Airbnb CEO Brian Chesky 计划成立一个新的 AI 实验室。他透露去年没有签下任何大模型合作,原因是当时市面上的产品还不够成熟。正文没披露实验室的具体方向、预算或团队规模。
#Airbnb#Brian Chesky#Product update
一句话点评
Airbnb CEO Brian Chesky 要自建 AI 实验室,理由是去年没签大模型合作,因为当时产品不够成熟。这等于说市面上现成的模型没满足他的需求,决定自己搞。但正文没披露实验室方向、预算和团队规模,所以目前只是一个意向声明。对从业者来说,信号是 Airbnb 对现有模型能力仍有保留,可能更看重垂直场景的定制或数据闭环。
OpenAI 把内容审核评分塞进了 Responses API 和 Completions API 的返回结果里。你现在发一次请求就能同时拿到生成内容和对应的安全分数,不用像以前那样先调生成接口、再调审核接口。拿到分数后,你可以自己决定怎么用:记日志、做路由分发、人工复核,或者直接拦截。正文没披露这个审核模型的延迟会增加多少、准确率怎么样,也没说和独立...
#Safety#Tools#OpenAI#Product update
精选理由
精选 · 重要度 72 · 知识量 + 共鸣
一句话点评
OpenAI 把安全审核直接塞进生成接口了,一次请求就能拿结果和分数,省掉一次 API 调用。但延迟和准确率都没给,实际效果得自己测。
锐评
这次更新把内容审核从“事后检查”变成了“同步出分”。以前你得先调生成接口,再拿结果去调审核接口,现在 Responses API 和 Completions API 的返回里直接带安全分数。对开发者来说,最直接的好处是少写一次调用逻辑,延迟上可能也省掉一轮网络往返。
但正文没披露这个内置审核的延迟增量、误判率,也没说和独立的 Moderation API 比准确度差多少。如果你现在的业务对延迟敏感,或者审核标准很严格,这点先别太激动,得自己压测看看。另外,分数怎么用完全由你决定——记日志、做路由分发、人工复核还是直接拦截,灵活性是给了,但也意味着你得自己定阈值和处置策略。
还缺一个关键信息:这个审核覆盖哪些类别,和独立接口的覆盖范围是否一致。如果范围缩水了,那“省一次调用”的代价可能是漏判。
苹果批准了 Poke 接入 Messages for Business,这是该平台第一个能直接跟用户发短信干活的 AI 代理。Poke 本身做的就是让用户通过短信使唤 AI 助手,这次相当于把它的服务嵌进了苹果官方的商家消息通道。不过正文没披露苹果的审核标准是什么、这次开放的范围有多大,也没提商业分成怎么算。
#Agent#Apple#Poke#Product update
精选理由
精选 · 重要度 73 · 吸引力 + 知识量 + 共鸣
一句话点评
苹果把 Messages for Business 的第一个 AI 代理名额给了 Poke,但没公布审核门槛和分成规则,先别急着说生态开放。
锐评
Poke 成了第一个被苹果放进 Messages for Business 的 AI 代理,用户可以直接在短信里使唤它干活。这件事的信号意义大于实际功能——苹果终于在自己的商业消息管道里给 AI 代理开了个口子。但正文没披露苹果的审核标准是什么,也没说这次开放是面向所有商家还是仅限 Poke 一家试点。商业分成怎么算、数据隐私怎么处理,这些关键信息全是空白。Poke 本身做的是短信即服务的模式,嵌进苹果的官方通道能省掉用户下载 App 的步骤,对低频使用场景确实友好。不过在没有看到更多案例之前,我会先打个折:这更像是一次谨慎的试探,而不是平台策略的大转向。
Google AI for Developers 放出了一个叫 Magenta RealTime 2(MRT2)的实时音乐模型,权重开放,推理引擎也开源了。你可以用 MIDI 键盘弹、打字给提示词,甚至用手势控制它来生成音乐。它在 MacBook 上原生跑,延迟压到了 200 毫秒以内,这个速度对实时演奏来说基本跟手。配套还给了应用和插件套件,到手就能...
#Audio#Multimodal#Inference-opt#Google AI for Developers
精选理由
精选 · 重要度 80 · 吸引力 + 知识量 + 共鸣
一句话点评
Google 把实时音乐生成模型 MRT2 的权重和推理引擎都开源了,MacBook 上延迟压到 200 毫秒以内,弹 MIDI 键盘或用手势就能控制,到手就能玩。
锐评
MRT2 最实在的地方是延迟压到了 200 毫秒以内,这个数字对实时演奏来说基本跟手,不会让你弹完一个音等半天才出声。模型权重和推理引擎都开源,意味着你可以自己部署、改参数,不用被云服务绑死。配套给了应用和插件套件,降低了上手门槛,不是只扔个模型让你自己折腾。
不过正文没披露模型的具体参数量、训练数据规模和版权处理方式,这些直接决定生成音乐的质量天花板和商用风险。也没提除了 MacBook 之外其他硬件的表现,Windows 或 Linux 上能不能跑到同样延迟还是未知数。手势控制的精度和延迟也没给具体数据,这点先别太激动。
整体看,这是一个把实时 AI 音乐生成从实验室推到桌面级的尝试,开源和低延迟是核心卖点。但缺了训练数据和版权说明,商用前得自己掂量。
Anthropic 发了一篇文章,讲他们内部怎么让 Claude 越来越多地参与 AI 开发。核心概念是“递归式自我改进”——让 AI 系统能完全自主地设计和开发自己的下一代。他们说自己还没到那一步,但趋势在加速。文章给了几个内部数据:到 2026 年 5 月,Anthropic 合并的代码里超过 80% 是 Claude 写的;工程师现在平均每个季度...
#Agent#Reasoning#Safety#Anthropic
精选理由
精选 · 重要度 74 · 吸引力 + 共鸣
一句话点评
Anthropic 自己说 80% 代码已是 Claude 写的,工程师产出涨了 8 倍,但全文没给实验设计、模型版本和验证方法,这点先别太激动。
锐评
Anthropic 这篇文章讲的是他们内部让 Claude 越来越多地参与 AI 开发,最终指向“递归式自我改进”——让 AI 自己设计、开发下一代模型。他们给了几个内部数字:到 2026 年 5 月,合并的代码里超过 80% 是 Claude 写的;工程师每季度交付的代码量比 2021-2025 年期间平均涨了 8 倍。外部基准也显示模型能独立完成任务的时间长度每四个月翻一倍,从 2024 年 3 月的 4 分钟涨到 2026 年的 12 小时。
这些数字看着挺猛,但文章没交代代码量是怎么统计的——是行数、提交次数还是合并请求数?也没说 8 倍增长里有多少是自动生成的样板代码或测试代码。研究部分只提了一句 Claude 能“匹配”人类研究员,具体怎么匹配、在什么任务上匹配,正文没展开。整篇更像一份趋势声明,不是可复现的实验报告。
还缺的东西不少:他们用的是什么版本的 Claude 在做这些事,有没有对照组,工程师的代码审查负担是变轻了还是变重了,以及“递归式自我改进”离真正闭环还差哪些环节。这些信息缺口让数字的参考价值打了折扣。