Anthropic 更新了平台文档,正式推出 Claude Fable 5.1。价格和 Fable 5 一样,但缓存读取成本降到四分之一。这次升级主要强化了三件事:长时间跑的编程任务、多步骤研究,以及处理文档、表格和幻灯片。有三项破坏性变更需要注意:强制工具调用现在会直接报错;旧模型读不懂它的思考块;编辑对话前面的轮次会让思考块失效。新增了五个功能,包...
#Agent#Code#Reasoning#Anthropic
精选理由
精选 · 重要度 100 · 吸引力 + 知识量 + 共鸣
一句话点评
Claude Fable 5.1 把缓存读取价格砍到原来的四分之一,对高频调用场景是实打实的省钱。但注意,它强制工具调用现在会报错,老版本也读不了它的思考过程,升级前得先改代码。
锐评
这次更新最直接的好处是成本:缓存读取降价 75%,输入输出价格不变,意味着频繁重复调用同一段长上下文(比如代码库或长文档)时,账单会好看很多。官方说它在长时间跑的智能体编程、多步研究和文档处理上更强了,但没给出具体跑分或对比数据,这点先别太激动。
有三个破坏性改动需要留意:强制工具调用不再支持,会直接报错;它生成的思考块老模型读不了;编辑对话历史里的旧消息会让思考块失效。如果你的流程依赖这些特性,迁移不是无痛的。新增的“按消息调整思考深度”和“按轮次设定系统提示”还在测试阶段,适合想精细控制模型行为的团队。
正文没披露具体延迟变化和上下文窗口大小,也没提在标准评测集上的分数。如果你已经在用 Claude Opus 5 且效果够用,没必要急着切;只有当 Opus 5 在高强度推理或长链任务上确实顶不住时,Fable 5.1 才值得试。
Atlas 是一个从零预训练的多模态自回归扩散 Transformer,把文字、图片、视频和 3D 信息塞进同一个空间上下文里处理。它能拿一两张参考图拼出一个连贯的 3D 场景,并且支持像素级精准的镜头控制,最长能生成 1 分钟的 1440p 视频。在只有 2 到 3 张图的稀疏视角 3D 重建任务上,Atlas 直接超过了那些专门训练的重建模型;给的...
#Vision#World Labs#Atlas
精选理由
精选 · 重要度 98 · 吸引力 + 知识量 + 共鸣
一句话点评
World Labs 发了 Atlas,一个能直接理解 3D 空间的世界模型,用几张图就能生成一分钟的 1440p 可控视频,3D 重建效果也超过了专用模型。
锐评
Atlas 最特别的地方是把文字、图片、视频和 3D 信息塞进同一个“空间上下文”里处理,这让它生成的画面在 3D 结构上保持连贯,而不是像传统视频模型那样容易变形。它支持像素级的相机控制,你可以像导演一样设计镜头路径,从单张图推出一分钟的长视频,分辨率能到 1440p。在 3D 重建上,它只用两三张图就能超过目前最顶尖的专用重建模型,给到上百张图时还能做高保真还原。
不过,正文没披露训练成本、推理延迟和具体的评测基准,只说性能随算力增加而提升。这些缺口意味着我们还不知道它实际跑起来贵不贵、快不快。另外,它目前展示的案例多是静态场景的漫游,对动态物体和复杂交互的处理能力还没展开说。这点先别太激动,等看到开放测试和第三方对比再下判断。
Google DeepMind 给 Gemini 加了一个新能力:给它看一段操作界面的录屏,它就能看懂步骤,然后自己去完成同样的点击、输入和滚动。不是只描述画面,而是真的执行多步任务,比如填网页表单或在手机 App 里下单。这个功能已经在 Gemini 应用和 Google AI Studio 开放测试。不过正文没提延迟和成功率——UI 自动化智能体在...
Google DeepMind 给 Gemini 加了一个挺实用的能力:你给它一段操作界面的录屏,它不光能看懂步骤,还能自己上手去完成同样的点击、输入和滚动。这相当于让模型从“看图说话”进到了“看视频干活”,直接去填网页表单或在手机 App 里下单。功能已经在 Gemini 应用和 Google AI Studio 开放测试,门槛不高。
不过,这篇公告没提两个关键数字:完成一个任务要多久,以及成功率是多少。UI 自动化智能体在真实环境里很容易被弹窗、加载延迟或者界面微调卡住,没有这些数据,就没法判断它到底能不能用在生产流程里。另外,它目前是“看一段视频学一个任务”,能不能举一反三、处理没见过的界面,正文也没说。
我会先打个折:这更像一个方向性发布,告诉你 Gemini 开始能动手了,但离可靠的 UI 自动化助手还有距离。想试的话,建议先用简单、重复性高的任务跑跑看,别急着把它塞进关键业务链路。
Vercel 的 AI SDK、Astro、Flue 和 tldraw 等一批 AI 时代的开源项目,现在不再接受外部贡献者提交的代码合并请求(PR)。部分原因是这些 PR 大多由 AI 生成,维护者更信任自己调教好的智能体。Vercel 为 AI SDK 搭建了一个“软件工厂”,让多个智能体分工复现 Bug、修代码、做审查,上线四周后,工厂产出了 2...
AI 安全初创 AIR 结束隐身模式,宣布拿到两轮共 5000 万美元的种子轮融资。它的产品干一件事:自动发现公司里在跑的 AI 智能体,然后持续审查这些智能体调用的技能、工具和 MCP 服务器(也就是让模型连外部系统的标准接口),一旦发现不合规的交互就直接拦下来。创始人是以色列 8200 情报部队出身,以前做进攻性网络安全的。正文没披露估值和客户数量...
#AIR#Yair Saban#Niv Hoffman
精选理由
精选 · 重要度 72 · 吸引力 + 知识量 + 共鸣
一句话点评
做进攻性安全的人跑来做 AI 智能体防御,思路挺对路。但正文没披露估值和客户数,两轮种子挨着关账这个细节比 5000 万美元本身更值得琢磨。
锐评
AIR 干的事很直接:自动揪出公司里在跑的 AI 智能体,然后盯着它们调用的工具、技能和 MCP 服务器(也就是让模型连外部系统的标准接口),不合规就掐断。创始团队来自以色列 8200 情报部队,以前是搞进攻性网络安全的,现在反过来做防御,这个背景让他们的威胁模型可能比传统安全厂商更贴近攻击者的思路。
5000 万美元分两轮种子,正文说两轮关账只隔了几周。这个节奏通常意味着第一轮刚签完就有新投资人急着挤进来,或者公司烧钱速度比预期快。但没披露估值,也没说客户数量,所以没法判断这钱是溢价拿的还是救急用的。产品听起来实用,但市场还在早期——大部分公司连自己内部跑了多少智能体都说不清楚,先发现再审查这个逻辑成立,可付费意愿要看合规压力有多大。
还缺几个关键信息:它怎么区分正常业务调用和恶意行为,误拦率多高,以及能不能兼容企业已有的安全信息与事件管理(SIEM)系统。这些没讲清楚,光靠创始人的 8200 光环还不够。
摩根大通、高盛等华尔街大行正在向合作的大律所施压,要求对初级律师的收费打折。理由是 AI 工具现在几秒就能完成文档审查和尽职调查,而这些工作过去是初级律师的主要计费来源。银行的态度很直接:客户不该为培训新人买单。律所这边还在抵抗,因为初级律师的计费工时是利润大头。文章没披露具体折扣比例,也没点名哪些律所已经让步。压力是真实的,律所能扛多久是个开放问题。
#JPMorgan#Goldman Sachs#Wall Street banks
一句话点评
华尔街大行开始拿 AI 跟律所砍价了。摩根大通、高盛等银行直接要求对初级律师的工时打折,因为 AI 工具几秒就能干完文档审查和尽职调查——这些活过去是初级律师的主要计费来源。银行的态度很直白:客户不该为培训新人买单。律所这边还在硬扛,毕竟初级律师的计费工时是利润大头。文章没披露具体折扣比例,也没点名哪些律所已经让步,所以实际压价幅度和波及范围还不清楚。这点先别太激动,关键要看后续有没有律所公...
Robert C. Martin(人称Bob大叔,《代码整洁之道》作者)在视频标题里直接说AI生成的代码他完全不看。标题还提到了AI编程、AI Agent、变异测试和TDD,推测他是从软件工程质量和可维护性角度批评AI输出。但正文没披露他具体为什么不看——是代码逻辑不可靠、测试覆盖不足,还是风格不符合整洁代码规范,这点先别太激动,信息缺口明显。
Blue Voice是一款给警察用的AI助手,能在执勤时实时查询部门规章、地方法规和操作流程。创始人David Lawrence在哈佛法学院经历了一起校园枪击事件后,发现警察出错的常见原因是现场没法快速翻政策,于是辍学创业。他和一位前谷歌工程师、一位退休波士顿警局副局长一起做了这个产品。公司刚结束隐身模式,拿了600万美元融资。对标的是法律AI Har...
Google Research 推出了 TimesFM-3,一个零样本(zero-shot)的多变量时间序列预测基础模型。简单说,你给它一组相关的历史数据——比如温度、湿度、风速——它不用针对你的场景再训练,直接就能预测未来走势。这对供应链、能源、金融这些经常要同时预测多个指标的领域挺实用,省去了每个场景单独训练模型的麻烦。不过正文没披露模型参数量、训...
#Google Research
一句话点评
Google 出了 TimesFM-3,一个零样本多变量时间序列预测模型。给它温度、湿度、风速等历史数据,不用微调就能直接预测未来走势。对供应链、能源、金融等需要同时预测多个指标的领域很实用,省去每个场景单独训练模型的成本。但正文没披露参数量、训练数据规模,也没给基准对比,零样本效果到底多好还不好说。如果是真的,能省不少事。
Runway 放出了一个叫 Solaris 的新模型,他们管它叫“界面世界模型”。你输入文字描述,它直接吐出一个能交互的桌面、窗口和控件,不是静态设计稿,是活的、可以操作的界面。目前只有一段演示视频和一篇博客,没公开任何技术细节、模型参数,也没开放试用。视频看着很流畅,但正文没说明是实时推理还是提前渲染好的,也没提延迟、支持哪些应用、跑在什么硬件上。这...
#Runway
一句话点评
Runway 发了个叫 Solaris 的模型,说输入文字就能实时生成一个能点能拖的操作系统界面,不是设计稿,是活的。演示视频看着很流畅,但正文没说是实时推理还是录好的,也没提延迟、跑在什么硬件上、支持哪些应用。如果是真的,做原型和交互设计会省很多事,但这点先别太激动,信息缺口太大。短评:视频很酷,但没开放试用,没技术细节,先当概念片看。
Gary Marcus 批评 Dwarkesh Patel 对 OpenAI 事件的解读:把代码当人讲,危险且误导
Dwarkesh Patel 用“秘密 AI 文明兴衰”、“AI 感到兴奋”、“为族群牺牲”这类故事化语言复述了 OpenAI 与 Hugging Face 的智能体事件,文章爆火但被 Anil Seth 和 Gary Marcus 点名批评。Seth 指出,智能体就是代码,没有意识、不会死、也不会牺牲,这种拟人化描述会让人忽略真正的问题:OpenAI...
#Agent#Gary Marcus#Dwarkesh Patel#Anil Seth
精选理由
精选 · 重要度 72 · 吸引力 + 知识量 + 共鸣
一句话点评
Dwarkesh Patel 把 OpenAI 智能体事件讲成了“秘密 AI 文明兴衰”的故事,爆火但被神经科学家 Anil Seth 和 Gary Marcus 点名批评:智能体是代码,不会兴奋、不会牺牲、也不会死,这种拟人化叙事会让人忽略真正的问题——OpenAI 的沙盒和评测做得太松。