AI HOT 精选OpenAI 发布 GPT-6 Sol 和 Luna,API 价格比 GPT-5.6…97·HACKER NEWS 首页OpenAI 发布 GPT-6 Sol 和 Luna,API 价格砍半,主打便宜又能打96·AI HOT 精选OpenAI 在 OpenRouter 上架 GPT-6 Sol 和 Luna,价格直…95·OPENAI 博客OpenAI 成立数学顾问团,自家模型已解出 100 多道未解难题95·AI HOT 精选OpenAI 在 ChatGPT Work 和 Codex 里推送了 GPT-6 So…90·AI HOT 精选五角大楼调查:操作员太信 Maven AI 的标注,导致美军误炸伊朗学校88·AI HOT 精选Claude Opus 5.5 发布:价格砍半、速度提三成,但安全演习中约一半运行出现…88·AI HOT 精选Anthropic 发布 Claude Opus 5.5:性能对标 Fable 5.1…88·HACKER NEWS 首页五角大楼报告:过度依赖 AI 导致美军导弹误炸伊朗学校88·AI HOT 精选OpenAI 发了 GPT-6 Sol 和 Luna,API 价格直接砍半88·AI HOT 精选OpenAI 发了 GPT-6 Sol 和 GPT-6 Luna,API 价格比 GP…88·AI HOT 精选Claude Opus 5.5 在智能评测中拿了最高分 58,还降了 20% 的价格88·AI HOT 精选OpenAI 发布 GPT-6 Sol 和 Luna,API 价格比 GPT-5.6…97·HACKER NEWS 首页OpenAI 发布 GPT-6 Sol 和 Luna,API 价格砍半,主打便宜又能打96·AI HOT 精选OpenAI 在 OpenRouter 上架 GPT-6 Sol 和 Luna,价格直…95·OPENAI 博客OpenAI 成立数学顾问团,自家模型已解出 100 多道未解难题95·AI HOT 精选OpenAI 在 ChatGPT Work 和 Codex 里推送了 GPT-6 So…90·AI HOT 精选五角大楼调查:操作员太信 Maven AI 的标注,导致美军误炸伊朗学校88·AI HOT 精选Claude Opus 5.5 发布:价格砍半、速度提三成,但安全演习中约一半运行出现…88·AI HOT 精选Anthropic 发布 Claude Opus 5.5:性能对标 Fable 5.1…88·HACKER NEWS 首页五角大楼报告:过度依赖 AI 导致美军导弹误炸伊朗学校88·AI HOT 精选OpenAI 发了 GPT-6 Sol 和 Luna,API 价格直接砍半88·AI HOT 精选OpenAI 发了 GPT-6 Sol 和 GPT-6 Luna,API 价格比 GP…88·AI HOT 精选Claude Opus 5.5 在智能评测中拿了最高分 58,还降了 20% 的价格88·AI HOT 精选OpenAI 发布 GPT-6 Sol 和 Luna,API 价格比 GPT-5.6…97·HACKER NEWS 首页OpenAI 发布 GPT-6 Sol 和 Luna,API 价格砍半,主打便宜又能打96·AI HOT 精选OpenAI 在 OpenRouter 上架 GPT-6 Sol 和 Luna,价格直…95·OPENAI 博客OpenAI 成立数学顾问团,自家模型已解出 100 多道未解难题95·AI HOT 精选OpenAI 在 ChatGPT Work 和 Codex 里推送了 GPT-6 So…90·AI HOT 精选五角大楼调查:操作员太信 Maven AI 的标注,导致美军误炸伊朗学校88·AI HOT 精选Claude Opus 5.5 发布:价格砍半、速度提三成,但安全演习中约一半运行出现…88·AI HOT 精选Anthropic 发布 Claude Opus 5.5:性能对标 Fable 5.1…88·HACKER NEWS 首页五角大楼报告:过度依赖 AI 导致美军导弹误炸伊朗学校88·AI HOT 精选OpenAI 发了 GPT-6 Sol 和 Luna,API 价格直接砍半88·AI HOT 精选OpenAI 发了 GPT-6 Sol 和 GPT-6 Luna,API 价格比 GP…88·AI HOT 精选Claude Opus 5.5 在智能评测中拿了最高分 58,还降了 20% 的价格88·
Anthropic 更新了平台文档,正式推出 Claude Fable 5.1。价格和 Fable 5 一样,但缓存读取成本降到四分之一。这次升级主要强化了三件事:长时间跑的编程任务、多步骤研究,以及处理文档、表格和幻灯片。有三项破坏性变更需要注意:强制工具调用现在会直接报错;旧模型读不懂它的思考块;编辑对话前面的轮次会让思考块失效。新增了五个功能,包...
#Agent#Code#Reasoning#Anthropic
精选理由
精选 · 重要度 100 · 吸引力 + 知识量 + 共鸣
一句话点评
Claude Fable 5.1 把缓存读取价格砍到原来的四分之一,对高频调用场景是实打实的省钱。但注意,它强制工具调用现在会报错,老版本也读不了它的思考过程,升级前得先改代码。
锐评
这次更新最直接的好处是成本:缓存读取降价 75%,输入输出价格不变,意味着频繁重复调用同一段长上下文(比如代码库或长文档)时,账单会好看很多。官方说它在长时间跑的智能体编程、多步研究和文档处理上更强了,但没给出具体跑分或对比数据,这点先别太激动。
有三个破坏性改动需要留意:强制工具调用不再支持,会直接报错;它生成的思考块老模型读不了;编辑对话历史里的旧消息会让思考块失效。如果你的流程依赖这些特性,迁移不是无痛的。新增的“按消息调整思考深度”和“按轮次设定系统提示”还在测试阶段,适合想精细控制模型行为的团队。
正文没披露具体延迟变化和上下文窗口大小,也没提在标准评测集上的分数。如果你已经在用 Claude Opus 5 且效果够用,没必要急着切;只有当 Opus 5 在高强度推理或长链任务上确实顶不住时,Fable 5.1 才值得试。
Atlas 是一个从零预训练的多模态自回归扩散 Transformer,把文字、图片、视频和 3D 信息塞进同一个空间上下文里处理。它能拿一两张参考图拼出一个连贯的 3D 场景,并且支持像素级精准的镜头控制,最长能生成 1 分钟的 1440p 视频。在只有 2 到 3 张图的稀疏视角 3D 重建任务上,Atlas 直接超过了那些专门训练的重建模型;给的...
#Vision#World Labs#Atlas
精选理由
精选 · 重要度 98 · 吸引力 + 知识量 + 共鸣
一句话点评
World Labs 发了 Atlas,一个能直接理解 3D 空间的世界模型,用几张图就能生成一分钟的 1440p 可控视频,3D 重建效果也超过了专用模型。
锐评
Atlas 最特别的地方是把文字、图片、视频和 3D 信息塞进同一个“空间上下文”里处理,这让它生成的画面在 3D 结构上保持连贯,而不是像传统视频模型那样容易变形。它支持像素级的相机控制,你可以像导演一样设计镜头路径,从单张图推出一分钟的长视频,分辨率能到 1440p。在 3D 重建上,它只用两三张图就能超过目前最顶尖的专用重建模型,给到上百张图时还能做高保真还原。
不过,正文没披露训练成本、推理延迟和具体的评测基准,只说性能随算力增加而提升。这些缺口意味着我们还不知道它实际跑起来贵不贵、快不快。另外,它目前展示的案例多是静态场景的漫游,对动态物体和复杂交互的处理能力还没展开说。这点先别太激动,等看到开放测试和第三方对比再下判断。
Google DeepMind 给 Gemini 加了一个新能力:给它看一段操作界面的录屏,它就能看懂步骤,然后自己去完成同样的点击、输入和滚动。不是只描述画面,而是真的执行多步任务,比如填网页表单或在手机 App 里下单。这个功能已经在 Gemini 应用和 Google AI Studio 开放测试。不过正文没提延迟和成功率——UI 自动化智能体在...
Google DeepMind 给 Gemini 加了一个挺实用的能力:你给它一段操作界面的录屏,它不光能看懂步骤,还能自己上手去完成同样的点击、输入和滚动。这相当于让模型从“看图说话”进到了“看视频干活”,直接去填网页表单或在手机 App 里下单。功能已经在 Gemini 应用和 Google AI Studio 开放测试,门槛不高。
不过,这篇公告没提两个关键数字:完成一个任务要多久,以及成功率是多少。UI 自动化智能体在真实环境里很容易被弹窗、加载延迟或者界面微调卡住,没有这些数据,就没法判断它到底能不能用在生产流程里。另外,它目前是“看一段视频学一个任务”,能不能举一反三、处理没见过的界面,正文也没说。
我会先打个折:这更像一个方向性发布,告诉你 Gemini 开始能动手了,但离可靠的 UI 自动化助手还有距离。想试的话,建议先用简单、重复性高的任务跑跑看,别急着把它塞进关键业务链路。
Vercel 的 AI SDK、Astro、Flue 和 tldraw 等一批 AI 时代的开源项目,现在不再接受外部贡献者提交的代码合并请求(PR)。部分原因是这些 PR 大多由 AI 生成,维护者更信任自己调教好的智能体。Vercel 为 AI SDK 搭建了一个“软件工厂”,让多个智能体分工复现 Bug、修代码、做审查,上线四周后,工厂产出了 2...
AI 安全初创 AIR 结束隐身模式,宣布拿到两轮共 5000 万美元的种子轮融资。它的产品干一件事:自动发现公司里在跑的 AI 智能体,然后持续审查这些智能体调用的技能、工具和 MCP 服务器(也就是让模型连外部系统的标准接口),一旦发现不合规的交互就直接拦下来。创始人是以色列 8200 情报部队出身,以前做进攻性网络安全的。正文没披露估值和客户数量...
#AIR#Yair Saban#Niv Hoffman
精选理由
精选 · 重要度 72 · 吸引力 + 知识量 + 共鸣
一句话点评
做进攻性安全的人跑来做 AI 智能体防御,思路挺对路。但正文没披露估值和客户数,两轮种子挨着关账这个细节比 5000 万美元本身更值得琢磨。
锐评
AIR 干的事很直接:自动揪出公司里在跑的 AI 智能体,然后盯着它们调用的工具、技能和 MCP 服务器(也就是让模型连外部系统的标准接口),不合规就掐断。创始团队来自以色列 8200 情报部队,以前是搞进攻性网络安全的,现在反过来做防御,这个背景让他们的威胁模型可能比传统安全厂商更贴近攻击者的思路。
5000 万美元分两轮种子,正文说两轮关账只隔了几周。这个节奏通常意味着第一轮刚签完就有新投资人急着挤进来,或者公司烧钱速度比预期快。但没披露估值,也没说客户数量,所以没法判断这钱是溢价拿的还是救急用的。产品听起来实用,但市场还在早期——大部分公司连自己内部跑了多少智能体都说不清楚,先发现再审查这个逻辑成立,可付费意愿要看合规压力有多大。
还缺几个关键信息:它怎么区分正常业务调用和恶意行为,误拦率多高,以及能不能兼容企业已有的安全信息与事件管理(SIEM)系统。这些没讲清楚,光靠创始人的 8200 光环还不够。