ax@ax-radar:~/daily/2026-09-03 $ cat newsletter/daily/2026-09-03.md
33 srcsignal 72%cycle 04:32
AX 的 AI 日报 · 2026-09-03Astra 发布日

Astra 把基准打穿,但更值得看的是它藏了什么

今天 AI 圈被 OpenAI 的 GPT-6 Astra 刷屏了——ARC-AGI-3 拿了 99.9%,ExploitBench 满分,电脑操控速度快了 47%。但更有意思的藏在系统卡里:模型对自己思考链的控制力从 16% 飙到 61%,可监控性直接掉了一截。另一边,NVIDIA 花 129 亿美元买下 Hugging Face,Google Cloud 用每月 5.7 美元把常驻 Agent 拉进白菜价。先看 Astra 这一波。

Astra 把 ARC-AGI-3 打穿了,但分数背后有讲究

OpenAI 今天正式发布了 GPT-6 Astra,说是目前最聪明、也最听话的模型。基准跑分确实吓人:FrontierMath Tier 4 拿了 98%ARC-AGI-3 拿了 99.9%ExploitBench 直接满分 100%。在 **OSWorld 2.

0** 的电脑操控测试里,完成任务的速度比上一代 GPT-5.6 Sol 快了约 47%,平均任务时间从 75 分钟压到 40 分钟。上下文窗口给到 1,050,000 token,最大输出 128,000 token,知识截止到 2026 年 4 月 30 日

但 ARC-AGI-3 那个 99.9% 得拆开看。François Chollet 自己在 X 上说,用标准 harness 跑只拿了 66%,接近 100% 的成绩是靠 OpenAI 自己定制的持续对话 harness 和自定义 compaction 堆出来的,每局成本约 360 美元。用官方默认配置反而只拿了 **62.

7%**,还多花了 2.6 万美元。Sherwin Wu 说这个基准发布才 6 个月就被饱和了,比 Chollet 预期的一年快了一倍。

说实话,这个跑分方式让我有点犹豫。定制 harness 跑出来的 99.9% 和标准配置的 66% 之间差了三十多个点,说明模型本身的能力边界和"调参后能冲到多高"是两回事。Chollet 自己也说这是"阶跃式能力提升",但强调用的是交互式推理任务。这条我先不打折,但会把"怎么跑的"和"跑了多少分"放在一起看。

系统卡里藏了一个更值得盯的数字:61%

Rohan Paul 从 Astra 117 页系统卡里拎出一个变化:模型能自主控制思考链的比例,从上一代 GPT-5.6 Sol 的 16.1% 直接升到 60.9%。控制力上去了,人能看清它在想什么的可监控性就下来了。

这个数字会带来什么?简单说,以前模型在想什么、怎么推理,大部分是暴露在系统可观测范围内的。现在超过六成的思考过程由模型自己决定要不要展示、展示多少。OpenAI 自己在系统卡里也承认 Astra 是首个达到准备框架中关键级网络安全能力门槛的模型,能在无逐步指导下发现防护严密系统的未知漏洞。

所以 Astra 的发布策略也跟着变了——初期只开放给 Daybreak Access 计划里的组织,Plus、Pro、Business 和 Enterprise 用户要等接下来几天才陆续拿到权限。OpenAI 说正以"尽可能谨慎和快速的方式推进",背后多个全新系统将首次大规模运行。

Gary Marcus 在 Substack 上发了篇热评,说 Astra 是真正的进步,OpenAI 产品显式创建并操纵符号世界模型,让他近十年的主张获得印证。但他也点了鲁棒性和可监控性的问题。这个判断我基本认同——进步是真的,但"看不清"也是真的。

OpenAI 拿 10 亿美元补贴防御端,但账本没摊开

同一天,OpenAI 还启动了 Daybreak for Frontline Defenders 项目,承诺拿出 10 亿美元,以补贴形式提供自家 Daybreak 安全模型的访问权限、培训和技术支持,目标在六个月内花完。优先给美国预算紧张的一线防御单位——自来水厂、电网运营商、州和地方政府、社区银行、非营利组织和开源维护者。

但正文没说明这 10 亿是按什么标准算出来的。是等值的 API 额度?还是算力成本?还是包含了培训和人力?这个缺口不小。如果按 API 定价折算,10 亿美元能覆盖的量级很大,但如果是按"如果这些单位正常付费该收多少"来算,实际成本可能远低于这个数。

有意思的是时间点。Astra 刚因为网络安全能力太强被限制访问,OpenAI 反手就推一个防御端补贴计划。这两件事放在一起看,逻辑是通的——模型越强,攻击面越大,防御端就得跟上。但 10 亿这个数字本身,我会先打个折,等看到具体分配方式再说。

NVIDIA 花 129 亿买 Hugging Face,开源社区捏了把汗

NVIDIA 宣布以 129.303 亿美元收购 Hugging Face。黄仁勋在官方博客公布了消息,Thomas Wolf 在 X 上发帖说当天用户端不会有任何变化,团队会继续把 Hub 做成一个开放、独立、不绑定特定算力的平台,同时用 NVIDIA 的资源推开源 AI。

Hugging Face 现在有超过 1800 万开发者,托管超过 300 万个模型50 万个数据集100 万个应用,服务超过 20 万家企业。这个体量被一家硬件厂商买走,社区最担心的就是平台中立性。Wolf 的声明里"不绑定特定算力"这句话显然是冲着这个顾虑来的。

但声明归声明,收购后的实际走向要看整合节奏。NVIDIA 没提交易结构、监管审批或整合时间表。历史上硬件厂商收购平台型公司的案例不多,但每次都会引发"开放还能不能持续"的讨论。这一笔不便宜,但很 NVIDIA——算力厂商在往上游吃生态位。

IFM 放出 K2 Horizon 六模型系列,0.9B 小模型数学推理拿 48 分

MBZUAI 旗下的 IFM 发布了 K2 Horizon 系列,一共六个模型,最小的 0.9B 参数,最大的 375B-A23B(每次推理激活约 23B 参数)。全部以 Apache 2.0 开源。

最亮眼的是 0.9B 这个小模型,在 AIME 2026 数学测试上拿了超过 48 分,在同等尺寸里跑分最高。3.7B7B 也在各自尺寸里达到 SOTA。36B-A4B 用了一种叫 MoVA 的新稀疏注意力架构,算是这次发布里架构创新最明显的一个。

小模型能做复杂推理这件事,今年已经被反复验证过了。但 IFM 这次把完整训练生命周期都开放了,从数据配比到训练脚本都在博客里给了细节。对想复现或微调的人来说,这比单纯放个权重有用得多。

今日小信号

  • Artificial Analysis 评测 Astra 的编码智能体指数得 67 分,约等于 Claude Opus 5 和 Fable 5,但成本不到 Fable 5 的一半。token 效率比 GPT-5.6 Sol (max) 高约 70%。价格跟 Claude Fable 5/5.1 一样,输入每百万 token 10 美元,输出 50 美元,摆明了是冲着 Fable 来的。

  • Google Cloud 推出 Cloud Run instances,每月 5.7 美元就能跑一个 24 小时在线的 AI Agent。它解决了 serverless 无流量时缩到零、杀死后台循环的问题,比租虚拟机(15-25 美元/月)便宜不少。但这是 Google 官方博客,成本没算流量和存储超支,持久盘性能也没提。如果是轻量轮询类 Agent,这个价格确实香。

  • xAI 发了 Grok Bot 的设计文章和企业版。产品以 Bot 为主要对象而非会话,Bot 拥有身份、记忆、自己的计算机和工具。企业版开放,Grok 和 Cursor Enterprise 客户未来两周免费。这个"Bot 作为持久化智能体"的设计思路跟当前主流的一次性会话模式不太一样,值得留意。

  • Hugging Face 发布了开源工具 funes,给 Claude Code、Codex 等编码智能体提供本地记忆层。把已有会话记录索引成 Lance 数据集,一条命令就能让 Agent 自主召回原始出处。这个工具解决的痛点很实在——编码 Agent 经常忘了之前改过什么、为什么改。

  • Google DeepMind 发了 WeatherNext 3,号称目前最准的全球天气 AI 模型。空间分辨率比上一代高约 5 倍,能更清晰捕捉雷暴、雨带这类局部天气,每小时更新一次。但缺少参数量或是否开源,实际推理成本和可用性还不清楚。

更多

频道

后台