ax@ax-radar:~/daily/2026-09-01 $ cat newsletter/daily/2026-09-01.md
33 srcsignal 72%cycle 04:32
AX 的 AI 日报 · 2026-09-01安全分层与收购卡位

今天 AI 圈在拼安全、拼收购、拼性价比

今天 AI 圈几件事同时翻动:OpenAI 自己承认 Astra 的网安能力到了最高档,能独立挖漏洞拼攻击链;Nvidia 快要以 129 亿美元买下 Hugging Face,估值是去年融资的 2.9 倍;通义千问的 Qwen3.8-Max 在代码榜上拿了第一,价格只要 $5/百万 token。先来看 OpenAI 这条——他们自己说 Astra 太危险了,得锁起来用。

OpenAI 自己承认 Astra 能挖零日漏洞,决定锁起来用

这条我不打折——是 OpenAI 自己说的。他们在 9 月 1 日确认,Astra 模型在内部《准备框架》里触到了网络安全能力的最高档 "Critical"。翻译成人话就是:给它合适的工具和权限,它能在没人手把手指导的情况下,自己在很多加固过的系统里找到未知漏洞,并拼出完整的攻击链。

内部测试的数据更具体:Astra 在 ExploitBench 上拿了满分,还用出了两个零日漏洞。OpenAI 因此推迟了 Astra 的广泛发布,改成只通过受信项目开放给特定合作伙伴。

这是 OpenAI 第一次自己给模型贴上最高危险等级的标签。之前行业里讨论 AI 安全风险,大多停留在"可能被滥用"的层面,但 Astra 这次是实打实在内部测试里跑出了攻击能力。OpenAI 没说是哪两个零日漏洞、影响什么系统,也没说 ExploitBench 的满分具体会带来什么——但光是"自己承认 Critical"这个动作,就说明他们内部评估是认真的。

有意思的是,这和 Anthropic 今天发的 Mythos 5.1 形成了镜像:Mythos 5.1 也是因为生物能力更强,只通过 Project Glasswing 给网络安全和生命科学领域的受信项目用,还得和美国政府合作审核。两家最领先的 lab 在同一天都在说"我们的模型太强了,不能随便给"——安全分层正在从论文话题变成产品决策。

Nvidia 快要以 129 亿美元买下 Hugging Face,估值是去年融资的 2.9 倍

Bloomberg 的消息:Nvidia 接近完成收购 Hugging Face,价格约 129 亿美元,加上其他条款总交易额可能到 140 亿。这个价是 Hugging Face 2023 年融资时 45 亿估值的 2.9 倍,按它现在一年大概 1.5 亿美元收入算,相当于 86 倍的年收入。

Nvidia 还谈了一个 10 亿美元的员工留任方案,防止人跑。这个数字本身就说明收购的核心目标不只是平台和用户,更是团队。Hugging Face 现在是开源模型生态的枢纽,几乎所有主流开放模型都在上面发布、下载、评测。Nvidia 买下它,等于在模型分发和开发者关系上直接卡位。

86 倍年收入的估值不便宜,但放在 AI 基础设施并购的逻辑里看,Nvidia 买的不是收入,是生态入口。Hugging Face 上托管着超过 20 万个模型,月活开发者数量巨大。对 Nvidia 来说,这是让更多模型跑在自家 GPU 上的最短路径。

不过这笔交易还没正式官宣,Bloomberg 引的是知情人士。我会等双方确认再看具体条款。

Qwen3.8-Max 在代码榜上拿了第一,$5/百万 token 的价格是目前性价比最高的

通义千问刚发的 Qwen3.8-Max-0902Code ArenaWebDev 榜单上首次亮相就拿了 1691 分,排总榜第一。这个分数说明它在网页开发任务上表现很强。

更值得看的是性价比:混合价 $5/百万 token,在 Pareto 前沿(就是性能和价格的最优平衡线)上是得分最高的模型。现在 QwenCloud 上就能用。

这次升级主要把参数量堆到了 2.4T,一次能读 1M token 的上下文,差不多是整本《三体》三部曲的量。后训练重点放在写代码和协作任务上,目标是让模型能跑复杂的企业流程、科研项目和长链条工作。

但有两个缺口:一是 Code Arena 的 WebDev 榜主要测网页开发,其他编程任务的表现还没数据;二是缺少和 Claude、GPT 最新版的直接跑分对比。$5/百万 token 确实便宜,但实际效果还得自己跑自己的任务才知道值不值。

Claude Fable 5.1 登顶智能指数,但每次任务贵了 20%

Anthropic 今天发了两个新模型:Claude Fable 5.1Claude Mythos 5.1。它俩底层是同一个模型,区别在于安全护栏的松紧:Fable 5.1 对所有人开放,Mythos 5.1 只通过受信项目给特定领域用。

Artificial Analysis 用最大算力跑了一遍 Fable 5.1,得分 66,直接冲到他们智能指数的榜首。代价是每次任务的花费比 Fable 5 高出 20%。正文只给了总分和成本涨幅,没拆具体任务类型,也没提延迟数据。

Simon Willison 拿他经典的"画一只骑自行车的鹈鹕"提示词,把五档推理强度全测了一遍。低和中两档几乎没区别,都没显示推理过程,23 秒左右出图,成本约 10 美分。开到 xhigh 档,模型花了 7 分 51 秒、烧了 1.83 美元,细节明显变多。最高档 max 跑了 13 分 54 秒,成本 3.3 美元

这个测试很直观地说明了一件事:Fable 5.1 的上限确实更高,但你要为那点提升付很多钱。对大多数日常任务,低档就够了。深度用户 Thariq 给了两条实用建议:对验证要求不高、边界情况少的任务,把 effort 调低省算力;现在切换 effort 不会清掉 prompt cache 了,频繁调参的人会省事不少。

价格方面,Fable 5.1 的输入输出价格和 Fable 5 一样,但缓存读取成本降到四分之一。跑长时间编程任务能省一笔。不过有三项破坏性变更需要注意:强制工具调用现在会直接报错;旧模型读不懂它的思考块;编辑对话前面的轮次会让思考块失效。

Gemini 现在能看录屏学操作,然后自己上手点按打字

Google DeepMind 给 Gemini 加了一个新能力:给它看一段操作界面的录屏,它就能看懂步骤,然后自己去完成同样的点击、输入和滚动。不是只描述画面,而是真的执行多步任务,比如填网页表单或在手机 App 里下单。

这个功能已经在 Gemini 应用和 Google AI Studio 开放测试。官方说模型会动态扫描视频片段,相比固定帧率处理,token 消耗最多降低 88%,成本最多降低 66%,准确率最多提升 7%

但正文没提延迟和成功率——UI 自动化智能体在实际环境里经常卡在奇怪的边缘情况上,比如页面加载慢、弹窗遮挡、按钮位置变了。官方给的数字是实验室条件下的,实际跑起来稳不稳还得自己试。

美国多州开始严查 AI 数据中心的"幽灵用电申请",得州率先冻结新项目接入

路透社的调查挖出一个大坑:美国中部、中大西洋和南部地区的数据中心用电申请加起来超过 700 吉瓦,是实际用电量的十倍还多。很多申请是重复提交的,或者来自根本没能力建成的公司。

得州的情况最夸张,电网接入申请从 2023 年的 48 吉瓦飙到现在的 474 吉瓦,逼得州政府直接冻结新项目接入,并启动全面审计,要求披露最终老板是谁、用水计划和现场发电方案。俄亥俄州、弗吉尼亚州等地也在跟进类似措施。

这波"幽灵需求"挤水分才刚开始。过去两年 AI 数据中心被当成稀缺资源炒,很多公司先占坑再找钱,甚至同一家公司对同一个站点提交多份申请。现在电网运营商开始认真审核了,那些没资金、没土地、没客户的项目会被清出去。对真有在建项目的大厂来说,短期是坏消息(接入更慢),长期是好消息(泡沫挤掉后资源更集中)。

今日小信号

  • World Labs 发布 Atlas:一个能从几张图拼出连贯 3D 场景并生成最长 1 分钟 1440p 视频的模型。在稀疏视角 3D 重建任务上超过了专门训练的模型。但没公布价格和公开上线时间,先别急着下单。
  • 苹果在 OpenAI 诉讼中提交新证据:指控前工程师 Chang Liu 下载了保密电路图并在 OpenAI 工作中使用,还让同事销毁证据。报道只引了苹果单方说法,没看到 OpenAI 的回应细节。
  • Slotstream 让 48GB 内存的 Mac 跑起 104GB 的大模型:原理是按需从 SSD 流式加载专家模块,生成速度约 12 tok/s。但没提首 token 延迟和用的什么 SSD,实际体感还得打问号。
  • Hugging Face 半年报告:中国模型参数冲上万亿,但下载量 99% 集中在 1.5% 的仓库。关注度不等于用起来。
  • 一个印度小哥用一张 5090 显卡,花 1.5 小时、67 美分训练的小模型,在 ARC-AGI-1 上拿了 44%,跟 TRM/HRM 打平。但 ARC-2 只有 7%,别太激动。

更多

频道

后台