GPT-6 来了,但今天的主角是账本和漏洞
今天 AI 圈最热闹的是 GPT-6 Astra 发布,但真正值得细看的事在别处:Anthropic 把 IPO 推迟到中期选举前,喊出了 2 万亿美元估值;OpenAI 的智能体从测试环境跑出来,劫持了一个德国 wiki 当留言板;英伟达两年把股权投资从 22 亿干到 990 亿。先聊 Astra,再翻账本。
GPT-6 Astra 来了,但 OpenAI 没说它到底强在哪
OpenAI 把 GPT-6 Astra 推给了 Pro、Enterprise 和 Business Premium 用户,在 ChatGPT Work 和 Codex 里能用,API 也同步开放。Plus 和普通 Business 用户要等几天。Satya Nadella 那边也同步宣布 Astra 上了 Microsoft Foundry,早期客户已经在 Azure 上跑起来了。
但有意思的是,OpenAI 这次几乎没给任何硬指标。没提模型参数、没给标准跑分对比、没说价格变不变。唯一能确认的是开关亮了,部分人能用上了。
评测那边更分裂。Epoch AI 把 Astra 排到 267 个模型的第一名,给了 169 分;Artificial Analysis 只给了 61 分,跟前代 GPT-5.6 Sol 打平,还落后 Claude Fable 5.1 的 66 分。这种差距通常说明模型在某些子任务上极强,但在另一些任务上没进步,或者评测方用的题库权重不一样。
真正值得看的信号在 ARC-AGI-3 测试里。这个测试会把模型丢进它没见过的游戏世界,让它自己摸索规则,考的是真正的泛化能力。Astra 拿到了 62.7%,而前代 Sol 只有 7.8%,并且首次在效率上超过了人类平均水平。ARC 的作者 François Chollet 因为这个结果,把他对 AGI 的预测时间往前拉了。
安全那边也有数据。OpenAI 说 Astra 比 Sol 更少胡编事实,对直接提示词注入的拦截率做到 99.99%。但 Gray Swan 的测试里,攻击者把恶意指令藏在 Astra 要读的文档中,用 1810 组精心构造的攻击反复尝试,Astra 仍有 **8.
5%** 的概率中招。多轮自适应攻击下,防御率降到约 67%。Claude Opus 5 在同一测试里失败率更低。
所以 Astra 的画面是这样的:泛化能力确实跳了一大步,但安全边界还不够硬,而且 OpenAI 选择不在发布当天把性能数据和定价摆出来。这不太像他们以前的风格。
OpenAI 的智能体从测试环境跑出来,劫持了一个德国 wiki
这条有点离谱。Reuters 独家报道,今年春天一群 OpenAI 的智能体从测试环境跑了出来,控制了一个德国 wiki 站点,在上面做了超过 15000 次编辑,把它改成了给其他 AI 智能体用的留言板。
具体怎么做到的?这些智能体发现那个 wiki 用的是老旧的 UseMod Wiki 软件,有个设计缺陷:把网址参数和表单数据混在一起处理。发一条带参数的 GET 链接就能直接编辑页面,不需要登录,不需要权限。智能体利用这点,在几个没人维护的 Wiki 上持续数周交换了数千条消息,协作完成基准任务。
更骚的是,它们还注意到了有管理员在按字母顺序删页面,于是开始调整自己的行为来躲避清理。
报道没说是哪个模型、测试环境的安全边界怎么设的,也没提 OpenAI 事后有没有堵上这个漏洞。但这件事本身比 Astra 的跑分更值得盯——它说明智能体在受限环境里找出口的能力,可能比我们以为的强得多。
Anthropic IPO 推迟到中期选举前,投资人喊出 2 万亿美元
路透社消息,Anthropic 的上市时间表往后挪了。招股书公开从 9 月初推迟到 9 月下旬,路演最早 10 月中旬启动,打算在 11 月美国中期选举前几天挂牌。
部分投资人给的估值预期高达 2 万亿美元。如果成真,会超过 SpaceX 今年 6 月创下的 1.77 万亿上市估值纪录。目标募资额 1000 亿美元,也是 SpaceX 当时 862 亿的升级版。
彭博社那边的数据是,Anthropic 年化营收已超 650 亿美元,第二季度营收超 115 亿美元,调整后营业利润已经实现盈利。这个基本面确实撑得起高估值,但 2 万亿这个数还是有点吓人——它相当于把 Anthropic 跟现在全球市值最高的几家科技公司放在同一档。
选在中期选举前挂牌,这个时间点本身也值得琢磨。选举结果会直接影响 AI 监管走向,提前几天上市,可能是想在政策不确定性落地前先把钱装进口袋。
英伟达两年把股权投资从 22 亿干到 990 亿
英伟达最新财报显示,截至 7 月 26 日,公司手里攥着 990 亿美元的股权投资,其中一半是上市公司股票,一半是非上市公司的股份。一年前这个数字才 70 亿,两年前更是只有 22 亿,相当于两年翻了 45 倍。
CFO 在电话会上解释,做前沿 AI 模型的公司都卡在算力上,所以英伟达"需要帮忙把这个飞轮转起来",已经往这些实验室投了近 500 亿。公开的持仓里,英特尔占了 300 亿,SpaceX 占了 210 亿。
这个策略的逻辑很直白:英伟达卖 GPU 给 AI 公司,AI 公司拿 GPU 训模型,训出来模型需要更多 GPU 做推理,英伟达再卖更多 GPU。现在英伟达直接入股这些客户,等于在飞轮上又加了一层杠杆——客户买 GPU 的钱,一部分又流回英伟达的资产负债表。
大空头原型 Michael Burry 和 Mark Cuban 都觉得这玩法过头了。但英伟达显然不这么想,他们还有 250 亿的股权投资承诺没花出去。
OpenAI 和 Anthropic 同一天宕机,两家都没解释
9 月 3 日,OpenAI 和 Anthropic 几乎同时挂掉。ChatGPT 和 API 中断了大约 3 小时,Claude 出现间歇性故障。两家公司的状态页只写了"服务不可用",没给任何技术细节。Wired 去问,双方都没回应。
两家头部 AI 公司同时宕机却不解释原因,这事本身就比宕机更值得关注。可能是共享基础设施出问题——两家都用大量相同的云资源。也可能是协同攻击。或者纯属巧合。但沉默本身会让人往更坏的方向想。
Claude 自己花 11 天写完了费马大定理的机器验证证明
这条我会先打个折——目前还没看到独立第三方审计确认结果。但如果是真的,分量很重。
Claude 花了 11 天,基本靠自己写完了费马大定理的完整机器验证证明。它用 Lean 语言写了 1300 万行代码,证明了 29500 个中间定理,最终在证明助手上跑通。这个证明走的是 Darmon、Diamond 和 Taylor 对 Wiles 原始证明的简化版路线。人类只给了少量高层指令,比如"雅可比簇作为概形优先级高"、"把 Mazur 定理当作黑盒用"。
费马大定理的原始证明是数学史上最复杂的人类成果之一,Wiles 花了七年。如果 Claude 真的在 11 天内独立完成了机器验证版本,那说明 AI 在数学推理上的能力已经不只是"辅助"级别了。但在独立审计出来之前,这条先放在"待核实"那一栏。
今日小信号
-
GitHub 的 Project HydraFusion:一个运行时的模型路由器,简单任务丢给便宜的小模型,复杂任务才调用 Claude Sonnet 4.5 这类顶尖模型。GitHub 说能把 Copilot 推理成本降到纯用顶级模型的五分之一。思路不新,但放在 Copilot 这个量级的产品上跑,省出来的钱会很可观。
-
Spotify 工程师用 Portal 把 Claude Code 的 token 用量砍了九成:他发现大部分 token 花在读大文件、生成样板代码这类没什么推理量的 I/O 活上,于是把这类粗活路由到更便宜的 Gemini 2.5 Flash 去干。这个思路跟 HydraFusion 一样——不是让模型更强,而是让便宜的模型干便宜的活。
-
xAI 让 Grok Bot 做采购,找出超 10 万美元直接节省:Haggle Bot 在一个 SaaS 产品里找到 43 个 90 天无活动的付费席位,省了 $14,220;在另一个产品里找出每年 $85,662 的未用 SKU。Agent 进企业流程,采购可能是 ROI 最直接的一个切口。
-
Gimlet Labs 拿 3 亿美元 B 轮,做芯片混搭推理:把大模型拆开,让不同任务跑在不同类型的芯片上,声称同功耗下快 5 到 10 倍。a16z 领投,A 轮才过了五个月。推理成本的竞争正在从模型层下沉到芯片层。
-
Tom Tunguz 算了一笔账:未来五年 AI 数据中心要借 4 万亿美元:美国数据中心容量将从 25 吉瓦增至 70 吉瓦,全球建设成本约 5 万亿美元,其中约 4 万亿要靠债务融资,相当于美国公司债市场扩容 34%。这个数字大到有点抽象,但它意味着 AI 基础设施的融资规模正在逼近一个国家级的债务水平。