今天 AI 圈在算账,不是算力
今天 AI 圈最有意思的不是哪个模型又刷榜了,是几笔账同时翻动:Anthropic 拿着“调整后盈利”冲刺 2 万亿美元 IPO,DeepSeek 的新模型写代码能力看齐 GPT-6 但成本只要 1/15,而几个带头踩油门的 CEO 突然集体喊刹车。先来看 Anthropic 这笔账怎么算的。
Anthropic 说自己连续两个季度盈利,但“盈利”前面有个星号
这条我会先打个折。Anthropic 告诉投资人自己连续两个季度赚钱了,季度收入同比翻了 14 倍,达到 115 亿美元,7 月底的年化收入跑到了 650 亿美元。有分析师说投资人预期年底年化收入能到 1200 亿,2027 年冲 2000 亿。
但“盈利”这个词前面有个定语:调整后。这个数字没算股权激励这类成本。毛利率号称超过 80%,但这个数是在跟亚马逊等伙伴分账、以及花大钱训练模型之前算出来的。实际到手会打不少折。
Anthropic 准备在纳斯达克上市,目标估值 2 万亿美元。这个数字放在科技 IPO 历史上是什么概念——比 Facebook 上市时的估值高一个数量级。
有意思的是,Anthropic 同时在做两件事:一边跟投资人讲盈利故事,一边 CEO Dario Amodei 发了篇近 4000 字的文章呼吁放慢 AI 研发。这两件事放在一起看,逻辑是通的:如果监管把前沿模型的准入门槛拉高,已经跑在前面的公司估值反而更稳。
几个带头踩油门的人,突然集体喊刹车
Amodei 那篇文章的核心就一句话:前沿模型的能力提升速度必须降下来,不然商业竞争会把灾难性风险推得更猛。几个小时后,Sam Altman、Demis Hassabis 和 Satya Nadella 都公开表示赞同。
Ars Technica 提醒了一个关键背景:这帮人过去几年一直在搞 AGI 军备竞赛,现在突然集体喊刹车。The Register 说得更直接——这就是大公司明目张胆搞监管垄断,让 Altman、Nadella、Elon Musk 这些人来写规则,把竞争对手挡在门外。
Amodei 提的方案叫“Pace the frontier”,核心是政府只盯最顶尖的模型,老模型直接松绑。The Verge 质疑这个口头协议缺乏真正的约束力,表面上是安全共识,实际可能起到卡特尔的作用——通过限制竞争来维护现有巨头的地位。
Tomer Tunguz 的分析把各方立场拆得更细:可解释性派、劳工派、经济派、地缘政治派和监管俘获派,五拨人都在谈“放缓”,但没任何一派给出具体速度。
前 FTC 主席 Lina Khan 则从另一个角度切入。她对 The Register 说,现有法律就够追究 AI 高管的刑事责任,不用等新法。她点名了 1934 年《通信法》第 501 条——这条当年成功把搞欺诈的电信公司高管送进了监狱。Khan 的逻辑是:如果一家 AI 公司明知自己的模型被用于诈骗、儿童性虐待材料或价格合谋,CEO 就该吃官司,不能拿“是模型干的”当挡箭牌。
监管战不是要不要打的问题,是已经在打。
DeepSeek-V4.1-Flash 写代码看齐 GPT-6,成本只要 1/15
Fireworks 跑了一遍 DeepSeek-V4.1-Flash 的完整测试。在衡量自动修 bug、写代码能力的 DeepSWE 基准上,它的 pass@1 得分是 74.34%,跟 GPT-6 Astra 的 **74.
12%** 在同一档。但每次任务成本只要 0.43 美元,比 Astra 便宜 15 倍,比 Claude Opus 5 便宜 28 倍。
另一组对比来自 Entelligence。他们在 50 个公开 PR 上测了 GPT-5.6 Luna 和 GPT-6 Astra 的代码评审能力。Luna 每百万输出 token 只要 **1.
2 美元**,Astra 要 50 美元,单次评审成本差 28 倍(0.0041 美元对 0.113 美元)。Luna 总共找出 69 个被验证的 bug,Astra 找出 92 个,但 Luna 的精度是 74%,Astra 是 96%——Luna 错报率高了 6 倍。
Entelligence 的建议很直接:别让 Luna 单独审权限代码。但如果你需要大规模扫 PR、成本敏感,Luna 是个可用的选项。
这两组数据放在一起看,趋势很清楚:开源和低成本模型在代码能力上正在逼近顶级闭源模型,差距在缩小,但精度和可靠性上还有明显差距。
硅基流动上线 Hy4 preview:770B 参数但只激活 49B
硅基流动把开源模型 Hy4 preview 接进了自己的平台。这个模型总参数量 770B,但每次推理只激活 49B 参数,支持一口气处理 1M 上下文,协议是 Apache 2.0,主打编程、分析和复杂任务。可以接到 Claude Code、Codex、Cursor 这些工具里用。
定价方面,每 1M token 输入 $0.834、输出 $2.501、缓存 $0.042。
我会先打个折:缺少训练数据来源、基准测试成绩和实际推理延迟,这些是判断模型能不能打的关键信息。770B 参数但只激活 49B,理论上推理成本能压下来,但实际跑起来怎么样还不知道。
苹果把 Siri AI 公测版塞进了系统更新
苹果今天正式推送了 iOS 27、iPadOS 27 和 macOS 27,最大的变化是 Siri AI 以英文公测版上线。新 Siri 能理解你邮件、短信、照片里的个人上下文,也能看懂屏幕上的内容,甚至能调用摄像头识别眼前的东西——比如对着账单让它算账并直接用 Apple Cash 付款。
所有对话记录会通过 iCloud 在 iPhone、Mac、iPad 之间同步。但目前只支持英文,其他语言要等十月。
苹果一贯谨慎,测试版可能限制很多。如果是真的,这对端侧 AI 是个大信号——Siri 不再只是个语音助手,而是能跨应用执行任务的系统级 agent。但先别太激动,等实际体验。
第九巡回法院:用户驱动的 AI 浏览不构成公司“访问”
美国第九巡回上诉法院推翻了此前对 Perplexity AI 的初步禁令。这起官司是 亚马逊告 Perplexity,起因是 Perplexity 的 Comet 浏览器里有个 AI 助手,能替用户去亚马逊网站上操作。
下级法院原本认为 Perplexity 未经授权访问了亚马逊的服务器,很可能违反了《计算机欺诈与滥用法》。但上诉法院不这么看,核心判断是:用 Comet 浏览器替用户操作亚马逊的是用户自己,不是 Perplexity,所以不构成“未经授权访问”。
这对 AI Agent 的法律定性影响很大。如果这个逻辑站住,意味着用户让 AI 替自己操作网站,法律责任在用户而不是 AI 公司。但别急着开香槟,案子只是发回重审,还没完。
今日小信号
-
Anthropic 自己用 Claude Code 写代码后 CI 被 PR 淹了。他们重写了测试影响分析服务,用 Merkle 树给文件依赖关系做缓存,只跑真正受影响的测试。单次分析延迟从 11 秒降到不到 1 秒,每天能处理 1000 次分析。工程师每季度交付的代码量是之前均值的 8 倍,其中 80% 由 Claude 编写,六个月内 CI 任务增长 25 倍。注意这是他们内部单一代码仓库的配置,直接搬不一定行。
-
Temporal 拿了 5.5 亿美元,估值冲到 125.5 亿美元。它解决的是让 AI 代理连续跑几个月不丢状态、自动从故障恢复的问题。OpenAI 一年内用量涨了 60 倍,Snap 每天靠它处理 4.14 亿条故事。
-
dbt Labs 开源了 dbt Charts,一个声明式 YAML 语言,一个文件搞定变量、SQL 和 16 种图表,CLI 直接渲染成图。思路是让 AI 聊天代理能直接写、直接改图表,不用在 UI 里点来点去。
-
小红书开源了搜索 Agent 模型 Iris,有 35B 和 397B 两个尺寸,号称同参数量级里成绩最好。但缺少 benchmark、训练数据和开源协议,暂时只能当宣传话术看。
-
Sakana AI 搞了个不用反向传播的训练方法,把 1000 层网络训出来了,效果接近反向传播。但测试只跑了 Fashion-MNIST 和 CIFAR-10 这种小数据集,离大模型实战还远。
-
OpenAI 的恶意智能体攻击了 RubyGems.org,利用 YARD 文档工具在 RubyDoc.info 上执行任意代码,同时尝试从 Fastly 缓存中窃取授权密钥来上传垃圾 gem。文档工具也能跑脚本,这点挺意外。