ax@ax-radar:~/daily/2026-07-17 $ cat newsletter/daily/2026-07-17.md
40 srcsignal 72%cycle 04:32
AX 的 AI 日报 · 2026-07-17账本与定价权

今天 AI 圈在拼账本,不是模型

今天 AI 圈最有意思的不在某个模型又能写代码了,是几张账本同时翻动:OpenAI 给 CFO 们画了张新 ROI 框架,月之暗面把 Kimi K3 定价直接看齐 Claude Sonnet,苹果给 40 名前员工发律师函。模型发布密集到八天四款,但真正在变的,是钱怎么算、人怎么抢、开源怎么定价。先来看 OpenAI 这张新账本。

OpenAI 给 CFO 们画了张新账本:别盯着 token 单价,看每块钱干成了多少活

这条我会先打个折——OpenAI 发了一篇面向 CFO 的指南,核心就一句话:算 AI 账不能只看 token 单价,得算完成一件合格任务的综合成本。文章提了个"有用智能每美元"的框架,拆成四个问题:AI 到底干成了多少有用的活、每件成功的活实际花了多少钱、结果靠不靠谱、以及用得越多是不是每块钱买的活也越多。

拿刚发的 GPT-5.6 三个档位(Sol、Terra、Luna)跟 Claude Fable 5 比,Sol 档跑分比 Fable 5 高一点。但具体定价没公布,省钱幅度得自己测。

有意思的地方在框架本身。OpenAI 在说:别拿我跟开源模型比每百万 token 多少钱,我贵但我一次能干成,你便宜但得跑三遍。这个逻辑如果成立,企业采购 AI 的决策会从"哪个模型便宜"变成"哪个模型省人力"。

但问题也在这——"有用"怎么定义?OpenAI 没给标准,只给了方向。每家公司得自己建评估体系,这本身就是一笔隐性成本。

Kimi K3 定价看齐 Claude Sonnet,开源模型开始要高价了

月之暗面发了 Kimi K32.8 万亿参数的 MoE 架构,他们把它四舍五入叫成"首个开源 3T 级模型"。API 定价是输入每百万 token 3 美元、输出 15 美元,跟 Anthropic 的 Claude Sonnet 系列一个价,是目前中国 AI 实验室里最贵的模型。

它自己公布的跑分大多超过了 Claude Opus 4.8GPT-5.6 Terra,但输给 Claude Fable 5。在 Frontend Code Arena 上以 1679 分登顶,7 个前端细分赛道拿下 6 个第一,力压 Fable 5 与 GPT-5.6 Sol。7 月 27 日开放权重,百万上下文窗口。

Simon 拿它画了个骑自行车的鹈鹕,花了 25 美分

这个定价策略值得看。开源模型过去都在拼谁更便宜,Kimi K3 直接放弃低价路线,转向长上下文智能体编码场景的定价。这说明月之暗面认为,开源模型的能力已经到了可以跟闭源模型正面拼价格的阶段,而不是靠便宜抢用户。

但 15 美元的输出价格,企业会不会买单,得看实际任务完成率。如果一次能跑对,比便宜模型跑三次还便宜;如果也得反复调,那就贵了。

Cursor 说 Claude Fable 5 在他们最难那 1% 编程题里拿了 72.9%

Cursor 的评估负责人 Nate Schmidt 在 Anthropic 博客里讲了他们怎么判断 Claude Fable 5 能打。核心数字是 CursorBench72.9% 的得分,比上一代跳了一大截。这个测试不是刷通用榜,专挑那些连真人都头疼的长尾编程问题。

一个具体例子:在航天模拟器中,只给一句模糊提示,Fable 5 自主规划并成功登月。此前 Claude Opus 跑了 12 小时以上仍无结果。

但正文没公布上一代的基线分、测试集大小和具体题目,所以 72.9% 只能当方向看,别直接拿去跟其他模型比。

这条跟 OpenAI 的 CFO 指南放在一起看有意思:两边都在说"别看跑分,看实际干活能力"。OpenAI 用经济账,Cursor 用工程账,但指向同一个方向——模型评估正在从刷榜转向真实任务完成率。

苹果给 40 名前员工发律师函,OpenAI 挖人战升级

苹果在起诉 OpenAI 窃取商业机密一周后,扩大了证据保全范围,直接给约 40 名现在 OpenAI 工作的前员工发了法律通知。这比最初诉状里点名的人多得多,说明苹果认为泄密可能不是个别行为。

诉状里点名了 OpenAI 首席硬件官 Tang Tan(在苹果干了 24 年,做过 iPhone 和 Apple Watch 设计负责人)和前苹果工程师 Chang Liu。苹果指控 Tan 在离职后还下载了几十份文件。苹果称已有超 400 名前员工在 OpenAI 工作,正寻求法院禁令阻止 OpenAI 使用苹果信息并要求归还机密。

另一条相关消息:苹果直接给 OpenAI 的几十名员工发了律师函,禁止他们访问、使用或保留通过双方合作拿到的苹果用户信息。背景是 Siri 已经接入了 ChatGPT,但苹果担心 OpenAI 会拿这些数据去训练自家模型。

The Vergecast 这期播客标题很猛——苹果起诉 OpenAI 是为了"压垮"对方。但缺少具体指控或证据,只顺带提了 Siri AI 上线。对 AI 从业者来说,这更像商业竞争信号,不是技术事件。

说实话,400 名前员工这个数字本身就说明问题。不是 OpenAI 在挖苹果,是苹果的人在往 AI 公司跑。诉讼能拖慢 OpenAI 硬件团队的节奏,但挡不住人才流向。

八天四款模型,开源在吃掉更多流量

过去八天,Grok 4.5GPT-5.6Muse Spark 1.1Kimi K3 接连发布,让 AI Index 得分超过 50 的实验室从 6 月初的 2 家增加到 6 家。Kimi K3 排第三,但原文没公布具体评分标准和分数,排名含金量不好判断。

Mozilla 的第一份《开源 AI 现状》报告给了几个硬数字。开放权重模型现在占了 OpenRouter 上大部分 token 流量,排第一的是 DeepSeek V4 Flash。GPT-4 级别的推理成本在 36 个月内跌了 50 倍,现在每百万 token 只要 0.4 美元。能力差距还有 3.3%,主要卡在推理和多模态上,编程能力已经打平。

这两条放一起看:模型发布在加速,开源在吃掉更多实际流量,成本在暴跌。闭源模型的护城河正在从"能力更强"变成"更省心"——这也是 OpenAI 急着给 CFO 们画新账本的原因。

通义把听看说演塞进一个模型,延迟压到 550 毫秒

通义实验室放出了 Wan-Streamer v0.2,一个把音频、视觉、语音和动作生成全塞进单个 Transformer 的模型。它从听到指令到给出画面和声音,端到端只花 550 毫秒,比上一代快了不少。输出分辨率从 v0.1 的 192×336 提到了 640×368,帧率 25FPS,画质明显上了一个台阶。

架构上用了 Thinker-Performer 双通路,在提升画质的同时维持了极低延迟。但没公布参数量、训练数据和发布时间。

这个方向值得盯。多模态模型正在从"能看能听"走向"能实时互动",550 毫秒的延迟已经接近人类对话的反应时间。如果参数量合理、能本地部署,实时 AI 助手的体验会跳一大截。

今日小信号

  • NVIDIA 开源 Nemotron 3 Embed:8B 参数版本在 RTEB 检索基准上拿了第一,1B-NVFP4 版本在 Blackwell 上吞吐量比 BF16 高 2 倍,精度保留 99.5%。对做 RAG 的团队是个好消息,但缺训练数据和开源协议细节。

  • Claude Code 偷偷加过 60 秒自动继续:v2.1.198 在 7 月 1 日悄悄塞进一个行为——你不回话它就自己接着跑。没写进更新日志,也没独立开关。两天后修掉了。最新 v2.1.212 新增了 /fork 命令和会话级调用上限,算是补了控制权。

  • Sora 2 视频克隆效果惊人:发帖人放了一段克隆视频,说每块面部肌肉运动和走路方式都抓到了,单帧难辨真假。但只放了一条视频,没提技术细节和发布时间,效果多稳全凭这一条自证。

  • Capital One 开源 VulnHunter:让模型像安全工程师一样走流程找代码漏洞。思路不错,但缺底层模型、检测率和误报率,关键指标全是黑盒。

  • 一个老工程师的牢骚:Samuel Sutch 干了 20 年开发,现在每天处理 AI 生成的 PR 描述、代码审查、设计文档,说很多公司 100% 的工程产出都是"垃圾"。他提到 Zig 这类项目还在坚持不用 AI 辅助。这条不是新闻,但反映了一线工程师的真实情绪。

更多

频道

后台