今天 AI 圈在算账:token 暗中涨价,数据中心砸 500 亿
今天 AI 圈最有意思的不在某个模型又刷榜了,是几张账本同时翻动:同一份代码,Claude 比 GPT 多收 73% 的 token 费;Meta 砸 500 亿美元建 5GW 数据中心;黄仁勋说英伟达季度收入快破千亿了。先来看 token 这笔暗账——标价页上的数字会骗人。
同一份代码,Claude 比 GPT 多收 73% 的 token 费
这条我今天反复看了两遍——模型比价不能只看标价页上的“每百万 token 价格”,因为各家切 token 的方式不一样。
Playcode 用各家官方分词器测了 16 个真实文件,结果很直接:同一份 TypeScript 文件,GPT-5.x 算 681 个 token,Claude 新分词器算 1,178 个,凭空多了 73%。更隐蔽的是,Claude Opus 4.8 和 4.6 标价完全一样,但 4.8 换了新分词器,同一份代码的 token 数多了约 32%——标价没变,账单膨胀了。
Anthropic 自家的新旧分词器差距也很大,新版本处理代码时比旧版多切出约 31% 的 token。也就是说,即使你只盯着 Anthropic 一家比价,同一个模型家族内部,新旧版本的“每百万 token 价格”也不是同一个单位。
还有个时间炸弹:Claude Sonnet 5 现在的 $2.00 / $10.00 是促销价,2026 年 8 月 31 日后恢复到 **$3.00 / $15.
00**。到时候相同代码的成本会比 Sonnet 4.6 高出约 3 倍——一部分来自标价涨,一部分来自 token 多切。
Tomer Tunguz 今天也发了篇博客,从另一个角度印证了这件事:前沿模型保持领先的平均时长只有 41 天,同等智能水平的模型价格每年下降约 10 倍。买家在每个技术周期里议价能力在变强,但前提是你得先看清账单。
说实话,token 计价这件事早该有人系统测一遍了。各家 API 的“每百万 token 价格”现在就像不同国家的“每升汽油价格”——单位一样,但升的定义不一样。
Meta 砸 500 亿美元建 5GW 数据中心,电费自己扛
500 亿美元,5GW——这两个数字放在一起,大概够 400 万户家庭同时用电。Meta 今天宣布把路易斯安那州的数据中心扩到这个规模,算全球最大的 AI 基建项目之一。
Meta 承诺电费、水费、配套基建全自己出,不转嫁给当地居民,还额外投 10 亿美元修路和供水。为了供电,Meta 跟安特吉公司签了协议,资助新建 7 座天然气发电厂、储能电池和核电增容项目。
但这条我会先打个折。公告里没提 GPU 数量,也没说什么时候建成。5GW 更像长期土地储备和电力容量的锁定,不是明天就通电的算力。这种合同形式让我想起 1990 年代末电信公司抢铺长途光纤——先占坑,再慢慢填设备。
黄仁勋今天在摩根士丹利路演上说了个数字,可以跟 Meta 这条对着看:英伟达季度收入快逼近 1000 亿美元了,而且增速还在加快。他还否认了 Rubin Ultra 延期的传闻,说按计划明年出货。一个有意思的细节:一个此前主要依赖 ASIC 的前沿 AI 模型项目,现在英伟达 GPU 算力占比已接近 50%——市场普遍指向 Anthropic。
Meta 在抢电力,英伟达在卖算力,Anthropic 在两边下注。这场基建战不是要不要打的问题,是已经在打。
Grok CLI 把用户整个家目录传到了谷歌云
这条有点离谱。安全研究者发现,xAI 官方的 Grok CLI(npm 包 @xai-official/grok 0.2.93 版)会在每轮任务前后,把当前工作目录打包成 `before_codebase.
tar.gz和after_codebase.tar.gz`,通过独立旁路通道静默上传至 xAI 的 Google Cloud 仓库。
验证显示,即使模型只回复一个单词,上传依然发生。更糟的是,上传包还包含仓库外的 ~/.claude.json、Claude Code 设置、全局 AGENTS 规则、30 多个 Skill 文件及一个 API 密钥。
7 月 13 日凌晨,xAI 通过服务端远程开关新增了 disable_codebase_upload 选项。但问题是,这个开关默认是关的——也就是说,如果你不知道这件事,你的代码和密钥已经在他们服务器上了。
目前只有一条推文链接和少量 HN 讨论,xAI 官方还没正式回应。缺的关键信息:上传是否加密、影响范围多大、已上传数据是否已删除。如果是 bug,这是非常严重的 bug;如果是设计如此,那问题更大。
腾讯混元把 OCR 大模型全开源了,1B 参数拿了端到端第一
腾讯混元今天开源了 HyOCR-1.5,训练代码、推理代码和模型权重全放出来了——这在端到端 OCR 大模型里是头一个。
模型只有 1B 参数,能处理文档解析、公式识别、表格还原等 8 种以上的文字任务。在 OmniDocBench v1.6 上拿了 94.74 分,排在端到端模型的第一名。
推理速度这块,它用了一个叫 DFlash 的投机解码方法,在 Transformers 下实现 6.37 倍加速,vLLM 下 2.14 倍加速,端到端推理每页 1.408 秒。
支持 4K 分辨率和 128K 上下文窗口,还通过 Agentic Data Flow 把低资源 OCR 扩展到了 331 种语言,包括古文字识别和多图问答。
开源这件事本身比跑分更有意思。OCR 是个很实用的能力——合同扫描、发票识别、古籍数字化——之前好用的模型要么闭源要么贵。腾讯这次全栈开源,训练代码都给了,意味着你可以用自己的数据微调一个专用 OCR 模型。
字节 Seedream 5.0 Pro:在图上打点画框就能换沙发
字节跳动发布了 Seedream 5.0 Pro,图像质量和提示词理解追平 GPT-Image 2.0,综合能力仅次于后者。但真正让我觉得有意思的不是跑分,是交互方式。
你可以在图片上打点、画框或者随手涂一下,然后在提示词里用 @ 标记,就能精准换掉沙发、改墙面颜色,画面其他部分保持不变。官方放出的案例包括一次性替换六件家具、做键盘爆炸拆解图并标注卖点、在画好的框里生成海报文字,还支持色卡配色和 SKU 换色。
这等于把图像编辑的门槛从“学会用蒙版”压到了“在图上指哪改哪”。火山引擎已经全量上线 API,即梦、豆包、Lumina 可以体验。
今日小信号
-
德国开源模型 Soofi S:31.6B 总参数,每次生成只激活 3.2B,长文本生成速度是同类模型的 8 倍。德语训练数据占比从 7.2% 提到 15.3%,在德语、英语和编程跑分上压过了 Olmo 3 32B 和 Apertus 70B。但目前只发了预训练报告,还没做指令微调,离能直接用的聊天助手有距离。所有跑分来自团队自己的技术报告,没看到第三方独立验证。
-
MIT 搞出“高斯探测”:不给模型下指令,也不让它生成任何图片,靠分析 LoRA 微调产生的内部变化来判断模型有没有被教坏。识别专门生成儿童性虐待素材的模型,准确率 100%。直接绕过了“为了查案得先违法”的死结。
-
苹果新语音 API:SpeechAnalyzer 在干净语音上词错率 2.12%,嘈杂语音 4.56%,比 Whisper Small 分别低了 1.62 和 3.38 个百分点,速度还快三倍。但缺少模型架构和参数量,不知道是模型强还是工程优化好。
-
**DoorDash 用多个大模型当“陪审团”**给菜品打标签,准确率比人工高 20%。不用人审,让多个强模型独立投票、取共识。另外用“上下文优化代理”在几分钟内自动迭代提示词,精度又提了 2-3%。
-
Cloudflare 推出 Precursor:持续行为验证引擎,全程追踪人类与 AI agent 在完整用户旅程中的交互方式,识别高级自动化行为同时减少对合法用户的干扰。