今天 AI 圈在翻账本,不是模型
今天 AI 圈最有意思的不在某个模型又能写代码了,是几张账本同时翻动:Stripe 花 70 多亿美元买下 OpenRouter、Anthropic 二季度收入冲到 115 亿美元、英伟达悄悄砍了对 OpenAI 基建的担保额度。另一边,Qwen 新模型默认推理烧掉几万 token 才画个圆,有人开始认真讨论模型是不是在故意变笨。先来看 Stripe 这一笔。
Stripe 花 70 多亿美元买 OpenRouter,等于把支付管道升级成 AI 算力管道
这条我今天看到的时候愣了一下——Stripe 要花超过 70 亿美元买下 OpenRouter,这是 Stripe 史上最大一笔收购。OpenRouter 做的是一个 API 路由层,让开发者用一个接口就能调用 300 多个大模型,按用量计费。去年它处理了 1500 亿次模型请求,月活开发者大约 20 万。
有意思的地方不在金额,在逻辑。Stripe 一直是支付公司,它的核心能力是让开发者几行代码就能收钱。现在它买的是一个让开发者几行代码就能调用任何模型的层。这两件事在架构上几乎一模一样——都是把复杂的后端抽象成一个简单的 API 调用,按用量计费,开发者不用管底层。
这笔交易直接把 Stripe 从"帮你收钱"拉进了"帮你用 AI"。如果整合得好,以后开发者在 Stripe 后台不仅能看支付流水,还能看模型调用成本、切换模型、管理配额。这对 Stripe 的商户来说,等于多了一条收入线——不是从 Stripe 收钱,是从 Stripe 花出去的钱里抽成。
不过交易结构还没披露,现金还是换股、什么时候交割都不清楚。70 亿这个数我会先打个折,等正式公告出来再看。但方向是明确的:支付管道正在变成算力管道。
Anthropic 二季度收入 115 亿美元,一年涨了 14 倍
CNBC 援引彭博社看到的文件,Anthropic 今年第二季度的初步收入超过 115 亿美元,去年同期只有 7.87 亿美元,一年内涨了 14 倍多。增长主要靠 Claude 拉动,公司也在为可能的 IPO 做准备。
这个数字确实夸张,但有几个地方要打折。第一,这只是初步数字,不是审计后的财报。第二,文章没披露利润、成本结构,也没说大客户是谁。Anthropic 的训练和推理成本极高,收入涨 14 倍不代表赚了 14 倍的钱,可能还在巨亏。第三,路透社同一天放出一个消息:Anthropic 的 IPO 估值会以 2028 年收入达到 1900 到 2000 亿美元这个预测来定价。
这就有点微妙了。二季度 115 亿年化大概 460 亿,要跳到 2028 年的 1900 亿,意味着未来两年多还要翻四倍。这个远期数字缺少现在的收入基数、估值倍数和具体的上市时间表,先别太激动。Gary Marcus 也发了篇文章提醒,这些数字多基于匿名信源和未披露算法,在静默期流传的数据要区分已核实和传闻。
坦率地讲,Anthropic 的增长确实快,但 IPO 前的数字战已经开打了。
英伟达砍了对 OpenAI 基建的担保额度,Stargate 能不能按计划拿钱要打个问号
华尔街日报的消息,英伟达把之前可能为 OpenAI 基建项目担保的 2500 亿美元融资额度砍了一大截。新数字具体是多少,没公布。
这笔钱直接关系到 Stargate 这类巨型项目能不能按计划拿到钱。2500 亿这个数之前是市场对 AI 基建投资规模的一个锚点,现在英伟达自己先撤了一步,说明要么是风险评估变了,要么是谈判条件没谈拢。
在新的细节出来之前,我会先把原来的 2500 亿这个数打个折来看。不是说项目会黄,而是融资规模和节奏可能要重新算。
Qwen 3.8 27B 很强,但默认推理模式是个坑
Simon Willison 上手了阿里 Qwen 团队新发的 27B 模型,评价很高,但指出一个明显毛病:模型默认的"超高"推理强度会过度思考。一个简单的画圆指令,模型会花几分钟生成一段精美的动画 SVG,完全偏离原意。画一张"鹈鹕骑自行车"的 SVG,默认设置下烧掉 22,276 个推理 token,耗时 21 分钟才出图。关掉推理后,同样的任务只需两分多钟。
他的建议很直接:上手第一件事就是把推理强度调低或关掉。模型本身能力不差,官方基准显示它超越了前代 Qwen 3.6 27B 和闭源的 Qwen 3.7-Plus,Apache 2 许可,能在 24GB 显存上跑。但默认设置太激进,等于出厂就给你开了个"烧 token 模式"。
这其实不是 Qwen 一家的问题。现在很多模型默认推理强度偏高,厂商可能觉得"思考时间长 = 看起来更聪明",但对用户来说,画个圆烧几万 token 是纯粹的浪费。如果你打算部署到聊天或客服场景,可能需要额外调 prompt 或做后处理来压缩输出长度。
模型正在被故意变笨:用知识换推理,把事实赶出参数
这篇文章观察到一个刻意的行业趋势:小模型在数学推理上越来越强,但记性越来越差。作者举了具体例子,Qwen3.5 9B 在知识测试里,遇到不会的问题有 八成概率会瞎编一个答案。目前事实记忆最强的 Gemini 2.5 Pro,在不联网的测试里正确率也只有 53%。
这不是 bug,是实验室在用参数里的"世界知识"换"推理能力"。事实很占地方,而且会过时,不如把参数省下来做推理,需要事实的时候让模型去查。这个 trade-off 在技术上说得通,但对用户来说体验很差——你问它一个事实性问题,它不会说"我不知道",而是自信地编一个。
有意思的是,这和另一条新闻形成了对照。有人提出一种叫"手艺编程"的用法:你写代码,AI 负责审阅。作者 Peter Bloem 认为,让 AI 写、人来查根本行不通,人的注意力撑不过一小时,代码库会慢慢烂掉。反过来,人写 AI 查,AI 能揪出过去要花几周才能发现的 bug,提醒你漏掉的技巧和没接触过的技术,你还能真正学到东西。
这两件事放在一起看,指向同一个方向:AI 正在从"替你做事"转向"帮你检查你做的事"。模型记性变差但推理变强,正好适合当审阅员而不是作者。
Anthropic 的文字水印方案:故意不选最自然的词
John Gruber 拆解了 Anthropic 的文字水印方案:Claude 在生成每个词时,会偏向选一个"绿名单"里的词,避开"红名单"里的词,靠这种统计偏差给文本打上可检测的指纹。
这直接打脸了 Anthropic 自己说的水印"不可察觉、不改变意思、质量和可读性"。它为了可追溯,故意让模型不选最自然的词。虽然人眼看不出来,但统计上是有偏的,理论上会影响文本质量。
Anthropic 公开这个方案是为了欧盟法规合规性,说明监管压力正在迫使模型厂商在输出质量上做妥协。这个 trade-off 值不值得,要看水印的实际检测准确率和误报率,但 Anthropic 没公布这些数字。
今日小信号
-
二手 API 额度市场已经商业化了。Vectoral 摸了一圈发现,初创公司没花完的赠金正被中间商以四到八折转卖,有卖家声称一天能出 10 万美元的额度。他们不直接给密钥,而是搭个代理转发请求,市面上甚至冒出了 AI Credits、CheapCredits 这类公开交易平台。流通规模估算在数千万美元级别。
-
给编程助手装个记忆,一条命令搞定。LoreKit 开源了一套记忆系统,把 AI 编程助手踩过的坑记成本地 Markdown 文件。一条 npx 命令就能搭好环境,之后助手遇到测试报错会自动把原因和修法写进
~/.lorekit文件夹,下次新会话自动加载,避免反复撞墙。 -
Protobuf 终于有 LSP 了。Buf 发布了首个生产级 Protobuf LSP 服务器,集成在 Buf CLI 里,底层换了一个查询驱动的编译器前端,支持增量编译。诊断也更细,比如能抓到重复的 repeated 修饰符。VSCode 和 Neovim 即装即用。
-
只喂小学教材的模型,天花板就钉在小学。一篇论文做了一个很干净的实验:把训练语料严格限制在美国 K-5 课程范围内,从零开始训了三个尺寸的模型。结果发现,超出教材范围的能力,靠堆参数、强化学习或者给示例都带不动。预训练数据就是能力天花板,这个结论干净利落。