今天 AI 圈在拼交付,不是拼参数
今天 AI 圈最有意思的不在某个模型又刷榜了,是几笔账同时翻动:Anthropic 把 100 亿美元押在一家成立几个月的云公司身上,只为抢算力交付速度;工信部把 L3/L4 自动驾驶的安全要求从推荐标准升级成强制国标,2027 年 7 月起没跨过这道门槛就别想卖车;GitHub 工程师把 AI 一次吐出的几千行代码拆成人类能审的小块。先来看 Anthropic 这一笔。
Anthropic 把 100 亿美元押给一家成立几个月的云公司,图的是交付快
这条我会先打个折——今天 AI 投资圈最值得看的不是金额,是结构。Anthropic 跟一家叫 Volta 的云初创公司签了 100 亿美元长约,平均每年 17 亿美元。Volta 成立才几个月,估值 24 亿,手里几乎没硬件。
它的算力是从比特币矿商 Bitdeer 在挪威的一个 121 兆瓦站点租来的,芯片由 英伟达供、戴尔组装。Anthropic 花钱买的是速度——传统超大规模云厂商的合同谈判和部署周期太长,它等不起。但代价是扛下了一种超大规模云厂商合同从未有过的交易对手风险:一家刚成立、自己没硬件的中间商,能不能稳定交付百亿美元级别的算力?
这不是第一次有 AI 公司为了抢算力走非传统路径。之前 CoreWeave、Lambda Labs 这些 GPU 云已经靠类似模式吃到了红利。但 Volta 的体量和成立时间让这笔交易的风险敞口明显更大。Anthropic 显然认为速度比风险更重要——或者说,它判断 Claude 的迭代窗口比合同安全更紧迫。
有意思的是,同一天 Anthropic 还宣布任命 Mariano-Florentino Cuéllar 为首任首席全球事务官,负责全球政策和政府关系。Cuéllar 曾任卡内基国际和平基金会主席、加州最高法院法官,今年 1 月起还担任 Anthropic 长期利益信托受托人。一边在算力上冒险抢速度,一边在政策上铺长期布局,这两件事放在一起看,Anthropic 的优先级很清楚。
工信部把 L3/L4 自动驾驶安全要求升级成强制国标,2027 年 7 月实施
这条没有悬念,但时间线值得记住。工信部把 2024 年的推荐标准升级成了强制性国标 GB 44721—2026,专门管 L3(有条件自动驾驶)和 L4(高度自动驾驶)系统的安全要求,2027 年 7 月 1 日起正式实施。
这会让以后 L3/L4 产品上市前,必须跨过这道统一的安全门槛,不能再各说各话。起草单位名单很长:比亚迪、蔚来、小鹏、理想、小米汽车、华为引望、吉利、长安、博世、地平线等都在里面。从发布到实施留了将近一年,给车企留了缓冲期,但红线已经划好了。
这条新闻的价值在于它划了一条明确的上市红线,但缺少具体的安全指标和测试方法,所以暂时没法判断门槛到底有多高。另外,同一天 英伟达开源了面向 Robotaxi 和自动驾驶的 Alpamayo 2 Super 模型,基于 Llama 架构,用驾驶数据训练,可免费商用。两条消息放在一起看,国内车企在合规上有了明确时间表,在技术上多了一个可控的基础模型选择。
商汤开源 SenseNova U1,一个模型同时搞定推理和出图
商汤放出了一个叫 SenseNova U1 的开源模型,把逻辑推理和图像生成塞进了同一条流水线。它能直接把一句提示词变成带图的结构化幻灯片,也能一步步边想边画,比如演示怎么分六步画出一条龙。模型代码和权重已经挂在 HuggingFace、GitHub 和 SenseNova Studio 上。
这个方向有意思——不是多模态模型各干各的,而是推理和生成在同一个流程里交替进行。信息图模式可以直接把文字转成结构化幻灯片,交错模式则逐步生成图文内容。但正文没提参数量、训练数据和跑分,实际效果和资源消耗得自己试了才知道。
同一天还有几个模型发布值得提:蚂蚁百灵开源了 Ling-3.0-flash 的权重,BF16 和 FP8 两种精度直接给,省了自己量化,但同样没提参数量和跑分。腾讯混元发布了 Hy ASR 3.0 preview,基于大语言模型 Hy3 与 MoE 架构,中文普通话 WER **3.
34%**、英语 WER 2.62%、粤语 WER 3.12%,支持上下文纠错和热词注入,已上线腾讯云 API。通义千问上线了 **Qwen-Image-3.
0-Pro**,在 Arena 文生图榜单上拿了中国模型第一,能处理 4500 个 token的提示词,文字渲染精度到 10 像素级别,支持 12 种语言,Pro 版 0.04 美元一张图。
GitHub 用堆叠式 PR 把 AI 生成的巨型代码拆成人类能审的小块
GitHub 工程师分享了一套处理 AI 生成大块代码的工作流:先让模型一次性吐出整个功能的代码,再用堆叠式 Pull Request 自动把几千行改动按文件依赖和语义拆成 200 到 400 行一个的逻辑块。每个 PR 只关注一层改动,审阅的人不用同时看所有东西。
具体做法是把 1000+ 行的大 diff 按数据、API、接线、UI 拆成 L1-L4 四个独立分层,每层可以分配给不同的审查者。文章给了具体命令和分支命名规范,但没披露内部有多少人用、审阅时间到底缩短了多少。
这个思路很直接:AI 能写代码,但人类审代码的带宽没变。堆叠式 PR 不是新概念,但用在 AI 生成代码的审阅流程上,算是把老工具用在了新问题上。同一天 Cloudflare 也分享了一个类似思路——他们搭了一套叫"软件工厂"的自动化流程,用 Workers AI 自动分类、去重、回复常见 GitHub issue,只有边缘情况才交给人工,最终把 Astro 项目的 issue 数降到了零。两件事放在一起看,AI 在软件开发流程里的角色正在从"写代码"扩展到"管流程"。
Swiftlet 让 Mac 用 4.3 GB 内存跑 80B 模型,iPhone 也能跑 35B
Swiftlet 用 Swift 和 Metal 重写了 MoE 模型的推理方式,只把一个小型稠密核心常驻内存,专家权重按需从存储流式加载,不用全塞进内存。一个 80B 的 Qwen3-Next 在 Mac 上只占 4.3 GB 内存,35B 模型能跑在 iPhone 上。
这个方向的价值很明确:把大模型从云端拉到本地设备上。但缺少延迟或每秒 token 数,所以实时性先别太期待。同一天 Simon Willison 把 MiniMax-H3 搬到了苹果芯片上,在 M5 Max MacBook Pro 上跑了不到 45 分钟生成了一段 15 秒视频,画面看着不错但声音是乱码。Soup v0.72.4 号称能在 4GB 显存的笔记本 GPU 上微调 8B 模型,用的是层流式加载,但目前 GitHub 上只有 186 颗星,算早期项目。
这几条放在一起看,本地运行大模型的门槛在快速降低,但从"能跑"到"能用"之间还有不小的距离。
今日小信号
- SpecForge v0.3 把投机解码的训练流程拆开了,推理和训练不再绑死,8 张 H20 上吞吐高了约 10%,还一口气支持了 EAGLE3、DFlash、Domino 等六种草稿模型方案。
- Reflex 开源 XY,一个用 Rust 写核心的 Python 绘图库,号称 1 亿点图表不卡顿——1 万点 0.071 秒,1 亿点也只要 0.081 秒,速度提升主要靠绕过 JSON 解析瓶颈。目前还是 v0.0.1 早期 alpha。
- Replit 推出"环境智能"功能,不用写提示词,在画布旁点卡片就能自动生成设计变体。省了写 prompt 的功夫,但没提底层模型和免费版能用几次。
- GPT-5.6 Luna 降价 80% 永久生效,不是临时促销。同一天有分析指出 Anthropic 的 Fable 5 定价每百万输出 token 50 美元,较 Opus 5 翻倍——AI 定价在分层,便宜的更便宜,贵的更贵。
- Google Cloud API Gateway 开始公测模型路由,一个接口统一调用 Gemini、Claude 和 OpenAI 开源模型,路由规则写在 OpenAPI 3.x 配置文件里。