今天 AI 圈在拼部署,不是模型
今天 AI 圈最有意思的不在某个模型又能写代码了,是几笔账同时翻动:AI 公司 12 个月砸了 97.5 亿美元建部署工程团队,微软开始用自研模型替换 OpenAI 和 Anthropic,中国打算把最强模型列入出口管制。先来看这笔 97.5 亿的部署账。
97.5 亿美元不是投模型,是投“教你怎么用”
这条我会先打个折——97.5 亿美元这个数字听着吓人,但它不是一年花掉的,是 12 个月内 AI 公司合计承诺的部署工程投入。不过方向很明确:瓶颈从模型能力转向了部署。
Tomer Tunguz 算了笔账,三种结构已经浮出来。第一种是资产负债模型:微软、亚马逊从现有编制里调配人手,Salesforce 直接承诺了 1000 个 FDE 岗位。第二种是独立实体模型:OpenAI 的 Deployment Company 融资 40 亿美元,投后估值 140 亿;Anthropic 从黑石等机构融了 15 亿美元。第三种是合作伙伴生态:Google Cloud 承诺了 7.5 亿美元的合作伙伴基金。
FDE 是什么?就是建设前部署工程——直接看,不是卖模型,是派人驻场教企业怎么用。GPT-4、Claude、Gemini 已经够强了,但多数企业自己装不上、配不好。这些嵌入式工程师一边教育客户,一边拿到专有工作流和数据反馈回去调模型。切换成本不是技术上的,是制度性的——你换模型可以,但你得重新教另一批人怎么用。
这笔钱砸下去,护城河不在模型本身,在“谁的人先住进客户机房”。
微软开始换模型,用户可能花同样的钱买到更弱的 AI
这条说实话我有点替 Copilot 用户捏把汗。微软已经在 Excel、Outlook 等 Copilot 产品里用自研的 MAI 模型处理部分请求,目标是逐步砍掉对 OpenAI 和 Anthropic 的模型支出。
AI 负责人 Mustafa Suleyman 6 月公开说过 Anthropic 太贵,要最终清零这笔成本。目前 MAI 只处理每周几万次请求,占比还很小,但路线很明确。Build 大会上发布的 MAI-Thinking 1 声称编码能力媲美 Sonnet 4.6 和 **Opus 4.
6**,但基准测试大幅落后,实际只跟 DeepSeek V3.2 相当。微软说 MAI 用的是干净商业许可数据,但上游报道指出实际基于 Common Crawl。
CEO 暗示未来可能按用量计费,MAI 做默认模型,第三方模型要付费附加。用户可能花同样的订阅费,背后跑的模型却从 OpenAI 换成了性能更弱的自研版本。省钱的是微软,不是用户。
中国要把最强模型列入出口管制,开源权重也可能不让外国人下载
这条值得认真看。商务部牵头、发改委参与,正在跟阿里、字节、Z.ai 等公司商量,要把先进模型(包括还没发布的)留在国内。
这次不是平台内容监管,是走出口管制逻辑。管的不只是 API 调用,连可下载的开源模型权重也算在内。讨论里还提到模型泄露可能按国家安全罪处理,以及限制外资投中国 AI 初创。如果落地,海外公司就买不到这些低成本模型了。
Ethan Mollick 同一天也发推说,前沿开放权重模型的供给不会一直持续,甚至可能很快断流。他没给具体原因和时间线,但结合 Meta 收紧 Llama 许可、创业公司转向闭源的趋势,这个判断方向是对的。
缺少时间表和具体执行细则,先别急着下结论。但如果两边都收紧——华盛顿限制美国先进模型出口,北京限制中国模型出去——全球 AI 市场会进一步分裂成两个互不流通的池子。
Anthropic 公开两种多智能体用法:便宜的干活,贵的把关
这条挺实用。Anthropic 的 Claude 开发者分享了他们内部高频使用的两种多智能体模式。
第一种叫 Advisor,让便宜的 Sonnet 5 干活,遇到难题时通过工具调用去问贵的 Fable 5。在 SWE-bench Pro 测试上,这套组合拿了 84% 的分数,花了 1.40 美元;对比纯用 Fable 5 是 91.5% 但花 2.25 美元。相当于用 92% 的性能省了 37% 的成本。
第二种叫 Orchestrator,让 Fable 5 当指挥,把子任务分派给多个 Sonnet 5 并行跑。这套在 SWE-bench Pro 上冲到 89%,比纯 Fable 5 低 2.5 个点,但成本差不多。
同时 Claude Code 也更新了模型选择和努力级别控制。你可以把 Opus 派去跨文件重构,Sonnet 处理日常编辑,Haiku 做快速小修。努力级别分低、中、高三档,调的是模型思考深度和工具调用次数。高努力配 Opus 会触发多步代码库搜索和测试运行,但烧的 token 也最多。
Anthropic 还扒了 Claude Cowork 的会话记录,发现约一半用量花在“工作周边”杂活上——跨岗位都有的琐事,但没写进 JD。业务流程与运营占 33.4%,内容创作与文案占 16.4%,软件开发只占 8.7%。Cowork 也要上手机和网页了,Beta 版未来几周先面向 Max 用户。
Meta 发了两个媒体生成模型,让模型读 Instagram 社交信息当上下文
Meta 超级智能实验室放出了 Muse Image 和 Muse Video,这是他们头一批媒体生成模型。
Muse Image 主打听话出图,能按指令精确生成、编辑图片,还能参考多张图来构图。比较新鲜的是它会读 Instagram 上的社交信息当上下文——比如你朋友发过的图、你点赞过的风格,这些都能变成生成时的参考。它还集成了一个叫 Muse Spark 的东西,能调用工具干活,具体是什么正文没细说。Muse Video 基于同一个预训练底座,能生成带原生音频的视频。
两个模型都接进了 Instagram、WhatsApp 和 Meta AI 应用,但初始只开放部分国家。没给模型大小、生成延迟和可用国家列表,先别太激动。
今日小信号
-
Liquid AI 开源 Antidoom:专门治推理模型“死循环”的毛病。用 1,040 组偏好样本训练后,DeepSeek V4 Pro 的死循环率从 3.2% 降到 0.3%,数学和编程成绩还没掉。整套流程几小时就能跑完,代码和数据集已开源。
-
YC CEO 吹 AI 日写 3.7 万行代码,开发者一看前端:169 个请求、6.42MB 数据,连 0 字节的 logo 文件都上线了。代码量不等于质量,这点先别太激动。
-
美国无人战车在乌克兰实战:Forterra 往战区送了超过 100 辆自动驾驶全地形车,跑了 1,100 多次任务,运送 777,440 磅物资,完成 52 次伤员撤离。目前主要靠远程操作,自主系统还无法实时识别敌方威胁。
-
Feyn Labs 开源 Pulpie:用 2.1 亿参数做到跟 6 亿参数的 Dripper 几乎一样的网页正文提取效果,速度快 20 倍,处理 10 亿页成本从 15.9 万美元降到 7,900 美元。
-
蚂蚁的 Token 密度方案:万亿参数模型每跑 15 分钟烧掉一辆特斯拉。团队用混合注意力把长文本成本从指数压到线性,Token 输出砍掉 3/4 能力没掉。但这是演讲 PPT 数据,没看到第三方复现。