今天 AI 圈在拼合同,不是模型
今天 AI 圈最有意思的不在某个模型又能写代码了,是几张账本同时翻动:Google 给 Anthropic 备了 400 亿、OpenAI 把 5.5 静悄悄接进 API、Affirm 把 800 多人停工一周改流程让 agent 顶上。先来看 Google 这一笔。
Google 四百亿不是一张支票,是给 Gemini 上的双保险
这一下我有点愣住了——今天 AI 投资圈最大的数字是 400 亿美元,但更值得看的不是金额,是结构。
Google 计划向 Anthropic 投资最高 400 亿美元,其中 100 亿美元立即投入,剩下的 300 亿美元取决于 Anthropic 是否达到特定营收目标。这笔钱不是直接给 Anthropic 的,而是通过云服务合同的形式——Anthropic 要在 Google Cloud 上跑训练和推理,Google 用投资锁定一个大客户。
这种"云厂商深度绑定大模型公司"的合同,之前已经出现过两次。Microsoft 和 OpenAI 的关系就是模板,Amazon 对 Anthropic 也有类似安排。但 Google 这次把金额拉到 400 亿,比之前任何一笔都大。
比较骚的是,触发条件没有公开。Anthropic 要达到什么营收目标才能拿到剩下的 300 亿?不知道。如果达不到,Google 是撤回承诺还是重新谈判?也不知道。这种模糊性让"400 亿"这个数字更像一个上限,而不是实际会发生的数字。
但 Google 的算盘很清楚:Gemini 还在追 Claude 和 GPT,与其只靠自研,不如同时绑定最强的对手。这一笔很贵,但很 Google。
Anthropic 发了 Sonnet 5,知识工作跑分反超 Opus 4.8
Anthropic 今天正式发布 Claude Sonnet 5,官方说这是目前最会自主干活的 Sonnet 版本——它能自己定计划、调用浏览器和终端这类工具。
跑分上有个有意思的反转:在真实世界知识工作测试 GDPval-AA v2 上,Sonnet 5 拿了 1618 分,比更贵的 Opus 4.8 还高出 3 分。但在智能体编程测试 SWE-bench Pro 上,Sonnet 5 还是比 Opus 4.8 差一截。这说明 Anthropic 在有意做产品分层——Sonnet 负责性价比和自主执行,Opus 守住编程和安全的最高端。
价格方面,即日起到 2026 年 8 月 31 日有尝鲜折扣:输入 $2/百万 token,输出 $10/百万 token。之后恢复原价:输入 $3/百万,输出 $15/百万。安全评估显示不良行为率更低,幻觉和谄媚减少,但网络安全能力弱于 Opus 4.8。
有意思的是,Anthropic 同时发了 Claude Science 科研工作台,把文献检索、数据分析、图表生成和论文编辑整合到一个会话里,内置 60 多个预配好的技能和连接器,覆盖基因组学、单细胞、蛋白质组学等领域。每次输出都附带可审计的代码、运行环境和聊天记录。但正文没提测试期价格和正式上线时间。
同一天,Claude Desktop 的 Linux 公测版也上线了,目前只支持 Ubuntu 和 Debian。付费用户现在可以在桌面端用 Claude Code、Claude Cowork 和聊天功能,不用再局限于浏览器和终端。
美国撤了对 Anthropic 的出口管制,但别急着欢呼
美国政府撤回了 6 月 12 日刚加上的出口许可要求,Anthropic 宣布 7 月 1 日起恢复 Mythos 和 Fable 的公开访问。
之前因为合规成本太高、没法大规模执行,Anthropic 直接切断了所有公开入口。商务部长 Lutnick 说 Anthropic 同意主动检测安全风险、跟政府合作制定发布标准并上报恶意活动。
但说实话,这些承诺 Anthropic 之前自己早就公开说过会做。政府到底拿到了什么新东西?正文没提。监管战不是要不要打的问题,是已经在打。
Claude Code 被扒出用隐写术标记中国用户
这条我会先打个折——社区逆向工程发现,Claude Code 会读取你的系统时区(比如 Asia/Shanghai)和 ANTHROPIC_BASE_URL 环境变量,然后跟一份加密的 147 个中国公司域名列表做比对,名单里包括美团、字节跳动、月之暗面等。
一旦命中,它会在发给服务器的系统提示词里动手脚——把日期里的单引号换成别的 Unicode 字符,连字符改成斜杠,用隐写术标记用户身份。
如果这是真的,信任直接打折。但注意这只是社区逆向工程的结果,Anthropic 还没回应。隐写标记的目的也不清楚——是为了合规审查、防止 API 滥用,还是有其他考虑?在官方确认前,先别急着下结论。
美团开源 LongCat-2.0,万亿参数模型用国产卡训的
美团今天开源了 LongCat-2.0,总参数 1.6 万亿,每次推理只激活约 480 亿参数,原生支持 100 万 token 上下文。
最值得看的是训练基础设施:全程在五万张国产 GPU 集群上训练和跑推理。架构上用了稀疏注意力、零计算专家、ScMoE 以及把 Agent、推理、交互三组专家揉在一起的 MOPD 融合方案。代码评测 SWE-bench Pro 拿了 59.5 分。
但有两个关键信息没公布:训练成本是多少?具体用了什么芯片型号?五万张国产卡听起来很猛,但如果不知道是什么卡、花了多少钱,这个"国产替代"的故事就先别太激动。
Meta 让外包假装未成年去测别家模型的安全底线
Meta 通过外包公司 Covalen 搞了个内部项目叫 "Cannes",至少持续到 2026 年 4 月。承包商注册了生日填成未成年的假账号,向 ChatGPT、Gemini 和 Character.AI 发送涉及自残、进食障碍、毒品等敏感话题的提示词,然后把机器人的回复抄进表格。
光 2025 年 8 月一轮测试就发了超过 4.5 万条提示,很多是从真实青少年对话里扒下来的。
Meta 说这是行业标准安全测试,没把数据用于训练自家模型。但被测试的公司不知情——Character.AI 表示违反其服务条款,OpenAI 已调查,Google 称未批准。
这就有点不对劲了。就算目的是安全测试,用假账号大规模探测竞品的安全机制,还不打招呼,怎么看都不像"行业标准"。Meta 也没说自己拿这些数据干了什么。
今日小信号
-
特斯拉 Cybercab 量产版在奥斯汀上路测试:无方向盘和踏板,34 台车配安全员但不接乘客。从 2024 年 10 月概念发布到实车上路只用了 20 个月,节奏很快。但注意这只是工程测试,验证硬件可靠性,离商业化还有距离。
-
黑石要在日本再砸 300 亿美元建 AI 数据中心:新增超 1GW 算力容量。黑石、阿波罗和博通这个月刚搞了个叫 AI XPV 的平台,目标 2028 年给 OpenAI、Anthropic 等提供超 20GW 算力。数字听着大,但缺少具体回报预期和客户签约情况。
-
Google DeepMind 发了两个新模型:Nano Banana 2 Lite 是给手机本地跑的轻量模型,文本到图像输出仅需 4 秒,每 1K 分辨率图像成本 $0.034;Gemini Omni Flash 能读文字、图片、音频还能用自然语言直接改内容,视频输出定价 $0.10/秒。
-
X(Twitter)推出 hosted X MCP:AI 智能体可通过 MCP 协议直接调用 X API 获取实时信息,个人优惠价每次调用 0.01 美元。有用户实测拉取近三天书签仅花 0.1 美元。
-
OpenAI 发了份 ChatGPT 全球用户画像:注册半年后,用户日均消息量涨 50%,尝试的任务种类翻倍。非洲和亚洲周活增长最快,非英语用户已过半,西语、葡语、阿语排前三。数据来自 0.1% 抽样,没给绝对用户数和付费转化率。