今天 AI 圈在拼开源、拼基建,也在拼谁能管住它
美团把 1.6 万亿参数的 LongCat-2.0 完全开源了,MIT 协议,跑分刚好压过 GPT-5.5 一点点。扎克伯格说要建一个千兆瓦级的 AI 集群,砸几千亿美元,但没给时间表。另一边,欧盟理事会绕过议会强推聊天扫描令,英国金融监管机构说 AI 军备竞赛太快,监管快跟不上了。先来看美团这一手。
美团 LongCat-2.0 完全开源,1.6T 参数压过 GPT-5.5 一点点
美团今天把 LongCat-2.0 整个开源了,MIT 协议,权重和推理代码都能直接用。这是个 1.6 万亿参数的 MoE 模型,每次推理只激活大约 480 亿参数,上下文窗口能塞进 100 万 token。
跑分上,SWE-bench Pro 拿了 59.5,刚好压过 GPT-5.5 的 58.6。
差距只有 0.9 分,别急着开香槟——这种级别的分差,换个测试集可能就反过来了。但 Terminal-Bench 2.1 拿了 **70.
8**,SWE-bench Multilingual 也有成绩,说明多语言和终端任务上确实下了功夫。
技术上有三个省资源的招:LongCat Sparse Attention 专门处理长文本,Zero-Compute Experts 会根据任务动态激活 33B 到 56B 参数,MOPD 按任务类型把请求路由到 Agent、Reasoning 或 Interaction 三组不同的专家。这套设计思路挺务实——不是一味堆参数,而是在怎么省着用上做文章。
美团这一手,更像是把内部已经跑通的东西拿出来,告诉大家"我们也有大模型,而且不藏着"。至于实际落地场景、API 定价、吞吐量这些,目前都没说。开源是好事,但开源之后有没有人用、能不能用起来,还得看社区反应。
扎克伯格画了张千兆瓦的大饼,但没给时间表
扎克伯格自己发帖说,Meta 正在建一个叫 Prometheus 的单一 AI 集群,功率超过 一千兆瓦,资本投入用他的原话是"数千亿美元"。他把自己的角色概括成三件事:把顶尖人才、钱和基础设施集中起来。
这个体量如果属实,比现在已知的任何公开项目都大一个数量级。但问题是,帖子里没有任何时间表、具体用什么芯片、能效比(PUE)这些关键信息。只有一句表态。
有意思的是,就在 5 月,Meta 刚裁了约 8000 人,又把 7000 人转岗到 AI 部门。扎克伯格自己在内部全员会上承认,AI 智能体的开发速度没达到高管预期,这次裁员不够"干净",新的 AI 架构也还没见到回报。他预计未来 3 到 6 个月能看到 AI 投资的成效。Meta 今年计划在 AI 基础设施上砸最多 1450 亿美元。
一边是千兆瓦集群的豪言,一边是内部承认进度没达标。这两条放在一起看,Prometheus 更像是一张远期支票——方向明确,但兑现时间未知。
NVIDIA Kyber NVL144 跳票到 2028,背靠背方案也砍了
SemiAnalysis 爆料,Jensen 在 GTC 上秀过的 Kyber NVL144 项目延期超过一年,现在要等到 2028 年。同时 NVL72x2 那种把两个机架背靠背拼起来的方案也被取消了,Rubin Ultra 的横向扩展能力会因此受限。
这是爆料线程的第一条,正文还没展开具体原因。我会先打个折——可能是设计问题,也可能是供应链卡壳,也可能是客户需求变了。但不管哪种,NVIDIA 的硬件路线图出现这种级别的延迟,对下游云厂商和 AI 公司的算力规划都会有连锁反应。
等后续细节出来再看。
欧盟理事会绕过议会强推聊天扫描令,技术可行性存疑
欧盟成员国把一份已经失效的 2022 年旧草案重新捡起来,打算在夏季休会前走快速通道强行通过。这个规定要求 WhatsApp、Signal 这类通讯软件扫描所有用户聊天内容,包括端到端加密的消息,用来查找儿童性虐待材料。
欧洲议会事先没接到通知,被打了个措手不及。草案将在夏季休会前以紧急程序提交议会表决,多数议员可能已离会,反对需要绝对多数,几乎无法阻止。
但文章没说明扫描是在用户手机上完成还是在服务器端进行,也没提具体技术方案。端到端加密的数学特性决定了,任何扫描都意味着在某个环节解密——要么在设备端(等于给每台手机装后门),要么在服务器端(等于破解加密协议)。两种方案的技术可行性和隐私代价都极高。
监管的焦虑是真实的,但这份草案更像是政治姿态,离技术落地还有巨大的鸿沟。
英国金融监管机构警告:AI 军备竞赛太快,监管快跟不上了
英国金融行为监管局(FCA)说,金融机构在交易、风控和客服上抢着部署 AI,已经形成一场"军备竞赛",监管机构必须拼命追赶。FCA 担心,如果 AI 用得又快又广,可能带来系统性风险——比如多个机构用同一套模型,一出错就连锁反应。
缺少具体案例或时间表,所以这点先别太激动。但监管的焦虑方向是对的:金融系统的特点是高度互联,一家机构的模型崩了可能拖累整个市场。2020 年 3 月美股熔断时,量化基金的模型集体踩踏就是一个先例——那时候还没大规模用大模型。
这条和欧盟的聊天扫描令放在一起看,能感觉到监管层面对 AI 的态度正在从"鼓励创新"转向"先看看风险"。
代码脏不脏不影响 AI 编程助手把活干成,但能省 token
SonarSource 的研究人员用 Claude Code 跑了 660 次实验,在 33 个任务里对比了"脏代码"和"干净代码"的仓库。结论挺反直觉:代码干不干净,不影响 agent 最终把任务做对的通过率。
但干净代码能让 agent 少用 7% 到 8% 的 token,重复打开同一个文件的次数也少了 34%。也就是说,代码整洁度不决定成败,但能实实在在省钱。
这个结论对实际开发有指导意义:如果你在用 AI 编程助手,重构代码的优先级可以往后排——先把功能跑通再说。但如果 token 开销是你的主要成本,保持代码整洁还是有回报的。
今日小信号
-
Simon Willison 花 149.25 美元让 Claude Fable 揪出一个会静默丢数据的 bug:在发布 sqlite-utils 4.0 稳定版前,他让模型做最终审查,结果发现 delete_where() 方法执行后从不提交事务,导致后续所有写入操作被静默回滚。修复全程用了 37 次提示、34 次提交,改了 30 个文件。这个案例的价值不在技术本身,而在于证明了 AI 能做"最后一道防线"——在人类已经觉得没问题的时候,再扫一遍。
-
Fly.io 把 AI 智能体的"大脑"和"手脚"拆开了:主循环跑在普通服务器上,每次要敲 shell 命令就扔进一个叫 Sprite 的一次性沙箱里,用完即毁。哪怕模型抽风执行了 rm -rf /,也只毁掉那个沙箱。思路简单但有效,适合已经在生产环境跑 agent 的团队参考。
-
达特茅斯统计课试点 AI 教材,期末成绩拉高了 0.71 到 1.30 个标准差:一个叫 Phosphor 的平台把 AI 批改的小测验嵌进阅读材料里,学生可以反复刷。结果 90.2% 的学生主动用了,而老师估计平时只有 10% 到 15% 的人会看教材。效果量不小,但得打个折:论文没报告 AI 批改和人工批改的一致性有多高,而且学生抱怨 AI 批改太严。
-
美国富人把孩子送进 AI 私校,学费几万美元,但教学效果没人验证过:Alpha 和 Forge Prep 这类学校每天让学生花两小时用 AI 学习软件,其余时间做项目。文章没给任何标准化考试成绩对比,等于这些孩子成了未经验证技术的付费测试员。
-
一位父亲为不会说话的自闭症儿子做了个沟通 App,意外找到产品-市场匹配:第一次带去言语治疗候诊室,所有妈妈和治疗师都看哭了。他决定即使再忙也要把这个 App 做出来。这条跟 AI 技术本身关系不大,但提醒我们:最好的产品往往来自最具体的痛苦。