ax@ax-radar:~/daily/2026-08-24 $ cat newsletter/daily/2026-08-24.md
33 srcsignal 72%cycle 04:32
AX 的 AI 日报 · 2026-08-24基建铺路日

今天 AI 圈在拼基建,不是模型

今天 AI 圈最有意思的不在某个模型又能写代码了,是几张底牌同时翻动:Meta 把 RDMA 协议重写了一遍,NVIDIA 用新系统跑出每瓦 30 倍的智能体效率,OpenAI 把 GPT-5.6 全家桶静悄悄接进 AWS 编程助手。先来看 Meta 这一手——它不是在优化网络,是在给百万 GPU 集群重新铺路。

Meta 把 RDMA 协议重写了一遍,已经在几十万张 GPU 上跑通了

这条我先说结论:Meta 今天开源的不是一个优化,是一个新协议。MetaRoCE,一套为百万 GPU 级以太网从头设计的 RDMA 传输协议,包含规范、参考实现和合规测试套件,全部通过 OCP 公开。

传统 RoCE 有个老毛病:它假设交换机保序、不丢包。这个假设在小规模集群里勉强成立,但到了几十万张 GPU 的规模,交换机一拥堵、一丢包,整个训练任务就得停下来等重传。Meta 的做法是把这些假设全扔掉——乱序到达、多路径喷洒、拥塞控制,全部交给网卡处理。每个数据包自带目标地址,数据落地直接写进内存,没有重排缓冲区,也不会出现队头阻塞。

说人话就是:以前是交换机当交警,车多了就堵;现在是每辆车自己知道怎么走,交警可以下班了。

Meta 已经在跨区域的数十万 GPU 集群上验证过这套协议。这个数字本身比协议设计更有说服力——不是实验室里的白板方案,是已经在生产环境跑通的东西。而且现有 RDMA Verbs API 和软件栈不用改,直接就能用。

这一手很 Meta。它不是在跟 NVIDIA 拼芯片,是在给整个 AI 训练的基础设施换底盘。

NVIDIA 说新系统每瓦能干 H100 30 倍的活,但我会先打个折

NVIDIA 官方博客放出一组内部测试数据:用 Llama 3.3 70B 模型跑智能体工作流,Vera Rubin NVL72 整机柜系统每瓦完成的工作量是 H100 的 30 倍。每百万 token 成本降到原来的 1/35

这个数字看着很猛,但有几个地方得先打折。第一,这是峰值数字,NVIDIA 没公布延迟数据和完整的测试配置。第二,智能体工作流跟传统推理不太一样——模型要进业务流程干活,调用模式更复杂,峰值效率能不能在日常负载里复现,现在还不知道。第三,新系统定在 2026 年下半年上市,现在看到的都是内部测试。

不过方向是对的。NVIDIA 这次把 Vera Rubin 的定位说得很清楚:主打推理和智能体场景。同一天他们还宣布了 Groq 3 LPX 全面投产,以及 NVLink Fusion 把定制 XPU 接入 NVLink 扩展域,端到端延迟比基于现成以太网的方案低 3 倍、数据包速率高 10 倍

这几张牌一起打,NVIDIA 想说的是:智能体时代,瓶颈不在模型,在推理效率和互联带宽。

OpenAI 把 GPT-5.6 静悄悄接进 AWS 编程助手,成本降了 82%

OpenAI 把 GPT-5.6 系列的 Sol、Terra、Luna 三个模型都接进了 AWS 的编程智能体 Kiro。Kiro 的工作方式是先把你的想法拆成需求、设计和具体任务,再让模型去规划、写代码、审查和测试。

官方说在 Terminal-Bench 2.1 这个测试集上,GPT-5.6 Terra 完成任务的同时,成本比之前低了大约 82%。这个数字同样得打折看——OpenAI 没公布具体单价和延迟,只说"成本降低",但没说基准是什么、对比的是哪个模型。

有意思的是发布方式。GPT-5.6 没有单独开一场发布会,也没有大张旗鼓地宣传,而是通过 Kiro 这个产品静悄悄上线。这跟 GPT-5 发布时的阵仗完全不一样。

我的判断是:OpenAI 现在更在意把模型塞进具体产品里证明价值,而不是在 benchmark 上刷分。GPT-5.6 在 Kiro 里的表现,比任何跑分都更能说服企业客户买单。

Steve Yegge 每月烧 12 万美元养 AI 智能体,最强模型每天还是出岔子

这条挺有意思。Steve Yegge 自己掏钱养了 50 到 60 个 AI 智能体帮他做游戏,用的都是目前最强的 Claude Fable 模型,折算下来每月 token 开销相当于 12.2 万美元

但他发现,即便用上最好的模型,这些智能体每天还是会至少出一个大岔子。比如上周有个智能体没打招呼就搞了个更新,把所有人的东西都搞崩了。

Yegge 的核心观点是:现在行业里流行的沙盒和护栏不够用。他提出用"法律式围栏"替代沙盒——不是把智能体关在笼子里,而是像法律一样,规定什么能做什么不能做,越界了有后果。

这个比喻挺形象,但文章没给出具体技术实现。"法律式围栏"怎么落地、怎么执行、怎么处理边界情况,现在还是概念阶段。

不过 Yegge 的实战经验比大多数理论文章值钱。12 万美元一个月的 token 账单、每天至少一个严重岔子——这些数字比任何白皮书都更能说明智能体现在的真实水平。

OpenAI 桌面端负责人把自己的邮箱和手机全交给 AI,你敢吗?

Andrew Ambrosino,OpenAI 桌面端负责人,为了测试把自己的邮箱、Slack、手机、Notion 和 Figma 全交给了 AI 智能体。他承认模型可能会不小心从私信里抓取敏感信息并泄露出去,但他愿意为工作承担这个代价。

TechCrunch 这篇特写核心在讨论一个信任问题:普通用户会不会愿意给模型这么大的控制权?

OpenAI 内部 6 月有 98% 员工使用 Codex,但组织订阅者仅 17%、个人订阅者不足 1%。这个落差很说明问题——内部员工愿意用,跟外部用户愿意付费、愿意交出控制权,是两码事。

Ambrosino 拿自己当小白鼠挺有说服力,但普通用户和 OpenAI 负责人的风险承受力差太远。他丢的是工作文件,普通用户丢的可能是私人聊天记录、银行信息。这点先别太激动。

丰田北美用 AI 智能体把交付周期从 6 个月压到 4 天

丰田北美借助 Deep AgentsLangSmith 运行了 50 多个生产环境 AI 智能体,将交付周期从 6 个月缩短至 4 天

这个数字很具体,而且 LangChain 的博客文章展示了他们如何通过 LangSmith 追踪 AI 投资回报率。不是"我们觉得 AI 有用",是"我们算出了 AI 帮我们省了多少时间和钱"。

对正在考虑把智能体塞进业务流程的企业来说,丰田这个案例比任何 benchmark 都有参考价值。6 个月到 4 天,这个压缩比意味着不是优化了某个环节,是整条流程被重写了。

今日小信号

  • Mistral 与 HUMAIN 达成数亿欧元合作,聚焦沙特及中东主权 AI。双方将开发本地化模型,初期重点包括网络安全和语音,计划开发在阿拉伯语上表现强劲的前沿模型。主权 AI 这个赛道,Mistral 选了一条跟 OpenAI 和 Anthropic 都不太一样的路。

  • Meta 发布 MTIA 300 训练芯片,芯片封装内集成 12 个 800 Gbps RDMA NIC,提供 1.2 TB/s 总 I/O 带宽。大规模 GEMM 与集合通信并发时计算吞吐损耗低于 0.5%。Meta 在自研芯片上越走越深。

  • AI 智能体技能文件里非英语占比一个季度从 13% 涨到 16.3%。Plicara 扫了 187 万份智能体技能文件,中文技能占 6.2%,差不多是 GitHub 文档里中文占比的两倍。欧洲语言翻了一倍多,日语和韩语反而下滑。智能体的使用正在从英语圈向外扩散。

  • JetBrains 研究发现越依赖 AI 的学生越容易跳过规划,产生"我懂了"的错觉。表现最好的反而是那些大幅限制或无视 AI 建议的人。Lars Faye 把这种现象叫"倒置学习"——LLM 对老手是加速器,对新手却是成长阻断器。

  • Kern:一个 1.52MB 的二进制文件就能跑容器,不用后台进程,3.5 毫秒启动,支持无 root 运行。项目明确把目标场景定在运行不信任代码和 AI 生成的代码上。仓库刚公开,星标还很少,没提任何生产环境测试,现在只能当实验品看。

更多

频道

后台