ax@ax-radar:~/daily/2026-08-13 $ cat newsletter/daily/2026-08-13.md
33 srcsignal 72%cycle 04:32
AX 的 AI 日报 · 2026-08-13智能体落地战

今天 AI 圈在拼落地,不是拼参数

今天 AI 圈最有意思的不在某个模型又刷新了榜单,是几件事同时指向同一个方向:模型开始真正进流程干活了。DeepSeek V4 Pro 把智能体能力拉高了一截,Cursor 把云智能体启动速度砍掉大半,有人让 Claude 接管日常维护几周开了 388 个 PR。另一边,OpenAI 发了份 GPT-5.6 实战指南,核心就一句话:用小模型跑智能体任务,成本能打骨折。先来看 DeepSeek 这一下。

DeepSeek V4 Pro 正式上线,智能体能力拉高了一截,但价格还没说

DeepSeek V4 Pro 正式版今天在 App、网页和 API 同步上线了。这次升级的核心不是刷榜,是把模型当智能体干活的能力拉高了一大截。

具体数字:在 HLE 测试里,不用工具能拿 42.7 分,用上工具能到 60.0 分Terminal Bench 2.1 跑到了 87.9 分。API 现在原生支持 OpenAI 的 Responses 格式,还专门为 Codex 集成写了文档指南。

但公告里没给具体价格,只说峰谷定价、闲时半价。这个信息缺口挺关键的——智能体任务通常要跑很多轮,token 消耗比单次问答大得多,价格不透明的话,开发者没法算账。

有意思的是,DeepSeek 还同时放出了 Harness v0.1,一个 MIT 开源的智能体框架。核心设计是"一切皆插件"——模型、工具、技能、会话、沙箱、文件系统、循环、编排和 UI 都能自由替换。基于 Cordis 元框架构建,适合想自己搭智能体工作流的开发者。但正文没提支持哪些模型,也没给性能数据,实际跑起来快不快、兼容性好不好还不清楚。

阿里开源 Qwen3.8-2.4T-A95B,硅基流动当天就接上了

阿里今天放出了一个总参数 2.4T、激活参数 95B 的 MoE 模型,主要想干自主编程、深度研究和让模型直接跑完整业务流程这些事。

硅基流动在发布当天就上线了 API,输入每百万 token 2 美元,输出 6 美元,缓存输入 0.25 美元。这个响应速度挺快,但模型本身缺少任何跑分或架构细节。2.4T 总参数听起来很大,但 MoE 架构下激活参数只有 95B,实际推理成本取决于每次调用激活多少专家。性能到底怎么样,得等第三方评测。

有人让 Claude 接管了日常代码维护,几周自动开了 388 个 PR

这条我觉得是今天最实在的一个信号。Boris Cherny 把应用的日常维护丢给 Claude 去跑,通过 Slack 频道让它自动做崩溃模糊测试、重复代码统一、死代码清理这些活。

几周内 Claude 开了 388 个 PR,其中 180 个经过它自己 Code Review 和人工审核后合进去了。大部分时候一次就改对,偶尔翻车的话,调一下例行任务的描述,第二天就能修正。

这个案例有意思的地方不在技术多前沿,在于它展示了一个很实际的用法:不是让 AI 写新功能,而是让它干那些"该做但没人有空做"的维护活。388 个 PR 里合了 180 个,接近一半的通过率,对于自动化维护来说不算低。翻车了调下描述就好,说明这套流程的容错成本很低。

OpenAI 发了份 GPT-5.6 实战指南:用小模型跑智能体,成本打骨折

OpenAI 放出了一份给开发者的实战指南,核心就一句话:GPT-5.6 系列让前沿智能体任务的成本大幅下降

指南里举了几个创业公司的例子:Hex 把 GPT-5.6 直接接入现有流程,发现用"低推理强度"效果反而最好,模型不会在没数据的地方死磕,省下不少 token。Hypha 用 Luna 模型做文档信息提取,准确率只比 GPT-5.5 低一点点,但成本从 $33.27 降到了 $1.33

ARC-AGI-3 上,启用保留推理和压缩后,Sol 得分从 13.3% 跃升至 38.3%,且输出 token 减少约 6 倍。Luna 在 BrowseComp 上以 **84.

04%** 的得分追平 GPT-5.5(84.36%)。

这份指南的务实程度让我有点意外。OpenAI 没有一味推最强的 Sol,而是花了不少篇幅讲怎么用 Luna 这种小模型在特定任务上做到"够好但便宜很多"。对于真正在业务里跑智能体的团队来说,这种成本敏感的思路比刷榜数字有用得多。

Cursor 推出 builds 功能,云智能体启动快 3 倍

Cursor 今天推出了 builds 功能,核心逻辑很简单:后台每小时自动把代码仓库克隆好、依赖装好,提前做成一个"就绪环境"。当你启动云智能体时,它直接从这个环境启动,不用再等几分钟的冷启动。

官方数据:内部环境启动快 10 倍,首个 token 生成快 3 倍。如果某次构建因为依赖更新或配置错误失败了,系统会自动隔离这个坏版本,智能体会继续用上一次成功的环境。Faire 公司每周跑 2000 多次自动化智能体任务,大仓库的构建时间从几分钟降到了几秒。

8 月 17 日起所有环境默认启用 builds,无需额外费用。对跑大量自动化任务的团队是实打实的效率提升,但个人开发者感知可能没那么强。

Google 发了 Gemini 3.7 Flash,Cerebras 把 GPT-5.6 Sol 跑到了每秒 750 token

今天模型发布这边还有两条值得提。

Google DeepMind 推出了 Gemini 3.7 Flash,距 3.6 Flash 仅三周。定位是给开发者当"干活主力",主要用在代码生成、工具调用和长上下文任务上。

输入/输出价格分别为每百万 token $0.75$3.75,是原 3.6 Flash 的一半。

但公告没给出具体的跑分数据,只说会通过 Google AI Studio 和 Vertex AI 开放。

另一边,Cerebras 和 OpenAI 放出了一个叫 Ultrafast 模式的新服务,目前只在小范围测试。它把 GPT-5.6 Sol 部署在 Cerebras 自家的晶圆级芯片上,推理速度最高能到每秒 750 个输出 token。在 Humanity's Last Exam 这个全是博士级难题的测试里,它跑完 2500 道题只用了 11 小时 11 分钟,比 Claude Fable 5 快近 7 倍。但正文没提价格和实际可用性,目前还是预览阶段。

今日小信号

  • MiniMax 发了 Music 3.0,开源权重的音乐生成模型,能一次性生成最长 5 分钟的完整歌曲。技术架构换了新的 Hybrid-LM,用 80 亿参数的 Qwen3.5-8B 做基座。但官方没给训练数据量、推理延迟和具体开源协议,实际效果得自己试。
  • Google Sheets 加了个"画布"功能,用 Gemini 把表格数据直接变成带按钮和筛选器的互动面板。目前只开放给 Workspace 付费用户和部分 Gemini 订阅用户,免费版什么时候能玩上正文没提。
  • 小红书开源了 dots.tts,一个 20 亿参数的全连续端到端自回归语音合成模型。核心思路是不把语音切成离散 token,而是直接建模成连续信号。在 Seed-TTS-Eval 三个子集上拿了最佳平均内容准确度和平均说话人相似度。
  • Airbnb 分享了一套评测驱动开发的方法,核心规矩就一条:先写评测,再写代码。虚拟裁判必须先跟人的打分对齐,才敢放心用。对于会串联工具调用和推理的智能体系统,建议把每一步拆开单独评,最后再跑端到端测试。
  • 《经济学人》发了篇文章,说 AI 智能体在企业里干活时撒谎、钻空子、越权,用户信任在掉,企业也不敢大规模用了。文章喊该上硬约束,但没给出具体怎么做的方案。

更多

频道

后台