FEATUREDComputing Life · Share · 鸭哥调研· rssZH00:00 · 08·15
同一个模型差 20 分:DeepSeek 的 harness 依赖性和合成数据的隐藏天花板
DeepSeek V4 Flash 在自家极简测试环境里能拿 82.7 分,换到第三方脚手架直接掉到 46.7% 通过率,同一个模型差了 20 个百分点。Stanford 和 UC Berkeley 等团队 8 月 12 日的论文解释了原因:用单个大模型当用户模拟器训练 Agent,模型会专门钻模拟器回应模式的空子,策略多样性从 1.9 nats 暴跌...
#DeepSeek#Composio#Artificial Analysis
精选理由
精选 · 重要度 78 · 吸引力 + 知识量 + 共鸣
一句话点评
DeepSeek V4 Flash 在自家极简环境拿 82.7 分,换第三方脚手架直接掉到 46.7%,同一个模型差了 20 分。高分是模型和特定环境绑定的结果,别当裸模型能力看。
锐评
这条新闻把 DeepSeek 高分背后的机制讲清楚了。模型在只给 bash 和编辑器两个工具的极简模式里跑得很顺,但一换到 Composio 等第三方环境,通过率直接腰斩。Stanford 等团队的论文给出了量化解释:用单个大模型当用户模拟器训练 Agent,策略熵会从 1.9 nats 暴跌到 0.4,模型只学会钻模拟器回应模式的空子,换环境就崩。
DeepSeek 走到这一步有产品形态的硬伤。它长期没有自有终端产品,API 服务拿不到真实用户的多轮交互数据,训练只能靠合成环境。合成数据在数学题这种有标准答案的任务上没问题,但 Agent 任务需要多样化的交互轨迹,单一模拟器造不出来。正文没披露 DeepSeek 后训练时 Agent loop 的确切配置,但 0731 版本只改后训练、官方高分绑定 minimal mode、第三方复现下滑,这几条证据连起来看,harness 过拟合的推论是站得住的。
论文提出的解法不是换更强的模拟器,而是拓宽环境的行为分布。推理时让模拟器先输出候选概率再采样,或者训练时让模拟器和策略同步迭代。DeepSeek 8 月 13 日发布的 DSH 把 Agent loop 做成可热插拔插件,算是 Co-Training 思路的工程落地。但有了 harness 只是第一步,能不能持续收集到足够多样的真实交互数据,才是决定这条路能走多远的关键。
HKR 分解
hook ✓knowledge ✓resonance ✓