FEATUREDComputing Life · Share · 鸭哥调研· rssZH00:00 · 08·23
Skill 不是教材,是检查单:普林斯顿等五校论文拆解 Agent Skill 的真实机制
普林斯顿等五所高校的一篇新论文,扒开了 8,135 次 agent 干活记录,发现 skill 真正管用的地方是给步骤、给检查单,占生效案例的 65.7%;靠补知识起效的只有 4.5%。研究者用同一批操作记录做了三组对照:裸考 agent 成功率 59.1%,给原始流水账反而跌到 55.9%,提炼成一页操作指南则升到 61.9%。更坑的是,如果提炼时不...
#Agent#Reasoning#Princeton#UCSD
精选理由
精选 · 重要度 78 · 吸引力 + 知识量 + 共鸣
一句话点评
这篇论文用八千多条实验记录讲清了一件事:给AI写操作指南,重点不是教知识,而是给检查单。65.7%的生效案例靠步骤指引,补知识只占4.5%。更坑的是,没标成败的原始记录反而让成功率跌到比裸考还低。
锐评
这篇论文最核心的发现是反常识的:我们总以为给AI塞更多背景知识能变聪明,但数据说65.7%的skill生效是因为提供了清晰的步骤和检查单,真正补上知识盲区的只有4.5%。这就像给外科医生一本解剖学教材,不如给他一张手术检查单——前者他本来就有,后者才能防住高压下的步骤遗漏。
实验设计很干净。同一批操作记录,提炼成一页操作指南后成功率从59.1%升到61.9%,但直接喂原始流水账反而跌到55.9%,比什么都不给的裸考还差。原因在于原始记录里全是试错回溯和死胡同,agent读进去不仅稀释注意力,还容易把错误路径当规范。更值得警惕的是,如果提炼时隐去成败标签,全失败记录产出的指南质量甚至低于空白基线——这等于把失败经验固化成了系统性的误导。
skill库规模扩大的数据也很有意思。从5个扩到100个,精准命中率从29.6%崩到3.3%,但任务成功率反而从36.4%微升到39.3%。这说明agent用skill更像逛图书馆而不是做单选题,翻到相近的指南也能提取出可用的配置和步骤。真正要防的不是库变大,而是大量长相相似的干扰条目混进去造成语义混淆。
不过这篇论文的结论要打折用。评测场景局限在终端命令和工具调用,没涉及长周期网页交互或多agent协作;实验模型只覆盖Codex和Gemini CLI两种体系;人工归类分析只覆盖了约3%的运行记录;而且这是arXiv预印本,还没经过同行评审。另外正文没披露skill提炼过程的人工成本,也没说明不同任务类型下检查单式指引的失效边界在哪里。
HKR 分解
hook ✓knowledge ✓resonance ✓