FEATUREDHugging Face 博客· rssEN00:00 · 08·13
Hugging Face 用 1200 人加编程智能体复现了 2200 篇 ICML 论文,发现审稿人没空看的证明,复现时真查出了问题
Hugging Face 搞了一场 19 天的黑客松,1200 多人带着 Claude Code、Codex 这类编程智能体,把 ICML 2026 接收的论文挑了 2226 篇来复现,覆盖了大会近三分之一。他们让智能体读论文、写代码、跑实验,然后汇报结果。一篇拿了 spotlight 的论文,审稿人自己承认没仔细检查证明,结果在这次复现里被抓住了真实...
#Benchmarking#Hugging Face#ICML 2026#Claude Code
精选理由
精选 · 重要度 82 · 吸引力 + 知识量 + 共鸣
一句话点评
Hugging Face 用编程智能体复现了 ICML 2026 近三分之一的论文,发现审稿人没查的证明被智能体揪出了问题。
锐评
Hugging Face 搞了一场 19 天的黑客松,1200 多人带着 Claude Code 这类编程智能体,把 ICML 2026 接收的论文挑了 2226 篇来复现,覆盖了大会近三分之一。他们让智能体读论文、写代码、跑实验,然后汇报结果。一篇拿了 spotlight 的论文,审稿人自己承认没仔细检查证明,结果在这次复现里被抓住了真实问题。
这个动作直接戳中了一个现实:顶会投稿量两年翻倍到 2.3 万篇,审稿人根本审不过来。智能体复现不是要替代人,而是暴露了现有评审流程的缺口——很多论文的验证工作其实没人做。
不过,正文没披露这 2226 篇里到底有多少篇复现失败、多少篇结果对不上。也没说智能体跑实验花了多少算力、成本多高。如果只是挑了几个典型案例,那说服力要打个折。另外,智能体自己写代码跑实验,会不会引入新的错误,这点也没展开。
HKR 分解
hook ✓knowledge ✓resonance ✓