FEATUREDAI HOT 精选· aihot-apiZH00:00 · 06·23
NatureBench 实测:AI 编程智能体只在 17.8% 的顶刊任务上打赢了原论文的 SOTA
这篇论文搞了个叫 NatureBench 的基准测试,从 Nature 系列期刊已发表的论文里抽了 90 个跨学科任务,专门考 AI 编程智能体能不能复现甚至超越原论文的最优结果。测试时不让智能体上网查资料,结果最强的模型配置只在 17.8% 的任务上真正超过了原 SOTA(判定标准是提升幅度 g>0.1)。智能体赢的套路主要是把科学问题翻译成自己擅长...
#Benchmarking#NatureBench#NatureGym#FrontisAI
精选理由
精选 · 重要度 78 · 吸引力 + 知识量 + 共鸣
一句话点评
AI编程智能体在90个Nature系论文任务里只赢了17.8%,赢的套路是把科学问题硬拗成自己擅长的监督学习,不是真发明。
锐评
这篇论文给AI编程智能体设了个硬核考场:从Nature系列已发表论文里抽了90个跨学科任务,让它们在不联网查资料的前提下,复现甚至超越原论文的最优结果。最强的模型配置只在17.8%的任务上真正胜出,判定标准是提升幅度超过0.1。这个数字说明,现在的AI离“独立搞科研”还差得远。
智能体赢的路径很取巧,主要是把各种科学问题翻译成自己擅长的监督学习套路,而不是靠真正的科学洞察或方法创新。输的原因里,大头是选错了方法或算力不够,倒不是没读懂任务。这暴露了一个关键短板:模型在陌生领域缺乏判断“该用什么方法”的元能力。
不过,这个基准本身也有局限。90个任务样本量不算大,而且禁止联网搜索,相当于捆住AI一只手去和全副武装的原论文比。如果开放联网,结果可能会好看些,但那就测不出模型自身的推理和创新能力了。论文公开了代码和排行榜,后续可以盯着看各家模型在这个硬指标上能刷到多少分。
HKR 分解
hook ✓knowledge ✓resonance ✓