FEATUREDHacker News 首页· rssEN00:06 · 08·28
斯坦福发布 Terminal-Bench-Science:让科学家出题考 AI,目前最强模型正确率仅 30%
斯坦福团队搞了个新基准 Terminal-Bench-Science 0.1,专门测 AI 能不能干真实的科研活儿。题目不是教科书习题,而是由一线科学家从自己研究里抽出来的工作流程,覆盖生命科学、物理、地球科学、数学和工程。第一版从 920 个提案里只筛出 70 个任务,淘汰率很高,因为既要科学上有意思,又得难住现在的模型,还得能客观打分。目前成绩最好...
#Benchmarking#Stanford University#Terminal-Bench#Claude Opus 5
精选理由
精选 · 重要度 78 · 吸引力 + 知识量 + 共鸣
一句话点评
斯坦福新基准用科学家自己出的题考 AI,最强模型 Claude Opus 5 只做对 30%,说明离真能帮上科研还差得远。
锐评
这个基准的出发点很实在:不让模型厂商自己出题考自己,而是让一线科学家从真实研究里抽任务来考 AI。第一版从 920 个提案里只筛出 70 个任务,淘汰率超过 92%,筛得狠是因为要求任务既要有科学价值,又得难住现有模型,还得能客观打分。目前成绩最好的是 Claude Opus 5,70 个任务里只解决了 30%,GPT-5.6 Sol 和 Claude Fable 5 分别只有 22.4% 和 21.4%。这些数字说明,哪怕是最强的模型,面对真实的科研工作流——比如数据分析、仿真、定理证明、信号处理——大部分还是搞不定。
值得留意的是,这个基准设计成持续更新的,科学家可以不断提交新任务,避免像很多老基准那样被模型刷爆后就没人用了。正文提到有 22 个国家 376 位贡献者参与,覆盖面不错,但没披露任务的具体难度分布和打分细节,也没说不同学科之间的成绩差异有多大。另外,30% 的解决率到底意味着模型卡在哪个环节——是理解任务意图、写代码、还是调试跑通——正文也没展开。这些缺口让人不好判断进步空间主要在工具能力还是推理能力上。
HKR 分解
hook ✓knowledge ✓resonance ✓