FEATUREDHacker News 首页· rssEN22:14 · 08·22
Prime Intellect 让 18 个前沿模型比赛自动优化 NanoGPT,Fable 5 把验证损失压到 2,726,追平了人类最优记录 81.7...
Prime Intellect 搞了一场“极速挑战”,把 18 个前沿模型分别配上编程助手,让它们自己动手改 NanoGPT 的训练脚本,目标是尽可能降低验证损失。Fable 5 搭配 Claude Code 跑出了 2,726 的最好成绩,把人类基线到最优记录之间的差距补上了 81.7%。第二名 Opus 5 和第三名 Kimi K3 分别补上了 5...
#Code#Agent#Prime Intellect#Fable 5
精选理由
精选 · 重要度 78 · 吸引力 + 知识量 + 共鸣
一句话点评
Fable 5 在改 NanoGPT 脚本的挑战里拿了第一,但别急着说它最强——这比赛只测“自己改代码压损失”这一招,而且正文没写它具体改了啥。
锐评
Prime Intellect 让 18 个模型自己动手改 NanoGPT 训练脚本,比谁把验证损失压得最低。Fable 5 搭配 Claude Code 跑出 2,726,把人类基线和最优记录之间的差距补上了 81.7%,第二名 Opus 5 只补了 53.6%,差距拉得挺开。DeepSeek V4 Pro 排第 13,只补了 12.3%,表现意外地弱。
数字看着热闹,但得打个折。这测试只考一件事:模型能不能在已知代码上做长时间自主优化。Fable 5 跑了 8.7 天,烧了 8 亿 token,成本不低。正文没披露各模型具体用了什么优化策略,也不知道跑挂的那些是卡在哪一步。所以这个排名只能说明谁更稳、更敢试,不能直接等于谁的编程能力更强。
还缺一个关键信息:这些优化出来的脚本,换到别的任务上还能不能打?如果只是针对这一个脚本调参,那实际价值就有限了。
HKR 分解
hook ✓knowledge ✓resonance ✓