FEATUREDComputing Life · Share · 鸭哥调研· rssZH00:00 · 08·12
OpenAI 的数学证明跑通了 Lean 检查,5 天后论文却偷偷加了 4 页
OpenAI 在 8 月 1 日发了 10 组数学成果,附带的 Lean 4 代码全部编译通过,8666 个构建任务没报错。但 5 天后,论文从 249 页涨到 253 页,作者补了一个极限情况下的推导漏洞,代码本身没改。这说明机器检查通过只代表语法和逻辑规则没毛病,不代表人类看懂了,也不代表代码真的对准了原始难题。Terence Tao 顺势提了个新...
#OpenAI#Terence Tao#Andreas Thom#Benchmark
精选理由
精选 · 重要度 78 · 吸引力 + 知识量 + 共鸣
一句话点评
OpenAI的数学证明代码全跑通了,但5天后论文还是补了4页。机器说“对”不等于人看懂了,这条新闻把“做完”拆成了五级台阶,值得点开看。
锐评
这条新闻讲了一个很具体的信号:OpenAI用Lean 4生成的十组数学证明,8666个构建任务一次编译通过,没报错。但五天后,论文从249页涨到253页,作者手动补了一个极限情况下的推导漏洞,代码本身没改。这说明机器检查通过只代表语法和逻辑规则没毛病,不代表人类看懂了,也不代表代码真的对准了原始难题。
文章把“做完”拆成了五级:候选生成、规则检查、意图对齐、同行理解、共同体吸收。目前十项成果里,只有一项关于非sofic群的证明走到了第五级,被后续学者直接复用;量子平行重复那项还卡在第二和第三级之间,专家坦言没消化关键步骤。Terence Tao顺势提了个新规矩:优先权不该给最早扔出代码的人,而该给最先交齐论文、解释和形式证书整套材料的团队。
正文没披露那4页补丁具体改动了哪个定理的哪个边界条件,也没给出其他五项成果为何无人审阅的细节。对AI从业者来说,这条新闻最大的提醒是:别把Agent返回的success=true当终点,测试通过和业务对齐是两码事。
HKR 分解
hook ✓knowledge ✓resonance ✓