FEATUREDLatent Space· rssEN19:27 · 06·03
Axiom 用形式化验证做数学推理,Putnam 竞赛 12 题全解,Verina 基准 187/189
Axiom 这家成立七个月的初创公司,在 2025 年 Putnam 数学竞赛里解出了全部 12 道题,限时内得分 8/12,不限时则拿到满分 120 分,超过了已知的 DeepSeek 成绩(103/120)。CEO Carina Hong 说,他们的模型在 Verina ProofGen 基准上跑出了 187/189(约 99%),而 OpenAI...
#Reasoning#Code#Benchmarking#Axiom Math
精选理由
精选 · 重要度 80 · 吸引力 + 知识量 + 共鸣
一句话点评
Axiom 用形式化验证做数学推理,Putnam 满分 120 分,不限时全对,限时 8/12,比 DeepSeek 的 103 分高。但别急着下结论,正文没披露模型规模、训练成本和泛化能力,这些才是关键。
锐评
Axiom 的思路是把数学证明交给 Lean 这类形式化验证工具去检查对错,而不是靠统计概率猜答案。这相当于给模型装了个不会放水的判卷老师,训练时能拿到绝对准确的反馈。他们在 Verina ProofGen 上拿了 187/189,而 OpenAI o3 上次公开的成绩只有 4.9%,差距很大。但这里得打个折:o3 的成绩是旧数据,而且 Axiom 没说自己模型多大、跑一次推理要烧多少钱。
Putnam 竞赛不限时拿满分确实厉害,说明模型在给定足够算力后能把难题啃下来。限时 8/12 则暴露了速度短板,可能推理链太长或者搜索步骤太多。Carina Hong 反复提“让聪明叠加”,本质是用可验证的正确结果当积木,一层层往上盖,避免模型在错误基础上瞎发挥。这个想法不新,但做出实际成绩的团队不多。
现在还缺三块信息:一是模型在数学之外的迁移能力,二是训练用了多少合成数据、有没有数据污染,三是推理成本到底多高。如果跑一道题要烧几千美元,那离实用还远。另外,正文没提他们和 DeepSeek 的对比是否在同等时间预算下进行,这点先别太激动。
HKR 分解
hook ✓knowledge ✓resonance ✓