FEATUREDHacker News 首页· rssEN02:01 · 06·23
VibeThinker-3B:一个30亿参数模型,在可验证推理上打平或超过DeepSeek V3.2等大模型
这篇技术报告放出了一个叫VibeThinker-3B的小模型,只有30亿参数,但在数学竞赛题(AIME26得分94.3,加长思考时间能到97.1)、编程题(LiveCodeBench v6的Pass@1是80.2)和没见过的LeetCode比赛(通过率96.1%)上,成绩直接对标甚至超过了DeepSeek V3.2、GLM-5和Gemini 3 Pro...
#Reasoning#Code#VibeThinker-3B#DeepSeek V3.2
精选理由
精选 · 重要度 82 · 吸引力 + 知识量 + 共鸣
一句话点评
一个30亿参数的小模型在数学和编程题上打平甚至超过千亿级大模型,但正文没披露训练用了多少数据和算力,这点先别太激动。
锐评
这篇论文放出了一个叫VibeThinker-3B的小模型,只有30亿参数,但在AIME26数学竞赛上拿了94.3分(加长思考时间能到97.1),LiveCodeBench v6编程测试Pass@1达到80.2,甚至在没见过的LeetCode新题上通过率96.1%。这些成绩直接对标DeepSeek V3.2、Gemini 3 Pro这些大几十倍甚至上百倍的模型。
训练方法用了三招:先按难度递进做监督微调(SFT),再用GRPO做多领域强化学习,最后用模型自己生成的数据做离线蒸馏。作者还提了一个假说,认为可验证的推理能力可以压缩进很小的参数核心里,但开放领域的知识还是需要大参数来覆盖。
不过正文没披露训练数据规模、总计算量和推理延迟。一个3B模型能跑出这个分,如果是真的挺省钱,但没这些数字就没法判断复现成本和实际部署体验。另外IFEval指令遵循得分93.4,说明推理能力拉上去之后,模型没变傻,这点算是个加分项。
HKR 分解
hook ✓knowledge ✓resonance ✓