FEATUREDHacker News 首页· rssEN14:48 · 08·19
Ornith-1.5 让模型自己出题、搭脚手架、写答案,靠强化学习滚雪球式变强,三个尺寸在编程和智能体跑分上压过同级开源模型
Ornith-1.5 把上一代的自搭脚手架思路升级成完整的自改进闭环:模型自己生成新任务、搭好解题用的脚手架、产出多轮答案,再用强化学习从这些经验里提升自己。旗舰版 397B MoE 在 Terminal-Bench 2.1 上拿了 86.1 分,DeepSWE 上 56.0 分,跟 Claude Opus 4.8(85.0、59.0)基本打平,超过了...
#Reasoning#Code#Ornith#Claude Opus 4.8
精选理由
精选 · 重要度 82 · 吸引力 + 知识量 + 共鸣
一句话点评
Ornith-1.5 让模型自己出题、搭脚手架、写答案,再用强化学习闭环自我进化。9B 小模型能跑手机,跑分还超了 31B 的 Gemma 4,这点挺狠。
锐评
Ornith-1.5 把上一代“自己搭脚手架”的思路,升级成了一个完整的自我改进闭环:模型自己生成新任务、搭好解题用的脚手架、产出多轮答案,再用强化学习从这些经验里提升自己。这相当于让模型自己给自己出卷子、找解题套路、批改并进步,不再依赖人类预先喂好的固定题目。
旗舰版 397B MoE 在 Terminal-Bench 2.1 上拿了 86.1 分,DeepSWE 上 56.0 分,跟 Claude Opus 4.8(85.0、59.0)基本打平,超过了 GLM-5.2 和 DeepSeek-V4-Flash-0731。但最让我注意的是 35B MoE 版,它每次推理只激活 3B 参数,却在智能体编程跑分上大幅甩开了 Gemma 4-31B 和 Meta 的 Muse Glimmer-30B,这说明它的稀疏激活效率很高。9B 的密集模型更夸张,量化后能塞进手机,在 Terminal-Bench 2.1 上跑出 47.0 分,SWE-Bench Verified 上 70.6 分,直接干掉了不少体积大几倍的模型。
不过,这篇博客没披露训练用了多少算力、数据规模多大,也没说什么时候开源或开放 API。任务奖励由有效性、前沿难度和 novelty 三项相乘得出,其中难度目标是让模型成功率保持在 20% 左右,这个设定挺聪明,能持续把模型推向能力边界。但 novelty 具体怎么算的,正文也没细说。所以,这个自我进化闭环的实际落地成本和泛化能力,还得等更多信息才能判断。
HKR 分解
hook ✓knowledge ✓resonance ✓