FEATUREDAI HOT 精选· aihot-apiZH11:56 · 06·26
Ornith-1.0 开源四个编程智能体模型,397B 版本自称打平 Claude Opus 4.8
Ornith-1.0 放出了四个尺寸的模型,从 9B 到 397B 都有,MIT 协议随便用。它们基于 gemma4 和 qwen3.5 做后训练,用的强化学习方法同时优化任务拆解和方案自我修正,相当于教模型先想清楚步骤再动手改代码。397B 在 SWE-Bench Verified 上拿了 82.4 分,Terminal-Bench 2.1 上 77...
#Agent#Code#Reasoning#Ornith-1.0
精选理由
精选 · 重要度 82 · 吸引力 + 知识量 + 共鸣
一句话点评
397B 模型在 SWE-Bench Verified 拿了 82.4 分,但推文说媲美 Claude Opus 4.8 却没给出对方分数,这点先别太激动。
锐评
Ornith-1.0 放出了四个尺寸的智能体编程模型,从 9B 到 397B 都有,MIT 协议随便用。它的训练思路是教模型先拆任务再改代码,同时用强化学习优化这两步,相当于让模型学会“想清楚再动手”。397B 在 SWE-Bench Verified 上拿了 82.4 分,Terminal-Bench 2.1 上 77.5 分,在开源模型里确实算高的。
但主推文说它“媲美甚至超越 Claude Opus 4.8”,正文却没给出 Opus 4.8 在同样基准上的具体分数。没有对照数字,这个说法只能先打个折。另外,35B MoE 和 31B Dense 两个中等尺寸的实际表现也没展开,不知道小模型在复杂任务上会不会掉链子。
还缺的是推理成本和延迟数据。397B 的 MoE 架构虽然激活参数可能少一些,但跑起来到底要多贵的卡、响应多快,正文没提。如果实际部署成本太高,MIT 开源的意义也会打折扣。
HKR 分解
hook ✓knowledge ✓resonance ✓