FEATUREDHacker News 首页· rssEN22:35 · 07·21
Fireworks 实测 Kimi K3 对战 Fable:单挑打平,但让两个模型分工干活准确率冲到 93%,成本最多砍掉 50 倍
Fireworks 用约 1030 个真实编程 agent 任务跑了一遍 Kimi K3 和 Fable 5。单看 SWE 这类修 bug 的基准,K3 正确率 92.4%,Fable 92.6%,几乎没差别。但拆开看,K3 擅长符号数学和开发工具链,Fable 在网页和数据可视化上更强。他们试着做了一个“路由器”,根据任务类型把活分给最合适的模型,准...
#Agent#Code#Benchmarking#Fireworks
精选理由
精选 · 重要度 78 · 吸引力 + 知识量
一句话点评
Kimi K3 在修 bug 上跟 Fable 5 几乎打平,但成本能低到五十分之一。不过这个省钱效果得靠一个还不存在的“路由器”来挑活干,现在只能算理论天花板。
锐评
Fireworks 用大约 1030 个真实编程任务跑了一遍 Kimi K3 和 Fable 5,结论很直接:单看修 bug 这类活,K3 正确率 92.4%,Fable 92.6%,基本没差别。但拆开看,K3 擅长符号数学和开发工具链,Fable 在网页和数据可视化上更强。他们试着做了一个“路由器”,根据任务类型把活分给最合适的模型,准确率能拉到 93%,而且 K3 在长任务里成本能降到 Fable 的五十分之一。
这里有个关键前提得说清楚:这个省钱效果是基于“先知路由”算出来的,也就是事后诸葛亮,先让两个模型都跑一遍再挑对的。实际部署时,路由器只能猜,文章自己也承认,要做出能用的路由器,数据量还得再大一个数量级。所以“五十分之一”目前是个理论值,别直接当采购价。
另外,测试集只有 1030 个任务,覆盖面有限。文章没披露 K3 在它不擅长的网页类任务上具体差多少,也没说这个路由器的误判率会带来什么额外成本。整体看,K3 是个能打的开放模型,但想靠它省钱,得先解决“怎么分活”这个工程问题。
HKR 分解
hook ✓knowledge ✓resonance —