FEATUREDr/LocalLLaMA· rssEN07:19 · 05·16
Qwen3.6-35B-A3B 和 9B 登上 Terminal-Bench 2.0 公开榜,小模型在硬核智能体测试里能跑分了
Qwen3.6 的两个新尺寸上了 Terminal-Bench 2.0 的公开排行榜。搭配 little-coder 这套脚手架(给模型加了一套在终端里干活的外壳),35B-A3B 版本跑出 24.6%(±3.2),压过了 Gemini 2.5 Pro 在 Gemini CLI 上的 19.6% 和 Qwen3-Coder-480B 在 Terminu...
#Agent#Code#Benchmarking#Qwen
精选理由
精选 · 重要度 73 · 吸引力 + 知识量 + 共鸣
一句话点评
Qwen3.6-35B-A3B 靠一套终端脚手架在 Terminal-Bench 2.0 上跑赢 Gemini 2.5 Pro,但 24.6% 的分数说明这任务对谁都不简单。
锐评
Qwen3.6 的两个新尺寸上了 Terminal-Bench 2.0 排行榜,搭配 little-coder 这套脚手架(给模型加了一层在终端里直接敲命令干活的外壳),35B-A3B 版本跑出 24.6%(±3.2),压过了 Gemini 2.5 Pro 在自家 Gemini CLI 上的 19.6% 和 Qwen3-Coder-480B 的 23.9%。9B 小模型也拿了 9.2%,虽然不高,但至少证明 10B 以下的本地模型在这种硬核任务上不是零分选手。
分数本身要打个折。24.6% 意味着大部分任务还是没搞定,而且 ±3.2 的波动不算小,说明稳定性有待验证。另外,正文没披露测试的具体任务分布和失败模式,也不知道 little-coder 这套脚手架本身对分数的贡献有多大——换一个外壳会不会结果差很多,这点还不清楚。
对本地部署的人来说,35B-A3B 这个尺寸能在消费级硬件上跑,还能在终端自动化这种实用场景里跟闭源大模型掰手腕,是个值得跟进的信号。但别急着下结论,等更多独立复现和不同脚手架下的对比出来再说。
HKR 分解
hook ✓knowledge ✓resonance ✓