FEATUREDX · @Yuchenj_UW· x-apiMULTI16:52 · 04·07
GLM-5.1 在 SWE-Bench Pro 上跑分压过 GPT-5.4 和 Gemini 3.1 Pro,开源模型差距缩到半年
GLM-5.1 在 SWE-Bench Pro 编程基准上拿了 58.4 分,比 Opus 4.6 的 57.3、GPT-5.4 的 57.7 和 Gemini 3.1 Pro 的 54.2 都高。模型是 MIT 协议开源的,权重公开。发帖人说开源和闭源的差距现在大概只剩六个月。不过正文没交代各家模型是不是在完全一样的条件下跑的,也没提测试成本和复现细...
#Code#Benchmarking#Benchmark#Open source
精选理由
精选 · 重要度 75 · 吸引力 + 知识量 + 共鸣
一句话点评
GLM-5.1 在 SWE-Bench Pro 上跑分压过 GPT-5.4 和 Opus 4.6,但正文没交代各家测试条件是否一致,先别急着开香槟。
锐评
GLM-5.1 在 SWE-Bench Pro 上拿了 58.4 分,比 GPT-5.4 的 57.7 和 Opus 4.6 的 57.3 都高一点,而且是 MIT 协议开源的,权重直接给。发帖人说开源和闭源的差距现在大概只剩六个月,这个判断挺乐观,但得看前提成不成立。
正文没披露几个关键信息:各家模型是不是在完全一样的 prompt、环境和预算下跑的,测试有没有第三方独立复现,以及 GLM-5.1 在这个基准上赢的这零点几分到底能不能在真实项目里复现。SWE-Bench Pro 本身测的是修 bug 和改代码的能力,分数差这么小的时候,排名波动可能只是评测噪音。
另外,帖子没提推理成本和延迟。如果 GLM-5.1 是用更大的算力或更慢的速度换来的分数,那“开源追上闭源”这个说法就得打折。想看它到底值不值得切过去,还得等有人拿它跑一遍真实代码仓库,看看成功率、耗时和成本。
HKR 分解
hook ✓knowledge ✓resonance ✓