FEATUREDComputing Life · Share · 鸭哥调研· rssZH00:00 · 05·28
SWE-Bench Pro 测不出模型差距了,有人重做了一把尺子,分差直接拉到 62 个百分点
SWE-Bench Pro 的排行榜上,GPT-5.5 和 Claude Opus 4.7 都挤在 82 分附近,看起来差不多。但 Datacurve 团队新发布的 DeepSWE 基准,让同一批模型跑出了 62 个百分点的差距:GPT-5.5 拿了 70%,Claude Opus 4.7 是 54%,DeepSeek V4 Pro 只有 8%。差距拉...
#Code#Benchmarking#DeepSWE#SWE-Bench Pro
精选理由
精选 · 重要度 80 · 吸引力 + 知识量 + 共鸣
一句话点评
SWE-Bench Pro 的尺子钝了,DeepSWE 这把新尺子把 GPT 和 Claude 的差距从 0.6 分拉到了 16 分,但样本量只有 113 个任务,先别急着拿它当新排名。
锐评
这条新闻值得看,因为它解释了一个很多人都有但说不清的体感:排行榜上 GPT 和 Claude 差不多,用起来差距明显。Datacurve 团队发现旧基准 SWE-Bench Pro 有两个硬伤。一是题目答案早就在公开代码库里,模型可能背过答案了,OpenAI 自己都证实过这事。二是评分方式太死板,只要你的代码结构和标准答案长得不一样,哪怕功能完全正确也判错,误判率高达 24%。
DeepSWE 的改进很直接:题目全部人工新写,暂时防住了泄漏;评分只看最终效果,不管你中间怎么实现,误判率压到了 1.1%。结果同一批模型跑出了 62 个百分点的差距,GPT-5.5 拿了 70%,DeepSeek V4 Pro 只有 8%。这个区分度更接近日常使用体感。
但别急着把它当圣经。总共才 113 道题,样本量太小,分数波动会很大。而且题目已经公开了,下一代模型训练时大概率会吃进去,防泄漏效果是一次性的。另外所有模型都被迫用同一套工具接口,这对习惯不同工具的模型可能不公平。正文没披露测试跑了多少轮,也没说置信区间,这些数字的稳定性还得再观察。
HKR 分解
hook ✓knowledge ✓resonance ✓