FEATUREDComputing Life · Share · 鸭哥调研· rssZH00:00 · 07·17
BackendForge 让 AI 编程评测从笔试变面试,同一份代码通过率直接腰斩
BackendForge 先给 56 个后端任务写了 7,250 项测试,再让 Agent 专门找这套题库漏了什么,最后补了 640 项。测试只多了 8.8%,但 GPT-5.5 全部通过的任务从 31 个掉到 16 个,Claude Opus 4.7 从 33 个掉到 10 个。代码没变,变的是评分方式:新题专挑权限、脏数据、连带影响这些第一版没覆盖...
#Code#BackendForge#GPT-5.5#Claude Opus 4.7
精选理由
精选 · 重要度 78 · 吸引力 + 知识量 + 共鸣
一句话点评
BackendForge 让评测从笔试变面试:题库只多了 8.8%,GPT-5.5 全过的任务却从 31 个掉到 16 个。代码没变,变的是题目专挑权限、脏数据和连带影响追问。但评测材料还没公开,这些数字先别急着往外搬。
锐评
这条新闻最值得看的是评测思路的转变,而不是具体分数。BackendForge 先写好 7,250 项测试,再让 Agent 围着参考服务找漏,补了 640 项新题。新题数量不多,但专挑第一版没覆盖的权限、脏数据和连带影响。同一批代码,GPT-5.5 全过的任务从 31 个掉到 16 个,Claude Opus 4.7 从 33 个掉到 10 个。这说明以前很多“全过”的成绩,可能只是题目没问到点上。
不过得打两个折。第一,论文说会公开材料,但截至发稿还没放出来,外界没法逐项检查那 640 项新题是否合理。第二,这套追问是按每个 task 的参考服务定制的,不同 task 补的题不一样,所以不能把“通过率腰斩”直接套到其他评测上。
真正可复用的思路是:以后做整套应用评测,可以在定稿前加一轮面试式追问,让 Agent 先对着参考服务找漏,人再检查新题有没有需求依据,最后冻结成统一题库。这样既保持公平比较,又不漏掉关键边界情况。
HKR 分解
hook ✓knowledge ✓resonance ✓