FEATUREDAI HOT 精选· aihot-apiZH16:32 · 07·17
Cursor 评估负责人说 Claude Fable 5 在他们最难的那 1% 编程题里拿了 72.9%
Cursor 的评估负责人 Nate Schmidt 在 Anthropic 博客里讲了他们怎么判断 Claude Fable 5 能打。核心数字是 CursorBench 上 72.9% 的得分,比上一代跳了一大截。这个测试不是刷通用榜,专挑那些连真人都头疼的长尾编程问题。不过正文没公布上一代的基线分、测试集大小和具体题目,所以 72.9% 只能当个...
#Code#Cursor#Anthropic#Claude Fable 5
精选理由
精选 · 重要度 82 · 吸引力 + 知识量 + 共鸣
一句话点评
Cursor 说 Claude Fable 5 在他们内部最难编程测试里拿了 72.9%,比上代跳了一大截。但没公布上代分数和测试集大小,这个数只能当方向看,别直接拿去跟其他模型比。
锐评
Cursor 的评估负责人亲自下场写博客,这事本身就值得看一眼——工具方直接告诉你他们怎么判断模型能不能打,比看通用跑分实在。他们用的 CursorBench 专挑那种连真人都头疼的长尾编程问题,不是刷题榜,所以 72.9% 这个数含金量比普通基准高。
但信息缺口也很明显。正文没公布上一代模型的基线分,也没说测试集到底有多少道题、具体长什么样。没有基线,这个“跳了一大截”就没办法量化——是 10 个点还是 30 个点,差别很大。另外,测试集如果太小,分数波动会很大;题目如果偏重某种语言或场景,结论也不通用。
我的判断是:这个数字说明 Claude Fable 5 在 Cursor 的真实工作流里确实变强了,方向可信。但如果你要拿它做采购决策,最好等 Cursor 公开更多细节,或者自己拿内部项目跑一遍。毕竟工具方测自己用的模型,天然有利益关系,数字会挑好看的放。
HKR 分解
hook ✓knowledge ✓resonance ✓