FEATUREDHacker News 首页· rssEN11:00 · 07·18
Fable 5 对战 GPT-5.6 Sol:/goal 命令到底有没有用?
作者拿一个未公开的 NP-hard 光纤网络优化问题,让 Claude Fable 5 和 GPT-5.6 Sol 各跑了三轮 30 分钟测试,对比普通模式和 /goal 模式。Fable 5 的普通模式平均得分 32,386,比 Sol 的 34,261 低了 1,875 分(分数越低越好),而且三次普通跑分只差了 319 分,稳得离谱。/goal ...
#Code#Reasoning#Agent#Anthropic
精选理由
精选 · 重要度 78 · 吸引力 + 知识量 + 共鸣
一句话点评
Fable 5 在 NP-hard 问题上稳得离谱,三次普通跑分只差 319 分;/goal 模式赢了多数局却拉低了平均分,别当默认开关用。
锐评
这篇博客最值得看的是 Fable 5 的稳定性,而不是 /goal 模式。作者拿一个未公开的光纤网络优化问题做测试,搜索空间下限高达 10^1223,属于典型的 NP-hard 问题。Fable 5 在普通模式下三次 30 分钟跑分只差了 319 分,平均得分 32,386,比 GPT-5.6 Sol 的 34,261 低了近两千分(分数越低越好)。这种一致性在模型评测里很少见,说明 Fable 5 在这个任务上不是靠运气蒙对的。
/goal 模式的表现反而让人犹豫。它在六次对比中赢了四次,但两个模型的平均分都被拉低了——Fable 5 差了 759 分,Sol 差了 868 分。作者解释了两家 /goal 的底层差异:Claude Code 用 Haiku 做纯文本评估器,Codex 则有持久化状态和生命周期工具。这意味着 /goal 不是简单的"再想想",它改变了搜索路径,有时找到更好的解,有时只是给一个烂方向更多时间发酵。
文章的限制也很明确:只测了一个问题、一种预算(30 分钟)、未公开数据集,所以结论不能直接推广。正文没披露这个问题的具体约束条件和最优解参考值,也没说明人类基准线到底是多少分。如果你关心的是模型在复杂优化任务上的原始推理能力,Fable 5 的表现值得关注;如果你在考虑把 /goal 当日常开关,这篇数据建议你先别急。
HKR 分解
hook ✓knowledge ✓resonance ✓