FEATUREDHacker News 首页· rssEN01:05 · 09·02
Simon Willison 用 Claude Fable 5.1 跑了五档推理强度的鹈鹕画画测试,最高档花了 3.3 美元画了 14 分钟
Simon Willison 拿他经典的“画一只骑自行车的鹈鹕”提示词,把 Claude Fable 5.1 的五档推理强度全测了一遍。低和中两档几乎没区别,都没显示推理过程,23 秒左右出图,成本约 10 美分。开到 xhigh 档,模型花了 7 分 51 秒、烧了 1.83 美元,细节明显变多。最高档 max 跑了 13 分 54 秒,成本 3.3...
#Code#Reasoning#Simon Willison#Anthropic
精选理由
精选 · 重要度 78 · 吸引力 + 知识量 + 共鸣
一句话点评
Simon 用画鹈鹕的老梗测了 Claude Fable 5.1 的五档推理强度,低中档几乎没推理,xhigh 和 max 档烧钱烧时间但细节确实上来了。
锐评
Simon Willison 这次测试很直观:同一个“画骑自行车的鹈鹕”提示词,Claude Fable 5.1 在低和中两档推理下表现几乎一样,都没显示推理过程,23 秒左右出图,成本约 10 美分。开到 xhigh 档,模型花了 7 分 51 秒、烧了 1.83 美元,细节明显变多;最高档 max 跑了 13 分 54 秒,成本 3.3 美元,是他见过 Anthropic 画得最好的鹈鹕,但他仍觉得不如 Gemini 3.7 Flash 有灵气。
这个对比说明,Fable 5.1 的推理强度调节对简单创意任务存在一个“阈值”:低中档几乎不思考,高档才开始认真琢磨。但即便烧到 max,Simon 也没觉得效果有质的飞跃,反而暴露了高推理档位成本高、延迟大的代价。
另外,Anthropic 官方重点宣传的科学基准 Terminal-Bench-Science 0.1 得分从 Fable 5 的 24.7% 跳到 52.6%,涨幅很大,但这是全新基准,缺乏历史对照和社区验证,实际意义还得看后续第三方评测。正文没披露其他常规编码或推理基准的具体提升幅度,只说“略有改善”,这点信息缺口让整体能力判断打了折扣。
HKR 分解
hook ✓knowledge ✓resonance ✓