FEATUREDHacker News 首页· rssEN15:39 · 07·22
一个 99 美元的 MUD 游戏,测出大模型当 NPC 时爱复读、会迷路,评分系统本身也不靠谱
CrucibleBench 把 13 个模型扔进一个文字 MUD 世界,让它们跟有记忆和信任值的 NPC 打交道,完成隐藏的社交任务。50 轮对话跑下来,总共花了 99.59 美元。最大的发现不是谁排第一,而是评分系统里一个负责评判对话质量的 LLM 组件,能让排行榜上的名次上下浮动 6 位。去掉这个不稳定的裁判后,GPT-5.4 从第 1 掉到第 5...
#CrucibleBench#OpenRouter#GPT-5.4
精选理由
精选 · 重要度 78 · 吸引力 + 知识量 + 共鸣
一句话点评
一个 99 美元的 MUD 测试,最大的发现不是模型排名,而是评分系统里一个裁判组件能让名次上下浮动 6 位。这点先别太激动,作者自己都说这只是概念验证。
锐评
这个测试把 13 个模型扔进一个文字 MUD 世界,让它们跟有记忆和信任值的 NPC 打交道,完成隐藏的社交任务。50 轮对话跑下来,总共花了 99.59 美元。
最值得看的结果不是谁排第一,而是评分系统本身的问题。他们发现一个负责评判对话质量的 LLM 组件,能让排行榜上的名次上下浮动 6 位。比如 GPT-5.4 在完整评分下排第 1,去掉这个不稳定的裁判后掉到第 5;Gemini 3.1 Pro 从第 3 掉到第 9。而这个裁判跟独立评判的一致性,在不同模型上从 21.7% 到 84.8% 不等,但汇总统计量 κ=0.04 完全看不出问题。作者的建议很实在:用 LLM 当裁判的测试,应该报告每个被评对象的裁判一致性,而不是只给一个汇总数字。
正文没披露这个裁判组件具体用的是哪个模型,也没说为什么一致性波动这么大。另外所有模型都有一个通病:14% 到 66% 的跑分会对着同一个 NPC 重复 8 次以上的对话指令,说明模型在社交场景里容易陷入循环。这个测试目前只是概念验证,不能当真用来衡量模型的社交能力或预测实际部署表现。
HKR 分解
hook ✓knowledge ✓resonance ✓