FEATUREDAI HOT 精选· aihot-apiZH12:00 · 06·04
OpenRouter 让 11 款大模型打了一局 30 轮吃鸡,Grok 赢麻了,Claude 在交朋友
OpenRouter 花了 482 美元推理费,把 11 个模型扔进一个 2D 大逃杀游戏里打了 30 局。Grok 4.1 Fast 赢了 13 局,每赢一局成本只要 0.97 美元;而 Claude Sonnet 4.6 赢了 5 局,每局成本 26.78 美元,贵了 27 倍。最会杀敌的是 GPT 5.4,干掉了 38 个对手,但只赢了 2 局,...
#Agent#Reasoning#Benchmarking#OpenRouter
精选理由
精选 · 重要度 76 · 吸引力 + 知识量 + 共鸣
一句话点评
OpenRouter 让 11 个模型打 30 局大逃杀,Grok 4.1 Fast 赢了 13 局,每局成本不到 1 美元;Claude Sonnet 4.6 赢了 5 局但贵了 27 倍。别急着按胜率选模型,Claude 输是因为总想跟对手组队。
锐评
OpenRouter 的 Jacky Liang 花了 482 美元推理费,把 11 个模型扔进一个 2D 大逃杀游戏里跑了 30 局。结果挺反直觉:赢最多的是 Grok 4.1 Fast,拿下 13 局,每局成本只要 0.97 美元。Claude Sonnet 4.6 赢了 5 局,但每局成本高达 26.78 美元,贵了 27 倍。最会杀敌的是 GPT 5.4,干掉了 38 个对手,却只赢了 2 局。
这个测试有意思的地方在于它测的不是刷榜能力,而是实时决策。Grok 赢在快和狠,Claude 输在太“友善”——它反复在游戏里喊话要组队,还主动暴露位置。正文没披露具体延迟数据,也没说模型调用有没有做思维链或工具使用限制,所以不能直接当成生产环境选型依据。
还缺什么:30 局样本偏少,运气成分不小;只测了一款游戏,换种规则结论可能完全不同。另外,正文没提各模型的推理延迟分布,这对实时场景比胜率更关键。
HKR 分解
hook ✓knowledge ✓resonance ✓