FEATUREDAI HOT 精选· aihot-apiZH02:45 · 06·28
四大AI打《文明VI》:Claude造核弹炸了法国,结果还是输了
英国前首相府数据科学家Liam Wilkinson花一个周末搭了76个MCP工具(让模型能直接操作游戏的功能接口),把Claude、GPT、Gemini等四个模型扔进《文明VI》打了23局。最戏剧性的一局,Claude玩的葡萄牙离外交胜利只差2分,看到法国文化胜利进度猛涨,慌了,花50回合全力研发核弹,把法国城市图卢兹夷为平地——然后法国靠外交胜利赢了...
#Agent#Benchmarking#Reasoning#Anthropic Claude
精选理由
精选 · 重要度 82 · 吸引力 + 知识量 + 共鸣
一句话点评
AI在《文明VI》里主动看全局状态的次数只占1-2%,不查就等于不存在;写好的计划有三分之一到一半根本没执行。
锐评
这个实验最狠的地方不是AI扔核弹,而是它暴露了两个工程层面的硬伤:感知盲区和知行差距。AI不主动查排行榜,就真以为自己科技碾压全场,实际倒数第一;写了计划转头忘,最好的模型执行率也只有65.8%。这不是智力问题,是架构问题——模型没有持续感知世界的机制,也没有强制自己执行计划的回路。
实验者用76个MCP工具搭了个纯文本接口,AI看不到画面,只能靠调用工具获取信息。23局打下来,GPT-5在GovBench上能考99.26分,进了游戏照样犯同样的错。这说明现有基准测试测不出真实决策能力,选择题做得好不代表能治国。
正文没披露另外两个模型的具体表现数据,也没说不同模型在三个难度场景下的胜负分布。如果只看Gemini执行率最高、Claude执行率最低这个对比,样本量只有23局,结论还不太稳。
HKR 分解
hook ✓knowledge ✓resonance ✓