FEATUREDComputing Life · Share · 鸭哥调研· rssZH00:00 · 08·30
模型答错事实题,先分清是没存进去,还是这次没取出来
Google Research 在 ICML 2026 发了一篇论文,用 2150 条维基百科事实测了 13 个模型,想搞清楚模型答错题到底是因为压根没学过,还是学过但这次没想起来。他们设计了两把尺子:一把松的,让模型接着维基百科原文往下写,测它有没有存进去,前沿模型能拿到 95–98% 的编码率;一把严的,闭卷、换着说法正问反问,四道题全对才算过,结...
#Reasoning#Google Research#Gemini-3-Pro#Gemma3
精选理由
精选 · 重要度 78 · 吸引力 + 知识量 + 共鸣
一句话点评
模型答错事实题,先别急着加数据。这篇论文用两把尺子测出,前沿模型95%以上的知识都存进去了,但闭卷提问时仍有近三成取不出来。
锐评
这篇论文最值得看的地方,是把“没存进去”和“存了没取出来”这两种失败干净地分开了。作者用贴着原文往下接的方式测存储,前沿模型能拿到95–98%的编码率,说明货架基本是满的。但一换成闭卷、换着说法正问反问,失败率立刻跳到26–34%。这个缺口的大小有尺子松紧的人为因素,但缺口的形状是硬的:冷门事实和热门事实存进去的差距只有5个点,取出来的差距却拉到20个点以上,说明瓶颈卡在提取通路,不是语料覆盖。
另一个反直觉的发现是思考的作用。面对毫无推理链路的单跳事实,开启思考能救回40–65%已编码但没取出的答案,而对根本没存进去的事实只能救回5–15%。这说明思考在这里不是逻辑推演,更像在权重里翻找记忆。对做系统的人来说,这直接给出了成本账本:思考是药,但只对存进去的内容有效,盲目全量开启就是浪费算力。
论文的局限也得说清楚。测试只用了2150条维基百科事实,全是公开的单跳知识,结论能不能迁移到多跳推理或私有数据上,正文没给出验证。另外,模型能不能自己判断“这次能不能取出来”,也就是元认知能力,论文也没答案,而这恰恰是线上精准触发思考或检索的关键。
HKR 分解
hook ✓knowledge ✓resonance ✓