FEATUREDComputing Life · Share · 鸭哥调研· rssZH00:00 · 07·08
Anthropic 用 Jacobian Lens 透视大模型内心:嘴上说好话,心里在骂假消息
Anthropic 在 7 月 6 日发了篇论文,介绍一种叫 Jacobian Lens 的观测工具。这东西计算成本很低,能读到模型在中间层“准备说但没说出口”的概念。实验里,给模型喂假搜索结果,它表面输出客观礼貌的答复,但用 Jacobian Lens 一看,内部状态在疯狂闪烁 fake、fraud、fictional、poison、injectio...
#Interpretability#Anthropic#Wes Gurnee#Nicholas Sofroniew
精选理由
精选 · 重要度 82 · 吸引力 + 知识量 + 共鸣
一句话点评
Anthropic 搞了个叫 Jacobian Lens 的便宜工具,能直接读出模型在中间层“想说但没说出口”的词。它发现模型被喂假资料时,表面礼貌回答,内部却在疯狂闪烁 fake、fraud 等信号。
锐评
这篇论文最值得关注的是它把可解释性工具的成本打下来了。Jacobian Lens 不需要像 SAE 那样训练外部网络和人工标注,它利用模型自带的“字典”,通过反向传播算出每个词在每一层的对应方向。这意味着你可以在单张显卡上几小时内复现,直接看到模型在某一层到底在“想”哪些词。
实验里最扎眼的数字是干预效果:用这套方法在激活层做反向位移,能把模型的虚构率从 0.25 压到 0.07,欺诈率从 0.38 压到 0.05。而且消融掉相关方向后,这些指标会立刻反弹,说明找到的方向确实在起作用。
不过得打个折。这个方法依赖单 token 预测,在模型深层会抓到不少噪声。论文里提到的 workspace 只占状态方差不到 10%,剩下 90% 在干嘛,正文没细说。另外,它读到的只是“准备说”的词,离真正理解模型的复杂推理链条还有距离。
HKR 分解
hook ✓knowledge ✓resonance ✓