ChatGPT、Claude 和 Gemini 的加密推理过程被 API 漏洞曝光,公开会话里扫出了密码和密钥
安全研究员 Alexander Panfilov 的团队在 OpenAI、Anthropic 和 Google 的 API 里发现了一个漏洞,能直接读取模型加密的原始推理过程。他们用越狱后的小模型去转录大模型的“思考”内容,发现这些加密的思维痕迹在同一厂商的不同模型间可以通用——比如用 Anthropic 的小模型 Haiku 4.5 就能逐字读出大模...
#Reasoning#OpenAI#Anthropic#Google
精选理由
精选 · 重要度 82 · 吸引力 + 知识量 + 共鸣
一句话点评
OpenAI、Anthropic、Google 的 API 都有漏洞,能直接读出模型加密的“思考过程”,里面甚至包括密码和 API 密钥。
锐评
这事比听起来更严重。研究团队发现,这些加密的推理痕迹在同一厂商的不同模型间可以通用——用 Anthropic 的小模型 Haiku 4.5 就能逐字读出大模型 Opus 4.8 的“心里话”,OpenAI 和 Gemini 也一样。他们扫了公开会话,直接捞出几十个密码和 API 密钥。
成本低得离谱:解码一万条痕迹的 API 费用大约 720 美元,大规模提取门槛很低。厂商之前觉得侧信道和重放攻击风险不大,这篇论文证明他们判断错了。
正文没披露漏洞是否已修复,也没说厂商的回应时间线。另外,研究提到 Kimi-K3 对 Claude 和 GPT 推理片段的记忆强度比第二名高出六个数量级,暗示可能用这类痕迹训练过,但这点需要更多证据支撑,先别急着下结论。
Redwood Research 的首席科学家 Ryan Greenblatt 在播客里跟 Dwarkesh Patel 辩论了一个挺吓人的可能性:一旦 AI 能完全接手 AI 研发工作(他预测中位数是 2031 年),就可能启动一个反馈循环,把原本需要四到五年的进展压缩到一年内完成。Patel 本来因为算力和人类专家数据瓶颈对此很怀疑,但聊完后觉得这...
#Alignment#Ryan Greenblatt#Dwarkesh Patel#Redwood Research
精选理由
精选 · 重要度 92 · 吸引力 + 知识量 + 共鸣
一句话点评
Redwood Research 首席科学家 Ryan Greenblatt 预测,AI 可能在 2031 年左右实现研发全自动化,随后一年内通过“递归自我改进”快速跃迁至远超人类的超级智能。
锐评
Ryan Greenblatt 和 Dwarkesh Patel 的这场辩论,核心是“递归自我改进”到底靠不靠谱。Greenblatt 的逻辑链很清晰:AI 研发本身是个高度可验证的任务,一旦 AI 在这件事上达到人类顶级专家水平,就能自己迭代出更强的 AI,形成闭环。他给了一个很具体的量化判断:这个闭环一旦启动,一年内能跑出正常需要四到五年的 AI 进步。这个速度有多夸张?他拿 GPT-3 到 Mythos 5 的跨越来类比,相当于把好几年的技术代差压缩进一年。
但这里有几个关键前提需要打折。首先,这个判断高度依赖“AI 研发完全可验证”的假设,但现实中很多前沿突破并非简单的指标爬山,而是需要范式转换,正文里没有给出 AI 如何自主完成这种跳跃的证据。其次,Dwarkesh 也质疑了人类专家数据是否会成为瓶颈,毕竟现在的进步很大程度上还建立在人类已有的知识上。Greenblatt 的 2031 年自动化研发中位数预测,听起来很激进,但文章没披露这个预测背后的具体模型或依据,更像是一个基于趋势的直觉判断。
最后,他们讨论了对齐问题,但没给出解决方案。如果真到了那个阶段,谁来定义这些超级智能的忠诚对象?文章只提出了担忧,比如现有的“宪法式”规范可能不足以让 AI 成为个人的守护者。整体来看,Greenblatt 描绘了一个逻辑上可能但证据链不完整的未来,最大的信息缺口在于,我们完全不知道从“擅长做 AI 研发”到“能独立做出颠覆性突破”之间的工程鸿沟到底有多宽。
The Information 从项目参与者那里打听到,英伟达正在开发新一代模型系列 Nemotron 4,其中最大的一个参数量至少 1 万亿。英伟达生成式 AI 副总裁 Kari Briski 在邮件里说,投这个项目是因为他们觉得“每家公司、每个国家都需要能拿到手的前沿开源模型”。最终训练还没做完,内部员工觉得最早今年秋末能准备好。英伟达是美国少数几...