今天 AI 圈在聊安全,但每个人说的不是同一件事
今天 AI 圈的安全讨论有点分裂:Anthropic 一边报告胡塞武装用 Claude Code 开发导弹制导软件,一边 CEO 发文呼吁给前沿 AI 踩刹车;研究员辞职警告 AI 可能毁灭人类,黄仁勋当场说这些警告不属实。另一边,Claude Fable 5.1 花了 44 分钟破解了一个 370 年没人解开的密码,普林斯顿给 Claude Opus 4.8 六天时间复现顶会论文却被原审稿人全拒。先来看 Anthropic 这份威胁报告。
Anthropic 报告胡塞武装用 Claude Code 开发导弹,但细节得打个折
这条我今天看了好几遍,说实话有点复杂。Anthropic 在 9 月的威胁报告里披露,也门北部一个极可能隶属胡塞武装的小组,同时跑多个 Claude Code 实例,把导弹工程拆成编码、研究和审查并行推进。他们用 Claude 写了战术火箭和射程超 2000 公里的弹道导弹的制导软件,还搞了个叫 R2000 的高超音速滑翔飞行器概念方案,做了六自由度弹道仿真和强化学习调参,最后打包成离线可部署的版本。
有意思的是,Anthropic 说他们主动检测到并阻止了这些滥用行为,但报告里没披露具体怎么发现的、阻止的时间线、以及这些导弹软件到底写到了什么程度——是概念设计还是接近可用的代码。上游报道也没说清楚胡塞小组是怎么绕过 Claude 的安全限制的,毕竟 Anthropic 一直强调自己的安全对齐做得很好。
我会先打个折:这份报告的时间点很微妙。就在同一天,Anthropic 的 CEO Dario Amodei 发了篇 3500 字的文章呼吁给前沿 AI 研发踩刹车,Sam Altman 和 Elon Musk 很快公开表示支持。威胁报告和刹车呼吁同时出现,很难不让人联想这是为监管造势。不是说胡塞武装没用 Claude——很可能确实用了——但报告里缺的关键细节,恰好是判断严重程度最需要的东西。
Dario Amodei 呼吁踩刹车,Gary Marcus 给了两分半好评
Anthropic CEO Dario Amodei 发了篇 3500 字的文章,主张给最前沿的 AI 研发"踩刹车"。Sam Altman 和 Elon Musk 很快公开表示支持,这组合本身就挺罕见。
Gary Marcus 对其中两点很买账:一是承诺让第三方评估人员像内部员工一样接触模型,二是对透明度的表态。但他也直接指出文章开头还是在用老一套的夸张话术,比如 AI 可能很快超越人类之类的说法。Marcus 还列了几个质疑:评估机构 METR 和 AI 公司关系太近、Anthropic 借对华威胁维持加速、以及这个刹车提议可能意在抢先于真正的监管——先自己提一个温和版,堵住更严格的监管方案。
"300 亿美元的后续投入取决于 Anthropic 达到特定目标。"
这里有个背景值得注意:Anthropic 正在谈新一轮融资,估值可能到 9650 亿美元。在这个节点上 CEO 出来说"我们要踩刹车",市场会怎么解读?是真心想慢下来,还是在监管压力下先表态、实际该加速还是加速?Marcus 的怀疑不是没道理——如果真想慢下来,为什么还要融那么多钱?
研究员辞职警告 AI 毁灭人类,黄仁勋当场说"不属实"
Anthropic 研究员 Jacob Coxon 周二辞职,公开说搞 AI 的人正在"拿我们的命赌博",很快会出现能黑掉任何系统的超级 AI。他的同事 Evan Hubinger 在 X 上补了一句,自己觉得十年内 AI 杀光所有人的概率超过 10%。
Nvidia 老板黄仁勋在高盛会议上直接说这些警告不属实。Grindr CEO George Arison 更直接——让工程师停用 Anthropic 的服务,怀疑这是为 9650 亿美元估值造势。
说实话我有点怀疑。不是说 AI 安全不值得担心,而是一个研究员辞职时说的"十年内灭绝概率超 10%"这种话,既没法证实也没法证伪,更像是在用极端表述吸引注意力。如果真要讨论 AI 风险,需要的是具体的技术路径分析,不是概率数字。黄仁勋说"不属实"可能也是这个意思——不是说 AI 没风险,而是这种"十年内杀光所有人"的说法本身就不严肃。
Claude Fable 5.1 破解 370 年密码,关键线索就藏在原书里
这条挺有意思,不用打折。Vals 团队让 Claude Fable 5.1 去解一个 370 年没人解开的密码——Cyphral Distich,模型花了 44 分钟、用了 17.6 万个 token 就搞定了。
关键发现很妙:密码本不在外面,就在书里。那 64 个数字不是对应外部字母表,而是指向书中 32 段"Proquiritations"里的第几个词,取首字母拼出来就是"O GOD UPHOLD KING CHARLES"。370 年来没人想到密码本就藏在原文里,Claude 找到了。
这个案例的价值不在"AI 比人聪明",而在它展示了一种不同的解题思路:模型没有预设"密码本一定在外部"这个假设,所以能回到原文去找。人类专家可能被自己的经验框住了。44 分钟、17.6 万 token,成本不高,但思路值得留意。
普林斯顿给 Claude Opus 4.8 六天时间复现顶会论文,全被拒了
普林斯顿的研究人员给了 Claude Opus 4.8 六天时间、3000 美元 API 额度外加 GPU 算力,让它复现两篇投给 NeurIPS 2026 的未公开论文。AI 能查文献、跑几百次实验,但两篇论文都被原论文作者拒了。
问题出在它不会设计靠谱的实验,走进死胡同也不懂回头,更提不出新东西。简单说,现在的 AI 能干活,但缺做开放式研究需要的判断力——什么时候该换方向、什么实验结果值得深挖、什么假设该放弃。
这条和上面破解密码那条放一起看很有意思:Claude 在封闭问题(密码有唯一正确答案)上表现出色,但在开放问题(论文需要创新和判断)上就露馅了。3000 美元和六天时间不算少,但买不到研究直觉。
Perplexity 说 GPT-6 Astra 能自己盯生产环境,但没给任何数据
Perplexity 的联合创始人 Johnny Ho 说,GPT-6 Astra 现在能直接写对外沟通文案、改线上代码、盯着生产环境运行,这些事以前的模型做不来。他们让 Astra 自己写测试程序,模拟外部 API 返回的数据,跑通完整的业务流程。
因为模型更稳了,团队不用像以前那样频繁盯着看。但正文只给了定性的说法,没披露具体的性能指标或延迟数据。我会先打个折——这读起来更像产品宣传,不是技术报告。"能自己盯生产环境"是个很重的说法,需要看到错误率、回滚次数、人工介入频率这些数字才能判断。
Google 自家 Gemini 能秒杀诈骗广告,但人工审核两次都放行
这条挺讽刺的。作者在 YouTube 上看到一个伪装成 iOS 系统弹窗的广告,提示"iPhone 存储已满",诱导用户点击。他举报了两次,Google 都说广告合规。
作者把广告截图喂给 Google 自家的 Gemini 模型,几秒内就被判定为违规:模仿系统弹窗、用假按钮、制造恐慌。Google 有现成的 AI 审核能力,却没用在广告审查上。
缺少 Google 广告审核流程是否用了 AI 的具体信息,但至少说明有现成能力却没部署。AI 能秒杀的问题,人审两次都放行——这不是技术问题,是流程问题。
今日小信号
- Docket 想解决一个真实痛点:AI 写的代码出 bug 时,你根本不知道它当时看了什么、做了什么决定。它会在每次 git 提交时自动抓取 AI 编程助手的完整对话记录和工具调用链,打包成防篡改的证据包。但目前只放了个 README,缺签名机制和存储开销数据。
- YC 掌门人 Garry Tan 公开呼吁美国开源模型公司去蒸馏 OpenAI、Anthropic 等前沿模型,理由是中国的实验室已经在这么干了。他希望监管别插手,让美国小实验室也能做出更多本土开源模型。
- PyO3 让 Rust 代码像 Python 包一样 import,Pydantic v2 就是这么干的。但关键发现:返回大结构时,把 Rust 值转成 Python 对象比解析本身还贵——10 万个值就要创建 10 万个 Python 对象。
- IEEE Spectrum 给家用机器人泼了盆冷水:人形机器人连端杯水都费劲,目前能进家门的还是扫地机和割草机。成本、安全、真有用三个问题一个都没解决。