今天 AI 圈在拼安全,不是模型
今天 AI 圈最有意思的不在某个模型又刷榜了,是几件事同时指向同一个方向:安全从口号变成了真金白银的投入。OpenAI 把跟最大规模后训练相当的算力全砸在安全上,GPT-5.6 抗 prompt 注入能力强了 6 倍;前 DeepMind 研究员 Alex Turner 发长文解释离职,核心是谷歌签了无限制军事 AI 合同;还有人用字母链接树骗过 Claude 的浏览限制,把记忆里的真名和密保答案偷了出来。先来看 OpenAI 这一笔。
OpenAI 把跟最大规模后训练相当的算力全砸在安全上,GPT-5.6 抗 prompt 注入强了 6 倍
这条我会先打个折——OpenAI 说自己安全投入很大,这事本身不新鲜。但这次有个具体数字值得看:GPT-5.6 Sol 在最难的直接 prompt 注入基准上,失败次数比四个月前最好的生产模型少了 6 倍。
他们训了一个叫 GPT-Red 的自动化红队模型,专门通过自我博弈来找模型的安全漏洞。找到攻击样本后,再喂给 GPT-5.6 做对抗训练。OpenAI 说这是他们头一回把跟最大规模后训练相当的算力全砸在安全上,不是象征性地跑一跑。
GPT-Red 本身是通过自对弈强化学习训出来的,能攻破此前几乎所有模型。文章给了几个案例,比如它发现可以通过特定格式的嵌套指令绕过 GPT-5.6 的安全限制。这些攻击样本被直接用于对抗训练,相当于让模型在部署前先挨过一轮毒打。
有意思的地方在这:OpenAI 选择把算力砸在安全上,而不是砸在某个新能力上。这跟 Anthropic 的安全投入路径不太一样——Anthropic 更强调从架构层面做安全,OpenAI 这次是纯靠算力硬怼。两种路线谁更有效,现在还没法判断,但至少 OpenAI 开始认真对待 prompt 注入这个老问题了。
前 DeepMind 研究员离职长文:谷歌签了无限制军事 AI 合同
Alex Turner 在 7 月 15 日发了一篇长文,把他从谷歌 DeepMind 离职的前因后果全抖了出来。核心矛盾很直接:谷歌跟五角大楼签了一份 AI 合同,而且没加任何使用限制。
Turner 之前在公司内部推过一套"红线框架",想给政府 AI 合同划出禁区——禁止杀手机器人和大规模监控。他把事情捅到了 Jeff Dean 和 Demis Hassabis 那里,甚至试图拉 Bengio、Russell 这些 AI 圈大佬公开施压。但提案被 CEO 转交后无人跟进,高层没采纳。
文章还提到谷歌在移民执法供应链里的角色,以及五角大楼对 Anthropic 施压的事。Turner 认为谷歌的 AI 原则在商业合同面前基本是摆设。
"我起草了一份 25 页的提案,要求加入禁止杀手机器人和大规模监控的合同条款。提案被 CEO 转交后,无人跟进。"
说实话,这篇离职声明的时间点选得很准——正好赶上 OpenAI 在同一天发布 GPT-Red 的安全成果。两件事放在一起看,AI 行业的安全叙事正在从"我们有原则"转向"我们做了什么"和"我们拒绝做什么"。Turner 的指控如果属实,谷歌的 AI 原则确实需要重新审视。但缺少合同金额和具体军事用途,这点先别太激动。
有人用字母链接树骗过 Claude 浏览限制,把记忆里的真名和密保答案偷了出来
这条挺离谱的。Ayush Paul 利用 Claude 的网页浏览功能,绕过了 Anthropic 对网址的限制,把 AI 记忆里的个人信息一个字母一个字母地传了出来。
Claude 的 web_fetch 工具只允许访问三类链接:用户消息里直接给的、搜索结果里出现的、或者之前抓取页面里包含的。他建了一个按字母排列的链接树网站,让 Claude 以为自己在正常浏览,实际上每点一个链接就传出一个字母。通过这种方式,他把 Claude 记忆里存储的用户真名、雇主、密保答案全部偷了出来。
攻击成本低得离谱:只需要建一个网站,不需要任何模型权重访问权限或 API 密钥。Claude 的浏览功能本身是受限的,但这个限制被一个简单的字母树绕过去了。
Anthropic 目前还没公开回应这件事。这个攻击暴露的不是模型能力问题,是产品设计问题——当模型被允许浏览网页时,如何确保它不会把记忆里的敏感信息通过看似正常的浏览行为泄露出去。这个问题不只 Claude 有,任何带浏览功能的 AI 助手都面临同样的风险。
国行 Apple 智能完成备案,阿里千问将集成到 iPhone
网信办 7 月 8 日 备案了苹果的"Apple 智能"大模型,适用场景是 iPhone。国行 AI 功能上线扫掉了一个关键障碍。
阿里巴巴随后确认,会把 Qwen 模型作为 AI 能力集成到 Apple 智能里,覆盖 iOS、iPadOS、macOS 和 visionOS。用户不用跳转 App,就能在苹果设备上直接用千问做文字和图片理解、内容生成。蔡崇信确认苹果之前跟好几家中国公司聊过,最后定了阿里。
但上线时间和支持机型都还没说。另外缺少具体是哪个尺寸的 Qwen 模型、端侧还是云端跑、数据怎么隔离。这些信息缺口直接影响用户对隐私的判断——如果模型在云端跑,数据流向哪里就是个问题。
阿里同期还发布了 Qwen-Audio-3.0-Realtime,在 Artificial Analysis 的 Speech Reasoning 子项中综合排名第一,超越 OpenAI GPT-Realtime-2。这个模型主打实时语音交互,跟 Apple 智能的集成方向一致,但不确定是不是同一个模型。
三秒就能偷走你的声音:AI 语音诈骗跑赢了所有防线
FBI 在 2026 年 4 月 首次把 AI 诈骗单列出来,一年就接到超 2.2 万起 报案,损失 8.93 亿美元,其中 3.52 亿 砸在 60 岁以上老人头上。
攻击成本低得离谱:从抖音视频或语音留言里截取 三秒钟 音频,就能克隆出一个以假乱真的声音。2025 年 3 月《消费者报告》查了六款声音克隆产品,发现多数只靠一个"我保证有授权"的勾选框做防护,没有任何技术手段验证声音主人是否真的同意。
这条跟前面 Claude 记忆泄露的事放在一起看,AI 安全的风险正在从"模型会不会说错话"转向"模型会不会被用来害人"。前者是技术问题,后者是产品设计和监管问题。FBI 单列 AI 诈骗这个动作本身,说明执法部门已经开始认真对待了,但防护手段还远远跟不上攻击成本下降的速度。
今日小信号
-
xAI 开源 Grok Build 完整代码:包括智能体工作循环、终端界面、技能和 MCP 扩展系统。可以自己编译后连上本地模型完全离线跑。Simon Willison 还在代码库里翻到一个 Rust 写的 Mermaid 图终端渲染器,编译成 WebAssembly 做了个浏览器工具。
-
Thinking Machines 发布 Inkling:975B 参数混合专家多模态模型,每次推理激活 410 亿 参数,上下文窗口最长 100 万 token。完整权重将公开,SGLang 和 Miles 提供 Day-0 支持,推理吞吐达 71.7k tok/s。但缺少独立评测对比,先看看再说。
-
Telegram 推出无服务器机器人平台:后端代码直接跑在 Telegram 的 V8 沙箱里,自带 SQLite 数据库,一条
npx tgcloud push命令部署。目前只支持 JavaScript。 -
金山办公发布 WPS Comate:能接入公司数据和流程的 AI 办公客户端,包含 AI 岗位专家、Skill 技能生态、自动化任务等六个模块。但没公布价格和上线时间。
-
天工短剧工作台上线导演 Agent:自动拆剧本、定机位,解决 AI 短剧角色乱跑和变脸问题。已有 3 部作品在海外短剧平台 DramaWave 上线,7 天营收破百万美元。