OpenAI 上市前挖人,Anthropic 被查芯片
今天 AI 圈最值得看的两件事,都跟“边界”有关。OpenAI 在 IPO 前一周连挖 Transformer 论文作者和白宫前 AI 政策官员,阵容很唬人,但具体职位和入职时间都还没说。另一边,WIRED 的调查把 Anthropic 的 Mythos 模型推到了出口管制的风口上,训练地点和时间线高度重合,但双方都拒绝回应。先来看 OpenAI 这一手。
OpenAI 上市前连挖两人,阵容唬人但缺关键信息
OpenAI 在 IPO 前一周内从 Google DeepMind 挖来了 Transformer 架构共同发明人 Noam Shazeer,以及曾在特朗普政府白宫科技政策办公室负责 AI 政策的 Dean Ball。
Shazeer 是那篇“Attention Is All You Need”论文的作者之一,后来创办了角色扮演 AI 公司 Character.AI,2024 年带着团队回了 Google。现在又被 OpenAI 挖走,等于在 Google 和 OpenAI 之间来回横跳。Dean Ball 则是在特朗普时期负责 AI 政策,现在加入 OpenAI,大概率是帮公司应对越来越紧的监管环境。
但这条我会先打个折。上游报道没提他俩具体担任什么职位、什么时候入职、向谁汇报。IPO 前挖大牌是常规操作,但如果没有实权,更像是给招股书加一行字。Shazeer 在 Google 待了不到两年又走,是项目不顺还是 OpenAI 给的包太大,目前还不清楚。
有意思的是,OpenAI 这次挖的不是产品经理或销售,而是一个底层架构发明人和一个政策老手。这说明它现在最担心的不是模型能力,而是技术护城河和监管风险。
Anthropic 的 Mythos 模型,可能是在受管制的 H100 上练出来的
WIRED 的调查把 SK 电信推到了前台。事情的核心是:Anthropic 的 Mythos 模型,可能是在受美国出口管制的芯片上训练的,而训练地点正好在 SK 电信的韩国数据中心。
2024 年 4 月,SK 电信公开宣布和 Anthropic 合作,为韩语模型训练提供 GPU 算力,其数据中心里部署的正是受管制的英伟达 H100 芯片。调查发现,Anthropic 在韩国的训练活动时间线和 Mythos 的开发周期高度重合,但双方都拒绝回应具体细节。
这事如果坐实,性质就变了。美国对华出口管制卡的就是 H100 这类高性能芯片,如果 Anthropic 通过韩国数据中心绕开了管制,那不只是合规问题,而是整个出口管制体系出现了漏洞。
但 WIRED 的调查目前还停留在“时间线和地点高度重合”这个层面,没有直接证据证明 Mythos 就是在那些 H100 上训练的。Anthropic 和 SK 电信都拒绝回应,所以这条先当信号看,别急着下结论。
Fable 被美国政府短暂关停,模型智能开始触碰安全红线
Steve Yegge 认为,Fable 模型被美国政府短暂关停是一个分水岭,说明模型智能已经危险到需要管控了。他预测,最多再过两三代模型,最前沿的 AI 就会像核武器一样被政府严格管制,绝大多数财富 500 强公司都拿不到访问权限。
开源模型虽然能追到 Fable 这个级别,但受限于算力壁垒和供应链封锁,很难再往上突破。对大多数人来说,AI 能力曲线会在这里开始分叉:少数机构拥有超强模型,其他人只能用次一级的开源版本。
但这条缺少关停的具体原因和时长,上游报道只说“被短暂关停”,没说为什么关、关了多久、谁下的命令。Yegge 的判断方向我认同,但“像核武器一样锁起来”这个类比有点重,先别太激动,等更多细节出来再判断。
GPT-5.5 Instant 进了健康问答,免费用户也能用
OpenAI 把最新的 GPT-5.5 Instant 模型用在了 ChatGPT 的健康问答上,免费用户也能用。在 3500 条回复的盲评里,医生给它的准确性、沟通清晰度和完整性打分,比真人医生写的回答还高,而且更少出现漏掉危险信号、不追问背景这类问题。
后台监控显示,过去两个月健康回复的事实错误率下降了 71%。这些提升靠的是模型本身变强,以及请医生团队做针对性微调。
但这是 OpenAI 自己组织的评测,外部独立验证还没看到。医疗场景的容错率极低,一次事实错误可能就是一次误诊。71% 的错误率下降听着不错,但绝对值是多少、剩下那 29% 的错误有多严重,OpenAI 都没说。
Claude Code 能把终端进度生成网页,但没提成本
Claude Code 开始支持 artifacts 了。你在终端里干活时,它可以把你当前的进度——比如代码改动说明、系统架构解释、数据看板——直接生成一个能交互的网页。这个网页带着完整的对话上下文,队友不用装 Claude Code 就能看。
这功能对团队协作确实有用,不用再截图发 Slack 或者写 README 解释进度了。但官方没说明这个功能是默认开启还是需要手动触发,也没提生成一个 artifact 会吃掉多少 token。
Claude Code 的 token 消耗本来就不低,如果每次生成 artifact 都要重新跑一遍上下文,成本可能比想象的高。这点等官方给具体数字再说。
工信部公示 L3/L4 自动驾驶强制国标,2027 年起实施
工信部 6 月 16 日公示了《智能网联汽车自动驾驶系统安全要求》强制性国标报批稿,建议 2027 年 7 月 1 日起实施。这是国内首部覆盖 L3、L4 的强制标准,核心要求就一条:自动驾驶系统安全水平不能低于一个合格且专注的人类司机。
标准引入了 **Safety Case(安全档案)**机制,企业得用“声明—论据—证据”的结构来证明系统安全,仿真、场地和道路测试数据都要归档。这会让车企不能再拿测试里程和覆盖城市吹牛,得用结构化的安全档案自证清白。
2027 年实施,还有两年多,但标准本身是信号:L3/L4 的商业化落地,监管框架已经开始搭了。
今日小信号
- DeepSeek 网页端上线识图功能:多模态研究员 Xiaokang Chen 宣布识图模式在网页和 App 端上线,但 App 端还挂着“内测”提示,全量放开可能还得等等。
- 火山引擎把豆包实时语音模型 3.0 做成 API:这个叫 Seeduplex 的模型能边听边说,会自己判断什么时候该插话,抗噪和判停延迟都有改善。但现在只能申请内测,价格和公开时间都没提。
- 皮尤民调:三分之二美国人觉得 AI 发展太快:ChatGPT 在美国的使用率一年翻倍到 44%,但只有 16% 的人觉得 AI 对社会有好处。这个落差比数字本身更值得看。
- 八部门发文鼓励贷款买 AI 产品:覆盖手机、电脑、人形机器人、养老陪伴机器人等,但缺贴息比例、贷款额度上限和落地时间表,具体能省多少钱还不清楚。
- Grok TTS 在盲测里拿了 96 分:真人满分 100,差距只有 4 分,听着确实像人。但没放实际音频样本,样本量和评分人数都没说,等实际样本出来再判断。