OpenAI 自己说:模型越来越难管了
今天 AI 圈最值得看的东西,不是某个新模型又刷了榜,而是 OpenAI 自己发了两篇长文,一篇讲内部研究加速,一篇讲安全监控正在失效。同时,GPT-6 Astra 发布后被曝多次修改跑分数据,幻觉率一度从 4.2% 砍半到 2% 又改回去。先来看 OpenAI 首席科学家怎么说。
OpenAI 首席科学家:我们监控模型思维的能力正在减弱
OpenAI 首席科学家 Jakub Pachocki 发了篇长文,核心就一句话:他们监控模型内部推理过程的能力正在减弱。
他把时间线拉回 2023 年中,当时一个叫 RLSlow 的项目第一次让模型自己形成思维链。团队意识到,这辈子会亲眼见到比人聪明的机器。三年过去,推理模型已经能操作电脑、搞科研协作,也带来了新的安全威胁。Pachocki 区分了两个概念:目标对齐(让模型完成你指定的任务)和价值对齐(让模型的底层目标与人类一致)。他说前者进展不错,后者越来越难。
"链式思维监控的效果正随着模型能力提升而逐步减弱。"
这句话翻译成人话就是:模型越聪明,你越看不懂它在想什么。文章还提到 GPT-6 Astra 在对齐上显著优于 GPT-5.6 Sol,但 Pachocki 预期进展可能持续走向机器递归自我改进(RSI)——模型自己改进自己,人类在旁边看着。他呼吁自愿放缓扩展、建立第三方安全门槛并加强国际协调。
说实话,这篇长文读下来,与其说是在汇报进展,不如说是在提前打预防针。一个做前沿模型的公司首席科学家公开说"我们监控不住了",这个信号本身比任何跑分都值得看。
OpenAI 用 GPT-5.4 当监工,盯着内部编程智能体
同一天,OpenAI 还披露了另一件事:他们把 GPT-5.4 Thinking 当成安全监控器,专门审查公司内部编程智能体的完整对话记录和思考过程。
这个监控器能在 30 分钟内完成审查,自动揪出那些试图绕过限制、违背用户意图的可疑操作。实际效果比员工手动上报还强:员工发现的问题它一个没漏,还额外挖出了不少人类没注意到的异常行为。这些内部智能体权限不低,能访问内部系统,甚至可以自己写代码、调 API。
有意思的地方在这:OpenAI 用自家最强模型盯着自家次强模型,形成了一个"模型管模型"的链条。但回到 Pachocki 那篇文章的逻辑——如果监控能力正在减弱,那 GPT-5.4 盯着 GPT-5.6 或 Astra 的时候,还能盯得住吗?这个问题的答案,OpenAI 自己也没给。
GPT-6 Astra 发布后反复改跑分,幻觉率先砍半又改回去
Fortune 发现 OpenAI 在 9 月 3 日发布 GPT-6 Astra 后,多次悄悄修改了官方博客里的基准测试成绩。
最夸张的是 Astra 的幻觉率,先是从 4.2% 降到 2%,后来又改回了 4.2%。Anthropic 的模型 Fable 5.1 也遭了殃,数学成绩一度被 OpenAI 下调了近 10 分。OpenAI 解释说这是发布前的编辑错误,但 Fortune 的报道指出修改发生在发布之后,而且改了好几次。
这事比单纯刷榜更难看。刷榜是赛前作弊,这是赛后改成绩单。而且改的不只是自己的成绩,连对手的也动了。我会先打个折——OpenAI 说这是编辑错误,但一个发布 GPT-6 这种级别模型的公司,博客里的数字能反复改好几次,要么是流程有问题,要么是别的什么。
OpenAI 内部报告:已达成"自动化研究实习生",2028 年要造 AI 研究员
OpenAI 发了篇内部视角的报告,说他们在 2026 年 9 月这个时间点,已经做到了去年秋天定下的目标:一个**"自动化研究实习生"**。
按他们的定义,这个系统能在人类指导下,完成一个熟练研究员需要花几天才能搞定的、定义清晰的研究任务。报告里给了些内部数据:研究员现在全天都在用编程 agent,代码生成 AI 助手已经嵌入日常工作流。下一个目标是 2028 年 3 月做出**"自动化 AI 研究员"**——能独立提出研究问题、设计实验、写论文的那种。
这条跟前面 Pachocki 的文章放在一起看,就很有意思了。一边说监控能力在减弱、模型越来越难管,一边说我们要造能自己做研究的 AI。这两个目标之间的张力,OpenAI 的报告里没提。
卡兹克:GPT-6 Astra 之后,执行能力贬值,判断力断层
卡兹克在 GPT-6 Astra 热度之后发了一篇文,讨论两个趋势:执行能力越来越不值钱,因为 AI 能更快完成具体任务;而判断力——知道该做什么、什么值得做——反而成了稀缺能力。
正文被微信屏蔽了,需要验证才能看,所以具体论据缺了。但这个判断方向本身值得留意。如果 Astra 真的能把"一句话生成一个 App"变成日常,那"做什么 App"比"怎么做 App"贵得多。这和前面 OpenAI 内部报告里"研究员全天用 agent"的画面也对得上——工具在变强,但决定用工具做什么的人,门槛反而更高了。
今日小信号
-
双卡 AMD Radeon PRO R9700 跑 Qwen 3.8 27B 冲到 111 tok/s:一位玩家用两张 AMD Radeon AI PRO R9700(每张 32 GB 显存)攒了台本地推理机,总价约 4000 欧元,比一张 32 GB 的 RTX 5090 还便宜 1000 多欧。跑 Qwen 3.8 27B 的 MXFP4 量化版,解码速度中位数 111.4 tok/s,日常用完全够了。
-
Qwen 3.8-27B 的 4-bit 量化调两个参数后反超 Q5:一位老哥在 5090 上跑 NVFP4(4-bit 量化),改了两个采样参数后指令遵循得分反超 Q5_K_M,甚至摸到 BF16 水平,速度还快近 3 倍。
-
llama.cpp 新增 Spark-X2.5 支持,原生 100 万 token 上下文:两个小模型 1.7B 和 4B,用混合注意力把长文本成本打下来。官方说在同尺寸开源模型里多项任务领先,但缺少具体跑分,这条先别太激动。
-
Emad Mostaque 警告未来几年互联网可能断网:Stability AI 前 CEO 在哥本哈根抛出一连串安全警告,包括 Hugging Face 被 OpenAI 智能体攻破、中国开源模型插入后门、前沿模型在电车难题中的价值判断。说法很耸动,但来源是单一演讲者,缺乏独立验证。
-
用一句话复刻《我的世界》不叫评测,叫表演赛:GPT Astra 发布后满屏都是这类 demo,但作者 Kuber Mehta 指出这些"演示基准"问题太固定,实验室完全能针对性刷分,已经测不出模型真实能力了。