FEATUREDAI HOT 精选· aihot-apiZH20:55 · 09·03
OpenAI GPT-6 Astra 系统卡:模型对自己思考链的控制力从 16% 跳到 61%
Rohan Paul 从 Astra 117 页系统卡里拎出一个变化:模型能自主控制思考链(chain-of-thought)的比例,从上一代 GPT-5.6 Sol 的 16.1% 直接升到 60.9%。控制力上去了,人能看清它在想什么的可监控性就下来了。帖子没讲这个比例是怎么测的、在什么风险场景下测的,我会先打个折,等完整系统卡公开再看具体评估方法。
#OpenAI#GPT-6 Astra#GPT-5.6 Sol
精选理由
精选 · 重要度 78 · 吸引力 + 知识量 + 共鸣
一句话点评
Astra 自己控制思考链的比例从 16% 飙到 60%,但帖子没说是怎么测的、在什么场景下测的,这个数先打五折看。
锐评
这条帖子从 Astra 117 页系统卡里抓了一个很扎眼的变化:模型自主决定思考链(你可以理解成它解题时打草稿的步骤)的比例,从上一代 Sol 的 16.1% 直接跳到 60.9%。数字本身说明模型在推理时越来越不按人类预设的路径走,自己想怎么想就怎么想。伴随而来的就是可监控性下降——人更难看清它到底是怎么得出答案的。
但这里有个大坑。帖子完全没交代这个比例是在什么任务、什么风险设定下测出来的。如果是在数学题上,模型多打点草稿反而是好事;如果是在安全敏感场景下,模型自己藏着掖着思考过程,那就是另一回事了。另外,正文也没说“可监控性下降”具体指什么指标,是人工审计看不明白,还是自动化工具也抓不到异常。
在完整系统卡公开之前,这个 60.9% 更像一个信号而不是结论。真正需要盯的是 OpenAI 用什么方法评估“自主控制思考链”,以及他们在哪些场景下认为这个能力是风险而不是进步。
HKR 分解
hook ✓knowledge ✓resonance ✓