FEATUREDAI HOT 精选· aihot-apiZH06:46 · 09·06
OpenAI 在 GPT-6 Astra 发布后反复修改跑分,幻觉率一度从 4.2% 砍半到 2% 又改回去
Fortune 发现 OpenAI 在 9 月 3 日发布 GPT-6 Astra 后,多次悄悄修改了官方博客里的基准测试成绩。最夸张的是 Astra 的幻觉率,先是从 4.2% 降到 2%,后来又改回了 4.2%。Anthropic 的模型 Fable 5.1 也遭了殃,数学成绩一度被 OpenAI 下调了近 10 分。OpenAI 解释说这是发布前...
#Benchmarking#OpenAI#GPT-6 Astra#Anthropic
精选理由
精选 · 重要度 88 · 吸引力 + 知识量 + 共鸣
一句话点评
OpenAI 发布 GPT-6 Astra 后,被曝多次悄悄修改跑分数据,对手的成绩也一度被下调,这比单纯刷榜更难看。
锐评
这件事最值得关注的点不是分数本身,而是修改的过程。Fortune 抓到了网页快照,显示 Astra 的幻觉率先从 4.2% 砍半到 2%,后来又改了回去;Anthropic 的模型 Fable 5.1 数学成绩一度被 OpenAI 下调了近 10 分。OpenAI 解释这是发布前的正常验证,但斯坦福的研究人员指出,系统卡里根本没写清楚幻觉测试到底用了多少样本、怎么测的。
我会先打个折:博客里也写了,这些都是在不计计算成本、用最强配置跑出来的“天花板分数”,普通用户用 ChatGPT 根本跑不出这个效果。所以这些数字更多是实验室里的营销素材,不是实际体验。
现在还缺两个关键信息:一是 OpenAI 到底有没有一套固定的、公开的测试流程,还是每次发布前可以反复调参直到数字好看为止;二是这些修改是在媒体和公众发现之后才改回去的,如果没人盯着,是不是就默认用那个更低的幻觉率了。这点先别太激动,等 OpenAI 把测试方法和原始数据公开再说。
HKR 分解
hook ✓knowledge ✓resonance ✓