FEATUREDAI HOT 精选· aihot-apiZH16:46 · 07·11
OpenAI 公布 GPT-5.6 医疗评估:最小号 Luna 模型在最低推理档位就赢了 GPT-5.5,成本还低了 25 倍
OpenAI 让专科医生不限时、可上网查资料来答题,再找其他医生盲评,从准确性、沟通、完整性、指令遵循和健康决策帮助性五个维度打了 20000 次分。所有 GPT-5.6 模型都明显超过医生,而且医生在 GPT-5.6 的回答里挑出的毛病比在同行写的回答里还少。最小的 GPT-5.6 Luna 只用最低推理强度就超过了最高推理强度的 GPT-5.5,成...
#Benchmarking#OpenAI#GPT-5.6 Luna#GPT-5.6 Sol
精选理由
精选 · 重要度 88 · 吸引力 + 知识量 + 共鸣
一句话点评
OpenAI 让专科医生不限时、可上网答题,再找同行盲评,结果所有 GPT-5.6 模型都赢了,最小的 Luna 成本还低了 25 倍。但没公布测了什么病、找了哪类医生,这点先别太激动。
锐评
这条推文放出的结果挺直接:OpenAI 搞了一场人机对战,让专科医生在完全没时间压力、还能上网查资料的情况下写回答,然后让另一批医生在准确性、沟通、完整性、指令遵循和健康决策帮助性五个维度上盲评打分,总共打了 20000 次。所有 GPT-5.6 模型都明显超过医生,而且医生在 AI 写的回答里挑出的毛病比在同行写的回答里还少。最小的 GPT-5.6 Luna 只用最低推理强度就超过了最高推理强度的 GPT-5.5,成本还低了 25 倍,这点如果是真的挺省钱。最大的 Sol 则把天花板又往上推了一截。
但正文没披露测试覆盖了哪些疾病、专科医生具体来自什么科室、样本量分布如何。医疗评估最怕的就是任务太窄或者医生群体不具代表性,这些信息缺口让结论的泛化能力打了折扣。另外,盲评虽然比自评靠谱,但评分医生本身的知识水平和判断标准也没交代。我会先打个折,等看到完整报告里的病种构成和医生资质再说。
HKR 分解
hook ✓knowledge ✓resonance ✓