FEATUREDAI HOT 精选· aihot-apiZH01:32 · 05·09
Claude Mythos 预览版风险时间距评估:50% 任务完成时间至少 16 小时
METR 在 2026 年 3 月的一个短暂窗口里,对 Claude Mythos 的早期预览版做了风险评估。他们用一套任务测下来,模型有 50% 概率能独立完成的任务,所需时间至少是 16 小时,95% 置信区间在 8.5 到 55 小时之间。这个数字已经碰到了 METR 现有任务能测出的上限,也就是说,再长他们就测不准了。正文没披露具体是什么任务、...
#Benchmarking#Safety#METR#Claude Mythos
精选理由
精选 · 重要度 82 · 吸引力 + 知识量 + 共鸣
一句话点评
METR 测出 Claude Mythos 预览版能独立干 16 小时的活,但这是他们现有题目的天花板,再长就测不准了。
锐评
METR 在 3 月短暂窗口里测了 Claude Mythos 的早期预览版,结论是模型有 50% 概率独立完成的任务,时间跨度至少 16 小时,95% 置信区间在 8.5 到 55 小时之间。这个数字本身不算离谱,但关键信息是:这已经碰到 METR 现有测试套件的上限了。也就是说,不是模型只能干 16 小时的活,而是他们的题目最长就设计到这儿,再往上没法测。
正文没披露具体测了什么任务、任务难度怎么定义、以及模型是在什么条件下跑的。16 小时这个数,如果任务本身是重复性操作或者低难度堆积,意义就打折;如果是需要持续推理和决策的复杂流程,那才值得关注。另外,这只是早期预览版,正式版的能力可能更强,也可能因为安全对齐被砍掉一些。
现在还缺两样东西:一是 METR 需要设计更长周期的任务来突破天花板,二是需要知道模型在接近 16 小时边界时,失败模式是什么——是中间崩了、忘了目标,还是产出质量断崖式下跌。这些比一个孤零零的时间数字更有参考价值。
HKR 分解
hook ✓knowledge ✓resonance ✓