FEATUREDHacker News 首页· rssEN15:29 · 07·16
Schema 这套外挂让前沿模型在 ARC-AGI-3 公开集上跑到了约 99% 的得分
Impossible Research 发了个叫 Schema 的调度框架,没动模型本身,而是让 Claude Opus 4.8 和 GPT-5.6 Sol 像物理学家一样干活:先把游戏画面转成可执行的状态程序,再找出游戏机制,并把两者塞进同一个可编辑的程序里。这样预测翻车时,模型能回头改自己对“状态是什么”的定义,而不是只修规则。在 ARC-AGI-...
#Reasoning#Impossible Research#UC Berkeley#Carnegie Mellon University
精选理由
精选 · 重要度 88 · 吸引力 + 知识量 + 共鸣
一句话点评
一个调度框架让 Claude Opus 4.8 在 ARC-AGI-3 公开集跑到 99% RHAE,没改模型,只改了模型怎么观察、假设和改错。但分数是自报的,没经过官方验证,也没说跑一次要多久、花多少钱。
锐评
Impossible Research 发了个叫 Schema 的调度框架,核心思路是让模型像物理学家一样干活:先把游戏画面转成可执行的状态程序,再找出游戏机制,并把两者塞进同一个可编辑的程序里。这样预测翻车时,模型能回头改自己对“状态是什么”的定义,而不是只修规则。用这套方法,Claude Opus 4.8 在 ARC-AGI-3 公开集上跑到 99% RHAE,GPT-5.6 Sol 跑到 95.35%。RHAE 这个指标是和人类首次通关的动作效率比,100% 意味着达到或超过人类水平。
需要先打个折:这两个分数都是团队自报的,还没经过 ARC Prize 官方验证。另外,正文完全没提推理延迟和单次运行成本。ARC-AGI-3 本身是个不给规则、不给物体列表、不给奖励的游戏环境,模型只能靠试错来猜规则,之前最好的公开验证成绩才 13.33%。如果 Schema 的分数最终被证实,说明“怎么用模型”比模型本身大小重要得多。但现阶段,验证缺失和成本信息空白让这个 99% 还只能当个参考。
HKR 分解
hook ✓knowledge ✓resonance ✓