FEATUREDComputing Life · Share · 鸭哥调研· rssZH00:00 · 05·10
Anthropic 的 Computer Use 是怎么训练出来的——从一项专利读它的数据管线
Anthropic 一项专利披露了 Computer Use 的训练数据管线,核心不是录屏,而是把原始操作变成带推理链的数据。管线分三步:截获用户操作时允许附加思考标注,用多模态模型把点击坐标翻译成语义意图,再用更强的模型做合成扩展,一条真实轨迹变出几十条带推理变体的样本。学术数据集能训出跑 benchmark 的原型,但覆盖软件少、轨迹偏干净、缺少长...
#Agent#Tools#Reasoning#Anthropic
精选理由
精选 · 重要度 76 · 吸引力 + 知识量 + 共鸣
一句话点评
Anthropic 训练 Computer Use 的核心不是录屏,而是把点击坐标翻译成“为什么要点这里”的推理链,再用强模型一条变几十条。
锐评
这条专利讲清了 Anthropic 的 Computer Use 数据从哪来,以及为什么学术数据集训不出产品。关键差别在于,他们的管线把原始操作变成了带推理链的数据:先截获用户操作并允许附加思考标注,再用多模态模型把点击坐标翻译成语义意图,最后用更强的模型做合成扩展,一条真实轨迹变出几十条带推理变体的样本。
这解释了为什么 Claude 操作软件时显得更“懂”界面,而不是机械地重复坐标。但专利正文没披露这套管线实际产出了多大规模的数据,也没说合成样本的准确率如何验证。如果合成扩展引入了错误推理,模型反而会学到坏习惯。另外,管线依赖用户主动标注思考过程,这在实际采集中的覆盖率有多高,正文也没提。
对从业者来说,这条管线的价值在于它把数据采集从“录操作”变成了“采推理”。但别急着激动——专利保护的是流程组合,不是模型能力。能不能持续低成本地跑通这条管线,才是真正的护城河。
HKR 分解
hook ✓knowledge ✓resonance ✓