FEATURED机器之心 · 公众号· rssZH07:30 · 06·03
蚂蚁灵波在 RSS 2026 提出首个自回归因果世界模型,用 50 条演示数据就能让机器人学会通用操控
蚂蚁灵波和港科大搞了个叫 LingBot-VA 的模型,把“预测画面接下来怎么变”和“判断该做什么动作”合到一个自回归框架里。论文说,每个任务只用 50 条真实世界的演示数据微调,在 RoboTwin 2.0 的简单和困难设定下,成功率分别到了 92.0% 和 91.1%。不过原文因为微信环境异常没抓到,具体实验细节和泛化边界暂时看不到,这个成功率数字...
#Robotics#Reasoning#Multimodal#Ant Lingbo
精选理由
精选 · 重要度 78 · 吸引力 + 知识量 + 共鸣
一句话点评
蚂蚁灵波和港科大搞了个模型,用50条真实演示就能让机器人学会新任务,成功率超90%。但原文没抓到,具体怎么测的、泛化能力如何都看不到,这个数字先打个折。
锐评
这条新闻最吸引人的点是“50条数据就能训出一个能用的机器人操控模型”。LingBot-VA 把“预测画面变化”和“决定动作”合在一个自回归模型里,相当于让模型一边看视频猜接下来会发生什么,一边想自己该怎么动。论文在 RoboTwin 2.0 的简单和困难设定下分别拿到 92.0% 和 91.1% 的成功率,如果数据真实,说明小样本微调的效果确实不错。
但问题在于,原文因为微信环境异常没抓到,我们看不到实验的具体设置。比如这 50 条演示数据覆盖了多少场景变化、测试任务和训练任务的相似度有多高、失败案例长什么样,这些都不知道。机器人操控里,换一个桌面背景、光照角度或者物体摆放位置,成功率就可能大幅波动。没有这些信息,91% 这个数字的参考价值要打折扣。
另外,模型叫“自回归因果世界模型”,但正文没解释它怎么处理因果关系,是学了物理规律还是纯靠关联。如果只是拟合视频和动作的统计规律,那离真正的“世界模型”还有距离。建议等论文全文公开后,重点看它在没见过的环境里表现如何,以及那 50 条数据到底有多“通用”。
HKR 分解
hook ✓knowledge ✓resonance ✓