FEATUREDComputing Life · Share · 鸭哥调研· rssZH00:00 · 08·09
Gemini Robotics 2 把感知和规划合进一个模型,但把动作控制单独留给了底层
Google 在 2026 年 8 月发了 Gemini Robotics 2 系列,分三层:云端 ER 2 负责看懂画面和推理步骤,但只输出文字和函数调用,不直接控制电机;VLA 模型负责把指令变成动作;On-Device 2 直接跑在硬件上。这种拆分不是倒退,是物理世界逼的。大模型跑不了 200 Hz 的高频控制,小模型又塞不进通用常识。On-De...
#Google DeepMind#Gemini Robotics 2#Gemini Robotics ER 2
精选理由
精选 · 重要度 78 · 吸引力 + 知识量
一句话点评
Google把机器人大脑拆成三层,高层管思考、底层管动作,这不是技术倒退,是物理世界逼的。端侧模型用不到2小时的示范数据就把成功率从6.7%拉到53.3%,但拧灯泡和扫地这种精细活还是不行。
锐评
这篇文章最值得看的地方,是它把“为什么大模型不能直接控制电机”这个直觉上的困惑讲清楚了。核心矛盾在于频率:高层推理模型每秒只能处理1帧画面,而底层动作控制需要跑到200Hz甚至1kHz,现有算力下,一个模型没法两头兼顾。所以Google的方案是让云端ER 2当“调度指挥官”,看懂场景、输出文字指令和函数调用,把具体的关节角度和运动轨迹交给下层的VLA模型去执行。这种高低频分离,就像人的大脑皮层和小脑的分工,是物理约束下的务实选择。
文章里几个数字值得留意:On-Device 2模型在SO101本体上,每任务只用0.25到1.7小时的示范数据,成功率就从6.7%冲到了53.3%,说明小样本适配这条路走得通。但一碰到柔性操作就露怯——拧入灯泡只有36%,扫进簸箕32%,系垃圾袋44%,说明精密力控和软体接触依然是硬骨头。文章还提了一个挺有用的概念叫“本体接入税”,把接入新硬件的综合成本拆成了数据采集、模型微调、延迟适配和安全认证四块,这比单纯炫耀适配了多少种机械臂要实在得多。
不过文章也有明显的信息缺口:ER 2的推理延迟到底是多少?Gemini Robotics 2的控制频率是多少?这些直接影响工程落地的关键指标,正文都没披露。另外,所有测试数据都来自Google自己的实验室环境,生产级的可靠性和长时运行的稳定性还没验证。所以On-Device 2那个53.3%的成功率,可以先打个折看——从实验室到工厂流水线,中间还隔着大量边缘异常处理和物理安全认证的坑要填。
HKR 分解
hook ✓knowledge ✓resonance —