BotOf TechAI / IoT / Full-Stack / 植物养护知识分享
返回首页Gemini Robotics 2 拆成三套模型后,具身智能开始有了真正的系统分层

Gemini Robotics 2 拆成三套模型后,具身智能开始有了真正的系统分层

Google DeepMind 在 7 月底公布 Gemini Robotics 2 时,最重要的信息不是人形机器人能系垃圾袋,也不是同一个模型 checkpoint 能控制多种机器人,而是它把“机器人智能”明确拆成了三种不同模型:

  • Gemini Robotics 2:把视觉与语言转成动作的 VLA,面向全身控制与精细操作;
  • Gemini Robotics ER 2:理解场景、拆解任务、调用工具、跟踪进度的高层具身推理模型;
  • Gemini Robotics On-Device 2:在机器人本地运行,并用少量样本适配新本体的动作模型。

这个分层比“一个大模型端到端控制机器人”的叙事更值得关注。真实机器人从来不是只有一个控制频率、一个失败边界和一种算力。自然语言目标可以几秒内调整,动作策略需要持续输出,碰撞保护和关节限位则必须在更硬的实时链路里工作。三套模型没有消除这些差异,但开始把差异变成产品边界。

三个模型对应三种时间尺度

可以把机器人控制粗略拆成四层:

层级核心问题典型输出失效后果
任务编排现在要完成什么、下一步是什么子任务、工具调用、成功条件做错事、漏步骤、陷入循环
学习策略在当前视觉和状态下怎样动作action chunk、目标位姿、技能参数动作失败、碰撞风险上升
经典控制怎样稳定跟踪目标速度、力矩、阻抗控制抖动、失稳、超调
硬安全哪些动作无论如何都不能发生限位、急停、安全速度人身与设备事故

Gemini Robotics ER 2 更接近第一层;Gemini Robotics 2 与 On-Device 2 主要进入第二层。第三、第四层仍然需要机器人控制器、安全 PLC、碰撞检测、关节限制和经过验证的停止链路。

这也是判断具身智能新闻时最重要的边界:VLA 能生成动作,不等于它应当直接拥有电机最终控制权;高层模型能识别人靠近,不等于可以取代独立安全传感器。

ER 2 的真正进步,是从“会规划”走向“知道进行到哪了”

长任务失败经常不是不会规划,而是系统不知道现实是否按计划发生。模型说“拿起水壶”,夹爪可能抓空;说“拧紧灯泡”,视觉上看起来接触了,实际还没有达到终止状态。若系统只按预先步骤向下执行,前面的小错会在后面放大。

ER 2 使用连续视频理解任务开始、结束和关键事件,能够跟踪数分钟、包含数百次决策的任务,并在失败后修正。官方公布的进度分类准确率为 57.4%,比几种对比模型高,但这个数字也说明问题远未解决:接近四成的进度状态仍可能被分错。

生产系统不能把“模型认为完成”直接写成业务完成。更可靠的完成判据应该分层:

  1. 视觉语义判据:对象是否出现在目标位置;
  2. 几何判据:位姿误差、插入深度、门是否闭合;
  3. 物理判据:力矩、重量、电流、压力或声音是否符合工艺窗口;
  4. 流程判据:前置步骤、质量记录和下游确认是否完整。

模型适合融合弱信号和解释异常,强验收仍应尽量落到传感器与确定性规则。

全身控制的难点,不是把手臂接到腿上

过去的桌面操作默认机器人底座不动,机械臂在固定工作空间内抓取。全身任务会把行走、重心、可达性、自碰撞和操作力耦合起来:机器人为了够到低层货架需要迈步、下蹲、伸手,同时保持支撑多边形和夹爪视野。

这不是“导航完成后再抓取”的简单串联。每次迈步都改变机械臂基座坐标,每次搬起物体都改变质量分布,狭窄空间还会让最短路径与可操作姿态冲突。系统至少需要:

  • 全身状态估计与统一坐标系;
  • 接触和质心约束;
  • 移动与操作联合的可达性评估;
  • 动作策略之外的碰撞与关节限制;
  • 失败时可退回稳定姿态的恢复技能。

官方展示中,同一 checkpoint 控制 Apollo 2 的不同手部配置和 Franka Duo,证明了跨本体共享能力的方向。但公布数据也呈现出明显差异:两指夹爪的精密插入达到 89.6%,多指手任务里拧下灯泡为 92%,而拧入灯泡、系垃圾袋、使用簸箕和封 Ziplock 等任务只有约 32%–44%。

这组差距比单个高分更有信息量。刚性夹爪、明确接触和固定工装仍然最接近生产;柔性物体、多指接触和中途遮挡依然是长尾区。

少于 200 个样本适配新本体,降低的是迁移门槛,不是验证成本

On-Device 2 被设计为在断网或低延迟要求下本地运行。官方称它可以用数小时数据、通常少于 200 个示例适配形状、传感器和自由度明显不同的新双臂机器人。

这是很强的工程信号:行业开始把“换一台机器人就重训全部策略”变成“基础能力 + 小样本本体适配”。但 200 个示例回答的是模型适配量,不是系统验收量。

新本体仍需重新确认:

  • 相机内外参和时间同步;
  • action space、关节方向、速度与力矩单位;
  • 工作空间、自碰撞和负载边界;
  • 推理最坏延迟、抖动和过期动作处理;
  • 电量、温度、网络与传感器退化时的回退;
  • 未见对象、反光、遮挡和人为干扰下的失败分布。

“快速适配”更像缩短技能冷启动,而不是拿到一张可以直接进现场的安全证书。

多机器人协同首先是分布式系统问题

ER 2 可以根据不同机器人能力分工,让多个机器人完成单机难以完成的任务。这会把具身智能从单机策略推到车队级 Agent,但多一个机器人,不只是多一个执行器,还会多出共享状态、资源竞争和通信失败。

例如一台移动机器人负责搬运,一台双臂机器人负责整理。高层计划必须回答:物体的所有权属于谁;区域是否被占用;对方状态多久没更新就算失联;任务取消后谁释放空间;两台机器人对同一障碍的认知冲突时听谁的。

最小可用的协同控制面至少要有:

  • 带版本与时间戳的共享任务状态;
  • 区域、工位和对象的 lease,而不是永久锁;
  • 幂等的任务接收和完成回执;
  • 心跳、超时、重分配和人工接管;
  • 地图、坐标和语义对象的版本兼容;
  • 每台机器人独立的局部安全权,不能等待云端共识才急停。

多机器人模型能提出分工,调度系统必须保证分工在断网、重复消息和局部失败下仍然收敛。

安全 benchmark 是能力证据,不是安全认证

DeepMind 同时推出 ASIMOV-Agentic,用于评估高层 Agent 拒绝不安全 VLA 工具调用、判断任务是否可行,以及不确定时请求人工介入。官方页面给出的 ER 2 安全指令遵循准确率为 97.9%,1 米人员接近场景为 93.0%。

这些结果值得肯定,但不能直接换算成现场事故概率。benchmark 的场景分布、传感器、速度、负载和故障注入与真实工位不同;一个 3% 的失败率用于内容问答可能可接受,用于每天重复数万次的接触动作就完全不同。

更稳妥的安全结构是:

  • AI 层负责理解意图、预测风险、主动求助;
  • 技能层只暴露经过约束的动作原语;
  • 控制层执行速度、力、空间和状态限制;
  • 独立安全层拥有最终停止权;
  • 部署流程通过场景回放、仿真、影子模式和分阶段放量积累证据。

怎样把三模型结构落到自己的机器人

不必等到所有模型公开才能采用这个分层。现在就可以把项目接口设计成:

Task API      -> 目标、优先级、完成标准、权限
Skill API     -> navigate、pick、place、open、inspect
Policy API    -> observation、action chunk、confidence、valid_until
Control API   -> trajectory、force limit、stop reason
Evidence API  -> video span、sensor trace、result、failure code

然后用现有 VLM 代替 ER 层、已有 VLA 或模仿学习策略代替动作层、ROS 2/控制器承担执行。接口稳定后,模型可以替换,安全和证据链不需要跟着重写。

验收时不要只统计“任务成功率”。还要记录:每个步骤的进度判断准确率、人工接管率、恢复后成功率、动作过期率、P95/P99 推理延迟、近碰次数、硬安全触发次数,以及不同本体和场景的分布外失败。

趋势判断:具身基础模型正在从单模型竞赛进入运行时竞赛

Gemini Robotics 2 的三模型结构释放了一个清晰信号:下一阶段的竞争不会只是 VLA 参数规模,而是高层推理、端侧动作、经典控制、安全链路、数据回流和多机器人控制面能否组成一个稳定运行时。

高层模型越强,越需要把低层技能做成可观察、可取消、可验证的工具;端侧模型越通用,越需要把本体描述、标定和动作约束标准化;多机器人能力越强,越需要成熟的分布式状态与故障恢复。

机器人不是长了手脚的聊天机器人。真正的具身智能,会表现为不同时间尺度的系统能够在现实扰动下协调工作,并且在模型判断错误时,物理世界仍然有可靠的最后一道门。

参考资料