面向机器人策略学习的几何动作模型
Geometric Action Model for Robot Policy Learning
论文信息
标题: Geometric Action Model for Robot Policy Learning
作者: Jisang Han, Seonghu Jeon, Jaewoo Jung, et al.
发布日期: 2026-06-15
arXiv ID: 2606.17046v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:当前的机器人视觉-语言-动作模型(VLA)和视频世界模型(WAM)主要在 2D 图像帧或 2D 隐空间中运行,缺乏接触密集型操作所需的对深度、尺度和遮挡的显式 3D 几何理解,导致在相机视角变化和环境扰动下泛化能力有限。
- 核心方法:提出几何动作模型(GAM),将预训练的几何基础模型(GFM)直接改造为共享的感知、未来状态预测和动作解码主干。通过在 GFM 的浅层和深层之间插入一个因果未来预测器,GAM 可以在 GFM 的几何隐空间中预测未来场景表征,并同时解码动作和未来 3D 几何。
- 关键结果:GAM 在推理延迟仅为 6.9 ms(比扩散模型 Cosmos Policy 快约 55 倍)和仅有 1.4B 参数的轻量级规模下,于 LIBERO-Plus 基准的相机扰动设置中比最佳基线高出 9.7 个百分点(表 1),并在真实世界实验中表现出更强的鲁棒性(图 4)。
- 主要局限:模型的语言推理和常识能力受限于所使用的冻结文本编码器,作者指出未来的一个自然方向是整合大语言模型或外部推理模块。
- 适合读者:适合从事机器人学习、具身智能、3D 视觉与策略学习交叉领域研究的学生和从业者阅读,特别是关注如何高效利用预训练模型、提升策略鲁棒性和环境泛化能力的读者。
论文背景和研究动机
构建能遵循自然语言指令并在多样化场景中操作任意物体的通用操作策略是机器人学的长期目标。近年来,该领域的进展很大程度上依赖于大规模基础模型,主要沿两条路径发展:视觉-语言-动作模型(VLA)和视频世界-动作模型(WAM)。VLA 基于视觉-语言模型,将视觉和语言令牌映射到机器人动作;WAM 则利用预训练的视频生成模型,使用其世界预测先验联合建模未来帧和动作。
尽管这些方法展现出令人印象深刻的语言条件操作能力,但它们存在一个根本性局限:它们在本质上是 2D 的。深度、尺度和遮挡等 3D 线索被隐式地留在单目线索中,动作解码器必须自行解耦这些信息,这导致了在环境变化(特别是机器人初始状态和相机视角变化)下的有限泛化能力。已有工作尝试融入 3D 几何信息,例如通过特征蒸馏将几何基础模型(GFM)的特征引入 VLA,或在 GFM 的最终特征上附加动作头。然而,这些方法仅将 GFM 用作静态特征提取器,其多层几何结构从未被用作策略自身的时间和动作生成基础。
GAM 正是在此背景下提出,其核心动机是:能否直接、完全地利用一个 GFM 作为操作策略的主干,使其不仅提取感知特征,还能在其几何特征空间中进行时序预测和动作解码?
核心方法和技术细节
GAM 的核心思想是将一个预训练的 GFM 分割为两部分,并在其间插入一个因果时序预测器,从而构建一个统一的、语言条件的世界-动作模型。
1. 观察编码器
GAM 复用 GFM 的浅层作为观察编码器。对于一个给定的分割层 ,GFM 的 Transformer 堆栈被分解为编码器 和解码器 。在多视角 RGB 观测输入下,编码器提取出富含几何信息的隐层表征 。
2. 因果未来预测器
这是 GAM 设计的核心。在分割层 处,论文插入一个名为 的因果 Transformer 预测器。该预测器接收由三部分拼接而成的每时间步令牌块:经投影的本体感知状态 、动作历史 ,以及编码器输出的几何特征 。所有时间步的令牌块再与语言指令令牌 一并输入 。
通过块因果自注意力机制, 预测下一时间步的隐层几何表征 ,并同时产生一个预测的下一动作令牌 。这种联合预测确保了动作与空间表征的紧密交互,并使 GFM 以最小的架构改动获得了语言条件的时序世界建模能力。
3. 特征传播与解码
此阶段旨在将预测的未来几何表征和动作令牌融为一体,并生成最终输出。预测的单一动作令牌 被复制为多份,分别与预测的未来几何令牌拼接,然后送入剩余的深层 GFM 块 进行特征传播。最后,输出的特征分别由一个轻量级动作回归头解码为可执行动作块 ,并由原始 GFM 的深度头解码为与动作对齐的未来深度图。
4. 训练目标
GAM 通过一个多任务目标函数进行端到端训练,损失函数由三部分组成:控制动作执行的 ,将预测的未来特征锚定在实际下一帧特征的 ,以及监督预测的未来深度图几何结构的 。
创新点和贡献
GAM 的工作主要有以下几个层面的创新和贡献:
-
统一的架构范式:这是最主要的创新。GAM 将感知、未来几何预测和动作解码统一在单个 GFM 主干中。这不同于以往任何工作(无论是仅用 GFM 做特征提取,还是独立的视频世界模型),它首次将 GFM 的内部表示过程直接用作策略的 “推理” 和 “预测” 过程(图 2 对比)。
-
共享令牌空间中的联合预测:GAM 证明动作和未来 3D 几何可以在一个自回归序列和一个主干前向传播中同时产生。这种在共享几何令牌空间中协同建模动作-世界动态的方式是新颖的。
-
高效且鲁棒:GAM 以 1.4B 参数的小模型(表 9)和单步前馈推理,实现了仅 6.9 ms 的极低延迟,比扩散模型 Cosmos Policy 快 55 倍(表 8)。在 LIBERO-Plus 的严格测试中,GAM 的总体成功率和抗扰动能力均显著超越参数量数倍于己的 VLA 和 WAM 基线(表 1),特别是在相机扰动下的 9.7 个百分点提升,直接验证了其内嵌的 3D 几何先验价值。
实验结果分析
论文在仿真和真实世界两类场景下进行了验证。
仿真基准:在 LIBERO 及更具挑战性的鲁棒性测试集 LIBERO-Plus 上进行了评估。结果(表 1)显示,在饱和的标准 LIBERO 任务上,GAM(97.6%)与最先进基线如 Cosmos-Policy(98.5%)、OpenVLA-OFT(97.1%)性能相当。然而在 LIBERO-Plus 上,GAM 的优势得以彰显:其性能下降幅度最小(仅-12.1%),而其他模型在相机、布局等扰动下成功率大幅下滑,甚至有的模型接近失效。这一对比有力地证明了显式 3D 几何先验对鲁棒泛化的关键作用。
消融研究提供了一些深入洞见:
- 预训练至关重要:移除预训练会严重损害 LIBERO-Plus 上的鲁棒性(表 2,成功率从~90% 降至 73.4%),但对标准 LIBERO 影响较小。
- 损失函数的作用:当使用预训练模型时,单独移除深度损失 或特征损失 影响不大,表明几何动态可能已被编码器捕获。但在无预训练的情况下,这些未来预测损失则成为强有力的几何监督信号(表 2,成功率最低为 50.0%)。
- 分割层位置:分割层 的位置至关重要,放在太浅或太深的层都会导致性能崩溃,只有放在合适的中层(如第 12 层)才能让预测的未来令牌充分与预训练的 3D 先验进行交互(表 3)。
真实世界实验进一步验证了上述结论。在四个操作任务中,GAM 不仅在常规设置下优于 和 Spatial Forcing 基线,更在外部相机被大幅移动(平移 85cm、旋转 45°)的极端 OOD 条件下,保持了远超对手的性能(图 4),证明了其方法在物理世界中的可行性和鲁棒性。
实践建议
对于希望在机器人策略中利用 3D 几何信息的研究者和工程师,可从 GAM 中获得以下实践启示:
- 深度利用预训练模型:不应仅将强大的预训练模型(如 GFM)视为黑盒特征提取器。将其内部 Transformer 层作为一个可介入的 “计算介质”,改造为策略主干的浅层编码器和深层解码器,可能比在顶层简单附加模块获得更本质的性能提升。
- 未来预测是一种强训练信号:即使在最终推理时不需要显式的未来几何输出,监督模型预测下一时刻的隐层几何特征()和深度图(),对于学习物理世界的动态规律、提升策略的环境鲁棒性非常有价值。当真实深度图不可得时,使用冻结的预训练 GFM 生成的伪标签也是一种可行方案。
- 单步前馈 > 扩散迭代:在追求低延迟的机器人控制场景下,考虑采用 GAM 式的单步自回归联合预测架构,而非需要多步去噪的扩散模型,可以在不牺牲精度和鲁棒性的前提下,获得数十倍的推理加速,这对于部署在机载计算资源受限的机器人上尤为关键。
- 构建混合数据集:GAM 的训练利用了大规模混合数据,包括真实机器人遥操作数据(Open X-Embodiment)和具有精确几何真值的仿真数据(MimicGen, RoboCasa365)。这种虚实结合的策略对于同时学习通用操作能力和精确 3D 动态是有效的。