用于机器人策略学习的几何动作模型

arXiv: 2606.17046v1

论文信息

标题: Geometric Action Model for Robot Policy Learning

作者: Jisang Han, Seonghu Jeon, Jaewoo Jung, et al.

发布日期: 2026-06-15

arXiv ID: 2606.17046v1

PDF 链接: 下载 PDF

几何驱动的机器人策略新范式:三维世界模型赋能精确操控

研究背景与动机

让机器人像人类一样理解语言指令并操控任意物体,是人工智能的长期愿景。这一目标要求策略模型不仅识别物体和解析指令,还要推理物理世界在自身动作下的演变。换言之,机器人需要同时理解语言、视觉外观、场景几何、自身状态和物理动态。

近年来的研究主要沿着两条路线推进:视觉-语言-动作模型(VLA)将视觉语言模型改造为策略模型,利用其语义理解能力直接映射到机器人动作;视频世界-动作模型(WAM)则借助预训练视频生成模型的世界预测先验,联合预测未来帧和动作。尽管这些方法表现出令人印象深刻的语言条件操控能力,但它们都存在一个根本缺陷:本质上仍在二维空间中操作,深度、尺度、遮挡等三维线索被隐式地留给动作解码器自行解耦。这导致模型在相机视角变化、机器人初始状态等环境变动下泛化能力有限。

几何基础模型(GFM)的兴起为这一问题提供了潜在的解决方案。这类模型能从多视角图像中推理出稠密的三维结构,蕴含着丰富的空间理解先验。然而,现有工作仅将其作为静态特征提取器使用,通过特征蒸馏或附加轻量级动作输出层的方式,将部分几何信息注入 VLA 策略——GFM 的多层几何结构从未被真正整合为策略自身的时序和动作生成基底。

本文提出的几何动作模型(GAM)正是针对这一空白的突破性尝试。

核心方法:将几何基础模型改造为世界-动作模型

GAM 的核心思想极具创新性:直接复用预训练的几何基础模型,将其作为感知、未来状态预测和动作解码的共享基底。这种设计的关键在于对 GFM 的架构级改造。

架构拆分策略

GAM 在 GFM 的某一中间层处将模型一分为二:浅层作为观测编码器,深层作为解码器。具体而言,设分割层为 LsL_s,则编码器 ELs=f(Ls)f(1)E_{\leq L_s} = f^{(L_s)} \circ \cdots \circ f^{(1)} 负责从多视角 RGB 观测中提取空间结构化的场景表征;解码器 D>Ls=f(M)f(Ls+1)D_{>L_s} = f^{(M)} \circ \cdots \circ f^{(L_s+1)} 则接收预测的未来特征,进行进一步的几何传播和解码。

这种拆分需要精心选择 LsL_s 的位置:它必须足够深以提取丰富的视觉特征,但又必须浅于几何解码头所使用的最早层(Ls<m1L_s < m_1),以便预测的未来状态能够通过原有解码头恢复出三维结构。

因果未来预测器

在分割层处,GAM 插入一个因果 Transformer 预测器 gϕg_\phi,负责建模时间维度上的状态演变。对于上下文窗口内的每个时间步 tt',编码器提供几何隐状态 Zt(Ls)\mathbf{Z}_{t'}^{(L_s)},同时将本体感受状态 sts_{t'} 和历史动作 at1a_{t'-1} 通过轻量投影层嵌入为 token:

pt=ψs(st),qt=ψa(at1)\mathbf{p}_{t'} = \psi_s(s_{t'}), \quad \mathbf{q}_{t'} = \psi_a(a_{t'-1})

任务语言指令 \ell 则通过冻结的 T5 编码器提取为语言 token L\mathbf{L}_\ell。这些异构信息被拼接为统一的 token 序列,通过分块因果自注意力机制进行处理,确保模型仅利用过去和当前信息预测未来。

预测器的输出包含两部分:从几何 token 槽位读出的未来几何隐状态 Z~t+1(Ls)\tilde{\mathbf{Z}}_{t'+1}^{(L_s)},以及从动作槽位投影出的下一动作 token a~t\tilde{\mathbf{a}}_{t'}。这种联合预测设计确保了动作与空间表征的紧密交互。

特征传播与双头解码

预测的动作 token 被复制为与相机视角数相同的份额,并与几何 token 拼接后送入 GFM 的剩余深层解码器。这一特征传播过程不仅将动作信号注入几何表征空间,更重要的是利用了 GFM 深层预训练的多视图融合能力——原本用于将浅层特征解码为三维几何的参数,被重新用于解码世界模型预测的未来状态。

最终,两个轻量输出头分别完成任务:动作回归头汇聚上下文窗口内的动作 token,生成可执行的动作块 a^t\hat{a}_{t'};深度头则解码几何 token 为与动作对齐的未来深度图。

多任务训练目标

GAM 的端到端训练最小化三个损失项的组合:

Ltotal=λactLact+λfeatLfeat+λdepthLdepth\mathcal{L}_{\text{total}} = \lambda_{\text{act}}\mathcal{L}_{\text{act}} + \lambda_{\text{feat}}\mathcal{L}_{\text{feat}} + \lambda_{\text{depth}}\mathcal{L}_{\text{depth}}

其中 Lact\mathcal{L}_{\text{act}} 是动作回归的 L1 损失,Lfeat\mathcal{L}_{\text{feat}} 将预测的未来隐状态与冻结 GFM 提取的真实下一帧特征对齐,Ldepth\mathcal{L}_{\text{depth}} 则采用尺度不变和梯度匹配损失来监督解码的深度图。这种多任务设计使得策略同时学习执行动作、预测世界状态、维持几何一致性。

关键创新与贡献

GAM 的核心贡献在于重新定义了机器人策略与几何基础模型的集成方式。与现有方法相比,它具有三个突破性特点:

统一基底的时序推理。GAM 首次将 GFM 作为动作预测和世界建模的唯一共享骨架,而非外挂的特征提取器。预测、传播、解码全流程均在 GFM 的特征空间内完成,实现了 “几何-动作” 共训。

单次前向推理效率。动作和未来场景在同一自回归序列中预测,仅需一次前向传播即可同时输出动作块和未来深度图。这避免了扩散模型的多步去噪过程,使得 GAM 仅需 6.9 毫秒即可完成推理(约 145Hz),比扩散策略快 55 倍以上,同时以仅 1.4B 的参数规模超越了更大基线的性能。

稳健的几何泛化能力。通过显式利用三维先验并辅以特征和深度的未来监督,GAM 在相机视角扰动下展现了卓越的鲁棒性——在 LIBERO-Plus 基准的相机类别中,GAM 的成功率为 83.1%,较最佳基线提升 9.7 个百分点,有力证实了几何理解对于空间扰动的关键作用。

实验验证与关键发现

论文在模拟和真实世界两个维度进行了全面验证。

在 LIBERO 和 LIBERO-Plus 模拟基准上,GAM 在原始的 LIBERO 任务中取得了与 3.3B-7B 参数规模基线相媲美甚至更优的表现(97.6% 平均成功率),而在引入环境扰动的 LIBERO-Plus 上优势更加明显——平均成功率 85.5%,优于所有对比的 VLA、WAM 和几何增强 VLA 方法。特别是在最困难的相机扰动水平上,GAM 的优势持续存在。

在包含四个操控任务的真实世界评估中,GAM 在标准场景和相机扰动场景下均显著超越基线,证明其仿真中获得的几何鲁棒性能够有效迁移至物理执行环境。

消融实验揭示了几个重要发现:预训练对于鲁棒性至关重要——省略预训练会使 LIBERO-Plus 性能从约 90% 骤降至约 50%;但即使没有预训练,未来预测损失(特征损失和深度损失)仍能提供强大的几何监督信号,大幅提升域外泛化能力;分割层选择方面,Ls=12L_s=12 被验证为最优,过早或过晚插入预测器均会导致性能崩溃,这反映了预测特征需要充分通过深层交互以融入预训练的三维先验。

在量化交易和 AI 领域的应用启示

尽管 GAM 面向机器人操控设计,其核心设计原则对量化交易和广义 AI 系统具有深刻的启发意义:

金融市场中的几何建模。将 GAM 的 3D 几何先验思想迁移到金融领域,市场状态可类比为高维空间中的几何结构。通过预训练一个 “市场几何基础模型” 来编码多资产价格、波动率曲面等结构化信息,策略模型可获得对市场空间结构的内在理解,提升在极端市场条件下的稳健性。

多模态时间序列预测。GAM 的因果未来预测器设计提供了一个通用模板:在预训练编码器的中间层插入时序预测模块,利用冻结的基础表征进行未来状态预测。这适用于任何具有预训练基础模型和时序依赖的任务,例如结合宏观经济文本与市场数据的资产配置模型。

高效推理与低延迟系统。GAM 证明了一个重要理念:通过架构创新而非模型规模的膨胀,可以实现性能与效率的双赢。在量化交易中,毫秒级的延迟差异直接影响策略竞争力。GAM 的单次前向推理设计(非扩散、非自回归循环)为构建低延迟决策系统提供了技术参考。

未来发展方向方面,GAM 的语言理解能力受限于冻结的 T5 编码器,作者也指出集成大规模语言模型或外部推理模块是自然的下一步。对于金融 AI 系统,这意味着可以将金融领域的专有知识图或法律约束通过类似的模态注入机制整合进决策模型。此外,GAM 中特征损失和深度损失的双重监督范式启示我们:在金融市场预测中,同时监督中间表征的未来演变和最终预测目标的未来状态,可能比单纯端到端的行为克隆更为鲁棒。

总结与展望

几何动作模型代表了一种范式转变:从将基础模型视为黑盒特征提供者,到将其多维结构全面整合为策略的推理骨架。通过在单个几何基础模型中统一感知、未来预测和动作解码,GAM 以更小的模型尺寸、更快的推理速度,实现了比大规模 VLA 和视频世界模型更强的域外泛化能力。

这一工作最关键的技术洞见在于:预训练模型的多层结构蕴含了超越其原始训练目标的能力——GFM 并非只是三维重建器,其深层也可以被重新编程为时序世界模型和动作解码器。这种 “模块化复用” 的思路为通用具身智能的架构设计提供了新的方向。

展望未来,将 GAM 扩展到更复杂的语言推理、人机交互和多智能体协作场景,并结合更强大的语言模型,有望构建出真正理解物理世界并能灵活遵循人类意图的通用操控系统。其轻量高效的特性也为实际部署扫清了重要障碍,预示着几何驱动的机器人智能从实验室走向现实应用的可能。