面向跨体现机器人操作的动作先验学习

Learning Action Priors for Cross-embodiment Robot Manipulation

arXiv: 2606.26095v1

论文信息

标题: Learning Action Priors for Cross-embodiment Robot Manipulation

作者: Dong Jing, Tianqi Zhang, Jiaqi Liu, et al.

发布日期: 2026-06-24

arXiv ID: 2606.26095v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:当前的视觉-语言-动作(VLA)模型大多将视觉-语言先验交给基础 VLM,而动作模块只能从随机初始化开始学习物理运动,尤其在动作分布差异大的跨具身场景中,导致训练前期需同时解决动作分布建模与跨模态对齐,收敛缓慢且不稳定。
  • 核心方法:提出两阶段训练框架——第一阶段仅使用无条件动作轨迹训练一个基于流匹配的编码器-解码器动作模块,使其学会动作分布与时序结构;第二阶段通过复用解码器、早期潜在蒸馏以及历史轨迹压缩,将动作先验轻量地注入 VLA 训练。
  • 关键结果:在 13 个跨具身任务上,引入动作先验后总体成功率从 55.3% 提升至 68.0%(表 III),真实机器人长尾任务成功率从 35.0% 升至 66.3%,且早期 VLA 预测损失降低了约 8 倍(图 5)。
  • 主要局限:论文未深入讨论局限性,但方法强依赖于第一阶段有足够覆盖的动作轨迹数据;蒸馏超参数(NdecayN_{decay})对性能有影响(图 6),需要调节。
  • 适合读者:从事机器人操作、VLA 模型、跨具身策略训练的研究者与工程师。

论文背景和研究动机

当前主流的视觉-语言-动作模型通常将动作预测头附加到视觉-语言基础模型之上,然后联合端到端训练。基础 VLM 从海量图文数据中获得丰富的语义先验,但动作模块几乎都是从随机权重开始,只能在模仿学习过程中从零学习物理运动的时间动态。这种缺失的 “动作先验” 造成了严重的优化瓶颈:早期训练阶段,动作模块既要学习连续动作分布,又要对齐视觉、语言特征,两个任务耦合导致梯度不稳定、收敛缓慢,并有可能拖累 VLM 已有的良好表征。

在跨具身场景下,问题被进一步放大。不同机器人平台的动作空间、状态维度、运动风格差异巨大,模型需要同时适应多种动作分布。若动作模块不具备任何运动结构知识,早期的梯度将极不规则,导致拟合数据充分的仿真任务过度吸收模型容量,而数据稀缺的真实世界长尾任务则难以得到有效学习。作者正是从这一不平衡出发,认为一个合理的机器人学习范式应当先 “学会移动”,再 “学会看与听指令”,因此提出在 VLA 训练之前引入独立的动作先验学习阶段。

核心方法和技术细节

第一阶段:从动作轨迹学习动作先验

第一阶段的目标是让动作模块在没有视觉观测、没有语言指令的条件下,仅通过状态-动作轨迹学会动作分布与运动中的时序结构。为此,作者设计了一个基于流匹配的编码器-解码器动作模块。

  • 输入构造:将机器人本体状态 ss 与动作 aa 交错排列为轨迹序列 τ=[st,at,st+1,at+1,… ]\tau = [s_t, a_t, s_{t+1}, a_{t+1}, \dots]。为处理跨具身差异,序列前会添加可学习的数据集软提示(dataset embeddings)以区分不同的平台,并额外添加一个可学习的 clscls 令牌。
  • 编码器:基于 Transformer 的编码器 EϕencE_{\phi_{enc}} 将整条轨迹压缩为单个 ℓ2\ell_2 归一化的潜在动作嵌入 zz。zz 被训练来提取 “在一段时间跨度上组合而成的宏观运动语义”(平移、旋转、抓取等)。
  • 解码器与流匹配重建:解码器 DϕdecD_{\phi_{dec}} 以 zz 为条件,通过流匹配目标重建原始动作块。具体来说,随机噪声 ϵ\epsilon 与真实动作 aa 线性插值构造 xr=ra+(1−r)ϵx_r = r a + (1-r)\epsilon,速度场目标为 vr=a−ϵv_r = a - \epsilon。模型学习预测速度场:Lrecon=∥Dϕdec(xr,r,z)−vr∥2\mathcal{L}_{recon} = \| D_{\phi_{dec}}(x_r, r, z) - v_r\|^2。流匹配使模型能够灵活地建模连续甚至多模态的动作分布。

该阶段不使用任何图像或语言输入,完全在动作空间中学习,从而将动作先验建立为分布建模和时序抽象两个维度的能力。

第二阶段:注入动作先验的 VLA 训练

获得动作先验后,第二阶段进行标准的 VLA 训练。VLM 骨干(Qwen3-VL-2B)接收视觉观察 oto_t、语言指令 ltl_t、数据集软提示以及一个可学习查询令牌 qq,输出预测的动作潜在嵌入 z’z’。动作解码器直接复用第一阶段训练好的权重,以 z’z’ 为条件生成动作。除此以外,方法通过三种机制将动作先验深度整合进 VLA 训练:

  1. 解码器复用:动作头不再随机初始化,而是继承一个已经懂得 “如何移动” 的解码器网络,大幅降低动作预测的初始难度。
  2. 早期潜在对齐蒸馏:对于每条轨迹,编码器提取真实动作嵌入 zz(不参与梯度更新),模型对预测的 z’z’ 施加 ℓ2\ell_2 对齐损失 Lalign=∥z’−sg(z)∥2\mathcal{L}_{align} = \|z’ - \mathrm{sg}(z)\|^2。同时保留以 zz 为条件的 Lrecon\mathcal{L}_{recon} 作为辅助损失,以维持动作潜在空间的几何结构。这两个损失通过线性衰减的系数 λ(k)=max⁡(0,1−k/Ndecay)\lambda(k) = \max(0, 1 - k/N_{decay}) 逐步降低权重,只在训练初期(前 NdecayN_{decay} 步)发挥引导作用,后期完全交由端到端预测损失主导。
  3. 历史轨迹压缩:第一阶段的编码器还被用作紧凑的历史压缩器。它将过去 HhH_h 步的状态-动作轨迹压缩为单个历史令牌 zhistz_{hist},注入 VLM 输入,为策略提供更大的时间感受野。训练时同时计算有/无历史令牌的两路损失并求均值,防止策略过度依赖历史线索。

整体 VLA 损失函数为:

L=Lpred+λ(k)(Lalign+Lrecon)\mathcal{L} = \mathcal{L}_{pred} + \lambda(k)(\mathcal{L}_{align} + \mathcal{L}_{recon})

其中 Lpred\mathcal{L}_{pred} 是基于 z’z’ 的流匹配动作预测损失。

创新点和贡献

  • 识别并缓解动作先验缺失瓶颈:首次在跨具身 VLA 训练中明确指出,动作模块缺乏结构化运动知识会严重拖累早期优化,且对长尾任务影响尤为突出。
  • 两阶段解耦框架:将 “学习移动” 与 “学习感知与听从指令” 分开,第一阶段仅利用低开销的无条件动作数据,即可高效地为第二阶段提供强先验。
  • 流匹配动作模块设计:采用流匹配而非标准扩散或回归,提供灵活的动作分布建模能力。
  • 三种动作先验迁移手段:解码器复用、可衰减的潜在蒸馏以及历史压缩,形成一个从初始化、表示对齐到上下文增强的完整方案,且历史压缩仅需一个令牌,计算开销极小。
  • 数据规模转移:论文表明,即使第一阶段和第二阶段 VLA 训练配置完全不变,仅通过增大第一阶段的无条件动作数据量(从 56.5 万过渡到约 230 万),就能直接提升下游 VLA 性能,展示了动作先验的可扩展性(图 7)。

实验结果分析

实验覆盖了 13 个跨具身任务:仿真环境 LIBERO(空间、物体、目标、长期四个套件)和 RoboCasa GR1(五项桌面任务),以及真实 Franka 机械臂的四项拾取放置任务。所有模型在混合数据上联合训练,不再进行环境特定微调。

  • 总体性能:同构设置下,无动作先验的方法平均成功率为 55.3%;引入动作-状态先验后提高至 64.9%;加入历史压缩后的完整模型达到 68.0%。完整模型相比 GR00T(48.6%)和 π0.5\pi_{0.5}(53.8%)有明显优势(表 III)。
  • 长尾任务收益:真实世界任务仅占总训练帧的 7.6%,属于典型的长尾分布。没有动作先验时成功率仅为 35.0%;使用动作-状态先验后跃升至 61.3%,加入历史达到 66.3%。尤其在 “叠杯子”“抓可乐” 等最难任务中,动作先验几乎将成功率从个位数拉至实用水平。
  • 训练动态:对比训练前 3000 步,无先验的初始预测损失约为 7.1,有先验后降至约 0.9,降低近 8 倍;梯度模长也从约 1400 骤降至约 90(图 5),说明动作先验大幅平稳了早期优化过程。
  • 消融研究:在动作编码器中加入本体状态信息(而非仅动作)可进一步提升性能(平均 68.3% 对比 65.4%),对高维 GR1 平台尤其明显。使用编码器压缩历史比简单 MLP 投影有效得多(71.5% vs 68.4%)。蒸馏步数在 5000 步时整体最优,过短则先验利用不充分,过长会约束 VLM 的后期精细化(图 6)。
  • 先验数据规模:在固定第二阶段 VLA 训练的前提下,扩大第一阶段动作数据集(约 4 倍),直接让最终成功率从 68.3% 提升至 68.8%,且收敛更快,说明动作先验知识可以随数据扩展而迁移增益。

实践建议

如果希望在跨具身 VLA 项目中引入动作先验,可以参考以下实践路径:

  1. 先独立训练动作自编码器:收集所有目标具身的离线轨迹,剥离图像与语言,只保留状态-动作序列。使用基于流匹配的编码器-解码器(类似文中)或扩散概率模型,在输入中添加平台区分软提示。该阶段硬件要求低,可使用小模型训练,仅消耗 VLA 训练约 10% 的算力。
  2. 复用解码器:VLA 的动作头直接加载第一阶段解码器权重,不要随机初始化。即便后续不再使用蒸馏损失,仅此一步也能大幅加速收敛。
  3. 早期蒸馏要设衰减:若在 VLA 训练中引入编码器潜在蒸馏,务必使用线性衰减至零的策略,推荐 NdecayN_{decay} 设在总训练步数的 10%–15% 左右(文中 5k/50k)。持续蒸馏会限制 VLM 对视觉-语言特征的适应。
  4. 引入历史压缩:对于长周期任务,利用训练好的编码器将历史状态-动作序列压缩为一个令牌,插入 VLM 输入序列。此方法计算开销极低,但能提供关键的时间上下文,减少策略在决策点(如抓取前)的犹豫。
  5. 扩展动作数据:如果拥有额外的、仅包含动作记录的机器人数据(如多来源的动作数据集),可将其全部加入第一阶段,不增加 VLA 主训练负担,却可能直接提升下游性能。动作先验的可扩展性是这一框架的重要优势。