学习面向跨形态机器人操作的动作先验

arXiv: 2606.26095v1

论文信息

标题: Learning Action Priors for Cross-embodiment Robot Manipulation

作者: Dong Jing, Tianqi Zhang, Jiaqi Liu, et al.

发布日期: 2026-06-24

arXiv ID: 2606.26095v1

PDF 链接: 下载 PDF

从 “学会移动” 到 “眼手协同”:解析跨具身机器人操作中的动作先验学习框架

论文背景与研究动机

近年来,视觉-语言-动作模型(Vision-Language-Action, VLA)已成为机器人操作领域的核心范式。这类模型以强大的视觉-语言基座模型(VLM)为骨干,通过附加动作模块实现从感知到控制的端到端学习。然而,当前 VLA 的成功主要依赖视觉与语言模态的丰富先验,而动作生成模块本身却缺乏可比的物理运动先验知识,这如同一名学徒在未掌握基本动作的情况下,就直接被要求完成 “看到目标并执行” 的复杂任务。

这种不平衡在标准 VLA 训练流程中制造了一个关键瓶颈:VLM 骨干已编码丰富的语义结构,但动作模块通常从随机权重或无关模态迁移的参数初始化,迫使模型在早期优化中同时学习动作分布和跨模态对齐。当动作头部训练不足时,向 VLM 回传的梯度可能不稳定且结构混乱,干扰基座模型的已有表征,延缓收敛。这一问题在跨具身设定下更为严峻,因为不同机器人平台的动作空间、运动分布和控制规范差异巨大。

针对这一困境,论文提出了一个两阶段训练框架:在 VLA 跨模态对齐之前,先为动作模块进行独立的动作先验学习。核心思想可以概括为 “先学会移动,再学会看和行动”——如同蒙眼学徒先练习基本动作,掌握运动的本质时序结构,然后再结合视觉与语言指令完成复杂任务。

核心方法:动作先验的习得与迁移

第一阶段:无条件的动作先验学习

论文设计了一个基于流匹配(Flow Matching)的编码器-解码器动作模块来获取动作先验。这一阶段的关键特征在于不使用任何视觉观察或语言指令,仅从原始的动作轨迹数据中学习。

动作编码器将跨时间的状态-动作序列压缩为单一隐向量 zz。具体而言,输入序列将机器人的本体感知状态 ss 与动作 aa 交错排列为 τ=[st,at,st+1,at+1,]\tau = [s_t, a_t, s_{t+1}, a_{t+1}, \ldots],通过 Transformer 架构聚合全局时序依赖,提取宏观的运动语义。为了处理不同具身平台之间的异构性,模型在序列前添加可学习的数据集嵌入标记(soft-prompt tokens),用于消歧平台特定的动作语义。

动作解码器则采用流匹配范式,以 zz 为条件重建原始动作块。流匹配通过在标准高斯噪声与真实动作之间构建概率路径来建模连续动作分布,其训练目标为预测速度场 vr=aϵv_r = a - \epsilon

Lrecon=Dϕdec(xr,r,z)vr2\mathcal{L}_{recon} = ||D_{\phi_{dec}}(x_r, r, z) - v_r||^2

这种设计使解码器能够灵活地对连续、潜在多模态的动作分布进行建模,为后续 VLA 训练奠定稳定的生成基础。更重要的是,第一阶段仅使用轻量级的 Qwen3-0.6B 骨干,不处理图像或语言 token,支持 8 倍大的批次规模,训练仅需 2 小时,是一种极为高效的动作校准过程。

第二阶段:先验迁移与早期蒸馏

习得的动作先验通过三种紧密关联的方式迁移至 VLA 训练:

一是解码器复用。第一阶段的解码器直接作为 VLA 的动作头部,其参数已蕴含合理的机器人运动模式,避免了从随机初始化开始的困难。

二是早期潜在蒸馏。编码器为 VLM 预测的动作嵌入提供结构化的教师信号。给定真实轨迹,编码器提取隐向量 zz,监督 VLM 预测的嵌入 zz',通过对齐损失 Lalign=zsg(z)2\mathcal{L}_{align} = ||z' - \mathrm{sg}(z)||^2 将 VLM 快速锚定到动作隐空间。该约束随训练步数线性衰减,在前期提供关键引导,后期释放以允许端到端策略精炼。

三是历史压缩。编码器同时作为紧凑的历史压缩器,将过去的状态-动作轨迹映射为单一隐 token zhistz_{hist},注入 VLM 输入。这使得策略获得更广阔的时序感受野,能以极小的计算代价感知机器人的历史运动状态。

创新贡献与实验验证

论文的主要贡献可归纳为三方面:其一,明确识别了 VLA 训练中动作先验缺失的结构性瓶颈,提出了解耦式的两阶段框架;其二,设计了基于流匹配的编码器-解码器架构,将动作先验以潜在嵌入的形式习得并迁移;其三,在覆盖模拟与真实环境的 13 个跨具身任务上进行了广泛验证。

实验设置了极具挑战性的跨具身训练协议:所有模型在 LIBERO、RoboCasa GR1 和真实 Franka 平台的多具身数据混合体上联合训练,并在各基准上进行无微调的评估。真实世界任务仅占总训练帧的 7.6%,天然构成了数据稀缺的长尾测试场景。

结果表明,动作先验学习带来了三项一致的优势。首先,更快收敛与更高成功率。动作-状态先验将整体平均成功率从 55.3% 提升至 64.9%,加入历史压缩后进一步提升至 68.0%。训练动态分析显示,有先验的模型初始预测损失降低近 8 倍,梯度范数降低近 16 倍,优化过程显著更稳定。

其次,显著改善长尾真实场景表现。在真实 Franka 平台的四项任务上,动作先验使平均成功率从 35.0% 提升至 61.3%,加入历史后达到 66.3%。尤其在 “堆叠杯子” 任务上,无先验的模型频繁在抓取后停滞,而完整模型能以 75-80% 的成功率果断完成任务。定性分析揭示了行为差异:无先验策略的运动轨迹不稳定、易犹豫,如同 “不熟悉自身臂体”;有先验的策略则运动流畅精准,因为 VLA 阶段主要学习将任务与已掌握的运动模式匹配。

第三,良好的可扩展性。将第一阶段动作数据扩大约 4 倍(至 230 万帧转换)后,下游 VLA 性能进一步提升,表明更强、更广的动作先验可直接迁移为更优的策略表现。这一阶段的额外成本(约 2 小时)在 VLA 训练中迅速摊销,验证了动作先验学习的高效性与扩展潜力。

消融研究进一步揭示了设计选择的合理性。将本体感知状态纳入动作编码器输入可提升复杂具身(如 GR1 人形机器人)的性能,因为状态信息将相对动作增量锚定到绝对身体构型。编码器压缩的历史信息远优于朴素 MLP 投影(71.5% vs. 68.4%),证明结构化运动嵌入比原始数值序列更易与视觉-语言特征融合。蒸馏步数的实验则展示了清晰的权衡:过早停止未充分利用先验,过晚约束则限制 VLM 的表征精炼,5,000 步的衰减阈值提供了实用的平衡。

实践应用与未来方向

这一框架为构建通用型机器人操作策略提供了明确的实践路径。在实际部署中,建议将动作数据的收集与视觉-语言数据分离:优先积累大规模、多样化的动作轨迹数据用于先验学习,即使这些数据不包含完整的视觉-语言标注。这种解耦策略显著降低了数据获取成本,因为纯粹的运动数据更易通过遥操作或仿真大规模采集。

对于资源受限的应用场景,轻量级的第一阶段训练以极小的时间代价换取 VLA 训练的显著加速和性能提升,是一种高性价比的策略初始化方法。历史压缩机制则在长时序操作任务中特别有价值,能以固定大小的 token 为策略提供丰富的时序上下文,避免直接暴露原始轨迹序列带来的计算和建模负担。

未来研究可沿两个方向深化。一是将动作先验学习扩展至更大规模的动作数据中心,探索跨更多具身类型和运动模式的泛化能力。二是研究更精细的先验迁移策略,例如在蒸馏衰减过程中引入自适应机制,根据任务难度或模态对齐程度动态调整约束强度。此外,将动作先验与基于视频的动态表征学习方法结合,可能进一步桥接 “运动理解” 与 “视觉感知” 之间的鸿沟。

总结

这篇论文从 VLA 训练的一个根本性问题出发——动作模块缺乏运动先验——提出了引人深思的解决思路:让模型先学会 “如何移动”,再学习 “如何看和行动”。通过流匹配编码器-解码器架构习得的结构化动作先验,不仅加速了跨模态策略学习的收敛,更在数据稀缺的真实场景中展现出实质性优势。这一工作的核心启示在于:在追求通用的视觉-语言-动作模型时,不应仅依赖视觉与语言的丰富先验,为物理运动本身构建独立的归纳偏置同样至关重要。正如论文所展示的,一个 “蒙眼” 预训练的动作模块,能为 “睁眼” 的策略学习奠定坚实而高效的起点。