CoorDex:协调身体与手部先验以实现连续灵巧人形机器人移动操作

CoorDex: Coordinating Body and Hand Priors for Continuous Dexterous Humanoid Loco-Manipulation

arXiv: 2606.23680v1

论文信息

标题: CoorDex: Coordinating Body and Hand Priors for Continuous Dexterous Humanoid Loco-Manipulation

作者: Sikai Li, Shuning Li, Zhenyu Wei, et al.

发布日期: 2026-06-22

arXiv ID: 2606.23680v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:这篇论文要解决人形机器人在持续移动过程中,同时进行高自由度灵巧手操作的问题。现有系统通常将 “行走” 和 “操作” 分离为停止-操作-再行走的模式,难以实现边走边操作的连续行为。
  • 核心方法:提出 CoorDex,一个分离身体与手部先验、并通过协调的潜在残差策略将它们组合的强化学习管道。身体先验负责移动与手腕定位,手腕稳定的手部先验负责手指协调,下游残差策略在紧凑的潜在空间中同时修正两者。
  • 关键结果:在边走边抓取的任务上,CoorDex 的成功率达到 55%,而直接关节空间控制和仅使用身体先验加关节空间手部控制的基线方法成功率为 0%(见论文表 3)。
  • 主要局限:当前策略依赖仿真中的特权状态观察(如物体精确位姿、接触信号),未处理视觉感知问题,也尚未验证从仿真到真实环境的迁移。硬件演示仅在回放记录轨迹的定性层面上进行,与仿真实验中的灵巧手型号不同。
  • 适合读者:对人形机器人全身控制、灵巧操作、强化学习在机器人中的应用感兴趣的研究人员和工程师。如果你关注高维动作空间的探索问题,或者希望理解如何将移动与操作耦合而非分阶段执行,这篇论文值得细读。

论文背景和研究动机

人形机器人配备高自由度灵巧手的理想场景是单一机体既能导航人类环境,又能操作日常物体。然而,实现这种能力远不止是把末端执行器移到目标附近那么简单。机器人必须在保持平衡的同时让物体始终可达,在接触前协调手腕和手指姿态,闭合手部时不扰动物体,并在手-物体交互持续扰动全身动力学的情况下继续搬运物体。

现有研究在以下几个方面取得了进展:全身运动追踪实现了稳定的移动和上半身运动;基于物理的先验通过结构化的潜在动作空间降低了探索难度;遥操作系统和视觉条件策略进一步改善了任务级交互。然而,目前的系统普遍存在一个简化假设:走到物体前、停下来、操作、再继续行走。这种 “停止-继续” 范式回避了一个关键难题——如何让手指级的精细接触在持续移动中可靠地形成和维持。

问题在边走边操作的场景中尤为突出。当前的灵巧手方法在抓取合成、手-物体表示和跨形态迁移上取得了显著进展,但它们通常假设手腕或手臂轨迹由遥操作、规划或静止的全身控制器提供。在真实行走的人形机器人上,手腕姿态实际上是由足部时序、根部运动、躯干姿态和全身伸展动作共同决定的。如果让手部先验同时承担手腕放置和手指协调的任务,它的表达能力将被大量消耗在身体侧的放置上,而非手指协调本身。

因此,核心挑战变为:如何将身体侧的手腕放置与手部侧的手指运动分解开,并在连续移动中协调它们。

核心方法和技术细节

CoorDex 的设计围绕一个关键思路展开:将高维度的全身与灵巧手控制转换为协调的潜在残差控制。整个管道包含三个阶段。

先验构建阶段。CoorDex 首先为身体和灵巧手分别训练运动先验,两者共享相同的蒸馏流程但聚焦于不同的跟踪任务。在仿真中收集参考运动:下半身移动由 AGILE 控制器生成,操作者通过 Apple Vision Pro 提供右手腕和手部运动,手腕姿态作为逆运动学求解器的末端目标,手部运动通过优化方法重新映射到目标灵巧手上。

身体先验基于一个全身运动跟踪教师网络训练。该教师以身体本体感知和参考目标为输入,输出身体关节位置目标。手部先验在 “浮动手腕” 环境中训练:参考手腕姿态和速度被直接写入仿真,策略只控制手指关节。这一手腕稳定化的设计避免了手部潜在空间被 6D 手腕运动占据过多容量,让学到的潜在指令直接服务于手指协调。

随后,每个教师网络被蒸馏为受本体感知条件的潜在先验。学生网络包含编码器、先验网络和解码器,训练目标结合了教师动作重建、编码器均值的时间平滑性,以及编码器与先验之间的 KL 正则化。蒸馏后,先验网络和解码器被冻结,先验均值成为下游残差强化学习的默认潜在指令。

协调的潜在残差策略。在下游任务中,一个残差 PPO 策略在每个控制步首先获取冻结先验网络的潜在均值,然后预测残差修正量。策略的核心是一个共享协调模块,它接收身体和手部的本体感知、任务状态、手-物体相对几何信息、接触特征、两个先验的均值,以及上一步的残差动作,输出一个任务级协调特征。随后,独立的身体残差头预测身体潜在修正量,手部残差头预测手部潜在修正量。修正后的潜在指令通过冻结的解码器映射为关节位置目标,由底层 PD 控制器执行。

这种架构保持了下游探索的低维度(身体 16 维 + 手部 12 维,共 28 维),同时赋予控制和抓取各自的独立控制权。共享协调模块让策略能够对任务阶段和接触状态进行推理,而分离的头部让身体残差可以调整步态、躯干运动、伸展和手腕放置,让手部残差可以调整手指预形、闭合和接触精化。

残差强化学习与环境设计。下游训练使用 PPO,保持身体和手部先验冻结。策略观察包含身体本体感知、手部本体感知、任务状态、物体相对几何信息、指尖接触特征、先验均值和上一步的潜在残差。所有任务共享相同的潜在残差接口,但在交互结构和探索难度上有所不同。对于较长的技能链(如边走边拾取并转身),论文引入了无演示参考状态初始化机制,将部分回合从策略自身已经到达的状态进行重置,形成探索课程。

创新点和贡献

论文的核心贡献可以归结为三点。

第一,提出了一套完整的学习管道,涵盖仿真中全身与手部演示的收集、运动跟踪策略训练、先验蒸馏,以及下游残差强化学习。这为高自由度灵巧人形机器人的移动操作提供了一个可复现的训练框架。

第二,提出了非对称的身体-手部先验组合方法。手腕放置由任务对齐的身体先验通过全身运动自然产生,而手腕稳定化的手部先验则专门捕获可复用的手指技能。一个协调的潜在残差策略通过共享任务上下文和分离的残差头,在保持先验冻结的前提下对两者进行适配。这种分解避免了让单一模型同时解释全身运动和手指协调所带来的容量竞争。

第三,通过消融实验提供了架构选择的经验证据。在边走边抓取的任务上,原始关节空间 PPO、仅使用身体先验加关节空间手部控制,以及单一 MLP 预测全部潜在残差的三种变体在相同奖励预算下全部失败(成功率 0%),而 CoorDex 达到 55% 的成功率(见论文表 3 和表 4)。这表明潜在先验接口和结构化的身体-手部协调对训练成功至关重要。

实验结果分析

实验在 Isaac Lab 仿真平台上进行,机器人模型为 29-DoF 的 Unitree G1 人形机器人,配备 20-DoF 的五指 WUJI 灵巧手。论文设计了三个具有不同交互结构的任务来评估 CoorDex。

在边走边抓取任务上,CoorDex 达到 55% 的成功率(见论文表 2)。这是三个任务中最具挑战性的,因为抓取必须在持续全身运动中进行。速度剖面的分析显示,机器人在靠近瓶子时略微减速,但保持在约 0.25 m/s 的前向速度(见论文图 4),说明策略并非靠停下来完成抓取。

在边走边开冰箱门任务上,成功率为 66%(见论文表 2)。该任务允许机器人在操作时放慢速度并重新定位。在边走边拾取并转身任务上,得益于无演示参考状态初始化的探索支持,成功率达到 89%(见论文表 2)。

消融实验揭示了不同动作空间的失败模式。去除所有潜在先验后,策略常将全身扭曲为不自然的姿态以避免摔倒,完全不抓取物体。仅保留身体先验而用手部关节空间控制时,机器人能走到瓶子旁并将手腕移近交互区域,但策略倾向于在物体附近减速或停止,试图将问题作为静止抓取来解决——这恰恰是 “停止-继续” 范式的表现。只有同时使用身体和手部先验,手指协调才变得可学习。在架构层面,单一 MLP 预测残差尽管能沿任务方向接近瓶子,但身体运动不够自然,抖动更大,反映在更高的动作率上(0.40 对比 CoorDex 的 0.22,见论文表 4),且成功率为 0%。

实践建议

对于希望在人形机器人上实现移动操作能力的研究者和工程师,CoorDex 的架构提供了一些可借鉴的设计原则。

第一,将高维控制问题分解为可复用的先验和低维残差适配是一个有效策略。在工程实践中,可以先为身体移动和手部操作分别训练独立的运动跟踪策略并蒸馏为潜在先验,然后在下游任务中仅对潜在空间进行残差学习。这大幅缩减了探索空间的维度(从 49 维缩减到 28 维),且每个先验可以在不同任务中复用。

第二,手腕稳定化的手部先验是值得注意的设计选择。手部先验训练时,参考手腕运动被直接写入仿真,策略仅控制手指。这避免了手部潜在空间被高方差的 6D 手腕运动占据,让学到的表示真正服务于手指协调。对于同样面临 “末端执行器定位” 与 “手指精细控制” 耦合问题的系统,这种分离思路可作为参考。

第三,在架构层面,共享协调模块加分离残差头比单一 MLP 更适合多子系统协调。共享模块让策略能够利用完整的任务上下文进行推理,分离的头部则保留了对不同子系统的独立控制权。论文的消融实验表明,即使两种设计在参数总量上相近,结构化的设计在训练可靠性和运动质量上都有显著优势。

需要指出的是,论文目前的工作仍局限于仿真环境,使用特权状态观察。要将其迁移到真实硬件,需要解决视觉感知、域随机化、以及从仿真到现实的迁移策略等问题。论文提到的硬件演示仅为轨迹回放的定性验证,且使用的手部硬件与仿真实验不同,因此从论文到实际部署之间仍有较大工程距离。