CoorDex:协调身体与手部先验实现连续灵巧的仿人移动操作
论文信息
标题: CoorDex: Coordinating Body and Hand Priors for Continuous Dexterous Humanoid Loco-Manipulation
作者: Sikai Li, Shuning Li, Zhenyu Wei, et al.
发布日期: 2026-06-22
arXiv ID: 2606.23680v1
PDF 链接: 下载 PDF
论文背景与研究动机
类人机器人的终极形态应当是单一机体同时具备环境导航和日常物品操作的能力。然而,当前类人机器人系统普遍将移动与操作割裂为 “走走停停” 的串行流程:先走到物体前停下来,完成抓取或操作,再继续行走。这种分段式策略尽管简化了控制问题,却牺牲了任务的连续性与效率,更偏离了人类自然行为中 “边走边做” 的流畅模式。
更深层的问题是末端执行器的自由度不足。许多系统采用低自由度的夹爪或简单的开合基元,无法实现多指灵巧手才能在动态接触中完成的精确协调。当类人机器人装备高自由度灵巧手后,控制维度急剧膨胀:机器人不仅需要维持行走平衡、保持物体在可达范围内,还需在移动中协调腕部姿态与手指运动,在闭合手指时不扰动被抓物体,并在搬运过程中消纳手与物体的接触扰动。这些行为若直接在全关节空间内训练,将面临高维探索困境——运动与灵巧控制必须从零开始同时学习,极难收敛。
CoorDex 正是针对这一难题提出的一整套学习管道。其核心动机在于:将高维度的身体与灵巧手控制解耦为两个可复用的先验模型,再通过协调的潜在残差策略在保留各自结构优势的前提下完成联合优化,从而实现真正 “在移动中灵巧操作” 的连续行为。
核心方法与技术架构
CoorDex 的设计遵循 “先分后合” 的模块化思路,整体管道包含三个阶段:先验构建、残差策略训练、以及协调执行。
身体先验与手部先验的分离构建
系统首先为类人机器人的身体和灵巧手分别训练运动先验。两者共享相同的蒸馏流水线,但训练任务彼此独立。
身体先验的构建从模拟遥操作收集的全身参考运动出发。操作员通过 Apple Vision Pro 提供右手腕与手部运动,下身运动由 AGILE 步态控制器生成,经逆运动学求解与优化重定向后,形成完整的全身参考轨迹。身体跟踪教师网络以这些轨迹为目标,接收本体感知和参考目标,输出身体关节位置指令。教师网络训练完成后,通过变分自编码器蒸馏为仅依赖本体感知的条件潜在先验。蒸馏损失包含教师动作重建误差、编码器均值的时间平滑性以及编码器与先验分布间的 KL 散度,确保潜在空间既紧凑又可从部分观测中可靠推断。
手部先验的训练则在浮动手环境中进行。参考运动来自基于 ManipTrans 风格的数据集,其中腕部位姿与速度被直接写入仿真,手部教师只需控制手指关节。这种 “腕部稳定” 的设计十分关键:它确保手部潜在空间的容量完全投入手指协调本身,而不会被高方差的腕部运动占据。蒸馏后得到的手部先验同样仅依赖本体的腕部速度、手指关节状态和上一次动作即可输出有意义的潜在指令。
协调潜在残差策略
两个先验冻结后,下游的强化学习策略不再直接输出全关节目标,而是在潜在空间中预测残差修正量。其架构由三个核心部件构成。
首先是共享协调主干网络。在每个控制步,身体和手部先验各自编码本体感知得到先验均值,这些均值连同物体相对于机器人和手部的几何特征、指尖接触力、任务级状态以及上一时刻的残差,一并输入主干网络,生成任务级的协调特征。
其次是残差头。身体头部接收协调特征、身体本体感知和先验均值,输出身体潜在空间的残差;手部头部额外接收手-物体交互状态,输出手部潜在空间的残差。两个残差经 tanh 约束后与先验均值相加,再分别通过冻结的解码器映射为关节位置目标。
这种非对称的解耦设计让身体残差负责调整步态、躯干姿态、手臂伸展和腕部定位,手部残差则精细化手指预成形、闭合和接触力。两者在共享任务上下文中耦合,却不在网络结构上被迫融合,保留了系统对全身运动与手指灵巧性的独立控制权。
下游残差强化学习
策略采用 PPO 算法训练,在冻结的两个先验基础上仅输出 28 维的潜在残差。奖励设计根据任务不同而有所区分:在抓取-搬运任务中,奖励融合了步态与平衡项、手掌-物体接近与对齐项、指尖接触与持续接触项以及提升与搬运完成项,并配以残差和执行动作的正则化惩罚。
对于长期任务如拾取-转弯,纯奖励优化从初始态出发近乎不可能探索到后期阶段。CoorDex 引入一种无需参考状态的课程机制,利用策略自身探索中到达的状态快照来重置部分训练环境,逐步解锁任务阶段。这一设计完全摆脱了对示教状态的依赖。
实验分析与关键发现
实验在 Unitree G1 人形机器人搭载 20 自由度的 WUJI 灵巧手上展开,共测试了三个代表性任务:行走中抓取并搬运瓶子、移动中打开冰箱门以及拾取方块并完成 180 度转弯。
任务成功率分别为 55%、66% 和 89%。拾取-转弯任务的较高成功率得益于阶段课程的部分辅助,而行走抓取作为对 “不停步灵巧操作” 定义最纯粹的测试,展现了最具挑战性的接触模式。
消融实验揭示了若干关键发现。在全关节空间 PPO 基线中,策略因探索空间过大而完全失败,从未学会抓取。若保留身体先验但手部采用关节空间控制,策略虽能走到瓶子附近并尝试抓取,却系统性地学会在物体前减速甚至停止,将任务降级为静止操作——这恰恰证明了单一先验不足以支撑在移动中生成灵巧手指行为。即使两个先验都存在,若将潜在残差预测改为单个 MLP 输出整体残差,任务成功率也降至零,且身体运动出现明显抖动和不自然姿态,动作变化率翻倍。这表明协调残差的分离结构对于同时保持运动质量和接触可靠性至关重要。
速度曲线分析进一步证实,成功的 CoorDex 策略在接近瓶子时仅轻微减速,仍保持约 0.25 m/s 的前向速度,不符合 “停下再抓” 的行为模式。
应用前景与未来展望
CoorDex 为类人机器人灵巧操作提供了一种可实践的工程路径。其模块化的设计允许身体和手部先验独立替换——更换灵巧手形态只需重新训练手部教师并蒸馏,无需改动下游策略架构。论文实际展示了在 Dex3-1 手上重构手部先验的操作流程。
潜在的应用场景涵盖动态仓储分拣中边走边抓取传送带上的异形物品、服务机器人在人群中持续移动并操纵环境物体,以及危险环境下的连续操作作业。在这些场景中,“不停步” 不仅是效率需求,更是平衡与安全的前提。
然而,当前成果仍是模拟环境中的早期验证。策略依赖特权状态观测,包括物体精确位姿和接触信号,没有涉及视觉感知或仿真到真机的迁移管道。对单一 G1 平台和 WUJI 手的测试也需拓展至更多形态和硬件配置。长任务仍依赖任务特定的探索辅助,通用性有待提升。未来工作应结合视觉策略、自动课程生成以及更广泛任务条件下的通用先验,使 “在移动中灵巧操作” 从实验室走向真实世界。
总结
CoorDex 通过将高维类人机器人控制分解为身体与手部的独立潜在先验,再以协调残差策略在共享任务上下文中组合两者,成功实现了移动中灵巧操作的可训练性。其不对称的先验组合方式——腕部姿态由身体先验涌现,手指协调由腕部稳定的手部先验负责——精准对应了物理上的控制分工。实验证据表明,潜在空间的接口和分离的残差结构两者缺一不可,为后续类人机器人全身灵巧操作系统指明了 “先分解后协调” 的关键设计原则。