HANDOFF:基于蒸馏互补教师的人形智能体任务空间全身控制
HANDOFF: Humanoid Agentic Task-Space Whole-Body Control via Distilled Complementary Teachers
论文信息
标题: HANDOFF: Humanoid Agentic Task-Space Whole-Body Control via Distilled Complementary Teachers
作者: Lizhi Yang, Junheng Li, Nehar Poddar, et al.
发布日期: 2026-06-04
arXiv ID: 2606.06493v1
PDF 链接: 下载 PDF
3 分钟速览
-
研究问题:仿人机器人规划器(planner)和全身控制器(WBC)之间的接口长期存在错配——控制器要求密集的全身运动参考,而规划器难以从任务语义中产生这种参考。论文要解决的核心问题是:如何设计一个既能被规划器轻松产生、又能驱动丰富全身行为的命令接口。
-
核心方法:提出 HANDOFF——一个仅需 10 维命令(平面速度、高度、双手腕目标位置)的仿人机器人全身控制器。通过多教师 KL 蒸馏,将三个功能互补的专家策略(全身运动跟踪、行走、摔倒恢复)融合为一个混合专家(MoE)学生模型,并采用上下文条件门控机制在不同任务场景下动态切换教师的监督来源。
-
关键结果:HANDOFF 在速度跟踪精度上达到当前最佳水平(横向上 m/s 等),并在双手腕鲁棒工作空间上取得了 0.31 m³ 的体积(见表 2),为同类方法中的最大值,同时在 92% 以上的随机目标试验中保持可行。
-
主要局限:接口仅支持 3 维手腕位置目标,不能直接指定完整的 6 维夹爪姿态(需通过运行时运动学校准补正);感知受限于装在头部的单 RGB-D 相机;专家覆盖不完整(缺乏针对崎岖地形、接触、高负载等的专家)。
-
适合读者:从事仿人机器人全身控制、技能学习、规划与控制接口设计,或具身智能(embodied AI)中任务与动作空间映射的研究者和工程师。
论文背景和研究动机
为了让仿人机器人在真实世界中执行复杂的运动与操作任务(如 “去拿一杯咖啡”),任务规划、物体感知、运动规划和全身控制必须紧密协作。传统全身控制器大多运行在 “运动跟踪” 范式下,需要上层规划器以高速率产生密集的全身运动学参考——如完整的 29 维关节角度序列。这种参考通常需要人工遥操作或动捕数据收集、针对具体机器人本体重新定向、过滤动力学不可行帧,再为每种新技能重复整个流水线。这使得规划器被降级为依赖特定演示库的数据回放引擎。
论文的核心观察是:规划器真正需要的是一个简洁、直观、通用的命令空间,而不是整条运动轨迹。人类在执行复杂操作时并不会有意识地推理每个关节的角度,而是将任务分解为一组稀疏的子目标(如 “走到桌边,伸出手,抓住杯子”),让低层运动系统自动处理行走步态和平衡。
作者由此提炼出了一个理想接口应具备的四个属性:直观(无论是人、几何规划器还是视觉语言模型都能产出有效命令)、通用(一个接口服务不同的运动操作任务)、模块化(规划器、感知、控制器可分别独立替换)、具有全身表现力(紧凑命令仍能激发协调的全身行为)。
核心方法和技术细节
10 维规划器命令接口
HANDOFF 设计的命令向量为:
其中 是平面速度指令, 是指令身高, 和 分别是左右手腕在骨盆坐标系中的目标位置。这个接口设计的精妙之处在于:每一部分都能与现有的规划技术族对应——行走堆栈产生速度命令,抓取规划器产生末端执行器目标,下蹲或取物启发式策略设置 。它介乎高度抽象的语义指令和密集关节参考之间,能够被传统任务规划器、大语言模型或视觉语言动作模型(VLA)直接驱动,无需为每种方法单独做重新定向或控制器微调。
三位互补专家教师
HANDOFF 并非直接训练单一策略完成这个 10 维接口的全覆盖任务——现实中没有任何单一训练范式能同时满足速度跟踪、全身协调和干扰鲁棒性。论文另辟蹊径,先独立训练三位专家教师:
-
全身运动跟踪教师:在重新定向的人类运动数据上训练,拥有 29 维全身动作空间。它提供了优越的姿态、伸手、下蹲和双臂协调先验,但行走行为被数据锚定,不能可靠地进行纯粹的速度跟踪(如表 2 消融所示)。此外,原始数据中的某些下蹲帧被论文用闭式 CBF(控制屏障函数)投影在校正 CoP(中心压力)容限后过滤(见附录 C.1)。
-
行走教师:一个 15 维身体切片(双腿+腰部)策略,在平坦地形上训练,手臂由课程混合的运动数据驱动以模拟躯干质心偏移。其奖励包括线速度和角速度跟踪项,行走在不同常规上表现稳健,但本质上是局部结构优越的专用体。
-
摔倒恢复教师:采用对抗性运动先验(AMP)训练,混合了行走数据和配对摔倒-恢复序列。它以全身 29 维动作空间运行,能在极端扰动后使机器人重新站立。
上下文条件门控与混合专家蒸馏
HANDOFF 的核心创新在于如何将这三位专家 “蒸馏” 到一个部署时可运行的学生策略中。学生接收 10 维规划器命令和 11 帧本体感觉历史,经过编码器产生一个共享的 64 维潜在表示,再进入一个软混合专家(Soft MoE)头,由门控网络计算三个专家的权重。
知识蒸馏时,监督损失的设计利用了上下文条件门控机制来划分不同专家的 “管辖范围”:速度命令的范数 和摔倒恢复标志 构成了运行时的上下文字段。体部动作切片被 WBC 教师与行走教师的 KL 散度按连续门 混合监督——指令速度低于 0.1 m/s 时趋向 WBC 教师,超过时趋向行走教师。手臂切片始终被 WBC 教师监督。在摔倒恢复激活的环境样本上,摔倒恢复教师就接管整个动作的 KL 监督。这种非对称监督实现了不同教师的无缝过渡:行走专家负责速度,运动跟踪专家维护上肢协调,AMP 专家处理意外摔倒。
基于智能体的部署流水线
为了展示接口的通用性,论文还实现了一个利用语言指令驱动的智能体规划器:高频的自然语言指令被大语言模型预处理为正则匹配的原子任务,视觉语言模型(VLM)将 2D 检测投影到点云上生成骨盆坐标系下的路径点,路径点跟踪器推导速度指令,技能选择器在接近目标时提供手腕目标值和身高。论文特别强调,该控制器未使用任何任务特定数据或微调。
创新点和贡献
1. 正视规划器与控制器的接口错配。 传统研究大多在提升控制器精度和表达能力,却很少反思这种 “控制器中心” 的设计究竟在多大程度上适合实际规划器。论文将命令接口设计提升为系统性问题,并提出了一种各层可独立演化的模块化方案。
2. 利用互补教师解决单一分布覆盖不足。 直接将 WBC 教师用到 10 维接口会导致 “退化速度跟踪”;将行走教师单独使用又失去了上肢操控能力。HANDOFF 的 “拆分蒸馏” 方案——身体切片用速度门控的 KL 混合,手臂切片固定锚定 WBC 教师,恢复专家的掩码 KL——为协调这种冲突提供了一个优雅且可扩展的范式。
3. 紧致表达与稀疏参考的一次关键平衡。 与需要完整关节角度的运动跟踪方法(如 [23])或需要头部-手部高速率参考的接口(如 OmniH2O)相比(参见表 1),HANDOFF 在 “规划器要产生什么” 和 “控制器能表达什么” 之间取得了更具代表性的平衡。
4. 安全滤波与运动数据修正。 训练前对身体静态 CoP 余量做闭式 CBF 投影,以确保学习到的下蹲行为在真实硬件上能安全执行(参见图 2),在仿真到现实迁移中具有实用意义。
实验结果分析
消融研究(表 2a)。 从直接使用 WBC 教师开始,逐步叠加行教师、随机化命令、拆分 KL 与 MoE 路由、AMP 恢复教师和稳定性奖励栈。结果显示,行教师的添加带来的速度跟踪改善最大( 从 0.29 降至 0.14),而 MoE 路由和随机化命令收紧了对 和 的跟踪。鲁棒工作空间随着每个模块的加入而提升,最终达 0.31 m³。
与现有方法对比(表 2b)。 尽管多数现有控制器不支持原生手腕目标(需通过 IK 适配器做 “有利对比”),HANDOFF 仍达到了最前沿的速度跟踪精度和最大的鲁棒工作空间。Ours+Stab. 的可行率达 97.7%。
硬件验证。 在宇树 G1 上完成了拾取放置、拾取运输放置、下蹲拾取、双臂拾取和交接、任务中断后摔倒恢复等多种任务。这些任务均因同一控制器完成,在任务之间未进行任何数据收集或模型微调(见图 5 和视频),验证了接口和蒸馏策略的鲁棒性。
实践建议
-
定义清晰的接口约定。 无论在仿真器或实物上构建人形机器人栈,考虑将规划器-控制器接口采用一个 “居中紧凑” 的命令向量(如相对速度、目标位置等)而非密集参考,这能极大降低连接新规划器和感知模块的工程开销。HANFOFF 的 10 维接口可作为直接参考。
-
用多教师蒸馏解决冲突需求。 若一个任务需要同时具备多个技能域的表现(如在跟踪速度的同时保持精细操作),直接训练单一策略容易偏向其中一个,多教师蒸馏 + 上下文门控是一种通用配方。体部维度按速度门控混合、手臂维度固定继承、离散情境接管整体动作,这种拆分监督的做法可被推广到任何具有不同自由度划分或可靠性域的任务中。
-
安全滤波先于训练。 当使用重新定向的人类运动数据时,应先用静态平衡条件(如 CoP 检查)和闭式 CBF 投影将动力学不可行帧修正。这不仅能提高策略学习效率,也大幅降低了因不可行参考导致的仿真到现实策略失效风险。
-
规划专家可扩展性设计。 论文的专家蒸馏架构在设计上考虑了扩展性——增加一个新的专家只需添加一个新的专家头和一条新的上下文字段(如接触状态),原有教师和命令接口都不需要变更。这种模块化的 “插件式” 设计对大型项目长期演进十分友好。