基于选择策略的协调人形机器人操作

Coordinated Humanoid Manipulation with Choice Policies

arXiv: 2512.25072v1

论文信息

标题: Coordinated Humanoid Manipulation with Choice Policies

作者: Haozhi Qi, Yen-Jen Wang, Toru Lin, et al.

发布日期: 2025-12-31

arXiv ID: 2512.25072v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:这篇论文要解决人形机器人在复杂任务中协调头部、手臂、手部和腿部的全身控制难题,以及从人类遥操作的多模态演示数据中高效学习自主策略的问题。
  • 核心方法:设计了一个模块化的遥操作界面,将全身控制分解为手眼协调、原子抓取、末端跟踪和运动控制四个子模块;并提出 Choice Policy 学习框架,通过单次前向传播生成多个候选动作并学习评分,兼顾推理速度与多模态建模能力。
  • 关键结果:在洗碗机装载任务中,Choice Policy 配合手眼协调的插入成功率达到了 70%(7/10),显著优于行为克隆和扩散策略在相同条件下的 50%(5/10)成功率(见表 I)。
  • 主要局限:作者承认视觉感知模块对显著变化的场景和物体泛化能力有限,且当前的手眼协调仍采用启发式算法,需要更自适应或可学习的机制。
  • 适合读者:对人形机器人全身控制、模仿学习、遥操作数据采集或具身智能(Embodied AI)感兴趣的研究者和工程师都值得阅读,尤其适合关注多模态行为建模和模块化系统设计的从业者。

论文背景和研究动机

人形机器人因其在人类中心环境中的巨大应用潜力而受到广泛关注。要在购物商场、家庭厨房等非结构化场景中完成有用工作,机器人必须协调头部、双手和双腿去主动搜索、定位、抓取和操纵物体。然而,实现这一层级的灵巧性和灵活性仍然是开放挑战——它要求无缝的全身协调以及移动与操纵的紧耦合(见论文第 I 节)。

当前主流的方法之一是 “从演示中学习”(Learning from Demonstrations, LfD)。人类操作员通过摄像头、动作捕捉或虚拟现实(VR)界面控制机器人的手臂和手掌,收集专家轨迹,然后用于监督式的模仿学习。但这个方法面临两大困难:第一,集成所有组件极其困难——虽然已有系统能分别实现手眼协调、上下半身协调或腰部运动,但将它们全部融合在一起会急剧增加复杂度;第二,现有 LfD 方法往往在效率和表达能力之间无法兼得:它们或者依赖迭代计算,速度太慢无法满足自适应移动操纵的实时性要求,或者模型表达能力不足,无法捕捉人类演示中的多模态特性。例如扩散策略虽然能建模多模态分布,但推理太慢;而标准行为克隆推理快,却容易将多模态数据坍缩成平均动作,产生次优甚至不稳定的行为(见论文第 II-B 节)。

本文正是在这种背景下提出了一套完整的解决方案:一方面设计模块化遥操作界面以高效收集高质量演示数据,另一方面提出 Choice Policy 学习框架以在保持实时推理的同时有效建模多模态行为。

核心方法和技术细节

模块化遥操作界面

遥操作人形机器人进行精确操纵的核心难点在于高维动作空间带来的全身协调负担。作者的思路是分解而非合一——将控制拆解为四个功能子模块(见论文第 III 节及图 1):

  1. 手眼协调:操作员可按下按钮让机器人的头部主动跟踪左手或右手。具体实现是:基于所选手掌在机器人基坐标系中的 3D 位置 php_h 与头部位置 pheadp_{head},计算相对位移向量 r=ph−pheadr = p_h - p_{head},然后解算出期望的偏航角 yaw=arctan⁡2(ry,rx)\text{yaw} = \arctan2(r_y, r_x) 和俯仰角 pitch=arctan⁡2(−rz,rx2+ry2)\text{pitch} = \arctan2(-r_z, \sqrt{r_x^2 + r_y^2}),确保头部摄像机始终指向正在操作的手,减少长时间任务中的遮挡问题。

  2. 原子抓取:四根非拇指手指通过扳机按钮组合驱动,拇指由手柄摇杆独立控制,两者都提供连续值信号映射到手指驱动,操作者可以精细调节抓取力度。这种降维并未牺牲基本的抓取分类能力——力度抓取、精度抓取和展平操作均可实现。

  3. 手臂末端跟踪:采用 “按需激活” 机制:只有按下触发按钮时手臂才跟随 VR 控制器运动。相对位姿变化被转换到机器人坐标系,通过逆运动学求解目标关节角度。这种方式允许双臂顺序操作而不会让闲置的手臂漂移,同时支持操作员重置控制器位置以扩展工作空间。

  4. 移动运动:利用仿真中通过强化学习训练的 100 Hz 移动策略,速度条件控制站立、前进、后退、侧行和转向。遥操作时通过手柄摇杆切换移动模式和拇指控制模式。

Choice Policy 学习框架

这是论文的核心算法贡献(见论文第 IV 节及图 2、图 3)。给定观测 oto_t,策略输出 KK 个候选动作轨迹 {at(k)}k=1K\{a_t^{(k)}\}_{k=1}^K,每个伴随相应得分 {σt(k)}k=1K\{\sigma_t^{(k)}\}_{k=1}^K,最终选择得分最高者执行。

训练目标的设计十分巧妙。每个候选轨迹先与真实轨迹计算均方误差(MSE),跨动作维度和预测时间层取平均:

ℓ(k)=1∣A∣∣T∣∑i=1∣A∣∑j=1∣T∣(at(k)[i,j]−at[i,j])2\ell^{(k)} = \frac{1}{|A||T|} \sum_{i=1}^{|A|}\sum_{j=1}^{|T|}(a_t^{(k)}[i,j] - a_t[i,j])^2

这些误差值承担双重职责:

  • 作为得分网络的回归目标:Lscore=1K∑k=1K(σt(k)−ℓ(k))2\mathcal{L}_{\text{score}} = \frac{1}{K}\sum_{k=1}^{K}(\sigma_t^{(k)} - \ell^{(k)})^2,让得分网络学会预估每个候选的实际质量;
  • 采用赢者通吃(winner-takes-all)策略:只选择误差最小的候选 k⋆=arg⁡min⁡kℓ(k)k^\star = \arg\min_k \ell^{(k)} 参与梯度更新,动作损失 Laction=ℓ(k⋆)\mathcal{L}_{\text{action}} = \ell^{(k^\star)}。总损失为二者的直接求和。

推理时仅需单次前向传播:同时输出 KK 条轨迹和对应得分,选得分最低的轨迹执行。整个过程保持了行为克隆的推理效率,同时又因多个预测头的分工而能捕捉多模态行为。

创新点和贡献

论文的创新主要体现在三个层面:

第一,系统性贡献:在现有工作中,有的实现了上半身手眼协调,有的做到了运动与抓取结合,但极少有工作能在一个完整的人形机器人平台上同时整合头、手、臂、腿的协调控制并学习自主策略。本文的模块化遥操作界面是第一个将这四个模块有机统一起来的系统设计,并且在 Fourier GR-1 和 Robotera Star-1 两个不同平台上验证了通用性(两者分别具有 44 和 55 个自由度)。

第二,算法创新:Choice Policy 提供了一种优雅的方案来突破模仿学习中效率与表达力的矛盾。与扩散策略需要数十步迭代采样不同,它只需一次前向传播;与标准行为克隆将多模态坍缩为单一均值不同,它通过 KK 个专业化预测头和学习得到的评分机制来维护行为多样性。论文还在图 5 中可视化了一个特别有趣的现象:不同的预测头自然专精于任务的不同阶段(如 Choice ID 2 主导取物阶段,ID 0 主导抓取阶段),这表明网络自动将长任务分解为子技能模式。

第三,实证见解:论文通过系统的消融实验证明了两个关键发现——(1)手眼协调对长时间任务的后期阶段(尤其是精准插入)至关重要,没有此能力时插入成功率几乎降为零(见表 I 第二组);(2)学习得到的评分策略远优于随机选择、平均化或固定选头等替代方案,说明自适应选择机制是核心驱动力(见表 III)。

实验结果分析

论文在两个真实世界任务上进行了评估:

洗碗机装载任务(见论文第 V-A 节,表 I、II、III):这一任务包含拾取、换手和插入三个紧密耦合的子阶段,失败在任何一环即全局失败。在搭配手眼协调时,Choice Policy 取得了 10/10 拾取、9/10 换手、7/10 插入的成绩,均优于扩散策略和行为克隆。取消手眼协调后,所有方法在插入阶段都几乎完全失败,证明了头部主动跟踪的关键性。分布外(OOD)测试还揭示了泛化方面的挑战:位置 OOD 比颜色 OOD 更具挑战性,Choice Policy 插入成功率降至 4/10,但仍高于其他方法(见表 II,扩散策略和行为克隆分别降至 0/10 和 2/10)。

白板擦拭移动操纵任务(见论文第 V-B 节,表 IV):这一任务更为复杂——机器人需先转头找板擦,拾取后走到白板前擦除目标区域,每一步都引入不确定性(姿态随机化、移动偏差)。Choice Policy 在拾取(2/5)和擦拭(2/5)上虽优于行为克隆(1/5 和 0/5),但总体成功率仍然较低。扩散策略因推理太慢和训练不稳定而无法部署。这表明集成感知、抓取、行走和全身调整的端到端长程成功仍然是待解决的开放问题。

实践建议

对于希望复现或改进类似系统的人形机器人研究者和工程师,论文隐含以下实践启示:

  1. 模块化但可扩展的数据采集架构:不要试图让操作员同时控制所有自由度。将遥操作拆解为在功能语义上有意义的子模块(如手眼跟踪、按需手臂激活、原子抓取分类),既降低学习成本(论文提到新用户练习不到 10 分钟即可顺畅执行复杂任务),也为后期统一策略学习保留了足够的灵活性。

  2. 手眼协调不是可选项:在洗碗机装载实验中,有无头部跟踪能力导致了插入阶段从 70% 到接近 0% 的剧烈差距。如果任务涉及需要视觉确认的精细操作(如插入、对准),务必在数据采集阶段纳入主动头部控制,并确保训练数据中包含这一行为模式。

  3. 多预测头 + 赢者通吃是应对多模态的有效策略:相比扩散模型的迭代采样,Choice Policy 的实现极其简单(论文提供的 PyTorch 伪代码仅十余行),在泛化性和推理速度之间取得了实用平衡。对于需要 20 Hz 以上控制频率的机器人系统,这比扩散策略更易部署。

  4. 为长程任务预设功能分解空间:图 5 的定性分析暗示,如果能让网络在训练时自然形成子技能专业化,可能需要在多模态数据中保留足够的变异度,而不是过早强制行为对齐。在评估阶段检查不同预测头的使用模式,也可以帮助诊断策略是否真正学会了分解任务。