DexCompose:复用灵巧操作策略实现单手多任务操控

DexCompose: Reusing Dexterous Policies for Multi-Task Manipulation with a Single Hand

arXiv: 2606.28323v1

论文信息

标题: DexCompose: Reusing Dexterous Policies for Multi-Task Manipulation with a Single Hand

作者: Dihong Huang, Zhenyu Wei, Zhuxiu Xu, et al.

发布日期: 2026-06-26

arXiv ID: 2606.28323v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:这篇论文要解决灵巧手如何用一个手掌同时完成 “保持已有成果”(如握住物体)和 “执行新任务”(如开门)的组合操作问题。
  • 核心方法:提出 DexCompose 框架,通过识别哪些手指对维持抓取是必要的,把手指划分为 “保留组” 和 “释放组”,然后用两个非对称的残差模块分别稳定抓取和适配下游任务。
  • 关键结果:在 16 个组合灵巧操作任务上,DexCompose 平均组合成功率达到 77.4%,比直接串联策略高出 74.3 个百分点,比最强基线高出 15.8 个百分点(见表 1)。
  • 主要局限:当前框架只支持同时组合两个技能,扩展到包含更多技能的长序列组合仍是一个待解决的问题。
  • 适合读者:从事机器人灵巧操作、强化学习、多任务策略组合的研究者和工程师,以及对资源分配式策略重用感兴趣的读者。

论文背景和研究动机

灵巧手操作中的一个常见难题是:机器人需要在保持一个技能成果的同时,用同一只手执行另一个技能。比如,握住一根棍子后,需要用同一只手去推门把手,同时不能让棍子掉落。虽然抓取和推门这两个行为可以分别用独立的单任务策略学会,但直接把这两个策略串联起来执行却不可靠:下游策略会控制整个手掌,可能覆盖掉维持抓取所需的手指动作。

这种两个目标共享同一动作空间的情况,在 “保持抓取” 和 “执行新交互” 之间造成了严重的破坏性干扰。一个直接的替代方案是为每个任务组合训练一个独立策略,但这会导致策略数量随任务数量呈 n×mn \times m 式增长,扩展性很差。

已有的一些工作(如 MultiGrasp、DexMulti、HANDFUL)开始探索通过分配手部自由度来让同一只手完成多个交互。但这些方法通常依赖预定义的手指分配方案,或者在抓取生成、数据构建阶段就组合了下游任务,难以在不同任务组合之间灵活迁移。

论文的核心假设是:在预训练策略中,空闲的自由度是一种可复用的资源。关键问题是如何自动发现哪些动作维度对维持第一个任务的结果是必要的,以及如何在保证这些维度不被干扰的前提下引入新任务。

核心方法和技术细节

DexCompose 的整体流程分为两个阶段:手指归因(Finger Attribution)和双残差稳定(Dual Residual Stabilizer)。

手指归因:发现必要的手指

给定两个预训练的灵巧手操作策略 πA\pi_A(如抓取物体并保持)和 πB\pi_B(如下游交互任务),首先收集 πA\pi_A 成功执行后的一系列 “持物状态”。对于每个候选的手指掩码 mm(用二进制位表示哪些手指保留给任务 A、哪些释放给任务 B),系统执行一组释放测试:

  • 被保留的手指继续执行原始的抓取参考动作
  • 被释放的手指逐步张开,从抓取配置过渡到完全打开的姿态

然后测量两个指标:保持成功率 Pret(m)P_{\text{ret}}(m)(物体在测试过程中是否保持稳定)和干净释放率 Pclean(m)P_{\text{clean}}(m)(释放的手指是否完全脱离接触,没有持续提供支撑力)。

最终的掩码选择由一个 LLM 智能体完成。它综合考虑保持稳定性、释放质量和释放手指数量对下游任务灵活度的影响,在候选掩码中选择一个能权衡三者最优折中的方案。论文实验对比了启发式选择方法(选保持率最高且至少释放两根手指的掩码),发现 LLM 更倾向于保留功能重要的手指(如食指),而不会为了短期保持率牺牲下游操作的灵活性(见论文附录 B.7)。

双残差稳定器:有结构的组合执行

选定手指掩码后,系统为任务 A 和任务 B 学习两个非对称的残差模块:

任务 A 残差稳定器(πresA\pi_{\text{res}}^A)的目标是在下游任务执行过程中补偿扰动,维持物体稳定。它只对保留手指的关节产生修正,修正量被限制在很小的有界范围内(通过 tanh⁡\tanh 函数和逐关节的幅度限制实现),确保抓取参考配置不被大幅偏离。

任务 B 残差适配器(πresB\pi_{\text{res}}^B)则对冻结的下游策略进行上下文感知的修正。关键设计在于:这个残差只作用于分配给任务 B 的动作子空间(即手腕和释放手指的自由度),被硬掩码强制约束,无法写入任务 A 保留的区域。这从结构上杜绝了两个任务之间的动作空间竞争。

最终每个时间步的复合动作由以下方式组装:

atcomp=MA∗⊙atA,pres+MB∗⊙atB,execa_t^{\text{comp}} = M_A^* \odot a_t^{A,\text{pres}} + M_B^* \odot a_t^{B,\text{exec}}

其中 MA∗M_A^* 和 MB∗M_B^* 是从手指掩码扩展而来的动作空间所有权掩码,⊙\odot 表示逐元素乘法。

两个残差模块在训练时都初始化为接近零输出,确保在训练前,组合策略的行为是直接执行任务 A 的存储参考动作(在保留手指上)和冻结的任务 B 策略(在释放的手指和手腕上),不会在训练初期产生不可预测的随机行为。

创新点和贡献

DexCompose 的核心创新在于三个相互配合的元素:

  1. 训练免费的手指归因。释放测试不需要重新训练任何策略,仅通过回放已收集的持物状态,就能自动发现预训练策略中哪些手指是维持任务结果所必需的。这使得框架可以在推理时灵活组合任意两个预训练策略,无需为每个任务对单独训练。

  2. 显式的动作所有权结构。通过在动作空间层面强制实施所有权掩码,DexCompose 从机制上阻止了任务 B 的策略污染任务 A 的保留动作维度。这与传统的残差学习方法(允许残差写入所有动作维度)形成鲜明对比。消融实验表明,去掉动作掩码后性能大幅下降(从 77.4% 降至 59.1%,见表 2),证实了结构化的所有权执行对双策略组合至关重要。

  3. 非对称双残差设计。任务 A 的残差稳定器和任务 B 的残差适配器各司其职:一个专注于对抗扰动、维持现状,另一个专注于在给定约束下最大化下游任务性能。这种设计在保持端到端可训练的同时,将不同目标的优化信号分离,避免了共享残差可能带来的优化困难。

实验结果分析

论文在 16 个组合灵巧操作任务上进行了系统评估,任务 A 包含 4 种物体保持技能(抓取球、倒杯子、拿罐子、拿棍子),任务 B 包含 4 种交互技能(开门、按下按钮、打开微波炉、转动开关)。

主比较结果(表 1):DexCompose 达到 77.4% 的平均组合成功率,直接串联策略几乎完全失败(平均 3.1%)。即使是组合了动作空间分解和残差学习的基线方法,平均成功率也只有 45.6% 和 61.6%,显示单纯的动作空间分解或通用残差学习不足以应对两个策略之间的复杂干扰。

基础策略保有分析(图 3):衡量组合策略是否破坏原始策略的能力。直接串联方法在任务 A 侧保有率仅 0.10,说明抓取几乎总是在执行任务 B 时丢失。DexCompose 在任务 A 和任务 B 侧分别达到 0.81 和 0.89 的保有率,位于保有率-组合成功率图表的右上角区域,表明该方法确实做到了在保护已有能力的同时引入新能力。

组件消融(表 2):逐模块移除实验揭示了清晰的依赖层级。去掉任务 A 残差(即不再主动稳定抓取)造成最严重的性能崩塌(平均成功率从 77.4% 降至 9.1%),证明主动稳定是组合成功的必要条件。去掉手指分配和动作掩码各造成约 18 个百分点的性能损失,说明结构化所有权在减少干扰方面也发挥了关键作用。

目标选择方式的对比(表 3):LLM 驱动的掩码选择器在 4 个采样任务对上平均高出启发式方法 6.5 个百分点,主要是因为 LLM 会优先保留具有高功能价值的手指(如食指),而不是单纯追求短期的保持成功率。

实践建议

DexCompose 的思路对灵巧手操作系统的工程实现有几点可迁移的启示:

1. 策略模块化设计。将复杂的多任务行为拆分为 “稳定器” 和 “执行器” 两个角色明确的模块,通过硬掩码强制划清边界,比让一个通用残差模块同时处理两个目标更容易训练和调试。这种设计模式不仅适用于手指,也可推广到双手机器人中手臂、手掌、手指等不同控制粒度之间的组合。

2. 自由度发现的价值。释放测试提供了一种轻量级的冗余度发现机制,不依赖精确的物理模型或抓取稳定性分析。在工程部署中,可以用类似的方法对已有策略进行后验分析,找出哪些关节或执行器在某些操作阶段实际处于空闲,这些都可视为可分配给新功能的资源。

3. 残差训练中的零初始化。让残差模块从零输出开始训练,保证了在训练的早期阶段,组合系统的行为接近于各原始策略的叠加,大幅降低了 RL 探索初期的不稳定性和随机性。这一原则同样适用于其他需要将已有控制器与学习型模块结合的场景。

4. 结合语义信息的组合规划。LLM 掩码选择器的高于启发式基线表现,说明在组合已有技能时,引入对人类操作经验的语义理解是有价值的。大规模语言模型能够捕捉到 “食指通常用于精细操作” 这类人类先验知识,在处理预定义规则难以描述的权衡场景时尤为有用。在实际系统中,可结合物理测试指标和 LLM 推理来为每对任务定制组合方案。