DexCompose:利用单手复用灵巧策略实现多任务操作

arXiv: 2606.28323v1

论文信息

标题: DexCompose: Reusing Dexterous Policies for Multi-Task Manipulation with a Single Hand

作者: Dihong Huang, Zhenyu Wei, Zhuxiu Xu, et al.

发布日期: 2026-06-26

arXiv ID: 2606.28323v1

PDF 链接: 下载 PDF

研究背景与问题动机

灵巧手操作是机器人领域的核心挑战之一。尽管近年来的研究已经能够训练出解决单一技能(如抓取、开门、按按钮)的灵巧操作策略,但将这些技能组合起来、用同一只手机器人顺序执行多个任务,依然十分困难。直接串联两个预训练策略会产生严重的干扰:下游策略控制全部手指时,往往会覆盖维持上游任务(如抓取物体)所需的精细手指动作,导致物体掉落或任务失败。

一个直观的替代方案是为每一种任务组合训练一个独立策略,但这会带来组合爆炸问题——若存在 nn 种抓取技能和 mm 种下游交互技能,就需要训练 n×mn \times m 个策略。这种方案既低效又不具备可扩展性。

DexCompose 的研究动机由此产生:能否像操作系统分配计算资源一样,将多任务组合视为一个手指资源分配问题——识别出每个策略真正 “占有” 哪些自由度,然后把空闲的手指 “释放” 给下游任务使用?

核心技术方法

DexCompose 采用两阶段流水线来解决策略组合问题:手指归属发现 (Finger Attribution) 和双残差组合 (Dual Residual Composition)。

手指归属发现

第一阶段的核心任务是回答:维持当前抓取状态,最少需要哪些手指?

具体做法是首先让预训练的抓取策略完成物体抓取,收集大量成功抓取状态。随后进行 “释放测试”:对每一种候选的手指掩码 m{0,1}Fm \in \{0,1\}^FF=5F=5 表示五指),保留掩码中标记为 1 的手指保持在参考抓取位置,而被标记为 0 的手指则沿着一条线性插值轨迹逐渐张开到完全释放姿态:

qi,ttest=mˉqiref+(1mˉ)[(1αt)qiref+αtqopen]q_{i,t}^{\text{test}} = \bar{m} \odot q_i^{\text{ref}} + (1-\bar{m}) \odot \left[(1-\alpha_t)q_i^{\text{ref}} + \alpha_t q^{\text{open}}\right]

通过对大量抓取状态执行该测试,计算两个指标:保持率 Pret(m)P_{\text{ret}}(m) 衡量物体是否能稳定保持在手内,清洁释放率 Pclean(m)P_{\text{clean}}(m) 衡量释放的手指是否真正脱离接触、不再提供支撑力。

最终的手指掩码选择由一个大型语言模型(LLM)代理完成。与仅选择最高保持率掩码的启发式方法不同,LLM 能够综合考虑抓取稳定性、释放质量以及下游任务对手指的语义需求。例如在 “抓球+开门” 任务中,启发式方法会选择拇指-食指抓取方案(保持率最高),但这会占用食指,导致无法有效拨动门把手;而 LLM 会选择拇指-无名指-小指的配置,虽保持率略低,却保留了食指用于后续交互,最终组合成功率从 72.1% 提升至 82.7%。

双残差稳定器

选定手指掩码后,第二阶段的组合机制引入了两个不对称的轻量残差模块:

任务 A 残差稳定器旨在维持已建立的抓取状态。它将抓取任务结束时的手指关节位置存储为参考 qrefq^{\text{ref}},并学习一个边界受限的残差修正:

ΔqtA=βAtanh(πresA(ot,m))\Delta q_t^A = \beta_A \odot \tanh(\pi_{\text{res}}^A(o_t, m^*))

这个 tanh\tanh 机制将残差输出严格限制在 [βA,βA][-\beta_A, \beta_A] 范围内,确保修正动作不会过度偏离参考配置。该模块专门补偿因腕部运动和释放手指动作带来的干扰。

任务 B 残差适配器则对冻结的下游策略进行上下文感知的修正,但仅限于分配给任务 B 的动作子空间内:

ΔatB=MB[βBtanh(πresB(ot,atB,m))]\Delta a_t^B = M_B^* \odot [\beta_B \odot \tanh(\pi_{\text{res}}^B(o_t, a_t^B, m^*))]

最终合成的动作为:

atcomp=MAatA,pres+MBatB,execa_t^{\text{comp}} = M_A^* \odot a_t^{A,\text{pres}} + M_B^* \odot a_t^{B,\text{exec}}

这种硬掩码机制强制执行了结构化的动作所有权——任务 A 的残差只能作用于保留的手指,任务 B 的控制信号只能作用于腕部和释放的手指。两个残差模块均采用 PPO 进行训练,任务 A 稳定器使用 1024 个并行环境训练 1000 轮迭代(约 20 分钟),任务 B 适配器使用 8 个并行环境训练(约 4 小时)。训练过程中所有基础策略权重保持冻结。

实验成果与关键发现

研究在 Isaac Lab 仿真环境中使用 Shadow Hand 机械手进行验证,组合了 4 种抓取保持技能(抓球、倒杯、抓罐、抓棍)和 4 种下游交互技能(开门、按按钮、开微波炉、拨开关),共形成 16 个组合任务。

表 1 的主要对比结果揭示了几个关键发现:

  • 直接策略串联几乎完全失败,平均成功率仅 3.09%,证明任务间干扰极其严重
  • 基于动作空间分解的基线(Decomposed, 45.61%)和全残差学习方法(FullRes, 61.60%)显著提升了成功率,但在竞争激烈的任务组合上仍不稳定
  • DexCompose 完整方案达到 77.43% 的平均组合成功率,相比最强基线提升 15.8 个百分点
  • 消融实验表明,任务 A 残差稳定器是最关键的组件:移除后成功率骤降至 9.13%,证明在释放手指和移动腕部时主动补偿干扰是维持抓取的必要机制
  • 移除动作掩码(即允许残差写入所有维度而非仅分配给任务 B 的子空间)使成功率降至 59.13%,这表明结构化所有权约束对减少跨任务干扰有显著作用

基础策略保持度分析进一步佐证了方法的有效性:DexCompose 的 A 侧保持率和 B 侧保持率分别达到 0.811 和 0.893,意味着组合后的策略几乎完整保留了原始单一技能的操控能力。

实践应用建议

对于从事灵巧操作研究的工程师和研究者,DexCompose 的技术路线提供了以下启示:

模块化策略复用:投资构建高质量的单任务灵巧操作策略库,通过后验组合而非重新训练来应对多样化的任务需求,这在工业场景中能大幅降低部署成本。

明确的所有权分配:在设计多任务控制器时,为每个子策略明确划定控制域(如特定手指或关节组),并通过硬掩码强制执行,这是降低冲突、提升鲁棒性的关键设计模式。

LLM 辅助的接触规划:利用大语言模型理解物体几何和任务语义的能力,辅助选择手指接触配置,往往能超越仅依赖力闭合指标的启发式规则。

残差修正而非重训练:当基础策略在组合环境中出现分布偏移时,学习一个受约束的残差修正比端到端重训练更高效,且能避免灾难性遗忘。

局限性与未来方向

当前框架存在几个值得关注的局限。首先,仅支持两个技能的串行组合,扩展到更长的任务序列需要研究层级化的所有权分配和动态掩码切换机制。其次,手指归属发现依赖于离线释放测试,在动态环境或新型物体场景中可能需要在线自适应。第三,LLM 代理的选择质量取决于对任务语义的理解程度,在极度规异的任务组合中可能需要额外的物理推理能力。

在更宏观的视角下,DexCompose 提出了一个富有前景的方向:将具身冗余视为可重用的计算资源。随着人形机器人和高自由度末端执行器的普及,这种思维方式可能超越灵巧手操作本身,应用于双臂协调、运动-操作整合等更广泛的人形操控场景。未来的研究可能沿着自主发现冗余自由度、动态角色切换以及多智能体行动空间分配等方向深化这一范式。

总结

DexCompose 通过将灵巧操作策略组合重新阐释为指级别的动作所有权分配问题,提出了一套优雅且实用的解决方案。其核心贡献在于:1)无需任务配对重训练的后验组合框架;2)融合物理释放测试与语言推理的手指归属分配机制;3)通过双残差稳定器实现非对称的抓取保持与交互执行。在 16 个组合任务上的卓越表现(较直接串联提升 74.3% 的成功率)证明了结构化动作所有权在解决多任务干扰方面的根本有效性,为构建可扩展、可复用的灵巧操作技能库开辟了新的技术路径。