Mana:铰接式工具的灵巧操作

Mana: Dexterous Manipulation of Articulated Tools

arXiv: 2606.13677v1

论文信息

标题: Mana: Dexterous Manipulation of Articulated Tools

作者: Zhao-Heng Yin, Guanya Shi, Pieter Abbeel, et al.

发布日期: 2026-06-11

arXiv ID: 2606.13677v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:这篇论文要解决多指灵巧手对关节式工具(如钳子、衣夹、注射器)的自主抓取与功能操作问题,这些操作需要同时稳定工具并施加精确的操作力。
  • 核心方法:提出 Mana 框架,借鉴计算机动画的 “粗到细” 管线,将人类少量标注(鼠标点击指定功能部位)程序化生成大量抓取关键帧,再用运动规划与强化学习填充关键帧之间的接触丰富过渡段。
  • 关键结果:在四种形状、尺度与关节特性各异的关节式工具上,实现了零样本 sim-to-real 转移,真实世界抓取与在手中操作的平均成功率约为 70%(见表 1),而遥操作基线在多数任务上成功率仅 0–30%。
  • 主要局限:受限于 Allegro 手的电机扭矩(最大 0.7 Nm),无法处理需要超过 10 N 操作力的工具(如扳机类);对极细目标的对齐仍需人工腕部遥操作,视觉感知在遮挡与小尺寸下仍面临挑战(见论文第 6 节)。
  • 适合读者:从事灵巧操作、sim-to-real 迁移、模仿学习与数据驱动机器人学的科研人员,以及对将动画思维引入机器人学习感兴趣的工程师。

论文背景和研究动机

在人类环境中,大量高频使用的工具并非刚性单一物体,而是包含内部自由度的关节机构——用钳子夹取小物、用衣夹固定、用剪刀或钳子切割、压注射器活塞排液。这些任务要求操作者不仅抓住工具,还要在手指始终保持稳定接触的同时,对薄而移动的柄施加精确的操作力。

然而,当前灵巧操作研究主要围绕刚性物体展开。即使近年刚性物体的抓取与手中重定向取得长足进步,关节式工具的操作仍处于待探索状态。这背后的物理挑战相当艰深:稳定工具和施加操作力这两个目标常需要高度困难的力配置(见图 2)。系统需要在摩擦锥内找到精确的接触力和方向,任何单指上的微小执行误差都可能改变接触点与力臂,导致整个交互崩溃。此外,很多工具需要 3–7 N 甚至更高的操作力,进一步放大滑动与不稳定的风险。

人类遥操作直觉上似乎是获取此类操作的捷径,但论文指出,现有遥操作界面大多是位置层面的(重定向指尖位置或手形),而非直接指定接触力。常见的补救方案——将指令指尖稍微向物体内部沿法线方向偏移,以通过底层 PD 控制器产生接触力——所能生成的力量有限,对于刚度高的工具关节往往无法提供足够驱动力,而且方向也不一定与所需的力方向重合(见图 2 及论文第 1 节)。

另一方面,端到端 sim-to-real 强化学习在这类任务中也显得不够成熟:策略需要在厘米级表面上发现精确的功能性接触,在工具构型动态变化间保持该接触,同时在高维动作空间产生足够大且有特定方向的操作力——从零开始的探索极为困难。

这些难点将作者的思路引向一个出人意料的灵感来源:计算机动画。

核心方法和技术细节

Mana 的核心立意是将关节式工具操作重新诠释为一个 “动画问题”,并借鉴动画流水线中 “设定关键帧—生成中间插值帧” 的粗到细思维,构建大规模仿真训练数据。整个数据系统(见图 3)包含三个主要阶段:抓取生成、轨迹生成和目视运动策略训练。

抓取生成器

对每个工具,人类标注者只需在 3D 界面上用鼠标点击几次,标出工具的标准姿态和功能性区域(如手柄处的啮合面、注射器的活塞与筒管)。整个标注过程不超过 1 分钟。论文提到,将来可利用现有功能可供性模型进一步自动化这一步(见论文第 3.1 节)。

基于这些标注,系统在增强版 Lightning Grasp 流水线上生成大量功能抓取关键帧。标注的功能区域上通过接触场构建接触域,再在域内优化指尖接触点和手指关节构型,并对生成的抓取在 IsaacLab 仿真中进行稳定性过滤。对关节式工具,与刚体不同的关键是:不只是单个稳定抓取,而要生成一整条在未来操作中存在的 “抓取链”。因此,关键帧规划器会跨功能接触区和相关工具构型(例如注射器在不同活塞位置下)密集采样状态,以此覆盖工具使用的多样状态空间。这个密集覆盖非常重要,因为关节式工具对接触位置毫米级变化极其敏感。

轨迹生成器

生成的抓取关键帧定义了操作序列的骨架节点。轨迹生成器再按 “预抓取—抓取—手中操作” 三个阶段填充节点间的运动。

  • 预抓取:使用 GPU 加速的 RRT-Connect 算法规划无碰撞的手腕与手臂运动。为避免与薄型关节工具过早碰撞,预抓取姿态是将指尖从最终接触位置沿表面法线向外随机偏移一段距离,再过滤碰撞构型获得。
  • 抓取:多数情况下,可通过将指尖沿接触法线向内挤压至优化接触构型,闭合手指夹住工具再提起,即可程序化生成执行轨迹。当工具过薄、初始接触不稳、或接触法线与所需稳定力方向不一致时,则训练一个短视域强化学习策略来填补预抓取到抓取关键帧之间的动态接触控制过渡。
  • 手中工具操作:这是接触最丰富的阶段,手必须在防止滑动、弹射或非期望体运动的同时施加任务导向力。论文将该阶段视为一个通用的目标到达问题,强化学习从预先生成的稳定抓取关键帧出发,目标为赋予特定工具构型变化的过渡状态(如从张开到闭合)。奖励由三项组成: r=rtool+w1rhand+w2rcontactr = r_{\text{tool}} + w_1 r_{\text{hand}} + w_2 r_{\text{contact}} 其中 rtoolr_{\text{tool}} 鼓励工具关节位姿匹配目标,rhandr_{\text{hand}} 鼓励手的当前姿态向期望姿态正则化,rcontactr_{\text{contact}} 直接鼓励维持并增加有效接触点数(见附录 A.2)。训练时注入多样的力域随机化——随机 PD 增益、物体质量与摩擦系数、外力扰动、动作噪声等——以练就鲁棒行为。成功完成目标到达的工具构型与姿态满足一定阈值后,将完整轨迹连同 “开启”“关闭”“挤压” 等语义标签存储为训练数据集。

视运动策略

为使操作策略能从视觉观察部署到真实世界,论文训练了一个点云条件的 Transformer 扩散策略(见图 4)。RGB-D 图像经 SAM 3 分割后与 Fast Foundation Stereo 结合生成工具点云,在手腕坐标系下编码。Perceiver 型 Transformer 将点云压缩为少量 token,连同机器人本体感知(过去两帧的手指关节位置与目标)传入基于 Transformer 的扩散头,生成 δ 手腕位姿和 δ 手指关节目标。训练时进行点云噪声干扰和随机部件掩蔽,以增强对真实世界中不完美分割和深度噪声的宽容度。

该策略完全在 Mana 生成的仿真数据集上训练,不依赖任何真实世界示教数据,直接零样本部署到真实机器人。

创新点和贡献

动画思维解决数据困境:将关节式工具操作解构为 “关键帧设置—中间帧生成” 的动画范式。这与现有端到端学习或纯遥操作的路线形成鲜明对比。通过少量人工功能标注(每工具 < 1 min)实现大规模自动数据生成,显著降低了数据获取成本与探索难度。

粗到细的异构轨迹合成:明确将长时间操作分为预抓取(几何运动规划)、抓取(程序化+必要时的短程强化学习)、手中操作(强化学习目标到达)三个阶段,每个阶段采用最适合其物理特性的合成机制。这种 “哪里接触、哪里学习” 的异构设计避免了从零开始探索长周期任务的计算负担。

力域鲁棒性的系统处理:论文对力的建模投入了大量细节——从校准仿真中的 PD 控制器、使用电子力计对真实工具参数进行系统辨识,到采用隐式欧拉法维持高刚度和大力值接触下的仿真稳定性,再到训练时对力相关参数的激进随机化(控制器增益、摩擦、质量、外力扰动)。这些常常被忽略的工程细节,构成了 sim-to-real 成功转移的基础。

针对薄型工具的硬件与感知协同设计:通过定制扁平柔顺指尖(硅胶浇铸、仿人指尖几何)增加薄型工具接触面积与被动容错;使用高效视觉链路(SAM3+FastStereo)在约 10 Hz 下推理,以处理 1 cm 级别的薄型工具感知。

实验结果分析

论文在四种代表性关节式工具上评估系统:钳子、钳夹、衣夹和注射器,每种使用两个物体实例。这些工具的厚度约为 0.8–1.5 cm,操作力在 3–7 N 范围,对相比人类手大约两倍的 Allegro 手而言极具挑战(图 6)。

与基线的对比

表 1 将 Mana 训练的策略与两个基线进行对比:开环执行 Mana 生成轨迹以及人类使用 GeoRT 遥操作。Mana 策略在抓取和手中操作各分项(张开/关闭/使用)上普遍达到 0.6–0.8 的成功率;遥操作基线则通常在 0.0–0.3 之间。论文指出遥操作难以在薄型关节工具上产生足够且精准的操作力,甚至对于衣夹这类刚度更高的工具完全无法闭合,这与近期其他研究的发现一致(见论文第 5.2 节)。开环基线因对真实工具位姿的微小估计误差敏感,成功率也低于闭环策略。

数据规模与多样性的消融

图 7 的系统消融表明,真实世界的成功率与仿真中使用的轨迹数量和抓取关键帧数量呈正相关,同时强烈依赖于力扰动与动作随机化强度。这印证了对于接触敏感的任务,必须通过密集采样来覆盖接触模式空间,而高强度的力域鲁棒化训练对抗真实执行中的电机噪声和扭矩衰减至关重要。

整工具使用任务

在将抓取—手中操作组合成完整功能性任务(用钳子夹取小物、用钳夹断电线、衣夹夹持、注射器推液)的测试中(表 2),成功率在 5/10 到 7/10 之间。性能的退化主要来自工具与其他物体的交互引入了未见过的扰动,可能超出仿真训练的力域范围。当前系统在对准极细目标时仍依赖人工腕部遥操作完成过渡,尚未实现全自主任务执行。

实践建议

基于 Mana 的设计与实验结果,面向灵巧操作系统的工程落地可从以下方面获得启示:

  1. 数据生成:借鉴关键帧—插值范式。对于长周期、多阶段的操作任务,完全端到端训练并非总是最优。先标定任务的关键 “骨架” 状态(如预抓取、稳定抓取、工具操作极值),再针对接触相使用短程强化学习生成过渡数据是一条可推广的路径。这种粗到细策略显著减轻探索负担,同时保持运动多样性。

  2. 力域建模与随机化并重。高接触力场景下,仿真致稳与力参数准确校准(如使用隐式积分、增加位置/速度迭代次数)是基础。更重要的是对 PD 增益、摩擦系数、质量、外力扰动等参数进行大范围随机化。从本文消融实验可见,力域随机化强度与真实世界鲁棒性直接相关。

  3. 硬件设计配合任务。标准半球指尖在薄型工具上容易形成点接触而打滑。设计带有扁平柔顺表面的指尖可显著增大接触斑面积并使被动形变吸收位姿误差。当目标工具厚度在 1 cm 级别时,这种定制是必要而非可选的。

  4. 感知流水线的实时性与鲁棒性权衡。论文选择 SAM 3 + Fast Foundation Stereo,在双 RTX 4090 工作站上达到约 10 Hz,虽非高频但满足了策略推理需求。实践中分割基础模型与立体匹配的搭配可在边缘设备上进一步剪裁加速。通过点云编码的随机掩蔽与噪声注入训练,使得策略对分割不全和深度误差有高度容错。

  5. 组合技能链的逐步自主化。当前方案中对齐精细目标的过渡仍借力于腕部遥操作,提示我们:在感知尚无法处理亚厘米级精确定位时,可优先实现抓取与操作的主体自主化,对准阶段可先借助人工少量介入收集数据,进而逐步训练独立的对准策略。