Mana:铰接工具的灵巧操作
论文信息
标题: Mana: Dexterous Manipulation of Articulated Tools
作者: Zhao-Heng Yin, Guanya Shi, Pieter Abbeel, et al.
发布日期: 2026-06-11
arXiv ID: 2606.13677v1
PDF 链接: 下载 PDF
论文背景与研究动机
许多对人类而言司空见惯的工具——钳子、夹子、注射器——本质上都是铰接机构。使用这些工具时,机器人不仅需要稳定抓握,还要在维持接触的同时驱动工具自身的内自由度。这种 “接触-施力双重要求” 构成了灵巧操作领域的核心难题。
现有方法面临双重困境。一方面,基于遥操作的方案受制于位置映射的本质局限:人类通过手部姿态控制机器人指尖时,很难在薄至 1 厘米的工具手柄上产生足够且方向精确的力。常见的变通方法如 “让指尖略微穿透表面以激发接触力”,在面对需要 3-7 牛顿操作力的场景时远不够用。另一方面,端到端的强化学习又面临探索效率问题——在 23 维的动作空间中(手臂 7 自由度+灵巧手 16 自由度),从零开始发现毫米级精度的接触位置几乎不可能。
本文作者团队来自 UC Berkeley、CMU、Stanford 和 Amazon FAR,他们巧妙地将目光转向了计算机动画领域。动画制作中通用的思路是 “从粗到细”:先设定关键帧,再进行中间帧的生成。这一哲学被移植到机器人数据生成中,形成了名为 Mana(Manipulation Animator)的框架。
核心方法与技术细节
从关键帧到完整轨迹
Mana 将铰接工具操作分解为三个有序阶段:预抓取、抓取、手中驱动。整个过程从少量人工标注开始——用户只需点击工具网格上的功能性区域(如钳子手柄、注射器推杆),耗时不超过 1 分钟。系统基于这些标注自动生成大量候选抓取关键帧。
为了处理桌面薄物体抓取中的碰撞问题,作者提出了碰撞感知的运动学优化算法。该算法的核心思路是在每次迭代中为发生穿透的手指施加 “排斥力”,使其远离障碍表面,同时向最近接触点施加 “吸引力”。迭代过程中交替进行接触投影与穿透解算,使手指既维持工具接触又不与环境碰撞。这一增强被称为 Lightning Grasp+。
分段生成策略
预抓取阶段本质上是几何问题。Mana 使用 GPU 加速的 RRT-Connect 运动规划算法生成从初始手部姿态到预抓取位姿的轨迹。这里的巧妙之处在于定义预抓取位姿的方式——它将指尖沿接触法线方向向外偏移一段随机距离。这为下游的抓取阶段提供了方向一致的接近路径,同时保证了数据多样性。
抓取阶段有两种处理方式。对于简单情形,系统几何地计算 “握紧配置”,让手指沿接触法线方向合拢。但对于不稳定接触或接触法线与所需施力方向不一致的棘手情形,Mana 会调用短程强化学习策略来连接预抓取关键帧和稳定抓取关键帧。这种短视界的 RL 不会遭遇端到端方案的大规模探索困难。
手中驱动阶段是接触最密集的阶段,统一由强化学习处理。任务被建模为目标达成问题:从稳定抓取状态出发,目标是使工具达到指定的关节位置。奖励函数包含三个分量:
其中 衡量工具关节位置和位姿的匹配程度, 约束手部动作幅度, 鼓励多点接触的维持。力相关的域随机化是整个训练的关键:PD 控制器增益、物体质量、摩擦系数、工具关节参数都被大幅随机化,使策略学会在不同动力学条件下维持稳健的力平衡。
视觉运动策略与 Sim-to-Real
仿真轨迹生成后,Mana 训练一个基于点云条件的扩散策略用于真实部署。感知流水线使用 SAM 3 进行图像分割,结合 Fast Foundation Stereo 生成物体点云,最终在手腕坐标系中表示。点云经 Perceiver-style Transformer 编码为少数标记,与机器人本体感知数据拼接后输入轻量级 Transformer 扩散头。
在训练过程中施加点云噪声扰动和随机部分掩码,使策略对分割不完善、深度噪声等真实世界感知误差具有容错能力。硬件方面,作者设计了扁平化、带柔软硅胶层的指尖,增加与薄工具之间的接触面积,实现被动形变补偿。
创新点与贡献
Mana 的核心贡献在于方法论范式的转变:将机器人数据生成重新表述为动画合成问题。这一视角带来了几个关键的技术创新。
首先,从粗到细的分解策略解决了长期困扰灵巧操作的两难。端到端方案要求策略同时发现接触位置和习得力控制,探索空间维度极高;分层方案则可能在各层间积累误差。Mana 通过人工标注关键帧 + 自动化插值的方式,在可扩展性和行为精度之间找到了平衡点。
其次,碰撞感知的抓取合成使得从桌面拾取薄铰接工具成为可能。传统抓取合成算法对薄物体贴近桌面时的碰撞处理往往失败,LG+的迭代排斥-吸引机制有效解决了这一问题,生成的抓取姿态对于从零开始的 RL 探索几乎不可能发现。
第三,力的随机化与物理鲁棒性的设计十分精细。不仅是常规的质量、摩擦随机化,还包括执行器 PD 增益的缩放—模拟电机刚度变化和性能衰减—以及持续的物体力扰动。这种全面的随机化对于需要平衡多重力的铰接工具操作至关重要。
实验结果分析
实验覆盖了四种差异显著的铰接工具:夹钳(长行程协调)、钳子(高力闭合)、衣夹(高阻抗精确驱动)和注射器(精密线性推拉)。这些工具厚度约 1 厘米,需 3-7 牛顿力驱动。
主实验结果展示了显著优势。抓取成功率方面,Mana 达到 70-80%,远超过遥操作基线(GeoRT)的 0-30% 和开环基线(Openloop)的 30-70%。手中操作阶段同样保持 70% 左右的高成功率,而遥操作对衣夹的驱动成功率为 0(因为位置式控制无法产生足够力),开环方案则因感知误差累积而频繁失败。
消融研究揭示了数据量与多样性对性能的直接影响。真实世界成功率随着训练轨迹数量和抓取关键帧数量的增加而显著提升。这一发现与近期大规模 RL 研究的结论一致:对于接触敏感的精细操作,状态空间的密集覆盖是鲁棒性的关键。
完整工具使用任务(用夹钳拾取物体、用钳子剪切导线、用衣夹夹持、用注射器注射)的成功率为 50-70%。性能下降主要源于工具与目标物体交互时的新受力情况。作者采用手腕遥操作进行工具到目标物体的精细对齐,这实际暴露了当前灵巧操作系统在感知精细定位方面的局限。
实践应用建议与未来发展方向
对于希望复现或扩展这一工作的研究者,有几个关键实践建议:
抓取数据生成优先。Mana 的成功很大程度上依赖高质量、多样化的关键帧。Lightning Grasp+的碰撞感知优化对于桌面薄物体至关重要,建议在类似场景中优先使用。消融研究表明,即使 RL 训练规模不变,仅增加关键帧多样性就能提升实际性能。
力的物理建模与校准要精细。作者花费了大量精力进行系统辨识——测量真实机械手的力响应特性,并在仿真中近似工具的内弹簧机制。隐式欧拉积分法、小时间步长(1/200 秒)、高迭代次数(16-32 次位置迭代)的设置对稳定仿真输出力大的场景很必要。在部署 10N 以上的操作任务时,这些细节可能成为成功的瓶颈。
指尖设计不可忽视。扁平的软指尖在本工作中至关重要。增加接触面积和被动形变是应对毫米级定位误差的经济方法,值得在实际系统中考虑。
未来方向方面,以下几点尤其值得关注:
硬件层面的力输出限制。当前 Allegro 手的最大关节扭矩 0.7 Nm,有效输出力约 10N。许多日常工具(如扳机式喷壶、强力钳)需要更大的驱动力。下一代硬件设计可能需要在不增加手部尺寸的前提下提升力矩密度。
接触感知的粒度与模态。尽管视觉策略在零样本迁移中表现不错,但无法检测滑动、不能感知微小摩擦力变化。高频触觉传感器(如 GelSight、BioTac)可能是在力密集操作中实现实时闭环的关键。
技能链的自动化。当前系统中工具与目标物体的精细对准仍依赖人体遥操作。将这一步骤也纳入自主策略,需要通过物体姿态估计和接触规划的结合。
总结与展望
Mana 展示了一种值得关注的范式:利用仿真生成的大规模、物理精确、具备语义标注的训练数据,配合鲁棒的 sim-to-real 迁移策略,解决传统上被视作遥操作专场的灵巧操作问题。它清晰地表明,动画制作中 “关键帧-插值” 的思维方式与机器人学习的结合能够产生强大的协同效应。
更宏观地看,这项工作初步打通了从仿真到真实的铰接工具使用链条——从抓取、驱动到功能完成。这条链条上的每一个环节在未来都有深化和扩展的空间:更大的力输出、更精细的感知、更长程的任务组合。随着硬件、仿真技术和学习方法的同步进步,灵巧工具操作从实验室走向实用场景的道路正在逐渐清晰。