AutoDex:面向灵巧抓取数据采集的自动化真实世界系统

AutoDex: An Automated Real-World System for Dexterous Grasping Data Collection

arXiv: 2606.23689v1

论文信息

标题: AutoDex: An Automated Real-World System for Dexterous Grasping Data Collection

作者: Mingi Choi, Gunhee Kim, Jisoo Kim, et al.

发布日期: 2026-06-22

arXiv ID: 2606.23689v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:灵巧手抓取策略的学习需要大量真实物理交互数据,但人工遥操作收集效率低下且带有操作者偏差,而纯仿真数据无法可靠验证真实接触动力学,存在几何可行性不等于物理有效性的核心矛盾。
  • 核心方法:构建全自动数据采集系统 AutoDex,将仿真生成的候选抓取在真实机器人上执行、通过 20 相机密集感知进行物体位姿估计与跟踪、基于抬升-保持准则自动标注成功/失败、并通过主动抓取重置实现多稳定位姿间的持续试验。
  • 关键结果:AutoDex 的采集吞吐量是人工遥操作的 4.8 倍(500 次试验仅需 10.3 小时对比 49.4 小时),且通过物理验证筛选后的抓取数据库在桌面上、墙壁旁和杂乱场景中的实际成功率达到 76%,远高于未经真实验证的 34%(见论文第 4.2 节,图 4 右)。
  • 主要局限:系统仅支持固定臂-手组合的单臂灵巧抓取,不处理双臂协调、人手内滚动重抓取以及工具使用等功能性抓取;依赖于多相机工作单元,在更稀疏的传感器配置下部署时的可靠性会下降。
  • 适合读者:从事机器人操作数据采集、灵巧抓取、仿真到真实迁移的研究者,以及关注自主机器人系统设计和数据集构建的工程师。

论文背景和研究动机

灵巧抓取是机器人学中长期存在的挑战。与平行爪抓取不同,多指手抓取涉及高维手部构型和多个同时接触点,位姿、摩擦、顺应性和力分布的微小误差都可能决定抓取成败。因此,学习鲁棒的灵巧抓取策略需要记录真实物理执行结果的数据,而不仅是仿真中的几何可行性判断。

当前的数据采集范式在规模和物理有效性之间存在根本性权衡。人工遥操作方式虽能产生真实的接触动力学反馈,但速度慢——操作者需要持续关注高自由度的灵巧手控制,且记录的抓取分布反映了操作者的偏好而非对稳定位姿或场景约束的系统性探索。另一方面,基于仿真和优化的抓取合成方法可以低成本生成大量候选构型,但其有效性预测完全依赖仿真器中的接触模型。即便采用域随机化等技术,仍无法处理手指垫变形、机械间隙、微滑移等仿真中缺失或不精确的物理效应。论文明确指出:“一个候选抓取可能是生成器有效的且规划器可执行的,但在物理执行时仍会失败”(见引言)。

解决这一矛盾的自然思路是将可扩展的候选生成与真实硬件验证相结合。但这要求整个采集回路——感知、执行、标注、重置——都能在无人工干预下运行。任何环节的人工介入都会重新引入遥操作的瓶颈。AutoDex 正是为此而设计的端到端自主数据采集系统。

核心方法和技术细节

AutoDex 的系统架构围绕四个核心组件构建,它们共同实现了从候选抓取生成到物理标注的完全自主化。

候选抓取生成与场景规格化。系统采用模块化的生成器接口,论文中使用 BODex 作为具体实现。场景规格通过墙、架、盒三种平面约束原语来描述常见的桌面操作约束。对于每个物体的稳定桌面位姿,系统聚合不同场景约束下生成的候选抓取,形成位姿索引的候选集。这种设计使抓取候选的覆盖范围由显式的场景参数控制,而非操作者的即兴选择。

20 相机密集感知工作单元。AutoDex 部署在一个装有 20 个同步 RGB 相机的 1.5×1.5×2.5 米 LED 照明采集单元中。所有相机通过硬件触发实现亚毫秒同步,以 2048×1536 分辨率 30FPS 采集。这种密集排列的核心目的不是追求图像质量,而是提供冗余视角以应对灵巧手在抓取过程中对物体造成的严重遮挡——这是灵巧抓取数据标注特有的难点。多视角下的物体位姿估计通过 SAM3 预测物体掩码,结合 FoundPose 的 RGB 基础特征位姿估计器在多个视角上产生假设,然后通过跨视角渲染轮廓与观测掩码的 IoU 进行共识选择,最终对筛选后的视角进行轮廓优化精化。

基于残差力矩的安全性监控。无干预运行要求可靠的安全机制。论文发现机械臂自带的碰撞检测器在灵巧抓取场景中不可靠,因为被夹持的物体表现为持续性外部载荷,且安装的灵巧手改变了末端惯性,容易触发误报。AutoDex 采用了一个学习的残差力矩监控器:训练一个小型 MLP(不到 100KB)以预测名义自由空间力矩,运行时计算预测力矩与电机电流推算力矩的残差。当肩关节监测窗口内的残差持续超过 30N·m 达 0.5 秒时,系统判定为意外接触并中止动作。该监控器仅在接触危险段启用(如下降接近桌面或场景时的运动段),接触后通过保持末端高度单调增加的恢复轨迹回到 home 构型。论文报告该监控器在 2.7% 的接近段试验和 8.9% 的放置段试验中触发了停机(见附录 C),有效防止了硬件损伤。

抬升-保持成功率标注与执行时跟踪。每项试验的成败通过客观的物理标准自动判定:物体在 3 秒保持阶段内持续保持在初始高度以上 5cm 即为成功,否则失败。关键的设计选择是将位姿跟踪后置执行:系统记录完整的多视角视频流,试验结束后运行多视角 GoTrack 估计物体位姿轨迹,再应用抬升-保持准则赋予标签。这避免了在线跟踪延迟对机器人执行时序的干扰。

主动重置与高度松弛放置。当物体当前稳定位姿下无可执行的未尝试候选抓取时,AutoDex 需要将物体重新放置到另一个仍有未尝试候选的稳定位姿。直接放置方式将拾取和放置约束合并为单一碰撞场景,生成满足两端几何兼容性的重置抓取。对于扁平物体(如盘子、托盘),同时满足拾取和放置约束可能导致手指空间不足。系统引入高度松弛放置:允许物体在目标位姿上方高度 hh 处释放,但同时添加虚拟支撑柱作为碰撞几何,排除手指侵入释放后物体下降区域的抓取。论文从 h=0h=0 开始尝试,仅在无碰撞解时递增高度(见第 3.4 节)。

创新点和贡献

端到端自主验证循环。AutoDex 首次将灵巧手抓取数据的采集从人工遥操作转向完全自主。系统整合了感知、规划、执行、安全监控、成功标注和场景重置的全链条,消除了人工瓶颈。传统上,灵巧抓取的数据采集依赖于操作者通过手套或视觉界面控制多指手,而 AutoDex 将人的角色从 “执行者” 转变为 “系统初始化者”,实现了持续无人值守的数据积累。

物理标签数据库的构建范式。不同于仅存储生成器输出的抓取数据库,AutoDex 构建的数据库包含物理执行的成功与失败标签。论文通过对比实验有力地证明了这一范式的价值:使用 AutoDex 验证的数据库检索抓取,在 20 个物体、515 次试验中达到 76% 成功率,而仅通过仿真前筛选的数据库仅有 34%(见论文第 4.2 节,图 4 右)。该提升在材质类别、场景类型和重量区间上一致,在杂乱场景中差距最大,模型筛选数据库的抓取频繁因接触失稳而失败,而 AutoDex 验证数据库维持了 80-90% 的成功率。

系统级的效率与可靠性工程。吞吐量分析显示 AutoDex 的循环时间瓶颈在于物理机器人运动(占总周期约 76.1%),而非感知或规划计算(见论文图 3 右)。这意味着系统并未通过缩短单次执行来实现高效,而是通过消除人工空闲时间和实现持续运行来获得 4.8 倍吞吐量提升。重置策略的比较实验也揭示了被动抛掷策略的根本缺陷:成功重置率随被动转移概率的降低而急剧下降,而主动放置策略在 P(Pj∣Pi)≈0P(P_j|P_i) \approx 0 的困难转移中仍保持高成功率(见论文图 5 左)。此外,被动重新定向下落中 5.3% 的试验将物体弹射出工作空间,需要人工恢复,而主动放置未发生此类故障。

实验结果分析

论文的四组实验从不同角度评估了 AutoDex 的系统性能。

吞吐量与瓶颈。在相同工作单元中,AutoDex 以 10.3 小时完成 500 次试验,而人工遥操作需 49.4 小时,后者因操作者疲劳和日终停歇积累了长时间的非活跃间隔。单次抓取执行的平均周期为 48.2 秒,其中机器人执行占 51.5%,撤回占 24.6%,感知与运动规划各占 16.1% 和 7.8%。物理动作的主导地位意味着进一步优化感知或规划难以显著提升吞吐量。

物理验证改善数据集质量。对比实验在桌面、墙壁和杂乱三种场景类型下进行,使用了 20 个物体的 515 次总试验。AutoDex 验证数据库的 76% 成功率与模型筛选数据库的 34% 成功率之间的差距,直接证明了仅凭运动学和碰撞可行性无法预测真实接触动力学下的抓取稳定性。论文特别指出,这种失效并非源于生成器的质量低下,而是由于仿真中缺失或简化了的物理效应(摩擦、滑移、顺应性、多指不稳定)在实际接触中起决定性作用。

主动重置的必要性。论文通过测量物体的被动转移概率 P(Pj∣Pi)P(P_j|P_i) 来量化不同位姿对间的重置难度。朴素抛落策略的成功率天然等于被动转移概率,而主动放置策略在整个难度范围内维持了高成功率。这一结果对无人值守运行至关重要:如果重置失败导致物体停留在错误位姿,系统将无法继续选择该稳定位姿下的候选抓取,最终阻断采集循环。

相机密度与位姿可靠性。ADD-S 指标从 2 相机时的 14.3mm 降至 16 相机时的 0.5mm,最大改善发生在 2 到 4 相机之间(见论文图 5 右)。2 相机时在无纹理或薄物体上偶发灾难性位姿估计失败,这些尾部失效在 8 相机时基本消除。论文据此论证,密集多视角冗余对无人值守采集的可靠性至关重要,因为候选筛选、碰撞检查和抓取执行都依赖于物体位姿估计的准确性。

实践建议

对于希望构建类似自主数据采集系统的研究者或工程师,AutoDex 的设计提供了以下可借鉴的经验。

安全机制不应依赖通用出厂方案。论文中 xArm6 的工厂碰撞检测在灵巧手和夹持物体的组合下产生大量误触发,而学习残差力矩监控器通过建模特定臂-手组合的名义动力学解决了此问题。实际部署时,建议针对实际使用的末端执行器采集自由空间力矩数据进行模型训练,而非信任预置的碰撞检测参数。

位姿估计的冗余性是一种可靠性投资。尽管 4 或 8 相机即可获得平均位姿精度较好,但消除灾难性失败的尾部风险需要更高的冗余度。在无人值守系统中,单个位姿估计错误可能导致碰撞、硬件损伤或整个采集运行的停滞,因此前期在相机数量上的投入可能避免后续更高的修复成本和数据损失。论文中 2.7% 和 8.9% 的接触监控触发率(见附录 C)也印证了感知失效在真实运行中的发生率。

物理验证的价值应作为数据集构建的标准步骤。AutoDex 的核心洞察是几何可行性并不保证接触稳定性,而这一差距无法通过仿真器改进完全弥合。对于需要高质量抓取数据库的应用,建议将物理执行和自动标注作为数据筛选的必要环节,而非仅依赖仿真器中的启发式筛选。论文中 34% 到 76% 的成功率跃升(图 4 右)直接量化了这一步骤的价值。

重置策略应避免对无控制动力学的依赖。实验表明,依赖重力抛落或被动整定的重置策略在困难位姿对间不可靠,且可能造成物体丢失。主动放置将控制延伸至接触结束后的物体释放阶段,是实现真正无人值守的必要条件。高度松弛放置提供了在处理扁平物体时的实用折中。