AutoDex:一种面向灵巧抓取数据采集的自动化真实世界系统

arXiv: 2606.23689v1

论文信息

标题: AutoDex: An Automated Real-World System for Dexterous Grasping Data Collection

作者: Mingi Choi, Gunhee Kim, Jisoo Kim, et al.

发布日期: 2026-06-22

arXiv ID: 2606.23689v1

PDF 链接: 下载 PDF

背景与问题:灵巧抓取数据为何难获取

灵巧多指抓取是机器人操作中的长期难题。与平行夹爪不同,多指手的高维关节配置和多点接触特性使得一个看起来可行的抓取姿态,在实际执行中可能因接触力分布、摩擦、指垫变形等微小差异而滑脱或失败。因此,学习鲁棒的灵巧抓取策略离不开大量包含真实物理结果的试验数据——既要成功案例,也要失败记录。

然而,收集这类数据面临两难:人类遥操作可以给出真实的接触结果,但速度慢、受操作员疲劳和偏好限制,且成本高昂;基于模拟器的抓取合成(如通过优化或学习生成候选姿态)可以低成本、大规模地生成抓取方案,但模拟中的接触物理往往无法准确复现现实中的滑移、柔性变形和执行器动力学。一个自然的思路是 “生成候选抓取,再在真实硬件上验证”,但要让这种验证可扩展,整个流程——感知、执行、标注、场景重置——必须完全脱离人工干预。这正是论文所解决的问题。

AutoDex:全自动灵巧抓取数据收集系统

AutoDex 是一套端到端的真实世界自动化数据收集系统。它以一个物体的三维模型和生成的候选抓取方案为输入,自主完成抓取试验的执行、成功/失败标注以及物体姿态重置,循环采集,最终构建出一个带有真实物理标签的抓取数据库。系统由四个核心模块支撑:

  • 密集多视角感知:20 台同步 RGB 相机组提供冗余观测,用于初始物体 6D 姿态估计和抓取执行中的高遮挡跟踪;
  • 碰撞监测安全执行:基于学习残差力矩的碰撞检测,确保无人值守时不损坏硬件;
  • 自动成功/失败标注:通过提举-保持试验(lift-and-hold)自动判定抓取是否稳定;
  • 主动物体重置:当当前姿态下的候选抓取耗尽时,机器手主动抓取物体并将其放置到其他稳定姿态,继续评估剩余候选。

候选抓取由外部生成器(论文中使用 BODex)给出,并与场景约束(如墙壁、隔板、箱子)结合,形成按物体稳定姿态索引的候选集。AutoDex 从当前姿态中动态筛选出可通过运动学检查和碰撞检测的可行候选,依次执行。每执行一次,该候选被标记为 “已尝试”,确保状态化调度,避免重复验证。

感知与标注:20 相机阵列如何工作

灵巧抓取过程中,机器手会严重遮挡目标物体,单一视角难以可靠跟踪物体。AutoDex 的工作间内布设了 20 台标定同步的 RGB 相机,分辨率 2048×1536,帧率 30 FPS。初始化时,系统使用 SAM3 对每幅图生成物体掩模,再用 FoundPose 估计各视图的姿态,通过多视图剪影一致性选出最佳姿态,最后进行剪影优化求精。执行阶段则采用 GoTrack 对录制流进行 6D 位姿跟踪,在提举-保持阶段判断物体是否持续高于桌面 5 cm 并保持 3 秒,若成功则标记为成功抓取,否则为失败。这种离线标注方式避免了实时跟踪延迟对机器人控制的干扰。

安全监测:学习残余力矩的碰撞检测

在无人值守运行时,机械臂需要能够自主检测异常接触并及时停机。传统基于动力学模型的碰撞检测器在抓持物体时容易因外部载荷和末端惯量变化产生误报。AutoDex 改用基于学习的残差力矩监测器:在自由运动状态下采集关节位置 qq、速度 q˙\dot{q} 和电机力矩 τmotor\tau_{\text{motor}},训练一个多层感知机(MLP)预测名义自由空间力矩 τ^θ=MLPθ(q,q˙)\hat{\tau}_\theta = \text{MLP}_\theta(q, \dot{q}),计算残差 τres=τ^θτmotor\tau_{\text{res}} = \hat{\tau}_\theta - \tau_{\text{motor}}。当肩部关节的时序滤波残差超过预设阈值并持续 0.5 秒时,触发碰撞报警,机器人立即中止当前动作并执行末端上抬的恢复轨迹。监测器仅在接触关键阶段(如向下靠近桌面)启用,既保证了安全性,又避免了误触发。实验数据显示,该监测器在无人干预的 1870 次试验中成功防止了机械臂安装适配器的再次损坏,且误报偏向保守,符合无人操作的可靠性需求。

物体重置:从被动掉落到主动放置

当物体当前姿态下所有可行候选都已执行完毕,系统需要将物体转到另一个姿态继续验证。简单的被动掉落(naïve drop)只依靠重力随机沉降,达到目标姿态的概率极低,尤其对于扁平、不对称物体;即使先重定向再释放,最终姿态仍不受控。AutoDex 采用 “稳定重定向放置”(stable reorient placement):规划一个抓取姿态,使得同一手-物抓取既能从当前姿态拾取物体,又能在目标姿态下放置并释放。对于扁平物体如盘子,放置时手指容易侵入物体下降区域,系统引入了 “高度松弛”:允许物体在离桌面一定高度释放,同时用虚拟支柱约束手指不得进入物体降落的轨迹。这种显式放置使系统能够在任意稳定姿态对之间可靠转换,成功率显著高于被动策略,即使在被动转换概率接近零的困难姿态对上也能保持高成功率。

系统吞吐与数据库构建

AutoDex 一次典型试验循环耗时约 48 秒,其中 51.5% 为机械臂运动,24.6% 为撤回动作,感知和规划各占 16.1% 和 7.8%。与遥操作相比,AutoDex 并非通过缩短单次执行来提速,而是消除了人工疲劳和间断,实现持续的小时级无人采集。在 500 次试验的对比中,AutoDex 仅用 10.3 小时,而人工遥操作需 49.4 小时,吞吐量提升 4.8 倍。由此构建的数据库包含 100 个日常物体的 3593 次真实抓取试验记录,涵盖 Allegro 和 Inspire 两种多指手,并附有同步多视角图像、机器人状态轨迹和成功/失败标签。

物理验证的价值:实验揭示的关键发现

论文通过多项实验验证了系统设计的有效性:

  • 物理验证大幅提升抓取可靠性:在 20 个物体、515 次真实环境试验中,从 AutoDex 验证数据库中检索的抓取成功率达到 76%,而仅经仿真筛选的数据库只有 34%。这种优势在障碍物密集场景中尤其明显,验证库仍保持 80–90% 的成功率,而仿真库频繁失败。这说明几何可行性远不足以评判接触稳定性,真实世界的物理反馈是筛选可靠抓取的 “黄金标准”。

  • 重置策略决定收集完整性:对比实验显示,稳定重定向放置的成功率几乎不受姿态转换难度影响,而被动策略在目标姿态出现概率低时几乎失效,甚至出现物体弹出工作区的危险情况(被动策略失败率 5.3%)。主动重置是实现全姿态覆盖的基础。

  • 相机密度对位姿精度至关重要:使用 2 台相机时平均 ADD-S 误差高达 14.3 mm,且存在纹理贫乏物体的灾难性失败;增加到 4–8 台相机后误差锐减,16 台相机时可达到 0.5 mm 级别。这证明了多视角冗余对无人干预下抓取规划可靠性的必要性。

应用启示与未来方向

AutoDex 提供了一套可复制的 “合成-验证” 范式,为灵巧抓取数据获取开辟了新路径。对于机器人学习研究者,可直接利用其构建的数据库训练策略,或克隆系统流程,针对自有硬件生成特定物体的验证数据。实践中建议:

  • 将候选生成与真实世界验证解耦:可以继续利用日新月异的仿真抓取生成器,而将硬件资源集中于验证环节,提升整体数据流的效率。
  • 注重感知冗余和安全监控:在无人操作环境中,即使微小的位姿偏差也可能导致碰撞,学习式残差监测器以较低成本提供了可靠的安全兜底。
  • 主动重置模块的设计可迁移到其他需要多姿态覆盖的任务(如物体扫描、操作学习),其高度松弛和虚拟支柱思想适用于扁平、易倾覆物品的自动化处理。

展望未来,AutoDex 目前仅支持单臂固定基座抓取,且抓取模式局限于静态抓取。今后可向双手协同、移动抓取、指间滚动再抓取以及功能性抓取(如工具使用)扩展。此外,虽然密集相机阵列提升了可靠性,但若能结合更轻量的视觉-惯性融合或基于 NeRF/3DGS 的场景表示,有望降低对相机数量的依赖,进一步推动系统走向真实工作环境。最后,将 AutoDex 的验证逻辑与现代基础模型相结合,或许能实现 “生成-验证-学习” 的闭环,使机器人自主提升灵巧操作能力。

总之,AutoDex 用工程系统的方式证明:通过精心设计的感知、安全、标注和重置模块,完全自动化的真实世界灵巧抓取数据采集不仅是可行的,而且能产生远超仿真筛选的数据质量,为未来灵巧操作的规模化学习奠定了坚实基础。