ADEPT:利用强化学习通过预训练与后训练加速灵巧性
ADEPT: Accelerating Dexterity via Pre-Training and Post-Training using Reinforcement Learning
论文信息
标题: ADEPT: Accelerating Dexterity via Pre-Training and Post-Training using Reinforcement Learning
作者: Jayjun Lee, Jessica Yin, Asif Rana, et al.
发布日期: 2026-08-19
arXiv ID: 2608.19182v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:解决高自由度机械臂-灵巧手系统如何通过强化学习直接学习并真实部署长时程、接触丰富的 “抓取—重定向—插入/放置” 任务,而不依赖人类演示或物体位姿跟踪器。
- 核心方法:ADEPT 框架先在通用物体重放置任务上预训练基础灵巧策略,再通过 BC 动作蒸馏、critic warm-up 和保守 PPO 后训练迁移到下游任务,最后蒸馏为仅使用视觉(或视觉+触觉)的学生策略。
- 关键结果:在真实世界,29 DoF Flexiv-Sharpa 视觉+触觉学生在 FMB 方形/圆形 peg 插入任务上达到 8/10 成功率,而同平台纯视觉学生为 3/10(表 4)。
- 主要局限:作者明确指出感知仍是主要瓶颈,尤其在遮挡下不对称 peg 朝向估计错误,且 Allegro 指尖接触面小、快速运动中抓取可能不稳定(第 5 节)。
- 适合读者:机器人学习、灵巧操作、强化学习 sim-to-real 迁移、多指手与多模态感知方向的研究者和工程师。
论文背景和研究动机
高自由度臂-手系统(如 7 DoF 机械臂加 16 DoF Allegro 手,共 23 DoF;或 29 DoF Flexiv-Sharpa)的动作空间大、接触模式丰富,从稀疏任务奖励中从零学习抓取、举升、重定向、插入等行为非常困难。即便使用大规模 GPU 仿真,同一套底层技能往往每个新任务都要重新发现。论文将这一现象作为核心动机,提出先获得通用灵巧基础,再适配下游任务,而不是为每个任务训练专家。
该研究选择的下游基准 FMB 最初面向平行爪夹爪设计,通常需要外置夹具和多阶段 “放置—重新抓取—旋转—插入” 流程。论文用多指手和单一连续策略绕开了这些假设,并报告了 5–10 秒/试次的执行速度,而 FMB 平行爪流程为 20–70 秒/试次,约 2×–14× 时间差距(见第 4.2 节)。
核心方法和技术细节
ADEPT 的方法分为四个阶段。
预训练基础灵巧策略。 预训练任务为通用物体重放置:随机生成 16 种原始几何体(圆柱、长方体、球、锥)中的一种,随机缩放后置于桌面,策略需完成伸手、抓取、举升、手中重定向、搬运和按目标位姿放置。训练使用 PPO、非对称 actor-critic、自动域随机化(ADR)和 Population-Based Training(PBT)。论文指出,使用物体点云表示在本文设置下表现出更好的下游零样本泛化(见第 3.2 节)。预训练策略在未见过的 FMB peg 和 VisDex 物体上保持了接近分布内的成功率(表 1),并且可以零样本完成下游任务路径中的重放置段:在 ADR 20 位置,Kuka-Allegro 和 Flexiv-Sharpa 的成功率分别为 78.6% 和 74.9%,但到实际插入目标 ADR 50 时,Kuka-Allegro 为 0%,Flexiv-Sharpa 仅为 0.70%(表 2)。
结构化后训练。 直接 PPO fine-tune 预训练策略会立即崩塌:图 3 蓝色插图显示在少数更新后,同一预训练点开始的成功率先下降到 0。论文将其归因于任务奖励变化、下游额外观测(容器位姿和物体-容器接触力)、价值估计错位以及策略更新过大。ADEPT 的后训练分为三步:
- BC actor 蒸馏:将预训练 actor 在下游观测空间中克隆 40k 次迭代,解决观测空间不匹配。
- Critic warm-up:冻结 actor,在下游奖励下训练新的 critic 20 个 PPO 迭代,先校准价值估计。
- 保守 PPO:解冻 actor,使用大幅降低的 actor 学习率()和更紧的 PPO clip()更新。
消融实验(表 3)表明,在本文设置下,低 actor 学习率是防止崩塌的必要因素;BC 蒸馏将到达 ADR 50 的平均时间从 35.2 小时降到 19.9 小时;critic warm-up 使训练成功率提高约 17.6 个百分点;clip 从 0.05 放宽到 0.20 影响不大。论文还指出,即便加入 KL 惩罚,标准学习率仍会崩塌,因此仅靠正则化不足以稳定迁移。
几何织物与全关节配置空间。 为安全利用完整手指运动学,论文不使用此前 DextrAH-G 等把手指限制到低维 PCA 抓取子空间的方法,而在全关节配置空间驱动几何织物。策略输出 的相对关节增量,映射为 Cspace 目标,由织物作为二阶系统执行。该织物提供碰撞避免、关节限位排斥、阻尼和速度控制,同时在仿真和真实机器人上使用相同实例。其核心动力学为:
其中 是碰撞、限位、阻尼等自主项, 是策略驱动力。论文认为全 Cspace 织物暴露了完整 DoF,但学习难度也明显更高。
学生蒸馏与感知。 后训练得到的状态教师通过 DAgger 蒸馏到视觉学生。学生输入包括本体感觉、织物状态和两个 RGB 相机图像;Flexiv-Sharpa 学生额外输入五个指尖触觉图。蒸馏损失包括 BC 损失和 8 关键点物体位姿辅助损失。两阶段课程先使用重放置教师对视觉学生做感知预训练,再由下游教师蒸馏策略。真实世界中单阶段基线在两个 peg 上均为 0/10,而两阶段课程取得非零成功(见第 4.2 节)。触觉学生使用 TacMap 穿透深度图加二值接触图,并用 SaTA 风格 FiLM 按指尖位置进行空间锚定。
创新点和贡献
论文的主要贡献可归纳为:提出 ADEPT 预训练/后训练框架,把通用重放置先验稳定迁移到接触丰富的下游任务;设计全 Cspace 几何织物,释放高 DoF 臂手系统的完整运动学能力;提出结构化 RL 后训练配方和蒸馏课程;并在两个不同臂手平台上实现零样本 sim-to-real 的抓取-重定向-插入/放置。论文称这是在没有演示和位姿跟踪器的情况下,从原始视觉或视觉+触觉感知完成 FMB 最难的方形/圆形 peg 插入的首次演示。
实验结果分析
模拟中,ADEPT 后训练以约 3B 环境步到达下游 ADR 50,而从头训练多数种子在 9B 步内仍低于 ADR 6(图 9)。表 1 显示预训练教师对 FMB peg 和 VisDex 对象没有明显 OOD 退化;其中 Kuka-Allegro 在 FMB Peg 上 SR 为 ,与原始几何体的 接近。表 2 显示随着 ADR 目标从搬运段进入插入段,零样本成功率持续下降,到实际插入目标时几乎为零,表明接触丰富的插入段确实是需要后训练的新行为。
真实世界结果中,表 4 按累积阶段记录成功率。Kuka-Allegro 视觉学生在 FMB 星形 peg 上为 5/10,方形/圆形为 3/10,盘子放置为 6/10;Flexiv-Sharpa 纯视觉方形/圆形为 3/10,加入触觉后上升到 8/10。失败模式不是抓取执行本身,而是纯视觉学生无法确定抓取成功,常常松开已经抓住的物体并循环抓取;触觉则消除了这种不确定性(见第 4.2 节)。不对称 peg 比星形 peg 更难,主要差异出现在举升和重定向阶段,作者归因于圆形腿产生不稳定点接触。盘子任务展示了后训练不仅细化已有抓取模式:预训练从未见过类似盘子的大而扁平物体,但后训练仍能学习成功抓取和翻转再抓取策略。
实践建议
如果要在类似高 DoF 臂手系统上落地 dexterous RL,本文给出的可操作经验包括:
-
先在通用重放置任务上做大规模预训练。预训练成本(论文中约 8B 环境步)可在多个下游任务间摊销,每个下游任务只需约 3B 步后训练(见第 4.1 节、图 3)。
-
不要用标准 PPO 学习率直接 fine-tune。建议先做 BC actor 蒸馏以兼容新观测空间,再冻结 actor 预热 critic,最后用 量级的 actor 学习率做本地更新。表 3 显示低学习率是避免崩塌的关键;KL 惩罚不能替代这一机制。
-
如果下游任务是接触丰富且与预训练差异较大,仍然可以尝试。盘子放置的例子表明,后训练能从 “已会到达但不会抓取” 的起始分布继续学习新的抓取策略,而不需要预训练覆盖该物体。
-
对真实部署,优先分离感知训练和策略训练。两阶段蒸馏课程先让视觉编码器学会关键点位姿预测,再蒸馏策略;本文真实实验中单阶段基线为 0/10。对需要高置信度接触判断的任务,强烈考虑加入指尖触觉;表 4 中 Flexiv-Sharpa 方形/圆形从纯视觉 3/10 提升到触觉 8/10。
-
使用全 Cspace geometric fabric 可以释放手指协调能力,但会显著增加学习难度。实践上应配套大规模并行仿真、ADR 和 PBT,并在部署中保持与仿真相同的织物接口,以减小 sim-to-real 控制器差距。
-
感知仍是本方法的主要部署瓶颈之一。若臂手系统允许,可评估腕部相机或增加触觉来缓解遮挡下的位姿估计错误;这是作者在第 5 节指出的方向。