模仿有效之法:基于仿真筛选的模块化策略学习从人类视频中
Imitating What Works: Simulation-Filtered Modular Policy Learning from Human Videos
论文信息
标题: Imitating What Works: Simulation-Filtered Modular Policy Learning from Human Videos
作者: Albert J. Zhai, Kuo-Hao Zeng, Jiasen Lu, et al.
发布日期: 2026-02-13
arXiv ID: 2602.13197v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:如何让非仿人机械臂仅通过观看人类操作视频,就能学会需要抓取后再运动的完整操作任务,而无需任何机器人演示数据。
- 核心方法:提出 “感知-模拟-模仿”(PSI)三层框架,用物体 6D 姿态轨迹抽象人体动作,在仿真中筛选可行的 “抓取-轨迹” 组合并标注抓取得分,最后用行为克隆训练一个同时输出动作轨迹和任务感知抓取分数的视觉策略网络。
- 关键结果:在真实世界的拾放、倾倒、搅拌和绘画四项任务中,PSI 训练的抓取得分模型使拾放任务的成功率从随机抓取的 25%(5/20)提升到 80%(16/20)(表 1),同时有效过滤了糟糕的示范数据。
- 主要局限:当前框架只适用于刚体或近似刚体,无法处理关节或可变形物体;仅学习开环策略,无法应对人-物交互视频中人体遮挡带来的视觉域偏移。
- 适合读者:从事机器人模仿学习、跨行为学、抓取规划或想用低成本人类视频数据训练机械臂策略的研究者和工程师。
论文背景和研究动机
机器人学习正朝着大规模数据驱动的方向快速发展,但获取高质量真实机器人动作数据成本极高、操作复杂。一个极具吸引力的替代方案是让机器人 “观看” 人类操作视频来学习技能——就像人类婴儿通过观察他人行为进行模仿一样。这不仅成本低廉,还能利用互联网上泛滥的人类操作视频。
然而,这道 “跨行为鸿沟” 并不容易跨越。当机械臂装有像平行爪这样的非仿人末端执行器时,直接将人手姿态重映射到机器人爪具上十分困难。现有方法通常要么依赖(昂贵的)机器人示教来弥补抓取层面的缺失,要么采用模块化方案:把抓取任务外包给现成的稳定抓取生成器,然后专注于从人类视频中学习抓取后的运动轨迹。
问题是,一个稳定的抓取不一定能支持完成后续动作。比如用右手握门把手,如果手背朝上正握,很容易顺时针旋转;但若换成手背朝下的反握,就会让旋转变得异常困难(图 2)。论文将这种特性称为任务兼容性,并指出此前所有纯人类视频学习的模块化方法都忽略了这一环节,导致实际执行时频繁失败。
另一个问题是,从视频中提取的物体运动轨迹可能因姿态估计错误或机器人的运动学限制而根本不可行。若不加筛选就把这些轨迹喂给策略网络,性能会严重受损。
PSI 框架正是为同时解决这两个问题而设计的:用仿真筛选出对机器人可行的轨迹,同时给每条轨迹上的不同抓取候选打分,从而学出一个能评估抓取任务兼容性的视觉模型。
核心方法和技术细节
三层框架总览
PSI 由感知(Perceive)、模拟(Simulate)、模仿(Imitate)三步构成(图 3)。
感知:从视频到物体 6D 姿态轨迹
核心假设是,操作任务的成功关键在于物体的运动方式,而不是执行者的具体身体形态。因此,PSI 用物体 6 自由度姿态轨迹来充当 “行为无关” 的运动表征,可以干净地通过刚性变换转换成机器人末端执行器的 SE(3) 动作,避免了先预测流再通过深度图转换带来误差的步骤。
论文探索了两条提取 6D 姿态的路线:
- 模型基础:若物体有 3D 模型,使用 FoundationPose 进行跟踪;
- 无模型:若没有模型(真实场景更常见),先用 Cutie 传播分割掩膜,再对物体点云应用迭代最近点跟踪相邻帧的相对变换,最后用姿态图优化保证全局一致性。
模拟:用仿真同时过滤轨迹和标注抓取
这是 PSI 的核心创新。对于每条视频提取出的 6D 姿态轨迹,论文在仿真中测试它是否能被机器人成功执行。具体来说,在物体周围采样 K 个标准锚定抓取(比如四个方位方向、两个俯仰角),然后用航点控制器依次执行 “抓取-轨迹” 对。
如果某轨迹在所有 K 个抓取下都因为运动学限制或碰撞而失败,则该轨迹直接被丢弃,杜绝了它对策略训练的污染。如果某些抓取成功,就为它们打上成功标签,提供抓取兼容性监督信号。成功与否完全基于运动学可达性,不评估抓取稳定性——稳定抓取在测试时由外部模型提供。
模仿:同时输出轨迹和抓取得分
策略网络用 ResNet18 对初始帧的 RGB 图像和物体掩膜编码,结合 2D 目标点的嵌入向量,经 MLP 融合后输入两个独立的解码头:
- 轨迹头预测相对于物体初始中心的 6D 姿态序列,用 MSE 损失训练;
- 抓取头预测
K个锚定抓取的成功概率,用二元交叉熵损失训练。
论文发现两阶段训练效果更好:先只训练轨迹头,再冻结骨干网络单独训练抓取头,这能缓解数据量小时抓取标签过拟合的问题。
测试时执行
测试时,先运行抓取得分模型给各锚定抓取打分,再调用外部稳定抓取生成器(如 Contact-GraspNet)产生候选抓取,把每个候选抓取对应到最近的锚定抓取并继承其得分,最后执行得分最高的那一对 “抓取-轨迹”(图 4)。这就在模块化框架中实现了任务导向抓取能力。
创新点和贡献
PSI 的主要贡献可归纳为三点:
-
首个将仿真筛选与模块化模仿学习结合。此前从人类视频学习的工作要么依赖机器人数据处理抓取,要么抽象掉抓取问题导致任务不兼容。PSI 用仿真为每条视频轨迹生成抓取兼容性标注,第一次在不依赖任何机器人演示的前提下实现了任务导向抓取。
-
提出轨迹级过滤机制。姿态估计失败或不物理可行的轨迹会被直接丢弃(论文记录了各项任务中丢弃的具体数量:FoundationPose 下拾放丢弃 6 条、倾倒 5 条、搅拌 3 条、绘画 3 条),避免它们污染训练数据。消融实验显示,去除过滤后拾放任务成功率从 80% 降到了 30%(表 1),性能退化惊人。
-
验证了 6D 姿态表征优于流预测。在与 General-Flow 的比较中(表 2),PSI 的 6D 姿态直接预测在拾放任务上达到 80%(16/20),而基于流的方法只有 35%(7/20),倾倒任务上 PSI 65%(13/20)对比流方法 20%(4/20)。论文解释这是因为姿态预测省去了深度-流-SE(3) 转换链中引入的累积误差。
实验结果分析
实验设置:四项任务(拾放、倾倒、搅拌、绘画)各采集 50 段人类视频,35 段用于训练、15 段验证,在 xArm7 机械臂上进行真实世界测试,每次实验重复 20 轮。
轨迹过滤和任务感知抓取的贡献(表 1):
- 去除轨迹过滤后,FoundationPose 下拾放成功率从 80% 降到 30%,ICP 下从 75% 降到 50%。
- 使用随机抓取替代抓取得分模型时,FoundationPose 下倾倒任务从 65% 降到 40%,绘画任务从 60% 降到 5%(1/20),突出任务兼容性抓取的必要性。
跨行为迁移能力(表 4):在 xArm7、Franka Panda、Kinova Gen3 和 UR5e 四种机械臂上进行的仿真评估中,PSI 成功训练出所有型号的策略,拾放任务成功率在 77%–85% 之间、搅拌任务全部达 100%。倾倒任务在各型号间差异最大(43%–79%),论文认为这是大幅度旋转更易触碰到不同型号的运动学极限。
预训练效果(表 3):在 HOI4D 数据集上用 PSI 做监督预训练,其拾放任务下游微调后达到 80%(对比仅用 ImageNet 预训练的 50% 和 R3M 的 25%),展示了 PSI 标注管道用于大规模预训练的潜力。
数据规模分析(表 5):将训练视频从 15 段增加到 35 段,拾放成功率从 54%(7/13)提升至 85%(11/13),搅拌任务在 15 段时即达到 100%,可能因该任务初始状态分布更集中。
实践建议
对于希望在自己的机器人系统上应用类似框架的团队,论文的设计选择提供了几点直接参考:
-
仿真过滤的开销很值得投入。PSI 的关键性能提升来自于过滤和打分两个步骤。虽然执行
K次仿真意味着计算量乘上K,但值不值得取决于你能否容忍大量无法执行的轨迹混入训练数据。对于需要大幅度旋转或高度依赖抓取方位的任务(如倾倒、绘画),建议必须加上这一步;对于简单直线运动任务,可能容忍度更高,但论文未对此做专门消融。 -
优先使用物体 6D 姿态,而非流。如果能可靠获取 6D 姿态(无论通过模型基础或 ICP),直接预测姿态比预测流再转换要精确得多。论文在四项任务上姿态预测均优于流预测(表 2)。若物体呈近似旋转对称性,姿态跟踪可能发生漂移,此时需要特别留意仿真过滤器的信号是否足以将这些轨迹标记为不可行。
-
稳定抓取和任务兼容抓取可以解耦。论文的核心工程洞察在于这个解耦设计(图 4):在仿真过滤时不考虑抓取稳定性(设物体一旦碰到抓取点就刚性吸附),让仿真专注于运动学兼容性评估;稳定抓取则由 Dex-Net、Contact-GraspNet 等成熟的离线模型兜底。开发时没必要试图在一个模型中同时解决稳定和兼容两个问题。
-
两阶段训练对小数据集更稳妥。如果只有几十段视频,论文建议先训练轨迹头、冻结骨干后再训练抓取头,避免抓取标签噪声导致过拟合。等数据规模扩到数百段后,再切换到联合训练。另外在训练抓取头时,交叉熵损失的权重可以设得较低(论文在 HOI4D 预训练时用 0.01),进一步抑制噪声。
-
考虑视觉域偏移的后续处理。PSI 目前只看初始帧,避开人体遮挡问题,但也因此只能学开环策略。如果想学闭环策略并利用完整的交互视频,就需要引入修复或插入渲染技术来处理中间帧中的手部遮挡。