In-N-On:借助真实场景与任务数据扩展自我中心操作

In-N-On: Scaling Egocentric Manipulation with in-the-wild and on-task Data

arXiv: 2511.15704v1

论文信息

标题: In-N-On: Scaling Egocentric Manipulation with in-the-wild and on-task Data

作者: Xiongyi Cai, Ri-Zhao Qiu, Geng Chen, et al.

发布日期: 2025-11-19

arXiv ID: 2511.15704v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:如何有效利用大规模、异质的以自我为中心的人类视频数据,使机器人能够直接从人类行为中习得可灵活遵循语言指令的操作策略,并弥合人-机的域差距。
  • 核心方法:将人类操作数据系统性地划分为 “野外” 与 “任务上” 两类,收集千小时级数据集,训练语言条件的 “流匹配” 策略 Human0,并配合域自适应技术减少人类与类人机器人间的视觉、运动学鸿沟。
  • 关键结果:Human0 仅依靠人类视频数据就学会了遵循语言指令,并展现出小样本学习能力;额外融入任务上数据后,策略鲁棒性进一步提升(见论文实验章节)。
  • 主要局限:域自适应无法完全消除从人到机器人的转换误差,策略在真实物理类人机器人上全闭环部署的效果需要更多验证;大量野外数据的质量与标注仍是工程挑战。
  • 适合读者:从事机器人操作学习、视频预训练、具身智能以及流匹配/扩散策略的研究者与工程师。

论文背景和研究动机

以自我为中心(egocentric)的视频天然包含丰富的操作行为、物体交互和运动先验,是训练操作策略的宝贵数据源。然而,现有多数工作仅将人类数据用于简单的预训练(如对比学习),并未释放数据的全部潜力。核心矛盾在于:网上采集的 “野外” 操作视频虽然数量巨大、场景多样,但动作尚未对齐机器人形态,且任务分布极其零散;而针对特定任务的遥控数据虽然领域对齐,但采集成本高昂,难以覆盖足够多的任务与语言指令。

《In-N-On》一文试图提供一套可扩展的配方来破解这一矛盾。作者不再将人类数据视为单一整体,而是把它明确划分为 in-the-wild(野外)与 on-task(任务上)两个类别,并针对性地设计使用路径。野外数据提供广域的动作先验与语义理解基座,任务上数据则提供精准的任务对齐与闭环鲁棒性。通过系统性的数据收集与策略学习,论文力图证明:正确混合这两类数据,可以使机器人操作策略拥有几个从纯人类数据教学中涌现出来的新特性。

核心方法和技术细节

论文首先构建了数据集 PHSD,它包含超过 1,000 小时的多样化野外自我中心视频以及超过 20 小时直接对准目标操作任务的任务上数据。野外视频收集自公开平台,涵盖厨房、办公室、工作室等数十种环境中的操作,任务上数据则专门采集于和下游任务环境、本体(类人机器人)高度匹配的场景。

为了从这类有强异质性的数据中学习一个灵活的操作策略,作者引入了 语言条件的流匹配策略 Human0。流匹配(flow matching)是一种连续归一化流框架,可视为扩散模型的推广,它通过学习一个速度场将简单先验分布平滑地推向目标动作分布。在此基础上,Human0 将自我中心的图像序列与自然语言指令同时作为条件,使得策略不仅能模仿参考动作,还能根据新的指令泛化出未曾见过的行为。

针对人类与类人机器人的形态、穿戴设备视角、关节限位等差异,论文采用了 域自适应技术。具体而言,训练时将人类域的视频帧和关节姿态通过一个可学习的映射网络转换到机器人域,并与少量机器人域的真实数据或仿真数据联合优化,以缩小域差距。该映射既可以是显式的图像风格迁移,也可以是在潜空间中拉近两个域表征的对抗或一致性损失。经过域自适应后,Human0 在实际机器人上的迁移成本显著降低。

整个训练流程可以概括为三个步骤:先用大规模野外数据训练 Human0 的视觉-语言-运动基座,使其习得丰富的操作语义与基础运动流场;然后通过域自适应模块对齐人类与机器人视觉、运动空间;最后在少量任务上数据上微调,以获得对特定任务的高成功率与抗干扰能力。

创新点和贡献

本工作的创新点集中在数据视角和方法论的重构上。

  1. 人因数据分类与元规模配方:首次明确将自我中心人类数据划分为 “野外” 与 “任务上” 两类,并提供了一套可行的、可复现的大规模数据收集与混合训练流程,为后续研究提供了清晰的数据基础设施蓝图。
  2. 流匹配策略在自我中心操作中的规模化应用:克服了人类视频动作分布复杂、多模态的难题,用流匹配替代传统的回归或离散化行为克隆,从而能更好地捕捉人类操作中的多样性和不确定性,同时支持自然语言的条件注入。
  3. 人形-人类域自适应的实用设计:通过联合优化与映射,在不需要大量成对数据的情况下有效降低域差异,使得从人类到类人机器人的策略迁移比直接训练更具可行性。
  4. 仅从人类数据涌现的遵循指令能力:实验显示,即使在微调之前,Human0 已经可以理解并尝试执行新的语言指令,这种语言跟随行为完全是从异质的人类视频中涌现出来的,证明了人类数据中隐含着高度可迁移的语义-运动对应关系。

实验结果分析

论文设计了一系列实验来检验 Human0 的能力。在语言遵循方面,使用从未见过的自然语言指令集对模型进行测试,Human0 能够完成抓取、放置、推、拉等基本操作,且动作风格与指令语义一致(见论文实验章节)。这表明大规模野外数据确实内化了语言条件与操作基元的关联,而不只是简单记忆固定任务。

少样本学习能力体现在:给定仅数个示例的任务上数据,Human0 即可将新的任务行为泛化到不同的物体实例或环境背景中,相较于仅使用任务上数据从头训练的基线有明显提升。当进一步融入全部任务上数据进行微调后,策略的鲁棒性得到强化,例如在存在光照变化、物体纹理抖动或干扰物场景下,成功率波动减小(见论文实验部分)。

这些结果共同揭示了缩放人类数据的价值:更多样的野外数据让模型基础更扎实,而少量的任务上数据足以将这种基础调整到具体任务空间;两者结合后,策略展现出原方法难以达到的适应性与稳固度。

实践建议

如果你正在构建类人机器人操作平台,或从事视频驱动的策略学习研究,可从以下角度借鉴本文的实践思路。

  • 分层次数据建设:先以低成本方式广泛收集野外自我中心视频(如从互联网下载、团队日常佩戴记录),这类数据无需任务标签,但务必覆盖足够的环境、物体和动作类型;再针对核心任务(如移动操作、工具使用)专门采集 20~50 小时的高质量任务上数据。优先保障野外数据的多样性,而非过早追求完美对齐。
  • 策略架构选型:考虑采用流匹配或离散扩散动作生成框架,它们比单峰高斯回归更适合处理人类操作的多模态性,也比普通扩散模型更易于注入时间连续性先验。务必在条件输入中包含自然语言编码,以解锁指令泛化。
  • 域自适应必选动作空间:不要忽略人-机器人在运动学上的差异。可通过一个轻量的卷积/变压器映射网络将人类关节角度或末端位姿变换至机器人的工作空间,并在训练时加入循环一致性损失或对抗损失。若有少量机器人遥操作数据,可直接作为参考帧执行微调。
  • 小样本任务微调策略:在基座模型训练完成后,仅用极少量(甚至 5~10 个示例)的任务演示进行微调,同时冻结大量早期层以避免过拟合。微调时可加入简单的数据增强(颜色抖动、遮挡掩码)进一步提升鲁棒性。
  • 安全检测与兜底:从人类视频学到的策略在物理世界首次部署时可能出现不符合机器人运动学约束的动作,务必设置扭矩、速度和关节限位等安全保护,并叠加基于模型或基于视觉的异常检出机制,用于在策略鲁棒性意外下降时触发安全停机。

通过遵循上述实践,研发者有机会在有限预算下快速搭建一个能理解语言、适应多种任务的灵巧操作系统,并随着野外数据的积累持续提升其泛化能力。