TraceGen:以三维轨迹空间进行世界建模实现跨具身视频学习
TraceGen: World Modeling in 3D Trace Space Enables Learning from Cross-Embodiment Videos
论文信息
标题: TraceGen: World Modeling in 3D Trace Space Enables Learning from Cross-Embodiment Videos
作者: Seungjae Lee, Yoonkyo Jung, Inkook Chun, et al.
发布日期: 2025-11-26
arXiv ID: 2511.21690v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:如何利用大量现存的人类与其他机器人视频,在仅需极少量目标机器人演示的条件下,使机器人学会新场景中的操作任务,克服实施例、相机视角和环境差异带来的迁移障碍。
- 核心方法:提出统一的 3D“轨迹空间” 符号表示,把各类视频中的运动抽象为场景级 3D 轨迹;用 TraceForge 数据管道将异构视频转化为统一的轨迹-语言数据,并训练 TraceGen 世界模型在该空间中预测未来运动。
- 关键结果:仅用 5 段目标机器人视频,TraceGen 在四项任务上达到 80% 成功率,且推理速度比当前最佳的像素空间世界模型快 50–600 倍(见论文摘要及实验结果部分)。
- 主要局限:论文未明确讨论,但 3D 轨迹空间抽象可能丢失力觉、接触力等精细交互信息,且性能依赖于场景 3D 重建的质量。
- 适合读者:从事机器人学习、世界模型、跨实施例迁移、3D 视觉与表征学习的研究者和工程师,尤其关注少样本学习与高效推理的群体。
论文背景和研究动机
让机器人通过少量演示在新环境、新平台上学到新任务,依然是一大挑战。人类操作视频和不同种类机器人的视频数据极为丰富,但实施例结构、相机内参、拍摄视角和场景外观的巨大差异,使得这些数据很难直接用于训练特定的目标机器人。传统做法要么需要大量配对数据进行实施例对齐,要么依赖像素级生成模型来预测未来帧,但像素空间的生成计算开销巨大,且外观变化会严重干扰运动策略的学习。
作者观察到,虽然外观千差万别,但不同实施例在执行类似任务时,其末端执行器或被操作物体的场景级 3D 运动轨迹却具有高度的结构性。若能将这些运动从像素中剥离出来,压缩到一种统一的、外观无关的符号空间中,就能在几何层面上实现跨实施例、跨环境的知识迁移。TraceGen 正是沿着这一思路,将世界建模从像素空间转移到紧凑的 3D 轨迹空间,使模型只需专注于预测运动的几何变化,从而在极少量目标演示下快速适应。
核心方法和技术细节
TraceGen 是一类新的世界模型,它在 3D 轨迹空间中进行运动预测,而非生成原始 RGB 图像。其关键在于三点:轨迹表示的设计、大规模数据集的构建,以及预训练与少样本适配流程。
3D 轨迹空间表示 作者定义的轨迹空间是一种场景级的、与外观无关的 3D 轨迹抽象。对于每一段视频,系统首先通过多视角几何或深度估计手段,将 2D 观测提升到 3D,从而得到被操作物体或末端执行器在连续时间步中的 3D 位姿序列。这些序列经过规整化后,形成固定长度的轨迹片段,再编码为模型可处理的 token 序列。这种表示直接抛弃了纹理、光照和背景信息,只保留对操作至关重要的空间几何信息,天然具备跨实施例迁移的属性。
TraceForge:大规模轨迹数据管道 要训练一个通用 3D 运动先验,需要海量的、多样化的轨迹数据。为此,作者开发了 TraceForge 管道。它能将各种来源的异构人类和机器人视频统一转换为上述 3D 轨迹表示,并同时提取对应的语言指令或自然语言描述。具体的转换过程包括:估计相机参数和场景结构,恢复操作相关的 3D 关键点运动,过滤和切片轨迹,最终将每条轨迹与语言标注配对。通过 TraceForge,作者构建了一个包含 123K 条视频和 1.8M 个观察-轨迹-语言三元组的大规模预训练语料(见论文数据集描述)。
TraceGen 世界模型与训练 TraceGen 的架构基于自回归 Transformer,输入为一段历史 3D 轨迹以及可选的语言条件,输出为未来步骤的 3D 轨迹预测。由于轨迹空间的维度远低于像素空间,模型可以非常轻量,推理速度极快。预训练阶段,TraceGen 在 TraceForge 生成的语料上学习 3D 运动先验,建模不同任务、不同实施例下的轨迹演化规律。在下游适配时,只需将目标机器人的少量 3D 轨迹(通常仅 5 段)作为上下文,模型就能根据当前观测轨迹推演出未来的合理运动,可直接用于机器人控制,或作为高级规划器的动力学先验。整个过程无需任何像素级别的生成,也不依赖预训练的目标检测器。
创新点和贡献
TraceGen 的核心贡献在于从 “在像素空间预测未来” 转向 “在 3D 轨迹空间预测未来”,并围绕此构建了一套完整的工程方法。
-
统一的跨实施例表征 3D 轨迹空间将人类、各种机器人等异构实施例的运动,映射到同一几何坐标系下。该表示天然独立于视觉外观和实施例结构,从根本上解决了像素级方法中领域差距过大的问题。这一设计不需要对象检测器来显式建模物体,也不需要在像素空间进行笨重的生成,大幅降低了模型对数据量的需求。
-
大规模的自动化数据管道 TraceForge 能够将大量自然视频自动转化为结构化的轨迹-语言对,使得原本不可直接使用的互联网视频成为有效的监督信号。这种数据生成能力为预训练通用运动先验提供了坚实的规模基础。
-
高效且可迁移的 3D 世界模型 TraceGen 模型本身是一个轨迹级别的动力学预测器。与视频生成类世界模型相比,它不仅推理速度提升 50–600 倍(见摘要及实验数据),而且由于直接在几何空间操作,适配新机器人时只需要极少量的 3D 演示即可实现高成功率。尤其是,在只有 5 段未校准手持手机拍摄的人类视频的情况下,TraceGen 在真实机器人上仍达到 67.5% 的成功率(见论文摘要及实验),展现了从人类直接迁移到机器人的非凡潜力。
实验结果分析
作者设计了多组实验,考察 TraceGen 在少样本迁移和极端跨实施例条件下的性能。
少样本目标机器人适配 在标准化实验中,为四项不同的操作任务分别提供 5 段目标机器人视频进行适配(注意:此时提供的是目标机器人自身的 3D 轨迹)。结果显示 TraceGen 平均成功率达到 80%(见论文实验结果部分)。同时,与当前先进的像素空间世界模型相比,TraceGen 的推理速度有 50–600 倍的提升,这表明将世界模型建立在 3D 轨迹空间不但精度有保证,且具备极高的实时性潜力。
跨实施例迁移:仅用人类视频 更具挑战性的场景是,目标机器人完全没有任何演示,仅有 5 段通过手持手机拍摄的、未经标定的人类演示视频。TraceGen 通过 TraceForge 将人类视频提升至 3D 轨迹空间,随后适配到真实机器人上,取得了 67.5% 的成功率。这一数字虽然低于有机器人自身演示的情形,但在零机器人演示的条件下已经极具竞争力,再次证明 3D 轨迹空间在实施例间具有强大的对齐能力。论文同时指出,该流程未使用对象检测器,也未在像素空间进行重生成,其迁移能力完全来自几何轨迹空间的抽象。
这些结果表明,TraceGen 提供的 3D 运动先验可以迅速适配到全新场景,而适配过程仅仅是输入少量轨迹作为 prompt,训练负担极低。
实践建议
TraceGen 的工作为工程落地提供了一条清晰的路径,特别适合希望在真实机器人上快速部署和迭代的研究组或企业。以下从数据、模型和部署三个层面给出建议。
构建专属的 3D 轨迹数据集 虽然论文提供了大规模预训练语料的思想,但在实际应用中,可利用 TraceForge 的范式,将产线中积累的人类操作视频或旧版机器人作业视频转化为 3D 轨迹数据集。推荐使用标定好的多相机视觉系统或基于深度学习的单目 3D 重建工具,提升轨迹恢复精度。对于涉及精细操作的任务,可额外采集末端力传感器数据,以弥补纯运动轨迹可能损失的信息(该方法本身不涉及力觉,但工程中可将其作为补充条件)。
模型训练与微调策略 若希望从头训练,可复用 Pipeline 的思路,生成大规模轨迹-语言对,并采用 Transformer 架构在轨迹空间做自回归预测。更务实的做法是:直接利用与论文类似的开源预训练 TraceGen 模型作为运动先验,仅在目标场景下注入 5–10 段实际机器人轨迹作为上下文,实现即时的运动规划辅助。在需要兼顾安全性的场合,可将 TraceGen 的输出作为候选提议,再通过一个低维控制器进行安全修正。
跨实施例快速迁移流程 当目标机器人无法提供演示时,可让人类操作者在相同场景中用手持手机录制约 5 段视频,经过离线 3D 重建与轨迹提取后导入 TraceGen,就能为机器人策略提供强有力的初始化。这一流程无需复杂标定,极大降低了机器人编程的门槛。不过,实践中需注意场景三维重建的鲁棒性,尤其是在遮挡严重或低纹理环境下,可能需引入轻量的手工标定或辅助标记点,以确保 3D 轨迹的准确性。
实时推理与系统集成 得益于在低维轨迹空间进行推理,TraceGen 的单次预测开销远低于视频生成模型,易于集成到实时控制回路中。建议将 TraceGen 部署为独立推理服务,在机器人运动规划周期中异步获取未来轨迹建议,再交由基于优化的局部运动规划器执行。该方案在计算资源有限的边缘设备上亦有应用潜力。