VLK:从重建场景中的合成交互学习人形机器人运动操作

VLK: Learning Humanoid Loco-Manipulation from Synthetic Interactions in Reconstructed Scenes

arXiv: 2606.30645v1

论文信息

标题: VLK: Learning Humanoid Loco-Manipulation from Synthetic Interactions in Reconstructed Scenes

作者: Yen-Jen Wang, Jiaman Li, Sirui Chen, et al.

发布日期: 2026-06-29

arXiv ID: 2606.30645v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:人形机器人要从自我视角的视觉输入和语言指令直接生成全身操控动作,但缺少大规模、配对的 “图像-语言-运动学” 训练数据。
  • 核心方法:利用 3D 高斯泼溅(3DGS)重建真实室内场景,在重建场景中合成导航和物体交互的全身运动轨迹,再事成之后渲染出对应的自我视角图像,从而自动生成 48,000 条视觉-语言-运动学(VLK)配对数据,训练一个预测短时运动学轨迹的策略,并由一个接触感知全身跟踪器在真实机器人上执行。
  • 关键结果:在真实 Unitree G1 人形机器人上,系统在实验室和公寓两个场景中均实现了高成功率(如 “走向” 任务 20/20、“转身”20/20、“从地面拾起”16-18/20),验证了纯合成数据驱动的 sim-to-real 人形操控的可行性(表 1)。
  • 主要局限:物体交互的合成受限于 OMOMO 运动数据集,仅支持搬运箱子等大型物体,难以泛化到杯子、工具等小物体;跟踪器依赖腕部接触实现稳定搬运,不处理精确抓取。
  • 适合读者:从事机器人学习、人形机器人、合成数据生成、sim-to-real 迁移的研究者,以及希望用廉价合成数据训练感知驱动控制策略的工程师。

论文背景和研究动机

人形机器人在人类环境中执行任务时,需要将自我视角的视觉感知、语言指令映射为全身协调动作(loco-manipulation)。这个映射的复杂性在于必须同步考虑高维视觉输入、任务语义和全身运动学。学习这样一个策略通常需要大量配对的自我视角图像、语言指令和机器人兼容的全身运动学轨迹。现有数据渠道各有短板:真实遥操作数据采集昂贵且难以规模化;人体动作捕捉数据虽然丰富,但不包含机器人的自我视角;自我视角视频数据集又不与机器人运动学配对。因此,获取 “视觉-语言-运动学” 完整元组成为一个关键瓶颈。

与此同时,两个半解决方案逐渐成熟:基于 3D 高斯泼溅(3DGS)的场景重建能以度量精度高、照片级真实地复现室内环境;在仿真中训练的全身体运动跟踪策略(如 BeyondMimic、SceneBot)可以让真实机器人忠实执行运动学参考轨迹。论文正是抓住这一技术粘合点,提出在重建的 3DGS 场景中合成交互行为并渲染自我视角图像,从而自动生成完整的视觉-语言-运动学监督数据,打通了从现实扫描到合成数据、再到真实机器人的闭环(real-to-sim-to-real)。该方法从根本上绕过了代价高昂的真实人形机器人遥操作,并可大幅扩展场景和任务的多样性。

核心方法和技术细节

整体方案分为三个紧密相连的阶段:重建场景中合成数据生成、视觉-语言-运动学(VLK)策略学习、以及全身跟踪执行。

合成数据生成 首先使用 iPhone 14 Pro 对真实室内环境进行 Polycam 扫描,优化得到具有度量尺度的 3DGS 场景表示。随后在场景中人工标注语义 3D 边界框(如桌子、椅子)和可行走区域,为运动合成提供空间约束。论文设计了一个自动化的轨迹生成流水线:根据任务类型(导航或物体交互)采样目标物体、初始位姿和稀疏路标点,然后使用条件扩散模型合成 Unitree G1 的全身运动轨迹。导航模型基于 BONES-SEED 训练,交互模型则从 OMOMO 人体交互动作经 OmniRetarget 重定向至 G1 形态进行训练。交互合成时还引入物体几何编码、期望相对腕部姿态和接触标签,以约束手腕与物体的接触关系。合成后通过后处理(脚滑动优化、腕-物体接触对齐)提升运动质量。完成动作生成后,在 Isaac Sim 中加载重建的 3DGS 场景,将虚拟 G1 机器人置于其中,并在头部安装与真实机器人标定一致的虚拟 ZED 2i 相机渲染自我视角图像,从而获得每帧同步的 RGB 图像。通过光照、相机外参、焦距等域随机化增强视觉鲁棒性。每条轨迹都配有模板生成的语言指令,例如 “走向椅子” 或 “从地板拾起箱子”。最终,整个流程在 600 GPU 小时内自动生成了 48,000 条轨迹(4 个场景×12 种模式×1000 条),完全无需人工演示。

VLK 策略 采用一个从预训练π₀.₅初始化的视觉-语言模型,输入当前自我视角图像、任务指令和当前 G1 运动学状态,输出未来 30 帧(1 秒)的运动学轨迹,包括相对位移、朝向变化、根高度、关节角度(以 sin/cos 编码)以及左右手腕的接触标签。训练过程使用流匹配(flow matching)的 x₀预测目标,并辅以脚-地接触焦点损失、累积根轨迹一致性损失、前向运动学损失和脚滑动正则化,以保证预测轨迹的物理合理性和可跟踪性。

全身跟踪 在部署时,VLK 策略定期(约 1.8 Hz)异步生成未来轨迹块,并送入基于 SceneBot 的接触感知全身跟踪器。跟踪器不接触视觉或语言,仅根据转换后的参考位姿和接触标签以及机器人当前本体感知,以 50 Hz 的频率输出关节 PD 目标,驱动真实 Unitree G1 执行动作。运动模糊问题通过训练时合成模糊增强和推理时拉普拉斯方差选择最锐利帧来缓解。整体推理延迟约 63 ms,远低于 1 秒的动作块长度,避免了动作堆积。

创新点和贡献

论文的核心贡献是构造了一条完整的、从真实环境扫描到合成交互再到真实机器人部署的 sim-to-real 流水线。其创新点主要体现在三个方面:

  1. 完整的 VLK 数据生成范式:首次在重建的 3DGS 场景中同时生成机器人运动学和配对的自我视角图像,并提供语言指令,补齐了此前 “视觉-语言-运动学” 同步数据缺失的短板。这套全自动流水线的引入,使得人形机器人策略训练无需任何遥操作演示。

  2. 解耦感知与控制:将任务分解为视觉语言驱动的运动学预测和盲全身跟踪,使高阶感知策略仅需关注运动学轨迹生成,而低阶动力学适应交由在仿真中专门训练的跟踪器处理。这种解耦简化了 sim-to-real 转移,因为只需对视觉输入做域随机化,不必将动力学差异强加给感知模型。

  3. 基于重建场景的交互合成:将人体-物体交互合成的扩散模型适配到 Unitree G1 形态,并利用 3DGS 场景的语义和几何标注生成场景感知的运动。该方法一方面保证了生成的运动在真实场景中几何可行,另一方面使学习到的策略具备场景视觉基础。

实验结果分析

实验在两个真实场景(实验室和公寓)的多个不同布局中进行,既在 MuJoCo 仿真(配合 IsaacSim 渲染)中做了闭环测试,也在实物 G1 机器人上完成了 120 次现实世界试验,涵盖六种任务模式:走向、转身、从地板拾起、放在地板、从表面拾起、放在表面。

主结果(表 1)显示,在导航类任务(走向、转身)上系统近乎完美(仿真和真实世界均≥18/20);地面级交互(拾起/放下地板)也表现出较高的成功(真实世界 16 – 20/20);但台面级交互(拾起/放下表面)成功率较低(8 – 15/20),这与重定向数据对不同操作高度的覆盖不足有关。

训练数据量消融(图 4)表明,增加合成轨迹能持续提升表现,尤其对需要接触交互的表面拾取任务,数据量从 10% 增加到 100% 时成功率从 0% 提升到 46%。这凸显了接触密集型任务对场景标定监督的需求,并为数据规模效益提供了定量证据。

视觉域随机化消融(表 2)进一步揭示:在光照和相机参数扰动下,无随机化时的行走成功率为 41%,而全随机化(光照+相机)后达到 90%,证明了外观适配对缩小视觉 sim-to-real 差距的关键作用。

这些结果共同说明,仅凭合成数据完全有可能驱动人形机器人在真实世界执行复杂的感知驱动全身运动,且通过增加数据量和域随机化,可以逐步提升任务的鲁棒性和泛化能力。

实践建议

对于希望在自己的应用场景中复现或借鉴本工作的从业者,以下建议可供参考:

  1. 场景重建的质量与覆盖:3DGS 重建需要高精度的 LiDAR 深度和充分的重叠图像;重建后务必进行人工语义标注,定义可步行区域和关键物体边界,这是后续运动合成逻辑正确的基础。

  2. 交互合成的多样性扩展:论文清楚地指出与 OMOMO 绑定带来的限制,因此若要扩展到小物体抓取或更多样的操作,应考虑引入新的交互运动数据源(如大规模人体抓取数据集),并通过重定向工具(如 OmniRetarget)将其适配到自己的机器人型号。

  3. 训练数据生成策略:合成任务模式应该同时包含核心任务和辅助模式(如随机行走、搬运转弯),以丰富状态覆盖。运动合成后必须进行场景穿透过滤和接触校准后处理,避免将不可行动作作为训练标签。

  4. 策略训练中的域随机化:渲染时的光照、相机偏差、图像模糊等扰动对 vision-to-real 迁移至关重要,不可省略。同时训练中加入运动模糊增强,并采用推理端的锐度筛选,可有效缓解真实运动中常见的图像模糊问题。

  5. 系统部署架构:推荐采用异步架构,将慢速的视觉-语言推理与快速的全身控制解耦。VLK 策略生成的未来轨迹块应留有充裕的重叠窗口,并采用客户端实时拼接技术,保证轨迹块的平滑过渡。

  6. 先导航后操作:如果任务既包含导航又包含操作,可先验证导航部分(因为其对数据量要求较低)在实物上的性能,再逐步扩展到操作,避免过早陷入端到端集成的调试困境。此外,合理利用接触标签信息可显著提升物体搬运的稳定性(论文中移除接触标签后,拾取任务在真实世界的成功次数为 0/5)。

通过上述实践,研究者可以较低成本地构建一个能在真实场景中运行的人形机器人全身操控系统,并逐步拓宽其操作技能的边界。