VLK:从重建场景的合成交互中学习人形机器人移动操控

arXiv: 2606.30645v1

论文信息

标题: VLK: Learning Humanoid Loco-Manipulation from Synthetic Interactions in Reconstructed Scenes

作者: Yen-Jen Wang, Jiaman Li, Sirui Chen, et al.

发布日期: 2026-06-29

arXiv ID: 2606.30645v1

PDF 链接: 下载 PDF

论文背景与研究动机

人形机器人在以人为中心的环境中工作,必须解决一个核心难题:如何将自我中心(egocentric)的视觉感知与自然语言指令,映射为全身协调的移动与操作动作。这一 “感知到行动” 的闭环要求机器人能实时理解周围场景、识别任务相关物体、规划走过去、弯下腰、抓取箱子并放置到指定位置等系列行为。学习这样一种策略,离不开一组至关重要的数据——同步的自我视角图像、语言任务描述,以及与之对齐的、机器人本体可执行的全身运动学轨迹。

然而,获取这样的成对数据极具挑战。真实世界的遥操作虽然能产生高质量的动作序列,但全身数据的采集成本高昂且难以覆盖多样的场景、物体和交互方式;人类动捕数据提供了丰富的动作参考,却缺少机器人眼里的视觉输入;而常见的自我中心视频数据集虽然视觉信息丰富,但并未与机器人运动学耦合。这意味着目前没有任何单一数据源能够同时提供训练全身移动操作策略所需的视觉、语言和运动学三元组。

针对这一数据瓶颈,论文 VLK 提出了一个突破性的思路:能否通过合成的方式来生成这些监督信号,从而绕开真实世界大批量数据采集的限制?这一思路固然诱人,但落地同样面临两个障碍:一是合成世界的资产必须足够多样且以假乱真,二是在这些虚拟世界中生成的机器人行为必须能在真实的物理环境中复现。该工作敏锐地捕捉到两类新兴技术的成熟——3D 高斯溅射(3D Gaussian Splatting, 3DGS)能够高效地从手机扫描中重建出具有真实尺度和逼真外观的室内场景,而基于强化学习的全身运动跟踪器则已被验证能忠实地将运动学参考轨迹在真实人形机器人上复现——于是试图将二者联通,构建一条 “真实场景→合成数据→真实机器人” 的闭环流水线。

核心方法:合成交互生成视觉-语言-运动学监督

VLK 的核心方法可以概括为三个步骤:在重建的真实场景中合成机器人行为、渲染自我中心图像,以及利用这些成对数据训练一个从视觉和指令到全身运动学的预测模型。

场景重建与标注

数据生成的第一步是利用 iPhone 搭载的 LiDAR 和 RGB 摄像头对目标室内环境进行扫描,然后通过 3DGS 重建出带精确尺度的三维场景。重建后的场景虽不具备语义标签,但论文设计了一套交互式标注工具,允许人工在点云上置放带语义的三维包围框(如 “椅子”“桌子”“箱子” 等)并标记可步行的多边形区域。这些标注为后续的运动合成提供了几何与任务语义约束。

基于重建场景的运动合成

在获得场景标注后,系统会根据任务类型自动采样目标物体、起始位姿和稀疏路径点,并利用预条件生成类人形机器人 Unitree G1 的运动序列。导航任务的目标是让机器人走向某个物体或在原地转身,而操作任务则需要抓取和放置纸箱。论文采用条件扩散模型对机器人-物体交互进行生成:对导航而言,生成 G1 的行走轨迹,条件包括语言指令、初始状态和路径点;对操作而言,则还需附加物体的初始位姿、几何特征,以及期望的手腕与物体接触相位。许多数据源的基础是重定向后的 OMOMO 人类-物体交互数据集,再通过一个 G1 专用的可微正向运动学层来提升末端执行器(即手腕)的位置精度。

自我中心渲染与域随机化

一旦生成一条 G1 全身运动学轨迹,系统就将其在 Isaac Sim 中重放,并在场景里放置一个与真实机器人安装位置完全一致的虚拟摄像头,从而渲染出与之对位的 RGB 图像。为了弥合后续真实部署时的视觉差异,渲染过程中引入了广泛的域随机化:灯光强度与角度、摄像头外参与焦距、图像亮度/对比度/饱和度/色调,乃至高斯噪声和运动模糊均在一定范围内随机变化。每一条合成轨迹最终都形成一个同步的三元组:一张自我中心图像、一句自然语言指令和一段时长约 1 秒(30 帧)的全身运动学片段。

整个数据生成过程完全自动化,无需真人演示。论文在两个室内环境(实验室和公寓风格)的 4 种不同布局下,每种布局执行 12 类任务模式,每类生成 1000 条轨迹,合计约 48,000 条训练样本,GPU 耗时仅 600 小时。

VLK 策略与全身跟踪

合成数据被用来微调一个基于 flow-matching 架构的 VLK 策略。该策略以当前自我中心图像、任务指令以及机器人当前的运动学状态(包含根位移、朝向、关节角度以及表示左右手腕是否接触物体的二元标签)作为输入,直接预测未来一秒钟的全身运动学轨迹——其动作空间就是 G1 的 30 帧关节级轨迹。训练目标除标准的重建损失外,还加入足部接触预测、累积根轨迹一致性、正向运动学精度及足部滑动正则化等辅助损失,以提升运动质量。

在部署时,VLK 策略运行于远程 GPU(RTX 5090),每次推理耗时约 31 ms,并采用块重叠机制保持轨迹的平滑性。预测出的运动学目标再由一个接触感知的全身跟踪器转换为实际的电机指令。跟踪器本身是盲的,只能看见 VLK 提供的未来参考状态和机器人当前的本体感觉,但其 “接触感知” 能力意味着在需要搬运箱子时,会主动维持手腕与物体的接触,从而稳定整个操作过程。

创新点与技术贡献

这篇工作的创新是多方面的。首先,它打通了从任意室内场景扫描到成规模合成机器人交互数据的全自动管道,首次在一个人形机器人上展示了利用手机重建环境即可生成有效监督信号的可行性。其次,它将感知和运动的耦合解耦为 “高层 VLK 轨迹预测 + 低层全身跟踪” 的框架,高层模型直接预测机器人可读的运动学状态而非末端执行器指令,使得整个系统更紧凑且易于跟踪。第三,VLK 策略在运动学空间内工作的同时,还额外学习预测手部-物体接触的二元标签,这些标签不仅作为一种辅助状态辅助跟踪器稳定接触,也反过来为策略提供了操作阶段的隐性上下文。此外,论文通过精细的后处理(足部逆运动学修正、手腕接触姿态优化)和丰富的域随机化,显著缩短了 sim-to-real 的视觉差距。

实验结果与关键发现

论文在真实 Unitree G1 上执行了导航(走至物体、原地转身)和操作(从地面或桌面捡箱子、放置箱子)共 6 类任务,每类 20 次实机试验,并在仿真中进行了上千次闭环评估。仿真成功率在导航任务上可达 99.4%(走至物体),操作任务从地面上捡、放箱子的成功率也在 73% 到 99% 之间;而平面高度(如桌子)上的操作任务则明显更困难,成功率约 45%~72%。实机表现趋势与仿真一致:实验室场景下捡地面箱子的成功率为 80%,放地面箱子为 100%,而捡表面箱子只有 55% 的成功率。这一落差主要源于训练数据中缺少针对不同支持面高度的精细操作样本。

从数据量消融实验看,操作任务对数据量的敏感性远高于导航:当训练数据仅 10% 时,捡表面箱子的成功率为 0,而增加至 100% 数据后提高到 46%,证明了接触丰富的操作确实需要大量的场景覆盖。视觉域随机化的消融实验同样具有说服力:在光照和摄像头随机化全开的情况下,走路任务在仿真中的成功率为 90%,关闭所有随机化后骤降至 41%,充分证实了外观变化对于策略鲁棒性的关键作用。

实践应用建议与未来方向

对于从事机器人操作或移动操作的研究者和工程师来说,VLK 的工作带来几点重要启示:第一,面向特定场景,使用消费级手机扫描加 3DGS 重建是一种低成本获取高保真训练环境的方式,结合合成运动生成可快速构建大规模任务数据;第二,将高层感知策略与低层全身跟踪控制器解耦,有助于在无需重新训练跟踪器的情况下灵活更换感知模块,且跟踪器的接触感知特性对稳定搬运大物体至关重要;第三,务实的域随机化策略(特别是光照和相机抖动)是 bridging sim-to-real gap 的必备手段,应当在数据生成阶段就予以考虑。

展望未来,VLK 仍有明确的拓展空间。当前操作交互的多样性受限于 OMOMO 数据集的覆盖范围,主要集中于搬运较大盒状物体,缺乏对小型物体(如杯子、工具)的精确抓取。后续工作可以引入更丰富的交互数据源,或者结合灵巧手实现精准抓取。此外,目前的 VLK 策略每次推理只预测一秒钟的运动,虽然配合块重叠可以执行长序列,但对于更长期的规划仍显不足,或许需要引入分层规划或回忆式上下文机制。在视觉方面,单目的自我中心图像在快速弯曲或转身时易产生运动模糊,论文提出的拉普拉斯锐度选择是一种工程缓解手段,而采用事件相机或融合惯性传感的感知方式也可能是值得探索的方向。

总结

VLK 论文给出了一条端到端的解决方案:从手机扫描室内环境开始,自动生成包含自我中心视觉、自然语言指令和人形机器人全身运动学的海量合成训练数据,再用这些数据训练一个直接输出运动学参考轨迹的感知策略,并通过接触感知全身跟踪器部署到真实机器人上。实验不仅验证了该方法可让 G1 顺利完成导航和搬运箱子等基本移动操作任务,还通过充分的消融研究厘清了数据量和视觉随机化的关键作用。这一工作开辟了利用合成交互在重建场景中廉价构建人类机器人交互策略的新范式,为未来感知驱动的人形机器人走向更多家庭和工业场景提供了坚实的技术基础。