TANGO:基于全身视觉-语言-动作模型的杂乱环境中人形机器人导航
TANGO: Humanoid Navigation in Cluttered Environments with a Whole-Body Vision-Language-Action Model
论文信息
标题: TANGO: Humanoid Navigation in Cluttered Environments with a Whole-Body Vision-Language-Action Model
作者: Anqi Li, Yuxin Chen, Zhaobo Li, et al.
发布日期: 2026-09-08
arXiv ID: 2609.09158v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:这篇论文要解决人形机器人在杂乱室内环境中执行语言引导导航的问题,该问题要求机器人同时理解指令、规划路径,并通过调整手臂、躯干和步态完成无碰撞的全身三维穿越。
- 核心方法:论文提出 TANGO,一个 “视觉-语言-动作” 框架。它用 Plan–Edit–Track 仿真数据管线自动生成无碰撞全身运动监督,并训练一个基于 Qwen2.5VL-7B 和 flow-matching 扩散动作专家直接预测 29 自由度关节空间动作块。
- 关键结果:在增强后的 VLNVerse-unseen 杂乱环境评估中,TANGO 的碰撞率为 9.90%,低于最强模块化基线 InternVLA-N1 + HumanoidPF 的 15.81%(表 2)。
- 主要局限:作者承认低层跟踪器的能力构成约束,例如无法处理上楼梯等复杂地形;此外,系统仅依赖 RGB 图像,在视觉模糊、遮挡或低光环境中场景理解可能受限。
- 适合读者:适合从事人形机器人控制、具身智能、视觉语言导航、仿真数据生成和 sim-to-real 迁移研究的学生、工程师和研究者阅读。
论文背景和研究动机
传统视觉语言导航(VLN)方法通常把导航建模为二维路径规划问题,预测离散动作或平面路径点。这类低维动作空间难以表达 “某个导航决策在物理上是否可执行”。例如,一条路径在地图层面可行,但人形机器人的手臂、躯干或腿部可能与周围物体碰撞。论文指出,RDP 等工作已经揭示了视觉语言导航中的 embodiment gap,但主流 VLN 仍倾向于将导航与全身控制分离。
另一方面,人形机器人控制领域近年来出现了 SONIC、HumanoidPF 和 InternVLA-N1 等工作。SONIC 提供了自然全身控制能力,但通常接收高层速度命令;HumanoidPF 能实现碰撞感知穿越,却难以扩展到长时程语言引导导航;InternVLA-N1 等 VLA 模型在持续导航中表现较强,但其动作空间仍主要面向平面运动。论文的动机在于:需要一种统一框架,让导航决策与全身可通行性联合推理,而不是在高层规划与低层执行之间留下物理可行性缺口。
核心方法和技术细节
TANGO 的问题定义是:给定语言指令 、前视和下视 RGB 序列以及本体感觉 ,预测未来 步的动作块 ,其中每步动作 包含 29 自由度期望关节角 和基础 6D 旋转表示 。预测结果交给低层运动跟踪器执行。
数据生成是 TANGO 的关键。论文提出 Plan–Edit–Track(PET)管线。首先对 VLNVerse 和 SAGE-3D 场景进行障碍物增强,加入侧向障碍、地面障碍和头顶障碍,以诱发侧身通过、跨步和低头/下蹲等全身行为。Plan 阶段使用带障碍物感知代价的 A* 规划平面路径,并在窄通道处插入 90 度航向偏移,使机器人以侧向步态通过。随后使用 SONIC 生成自然步态。Edit 阶段通过基于有符号距离场的势场伪力、SoftMimic 风格的目标位移,以及步态适应模块,对参考运动进行全身障碍物避让编辑:跨步时重新规划落脚点并加入摆动足部高度弧线,下蹲时引入肩部/躯干下降。Track 阶段把编辑后的运动输入 SONIC 跟踪器,检验动力学可行性并过滤碰撞轨迹。最终用于监督的是 “编辑后的参考运动”,而不是跟踪后的结果,以保留人类自然运动结构。整个数据集包含 64,633 条轨迹,PET 和渲染合计约 211 GPU-hours(表 6)。
TANGO 采用三系统架构。System-2 是 Qwen2.5VL-7B 视觉语言模型,从视觉 token 和语言指令生成潜在上下文 token ;它使用 BATS 采样历史帧,并对视觉特征做空间网格池化。System-1 是 flow-based MM-DiT 扩散动作专家,以 和当前本体感觉为条件生成动作块。论文引入稳定化动作目标:基础偏航相对于块首帧参数化,并附加 作为辅助平面位移监督。训练时使用实时分块(RTC),让模型在给定随机已承诺动作前缀的条件下补全剩余时域,以匹配在线流式执行。System-0 是 SONIC 跟踪器,负责将动作块转换为高频关节命令。训练损失同时包含 VideoQA 文本解码的交叉熵损失和 flow-matching 损失。
创新点和贡献
论文的主要贡献包括四个方面。第一,提出了据论文表述为首个全身视觉语言导航框架,直接输出 29-DoF 关节空间动作,而不是高层路径点或分离的上下半身指令。第二,PET 管线自动生成无碰撞、动力学可行的全身导航监督,避免依赖人工动作捕捉和重定向。第三,在模型层采用 “视觉语言 backbone + 扩散动作专家 + 低层跟踪器” 的三系统设计,并用 RTC 对齐离线训练和在线部署。第四,在仿真和真实机器人上验证了零样本迁移。真实世界部署使用宇树 G1,未使用任何真实导航数据训练;实验显示机器人可在约 30 米路线中执行语言引导穿越,包括窄道侧行、头顶障碍下蹲和地面障碍跨步。
实验结果分析
在 VLNVerse 基准上,TANGO 是在带低层物理控制条件下评估的方法,其他基线均在传送设定下评估。即便如此,TANGO 在 seen 和 unseen 验证集上取得最高 SR(54.69/52.89)和最低 NE(3.90/3.72)(表 1)。但 SPL 与 RDP 等基线相当,论文将其保守路径归因于低层跟踪器倾向于选择更安全但不够直接的轨迹。
在增强后的 VLNVerse-unseen 杂乱环境中,TANGO 的碰撞率为 9.90%,而 InternVLA-N1 + HumanoidPF 基线为 15.81%;TANGO 的 SR/SPL 为 43.75/31.83,高于该基线的 41.88/29.49(表 2)。论文特别说明,HumanoidPF 基线还额外使用了 LiDAR 几何感知,而 TANGO 只使用 RGB 输入。这一比较是在该实验设置下的有限结论,不能推广为 “RGB 一定优于 LiDAR”。
真实世界实验中,每种方法在每个设置下进行 15 次试验。TANGO 在短程二维、长程二维和杂乱三维场景中的成功次数分别为 12/15、8/15 和 10/15,平均碰撞次数为 0.40、1.07 和 0.73;对照基线分别为 11/15、6/15 和 6/15,平均碰撞次数为 1.40、3.47 和 1.93(表 3)。这支持 TANGO 在该测试条件下具有更好的任务完成率和更低碰撞频率。
消融研究进一步表明:去掉 RTC 后,增强 VLNVerse-unseen 上的 SR 从 43.75 降至 10.94,碰撞率从 9.90% 升至 14.60%;去掉运动编辑后,SR 降至 36.25,碰撞率升至 20.60%(表 5)。这支持 RTC 和障碍物感知运动监督在保持动作连续性和避障能力方面的重要性。将 SONIC 替换为 ScaleBFM 后,SR/SPL/CR 分别为 40.94/29.65/9.10,与默认配置保持在约三个百分点内,体现了一定跟踪器兼容性。
实践建议
对于希望构建人形机器人语言引导导航系统或复现 TANGO 的团队,本文提供了几个可参考的工程要点。
其一,数据管线比模型本身更值得关注。PET 管线可以在仿真中批量生成带全身避障标签的导航轨迹,避免人工动作捕捉。如果团队已有仿真场景和运动生成器,可优先复现 “障碍物增强 + Plan + Edit + Track” 流程,再根据硬件平台调整 29 自由度关节空间和跟踪器。
其二,部署架构适合资源受限的人形机器人。TANGO 将低频 VLA 推理放到服务器端,将高频 WBC 放到 Jetson Orin NX 上,通过标准 IP 网络通信。论文给出的工程参数为:RGB 与本体感觉传输约 20ms 延迟,VLA 每 0.5s 推理一次,每次生成 15 个动作 @30Hz,随后重采样到 50Hz,低层控制约 200Hz(第 7 节)。这些参数可作为同类系统的延迟预算起点。
其三,跟踪器能力边界需要纳入任务设计。论文明确指出低层跟踪器是进一步部署的瓶颈,例如无法上楼梯。因此,将 TANGO 扩展到新环境前,应首先验证 SONIC 或替代跟踪器是否能处理目标地形;若不能,应换用或微调跟踪器,并重新评估闭环导航性能。
其四,视觉输入限制需要工程缓解。论文实验没有使用深度相机或 LiDAR,且作者认为在低光或视觉模糊场景中仅 RGB 可能限制场景理解。实际部署时,可考虑增加主动照明、深度传感器或 LiDAR 作为辅助,但论文未验证这些扩展对成功率的影响。
整体来看,TANGO 适合作为全身导航基础模型继续迭代:可替换视觉语言 backbone、动作专家和低层跟踪器,并逐步扩展到更多样化的地形与操作任务。更多实现细节可参见 TANGO 项目主页。