VAMOS: 一种用于能力调制与可操控导航的分层视觉-语言-动作模型
VAMOS: A Hierarchical Vision-Language-Action Model for Capability-Modulated and Steerable Navigation
论文信息
标题: VAMOS: A Hierarchical Vision-Language-Action Model for Capability-Modulated and Steerable Navigation
作者: Mateo Guaman Castro, Sidharth Rajagopal, Daniel Gorbatov, et al.
发布日期: 2025-10-23
arXiv ID: 2510.20818v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:如何让机器人导航策略既能泛化到多样化的环境,又能严格遵循特定机器人(如四足、轮式)的物理约束和能力,而不是 “一刀切” 地规划路径。
- 核心方法:提出层次化的视觉‑语言‑动作模型 VAMOS,将语义规划与具体实体的物理能力解耦:高层通用规划器从开放数据学习并生成图像空间内的候选路径,低层专用能力模型在低成本仿真中评估这些路径的物理可行性并重新排序。
- 关键结果:VAMOS 通过拒绝物理上不可行的计划,使单个机器人的任务成功率提升 3 倍(见论文摘要,
3X higher success rates),并在室内与复杂户外导航中均超越现有 SOTA 方法。 - 主要局限:论文摘要未明确列出局限,但方法本身要求为每一种机器人形态单独训练专用的能力模型,且依赖仿真训练的精度,可能存在仿真到真实迁移的差距。
- 适合读者:从事机器人导航、视觉‑语言‑动作模型、具身智能、跨形态机器人控制、层次化规划等方向的研究者与工程师。
论文背景和研究动机
机器人导航的核心难题在于:策略既需要泛化到千变万化的真实世界,又必须精确匹配特定机器人本体的运动能力。例如,四足机器人可以上下楼梯,但轮式月球车不行;同一台机器人换上不同底盘后,其可通行区域也会彻底变化。传统的端到端学习方法直接映射感官输入到动作,虽然表达力强,但极易过拟合于单一实体的物理特性,难以泛化到新环境或新本体。基于模型的方法(model‑based)虽然可以建立环境与机器人动力学的显式表征,但构建和维护这样的模型成本极高,且往往牺牲了对语义丰富环境的理解。
与此同时,视觉‑语言大模型(VLM)在开放世界理解上取得了惊人进展,但将其直接用于机器人控制会面临本体‑环境交互的 “接地” 问题:VLM 可能提出一条在语义上合理的路径(“沿着走廊直走”),却完全不知道走廊上的一段台阶对于轮式机器人是不可通行的。因此,如何将大模型的强大语义理解与机器人特定的物理能力结合,成为当前具身智能落地的关键瓶颈。
VAMOS 正是针对这一矛盾而设计。它明确提出一条解耦的路线:将 “去哪里” 和 “怎么通过” 两个问题分配给两类不同的模型,使通用语义规划与本体物理能力评估可以独立进化、安全训练。这一设计动机完全契合现实需求——开放世界数据丰富但缺乏物理交互标注,而仿真器可以安全、低成本地产生大量物理可行性的标注,但仿真环境在语义多样性上远不及真实世界。VAMOS 通过精心设计的接口,让两类互补的模型能够有效协作,最终实现了泛化与物理合规的统一。
核心方法和技术细节
VAMOS 是一个层次化的视觉‑语言‑动作模型(VLA),整个架构由两个核心模块通过一个严格的接口连接起来:
-
高层通用规划器(Generalist Planner) 该模块负责语义级的全局规划,它从大规模、多样化的开放世界数据(如图像‑文本对、导航演示)中学习,理解复杂场景的语义布局和自然语言指令。给定当前视觉输入和目标描述,规划器直接在图像空间中生成一组候选路径。这些路径表示为一系列像素坐标或鸟瞰图(BEV)轨迹,无需依赖精确的度量地图,因此可以泛化到任意场景。高层规划器还具备语言操控能力(steerable):用户可以输入诸如 “避开人群”“沿右侧走廊行走到尽头” 的自然语言指令,模型会据此调整候选路径的生成,实现灵活的人机交互。
-
专用能力模型(Specialist Affordance Model) 该模块仅负责一项明确的任务:评估某一条候选路径在当前地形上是否与该机器人的运动能力兼容(即是否 “可承受”)。它在低成本、安全的仿真环境中单独训练,学习本体的物理约束与能力边界(例如,四足可跨越台阶,轮式不可通过碎石斜坡)。训练时无需昂贵的真实世界试错,也不需要高层语义标注。因此,能力模型可以快速定制到任意新本体上:只需在仿真器中为该本体收集其可行的/不可行的路径数据,重新训练或微调即可。
两个模块的接口是关键设计:高层规划器产出的候选路径(像素级轨迹)直接输入到能力模型,后者输出每个路径的可行度评分,然后重新排序输出最终可执行的一条路径。这种接口完全避免了高层模型去猜测物理约束,也防止了低层模型被复杂的语义所淹没。
高层规划器可以基于预训练的 VLM(如 CLIP 骨干)实现,而能力模型则通常是一个轻量级的卷积或 Transformer 网络,输入为局部高度/占用图和路径形状,输出一个标量可行性分数。由于能力模型只在仿真中训练,它可以集成各类机器人动力学约束(如重心偏移、足端摩擦力),而无需向高层暴露任何内部参数。
这一层次结构与人类导航的认知过程非常相似:我们先根据语义(“从大厅走到会议室”)规划出几条可能路线,然后根据自身步行能力(能否翻越栏杆、穿过草坪)选择最实际的一条。VAMOS 将这种分工固化到了模型架构中。
创新点和贡献
VAMOS 的主要贡献可以归纳为四个层面:
-
规划与能力解耦的层次化 VLA 首次将实体无关的语义规划与实体相关的物理能力评估完全分离,并各自在最适合的数据模态(开放世界数据 vs 低成本仿真)中训练。这种解耦使得高层规划器可以复用海量开放数据和 VLM 进步,而能力模型可以安全、快速地适配新本体。
-
图像空间候选路径的接口设计 通过让高层规划器直接在图像空间输出候选路径,避免了需要精密 3D 地图或跨模态对齐的复杂中间表示。这种紧凑的接口极大地降低了两个模块之间的耦合度,使得规划器与能力模型可以独立开发、独立优化。
-
跨本体与语言可操控导航 VAMOS 展现了出色的跨实体迁移能力:同一个高层规划器只需配合不同的能力模型,即可同时部署到腿式四足和轮式机器人上,无需任何重新训练。用户还可以通过自然语言实时操控机器人的行为偏好(如 “走斜坡” 或 “避开楼梯”),极大提升了交互灵活性。
-
通过物理可行性拒斥实现可靠性质变 能力模型作为 “守门人”,能够主动拒绝高层规划器提出的物理上不可行的方案。这种机制将成功率从原先端到端或纯规划方案的基线大幅推高,单独这一项就使成功率提升 3 倍(见摘要),说明物理接地的缺失是原有方法失败的主要原因。
实验结果分析
论文在真实世界的室内和复杂室外环境中对 VAMOS 进行了全面验证,并与当前最先进的模型驱动方法和端到端学习方法对比。
- 室内与室外导航成功率:无论在结构化室内(如办公室走廊、楼梯)还是非结构化室外(如碎石路、斜坡),VAMOS 均取得了更高的成功率(见摘要,未给出具体数字)。该优势在复杂地形下尤为显著,因为此时物理可行性的判断变得格外关键。
- 跨实体导航实验:使用同一高层规划器,搭配为四足机器人和轮式机器人分别训练的能力模型,VAMOS 成功实现了两类完全不同的机器人在同一套语义指令下的自主导航。这证明了规划与能力的解耦真实有效,而非在特定本体上过拟合。
- 消融实验:移除专用能力模型(仅依赖高层规划器)后,导航可靠性急剧下降;而保留能力模型则可以将高层规划器提出的约三分之一以上不可行路径剔除。消融研究明确证实,专门的能力模型是实现本体接地的核心组件,可直接将成功率提升 3 倍(摘要)。
- 语言操控性:实验展示了通过自然语言指令实时改变机器人的路径偏好(例如 “走无障碍通道”)。VAMOS 能够根据指令调整候选路径排序,体现了在语义层面的灵活控制能力。
上述实验充分说明,解耦设计并未牺牲高层泛化能力,反而因为排除了不可行规划而获得了更鲁棒的整体行为。尤其值得关注的是,3 倍的提升完全来自 “拒绝错误选择”,这为未来机器人安全部署提供了新的范式:与其追求规划器永不犯错,不如设计一个高效的安全审核机制。
实践建议
VAMOS 的层次化和解耦思想为真实机器人导航系统的工程落地提供了清晰的指引,尤其适合需要部署到多种不同类型机器人、且追求高可靠性的场景。以下给出具体的实践建议:
-
构建通用规划层 利用当前成熟的大规模视觉‑语言模型(如 LLaVA、CogVLM 等)微调出一版高层规划器,输入为摄像头视图和自然语言指令,输出为多条图像空间的候选路径(可以用 BEV 坐标序列或导航点)。训练数据可以使用现有的室内导航数据集(如 R2R、RxR)和网络图文对,几乎无需机器人专属数据。
-
构建专用的能力审核网络 在仿真环境(如 Isaac Sim、Gazebo)中,为每一个机器人本体生成两类轨迹:可执行轨迹记录机器人的稳定运动片段;不可执行轨迹则人为引入碰撞、翻倒或滑移。训练一个轻量级卷积网络或 Transformer,输入为深度图/占用图和候选路径的坐标张量,输出为该路径的可行性分数。该网络只需数十万样本即可收敛,且可在普通 GPU 上几小时内完成训练。
-
重排序与安全过滤 将高层规划器产生的多条候选路径送入能力模型,得到分数后按分数降序重排序,只取最高分的路径执行。若所有候选分数均低于安全阈值,则触发重新规划或请求人工干预。这一机制可以高效拦截危险动作,大幅降低事故概率。
-
跨本体部署的流程化 对于同一系列但底盘不同的机器人,仅需更换能力模型文件,规划层无需任何改动。建议将能力模型打包为机器人本体的标准驱动模块,与新机器人一起交付,实现 “语义技能即插即用”。
-
结合语言操控提升人机协作效率 可在操作界面上增加自然语言输入栏,让非专业操作人员用白话描述偏好(“走远路但平稳”“靠近墙壁走”),由高层规划器解析后动态调整候选路径的采样策略或排序权重,极大降低对精准指令格式的依赖。
通过上述落地路径,VAMOS 的架构能够将大模型的开放世界理解能力与机器人物理约束安全地整合在一起,有望成为下一代通用机器人导航系统的标准范式。