Vega:通过自然语言指令学习驾驶

Vega: Learning to Drive with Natural Language Instructions

arXiv: 2603.25741v1

论文信息

标题: Vega: Learning to Drive with Natural Language Instructions

作者: Sicheng Zuo, Yuxuan Li, Wenzhao Zheng, et al.

发布日期: 2026-03-26

arXiv ID: 2603.25741v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:当前自动驾驶的视觉-语言-动作模型仅用语言进行场景描述或推理,缺乏遵循多样化、开放式的用户自然语言指令来实现个性化驾驶的能力。
  • 核心方法:构建了包含约 10 万条指令-轨迹配对数据的大规模数据集 InstructScene,并提出统一视觉-语言-世界-动作模型 Vega。该模型采用自回归与扩散混合架构,通过联合预测未来图像(世界模型)和驾驶动作,利用密集的像素级监督信号,学习 “指令-动作-视觉结果” 间的因果联系。
  • 关键结果:在 NAVSIM v2 基准测试中,Vega 结合 best-of-N 策略取得了 89.4 的 EPDMS 分数,超越了当时最优方法,并展现出强大的指令遵循与未来场景生成能力(见表 1)。
  • 主要局限:在 NAVSIM v1 基准上,Vega 的性能略低于部分使用多视图、高分辨率输入或额外强化学习训练的方法,论文认为这主要是由于 v1 的指标不平衡地偏爱保守策略所致(见论文第 4.3 节)。
  • 适合读者:对端到端自动驾驶、具身智能、视觉-语言-动作模型、世界模型以及多模态学习感兴趣的研究者和工程师。

论文背景和研究动机

传统的视觉中心自动驾驶方案采用模块化的感知-预测-规划流水线,这严重依赖昂贵的三维标注,限制了其在真实世界的可扩展性。近年来,视觉-语言-动作(VLA)模型兴起,它们利用大型语言模型的世界知识将视觉输入直接映射为驾驶动作,展现了强大的泛化能力。

然而,现有 VLA 模型存在一个关键瓶颈:它们大多只使用语言进行场景描述或决策推理,缺乏灵活的指令遵循能力。这些模型要么模仿一个 “平均化” 的专家策略,要么局限于 “左转”、“直行” 等简单的封闭式导航指令集,无法泛化到开放、灵活的自然语言指令。一个真正的通用驾驶智能体,不仅应能自主导航,还应能理解并执行用户的各种个性化指令,例如,一个匆忙的用户可能会指示车辆 “超过前车,争取在下一个绿灯通过”,而非遵循从训练数据中学到的保守策略。

为了实现从 “模仿驾驶” 到 “指令驾驶” 的范式转移,论文作者构建了一个大规模指令驾驶数据集,并提出了一个能够联合进行指令驱动的轨迹规划与未来场景生成的统一模型,旨在让模型真正理解指令、动作和视觉变化之间的因果逻辑。

核心方法和技术细节

Vega 的核心思路是通过一个统一模型,同时完成基于指令的动作规划和未来图像生成,以后者提供的密集监督信号来解决传统 VLA 模型动作监督稀疏的难题。

1. 数据集构建:InstructScene 为了训练指令遵循能力,论文基于 NAVSIM 数据集构建了包含约 10 万个场景的 InstructScene。他们采用了一个全自动的两阶段标注流程:

  • 场景理解阶段:利用强大的 VLM(Qwen2.5-VL-72B-Instruct),输入前后共 14 帧前视图图像,要求模型描述前 4 帧的静态与动态场景元素,并分析后 10 帧中自车的行为及其与场景元素的交互。
  • 指令生成阶段:结合历史观测、未来轨迹和第一阶段的场景描述,让 VLM 提炼出简洁的、能引导车辆复现该轨迹的驾驶意图指令。同时,为了弥补 VLM 对自车运动感知不准的缺陷,论文补充了基于规则的指令生成方法,根据速度、加速度等阈值生成精确的运动描述,并作为辅助提示与 VLM 生成结果结合。

2. Vega 模型架构 Vega 采用了一种混合自回归-扩散 Transformer 架构,实现了四大核心功能的统一:

  • 多模态输入编码:将语言指令通过 Qwen2.5 分词器编码,将前视图图像通过 VAE 和 SigLIP2 ViT 编码为视觉特征,并将绝对轨迹坐标转换为相对动作 (Δx,Δy,Δθ)(\Delta x, \Delta y, \Delta \theta) 后通过线性层投影到模型维度。
  • 因果序列构建:将历史图像、动作以及当前指令按时间顺序交织排列,并在序列末端拼接带噪声的目标动作或未来图像。模型通过精心设计的因果注意力掩码,确保每个位置的 token 只能关注其之前的序列,符合驾驶过程中 “先感知、后决策、再观测” 的因果链。
  • 联合生成与规划:模型采用扩散范式生成动作轨迹和未来图像。为在训练中高效处理多个扩散过程,论文引入了一种 “干净-噪声” 潜变量复制策略:将同一时刻的动作或图像潜变量复制为两份,一份加噪用于扩散去噪训练,另一份保持干净作为后续序列的条件输入,并屏蔽后续 token 对带噪副本的注意力。
  • 模块化 Transformer(MoT):不同于仅解耦 FFN 层的 Mixture of Experts,Vega 采用 Mixture-of-Transformers 架构,为视觉-语言理解、图像生成和动作规划分别配备独立的 Transformer 网络(包括注意力和 FFN 层)。其中,理解和生成模块使用大规模参数,而动作模块则减小到 256 维以降低计算开销。整个前向过程中,多模态序列被拆分后送入各自模块,再重组以计算全局因果注意力。

3. 训练与推理 模型采用单阶段联合训练,损失函数为动作扩散去噪的 MSE 损失 LA\mathcal{L}_A 和未来图像 VAE 潜变量去噪的 MSE 损失 LV\mathcal{L}_V 的加权和。在推理时,模型使用无分类器引导的扩散过程生成动作,并可选择性地生成与动作指令一致的未来图像。

创新点和贡献

  1. 提出 “指令驾驶” 新范式:论文明确指出了现有自动驾驶模型从 “模仿学习” 到 “指令学习” 的范式空缺,并为此构建了首个大规模、具备丰富自然语言指令标注的驾驶数据集 InstructScene。
  2. 提出统一的 VLWA 模型 Vega:首次将视觉理解、语言理解、世界建模(未来生成)和动作规划四大任务整合到一个单一的混合自回归-扩散 Transformer 框架中。通过联合学习,利用世界模型提供的密集、像素级监督信号,有效缓解了从高维指令到低维动作映射的监督稀疏问题。
  3. 创新的架构设计:采用 Mixture-of-Transformers 架构对多模态能力进行高度解耦,提升了模型容量和优化效率。同时,“干净-噪声” 潜变量复制策略巧妙地解决了在一个因果序列中同时训练多个条件扩散过程的难题。

实验结果分析

论文在 NAVSIM v1 和 v2 两个基准上进行了全面评估。

总体性能:在 NAVSIM v2 上,Vega 基础模型取得了 86.9 的 EPDMS,已与最优方法相当。当采用 best-of-N(N=6)策略后,其 EPDMS 跃升至 89.4,超越了所有对比方法,尤其在驾驶方向合规(DDC)、交通灯合规(TLC)、车道保持(LK)等指标上表现出色(见表 1)。在 NAVSIM v1 上,Vega 同样表现出竞争力,PDMS 达到 89.8(best-of-N)。

消融实验启示:

  • 未来帧预测的作用:对比随机预测未来帧、删去未来帧预测任务的实验表明,加入未来图像生成任务能显著提升规划能力,而具体预测哪一帧影响不大(见表 3)。
  • 动作专家模块的有效性:将动作规划任务交由独立的、低维的动作专家模块,效果好于复用 VLM 模块,并远超复用扩散生成模块(见表 4),这验证了为特定模态定制专用模块设计的有效性。
  • 序列交织的影响:在训练中采用图像-动作交织序列的模型,虽然在微调初期损失更高,但最终收敛速度更快,损失更低(见图 4),说明这种设计有助于模型更好地学习观察与动作之间的动态关系。

可视化分析:论文的可视化结果直观展示了 Vega 的能力。它不仅能根据不同的指令(如 “加速”、“减速”)在相同场景下规划出截然不同的轨迹(见图 5),还能在生成规划轨迹的同时,渲染出与指令和动作逻辑相符的未来驾驶场景图像(见图 6)。这证明了其世界模型和内嵌的因果推理是有效的。

实践建议

Vega 的工作为开发更智能、更个性化的自动驾驶系统提供了切实可行的路径,但在工程落地时需考虑以下几点:

  1. 指令数据集的构建成本与泛化性:InstructScene 的构建依赖昂贵的大型 VLM,且当前仅基于前视图和 NAVSIM 场景。在实践中,若要部署到更复杂、多变的真实环境,需要构建覆盖多视角、多城市、多天气和更多样化用户指令场景的数据集。可以考虑采用半自动化流程,先由 VLM 生成种子指令,再通过人工筛选和众包进行修正与扩充。
  2. 单视图感知的局限性:当前 Vega 仅使用前视图图像,这限制了其在换道、十字路口等复杂场景下的决策安全裕度。工程实现中,应将模型输入扩展至环视多路相机,但这会显著增加模型的序列长度和计算负担,需要配合更高效的长序列注意力机制或视觉 token 压缩技术。
  3. 模型部署的推理延迟:Vega 的集成式 Transformer 架构和扩散生成过程计算量庞大,难以满足车载端实时性要求。一条可行路径是利用知识蒸馏,将训练好的大型 Vega 模型中的指令理解和世界知识迁移到更小、更高效的实时规划网络中。或者,将世界模型的生成过程移至云端,仅将生成的潜在未来状态特征下发至车端用于辅助决策。
  4. 指令遵循的安全性:允许用户以开放词汇指令干预驾驶行为引入了新的安全风险。系统必须具备鲁棒的异常指令检测和拒绝能力。例如,当用户指令 “无视红灯” 或会导致危险碰撞时,模型应能基于内置的安全规则和世界模型预测的未来风险,否决该指令并执行安全策略。这需要在训练时引入对抗性指令和安全强化学习。