BEVLM:将大语言模型的语义知识蒸馏到鸟瞰图表示中

BEVLM: Distilling Semantic Knowledge from LLMs into Bird's-Eye View Representations

arXiv: 2603.06576v1

论文信息

标题: BEVLM: Distilling Semantic Knowledge from LLMs into Bird's-Eye View Representations

作者: Thomas Monninger, Shaoyuan Xie, Qi Alfred Chen, et al.

发布日期: 2026-03-06

arXiv ID: 2603.06576v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:如何将大语言模型(LLM)的语义知识蒸馏到自动驾驶的鸟瞰视角(BEV)表示中,从而提升空间推理能力和驾驶安全性?
  • 核心方法:提出 BEVLM 框架,通过 VQA 任务将冻结的 LLM 作为 “语义教师”,监督 BEV 编码器(学生)学习语义特征,同时保留几何检测任务以维持空间结构。
  • 关键结果:在 Ego3D 跨视图推理中,BEV 表示准确率比多视图图像输入提升 46.0%;在 NeuroNCAP 安全闭环评测中,蒸馏后的端到端驾驶模型安全评分提升 29.0%,碰撞率降低 11.3%。
  • 主要局限:语义蒸馏依赖人工标注的 VQA 数据集(如 DriveLM),尚未实现无人工蒸馏;实验仅基于 UniAD 的 BEV 架构,未验证对其他 BEV 骨干网络的通用性。
  • 适合读者:从事自动驾驶感知、多模态大模型、端到端驾驶系统以及视觉-语言对齐研究的工程师和研究者。

论文背景和研究动机

大语言模型(LLM)凭借强大的常识推理和场景理解能力,正被逐步引入自动驾驶系统,以应对复杂的长尾场景。主流方法通常将多视角、多帧图像独立编码为视觉 Token 输入 LLM(如 DriveLM、Senna 等),但这带来两个根本性问题:

  1. 空间一致性缺失:不同视角的图像被独立处理,LLM 难以建模 3D 几何关系,尤其不利于跨视角的空间推理(图 1 左侧)。
  2. 计算冗余严重:独立处理每个视角使得计算成本随帧数线性增长,限制了长时序信息的利用。

与此同时,BEV 表示已成为现代自动驾驶系统的核心中间表示。它通过融合多视角、多时序甚至多模态信息,形成统一的自车坐标系网格,天然具备空间一致性和紧凑性。然而,BEV 编码器通常仅通过检测、建图等密集几何任务进行训练,缺乏大规模图文预训练赋予的语义丰富性(图 1 中间),这形成了语义瓶颈,使其难以被 LLM 高效利用。

论文的核心动机正是填补这一鸿沟:将 LLM 的语义知识蒸馏到 BEV 编码器中,构造出既有空间结构又具语义感知能力的表示,从而同时提升 LLM 的空间推理效果和端到端驾驶模型在安全关键场景下的表现。

核心方法和技术细节

BEVLM 框架由两个紧密关联的阶段构成:BEV-语言对齐研究和语义蒸馏。

BEV 表示的优势验证(第 3 节)

在研究蒸馏方法之前,论文首先系统回答了 “BEV 表示是否比透视图像更适合 LLM 空间推理” 这一基础问题。

  • BEV Token 化:将 UniAD 的 BEV 特征图(200×200)最大池化至 50×50,得到 2500 个 Token,通过一个 MLP 投影器(结构为 LayerNorm→Linear→GELU→Linear)映射到 LLM 的嵌入空间。LLM 参数冻结,仅训练投影器。
  • 对齐验证:在 DriveLM 的二元目标存在性问题上,BEVLM(InternVL3 1B)准确率达 90.8%,接近 UniAD 检测器的 92.8%,证明投影器有效保留了空间信息(表 1)。
  • 跨视图推理对比:在要求全景空间理解的 Ego3D 数据集上,BEV Token(BUniADB_{\text{UniAD}})的多选题准确率为 61.34%,比单视图图像 Token(IUniADI_{\text{UniAD}})的 42.02% 高出 46.0%,且距离估计 L1 误差降低 27.8%(表 3)。即使与千万级参数量的 ViT 视觉编码器(IViTI_{\text{ViT}} fine-tuned)相比,BEV 表示性能接近,但模型规模仅为后者的 1/10(44M vs. 400M)。这确证了 BEV 在空间推理上的根本性优势。

语义蒸馏(第 4 节)

基于上述发现,BEVLM 提出将 LLM 作为 “不可移动的语义教师” 进行表示蒸馏,而非传统的输出层蒸馏。

  • 蒸馏形式:将冻结的 LLM 视为一个固定的语义流形 Mteacher\mathcal{M}_{\text{teacher}},BEV 编码器学生必须将场景表示为能激活该流形中正确概念的嵌入 v∗\mathbf{v}^*(如 “阻塞车道”“不安全车速”)。监督信号通过 VQA 任务的交叉熵损失反向传播,迫使 BEV Token 编码高层语义。联合训练目标同时包含检测任务(维持几何结构)和 VQA 任务(注入语义): L=Ldet+LVQA\mathcal{L} = \mathcal{L}_{\text{det}} + \mathcal{L}_{\text{VQA}}
  • 训练流程:从预训练的 BEVFormer 检测权重出发,先用 1 个 epoch 进行蒸馏(8×A100 约 35~100 小时),再冻结蒸馏后的 BEV 编码器,训练 UniAD 的端到端检测、预测、规划头 20 个 epoch(约 115 小时)。在端到端规划阶段,LLM 本身不参与推理,蒸馏产生的语义增强 BEV 特征直接供传统规划模型使用。

创新点和贡献

  1. 首次系统性表示研究(贡献 1):通过单视图(DriveLM)和跨视图(Ego3D)两个维度,定量证明了 BEV 表示在 LLM 空间推理上远超多视图独立图像输入,且能以小得多的模型规模媲美大规模 ViT 编码器。
  2. BEV 语义蒸馏框架(贡献 2):不同于以往将 LLM 作为解码器使用,BEVLM 开创性地将 LLM 用作 “语义教师”,通过 VQA 任务将常识知识注入 BEV 编码器。该方法统一了结构化 3D 建模与语义推理。
  3. 安全临界场景的实质提升(贡献 3):在 NeuroNCAP 闭环仿真中,蒸馏后模型的 NeuroNCAP 安全评分从 2.10 升至 2.71(+29.0%),碰撞率从 62% 降至 55%。尤其关键的是,行为与规划类 VQA 问题对安全提升贡献最大(表 6),证实了蒸馏的是高层决策语义,而非单纯的目标识别。

实验结果分析

开环与闭环评估(第 5.2~5.3 节)

开环 nuScenes 的 L2 规划误差仅略有下降(1.05m→0.97m),但闭环比拼结果揭示了关键差别。这一反差符合作者引述的 “开环指标与实车安全相关性弱” 的共识(相关论文:Dauner 等、Li 等)。在 NeuroNCAP 生成的未见安全临界场景中,蒸馏模型表现出明显更优的决策:

  • 场景 1(图 4a):右转遇施工封路,蒸馏模型提前变道躲避后车,基线模型犹豫并碰撞。
  • 场景 2(图 4b):逆行车辆逼近,蒸馏模型果断右躲避碰,基线反应过晚。
  • 失败案例(图 0.D.3):即使蒸馏模型也碰撞,但提前刹车的减速幅度达 35%,严重性显著降低。

消融实验洞察

  • VQA 数据类型(表 6):仅用感知+预测数据蒸馏,安全评分提升至 2.37;仅用行为+规划数据,提升至 2.42;使用全部数据,达到最优 2.46。同时,前者平均撞击速度从 7.86 m/s 降至 6.24 m/s,后者进一步降至 6.10 m/s,说明高层推理数据对抑制碰撞严重性的作用更为直接。
  • LLM 规模效应(表 4):1B LLM 蒸馏安全评分 2.46,8B LLM 达 2.71(+10.2%),碰撞率亦有绝对 8 个百分点的降幅。作者指出,这证明 LLM 作为教师的质量会显著影响蒸馏效果,并非简单的辅助任务正则化。
  • BEV 下采样(表 5):简单的 Max Pool 在准确率上与可学习的卷积下采样持平(90.8%),无需额外参数,说明 BEV 网格本身已是高表达性表示。

实践建议

对于期望在自动驾驶系统中融合 LLM 语义能力的工程团队,BEVLM 提供了明确可操作的路线图:

  1. 优先采用 BEV 作为 LLM 的视觉输入接口。如第 3 节所示,BEV Token 能在小得多的模型规模下实现可比甚至更优的空间推理,同时天然消除了多视图独立编码带来的计算冗余和几何歧义。工程师可基于现有的 BEVFormer、UniAD 等架构,冻结视觉骨干网络,仅训练一个轻量 MLP 投影器,即可快速验证 LLM 对 BEV 场景的理解精度。

  2. 蒸馏时可侧重行为与规划类 VQA 数据。表 6 的消融结果显示,感知/预测问题和行为/规划问题对安全评分的贡献分别为约 12.9% 和 15.2%(相对提升),后者对减速避碰等主动安全行为的影响更显著。实践中应优先构建覆盖长尾场景的 “安全决策” 提示对(如 “现在最安全的行动是什么?”),而非仅标注目标类别。

  3. LLM 仅作为蒸馏教师使用,不嵌入实时推理。BEVLM 设计的核心优势在于:蒸馏阶段引入 LLM,但最终的端到端规划器仍为传统模型,不受 LLM 推理延迟影响。这避免了 Vision-Language-Action(VLA)架构在实车上部署的实时性瓶颈(论文第 4 节已明确指出此 Challenge),同时仍能获得语义感知能力的提升。

  4. 注意计算资源分配。蒸馏 8B 教师需 100 GPU 小时(A100),端到端训练需额外 115 GPU 小时,团队应据此评估迭代周期。如资源受限,可考虑先用 1B 教师快速验证,其在 NeuroNCAP 上已有 17% 的提升。