看得更少,驾驶更好:通过基础模型随机补丁选择实现可泛化的端到端自动驾驶

See Less, Drive Better: Generalizable End-to-End Autonomous Driving via Foundation Models Stochastic Patch Selection

arXiv: 2601.10707v1

论文信息

标题: See Less, Drive Better: Generalizable End-to-End Autonomous Driving via Foundation Models Stochastic Patch Selection

作者: Amir Mallak, Erfan Aasi, Shiva Sreeram, et al.

发布日期: 2026-01-15

arXiv ID: 2601.10707v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:端到端自动驾驶中,从视觉语言基础模型提取的 patch 对齐特征存在严重的信息冗余和跨 patch 相关性,策略网络容易过拟合虚假关联,导致分布外(OOD)场景下性能下降。
  • 核心方法:提出随机 Patch 选择(Stochastic Patch Selection, SPS),每帧图像随机屏蔽固定比例的 patch 描述符但保留原有空间布局,迫使策略从不同的随机子集学习中学习到不变的、因果相关的视觉线索。
  • 关键结果:在 CARLA/VISTA 仿真闭环驾驶测试中,SPS 平均 OOD 成功率达 90%,比现有 SOTA(Drive Anywhere)提高 6.2%,在极端场景最高提升 20.4%,同时推理速度提升 2.4 倍(表 1、图 1)。
  • 主要局限:SPS 的选择策略目前是均匀随机和固定采样比例的,未根据场景动态调整或基于描述符信息价值进行智能挑选;论文也指出,在极低保留率(如 30%)下某些变体会出现性能下滑。
  • 适合读者:从事端到端自动驾驶、机器人感知与控制、或者对如何利用基础模型的冗余特征进行高效、鲁棒策略训练感兴趣的研究者和工程师。

论文背景和研究动机

近年来,端到端自动驾驶直接将感知输入映射到车辆控制指令(转向、油门),省去了传统模块化架构中的抽象边界,能够以单一的驾驶目标优化整体系统。然而这类方法对训练数据的分布极其敏感,分布外(OOD)场景——例如不同季节、天气、光照或物体类别——常常导致性能雪崩。

Wang 等人(2024)提出的 Drive Anywhere 框架利用冻结的视觉问答基础模型 BLIP-2,通过掩码注意机制为每一帧图像的每一个 patch 提取一个与语言空间对齐的独立描述符,然后训练一个轻量策略头。此举大幅提升了 OOD 泛化能力。然而,论文指出一个被忽视的问题:这些从 ViT 自注意力层中提取出的 patch 描述符并非局部独立表征——由于自注意力机制会全局混合信息,每个 token 已经在不同权重下包含了整个场景的信息,因此描述符之间高度冗余且强相关。PCA 分析显示 90% 的方差仅由 17/64 个主成分解释,跨 patch 皮尔森相关系数矩阵也展现出大面积的强相关,而余弦相似度叠加图则可视化出种子 patch 与远距离其它 patch 存在广泛语义纠缠(见论文第 4.1 节,图 3)。这种冗余对下游策略训练十分不利:它放大了特征空间的有效维度,促进策略去记忆训练数据中的虚假相关性而非学习真正稳健的视觉线索,最终损害 OOD 性能。

这一洞见驱动了本文的核心思想:既然冗余是致命的,那何不主动丢弃一部分 patch 描述符?通过随机地让策略看到场景的不同子集,使其无法依赖于特定 token 的存在,从而迫使策略提取对 token 存活具有不变性的稳定特征。这种思路与视觉 Transformer 中的随机 token 丢弃(如 MAE)有相似之处,但这里的目的不是自监督重建,而是直接提升闭环驾驶策略的泛化能力和效率。

核心方法和技术细节

1. 多模态 patch 描述符提取

首先复现 Drive Anywhere 的特征提取流程:对于输入图像 FF,使用冻结的 BLIP-2 视觉编码器,在其 Q-Former 的输入层应用掩码注意,为每个 patch jj 生成一个仅聚焦于该 patch 和其邻域上下文的描述符向量 F′(j)F'^{(j)}(具体掩码公式见第 3.1 节)。最终得到一个 H′×W′×DH' \times W' \times D 的张量,其中 H′,W′H',W' 为 patch 网格尺寸,DD 为特征维度。

2. 冗余的定量刻画

论文通过三个指标揭示冗余:

  • PCA 解释方差:将 N×DN \times D 的描述符矩阵进行主成分分析,累积解释方差函数 E(m)E(m) 快速饱和——17 个主成分就能保留 90% 的方差;若只保留 ℓ2\ell_2 范数最高的 128 个 patch,14 个主成分就达到同样水平,证明即使最有信息的 token 也携带大量重叠信息(图 3a)。
  • 跨 patch 相关性矩阵:皮尔森相关系数热力图展示出大范围的正负强相关(图 3b)。
  • 图像平面的余弦相似度叠加热力图:对任意种子 patch,其描述符与大量远距离 patch 的余弦相似度仍然很高,证明全局信息渗透入每个局部 token(图 3c,图 6 展示全网格叠加)。

3. 随机 Patch 选择(SPS)

SPS 的核心操作如下(第 3.3 节): 在每个时间步 tt,从 NN 个 patch 位置中均匀随机地选取恰好 k=⌈rate⋅N⌉k = \lceil \text{rate} \cdot N \rceil 个索引 Ωt\Omega_t,只对这些被选中的 patch 执行前述掩码注意特征提取,其余 patch 的描述符置为全零向量。然后保持原有 H′×W′H' \times W' 的空间网格不变,将稀疏张量 F~′\tilde{F}' 送入下游策略网络。这样每一帧图像呈现给策略的是一组随机、不完整但空间连贯的投影。由于零向量的位置在空间上自然保持,策略网络可以依靠其卷积或 Transformer 结构理解稀疏输入。

该方案的计算效率直接正比于保留率 rate\text{rate}。当 rate=0.5\text{rate}=0.5 时,基础模型的 Q-Former 前传时间节约近一半,整体推理时间约为原来的 1/2.41/2.4(2.43 倍加速,表 4)。

4. 消融变体

论文还探索了两种变体(第 3.4 节):

  • (v1) 阈值掩码:每个 patch 独立以概率 rate\text{rate} 选中,数量具有轻微波动,增加随机性。
  • (v2) 位置调整稀疏序列:直接将未选中的 token 彻底丢弃,只把被选中的描述符与它们原本的 ViT 位置编码一起组成变长的序列送入策略,进一步减少计算量。

5. 理论保证

论文借助矩阵采样理论证明:如果描述符矩阵 FcF_c 具有低秩以及有界的行相干性,则以 mm 个均匀随机采样行构成的子矩阵 SFcSF_c 能够高概率保持原行空间的 rr 维主成分子空间(引理 1,附录 A.4)。这意味着即使丢弃大量 patch,主要视觉语义信息仍然得到保留,因此策略仍能做出正确决策。

创新点和贡献

  1. 首次揭示并量化了多模态基础模型 patch 特征的冗余性,并提出冗余是 OOD 泛化的阻碍。该发现对于所有使用冻结 ViT 特征的下游任务具有普遍启示。
  2. 提出极其简单的 SPS 策略:无需修改基础模型,无需额外训练,仅靠推理时的随机 tokен丢弃,就同时带来泛化性和计算效率的双重提升。这较之依赖分割模型或区域池化的方案,既不引入外部模型,也保留了空间连续性和语言对齐能力。
  3. 大规模系统验证:在 CARLA/VISTA 模拟器中进行了涵盖场景、季节、天气、光照、动态物体共 14 个 OOD 场景的闭环评估,所有 9 个消融模型中 8 个均超越之前的 SOTA(表 1、2、5)。同时真实车辆零调参部署成功,展现了 Sim-to-Real 的潜力(第 4.6 节)。
  4. 可组合性:SPS 与 Drive Anywhere 的文本驱动数据增强完美兼容,通过大语言模型生成概念替换,在潜在空间中对齐特征,可获得额外 +1.7% 的 OOD 性能提升(表 3)。
  5. 交叉骨干通用性:用 DINO 骨干替换 BLIP-2 仍可获得平均 +3.3% 的增益,表明方法不局限于特定视觉语言模型。

实验结果分析

所有模拟实验均采用统一的训练环境——在乡村、夏季、干燥、日间、有车的配置下训练,并迁移到完全不同的场景组合评估 OOD 成功率(表 1)。与四种基线进行比较:

  • No-FM:不使用基础模型,直接从图像端到端训练 CNN,OOD 平均成功率仅 0.55。
  • Mask-based Features (MF):先分割再提取区域特征,由于分割模型可能遗漏区域,成功率仅 0.47。
  • Inherent ViT Features (I-ViT):直接从 ViT 中间层提取 token 级特征,OOD 成功率 0.83。
  • Drive Anywhere (DA):最先进的基模型 patch 对齐方法,OOD 成功率 0.84。

SPS-50%(保留 50% 的 patch)将平均成功率拉升至 0.90,比 DA 绝对提升 6%。在一些极具挑战性的场景,提升尤其显著:如在冬季雪天有动物环境,从 0.95 提升至 0.99;在夜间有动物场景,从 0.85 提升至 0.86(相对紧致),而在城区夜间有车场景从 0.78 提升至 0.87,增幅达 9 个百分点(具体见表 1)。在速度方面,SPS-50% 实现了 2.43 倍整体推理加速,其中 Q-Former 部分加速最明显(表 4)。加速与准确率的权衡图(图 1(4))表明,多个 SPS 变体以更低的相对运行时间(1/TFactor1/T_{\text{Factor}})换取了更高的闭环成功率,复合性能更优。

对于不同选择比例 rate\text{rate} 的消融实验(表 2,图 5),SPS 变体在 50% 时达到最优(+6.2%),而带有位置调整的 SPPS 在 70% 时最好(+5.5%),基于矩阵概率的 MSPPS 则在更激进的 30% 时性能最强(+5.5%)。这些结果表明随机性强度与信息保留量之间存在平衡,且不同输入编码方式有不同的最优工作点。

文本引导增强实验(第 4.4 节)展示了一个有趣的特性:在潜在空间中根据 LLM 建议替换部分 patch 描述符(例如把 “树” 换成 “房子”),对 SPS-50% 进行少量迭代微调,整体 OOD 成功率再提升 1.7%,证明 SPS 训练的策略仍能受益于语义级别的数据增强,且增强过程完全在文本-视觉共享空间内完成,无需图像生成。

真实车辆测试(第 4.6 节)进一步验证了模型的 sim-to-real 泛化能力:在乡村道路和地下停车场(无车道线、低光照、杂乱视觉)均成功完成车道跟随和静态障碍物避让,且未进行任何调参。这些结果强有力地证明了 SPS 所训练的策略已经学到了视觉不变性,而非对仿真器特有纹理的过拟合。

实践建议

对于希望将基础模型的视觉特征应用于机器人或自动驾驶决策任务的工程师和研究者,本文给出了几条可直接照搬的工程经验:

  1. 不要迷信全量 patch 特征。即便是强如 BLIP-2 的多模态 ViT 特征,也存在很高的冗余,将其直接堆叠送入策略网络不仅浪费计算,更可能损害泛化。在训练和推理阶段都应考虑对 token 进行稀疏化。
  2. 采用固定空间布局的随机丢弃是低成本的鲁棒性增强术。SPS 的实现只需在提取完选定 patch 的描述符后对未选区域置零,无需改变任何网络结构,完全即插即用。在自己的系统中,可以先通过 PCA 或相似度分析评估特征冗余程度,然后设定一个适中的初始丢弃率(如 50%),观察闭环性能变化。
  3. 保留空间位置编码至关重要。SPS 和 SPPS(彻底丢弃未选 token 但仍保留其位置编码)均获得了强结果,但后者在极低保留率下略微不稳定。建议优先采用将未选 token 归零的 SPS,因其实现了固定形状的输入,兼容大多数下游网络,并且空间线索完整。
  4. 利用文本驱动的潜在空间数据增强。SPS 与 Drive Anywhere 的文本条件编辑天然兼容,可以通过 LLM 生成场景概念替换对,在特征空间进行语义级别的 OOD 增强,进一步提升鲁棒性。这一步仅需数轮微调,成本极低。
  5. 备份不同的随机选择策略。根据对几个变体的消融,最优的 rate\text{rate} 和选择方式(固定数量 vs. 概率独立)与基础模型及下游架构有关,因此建议对 30%、50%、70% 三种保留率以及是否使用位置调整进行小规模网格搜索,找到给定系统的最甜点。

总的来说,这篇论文清晰传达了一个逆向思维:“少即是多”——有策略地让模型看到的少一些,反而开得更稳、更远。这种思路不仅适用于自动驾驶,也能启发其他使用大规模预训练视觉特征的具身智能任务。