DVGT:驾驶视觉几何 Transformer

DVGT: Driving Visual Geometry Transformer

arXiv: 2512.16919v1

论文信息

标题: DVGT: Driving Visual Geometry Transformer

作者: Sicheng Zuo, Zixun Xie, Wenzhao Zheng, et al.

发布日期: 2025-12-18

arXiv ID: 2512.16919v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:这篇论文要解决自动驾驶中缺乏一个能适应不同场景和相机配置的专用稠密几何感知模型的问题。
  • 核心方法:提出了 DVGT,一个端到端模型,从无位姿多视角图像序列直接预测度量尺度的全局 3D 点云图和自车位姿,采用 “无 3D 先验” 设计和因子化的时空注意力机制。
  • 关键结果:DVGT 在五个主流驾驶数据集上显著优于现有通用和专用模型,无需任何后处理对齐(见表 1、表 2、图 2)。
  • 主要局限:论文指出在 Waymo 数据集上性能相对不那么有竞争力,并将其归因于训练时的数据采样权重不均衡(见第 4.1 节)。
  • 适合读者:对自动驾驶感知、3D 视觉重建、通用视觉模型以及多传感器数据融合感兴趣的工程师和研究者。

论文背景和研究动机

视觉为中心的自动驾驶因其低成本和人眼般的感知能力而备受关注。其基础是精准地从视觉输入中感知三维场景几何。然而,主流方法存在明显痛点。

一方面,大多数现有工作专注于单帧深度预测或 3D 占用率预测。这些方法普遍依赖已知的相机内外参,通过显式的 2D 到 3D 投影来获取几何信息。这种设计将模型与特定的传感器配置紧密耦合,极大限制了模型在不同车型和场景下的泛化能力。此外,它们通常需要真实的位姿信息进行时序融合才能实现全局 3D 理解,难以做到端到端地输出全局几何。

另一方面,尽管 DUSt3R、VGGT 等通用视觉几何模型在三维重建上表现出色,但它们并非为自动驾驶量身定制。这些模型通常只能恢复相对尺度的几何,需要借助激光雷达等外部传感器进行后处理对齐才能获得度量尺度。同时,它们将多帧多视图无差别对待,没有充分利用自动驾驶场景中固有的时空结构,计算开销巨大,难以满足实时性要求。

针对以上缺口,DVGT 的核心动机是:设计一个专为驾驶场景打造的通用视觉几何模型,它能够摆脱对相机先验和外部传感器的依赖,直接从大量、多样的图像序列中端到端地学习并预测出度量精度的、连续的全局 3D 点云图。

核心方法和技术细节

DVGT 的核心任务可被形式化为 “以自车为中心的 3D 点云图重建”。给定一段包含 TT 帧、每帧 NN 个视角的无位姿图像序列 I\mathcal{I},模型 M\mathcal{M} 需要联合预测两样东西:一是所有图像的 3D 点云图 P\mathcal{P},所有点坐标均统一表达在第一帧的自车坐标系下;二是每一帧相对于第一帧的自车位姿序列 Tego\mathcal{T}_{\text{ego}}。

1. 总体框架

DVGT 由三个主要组件构成:图像编码器 E\mathcal{E}、几何变换器 F\mathcal{F} 和预测头 H\mathcal{H}。

  • 图像编码器:采用预训练的视觉基础模型(DINOv3)为每张图像提取视觉 Token。
  • 几何变换器:这是模型的核心,由 LL 层级联模块组成,每层依次执行三种因子化的注意力操作,以高效捕获多帧多视图之间的几何关联。
  • 预测头:包含两个独立的头部。点云头负责解码图像 Token,生成每个像素点的度量尺度 3D 坐标;位姿头则汇总同一帧内所有视角的 “自车 Token”,回归出该帧的自车位姿。

2. 时空因子化注意力机制

这是 DVGT 与 VGGT 等使用全量注意力的模型相比,实现效率和性能平衡的关键。全量注意力让所有图像 Token 两两交互,计算复杂度随图像数量平方级增长,在同时处理多帧多视图时变得不可行。

DVGT 利用驾驶场景中强大的时空结构,将计算密集的全量注意力分解为三步连续的、针对性的操作(见图 4):

  • 视图内局部注意力:仅在单张图像内部进行,精炼局部特征,如纹理和边缘。
  • 跨视图空间注意力:在同一帧的不同视角间进行,融合空间信息,理解 360 度环绕场景的静态结构。
  • 跨帧时序注意力:在同一视角的不同帧间进行,捕捉时间维度上的动态物体运动和一致的静态背景。

这种分解方式将计算复杂度从平方级降低,极大提升了推理速度,同时保留了有效的时空信息融合。实验显示,结合时序位置编码后,该方法的性能已非常接近全量注意力方案,但推理速度更快(见表 6)。

3. 无 3D 先验的设计

一个根本性的创新是模型结构完全独立于相机参数。传统方法依赖相机内外参进行 2D 到 3D 的特征投影,这构成了模型泛化的核心瓶颈。DVGT 没有任何空间归纳偏置,不包含显式的 2D-to-3D 投影模块。它纯粹以数据驱动的方式,从图像特征中学习推断 3D 几何。这使其能灵活适应任意相机配置。

4. 训练策略与数据构造

为解决自动驾驶中稠密真值缺失的难题,论文提出了一套鲁棒的伪标签生成和过滤流水线。它利用通用单目深度模型 MoGe-2 生成稠密深度图,并与稀疏的 LiDAR 点云投影对齐,获得度量尺度的 3D 点。关键在于,论文识别并过滤了五种导致伪标签失效的模式,如语义错判、运动伪影、对齐病态等,通过设定多种阈值来保障伪标签质量(见第 3.3 节)。最终,论文聚合了 nuScenes、Waymo、KITTI 等五个数据集,形成了一个大规模、多样化的训练数据。

创新点和贡献

  1. 首个面向驾驶的通用稠密视觉几何模型:DVGT 是首个能从无位姿序列图像中,直接端到端输出度量尺度、自车坐标系下全局 3D 点云的模型。这填补了通用几何模型与驾驶专用占用率/深度预测模型之间的空白。
  2. 先验解耦的时空架构:通过 3D 先验无关的设计和因子化的注意力机制,DVGT 在结构上与相机配置解耦,能够统一处理来自不同车辆、不同数据集的数据,展现了极强的可扩展性,并为大规模统一训练铺平了道路。
  3. 高质量的驾驶几何伪标签数据集:论文提出并验证了一套系统性的伪标签清洗流程,有效地从多源数据中生成高质量稠密 3D 真值,这本身就是对学术界的贡献。
  4. 全面的性能验证与效率优势:DVGT 在 5 个数据集上的 3D 重建和深度估计任务中,不仅精度大幅超越 MapAnything 等可直接预测尺度的模型(例如在 OpenScene 上,DVGT 的点云完整性误差为 0.481,而 MapAnything 为 4.303),甚至优于需要后对齐的 VGGT 等方法。同时,它的推理速度比同类模型快(处理 128 张图像约 4 秒),展示了较高的综合性能(见表 1、表 2)。

实验结果分析

实验部分提供了详尽的定量和定性对比,支撑起论文的核心主张。

与通用模型和驾驶专用模型的对比:在 3D 点云重建和射线深度评估中(表 1、表 2),DVGT 在大多数数据集上取得了最佳性能。一个关键区别在于,DVGT 无需像 VGGT、CUT3R 那样用 Umeyama 算法进行后处理尺度对齐。与同样直接预测尺度的 MapAnything 相比,DVGT 的精度有巨大优势。在与 Driv3R 等驾驶专用或 BEV 感知模型的深度估计对比中,DVGT 同样表现最优,且在 nuScenes 上,其 AbsRel 达到了 0.13(见表 4)。

自车位姿估计:DVGT 还能准确地估计自车位姿,在 OpenScene 和 DDAD 上取得了最佳 AUC@30 分数,在其他数据集上与专门的 VGGT 等模型表现相当(见表 3)。这表明 DVGT 是一个全面的视觉几何基础模型。

消融实验:论文分析了场景尺度归一化策略和注意力机制设计的影响。实验表明,将 3D 坐标线性缩放 10 倍是平衡远近几何预测精度的最佳方案(表 5)。在注意力机制上,因子化设计加上时序位置编码,在性能接近计算昂贵的全量注意力的同时,推理时间减半,实现了很好的性能与效率权衡(表 6)。

定性分析:可视化结果(图 6、图 7)直观展示了 DVGT 对静态道路、建筑和动态行人、车辆的高保真度和多帧一致的重建能力,同时保留了树木等精细结构,而对比方法 VGGT 则在处理树木、车辆时出现了更明显的几何形变。

实践建议

DVGT 的技术方案和模型特性为工程落地提供了清晰指引:

  1. 部署灵活性:由于 DVGT 不依赖相机内外参,开发者在集成到不同的自动驾驶平台上时,无需针对特定车型的相机配置重新设计或大幅调整模型结构。模型可以作为通用模块直接部署,只需微调或直接推理,极大降低了异构平台的迁移成本。
  2. 端到端开发流水线:DVGT 能在单个前向传播中直接输出带尺度的 3D 点云图,这省去了传统流程中对 LiDAR 数据进行耗时的多帧点云拼接、地图构建和后处理尺度对齐步骤。下游任务(如预测、规划)可以直接消费这个统一的 3D 表示,为构建更简洁、高效的全视觉端到端系统提供了新的基础模块。
  3. 数据驱动的规模化路径:论文证明了通过设计一套鲁棒的伪标签生成与过滤流程,我们可以有效利用海量的、不同来源的驾驶数据来训练一个统一模型。工程团队可以借鉴这种方法,持续利用新增的未标注驾驶数据来迭代模型,形成数据飞轮,持续提升模型在各类困难场景下的泛化能力。
  4. 效率优化方向:虽然 DVGT 已具备相对较快的推理速度(4 秒处理 128 张图),但仍不满足实时性要求。基于其因子化注意力设计,一个潜在的优化方向是对时空 Transformer 模块进行工程加速,例如将其中的注意力操作替换为针对特定硬件优化的算子,探索更轻量的编码器或更激进的 Token 剪枝策略,以逼近在线推理的时延要求。