具有隐式与显式几何的 3D 感知视觉语言模型

3D-Aware VLMs with Implicit and Explicit Geometries

arXiv: 2607.21595v1

论文信息

标题: 3D-Aware VLMs with Implicit and Explicit Geometries

作者: Wenhao Li, Xueying Jiang, Quanhao Qian, et al.

发布日期: 2026-07-23

arXiv ID: 2607.21595v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:现有基于 2D 视觉输入的视觉语言模型(VLM)在处理需要精细 3D 空间推理的任务时表现不足,主要因为仅依赖隐式 3D 表征只能获取粗略的全局场景布局,缺乏可解释的局部几何细节。
  • 核心方法:提出了 VLM-IE3D 框架,同时从 RGB 视频中提取 “隐式几何令牌(IGTs,编码高层场景先验)” 和 “显式几何令牌(EGTs,从重建的深度图、点云等属性中编码精细结构)”,并通过一个 3D 感知适配器将它们与 2D 视觉特征融合,注入强 3D 偏置。
  • 关键结果:在 3D 视频检测任务上,VLM-IE3D 的 F1@25 达到 42.8,比使用 2D 视觉输入的 VG LLM 提高 4.6 个点(见表 3),仅多引入 0.1B 参数、推理速度下降 1 FPS。
  • 主要局限:训练仍依赖 2D 视频数据,在需要厘米级精确定位的任务中仍比不上使用了真实 3D 点云输入的模型,且显式几何令牌的质量受限于采用的 3D 几何编码器的重建精度。
  • 适合读者:从事多模态大模型、3D 场景理解、空间推理以及机器人具身智能的研究者与工程师;对在有限数据条件下增强 VLM 的 3D 感知能力感兴趣的人。

论文背景和研究动机

视觉语言模型(VLM)在具身导航、视觉‑语言‑动作(VLA)和 3D 场景理解等领域展现出巨大的潜力。然而,大多数现有 VLM 仅从 2D 图像或视频学习,缺乏对真实三维空间关系的精确感知。近期工作尝试通过引入 “3D 几何编码器” 从视频序列中提取隐式 3D 表征,并注入 VLM 以增强其空间认知。这类隐式表征(如使用 DUSt3R、AnySplat 等输出)能够提供类似 “3D 认知地图” 的全局场景布局,但很难被语言模型解读为具体的距离、尺寸等定量几何属性,因此在需要精细定位的 3D 视觉接地、密集描述和空间推理任务中仍存在明显短板。

从认知科学的视角看,人类在理解空间时既会形成抽象的认知地图,又需要依赖具象的 “重建地图”(例如通过视觉深度估计获得的度量信息)。当前仅用隐式表征的 VLM 相当于只具备前者,而遗漏了后者。本文的核心动机就是弥补这一差距,让 VLM 既能享受隐式表征带来的泛化性,又能利用显式三维结构提供的可解释精细几何信息,从而在仅使用 2D 视频的条件下获得更强的 3D 场景理解能力。

核心方法和技术细节

VLM-IE3D 是一个统一的框架,直接以 RGB 视频序列和自然语言查询作为输入。其架构(图 2)包含三个并行的信息流:2D 视觉编码器提取视觉令牌 T2D\mathbf{T}_{2D};预训练的 3D 几何编码器(本文采用 AnySplat)一方面输出高层隐式表征作为隐式几何令牌 TI\mathbf{T}_I,另一方面通过其预测头得到深度图、相机位姿、3D 高斯点等显式三维属性;这些显式属性经过一个轻量级的显式嵌入模块(一层 patch 嵌入+两层 MLP)转换为显式几何令牌 TE\mathbf{T}_E。两种几何令牌在帧级别上一一对应,维度相同。

为了让隐式与显式几何信息有效融合,论文设计了 3D 感知适配器。首先,将 2D 令牌、IGTs 和 EGTs 分别按 Qwen2.5-VL 的合并策略进行空间压缩,由 nn 减少到 mm。接着,通过一个隐式‑显式注意力模块(IEA)对压缩后的 IGTs 和 EGTs 执行多头交叉注意力:以 IGTs 为查询,EGTs 为键和值,输出与 IGTs 相加,得到融合后的 3D 令牌 T~3Di=T~Ii+MCA(T~Ii,T~Ei,T~Ei)\tilde{\mathbf{T}}_{3D}^i = \tilde{\mathbf{T}}_I^i + \text{MCA}(\tilde{\mathbf{T}}_I^i, \tilde{\mathbf{T}}_E^i, \tilde{\mathbf{T}}_E^i)。最后,将融合后的 3D 令牌与压缩后的 2D 令牌逐元素相加,形成最终的 3D 感知视觉令牌 T3D\mathbf{T}_{3D},送入冻结的 VLM 骨干网络(Qwen2.5-VL-3B)参与文本预测。整个过程中 2D 视觉编码器和 3D 几何编码器均被冻结,只有 3D 显式嵌入、适配器和 VLM 骨干参与训练,参数量增加极少(仅 0.1B,见表 3)。

创新点和贡献

论文的贡献可以归纳为三方面:

  1. 双流 3D 几何表征的融合框架:首次将隐式和显式 3D 表征同时引入 VLM,使得模型在仅输入 2D 视频的条件下获得了相辅相成的几何信息——高层全局先验与局部可解释结构。这突破了先前工作仅依赖单一隐式表征的局限。
  2. 轻量化的显式几何嵌入设计:显式令牌通过极简的嵌入网络(仅 0.008B 参数)从重建的深度图/点云中提取,避免使用大型深度编码器(如 DepthAnything V2),既保持了效率,又防止抽象过度导致与 IGTs 功能重叠。消溶实验表明,复杂的深度编码器反而导致检测 F1 下降(表 8),突显了 “保持细节” 这一设计原则的重要性。
  3. 有效的 3D 感知适配器:提出的隐式‑显式交叉注意力融合策略在多种融合方式(拼接、相加、加权相加)中取得了最优的 3D 视频检测性能(F1@25 = 42.8,表 6),为多尺度几何特征的交互提供了新范式。

实验结果分析

VLM-IE3D 在 3D 稠密描述、3D 视觉接地和 3D 视频检测三个基础 3D 场景理解任务上全面超越了仅使用 2D 输入的现有方法,并在部分指标上接近甚至持平使用了 3D 场景输入的模型。在 Scan2Cap 数据集上,C@0.5 达到 80.4,优于 VG LLM 的 78.6 和 Video‑3D LLM 的 80.0(表 1)。在 ScanRefer 视觉接地上,无提案优化的 Acc@0.25 为 43.2%,比 VG LLM 高出 6.8 个点(表 2);结合提案匹配后 Acc@0.5 达到 48.9%,缩小了与需要真实 3D 输入的模型的差距。特别是在 3D 视频检测任务中,F1@25 为 42.8,相对于基线 Qwen2.5-VL‑3B 提升了 11.9,且参数仅增加 3.2%、推理速度仅下降 1 FPS(表 3)。在空间推理基准 VSI‑Bench 上,VLM-IE3D‑4B 以 47.6% 的平均准确率超越了包括 Gemini‑1.5‑Pro 在内的所有对比模型(表 4),在对象计数和相对距离等需要精细度量判断的子任务上优势尤为明显,说明显式表征真正弥补了隐式表征在量化空间理解上的不足。

消融实验(表 5‑表 9)系统性地验证了 IGTs 和 EGTs 的互补性、IEA 融合策略的有效性,以及不同显式属性(深度图、点云、3D 高斯)的通用性。值得注意,即使使用不同型号的几何编码器(VGGT、π³)或跨模型获取 IGTs 与 EGTs(AnySplat+DepthAnything V2),VLM-IE3D 仍保持稳健提升(表 9),展现出良好的泛化潜力。

实践建议

VLM-IE3D 提供了一种在有限计算资源下增强视觉语言模型 3D 感知能力的实用范式,尤其适用于以下场景:

  • 机器人视觉与导航:实际部署中往往只能获取单目或多视角 RGB 视频,难以配备高成本 3D 传感器。该框架可直接从视频流中提取隐式与显式几何令牌,使机器人在不依赖深度相机的情况下完成目标抓取点定位、空间关系推理等任务。部署时建议采用深度图作为 EGTs(参数少、获取容易),并使用冻结的几何编码器以保持效率;如需更高精度,可替换为更先进的几何编码器,无需重新设计整体框架。
  • AR/VR 内容理解:在混合现实中需要对场景进行实时 3D 目标检测与描述时,可将 VLM-IE3D 集成到现有视觉通道中,利用其输出的 3D 感知令牌提升定位精度。考虑到延迟,应尽量使用本文所示的轻量级显式嵌入(patch 嵌入+MLP),避免引入 Deep Encoder 导致性能下降。
  • 多模态训练数据受限时的策略:若某些领域缺乏配对的 3D 真实数据,可以利用大规模的 2D 视频数据,通过预训练的 3D 几何编码器自动生成 IGTs 和 EGTs 来增强预训练或微调。要特别关注显式属性的重建质量,必要时可结合多个几何编码器的输出进行融合(如表 9 所示,跨模型组合依然有效)。
  • 模型性能优化技巧:融合过程中应优先采用交叉注意力机制来对齐隐式与显式表征。对于 2D 与 3D 令牌的融合,简单的逐元素加和在实验中已足够有效,避免了额外参数和计算开销。此外,在显式嵌入中保留原始空间坐标信息(如点云坐标)比使用高阶特征更有利于保持局部几何细节,这一点在表 8 中 “Deep Encoder” 导致性能骤降的结果中得到了印证。

综上,VLM-IE3D 的核心经验在于 “隐式提供泛化、显式补充精度”,且两个模块在训练中保持解耦。这一设计思路可推广到其他需要融合结构化先验与可解释度量的多模态任务中。