具有隐式与显式几何的 3D 感知视觉语言模型

arXiv: 2607.21595v1

论文信息

标题: 3D-Aware VLMs with Implicit and Explicit Geometries

作者: Wenhao Li, Xueying Jiang, Quanhao Qian, et al.

发布日期: 2026-07-23

arXiv ID: 2607.21595v1

PDF 链接: 下载 PDF

论文背景与研究动机

视觉语言模型(VLMs)近年来在空间理解与推理任务中展现了巨大潜力,但其在精细化的三维场景理解方面仍面临严峻挑战。现有模型大多从二维图片或视频中提取特征,缺乏对三维几何结构的显式感知,导致在物体定位、空间关系判断等任务中表现不佳。一种直观的解决思路是直接引入深度图、点云等三维数据,但这依赖于昂贵的专用传感器,严重限制了 VLM 在真实场景中的可部署性。

近期研究中,部分工作尝试利用三维几何编码器从 RGB 视频中学习隐式的三维表征,为 VLM 注入全局空间先验。这些隐式表征类似于人类大脑中的 “三维认知地图”,能够捕捉场景的粗略布局和物体间的大致关系,却难以提供精确的量化几何信息。这类似于人类仅凭记忆回忆房间结构时,很难准确说出沙发与电视之间的实际距离。这种粗粒度的空间认知难以满足高精度定位和细粒度推理的需求。

论文《3D-Aware VLMs with Implicit and Explicit Geometries》正是针对这一局限提出创新方案。作者观察到,机器人系统往往依赖显示的三维重建地图(如点云、深度图)来完成精确导航与操作,这种 “三维重建地图” 提供了结构清晰、可直接解读的几何信息。然而在纯 RGB 输入的 VLM 框架中,这一优势未能得到利用。因此,论文的目标是弥合这种差距,让 VLM 同时拥有隐式的全局空间感知能力与显式的精细几何结构信息,从而在不依赖专用三维传感器的情况下,实现全方位的三维场景理解。

核心方法:隐式与显式几何协同框架 VLM-IE3D

VLM-IE3D 的整体架构包含三条并行的特征流。给定一段 RGB 视频序列 {Ii}i=1f\{I^i\}_{i=1}^f 和自然语言查询 QQ,系统首先通过二维视觉编码器提取视觉令牌 T2DRf×n×cT_{2D}\in\mathbb{R}^{f\times n\times c}。视频序列同时被送入三维几何编码器,用于生成两种互补的三维几何令牌,并通过三维感知适配器有机融合,最终由预训练的 VLM 骨干生成回答。

隐式几何令牌(IGTs)

隐式几何令牌源自三维几何编码器的融合解码器输出。论文选用了 AnySplat 作为三维几何编码器,该编码器由图像编码器、融合解码器和任务预测头组成。融合解码器在帧间和全局层面交替进行自注意力计算,输出蕴含高层空间先验的隐式表征 TIRf×n×cT_I\in\mathbb{R}^{f\times n\times c}。IGTs 编码了场景的全局布局信息(如卧室的典型结构)以及物体间的空间关系(如 “电视挂在墙上,沙发位于电视前方”)。这种隐式令牌使模型能够快速泛化到不同场景的三维结构建模中,无需显式三维输入。

显式几何令牌(EGTs)

为弥补隐式表征在细节几何信息上的不足,论文引入了显式几何令牌。具体而言,三维几何编码器的预测头会重建出深度图、相机位姿以及三维高斯溅射等显式三维属性。深度图通过相机位姿反投影生成点云。这些明确定义的三维属性 XERf×h×w×cX_E\in\mathbb{R}^{f\times h\times w\times c'} 随后通过一个轻量级的三维显式嵌入模块转化为显式几何令牌 TERf×n×cT_E\in\mathbb{R}^{f\times n\times c}。该嵌入模块仅包含一层补丁嵌入(patch embedding)和两层 MLP,避免了深层网络带来的抽象化倾向,从而保留空间坐标的直接映射关系。EGTs 作为显式三维结构数据的潜在表示,提供了具体的空间量化测量,能够为 VLM 提供精确的位置信息,用于提升量化理解与推理能力。

三维感知适配器(3D-Aware Adapter)

为有效融合三类令牌(二维视觉令牌、IGTs、EGTs),论文设计了一个三维感知适配器。首先,各类令牌按照 Qwen2.5-VL 的空间合并策略,将空间相邻的 2×22\times2 特征拼接并经过两层 MLP 压缩,得到 {T~2D,T~I,T~E}Rf×m×c\{\tilde{T}_{2D},\tilde{T}_I,\tilde{T}_E\}\in\mathbb{R}^{f\times m\times c}。随后,引入隐式-显式注意力(IEA)模块,通过多头交叉注意力实现 IGTs 和 EGTs 的动态融合。对于每一帧 ii,以压缩后的 IGTs T~Ii\tilde{T}_I^i 作为查询,EGTs T~Ei\tilde{T}_E^i 作为键和值,执行交叉注意力并加上残差连接:

T~3Di=T~Ii+MCA(T~Ii,T~Ei,T~Ei)\tilde{T}_{3D}^i = \tilde{T}_I^i + \operatorname{MCA}(\tilde{T}_I^i, \tilde{T}_E^i, \tilde{T}_E^i)

融合后的三维令牌 T~3D\tilde{T}_{3D} 与压缩二维视觉令牌 T~2D\tilde{T}_{2D} 通过逐元素相加进一步融合,得到最终的三维感知视觉令牌 T3D=T~2D+T~3DT_{3D} = \tilde{T}_{2D} + \tilde{T}_{3D}。这一适配器使模型能够协同利用隐式和显式三维空间关系,同时保留二维视觉语义。

创新点与贡献

论文的核心创新在于首次将隐式与显式三维几何表征统一融入 VLM 框架,形成互补增强的三维空间感知能力。具体贡献包括:

  • 双几何令牌机制:提出 IGTs 和 EGTs,分别捕获全局场景先验和局部精细结构,解决了单一隐式表征在定量空间推理上的不足。
  • 轻量级显式几何嵌入:仅使用极简的嵌入模块处理深度图等显式属性,避免深层网络抽象化,确保几何细节的准确传递。
  • 适配器融合设计:通过 IEA 模块实现两种几何信息的动态对齐,提升融合效率。
  • 纯 RGB 输入下的强三维能力:无需额外三维传感器数据,仅从视频中学习到具有强三维归纳偏置的视觉表征,大幅提升了 VLM 在多种三维任务上的表现。

实验结果深入分析

实验覆盖了三维场景理解与空间推理两大领域,全面验证了 VLM-IE3D 的有效性。

三维场景理解任务

在三维密集字幕生成(Scan2Cap)上,VLM-IE3D 以 80.4 的 C@0.5 得分超越了所有只依赖二维输入的方法,且与使用三维场景输入的最佳方法相比也极具竞争力。在三维视觉定位(ScanRefer)任务中,VLM-IE3D 在 IoU 阈值 0.25 和 0.5 下分别达到 43.2% 和 16.9% 的准确率,显著优于纯二维输入的基线模型。结合预检测提案进行优化后,准确率进一步提升至 55.4% 和 48.9%,缩小了与直接使用三维输入方法的差距。在三维视频物体检测(EmbodiedScan 子集)中,VLM-IE3D 取得了 42.8 的 F125_{25},较基线提升 11.9,较仅含 IGTs 的变体提升 2.3。这些结果表明,引入 EGTs 能有效弥补隐式表征在精细定位上的不足,二者联合能带来稳定的性能增益。

空间推理能力

在 VSI-Bench 基准上,VLM-IE3D 以 47.6% 的平均得分超越了包括 GPT-4o、Gemini-1.5-Pro 在内的多个闭源模型,以及参数量远大于自身的开源模型(如 LLaVA-NeXT-Video-72B)。尤其在物体计数(67.5%)和相对距离判断(47.7%)等需要精确几何感知的子任务上,较隐式基线取得了显著提升。这直接印证了显式几何令牌在提供量化空间信息方面的独特价值。

消融实验与设计考量

消融实验进一步揭示了各组件的贡献:单独使用 EGTs 或 IGTs 均能提升性能,其中 IGTs 收益更大(F125_{25} 从 30.9 到 40.5),但两者结合时效果最佳(42.8)。融合策略中,IEA 模块优于简单的拼接或相加。显式三维属性的选择上,深度图、点云与高斯溅射均带来相近提升,考虑效率后深度图成为首选。三维显式嵌入模块的轻量设计至关重要,使用深度编码器如 DepthAnything V2 反而导致性能下降,原因在于深层网络过度抽象化特征,与 IGTs 产生冗余。此外,VLM-IE3D 框架对不同三维几何编码器(AnySplat、VGGT、π3\pi^3)表现出良好的泛化能力,且即使 IGTs 和 EGTs 来自不同编码器仍能有效工作,展现了高度的灵活性。

实践应用建议与未来发展方向

VLM-IE3D 的设计理念为三维视觉语言模型的实际部署提供了明确指引。对于量化交易领域,尽管论文并未直接涉及,但该框架对时空数据的精细感知能力可启发多模态市场分析模型,例如融合历史价格走势(视频流)与订单簿深度(深度图)等信息,增强模式识别和预测的准确性。更直接的应用场景包括具身智能(机器人导航与操作)、增强现实、自动驾驶等领域,在这些场景中,对三维环境的细粒度理解至关重要。

未来研究可沿以下几个方向展开:

  • 动态场景与长序列建模:当前模型处理固定长度且较短序列,未来可探索对更长视频和动态场景的连续感知,进一步提升时态连贯性。
  • 多视角融合与记忆机制:结合多视角图像或视频构建全局一致的三维地图,并引入记忆网络以支持长期交互。
  • 与大型语言模型的更深集成:将三维感知能力直接嵌入 LLM 预训练过程,减少适配器参数,提升推理效率。
  • 量化交易领域的创新应用:借鉴本框架的几何令牌机制,可设计 “时间-订单隐式令牌” 和 “价格深度显式令牌”,通过交叉注意力学习市场微观结构,辅助高频决策。

总结与展望

VLM-IE3D 通过巧妙地结合隐式与显式三维几何表征,为纯 RGB 输入下的视觉语言模型注入了强大的三维空间推理能力。其互补令牌设计和轻量适配器在多个三维理解基准上取得了领先性能,证明了无需昂贵三维传感器即可实现精细化场景理解。这一工作不仅推动了三维视觉语言模型的发展,也为多模态感知在具身智能、空间推理乃至量化金融等交叉领域的应用开辟了新思路。随着三维几何编码器技术的持续进步,该框架将能无缝吸收更精准的几何先验,进一步拓宽 VLM 在复杂真实世界任务中的边界。