IVGT:面向神经场景表示的隐式视觉几何 Transformer
IVGT: Implicit Visual Geometry Transformer for Neural Scene Representation
论文信息
标题: IVGT: Implicit Visual Geometry Transformer for Neural Scene Representation
作者: Yuqi Wu, Tianyu Hu, Wenzhao Zheng, et al.
发布日期: 2026-05-15
arXiv ID: 2605.16258v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:如何从无位姿的多视图图像中,一次性重建出连续一致的 3D 几何与外观,而无需依赖相机标定或逐场景优化。
- 核心方法:提出 IVGT,一种隐式视觉几何 Transformer,它将多视图特征融合为统一的全局神经场景表示,支持在任意三维空间位置查询符号距离函数(SDF)和颜色,进而通过可微分体渲染实现表面提取与新视图合成。
- 关键结果:在 ScanNet 网格重建任务中,IVGT 作为可泛化方法,其 Chamfer 距离达到 0.060,性能超过多数逐场景优化基线,且接近需要数小时优化的 MonoSDF(表 1)。
- 主要局限:渲染质量在高频细节上落后于 3DGS 等专用新视图合成方法;仅支持静态有界场景;每点查询需要投影到所有视图并聚合特征,推理计算量较大。
- 适合读者:从事 3D 视觉、神经渲染、多视图几何重建以及视觉基础模型研究的人员。
论文背景和研究动机
从多视图图像重建三维场景是计算机视觉的核心任务,广泛应用于机器人、自动驾驶等领域。传统方法依赖运动恢复结构(SfM)和多视图立体(MVS)等流程,后续再由 NeRF 或 3DGS 进行稠密重建,这些方法通常需要准确的相机位姿和耗时的逐场景优化。近年来,DUSt3R、VGGT、Point3R 等视觉几何基础模型兴起,它们通过端到端回归像素对齐的点图(explicit pointmap),直接在无位姿条件下实现粗几何估计,简化了管线。然而,这种显式表示是离散的,仅定义在像素位置,无法支持对任意三维点的连续查询,也难以提取光滑的连续表面。此外,同一物理点可能在多个视图中被重复预测而产生不一致。因此,如何在保留无位姿、快速推断优势的同时,获得真正连续、一致的几何表示,是一个尚未被充分探索的问题。
IVGT 正是在这一背景下提出,它将显式的点图重建范式转变为隐式神经场表示。模型一次性处理多张无位姿图像,输出一个全局的符号距离函数场,可在空间中任意位置查询几何和颜色信息,直接支持高保真网格提取和新视图渲染,弥合了视觉基础模型与神经隐式曲面建模之间的鸿沟。
核心方法和技术细节
IVGT 的输入是一组无位姿的多视图图像 ,输出包括每个像素的深度图 、相机参数 ,以及一个全局神经场景表示 ,后者可被查询以得到 SDF 值和视角相关的颜色。整体框架分为三个关键部分。
多视图特征聚合与全局表示 图像首先通过冻结的 DINOv2 编码为 token,然后送入一个多层 Transformer,该 Transformer 交替进行帧内自注意力和跨视图全局注意力,在不显式输入相机位姿的情况下隐式对齐多视图观测,同时预测出各视图的深度图和相对位姿(以第一帧为参考)。最终得到一组特征图 ,它们共享一个规范坐标系,构成了全局隐式表示的基础。
连续三维查询与射线深度编码 对于规范坐标系中的任意三维点 ,IVGT 将它投影到所有可观察视图中,并采样对应像素的特征,聚合得到 。为了避免同一投影射线上不同深度点共享相同特征而造成的歧义,IVGT 引入了射线深度编码:将点在每个视图中的射线深度 通过一个小型 MLP 编码,并聚合为 。作者特别指出,直接对三维绝对坐标做位置编码会因参考帧选择而变化,引入模糊性;而相对视图的射线深度是视角不变的,能够提供鲁棒的空间定位信息。消融实验(表 7)验证了这一设计的优越性,仅使用绝对坐标编码的变体性能远差于射线深度编码。
几何与外观解码及渲染 将融合后的空间特征 送入一个 8 层 MLP,输出该点的 SDF 值 和中间外观特征 。随后附加 SDF 的梯度(即表面法线 )和视角方向的位置编码,由 2 层 MLP 解码出颜色 。这使得几何与外观在统一框架下联合建模。
训练时,采用 VolSDF 的方式将 SDF 转换为密度,进行可微分体渲染,得到每条光线的颜色、深度和法线图。实际损失函数分两阶段设计:第一阶段仅使用 2D 监督(RGB、深度、法线及相机位姿损失)让模型建立粗略几何;第二阶段引入 SDF 的 Eikonal 正则项和表面法线光滑项,以强制学到有意义的隐式曲面。图 8 显示,第二阶段显著改善了表面光滑度。
推理时,网格提取通过 Marching Cubes 算法直接实现,无需额外的后处理或复杂融合。
创新点和贡献
- 从无位姿图像学习连续隐式几何:不同于之前所有视觉基础模型采用的显式点图输出,IVGT 首次在无位姿设定下学习了一个全局 SDF 场,解决了显式方法离散化、多视图冗余和不连续的问题(图 2、图 6)。
- 射线深度编码消除参考帧歧义:通过编码视角一致的射线深度,而非绝对三维坐标,保证了跨视图的空间一致性,是使隐式表示在无位姿条件下稳定工作的关键设计(见 3.2 节和表 7 消融)。
- 统一的多任务表示:IVGT 从同一 SDF 场中同时支持网格重建、点云重建、新视图合成、深度估计、法线估计和相机位姿估计,且所有输出均来自一次性前馈推理,无需逐场景优化。
- 大规模多数据集联合训练:模型在 9 个涵盖物体和场景、真实与合成的数据集上训练,展现了良好的跨域泛化能力。
实验结果分析
IVGT 在多项任务上进行了全面评估:
- 网格重建(ScanNet,表 1):IVGT 的 Chamfer 距离为 0.060,优于 COLMAP、Neus、VolSDF 等逐场景优化方法,仅次于使用了单目几何先验的 MonoSDF(0.042)。作为可泛化模型,IVGT 在推理时不需任何微调,效率远超需要数小时优化的 MonoSDF。图 4 和 5 显示其重建的网格几何完整、连贯。
- 点图重建(7-Scenes、NRGBD、DTU,表 2):IVGT 从图像特征直接解码出的深度得到的点图在多数指标上优于 Fast3R、CUT3R、Point3R 和 VGGT 等显式方法,表明隐式表示并未牺牲基本的点级精度。
- 相机位姿估计(表 3):在 ScanNet、Sintel 和 TUM-dynamics 上,IVGT 的 ATE 等指标与 VGGT、WorldMirror 持平甚至更优,证明其隐式场景表示中包含准确的相对位姿信息。
- 新视图合成(表 4,图 7):尽管 IVGT 的 PSNR 和 SSIM 通常低于 WorldMirror 等专用高斯泼溅方法,但依然能够从隐式 SDF 场中渲染出视觉上连贯的 RGB、深度和法线图,后者尤其展现了平滑的几何结构。LPIPS 明显偏高,说明高频纹理细节再现不足,这也是隐式表面类方法的固有限制。
- 深度与法线估计(表 5、表 6):直接解码的深度在单目和视频深度估计任务上优于 VGGT、CUT3R 等方法;渲染的深度略逊但仍有竞争力。法线估计的结果与 DSine 等专用方法接近,印证 SDF 场能够提供高质量几何线索。
总体而言,IVGT 在几何重建的一致性和连续性上展现了显著优势,同时维持了灵活的渲染和多任务能力,但也暴露了隐式表示在重建高频细节和计算效率方面的不足。
实践建议
IVGT 的理念和架构可以作为构建下一代统一视觉几何模型的基础。有鉴于此:
- 部署场景选择:由于模型仅需一次前馈推理即可输出可渲染的 SDF 场,特别适合需要快速获取完整三维场景(如室内导航、机器人抓取)且对表面平滑度要求高、对新视角细微纹理要求不极端的应用。对于追求写实渲染的应用,可将其输出的几何与 3DGS 或光场方法结合,由 IVGT 负责几何一致性,由外观专用网络增强细节。
- 训练数据与多任务扩展:IVGT 仅使用 RGB-D 和法线监督,已在多个数据集上训练。实践中可以继续引入室外无界数据、动态数据,并结合语义分割或实例分割等任务进行联合训练,以增强场景理解能力。
- 推理效率优化:目前的点查询聚合会遍历所有视图,限制了在低算力设备上的部署。可在推理时通过基于深度预测的筛选只保留可见视图,或采用稀疏采样策略减少查询点数量,甚至将隐式场通过网格蒸馏迁移到轻量级显式表示,以适配实时系统。这些都是有潜力的工程方向。