Re-Depth Anything:基于自监督重光照的测试时深度精化

Re-Depth Anything: Test-Time Depth Refinement via Self-Supervised Re-lighting

arXiv: 2512.17908v1

论文信息

标题: Re-Depth Anything: Test-Time Depth Refinement via Self-Supervised Re-lighting

作者: Ananta R. Bhattarai, Helge Rhodin

发布日期: 2025-12-19

arXiv ID: 2512.17908v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:如何在不依赖额外标注数据的情况下,提升基础深度估计模型(如 Depth Anything V2)在真实世界 “野生” 图像上的深度预测精度,弥补训练分布与测试分布之间的领域差距。

  • 核心方法:提出一种测试时自监督优化框架,通过一个可微的 “重打光” 模块,将预测深度图渲染成带有随机光照的增强图像,并利用预训练的 2D 扩散模型作为 “评分器”,判断渲染结果的真实感,从而将梯度回传以优化深度估计网络的部分参数。

  • 关键结果:在 KITTI 数据集上,该方法相较于基线模型 Depth Anything V2,在尺度不变对数误差(SI log)上实现了 8.51% 的相对降低,在所有九个评估指标上均取得了一致性提升(见论文表 1)。

  • 主要局限:方法偶尔会在平坦区域 “幻觉” 出不存在的边缘,或在天空等区域过度平滑掉精细结构;优化过程耗时较长,单次优化约需 80 秒,并通过多次运行取平均来稳定结果(见论文第 5 节及图 5)。

  • 适合读者:对单目深度估计、测试时自适应、3D 视觉与生成模型结合感兴趣的计算机视觉研究人员和工程师,尤其是那些希望利用基础模型和自监督学习增强几何推理能力的读者。

论文背景和研究动机

单目深度估计(Monocular Depth Estimation, MDE)旨在从单张彩色图像中预测稠密的逐像素深度,是计算机视觉中的一项基础但极具挑战性的任务。近年来,以 Depth Anything V2 (DA-V2) 为代表的基础模型通过在混合大规模数据集上训练,展现了强大的零样本泛化能力。然而,这些模型在面对与训练数据分布差异较大的 “野生”(in-the-wild)图像时,仍然会出现不准确的预测。例如,论文图 1 展示了一个案例,DA-V2 将一张老虎的脸预测得过于扁平,鼻子形状更像狗,这很可能源于训练数据中犬科动物图像的偏差。

传统的自监督学习方法通过光度重建(如利用神经辐射场 NeRF 或高斯泼溅进行新视角合成)来提供监督信号,但其存在计算量大、存在多义性,且性能通常不如监督模型。本文的核心洞察在于,不寻求完美的光度重建,而是利用一个更简单的 “重打光”(re-lighting)过程来生成增强图像,并引入 2D 扩散模型包含的强大视觉先验,来评判增强后图像的几何合理性。这种方法的目的是在保持监督模型强大几何先验的同时,利用生成模型的知识来微调细节,弥合领域差距。

核心方法和技术细节

Re-Depth Anything 的核心是一个在测试时运行的、无需标签的自监督优化框架。对于一个输入图像 I\mathbf{I},该方法从一个预训练的 DA-V2 模型给出的初始视差图开始,通过三个紧密耦合的组件进行迭代精化。

1. 可微的重打光增强模块 这是连接 3D 几何与 2D 图像的关键桥梁。首先,从预测的视差图 D^disp\mathbf{\hat{D}}_{\text{disp}} 和相机模型(默认为缩放正交投影)计算 3D 顶点和表面法线 N\mathbf{N}。由于 DA-V2 输出的是归一化的相对视差,论文通过一个需要优化的未知标量 bb 将其转换为可用于计算法线的深度。接着,该方法使用经典的 Blinn-Phong 光照模型,将输入图像本身的反色调映射(inverse-tonemapped)结果作为场景漫反射反照率的 “代理”,合成一个在随机光照条件下的重新照明图像 I^\mathbf{\hat{I}}。重要的是,这种方法不追求物理精确重建,而是作为一种数据增强手段。

2. 基于扩散模型的评分与损失函数 合成图像 I^\mathbf{\hat{I}} 的真实感由一个预训练的 2D 扩散模型(Stable Diffusion)通过分数蒸馏采样(Score Distillation Sampling, SDS)损失来评估。SDS 损失通过计算扩散模型对加噪图像 I^t\mathbf{\hat{I}}_t 预测的噪声与所加真实噪声之差,并将此梯度通过可微的渲染和深度估计管线回传。其目标是:如果深度图正确,那么施加在其上的随机光照应该看起来是自然的。最终的优化目标由 SDS 损失和一个鼓励表面平滑的视差梯度 L1 正则项组成。为了使 SDS 条件化,论文还使用 BLIP-2 模型为输入图像生成描述性文本提示。

3. 针对性的优化策略 这是方法成功的关键。直接优化整个 DA-V2 网络或像素级的深度图容易导致过拟合或陷入糟糕的局部最优。论文提出的解决方案是:冻结视觉 Transformer(ViT)编码器,仅联合优化其输出的中间特征嵌入 W\mathbf{W} 和 DPT 解码器的权重 θ\theta。这种策略保留了编码器中强大的几何先验,同时允许模型根据特定图像内容的 SDS 引导来调整最终的视差预测。最后,为了降低 SDS 损失随机性带来的高方差,该方法独立运行优化 10 次,并对得到的视差图取平均。

创新点和贡献

  1. 提出了重打光增强用于自监督深度精化:不同于传统基于光度重建的自监督方法,论文首次提出利用重打光来为单张图像的深度估计创造自监督信号。这巧妙地避开了复杂的光度重建问题,并通过随机化光照条件将歧义问题转化为一个 “判断光照是否自然” 的评估问题。

  2. 融合了监督先验与生成先验的优化范式:该方法并非从零开始优化一个 3D 形状,而是在一个强大的监督基础模型(DA-V2)之上,通过扩散模型提供的生成式 2D 先验进行 “测试时微调”。这代表了在不同类型预训练模型间迁移知识的一种新思路。

  3. 设计了有效的针对性优化方案:发现并验证了仅优化编码器嵌入和 DPT 解码器权重是避免优化崩溃、保持几何结构的有效策略。消融实验(见论文表 2 和图 4)清晰地表明,直接优化深度图会产生噪声伪影,而微调整个网络则会导致几何结构坍塌。

实验结果分析

论文在涵盖单物体(CO3D)、室外驾驶(KITTI)和室内外场景(ETH3D)的三个标准数据集上进行了定量与定性评估。

定量结果十分稳健。如表 1 所示,Re-Depth Anything 在全部九个评估指标上一致超越了 DA-V2 基线,这包括误差指标的降低和准确率指标的提升。最显著的提升体现在 KITTI 数据集上,所有误差指标的相对降低均在 4.29% 到 15.3% 之间。在 ETH3D 上,AbsRel 误差相对降低了 8.30%。即便在初始精度极高的 CO3D 数据集上,该方法也带来了微小的全面改善。这种跨数据集的一致性验证了方法的鲁棒性和泛化能力。

定性结果(如图 3 所示)进一步揭示了改进的本质。该方法擅长在原本平坦或有噪声的区域恢复出精细的几何细节,例如球体上的线脚、阳台栏杆等,同时也能有效去除 DA-V2 在平坦墙面上产生的噪声预测。

消融研究为设计选择提供了有力的辩护。缺乏 SDS 损失的优化性能骤降,证明了扩散模型先验的核心作用(表 2 “w/o LSDS\mathcal{L}_{\text{SDS}}”)。直接优化深度张量或进行完整模型微调的变体,在性能和稳定性上均远不如所提出的针对性策略,并且产生了肉眼可见的伪影和崩塌(图 4)。此外,对优化结果进行集成能有效提升性能,3 次集成的增益最大,此后收益迅速饱和(图 6)。

综上所述,论文以清晰的逻辑和严谨的实验,证明了通过 “重打光” 这一新颖的自监督信号,可以有效利用生成模型来精化基础深度估计模型,为单目深度估计的测试时自适应提供了一条充满潜力的新路径。

实践建议

对于希望将此项技术应用于相关领域的从业者,以下建议可能具有参考价值。

  1. 作为后处理精化工具:可直接将 Re-Depth Anything 框架视为一个即插即用的后处理模块,应用于任何基于 DA-V2 的深度估计流程中。对于需要高精度细节的应用,如单张图像的 3D 建模或机器人抓取,付出约 80 秒(单次运行)的计算成本来换取细节和准确性的提升是合理的。考虑到论文已证明了其跨数据集的鲁棒性,对于 DA-V2 预测不佳的、训练数据覆盖不足的特定场景,该方法可能尤其有效。

  2. 优化策略的应用:论文中的 “针对性优化” 思想极具通用价值。当对任何基于 ViT 编码器-解码器架构的预训练模型进行微调,尤其是在数据稀缺(本工作中甚至为零样本)的情况下,优先考虑冻结编码器、仅微调解码器及其输入嵌入的策略,是防止灾难性遗忘和过拟合的稳妥起点。这一实践原则可以借鉴到分割、法线估计等其他密集预测任务中。

  3. 关于光照模块的设计:论文证明,一个简化但可微的物理光照模型(如 Blinn-Phong)足以与生成模型结合,提供有效的几何监督,而无需追求复杂的光度真实感渲染。在实践中,这意味着开发类似系统时,应优先关注监督信号的提供方式(如 SDS 损失)和优化的稳健性,而非渲染器的物理准确性。可以从简单的渲染模型入手,快速验证想法。