用于解决线性逆问题的精确后验分数估计
Exact Posterior Score Estimation for Solving Linear Inverse Problems
论文信息
标题: Exact Posterior Score Estimation for Solving Linear Inverse Problems
作者: Abbas Mammadov, Ozgur Kara, Kaan Oktay, et al.
发布日期: 2026-06-15
arXiv ID: 2606.17048v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:如何利用预训练扩散/流模型的强数据先验,在线性高斯逆问题(修复、超分、去模糊等)中精确采样后验样本,而不是依赖近似的测量匹配修正。
- 核心方法:将后验分数推导为在测量依赖的 “后验枢轴” 和算符相关的各向异性噪声协方差 下的去噪问题,并直接训练一个去噪器 来拟合 ,保持与标准预训练相同的输入输出结构。
- 关键结果:EPS 在 FFHQ 与 ImageNet 的五个线性逆问题上,以仅 20 次去噪器评估(NFE) 就达到了点保真度、感知质量和分布校准指标的最好或次好水平,远低于梯度基后验采样器的 100–250 NFE(表 1、图 3)。
- 主要局限:推导假定线性前向算子和高斯观测噪声,对非线性算子需线性化或特殊训练;应用于潜在扩散模型时,像素空间的线性算子经过解码器会变成潜在空间的非线性变换。
- 适合读者:从事扩散模型、计算成像、医学图像重建、贝叶斯逆问题的研究者,以及需要高效且校准良好的后验采样的工程师。
论文背景和研究动机
线性逆问题(压缩感知、加速 MRI、超分辨率、去模糊等)通常需要从带噪声的测量 中恢复未知信号 。由于 往往是秩亏或病态的,许多信号与同一观测相容,因此目标不是点估计,而是从后验 中采样。扩散模型和流模型通过学习一条从噪声到干净样本的去噪轨迹,为这一问题提供了强大的数据先验。然而,反向采样需要的是后验分数 ,而预训练给出的只是无条件分数。
现有方法分两类:免训练方法(如 DPS、DDNM、ΠGDM)通过在每个去噪步骤添加一个测量匹配修正来近似后验,但这些修正本质上是将无条件去噪器在当前状态 下查询,而不是按照精确后验在 “枢轴” 处查询,从而引入了偏差;训练基方法(如 Palette、条件扩散、桥方法)直接训练一个以测量 为输入的条件模型,但网络需要端到端学习算符依赖,无法利用预训练去噪器的结构。本文的贡献在于:推导出线性高斯逆问题的精确后验分数闭式,进而设计出一种既保持预训练输入/输出结构,又能将后验采样完全还原为去噪任务的方法 EPS。
核心方法和技术细节
论文的关键观察是:对于插值 和线性高斯观测模型 ,后验边缘 可通过高斯乘积(completing the square)写成一个新高斯噪声下的数据密度(定理 1):
其中
这里 被称为后验枢轴,它是当前状态 和测量 的高斯贝叶斯融合, 则是相应的后验协方差,在 的零空间方向保留大方差,在观测方向上收缩。 是对该各向异性噪声的最优去噪器。换言之,后验采样就是在一个由测量决定的输入 下进行去噪,但噪声不再是各向同性的 ,而是算符依赖的 。
由此,论文定义 EPS 训练目标:
这一目标在结构上与标准扩散预训练完全相同(干净目标 ,均方误差),唯一变化是网络输入从 换成了 ,并附加了观测 作为条件。根据命题 3, 的分布恰好是 ,因此训练时无需显式采样各向异性噪声,只需通过枢轴构造即可获得所需噪声。训练后,EPS 直接使用底层骨干(如 EDM)的原有采样器,每个采样步只需计算一次 的前向运算(对常见算子仅为逐元素、池化或 FFT 求解,开销远小于去噪器),无需计算似然梯度或投影。在高噪声极限(), 收敛到 加上 零空间上的纯噪声,一次去噪器调用即近似后验均值(观察 4),这也是表 1 中 NFE=1 的 EPS 能获得高 PSNR 的原因。
论文进一步指出,现有免训练方法(如 DPS、ΠGDM 等)的近似误差本质在于:它们用无条件去噪器在 处的查询近似 ,而未在正确的输入 下考虑各向异性噪声 。因为测量匹配分数(式 14)恰等于两个去噪器之差:后验去噪器在 的估计减去无条件去噪器在 的估计;免训练方法忽略了这一差异,EPS 通过训练直接学习了后项。
创新点和贡献
- 闭式后验分数与几何解释:首次明确给出一般高斯插值下线性高斯逆问题的精确后验分数,并用 “枢轴 + 各向异性噪声” 统一理解后验去噪的查询几何。
- 保留预训练结构的训练范式:EPS 训练目标与标准去噪预训练同构,因此可以从预训练检查点高效微调(Appendix D.3 显示 EPS 收敛速度远快于同等条件的 Palette),甚至随机初始化后训练。
- 无梯度的采样器:采样过程不需要任何测量损失函数的梯度、投影或内层优化,只要完成对 一次线性求解(开销相对于去噪器一前向可忽略,附录 D.12 测量为 <1 ms)。因此 EPS 能复用底层模型的所有采样技巧。
- 极低 NFE 下高性能:实验表明,EPS 在约 20 NFE 时各项指标即平坦(图 3、5、6),而免训练的 DPS、ΠGDM 等 100 NFE 仍不能达到同一水平,训练基 Palette 也需更多计算才能持平,这使 EPS 成为低采样预算下的高效选择。
实验结果分析
论文在 FFHQ‑64 和 ImageNet‑64 上评估了五种任务:随机修复(70% 缺失)、方块修复、4× 超分辨率、高斯去模糊和运动去模糊,所有实验均添加 的观测噪声。指标涵盖 PSNR、SSIM、LPIPS、FID 以及分布校准的 CRPS 和 MMD(像素空间和 Inception 特征空间)。
表 1 与表 6 显示,在 ImageNet 和 FFHQ 上,EPS(100 NFE 和 20 NFE)在几乎所有指标上位列第一或第二,在随机修复和超分辨率这类秩亏严重的任务上优势更明显。例如,ImageNet 随机修复中 EPS‑20 获得 PSNR 24.87、FID 77.06,显著优于 ΠGDM 的 23.95 / 99.60 和 Palette 的 24.09 / 81.88(表 1)。图 3 展示的采样步数敏感性表明,EPS 很快收敛,而 DPS、DAPS、DDNM、ΠGDM 等即使加到 100 NFE 仍追不上 EPS 的渐近水平。100 NFE 的 Palette 与 EPS 的对比尤其说明:仅仅将 替换为 并微调就带来了持续的提升(附录 D.1 输入配置消融表明,从 Palette 到 EPS 的升级是单调收益)。此外,NFE=1 的单步后验均值估计(Tweedie 调用)得到了最高 PSNR/SSIM,但损失了感知与分布指标,这符合感知-失真权衡。
定性结果(图 2、7、8)显示,EPS 在修复和去模糊任务中能恢复清晰的纹理与边缘,同时保持与观测一致性;而免训练基线在未观测区域常出现过度平滑或伪影。在 95% 极端掩码和 16× 超分辨率的额外实验中(表 7、图 9),EPS 仍然在感知与分布指标上大幅领先,且能生成语义上多样但都符合观测的后验样本,证明了 EPS 的校准能力。
此外,论文还验证了 EPS 的多个实用特性:可以在一个模型中摊销所有五个任务而不损失性能(表 4),对掩码密度的外推也表现出一定程度的鲁棒性(表 8),在 256×256 分辨率下依旧有效(表 9)。
实践建议
EPS 非常自然地可被集成到现有的扩散/流模型工作流中,尤其是那些已经拥有预训练无条件去噪器(如 EDM)的场景。实际部署时:
- 微调策略:保留预训练去噪器的架构,仅把输入通道从 (3 通道) 扩展为 (通常 6 通道,图像问题中 可经掩码或上采样对齐尺寸),额外卷积核零初始化,然后以标准 EDM 损失权重微调 10 个 epoch 左右(约 25k 次迭代)即可收敛(附录 B)。这比从头训练条件模型节省巨大算力。
- 采样配置:直接采用 EDM 的 Euler 或 Heun 采样器,推荐 20 NFE,此时性能已接近饱和。每步需计算 :对修复(逐元素求解)、超分(池化-反池化递推)、卷积模糊(FFT 对角化)都有极高效的实现;若遇到一般稠密 ,可用共轭梯度求解对称正定系 ,每次迭代仅需 和 的矩阵-向量乘积。
- 摊销多任务:若需支持多个逆问题(如不同掩码或模糊核),建议训练一个统一的 EPS 模型,在训练时随机采样算子,文中已证实摊销版本性能几乎不降,且大幅减少部署模型数量。
- 潜在扩散模型:若使用 VAE 潜在空间中的扩散先验,由于解码器使像素空间的线性算子变成非线性的,EPS 的封闭形式不再直接适用;一种策略是在潜在空间内对解码器的雅可比进行局部线性近似,或训练时包含解码器的梯度,但会增加复杂度。这类场景应谨慎验证。
总之,EPS 为线性高斯逆问题提供了一种精确、高效、易集成的后验采样方案,特别适合对推断准确性和计算预算都有严格要求的应用。