求解线性逆问题的精确后验得分估计

arXiv: 2606.17048v1

论文信息

标题: Exact Posterior Score Estimation for Solving Linear Inverse Problems

作者: Abbas Mammadov, Ozgur Kara, Kaan Oktay, et al.

发布日期: 2026-06-15

arXiv ID: 2606.17048v1

PDF 链接: 下载 PDF

精确后验分数估计:线性逆问题求解的新范式

引言:当扩散模型遇上逆问题

线性逆问题广泛存在于计算成像和科学测量领域——从压缩感知、医学影像重建到图像超分辨率和去模糊,核心任务都是从带噪的线性测量 y=Ax0+ηy = A x_0 + \eta 中恢复未知信号 x0x_0。由于前向算子 AA 通常病态或秩亏,多个候选信号都能与观测相容,因此理想的重建对象不是单个点估计,而是捕捉了重建不确定性的完整后验分布 p(x0y)p(x_0|y)

扩散模型和流模型通过学习从噪声到干净样本的去噪轨迹,为这类任务提供了强大的数据先验。然而,关键问题在于:逆向采样器需要的是后验分数 xtlogp(xty)\nabla_{x_t} \log p(x_t|y),而非预训练所提供的无条件先验分数。用近似替代会引入累积偏差,导致过平滑、伪影或校准不良的不确定性。

现有方法大致分为两类:免训练方法(如 DPS、DDNM 等)保持预训练去噪器固定,在每步添加测量匹配修正;基于训练的方法(如 Palette、I²SB 等)则从头训练一个以测量 yy 为输入的条件模型。前者虽然是零样本的,但其修正本质上只是对真实测量匹配分数的近似;后者则抛弃了预训练去噪先验的有利结构。

本文提出的精确后验分数(Exact Posterior Score, EPS)方法,通过一个关键洞察打破了这一僵局:对于线性高斯逆问题,后验分数具有闭合形式,且后验采样可被准确地转化为一个在算子依赖的各向异性噪声协方差下、于测量感知枢轴处进行去噪的问题。

核心技术:后验采样的去噪重构

EPS 的核心理论建立在随机插值框架之上。考虑前向过程 xt=αtx0+βtϵx_t = \alpha_t x_0 + \beta_t \epsilon,其中 ϵN(0,Id)\epsilon \sim \mathcal{N}(0, I_d),标准的 Tweedie 恒等式将分数与最优去噪器联系起来:

Dt(x)=E[x0xt=x]=1αt(x+βt2st(x))D_t(x) = \mathbb{E}[x_0|x_t=x] = \frac{1}{\alpha_t}(x + \beta_t^2 s_t(x))

论文的核心定理精确刻画了后验分数的结构。通过将联合分布 p(xt,yx0)p(x_t, y|x_0) 中的高斯项进行配方,后验分数可表达为:

xtlogp(xty)=1βt2(αtDΣ(t)(μ(xt,y,t))xt)\nabla_{x_t} \log p(x_t|y) = \frac{1}{\beta_t^2}\Big(\alpha_t D_{\Sigma_\star(t)}(\mu_\star(x_t,y,t)) - x_t\Big)

其中后验枢轴 μ\mu_\star 和各向异性协方差 Σ(t)\Sigma_\star(t) 由前向算子 AA 和观测噪声 σy\sigma_y 解析确定:

Σ(t)=(αt2βt2Id+1σy2AA)1,μ(xt,y,t)=Σ(t)(αtβt2xt+1σy2Ay)\Sigma_\star(t) = \left(\frac{\alpha_t^2}{\beta_t^2}I_d + \frac{1}{\sigma_y^2}A^\top A\right)^{-1}, \quad \mu_\star(x_t,y,t) = \Sigma_\star(t)\left(\frac{\alpha_t}{\beta_t^2}x_t + \frac{1}{\sigma_y^2}A^\top y\right)

这一分解具有深刻的结构含义:(μ,Σ)(\mu_\star, \Sigma_\star) 是精度加权的贝叶斯融合——将在当前状态 xtx_t 和测量 yy 下的两个高斯似然进行合并后,对 x0x_0 形成的后验均值和协方差。枢轴 μ\mu_\star(xt,y)(x_t, y) 对于后验去噪任务的唯一充分统计量,而去噪器 DΣ(t)D_{\Sigma_\star(t)} 是在各向异性噪声 ξN(0,Σ(t))\xi \sim \mathcal{N}(0, \Sigma_\star(t)) 下的条件期望 E[x0x0+ξ=μ]\mathbb{E}[x_0|x_0+\xi=\mu_\star]

从理论到训练:EPS 目标函数

EPS 的训练目标与标准扩散预训练高度一致:

LEPS(θ)=Ex0,y,t,ϵ[w(t)Dθ(μ(xt,y,t),y,t)x02]\mathcal{L}_{\mathrm{EPS}}(\theta) = \mathbb{E}_{x_0, y, t, \epsilon}\left[w(t) \|D_\theta(\mu_\star(x_t,y,t), y, t) - x_0\|^2\right]

与标准预训练相比,核心变化在于:网络的输入从 xtx_t 替换为枢轴 μ\mu_\star,且隐含地,该输入被各向异性噪声 Σ(t)\Sigma_\star(t) 而非各向同性噪声 βt\beta_t 所污染。一个关键的命题保证了这种各向异性噪声可由枢轴构造本身自然诱导:给定 x0x_0,有 μx0N(x0,Σ(t))\mu_\star|x_0 \sim \mathcal{N}(x_0, \Sigma_\star(t)),因此训练时无需显式地对各向异性噪声进行采样,只需按标准方式生成 (xt,y)(x_t, y) 并计算对应的 μ\mu_\star

对于常见的结构化算子(掩码、下采样、循环卷积),μ\mu_\star 的计算可通过对角化、块对角求解或 FFT 高效完成,每次迭代的开销远低于一次去噪器前向传播。训练可以从头开始,也可以从预训练去噪器热启动——由于保留了与预训练相同的输入/输出类型和平方损失结构,EPS 只需微调适应各向异性去噪几何,收敛速度远快于从原始测量端到端学习算子依赖的条件训练方法。

创新定位:训练无关方法错在哪里?

将 EPS 的后验分数与无条件 Tweedie 恒等式相结合,可以精确刻画测量匹配分数:

xtlogp(yxt)=αtβt2(DΣ(t)(μ)Dt(xt))\nabla_{x_t} \log p(y|x_t) = \frac{\alpha_t}{\beta_t^2}\Big(D_{\Sigma_\star(t)}(\mu_\star) - D_t(x_t)\Big)

这个表达式揭示了现有免训练方法的本质偏差:它们都将上式中的后验去噪器 DΣ(t)(μ)D_{\Sigma_\star(t)}(\mu_\star) 替换为在 xtx_t 处评估的无条件去噪器 Dt(xt)D_t(x_t) 的某种变体——通过对去噪输出进行投影、微分或矩匹配等操作。即使是最先进的矩匹配方法(如对 p(x0xt)p(x_0|x_t) 进行各向异性高斯近似),也只能细化无条件查询的输入,而无法触及真正的后验去噪查询。μ\mu_\star 作为 (xt,y)(x_t, y) 的融合结果,包含了测量信息对 x0x_0 推断的精确约束,这一信息流失在无条件查询中是不可避免的。

实验验证与关键发现

论文在 FFHQ 和 ImageNet 数据集上评估了五种线性逆问题(随机修复、矩形修复、4 倍超分辨率、高斯去模糊、运动去模糊),采用 PSNR、SSIM、LPIPS、FID 以及分布校准指标 CRPS 和 MMD 进行全面评价。

EPS 在几乎所有任务和指标上达到最优或次优,显著优于各种免训练基线(DPS、DDNM、ΠGDM 等)和训练基线 Palette。一个关键的效率发现是:EPS 在约 20 次去噪器评估(NFE)就能达到渐进性能,而基线方法即使扩展到 100-250 NFE 也追不上这一水平。这体现了精确后验几何的结构性优势——每一步采样都是对正确后验的推进,而非近似的累积。

单步 EPS(在最高噪声水平进行一次 Tweedie 评估)返回条件后验均值 E[x0y]\mathbb{E}[x_0|y],获得最高的 PSNR 和 SSIM(例如在 ImageNet 随机修复上达 26.60 dB,而 100 步样本为 24.34 dB),这直接验证了高噪声极限下的理论预测,也暴露了感知-失真权衡:点估计虽在保真度上最优,但丧失了纹理细节和分布校准。

输入配置消融实验揭示,将 Palette 的输入从 (xt,y)(x_t, y) 替换为 (μ,y)(\mu_\star, y) 解释了 EPS 大部分的性能增益,辅以输入中显式传递测量 yy 可进一步锚定学习。预训练热启动使 EPS 在训练极早期就达到高保真度,而 Palette 需要更多迭代才能赶上——这归因于 EPS 仅需适应各向异性去噪几何,而 Palette 必须从零学习算子依赖性。

实践指南与应用前景

对于将 EPS 部署到实际逆问题场景的研究者和工程师,以下几点值得关注:

算子结构利用:对于掩码修复,Σ(t)\Sigma_\star(t) 是对角矩阵,枢轴计算是逐元素的;对于以循环卷积为核心的模糊和超分辨率,FFT 对角化可将求解降为频域逐元素除法。在实际部署中,应优先识别算子结构以实现高效枢轴求解。

采样预算分配:20 NFE 的 EPS 通常已接近渐进性能,远低于免训练方法所需的数百步。对于延迟敏感的应用(如实时医学影像重建),可考虑进一步降低步数,甚至使用单步后验均值作为快速预览。

多任务摊销:论文展示了单一次 EPS 检查点可以同时处理五种不同的逆问题,性能与逐任务微调相当甚至更优。对于需要支持多种退化类型的生产系统,摊销训练是减少存储和部署成本的有效策略。

热启动优于从头训练:从预训练无条件去噪器微调 EPS 可获得更快的收敛和更好的最终性能。若无法获取预训练模型,从头训练仍有效,但应预留足够的计算预算。

未来方向:当前 EPS 的闭合形式依赖于线性前向算子和高斯噪声假设。对于非线性逆问题,可能的扩展路径包括:对非线性观测模型进行局部线性化后应用 EPS 作为内环求解器;或将 EPS 的枢轴构造理念融入更通用的条件扩散训练框架。另一个值得探索的方向是将 EPS 与潜在扩散模型结合,需要处理解码器使像素空间算子非线性化的挑战。

总结

EPS 通过精确识别线性高斯逆问题后验分数中的各向异性去噪结构,建立了一座连接无条件扩散预训练与后验推理的解析桥梁。其训练目标的简洁性和采样效率的显著提升,使其成为解决逆问题的一种既原则又实用的方案。这项工作也提醒我们:在生成模型的时代,对概率结构的深入理解仍然能够导向既优雅又高性能的算法设计。