尺度和空间扩散

Scale Space Diffusion

arXiv: 2603.08709v1

论文信息

标题: Scale Space Diffusion

作者: Soumik Mukhopadhyay, Prateksha Udhayanan, Abhinav Shrivastava

发布日期: 2026-03-09

arXiv ID: 2603.08709v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:扩散模型的高噪声状态包含的信息与大幅降采样的低分辨率图像相当,为何仍需在全分辨率下处理这些状态,导致不必要的计算开销。
  • 核心方法:将尺度空间理论融入扩散过程,提出广义线性退化扩散模型(Scale Space Diffusion, SSD),并设计可动态激活不同深度的 Flexi-UNet 架构支持多分辨率去噪。
  • 关键结果:在 CelebA-256 数据集上,SSD (6L) 的训练时间不到基线 DDPM 的一半(42.88 小时 vs 87.33 小时),同时保持可接受的 FID 分数(表 2)。
  • 主要局限:论文未引入高级训练技巧(如改进的采样器、课程学习等)以优化性能,FID 在部分配置下略高于 DDPM 基线。
  • 适合读者:从事生成模型、扩散模型、图像生成效率优化的研究人员,以及对多尺度架构设计感兴趣的工程师。

论文背景和研究动机

扩散模型通过逐步添加高斯噪声降解图像信息,其逆向过程在去噪的不同时刻揭示出从粗粒度结构到细粒度细节的信息层级。无独有偶,计算机视觉中的尺度空间理论通过低通滤波构建高斯金字塔,同样呈现信息随分辨率降低而流失的层次化特征。论文开篇通过可视化对比直观展示了这一平行关系:沿扩散时间轴和沿尺度空间分辨率轴的信息退化趋势高度相似。

为量化这一直觉,论文对两种过程的信息量进行了数学建模。对扩散状态 xt=αˉtx0+1−αˉtϵx_t = \sqrt{\bar{\alpha}_t}x_0 + \sqrt{1-\bar{\alpha}_t}\epsilon,定义信息量为信号主导像素的期望占比 Info(t)=1−2∫01Φ(−s(t)x)dxInfo(t) = 1 - 2\int_0^1\Phi(-s(t)x)dx,其中 s(t)=αˉt/1−αˉts(t)=\sqrt{\bar{\alpha}_t}/\sqrt{1-\bar{\alpha}_t} 为信噪比系数的平方根。对尺度空间,简单地假设 Info(r)=r2Info(r) = r^2(面积比例)。两者随 tt 增加与 rr 减小呈现出相似的衰减趋势(见图 2),为融合两种信息降解机制提供了理论动机。

此前的工作或在全分辨率下操作导致计算低效,或采用过强的协方差简化假设,或在推理阶段才近似处理尺度变换,未将尺度空间真正嵌入扩散过程的数学建模中。Scale Space Diffusion 正是要填补这一空白。

核心方法和技术细节

广义线性退化扩散过程

标准 DDPM 的前向过程定义为 xt=αtxt−1+1−αtϵx_t = \sqrt{\alpha_t}x_{t-1} + \sqrt{1-\alpha_t}\epsilon。SSD 将其推广为更一般的形式:

xt=Mtxt−1+ηt,ηt∼N(0,Σt∣t−1)x_t = M_t x_{t-1} + \eta_t, \quad \eta_t \sim \mathcal{N}(0, \Sigma_{t|t-1})

其中 MtM_t 为线性算子,可以是下采样、模糊等任意线性退化操作。在假设边缘分布具有各向同性协方差 Σt=σt2I\Sigma_t = \sigma_t^2 I 的前提下,推导得到:

边缘分布:q(xt∣x0)=N(M1:tx0,σt2I)q(x_t|x_0) = \mathcal{N}(M_{1:t}x_0, \sigma_t^2 I),即 xt=M1:tx0+σtϵx_t = M_{1:t}x_0 + \sigma_t \epsilon。

前向转移协方差:Σt∣t−1=σt2I−σt−12MtMt⊤\Sigma_{t|t-1} = \sigma_t^2 I - \sigma_{t-1}^2 M_t M_t^\top,可行性要求 \sigma_t^2 \geq \sigma_{t-1}^2 \lambda_\max(M_t M_t^\top)。

后验分布(定理 2、3):q(xt−1∣xt,x0)=N(μt→t−1,Σt→t−1)q(x_{t-1}|x_t, x_0) = \mathcal{N}(\mu_{t\to t-1}, \Sigma_{t\to t-1}),其中:

Σt→t−1=σt−12I−σt−14σt2Mt⊤Mt\Sigma_{t\to t-1} = \sigma_{t-1}^2 I - \frac{\sigma_{t-1}^4}{\sigma_t^2} M_t^\top M_t μt→t−1=μt−1+σt−12σt2Mt⊤(xt−Mtμt−1)\mu_{t\to t-1} = \mu_{t-1} + \frac{\sigma_{t-1}^2}{\sigma_t^2} M_t^\top (x_t - M_t\mu_{t-1})

当 Mt=αtIM_t = \sqrt{\alpha_t}I 且 σt=1−αˉt\sigma_t = \sqrt{1-\bar{\alpha}_t} 时,该框架退化为标准 DDPM,体现了其一般性。

实践实现

为实现 SSD,论文选择图像缩放(先模糊后降采样)作为 MtM_t,并结合衰减系数 at=αˉta_t = \sqrt{\bar{\alpha}_t} 得到 Mt(x)=(at/at−1)⋅resize(x)M_t(x) = (a_t/a_{t-1}) \cdot \text{resize}(x)。这使状态维度随分辨率变化。

实现中的三个关键技巧:

  1. 隐式转置:使用 torch.autograd.grad 计算向量-雅可比积 Mt⊤v=∇x⟨v,Mtx⟩M_t^\top v = \nabla_x \langle v, M_t x\rangle(算法 2)。
  2. 非各向同性采样:后验协方差不满足各向同性假设,需通过 Lanczos 算法数值计算 Σt→t−11/2ϵ\Sigma_{t\to t-1}^{1/2}\epsilon 以采样 N(0,Σt→t−1)N(0, \Sigma_{t\to t-1})(算法 3)。
  3. 训练损失:采用 Min-SNR-γ 加权的 x₀ 预测损失 L=Ex0,t,ϵ[min⁡(s2(t),γ)∥x^0r(t−1)(xt,t)−1at−1M1:t−1x0∥22]L = \mathbb{E}_{x_0,t,\epsilon}[\min(s^2(t), \gamma)\|\hat{x}_0^{r(t-1)}(x_t, t) - \frac{1}{a_{t-1}}M_{1:t-1}x_0\|_2^2]。

Flexi-UNet 架构

标准 UNet 在固定深度下只处理有限的尺度数,且输入输出分辨率需一致。Flexi-UNet 通过动态激活子网络解决此问题:高分辨率输入经过完整 UNet,低分辨率输入仅通过深层路径,绕过浅层编码器和解码器块。通过 1×1 卷积将输入特征映射到对应块的通道维度。分辨率提升时,模型使用非对称路径(更多上采样块),缺失的跳跃连接用零张量填充。

创新点和贡献

  1. 首次定量分析扩散状态与尺度空间的信息层次关系,为两种机制的融合提供了理论基础。
  2. 建立广义线性扩散过程的数学框架,将缩放等退化操作直接纳入扩散模型,突破传统各向同性协方差的限制,并给出可行的深度习框架实现方案。
  3. 提出 Flexi-UNet,一种支持多分辨率输入输出且参数共享的 UNet 变体,仅在必要时使用网络部分层,无需为每个尺度维护独立模型。
  4. 端到端像素空间多尺度扩散,无需潜在空间转换或级联多个模型,在训练和推理效率上均展现优势。

实验结果分析

主要设定

实验在 CelebA(64, 128, 256 分辨率)和 ImageNet-64 上进行无条件图像生成,基线包括 DDPM(ϵ 预测和 x₀ 预测)、Blurring Diffusion(BD)。所有模型基于 ADM [10] 架构,用 1000 步扩散,评估指标为 FID。

训练效率与性能(表 2)

在 CelebA-64(1M 次迭代)上,SSD (2L) 以 2.14 FID 略优于 DDPM-ϵ (2.22) 和 BD (2.06),训练时间从 70.30 小时降至 62.63 小时,计算量从 60.05 GFlops 降至 50.61。随层数增加(3L, 4L),FID 分别增加到 3.61 和 4.28,但训练时间进一步降至 56.13 和 52.38 小时。

在更高分辨率上效率优势更突出。CelebA-256 上,DDPM-ϵ 需 87.31 小时达到 5.52 FID,而 SSD (6L) 仅用 42.88 小时达到 13.50 FID。SSD (3L) 在 59.00 小时达到 7.79 FID。图 6 展示了 SSD 在分辨率提升时训练时间增长更为缓和。

ImageNet-64 结果(表 3)

在更具多样性的 ImageNet-64 上,SSD (2L) 以 13.08 FID 与 DDPM (12.82-13.07) 基本持平,验证了方法在复杂分布上的可行性。

架构消融(表 4)

Flexi-UNet 在 2L 和 4L 配置下不仅 FID 略优于 Full UNet(如 2L: 2.26 vs 2.33, 4L: 4.87 vs 4.90),推理速度也更快(2L 64 分辨率: 15.38s vs 16.19s)。

采样步数缩减(表 7)

DDPM 在步数从 1000 降至 250 时 FID 大幅恶化(DDPM-x₀: 2.98→14.00),而 SSD (2L) 仅从 2.14 增至 2.87,展现了更好的稳健性。

实践建议

多尺度训练策略的工程部署

对于需要在像素空间进行高分辨率图像生成的应用,SSD 框架提供了计算效率与质量之间的可控权衡。建议:

  • 分辨率调度设计:论文实验表明 ConvexDecay 0.5 曲线(最高分辨率停留最长时间)取得最佳 FID,但训练最慢。可根据在线推理的延迟预算选择更激进的调度(如 ConvexDecay 2),其训练速度最快,适合快速原型化。
  • 层级数量选择:2L 配置在 64 分辨率上取得最佳 FID 且效率提升,3-4L 适用于 128-256 分辨率以显著节省训练成本。6L 在 256 分辨率上训练时间减半但 FID 有所牺牲,需结合实际质量要求判断。

非各向同性噪声采样

Lanczos 算法引入的额外开销可忽略(表 8),但避免了各向同性近似导致的颜色饱和、生成失真问题(图 10)。在实现类似可变形退化的扩散过程时,不应为简化而采用各向同性噪声假设。

架构选择

Flexi-UNet 在处理多分辨率输入时不仅比 Full UNet 更快,而且性能基本不损失。对于需要动态输入尺度的场景(如交互式生成应用中逐步细化图像),这种参数共享的设计具有工程价值。

扩展方向

  • SSD 的数学框架可应用于其他线性退化操作(如柔焦、运动模糊),论文中已验证逐步缩小的退化方式(图 9)。可据此设计针对特定降质过程的定制化生成或复原模型。
  • Flexi-UNet 的非 SSD 版本也可用于其他多尺度生成方法(如 PyramidalFlow 风格的近似多分辨率扩散),论文中已展示其竞争优势(表 11)。
  • 论文未使用高阶采样器或课程学习,引入这些技术有望进一步提升 SSD 的质量上限。