前向扩散过程中的得分精度无法保证扩散采样的数值稳定性
Score Accuracy Along the Forward Diffusion Does Not Certify Numerical Stability in Diffusion Sampling
论文信息
标题: Score Accuracy Along the Forward Diffusion Does Not Certify Numerical Stability in Diffusion Sampling
作者: Yiwei Zhou
发布日期: 2026-07-09
arXiv ID: 2607.08757v1
PDF 链接: 下载 PDF
3 分钟速览
-
研究问题:扩散模型采样中,即便训练好的分数网络在前向边际分布上的均方误差极小,其欧拉–丸山离散采样也可能失去数值稳定性。本文探究了前向边际误差无法保证样本矩收敛和 Wasserstein 收敛的根本原因。
-
核心方法:构造了一个光滑的逆时间分数场,它在极小概率的远端区域嵌入了超线性扰动。前向边际误差可以任意小,但一旦离散采样路径进入该区域,就会引发迭代放大,导致样本矩发散。
-
关键结果:论文严格证明,存在前向边际 误差任意小的单个分数场,其连续时间逆过程稳定且与真实逆过程在路径全变差意义下任意接近,但欧拉–丸山离散化的每一个正阶矩都发散,从而使任意 距离发散(定理 3.1)。
-
主要局限:构造的远端扰动在真实数据上未必自然出现,且提出的去噪器投影稳定方法要求已知数据支撑的凸包,这在无界分布或未知支撑集时难以直接应用。
-
适合读者:对扩散模型采样理论、SDE 数值解稳定性、以及 score-based 生成模型端到端保证感兴趣的研究者和工程师,特别是关注弱误差与强误差(矩、Wasserstein 距离)之间差异的读者。
论文背景和研究动机
扩散模型通过逐步去噪生成高质量样本,其核心在于用训练好的分数网络 替代真实分数 来进行逆向采样。实际采样中,必须对逆向随机微分方程(SDE)或概率流 ODE 进行时间离散化(如欧拉–丸山方法),因此衡量生成质量的指标不仅是连续时间近似精度,更关键的是离散轨迹的端到端行为。
训练中常用的损失函数是前向边际 误差
即在前向加噪过程所产生的分布 下评估分数近似精度。自然的问题是:“如果这个误差可以任意小,同时连续时间反向过程稳定且路径接近,是否足以保证离散采样在强意义下(如矩、Wasserstein 距离)也稳定?”
本文指出答案是否定的。即使前向误差极小且连续过程近于完美,离散采样仍会因为 “盲区” 超线性扰动而引发灾难性矩发散。这一发现补充了现有理论中主要关注分布加权误差或弱收敛的不足,揭示了离散误差与分数评估点漂移之间的恶性反馈机制。
核心方法和技术细节
问题设定
考虑 variance-exploding (VE) 正向过程 ,其中 ,真实分数为 , 是后验期望。给定的学习分数 通过 Tweedie 公式对应去噪器 。采样时采用从终端 到初始 的欧拉–丸山离散化:
核心反例构造
对于一维有界支撑数据(支撑在 ),固定超参数 ,可构造
其中 是光滑截断函数,在 上为零,在 外为 1。选择足够大的 可使前向 误差任意小,因为 的尾部极轻。
尽管如此,在 区域,分数追加了一项向内的超线性分量 。连续时间 SDE 的漂移满足 ,确保全局 dissipativity,因此解非爆破且矩有界。通过停止时间耦合,逆向过程的路径全变差可以任意小(与真实过程的路径轨迹几乎一致)。
离散矩崩溃的关键在于欧拉–丸山显式离散。在嵌套几何网格 上,若 落入 且噪声项适度小,则一步显式迭代会产生
随后通过反向递归产生超指数增长 。这一放大抵消了进入该尾部区域的小概率(其对数阶仅为 ),最终导致对所有 ,
弱收敛(依概率收敛)仍然成立,但强矩发散,从而对任意 , 距离发散。
该构造可扩展到任意维度(径对称扰动)和概率流 ODE。进一步,即使限定于固定的 DiT 架构(如 DiT-S/2),也可构造出一族有界且全局 Lipschitz 的去噪器,其前向误差趋于零,但欧拉离散矩仍发散(定理 3.5)。
稳定化策略:去噪器投影
若已知数据支撑在一个紧凸集 内,由于真实去噪器 ,可将学习去噪器投影到 上:
这一操作不会增加逐点去噪误差或分数误差(命题 4.2),同时将欧拉–丸山更新改写为:
因为 有界,确定性更新是当前状态与 中某点的凸组合,从而杜绝了超线性增长,产生网格一致矩界(命题 4.1)。结合弱收敛与矩一致可积性,即得 Wasserstein 收敛(定理 4.3)。
创新点和贡献
- 指出前向边际精度不足以保证离散强稳定性:提供首个构造性反例,展示任意小前向 分数误差可与连续过程近完美、离散矩完全发散并存。这补充了现有理论主要关注弱收敛的不足。
- 揭示 “盲区” 放大机制:通过远端超线性扰动+显式离散过冲,给出从罕见事件到超指数放大的完整数学分析。该方法适用于 SDE 与 ODE 采样器。
- 固定架构下的不稳定性:证明即使在同一 DiT 架构内,通过控制参数也可实现前向误差消失而矩发散,排除了架构容量不足导致不稳定的解释。
- 投影稳定性的严格分析:在已知支撑凸包下,证明投影操作保留逐点精度并赋予网格一致矩界限,从而在弱收敛基础上直接获得 Wasserstein 收敛。这为实践中常用的裁剪(clipping)操作提供了理论基础。
- 实验验证:在小型 DiT 网络上完成了构造性实验,显示普通采样精度良好但应力测试下存在大幅增长,而投影操作抑制了这一增长(图 1、图 2)。
实验结果分析
实验在一维 点质量模型上进行,真实去噪器恒为零。四个不同参数配置(改变扰动阈值 和饱和幅度 )共享一个小的 DiT 风格网络架构。无条件轨迹评估中,分数均方误差在 至 ,路径 RMSE 在 至 (表 1),表明网络在典型区域拟合良好。
通过应力初始化( 置入扰动区域)观察后进入动力学:RMS 放大因子 从 升至 (表 1),步进轨迹与目标扰动函数紧密跟踪,证实了超线性放大效应(图 1)。
采用去噪器投影()后,用相同应力初始化重新评估:原始链的 RMS 幅度上升,而投影链的 RMS 幅度从初始的 – 下降到 –,二阶矩压制了约四个数量级( 至 倍),成功去除放大(图 2)。实验验证了理论构造的可复现性,即在实际有限网络和训练中也能观察到相似的不稳定现象,且投影能有效应对。
局限与待解决问题
- 构造中的超线性扰动需人工设定,并未声称在实际数据或常用训练范式下必然出现类似的远端分数偏差。论文中的反例主要用作不可能性证明,而非对现有模型不稳定性的直接诊断。
- 投影稳定化依赖数据支撑凸包的先验知识。对无界分布或高维复杂图像数据,难以精确确定凸包,使用经验盒约束可能会丢失分布外侧的信息,其理论保证弱化。
- 理论结果基于 VE 体系及单调节超线性形式,对于 VP/DDPM 等常用参数化,类似的不稳定机制是否仍可被小前向误差掩盖,有待进一步公式化。
- 弱收敛与强矩发散之间的鸿沟在高维中如何影响样本质量(如 FID、Inception Score 等)未得到定量关联,实验仅在一维 toy 模型上进行。
- 若采样步数较少或网格非几何递减,进尾概率与放大率的量化关系会变化,相应的安全界限尚未给出。