前向扩散过程中的评分准确度不能保证扩散采样的数值稳定性

arXiv: 2607.08757v1

论文信息

标题: Score Accuracy Along the Forward Diffusion Does Not Certify Numerical Stability in Diffusion Sampling

作者: Yiwei Zhou

发布日期: 2026-07-09

arXiv ID: 2607.08757v1

PDF 链接: 下载 PDF

研究背景与动机

扩散模型在生成建模领域取得了显著成功,其核心思想是学习一个从噪声还原数据的逆向随机过程。这一过程的漂移项依赖于所谓的 “评分函数” st(x)=logpt(x)s_t(x) = \nabla \log p_t(x),表示数据分布的梯度。实际训练时,我们只能获得一个近似评分 s^t\hat{s}_t,并常用前向扩散过程中的边缘分布 ptp_t 下的 L2L^2 误差来衡量其准确度:

Escore=δTEXtpts^t(Xt)st(Xt)2dt.\mathcal{E}_{\mathrm{score}}=\int_{\delta}^{T}\mathbb{E}_{X_t\sim p_t}\|\hat{s}_t(X_t)-s_t(X_t)\|^2\,dt.

这种误差被称为 “on-path” 误差,因为它只关心模型在逐渐加噪的数据路径上是否准确。一个自然的问题是:如果 on-path 误差极小,能否保证离散化后的采样过程(如欧拉-丸山方法)收敛到真实分布,且具有良好的数值稳定性?尤其是在使用显式时间步进时,每一步计算依赖的评分是在当前状态估计的,这个状态可能偏离前向训练分布的支持集。本论文通过严格的数学构造和实验表明,即便前向误差任意小,连续时间的逆向过程也十分接近真实过程,显式离散采样仍然可能发生灾难性的发散——所有正阶矩趋于无穷,Wasserstein 距离发散。这一发现揭示了对扩散采样稳定性进行理论担保时,仅靠 on-path 误差是不充分的,需要额外的控制机制。

核心方法与反例构造

尾部扰动与 superlinear 放大机制

作者的核心构造非常精巧:在一个一维的方差爆炸(VE)扩散模型中,真实数据 X0X_0 有界,真实评分 st(x)s_t(x) 的增长至多是线性的。在离原点非常远的区域 xR|x|\ge R,我们在真实评分上叠加一个向内的 superlinear 扰动:

s^t(x)=st(x)λχR(x)xxα,\hat{s}_t(x)=s_t(x)-\lambda\chi_R(x)\,x|x|^{\alpha},

其中 χR\chi_RxR|x|\le R 时为 0,在 xR+1|x|\ge R+1 时为 1,λ>0\lambda>0α>0\alpha>0。扰动项 λxxα-\lambda x|x|^{\alpha} 在数值上具有向内 “拉回” 的效应(连续时间下是稳定的),但在显式的欧拉-丸山离散中会产生危险的过冲。因为网格步长与状态大小成比例时,一次更新可能将状态放大到更极端的区域,触发后续进一步的放大,形成级联式的指数增长。

关键的一招在于,扰动所在的尾部区域在前向边缘分布 ptp_t 下的质量极小(高斯尾部),因此 on-path 误差可以做到任意小。更加巧妙的是,连续时间的逆向随机微分方程(SDE)仍是稳定的——因为漂移项 xs^t(x)Ccx2+αx\cdot \hat{s}_t(x)\le C-c|x|^{2+\alpha} 提供了强耗散,保证了解的存在唯一性和任意阶矩的有界性。同时,由于扰动仅作用在很远的区域,正确评分与扰动评分的路径律之间的全变差距离也可以任意小。

离散灾难:弱收敛但矩发散

在嵌套的几何网格 tj(K)=δexp(jKlogTδ)t_j^{(K)}=\delta\exp(\frac{j}{K}\log\frac{T}{\delta}) 上应用欧拉-丸山离散,从 YKpTY_K\sim p_T 开始。作者证明了一个令人震惊的结果:端点 Y0(K)Y_0^{(K)} 依概率收敛到连续过程的端点(弱收敛),但对任意 q>0q>0EY0(K)q\mathbb{E}|Y_0^{(K)}|^q\to\infty。于是对任意 p1p\ge 1,Wasserstein 距离 WpW_p 发散。通俗地说,大部分采样轨迹看起来正常且收敛,但极少数轨迹会进入扰动尾部,随后每一步都将状态放大 superlinear 的量,导致这些轨迹的模长以 (1+α)(1+\alpha) 的指数倍增,最终导致所有正阶矩被拉向无穷。因为 on-path 误差仅衡量典型路径上的准确性,它完全看不到这种罕见但灾难性的事件。

这一机制与经典的显式欧拉法求解 superlinear SDE 时会发散的现象一致,但这里的独特性在于扰动可以被放置在 forward 分布几乎不触及的区域,使得连续过程的路径仍然接近真实路径,而 on-path 误差预算极小。

扩展到高维、概率流与不可排序性

该构造可以轻易推广到任意维度,只需将扰动改为沿径向,λχR(x)xαx-\lambda\chi_R(\|x\|)\|x\|^{\alpha}x,相应的矩发散和 Wasserstein 发散同样成立。对于确定性概率流常微分方程(ODE),同样可以构造类似的反例:显式欧拉离散会导致矩发散,尽管 ODE 路径本身稳定且接近真实 ODE 路径。

更深刻的是,作者还证明了 on-path 误差预算甚至不能可靠地对不同评分场进行数值稳定性排序:两个不同的评分场可以有完全相同的 on-path 误差 bb,一个(通过对真实评分加一个常数偏移)产生具有任意阶一致有界矩的安全采样器,另一个则导致矩发散。这意味着,仅凭训练 loss 无法判断哪个模型在实际采样中更稳定。

固定架构内的神经反例

上述反例是在光滑评分场层面构建的,作者进一步证明,即使限定在固定的有限神经架构(例如 DiT)内,仍然可以找到一组参数序列,使得 on-path 误差趋于零、连续过程接近真实过程,但离散采样端点的所有矩发散。构造思路是将扰动项实现为门控的三次函数 λΓR(x)x3-\lambda\Gamma_R(x)x^3,然后用一个固定大小、但参数可变的 DiT 块来逼近该函数,同时保持网络有界且全局 Lipschitz。这一结果表明,即便在具体深度学习实现层面,单靠前向误差也远远不够。

正向结果:去噪器投影恢复稳定性

反例揭示的一个根本问题是:当数值轨迹滑入训练支持极少的区域时,评分预测可能严重失准,而这一失准无法被 on-path 误差捕获。一旦给予额外的几何先验,问题就可以迎刃而解。假设已知数据支撑在一个有界闭凸集 CC 内(如图像像素值在 [0,1][0,1] 中)。因为真实去噪器 Dt(x)=E[X0Xt=x]D_t(x)=\mathbb{E}[X_0|X_t=x] 也落在 CC 内,我们可以简单地将学习到的去噪器投影到 CC 上:

DtP(x)=ΠCD^t(x),stP(x)=DtP(x)xt.D_t^P(x)=\Pi_C\hat{D}_t(x),\quad s_t^P(x)=\frac{D_t^P(x)-x}{t}.

投影不会增大点对点的去噪器或评分误差(因为真实目标已经在 CC 内),但却在每一步更新中引入了一个有界凸组合:

Yk=(1ρk)Yk+1+ρkDtk+1P(Yk+1)+hkξk.Y_k = (1-\rho_k)Y_{k+1} + \rho_k D_{t_{k+1}}^P(Y_{k+1}) + \sqrt{h_k}\,\xi_k.

由于 Dtk+1PCD_{t_{k+1}}^P\in C 有界,上式表明确定性部分总是将状态拉向有界集 CC,从而根本避免了 superlinear 过冲。利用该表示,可以导出网格一致的高阶矩界,进而将依概率收敛提升为 LpL^p 收敛和 Wasserstein 收敛。这为实践中常用的 “预测干净样本裁剪” 提供了理论解释和稳定性保障。

实验验证

作者在一维 8×88\times 8 点质量扩散任务上进行了小型实验,使用一个共享架构的小 DiT 网络,四个模型仅在目标尾部 profile 上有所不同。所有模型的 on-path 评分均方误差都极小(10310^{-3} 量级),路径 RMSE 也很低。但在一个定制的 “应力测试” 中,将初始状态直接置于扰动区域并施加相同的小噪声序列,原始模型的 RMS 幅值经过 8 步逆扩散后被放大了 7.9 到 14.7 倍,而加了投影的版本却能将最终二阶矩降低 10410^4 倍,RMS 幅值从 35–46 骤降到 2.6–3.7,完美压制了放大效应。这清楚地演示了 on-path 误差无法预见的数值不稳定性,以及投影如何有效抑制它。

实践应用建议

  1. 不要只盯着训练 loss:训练时的评分误差无法反映采样路径中罕见但灾难性的发散。在部署扩散模型时,应额外评估采样器在各种初始条件下的稳定性,尤其是对尾部区域的鲁棒性。

  2. 利用数据范围先验:对于图像等已知范围的数据,在推理时对去噪器输出进行裁剪或投影到支撑集是一个简单、零额外成本的稳定技巧,能够在理论上保证矩的有界性和 Wasserstein 收敛。

  3. 设计数值稳定的采样器:如果无法施加全局凸约束,则应考虑采用隐式或半隐式的时间离散,或者在评分函数中加入平滑的正则化来控制尾部增长,从而抑制显式方法的 superlinear 过冲。

  4. 验证理论担保:在开发新的扩散采样算法时,应分析其离散过程的矩性质,而非仅仅依赖连续过程的收敛性。

总结与展望

这篇论文深刻地揭示了扩散模型采样中一个隐蔽的理论盲点:前向边缘评分误差无法保证反向离散化的数值稳定性。其构造精巧的反例展示了即使在连续过程几乎完美的情况下,显式欧拉离散仍可能导致所有矩发散和 Wasserstein 距离爆炸,且这种失效可以发生在有限的神经网络架构内。正面结果给出的去噪器投影方法既简单又有效,为实践提供了加固稳定性的直接手段。

未来研究可以向多个方向拓展:一是将该分析框架推广到更一般的随机插值或薛定谔桥(Schrödinger bridge)模型,探索桥边缘误差与采样稳定性的类似脱节;二是寻求更弱的条件(可能不依赖凸集支撑的先验)下的矩控制方法;三是研究自适应步长或高阶方法是否能自动缓解这种尾部放大效应。这些工作将进一步完善扩散模型数值采样的理论基础,并提高大模型部署的可靠性。