前向扩散过程中的评分准确度不能保证扩散采样的数值稳定性
论文信息
标题: Score Accuracy Along the Forward Diffusion Does Not Certify Numerical Stability in Diffusion Sampling
作者: Yiwei Zhou
发布日期: 2026-07-09
arXiv ID: 2607.08757v1
PDF 链接: 下载 PDF
研究背景与动机
扩散模型在生成建模领域取得了显著成功,其核心思想是学习一个从噪声还原数据的逆向随机过程。这一过程的漂移项依赖于所谓的 “评分函数” ,表示数据分布的梯度。实际训练时,我们只能获得一个近似评分 ,并常用前向扩散过程中的边缘分布 下的 误差来衡量其准确度:
这种误差被称为 “on-path” 误差,因为它只关心模型在逐渐加噪的数据路径上是否准确。一个自然的问题是:如果 on-path 误差极小,能否保证离散化后的采样过程(如欧拉-丸山方法)收敛到真实分布,且具有良好的数值稳定性?尤其是在使用显式时间步进时,每一步计算依赖的评分是在当前状态估计的,这个状态可能偏离前向训练分布的支持集。本论文通过严格的数学构造和实验表明,即便前向误差任意小,连续时间的逆向过程也十分接近真实过程,显式离散采样仍然可能发生灾难性的发散——所有正阶矩趋于无穷,Wasserstein 距离发散。这一发现揭示了对扩散采样稳定性进行理论担保时,仅靠 on-path 误差是不充分的,需要额外的控制机制。
核心方法与反例构造
尾部扰动与 superlinear 放大机制
作者的核心构造非常精巧:在一个一维的方差爆炸(VE)扩散模型中,真实数据 有界,真实评分 的增长至多是线性的。在离原点非常远的区域 ,我们在真实评分上叠加一个向内的 superlinear 扰动:
其中 在 时为 0,在 时为 1,,。扰动项 在数值上具有向内 “拉回” 的效应(连续时间下是稳定的),但在显式的欧拉-丸山离散中会产生危险的过冲。因为网格步长与状态大小成比例时,一次更新可能将状态放大到更极端的区域,触发后续进一步的放大,形成级联式的指数增长。
关键的一招在于,扰动所在的尾部区域在前向边缘分布 下的质量极小(高斯尾部),因此 on-path 误差可以做到任意小。更加巧妙的是,连续时间的逆向随机微分方程(SDE)仍是稳定的——因为漂移项 提供了强耗散,保证了解的存在唯一性和任意阶矩的有界性。同时,由于扰动仅作用在很远的区域,正确评分与扰动评分的路径律之间的全变差距离也可以任意小。
离散灾难:弱收敛但矩发散
在嵌套的几何网格 上应用欧拉-丸山离散,从 开始。作者证明了一个令人震惊的结果:端点 依概率收敛到连续过程的端点(弱收敛),但对任意 ,。于是对任意 ,Wasserstein 距离 发散。通俗地说,大部分采样轨迹看起来正常且收敛,但极少数轨迹会进入扰动尾部,随后每一步都将状态放大 superlinear 的量,导致这些轨迹的模长以 的指数倍增,最终导致所有正阶矩被拉向无穷。因为 on-path 误差仅衡量典型路径上的准确性,它完全看不到这种罕见但灾难性的事件。
这一机制与经典的显式欧拉法求解 superlinear SDE 时会发散的现象一致,但这里的独特性在于扰动可以被放置在 forward 分布几乎不触及的区域,使得连续过程的路径仍然接近真实路径,而 on-path 误差预算极小。
扩展到高维、概率流与不可排序性
该构造可以轻易推广到任意维度,只需将扰动改为沿径向,,相应的矩发散和 Wasserstein 发散同样成立。对于确定性概率流常微分方程(ODE),同样可以构造类似的反例:显式欧拉离散会导致矩发散,尽管 ODE 路径本身稳定且接近真实 ODE 路径。
更深刻的是,作者还证明了 on-path 误差预算甚至不能可靠地对不同评分场进行数值稳定性排序:两个不同的评分场可以有完全相同的 on-path 误差 ,一个(通过对真实评分加一个常数偏移)产生具有任意阶一致有界矩的安全采样器,另一个则导致矩发散。这意味着,仅凭训练 loss 无法判断哪个模型在实际采样中更稳定。
固定架构内的神经反例
上述反例是在光滑评分场层面构建的,作者进一步证明,即使限定在固定的有限神经架构(例如 DiT)内,仍然可以找到一组参数序列,使得 on-path 误差趋于零、连续过程接近真实过程,但离散采样端点的所有矩发散。构造思路是将扰动项实现为门控的三次函数 ,然后用一个固定大小、但参数可变的 DiT 块来逼近该函数,同时保持网络有界且全局 Lipschitz。这一结果表明,即便在具体深度学习实现层面,单靠前向误差也远远不够。
正向结果:去噪器投影恢复稳定性
反例揭示的一个根本问题是:当数值轨迹滑入训练支持极少的区域时,评分预测可能严重失准,而这一失准无法被 on-path 误差捕获。一旦给予额外的几何先验,问题就可以迎刃而解。假设已知数据支撑在一个有界闭凸集 内(如图像像素值在 中)。因为真实去噪器 也落在 内,我们可以简单地将学习到的去噪器投影到 上:
投影不会增大点对点的去噪器或评分误差(因为真实目标已经在 内),但却在每一步更新中引入了一个有界凸组合:
由于 有界,上式表明确定性部分总是将状态拉向有界集 ,从而根本避免了 superlinear 过冲。利用该表示,可以导出网格一致的高阶矩界,进而将依概率收敛提升为 收敛和 Wasserstein 收敛。这为实践中常用的 “预测干净样本裁剪” 提供了理论解释和稳定性保障。
实验验证
作者在一维 点质量扩散任务上进行了小型实验,使用一个共享架构的小 DiT 网络,四个模型仅在目标尾部 profile 上有所不同。所有模型的 on-path 评分均方误差都极小( 量级),路径 RMSE 也很低。但在一个定制的 “应力测试” 中,将初始状态直接置于扰动区域并施加相同的小噪声序列,原始模型的 RMS 幅值经过 8 步逆扩散后被放大了 7.9 到 14.7 倍,而加了投影的版本却能将最终二阶矩降低 倍,RMS 幅值从 35–46 骤降到 2.6–3.7,完美压制了放大效应。这清楚地演示了 on-path 误差无法预见的数值不稳定性,以及投影如何有效抑制它。
实践应用建议
-
不要只盯着训练 loss:训练时的评分误差无法反映采样路径中罕见但灾难性的发散。在部署扩散模型时,应额外评估采样器在各种初始条件下的稳定性,尤其是对尾部区域的鲁棒性。
-
利用数据范围先验:对于图像等已知范围的数据,在推理时对去噪器输出进行裁剪或投影到支撑集是一个简单、零额外成本的稳定技巧,能够在理论上保证矩的有界性和 Wasserstein 收敛。
-
设计数值稳定的采样器:如果无法施加全局凸约束,则应考虑采用隐式或半隐式的时间离散,或者在评分函数中加入平滑的正则化来控制尾部增长,从而抑制显式方法的 superlinear 过冲。
-
验证理论担保:在开发新的扩散采样算法时,应分析其离散过程的矩性质,而非仅仅依赖连续过程的收敛性。
总结与展望
这篇论文深刻地揭示了扩散模型采样中一个隐蔽的理论盲点:前向边缘评分误差无法保证反向离散化的数值稳定性。其构造精巧的反例展示了即使在连续过程几乎完美的情况下,显式欧拉离散仍可能导致所有矩发散和 Wasserstein 距离爆炸,且这种失效可以发生在有限的神经网络架构内。正面结果给出的去噪器投影方法既简单又有效,为实践提供了加固稳定性的直接手段。
未来研究可以向多个方向拓展:一是将该分析框架推广到更一般的随机插值或薛定谔桥(Schrödinger bridge)模型,探索桥边缘误差与采样稳定性的类似脱节;二是寻求更弱的条件(可能不依赖凸集支撑的先验)下的矩控制方法;三是研究自适应步长或高阶方法是否能自动缓解这种尾部放大效应。这些工作将进一步完善扩散模型数值采样的理论基础,并提高大模型部署的可靠性。