视频扩散模型中的序列性差距
论文信息
标题: The Seriality Gap in Video Diffusion Models
作者: Jorge Diaz Chao, Konpat Preechakul, Yuxi Liu, et al.
发布日期: 2026-07-14
arXiv ID: 2607.13031v1
PDF 链接: 下载 PDF
研究背景与动机
视频扩散模型近年来取得了惊人的生成效果,甚至被寄予厚望成为 “世界模拟器” 与视觉推理引擎。然而,即便是在简单的物理场景中,这些模型也常常暴露出物理一致性与因果推理方面的缺陷。例如,当一只球撞击另一只球、继而引发一连串碰撞时,人类可以轻易预判后续运动,但视频扩散模型却往往出现穿透、颜色错乱甚至凭空消失等荒谬错误。这不禁让人追问:视频扩散模型能否真正预测越来越长的依赖事件链?
该论文正是围绕这一核心问题展开。作者设计了一个极简的 “硬球动力学” 视频预测实验平台:多个相同小球在无摩擦的方盒内进行弹性碰撞,模型需要根据前几帧画面预测未来视频。在视觉复杂度极低、物理过程完全确定的情况下,该任务将 “依赖事件链长度” 这一变量独立出来,排除了自然视频中的外观复杂性和随机性的干扰。由此,研究者揭示出一个名为 “串行性差距”(seriality gap)的现象:标准双向视频扩散模型的预测精度会随着因果链变长而显著恶化,即便增加去噪步数也无法弥合这一差距;而增加模型的串行计算能力(例如采用自回归生成或加深网络深度)则能有效改善性能。
这一发现具有深刻的启示:扩散模型的迭代去噪过程并不能为序列推理提供可扩展的串行计算资源。这不但从理论上解释了现有模型的局限,也为设计下一代具备真正因果推理能力的视频生成模型指明了方向。
核心方法与实验设计
硬球动力学测试平台
为了剥离视觉复杂性,研究者采用硬球动力学作为 “诊断性” 任务。系统中有 个完全相同的小球,每个小球在正方形盒子内无摩擦运动,彼此之间以及与墙壁发生完全弹性碰撞。给定前 帧(实验中 )作为条件,模型需要预测后续 帧。该设置具有三大优势:
- 确定性:初始状态确定后,未来轨迹唯一,误差可精确度量。
- 串行性可调:通过改变 可以控制球-球碰撞链的长度。多球场景()中碰撞链随视频长度 增长,而单球场景()则没有球间依赖,未来状态可以直接从初态一步算出,成为完美的 “非串行” 对照组。
- 视觉简洁:渲染仅使用简单色块,避免了自然视频中语义模糊和视觉噪声对分析结论的污染。
模型与评估
实验采用基于 DiT 架构的双向视频扩散模型(改编自 Wan2.1),并在其基础上实现了多种推理范式:标准双向去噪、块自回归(Block-)以及完全自回归(Block-1)。此外,还通过改变骨干网络的深度 和宽度 来研究架构层面的串行计算能力。
评估指标分为三类:
- 全局误差 :预测球心位置与真实位置的欧氏距离均值,反映累积漂移。
- 局部误差 :从当前帧倒推 帧提取状态,用模拟器向前推演 步后与预测帧比较。该指标剥离了长期漂移,直接衡量局部物理一致性(论文默认使用 )。
- 视觉质量(IoU):将预测球体掩膜与理想圆形掩膜对齐后计算交并比,评估形状保真度。
所有模型均在相同设定下训练 20 万步,使用 AdamW 优化器,并在 NVIDIA A100 GPU 上执行。
关键发现:串行性差距的实证证据
论文通过一系列严谨实验给出了五项核心观察。
观察 1:双向扩散随视频变长而性能恶化 在 的多球设定中,随着预测帧数 增加,双向模型局部误差 显著上升;而自回归模型的误差则几乎保持持平(图 3 左上)。虽然双向模型的时空自注意力计算量以 增长,远超物理模拟所需的 ,但额外计算并未转化为有效的串行推理能力。
观察 2:无球-球碰撞时不出现差距 在 的单球对照组中,同样长度的视频下,双向与自回归模型的局部误差几乎相同,且均不随 增长而恶化(图 3 左上)。这直接证明视频长度并非主因,依赖事件链的串行复杂度才是导致双向模型性能下降的根源。
观察 3:串行化推理可提升性能 保持骨干架构不变,仅改变推理时的注意力掩膜,从双向(Block-11)到块大小 3、2,再到完全自回归(Block-1),局部误差逐级下降(图 3 右下)。这表明即使在总计算量接近的情况下,沿时间轴更细粒度的串行计算分配能提供更有效的因果传播。
观察 4:增加去噪步数无法弥合差距 将去噪步数 从 10 提高到 200,性能在 左右饱和,之后几乎没有改善,且长期预测的退化依然存在(图 3 右上)。去噪迭代并未给模型提供可扩展的串行计算能力。
观察 5:深度比宽度更重要 扫描不同的骨干深度和宽度组合发现,加深网络(如从 10 层增加到 30 层)带来的性能提升远大于加宽网络(如 从 640 增至 1536)。这暗示串行计算更有效地来源于网络深度,而非并行宽度(图 3 左下)。
定性分析还揭示出典型的失败模式:球体穿透、数量错误和颜色身份混淆,这些在双向生成中尤为频繁。
理论解释:为何去噪步骤不提供可扩展串行计算
这些现象看似费解:模型明明接收了巨额并行计算,为何还会在依赖链上失败?论文从计算复杂性角度给出了清晰的解答。
给定一个确定性、完全可观测的物理过程,初始帧确定了唯一的未来轨迹。在扩散模型的 NCSN(噪声条件评分网络)形式下,当条件分布退化为一个点质量(即未来视频完全确定)时,加噪后的分布仍集中在同一点周围。此时,评分函数 具有闭式解,并且可以从任意时刻 的含噪状态 和评分函数一步直接还原出干净样本 :
这意味着,若骨干网络已经计算出了准确的评分函数,那么单次网络前向传播即足以恢复完整未来,之后反复应用去噪步仅仅是数值积分手段,并未贡献超越骨干网络本身的额外串行计算。
从计算复杂性的视角看,固定深度的 Transformer 骨干属于并行计算类 (多项式规模、常数深度的电路),而多球碰撞预测可归约为已知的 -完全问题(如弹子球计算),无法被 高效求解(在 等广泛接受的假设下)。因此,当依赖链长度超过骨干深度所能提供的串行计算量时,即便有无限多的去噪步,双向扩散模型也无法准确预测。相反,自回归生成通过在时间轴上执行 次串行前向,其总串行深度与任务需求相匹配,因而能够应对更长的因果链。
这一理论也解释了为什么深度和自回归能弥合差距:它们提供的才是真正的串行计算。而去噪步数只相当于在固定深度下做更多次并行评估,并不能提升串行复杂度。
创新点与贡献
- 提出了 “串行性差距” 概念,首次系统揭示视频扩散模型在依赖事件预测上的结构性缺陷,并证明其根源在于去噪过程无法提供可扩展的串行计算。
- 构建了一个极简的硬球动力学测试平台,成功将串行复杂度与视觉内容解耦,为因果推理能力的研究提供了高度可控的基准。
- 提供了严格的理论分析,在确定性视频预测设定下,证明了扩散模型去噪步骤的串行计算局限,将经验发现与计算复杂性理论相联系。
- 通过系统的消融实验,明确了推理因子分解、骨干深度等因素对性能的影响,为视频模型架构设计提供了清晰指导。
实践应用建议
基于该研究的结论,从事视频生成、世界模型或具身智能研发的从业者可以从以下角度获得启发:
- 对于长程物理交互任务,应优先采用自回归或块自回归的推理范式,而非寄希望于增加去噪步数。在流式视频预测、机器人轨迹规划等应用中,沿时间轴串行化推理是必要的。
- 网络架构设计上,在预算允许时优先加深网络(增加层数)而非单纯加宽,以获得更强的串行推理能力。但需注意过深网络可能带来的优化困难,可结合残差连接、层归一化等技巧。
- 训练策略可尝试混合范式:在预训练阶段采用双向扩散以利用全局信息,在微调或下游任务中切换为块因果掩膜,兼顾效率与因果一致性。
- 对于非时间对齐的推理任务(如迷宫求解、拼图),简单的逐帧自回归不一定有效,此时可借鉴本工作的思路:分析任务依赖图,将串行计算分配到任务固有的因果结构上(例如通过递归网络或搜索增强)。
局限性与未来方向
尽管该工作深刻揭示了扩散模型的串行性短板,但自身也存在局限性。理论部分假设了确定性和完全可观测性,而自然视频往往包含随机性和部分可观测性。论文在附录中用 “振动墙壁” 的随机变体做了初步验证,结果仍然支持原有结论,但将其推广到更复杂的视觉环境仍需更多实证。
此外,自回归并非万能药方。某些视觉推理任务可能需要跨越多帧的非局部依赖,逐帧生成可能限制全局计划。未来研究可探索以下方向:
- 设计新的生成模型范式,使迭代过程不仅仅是评分匹配,还能在每个步骤中执行并传递有用的计算状态,真正将 “推理” 内化到生成过程中。
- 混合架构:结合扩散的并行生成能力与自回归的串行推理优势,根据任务的局部依赖密度自适应地调整块大小或并行度。
- 将串行性差距分析扩展到真实世界视频,建立更综合的基准,量化模型在处理复杂物理事件、社会交互等场景下的因果跟踪能力。
总结与展望
“The Seriality Gap in Video Diffusion Models” 一文以简驭繁,通过一个看似简单的弹性碰撞任务,直击当代视频扩散模型在因果推理上的根本局限。它不仅在经验上清晰展示了双向扩散在处理长依赖链时的失败,更从计算复杂性角度给出了理论解释:去噪循环并不能替代真正的串行计算。这一洞见对于所有试图将扩散模型用作 “世界模拟器” 的研究者都是一次重要的警醒。未来,若要实现强健的物理预测和视觉推理,必须重新思考模型的计算结构,让生成过程本身具备与任务复杂度相匹配的串行演算能力。