生成式视图拼接

Generative View Stitching

arXiv: 2510.24718v1

论文信息

标题: Generative View Stitching

作者: Chonghyuk Song, Michal Stary, Boyuan Chen, et al.

发布日期: 2025-10-28

arXiv ID: 2510.24718v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:自回归视频扩散模型在相机轨迹引导的视频生成中,无法利用未来帧信息进行条件生成,导致相机与已生成场景发生碰撞,随后生成过程迅速崩溃。
  • 核心方法:提出生成式视角拼接(Generative View Stitching, GVS),并行采样整个序列,使生成场景忠实于预定义相机轨迹的每一部分;该方法基于扩散拼接(diffusion stitching)思想,但无需专门训练的模型,直接适用于任何使用 Diffusion Forcing 框架训练的现成视频模型。
  • 关键结果:GVS 成功实现了稳定、无碰撞、帧间一致的相机引导视频生成,并能对包括 “不可能的楼梯” 在内的多种预定义相机路径完成闭环生成(见论文摘要和项目页面)。
  • 主要局限:方法依赖 Diffusion Forcing 框架提供的拼接所需特性,尚未在其它扩散训练范式上验证;此外,并行采样可能带来比自回归方法更高的计算开销,但论文未给出具体对比数据。
  • 适合读者:从事视频生成、扩散模型、3D 场景表示或机器人规划的研究者,以及对多视角一致性和可控生成感兴趣的开发人员。

论文背景和研究动机

近年来,自回归视频扩散模型在生成长序列方面取得了显著进展。这类模型逐帧或逐段生成视频,通过将已生成的历史帧作为条件来维持时间一致性。然而,当应用场景要求生成过程同时受到未来信息的引导时,自回归框架暴露出结构性缺陷。一个典型场景是相机轨迹引导的视频生成:给定一条预定义的相机运动路径(例如围绕物体旋转、穿行一条走廊),模型需要在每一帧生成与新相机位姿对应的图像,同时保持整个场景的三维一致性和帧间的连贯性。

在自回归范式下,模型在生成当前帧时只能看到过去的帧,无法知晓未来的相机位置。当相机路径出现大范围运动或回环时,模型可能在早期帧中生成一个与后期相机视角冲突的物体或结构,导致 “碰撞”——即相机在后续帧中进入了一个本不应该有物体的区域,或者场景元素在帧间发生不合理的形变。一旦发生碰撞,自回归生成的错误会迅速累积,使后续帧完全崩溃。这一问题本质上源于缺乏未来前瞻能力:模型无法在生成早期帧时预留出未来视角所需的空间结构。

为了解决这一局限,作者提出了生成式视角拼接(GVS)。其核心思想是将整个视频序列的生成从串行改为并行,使得每一帧的生成都能同时参照整个相机轨迹条件,从而在全局层面保证场景的忠实性和帧间一致性。这一想法受到机器人规划领域 “规划扩散拼接”(diffusion stitching)技术的启发,但将其迁移到视频生成领域,并发展出一套适用于通用视频扩散模型的方法。

核心方法和技术细节

GVS 建立在 Diffusion Forcing 这一序列扩散框架之上。Diffusion Forcing 是一种训练和采样策略,它允许模型在生成过程中灵活地混合自回归模式和批处理模式:在训练时,模型学习在不同噪声水平下,如何根据过去帧的部分观测来重建当前帧;在采样时,模型不仅可以逐步去噪,还能在任意时刻回退或重新组合噪声与观测。这一框架天然提供了拼接所需的 “可提供性”(affordances):模型能够接受任意噪声状态的帧,并依据相邻帧的条件生成一致的干净图像。

GVS 的核心算法是一种并行采样拼接策略。设我们要生成长度为 TT 的视频序列,对应一条预定义相机轨迹。每帧的生成条件包括相机参数和文本描述,但没有真实的场景数据。算法步骤如下:

  1. 将所有帧初始化为随机高斯噪声,形成初始噪声序列 {xt(0)}t=1T\{\mathbf{x}_t^{(0)}\}_{t=1}^T。
  2. 在每一步扩散去噪迭代中,同时对整段序列进行去噪,得到稍干净的序列 {xt(k)}\{\mathbf{x}_t^{(k)}\}。
  3. 利用 Diffusion Forcing 的 “混合观测” 特性,在每次迭代后,将序列中某些帧替换为从其它帧出发重新推理出来的干净图像,以实现帧间的相互一致。这种替换操作相当于在扩散采样过程中动态拼接不同片段。
  4. 经过若干轮迭代,所有帧收敛到一个全局一致的干净视频序列。

为了让拼接过程更稳定且具备时序连贯性,作者进一步提出了 Omni Guidance 技术。传统的生成模型通常仅通过左侧历史帧进行条件化,而 Omni Guidance 在去噪过程中同时条件化于过去和未来的帧。具体实现上,模型在生成第 tt 帧时,不仅接收来自 t−1t-1 帧的信息流,还接收来自 t+1t+1 帧的反向信息流,从而在去噪的每一步都修正当前帧,使其既符合历史又符合未来。这种双向条件引导极大地增强了拼接时的帧间一致性,尤其对于需要关闭回环的长序列至关重要。

另一个关键组件是闭环机制。在相机轨迹形成闭环(如回到起点或交叉路径)的情形下,GVS 利用 Omni Guidance 在整个环上进行一致性传播。算法在并行采样中识别出环上对应的帧对(例如第 ii 帧和第 jj 帧应看到同一场景的同一位置),将它们视为双向条件约束,在去噪迭代中强制其内容趋同,从而在最终视频中实现无缝闭合。这一点在 “不可能的楼梯” 这类需要视觉错觉保持全局一致的路径上尤为突出。

值得注意的是,GVS 不需要针对拼接进行任何额外的模型训练。它直接使用现成的、用 Diffusion Forcing 训练的任意视频模型,仅通过改写采样逻辑即可实现拼接。这与以往需要专门训练拼接模型的方案有本质区别。

创新点和贡献

论文的创新点主要体现在以下三方面:

  1. 将扩散拼接从机器人规划迁移到视频生成。机器人规划中的拼接用于组合可行轨迹段,而 GVS 将其用于生成跨相机轨迹一致的视觉内容,为视频扩散模型增加了全局规划能力。
  2. 揭示 Diffusion Forcing 的拼接可提供性。论文论证并实验证明了 Diffusion Forcing 框架本身即具备支持拼接采样的特性,无需修改模型结构或重新训练。这为社区提供了一个即插即用的工具:任何基于 Diffusion Forcing 的视频模型都可以立刻启用 GVS。
  3. 提出 Omni Guidance 和闭环机制。双向条件引导显著增强了拼接的时序稳定性,使长序列闭环生成成为可能,解决了传统自回归方法无法处理回环路径的痛点。

实验结果分析

论文在项目页面(https://andrewsonga.github.io/gvs)上展示了大量定性结果,包括室内房间旋转、走廊穿行、螺旋下降以及 “不可能的楼梯” 等复杂相机轨迹。观察到的现象包括:

  • 无碰撞生成:在所有展示的轨迹中,相机平稳穿梭,未出现穿模或场景结构突变。
  • 帧间一致性:相邻帧之间物体轮廓、纹理和空间位置平滑变化,没有闪烁或跳变。
  • 闭环质量:对于回环路径,起点和终点画面高度一致,证明了 Omniguidance 和闭环拼接的有效性。
  • 比较优势:论文虽未提供数字指标对比表格,但通过视频对比直观展示:自回归基线在轨迹后半段出现严重伪影和崩溃,而 GVS 始终保持稳定。

由于论文强调视觉效果,定量评估难以通过传统图像质量指标(如 FVD)完全捕捉,但作者明确指出 “结果最好以视频形式观看”,说明动态连贯性和物理合理性是其核心评价维度。局限在于目前缺少标准化的相机引导视频数据集和对应的评价基准,这一领域仍有待发展。

实践建议

GVS 的方法可直接应用于需要相机路径控制的三维场景生成和视频创作工具中。对于希望复现或利用该技术的开发者,以下几点具有实践价值:

  • 模型选择:确保使用基于 Diffusion Forcing 框架训练的视频扩散模型。如果不是,需先按该框架重新训练或微调。论文未提供具体训练配方,但可参考 Diffusion Forcing 原论文的实现。
  • 采样参数调整:并行拼接涉及噪声调度和拼接迭代次数。实验时,应从小规模序列开始,观察收敛速度和一致程度,再逐步延长序列。Omni Guidance 的强度可能需要作为超参数调节。
  • 闭环应用:在定义相机路径时,显式标记需要闭合的帧对,并在拼接循环中引入这些位置的身份损失或特征匹配约束。论文的闭环机制依赖双向条件,实践中可通过在序列末尾拼接开头帧并施加一致性损失来实现。
  • 计算资源:并行采样整个序列会占用比自回归方案更多的 GPU 显存,尤其是当序列长度和分辨率增加时。可采用滑动窗口分段拼接(先拼接局部片段,再拼接片段之间)来降低峰值显存需求,之后在主序列上执行全局精细拼接,以平衡质量与资源消耗。
  • 评估方法:当前缺乏客观评价协议,建议在研发阶段结合用户研究(如双选项强迫选择偏好)与经典视频质量指标进行综合评估,重点考察相机路径上的物理一致性和无碰撞通过率。

通过将 GVS 集成到交互式内容创作流水线,创作者可以预先设计任意相机运动,并立刻获得全景一致的场景视频,在游戏预览、建筑漫游和虚拟制片等场景中具有广阔的应用前景。