Spatia:具备可更新空间记忆的视频生成

Spatia: Video Generation with Updatable Spatial Memory

arXiv: 2512.15716v1

论文信息

标题: Spatia: Video Generation with Updatable Spatial Memory

作者: Jinjing Zhao, Fangyun Wei, Zhening Liu, et al.

发布日期: 2025-12-17

arXiv ID: 2512.15716v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:现有视频生成模型因视频信号的高维稠密特性,难以编码长期历史信息,导致长序列生成中空间与时间一致性严重退化。
  • 核心方法:提出 Spatia 框架,显式维护一个 3D 场景点云作为 “空间记忆”,在生成过程中不断用视觉 SLAM 对其进行更新,并将投影后的场景点云作为条件送入以 ControlNet + Flow Matching 为核心的生成网络。
  • 关键结果:在 WorldScore 综合评测中,Spatia 的平均得分 69.73,显著超过最优秀的静态场景生成模型 Voyager(66.08)和基础视频模型 CogVideoX-I2V(60.64),且同时保持了较高的静态一致性(72.63)和动态质量(66.82)(表 1)。
  • 主要局限:论文未明确列举局限;但方法依赖点云估计与分割的准确性,且训练数据仅来自室内/室外静态场景数据集(RealEstate、SpatialVID),对包含复杂、快速动态对象的场景泛化能力尚未验证。
  • 适合读者:从事视频生成、世界模型、3D 视觉、具身 AI 方向的研究者与工程师,尤其希望对长时一致性、相机控制和可编辑视频生成进行深入工程化探索的读者。

论文背景和研究动机

视频生成正在从短片段合成向长视距、持久一致的世界模拟演进。然而,当前视频扩散模型在编码历史信息时面临本质障碍:一段 5 秒 480P 视频用主流编码器就能产生约 36,000 个时空 token,相当于 GPT-3 中约 27,000 词的 token 量。若要直接串联多个片段,token 数将爆炸性增长,使模型无法直接建模分钟甚至小时级别的上下文。相比之下,大语言模型(LLM)可以通过扩展上下文窗口或 KV‑缓存压缩轻松处理百万级 token,但视频生成的双向时空注意力使其无法沿用这类技术。因此,为视频生成器额外配备显式的空间记忆机制,是突破这一瓶颈的关键。

在此背景下,Spatia 的提出旨在解决两个核心问题:1) 如何在长序列生成中维持场景空间结构的一致性;2) 如何在保留空间记忆的同时,依然生成动态实体并与静态场景自然交互。以往的工作如 ViewCrafter、Voyager 等倾向于生成全静态场景,或者仅具备有限的记忆能力,无法兼顾高质量的动态内容。Spatia 通过将场景静态几何结构显式编码为可迭代更新的 3D 点云(空间记忆),并将其作为生成条件,实现了动态‑静态解耦,同时支持相机显式控制和 3D 交互编辑。

核心方法和技术细节

Spatia 包含训练和推理两个阶段,整体思想是将视频生成形式化为以文本、空间记忆(3D 点云)和时序上下文为条件的多模态条件生成问题。

训练数据预处理:对于每个训练视频,将其划分为目标片段、前一个片段和候选帧集合。从候选帧中随机选择一帧,利用 MapAnything 估计整个场景的 3D 点云 S\mathcal{S}。若视频中包含动态实体,先使用 Keye‑VL‑1.5 识别并生成文字提示,再由 ReferDINO 分割去除动态部分,确保空间记忆 S\mathcal{S} 仅保留静态场景。然后为所有帧(目标、前一个、候选)估计相机位姿,并将 S\mathcal{S} 通过各帧的位姿投影到 2D 平面,得到各视点对应的场景投影视频序列。此外,基于投影后的点云计算空间重叠程度(3D IoU),从候选帧中检索最多 7 个与目标片段空间最相关的参考帧,用于提供额外的空间线索。

网络架构:生成网络基于 Wan2.2 的流匹配框架(Flow Matching),并在其主网络旁额外引入 8 个 ControlNet 块。每个 ControlNet 块接收拼接后的前一个片段场景投影视频 SP\mathcal{S}_P 和目标片段场景投影视频 ST\mathcal{S}_T;经过处理后,其输出通过一个简单的 MLP 投影器分别与主网络块中对应的前一个帧特征和目标帧特征相加,从而注入空间记忆条件。文本 token 则通过交叉注意力层融入。另外,参考帧先被独立编码为 token 序列 XR\boldsymbol{X}_R,再与前一个帧 token XP\boldsymbol{X}_P 和当前噪声 xt\mathbf{x}_t 共同输入第一个主网络块。整个训练通过最小化预测速度 vt\mathbf{v}_t 与真实速度 ut\mathbf{u}_t 的均方误差进行:

L=Et,x0,XT∥vt−ut∥2.\mathcal{L} = \mathbb{E}_{t, \mathbf{x}_0, \boldsymbol{X_T}} \left\| \mathbf{v}_t - \mathbf{u}_t \right\|^2.

训练分两步:先冻结主网络,训练 ControlNet 块 8,000 次迭代;再冻结 ControlNet 块,用 LoRA(秩 64)微调主网络 5,000 次迭代,数据来自 RealEstate 和 SpatialVID 的 720P 视频。

推理时的记忆更新:推理以迭代方式进行。首先根据用户提供的初始图像估计 3D 场景点云;随后用户指定相机轨迹和文本指令,系统渲染出沿该轨迹的投影视频,并将其与参考帧和前一个片段一起输入网络生成新视频片段。每生成一个片段,用 MapAnything 再次更新全局点云(动态区域通过 SAM2 跟踪并排除),从而使空间记忆不断扩充,支持长视距生成和闭环一致。

创新点和贡献

Spatia 的核心创新在于将 3D 场景点云作为一种可更新的、显式的空间记忆无缝集成到视频扩散模型中,构建了动态‑静态解耦的生成范式。具体贡献包括:

  1. 空间记忆驱动的长视频生成:不同于仅依靠隐变量传递时序信息的现有方法,Spatia 通过维护场景点云实现了 “遇到过的地点不会忘”。当镜头多次经过同一区域时,系统能利用记忆生成结构一致的画面,这一点在闭环实验中得到了验证:在最后一个帧回到起始视点时,Spatia 的 PSNRC_C 达到 19.38,LPIPSC_C 低至 0.213,远优于 ViewCrafter、FlexWorld 等(表 3)。
  2. 动态‑静态解耦:空间记忆仅保存静态场景,同时生成的视频可包含运动实体,这两种内容各司其职,既保证了几何稳定性,又保留了场景的动态表现力。
  3. 显式相机控制:模仿 3DGS 的渲染思路,直接将相机路径作用于点云,得出 2D 投影序列作为条件,实现了精确且几何上有根据的相机控制,避免了传统将相机参数编码为隐向量所导致的控制不准确。
  4. 3D 感知交互编辑:在生成前,用户能直接编辑点云(如移除、添加或修改物体颜色),编辑效果会原样反映到生成视频中,为交互式内容创作提供了新的可能。

实验结果分析

视觉质量:在十分全面的 WorldScore 基准评测中(表 1),Spatia 的平均得分 69.73 显著高于其他两类模型。尤其是在静态各项指标(3D 一致性 86.40、照片一致性 89.10、风格一致性 80.09)以及动态一致性(运动平滑度 80.26)上,Spatia 不但大大超过基础视频模型,更优于专门的静态场景模型(如 Voyager 的物体控制仅 66.92,而 Spatia 为 52.32,但动态质量大幅领先)。在 RealEstate 测试集上(表 2),Spatia 同样取得了最高的 PSNR(18.58)、SSIM(0.646)和最低的 LPIPS(0.254),证明其生成画面在像素层面对齐程度最优。

记忆机制有效性:闭环视频生成实验(表 3)直观展示了空间记忆的持久性。Spatia 的 Match Accuracy 达到 0.698,意味着最终帧与初始帧的点对应率接近 70%,而此前方法大多在 0.5 以下。消融实验(表 4)显示,同时使用场景投影视频和参考帧时,相机控制分数从 58.81 提升到 84.47,PSNRC_C 从 15.55 提升到 19.38,证明这两部分对空间记忆同等关键。参考帧数量增加至 7 时性能趋于饱和,再增加无明显提升(表 5)。长视距生成中(表 6),随着片段数从 2 增加到 6,Spatia 的 PSNRC_C 仅从 19.38 略降至 18.04,而 Wan2.2 则从 13.00 暴跌到 10.74,说明空间记忆有效防止了误差积累。

点云密度影响:点云下采样立方体边长从 0.01 m 增大到 0.07 m 会导致 PSNR 从 18.58 降至 15.97(表 7),反映空间记忆精度与视觉质量的显著正相关。

实践建议

如果要在自己的视频生成系统或世界模拟器中复现或借鉴 Spatia 的思路,以下几点值得关注:

  1. 点云估计与分割流水线的鲁棒性:Spatia 高度依赖 MapAnything 的点云质量和动‑静分割精度。在实践中,可结合多个 SfM/SLAM 后端,并针对目标场景微调分割模型,避免因点云错误或动态物体残影导致空间记忆污染。
  2. 相机轨迹与内存的权衡:显式相机控制虽然精确,但需要预先定义轨迹或根据当前点云实时规划。推荐在交互式应用中提供简单的轨迹脚本接口,并利用连续的长序列 SLAM 增量更新点云。
  3. 训练数据与泛化:当前模型主要在静态场景为主的 RealEstate 和 SpatialVID 子集上训练。若要扩展到高度动态场景(如街道、体育赛事),应添加大量含动态实体和丰富视角变换的视频数据,并设计更鲁棒的动态分割策略。
  4. 工程集成:ControlNet 的两阶段训练(先控再微)与 LoRA 微调策略十分高效,可在 64 个 AMD MI250 GPU 上完成。迁移到其他主干模型时,可沿用类似的 ControlNet 注入方案,仅需调整特征维度匹配。
  5. 交互编辑管线:建议将点云编辑工具(如选择、平移、颜色修改)包装为可视化界面,用户直接在 3D 视图操作,然后实时驱动视频生成,以便在影视预览、虚拟场景漫游等应用中快速迭代。

通过上述实践,可以构建一个具备持久空间记忆、一致且可交互的长视距视频生成系统,并进一步向世界模型和具身 AI 领域拓展。