AnyView:合成动态场景中的任意新视图

AnyView: Synthesizing Any Novel View in Dynamic Scenes

arXiv: 2601.16982v1

论文信息

标题: AnyView: Synthesizing Any Novel View in Dynamic Scenes

作者: Basile Van Hoorick, Dian Chen, Shun Iwase, et al.

发布日期: 2026-01-23

arXiv ID: 2601.16982v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:给定一段单目动态场景视频,如何生成任意新视角下的视频,尤其是在相机位置大幅度变化、两视角重叠极少的 “极端” 条件下,仍能保持视频的时空一致性。
  • 核心方法:提出基于扩散变换器的 AnyView 框架,将输入视频和待生成视频的相机参数都用密集 Plücker 光线编码,与像素一同送入模型,无需显式 3D 重建或深度估计,纯粹从大规模多域数据中学习隐式 4D 表示。
  • 关键结果:在专门设计的 AnyViewBench 极端动态视角合成基准上,AnyView 的零样本性能显著超越所有基线——在 8 个分布内数据集上平均 PSNR 达到 17.78,而最好的显式重建基线仅为 12.82(表 3)。
  • 主要局限:对于输入视频中完全被遮挡、从未出现的区域,生成结果存在本质上的多模态不确定性,模型只能给出 “合理” 推测而无法保证真实对应(论文图 9)。
  • 适合读者:从事视频生成、3D/4D 视觉、自动驾驶、机器人仿真、VR/AR 世界模型等方向的研究者与工程师。

论文背景和研究动机

“仅凭一个单目视频,想象另一个位置的摄像头会看到什么。” 这是计算机视觉中极具挑战的动态新视角合成(Dynamic View Synthesis,DVS)任务。传统方法多在小视角变化、高画面重叠的 “窄域” 设定下取得不错效果,但它们普遍依赖显式 3D 重建:先深度估计、再点云重投影、最后用图像修复填补空洞。这类流水线在相机位移剧烈、重叠几乎为零时极易崩溃,因为深度估计误差会层层放大,且缺失区域过大,修复难以保持时空一致。

另一方面,人类却能轻松做到——我们看到一个场景,即使眼睛看不到物体的另一侧,大脑也会自然而然地对被遮挡部分进行 “补全”,并推断动态物体的合理运动。这种强大的先验并非精确重建,而是关于形状、语义、材质和运动的分布性理解。论文的目标就是将这种归纳偏置赋予生成式视频模型,使其能够在极端相机轨迹下合成感知上真实、时间上稳定、空间上自洽的视频。

为此,作者提出了 AnyView,一个基于扩散的视频生成框架。它有意弱化显式几何偏置,把相机参数编码成密集 Plücker 光线图,和像素帧一同输入网络,让模型从数据中自主学习多视角几何和动态补全能力。同时,针对现有基准大多只在窄域小动作下评测的缺陷,工作又构建了 AnyViewBench,统一规范化了极端 DVS 的评测方式,覆盖驾驶、机器人、人类活动三大领域,为这一方向提供了更具挑战性的标尺。

核心方法和技术细节

AnyView 的输入是单目 RGB 视频 Vx∈RT×H×W×3\boldsymbol{V}_x \in \mathbb{R}^{T\times H\times W\times 3} 以及对应的 6 自由度相机轨迹 cxc_x 和内参 ixi_x,目标是生成在指定虚拟相机轨迹 cy,iyc_y, i_y 下的视频 Vy\boldsymbol{V}_y。此处相机轨迹被定义为一系列 SE(3)\text{SE}(3) 矩阵,所有坐标统一变换到以 t=0t=0 时刻目标相机为原点的参考系,避免绝对尺度混淆。

架构设计:模型以 NVIDIA 的 Cosmos‑Predict2‑2B 扩散变换器为基座,遵循 “简单可扩展” 原则,不使用任何显式深度图或点云重投影。它将两个视角的 RGB 像素和相机信息分别编码后,沿通道维拼接、再沿序列维堆叠,送入扩散模型迭代去噪。

相机信息的编码采用 Plücker 表示 P=(r,m)\boldsymbol{P} = (\boldsymbol{r}, \boldsymbol{m})。对每个像素,射线向量 r\boldsymbol{r} 表示从相机光心穿过该像素的方向,矩向量 m=r×o\boldsymbol{m} = \boldsymbol{r} \times \boldsymbol{o} 编码了光心位置(o\boldsymbol{o} 为相机中心)。这一 6 通道密集图天然支持非针孔模型,无需显式标定矩阵,因为每条射线的 3D 方向直接反映了任意内参。

输入视频和相机信息经视频分词器降维(时空下采样 4×8×8)后得到潜码 vx\boldsymbol{v}_x,而 Plücker 光线的射线和矩分量也被独立分词为 px\boldsymbol{p}_x 和 py\boldsymbol{p}_y。随后,来自同一视角的潜码和 Plücker 码在通道维联结,再与另一视角对应的联结 token 沿序列维合并,形成 2×t×h×w2\times t\times h\times w 个令牌,每个令牌维度为 3d3d。所有令牌加上旋转位置嵌入与视角区分嵌入,经自注意力和交叉注意力块处理后输出目标潜码 vy\boldsymbol{v}_y,解码得到最终视频。

训练数据:为使模型获得广泛的单视角/多视角/多时间监视,AnyView 混合了 12 个数据集,并归入 Robotics、Driving、3D、Other 四个象限,通过加权采样确保每个域各占 25% 的批次(图 3)。值得注意的是,还引入了新变体 Kubric‑5D,它相比 Kubric‑4D 大幅增加了相机轨迹的复杂性和物体布局多样性,进一步强化模型的泛化能力。

训练采用课程学习:先以 384 最大像素边训练 30,000 步,再微调至 576 边共 10,000 步,总步数 40,000,在 64 块 H200 GPU 上进行,全局批大小 512。为了融合多数据集中物理尺度不一的问题,每个数据集的相机位移向量都会除以其专属的归一化常数,使 Plücker 值控制在 [−1,1][-1, 1] 区间。

创新点和贡献

论文的核心贡献可以归纳为三个维度。

1. 提出极端动态视角合成的方法论转向 现有最先进的 DVS 方法几乎都依赖 “重投影 + 修复” 管线,在小重叠区域很容易复制输入视角,无法进行大幅度的场景外扩。AnyView 选择了纯隐式、数据驱动的道路,将相机控制从几何先验中解耦出来,证明在不依赖深度估计和测试时优化的情况下,也能实现任意视角的逼真生成。这一设计哲学带来的直接优势是:模型支持任意动态相机(静态、线性、复杂螺旋皆可),且不要求输入输出视角在开始时对齐,从而彻底释放了相机控制的自由度。

2. AnyViewBench:为极端 DVS 量身定制的基准 以往基准仅在固定或小幅度相机运动下评价,缺乏对 “极端” 情形的定义和统一评测。AnyViewBench 系统性地选定了 13 个测试数据集(表 1),区分 “分布内”(训练中见过的数据集/域)和 “零样本”(完全未见的域或站点)两大类别,涵盖相机外参、内参、运动模式、场景类型(驾驶、机器人、人类活动)等多维变化。每个场景都提供至少两路同步视频,从而可以直接对生成视频计算 PSNR、SSIM、LPIPS 等定量指标,终结了以往依赖代理设置或定性观察的混乱。

3. 多域数据融合与不确定性建模 通过混合 4D 多视角动态数据、3D 静态场景单一相机轨迹、以及大规模单目视频,AnyView 成功训练出一个 “通才” 时空表示。模型不仅学会了重建可见部分,还内建了合理的 “场景补全” 先验:例如在自动驾驶场景中,当车辆尚未出现在前视输入中时,左侧视角已经提前 “预测” 出将要驶入路口的红色轿车(图 6),这体现了模型对时空因果和对象永久性的隐式学习。同时,论文通过多次采样分析了生成的不确定性(图 9),指出被遮挡区域会出现期待中的多模态输出,表明模型捕捉到了环境的概率性结构。

实验结果分析

窄域基准对比(表 2) 在 DyCheck iPhone、Kubric‑4D(gradual)和 ParDom‑4D(gradual)等传统小角度 DVS 基准上,AnyView 展现出有竞争力的性能。在 Kubric‑4D 上 PSNR 21.21,虽低于需要测试时优化或用 GT 深度的方法(如 CogNVS 的 22.63),但在同样为零样本、无需辅助网络的类别中大幅领先 GCD(20.42)。在 ParDom‑4D 上 AnyView 达到 26.29,已超越部分显式方法,证明即使在窄域,隐式学习也可以逼近专门设计的几何流水线。

极端基准 AnyViewBench(表 3) 这才是论文真正的主场。在 8 个分布内数据集的平均值上,AnyView 以 PSNR 17.78 显著甩开最佳基线 TrajCrafter 的 12.82,SSIM 和 LPIPS 同样大幅领先。特别值得关注的是,所有需要深度图重投影的基线(GEN3C、TrajAttn、TrajCrafter、CogNVS)在极端重叠低、相机轨迹复杂的情形下明显挣扎,经常出现形变、撕裂和直接复制输入视角的现象(图 1 第三行)。而 AnyView 即使面对极度不同的目标姿态和高度不完整的视觉观察,也能保持场景几何、外观和动态的一致性。

在 5 个零样本数据集中,AnyView 平均 PSNR 12.03,同样优于所有基线。例如在 Argoverse 上达到 12.38,DDAD 上 11.44,而同类隐式方法 GCD 仅 11.45 和 9.81。定性结果也显示,AnyView 能根据极少的线索 “猜” 出合理的背景(篮球场、足球场等),且修复区域与整体场景和谐融合(图 7)。

实践建议

如果读者计划将 AnyView 或类似框架落地,以下几点值得注意。

1. 相机姿态与镜头畸变的前处理 模型接受密集 Plücker 光线图,因此您需要为所有视频帧提供准确的相机外参与内参(含畸变系数)。对于用广角或鱼眼镜头采集的真实数据,务必采用非针孔模型生成光线向量,否则边缘区域的几何会失准,导致合成质量下降。如果您面对的数据集缺少相机标定,可借助 SLAM 或 Structure-from-Motion 工具获得可信初值,但必须统一到世界坐标系(或 target 原点系)中。

2. 训练数据的领域配比与尺度归一化 AnyView 强依赖于多样化的多视角视频。在自建训练混合时,建议模仿论文将数据集分为若干领域,并通过加权采样防止某一域的数据量主导训练。同时,为每个数据集指定合适的位移归一化常数至关重要,它保证 Plücker 值的范围合理(−1-1 到 11)。实践中可统计该数据集的典型相机移动半径,并以其中位数或 95 分位数作为缩放因子。

3. 处理遮挡与不确定性 对于完全不可见区域,AnyView 输出的是概率性幻觉,这在自动驾驶安全性验证或机器人决策应用中可能直接使用会有风险。建议在这些场合增加多采样机制,通过生成多个可能版本并计算差异热力图,量化不确定区域,作为下游模块的提醒信号。例如在图 9 (a) 的黑色箱体内部,所有样本都生成水果但位置各异,这种一致性中的细微变化即可用于评估风险。

4. 速度与资源权衡 论文中 64 块 H200 GPU 训练 40,000 步不是轻量级任务。对于资源有限的团队,可考虑用较小的扩散基座、减少训练帧数或先在一个大域上预训练再微调。推理时,由于没有测试时优化,生成一段 41 帧视频大约 10 秒(表 2),已经适合交互式应用,但仍需高端 GPU。如果目标是长时间流式输出,可采用滑动窗口策略,但要注意帧间重叠区域的抖动控制,可通过后处理光流平滑缓解。

5. 下游应用场景

  • 机器人遥操作与数据增强:为重排、抓取等任务生成多视角同步视频,扩大训练分布,降低策略对单一视角的过拟合。
  • 自动驾驶仿真:将路测记录的一段前视视频,转换成侧向或鸟瞰视角,用于训练感知模型或验证规划在极限视角变化下的鲁棒性。
  • VR/AR 内容生成:从用户录制的一段立体视频扩展为可自由环顾的动态场景,提升沉浸感。

总之,AnyView 用简洁的架构解决了极端视角合成这一难题,但要发挥其最佳效用,仍需根据具体场景精细设计数据管线、相机标定流程和后验安全机制。