ActCam:面向视频生成的零样本联合摄像机与三维运动控制

ActCam: Zero-Shot Joint Camera and 3D Motion Control for Video Generation

arXiv: 2605.06667v1

论文信息

标题: ActCam: Zero-Shot Joint Camera and 3D Motion Control for Video Generation

作者: Omar El Khalifi, Thomas Rossi, Oscar Fossey, et al.

发布日期: 2026-05-07

arXiv ID: 2605.06667v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:这篇论文要解决视频生成中同时精确控制演员动作(Motion)和摄像机轨迹(Camera)的难题,且无需额外模型训练。
  • 核心方法:利用现成的图像到视频扩散模型,通过构建摄像机视角对齐的深度图与姿态图作为条件信号,并采用 “先深度+姿态,后仅姿态” 的两阶段去噪调度,实现零样本联合控制。
  • 关键结果:在联合控制任务上,ActCam 的运动精度(MPJPE 0.2087)和几何一致性(SE 0.4546)均优于需要专门训练的 Uni3C(MPJPE 0.2121,SE 0.5665)(见表 1)。
  • 主要局限:深度图来自单目估计,质量粗糙可能影响最终细节;两阶段调度中的深度作用步数需手动设定;作者未提供对复杂多人交互场景的定量评估。
  • 适合读者:对视频生成、三维视觉、计算机图形学以及 AI 辅助影视创作感兴趣的算法研究员和工程师。

论文背景和研究动机

在视觉内容创作,尤其是实验电影制作中,一个引人入胜的镜头不仅取决于 “演员做什么”,还取决于 “摄像机如何移动”。现有视频生成方法在分别控制这两方面取得了进展,例如基于 2D 人体关键点的姿态控制,或基于 Plücker 射线的摄像机控制。然而,将它们结合起来却异常困难。

核心矛盾在于,当摄像机运动时,2D 控制信号会产生歧义:同一段 2D 关键点序列可能对应多种 3D 运动,且信号本身在摄像机旋转平移后就无法保持一致性。虽然 Uni3C 等近期工作尝试解决联合控制问题,但它们依赖于定制架构和专门微调。这带来了两个根本限制:第一,针对每个新出现的视频生成模型进行微调成本高昂且难以迁移;第二,为特定镜头使用专用模型,会与电影中其他镜头产生风格不一致,损害最终成片质量。

因此,这篇论文提出了 ActCam,一个完全零样本(zero-shot)的框架,其核心动机是:能否不训练任何新模型,仅利用现有视频扩散模型广泛支持的稠密条件机制(如深度图和人体姿态),就实现摄像机与动作的联合控制? 这使得 ActCam 可以即插即用到任何兼容的视频生成骨干模型上,极大地提升了灵活性和实用性。

核心方法和技术细节

ActCam 的方法论围绕一个核心直觉展开:要避免信号歧义,所有提供给生成模型的条件信息必须严格 “与目标摄像机对齐”。整个流程(见图 2)包含三个关键步骤。

第一步:摄像机对齐的条件构建

这项工作首先解决的是信息来源的几何一致性。给定一张参考图 IrefI_{\mathrm{ref}},它定义了角色身份和场景外观。为了获得干净的静态场景几何,ActCam 首先将参考图中的角色 “擦除”,然后用单目深度估计器(MoGe)预测纯背景深度图 Dbg\mathcal{D}_{\mathrm{bg}},重构出三维背景网格。

对于动态角色,ActCam 从驱动视频 VactV_{\mathrm{act}} 中恢复其四维运动序列(3D 人体姿态随时间的变化)。这避免了 2D 姿态在视角变化下的歧义。为了将这个运动 “植入” 到三维背景中,论文提出了一项精细的场景迁移(Scene Transfer)技术:它根据背景和参考图中的非角色区域,计算带权重的质心,然后沿深度轴对角色进行仿射对齐,确保角色双脚接地、交互正确,而不会悬空或穿透。

最终,在目标摄像机轨迹 C\mathcal{C} 的每个帧下,系统分别栅格化(rasterize)出两个条件信号:

  1. 纯姿态图:仅包含绘制在黑色背景上的角色骨架。
  2. 深度+姿态叠加图:将姿态骨架直接绘制在背景深度图上。

第二步:两阶段去噪调度

这是本论文最具巧思的设计。直接将深度与姿态叠加作为唯一条件,会过度约束生成过程。因为单目深度估计本身粗糙且不精确,全程使用会向画面注入静态背景和深度伪影。

ActCam 采用了分而治之的策略,将生成过程分为两个阶段:

  • 早期阶段(t≤tstopt \le t_{\mathrm{stop}}):此时扩散模型的去噪步骤负责构建图像的全局结构、场景布局和摄像机视差。ActCam 在此阶段提供深度+姿态联合条件,用深度图锁定背景的几何运动,为摄像机控制打下基础。
  • 后期阶段(t>tstopt > t_{\mathrm{stop}}):此时模型开始填充高频细节和精细纹理。如果继续使用粗糙的深度图,就会扭曲这些细节。因此,ActCam 刻意丢弃深度条件,转而仅使用精准的角色姿态图作为引导,释放模型的生成能力,产生逼真的局部细节而不过度制约。

这个调度策略的精髓在于:深度图负责 “搭骨架”(几何正确性),姿态图负责 “填血肉”(动态逼真度),两者各司其职且互不干扰。

创新点和贡献

  • 零样本联合控制范式:在完全不需要训练和微调模型的前提下,首次实现同一框架内对角色动作和摄像机轨迹的强联合控制。这打破了先前方法(如 Uni3C)需要为控制任务绑定专门训练的模型的限制,使其可以灵活适配最新最强的视频生成骨干模型。
  • 几何对齐的条件生成策略:提出了一套完整的由三维引导的条件准备流水线。通过 “参考图角色擦除+背景深度估计+4D 动态角色嵌入+场景迁移” 的组合拳,系统性解决了静态场景与动态角色在几何空间中的冲突问题,避免了角色重复、透视错误等典型失败模式。
  • 自适应的两阶段去噪调度:创新性地将不同类型的条件信号与去噪过程的不同阶段解耦。这一机制简明有效,通过对深度条件施加一个简单的时间掩码,平衡了全局几何约束与局部细节自由度,为解决 “粗糙条件过约束生成” 这一普遍问题提供了新思路。

实验结果分析

实验部分严格验证了 ActCam 的控制精度与生成质量。在联合控制(动态摄像机)基准测试中,ActCam 不仅全面优于需要训练的 Uni3C,更在关键指标上展现出显著优势。VBench 视觉质量综合得分达到 0.8497(Uni3C 为 0.8370),同时,衡量运动保真度的 MPJPE 误差降低至 0.2087,几何一致性 Sampson Error 大幅降低至 0.4546,表明生成视频的 3D 结构更加稳定、符合目标摄像机轨迹(见表 1)。

用户调研进一步证实了这一优势:在摄像机遵循度、运动忠实度和整体画质三个维度上,受试者一致显著偏好 ActCam 生成的结果(见图 3)。即使在静态摄像机这一更具竞争力的赛道上,ActCam 与众多专为动作迁移设计的强基线(如 MimicMotion、UniAnimate-DiT)对比,也取得了最高的综合 VBench 得分(86.47),证明了其基于 3D 的姿态管线相比传统 2D 关键点方法在遮挡和比例保持上的固有优势(见表 2)。

消融实验极其清晰地阐释了每个设计的作用:

  • 若完全不用深度条件(ND=0N_D=0),模型会将摄像机运动误解为角色自身运动,背景不产生应有的视差(见图 6)。
  • 若全程使用深度条件(ND=1N_D=1),则会 “锁定” 场景,使本应被角色拿起的杠铃等动态物体僵化静止(见图 5)。
  • 若跳过角色擦除或场景迁移,则会产生双影、错位等严重破绽(见图 7、8),印证了精确几何对齐的必要性。

实践建议

对于计划将 ActCam 思路应用于实际视频生成管线或二次开发的工程师和创作者,以下建议可供参考。

模型即插即用的前提条件: 构建自己的 ActCam 式管线时,所选择的视频生成骨干必须原生支持姿态图(pose map)和深度图(depth map)条件注入。目前典型的代表为 VACE 模型。确保其条件注入通道未被锁定,是实现零样本迁移的关键。

高质量素材是效果基线: 参考图的清晰度、角色边界的显著度直接影响后续的背景填充(inpainting)和深度估计质量。驱动视频中动作的完整性和无遮挡程度,则决定了 4D 运动恢复的精度。在实践中,应优先选取背景相对干净、角色与背景区分度高的参考图,以及动作覆盖完整无严重遮挡的驱动视频。

摄像机轨迹的设定要渐进式调整: 论文中预置了四种推、拉、摇、移的典型电影镜头。在实际应用中,建议从这些小幅度的镜头运动开始实验。过大或过于激烈的轨迹变化(如极速环绕)可能超出单目深度估计所构建场景的鲁棒边界,导致背景留白或扭曲。可以先在静态摄像机设定下验证角色动作迁移无误后,再逐步叠加摄像机运动。

关键参数 tstopt_{\mathrm{stop}} 的调优准则: t_stop 决定了深度条件作用的时长。作为一个经验法则:如果生成的视频背景僵硬、细节像贴在墙上,说明 t_stop 过大,需要提前结束深度引导;反之,如果摄像机感微弱、背景几乎不动,说明 t_stop 过小,需要增强深度引导。论文实验发现取总步数的 20% 通常是一个较优的平衡点(见图 4),但此值应作为起点而非绝对真理,最好根据具体场景的动态性(如是否有可交互物体)手动微调几个候选值。