视频生成的运动归因
Motion Attribution for Video Generation
论文信息
标题: Motion Attribution for Video Generation
作者: Xindi Wu, Despoina Paschalidou, Jun Gao, et al.
发布日期: 2026-01-13
arXiv ID: 2601.08828v1
PDF 链接: 下载 PDF
3 分钟速览
-
研究问题:视频生成模型的运动质量与训练数据紧密相关,但具体是哪些训练片段影响了生成视频中的运动,此前缺乏系统研究。论文旨在回答 “哪个微调片段会提升或降低视频的时序动态表现”。
-
核心方法:提出 Motive(MOTIon attribution for Video gEneration)框架——通过光流提取运动信息并构建运动感知权重,在损失层面为动态区域的梯度赋予更高重要性,从而将归因信号聚焦于运动而非静态外观;结合单时间步、共享噪声、Fastfood 投影等近似技巧,使梯度归因能在十亿参数模型与万级视频数据上可行。
-
关键结果:仅使用 10% 的微调数据,Motive 选择的子集在 VBench 动态程度上达到 47.6%,不仅远超随机选取(41.3%)和全视频级别归因(43.8%),甚至超越使用全部数据微调的模型(42.0%);人类评估中获得 74.1% 的胜率(对比预训练基模型)。
-
主要局限:运动显著性依赖 AllTracker 跟踪器的质量,严重遮挡或透明物体会导致运动掩膜退化;相机纯移动与细微运动目前难以在没有额外信号(如相机姿态)的情况下分离。
-
适合读者:从事视频生成、扩散模型训练与数据工程的研究者和工程师,以及对训练数据归因、选择性微调感兴趣的人工智能从业者。
论文背景和研究动机
视频生成模型近几年进步迅速,但其运动生成能力仍是一个核心挑战。运动是视频区别于图像的本质要素,它涵盖物体的轨迹、形变、相机移动以及物理交互。尽管学者们不断改进模型架构(如时序注意力、3D‑UNet),大量实践表明,生成质量的飞跃往往来自数据规模与质量的提升。然而,一个根本性问题始终未被系统回答:哪些训练片段驱动了生成视频中的运动?
传统的扩散模型数据归因方法主要面向图像,通过影响函数或梯度相似度衡量单个训练样本对测试样本的贡献。若将这些方法直接套用到视频上,会将运动与外观混为一谈,导致归因结果过度反映背景、纹理等静态信息,而无法揭示时序动态的来源。此外,视频归因面临三个新挑战:
- 运动定位:需要让归因集中在 “正在运动” 的区域,而非静态背景;
- 时序扩展:梯度必须在时间轴上整合,计算与存储成本随帧数线性增长;
- 时间关系捕捉:速度、加速度、轨迹一致性等仅靠单帧无法度量的特性必须被纳入考量。
在微调场景中,这一问题尤为突出。微调阶段可用的数据量远少于预训练,但精挑细选的高质量片段能带来巨大影响。若能在微调前识别出对特定运动模式最具影响力的训练样本,就能针对性地提升时序一致性和物理合理性,同时避免无效甚至有害的片段。这就是本文提出 Motive 框架的动机:设计一种运动中心的、可扩展的梯度归因方法,专门追踪生成运动与训练数据之间的因果联系。
核心方法和技术细节
Motive 的方法设计围绕 “可扩展性” 和 “运动特异性” 两个目标展开。整体流程可以概括为三个关键步骤:运动感知的梯度计算、高效近似、以及基于归因得分的微调子集选择。
运动感知的梯度归因
首先,使用 AllTracker 对像素空间提取光流,得到每个像素的位移向量及置信度。定义运动幅度 ,然后对全视频的所有像素进行最小-最大归一化,得到归一化运动权重 。权重通过双线性下采样映射到 VAE 的潜在空间(与扩散模型计算的损失维度对齐),得到潜在运动权重 。
在预训练模型上,对给定的微调数据或查询视频,利用固定的时间步 和共享噪声 进行单步前向扩散,并计算逐位置的重构误差。将运动权重与逐位置误差相乘,再在帧和空间上取平均,得到运动加权损失:
当 全为 1 时,该损失退化为普通的扩散损失。运动加权损失只改变归因时的梯度方向,不影响前向加噪和生成过程。对测试样本和每个训练样本分别求运动加权损失的梯度,经归一化后计算余弦相似度,即得到运动归因分数 。
可扩展的近似技术
对十亿参数模型存储完整梯度向量并计算内积,存储与计算开销均难以接受。Motive 采用了一套高效的近似组合:
- 单样本估计:使用固定的 和 代替多时间步、多噪声采样的平均。实验表明,选取去噪过程中段的时间步(如 1000 步中的第 751 步)能在方差与计算间取得良好平衡。
- Fastfood 投影:利用 Johnson‑Lindenstrauss 变换将梯度从原始维度 投影到低维空间 (如 512 维)。投影矩阵通过 Walsh‑Hadamard 矩阵、对角随机矩阵等结构实现,投影后存储成本仅为 ,且内积计算为 。
- 帧长度修正:不同时长的视频会产生不同量级的梯度,导致长视频被错误地赋予高影响分数。Motive 将梯度除以帧数 后再进行 归一化,显著缓解了帧长偏差(见论文第 3.3 节)。
最终每个样本以归一化低维向量 表示,归因分数就是查询向量与训练向量之间的内积。
微调子集选择
给定若干查询视频(如 10 类动作,每类 5 个),对每个查询分别计算所有训练样本的影响分数,然后采用多数投票机制:如果一个训练样本在某个查询上的分数超过预设分位数阈值,则获得该查询的一票。将所有查询的票数相加,选出票数最高的前 个样本组合成微调数据集。这种做法能筛选出对多种运动模式均有正面影响的通用性片段。
创新点和贡献
- 首次提出视频生成中的运动归因:此前所有的扩散模型数据归因工作均针对图像或视频的静态内容,Motive 是第一个将归因目标明确锁定在 “运动” 上的框架。
- 运动感知的梯度重加权:通过光流提取运动掩膜并在损失空间施加权重,让梯度信号自然地聚焦于动态区域。这一设计未改变模型结构或训练目标,仅影响归因计算,简洁而有效。
- 实用的全流程可扩展性:结合单时间步、共享噪声和 Fastfood 投影,将归因成本控制在可实际部署的范围。论文详细计算了梯度计算、存储和排序的开销(见第 3.6 节),并指出在 64 块 GPU 上可将 10k 样本的归因时间压缩到约 2.3 小时。
- 帧长度偏差的显式矫正:通过帧数归一化消除了视频长度带来的伪相关,使归因排名更真实地反映运动质量。
- 在微调中验证实效:使用仅 10% 的数据微调,运动动态程度和人类评估结果均优于随机选择、运动幅度选择、V‑JEPA 嵌入选择以及全视频级别归因选择,甚至超过使用全部数据的微调(见论文表 1 和表 2)。
实验结果分析
论文在 Wan2.1‑T2V‑1.3B 模型上进行了详尽评估,微调数据来自 VIDGEN‑1M 和 4DNeX‑10M,各取 1 万个视频片段。查询视频覆盖 10 种明确运动类别(如压缩、弹跳、漂浮、旋转等)。所有对比方法均运行在相同的 10% 数据预算下,并使用 VBench 的六个指标和人工偏好投票进行衡量。
表 1 的关键信息:Motive 在运动核心指标上表现突出,动态程度为 47.6%,大幅超过随机选择的 41.3% 和全视频归因的 43.8%,也优于全数据微调的 42.0%。同时,主体一致性 (96.3%) 和美学质量 (46.0%) 均有提升,运动平滑度维持在高水平 (96.3%)。这证明运动感知归因筛选出的数据既能强化动态表现,又不会损害其他视觉质量。
图 2 和图 3 的定性分析:归因分数排名高的训练样本通常包含清晰的、具有物理意义的目标运动(如水流推动物体、行星旋转),而低分样本往往是静态镜头、纯相机移动或卡通风格内容。在压缩、旋转、滑行、自由落体等场景的生成对比中,Motive 微调的模型表现出更真实的形变、旋转轨迹和物理响应。
人类评估:17 名参与者对 50 个视频双盲对比显示,Motive 在与预训练基模型对比中获得 74.1% 胜率,与全数据微调模型对比也达到 53.1% 胜率(见论文表 2),说明感知层面的运动质量确有切实改善。
消融实验:固定 的单时间步归因与多时间步基准的斯皮尔曼等级相关系数为 66%,投影维度 512 时相关系数可达 74.7%(见图 4),证明了简化和投影对排名质量的保持。帧长度归一化将长度相关偏差降低了 54.0%,且使归因结果在视觉上呈现一致的运动主题(见图 5)。
实践建议
对于希望利用 Motive 提升视频生成运动质量的团队,以下几点值得参考:
-
运动归因作为数据清洗工具:在微调或持续训练前,对候选数据集运行一次 Motive,获得每个样本对不同目标运动的影响分数。优先保留高影响得分、移除低分及负影响样本,能有效浓缩数据中的运动信息,减少训练时间与计算开支。
-
帧长度标准化:构建数据集时务必统一帧数和帧率(如论文使用的 81 帧、16fps),或在归因阶段对梯度除以帧数。忽略此步骤会导致排行榜被长视频统治,扭曲筛选结果。
-
权衡投影维度与存储:投影维度 建议从 512 起步,它能在 10 亿参数模型上提供良好的排名保持率(斯皮尔曼相关 74.7%),同时将单样本存储降至约 2KB。若 GPU 内存和存储充裕,可适当增大至 1024 或 2048 以获取微小提升,但边际收益递减。
-
单时间步部署:可在训练完成的最终模型上,固定一个中间去噪步(如 751)进行梯度提取。这已足够维持样本间的相对排名,无需执行昂贵多步采样。
-
多查询聚合:若要改善模型的普适运动能力,应采用多数投票而非简单平均分数。这可以避免个别查询的异常分数主导筛选结果,选出对多数运动类型均有正面促进作用的通用片段。
-
运动跟踪器的审慎选择与补充:当视频中存在严重遮挡或透明物体时,AllTracker 提取的运动掩膜可能失效。此时可考虑加入相机姿态、深度估计等额外信号作为辅助,或对这类片段提前标记并单独审核。
-
端到端微调流程:先用 Motive 选出高影响子集,随后固定 VAE 与文本编码器,仅更新 DiT 骨干网络。实践表明,用 10% 优选数据即可达到甚至超越全数据微调的运动表现,显著节约 GPU 时间和资金成本。