感知快慢:学习视频中的时间流

Seeing Fast and Slow: Learning the Flow of Time in Videos

arXiv: 2604.21931v1

论文信息

标题: Seeing Fast and Slow: Learning the Flow of Time in Videos

作者: Yen-Siang Wu, Rundong Luo, Jingsen Zhu, et al.

发布日期: 2026-04-23

arXiv ID: 2604.21931v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:这篇论文要解决视频中 “时间流逝” 的感知与操控问题——如何判断视频是否被加速或减速,如何按指定速度生成视频,以及如何将模糊的低帧率视频提升为清晰的高帧率慢动作。

  • 核心方法:利用音频音高变化提供跨模态监督来检测速度变化(图 2),通过 “时间等变性” 自监督约束训练速度预测模型(公式 1),并以此自动标注大规模慢动作数据集 SloMo-44K,进而训练可控制速度的视频生成与时间超分辨率模型。

  • 关键结果:所提出的速度变化检测模型在测试集上达到 92.4% 的准确率(见第 5.1 节),速度预测模型将机器与人类表现之间的差距显著缩小——Pearson 相关系数从 SOTA 的 0.508 提升至 0.735,而人类专家为 0.880(表 2)。

  • 主要局限:当视频缺乏明显运动线索或人物刻意缓慢移动时,速度理解模型可能被误导;生成模型依赖于预训练的 Wan 骨干网络,在架构创新或全参数微调方面仍有提升空间(见第 6 节)。

  • 适合读者:对视频理解、自监督学习、视频生成式模型、时间序列分析感兴趣的计算机视觉研究者,以及关注多媒体取证或内容创作工具的工程师。

论文背景和研究动机

人类天生对时间的流逝有着敏锐的直觉。即使没有明确的提示,我们也能感知到视频是否被加速或减速——水面的涟漪是否扩散得太快,物体下落的速度是否偏离了物理常识,人的动作是否显得迟钝。这种直觉反映的是我们对物理世界中事件展开速度的内隐理解。

然而,当前最先进的视频理解和生成模型普遍缺乏这种时间推理能力。论文指出,当被要求预测视频的播放速度时,现代视觉语言模型(如 Gemini 2.5 等)频繁 “产生幻觉” 或给出错误预测;当被要求生成特定速度的视频内容时,现有生成模型往往忽略速度指令,或者生成的视频在时间精度上极不可靠。

这一局限性并不令人意外。现代模型主要从标准帧率(24-60 FPS)的视频中学习,因此从未真正接触 “时间速度” 的概念。论文用了一个精妙的比喻:我们实际上是在要求模型 “从观察单一节奏来推断时间的可变性”。要让模型真正理解时间流并能控制时间动态,它们必须接触跨越完整时间连续谱的数据。

然而,获取大规模的慢动作视频标注数据极其困难。虽然线上存在海量的慢动作视频资源,但与之相关的帧率、播放速度、时间戳等元数据往往残缺不全。单纯依靠人工标注又耗时巨大且不够精确。这构成了整篇论文的现实出发点:如何在不依赖明确标签的前提下,让模型学会感知和操控时间。

核心方法和技术细节

论文的方法体系可以分为 “感知时间” 和 “操控时间” 两个递进的阶段,中间通过自动构建的大规模数据集将两者连接起来。

速度变化检测:从音频中 “偷师”

第一个核心洞见建立在一个简单但巧妙的物理原理上:时间-频率缩放。当视频的播放速度改变时,其音频的音高也会同步变化——加速会使音高上升,减速会使音高下降。论文利用这一原理,通过检测音频中音高发生显著变化的时刻,自动获取了超过 8000 个速度变化标签。这些标签随后被用于微调基于 VideoMAEv2 的视觉检测器(仅使用视觉输入),训练目标为标准二元交叉熵损失。

速度预测:让模型学会 “等变性”

检测到速度变化后,自然的问题是:视频具体被加速或减速了多少?由于缺乏可靠的监督信号,论文设计了一个自监督约束——速度估计模型应对时间重采样具有等变性。具体来说,若将一段视频加速 kk 倍,其预测速度也应恰好缩放 kk 倍。这一关系被形式化为对数空间中的均方误差损失:

L=(log⁡fθ(Vk)−log⁡(k⋅fθ(V)))2L = \left( \log f_\theta(V_k) - \log(k \cdot f_\theta(V)) \right)^2

其中 VkV_k 是原视频 VV 被加速 kk 倍后的版本,fθf_\theta 是速度估计器。为了让预测结果锚定到绝对速度尺度,论文还引入少量已知真实播放速度的视频进行校准训练。

一个在实践中发现的问题是,模型在面对极慢动作视频时容易低估速度。论文的解决方案是 “迭代预测”:先预测一个初始速度 xx,据此将视频加速到接近正常速度,再重新估计,重复三次。实验证明这一策略显著提升了预测准确率(表 7)。

SloMo-44K 数据集:从噪音中淘金

有了可靠的速度感知模型,论文将其部署到从 YouTube、Vimeo、Flickr 等平台收集的海量视频上。首先用速度变化检测器将视频切分为速度均一的片段,再用速度估计器为每个片段标注播放速度,同时进行一系列质量过滤(去除 CGI、屏幕录制、低画质等)。最终构建的 SloMo-44K 包含 44,632 个慢动作视频片段,总计 1800 万帧,是此前最大同类数据集的 70 倍以上(视频数量维度)和 150 倍以上(帧数维度),且场景和运动模式的多样性远超以往(表 1)。

速度条件视频生成:注入显式速度信号

传统方法试图通过文本修饰词(如 “超慢动作”“慢动作”)来控制生成视频的播放速度,但论文发现这种方式效果极差,因为物理运动线索与提示词中的其他语义因素高度纠缠。

论文的做法是在图像到视频扩散模型(基于 Wan2.1-I2V)中直接注入显式的速度条件。速度值先被离散化为对数分布的 “桶”(覆盖 0.01× 到 1.0×),桶编号通过正弦位置编码和 MLP 后加入到扩散模型的去噪时间步嵌入中;同时在每一帧的潜在特征上施加逐帧的速度调制。这种方式让模型将去噪时间步与视频的时间速度明确对齐。

极端时间超分辨率:处理运动模糊

时间超分辨率的目标是将低帧率、运动模糊的视频恢复为高帧率、清晰的慢动作序列。论文利用 SloMo-44K 的高帧率特性,通过平均相邻帧再下采样的方式合成出携带真实运动模糊的训练对,使模型能够联合执行去模糊和帧插值。实验设置聚焦于 8 倍上采样。

创新点和贡献

这篇论文的首要贡献是将 “时间” 确立为视频学习中可被感知和操控的维度,并搭建了从感知到操控的完整技术栈。

在技术方法上,论文有三处突出的创新设计。第一是无标注条件下的时间感知训练:利用音视频跨模态信号和时间等变性自监督约束,避开了人工标注的瓶颈。第二是SloMo-44K 数据集本身:它不仅在规模上远超现有高帧率数据集,更关键的是覆盖了极其多样的真实世界场景和跨越多个数量级的时间尺度(从正常速度到 100 倍慢动作),这为训练具备精细时间建模能力的生成模型提供了前提条件。第三是速度条件注入方式:将播放速度直接映射为去噪时间步的条件信号,使得速度控制成为一个强大的、解耦的控制维度,而非只是提示词中的一个模糊修饰。

从应用角度看,论文展示了一个自洽的数据飞轮:用自监督方法训练感知模型,用感知模型构建大规模高质量数据集,再用该数据集训练能力更强的生成和操控模型。这种模式对于许多缺乏标注数据的视觉任务具有示范意义。

实验结果分析

速度感知任务

速度变化检测方面,论文模型达到了 92.4% 的测试准确率,远超 Gemini 2.5 的 59.5% 和基于光流的基线方法的 80.4%(第 5.1 节)。论文还展示了模型对《X 战警》中时间冻结效果场景的分析能力,准确识别出从慢动作到正常速度的过渡时刻。

速度预测方面,模型取得了 0.735 的 Pearson 相关系数和 0.706 的 Spearman 秩相关系数(表 2),虽然仍低于人类专家标注的 0.880 和 0.783,但已大幅领先于 Pulse-of-Motion(分别为 0.508 和 0.525)、SpeedNet(0.476 和 0.331)等现有方法,实质性地缩小了机器与人类之间的差距。

速度条件视频生成

论文采用了多维度评估:FID 和 FVD 衡量生成质量,不同速度条件下平均光流幅值的变化衡量速度可控性。模型在 FID(68.4)和 FVD(1114.1)上均优于基线方法(Wan2.1 为 72.2 和 1266.8,见表 5)。更关键的是,当速度条件从超慢切换到正常时,模型生成视频的平均光流幅值呈现出清晰的递增趋势,而基线方法几乎无变化(图 6a),表明速度控制信号已被有效学习。

时间超分辨率

在传统的 “清晰输入” 设定下,模型在视频级指标 FloLPIPS 和 FVD 上优于 FILM、LDMVFI 和 Generative Inbetween 等方法(表 3)。在实际拍摄中更常见的 “模糊输入” 设定下,模型的优势更为明显——在 SloMo-44K 测试集的所有指标上均取得最优(表 4),FVD 从次优方法的 250.0 大幅降至 134.3。用户研究进一步验证了这一结果:在真实输入设定下,人类评测者对模型生成视频的偏好率超过 90%(图 6b)。

消融实验的关键发现

两项消融实验证实了方法论基础的重要性。一是迭代预测机制的引入使模型和 VideoLLM 的速度预测准确率均获得一致提升(表 7)。二是用标准帧率视频(即使经过人工减速增强)训练的速度条件生成模型会产生 “卡顿伪影”,而使用 SloMo-44K 训练的模型则能忠实合成慢动作动态(图 7 和表 6),这直接证明了真实高帧率数据对于学习精细时间动态的不可替代性。

实践建议

对于希望应用或扩展这项工作的工程师和研究者,以下几方面值得关注。

在视频内容审核与取证领域,速度变化检测模型具有直接应用价值。论文展示了对电影效果片段的准确检测(图 1 第一行),类似能力可迁移至深度伪造检测——恶意篡改视频常伴随不自然的局部速度变化。建议在实践中将速度变化检测作为一种辅助的异常检测手段,与画面内容分析、元数据验证等方法结合使用。

在视频生成方向,速度条件注入的设计思路可以推广到其他连续可控属性的生成任务中。关键做法是将目标属性量化为离散桶,并同时注入去噪时间步和逐帧特征。对于超慢动作生成(低于 0.1×),SloMo-44K 的训练数据覆盖了这部分极端时间尺度,但普通标准视频数据集完全缺失这一区域,因此使用该数据集或采用类似的慢动作数据收集策略至关重要。

在视频增强与修复领域,论文的时间超分辨率方法为处理老旧低帧率资料或有运动模糊的视频提供了新思路。传统上帧插值和去模糊被视为独立任务,但真实世界低帧率视频的问题恰恰来自更长的曝光时间。论文使用的 “先合成真实模糊,再训练联合恢复” 的策略可迁移至其他退化类型,建议在实际部署时根据目标场景的曝光特性调整模糊合成的窗口大小。

关于数据构建流程,论文展示的 “自监督感知模型 → 自动标注 → 数据集构建 → 生成模型训练” 流水线具有高度可复现性。对于面临标注瓶颈的视觉任务,可以首先寻找是否存在自然耦合的信号(如音频、时间重采样)提供免费监督,然后用以此训练的模型进行规模化数据标注。需要注意的是,论文在慢动作分类阶段仍依赖少量人工标注来训练过滤模型(见补充材料 B.2 节),完全无人工介入的数据构建目标仍未完全实现。