面向高效视频视觉语言模型的统一时空词元评分
Unified Spatio-Temporal Token Scoring for Efficient Video VLMs
论文信息
标题: Unified Spatio-Temporal Token Scoring for Efficient Video VLMs
作者: Jianrui Zhang, Yue Yang, Rohun Tripathi, et al.
发布日期: 2026-03-18
arXiv ID: 2603.18004v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:视频视觉语言模型(VLM)需要处理大量视觉令牌,导致训练和推理计算成本极高,现有剪枝方法要么只在视觉编码器内部剪枝,要么只在语言模型入口处剪枝,未能实现端到端的整体加速。
- 核心方法:提出 STTS(Spatio‑Temporal Token Scoring),一个轻量、可端到端训练的模块,同时从空间显著性和时间冗余两个维度为视觉令牌打分,结合注意力偏置注入与打包算法,在 ViT 和 LLM 中统一剪枝,无需文本条件或复杂合并。
- 关键结果:剪掉 50% 的视觉令牌,训练和推理吞吐量提升最高达 62%,而 13 个视频问答基准上的平均性能仅下降 0.7%(见表 1、图 5)。
- 主要局限:所有实验均围绕 Molmo2 架构展开,未验证在其他 VLM 上的泛化性;剪枝比率需要手工设定,且极度动态场景下时间冗余信号可能失效。
- 适合读者:从事视频理解、多模态大模型效率优化,以及需要在有限资源下部署长视频应用的研究者和工程师。
论文背景和研究动机
视频理解任务中的视觉语言模型(VLM)正面临越来越大的计算压力。为了捕捉时序信息,视频通常被分解为数十甚至数百帧,每一帧又被 ViT 切割成数百个 patch token,导致视觉令牌序列长度随帧数线性增长。标准的 Transformer 注意力机制具有 复杂度,长序列会严重拖慢训练速度、耗尽显存,并增大推理延迟。现存的一类剪枝方法集中在 ViT 内部,如 SPViT、ToMe 等,它们通过令牌合并或提前退出减少计算量,但主要面向单模态视觉任务,未考虑多模态下游目标,且往往忽略视频中大量的跨帧时间冗余。另一类方法在 ViT 输出后对送入 LLM 的令牌进行操作,例如空间池化、文本条件选择或跨帧合并,但这样做并没有减轻 ViT 本身的负担,而 ViT 恰恰是处理多帧时的计算瓶颈。
因此,作者认为需要一个 “全架构” 的解决方案——从 ViT 内部就开始剪枝,让减少后的令牌一直流向 LLM,从而同时加速两个模块。同时,剪枝策略既要考虑单帧内的空间重要性,也要利用视频特有的时间冗余,而不依赖复杂的文本条件选择或 token 合并算法。这便是 Spatio‑Temporal Token Scoring(STTS)的出发点。
核心方法和技术细节
STTS 的核心是一个轻量评分模块,它被插入到 ViT 的某个中间层之后(论文中固定在第 3 层后),由两部分组成:一个用于空间特征池化的自注意力层(Token Pooler)和一个 3 层 MLP 打分器。给定一个视频输入,ViT 前 层处理得到的特征 ( 帧,每帧 个 patch,维度 ),先经过 空间池化(,与 backbone Molmo2 对齐),再将当前帧与前一帧的池化特征拼接,以提供时间上下文。MLP 为每个池化后的 patch 输出一个重要性分数,低分意味着低重要性。
为了实现端到端的空间显著性学习,STTS 将这些分数扩展回原始分辨率,取对数后作为注意力偏置注入到后续 ViT 层( 层)的自注意力计算中:
其中 是扩展后的对数得分偏置。这样一来,下游多模态任务的梯度可以直接反向传播到打分器,让它学会从语义上识别每个 patch 的重要性,而不需文本条件。
时间维度的学习则通过一个辅助 MSE 损失显式引导。作者利用第 层池化特征计算相邻帧每个对应 patch 的余弦相似度,将 当作 “时间冗余的 ground truth”,让打分器的输出尽量逼近这个值。辅助损失定义为:
最终训练目标为下游任务损失(如视频问答的交叉熵)与所有 patch 辅助损失平均值的加权和。
经过第 层后,STTS 执行硬剪枝:丢掉得分最低的 token。由于每帧冗余度不同,剪枝后各帧保留的 token 数量不一,形成稀疏张量。为在 PyTorch 这样依赖密集矩阵乘法的框架中获得真实加速,作者设计了一个一阶降序装箱算法(first‑fit descending packing)。它将每帧视为一个具有可变长度 token 序列的 “物品”,按有效 token 数降序放入 “箱子”(即新的帧),将一个 batch 帧压缩为 个密集帧,同时生成相应的注意力掩码以保持帧内注意力的独立性。这一打包步骤使理论裁剪率直接转化为实际的硬件加速。
整个 STTS 模块插入后,视觉 token 数量从 ViT 内部就被永久削减,直接减少了后续所有 Transformer 层的计算量,包括 LLM 的输入令牌数,从而实现了统一的架构级加速。
创新点和贡献
- 统一的令牌剪枝框架:STTS 首次在 ViT 和 LLM 两端协同工作,用一个轻量模块同时解决视觉编码器和语言解码器的计算瓶颈,避免了两阶段剪枝的不协调。
- 无需文本条件的双轴评分:通过注意力偏置注入和辅助时间损失,STTS 隐式学习空间显著性,显式学习时间冗余,完全不需要繁重的文本条件选择器或跨模态注意力。
- 带真实加速的打包算法:提出的装箱式打包解决了非均匀剪枝带来的稀疏问题,保证理论 剪枝率转化成接近线性的吞吐量提升,且算法开销可忽略。
- 极低性能代价与可扩展性:在 13 个短/长视频 QA 基准上,50% 剪枝仅损失 0.7% 平均性能,效率提升最高达 2.25 倍(256 帧训练)。增加帧数时效率收益更加显著,并且可以与测试时缩放无缝结合,用等量计算预算处理更多帧,获得 0.5–1% 的额外性能增益。
实验结果分析
论文围绕 Molmo2(SigLIP 2 视觉编码器 + Qwen3-4B LLM)构建实验,使用 Molmo2 的视频 QA 子集微调,在 NextQA、Perception‑Test、MVBench、VideoMME、LongVideo 等 13 个数据集上进行评测。
剪枝性能(见表 1):在 30% 剪枝率下,STTS 在多个基准上甚至超过未剪枝基线(如 NextQA 84.1 vs 83.9),作者解释为评分器滤除了干扰背景噪声。50% 剪枝时,平均性能仅下降 0.7%,且下降曲线远比随机剪枝平坦(见图 1 右),展现出强鲁棒性。一个有趣的现象是 50% 剪枝的总体平均分(62.3)略高于 40%(62.1),这被归因于中等剪枝率时可能保留了一些 “边界” 噪声 token,稀释了注意力密度。
效率提升(见图 5 和附录表):在 64 帧、有效批大小 128 的设置下,50% 剪枝带来训练吞吐量 1.62 倍加速,MLVU 推理 1.61 倍加速。当帧数增至 256,训练加速比跃升至 2.25 倍,推理达 2.22 倍,充分体现了复杂度随序列长度二次方降低的优势。
消融实验:与直接使用余弦相似度剪枝的启发式方法相比,STTS 在长视频上领先约 0.5 个百分点,短视频上持平,说明学习型评分器在稀疏采样、时间冗余不足时仍可利用空间线索。去掉辅助损失的 STTS 变体性能甚至低于随机剪枝(表 2),证实了仅靠下游任务损失无法充分捕捉时间冗余。注入层深度 的扫描显示, 效果最佳,过早剪枝( 或 )会因特征未充分融合而造成性能下降。
测试时缩放(见表 3):对 50% 剪枝模型,在推理时将帧数从 64 增加到 128,以匹配基线的视觉 token 预算,长视频平均得分从 58.4 提升至 59.4,超过未剪枝基线的 59.0;30%+缩放更是达到 60.1。这表明 STTS 成功用 “空间信息密度” 换取 “时间覆盖密度”。
可视化分析:在游戏视频和真实人脸视频中,STTS 能保留前景人物、动态物体和面部表情,而启发式方法则盲目丢弃 “相似” 背景甚至人脸。这说明评分器在 LLM 下游梯度引导下,学会了区分语义上重要的区域。
实践建议
对于希望在自己的系统中部署高效视频 VLM 的团队,STTS 提供了一个模块化、低侵入的优化方案。具体实践建议如下:
- 架构适配:STTS 不依赖特定 backbone,只要含有标准 ViT 和 token 到 LLM 的通道即可复用。若当前模型也使用类似 Molmo2 的 pooling 策略(如 3×3 空间池化),可直接插入评分模块并微调。
- 训练集成:由于 STTS 是端到端可训练的,你只需在现有训练代码中添加辅助损失,并为评分器设置较高学习率(论文使用 1e‑4,而其他部分为 1e‑5 或 5e‑6)。建议先用少量视频数据微调,再逐步扩展到完整混合数据。
- 超参数选择:剪枝率 是精度‑效率的调节旋钮。如果计算资源紧张,可将 50% 作为起点;如果希望保持接近基线的准确度,30% 是更安全的选择。注入层 建议保持与论文一致的浅层位置(如第 3 层);若骨干 ViT 总层数不同,可通过类比调整到约总层数的 1/4 处。
- 推理部署:打包算法能保证训练一样获得实际加速,但推理时若采用动态 batching,需要注意不同的 token 长度可能影响最终 kernel 调用效率。可以考虑在推理前固定一个统一 pad 长度,与 torch.compile 结合以获得最大加速。
- 测试时缩放:充分利用剪枝省下的预算,在推理时动态增加帧数。论文方法显示,即使不重新训练,将相等 token 数量的分配从 “多空间、少时间” 转为 “少空间、多时间” 也能带来长视频性能提升。这一策略可嵌入到实际产品中,根据视频长度自适应调整帧数与剪枝率。
STTS 的整体设计简洁、训练友好、加速可测量,非常适合需要处理海量视频数据且追求推理低延迟的工业场景,如视频监控分析、体育赛事理解、长视频问答等。