VideoMLA:面向分钟级自回归视频扩散的低秩潜变量 KV 缓存

VideoMLA: Low-Rank Latent KV Cache for Minute-Scale Autoregressive Video Diffusion

arXiv: 2605.30351v1

论文信息

标题: VideoMLA: Low-Rank Latent KV Cache for Minute-Scale Autoregressive Video Diffusion

作者: Hidir Yesiltepe, Jiazhen Hu, Tuna Han Salih Meral, et al.

发布日期: 2026-05-28

arXiv ID: 2605.30351v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:自回归视频扩散模型在生成长达数分钟的视频时,KV 缓存内存急剧膨胀,严重限制了生成规模与推理吞吐。
  • 核心方法:首次将多头潜在注意力(MLA)引入视频扩散,用共享低秩内容潜在向量和共享解耦 3D-RoPE 位置键替代每头密集键值,将缓存从每 token 3072 标量压缩至 224 标量。
  • 关键结果:在 Wan‑1.3B 模型上,KV 缓存减少 92.7%,单张 B200 GPU 吞吐量提升 1.23×;VBench 60 秒长视频总体得分 0.859,居评估方法之首(表 2)。
  • 主要局限:极低潜在维度(如 64)会丢失细节,论文仅在 Wan2.1‑T2V‑1.3B 和分钟级生成上验证,更大模型和高分辨率场景尚未探索。
  • 适合读者:视频生成、高效推理系统、注意力机制优化方向的研究者与工程师;对低秩缓存、分布式长视频生成落地感兴趣的从业者。

论文背景与研究动机

当前,因果视频扩散模型已成为长时流式视频生成的主流范式。它们将双向教师模型蒸馏为自回归学生,每次生成一个或一帧组块,并保持一个滚动的 KV 缓存,以复用过去帧的键和值。然而,随着模型向更长镜头扩展,每层每头存储的密集 KV 状态成为系统的绝对瓶颈。以 Wan‑1.3B 为例,每缓存的 token 须存储 12 个头、每头 128 维的键和值,即 3072 个标量;若缓存 21 帧潜在表示,30 个 Transformer 层总共需要约 6 GB 的 BF16 索引。这解释了为何现有方法普遍采用固定大小的滑动窗口,却未触及问题的核心——每 token 的 KV 布局本身并没有被压缩。

最近的大量工作都在滑动窗口内部做文章:选择不同的 token、重新编码位置、引入注意力汇或记忆压缩,但它们都保留了密集的每头 KV 形式。另一条路线则改变注意力计算本身,例如用块因果线性注意力取代 softmax 注意力,或将时间推理路由到少量可缓存的编码层。这两类方法分别操作 “哪些 token 被缓存” 和 “多少层缓存”,但都没有直接对缓存内每个 token 所需的标量数动手。VideoMLA 发现了第三条轴:直接压缩每 token 的 KV 表示,在不改变窗口内容和层数的情况下,将每层缓存尺寸缩减到原先的 7.3%。

更微妙的是,传统的 MLA 动机源于语言模型中 K/V 映射的近似低秩性。但作者分析了 Wan‑1.3B 的预训练矩阵形态,发现其 99%‑能量有效秩在每一层都超过 1300(图 1),远高于实际可用的潜在维度(如 192)。如果按照谱近似,会丢弃绝大部分能量,但 VideoMLA 仍能维持生成质量。这一 “谱谜题” 表明,MLA 在视频扩散中的成功并非因为发现了隐藏的低秩结构,而是因为 MLA 的瓶颈本身定义了一个秩预算——训练过程几乎用完这个预算,而不会继续塌缩,生成质量由预算容量而非源模型的谱决定。

核心方法与技术细节

VideoMLA 直接替换 Wan‑1.3B 中所有自注意层的 KV 路径,保持其余网络(含前馈层、交叉注意力、文本条件化)完全不变。基本思想是:将每 token 的键值内容压缩成一个共享的低秩潜在向量 ctKV∈Rdcc_t^{KV} \in \mathbb{R}^{d_c},同时用解耦的单头位置键 ktRk_t^R 传递 3D‑RoPE 位置信息。最终每 token 缓存由 (ctKV,ktR)(c_t^{KV}, k_t^R) 组成,默认 dc=192d_c=192 与 dhrope=32d_h^{\mathrm{rope}}=32,共 224 标量(原 3072)。

具体来说,对于任意时刻的注意力输入 xtx_t,先经降维投影得到内容缓存:

ctKV=W↓KVxt,W↓KV∈Rdc×dc_t^{KV} = W_{\downarrow}^{KV} x_t,\quad W_{\downarrow}^{KV} \in \mathbb{R}^{d_c \times d}

查询侧也建立类似的潜在向量 ctQ=W↓Qxtc_t^Q = W_{\downarrow}^Q x_t,但 ctQc_t^Q 不写入缓存,只在当前组块内使用。随后,每个注意力头 hh 的无位置(NoPE)键和值由共享的 ctKVc_t^{KV} 经升维投影重建:

kt,hnope=W↑,hKctKV,vt,h=W↑,hVctKVk_{t,h}^{\mathrm{nope}} = W_{\uparrow,h}^K c_t^{KV},\quad v_{t,h} = W_{\uparrow,h}^V c_t^{KV}

同时,单个头共享的位置键 ktR=WRKxtk_t^R = W_R^K x_t 被缓存,使用时通过 3D‑RoPE 旋转得到 ktropek_t^{\mathrm{rope}}。查询头 hh 也执行类似拆分:从 ctQc_t^Q 重建无位置查询 qt,hnopeq_{t,h}^{\mathrm{nope}},并生成独立的 per‑head 位置查询 qt,hropeq_{t,h}^{\mathrm{rope}}。

注意力得分由两部分内积组合而成:

scorei,j(h)=qi,hnope⋅kj,hnope+qi,hrope⋅kjropedhnope+dhrope\mathrm{score}^{(h)}_{i,j} = \frac{ q_{i,h}^{\mathrm{nope}} \cdot k_{j,h}^{\mathrm{nope}} + q_{i,h}^{\mathrm{rope}} \cdot k_j^{\mathrm{rope}} }{ \sqrt{d_h^{\mathrm{nope}} + d_h^{\mathrm{rope}}} }

这一结构与标准多头注意力实现的接口完全一致,因此可以直接继承因果分块掩码、沉没 token、以及 FlexAttention 等内核优化。训练与生成流程仅将缓存格式从 “每头 K/V” 替换为 (ctKV,ktR)(c_t^{KV}, k_t^R),注意力计算时再现场重建,表现完全兼容。

为进一步提高推理效率,作者还引入重参数化:qi,hnope⋅kj,hnopeq_{i,h}^{\mathrm{nope}} \cdot k_{j,h}^{\mathrm{nope}} 可以写成 (ciQ)⊤(W↑,hQ)⊤W↑,hKcjKV(c_i^Q)^\top (W_{\uparrow,h}^Q)^\top W_{\uparrow,h}^K c_j^{KV};矩阵 AhA_h 可预计算。类似地,值投影与输出投影合并为 Bh=WhOW↑,hVB_h = W_h^O W_{\uparrow,h}^V。如此一来,推理时完全避免重建密集的每头键值向量,真正实现了缓存尺寸和带宽的双重节约。

创新点与贡献

VideoMLA 的贡献可从三个层面理解。

1. 首次将 MLA 引入视频扩散,直接压缩每 token KV 缓存。 与现有工作在滑动窗口内调优缓存内容或压缩时间维度不同,VideoMLA 瞄准了之前未触动的维度——每 token 每层 KV 布局。通过共享内容隐空间与单头位置键的解耦设计,它将 Wan‑1.3B 的每 token 缓存从 3072 标量降至 224 标量,对应 13.7× 的压缩比(缓存缩减 92.7%)。这一压缩是作用于所有自注意力层的,并非仅节约部分层或时间步。

2. 揭示了视频扩散中 MLA 的成功与秩结构无关,而由秩预算决定。 论文对 Wan‑1.3B 的联合映射 [WK;WV][W_K;W_V] 进行奇异值分析,发现 99%‑能量有效秩远超任何实际可用的 dcd_c。若直接做谱截断,将丢失大量信息。但 VideoMLA 训练后的组合算子 Mlearned=[W↑KW↓KV;W↑VW↓KV]M_{\mathrm{learned}} = [W_{\uparrow}^K W_{\downarrow}^{KV}; W_{\uparrow}^V W_{\downarrow}^{KV}] 几乎占满整个 dcd_c 的秩预算(99%‑能量有效秩 ≈ 0.98 dcd_c,如图 2 所示),且该现象在 SVD 初始化和随机初始化下均出现(图 8)。这表明训练并不是去寻找预训练中的低维子空间,而是利用给定的潜在容量重新学习一个满秩的组合映射。因此,设计重心从 “内在秩是多少” 转移到 “需要多大的潜在预算以保持视频质量”。

3. 在极低的潜在维度下实现了高质量长视频生成与高吞吐。 VBench 评估显示,VideoMLA 在 60 秒视频上的总体得分达到 0.859(表 2),并表现出最强的运动动态程度(60 秒动态度为 0.958)和运动平滑性。同时,它在单张 B200 上将吞吐量从 19.35 FPS(LongSANA)提升到 23.96 FPS(表 3),而 CLIP‑T 得分 0.3278 也属最优。定性结果(图 4、5)表明,即使缓存尺寸大幅缩减,模型仍能维持主体一致性、场景结构和视觉细节。

实验结果分析

实验基于 Wan2.1‑T2V‑1.3B 主干预训练权重,训练分为教师强制、一致性蒸馏、分布匹配蒸馏三阶段。所有测评均使用四步采样器,以 832×480 分辨率生成 5 秒片段并通过滚动缓存扩展到 30 秒和 60 秒。主要发现:

长视频质量: VideoMLA 在 60 秒基准上超越所有对比方法(如 Reward Forcing、Infinity‑RoPE、LongLive、LongSANA),总体得分 0.859;在 30 秒上与最强基线持平但内存远低(表 2)。值得强调的是,其动态度得分始终最高(30 秒 0.981、60 秒 0.958),表明压缩并未导致视频趋向静止,这与 LongSANA 等线性注意力方法形成鲜明对比——后者虽在帧间相似度(CLIP‑F)上略高,但动态度极低(30 秒仅 0.149),实际画面近乎凝固(图 6)。用户研究同样表明 VideoMLA 在提示遵循、时间一致性和动态一致性上均获最高分(3.17 对比 Reward Forcing 的 2.91)。

吞吐与内存缩放: 在固定显存预算下,MLA 大幅提高非 OOM 的批次大小(图 7)。相比密集 MHA,MLA 的每个请求增量内存从 6.26 GB/批降至 0.57–1.43 GB/批(dcd_c 在 64~512 间),在缺省 dc=192d_c=192 下可获得约 8× 的批次增长,这直接转化为更高的服务吞吐。表 3 则显示,即使在批次 1 的条件下,VideoMLA 也达到了同级模型中最高的帧率和最低的延迟。

消融研究: 潜在维度 dcd_c 是质量与效率的最主要旋钮。从 64 增加到 192 时,语义和质量指标显著提升,进一步增至 512 仅有微小收益却大幅削弱内存优势(表 5a);推荐操作点为 128–192。在 NoPE/RoPE 划分上,内容通道多于位置通道的设置(如 96/32)更利于质量(表 5b),这与视频生成需要强内容还原能力、位置信息可通过轻量解耦键高效加载的直觉一致。

实践建议

VideoMLA 的方法在视频生成服务的工程落地中具有直接价值,以下建议可供参考:

  1. 选择 dcd_c 和头拆分以平衡质量与效率。 对于追求高吞吐的实时交互场景,可选用 dc=128d_c = 128,缓存压缩约 19×,仍维持可接受的质量(表 5a);若质量优先级更高,dc=192d_c=192 能提供额外增益,同时仅让缓存尺寸略增。NoPE/RoPE 建议采用内容占优分割(例如 96/32),实验证实这种配置最能兼顾语义与运动连贯性。

  2. 利用秩预算现象简化初始化。 论文发现 SVD 初始化和随机初始化在训练后均几乎占满秩预算,且光谱尾端相似(图 8)。这意味着实践者不必精确计算预训练权重的 SVD,随机投影同样可作为合理的起点,从而减少模型迁移时的计算开销。

  3. 重参数化实现真正的压缩带宽。 在生产推理中,务必采用文中描述的预合并矩阵 AhA_h 和 BhB_h,避免重建密集的每头 K/V。这将使缓存带宽从 O(W⋅3072)\mathcal{O}(W \cdot 3072) 降至 O(W⋅224)\mathcal{O}(W \cdot 224),在滑动窗口大小 WW 较大时,能实质性降低内存访问压力并提升流水线利用率。

  4. 将压缩收益转换为服务能力。 图 7 显示,相同的 B200 显存预算下,MLA 可支持 8× 乃至更高倍数的批次处理,这意味着单个 GPU 的并发处理能力大幅提升。对于需要在有限硬件上支撑多用户分钟级视频生成的服务,应优先尝试 VideoMLA 架构,并将其与现有滑动窗口优化(如沉没 token、RoPE 重索引)结合,以获得最优的长视频流式体验。

  5. 应用拓展需注意尺度泛化。 论文仅在 Wan‑1.3B 上验证,更大模型或更高分辨率下,秩预算与压缩比的交互可能发生变化。在新的主干上部署时,建议先用小规模快速扫描 dcd_c 和 NoPE/RoPE 划分,找到该骨干的质量拐点,避免直接套用默认参数。

总之,VideoMLA 提供了一个低摩擦、高收益的 KV 缓存压缩方案,其架构改动仅限于自注意层,可无缝嵌入现有因果视频扩散管线,是迈向低成本、高质量分钟级视频生成的关键一步。