VideoMLA:面向分钟级自回归视频扩散的低秩潜变量 KV 缓存
VideoMLA: Low-Rank Latent KV Cache for Minute-Scale Autoregressive Video Diffusion
论文信息
标题: VideoMLA: Low-Rank Latent KV Cache for Minute-Scale Autoregressive Video Diffusion
作者: Hidir Yesiltepe, Jiazhen Hu, Tuna Han Salih Meral, et al.
发布日期: 2026-05-28
arXiv ID: 2605.30351v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:自回归视频扩散模型在生成长达数分钟的视频时,KV 缓存内存急剧膨胀,严重限制了生成规模与推理吞吐。
- 核心方法:首次将多头潜在注意力(MLA)引入视频扩散,用共享低秩内容潜在向量和共享解耦 3D-RoPE 位置键替代每头密集键值,将缓存从每 token 3072 标量压缩至 224 标量。
- 关键结果:在 Wan‑1.3B 模型上,KV 缓存减少 92.7%,单张 B200 GPU 吞吐量提升 1.23×;VBench 60 秒长视频总体得分 0.859,居评估方法之首(表 2)。
- 主要局限:极低潜在维度(如 64)会丢失细节,论文仅在 Wan2.1‑T2V‑1.3B 和分钟级生成上验证,更大模型和高分辨率场景尚未探索。
- 适合读者:视频生成、高效推理系统、注意力机制优化方向的研究者与工程师;对低秩缓存、分布式长视频生成落地感兴趣的从业者。
论文背景与研究动机
当前,因果视频扩散模型已成为长时流式视频生成的主流范式。它们将双向教师模型蒸馏为自回归学生,每次生成一个或一帧组块,并保持一个滚动的 KV 缓存,以复用过去帧的键和值。然而,随着模型向更长镜头扩展,每层每头存储的密集 KV 状态成为系统的绝对瓶颈。以 Wan‑1.3B 为例,每缓存的 token 须存储 12 个头、每头 128 维的键和值,即 3072 个标量;若缓存 21 帧潜在表示,30 个 Transformer 层总共需要约 6 GB 的 BF16 索引。这解释了为何现有方法普遍采用固定大小的滑动窗口,却未触及问题的核心——每 token 的 KV 布局本身并没有被压缩。
最近的大量工作都在滑动窗口内部做文章:选择不同的 token、重新编码位置、引入注意力汇或记忆压缩,但它们都保留了密集的每头 KV 形式。另一条路线则改变注意力计算本身,例如用块因果线性注意力取代 softmax 注意力,或将时间推理路由到少量可缓存的编码层。这两类方法分别操作 “哪些 token 被缓存” 和 “多少层缓存”,但都没有直接对缓存内每个 token 所需的标量数动手。VideoMLA 发现了第三条轴:直接压缩每 token 的 KV 表示,在不改变窗口内容和层数的情况下,将每层缓存尺寸缩减到原先的 7.3%。
更微妙的是,传统的 MLA 动机源于语言模型中 K/V 映射的近似低秩性。但作者分析了 Wan‑1.3B 的预训练矩阵形态,发现其 99%‑能量有效秩在每一层都超过 1300(图 1),远高于实际可用的潜在维度(如 192)。如果按照谱近似,会丢弃绝大部分能量,但 VideoMLA 仍能维持生成质量。这一 “谱谜题” 表明,MLA 在视频扩散中的成功并非因为发现了隐藏的低秩结构,而是因为 MLA 的瓶颈本身定义了一个秩预算——训练过程几乎用完这个预算,而不会继续塌缩,生成质量由预算容量而非源模型的谱决定。
核心方法与技术细节
VideoMLA 直接替换 Wan‑1.3B 中所有自注意层的 KV 路径,保持其余网络(含前馈层、交叉注意力、文本条件化)完全不变。基本思想是:将每 token 的键值内容压缩成一个共享的低秩潜在向量 ,同时用解耦的单头位置键 传递 3D‑RoPE 位置信息。最终每 token 缓存由 组成,默认 与 ,共 224 标量(原 3072)。
具体来说,对于任意时刻的注意力输入 ,先经降维投影得到内容缓存:
查询侧也建立类似的潜在向量 ,但 不写入缓存,只在当前组块内使用。随后,每个注意力头 的无位置(NoPE)键和值由共享的 经升维投影重建:
同时,单个头共享的位置键 被缓存,使用时通过 3D‑RoPE 旋转得到 。查询头 也执行类似拆分:从 重建无位置查询 ,并生成独立的 per‑head 位置查询 。
注意力得分由两部分内积组合而成:
这一结构与标准多头注意力实现的接口完全一致,因此可以直接继承因果分块掩码、沉没 token、以及 FlexAttention 等内核优化。训练与生成流程仅将缓存格式从 “每头 K/V” 替换为 ,注意力计算时再现场重建,表现完全兼容。
为进一步提高推理效率,作者还引入重参数化: 可以写成 ;矩阵 可预计算。类似地,值投影与输出投影合并为 。如此一来,推理时完全避免重建密集的每头键值向量,真正实现了缓存尺寸和带宽的双重节约。
创新点与贡献
VideoMLA 的贡献可从三个层面理解。
1. 首次将 MLA 引入视频扩散,直接压缩每 token KV 缓存。 与现有工作在滑动窗口内调优缓存内容或压缩时间维度不同,VideoMLA 瞄准了之前未触动的维度——每 token 每层 KV 布局。通过共享内容隐空间与单头位置键的解耦设计,它将 Wan‑1.3B 的每 token 缓存从 3072 标量降至 224 标量,对应 13.7× 的压缩比(缓存缩减 92.7%)。这一压缩是作用于所有自注意力层的,并非仅节约部分层或时间步。
2. 揭示了视频扩散中 MLA 的成功与秩结构无关,而由秩预算决定。 论文对 Wan‑1.3B 的联合映射 进行奇异值分析,发现 99%‑能量有效秩远超任何实际可用的 。若直接做谱截断,将丢失大量信息。但 VideoMLA 训练后的组合算子 几乎占满整个 的秩预算(99%‑能量有效秩 ≈ 0.98 ,如图 2 所示),且该现象在 SVD 初始化和随机初始化下均出现(图 8)。这表明训练并不是去寻找预训练中的低维子空间,而是利用给定的潜在容量重新学习一个满秩的组合映射。因此,设计重心从 “内在秩是多少” 转移到 “需要多大的潜在预算以保持视频质量”。
3. 在极低的潜在维度下实现了高质量长视频生成与高吞吐。 VBench 评估显示,VideoMLA 在 60 秒视频上的总体得分达到 0.859(表 2),并表现出最强的运动动态程度(60 秒动态度为 0.958)和运动平滑性。同时,它在单张 B200 上将吞吐量从 19.35 FPS(LongSANA)提升到 23.96 FPS(表 3),而 CLIP‑T 得分 0.3278 也属最优。定性结果(图 4、5)表明,即使缓存尺寸大幅缩减,模型仍能维持主体一致性、场景结构和视觉细节。
实验结果分析
实验基于 Wan2.1‑T2V‑1.3B 主干预训练权重,训练分为教师强制、一致性蒸馏、分布匹配蒸馏三阶段。所有测评均使用四步采样器,以 832×480 分辨率生成 5 秒片段并通过滚动缓存扩展到 30 秒和 60 秒。主要发现:
长视频质量: VideoMLA 在 60 秒基准上超越所有对比方法(如 Reward Forcing、Infinity‑RoPE、LongLive、LongSANA),总体得分 0.859;在 30 秒上与最强基线持平但内存远低(表 2)。值得强调的是,其动态度得分始终最高(30 秒 0.981、60 秒 0.958),表明压缩并未导致视频趋向静止,这与 LongSANA 等线性注意力方法形成鲜明对比——后者虽在帧间相似度(CLIP‑F)上略高,但动态度极低(30 秒仅 0.149),实际画面近乎凝固(图 6)。用户研究同样表明 VideoMLA 在提示遵循、时间一致性和动态一致性上均获最高分(3.17 对比 Reward Forcing 的 2.91)。
吞吐与内存缩放: 在固定显存预算下,MLA 大幅提高非 OOM 的批次大小(图 7)。相比密集 MHA,MLA 的每个请求增量内存从 6.26 GB/批降至 0.57–1.43 GB/批( 在 64~512 间),在缺省 下可获得约 8× 的批次增长,这直接转化为更高的服务吞吐。表 3 则显示,即使在批次 1 的条件下,VideoMLA 也达到了同级模型中最高的帧率和最低的延迟。
消融研究: 潜在维度 是质量与效率的最主要旋钮。从 64 增加到 192 时,语义和质量指标显著提升,进一步增至 512 仅有微小收益却大幅削弱内存优势(表 5a);推荐操作点为 128–192。在 NoPE/RoPE 划分上,内容通道多于位置通道的设置(如 96/32)更利于质量(表 5b),这与视频生成需要强内容还原能力、位置信息可通过轻量解耦键高效加载的直觉一致。
实践建议
VideoMLA 的方法在视频生成服务的工程落地中具有直接价值,以下建议可供参考:
-
选择 和头拆分以平衡质量与效率。 对于追求高吞吐的实时交互场景,可选用 ,缓存压缩约 19×,仍维持可接受的质量(表 5a);若质量优先级更高, 能提供额外增益,同时仅让缓存尺寸略增。NoPE/RoPE 建议采用内容占优分割(例如 96/32),实验证实这种配置最能兼顾语义与运动连贯性。
-
利用秩预算现象简化初始化。 论文发现 SVD 初始化和随机初始化在训练后均几乎占满秩预算,且光谱尾端相似(图 8)。这意味着实践者不必精确计算预训练权重的 SVD,随机投影同样可作为合理的起点,从而减少模型迁移时的计算开销。
-
重参数化实现真正的压缩带宽。 在生产推理中,务必采用文中描述的预合并矩阵 和 ,避免重建密集的每头 K/V。这将使缓存带宽从 降至 ,在滑动窗口大小 较大时,能实质性降低内存访问压力并提升流水线利用率。
-
将压缩收益转换为服务能力。 图 7 显示,相同的 B200 显存预算下,MLA 可支持 8× 乃至更高倍数的批次处理,这意味着单个 GPU 的并发处理能力大幅提升。对于需要在有限硬件上支撑多用户分钟级视频生成的服务,应优先尝试 VideoMLA 架构,并将其与现有滑动窗口优化(如沉没 token、RoPE 重索引)结合,以获得最优的长视频流式体验。
-
应用拓展需注意尺度泛化。 论文仅在 Wan‑1.3B 上验证,更大模型或更高分辨率下,秩预算与压缩比的交互可能发生变化。在新的主干上部署时,建议先用小规模快速扫描 和 NoPE/RoPE 划分,找到该骨干的质量拐点,避免直接套用默认参数。
总之,VideoMLA 提供了一个低摩擦、高收益的 KV 缓存压缩方案,其架构改动仅限于自注意层,可无缝嵌入现有因果视频扩散管线,是迈向低成本、高质量分钟级视频生成的关键一步。