RefDecoder:通过条件视频解码增强视觉生成

RefDecoder: Enhancing Visual Generation with Conditional Video Decoding

arXiv: 2605.15196v1

论文信息

标题: RefDecoder: Enhancing Visual Generation with Conditional Video Decoding

作者: Xiang Fan, Yuheng Wang, Bohan Fang, et al.

发布日期: 2026-05-14

arXiv ID: 2605.15196v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:主流视频生成模型中的 VAE 解码器通常是无条件的,导致从压缩潜空间重建像素时会丢失细节、出现时序不一致。这篇论文要解决的是解码器缺乏条件信号导致的结构不对称问题。
  • 核心方法:提出 RefDecoder,在解码器的每个上采样阶段通过共享 Transformer 的自注意力机制,将高保真参考图像 token 与视频潜变量 token 共同处理,让解码器能直接从参考图像中检索并注入细节。
  • 关键结果:在 Inter4K 重建基准上,基于 Wan 2.1 主干的 RefDecoder 比无条件基线提高 +1.2 dB PSNR;在 VideoVAE+主干的 WebVid 上提高 +2.1 dB PSNR(见表 1)。在 VBench I2V 生成任务上,总分从 87.9 提升至 88.2(见表 2)。
  • 主要局限:目前仅支持单一参考帧(论文讨论了可扩展到多参考帧,但尚未实现);参考帧在长视频中可能因时间距离过远而效果减弱;超参数选择依赖于具体架构,未自动化(见论文第 5 节)。
  • 适合读者:从事视频生成、扩散模型、视觉自编码器研究的工程师和研究人员;对模型即插即用改进感兴趣、希望不重训扩散主模型即提升生成质量的从业者。

论文背景和研究动机

在当前的视频生成范式中,扩散主模型负责在条件信号(如图像、文本)引导下对潜变量进行去噪,而 VAE 解码器则将这些潜变量映射回像素空间。主流系统如 Wan 2.1、CogVideoX、HunyuanVideo 等都将大量精力投入扩散主模型的条件机制和架构设计,但解码器却长期保持无条件状态——它在推理时无法访问任何条件信号,只能从一个高度压缩的潜表示中重建所有空间细节。

论文观察到这种架构不对称造成了系统性的瓶颈:即使扩散模型在潜空间中忠实地保留了参考信息,解码器在没有细节锚点的情况下,仍须从压缩表示中恢复纹理、边缘和高频内容。这导致两类典型失败模式:

  1. 空间细节逐渐退化:纹理、文字、人脸等高频内容在与参考帧偏离较大的帧中会明显劣化(见图 3 基线细节);
  2. 时序不一致:外观在序列中漂移,例如人脸在不同帧之间发生变化(见图 4(a)人脸部分)。

关键洞察在于,这些伪影往往在潜变量到像素的解码阶段(而非扩散阶段)产生,解码器作为一个被忽视的组件,未能利用已经提供的参考视觉线索。

然而,直接将参考图像注入解码器面临三个技术挑战:(1)解码器通过层级上采样运行,应在哪个阶段引入参考信号;(2)条件机制必须与预训练解码器权重兼容,保证在无参考图像的原始设定中仍能正常工作;(3)方法应足够通用,能跨不同视觉生成任务和解码器主干进行泛化。

核心方法和技术细节

RefDecoder 的设计核心是将参考帧编码为高维 token,在解码器的每个上采样阶段通过共享的自注意力块与视频潜变量 token 进行联合处理。该方法包含三个关键组成部分:

参考图像编码。传统方法通常将参考帧编码到与 VAE 潜空间瓶颈相当的低维特征空间(如 16 通道)。RefDecoder 则放弃这种压缩路径,改用单个卷积层加归一化构成轻量编码器,直接将参考图像块投影到解码器第一个阶段的高维特征空间(如 512 维)。这使得多分辨率高维特征提取可以在解码过程中自然开展,避免了深层编码器平滑高频细节的风险。编码后得到参考 token zref∈RC×Hp×Wp\mathbf{z}_{\text{ref}} \in \mathbb{R}^{C \times \frac{H}{p} \times \frac{W}{p}},其中 CC 为第一解码器阶段的通道维度,pp 为 VAE 的空间压缩比,使得参考 token 与解码器初始特征图对齐,能实现位置感知的信息传递(见论文第 2 节 “参考图像编码”)。

条件 token 解码。标准视频 VAE 解码器依赖因果 3D 卷积上采样层,其局部感受野有限,无法从狭窄的潜空间瓶颈中恢复细粒度细节。RefDecoder 在上采样阶段插入 Transformer 块,让每个视频 token 能查询参考 token 并提取相关信息。具体操作流程为:

  1. token 拼接:在解码器阶段 ss,将视频 token z(s)\mathbf{z}^{(s)} 和参考 token zref(s)\mathbf{z}_{\text{ref}}^{(s)} 沿时间维度拼接;
  2. 联合注意力处理:拼接后的张量经过共享 Transformer 块的自注意力处理,允许视频 token 与参考 token 之间进行信息交换;
  3. 分离与上采样:输出被拆分回参考 token 和视频 token,分别通过预训练的上采样模块——参考 token 仅做空间上采样,视频 token 进行时空上采样;
  4. 阶段间权重共享:Transformer 权重在所有阶段共享,通过阶段特定的补丁嵌入层将各不相同的通道维度 CsC_s 投影到统一的 Transformer 隐藏维度,在保持架构灵活性的同时最小化参数开销(见论文第 2 节 “条件 token 解码”)。

潜变量 token dropout。为防止解码器忽略参考信号而完全依赖视频潜变量,训练时对潜变量 token 进行随机丢弃:每个时空位置以概率 rr 独立置零,rr 从 [0,rmax⁡)[0, r_{\max}) 均匀采样,默认 rmax⁡=0.7r_{\max}=0.7。这迫使模型通过注意力机制从参考 token 中恢复缺失的细节。

训练策略采用两阶段课程:先使用支持的最少帧数短视频片段训练(Wan 2.1 为 5 帧,VideoVAE+为 4 帧),再扩展到最大帧数(17 帧和 16 帧),以泛化到长时序上下文。参考帧选择采用随机帧策略而非固定首帧,防止过拟合到固定的时序关系。训练目标为 L1 损失与 LPIPS 感知损失的组合。

创新点和贡献

  1. 识别并解决架构不对称问题。论文首次明确指出现有视频扩散流水线中解码器缺乏条件信号的结构性缺陷,并通过实验定量刻画了该缺陷导致的细节损失和时序不一致。

  2. 即插即用的条件解码设计。RefDecoder 是一种架构无关的直接替换方案,不修改编码器、不重训扩散主模型,仅替换解码器即可立即提升现有系统的生成质量。这是与 H3AE、RefTok、Reducio-VAE 等需要从头训练整个自编码器的方法的本质区别(见附录 A 对比)。

  3. 通过共享 Transformer 实现高效的条件交互。将参考 token 与视频 token 在时间维度上拼接并通过共享 Transformer 进行自注意力处理,使得解码过程能自适应地检索参考信息,同时权重共享最小化了参数开销(仅增加约 2.5 秒延迟,附录未详述,正文第 3.6 节报告总流水线延迟 72,037±16 ms vs. 74,584±40 ms)。

  4. 跨任务泛化能力。同一框架无需修改即扩展到解码时风格迁移(见第 4.1 节)和视频编辑精化(见第 4.2 节)。在 LoRA-Edit 编辑任务中,RefDecoder 在非编辑区域上提高+1.4 dB PSNR、+1.9% SSIM、-0.018 LPIPS(见表 3),缓解了编辑质量与保真度之间的权衡。

实验结果分析

重建性能。在 Inter4K、WebVid 和 Large Motion 三个基准上,RefDecoder 在两个主干(Wan 2.1 和 VideoVAE+)上均一致超越基线。以 Wan 2.1 为例,Inter4K 上 PSNR 从 33.7 dB 提升到 34.9 dB(+1.2 dB),WebVid 上从 32.8 dB 提升到 33.5 dB(+0.7 dB)。VideoVAE+主干在 WebVid 上增益最显著(+2.1 dB PSNR),表明方法在不同架构宽度和深度的解码器上均有效(见表 1)。按类别分析显示,增益在内容丰富的场景(城市街道、霓虹夜景、航拍天际线等)最大,在内容稀疏的场景(动画图形、人物肖像、微距特写等)最小,支持了 “参考信号在潜代码最不充分时贡献最大” 的直觉(见附录 B.6,表 4)。

生成性能。采用固定种子协议消除扩散侧随机性后,在 VBench I2V 基准的 12 个维度中,RefDecoder 在 11 个维度上超越 Wan 2.1 基线,主体一致性从 96.6 提升到 96.8,背景一致性从 97.9 提升到 98.2,总分从 87.9 提升到 88.2(+0.3)。作为对比,VBench 排行榜上顶尖开源模型之间的分数差异仅为 0.1(见表 2)。时序稳定性方面,RefDecoder 将所有三个退化指标降低 8%~15%:EwarpE_{\text{warp}} 降低 10.2%,EtLPIPSE_{\text{tLPIPS}} 降低 8.4%,EflickerE_{\text{flicker}} 降低 15.5%(见附录 C,表 5)。

人类评估。在盲偏好研究中,RefDecoder 在所有对比中均被显著偏好:重建任务中 vs. Wan 2.1 为 92.3% 偏好率,vs. HunyuanVAE 为 69.2%,vs. VideoVAE+为 63.4%,vs. Reducio-VAE 为 89.6%;生成任务中 vs. Wan 2.1 为 82.4%(见附录 F,表 7)。

消融研究。关键消融发现:(1)Transformer 块数从 3 增加到 10 时,Inter4K PSNR 从 34.3 dB 单调提升到 34.9 dB(见附录 I,表 10);(2)潜变量 token dropout 从 0.0 提高到 0.7 时,整体 PSNR 从 27.4 dB 提升到 30.1 dB(+2.71 dB),说明更强的 dropout 鼓励更高效的参考信息利用(见附录 J,表 11);(3)两阶段课程训练比单阶段训练提升整体 PSNR +3.80 dB,参考帧 PSNR 提升+4.64 dB,表明第二阶段主要精化了长时序上下文下的参考 token 解码(见附录 J);(4)与 ControlNet 风格的残差注入对比,注意力机制具有时序推理能力且收敛到更高质量(见附录 K)。

实践建议

对于计划将 RefDecoder 集成到视频生成流水线的工程师和研究人员,以下建议值得关注:

直接替换策略。RefDecoder 的核心卖点是不重训扩散主模型。在集成时,保持编码器冻结,仅用 RefDecoder 替换原解码器;确保原 VAE 的潜变量格式不变,将原扩散模型生成的潜变量直接送入新的条件解码器。固定种子评估协议(见附录 B.7)是验证改进的重要手段,它可以完全隔离解码器的贡献。

训练数据与课程设计。训练集规模约 100K 视频即可取得显著增益(论文使用 MiraData9K、DL3DV 和 OpenVidHD-0.4M 的子集)。两阶段课程是必要的:第一阶段用短视频(5 帧或 4 帧)进行初始化训练,第二阶段扩展到长视频(17 帧或 16 帧)。随机参考帧选择(而非固定首帧)能产生更鲁棒的模型(见附录 H,表 9 中随机参考训练在首帧评估下仍优于固定首帧训练)。

关键超参数配置。强烈建议使用较高的潜变量 token dropout(rmax⁡=0.7r_{\max}=0.7),这是促使解码器真正利用参考信号的核心机制。Transformer 块数在计算资源允许范围内越多越好——10 块模型在所有基准上表现最佳(见附录 I,表 10)。附录 G 中的潜变量微调策略可进一步优化生成任务性能:使用真实视频和扩散模型生成的潜变量视频混合训练,并采用双向时序训练让模型适应更长的时序依赖。

计算开销评估。在 Wan 2.1 流水线中,总延迟仅从 72,037 ms 增加到 74,584 ms,增幅约 3.5%。考虑到 DiT 去噪阶段占绝对主导,解码器侧的开销在实际部署中几乎可忽略。部署时应在延迟敏感的场景中进行端到端测试以确认可接受性。