Lumos-Nexus:面向视频统一模型的同质潜在空间高效频率桥接
Lumos-Nexus: Efficient Frequency Bridging with Homogeneous Latent Space for Video Unified Models
论文信息
标题: Lumos-Nexus: Efficient Frequency Bridging with Homogeneous Latent Space for Video Unified Models
作者: Jiazheng Xing, Hangjie Yuan, Lingling Cai, et al.
发布日期: 2026-05-29
arXiv ID: 2605.31603v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:统一视频模型在推理驱动的视频生成中,将大规模高保真生成器纳入端到端训练的计算成本极高,视觉质量与推理能力难以兼得。
- 核心方法:提出 Lumos-Nexus,训练时仅对齐轻量生成器,推理时通过统一渐进频率桥接(UPFB)将生成任务逐步交接给预训练的大容量生成器,共享同构潜空间实现高低频协同。
- 关键结果:在 VBench 上总得分 84.12,超越所有对比模型;在自建的 VR-Bench 推理评测上同样取得最优,且大幅缓解了基线的 “短板效应”(见论文表 1、表 2)。
- 主要局限:VR-Bench 未能覆盖开放世界中的长程因果链等更广泛的推理场景;方法要求大小生成器共享同构潜空间,对异构模型适配有限(见论文附录 F 与表 12)。
- 适合读者:从事视频生成、多模态统一模型、扩散模型推理优化的研究者与工程师,以及对推理驱动生成评测感兴趣的从业者。
论文背景和研究动机
近年来,统一模型将多模态理解与生成整合到同一框架,为理解与生成的相互增强提供了可能。尤其在视频领域,生成不仅要求视觉保真,还需要维持时序一致、因果推进和动作连贯,对模型的推理能力提出了更高要求。现有的视频统一模型主要分为联合注意力架构和连接器架构。前者通过共享自注意力实现长上下文交互,但训练开销极大;后者通过显式连接器将对齐后的理解特征注入生成器,训练更高效,但当生成器规模扩大(如 Wan2.1-14B)时,微调成本依然难以承受。因此,如何在有限计算预算下,将大模型的视觉保真能力引入推理驱动的视频生成,成为一个核心挑战。
论文 Lumos-Nexus 正是针对这一矛盾提出的。它观察到连接器架构中,扩散生成器在微调期间并未改变其潜空间分布,因此同构潜空间的不同规模生成器之间存在天然的桥接基础。基于此,论文提出 “小生成器学习语义,大生成器负责细节” 的训练-推理分离策略,并通过频率域渐进桥接,实现训练高效且高保真的统一视频生成。
此外,已有视频生成基准(如 VBench)主要关注视觉质量和时序连贯性,缺乏对推理能力的系统评估。为此,论文同时推出了 VR-Bench,从物理世界推理、常识推理和具身交互等八个维度衡量生成视频与推断意图的对齐程度。
核心方法和技术细节
1. 两阶段框架:训练与推理解耦
Lumos-Nexus 在训练阶段仅对轻量生成器 和连接器进行微调,使得小模型学会吸收理解模块提供的推理驱动语义先验。训练成本与基线 Omni-Video 相当(2.25 s/it,26.3 GB 显存),而大模型无需任何训练。推理时引入统一渐进频率桥接(UPFB),实现从小模型到大模型的无缝生成交接(见论文图 2)。
2. 统一渐进频率桥接(UPFB)
UPFB 的核心思想是将大小两个生成器在时域和频域上进行动态、不对称的融合。
时序语义门控:使用余弦权重 控制两生成器的主导程度:
其中 为归一化时间步, 控制过渡尖锐度。在早期去噪步, 较大,小生成器主导全局语义布局;后期 降低,大生成器逐渐接管纹理细节。
时变频率分解:利用高斯低通滤波 将速度场分解为低频结构 和高频纹理 。带宽 从 衰减至 ,实现从粗到细的过渡。
双频桥接:以不对称权重融合两个模型的分量:
其中 用于抑制小模型高频噪声。融合后通过 RMS 对齐与能量重平衡,确保速度场幅度一致,防止过度曝光或不稳定。
整个 UPFB 是无训练的,可即插即用于任意连接器式统一视频模型,在推理时仅带来约 1.2 倍的延迟增加,却显著提升质量(见论文表 9)。
3. VR-Bench:推理驱动视频生成评测基准
VR-Bench 设计了 8 个评测维度,分属三类:
- 高层物理世界推理:动态参考系(DRF)、能量传递可视化(ETV)、材料记忆一致性(MMC);
- 高层常识推理:概念动作推理(CAR)、文化常识推理(CCR)、预防因果推理(PCR);
- 具身物理推理:生物行为推理(BBR)、并发动作协调(CAC)。
每个维度包含 8 个问题,分三层评估基础感知、关系推理和高层因果语义,由 Qwen3-VL 模型打分。共设计 208 个评测案例(见论文附录 B 与图 6)。
创新点和贡献
-
训练高效的统一视频框架:首次在同构潜空间假设下,实现小模型训练、大模型零样本接入的两阶段生成,大幅降低训练成本。消融实验表明,仅依靠模型容量提升(将小模型替换为 14B 微调)无法达到同等性能(Omni-Video* 在 VBench 仅 81.73 vs. Lumos-Nexus 84.12,见论文表 9),证明收益源于 UPFB 设计本身。
-
无训练的渐进频率桥接:通过时序门控+频域分解+能量对齐,解决了直接平均两生成器输出导致的重复主体、结构紊乱问题(见论文图 9)。在 VBench 和 VR-Bench 上分别比直接相加融合提升 0.84 和 1.95 分(见论文表 7)。
-
首个推理导向的视频生成基准 VR-Bench:覆盖物理、常识、具身三大类推理,并验证了评测结果在不同判别模型下的鲁棒性(Kendall’s ,见论文附录表 8 与表 11)。
实验结果分析
实验基于 Omni-Video 基线,小生成器采用 Wan2.1-1.3B,大生成器采用 Wan2.1-14B。在 VBench 上,Lumos-Nexus 总分 84.12,优于所有对比的视频生成模型和统一模型,尤其在语义对齐(80.52)和美学质量等指标上表现突出(表 1)。在 VR-Bench 上,总分 79.28,领先开源模型并缓解了 Omni-Video 因生成器性能不足导致的推理-执行不一致问题(表 2)。进一步将大生成器替换为 Wan2.2-T2V-A14B 后(Lumos-Nexus*),VR-Bench 达到 81.90,表明框架具有良好的扩展性。
消融实验中, 在 VBench 和 VR-Bench 上表现最佳,偏离该值会造成语义或细节损失(表 3,图 5)。带宽参数 设置为 (0.35, 0.70) 时平衡性最优(表 4)。RMS 能量对齐带来稳定的性能增益(表 5)。此外,对同构潜空间的依赖通过 MMD 验证:与不共享 VAE 的模型(如 HunyuanVideo)结合时性能大幅下降,表明潜空间一致性至关重要(表 12)。
实践建议
Lumos-Nexus 的设计理念对工业级视频生成系统具有直接参考价值:
-
利用模型家族的同构潜空间实现阶梯式生成:当系列模型(如 Wan2.1-1.3B/14B)共享 VAE 时,可直接套用 UPFB,避免大规模微调。用户可预先训练一个轻量但推理能力强的统一模型,然后在推理时无缝切换到最高质量的生成器,兼顾低成本训练与高视觉保真。
-
频率域融合可作为多模型集成的通用模块:UPFB 的频域分解、时序门控和能量对齐均无训练,适用于扩散/流匹配框架。在不改变模型架构的前提下,可将这一模块用于提升其他条件生成任务(如文生图、可控视频编辑)的质量。
-
VR-Bench 可作为推理驱动生成的选型标准:在部署面向复杂指令的视频生成服务前,利用 VR-Bench 的八维评测体系筛查模型在物理、常识和具身推理上的薄弱环节,进而决定是否需要引入类似 Lumos-Nexus 的推理增强机制。
未来改进方向包括:探索更通用的潜空间对齐方法,以适配异构 VAE;扩展 VR-Bench 覆盖更长序列的因果推理与开放场景,提升评测的完备性。