MeanFlowNFT:将前向过程强化学习引入平均速度生成器
论文信息
标题: MeanFlowNFT: Bringing Forward-Process RL to Average-Velocity Generators
作者: Yushi Huang, Xiangxin Zhou, Jun Zhang, et al.
发布日期: 2026-07-16
arXiv ID: 2607.15273v1
PDF 链接: 下载 PDF
背景与动机
扩散模型和流匹配模型已成为高质量图像与视频生成的主流框架,但其推理需要沿时间轴逐步积分瞬时速度场,生成步骤多、计算开销大。MeanFlow(平均流)通过预测区间上的平均速度而非瞬时速度,支持单步或少步采样,显著提升了生成效率,因此在部署中极具吸引力。
强化学习已成为将生成模型与人类偏好或任务奖励对齐的重要工具。其中,DiffusionNFT提出了一种高效的前向过程 RL 方法,直接在加噪前向过程中构造对比目标(正样本 vs 负样本),无需反向采样轨迹或似然估计,训练实现简洁、收敛稳定。然而,DiffusionNFT 优化的是瞬时速度函数,而 MeanFlow 网络输出的是平均速度,二者之间存在根本性鸿沟。若直接将平均速度代入 DiffusionNFT 的目标,会破坏其策略改进的理论保证,甚至导致训练崩溃。
本文要回答的核心问题是:能否利用高效的前向过程 RL 来微调预训练的 MeanFlow 模型,使之在保留少步采样优势的同时,获得显著的奖励对齐提升? 为此,作者提出了 MeanFlowNFT。
核心方法
MeanFlow 的学习关键在于一个恒等式:对于真实平均速度 ,其对应的瞬时速度可以通过全导数构建:
第一步:构造诱导的瞬时速度预测器。 给定一个 MeanFlow 网络 ,论文利用上述恒等式构造出一个诱导瞬时速度预测器 :
其中 是网络在 时恢复的瞬时速度,用于雅可比-向量积的方向。为了优化计算,总导数在训练中被包裹在 stop-gradient 中,防止其参与更新 ,但仍能间接强化平均速度预测。
第二步:在诱导预测器上施加 DiffusionNFT 目标。 DiffusionNFT 基于策略的后验分解 和 ,定义了一个隐式参数化的正/负预测器:
并最小化奖励加权的流匹配损失。直接将该范式照搬到 上,得到 MeanFlowNFT 的目标:
其中 的定义与瞬时速度版本一致,只是将 替换为 。
第三步:稳定训练的关键设计。
- 有限差分导数:总导数 用中心有限差分近似,避免了昂贵的雅可比-向量积计算,且与分布式训练兼容。
- 共享总导数:将参考模型 与当前模型 的总导数项统一,使两者之差退化为简单的 ,消除了 EMA 参数更新带来的导数差异,训练极其稳定。
- 方向向量选择:有限差分沿 (前向条件速度)位移,而非 ,既节省计算又避免了训练后期方向偏差导致的退化。
整个过程中,采样仍使用原始的少步 MeanFlow 采样器 ,优化与推理完全解耦。
理论保证
在理想条件下(各点各区间独立优化至最优),论文给出了严格的策略改进证明。推论指出:当 时( 为期望奖励), 可精确恢复改进策略 的边际瞬时速度 。进一步,利用 MeanFlow 的一致性引理,可以证明此时 就是由 驱动的 ODE 的精确平均速度,因此部署的 MeanFlow 策略实际上实现了 ,奖励 。这为算法提供了坚实的理论基础。
实验效果
在图像生成(SD3.5-M)和视频生成(Wan2.1 1.3B)两个任务上,MeanFlowNFT 均展现出显著优势。
图像生成: 仅用 4 步采样,MeanFlowNFT 在 8 项指标中的 6 项上取得少步模型最佳,不但明显超越 DMD、CDM、AnyFlow 等蒸馏基线,更在多数指标上击败了使用 40 步的 DiffusionNFT 和 Flow-GRPO 等多步 RL 方法。例如,ImageReward 达到 1.45(DiffusionNFT 40 步为 1.41),OCR 从 0.45(AnyFlow)大幅提升至 0.65。直接对 AnyFlow/DMD/CDM 应用 DiffusionNFT 的基线则表现不佳,甚至训练崩溃,这验证了 “必须通过诱导构造才能保持理论一致性” 的关键论点。
视频生成: 在 Wan2.1 1.3B 上,MeanFlowNFT 以 4 步取得 VBench 总分 84.33,超过 AnyFlow 的 83.71,并大幅领先 50 步的 LongCat-Video RL(82.57),在运动质量和文本一致性上尤为突出。定性结果也显示,生成结果更忠实于提示,色彩自然,物体比例合理,避免了奖励黑客现象(如过饱和、比例失调)。
测试时步数扩展: MeanFlowNFT 在任何步数(2~32)下都保持生成质量的提升,且对比 AnyFlow,对不同步数的视觉一致性更强,暗示其平均速度估计更准确,策略改进更彻底。
消融实验进一步证实:共享总导数项是训练稳定的必要条件;沿 位移优于使用网络自身瞬时速度;训练时需同时使用 (瞬时速度监督)和 (平均速度监督)的样本对,否则效果会退化。
实践应用与未来方向
MeanFlowNFT 为少步生成模型的对齐提供了可行、高效的方案,尤其适合需要快速推理且追求高奖励的应用,如移动端文本到图像生成、短视频自动创作等。算法仅在前向加噪过程中操作,不依赖反向轨迹采样,计算代价低,与 EMA、LoRA 等标准优化技术完美兼容。实践者可遵循以下建议:
- 在预训练的 MeanFlow 蒸馏模型基础上,直接应用 MeanFlowNFT,仅需增加一个轻量的诱导预测器构造和共享的有穷差分模块。
- 选取适当的指导强度 (论文采用 0.1),配合 KL 正则化防止过度优化单一奖励。
- 利用 CFG-free 的 MeanFlow 采样器,在强化学习训练和部署中保持一致。
未来工作可将此框架扩展到更多流映射模型(如一致性轨迹模型、捷径模型),这些模型同样学习跨区间直接映射,均可能受益于诱导预测器构建及前向过程 RL 优化。此外,结合其他前向过程 RL 变体(如 RAM、AWM)亦可套用该范式,进一步扩展少步生成模型的 RL 微调工具箱。
总结
MeanFlowNFT 为平均速度生成器引入了首个高效的前向过程强化学习框架。通过 MeanFlow 恒等式构建诱导瞬时速度预测器,并巧妙地将 DiffusionNFT 目标投射其上,实现了在保持少步极速采样的同时,获得严格策略改进的理论支撑和优异的实验结果。这一工作打通了 RL 与高效流映射生成器之间的隔阂,为大规模实际部署提供了新路径。