MeanFlowNFT:将前向过程强化学习引入平均速度生成器

arXiv: 2607.15273v1

论文信息

标题: MeanFlowNFT: Bringing Forward-Process RL to Average-Velocity Generators

作者: Yushi Huang, Xiangxin Zhou, Jun Zhang, et al.

发布日期: 2026-07-16

arXiv ID: 2607.15273v1

PDF 链接: 下载 PDF

背景与动机

扩散模型和流匹配模型已成为高质量图像与视频生成的主流框架,但其推理需要沿时间轴逐步积分瞬时速度场,生成步骤多、计算开销大。MeanFlow(平均流)通过预测区间上的平均速度而非瞬时速度,支持单步或少步采样,显著提升了生成效率,因此在部署中极具吸引力。

强化学习已成为将生成模型与人类偏好或任务奖励对齐的重要工具。其中,DiffusionNFT提出了一种高效的前向过程 RL 方法,直接在加噪前向过程中构造对比目标(正样本 vs 负样本),无需反向采样轨迹或似然估计,训练实现简洁、收敛稳定。然而,DiffusionNFT 优化的是瞬时速度函数,而 MeanFlow 网络输出的是平均速度,二者之间存在根本性鸿沟。若直接将平均速度代入 DiffusionNFT 的目标,会破坏其策略改进的理论保证,甚至导致训练崩溃。

本文要回答的核心问题是:能否利用高效的前向过程 RL 来微调预训练的 MeanFlow 模型,使之在保留少步采样优势的同时,获得显著的奖励对齐提升? 为此,作者提出了 MeanFlowNFT

核心方法

MeanFlow 的学习关键在于一个恒等式:对于真实平均速度 u(xt,s,t)=1tsstv(xτ,τ)dτ\bm{u}(\bm{x}_t, s, t) = \frac{1}{t-s}\int_s^t \bm{v}(\bm{x}_\tau,\tau)\,\mathrm{d}\tau,其对应的瞬时速度可以通过全导数构建:

v(xt,t)=u(xt,s,t)+(ts)ddtu(xt,s,t).\bm{v}(\bm{x}_t, t) = \bm{u}(\bm{x}_t, s, t) + (t-s)\frac{\mathrm{d}}{\mathrm{d}t}\bm{u}(\bm{x}_t, s, t).

第一步:构造诱导的瞬时速度预测器。 给定一个 MeanFlow 网络 uθ(xt,s,t)\bm{u}_\theta(\bm{x}_t, s, t),论文利用上述恒等式构造出一个诱导瞬时速度预测器 Vθ\bm{V}_\theta

Vθ(xt,s,t)=uθ(xt,s,t)+(ts)[tuθ+(xuθ)v^θ],\bm{V}_\theta(\bm{x}_t, s, t) = \bm{u}_\theta(\bm{x}_t, s, t) + (t-s)\left[\partial_t\bm{u}_\theta + (\partial_{\bm{x}}\bm{u}_\theta)\,\widehat{\bm{v}}_\theta\right],

其中 v^θ(xt,t)=uθ(xt,t,t)\widehat{\bm{v}}_\theta(\bm{x}_t, t) = \bm{u}_\theta(\bm{x}_t, t, t) 是网络在 sts\to t 时恢复的瞬时速度,用于雅可比-向量积的方向。为了优化计算,总导数在训练中被包裹在 stop-gradient 中,防止其参与更新 uθ\bm{u}_\theta,但仍能间接强化平均速度预测。

第二步:在诱导预测器上施加 DiffusionNFT 目标。 DiffusionNFT 基于策略的后验分解 π+rπold\pi^+\propto r\pi^{\text{old}}π(1r)πold\pi^-\propto(1-r)\pi^{\text{old}},定义了一个隐式参数化的正/负预测器:

vθ+=(1β)vold+βvθ,vθ=(1+β)voldβvθ,\bm{v}_\theta^+ = (1-\beta)\bm{v}^{\text{old}} + \beta\bm{v}_\theta,\quad \bm{v}_\theta^- = (1+\beta)\bm{v}^{\text{old}} - \beta\bm{v}_\theta,

并最小化奖励加权的流匹配损失。直接将该范式照搬到 Vθ\bm{V}_\theta 上,得到 MeanFlowNFT 的目标:

LMFNFT=E[rVθ+vt2+(1r)Vθvt2],\mathcal{L}_{\text{MFNFT}} = \mathbb{E}\left[ r\|\bm{V}_\theta^+ - \bm{v}_t\|^2 + (1-r)\|\bm{V}_\theta^- - \bm{v}_t\|^2 \right],

其中 Vθ±\bm{V}_\theta^{\pm} 的定义与瞬时速度版本一致,只是将 vold/vθ\bm{v}^{\text{old}}/\bm{v}_\theta 替换为 Vold/Vθ\bm{V}^{\text{old}}/\bm{V}_\theta

第三步:稳定训练的关键设计。

  • 有限差分导数:总导数 ddtu\frac{\mathrm{d}}{\mathrm{d}t}\bm{u} 用中心有限差分近似,避免了昂贵的雅可比-向量积计算,且与分布式训练兼容。
  • 共享总导数:将参考模型 Vold\bm{V}^{\text{old}} 与当前模型 Vθ\bm{V}_\theta 的总导数项统一,使两者之差退化为简单的 uθuold\bm{u}_\theta - \bm{u}^{\text{old}},消除了 EMA 参数更新带来的导数差异,训练极其稳定。
  • 方向向量选择:有限差分沿 vt\bm{v}_t(前向条件速度)位移,而非 v^θ\widehat{\bm{v}}_\theta,既节省计算又避免了训练后期方向偏差导致的退化。

整个过程中,采样仍使用原始的少步 MeanFlow 采样器 xti1=xti(titi1)uθ(xti,ti1,ti)\bm{x}_{t_{i-1}} = \bm{x}_{t_i} - (t_i-t_{i-1})\bm{u}_\theta(\bm{x}_{t_i}, t_{i-1}, t_i),优化与推理完全解耦。

理论保证

在理想条件下(各点各区间独立优化至最优),论文给出了严格的策略改进证明。推论指出:当 β=2α(xt,c)\beta = 2\alpha(\bm{x}_t,\bm{c}) 时(α\alpha 为期望奖励),Vθ\bm{V}_{\theta^*} 可精确恢复改进策略 π+\pi^+ 的边际瞬时速度 v+\bm{v}^+。进一步,利用 MeanFlow 的一致性引理,可以证明此时 uθ\bm{u}_{\theta^*} 就是由 v+\bm{v}^+ 驱动的 ODE 的精确平均速度,因此部署的 MeanFlow 策略实际上实现了 π+\pi^+,奖励 J(πθ)=J(π+)>J(πold)J(\pi_{\theta^*}) = J(\pi^+) > J(\pi^{\text{old}})。这为算法提供了坚实的理论基础。

实验效果

在图像生成(SD3.5-M)和视频生成(Wan2.1 1.3B)两个任务上,MeanFlowNFT 均展现出显著优势。

图像生成: 仅用 4 步采样,MeanFlowNFT 在 8 项指标中的 6 项上取得少步模型最佳,不但明显超越 DMD、CDM、AnyFlow 等蒸馏基线,更在多数指标上击败了使用 40 步的 DiffusionNFT 和 Flow-GRPO 等多步 RL 方法。例如,ImageReward 达到 1.45(DiffusionNFT 40 步为 1.41),OCR 从 0.45(AnyFlow)大幅提升至 0.65。直接对 AnyFlow/DMD/CDM 应用 DiffusionNFT 的基线则表现不佳,甚至训练崩溃,这验证了 “必须通过诱导构造才能保持理论一致性” 的关键论点。

视频生成: 在 Wan2.1 1.3B 上,MeanFlowNFT 以 4 步取得 VBench 总分 84.33,超过 AnyFlow 的 83.71,并大幅领先 50 步的 LongCat-Video RL(82.57),在运动质量和文本一致性上尤为突出。定性结果也显示,生成结果更忠实于提示,色彩自然,物体比例合理,避免了奖励黑客现象(如过饱和、比例失调)。

测试时步数扩展: MeanFlowNFT 在任何步数(2~32)下都保持生成质量的提升,且对比 AnyFlow,对不同步数的视觉一致性更强,暗示其平均速度估计更准确,策略改进更彻底。

消融实验进一步证实:共享总导数项是训练稳定的必要条件;沿 vt\bm{v}_t 位移优于使用网络自身瞬时速度;训练时需同时使用 s=ts=t(瞬时速度监督)和 s<ts<t(平均速度监督)的样本对,否则效果会退化。

实践应用与未来方向

MeanFlowNFT 为少步生成模型的对齐提供了可行、高效的方案,尤其适合需要快速推理且追求高奖励的应用,如移动端文本到图像生成、短视频自动创作等。算法仅在前向加噪过程中操作,不依赖反向轨迹采样,计算代价低,与 EMA、LoRA 等标准优化技术完美兼容。实践者可遵循以下建议:

  • 在预训练的 MeanFlow 蒸馏模型基础上,直接应用 MeanFlowNFT,仅需增加一个轻量的诱导预测器构造和共享的有穷差分模块。
  • 选取适当的指导强度 β\beta(论文采用 0.1),配合 KL 正则化防止过度优化单一奖励。
  • 利用 CFG-free 的 MeanFlow 采样器,在强化学习训练和部署中保持一致。

未来工作可将此框架扩展到更多流映射模型(如一致性轨迹模型、捷径模型),这些模型同样学习跨区间直接映射,均可能受益于诱导预测器构建及前向过程 RL 优化。此外,结合其他前向过程 RL 变体(如 RAM、AWM)亦可套用该范式,进一步扩展少步生成模型的 RL 微调工具箱。

总结

MeanFlowNFT 为平均速度生成器引入了首个高效的前向过程强化学习框架。通过 MeanFlow 恒等式构建诱导瞬时速度预测器,并巧妙地将 DiffusionNFT 目标投射其上,实现了在保持少步极速采样的同时,获得严格策略改进的理论支撑和优异的实验结果。这一工作打通了 RL 与高效流映射生成器之间的隔阂,为大规模实际部署提供了新路径。