MeanFlowNFT:将前向过程强化学习引入平均速度生成器

MeanFlowNFT: Bringing Forward-Process RL to Average-Velocity Generators

arXiv: 2607.15273v1

论文信息

标题: MeanFlowNFT: Bringing Forward-Process RL to Average-Velocity Generators

作者: Yushi Huang, Xiangxin Zhou, Jun Zhang, et al.

发布日期: 2026-07-16

arXiv ID: 2607.15273v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:这篇论文要解决什么? MeanFlow 模型通过预测平均速度实现快速少步采样,但现有的高效前向过程强化学习(RL)方法(如 DiffusionNFT)只能优化瞬时速度,无法直接应用于 MeanFlow。论文试图为 MeanFlow 构建一套前向过程 RL 框架。

  • 核心方法:用什么办法解决? 利用 MeanFlow 恒等式,从预测平均速度的网络中构造一个 “诱导瞬时速度预测器”,然后将 DiffusionNFT 的奖励优化目标作用在这个诱导预测器上,而推理时仍使用 MeanFlow 的少步采样器。

  • 关键结果:最重要的一个结论或数字。 在 Wan2.1 视频生成任务上,4 步 MeanFlowNFT 的 VBench 总分达到 84.33,超过了 50 步 LongCat-Video RL 的 82.57(见论文表 2)。

  • 主要局限:作者自己承认的、或方法本身固有的限制。 作者仅探索了 DiffusionNFT 这一种前向过程 RL 目标,未扩展到其他前向过程方法(如 RAM、AWM);同时只研究了 MeanFlow,未涉及更广泛的流映射模型家族(如 shortcut 模型、一致性轨迹模型)。

  • 适合读者:什么背景的人值得读? 适合从事生成模型(扩散模型/流匹配)加速、生成模型强化学习对齐、以及图像/视频生成效率优化的研究人员和工程师阅读。

论文背景和研究动机

扩散模型和流匹配模型已成为高质量图像与视频生成的主流范式。然而,这类模型在推理时需要沿反向过程逐步积分瞬时速度场,通常需要数十甚至上百步网络评估,生成速度缓慢。MeanFlow 通过预测一段时间区间内的平均速度,使得一步或几步采样即能完成生成,极大提升了效率。

另一方面,强化学习已经成为对齐生成模型与人类偏好、任务特定奖励的标准工具。在扩散/流匹配模型的 RL 方法中,DiffusionNFT 独树一帜:它不依赖策略梯度或反向过程似然估计,而是直接在前向加噪过程中进行在线 RL 训练,将奖励优化转化为一个流匹配风格的回归目标。这种方式不需要似然、与求解器无关,效率远高于基于 GRPO 的方法。

然而,一个关键障碍出现了:DiffusionNFT 优化的是瞬时速度,而 MeanFlow 采样依赖的是平均速度。直接将 DiffusionNFT 应用于 MeanFlow 是行不通的。这就引出了论文的核心问题:能否为 MeanFlow 设计一套高效的前向过程 RL 框架,使其在保持少步采样的同时,获得 RL 的奖励优化能力?

核心方法和技术细节

论文提出的 MeanFlowNFT 方法,核心思路是 “在平均速度空间保持网络参数化,在瞬时速度空间进行优化”。

诱导瞬时速度预测器的构造。 MeanFlow 恒等式(论文式 3)揭示了平均速度 u(xt,s,t)\bm{u}(\bm{x}_t,s,t) 与瞬时速度 v(xt,t)\bm{v}(\bm{x}_t,t) 之间的精确关系:

v(xt,t)=u(xt,s,t)+(t−s)ddtu(xt,s,t)\bm{v}(\bm{x}_t,t) = \bm{u}(\bm{x}_t,s,t) + (t-s)\frac{\mathrm{d}}{\mathrm{d}t}\bm{u}(\bm{x}_t,s,t)

其中全导数包含时间偏导和空间偏导项。该式表明,给定一个平均速度网络 uθ\bm{u}_\theta,可以通过恒等式构造出一个 “诱导瞬时速度预测器” Vθ\bm{V}_\theta(式 8):

Vθ(xt,s,t)=uθ(xt,s,t)+(t−s)[∂tuθ+(∂xuθ)v^θ]\bm{V}_\theta(\bm{x}_t,s,t) = \bm{u}_\theta(\bm{x}_t,s,t) + (t-s)\left[\partial_t \bm{u}_\theta + (\partial_{\bm{x}}\bm{u}_\theta) \hat{\bm{v}}_\theta\right]

其中 v^θ\hat{\bm{v}}_\theta 是网络在 s→ts \to t 极限下的瞬时速度。通过这个诱导预测器,原本作用于瞬时速度的 DiffusionNFT 目标就可以被无缝应用。

优化目标与应用。 MeanFlowNFT 采用与 DiffusionNFT 相同的隐式参数化方案,定义 “正向” 和 “负向” 诱导预测器 Vθ+\bm{V}_\theta^+ 和 Vθ−\bm{V}_\theta^-,然后优化(式 9):

LMFNFT(θ)=E[r∥Vθ+−vt∥22+(1−r)∥Vθ−−vt∥22]\mathcal{L}_{\mathrm{MFNFT}}(\theta) = \mathbb{E}\left[r\|\bm{V}_\theta^+ - \bm{v}_t\|_2^2 + (1-r)\|\bm{V}_\theta^- - \bm{v}_t\|_2^2\right]

其中 rr 为奖励信号,vt\bm{v}_t 为前向过程的条件速度。训练完全在前向加噪过程中进行,无需似然估计,也不展开反向去噪过程。推理时仍直接使用 uθ\bm{u}_\theta 和 MeanFlow 的少步采样器(式 4)。

关键实现技巧。 论文引入了若干实用设计以确保训练稳定性:使用中心有限差分近似全导数项,避免昂贵的雅可比向量积计算;训练和参考预测器共享同一次有限差分估计,消除两者衍差带来的不稳定;使用前向条件速度 vt\bm{v}_t 而非可训练的 v^θ\hat{\bm{v}}_\theta 作为位移方向。

创新点和贡献

首个面向 MeanFlow 的前向过程 RL 框架。 这是论文最核心的创新。在 MeanFlowNFT 之前,尚无方法能将高效的前向过程 RL(如 DiffusionNFT)应用于平均速度生成器。论文通过构造诱导瞬时速度预测器,成功架起了两者之间的桥梁。

理论保证。 论文在理想化设定下证明了三个递进层次的结论:诱导预测器的逐点最优解具有闭合形式(命题 3.1);在特定引导强度下,该最优解精确恢复了改进策略 π+\pi^+ 的边际速度(推论 3.2);这一改进能够被传递回平均速度网络,使得训练后的 MeanFlow 策略严格优于旧策略(定理 3.4)。该定理保证了 J(πθ∗)=J(π+)>J(πold)J(\pi_{\theta^*}) = J(\pi^+) > J(\pi^{\mathrm{old}})。

充分解耦优化与推理。 优化在瞬时速度空间进行,推理仍在平均速度空间进行。这一解耦简洁而有效:既享受了 DiffusionNFT 高效的似然无关训练,又完整保留了 MeanFlow 的少步推理优势。

实验结果分析

图像生成。 在 SD3.5-M 上(表 1),4 步 MeanFlowNFT 在 8 项指标中的 6 项上取得最优,明显超越了同类少步蒸馏方法(DMD、CDM、AnyFlow)和少步 RL 方法(RTDMD、RdmR_{\mathrm{dm}})。更引人注目的是,它使用 4 步采样在部分指标上(如 ImageReward 1.45 vs. 1.41、CLIPScore 0.297 vs. 0.289)就已经匹配甚至超过了 40 步 DiffusionNFT,计算量仅为后者的十分之一。

视频生成。 在 Wan2.1 1.3B 上(表 2),4 步 MeanFlowNFT 的 VBench 总分达到 84.33,不仅在少步方法中全面领先,而且超越了 50 步 LongCat-Video RL 的 82.57。在 HPSv3 和运动质量(MQ)指标上提升尤为显著。

消融与分析。 论文验证了共享导数项(图 8)和使用条件速度 vt\bm{v}_t(图 9)对训练稳定性的关键作用。如果不共享导数项,训练会迅速崩溃;如果使用可训练的 v^θ\hat{\bm{v}}_\theta,奖励会先升后降。此外,只使用 s=ts=t 对(即只优化瞬时速度)也会导致崩溃(图 10),证明了平均速度优化的必要性。

测试时缩放。 MeanFlowNFT 继承 AnyFlow 的任意步采样能力,且展现出更好的步数一致性:不同采样步数下生成的样本在布局和内容上变化更小(图 6、图 7),说明 RL 训练确实提升了平均速度估计的精度。

实践建议

对于考虑将 MeanFlowNFT 落地的工程师和研究人员,以下几点值得关注:

  1. 基础模型的准备。 MeanFlowNFT 需要一个预训练好的 MeanFlow 策略作为起点。论文在图像上先用两阶段 AnyFlow 流程获得了 MeanFlow 策略(流映射预训练 6000 步 + 在策略蒸馏 12000 步),在视频上直接使用了公开的 AnyFlow 检查点。对于自己的场景,需先通过蒸馏获得合理的 MeanFlow 基线。

  2. 奖励信号的设计。 图像训练使用了 CLIPScore、PickScore、HPSv2 三个奖励的等权组合;视频训练使用了 HPSv3-general、HPSv3-percentile、VideoAlign 运动质量和文本对齐四个奖励的组合,并在每组内对每个奖励维度做组归一化相对优势。多奖励组合和归一化策略可能是取得稳定提升的关键。

  3. 超参数设定。 论文使用的引导强度 β=0.1\beta=0.1、KL 正则化权重 10−410^{-4}、AdamW 学习率 3×10−63\times 10^{-6} 在实验中被证明有效。LoRA 秩为 32,缩放因子 64,应用于所有注意力块的线性层。对于不同的基座模型和任务,可能需要进行调整。

  4. 稳定性保障。 共享导数项和使用条件速度 vt\bm{v}_t 作为位移方向是训练稳定性的必要条件。在生产部署中,建议严格遵循这两个设计选择。若不共享导数项,训练会迅速发散(图 8)。

  5. 测试时步数选择。 MeanFlowNFT 支持任意步采样。论文实验表明,随着步数增加,大多数指标持续改善(图 5),且步数一致性优于 AnyFlow。实际部署时可以根据延迟-质量权衡灵活选择步数。4 步通常已能提供很强的质量。