MeanFlowNFT:将前向过程强化学习引入平均速度生成器
MeanFlowNFT: Bringing Forward-Process RL to Average-Velocity Generators
论文信息
标题: MeanFlowNFT: Bringing Forward-Process RL to Average-Velocity Generators
作者: Yushi Huang, Xiangxin Zhou, Jun Zhang, et al.
发布日期: 2026-07-16
arXiv ID: 2607.15273v1
PDF 链接: 下载 PDF
3 分钟速览
-
研究问题:这篇论文要解决什么? MeanFlow 模型通过预测平均速度实现快速少步采样,但现有的高效前向过程强化学习(RL)方法(如 DiffusionNFT)只能优化瞬时速度,无法直接应用于 MeanFlow。论文试图为 MeanFlow 构建一套前向过程 RL 框架。
-
核心方法:用什么办法解决? 利用 MeanFlow 恒等式,从预测平均速度的网络中构造一个 “诱导瞬时速度预测器”,然后将 DiffusionNFT 的奖励优化目标作用在这个诱导预测器上,而推理时仍使用 MeanFlow 的少步采样器。
-
关键结果:最重要的一个结论或数字。 在 Wan2.1 视频生成任务上,4 步 MeanFlowNFT 的 VBench 总分达到 84.33,超过了 50 步 LongCat-Video RL 的 82.57(见论文表 2)。
-
主要局限:作者自己承认的、或方法本身固有的限制。 作者仅探索了 DiffusionNFT 这一种前向过程 RL 目标,未扩展到其他前向过程方法(如 RAM、AWM);同时只研究了 MeanFlow,未涉及更广泛的流映射模型家族(如 shortcut 模型、一致性轨迹模型)。
-
适合读者:什么背景的人值得读? 适合从事生成模型(扩散模型/流匹配)加速、生成模型强化学习对齐、以及图像/视频生成效率优化的研究人员和工程师阅读。
论文背景和研究动机
扩散模型和流匹配模型已成为高质量图像与视频生成的主流范式。然而,这类模型在推理时需要沿反向过程逐步积分瞬时速度场,通常需要数十甚至上百步网络评估,生成速度缓慢。MeanFlow 通过预测一段时间区间内的平均速度,使得一步或几步采样即能完成生成,极大提升了效率。
另一方面,强化学习已经成为对齐生成模型与人类偏好、任务特定奖励的标准工具。在扩散/流匹配模型的 RL 方法中,DiffusionNFT 独树一帜:它不依赖策略梯度或反向过程似然估计,而是直接在前向加噪过程中进行在线 RL 训练,将奖励优化转化为一个流匹配风格的回归目标。这种方式不需要似然、与求解器无关,效率远高于基于 GRPO 的方法。
然而,一个关键障碍出现了:DiffusionNFT 优化的是瞬时速度,而 MeanFlow 采样依赖的是平均速度。直接将 DiffusionNFT 应用于 MeanFlow 是行不通的。这就引出了论文的核心问题:能否为 MeanFlow 设计一套高效的前向过程 RL 框架,使其在保持少步采样的同时,获得 RL 的奖励优化能力?
核心方法和技术细节
论文提出的 MeanFlowNFT 方法,核心思路是 “在平均速度空间保持网络参数化,在瞬时速度空间进行优化”。
诱导瞬时速度预测器的构造。 MeanFlow 恒等式(论文式 3)揭示了平均速度 与瞬时速度 之间的精确关系:
其中全导数包含时间偏导和空间偏导项。该式表明,给定一个平均速度网络 ,可以通过恒等式构造出一个 “诱导瞬时速度预测器” (式 8):
其中 是网络在 极限下的瞬时速度。通过这个诱导预测器,原本作用于瞬时速度的 DiffusionNFT 目标就可以被无缝应用。
优化目标与应用。 MeanFlowNFT 采用与 DiffusionNFT 相同的隐式参数化方案,定义 “正向” 和 “负向” 诱导预测器 和 ,然后优化(式 9):
其中 为奖励信号, 为前向过程的条件速度。训练完全在前向加噪过程中进行,无需似然估计,也不展开反向去噪过程。推理时仍直接使用 和 MeanFlow 的少步采样器(式 4)。
关键实现技巧。 论文引入了若干实用设计以确保训练稳定性:使用中心有限差分近似全导数项,避免昂贵的雅可比向量积计算;训练和参考预测器共享同一次有限差分估计,消除两者衍差带来的不稳定;使用前向条件速度 而非可训练的 作为位移方向。
创新点和贡献
首个面向 MeanFlow 的前向过程 RL 框架。 这是论文最核心的创新。在 MeanFlowNFT 之前,尚无方法能将高效的前向过程 RL(如 DiffusionNFT)应用于平均速度生成器。论文通过构造诱导瞬时速度预测器,成功架起了两者之间的桥梁。
理论保证。 论文在理想化设定下证明了三个递进层次的结论:诱导预测器的逐点最优解具有闭合形式(命题 3.1);在特定引导强度下,该最优解精确恢复了改进策略 的边际速度(推论 3.2);这一改进能够被传递回平均速度网络,使得训练后的 MeanFlow 策略严格优于旧策略(定理 3.4)。该定理保证了 。
充分解耦优化与推理。 优化在瞬时速度空间进行,推理仍在平均速度空间进行。这一解耦简洁而有效:既享受了 DiffusionNFT 高效的似然无关训练,又完整保留了 MeanFlow 的少步推理优势。
实验结果分析
图像生成。 在 SD3.5-M 上(表 1),4 步 MeanFlowNFT 在 8 项指标中的 6 项上取得最优,明显超越了同类少步蒸馏方法(DMD、CDM、AnyFlow)和少步 RL 方法(RTDMD、)。更引人注目的是,它使用 4 步采样在部分指标上(如 ImageReward 1.45 vs. 1.41、CLIPScore 0.297 vs. 0.289)就已经匹配甚至超过了 40 步 DiffusionNFT,计算量仅为后者的十分之一。
视频生成。 在 Wan2.1 1.3B 上(表 2),4 步 MeanFlowNFT 的 VBench 总分达到 84.33,不仅在少步方法中全面领先,而且超越了 50 步 LongCat-Video RL 的 82.57。在 HPSv3 和运动质量(MQ)指标上提升尤为显著。
消融与分析。 论文验证了共享导数项(图 8)和使用条件速度 (图 9)对训练稳定性的关键作用。如果不共享导数项,训练会迅速崩溃;如果使用可训练的 ,奖励会先升后降。此外,只使用 对(即只优化瞬时速度)也会导致崩溃(图 10),证明了平均速度优化的必要性。
测试时缩放。 MeanFlowNFT 继承 AnyFlow 的任意步采样能力,且展现出更好的步数一致性:不同采样步数下生成的样本在布局和内容上变化更小(图 6、图 7),说明 RL 训练确实提升了平均速度估计的精度。
实践建议
对于考虑将 MeanFlowNFT 落地的工程师和研究人员,以下几点值得关注:
-
基础模型的准备。 MeanFlowNFT 需要一个预训练好的 MeanFlow 策略作为起点。论文在图像上先用两阶段 AnyFlow 流程获得了 MeanFlow 策略(流映射预训练 6000 步 + 在策略蒸馏 12000 步),在视频上直接使用了公开的 AnyFlow 检查点。对于自己的场景,需先通过蒸馏获得合理的 MeanFlow 基线。
-
奖励信号的设计。 图像训练使用了 CLIPScore、PickScore、HPSv2 三个奖励的等权组合;视频训练使用了 HPSv3-general、HPSv3-percentile、VideoAlign 运动质量和文本对齐四个奖励的组合,并在每组内对每个奖励维度做组归一化相对优势。多奖励组合和归一化策略可能是取得稳定提升的关键。
-
超参数设定。 论文使用的引导强度 、KL 正则化权重 、AdamW 学习率 在实验中被证明有效。LoRA 秩为 32,缩放因子 64,应用于所有注意力块的线性层。对于不同的基座模型和任务,可能需要进行调整。
-
稳定性保障。 共享导数项和使用条件速度 作为位移方向是训练稳定性的必要条件。在生产部署中,建议严格遵循这两个设计选择。若不共享导数项,训练会迅速发散(图 8)。
-
测试时步数选择。 MeanFlowNFT 支持任意步采样。论文实验表明,随着步数增加,大多数指标持续改善(图 5),且步数一致性优于 AnyFlow。实际部署时可以根据延迟-质量权衡灵活选择步数。4 步通常已能提供很强的质量。