DanceOPD:同策生成场蒸馏

arXiv: 2606.27377v1

论文信息

标题: DanceOPD: On-Policy Generative Field Distillation

作者: Wei Zhou, Xiongwei Zhu, Zelin Xu, et al.

发布日期: 2026-06-25

arXiv ID: 2606.27377v1

PDF 链接: 下载 PDF

论文背景与研究动机

现代图像生成模型正从单一文本到图像(T2I)功能向多能力统一的方向快速发展。一个部署的模型需要同时支持文本到图像生成、局部编辑(如更换物体颜色)、全局编辑(如风格迁移)等多种功能。然而,这些能力在本质上并不兼容:T2I 追求开放域的视觉质量和指令跟随,局部编辑要求保持源图像内容不变而只做精确修改,全局编辑则需要大幅改变整体视觉统计特征。直接将它们联合训练或简单混合数据,会带来能力干扰——编辑任务可能削弱 T2I 性能,而局部与全局编辑在学习目标上相互冲突。因此,如何有效组合多种生成能力成为当前图像生成模型训练的核心挑战。

现有的能力组合方案各有局限:数据混合与联合训练容易稀释任务特定监督,引发多任务梯度冲突;参数空间合并(如模型权重插值)和适配器组合往往只能得到折衷解;推理时的分数组合则把能力组合过程放在了模型外部,无法在部署模型中内化这些能力。这些方法都不能直接回答一个关键问题:一个模型应该如何在其生成轨迹的各个状态上,有效地查询和组合多个生成能力?

为了解决这一问题,本文作者从流匹配模型(flow-matching models)的视角出发,把每个冻结的能力源视为一个定义在共享生成状态空间上的速度场。能力组合因此转化为一个场查询(field query)问题,涉及三个紧密耦合的选择:哪个能力场监督当前样本、在状态空间的哪里查询该场、以及从学生模型的一次推演中采多少状态用于监督。基于此,本文提出了 DanceOPD —— 一个基于在策略生成场蒸馏的框架,通过硬路由、学生状态查询和语义侧单查询设计,有效实现了多能力组合。

核心方法与技术细节

DanceOPD 将多能力图像生成建模为一个 在策略生成场蒸馏 问题。给定 MM 个冻结的、来自同一状态空间的能力源(例如 T2I 模型、编辑模型、风格模型等),希望训练一个学生模型 vθv_\theta 能模仿这些速度场,但不是通过静态参数插值或固定数据配比的微调,而是通过 query 的方式组合。

方法围绕三个诊断出的挑战展开:

  1. 目标场模糊:如果在一个样本内对多个冻结场进行线性混合,得到的监督方向可能不再对应任何一个有语义意义的能力,导致目标歧义。
  2. 状态分布错配:如果只在数据状态或教师轨迹上查询场,学生模型推理时实际访问的状态可能与训练时不同,造成训练-推理分布偏移。
  3. 轨迹查询相关:从同一条学生推演轨迹上采样多个状态进行监督,这些状态共享初始化噪声、提示词、学生动力学和路径历史,其梯度高度相关,并不能提供有效的独立监督。

针对上述问题,DanceOPD 采用了三种对应的设计:

硬路由样本级场匹配 每个训练样本只被路由到一个能力场,保持监督目标的语义纯度。设路由概率 π(m)\pi(m),则目标速度场为 um(z,t,c)=vm(z,t,c)u_m(z,t,c)=v_m(z,t,c),这避免了一个样本中混入无关能力的梯度。

在策略场查询 不再从离线加噪端点或教师轨迹获取查询状态,而是在学生自身生成的推演轨迹上选取状态。具体操作是:对当前学生进行 ODE 推演,得到轨迹 z0:Tθz_{0:T}^\theta,然后选取一个的语义坐标 ss 对应的物理时间步 tt,取 ztθz_t^\theta 作为停止梯度的查询状态 zˉt\bar{z}_t。这样做使得监督信号与学生在实际生成过程中遇到的状态对齐,缓解分布错配。

语义侧低噪声单查询 为了避开轨迹内状态的相关性,DanceOPD 每样本只查询一个状态,且偏向于低噪声(接近最终图像的语义侧)。作者认为,编辑、风格等能力特定信息集中在低噪声区域;高噪声状态更多承载通用去噪信息。通过采样偏置分布 sqsem(s)s\sim q_\text{sem}(s) 偏向低噪声侧,得到高信噪比的能力监督。实验表明,仅一个语义侧低噪声查询的稳定性和效果优于多个轨迹查询的变体。

训练目标 采用普通的速度均方误差(MSE)作为损失函数:

LDanceOPD=E[vθ(zˉt,t,c)vm(zˉt,t,c)22]\mathcal{L}_{\text{DanceOPD}} = \mathbb{E}\left[ \| v_\theta(\bar{z}_t,t,c) - v_m(\bar{z}_t,t,c) \|_2^2 \right]

一方面,在局部高斯过渡假设下,KL 散度可转化为加权 MSE,因此该目标自然合理;另一方面,该目标也适用于吸收运算符定义的场,如将无分类器引导(CFG)视为一个引导速度场 vαv_\alpha 并采用相同 MSE 进行吸收,使得模型可以内部化部分引导效果。

创新点与贡献

DanceOPD 的核心贡献在于首次将多能力组合系统性地形式化为在策略场蒸馏,提出了一套完整的场查询设计准则,并深入分析了查询过程中的三个错配问题。具体创新点包括:

  • 场蒸馏视角的能力组合:把每个冻结模型视为速度场,将组合简化为 “查询哪个场、在哪查、查多少”。
  • 硬路由机制:保持每个样本的能力身份,避免语义混杂。
  • 在策略查询:根据学生当前推演状态查询教师场,是流匹配模型中对 on-policy 蒸馏的具体实现,不同于以往仅应用于语言模型或标量反馈的方法。
  • 语义侧单查询:证实了低噪声单状态查询的高效性,大幅减少计算量且性能更优。
  • 统一吸收运算符定义的场:如 CFG 吸收和真实感场吸收,展示了框架的通用性。

实验结果分析

作者在 Z-Image 和 SD3.5-M 两个骨干上,对 T2I 与编辑组合、局部与全局编辑组合、真实感场吸收以及 CFG 吸收等四个场景进行了全面评估,使用 GenEval 和 GEditBench 作为主要指标。

多能力组合实验 在 T2I 与编辑组合中,DanceOPD 相比最强基线在 GEditBench 平均分上提升 8.1%8.1\%,且 GenEval 甚至超过了 T2I 源模型,表明目标能力增强的同时,锚点能力未被牺牲。在局部与全局编辑组合中,改进幅度更大(提升 16.1%16.1\%),特别是在背景变化、风格变换等需要大范围修改的类别上效果显著。

场吸收实验 对于真实感场吸收,DanceOPD 在保持 T2I 分数基本不变的条件下,显著缩小了与真实感教师之间的奖励差距(关闭 85.3%85.3\% 的差距)。CFG 吸收实验中,合理组合吸收与外部引导可获得最优结果,训练时吸收的 CFG 与推理时 CFG 近似相乘,需要谨慎选择尺度以避免过度引导。

消融研究 验证了硬路由相对于软多教师混合的显著优势(MSE 下提升 15.2%15.2\%);低噪声查询相对于中、高噪声查询的提升(23.7%23.7\%19.5%19.5\%);单查询相对于多查询的稳定性;以及在固定匹配目标上,普通 MSE 优于 KL 加权、一致性匹配等变体。同时,学生初始化的选择至关重要:从最强的相关能力初始化,比从混合初始化或无关锚点初始化能获得数倍的性能提升。

实践应用建议与未来发展方向

DanceOPD 为工业界训练统一多能力图像生成模型提供了可行的流水线:直接在一个基础模型上,针对不同下游任务(例如编辑、风格化、真实感增强)准备冻结的能力场,然后采用在策略场蒸馏吸收这些场,而无需反复联合微调或复杂的参数融合。实践中应注意:

  • 能力场兼容性:要求各能力源来自同一模型族、使用相同的潜空间和调度器,否则场无法在共享状态空间上对齐。
  • 路由定义清晰:对任务划分明确的数据集,可以预先定义能力桶并均匀采样路由;若任务边界模糊,可引入验证器或奖励模型自动分配路由。
  • 一次性单查询的效率:低噪声单查询不仅性能好,而且大幅节省计算开销,适合资源受限的训练环境。

未来,DanceOPD 可扩展至更多能力组合,例如角色一致性、多视角生成等;也可以结合在线奖励模型实现自适应路由,将能力组合转化为一个多臂老虎机问题,使得学生能动态调整从各能力场的查询频率。此外,将该框架从 DiT 架构推广到更多扩散模型变体,并与提示工程、控制信号结合,有望进一步提升可控生成的灵活性与质量。

总结与展望

DanceOPD 通过把多能力图像生成重新表述为在策略生成场蒸馏,提出了一种系统化的能力组合方法。其核心洞察在于:组合多个生成能力的关键不是静态的参数平均或数据比例调整,而是在学生生成轨迹上,对每个样本硬路由到一个能力场,在低噪声侧仅用一个查询状态进行监督。理论推导与大量实验共同证明,这种方法有效缓解了目标场模糊、分布错配和查询相关三大挑战,在多组基准上实现了目标能力与锚点能力的双赢。

DanceOPD 不仅提供了一个即用的蒸馏协议,更为生成模型的 “后训练能力组合” 开辟了新的研究方向。展望未来,随着更大规模多任务生成模型的涌现,基于场蒸馏的能力融合框架有望成为构建通用创作工具的基石。