Diffusion Transformers 中上下文空间的动态排斥以实现丰富多样性

On-the-fly Repulsion in the Contextual Space for Rich Diversity in Diffusion Transformers

arXiv: 2603.28762v1

论文信息

标题: On-the-fly Repulsion in the Contextual Space for Rich Diversity in Diffusion Transformers

作者: Omer Dahary, Benaya Koren, Daniel Garibi, et al.

发布日期: 2026-03-30

arXiv ID: 2603.28762v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:现代文本到图像扩散模型虽然语义对齐精度高,但生成结果多样性明显不足,倾向于输出 “典型” 图像,这种现象被称为典型性偏见。
  • 核心方法:在扩散变换器(DiT)的多模态注意力通道内部,对 “上下文空间”(即文本与图像交互后形成的丰富化文本令牌)施加实时排斥力,使同一批次的样本在语义层面被引导到不同方向,而不是在像素空间或初始噪声上扰动。
  • 关键结果:在 Flux-dev 上,本方法在所有质量与多样性指标(人类偏好、提示对齐、分布保真度)上都形成了优于现有所有基线的帕累托前沿,且仅带来约 20‑30% 的额外计算开销(见论文表 1)。
  • 主要局限:排斥力增加了多样性,但无法指定哪些视觉属性会发生变化;变化倾向偏粗粒度语义调整,缺少对精细属性的控制;干预主要集中在生成过程早期,如何与后期精细化控制协同仍是开放问题。
  • 适合读者:扩散模型、文本到图像生成、可控生成和生成式 AI 应用方向的研究者与工程师,特别是关注模型多样性、创意输出及推理效率权衡的读者。

论文背景和研究动机

近年来,扩散模型在文本到图像(T2I)领域取得了惊人的视觉质量和提示响应能力。然而,为了让模型贴近人类偏好,主流技术如无分类器引导(CFG)会压缩生成分布,将输出推向一个单一模态,导致多次采样时图像高度雷同。这种典型性偏见在追求高精度和快速推理的 “Turbo” 类蒸馏模型中愈发明显,严重限制了生成模型作为 “创意伙伴” 的潜力,使得它更像一种高级检索工具,而非探索丰富的视觉可能性的引擎。

现有增加多样性的方法可归为两类:上游干预(修改初始噪声或文本嵌入)和下游干预(在去噪过程中对隐空间施加排斥)。上游方法缺乏正在形成的图像结构的反馈,往往导致语义漂移,或需要昂贵的优化搜索来寻找多样性路径;下游方法因为作用于已经空间固定的隐变量,强行推开样本会破坏构图,产生伪影,并且在少步数蒸馏模型中几乎无效(去噪轨迹太短,来不及转向)。因此,存在一个根本性的干预困境:早期干预缺乏结构信息,晚期干预又已经 “木已成舟”。论文正是瞄准这一困境,提出一个全新干预层面——上下文空间。

核心方法和技术细节

扩散变换器(DiT)架构的一个关键特性是文本与图像令牌在每一个多模态注意力块中同时交互,文本表示会吸收来自图像的空间和内容反馈,形成一种既与提示相关又与当前图像结构同步的 “丰富化文本令牌”。论文把这个高维流形称为上下文空间,并以这些令牌作为排斥干预的载体。

具体来说,在每个多模态注意力块输出的文本令牌 f^T(l)\hat{f}_T^{(l)} 上,执行基于粒子的排斥——类似于粒子引导(PG)的思路,但完全作用在上下文令牌上,而非图像隐变量 ztz_t。对一批 BB 个样本,定义它们的上下文向量为 ci(l)\mathbf{c}_i^{(l)} (将令牌序列展平),然后用余弦相似度构建核矩阵 K\mathbf{K},计算正则化核矩阵 K~=1BK\tilde{\mathbf{K}} = \frac{1}{B}\mathbf{K} 的特征值 {λk}\{\lambda_k\},优化的损失函数为负冯·诺依曼熵:

Ldiv=−∑k=1Bλklog⁡λk\mathcal{L}_{div} = -\sum_{k=1}^{B} \lambda_k \log \lambda_k

在每个注意力块的内部,通过 MM 次梯度步更新上下文令牌:

f^T,i(l)′=f^T,i(l)+ηM∇f^T,i(l)Ldiv\hat{f}_{T,i}^{(l)\prime} = \hat{f}_{T,i}^{(l)} + \frac{\eta}{M} \nabla_{\hat{f}_{T,i}^{(l)}} \mathcal{L}_{div}

其中 η\eta 控制排斥强度,所有的计算都在模型前向过程中实时进行,无需反向传播至整个网络,开销极低。干预仅限制在最初几个去噪时间步(由 τ\tau 控制),因为早期阶段对全局语义和构图的决定性最大。这种方法实质上是在生成意图尚未固化为空间布局之前,对高层次的语义方向进行引导,使得同一提示下的各样本朝着不同的语义支线演进,避免 CFG 导致的模式坍缩。

此外,论文还揭示了上下文空间的优良性质:通过在一个源图像和一个目标图像之间对上下文令牌做线性插值,模型能够实现平滑的语义过渡,而不会像在 VAE 隐空间插值那样产生结构模糊或伪影,证明上下文空间解耦了语义内容与固定空间网格。

创新点和贡献

  1. 识别并利用上下文空间作为多样性干预的理想场所。与传统方法纠缠于像素级或无条件噪声空间不同,该方法抓住 DiT 架构中文本与图像令牌交互的动态本质,在语义灵活性和结构敏感性之间找到了平衡点。
  2. 提出实时上下文排斥框架。将粒子排斥从图像隐变量迁移至上下文令牌,干预时机选择在语义已受图像反馈但布局未锁定的关键时刻,且无需额外优化和反向传播,显著降低计算负载。
  3. 在多种模型和采样体制下验证有效性。不仅适用于标准扩散模型(SD3.5-Large),也在蒸馏模型(SD3.5-Turbo)和最新的 Flux-dev 上表现出色,甚至在图像编辑模型 Flux Kontext 上零样本直接应用也能产生多样化编辑结果,显示出方法的泛化性。
  4. 完整的实验与用户研究。通过大量定量指标(Vendi 得分、ImageReward、VQAScore、KID)构建帕累托前沿,结合用户调研,系统性证明上下文排斥在多样性、质量、对齐度三者间取得了先前方法难以企及的权衡,且速度上远超需要候选池优化的方法(如 SGI)。

实验结果分析

定量对比 在 Flux-dev 上,上下文排斥的帕累托前沿全面优于 PG、SPARKE、CADS 和 SGI。例如,当排斥强度 η\eta 从 2.5×1082.5\times10^{8} 增大到 2.5×10102.5\times10^{10} 时,Vendi 得分从 1.810 升至 1.898,而 ImageReward 仅从 1.102 轻微降至 1.070(见表 2)。相比之下,CADS 虽然能提升多样性,但人类偏好和提示对齐度急剧下降;PG 和 SPARKE 在提升 Vendi 的同时导致 KID 陡增(分布失真)。更重要的是,SGI 通过从 64 个候选选出结果,多样性(Vendi=1.916)与上下文排斥(1.898)接近,但计算时间是后者的近 9 倍(113.99 秒 vs 12.80 秒,表 1),这在实时或大规模应用中几乎不可行。

用户研究 45 名参与者对 40 个多样提示进行盲测,上下文排斥在整体偏好上胜过所有对比方法,仅在 SGI 上接近(31.1% vs 27.8% 偏好对手,其余为平局)。在多样性和质量两个维度上,本方法均获得明显优势(分别平均 61.1% 和 58.0% 的用户偏好),并且提示遵循度也胜出(平均 48.9%),说明多样性并未以牺牲语义为代价。

消融实验 本文还做了大量消融,确认了几个关键点:(1)排斥作用在文本令牌上明显优于图像令牌——图像令牌的排斥因空间刚性而引入伪影,且多样性-质量曲线下降陡峭(图 9)。(2)排斥强度 η\eta 与多样性正相关,合理设置可平滑调节变化程度。(3)排斥时间窗选择影响最终行为,早期介入贡献多样性,晚期介入有助于质量,中间块(中间三分之一层)往往能给出最好的综合效果(表 8)。

跨架构泛化 方法在 SD3.5-Large(非蒸馏,28 步)和 SD3.5-Turbo(4 步蒸馏)上同样有效,甚至在后者上显著优于其他所有方法,进一步证明上下文排斥不需要长去噪轨迹,特别适合高速采样场景。

本文的实质性贡献在于,它不是通过牺牲质量来换取多样性,而是重新定义了在何处以及何时施加多样性信号,为扩散模型的可控生成提供了新的操控维度。

实践建议

对于希望在其 T2I 系统或产品中集成此方法的工程师,以下几点值得参考:

  • 优先在 DiT 架构上采用。由于方法依赖多模态注意力块产生的上下文令牌,它天然适用于 Flux、SD3 系列等 DiT-based 模型。对于仍使用 UNet+交叉注意力的旧模型(如 SDXL),无法直接移植,需考虑架构升级。
  • 超参数调节以平衡 trade-off。关键参数是排斥强度 η\eta 和干预的终止时间步 τ\tau。通常,η\eta 越大,多样性越高但质量略有下降。建议根据应用场景设定容忍度:创意工具可选用较大 η\eta,产品级图像则需保守选择。此外,将干预限定在总步数的前 14\frac{1}{4} 至 12\frac{1}{2} 是一个稳健的起点(见论文附录 D)。
  • “批量” 推理架构友好。正因为方法需要一批样本同时进行排斥,它天然适合在线服务中并行生成多张候选图的模式。可将用户的一次请求视为一个批次,用本方法直接输出一组多样化的图像,无需事后筛选。
  • 与图像编辑流水线零成本结合。如 Flux Kontext 的实验所示,直接对编辑指令的文本流施加排斥,可在保持编辑语义的前提下产生多样化结果。内容创作平台可将此作为 “风格/构图变体” 功能,显著提升用户体验。
  • 注意应用局限性。该方法不能指定变化维度;若用户期望多样化的同时保持某一特定属性固定,需额外加入属性保持损失或与 ControlNet 等机制结合。可考虑引入一个基于关键词的偏置项,但论文将此留给未来工作,当前工程实现需辅以后过滤或人工筛选。

总体而言,上下文排斥为扩散模型赋予了低成本、高保真的多样性控制能力,特别适合需要快速生成有变异度的创意内容的工业场景。