CFG-Ctrl:基于控制的无分类器扩散引导

CFG-Ctrl: Control-Based Classifier-Free Diffusion Guidance

arXiv: 2603.03281v1

论文信息

标题: CFG-Ctrl: Control-Based Classifier-Free Diffusion Guidance

作者: Hanyang Wang, Yiyang Liu, Jiawei Chi, et al.

发布日期: 2026-03-03

arXiv ID: 2603.03281v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:Classifier-Free Guidance (CFG) 在流匹配扩散模型中使用高引导尺度时,会出现颜色过饱和、结构扭曲和语义失真等不稳定现象,本质上是线性反馈控制的固有缺陷。

  • 核心方法:将 CFG 重新解释为一种作用于生成流上的反馈控制过程,提出滑模控制 CFG (SMC-CFG),通过引入一个开关控制项强制生成轨迹沿滑模面快速收敛,实现非线性引导。

  • 关键结果:在 Stable Diffusion 3.5、Flux-dev 和 Qwen-Image 三款模型上,SMC-CFG 在 CLIP Score、ImageReward 等多个语义对齐和人类偏好指标上均优于标准 CFG 及近期变体,尤其在高引导尺度下保持鲁棒(见论文表 2)。

  • 主要局限:SMC-CFG 引入了 λ 和 k 两个额外超参数,不同模型需要手动调优;论文在离散实现中的抖动抑制问题主要依赖经验性的 “稳定性走廊” 启发式规则,未给出自适应调参方案(见论文第 9.2 节)。

  • 适合读者:从事扩散模型研究、对控制理论与生成模型交叉领域感兴趣的研究者,以及希望在工程中提高 T2I 生成质量与稳定性的应用开发者。

论文背景和研究动机

扩散模型和流匹配模型已成为高保真图像生成的核心技术。在这些模型中,Classifier-Free Guidance (CFG) 作为一种关键的推理时技术,通过线性外推条件预测与无条件预测之间的差异来增强生成样本与输入条件的语义对齐。然而,当引导尺度 ww 增大时,这种线性外推会逐渐偏离训练数据的流形,导致颜色饱和度过高、纹理细节丢失、结构扭曲等问题。

论文作者从动力学系统的视角审视 CFG,发现条件预测与无条件预测之间的差异 e(t)\mathbf{e}(t) 在理想情况下应当随去噪过程单调衰减。但在实践中,尤其是在模型容量增大或引导尺度提高时,(e(t),e˙(t))(\mathbf{e}(t), \dot{\mathbf{e}}(t)) 在相平面上的轨迹并非理想的指数收敛曲线,而是呈现出强烈的振荡乃至发散行为(见论文图 1 左侧)。这表明标准 CFG 本质上是一个固定增益的比例控制器 (P-control),无法在高度非线性的生成动力学中保证稳定收敛。

这一观察形成了论文的核心动机:与其将 CFG 视为一种静态的线性外推规则,不如从控制论的视角将其重构为一个主动调节语义误差演化过程的反馈控制系统。这一视角的转变解释了为何现有改进方法(如权重调度、自适应投影等)虽然有效但仍存在局限——它们本质上仍是线性或近似线性的控制律设计。

核心方法和技术细节

CFG-Ctrl 统一框架

论文首先提出 CFG-Ctrl 框架,将流匹配采样过程建模为受控动力学系统:

dxtdt=vθ(xt,t,∅)+ut\frac{d\mathbf{x}_t}{dt} = \mathbf{v}_\theta(\mathbf{x}_t, t, \varnothing) + \mathbf{u}_t

其中控制信号 ut\mathbf{u}_t 被分解为引导调度 KtK_t 和方向算子 Πt\Pi_t 对语义误差 e(t)\mathbf{e}(t) 的作用:

ut=KtΠt(e(t))\mathbf{u}_t = K_t \Pi_t(\mathbf{e}(t))

在这一框架下,标准 CFG 相当于 Kt=wK_t = w(常数标量增益)且 Πt=I\Pi_t = I(恒等映射)的比例控制器。权重调度方法相当于时变增益调度 (Kt=w(t)K_t = w(t)),而 APG (Adaptive Projected Guidance) 则对应于一个矩阵形式的 KtK_t 与结构化投影 Πt\Pi_t 的组合,本质上是一种基于投影的反馈控制器。论文在表 1 中系统归纳了多种 CFG 变体在 CFG-Ctrl 框架下的控制解释。

SMC-CFG:滑模控制引导

本文的核心贡献在于提出了 SMC-CFG。其关键思想来源于滑模控制理论:在相平面上定义一个滑模面 s(t)=e˙(t)+λe(t)\mathbf{s}(t) = \dot{\mathbf{e}}(t) + \lambda\mathbf{e}(t),通过引入一个非线性的开关控制项,强制系统状态向该滑模面收敛(见论文图 1 右侧)。

具体而言,SMC-CFG 在语义误差上施加一个修正项:

Δe(t)=−k⋅sign(s(t))\Delta\mathbf{e}(t) = -k \cdot \text{sign}(\mathbf{s}(t))

这使得完整的引导控制信号变为 u(t)=w(e(t)+Δe(t))\mathbf{u}(t) = w(\mathbf{e}(t) + \Delta\mathbf{e}(t))。滑模面参数 λ\lambda 决定了目标指数收敛曲线的斜率,而开关增益 kk 控制驱动系统向滑模面靠拢的力度。

论文通过 Lyapunov 稳定性分析证明了有限时间收敛性。选择 Lyapunov 函数 V(s)=12∥s∥2V(\mathbf{s}) = \frac{1}{2}\|\mathbf{s}\|^2,代入受控动力学方程和开关控制律后,通过链式法则展开和范数放缩,得到了 V(sV(\mathbf{s}) 的上界不等式。当增益 kk 满足 k⋅bmin⁡>δk \cdot b_{\min} > \delta 时(其中 bmin⁡b_{\min} 为有效控制增益矩阵的最小奇异值下界,δ\delta 为固有漂移动力学范数的上界),可得到:

V˙≤−η∥s∥,η=kbmin⁡−δ>0\dot{V} \leq -\eta\|\mathbf{s}\|, \quad \eta = k b_{\min} - \delta > 0

这保证了 ∥s(t)∥\|\mathbf{s}(t)\| 沿轨迹单调递减直至为零,从而确保了系统状态在有限时间内抵达滑模面并沿其收敛至原点。论文在补充材料中进一步给出了离散实现下的 “稳定性走廊” 启发式规则,用以指导实际调参。

创新点和贡献

  1. 从线性外推到非线性控制的范式转换:论文首次将 CFG 系统地置于控制论的框架中审视,揭示了标准 CFG 及现有变体在本质上的线性反馈特性及其在非线性生成动力学中的根本局限。这一统一的 CFG-Ctrl 框架为分析和设计引导策略提供了结构化的语言。

  2. 滑模控制与生成模型的融合:SMC-CFG 是首次将滑模控制引入扩散模型引导的工作。通过开关控制项引入的非线性修正力,使得系统在面对模型非线性和引导尺度增大时能够保持鲁棒收敛,这是单纯的增益调度或投影操作无法实现的。

  3. 理论保障的实证验证:论文不仅在理论上给出了 Lyapunov 意义上的有限时间收敛证明,还在 Stable Diffusion 3.5、Flux-dev、Qwen-Image 三个不同规模的模型上进行了广泛评估,证明了方法的模型无关性。尤其在 Flux-dev 上,SMC-CFG 在高引导尺度下的性能曲线(见论文图 6)明显优于其他方法,形象地展示了非线性控制的独特优势。

实验结果分析

定量评估(论文表 2)

在 MS-COCO 5,000 对图文数据的评估中,SMC-CFG 在三个模型上均取得了优越的性能:

  • SD3.5:FID 降至 20.044(CFG 为 21.421),HPSv2.1 提升至 0.2875(CFG 为 0.2842),MPS 提升至 7.5719(CFG 为 7.2476)。
  • Flux-dev:ImageReward 提升至 1.0558(CFG 为 0.8749),HPSv2.1 提升至 0.3021(CFG 为 0.2828)。
  • Qwen-Image:CLIP Score 提升至 0.3856(CFG 为 0.3815),HPSv2.1 提升至 0.3105(CFG 为 0.3038)。

值得注意的是,SMC-CFG 同时降低了 FID 和提升了多个语义/人类偏好指标,说明该方法在提高语义对齐的同时并未牺牲图像质量,反而有所改善。

引导尺度鲁棒性(论文图 4、图 6)

在引导尺度从 2.0 增大至 5.0 的过程中,标准 CFG 的 FID 和 CLIP Score 均出现明显恶化,而 SMC-CFG 保持稳定的同时实现了小幅持续改善。这表明 SMC-CFG 能够有效利用更大的引导尺度而不引入典型的结构失真或视觉伪影。

消融实验(论文表 3)

在 Flux-dev 上对 λ\lambda 和 kk 的消融表明:

  • λ\lambda 过小(3)或过大(6)均导致 FID 升高,最优值在 5 附近。λ\lambda 决定了滑模面的斜率,直接影响收敛路径的理想形状。
  • kk 过小(0.1)时 CLIP Score 较低(收敛速度慢),过大(1.0)时 FID 上升、ImageReward 下降,说明过强的开关力引入了抖动。最优 k=0.4k=0.4 在语义对齐与视觉质量之间取得了最佳平衡。

这一结果与理论分析的 “稳定性走廊” 直觉一致:kk 需足够大以克服模型固有漂移,但又须小于由离散步长决定的抖动阈值。

T2I-CompBench 组合生成评估(论文表 5、表 6)

在 T2I-CompBench 的颜色、形状、纹理和空间关系四个子类上,SMC-CFG 均在三个模型上取得一致提升。特别值得关注的是 Qwen-Image 在空间关系上的大幅提升(0.2968 → 0.4085),说明 SMC-CFG 对复杂组合语义的生成具有更强的刻画能力。在 GenAI-Bench 的 VQAScore 评估中,SMC-CFG 在基础能力和高级能力上分别达到 0.89 和 0.68,均优于 CFG-Zero⋆(0.88, 0.66)和 Rect-CFG++(0.87, 0.64)。

视频生成扩展(论文表 7)

论文还将 SMC-CFG 应用于 Wan2.2-TI2V-5B 文本到视频生成模型,在 VBench 上的 Total Score 从 0.5594 提升至 0.5839,其中 Human Action(0.5313 → 0.6000)和 Color(0.9087 → 0.9818)的提升尤为显著。这初步证明了 SMC-CFG 的泛化能力不仅限于图像生成场景。

计算效率(论文表 8)

SMC-CFG 的 FLOPs 和推理时间与标准 CFG 基本一致(如 1024×1024 分辨率下,FLOPs 从 3590870.89G 增至 3590870.93G,推理时间从 44.78s 增至 45.09s),计算开销可忽略不计,具备良好的工程可用性。

实践建议

  1. 超参数调优策略:SMC-CFG 在不同的扩散模型上表现差异不大,但最优超参数有所不同(SD3.5 和 Qwen-Image 的 k=0.1k=0.1,而 Flux-dev 的 k=0.7k=0.7,见论文第 7.3 节)。建议在新的预训练模型上部署时,先在一个小型验证集(如 200 组图文对)上进行网格搜索确定 λ\lambda 和 kk,再迁移到正式评估集使用。

  2. 引导尺度的设定:SMC-CFG 允许使用比标准 CFG 更大的引导尺度而不牺牲视觉质量。如果你的应用场景对语义精确性要求极为苛刻(如含特定文字生成、细粒度空间关系描述),可以尝试在模型默认引导尺度基础上提高 1.5~2 倍,配合 SMC-CFG 使用,论文图 6 显示这种做法往往能取得额外的语义对齐增益。

  3. 组合生成场景优先考虑:从 T2I-CompBench 的结果来看,SMC-CFG 在空间关系上的相对提升最大。在多物体交互、复杂空间场景的生成任务中,SMC-CFG 可能带来比标准 CFG 和现有变体更显著的改善。

  4. 工程部署考量:SMC-CFG 的计算开销几乎为零(每一时间步多计算一次误差修改量和一个符号函数),与标准 CFG 的内存占用和推理延迟完全持平。因此,在现有的流匹配模型推理流程中加入 SMC-CFG 无需额外的硬件升级或优化改动。

  5. 不要忽视基本技巧的组合:SMC-CFG 作为一个误差修正层,可以和权重调度(w(t)w(t))、自适应投影(APG)等方法组合使用。论文的 CFG-Ctrl 框架已经给出了这些方法的统一表示,实践中可以尝试将 SMC-CFG 的开关控制项叠加在动态增益或投影操作之上,有可能获得进一步的性能提升。