扩张流映射

arXiv: 2607.21585v1

论文信息

标题: Expanding Flow Maps

作者: Sophia Tang, Pranam Chatterjee

发布日期: 2026-07-23

arXiv ID: 2607.21585v1

PDF 链接: 下载 PDF

背景与研究动机

生成式模型近年来取得了长足进步,尤其是在连续和离散状态空间中的快速可控生成。基于流的模型通过构建噪声与数据之间的概率路径,提供了稳定且高效的采样方式。然而,现有方法普遍受限于固定维度或固定序列长度的 “画布”:连续状态空间的维度 dd 在生成过程中不可改变,离散序列的长度 LL 也被预先确定。这一约束与实际需求严重脱节——许多生成任务中,输出的大小本身就是待学习的关键变量,例如分辨率可变的图像、持续时间任意的音频、长度不固定的文本或包含不同模态的交错数据。

为了解决这一根本性限制,论文《Expanding Flow Maps》提出了一个通用框架,使得生成模型能够在推理过程中动态地增加状态空间的维度。作者的核心思想是将标准流模型扩展为扩展流(Expanding Generative Flows, EFlows)和扩展流图(Expanding Flow Maps, EFMs),在连续和离散两种模态下实现维度自适应的单步或少步生成。这项工作为 “画布大小” 本身成为一个可学习的、可控的自由度提供了原则性基础。

核心方法与技术细节

扩展插值过程

传统流模型依赖一个连接先验分布 p0p_0 和数据分布 p1p_1 的插值路径 xt=It(x0,x1)x_t = I_t(x_0, x_1),其维度固定。EFlows 的关键创新在于引入非递减的维度调度 d(t)d(t),使得任意时刻 tt 的状态 xtRd(t)x_t \in \mathbb{R}^{d(t)}。当 s<ts < td(s)<d(t)d(s) < d(t) 时,源状态和目标状态处于不同维度的空间,无法用传统的速场直接传输。为此,作者定义了一个扩展算子 Es,tE_{s,t},它通过从条件噪声分布 pϵs,tp_{\epsilon|s,t} 中采样额外的坐标,将源状态提升到目标维度:

Es,t(xs,ϵ):Rd(s)×Rd(t)d(s)Rd(t).E_{s,t}(x_s, \epsilon) : \mathbb{R}^{d(s)} \times \mathbb{R}^{d(t)-d(s)} \to \mathbb{R}^{d(t)}.

该算子可以采取拼接、位置插入或子扩展(如为结构化状态附加子节点)等形式。扩展后,状态在增广空间中遵循标准速场 btb_t 的常微分方程(ODE)进行传输,从而完成从 psp_sptp_t 的演化。整个扩展生成流可以形式化为一个分段确定性马尔可夫过程(PDMP),其生成元包含传输项和跳跃项,跳跃核就是扩展算子的前推分布。

扩展流图与少步生成

为了将这种连续时间动力学蒸馏为高效的小步数生成器,论文进一步提出了扩展流图(EFM)。EFM 将任意两个时间点 sstt 的映射分解为两个可学习的操作:先用扩展算子 Es,tE_{s,t} 提升维度,再用传输映射 Xs,tX_{s,t} 将增广状态沿插值路径向前推进。整体映射写作:

Φs,t=Xs,tEs,t,Xs,t(x)=Es,t(x)+(ts)vs,t(Es,t(x)),\Phi_{s,t} = X_{s,t} \circ E_{s,t}, \quad X_{s,t}(x) = E_{s,t}(x) + (t-s) v_{s,t}(E_{s,t}(x)),

其中 vs,tv_{s,t} 是增广空间中的平均速度,可通过自蒸馏或教师模型蒸馏训练。EFM 满足与固定维度流图一致的三大一致性条件(拉格朗日条件、欧拉条件和半群条件),只是欧拉条件中的雅可比矩阵变成了矩形,需要引入一个未提升的对角速度。这些条件转化为相应的均方误差损失,使得网络可以在单步或少数几步内直接预测增广状态的演变。

离散扩展流与序列生成

在离散域,EFlows 和 EFMs 的自然对应是可变长度序列生成。每个令牌被赋予独立的插入时间 tiinst^{\text{ins}}_i,未插入的位置保持空置。扩展算子根据学习的插入期望 Is,tI_{s,t} 在序列间隙中插入服从二项或泊松分布的隐令牌(初始化为高斯噪声),然后由均值降噪器 ψs,t\psi_{s,t} 在增广的单纯形上将这些令牌逐渐降噪为目标独热分布。离散 EFM 的映射为:

Φs,t(xs)=1t1sEs,t(xs)+ts1sψs,t(Es,t(xs)).\Phi_{s,t}(x_s) = \frac{1-t}{1-s}E_{s,t}(x_s) + \frac{t-s}{1-s} \psi_{s,t}(E_{s,t}(x_s)).

对应的离散一致性条件被导出,并可通过交叉熵目标进行训练。这一框架首次将流图蒸馏拓展到可变长度离散序列,使得模型可以在单步内同时决定序列长度和内容。

创新贡献

  1. 扩展生成流的严格定义:将标准连续和离散流模型推广到维度递增的情景,并用 PDMP 统一描述了传输和维度跳跃的联合动力学。
  2. 统一的扩展流图框架:提出了一种同时处理升维和降噪的组合映射,保留了标准流图的一致性训练范式,并证明固定维度流图仅是扩展算子恒等映射的特例。
  3. 连续与离散域的统一:该框架不仅适用于连续坐标(如分子构象),也通过规范化离散扩展算子直接延伸到可变长度的图和序列生成,打破了流模型对固定 “画布” 的依赖。
  4. 高效的少步生成:通过蒸馏,EFM 可以在极小的步数(1~4 步)内生成高质量的样本,显著降低了推理成本,同时保持了可变维度的表达能力。

实验结果与分析

论文在三个差异显著的模态上验证了方法:粗到细的分子构象生成(连续坐标)、离散分子图生成和语言建模。

分子构象生成:在 GEOM-QM9 和 GEOM-Drugs 数据集上,EFlow 仅用 20 步就超越了需要 500~1000 步的扩散基线模型(如 GeoDiff、MSGEN),尤其在 Drugs 大分子上实现所有四项指标(覆盖率和平均最小 RMSD)的领先。蒸馏后的 EFM 进一步将步数降至 4、2 甚至 1 步,结合一个轻量级精炼器(EFM+R),仍能获得最优的精度和召回率。这证明了扩展流能有效处理重原子骨架先导、氢原子后补的层次化结构。

离散分子图生成:在 QM9 小分子生成上,非蒸馏的 EFlow 在 100 步时就以更低 FCD 击败了 DeFoG,且在步数降低至 10 步时有效性仍高于 97%。在单步和双步设置中,EFM 明显优于类别流图(CFM),特别是在单步下 FCD 仅为 0.44,而 CFM 为 2.14,凸显了可变长度图生成中插入-降噪分解的威力。

语言建模:在 LM1B 数据集上,EFlow 在 64 到 1024 步的所有预算下,生成困惑度均低于固定长度的流语言模型(FLM)。蒸馏后的 EFM 以 2 步或 4 步生成出连贯文本,显著优于蒸馏扩散基线;但在单步采样中出现模式坍塌,作者指出这是因一次性预测全长扩张并应用全区间映射所造成,通过调节降噪区间即可缓解。这首次展示了流图在可变长度离散序列上的可行性。

实践应用建议

  • 任务选择:扩展流图特别适合输出维度本身是任务一部分的场景,例如任意长度文本生成、可变大小图像或点云、分子设计(可变原子数)等。
  • 调度设计:插入调度(如 αt\alpha_t 的形式和截止时间 tins-endt_{\text{ins-end}})对生成质量影响显著。需要根据任务调整,以平衡插入和降噪的时间分配。对于大词汇量或高维序列,建议设置较早的插入截止时间,保留足够的纯降噪阶段。
  • 蒸馏策略:EFM 训练可采用自蒸馏(从数据)或教师蒸馏,前者更稳定,后者性能更好。建议用对角损失和一致性损失的混合训练,并针对离散域使用自适应损失权重以稳定训练。
  • 插入头与降噪器耦合:插入头的学习应与降噪器联合优化,但在初期可冻结降噪器,避免未受训的插入头污染特征。对于小图生成,插入头可仅由对角损失训练,采样时根据调度比例推断两时间点间的插入计数。

总结与展望

《Expanding Flow Maps》通过引入扩展算子和传输映射的优雅分解,成功打破了生成流模型对固定维度的长期束缚。它不仅在理论上将流模型推广到维度递增的插值路径,并用 PDMP 提供了坚实的随机过程基础,更在实践中证明,无论连续还是离散模态,该方法都能在极低采样步数下保持高质量生成。这项工作为自适应维度的生成建模开辟了新方向,有望在长文本生成、多模态融合、科学发现等任务中发挥重要作用。

未来的工作可探索更丰富的条件噪声分布(如学习参数化)、基于插入时间的非线性插值策略,甚至在插值路径中允许维度收缩以支持编辑和删减操作。此外,将框架扩展至更大规模、更多样化的数据集,并进一步调优局部时间条件机制,将是释放其全部潜力的关键步骤。