扩展流映射

Expanding Flow Maps

arXiv: 2607.21585v1

论文信息

标题: Expanding Flow Maps

作者: Sophia Tang, Pranam Chatterjee

发布日期: 2026-07-23

arXiv ID: 2607.21585v1

PDF 链接: 下载 PDF

3 分钟速览

研究问题:现有的基于流的生成模型(包括流映射)只能在固定维度或固定序列长度的 “画布” 上生成数据,无法处理输出大小本身也是变量的任务,如变长文本、不同节点数的分子图。

核心方法:将生成过程分解为两个可学习的操作——扩展算子(在当前状态上插入新坐标或词元并填充有条件噪声)和传输映射(在扩展后的空间中将状态沿插值路径向前推进),两者组合成一次跳跃。

关键结果:在 GEOM-Drugs 分子构象生成任务上,扩展流映射(EFM)只需 4 步就达到了与 500-1000 步扩散模型相当甚至更优的覆盖率(COV-R 81.26%,表 1),而 1 步生成离散分子图时 FCD 仅为 0.44(表 2),大幅优于对比方法。

主要局限:作者承认,由于每个维度需要独立条件于局部时间坐标,以及按照固定调度进行复杂训练,该框架在扩展到更大维度时 “需要进一步调优”,且论文未充分探索这一点(见论文第 8 节)。

适合读者:对生成模型、流匹配、扩散模型感兴趣的研究者和工程师,特别是需要处理变长/变维度生成任务(如分子设计、文本生成、3D 形状生成)的从业者。

论文背景和研究动机

流映射(Flow Maps)是近年生成模型领域的重要进展。它通过将一个连续时间的插值路径(从噪声分布到数据分布)蒸馏成少数几步的确定性映射,实现了极低步数(甚至一步)的高质量生成。无论是连续状态空间还是离散状态空间,流映射都展现了强大的建模能力(Boffi et al., 2025; Lee et al., 2026)。

然而,一个根本性的限制被忽视了:现有所有流映射都要求状态空间的维度在生成过程中保持不变。对于连续数据(如图像),这意味着像素网格大小在初始化时就被锁定;对于离散数据(如文本),这意味着生成前必须预先决定序列长度。这一 “固定画布” 的假设与现实世界中大量生成任务相矛盾——分子构象的原子数可变、文本序列长度未知、多模态数据的各模态维度不同。

作者提出的核心问题是:如何让流映射在推理时动态地扩展其状态空间维度,使输出大小本身成为一个可学习、可控的自由度? 这一问题将流映射从 “在固定维度空间中的传输” 推广到 “在递增维度空间中的传输”,既有理论意义也有工程价值。

核心方法和技术细节

扩展生成流(EFlow)

传统流模型假设所有时间点的状态维度 d(t)d(t) 为常数。本文将其推广为非递减的维度调度 d(t):[0,1]→Nd(t) : [0,1] \rightarrow \mathbb{N},使得在时间 tt 的状态 xt∈Rd(t)x_t \in \mathbb{R}^{d(t)} 生活在不同维度的空间中。

当需要从低维状态 xs∈Rd(s)x_s \in \mathbb{R}^{d(s)} 跳转到高维状态空间 Rd(t)\mathbb{R}^{d(t)}(其中 d(s)<d(t)d(s) < d(t))时,两者之间不存在微分同胚。解决方案分两步:

  1. 扩展算子 Es,tE_{s,t}:将源状态 xsx_s 与从条件分布 pϵ∣s,tp_{\epsilon|s,t} 中采样的噪声 ϵ∈Rd(t)−d(s)\epsilon \in \mathbb{R}^{d(t)-d(s)} 组合,提升到目标维度。具体实现可以是串联、按位置插入、或基于父节点的子扩展(用于分子从重原子扩展氢原子)。

  2. 传输映射 Xs,tX_{s,t}:在扩展后的 d(t)d(t) 维空间中,沿标准流 ODE 的插值路径将增强状态推送到目标时间。

新插入的每个坐标被赋予一个局部时间坐标 ti=t−tiins1−tiinst_i = \frac{t - t_i^{\text{ins}}}{1 - t_i^{\text{ins}}},将全局时间投影到 [0,1][0,1] 区间,确保所有坐标在统一的局部时钟上进行去噪。

作者进一步证明,该两阶段过程可统一为分段确定性马尔可夫过程(PDMP),其生成器包含两项:平滑传输项和跳跃项(由扩展算子与噪声律的推前给出),从而提供了严格的理论基础(命题 3.2,见论文附录 B.4)。

扩展流映射(EFM)

在上述基础上,EFM 将扩展和传输组合成单步操作:

Φs,t=Xs,t∘Es,t\Phi_{s,t} = X_{s,t} \circ E_{s,t}

即先扩展、再传输,在一步函数调用中同时完成维度增加和时间推进。这与标准流映射的区别在于,扩展算子不再是恒等映射。

为保证 Φs,t\Phi_{s,t} 是有效的流映射,需满足三个一致性条件(命题 4.1,见论文附录 B.6):

  • 拉格朗日条件:∂tΦs,t(x)=vt,t(Φs,t(x))\partial_t \Phi_{s,t}(x) = v_{t,t}(\Phi_{s,t}(x))
  • 欧拉条件:∂sΦs,t(x)+∇xΦs,t(x)v~s,s(x)=0\partial_s \Phi_{s,t}(x) + \nabla_x \Phi_{s,t}(x)\tilde{v}_{s,s}(x) = 0(注意雅可比矩阵是矩形的)
  • 半群条件:Φu,t(Φs,u(x))=Φs,t(x)\Phi_{u,t}(\Phi_{s,u}(x)) = \Phi_{s,t}(x)

这些条件转化为训练目标中的一致性损失,与对角损失联合优化。

离散扩展流映射

对于离散数据,扩展算子变为词元插入操作。一个学习的插入头预测每个间隔应插入多少词元,按二项分布采样(在少步采样时退化为泊松分布),然后传输映射(由均值去噪器 ψs,t\psi_{s,t} 参数化)对这些词元进行去噪。离散 EFM 的形式为:

Φs,t(xs)=1−t1−sEs,t(xs)+t−s1−sψs,t(Es,t(xs))\Phi_{s,t}(x_s) = \frac{1-t}{1-s}E_{s,t}(x_s) + \frac{t-s}{1-s}\psi_{s,t}(E_{s,t}(x_s))

对应的三个一致性条件(命题 5.1,见论文附录 B.8)在单纯形上定义,并通过交叉熵损失优化。

创新点和贡献

  1. 统一框架:首次将生成流和流映射推广到变维度设置,现有固定维度流映射成为扩展算子为恒等映射的特例。

  2. 理论基础扎实:通过 PDMP 刻画将扩展和传输统一为单一随机过程(命题 3.2),严格证明了边际匹配、条件律推前、变元公式等性质(见论文附录 B.4-B.8)。

  3. 连续与离散统一:同一框架同时适用于连续坐标(如 3D 分子构象)和离散词元(如文本、分子图),唯一的区别在于传输映射的参数化形式(均值速度 vs 均值去噪器)。

  4. 从多步到一步的平滑过渡:EFlow 可以用 20 步(无蒸馏)达到多步扩散基线的性能,而蒸馏后的 EFM 可在 1-4 步内维持竞争力,实现了采样预算的灵活控制。

实验结果分析

分子构象生成(连续空间)

在 GEOM-Drugs 数据集上(最多 181 个原子),EFlow 仅用 20 步就超越了 500-1000 步的 GeoDiff 和 SubgDiff 等扩散基线(表 1)。更重要的是,蒸馏后的 EFM 在 4 步时 COV-R 达 81.26%,2 步时仍有 77.21%,远优于固定维度流映射所无法企及的变维度任务需求。加入 10 步细化网络后,EFM+R 在所有四个指标上均取得最优值(COV-R 87.97%)。

离散分子图生成

在 QM9 分子图生成上,EFlow 在 10 步时 FCD 仅为 0.390,而 DeFoG 需 100 步才达到 0.134,且 DeFoG 在 4 步时有效性暴跌至 53.6%,而 EFlow 仍保持 91.7%(表 2)。EFM 在 1 步生成时 FCD 仅为 0.44,对比标准流映射 CFM 的 2.14 提升了近 5 倍。

语言建模

在 LM1B 上,EFlow 在所有步数预算下均优于固定长度流语言模型 FLM(表 3),生成困惑度从 133.62(64 步)单调下降至 103.63(1024 步)。蒸馏后的 EFM 在 4 步和 2 步时生成连贯文本,在 1 步时出现模式坍缩——作者归因于模型几乎从未在训练中见过所有词元都在 t=0t=0 插入的全噪声全长序列(见论文附录 C.5)。

实践建议

对于希望在变维度生成任务上应用 EFM 的工程师,有以下要点:

  1. 调度设计是关键:插入调度 αt\alpha_t、插入截止时间 tins-endt_{\text{ins-end}}、局部时间重参数化 β(t)\beta(t) 都显著影响训练和采样。论文在语言任务中将插入限制在 [0,0.5][0, 0.5],为纯去噪留下了 [0.5,1][0.5, 1] 的区间(附录 C.1)。建议根据数据的结构特性设计调度的形状和截止点。

  2. 一步采样需特殊处理:对于离散序列的一步生成,直接从 t=0t=0 开始会导致分布外问题。论文建议改用 Φ0,1(x0)=ψtdenoise-min,1(E0,1(x0))\Phi_{0,1}(x_0) = \psi_{t_{\text{denoise-min}},1}(E_{0,1}(x_0)),即先扩展到一个最小去噪时间再应用流映射(附录 C.5)。

  3. 扩展算子的实例化需匹配领域结构:对于分子,使用确定性子扩展(氢原子锚定在重原子上);对于图,使用排列不变的插入(附录 D 详述);对于序列,使用学习到的每间隔插入头。选择适合的实例化方式能降低模型负担。

  4. 计算成本考虑:由于每个维度需条件于独立的局部时间,且训练需采样大量 (s,t)(s, t) 对,大维度任务(如高分辨率图像)可能需要更多调优。论文在分子实验中维度上限为 181(GEOM-Drugs),语言实验序列长度上限为 128,更大规模的应用尚待验证。