扩展流映射
Expanding Flow Maps
论文信息
标题: Expanding Flow Maps
作者: Sophia Tang, Pranam Chatterjee
发布日期: 2026-07-23
arXiv ID: 2607.21585v1
PDF 链接: 下载 PDF
3 分钟速览
研究问题:现有的基于流的生成模型(包括流映射)只能在固定维度或固定序列长度的 “画布” 上生成数据,无法处理输出大小本身也是变量的任务,如变长文本、不同节点数的分子图。
核心方法:将生成过程分解为两个可学习的操作——扩展算子(在当前状态上插入新坐标或词元并填充有条件噪声)和传输映射(在扩展后的空间中将状态沿插值路径向前推进),两者组合成一次跳跃。
关键结果:在 GEOM-Drugs 分子构象生成任务上,扩展流映射(EFM)只需 4 步就达到了与 500-1000 步扩散模型相当甚至更优的覆盖率(COV-R 81.26%,表 1),而 1 步生成离散分子图时 FCD 仅为 0.44(表 2),大幅优于对比方法。
主要局限:作者承认,由于每个维度需要独立条件于局部时间坐标,以及按照固定调度进行复杂训练,该框架在扩展到更大维度时 “需要进一步调优”,且论文未充分探索这一点(见论文第 8 节)。
适合读者:对生成模型、流匹配、扩散模型感兴趣的研究者和工程师,特别是需要处理变长/变维度生成任务(如分子设计、文本生成、3D 形状生成)的从业者。
论文背景和研究动机
流映射(Flow Maps)是近年生成模型领域的重要进展。它通过将一个连续时间的插值路径(从噪声分布到数据分布)蒸馏成少数几步的确定性映射,实现了极低步数(甚至一步)的高质量生成。无论是连续状态空间还是离散状态空间,流映射都展现了强大的建模能力(Boffi et al., 2025; Lee et al., 2026)。
然而,一个根本性的限制被忽视了:现有所有流映射都要求状态空间的维度在生成过程中保持不变。对于连续数据(如图像),这意味着像素网格大小在初始化时就被锁定;对于离散数据(如文本),这意味着生成前必须预先决定序列长度。这一 “固定画布” 的假设与现实世界中大量生成任务相矛盾——分子构象的原子数可变、文本序列长度未知、多模态数据的各模态维度不同。
作者提出的核心问题是:如何让流映射在推理时动态地扩展其状态空间维度,使输出大小本身成为一个可学习、可控的自由度? 这一问题将流映射从 “在固定维度空间中的传输” 推广到 “在递增维度空间中的传输”,既有理论意义也有工程价值。
核心方法和技术细节
扩展生成流(EFlow)
传统流模型假设所有时间点的状态维度 为常数。本文将其推广为非递减的维度调度 ,使得在时间 的状态 生活在不同维度的空间中。
当需要从低维状态 跳转到高维状态空间 (其中 )时,两者之间不存在微分同胚。解决方案分两步:
-
扩展算子 :将源状态 与从条件分布 中采样的噪声 组合,提升到目标维度。具体实现可以是串联、按位置插入、或基于父节点的子扩展(用于分子从重原子扩展氢原子)。
-
传输映射 :在扩展后的 维空间中,沿标准流 ODE 的插值路径将增强状态推送到目标时间。
新插入的每个坐标被赋予一个局部时间坐标 ,将全局时间投影到 区间,确保所有坐标在统一的局部时钟上进行去噪。
作者进一步证明,该两阶段过程可统一为分段确定性马尔可夫过程(PDMP),其生成器包含两项:平滑传输项和跳跃项(由扩展算子与噪声律的推前给出),从而提供了严格的理论基础(命题 3.2,见论文附录 B.4)。
扩展流映射(EFM)
在上述基础上,EFM 将扩展和传输组合成单步操作:
即先扩展、再传输,在一步函数调用中同时完成维度增加和时间推进。这与标准流映射的区别在于,扩展算子不再是恒等映射。
为保证 是有效的流映射,需满足三个一致性条件(命题 4.1,见论文附录 B.6):
- 拉格朗日条件:
- 欧拉条件:(注意雅可比矩阵是矩形的)
- 半群条件:
这些条件转化为训练目标中的一致性损失,与对角损失联合优化。
离散扩展流映射
对于离散数据,扩展算子变为词元插入操作。一个学习的插入头预测每个间隔应插入多少词元,按二项分布采样(在少步采样时退化为泊松分布),然后传输映射(由均值去噪器 参数化)对这些词元进行去噪。离散 EFM 的形式为:
对应的三个一致性条件(命题 5.1,见论文附录 B.8)在单纯形上定义,并通过交叉熵损失优化。
创新点和贡献
-
统一框架:首次将生成流和流映射推广到变维度设置,现有固定维度流映射成为扩展算子为恒等映射的特例。
-
理论基础扎实:通过 PDMP 刻画将扩展和传输统一为单一随机过程(命题 3.2),严格证明了边际匹配、条件律推前、变元公式等性质(见论文附录 B.4-B.8)。
-
连续与离散统一:同一框架同时适用于连续坐标(如 3D 分子构象)和离散词元(如文本、分子图),唯一的区别在于传输映射的参数化形式(均值速度 vs 均值去噪器)。
-
从多步到一步的平滑过渡:EFlow 可以用 20 步(无蒸馏)达到多步扩散基线的性能,而蒸馏后的 EFM 可在 1-4 步内维持竞争力,实现了采样预算的灵活控制。
实验结果分析
分子构象生成(连续空间)
在 GEOM-Drugs 数据集上(最多 181 个原子),EFlow 仅用 20 步就超越了 500-1000 步的 GeoDiff 和 SubgDiff 等扩散基线(表 1)。更重要的是,蒸馏后的 EFM 在 4 步时 COV-R 达 81.26%,2 步时仍有 77.21%,远优于固定维度流映射所无法企及的变维度任务需求。加入 10 步细化网络后,EFM+R 在所有四个指标上均取得最优值(COV-R 87.97%)。
离散分子图生成
在 QM9 分子图生成上,EFlow 在 10 步时 FCD 仅为 0.390,而 DeFoG 需 100 步才达到 0.134,且 DeFoG 在 4 步时有效性暴跌至 53.6%,而 EFlow 仍保持 91.7%(表 2)。EFM 在 1 步生成时 FCD 仅为 0.44,对比标准流映射 CFM 的 2.14 提升了近 5 倍。
语言建模
在 LM1B 上,EFlow 在所有步数预算下均优于固定长度流语言模型 FLM(表 3),生成困惑度从 133.62(64 步)单调下降至 103.63(1024 步)。蒸馏后的 EFM 在 4 步和 2 步时生成连贯文本,在 1 步时出现模式坍缩——作者归因于模型几乎从未在训练中见过所有词元都在 插入的全噪声全长序列(见论文附录 C.5)。
实践建议
对于希望在变维度生成任务上应用 EFM 的工程师,有以下要点:
-
调度设计是关键:插入调度 、插入截止时间 、局部时间重参数化 都显著影响训练和采样。论文在语言任务中将插入限制在 ,为纯去噪留下了 的区间(附录 C.1)。建议根据数据的结构特性设计调度的形状和截止点。
-
一步采样需特殊处理:对于离散序列的一步生成,直接从 开始会导致分布外问题。论文建议改用 ,即先扩展到一个最小去噪时间再应用流映射(附录 C.5)。
-
扩展算子的实例化需匹配领域结构:对于分子,使用确定性子扩展(氢原子锚定在重原子上);对于图,使用排列不变的插入(附录 D 详述);对于序列,使用学习到的每间隔插入头。选择适合的实例化方式能降低模型负担。
-
计算成本考虑:由于每个维度需条件于独立的局部时间,且训练需采样大量 对,大维度任务(如高分辨率图像)可能需要更多调优。论文在分子实验中维度上限为 181(GEOM-Drugs),语言实验序列长度上限为 128,更大规模的应用尚待验证。