扩张流映射
论文信息
标题: Expanding Flow Maps
作者: Sophia Tang, Pranam Chatterjee
发布日期: 2026-07-23
arXiv ID: 2607.21585v1
PDF 链接: 下载 PDF
背景与研究动机
生成式模型近年来取得了长足进步,尤其是在连续和离散状态空间中的快速可控生成。基于流的模型通过构建噪声与数据之间的概率路径,提供了稳定且高效的采样方式。然而,现有方法普遍受限于固定维度或固定序列长度的 “画布”:连续状态空间的维度 在生成过程中不可改变,离散序列的长度 也被预先确定。这一约束与实际需求严重脱节——许多生成任务中,输出的大小本身就是待学习的关键变量,例如分辨率可变的图像、持续时间任意的音频、长度不固定的文本或包含不同模态的交错数据。
为了解决这一根本性限制,论文《Expanding Flow Maps》提出了一个通用框架,使得生成模型能够在推理过程中动态地增加状态空间的维度。作者的核心思想是将标准流模型扩展为扩展流(Expanding Generative Flows, EFlows)和扩展流图(Expanding Flow Maps, EFMs),在连续和离散两种模态下实现维度自适应的单步或少步生成。这项工作为 “画布大小” 本身成为一个可学习的、可控的自由度提供了原则性基础。
核心方法与技术细节
扩展插值过程
传统流模型依赖一个连接先验分布 和数据分布 的插值路径 ,其维度固定。EFlows 的关键创新在于引入非递减的维度调度 ,使得任意时刻 的状态 。当 且 时,源状态和目标状态处于不同维度的空间,无法用传统的速场直接传输。为此,作者定义了一个扩展算子 ,它通过从条件噪声分布 中采样额外的坐标,将源状态提升到目标维度:
该算子可以采取拼接、位置插入或子扩展(如为结构化状态附加子节点)等形式。扩展后,状态在增广空间中遵循标准速场 的常微分方程(ODE)进行传输,从而完成从 到 的演化。整个扩展生成流可以形式化为一个分段确定性马尔可夫过程(PDMP),其生成元包含传输项和跳跃项,跳跃核就是扩展算子的前推分布。
扩展流图与少步生成
为了将这种连续时间动力学蒸馏为高效的小步数生成器,论文进一步提出了扩展流图(EFM)。EFM 将任意两个时间点 到 的映射分解为两个可学习的操作:先用扩展算子 提升维度,再用传输映射 将增广状态沿插值路径向前推进。整体映射写作:
其中 是增广空间中的平均速度,可通过自蒸馏或教师模型蒸馏训练。EFM 满足与固定维度流图一致的三大一致性条件(拉格朗日条件、欧拉条件和半群条件),只是欧拉条件中的雅可比矩阵变成了矩形,需要引入一个未提升的对角速度。这些条件转化为相应的均方误差损失,使得网络可以在单步或少数几步内直接预测增广状态的演变。
离散扩展流与序列生成
在离散域,EFlows 和 EFMs 的自然对应是可变长度序列生成。每个令牌被赋予独立的插入时间 ,未插入的位置保持空置。扩展算子根据学习的插入期望 在序列间隙中插入服从二项或泊松分布的隐令牌(初始化为高斯噪声),然后由均值降噪器 在增广的单纯形上将这些令牌逐渐降噪为目标独热分布。离散 EFM 的映射为:
对应的离散一致性条件被导出,并可通过交叉熵目标进行训练。这一框架首次将流图蒸馏拓展到可变长度离散序列,使得模型可以在单步内同时决定序列长度和内容。
创新贡献
- 扩展生成流的严格定义:将标准连续和离散流模型推广到维度递增的情景,并用 PDMP 统一描述了传输和维度跳跃的联合动力学。
- 统一的扩展流图框架:提出了一种同时处理升维和降噪的组合映射,保留了标准流图的一致性训练范式,并证明固定维度流图仅是扩展算子恒等映射的特例。
- 连续与离散域的统一:该框架不仅适用于连续坐标(如分子构象),也通过规范化离散扩展算子直接延伸到可变长度的图和序列生成,打破了流模型对固定 “画布” 的依赖。
- 高效的少步生成:通过蒸馏,EFM 可以在极小的步数(1~4 步)内生成高质量的样本,显著降低了推理成本,同时保持了可变维度的表达能力。
实验结果与分析
论文在三个差异显著的模态上验证了方法:粗到细的分子构象生成(连续坐标)、离散分子图生成和语言建模。
分子构象生成:在 GEOM-QM9 和 GEOM-Drugs 数据集上,EFlow 仅用 20 步就超越了需要 500~1000 步的扩散基线模型(如 GeoDiff、MSGEN),尤其在 Drugs 大分子上实现所有四项指标(覆盖率和平均最小 RMSD)的领先。蒸馏后的 EFM 进一步将步数降至 4、2 甚至 1 步,结合一个轻量级精炼器(EFM+R),仍能获得最优的精度和召回率。这证明了扩展流能有效处理重原子骨架先导、氢原子后补的层次化结构。
离散分子图生成:在 QM9 小分子生成上,非蒸馏的 EFlow 在 100 步时就以更低 FCD 击败了 DeFoG,且在步数降低至 10 步时有效性仍高于 97%。在单步和双步设置中,EFM 明显优于类别流图(CFM),特别是在单步下 FCD 仅为 0.44,而 CFM 为 2.14,凸显了可变长度图生成中插入-降噪分解的威力。
语言建模:在 LM1B 数据集上,EFlow 在 64 到 1024 步的所有预算下,生成困惑度均低于固定长度的流语言模型(FLM)。蒸馏后的 EFM 以 2 步或 4 步生成出连贯文本,显著优于蒸馏扩散基线;但在单步采样中出现模式坍塌,作者指出这是因一次性预测全长扩张并应用全区间映射所造成,通过调节降噪区间即可缓解。这首次展示了流图在可变长度离散序列上的可行性。
实践应用建议
- 任务选择:扩展流图特别适合输出维度本身是任务一部分的场景,例如任意长度文本生成、可变大小图像或点云、分子设计(可变原子数)等。
- 调度设计:插入调度(如 的形式和截止时间 )对生成质量影响显著。需要根据任务调整,以平衡插入和降噪的时间分配。对于大词汇量或高维序列,建议设置较早的插入截止时间,保留足够的纯降噪阶段。
- 蒸馏策略:EFM 训练可采用自蒸馏(从数据)或教师蒸馏,前者更稳定,后者性能更好。建议用对角损失和一致性损失的混合训练,并针对离散域使用自适应损失权重以稳定训练。
- 插入头与降噪器耦合:插入头的学习应与降噪器联合优化,但在初期可冻结降噪器,避免未受训的插入头污染特征。对于小图生成,插入头可仅由对角损失训练,采样时根据调度比例推断两时间点间的插入计数。
总结与展望
《Expanding Flow Maps》通过引入扩展算子和传输映射的优雅分解,成功打破了生成流模型对固定维度的长期束缚。它不仅在理论上将流模型推广到维度递增的插值路径,并用 PDMP 提供了坚实的随机过程基础,更在实践中证明,无论连续还是离散模态,该方法都能在极低采样步数下保持高质量生成。这项工作为自适应维度的生成建模开辟了新方向,有望在长文本生成、多模态融合、科学发现等任务中发挥重要作用。
未来的工作可探索更丰富的条件噪声分布(如学习参数化)、基于插入时间的非线性插值策略,甚至在插值路径中允许维度收缩以支持编辑和删减操作。此外,将框架扩展至更大规模、更多样化的数据集,并进一步调优局部时间条件机制,将是释放其全部潜力的关键步骤。