ELF: 嵌入式语言流

ELF: Embedded Language Flows

arXiv: 2605.10938v1

论文信息

标题: ELF: Embedded Language Flows

作者: Keya Hu, Linlu Qiu, Yiyang Lu, et al.

发布日期: 2026-05-11

arXiv ID: 2605.10938v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:本论文要解决连续扩散语言模型(DLM)在文本生成中性能不如离散模型的问题,并探索能否通过简单的设计让连续空间方法达到甚至超越离散方法的效果。
  • 核心方法:提出 Embedded Language Flows(ELF),在连续嵌入空间中直接进行流匹配去噪,仅在最后一步将连续表示映射为离散 token,并使用共享权重网络同时完成去噪与解码。
  • 关键结果:ELF 仅用 32 步采样即达到生成困惑度(Gen. PPL)24,优于参数量更大的领先离散和连续 DLM,且仅消耗约 45B 训练 token(比其他方法少约 10 倍,详见第 4.2 节及图 7)。
  • 主要局限:论文目前仅在纯文本的生成式任务上验证,且训练数据规模相对较小,尚未在更大数据集上验证缩放极限(训练更多 token 未观察到进一步收益)。
  • 适合读者:关注扩散/流模型在自然语言处理中应用的研究者、致力于高效文本生成的工程师,以及对连续空间与离散符号映射感兴趣的机器学习从业者。

论文背景和研究动机

扩散模型和流模型已成为图像、视频等连续数据生成的主流方法。近年来,研究者尝试将这些模型引入语言建模领域,形成扩散语言模型(DLM)。当前 DLM 主要分为两类:连续 DLM 与离散 DLM。连续 DLM 先将离散 token 映射到连续空间(如嵌入向量),然后在连续空间中进行去噪;离散 DLM 则直接在 token 空间定义扩散过程。尽管连续 DLM 有潜力利用图像扩散模型的成熟技术,但实际性能一直逊于离散 DLM,导致近期进展主要集中在离散方法(如 MDLM、Duo)上。

ELF 的动机正是探究这一性能差距究竟是源于语言建模本身的离散性,还是由于连续 DLM 的设计未能充分利用连续空间的优势。作者认为,现有连续 DLM 过早地将连续状态与离散 token 绑定(例如每步均计算交叉熵损失、使用单独的 decoder),限制了流动模型的灵活性。因此,他们提出一种极简设计:在整个流匹配过程中完全维持在连续嵌入空间,仅在最后时间步进行离散化,从而让模型更自由地学习连续动态,并方便地借用分类器无关引导(CFG)等已在图像生成中验证有效的技术。

核心方法和技术细节

ELF 的设计围绕 “连续嵌入流匹配” 展开,由以下几个关键组件构成:

  1. 连续嵌入空间与流匹配 ELF 首先利用一个预训练(或可学习)编码器将离散 token 序列映射为上下文相关的连续嵌入 x\boldsymbol{x}。随后在嵌入空间中应用连续时间的流匹配。具体地,定义线性插值路径 zt=tx+(1−t)ϵ,ϵ∼N(0,I),t∈[0,1].\boldsymbol{z}_t = t \boldsymbol{x} + (1-t) \boldsymbol{\epsilon},\quad \boldsymbol{\epsilon}\sim\mathcal{N}(0,\mathbf{I}), \quad t\in[0,1]. 网络参数化为 xθ\boldsymbol{x}_\theta 预测(即直接预测干净嵌入 x\boldsymbol{x}),训练目标为均方误差: LMSE=Et,x,ϵ1(1−t)2∥xθ(zt,t)−x∥2.\mathcal{L}_{\text{MSE}} = \mathbb{E}_{t,\boldsymbol{x},\boldsymbol{\epsilon}}\frac{1}{(1-t)^2}\|\boldsymbol{x}_\theta(\boldsymbol{z}_t,t)-\boldsymbol{x}\|^2. 这种参数化方式使模型能同时服务于去噪和最终解码,并与后续的交叉熵损失实现权重共享。与预测速度 v\boldsymbol{v} 或噪声 ϵ\boldsymbol{\epsilon} 相比,x\boldsymbol{x}-预测在高维嵌入下更稳定(详见附录 C.1 的消融实验)。

  2. 最后一步离散化与共享权重解码 ELF 的一大特色是:整个时间步 t<1t<1 均在嵌入空间中以 MSE 损失训练,无需每步将中间状态投射回 token 空间。仅在 t=1t=1 时,模型切换为 “解码模式”,此时输入经过一次额外的 token 级加噪(用不同噪声分布生成 z~\tilde{\boldsymbol{z}}),网络输出 xθ(z~)\boldsymbol{x}_\theta(\tilde{\boldsymbol{z}}),再通过共享的 unembedding 矩阵 WW 映射为 logits,并用交叉熵损失监督: LCE=Ez~[CrossEnt(Wxθ(z~),s)].\mathcal{L}_{\text{CE}} = \mathbb{E}_{\tilde{\boldsymbol{z}}}\left[\text{CrossEnt}(W\boldsymbol{x}_\theta(\tilde{\boldsymbol{z}}),\boldsymbol{s})\right]. 训练时,80% 的样本执行去噪分支,20% 执行解码分支,两者共享同一个网络,仅通过 prepend 的 “模式令牌”(denoise 或 decode)区分。这种共享权重设计避免了单独训练 decoder,简化了流程。

  3. 自条件与分类器无关引导 ELF 无缝融合了自条件(self-conditioning)和训练时 CFG。自条件通过在网络输入中拼接上一轮预测 x^′\hat{\boldsymbol{x}}' 实现(以 50% 概率使用零向量替代)。CFG 则以训练时的方式嵌入模型:网络直接学习组合后的目标,利用自条件预测作为条件 c\boldsymbol{c},将 CFG 尺度 ω\omega 作为控制令牌输入,使推理时无需额外前传即可改变引导强度。

  4. ODE/SDE 采样与时间表 推理时,ELF 从高斯噪声 z0\boldsymbol{z}_0 出发,通过数值求解 ODE dzt/dt=vθ(zt,t)d\boldsymbol{z}_t/dt = \boldsymbol{v}_\theta(\boldsymbol{z}_t,t) 迭代去噪。利用 logit-normal 时间表将更多步分配给高噪声区域,进一步高效采样。此外,论文引入一种 SDE 启发的随机采样器,在每步重新注入一定量噪声 γ\gamma 并同步回退时间,以修正早期去噪误差。实验表明,SDE 采样可在大幅降低采样步数的同时维持甚至提升生成质量(图 5c)。

创新点和贡献

ELF 的核心贡献体现在设计理念和工程实践的结合上:

  • 彻底的连续化与最小离散干预:与现有的连续 DLM 不同,ELF 除了最后一步外,不在中间轨迹求解 token 级监督(例如通用交叉熵 loss),也不使用单独的解码器。这种 “全连续” 策略让流动模型在嵌入空间内充分演化,更自然地适配流匹配理论。
  • 共享权重网络统一去噪与解码:通过 x\boldsymbol{x}-预测使去噪输出可直接用于 unembedding,并结合模式令牌和不同的噪声腐蚀策略,实现单网络双任务的联合训练。这不仅简约,还带来了竞争性能(图 5b 显示共享权重甚至优于两阶段单独解码器)。
  • 将图像扩散的成熟技巧引入语言模型:包括训练时 CFG、自条件、logit-normal 时间表、SDE 采样等,均能直接应用于 ELF,且效果显著。例如 CFG 在离散 DLM 中难以有效运用,而在 ELF 中自然适用(图 4)。
  • 强数据效率与采样效率:在 OWT 上仅用约 45B token 训练,远少于同期方法的 500B+ token;仅需 32 步采样即实现 Gen. PPL 24,超越了需要蒸馏的离散 DLM(图 7b,c)。

实验结果分析

论文在无条件文本生成和条件式文本生成(机器翻译、摘要)上进行了系统评估。

无条件生成(OpenWebText)

  • 主要结果:ELF-B(105M 参数)在 32 步 SDE 采样下取得 Gen. PPL 24.08 ± 0.16,熵约 5.15(表 6),优于 170M 参数的 MDLM(约 38 PPL)和 Duo(约 35 PPL),也优于连续模型 FLM 和 LangFlow(图 7a)。即使在 8 步极低采样预算下,ELF 仍可达 PPL 67.32(表 6),远超其他方法。
  • 与蒸馏模型对比:ELF 不依赖任何蒸馏,在 8、16、32 步采样时均优于经过蒸馏的 MDLM+SDTT、Duo+DCD 和 FMLM(图 7b),展示出强大的内在生成能力。
  • 效率和缩放:ELF 的训练数据量比对比方法少约一个数量级(约 45B vs. 524B+,见附录表 5)。模型规模从 105M 扩展到 652M 后,Gen. PPL–熵前缘持续改善(图 6),表明 ELF 具备良好的可缩放性。

条件生成(翻译和摘要)

  • 在 WMT14 德英翻译上,ELF-B 以 26.4 BLEU 超过 MDLM(18.4)、Duo(21.3)和 CDCD(24.9)等基线(表 1)。
  • 在 XSum 摘要任务上,ELF-B 的 ROUGE-1/2/L 分别为 36.0/12.2/27.8,全面优于其他方法(表 1)。定性示例显示 ELF 输出流畅且忠实于源文本。

消融研究的关键发现

  • 嵌入选择:预训练上下文嵌入(T5-small)优于非上下文、随机或可学习嵌入(图 5a),带来更好的质量-多样性权衡。
  • 采样器:SDE 采样在少步数下明显优于 ODE(图 5c),恰当的噪声再注入(γ=1.0\gamma=1.0)有效平衡了困惑度与熵(图 15b)。
  • x\boldsymbol{x} 预测:在多维度测试下,x\boldsymbol{x}-预测始终保持稳定,而 v\boldsymbol{v}-预测在高维时退化,ϵ\boldsymbol{\epsilon}-预测崩溃(图 10),说明这类设计是高维流匹配在文本上成功的关键。

实践建议

ELF 的方法对于希望将扩散模型应用于文本生成的工程师和研究者具有以下实践指导价值:

  1. 从连续空间切入,简化设计:如果你的任务允许将文本映射到连续表示(如预训练编码器输出),不妨放弃每步离散化。嵌入空间中的连续去噪可以显著减少对复杂解码器和 token 级损失的依赖,同时更兼容 CFG 等图像生成中的增强技术。
  2. 采用 x\boldsymbol{x}-预测与共享权重:直接预测干净嵌入并让同一网络完成解码,不仅能降低参数量,还能使两种目标的梯度互补,提高最终生成质量。训练时需注意两个分支的比例(论文推荐去噪/解码 ≈ 80%/20%),以及解码分支的独立噪声设置。
  3. 重视采样策略:对于低步数推理,应该采用 SDE 方式注入适量噪声(γ=1∼2\gamma=1\sim2),并结合 logit-normal 时间表;对于高步数推理,ODE 采样足够。CFG 尺度可根据所需多样性调节:高质量低多样性时可取 23,需要更高多样性时取 11.5。
  4. 数据与模型规模:ELF 证明在小数据(45B token)和小模型(105M)上即可取得有竞争力的结果,非常适合资源受限的研究环境。若想进一步扩大模型,可沿用其瓶颈设计(推荐 128 维)和预测策略,预期性能将稳步提升(图 6)。
  5. 应用到条件生成:只需将条件 token 的嵌入前置并在编码时不加噪,即可推展现有架构,CFG 对输入条件的引导也极为有效(建议 CFG 尺度 2,如图 16)。这种方法无需大改结构,即可推广至对话、翻译、摘要等任务。

ELF 整体的框架清晰、组件灵活,尤其适合那些希望用扩散流模型进行可控文本生成的应用场景。