伸缩式语言模型

Telescopic Language Models

arXiv: 2609.35769v1

论文信息

标题: Telescopic Language Models

作者: Zhilin Guo, Boqiao Zhang, Hakan Aktas, et al.

发布日期: 2026-09-28

arXiv ID: 2609.35769v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:一次训练能否得到一个语言模型,使其在任意深度截断后都是可用模型,而不是只为少数固定预算训练独立模型或固定出口套件?
  • 核心方法:在 Matryoshka Language Model Suites 的嵌套宽度-深度级联上,每步随机采样一个前缀深度,用完整下一 token 目标监督该前缀,同时加入全容量锚点损失;架构和推理均不增加额外组件。
  • 关键结果:在 200M 参数、20B FineWeb-Edu tokens 的同一数据流设置下,uniform 采样 TLM 在全部 20 个深度前缀上都是有效语言模型,AULB 从 MLMS 的 5.73–5.90 降至 3.28,降低 43–44%,且全容量困惑度 14.99 与 MLMS 套件范围 14.96–15.42 持平(见论文摘要及第 4.2 节)。
  • 主要局限:证据主要在 200M 代理规模、部分单种子;MLMS 在其两个小于全容量的训练出口仍优于 TLM;论文未说明该方法在 8B–70B 规模是否保留同样的峰值-连续分离。
  • 适合读者:关注多预算推理部署、弹性 Transformer 训练、固定出口/剪枝替代方案,以及训练效率与前沿连续性的研究者与工程师。

论文背景和研究动机

语言模型要服务从端侧到数据中心相差多个数量级的延迟与算力预算。目前常见做法是:为每个预算独立训练一个模型,或事后压缩大模型并接受质量损失。二者都会成倍增加训练或压缩成本。嵌套容量级联提供了一条更便宜的路线:把不同宽度和深度的子模型堆叠进一个 Transformer,理想情况下一次训练可服务多个尺寸。

Matryoshka Language Model Suites(MLMS)是这一思路的代表:它只监督 M=3M=3 个固定出口,并用最大子模型做在线蒸馏。论文作者发现,级联本身不能自动产生连续可用的中间深度;在 MLMS 未训练的深度上,验证困惑度会从出口附近的约 20 升至 10210^2–10510^5,例如 k=1k=1 达到 438,883(见论文图 2a)。作者据此认为,决定模型是否 “弹性” 的是训练目标,而不是嵌套结构本身。

这一动机与 MatFormer、slimmable networks、LayerDrop 等工作相关。论文特别指出一个表面矛盾:MatFormer 的未训练中间宽度仍可用,而 MLMS 的未训练中间深度会崩溃;作者推测差异来自嵌套位置与读出头的校准方式,而 TLM 则直接训练连续深度前缀,避免固定出口监督的稀疏性。

核心方法和技术细节

TLM 使用与 MLMS 相同的嵌套容量级联:Llama 风格 Transformer 子模型按宽度和深度递增排列,共 20 个 block,三个宽度段为 11@320、5@576、4@960。每个子模型在连接处拼接共享输入嵌入的新切片,并拥有自己的最终 RMSNorm 和 LM head,因此每个级联前缀都是独立的语言模型。

核心训练目标是随机前缀监督加全锚点。每个优化步在同一个微批次 (x,y)(x,y) 上做两次前向-反向:

Lstep(θ)=λ ℓ(Fk~(x;θ), y)+γ ℓ(FN(x;θ), y),k~∼π\mathcal{L}_{\mathrm{step}}(\theta) = \lambda\,\ell\big(F_{\tilde{k}}(x;\theta),\,y\big) + \gamma\,\ell\big(F_N(x;\theta),\,y\big), \quad \tilde{k}\sim\pi

其中 Fk~F_{\tilde{k}} 是前 k~\tilde{k} 个 Transformer block 加对应子模型 head 的 logits;ℓ\ell 是 token 级交叉熵;N=20N=20 是总深度;π\pi 是前缀深度的采样分布,默认均匀分布;λ=γ=1\lambda=\gamma=1。第一项是随机前缀 pass,每次只训练一个随机深度前缀;第二项是全锚点 pass,保证全容量模型每步都获得完整目标梯度。训练目标是该每步损失的期望。

与 MLMS 的差异在于:MLMS 每步在 M=3M=3 个固定出口都施加损失并做蒸馏,因此每步成本随出口数增长;TLM 每步只采样一个前缀,平均深度浅于全栈,外加一个全容量 pass,成本固定为两次 pass。架构和推理均无额外变化:训练产物在任意深度 kk 直接截断使用。

论文引入一系列连续前沿评估指标:AULB 是验证 NLL 在整数深度网格 k=1..20k=1..20 上的梯形积分并按网格跨度归一化,衡量整个深度轴的损失面积;LODA 是质量-吞吐前沿下的归一化面积,只计入方法实际可用的有效操作点;off-exit gap 直接衡量固定出口基线在未训练深度上的质量差距;Δfull\Delta_{\mathrm{full}} 衡量全容量相对独立训练 twin 的差距。

创新点和贡献

TLM 的主要贡献是把 “一个随机前缀对完整目标训练,加上全模型锚点” 的目标从 3D Gaussian splatting 迁移到语言模型容量轴,并在同一嵌套架构和数据流下与固定出口套件做隔离比较。这带来几个可观察的创新:

第一,用训练目标而非架构解释弹性。图 2 显示同样级联下,TLM uniform 在所有 20 个深度平滑下降,而 MLMS 只在三个训练出口有效;exit-grid 采样的 TLM 也会在非出口深度崩溃(见论文表 1 与第 4.3 节)。作者据此推断,密集随机监督是连续性的必要条件。

第二,提出并量化了覆盖-出口质量权衡。前缀采样分布 π\pi 是连续调节旋钮:log-uniform、uniform、exit-grid 三者从密集小前缀到固定出口逐渐集中。论文第 4.3 节显示,质量在训练出口随采样集中而改善,但 off-exit 覆盖随之恶化;uniform 在 AULB 上最好(3.28),而 exit-grid 几乎没有连续覆盖(AULB 6.21)。

第三,在 200M 代理规模上,连续覆盖在峰值处几乎免费。uniform TLM 的全容量 PPL 为 14.99,MLMS best suite 为 14.98;exit-grid TLM 达到 14.65,缩小了与独立 twin(13.98)的差距(见论文表 1 与第 4.2 节)。训练成本方面,TLM uniform 为 131 GPU-h,比无蒸馏 MLMS 的 149 GPU-h 低约 12%,比三模型 vanilla suite 216 GPU-h 低约 1.7 倍(见论文表 2)。

实验结果分析

图 2 是主要证据:TLM uniform 从 k=1k=1 的 81 PPL 平滑下降到 k=20k=20 的 15,中间没有超过 56 的尖峰;MLMS 在 k=5k=5 达 1,412 PPL,k=1k=1 达 438,883 PPL,远高于词表 chance 水平 49,152。AULB 从 MLMS 四套配置的 5.73–5.90 降至 3.28,即 43–44% 降低(见论文第 4.2 节)。在下游 7 个基准任务上,TLM 的深度前缀也随深度提升准确率,而 MLMS 的 off-exit 前缀接近 chance(见图 2b)。

表 1 的 LODA 进一步显示连续模型在部署前沿的价值:TLM uniform 的 LODA_acc 为 38.9,MLMS best suite 为 21.8;LODA_ppl 为 47.3 对 27.8(见论文表 1)。这主要来自 TLM 能在 MLMS 最小出口以下额外服务十个操作点。图 3 用质量-吞吐前沿展示了同一趋势。

值得注意的是,MLMS 在其两个小于全容量的训练出口仍占优。例如在 50M 出口,MLMS norm+distill 为 21.89 PPL,TLM best arm 为 24.38;在 100M 出口为 17.47 对 19.11(见论文第 4.2 节)。这说明连续覆盖不是免费午餐:监督分散到 20 个深度会削弱固定出口质量。图 4 在实测 A100 延迟上也复现了这一现象:TLM 在任意延迟可用,但 MLMS 的固定出口在对应点略强。

消融实验为各成分提供了证据。去掉全锚点后,200M PPL 从 14.99 左右升至 22.32,连续 AULB 几乎不变(3.41),说明锚点主要保护峰值(见第 4.3 节)。log-uniform 采样不采样 k=1k=1,该前缀崩溃到 6,740 PPL;这再次表明,即便在 TLM 内,未监督前缀仍会失败,连续性来自监督密度。论文还做了 head-only 修复、LayerDrop 控制等,结果在附录 B 中报告。

这些结论都应当限制在该数据集和实验设置下:200M 参数、FineWeb-Edu 20B tokens、单一种子为主。论文作者也明确 8B–70B 的峰值-连续分离是否成立仍是开放问题。

实践建议

对于需要在多预算或未知延迟空间部署语言模型的团队,TLM 类随机前缀监督加全锚点目标值得尝试。实践上可先确认部署预算是否连续分布:如果只有少数固定尺寸,固定出口套件或独立训练可能仍是更简单的选择;如果需要覆盖中间延迟,TLM 的 uniform 采样能在不改变推理代码的情况下提供 20 个整数深度操作点。

训练成本可以直接按论文的两次 pass 结构核算:TLM uniform 在 200M 代理规模为 131 GPU-h,低于无蒸馏 MLMS 的 149 GPU-h(见论文表 2)。但在工程实现中,MLMS 的共享前向与逐出口反向可能因框架不同而改变成本关系,建议在目标集群上做小规模成本基准,而不是直接套用论文数字。

如果业务关心最小模型质量,log-uniform 采样偏向小前缀,论文报告 k=2k=2 可到 40.0 PPL,优于 uniform 同深度的 54.7(见第 4.3 节)。但要注意它不采样 k=1k=1,导致最浅前缀崩溃;若需要 k=1k=1,应继续使用 uniform 或显式补充 k=1k=1 训练。

部署时每个请求固定一个深度即可直接截断使用;论文未研究在一个生成过程中切换深度,因为这要求跨层截断或扩展 KV cache,属于配套系统问题。若追求质量前沿评估,可引入 AULB 或 LODA 类指标,避免只看固定出口困惑度而忽略 off-exit 崩溃。最后,论文的结论主要来自 200M 代理规模,生产前应在目标参数规模和数据上复现,尤其是全容量质量能否保持与独立 twin 的差距,以及 off-exit 覆盖是否仍平滑。