连续自回归语言模型
Continuous Autoregressive Language Models
论文信息
标题: Continuous Autoregressive Language Models
作者: Chenze Shao, Darren Li, Fandong Meng, et al.
发布日期: 2025-10-31
arXiv ID: 2510.27688v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:传统大语言模型受限于逐 token 生成的方式,计算效率瓶颈严重,论文试图打破这一限制,寻找在单步生成中承载更多语义信息的新范式。
- 核心方法:提出连续自回归语言模型(CALM),用高保真自编码器将 K 个离散 token 压缩为一个连续向量,进而建模连续向量序列的生成,将生成步数缩减至原来的 1/K。
- 关键结果:CALM 在性能-计算权衡上显著优于离散基线,以大幅降低的计算成本达到强自回归模型的性能水平(见论文实验部分)。
- 主要局限:论文未明确列出局限性;方法固有的约束包括压缩窗口大小 K 为固定超参数,以及连续向量重建虽精度很高但仍可能引入微小的语义偏差,对极长依赖的建模能力有待进一步验证。
- 适合读者:关注大语言模型效率、生成模型架构创新、自编码器与表示学习交叉领域的研究者、工程师和算法架构师。
论文背景和研究动机
大语言模型近年来在各类自然语言任务上展现出惊人的能力,但其自回归逐 token 生成的本质导致推理延迟随序列长度线性增长。即便在训练阶段,顺序预测也限制了并行化潜力。效率已经成为 LLM 规模化部署的核心瓶颈,现有工程优化(如 KV 缓存、投机解码)虽然缓解了部分问题,但并未触动生成范式的根基。
论文指出,要真正突破这一瓶颈,必须在 LLM 的缩放维度上引入新的设计轴:增加每步生成的语义带宽。传统离散词表模型每一步只能产生一个 token 的信息量,而自然语言中相邻 token 之间存在大量冗余与可预测性。如果能在表示层面将多个 token 压缩为一个稠密向量,并以该向量作为生成单位,那么生成步数就能成倍减少,从根本上提升效率。
这一直觉引导作者提出了连续自回归语言模型(CALM)。其核心思想是将语言建模从一个离散序列预测问题转变为连续向量序列预测问题——用高保真自编码器把长度为 K 的 token 块嵌入为一个连续向量,然后训练一个自回归模型预测下一个向量,最后通过解码器无损或近似无损地恢复出原始 token。这种 “先压缩再预测再重建” 的流水线,将生成步数压缩为原来的 1/K,同时要求整个系统在连续域中具备高精度的重建和可控采样能力。论文为此专门构建了一套无似然训练、评估与采样框架,为连续语言建模铺设了完整的工具链。
核心方法和技术细节
CALM 由三个核心模块构成:高保真自编码器、连续向量的自回归模型,以及配套的无似然训练体系。
高保真自编码器:从离散到连续的桥梁
自编码器的任务是将 K 个离散 token 组成的一个 token 块编码为一个固定维度的连续向量 ,并要求解码器能够从 精确还原出原始的 K 个 token。论文强调,这种编码必须达到 “高保真”,其重建准确率超过 99.9%(据论文描述)。这意味着连续向量几乎可以无损地承载原始 token 块的全部信息,为后续的向量级建模提供了可靠的语义单元。
在实现上,编码器可能采用基于 Transformer 的结构,将 K 个 token 的嵌入序列聚合为一个向量;解码器则以该向量为条件,自回归地生成每个 token。为了达到超高重建精度,论文很可能引入了辅助重建损失与表示正则化技术,但未公开完整细节。关键之处在于,编码向量 不再是离散代码,而是位于连续欧几里得空间的点,这为后续的密度建模打开了使用连续化生成模型的大门。
向量序列的自回归建模
获得高保真编码器后,训练语料中的每一个 token 序列都会被切割为不重叠的长度为 K 的块,每个块被编码为一个向量,从而将原始文本转化为连续向量序列 。此时,语言模型的任务变成:给定过去的所有向量,预测下一个向量 的分布。
与离散 token 预测不同,连续向量的每个维度都是实数,无法直接使用交叉熵损失。论文开发了一套无似然(likelihood‑free)框架来训练此类模型。具体地,训练目标可能结合了得分匹配(score matching)或对比散度,使得模型能够学习在连续空间中刻画条件分布。采样时,模型通过迭代去噪或从预测的连续分布中抽取下一个向量,再将其传递给自编码器解码器恢复 token。这一过程允许可控采样,例如通过引入条件向量或引导项来控制生成风格或内容。
评估与可控采样
由于生成单元变成了连续向量,传统的困惑度(perplexity)等依赖离散似然的指标不再直接适用。论文为此提出了新的评估协议,仍然以重建的 token 序列质量为准,评测生成文本的流畅度、一致性和下游任务性能,从而公平地与离散基线比较。
可控采样方面,无似然框架天然支持在连续空间中施加约束或引导,例如通过条件嵌入调节生成属性,或在采样过程中进行梯度引导,实现类似分类器引导的效果。这为高效的条件生成打开了一条新路径。
创新点和贡献
CALM 的创新性可以概括为三个层面。
其一,范式跃迁:首次将大语言模型的生成单元从离散 token 提升为连续语义向量。这不是简单的块级别预测(例如预测多个 token),而是通过一块文本的整体信息压缩得到一个稠密表示,并在此表示之上进行一步预测。这种 “next‑vector prediction” 将语义带宽直接放大了 K 倍,为极致高效的模型缩放开辟了全新方向。
其二,高保真压缩与重建:实现超过 99.9% 重建精度的自编码器是论文的关键工程突破。若没有这一精度,重建 token 的噪声会迅速污染生成质量,使连续建模失去实用价值。这一压缩能力证明了语言中大量局部冗余可以被紧凑编码,为其他高效表示研究提供了有力佐证。
其三,完整的无似然连续建模方法论:论文不仅提出想法,还配套了从训练、评估到可控采样的全链路工具,使连续自回归模型的探索不再停留在概念阶段。这一框架可以直接应用于不同规模的模型和不同 K 的设置,极具扩展性。
这些贡献共同作用,带来了性能-计算权衡的显著改善(见论文实验部分)。CALM 能够在远低于离散基线的计算消耗下,取得有竞争力的生成质量和下游任务成绩,为在资源受限场景中部署强大语言模型提供了可能。
实验结果分析
论文的实验主要围绕性能与计算成本的权衡展开。虽然具体数字未在摘要中详述,但作者报告称,CALM 以显著更低的计算成本达到了强离散自回归基线的性能。这意味着在相同的推理算力预算下,CALM 可以生成更长的连贯文本或容纳更大规模的模型;或者,在同等输出质量下,其延迟与能耗远低于传统方式。
值得关注的是,这种提升的幅度与 K 的取值直接相关。更大的 K 能带来更激进的步数压缩,但对自编码器的重建能力和连续模型的预测精度提出了更高要求。论文可能展示了不同 K 下的性能曲线,并给出一个推荐区间,在重建质量与效率之间取得平衡。同时,可控采样实验表明,CALM 可以在不显著增加额外计算负担的情况下,实现灵活的条件生成,进一步拓宽了其应用场景。
实践建议
对于希望在工程中应用或借鉴 CALM 思想的团队,以下几点建议值得参考。
-
先评估压缩比 K 的选择:K 值是 CALM 的核心超参数,直接影响生成步数和重建难度。建议从较小 K(如 4 或 8)开始实验,验证自编码器在目标领域数据上的重建精度是否满足 >99.9% 的门槛。随着自编码器能力的提升,再逐步增大 K 以获取更高的效率收益。
-
自编码器的训练与微调应视为独立子系统:自编码器需要高性能的重建,它可以先于连续生成模型独立训练。训练时建议采用大规模无监督语料,结合针对序列重建的辅助损失(如对比学习)保证表示泛化性。自编码器一经训练固定,后续生成模型的迭代会非常轻便。
-
无缝替换现有 pipeline 的策略:CALM 的生成模型本质上可以复用现有 Transformer 架构,只需将输出 head 改为预测连续向量,并采用无似然训练目标。实践中,可以先用 CALM 替换模型中最耗时的长序列生成部分(例如聊天模型的回答生成),而将 prompt 编码仍用标准 token 级编码,实现分阶段迁移。
-
关注采样效率与可控性的平衡:无似然框架下的采样可能涉及多步去噪或迭代细化,引入额外的计算开销。建议在生产环境中预研采样步数与生成质量的关系,在可控性需求不高的场景中采用更低的采样步数。同时,充分利用连续空间中直接施加引导的特性,设计简化的可控生成接口,例如通过低秩适配器将条件信息注入向量预测。
-
部署时注意推理优化:虽然生成步数大幅减少,但每步都涉及连续向量的预测与重建,需要评估实际延迟。可以采用模型量化、算子融合等方法优化向量预测模块,并将自编码器的解码过程(token 重建)与生成流水线深度整合,减少内存搬运。
CALM 的出现标志着语言模型正向连续、更具语义密度的表示演化。早期实践者有机会在长文本生成、实时对话和边缘设备部署等领域率先获得效率红利。未来,随着高保真压缩技术的成熟和无似然训练的进一步简化,连续自回归模型有望成为主流架构选型中的重要分支。