Co-LMLM:连续查询有限记忆语言模型

arXiv: 2607.07707v1

论文信息

标题: Co-LMLM: Continuous-Query Limited Memory Language Models

作者: Yair Feldman, Linxi Zhao, Nathan Godey, et al.

发布日期: 2026-07-08

arXiv ID: 2607.07707v1

PDF 链接: 下载 PDF

1. 背景与动机

大型语言模型(LLM)通常将事实性知识隐式存储于模型参数中,这种方式虽然简单,却带来了诸多难题:知识更新需要重新训练,事实归属难以追溯,错误信息容易 “固化” 在权重中,且长尾知识覆盖严重不足。为了解决这些痛点,Zhao 等人(2026)提出了有限记忆语言模型(Limited Memory Language Models, LMLM),其核心思想是在预训练阶段就将事实性知识 “外化” 到一个人类可读的知识库(KB)中,而非强行压缩进模型权重。这种设计(原文称为 Rel‑LMLM)以关系三元组(subject‑relation‑object)的形式组织知识,并在推理时通过解码出文本查询来获取信息,带来了可解释性、可编辑性和易于归因等优势。

然而,Rel‑LMLM 存在几个关键局限,阻碍了其规模化与表达能力:

  1. 数据依赖性强:预训练依赖维基百科,因为每篇文章都围绕一个实体,便于自动标注关系查询,无法扩展到通用文本。
  2. 表示形式受限:只能外化可表达为关系三元组的事实,且这些三元组的主语和关系必须出现在前文中,极大地限制了可外化知识的范围。
  3. 查询生成开销大:检索时需要额外解码多个令牌来生成自然语言查询,增加了推理成本。
  4. 检索路径固化:在数据预处理阶段就合成了精确的文本查询,导致模型只能学习到预定的检索模式,缺乏灵活性。

本文提出的 Co‑LMLM(Continuous‑Query Limited Memory Language Models) 正是为了突破上述限制而设计的。它将查询从离散的关系三元组改为连续的向量表示,知识库也从结构化关系变为自由文本跨度,从而在保持 LMLM 全部优点的同时,实现了更灵活、更通用且更高效的知识外化。

2. 核心方法

Co‑LMLM 本质上是一个 “双重身份” 的解码器 Transformer:既是一个语言模型,又是一个稠密检索器。它的工作机制可以类比于工具调用,但查询不是解码出的文本,而是模型隐状态直接生成的向量。

2.1 模型结构与推理流程

外部记忆采用键值存储:是模型在特殊令牌 <FACT> 处输出的 L2 归一化隐状态,是对应的事实文本片段。推理时,模型自回归地生成令牌,一旦发出 <FACT>,系统立即将此刻的最后一层隐状态作为查询向量,在向量索引中检索最相似的一个事实片段,并将其拼接回上下文,之后追加一个 </FACT> 令牌,再继续后续生成。整个过程仅增加一个 <FACT> 令牌的额外步骤和检索来的文本长度,远轻于显式解码文本查询的方式。

2.2 联合训练目标

训练数据中,每个事实跨度被 <FACT></FACT> 包围,并且每个跨度都配有一个自然语言问题(该问题的答案就是跨度内容)。训练时,模型同时优化两个目标:

  • 下一令牌预测(NTP)损失:对非事实部分(即 <FACT> 之前、</FACT> 之后以及 <FACT> 本身)计算交叉熵,明确地将事实内容排除在外,迫使模型不将其记忆在参数中。
  • 双对比 InfoNCE 损失:将文档中 <FACT> 令牌的隐状态作为文档查询 ff,将对应问题末尾 <FACT-q> 令牌的隐状态作为问题查询 qq。在一个批次内,正对是 (f(i),q(i))(f^{(i)}, q^{(i)}),其他问题的查询作为负样本。对比损失定义为
LCL=12Bi=1B(logexp(f(i) ⁣ ⁣q(i)/τ)kexp(f(i) ⁣ ⁣q(k)/τ)+logexp(q(i) ⁣ ⁣f(i)/τ)kexp(q(i) ⁣ ⁣f(k)/τ)),\mathcal{L}_{\mathrm{CL}} = -\frac{1}{2B}\sum_{i=1}^B \left( \log\frac{\exp(f^{(i)}\!\cdot\! q^{(i)}/\tau)}{\sum_k\exp(f^{(i)}\!\cdot\! q^{(k)}/\tau)} + \log\frac{\exp(q^{(i)}\!\cdot\! f^{(i)}/\tau)}{\sum_k\exp(q^{(i)}\!\cdot\! f^{(k)}/\tau)} \right),

其中 τ\tau 为温度系数。该损失促使文档上下文中的 “检索意图” 与对应问题的语义表示在嵌入空间中拉近,从而实现隐式查询与正确知识值的对齐。最终联合损失为 L=LNTP+λLCL\mathcal{L} = \mathcal{L}_{\mathrm{NTP}} + \lambda \mathcal{L}_{\mathrm{CL}}(默认 λ=0.25\lambda = 0.25)。

2.3 大规模数据预处理管线

Co‑LMLM 的成功离不开自动化的语料标注流程。预处理分为三个阶段:

  1. 种子标注:使用 Gemini‑3.1‑Pro 对少量文档进行手工级标注,格式为 <FACT q="…" a="…">事实文本</FACT>,其中问题写成独立的搜索查询,答案尽量变换措辞以增强泛化。
  2. 蒸馏训练:用种子数据微调两个轻量级标注器——一个基于 ModernBERT 的事实跨度标注器(BIO 标注),以及一个基于 Qwen2.5‑1.5B 的问题生成器(只输出问答对,文档前缀被 KV 缓存复用)。两阶段设计保证了效率与忠实度,因为跨度直接标注为原文子串,避免了生成式模型可能产生的幻觉。
  3. 规模应用:将两个标注器运行在整个预训练语料上,将原始文档转换为 Co‑LMLM 所需的标注格式。

此管线可以高效处理从维基百科到 FineWeb‑Edu 等多种大规模语料,为模型打开了超越百科的广阔数据疆域。

3. 创新点与贡献

  • 连续查询机制:放弃了关系查询和自然语言问题生成,直接用模型内部状态驱动检索,使查询可以携带任意上下文信息,不受语言表达的限制,且检索开销仅为一个前向步。
  • 自由文本知识库:知识库变成非结构化的文本片段,摆脱了关系三元组对主语、谓语形式的严格约束,大大拓宽了可外化知识的类型和数量。
  • 可控且可扩展的训练框架:通过对比学习和 NTP 掩码策略,让模型自然地学习 “何时检索” 和 “检索什么”,同时保留标准预训练的规模化能力。
  • 数据标注处理:设计了一套高效、忠实度高的自动标注管线,支持将预训练语料无缝适配到知识外化范式。

4. 实验结果分析

论文在 SmolLM2‑135M 和 SmolLM2‑360M 架构上验证了 Co‑LMLM,并与标准语言模型、Rel‑LMLM 以及 RAG 等进行了全方位比较。知识库使用整个维基百科训练集构建,Co‑LMLM 对应的索引约有 2.4 亿条目(多于 Rel‑LMLM 的 1.45 亿),显示其更激进的外化能力。

4.1 语言建模困惑度

在简单英语维基百科测试集上,Co‑LMLM 的动态困惑度(实际检索)显著低于标准模型:135M 规模从 14.4 降至 11.8,360M 规模从 14.0 降至 10.5。更令人瞩目的是,Co‑LMLM‑360M‑FW(在 FineWeb‑Edu 上继续训练)的困惑度甚至低于训练数据多 40 倍的公开 SmolLM2‑360M 模型,表明外化知识对数据量的利用效率极高。当索引扩展到 22 亿条目后,模型在 FineWeb 测试集上依然保持低困惑度,验证了即便索引规模扩大一个量级,检索器的稳健性依然良好。

4.2 事实精度与通用能力

在 TriviaQA、PopQA、SimpleQA、T‑REx 和 FactScore 等五个基准上,Co‑LMLM 一致碾压标准基线和 Rel‑LMLM。以 360M 为例,Co‑LMLM 在 PopQA 上提升 30.3 个百分点,SimpleQA 提升 20.9 个百分点。更值得关注的是,Co‑LMLM‑360M‑FW 在 SimpleQA 上达到 21.7,与 GPT‑4o‑mini 持平,超越 Claude Sonnet 4.5。同时,知识外化并未损害自然语言理解(NLU)能力,在 CommonsenseQA、HellaSwag 等任务上表现与同尺寸标准模型相当。这表明事实知识与语言理解能力可以在预训练中有效解耦。

4.3 遗忘、效率与查询时机

通过直接删除知识库条目,Co‑LMLM 在 TOFU 遗忘测试中实现了 “训练自由” 的精准遗忘,忘却集中的知识被彻底移除,而保留集和真实世界知识不受影响;相比之下,基于梯度的 NPO 方法则显著损害了保留能力。效率方面,从隐藏态生成查询仅需约 2.2 毫秒,而解码自然语言问题的开销高达 28 毫秒(约 13 倍),凸显连续查询的低延迟优势。论文还通过 “强制查询” 实验揭示了模型有时未能及时触发检索的问题,当强制在回答前查询时,事实得分进一步提升,说明查询时机决策仍有优化空间。

5. 实践应用建议

  • 知识可控大模型:Co‑LMLM 为构建可审计、可编辑的 AI 系统提供了直接路径。企业可以将内部知识文档标注后构建 KB,模型通过检索生成时天然附带知识来源,便于合规审查。
  • 持续学习与领域适配:因为知识不在权重中,新增领域知识只需向索引追加新键值对,无需重新训练,极大降低了维护成本。
  • 组合 RAG 的增强方案:实验表明 Co‑LMLM + RAG 可以进一步叠加效果,RAG 负责宽泛的文档上下文,Co‑LMLM 提供细粒度的、可控的事实记忆,两者互补。
  • 高效推理部署:连续查询消除了显式问答生成和额外的编码器推理,适合对延迟敏感的应用场景。

6. 未来发展方向

当前工作仍以中等规模和百科类知识为主,未来有几个重要方向值得探索:

  1. 知识缩放定律:在更大模型和更多样化的数据(如编程、医疗、多语言)上研究外化知识的规模效应,建立类似于参数知识的新缩放规律。
  2. 后训练索引自适应:如何在微调甚至强化学习后,高效地适配或扩充知识库,使模型既拥有新能力又不丢失外化知识。
  3. 检索触发优化:改进模型自主决定何时查询的机制,减少过犹和略过的错误,或许可以通过强化学习或更精细的损失函数监督。
  4. 安全与隐私:利用可删除记忆的特性设计更稳健的隐私保护方案,同时研究如何防止知识库被恶意篡改或窃取。

7. 总结

Co‑LMLM 通过连续向量查询自由文本知识库两大核心设计,优雅地突破了第一代有限记忆语言模型的关系表示瓶颈。它既保留了知识外化所固有的可解释性、可编辑性和归因能力,又在困惑度、事实精度和推理效率上实现了全面超越。其可扩展的预训练管线和对通用语料的成功适配,展示了该范式从 “概念验证” 迈向 “实用基础设施” 的潜力。随着对知识边界、检索策略和索引管理的进一步研究,Co‑LMLM 有望成为构建透明、可控且持续学习的语言模型的重要基石。