Co-LMLM:连续查询有限记忆语言模型

Co-LMLM: Continuous-Query Limited Memory Language Models

arXiv: 2607.07707v1

论文信息

标题: Co-LMLM: Continuous-Query Limited Memory Language Models

作者: Yair Feldman, Linxi Zhao, Nathan Godey, et al.

发布日期: 2026-07-08

arXiv ID: 2607.07707v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:传统大语言模型将事实知识记忆在参数中,难以编辑、归因和移除。本文尝试解决如何在预训练阶段就把知识外部化到可读的知识库(KB),同时让模型以极低成本发起灵活的知识检索。
  • 核心方法:提出连续查询受限记忆语言模型(Co‑LMLM),用单个连续向量代替文本查询,从向量-文本键值对的知识库中检索事实片段,训练时联合优化语言建模和对比学习目标。
  • 关键结果:在 360M 参数、仅使用 Wikipedia 训练的条件下,Co‑LMLM 在 SimpleQA‑verified 上得分 21.2,与 gpt‑4o‑mini 持平、超过 Claude Sonnet 4.5;困惑度也低于用 40 倍数据训练的 SmolLM2‑360M(图 4a、表 1)。
  • 主要局限:目前仅在较小模型和 Wikipedia 风格知识上验证,未在更大规模、更多样语料中全面评估;构建数十亿条目的检索索引有一次性的计算开销。
  • 适合读者:关注大模型知识外部化、可解释性、事实性提升、知识编辑与遗忘机制的 NLP 研究者及工程实践者。

论文背景和研究动机

近年来,大语言模型(LLM)虽然在各种任务上表现惊人,但其参数中隐式存储事实知识的方式带来了诸多难题。事实召回与模型容量、数据频率强相关,长尾知识难以覆盖;知识熵与语言表征缠绕在一起,难以归因、编辑或移除,从而引发幻觉和过时知识(见第 2 节)。为此,研究者开始探索将知识从模型权重中 “外部化” 到独立存储单元。其中一种极具吸引力的思路是受限记忆语言模型(LMLM):在预训练期间,模型有意识地不记忆事实信息,而是将其存入人类可读的知识库,并在生成时按需检索。

此前 Zhao 等人提出的 Rel‑LMLM 使用关系型知识库(主体‑关系‑对象三元组),通过解码文本查询获取知识。虽然该方法首次展示了零训练遗忘、知识归因等优势,但存在明显局限:(1)预训练数据仅限于 Wikipedia,因为其文章围绕实体组织,便于自动标注三元组,难以扩展到通用文本;(2)知识只能表达为关系元组,覆盖面有限;(3)查询需解码成自然语言,既增加了推理开销,又受限于文本查询的表达力,且预定义的查询路径限制了学习到的检索机制。

Co‑LMLM 正是为了解决这些瓶颈而提出:用连续向量查询代替结构化文本查询,知识库存储任意自由文本片段,从而摆脱对 Wikipedia 实体‑关系结构的依赖,支持更广泛的预训练语料(如 FineWeb‑Edu),同时将单次查询的推理成本压至仅一次前向传播。

核心方法和技术细节

Co‑LMLM 的整体设计可以概括为 “连续工具调用” 式的检索增强语言模型。训练时,模型同时扮演语言模型和密集检索器两个角色。

1. 数据预处理与标注 训练需要原始文档中的事实片段被标记出来,并配套一个能回答该片段的问题。为此,作者设计了一套可扩展的自动标注流水线(图 3):

  • 先用强大的前沿模型(Gemini 3.1 Pro)在少量种子文档上生成 <FACT q="…" a="…">span</FACT> 格式的标注;
  • 然后利用种子数据分别微调两个轻量级标注器:一个基于 ModernBERT 的 BIO 标注器检测事实片段;一个基于 Qwen2.5‑1.5B 的生成器为每个片段生成问题‑答案对。生成器在看到全文档后一次性输出所有问题,利用 KV 缓存复用,效率很高。 最终,原始文本变为带有 <FACT> 和 </FACT> 标记的知识外部化训练语料。

2. 模型架构与推理 Co‑LMLM 是一个标准的解码器‑仅 Transformer,但在词汇表中引入两个特殊标记 <FACT> 和 </FACT>。推理时,模型自回归生成文本,一旦发出 <FACT>,就立即读取该位置最后一层的隐藏状态(经过 L2 归一化)作为查询向量,到预先构建的向量索引中检索 top‑1 事实文本片段,将其拼接在 <FACT> 之后,再追加 </FACT>,然后继续解码。整个过程只多耗费一步生成(<FACT> 本身)和相应上下文长度,无需解码文本查询(图 2 底部)。

3. 训练目标 模型训练包括两个联合损失:

  • 下一词预测损失(LNTP\mathcal{L}_{\mathrm{NTP}}):对文档中除 <FACT> 和 </FACT> 之间的内部事实 token 以外的所有 token 计算交叉熵。关键之处在于,我们不优化模型记住事实片段内的词,因为那部分知识应该外部化;但 <FACT> 标记本身是被优化的,以教会模型在需要时发起检索。
  • 对比损失(LCL\mathcal{L}_{\mathrm{CL}}):对于每个事实,文档中 <FACT> 位置的查询向量 ff 与对应问题中 <FACT‑q> 位置的查询向量 qq 构成正样本对,批次内其他问题为负样本。使用双向 InfoNCE 损失,温度 τ\tau,并加权求和: L=LNTP+λLCL\mathcal{L} = \mathcal{L}_{\mathrm{NTP}} + \lambda \mathcal{L}_{\mathrm{CL}} 默认 λ=0.25\lambda = 0.25。

这样,模型不仅学到何时检索,还学会将文档上下文的检索意图编码进同一隐藏状态,从而通过向量相似性找到正确事实。

4. 知识库构建 训练完毕后,用 Co‑LMLM 扫描整个预训练语料,提取所有 <FACT> 位置的 L2 归一化隐藏状态作为键,对应的事实文本作为值,存入 FAISS 向量索引。这一索引在推理时供模型查询。

创新点和贡献

Co‑LMLM 的创新主要体现在:

  • 从关系查询到连续查询:摒弃了必须解码的实体‑关系文本查询,用模型内部隐藏状态直接生成查询向量,检索成本极低(一次前向,约 2.2 毫秒,而文本查询方法约 28 毫秒,表 4)。这种设计让模型可以用更丰富的上下文信息来表达检索需求,性能显著优于 LMLM‑Asker 等文本查询方案。
  • 自由文本知识库:知识库不再局限于关系三元组,可以是任意跨度的事实句子。这使得知识外部化不再依赖 Wikipedia 的实体中心结构,可以扩展到 FineWeb‑Edu 等通用网络语料,训练数据范围扩大。
  • 可扩展的标注流水线:通过种子标注加微调小模型的方式,用较低成本即可对数以百亿 token 的语料进行事实标注,为大规模预训练铺平道路。
  • 在解释性和控制性上的延续与增强:与 Rel‑LMLM 一样,Co‑LMLM 的知识库是人类可读的,支持直接编辑、归因和无损遗忘(图 5b),同时提供更强的检索能力。
  • 有效的知识外化:当禁用知识库检索时,模型的事实精度急剧下降(表 3),证明知识确实被转移到了外部而非记忆在参数中。

实验结果分析

作者在 135M 和 360M 两种参数规模上,分别使用 Wikipedia 和 FineWeb‑Edu 预训练,系统比较了 Co‑LMLM 与标准语言模型、Rel‑LMLM 等基线。

困惑度 在简单英语维基百科测试集上,Co‑LMLM 的动态困惑度持续低于标准模型:360M 规模时,标准模型困惑度 14.0,Co‑LMLM 降至 10.5(图 4a)。即使采用最悲观的动态归一化困惑度度量,Co‑LMLM 仍然大幅领先(图 6)。值得注意的是,仅在 Wikipedia 上训练的 Co‑LMLM‑360M 困惑度已经低于用 40 倍数据(4T tokens)训练的 SmolLM2‑360M(图 4a 虚线),虽然存在领域差异,但趋势令人鼓舞。当索引扩大至包含 FineWeb‑Edu 的 2.2B 条目时,FineWeb 测试集的困惑度也得到明显改善,表明模型能从更大的知识库中受益。

事实精度 在短文本问答、知识补全、长文本生成等五个基准上,Co‑LMLM 全面超越标准模型和 Rel‑LMLM(表 1)。以 360M 模型为例,Co‑LMLM 相对标准模型的 TriviaQA 提升 23.9 个百分点,PopQA 提升 30.3 个百分点,SimpleQA 提升 20.9 个百分点。加入了 FineWeb‑Edu 训练后,SimpleQA 得分达到 21.7,与 gpt‑4o‑mini 相当,并超过 Claude Sonnet 4.5 和 Grok 2(排行榜数据)。同时,Co‑LMLM 在自然语言理解(NLU)任务上的性能与同规模标准模型持平,说明知识外部化没有牺牲通用语言能力(表 12)。

知识外化与遗忘 禁用 KB 检索后,Co‑LMLM 的 TriviaQA 得分从 31.4 暴跌至 6.0(360M),其余指标也大幅下降(表 3),强有力地证明模型依赖外部记忆而非参数记忆。在 TOFU 遗忘任务上,仅需从知识库中删除对应条目,就能实现统计上不可区分的遗忘效果(p>0.05p > 0.05),且不损伤保留集性能(图 5b),而传统的基于梯度的遗忘方法如 NPO 则会明显损害通用能力。

与 RAG 的互补性 在标准模型上加入 BM25 检索,事实性大幅提升,但 Co‑LMLM 仍保持优势;再在 Co‑LMLM 上叠加 RAG,性能进一步提升(表 2)。这表明 Co‑LMLM 提供的是可控、可编辑的细粒度事实内存,与文档级检索形成互补。

实践建议

Co‑LMLM 的设计为需要高事实准确性、可解释性和可编辑性的语言模型应用提供了直接路径:

  • 可审计的知识库型助手:由于所有事实均来自人类可读的外部 KB,且每次检索可以清晰归因到具体文本片段,特别适合法律、医疗、金融等对信息溯源要求高的垂直领域。开发者可以预先构建高质量的领域知识库,并持续更新,无需重新训练模型。
  • 在线学习与忘却的轻量实现:当需要移除某条知识(如涉及隐私或错误信息)时,直接从向量索引中删除对应条目即可生效,无需梯度更新,避免了灾难性遗忘。这种能力对合规要求严格的服务极具吸引力。
  • 以更低成本扩展知识范围:标注流水线可处理大规模通用语料,模型训练仅需在普通下一词预测框架中加入对比损失,改动不大。实践者可以先在自身领域的无标注文档上运行流水线,生成外部化训练数据,再用相对较小的模型(如 360M)取得与庞大模型可比的事实性能,降低推理成本。
  • 结合文档检索的多层记忆:建议将 Co‑LMLM 作为内部可编辑的 “精读记忆”,与 BM25 等文档检索组成的 “泛读记忆” 结合,构建事实性与上下文覆盖兼顾的生成系统。

需要注意的是,目前方案在大模型(>1B)和极大规模数据上的行为尚未充分验证;构建和维护数十亿条目的向量索引也有一定工程复杂度,但作者已将标注数据和模型开源,为进一步降门槛和规模化研究提供了基础。