Co-LMLM:连续查询有限记忆语言模型
论文信息
标题: Co-LMLM: Continuous-Query Limited Memory Language Models
作者: Yair Feldman, Linxi Zhao, Nathan Godey, et al.
发布日期: 2026-07-08
arXiv ID: 2607.07707v1
PDF 链接: 下载 PDF
1. 背景与动机
大型语言模型(LLM)通常将事实性知识隐式存储于模型参数中,这种方式虽然简单,却带来了诸多难题:知识更新需要重新训练,事实归属难以追溯,错误信息容易 “固化” 在权重中,且长尾知识覆盖严重不足。为了解决这些痛点,Zhao 等人(2026)提出了有限记忆语言模型(Limited Memory Language Models, LMLM),其核心思想是在预训练阶段就将事实性知识 “外化” 到一个人类可读的知识库(KB)中,而非强行压缩进模型权重。这种设计(原文称为 Rel‑LMLM)以关系三元组(subject‑relation‑object)的形式组织知识,并在推理时通过解码出文本查询来获取信息,带来了可解释性、可编辑性和易于归因等优势。
然而,Rel‑LMLM 存在几个关键局限,阻碍了其规模化与表达能力:
- 数据依赖性强:预训练依赖维基百科,因为每篇文章都围绕一个实体,便于自动标注关系查询,无法扩展到通用文本。
- 表示形式受限:只能外化可表达为关系三元组的事实,且这些三元组的主语和关系必须出现在前文中,极大地限制了可外化知识的范围。
- 查询生成开销大:检索时需要额外解码多个令牌来生成自然语言查询,增加了推理成本。
- 检索路径固化:在数据预处理阶段就合成了精确的文本查询,导致模型只能学习到预定的检索模式,缺乏灵活性。
本文提出的 Co‑LMLM(Continuous‑Query Limited Memory Language Models) 正是为了突破上述限制而设计的。它将查询从离散的关系三元组改为连续的向量表示,知识库也从结构化关系变为自由文本跨度,从而在保持 LMLM 全部优点的同时,实现了更灵活、更通用且更高效的知识外化。
2. 核心方法
Co‑LMLM 本质上是一个 “双重身份” 的解码器 Transformer:既是一个语言模型,又是一个稠密检索器。它的工作机制可以类比于工具调用,但查询不是解码出的文本,而是模型隐状态直接生成的向量。
2.1 模型结构与推理流程
外部记忆采用键值存储:键是模型在特殊令牌 <FACT> 处输出的 L2 归一化隐状态,值是对应的事实文本片段。推理时,模型自回归地生成令牌,一旦发出 <FACT>,系统立即将此刻的最后一层隐状态作为查询向量,在向量索引中检索最相似的一个事实片段,并将其拼接回上下文,之后追加一个 </FACT> 令牌,再继续后续生成。整个过程仅增加一个 <FACT> 令牌的额外步骤和检索来的文本长度,远轻于显式解码文本查询的方式。
2.2 联合训练目标
训练数据中,每个事实跨度被 <FACT> 和 </FACT> 包围,并且每个跨度都配有一个自然语言问题(该问题的答案就是跨度内容)。训练时,模型同时优化两个目标:
- 下一令牌预测(NTP)损失:对非事实部分(即
<FACT>之前、</FACT>之后以及<FACT>本身)计算交叉熵,明确地将事实内容排除在外,迫使模型不将其记忆在参数中。 - 双对比 InfoNCE 损失:将文档中
<FACT>令牌的隐状态作为文档查询 ,将对应问题末尾<FACT-q>令牌的隐状态作为问题查询 。在一个批次内,正对是 ,其他问题的查询作为负样本。对比损失定义为
其中 为温度系数。该损失促使文档上下文中的 “检索意图” 与对应问题的语义表示在嵌入空间中拉近,从而实现隐式查询与正确知识值的对齐。最终联合损失为 (默认 )。
2.3 大规模数据预处理管线
Co‑LMLM 的成功离不开自动化的语料标注流程。预处理分为三个阶段:
- 种子标注:使用 Gemini‑3.1‑Pro 对少量文档进行手工级标注,格式为
<FACT q="…" a="…">事实文本</FACT>,其中问题写成独立的搜索查询,答案尽量变换措辞以增强泛化。 - 蒸馏训练:用种子数据微调两个轻量级标注器——一个基于 ModernBERT 的事实跨度标注器(BIO 标注),以及一个基于 Qwen2.5‑1.5B 的问题生成器(只输出问答对,文档前缀被 KV 缓存复用)。两阶段设计保证了效率与忠实度,因为跨度直接标注为原文子串,避免了生成式模型可能产生的幻觉。
- 规模应用:将两个标注器运行在整个预训练语料上,将原始文档转换为 Co‑LMLM 所需的标注格式。
此管线可以高效处理从维基百科到 FineWeb‑Edu 等多种大规模语料,为模型打开了超越百科的广阔数据疆域。
3. 创新点与贡献
- 连续查询机制:放弃了关系查询和自然语言问题生成,直接用模型内部状态驱动检索,使查询可以携带任意上下文信息,不受语言表达的限制,且检索开销仅为一个前向步。
- 自由文本知识库:知识库变成非结构化的文本片段,摆脱了关系三元组对主语、谓语形式的严格约束,大大拓宽了可外化知识的类型和数量。
- 可控且可扩展的训练框架:通过对比学习和 NTP 掩码策略,让模型自然地学习 “何时检索” 和 “检索什么”,同时保留标准预训练的规模化能力。
- 数据标注处理:设计了一套高效、忠实度高的自动标注管线,支持将预训练语料无缝适配到知识外化范式。
4. 实验结果分析
论文在 SmolLM2‑135M 和 SmolLM2‑360M 架构上验证了 Co‑LMLM,并与标准语言模型、Rel‑LMLM 以及 RAG 等进行了全方位比较。知识库使用整个维基百科训练集构建,Co‑LMLM 对应的索引约有 2.4 亿条目(多于 Rel‑LMLM 的 1.45 亿),显示其更激进的外化能力。
4.1 语言建模困惑度
在简单英语维基百科测试集上,Co‑LMLM 的动态困惑度(实际检索)显著低于标准模型:135M 规模从 14.4 降至 11.8,360M 规模从 14.0 降至 10.5。更令人瞩目的是,Co‑LMLM‑360M‑FW(在 FineWeb‑Edu 上继续训练)的困惑度甚至低于训练数据多 40 倍的公开 SmolLM2‑360M 模型,表明外化知识对数据量的利用效率极高。当索引扩展到 22 亿条目后,模型在 FineWeb 测试集上依然保持低困惑度,验证了即便索引规模扩大一个量级,检索器的稳健性依然良好。
4.2 事实精度与通用能力
在 TriviaQA、PopQA、SimpleQA、T‑REx 和 FactScore 等五个基准上,Co‑LMLM 一致碾压标准基线和 Rel‑LMLM。以 360M 为例,Co‑LMLM 在 PopQA 上提升 30.3 个百分点,SimpleQA 提升 20.9 个百分点。更值得关注的是,Co‑LMLM‑360M‑FW 在 SimpleQA 上达到 21.7,与 GPT‑4o‑mini 持平,超越 Claude Sonnet 4.5。同时,知识外化并未损害自然语言理解(NLU)能力,在 CommonsenseQA、HellaSwag 等任务上表现与同尺寸标准模型相当。这表明事实知识与语言理解能力可以在预训练中有效解耦。
4.3 遗忘、效率与查询时机
通过直接删除知识库条目,Co‑LMLM 在 TOFU 遗忘测试中实现了 “训练自由” 的精准遗忘,忘却集中的知识被彻底移除,而保留集和真实世界知识不受影响;相比之下,基于梯度的 NPO 方法则显著损害了保留能力。效率方面,从隐藏态生成查询仅需约 2.2 毫秒,而解码自然语言问题的开销高达 28 毫秒(约 13 倍),凸显连续查询的低延迟优势。论文还通过 “强制查询” 实验揭示了模型有时未能及时触发检索的问题,当强制在回答前查询时,事实得分进一步提升,说明查询时机决策仍有优化空间。
5. 实践应用建议
- 知识可控大模型:Co‑LMLM 为构建可审计、可编辑的 AI 系统提供了直接路径。企业可以将内部知识文档标注后构建 KB,模型通过检索生成时天然附带知识来源,便于合规审查。
- 持续学习与领域适配:因为知识不在权重中,新增领域知识只需向索引追加新键值对,无需重新训练,极大降低了维护成本。
- 组合 RAG 的增强方案:实验表明 Co‑LMLM + RAG 可以进一步叠加效果,RAG 负责宽泛的文档上下文,Co‑LMLM 提供细粒度的、可控的事实记忆,两者互补。
- 高效推理部署:连续查询消除了显式问答生成和额外的编码器推理,适合对延迟敏感的应用场景。
6. 未来发展方向
当前工作仍以中等规模和百科类知识为主,未来有几个重要方向值得探索:
- 知识缩放定律:在更大模型和更多样化的数据(如编程、医疗、多语言)上研究外化知识的规模效应,建立类似于参数知识的新缩放规律。
- 后训练索引自适应:如何在微调甚至强化学习后,高效地适配或扩充知识库,使模型既拥有新能力又不丢失外化知识。
- 检索触发优化:改进模型自主决定何时查询的机制,减少过犹和略过的错误,或许可以通过强化学习或更精细的损失函数监督。
- 安全与隐私:利用可删除记忆的特性设计更稳健的隐私保护方案,同时研究如何防止知识库被恶意篡改或窃取。
7. 总结
Co‑LMLM 通过连续向量查询和自由文本知识库两大核心设计,优雅地突破了第一代有限记忆语言模型的关系表示瓶颈。它既保留了知识外化所固有的可解释性、可编辑性和归因能力,又在困惑度、事实精度和推理效率上实现了全面超越。其可扩展的预训练管线和对通用语料的成功适配,展示了该范式从 “概念验证” 迈向 “实用基础设施” 的潜力。随着对知识边界、检索策略和索引管理的进一步研究,Co‑LMLM 有望成为构建透明、可控且持续学习的语言模型的重要基石。