Hubble:一套推动大语言模型记忆现象研究的模型套件

Hubble: a Model Suite to Advance the Study of LLM Memorization

arXiv: 2510.19811v1

论文信息

标题: Hubble: a Model Suite to Advance the Study of LLM Memorization

作者: Johnny Tian-Zheng Wei, Ameya Godbole, Mohammad Aflah Khan, et al.

发布日期: 2025-10-22

arXiv ID: 2510.19811v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:大语言模型(LLM)的记忆行为缺乏系统可控的研究工具,难以定量分析敏感数据在预训练中如何被记住、遗忘或被推断。
  • 核心方法:构建一套完全开源的模型套件 Hubble,包含标准模型与扰动模型,后者在预训练中按不同频率、阶段插入控制文本(如书籍片段、传记、测试集),以模拟记忆风险场景。
  • 关键结果:敏感数据的记忆强度由其在训练语料中的相对频率决定——同一密码在较小语料中出现一次比在较大语料中出现一次更容易被模型记忆。
  • 主要局限:扰动模型中的插入文本均为已知内容,无法覆盖真实世界中数据泄露的未知模式;且模型规模与训练数据量固定于少数配置,结论的普适性仍待扩展。
  • 适合读者:关注 LLM 隐私安全、数据遗忘与成员推断的研究者,以及需要评估自研模型记忆风险的工程师。

论文背景和研究动机

随着大语言模型在各类任务中广泛应用,其训练数据中可能无意包含的隐私信息(如电子邮件、电话号码、密码)带来的记忆风险引起了广泛关注。已有工作表明,LLM 会在一定程度上逐字记住训练样本,并可能在特定查询下泄露这些敏感内容。然而,对这一问题的科学理解仍受到工具匮乏的限制——多数研究只能在公开的黑盒模型或不可控的预训练流程上进行观察,难以分离变量、重复实验。学界缺乏一套完全透明、可任意干预的模型套件,以系统性地研究 “模型记住了什么”“何时记住”“为什么会忘记” 等基础问题。

正是为了填补这一空白,作者提出了 Hubble。该名称既暗示对记忆现象的精细 “观测”,也意喻模型套件像望远镜一样扩展研究的视野。Hubble 的核心目标是提供一个可控的实验平台,使研究者能够精确测量在给定训练分布和数据顺序下,模型对特定内容的记忆程度,并测试各种缓解策略(如数据稀释、重新排序)的实际效果。此外,论文还希望通过这一工具促进成员推断攻击和机器遗忘等方向的研究,建立一套可复现、可比较的基准。

核心方法和技术细节

Hubble 的设计遵循 “可控干预” 的原则,所有模型均基于相同的架构和训练流程,区别仅在于训练数据中是否有系统插入的特定文本。其发布的核心资产包括两类模型:

  • 标准模型(standard models):仅在大型英文语料上预训练,不引入任何人为插入的敏感内容,用作比较基线。
  • 扰动模型(perturbed models):在标准预训练语料的相同位置上,额外插入一组精心设计的文本。这些文本模拟了现实中可能被记忆的高风险内容,涵盖书籍章节、人物传记(包含邮箱、地址、电话等个人信息)以及标准测试集片段(如编程题库的部分答案)。

模型规模囊括 1B 和 8B 参数,训练 token 量分为 100B 和 500B,共发布 8 个模型(4 个标准、4 个扰动),以此探究模型容量和训练数据量对记忆行为的影响。为了考察暴露时序的作用,作者还额外提供 6 个扰动模型,它们在预训练的不同阶段(早期、中期、晚期)插入敏感文本,并在插入后的后续训练中不再重复这些文本,以模拟 “仅短期暴露” 的场景。

记忆程度的衡量并非通过模型直接输出完整密码,而是采用一系列已被社区接受的度量指标,例如对插入文本中特定字符串的可提取性(extractability)和似然度。论文未公开具体的度量公式,但强调所有评测代码与数据均已开源,供研究者自行复现和扩展。值得注意的是,所有插入文本的放置位置、重复次数、删除策略等变量都被严格记录,使得实验完全可回溯。这种 “污染-修复” 的范式让研究者能像在实验室中控制变量一样,分离不同因素的影响。

创新点和贡献

Hubble 的创新性首先体现在其作为首个专门为 LLM 记忆研究设计的全开源、多分支模型套件。与以往依赖事后分析或仅检查单个黑盒模型的工作不同,Hubble 通过预注册式干预,建立了因果推断的基础。研究者不再只能追问 “这个模型是否记住了某段文本”,而是可以回答 “如果将某段文本以特定频率放入训练集的特定位置,它将被如何回忆、何时会被遗忘”。

其次,Hubble 系统地揭示了数据频率与模型大小对记忆风险的交互影响。在标准实验中,模型在 100B token 上预训练时,出现一次的密码能够被可靠提取;但在 500B token 上训练时,相同频率的密码记忆显著减弱。这一结论直接转化为实践指导:通过增大语料库稀释敏感数据。这个发现虽直观,却是首次在完全控制的条件下被定量验证。

第三个贡献是提供了敏感数据插入时序的实验证据。仅出现在训练早期的文本如果不再以任何形式重复,其记忆会逐渐消退,这提示将不可删除的敏感数据安排在预训练早期可能降低长期记忆风险。此结论为数据审计和遗忘策略提供了新的视角。

最后,Hubble 作为公共测试平台,极大地降低了相关研究的准入门槛。研究者无需自己训练多个大规模模型,即可直接利用现有的标准与扰动模型研究记忆提取、成员推断攻击、机器遗忘等。论文特别指出,由于插入文本是随机打散的,攻击者无法事先知晓扰动位置,因此 Hubble 是评估成员推断算法公平性和有效性的理想基准。

实验结果分析

论文中描述的核心实验分为两大块:数据频率与记忆强度的关系,以及插入时序对遗忘的影响。

在频率实验中,作者对比了 1B 和 8B 参数模型在 100B 与 500B token 设置下的表现。结果一致显示,控制相同插入次数,当总语料规模更大时,模型对被插入文本的逐字记忆率明显更低。例如,同一密码在 100B token 训练中出现一次后,被模型输出的概率更高(见论文关于 extractability 的图示描述),而在 500B token 场景下该概率大幅下降。这一趋势表明记忆风险本质上是相对频率的函数,而非绝对出现次数。论文未给出具体数字,但这一趋势在所有测试文本类型(传记、书籍片段、测试集)中保持一致。

时序实验则分析了 6 个仅在某一个训练阶段插入敏感文本的模型。数据显示,若敏感内容只在预训练早期出现且后续不再参与训练,随着训练继续,模型对这些内容的记忆逐渐模糊,提取难度上升;反之,若敏感内容出现在预训练后期,模型此时已经具备了较强的记忆能力,被记住的风险更高。这说明 “训练后期” 是记忆的高危窗口,而早期暴露配合后续覆盖可以促进遗忘。

另外,通过对传记文本的细粒度分析,论文发现不同类型的信息记忆难易度不同。例如,姓名和电子邮件地址比电话号码更容易被完整记住,可能与它们的语义连贯性和语言模式的重复度有关。论文以此展示了 Hubble 如何支持细致的记忆特性研究。

实践建议

基于 Hubble 所揭示的规律,从事 LLM 训练和安全工作的团队可以采取以下实践措施:

  1. 语料规模稀释策略 对于不可避免含有少量个人信息的训练集(如公开网页文本),在资源允许的前提下,应尽可能增大高质量非敏感语料的规模。将敏感内容的相对出现频率压缩到极低水平,可以显著降低模型逐字泄露的风险。此处 “稀释” 不是指简单复制非敏感数据,而是引入更多样化的自然文本,使偶然出现的电话号码或邮箱在总体训练 token 中的占比远低于模型的记忆阈值。

  2. 训练数据排序与阶段管理 如果训练过程中不得不包含某些后期会被审计或要求删除的特定文档,可以将这些文档集中放在预训练的早期阶段,并确保在整个训练后续环节不再重复使用。Hubble 的证据表明,早期插入且无后续强化的内容会逐渐被后续海量数据所 “覆盖”,导致记忆度下降。注意,这一策略并非让模型 “安全遗忘” 的通用解,但它是一种低成本、易实施的风险缓解手段。

  3. 利用 Hubble 模型评估防护机制 安全团队可以将 Hubble 的扰动模型作为现成的红队测试工具,检验自行开发的去隐私化、机器遗忘或成员推断防御算法的有效性。例如,可以先在标准模型上测试攻击方法的基线性能,再切换到对应扰动模型验证攻击是否能准确发现插入文本,从而评价自身防御的强度。Hubble 提供的确定性插入也使得评测结果可在不同团队之间复现和比较。

  4. 差异化敏感信息保护 传记文本分析提示,个人信息中的姓名和邮箱可能比电话号码更容易被模型整体捕获。实践中,数据清洗流水线应对不同类型的标识符采取不同粒度的处理:对高度结构化的号码可依赖模式匹配去除;而对语义嵌入较强的字段,可能需要结合命名实体识别与上下文替换,避免单一策略留下记忆缺口。

Hubble 作为一个研究型工具,其设计参数相对有限,直接应用于生产还需扩展模型规模和更多数据分布。但这些发现为构建更安全的 LLM 训练管线提供了可操作的起点。