LACUNA:一个评估大语言模型遗忘中定位精度的测试平台

arXiv: 2607.02513v1

论文信息

标题: LACUNA: A Testbed for Evaluating Localization Precision for LLM Unlearning

作者: Matteo Boglioni, Thibault Rousset, Siva Reddy, et al.

发布日期: 2026-07-02

arXiv ID: 2607.02513v1

PDF 链接: 下载 PDF

背景与研究动机

大型语言模型(LLM)在训练过程中会不可避免地记忆敏感数据,尤其是个人可识别信息(PII),这带来了严重的隐私风险。一旦攻击者通过成员推断攻击或重构攻击提取出这些记忆内容,就可能造成数据泄露。传统做法是对训练数据进行清洗后重新训练模型,但在当前百亿甚至千亿参数规模下,重训成本极其高昂。因此,机器遗忘(machine unlearning) 作为一种折中方案受到广泛关注:它试图直接在已训练的模型中抹除特定知识,使模型不再生成相关输出,同时尽可能保留模型的一般能力。

当前主流的遗忘方法大致分为两类:基于梯度的方法直接通过目标函数修改权重,代表如 SimNPO;先定位再移除的方法(localize-first, remove-second)则试图先识别出存储目标知识的神经网络组件,再对其实施编辑,例如 AlphaEdit 和 MemFlex。这两种范式都取得了一定的输出层面的成功,但一个根本问题始终未被回答:遗忘到底是真的从模型参数中擦除了知识,还是仅仅 “混淆” 了输出,使得知识暂时隐藏? 已有研究表明,通过精心设计的重浮现攻击(resurfacing attacks),很多已被 “遗忘” 的信息可以被重新激发,这意味着之前的方法可能只是表面上的遗忘,远未实现真正的参数级擦除。

这一困境的根源在于缺乏参数级定位的真值(ground-truth):我们无法确知一段特定知识到底存储在模型的哪些权重中。现存的知识归因方法(如因果追踪)虽能给出相关性判断,但无法提供独立验证,容易陷入循环论证。而本次介绍的 LACUNA 测试平台,正是为了打破这一僵局而设计。它通过一种精巧的掩码持续预训练策略,将合成人物的 PII 注入到模型的预定义参数中,从而首次为遗忘的定位精度提供了可量化的评价基准。

核心方法与技术细节

LACUNA 的构建主要分为三个步骤:数据准备、掩码训练和评估体系设计。

合成 PII 注入与掩码持续预训练

研究人员从 Panorama 语料库中选取了 1,200 个合成人物档案,每个档案包含邮箱、出生城市、电话号码、驾驶证号码等多种 PII 字段,并配合大量 QA 对来强化模型对信息的关联提取能力。这些数据被分成六个互不重叠的组,每一组对应一个参数掩码:掩码是一个二值矩阵,标记了模型中 5% 的权重(仅限注意力层和前馈层,不包括归一化层和嵌入矩阵),并且六个掩码之间无重叠。训练时,如果当前样本属于某个 PII 组,就只对该组对应的掩码内的权重计算梯度并更新,其余权重冻结;对于普通文本,则所有权重正常更新。这样就实现了知识存储位置的人为指定:不同组的 PII 被隔离在不同的参数子集中。

这种设计具有极高的精细度——掩码是逐参数(per-parameter)而非逐组件(per-component)的。为了在 7B 规模的模型上高效实现,作者将多个掩码打包进 32 位整数的不同比特位,一个参数用一个 32 位值承载最多 32 个掩码的身份,从而在分布式训练(DDP/FSDP)中没有额外内存开销。训练完成后,模型继续使用 LoRA 进行指令微调,使其能通过问答格式泄露记忆信息。

遗忘与保留集的划分

通过对训练后模型的记忆提取率分析,研究者筛选出能被成功提取的档案,并从中选取 200 个档案用于遗忘(forget set)、200 个用于保留(retain set)。关键在于,遗忘档案对应的掩码与保留档案对应的掩码是完全不相交的参数组,这就保证了评估定位精度时的非混淆性。此外,每个字段(邮箱、出生城市等)的遗忘和保留采用交叉字段策略,即遗忘某一字段时保留另一字段,防止任务过于简单。

输出层与参数层的双重评估指标

LACUNA 的评估体系包含两个维度:

  • 输出层指标:沿用 Exact Memorization (EM)、Extraction Strength (ES) 和生成概率(Prob)来衡量模型是否不再产生目标输出,并在改写提示(paraphrase)上测试泛化性。
  • 定位精度指标:这是论文的核心贡献。对模型未遗忘前的注入权重 θinj\boldsymbol{\theta}_{\text{inj}} 和遗忘后的权重 θunl\boldsymbol{\theta}_{\text{unl}},计算每个参数的改变量 Δunl|\Delta_{\text{unl}}| 等特征,以遗忘掩码为真值标签,使用 ROC AUC 评价该改变对 “掩码内/外” 参数的区分能力。AUC=0.5 表示完全随机修改,越接近 1.0 表示修改越集中于目标存储位置。作者还设计了三种特征族(幅度型、逆转型、对比型)和一个复合逻辑回归评分,取最优 AUC 作为每种方法的定位得分。

实验结果分析

遗忘输出性能:SimNPO 显优势,但定位普遍失败

在 OLMo2 1B 和 OLMo3 7B 模型上对四个 PII 字段的实验中,SimNPO 在遗忘集中取得了最低的泄露率,保留效果也维持得较好,但会带来轻微的一般能力下降。定位型方法 AlphaEdit 和 MemFlex 的遗忘力度不足,甚至出现遗忘和保留同步下降的现象。然而,在定位精度这一维度上,所有现有方法的 AUC 几乎全部徘徊在 0.500 左右,最好的 SimNPO 也仅有 0.515~0.522,这说明它们对权重的修改几乎是随机的,完全没有集中到真正存储知识的参数上。这一发现强烈暗示了现有遗忘方法的潜在脆弱性:输出层面看似 “遗忘” 了,实质只是通过某种不可靠的方式掩盖了知识。

OracleGrad 揭示精准定位的威力

作为对比,作者构造了一个先知型方法 OracleGrad,它直接拿到真实忘记掩码,并只在掩码参数上应用简单的 Gradient Difference(对遗忘集执行梯度上升,保留集梯度下降)。结果显示,OracleGrad 不仅在遗忘和保留之间取得了最佳平衡,且定位 AUC 高达 0.91 以上。更重要的是,在重浮现攻击下(用已遗忘但未参与训练集的其他 PII 数据微调模型),OracleGrad 泄露出的遗忘档案数量最少,且与 SimNPO 泄露的档案存在高度重叠,表明那些特别 “顽固” 的数据点本身就是难点,而与具体方法关系不大。

重浮现攻击:定位精度与鲁棒性正相关

实验表明,AlphaEdit 和 MemFlex 极易被重新唤起记忆,SimNPO 虽稍好但仍能被恢复部分数据,而 OracleGrad 则展现出最强的抗重浮现能力。这种趋势验证了一个核心假设:参数级的精准擦除才是真正鲁棒的遗忘,输出层面的混淆可以被后续训练步骤轻易逆转。

创新点与实践应用建议

LACUNA 的首创性在于它首次为 LLM 遗忘的定位精度提供了可操作的真值。其主要贡献可归纳为:

  1. 可扩展的掩码注入方法:能支持到 7B 参数模型,且无需跨掩码的内存膨胀,为后续知识存储研究奠定了工程基础。
  2. 双重评估范式的建立:将参数级定位纳入遗忘评价,弥补了仅靠行为测试的不足。
  3. 对现有方法的客观诊断:实证表明,最前沿的遗忘方法在定位能力上几乎等同于随机猜测,促使社区重新审视遗忘的本质。
  4. 先知实验的启示:证明即便使用简单的梯度操作,只要定位足够精准,遗忘效果和鲁棒性就能远超复杂算法。

基于这些发现,论文向工业界和学术界提供了几条实践建议:

  • 研发新一代遗忘方法时,必须将参数定位能力作为核心设计目标,而不是仅追求输出指标。可以探索更精确的知识定位算法,例如结合稀疏建模或模块化网络设计。
  • 如果出于合规需求必须使用真实敏感数据训练模型,不妨借鉴 LACUNA 的思想,主动将敏感数据的存储限制在少数可控的参数组中,从而降低后续遗忘的难度和风险。
  • 应当将重浮现攻击纳入遗忘方法的常规安全测试,因为它是检验知识是否被真正擦除的试金石。
  • 提倡更加开放的基准和测试平台:LACUNA 已经开源,包含 1B 和 7B 模型、遗忘/保留集和掩码,未来可扩展更多模型架构和数据类型。

总结与展望

LACUNA 的出现无疑是机器遗忘领域从 “行为主义” 走向 “结构主义” 的关键一步。它用扎实的实验告诉我们,模型可能只是在表演遗忘,而真实的遗忘要求我们直接触及记忆的物理载体——参数。OracleGrad 的出色表现既是一盏明灯,也是一种警示:倘若我们连知识存于何处都无法精准定位,再精巧的数学技巧也难以保证隐私的安全。

未来,该方向可沿以下几个维度拓展:一是将掩码注入扩展到更大规模(如 70B 模型)和更复杂的知识类型,检验定位精度与模型容量的关系;二是开发无需掩码监督的定位方法,通过对遗忘前后表征变化的对比自动发现 “记忆热点”;三是耦合遗忘与模型编辑技术,实现可解释且持续的遗忘;四是建立法律与技术的桥梁,推动参数级遗忘成为数据保护合规的技术手段之一。LACUNA 已为我们准备了坚实的地基,真正的知识擦除时代或许才刚刚开始。