PLATE:面向几何感知持续学习的塑性可调高效适配器
PLATE: Plasticity-Tunable Efficient Adapters for Geometry-Aware Continual Learning
论文信息
标题: PLATE: Plasticity-Tunable Efficient Adapters for Geometry-Aware Continual Learning
作者: Romain Cosentino
发布日期: 2026-02-03
arXiv ID: 2602.03846v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:在大模型持续微调时,旧任务的训练数据往往不可用,如何在不访问这些数据的情况下抑制灾难性遗忘?
- 核心方法:利用预训练权重中的冗余构造可塑性可调的适配器 PLATE,通过选择冗余输出通道和限制更新到低能输入子空间来降低对旧功能的扰动。
- 关键结果:在 Qwen2.5-7B 上,PLATE 在 DeepSeek-R1 推理任务上实现与 LoRA 相当的约 13 个点的数学提升,同时将 IFEval 指令遵循能力的遗忘从约 16 点几乎降为零(见图 4)。
- 主要局限:超参数更复杂(需调节
r和τ),相比 LoRA 存在约 10–15% 的训练时间开销,且在极低参数预算下 PLATE 的可塑性可能弱于 LoRA。 - 适合读者:从事大语言模型微调、持续学习、参数高效迁移学习的工程师和研究员,尤其需要对遗忘有严格控制的场景。
论文背景和研究动机
在大模型时代,基础模型(Foundation Models)通常首先在庞大的、不透明的数据上预训练,然后针对下游任务进行监督微调或指令微调。如果对每个新任务都全参数微调,不仅计算代价高昂,还会严重侵蚀模型的通用能力,如事实知识、推理或指令遵循。参数高效微调(PEFT)方法,如 LoRA,通过仅更新少量参数来缓解计算问题,但在持续学习场景下,即使是小规模的更新仍可能造成明显的灾难性遗忘——模型对旧数据或旧能力的表现急剧下降。这在大模型落地时尤为棘手,因为预训练数据往往不可用(商业机密或规模过大),无法像经典持续学习方法那样通过重放或约束梯度来保护旧任务。
PLATE 的作者观察到:预训练神经网络中存在显著的几何冗余,大量神经元实现高度相似的特征,权重向量间存在强共线性。这种冗余提供了两个可利用的机会:(i)冗余神经元可作为旧任务特征方向的权重代理,从而直接从冻结权重中构造近似保护子空间;(ii)将可塑性集中在冗余通道上,能使更新偏向对旧数据分布改变较小的方向。这些洞察促成了 PLATE,一种完全无需旧任务数据的、内置可塑性-保留权衡控制的结构化适配器。
核心方法和技术细节
PLATE 以一个层级的结构化低秩更新为基础,形式为:
其中 和 在训练前根据冻结权重一次性计算并固定,只有 是可训练的参数矩阵。其设计服务于两个目标:限制可塑性分布和约束更新方向。
-
构造冗余输出选择器 依据预训练权重的冗余性,PLATE 识别出在许多其他神经元中高度共线的 “冗余” 输出通道。具体做法是:对每个输出神经元权重 和随机投影矩阵计算余弦相似度得分 (公式 3),并选择得分最高的 个神经元。这些冗余神经元方向对模型输出的影响更小,集中可塑性于其上能降低对旧功能漂移的风险。 即为对应索引的标准基向量组成的列选择矩阵。
-
构造权重的低能输入基 在冻结部分权重的 Gram 矩阵 上,利用随机 Hadamard 变换和探针方法快速求解其底部特征空间(低能量方向)。低能量意味着对应的输入方向几乎不激活冻结神经元,即与旧任务的主要特征方向正交。 作为该低能子空间的正交基,将更新限制在这些方向,从而抑制对旧数据的第一阶输出漂移。
-
可塑性-保留权衡的两个旋钮
- :可训练输出神经元数量,控制模型学习新任务的能力(可塑性预算)。增大 通常提高新任务表现,但可能增加遗忘。
- :输入能量阈值,决定低能子空间的维度 。 越大, 越小,输入约束越严格,遗忘更少,但可塑性可能降低。在实践中, 是更主要的遗忘控制旋钮,而 提供细调节。
通过这两个冻住的矩阵,PLATE 在仅训练 矩阵的情况下,实现了对可塑性和遗忘的显式控制,且适配器的可训练参数为 ,不再像 LoRA 那样随隐藏维度 线性增长,有利于大规模模型的计算效率。
创新点和贡献
-
完全的 “无数据” 持续学习框架 PLATE 在任何环节都不需要访问旧任务的数据或特征,也无需存储任何历史样本或梯度。它仅从冻结的预训练权重中推导出保护子空间和可塑性通道,这使得它极其适用于预训练数据不可得的大模型场景。
-
将功能性漂移作为遗忘的几何控制目标 理论部分证明了任意近似保护子空间都会保留一个非零的遗忘下限(定理 1),而第一阶输出漂移 对最坏情况遗忘有直接的上界控制(定理 2)。PLATE 的设计正是通过冗余通道和低能输入子空间来压缩 ,从而在原理上将遗忘与更新族几何相连。
-
与 LoRA 相当的效率且更优的遗忘-学习权衡 PLATE 在可控基准和大模型微调中均显示出远低于 LoRA 的遗忘,同时保持相近的新任务学习能力,并且提供 和 两个可解释的旋钮来导航遗忘-保留谱系。
实验结果分析
实验覆盖了异业场景:LLM 的分布外遗忘(如 Qwen2.5-7B → DeepSeek-R1 推理,OLMo-2-7B → Tulu-3 混合)和可控的标准持续学习基准(MNIST、AG News、回归合成任务)。
- Qwen2.5-7B:PLATE(r=256)在 AIME、GSM8K、MATH-500 上获得与 LoRA(r=32)约同等的数学提升,但 LoRA 导致 IFEval 下降约 16 点,PLATE 几乎无遗忘(图 4)。
- OLMo-2-7B:随着可训练参数比例增加,PLATE 的 IFEval 线性改善而 MATH 遗忘几乎保持不变,LoRA 则迅速饱和且遗忘持续增加(图 5)。
- MNIST 0-4 → 5-9:在仅 10.2% 可训练参数下,PLATE 的新任务准确率 98.28%、旧任务保留 97.45%,比 LoRA 的遗忘降低 4 倍以上(图 8 上)。
- AG News → IMDB:LoRA 遗忘随秩增长,而 PLATE 所有配置的遗忘均低于 0.5%(图 8 下)。
- 合成回归:随着任务相异性增大,PLATE 的遗忘保持在一个数量级更低的水平,而全微调和 LoRA 遗忘近乎线性增长(图 7)。
计算效率方面,PLATE 由于仅训练 ,参数和优化器状态更少,峰值 GPU 内存低于 LoRA,但存在约 10–15% 的训练时间开销,主要来自 的额外投影计算(图 9)。
实践建议
对于需要将 LLM 适配到新任务、同时必须保留原有能力的工程场景,PLATE 提供了切实可行的控制方案:
-
以 为主要杠杆 在调参时,优先扫描 (建议 32–256),固定 于 0.8–0.9。 控制可塑性广度,对遗忘影响显著;如果需要进一步降低遗忘,再逐渐提高 (例如 0.95 或 0.98)来收紧输入约束。观察任务留存的 OOD 基准(如 IFEval)来校准。
-
利用 PLATE 的低参数量优势 PLATE 的可训练参数为 ,不与隐藏维 直接挂钩。因此,即使 较大,总参数量仍可能少于等秩的 LoRA,且优化器状态占用更少,适宜部署在内存受限的推理或继续训练环境中。
-
规避全参数微调的遗忘风险 对于需要不断迭代微调的生产系统,可设计 “一次预处理 + 多次微调” 流水线:仅需在最开始生成 和 (算法 1),后续每个新任务只需初始化 并训练即可,无需重跑任何预处理,且每次都能保持良好的旧任务保留。
-
谨慎选择适配层 在 LLM 上,经验表明对所有线性层(含注意力投影和 MLP)施加 PLATE 可获得最佳的遗忘-学习平衡;若资源有限,可优先对 MLP 层施加,注意力层保留 LoRA 或冻结,以在计算开销与保护能力之间折中。
-
监控 OOD 遗忘指标 因为预训练分布未知,务必在微调后使用多个 OOD 基准(例如 MMLU、HellaSwag、IFEval 等)检验通用能力是否退化,而不仅仅看新任务指标。若发现遗忘增加,立即调整 增大或 减小进行修正。
通过将遗忘问题几何化为更新方向与旧任务特征的对齐程度,PLATE 提供了一种无数据且计算可控的方法,使得大模型的持续性知识注入成为可能,而无须担心灾难性遗忘损害已有的核心竞争力。