PEFT-Arena:从稳定性-可塑性视角理解参数高效微调

PEFT-Arena: Understanding Parameter-Efficient Finetuning from a Stability-Plasticity Perspective

arXiv: 2605.28819v1

论文信息

标题: PEFT-Arena: Understanding Parameter-Efficient Finetuning from a Stability-Plasticity Perspective

作者: Yangyi Huang, Ruotian Peng, Zeju Qiu, et al.

发布日期: 2026-05-27

arXiv ID: 2605.28819v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:如何从稳定性(保留预训练通用能力)与可塑性(学习下游任务)的权衡视角,全面评估参数高效微调(PEFT)方法的真实效果,而非仅关注下游准确率。
  • 核心方法:构建 PEFT-Arena 基准,联合测量下游任务表现与通用能力保留;从权重空间和激活空间的几何视角分析不同 PEFT 方法如何内部重塑模型;利用插值作为路径诊断工具,揭示微调动态过程中的 “过冲” 现象。
  • 关键结果:在可比的参数预算下,正交微调(OFT)达到了最有利的稳定性-可塑性帕累托前沿。例如,OFT-b32 在数学任务上提升 11.63 个百分点,通用能力仅下降 2.60 个百分点,而同等参数量的 LoRA 提升 7.17 个百分点时,通用能力下降 7.75 个百分点(表 1)。
  • 主要局限:基准目前仅覆盖数学和医学两个推理导向的领域,且通用能力评估主要基于英文基准;内部分析为实证诊断而非完整的因果遗忘理论;插值分析主要用于诊断,而非直接的优化技术。
  • 适合读者:从事大语言模型微调、持续学习、模型可解释性研究的工程师和研究人员,特别是那些关注微调后模型综合性能衰减问题的从业者。

论文背景和研究动机

参数高效微调(PEFT)已成为适配大型基础模型的主流范式。通过仅更新极小部分参数,PEFT 使得以低成本将模型部署到多样化下游领域成为可能。然而,当前评估 PEFT 方法的准则存在严重偏颇:业界习惯于用单一的下游任务准确率作为黄金标准,却系统性地忽略了模型在适配过程中丧失的预训练能力。

一个尖锐的提问足以揭示该范式的脆弱性:如果一种方法显著提升了数学推理能力,却以同等幅度破坏了模型的指令遵循、事实回忆和通用推理能力,这究竟是适配了模型,还是毁掉了模型?这恰恰是稳定性-可塑性困境所刻画的核心矛盾。因此,真正的问题不是 “模型学到了多少”,而是 “相对于遗忘的量,它学到了多少”。

该论文正是以此为出发点,试图回答一个本质问题:哪一种 PEFT 方法能产生最有利的稳定性-可塑性权衡? 为此,研究者构建了 PEFT-Arena 基准,在数学和医学两个挑战性推理领域,系统性评估了多种主流 PEFT 方法,并首次从权重空间和激活空间的几何视角揭示了外部性能退化与内部表征变化之间的关联。

核心方法和技术细节

PEFT-Arena 基准沿两条轴评估方法:(i)目标领域表现,作为可塑性的代理指标;(ii)通用能力保留,作为稳定性的代理指标。实验在 Qwen2.5-7B 和 Llama3.2-3B-Instruct 两个不同规模和配置的基座模型上进行,覆盖了有监督微调(SFT)和基于可验证奖励的强化学习(RLVR)两种后训练设置。

研究者测试了全面的 PEFT 基线,包括:加法类 LoRA 家族(LoRA、AdaLoRA、DoRA、PiSSA、MiLoRA、MiSS、VeRA、KeepLoRA)、乘法类正交微调(OFT)以及基于激活缩放的 IA³。为保证公平,论文在 “相似可训练参数量” 的分组下进行方法比较,而非简单使用单一配置。

除了外部的性能评分,论文深入分析了 PEFT 更新如何从内部重塑模型,涉及两个互补视角:

权重空间几何。该方法将预训练权重矩阵进行奇异值分解后,从两个剖面刻画微调更新:

  • 保留剖面:测量微调后的权重在预训练奇异向量对角线上的投影偏差,偏差越大,意味着对支持通用能力的主方向扰动越强。
  • 适应剖面:将更新能量投影到预训练输入方向,观察不同参数化方法如何分配更新能量。

激活空间几何。论文使用通用评估数据上的表征,通过三个互补指标量化微调带来的表征失真:

  • 普氏残差:测量去除最优正交旋转后基座模型与微调模型激活值之间的残余差异,用于检测非等距失真。
  • 线性 CKA:通过中心化 Gram 矩阵衡量表征相似度。
  • 成对 Gram 失真:比较样本间余弦相似度结构的改变。

最后,论文将权重插值作为路径诊断工具。通过从基座模型到微调模型插值(即 W(α)=W₀ + α·ΔW),可以显式地扫描稳定性-可塑性曲线,揭示最终检查点是否 “冲过” 了最佳的保留-适应平衡点。对于 OFT,作者特别强调须使用参数感知的插值路径(缩放 Cayley 生成器),而非简单的稠密权重插值。

关键发现与实验结果分析

SFT 与 RLVR 的权衡模式迥异。在 SFT 下,所有方法均表现出清晰的稳定性-可塑性权衡:Full FT 获得最大任务增益,但也造成最严重的遗忘。例如在 Qwen2.5-7B 数学 SFT 中,Full FT 将数学准确率从 35.30% 提升至 50.63%,但通用能力从 46.97% 骤降至 34.22%(表 1)。相比之下,RLVR(GRPO)表现出质的不同:OFT-b32 在数学任务上提升 12.60 个百分点的同时,通用能力不仅未降反而微增 1.93 个百分点(表 1)。

OFT 位于最有利的帕累托前沿。在相近参数量下,OFT 展现出最佳的适应性-保留性平衡。在 Qwen 约 20M 参数组中,OFT-b32 以 17.55M 参数实现了数学任务 +11.63 的提升和通用能力 -2.60 的轻微下降,而 LoRA-r8(20.19M 参数)在同任务上仅提升 +7.17 却付出了 -7.75 的通用能力代价(表 1)。这表明乘法正交参数化中固有的谱保留属性对维持通用能力至关重要。

遗忘与激活空间非等距失真强相关。论文发现,通用数据上的普氏残差与遗忘程度之间存在显著正相关(Pearson r=0.711),而 CKA 相似度则与遗忘呈负相关(Pearson r=-0.761)。OFT 在激活空间展现出更低的非等距失真(普氏残差 0.1279,对比 Full FT 0.1640、LoRA 0.1808)和更高的 CKA 相似度(0.9340),这意味着它不仅保留了权重的谱结构,更在功能层面维持了对通用能力至关重要的表征几何(表 4)。

SFT 检查点普遍存在 “过冲” 现象。通过 α-插值扫描发现,最终 SFT 检查点常常并非最佳的保留-适应操作点。在一定范围内减小更新强度(如 α=0.3),可以在几乎不损失任务增益的前提下显著恢复通用能力。以 OFT-b32 为例,其 Cayley 路径下 α=0.3 时可达到 45.77 的数学分和 48.64 的通用分,远优于最终检查点(46.93 数学 / 44.37 通用)。

实践建议

基于论文的发现和分析,为从事大模型微调的工程师和团队提供以下实践建议:

1. 评估微调效果时引入遗忘度量。不应仅凭下游任务准确率判断 PEFT 方法优劣。至少应监控模型在指令遵循、事实问答、通用推理等基准上的退化程度(该论文使用 IFEval、Natural Questions、BBH)。当发现目标增益伴随几乎同等幅度的通用能力损失时,实际上并未实现有意义的适配。

2. 将 OFT 作为高稳定性需求的默认选择。当应用场景要求微调后模型必须保持广泛的通用能力(如面向 C 端用户的产品、需要与用户安全交互的对话系统),乘法正交参数化(OFT)提供了目前最强的前沿。即使在低参数预算下,其稳定边界也优于同等配置的 LoRA 变体。

3. 对最终检查点进行 “路径回退” 检验。在 SFT 微调完成后,不要简单地使用最终检查点。沿更新方向进行插值扫描(对于加法方法,缩放 ΔW;对于 OFT,缩放 Cayley 生成器),寻找既能保留大部分任务增益、又能明显恢复通用能力的 α 值。论文的案例研究表明,这一简单的后处理步骤无需额外训练即可提升模型的整体质量。

4. 关注更新在不同层之间的不平衡性。论文发现 OFT 更新在深层网络中往往强度不均衡。实践中,可尝试对上层的更新幅度进行不同程度的控制(如以浅层平均更新强度为参考进行缩放),以更精细地平衡各层的适应性与稳定性。这一思路不仅适用于 OFT,对 LoRA 等方法也具有参考价值。

5. 审慎使用基于 SVD 初始化的方法。PiSSA 等通过初始化策略将更新限制在特定子空间的方法,虽然在特定场景下可能有效,但在本基准中表现出极不稳定的行为(PiSSA-r8 数学增益 9.23 但通用能力下降 22.19),该现象与它对主奇异分量的强力扰动有关。在生产环境中采用此类方法前,必须进行全面且严格的多维度评估。