进化策略导致大型语言模型的灾难性遗忘

Evolutionary Strategies lead to Catastrophic Forgetting in LLMs

arXiv: 2601.20861v1

论文信息

标题: Evolutionary Strategies lead to Catastrophic Forgetting in LLMs

作者: Immanuel Abdi, Akshat Gupta, Micah Mok, et al.

发布日期: 2026-01-28

arXiv ID: 2601.20861v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:本文探讨进化策略(Evolutionary Strategies, ES)在微调大语言模型时是否会导致对原有能力的灾难性遗忘,以及其背后的原因。
  • 核心方法:将进化策略(ES)与主流的组相对策略优化算法(GRPO)进行对比,在多个数学推理任务上微调模型,并从遗忘曲线、参数更新范数及稀疏性三个维度进行系统分析。
  • 关键结果:ES 虽能达到接近 GRPO 的任务表现,但会在训练中造成严重的灾难性遗忘。其参数更新的 Frobenius 范数是 GRPO 的1000 倍以上(见论文图 3),且更新极其稠密,导致模型偏离初始权重。
  • 主要局限:ES 的更新存在固有的高方差;论文仅通过微调一个任务并评估一个旧任务来衡量遗忘程度,未能全面反映模型在多任务场景下的能力退化。
  • 适合读者:对 LLM 持续学习、模型微调、以及无梯度优化算法感兴趣的机器学习研究者和工程师。

论文背景和研究动机

当前最先进的大语言模型(LLMs)通常在训练完成后被静态部署,缺乏在部署后持续学习新知识的能力。实现这种持续学习系统面临诸多挑战,其中核心难点在于,主流的微调方法(如 SFT、RLHF、DPO、GRPO)均为基于梯度的算法。这些方法需要存储梯度、优化器状态或中间激活值,导致巨大的内存开销,在部署环境中成本高昂。

进化策略(Evolutionary Strategies, ES)作为一种无梯度的替代方案,近年来重新受到关注。它通过种群级别的扰动而非反向传播来估计参数更新,可显著降低内存需求。近期有研究表明,ES 在特定任务上能达到与 GRPO 相当的性能,被视为实现 LLM 持续学习的一种潜在方案。然而,此前的研究未充分评估 ES 在持续学习中最关键的问题:在学习新任务时,它在多大程度上保留模型的原有能力? 本文即针对这一空白,对 ES 用于 LLM 微调时的灾难性遗忘现象进行了全面的实证分析。

核心方法和技术细节

本文的核心方法是围绕 ES 与 GRPO 两种微调算法,设计了一系列对比实验,具体包括:

  1. 算法对比: 选择 Qwen2.5-1.5B-Instruct 和 Llama-3.2-1B-Instruct 两个模型,在 Countdown、GSM8K、MATH 和 OlympiadBench 四个数学与推理基准上分别使用 ES 和 GRPO 进行微调,并控制训练样本数(200 个)、批次大小和 rollout 数量等关键变量保持一致。

  2. 遗忘评估: 在 Countdown 任务上持续微调 Qwen2.5-1.5B-Instruct 模型,同时定期在新的评估任务(Countdown)和反映旧有能力的任务(HellaSwag)上测量准确率。这种做法构建了一个 “新任务-旧任务” 的帕累托前沿,直观展示性能权衡。

  3. 更新机制分析: 为了探究遗忘的成因,论文从两个角度分析模型的参数更新:

    • 更新范数: 计算不同检查点相对于基座模型的参数更新矩阵的 Frobenius 范数,来衡量模型参数的偏移量。
    • 更新稀疏性: 参照先前工作,将稀疏性定义为更新矩阵中绝对值低于阈值(τ=10−6\tau = 10^{-6})的元素百分比。该值越高,意味着更新只集中在少数参数上,对模型的干扰越小。分析按模型的不同架构组件(如 Q、K、V 投影,MLP 层等)分层进行。

创新点和贡献

本文的主要贡献是从持续学习的角度,揭示了进化策略(ES)微调 LLM 的一个关键缺陷:

  1. 发现并量化了灾难性遗忘: 论文首次明确指出,尽管 ES 在性能上可以接近 SOTA 算法 GRPO,但它会伴随着严重的灾难性遗忘。实验表明,在 Countdown 任务上,即使新任务性能已经收敛,继续使用 ES 训练仍会导致旧任务性能(HellaSwag)下降约 10%(见论文图 2 及相关描述)。

  2. 揭示了遗忘的根本原因: 论文通过实证分析,找到了导致 ES 灾难性遗忘的直接原因:与 GRPO 相比,ES 产生的参数更新范数巨大且极其稠密。具体而言,在 500 次训练迭代后,ES 更新矩阵的 Frobenius 范数比 GRPO 高出三个数量级(见论文图 3)。同时,GRPO 的更新稀疏度在所有参数组和层中接近 95%,而 ES 的更新则高度密集(见论文图 4)。这种全局性的、大规模的参数漂移是破坏原有能力的主要因素。

  3. 对 ES 的 “无梯度” 优势提出了场景修正: 虽然 ES 内存效率高,但论文的研究结果表明,这种高效率的代价是模型以不受控的方式偏离其原始状态,从而无法满足持续学习中 “抗遗忘” 的核心需求。

实验结果分析

实验结果清晰地展现了 ES 在性能与稳定性上的矛盾。

表 1显示,在两个模型上,ES 在多个任务上的准确率与 GRPO 的差距在 3-4 个百分点以内,证明其具备竞争性的任务学习能力。然而,真正的差异体现在模型的退化表现上。图 1的帕累托曲线显示,ES 的微调过程呈现一个 “凸” 形:新任务准确率的提升伴随着旧任务准确率的持续下降。相比之下,GRPO 的曲线几乎聚集在右上角,表明其能在高效学习新任务的同时,稳定保持旧任务能力。

图 2则从时间维度证实了这一趋势:随着训练迭代次数的增加,GRPO 微调的模型在 HellaSwag 上的准确率保持平稳,而 ES 微调的模型则持续衰减,甚至在 200 次迭代后性能停滞的期间,遗忘仍在继续。这表明 ES 的破坏性更新具有惯性,并不会因新任务学习的收敛而停止。

论文进一步对参数更新机制的分析(见论文图 3 和图 4)为上述行为提供了合理解释。GRPO 由于其基于梯度的特性及优化目标中的 KL 散度正则化项,能够将参数更新限制在任务相关的子空间内,形成稀疏、有目标的更新。而 ES 的更新几乎等同于在所有参数上施加全局噪声,导致模型发生了灾难性的 “整体漂移”,从而覆盖了先前学到的知识。

实践建议

尽管 ES 展示出了灾难性遗忘的问题,但其无梯度和节省内存的特性在特定场景下仍具吸引力。对于期望应用 ES 或类似无梯度优化算法进行模型持续更新的团队,以下建议可供参考:

  1. 将更新稀疏性作为约束条件: 朴素 ES 对所有参数进行稠密更新的行为是导致遗忘的根源。在实践中,可以探索将更新限定在模型的一小部分参数上,例如将其与 LoRA 等参数高效微调方法结合,或设计一种激励稀疏更新的机制。

  2. 引入正则化以限制模型偏移: 借鉴 GRPO 的成功经验,为 ES 的优化过程添加一个类似 KL 散度的正则化项,惩罚当前模型与参考模型(通常是初始基座模型)之间的差异,可能是一种直接的缓解方法。这能直接对抗 ES 更新范数过大的问题。

  3. 设计混合更新策略: 可以在部署的场景下,用基于向量的记忆或上下文学习来处理日常的、高频的知识更新,而仅在需要微调模型权重时,谨慎地使用带强制正则化或稀疏化约束的 ES。ES 当前的状态尚不适合直接用于在线、连续的权重更新。

  4. 加强遗忘监控: 在实施任何无梯度微调方案时,必须建立一个多任务评估体系。不能仅监控目标任务的损失或准确率,必须定期评估模型在原先擅长领域的性能指标,建立如图 1 所示的帕累托监控面板,以便在发现灾难性遗忘趋势时及时中止训练。