微调制度定义了不同的持续学习问题
Fine-Tuning Regimes Define Distinct Continual Learning Problems
论文信息
标题: Fine-Tuning Regimes Define Distinct Continual Learning Problems
作者: Paul-Tiberiu Iordache, Elena Burceanu
发布日期: 2026-04-23
arXiv ID: 2604.21927v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:这篇论文质疑持续学习(CL)方法的比较是否应该固定微调模式(fine‑tuning regime)。它探究只改变可训练参数子空间(即 “可训练深度”)是否会打乱标准方法的排序。
- 核心方法:作者将微调模式形式化为投影优化,把可训练深度当作显式评估变量,并在五种深度设置、五个基准数据集、四种标准 CL 方法上系统实验,使用 Kendall 衡量排名一致性。
- 关键结果:方法排名在不同微调模式下强烈不稳定。例如在 Fashion‑MNIST 上,不同深度之间的平均 Kendall 仅为 0.42(图 1b),表明结论高度依赖选定的可训练深度。
- 主要局限:超参数未针对每种深度单独调优;变化轴仅限于 “可训练深度”,未覆盖稀疏掩码、低秩适配等其他子空间;仅限任务增量场景;仅用 ResNet‑18 一种架构;对投影量的直接测量还不全面。
- 适合读者:从事持续学习评估、基准设计、深度网络优化以及关注训练配置稳定性的研究人员和工程师。
论文背景和研究动机
持续学习研究如何在顺序接收任务的同时保留旧知识,核心是平衡可塑性与稳定性。长期以来的评估实践几乎都将微调模式固定为全参数更新,例如直接对整个网络进行 finetune,却很少追问:如果只训练最后几层,方法的相对优劣还会一致吗?
这篇论文正是从这一问题出发。作者指出,微调模式决定了优化过程中哪些参数方向可用,从而同时改变了 “拟合当前任务” 和 “保留旧知识” 两种信号的传播通道。不同的 CL 方法(如 online EWC、LwF、SI、GEM)对这些信号的构造方式不同,因此当可训练深度变化时,它们的相对表现可能不再保持。已有工作虽承认任务顺序会严重影响评估,但尚未将微调模式本身作为一级评估变量看待。论文的目标就是把可训练深度拉进评估框架的中心,并检验方法排名的不变性假设。
核心方法和技术细节
投影优化形式化
论文将微调模式定义为一个固定的可训练坐标子集 ,并用正交投影算子 将全梯度限制在该子空间中。训练对象为依次到来的任务 ,在第 个任务上,优化目标为
其中 是当前任务损失, 是保留旧知识的方法特有项。参数更新只发生在可训练坐标上:
进一步将投影梯度拆分为 “当前任务信号” 和 “保留信号”:
并定义两者的交互 。这个分解清楚地显示:微调模式不仅缩减参数数量,更通过 改变了两个信号的有效方向以及它们之间的对齐或冲突程度。论文还在附录中给出了一个基于光滑性的下降界,表明局部进展仅依赖于投影梯度的范数,而非全梯度,这为将实验聚焦于投影量提供了合理性。
实验设计
作者在任务增量 CL 协议下,采用 ResNet‑18 作为背骨,定义五种可训练深度:仅训练最后一个残差块、最后 2 块、最后 3 块、最后 6 块、以及全部 8 块(相当于全 finetune)。由于背骨主体被冻结,这种设计直接将 “适应能力” 由浅入深地展开。评估覆盖四个代表性 CL 方法:online EWC、LwF、SI 和 GEM,在五个数据集(MNIST、Fashion‑MNIST、KMNIST、QMNIST、CIFAR‑100)上,每个数据集使用 11 种任务顺序(1 个规整顺序 + 10 个随机顺序)。核心指标不是单纯的准确率绝对值,而是通过 Kendall 衡量两种深度下方法排名的关联程度,以此捕捉 “比较结论是否随深度变化”。
创新点和贡献
论文的第一个贡献是将 “微调模式” 从背景实现细节提升为正式的评价变量,并通过投影优化视角给出了清晰的数学语言。这一视角使得可训练深度不再是一个无足轻重的超参数,而是决定优化几何结构的因子。
第二个贡献是系统的跨方法、跨深度、跨数据集、跨任务顺序的实证研究。结果显示,即使在同一个基准内,当可训练深度从浅到深变化时,online EWC、LwF、SI、GEM 的排名会显著改变。例如 Figure 1b 显示 Fashion‑MNIST 上平均 仅为 0.42,而 Figure 2 在多数据集上也都远离完美一致( 范围约 0.42–0.72)。最极端的排名反转出现在最受限与最宽松的深度之间,这说明单一深度的比较结论不具普遍性。
第三个贡献是对 “为什么深度会改变排名” 给出了优化层面的解释。实验表明,深度增加会导致更大的更新幅度和更高的遗忘率,并且两者的相关性在宽松深度下更强(Figure 3d)。这与分析一致:宽松深度打开了更多可干扰的方向,使得当前任务梯度更容易覆盖之前的知识,而不同方法对这类干扰的缓冲能力不同,从而排名发生变化。
实验结果分析
排名不稳定性。论文首先在 Fashion‑MNIST 上展示,各个方法的最终准确率在不同深度下走势不一,某些任务顺序下排名几乎反转(Figure 1c, d)。用 Kendall 量化后发现,深度间的排名一致度普遍偏低。这一现象并非 Fashion‑MNIST 独有,在 CIFAR‑100、MNIST、QMNIST、KMNIST 上也一致存在(Figure 2),其中 CIFAR‑100 的平均 为 0.68,而 Fashion‑MNIST 仅为 0.42。这表明,如果在某一深度下得出 “方法 A 优于 B” 的结论,在另一深度下可能就完全不同。
梯度幅度与遗忘的耦合。为探究机制,论文以 LwF 在 Fashion‑MNIST 上的表现为例,考察了训练过程中投影梯度的幅度以及最终的遗忘率。随着可训练深度增加,平均梯度幅度上升(Figure 3a),平均遗忘也上升(Figure 3b)。更关键的是,在深度较大的宽松模式下,梯度幅度与遗忘之间的 Kendall 相关性更强(Figure 3d),说明优化空间的扩张使当前任务信号更容易与旧知识冲突,从而推高遗忘。这为排名漂移提供了动力学层面的解释:不同的 CL 方法对 “更新幅度 ↔ 遗忘” 的转换效率不同,深度变化就会放大或削弱这些差异。
实践建议
基于以上发现,以下几条实践原则可帮助持续学习的研究者和工程师更稳健地评估方法:
-
将可训练深度视为显式实验因子。在设计 CL 基准或汇报结果时,应像报告任务顺序一样,明确记录并变化微调模式。不要仅在默认的全 finetune 下比较方法,而应至少包含一种受限的浅层更新方案(如只训练最后几层)来检验排名稳定性。
-
多种深度下的排名一致性应成为评估方法鲁棒性的一部分。如果一种 CL 方法仅在某个特定深度下表现突出,而在其他深度下表现平平,那么它的优势可能是配置依赖的,而非算法内在的优越。建议报告不同深度下的 Kendall 或类似的排名一致性指标。
-
注意超参数与深度的交互。本论文未针对每种深度单独调参,因此观察到的排名漂移可能部分来自超参数在不同深度下的不适配。在实际落地时,若决定采用某种微调深度,应为该深度重新搜索合适的正则化系数或学习率,避免将单次参数设置下的结论过度泛化。
-
关注更新幅度与遗忘的关联。实验中观察到梯度幅度越大遗忘往往越高,这提示开发者在选择可训练深度时,需要权衡新任务的学习效率和旧知识的保留。业务场景中若对遗忘极为敏感(如多租户模型更新),可考虑采用较浅的可训练深度来限制干扰,或辅以更强的保留正则化。
-
推广到更丰富的子空间选择。虽然论文只探索了 “可训练深度” 这一轴,但思路可以扩展到其他微调子空间,如低秩适配、稀疏掩码、参数隔离等。评估方法时,把子空间的类型和大小也作为变量,将得到更全面的方法特征画像。
通过上述做法,持续学习的基准测试将更贴近实际部署中灵活多变的训练配置,得出的结论也更可能在不同设置下稳定迁移。