自蒸馏实现持续学习
Self-Distillation Enables Continual Learning
论文信息
标题: Self-Distillation Enables Continual Learning
作者: Idan Shenfeld, Mehul Damani, Jonas Hübotter, et al.
发布日期: 2026-01-27
arXiv ID: 2601.19897v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:这篇论文要解决基础模型在持续学习中如何从专家示范数据中有效学习新技能而不遗忘旧能力的问题。现有监督微调(SFT)是离策略学习,容易导致灾难性遗忘,而在策略强化学习又需要明确的奖励函数。
- 核心方法:提出了自蒸馏微调(Self-Distillation Fine-Tuning, SDFT),利用模型自身的上下文学习能力,将同一个模型充当教师(条件化于专家示范)和学生(不条件化),通过在学生自己生成的轨迹上最小化反向 KL 散度,实现在策略学习。
- 关键结果:在多个技能学习和知识获取任务中,SDFT 在提升新任务准确率的同时显著减少了对旧能力的遗忘。在顺序学习三个不同技能的实验中,SDFT 使单一模型逐步积累技能而不出现性能倒退(图 3)。
- 主要局限:SDFT 依赖于模型较强的上下文学习能力,小模型效果不佳;计算成本约是 SFT 的 2.5 倍(FLOPs)和 4 倍(墙钟时间);学生可能学到一些不希望的语言模式(如 “基于文本…”),需要额外处理。
- 适合读者:对大型语言模型的持续学习、微调策略、知识注入以及在策略学习感兴趣的机器学习研究者和工程师。
论文背景和研究动机
基础模型在部署后通常保持静态,无法通过参数更新习得新技能或吸收新知识。持续学习(continual learning)旨在让模型像人类一样不断累积知识、提升能力,但面临灾难性遗忘的挑战。大量近期工作表明,在策略(on‑policy)学习能显著减少遗忘,因为它使模型在与当前策略一致的数据分布上学习。然而,在策略方法(如强化学习)需要显式的奖励函数,而在许多真实场景中,可用的仅仅是专家示范数据集,而非奖励。当前主流做法是监督微调(SFT),直接让模型模仿专家动作,但它是典型的离策略(off‑policy)学习,会导致泛化能力差和严重的灾难性遗忘。因此,如何在仅有示范数据时获得在策略学习的好处,成为持续学习的一个根本性挑战。
论文指出,传统的逆强化学习(IRL)可以从示范中推断奖励函数,然后进行在策略 RL,但通常需要强先验假设,难以大规模应用。因此,作者另辟蹊径,利用大模型强大的上下文学习(in‑context learning)能力,直接将示范作为条件,让模型自行提炼出在策略的学习信号。
核心方法和技术细节
SDFT 的基本框架是学生‑教师蒸馏:对于给定的提示 ,教师模型 同时被条件化于专家示范 ;学生模型 则只有提示。训练时,先由学生生成回答 ,然后最小化学生分布与教师分布之间的反向 KL 散度:
利用自回归结构,该目标可分解为 token 级别的梯度估计(见论文公式 (2)),训练时使用按 token 分析梯度(analytic per‑token estimator),在实验中表现出最稳定的优化效果(附录 A.1)。
教师模型的权重源自学生参数的指数移动平均(EMA),以平衡训练稳定性和跟踪学习进展。对每个提示,教师上下文的构建采用一种简单提示模板(包括问题和示范),促使模型推理其意图而非简单复制示范输出。
与逆强化学习的联系
论文从理论上证明 SDFT 等价于在策略 RL,其隐含的奖励函数可表示为:
这一推导基于一个核心假设:条件化于示范的模型近似最优策略 (称为上下文假设)。实验验证表明,该假设下的教师策略不仅能达到 100% 的任务成功率(ToolAlpaca),且其与基础模型的 KL 散度(0.68 nats)远小于 SFT 模型(1.26 nats),说明教师既能产生正确行为,又保持在当前策略附近,符合信任域约束(图 2 右)。
创新点和贡献
- 在策略蒸馏框架:首次将自蒸馏和上下文学习结合,实现了从示范数据中进行在策略学习,无需外部奖励或显式 IRL。
- 统一持续学习范式:SDFT 不但在单一任务微调时减轻遗忘,还能在顺序学习多个技能时使模型稳定累积能力,证明了从示范实现持续学习的可行性。
- IRL 的新视角:通过上下文假设将条件化模型的输出视为隐含奖励,避免了传统 IRL 的识别难题。
- 兼容推理模型:SDFT 可在无推理痕迹的数据上微调推理模型,而不破坏其长链推理风格(表 2)。
- 实验全面的分析:通过在科学问答、工具使用、医学推理和知识获取等多个任务上的实验,并与 SFT、DFT、CPT 等基线比较,系统地展现了方法在准确率和抗遗忘上的优势。
实验结果分析
论文在两类持续学习设置下评估:技能学习和知识获取。
技能学习
使用 Qwen‑2.5‑7B‑Instruct 模型在三个任务(科学问答、工具使用、医学推理)上对比 SFT、DFT 和 “Re‑invoke” 方法。主要结果总结如下(图 4 和表 5):
- 新任务准确率:SDFT 均显著高于 SFT。例如在科学问答上,SDFT 达到 70.2%,而 SFT 为 66.2%;在工具使用上,SDFT 为 70.6%,SFT 为 63.2%。
- 旧能力保留:SDFT 在六个通用基准上的平均得分(64.5%)与基础模型(65.5%)非常接近,而 SFT 大幅下降至 53.4‑60.2% 不等。
- 顺序学习:将同一模型依次在三个技能上训练,SDFT 能稳定学习新任务且保持之前学到的技能(性能归一化后几乎不下降),而 SFT 会出现明显的性能振荡和遗忘(图 3)。
知识获取
使用 2025 年自然灾害的维基百科文章构建事实问答集。结果如表 1 所示:
- 严格准确率:SDFT 达到 89%,高于 SFT 的 80%,接近 Oracle RAG 的 91%。
- 分布外泛化:SDFT 达 98%,远超 SFT 的 80%,表明新知识被真正整合进模型内部而非死记硬背。
额外分析
- 模型规模的影响:SDFT 的优势随模型规模增大而增加(图 5 左),因为更大模型具有更强的上下文学习。
- Pass@k 表现:SDFT 在所有 值上均优于基线和 SFT,证明其性能提升来自真正的技能习得而非熵坍缩(图 5 右)。
- 教师消融:去除示范中的回答只保留文章文本导致准确率下降至 75%,说明完整的示范上下文(文本+回答)至关重要(图 7)。
- 蒸馏方式:离线蒸馏(从教师生成数据训练)的表现不如在策略 SDFT,印证在策略采样的必要性(图 6)。
实践建议
对于需要在生产环境中持续更新大型语言模型的工程团队,SDFT 提供了一条实用的路径,尤其适用于以下场景:
-
无需奖励函数的技能增强:当希望模型学会新工具使用、特定领域问答等技能,但缺乏可量化的奖励时,可直接利用现有示范数据集,通过 SDFT 进行在策略微调。建议采用 EMA 教师,并使用按 token 分析梯度估计以保持训练稳定。
-
知识注入与更新:对于知识截止日期后的新事件(如政策法规、灾难事件),可构造短文‑问答对,应用 SDFT 使模型内化事实。相较于传统 SFT,它能显著提升分布外泛化,避免模型仅在形式匹配时不理解实质。
-
顺序技能积累:在产品迭代中,通过依次对新技能数据运行 SDFT,可以不断为模型添加新能力而不覆盖已有技能。训练时设置 2‑4 个 epoch 通常足够,需要留意避免学生复制教师语言标记(如 “基于文本…”),可通过遮蔽前几个 token 的损失缓解。
-
推理模型后训练:对于具备内置推理的模型(如 Olmo‑3‑Think),使用无推理痕迹的答案数据进行微调时,SDFT 能保留推理深度而不退化到短回答。这降低了对人类标注推理过程的依赖。
-
与 RL 的互补:SDFT 可作为 RL 微调前的初始化,因为它提升了高 下的 pass@k,为后续基于奖励的探索提供更好的起点。计算开销虽然高于 SFT(约 2.5‑4 倍),但若考虑 SFT 后可能需额外 “能力恢复” 步骤,整体效率反而更高。
实施要点:确保基础模型具备一定的上下文学习能力(如 7B 以上),对于小模型可考虑使用更强的教师或先提升 ICL 能力;监控 KL 散度以防止训练发散;对于开放性文本生成任务,可结合人工或自动评估逐步迭代示范。