DemoPSD:分歧调节的策略自蒸馏
论文信息
标题: DemoPSD: Disagreement-Modulated Policy Self-Distillation
作者: Yunhe Li, Hao Shi, Wenhao Liu, et al.
发布日期: 2026-07-02
arXiv ID: 2607.02502v1
PDF 链接: 下载 PDF
引言:当自我蒸馏遭遇特权信息泄露
近年来,大语言模型的后训练优化越来越依赖可验证奖励的强化学习(RLVR),如 GRPO 等方法通过多条采样轨迹与最终正确答案提供稀疏奖励信号。然而,这种稀疏反馈面临一个根本的 “信用分配瓶颈”:模型很难区分单个 token 对答案正确性的贡献。于是,在线策略自蒸馏(On-Policy Self-Distillation, OPSD) 被提出,它用拥有特权信息(如正确答案或完整推理链)的同一个模型作为教师,向学生(无特权信息的同一模型)提供稠密的 token 级监督。像 DeepSeek-V4、Qwen3 等工业级模型已经采用这一范式,并展示了比 GRPO 高出数倍的样本效率。
然而,最新的理论分析揭示了一个危险的失败模式——特权信息泄露。因为教师可访问学生测试时看不到的答案 ,即便给定问题和已生成的文本前缀,特权信息仍能提供下一 token 的额外预测信息。学生会学会利用 的捷径,而不是学到可迁移的推理能力,导致训练早期性能迅速提升,随后逐步退化。这种泄露是一股扭曲的梯度,迫使模型过度拟合教师的分布,不仅牺牲了跨域泛化能力,还会压缩策略的探索熵,造成策略熵崩塌。
DemoPSD 正是在这一背景下被提出,其核心思想是选择性采纳教师指导:当教师的分布与学生分布高度一致时,学生安全地模仿教师;当两者严重分歧(表明教师的输出被特权信息过度扭曲)时,则更多地依靠学生自己的推理。
核心方法:基于分歧调制的反向 KL 重心目标
DemoPSD 的关键创新在于重新定义了蒸馏目标,它不是让学生直接匹配完整的教师分布,而是构造一个 反向 KL 重心目标:
这个目标本质上是教师分布和学生分布的几何加权组合,其中权重 是完全由教师与学生的分布分歧决定的 token 级调制系数。当 时,目标退化为教师分布;当 增大时,目标向学生分布插值,从而削弱特权信息的过度影响。
分歧度量和自适应衰减
DemoPSD 使用 Jensen-Shannon 散度(JSD)度量两个分布的分歧 ,JSD 对称且有界,适合比较教师(拥有特权)和学生(无特权)在同一前缀下的预测差异。随后,通过一个重标定的 sigmoid 函数将分歧映射为 :
该函数具有单调递增、零分歧时零衰减以及有上限 的特点,确保即使极端分歧也不会完全丢弃教师信号。超参数 控制衰减对分歧的敏感度, 则限定最大衰减幅度。
损失函数与梯度分析
训练目标是最小化学生与重心目标之间的反向 KL 散度:
其中目标中的教师分布、学生分布和 均通过 stopgrad 固定。梯度推导显示,教师引导的信号被缩放因子 调制:
当教师和学生在某一位置的分布分歧较大时, 增大, 变小,从而削弱该位置教师信号的贡献。这种机制精确地体现了 “选择性采纳”:低分歧 token 保留稠密监督,高分歧 token 则被衰减,避免了强迫学生模仿被特权信息污染的模式。
理论贡献:泄露衰减与探索保持
DemoPSD 提供了两个严谨的理论保证,解释其成功的原因。
定理 1(泄露衰减):定义泄露率为特权偏差 的期望平方范数。DemoPSD 的有效泄露率变为 ,严格小于标准 OPSD 的 。更重要的是,由于 与 正相关,衰减在最需要的位置最强。
定理 2(探索保持):在一个温和的正相关条件下,DemoPSD 的重心目标严格保持比完整教师目标更高的熵:。熵的导数分解揭示了两个部分:特权信号的内在信息压缩成本,以及教师分布与学生先验的相互作用成本。DemoPSD 在几何路径上提前停止插值(),因此避免了熵的最后急剧下降,保留了更多探索能力。
这两个理论结果共同说明,基于分歧调制的重心目标既能削弱泄露,又能维持策略的多样性。
实验结果:性能、泛化与训练动态
实验基于 Qwen3-4B-Instruct 模型,在 SciKnowEval 四个科学领域(生物、化学、材料科学、物理)上训练和评估,使用 GRPO 和 SDPO 作为基线。主要发现如下:
领域内准确率全面提升:DemoPSD 在所有领域和三项指标(mean@16、maj@16、best@16)上均优于两个基线,平均 best@16 比 SDPO 高 2.82 个百分点,比 GRPO 高 6.7 个百分点。特别值得注意的是,best@16 的提升比 mean@16 更大,说明更高的探索熵确实带来了更高质量的解空间覆盖。
训练熵显著提升:DemoPSD 的最终训练策略熵比 SDPO 高出 33% 到 98%,尤其是在材料科学领域,SDPO 的熵已经跌至 0.15,接近熵崩塌,而 DemoPSD 仍维持在 0.30。更高的熵意味着模型保留了对不同推理路径的尝试能力,这直接转化为更好的 best-of-N 性能。
分布外泛化鲁棒:在 GPQA Extended 基准上,SDPO 呈现典型的先升后降模式:训练中 OOD 准确率早期达到峰值,随后逐步恶化(化学领域从 40.45 降至 28.62)。DemoPSD 则在训练全程保持稳定的 OOD 准确率,甚至小幅提升,最终平均领先 SDPO 7.91 个百分点。这有力证明了泄露衰减缓解了领域内过拟合,保留了可迁移的推理技能。
分歧动态:大部分 token 的师生分歧极低(JSD 中位数接近零),只有约 2%—5% 的 token 分歧超过 0.25。平均 仅在 0.033—0.055 之间,表明 DemoPSD 对绝大多数 token 保留了接近完整的教师监督,仅对少数高危 token 进行衰减,实现了精准的调制。
超参数敏感性:参数 控制衰减锐度,领域差异性明显:分歧小的领域(如物理,平均 )受益于较高的 来放大弱分歧信号;分歧大的领域(如生物,)则更适合较低的 。但总体上,DemoPSD 在较宽的 范围内都优于 SDPO,表现出良好的鲁棒性。
实践应用与未来展望
DemoPSD 为工业级自蒸馏提供了一个即插即用的解决方案。其实现复杂度与 SDPO 相当,只需计算一次额外的学生(无特权)前向传播,并替换蒸馏目标为几何混合。实践中,可以采用指数移动平均(EMA)模型作为学生参考以提升稳定性,并利用 top-k 蒸馏降低显存开销。建议在应用时根据领域难度微调 和 ,通常 是一个安全的起点。
该方法的核心哲学——不要盲目模仿老师,要带着怀疑学——不仅适用于自蒸馏,也可以延伸至多智能体协作、课程学习等场景。未来的工作可以探索更精细的分歧度量(如 token 重要性加权),或将反向 KL 重心引入到非自蒸馏的 OPD 中。此外,将 DemoPSD 与基于过程奖励的信用分配方法结合,或许能进一步消除泄露与噪声,推动大语言模型推理能力的上限。
总结
DemoPSD 为在线自蒸馏提供了一种新颖而优雅的解决方案,它通过量化教师与学生之间的分歧,动态调整蒸馏目标,有效缓解了特权信息泄露和熵崩塌的双重困境。理论与实验共同证明,这种选择性采纳教师指导的策略既能保留稠密监督的高效性,又能守护模型的自主探索与泛化能力。在语言模型日益依赖自蒸馏高效训练的时代,DemoPSD 代表的 “有选择地学习” 思想可能会成为下一波推理模型优化的标准组件。