DemoPSD:分歧调节的策略自蒸馏

arXiv: 2607.02502v1

论文信息

标题: DemoPSD: Disagreement-Modulated Policy Self-Distillation

作者: Yunhe Li, Hao Shi, Wenhao Liu, et al.

发布日期: 2026-07-02

arXiv ID: 2607.02502v1

PDF 链接: 下载 PDF

引言:当自我蒸馏遭遇特权信息泄露

近年来,大语言模型的后训练优化越来越依赖可验证奖励的强化学习(RLVR),如 GRPO 等方法通过多条采样轨迹与最终正确答案提供稀疏奖励信号。然而,这种稀疏反馈面临一个根本的 “信用分配瓶颈”:模型很难区分单个 token 对答案正确性的贡献。于是,在线策略自蒸馏(On-Policy Self-Distillation, OPSD) 被提出,它用拥有特权信息(如正确答案或完整推理链)的同一个模型作为教师,向学生(无特权信息的同一模型)提供稠密的 token 级监督。像 DeepSeek-V4、Qwen3 等工业级模型已经采用这一范式,并展示了比 GRPO 高出数倍的样本效率。

然而,最新的理论分析揭示了一个危险的失败模式——特权信息泄露。因为教师可访问学生测试时看不到的答案 yy^*,即便给定问题和已生成的文本前缀,特权信息仍能提供下一 token 的额外预测信息。学生会学会利用 xyx \to y^* 的捷径,而不是学到可迁移的推理能力,导致训练早期性能迅速提升,随后逐步退化。这种泄露是一股扭曲的梯度,迫使模型过度拟合教师的分布,不仅牺牲了跨域泛化能力,还会压缩策略的探索熵,造成策略熵崩塌。

DemoPSD 正是在这一背景下被提出,其核心思想是选择性采纳教师指导:当教师的分布与学生分布高度一致时,学生安全地模仿教师;当两者严重分歧(表明教师的输出被特权信息过度扭曲)时,则更多地依靠学生自己的推理。

核心方法:基于分歧调制的反向 KL 重心目标

DemoPSD 的关键创新在于重新定义了蒸馏目标,它不是让学生直接匹配完整的教师分布,而是构造一个 反向 KL 重心目标

πtargetαt(vx,y,y^<t)(πteacher(vx,y,y^<t))1αt(πstudent(vx,y^<t))αt.\pi_{\text{target}}^{\alpha_t}(v \mid x, y^*, \hat{y}_{<t}) \propto \big(\pi_{\text{teacher}}(v \mid x, y^*, \hat{y}_{<t})\big)^{1-\alpha_t} \cdot \big(\pi_{\text{student}}(v \mid x, \hat{y}_{<t})\big)^{\alpha_t}.

这个目标本质上是教师分布和学生分布的几何加权组合,其中权重 αt[0,αmax]\alpha_t \in [0, \alpha_{\max}] 是完全由教师与学生的分布分歧决定的 token 级调制系数。当 αt=0\alpha_t=0 时,目标退化为教师分布;当 αt\alpha_t 增大时,目标向学生分布插值,从而削弱特权信息的过度影响。

分歧度量和自适应衰减

DemoPSD 使用 Jensen-Shannon 散度(JSD)度量两个分布的分歧 dtd_t,JSD 对称且有界,适合比较教师(拥有特权)和学生(无特权)在同一前缀下的预测差异。随后,通过一个重标定的 sigmoid 函数将分歧映射为 αt\alpha_t

αt=(σ(βdt)0.5)2αmax.\alpha_t = \big(\sigma(\beta \cdot d_t) - 0.5\big) \cdot 2 \cdot \alpha_{\max}.

该函数具有单调递增、零分歧时零衰减以及有上限 αmax\alpha_{\max} 的特点,确保即使极端分歧也不会完全丢弃教师信号。超参数 β\beta 控制衰减对分歧的敏感度,αmax\alpha_{\max} 则限定最大衰减幅度。

损失函数与梯度分析

训练目标是最小化学生与重心目标之间的反向 KL 散度:

LDemoPSD=E[tKL(πθ(x,y^<t)πtargetαt)],\mathcal{L}_{\text{DemoPSD}} = \mathbb{E}\left[\sum_t \mathrm{KL}\big(\pi_{\theta}(\cdot|x,\hat{y}_{<t}) \,\|\, \pi_{\text{target}}^{\alpha_t}\big) \right],

其中目标中的教师分布、学生分布和 αt\alpha_t 均通过 stopgrad 固定。梯度推导显示,教师引导的信号被缩放因子 (1αt)(1-\alpha_t) 调制:

θL=E[t(1αt)logπθ(y^tx,y^<t)πθ(y^tx,y,y^<t)θlogπθ(y^tx,y^<t)].\nabla_\theta \mathcal{L} = \mathbb{E}\bigg[\sum_t (1-\alpha_t) \log\frac{\pi_\theta(\hat{y}_t|x,\hat{y}_{<t})}{\pi_\theta(\hat{y}_t|x,y^*,\hat{y}_{<t})} \nabla_\theta \log\pi_\theta(\hat{y}_t|x,\hat{y}_{<t})\bigg].

当教师和学生在某一位置的分布分歧较大时,αt\alpha_t 增大,(1αt)(1-\alpha_t) 变小,从而削弱该位置教师信号的贡献。这种机制精确地体现了 “选择性采纳”:低分歧 token 保留稠密监督,高分歧 token 则被衰减,避免了强迫学生模仿被特权信息污染的模式。

理论贡献:泄露衰减与探索保持

DemoPSD 提供了两个严谨的理论保证,解释其成功的原因。

定理 1(泄露衰减):定义泄露率为特权偏差 Δt(v)=logπteacherlogπstudent\Delta_t(v)=\log\pi_{\text{teacher}}-\log\pi_{\text{student}} 的期望平方范数。DemoPSD 的有效泄露率变为 Et[(1αt)2Δt2]\mathbb{E}_t[(1-\alpha_t)^2\|\Delta_t\|^2],严格小于标准 OPSD 的 Et[Δt2]\mathbb{E}_t[\|\Delta_t\|^2]。更重要的是,由于 αt\alpha_tΔt\|\Delta_t\| 正相关,衰减在最需要的位置最强。

定理 2(探索保持):在一个温和的正相关条件下,DemoPSD 的重心目标严格保持比完整教师目标更高的熵:H(πstudent)H(πtargetαt)H(πteacher)\mathcal{H}(\pi_{\text{student}}) \ge \mathcal{H}(\pi_{\text{target}}^{\alpha_t}) \ge \mathcal{H}(\pi_{\text{teacher}})。熵的导数分解揭示了两个部分:特权信号的内在信息压缩成本,以及教师分布与学生先验的相互作用成本。DemoPSD 在几何路径上提前停止插值(γ=1αt<1\gamma=1-\alpha_t<1),因此避免了熵的最后急剧下降,保留了更多探索能力。

这两个理论结果共同说明,基于分歧调制的重心目标既能削弱泄露,又能维持策略的多样性。

实验结果:性能、泛化与训练动态

实验基于 Qwen3-4B-Instruct 模型,在 SciKnowEval 四个科学领域(生物、化学、材料科学、物理)上训练和评估,使用 GRPO 和 SDPO 作为基线。主要发现如下:

领域内准确率全面提升:DemoPSD 在所有领域和三项指标(mean@16、maj@16、best@16)上均优于两个基线,平均 best@16 比 SDPO 高 2.82 个百分点,比 GRPO 高 6.7 个百分点。特别值得注意的是,best@16 的提升比 mean@16 更大,说明更高的探索熵确实带来了更高质量的解空间覆盖。

训练熵显著提升:DemoPSD 的最终训练策略熵比 SDPO 高出 33% 到 98%,尤其是在材料科学领域,SDPO 的熵已经跌至 0.15,接近熵崩塌,而 DemoPSD 仍维持在 0.30。更高的熵意味着模型保留了对不同推理路径的尝试能力,这直接转化为更好的 best-of-N 性能。

分布外泛化鲁棒:在 GPQA Extended 基准上,SDPO 呈现典型的先升后降模式:训练中 OOD 准确率早期达到峰值,随后逐步恶化(化学领域从 40.45 降至 28.62)。DemoPSD 则在训练全程保持稳定的 OOD 准确率,甚至小幅提升,最终平均领先 SDPO 7.91 个百分点。这有力证明了泄露衰减缓解了领域内过拟合,保留了可迁移的推理技能。

分歧动态:大部分 token 的师生分歧极低(JSD 中位数接近零),只有约 2%—5% 的 token 分歧超过 0.25。平均 αt\alpha_t 仅在 0.033—0.055 之间,表明 DemoPSD 对绝大多数 token 保留了接近完整的教师监督,仅对少数高危 token 进行衰减,实现了精准的调制。

超参数敏感性:参数 β\beta 控制衰减锐度,领域差异性明显:分歧小的领域(如物理,平均 dtˉ=0.026\bar{d_t}=0.026)受益于较高的 β\beta 来放大弱分歧信号;分歧大的领域(如生物,dtˉ=0.046\bar{d_t}=0.046)则更适合较低的 β\beta。但总体上,DemoPSD 在较宽的 β\beta 范围内都优于 SDPO,表现出良好的鲁棒性。

实践应用与未来展望

DemoPSD 为工业级自蒸馏提供了一个即插即用的解决方案。其实现复杂度与 SDPO 相当,只需计算一次额外的学生(无特权)前向传播,并替换蒸馏目标为几何混合。实践中,可以采用指数移动平均(EMA)模型作为学生参考以提升稳定性,并利用 top-k 蒸馏降低显存开销。建议在应用时根据领域难度微调 β\betaαmax\alpha_{\max},通常 αmax=0.15\alpha_{\max}=0.15 是一个安全的起点。

该方法的核心哲学——不要盲目模仿老师,要带着怀疑学——不仅适用于自蒸馏,也可以延伸至多智能体协作、课程学习等场景。未来的工作可以探索更精细的分歧度量(如 token 重要性加权),或将反向 KL 重心引入到非自蒸馏的 OPD 中。此外,将 DemoPSD 与基于过程奖励的信用分配方法结合,或许能进一步消除泄露与噪声,推动大语言模型推理能力的上限。

总结

DemoPSD 为在线自蒸馏提供了一种新颖而优雅的解决方案,它通过量化教师与学生之间的分歧,动态调整蒸馏目标,有效缓解了特权信息泄露和熵崩塌的双重困境。理论与实验共同证明,这种选择性采纳教师指导的策略既能保留稠密监督的高效性,又能守护模型的自主探索与泛化能力。在语言模型日益依赖自蒸馏高效训练的时代,DemoPSD 代表的 “有选择地学习” 思想可能会成为下一波推理模型优化的标准组件。