DemoPSD:分歧调制的策略自蒸馏
DemoPSD: Disagreement-Modulated Policy Self-Distillation
论文信息
标题: DemoPSD: Disagreement-Modulated Policy Self-Distillation
作者: Yunhe Li, Hao Shi, Wenhao Liu, et al.
发布日期: 2026-07-02
arXiv ID: 2607.02502v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:这篇论文要解决在线策略自蒸馏(OPSD)训练大语言模型推理时,教师模型因访问特权信息而导致的 “特权信息泄露”,使得学生模型过度拟合教师分布、探索能力退化和跨领域泛化能力下降。
- 核心方法:DemoPSD 提出 “选择性采纳教师指导” 原则,通过计算教师与学生分布之间的 Jensen-Shannon 分歧,生成每个词元位置的自适应衰减系数,进而构造一个反向 KL 重心目标(几何混合),在分歧大时削弱教师信号,保留学生自身推理能力。
- 关键结果:在四个科学领域的 SciKnowEval 基准上,DemoPSD 相比上一代自蒸馏方法 SDPO 在 best@16 上平均提升 2.82 个百分点,同时训练熵高出 33–98%(见论文表 1 与表 3)。
- 主要局限:方法依赖至少一个正确回答来构造特权上下文,无法在全部回答错误时提供密集监督;额外引入了超参数 β 和 α_max,最优值需按领域调整;论文未在更大模型或不同训练范式下验证。
- 适合读者:从事大语言模型强化学习、知识蒸馏、推理能力提升训练的研究者与工程师,以及对避免模型过拟合和提升探索能力感兴趣的技术从业者。
论文背景和研究动机
在基于可验证奖励的强化学习(RLVR)框架下训练大语言模型,例如 GRPO,虽然能利用结果正确性信号,但它面临一个根本的信用分配瓶颈:它只能将句子级奖励均摊到所有词元上,无法区分各个词元的贡献。在线策略自蒸馏(OPSD)通过引入一个带有特权信息(如正确答案或验证推理链)的同一模型作为教师,在每个词元位置提供密集的对数概率监督,极大缓解了这一问题(Agarwal et al., 2024;Hübotter et al., 2026),并已成为工业界的主流选择。
然而,最近的研究发现 OPSD 存在特权信息泄露(Yang et al., 2026)。由于教师可以看见学生永远无法观测的特权信息 ,学生模型会被迫在训练时内化那些仅在教师上下文中存在的捷径关联,导致在测试时性能逐渐退化。SDPO(Hübotter et al., 2026)的实验就表现出典型的 “先升后降” 模式——早期准确率提升,随后因过拟合和探索能力丧失而衰减。这种泄露本质上是因为标准 OPSD 的目标是完全拟合教师的特权条件分布,而该分布在某些位置(如数值答案处)严重依赖于特权信息,并非可迁移的推理策略。
为了缓解这一问题,RLSD、HDPO、DASD 等方法尝试通过教师熵、样本正确性等间接代理信号来选择性施用蒸馏。但这些方法都没有直接回答一个根本问题:如何让蒸馏目标本身自适应地平衡教师指导和学生的独立推理? DemoPSD 正是为此提出了一种全新的框架,通过直接度量教师与学生之间因特权信息导致的分歧,动态调制蒸馏目标的构成,从而在保留密集监督的同时压制泄露。
核心方法和技术细节
DemoPSD 的核心理念是选择性采纳教师指导:当教师分布与学生分布较为一致时,表明特权信息未严重扭曲教师预测,此时可以直接采纳教师信号;当两者出现较大分歧时,意味着教师预测过度依赖特权信息,蒸馏将带来泄露风险,应更多地依赖学生自身的推理。
1. 测量教师-学生不一致度
在每一个词元位置 ,DemoPSD 计算两个分布:特权教师分布在上下文 下的预测 ,以及无特权学生分布在上下文 下的预测 (学生分布由指数移动平均 EMA 副本计算以保证稳定性)。两者的不一致度用 Jensen-Shannon 散度(JSD)衡量:
然后通过一个单调递增的变换将 映射为泄露衰减系数 。论文使用了一个重缩放的 sigmoid 函数:
其中 控制对不一致的敏感度, 为系数上界。当 时 ,目标退化为教师分布;随着 增大, 趋近 ,最大程度削弱教师信号。
2. 反向 KL 重心目标
DemoPSD 不让学生直接拟合教师分布,而是构建一个新的目标分布 ,它是教师与学生分布的一个几何混合:
这个形式恰好是反向 KL 重心(reverse-KL barycenter)的解,即最小化 得到的分布。几何混合的重要性质是:只有当教师和学生同时赋予较高概率的词元才会在目标中获得较大质量,这有效抑制了单纯由特权信息诱导的高概率词元,避免了算术混合常见的模式平均和熵膨胀。
3. 损失与梯度
DemoPSD 训练学生最小化 。将目标展开后,由于目标分布被停止梯度计算,归一化常数 成为常量,优化避开了复杂的反向传播。推导出的梯度为:
关键之处在于,教师诱导的对数比率信号被逐位置乘上了 。不一致度大的位置,该因子小,从而削弱了来自特权上下文的梯度,实现了针对性的泄露衰减。
4. 训练流程
DemoPSD 与 SDPO 类似,采用一种 “重新提示” 机制:对于每个问题,采样多个回答,如果存在正确答案,则随机选取一个正确回答作为特权信息 ,注入教师输入中;若全错,则跳过该样本(因无法形成可靠特权上下文)。算法交替采样、计算不一致度、构建重心目标、梯度更新。EMA 副本每步更新一次,用以提供稳定的 。
创新点和贡献
DemoPSD 的主要创新在于直接通过分布间分歧调制蒸馏目标,而非间接依赖熵或正确性等代理信号。其贡献可概括为:
- 提出反向 KL 重心蒸馏目标:几何混合的自适应目标在保留教师密集监督的同时,抑制特权信息诱导的偏差,比算术混合更能保持清晰的训练信号。
- 严谨的理论分析:
- 泄露衰减定理(定理 5.1):证明有效泄露率 严格低于标准 OPSD,且衰减在分歧大时更强。
- 探索保持定理(定理 5.2):在教师对高概率词元给予正向增权的合理假设下,重心目标的熵严格高于完全教师目标,保留了更多探索能力,且熵增益随 递增。
- 全面的实验验证:在 SciKnowEval 四个领域和跨域泛化 GPQA 基准上,DemoPSD 均优于 SDPO 和 GRPO,且训练熵显著更高,体现了理论预期的效果。
实验结果分析
论文在 Qwen3-4B-Instruct 基模型上展开实验。
在域内表现:表 1 的平均数据显示,DemoPSD 在 mean@16、maj@16、best@16 三项指标上均优于 SDPO,尤其在 best@16 上平均提升 2.82 个百分点(82.12 vs 79.30)。图 2(a) 的验证曲线表明,随着训练进行,DemoPSD 的优势逐渐扩大,这与理论预测的后期泄露加剧后保护效果凸显一致。
在跨域泛化上:GPQA Extended 测试中,SDPO 的 OOD 准确率在达到峰值后持续下降(化学领域从 40.45 降至 28.62),而 DemoPSD 保持稳定并略有提升,最终平均高出 7.91 个百分点(表 2 与图 3)。这直接印证了特权信息泄露的缓解有效转化为泛化能力的保持。
训练动力学:表 3 和图 1(a) 显示,DemoPSD 的训练熵始终大幅高于 SDPO(材料科学领域高 98%),表明策略并未崩塌。不一致度分布高度右偏(图 4(a)),大部分词元的不一致极小,仅在约 5% 的词元处触发显著衰减,这正是选择性采纳的直观体现。平均衰减系数 维持在 0.033–0.055,说明整体上教师信号仍被大量保留,仅在高风险位置修剪。
超参数敏感性:表 4 展示了 的影响,DemoPSD 在 范围内均保持对 SDPO 的优势,且最优 因领域而异:不一致较小的领域(如物理)宜用较大 增强衰减,反之(如生物)宜用较小 避免过度保守。
实践建议
DemoPSD 的算法流程清晰,与现有 OPSD 训练框架兼容,适合在需要密集监督且存在特权信息可用的场景中落地。实践时应注意以下几点:
- 特权信息的构造:必须依赖正确回答提供特权上下文可显著提升信号质量;当样本组全错时会丢失该步蒸馏,因此应适当增加采样数量或使用更丰富的提示形式以提高正确覆盖率。
- EMA 与学生模型的分离:使用 EMA 副本计算不一致度和重心目标中的学生分布,能有效稳定训练,EMA 系数 0.05 可作为起点,过大会导致目标过于陈旧,过小则近似在线,波动增大。
- 超参数调节:
- 控制最大衰减程度,论文使用 0.15;它决定了即使极端分歧时教师仍保留至少 85% 权重,安全保守。
- 是最敏感的域相关参数,建议先观测训练中平均 的水平: 普遍很小时(如物理 ),可将 设置较高(如 100); 较大时(如生物 ),更低的 (如 50)可防止过度压制教师信号。
- 内存与计算:DemoPSD 需额外计算教师分布和学生分布以及 JSD,但在 top-k=100 蒸馏和共享索引的情况下,额外开销可控,论文未报告显著效率问题。
- 适用场景:本方法适用于推理类任务(数学、科学问答等),特权信息清晰且可自动构造;若特权信息难以定义或获取,无法直接应用,但 “选择性采纳” 的思想可迁移到其他教师-学生蒸馏场景中。
综上,DemoPSD 为在线策略自蒸馏提供了一种理论扎实、实现简洁且实验有效的改良方案,有望成为训练鲁棒推理模型的标准组件。