通过直接同策略蒸馏实现从弱到强的泛化
论文信息
标题: Weak-to-Strong Generalization via Direct On-Policy Distillation
作者: Shiyuan Feng, Huan-ang Gao, Haohan Chi, et al.
发布日期: 2026-07-06
arXiv ID: 2607.05394v1
PDF 链接: 下载 PDF
背景与动机
近年来,基于可验证奖励的强化学习(RLVR)已成为提升大语言模型推理能力的核心后训练范式。从 DeepSeek-R1 到各类开源推理模型,这一方法在数学、编程等任务中取得了显著突破。然而,RLVR 的高昂成本与模型规模紧密绑定:每一步更新都要求当前策略生成大量推理轨迹(rollout),模型越大,单条轨迹耗时越长,强化学习迭代越昂贵。当目标模型不断扩展时,每次都为每个新强模型从头运行 RLVR,极易使后训练本身成为整个流程的算力瓶颈。
本文提出一种弱到强后训练范式——Direct On-Policy Distillation(Direct-OPD),核心思路是:将 RL 运行在较小的便宜模型上,然后将小模型 RL 训练学到的 “改进方向” 提取出来,迁移到更强的目标模型中。与传统知识蒸馏不同,我们不直接模仿小模型 RL 结束后的最终策略,因为该策略混合了 RL 带来的能力提升与小模型本身的容量上限,当学生模型能力已超过教师时,盲目模仿反而会拉低性能(例如 R1-Distill-7B 去模仿 JustRL-1.5B 时,准确率从 56.7% 降至约 50%)。Direct-OPD 希望传递的是RL 引起的策略偏移(policy shift),而非教师的绝对输出分布。
核心方法:将策略偏移用作隐式奖励
Direct-OPD 的关键创新在于对比一对弱模型检查点:RL 前的参考策略 与 RL 后的策略 ,定义教师策略偏移为对数概率之差:
正值表示 RL 使教师更倾向于某个动作,负值则相反。这一偏移量并非随意定义的启发式信号,而是具有严格的奖励解释。在 KL 正则化 RL 的目标下,最优策略满足 ,从而 (忽略常数)。因此,一对(参考 RL 前,RL 后)检查点天然存储了隐式奖励——我们只需读出两者的对数比,便可反向重构出训练教师时使用的奖励信号,无需显式奖励模型,也无需在目标模型上运行任何带稀疏奖励的 RL。
为了让这个奖励信号作用于更强学生,Direct-OPD 构建了如下目标:
学生 被鼓励最大化教师策略偏移的期望,同时通过 KL 惩罚项锚定在其自身初始模型 上。这个目标在数学上等价于用教师的隐式奖励对学生执行 KL 正则化 RL,只是奖励完全来自一对小模型检查点,学生无需接触任何真实的可验证奖励函数。
在实现上,策略偏移按自回归结构天然分解为逐 token 稠密奖励:
表示教师 RL 鼓励该 token,反之抑制。学生在自己采样轨迹的每个状态下,只考虑其 top-k 候选 token 集合并做 renormalize。为了降低梯度方差,Direct-OPD 采用了 Rao-Blackwellized 估计:在每一时间步,对 top-k 内的所有动作 计算梯度 ,并用学生自身上述集合上的重归一化概率 与 的乘积作为权重(该权重被 stop-gradient 处理,以保证它是静态系数)。再加上对 KL 惩罚的标准实现,整个训练得以在 verl 等框架中高效完成。
由于教师奖励的尺度(由教师 RL 的 决定)不可观测,固定 KL 系数 很难在不同教师-学生对之间通用。Direct-OPD 引入一个轻量级自适应控制器:根据每个训练批次中学生加权平均教师偏移的符号微调 。若平均偏移为正,说明学生当前访问状态上教师 RL 普遍鼓励动作,则增大 以增强锚定,防止过度放大局部信号;若平均偏移为负,则减小 ,让梯度更自由地将概率移离教师 RL 抑制的 token。
创新与贡献
Direct-OPD 将传统蒸馏范式从 “模仿最终策略” 转变为 “传递改进方向”,并系统地利用了 KL 正则化 RL 中的策略-奖励对偶性质。其贡献可概括为:
- 弱到强后训练范式:将小模型 RL 重新定位为隐式奖励的廉价生成器,而非最终行为的模板。
- 信号提取简洁且通用:仅需一个参考检查点和 RL 后检查点,即可产生密集奖励,适用于不同教师对和不同学生模型家族。
- 性能与效率兼具:Qwen3-1.7B 在 AIME 2024 上从 48.3% 提升至 62.4%,仅需 8 张 A100 训练约 4 小时;在与直接 7B 模型 RL 匹配 RL 步数的对比中,弱到强路径以更少的算力获得了更高精度。
- 支持顺序组合:多个独立教师(如 JustRL 和 QuestA)的策略偏移可以先后施加给同一学生,累积各自的增益,展示出不同 RL 运行习得能力可合并的潜力。
实验结果分析
实验覆盖了多组教师对和多种学生模型,得出几个关键结论:
- 跨能力提升:即使初始准确率已经超过后 RL 教师(如 R1-Distill-7B、Qwen3-4B),学生依然能从弱教师的策略偏移中获益。这表明 Direct-OPD 确实传递了 RL 发现的方向性知识,而不是简单拉平到教师水平。
- 计算效率显著优于直接大型 RL:在相同 RL 步数预算下,先在 1.5B 模型上运行 RL 再用 Direct-OPD 迁移至 7B,比直接在 7B 上 RL 效果更好,且总 GPU 小时大幅减少(小模型 RL + 约 4 小时转移)。转移阶段因为只涉及小教师模型做前向 “打分”,不成为速度瓶颈。
- 行为分析揭示机制:Direct-OPD 不要求学生与教师之间具有高 top-k token 重叠,跨架构迁移时重叠度很低却仍然有效,说明它利用的是教师 shift 在学生自己状态上的局部排序,而非模仿教师分布。同时学生策略的熵未崩溃,训练后策略在远超训练时使用的短响应长度(2k tokens)的长 rollout 上依然明显朝向教师 RL 偏移方向,证明短窗口训练已足以捕获可泛化的改进信号,而过长的响应(如 6k)则可能引入尾部不可靠信号导致验证性能下降。
- 自适应 KL 的重要性:固定 KL 系数的最优值高度依赖教师-学生对,而自适应 KL 能将平均教师偏移逐步拉向零附近的平衡区域,使学生既不忽略教师 shift,也不因信号不可靠而过度漂移。
实践应用建议
对于实际部署大模型后训练管线的团队,Direct-OPD 提供了若干实践启示:
- 小模型先行探索,大模型廉价受益:可以将小模型视为强化学习方向的快速探针。在一个小规模(如 1.5B~4B)模型上运行 RLVR,获得几个检查点对,即可提取出 “能力提升方向”,然后通过 Direct-OPD 泛化到更大更强的目标模型上,大幅降低 RL 算力开销。
- 选择合适的响应长度和 KL 控制:训练时采用适中短响应(如 2k tokens)往往能捕获可靠的学习信号,避免尾部噪声。自适应 KL 系数可作为一种方便的调节器,省去为每一对教师-学生手动搜索最佳惩罚系数的麻烦。
- 多教师信号组合:不同 RL 运行(不同数据、不同奖励设置)可能学到互补的能力(如数学严谨性、证明完整性等)。利用 Direct-OPD 的顺序组合能力,可以像叠加技能模块一样分阶段注入不同教师的改进方向,构建出综合能力更强的学生模型。
- 与现有蒸馏/RL 管道兼容:Direct-OPD 完全基于 on-policy 蒸馏接口(top-k、agent rollout),可直接嵌入现有 verl 等 RL 训练框架中,且所需教师模型小,推理开销低,易于在生产环境中快速迭代。
未来发展方向
Direct-OPD 开辟了 “将 RL 结果视为可复用隐式信号” 的新视角,未来可沿多个方向深入:
- 教师 shift 质量的自适应评估:如何自动判断哪个 RL 检查点(或哪对教师)对给定学生最有益?当前仍依赖人工选择或步数扫描,未来可发展基于学生状态分布和教师 shift 可靠性度量的自动选择标准。
- 更复杂的多教师融合:除了顺序组合,或许可以通过加权、门控等方式同时利用多个教师 shift,甚至让不同教师在不同推理阶段提供信号,实现更精细的能力集成。
- 扩展至非推理任务:目前 Direct-OPD 在数学推理上验证有效,其背后原理(将Δ作为稠密奖励)同样适用于代码、安全对齐等可通过 RLVR 优化的场景,值得进一步探索泛化性。
- 理论分析:教师 shift 与学生分布偏移的关系,以及 KL 控制的收敛性质,仍有理论深化空间,以更好地指导实践中的超参数设置和训练策略。
总结
Direct-OPD 为弱到强泛化提供了一种简洁而高效的工具:它不把 RL 结束的小模型当作模仿对象,而是将其 RL 前后的变化解读为可泛化的改进信号,直接应用于更强学生的 on-policy 状态上。实验证明,这一方法不仅在算力上远优于对大型模型直接 RL,还能提升那些本身已优越于教师的学生模型,并支持多教师能力顺序组合。这一成果不仅改变了我们对 “RL 后模型重用” 的认知,也为未来更灵活、更经济的 LLM 后训练生态奠定了基础。