通过直接同策略蒸馏实现弱到强泛化

Weak-to-Strong Generalization via Direct On-Policy Distillation

arXiv: 2607.05394v1

论文信息

标题: Weak-to-Strong Generalization via Direct On-Policy Distillation

作者: Shiyuan Feng, Huan-ang Gao, Haohan Chi, et al.

发布日期: 2026-07-06

arXiv ID: 2607.05394v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:大模型强化学习推理训练成本随规模急剧升高,论文探索如何复用小型模型的 RL 成果来高效提升更强模型,即弱到强泛化。
  • 核心方法:不模仿弱老师最终的策略,而是提取其 RL 前后的策略偏移(对数比)作为稠密隐式奖励,直接在大学生的在线采样状态上训练。
  • 关键结果:使用 8 张 A100 约 4 小时,将 Qwen3-1.7B 在 AIME 2024 的精度从 48.3% 提升至 62.4%,且该方法在同等计算量下优于直接对大模型做 RL。
  • 主要局限:迁移效果依赖于老师策略偏移在学生访问状态上的可信度;最优的回放长度和 KL 系数随师生配对变化,尚无统一设定。
  • 适合读者:从事大语言模型推理、强化学习、知识蒸馏以及想降低后训练成本的研究者和工程师。

论文背景和研究动机

以可验证奖励进行的强化学习(RLVR)已广泛用于增强语言模型的数学与推理能力。但 RLVR 的成本与模型规模紧密挂钩:每一步更新都需要当前策略生成大量 rollouts 并接收稀疏的结果反馈。随着目标模型越来越大,从头对每个强模型重新运行 RL 正在成为后训练的瓶颈。

作者提出 Direct On-Policy Distillation(Direct‑OPD),将小模型的 RL 结果当作隐式奖励信号,直接迁移给更强的学生模型。核心洞察是:小模型跑 RL 很便宜,但它最终学到的策略混杂了 RL 带来的改进与模型自身的容量天花板。如果直接让学生模仿弱老师的最终分布,可能反而拉低学生原本更强的表现(例如 R1‑Distill‑7B 用标准在线蒸馏模仿 JustRL‑1.5B,精度反而从 56.7 掉到约 50,见图 1)。因此,Direct‑OPD 只迁移 RL 带来的 “变化”——即老师 RL 前后检测点之间的策略偏移,用对数比表示,而不是老师的绝对策略。

核心方法和技术细节

Direct‑OPD 将老师的 RL 诱导偏移定义为:

ΔT(y∣x)=log⁡πT(y∣x)−log⁡πTref(y∣x)\Delta_T(y|x) = \log \pi_T(y|x) - \log \pi_{T_{\text{ref}}}(y|x)

其中 πTref\pi_{T_{\text{ref}}} 是老师 RL 前的参考模型,πT\pi_T 是 RL 后的模型。在 KL 正则化 RL 框架下,该偏移等价于一个隐式奖励(缩放后加上仅依赖提示的常数),这从策略优化的闭合解可直接推出(见论文 2.2 节)。因此,Direct‑OPD 其实是用一对小型检查点编码了一个稠密奖励,而无需显式奖励模型。

在训练阶段,学生从自己的当前策略 πθ\pi_\theta 采样 rollouts,并在每个前缀状态 sts_t 读取学生自己的 top‑kk 候选动作。接着计算每个候选 token vv 的 “教师奖励” rt(v)=log⁡πT(v∣st)−log⁡πTref(v∣st)r_t(v) = \log\pi_T(v|s_t) - \log\pi_{T_{\text{ref}}}(v|s_t)。Direct‑OPD 结合这些奖励与学生的 top‑kk 动作概率,构造 Rao‑Blackwellized 的局部梯度估计(见公式 13–15)。具体实现中将候选 token 的奖励加权(以学生概率为权重)并作梯度停止,然后乘上该 token 对数似然的梯度。同时增加一个 KL 散度项,将学生正则化到自己的初始检测点 πS\pi_S,防止走偏。

由于教师偏移的尺度不可还原(教师 RL 的奖励系数 β\beta 未知),Direct‑OPD 引入自适应 KL 系数控制。它根据当前批次学生访问状态上老师奖励的符号动态调整 KL 项权重:平均奖励为正时增大 KL 约束,避免过度放大局部信号;为负时减小 KL 约束,允许学生压减被 RL 降低的 token。这一简单控制器(公式 16)使得方法在不同师生配对上更鲁棒。

创新点和贡献

论文的主要贡献是将小模型 RL 重新定位为 “廉价优化方向发现器”,而非最终策略提供者。Direct‑OPD 的创新性体现在:

  1. 转移 RL 偏移而非策略:明确区分 “变化” 与 “最终分布”,只提取老师 RL 带来的方向性信号。这解决了弱老师策略即使低于学生初始水平也可利用的悖论。
  2. 隐式奖励的逆向使用:利用策略与奖励的对偶关系,从一对检测点读出稠密奖励,避免了训练显式奖励模型或在大目标上运行稀疏 feedback RL。
  3. 跨家族、跨师生对的泛化:在两种不同来源的老师对(JustRL‑1.5B / QuestA‑Nemotron‑1.5B)和三种学生(Qwen3‑1.7B/4B、R1‑Distill‑7B)上均稳定提升(见表 1),包括学生起点已高于老师的场景。
  4. 计算效率的实证:同等 RL 步数下,先在小模型上跑 RL 再用 Direct‑OPD 转移给大模型,比直接用大模型跑 RL 得到更高精度(图 3 中 T600–T1500 点均高于 direct‑RL 曲线),且转移阶段仅需约 4 GPU 时(8 张 A100),远低于完整 RL。
  5. 可组合性:多个独立 RL 运行产生的策略偏移可以顺序施加在同一学生上(见图 4),展现直接组合不同能力来源的潜力。

实验结果分析

实验部分围绕三个研究问题展开:

  • RQ1:小老师能否改善强的多的学生? 表 1 和图 2 显示,JustRL 1.5B 教师偏移使 Qwen3‑1.7B、Qwen3‑4B、R1‑Distill‑7B 均在 AIME 2024 和 2025 上取得提升,最明显的 Qwen3‑1.7B 从 48.3% → 62.4%。即使对于起点(72.5%)已经超出老师最终精度(51.3%)的 Qwen3‑4B,仍然获得了 5.1 个点的提升。QuestA 教师偏移同样带来一致增益,证明方法不依赖于特定 RL 训练流程。

  • RQ2:匹配计算量时是否优于直接 RL? 在小模型 R1‑Distill‑1.5B 上用 RL 逐步训练至不同步骤,保存其 RL 前后检查点;再用 Direct‑OPD 将对应策略偏移转移给 R1‑Distill‑7B。图 3 显示,随着小模型 RL 步数增加(从 T300 到 T1500),转移后的大模型精度持续高于同等总计算量下直接在大模型上运行的 RL,且 T900–T1500 的优势尤为明显。Left 图将成本换算为 GPU‑小时:小模型 RL 耗时约 160 小时(32 A100),转移仅加约 4 小时(8 A100),而直接在大模型上 RL 耗时约 320 小时。这表明弱到强转移能更高效地利用 RL 信号。

  • RQ3:能否顺序组合多个偏移? 将 JustRL 偏移先应用到 Qwen3‑1.7B,再继续用 QuestA 偏移训练,结果(图 4)显示 AIME 2024 从 48.3% → 62.4% → 63.8%,实现了能力的累积。

论文还对迁移机理做了深入分析:

  • 跨模式偏移不需要高重叠:测量学生与老师的 top‑kk 重叠度(图 5),跨家族(如 Nemotron → Qwen3‑1.7B)时重叠度很低,但仍然成功转移。熵分析(图 6)确认学生分布未坍缩。
  • 短回复训练影响长回复行为:用 2k 长度的回复训练,却能让模型在长达 ∼16k 的 rollout 上向老师正确方向偏移(图 8),而 6k 训练导致更偏但验证精度下降,推测后续状态上的老师信号不可靠。
  • KL 系数的关键作用:密集奖励的可靠性依赖于学生的采样分布。固定 KL 时,不同师生对的最佳值不同,且平均奖励本身并非单调决定验证精度。自适应 KL 能将平均奖励拉向接近零的平衡区间(图 9)。

实践建议

基于论文的方法和分析,以下建议可指导实际应用:

  1. 利用小模型 RL 作为先导:在大规模训练新模型前,可先在小模型上完成 RL 探索,得到一对预 RL 和后 RL 检查点。然后通过 Direct‑OPD 快速将发现的能力方向迁移到大模型,节约大量 GPU 资源。即使小模型终点精度不高,其 RL 偏移仍有价值。
  2. 监控学生分布,控制 KL 系数:实施时应配备类似的自适应 KL 控制器,根据当前批次的平均教师偏移符号调节正则化强度,避免学生进入教师信号不可信的区域。如果无法自适应,至少需要对师生配对扫描 KL 系数(论文中用 [0.8, 2.0] 范围)。
  3. 选择适中的训练回复长度:不必用全长的生成来训练,短回复(例如 2048 tokens)即可传递足够的信号,且能避免长序列末段教师信号噪声导致的精度下降。建议从 2k 长度起步,视验证曲线微调。
  4. 复用不同来源的政策偏移:如果已有多个经过验证的老师检测点对(来自不同的 RL 数据集或算法),可以尝试顺序应用它们,逐步提升同一学生模型。这为多阶段后训练流程提供了模块化选择。
  5. 在线蒸馏框架兼容:Direct‑OPD 复用现成的 online policy distillation 接口(top‑kk 概率读取),只需替换信号来源即可部署到现有 RL 蒸馏流程中,无需额外奖励模型。

总之,Direct‑OPD 提供了一种轻量、高效且可组合的弱到强迁移策略,有望成为大模型后训练成本优化的重要组件。