传递接力棒:轨迹接力的同策略蒸馏

Pass the Baton: Trajectory-Relayed On-Policy Distillation

arXiv: 2607.26057v1

论文信息

标题: Pass the Baton: Trajectory-Relayed On-Policy Distillation

作者: Haolei Xu, Xiaowen Xu, Haiwen Hong, et al.

发布日期: 2026-07-28

arXiv ID: 2607.26057v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题 针对在线策略蒸馏(OPD)中,学生模型生成推理链时容易 “一步错、步步错” 的前缀失败问题,导致后续训练信号不可靠、计算浪费。

  • 核心方法 提出Relay-OPD:在线检测师生模型在同一前缀下的 “反思 vs 继续” 分歧,在错误萌芽点让教师短暂接管,生成纠正片段后交还学生,最终在整条拼接轨迹上蒸馏;全程无需外部标签或奖励模型。

  • 关键结果 在 Qwen3-1.7B 学生上,Relay-OPD 平均准确率46.96%,比标准 OPD 高+5.73%,比最强干预基线 FastOPD 高+1.49%;同时训练轨迹长度缩短超过50%(见论文表 1)。

  • 主要局限 实验仅限于数学推理和 Qwen3 系列模型;当师生能力差距缩小时收益可能减弱;反射词集需针对不同模型家族调整(附录 F)。

  • 适合读者 关注大语言模型训练、知识蒸馏、推理增强、强化学习的研究者与工程师,尤其是希望从强模型向弱模型高效迁移推理能力的从业者。


论文背景和研究动机

在大语言模型的后训练中,如何将强模型(教师)的能力高效传递给弱模型(学生)是核心挑战。传统的离线蒸馏(如 SFT、KD)使用教师生成的数据训练学生,但存在训练‑推理分布偏移。在线策略蒸馏(On‑Policy Distillation, OPD)通过让学生用自己的策略采样轨迹,再由教师对这些轨迹提供词元级监督,将学习锚定在学生实际访问的状态上,显著提升了迁移效率。

然而,OPD 也暴露了一个新问题:学生自己的轨迹不可避免地包含错误。在长链推理任务中,一旦学生早期陷入错误方向(例如误判一个中间结论),后续的所有生成都建立在这个偏差上,形成前缀失败(prefix failure)。这种长段落的错误延续不仅产生不可靠的训练信号,还浪费大量训练计算。现有改进方法各有缺陷:固定长度截断(如 FastOPD)在不关心失败位置时就截断;离线重写(如 TRD)在轨迹完成后才修复,会留下明显修复痕迹;词元级混合(如 SKD)依赖通用分布差异,无法精准识别推理方向错误。一个关键的缺失是:在线地、从推理状态本身出发,精准识别并纠正前缀失败。

该论文受一个简单观察启发:在失败的学生前缀上,教师和学生接下来的生成方向有体系性不对称——教师倾向于停下来反思、掉头重来,而学生倾向于在原有错误方向上一意孤行(图 1a)。这种不对称无需任何外部标签或验证器就可以在生成时被检测到,从而指出学生推理出错的位置。论文称这样的位置为交接触发点(handoff trigger)。预先的干预实验进一步表明,纠正可以极其局部(只替换那个反思词就能提升 7.23% 准确率,而教师词仅占总词的 0.35%)且价值前移(越早干预越有效)。因此,一个清晰的设计浮现出来:在错误萌芽点,由教师短暂接棒、推送一个反思片段,再让回学生继续,从而使整个训练轨迹既保留学生的策略特性,又避免了前缀失败蔓延。


核心方法和技术细节

Relay-OPD 的工作流程可概括为三个环节:检测、接力、蒸馏。

1. 交接触发机制

在生成过程中,Relay-OPD 持续监视当前前缀。设反射词集 R\mathcal{R}(如 But, Wait, However 等)。对于前缀 hh,计算:

  • 教师的最可能下一词 aT(h)=arg⁡max⁡vπT(v∣h)a^T(h)=\arg\max_v \pi_T(v|h);
  • 学生的 top‑KK 支持集 KS(h)=TopKK(πθˉ(⋅∣h))\mathcal{K}_S(h)=\text{TopK}_K(\pi_{\bar{\theta}}(\cdot|h))。

当 aT(h)∈Ra^T(h)\in\mathcal{R} 而 KS(h)∩R=∅\mathcal{K}_S(h)\cap\mathcal{R}=\varnothing 时,触发交接。此时教师倾向反思,学生却不打算反思,呈现出方向性分歧。超参数 KK 控制触发灵敏度:KK 越小,对分歧的容忍度越低,越容易触发。

2. 接力轨迹构建

一个中继预算 (M,L)(M,L) 限制了教师接管的次数 MM 和每次接管的长度(以段落为单位,用 \n\n 分隔)。当触发发生后:

  • 教师从该位置开始,先输出一个反射词(作为教师腿的起始),再生成 LL 个段落;
  • 若 L=0L=0,则教师腿仅包含那个反射词,实现最小纠正;
  • 教师腿结束后,学生从扩展后的前缀恢复生成,直到再次触发或预算用完;
  • MM 次接棒后,当前轨迹终止。

这样,生成的接力轨迹 zz 由学生腿和教师腿交替构成,干预集中在早期触发点,最大限度保持轨迹与学生策略的同分布性。

3. 优化目标

Relay‑OPD 不采用模式覆盖性的前向 KL,而是对整条接力轨迹上的每个词元 ztz_t 计算逆向 KL 风格的单样本优势:

AtRelay=log⁡πT(zt∣htz)−log⁡πθˉ(zt∣htz)A_t^{\text{Relay}} = \log\pi_T(z_t|h_t^z) - \log\pi_{\bar{\theta}}(z_t|h_t^z)

并使用 PPO 风格的裁剪损失更新学生策略。这一设计使学生在教师纠正的上下文中,有选择地吸收教师的矫正信号,而不是全盘模仿教师的分布。

4. 高效实现

为了避免两套生成引擎频繁切换的调度开销,Relay‑OPD 将整个接力过程统一到 推测解码(speculative decoding) 框架中:学生作为草案模型,教师作为目标模型。状态机根据预算和触发信号决定当前处于学生腿(S\mathsf{S})还是教师腿(T\mathsf{T}),并在教师腿内执行标准推测解码接受/拒绝采样,从而保证生成的教师腿在分布上等同于教师直接从扩展前缀生成。触发所需的 aT(h)a^T(h) 和 ϕ(h)\phi(h) 可由推理解码中的验证步骤无额外开销地获得。


创新点和贡献

  1. 发现并利用了师生延续不对称性 论文首次明确指出,在失败前缀上教师倾向于反思而学生倾向于继续,并将这种可在线检测的分歧转化为无标签的交接触发信号,无需任何外部监督。这一洞察为前缀失败的在线纠正提供了零额外成本的信号源。

  2. 设计了预算中继轨迹构建机制 不同于固定截断或离线重写,Relay‑OPD 在推理状态驱动下,于错误萌芽点进行局部的、长度有限的教师接管。(M,L)(M,L) 预算一方面把干预集中在高价值的早期触发上,另一方面限制了轨迹偏离学生策略的程度,保证了 on‑policy 蒸馏的优势不被破坏。

  3. 实现了基于推测解码的统一生成引擎 将学生和教师的交替生成整合到一个推测解码流程中,极大降低了工程复杂度,同时确保了教师腿的分布正确性。这为多模型交替生成任务提供了一种优雅的实现范式。

  4. 取得显著的性能与效率双提升 在 1.7B 学生上,Relay‑OPD 的平均准确率提升 5.73%(vs OPD)和 1.49%(vs FastOPD),训练轨迹长度缩短逾 50%;0.6B 学生同样获得一致提升(表 1),充分验证了方法的有效性。


实验结果分析

实验使用 Qwen3‑4B‑Instruct‑2507 作为教师,两个不同尺寸的 Qwen3‑Non‑Thinking 学生(0.6B、1.7B),在 DAPO‑Math‑17K 英文子集上训练,8 个数学推理基准上评测。

主结果(表 1)

  • 对于 1.7B 学生:标准 OPD 平均 41.23,Relay‑OPD 达到 46.96(+5.73%);FastOPD 最佳截断长度为 4096 时达到 45.47,低 1.49%。在竞争性强的 AIME 2025/2026 上,Relay‑OPD 分别提升 7.29% 和 7.19%,优势明显。
  • 对于 0.6B 学生:OPD 平均 28.03,Relay‑OPD 31.04(+3.01%),并超越 FastOPD 的 30.42。
  • 在 Pass@k 指标上(图 5),Relay‑OPD 也全面优于 OPD,且推理时的回答长度比 FastOPD 更短,显示它教会学生更早地纠正错误,输出更简洁。

训练动态(图 6)

  • 触发率(预算耗尽的轨迹比例)随训练下降,从 75‑85% 降至 50‑60%,表明学生策略逐渐改善;教师词比例从 13% 降至 2‑3%,干预需求减少。
  • 策略熵比较:Relay‑OPD 的熵持续高于 OPD 和 FastOPD,因为教师接管改变了后续前缀,带来了更多探索机会,可能促进了更好的收敛点。

消融实验

  • 教师腿的价值:当 M=1M=1 时,“仅触发就停止” 的变体(Trigger‑stop)平均 43.48;加上长度为 3 的教师腿后升至 46.25(+2.77%),说明纠正上下文和局部推理示范远非早期终止可比。
  • 教师腿的优化目标:使用被拒绝的学生草案词元(44.56)或教师前向 KL(44.08)均远差于 Relay‑OPD 默认的单样本逆向 KL(46.96),证明选择性吸收教师信号至关重要。

超参数敏感性(图 7、表 6)

  • 预算:M=2,L=3M=2, L=3 最优;MM 过大或 LL 过长(如 L=5L=5)会偏离学生策略太远,性能反而下降。
  • KK 值:K=5K=5 最佳;过小或过大均不佳,说明需要适中的分歧阈值。

综上,Relay‑OPD 在准确性、训练效率、回答紧凑性上均表现出显著优势,且各组件贡献明确。


实践建议

Relay‑OPD 的核心思想(在线检测方向分歧、预算化局部纠正)具有很强的通用性,可迁移至各类强弱模型蒸馏场景:

  1. 适配新的模型家族 反射词集 R\mathcal{R} 是本方法中唯一需人工指定的组件。在跨模型家族使用时,应首先分析目标模型的反思性关键词,收集其习惯的转折词、质疑词。例如,代码生成模型可能用 # actually, # wait 等注释语句,需相应扩展。

  2. 预算调参策略 论文的灵敏度分析(第 4.5 节)提供了很好的起始参考:先固定 M=2M=2,扫 LL(0~5),再固定最优 LL 扫 MM。通常 L=3∼4L=3\sim4 和 M=2M=2 能在纠正与保真间取得平衡。若学生基础能力更弱,可适当增加 MM 或 LL。

  3. 触发敏感度调整 KK 值控制触发频率:KK 越小,仅当学生几乎不倾向反思时才触发,适合希望减少干预的场景;KK 较大时触发更频繁,可能更适合差距大的师生对。可先用少量数据跑生成轨迹,观察触发率,使触发率在 30‑50% 左右为宜。

  4. 与其它后训练技术结合 Relay‑OPD 可与 PPO 风格的奖励混淆,或与拒绝采样结合。例如,仅在回答错误的样本上应用接力,或在接力的同时加入习题的正确性奖励,有望进一步提升。

  5. 工程实现参考 文中展示的基于推测解码的统一生成管道,可极大降低交替生成的管理复杂度。如果你的训练框架已支持推测解码,可直接复用;否则,也可以用两套模型 API 加上状态机调度实现,但需注意通信开销。

通过仔细配置反射词集和预算,Relay‑OPD 有望在代码生成、智能体规划等需要长链推理的强‑弱蒸馏任务中,取得类似的效率与准确率提升。