传递接力棒:轨迹接力的同策略蒸馏
Pass the Baton: Trajectory-Relayed On-Policy Distillation
论文信息
标题: Pass the Baton: Trajectory-Relayed On-Policy Distillation
作者: Haolei Xu, Xiaowen Xu, Haiwen Hong, et al.
发布日期: 2026-07-28
arXiv ID: 2607.26057v1
PDF 链接: 下载 PDF
3 分钟速览
-
研究问题 针对在线策略蒸馏(OPD)中,学生模型生成推理链时容易 “一步错、步步错” 的前缀失败问题,导致后续训练信号不可靠、计算浪费。
-
核心方法 提出Relay-OPD:在线检测师生模型在同一前缀下的 “反思 vs 继续” 分歧,在错误萌芽点让教师短暂接管,生成纠正片段后交还学生,最终在整条拼接轨迹上蒸馏;全程无需外部标签或奖励模型。
-
关键结果 在 Qwen3-1.7B 学生上,Relay-OPD 平均准确率46.96%,比标准 OPD 高+5.73%,比最强干预基线 FastOPD 高+1.49%;同时训练轨迹长度缩短超过50%(见论文表 1)。
-
主要局限 实验仅限于数学推理和 Qwen3 系列模型;当师生能力差距缩小时收益可能减弱;反射词集需针对不同模型家族调整(附录 F)。
-
适合读者 关注大语言模型训练、知识蒸馏、推理增强、强化学习的研究者与工程师,尤其是希望从强模型向弱模型高效迁移推理能力的从业者。
论文背景和研究动机
在大语言模型的后训练中,如何将强模型(教师)的能力高效传递给弱模型(学生)是核心挑战。传统的离线蒸馏(如 SFT、KD)使用教师生成的数据训练学生,但存在训练‑推理分布偏移。在线策略蒸馏(On‑Policy Distillation, OPD)通过让学生用自己的策略采样轨迹,再由教师对这些轨迹提供词元级监督,将学习锚定在学生实际访问的状态上,显著提升了迁移效率。
然而,OPD 也暴露了一个新问题:学生自己的轨迹不可避免地包含错误。在长链推理任务中,一旦学生早期陷入错误方向(例如误判一个中间结论),后续的所有生成都建立在这个偏差上,形成前缀失败(prefix failure)。这种长段落的错误延续不仅产生不可靠的训练信号,还浪费大量训练计算。现有改进方法各有缺陷:固定长度截断(如 FastOPD)在不关心失败位置时就截断;离线重写(如 TRD)在轨迹完成后才修复,会留下明显修复痕迹;词元级混合(如 SKD)依赖通用分布差异,无法精准识别推理方向错误。一个关键的缺失是:在线地、从推理状态本身出发,精准识别并纠正前缀失败。
该论文受一个简单观察启发:在失败的学生前缀上,教师和学生接下来的生成方向有体系性不对称——教师倾向于停下来反思、掉头重来,而学生倾向于在原有错误方向上一意孤行(图 1a)。这种不对称无需任何外部标签或验证器就可以在生成时被检测到,从而指出学生推理出错的位置。论文称这样的位置为交接触发点(handoff trigger)。预先的干预实验进一步表明,纠正可以极其局部(只替换那个反思词就能提升 7.23% 准确率,而教师词仅占总词的 0.35%)且价值前移(越早干预越有效)。因此,一个清晰的设计浮现出来:在错误萌芽点,由教师短暂接棒、推送一个反思片段,再让回学生继续,从而使整个训练轨迹既保留学生的策略特性,又避免了前缀失败蔓延。
核心方法和技术细节
Relay-OPD 的工作流程可概括为三个环节:检测、接力、蒸馏。
1. 交接触发机制
在生成过程中,Relay-OPD 持续监视当前前缀。设反射词集 (如 But, Wait, However 等)。对于前缀 ,计算:
- 教师的最可能下一词 ;
- 学生的 top‑ 支持集 。
当 而 时,触发交接。此时教师倾向反思,学生却不打算反思,呈现出方向性分歧。超参数 控制触发灵敏度: 越小,对分歧的容忍度越低,越容易触发。
2. 接力轨迹构建
一个中继预算 限制了教师接管的次数 和每次接管的长度(以段落为单位,用 \n\n 分隔)。当触发发生后:
- 教师从该位置开始,先输出一个反射词(作为教师腿的起始),再生成 个段落;
- 若 ,则教师腿仅包含那个反射词,实现最小纠正;
- 教师腿结束后,学生从扩展后的前缀恢复生成,直到再次触发或预算用完;
- 次接棒后,当前轨迹终止。
这样,生成的接力轨迹 由学生腿和教师腿交替构成,干预集中在早期触发点,最大限度保持轨迹与学生策略的同分布性。
3. 优化目标
Relay‑OPD 不采用模式覆盖性的前向 KL,而是对整条接力轨迹上的每个词元 计算逆向 KL 风格的单样本优势:
并使用 PPO 风格的裁剪损失更新学生策略。这一设计使学生在教师纠正的上下文中,有选择地吸收教师的矫正信号,而不是全盘模仿教师的分布。
4. 高效实现
为了避免两套生成引擎频繁切换的调度开销,Relay‑OPD 将整个接力过程统一到 推测解码(speculative decoding) 框架中:学生作为草案模型,教师作为目标模型。状态机根据预算和触发信号决定当前处于学生腿()还是教师腿(),并在教师腿内执行标准推测解码接受/拒绝采样,从而保证生成的教师腿在分布上等同于教师直接从扩展前缀生成。触发所需的 和 可由推理解码中的验证步骤无额外开销地获得。
创新点和贡献
-
发现并利用了师生延续不对称性 论文首次明确指出,在失败前缀上教师倾向于反思而学生倾向于继续,并将这种可在线检测的分歧转化为无标签的交接触发信号,无需任何外部监督。这一洞察为前缀失败的在线纠正提供了零额外成本的信号源。
-
设计了预算中继轨迹构建机制 不同于固定截断或离线重写,Relay‑OPD 在推理状态驱动下,于错误萌芽点进行局部的、长度有限的教师接管。 预算一方面把干预集中在高价值的早期触发上,另一方面限制了轨迹偏离学生策略的程度,保证了 on‑policy 蒸馏的优势不被破坏。
-
实现了基于推测解码的统一生成引擎 将学生和教师的交替生成整合到一个推测解码流程中,极大降低了工程复杂度,同时确保了教师腿的分布正确性。这为多模型交替生成任务提供了一种优雅的实现范式。
-
取得显著的性能与效率双提升 在 1.7B 学生上,Relay‑OPD 的平均准确率提升 5.73%(vs OPD)和 1.49%(vs FastOPD),训练轨迹长度缩短逾 50%;0.6B 学生同样获得一致提升(表 1),充分验证了方法的有效性。
实验结果分析
实验使用 Qwen3‑4B‑Instruct‑2507 作为教师,两个不同尺寸的 Qwen3‑Non‑Thinking 学生(0.6B、1.7B),在 DAPO‑Math‑17K 英文子集上训练,8 个数学推理基准上评测。
主结果(表 1)
- 对于 1.7B 学生:标准 OPD 平均 41.23,Relay‑OPD 达到 46.96(+5.73%);FastOPD 最佳截断长度为 4096 时达到 45.47,低 1.49%。在竞争性强的 AIME 2025/2026 上,Relay‑OPD 分别提升 7.29% 和 7.19%,优势明显。
- 对于 0.6B 学生:OPD 平均 28.03,Relay‑OPD 31.04(+3.01%),并超越 FastOPD 的 30.42。
- 在 Pass@k 指标上(图 5),Relay‑OPD 也全面优于 OPD,且推理时的回答长度比 FastOPD 更短,显示它教会学生更早地纠正错误,输出更简洁。
训练动态(图 6)
- 触发率(预算耗尽的轨迹比例)随训练下降,从 75‑85% 降至 50‑60%,表明学生策略逐渐改善;教师词比例从 13% 降至 2‑3%,干预需求减少。
- 策略熵比较:Relay‑OPD 的熵持续高于 OPD 和 FastOPD,因为教师接管改变了后续前缀,带来了更多探索机会,可能促进了更好的收敛点。
消融实验
- 教师腿的价值:当 时,“仅触发就停止” 的变体(Trigger‑stop)平均 43.48;加上长度为 3 的教师腿后升至 46.25(+2.77%),说明纠正上下文和局部推理示范远非早期终止可比。
- 教师腿的优化目标:使用被拒绝的学生草案词元(44.56)或教师前向 KL(44.08)均远差于 Relay‑OPD 默认的单样本逆向 KL(46.96),证明选择性吸收教师信号至关重要。
超参数敏感性(图 7、表 6)
- 预算: 最优; 过大或 过长(如 )会偏离学生策略太远,性能反而下降。
- 值: 最佳;过小或过大均不佳,说明需要适中的分歧阈值。
综上,Relay‑OPD 在准确性、训练效率、回答紧凑性上均表现出显著优势,且各组件贡献明确。
实践建议
Relay‑OPD 的核心思想(在线检测方向分歧、预算化局部纠正)具有很强的通用性,可迁移至各类强弱模型蒸馏场景:
-
适配新的模型家族 反射词集 是本方法中唯一需人工指定的组件。在跨模型家族使用时,应首先分析目标模型的反思性关键词,收集其习惯的转折词、质疑词。例如,代码生成模型可能用
# actually,# wait等注释语句,需相应扩展。 -
预算调参策略 论文的灵敏度分析(第 4.5 节)提供了很好的起始参考:先固定 ,扫 (0~5),再固定最优 扫 。通常 和 能在纠正与保真间取得平衡。若学生基础能力更弱,可适当增加 或 。
-
触发敏感度调整 值控制触发频率: 越小,仅当学生几乎不倾向反思时才触发,适合希望减少干预的场景; 较大时触发更频繁,可能更适合差距大的师生对。可先用少量数据跑生成轨迹,观察触发率,使触发率在 30‑50% 左右为宜。
-
与其它后训练技术结合 Relay‑OPD 可与 PPO 风格的奖励混淆,或与拒绝采样结合。例如,仅在回答错误的样本上应用接力,或在接力的同时加入习题的正确性奖励,有望进一步提升。
-
工程实现参考 文中展示的基于推测解码的统一生成管道,可极大降低交替生成的管理复杂度。如果你的训练框架已支持推测解码,可直接复用;否则,也可以用两套模型 API 加上状态机调度实现,但需注意通信开销。
通过仔细配置反射词集和预算,Relay‑OPD 有望在代码生成、智能体规划等需要长链推理的强‑弱蒸馏任务中,取得类似的效率与准确率提升。