超越教师似然:用于长上下文推理的组校准同策略蒸馏

Beyond Teacher Likelihood: Group-Calibrated On-Policy Distillation for Long-Context Reasoning

arXiv: 2608.19181v1

论文信息

标题: Beyond Teacher Likelihood: Group-Calibrated On-Policy Distillation for Long-Context Reasoning

作者: Zhu Zhang, Jixun Wang, Xiaoang Xu, et al.

发布日期: 2026-08-19

arXiv ID: 2608.19181v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:长上下文任务中,on-policy distillation 的 token 级教师偏好与任务验证器的响应级奖励会出现分歧,且输入越长分歧越明显;论文研究如何在保留稠密教师信号的同时引入验证器校准。
  • 核心方法:提出 GC-OPD,先在每个 rollout 组内分别对验证器奖励和轨迹级 OPD 分数做 z-score 归一化,再用两者之差构造符号化残差,并通过 RACA 将残差分配到 token,叠加到原始 OPD 优势上。
  • 关键结果:在五个长上下文基准上,GC-OPD 使 Qwen3-4B 平均分从 29.08 提升到 40.47,Qwen3-8B 从 35.12 提升到 44.65;比 vanilla OPD 分别高 1.16 和 1.09 个百分点(表 2)。
  • 主要局限:残差系数 β\beta 在一个仅含 High-Recall Retrieval 任务的 231 例 GoLongRL 验证子集上选择,系数选择的跨任务泛化性未在论文中验证;组内或 token 级方差过小时,方法会退化为 vanilla OPD。
  • 适合读者:长上下文 LLM 训练、on-policy distillation、验证器反馈/RLVR、模型对齐与紧凑模型后训练的研究者和工程师。

论文背景和研究动机

On-policy distillation(OPD)让学生模型在其自身生成的响应上获得来自更强教师的 token 级指导。对每个采样 token,OPD 优势定义为教师 log 概率与学生 log 概率之差:

At(i)=log⁡πT(yt(i)∣ht(i))−log⁡πθold(yt(i)∣ht(i)).A_t^{(i)}=\log\pi_T(y_t^{(i)}\mid h_t^{(i)})-\log\pi_{\theta_{\mathrm{old}}}(y_t^{(i)}\mid h_t^{(i)}).

该信号的期望等于对应状态上的负逆向 KL(论文第 3.1 节),因此它衡量的是教师对采样 token 的偏好,而不是任务是否真正成功。

在长上下文任务中,正确答案往往需要聚合分散在远处的证据,并满足全局任务约束。学生模型更容易生成局部合理但全局不完整的响应。此时,token 级教师支持可能偏好一个遗漏关键证据的响应,而任务验证器会在响应级给出较低奖励。论文将这种现象称为 teacher–verifier disagreement。

论文在 Multi-Table Extraction 和 High-Recall Retrieval 两个任务上做了诊断:随输入长度增加,成对分歧率上升,OPD 偏好间隔由正转负。例如 Multi-Table Extraction 的成对分歧率从 8K 以下的 40.6% 上升到 32–64K 的 64.0%,OPD 偏好间隔从 +0.35+0.35 降到 −0.37-0.37(图 1)。这构成引入验证器校准的直接动机。

核心方法和技术细节

GC-OPD 由两部分组成:组相对残差构造与相对优势信用分配。

1. 组相对评估与符号残差

对每个 rollout 组内的 GG 个响应,论文先定义轨迹级 OPD 分数:

s(i)=1T(i)∑t=1T(i)At(i),s^{(i)}=\frac{1}{T^{(i)}}\sum_{t=1}^{T^{(i)}}A_t^{(i)},

然后分别对验证器奖励 R(i)R^{(i)} 和轨迹级 OPD 分数 s(i)s^{(i)} 做组内 z-score 归一化,得到 R~(i)=z(R(i))\tilde R^{(i)}=z(R^{(i)}) 和 s~(i)=z(s(i))\tilde s^{(i)}=z(s^{(i)})。残差定义为:

ρ(i)=R~(i)−s~(i).\rho^{(i)}=\tilde R^{(i)}-\tilde s^{(i)}.

残差符号表示分歧方向:验证器评估高于 OPD 评估时为正;幅度表示两者差异大小。该设计的关键在于不是直接加入归一化验证器奖励,而是减去 OPD 已经表达的那部分相对偏好。论文在第 4.3 节说明:当二者排序严格不一致时,残差排序与验证器偏好一致,从而将后续 token 级校正导向高奖励响应。

2. RACA:相对优势信用分配

轨迹级残差需要分配到 token。RACA 先把每个 token 的 OPD 优势相对响应均值做归一化:

ut(i)=At(i)−s(i)1T(i)∑v(Av(i)−s(i))2+ϵ,u_t^{(i)}=\frac{A_t^{(i)}-s^{(i)}}{\sqrt{\frac{1}{T^{(i)}}\sum_v(A_v^{(i)}-s^{(i)})^2+\epsilon}},

再映射为正的有界信用:

ct(i)=1+tanh⁡(ut(i)2),c_t^{(i)}=1+\tanh\left(\frac{u_t^{(i)}}{2}\right),

ct(i)∈(0,2)c_t^{(i)}\in(0,2)。最终 GC-OPD 优势为:

At′(i)=At(i)+βct(i)ρ(i).A_t^{\prime(i)}=A_t^{(i)}+\beta c_t^{(i)}\rho^{(i)}.

原始 OPD 优势仍作为基座,β=0\beta=0 时完全退化为 vanilla OPD。信用始终为正,因此只缩放残差,不反转其符号。实现上,当组内任一信号标准差过小时,ρ(i)=0\rho^{(i)}=0;当 token 级标准差过小时,ct(i)=1c_t^{(i)}=1,此时退化为均匀分配或 vanilla OPD(论文附录 B)。

创新点和贡献

论文列出三个贡献(论文第 1 节结尾)。第一个贡献是通过图 1 的诊断识别出两个任务的共同模式:输入长度增加时,轨迹级 OPD 分数与验证器奖励的对齐程度下降。该结论不是因果推断,论文仅描述在这两个任务和当前模型组合下的趋势。

第二个贡献是 GC-OPD 的残差形式。相比直接加入 R~(i)\tilde R^{(i)},ρ(i)=R~(i)−s~(i)\rho^{(i)}=\tilde R^{(i)}-\tilde s^{(i)} 只校正教师与验证器不一致的部分:两者一致时残差为 0,分歧越大修正越强。此设计保留 OPD 原有排序,同时利用分级奖励的幅度,而不只使用其排名。

第三个贡献是 RACA。它不判断 token 正确性,只按相对 OPD 优势分配残差;信用有界且恒正,避免绝对值分配丢失符号、或极端 token 权重的稳定性问题。

实验结果分析

主实验使用 Qwen3-4B 和 Qwen3-8B 学生、Qwen3-30B-A3B-Thinking-2507 教师,在 9,527 条 32K 过滤后的 GoLongRL 训练数据上做 100 步后训练。所有训练方法共享同一学生初始化、教师、数据、rollout 配置和评测管线。

在五个长上下文基准的平均分上,GC-OPD 在两种模型规模下均最高(表 2)。Qwen3-4B 从 Raw 的 29.08 到 GC-OPD 的 40.47,vanilla OPD 为 39.31;Qwen3-8B 从 Raw 的 35.12 到 GC-OPD 的 44.65,vanilla OPD 为 43.56。相对 vanilla OPD,GC-OPD 分别提升 1.16 和 1.09 个百分点。需要说明,不同基线在单项基准上各有领先,论文报告的是五基准未加权平均,因此更应视为综合平衡优势。

消融实验(Qwen3-8B)分别检验残差信号和 token 分配。响应级信号消融中,Additional OPD 仅使平均分从 43.56 变为 43.60;Direct reward 提升到 44.19;GC-OPD 进一步提升到 44.65(表 3)。这显示增益主要来自验证器反馈,且用残差形式优于直接加奖励。token 分配消融中,Uniform 为 44.28,Absolute OPD 为 43.93,RACA 为 44.65(表 4)。论文据此认为保留符号的 RACA 优于均匀分配和基于绝对值的分配。

论文还测试了任务条件分歧。在 GoLongRL 四个样本量足够的任务家族中,分歧存在于 MTE 和 HRR 之外,但不同任务之间差异明显(附录 A、图 4)。作者未将该差异归因于任务类型或上下文长度,只把它作为信号分歧的证据。

实践建议

对已有 OPD 训练管线且有任务验证器的长上下文后训练场景,GC-OPD 的工程成本很低:它只需要组内聚合、归一化和 token 级元素运算,不额外增加教师或学生前向(论文第 4.4 节)。因此可以优先在现有 OPD 流水线上作为轻量插件尝试。

落地时有三点需要注意。第一,残差系数 β\beta 论文只在含 231 例 High-Recall Retrieval 的 GoLongRL 验证子集上选定为 0.10(图 3)。实际使用时,应在与训练分布更接近、且覆盖目标任务类型的验证集上重新选择,而不是直接照搬论文数值。第二,z-score 归一化依赖 rollout 组内方差。如果组内奖励几乎相同,或响应级 OPD 分数变化很小,残差会被置零,该方法不会比 vanilla OPD 多提供信息;此时应检查 rollout 采样多样性或验证器是否过于粗糙。第三,论文的训练数据来自 GoLongRL,包含二元和分级奖励两类验证器。若目标任务的奖励仅有二元值,RACA 仍可工作,但残差幅度只能体现成功/失败与 OPD 排序的差异,分级奖励所提供的信息会被削弱。

代码已公开,可作为对照实现参考:GC-OPD 代码仓库。