超越教师似然:用于长上下文推理的组校准同策略蒸馏
Beyond Teacher Likelihood: Group-Calibrated On-Policy Distillation for Long-Context Reasoning
论文信息
标题: Beyond Teacher Likelihood: Group-Calibrated On-Policy Distillation for Long-Context Reasoning
作者: Zhu Zhang, Jixun Wang, Xiaoang Xu, et al.
发布日期: 2026-08-19
arXiv ID: 2608.19181v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:长上下文任务中,on-policy distillation 的 token 级教师偏好与任务验证器的响应级奖励会出现分歧,且输入越长分歧越明显;论文研究如何在保留稠密教师信号的同时引入验证器校准。
- 核心方法:提出 GC-OPD,先在每个 rollout 组内分别对验证器奖励和轨迹级 OPD 分数做 z-score 归一化,再用两者之差构造符号化残差,并通过 RACA 将残差分配到 token,叠加到原始 OPD 优势上。
- 关键结果:在五个长上下文基准上,GC-OPD 使 Qwen3-4B 平均分从 29.08 提升到 40.47,Qwen3-8B 从 35.12 提升到 44.65;比 vanilla OPD 分别高 1.16 和 1.09 个百分点(表 2)。
- 主要局限:残差系数 在一个仅含 High-Recall Retrieval 任务的 231 例 GoLongRL 验证子集上选择,系数选择的跨任务泛化性未在论文中验证;组内或 token 级方差过小时,方法会退化为 vanilla OPD。
- 适合读者:长上下文 LLM 训练、on-policy distillation、验证器反馈/RLVR、模型对齐与紧凑模型后训练的研究者和工程师。
论文背景和研究动机
On-policy distillation(OPD)让学生模型在其自身生成的响应上获得来自更强教师的 token 级指导。对每个采样 token,OPD 优势定义为教师 log 概率与学生 log 概率之差:
该信号的期望等于对应状态上的负逆向 KL(论文第 3.1 节),因此它衡量的是教师对采样 token 的偏好,而不是任务是否真正成功。
在长上下文任务中,正确答案往往需要聚合分散在远处的证据,并满足全局任务约束。学生模型更容易生成局部合理但全局不完整的响应。此时,token 级教师支持可能偏好一个遗漏关键证据的响应,而任务验证器会在响应级给出较低奖励。论文将这种现象称为 teacher–verifier disagreement。
论文在 Multi-Table Extraction 和 High-Recall Retrieval 两个任务上做了诊断:随输入长度增加,成对分歧率上升,OPD 偏好间隔由正转负。例如 Multi-Table Extraction 的成对分歧率从 8K 以下的 40.6% 上升到 32–64K 的 64.0%,OPD 偏好间隔从 降到 (图 1)。这构成引入验证器校准的直接动机。
核心方法和技术细节
GC-OPD 由两部分组成:组相对残差构造与相对优势信用分配。
1. 组相对评估与符号残差
对每个 rollout 组内的 个响应,论文先定义轨迹级 OPD 分数:
然后分别对验证器奖励 和轨迹级 OPD 分数 做组内 z-score 归一化,得到 和 。残差定义为:
残差符号表示分歧方向:验证器评估高于 OPD 评估时为正;幅度表示两者差异大小。该设计的关键在于不是直接加入归一化验证器奖励,而是减去 OPD 已经表达的那部分相对偏好。论文在第 4.3 节说明:当二者排序严格不一致时,残差排序与验证器偏好一致,从而将后续 token 级校正导向高奖励响应。
2. RACA:相对优势信用分配
轨迹级残差需要分配到 token。RACA 先把每个 token 的 OPD 优势相对响应均值做归一化:
再映射为正的有界信用:
。最终 GC-OPD 优势为:
原始 OPD 优势仍作为基座, 时完全退化为 vanilla OPD。信用始终为正,因此只缩放残差,不反转其符号。实现上,当组内任一信号标准差过小时,;当 token 级标准差过小时,,此时退化为均匀分配或 vanilla OPD(论文附录 B)。
创新点和贡献
论文列出三个贡献(论文第 1 节结尾)。第一个贡献是通过图 1 的诊断识别出两个任务的共同模式:输入长度增加时,轨迹级 OPD 分数与验证器奖励的对齐程度下降。该结论不是因果推断,论文仅描述在这两个任务和当前模型组合下的趋势。
第二个贡献是 GC-OPD 的残差形式。相比直接加入 , 只校正教师与验证器不一致的部分:两者一致时残差为 0,分歧越大修正越强。此设计保留 OPD 原有排序,同时利用分级奖励的幅度,而不只使用其排名。
第三个贡献是 RACA。它不判断 token 正确性,只按相对 OPD 优势分配残差;信用有界且恒正,避免绝对值分配丢失符号、或极端 token 权重的稳定性问题。
实验结果分析
主实验使用 Qwen3-4B 和 Qwen3-8B 学生、Qwen3-30B-A3B-Thinking-2507 教师,在 9,527 条 32K 过滤后的 GoLongRL 训练数据上做 100 步后训练。所有训练方法共享同一学生初始化、教师、数据、rollout 配置和评测管线。
在五个长上下文基准的平均分上,GC-OPD 在两种模型规模下均最高(表 2)。Qwen3-4B 从 Raw 的 29.08 到 GC-OPD 的 40.47,vanilla OPD 为 39.31;Qwen3-8B 从 Raw 的 35.12 到 GC-OPD 的 44.65,vanilla OPD 为 43.56。相对 vanilla OPD,GC-OPD 分别提升 1.16 和 1.09 个百分点。需要说明,不同基线在单项基准上各有领先,论文报告的是五基准未加权平均,因此更应视为综合平衡优势。
消融实验(Qwen3-8B)分别检验残差信号和 token 分配。响应级信号消融中,Additional OPD 仅使平均分从 43.56 变为 43.60;Direct reward 提升到 44.19;GC-OPD 进一步提升到 44.65(表 3)。这显示增益主要来自验证器反馈,且用残差形式优于直接加奖励。token 分配消融中,Uniform 为 44.28,Absolute OPD 为 43.93,RACA 为 44.65(表 4)。论文据此认为保留符号的 RACA 优于均匀分配和基于绝对值的分配。
论文还测试了任务条件分歧。在 GoLongRL 四个样本量足够的任务家族中,分歧存在于 MTE 和 HRR 之外,但不同任务之间差异明显(附录 A、图 4)。作者未将该差异归因于任务类型或上下文长度,只把它作为信号分歧的证据。
实践建议
对已有 OPD 训练管线且有任务验证器的长上下文后训练场景,GC-OPD 的工程成本很低:它只需要组内聚合、归一化和 token 级元素运算,不额外增加教师或学生前向(论文第 4.4 节)。因此可以优先在现有 OPD 流水线上作为轻量插件尝试。
落地时有三点需要注意。第一,残差系数 论文只在含 231 例 High-Recall Retrieval 的 GoLongRL 验证子集上选定为 0.10(图 3)。实际使用时,应在与训练分布更接近、且覆盖目标任务类型的验证集上重新选择,而不是直接照搬论文数值。第二,z-score 归一化依赖 rollout 组内方差。如果组内奖励几乎相同,或响应级 OPD 分数变化很小,残差会被置零,该方法不会比 vanilla OPD 多提供信息;此时应检查 rollout 采样多样性或验证器是否过于粗糙。第三,论文的训练数据来自 GoLongRL,包含二元和分级奖励两类验证器。若目标任务的奖励仅有二元值,RACA 仍可工作,但残差幅度只能体现成功/失败与 OPD 排序的差异,分级奖励所提供的信息会被削弱。
代码已公开,可作为对照实现参考:GC-OPD 代码仓库。