半事实信用增强策略优化

Semifactual Credit-Augmented Policy Optimization

arXiv: 2609.40360v1

论文信息

标题: Semifactual Credit-Augmented Policy Optimization

作者: Junshu Pan, Zhizhang Fu, Shulin Huang, et al.

发布日期: 2026-09-30

arXiv ID: 2609.40360v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:论文研究强化学习+可验证奖励(RLVR)下,大语言模型在数学推理中对任务无关提示特征的敏感性,以及 GRPO 以同一个响应级优势赋给所有 token 的粗粒度信用分配问题。
  • 核心方法:提出 SCAPO(Semifactual Credit-Augmented Policy Optimization),在 GRPO 优势上叠加一个由半事实提示干预测得的 token 概率漂移所构造的负向稳定性修正,在训练早期降低相对不稳定 token 的优势。
  • 关键结果:在 Qwen3-4B-Base 和 Qwen3-1.7B-Base 上,SCAPO 的 AIME 2024–2026 精度分别比 GRPO 高 5.63 和 4.17 个百分点(表 1)。
  • 主要局限:作者自述实验限于数学推理、DAPO-Math-17K、1.7B/4B 稠密 Qwen3 模型;更大模型、更多架构和更广领域尚未评估(附录 A)。
  • 适合读者:关注 LLM 强化学习、RLVR、token 级信用分配、推理鲁棒性与因果启发训练方法的研究者和工程师。

论文背景和研究动机

RLVR 已经推动大语言模型形成较强推理能力,例如 OpenAI o1 与 DeepSeek-R1(见论文第 1 节)。GRPO 是代表性 RLVR 方法,它基于组内相对奖励构造轨迹级优势 AiA_i,且 AiA_i 被赋给回复中的每个有效 token。这带来一个明显限制:同一回复内所有 token 接收相同的学习信号,无法区分哪些 token 真正依赖任务可验证结果,哪些 token 仅与任务无关提示特征存在伪相关。

论文的诊断聚焦于 “半事实” 扰动(semifactual interventions):保持数学问题和正确答案不变,只改变无关提示特征,例如释义、轻微拼写噪声、场景包装和追加无关上下文。用冻结的 Qwen3-4B-Base 在 1,000 道 DAPO-Math-17K 问题上采样回复,再对每个 token 计算原提示与四个扰动提示下的概率漂移。结果发现 token 级灵敏度高度异质:反射词和话语连接词的平均漂移分别是总体均值的 2.74 倍和 2.32 倍,数学符号和数字则只有 0.47 倍和 0.37 倍(图 2c)。这说明模型对提示表面形式的敏感并非均匀分布,而是集中在某些组织性、反思性语言成分上。

更关键的是,这种灵敏度可以反向用于解码:冻结模型不变,在每一步排除高漂移候选 token 但保留 EOS,累计被屏蔽概率质量不超过 0.8,准确率从 15.8% 上升到 30.0%,提升 14.2 个百分点(图 3)。作者据此推测,半事实敏感性可作为 token 级训练信号,并据此提出 SCAPO。

核心方法和技术细节

SCAPO 仍以 GRPO 为基础,只修改 token 优势项。其信号构造分三步。

第一,半事实扰动。对每个原提示 x=x(0)x=x^{(0)},构造 K=4K=4 个扰动提示 x(1),…,x(4)x^{(1)},\dots,x^{(4)},对应释义、轻微拼写噪声、场景包装和无关上下文。扰动由 GPT-5.5 生成,并要求保留数值、数学表达式、约束和所求量(见附录 B.1)。

第二,固定回复概率漂移。在 rollout 政策 πold\pi_{\mathrm{old}} 下,GG 个回复先按原提示采样。随后对同一个回复做 teacher forcing,保持 token 及其前缀不变,只替换提示,得到

pi,t(k)=πold(yi,t∣x(k),yi,<t),k=0,…,K.p_{i,t}^{(k)}=\pi_{\mathrm{old}}(y_{i,t}\mid x^{(k)},y_{i,<t}),\quad k=0,\dots,K.

用有界对称距离衡量漂移:

di,t(k)=∣pi,t(0)−pi,t(k)∣(pi,t(0)+pi,t(k))/2.d_{i,t}^{(k)}=\frac{|p_{i,t}^{(0)}-p_{i,t}^{(k)}|}{(p_{i,t}^{(0)}+p_{i,t}^{(k)})/2}.

该量被限制在 [0,2][0,2],避免极端概率比导致数值不稳定。

第三,组内相对稳定性。对每种扰动类型先对负漂移做组内标准化,再平均并再次标准化:

u=zscore⁡x ⁣(1K∑k=1Kzscore⁡x(−d(k))).\bm{u}=\operatorname{zscore}_x\!\left(\frac{1}{K}\sum_{k=1}^{K}\operatorname{zscore}_x(-\bm{d}^{(k)})\right).

最后只保留负部 ui,t−=min⁡(ui,t,0)u_{i,t}^-=\min(u_{i,t},0)。这样只有相对不稳定的 token 被惩罚,稳定性本身不会带来额外奖励,因为稳定性不蕴含正确性。

SCAPO 的 token 优势为

A~i,t=Ai+λ sg⁡(ui,t−),\tilde A_{i,t}=A_i+\lambda\,\operatorname{sg}(u_{i,t}^-),

其中 AiA_i 是 GRPO 的组内标准化奖励优势,λ≥0\lambda\ge 0 是修正强度,sg⁡\operatorname{sg} 表示停止梯度。由于 ui,t−≤0u^-_{i,t}\le 0,必有 A~i,t≤Ai\tilde A_{i,t}\le A_i;当 Ai>0A_i>0 时它削弱正信号,当 Ai<0A_i<0 时它加强负信号。将 A~i,t\tilde A_{i,t} 代入 token-mean 的 clipped 目标即得到 SCAPO 目标:

JSCAPO(θ)=E ⁣[1∑iTi∑i,tmin⁡(ri,tA~i,t,rˉi,tA~i,t)].\mathcal{J}_{\text{SCAPO}}(\theta)=\mathbb{E}\!\left[\frac{1}{\sum_i T_i}\sum_{i,t}\min(r_{i,t}\tilde A_{i,t},\bar r_{i,t}\tilde A_{i,t})\right].

训练调度上,SCAPO 只在早期施加信用增广:1≤n≤N01\le n\le N_0 时 λ=λ0\lambda=\lambda_0,之后 λ=0\lambda=0 并继续标准 GRPO。Qwen3-4B 上 λ0=0.01,N0=120\lambda_0=0.01,N_0=120;Qwen3-1.7B 上 λ0=0.01,N0=200\lambda_0=0.01,N_0=200。

创新点和贡献

首先,论文把半事实扰动从可解释性工具扩展为 RLVR 的 token 级信用信号。传统 GRPO 与多数 RLVR 变体只使用响应级正确性,SCAPO 通过固定回复的概率漂移得到更细粒度信号,且不需要过程监督或外部奖励模型。

其次,负向修正的设计是克制的:只减少相对不稳定 token 的优势,不奖励稳定 token。这个设计与最终答案正确性解耦,避免把 “稳定” 误认为 “正确”。消融结果支持该选择:负向修正在 AIME/AMC/HMMT/BRUMO/SMT 五项上的平均成绩为 17.65%,高于 all-sign 的 15.65% 和 positive-only 的 14.05%(表 2,Qwen3-1.7B-Base)。

再次,论文还给出了形式化优化分析。附录 D 在随机梯度模型下给出有限时长增广的梯度偏差上界和平均梯度范数界。这为 “短期增广不会无限累积优化偏差” 提供了较严格的分析。

实验结果分析

在 Qwen3-4B-Base 和 Qwen3-1.7B-Base 上,SCAPO 在 AIME 2024–2026 上分别取得 27.71% 和 11.88%,比 GRPO 高 5.63 和 4.17 个百分点(表 1)。在 4B 的八个数学基准中,SCAPO 在六个上最高;在 1.7B 的八个基准中,SCAPO 全部最高(表 1)。其 In-Distribution 平均精度分别为 39.65% 和 23.08%,高于所有对比方法。

在分布外评测上,SCAPO 在 NoOp-AIME、ThinkBench-AIME 和 GPQA-Diamond 上均最高(表 1)。以 GPQA-Diamond 为例,4B 从 GRPO 的 36.26% 提升到 42.45%;1.7B 从 27.42% 提升到 31.25%。但需要强调,这是在该论文的 checkpoint、采样设置和评测协议下的有限结论,不能直接推广为所有模型和任务。

训练效率方面,论文指出半事实探查和信用构造只占总训练运行时间的 1.8%(图 5),原因是它们复用采样回复做 teacher forcing,不使用新的自回归生成,且只发生在早期增广阶段。

实践建议

如果你想在 RLVR 数学推理或类似可验证任务中尝试 SCAPO 思路,以下几点可作参考。

第一,优先控制半事实扰动质量。SCAPO 的信号来自 “答案不变、仅表面变化” 的扰动。若扰动改变了答案或数学内容,信号的含义会漂移。论文消融显示,替换为答案变化的反事实扰动后,平均成绩从 SCAPO 的 17.65% 降到 11.68%(表 2)。因此建议在生成扰动后做答案一致性校验,或使用论文附录 B.1 的 prompt 模板。

第二,把半事实修正放在训练早期。论文采用早期增广、后期标准 GRPO 的调度,并称 SCAPO 达到 GRPO 最终 AIME 精度所需策略优化步数不到一半(图 1)。对于训练预算紧张的场景,这可以作为加快轨迹选择的手段。论文未说明在其他模型规模上是否同样成立。

第三,解码过滤可作为离线诊断工具。冻结 Qwen3-4B-Base 上,在线屏蔽高漂移 token 将准确率从 15.8% 提高到 30.0%(图 3)。不过该过程需要在每个解码步对多个扰动提示计算全词表 drift,推理成本论文未给出;因此可能更适合用于评估模型对提示表面形式的敏感区域,而不是直接部署到低延迟在线推理。

第四,敏感 token 类别值得监控。论文在冻结 Qwen3-4B-Base 上观察到反射词和话语连接词漂移远高于数学符号和数字(图 2c)。在训练日志或事后分析中,可以重点关注这类 token 的概率变化,但这是相关性观察,作者未证明它们是错误推理的原因。

最后,不建议把本文数值直接当作新方法的性能下限或上限。SCAPO 的结果来自 Qwen3-1.7B/4B、DAPO-Math-17K 和固定评测协议;作者也在附录 A 明确说明更大模型、MoE/混合架构和更广领域仍需评估。若要在其他项目中使用,应先在小规模数据上复现并验证扰动构造与超参。

代码:论文提供开源实现和训练数据,可从 GitHub 获取。