如何稳定且高效地训练评论家

How to Train a Critic Stably and Efficiently

arXiv: 2608.23566v1

论文信息

标题: How to Train a Critic Stably and Efficiently

作者: Penghui Qi, Xiangxin Zhou, Wee Sun Lee

发布日期: 2026-08-24

arXiv ID: 2608.23566v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:这篇论文要解决基于 critic(价值函数)的大语言模型强化学习训练不稳定问题,目标是让单次采样即可获得 token 级优势估计,替代需要多次采样的 group-based 方法。
  • 核心方法:提出 Best-Practice Critic Optimization(BPCO),组合 DPPO、有界价值预测、蒙特卡洛价值目标、非归一化优势以及长度自适应 GAE,并可选择给 critic 提供参考答案或评分标准等特权信息。
  • 关键结果:在 1.5B 到 30B-A3B 混合专家模型及数学推理、rubric 奖励任务中,BPCO 持续改进 critic-based baseline,并匹配或超过 group-based baseline,且每个 prompt 只采样一个响应(见论文第 4 节)。
  • 主要局限:证据限于数学与 rubric 奖励场景;BPCO 假设奖励范围已知;特权变体需要额外的评估者信息;critic 训练带来额外计算和内存开销。
  • 适合读者:从事 LLM 强化学习、RLHF、推理模型训练或偏好优化的工程师与研究者。

论文背景和研究动机

强化学习已成为提升大语言模型推理和指令跟随能力的标准手段。有效 RL 的关键在于为采样 token 分配信用。以 GRPO 为代表的 group-based 方法通过为每个 prompt 采样多个响应并比较奖励来估计优势,避免训练 critic;但它多次采样,且将同一个 outcome-level 优势分配给响应中的所有 token,无法区分中间 token 的贡献。

训练 critic 可以直接估计每个前缀的期望回报,并从单次 rollout 构造 token 级优势。然而,常见 critic-based 训练 recipe 在实践中很脆弱。论文指出几个不稳定来源:PPO 的 ratio clipping 对低概率和高概率 token 施加相同的比例阈值,导致绝对概率变化不平滑;bootstrapped value target 会继承 critic 误差;固定 GAE 参数会使终端奖励在长短响应中获得非常不同的权重。此外,作者识别出两个额外的不匹配:线性 value head 可能预测出超出回报范围的值;batch-wise advantage normalization 在策略接近最优时仍将微小优势噪声放大为单位尺度信号。

另一个关键动机来自 critic 的 “训练期专用” 特性:critic 只在训练时使用,可以接收 policy 无法获得的奖励定义信息,例如数学题的参考答案、官方解答或开放任务的评分 rubric。这类信息由 prompt 决定,不改变理想价值函数,但可能降低价值函数逼近难度。

核心方法和技术细节

BPCO 由六个可组合组件构成。

DPPO 替代 PPO。PPO 的 clip 边界基于概率比 ρt(θ)\rho_t(\theta),在大型词表上对不同采样 token 不一致。DPPO 将 clip 边界改为基于采样 token 的概率绝对变化:

LDPPO(θ)=Et[min⁡(ρt(θ)A^t,clip⁡(ρt(θ),1−ϵμ(yt∣st),1+ϵμ(yt∣st))A^t)]\mathcal{L}_{\mathrm{DPPO}}(\theta)=\mathbb{E}_t\left[\min\left(\rho_t(\theta)\hat A_t,\operatorname{clip}\left(\rho_t(\theta),1-\frac{\epsilon}{\mu(y_t\mid s_t)},1+\frac{\epsilon}{\mu(y_t\mid s_t)}\right)\hat A_t\right)\right]

这等价于将采样 token 的绝对概率偏移限制在 ϵ\epsilon 以内。

有界价值预测。论文使用 scaled arctangent 将 value head 输出映射到奖励范围 (Rmin⁡,Rmax⁡)(R_{\min},R_{\max}):

Vϕ(st)=Rmin⁡+(Rmax⁡−Rmin⁡)(12+1πarctan⁡(zϕ(st)))V_\phi(s_t)=R_{\min}+(R_{\max}-R_{\min})\left(\frac12+\frac1\pi\arctan(z_\phi(s_t))\right)

对二值奖励,Rmin⁡=0R_{\min}=0、Rmax⁡=1R_{\max}=1。实验显示,线性 head 会预测范围外值,而有界输出使训练奖励接近 1(图 2)。

蒙特卡洛价值目标。常见 GAE target 在 λ<1\lambda<1 时包含 bootstrapped value prediction,容易出现 “自引用” 偏差:explained variance 接近 1,但 critic 对真实回报预测不准(图 3)。BPCO 解耦 critic 目标与 policy advantage,专门设置 λV=1\lambda_V=1,使 critic 目标退化为完整轨迹回报 R(x,y)R(x,y)。对从行为策略采样的 continuation,该目标是 Vμ(st)V^\mu(s_t) 的无偏蒙特卡洛样本。

移除优势归一化。批量内归一化在策略接近最优时,将接近零的原始优势除以很小的标准差,放大噪声;同时减去均值可能翻转小正优势的符号。BPCO 直接使用原始 GAE 优势。在图 4 中,归一化导致优势幅度随训练扩大,非归一化则保持较小且稳定,并在验证指标上表现出更低的过拟合风险。

长度自适应 GAE。固定 λπ\lambda_\pi 使终端奖励在长响应中权重随 λπT−t\lambda_\pi^{T-t} 指数衰减。BPCO 使用

λπ(L)=1−1αL\lambda_\pi(L)=1-\frac{1}{\alpha L}

其中 LL 为响应长度,α>0\alpha>0 控制 bias-variance trade-off。这样最早 token 的终端奖励系数约为 exp⁡(−1/α)\exp(-1/\alpha),对长度几乎不变。论文在 sanity test 中使用 α=0.4\alpha=0.4,在训练效率与验证稳定性之间取得折中(图 6)。

特权信息。设 q(x)q(x) 为奖励定义信息,特权 critic 学习 Vϕ(st,q(x))≈Eμ[R(x,y;q(x))∣st,q(x)]V_\phi(s_t,q(x))\approx\mathbb{E}_\mu[R(x,y;q(x))\mid s_t,q(x)]。policy 仍只接收 prompt 和生成前缀。该设计借鉴多智能体 RL 中的集中训练、分散执行思想。

创新点和贡献

BPCO 的主要贡献不是单一算法突破,而是对 critic 不稳定性来源的系统诊断和组合式修正。论文通过受控 sanity test 逐步剥离每个组件的影响,说明问题往往不是模型容量或奖励信号不足,而是优化 recipe 本身存在缺陷。

其次,BPCO 将 critic 输出范围、训练目标和输入信息与它提供给 policy 的优势信号统一起来。有界价值预测匹配 reward range,蒙特卡洛目标避免 bootstrapping 误差,非归一化优势保留原始信号尺度,长度自适应 GAE 稳定终端奖励传播。

第三,论文提出并系统评估了 critic 特权输入。这一视角将 “训练期专用 critic” 与 “部署期 policy” 解耦,使 critic 可以利用参考答案、官方解答或 rubric,而 policy 输入保持不变。论文同时观察到特权信息在数据量小或任务简单时可能加速过拟合或没有收益(图 5、图 11)。

实验结果分析

在 sanity test 中,初始 PPO recipe 的训练奖励先升后崩溃;替换为 DPPO 后在 λ=1\lambda=1 下稳定。将 λ\lambda 降到 0.99 又导致不稳定,说明需要控制 critic 误差进入 policy 的方式(图 1)。逐步加入有界价值、MC 目标、去归一化和 LA-GAE 后,训练奖励与 AIME 2025 avg@32 的稳定性明显改善。

在 DeepScaleR 40.3K 数据集上,BPCO 同时优于 group-based 和 critic-based baseline,训练和验证曲线均更优(图 7)。消融显示,移除价值边界会降低训练效率与 AIME 2025 性能;恢复优势归一化会带来轻微性能下降(图 8)。特权信息中,参考答案明显加速训练并提高 explained variance 与 AIME 2025 性能;官方解答虽仅覆盖约 7.3K/40.3K 问题,也有小幅改善(图 9)。

在两个 Qwen3-30B-A3B 模型上,BPCO 继续改善 critic baseline。论文报告:在 Qwen3-30B-A3B 上与 group baseline 相比表现更好,在 Qwen3-30B-A3B-Base 上相当(图 10)。在 rubric-based reward 实验中,BPCO 两种变体都比两个 baseline 更快提升,critic baseline 最终收敛到略低奖励;但特权 rubric 信息虽然提高 explained variance,却未带来性能收益,作者推测是因为任务相对简单。

实践建议

如果奖励输出天然有界,建议将 value head 输出压缩到已知奖励范围,例如用 scaled arctangent 或 sigmoid,而不是使用无界线性头。这可以防止 critic 预测极端值,并稳定训练信号。

对 critic 训练,优先使用完整 return 作为目标,即设置 λV=1\lambda_V=1。如果还想保留 policy advantage 中的 bootstrapping,可采用解耦 GAE:critic 用 R(x,y)R(x,y),policy 单独使用较小 λπ\lambda_\pi。不要使用 bootstrapped target 上的 explained variance 作为 critic 是否准确的唯一标准,因为它可能偏向自引用目标。

在 policy 更新中避免批量内优势归一化。如果必须将优势映射到统一尺度,应谨慎评估其是否在接近收敛时放大噪声。原始优势更利于让更新幅度自然缩小。

对于长度变化较大的推理任务,建议使用长度自适应 GAE。α\alpha 的选择需要在小规模或验证集上调试;论文在 sanity test 中取 α=0.4\alpha=0.4,但未说明该值在不同数据规模上的普适性。

如果有参考答案、官方解答或评分 rubric,可以尝试给 critic 提供特权输入,而 policy 保持原样。需要注意的是,特权信息在小数据或简单任务上可能加速过拟合或没有收益,应通过验证指标而非训练奖励判断是否启用。论文代码可在 golden_critic 获取。论文未报告额外 critic 训练带来的具体 wall-clock 或显存增量,部署前应自行评估系统开销。