探索与利用:通过裁剪、熵和虚假奖励重新思考 RLVR

Exploration v.s. Exploitation: Rethinking RLVR through Clipping, Entropy, and Spurious Reward

arXiv: 2512.16912v1

论文信息

标题: Exploration v.s. Exploitation: Rethinking RLVR through Clipping, Entropy, and Spurious Reward

作者: Peter Chen, Xiaopeng Li, Ziniu Li, et al.

发布日期: 2025-12-18

arXiv ID: 2512.16912v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:本文探讨可验证奖励强化学习(RLVR)中一个核心悖论——抑制利用的虚假奖励和抑制探索的熵最小化都能提升推理性能,试图揭示裁剪、策略熵与虚假奖励之间的相互作用机制。
  • 核心方法:通过理论推导裁剪偏差的显式上下界、建立单步策略熵变化公式,并提出奖励错位模型,结合 Qwen-Math、Llama、QwQ 等多模型族的实验验证。
  • 关键结果:裁剪偏差在虚假奖励下不构成有意义的学习信号(E[∣Nraw∣]/E[∣Ctot+∣]≈17.15\mathbb{E}[|N_{\text{raw}}|] / \mathbb{E}[|C_{\text{tot}}^{+}|] \approx 17.15),其实际作用是降低策略熵;而虚假奖励能否提升性能取决于模型强度——更强模型收益更大(见论文第 5 节)。
  • 主要局限:分析限于二元结果奖励的 GRPO 框架,奖励错位模型假设独立均匀的标签错误,未涉及更复杂的奖励污染模式。
  • 适合读者:从事 LLM 强化学习训练、对 RLVR 机制感兴趣的研究者和工程师,需具备策略梯度、PPO/GRPO 基础知识。

论文背景和研究动机

近年来,大型推理模型(如 Kimi-K2、OpenAI-o1、DeepSeek-R1)的涌现得益于可验证奖励强化学习(RLVR)。在 RLVR 中,验证器将模型输出与确定性地真答案比对,提供二元结果奖励。Group Relative Policy Optimization(GRPO)因计算简洁、内存高效而成为主流方法。

然而,RLVR 在探索-利用权衡上表现出与传统强化学习截然不同的特征。传统 RL 中,随机虚假奖励会抑制利用、损害性能;但 Shao-2025-Spurious 的研究却发现在 Qwen-Math 模型中,虚假奖励反而提升性能,并归因于 PPO 裁剪偏差——裁剪不对称地放大高概率响应。同时,熵最小化(抑制探索)也被多项工作证实在 RLVR 中带来一致收益。这形成一个令人困惑的悖论:抑制利用的虚假奖励和抑制探索的熵最小化都能提升性能。

这一矛盾现象揭示了 RLVR 学习动力学的特殊性。传统的一阶熵变化近似(如 Cui-2025-Entropy 提出的公式)在虚假奖励下失效——该近似预测熵不变,但实验却观察到清晰的熵下降。这引出了本文的三个核心问题:虚假奖励能否提升性能?裁剪偏差是否提供有意义的信号?策略熵与性能是否存在因果关系?

核心方法和技术细节

裁剪偏差的严格分析

论文首先将 GRPO 的裁剪修正项形式化,定义总上界裁剪修正:

Ctot+=∑t=1L(rt−1−ε)It+A(x,y)C_{\text{tot}}^{+} = \sum_{t=1}^{L} (r_t - 1 - \varepsilon) I_t^{+} A(\mathbf{x}, \mathbf{y})

通过推导其期望的显式上界(定理 3.2),论文证明了在虚假奖励下,裁剪修正的量级远小于原始代理损失(定理 3.4)。使用实际超参数(G=16G=16, L=4096L=4096, ε=0.2\varepsilon=0.2, η=5×10−7\eta=5\times10^{-7})计算得比率约 17.15,确认裁剪偏差不构成有意义的学习信号。

单步策略熵变化理论

本文提出了更精确的熵动力学分析,同时考虑裁剪和初始策略偏度。无裁剪训练下(定理 4.1):

E[H(πnew)−H(πold)]=−cGΦ(πold)η2+E[R(η)]\mathbb{E}[\mathcal{H}(\pi_{\text{new}}) - \mathcal{H}(\pi_{\text{old}})] = -c_G \Phi(\pi_{\text{old}}) \eta^2 + \mathbb{E}[R(\eta)]

其中 Φ\Phi 度量策略的偏度:当策略足够偏斜(例如二动作策略中 β∉[0.176,0.824]\beta \notin [0.176, 0.824]),熵可能增加而非减少。这解释了一阶近似失效的原因。裁剪训练下(定理 4.3),裁剪强制降低熵,形成一个隐含的正则化机制。

奖励错位模型

为解释虚假奖励改善性能的条件,论文提出一个概率模型:对于正确响应占比 ncn_c 的批次,虚假奖励造成的正确响应优势损失期望为 E[Δ]=nc(G−nc)G\mathbb{E}[\Delta] = \frac{n_c(G-n_c)}{G}(命题 5.2)。该损失的方差也随 ncn_c 增加而减小,解释了为什么更强模型训练更稳定、更可能从虚假奖励中获益。

创新点和贡献

理论创新一:裁剪作用的重新定位。 论文首次严格证明了在虚假奖励下,裁剪偏差的量级远不足以构成有效学习信号,推翻了 “裁剪偏差放大高概率响应从而改善性能” 的先前解释。

理论创新二:策略熵的二阶精确刻画。 相比先前仅保留一阶项的近似,本文的二阶分析揭示了策略偏度对熵变化方向的关键作用——高偏度策略在无裁剪虚假奖励下熵可能增加,这一预测得到了实验证实(图 2)。

实践洞察:模型强度依赖的收益规律。 通过奖励错位模型和跨模型族实验,论文证明了虚假奖励的收益不是 Qwen-Math 特有、也非数据污染所致,而是模型强度决定收益大小的系统性规律。更强的蒸馏 Llama 模型同样获得提升,而较弱的 1.5B Qwen-Math 模型则震荡无改善(图 4)。

实验结果分析

裁剪与验证性能(图 1): 在 Qwen2.5-Math-7B 上,启用裁剪时 6 次独立运行中约 4 次出现性能下降;禁用裁剪反而带来更稳定的提升。这与[定理 3.4]的结论一致——裁剪偏差不提供有效信号。

裁剪与熵动态(图 2): 在虚假奖励训练中,禁用裁剪导致策略熵上升,启用裁剪则导致熵下降。这直接支持了[定理 4.1]与[定理 4.3]的预测:裁剪通过限制重要性比率发挥熵正则化作用。一个关键案例是 R1-Distill-Llama-8B 在无裁剪下虽初始提升(65.6%→76.6%),但约 150 步后梯度爆炸(图 2 右),凸显裁剪在防止训练崩溃中的必要性。

熵-性能无关性(图 3): 在 AIME 难题上,Qwen2.5-Math-7B 的熵持续下降但性能近似随机游走,而更强的 QwQ-32B 和 Llama-8B 则保持稳定提升。这说明熵最小化本身不保证性能改善,在弱模型或困难数据上可能强化错误模式。

多模型验证(图 4): 蒸馏 Llama-8B 在虚假奖励训练下获得与 Qwen-Math 可比甚至更优的提升;而弱小的 Qwen2.5-Math-1.5B 几乎无改善。这证实了奖励错位模型的核心预测:改善来自模型强度而非数据污染。


实践建议

基于本文发现,RLVR 训练实践中应注意以下原则:

1. 谨慎解读裁剪的作用。 裁剪的首要功能是稳定训练(防止梯度爆炸),而非注入学习信号。当训练稳定的模型(如 7B 级、4K 上下文)可尝试放宽裁剪比例以增加探索;但对大模型或长链推理,裁剪是训练稳定的必要保障。

2. 熵动态需与任务难度匹配。 在简单数据集上,熵自然下降并伴随性能提升是可以接受的;但在困难数据上,过度的熵塌陷可能将策略锁定在次优解。可考虑在训练早期注入适当噪声(如温和的虚假奖励)以保持探索多样性。

3. 虚假奖励作为探索工具。 虚假奖励并非无用的扰动——它可以在不依赖地真标签的情况下调节策略熵。对于基础能力较强的模型(如 70%+基准准确率),短期虚假奖励训练可能作为 “预热” 阶段,帮助策略从过确定性状态中恢复探索能力。

4. 模型强度评估至关重要。 在部署虚假奖励策略前,应评估模型在目标数据集上的基线表现。当基线准确率低于 50% 时,虚假奖励可能引入过多噪声而无法带来收益;强模型则更可能从中获益。