探索与利用:通过裁剪、熵和虚假奖励重新思考 RLVR
Exploration v.s. Exploitation: Rethinking RLVR through Clipping, Entropy, and Spurious Reward
论文信息
标题: Exploration v.s. Exploitation: Rethinking RLVR through Clipping, Entropy, and Spurious Reward
作者: Peter Chen, Xiaopeng Li, Ziniu Li, et al.
发布日期: 2025-12-18
arXiv ID: 2512.16912v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:本文探讨可验证奖励强化学习(RLVR)中一个核心悖论——抑制利用的虚假奖励和抑制探索的熵最小化都能提升推理性能,试图揭示裁剪、策略熵与虚假奖励之间的相互作用机制。
- 核心方法:通过理论推导裁剪偏差的显式上下界、建立单步策略熵变化公式,并提出奖励错位模型,结合 Qwen-Math、Llama、QwQ 等多模型族的实验验证。
- 关键结果:裁剪偏差在虚假奖励下不构成有意义的学习信号(),其实际作用是降低策略熵;而虚假奖励能否提升性能取决于模型强度——更强模型收益更大(见论文第 5 节)。
- 主要局限:分析限于二元结果奖励的 GRPO 框架,奖励错位模型假设独立均匀的标签错误,未涉及更复杂的奖励污染模式。
- 适合读者:从事 LLM 强化学习训练、对 RLVR 机制感兴趣的研究者和工程师,需具备策略梯度、PPO/GRPO 基础知识。
论文背景和研究动机
近年来,大型推理模型(如 Kimi-K2、OpenAI-o1、DeepSeek-R1)的涌现得益于可验证奖励强化学习(RLVR)。在 RLVR 中,验证器将模型输出与确定性地真答案比对,提供二元结果奖励。Group Relative Policy Optimization(GRPO)因计算简洁、内存高效而成为主流方法。
然而,RLVR 在探索-利用权衡上表现出与传统强化学习截然不同的特征。传统 RL 中,随机虚假奖励会抑制利用、损害性能;但 Shao-2025-Spurious 的研究却发现在 Qwen-Math 模型中,虚假奖励反而提升性能,并归因于 PPO 裁剪偏差——裁剪不对称地放大高概率响应。同时,熵最小化(抑制探索)也被多项工作证实在 RLVR 中带来一致收益。这形成一个令人困惑的悖论:抑制利用的虚假奖励和抑制探索的熵最小化都能提升性能。
这一矛盾现象揭示了 RLVR 学习动力学的特殊性。传统的一阶熵变化近似(如 Cui-2025-Entropy 提出的公式)在虚假奖励下失效——该近似预测熵不变,但实验却观察到清晰的熵下降。这引出了本文的三个核心问题:虚假奖励能否提升性能?裁剪偏差是否提供有意义的信号?策略熵与性能是否存在因果关系?
核心方法和技术细节
裁剪偏差的严格分析
论文首先将 GRPO 的裁剪修正项形式化,定义总上界裁剪修正:
通过推导其期望的显式上界(定理 3.2),论文证明了在虚假奖励下,裁剪修正的量级远小于原始代理损失(定理 3.4)。使用实际超参数(, , , )计算得比率约 17.15,确认裁剪偏差不构成有意义的学习信号。
单步策略熵变化理论
本文提出了更精确的熵动力学分析,同时考虑裁剪和初始策略偏度。无裁剪训练下(定理 4.1):
其中 度量策略的偏度:当策略足够偏斜(例如二动作策略中 ),熵可能增加而非减少。这解释了一阶近似失效的原因。裁剪训练下(定理 4.3),裁剪强制降低熵,形成一个隐含的正则化机制。
奖励错位模型
为解释虚假奖励改善性能的条件,论文提出一个概率模型:对于正确响应占比 的批次,虚假奖励造成的正确响应优势损失期望为 (命题 5.2)。该损失的方差也随 增加而减小,解释了为什么更强模型训练更稳定、更可能从虚假奖励中获益。
创新点和贡献
理论创新一:裁剪作用的重新定位。 论文首次严格证明了在虚假奖励下,裁剪偏差的量级远不足以构成有效学习信号,推翻了 “裁剪偏差放大高概率响应从而改善性能” 的先前解释。
理论创新二:策略熵的二阶精确刻画。 相比先前仅保留一阶项的近似,本文的二阶分析揭示了策略偏度对熵变化方向的关键作用——高偏度策略在无裁剪虚假奖励下熵可能增加,这一预测得到了实验证实(图 2)。
实践洞察:模型强度依赖的收益规律。 通过奖励错位模型和跨模型族实验,论文证明了虚假奖励的收益不是 Qwen-Math 特有、也非数据污染所致,而是模型强度决定收益大小的系统性规律。更强的蒸馏 Llama 模型同样获得提升,而较弱的 1.5B Qwen-Math 模型则震荡无改善(图 4)。
实验结果分析
裁剪与验证性能(图 1): 在 Qwen2.5-Math-7B 上,启用裁剪时 6 次独立运行中约 4 次出现性能下降;禁用裁剪反而带来更稳定的提升。这与[定理 3.4]的结论一致——裁剪偏差不提供有效信号。
裁剪与熵动态(图 2): 在虚假奖励训练中,禁用裁剪导致策略熵上升,启用裁剪则导致熵下降。这直接支持了[定理 4.1]与[定理 4.3]的预测:裁剪通过限制重要性比率发挥熵正则化作用。一个关键案例是 R1-Distill-Llama-8B 在无裁剪下虽初始提升(65.6%→76.6%),但约 150 步后梯度爆炸(图 2 右),凸显裁剪在防止训练崩溃中的必要性。
熵-性能无关性(图 3): 在 AIME 难题上,Qwen2.5-Math-7B 的熵持续下降但性能近似随机游走,而更强的 QwQ-32B 和 Llama-8B 则保持稳定提升。这说明熵最小化本身不保证性能改善,在弱模型或困难数据上可能强化错误模式。
多模型验证(图 4): 蒸馏 Llama-8B 在虚假奖励训练下获得与 Qwen-Math 可比甚至更优的提升;而弱小的 Qwen2.5-Math-1.5B 几乎无改善。这证实了奖励错位模型的核心预测:改善来自模型强度而非数据污染。
实践建议
基于本文发现,RLVR 训练实践中应注意以下原则:
1. 谨慎解读裁剪的作用。 裁剪的首要功能是稳定训练(防止梯度爆炸),而非注入学习信号。当训练稳定的模型(如 7B 级、4K 上下文)可尝试放宽裁剪比例以增加探索;但对大模型或长链推理,裁剪是训练稳定的必要保障。
2. 熵动态需与任务难度匹配。 在简单数据集上,熵自然下降并伴随性能提升是可以接受的;但在困难数据上,过度的熵塌陷可能将策略锁定在次优解。可考虑在训练早期注入适当噪声(如温和的虚假奖励)以保持探索多样性。
3. 虚假奖励作为探索工具。 虚假奖励并非无用的扰动——它可以在不依赖地真标签的情况下调节策略熵。对于基础能力较强的模型(如 70%+基准准确率),短期虚假奖励训练可能作为 “预热” 阶段,帮助策略从过确定性状态中恢复探索能力。
4. 模型强度评估至关重要。 在部署虚假奖励策略前,应评估模型在目标数据集上的基线表现。当基线准确率低于 50% 时,虚假奖励可能引入过多噪声而无法带来收益;强模型则更可能从中获益。