重新思考大语言模型强化学习中的散度正则化
Rethinking the Divergence Regularization in LLM RL
论文信息
标题: Rethinking the Divergence Regularization in LLM RL
作者: Jiarui Yao, Xiangxin Zhou, Penghui Qi, et al.
发布日期: 2026-06-08
arXiv ID: 2606.09821v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:大语言模型强化学习(LLM RL)中,基于重要性比率的信任域方法(如 PPO、GRPO)在长尾词汇分布下不稳定,而现有的散度掩码方法(DPPO)虽能部分缓解,却使用硬掩码导致梯度突变且缺乏校正信号。
- 核心方法:提出散度正则化策略优化(DRPO),将 DPPO 的 Binary-TV 硬掩码替换为一种平滑的、优势加权的二次正则化项,直接约束被采样令牌的绝对概率偏移,并诱导出连续的、有界的梯度权重。
- 关键结果:在 6 种不同模型、架构和精度设置的实验中,DRPO 均展现出更稳定的训练过程和更优的评估准确率,尤其在低精度(FP8)训练下优势明显(图 3)。
- 主要局限:方法仍然基于 DPPO 的 Binary-TV 近似,仅考虑被采样令牌的概率偏移,未严格约束全分布散度;实验集中在数学推理任务,在其他类型任务上的泛化性尚未验证。
- 适合读者:从事大语言模型对齐、强化学习训练、策略优化算法研究的工程师和科研人员。
论文背景和研究动机
在大语言模型的后训练阶段,强化学习已成为对齐人类偏好和提升复杂推理能力的关键技术。然而,现代 LLM RL 通常处于离策略(off‑policy)状态:由于训练引擎与推理引擎的数值不匹配,以及一次收集的轨迹会被切分为多个小批量进行多次梯度更新,当前更新的策略与产生数据的策略并不一致。在这种设定下,信任域控制对稳定优化至关重要。
主流方法 PPO 和 GRPO 通过简单的比率裁剪(ratio‑clipping)来近似信任域约束,但重要性比率 在长尾、大词汇表场景中是分布偏移的一个很差代理:一个低概率令牌的微小绝对概率变化可以产生极大的比率,而高概率令牌的较小比率变化却可能导致显著的策略质量转移。因此,固定比率窗口往往过度约束低概率令牌,同时对高概率令牌约束不足。
DPPO(Qi et al., 2026)用散度掩码替代比率裁剪,具体采用 Binary‑TV 距离 ,当策略偏移超过阈值且更新方向有害时直接将梯度置零。尽管这一设计更贴合分布偏移的几何,但硬掩码带来了新问题:在阈值附近梯度的突然切换会使优化不稳定,且一旦令牌越界,梯度被完全丢弃,缺乏将策略拉回信任域内的校正信号。
SPO(Xie et al., 2024)已经从 PPO 的硬裁剪走向平滑正则化,但它依然使用比率约束,其梯度权重在低概率尾端可能无界增长。基于这些观察,论文提出 DRPO,旨在保留 DPPO 的散度几何优点的同时,用平滑正则化器取代硬掩码,从而实现连续、有界的梯度,并在信任域外提供修正信号。
核心方法和技术细节
DRPO 的出发点是将 Binary‑TV 信任域 改写为自适应比率约束 ,然后借鉴 SPO 把硬裁剪替换为二次惩罚的构造,得到如下目标函数:
这里的关键在于正则化项中额外乘上了行为概率 。这一简单修改将隐式正则化从 SPO 的 型惩罚(即对概率偏移按 加权)转变为对绝对概率偏移的 惩罚,从而与 Binary‑TV 距离对齐。
对目标求梯度后,每个令牌的策略梯度贡献被乘以权重:
该权重连续且分为两种情况:
- 偏离行为策略( ):权重为 ,在信任域内随偏移增大而衰减,到达边界时权重为零,若继续向外则权重转为负值,提供反向校正梯度,将策略拉回边界处。
- 靠近行为策略( ):权重为 ,梯度被放大,鼓励策略快速回归。
与 SPO 的权重 相比,DRPO 的权重直接依赖绝对概率偏移 ,该量始终在 ,因此梯度权重被严格限制在 之间,完全有界(表 1、图 1)。而在低概率令牌上 SPO 的权重可以趋于无穷,导致长尾区域的梯度爆炸。DRPO 的另一重要设计是将正则化强度与优势的绝对值 耦合,使得令牌的最优解 不依赖于优势尺度,从而保持信任域边界稳定。
从整体视角看,DRPO 实现了一个平滑的 Binary‑TV 信任域:它继承了 DPPO 的散度几何,避免了比率约束的方差和高敏感度,同时以连续的二次惩罚消除硬掩码的突变与零梯度死区。
创新点和贡献
- 从梯度视角设计正则化器:论文强调,对于 LLM RL 的离策略设定,正则化器诱导的实际梯度权重比名义散度更重要。DRPO 通过直接控制梯度权重,将信任域边界固定在 Binary‑TV 上,而非停留在比率空间。
- 解析不同散度正则化器的诱导几何:文中在附录 C 中严格对比了 KL、K3、TV 等常用惩罚项,证明它们的梯度要么退化为二元信号,要么仍为比率型约束,唯独 DRPO 能产生平滑的、附合绝对概率偏移的信任域。
- 提出优势加权的必要性:通过消融实验(图 4)和正则化分析,证明 加权是维持稳定边界、防止令牌级噪声导致过度约束的关键,这并非一个可有可无的细节。
- 统一的实验验证:在密集模型、MoE 架构、不同参数量级以及 BF16 与 FP8 低精度训练等多种设置下,DRPO 一致优于 GRPO、SPO、DPPO 和不加信任域的基准(图 3),体现了方法在真实工程环境中的普适性与鲁棒性。
实验结果分析
实验涵盖了 Qwen3‑4B‑Base、Qwen3‑30B‑A3B‑Base、Qwen3.5‑35B‑A3B‑Base 以及 DeepSeek‑R1‑Distill‑1.5B 等模型,训练数据为约 13K 道数学题的 DAPO 子集,以 AIME2024/2025 的 Pass@16 平均分作为主要指标。
- 整体性能:在所有 6 组实验中,DRPO 的训练曲线最稳定,最终准确率始终处于最高水平或与最佳基线持平(图 3)。尤其在 Qwen3‑4B‑Base 上,无信任域方法出现了明显的性能退化,而 DRPO 保持提升。
- 低精度场景:在 Qwen3‑30B‑A3B‑Base 的 FP8 rollout 和 FP8 端到端训练设置下,基于比率的方法(GRPO、SPO)崩溃严重,而 DRPO 依然有效收敛,凸显其鲁棒性。
- 硬掩码 vs 平滑正则化:DPPO 虽能稳定训练,但收敛速度和最终精度常不如 DRPO;而 Mask‑DRPO 实验(图 11)表明,将 DRPO 的正则化仅作用于 DPPO 信任域外的令牌时,性能与全局应用 DRPO 接近,说明主要的性能增益来自于边界外令牌的校正信号。
- 消融实验:移除 权重的 DRPO 和 SPO 均出现性能大幅下降或训练不稳定(图 4);用 KL、TV 等其他散度惩罚替代 DRPO 均不能达到同等效果(图 5)。这些结果印证了 “梯度几何优于散度名称” 的核心观点。
实践建议
对于实际部署 LLM RL 训练的团队,基于 DRPO 的改进可直接嵌入现有 PPO 或 GRPO 流程:
- 替换裁剪机制:用 DRPO 损失(公式 8)代替 PPO 的比率裁剪或 DPPO 的硬掩码。论文推荐的超参数 在多种模型上工作良好,无需细粒度调节(图 10)。
- 处理训练‑推理错配:当使用不同精度(如 FP8)进行推理加速时,DRPO 对数值漂移的容忍度明显高于比率方法,有助于在工程效率与训练稳定性之间取得平衡。
- 优势估计方式:DRPO 不依赖值函数,与 GRPO 的组相对优势完全兼容,可直接用于现有无需评论家的 GRPO 框架。
- 关注梯度设计:在设计新的正则化器时,不应仅看目标函数的散度名称,而要推导实际作用于策略梯度的权重形式。确认该权重是否与分布偏移(如绝对概率差)直接关联、是否有界、是否在越界时提供校正信号。
- 监控令牌级偏移:可在训练中记录 的分布,当大量令牌持续超出 时,可考虑适当增大阈值或排查数据质量与奖励噪声。
DRPO 的核心贡献在于把 “信任域应约束分布偏移” 这一直觉,通过一个简单且平滑的二次惩罚器落实到了梯度层面,为 LLM 的稳定强化学习提供了一条工程上可立即采用的路径。