重新思考大语言模型强化学习中的散度正则化

Rethinking the Divergence Regularization in LLM RL

arXiv: 2606.09821v1

论文信息

标题: Rethinking the Divergence Regularization in LLM RL

作者: Jiarui Yao, Xiangxin Zhou, Penghui Qi, et al.

发布日期: 2026-06-08

arXiv ID: 2606.09821v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:大语言模型强化学习(LLM RL)中,基于重要性比率的信任域方法(如 PPO、GRPO)在长尾词汇分布下不稳定,而现有的散度掩码方法(DPPO)虽能部分缓解,却使用硬掩码导致梯度突变且缺乏校正信号。
  • 核心方法:提出散度正则化策略优化(DRPO),将 DPPO 的 Binary-TV 硬掩码替换为一种平滑的、优势加权的二次正则化项,直接约束被采样令牌的绝对概率偏移,并诱导出连续的、有界的梯度权重。
  • 关键结果:在 6 种不同模型、架构和精度设置的实验中,DRPO 均展现出更稳定的训练过程和更优的评估准确率,尤其在低精度(FP8)训练下优势明显(图 3)。
  • 主要局限:方法仍然基于 DPPO 的 Binary-TV 近似,仅考虑被采样令牌的概率偏移,未严格约束全分布散度;实验集中在数学推理任务,在其他类型任务上的泛化性尚未验证。
  • 适合读者:从事大语言模型对齐、强化学习训练、策略优化算法研究的工程师和科研人员。

论文背景和研究动机

在大语言模型的后训练阶段,强化学习已成为对齐人类偏好和提升复杂推理能力的关键技术。然而,现代 LLM RL 通常处于离策略(off‑policy)状态:由于训练引擎与推理引擎的数值不匹配,以及一次收集的轨迹会被切分为多个小批量进行多次梯度更新,当前更新的策略与产生数据的策略并不一致。在这种设定下,信任域控制对稳定优化至关重要。

主流方法 PPO 和 GRPO 通过简单的比率裁剪(ratio‑clipping)来近似信任域约束,但重要性比率 rt=π(yt∣st)/μ(yt∣st)r_t = \pi(y_t|s_t) / \mu(y_t|s_t) 在长尾、大词汇表场景中是分布偏移的一个很差代理:一个低概率令牌的微小绝对概率变化可以产生极大的比率,而高概率令牌的较小比率变化却可能导致显著的策略质量转移。因此,固定比率窗口往往过度约束低概率令牌,同时对高概率令牌约束不足。

DPPO(Qi et al., 2026)用散度掩码替代比率裁剪,具体采用 Binary‑TV 距离 DtBin-TV=∣π(yt∣st)−μ(yt∣st)∣D_t^{\text{Bin-TV}} = |\pi(y_t|s_t) - \mu(y_t|s_t)|,当策略偏移超过阈值且更新方向有害时直接将梯度置零。尽管这一设计更贴合分布偏移的几何,但硬掩码带来了新问题:在阈值附近梯度的突然切换会使优化不稳定,且一旦令牌越界,梯度被完全丢弃,缺乏将策略拉回信任域内的校正信号。

SPO(Xie et al., 2024)已经从 PPO 的硬裁剪走向平滑正则化,但它依然使用比率约束,其梯度权重在低概率尾端可能无界增长。基于这些观察,论文提出 DRPO,旨在保留 DPPO 的散度几何优点的同时,用平滑正则化器取代硬掩码,从而实现连续、有界的梯度,并在信任域外提供修正信号。

核心方法和技术细节

DRPO 的出发点是将 Binary‑TV 信任域 ∣π(yt∣st)−μ(yt∣st)∣≤δ|\pi(y_t|s_t) - \mu(y_t|s_t)| \le \delta 改写为自适应比率约束 ∣rt−1∣≤δ/μ(yt∣st)|r_t - 1| \le \delta / \mu(y_t|s_t),然后借鉴 SPO 把硬裁剪替换为二次惩罚的构造,得到如下目标函数:

LDRPO(x,π)=Ey∼μ(⋅∣x) ⁣[∑t=1∣y∣rtA^t−∣A^t∣2δ μ(yt∣st) (rt−1)2].\mathcal{L}_{\text{DRPO}}(x,\pi) = \mathbb{E}_{y\sim\mu(\cdot|x)}\!\left[\sum_{t=1}^{|y|} r_t \hat{A}_t - \frac{|\hat{A}_t|}{2\delta}\, \mu(y_t|s_t)\,(r_t - 1)^2 \right].

这里的关键在于正则化项中额外乘上了行为概率 μ(yt∣st)\mu(y_t|s_t)。这一简单修改将隐式正则化从 SPO 的 χ2\chi^2 型惩罚(即对概率偏移按 1/μ1/\mu 加权)转变为对绝对概率偏移的 ℓ22\ell_2^2 惩罚,从而与 Binary‑TV 距离对齐。

对目标求梯度后,每个令牌的策略梯度贡献被乘以权重:

wt=1−sign⁡(A^t(rt−1)) ∣π(yt∣st)−μ(yt∣st)∣δ.w_t = 1 - \operatorname{sign}\bigl(\hat{A}_t (r_t-1)\bigr) \, \frac{|\pi(y_t|s_t) - \mu(y_t|s_t)|}{\delta}.

该权重连续且分为两种情况:

  • 偏离行为策略( sign⁡>0\operatorname{sign}>0 ):权重为 1−DtBin-TV/δ1 - D_t^{\text{Bin-TV}}/\delta ,在信任域内随偏移增大而衰减,到达边界时权重为零,若继续向外则权重转为负值,提供反向校正梯度,将策略拉回边界处。
  • 靠近行为策略( sign⁡<0\operatorname{sign}<0 ):权重为 1+DtBin-TV/δ1 + D_t^{\text{Bin-TV}}/\delta ,梯度被放大,鼓励策略快速回归。

与 SPO 的权重 1−sign⁡(⋅) ∣rt−1∣/ϵ1 - \operatorname{sign}(\cdot)\,|r_t-1|/\epsilon 相比,DRPO 的权重直接依赖绝对概率偏移 ∣πt−μt∣|\pi_t - \mu_t|,该量始终在 [0,1][0,1],因此梯度权重被严格限制在 [1−1/δ, 1+1/δ][1-1/\delta,\,1+1/\delta] 之间,完全有界(表 1、图 1)。而在低概率令牌上 SPO 的权重可以趋于无穷,导致长尾区域的梯度爆炸。DRPO 的另一重要设计是将正则化强度与优势的绝对值 ∣A^t∣|\hat{A}_t| 耦合,使得令牌的最优解 πt∗=μt+sign⁡(A^t)δ\pi_t^* = \mu_t + \operatorname{sign}(\hat{A}_t)\delta 不依赖于优势尺度,从而保持信任域边界稳定。

从整体视角看,DRPO 实现了一个平滑的 Binary‑TV 信任域:它继承了 DPPO 的散度几何,避免了比率约束的方差和高敏感度,同时以连续的二次惩罚消除硬掩码的突变与零梯度死区。

创新点和贡献

  1. 从梯度视角设计正则化器:论文强调,对于 LLM RL 的离策略设定,正则化器诱导的实际梯度权重比名义散度更重要。DRPO 通过直接控制梯度权重,将信任域边界固定在 Binary‑TV 上,而非停留在比率空间。
  2. 解析不同散度正则化器的诱导几何:文中在附录 C 中严格对比了 KL、K3、TV 等常用惩罚项,证明它们的梯度要么退化为二元信号,要么仍为比率型约束,唯独 DRPO 能产生平滑的、附合绝对概率偏移的信任域。
  3. 提出优势加权的必要性:通过消融实验(图 4)和正则化分析,证明 ∣A^t∣|\hat{A}_t| 加权是维持稳定边界、防止令牌级噪声导致过度约束的关键,这并非一个可有可无的细节。
  4. 统一的实验验证:在密集模型、MoE 架构、不同参数量级以及 BF16 与 FP8 低精度训练等多种设置下,DRPO 一致优于 GRPO、SPO、DPPO 和不加信任域的基准(图 3),体现了方法在真实工程环境中的普适性与鲁棒性。

实验结果分析

实验涵盖了 Qwen3‑4B‑Base、Qwen3‑30B‑A3B‑Base、Qwen3.5‑35B‑A3B‑Base 以及 DeepSeek‑R1‑Distill‑1.5B 等模型,训练数据为约 13K 道数学题的 DAPO 子集,以 AIME2024/2025 的 Pass@16 平均分作为主要指标。

  • 整体性能:在所有 6 组实验中,DRPO 的训练曲线最稳定,最终准确率始终处于最高水平或与最佳基线持平(图 3)。尤其在 Qwen3‑4B‑Base 上,无信任域方法出现了明显的性能退化,而 DRPO 保持提升。
  • 低精度场景:在 Qwen3‑30B‑A3B‑Base 的 FP8 rollout 和 FP8 端到端训练设置下,基于比率的方法(GRPO、SPO)崩溃严重,而 DRPO 依然有效收敛,凸显其鲁棒性。
  • 硬掩码 vs 平滑正则化:DPPO 虽能稳定训练,但收敛速度和最终精度常不如 DRPO;而 Mask‑DRPO 实验(图 11)表明,将 DRPO 的正则化仅作用于 DPPO 信任域外的令牌时,性能与全局应用 DRPO 接近,说明主要的性能增益来自于边界外令牌的校正信号。
  • 消融实验:移除 ∣A^t∣|\hat{A}_t| 权重的 DRPO 和 SPO 均出现性能大幅下降或训练不稳定(图 4);用 KL、TV 等其他散度惩罚替代 DRPO 均不能达到同等效果(图 5)。这些结果印证了 “梯度几何优于散度名称” 的核心观点。

实践建议

对于实际部署 LLM RL 训练的团队,基于 DRPO 的改进可直接嵌入现有 PPO 或 GRPO 流程:

  • 替换裁剪机制:用 DRPO 损失(公式 8)代替 PPO 的比率裁剪或 DPPO 的硬掩码。论文推荐的超参数 δ=12.5\delta = 12.5 在多种模型上工作良好,无需细粒度调节(图 10)。
  • 处理训练‑推理错配:当使用不同精度(如 FP8)进行推理加速时,DRPO 对数值漂移的容忍度明显高于比率方法,有助于在工程效率与训练稳定性之间取得平衡。
  • 优势估计方式:DRPO 不依赖值函数,与 GRPO 的组相对优势完全兼容,可直接用于现有无需评论家的 GRPO 框架。
  • 关注梯度设计:在设计新的正则化器时,不应仅看目标函数的散度名称,而要推导实际作用于策略梯度的权重形式。确认该权重是否与分布偏移(如绝对概率差)直接关联、是否有界、是否在越界时提供校正信号。
  • 监控令牌级偏移:可在训练中记录 DtBin-TVD_t^{\text{Bin-TV}} 的分布,当大量令牌持续超出 δ\delta 时,可考虑适当增大阈值或排查数据质量与奖励噪声。

DRPO 的核心贡献在于把 “信任域应约束分布偏移” 这一直觉,通过一个简单且平滑的二次惩罚器落实到了梯度层面,为 LLM 的稳定强化学习提供了一条工程上可立即采用的路径。