重新思考大语言模型强化学习中的散度正则化
论文信息
标题: Rethinking the Divergence Regularization in LLM RL
作者: Jiarui Yao, Xiangxin Zhou, Penghui Qi, et al.
发布日期: 2026-06-08
arXiv ID: 2606.09821v1
PDF 链接: 下载 PDF
论文背景和研究动机
大语言模型(LLM)的后训练阶段,强化学习(RL)已成为对齐人类偏好、提升复杂推理能力的关键技术。在此类任务中,模型被视作自回归的 token 级策略,逐 token 生成回复,并根据最终标量奖励进行优化。然而,现代 LLM 的 RL 训练几乎天然处于 off‑policy 状态:推理引擎与训练引擎在数值精度、执行路径上存在差异,并且大规模采样得到的轨迹往往会被分割成多个小批次进行多次梯度更新。这导致正在优化的策略与生成数据的策略不再一致,因此必须引入信任区域来稳定优化。
主流方法如 PPO 和 GRPO 通过重要性比率的裁剪来近似信任区域,但这一做法在 LLM 庞大的长尾词汇表上暴露出根本缺陷。一个低概率 token 的微小概率增加就会引发极大的比率变化,而高概率 token 上同等规模的比率偏移却可能对应着更大的概率质量移动。固定的比率窗口会过度惩罚频繁探索的稀有 token,却又对高频 token 约束不足。DPPO 率先指出这一点,并改用基于散度的掩码——当策略偏离超过阈值且当前更新会继续恶化时直接丢弃 token 的梯度。但其硬掩码依然粗糙:一旦 token 跨出边界,梯度便骤降为零,既没有逐步衰减的过渡,也缺乏将策略拉回信任区域的修正信号。
针对这些问题,本文提出了 Divergence Regularized Policy Optimization(DRPO)。它保留了 DPPO 所采用的基于绝对概率偏移的信任区域几何,同时用平滑的二次正则项取代硬掩码,从而在稳定性和训练效率上实现了一致提升。
核心方法和技术细节
DRPO 的出发点来自 DPPO 的 Binary‑TV 近似。对于采样到的 token ,Binary‑TV 散度定义为
其中 是重要性比率。DPPO 的信任区域要求 ,这等价于一个 token 自适应的比率约束:
与 PPO 固定的比率区间相比,这里宽度与 token 的行为概率成反比,从而对低概率 token 更宽松、对高概率 token 更严格。
受 SPO 的启发,DRPO 不再用硬裁剪或硬掩码,而是通过一个优势加权的二次正则项来实现同样的信任区域。DRPO 的每 token 目标函数为
整体损失为对该目标在所有采样轨迹上的期望。这里 是优势估计。相较于 SPO,关键区别在于正则项中多了一个因子 。正是这个因子将 SPO 中隐含的 型惩罚(平方概率偏移除以 )转变为了 型惩罚——直接对绝对概率偏移 进行约束,而非对其比率变化。
对策略参数求梯度,DRPO 产生的梯度权重为
该权重根据更新的方向与幅度连续变化。当更新将 推离 时(),权重为 。在信任区域内部,,权重为正且逐渐衰减;当跨过边界后权重变为负,梯度反转,提供明确的回拉信号,将策略拉向信任区域的边界。当更新朝向行为策略回缩时,权重放大为 ,加速收敛。
这种连续、有界的梯度形式是 DRPO 的核心优势。相比之下,SPO 的权重依赖于 ,在低概率 token 上该值可随意膨胀,导致梯度权重无界,极易让训练失稳。而 DRPO 的权重完全由绝对概率偏移 决定,该量天然在 内有界,因此 被限制在 之间,保证了所有 token 上的梯度稳定。
创新点和贡献
DRPO 的主要贡献在于重新思考了 LLM 强化学习中发散正则化的形式,并从梯度设计视角提供了实用方案。
首先,信任区域几何的转变。DRPO 明确将信任区域定义在绝对概率偏移上,而非重要性比率上。这从根本上解决了长尾词汇下比率剧烈波动带来的问题,使约束与真实的分布漂移更一致。
其次,平滑矫正机制。不同于 DPPO 的硬掩码,DRPO 通过二次正则化实现了梯度权重的连续衰减和越过边界后的反向修正。这不仅消除了边界附近的梯度突变,还避免了 token 被永久丢弃的情况,提高了训练的鲁棒性。
第三,梯度有界性。通过对 的巧妙加权,DRPO 将梯度权重的变化完全锚定在绝对值域,即使在极低概率 token 上也能维持有限权重,从而克服了 SPO 等方法在长尾区域的不稳定性。
此外,消融实验揭示了优势加权 的关键作用。虽然它使正则项无法被看作一个纯粹的散度度量,但正是这一设计让信任区域边界与优势幅度解耦,保证了边界的位置恒定且独立于奖励尺度。没有该加权时,训练性能显著下降。这一发现为未来的正则器设计提供了重要准则:不要盲目追求形式上的散度,而应重视梯度所诱导的信任区域几何。
实验结果分析
论文在 Qwen3‑4B‑Base、Qwen3‑30B‑A3B‑Base 等不同规模和架构的模型上,以及 BF16 和 FP8 等多种精度设置下进行了系统评估,基准任务为 AIME 数学推理。
整体结果显示,DRPO 在所有六种设定中都取得了最优或接近最优的成绩。相比之下,基于比率裁剪的 GRPO 和 SPO 在低精度训练中频繁出现训练崩溃,且即使表现较好的情形,其最终准确率和效率也落后于 DRPO。这印证了 作为散度代理的不可靠性。而 DPPO 尽管使用了更合理的散度掩码,但因硬切断的存在,收敛速度较慢,最终得分往往低于 DRPO。有趣的是,完全不施加信任区域的裸体代理在某些设定下也能取得较好结果,但表现不稳定,在另一模型上性能暴跌,这进一步表明信任区域仍是必要的,但其形式至关重要。
消融实验给出了更细腻的结论:
- 优势加权 的移除会导致性能大幅下降和训练失稳,因为它使得信任区域边界随优势大小浮动。
- 使用前向 KL 或 TV 替代 DRPO 的正则项均无法匹敌 DRPO。理论分析指出,KL 类型会诱导出基于比率的边界,TV 则退化为二值梯度权重,两者都未能得到平滑的 Binary‑TV 几何。
- 仅将正则化应用于信任区域外(Mask‑DRPO)的性能与全量 DRPO 接近,表明主要收益来自对出界 token 的修正,而内部平滑衰减相对次要。同时,即使在 Mask 模式下,其他散度正则项依然劣于 DRPO,进一步验证了 Binary‑TV 二次正则项的独特有效性。
这些结果一致地传递出:在 LLM RL 中,梯度的具体形式远比损失函数中散度的名称更重要。
实践应用建议和未来发展方向
对于希望在大语言模型上稳定运行强化学习微调的从业者,DRPO 提供了几项可操作的洞见。
- 用绝对概率偏移取代重要性比率。在实现信任区域时,应避免直接使用 作为约束依据,尤其是在模型词表庞大、采样温度较高的情况下。基于 的度量更贴近实际的概率质量移动,能同时兼顾高频和低频 token。
- 优先选用平滑正则化而非硬裁剪或硬掩码。连续的梯度权重不仅能避免梯度突变,还能为越界的更新提供纠正机会。这在模型规模大、训练‑推理 mismatch 严重时尤为关键。
- 正则化强度应与优势的绝对量成比例。通过在损失中引入 因子,可以保证每个 token 的信任区域边界恒定,不受优势浮动影响。虽然这会牺牲损失函数作为 “纯粹散度” 的简洁性,但对稳定训练的增益是决定性的。
- 在低精度(如 FP8)或 MoE 架构下更要重视信任区域设计。这些设定下数值 mismatch 被放大,ratio‑based 方法极易崩溃,此时 DRPO 的稳健性优势更加突出。
展望未来,几个方向值得探索。一是结合自适应阈值,根据当前策略分散度动态调整 ,以在不牺牲探索的前提下更精细地控制漂移。二是将 DRPO 的思想推广到更丰富的散度族,或与策略镜像下降等在线方法结合,进一步提升样本效率。三是将梯度设计的方法论引入其他需要信任区域的场景,如多模态 LLM 或基于 RLHF 的偏好对齐,验证其通用性。
总结与展望
DRPO 通过一个简洁的加权二次正则项,将 DPPO 的散度感知信任区域与 SPO 的平滑矫正机制融为一体。它从根本上规避了长尾词汇下比率估计的高方差问题,同时用连续的梯度权重替代硬掩码,在维持同一 Binary‑TV 信任区域边界的前提下,实现了更稳定、更高效的训练。实验充分验证了其在不同模型、精度条件下的优越性和鲁棒性。
这项工作提示我们,在大模型 RL 中,设计正则化器不能只停留在散度名称的层面,而必须深入分析梯度流中每个 token 的权重形式,确保信任区域几何与真实分布漂移匹配,并且梯度有界。DRPO 为此提供了一套清晰的原则和实用的实现方案,有望成为 LLM 后训练中新一代稳定优化方法的基石。