GDPO:面向多奖励强化学习优化的分组奖励解耦归一化策略优化

GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization

arXiv: 2601.05242v1

论文信息

标题: GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization

作者: Shih-Yang Liu, Xin Dong, Ximing Lu, et al.

发布日期: 2026-01-08

arXiv ID: 2601.05242v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:这篇论文要解决多奖励强化学习中,直接使用 GRPO 对总和奖励做组归一化会导致不同奖励组合塌缩为相同优势值,损失学习信号分辨率,甚至引发训练崩溃。
  • 核心方法:提出 GDPO(Group reward-Decoupled Normalization Policy Optimization),对每个奖励单独做组归一化后再加和,并加入批次级优势归一化以保持数值稳定。
  • 关键结果:在工具调用、数学推理和代码推理三个任务上,GDPO 在所有奖励维度上均一致优于 GRPO;例如在 AIME 上训练 DeepSeek-R1-1.5B,GDPO 相较 GRPO 精度提升最高达 6.3%,同时大幅降低超长响应比例(表 3)。
  • 主要局限:论文未讨论当奖励数量极多或奖励高度稀疏时 GDPO 的衰减行为,也未给出超参数关于任务规模的缩放建议。
  • 适合读者:对 LLM 强化学习微调、多目标偏好对齐、以及 GRPO 类算法感兴趣的研究人员和工程师;尤其是正在应用多奖励 RL 的从业者。

论文背景和研究动机

随着大语言模型需要同时满足准确性、格式合规、长度限制、安全性等多维人类偏好,强化学习流水线越来越多地引入多个奖励信号。近期工作几乎都默认直接使用 Group Relative Policy Optimization(GRPO)来优化多个奖励之和,而很少检查 GRPO 在异质多奖励下的适用性。

GRPO 通过对每组采样响应计算组内均值与标准差来获得组相对优势,从而省去价值模型。当面临多个奖励时,现有做法是先将不同奖励简单相加得到总奖励 rsumr_{\text{sum}},再对总奖励进行组归一化得到优势 AsumA_{\text{sum}}。本论文发现这一环节存在严重的 “奖励信号塌缩” 问题:在典型的二值二元奖励、每组两个响应的场景下,六种总奖励组合被映射为仅两种不同的优势值,无法区分如 (0,2)(0,2) 和 (0,1)(0,1) 这类在奖励组成上有重要差异的情形。随着采样数或奖励数量增加,GRPO 的独特优势组数远低于理论上应保留的数量(图 3)。这种塌缩导致训练信号不够精细,可能引起策略更新失准、收敛放缓甚至训练早期崩溃(如图 5 所示,GRPO 训练约 400 步后正确性奖励下降)。因此,探索更适合多奖励的优化方法成为必要。

核心方法和技术细节

GDPO 的关键思想是将奖励的和归一化改为 “先分别归一化,再求和”,即对每个奖励单独执行组内归一化,保留不同奖励维度下的相对差异。

给定一个问题-答案对,对第 jj 个响应的第 kk 个奖励 rk(i,j)r_k^{(i,j)},先对该组内的 GG 个响应计算该奖励的均值与标准差:

Ak(i,j)=rk(i,j)−mean{rk(i,1),…,rk(i,G)}std{rk(i,1),…,rk(i,G)}A_k^{(i,j)} = \frac{r_k^{(i,j)} - \mathrm{mean}\{r_k^{(i,1)},\dots,r_k^{(i,G)}\}}{\mathrm{std}\{r_k^{(i,1)},\dots,r_k^{(i,G)}\}}

然后将各奖励的优势加和:

Asum(i,j)=∑k=1nAk(i,j)A_{\text{sum}}^{(i,j)} = \sum_{k=1}^n A_k^{(i,j)}

最后为了防止优势数值尺度随奖励数量膨胀,再执行批次级优势归一化:

A^sum(i,j)=Asum(i,j)−meanbatch{Asum}stdbatch{Asum}+ϵ\hat{A}_{\text{sum}}^{(i,j)} = \frac{A_{\text{sum}}^{(i,j)} - \mathrm{mean}_{\text{batch}}\{A_{\text{sum}}\}}{\mathrm{std}_{\text{batch}}\{A_{\text{sum}}\} + \epsilon}

进一步,论文还讨论了如何融入用户对不同目标的优先级变化。当各目标难度差异悬殊时,简单地调整权重 wkw_k 可能无法有效优先化困难目标,因为模型倾向于最大化容易目标。解决方法是将容易奖励(如长度限制奖励)条件化于困难奖励(如正确性奖励)之上,例如:

R~length={1,若长度达标且 Rcorrect=10,否则\tilde{\mathcal{R}}_{\text{length}} = \begin{cases}1, & \text{若长度达标且 }\mathcal{R}_{\text{correct}}=1 \\ 0, & \text{否则}\end{cases}

这会强制模型优先优化正确性,再从权重微调中反映精细偏好。实验表明,这种条件化奖励函数在 GDPO 下能达到更好的准确率-效率权衡(表 4)。

创新点和贡献

  • 揭示 GRPO 在多奖励下的塌缩问题:通过理论枚举和图解展示 GRPO 总奖励归一化会压缩奖励组合信息,损失优势分辨率(图 2 及图 3)。
  • 提出 GDPO:通过奖励解耦组归一化保留跨奖励差异,并加入批次级优势归一化维持数值稳定性,无需更改 RL 主体架构,易于集成到现有框架(已在 HF-TRL、verl、Nemo-RL 提供实现)。
  • 系统性优先级融合方案:区分权重调整与奖励函数条件化两种机制,指出当目标难度差异大时,条件化奖励是更有效的手段,并提供经验验证。
  • 跨任务可推广性验证:在工具调用(行为级奖励)、数学推理(长度约束)和代码推理(三个奖励)等不同任务、不同模型上,GDPO 始终优于 GRPO。

实验结果分析

论文在三个代表性任务上对比 GDPO 与 GRPO(以及去掉标准差归一化的变体 GRPO w/o std)。

工具调用:使用 ToolRL 基准训练 Qwen2.5-Instruct(1.5B/3B),奖励包括格式合规和工具调用正确性。GDPO 在 BFCL-v3 评测上平均准确率相对 GRPO 提升约 2.6%(1.5B: 30.18% → 32.81%;3B: 39.20% → 40.87%),格式正确率分别提升 4.3% 和 0.6%(表 1)。GRPO w/o std 完全学不会格式,正确格式率为 0%(表 2),说明仅靠去除标准差归一化反而导致训练不稳定。

数学推理:在 DeepScaleR-Preview 上训练 DeepSeek-R1 1.5B/7B 和 Qwen3-4B,同时优化正确性和长度约束(奖励 l=4000l=4000)。训练曲线(图 5, 图 9, 图 10)显示 GDPO 能更早恢复正确性损失并持续提升,而 GRPO 约 400 步后正确性回落且最大响应长度反弹。在 AIME 等榜单上,GDPO 在保持或提高精度的同时将超长响应比例大幅降低(例如 DeepSeek-R1-1.5B 在 AIME Exceed 从 GRPO 的 10.8% 降至 6.5%,准确率从 23.1% 升至 29.4%)。当调整长度奖励权重时,GDPO 在条件化奖励下实现更可控的准确率-长度取舍(表 4,图 6)。

代码推理:在 Eurus-2-RL 数据集上训练 DeepSeek-R1-7B,优化通过率、条件化长度和 Bug 比率三个奖励。GDPO 在两目标和三目标设置下均表现出更好的多目标平衡。例如三目标下,GDPO 相较 GRPO 在 Apps 上通过率几乎不变(67.8% vs 68.1%)但长度超出率从 11.2% 降至 8.5%,Bug 率从 20.3% 降至 18.8%(表 5),表明其优势随奖励数量增加依然保持。

实践建议

对于正在或计划使用多奖励 RL 微调 LLM 的团队,以下建议可帮助获得更稳定、高效的对齐效果:

  1. 用 GDPO 替换 GRPO 作为多奖励优化器。论文验证了在 2–3 个奖励(格式、正确性、长度、Bug 率)下 GDPO 均优于 GRPO,且现存主流训练框架(verl、HF-TRL 等)已提供集成。建议直接使用 GDPO 进行多奖励训练,避免因总奖励归一化导致的学习信号折损。

  2. 当目标难度差异显著时,优先采用条件化奖励而非纯调整权重。若希望模型 “先保证准确性再限制长度”,可将长度奖励设置为仅在答案正确时才有效,从而强制模型优先优化正确性,再通过细调长度权重控制效率。根据论文表 4,GDPO 配合条件化长度奖励在 AIME 准确率提升 4.4 个百分点同时大幅减少超长输出,而单纯调小长度权重则可能无法有效传递优先级。

  3. 保持批次级优势归一化以提升训练稳定性。实验显示去除批次归一化偶尔会导致收敛失败(附录 A),因此在实现 GDPO 时应保留这一步,尤其是引入更多奖励时。

  4. 多奖励场景下避免去除 GRPO 标准差归一化。GRPO w/o std 看似增加了优势多样性,但在工具调用实验中表现出严重的格式学习失败,证明仅靠去除归一化非但不能解决问题,甚至可能破坏训练。

  5. 对奖励函数的设计要结合任务结构。论文指出奖励权重调整与条件化并非互斥,可以在解决难度差异后,利用权重进一步微调各项偏好。实践中可先用条件化保证核心目标,再通过权重控制次要目标幅度。

综上,GDPO 为多奖励对齐提供了一个简洁高效的专用优化方案,有望成为未来多偏好对齐训练的标准组件。