面向冲突目标的无奖励对齐
Reward-free Alignment for Conflicting Objectives
论文信息
标题: Reward-free Alignment for Conflicting Objectives
作者: Peter Chen, Xiaopeng Li, Xi Chen, et al.
发布日期: 2026-02-02
arXiv ID: 2602.02495v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:这篇论文要解决如何在不依赖显式奖励模型的前提下,对存在冲突目标的多个偏好进行对齐,使大语言模型(LLM)在多个相互竞争的标准(如帮助性与无害性)之间取得更好的权衡。
- 核心方法:论文提出名为 RACO 的奖励自由对齐框架,将多个目标的偏好损失与一种改良的冲突规避梯度下降算法(CAGrad-Clip)结合,通过裁剪其校正系数来防止对低优先级目标的过度纠正。
- 关键结果:在多个 LLM 家族(Qwen 3, Llama 3, Gemma 3)的摘要和安全对齐任务上,RACO 一致地取得了比现有奖励自由方法更优的帕累托前沿(见图 2(c)、图 3、图 4)。
- 主要局限:论文的理论分析集中在平滑非凸设定下的收敛性,并未讨论数据分布偏移或在线训练场景下的性能。
- 适合读者:对 RLHF、多目标优化、LLM 对齐、偏好学习感兴趣的机器学习研究员和工程师。
论文背景和研究动机
使大语言模型(LLM)的输出与人类偏好对齐是部署安全、有用模型的核心步骤。经典方法是使用人类反馈的强化学习(RLHF),但这需要训练显式的奖励模型,流程复杂且计算代价高。直接偏好优化(DPO)等奖励自由方法虽然简化了流程,却主要面向单一目标。然而,实际对齐问题本质上是多目标的——用户同时关心帮助性、无害性、忠实性、简洁性等多个相互冲突的标准。简单地对多个目标的偏好进行加权求和,往往会因为梯度方向相互抵消而导致训练不稳定或某一目标被牺牲。
已有一些多目标对齐工作,如 MODPO、AMoPO,它们要么依赖奖励模型,要么通过启发式权重聚合偏好损失,尚未系统性地解决梯度冲突。论文作者观察到,将多目标优化中的冲突规避梯度下降(CAGrad)直接用于 LLM 的参数空间有两个问题:一是高维空间中的梯度噪声会使搜索校正方向更加不稳定;二是加权求和后的校正步骤可能将更新方向过度拉向权重较小的目标,扭曲用户指定的权重比例。正是这些实际问题驱动了 RACO 及其带裁剪的改进方法。
核心方法和技术细节
RACO 将多个目标的偏好数据定义为各自的 DPO 式损失函数 ,并计算对应的策略梯度 。其目标是根据用户给定的权重 产生一个更新方向,使其既能改善加权损失 ,又能同时尊重所有目标。RACO 的核心步骤位于算法 1 中,可总结为:
- 计算加权梯度 作为锚点。
- 求解一个子问题,找到校正系数 ,使得一个混合梯度 与锚点的对齐程度在一个约束半径内最优。其数学形式为: 该问题在目标数 较少时(如 )存在闭式解(见附录 B.1)。
- 应用系数裁剪:,防止对权重较小的目标的校正权重超过用户指定的上限。这一步骤是论文方法的关键创新之一。
- 构造最终更新方向 ,其中 。
论文在理论上证明了该裁剪变体的收敛性(定理 3.1):在光滑且步长适当的设定下,算法可以收敛到 的临界点和所有目标的帕累托临界点,收敛速率为 。更有趣的是,在双目标情况下(定理 3.2),裁剪操作能严格提升单步下降的保证——即相比未裁剪的 CAGrad,CAGrad-Clip 能使加权损失下降得更快,这一结论在非共线梯度且主动裁剪时严格成立。
创新点和贡献
论文的主要贡献包括:
- 奖励自由且可处理冲突的对齐框架:首次将冲突规避梯度下降引入偏好对齐,并完整保留用户权重,不依赖显式奖励模型。
- 针对 LLM 训练的裁剪机制:提出 CAGrad-Clip,通过对校正系数施加用户权重的上界,解决了在高维参数空间中,校正步骤可能过度偏向弱目标的问题。这是对原始 CAGrad 的关键性、实用性改进。
- 新理论基础:为带裁剪的多目标梯度下降提供了收敛性保证,并证明了在双目标场景下的加速效果。这些定理构成了方法有效性的理论支柱。
- 广泛的实验验证:在摘要(Reddit TL;DR)和安全对齐(BeaverTails)两大任务上,覆盖 Qwen3-4B, Llama3-8B, Gemma3-4B 等多个模型族,无论是指令微调版还是基座版模型,RACO 都实现了比 DPO Loss Weight 和 AMoPO 更优的帕累托前沿。
实验结果分析
论文的实验涵盖两大任务和多个模型族,旨在评估方法在不同偏好权重下的实际权衡能力。
摘要任务(质量-简洁性 & 质量-忠实性) 在 Qwen3-4B 和 Llama3-8B 上的质量-简洁性任务中,论文监测了两个目标各自的验证边界值(margin)。结果表明(图 2(a)(b)),当某个目标的权重较高时,DPO Loss Weight 和 AMoPO 通常会以牺牲另一个目标为代价来提高重权重的目标,而 RACO 能够同时改善两个目标。通过扫描不同权重(),绘制出的帕累托前沿曲线(图 2(c))显示 RACO 在所有权重组合下都位于最外侧,代表更好的整体权衡。在质量-忠实性任务中,趋势相同(图 3),尤其在极端权重(如 0.8 / 0.2)下,RACO 的优势最为明显。
安全对齐任务(帮助性-无害性) 在 BeaverTails 基准上,RACO 同样产生了更优的帕累托前沿(图 4)。值得注意的是,在一些配置(如 Qwen3-4B-Base 和 Gemma3-4B-Instruct)中,RACO 是唯一能够在提升无害性的同时不严重损害帮助性的方法。GPT-5.1 作为裁判模型计算的胜率表(表 2)证实,RACO 在多数权重设置下对 DPO Loss Weight 和 AMoPO 都取得了较高的胜率,尤其在侧重帮助性的权重(0.8)下优势显著(例如对 AMoPO, 76.51% 的胜率,Gemma3-4B-Base)。
消融实验 消融实验定量展示了裁剪的作用。在 的极端权重下,原始 CAGrad 会对低权重目标分配很大的校正权重 ,导致过度校正;而 CAGrad-Clip 限制了 不超过 0.2,从而获得了更高的验证边界值(图 5),与理论分析一致。另外,对校正半径常数 的消融表明(图 6(b)), 在质量提升和表达长度控制之间提供了最佳平衡,且方法在该值附近对性能不敏感。
实践建议
对于大语言模型的对齐工程师和研究员,RACO 提供了一个在不牺牲多目标权衡的前提下进行偏好对齐的实用工具。基于论文发现,可在实践中考虑以下方面:
- 起步配置:对双目标对齐任务,可直接使用论文推荐的默认校正半径 (针对指令微调模型)或 (针对基座模型)。该方法对 不敏感,小幅调整通常不会导致性能崩溃。
- 数据预处理:参考论文做法,将多目标的偏好标签组织为独立的胜负对 ,直接对每个目标计算其 DPO 损失。这种处理能让 RACO 自然复用现有单目标偏好数据集,无需构建新的复杂标签体系。
- 监控方式:在训练中实时监控各个目标的验证边界值(margin),如论文实验所示,这是比生成质量打分更稳定、确定性更高的指标,能够有效暴露梯度冲突和过度校正问题。
- 极端权重场景:当某一目标权重极小(如 0.2)时,系数裁剪的效果最为显著。若业务场景需要极端的偏好倾斜(例如安全-严格模式),RACO-Clip 的裁剪机制是保证弱目标不被过度优化的关键。
- 扩展到更多目标:虽然论文实验主要聚焦两个目标,但算法理论上支持任意 个目标。当 时,求解校正系数的子问题需要数值优化(如投影梯度),会增加训练开销,但其原理和裁剪保障依然成立。