一种用于 LLM 偏好对齐的零阶范式
A Zeroth-Order Paradigm for LLM Preference Alignment
论文信息
标题: A Zeroth-Order Paradigm for LLM Preference Alignment
作者: Peter Chen, Xi Chen, Wotao Yin, et al.
发布日期: 2026-09-16
arXiv ID: 2609.19144v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:论文针对大语言模型直接偏好对齐中的 “似然位移”(likelihood displacement)问题,尤其是低似然边际的噪声偏好对带来的副作用。
- 核心方法:提出 ComPO,一种基于比较预言机(comparison oracle)的零阶对齐方法。它不直接对偏好损失求梯度,而是通过扰动当前策略、观察偏好/非偏好回复似然变化,估计稀疏更新方向。
- 关键结果:在 Mistral、Llama、Gemma-2、Qwen3、Gemma-3 等模型上,ComPO 与 DPO/SimPO 组合后,在多数基准上改善了表现,尤其是 AlpacaEval 2 长度控制胜率(表 1、表 3)。
- 主要局限:论文的实用在线方案使用长度归一化统计量并采用软阻尼,不等价于理论中的硬 reverse-KL 约束,因此不能被论文定理 3.4 覆盖(见论文第 3.2 节);理论收敛结果也依赖潜在目标、梯度稀疏和预言机兼容假设。
- 适合读者:从事 LLM 对齐、直接偏好优化、零阶优化、RLHF,或关注偏好数据低边际样本处理的研究与工程人员。
论文背景和研究动机
大语言模型在预训练后通常需要与人类偏好对齐,使回复有帮助、无害且可靠。RLHF 需要先训练奖励模型,再用强化学习优化策略,流程多、计算和显存开销较大。DPO 等直接偏好对齐方法以更简单、稳定的方式利用偏好对直接训练策略,避免了单独奖励模型。
但直接对齐方法存在 “似然位移” 问题:训练可以提高偏好回复相对非偏好回复的相对概率,却同时降低偏好回复的绝对概率。论文举了一个已有工作中的例子:当要向模型传递 “No 优于 Never” 的偏好时,DPO 训练可能反而大幅提高 “Yes” 的概率;更严重时,Gemma-2B-it 初始会拒绝危险请求,DPO 训练后却可能因为概率质量从拒回复中移走而顺从请求(论文第 1 节)。此外,直接对齐还可能带来冗长回复倾向。
已有研究发现,似然位移与偏好对中偏好/非偏好回复在建模指标下相似的情况有关。论文把这些低边际样本称为 “噪声偏好对”,定义为对数似然差不超过阈值 的样本(Eq. 10)。一种策略是直接过滤这些样本,但过滤会完全移除其中的比较信息。作者提出,低边际对虽然不适合用固定边际损失直接优化,但仍能作为局部比较信号:一个更好的邻近策略应当同时提高偏好回复似然、降低非偏好回复似然。这构成 ComPO 的动机。
核心方法和技术细节
ComPO 使用偏好比较预言机。对固定样本集 ,定义
- 为偏好回复对数似然的平均变化;
- 为非偏好回复对数似然的平均变化。
偏好比较预言机返回 ,当且仅当从 到 后 且 ;否则返回 。也就是说, 表示 在该偏好集上被认为优于 。
在每个迭代,ComPO 采样 个单位球面扰动 ,对当前参数 和扰动参数 查询预言机,得到一位标签 。之后求解带稀疏约束的优化问题:
并将方向用于更新 。其思想来自一比特压缩感知:扰动查询近似给出 。
实际实现(Algorithm 2)并不对全部参数做扰动,而是冻结除输出层以外的参数,仅扰动输出层 。将偏好集划分为 D_clean 和 D_noisy 后,论文先用 DPO 或 SimPO 优化干净对,再对低边际对运行 ComPO。实用步骤中,方向估计被替换为
并对每个条目做阈值裁剪;若 的比例低于阈值 ,则跳过该迭代。这样只更新少量输出层参数,例如论文报告在 Mistral-7B 和 Llama-3-8B 中约保留 1% 输出层条目(图 1 左)。
在线扩展(Algorithm 4)保留离线比较方向,但使用当前策略的未标注生成调整步长。具体是计算长度归一化统计量
再用软阻尼规则
调整步长。论文还加入重放缓冲区:只保存通过比较门槛的历史小批次,并以概率 重放。
创新点和贡献
论文的主要贡献有三点:
- 提出 ComPO,通过比较预言机从低边际偏好对中提取方向,而不在噪声对上直接优化可微偏好损失;实用离线实现采用输出层扰动和条目阈值。
- 为基本离线方案建立 best-iterate 收敛保证。该理论在存在潜在光滑目标 、梯度稀疏、且偏好比较预言机与 兼容的条件下成立,预言机调用次数对环境维度 仅呈对数依赖(定理 3.2)。就在线基本受约束方案,定理 3.4 证明迭代始终位于 reverse-KL 邻域 ,并在局部覆盖假设下用分布内成对奖励误差给出性能上界。
- 在多个模型家族上评估 ComPO 与直接对齐方法的组合,使用配对似然诊断支持 ComPO 缓解似然位移的方向。
实验结果分析
在离线实验中,论文使用 UltraFeedback 数据集,先把数据划分为 D_clean 和 D_noisy,再比较 DPO、DPO_clean 与 DPO_clean+ComPO。表 1 显示,仅过滤低边际对不总能一致改进 DPO;例如 Llama-3-Instruct-8B 的 DPO_clean 略优于 DPO,但 Mistral-7B-Base 的若干指标接近或更差。相较之下,DPO_clean+ComPO 在大多数模型-基准组合中可以改善结果,其中 AlpacaEval 2 长度控制胜率改善较一致。例如 Mistral-7B-Instruct 的 LC 从 DPO 的 24.14% 升至 26.17%(表 1)。论文也报告了例外:Mistral-7B-Instruct 在 Arena-Hard 的原始胜率从 14.4 降至 10.5。作者解释 Arena-Hard 使用原始胜率,可能较偏好更长回复;同时该配置下平均回复长度分别为 513 和 468,但作者明确表示这不构成因果证明。
表 3 表明,将 ComPO 应用于已有 SimPO 检查点也可以改善 AlpacaEval 2 和多数 Arena-Hard 及 MT-Bench 指标。表 2 的配对似然诊断显示,在两个模型、多个试验中,偏好回复对数似然通常不下降,非偏好回复对数似然通常不上升。论文将这一现象表述为 “与缓解似然位移一致的证据”,而不是群体层面的性能保证。
消融实验(第 4.2 节)显示:增加扰动数 从 800 到 5400,平均 WR/LC 有改善,但收益递减;扰动输出层以外还会带来更高显存和更长时间,但在三个扰动层设置中指标更高;阈值 保留约 1%–6% 输出层条目时效果最好;低边际对从 100 增至 300 时表现继续改善。在线实验(表 10)表明,与离线 ComPO 相比,加入长度归一化阻尼和重放在 Qwen3-4B-Base、Llama-3.2-3B-Instruct 和 Gemma-3-4B-it 上普遍提高 AlpacaEval 2 与 Arena-Hard 指标。
实践建议
对于希望缓解 DPO 类方法似然位移、同时在低算力下进行后训练的团队,ComPO 提供了一种可落地的组合思路。
首先,可以采用 “先干净对、后噪声对” 的两阶段流程:使用 Eq. 10 的边际阈值划分数据集,先在 D_clean 上运行现有 DPO 或 SimPO,再对 D_noisy 运行 ComPO。若已经有一个完整偏好集上训练好的 DPO 检查点,也可以在后续直接加 ComPO;论文表 8 显示这种直接叠加在 AlpacaEval 2 和 MT-Bench 上的增益与先过滤再叠加相当。
其次,ComPO 的实际实现对显存友好。论文报告 Llama-3-8B 的 ComPO 峰值约 23 GB/GPU,而 DPO、SimPO 的峰值约 77 GB、69 GB,但这些测量使用 A40 与 H100 不同硬件,只能理解为资源需求参考(图 1 中)。如果优先降低显存和避免全模型反向传播,可以优先只扰动 lm_head 层,并保持其余参数冻结。
在超参数上,论文的消融结果提供了一些建议:扰动数 可以调大,但收益存在递减; 不宜过高或过低,论文建议保留约 1%–6% 高幅值条目; 用于跳过低比较信号的小批次。配置应按模型进行调整,论文为不同模型家族给出的 、、 可作为起点。
最后,在可获得未标注当前策略生成样本时,可以尝试在线阻尼和重放。论文表 10 表明,在该实验设置下,阻尼和重放在三个模型上进一步改善指标。但需要注意,实际在线方案并非执行理论中的硬 reverse-KL 约束,而是一种启发式实现;若应用场景对偏离参考策略有严格上限要求,还需额外监控或加入更严格的 KL 控制机制。