一种用于 LLM 偏好对齐的零阶范式

A Zeroth-Order Paradigm for LLM Preference Alignment

arXiv: 2609.19144v1

论文信息

标题: A Zeroth-Order Paradigm for LLM Preference Alignment

作者: Peter Chen, Xi Chen, Wotao Yin, et al.

发布日期: 2026-09-16

arXiv ID: 2609.19144v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:论文针对大语言模型直接偏好对齐中的 “似然位移”(likelihood displacement)问题,尤其是低似然边际的噪声偏好对带来的副作用。
  • 核心方法:提出 ComPO,一种基于比较预言机(comparison oracle)的零阶对齐方法。它不直接对偏好损失求梯度,而是通过扰动当前策略、观察偏好/非偏好回复似然变化,估计稀疏更新方向。
  • 关键结果:在 Mistral、Llama、Gemma-2、Qwen3、Gemma-3 等模型上,ComPO 与 DPO/SimPO 组合后,在多数基准上改善了表现,尤其是 AlpacaEval 2 长度控制胜率(表 1、表 3)。
  • 主要局限:论文的实用在线方案使用长度归一化统计量并采用软阻尼,不等价于理论中的硬 reverse-KL 约束,因此不能被论文定理 3.4 覆盖(见论文第 3.2 节);理论收敛结果也依赖潜在目标、梯度稀疏和预言机兼容假设。
  • 适合读者:从事 LLM 对齐、直接偏好优化、零阶优化、RLHF,或关注偏好数据低边际样本处理的研究与工程人员。

论文背景和研究动机

大语言模型在预训练后通常需要与人类偏好对齐,使回复有帮助、无害且可靠。RLHF 需要先训练奖励模型,再用强化学习优化策略,流程多、计算和显存开销较大。DPO 等直接偏好对齐方法以更简单、稳定的方式利用偏好对直接训练策略,避免了单独奖励模型。

但直接对齐方法存在 “似然位移” 问题:训练可以提高偏好回复相对非偏好回复的相对概率,却同时降低偏好回复的绝对概率。论文举了一个已有工作中的例子:当要向模型传递 “No 优于 Never” 的偏好时,DPO 训练可能反而大幅提高 “Yes” 的概率;更严重时,Gemma-2B-it 初始会拒绝危险请求,DPO 训练后却可能因为概率质量从拒回复中移走而顺从请求(论文第 1 节)。此外,直接对齐还可能带来冗长回复倾向。

已有研究发现,似然位移与偏好对中偏好/非偏好回复在建模指标下相似的情况有关。论文把这些低边际样本称为 “噪声偏好对”,定义为对数似然差不超过阈值 δmargin\delta_{\text{margin}} 的样本(Eq. 10)。一种策略是直接过滤这些样本,但过滤会完全移除其中的比较信息。作者提出,低边际对虽然不适合用固定边际损失直接优化,但仍能作为局部比较信号:一个更好的邻近策略应当同时提高偏好回复似然、降低非偏好回复似然。这构成 ComPO 的动机。

核心方法和技术细节

ComPO 使用偏好比较预言机。对固定样本集 SS,定义

  • ΔS+(θ,θ′)\Delta_S^+(\theta,\theta') 为偏好回复对数似然的平均变化;
  • ΔS−(θ,θ′)\Delta_S^-(\theta,\theta') 为非偏好回复对数似然的平均变化。

偏好比较预言机返回 −1-1,当且仅当从 θ\theta 到 θ′\theta' 后 ΔS+(θ,θ′)>0\Delta_S^+(\theta,\theta')>0 且 ΔS−(θ,θ′)<0\Delta_S^-(\theta,\theta')<0;否则返回 +1+1。也就是说,−1-1 表示 θ′\theta' 在该偏好集上被认为优于 θ\theta。

在每个迭代,ComPO 采样 mm 个单位球面扰动 ziz_i,对当前参数 θt\theta_t 和扰动参数 θt+rzi\theta_t+r z_i 查询预言机,得到一位标签 yiy_i。之后求解带稀疏约束的优化问题:

g^=arg⁡max⁡∥g∥1≤s, ∥g∥≤1∑i=1myizi⊤g\hat{\mathbf{g}} = \arg\max_{\|\mathbf{g}\|_1 \le \sqrt{s},\ \|\mathbf{g}\| \le 1} \sum_{i=1}^m y_i z_i^\top \mathbf{g}

并将方向用于更新 θt+1=θt−ηg^\theta_{t+1}=\theta_t-\eta \hat{\mathbf{g}}。其思想来自一比特压缩感知:扰动查询近似给出 yi≈sign⁡(zi⊤∇f(θt))y_i \approx \operatorname{sign}(z_i^\top \nabla f(\theta_t))。

实际实现(Algorithm 2)并不对全部参数做扰动,而是冻结除输出层以外的参数,仅扰动输出层 θo\theta^o。将偏好集划分为 D_clean 和 D_noisy 后,论文先用 DPO 或 SimPO 优化干净对,再对低边际对运行 ComPO。实用步骤中,方向估计被替换为

ut=∑i=1myizi,g^to=ut/∥ut∥,u_t=\sum_{i=1}^m y_i z_i,\quad \hat{\mathbf{g}}_t^o = u_t/\|u_t\|,

并对每个条目做阈值裁剪;若 yi=−1y_i=-1 的比例低于阈值 λ\lambda,则跳过该迭代。这样只更新少量输出层参数,例如论文报告在 Mistral-7B 和 Llama-3-8B 中约保留 1% 输出层条目(图 1 左)。

在线扩展(Algorithm 4)保留离线比较方向,但使用当前策略的未标注生成调整步长。具体是计算长度归一化统计量

d^t=1B∑j=1Blog⁡πθt(y~j∣x~j)−log⁡πref(y~j∣x~j)max⁡{1,∣y~j∣}\hat{d}_t = \frac{1}{B}\sum_{j=1}^{B} \frac{\log\pi_{\theta_t}(\tilde{y}_j\mid\tilde{x}_j) -\log\pi_{\text{ref}}(\tilde{y}_j\mid\tilde{x}_j)} {\max\{1, |\tilde{y}_j|\}}

再用软阻尼规则

γt=γ1+ρmax⁡{d^t−τp,0}\gamma_t = \frac{\gamma}{1+\rho \max\{\hat{d}_t-\tau_p,0\}}

调整步长。论文还加入重放缓冲区:只保存通过比较门槛的历史小批次,并以概率 α\alpha 重放。

创新点和贡献

论文的主要贡献有三点:

  1. 提出 ComPO,通过比较预言机从低边际偏好对中提取方向,而不在噪声对上直接优化可微偏好损失;实用离线实现采用输出层扰动和条目阈值。
  2. 为基本离线方案建立 best-iterate 收敛保证。该理论在存在潜在光滑目标 ff、梯度稀疏、且偏好比较预言机与 ff 兼容的条件下成立,预言机调用次数对环境维度 dd 仅呈对数依赖(定理 3.2)。就在线基本受约束方案,定理 3.4 证明迭代始终位于 reverse-KL 邻域 Πτ\Pi_\tau,并在局部覆盖假设下用分布内成对奖励误差给出性能上界。
  3. 在多个模型家族上评估 ComPO 与直接对齐方法的组合,使用配对似然诊断支持 ComPO 缓解似然位移的方向。

实验结果分析

在离线实验中,论文使用 UltraFeedback 数据集,先把数据划分为 D_clean 和 D_noisy,再比较 DPO、DPO_clean 与 DPO_clean+ComPO。表 1 显示,仅过滤低边际对不总能一致改进 DPO;例如 Llama-3-Instruct-8B 的 DPO_clean 略优于 DPO,但 Mistral-7B-Base 的若干指标接近或更差。相较之下,DPO_clean+ComPO 在大多数模型-基准组合中可以改善结果,其中 AlpacaEval 2 长度控制胜率改善较一致。例如 Mistral-7B-Instruct 的 LC 从 DPO 的 24.14% 升至 26.17%(表 1)。论文也报告了例外:Mistral-7B-Instruct 在 Arena-Hard 的原始胜率从 14.4 降至 10.5。作者解释 Arena-Hard 使用原始胜率,可能较偏好更长回复;同时该配置下平均回复长度分别为 513 和 468,但作者明确表示这不构成因果证明。

表 3 表明,将 ComPO 应用于已有 SimPO 检查点也可以改善 AlpacaEval 2 和多数 Arena-Hard 及 MT-Bench 指标。表 2 的配对似然诊断显示,在两个模型、多个试验中,偏好回复对数似然通常不下降,非偏好回复对数似然通常不上升。论文将这一现象表述为 “与缓解似然位移一致的证据”,而不是群体层面的性能保证。

消融实验(第 4.2 节)显示:增加扰动数 mm 从 800 到 5400,平均 WR/LC 有改善,但收益递减;扰动输出层以外还会带来更高显存和更长时间,但在三个扰动层设置中指标更高;阈值 λg\lambda_g 保留约 1%–6% 输出层条目时效果最好;低边际对从 100 增至 300 时表现继续改善。在线实验(表 10)表明,与离线 ComPO 相比,加入长度归一化阻尼和重放在 Qwen3-4B-Base、Llama-3.2-3B-Instruct 和 Gemma-3-4B-it 上普遍提高 AlpacaEval 2 与 Arena-Hard 指标。

实践建议

对于希望缓解 DPO 类方法似然位移、同时在低算力下进行后训练的团队,ComPO 提供了一种可落地的组合思路。

首先,可以采用 “先干净对、后噪声对” 的两阶段流程:使用 Eq. 10 的边际阈值划分数据集,先在 D_clean 上运行现有 DPO 或 SimPO,再对 D_noisy 运行 ComPO。若已经有一个完整偏好集上训练好的 DPO 检查点,也可以在后续直接加 ComPO;论文表 8 显示这种直接叠加在 AlpacaEval 2 和 MT-Bench 上的增益与先过滤再叠加相当。

其次,ComPO 的实际实现对显存友好。论文报告 Llama-3-8B 的 ComPO 峰值约 23 GB/GPU,而 DPO、SimPO 的峰值约 77 GB、69 GB,但这些测量使用 A40 与 H100 不同硬件,只能理解为资源需求参考(图 1 中)。如果优先降低显存和避免全模型反向传播,可以优先只扰动 lm_head 层,并保持其余参数冻结。

在超参数上,论文的消融结果提供了一些建议:扰动数 mm 可以调大,但收益存在递减;λg\lambda_g 不宜过高或过低,论文建议保留约 1%–6% 高幅值条目;λ\lambda 用于跳过低比较信号的小批次。配置应按模型进行调整,论文为不同模型家族给出的 rr、mm、λg\lambda_g 可作为起点。

最后,在可获得未标注当前策略生成样本时,可以尝试在线阻尼和重放。论文表 10 表明,在该实验设置下,阻尼和重放在三个模型上进一步改善指标。但需要注意,实际在线方案并非执行理论中的硬 reverse-KL 约束,而是一种启发式实现;若应用场景对偏离参考策略有严格上限要求,还需额外监控或加入更严格的 KL 控制机制。