通过选择性上下文偏好优化学习何时信任

Learning When to Trust via Selective Context Preference Optimization

arXiv: 2608.06377v1

论文信息

标题: Learning When to Trust via Selective Context Preference Optimization

作者: Xian Sun, Wei Chow, Yingshuo Wang, et al.

发布日期: 2026-08-06

arXiv ID: 2608.06377v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:语言模型容易受到外部上下文的误导,一个错误信号就能让原本正确的回答出错;但若让模型完全忽略上下文,又会失去利用可靠信息的能力。本文要解决的问题是如何让模型学会 “选择性信任”。
  • 核心方法:作者构建了包含四种匹配条件的人工标注基准 MIST,设计了衡量误导翻转率的成对指标 SC2W,并提出了 SCOPE——一种基于选择性上下文偏好优化,从全部四种条件中均衡采样偏好对来训练 DPO 的方法。
  • 关键结果:SCOPE 在多个流行开源模型上大幅降低了 SC2W 指标,同时能保持干净上下文、正确上下文和不相关上下文下的准确率(见论文实验部分)。
  • 主要局限:MIST 数据集为人工标注,规模与领域覆盖有限;当前只评估了推理类任务;SCOPE 依赖挖掘出的失败样本,对未见过的误导模式泛化能力未充分验证。
  • 适合读者:从事大语言模型对齐、可信 AI、检索增强生成(RAG)系统以及对话安全的研发人员与研究者,尤其是关注如何平衡鲁棒性与可用性的读者。

论文背景和研究动机

当前的大语言模型普遍支持在推理时融入外部上下文,例如搜索结果、用户提供的文档或工具返回的信息。这极大地扩展了模型的知识边界,但也引入了一个新的脆弱性:如果上下文中包含误导性信息,模型很可能将原本正确的答案改为错误答案。最简单的对策是训练模型 “抵抗” 误导信号,但论文指出这种策略藏着一个危险的失效模式——一个对所有上下文都视而不见的模型看似鲁棒,但当上下文确实值得信任时,它也变得毫无用处。

因此,作者将问题重新定义为 “选择性信任”(selective trust):模型不仅要能拒绝错误上下文,还要能在适当的时候采纳正确上下文、忽略不相关上下文。衡量选择性信任不能只看 “抗误导能力”,还必须考察模型在不同类型上下文下的综合表现。然而,此前很少有基准能够系统覆盖这些条件并给出统一的评价指标,训练方法也往往聚焦于单一的对抗目标,忽视了多条件之间的权衡。

核心方法和技术细节

论文的贡献包括三个紧密耦合的部分:基准数据集 MIST、评估指标 SC2W,以及训练方法 SCOPE。

MIST 基准:作者为每个推理问题精心设计了四种上下文条件:

  1. 干净条件:不提供任何外部上下文,仅凭问题作答。
  2. 误导条件:提供一条看似合理但会导向错误答案的上下文。
  3. 正确上下文条件:提供一条直接有助于得出正确答案的上下文。
  4. 不相关上下文条件:提供一条与问题无关的干扰信息。

所有条件的上下文都与问题一一对齐,确保比较的公平性。数据集通过人工标注构建,保证了上下文的质量与条件的精确控制。

SC2W 指标:全称为 “Selective Context-to-Wrong”,它衡量在误导上下文的干扰下,有多少原本在干净条件下回答正确的样本被翻转为错误。即计算满足 “干净时正确但加误导后错误” 的样本对比例。这一指标直观捕捉了模型对误导信号的敏感性,并且天然具有成对比较的性质。

SCOPE 训练方法:SCOPE 全称 Selective Context Preference Optimization,其核心思路是将选择性信任建模为偏好学习问题。具体做法分三步:

  1. 在 MIST 四种条件下分别运行模型,收集标准答案与非标准答案,构造偏好对。特别关注两类失败模式:干净时正确但误导时错误(需要惩罚)以及误导时错误但正确上下文时正确(需要奖励)。
  2. 从四种条件中均衡地采样偏好对,使得每一个训练批次中各个条件贡献的偏好数据比例一致。这与仅使用误导样本的传统方法形成对比——后者容易让模型学习到 “始终无视上下文” 的偏激策略。
  3. 使用标准的 Direct Preference Optimization (DPO) 目标函数在平衡的偏好对上进行优化,无需额外训练奖励模型。损失函数为:
LDPO(πθ;πref)=−E(x,yw,yl)∼D[log⁡σ(βlog⁡πθ(yw∣x)πref(yw∣x)−βlog⁡πθ(yl∣x)πref(yl∣x))]\mathcal{L}_{\text{DPO}}(\pi_\theta; \pi_{\text{ref}}) = - \mathbb{E}_{(x, y_w, y_l) \sim \mathcal{D}} \left[ \log \sigma \left( \beta \log \frac{\pi_\theta(y_w|x)}{\pi_{\text{ref}}(y_w|x)} - \beta \log \frac{\pi_\theta(y_l|x)}{\pi_{\text{ref}}(y_l|x)} \right) \right]

其中 ywy_w 为偏好回复,yly_l 为非偏好回复,πref\pi_{\text{ref}} 为参考模型,β\beta 控制偏离程度。

通过这种均衡的偏好数据构造,模型被迫学习区分何时信任上下文、何时保持怀疑,而不是简单地采取 “全信” 或 “全不信” 的捷径。

创新点和贡献

  1. 首次系统定义并基准化 “选择性信任”:不同于以往只关注鲁棒性或只关注上下文利用的工作,MIST 通过四种匹配条件把信任决策的多面性同时固定下来,并提出了统一的 SC2W 指标,推动领域从 “抵抗” 走向 “抉择”。
  2. 揭示误导敏感性的普遍性:论文在多个开源模型上开展全面基准研究,发现所有测试模型都存在显著的 SC2W 值,表明误解敏感是一个普遍问题,而非个别模型的缺陷。
  3. SCOPE 提供了一种简单有效的训练范式:在标准的 DPO 框架上只需改变偏好数据的分布,无需改动模型结构或训练流程。均衡采样策略使得模型在各种上下文条件下实现帕累托改进,效果优于仅在误导样本上对齐的方案。
  4. 明确主张模型评价应基于选择性信任:论文认为,单纯追求抵抗能力是不够的,评估体系必须同时涵盖正确利用上下文的能力,这为今后的研究和产品指标设计提供了方向性参考。

实验结果分析

论文的实验部分覆盖了多个主流开源模型(论文未公开具体型号),并在 MIST 的四种条件下测试了零样本性能以及经过 SCOPE 或其他基线的微调后性能。主要发现包括:

  • 所有基线模型在误导条件下都将大量原本正确的答案翻转为错误,SC2W 值均处于较高水平(具体数值见论文实验图表),验证了选择性信任问题的严重性。
  • 仅用误导样本做 DPO 虽然能降低 SC2W,但同时损害了干净条件和正确上下文下的准确率,出现了 “过度抵抗” 的现象,这通过 SC2W 与正确上下文利用率的对比得到证实。
  • SCOPE 在显著压低 SC2W 的同时,在干净、正确上下文和不相关上下文三种条件下准确率几乎不受影响或略有提升,实现了四类条件的整体平衡。该结果在消融实验中得到进一步验证:当减少均衡采样中的某些条件样本时,对应条件的表现会明显下滑。
  • 论文还通过案例分析了 SCOPE 模型的行为变化:模型学会了评估上下文的可信度,而不是简单地复制上下文内容或忽略所有额外信息。

这些结果表明,通过显式的多条件偏好均衡,模型能够内化一种更精细的信任决策能力,而 SC2W 也证明了其作为选择性信任综合性指标的有效性。

实践建议

对于希望在实际系统中落地选择性信任能力的工程团队,可从以下几个方面着手:

  1. 构建与应用场景匹配的多条件测试集:可参考 MIST 的四类条件,为自己的业务数据(如客服问答、金融分析报告生成)构造干净、误导、正确上下文和不相关上下文的测试用例。重点关注在误导条件下原本正确回答的翻转率,这比单纯看鲁棒性指标更能反映真实风险。

  2. 在偏好对齐阶段引入均衡采样:当前许多团队使用 DPO 或 RLHF 提升模型安全性,往往倾向于大量加入对抗性负样本。SCOPE 的做法表明,必须同时保留干净状态和正确上下文的偏好对,并保证四类样本比例平衡,才能避免模型滑向 “盲目不信” 的极端。实践中可将训练数据按上下文条件分为四个桶,每个训练步从各桶中抽取相等数量的样本组成一个批次。

  3. 监控多维度指标而非单一得分:部署时不应只跟踪准确率或拒绝率,应同时计算 SC2W(或类似的自定义指标)以及在已知可信上下文下的采纳率,设置联合阈值。例如,可设定 SC2W 低于某值且正确上下文准确率不低于某值才允许上线。

  4. 构造自动化的弱监督数据挖掘管线:SCOPE 的偏好对来自模型在四种条件下的输出对比。工程上可以周期性地利用用户反馈或规则检测出 “原正确因新上下文而错误” 的样本,再反向生成对应的正确上下文版本,从而不断扩充和刷新训练集,使模型保持对最新误导模式的适应力。

  5. 联合检索增强架构进行在线决策:如果系统使用了 RAG,可以将检索到的多个候选上下文分别输入模型并比较输出的一致性,利用 SCOPE 训练出的模型内在信任偏向来对结果排序,从而在推理时动态决定是否采纳某一上下文。这可以视作一种内化的选择性信任路由。