少复制,多夯实:通过证据感知的强化学习克服长上下文推理中的重复复制

arXiv: 2607.19345v1

论文信息

标题: Copy Less, Ground More: Overcoming Repetitive Copying in Long-Context Reasoning via Evidence-Aware Reinforcement Learning

作者: Lizhe Fang, Weizhou Shen, Tianyi Tang, et al.

发布日期: 2026-07-21

arXiv ID: 2607.19345v1

PDF 链接: 下载 PDF

研究背景与问题动机

近年来,具备逐步推理能力的语言模型(如 Qwen、DeepSeek、Claude 等)在复杂推理任务上取得了显著突破。这类模型在给出最终答案之前会生成显式的 “思考轨迹”,从而将推理过程透明化并大幅提升准确性。随着长上下文评估从简单的检索任务转向需要深度理解与推理的复杂场景,将这类思考模型应用于长上下文推理已成为重要的前沿方向。

然而,论文作者发现了一个此前未受重视的关键失败模式:重复复制(repetitive copying)。当推理模型处理长输入时,它们会频繁地将输入文本的大段内容原封不动地复制到思考轨迹中,而不是真正地分析问题。这种行为在多个前沿长上下文模型中普遍存在,且随着上下文长度增加而加剧。例如,在 64k 令牌的算数推理任务上,Qwen3.5-9B 有超过 50% 的十元语法窗口都来自对输入的逐字拷贝。更严重的是,这种复制不仅损害准确率,还急剧膨胀推理长度,模型将宝贵的令牌预算浪费在转录输入而非解决问题上。

深入诊断:重复复制的本质是 “证据接地不足”

为了理解重复复制的根本原因,作者设计了一套细粒度的分析方法。他们利用 GSM-Infinite 这一可程序生成的长上下文基准,精确地将每个输入划分为 “关键证据”(解决问题必需的支撑文本)和 “干扰上下文”(其他无关内容),并计算模型在推理过程中对这两部分的复制强度。

分析揭示出一个清晰的图景:正确作答的样本展现出明显更高的接地比率(关键证据复制量 / 干扰上下文复制量),意味着成功的推理倾向于有选择地复制与任务相关的信息,同时减少对无关内容的复制。而错误样本则表现为无差别的复制,即模型难以区分哪些内容重要、哪些纯属噪声。因此,问题的核心不在于 “是否复制”,而在于复制时是否接地于关键证据。这一洞察为后续的方法设计提供了清晰的方向。

核心方法:GEAR——基于证据感知的奖励塑造

针对上述诊断,作者提出了 GEAR(Grounding Evidence-Aware Reward),一种轻量级的奖励塑形方法,直接在强化学习训练中以 nn-gram 统计量来引导模型有选择地聚焦于证据。

奖励函数设计

给定一个输入 xx,将其划分为关键证据 xkeyx^{\mathrm{key}} 和干扰上下文 xdistx^{\mathrm{dist}},模型生成的思考轨迹记为 yy。GEAR 的奖励函数定义为:

R(x,y)=Racc+αOverlapn(yxkey)βOverlapn(yxdist)R(x,y) = R_{\mathrm{acc}} + \alpha \cdot \mathrm{Overlap}_n(y\|x^{\mathrm{key}}) - \beta \cdot \mathrm{Overlap}_n(y\|x^{\mathrm{dist}})

其中 RaccR_{\mathrm{acc}} 是二元的准确率奖励(正确为 1,否则为 0),Overlapn()\mathrm{Overlap}_n(\cdot) 表示思考轨迹 yy 与指定文本之间基于 nn-gram 的重叠率(匹配的 n_n-gram 位置占总位置的比例)。α\alphaβ\beta 为正系数,分别控制接地奖励干扰惩罚的强度。为防止误伤,同时出现在关键证据和干扰上下文中的 n_n-gram 会被排除在干扰惩罚项之外。

这一设计的精妙之处在于两条信号协同作用:只给接地奖励可能会诱使模型全盘复制所有内容(这样也能获得较高的关键证据重叠),而只给干扰惩罚则可能让模型完全不敢引用任何输入,从而丧失从上下文中获取信息的收益。两者结合,模型才能在强化学习过程中学会 “选择性参与”——多引用有用信息,少复制无关内容。

自动化证据标注数据构建

GEAR 需要关键证据的标注信息,这在合成基准中容易获得,但在自然语言数据上则需额外构建。为此,作者提出了一套三阶段自动化流水线:

  1. 文档分析与过滤:使用语言模型分析长文档的信息特征(如是否包含事实陈述、数值、因果关系等),过滤掉不适合生成问答的结构化或低质量文本。
  2. 证据受限的问答生成:将文档切成片段后,随机抽取 1~3 个片段作为 “受限上下文”(即证据区域),其余部分作为干扰。然后要求语言模型仅基于这些受限上下文生成问题和答案,并附带精确的引文,从而在生成过程中天然获得证据标注。
  3. 答案验证:独立地再次仅用受限上下文回答该问题,保留答案一致的数据,确保问题无歧义地可由指定证据解答。

该流水线使得 GEAR 能够从任意大型文档语料(例如 RedPajama-v2)中构建证据标注化的长上下文训练数据,而无需昂贵的人工注释。

强化学习训练细节

作者在 Qwen3.5 系列的三个不同规模模型(9B、27B、35B-A3B)上使用 GSPO 算法进行训练,训练集包含 3200 个样本(合成任务 2000 例,自然语言 1200 例),上下文长度分布在 16k~32k 令牌。关键超参设置为 n=3_n=3 以获得密集的重叠信号,α=0.1\alpha=0.1β=0.3\beta=0.3(惩罚权重显著高于奖励权重),从而强有力抑制干扰复制。

实验结果与关键发现

论文在五个严格独立的基准上进行了系统评测(Ruler、LongBench-v2、BrowseComp-LC、GraphWalks、AA-LCR),涵盖检索、多文档理解、图推理等多种任务,上下文长度最高达 128k。

主要性能提升

相比仅使用准确率奖励的标准 RL,GEAR 在所有模型和上下文长度下均取得了一致的提升:在 32k 上下文时平均提高 +1.5~+2.8 分,在 128k 时提升幅度更大,达到 +2.1~+4.6 分。值得注意的是,GEAR 的训练上下文均不超过 32k,但在 4 倍长度的测试环境中提升反而更显著,证明模型学到的 “证据接地” 能力具有良好的长度泛化性。

奖励组件缺一不可

消融实验揭示了一个反直觉的结果:仅添加接地奖励而不加干扰惩罚,性能反而大幅下降(甚至低于纯准确率训练的基线)。原因是接地奖励在缺乏压制的情况下会鼓励模型无选择地复制所有内容,导致推理轨迹冗长且充满噪声。只有当干扰惩罚同时存在时,模型才能真正学会区分证据与干扰,从而整体提升表现。

对复制行为和推理长度的影响

通过量化分析发现,GEAR 成功地将 Ruler 上的复制率从基线 35.7% 降至 27.0%,将 LongBench-v2 上的复制率从 27.2% 降至 22.6%,同时推理长度也分别缩短了 26% 和 15%。这直观地验证了 GEAR 直接抑制了无差别复制,并由此压缩了无谓的思维长度。

创新点与实践价值

本文的创新之处可归纳为三点:

  1. 识别并系统诊断了重复复制问题,将其从 “过思考” 的现象中抽离,并明确指出其与证据接地不足的因果联系。
  2. 提出了一种简洁高效的奖励塑形方法 GEAR,仅依靠 n_n_-gram 重叠统计量,无需额外验证器或检索器,就能有效引导模型聚焦关键证据。
  3. 开发了自动化证据标注数据生成流水线,使 GEAR 可以规模化应用于自然语言领域,突破合成基准的限制。

在实际应用中,GEAR 的思路具有广泛的迁移价值。例如:

  • 量化金融文档分析:在长篇幅的财报、研报或新闻中提取关键信息进行推理时,模型常被无关段落分散注意力。引入类似 GEAR 的奖励机制,可以训练模型专注于与特定问题相关的财务数据或风险描述,减少对冗余文字的复述,提高信息抽取与推理的精度。
  • 知识问答与智能助理:处理大型知识库或长文档时,可通过对关键证据接地行为的强化学习,让模型在回答时自主引用文档中真正相关的片段,既提升准确度,又使推理过程可解释、可校验。
  • 多步推理任务:GraphWalks 等需要多跳推理的任务,要求模型在长文本中保持状态并追踪实体,GEAR 的选择性复制引导有助于模型维持正确的推理链,避免被大量干扰内容淹没。

总结与展望

GEAR 表明,即使长上下文评估的重点已从简单检索转向复杂推理,模型准确接地于相关证据的能力仍是不可或缺的基石。通过一个轻量的奖励重塑策略,该方法在多个模型规模和测试情境下稳健地提升了推理质量,同时减轻了无差别复制和思维膨胀的问题。

未来的发展可沿着多条路径推进:一是将接地奖励与更精细的证据表征(如段落级或句子级权重)结合,以提供更精准的指导;二是探索在无需人工分割证据与干扰的条件下,自适应地学习哪些上下文值得关注;三是将 GEAR 的思想扩展至多模态长上下文任务,例如视频理解或长篇报告分析,使模型能够在复杂信息流中动态锁定关键模态和片段。总体而言,GEAR 为长上下文推理模型的优化提供了一个清晰而实用的方向:少一些拷贝,多一些接地。