少复制,重依据:基于证据感知的强化学习克服长上下文推理中的重复复制

Copy Less, Ground More: Overcoming Repetitive Copying in Long-Context Reasoning via Evidence-Aware Reinforcement Learning

arXiv: 2607.19345v1

论文信息

标题: Copy Less, Ground More: Overcoming Repetitive Copying in Long-Context Reasoning via Evidence-Aware Reinforcement Learning

作者: Lizhe Fang, Weizhou Shen, Tianyi Tang, et al.

发布日期: 2026-07-21

arXiv ID: 2607.19345v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:这篇论文要解决大语言模型在长上下文推理时的一种 “重复复制” 现象——模型在思考过程中大量逐字抄写输入文本,而非真正推理,导致正确率下降和输出令牌膨胀。
  • 核心方法:作者提出 GEAR(Grounding Evidence-Aware Reward)奖励函数,在标准答案正确奖励之上,加入对关键证据的 nn-gram 重合奖励和对无关干扰文本的重合惩罚,并通过自动化管道为自然语言文档构造证据标注数据,在强化学习中训练模型。
  • 关键结果:在多个长上下文基准上,GEAR 相比仅用正确性奖励的 RL 平均最高提升 +4.6 个百分点(128k 上下文),同时显著降低重复复制率和思维长度(表 1 和表 2)。
  • 主要局限:GEAR 需要训练数据中带有文本支持区间(关键证据)的标注,虽然论文提出了自动构建管道,但在完全无监督的开放域场景中标注质量仍依赖生成模型;此外,该方法仅在特定基座模型(Qwen3.5 系列)和若干长上下文基准上验证,泛化到其他模型家族的效果未测试。
  • 适合读者:对长上下文推理模型、强化学习微调、以及大模型输出可控性感兴趣的研究者和工程师;尤其适合希望减少模型 “废话连篇” 和抽取关键信息能力的实践者。

论文背景和研究动机

近年来,具备显式思维链的 LLM 在复杂推理任务上表现优异,如 Qwen3、Claude 和 DeepSeek-R1 系列。随着评估重心从简单检索转向长文本上的复杂推理,这类模型自然成为长上下文任务的重要基座。然而,论文发现了一个普遍且严重的 “重复复制” 失效模式:模型在解决长输入中的问题时,会大段地原样复制提示中的文本到思维链中,而不是进行有效推理。

这一行为在七个前沿长上下文模型中均被观察到,并且随着上下文长度增加而加剧(图 1)。在 64k 上下文下,部分模型的三元重叠率可超过 70%,十元重叠率也超过 50%,说明复制跨度很长,是刻意转录而非偶然词法重合。更重要的是,高复制率与低准确率和高思维长度强相关:当复制率超过 0.4 时,准确率急剧下降甚至归零,思维长度却膨胀至数万令牌(图 2)。作者将该问题归因于 证据锚定不足(insufficient grounding):模型不加区分地复制输入内容,而无法聚焦于任务相关的关键证据。这一诊断构成了论文的核心动机。

核心方法和技术细节

问题量化与诊断

作者首先定义了量化复制程度的指标 Overlap_n(y||x):以 n=3n=3 衡量总体复制量,以 n=10n=10 捕捉长段转录。在 GSM-Infinite 数据集上,揭示了复制率随上下文长度递增,且正确回答的样本复制率显著低于错误样本。

进一步,利用 GSM-Infinite 已知的关键证据区间,将提示拆分为 关键证据(xkeyx^{key}) 和 干扰上下文(xdistx^{dist}),定义锚定比 r=Overlap10(y∥xkey)Overlap10(y∥xdist)r = \frac{\text{Overlap}_{10}(y\|x^{key})}{\text{Overlap}_{10}(y\|x^{dist})}。正确样本的锚定比显著更高,表现为关键证据重合更多、干扰文本重合更少(图 3)。这直接指明,问题不在于复制本身,而在于复制的选择性——模型若懂得聚焦关键信息,复制反而有益。

GEAR 奖励设计

基于上述发现,论文设计了 GEAR 奖励:

R(x,y)=Racc+α⋅Overlapn(y∥xkey)−β⋅Overlapn(y∥xdist)R(x,y) = R_{acc} + \alpha \cdot \text{Overlap}_n(y\|x^{key}) - \beta \cdot \text{Overlap}_n(y\|x^{dist})

其中 RaccR_{acc} 为二元答案正确奖励,第二项为 锚定奖励,鼓励模型在思维过程中提及关键证据;第三项为 干扰惩罚,抑制无关内容的复制。同一 nn-gram 若同时出现在关键证据和干扰文本中,则不计入干扰惩罚,避免误伤。训练中使用 n=3n=3 提供更稠密的奖励信号,系数设定 α=0.1,β=0.3\alpha=0.1, \beta=0.3,即对干扰惩罚的权重更大。

证据标注数据构造

对于 GSM-Infinite 和 PhantomWiki 等合成基准,关键证据区间可由程序直接获得。为扩展到自然语言文档,作者提出三阶段自动化管道:① 文档分析与过滤,确定适宜生成的问题类型;② 随机抽取 1-3 个文档块作为约束上下文,据此生成问答对并附带证据引用;③ 答案验证,仅保留可从约束上下文中唯一推导出的问题。最终训练集包含 3200 个样本,混合合成与真实文档数据。

训练设定

采用 Group Sequence Policy Optimization (GSPO) 算法,训练 Qwen3.5-9B、27B 和 35B-A3B 三个模型,上下文中长均匀分布在 16k-32k 之间,最大生成长度 16k 令牌,训练 1 个 epoch。

创新点和贡献

论文的创新之处可概括为三点。第一,首次系统识别并量化 了长上下文推理中的重复复制问题,将其与最终性能建立强关联,并定位到证据锚定不足这一深层原因。第二,提出了一种轻量且可解释的奖励塑造方法 GEAR,仅利用 nn-gram 统计量,无需额外检索模块或外部验证器,便有效引导模型区分关键信息和噪声。第三,开发了自动化证据标注管道,使得 GEAR 能够脱离人工标注,在任意长文档上扩展应用,打通了从诊断到落地训练的闭环。

实验结果分析

在五个与训练集无重叠的长上下文基准(Ruler、LongBench-v2、BrowseComp-LC、GraphWalks、AA-LCR)上,GEAR 在所有三个模型尺度和两种上下文长度(32k、128k)下均取得最佳平均分(表 1)。值得注意的是,GEAR 仅在 16k-32k 上下文上训练,但在 128k 上下文上增益更大(如 9B 模型提升 +4.6 平均分),说明学习到的证据锚定能力可泛化至更长的未见上下文。

消融实验揭示了奖励组分的关键性。仅加锚定奖励而不加干扰惩罚(+RgroundR_{ground}),性能反而大幅低于基线(可下降 8.3 个点),且思维长度与复制率急剧上升(表 2)。这是因为奖励一切对关键证据的提及,等于变相鼓励模型无差别复制更多文本以增加覆盖率。只有同时施加干扰惩罚,模型才学会舍弃无关内容,实现既精准又简洁的推理。

在行为层面,GEAR 将答案与输入的 3-gram 重叠率从基线或 GSPO 的水平显著拉低(如 Ruler 上从 35.7% 降至 27.0%),思考字数也大幅减少(表 2)。案例研究表明,GEAR 模型不再陷入无休止的重复循环或冗长无结论的推敲,而是以流程化的简洁推理直达正确答案。

系数和 nn-gram 大小的消融(表 3、表 4)显示,较小的 nn(3)和 β>α\beta > \alpha 的配置最优,进一步支持了 “强干扰抑制、适度关键锚定” 的原则。

实践建议

GEAR 为希望提升长上下文推理模型效率和准确率的团队提供了直接可用的方案,在实践中可参考以下几点:

  1. 从正确性奖励转向选择性锚定奖励:对于需要从长文档中抽取事实或进行多跳推理的任务,直接在 RL 训练中对模型生成文本与关键证据的重合度给予正向反馈,同时对无关文本重合进行惩罚,是一种简单有效的奖励改造手段。系数上,建议 以干扰惩罚为主(如 β=0.3\beta=0.3),锚定奖励设为较低权重(α=0.1\alpha=0.1),避免模型为了获得锚定奖励而无差别复制。

  2. 自动化构建证据标注数据:对于没有现成支持区间标注的业务数据,可借鉴论文的三段式管道:先分析文档信息特征,再基于随机选取的片段生成问答对,并验证答案的唯一性。注意答案应设计为短实体或数值,以支持自动化奖励计算。该管道可采用现有的强模型(如 GPT-4)完成生成与验证,成本可控。

  3. 在长上下文泛化上保持信心:实验表明 GEAR 在 16k-32k 上下文上训练后,对 128k 上下文的任务有更强增益,说明证据锚定行为一旦习得,可以泛化到训练时未见的长上下文。因此,无需在极大上下文上做全量训练,可节省大量计算资源。

  4. 整合到现有 RL 训练流程:GEAR 与 GSPO、GRPO 等算法无缝兼容,可作为一个奖励插件。团队可以先在少量混合数据上训练一个 epoch(如数百个 optimizer step),观察模型是否减少复制并提升关键基准分数,再决定是否大规模扩展。

  5. 注意区分 “危害性复制” 与 “有益引用”:并非所有复制都应被惩罚。在实施时,务必屏蔽同时出现在关键证据和背景中的 nn-gram,避免误伤对核心信息的复现。实践中,这一过滤操作可基于 TF-IDF 或简单的字符串查重实现。

GEAR 提醒我们,即便在强化学习中奖励信号极度简洁,只要其设计紧扣认知诊断(模型因 “眼高手低” 而失败),就能获得符合直觉且跨任务鲁棒的性能提升。对于正在将推理模型落地到金融研报分析、学术文献问答、长对话理解等场景的团队,GEAR 提供了从问题定义到数据构建再到训练策略的整套范式。