ReContext:递归证据重放作为大语言模型进行长上下文推理的驾驭手段

arXiv: 2607.02509v1

论文信息

标题: ReContext: Recursive Evidence Replay as LLM Harness for Long-Context Reasoning

作者: Yanjun Zhao, Ruizhong Qiu, Tianxin Wei, et al.

发布日期: 2026-07-02

arXiv ID: 2607.02509v1

PDF 链接: 下载 PDF

研究动机:长上下文推理的 “看得见却用不上” 困境

大语言模型(LLM)的上下文窗口已经扩展到 128K 甚至更多 token,理论上可以一次性吞下整本书、多文档集合或长篇对话。然而,更长的窗口并不等于更好的推理能力。大量研究发现,模型常常对上下文中已经存在的证据 “视而不见”——即输入里明明有正确答案所需的信息,但模型在生成阶段却没能有效利用它们。这暴露出一个核心矛盾:长上下文系统拥有充分的 “信息访问” 能力,却缺乏高效的 “信息驾驭” 能力

造成这一现象的原因在于,标准的长上下文提示方式要求模型在单次推理中同时完成阅读理解与答案生成。当上下文膨胀时,关键证据被迫与海量无关内容 “同台竞争” 注意力资源,模型很容易在嘈杂的背景中迷失方向,导致回答不够扎实,甚至产生幻觉。现有的改进方法大致可分为三类:对流层注意力进行干预(侵入性强,需要修改模型正向传播逻辑)、引入外部检索或记忆模块(可能丢失细粒度线索)、以及对上下文进行压缩(可能丢弃关键片段)。这些方法都没有做到在保留完整原始上下文的前提下,动态地将分散的证据组织成一个供生成阶段直接使用的 “工作台”。

ReContext:递归证据回放框架

针对上述问题,论文提出了 ReContext(Recursive Evidence Replay as LLM Harness),一种无需训练、无需外部存储、也不裁剪上下文的推理方法。它的核心思想非常直觉化:先读全文,用模型内部的注意力信号作为 “探针”,找出与问题最相关的证据片段,然后将这些片段整理成一个结构化的证据池,在最终生成答案前重放给模型。整个过程就像为模型临时搭建一个高亮的 “记事本”,让它在回答问题时能够直接引用这些已梳理好的支撑材料,同时依然可以随时翻阅原始全文。

证据选择与物化

ReContext 的第一步是利用 LLM 自身的注意力分布来筛选证据候选位置。对于给定的长上下文 CC 和问题 qq,它从提示尾部取最后 ww 个 token(如 8 个)作为 “线索 token”,并读取它们对上下文中每个 token 的注意力权重,经过多头平均和指数衰减累积后,得到每个上下文 token 的问题相关度分数 rir_i。关键之处在于,这些分数并不是被直接用来干预解码时的注意力,而是作为一种廉价的候选生成信号:只要一个 token 的分数足够高,就说明它周围可能存在关键信息。

由于单个 token 通常过于碎片化(一个日期、一个名词),ReContext 进一步把被选中的 token 映射回它们所在的完整句子或局部片段,形成可读的证据文本单元。这些从原始上下文中直接复制的文本片段组合在一起,构成了一个有序的证据池 EE。文本格式的重放意味着:模型看到的不仅是 “重点位置” 的隐式标记,而是实实在在的语句。这种显式呈现方式有效避免了纯注意力干预中证据仍 “潜伏” 在内部状态、难以被充分利用的问题。

递归迭代:逐步精炼证据池

单一轮的证据选择可能还会遗漏部分跨句关联或需要结合之前已选证据才能定位的信息。因此,ReContext 采用了递归选择机制。设初始证据池为空,每一轮 jj 都会将当前证据池重放到上下文之后、问题之前,形成新的提示 x(j1)=[C;ϕ(E(j1));q]x^{(j-1)}=[C; \phi(E^{(j-1)}); q]。模型再次读取这个提示,此时重放的证据会改变模型的隐状态,进而影响下一轮注意力分数的计算。其结果就是,后续轮次可以 “注意到” 与前一轮已选片段相关的证据,实现多跳证据链的逐步补全。每轮只从原始上下文中选择尚未被收录的新片段,追加到证据池末尾。通常只需进行很少的轮数(如 2 到 4 轮),就可以得到一个信息密度较高的证据支架。

最终,答案在包含完整上下文和最终证据池的提示下生成:yM([C;ϕ(E(R));q])y \sim M(\cdot | [C; \phi(E^{(R)}); q])。整个过程中,原始上下文从来未被删除或截断,因此即使证据池遗漏了某些信息,模型仍有机会从全文中自行补足。这种 “强调而不排除” 的策略,使得 ReContext 更像是为生成阶段设置了一个清晰的参考提纲,而不是替代原始输入。

理论视角:从联想记忆看证据回放

论文还从一个优雅的理论角度解释了 ReContext 的有效性:联想记忆。可以将长上下文视为存储着一系列记忆痕迹的仓库,问题则作为检索线索,注意力机制充当了线索与痕迹之间的关联强度指标。证据选择相当于依据线索筛选出最相关的痕迹,而证据回放则是在接近生成的时间节点上 “重新激活” 这些痕迹。

基于这一设定,论文给出了一个单调改进定理:在满足正交嵌入和问题与答案强相关的理想条件下,每一轮证据回放都会使隐状态 h(j)h^{(j)} 与答案嵌入 yy 之间的余弦相似度严格递增,即 cos(h(j),y)>cos(h(j1),y)\cos(h^{(j)}, y) > \cos(h^{(j-1)}, y)。证明通过归纳展示了随着正确证据的多次拷贝和注意力权重比值的持续扩大,模型表征会持续向正确答案靠拢。这为递归证据回放的行为提供了坚实的理论支撑,也解释了为何在噪声环境下反复凸显关键信息能够提升长文本推理的可靠性。

实验表现:一致且稳健的提升

实验在 8 个具有代表性的长上下文数据集上进行,包括 NQ、TriviaQA、HotpotQA、PopQA、NarrativeQA、InfBench QA、InfBench MC 和 CLIPPER,上下文长度均为 128K。评估覆盖了 Qwen3-4B、Qwen3-8B 和 Llama3-8B 三种主干模型。ReContext 与原始全上下文生成(Vanilla)、注意力锐化方法(AttnSharp)、动态注意力缩放解码(DySCO)、外部记忆体方法(A-MEM)以及动态压缩方法(DAC)进行了全面对比。

主要结果非常突出:ReContext 在三个主干模型上均获得了最佳平均排名(1.00、1.46、1.29,排名越低越好)。将八个数据集的准确率在三个模型上平均后,ReContext 相较于 Vanilla 从 0.24 提升至 0.30,相对增益达到 24.6%。尤其在 Qwen3-4B 上,ReContext 在所有报告指标上均取得最好成绩;在 Llama3-8B 上,所有任务的准确率都处于领先。定性案例分析也显示,ReContext 使模型回答能够更明确地锚定在被高亮的证据句子上,从而纠正了 Vanilla 下的许多事实错误。

稳健性测试进一步表明,即便启用思考链模式或采用较短的 64K 上下文,ReContext 仍然保持优势。消融实验揭示了递归轮数与候选 token 预算的影响:多轮选择显著优于单轮,但最优深度因任务而异,说明任务可以自行决定合理的搜索深度;较大预算能提升多跳任务的召回率,但过大的噪声也会损害答案纯净度。此外,仅从原始上下文选择证据(而非从整个重放提示中选取)被验证更为有效,说明重放的支架主要起状态调节作用。

效率方面,ReContext 因为增加了阅读和重放步骤,推理速度比 Vanilla 略慢,但显著快于需要修改解码逻辑的 DySCO,且 GPU 内存消耗与 Vanilla 几乎持平(因为附加的证据 token 通常不超过 128 个)。这使得它在实际部署中具备很好的可行性和可扩展性。

实践启示与应用前景

从量化交易、复杂数据分析到智能问答系统,许多现实场景都需要模型基于大规模文档进行推理。ReContext 提供了一条低成本、可插拔的增强思路:

  • 金融报告分析:面对数百页的年报或研究论文,可先利用问题(如 “对比两家公司的利润率趋势”)引导模型自动提取并重放相关段落,再生成回答,大幅提高查找和综合信息的准确性。
  • 科技文献审稿与写作辅助:在整篇论文中快速定位与某个论点或数据相关的证据,递归回放可帮助构建逻辑链条,避免大语言模型因篇幅过载而遗漏关键支撑。
  • 多轮对话型应用:在超长对话历史中定位早前提过的关键细节,ReContext 的机制可以稍加变种,用递归证据池维护 “当前话题的证据子集”,缓解对话状态管理难题。

需要注意的是,ReContext 依赖模型内部可获取的注意力信号,这限制了它在闭源 API(如 GPT 系列不暴露注意力权重)上的直接使用。不过,随着开源模型的性能不断提升,这一限制的影响正在减弱。对于开发者而言,可以在模型推理管线的非解码阶段插入该模块,仅需少量代码改动即可实现。

总结与展望

ReContext 重新定义了长上下文推理中的 “信息组织” 问题,提出了一种轻量且理论扎实的解决方案。它不是在上下文尺寸上做加法,也不是在信息量上做减法,而是通过递归证据选择与回放,在模型生成答案前为它搭建一个动态的、问题相关的证据工作台。实验结果表明,这种方法能够显著提升多种模型和任务的表现,并且具有良好的鲁棒性。

未来工作有几个值得深入的方向:一是将证据选择机制与模型自身的推理过程更紧密结合,例如让模型自我修正或冗余裁剪证据池;二是探索在真实的多模态长文档(如带图片、表格的报告)中的应用;三是研究如何在保持全上下文访问的同时,进一步降低递归步骤带来的时间开销。ReContext 所揭示的 “分离证据整理与答案生成” 范式,将为长上下文智能处理铺就一条更宽广的道路。