ReContext:递归证据重演作为长上下文推理的 LLM 驾驭方法
ReContext: Recursive Evidence Replay as LLM Harness for Long-Context Reasoning
论文信息
标题: ReContext: Recursive Evidence Replay as LLM Harness for Long-Context Reasoning
作者: Yanjun Zhao, Ruizhong Qiu, Tianxin Wei, et al.
发布日期: 2026-07-02
arXiv ID: 2607.02509v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:这篇论文要解决长文本上下文中 “证据已存在,模型未利用” 的瓶颈,即大语言模型在一次推理中容易遗漏长上下文里分散的支持性信息,导致回答错误或产生幻觉。
- 核心方法:提出 ReContext,一种无需训练的递归证据回放框架。它利用模型内部的注意力权重作为相关性信号,动态抽取出与问题相关的证据片段(句子),在最终生成前将这些片段整理成证据池并显式回放到提示中,而原上下文保持完整不被剪裁。
- 关键结果:在 128K 上下文、8 个长文本数据集上,ReContext 在 Qwen3‑4B、Qwen3‑8B 和 Llama3‑8B 三个模型上均获得最佳平均排名,对 Vanilla 基准的宏平均准确率从 0.24 提升至 0.30,相对提升 24.6%(见论文表 1)。
- 主要局限:需要访问模型内部的注意力权重,无法直接用于不暴露注意力信息的闭源 API;额外增加了证据选择与重放的推理延迟(见表 5 和图 5)。
- 适合读者:关注长上下文 LLM 推理、提示工程、免微调推理增强,以及希望理解如何利用模型内部信号来组织上下文信息的研究者和工程师。
论文背景和研究动机
现代大语言模型已能支持长达 128K 甚至更长的上下文窗口,但 “能够输入” 并不等于 “能够用好”。已有工作表明,即使相关证据完整地存在于输入中,模型仍可能因信息在提示中的位置靠后、长期依赖衰减等原因而忽略或误用它们(论文第 1 节)。这一问题暴露出上下文利用效率的短板,而非单纯的上下文吞吐能力。
常见的改进方案各有取舍:检索增强生成(RAG)依赖外部检索器,可能丢失细粒度信息;提示压缩方法缩短输入,但会永久性地丢弃文本;注意力干预方法直接修改解码时的注意力分布,虽可提升证据聚焦,但属于侵入式修改,且黑盒性较强。ReContext 的出发点是:不丢弃原上下文、不修改模型前向或解码逻辑,而是利用模型已有的内部注意力信号,为每一轮推理临时构建一个与查询相关的证据支架,在回答问题前将其显式重放,从而在不损失任何原文的前提下增强模型对关键信息的提取与利用。
核心方法和技术细节
ReContext 的整体流程(图 2)分为三步:证据选择、证据具体化与回放、递归更新。
-
证据选择 给定长上下文 和问题 ,将拼接后的提示 馈入模型一次前向。取提示末尾最后 个令牌作为查询线索(论文中 ),聚合它们在预先选定的若干注意力头上的注意力权重(式 1),得到每个上下文令牌 的相关性得分 。得分聚合采用指数衰减,以强调靠后的线索令牌。
-
证据具体化与回放 仅靠 top‑K 个令牌常常过于碎片化,模型需要完整的语句才能可靠利用。ReContext 将选出的高相关性令牌位置映射回它们所在的句子或局部片段,按原文顺序整理为一个有序证据池 (式 3)。在最终生成前,将 显式插入到提示中,形成 ,其中 为文本形式的重放段落。注意,原始上下文 依然完整保留,回放的证据池仅起强调作用,未被选中的内容仍可被模型直接访问(式 4–5)。
-
递归证据选择 上述过程可进行多轮。设初始证据池 ,第 轮时,使用已包含前几轮证据的提示 再次计算注意力权重,从原始上下文(而非重放部分)中选取新的 top‑K 令牌,并将其映射为句子,排重后追加到证据池中,得到 。最终从 中采样生成答案(式 10–11)。这一 “递归” 并非无限循环,而是一个固定轮数的轻量推理外壳,论文主要设定 。
作者还提供了基于联想记忆的理论分析(定理 1 及附录 E)。将长上下文视作记忆仓库,问题视为检索线索,注意力作为线索与记忆痕迹的关联强度,证据重放则是将相关痕迹在生成前重新激活。在设定下证明了,每追加一个最相关证据,隐藏状态与答案嵌入的余弦相似度单调递增,即 ,从理论上支持递归回放的有效性。
创新点和贡献
- 无需训练的证据组织框架:ReContext 不进行任何微调,不修改注意力权重,也不构建外部持久记忆。它仅利用模型已计算的注意力作为 “提案信号”,属于一种推理时提示编排方法,适用于多种开源 LLM。
- 分离证据组织与答案生成:通过将证据选择、排序、重放独立于最终生成,ReContext 相当于为模型提供了一个临时的 “外部工作空间”,使其在回答前能再次聚焦已选出的关键句子,同时完整原文任可作为后备参考。
- 理论与实验双支撑:联想记忆的解释给出了单调改进的保证,而跨三个模型家族、八个数据集的实验表明,该方法能够稳定提升多种长上下文任务的平均效果,其中弱基模型(如 Qwen3‑4B)的提升尤其明显(例如 NQ Acc 从最佳基线 0.02 提升至 0.08)。
- 灵活的超参控制:证据候选预算 和递归轮数 可以根据任务特点调节,论文通过消融实验展示了在不同任务上存在最优值,为实际部署提供参考。
实验结果分析
论文在 HELMET 提供的 7 个 128K 长文本数据集(NQ、TriviaQA、HotpotQA、PopQA、NarrativeQA、InfBench QA、InfBench MC)以及 CLIPPER 长书卷证据验证任务上进行了全面评估。基线包括标准全上下文生成(Vanilla)、注意力锐化(AttnSharp)、动态注意力缩放(DySCO)、外部记忆模块(A‑MEM)和动态上下文压缩(DAC)。
从表 1 可见,ReContext 在三个模型上均取得最佳平均排名(1.00 / 1.46 / 1.29),其中在 Qwen3‑4B 上所有报告指标均位列第一;在更强的 Qwen3‑8B 和 Llama3‑8B 上,虽然个别指标(如 HotpotQA Acc)并非最高,但综合排名仍优于所有基线。将八个任务的 Acc 跨模型平均后,ReContext 较 Vanilla 相对提升 24.6%,这一增益表明该方法对长文本证据利用确有系统性的帮助。
消融实验(表 6、表 7 及图 3)进一步揭示:
- 递归轮数 从 1 增至 2 可大幅提升所有指标,继续增加至 4 轮在 InfBench MC 上仍有增益,但在 PopQA 上最优 ,说明并非轮数越多越好,存在任务依赖性。
- 证据候选预算 较大的值可提升 PopQA 和 InfBench MC,但过大的 会引入噪声并拉低 NQ 的性能,存在召回‑噪声权衡。
- 将候选令牌限制在原始上下文(而非整个提示)时性能更佳(表 4),验证了回放支架的作用是 “调焦” 而非 “分配预算”。
定性案例(图 4)显示,ReContext 选出的证据句往往直接支撑正确答案,而基线方法即便能利用部分相关信息,仍可能因其他细节缺失而产生错误。在效率方面,ReContext 的推理耗时虽略高于 Vanilla,但远低于 DySCO,且 GPU 内存占用与原始解码相近(见附录 B.3 和表 5),总体成本可控。
实践建议
对于希望在开源 LLM 上改进长上下文推理的工程师或研究者,可以尝试以下策略借鉴 ReContext 的思想:
-
先读一遍再聚焦 利用一次完整前向传播获取 prompt 内部的注意力分数,然后基于这些分数筛选出最相关的原文句子,以简单的 “证据清单” 形式插入到提示中,再调用模型生成最终答案。注意,不要删除原上下文,否则可能丢失辅助信息。
-
控制重放规模与轮数 根据任务特性选择 和 :对于答案高度集中的事实型问答,较小的 (如 8 或 16)通常更精确;对于需要多跳推理的任务,适当增大候选池和轮数可能有益。论文的消融结果可作为初始参考,但最好在目标数据集上做少量验证。
-
关注注意力头的选取与归一化 ReContext 使用了预先选定的注意力头,并对接续线索令牌进行指数衰减聚合。在实现类似方案时,建议分析模型不同层的注意力分布,选择对 “查询‑上下文” 关联最敏感的头部,并使用如式 (13) 的衰减机制。
-
适配受限环境 该方法需要模型内层注意力张量的访问权限,因此仅适用于开源模型或支持返回注意力权重的高级 API。如果环境仅提供最终输出而无法获取中间激活,可考虑用轻量级的显式检索器(如 BM25)作为弱替,但效果可能与内部信号有一定差距。
-
与思维链等推理策略兼容 论文在启用思考(thinking)模式后,ReContext 依然有效(表 2),说明该方法可以与模型自带的推理能力协同工作。当模型能进行中间推理时,证据重放可进一步为推理提供明确的原文支撑,减少幻觉。