面向长程智能体框架的递归经验-工作记忆演化
Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses
论文信息
标题: Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses
作者: Zhaochen Yu, Yingcheng Wu, Zhenfei Yin, et al.
发布日期: 2026-08-25
arXiv ID: 2608.24876v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:这篇论文要解决长程任务中递归自我改进(RSI)的难点——交互历史膨胀会让代理丢失未完成目标,并错误调用与当前任务状态不匹配的技能。
- 核心方法:提出 Recuris 架构,用工作记忆(WM)维护经环境验证的任务状态,并据此从体验记忆(EM)中选择技能;跨任务由固定 Meta-Agent 对结构化轨迹做组件级失败定位、补丁和验证门控更新。
- 关键结果:在 τ²-Retail 上,Recuris 将 Claude Opus 5 从 72.4% 提升到 87.9%,+15.6;将 GPT-5.6 Sol 从 58.3% 提升到 76.1%,+17.8;35/37 个完成的模型–基准组合得到改善(摘要、表 1)。
- 主要局限:作者承认在 Terminal-Bench 2.1 上,测试时适应相比同预算重试仅 +2.3,置信区间含零;τ²-Airline 的消融结果也多为方向性而非统计显著(表 2、表 8)。
- 适合读者:研究 LLM 代理记忆架构、长程任务执行、自改进系统或工程化 agent harness 的人。
论文背景和研究动机
长程任务中的代理通常会累积大量交互历史。随着上下文增长,代理容易遗忘未完成的目标,或在错误的执行阶段调用技能。论文指出,这暴露了 RSI 的核心障碍:代理可以积累经验,但负责组织、选择和改进经验的记忆机制本身基本固定(论文第 1 节)。
现有体验记忆方法常从初始指令或完整交互历史中检索技能。初始指令可能无法反映当前问题;完整历史混入已完成步骤、过时信息和执行噪声,导致检索越来越不可靠。论文认为,关键不是缺少有用经验,而是缺少一个紧凑、可靠的任务状态,用于持续对齐经验与当前执行需求(论文第 1 节)。
图 2 总结了 Recuris 与既有记忆型 harness 的两个区别:记忆使用方式从 “对增长历史检索” 转向 “在执行事件处检索,并由检查器验证状态更新”;记忆演化方式从 “根据一次任务结果重写整个记忆” 转向 “从结构化轨迹定位失败组件,只修补相关组件,并经验证门准入”。
核心方法和技术细节
Recuris 的 Skill Memory 由四个组件组成:
其中 是体验记忆,存储可复用技能; 是工作记忆规范,定义状态模式和更新提案; 是调用策略,决定何时检索技能; 是检查器集,判断观察是否支持状态变更(论文第 2.1.1 节)。
任务内执行循环为:工作状态 引导技能调用 ,选中技能 进入上下文;代理生成动作并接收环境观察 ;更新器 提出下一状态,检查器 验证后,固定内核只提交被支持的状态变更。论文将该闭环写作:
关键点是:目标只有得到工具或环境证据支持才从未决变为完成;仅调用技能或代理口头声称成功不算完成证据(论文第 2.2.3 节)。
跨任务演化依赖结构化轨迹 ,它记录每一步的工作状态、调用技能、动作、观察、提议状态、检查器决策和实际状态。固定 Meta-Agent 从失败轨迹中诊断故障,并将每个故障归属到 、、 或 之一。随后只对相关组件生成补丁,其他组件原样复制。候选补丁必须通过固定验证门:修复源任务且不在开发集锚任务上回归,才被准入;否则保持原记忆(论文第 2.3 节)。
递归发生在外部记忆控制层:基座 LLM、工具、Meta-Agent、定位/修补流程和验证门都保持固定。论文称之为 “有界的递归记忆演化循环”(论文第 2.3.4 节)。测试时适应模式则将证据池和补丁范围缩小到单个任务,在同任务失败后重试更新。
创新点和贡献
论文的第一个贡献是把 “状态接地记忆使用” 确立为长程任务 RSI 的必要条件。与从历史检索或让模型自行选择技能不同,Recuris 用经验证的工作状态决定何时以及调用哪些技能。消融实验显示,仅添加体验记忆在 τ²-Retail 上只带来 +2.0(CI 含零),而添加验证工作记忆带来 +23.9;两者耦合达到 +25.4(表 2)。
第二个贡献是 EM–WM 耦合把执行过程变成结构化诊断证据。注入故障实验表明,从结构化轨迹判断故障组件的宏准确率为 64.8%,而仅从任务结果判断只有 13.0%(表 4)。这使修复可以定位到具体组件,而不是粗粒度重写。
第三个贡献是证明外部记忆控制层可以作为冻结模型的 “可训练表面”。同一记忆包在未参与训练的模型上迁移有效:在 τ²-Retail 上,Claude Opus 5 +15.6,GPT-5.6 Sol +17.8(表 7)。作者推测,迁移效果取决于目标模型自身失败空间与记忆包所含修复类型的匹配,而非模型规模(论文第 3.4.6 节)。
实验结果分析
主结果覆盖四个长程基准、十个模型。论文报告 Recuris 在 35/37 个完成的模型–基准组合中改善任务成功率(摘要)。τ²-Retail 和 SkillFlow 收益最明显:部署模型在 τ²-Retail 从 58.1% 提升到 81.4%,+23.3;SkillFlow 从 34.6% 提升到 51.4%,+16.8(表 1)。Claude Opus 5 在 τ²-Retail 达到 87.9%,论文称该基准上无 Recuris 的最佳模型分数低 9.7 个点(摘要)。
按交互长度分层后,Recuris 的优势随任务长度没有单调下降:在 τ²-Retail 四个长度四分位上,领先幅度从 +17.0 到 +44.7(图 4)。读动作召回在各变体、各四分位保持在 88.0%–97.9%,说明失败主要发生在写路径而非信息检索阶段(论文第 3.3.1 节)。
消融显示机制关键点因领域而异:τ²-Airline 中写操作预审最关键,移除代价 13.5;τ²-Retail 中状态呈现最关键,移除代价 17.3;两个关键机制互不重叠(图 6)。演化实验方面,两条使用不同 Meta-Agent 实现(Claude Code 与 DeepSeek Harness)的路线都收敛到约 +10 的 held-out 增益,直接配对差为 -1.45,CI 含零(表 6)。验证门在开发集上很保守:18 个被拒绝候选的开发集区间全部含零,但其中部分在 held-out 集后来表现良好(图 9b)。
测试时适应在 Terminal-Bench 2.1 上的分解很重要:同预算重试使解决任务数从 30/87 提升到 51/87;在此基础上适应再 +2.3,p=0.774,未达统计显著(表 8)。按单次尝试成功率,学习技能的任务集上 avg@4 从 17.4% 提升到 21.9%,+4.5,CI 含零(表 9)。作者将其表述为方向而非确定效应。
实践建议
针对需要长程自主执行的 AI agent 系统,这篇论文给出几项可落地的设计原则。
第一,不要从完整历史中检索经验,改为维护一个经验证的工作状态。在实际 agent 中,可以让外部 harness 保存 “目标—状态—证据” 结构,只允许环境或工具返回结果驱动状态更新。这能显著降低长上下文中 “已完成步骤仍在干扰技能选择” 的风险。
第二,将技能调用绑定到执行事件,而不是每轮注入全部技能。论文的模型控制对照显示,把整个技能库放在上下文里让模型自行决定,效果低于完全不加技能的验证工作记忆配置,且 token 成本更高(表 3)。实际系统可以在 “草拟状态变更调用” 或 “回合边界” 等事件触发检索。
第三,记忆更新要走组件级诊断和验证门。如果只凭最终成功/失败改写整个记忆,很多修复会打到错误组件。建议在执行轨迹中记录工作状态、技能选择、动作和检查器决策,并让固定诊断器先把失败归属到某个组件,再只修改该组件。上线前用已解决锚任务做回归检查,防止新补丁破坏旧能力。
第四,跨模型复用记忆包时,先评估目标模型的失败分布。论文数据显示同一记忆包在相近起点模型上可能带来 +15.6 或 +4.8 的差异(表 7),因此不应假设包的价值只看内容;应测试它是否覆盖目标模型实际出现的失败类型。
第五,在任务共享结构弱或统计分辨率有限时,先把重试预算与适应收益分开评估。Terminal-Bench 2.1 的结果表明,单纯增加尝试次数可能掩盖记忆学习的真实贡献。工程团队应设置与适应配置共享首轮 rollout 的预算匹配对照,否则容易把重试收益误判为学习收益。