EEVEE:面向现实世界中自改进智能体的测试时提示词学习
EEVEE: Towards Test-time Prompt Learning in the Real World for Self-Improving Agents
论文信息
标题: EEVEE: Towards Test-time Prompt Learning in the Real World for Self-Improving Agents
作者: Weixian Xu, Shilong Liu, Mengdi Wang
发布日期: 2026-06-09
arXiv ID: 2606.11182v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:真实世界中的 LLM 智能体面对的输入流来自多个异质任务,传统测试时提示学习方法只在单一数据集上优化,跨数据集干扰会导致已学任务性能退化。本文要解决的是多数据流下如何让提示持续有效学习而不相互损害。
- 核心方法:提出 Eevee 框架,引入一个路由器将输入按任务隐式聚类,并把样本分发给不同专用提示,同时通过路由器–提示协同进化策略轮替优化路由规则和提示内容,最终让每个提示专门处理某一类任务。
- 关键结果:在 GPQA Diamond、Formula、TheoremQA、HumanEval 四个基准上,Eevee 使 Qwen3-4B-Instruct 平均分提升 10.38,DeepSeek-V3.2 提升 24.32,相对 GEPA 和 ACE 的改进比例最高达 37.2% 和 48.2%(表 1)。
- 主要局限:搜索过程随机,无法保证每次结果完全复现;依赖真值或规则反馈,不能完全在无标注数据上运行;若适配数据与真实场景分布不匹配,性能可能下降(见论文第 6 节)。
- 适合读者:从事LLM 智能体、提示工程、多任务学习、自改进系统研究或工程落地的读者,可从中了解如何在一个框架内同时处理多个领域的快速适配。
论文背景和研究动机
测试时提示学习(test-time prompt learning)让模型在部署后可以仅通过修改提示文本来适应新任务、新分布或新错误模式,而无需更新模型权重。近期的工作如 GEPA、ACE、Combee 在单数据集上取得了不错的效果,但它们默认所有样本来自同质分布,用一个共享的提示或上下文去学习全部反馈。
然而,真实应用中查询往往是多领域、多格式、多评价方式的混合流。如果将所有输入塞进同一个提示学习流程,针对一个领域的更新很可能破坏对另一个领域的已有能力。论文通过一个增量实验(图 1)清晰地展示了这一点:将 GPQA Diamond、Formula、TheoremQA、HumanEval 依次加入学习流,GEPA 和 ACE 在累计保留增益上迅速转负,最终分别为 -15.36 和 -18.58,而 Eevee 始终保持正增益,结束时累计提升 +41.53。
这一现象暴露了 “单提示适应所有任务” 的脆弱性。作者将其形式化为多数据集测试时提示学习问题,并要求方法能在混合流中同时保持各任务的专门化能力,这正是 Eevee 的出发点。
核心方法和技术细节
Eevee 的核心思路是不为所有输入只维护一个提示,而是维护一个提示集合与一个路由器。推断时,路由器 先根据输入 和提示集 选择一个槽位 ,再用对应提示 调用模型 生成答案。这样就实现了 “同一模型,不同任务用不同提示”,从而隔离跨任务干扰。
真正的挑战在于路由器本身也需要学习。若路由器固定不变,无法适应任务结构;若路由器不稳定,提示优化又会受到干扰。作者发现路由器和提示之间存在强耦合——路由决定了每个提示看到哪些样本,提示的质量又决定了某条路由决定是否合理。
为此,Eevee 引入路由器–提示协同进化(router-prompt co-evolution)策略,在一个训练周期内交替执行两个操作:
- 路由进化:固定当前提示集 ,用变异和反思机制生成新的路由候选,根据下游正确率、路由一致性与槽位使用平衡性打分,保留更好的路由 。
- 提示进化:固定新路由,把训练数据按路由分配至各槽,对每个槽独立地进行变异、反思和帕累托前沿筛选,更新提示内容,得到 。
两者交替进行,逐步让路由和提示相互适配。这一交替过程又被组织成三阶段训练:
- 初始化:先在混合数据上运行不带路由的提示学习,用帕累托池选出覆盖面互补的多个提示,作为初始提示集。这保证了路由进化时不至于因为提示太弱而无法评估路由好坏。
- 探索:在小预算下快速轮替路由进化和提示进化,并逐步将路由评价的权重从平衡性/一致性向最终准确率倾斜,从而在保持行为多样性的同时收敛至稳定路由。
- 收敛:一旦路由稳定,固定 ,重新分区数据,给每个槽更大的提示学习预算,做精细优化。
在路由进化的具体实现中,Eevee 只从那些 “当前某槽位提示可以正确回答” 的样本中采样,以确保路由错误可归因于分配而非提示能力不足。变异和反思分别生成候选路由,再由验证集选出最佳路由。提示进化中则采用帕累托前沿池,保留互补的提示,防止有效行为被过早丢弃。
整个设计让 Eevee 成为一个可处理真实世界多任务流的自改进智能体框架,且无需修改模型参数。
创新点和贡献
本文的第一个核心贡献是提出了多数据集测试时提示学习这个新设定,并给出第一个系统性解决方案。以往工作都是单数据集,Eevee 首次通过路由器显式建模任务异质性,给出了应对跨任务干扰的路径。
第二个贡献是路由器–提示协同进化的三阶段训练设计。论文通过消融实验(表 2)证明,若用默认路由器、人工手写路由器,或者先学路由再固定路由学提示(无协同进化),平均得分分别只有 43.58、37.18 和 42.88,远低于完整 Eevee 的 51.75,证实了联合学习的必要性。
第三个贡献是经验性洞察。通过六个完整实验的案例回溯(表 4 和图 6),论文指出测试时提示学习对于 “可转化为可复用规程” 的任务(如公式计算、代码补全)提升巨大,而在封闭域知识问答上,推理强化可能压低对领域知识的依赖,从而产生性能倒退。这一发现给实际应用提供了直接指导。
实验结果分析
论文在四个基准数据集上进行了评估,使用 Qwen3-4B-Instruct 和 DeepSeek-V3.2 作为后端模型。主要结果(表 1)显示:
- 在 Qwen3-4B 上,Eevee 平均分 51.75,比未适配基线提升 10.38,比 GEPA 和 ACE 分别高出 14.02 和 16.83 分。特别是 HumanEval 提升了 23.17 分,达到 72.63。
- 在 DeepSeek-V3.2 上,Eevee 平均分 64.07,提升 24.32,HumanEval 甚至达到 92.82。
增量任务实验(图 1)更凸显优势:Eevee 在所有任务引入后仍保持正累积增益,而 GEPA 和 ACE 均大幅为负。这说明路由机制有效保留了历史任务能力。
消融研究(表 2)对比了无路由、固定路由、无协同进化等情况,均远低于完整方法,验证了路由学习和协同进化的必要性。泛化能力测试(表 3)显示,在 Qwen 上学习的提示直接迁移到 DeepSeek 能带来 54.10 的平均得分(原基线 39.75),在未见过的 MBPP 上也有正向增益,表明学习到了一定的跨模型和跨任务可迁移行为。
在效率上,Eevee 每测试样本平均耗费 4.32k token,虽略高于 GEPA 的 3.47k,但远低于 ACE 的 21.30k(图 5)。考虑到其多任务隔离能力,这个计算增量是可接受的。
实践建议
基于 Eevee 的设计和实验结论,面向真实世界多任务智能体的提示学习可遵循以下建议:
-
任务拆分与路由设计 不要试图用一个提示适应所有场景。如果应用涉及明显不同格式或评价标准的任务(如代码生成与知识问答),可仿照 Eevee 设计轻量路由模块,利用少量标注样本优化路由规则,让不同提示专业化。
-
反馈质量决定训练效果 Eevee 仍需要真值或规则评分信号驱动进化。训练时务必确保反馈准确且与下游评价对齐。如果反馈噪声较大,路由和提示的联合优化可能产生错误偏见,建议先清洗适配集或引入人工校验。
-
领域知识的保守策略 对于需要大量封闭领域知识的任务(如 GPQA Diamond 那样的高难度科学知识问答),纯提示学习可能过度强调推理而忽略事实记忆。此时,应评估提示改写是否无意中替换了模型已有的正确知识。可考虑冻结部分知识密集型任务的路由槽,或在该槽位提示中加入 “首先依赖已知事实” 的约束。
-
训练阶段的资源分配 初始提示集应尽量覆盖互补成功模式;探索阶段预算不宜过早集中到准确率,而应引导路由保持一定的槽位平衡;收敛阶段在固定路由后加大每个槽的提示优化预算,可取得更精细表现。实际部署可并行运行多个提示池,采用类似帕累托择优的方式保留多样性。
-
监控与持续更新 由于适配数据与真实流量可能存在分布偏移,上线后应持续监控各路由槽位的准确率与流量占比。若某一槽位性能持续下降或流量分布剧烈变化,可重新触发协同进化流程,但注意保留原有稳定路由作为候选,防止灾难性遗忘。
Eevee 的核心思想——用路由器隔离任务、用协同进化解决路由与提示的相互依赖——同样适用于其他需要在线自改进且任务多元的系统,为真实世界智能体的持续学习提供了一条清晰的工程路径。