EEVEE:迈向真实世界中自我改进智能体的测试时提示学习
论文信息
标题: EEVEE: Towards Test-time Prompt Learning in the Real World for Self-Improving Agents
作者: Weixian Xu, Shilong Liu, Mengdi Wang
发布日期: 2026-06-09
arXiv ID: 2606.11182v1
PDF 链接: 下载 PDF
论文背景与研究动机:当单任务优化遇上异构数据洪流
大型语言模型(LLM)在实际部署中面临一个关键矛盾:训练时的静态优化与推理时的动态需求不匹配。传统的测试时提示学习(test-time prompt learning)提供了一种轻量级的解决方案——无需更新模型权重,仅通过优化提示词就能让模型适应新任务。这种方法已在反思型智能体和进化式上下文系统中展现出显著效果,典型代表如 GEPA、ACE 和 Combee 等。
然而,现有方法几乎都建立在一个隐含假设之上:模型面临的是单一数据集或单一任务分布。真实世界的数据流完全不同——来自不同领域、不同格式、不同能力要求的查询会混合涌入。论文作者将这一更具挑战性的场景形式化为 “多数据集测试时提示学习”。当模型尝试用一个统一的提示去学习所有这些异构任务时,跨数据集干扰(cross-dataset interference)不可避免地出现:为一个领域优化的提示行为可能损害另一个领域的表现。
作者通过增量多基准测试清晰地展示了这一问题:当依次引入 GPQA Diamond(知识问答)、Formula(公式计算)、TheoremQA(定理证明)和 HumanEval(代码生成)四个基准时,现有方法 GEPA 和 ACE 在旧任务上的表现持续恶化,累积改善最终跌入负值。这种 “学了新的、忘了旧的” 的现象,暴露了单一提示在处理任务混合流时的根本局限。
核心方法:路由器-提示协同进化框架
为了解决上述问题,论文提出了Eevee——首个面向 LLM 智能体的多数据集测试时提示学习框架。其核心思想简单而深刻:不是让所有输入共享一条适应路径,而是维护一组专业化提示,并训练一个路由器将每个输入分配到最合适的提示配置上。
路由机制的架构
在推理阶段,系统首先通过路由器 选择提示槽位 ,然后目标模型使用对应提示 生成答案。形式上,这一过程可表示为:
这种设计的关键优势在于:不同领域的任务可以调用不同的专业化行为,避免优化信号相互干扰。消融实验也证实了这一点——使用默认路由器或人工编写的固定路由器时,性能显著下降甚至不如未适应的基线模型,说明分区的智能化程度对效果至关重要。
协同进化的三阶段训练
路由器学习本身存在一个棘手的相互依赖问题:路由决策决定了每个提示从哪些样本中学习,而提示质量又决定了路由策略是否有效。如果孤立地优化其中一方,都会陷入次优解。Eevee 通过路由器-提示协同进化策略破解了这一困境。
协同进化周期交替执行两次操作:
- 路由器进化:固定提示集,通过变异和反思搜索更好的路由器。系统采样训练样本,对失败案例进行溯源分析,解释为何正确的提示槽位更适合该任务,从而生成改进版路由规则
- 提示进化:固定路由器,对各槽位的提示独立优化,使用变异、反思和帕累托前沿保留多样化提示候选项
为了让这一过程切实可行,Eevee 设计了三个训练阶段:
- 初始化阶段:在没有路由器的情况下,从混合数据中学习一组多样性最大化的初始提示,为路由器提供可分辨的行为基础
- 探索阶段:交替进行轻量级的路由器和提示更新,同时通过退火机制逐步将评分权重从一致性和平衡性转向下游准确率
- 收敛阶段:当路由器趋于稳定后,投入更大的提示学习预算,在固定分区上深度优化每个槽位
这一设计体现了对进化搜索中 “探索-利用” 权衡的深刻理解——早期保持路由多样性避免局部最优,后期聚焦准确率确保性能。
创新贡献与应用价值
Eevee 的贡献体现在三个层面:
框架层面的创新:首次将测试时提示学习从单数据集扩展到多数据集场景,并系统地解决了跨任务干扰问题。这不仅是技术上的增量改进,更是范式的扩展——从 “一任务一提示” 到 “一任务族一提示”。
算法层面的创新:路由器-提示协同进化解决了两个耦合优化问题的联合学习,三阶段训练设计为这种相互依赖的优化提供了实用的收敛路径。这一思想可以泛化到其他需要在不同子系统间协调优化的场景。
实证层面的价值:实验提供了丰富的洞察——提示学习在可复用程序(代码生成、公式计算)上效果显著(HumanEval 提升 23.17 个点),但在依赖领域知识的任务上可能产生负面效果(GPQA Diamond 下降 1.45 个点)。这个发现本身就具有指导意义:它告诉实践者何时应该依赖提示学习,何时需要结合其他方法。
实验结果深度解读
在 Qwen3-4B-Instruct 和 DeepSeek-V3.2 两个不同量级的模型上,Eevee 均表现出显著优势:
- Qwen3-4B-Instruct 平均得分从 41.37 提升至 51.75(+10.38)
- DeepSeek-V3.2 平均得分从 39.75 提升至 64.07(+24.32)
- 相比 GEPA 和 ACE,相对提升分别最高达 37.2% 和 48.2%
任务保留能力的关键优势
在增量多基准测试中,当四个任务全部引入训练流后,Eevee 的累积改善稳定在+41.53,而 GEPA 和 ACE 分别跌至-15.36 和-18.58。这一对比清晰说明了路由器架构的必要性,也揭示了单一提示在多任务场景下的根本局限。
泛化与效率的平衡
Eevee 展示了良好的跨模型泛化能力:在 Qwen3-4B-Instruct 上学到的提示直接应用于 DeepSeek-V3.2,仍能带来显著提升(如 HumanEval 从 42.82 提升至 77.04)。在跨任务泛化方面,MBPP(代码)略有提升,MMLU-Pro(通用知识)小幅下降,再次验证了 “可复用程序受益、领域知识可能损耗” 的规律。
token 成本方面,Eevee(4.32k/样本)远低于 ACE(21.30k/样本),接近 GEPA(3.47k/样本)。路由器仅引入适度的开销,却换来了多任务适应能力的质变。
实践应用建议与前瞻
对于希望在真实系统中应用测试时提示学习的工程师和研究者,Eevee 提供了明确的指导:
场景适配策略:若任务流中的查询具有明确的领域边界(如同时处理代码补全、数学推理、知识问答),应考虑采用路由机制而非单一提示。路由器的训练成本和推理开销可控,但能显著提升整体鲁棒性。
任务属性诊断:在部署前,通过小规模实验判断各任务更适合哪种适应方式——对于可总结为可复用规则或输出契约的任务(如遵循特定格式、处理边界条件),提示学习效果显著;对于依赖更新知识库的任务,需结合检索增强等外部知识源。
部署风险管控:论文明确指出,提示学习仍依赖标注数据或基于规则的评判器,且存在跨运行随机性。建议在部署流水线中加入 held-out 验证环节,监控各任务子集的性能变化,并在反馈数据质量下降时及时介入。
未来发展方向可能包括:
- 将路由机制与模型内部的专家混合架构(MoE)结合,实现更细粒度的能力分配
- 探索完全基于自我反思的优化回路,减少对外部监督信号的依赖
- 研究提示学习中的灾难性遗忘问题,设计更稳健的知识保留机制
- 将 Eevee 的协同进化框架应用到具身智能体、多模态任务等更广泛的自适应场景
总结与展望
Eevee 通过巧妙的 “分而治之” 策略,将测试时提示学习从单一任务的精调工具扩展为多任务环境的通用框架。其核心洞察——让不同任务享有专属提示而非强制共享——看似简单,但配套的协同进化训练过程体现了对优化动力学深刻的理解。
这项工作不仅提供了性能上的显著提升,更揭示了一个实用洞见:提示学习更适合将反馈转化为可复用程序,而非灌输事实性知识。对于正在将 LLM 部署到多样化真实场景的从业者来说,这一观察本身就具有直接的指导价值。随着智能体系统日益复杂,类似 Eevee 这样的自适应框架将成为构建持续学习、稳健推理的 AI 系统的基础组件。