ESPO:通过诊断、多样化与稳定化实现基于错误结构的提示词优化

ESPO: Error-Structured Prompt Optimization via Diagnose, Diversify, and Stabilize

arXiv: 2609.04197v1

论文信息

标题: ESPO: Error-Structured Prompt Optimization via Diagnose, Diversify, and Stabilize

作者: Lihao Liu, Peng Tang, Kunwar Yashraj Singh, et al.

发布日期: 2026-09-03

arXiv ID: 2609.04197v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:这篇论文要解决进化式提示优化中的 “提示膨胀” 问题,以及由此带来的误差观察不完整、搜索多样性不足和候选选择不可靠。
  • 核心方法:提出 ESPO,把提示优化拆为三步:一次性全量错误诊断并聚类成结构模式、用四种互补策略生成候选、用 bootstrap 稳定性选择挑选最终提示。
  • 关键结果:在七个公开 NLP 基准上,从同一个弱提示出发,ESPO 平均测试准确率 74.67%,GEPA 为 70.91%(+3.76 个百分点),且提示平均长度缩短 47%(1,004 vs 1,878 字符)(表 1)。
  • 主要局限:优化成本仍不低;理论假设四个策略独立、验证噪声亚高斯等,作者承认是简化;诊断依赖反思 LLM 的聚类质量;工具使用、长上下文、代码等不在评测范围(第 6 节)。
  • 适合读者:从事 LLM 提示工程、自动提示优化、NLP 系统部署或机器学习流程自动化的工程师与研究者。

论文背景和研究动机

大型语言模型越来越多地通过自然语言提示来引导,而不是修改参数。自动提示优化器如 APE、OPRO、MIPROv2 和 GEPA 试图替代人工试错。其中 GEPA 通过进化循环取得当时最优结果,但论文发现其存在持续问题:每轮迭代都倾向于追加规则和注意事项,提示长度不断膨胀,最高可到 ESPO 的 3 倍,却没有带来更高准确率(第 1 节)。

论文把这一现象归因于三个结构缺陷。第一,进化式方法的误差观察不完整:GEPA 每轮只反思 3–8 个随机错误,按优惠券收集者论证,约需 15 轮才能以 95% 概率覆盖所有系统性错误模式;期间优化器会不断堆积冗余或矛盾规则。第二,搜索多样性有限:单一变异算子锁定一种偏差模式,遇到某些错误类型时只能继续堆规则。第三,选择不可靠:在约 30 条验证集上、从约 10 个候选中用点估计选择,是一个多重检验问题,噪声可能让冗长候选胜出(第 1 节)。

核心方法和技术细节

ESPO 将提示优化从进化搜索重新表述为结构化统计估计。其优化目标是找到最大化测试性能的指令 p∗p^*,形式为:

p∗=arg⁡max⁡p∈ΠE(x,y)∼Dtest[M(mp(x),y)]p^*=\arg\max_{p\in\Pi} \mathbb{E}_{(x,y)\sim\mathcal{D}_{\text{test}}}[M(m_p(x),y)]

整个流程对应三个阶段(第 3.1 节)。

阶段 1:结构化误差诊断。 收集当前提示在训练集上的全部错误 Etrain\mathcal{E}_{\text{train}},让反思 LLM 把它们聚类成 3–7 个结构模式。每个模式包含失败模式描述、代表性例子和计数。与 GEPA 每轮只看少量错误不同,ESPO 一次看全量错误,能够在一轮内实现完整覆盖。附录 B 的优惠券收集者命题给出,m=3m=3 时大约需要 15 轮才能覆盖全部模式,而 m=allm=all 一轮即可。

阶段 2:多策略候选生成。 基于诊断结果,使用四个互补策略分别生成候选:诊断修订针对根因修改提示;合并策略在不增加长度的前提下合并冗余规则;消融策略识别并弱化过度触发的规则;事实注入策略从错误样本中提取领域知识作为上下文。种子阶段通常产生 4–6 个候选,再进行两轮交叉授粉和靶向细化,候选数上限为 N=10N=10。四个策略没有在多数数据集上出现单一赢家,论文认为这支撑了它们具有不同偏差的假设(第 3.3 节、附录 D.1)。

阶段 3:bootstrap 稳定性选择。 对验证集做 B=20B=20 轮有放回重采样,每轮评估所有候选并记录胜者,最终选择赢得最多重采样的候选,平局时偏好较短提示。形式为:

p∗=arg⁡max⁡pi∈P∣{b:pi=arg⁡max⁡pj∈PAcc(pj,Vb)}∣p^*=\arg\max_{p_i\in\mathcal{P}} \left|\{b: p_i=\arg\max_{p_j\in\mathcal{P}}\mathrm{Acc}(p_j,\mathcal{V}_b)\}\right|

这样反复获胜的候选对验证集扰动更稳健,更可能泛化。ESPO 还隐式遵循最短描述长度原则:诊断把大量错误压缩为少量模式,消融移除无用规则,合并避免增长(第 3.4 节)。

论文在附录 A 给出了非正式泛化界,将其分解为偏差底、探索增益和选择误差三项,分别对应三个阶段。作者在限制部分明确指出,该定理是解释性框架,而不是严格的概率保证;其中独立性、亚高斯噪声和最优候选获胜概率 p1>1/2p_1>1/2 都是简化假设(第 6 节)。

创新点和贡献

第一个贡献是把进化式提示优化统一为统计估计框架,并说明 GEPA 是 ESPO 的退化情况:令 K=1K=1、B=1B=1、诊断批量 m=3m=3,即可恢复 GEPA。这使得原方法的三个弱点都被显式暴露出来。

第二个贡献是实验证据。在七个公开 NLP 基准上,从故意选择的弱提示开始,ESPO 平均准确率 74.67%,比 GEPA 的 70.91% 高 3.76 个百分点,每个数据集上都不低于 GEPA;同时平均提示长度从 1,878 字符降到 1,004 字符,缩短 47%(表 1)。论文还做了约束 GEPA 对照,表明仅施加长度约束不能让 GEPA 提高准确率,平均准确率只变化 +0.09%,说明 ESPO 的收益不单纯来自长度控制(表 2)。

第三个贡献是跨模型泛化。在 Gemma 3 12B、Mistral 14B、Qwen3 32B 和 Claude Haiku 4.5 四个学生模型上,ESPO 都取得最佳平均准确率;其中 Qwen3 的 GSM8K 从默认提示的 15.00% 提升到 91.40%,比 GEPA 高 56.00 个百分点(表 3)。

实验结果分析

在主实验设置下,非反思式基线 Bootstrap、COPRO 和 MIPROv2 从弱提示恢复能力有限:Bootstrap 平均 29.65%,甚至略低于默认提示的 31.12%;而 GEPA 和 ESPO 分别达到 70.91% 和 74.67%(表 1)。这在该实验设置下说明反思式优化更适合从弱提示出发恢复可用提示。

分数据集看,ESPO 的领先在 HoVer(+8.80 个百分点)、Tweet(+6.18)、MMLU(+4.92)和 ScoNe(+4.40)上比较明显;GSM8K 打平在约 96.8% 的接近上限位置;HotpotQA(+0.80)和 PUPA(+1.20)的差异落在单次运行的标准差之内,论文明确将它们描述为与 GEPA 相当(第 4.2 节)。在主文本中,ESPO 与 GEPA 的均值差距约为其配对标准误的 3.1 倍,但这是 7 个数据集的有限比较,不能推广到所有任务。

消融结果显示,单独使用 bootstrap 选择可带来 +3.60 个百分点,单独使用全量诊断带来 +2.00 个百分点;而单独增加多样性反而下降 1.20 个百分点。三者组合达到 +6.18 个百分点(表 4)。这与论文的理论预测一致:只增加候选多样性而不提高选择可靠性,会放大选择误差。

在强初始化下,ESPO 仍平均比 GEPA 高 4.79 个百分点(附录 D.4),说明其优势不限于修复弱提示。推理延迟方面,ESPO 在七个任务上都不高于 GEPA,链式思考任务上差距更明显(表 9)。

实践建议

如果现有自动提示优化流程出现提示膨胀、响应变慢或验证集过拟合,可以优先考虑以下调整。

第一,把 “随机抽样少量错误进行反思” 改成 “全量错误聚类诊断”。当训练错误数量可控时,一次性聚类能够减少多轮冗余规则堆积。论文实验显示,全量诊断单独可带来约 +2.00 个百分点,同时比部分抽样产生更短提示(表 4、表 5)。实际系统里,建议把诊断输出设计为结构化模式列表,而不是一段自由反思文本。

第二,候选生成应明确引入多个互补策略,而非只改变一个变异算子。可参考 ESPO 的诊断修订、合并、消融、事实注入四类策略。但要注意:如果后续选择仍是小验证集点估计,增加多样性可能反而损害效果。论文消融中多样性单独使用下降 1.20 个百分点,说明需要与稳定选择同步引入(表 4)。

第三,在候选数较多、验证集较小时,用 bootstrap 重采样代替单次验证集最优选择。实现上可设 B=10B=10 或 B=20B=20,选择赢得最多重采样的候选,并在平局时偏好更短提示。论文中 B=20B=20 已足以选出更短且准确率不差的候选;继续增大到 30 在该设置下没有进一步变化(表 5)。

第四,如果生产环境更关注推理延迟,可在选择阶段通过平局规则或评分组合让短提示占优。在论文实验中,ESPO 的短提示不仅减少输入 token,还在链式思考任务上伴随更短的推理链,使单例延迟不高于 GEPA(表 9)。这在本评测模型与数据集上表现为一种相关性,不能直接断言所有场景都如此。

最后是成本控制。完整 ESPO 的一次运行成本与默认 GEPA 大致相当,反思 token 约为 GEPA 的 39%,但 bootstrap 会带来 B×NB\times N 次候选评估(第 6 节、表 10)。工程实践可以先用较小的 BB 或 NN 做粗筛,再对前几名候选投入更多重采样。