自动化发现没有普遍优越的测试框架

arXiv: 2607.18235v1

论文信息

标题: Automated Discovery Has No Universally Superior Harness

作者: Akshat Gupta, Jermaine Lei, Alexander Lu, et al.

发布日期: 2026-07-20

arXiv ID: 2607.18235v1

PDF 链接: 下载 PDF

引言:自动化发现系统的 “控制框架” 困境

近年来,基于大语言模型(LLM)的自动化发现系统,如 OpenEvolve 和 TTT-Discover,在数学、算法和科学问题上展现出令人瞩目的能力。这些系统通常遵循 “生成—评估—改进” 的迭代循环:LLM 生成候选程序,外部评估器为其打分,随后一个被称为 harness(控制框架) 的组件依据评分和搜索历史决定下一个迭代中该扩展哪些已有的解。

然而,当前的控制框架往往是多种设计选择的复合体:它同时集成了存档策略、父代选择规则、探索机制和预算分配方式,最终打包成一个 “大杂烩” 式的配方。由于每次发现的运行成本高昂且天生具有随机性,研究者通常只能进行少量的独立实验,很难将真正的算法改进与单纯的随机波动区分开。这就引出了一个核心问题:当某个发现系统在特定任务上成功时,其背后的控制框架设计是否可以作为普适的方法论原则进行迁移,还是只是一个依赖于具体模型和问题的 “超参数”?

本文通过系统性地解构两大主流控制框架——OpenEvolve(进化式搜索)和 TTT-Discover(PUCT 树搜索),对 30 种预算匹配的框架在 12 个模型–问题对上进行了超过 310 万次 LLM 运行的大规模统计评估,由此揭示出一个重要的泛化难题。

核心方法与技术细节

统一视角下的控制框架解构

为了单独研究每个设计组件的作用,研究者从一个最简单的基线——贪心序贯最佳-N(Sequential Best-of-N, Sequential BoN) 出发,逐步添加组件,重建出完整的 OpenEvolve 和 TTT-Discover 框架。

Sequential BoN 的策略极其朴素:每次迭代都只选择当前历史中得分最高的程序作为父代,生成 NN 个变异子代,评估后更新历史。这一过程可以形式化为 pt=argmaxxHtS(x)p_t = \arg\max_{x \in H_t} S(x),其中 HtH_t 是时刻 tt 的完整历史,S(x)S(x) 是评估分数。

由此伸展出两条路径:

  • 走向 OpenEvolve:依次加入 Top-K 精英存档(允许从得分最高的 KK 个程序中采样父代)、ϵ-贪心探索(以概率 ϵ 从完整历史而非仅仅精英集采样)、深度优先的预算分配(减少每代的子代数量 NN,增加迭代次数 TT,总预算 B=NTB=NT 不变),以及最后的灵感采样、MAP-Elites 多样性维护和多岛并行进化。
  • 走向 TTT-Discover:将评分函数替换为子树价值估计 Qt(x)Q_t(x)(取程序 xx 的所有后代中的最佳分数),引入基于访问计数的 UCT 探索奖励,再在其上叠加基于排名的先验项形成 PUCT 规则,最后允许多个父代并行扩展。

通过这种模块化的 “加法” 实验设计,每个组件的独立贡献得以被精确衡量。

预算匹配与统计推演

所有对比均在严格匹配的总计算预算(生成次数)下进行,以避免 “用更多算力换取更好结果” 的假象。为区分真实信号与运行间方差,研究为每个模型–问题对构建了 30 或 100 次 Sequential BoN 运行的基线分布,并采用 自助法(bootstrap) 统计检验来判断候选框架的五次运行中的最佳分数是否显著高于基线分布。此外,还引入了 跨对多数胜利概率 这一指标,用以衡量一个固定框架在全部 12 个场景中超越基线的综合表现。

创新点与贡献

本文的首个贡献在于规模与统计严谨性:它是迄今最全面的一次发现控制框架实证研究,使用了超过 310 万条运行记录,并在配对和跨对两个层面实施了重复随机试验和显著性检验。

第二个核心贡献是揭示了 “固定控制框架不具普适优越性” 这一事实。实验表明,没有任何一种固定的框架配置能在所有模型和问题上显著优于简单的 Sequential BoN 基线。在 ϵ-贪心、ULT/PUCT 树搜索及深度优先分配等轻量变体上取得的优势,一旦套用完整的 OpenEvolve 或 TTT-Discover 配方,效果就变得不稳定,甚至退化为负向影响。这有力地论证了控制框架的选择应当被视作一个依赖于模型和问题的超参数,而非可移植的通用方法。

第三个贡献是基于早期反馈的自适应分配策略。研究发现,搜索进度与最终性能之间具有很强的相关性——当搜索进行到 50% 的预算时,部分得分与最终得分的斯皮尔曼秩相关系数在多数配对中超过 0.7。据此,研究者提出了一种 在线自适应编排方案:启动多个控制框架的部分运行,利用早期得分剪除较弱的运行,将剩余计算资源重新分配给强势的幸存者。在等量总计算预算(相当于五次完整运行)的公平比较中,该自适应策略的平均最终得分优于单框架承诺、非自适应的框架组合以及五次 Sequential BoN 运行,进一步佐证了动态选择框架的价值。

最后,论文还公开了全部运行记录和基线分布,为后续框架的评测提供了可复用的统计基础设施。

实验结果深度剖析

固定框架的泛化难题

组件消融实验清晰地展示了 “此消彼长” 的模式。以 ϵ-贪心探索为例,它在 Qwen2.5-3B 模型处理圆形填充问题时取得了显著的增益,但在其他配对中则无明显提升甚至有害。将搜索预算从广度向深度转移(减小 NN,增大 TT)虽然在某些任务上对小模型有助益,但并不能一致地推广到所有模型。完整的 OpenEvolve 配置(多岛、灵感采样等)甚至在第二自相关不等式任务上严重损害了 Qwen 模型的性能。

在跨对多数胜利排名中,表现最好的配置是 K=1,ϵ=20%K=1, \epsilon=20\% 的简单 ϵ-贪心框架,其多数胜利概率为 0.914,但经过 Holm 校正后的 pp 值不再显著,说明其优势仍不够普适。而完整的 OpenEvolve 配置多数胜利概率仅为 0.033,几乎总是劣于基线。这一结果强有力地表明:复杂性的堆砌并不能自动转化为更强的泛化能力,控制架构成分的效益高度依赖于模型能力与问题结构

早期反馈驱动自适应的有效性

基于预测性分析的各种剪枝调度均优于非自适应基线。其中表现最佳的策略是 “12→5→2→1” 三阶段剪枝:在 25%、50% 和 75% 进度处分别筛选,最终只保留一个最强运行。该策略在 12 个配对上的平均归一化得分达到 85.75%,显著高于单框架承诺的 82.49%、无剪枝组合的 84.54% 和 Sequential BoN 基线的 84.35%。值得注意的是,无剪枝组合已使用了多样化的框架池,但仍被自适应分配超越,这直接证明了 中途反馈信息本身具有额外的决策价值,而不仅是多样性的边际效益。

实践应用建议与未来方向

对于正在开发或使用 LLM 自动化发现系统的从业者,本文带来了几条关键的实践启示:

  1. 摒弃 “万能框架” 迷思:不要指望某个成熟的控制框架配方能无差别地适用于新问题。应当将框架选择视为实验过程中的一个超参数,并在给定计算预算内进行探索。
  2. 利用轻量级变体作为起点:实验反复显示,简单的 ϵ-贪心探索或 UCT/PUCT 树搜索本身往往比全功能的 OpenEvolve 更稳定。从这些轻量组件开始,逐步调整可能比直接使用复杂配方更有效率。
  3. 早期中止与动态预算分配:在实际运行中,可以并行启动几个候选框架,在消耗少量预算(如 25%)后,根据已获得的最优解质量,果断舍弃表现不佳的运行,将剩余预算集中于最有希望的搜索分支。这种 “早期判决” 的方式能显著提升整体投资回报。
  4. 适配模型能力:不同规模的模型对同一框架的响应截然不同。强大且稳定的模型(如 GPT-OSS-20B)往往能在多种框架下保持接近天花板的表现,而较弱模型的性能则严重受限于框架选择。因此,模型的能力边界应当直接影响框架的复杂度设计。

研究也指明了未来的重要方向:控制框架本身也应成为自适应的对象。可以预见,下一代发现系统将不再依赖固定的搜索策略,而是能够在求解过程中动态调整其父代选择、探索力度和预算深度——就如同人类科学家在解决问题的过程中会切换不同的思考策略一样。这一思路与元学习、算法配置和在线资源分配等领域的融合,将有望构建出真正自主、高效的自动化发现引擎。

总结与展望

这篇论文通过系统严谨的实证分析,给出了一个极其重要的警示:自动化发现系统不能指望一个放之四海皆准的控制框架。将框架设计简单视为一个可移植的 “秘方” 是危险的;相反,它应当被理解为一种需要针对具体模型和问题进行调适的超参数。同时,研究也展现了一条补救路径:利用早期搜索反馈进行在线剪枝与算力重分配,能够有效化解固定框架泛化能力不足的问题。这一发现不仅将引导未来发现系统的设计范式从静态转向自适应,更为整个领域提供了可复用的评估标准和数据基础设施,推动该方向的研究走向更扎实、更可重复的科学化道路。