EurekAgent:智能体环境工程是实现自主科学发现的唯一关键
论文信息
标题: EurekAgent: Agent Environment Engineering is All You Need For Autonomous Scientific Discovery
作者: Amy Xin, Jiening Siow, Junjie Wang, et al.
发布日期: 2026-06-11
arXiv ID: 2606.13662v1
PDF 链接: 下载 PDF
研究背景与动机:当通用智能体足够强大,瓶颈何在?
近年来,基于大语言模型的智能体在自动化科学研究中展现出惊人潜力。给定一个可优化的指标和执行环境,它们能够自主提议、验证并迭代科学解决方案,甚至在诸多领域超越了人类设计的方法。从数学定理搜索、算法演化到核函数工程、机器学习流水线,LLM 智能体正推动一种范式转变:人类越来越多地专注于选择有价值的方向、定义有意义的指标和监督有效性,而智能体则承担起大规模方法探索的工作。
然而,当前多数自主研究系统实现这一愿景的方式,是将特定研究流程硬编码到智能体行为中。例如,基于进化算法的系统显式维护候选程序种群,通过评估反馈指导变异与选择;一些机器学习系统则围绕解决方案树和角色化智能体组织探索过程。尽管这些设计能够生效,但它们都强有力地预设了 “研究应该如何进行”。随着通用编程智能体(如 Claude Code、Codex)的能力持续提升,最近的证据表明,大部分有用的能力可能已经蕴含在基础智能体中——只要给出清晰的研究任务和可优化的指标,它们就能发现新的最优解。在 ResearchClawBench 基准上,两个独立的通用智能体已经优于所有特化研究系统。
但仅凭任务表现并不能塑造可靠的研究者。科学发现要求严谨性、可复现性与可审视性,然而智能体可能会污染评估、操纵中间产物、或违反程序约束。这类 “奖励攻陷” 与可观测性失败在实际系统中已被多次报道。由此,一个关键瓶颈浮现:当通用智能体能力越来越强时,自主科学发现的瓶颈正从 “规定智能体工作流” 转向 “设计智能体所处的环境”。
这正是本文提出的 “环境工程” 概念。它呼应了 Gibson 的 “可供性” 理论——环境塑造了行动者可能的行动范围,无论好坏。对于科学发现,一个精心工程化的环境应当抑制有害的可供性(如评估篡改和中间产物操纵),同时放大有益的可供性(如自由探索、准确反馈、智能体间协作和便捷的人类监督)。可以这样类比:一位优秀的博士生的高产并非来自逐分钟的指令,而是来自责任感、研究自主权、准确的反馈、同行协作与导师指导。
核心方法:EurekAgent 的四维环境工程
EurekAgent 并非从零创造新的智能体工作流,而是协调现成的命令行智能体会话,通过一个简单的准备-提议-实现循环,同时沿着四个环境工程维度进行系统性设计,确保探索过程的可靠性与效率。
权限工程 在开放能力与风险管控之间取得平衡。系统提供了可自由配置的 Python 环境、工作区级 Shell 访问、强大的网页搜索与浏览器工具,以及同一次运行之前轮次产生的产物。这赋予智能体类似人类研究人员的工具集。约束方面,每次运行在 Docker 容器中隔离执行,隐藏的评估器和测试数据仅通过安全评分服务暴露,智能体无法窥探或修改评估逻辑。系统还强制要求并行实现会话之间同轮隔离,防止过早收敛到单一方向。对于 GPU 任务,采用默认拒绝策略,GPU 只有通过辅助接口获取,并确保同一时间每个 GPU 仅被一个会话持有,消除了无序竞争。
产物工程 利用文件系统与 Git 历史作为共享的长期记忆。文件系统存储阶段交付物——准备摘要、提案清单、假设、解决方案代码、评估反馈和排名结果。系统还维护网络搜索历史的缓存,所有运行产物持久化,提供了可追溯性、中断恢复与续跑能力。在每个会话内,Git 提交记录解决方案的演变,同时要求智能体在每次提交信息中描述当前方案以及相对前版本的变化,这进一步增强了可检视性和经验积累。
预算工程 将资源约束融入环境设定。用户可以从挂墙时间和 API 开销两个维度设定限制。对于提案与实现阶段,可分别配置不同时间预算以反映两类活动所需的时间差异。系统通过主动和被动机制让智能体感知时间:主动调用时间查问辅助接口查看剩余时间;当截止时间临近而必需交付件尚未产出时,系统会注入警告消息促使智能体结束探索并生成交付件。API 成本限额被全局追踪但不暴露给智能体,一旦达到即中止运行并保留工作区快照。预算机制也支持长周期运行的连续性,中断后可从最新文件系统状态在剩余预算下恢复。
人机协作工程 则保留了人对研究过程的最终监督。EurekAgent 同时提供一个终端用户界面和一个网页监视器。终端界面呈现每个方法的进度、原始会话输出,并提供输入框方便用户与活跃会话直接交流;网页监视器则提供全局视图,包括分数演化的可视化、逐轮最佳方案和当前最佳方案,并记录完整会话脚本,使人类可以随时介入,重定向智能体行为,同时又不必剥夺其自主性。
在这个环境中,智能体仅需遵循最外层循环:准备阶段搭建可靠执行环境并形成起步上下文;提议阶段通过回顾从前轮的最佳方案、查阅网络资料,产生一批多样化、可独立执行的假设;实现阶段对每个假设启动并行会话进行迭代优化,通过安全评估服务获取真实分数,系统自动对所有提交进行排序并更新历史记录,为下一轮提供共享进展记忆。整个过程,智能体享有自由选择研究策略和实施细节的权利。
创新点与贡献
论文的最大创新在于视角的转换:从设计智能体的 “思考流程” 转向设计智能体的 “操作环境”。这并非微小的工程改进,而是对自主科学发现系统中可信性和效率的一次根本性重思。
传统方法通常将研究流程硬编码为固定的脚本——变异、选择、反思等——这些流程虽然针对特定任务有效,但牺牲了通用性和智能体自身策略的涌现。EurekAgent 证明,当环境足够可靠时,通用智能体能够自行探索出强大的解决方案。系统通过四个维度(权限、产物、预算、人机协作)的协同设计,显式压制了常见失败模式:评估泄漏、分数篡改、无序竞争、无限资源消耗与黑箱操作。这种机制不仅在研究完整性上形成闭环,也使得整个探索过程可审计、可复现。
将 “环境” 作为第一等设计原则,呼应了从 “指令驱动” 到 “环境塑造” 的科学研究范式变迁。特别是在科学领域,真正的进展需要可验证的反馈信号和持久的知识积累,EurekAgent 的文件系统、Git 历史与系统托管评分记录构成了一条清晰的知识链,将多轮探索的成果不断内化成共享存储器,而非让每一轮从零开始。
实验结果解析
EurekAgent 使用 Claude Code 作为 CLI 智能体、GLM-5.1 作为基座模型,在数学、核函数工程与机器学习工程三个领域均取得突破。
在数学优化任务上(26 圆周装箱、Erdős 最小重叠、第一自相关不等式),EurekAgent 全部刷新了最优纪录,且这是在没有模型更新的情况下实现的——对比之前的最优 AI 结果均来自测试时训练系统,需要根据评估反馈更新模型。这意味着仅靠环境工程,就能在 “训练无关” 的范式下解放更强的搜索能力。其中 26 圆周装箱任务仅花费不到 11 美元的 API 总成本,性价比极高。
在核函数工程 Triple 矩阵乘法竞赛中,在不提交至已关闭官方排行榜的情况下,EurekAgent 于相同本地评估环境中,发现多个方案优于曾排名第一的人类方案和 AI 方案。前四名 EurekAgent 内核的中位运行时间均低于 2031 μs,比最强重评的公开方案快约 4.3%,比测试时训练系统 TTT-Discover 快 10.8%。这体现了探索的稳定优势,而非偶然性。
在 MLE-Bench Lite 子集的七项机器学习竞赛中,EurekAgent 单次运行获得任何奖牌的比率为 85.71%,金牌率 71.43%,均为所比较方法的最佳水平。值得强调的是,所有列出的基准方法都使用闭源商业模型,而 EurekAgent 使用的是开源 GLM-5.1,这表明精心设计的环境可以让开源模型与顶级闭源模型在自主研究方面一较高下。
实践应用建议与发展方向
对想要构建自主研究系统的实践者来说,这篇工作的启示在于:投资于环境工程,而非仅仅是智能体策略细节。具体建议包括:
- 安全评估必不可少:始终将评估器、黄金答案以及与任务无关的测试数据隐藏在受限接口之后,杜绝智能体通过读取文件、环境变量等方式进行作弊或过拟合。
- 持久化与可溯性设计:利用文件系统与版本控制系统构建共享记忆,让每一轮的尝试、分数和脚本自动归档,不仅便于审核,也能让后续轮次复用历史知识。
- 预算下探与感知:在设定时间与金钱限制的同时,应当让智能体感知剩余资源,并嵌入软硬兼备的停止机制,防止无限循环或因超时而导致未交付任何成果。
- 人机接口的平衡设计:既要提供全局视野让研究者掌握趋势,又要支持深入到某个具体智能体会话中进行干预或沟通,同时不干扰其自主性。
未来,环境工程的研究需要扩展到更开放的科学场景。当前 EurekAgent 仍依赖可执行评估器产生的精确优化信号;但在更宽阔的研究方向中,评价可能带有噪声、延迟或者主观成分。如何构建 “反馈环境” 来容纳这些不确定性,将成为下一步挑战。此外,跨领域、多智能体协作环境的设计——例如在同一个历史知识库上运行多个不同领域的专家智能体——可能带来更高级的科学涌现现象。
总结
EurekAgent 以 “环境工程” 为核心,展示了自主科学发现系统的新坐标。当我们将目光从设计智能体的具体流程移至设计它们所处的环境时,系统的可靠性、可扩展性和性能获得同步提升。它用多个领域的全新最优结果证明了这一方法的潜力,同时也为开源社区提供了一个可复现的起点。未来,可靠自主研究智能体的发展,不仅取决于模型本身有多聪明,更取决于我们为它们构建了怎样负责任、可反馈且能持续积累的环境。