ScienceBuddy:面向交互式科学智能体的递归中递归自改进
ScienceBuddy: Recursive-in-Recursive Self-Improvement for Interactive Scientific Agents
论文信息
标题: ScienceBuddy: Recursive-in-Recursive Self-Improvement for Interactive Scientific Agents
作者: Shuhan Xue, Jianyuan Zhong, Ziyuan Nan, et al.
发布日期: 2026-09-15
arXiv ID: 2609.17523v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:如何让科学智能体把研究者的请求、反馈和执行证据,转化为持续改进的工作程序与底层能力,而不是只在单次对话中修正答案。
- 核心方法:提出 recursive-in-recursive self-improvement:内递归固定模型、迭代改进 agent harness;外递归在改进 harness 下用任务化 rubric 奖励和 GRPO 更新模型,两者交替并异步部署。
- 关键结果:在 Qwen3.5-4B 初始模型上,三个递归循环后整体单次测试准确率从 42.2% 提升到 73.3%(见论文第 4.2 节,图 8)。
- 主要局限:案例研究分别固定模型或 harness 来评估单侧收益,完整递归闭环的长期协调效果仍需要更多证据;部分实验使用有界模拟反馈,真实研究者反馈的多样性尚未完全覆盖(见论文第 7.2 节)。
- 适合读者:关注科学智能体、LLM agent 持续学习、GRPO/RL 以及生物医学信息学产品化的研究与工程人员。
论文背景和研究动机
科学研究的常态是分析、检查、修订。语言模型智能体可以在证据检索、数据库查询和计算流程执行中提供帮助,但研究者在对话中指出的问题,往往只修正了当前答案,难以沉淀为跨任务的稳定能力。论文由此提出中心问题:科学智能体如何把与研究者协作中产生的要求、反馈和执行记录,转化为可持续改进的 “工作程序” 和 “模型参数”。
相关工作已经分别触及程序优化和模型学习。Reflexion、GEPA、ACE 等方法保留经验或搜索提示;Meta-Harness 和 PILOT 优化 harness 或学习可复用技能;OpenClaw-RL 与 RLAnything 从交互中提取学习信号;SIA 同时更新 harness 和模型权重,HELIX 将 harness 进化与训练数据构造连接。但 ScienceBuddy 的出发点不同:它让协作本身同时提供任务定义和评估标准,从而协调程序级和策略级的重复学习。
论文明确引用 Silver 和 Sutton 的话:“Agents will inhabit streams of experience, rather than short snippets of interaction.” 这是整个工作的基调:不是优化单次问答,而是沉淀长期经验。
核心方法和技术细节
ScienceBuddy 是一个交互式科学研究工作区,包含 224 个工具、22 个功能模块,覆盖基因组学、分子与癌症生物学、药理学、生物成像、文献检索和数据库查询等方向。运行时支持 Python、R 和 Bash,并提供在线数据库接口与本地数据湖。研究者可以上传文档、表格、序列和图像,在 Chat 视图提交问题、检查结果并追加要求,在 Trajectory 视图审查完整执行轨迹和事件详情。
系统采用 ReAct 式 “推理—行动—观察” 循环。模型动作可以是可执行代码、工具调用或面向研究者的回复。harness 负责组织指令、可复用技能和上下文管理流程,并与科学基础设施分离。这种分离使程序修改可以被独立评估和版本化。
学习信号的构造分三步。首先,从协作轨迹中重建自包含任务 及其所需资产 ;其次,用完整协作轨迹构造任务专属 rubric ,覆盖任务范围、方法要求、证据和预期产物;最后,将指令、资产、执行环境和 rubric 打包为 Harbor 任务,支持 SFT 和 RL。
核心范式是 recursive-in-recursive self-improvement。内递归在固定任务模型 下,由固定辅助模型 GPT-6 Astra 诊断轨迹失败,并提议对 harness 做有界修改:一次只添加、删除或修改一个 scoped skill、一条指令或一个上下文设置。候选修改只有在满足编辑约束、且成对开发评估分数 时才被接受;否则保留父版本(见论文第 2.3 节,公式 5)。外递归在选定 harness 下校准环境难度,生成新的 on-policy rollout,并用任务专属 rubric 奖励驱动 GRPO 更新任务模型。rubric 和 harness 在训练期间固定,历史交互只用于任务定义和诊断,不作为在线策略样本。
算法 1 给出了异步在线服务与后台更新流程:在线部署 ,收集一定周期内的交互;后台完成 harness 优化和模型强化学习;重新评估后部署 。所有 harness 和环境版本都被保留,以便后续进化和再评估。
创新点和贡献
论文列出了四项贡献。第一,发布 ScienceBuddy 研究型产品,将对话、可执行分析、可检查制品和可插拔 harness 整合到持久工作区。第二,提出从协作中生成可执行任务和 rubrics 的流程,而不是先打包任务再请专家标注。第三,提出 recursive-in-recursive self-improvement 范式,把 harness 进化与模型强化学习双向耦合:harness 修订塑造训练轨迹和任务难度,模型更新又改变现有程序的有效性。第四,通过案例研究展示固定模型下的程序改进和固定 harness 下的模型学习。
值得注意的一点是,论文没有把研究者的认可当作科学真值。历史答案和研究者批准只是构造任务和 rubric 的证据,最终评估仍由可执行检查或固定裁判完成。这降低了对人类反馈质量的过度依赖。
实验结果分析
实验覆盖四个科学任务族:文献阅读、数据库判断、实验协议故障排除、基因与变异评估。总任务集合为 895 个任务,包括 96 个 LitQA2、511 个 DbQA、108 个 ProtocolQA 和 180 个 GWAS 任务(见论文第 7.1 节,表 1)。
在真实交互案例中,研究者先要求设计 JAK1 与小细胞肺癌免疫治疗的关联分析,再要求为 ARL4C 研究准备演讲提纲。ScienceBuddy 分别生成了基因特异性分析计划和证据关联式演示结构。论文指出,这些请求可以转化为任务目标、评估标准和预期产物,但图 7 中的 task specifications 是说明性推导,不是已归档的 rubric 包。
两周期递归动力学实验中,从 Qwen3.5-4B 和初始 harness 出发,运行三个循环,每个循环包含 10 步 harness 搜索和 20 步 RL。harness 验证准确率在三个循环中分别从 38.9% 到 44.4%、34.4% 到 46.7%、61.1% 到 70.0%。整体单次测试准确率从 42.2% 上升到 73.3%;33.3% 的测试问题由错误转为正确,2.2% 由正确转为错误;四个任务族均观察到改善(见论文第 4.2 节,图 8)。这一结果表明,在该实验设置下,递归循环同时提升了程序搜索和策略学习指标。
固定模型下的 harness adaptation 实验中,验证准确率从初始 harness 的 31.1% 提升到所选 harness 的 51.1%,提升 20 个百分点(见论文第 4.3 节,图 9b)。所选 harness 包含 4 条指令和 9 个 scoped skills,涉及 Python 执行、资源检查、有限记录查询和显式提交等过程。固定 harness 下的模型学习中,pass@4 问题覆盖率从 48.3% 提升到 67.8%,提升 19.5 个百分点(见论文第 4.4 节,图 10b)。这说明在同一评估预算下,模型学会了解决更多不同问题。
实践建议
对从事科学智能体或 agent 持续学习系统设计的团队,这篇论文给出了几条可落地的思路。
第一,优先分离 harness 与基础设施。科学智能体的提示词、技能和上下文管理不应与工具运行时绑死。把可编辑过程封装为版本化的 harness,可以让程序修改在小数据集上快速验证,而不必每次训练模型。
第二,把用户协作变成训练资产,但不要直接当作标签。在线产品应自动记录请求、轨迹、用户反馈和生成制品,并把它们打包成带 rubric 的可执行任务。用户点头同意可以作为 rubric 构造线索,但最终奖励应由可执行检查和固定裁判给出。这样可以避免幻觉式用户反馈污染策略训练。
第三,从固定模型优化 harness 开始。论文在 4B 模型上仅通过程序修改,在验证集上提升 20 个百分点。对于资源有限的团队,先做低成本的 harness evolution,往往比直接上 RL 更快获得收益。之后再引入 GRPO,用相同 harness 下的 on-policy rollout 扩展模型的问题覆盖范围。
第四,保持训练任务和评估任务严格隔离。论文中开发集用于 harness 选择,RL 训练使用独立 rollout 组,最终测试集不参与编辑或选择。生产环境中,需要建立多层任务池:收集集、程序开发集、RL 训练集和长期保留的回归测试集。
第五,设计异步后台更新流水线。在线服务可以继续用旧 服务,后台完成 harness 搜索和模型更新后再切换。论文算法 1 的收集—后台更新—部署循环,适合需要持续迭代的科学分析产品。所有模型和 harness 版本都应保留,以便回滚和交叉评估。