SkillOpt:自进化智能体技能的执行策略

SkillOpt: Executive Strategy for Self-Evolving Agent Skills

arXiv: 2605.23904v1

论文信息

标题: SkillOpt: Executive Strategy for Self-Evolving Agent Skills

作者: Yifan Yang, Ziyang Gong, Weiquan Huang, et al.

发布日期: 2026-05-22

arXiv ID: 2605.23904v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:这篇论文要解决什么? 前沿语言模型作为代理时,其行为规范(技能)通常是手工编写或一次性生成,缺乏类似深度学习优化器那样可控、可验证、可改进的迭代训练过程。论文试图将代理的技能文档变为一个可正式优化的外部状态,从而稳定提升代理性能。

  • 核心方法:用什么办法解决? 提出 SkillOpt,一个文本空间内的技能优化器。它保持目标模型冻结,由独立的优化器模型基于 rollout 证据提出结构化的增/删/改编辑,通过验证集门控、受控编辑预算和 epoch 级慢速/元更新,将技能优化转化为类深度学习的受控训练,并导出紧凑的 best_skill.md 文件。

  • 关键结果:最重要的一个结论或数字。 在 6 个基准、7 个目标模型、3 种执行模式的共计 52 个 (模型, 基准, 执行模式) 评估单元中,SkillOpt 在所有单元上均为最佳或并列最佳(见表 1)。例如,在 GPT‑5.5 上,平均无技能得分被提升 23.5 个百分点(直接对话),并比任何单一单元下的最强基线高出 5.4 个百分点。

  • 主要局限:作者自己承认的、或方法本身固有的限制。 优化依赖自动评分和验证集,当任务缺乏可靠自动反馈(如主观、多维度评价)时适用性受限;技能训练需要额外模型调用,虽有成本但对一次性训练可接受,不适合高度异构的领域;优化出的技能可能编码训练分布中的偏见,跨域迁移时仍需谨慎评估。

  • 适合读者:什么背景的人值得读? 关注大语言模型代理、提示工程、自动化技能构建与自进化系统的研究者与工程师;希望为冻结模型引入可控、可复用领域适配层的应用开发者;以及对类深度学习优化技术引入自然语言空间感兴趣的人。

论文背景和研究动机

近年来,前沿语言模型正越来越多地被部署为代理,从单一对话调用扩展到多步骤工具执行环(如 ReAct、Toolformer 等)。在此类设定下,领域适配已不仅是调整模型权重或提示词,还需要改进代理「如何收集证据、调用工具、遵循领域惯例、格式化输出」的程序性知识。技能(skill)作为一种自然的接口,将程序性规则、领域启发式、工具策略、输出约束等打包为可移植的自然语言文档,允许冻结模型通过外部文本适应领域。

然而现有技能要么由手工编写、一次性生成,要么通过松散的自我修正进化——没有任何一种方法类似于深度学习中对权重的系统性优化,也无法保证基于反馈能可靠地超越起点。论文作者提出:技能文档本身应该是一个可训练的外部状态,引入与权重空间优化相同的纪律(如证据批次、学习率、验证门控、动量项)来训练程序性文本。SkillOpt 正是在这一思想下诞生的第一个系统级、可控的文本空间技能优化器。

核心方法和技术细节

SkillOpt 的核心是将技能文档视为待优化的外部状态,并将优化过程分解为前向传递(收集 rollout 证据)和反向传递(基于证据生成编辑)两个阶段,同时引入多项控制机制使优化稳定且可审计。

前向传递:Rollout 批次与收集证据

在每一个优化步,冻结的目标模型 MM 使用当前技能 ss 从训练集 DtrD_{\text{tr}} 执行一批任务,执行环(聊天、Codex、Claude Code)会记录任务元数据、消息、工具调用、观察结果、最终答案、验证器反馈以及特定基准的上下文(如电子表格预览、文档引用等)。此 rollout 批次是编辑的证据单元:较小批次更新快但噪音大,较大批次能揭示更多重复模式。实现还支持累积若干批次后合并为一次更新,解耦执行吞吐量与更新频率。

反向传递:小批次反思与结构化编辑

独立的优化器模型 OO 接收轨迹证据,首先区分失败与成功案例,并将每组分为多个反思小批次(默认大小 8)。小批次反思能够暴露出可复现的过程性错误(如代理反复搜索错误源、写错答案格式等),避免单个轨迹产生过于轶事化的修补。失败小批次提出缺失或修正性规则,成功小批次则保留已奏效的行为。每次反思输出结构化的「添加」「在……后插入」「替换」「删除」编辑。

随后,编辑经过层次化合并:先在失败组和成功组内分别合并,去除重复、矛盾与示例特定建议;再进行最终合并,失败修正拥有更高优先。最后由优化器在给定的编辑预算 LtL_t(即最大可应用编辑数)下排名并选取至多 LtL_t 个编辑,形成候选技能 s∼s^\sim。这一定量编辑预算就是文本学习率,阻止无限制重写造成有益规则的丢失或不兼容。

验证门控与拒绝编辑缓冲

候选技能 s∼s^\sim 在验证集 DselD_{\text{sel}} 上进行评估(保持模型、执行环全同),只有当其得分严格高于当前技能得分时才被接受;若同时超过历史最佳得分,则更新导出 best_skill.md。被拒绝的编辑并非直接丢弃,而是将失败模式和尝试过的编辑及其得分下降量记录到 epoch 局部缓冲中,供后续反射调用时作为负反馈,帮助避免重复无效编辑。

Epoch 级慢速/元更新

在每 epoch 结束时,SkillOpt 对上一 epoch 技能和当前技能在相同训练样本上重新采样,分组为改进、退化、持续失败和稳定成功四类,让优化器写出纵向指引,写入技能文档的受保护慢速更新区域。该区域不被步骤级编辑触及,从而实现快速局部更新与慢速 epoch 级巩固的分离。此外,优化器侧维护一个元技能,总结 “哪些编辑模式有效、哪些被拒、哪些失败持续存在”,仅用于优化器自身的提示,不随部署技能发布。

部署与通用性

SkillOpt 透过轻量级适配接口做到执行环无关:适配器只需构造训练/评估批次、注入技能、运行原生执行环并返回带分轨迹,同一优化器即可用于直接问答、电子表格、文档推理、具身环境等不同任务,以及 Codex 或 Claude Code 工具环境。最终输出是仅数百至两千词元的紧凑 best_skill.md,部署时完全不引入额外的模型调用。

创新点和贡献

论文的核心创新在于为代理技能引入了系统化的可控优化范式,并提供了完整的实现设计、广泛的实验验证以及组件消融。

  1. 将技能优化形式化为文本空间训练问题:提出技能作为冻结模型外部可优化状态,并对应设计了 Rollout 批次、反思小批次、结构性编辑、文本学习率、验证门控、拒绝编辑缓冲和 epoch 级慢速/元更新等一整套优化控制,极大地突破了现有的手工编写、一次性生成或非受控自我修订的限制。
  2. 首次提供跨基准、跨模型、跨执行环的大规模技能优化研究:在 6 个多样化的基准(QA、电子表格、文档、数学、具身决策)、7 个模型(从 GPT 前沿系列到 Qwen 小模型)以及 3 种执行模式(直接聊天、Codex、Claude Code)上,SkillOpt 在所有 52 个评估单元上均为最佳或并列最佳,展现了极强的普适性。
  3. 验证了设计组件的必要性并通过转移实验展示了技能的可复用性:消融实验(表 2、表 3)表明,受控编辑预算、拒绝缓冲和 epoch 级慢速/元更新对性能至关重要;转移实验(表 4)显示,优化出的技能可以正向迁移到不同规模的模型、不同的执行环境,甚至相邻的数学基准,且无权重更新,进一步突出了技能文档作为可复用制品的价值。

实验结果分析

主结果矩阵(表 1)展示了 SkillOpt 在全部 52 个单元上的统治性表现。在 GPT‑5.5 直接聊天下,六个基准的平均得分从无技能的 58.8 提升到 82.3(+23.5 点);即使与每单元最强基线(来自人类、LLM、Trace2Skill、TextGrad、GEPA 和 EvoSkill)比较,SkillOpt 仍平均高出 5.4 点。其中电子表格(SpreadsheetBench)和 OfficeQA 等程序性强的基准收益最显著(分别 +38.9 和 +39.0 点),甚至在 Qwen3.5‑4B 小模型上实现近 2 倍提升。在 Codex 和 Claude Code 工具执行环中,SkillOpt 同样为 GPT‑5.5 带来 +24.8 和 +19.1 的平均增益,并大幅超越最强基线 EvoSkill。

消融实验(表 2、表 3)表明,验证门控、拒绝缓冲和慢速/元更新是取得高分的必要组件。移除慢速更新和元技能导致 SpreadsheetBench 得分骤降 22.5 点(从 77.5 降至 55.0),突显长程指导的关键性。同时,优化器强度分析(表 5)指出,虽然更强大的优化器能带来更多收益,但目标匹配的优化器仍可恢复大部分增益,证明优化循环本身有独立价值。

技能的紧凑性和编辑经济性同样引人注目(表 6):最终 best_skill.md 词元数仅在 379 至 1995 之间,通过仅 1–4 次被接受的编辑就获得了巨大提升,训练成本可在部署前一次支付。提取出的规则(图 4)均为程序性而非实例特定,体现为答案格式约束、证据绑定、搜索簿记、公式验证等,可读性强且可审计。

实践建议

SkillOpt 为实际部署代理技能优化提供了明确的方法路径,尤其适合以下场景:

  • 冻结模型需适应严格程序性要求的领域:当任务对证据收集顺序、工具调用策略、答案格式有严格要求时(如金融表单查询、科研数据抽取),可固定模型,用少量标注样本优化的技能大幅提升可靠性与合规性,而无需修改模型权重或使用复杂微调。
  • 跨模型和跨平台技能复用:技能文档为纯文本,可在不同规模模型甚至不同工具执行环间迁移且保持大部分增益(见表 4)。实践中可在最强模型上训练一次技能,然后分发给推理成本更低的小模型或不同开发环境,摊销多次部署成本。
  • 构建可审计、可维护的代理逻辑:由于技能文档精简且语义清晰,运营团队能够直接审阅和编辑(如调整敏感数据访问规则),而非面对黑盒提示或模型权重。建议配合版本控制,并在迁移任务时进行小规模验证,以确保原技能在新域下仍安全有效。
  • 在优化成本可接受时逐步改进:SkillOpt 的训练过程需要额外模型调用,但训练后就无需额外推理开销。对于长期、重复性在线代理服务,可在离线阶段用少量代表性样本生产高质量技能,收益可覆盖成本,部署后可通过监控拒绝率或失败模式定期触发再优化。

在使用中还需注意:当验证反馈不可靠时,应考虑引入人工评估或多维评分以避免技能偏向验证指标;并且切勿将未经评估的技能跨域迁移,应保留评估门控,防止性能退化。