CalibForge:面向可学习终端任务规模化的对抗性求解器校准
CalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal Tasks
论文信息
标题: CalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal Tasks
作者: Fanzhe Meng, Guoxin Chen, Jiale Zhao, et al.
发布日期: 2026-08-06
arXiv ID: 2608.06352v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:如何构建 “对学习真正有用” 的终端代理训练任务?现有方法只保证任务可执行且可验证,却无法判断任务难度是否匹配目标模型的当前能力,容易产出太简单或太难的任务。
- 核心方法:论文提出 CalibForge,一种对抗式求解器校准系统,让任务构造者根据多种求解器的实际行为反馈来不断修改任务,直到任务落入 “求解器相关的可学习区”——即至少一个求解器成功、至少一个失败。
- 关键结果:用 CalibForge 合成 5,431 个校准任务,在 Terminal-Bench 2.0 上训练的模型分别取得 32.58% 和 47.57% 的正确率,比使用其他开源终端任务数据集训练的模型高出超过 6 个百分点(见表 1)。
- 主要局限:校准过程依赖强大的教师求解器,且需要多轮修订与重复探测,计算成本较高;任务集的领域覆盖虽广,但最终训练任务的可迁移性仍受限于参与校准的求解器和基准范围。
- 适合读者:对大模型智能体训练、终端任务合成、课程学习以及执行反馈驱动的数据构造感兴趣的研究者和工程师。
论文背景和研究动机
大语言模型驱动的终端智能体已经能够完成复杂的计算任务,例如在 Shell 环境中执行命令、编写代码或修复软件工程问题。训练这类智能体需要大量可执行且可验证的任务。最近的合成系统(如 TermiGen、Endless Terminals、SETA-Env 等)在规模化构建终端任务上取得了显著进展,但它们主要关注 “任务通过结构验证和自解”,即任务本身是否能够被某个求解器成功完成。这种方式留下了一个关键盲区:可执行不等同于适合学习。一个任务可能简单到只需调用一条命令,也可能难到现有模型都无法解决,这两种情况都无法为模型提供有效的学习信号。
论文的洞察在于:任务的价值不仅由任务本身决定,更取决于任务相对于训练中求解器(即被训练的智能体)的 “可学性”。因此,应当利用求解器群体的行为证据来界定一个求解器相关的可学习区,并以此指导任务的修订。由此提出了 CalibForge,一个将求解器行为转化为构造时反馈的自主终端任务合成系统。
核心方法和技术细节
CalibForge 的核心是一个对抗式作者–求解器循环(adversarial author–solver loop)。整个流程从一条 “线索”(clue,如一个技术洞察或领域关键词)开始:
-
任务创作与验证:作者代理(authoring agent)通过网络搜索挖掘具体的工程问题,形成任务规格说明书,然后在沙盒中测试依赖和工具,编写任务指令、Docker 执行环境和验证测试。任务首先通过结构验证(确保环境可构建、测试均未通过初始状态)和自解(作者代理自己尝试解决并成功)。只有同时通过这两步的任务才能进入校准阶段。
-
对抗式求解器校准:校准循环将任务提交给一组求解器,收集它们的通过/失败结果与完整交互轨迹,并根据预定义的保留准则 判断是否保留。若不满足,作者代理利用反馈(包括失败诊断、自我评估等)修订任务的指令、环境或验证器,然后重新验证并再次探测。每次修订都允许回到网络搜索和规格修改。这一过程持续最多 轮;若最终仍未满足准则,则丢弃该任务。
两种核心校准策略分别定义了不同的保留准则:
-
多求解器校准(Multi-Solver Calibration):使用 个不同模型(论文中为 DeepSeek‑V4‑Flash、GLM‑5、Kimi K2.5)独立求解同一个任务。若结果满足 ,即至少一个求解器成功且至少一个失败,则任务被保留。这种 “不一致性” 确保任务难度处于多个求解器能力的差异区间,避免全过或全败的极端情形。
-
对比求解器校准(Contrastive Solver Calibration):指定一个更强的求解器(DeepSeek‑V4‑Pro)和一个更弱的求解器(DeepSeek‑V4‑Flash)。保留条件是强求解器通过且弱求解器失败()。该准则精确定义了一个以两个固定求解器为边界的 “能力区间”,任务必须位于其中。论文观察到一个关键现象:进入对比校准时,尽管所有任务都已通过自解,但仅有 19% 在首次探测时就满足该关系;经过多轮反馈修订和重新探测后,最终累计接受率达到 96%(见图 8)。这充分说明求解器反馈的修订作用远大于单纯筛选。
校准完成后,所有保留任务被统一蒸馏为训练轨迹(使用 DeepSeek‑V4‑Pro 以高推理努力模式产生),轨迹经过过滤后用于全参数监督微调。
创新点和贡献
CalibForge 的主要贡献可以概括为以下三点:
-
提出环境级行为校准原则:将任务的可学性定义为求解器相关的,而非任务本身的绝对属性。传统合成方法只检查 “作者是否能解”,CalibForge 则要求任务在指定求解器设定的边界内表现出合适的难度间隙,这直接对齐了训练数据的有用性。
-
设计对抗式求解器校准系统:引入 “作者–求解器” 多轮对抗循环,将求解器的通过/失败信号与完整交互轨迹转化为任务修订的依据。与单纯使用单个求解器反馈或仅执行一次验证相比,多求解器不一致性(+6.74 个百分点)和对比强弱关系(+8.62 个百分点)均带来显著更高的下游性能(表 3),说明行为校准策略本身在提供更有效的监督方面起决定性作用。
-
构建大规模校准任务集并验证迁移能力:生成的 5,431 个任务在领域和标签多样性上超过了多个现有开源数据集(图 4、图 5)。以此训练的模型不仅在 Terminal‑Bench 2.0 上取得最佳成绩,还在两个典型的软件工程基准——SWE‑bench Pro(解决长期软件问题)和 Doc2Repo(从自然语言规范生成完整代码仓库)上获得大幅提升。例如,CalibForge‑35B‑A3B 在 Doc2Repo 的通过率达到 48.77%(表 1),显示出训练的终端能力可以泛化到不同形式的软件工程任务。
实验结果分析
论文通过系统的实验支撑了上述主张。
-
主结果对比(表 1):在相同的蒸馏协议和训练配置下,CalibForge 任务集训练的模型在 Terminal‑Bench 2.0 上明显优于 Endless Terminals、CLI‑Gym、SETA‑Env、TermiGen 和 TerminalTraj 等基线数据。以 35B 模型为例,CalibForge 达到 47.57%,而次好的 TerminalTraj 仅为 40.82%,差距 6.75 个百分点。同时,在 SWE‑bench Pro 和 Doc2Repo 上的迁移改进也进一步证实了任务的有效性。
-
校准策略消融(表 3):将相同数量(1,300 个)的任务按 “无求解器”“单求解器”“多求解器”“对比求解器” 四种方式进行构建并训练。无求解器仅靠自解和结构验证,得到 22.47% 的准确率;单求解器的反馈仅提升至 24.34%;而多求解器和对比求解器分别提升至 29.21% 和 31.09%,表明跨模型的不一致性和指定的强弱关系比单个求解器的通过/失败信号携带更丰富的学习价值。
-
任务多样性与行为特征:图 4 显示 CalibForge 的任务在软件工程、系统管理、科学计算等多个类别分布较为均匀,不像先前数据集那样集中于某一两个领域。图 5 的能力标签呈长尾分布,3,885 个独特标签中超过半数只出现一次,说明任务集中包含大量专一化的能力要求。图 7 则显示虽然 CalibForge 轨迹的平均交互步数略低于 CLI‑Gym,但其教师思考 token 数量中位数更高,暗示任务更强调推理深度。
实践建议
CalibForge 提供了一套可操作的终端任务构建策略,对训练高效的代码或 Shell 智能体具有直接指导意义:
-
将求解器差分信号纳入数据构造:不要仅依赖 “是否能解” 的二元判断。在生成训练任务时,应当用至少两个不同能力的模型(或同一模型的不同规模/温度配置)进行探测,并保留那些产生分化结果(有的成功、有的失败)的样本。这种方法能有效滤除对当前训练目标模型而言过易或过难的任务。
-
利用完整轨迹而不仅是结果:在反馈循环中,不仅要看通过/失败,还要提取求解器的自我评估、失败诊断和具体操作轨迹。这些信息能帮助任务设计者(或自动化流程)定位问题根源,例如指令是否过于明确、验证器是否过于僵化、环境是否存在隐蔽状态污染等。附录中的案例展示了通过轨迹修正任务描述或验证逻辑的关键作用。
-
平衡修订深度与计算成本:论文图 9 显示多数校准在少量探测轮次内完成,但长尾部分需要更多轮次。在实践中可根据预算设定合理的最大轮次(例如 5‑10 轮),优先覆盖可快速修正的样本;对于极难校准的候选,可考虑丢弃或降级为简单模版任务。
-
关注领域和能力的多样性:CalibForge 合成的任务不仅在领域上分布广泛,而且每个任务标签呈现长尾分布,这为模型提供丰富的技能覆盖。在实际构建训练集时,应明确追求领域与技能的多维多样性,避免仅堆砌某一类任务的数量。
-
跨基准迁移的启示:CalibForge 任务在 SWE‑bench Pro 和 Doc2Repo 上的提升表明,高质量终端任务训练出的过程性推理和状态管理能力可以迁移到类似的软件工程场景。因此,即便目标应用是代码仓库维护或长周期问题求解,通过终端任务进行校准训练也可能是一种低成本且有效的预训练或微调策略。