CodeRescue:面向编码代理的预算校准恢复路由
论文信息
标题: CodeRescue: Budget-Calibrated Recovery Routing for Coding Agents
作者: Qijia He, Jiayi Cheng, Chenqian Le, et al.
发布日期: 2026-07-21
arXiv ID: 2607.19338v1
PDF 链接: 下载 PDF
论文背景与研究动机
近年来,大语言模型(LLM)在代码生成领域的应用已从单一问题的零样本预测,演变为能够阅读仓库、编辑文件、执行命令并基于反馈迭代的智能代理。在 SWE-bench、OpenHands 等可执行环境中,代码生成失败不再只是一个错误答案,而是附带了丰富的执行反馈,如编译器错误、测试失败输出、超时信息等。这一转变为推理阶段的决策带来了新问题:当一次廉价模型的尝试失败后,我们应该如何选择下一步行动?
现有的成本敏感路由方法大多采用级联策略:先用一个轻量模型生成结果,在不确定或失败时调用更强大的模型。这类方法隐含地假设失败意味着需要更强的模型能力,因此往往直接放弃廉价模型,转而调用昂贵的大模型。但在编码环境中,执行反馈本身具有诊断价值:一个编译错误可能只需要简单的局部修复,而无需丢弃整个生成结果或动用强大的模型。此外,测试时计算缩放的研究也表明,让同一模型多尝试几次、更换生成计划,有时比直接切换到更大模型更具成本效益。因此,合理的选择不仅是在 “用哪个模型” 之间切换,更在于 “采取哪种恢复动作”——是利用反馈进行修订、重新规划,还是升级至强大模型。
论文《CodeRescue: Budget-Calibrated Recovery Routing for Coding Agents》正聚焦于这一问题。作者观察到,不同失败实例的最佳恢复动作并不单调:有些问题只需廉价修复(reflect)或重新规划(replan)即可解决,有些则必须升级(escalate),而另一部分两者皆可。这种异质性使得固定策略(如总是升级)效率低下。更重要的是,实际部署中存在预算约束,不同用户和场景对成本与质量的需求各异,而重训路由器以适配每个预算是不现实的。因此,论文提出一种预算可控的恢复路由框架:训练一个监督路由器,并根据给定预算通过保形风险控制(CRC)在部署时动态校准路由策略,从而在无需重训的情况下获得一系列成本-质量前沿点。
核心方法:从恢复路由到预算校准
问题建模与路由器训练
论文将失败后的恢复决策形式化为一个分类路由问题。对于每个失败的初始尝试,路由器接收一个恢复上下文 ,包括问题描述 、执行判据 (如错误答案、超时)以及标准错误输出 。动作集 分别表示:利用反馈进行局部修复、重新规划后用同一廉价模型重新生成、调用强模型求解。每个动作伴随一个已知的部署成本 ,来自模型 API 调用的输入输出 token 费用。
路由器的训练数据通过离线收集的 rollout 构建:对每个失败样本,执行全部三种动作并记录成功动作集 。监督标签 取其中成本最低的成功动作,忽略所有动作均无效的样本。这一标签策略允许路由器学习选择最经济的有效恢复路径,而非传统分类中的单一正确动作。评估时采用解速率(solve rate)而非分类准确率,因为多个动作可能同时有效。
路由器本身是一个经过监督微调的语言模型(如 Qwen3.5-4B),输入为上述恢复上下文,输出为三个动作的 log-probability 经过 softmax 归一化后的概率 。默认的未约束路由器取 。
成本正则化与预算可控性
为从单个训练好的路由器衍生出多个预算下的操作点,论文引入一个标量成本惩罚 ,定义能量正则化策略:
当 时退化为原始 argmax 路由器; 增大时策略倾向于更廉价的动作。由于成本 关于 单调非增(引理 1),但解速率未必单调,因此在不同的惩罚值下会形成离散的成本-质量前沿。
关键突破在于, 的调整无需重新训练路由器。通过在校准集上计算所有可能的断点(即动作切换的 阈值),得到一个有限网格 ,并存储每个 对应的经验平均成本 。部署时,给定用户预算 ,只需从该网格中选择满足保形预算约束的最小惩罚值:
这里 是可能的最大动作成本,用于保证有限样本下的边际期望成本控制。
保形风险控制保证
论文基于 Conformal Risk Control (CRC) 理论,证明在上述选择下,对于交换的校准样本和未来测试点,所选策略的期望恢复成本满足 (定理 2)。该保证是关于成本的边界期望,而非解速率,也就是说它确保路由器在平均意义上不会超预算,但解速率的变化依然是经验性的。这种设计使得成本控制具有形式化保障,同时允许解速率曲线非单调——正如实验中观察到的,在某些难题子集上,过度升级反而会降低解速率。
主要创新与贡献
论文的贡献可归结为三点:
-
失败后恢复路由的正式建模。首次将编码代理的失败后决策看作一个多动作路由问题,超越了传统的 “弱模型失败即升级” 的二元级联范式,利用执行反馈来挖掘廉价模型的剩余价值。
-
预算可控的部署机制。通过在训练好的路由器之上叠加 CRC 校准层,实现无需重训的预算控制,且拥有边际期望成本保证。这种方法将经济约束从训练阶段解耦,大幅提升了路由器的部署灵活性。
-
补充性恢复模式的实证证据。在涵盖五个编码基准的留出测试中,展示了廉价修复与升级之间的互补性,证明学习型恢复路由器能比固定策略或零样本提示路由器更有效地在成本和求解率之间取得平衡。
实验分析与关键发现
实验使用 GPT-5.4-nano(廉价模型)和 GPT-5.4(强模型)作为动作执行引擎,在 APPS、TACO、BigCodeBench、LiveCodeBench 和 CodeContests 五个基准上收集了数千条失败恢复轨迹。路由器由 Qwen3.5-4B 微调得到,校准集和测试集各 360 例。
恢复动作的异质性:在全部留出失败样本中,仅 28% 可通过廉价恢复解决,45% 只能由升级解决,还有 27% 两者均可。这种分布随基准变化明显,例如 BigCodeBench 中廉价恢复占比更高,而 TACO 的困难子集更多依赖升级。这是固定策略难以统一的根本原因。
路由器质量对比(表 1):未约束路由器取得 81.7% 解速率,平均成本 5.51 毫美元(m)或 “总是重新规划”(45.3%,1.59 m$)。零样本提示的 LLM 路由器(如 Claude、GPT 等)的解速率均不超过 45%,且自身推理成本不容忽视,说明从 rollout 中学习的必要性。
预算可控前沿(图 3):CRC 校准得到的操作点构成一条离散的成本-解速率曲线。在约 2.56 m$ 的低预算点,解速率已达到 71.7%,超越了 “总是升级” 的 68.6%,而成本仅为其 35%。该点也明显优于同等成本下的二元级联基线(63.6%)。随着预算放松,前沿逐渐接近未约束路由器的 81.7% 解速率,但边际收益递减。论文还观察到在 TACO 的某些子集上,高预算点(更多升级)的解速率反而更低,呈现出非单调前沿,直接印证了仅靠升级并非最优的结论。
消融与跨模型验证:元数据前缀(如题源、难度标签)对路由器性能提升显著;硬标签比软标签更好;全量微调略优。用 Gemini-2.5-Flash / Gemini-2.5-Pro 复现的实验也再现了类似趋势,证明了框架的模型无关性。
实践应用与未来方向
对于构建商用编码代理(如 GitHub Copilot、Claude Code)的团队,该研究提供了可立即落地的方案:在失败后引入一个轻量路由器来选择恢复动作,并可通过预算参数灵活控制成本。由于 CRC 仅需离线校准且几乎无推理开销(仅为一次小型模型的分类),它很适合集成到现有的 agent 环路中。开发人员可根据任务关键度、账户预算或不同用户等级设置 ,在质量和成本之间动态权衡。
未来工作可向多步恢复扩展:实际代理往往需要多轮交互(如多次修复-测试循环),此时每轮都可看作一个子决策点,需设计更复杂的状态表示与长期成本控制方案。此外,当前的训练标签仅为 “最廉价成功动作”,并非概率校准,未来可探索更精细的动作价值估计,以提供更准确的置信度信息,或纳入安全约束(如拒绝不可靠的修复)。保形控制的保证仅限于成本期望,如何同时为解速率提供概率下界也是值得研究的方向。
总结与展望
《CodeRescue》通过将编码代理的失败恢复重新定义为多动作路由问题,并配以保形预算校准,开辟了一条兼顾效果与成本控制的新路径。其核心洞见在于:失败后的执行反馈是宝贵的诊断信号,不应简单视为升级的理由;而异质恢复动作的存在要求路由器智能分配廉价计算与昂贵升级。实验清晰展示了该方法能够用显著更低的成本达到甚至超越 “始终升级” 的解速率,同时提供了部署期的成本可调性。
随着编码代理系统不断走向复杂和长程交互,类似的分层决策与资源管理思想将愈发关键。将预算控制、反馈利用和多步规划融合,有望使未来的人工智能助手在更加宽广的任务空间中实现可靠且经济的自主操作。