面向网络智能体的智能体测试时扩展

Agentic Test-Time Scaling for WebAgents

arXiv: 2602.12276v1

论文信息

标题: Agentic Test-Time Scaling for WebAgents

作者: Nicholas Lee, Lutfi Eren Erdogan, Chris Joseph John, et al.

发布日期: 2026-02-12

arXiv ID: 2602.12276v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:多步 Web Agent 的测试时计算缩放(test‑time scaling)会出现按步均匀增加采样带来的收益递减,并且仲裁模型(arbiter)可能在高共识步骤上错误覆盖多数投票,造成整体性能下降。
  • 核心方法:提出 CATTS(Confidence‑Aware Test‑Time Scaling),利用每步候选动作的投票分布计算出熵或 top‑1/top‑2 概率差,仅在不确定性高时才调用仲裁器,否则采用多数投票,从而动态分配计算资源。
  • 关键结果:在 WebArena‑Lite 上,CATTS 最佳配置成功率达到 47.9%,比基础 React 高出 9.1%;同时消耗的 token 数量比均匀缩放方案减少约 2.3 倍(见摘要与前 4.3 节表 4)。
  • 主要局限:不确定性阈值需要通过网格搜索离线确定,没有在线自适应机制;实验仅在两个基准上使用单一模型(gpt‑oss‑120b),通用性有待验证。
  • 适合读者:从事 LLM Agent、推理效率优化、web 导航任务的研究者,以及对动态计算分配和测试时计算策略感兴趣的工程师。

论文背景和研究动机

大型语言模型(LLM)正从纯文本生成走向在交互环境中执行动作,例如浏览网页、调用工具、完成多步操作。这类 agent 任务具有长时程和序贯依赖:一个错误的早期点击可能使整个轨迹坠入不可恢复的状态。为了提高可靠性,研究者广泛采用测试时计算(test‑time scaling)——在测试阶段生成更多 token 并用投票或验证从多个候选中选出更优动作。

然而,将单步推理的缩放策略直接套用到 agent 的每一步会暴露出两个严重问题。一是均匀缩放(uniform scaling)的收益递减:在简单步骤上浪费计算资源,因为多数步骤候选动作高度一致,重复采样只是产生冗余投票;二是仲裁器(arbiter)的风险:当投票分布已经形成强共识时,引入额外的 LLM 仲裁反而可能覆盖正确动作,尤其当仲裁模型 “过度思考” 时。论文在 WebArena‑Lite 和 GoBrowse 上的实验表明,将每步候选数从 1 增加到 20 只会使成功率从 38.8% 微升到 43.2%,最后翻倍的算力几乎无增益(表 1);而给每一步都使用仲裁器虽然平均有所改善,但在高共识步骤上却导致成功率显著下降(图 3)。这些观察推动了一个核心问题:如何根据步骤本身的特性来决定哪些地方值得投入额外计算。

核心方法和技术细节

CATTS 的设计建立在两个关键发现之上:

  1. 每步的投票分布可以自然地分为高共识(冗余)和低共识(争议)两种模态——约 42% 的步骤 top‑1 概率超过 0.9,而有约 49% 的步骤熵大于 0.6(图 6)。
  2. 仲裁器的利弊与这两种模态紧密相关:在高共识步骤上,仲裁器的不良覆盖显著降低任务成功率;而在低共识步骤上,仲裁器能够利用上下文信息比纯投票选得更好(图 4)。

基于此,CATTS 在每个时间步 tt 先采样 NN 个候选动作,再经语义去重将其聚合成簇,得到经验投票分布 pt(a)p_t(a)。由此计算两个不确定性统计量:

  • 熵 Ht=−∑apt(a)log⁡pt(a)H_t = -\sum_a p_t(a)\log p_t(a),
  • 概率差 Δt=pt(a(1))−pt(a(2))\Delta_t = p_t(a^{(1)}) - p_t(a^{(2)}),即第一名与第二名簇的频率差。

CATTS 设置一个阈值 τ\tau,当不确定性测度 UtU_t(可以是 HtH_t 或 1−Δt1-\Delta_t)低于 τ\tau 时,认为当前步骤置信度高,直接采用多数投票的结果;若 Ut>τU_t > \tau,则调用 Arbiter,它接收当前页面状态和去重后的候选列表,推理后选出最终动作。实际部署中,对每个任务使用网格搜索选定 τ\tau(例如在 WebArena‑Lite 上熵门控最佳阈值为 0.2)。整个流程相当于仅把额外的计算花费在 “有争议” 的决策点上,而保持其他步骤的计算开销不变。

作者还比较了其他变体,如 DeepConf 风格的置信度过滤(需要 token 级 log 概率)以及递归自聚合(RSA),但前者需要模型内部概率访问,后者虽然在单步推理中有效,在 agent 动作选择中却因算力开销过大而未能超越简单仲裁。

创新点和贡献

  1. 首次系统性刻画了 agent 任务中测试时计算的两种分布模态,并证明均匀缩放会导致昂贵且无效的计算。
  2. 提出用投票分布的自发不确定性作为计算分配的信号,使决策过程无需依赖模型内部的 token 级置信度,对任何支持采样的模型均适用。
  3. 引入 CATTS 动态门控策略,在保持、甚至提升成功率的同时大幅降低 token 消耗:边际门控的 CATTS 在 WebArena‑Lite 上只用 405K token 就达到 47.9% 成功率,相比均匀缩放方案节省了 56% 的 token(表 4)。这为实际部署中的成本和延迟控制提供了直接指导。
  4. 揭示了仲裁器的双面性:通过系统性实验量化了仲裁器在高共识步骤上的危害,发现每多一次覆盖会使任务成功率下降约 11%(图 3),并以此为依据设计了 “只干预争议步骤” 的规则。

实验结果分析

在 WebArena‑Lite 和 GoBrowse 两个基准上,CATTS 均体现出明显的 Pareto 优化效果(图 5)。

  • 准确率‑计算前沿:CATTS 在所有配置中均位于均匀投票和总是仲裁的上方或同水平,但 token 使用量显著更低。例如,在 WebArena‑Lite 上,熵门控 CATTS 以 745K token 达到 47.9%,而等量的静态多数投票(N=10,920K token)仅有 43.2%。
  • 仲裁器调用率:熵门控下仲裁器只在约 40–60% 的步骤上被触发,证明不确定性信号确实能识别出需要 “深度选择” 的步骤。
  • 普适性:在 GoBrowse 这种更简单的基准上,边际门控 CATTS 也以 372K token 获得 90.4% 的成功率,比多数投票的 88.0%(481K token)更高,展示了方法的跨任务鲁棒性。
  • DeepConf 对比:虽然 DeepConf 也能提供类似提升,但它必须访问 token 级概率,限制了其在闭源 API 上的应用;CATTS 仅用抽样投票分布即可达到甚至超越其效果,实用性更强。

实践建议

  1. 避免粗暴地按步缩放:在构建 long‑horizon agent 时,应识别 “争议” 步骤。可以直接利用投票分布的熵或 top‑2 差来量化每步的不确定性,而不是在每一步都浪费算力。
  2. 仲裁器作为最后手段:当投票已经高度一致(如 Δt>0.7\Delta_t > 0.7)时,直接用多数投票,不要调用 LLM 仲裁器,否则可能引入覆盖风险。将仲裁器限定在熵高或差距小的步骤,可在不牺牲成功率的前提下大幅降低推理成本。
  3. 选择简单且可解释的信号:投票分布的统计量(熵、 margin)计算开销极低,且能实时在线获得,不需要额外的模型调用,适合生产环境。对于无法获取内部概率的 API 模型,该方法是目前最切实可行的动态缩放手段。
  4. 调整阈值以适应任务难度和预算:可以预先在一小批典型任务上进行网格搜索确定 τ\tau。从实验结果看,阈值在 0.2–0.7 的宽范围内都能带来稳定收益(附录 H),表明方法对阈值选择并不极端敏感,便于工程师快速部署。
  5. 关注语义去重:在实现动态投票时必须对候选动作进行语义去重(如论文使用的轻量级去重 LLM),否则语义等价但文本形式不同的动作会稀释投票信号,导致性能下降(附录 D)。这一预处理步骤是可靠缩放的基础。

通过以上设计,开发者可以在有限的 token 预算下构建更稳健的 web agent,同时将推理延迟控制在可接受范围。