面向 Web 智能体的判别式世界模型

Discriminative World Models for Web Agents

arXiv: 2609.02885v1

论文信息

标题: Discriminative World Models for Web Agents

作者: Kelvin Li, Dhruv Pendharkar, Anish Pahilajani, et al.

发布日期: 2026-09-02

arXiv ID: 2609.02885v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:现有网页智能体的世界模型用 “监督式下一状态预测” 生成固定格式页面表示,但该目标与下游动作排序器所需的 “判别性” 不一致;论文要解决如何训练出更适合动作选择的世界模型。
  • 核心方法:提出 “预测状态匹配”(predicted-state matching),不要求生成固定目标,而是让预测表示能够把同一决策点下不同动作导致的真实结果区分开。
  • 关键结果:在预测状态匹配基准上,本文模型整体准确率为 80.80%,高于 WebDreamer-7B 的 74.51% 和 WebWorld-8B 的 70.17%(表 1)。
  • 主要局限:评估主要限于 WebArena 环境和 GPT-4o 策略模型;匹配判断依赖语言模型,且分支数据没有穷举所有可能动作(论文第 6 节)。
  • 适合读者:从事网页智能体、世界模型、过程奖励模型、基于模型的规划,或对判别式表示学习感兴趣的工程师和研究人员。

论文背景和研究动机

近几年,大语言模型驱动的网页智能体通常采用 “反应式下一步动作预测”:给定任务指令、历史交互和当前网页状态,直接选择下一个动作。这种方法简单,但不会显式比较同一状态下多个候选动作的后果。为此,一些工作引入测试期动作选择:先提出多个候选动作,再用过程奖励模型(PRM)或排序器打分;基于模型的规划则进一步预测每个动作的下一状态,帮助评估候选路径。

已有世界模型普遍采用监督式下一状态预测,目标是生成固定格式,如文本摘要、HTML 或 AXTree 快照。论文认为,这种目标与后续动作排序需求不一致。如图 1 所示,文本摘要可能遗漏区分动作后果的关键变化;完整 AXTree 表示又可能被大量未变化的页面结构淹没。因此,预测状态的目标不应只是 “重建某个格式的目标”,而应是 “让同一状态下、不同动作的后果能够被区分”。

这一观察构成了论文的核心动机:世界模型应当学习判别性的下一状态表示,而不是追求固定目标格式的保真度。

核心方法和技术细节

论文构建了分支型网页智能体数据。原始 Go-Browse 轨迹是线性的,但不同轨迹可能重复到达相同浏览器状态。论文将这些重复状态合并成状态-动作图:节点是浏览器状态,边是已执行动作及其下一状态。这样,同一状态有多个出边时,就形成分支决策点。最终得到 7,730 个分支决策点,来自 2,839 条轨迹,并生成 30,920 个成对匹配样本(论文第 3.1 节、附录 C.2)。

在训练目标上,给定当前状态 sts_t、历史 hth_t、任务指令 II 和查询动作 atqrya_t^{qry},世界模型生成文本表示 z^t+1qry∼πθ(⋅∣I,ht,st,atqry)\hat{z}_{t+1}^{qry} \sim \pi_\theta(\cdot \mid I,h_t,s_t,a_t^{qry})。这里用 z^\hat{z} 而非 s^\hat{s},强调输出是对下一状态的表示,不是环境状态本身。

判别性通过匹配判断实现。固定裁判 JJ 收到预测表示、真实下一状态 st+1qrys_{t+1}^{qry} 和一个替代下一状态 st+1alts_{t+1}^{alt},候选顺序随机化,裁判必须选出与预测表示匹配的状态。关键点是裁判不接收指令、历史、当前状态或查询动作,因此预测表示自身必须包含足够信息。匹配奖励为:

Rmatch=1[J(z^t+1qry,st+1qry,st+1alt)=st+1qry]R_{match}=\mathbf{1}\left[J(\hat{z}_{t+1}^{qry},s_{t+1}^{qry},s_{t+1}^{alt})=s_{t+1}^{qry}\right]

同时引入格式奖励 RfmtR_{fmt},当输出为非空且符合 <predicted_state> 标签格式时为 1,否则为 0。总奖励为 R=Rmatch+λfmtRfmtR=R_{match}+\lambda_{fmt}R_{fmt},主实验取 λfmt=0.4\lambda_{fmt}=0.4。训练使用 GRPO,每个输入采样 8 个完成结果,KL 正则化系数 0.04,基础模型为 Qwen3-8B,训练约 390 GPU-hours(论文第 3.2 节、附录 C.1、C.2)。

下游使用时,世界模型为每个候选动作生成 z^t+1i\hat{z}_{t+1}^{i},随后 PRM 或排序器在动作对和对应预测表示上输出偏好:

y^∼rϕ(⋅∣I,ht,st,(at1,z^t+11),(at2,z^t+12))\hat{y} \sim r_\phi(\cdot \mid I,h_t,s_t,(a_t^1,\hat{z}_{t+1}^1),(a_t^2,\hat{z}_{t+1}^2))

无状态设置则省略 z^\hat{z} 项。这样可以直接比较 “仅动作”“动作 + WebWorld-8B 状态”“动作 + 本文状态匹配表示” 三种条件。

创新点和贡献

论文的第一个贡献是提出表示无关的训练目标。不同于固定目标格式的监督学习,预测状态匹配只要求表示能在同一决策点区分不同动作结果。这个目标不绑定 HTML、AXTree 或摘要格式,模型可以自适应地调整细节和抽象程度。

第二个贡献是构建了分支型数据集。传统线性轨迹只记录单一黄金路径,无法提供 “如果选了另一个动作会怎样” 的监督。论文通过合并重复状态,从已有 Go-Browse 数据中提取局部决策点,为判别式世界模型提供训练和评估基础。

第三个贡献是三层评估体系。论文不仅评估表示级匹配准确率,还评估下游 PRM 动作排序效果,以及 WebArena-Lite 端到端任务成功率。这种从表示到排序、再到实际任务的链路评估,比单独报告生成质量更有说服力。

在数据规模和计算成本方面,论文也体现了一个有价值的现象:本文模型仅使用 30,920 个成对样本,显著少于 WebDreamer-7B 的 310 万余合成的网页交互和 WebWorld-8B 的 106 万轨迹,但匹配准确率更高。作者推测,这显示训练目标与动作结果判别性对齐,可能比单纯扩大监督式下一状态预测规模更重要(附录 C.2)。

实验结果分析

在预测状态匹配基准上,本文模型达到 80.80% 整体准确率,高于 Qwen3-8B 的 62.86%、WebDreamer-7B 的 74.51% 和 WebWorld-8B 的 70.17%(表 1)。更重要的是,数据匹配的监督微调基线仅 47.77%。该基线与本文模型都从 Qwen3-8B 训练,并且使用同一份分支数据,唯一区别是目标函数:基线生成固定 AXTree 目标,本文使用预测状态匹配。因此,这一差距基本隔离了训练目标的影响,而不是模型、数据或基础能力差异。

在裁判鲁棒性上,论文用 Qwen3-32B、GPT-4o 和 Llama-3.1-70B-Instruct 评估,本文模型分别为 80.80%、81.26% 和 79.31%,均高于 WebDreamer-7B 与 WebWorld-8B(表 2)。这降低了对单一裁判过拟合的担忧。

在 WebPRMBench 训练奖励模型对比中,最后的控制对比条件都用 Qwen2.5-7B 和相同的 answer-only 偏好训练设置,只改变下一状态信息来源。结果显示,BoN 平均准确率从 Direct 的 55.80% 提升到 +WebWorld-8B states 的 67.63%,再提升到 +state-matching states 的 72.70%;Pairwise 平均准确率也有 82.02% → 85.48% → 89.36% 的改善(表 3)。在冻结排序器设置下同样如此:Qwen2.5-7B 的 BoN 平均准确率从 42.78% 提升到 51.53%(+WebWorld-8B states)和 54.65%(+本文状态,表 4)。这表明预测状态信息本身对动作排序有用,且本文表示明显优于监督式下一状态预测表示。

端到端实验中,ReAct-style 成功率为 13.94%,Best-of-5 提升到 21.82%,加入本文世界模型的状态匹配后进一步提升到 28.48%(论文第 4.4 节)。需要说明,这是在同一评估框架下的对照结果,而不是与所有外部报告直接比较。

总体来看,论文的实验结论是有限的:在 WebArena 相关基准和 GPT-4o 策略下,判别式世界模型表示比监督式下一状态预测更有利于动作区分和排序。其跨环境、跨策略的泛化性仍未被验证。

实践建议

对于正在构建网页智能体或世界模型系统的团队,本文提供了几个可操作的思路:

第一,如果世界模型的下游用途是动作排序,不应只优化 “重建下一状态” 的目标。可以考虑将训练目标改为让预测表示在同一状态下区分不同动作的后果,尤其是候选动作多、页面结构高度重复的场景,例如后台管理界面、电商列表或仪表盘。

第二,分支数据可以通过复用已有轨迹构建。论文展示了从重复状态中合并出分支决策点的做法,不必为每个决策点单独采集所有动作的结果。这比从零构造分支数据成本更低,适合已有大规模线性轨迹的团队。

第三,在使用判别式匹配训练时,裁判模型的选择会影响训练信号。论文用多个裁判模型做鲁棒性检查(表 2)。建议部署前至少用训练时未见过的裁判或规则做一轮验证,避免学习到仅对单一裁判有效的表示。

第四,本文生成的表示平均约 91.6 tokens,明显短于 WebWorld-8B 的 412.7 tokens,而且下游排序效果更好(附录 B)。如果系统需要批量调用世界模型和排序器,这种较短表示有助于降低推理延迟和成本。

最后要谨慎对待环境迁移:当前结果来自 WebArena 环境和 GPT-4o 策略,部署到真实网站、真实用户账户或不同策略模型时,仍需先用小规模在目标环境中验证 “状态匹配 → 排序提升 → 端到端成功率提升” 的链路是否成立。