DynaWeb:基于模型的网络智能体强化学习

DynaWeb: Model-Based Reinforcement Learning of Web Agents

arXiv: 2601.22149v1

论文信息

标题: DynaWeb: Model-Based Reinforcement Learning of Web Agents

作者: Hang Ding, Peidong Liu, Junqiao Wang, et al.

发布日期: 2026-01-29

arXiv ID: 2601.22149v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:训练自主网页智能体时,强化学习需要大量在线交互,但真实网页环境成本高、风险大(意外下单、页面不确定、反爬等),严重限制可扩展性。
  • 核心方法:提出 DynaWeb 框架,先训练一个能预测网页状态变化的世界模型,再用它作为合成环境,让智能体通过 “想象” 生成轨迹进行模型基强化学习,同时混入少量真实专家轨迹来稳定训练。
  • 关键结果:在 WebArena 基准上,DynaWeb 将平均成功率从 26.7% 提升至 31.0%,相对提高 16.1%;在 WebVoyager 上也取得了最高平均成功率(38.7%)。
  • 主要局限:对需要长程规划、页面高度动态的网站(如 ArXiv、GitHub)仍不及部分基线;世界模型在多步模拟中会积累误差,目前只在较短梦想序列(4‑5 步)上效果最好。
  • 适合读者:从事大语言模型智能体、强化学习、网页自动化,或对世界模型和想象驱动训练有兴趣的研究人员与工程师。

论文背景和研究动机

近年来,大语言模型(LLM)使自主网页智能体成为可能,它们能理解自然语言指令,在多步交互中完成购物、信息检索等任务。然而,仅仅靠监督微调(SFT)或提示工程,智能体在复杂、长时程任务上的鲁棒性和探索能力仍显不足,在线强化学习(RL)因此成为提升性能的重要方向。代表性工作如 WebAgent‑R1、WebRL 等已展示了在线 RL 对网页智能体的显著增益。

但真实网页环境的在线交互代价高昂且充满风险:智能体可能触发不可逆操作(如误下单、修改账户设置),页面动态变化、反爬机制和网络波动也让大规模训练变得不稳定且难以复现。因此,能否在保留在线 RL 优势的同时,大幅减少对真实交互的依赖,成为该领域的核心矛盾。

受经典模型基强化学习(MBRL)的 Dyna 架构和 Dreamer 的启发,本文提出 DynaWeb:训练一个网页世界模型作为合成环境,让智能体在模型生成的 “想象轨迹” 上进行策略优化,从而用极低成本实现可扩展的在线 RL。不同于此前仅将世界模型用于推理时短期前瞻或离线数据扩充的工作,DynaWeb 首次把想象 rollout 直接作为第一类的在线策略优化经验,真正实现了网页智能体的 “在梦中学习”。

核心方法和技术细节

世界模型:从动作到页面变化

DynaWeb 的核心是一个基于大语言模型的世界模型 pϕp_\phi。给定当前的可访问性树(accessibility tree)观测 oto_t 和智能体动作 ata_t,它需要预测下一步的观测 ot+1o_{t+1}。直接生成整棵新树不仅输出长度大,而且大部分内容与上一步相同,会导致训练信号稀疏。

为此,作者将任务分解为两步:先预测由动作引起的状态变化描述 Δ(ot,ot+1)\Delta(o_t, o_{t+1}),再基于该变化和 oto_t 产出 ot+1o_{t+1}。训练时只让世界模型学习第一个推理子任务:输入 (I,ot,at)(I, o_t, a_t),输出变更描述和相应的推理链 rr,损失函数为

Lϕ=∑−log⁡pϕ(r,Δ∣I,ot,at)\mathcal{L}_\phi = \sum -\log p_\phi(r, \Delta \mid I, o_t, a_t)

世界模型选用 GPT‑oss‑120b,在 NNetNav 数据集的真实交互轨迹上微调,并使用 GPT‑oss‑120b 自动标注每条状态转移的变更描述。推理时,世界模型依变更描述更新可访问性树,充当可控制的合成网页服务器。

想象驱动的在线强化学习

DynaWeb 将世界模型作为合成环境,智能体策略 πθ\pi_\theta(初始化为 NNetNav 的 SFT 模型)与其交互生成想象轨迹:

τ^=(o^1,h1,a1,…,o^T,hT,aT)\hat{\tau} = (\hat{o}_1, h_1, a_1, \dots, \hat{o}_T, h_T, a_T)

其中 o^t+1∼pϕ(⋅∣o^t,at,q)\hat{o}_{t+1} \sim p_\phi(\cdot \mid \hat{o}_t, a_t, q)。每一轨迹结束后,用一个基于模型的自我评估模块给出二元任务完成奖励 r(τ^,q)r(\hat{\tau}, q)。这些想象轨迹无需访问真实网页,可直接用于策略梯度优化。

为了稳定训练并纠正世界模型的固有偏差,DynaWeb 在每次训练批次中随机混入 50% 的真实专家轨迹(从 NNetNav 的 SFT 数据中采样)。这种简单的交织策略既保留了在线策略的学习信号,又通过高质量的锚定数据抑制了世界模型误差的恶性传播。

策略优化采用 GSPO(组序列策略优化),它是一种序列级的重要性采样方法。对于一组 rollout,GSPO 为整条轨迹计算一个几何平均的序列比率 si(θ)s^i(\theta),并在其基础上进行截断优化:

JGSPO(θ)=E[1G∑i=1Gmin⁡(si(θ)A^i,clip⁡(si(θ),1−ε,1+ε)A^i)]\mathcal{J}_{\text{GSPO}}(\theta) = \mathbb{E} \left[ \frac{1}{G} \sum_{i=1}^G \min\left( s^i(\theta) \hat{A}^i, \operatorname{clip}(s^i(\theta), 1-\varepsilon, 1+\varepsilon) \hat{A}^i \right) \right]

这避免了长文本中逐 token 比率带来的高方差,适合稀疏奖励的多步网页任务。

训练时,想象轨迹的最大长度限制为 5 步,初始状态从 SFT 数据的各个阶段随机采样,以保证世界模型覆盖任务的多个阶段。

创新点和贡献

  1. 首次将 MBRL 范式完整迁移到 LLM 网页智能体训练,世界模型不再是推理时的辅助工具,而是在线策略优化的核心环境,开启了网页智能体 “想象式” 学习的新路径。
  2. 设计并验证了混合真实专家轨迹的训练机制,证明仅需约 40% 的真实数据即可显著超越纯 SFT 基线,有效平衡了仿真效率与真实经验的需求。
  3. 系统分析了影响想象训练的关键因素,包括梦想长度(图 3a)、真实数据比例(图 3b)以及世界模型是否必须经过专门训练(图 4),为后续研究提供了实用的设计准则。
  4. 在广泛基准上取得一致且显著的提升,WebArena 平均成功率 31.0%,相对离线 RL 提升了 16.1%;WebVoyager 平均成功率 38.7%,且优势在多数网站上都得到复现,表明方法具有跨场景的泛化性。

实验结果分析

主实验

在 WebArena 自托管的五个网站(Reddit, GitLab, Maps, CMS, Shopping)上,DynaWeb 均取得或并列第一的平均成功率,远超 SFT 基线 NNetNav(15.8%)和离线 RL 型的 WebRL(26.7%),尤其在高交互性的 Reddit 和 GitLab 上提升最为显著(表 1)。在 WebVoyager 的 15 个真实网站中,DynaWeb 的平均成功率达 38.7%,超过了 GPT‑4o 的 31.1% 以及所有开源基线(表 2),在 Amazon、BBC News、GitHub 等大部分网站上都表现出更强的通用性。

值得注意的是,在需要极长序列规划和高度动态页面的 ArXiv 和 GitHub 上,DynaWeb 仍未超越某些强基线,这指向世界模型的长程预测准确性仍是当前瓶颈。

消融与分析

  • 梦想长度:如图 3a 所示,当平均想象步数为 4–5 步时成功率最高;过短则任务无法完成,过长则世界模型幻觉增多,性能反降。这证实了控制 rollout 深度对平衡学习深度与仿真质量的重要性。
  • 真实数据比例:仅用想象数据训练(0% 真实)的性能低于 SFT 基线;加入 40% 真实数据后效果大幅超越 SFT,继续增加比例则收益递减(图 3b)。说明少量真实经验作为 “锚点” 即可有效纠正世界模型偏差。
  • 世界模型训练的必要性:若直接用未微调的 GPT‑oss‑120b(仅通过提示)作为世界模型,下游智能体在 WebArena 上的成功率仅为 20.9%,远低于精心训练的 WM 的 31.0%(图 4),证明单纯依靠通用 LLM 的先验不足以模拟网页交互动态,专用训练不可或缺。

实践建议

对于希望复现或扩展 DynaWeb 的工程师与研究者,以下建议有助于提高训练效率和成功率:

  1. 聚焦状态变化而非全页渲染:世界模型训练时采用 “预测变更描述 + 应用变更” 两阶段设计,能显著降低建模难度,提高生成质量。可通过自动标注工具(如 GPT‑oss‑120b)高效获取变更描述数据。
  2. 将想象长度控制在合理范围:建议初始设置最大梦想步数为 5,并根据具体任务复杂度微调,避免过长的 rollout 导致误差累积。在模型初期可先用短序列训练,逐步增加。
  3. 用少量真实数据锚定学习:根据实验,40% 真实专家轨迹与 60% 想象轨迹的比例是较为高效的配比;如果真实数据成本极高,可适当降低至 20‑30%,但仍需保证有真实信号注入。
  4. 采用序列级策略优化算法:GSPO 在处理多步文本交互任务时比逐 token 方法更稳定,推荐直接使用。同时注意在 rollout 生成时关闭 KL 正则(论文中即禁用),以维持探索空间。
  5. 世界模型的选择与评估:务必进行任务特定的监督微调,而非依赖通用 LLM 的零样本能力;训练后应在验证集上评估状态变化预测的准确率,并监控下游智能体的成功率,以决定世界模型的质量和 rollout 长度的上限。