面向大语言模型智能体规划的自演化世界模型
Self-Evolving World Models for LLM Agent Planning
论文信息
标题: Self-Evolving World Models for LLM Agent Planning
作者: Xuan Zhang, Wenxuan Zhang, See-Kiong Ng, et al.
发布日期: 2026-06-29
arXiv ID: 2606.30639v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:大语言模型(LLM)智能体在进行长期任务规划时,可借助世界模型预测动作后果来提供 “前瞻”(foresight),但不准确的预测反而可能误导下游决策,而现有世界模型在部署后难以适应环境变化。
- 核心方法:提出 WorldEvolver 框架,在不更新任何模型参数的前提下,通过三种记忆机制——情节记忆(检索历史转移)、语义记忆(从预测-观测差异中提炼启发式规则)和选择性前瞻(按置信度过滤预测)——让世界模型在推理时自我演化。
- 关键结果:在 ALFWorld 和 ScienceWorld 环境中,WorldEvolver 的世界模型预测精度(Exact Match)相比基线最高提升约 50 个百分点(Gemma-4-26B-A4B 在 ScienceWorld 上从 0.41% 提升到 51.55%),并驱动下游智能体任务成功率显著提高(表 1、表 2)。
- 主要局限:目前仅评估于两个文本交互环境,未覆盖网页导航、代码等更广领域;置信度过滤依赖 token 级概率,部分闭源 API 不可用;语义记忆在极度稀疏的转移上可能难以积累有效规则。
- 适合读者:对 LLM 智能体规划、世界模型、持续学习或模型基强化学习有兴趣的研究者和工程师,尤其关注如何在不微调模型的前提下提升预测和决策性能。
论文背景和研究动机
在 LLM 智能体处理长周期任务时,许多方法依赖记忆机制重用过去的交互经验。另一条互补路线是引入世界模型——在采取行动之前,先预测动作可能引发的后续观察,这类似于基于模型的强化学习中的环境模型。最近的工作在网页导航、文本游戏等领域验证了这种 “前瞻” 的价值。然而,世界模型的可靠性并非恒定不变:部署时环境会持续变化,引入分布偏移(类比机器人领域的 sim-to-real 缺口),冻结的世界模型会因此产生错误预测。直接通过梯度更新来吸收每一次预测错误代价高昂,还容易引发灾难性遗忘或过度编辑,不适合线上部署。
因此,需要一种能在部署期间自我演化的世界模型:它应该检测预测与现实观察之间的不匹配,并据此调整自身,但保持下游智能体和模型参数不变。这正是 WorldEvolver 的动机:用显式的语境证据代替参数更新,使后续预测能基于部署时积累的信息生成更可靠的前瞻。
核心方法和技术细节
WorldEvolver 将任务建模为部分可观察的交互过程 。在时刻 ,智能体只能访问文本交互状态 ,由历史观测和动作构成。一个冻结的世界模型 根据当前状态和候选动作预测下一时刻的观测 。WorldEvolver 的工作正是在不改变 和智能体策略的前提下,通过修正外部记忆内容来提升 的可靠性。
框架由三个互补模块组成:
-
情节记忆(Episodic Memory):存储已执行的真实转移 。当智能体提出一个候选动作 时,通过 Jaccard 相似度检索出与该动作最相似的前 个历史转移,以文本形式注入世界模型的上下文。这一步利用具体案例为预测提供类比依据,本质上是一种基于检索的推导(exploitation)。
-
语义记忆(Semantic Memory):从预测与真实观察的差异中提取持久的启发式规则。预测和观察首先被映射为因子化的三元组(如
(fridge 1, is, open))。如果两组三元组不一致(),LLM 评论家会生成一条候选文本规则 ,标记为 “应保持不变” 的约束(例如 “检查物体不会移动它”)。每条规则附带一个证据分数 ,每次在新转移上被验证或违反时,分数会更新。只有 的规则才会被加入上下文,形成一种从失败中提炼知识的探索(exploration)分支。规则可按最小批次()聚合后批量更新。 -
选择性前瞻(Selective Foresight):即使记忆改善了预测质量,不可靠的前瞻仍可能误导智能体。该模块计算生成预测的平均 token 对数概率 ,并转换为归一化置信度 。只有当 超过阈值 时,预测 才会呈递给下游策略;否则不提供前瞻。这相当于一种基于置信度的弃权机制。
算法流程体现闭环规划:智能体先采样一个草案动作 ,世界模型结合记忆生成预测和置信度。选择性前瞻决定是否将预测暴露给策略;策略据此重新采样最终动作 。若最终动作不同于草案,世界模型还会针对最终动作再做一次预测,确保语义记忆从与实际执行动作对应的不匹配中学习。随后执行动作,将真实转移追加到情节记忆,并根据因子化比较结果更新语义记忆。整个过程无需任何梯度更新,所有记忆都在部署过程中增量累积(图 3,算法 1)。
创新点和贡献
这篇论文的主要贡献在于提出了 首个训练自由、自演化的世界模型框架,使 LLM 智能体的世界模型能在交互中自我改进,而无需更新任何模型权重。具体创新体现在:
- 记忆驱动的自演化范式:将情节记忆和语义记忆的经典心理学区分引入世界模型,前者用于回放具体经验,后者用于从失败中抽象通用规则。两者协同,既利用过往成功的转移,又从识别 “什么不该变” 的角度纠正世界模型的系统性偏见。
- 无需参数的适应性:所有适应都通过修改世界模型的提示上下文完成,避免了 LLM 规模下的参数更新开销和灾难性遗忘风险。这对线上部署特别友好,尤其在使用昂贵的大模型时。
- 选择性前瞻作为安全阀:明确将预测置信度作为是否信任世界模型的开关,降低了低质量前瞻对智能体决策的负面影响,并可通过调整阈值灵活控制风险。
- 完整的闭环设计:算法细致处理了草案动作与最终动作不一致的情况,确保学习信号始终与真实执行动作对齐,避免了因世界模型为错误动作预测而产生的噪声更新。
实验结果分析
实验在两个维度上展开:世界模型的预测精度(Word2World 基准)和下游智能体的任务成功率(AgentBoard)。
世界模型预测(表 1):WorldEvolver 在 ALFWorld 和 ScienceWorld 上均取得最佳预测准确度。以 Gemma-4-26B-A4B 为例,Exact Match 从零样本的 3.60% 提升到 52.88%(ALFWorld),从 0.41% 提升到 51.55%(ScienceWorld)。单独使用情节记忆已大幅超过基线 RAWM-(单靠检索),再加入语义记忆后进一步巩固了优势,尤其在 ScienceWorld 上增量明显。RAWM- 虽检索了完整轨迹,但检索键基于全文嵌入,容易引入噪声,而情节记忆直接根据动作 token 相似度匹配,更聚焦;ITP-I 因过度生成想象的细节而表现不升反降。三种指标(Exact Match、Token F1、Cosine Similarity)排名一致。
智能体规划(表 2):下游成功率的提升比纯预测更难。RAWM- 和 ITP-I 常因不可靠前瞻而低于无世界模型的基线,再次证明糟糕的预测会损害决策。WorldEvolver 在所有八个设置(两种智能体类型×两种环境×两个模型)中都是最强的世界模型方法:去掉选择性前瞻时,平均成功率比 RAWM- 高 3.67 个百分点;增加选择性前瞻后,又在多数情况下继续提升。在 Gemma-4-26B-A4B 上,WorldEvolver with Foresight 相对无世界模型基线在 ALFWorld 平均提升 2.24,在 ScienceWorld 平均提升 3.33。对于更强的主干模型 GPT-5.4-mini,提升幅度较小,因为其规划能力本身已接近饱和,仅在硬任务上有所体现(图 4、图 8)。
消融与超参数分析(图 5、图 4):情节记忆的检索尺寸 从 1 增加到 5 时,Exact Match 在多数配置下提升明显(例如 Gemma-4-26B-A4B 在 ALFWorld 上增 16.8 个百分点)。语义记忆的批次大小 则不太敏感。在线持续学习中,WorldEvolver 的优势随试验次数累积而扩大(图 4),表明积累的记忆能跨 trial 复用,符合自演化设计的初衷。
实践建议
若希望在自己的 LLM 智能体系统中应用类似 WorldEvolver 的世界模型,以下几点值得参考:
-
场景适配:当前框架在需要跟踪物体状态和动作后果的文本交互环境中表现良好,如家居模拟(ALFWorld)和科学实验(ScienceWorld)。推广到其他领域时,需确保能够定义因子化状态并可靠地比较预测与真实观测的差异。对于无法拆解状态的场景,可考虑用嵌入相似度替代三元组比较,但需注意这可能削弱语义记忆的精确性。
-
记忆管理开销:WorldEvolver 的运行时增加可控(表 4)。情节记忆的检索对推理速度影响不大,但随记忆增长可能需丢弃过时条目;论文采用保持所有转移的策略,对短期任务可行。如果处理极长周期任务,需引入淘汰机制(如保留最近 条或按相似度裁剪)。语义记忆规则通常很少,几乎无额外开销。
-
主干模型选择:从实验结果看,WorldEvolver 使用中小型模型(如 Gemma-4-26B-A4B、Qwen3.5-9B)能带来更大的相对增益,因为这类模型的零样本预测较弱,而记忆提供的语境能显著提升其表现。如果使用超强模型(如 GPT-5.4-mini),世界模型前瞻的边际收益会减小,但仍能在困难任务上发挥作用。
-
超参数调优:检索尺寸 建议设为 5,既可收获主要增益,又不会引入过多上下文干扰。语义批次 可设为 1,即逐次更新,也可批量更新以节省 API 调用;实际差异不大。置信度阈值 需要根据主干模型的校准曲线小幅调整,论文中取值在 到 之间(表 3),可先按此范围尝试再微调。
-
规避风险:当模型不输出 token 概率或预测本身极不准确时,选择性前瞻应确保 设置较高,宁可放弃前瞻也不引入噪声。如果观察到语义记忆生成的规则质量不高(例如过于具体或错误),可提高证据分数更新门槛,只保留被多次验证的规则,从而提高鲁棒性。
通过这种即插即用的自演化范式,WorldEvolver 为构建更可靠的 LLM 智能体世界模型提供了一条实用的路径,特别适合在不具备微调权限或资源受限的部署环境中累积经验,持续提升规划性能。