用于 LLM 智能体规划的自进化世界模型
论文信息
标题: Self-Evolving World Models for LLM Agent Planning
作者: Xuan Zhang, Wenxuan Zhang, See-Kiong Ng, et al.
发布日期: 2026-06-29
arXiv ID: 2606.30639v1
PDF 链接: 下载 PDF
研究动机:世界模型的可靠性与自我演化困境
近年来,大型语言模型(LLM)驱动的智能代理在复杂任务中展现出强大潜力。为了赋予代理对未来的 “预见” 能力,研究者借鉴模型型强化学习的思想,将世界模型引入 LLM 代理规划:世界模型在动作执行前预测其可能产生的后续观察,为代理提供前瞻性信号。然而,一个根本问题始终未解:这种前瞻信号本身并不可靠。当代理在部署环境中持续运行,面对不断变化的任务分布时,冻结的世界模型会像遭遇机器人学中的 “仿真到真实” 鸿沟一样,产生错误预测。这些错误的前瞻可能被忽略、误用,甚至劣化下游决策。
一种直接思路是通过在线梯度更新不断微调世界模型参数,但这在大模型上计算代价极高,且容易引发灾难性遗忘或过度编辑。论文《Self-Evolving World Models for LLM Agent Planning》由此提出核心命题:让世界模型在部署时像生物记忆一样自我演化,而非改变参数。这种 “测试时进化” 不触碰任何模型权重,而是通过积累和修订外部记忆内容,持续提升预测的可靠性,同时保持代理策略完全冻结。
核心方法:WorldEvolver 的三重记忆机制
WorldEvolver 是一个独立于下游代理和基础模型的自我演化框架。其独特之处在于将世界模型的推理上下文看作一个可增删的非参数记忆库 ,包含两个认知性记忆分支:
情节记忆(Episodic Memory) 用于利用。它直接记录代理与环境交互的真实转换三元组 ——即历史中执行了某个动作后环境给出的下一个观察。当需要预测当前候选动作 的结果时,情节记忆会基于动作的词汇重合度(Jaccard 相似度)检索出 个最相似的过往转换,以纯文本形式拼接到世界模型的提示上下文中。这种基于检索的模拟为预测提供了实例依据,相当于让世界模型 “回忆” 类似场景中的因果链路。每个新步骤完成后,实际执行的转换会被立即追加到情节记忆中,使记忆库不断增长。
语义记忆(Semantic Memory) 则负责探索——将错误转化为可复用的启发式规则。WorldEvolver 先对预测观察 和真实观察 进行因子化,用一个映射函数 将自然语言观察分解为一组三元组(如 (fridge 1, is, open))。当因子化后的预测与真实状态不一致时,一个 LLM 批评家便会从这一不匹配中提炼出持久性规则,例如 “执行检查动作不会改变物体位置”。每条规则关联一个证据分数 ,每次后续交互若支持或矛盾该规则,分数就会相应增减,只有证据分数持续为正的规则才会保留在语义记忆上下文中。这种机制使得世界模型能够从稀疏的步级反馈中自动提取世界动力学中的不变性,无需任何梯度信号。
选择性预见(Selective Foresight) 则解决了一个实际问题:即便有了记忆增强,世界模型的预测仍可能有噪声。以往研究表明,不可靠的前瞻比完全不提供前瞻更有害。因此,WorldEvolver 会计算预测序列的平均对数概率,将其转化为置信度分数 ,并与阈值 比较。只有当置信足够高时,预测才被展示给下游代理;否则,代理将在不含前瞻信号的条件下生成动作。这一门控机制相当于让世界模型学会了 “沉默”,避免错误预见误导决策。
整个交互流程环环相扣:代理先生成一个草稿动作,世界模型依据情节记忆和语义记忆为其产生预测,选择性预见决定是否暴露给代理,代理据此做出最终动作。若最终动作与草稿动作不同,系统会用最终动作重新查询世界模型以获得一致的预测,确保语义记忆更新的准确性。这一设计精巧地将在线学习信号与执行动作对齐,保证了记忆演化的一致性。
实验验证:预测精度与规划性能的双重提升
论文在 ALFWorld(家庭仿真)和 ScienceWorld(科学实验)两个长程文本环境中评估了 WorldEvolver。评测分为两个轴:世界模型预测的准确性(Word2World 基准集)和代理规划的成功率(AgentBoard 平台)。
在预测准确率上,WorldEvolver 在 Gemma-4-26B、Qwen3.5-9B 和 Gemma-4-31B 三个不同尺度的模型上均取得了最高的精确匹配、Token F1 和余弦相似度,全面超越 Zero-Shot、离线检索基线 RAWM- 和自适应想象基线 ITP-I。消融实验清晰地揭示了两个记忆分支的互补性:仅用语义记忆有小幅提升,仅用情节记忆则带来很大增益(甚至高于基线中最好的 RAWM-),这得益于情节记忆的动作键检索更直接地定位到相关转换。而完整框架在所有指标上均最优,尤其在 ScienceWorld 这类动态复杂环境中,语义记忆带来的规则约束进一步稳定了预测。
在代理规划方面,结果更具启发性。多数情况下,RAWM- 和 ITP-I 的规划成功率甚至不如完全不使用世界模型的 ReAct 代理,再次印证了不准确的前瞻会伤害决策。WorldEvolver 的两个变体中,不使用选择性预见(即代理始终能看到预测)的版本已在 8 个设置中的 4 个超越无世界模型基线,而加入选择性预见后,全部 8 个设置均持平或超越基线,并在 Gemma-4-26B 上平均提升 2-3 个百分点。值得注意的是,选择性预见对能力较弱的主干模型(Gemma-4-26B)增益更大,因为它能更有效地过滤噪声,而对强模型(GPT-5.4-mini)的增益相对温和——这恰好符合直觉:强大的规划能力本身对前瞻的依赖度更低,但也更难从中获益。
进一步分析显示,WorldEvolver 的运行成本控制良好,其推理时间仅略高于 Zero-Shot,远低于同样生成未来轨迹的 ITP-I,表明额外的检索和规则获取有效地转化为了预测质量,而非纯粹增加计算消耗。
创新与应用:面向 AI 代理的世界模型自演进范式
WorldEvolver 的创新意义在于它重新定义了世界模型在 LLM 代理中的角色和维护方式。其核心贡献可归结为三点:
- 无参数自演化:首次提出通过部署时非参数记忆修订实现世界模型的持续提升,避免了在线梯度更新的高成本和潜在风险,使大模型世界模型能够在资源受限的在线环境中自我优化。
- 情节-语义双记忆架构:分离具体的经验复现与抽象的规则提取,形成利用与探索闭环。情节记忆提供高保真情景参考,语义记忆则将短期错误转化为长期结构化知识,二者共同提供一个逐步精化的预测环境。
- 基于置信度的选择性利用:引入置信门控解决不可靠前瞻的有害影响,使世界模型的输出从 “强制信源” 变为 “可信顾问”,极大增强了框架的鲁棒性。
对于 AI 代理系统的实践者而言,WorldEvolver 提供了可操作的部署增强方案。在诸如自动化客服、虚拟实验助手、多步推理等场景,可以为现有的 LLM 代理配备一个独立的世界模型记忆库。实施时,不妨先从情节记忆入手:记录每一步真实交互,并在预测时检索相似动作的历史结果。随着交互量增加,可进一步加入语义记忆,通过 LLM 自动提炼守恒规则,处理那些 “通常如此但不总是” 的环境动态。选择性预见可以采用 token 级概率或自一致性估计等替代置信度,根据任务特性设定保守的门限。所有组件均可叠加在已有代理之上,无需修改原始模型权重,适合快速集成和迭代。
总结与展望
WorldEvolver 为 LLM 代理的世界模型提供了一条既优雅又务实的进化路径。它在不改变任何参数的前提下,通过记忆式的心智模块使世界模型随部署进程变得愈发准确,进而帮助代理更可靠地完成长期任务。实验证据表明,这种 “边用边学” 的记忆驱动机制不仅能提高预测保真度,还能切实转化为下游规划成功率的提升,尤其在复杂环境与较弱骨干模型上效果显著。
当然,当前工作仍局限于相对规则的文本环境,未来可向更广阔的领域延伸,如网页导航、代码生成或多模态交互。置信度估计也可进一步发展为自适应阈值或元学习门控。更大的愿景在于,让世界模型成为代理的长期认知伙伴,通过持续积累经验、提炼常识、学会何时沉默,在变幻的真实世界中为 AI 代理提供忠实而审慎的未来之眼。