铭记好奇:用于 3D 探索的情景语境与持久世界

Remember to be Curious: Episodic Context and Persistent Worlds for 3D Exploration

arXiv: 2605.22814v1

论文信息

标题: Remember to be Curious: Episodic Context and Persistent Worlds for 3D Exploration

作者: Lily Goli, Justin Kerr, Daniele Reda, et al.

发布日期: 2026-05-21

arXiv ID: 2605.22814v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:在复杂逼真的 3D 环境中,如何让 AI 智能体通过好奇心驱动实现高效的长程探索,避免陷入原地打转或重复访问已遗忘区域的 “失忆症式” 探索困境。
  • 核心方法:将 “持久的世界模型” 与 “具有情节上下文的智能体策略” 配对使用。具体来说,用在线 3D 高斯泼溅(3DGS)作为持续更新的世界模型来提供可靠的探索奖励,同时用基于 Transformer 的序列模型作为智能体架构,让智能体从 RGB 图像历史中学习到自己的情节记忆。
  • 关键结果:在 HM3D 数据集上,仅凭好奇心奖励训练的智能体在 3D 场景覆盖率上超越了所有基于强化学习的主动建图基线方法(图 3),其 1024 步后的覆盖率达到 74.94%,且能零样本泛化到 Gibson 和 AI 生成的世界中。
  • 主要局限:由于使用了 3DGS 作为世界模型,该方法目前局限于静态场景的探索,无法直接应用于动态环境。
  • 适合读者:对具身智能、强化学习探索机制、3D 视觉以及机器人导航感兴趣的研究者和工程师。

论文背景和研究动机

在强化学习领域,当外部奖励极其稀疏时,探索成为智能体学习有用行为的前提。好奇心驱动是一种常用方法,其核心是让智能体从对世界模型的预测误差中获得内在奖励。然而,在高质量真实感 3D 环境中,现有好奇心方法很容易失效:智能体常陷入局部死循环,或对已遗忘的状态产生虚假的新鲜感而获取奖励。

论文将这种失效归因于两个并发的 “失忆症” 问题。首先,传统的前向动力学模型(如 ICM 中的模型)缺乏空间持久性,它是对整个训练经历的统计先验,而非对当前场景的 “情节性” 记录。这意味着当智能体重返旧地时,模型可能因 “遗忘” 而再次产生高预测误差,奖励了无意义的重复访问。其次,智能体策略通常缺乏情节上下文,只对当前观察做出反应或仅维持短期记忆,这令其无法形成 “回溯到先前路口再去探索新分支” 这类长程规划能力。为了解决这两个根本缺陷,作者提出了一个将持久的世界模型与带有情节记忆的智能体配对的全新框架。

核心方法和技术细节

该方法由两个解耦的关键部分构成:一个提供好奇心信号的持久世界模型,和一个保持情节记忆的探索策略。

1. 持久世界模型:基于在线 3DGS 的前向模型

与学习一个抽象、非持久的前向动力学模型不同,作者在训练期间引入了一个辅助的、持续更新的 3D 世界模型。具体来说,他们使用了在线 3D 高斯泼溅(3DGS)作为前向模型 F\mathcal{F}。在探索过程中,利用训练时的特权信息(RGB 图像、深度和相机位姿),系统会逐步将观察到的每一个像素初始化为一个 3D 高斯,并不断优化和更新这个场景表示 Gt\mathcal{G}_t。

在每个时间步,前向模型会根据当前场景模型 Gt\mathcal{G}_t 去渲染下一个相机位姿 pt+1p_{t+1} 的预测图像 I^t+1\hat{I}_{t+1}。如果渲染结果与真实观察 It+1I_{t+1} 存在显著差异,就意味着这部分场景信息还未被模型捕获,是新颖区域。这种设计天然保证了空间持久性:场景中一旦被建好的区域,模型会 “记住” 它,再次访问时,预测误差很小。基于这种渲染误差,论文定义了一个经低通滤波和下采样处理的二值好奇心奖励 rtcurr^{\text{cur}}_t:对于模型无法解释的新颖视角给予正奖励,对已解释的视角给予小惩罚。

2. 具有情节上下文的智能体:视觉序列 Transformer

为了让智能体有能力利用历史信息规划去往新颖区域,其策略 π\pi 被设计为依赖于从开始到当前的全部视觉观察序列和动作序列。智能体架构的核心是一个处理时序序列的 Transformer。

具体流程是:每个时间步的 RGB 图像,先和用 Plücker 射线表示的动作在通道上拼接,再通过一个视觉编码器(含 DINOv2 预训练特征和可学习的查询令牌)压缩成单个帧令牌 ziz_i。这些帧令牌随后被送入一个融合了滑动窗口因果自注意力和全局线性注意力记忆模块的 Transformer 中。滑动窗口注意力提供了计算高效的局部上下文,而线性注意力模块通过维护一个运行中的记忆状态 hih_i,赋予模型不依赖全注意力计算的长程记忆能力。最终,当前帧令牌 ztz_t 的处理结果会被送入 actor-critic 头,输出动作和价值估计。这个设计让智能体仅从 RGB 输入流中学习到了自己的内部世界表征,无需对环境进行显式的几何建图,因此在迁移到语义任务时更加灵活。

3. 训练正则化

为克服探索后期正奖励稀疏导致的动作多样性崩溃,论文采用了随机策略正则化。在训练初期,以一定概率 β\beta 让智能体执行随机动作,保证它能突破无奖励区域,有机会遇到新的场景分支。这个概率会随着训练进行逐渐退火至零。

创新点和贡献

  1. 明确了好奇心的双重 “记忆” 需求:论文通过系统性的消融实验,清晰地论证了持久的正向模型和情节性的智能体记忆对于在复杂 3D 环境中实现有效好奇心探索是缺一不可的。非持久的世界模型(如短记忆的 3DGS 或经典 ICM)会导致探索灾难性崩溃(见图 4)。

  2. 提出了一个耦合持久世界与情节记忆的端到端框架:首次将在线 3DGS 作为鲁棒的好奇心奖励源,与一个仅依赖 RGB 的 Transformer 策略配对。该框架在训练时借助几何信息构建好奇心信号,但在部署时,智能体完全不需要显式建图、深度传感器或精准定位,仅凭单目 RGB 即可行动,大大提升了其适应性和通用性。

  3. 验证了技能迁移与泛化能力:论文证明了纯粹出于好奇心学到的探索行为,可以作为强大的先验,通过微调快速迁移到下游稀疏奖励任务(如摘苹果、图像目标导航)上,并显著优于从头开始训练的模型(见图 5、图 6 左)。同时,该智能体展现了对完全不同分布环境(AI 生成世界)的零样本泛化能力(见图 6 右)。

实验结果分析

论文进行了多维度的严格实验。 在室内场景探索的主测试上(HM3D 和 Gibson 数据集),与主动神经 SLAM(ANS)和占据预测(OccAnt)等基于显式地图的强化学习方法对比,本文的模型在所有时间尺度上的 3D 场景覆盖率均更高,1024 步后在 HM3D 上达到 74.94%(对比表,图 3)。其轨迹显示,智能体能发现门廊、穿越走廊并回溯到交叉口。

消融实验(图 4)是最具说服力的部分之一:

  • 替换世界模型:将 3DGS 换成 ICM 中的非持久模型,或仅保留 64 帧短记忆的 3DGS,覆盖率均出现断崖式下降(从 74.94% 降至不足 40%),证实了持续更新的持久世界模型对提供稳定奖励至关重要。
  • 缩减智能体记忆:将 Transformer 换成 RNN,或将 transformer 的上下文窗口从完整历史缩减到 1、4 或 16,探索性能也会严重退化。即使只给 critic 保留长上下文而 actor 是反应式的,效果也优于两者都没有记忆,这表明情节记忆对评估状态价值同样重要。

在下游任务中,经过预训练的智能体在 “摘苹果” 任务上,其性能不受苹果数量稀疏性的影响,始终优于从零训练的基线。在更困难的 “图像目标导航” 任务中,从零训练的智能体完全崩溃为漫无目的地游荡,而微调后的模型则能成功将通用探索行为重定向为面向目标的搜索。

实践建议

对于希望将好奇心理念应用于真实世界机器人或具身智能系统的从业者,本文提供了几项关键指导:

  1. 世界模型必须 “持久”:在设计好奇心奖励的生成器时,应优先考虑一个能在线、持续更新且具备空间一致性的世界表征。纯粹的隐式动力学模型很容易因为 “灾难性遗忘” 而奖励停滞行为。在静态或准静态环境中,在线 SLAM 或高斯泼溅等技术是构建可靠好奇心的有效选择。
  2. 策略需要 “情节记忆”:仅对当前帧响应的策略无法产生高效、有远见的探索行为。架构设计上应加入能融合长序列信息的能力,例如引入 Transformer 或结构化的记忆模块。这比在地理地图上进行算法规划更为灵活,因为其内部记忆可以同时编码几何和语义,有利于下游多模态任务的迁移。
  3. 行为正则化不可或缺:纯粹的随机熵正则化可能不足以应对探索的 “高原期”。在训练过程中,有策略地(且可退火的)注入随机行动(如随机策略正则化),是一种简单有效的手段,可以帮助智能体在奖励荒漠中保持移动,从而发现新的学习信号。
  4. 选择模块化解耦架构:世界模型和行动策略的解耦设计,意味着好奇心信号的质量和策略的探索能力可以各自迭代。这为系统调试和升级提供了便利。当更强大的生成式世界模型成熟时,可以直接替换掉 3DGS 部分,而无需彻底改变整个训练框架。