ReWorld:一种具有长时程记忆的交互式世界模型
ReWorld: An Interactive World Model with Long-Horizon Memory
论文信息
标题: ReWorld: An Interactive World Model with Long-Horizon Memory
作者: Zhifei Chen, Luozhou Wang, Guibao Shen, et al.
发布日期: 2026-08-24
arXiv ID: 2608.23565v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:如何让交互式世界模型同时满足三个需求:准确跟随相机动作、长时间后仍能重现访问过的场景、在固定内存预算下实时流式生成。
- 核心方法:在训练时用 “混合每头注意力窗口” 分离控制和记忆——大部分头只看近期内容,少数全局头看完整历史,并用 “随机头路由” 让每个头都轮流扮演两种角色;在推理时用固定大小 KV 缓存搭配 “位姿索引地标库” 检索最相关的历史片段,同时用 “chunk-drop 训练” 让模型适应稀疏缓存。
- 关键结果:在 40 张起始图 × 6 条轨迹的基准上,ReWorld 取得整体旋转误差 11.95°、相机运动一致性 0.332,优于对比的六个近期交互式世界模型(表 3);在 64 秒、384 个潜在帧的往返滚动中,固定 12 块缓存仍能重建起始视图,而滑动窗口和全 KV 注意力分别出现遗忘和显存耗尽(第 4.5 节)。
- 主要局限:记忆仍只以相机位姿为检索键,论文未处理动态场景和更丰富的非导航式交互;此外,实验结论来自特定基准和数据集,是否普遍适用需要进一步验证。
- 适合读者:从事视频生成、世界模型、实时交互系统、KV 缓存优化或具身智能研究的研究者和工程师,尤其是关注长时程空间记忆与实时推理平衡的读者。
论文背景和研究动机
交互式世界模型的目标是让用户通过动作流操控视频生成,形成可探索的连贯环境。近年系统在控制和记忆上各有进展,但论文指出了一个结构性冲突:控制需要短窗口——模型只需当前场景和当前命令即可响应;而记忆需要长窗口——若模型看不到遥远的过去,就无从检索和重现访问过的位置。作者在论文中提到,当直接动作注入与位姿索引注意力一起训练时,控制指标全面提升,但重访保真度下降(见论文第 4.5 节表 7)。因此二者在同一窗口下联合训练会产生干扰。
此外,部署时存在硬约束:KV 缓存必须固定大小,不能无限增长。ReWorld 的设计动机因此分为两步:先在训练时按窗口分裂控制与记忆,再在推理时把记忆压缩到固定预算内。这一思路与单纯滑窗或全 KV 不同,试图兼顾控制稳定性和超长时程空间一致性。
核心方法和技术细节
ReWorld 基于 Wan2.2-TI2V-5B 视频扩散 transformer,采用分块因果生成:视频被分为 个潜在块,每块由对应的 6-DoF 相机动作驱动,模型一次生成一块并追加到 KV 缓存。控制侧有两个条件通道:位姿索引注意力(MRoPE)和直接动作注入。
MRoPE 把相对相机位姿 映射为相位偏移,叠加在 RoPE 上,使注意力取决于位姿差异而非时间距离。这与两类现有设计不同:HY-WorldPlay 1.5 的双通道会增加一次相机感知注意力,E-PRoPE 使用降采样 token 的第二次注意力,而 MRoPE 只在现有注意力中引入一个 MLP 和两个线性层,保持注意力核和每头窗口不变(表 1)。
动作注入则把每帧命令位姿展开为 Plücker 射线图,经 MLP 后逐 token 加到 patch embedding 上。这样,射线图告诉当前块 “相机要看哪里”,MRoPE 位姿告诉注意力 “缓存 token 在哪里被看到”。但作者观察到,当所有头同时接收两者时,动作信号会挤占位姿键检索,导致长时记忆变差(第 4.5 节表 7)。
混合每头注意力窗口将 24 个头分为 18 个局部头和 6 个全局头。局部头只看最近 个潜在帧,负责动作跟随;全局头看完整因果历史,负责长程检索。为避免训练出来的头绑定特定窗口——因为推理时无法维持这种分裂——作者引入随机头路由:预先构造 12 个随机 6 头全局集合,每个优化步切换一次,使每个头都在两种角色中训练,控制能力必须在短窗口内完整学成。
推理侧,ReWorld 使用固定预算 块的缓存:1 个 sink 块、5 个近期块、6 个从地标库检索的块。老块从近期窗口退出时,只有相机移动超过一定步长才存入地标库,库满时逐出位姿最冗余的成员;下一次生成时检索与当前位姿最近的 6 个地标。为弥合训练时连续前缀与推理时稀疏拼贴缓存之间的分布差异,chunk-drop 训练随机丢弃历史块,每步只保留 sink 与随机抽样的 5 个幸存块,使模型学会从残缺历史重建场景(第 2.3 节)。
实时推理采用 DMD 蒸馏到 LoRA 适配器,冻结主模型,只训练 rank-128 的 LoRA,使采样压缩到 4 步;动作和位姿注入路径不经过 LoRA,因此蒸馏不干扰控制(第 2.4 节)。
创新点和贡献
论文的四个主要贡献是:
-
窗口分裂训练与随机头路由:把控制训练放在短窗口、记忆训练放在长窗口,并通过随机头路由防止能力绑定到特定头。该设计不增加参数、损失或模块,且预测推理缓存策略改变时控制误差应保持不变,论文在消融中验证了这一点(第 4.5 节)。
-
chunk-drop 训练与地标 consolidation 推理:前者让稀疏 KV 缓存成为训练分布内条件;后者用里程计准入和冗余驱逐保持地标库多样,用位姿邻近检索填满缓存,使固定内存预算下空间记忆可持续(第 2.3 节)。
-
度量对齐多源数据管线:将 Unreal 渲染、真实世界与游戏八类来源的位姿统一到同一物理动作尺度,同一按键在不同来源中移动相同距离;回文轨迹提供重访监督(第 3.3 节)。
-
实时部署与评测协议:LoRA 限定的少步蒸馏让同一骨干网同时拥有高质量多步模式与实时模式,并提出覆盖动作跟随、长时记忆和视频质量的三轴评测方案(第 2.4 节和第 4 节)。
实验结果分析
相机控制:在 40 张起始图 × 6 条轨迹的基准上,ReWorld 的整体旋转误差为 11.95°,平移误差 0.102,相机运动一致性 0.332。其中 RotErr 和 CamMC 为所有方法中最佳,平移主导轨迹(dolly、strafe、palindrome)处于第一梯队;旋转主导的弧线轨迹仍具挑战性,所有方法在该类轨迹上误差较高(表 3)。
长时程记忆:在 和 潜在帧回文基准上,ReWorld 的 SSIM 分别为 0.349 和 0.384,DINO 为 0.913 和 0.932,ORB 为 0.325 和 0.379,均优于大多数基线。论文特别指出 HY-WorldPlay 虽然分数更高,但其执行的路径长度只有 113/210 像素,远短于其他方法的 279–834 像素,因此该对比需谨慎解读(表 4 脚注)。在扩展至 384 潜在帧的 64 秒滚动中,全 KV 在 192 后显存耗尽,滑窗等策略的 SSIM 随长度下降,而 consolidation with bank 在 384 时仍为 0.3752(表 6)。
视频质量:在 VBench 七个视频内在维度上,ReWorld 均值为 0.850,为所有方法最高;其 Temporal Flickering 0.952、Motion Smoothness 0.979 处于前列,同时 Dynamic Degree 0.912 较高(表 5)。
消融:控制–记忆解耦实验显示,仅 MRoPE 时 RotErr 17.66°、重访 SSIM 0.3898;加入动作注入后 RotErr 降至 13.21°,但 SSIM 降至 0.3376;加入路由后 RotErr 12.94°,SSIM 恢复至 0.3752(表 7)。训练配方消融中,同时使用 chunk drop 和随机头路由在所有滚动长度上取得最高 SSIM(表 6 上块)。缓存策略对比中,naive-merge 在多数长度上低于 consolidation,后者在远间隔长度上明显领先滑窗(表 6 下块)。
实践建议
ReWorld 的工程落地场景明确,适合部署为实时交互式世界生成系统。以下是若干可操作的实践建议:
第一,缓存策略适合作为固定预算长视频生成的基础方案。在需要长时间探索的游戏、虚拟旅游或数字孪生应用中,可以直接采用 “sink 块 + 近期窗口 + 位姿地标检索” 的结构。部署时注意论文的默认预算 块、地标库容量 ,显存占用与滚动长度无关,这是其相对全 KV 的主要优势。
第二,训练数据应优先补齐方向均衡的运动分布。论文强调动作跟随精度 “既归功于方向均衡轨迹,也归功于模型设计”(第 3.2 节)。若自建数据集,建议参考论文的控制模式:在兴趣点之间填充前向、后退、横向和对角运动,避免前向偏差导致稀有方向监督不足。
第三,若需实时推理,可采用 LoRA 受限的 DMD 蒸馏而非全文微调。ReWorld 用 2.6 GB 的 LoRA 适配器实现 4 步采样,冻结主模型可保留多步高质量模式。工程上可以利用这一特性,在离线高质量预览和在线实时交互之间切换,同时注意论文建议 “在部署分辨率下蒸馏,并使用与部署提示词相似的提示词”(第 2.4 节)。
第四,评测应同时报告路径长度与重访相似度。论文指出低运动滚动在任何相似度指标上都容易得高分(表 4 脚注),因此实际评测互动系统时,如果只报告 SSIM/LPIPS 而不控制实际移动距离,可能得出误导性结论。建议集成路径长度与相似度联合判断。
需要留意的是,ReWorld 的记忆检索仅基于相机位姿,未显式处理物体运动、光照变化或动态场景。在动态环境或需要非导航交互的场景中,当前机制可能不够充分,作者也将其列为下一步工作(第 6 节)。在工程落地时,如果应用目标包含动态物体或非相机动作,建议先评估位姿键控是否足够,或考虑扩展地标表征。