Marionette:预测世界状态、渲染几何、绘制外观

Marionette: Predicting World States, Rendering Geometry, Painting Appearance

arXiv: 2608.14530v1

论文信息

标题: Marionette: Predicting World States, Rendering Geometry, Painting Appearance

作者: Zian Meng, Zhen Li, Chuanhao Li, et al.

发布日期: 2026-08-14

arXiv ID: 2608.14530v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题: 交互式游戏世界模型若直接自回归像素或隐空间,姿态、几何、遮挡等结构属性会被隐式维护,长时程下误差累积,一致性与可控性下降。
  • 核心方法: 将世界模型拆成显式 276 维 3D 状态、零参数确定性渲染器、控制条件视频扩散外观模型三部分;动力学由 ActionGPT/PoseGPT 两阶段预测。
  • 关键结果: 在 48 段 held-out 测试中,强制错误动作流使根对齐关节误差从 0.272 m 增至 0.357 m,变化约 31%;仅对状态层施加地形碰撞与分离规则,地面穿透从无规则时的 0.337 降至 0.114,降幅约 66%(表 2、表 4)。
  • 主要局限: 作者承认外观一致性仍随分块 rollout 衰减;部分视觉实体没有对应状态骨架;训练与推理之间存在真值/生成姿态分布偏移;动力学模型目前只覆盖单怪物类型。
  • 适合读者: 从事世界模型、视频生成、游戏 AI、具身智能、神经渲染或可控角色动画研究的人。

论文背景和研究动机

近年的交互式游戏世界模型,如 Genie、GameNGen、Diamond、Oasis 等,通常直接以像素或隐空间自回归方式生成视频。它们在视觉质量上提升很快,但姿态、几何、遮挡、物体身份以及控制输入的效果,都被交给同一个生成序列隐式维护。长时间 rollout 时,模型不断接收自身输出,输入分布逐渐偏离训练分布,误差因此复合。论文引用 DAgger 与 scheduled sampling 的经典结论来说明这一问题,并指出:视频是高维观测,直接学习 p(video)p(\text{video}) 会把物理、身份和控制纠缠在像素空间里。

论文主张将问题显式化为动力学模型与观测模型的分解:

p(video)=∫p(obs∣s) p(st+1:∣s≤t,control) dsp(\text{video}) = \int p(\text{obs}\mid s)\, p(s_{t+1:}\mid s_{\leq t}, \text{control})\, ds

关键设计判断是:哪些部分由神经模型负责,哪些部分由确定性工具负责。作者用 Minecraft 红石电路举例:红石灯是否点亮由逻辑电路状态决定,而不是相邻像素外观;因此这类必须精确的簿记应当交给固定规则,而不是生成器。类似语言模型调用计算器,Marionette 把必须精确的几何、遮挡、度量运动委托给零参数渲染器,让神经模型只负责外观与感知合理性。

核心方法和技术细节

Marionette 的显式世界状态 s∈R276s\in\mathbb{R}^{276} 描述两个铰接实体:怪物与猎人。其内容包括怪物根位移、53 个根相对关节、猎人根位移、31 个根相对关节、武器点、以及两个 6D 根旋转(论文第 3.1 节)。根相对关节与根位移的存储方式使表示对全局位置和朝向不变,同时便于确定性桥接恢复世界空间骨架。

动力学模型被分成两阶段。ActionGPT 是 4 层、宽 256、约 2.5M 参数的因果 Transformer,每帧为每个实体选择一个离散动作 token,并回归下一步根位移与朝向。它接收低维状态摘要:18 维根/旋转流、动作嵌入、动画进度以及武器子状态。PoseGPT 是 8 层、宽 512、约 25M 参数的因果 Transformer,将动作 token 与近期身体状态映射为下一帧身体姿态。控制直接通过覆盖离散动作 token 来实现,无需重训练或额外网络;根位移和旋转也可同样覆盖。若带地形条件,两阶段都会接收以自身根为参考的高度 patch 和关键关节地面间隙。

确定性图形桥没有任何可学习参数。它先把 6D 旋转通过 Gram–Schmidt 正交化转为旋转矩阵;再把局部根位移旋转到世界坐标系并累积求和,得到绝对根轨迹;然后放置根相对关节,形成世界空间骨架;最后经过相机投影与光栅化,生成姿态控制视频。这一步把几何、遮挡和度量尺度在构造上变为精确运算。姿态控制帧是三通道几何缓冲:R 通道编码高度,G 通道编码关节身份,B 通道编码逆深度(附录 C)。地形也由扫描高度场绑定,并在推理时用于可行域投影。

观察模型是控制条件视频扩散模型,基于 Wan2.2-Fun-5B 的 DiT 视频骨干。它接收姿态控制视频和首帧外观信息,生成逼真 RGB。长时程超出单次扩散窗口时,采用 chunk-relay:模型生成固定长度块,其末帧作为下一块的种子。几何与动力学仍由状态层和确定性桥梁决定,外观身份则依赖逐块传播。

创新点和贡献

Marionette 的主要贡献不是新的视频生成技巧,而是重新划分了生成式世界模型的边界。

第一,它给出一个显式、可解释、render-ready 的状态。状态不仅是隐空间向量,而是以米为单位的骨架、根轨迹与旋转。误差可以在米量级被测量,而不是只反映在生成图像上。

第二,它把精确几何计算隔离进零参数确定性桥梁。世界空间一致性、遮挡排序和度量尺度不会因扩散模型的采样随机性而改变;只有当预测状态漂移时,渲染几何才会漂移。这是与纯像素自回归基线最本质的区别。

第三,它提出决策与动画两阶段解耦。动作是离散、低维、可解释的控制接口,身体姿态是连续、高维的输出。这种解耦让玩家按钮输入可以表示为单个 token 覆盖,也让动力学模型的结构更清晰。

第四,它建立了双层评估协议:状态层报告地面穿透、足部滑动、实体分离等绝对物理量;观察层报告 FVD。论文在实验中证明这种分层的必要性:FVD 曲线较平滑时,状态层可能已经出现地面穿透和实体漂移(第 4.4 节)。

第五,它给出了一个负结果。强穿透损失和接触损失本意是约束身体,但优化器通过拉伸骨骼规避,骨长误差从约 3% 上升到约 13%(附录 C)。作者因此将约束改为输入特征与推理时投影,而不是仅依赖可微损失。这一结论对任何试图用软约束稳定生成式世界模型的工作都有参考价值。

实验结果分析

可控性实验回答 “控制输入是否有因果权威” 的问题。在 48 段 held-out 测试中,三种条件只改变猎人动作流:Free 由模型自行采样,Force-GT 强制为真值动作,Force-Shuf 强制为时间打乱的真值动作。结果显示,Force-GT 的 RA-MPJPE 为 0.272 m,Force-Shuf 为 0.357 m,错误 token 使误差增加约 31%;且 Force-GT 优于 Force-Shuf 的排序在 33/48 段中成立(表 4)。这说明覆盖 token 并不是被忽略,而是改变了生成姿态。作者还指出,Force-GT 与 Free 的差距很小(0.272 对 0.281),意味着自由 rollout 中模型很少选错,玩家输入只有在与自主预测不同时才起关键作用。

长期行为实验回答 “长期行为由什么决定” 的问题。固定观察模型,只改变驱动它的状态。自由生成 12 秒后,怪物与猎人的距离漂移到 21.2 m,而记录会话中约为 4.8 m;地面穿透碰撞帧比达到 0.337。若加入地形碰撞器,穿透降至 0.114,降幅约 66%,但分离距离仍为 21.2 m。进一步加入分离上限规则,最终距离被限制在 5.1 m,穿透保持 0.114,足部滑动略有增加(表 2)。每条规则只作用于其设计约束的自由度,说明状态层是可修复的。

观察层方面,Marionette 的 FVD 为 831,像素自回归基线为 975;最终块 FVD 为 1013 对 1198(表 1)。论文提醒 bootstrap 区间有重叠,因此在该检测精度下不能认为观察质量有显著差异。用真值姿态驱动同一观察模型得到 FVD 799,预测姿态为 831;作者认为在该样本量下两者未进一步分离,说明动态模型造成的观察层代价在当前测量中无法明确检测。

实践建议

如果目标是构建需要长时程一致性、精确控制或物理可信度的交互式世界模型,Marionette 的架构选择值得借鉴。

首先,不要把所有长期一致性都交给像素或隐空间序列。对必须精确的量——例如几何、遮挡、度量轨迹、实体身份——可以考虑建立一个显式中间状态,并用固定规则或确定性渲染器完成这部分计算。视觉生成模型则专注于外观和感知合理性。这样,长期行为可以被状态层规则直接检查和修复,而不是只能在图像空间模糊地观察退化。

第二,控制接口应尽量简单且作用在可解释状态上。离散动作 token 加根位移/旋转覆盖,既容易被玩家或脚本写入,也便于做因果验证。若团队正在开发多智能体或可交互角色系统,可以考虑把 “决策” 和 “动画” 分开,而不是用一个大模型同时负责两者。

第三,重要约束应放在优化器无法交易的位置。论文附录 C 的负结果清楚显示,仅靠穿透损失会让模型拉伸骨骼来满足表面约束。更稳健的做法是把地形或可达性作为输入条件,并在推理时对状态做投影修正。这个经验适用于任何带物理规则约束的生成式系统。

第四,评估协议应区分状态层和观察层。单一 FVD 指标可能掩盖状态层失败。对包含物理规则、碰撞或空间关系的系统,建议在绝对物理单位下测量关键量,如穿透深度、足部滑动和实体分离,并观察它们随 rollout 时长的变化。这样,模型是否真正遵循状态约束,而不是仅生成看似合理的图像,才能被识别。

最后,如果数据条件允许,尽量记录引擎级动作和状态标签。Marionette 能进行双层评估,依赖 WildWorld 数据集中时间对齐的动作、状态与 RGB 视图。这类标注在真实工程中成本较高,但它使得动力学模型训练、规则验证和因果关系测试成为可能。若团队无法获得引擎级状态,也应在采集阶段考虑如何为关键实体补齐结构化表示。

整体而言,Marionette 的方法在当前技术条件下提供了一种务实路线:用显式状态和确定性工具承接必须准确的长期结构,用扩散模型补足真实视觉外观。它不是否定像素级世界模型,而是在 “生成” 与 “计算” 之间给出了更清晰的分界线。