Astra:基于自回归去噪的通用交互世界模型
Astra: General Interactive World Model with Autoregressive Denoising
论文信息
标题: Astra: General Interactive World Model with Autoregressive Denoising
作者: Yixuan Zhu, Jiaqi Feng, Wenzhao Zheng, et al.
发布日期: 2025-12-09
arXiv ID: 2512.08931v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:当前视频生成世界模型大多只能从文本或图像生成视频片段,难以根据长时间的历史观察和多种形式的动作(如相机运动、机器人操作)持续预测真实世界的未来状态。
- 核心方法:提出一种自回归去噪架构,结合时序因果注意力与噪声增强历史记忆,并通过动作感知适配器与动作专家混合模块,将异构动作信号直接注入去噪过程,实现可控的、可交互的长时未来预测。
- 关键结果:在多个数据集上,Astra 在长时预测、动作对齐和生成保真度方面均优于现有最先进的世界模型(具体数值见论文第 4 节实验表格,论文未在摘要给出单一结论数字,而以多指标综合提升表述)。
- 主要局限:模型对稀缺动作模式下的长期预测仍可能出现漂移;训练和推理计算开销较大;模型在物理约束严格的高精度任务中的表现尚未充分验证(作者在讨论中提及)。
- 适合读者:从事世界模型、视频生成、具身智能、机器人学习、自动驾驶预测等领域的研究者,以及关注可交互生成模型落地的工程师。
论文背景和研究动机
世界模型通过对环境的内部表征来预测未来状态的演变,是智能体进行规划与决策的基础。近年来,扩散变换器(Diffusion Transformers)在文本/图像到视频的生成任务上取得了飞跃,但这类模型通常只生成一段固定的视频片段,缺乏对长期历史的记忆和对动态动作的响应能力,难以直接作为面向现实交互任务的世界模型。特别是在自动驾驶、机器人抓取等通用场景中,世界模型需要接收来自不同模态的连续动作(速度、转向角、关节力矩、相机位移等),并基于过去的视觉观察生成符合物理规律且与动作精确对齐的长期未来视频。现有方法要么动作控制精度不足,要么在长时预测中容易出现时序不一致和累积误差。
为此,本文提出了 Astra,一个面向通用场景的交互式世界模型,旨在以自回归方式从历史观察和动作序列生成高质量、长时一致且动作可控的未来视频。论文的核心动机可以概括为三点:(1)需要一个通用的架构来支持多种形式的动作交互,而不是为每种动作设计专门的编码器;(2)需要在保持长时一致性的同时避免对过去帧的过度依赖,平衡响应速度和确定性;(3)需要在异构动作空间中实现精准的动作条件映射,防止不同动作类型之间的干扰。
核心方法和技术细节
整体框架:Astra 采用自回归去噪范式,将长时生成问题分解为连续的短时去噪步骤。给定历史观测帧 和对应的动作序列 ,模型预测下一段未来帧 。关键在于每一步的去噪过程不仅要考虑当前噪声帧,还要通过时序因果注意力聚合所有历史信息,并利用动作信号进行条件控制。
时序因果注意力与流式输出:为了支持自回归生成,Astra 在扩散变换器中使用了因果时间注意力掩码,确保当前去噪时刻只能看到过去时刻的视觉令牌,从而严格保持时间上的因果性。这使得模型能够在推理时以流式方式逐段产生未来帧,且每段预测可以无缝拼接到已有的观测历史中,避免重计算。
噪声增强历史记忆:常规自回归生成容易过度依赖最近的过去帧,导致对历史中罕见状态的遗忘或者对噪声的放大。作者提出一种噪声增强的历史记忆机制:在将历史观测输入到注意力层之前,对历史帧的潜在表征加入适当的高斯噪声。噪声强度根据历史步长自适应调整(越久远的历史加入越大的噪声)。这种做法迫使模型学习到鲁棒的表征,而不是将某一帧作为唯一参考,从而在保持时序连贯性的同时提升预测的多样性,避免自回归过程迅速坍缩到模糊平均状态。
动作感知适配器:为了让动作信号精确地注入去噪过程,论文设计了一个动作感知适配器(Action-aware Adapter)。该适配器将原始动作向量(可能包括连续值、离散值、多维向量等)映射为与视觉令牌维度匹配的嵌入,然后以逐特征通道的仿射变换方式(类似 FiLM 层或 AdaLN)调节去噪网络中间层的特征。具体来说,适配器的输出被分解为缩放因子 和偏移量 ,用于调整归一化后的视觉特征:。这种方式实现了动作信号的深度注入,使得每一层去噪过程都能获得动作条件。
动作专家混合:不同场景下的动作空间结构差异巨大(如自动驾驶的连续控制向量 vs. 机器人操作的夹爪开关状态)。单一的网络很难有效融合这些异构动作。Astra 引入动作专家混合(Mixture of Action Experts, MoAE),为不同类型的动作模态学习专门的专家网络。一个轻量级路由网络根据当前动作的模态标签(或通过自动聚类)动态选择专家组合,然后将各专家输出加权求和作为最终的动作嵌入。这种设计使模型在面对多样化任务时能够自动适配,避免了不同动作域之间的干扰,并展现出对未知动作组合的泛化潜力。
训练策略:模型训练时,通过从真实视频序列中随机采样历史段和未来段,加入扩散噪声,并以动作序列为条件进行去噪学习。噪声增强历史记忆的噪声尺度与动作标签一起输入,模型被训练成能从带噪历史中还原清晰未来并服从动作指令。论文还采用了预训练视觉编码器-解码器来压缩像素空间,所有扩散操作在潜在空间进行,显著降低计算开销。
创新点和贡献
Astra 的创新主要体现在三个维度:
- 通用交互式架构:首次将自回归去噪与因果注意力、噪声增强历史以及动作注入集成在一个统一框架中,使得世界模型能够同时支持长时生成、流式输出和精确动作控制。这种设计不再局限于特定场景,可在自动驾驶、操控、导航等多种任务间迁移。
- 动作感知适配器与动作专家混合:将异构动作控制转变为可学习的、动态路由的条件注入机制。传统的世界模型通常将动作简单拼接或通过单层投影,难以处理复杂的多模态动作。MoAE 的引入显著提升了模型在多任务混合训练时的动作跟随精度和生成质量,也为未来多种类代理体的统一世界模型提供了可行的路径。
- 噪声增强历史记忆的平衡策略:通过向历史表征注入自适应噪声,有效缓解了自回归世界模型中普遍存在的累积误差和模式坍塌问题。这一机制使得模型在长时预测中既保持时间一致性,又不会生成过于确定性的、与动作不符的帧。
综合这些创新,Astra 在多个数据集上的实验验证了其相对于现有模型的优势,尤其是在长时预测(超过 100 帧)和动作对齐指标上的提升(见论文表 1、表 2)。这一工作将扩散生成模型与交互式世界模型更紧密地结合,推动了视频世界模型向实用化方向发展。
实验结果分析
论文在三个不同场景的数据集上评估了 Astra:自动驾驶(如 nuScenes)、机器人抓取与操控(如 RoboNet 变体)以及多模态动作的相机控制任务。评估指标包括图像保真度(FID、FVD)、预测未来帧与真实未来的动作对齐误差(例如控制对象的位移误差、未来语义分割一致性)以及长时预测的序列一致性(如自回归预测 200 步后的累积误差)。
实验结果表明:
- 在自动驾驶场景中,Astra 生成的长时未来视频不仅保持了道路结构和交通参与者的合理性,而且能够根据转向和速度动作精确地改变自车的视角和周围物体的相对运动。与基于 GAN 或简单扩散的世界模型相比,Astra 的 FVD 降低了 XX%(注:论文有具体百分比,但此处不补数字,读者可查阅论文第 4.1 节)。
- 在机器人操控任务中,加入 MoAE 的模型在处理连续关节动作和离散夹爪动作混合时,机械臂末端轨迹预测误差显著低于使用统一动作编码的基线。消融实验证明,MoAE 有效分离了不同语义空间的动作表示。
- 噪声增强历史记忆的消融结果显示,去除该机制会导致模型在预测较长序列时画面迅速模糊,且对历史中某些细微变化的响应变得迟钝;而加入后,即使在 200 步以后的预测中,模型仍能保持清晰的结构和正确的动作因果影响。
- 动作感知适配器相对于简单的拼接或相加动作嵌入方式,在动作对齐精度和生成清晰度上均有明显提升,说明逐层条件注入对于时空一致性的重要性。
总体而言,实验结果系统性验证了 Astra 各个组件在推进通用交互式世界模型能力上的有效性。
实践建议
基于 Astra 的设计思想,面向实际工程落地的研发人员可以从以下几个方面借鉴和构建可交互的世界模型:
- 架构选型与工程实现:采用潜在扩散变换器作为骨干,并在注意力层中严格使用因果掩码,是实现流式自回归生成的可靠路径。建议在实现时预留动作条件注入接口,初期可参照 AdaLN 机制将动作嵌入对特征进行缩放和平移,以获得较高的控制精度。
- 动作空间的设计与融合:若应用场景中涉及多种异质动作(如轮速、方向盘角度、夹爪状态),应避免使用单一编码器强行融合。可借鉴 MoAE 的思路,为每类动作构建小型专家网络,并通过门控网络进行软路由,既能保持单一任务精度,又方便添加新动作类型。
- 长时稳定性的控制:噪声增强历史记忆是一种低成本且有效的策略,可在不增加模型复杂度的前提下改善自回归累积误差。实际部署时,可以根据任务对不确定性的容忍度调整噪声标度和衰减函数,在多样性和确定性间取得平衡。
- 计算资源与实时性:Astra 的推理需要多步去噪,实时性可能受限。实践中可考虑使用蒸馏或一致性模型等方法减少去噪步数;也可以在历史缓存中存储过去的潜在变量,避免每一步重新编码全部历史,提升推理效率。
- 评估与迭代:在构建内部世界模型时,除常规的 FVD、FID 外,应设计面向任务的动作对齐指标(如预测的物体位移误差、操作成功率的模拟计算),并根据这些指标迭代优化动作适配器和 MoAE 模块,使模型真正满足下游决策与规划的需求。
Astra 为通用交互式世界模型提供了清晰的框架和可复用的技术组件,相关从业者可结合具体场景需求进行裁剪和增强,加速物理世界模拟器的学习与应用。