WorldCache:面向加速视频世界模型的内容感知缓存

WorldCache: Content-Aware Caching for Accelerated Video World Models

arXiv: 2603.22286v1

论文信息

标题: WorldCache: Content-Aware Caching for Accelerated Video World Models

作者: Umair Nawaz, Ahmed Heakl, Ufaq Khan, et al.

发布日期: 2026-03-23

arXiv ID: 2603.22286v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:这篇论文要解决视频世界模型(基于扩散变换器)推理速度过慢的问题,现有训练无关的缓存方法在动态场景中容易出现重影、模糊和运动不一致。
  • 核心方法:提出 WorldCache,一种感知约束的动态缓存框架,通过运动自适应阈值、显著性加权漂移估计、最优特征近似以及自适应阈值调度,联合改进了 “何时跳过计算” 和 “如何重用缓存特征” 两个环节。
  • 关键结果:在 Cosmos-Predict2.5-2B 模型上,WorldCache 取得了 2.3 倍推理加速,同时保留了 99.4% 的基准质量(见论文表 2),大幅优于之前的训练无关缓存方案。
  • 主要局限:论文指出,在场景发生剧烈跳变(如快速视角切换、严重遮挡)时,缓存命中率可能下降,运动估计和补偿在高速动态下仍有提升空间。
  • 适合读者:从事视频生成、扩散模型推理加速、世界模型或物理 AI 仿真的研究者和工程师,以及对训练无关加速技术感兴趣的读者。

论文背景和研究动机

世界模型通过预测未来视觉状态,支持智能体在模拟环境中进行规划和决策。当前主流的扩散变换器(DiT)凭借时空注意力机制,能捕捉长程依赖性(如物体恒常性和因果运动),成为构建高保真世界模型的核心架构。然而,这种表现力带来高昂的计算代价:生成一段多帧的未来视觉需要调用若干层变换器块,并经历几十步去噪过程,导致延迟成为交互式模拟和闭环部署的主要瓶颈。

一种自然的补救思路是利用去噪轨迹上的冗余——相邻去噪步骤常常只对中间特征产生微小改变,因此在微小漂移时可跳过代价高昂的层,直接复用缓存的激活。训练无关的缓存方法可实现这一目标,例如 FasterCache 使用固定跳过策略,DiCache 通过浅层探针动态决定刷新时机。但它们都隐含一个 “零阶保持” 假设:只要全局漂移小,就将缓存特征作为静态快照直接拷贝到下一时间步。在动态场景中,这一假设会带来重影、语义涂抹和轨迹不一致,这些正是破坏世界模型自回归生成的致命伤。问题根源有三个盲点:(1) 全局漂移平均了所有空间位置,静态背景可能掩盖大范围的前景变化;(2) 所有空间位置权重相等,而感知和功能质量主要由显著性实体(如智能体、手部、被操纵物体)的错误决定;(3) 一个固定的阈值无法适配去噪过程两个截然不同的阶段——早期建立全局结构,晚期仅细化高频细节。

WorldCache 正是在这一背景下被提出的,目标是用一种无需重新训练的框架,将缓存从脆弱的快捷方式转化为一种与世界模型要求对齐的可控近似策略。

核心方法和技术细节

WorldCache 建立在 probe-then-cache 范式的骨架之上,但重新设计了 “何时跳过” 的决策准则和 “如何重用” 的近似机制。其完整流程如图 2 所示:每一步仅执行前 kk 个探针块得到浅层特征,然后由四个模块联合决定是否执行深层块或直接利用缓存近似深层输出。

运动自适应决策——因果特征缓存(CFC):利用两步间隔的输入归一化变化量 vtv_t 作为运动代理,将缓存阈值设为 τCFC(vt)=τ0/(1+α⋅vt)\tau_{\text{CFC}}(v_t)=\tau_0/(1+\alpha\cdot v_t)。运动越快,阈值越紧,强迫重新计算;运动越慢,阈值接近基础值,安全跳过。

感知对齐的探测——显著性加权漂移(SWD):计算探针输出在通道维度上的方差作为空间显著性图 SS,归一化后对逐空间位置的探针漂移进行重加权:δtSWD=1HW∑h,w∥zt(k)(h,w)−zt−1(k)(h,w)∥1⋅(1+βsS^h,w)\delta_t^{\text{SWD}} = \frac{1}{HW}\sum_{h,w}\|\mathbf{z}_t^{(k)}(h,w)-\mathbf{z}_{t-1}^{(k)}(h,w)\|_1 \cdot (1+\beta_s \hat{S}_{h,w}) 。这样,前景变化会放大漂移信号从而触发重算,而背景起伏则被抑制。跳过决策即当 δtSWD<τCFC(vt)\delta_t^{\text{SWD}} < \tau_{\text{CFC}}(v_t) 时成立。

最优特征近似(OFA):当跳过发生时,OFA 用两个算子改进缓存特征的复用质量。

  • 最优状态插值(OSI):将特征演化建模为向量投影问题,利用最小二乘法求解加权系数 γ∗=⟨Δtgt,Δsrc⟩/(∥Δsrc∥2+ϵ)\gamma^* = \langle\Delta_{\text{tgt}}, \Delta_{\text{src}}\rangle / (\|\Delta_{\text{src}}\|^2+\epsilon),然后通过 z^t(N)=zt(0)+rt−2+γ∗(rt−1−rt−2)\hat{\mathbf{z}}_t^{(N)} = \mathbf{z}_t^{(0)} + \mathbf{r}_{t-2} + \gamma^*(\mathbf{r}_{t-1}-\mathbf{r}_{t-2}) 近似输出。这避免了传统标量比值方法在特征轨迹弯曲时沿陈旧方向外推的问题。
  • 运动补偿特征形变:通过隐空间多尺度相关性估计位移场 ut→t−1\mathbf{u}_{t\to t-1},将缓存特征形变到当前坐标框架后再进行 OSI。这减少了空间漂移,对自回归世界模型尤为重要。为防止低信噪比阶段的不可靠形变,前五个去噪步骤禁用该操作。

阶段感知缓存调度——自适应阈值调度(ATS):去噪早期结构形成阶段需保守跳过,晚期细节细化阶段可大幅放松。因此阈值乘以一个随步骤递增的因子 τATS(t)=τCFC(vt)⋅(1+βd⋅t/T)\tau_{\text{ATS}}(t)=\tau_{\text{CFC}}(v_t)\cdot(1+\beta_d \cdot t/T),在 t=2t=2 时因子约 1.2,在 t=32t=32 时可达约 4.6,从而实现后期的高缓存命中率与加速。后续消融实验表明,ATS 带来的质量损失低于 0.6%(见论文 4.3 节)。

这四个模块全部训练无关,仅需极小的额外计算开销。

创新点和贡献

  1. 问题形式化:首次将 DiT 世界模型的缓存问题形式化为动态近似问题,并明确指出现有方法中零阶保持假设是导致动态场景重影、模糊和运动不一致的根源。
  2. 一体化的缓存决策与近似:提出 WorldCache 框架,从运动和显著性两个维度改进了 “何时跳过” 的决策,并通过最小二乘最优混合和运动补偿形变改进了 “如何近似” 的质量。
  3. 阶段自适应:引入去噪阶段感知的阈值调度,在早期保持保真度,在晚期释放加速潜力,实现了加速与质量的强边界。
  4. 跨模型与模态可迁移:在 Cosmos-Predict2.5 和 WAN2.1 两个不同模型族的实验证明了方法的泛化性;在文本到世界和图像到世界两种条件下均有效。在 14B 参数规模上同样保持优势。

实验结果分析

所有评估在 PAI-Bench 物理 AI 基准上完成,包含领域得分(物理合理性)和质量得分(视觉保真度),并记录端到端延迟与加速比。

Cosmos-Predict2.5 上的表现:在文本到世界(T2W)任务中,2B 模型上 WorldCache 获得 2.1 倍加速,总体得分 0.745 vs. 基准 0.748(见表 3.6.2),DiCache 仅 1.3 倍且得分 0.743,FasterCache 1.6 倍但得分 0.652。在图像到世界(I2W)任务中,2B 模型达到 2.3 倍加速,总体得分 0.798 vs. 基准 0.803(表 4.2);14B 模型则达到 2.18 倍加速,得分 0.813 vs. 基准 0.814。WorldCache 在增大模型规模时也维持了加速与质量的最优平衡。

跨模型族迁移:在 WAN2.1 上同样体现出优势。例如 WAN2.1-1.3B 的 T2W 任务上,WorldCache 相比 DiCache 将加速从 1.96 倍提升至 2.36 倍,且总体得分从 0.7703 提升至 0.7721(见表 4.2 中表 3)。在 EgoDex-Eval 机器人操作评估中,WorldCache 同样实现了更优的质量-延迟边界。

消融研究:逐步增加 CFC、SWD、OFA、ATS,表明 CFC 安全地提供加速,SWD 通过聚焦显著区域提升命中率,OFA 以略降吞吐为代价换取了更高的保真度,ATS 最终释放了晚期细化阶段的加速潜力,使加速比从 1.49 倍跃升至 2.3 倍,而总体得分仅损失 0.6%(见论文表 4)。超参数敏感性和近似算子选择也通过实验得到验证。

定性结果:可视化对比中,WorldCache 缓解了 DiCache 在动态场景中的重影、变形和运动不一致(图 5, 7, 8),尤其在前景实体和手-物交互等高显著性区域。

实践建议

WorldCache 作为一个即插即用的训练无关加速模块,可直接应用在已有视频世界模型推理管线中,无需重新训练或修改模型权重。实际部署时,可考虑以下几点:

  • 参数固化与调优:论文已给出了跨模型和任务均有效的默认超参数(τ0=0.08\tau_0=0.08, α=2.0\alpha=2.0, βs=0.12\beta_s=0.12, βd=4.0\beta_d=4.0),新场景下可以此为基础,在小规模验证集上微调运动灵敏度、显著性权重和晚期松弛速率。
  • 硬件与任务适配:在单张 H200 GPU 上实现 2.3 倍加速,但不同 GPU 或更大模型可能需要不同的延迟-保真度权衡。可先固定 OFA 的形变比例(如 0.5)和 OSI 的增益夹界,再调整 CFC 的 α\alpha 和 ATS 的 βd\beta_d 来控制缓存激进程度。
  • 边缘场景处理:论文指出剧烈视角跳变或重度遮挡会降低缓存命中率,建议在应用中监控连续缓存命中次数或漂移统计,当命中率骤降时可退化为全执行,保证生成质量。
  • 世界模型自回归部署:由于错误会累积,强烈建议使用形变补偿的 OFA 并适当延长前几步禁止跳跃,确保早期结构稳定。
  • 扩展到其他 DiT 视频模型:WorldCache 的探针深度 kk 和缓存槽位(论文采用基于步数奇偶的乒乓缓冲)可根据具体模型的层数和去噪步数略作调整,但框架保持不变,迁移成本较低。

通过上述措施,WorldCache 可帮助研发团队以近乎无损的质量换来 2 倍以上的推理加速,从而推动视频世界模型在交互式仿真和实时决策中的应用。