OpenCoF:通过视频生成学习推理
论文信息
标题: OpenCoF: Learning to Reason Through Video Generation
作者: Xinyan Chen, Ziyu Guo, Renrui Zhang, et al.
发布日期: 2026-07-09
arXiv ID: 2607.08763v1
PDF 链接: 下载 PDF
视频生成如何成为推理新路径:OpenCoF 框架深度解析
背景:从思维链到帧链推理
近年来,大语言模型与多模态模型的推理能力受到广泛关注。主流的视觉思维链方法多依赖于静态图像、外部工具或辅助图像生成,难以内在地建模动态变化和多步视觉因果。视频生成模型的快速进步带来了另一种可能:让推理过程在连续帧的时间演化中自然展开,即 “帧链”(Chain-of-Frame, CoF)推理。模型不再仅依靠文字步骤,而是通过生成一系列逻辑连贯的视频帧来展示物理变化、规则推演或空间变换。
然而,现有视频生成器大多在通用视频数据上训练,缺乏针对推理的多样化时间监督,导致在长时间连贯性、物理一致性和逻辑连续性上仍存在不足。为填补这一空白,字节跳动与香港中文大学的研究者提出了 OpenCoF 框架,试图系统性地增强视频模型的 CoF 推理能力。
核心方法:数据集构建与模型设计
OpenCoF 框架由两部分组成:OpenCoF-17K 数据集和在其上微调的模型 Wan-CoF,以及后续的推理令牌机制。
OpenCoF-17K:多样化推理视频数据集
OpenCoF-17K 共包含 17,312 个视频,横跨 11 个任务家族,包括国际象棋、数独、二维几何、点连线、七巧板、立方体折叠、三维多立方体旋转、物理运动、迷宫、具身操控以及一个复合认知任务子集 VBVR。其构建采用四种互补策略,以保证数据的多样性和可扩展性:
- 实例化渲染:从结构化资产(如棋盘状态)中采样实例,通过代码渲染生成视频。例如将象棋的 “一步杀” 局面和数独解题过程转为视频帧序列。
- 专家引导渲染:利用人类专家、大型语言模型或文生图模型生成概念和标注,再通过代码转换成逐步动画。如几何题辅助线绘制、点连线图案逐步连接。
- 程序化场景合成:通过随机种子初始化场景参数,使用物理引擎或图形管线动态渲染。涵盖七巧板拼搭、立方体折叠、多立方体旋转和不同摩擦系数下物体的物理运动。
- 外部视频再利用:从已有高质量数据集中抽取并统一格式,如迷宫导航数据、具身操控演示等。
所有视频统一为 480p、15 fps、81 帧,便于条件生成训练(首帧条件 + 文本提示 → 目标视频)。
Wan-CoF:数据驱动的基线提升
研究者选取开源视频生成模型 Wan2.2-I2V-A14B 作为骨干,直接在 OpenCoF-17K 上使用 LoRA 微调,得到 Wan-CoF。这一阶段未引入任何专用推理模块,目的在于验证纯时间监督能否有效激发 CoF 行为。实验采用四个外部视频推理基准进行评估:MME-CoF、Gen-ViRe、VIPER 和 RULER-Bench,这些基准的任务分布均不同于训练集,可以检验模型的泛化性。
推理令牌:为中间推理状态提供显式载体
在 DiT(Diffusion Transformer)架构中,推理过程隐含于视觉潜在表示和文本条件中,缺乏专门的推理状态维护通道。为此,研究者设计了两种互补的推理令牌:
- 视觉推理令牌(vt):在视觉令牌序列前插入可学习的令牌,参与所有自注意力模块。它们能与视觉令牌双向交互,聚合全局上下文并反馈给各个空间-时间位置,更适合捕获低层视觉线索和维持全局空间规划。
- 文本推理令牌(tt):在文本条件序列前追加可学习的令牌,仅在交叉注意力中作为额外的键/值对供视觉令牌查询。它们不参与自注意力更新,共享到所有帧和空间位置,提供高层语义先验和任务级指导。
两种令牌在推理时均被丢弃或不影响最终输出,仅作为中间状态的暂存器。研究者分别训练了包含 vt 或 tt 的模型版本(Wan-CoF^{vt} 和 Wan-CoF^{tt})进行对比。
创新点与贡献
- 首个大规模公开 CoF 推理视频数据集:OpenCoF-17K 通过 4 种互补策略覆盖 11 类任务,为研究视频生成中的推理提供了丰富、标准化且可扩展的监督资源。
- 证明多样化时间监督的迁移价值:仅通过数据微调,Wan-CoF 在零样本泛化到四个独立基准时,整体指标均有明显提升,尤其在物理、空间、算法逻辑等推理子维度上增益显著,说明训练带来了可迁移的推理技能,而非简单的视觉质量优化。
- 提出并分析视觉/文本推理令牌:首次在视频生成器内部显式构建推理状态缓存,并通过性能对比和注意力分析揭示了两种令牌的互补特性:vt 擅长空间规划和视觉稳定性,tt 擅长指令对齐和结构推理。
- 系统的注意力行为研究:从模型深度、去噪步数、空间位置和时间维度四个角度分析令牌的作用模式,为理解视频模型中的推理机制提供了新视角。
实验结果分析
在四个基准上,Wan-CoF 均超越未微调的 Wan2.2 基线,并且大幅缩小了与商业闭源模型(如 Sora-2、Veo-3)的差距。例如,MME-CoF 整体评分从 1.00 提升至 1.30(+0.30),Gen-ViRe 平均分从 0.304 到 0.391(+0.087),VIPER 的 POC 指标从 3.3 到 7.5(+4.2)。在类别级迁移上,观察到明显的对应关系:物理运动训练提高了 VIPER 物理得分,棋类和迷宫训练提升了 Gen-ViRe 的算法逻辑能力,空间几何训练增强了感知和空间推理。
引入推理令牌后,vt 和 tt 进一步提升了指标,但各有侧重:vt 在需要维持全局计划的维度(如 VIPER 规划、Gen-ViRe 抽象与类比)表现更优;tt 在需要上下文独立语义引导的维度(如 MME-CoF 指令对齐)更突出。注意力可视化显示:vt 的注意力分散且呈现轴对齐的带状模式,强调局部线索和起止帧;tt 的注意力更平滑,覆盖关键场景区域且在整个时间范围内平稳。
实践应用建议与未来方向
OpenCoF 的工作对于将视频生成应用于逻辑推理、教育、机器人规划等领域具有启发意义。
- 构建领域推理数据集:可参照其四管道策略,针对特定应用(如物理实验演示、装配指导、游戏 AI)生成标准化视频,训练具有领域推理能力的模型。
- 推理令牌的工程化应用:在视频生成模型中嵌入可学习的视觉或文本令牌,能以较低参数成本提升对规则、计划和物理约束的遵循度,适合用于可控视频生成或仿真环境。
- 未来研究方向:
- vt 与 tt 的融合:当前二者分别训练,如何有效结合以获取互补优势是直接延伸。
- 动态令牌分配:根据任务难度或去噪阶段自适应地增减推理令牌数量,提升效率。
- 从仿真到真实环境的迁移:在更多样化的真实场景中验证 CoF 推理能力,并与具身智能决策结合。
总结与展望
OpenCoF 通过构建大规模、多样化的推理视频数据集,并探索显式推理令牌机制,系统性地增强了视频生成模型的 CoF 推理能力。实验证明,单纯的数据多样性已能带来可观的泛化增益,而专用的推理令牌则为模型提供了更清晰的推理状态组织方式。这项研究不仅在视频生成社区确立了 “帧链推理” 的实用基线,也为未来多模态推理系统的设计提供了全新的架构思路。随着视频生成质量的持续跃升,让模型学会 “通过生成来思考” 或许将成为强推理能力的重要实现路径。