GraphVid:交互式图可控视频生成
GraphVid: Interactive Graph-Controllable Video Generation
论文信息
标题: GraphVid: Interactive Graph-Controllable Video Generation
作者: Vedant Shah, Onkar Susladkar, Tushar Prakash, et al.
发布日期: 2026-07-23
arXiv ID: 2607.21580v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:这篇论文旨在解决可控视频生成中多物体交互控制的难题,现有方法依赖文本或密集轨迹信号,难以灵活、精准地描述对象间的物理关系。
- 核心方法:提出 GraphVid,一种以有向交互场景图为控制接口的图像到视频生成框架,通过边感知图神经网络对关系进行建模,并将图结构注入冻结的视频扩散变换器进行生成。
- 关键结果:仅使用 27K 训练视频和 0.6B 可训练参数,GraphVid 在交互中心的 MoveBench 子集上 FID 降至 17.02,比 Physics‑centric 的 WISA 低 34.5%,比 Motion‑I2V 低 39.9%(表 2)。
- 主要局限:当视觉语言模型未能检测到细粒度、弱纹理的语义元素(如 “zzz” 睡眠符号)时,交互会被错误关联到附近的较大物体上,导致运动失真(见附录 F 失败案例)。
- 适合读者:从事视频生成、视觉关系建模、人机交互或物理仿真研究,并对轻量化可控生成技术感兴趣的读者。
论文背景和研究动机
图像到视频(I2V)生成正从单纯的视觉合成迈向精细可控。传统方法如轨迹引导(Motion‑I2V、DragAnything)或文本属性注入(WISA),往往要求用户为每个物体绘制精确的运动轨迹或定义复杂的物理描述,在多物体场景中操作负担极重,且难以捕捉 “推”、“拉”、“支撑” 等关系性语义引发的动态。论文指出三大痛点:①现有物理感知方法将交互编码为低层控制场或固定类别,无法表达开放场景中多实体间的复杂关系;②轨迹控制对每类对象要求密集标定,微小错误就会导致穿模、错位等全局不合理运动;③训练数据需百万级带有轨迹或光流的标注,成本高昂。因此,作者提出用交互场景图作为更高层的语义接口,允许用户通过修改关系边直观地指定物体间的相互作用,从而将控制模式从 “怎样运动” 转向 “谁对谁做了什么”。
核心方法和技术细节
GraphVid 的 pipeline 包含三个核心模块:交互图构建与编辑、边感知图推理以及图到视频适配器。
给定一帧输入图像 I₀,首先通过预训练视觉语言模型(Qwen3‑VL)检测实体并提取视觉和文本特征,构造有向图 G=(V,E)。节点包含物体的视觉嵌入、文本标签和归一化边界框,边则编码开放词汇的关系描述(如 “person pushes box”),同时可携带力方向、大小等物理线索。用户通过直接编辑图来添加或修改边,即可指定交互动态。
为避免将关系图简化为纯邻接耦合,GraphVid 采用 边感知图同构网络(GINEConv) 进行消息传递。不同于普通 GCN,GINEConv 将边特征 a_{ji} 直接注入节点更新过程:
这使得节点的表示不仅编码物体身份,还嵌入了它所承受的关系动因(如 “被推” vs “被拉” 会在节点更新中产生不同响应)。经过 L 层推理后,得到交互感知节点嵌入 h_i,它们被映射为与冻结视频扩散变换器(LTX‑Video)潜空间维度匹配的语义标记 z_i。
为了保持预训练模型的强大生成先验,扩散主干(DiT)和 VAE 均被冻结,只在注意力层注入低秩适应(LoRA)模块(秩 128),并训练一个小型 MLP 将图标记投影到变换器输入。训练目标采用流匹配损失,只更新 GNN、MLP 适配器和 LoRA 权重。数据集 GraphVid‑Bench 由约 27K 视频组成,每段视频配有高质量的交互图,平均每个图包含 7.76 个节点和 4.85 条边,其中有 12,641 个样本包含多个交互,确保了模型对复合动力学的学习能力。
创新点和贡献
论文的主要创新可归纳为三层:
- 图控视频生成范式:首次将交互图作为控制信号引入 I2V,用户可以直接编辑对象间的关系来指定多物体动作,而无需绘制轨迹或编写物理宏指令。
- 边感知图推理:通过 GINEConv 将边的语义(关系类型)显式整合到消息传递中,使节点更新受物理因果关系驱动,从而编码 “力” 的流向。
- 轻量高效的条件注入设计:在冻结的 DiT 上仅用 LoRA 和 MLP 适配器将图信息注入,全流程可训练参数仅 0.6B,推理速度最快(200 秒),训练数据仅需 27K,实现了高效率与强可控性的平衡。
此外,作者构建的 GraphVid‑Bench 是首个以交互为中心的图控视频生成数据集,为未来的结构化视频控制研究提供了基准。
实验结果分析
定量评估采用 MoveBench 子集(经过视觉语言模型过滤,仅保留含实体交互的片段),并与多种基线对比。表 2 显示,GraphVid 在 FID(17.02)、FVD(99.42)、PSNR(15.98)、SSIM(0.61)上全面优于轻量级模型 WISA 和轨迹方法 Motion‑I2V,同时端点评分(EPE)降至 2.9,表明生成的运动与真实光流更为吻合。在与 FlashMotion、Tora 等轨迹模型的对比中,GraphVid 在仍然无需任何运动标注的条件下,取得了更低的 EPE 和更优的感知质量。值得注意的是,尽管大规模模型 Wan‑Move 在所有指标上最佳,但 GraphVid 以两个数量级更少的训练数据和仅约 1/24 的参数量达到了高度竞争力,突出了图结构作为动态控制信号的表达效率。
消融实验进一步强化了设计合理性:①更换骨干为 Wan 2.2 后性能几乎持平(表 4),证明图表示是模型无关的通用条件输入;②移除边的文本描述后 FID 升至 17.52,EPE 恶化,表明关系的语义标签对消除动作歧义至关重要;③节点数量不宜过多,论文发现当最大节点数设为 30 时性能最佳,过度填充零标记会稀释注意力(表 5);④LoRA 秩由 16 增至 128 会带来持续的性能提升,证实了容量对控制能力的影响(表 7)。
用户偏好研究(附录 D)也表明,GraphVid 在语义意图匹配上赢得 60% 的投票,在视觉质量上赢得 90% 的投票,显著高于 Wan‑Move、Tora 等基线,说明基于交互图的控制更贴合人类对动态场景的直觉。
实践建议
若要复现 GraphVid 或借鉴其交互图控制思路,可关注以下几点:
- 图构建质量:目标检测和关系提取(论文中用 Qwen3‑VL 和 Qwen3‑Embedding)的准确性直接影响可控性。建议对细粒度、遮挡或小尺度对象采用带交互式校正的检测流程,以避免误关联。
- 训练数据集的交互丰度:GraphVid‑Bench 的构建强调通过运动能量窗口筛选交互最密集的视频片段,并剔除相机运动和环境流体运动。在自建数据集时,可采用类似 VLM 分类的策略,确保训练信号聚焦于实体间物理动力学。
- 节点容量与经济性:实验表明,最大节点数 30 即可获得最佳生成质量,再增加节点反而因零填充引入噪声。建议根据实际场景复杂度设置合理的节点上限,并在训练前检查零填充比例。
- 条件注入策略:使用冻结扩散主干+LoRA 的方案可大幅降低计算开销,同时避免灾难性遗忘。在设计新控制信号时,可优先考虑类似轻量适配器,并通过消融确定 LoRA 秩与条件语义的匹配关系。
- 推理时交互编辑:GraphVid 允许用户在推理时修改或增加交互边,因此适合构建交互式创作工具。在工程实现中,可提供一个前端供用户拖拽关系箭头并添加文本描述,后台自动编译为图标记送入生成模型,实现 “所见即所得” 的动态视频生成。
总体而言,GraphVid 展示了结构化语义接口在视频生成中的强大潜力,为上层应用(如动画预览、物理教育模拟)提供了轻量、灵活的控制方案。