GraphVid:交互式图可控视频生成

arXiv: 2607.21580v1

论文信息

标题: GraphVid: Interactive Graph-Controllable Video Generation

作者: Vedant Shah, Onkar Susladkar, Tushar Prakash, et al.

发布日期: 2026-07-23

arXiv ID: 2607.21580v1

PDF 链接: 下载 PDF

引言:视频生成的可控性困境

近年来,图像到视频生成技术取得了长足进步,但如何精确控制视频中多个对象的交互动态,仍然是该领域的核心难题。现有方法主要依赖文本提示或运动轨迹作为控制信号。文本提示语义丰富但空间约束模糊,难以描述 “物体 A 推开物体 B” 这类需要明确空间指向的动作。轨迹驱动方法虽然精确,却要求用户为每个对象绘制精确的运动路径,在遮挡、重叠或场景物体增多时,操作异常繁琐且容易失控。更关键的是,这两类控制手段都忽视了物体运动背后的物理因果关系——运动不仅是像素位移,更是实体间相互作用的结果。

针对这一空白,本文提出 GraphVid,一种基于场景图的可控图像到视频生成框架。它将用户意图表达为一张有向的交互场景图,图中节点代表场景实体,边描述实体间的交互关系(如推、拉、握住),并直接将图结构注入冻结的视频扩散主干,驱动视频生成。这种方式让用户以直观的 “谁对谁做了什么” 来控制运动,极大降低了多对象视频编辑的门槛。

核心思想:用交互图驱动运动

GraphVid 的工作流程始于一张输入图像。系统首先用视觉语言模型检测图像中的物体,构建节点,并提取物体之间的交互边,形成一张初始交互图。用户可以在图上直接编辑,增加、删除或修改边,甚至调整交互方向与力度,来描述想要发生的动作。编辑后的图通过一套 “图到令牌” 的适配器,转换为扩散模型能理解的调节令牌,最终由冻结的视频 DiT(Diffusion Transformer)生成连贯的视频序列。

这个过程的关键在于,图不仅仅对 “谁和谁有关系” 进行拓扑编码,还通过边属性注入交互语义,例如 “推” 与 “拉” 在图上对应不同边,会使物体产生截然相反的运动。GraphVid 提出边感知图推理模块(Edge-Aware Graph Reasoning),用 GINEConv(图同构网络卷积)替代传统的图卷积网络,在消息传递时显式融合边特征:每个节点的更新不仅来自邻居节点的状态,还来自它们之间交互类型的编码。这样,物体节点的表示就能同时感知自身身份、空间位置以及它与其他对象的互动关系,为下游生成器提供动态敏感的调节信号。

整个视频生成骨干 LTX-Video 保持冻结,只通过低秩适应(LoRA)在注意力层注入可训练参数。这种参数高效的设计不仅保留了预训练模型强大的生成先验,还将可训练参数量控制在仅 0.6B,远低于现有方法(通常 1B~14.5B),大幅降低了训练成本与推理时间。

技术细节:从图到视频的适配

节点和边编码

物体节点由视觉特征、文本标签和归一化边界框坐标拼接而成。视觉特征提取自物体裁剪区域的编码,文本标签使用 Qwen3 嵌入模型向量化,形成 10756 维的节点特征。每条边则用开放式词汇的文本描述表示,同样编码为 2560 维向量,以保留交互的语义丰富性。

边感知图推理

节点与边特征被各自线性层投影到 512 维共享空间,然后经过多层 GINEConv 传播。每层的前向公式为:

hi(l+1)=MLP(l)(hi(l)+jN(i)ReLU(hj(l)+aji))\mathbf{h}_i^{(l+1)} = \text{MLP}^{(l)} \left( \mathbf{h}_i^{(l)} + \sum_{j \in \mathcal{N}(i)} \text{ReLU}(\mathbf{h}_j^{(l)} + \mathbf{a}_{ji}) \right)

这里 aji\mathbf{a}_{ji} 是边 (j,i)(j,i) 的特征映射。与标准 GCN 不同,边属性直接加在邻居节点表示上再参与聚合,使交互语义影响节点的最终状态。经过多层传播后,每个节点获得富含关系上下文的嵌入。

图到视频适配器和训练

节点嵌入经一个 3 层 MLP 投影到 DiT 的 4096 维隐藏空间,成为调节令牌。这些令牌与边文本令牌一起作为编码器隐藏状态输入 DiT 的交叉注意力层。训练时仅更新 GNN、MLP 适配器与 LoRA 参数,使用流匹配损失:

LCFM(θ)=EcI0,GEtp(t)Ex0pdata(c), x1N(0,I)[vθ(xt,t,c)(x1x0)22].\mathcal{L}_{\mathrm{CFM}}(\theta) = \mathbb{E}_{\mathbf{c}\sim \mathcal{I}_0, G}\, \mathbb{E}_{t\sim p(t)}\, \mathbb{E}_{\mathbf{x}_0\sim p_{\mathrm{data}}(\cdot \mid \mathbf{c}),\ \mathbf{x}_1\sim \mathcal{N}(0,\mathbf{I})} \Big[ \big\|\mathbf{v}_\theta(\mathbf{x}_t,t,{\mathbf{c}})-(\mathbf{x}_1-\mathbf{x}_0)\big\|_2^2 \Big].

这种训练策略保证生成模型在保留原有画质和时序一致性的同时,学会遵从图结构指定的交互。

数据集构建:GraphVid-Bench

为了训练和评估交互感知的视频生成模型,作者从 WISA-80K、Something-Something v2 和 MagicData 三个开放数据集中筛选约 27K 个视频片段,并为其匹配交互图。筛选过程用视觉语言模型剔除摄像机运动或环境流动占主导的片段,只保留由固体对象之间离散物理作用驱动的视频。为了捕捉最活跃的交互瞬间,还设计了基于运动能量滑窗的裁剪算法,选择帧间像素差异最大的 81 帧作为训练片段。最终,每个视频对应一张交互图,图平均包含 7.76 个节点和 4.85 条边,覆盖推力、拉力、支撑、碰撞等二十余种典型交互类型,其中超过 46% 的样本包含多个同时发生的交互。这为模型学习真实世界中复合的、关系驱动的动态提供了重要基础。

实验结果:小模型的大能量

在交互中心的 MoveBench 子集上,GraphVid 取得了全面的优越性能。与最接近的物理感知方法 WISA 相比,FID 降低 34.5%(25.98→17.02),FVD 降低 7.8%(107.89→99.42),同时 PSNR 提升 5.9%,SSIM 提升 15.0%,端点误差 EPE 也从 4.1 降至 2.9(降幅 29.3%)。这些数据表明,图结构提供的显式关系建模比纯文本物理属性更能让视频生成忠实于交互指令,同时保持帧间的结构一致。

与轨迹驱动方法相比,GraphVid 同样优势明显。相较 Motion-I2V,FID 与 FVD 分别降低 39.9% 和 37.6%,PSNR 从 9.87 跃升至 15.98,SSIM 从 0.38 翻倍至 0.61,甚至运动误差也降低了 25.6%(EPE 3.9→2.9)。在与 MagicMotion、FlashMotion 和 Tora 的对比中,GraphVid 也均以最低的 FID 和 EPE 胜出,证明其无需稠密运动监督就能生成更符合交互语义的流畅运动。

当场景变复杂,涉及多个物体同时交互时,GraphVid 仍保持优势。在多对象 MoveBench 子集上,其 FID(49.45)比同样数据量级的 FlashMotion 低 10.1%,FVD(291)低 6.4%,EPE(3.0)也为最优。值得注意的是,GraphVid 仅用 27K 视频和 0.6B 可训参数,便接近或超越了训练数据量和参数量均大一个数量级的模型。消融实验进一步揭示:承载交互语义的边特征至关重要,移除此信息会导致 FVD 升高、画面失真;图节点容量设为 30 时效果最佳,过多的空白填充会稀释注意力;LoRA 秩越高,生成质量越好,但 128 已基本饱和。

实践应用建议与未来方向

GraphVid 的交互图接口大幅简化了视频编辑中多对象控制的表达,可广泛应用于下列场景:

  • 创意内容生产:动画师只需在静态分镜上拖拽关系箭头,即可快速预览角色之间的推拉、对视、击打等动作,提升分镜迭代速度。
  • 物理教育仿真:教师可在静态实验装置图上添加 “施加推力”“松开支撑” 等交互边,动态生成演示物理定律的视频片段。
  • 具身智能研究:通过图描述机械臂与物体的交互关系,可合成大量带精确操控标注的训练数据,用于机器人策略的学习。
  • 交互式视频编辑工具:集成至剪辑软件,让非专业用户也能用 “谁碰谁” 的自然语言控制画面运动。

未来,有几个方向值得进一步探索:

  1. 细粒度物体检测与分割:当前零样本检测器对微小或符号性物体(如文字、烟圈)容易遗漏,导致运动错误地施加到附近大物体上。引入交互式分割或用户辅助画框可提升控制精度。
  2. 时序图扩展:目前图只描述全局交互,无法表达 “先推后拉” 等时序行为。赋予图时序维度,或将其与视频的时间步调节相结合,将大幅增强叙事控制。
  3. 物理真实性增强:可将交互图与轻量物理引擎(如刚体模拟)结合,用图定义边界条件,用物理模拟确保碰撞、摩擦、重力等约束不被违反,使生成的运动更符合物理规律。
  4. 开放域交互库:进一步扩大 GraphVid-Bench 的覆盖范围,纳入更多罕见交互(如扭曲、编织)和复杂多级因果关系,增强模型对长尾动力学的泛化能力。

总结与展望

GraphVid 提出了一种崭新的可控视频生成范式:将多对象交互抽象为有向场景图,并通过边感知图神经网络和参数高效的适配机制,将关系推理注入冻结的视频扩散模型。这一设计回避了传统轨迹信号操作的繁琐,以直观、语义化方式实现了复杂动力学的精准控制。实验充分证明,哪怕使用极小的训练数据和参数量,结构化交互图仍能带来显著的画质、时序一致性和运动准确度提升。这标志着从 “像素运动控制” 到 “关系理解驱动生成” 的重要跨越。随着交互图表达与时序、物理引擎的深度融合,未来视频生成将更接近人类的因果思维方式,为创意、仿真和教育领域开拓前所未有的可能性。