跳转至

GraphVid: Interactive Graph-Controllable Video Generation

会议: ECCV 2026
论文: ECCV 原文
项目: https://plan-lab.github.io/graphvid
领域: 视频生成
关键词: 可控视频生成, 交互场景图, 边感知图神经网络, 扩散变压器, 物理关系动力学

一句话总结

GraphVid 提出通过有向交互场景图对单帧图像中的多实体动态进行交互式控制,利用边感知图同构网络将关系语义注入消息传递,并通过轻量级适配器与 LoRA 引导冻结的视频扩散变压器,仅需 0.6B 可训参数与 27K 训练数据即在感知质量与运动精度上超越依赖海量轨迹监督的 SOTA 方法。

研究背景与动机

单图生成视频(Image-to-Video, I2V)的核心难点在于从单张静态画面推断多实体在时空演化中的物理动态与交互因果。当前主流的可控视频生成技术多聚焦于轨迹驱动的运动控制(如 Wan-Move、Motion-I2V、Tora、MagicMotion 等),这类方案本质上将运动建模为低维像素级几何位移,要求用户针对每个目标手动绘制精确的点轨迹、光流或边界框路径。在复杂多物体场景中,手绘轨迹的标注成本随实体数量急剧上升,且在物体发生遮挡、重叠或形态形变时极易产生几何歧义,微小的轨迹冲突便会导致全局不可信的物理瑕疵(如接触面滑动、刚体穿透或动作不同步)。

物理引导的生成方法试图引入外力、速度场或文本物理分类(如 WISA、Force Prompting)来缓解这些问题,但其底层大多将物理规则简化为低级控制场或预设分类标签,缺乏在开放域场景中表达多实体之间复杂因果交互的结构化语义能力。更致命的是,现有轨迹控制模型极度依赖海量标注数据与庞大算力开销,如 Wan-Move 依赖 200 万段视频、Motion-I2V 需要 1000 万样本,且动辄微调数十亿甚至上百亿参数,使得模型在资源受限环境下的泛化与交互微调极为受限。

本文的切入视角在于:真实物理世界中的运动往往源于实体之间的相互作用(如推、拉、举、接触、支撑),而非孤立的点位移。如果能将用户的交互意图显式建模为结构化的有向场景交互图,不仅能降低用户精细手绘轨迹的负担,还能将因果推理机制显式引入生成先验。核心 idea:将多实体运动控制表征为有向交互场景图,通过边感知图同构网络(GINEConv)将关系属性显式融入节点消息传递,并经由轻量图适配器与注意力 LoRA 调制冻结的视频 DiT 骨干,以极低的数据与参数开销实现精准、物理自洽的多物体交互式视频生成。

方法详解

整体框架

GraphVid 建立在预训练视频扩散变压器(以 LTX-Video 为主,亦可无缝切换至 Wan 2.2)之上,保持主干网络与 3D VAE 编解码器完全冻结,仅训练图推理模块、投影适配器与注意力 LoRA。输入单张条件图像 \(I_0\) 后,首先利用视觉语言检测模型抽取场景中的所有前景实体,并结合开放词汇关系提取器或用户交互交互式地构建有向交互场景图 \(\mathcal{G} = (\mathcal{V}, \mathcal{E})\)。图中的节点表征实体,有向边描述施力/交互关系(如 push、pull、lift、hold 等物理动词及粗粒度方向强度;一元动作如旋转、自转则以自环边表示)。随后,节点与边的多模态特征输入边感知图神经网络进行关系演化,生成的交互感知节点隐向量被映射为条件语义 token,与边文本 token 共同注入视频 DiT 的注意力层,在流匹配(Flow Matching)目标下指导动态去噪与时空演化。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入静态图像 I₀ 与用户交互指令"] --> B["场景图构建与多模态表征<br/>实体检测池化与开放词汇交互边构建"]
    B --> C["边感知图推理<br/>GINEConv 显式注入有向边交互属性"]
    C --> D["图到视频适配与骨干调制<br/>隐空间对齐投影与注意力 LoRA 注入"]
    D --> E["输出时空一致交互视频"]

关键设计

1. 场景图构建与多模态表征:解耦结构化实体与开放词汇交互意图

针对传统轨迹输入无法兼顾实体外观细节与物理因果描述的痛点,该设计在单帧输入图像上构建多模态属性图。对于视觉实体提取,利用预训练视觉语言检测器(Qwen3-VL)提取图像中的前景目标,针对每个检测到的实体 \(v_i\),融合三部分信息:从目标边界框 \(b_i\) 区域进行均值与最大池化得到的局部视觉表征 \(f_i^{vis} \in \mathbb{R}^{8192}\)、编码目标类别标签的文本嵌入 \(f_i^{txt} \in \mathbb{R}^{2560}\),以及归一化的四维边界框坐标 \(b_i \in \mathbb{R}^4\)。将三者拼接得到综合节点表征 \(x_i = [f_i^{vis}; f_i^{txt}; b_i] \in \mathbb{R}^{10756}\),同时捕获外观、语义类别与空间定位。对于实体间的交互边 \(e_{ij}\),允许开放词汇的用户自然语言描述(如“woman moves closer to viewer”、“hand grips cup”),通过 Qwen3-Embedding 编码为关系特征 \(e_{ij} \in \mathbb{R}^{2560}\)。自环边 \(e_{ii}\) 则承载单实体的独立形变或位移指令,从而将复杂的视觉场景完全解耦为图拓扑与多模态语义。

2. 边感知图推理:将有向交互语义直接注入图消息传递

标准图卷积网络(GCN)通常将边视作无差别的二值连接,仅单纯聚合邻域节点特征,这在物理交互建模中存在严重缺陷:不同类型的相互作用(如“推”与“拉”、“支撑”与“碰撞”)产生完全相反的受力状态与运动轨迹,忽视边语义将使模型退化为纯空间邻近性平滑。为突破该瓶颈,GraphVid 采用边感知图同构网络(GINEConv)。节点与边特征首先通过可学习多层感知机映射至共享隐空间 \(d = 512\)\(h_i^{(0)} = \omega_n(x_i)\)\(a_{ij} = \omega_e(e_{ij})\)。随后在 \(L\) 层 GINEConv 中进行关系加权消息传递:

\[h_i^{(l+1)} = \text{MLP}^{(l)}\left( h_i^{(l)} + \sum_{j \in \mathcal{N}(i)} \text{ReLU}\left( h_j^{(l)} + a_{ji} \right) \right)\]

通过将有向交互属性 \(a_{ji}\) 显式加和进邻居状态聚合中,每个实体节点的更新不仅依赖其邻居实体的空间状态,更受制于两者之间的交互物理语义。经过多层消息传递后,节点表征 \(h_i \in \mathbb{R}^{512}\) 编码了该实体在全局因果链条中的角色以及受力后预期的动态行为。

3. 图到视频适配与骨干调制:以极低可训参数保留生成先验并对齐物理动力学

为了避免从头训练数十亿参数视频生成模型导致的巨大算力消耗及泛化先验遗失,GraphVid 采取完全冻结主干与轻量级适配策略。将各节点经过图推理得到的特征 \(h_i\) 通过适配器 \(\text{MLP}(h_i)\) 投影至 DiT 的隐空间维度 \(d_l = 4096\),得到语义条件 token \(z_i\)。为了适配不同场景中物体数量的变化,节点序列被固定截断或补零至最大容量 \(N_{max} = 30\)。这些节点 token 与边文本 token 拼接后作为 encoder hidden states 传入 DiT。与此同时,在 DiT 各层的 Query、Key、Value 与 Output 投影矩阵中插入 rank=128 的低秩自适应(LoRA)模块。冻结原有的注意力权重,仅通过 LoRA 权重学习如何根据图 token 调制视频特征的时空注意力关联,全流程仅需优化 0.6B 可训参数。

4. 交互中心数据集构建:覆盖多实体动力学与复合交互原语

缺乏配对的交互图-视频监督数据是阻碍结构化视频控制的核心瓶颈。本文为此构建了 GraphVid-Bench 数据集,共包含约 27K 条交互中心视频片段,统一截取为 81 帧 @ 16 fps。每条视频均配对结构化有向交互图,平均每图包含 7.76 个节点与 4.85 条交互边。数据集覆盖力学与操作(force & manipulation)、运动学与运动(kinematics & motion)、物理接触(physical contact)、支撑与位置(support & position)四大交互体系。在样本分布上,10,982 条样本包含单一交互,12,641 条包含两个及以上复合交互(\(N > 1\)),另有 3,881 条无交互(\(N = 0\))自然运动样本作为背景动态与基线先验,为模型学习不同交互引入后的物理状态迁移提供了坚实数据基础。

损失函数 / 训练策略

训练过程采用标准条件流匹配(Conditional Flow Matching, CFM)目标。对于目标视频 \(x_0\),使用预训练 3D VAE 编码为隐空间表征,从 Logit-Normal 分布中采样时间步 \(t \in p(t)\),并按照线性插值方式注入高斯噪声构造加噪潜变量 \(x_t = (1 - t)x_0 + t x_1\)(其中 \(x_1 \sim \mathcal{N}(0, \mathbf{I})\))。模型学习速度场预测网络 \(v_\omega(x_t, t, c)\),目标为最小化与理想向量场之间的均方误差:

\[\mathcal{L}_{CFM}(\omega) = \mathbb{E}_{c \sim \{I_0, \mathcal{G}\}, t \sim p(t), x_0 \sim p_{data}(\cdot|c), x_1 \sim \mathcal{N}(0, \mathbf{I})} \left\| v_\omega(x_t, t, c) - (x_1 - x_0) \right\|_2^2\]

优化过程中,3D VAE、Qwen3 特征提取器及 DiT 原生权重完全冻结,仅更新 GNN 参数、投影适配器及 LoRA 权重,实现了从符号化交互图到连续物理隐空间的端到端端可微训练。

实验关键数据

主实验

在交互中心 MoveBench 基准子集上,GraphVid 与代表性轨迹控制及物理引导模型进行了综合评测。评价指标包括反映视觉质量与时间一致性的 FID、FVD,度量图像重建精度的 PSNR、SSIM,以及衡量光流运动跟踪误差的端点误差(End-Point Error, EPE)。

方法 训练数据量 可训参数量 (B) 推理耗时 (s) ↓ FID ↓ FVD ↓ PSNR ↑ SSIM ↑ EPE ↓
Wan-Move 2M 14.5 1800 15.56 82.17 17.21 0.61 2.6
Motion-I2V 10M 1.2 790 28.32 159.32 9.87 0.38 3.9
Tora 630K 5.0 1200 24.45 110.47 11.27 0.54 3.3
MagicMotion 23K 1.5 750 26.57 105.12 12.04 0.51 3.2
WISA 80K 1.0 1000 25.98 107.89 15.08 0.53 4.1
FlashMotion 23K 13.0 677 19.02 104.12 14.04 0.56 3.8
GraphVid (Ours) 27K 0.6 200 17.02 99.42 15.98 0.61 2.9

在多物体复杂交互场景(Multi-object MoveBench)下,GraphVid 同样表现出色,保持了极强的时空结构一致性:

| 方法 | 训练数据量 | 可训参数量 (B) | FID ↓ | FVD ↓ | PSNR ↑ | SSIM ↑ | EPE ↓ | |---|---|---|---|---|---|---| | Wan-Move | 2M | 14.5 | 31.29 | 252.0 | 16.69 | 0.61 | 2.2 | | Tora | 630K | 5.0 | 56.04 | 369.0 | 14.98 | 0.52 | 3.5 | | WISA | 80K | 1.0 | 60.12 | 341.0 | 13.13 | 0.55 | 3.9 | | FlashMotion | 23K | 13.0 | 55.03 | 311.0 | 12.12 | 0.52 | 3.9 | | GraphVid (Ours) | 27K | 0.6 | 49.45 | 291.0 | 14.44 | 0.55 | 3.0 |

消融实验

消融实验深入验证了条件输入模态、上下文节点预算容量、骨干模型可迁移性及 LoRA 秩对生成效果的影响。

配置 / 变体 FID ↓ FVD ↓ PSNR ↑ SSIM ↑ EPE ↓ 说明
文本 + 图像基线 (LTX) 20.04 109.34 11.23 0.53 3.6 仅用全局文本与单图,实体运动绑定极易混乱
仅拓扑图 (无边文本描述) 17.52 101.32 16.88 0.60 3.0 缺失边文本语义,难以区分推/拉等对立动作
完整图条件 (GraphVid) 17.02 99.42 15.98 0.61 2.9 拓扑与交互属性结合,动态逼真且运动最准
节点容量 \(N_{max}=10\) 17.25 102.04 15.56 0.60 - 节点截断过早,复杂场景丢实体信息
节点容量 \(N_{max}=30\) 17.02 99.42 15.98 0.61 - 最佳平衡点,避免过多 zero-padding 稀释注意力
节点容量 \(N_{max}=256\) 17.97 109.92 13.77 0.57 - 冗余 padding token 引入噪声并稀释注意力
骨干替换为 Wan 2.2 (5B) 17.29 100.01 15.70 0.60 3.1 验证架构通用性,在不同 DiT 上表现稳定
LoRA 秩 Rank=16 18.34 103.18 13.70 0.58 - 容量较小,难以拟合复杂外观变化
LoRA 秩 Rank=128 17.02 99.42 15.98 0.61 - 兼顾表达力与计算开销的默认设置

关键发现

  • 结构化交互图显著优于纯轨迹监督:相比依赖密集光流/点轨迹的 Motion-I2V,GraphVid 在仅用 27K 数据训练的情况下,FID 降低 39.9%(28.32 \(\to\) 17.02),FVD 降低 37.6%(159.32 \(\to\) 99.42),且光流端点误差 EPE 从 3.9 降至 2.9,证明语义层面的关系引导提供了更强且更紧凑的物理归纳偏置。
  • 边语义是解决动作歧义的关键:条件模态消融显示,仅提供图拓扑连通性时,模型无法区分如“推(push)”与“拉(pull)”等互逆动作。引入开放词汇的边语义嵌入后,FVD 进一步下降近 2 点,EPE 降至 2.9,有效消解了运动方向的模糊性。
  • 注意力稀释效应(Attention Dilution):节点上下文容量实验揭示了一个重要现象,将节点预算从 30 增加到 256 时,FVD 从 99.42 恶化至 109.92。这是因为真实场景通常包含 5-10 个实体,过大的容量被大量零填充(zero-padding)占据,在 DiT 的全局自注意力机制中稀释了有效实体的交互权重。
  • 极致的推理吞吐优势:得益于冻结骨干以及摒弃庞大的密集轨迹编码器,GraphVid 推理单段视频仅耗时 200 秒,远快于 Wan-Move(1800 秒)、Tora(1200 秒)与 WISA(1000 秒)。

亮点与洞察

  • 将轨迹标注降维为语义图编辑:传统控制要求在多帧或首帧精细勾勒多条复杂曲线,而 GraphVid 将控制界面抽象为“实体-动作-受体”的关系图。用户只需在图像上指定关系标签,模型便能借助先验将其展开为物理合理的运动轨迹。
  • GINEConv 实现了物理关系与视觉特征的深度共融:巧妙地将有向边的文本交互特征 \(a_{ji}\) 作为加性偏置直接融入 GNN 聚合操作,使图神经网络自然胜任因果与动量传递的模拟。
  • 通用且解耦的即插即用架构:生成骨干与图模块完全解耦,不仅支持轻量快速微调,还能在不同规模的开源 DiT(如 LTX-Video 与 Wan 2.2)之间无缝平移,具有很高的工程与实用价值。

局限与展望

  • 作者承认的局限:对极度精细的微观物理属性(如复杂流体黏度、布料撕裂破碎等高频拓扑变化)缺乏显式建模能力,仍依赖骨干网络自身先验。
  • 潜在不足与边界条件:初始图构建依赖前置的视觉语言检测器(Qwen3-VL),若检测器在复杂遮挡或极小目标上发生漏检或误识别,下游图推理与运动控制将受到级联误差干扰。
  • 未来改进方向:可探索引入人在回路(Human-in-the-loop)的交互式图纠错与强化反馈,同时结合 3D 空间高斯或点云表征,将 2D 交互图升级为 3D 时空场景图,实现视角与物理动作的联合全自由度控制。

相关工作与启发

  • vs Wan-Move / Motion-I2V (基于轨迹/光流的运动控制):Wan-Move 等方法直接对密集点轨迹或潜在流进行对齐学习,严重依赖超大规模监督数据(2M-10M 样本)与数十亿可调参数;GraphVid 从高层物理语义出发,用轻量有向交互图替代低级位移场,仅用 27K 样本便达到了极具竞争力的运动一致性。
  • vs WISA (基于物理属性的文本控制):WISA 通过注入物理文本属性与分类先验指导扩散,但缺乏针对多实体的显式拓扑关系建模;GraphVid 通过有向图结构精确绑定“谁对谁施加了什么作用”,在多目标复合场景中表现出大幅领先的结构自洽性。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ [首次系统地将有向交互场景图作为单图生视频的核心控制介质,设计极具开创性]
  • 实验充分度: ⭐⭐⭐⭐⭐ [涵盖 MoveBench 多物体子集评测、骨干泛化、模态消融、容量与秩敏感性分析]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑层层递进,对图拓扑与视频生成注意力的结合机制阐述极为透彻]
  • 价值: ⭐⭐⭐⭐⭐ [为解决多实体交互控制难题开辟了兼顾轻量级与强控制力的高效新范式]