DIVER: Disentangling Camera–Object and Active–Passive Motion for Video Generation¶
会议: ECCV 2026
论文: ECCV 原文
项目: https://research.nvidia.com/labs/sil/projects/moright
领域: 视频生成
关键词: 视频生成、运动解耦、相机控制、因果推理、流匹配
一句话总结¶
提出基于流匹配与双流交互架构的视频生成模型,通过规范静态视点投影解耦相机与物体运动,并通过主动/被动运动掩码 Dropout 建立动作-后果物理因果推理,支持自由视角与双向因果视频合成。
研究背景与动机¶
运动可控视频生成是通向具身智能环境模拟与交互式内容创作的核心基石。用户期望能够以直观的交互方式(如笔触轨迹或关键点)指定物体的运动轨迹,同时在自由指定的相机视角下渲染出符合物理规律的动态视频。然而,现有的轨迹引导可控生成方法通常直接以像素级位移作为控制信号,在实际交互中面临相机运动与物体运动严重耦合的根本瓶颈:当相机发生旋转或平移时,画面中所有物体的二维像素轨迹都会发生剧烈形变,迫使模型在没有显式几何先验的情况下艰难猜测几何视点与物体本质位移的归因。
现有方法在交互物理合理性上也存在严重缺失,往往将用户输入的运动简化为刚性的运动学位移,忽略了动作与后果之间的因果依赖(Motion Causality)。现实世界中,主动施加的作用力必然伴随被动的动态响应,例如推击茶壶会导致其滑动倾倒并倾倒出液体。以往方法若要生成多物体交互,必须为所有受力物体密集标注运动轨迹,或者借助外部物理模拟器与大语言模型两阶段规划,这极易引发跨模态误差累积与动力学失真。
本文的切入角度是:物体自身的动力学在固定的规范相机坐标系(Canonical View)下是绝对自洽且无歧义的,而物体间的因果响应可以通过非对称监督从视频数据中自发涌现。核心 idea:构建双流(Dual-Stream)协同生成架构,在规范静态视点分支中定义并控制物体运动,通过跨视点时序自注意力将运动迁移至任意目标相机视角;同时在训练中引入主动-被动运动分解与非对称 Dropout,使模型学会从局部主动动作推演环境连锁后果(正向推理),或从期望被动结果反推驱动动作(逆向推理)。
方法详解¶
整体框架¶
模型以单张输入图像 \(I\)、规范视点下的物体运动轨迹集合 \(\mathcal{T} = \{\tau_i\}_{i=1}^T\) 以及目标相机位姿序列 \(\{C_i\}_{i=1}^T\) 作为输入,输出在目标相机视角下生成连贯动力学视频 \(x^{\text{tar}}\)。整体流程划分为双流生成网络与跨视点自注意力交互机制:规范流(Canonical Stream)以单位相机位姿和输入的稀疏轨迹运行,作为无相机干扰的动力学生成锚点;目标流(Target Stream)则接收真实的目标相机外参变换编码,轨迹输入置空。两流在 DiT 的各层 Transformer 模块中通过跨视点自注意力共享权重并互联,使得目标视角在去噪演化过程中平滑吸收规范坐标系下的动力学先验。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["单张参考图像 + 目标相机位姿 + 规范运动轨迹"] --> B["条件编码与特征注入<br/>Gen3C相机形变编码 + 轨迹时间对应嵌入"]
B --> C["双流流匹配架构<br/>规范静态流与目标动态流共享权重并拼接"]
C --> D["跨视点时序自注意力<br/>规范坐标系动力学向任意目标相机视角迁移"]
D --> E["主动-被动运动因果推断<br/>非对称Dropout驱动的正向/逆向物理响应推理"]
E --> F["输出:目标视角下符合物理因果的交互视频"]
关键设计¶
1. 规范双流视点解耦:消除相机运动与物体运动的几何混淆
针对像素级轨迹在视点变换下的混淆问题,本文提出双流生成机制。对于任意视频,模型利用预训练几何感知网络(如 ViPE)估计的深度和相机姿态,将任意帧的二维物体轨迹统一重投影回第一帧参考视点,形成规范轨迹 \(\tau^{\text{can}}\): $\(\tau^{\text{can}}_i = \pi \bigl(K,\,C_0\,C_i^{-1}\,\pi^{-1}(K,\,\tau_i,\,D_i)\bigr)\)$ 在 DiT 主干中,规范流的输入条件为 \(\mathbf{c}^{\text{can}} = \{I,\, C_1,\, \tau^{\text{can}}\}\),目标流的条件为 \(\mathbf{c}^{\text{tar}} = \{I,\, \{C_i\},\, \emptyset\}\)。两路流共用 DiT 权重,各自加噪后沿时间维度拼接联合去噪。规范流由于相机恒定为单位阵,纯粹学习真实的物体形变与移动;在推理时,规范流充当虚拟几何锚点,最终仅解码目标流隐变量输出 \(\hat{x} = \mathcal{D}(\hat{z}^{\text{tar}}_0)\),实现相机轨迹与物体运动的完全正交解耦。
2. 条件编码与跨视点时序自注意力:无缝迁移跨视点运动特征
为了将相机控制和运动先验注入生成过程,相机姿态依据首帧图像和估计深度进行 3D 前向单应性变形并由 VAE 编码为 \(z^{\text{cam}} \in \mathbb{R}^{\hat{T} \times \hat{H} \times \hat{W} \times d}\);物体运动轨迹则编码为逐像素时序对应特征 \(e^{\text{trk}} \in \mathbb{R}^{\hat{T} \times \hat{H} \times \hat{W} \times d}\)。在 DiT 的每一个注意力块中,两类特征经过线性投影与网络隐状态相加: $\(\mathbf{f}^i \leftarrow \mathbf{f}^i + W_{\text{cam}} \mathbf{z}^{i,\text{cam}} + W_{\text{trk}} \mathbf{e}^{i,\text{trk}}, \quad i \in \{\text{can},\, \text{tar}\}\)$ 随后,两分支特征进行跨视点全自注意力融合: $\([\mathbf{f}^{\text{can}};\; \mathbf{f}^{\text{tar}}] := \text{SelfAttn}\bigl([\mathbf{f}^{\text{can}};\; \mathbf{f}^{\text{tar}}]\bigr)\)$ 目标视角的视觉 token 通过全局自注意力层直接查询规范流中对应物体的动力学表征,随着去噪层数递进,规范动力学精准映射到目标相机的新观察几何中。
3. 主动-被动运动因果推断:非对称 Dropout 诱导物理连锁反应
为了打破传统方法“无标注即不运动”的刚性缺陷,将物体运动分解为主动作物体轨迹 \(\tau^{\text{act}}\) 与被动响应物体轨迹 \(\tau^{\text{pas}}\)。在训练阶段采用非对称运动 Dropout 策略,以预设概率 \(p\) 随机保留其中一类作为条件: $\(\tilde{\tau}_i := \begin{cases} \tau_i^{\text{act}}, & \xi < p \\ \tau_i^{\text{pas}}, & \text{otherwise} \end{cases}\)$ 监督信号始终作用于包含完整全场动态的目标视频。网络被迫学会补全缺失的受力响应或施力原因,从而在测试期支持两种强大的推理模式:正向因果推理(用户输入施力动作如手部抓推,模型自发生成物体的滑移、倾倒或液体泼溅)以及逆向因果推理(用户仅指定被动结果如目标移动轨迹,模型自发合成出合理的外力动作来驱动该结果)。
损失函数 / 训练策略¶
基于 DiT 架构采用 Flow Matching(流匹配)优化目标。对输入潜在向量 \(z_0\) 和高斯噪声 \(\epsilon \sim \mathcal{N}(0, I)\) 进行插值 \(z_t = (1-t)z_0 + t\epsilon\),网络 \(\mathcal{G}_\theta\) 拟合速度矢量场: $\(\mathcal{L}_{\text{FM}} = \mathbb{E}_{t, z_0, \epsilon} \bigl[ \|\mathcal{G}_\theta(\mathbf{z}_t, t, \mathbf{c}) - (\epsilon - \mathbf{z}_0)\|^2 \bigr]\)$ 在训练数据上采用三阶段混合监督策略: 1. 真实静态/生成动态配对数据:通过视频深度与位姿模型从真实视频提纯静态相机片段,再利用视点控制模型合成对应的多视角动态副本; 2. 单视角真实数据混合训练:对于真实世界纯静态视频,复制两路输入,迫使网络学习将规范流条件传递至无条件流;对于真实动相机视频,仅对目标流计算损失,规范流置零; 3. 多粒度与遮挡 Dropout:在轨迹图上随机应用 Patch 均值池化以模拟粗粒度区域交互,并随机遮挡部分轨迹线段以提升抗遮挡鲁棒性。
实验关键数据¶
主实验¶
在兼具强动态相机与复杂交互的 DynPose-100K 以及真实复杂双手交互的 Cooking 基准上进行评估。对比方法包括非受控 Wan2.1、相机控制模型 Gen3C 以及轨迹控制模型 MP、ATI、WanMove。需要注意,基线轨迹模型均接收了全时段像素级前后景全量轨迹(Full info),而本文方法仅接收首帧重投影轨迹和相机位姿。
| 数据集 | 方法 | 全轨迹先验 | PSNR ↑ | SSIM ↑ | 旋转误差 Rot (°) ↓ | 平移误差 Trans ↓ | 运动终点误差 EPE ↓ |
|---|---|---|---|---|---|---|---|
| DynPose-100K | Wan2.1 | × | 11.23 | 0.435 | - | - | - |
| Gen3C* | × | 12.45 | 0.507 | 5.46 | 4.09 | - | |
| MP* | ✓ | 11.72 | 0.455 | 6.76 | 6.04 | 7.56 | |
| ATI | ✓ | 13.18 | 0.493 | 5.62 | 6.54 | 8.43 | |
| WanMove | ✓ | 13.91 | 0.521 | 4.12 | 3.56 | 8.05 | |
| Ours | × | 12.30 | 0.457 | 4.55 | 4.61 | 7.64 | |
| Cooking | Wan2.1 | × | 14.23 | 0.527 | - | - | - |
| Gen3C* | × | 15.37 | 0.613 | 1.97 | 10.03 | - | |
| MP* | ✓ | 15.68 | 0.564 | 2.50 | 12.24 | 4.25 | |
| ATI | ✓ | 15.93 | 0.582 | 4.25 | 16.94 | 5.87 | |
| WanMove | ✓ | 16.42 | 0.589 | 2.93 | 13.27 | 5.47 | |
| Ours | × | 16.44 | 0.594 | 2.16 | 10.11 | 4.27 |
注: 表示作者在统一配置下复现重训;Full info 表示测试时是否输入全视频序列像素级运动场。
在物理常识与因果交互基准 WISA 及 Cooking 上的交互生成评测中,基线方法输入包含动作与结果的完整文本描述,而本文方法仅输入动作描述,迫使模型自发进行因果演绎:
| 数据集 | 方法 | 完整提示词先验 | FID ↓ | FVD ↓ | 物理常识 PC ↑ | 语义一致性 SA ↑ |
|---|---|---|---|---|---|---|
| WISA | MP* | ✓ | 57.29 | 975.94 | 0.75 | 0.82 |
| ATI | ✓ | 69.80 | 990.82 | 0.75 | 0.83 | |
| WanMove | ✓ | 61.34 | 1088.23 | 0.73 | 0.83 | |
| Ours | × | 52.95 | 876.03 | 0.76 | 0.82 | |
| Cooking | MP* | ✓ | 43.49 | 759.53 | 0.87 | 0.89 |
| ATI | ✓ | 55.80 | 881.94 | 0.85 | 0.90 | |
| WanMove | ✓ | 53.51 | 882.90 | 0.84 | 0.87 | |
| Ours | × | 39.94 | 730.46 | 0.88 | 0.89 |
消融实验¶
在 Cooking 基准上对系统架构、因果设计、数据配比与交互模式进行全方位消融:
| 配置 / 变体 | FID ↓ | FVD ↓ | PSNR ↑ | SSIM ↑ | 旋转误差 Rot ↓ | 平移误差 Trans ↓ | 运动误差 EPE ↓ | 物理常识 PC ↑ | 语义一致性 SA ↑ |
|---|---|---|---|---|---|---|---|---|---|
| 级联两阶段 (Cascaded) | 41.74 | 728.80 | 15.98 | 0.569 | 2.69 | 11.50 | 5.05 | 0.87 | 0.89 |
| 移除规范视点分支 (w/o fixed view) | 51.17 | 997.83 | 14.15 | 0.515 | 3.36 | 14.57 | 14.30 | 0.87 | 0.89 |
| 移除因果推理训练 (w/o reasoning) | 44.04 | 784.19 | 15.55 | 0.562 | 2.88 | 12.49 | 5.05 | 0.87 | 0.88 |
| 移除单视角混合训练 (w/o mixed training) | 41.94 | 808.96 | 16.29 | 0.583 | 2.22 | 12.80 | 4.09 | 0.87 | 0.89 |
| 粗粒度输入 (Ours coarse) | 39.83 | 725.88 | 16.45 | 0.594 | 2.21 | 10.98 | 4.37 | 0.88 | 0.88 |
| 被动反推输入 (Ours passive) | 44.20 | 838.67 | 15.99 | 0.588 | 2.21 | 11.04 | 7.27 | 0.87 | 0.88 |
| 完整模型主动输入 (Ours active) | 39.94 | 730.46 | 16.44 | 0.594 | 2.16 | 10.11 | 4.27 | 0.88 | 0.89 |
关键发现¶
- 规范流锚点至关重要:移除规范静态视点分支后,模型在动态视角下直接混淆相机流与运动流,EPE 从 4.27 暴增至 14.30,且旋转和平移误差显著恶化,证明规范空间对独立轨迹控制具有不可替代的锚定作用。
- 端到端联合去噪优于两阶段级联:先生成静态视频再运行相机重渲染(Cascaded)会导致严重的跨阶段生成伪影与累积误差,控制精度明显差于联合去噪的双流设计。
- 因果推理增强物理合理性:加入主动-被动分解与 Dropout 训练后,物理常识评分显著上升,FID/FVD 改善明显,验证了模型学到了跨实体的动力学迁移而非简单纹理平移。
亮点与洞察¶
- 解耦的数学简洁性:巧妙地利用首帧几何重投影将三维视点变换约束在规范视点内,避开了复杂的显式三维表征构建与神经辐射场重建,仅凭 2D 双流机制即实现了纯粹的相机与物体运动解耦。
- 首创动作与结果的因果双向性:突破了以往视频可控生成单纯作为“运动学插值器”的局限,首次利用非对称训练使扩散模型具备了“动作生成响应”与“由果索因”的双向动力学推理能力。
- 可迁移的轻量控制范式:通过 Patch 池化对轨迹信息降维,让模型既支持细粒度光流轨迹输入,也兼容粗粒度涂鸦手势输入,对交互式 UI 系统极度友好。
局限与展望¶
- 极端视角与剧烈视点变换下的退化:依赖首帧深度估计与 3D 逆向投影,当目标相机运动过大、引入大面积严重遮挡或视场外未知区域时,重投影质量下降,导致边缘动态伪影。
- 长序列幻觉与物体一致性衰减:在极端复杂的长程多体碰撞中,可能出现受力物体形变失真或偶然消失的情况,欠缺显式刚体碰撞边界约束。
- 单卡推理延迟偏高:双流拼接使推理阶段计算开销加倍,在单张 A100 上生成单个视频约需 15 分钟,限制了实时环境交互应用,未来需探索蒸馏加速方案。
相关工作与启发¶
- vs Motion-conditioned Baselines (MP, ATI, WanMove):这类方法直接以像素流作为条件,相机旋转平移与物体运动死死纠缠,且必须全序列密集标注;本文仅依赖首帧单目重投影与轻量笔触,并在生成空间解耦视点。
- vs Physical Simulation Pipelines (PhysGen, WonderPlay):传统物理接地模型往往需要调用外部刚体或流体物理求解器,适用场景极为受限且流程笨重;本文直接利用大规模数据驱动隐式学习因果物理规律。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次系统性解耦相机视角与局部运动,并引入主动-被动因果推理双向机制。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 DynPose-100K、WISA 和 Cooking 三大基准,包含详细消融、物理合理性量化与人类评估。
- 写作质量: ⭐⭐⭐⭐⭐ 框架设计思路清晰,问题动机明确,实验对比严谨。
- 价值: ⭐⭐⭐⭐⭐ 为具身智能环境交互模拟与电影级机位运镜生成提供了坚实的可行范式。