LooseControlVideo: Directorial Video Control using Spatial Blocking¶
会议: ECCV 2026
论文: ECCV 2026 Poster
领域: 视频生成
关键词: 视频生成与编辑, 导演级控制, 空间站位代理, 面向3D包围盒, DNOCS表示
一句话总结¶
LooseControlVideo 借鉴专业电影视听语言中的空间站位(blocking)理念,将粗粒度定向 3D 包围盒作为稀疏代理并渲染为联合编码朝向与全局深度的 DNOCS 控制图,使基础视频 DiT 能解耦高层调度轨迹与细粒度物体形变,实现精确的 3D 轨迹编排与高质量视频生成及局部运动编辑。
研究背景与动机¶
现代视频扩散生成模型(如 Wan 2.2、Sora、Veo)已经能够合成高度逼真且具有物理感知的动态视频,但在复杂多主体场景下,针对特定运动轨迹、精准时空同步和物体交互的导演级精准控制(directorial control)仍然严重欠缺。现有的视频引导控制模态陷入两难境地:自然语言描述由于语义歧义性无法表达毫米或像素级的精确空间几何路径;而基于密集帧级深度图(depth video)或骨骼姿态的条件控制,虽然结构保真度高,但对用户而言几乎不可能手动绘制包含复杂非刚体形变(例如飞鹰俯冲捕捉野兔时的羽翼挥动与肌肉收缩)的高动态连续序列。
这种控制困难的本质在于:传统的结构引导信号将两个本应独立的控制维度混淆在了一起——其一是相机运动、多物体宏观空间布局与交互碰撞轨迹(高层调度),其二是物体在运动过程中自发产生的细粒度局部形变、关节姿态演化与次生动力学效果(执行细节)。如果强行要求用户提供密集的几何指引,不仅让创作门槛极其高昂,也浪费了视频大模型自身学到的强大物理解算与形变先验。
受电影制作中导演通过粗略演员走位(spatial blocking)来规划空间运动的启发,本文的核心 idea 是将高层空间编排与局部几何形变显式解耦,采用稀疏且易于绘制的定向 3D 包围盒(oriented 3D bounding boxes)作为空间站位代理,并将其通过相机投影预先渲染为联合编码朝向与逆深度的 DNOCS(Depth-modulated Normalized Object Coordinate Space)图像空间控制流,从而让冻结骨干的视频 DiT 自主推理物体形变、遮挡关系与物理交互效果。
方法详解¶
整体框架¶
LooseControlVideo (LCV) 围绕“轻量 3D 代理输入 \(\rightarrow\) 图像域几何投影与着色 \(\rightarrow\) 视频生成骨干残差注入”的三阶段架构构建。输入包括目标视频文本提示词 \(p\)、用户编辑或模拟生成的随时间变化的 3D 定向包围盒序列 \(b = \{b_t\}_{t=1}^T\)(包含中心位置、尺度与 3D 旋转姿态)以及虚拟相机轨迹 \(c = \{c_t\}_{t=1}^T\);在视频编辑任务中,还可以额外输入参考源视频片段 \(v\)。
为解决视频 DiT 缺乏原生显式 3D 坐标理解能力的问题,系统首先使用虚拟相机参数,通过光线投射对每个包围盒进行几何相交测试,计算局部坐标归一化朝向与全局深度,渲染出稠密的 DNOCS 引导视频流 \(v_{\text{ctrl}}\)。随后,在保持 Wan 2.2 视频 DiT 骨干网络完全冻结的前提下,通过轻量级 WAN-VACE 条件适配模块注入残差控制特征,最终解码合成既精确遵循 3D 包围盒走位、又具备细腻物理形变与自洽遮挡关系的逼真视频。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["用户输入<br/>文本提示词 + 3D定向包围盒轨迹 + 相机参数"] --> B["DNOCS 虚拟渲染机制<br/>光线投射与朝向色彩/逆深度亮度联合映射"]
B --> C["多模式控制流合成策略<br/>纯生成/视频片段保留/局部擦除/空间混合拼接"]
C --> D["冻结 DiT 骨干与 VACE 注入<br/>Wan 2.2 保持冻结 + LoRA 微调 VACE 条件残差"]
D --> E["视频输出<br/>时空精确对齐 + 自洽遮挡 + 真实次生形变动力学"]
关键设计¶
1. DNOCS 虚拟渲染机制:解耦 3D 几何投影并联合编码朝向与全局深度
若直接将 3D 包围盒的坐标参数(中心 \(o_t\)、尺寸 \(s_t\)、旋转 \(R_t\))通过 MLP 编码为 token 拼入 DiT 注意力层,模型必须在隐空间自行重构透视投影与遮挡逻辑,实验证明这种隐式 token 条件极易失效或导致训练不收敛。本文选择在输入前显式完成光线投影:针对相机内参 \(K\)、外参 \((R_{cw}, t_{cw})\) 以及包围盒中心 \(C_w\)、旋转 \(R_{wb}\)、半长宽轴 \(h\),系统将像素光线逆变换至包围盒局部坐标系,通过标准 slab test 判定包围盒相交,获得局部相交点 \(p_b(u,v)\) 和相机空间深度 \(z(u,v)\)。
为使单一 3 通道图像能无歧义地表达 6-DOF 空间态势,DNOCS 将局部表面单位朝向 \(n(u,v) = p_b(u,v) / \|p_b(u,v)\|\) 映射至恒定明度(\(L=0.55, a=0.35\))的球面色环 \(\mathrm{rgb}_{\text{orient}}(u,v)\),提供绝对旋转线索;同时提取每帧有效包围盒区域深度的第 2 与第 98 百分位数 \((z_{\min}, z_{\max})\) 进行尺度不变的归一化逆深度裁剪: $\(d(u,v) = 1 - \mathrm{clip}\left(\frac{z(u,v) - z_{\min}}{z_{\max} - z_{\min}}, 0, 1\right)\)$ 再通过指数衰减底色调制函数计算乘性亮度因子: $\(b(d) = \beta_{\min} + (1 - \beta_{\min})\exp\left(-k(1 - d)\right)\)$ 其中设定 \(\beta_{\min}=0.08, k=2.0\)。最终像素色彩为 \(\mathrm{rgb}_{\text{DNOCS}}(u,v) = \mathrm{rgb}_{\text{orient}}(u,v) \odot b(d(u,v))\)。靠近相机的近景表现为鲜亮饱满色彩,远景则自然变暗;发生重叠时近景几何在像素层自然遮蔽远景,彻底向视频生成网络显式暴露了空间朝向与深度遮挡拓扑。
2. 多模式控制流合成策略:统一视频纯生成与局部运动重定向编辑
为了让同套网络在不改动输入架构的前提下无缝支持文本生成视频(T2V)与交互式视频编辑,框架设计了高度灵活的复合输入构造接口。对于纯生成模式,控制视频 \(v_{\text{ctrl}}\) 仅由纯粹的黑底 DNOCS 投影构成;而在视频编辑或运动重定向模式下,用户希望修改特定物体的行进路线同时保留背景或其它实体。
系统借助单目视频深度估计模型 Video Depth Anything (VDA) 提取源视频背景几何,将重新编排的 3D 包围盒渲染图与原视频进行遮挡感知合成。每一帧的控制输入可根据需求任意组合为四种原子形态之一:全 DNOCS 帧、完全保留原像素的真实视频片段、要求模型自由推演补全的纯黑帧、以及 DNOCS 与原视频局部空间合成帧。针对需要重定向运动的原始目标,支持在源视频帧中覆盖灰色遮罩消除原主体,并在新轨迹处放置渲染包围盒。模型借此既能平滑插帧与补全,又能完成如将普通行驶的吉普车重编排为高速漂移带出轮胎烟尘等高自由度二次创作。
3. 自动化数据挖掘与双路混合训练:从野外单目视频提炼 3D 监督
针对真实 3D 物体走位标注稀缺的瓶颈,本文建立了一套全自动的无监督数据挖掘流水线,从约 1 万条无标注库存真实视频中构建训练语料。流水线首先使用 GroundingDINO 与 SAM-2 提取高精度单目视频目标追踪分割掩码;随后结合 VDA 提取目标区域点云,并调用全局几何拟合算法估计每帧最优的定向 3D 包围盒;最后引入 3D 卡尔曼滤波算法滤除单目估计的时序抖动,构建时序平滑、朝向连贯的 3D 轨迹元数据。
在训练阶段,为了防止模型退化为仅记住纯渲染图或过度依赖特定视频背景,训练样本以 70% 概率采样纯 DNOCS 渲染序列,以 30% 概率采样包含源视频片段与空间局部混合构成的编辑控制信号。网络基于 WAN-VACE 框架构建,全量冻结预训练 Wan 2.2 DiT 骨干参数,仅对 rank=64 的 VACE 条件适配模块进行 LoRA 微调,在 4 块 H100 80GB GPU 上迭代训练 10,000 步,在低训练开销下最大化迁移大模型的泛化外观与运动先验。
一个完整示例¶
以“老鹰从高空俯冲捕食地面野兔”的剧烈交互镜头为例: 1. 用户端交互编排:创作者在简易 3D 视口中放置两个长方体代理,分别赋给老鹰和野兔标签;在时间轴上设置老鹰从远景高空沿抛物线俯冲至近景平地的 3 个关键帧,并将包围盒主轴沿速度切线向前倾斜 45 度;野兔包围盒则设置沿地面折线逃窜。 2. 离线光线投射着色:渲染器以设定好的虚拟跟拍机视角投射光线,老鹰包围盒表面被着色为高明度橙蓝朝向色谱,且随着俯冲接近摄像机,亮度因子 \(b(d)\) 沿指数函数连续增大;野兔在老鹰到达接触点瞬间在投影屏幕上产生重叠,老鹰包围盒的近景像素在屏幕上直接覆盖野兔包围盒。 3. DiT 条件解算:Wan 2.2 接收到合成 DNOCS 序列后,自动在老鹰包围盒内生成猛禽张开羽翼、收爪减速扑击的非刚体真实解剖学动作,在野兔包围盒内补足毛发飞扬与腾挪姿态,同时自主合成羽翼在地面的投射阴影与扬尘次生特效,最终生成完美遵循导演走位的高画质电影级镜头。
实验关键数据¶
主实验¶
评估涵盖三大具有真实 3D 标注的场景基准:包含自动驾驶多主体交互的 nuScenes 验证集,以及包含高动态刚体旋转和手物/人身紧密接触交互的 HO-3D 和 BEHAVE。结构对齐评测指标包括包围盒像素包容度(Contain ↑)、轨迹欧式误差(TrajErr ↓,越低越好)、全局重叠获胜率(GOW ↑)、全域运动场一致性(GMFA ↓)、刚体运动一致性(RMC ↓)、遮挡准确度(OcclAcc ↑,以近景支配比 NDR > 0.55 为阈值)以及 VBench 归一化感知综合画质(Quality)。
下表列出 nuScenes 自动驾驶数据集(表1)与 HO-3D / BEHAVE 人机交互基准(表2)的主客观对比:
| 数据集 | 方法 | 输入控制模态 | Contain (%) ↑ | GMFA ↓ | RMC ↓ | TrajErr (像素) ↓ | OcclAcc (%) ↑ | Quality |
|---|---|---|---|---|---|---|---|---|
| nuScenes | 无控制基线 | 首尾两帧真实图像 | 10.22 | 0.828 | 0.863 | 90.12 | 41.45 | 76.45 |
| nuScenes | VACE | 2D 光流 (Flow) | 21.23 | 0.135 | 0.566 | 7.86 | 73.91 | 73.90 |
| nuScenes | VACE ft | 2D 光流 (Flow) | 22.45 | 0.093 | 0.528 | 6.78 | 79.32 | 75.50 |
| nuScenes | VACE ft | 2D 轴对齐包围盒 | 96.33 | 0.232 | 0.735 | 16.66 | 42.45 | 66.34 |
| nuScenes | LCV (本文) | 渲染定向 3D 包围盒 (DNOCS) | 87.93 | 0.066 | 0.318 | 5.79 | 92.69 | 74.45 |
| HO-3D | 无控制基线 | 首尾两帧真实图像 | 46.8 | 0.440 | 0.362 | 38.5 | 53.4 | 76.4 |
| HO-3D | VACE ft | 2D 光流 (Flow) | 69.1 | 0.071 | 0.192 | 5.4 | 84.2 | 73.6 |
| HO-3D | VACE ft | 2D 轴对齐包围盒 | 97.9 | 0.126 | 0.181 | 9.7 | 55.1 | 72.4 |
| HO-3D | LCV (本文) | 渲染定向 3D 包围盒 (DNOCS) | 91.3 | 0.045 | 0.122 | 3.9 | 94.1 | 72.9 |
| BEHAVE | 无控制基线 | 首尾两帧真实图像 | 42.3 | 0.611 | 0.490 | 54.8 | 48.6 | 76.2 |
| BEHAVE | VACE ft | 2D 光流 (Flow) | 63.8 | 0.098 | 0.318 | 7.6 | 78.5 | 75.8 |
| BEHAVE | VACE ft | 2D 轴对齐包围盒 | 95.8 | 0.238 | 0.412 | 14.9 | 49.7 | 69.3 |
| BEHAVE | LCV (本文) | 渲染定向 3D 包围盒 (DNOCS) | 88.6 | 0.062 | 0.207 | 5.8 | 90.2 | 75.0 |
在与当前唯一的 3D 轨迹控制模型 3DTrajMaster 对比中(针对限制 3 目标以内的 HO-3D 与 BEHAVE 子集),LCV 的轨迹误差相比 3DTrajMaster 降低了 10 至 12 倍(HO-3D 从 47.2 降至 3.9,BEHAVE 从 52.6 降至 5.8),遮挡准确率提升了超过 25 个百分点(HO-3D 从 67.5% 提升至 94.1%,BEHAVE 从 64.8% 提升至 90.2%)。
消融实验¶
针对控制信号的表征形式与核心深度调制超参数 \(k\)(在 nuScenes 验证集上评测),消融实验结果如下:
| 配置 / 变体 | 调制超参数 \(k\) | TrajErr (像素) ↓ | RMC ↓ | OcclAcc (%) ↑ | 说明与分析 |
|---|---|---|---|---|---|
| 纯深度图 (Depth-only) | - | 7.42 | 0.471 | 81.34 | 仅含包围盒表面深度,缺少朝向色相,刚体旋转易混淆 |
| 基础 NOCS (无深度调制) | \(k = 0\) | 6.18 | 0.402 | 73.56 | 缺少全局距离强度变化,重叠时前后遮挡判断退化 19.13% |
| DNOCS 弱调制 | \(k = 1\) | 6.05 | 0.371 | 88.21 | 浅层深度衰减已能显著恢复前后次序认知 |
| DNOCS 均衡设置 (本文默认) | \(k = 2\) | 5.79 | 0.318 | 92.69 | 朝向分辨度与深度对比度达到最佳平衡点 |
| DNOCS 强调制 | \(k = 4\) | 6.34 | 0.395 | 89.47 | 深度衰减过快导致中远景亮度骤降,洗褪了局部朝向色彩 |
关键发现¶
- 深度调制是遮挡判断的胜负手:消融实验清晰证实,当 \(k=0\)(纯 NOCS 局部坐标颜色)时,遮挡准确率仅有 73.56%;引入指数深度加权至 \(k=2\) 时,遮挡准确率跃升至 92.69%(提升超过 19 个百分点)。但 \(k\) 不能无节制增大,\(k=4\) 时暗部过暗会导致朝向特征信息被遮蔽。
- 2D 框与 3D 框的本质鸿沟:2D 轴对齐包围盒虽然在画面占据面积(Contain 达 96%+)上指标很高,但由于其完全丧失景深层次和旋转姿态,轨迹中心误差(TrajErr 达 14~16 像素)与遮挡判断(OcclAcc 仅 40~50%)极其糟糕,模型极易产生物体在框内无规律滑动或朝向穿模的现象。
- 极度鲁棒的稀疏关键帧插值能力:进一步分析表明,即使用户仅在每 8 帧标注一个 3D 包围盒关键帧(降采样 8 倍稀疏输入),LCV 在 nuScenes 上的轨迹误差与稠密标注版相比恶化幅度仍在 2% 以内,表明生成网络内部成功利用时间注意力机制填充了平滑的连续动力学。
亮点与洞察¶
- 将复杂的 3D 几何问题拉回 2D 图像域解决:不强求在 DiT 复杂的隐空间中添加 3D 几何解析层,而是借助成熟的图形学光线投射,将 3D 空间代理直接渲染为融合深度与朝向的 2D 图像控制流。这种设计既完整保留了 6-DOF 几何线索,又完美契合了 2D 视频生成骨干的原生感受野。
- 电影调度学与扩散生成先验的优雅分工:专业影视制作中导演负责演员走位(blocking),演员负责表情与动作细节。LCV 精准踩中这一分工哲学——用户只负责拖拽 3D 方块规划 macro-motion,DiT 负责微观解剖形变与光影次生效应,彻底打破了“精准控制必需要求繁重密集手绘”的桎梏。
- 即插即用的轻量级工程架构:通过在 Wan 2.2 骨干上仅使用 4 张 H100 微调 VACE 适配层(LoRA rank 64),避免了重训庞大底模的巨大算力消耗,为工业级视频制作工具链的搭建提供了极具吸引力的工程范本。
局限与展望¶
- 实体外观与 3D 包围盒的显式绑定缺失:当前模型尚未引入实体外观与指定 3D 包围盒之间的显式多模态绑定机制。在多个同类型角色(如两只相似的猫或多辆相仿的汽车)近距离交错穿越时,ControlNet 风格的残差特征可能发生轻微外观互渗。后续需探索结合多视角参考图像与 3D 空间锚点的多主体解缠控制。
- 时间节奏仍需人工编排关键帧:目前虽然解耦了物体形变与宏观路径,但物体移动的加减速与交互碰撞的确切时间点仍取决于用户设定的包围盒关键帧时序,未来可进一步探索仅给出起伏空间轨迹曲线,由生成模型结合常识物理自动推演运动节奏的机制。
相关工作与启发¶
- vs ControlNet / ControlVideo: 传统方案依赖密集的 Canny 边缘图、深度图或人体骨骼序列,用户从零创作动态镜头难度极大且容易固化形变;本文采用极为轻量的 3D 粗糙立方体,大幅减轻用户手绘负担并赋予大模型形变想象空间。
- vs Boximator / GLIGEN / Ctrl-V: 早期空间条件局限于 2D 屏幕空间轴对齐包围盒,面对物体 3D 轴向自转、视角变换与复杂深度遮挡时极易崩溃;本文通过 6-DOF 定向 3D 框与 DNOCS 渲染,从根本上补全了三维透视与遮挡拓扑。
- vs 3DTrajMaster: 3DTrajMaster 采用基于 token 的稀疏轨迹注入,严格受限于每片段最多 3 个实体,且缺乏物体空间包络;本文通过图像域稠密渲染代理,能够自然扩展至城市级交通流等 10 个以上实体的多目标同台调度。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 巧妙借鉴电影视听语言的 spatial blocking 理念,首创以 DNOCS 渲染定向 3D 包围盒作为视频生成代理,优雅解耦调度与形变。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 nuScenes、HO-3D 与 BEHAVE 三大多目标真实世界基准,创新性提出 Contain、GOW、GMFA 等完备空间评价体系,消融细致且包含成对用户调研。
- 写作质量: ⭐⭐⭐⭐⭐ 问题剖析直击传统深度条件与 token 条件的痛点,动机叙述层层递进,方法数学公式清晰规范。
- 价值: ⭐⭐⭐⭐⭐ 为影视级镜头运动调度、视频特效制作以及高保真交互式视频编辑提供了兼具直觉易用性与物理严谨性的全新技术路径。