跳转至

Control-DINO: Feature Space Conditioning for Controllable Video Diffusion

会议: ECCV2026
Paper: https://eccv.ecva.net/virtual/2026/poster/4902
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/7924.pdf
项目: Control-DINO
领域: 视频生成
关键词: 稠密特征条件、外观解耦、视频风格迁移、三维引导生成、DINOv3

标题沿用会议清单;缓存 PDF 的标题多出 “Image-to-Video”,实际任务也以图像到视频扩散为基础。以下依据论文正文与实验表撰写;未从项目页核验代码或权重的发布状态。

一句话总结

Control-DINO 用保留全部通道的稠密 DINOv3 特征控制冻结的 CogVideoX,通过“原视频特征对应多种增强外观”的训练减少源外观复制,在 T&T 的 stride=16 外观迁移中获得 0.9932 的 COLMAP 配准率,并将同一特征接口扩展到三维生成。

研究背景与动机

视频外观迁移不是从零生成:用户已有一段视频,希望改变光照或画风,但保留建筑轮廓、物体身份和相机轨迹。深度图告诉模型表面在哪里,边缘图告诉模型哪里发生强烈变化,分割图提供类别区域;这些条件各自有效,却难以同时表达局部几何和细粒度语义。相机移动越大,单靠首帧外观和弱结构条件,后续帧越容易出现结构漂移。

DINOv3 的逐 patch 特征似乎能补足这一缺口:它们既描述物体及部件,也保留空间布局。然而,高信息量同时带来副作用,颜色、纹理和风格也编码在特征中。若直接用原视频特征监督原视频重建,最简单的学习策略就是复制源域外观;这会使控制分支与用户指定的新首帧风格相互竞争。论文中的 Real Only 对照说明,保持几何并不自动意味着能够跟随目标外观。

作者没有把主要希望寄托在 PCA 删除风格通道上,而是改变训练对应关系:同一份未改动的特征,可以对应不同风格、色调或清晰度的视频。核心 idea:保留高维特征中的结构信息,通过多外观监督教会控制分支选择性使用这些信息,而不是预先把整个特征压缩成一个假定无风格的子空间。

方法详解

整体框架

输入由源视频或三维场景提供的逐帧特征、目标外观首帧及文本条件组成,输出是沿给定结构和视角变化生成的视频。稠密特征接口负责把二维与三维来源统一到空间特征图,时空残差适配负责把它们注入冻结的视频模型,多外观配对训练则决定模型应从条件中读取什么。

训练和推理的差别很关键:训练时用源视频提取特征,却让模型对增强后的视频去噪;推理时不必把整段视频逐帧风格化,只需编辑首帧,再由源域特征维持后续布局。首帧编辑必须保留原有结构和语义,否则外观条件与结构条件仍可能冲突。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    Source["源视频或三维场景"] --> Features["稠密特征接口"]
    Features --> Adapter["时空残差适配"]
    Noisy["带噪视频潜变量"] --> Adapter
    Adapter --> Backbone["冻结 CogVideoX<br/>目标首帧与文本"]
    Original["原训练视频"] --> Features
    Original --> Pairing["多外观配对训练"]
    Backbone -->|训练预测| Pairing
    Backbone -->|推理| Output["结构受控的新视频"]

关键设计

1. 稠密特征接口:用高通道数弥补低空间分辨率,并兼容三维来源

二维路径使用冻结的 DINOv3-ViT-S/16,逐帧提取 384 维 patch 特征。论文方法节说明先对输入图像做双三次上采样再编码,模型细节给出 2 倍尺度;最终条件图为 \(384\times60\times90\)。这不是把特征压成 RGB 控制图再送进视频 VAE,而是保留原始通道,由专门的适配器完成后续对齐。低空间分辨率并不等于只有粗略类别标签:每个 token 的高维向量仍携带部件布局和区域语义,能够给生成先验提供比单一深度或边缘更丰富的约束。

三维输入沿用同一接口,但获得特征的方式不同。网格路径沿目标相机轨迹渲染无纹理网格,对渲染图上采样后提取 DINOv3 特征。体素路径先由输入视频重建稠密点云,把图像 DINO 特征关联到三维点,再体素化并投影到目标视角。后者不是“只靠几何猜出 DINO”:它利用了输入视频提供的外观与特征信息,因此不能与纯无色几何条件当成同等信息量比较。

Concerto 路径从点云提取三维描述子,经体素化和渲染生成 DINO-like 条件图,让缺少完整 RGB 覆盖的场景也能进入同一控制分支。正文最终把表 4 的 Concerto 与 Concerto (inpainted) 分别解释为有色和无色点云设置;两者应分开报告。网格和体素投影的空洞也不能当作有效场景特征:作者传播可见性掩码,网格路径还明确将二值掩码用 CogVideoX VAE 编码,作为辅助条件,让模型识别需要补全的位置。

这套接口把“哪个视角能看见什么”交给三维投影,把“这些区域是什么”交给高维特征,把缺失纹理和细节交给视频生成先验。它并不保证三维描述子与二维 DINO 的分布完全一致;这种差异本身就是三维结果低于二维参考的一项限制。

2. 时空残差适配:在冻结骨干中混合条件与去噪状态

DINO 特征是逐帧图像表示,而视频 VAE 会压缩时间轴。直接逐帧相加会使条件与潜变量时间长度不匹配,因此作者使用两层因果 Conv3D,把 49 帧特征压缩到 13 个潜时间位置,再与带噪 VAE 潜变量沿通道拼接。因果结构对应视频编码器的时间组织方式,而不是任意抽取 13 帧来替代完整序列。

拼接后的信息进入隐藏维度为 256 的轻量 Transformer 控制分支,其输出通过零初始化投影,以加法残差注入 CogVideoX-5B-I2V 的前 16 个 Transformer 块。冻结大骨干保留预训练生成先验,小分支学习条件的使用方式;零初始化使训练起点不会突然扰乱骨干。推理时统一把残差强度缩放为 0.8,另可用空间掩码调节注入,未加掩码对应全部位置有效。

这里的 Transformer 不只是给每个位置换一个通道数。它让结构条件与当前去噪隐藏状态进行空间混合,从而在相机大幅移动时共同确定区域关系。作者用直接线性投影替换该过程后,观察到大相机运动下条件跟随变差;因此“输入具有语义”不足以替代“注入过程理解空间关系”。缓存中的原式(2)符号损坏,本笔记采用文字说明已可核实的残差机制,不自行补写为声称来自论文的完整公式。

3. 多外观配对训练:改监督关系,而非提前删除疑似风格方向

对于同一源视频,DINO 条件始终来自未风格化版本,去噪目标则从四组中等概率抽样:真实视频、光度增强、GAN 风格增强、小幅模糊。光度增强包括色相、饱和度、亮度、对比度和 gamma 等,并在整段视频中一致施加;GAN 组使用五种神经风格迁移方法。四组等概率是组间采样规则,不代表每一种具体滤镜与真实视频的概率相同。

这种训练让源特征中的颜色不再是可靠的唯一答案,但空间布局仍能预测所有增强目标共有的结构。模型因而学会降低对源外观的依赖,同时依靠目标首帧给出生成外观。它是功能上的选择性解耦,并不声称 DINO 特征本身已分解成独立的几何和风格变量。

论文还认真检验了“先删风格方向”的替代方案:利用真实与风格化特征的差向量估计风格方向,投影掉这些方向后再做结构 PCA。该方案把跨外观余弦相似度从 0.9194 提到 0.9481,却只保留 30.4% 的解释方差;取底部特征向量能达到 0.9929 的相似度,但只留下 2.9% 方差。也就是说,让两个外观的表示更像,不一定意味着还保留了足够的结构控制信息,这正是本文坚持保留 384 通道的依据。

一个完整示例

以一段沿建筑移动的 49 帧视频为例,用户希望得到同一路径的绘画风格视频。先对原始 49 帧提取 \(384\times60\times90\) 的条件图,再由因果适配器得到 13 个潜时间位置;只对首帧做 InstantStyle 编辑,作为目标外观参考。

去噪过程中,轻量分支同时读取源特征与当前带噪潜变量,通过前 16 个块的残差持续约束建筑和背景布局,目标首帧则提供绘画外观。换成三维场景时,先沿相机轨迹渲染特征和可见性掩码,再进入相同分支。这个例子用于解释流程,不是新增的定量实验;首帧被改动到不再保持建筑结构时,论文并未保证该流程仍能正确工作。

损失函数 / 训练策略

论文采用速度预测的平方误差目标。把正文中的监督关系显式写出,目标来自增强视频潜变量 \(\tilde z_0\),条件来自原视频特征 \(F_{1:T}\)

\[ v_t=\alpha_t\epsilon-\sigma_t\tilde z_0,\qquad \mathcal L=\mathbb E\left[\left\|v_t-v_\theta(z_t,t,F_{1:T})\right\|_2^2\right]. \]

这里 \(t\) 是扩散时间步,\(1:T\) 才是视频帧索引,\(z_t\) 是增强视频经过前向加噪后的潜变量;式中省略的首帧和文本仍是骨干条件。上式按正文明确的速度目标与增强配对关系整理,不增加额外解耦损失。缓存的前向加噪原式(1)和特征形状原式(3)存在缺字符,不能据此推断完整噪声调度或更多维度约定。

仅时间适配器和轻量 Transformer 分支从头训练。优化器为 AdamW,\(\beta_1=0.9\)\(\beta_2=0.95\),峰值学习率 \(2\times10^{-4}\),余弦退火,500 步预热,batch size 为 8,梯度裁剪为 1.0,条件输入以 0.1 概率置零。正文没有给出可核实的总训练步数、完整 GPU 成本或推理速度,不补写这些信息。

实验关键数据

主实验

基础训练集为 DL3DV,约 4.5M 个独立训练帧,评估约 10k 个独立帧。跨域测试使用 Tanks and Temples,按 stride=8 和 stride=16 采样,并为每个场景设置 15 种不同于训练的光照或风格变化。下表节选原表 1 中相机运动更大的 stride=16 设置,所有指标越高越好。

方法 主体一致性 背景一致性 美学 成像质量 首帧 CLIP 相似度 COLMAP 配准率
Wan 2.2 Fun Depth 0.8222 0.8527 0.5044 0.6497 0.4804 0.4956
Wan 2.2 Fun Canny 0.8226 0.8512 0.5104 0.7235 0.4630 0.5918
AnyV2V 0.7621 0.8579 0.5072 0.6299 0.4864 0.1875
Control-DINO Real Only 0.8544 0.8906 0.5485 0.6908 0.4406 0.9911
Control-DINO 0.8461 0.8862 0.5508 0.7109 0.4707 0.9932

相对 Canny,配准率提高 0.4014,即 40.14 个百分点,但成像质量由 0.7235 降到 0.7109,不能概括成全面胜出。相对自身 Real Only,混合增强使首帧 CLIP 相似度增加 0.0301,同时主体和背景一致性略降;这是外观迁移改善的直接证据,也是控制与外观之间存在折中的证据。

CLIP 相似度以目标首帧为参考,用作外观跟随的代理指标,并不是独立的“纯风格正确率”。COLMAP 配准率反映能否成功注册视角,不等于几何完全正确。基线采用不同预训练骨干和官方检查点,因此跨模型结果不能单独归因为 DINO 条件更优。

消融实验

原表 6 的 DL3DV140 架构消融中,下列三行可完整辨读。Tail Drop 训练先构建 64 维 PCA 基,并从 \(k\in\{8,16,32,64\}\) 随机保留前 \(k\) 个分量;表中是推理时分别保留 64 或 8 个分量的结果。

配置 FID,越低越好 主体一致性 背景一致性 美学 成像质量
Control-DINO 71.67 0.959 0.955 0.504 0.542
Tail Drop,k=64 108.87 0.918 0.920 0.459 0.494
Tail Drop,k=8 156.67 0.845 0.908 0.468 0.490

相对完整模型,两种 Tail Drop 配置的 FID 分别增加 37.20 和 85.00。原表 6 的“去空间混合”与“风格不变 PCA”两行在缓存中粘连,因此不拆猜其数字;空间混合消融只采用正文的定性结论。原表 3 同样标为 DL3DV140,但报告另一个重建与随机种子分析设置,Control-DINO 的 FID 为 20.23,不能拿它与表 6 的 71.67 混算提升。

三维条件分析

ScanNet++ 实验在基础模型上微调,训练片段按 stride=1 采样,接近 8k 个 clips;测试来自官方验证集的一部分。下表节选原表 4,并保留二维参考与三维输入条件的区别。

条件来源 PSNR,越高越好 SSIM,越高越好 LPIPS,越低越好 FID,越低越好
2D Control-DINO,参考 27.93 0.9084 0.0963 38.5853
无纹理网格渲染 21.41 0.8010 0.1807 67.1730
体素特征 22.80 0.8153 0.1572 65.3810
Concerto,有色设置 21.19 0.7805 0.1752 67.9680
Concerto (inpainted),无色设置 19.66 0.7542 0.2060 78.8411

关键发现

  • 结构控制的优势随相机运动扩大而更明显,但不是每种设置都领先:stride=8 时 Canny 配准率 0.9770,高于 Control-DINO 的 0.9530。
  • 高维信息与低输出多样性相伴。原表 3 中 Control-DINO 的 Latent Var. 为 0.1944、CLIP Var. 为 0.0051,Canny 分别为 0.4787、0.0150;正文没有充分给出这两个方差统计量的计算细节,只把它们作为同表内的种子敏感性证据。
  • 三维输入的缺失信息不能凭控制模块消除。体素结果优于网格,但仍低于具有完整图像特征的二维参考;无色 Concerto 的成像质量可达 0.6326,却不意味着其重建误差更小。

亮点与洞察

  • 表示解耦不一定要靠删通道。把源特征对应到多种输出外观,可以让接收表示的模型学会忽略不可靠的外观线索,同时避免 PCA 丢掉结构信息。
  • 稠密语义特征是跨二维与三维的实用接口。高维向量补充粗几何缺乏的语义,而可见性掩码让“未知区域”和“有效条件”得到不同处理。
  • 好的迁移结果需要同时衡量结构和外观。Real Only 的高配准率与低首帧相似度说明,只报告几何一致性会掩盖风格跟随失败。

局限与展望

  • 作者承认源外观仍会泄漏,尤其面对远离训练分布的风格。减弱条件可缓解,但也会放松结构约束;本文不是严格的风格与几何独立控制。
  • 首帧转换须保留结构与语义。对象替换或大幅布局修改不属于已验证的通用能力,不能把外观迁移结果解释成任意视频编辑。
  • 三维效果依赖重建质量、空洞比例及三维特征与二维 DINO 分布的匹配;无色点云结果更适合合理生成,而非精确恢复真实纹理。
  • 从笔记审读角度看,骨干与训练资源不统一、统计显著性和算力信息不足,限制了对效率及条件表示因果贡献的判断。缓存还有损坏公式、粘连表格及 Concerto 设置解释分散的问题,需区分原文报告与可验证细节。
  • 可继续研究按空间位置学习条件权重,对低置信度三维区域减弱注入;也值得在相同骨干、数据和训练预算下系统比较 DINO、深度、边缘及其他基础特征空间。

相关工作与启发

  • vs ControlNet / T2I-Adapter:继承冻结生成骨干加可训练条件分支的路线,差别在于使用高维基础特征并处理其外观纠缠,不是重新提出残差控制本身。
  • vs DIVE:DIVE 侧重主体驱动编辑和逐视频 MLP 优化;本文训练可复用的场景级稠密适配器,并验证三维条件,不需要逐视频优化。
  • vs Driving with DINO:并行工作也把 DINOv3 送入控制分支,但聚焦驾驶仿真到真实的转换并采用 PCA 频谱裁剪;本文用多外观监督保留原始高维信息,不能据此宣称裁剪对所有任务都无效。
  • vs REPA / Concerto:REPA 把 DINO 表示作为训练对齐目标,本文把它作为推理时的显式空间条件;Concerto 提供三维描述子,是本文输入来源而非视频生成基线。

评分

  • 新颖性: 4/5。价值在于多外观配对训练与通用二维、三维条件接口的结合,残差适配本身已有成熟先例。
  • 实验充分度: 4/5。覆盖跨域迁移、三维生成和特征消融,但骨干差异与缺失预算信息限制严格归因。
  • 写作质量: 3/5。主线明确,但若干协议说明不够集中,当前缓存还损坏了公式和部分消融行。
  • 价值: 4/5。为结构优先的视频编辑和生成式渲染提供可复用思路,同时清楚暴露了控制强度与多样性的折中。