Control-DINO: Feature Space Conditioning for Controllable Video Diffusion¶
会议: ECCV2026
Paper: https://eccv.ecva.net/virtual/2026/poster/4902
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/7924.pdf
项目: Control-DINO
领域: 视频生成
关键词: 稠密特征条件、外观解耦、视频风格迁移、三维引导生成、DINOv3
标题沿用会议清单;缓存 PDF 的标题多出 “Image-to-Video”,实际任务也以图像到视频扩散为基础。以下依据论文正文与实验表撰写;未从项目页核验代码或权重的发布状态。
一句话总结¶
Control-DINO 用保留全部通道的稠密 DINOv3 特征控制冻结的 CogVideoX,通过“原视频特征对应多种增强外观”的训练减少源外观复制,在 T&T 的 stride=16 外观迁移中获得 0.9932 的 COLMAP 配准率,并将同一特征接口扩展到三维生成。
研究背景与动机¶
视频外观迁移不是从零生成:用户已有一段视频,希望改变光照或画风,但保留建筑轮廓、物体身份和相机轨迹。深度图告诉模型表面在哪里,边缘图告诉模型哪里发生强烈变化,分割图提供类别区域;这些条件各自有效,却难以同时表达局部几何和细粒度语义。相机移动越大,单靠首帧外观和弱结构条件,后续帧越容易出现结构漂移。
DINOv3 的逐 patch 特征似乎能补足这一缺口:它们既描述物体及部件,也保留空间布局。然而,高信息量同时带来副作用,颜色、纹理和风格也编码在特征中。若直接用原视频特征监督原视频重建,最简单的学习策略就是复制源域外观;这会使控制分支与用户指定的新首帧风格相互竞争。论文中的 Real Only 对照说明,保持几何并不自动意味着能够跟随目标外观。
作者没有把主要希望寄托在 PCA 删除风格通道上,而是改变训练对应关系:同一份未改动的特征,可以对应不同风格、色调或清晰度的视频。核心 idea:保留高维特征中的结构信息,通过多外观监督教会控制分支选择性使用这些信息,而不是预先把整个特征压缩成一个假定无风格的子空间。
方法详解¶
整体框架¶
输入由源视频或三维场景提供的逐帧特征、目标外观首帧及文本条件组成,输出是沿给定结构和视角变化生成的视频。稠密特征接口负责把二维与三维来源统一到空间特征图,时空残差适配负责把它们注入冻结的视频模型,多外观配对训练则决定模型应从条件中读取什么。
训练和推理的差别很关键:训练时用源视频提取特征,却让模型对增强后的视频去噪;推理时不必把整段视频逐帧风格化,只需编辑首帧,再由源域特征维持后续布局。首帧编辑必须保留原有结构和语义,否则外观条件与结构条件仍可能冲突。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
Source["源视频或三维场景"] --> Features["稠密特征接口"]
Features --> Adapter["时空残差适配"]
Noisy["带噪视频潜变量"] --> Adapter
Adapter --> Backbone["冻结 CogVideoX<br/>目标首帧与文本"]
Original["原训练视频"] --> Features
Original --> Pairing["多外观配对训练"]
Backbone -->|训练预测| Pairing
Backbone -->|推理| Output["结构受控的新视频"]
关键设计¶
1. 稠密特征接口:用高通道数弥补低空间分辨率,并兼容三维来源
二维路径使用冻结的 DINOv3-ViT-S/16,逐帧提取 384 维 patch 特征。论文方法节说明先对输入图像做双三次上采样再编码,模型细节给出 2 倍尺度;最终条件图为 \(384\times60\times90\)。这不是把特征压成 RGB 控制图再送进视频 VAE,而是保留原始通道,由专门的适配器完成后续对齐。低空间分辨率并不等于只有粗略类别标签:每个 token 的高维向量仍携带部件布局和区域语义,能够给生成先验提供比单一深度或边缘更丰富的约束。
三维输入沿用同一接口,但获得特征的方式不同。网格路径沿目标相机轨迹渲染无纹理网格,对渲染图上采样后提取 DINOv3 特征。体素路径先由输入视频重建稠密点云,把图像 DINO 特征关联到三维点,再体素化并投影到目标视角。后者不是“只靠几何猜出 DINO”:它利用了输入视频提供的外观与特征信息,因此不能与纯无色几何条件当成同等信息量比较。
Concerto 路径从点云提取三维描述子,经体素化和渲染生成 DINO-like 条件图,让缺少完整 RGB 覆盖的场景也能进入同一控制分支。正文最终把表 4 的 Concerto 与 Concerto (inpainted) 分别解释为有色和无色点云设置;两者应分开报告。网格和体素投影的空洞也不能当作有效场景特征:作者传播可见性掩码,网格路径还明确将二值掩码用 CogVideoX VAE 编码,作为辅助条件,让模型识别需要补全的位置。
这套接口把“哪个视角能看见什么”交给三维投影,把“这些区域是什么”交给高维特征,把缺失纹理和细节交给视频生成先验。它并不保证三维描述子与二维 DINO 的分布完全一致;这种差异本身就是三维结果低于二维参考的一项限制。
2. 时空残差适配:在冻结骨干中混合条件与去噪状态
DINO 特征是逐帧图像表示,而视频 VAE 会压缩时间轴。直接逐帧相加会使条件与潜变量时间长度不匹配,因此作者使用两层因果 Conv3D,把 49 帧特征压缩到 13 个潜时间位置,再与带噪 VAE 潜变量沿通道拼接。因果结构对应视频编码器的时间组织方式,而不是任意抽取 13 帧来替代完整序列。
拼接后的信息进入隐藏维度为 256 的轻量 Transformer 控制分支,其输出通过零初始化投影,以加法残差注入 CogVideoX-5B-I2V 的前 16 个 Transformer 块。冻结大骨干保留预训练生成先验,小分支学习条件的使用方式;零初始化使训练起点不会突然扰乱骨干。推理时统一把残差强度缩放为 0.8,另可用空间掩码调节注入,未加掩码对应全部位置有效。
这里的 Transformer 不只是给每个位置换一个通道数。它让结构条件与当前去噪隐藏状态进行空间混合,从而在相机大幅移动时共同确定区域关系。作者用直接线性投影替换该过程后,观察到大相机运动下条件跟随变差;因此“输入具有语义”不足以替代“注入过程理解空间关系”。缓存中的原式(2)符号损坏,本笔记采用文字说明已可核实的残差机制,不自行补写为声称来自论文的完整公式。
3. 多外观配对训练:改监督关系,而非提前删除疑似风格方向
对于同一源视频,DINO 条件始终来自未风格化版本,去噪目标则从四组中等概率抽样:真实视频、光度增强、GAN 风格增强、小幅模糊。光度增强包括色相、饱和度、亮度、对比度和 gamma 等,并在整段视频中一致施加;GAN 组使用五种神经风格迁移方法。四组等概率是组间采样规则,不代表每一种具体滤镜与真实视频的概率相同。
这种训练让源特征中的颜色不再是可靠的唯一答案,但空间布局仍能预测所有增强目标共有的结构。模型因而学会降低对源外观的依赖,同时依靠目标首帧给出生成外观。它是功能上的选择性解耦,并不声称 DINO 特征本身已分解成独立的几何和风格变量。
论文还认真检验了“先删风格方向”的替代方案:利用真实与风格化特征的差向量估计风格方向,投影掉这些方向后再做结构 PCA。该方案把跨外观余弦相似度从 0.9194 提到 0.9481,却只保留 30.4% 的解释方差;取底部特征向量能达到 0.9929 的相似度,但只留下 2.9% 方差。也就是说,让两个外观的表示更像,不一定意味着还保留了足够的结构控制信息,这正是本文坚持保留 384 通道的依据。
一个完整示例¶
以一段沿建筑移动的 49 帧视频为例,用户希望得到同一路径的绘画风格视频。先对原始 49 帧提取 \(384\times60\times90\) 的条件图,再由因果适配器得到 13 个潜时间位置;只对首帧做 InstantStyle 编辑,作为目标外观参考。
去噪过程中,轻量分支同时读取源特征与当前带噪潜变量,通过前 16 个块的残差持续约束建筑和背景布局,目标首帧则提供绘画外观。换成三维场景时,先沿相机轨迹渲染特征和可见性掩码,再进入相同分支。这个例子用于解释流程,不是新增的定量实验;首帧被改动到不再保持建筑结构时,论文并未保证该流程仍能正确工作。
损失函数 / 训练策略¶
论文采用速度预测的平方误差目标。把正文中的监督关系显式写出,目标来自增强视频潜变量 \(\tilde z_0\),条件来自原视频特征 \(F_{1:T}\):
这里 \(t\) 是扩散时间步,\(1:T\) 才是视频帧索引,\(z_t\) 是增强视频经过前向加噪后的潜变量;式中省略的首帧和文本仍是骨干条件。上式按正文明确的速度目标与增强配对关系整理,不增加额外解耦损失。缓存的前向加噪原式(1)和特征形状原式(3)存在缺字符,不能据此推断完整噪声调度或更多维度约定。
仅时间适配器和轻量 Transformer 分支从头训练。优化器为 AdamW,\(\beta_1=0.9\)、\(\beta_2=0.95\),峰值学习率 \(2\times10^{-4}\),余弦退火,500 步预热,batch size 为 8,梯度裁剪为 1.0,条件输入以 0.1 概率置零。正文没有给出可核实的总训练步数、完整 GPU 成本或推理速度,不补写这些信息。
实验关键数据¶
主实验¶
基础训练集为 DL3DV,约 4.5M 个独立训练帧,评估约 10k 个独立帧。跨域测试使用 Tanks and Temples,按 stride=8 和 stride=16 采样,并为每个场景设置 15 种不同于训练的光照或风格变化。下表节选原表 1 中相机运动更大的 stride=16 设置,所有指标越高越好。
| 方法 | 主体一致性 | 背景一致性 | 美学 | 成像质量 | 首帧 CLIP 相似度 | COLMAP 配准率 |
|---|---|---|---|---|---|---|
| Wan 2.2 Fun Depth | 0.8222 | 0.8527 | 0.5044 | 0.6497 | 0.4804 | 0.4956 |
| Wan 2.2 Fun Canny | 0.8226 | 0.8512 | 0.5104 | 0.7235 | 0.4630 | 0.5918 |
| AnyV2V | 0.7621 | 0.8579 | 0.5072 | 0.6299 | 0.4864 | 0.1875 |
| Control-DINO Real Only | 0.8544 | 0.8906 | 0.5485 | 0.6908 | 0.4406 | 0.9911 |
| Control-DINO | 0.8461 | 0.8862 | 0.5508 | 0.7109 | 0.4707 | 0.9932 |
相对 Canny,配准率提高 0.4014,即 40.14 个百分点,但成像质量由 0.7235 降到 0.7109,不能概括成全面胜出。相对自身 Real Only,混合增强使首帧 CLIP 相似度增加 0.0301,同时主体和背景一致性略降;这是外观迁移改善的直接证据,也是控制与外观之间存在折中的证据。
CLIP 相似度以目标首帧为参考,用作外观跟随的代理指标,并不是独立的“纯风格正确率”。COLMAP 配准率反映能否成功注册视角,不等于几何完全正确。基线采用不同预训练骨干和官方检查点,因此跨模型结果不能单独归因为 DINO 条件更优。
消融实验¶
原表 6 的 DL3DV140 架构消融中,下列三行可完整辨读。Tail Drop 训练先构建 64 维 PCA 基,并从 \(k\in\{8,16,32,64\}\) 随机保留前 \(k\) 个分量;表中是推理时分别保留 64 或 8 个分量的结果。
| 配置 | FID,越低越好 | 主体一致性 | 背景一致性 | 美学 | 成像质量 |
|---|---|---|---|---|---|
| Control-DINO | 71.67 | 0.959 | 0.955 | 0.504 | 0.542 |
| Tail Drop,k=64 | 108.87 | 0.918 | 0.920 | 0.459 | 0.494 |
| Tail Drop,k=8 | 156.67 | 0.845 | 0.908 | 0.468 | 0.490 |
相对完整模型,两种 Tail Drop 配置的 FID 分别增加 37.20 和 85.00。原表 6 的“去空间混合”与“风格不变 PCA”两行在缓存中粘连,因此不拆猜其数字;空间混合消融只采用正文的定性结论。原表 3 同样标为 DL3DV140,但报告另一个重建与随机种子分析设置,Control-DINO 的 FID 为 20.23,不能拿它与表 6 的 71.67 混算提升。
三维条件分析¶
ScanNet++ 实验在基础模型上微调,训练片段按 stride=1 采样,接近 8k 个 clips;测试来自官方验证集的一部分。下表节选原表 4,并保留二维参考与三维输入条件的区别。
| 条件来源 | PSNR,越高越好 | SSIM,越高越好 | LPIPS,越低越好 | FID,越低越好 |
|---|---|---|---|---|
| 2D Control-DINO,参考 | 27.93 | 0.9084 | 0.0963 | 38.5853 |
| 无纹理网格渲染 | 21.41 | 0.8010 | 0.1807 | 67.1730 |
| 体素特征 | 22.80 | 0.8153 | 0.1572 | 65.3810 |
| Concerto,有色设置 | 21.19 | 0.7805 | 0.1752 | 67.9680 |
| Concerto (inpainted),无色设置 | 19.66 | 0.7542 | 0.2060 | 78.8411 |
关键发现¶
- 结构控制的优势随相机运动扩大而更明显,但不是每种设置都领先:stride=8 时 Canny 配准率 0.9770,高于 Control-DINO 的 0.9530。
- 高维信息与低输出多样性相伴。原表 3 中 Control-DINO 的 Latent Var. 为 0.1944、CLIP Var. 为 0.0051,Canny 分别为 0.4787、0.0150;正文没有充分给出这两个方差统计量的计算细节,只把它们作为同表内的种子敏感性证据。
- 三维输入的缺失信息不能凭控制模块消除。体素结果优于网格,但仍低于具有完整图像特征的二维参考;无色 Concerto 的成像质量可达 0.6326,却不意味着其重建误差更小。
亮点与洞察¶
- 表示解耦不一定要靠删通道。把源特征对应到多种输出外观,可以让接收表示的模型学会忽略不可靠的外观线索,同时避免 PCA 丢掉结构信息。
- 稠密语义特征是跨二维与三维的实用接口。高维向量补充粗几何缺乏的语义,而可见性掩码让“未知区域”和“有效条件”得到不同处理。
- 好的迁移结果需要同时衡量结构和外观。Real Only 的高配准率与低首帧相似度说明,只报告几何一致性会掩盖风格跟随失败。
局限与展望¶
- 作者承认源外观仍会泄漏,尤其面对远离训练分布的风格。减弱条件可缓解,但也会放松结构约束;本文不是严格的风格与几何独立控制。
- 首帧转换须保留结构与语义。对象替换或大幅布局修改不属于已验证的通用能力,不能把外观迁移结果解释成任意视频编辑。
- 三维效果依赖重建质量、空洞比例及三维特征与二维 DINO 分布的匹配;无色点云结果更适合合理生成,而非精确恢复真实纹理。
- 从笔记审读角度看,骨干与训练资源不统一、统计显著性和算力信息不足,限制了对效率及条件表示因果贡献的判断。缓存还有损坏公式、粘连表格及 Concerto 设置解释分散的问题,需区分原文报告与可验证细节。
- 可继续研究按空间位置学习条件权重,对低置信度三维区域减弱注入;也值得在相同骨干、数据和训练预算下系统比较 DINO、深度、边缘及其他基础特征空间。
相关工作与启发¶
- vs ControlNet / T2I-Adapter:继承冻结生成骨干加可训练条件分支的路线,差别在于使用高维基础特征并处理其外观纠缠,不是重新提出残差控制本身。
- vs DIVE:DIVE 侧重主体驱动编辑和逐视频 MLP 优化;本文训练可复用的场景级稠密适配器,并验证三维条件,不需要逐视频优化。
- vs Driving with DINO:并行工作也把 DINOv3 送入控制分支,但聚焦驾驶仿真到真实的转换并采用 PCA 频谱裁剪;本文用多外观监督保留原始高维信息,不能据此宣称裁剪对所有任务都无效。
- vs REPA / Concerto:REPA 把 DINO 表示作为训练对齐目标,本文把它作为推理时的显式空间条件;Concerto 提供三维描述子,是本文输入来源而非视频生成基线。
评分¶
- 新颖性: 4/5。价值在于多外观配对训练与通用二维、三维条件接口的结合,残差适配本身已有成熟先例。
- 实验充分度: 4/5。覆盖跨域迁移、三维生成和特征消融,但骨干差异与缺失预算信息限制严格归因。
- 写作质量: 3/5。主线明确,但若干协议说明不够集中,当前缓存还损坏了公式和部分消融行。
- 价值: 4/5。为结构优先的视频编辑和生成式渲染提供可复用思路,同时清楚暴露了控制强度与多样性的折中。