Unified Video Dense Prediction from Disjoint Data¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://unid-video.github.io
领域: 语义分割
关键词: 统一稠密预测、视频场景理解、隐空间蒸馏、扩散先验、时间连续性
一句话总结¶
针对多任务密集标注在跨数据集下互斥割裂且视频标注极其匮乏的难题,本文提出 UniD,利用预训练扩散模型的通用视觉先验,在完全互斥的异构静态/视频数据集上训练单任务专家,并通过轻量级投影器在隐空间联合蒸馏出共享主干,仅需一次前向传播即可实时统一预测深度、法线、反照率、着色、边界、语义、材质及人体部件等 8 项视频稠密属性。
研究背景与动机¶
构建能够全面理解复杂物理世界的视觉系统,需要模型同时推断场景的几何结构(如深度、表面法线)、外观材质属性(如反照率、着色、材料)以及高层语义信息(如语义分割、人体部件与实例边界)。现实中具身智能导航或动态场景交互更是要求这些预测在视频流中保持高帧率连续输出。然而,现存的密集预测标注高度碎片化且彼此互斥:几何标注多依赖 RGB-D 传感器且局限于低语义多样性的室内或街景,语义分割需大量人工标注但极度缺乏精确几何真值,而本征图像分解(Intrinsic Decomposition)更几乎只能在合成渲染数据集中获取。
这种数据割裂带来的核心矛盾是:现有统一多任务模型要么退缩在全共标注(Co-annotated)的狭窄子集上训练,要么被迫花费庞大的计算资源对海量未标注数据进行离线伪标签(Pseudo-labeling)生成;而扩展到视频领域时,为所有任务制作稠密时序标注在经济与人力上更不可承受。同时,若引入多任务模型,一旦增加新任务就需要对全部数据重打伪标签并重新联合训练,完全丧失了工程可扩展性。
面对数据互斥与视频时序标注缺失的双重困境,本文的切入角度是:预训练扩散模型在大规模网络数据上吸收了强大的开放域视觉先验,不仅天然具备几何与外观不变性,还在跨帧之间内生蕴含对应关系。核心 idea:先借助预训练扩散先验在完全互斥的数据集上分别训练单任务专家,再通过轻量级任务投影器在隐空间将各专家的潜在表征在线蒸馏至统一时序主干中,完全摒弃共标注与伪标签生成,实现跨域泛化与无视频标注任务的时序一致性迁移。
方法详解¶
整体框架¶
UniD 将视频稠密预测任务表述为:输入包含 \(T\) 帧的视频流 \(\mathbf{v} = \{\mathbf{x}_1, \dots, \mathbf{x}_T\}\)(\(\mathbf{x}_i \in \mathbb{R}^{H \times W \times 3}\)),共享主干网络仅执行一次前向计算,同时输出 \(K=8\) 项任务的稠密预测图 \(\{\mathbf{y}_i^k\}_{k=1}^K\)(\(\mathbf{y}_i^k \in \mathbb{R}^{H \times W \times C_k}\))。整个框架分为三个核心组成部分:首先,基于预训练单步潜扩散模型(LDM)在各自互斥数据集上训练单任务专家(Task Specialists);其次,构建带有扩展自注意力(Extended Self-Attention, ESA)的统一主干网络 \(\mathbf{G}_\phi\),配合各任务轻量级隐空间投影器(Latent Projectors)\(\Psi^k\),通过隐空间重构损失与时序梯度匹配损失进行在线蒸馏;最后,在流式推理时,共享特征经由任务投影器、预训练 VAE 解码器前缀与像素投影器瞬时解码出所有多任务稠密预测。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400, 'subGraphTitleMargin': {'top': 8, 'bottom': 16}}}}%%
flowchart TD
A["输入视频帧序列<br/>x_1, ..., x_T"] --> B["VAE 编码器 E 映射<br/>隐空间表征 z_i"]
B --> C["单步扩散专家训练<br/>各任务互斥数据集优化"]
B --> D["统一主干网络 G_phi<br/>扩展自注意力 ESA 时序记忆"]
C -.->|提供专家潜在目标 l_i^k| E["隐空间联合蒸馏<br/>轻量级 DPT 投影器 Psi^k"]
D --> E
E --> F["时序梯度匹配正则<br/>跨帧抑制伪影与闪烁"]
F --> G["流式多任务联合解码<br/>Psi^k + VAE D' + Pk 一次前向"]
G --> H["8 项视频稠密预测输出<br/>几何 / 语义 / 本征 / 边界"]
关键设计¶
1. 单步扩散专家训练:借助生成先验跨越互斥数据域分布差异
针对多任务数据集互斥且域分布差异极大的问题(如几何来自室内合成扫描、本征来自合成渲染、语义来自真实网络图像),直接使用判别式网络(如 DINOv3)联合拟合极易在外观与几何的虚假相关性上过拟合。UniD 选择以 Stable Diffusion v2 为基底构建单任务专家 \((F_\theta^k, P^k)\)。输入图像 \(\mathbf{x}_i\) 由冻结的 VAE 编码器映射至紧凑隐空间 \(\mathbf{z}_i = \mathcal{E}(\mathbf{x}_i) \in \mathbb{R}^{h \times w \times d}\)。为了彻底免除传统扩散模型多步迭代去噪的推理延迟,模型采用单步扩散机制,由 U-Net 骨干网络 \(F_\theta^k\) 直接预测任务潜在嵌入 \(\mathbf{l}_i^k \in \mathbb{R}^{h \times w \times d}\)。该潜在特征经由截断至最后卷积层前的冻结 VAE 解码器 \(\mathcal{D}'(\cdot)\) 升采样至全分辨率空间特征,再通过单个 \(3 \times 3\) 卷积构成的像素投影器 \(P^k\) 输出最终预测 \(\hat{\mathbf{y}}_i^k = P^k(\mathcal{D}'(\mathbf{l}_i^k)) \in \mathbb{R}^{H \times W \times C_k}\)。专家模型直接在各自任务的独立标注集 \(\mathcal{D}_k\) 上通过特定任务损失 \(\mathcal{L}_k\) 优化:
$$ (F_\theta^k, P^k) = \arg\min_{F^k, P^k} \mathbb{E}_{(\mathbf{x}, \mathbf{y}^k) \sim \mathcal{D}_k} \left[ \mathcal{L}_k\left( P^k(\mathcal{D}'(F^k(\mathcal{E}(\mathbf{x})))), \mathbf{y}^k \right) \right] $$
这种设计使专家模型充分继承了扩散模型强大的通用视觉表征与形状感知能力,显著增强了在未见域场景下的泛化鲁棒性。
2. 隐空间联合蒸馏:规避高昂伪标签与梯度回传开销的通用表征对齐
在获得 \(K\) 个单任务专家后,若采用常规的伪标签生成方案,不仅需要在离线阶段存储数以亿计的高分辨率多任务标签图,而且在联合训练时若从像素预测反向传播,必须在显存中同时常驻 \(K\) 个解码器反向计算图,导致单卡显存开销膨胀至不可承受的 650GB。UniD 提出直接在隐空间实施在线特征蒸馏。构建与专家结构一致的统一 U-Net 主干 \(\mathbf{G}_\phi\),并在其顶层挂载 \(K\) 个轻量级密集预测变换器(DPT)隐空间投影器 \(\{\Psi^k\}_{k=1}^K\)(融合 3 个中间特征与最终输出,特征维度压缩至 256)。对于任意未标注的视频序列,各个冻结的专家实时计算目标潜在码 \(\mathbf{l}_i^k = F_\theta^k(\mathbf{z}_i)\),而统一主干仅需一次前向推导,令预测潜在特征 \(\hat{\mathbf{l}}_i^k = \Psi^k(\mathbf{G}_\phi(\mathbf{z}_i))\) 逼近专家目标。隐空间蒸馏完全绕过了高分辨率解码器 \(\mathcal{D}'\) 的反向传播,将训练峰值显存从 650GB 剧降至 78GB,降幅达 88%,且使得引入第 \(K+1\) 个新任务时只需额外训练单个轻量投影器,骨干网络完全无需重构。
3. 时序梯度匹配正则:促使静态任务无缝继承视频时序一致性
视频稠密预测面临标注不对称的严峻挑战:几何任务(如深度)或部分语义分割含有时序视频数据,但本征分解与材质等任务完全缺乏连续视频真实标注。若蒸馏目标仅包含逐帧 \(\ell_1\) 误差,统一模型无法学到动态平滑规律。为此,UniD 引入扩展自注意力(Extended Self-Attention, ESA)机制,将当前帧查询特征 \(\mathbf{Q}_t\) 与历史记忆库 \(\mathcal{M}_t\)(包含过去 \(M\) 帧的键 \(\mathbf{K}_s\) 与值 \(\mathbf{V}_s\))及当前帧联合进行注意力交互,无需额外时序参数即可通过帧间特征对应实现连续平滑。在此基础上,UniD 将时序梯度匹配(Temporal Gradient Matching, TGM)拓展至潜空间,要求统一网络在相邻帧间的特征变化趋势严格对齐专家的时序变化,同时引入动态掩码 \(\mathbb{I}_{[\cdot]}\) 过滤掉剧烈运动与遮挡形变的不可靠区域:
$$ \mathcal{L}{\text{TGM}}(\hat{\mathbf{l}}, \mathbf{l}) = \sum}^{T-1} \mathbb{I{[\cdot]} \cdot \left| \frac{\hat{\mathbf{l}}} - \hat{\mathbf{l}i}{|\hat{\mathbf{l}}} - \hat{\mathbf{l}i|_2} - \frac{\mathbf{l}} - \mathbf{li}{|\mathbf{l} \right|_1 $$
最终隐空间联合重构损失为 } - \mathbf{l}_i|_2\(\mathcal{L}_{\text{rec}} = \|\hat{\mathbf{l}}_i^k - \mathbf{l}_i^k\|_1 + \lambda \mathcal{L}_{\text{TGM}}(\hat{\mathbf{l}}^k, \mathbf{l}^k)\)。在此联合优化下,即使从未接受过视频监督的本征与材质任务,也能无监督地从深度等视频任务中共享到高度稳定的时序平滑先验。
损失函数 / 训练策略¶
在统一模型训练阶段,统一主干 \(\mathbf{G}_\phi\) 及各任务隐空间投影器 \(\{\Psi^k\}_{k=1}^K\) 在所有任务的标注数据集联合上进行联合训练,图像数据与视频数据各按 50% 权重均匀采样。训练采用 AdamW 优化器,学习率设为 \(3 \times 10^{-5}\),权重衰减为 \(10^{-2}\),批大小为 32,共迭代训练 50k 步。针对离散分类属性的语义分割任务,作者发现纯 \(\ell_1\) 潜空间重构难以完全捕获高频语义边界(交叉熵专家潜变量的空间拉普拉斯范数高达 2.52,远高于回归任务的 1.40),因此在主蒸馏完成后,可对语义任务的轻量投影器 \((\Psi^k, P^k)\) 进行保持主干 \(\mathbf{G}_\phi\) 冻结的轻量微调(FT),以极低代价补足分类精度。
实验关键数据¶
主实验¶
评估全面覆盖 8 项稠密预测任务,重点检验模型在从未见过的域外分布(OOD)上的泛化能力。在单目深度估计与表面法线估计对比中,UniD 在域外基准上全面大幅领先各类多任务统一模型与强判别式基线 DINOv3-H。
| 数据集 (深度) | 指标 | UniD (Gϕ) [本文] | DINOv3-H (多任务基线) | 4M-21-XL (统一多任务) | DICEPTION (统一扩散) |
|---|---|---|---|---|---|
| NYUv2 (室内 OOD) | AbsRel ↓ / \(\delta_1\) ↑ | 0.059 / 96.3 | 0.092 / 92.9 | 0.068 / 95.1 | 0.060 / 96.3 |
| KITTI (室外 OOD) | AbsRel ↓ / \(\delta_1\) ↑ | 0.110 / 89.5 | 0.121 / 86.5 | 0.105 / 89.6 | 0.085 / 91.8 |
| ETH3D (真实 OOD) | AbsRel ↓ / \(\delta_1\) ↑ | 0.073 / 95.5 | 0.087 / 93.7 | 0.070 / 95.3 | 0.070 / 96.6 |
| ScanNet (室内 OOD) | AbsRel ↓ / \(\delta_1\) ↑ | 0.063 / 96.2 | 0.089 / 93.6 | 0.065 / 95.5 | 0.071 / 94.8 |
| DIODE (混合 OOD) | AbsRel ↓ / \(\delta_1\) ↑ | 0.301 / 77.3 | 0.314 / 77.5 | 0.331 / 73.4 | 0.304 / 72.2 |
| 数据集 (表面法线) | 指标 | UniD (Gϕ) [本文] | DINOv3-H (多任务基线) | 4M-21-XL (统一多任务) | DICEPTION (统一扩散) |
|---|---|---|---|---|---|
| NYUv2 (室内 OOD) | Mean ↓ / \(11.25^\circ\) ↑ | 16.2 / 59.9 | 16.8 / 57.0 | 18.4 / 49.8 | 19.7 / 51.4 |
| ScanNet (室内 OOD) | Mean ↓ / \(11.25^\circ\) ↑ | 14.6 / 65.1 | 16.0 / 58.7 | 17.4 / 48.9 | 19.3 / 54.5 |
| iBims-1 (真实 OOD) | Mean ↓ / \(11.25^\circ\) ↑ | 16.6 / 67.4 | 16.7 / 66.8 | 18.6 / 61.4 | 17.8 / 66.2 |
| Sintel (动画/合成 OOD) | Mean ↓ / \(11.25^\circ\) ↑ | 33.0 / 21.4 | 32.3 / 18.9 | 41.6 / 12.4 | 37.2 / 19.6 |
在反照率、着色与边界检测上,UniD (Gϕ) 在域内维持顶尖水平的同时,域外显著超越基线(IIW 反照率 WHDR 降至 0.207 对比 DINOv3-H 的 0.289;SAW 着色 [email protected] 达到 94.6 对比 87.8;Mapillary 边界 odsF 达 57.2 对比 55.0)。
消融实验¶
消融实验着重探究视频训练监督与推理期时序记忆库(ESA)对视频一致性指标(mVC-4/16)及几何精度的具体贡献。
| 训练视频监督 (Train w/ Video) | 推理记忆库 (Inf. Memory) | 深度 ScanNet (AbsRel ↓) | 法线 InteriorNet (mVC-4/16 ↑) | 反照率 InteriorNet (mVC-4/16 ↑) | 着色 InteriorNet (mVC-4/16 ↑) | 边界 YT-VIS (mVC-4 ↑) | 语义 VIPSeg (mVC-4 ↑) |
|---|---|---|---|---|---|---|---|
| ✗ (仅单帧静态蒸馏) | \(\emptyset\) (单帧无记忆) | 0.121 | 79.0 / 65.6 | 84.4 / 65.0 | 92.7 / 81.5 | 92.9 | 85.9 |
| ✗ (仅单帧静态蒸馏) | [16, 1] (16帧时序滑动) | 0.115 | 82.9 / 72.7 | 87.3 / 70.7 | 93.6 / 82.9 | 93.0 | 89.1 |
| ✓ (包含时序 TGM 正则) | \(\emptyset\) (单帧无记忆) | 0.109 | 80.9 / 68.5 | 86.0 / 67.1 | 93.7 / 83.5 | 93.6 | 86.5 |
| ✓ (UniD 完整方案) | [16, 1] (16帧时序滑动) | 0.103 | 84.7 / 75.8 | 88.8 / 73.7 | 94.5 / 85.2 | 93.7 | 90.3 |
在推理效率方面(单卡 A100,432×768 分辨率):独立专家集成 \(K=8\) 顺序推断在 \(M=16\) 时仅有 0.44 FPS,而 UniD 仅需计算一次 U-Net 主干(235.0 ms),总推理时间由单图 2.27s 压减至 0.64s,实现 1.56 FPS,带来超过 3.5 倍的加速。
关键发现¶
- 跨任务时序增益的外溢效应:在训练集中,仅有深度与语义分割任务具备视频标注。然而消融表明,加入视频训练与 TGM 损失后,完全没有视频标注的反照率(mVC 从 84.4 提升至 88.8)和着色(mVC 从 92.7 提升至 94.5)时序稳定性显著飞跃,证明统一特征表征成功将时序平滑性传递至无视频标注任务。
- 扩散生成先验抵御域漂移:在 Hypersim 验证集上施加颜色抖动时,UniD 专家的深度绝对相对误差波动仅 0.011(对比 DINOv3-H 的 0.034),法线误差波动仅 \(2.2^\circ\)(对比 \(5.8^\circ\)),鲁棒性提升近 3 倍。
- 跨任务几何自洽性自发增强:在 ScanNet 深度与表面法线的几何一致性检验中,统一模型 UniD (Gϕ) 取得 \(22.6^\circ\) 均值误差,不仅显著优于 DINOv3-H 的 \(36.0^\circ\) 和 DICEPTION 的 \(27.3^\circ\),甚至超越了独立专家集成(\(23.9^\circ\)),表明多任务共享特征对几何空间形成了互补约束。
亮点与洞察¶
- 完全解耦互斥数据集的潜空间蒸馏范式:UniD 证明了无需强制构建全任务共标注基准,也无需忍受昂贵且存在累积误差的离线伪标签流水线,借助在各自领域充分拟合的单任务专家在潜空间实施蒸馏,即可获得高质量的统一多任务模型。
- 单步扩散与共享主干实现高效多任务吞吐:摒弃了扩散模型昂贵的多步迭代反向采样,借助单步扩散直接回归高质量潜码,配合一次主干前向 + 多头轻量级 DPT 投影,使得多任务密集推断在 16 帧长时序上下文下仍可稳定维持 1.56 FPS。
- 可低成本无限横向扩展的模块化架构:若未来需要新增第 9 项稠密感知任务(如光流、三维边界框),仅需独立微调该任务的专家网络并训练其对应的轻量级潜在投影器 \(\Psi^{K+1}\),既无需对历史数据打新标签,也无需全量重训统一主干。
局限与展望¶
- 分类属性任务在纯 \(\ell_1\) 蒸馏下的频域失真:由于交叉熵训练出的离散语义专家潜空间包含极其丰富的高频空间细节,直接使用平滑倾向的 \(\ell_1\) 潜空间重构会导致语义分割准确率下滑(Cityscapes mIoU 由 64.1 跌至 37.8),虽可通过只调投影器的轻量微调补救至 58.4,但未来仍需探索能更好保留高频语义边界的非对称潜空间蒸馏目标。
- 长时序大显存消耗与在线流式延迟瓶颈:ESA 机制基于历史键值对缓存,在超长视频序列中显存增长不可忽视;当前 1.56 FPS 虽然在多任务模型中表现优秀,但距离严苛的 30 FPS 实时交互仍有优化空间,未来可引入状态空间模型(Mamba)或递归隐式记忆机制。
相关工作与启发¶
- vs DICEPTION / 4M-21:DICEPTION 将全部多任务映射回 RGB 图像空间并依赖文本 prompt 引导,导致 \(K\) 个任务必须执行 \(K\) 次独立的扩散去噪;4M-21 要求所有任务输出先离散 Token 化,丧失了任务特异性连续回归优化的灵活性。UniD 在潜空间保持连续向量表征,单次前向并发输出全部 8 项结果,并支持任意维度的像素投影。
- vs DINOv3-H 多任务基线:判别式自监督模型在具有配对真值的训练域内表现优异,但在缺乏标注的域外场景(OOD)中容易被表观纹理带偏;UniD 依托在网络规模多模态数据上预训练的生成式扩散先验,展现出压倒性的跨域鲁棒性与几何不变性。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ (提出利用预训练扩散先验通过无伪标签潜空间蒸馏统一互斥数据多任务,思路巧妙)
- 实验充分度: ⭐⭐⭐⭐⭐ (全面评测 8 项任务的域内/域外表现、视频时序指标、跨任务一致性与运行时显存分析)
- 写作质量: ⭐⭐⭐⭐⭐ (结构清晰严谨,深入分析了分类任务潜空间拉普拉斯范数的频域差异)
- 价值: ⭐⭐⭐⭐⭐ (为大规模碎片化、互斥领域的多任务视频感知提供了一条极具工程落地与拓展价值的高效路线)