跳转至

Weather-Conditioned Depth Anything

会议: ECCV 2026
论文: ECCV 2026
领域: 3D 视觉
关键词: 单目深度估计, 恶劣天气鲁棒性, 风格与内容解耦, 风格滤波器, 参数高效微调

一句话总结

针对单目深度基础模型在雨雪雾夜等恶劣天气下特征混杂与几何失真的痛点,本文提出 DA-W(Weather-Conditioned Depth Anything),通过跨域对比学习的风格滤波器提取解耦天气嵌入,并借助零初始化 AdaLN-Zero 轻量调制解码器,在不破坏清晰场景泛化能力的前提下显著提升复杂天气下的深度估计鲁棒性。

研究背景与动机

单目深度估计(Monocular Depth Estimation, MDE)作为三维场景感知的核心基石,在自动驾驶、具身智能与机器人导航等低成本视觉系统中扮演着不可替代的角色。近年来,以 Depth Anything 系列为代表的通用深度估计大模型凭借大规模多源混合数据预训练和仿射不变损失,在常规清晰天气和开域场景中展现出惊人的零样本几何泛化能力。然而,当输入图像遭遇雨、雪、浓雾或暗光夜间等恶劣天气时,大气散射、水滴附着、雨条遮挡以及传感器夜间噪声彻底破坏了清晰成像假设,导致前沿深度大模型输出出现严重的深度撕裂、结构伪影与几何失真。

面对这一鲁棒性鸿沟,现有解决范式陷入了两难困境。第一类方法依赖两阶段管线,即先利用通用图像恢复或扩散增强模型去除天气退化,再将恢复图像喂入深度估计器;但图像去雾/去雨等恢复算法的优化目标通常偏向人眼感知的逼真度,极易平滑掉高频几何线索,甚至引入非物理的人工幻觉。第二类方法选择直接对深度模型进行恶劣天气适应训练,但真实世界的成对多天气几何真值极其昂贵,现有工作多依赖合成退化数据。通过深入探究 ViT 编码器的全局特征表示(如提取 Depth Anything v2 的 CLS 标记进行 t-SNE 可视化)可以发现,现存基础模型将天气外观风格与物体几何语义严重混杂在了一起,不同天气条件的嵌入彼此缠绕,根本无法区分是场景本身的纹理还是外界天气退化,这成为合成退化向真实退化泛化时的致命瓶颈。

本文的切入角度是:与其破坏主干网络既有的通用几何先验,不如显式实现「内容与天气风格」的解耦与条件注入。核心 idea:设计跨域对比学习的风格滤波器(Style Filter)提取紧凑且与内容无关的域对齐天气嵌入,并通过多尺度零初始化 AdaLN-Zero 调制模块仅微调 DPT 解码器,在冻结编码器先验的同时赋予模型自适应全天候环境的能力。

方法详解

整体框架

DepthAnything-W(DA-W)整体管线包含风格特征提取与天气条件深度生成两个核心阶段。输入任意 RGB 图像(清晰、真实恶劣天气或合成退化图像),系统首先通过预训练的风格滤波器(Style Filter)计算全局外观统计特性,映射为紧凑的 64 维天气条件嵌入 \(\mathbf{w}\);随后,图像输入冻结的 DINOv2 ViT 编码器提取多尺度金字塔几何特征,在 DPT 逐步上采样解码的 4 个多尺度特征层及最终预测头入口(共 5 处)通过 AdaLN-Zero 模块接入天气嵌入进行自适应特征调制,最终输出高质量深度视差图。整个训练流程配合伪标签蒸馏与几何一致性约束,使模型在掌握恶劣天气补偿的同时完全规避灾难性遗忘。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入退化/清晰图像 I"] --> B["阶段1:风格滤波器<br/>多尺度 Gram 矩阵与跨域对比提取"]
    A --> C["冻结 ViT 编码器<br/>提取多尺度金字塔特征 Fi"]
    B --> D["阶段2:轻量化天气条件调制<br/>AdaLN-Zero 预测尺度/平移/门控系数"]
    C --> D
    D --> E["阶段3:联合蒸馏与一致性监督<br/>教师引导蒸馏 + 成对对齐 + 增强正则"]
    E --> F["输出天气自适应鲁棒深度图"]

关键设计

1. 风格滤波器:解耦且域对齐的天气嵌入提取 基础模型无法有效应对天气的根本原因在于外观风格与场景几何高度纠缠,且合成退化与真实退化之间存在分布鸿沟。为此,本文设计了独立的风格滤波器 \(F_\theta(\cdot)\),利用多尺度 Gram 矩阵表征低阶纹理退化统计特性,将其映射为 64 维紧凑天气嵌入 \(\mathbf{w} \in \mathbb{R}^{64}\)。在对比学习训练中,跨越 7 个真实恶劣天气数据集(15K 图像)与 4 个高质量合成退化数据集(20K 图像),构建统一隐空间。对于批次内图像对 \((a, b)\),其对比损失定义为: $$ \mathcal{L}{\text{con}} = \sum}} \left[ \mathbb{I{ab} [m - d]+ + (1 - \mathbb{I} \right] $$ 其中 }) d_{ab\(d_{ab}\) 为天气嵌入 \(\mathbf{w}_a\) 与 \(\mathbf{w}_b\) 的余弦相似度,\(m\) 为正边距,\(\mathbb{I}_{ab}=1\) 表示两幅图像属于同一种天气类别(如均为雪天),否则为 0。关键创新在于将同属一种天气类型的真实样本与合成样本显式作为正样本对进行拉近,打破了以往仅在单域内对比的局限,迫使嵌入空间对场景语义内容完全不敏感,而对降水、起雾、光照骤降等物理属性高度敏感且实现真伪域对齐。

2. 轻量化天气条件调制:零初始化 AdaLN-Zero 解码器注入 若为了恶劣天气而全量微调整个深度大模型,往往会导致预训练在大规模清晰图像上的先验知识发生严重灾难性遗忘。DA-W 保持庞大的 ViT 编码器完全冻结,仅在 DPT 解码器的 4 个多尺度特征融合层(通道降维至 \(C_i=64\) 后)以及输出预测头前的一处全局特征层引入轻量调制(全流程仅 5 处)。一个极轻量的 MLP 将 64 维天气嵌入 \(\mathbf{w}\) 映射为通道维度的平移向量 \(\boldsymbol{\beta}_i(\mathbf{w})\)、缩放向量 \(\boldsymbol{\gamma}_i(\mathbf{w})\) 以及标量门控因子 \(g_i(\mathbf{w})\),特征更新公式遵循 AdaLN-Zero: $$ F_i \leftarrow F_i + g_i(\mathbf{w}) \Big( \mathrm{LN}(F_i) \odot (1 + \boldsymbol{\gamma}_i(\mathbf{w})) + \boldsymbol{\beta}_i(\mathbf{w}) \Big) $$ 其中 \(\mathrm{LN}(\cdot)\) 表示不含可学习仿射参数的通道层归一化。核心机制在于门控 \(g_i(\mathbf{w})\) 采用零初始化(Zero-Initialization),保证在训练初始时刻模型的输出与原始未调制的 Depth Anything 完全一致;在后续训练中,模型自适应学习对夜间弱光暗区补偿、对雨雾散射高亮伪影抑制的增量偏移,既获得了针对特定天气的自适应校准能力,又杜绝了对常规清晰场景的破坏。

3. 联合蒸馏与一致性监督:无真值约束下的跨域几何锚定 真实恶劣天气数据通常缺乏精确稠密的激光雷达真值,直接伪标签训练极易引入几何偏置。为此,本文设计了三位一体的训练目标,涵盖清晰图像集 \(\mathcal{D}\)、合成配对集 \(\mathcal{D}_s\) 及真实恶劣天气图像集 \(\mathcal{D}_r\)。所有几何偏差均基于归一化仿射不变损失 \(\ell(y, \hat{y})\) 计算(消除尺度与平移歧义)。总体优化目标为: $$ \mathcal{L} = \mathcal{L}{\text{dist}} + \mathcal{L} $$ 其中 }} + \mathcal{L}_{\text{aug}\(\mathcal{L}_{\text{dist}}\) 使用性能强大的冻结大教师模型(ViT-L)作为锚点,对清晰样本及真实退化样本进行知识蒸馏,对于合成退化样本 \(x^s=\tau(x)\),则强制将学生预测对齐到对应干净原图 \(x\) 的教师输出上;\(\mathcal{L}_{\text{pair}}\) 约束学生模型在干净图像 \(x\) 与其对应几何同构的合成恶劣图像 \(x^s\) 之间的预测输出必须保持一致;\(\mathcal{L}_{\text{aug}}\) 则对无干净配对的真实天气图像施加几何保形的色彩抖动(ColorJitter)等扰动,强制满足自一致性正则。三者协同彻底消除了跨域几何漂移。

实验关键数据

主实验

在真实恶劣天气基准(NuScenes-night、RobotCar-night、DrivingStereo 降雨/多云/大雾子集)与合成退化基准(KITTI-C 暗光、降雪、浓雾、运动模糊)上全面评估零样本相对深度估计性能(主干统一采用 ViT-S)。

数据集 / 场景 指标 DepthAnything v2 DepthAnything-AC DA-W (本文) 较 DA v2 提升
NuScenes-night (真实夜间) AbsRel ↓ / \(\delta_1\) ↑ 0.200 / 0.725 0.198 / 0.727 0.194 / 0.737 -0.006 / +0.012
DS-rain (真实降雨) AbsRel ↓ / \(\delta_1\) ↑ 0.125 / 0.840 0.125 / 0.840 0.123 / 0.842 -0.002 / +0.002
DS-fog (真实大雾) AbsRel ↓ / \(\delta_1\) ↑ 0.103 / 0.890 0.103 / 0.889 0.101 / 0.896 -0.002 / +0.006
KITTI-C Dark (合成夜间) AbsRel ↓ / \(\delta_1\) ↑ 0.130 / 0.832 0.130 / 0.834 0.126 / 0.837 -0.004 / +0.005
KITTI-C Snow (合成降雪) AbsRel ↓ / \(\delta_1\) ↑ 0.115 / 0.872 0.114 / 0.873 0.107 / 0.884 -0.008 / +0.012
KITTI-C Fog (合成浓雾) AbsRel ↓ / \(\delta_1\) ↑ 0.097 / 0.905 0.096 / 0.906 0.093 / 0.910 -0.004 / +0.005
KITTI-C Motion (合成运动) AbsRel ↓ / \(\delta_1\) ↑ 0.127 / 0.840 0.126 / 0.841 0.125 / 0.841 -0.002 / +0.001
KITTI Clean (清晰基准) AbsRel ↓ / \(\delta_1\) ↑ 0.083 / 0.934 0.083 / 0.934 0.080 / 0.937 -0.003 / +0.003

在复合恶劣天气(Mix-weather,如雾+夜、雨+夜、雪+夜等 11 种复合环境)基准测试中,DA-W 同样保持显著领先。例如在极具挑战的「雾+雨+雪+夜」四合一恶劣场景下,DA-W 取得 \(\delta_1=0.630\)、\(\text{AbsRel}=0.236\),大幅领先 DepthAnything v2(\(0.562 / 0.268\))与 DepthAnything-AC(\(0.608 / 0.245\))。

消融实验

下表展示了模型微调策略、真实恶劣天气数据注入以及 AdaLN-Zero 天气嵌入调制对多域零样本相对深度的影响(综合平均排位越低越优):

编码器微调 解码器微调 引入真实恶劣数据 天气嵌入注入 NS-night (AbsRel/\(\delta_1\)) RC-night (AbsRel/\(\delta_1\)) KITTI-Snow (AbsRel/\(\delta_1\)) KITTI Clean (AbsRel/\(\delta_1\)) 平均排位 (Avg. rank ↓)
全微调 (FT) 全微调 (FT) 否 否 0.194 / 0.727 0.245 / 0.493 0.109 / 0.888 0.084 / 0.932 2.89
冻结 仅解码器微调 否 否 0.190 / 0.741 0.248 / 0.495 0.113 / 0.877 0.081 / 0.936 2.68
冻结 仅解码器微调 是 否 0.195 / 0.731 0.243 / 0.507 0.112 / 0.878 0.081 / 0.936 2.29
冻结 仅解码器微调 是 是 (完整 DA-W) 0.194 / 0.737 0.239 / 0.513 0.107 / 0.884 0.080 / 0.937 2.14

在监督损失函数的针对性消融中,若移除教师模型几何蒸馏损失 \(\mathcal{L}_{\text{dist}}\),全局综合 AbsRel 剧烈恶化,从 0.117 飙升至 0.352,证实伪标签蒸馏是稳固几何尺度的基石;成对对齐损失 \(\mathcal{L}_{\text{pair}}\) 将全局误差由 0.120 压低至 0.117;而对比单纯增加图像恢复头的基线(全局 AbsRel 0.118),本文天气调制策略展现出更优的几何适应性。

关键发现

  • 冻结编码器能有效兼顾鲁棒性与通用性:仅微调解码器并注入天气调制,模型平均排位由全量微调的 2.89 提升至 2.14;不仅防止了清晰场景的特征漂移,在真实暗光夜间上更具抗噪泛化力。
  • 降雪与暗光受益最深:KITTI-C 降雪场景下 AbsRel 相对降幅达到 7.0%(0.115 \(\to\) 0.107),这证明基于风格滤波器捕获的低阶高频散射模式能够精准指引解码器纠正被雨雪遮挡的深度断层。
  • 空间自适应聚焦特性:特征调制差分图(\(|\Delta\text{Feat.}|\))可视化显示,即使没有显式的空间注意力或掩码监督,AdaLN-Zero 在暗光场景下也能自发地将调节强度集中在无光照的极暗区域,在雾天场景下集中在远景散射强、细节丢失严重的区域,呈现出精准的自适应响应。

亮点与洞察

  • 解耦式条件设计优于两阶段图像恢复:传统的「图像去噪/去雾 + 深度估计」易因去噪模型引入的人造伪影破坏原本正确的透视几何;DA-W 仅抽取 64 维天气先验并在特征层调制,无需高成本图像重建即可实现几何纠偏。
  • 跨域正样本对齐构建统一天气空间:将具有相同天气属性但分属真实世界与合成引擎的样本拉入同一簇,成功破除了预训练 ViT 编码器中内容与退化深层纠缠的顽疾。
  • 零初始化门控防遗忘机制:通过在解码阶段对调制参数采用零初始化,既维持了原始大模型在清晰域(KITTI / NYUv2 / ETH3D)的绝对 SOTA 水平,又实现了对多种恶劣天气组合的即插即用迁移。

局限与展望

  • 超极端暗光域的传感器偏差挑战:在 Oxford RobotCar-night 等含有极端曝光动态范围、运动模糊以及传感器独特色彩响应曲线的数据集上,模型性能仍落后于全量微调的专用模型,说明单一的全局天气嵌入尚不足以完全建模复杂的相机畸变与严重运动模糊。
  • 模型尺度扩展待验证:当前适配验证主要基于 Depth Anything v2 Small(ViT-S)版本展开,将此机制扩展至 Base、Large 以及混合几何多任务大模型上的计算开销与最佳层级配置仍需深入探究。
  • 空间局部多天气混合建模:在局部积水倒影、局部暴雪以及强眩光车灯等空间异质性极强的复杂物理环境下,全局 64 维嵌入可能存在局部表征粒度不足的问题,未来可探索空间变异型天气调制机制。

相关工作与启发

  • vs Depth Anything v2 / v3: 原始基础模型依赖大规模数据隐式学习鲁棒性,但特征空间内天气风格与场景内容纠缠不清,遇极端退化时深度断裂明显;DA-W 显式分离天气嵌入并调制,不仅在 8 项恶劣天气基准上全面反超,还保持了常规场景性能的零回退。
  • vs Depth Anything-AC / WeatherDepth: 现有天气适应方法多依赖针对特定退化的渐进课程学习或全模型微调,存在破坏原本泛化能力的风险;DA-W 采用冻结编码器 + 零初始化 AdaLN 调制,参数开销低且能够平滑泛化到任意未见过的混合天气。
  • vs MWFormer / UniRestore: 两阶段方案先恢复清晰 RGB 图像再测深度,极易破坏细小边缘与远景透视关系;DA-W 直接在特征表征层面进行任务驱动的天气适应,避免了中间图像重建误差的级联累积。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 构思精巧,将风格滤波器解耦与 AdaLN-Zero 条件调制引入单目深度基础模型,成功解决合成向真实恶劣天气迁移的难题。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 5 个真实天气基准、4 个合成退化基准、11 个复合混合天气基准以及 5 个标准清晰场景基准,消融与特征可视化非常扎实。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,图文对照自洽,特征混杂分析与自适应调制机理解释深刻透彻。
  • 价值: ⭐⭐⭐⭐⭐ 为单目深度估计大模型在全天候自动驾驶与具身系统中的工程落地提供了高能效、无灾难遗忘的优雅范式。