跳转至

Towards Robust Driving Perception: A Flexible Scale-Driven Family for Self-Supervised Monocular Depth Estimation

会议: ECCV 2026
论文: ECCV 2026 Poster
代码: https://github.com/startnew/flexdepth
领域: 自动驾驶
关键词: 单目深度估计, 动态场景解耦, 尺度驱动解码器, 边缘端部署, 自监督学习

一句话总结

针对自动驾驶中运动物体破坏光度重投影一致性以及轻量模型边缘模糊的难题,FlexDepth 构建了覆盖 Nano 到 X-Large 的全尺度自监督单目深度估计模型家族,首创无前置卷积的尺度驱动解码器与基于跨 epoch 预测时序不一致性的两阶段动静解耦训练策略,在完全不依赖语义或光流等先验下实现 SOTA 精度与极致端侧推理速度。

研究背景与动机

自监督单目深度估计通过单目连续帧之间的光度重投影误差建立几何监督,摆脱了真实世界密集深度真值采集成本高昂的制约,已成为自动驾驶与机器人环境感知的核心基石。然而,当前主流自监督方案普遍面临落地困境:以 Vision Transformer 或扩散先验为主的大模型计算开销与推理时延巨大,难以适配算力受限的车载边缘芯片;而现存的轻量级网络为了压低 FLOPs,往往采用固定的单一尺度设计与简化的上采样算子,在物体边缘和细长结构上产生严重的几何失真。更致命的是,自动驾驶道路场景充满移动车辆与行人,这些动态交通参与者直接违反了多视图几何中的静态场景假设,导致重投影光度损失产生错误的梯度反传。

现有应对动态场景的策略主要存在两类死穴:一类依赖额外的语义分割掩码、光流场估计或跨数据集伪标签微调,这不仅使推理流程严重膨胀、破坏了端到端纯自监督的优雅性,还在面对阴影、运动模糊及跨域场景时极为脆弱;另一类基于静态阈值抑制动态区域误差的方案,无法适应不同道路场景中动态目标占比剧烈波动的现实,泛化能力受限。同时,传统轻量级编码器-解码器架构习惯在跨层拼接前施加预置卷积压缩特征通道,过早丢失了珍贵的深层全局语义线索。

针对上述瓶颈,本文主张在统一框架内兼顾轻量化架构扩展性与动态场景本质鲁棒性,无需引入任何外部辅助网络或先验标签。核心 idea:剔除阻碍深层语义传递的前置卷积,构建自适应组装算子的尺度驱动解码器(SDD),并利用动静态区域跨训练阶段的预测收敛方差差异设计自适应解耦掩码,实现动静解耦的两阶段自监督重训练。

方法详解

整体框架

FlexDepth 包含 Nano、Small、Medium、Large、X-Large 共 5 种不同参数尺度的模型,满足从低算力移动端到高性能边缘 GPU 的弹性部署需求。网络以轻量级且特征表征能力强的 YOLOv11 骨干为深度编码器,逐级下采样抽取 5 种尺度的多层特征图(分辨率从原图的 \(1/2\) 至 \(1/32\))。整体训练流程解耦为两阶段:第一阶段联合训练姿态估计网络 PoseNet(ResNet-18 配合四层解码器输出 6-DoF 相对位姿 \(P_{t \to s}\))与深度预测网络,在常规光度一致性损失下建立基础几何表征;第二阶段冻结 PoseNet,利用模型在第一阶段初末期权重对图像生成的视差图方差差异,构建像素级自适应动静解耦掩码 \(M\),重训练深度网络并结合不确定性正态分布损失与几何平滑约束,精确消除运动目标造成的负面梯度干扰。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["连续单目驾驶图像<br/>I_t, I_s"] --> B["阶段1:几何联合预训练<br/>PoseNet 与 YOLOv11 深度编码器协同优化"]
    B --> C["跨阶段预测不稳定性感知<br/>对比初始轮次 disp_i 与末尾轮次 disp_l 视差差异"]
    C --> D["自适应动静解耦掩码构建<br/>动态阈值过滤运动物体并隔离静态背景"]
    D --> E["阶段2:深度网络鲁棒重训练<br/>冻结 PoseNet + 掩码正态分布损失 L_m"]
    E --> F["尺度驱动解码器 SDD<br/>自适应装配 HEB/HPB 与动态重采样"]
    F --> G["高保真度度量深度图输出<br/>边缘锐利且动态物体几何完整"]

关键设计

1. 尺度驱动解码器(Scale-Driven Decoder, SDD):重构轻量上采样与特征融合管线

传统轻量级 U-Net 范式严格遵循“预卷积降维 \(\to\) 双线性插值上采样 \(\to\) 拼接 \(\to\) 后卷积融合”流程,过早在空间还原前用卷积核压缩高维深层特征,不可逆地破坏了全局上下文与微弱深度线索,导致深度边界严重虚化。SDD 彻底剔除跨层融合前的预卷积环节,直接对深层特征进行上采样后再做跳跃拼接,使生成过程表示为: $\(D_i = \mathcal{P}\{\mathcal{C}(\text{Concat}[\mathcal{U}(F_{i+1}), F_{\text{enc},i}])\}\)$ 其中针对不同模型体量自适应切换算子组合: - 后置卷积单元 \(\mathcal{C}\):在轻量版 Flex-Nano/Small 中采用高效瓶颈块(HEB),通过通道切分算子 \(S\) 将特征切分为 \(f_a\) 与 \(f_b\),将密集跨层连接的多级瓶颈输出与初始切片拼接并卷积,构建极其通畅的梯度回传捷径;在 Medium/Large/X-Large 中则无缝替换为高性能瓶颈块(HPB),以跨阶段局部(CSP)结构构筑瓶颈簇,极大增强局部微小结构的感知力而几乎不增加额外开销。 - 动态重采样算子 \(\mathcal{U}\):摒弃传统双线性插值固有的低通平滑滤波效应(该效应在物边缘容易造成光晕伪影与边界抹平)。SDD 引入可变形采样机制,先利用卷积动态预测空间位置偏移场 \(\Delta P\),通过 Pixel Shuffle 调整至坐标维度,最后结合标准采样网格 \(C\) 执行双线性网格采样: $\(\mathcal{U}(X) = \text{GS}\left(X, \text{PS}\left(\frac{2}{\text{Norm}} \cdot (C + \Delta P) - 1, s\right)\right)\)$ 根据图像物体的语义轮廓轮廓实现非均匀自适应网格插值,大幅恢复锐利物方边缘。 - 逆序预测头 \(\mathcal{P}\):对于大尺度模型,颠倒传统“先预测深度再上采样”的时序,先在高通道丰富特征域完成动态上采样,再由轻量预测头回归深度,保证了深层几何语义连续性;小型模型则保持传统预测时序以确保端侧推理超低延迟。

2. 跨阶段时序不稳定性感知与自适应动静解耦掩码(Static-Dynamic Decoupled Mask)

在自监督光度重投影约束下,处于真实运动中的车辆和行人由于位置变化打破了几何投影恒等式,导致其反向传播的预测梯度持续振荡,在训练全生命周期中呈现出极高的时序波动;而静止背景(道路、建筑物、路标)则表现出高度平稳的单调收敛特性。基于此物理与学习动态特性,FlexDepth 提取第一阶段初始轮次权重推断的视差图 \(\text{disp}_i\) 与最终轮次收敛的视差图 \(\text{disp}_l\),计算时序绝对残差。为解决传统固定阈值在异质复杂场景中频繁漏检与误判的缺陷,SDD 引入基于特征演化相似度的像素级自适应阈值函数: $\(M = \left[ |\text{disp}_i^{\beta} - \text{disp}_l^{\beta}| < g(\phi(f_{si}, f_{sl})) \right]\)$ 其中超参数 \(\beta = 0.7\) 用于平衡近远景动态敏感度,\([\cdot]\) 为 Iverson 括号。\(\phi\) 衡量浅层/深层表征在两阶段间的特征结构演化,函数 \(g\) 动态映射出像素自适应阈值图。在纹理繁杂、剧烈运动的区域,阈值自动下调收紧,精准滤除动目标;而在平稳区域放宽容限,保留所有静态背景的高保真几何线索,全程无需任何语义或光流先验辅助。

3. 动静解耦的鲁棒重训练目标与不确定性几何平滑

在获得像素级静态掩码 \(M\) 后,第二阶段冻结已收敛的 PoseNet 权重,彻底斩断不可靠动目标对相机自车位姿预测的负面牵引,专门对深度预测网络执行定向重训练。为解决传统光度损失在未被掩盖的边缘过渡区或残余阴影中的发散问题,模型联合学习一个预测不确定性方差网络 \(\sigma\),引入掩码正态分布损失 \(L_m\) 与各向异性几何深度平滑约束 \(L_{\text{GDS}}\): $\(L_m = M \cdot \left[ \log(\sigma + 1) + \frac{\lambda L_r^2}{2\sigma^2} \right]\)$ $\(L_{\text{GDS}} = |\partial_x \hat{d}_t| e^{-|\partial_x I_t|} + [\eta(1 - M) + M] |\partial_y \hat{d}_t| e^{-|\partial_y I_t|}\)$ 其中基础光度误差 \(L_r\) 采用结构相似度(SSIM,权重 \(\alpha=0.85\))与 \(L_1\) 范数结合的每像素最小重投影损失,\(\lambda = 0.5\);而在几何平滑项 \(L_{\text{GDS}}\) 中,针对掩码标记的动态区域(\(1-M\))大幅强化平滑惩罚(权重倍率 \(\eta=100\)),强制利用周围静态地表与背景的几何连续性对运动物体实施合理的空间流形插值,根除了运动空洞与悬空漂浮伪影。

实验关键数据

主实验

在自动驾驶标杆数据集 KITTI(Eigen split,分辨率 \(640 \times 192\))与高度动态城市道路数据集 Cityscapes(分辨率 \(416 \times 128\))上,FlexDepth 家族与主流自监督单目深度估计方法进行全面对比。所有模型均仅采用单目连续视频序列(M)无监督训练。

数据集 方法 类别/规模 FLOPs (G) ↓ Abs Rel ↓ Sq Rel ↓ RMSE ↓ \(\delta < 1.25\) ↑
KITTI Monodepth2 Baseline 8.0 0.115 0.903 4.863 0.877
KITTI Lite-Mono-Tiny Lightweight 2.8 0.110 0.837 4.710 0.880
KITTI PuriLight Lightweight 7.1 0.106 0.747 4.536 0.890
KITTI Flex-Nano (Ours) Lightweight 0.7 0.110 0.794 4.678 0.878
KITTI Flex-Small (Ours) Lightweight 2.8 0.104 0.713 4.458 0.890
KITTI TinyDepth Medium 13.3 0.096 0.665 4.249 0.904
KITTI Flex-Medium (Ours) Medium 10.0 0.096 0.639 4.253 0.903
KITTI Flex-Large (Ours) Large 11.5 0.095 0.642 4.199 0.906
KITTI MonoViT Heavyweight 59.7 0.099 0.708 4.372 0.900
KITTI DSI-MonoViT Dynamic SOTA 59.7 0.096 0.711 4.321 0.905
KITTI Flex-X-Large (Ours) Large 24.6 0.093 0.605 4.114 0.910
Cityscapes ManyDepth Multi-frame 12.1 0.114 1.193 6.223 0.875
Cityscapes DynamicDepth M + Semantic 18.5+ 0.103 1.000 5.867 0.895
Cityscapes PuriLight Single-frame 5.7 0.099 1.014 5.892 0.901
Cityscapes Flex-Nano (Ours) Single-frame 0.6 0.107 1.261 6.133 0.893
Cityscapes Flex-Small (Ours) Single-frame 2.2 0.100 1.078 5.813 0.904
Cityscapes ProDepth Multi-frame 35.5 0.095 0.876 5.531 0.908
Cityscapes DSI-MonoViT Single-frame 47.7 0.088 0.872 5.410 0.918
Cityscapes Flex-X-Large (Ours) Single-frame 19.6 0.086 0.877 5.268 0.926

消融实验

基于 Flex-X-Large 变体在 KITTI 数据集上对后卷积模块(HPB vs. HEB)、上采样策略(动态重采样 vs. 双线性插值)、预测头时序(逆序 vs. 传统)以及第二阶段动态环境解耦策略进行严格消融验证:

ID 后卷积 \(\mathcal{C}\) 上采样 \(\mathcal{U}\) 预测头 \(\mathcal{P}\) 动态策略 FLOPs (G) Params (M) Abs Rel ↓ Sq Rel ↓ RMSE ↓ \(\delta < 1.25\) ↑ 说明
1 HEB (◦) 动态 (✓) 逆序 (✓) 动态掩码 \(M\) (✓) 24.0 32.0 0.093 0.614 4.188 0.907 采用小模型 HEB 略微减小算力,精度微跌
2 HPB (✓) 双线性 (◦) 逆序 (✓) 动态掩码 \(M\) (✓) 24.3 32.3 0.094 0.627 4.204 0.906 双线性上采样平滑抑制高频,精度退化
3 HPB (✓) 动态 (✓) 传统 (◦) 动态掩码 \(M\) (✓) 24.3 32.3 0.094 0.631 4.205 0.906 传统预测头顺序破坏深层几何通道表达
4 HPB (✓) 动态 (✓) 逆序 (✓) 无第二阶段 (×) 24.6 32.3 0.100 0.729 4.431 0.900 移除动静解耦重训练,误差显著攀升
5 HPB (✓) 动态 (✓) 逆序 (✓) 固定阈值 (◦) 24.6 32.3 0.093 0.629 4.195 0.909 固定阈值掩码无法适配动态异质环境
6 HPB (✓) 动态 (✓) 逆序 (✓) 动态掩码 \(M\) (✓) 24.6 32.3 0.093 0.605 4.114 0.910 完整模型配置,达成最优性能

关键发现

  • 两阶段解耦训练对性能起决定性作用:对比消融 ID 4 与 ID 6,去掉第二阶段动态解耦训练,Abs Rel 剧烈恶化 7.5%(0.093 骤降至 0.100),RMSE 从 4.114 劣化至 4.431,证实未解耦的动态目标反向传播梯度对几何特征空间具有强破坏性。此外,自适应阈值动态掩码优于固定阈值(Sq Rel 0.605 vs 0.629),表明跨场景时自适应容限的必要性。
  • 解耦场景分项评测验证动态突破:在 Cityscapes 动态与静态分离评估中,Flex-X-Large 在动态区域取得 Abs Rel 0.091 与 \(\delta < 1.25\) 0.935,大幅超越依赖像素运动与伪深度双先验的 Mining-BrNet(Abs Rel 0.119、\(\delta\) 0.872)以及多帧融合的 ProDepth(Abs Rel 0.115、\(\delta\) 0.884),计算量却仅为其 \(55\%\) 至 \(72\%\)。
  • 端侧部署吞吐实现断层式领先:在 Snapdragon 8 Elite 移动端芯片上实测,仅需 0.718 GFLOPs 的 Flex-Nano 实现了 37.6 FPS 的高帧率实时推理;而参数量和算力相似的 Lite-Mono-Tiny(2.842 GFLOPs)仅有 15.9 FPS。在桌面级 RTX 4090 上,Flex-Nano 推理吞吐高达 1583 FPS,展现出对工业自动驾驶感知的卓越工程价值。
  • 超越大基座模型的小样本适配性:在与拥有 3.35 亿参数的视觉大模型 Depth Anything V2 (ViT-L) 对齐评测时,Flex-X-Large 凭借仅 32M 参数与 25 GFLOPs,在 KITTI 域内取得 Abs Rel 0.063(优于 DA2-Large 的 0.070),证明了在强领域特异性任务中轻量级自监督专用架构的独特性价比优势。

亮点与洞察

  • 跨训练周期不一致性构建自监督动静分离:利用移动物体在光度重投影优化过程中的收敛震荡与不收敛特性反哺动态区域生成,无需任何光流或检测分割模型,以极简的数学形式实现了零开销的无监督动态目标发现。
  • 尺度驱动的模块化按需装配思想:打破“单一模块等比例缩放”的惯性思维,通过在不同算力规模(Nano 到 X-Large)上差异化配置 HEB/HPB 模块、正逆序预测头及动态插值,实现了全产品线吞吐与精度的 Pareto 最优前沿。
  • 轻量解码器去前置卷积范式:指出了以往轻量 U-Net 类模型盲目在跳跃拼接前施加 \(1 \times 1\) 预卷积破坏全局深层语义的弊端,直接移除非核心压缩操作,为通用视觉密集预测任务的网络轻量化设计提供了重要启发。

局限与展望

  • 复杂室内及极端几何泛化受限:作者在文中坦陈,FlexDepth 针对自动驾驶道路场景的水平视场和远景纵深深度先验进行了优化,在面对室内具有丰富人造纹理、近距离重度遮挡或非结构化凸起物时,几何平滑先验容易出现过度平滑失真。
  • 极暗与光照骤变下的光度一致性失效:作为纯自监督单目框架,方法依然强依赖灰度/色彩一致性,在夜间对向眩光、暴雨隧道进出口等严重光照突变场景下,第一阶段初始权重质量可能受损,从而影响第二阶段掩码生成的精准度。
  • 未来方向:可进一步将隐式时空神经辐射场(NeRF)或 3D Gaussian Splatting 的瞬态场表示引入轻量化两阶段训练中,以无监督姿态精修强化复杂动态道路拓扑的几何重建。

相关工作与启发

  • vs Monodepth2 & Lite-Mono: Monodepth2 依赖简单的静止相机自动掩码(Auto-masking),只能过滤与自车同速行驶的目标,对侧向穿行或对向驶来物体完全失效;Lite-Mono 虽引入轻量注意力,但忽略了解码器上采样过程的信息损耗。本文通过动态重采样与跨 epoch 动静自适应掩码,一举兼顾了边缘锐利度与非刚性动态物体的鲁棒性。
  • vs DSI-MonoViT: DSI 首次揭示了深度自抑制现象,但采用静态经验阈值进行分割,且依赖近 60 GFLOPs 的大参数 ViT 主干。FlexDepth 将其升级为基于特征差异的自适应阈值函数,并嵌入紧凑的 CNN/CSP 尺度驱动框架,在将计算量压缩至三分之一的同时在 Cityscapes 动态区获得更高精度。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 跨 epoch 预测收敛震荡感知动静目标的机制非常巧妙,摆脱了语义与光流依赖;尺度驱动解码器设计针对性强。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 KITTI、Cityscapes 动态分项、Make3D 跨域零样本、手机移动端与 GPU 部署延迟实测,消融实验严谨详实。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑主线清晰,图表完备,对传统轻量解码器瓶颈的剖析见解深刻。
  • 价值: ⭐⭐⭐⭐⭐ 兼顾了 0.7 GFLOPs 极速端侧部署与 0.093 Abs Rel 的 SOTA 精度,对量产自动驾驶单目感知系统具有极高的实用参考价值。