跳转至

OmniDS: Dual-Stream Context Fusion for Omnidirectional Depth from Fisheye Cameras

会议: ECCV 2026
论文: ECCV 2026 官方页面
领域: 3D视觉
关键词: 全向深度估计、多鱼眼相机立体匹配、动态上下文融合、多视角共识体、知识蒸馏

一句话总结

针对多鱼眼相机宽基线全向深度估计中的遮挡冲突与刚性投影模糊,OmniDS 提出结合轻量 CNN 与冻结 DINOv3 的动态 ERP 上下文融合,以及融合分组相关与跨视角方差的全局共识体,并通过轻量学生网络蒸馏实现端侧约 10 FPS 实时高精度建图。

研究背景与动机

多鱼眼环视相机系统通过紧凑小巧的硬件形态提供了 360° 无盲区的全向视觉感知,是室内服务机器人、工业仓储巡检无人机、自动驾驶以及 AR/VR 空间计算中避障规划与全局 SLAM 的核心传感器配置。为了将多路严重畸变且基线重叠不均的鱼眼图像统一处理,传统方案通常将特征沿球坐标系投影到全景展开图(Equirectangular Projection, ERP)或同心球面上构建代价体,再借助 3D 卷积正则化或类似 RAFT 的循环更新网络(如 OmniMVS、RomniStereo)进行视差/逆深度推断。

然而,宽基线多鱼眼系统不可避免地伴随着强烈的视差与自遮挡效应。当多个相机从不同视角观察近处物体时,往往只能看到该物体的不同侧面,甚至存在严重的视线遮挡。这种物理可见性差异使得现有的刚性坐标映射机制产生本质矛盾:即便在投影几何完全精准的前提下,简单的鱼眼到 ERP 网格采样依然会引发“遮挡泄漏”(被遮挡相机将背景像素强行投射入目标前景格)与“自遮挡表面混叠”(不同法线、不同光照特征的不同表面被强行聚合到同一 ERP 单元)。现有方法如 RomniStereo 采用基于视角权重的下采样或中心视角启发式策略,仅仅是在数值上衰减不可靠相机的贡献,未从根本上解耦特征歧义;同时,仅依赖纯 CNN 构建的上下文在弱纹理大白墙与复杂反射区域缺乏长程结构感知。

针对这一瓶颈,本文摒弃了在投影空间内进行硬性特征聚合的传统范式,主张将自适应的动态上下文重构与跨相机全局共识机制相结合。核心 idea:构建轻量 CNN(几何高频)与冻结 DINOv3(语义先验)解耦的双流特征架构,在循环迭代中基于当前深度动态执行畸变感知的 ERP 上下文交叉注意力融合,并结合分组相关与跨视角特征方差构建 3D 正则化共识体,最后通过特征蒸馏实现端侧高效推理。

方法详解

整体框架

给定安装在刚性底盘上的 4 路 220° 鱼眼相机输入 \(\{I_k\}_{k=1}^4\)(分别朝向前、右、后、左)及已知内外参标定,OmniDS 的目标是估计全景球面坐标系下分辨率为 \(H \times W\) 的高质量逆深度图 \(\hat{d} \in \mathbb{R}^{H \times W}\)

整个框架采用“双流提取 → 动静双轨表征 → ConvGRU 循环精炼”的流水线。首先,每张鱼眼图像分别送入轻量级 18 层残差 CNN 提取保留高频边缘的几何匹配特征 \(F_k^{\mathrm{cnn}}\),以及冻结的 DINOv3 ViT 主干提取富含长程语义先验的特征 \(F_k^{\mathrm{dino}}\)。接着,在每个迭代精炼步 \(t\),系统根据当前逆深度估计 \(\hat{d}^{(t)}\),利用学习到的视角权重与带几何畸变偏置的变形交叉注意力,将两类特征自适应反投影并残差融合为动态上下文表示 \(F^{\mathrm{context}}\)。与动态路径并行,静态分支沿预设离散反深度级别构建相关剖面(Correlation Profile)和多视角共识体(Multi-View Consensus Volume, MVC),并在 4 级特征金字塔中由 ConvGRU 根据当前逆深度检索对应几何代价,逐步预测逆深度残差 \(\Delta d^{(t)}\)。为了消除 ViT 主干高昂的在线计算负担,模型通过知识蒸馏将双流特征压缩至单一轻量 MobileNetV2 网络,用于部署阶段的实时推理。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["四路鱼眼图像输入<br/>前/后/左/右环视视角"] --> B["双流特征提取与畸变感知注意力<br/>CNN局部几何 + 冻结DINOv3语义先验"]
    B --> C["多视角共识体与 3D 几何正则化<br/>分组相关与四视角特征方差 + 3D U-Net"]
    B --> D["迭代式动态 ERP 上下文融合<br/>依当前深度重投影 + 动态视角加权与形变交叉注意力"]
    C --> E["ConvGRU 循环迭代更新<br/>聚合运动特征与残差反向深度更新"]
    D --> E
    E --> F["凸上采样输出高分辨率逆深度图<br/>192 个深度假设级别"]
    B -.->|知识蒸馏| G["双流表征轻量化蒸馏<br/>统一 MobileNetV2 学生网络端侧部署"]

关键设计

1. 双流特征提取与畸变感知注意力:互补几何高频与语义先验 传统全向深度网络纯粹依赖 CNN 提取特征,容易在无纹理墙面、过曝区域或低光照条件下产生大范围匹配断裂;若直接引入视觉 Transformer,其自注意力固有的大面积平滑性又会破坏深度估计所需的锐利边缘。为此,OmniDS 采用双流解耦策略:共享的 18 层残差 CNN 专职捕获高频边缘与几何纹理,用于静态代价体构建与局部结构精细化;同时引入冻结的 DINOv3 ViT 主干及其后接的可学习投影头,提取具备强鲁棒语义不变性与目标级上下文的全局表征。针对鱼眼镜头从中心到边缘非线性剧烈拉伸的光学特性,在利用 DINO 特征更新 ERP 空间查询点 \(q_i\) 时,设计了带几何畸变偏置的变形交叉注意力(Deformable Cross-Attention):每个 ERP 像素采样参考点 \(p_{i,k}\) 周围 \(P\) 个学习偏移量 \(\Delta p_{i,k,j}\),并在注意力对数几率中显式注入基于径向距离 \(r_{i,k}\) 的几何偏置项 \(b(r_{i,k}) = \mathrm{MLP}(\min(\|2 p_{i,k} - c_k\|, \dots))\)。这一偏置强制网络优先信赖低畸变、高有效像素密度的鱼眼中心视场,显著抑制了鱼眼边缘严重形变区域对全局语义上下文的污染。

2. 迭代式动态 ERP 上下文融合:摆脱刚性投影与解决遮挡泄漏 传统方案通常在初始阶段将多相机特征一次性刚性网格采样至 ERP 空间并沿通道求平均,这种不可变上下文在遇到遮挡边界与纤细物体时,由于遮挡相机的背景像素强行混入(遮挡泄漏),导致循环更新模块在迭代过程中不断接收到错误的几何线索。OmniDS 改为在每一次迭代步 \(t\) 进行基于当前逆深度假设 \(\hat{d}^{(t)}\) 的动态重采样。针对 CNN 几何特征,将 4 个相机采样到的特征 \(F_{i,k}^{\mathrm{cnn}}\) 沿通道拼接,送入轻量网络预测视角归一化权重 \(w_{i,k} = \mathrm{Softmax}_k(\mathrm{Cam}_{\mathrm{weight}}([F_{i,1}^{\mathrm{cnn}}; \dots; F_{i,4}^{\mathrm{cnn}}]))\),实现动态多视角加权汇聚 \(F_i^{\mathrm{cnn\text{-}erp}} = \sum_{k=1}^4 w_{i,k} F_{i,k}^{\mathrm{cnn}}\);随后将该特征与经由畸变感知变形注意力投影的 DINO 上下文 \(F^{\mathrm{dino\text{-}erp}}\) 输入残差逐点卷积融合层: $\(F^{\mathrm{context}} = F^{\mathrm{dino\text{-}erp}} + \mathrm{Fuse}([F^{\mathrm{dino\text{-}erp}}; F^{\mathrm{cnn\text{-}erp}}])\)$ 这种动态重构机制使得网络在每一次更新步都能自适应屏蔽被遮挡相机的污染像素,将注意力集中在真正共视且清晰的有效可见面上。

3. 多视角共识体与 3D 几何正则化:全视角一致性与方差约束 除了局部配对相关剖面,宽基线多相机全向系统亟需衡量所有视角之间的多边一致性。OmniDS 构造了双重信号复合的“多视角共识体”(Multi-View Consensus Volume, MVC):第一部分将 CNN 特征通道划分为 8 个子组,在离散深度切片上计算多视角的组内相关性(Group-wise Correlation),保留比单通道标量点积丰富得多的多峰匹配分布;第二部分在每个 ERP-深度候选网格上,直接计算来自 4 个相机重投影特征的跨相机特征方差(Feature Variance)。在正确的物体深度假设处,4 个相机(若共视)的特征高度吻合,方差呈现显著的极小值谷底;而在遮挡面或假性深度假设处,方差急剧升高。拼接后的原始共识体输入轻量 3D U-Net 进行跨空间 \((H, W)\) 与深度维度 \((D)\) 的联合几何滤波,有效滤除高频伪影并越过局部次优解。最后,将正则化后的共识体与 2D 平滑相关剖面下采样组织为 4 层特征金字塔,供 ConvGRU 运动编码器以局部查找半径高效索引。

4. 双流表征轻量化蒸馏:兼顾高精度与端侧实时推理 尽管 CNN + DINOv3 双流架构在离线预训练中提供了优异的语义与几何表示,但在机器人端侧 GPU 上并行运行大型 ViT 模型的显存与延迟难以承受。OmniDS 提出了基于特征模仿的蒸馏策略,设计以 U-Net 构架的轻量 MobileNetV2 作为单一体干学生网络,其输出分为两个 \(1 \times 1\) 卷积头:分别输出 \(\times 2\) 下采样的几何特征 \(F_{\mathrm{cnn}}^s\)\(\times 16\) 下采样的语义特征 \(F_{\mathrm{dino}}^s\)(均约束为 32 通道以对齐后续维度)。蒸馏损失函数采用非对称加权均方误差: $\(\mathcal{L}_{\mathrm{distill}} = \lambda_{\mathrm{cnn}} \mathrm{MSE}(\mathbf{F}_{\mathrm{cnn}}^s, \mathbf{F}_{\mathrm{cnn}}^t) + \lambda_{\mathrm{dino}} \mathrm{MSE}(\mathbf{F}_{\mathrm{dino}}^s, \mathbf{F}_{\mathrm{dino}}^t)\)$ 设置权重 \(\lambda_{\mathrm{cnn}} = 1.0, \lambda_{\mathrm{dino}} = 10.0\) 以重点强化对高维复杂 DINO 语义流的拟合。蒸馏训练在 OmniThings 上仅需 1 个 epoch 即可收敛,之后由该学生网络完全替代双教师网络参与端到端微调。在几乎不损失深层几何精度的前提下,推理耗时从 148 ms 骤降至 102 ms,提速达 31.1%,达到约 10 FPS 的实用交互水准。

损失函数 / 训练策略

网络在迭代精炼阶段输出序列化的逆深度预测序列 \(\{\hat{d}^{(t)}\}_{t=1}^T\)(实验中精炼步数 \(T\) 设为 96 个深度 bin 的残差更新,最终经凸上采样恢复至 \(N=192\) 级全分辨率逆深度),全流程遵循指数衰减序列损失: $\(\mathcal{L} = \sum_{t=1}^T \gamma^{T-t} |\hat{d}_{\mathrm{up}}^{(t)} - d^*|\)$ 其中 \(d^*\) 为真实逆深度标签,衰减因子 \(\gamma = 0.9\),赋予后期迭代更大的优化权重。模型首先在合成基准 OmniThings 上执行 30 个 epoch 的预训练;随后固定特征教师进行 1 个 epoch 的 MobileNet 学生蒸馏;最后在 OmniHouse 与 Sunny 的混合数据集上进行 15 个 epoch 的端到端联合微调。优化器采用 AdamW,蒸馏学习率设为 \(5 \times 10^{-4}\),权重衰减为 \(10^{-5}\)

实验关键数据

主实验

论文在 OmniThings、OmniHouse 以及三个室外天气变体基准(Sunny、Cloudy、Sunset)上进行了全面评测。评估指标采用反深度索引空间下的阈值相对误差百分比(误差绝对值大于 1、3、5 个索引级的像素比例 \(>1, >3, >5\))以及平均绝对误差(MAE)和均方根误差(RMS)。

下表展示了在 OmniThings 上预训练以及在 OmniHouse + Sunny 微调后的核心量化结果:

数据集与训练设定 方法 >1 (%) ↓ >3 (%) ↓ >5 (%) ↓ MAE ↓ RMS ↓ 推理耗时 (ms) ↓
OmniThings (仅预训练) OmniMVS 47.72 15.12 8.91 2.40 5.27 289
RomniStereo64 17.77 7.52 5.00 1.22 3.90 161
MDP-Omni 18.37 7.09 4.59 1.20 3.79 117
Ours (OmniDS) 14.89 5.94 3.96 1.04 3.59 148
OmniHouse (仅预训练) RomniStereo64 10.52 4.05 2.69 0.74 1.73 161
MDP-Omni 17.13 7.20 4.68 1.16 2.62 117
Ours (OmniDS) 9.42 3.28 2.01 0.64 1.61 148
OmniThings (微调后) RomniStereo64-ft 29.84 16.21 11.28 2.26 5.60 161
MDP-Omni-ft 29.53 14.05 9.12 1.96 5.08 117
Ours-ft 25.14 11.72 7.67 1.70 4.69 148
Ours-ft (distilled) 26.22 13.69 9.51 2.11 5.49 102
OmniHouse (微调后) RomniStereo64-ft 5.28 2.22 1.51 0.42 1.14 161
MDP-Omni-ft 5.61 2.19 1.50 0.44 1.15 117
Ours-ft 3.92 1.17 0.64 0.28 0.89 148
Ours-ft (distilled) 3.41 1.16 0.73 0.28 0.89 102
Sunny (微调后) RomniStereo64-ft 4.61 1.78 1.10 0.32 1.43 161
MDP-Omni-ft 4.51 1.43 0.86 0.33 1.43 117
Ours-ft 3.75 1.39 0.86 0.28 1.32 148
Ours-ft (distilled) 3.85 1.43 0.87 0.27 1.30 102

消融实验

论文在 Sunny 数据集上对特征流组合、动态形变注意力机制以及相似度代价体各模块的设计进行了深入消融分析(基准模型统一训练 30 个 epoch):

表 1:双流架构与上下文分支配置消融(Sunny 数据集)

配置 ID 相似度体 (CNN) 相似度体 (DINO) 相似度体 (MVC) 上下文 (CNN) 上下文 (DINO) 变形交叉注意力 >1 (%) ↓ >3 (%) ↓ >5 (%) ↓ MAE ↓ RMS ↓
(a) - - - - 9.70 3.01 1.69 0.51 1.76
(b) - - - - 5.06 1.84 1.13 0.38 1.69
(c) - - - - 5.37 1.98 1.23 0.38 1.62
(d) - - - 4.69 1.69 1.07 0.35 1.55
(e) - - 4.60 1.74 1.09 0.35 1.63
(f) 完整模型 - 4.49 1.68 1.07 0.34 1.59

表 2:多视角共识体(MVC)构建组件消融(Sunny 数据集)

配置 ID 配对相关剖面 (Corr) 2D 空间聚合 (2D Aggr.) 多视角共识体 (MVC) >1 (%) ↓ >3 (%) ↓ >5 (%) ↓ MAE ↓ RMS ↓
(a) - - 5.00 1.86 1.19 0.37 1.59
(b) - 4.67 1.68 1.06 0.34 1.52
(c) 完整组合 4.49 1.68 1.07 0.34 1.59

关键发现

  • 双流互补带来质的飞跃:从单流与双流消融可知,仅用 DINOv3 构建相似度与上下文(配置 a)指标急剧劣化(>1 误差达 9.70%),表明缺乏高频边缘的粗粒度特征无法单独完成精确视差定位;而在 CNN 上下文基础上融合 DINO 上下文(配置 d 相对 b)使 >1 误差从 5.06% 下降至 4.69%,验证了语义长程先验对消除大范围几何歧义的关键效用。
  • 几何畸变偏置与变形注意力对细节恢复至关重要:加入带径向偏置的变形交叉注意力(配置 f 相对 e)进一步将 >1 误差压低至 4.49%,定性结果显示细杆、路标以及窗户边缘的撕裂伪影得到根本消除。
  • 多视角共识体(MVC)主导细粒度精度:表 2 中,在常规 2D 聚合相关剖面基础上引入包含多视角特征方差的 MVC 后,严格误差阈值 >1 指标从 4.67% 显著提升至 4.49%,表明跨相机一致性度量对于过滤遮挡边界的多峰假象起到了决定性作用。
  • 蒸馏策略在端侧极具性价比:蒸馏后的 MobileNetV2 模型在 OmniHouse 上甚至取得了与完整微调模型相当的 MAE (0.28) 与 RMS (0.89),推理时间从 148 ms 降低到 102 ms,展现出出色的特征保真度。

亮点与洞察

  • 几何偏置变形交叉注意力机制:将鱼眼光学固有的径向非均匀畸变显式建模为交叉注意力的空间几何先验,使得 ERP 空间查询能自适应向鱼眼高保真中心区域寻优,这一设计优雅地规避了边缘低信噪比采样。
  • 动静解耦的立体循环迭代设计:静态代价体负责提供全局稳定的多尺度几何候选锚点,而动态 ERP 上下文基于瞬态深度预测逐轮去除遮挡泄漏,动静协同完美化解了宽基线鱼眼系统的视差冲突。
  • 面向端侧的双流非对称知识蒸馏:通过设置 \(\lambda_{\mathrm{dino}}=10.0\)\(\lambda_{\mathrm{cnn}}=1.0\) 的非对称损失,利用单一轻量学生网络同时克隆大参数量 ViT 的语义场与深层 CNN 的边缘结构,为前沿基础模型轻量化落地提供了通用示范。

局限与展望

  • 固定四相机拓扑先验依赖:当前系统强假设输入为正交布局的固定四目鱼眼平台(前/后/左/右),共识体方差计算与动态加权网络均针对 4 相机定制,难以直接零样本泛化至任意多相机或非对称异构相机阵列。
  • 真实环境标定噪声与光照变化敏感性:实验完全基于合成仿真数据集(OmniThings、OmniHouse 等),未充分考量现实机器人底盘震动导致的相机外参微小漂移、鱼眼镜头镜头眩光以及多视角曝光不一致对特征方差的干扰。
  • 未来方向:探索支持任意视角数量与位置的置换不变(Permutation-invariant)跨相机注意力共识模块,并结合物理自监督微调提升真实世界实车/机器人平台的无标注适配能力。

相关工作与启发

  • vs OmniMVS / CasOmniMVS: 传统 3D 全景立体匹配使用昂贵的全尺寸 3D 卷积在同心球壳上聚合特征,显存开销极大(单帧需 289 ms);OmniDS 采用轻量 ConvGRU 迭代循环架构,结合 3D MVC 正则化,精度大幅领先的同时延迟缩减超一半。
  • vs RomniStereo: RomniStereo 采用纯 CNN 提取特征并在 ERP 空间进行固定的视角权重截断,容易在无纹理区域失真并在遮挡边界混叠;OmniDS 引入 DINOv3 语义先验与动态 ERP 重采样融合,有效消除了遮挡泄漏。
  • vs MDP-Omni: MDP-Omni 采用中心视角采样来缓解多峰深度歧义,但在侧视大视差区域信息损失明显;OmniDS 的多视角共识体同时建模了分组相关与全视角特征方差,在多相机对称视场下保留了全局无偏几何一致性。

评分

  • 新颖性: ⭐⭐⭐⭐☆ (双流动态 ERP 上下文融合与鱼眼畸变感知交叉注意力设计极具巧思)
  • 实验充分度: ⭐⭐⭐⭐⭐ (覆盖 5 大全向基准、微调与未微调对比、双流与 MVC 逐级消融完备)
  • 写作质量: ⭐⭐⭐⭐⭐ (概念清晰、问题定义直击宽基线多鱼眼系统本质矛盾、图文并茂)
  • 价值: ⭐⭐⭐⭐⭐ (突破全向多目深度精度瓶颈,蒸馏模型具备在移动机器人端侧直接落地的工程实用性)