跳转至

FDR-Occ: Factorized Dense Routing for Full-Spectrum 3D Occupancy Prediction

会议: ECCV 2026
论文: ECCV 原文
领域: 自动驾驶
关键词: 3D占用预测 / 视角转换 / 密集路由 / 分辨率-上下文解耦 / 鲁棒感知

一句话总结

针对传统基于物理光线的 2D 到 3D 视角转换存在的局部受限与外参敏感痛点,FDR-Occ 提出因子化密集路由(FDR)算子与分辨率-上下文解耦架构,以亚二次复杂度实现全域可达性,并在外参完全缺失时仍能鲁棒感知场景拓扑。

研究背景与动机

基于环视相机的三维占用预测(3D Occupancy Prediction)是自动驾驶与具身智能感知的核心基石。然而,该任务的根本瓶颈在于 2D 到 3D 的视角转换(View Transformation, VT):如何将透视图像特征精准、完整地提升到自车三维体素网格中。目前主流的视角转换方法主要遵循以物理光线先验为主导的两大流派,即以 LSS 为代表的主动前向投影(沿光线深度概率 splatting)与基于 3D 到 2D 交叉注意力的反应式反向查询。

这些经典方案在结构上存在一个根本缺陷:极其严苛的光线级感受野局部限制(Locality Bottleneck)。在现有框架中,2D 到 3D 的路由矩阵被人为限制在与相机视线共线且极度稀疏的模式上。这一约束导致了严重的“受限可达性(Restricted Reachability)”——任意 2D 像素只能将特征严格广播在自身的物理视线上,导致三维空间中大量连续体素区域完全无法接收直接的图像证据。面对大尺度车辆或道路等跨相机连续结构时,网络只能将其离散投影为破碎碎片,迫使后续依赖沉重的 3D/BEV 卷积进行后验扩散弥补。更致命的是,这类方法强依赖高精度的相机外参标定,一旦出现车辆颠簸、标定漂移甚至外参缺失,刚性物理投影便会迅速崩溃。

从理论上看,受限的物理光线路由空间仅仅是全域无约束二分路由空间的一个严格真子集。为了彻底打破局部可达性瓶颈,本文将视角转换重构为广义的全局密集二分路由;针对直接构建稠密路由带来的二次复杂度爆炸问题,核心 idea:通过分层张量收缩将全局密集视角转换近似为“因子化密集路由(FDR)”,并与高分辨率显式投影正交解耦,以全局拓扑锚点与局部几何平面协同兼顾宏观上下文与精细边界。

方法详解

整体框架

FDR-Occ 针对全局感受野与计算开销之间的矛盾,提出了“因子化密集路由(Factorized Dense Routing, FDR)”,并构建了“分辨率-上下文解耦架构(Resolution-Context Decoupled Architecture)”。模型输入为 \(N\) 个环视相机图像,经过 2D 主干提取特征 \(\mathcal{F}_{2D} \in \mathbb{R}^{N \times C \times H \times W}\)。随后,系统分流进入两条正交通路:一是利用分阶段张量收缩在可控计算量下捕捉全局全域拓扑的全局上下文通路(Global Context Pathway),在最终阶段沿 \(Z\) 轴压缩生成宏观对齐的 BEV 全局上下文锚点 \(\mathcal{V}_{global} \in \mathbb{R}^{C \times X \times Y \times 1}\);二是通过免空间下采样的显式 LSS 投影建立局部高分辨率几何通路(Local Resolution Pathway),产出精细几何体素 \(\mathcal{V}_{LSS} \in \mathbb{R}^{C \times X \times Y \times Z}\) 并池化为三平面正交表征。二者在共享的 BEV 空间完成无损融合后,解码出稠密 3D 语义占用概率。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    In["环视图像输入<br/>F_2D"] --> Split{"双流解耦路由"}
    Split -->|"宏观全局流 (Pt > 1)"| FDR["因子化密集路由 (FDR)<br/>分层张量收缩 St->1, Vt->V"]
    Split -->|"精细几何流 (Pt = 1x1)"| LSS["显式物理投影 (LSS)<br/>深度加权 Splatting 生成 V_LSS"]
    FDR --> Anchor["全局拓扑锚点<br/>V_global (Z轴压缩 BEV)"]
    LSS --> TPV["三平面投影<br/>P_xy, P_xz, P_yz"]
    Anchor & TPV --> Merge["BEV 空间正交解耦统一<br/>P_xy = P_xy + V_global"]
    Merge --> Dec["多平面广播融合与 MLP 解码"]
    Dec --> Out["3D 语义占用预测<br/>O ∈ R^(B×X×Y×Z)"]

关键设计

1. 因子化密集路由(FDR):以分层张量收缩逼近全域可达性

传统全域无约束密集路由矩阵 \(\mathbf{W} \in \mathbb{R}^{V_T \times S_0}\) 需要在输入像素数 \(S_0 = HW\) 与三维体素数 \(V_T = XYZ\) 之间建立二分映射,带来高达 \(\mathcal{O}(S_0 V_T C)\) 的二次计算复杂度。FDR 借鉴从全连接网络向分层卷积演进的归纳偏置思想,将密集映射分解为 \(T\) 个局部化阶段性张量算子的乘积: $\(\mathbf{W} \approx \mathbf{M}^{(T)} \mathbf{M}^{(T-1)} \dots \mathbf{M}^{(1)}\)$ 在阶段 \(t\) 中,算法将 2D 空间划分为大小为 \(P_t = \Delta_h^{(t)} \times \Delta_w^{(t)}\) 的无重叠 Patch,通过 Unfold 展开为 \(\tilde{\mathcal{X}}^{(t-1)}\),并将其与动态生成的局部路由权重 \(\mathbf{A}^{(t)}\) 进行张量收缩运算(Tensor Contraction): $\(\mathcal{Y}^{(t)} = \tilde{\mathcal{X}}^{(t-1)} \otimes \mathbf{A}^{(t)}\)$ 收缩后通过 Fold 操作将微体素维度 \(K_t = \Delta_x^{(t)} \times \Delta_y^{(t)} \times \Delta_z^{(t)}\) 合并入 3D 体积轴。通过令 2D 分辨率逐步收缩(\(S_t \to 1\))而 3D 体积维度指数级膨胀(\(V_t \to V_T\)),前期计算受益于未膨胀的 3D 体积(\(V_t \ll V_T\)),后期计算受益于已高度压缩的 2D 网格(\(S_{t-1} \ll S_0\))。在实际 \(T=3\) 阶段配置下,FDR 实现了 100% 的全域感受野可达性,但仅消耗全局全连接理论计算量的约 1.4%。

2. 自适应几何上下文路由:引导软性归纳偏置

为了使动态路由权重 \(\mathbf{A}^{(t)}\) 避免盲目探索,FDR 摒弃了硬编码的静态物理光线过滤,而是采用软性几何引导。在计算第 \(t\) 阶段的微体素路由概率时,中间特征与显式对齐的几何上下文特征 \(E_{geo}^{(t)}\) 进行通道拼接: $\(\mathbf{A}^{(t)} = \text{Softmax}\left(\text{Unfold}_{P_t}\left(g_\theta^{(t)}\left(\mathcal{X}^{(t-1)} \parallel E_{geo}^{(t)}\right)\right)\right)\)$ 其中 \(E_{geo}^{(t)}\) 融合了由轻量级深度头预测的局部深度特征以及相机的普吕克(Plücker)光线坐标 \(E_{ray} = \text{MLP}(d \parallel (o \times d))\)。与经典 LSS 直接在光线以外硬截断为 0 不同,软性几何引导将物理视线视为软先验,赋予模型自主跨越光线捕捉遮挡区域与跨相机全局语义关联的能力。

3. 分辨率-上下文解耦统一:正交双通路互补

密集路由中的空间收缩(\(P_t > 1\))不可避免地面临“分辨率-上下文权衡(Resolution-Context Trade-off)”:获得全域感受野必然伴随精细边缘信息的聚集与模糊,导致 FDR 更偏好宏观拓扑而非微观几何表面。本文并不强求单一算子突破该理论约束,而是构建正交双流: 1. 全局上下文通路:由 FDR 负责,配置最终阶段压缩 \(Z\) 轴,输出全局重力对齐的宏观拓扑锚点 \(\mathcal{V}_{global} \in \mathbb{R}^{C \times X \times Y \times 1}\); 2. 局部几何通路:由免跨 Patch 聚合的经典 LSS 担当(\(P_t = 1 \times 1\)),严格保持 2D 原生像素级空间对齐,输出高精度局部表面体素 \(\mathcal{V}_{LSS}\) 并正交投影为三平面(\(P_{xy}, P_{xz}, P_{yz}\))。 考虑到驾驶环境中的核心拓扑与连续结构(道路、车辆群)主要分布在地面俯视维度,系统通过最简洁的直接残差相加将二者统一于共享的 BEV 平面: $\(\tilde{\mathcal{P}}_{xy} = \mathcal{P}_{xy} + \mathcal{V}_{global}\)$ 从而在零额外密集 3D 显存开销的前提下,同时获得了无约束全局语义推理与像素级锐利几何边界。

损失函数 / 训练策略

模型采用端到端多任务联合监督训练,总损失函数定义为: $\(\mathcal{L} = \mathcal{L}_{3D} + \lambda_{depth} \mathcal{L}_{depth} + \lambda_{sem} \mathcal{L}_{sem}\)$ 其中三维占用损失 \(\mathcal{L}_{3D}\) 结合了加权二元交叉熵损失(BCE)与 Dice 损失,有效缓解体素背景与前景类别之间的严重不平衡;\(\mathcal{L}_{depth}\) 为 LSS 分支的显式深度预测提供辅助几何监督;\(\mathcal{L}_{sem}\) 则遵循 ALOcc 引入 2D 透视视角的语义分割辅助监督,增强底层表征辨识度。

实验关键数据

主实验

在自动驾驶标杆数据集 Occ3D-nuScenes 与 Occ3D-Waymo 上,采用 ResNet-50 作为图像主干网络,输入分辨率分别为 \(256 \times 704\)\(640 \times 960\)

在 Occ3D-nuScenes 验证集上(单帧与单历史帧 +1f 设置):

模型 主干网络 帧设置 mIoU (%) IoU (%) 可行驶地面 (drv. surf.) 汽车 (car) 卡车 (truck)
FB-Occ ResNet-50 单帧 35.7 66.5 77.6 46.6 33.7
BEVDetOcc ResNet-50 单帧 37.1 70.4 80.2 50.0 36.8
LightOcc-S ResNet-50 单帧 37.9 - 80.0 48.7 35.1
ProtoOcc ResNet-50 单帧 39.6 - - - -
ALOcc ResNet-50 单帧 40.1 70.2 81.2 52.1 39.5
Ours (FDR-Occ) ResNet-50 单帧 41.2 71.0 81.6 53.0 39.9
COTR ResNet-50 +1f 41.4 - 81.8 53.3 39.5
DHD-M ResNet-50 +1f 41.5 - 83.1 52.9 40.2
Ours (+1f) ResNet-50 +1f 42.2 72.1 82.6 53.8 41.3

在 Occ3D-Waymo 验证集上(多帧时序融合设置):

模型 mIoU (%) 车辆 (Vehicle) 行人 (Pedestrian) 道路 (Road) 人行道 (Walkable) 建筑 (Building)
BEVFormer 24.58 36.06 21.00 79.11 57.04 23.98
CVT-Occ 27.37 41.00 23.93 79.12 59.09 29.40
ALOcc-3D 30.03 39.61 24.14 78.42 59.91 35.67
Ours (FDR-Occ) 31.25 42.74 27.52 81.21 64.46 39.98

消融实验与外参鲁棒性分析

1. 核心模块与融合策略消融(Occ3D-nuScenes 轻量单帧设置)

配置与融合策略 mIoU (%) IoU (%) 说明
默认完整模型 (Baseline) 38.1 67.1 完整 FDR 全局流 + LSS 几何流解耦统一
去掉全局通路 (w/o Global Pathway / FDR) 37.0 66.0 仅保留局部物理投影,性能显著下跌 -1.1%
去掉软几何先验 (w/o Soft Geometric Hint) 37.7 66.7 缺少深度与光线引导,密集路由探索效率下降
仅纯 BEV 表征 (Only BEV Representation) 37.7 67.9 缺乏正交三平面,垂直分辨率表达减弱
自适应空间加权融合 (Adaptive Weighting) 38.0 67.2 引入复杂自适应加权,相比直接残差相加无增益
晚期 3D 融合 (Late 3D Fusion) 37.7 66.9 在 3D 编码后融合,错失浅层联合表征学习时机

2. 极端无外参设置(Uncalibrated Scenario)鲁棒性对比

评估方法 mIoU (%) IoU (%) 性能保留说明
BEVDetOcc 4.7 33.1 依赖硬性标定,光线错位后完全崩溃
ALOcc 9.0 43.5 物理光线受扰,几何投影严重畸变
FB-Occ 12.0 54.5 即使有注意力微调,局部受限投影仍大幅受挫
Ours (FDR-Occ) 28.0 63.2 全局路由内化多相机相对几何,展现极高结构鲁棒性

关键发现

  • 大尺度连续结构受益最深:在 Occ3D-nuScenes 的 driveable surface 与 Occ3D-Waymo 的 Road (+2.79%)、Walkable (+4.55%) 等类别上增幅显著,证实全域密集路由有效消除了物理光线导致的跨相机接缝与遮挡盲区断裂。
  • 因子化阶段配置不可骤变:将张量收缩压缩为 2 阶段(\(20 \to 10\))时 mIoU 下降至 37.4%,证明平滑递进的 3 阶段(\(10 \to 5 \to 4\))对于构建连续的宏观上下文必不可少。
  • 内化外参先验:在完全剥离预置相机参数的严苛无外参实验中,传统基线 mIoU 崩塌至 4.7%~12.0%,而 FDR-Occ 依然坚挺达到 28.0%,证明全局可达性使网络能够自主通过视觉语境学习多相机拓扑。

亮点与洞察

  • 将视角转换形式化为受限二分路由:论文从图论与张量路由的视角审视视角转换,证明了物理投影只是全局二分图的极稀疏局部子集,从理论上限层面指明了视角转换演进的方向。
  • 以张量收缩打破复杂度壁垒:类比 CNN 对全连接的结构分解,通过 2D 收缩与 3D 扩张的分层张量收缩交织,将不可行的 \(\mathcal{O}(S_0 V_T)\) 稠密操作降低两个数量级,仅需约 1.4% 的理论计算量即换得 100% 感受野。
  • 正交双流解耦的精巧设计:认识到“全域上下文扩展必然损失精细空间分辨率”的客观规律,不强行将单一算子推向极端,而是让 FDR 主攻宏观拓扑、LSS 主攻边缘雕刻,在 BEV 平面以简单的残差相加达成优雅互补。

局限与展望

  • 作者承认的局限:FDR 在构建全局路由时虽然降低了理论乘加操作量,但分层 Patch Unfold 与频繁张量变形在特定轻量嵌入式硬件上的内存访存带宽(Memory Bandwidth)仍有进一步优化空间。
  • 潜在改进方向:当前软几何引导仅依赖轻量深度头与光线坐标,未来可探索结合粗粒度自监督高斯基元(3D Gaussians)进行轻量拓扑引导;另外可进一步探索在时间序列流动下动态演化路由因子的时空密集路由(Spatio-Temporal FDR)。

相关工作与启发

  • vs LSS & BEVDetOcc:传统 LSS 严格限制沿光线 1D 离散化投影,导致大量体素不可达且对外参敏感;FDR 将物理光线放宽为软先验,利用张量收缩实现全域密集可达。
  • vs TPVFormer & FB-Occ:反向查询与前后向变换依赖空间交叉注意力且计算沉重;本文通过解耦架构将 BEV 拓扑锚点与垂直平面正交分工,在保持高效推理的同时规避了注意力分辨率退化。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次从张量因子化密集路由角度系统重构 2D-3D 视角转换,理论视角极佳。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖双权威榜单、精细消融、定性图示及非常惊艳的无外参鲁棒性破坏实验。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑层层推进,公式规范,图文对照紧密且洞见深刻。
  • 价值: ⭐⭐⭐⭐⭐ 为自动驾驶视角转换提供了突破物理外参依赖的新范式,工业界与学术界借鉴意义极大。