跳转至

Targeted Structure Completion for Sparse-View 3D Reconstruction in Autonomous Driving

会议: ECCV 2026
论文: ECCV 2026 Poster
项目主页: https://focusgs.github.io/
领域: 自动驾驶
关键词: 3D场景重建, 高斯泼溅, 几何不确定性, 稀疏视角重建, 目标结构补全

一句话总结

针对自动驾驶环视稀疏视角(重叠率<15%)下全场景体素密集补全计算冗余的问题,FocusGS解耦确定性区域与歧义区域,通过提取深度边缘构建3D几何歧义流形,仅在该稀疏拓扑子空间内实例化与优化高斯查询,以减少约74%的高斯数量和34%的渲染延迟实现了SOTA重建质量。

研究背景与动机

在自动驾驶自车中心(ego-centric)场景中,由稀疏多视角相机进行高质量3D场景重建是支撑感知、仿真与世界模型的基石。基于3D高斯泼溅(3DGS)的前馈式单阶段预测方法近年来展现出极高的推理效率与泛化能力。然而,现有的像素对齐式前馈高斯方法高度依赖跨视角间的显著视场重叠以维持多视角几何一致性。而在自动驾驶感知配置中,环视相机旨在用最少传感器实现全景覆盖,相邻相机间的视场重叠率往往低于15%。在缺乏足够视差重叠与频繁出现截断遮挡的条件下,传统的像素投影方法在前景与背景交界处会出现严重的几何退化和破洞。

为了摆脱对视场重叠的强依赖,近期以Omni-Scene为代表的工作引入了体素高斯分支,将2D图像特征提升至3D体素空间并预测致密的高斯基元。然而,这种均匀体素处理策略在整个3D空间内无差别地实例化和优化数百万个高斯,带来了极大的计算与显存冗余。定量统计表明,在自动驾驶场景中,超过82%的区域属于平坦道路、开阔天空等连续平滑的确定性表面,基础的像素级高斯已能实现高达26.50 dB的PSNR;真正的伪影与几何崩溃高度集中在仅占约17.93%的视线转换与遮挡边缘区域(其基线PSNR仅21.90 dB)。采用全域致密体素网格,本质上是在用极昂贵的全局代价去弥补局部小范围的几何缺陷。

这种效率与结构完整性之间的矛盾启示我们:场景补全不应全盘铺开,而应与确定性平滑区域解耦。本文的核心 idea 是显式提取由深度梯度与视线跳变诱导的“几何歧义流形”,仅在这一稀疏且不规则的3D拓扑子空间内有针对性地实例化固定预算的高斯查询,实现低开销的定向结构补全(FocusGS)。

方法详解

整体框架

FocusGS由两个紧密协作的分支构成:基础像素对齐表征分支与定向结构补全(Targeted Structure Completion, TSC)分支。系统首先通过多视角图像编码器提取2D图像特征并结合Plücker射线等几何先验,高效反投影出覆盖全景连续可见表面的基础像素级3D高斯;与此同时,几何歧义定位模块检测深度图突变并膨胀为2D歧义掩码,沿相机射线抬升为稀疏3D不确定性子空间;最后,定向结构补全模块在该子空间内均匀采样固定数量的3D查询,经由稀疏卷积自身上下文聚合与跨视角可形变注意力更新后,由MLP回归补偿高斯属性,与基础高斯联合完成高质量场景渲染。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["稀疏环视图像输入<br/>6路环视RGB图像"] --> B["多视角特征提取与几何增强<br/>ResNet-50 + Plücker射线先验"]
    B --> C["基础像素对齐高斯预测<br/>高效覆盖82%确定性平滑表面"]
    B --> D["2D几何歧义流形提取<br/>中心差分深度梯度 + 形态学膨胀"]
    D --> E["3D不确定性子空间抬升<br/>深度自适应射线线段抬升"]
    E --> F["定向结构补全模块<br/>固定预算查询 + 稀疏卷积 + 可形变注意力"]
    C --> G["高斯聚合与可微渲染<br/>G_final = G_base ∪ G_comp"]
    F --> G
    G --> H["全景新视角图像与深度输出"]

关键设计

1. 几何歧义定位与3D子空间抬升:从深度不连续面精准锁定遮挡区域 为了避免全场景无差别的体积处理,首先必须在三维空间中精准定位出遮挡与视线转换区域。在环视图像中,连续表面深度平滑变化,而前景边缘遮挡背景处会产生尖锐的深度断层。方法利用中心差分卷积核计算预测深度图的水平与垂直梯度: $\(D_x = Z_i \times K_x, \quad D_y = Z_i \times K_y, \quad E_i = \sqrt{D_x^2 + D_y^2}\)$ 随后通过阈值 \(\tau_g\) 筛选出严格的几何跳变边界,并通过尺寸为 \(k\) 的正方形结构元进行形态学膨胀,形成覆盖边界邻域不确定性条带的2D歧义流形 \(\mathcal{O}_d\)。随后,系统将流形上的像素沿相机光线反投影至世界坐标系,以预测深度 \(d_p\) 为中点构建长度为 \(\Delta_p\) 的3D线段 \([p_0, p_1]\)。线段厚度 \(\Delta_p = \kappa_{\text{rel}} d_p + \kappa_{\text{abs}}\) 随距离线性增大,从而自适应赋予远景更大的纵向容差。全重视角下所有反投影线段的并集构成了紧凑且不规则的3D不确定性子空间 \(\mathcal{O}_{3d}\)。

2. 不确定性感知查询采样:固定预算下的恒定内存开销保障 针对传统网格在不规则流形上计算低效的问题,FocusGS抛弃了依赖稠密3D体素或沿光线致密采样的做法,转而在衍生的3D不确定性子空间 \(\mathcal{O}_{3d}\) 内进行均匀几何采样,直接抽取固定总数 \(N_q\)(默认60k)个离散三维坐标点: $\(\mathcal{P} = \left\{\mathbf{p}_m \in \mathcal{O}_{3d} \;\middle|\; m = 1, \dots, N_q\right\}, \quad \mathbf{p}_m \sim \mathcal{U}(\mathcal{O}_{3d})\)$ 每个采样点作为补偿高斯的几何空间锚点,绑定可学习的高维特征嵌入。将查询数量与原始像素分辨率和场景体素规模完全解耦,从算法机制上保证了补全阶段内存占用的恒定与轻量化。

3. 双重上下文聚合与结构补偿解码:稀疏几何建模与跨视角色彩注入 针对抽取的稀疏查询,模块堆叠4个级联定向补全块进行迭代更新。首先,针对内部局部几何关系,采用3D稀疏卷积(spconv)对体素化后的非空查询执行邻域自上下文聚合,完全避开密集三维体素 \(O(X \times Y \times Z)\) 的立方级复杂度。随后,为消除遮挡下的单视角几何多义性,利用可形变交叉注意力机制将3D高斯查询投影至多视角2D特征图,自适应聚合未被遮挡视角的互补视觉线索。最后,由轻量MLP预测高斯的3D均值残差偏移 \(\delta_m\) 以及不透明度、尺度、旋转四元数和RGB颜色,形成用于缝合空洞的定向补偿高斯集合 \(\mathcal{G}_{\text{comp}}\)。

损失函数 / 训练策略

场景由基础高斯与补偿高斯共同组成 \(\mathcal{G}_{\text{final}} = \mathcal{G}_{\text{base}} \cup \mathcal{G}_{\text{comp}}\) 进行全局可微渲染,并计算整体光度损失(\(L_1\) 与 LPIPS)。为了让补偿高斯专注于解决局部缺陷,FocusGS将2D歧义流形 \(\mathcal{O}_d\) 作为空间掩码,专门为 \(\mathcal{G}_{\text{comp}}\) 单独渲染局部图像与深度并计算掩码监督损失: $\(\mathcal{L} = \mathcal{L}_{\text{full}}^{l_1} + \lambda_1 \mathcal{L}_{\text{full}}^{\text{lpips}} + \lambda_2 \mathcal{L}_{\text{comp}}\)$ 其中 \(\mathcal{L}_{\text{comp}} = \mathcal{L}_{\text{comp}}^{l_1} + \lambda_{c1} \mathcal{L}_{\text{comp}}^{\text{lpips}} + \lambda_{c2} \mathcal{L}_{\text{comp}}^{\text{dpt}}\)。该机制迫使补偿高斯的梯度严格集中在流形界定的不确定区域内,防止补全基元漂移至已充分优化的平坦路面。模型使用两张80GB GPU以AdamW优化器(初始学习率 \(1 \times 10^{-4}\),余弦退火衰减)在nuScenes上训练100k次迭代。

实验关键数据

主实验

在nuScenes自动驾驶自车中心(ego-centric)稀疏环视(6相机,重叠率约15%)基准以及RealEstate10K场景中心基准上进行对比。

数据集 方法 渲染耗时 (s) ↓ PSNR ↑ SSIM ↑ LPIPS ↓ PCC ↑
nuScenes AttnRend 9.980 20.96 0.533 0.467 N/A
nuScenes MuRF 0.672 20.34 0.504 0.433 -0.332
nuScenes pixelSplat 0.508 21.51 0.616 0.372 0.001
nuScenes MVSplat 0.174 21.61 0.658 0.295 0.181
nuScenes SCube - 23.85 0.721 0.258 0.651
nuScenes DrivingForward - 24.32 0.732 0.229 0.766
nuScenes STORM - 24.56 0.752 0.217 0.788
nuScenes Omni-Scene (SOTA基线) 0.088 24.27 0.736 0.237 0.800
nuScenes FocusGS (本文) 0.058 24.65 0.754 0.220 0.837
RealEstate10K Omni-Scene - 26.19 0.865 0.131 0.368
RealEstate10K FocusGS - 26.32 0.872 0.123 0.365
RealEstate10K MVSplat + FocusGS - 27.02 0.892 0.118 0.374

消融实验

表1检验核心模块逐步叠加的增益,表2检验定向结构补全内部聚合层与歧义掩码形式的影响。

配置 / 模块组合 PSNR ↑ SSIM ↑ LPIPS ↓ PCC ↑ 核心说明
(a) Pixel-aligned Baseline 22.89 0.698 0.290 0.780 仅用基础像素对齐高斯
(b) (a) + 深度初始化 23.14 0.703 0.320 0.802 引入先验深度投影微弱改善几何
(c) (b) + 全局随机结构补全 23.40 0.708 0.306 0.810 全域随机补全,缺乏空间先验引导
(d) 完整模型 (含几何歧义定位) 24.65 0.754 0.220 0.837 定向至流形内,PSNR大幅跃升+1.25 dB
TSC 去除自上下文聚合 (w/o S.A.) 24.04 0.738 0.234 0.827 失去稀疏卷积邻域几何平滑能力
TSC 去除跨视角聚合 (w/o C.A.) 23.30 0.723 0.265 0.802 缺乏互补视角特征,遮挡区严重掉点
歧义掩码:学习型掩码 (Learned Mask) 24.03 0.732 0.261 - 查准高但召回仅0.55,遗漏大量结构缺陷
歧义掩码:基于深度差分 (本文) 24.65 0.754 0.220 - 召回率高达0.82,PSNR超越学习掩码0.62 dB

关键发现

  • 定向补全超越全域随机:消融表明,在全场景盲目随机补充查询(Random S.C.)仅带来0.26 dB提升,而结合几何歧义定位后PSNR剧增1.25 dB,证实了“算力精准聚焦于不确定性流形”是突破性能瓶颈的关键。
  • 跨视角注意力最为致命:在定向补全模块中,移除跨视角注意力(w/o C.A.)导致PSNR剧降1.35 dB,远大于移除内部自卷积(w/o S.A.)的0.61 dB,说明解决单目遮挡最核心的养分来自其他无遮挡相机的特征注入。
  • 高召回掩码优于高精确率掩码:对比实验表明,虽然网络自学习掩码查准率高达0.86(IoU 0.50),但因漏检严重(召回仅0.55)使补全效果受限;而基于深度梯度的启发式流形凭借0.82的高召回率全面胜出,说明结构修复任务对结构缺失的漏报容忍度极低。
  • 高斯容量与深度的饱和特性:查询数从10k增至60k时PSNR从23.79提升至24.65 dB,进一步倍增至120k时性能趋于平缓(24.67 dB);级联块数以4层为最优,6层时因稀疏特征过拟合略有退化(24.56 dB)。

亮点与洞察

  • 空间解耦取代全域密集化:敏锐地指出自动驾驶中80%以上的路面属于简单平滑区域,采用显式歧义流形将补全区域严格局限在约18%的复杂视线切换带,以极其精炼的架构消除了双分支高斯方法长期存在的巨大算力开销。
  • 简单有效的梯度差分先验胜过黑盒学习:利用经典的中心差分算子结合深度自适应光线拉伸,构造出召回率高达82%的三维不确定性管道,相比黑盒神经掩码不仅无需额外监督且物理直观,展现了经典几何先验与现代高斯表征的优雅融合。
  • 计算复杂度与高斯基元的解耦控制:通过在稀疏3D子空间内抽取固定数量 \(N_q\) 的查询配合稀疏卷积运算,在不依赖复杂动态负载均衡的情况下,实现了恒定内存占用与约74%的基元缩减。

局限与展望

  • 极端恶劣天气下的传感器伪影干扰:作者指出模型在雨天强干扰场景下存在失败案例,雨滴落在镜头上引起的强光学畸变和离焦模糊破坏了跨视角特征一致性,导致模型将2D镜头噪点误认为是三维几何歧义而产生模糊破损。
  • 强动态目标下的流形时间维度缺失:当前的歧义流形仅在单帧空间维度上建立,对于马路上高速移动的车辆和穿行行人,由于缺少时序运动补偿,容易产生拖影与时间维度闪烁。
  • 改进思路:后续工作可引入去雨滴/去模糊的时空注意力先验,将单帧的空间几何歧义流形扩展为4D时空流形,并在多相机间建立光流/场景流一致性约束。

相关工作与启发

  • vs Omni-Scene: Omni-Scene构建了全域平铺的稠密体素高斯分支以解决环视盲区,造成数百万高斯的冗余分配;FocusGS通过几何流形将补全范围收敛至局部断层,以仅四分之一的高斯基元和更低的延迟刷新了SOTA。
  • vs MVSplat / pixelSplat: 纯像素反投影前馈方法在重叠率充足的双目场景表现优异,但在自动驾驶大基线、视场微弱重叠(<15%)下因几何多义性出现严重退化;FocusGS保留了其高效的基底像素通路,通过轻量级定向补全巧妙化解了遮挡缺陷。
  • vs VoxSplat / SCube: SCube依赖密集三维体素网格生成VoxSplat基元,显存消耗大且无法自适应地形;FocusGS采用连续空间固定查询点与稀疏卷积,实现了严格常数级的显存占用。

评分

  • 新颖性: ⭐⭐⭐⭐ [跳出均匀密集化思维,提出几何歧义流形解耦补全,思路清晰优雅]
  • 实验充分度: ⭐⭐⭐⭐⭐ [对比基线全面,指标覆盖渲染效率、光度质量与深度相关性PCC,消融实验设计严密]
  • 写作质量: ⭐⭐⭐⭐⭐ [动机阐述有数据实证支撑,问题建模与公式推导逻辑自洽,图表质量上乘]
  • 价值: ⭐⭐⭐⭐⭐ [为端到端自动驾驶自车视角3D表征与世界模型重建提供了一个高性价比的实时范式]