Sparse-View Surface Reconstruction using Gaussian Splatting through High-Confidence Depth Propagation with Normal Priors¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://hanl2010.github.io/DP-GS
领域: 3D 视觉
关键词: 3D高斯泼溅、稀疏视角表面重建、法线先验、深度传播、异常深度边缘平滑
一句话总结¶
针对稀疏视角下 3DGS 缺乏几何线索和离散高斯易导致深度模糊与断裂的问题,本文提出利用多视角几何与光度一致性筛选高置信度锚点、在单目法线先验引导下向低置信度区域迭代传播深度,并结合异常深度边缘感知平滑损失消除离散裂痕,实现了高质量表面重建。
研究背景与动机¶
从极稀疏视角(如 3 张小重叠图像)重建场景的高保真 3D 表面是三维视觉中的经典难题。近年来,以 3D Gaussian Splatting (3DGS) 为代表的点云辐射场方法在密集视角下展现出惊人的渲染速度与表面拟合能力,但在稀疏输入场景下性能急剧恶化。由于视角数量匮乏,多视角几何约束严重不足,且 3DGS 基础图元具有离散、无序的本质,仅靠稀疏视角的 RGB 渲染损失进行优化极易陷入病态局部极小,导致高斯基元漂浮在表面之外、渲染深度失真,进而彻底破坏提取出的网格表面质量。
为了在稀疏条件下引入几何先验,学术界主要探索了泛化型重建与特定场景优化两条路线。基于大规模预训练的泛化型方法耗费极高算力,且在视点排布与训练分布偏差较大或遇到未见域时重建质量崩溃;而基于场景优化的 NeRF 类隐式场(如基于 SDF 的方法)收敛速度极慢。虽然近期的 3DGS 优化方案尝试引入单目深度或法线先验,但单目深度固有尺度模糊与透视形变,哪怕经过标定也难以与三维真实表面严密对齐;同时,现有法线先验多直接用于法线渲染正则化,未能释放其对空间深度排布的直接几何引导潜力。另一方面,即使法线大致正确,在弱纹理和遮挡等无法形成多视角几何验证的低置信度区域,离散高斯的无序分裂仍会催生阶梯状断裂和撕裂的异常深度边缘。
本文的切入视角是:直接信任整幅图像的单目深度先验不可靠,但可以通过多视角严密的几何重投影与块光度一致性检验,精准挑选出少量可靠的「高置信度深度锚点」;随后,借助较为稳健的单目表面法线作为局部切平面指引,将这些高质量深度由内向外拓展至模糊与弱纹理区域。核心 idea:利用多视角几何与光度双重一致性构建置信度掩码筛选锚点,以单目法线先验为切平面几何引导迭代向外传播高置信度深度以约束弱置信度区域,并协同基于法线反掩码的异常深度边缘平滑正则化消除高斯离散断裂。
方法详解¶
整体框架¶
本文方法的整体流程旨在解决稀疏输入下高斯深度的不确定性与离散断裂。系统输入为稀疏图像与 COLMAP 初始化的高斯点云,前向过程渲染出 RGB 图像、深度图以及法线图,并借助预训练模型(如 Metric3Dv2)提取单目法线先验。算法首先通过参考视与邻近源视之间的重投影距离误差和 NCC 块光度相关度计算出像素级深度置信度图,阈值化后锁定高置信度区域;随后基于局部平面假定与法线先验,将高置信度深度迭代向外传播至低置信度区域以施加几何监督;最后,通过对比深度边缘与法线边缘提取异常深度不连续区域,在反投影 3D 空间施加垂直于法线的切向平滑损失。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["稀疏图像输入<br/>COLMAP 点云初始化"] --> B["3DGS 渲染<br/>输出 RGB / 深度 / 法线"]
B --> C["高置信度深度锚点筛选<br/>几何重投影 + NCC 光度相关度"]
C --> D["法线先验引导的深度迭代传播<br/>局部切平面几何约束向外扩展"]
B --> E["异常深度边缘检测与平滑<br/>深度边缘 × 翻转法线边缘掩码"]
D --> F["综合损失联合优化<br/>RGB 误差 + 传播深度 + 异常平滑 + 法线先验"]
E --> F
F --> G["高质量连续网格表面输出"]
关键设计¶
1. 几何与光度双重一致性的高置信度深度锚点筛选:拒绝全图盲目先验
单纯依赖单目深度先验会导致形变与尺度误差,而直接将密集视角下的多视角一致性作为损失项在极稀疏视角下易受噪声干扰。本文并不把一致性直接作为损失优化,而是将其用于构建精确的置信度掩码。对于参考视像素 \(p_r(u_r, v_r)\) 及其渲染深度 \(d_r\),通过深度单应变换投影至源视得到 \(p_s\),再利用源视深度图内插得到的 \(d_s\) 反投影回参考视得到 \(p'_r\)。往返重投影误差反映了几何一致性:
与此同时,在参考像素周围构建图像块 \(P_r\),通过单应映射至源视块 \(P_s\),计算归一化互相关(NCC)作为光度一致性度量 \(C_{pho} = \text{NCC}(P_r, P_s)\)。最终深度置信度为两者的乘积 \(C = C_{geo} \cdot C_{pho}\)。通过阈值 \(\tau\) 截断生成置信度二值掩码 \(M_C = \mathbb{I}(C > \tau)\),高精度锁定了几何与外观均自洽的高保真锚点区域。
2. 单目法线先验引导的局部切平面深度迭代向外传播:赋能低置信度与弱纹理区
在弱纹理或重叠视角较小的区域,一致性判断往往失效导致置信度偏低,无法获得直接多视角监督。本文利用单目法线估计模型生成的法线先验 \(\boldsymbol{n}\),基于局部共面假设推导空间深度传递关系。假设像素 \(p_i\) 与其邻域像素 \(p_j\) 属于同一局部平面(法向量均为 \(\boldsymbol{n}_i\)),自相机光心指向像素的光线归一化方向向量分别为 \(\boldsymbol{r}_i\) 和 \(\boldsymbol{r}_j\),则根据平面点法式方程,由 \(p_j\) 深度 \(d_j\) 推算 \(p_i\) 的深度解析公式为:
算法利用置信度掩码 \(M_C\) 过滤无效邻域点,对高置信邻域传递而来的深度取局部平均,并在多次迭代 \(t \in [1, 10]\) 中交替更新深度图 \(d^{t+1}\) 与置信度掩码 \(M_C^{t+1}\)。这使得几何可靠的深度能够沿物体的平坦与连续表面稳健外扩,对原本缺乏有效约束的低置信度区域施加严格的深度监督损失 \(\mathcal{L}_{dp} = M_C^{t+1} |D - d^{t+1}|\)。
3. 异常深度边缘感知平滑正则化:根除离散高斯断裂与表面穿孔
受制于局部共面假设的有效范围以及法线先验在复杂曲率区域的误差,深度传播无法跨越长距离无边界漫延,远离锚点的阴影或极低纹理区仍可能欠约束;仅依赖法线先验监督渲染法线时,离散高斯会各自调整方向匹配法线,但在空间距离上发生错位断层,导致“法线平滑但深度阶跃”的异常裂痕。为此,本文设计了一种反常边缘剥离机制:分别提取渲染深度图的边缘掩码和法线先验图的边缘掩码,将深度边缘掩码与「翻转的法线边缘掩码」进行逐像素相乘。这种相乘操作排除了物体真实物理轮廓(物体边界处深度与法线通常同时跳变),精准捕获了本该平滑却产生深度突变的假边缘。针对这些异常边缘像素 \(i\) 及其邻域采样点 \(j\),利用相机内参和深度将其反投影为 3D 点 \(\boldsymbol{a}_i, \boldsymbol{a}_j\),构成空间位移向量 \(\boldsymbol{v}_{ij} = \boldsymbol{a}_j - \boldsymbol{a}_i\),并强制其与该处表面法线 \(\boldsymbol{n}_i\) 正交:
该损失迫使高斯基元在切向连续密铺,彻底消除了由于离散分裂产生的伪边缘与网格孔洞。
损失函数 / 训练策略¶
整个优化目标整合了外观渲染与多重几何正规化:
其中 \(\mathcal{L}_{rgb}\) 为渲染 RGB 与真实图像的组合损失(包含 \(\ell_1\) 与 D-SSIM),\(\mathcal{L}_{normal}\) 为渲染法线与 Metric3Dv2 预测法线先验之间的 \(\ell_1\) 距离。在训练策略上,模型基于 PGSR 的可微高斯渲染器实现,并引入高斯不透明度衰减策略抑制表面附近漂浮的冗余图元。在单个 RTX 3090 GPU 上优化 10K 步仅需约 10 分钟。超参数设定为:置信度阈值 \(\tau = 0.6\),传播迭代轮数 \(t = 10\),平衡权重 \(\lambda_1 = 0.5, \lambda_2 = 0.03, \lambda_3 = 0.1\)。
实验关键数据¶
主实验¶
在 DTU 基准数据集(采用公认最具挑战性的 3 个小重叠视角配置,跨 15 个场景)上评估倒角距离 Chamfer Distance (CD ↓,单位 mm);在 Tanks & Temples (TNT) 360 度环拍场景上评估 F1 分数(F1 ↑,点云重建精度与召回综合指标)。
表 1: DTU 数据集 3 个小重叠输入视角下的倒角距离(CD ↓, mm)定量对比(节选自原文 Table 1,涵盖密集视角、泛化型稀疏与场景特定优化型代表方法;# 表示采用 MASt3R 初始化):
| 方法类别 | 代表方法 | 平均 CD (Mean CD ↓) | Scan 24 | Scan 65 | Scan 110 |
|---|---|---|---|---|---|
| 密集视角 3DGS 基础方法 | 2DGS (SIGGRAPH 2024) | 2.45 | 3.54 | 2.35 | 2.97 |
| 密集视角 3DGS 基础方法 | PGSR (CVPR 2024) | 2.38 | 4.01 | 2.84 | 1.91 |
| 泛化型稀疏重建 | SparseNeuS-ft (ECCV 2022) | 3.34 | 4.81 | 3.88 | 3.12 |
| 泛化型稀疏重建 | VolRecon (CVPR 2023) | 3.02 | 3.05 | 3.68 | 2.77 |
| 泛化型稀疏重建 | UFORecon (CVPR 2024) | 1.40 | 1.51 | 1.81 | 0.93 |
| 场景特定隐式优化 | NeuSurf (3DV 2024) | 1.35 | 1.35 | 2.35 | 1.21 |
| 场景特定隐式优化 | SparseRecon (ECCV 2024) | 1.06 | 1.26 | 2.38 | 0.77 |
| 场景特定 3DGS 优化 | FatesGS (ECCV 2024) | 1.37 | 1.32 | 2.08 | 0.85 |
| 场景特定 3DGS 优化 | MAtCha (NeurIPS 2024) | 1.48 | 1.38 | 1.58 | 1.24 |
| 场景特定 3DGS 优化 | MAtCha# (MASt3R 初始化) | 1.16 | 0.88 | 1.35 | 1.02 |
| 本文方法 | Ours (COLMAP 初始化) | 1.02 | 1.45 | 1.09 | 0.61 |
| 本文方法 | Ours# (MASt3R 初始化) | 0.85 | 0.57 | 1.11 | 0.65 |
表 2: Tanks & Temples (TNT) 环拍场景不同稀疏视角数量下的 F1 分数对比(节选自原文 Table 2,均使用 MASt3R 初始化):
| 方法 | 5 Views | 10 Views | 20 Views |
|---|---|---|---|
| FatesGS | 0.014 | 0.025 | 0.033 |
| MAtCha | 0.072 | 0.156 | 0.218 |
| Ours | 0.081 | 0.173 | 0.293 |
消融实验¶
在 DTU 3 个小重叠视角配置下,对法线先验损失 \(\mathcal{L}_{normal}\)、高斯不透明度衰减策略 (Opacity Decay, O.D.)、深度传播损失 \(\mathcal{L}_{dp}\) 以及异常深度边缘平滑损失 \(\mathcal{L}_{ds}\) 进行逐项消融(节选自原文 Table 4):
| 配置编号 | \(\mathcal{L}_{normal}\) | 不透明度衰减 (O.D.) | 深度传播 \(\mathcal{L}_{dp}\) | 异常边缘平滑 \(\mathcal{L}_{ds}\) | 平均倒角距离 (Mean CD ↓) | 说明 |
|---|---|---|---|---|---|---|
| (1) 基线 | - | - | - | - | 2.79 | 仅靠 RGB 渲染损失,表面崩塌 |
| (2) | ✓ | - | - | - | 2.28 | 引入法线平滑但存在明显空间失真 |
| (3) | ✓ | ✓ | - | - | 1.55 | 消除表面漂浮物,骨架仍粗糙 |
| (4) | ✓ | ✓ | ✓ | - | 1.13 | 传播深度大幅提升弱纹理几何 |
| (5) | ✓ | ✓ | - | ✓ | 1.38 | 边缘平滑避免断裂,但缺乏全局准确深度 |
| (6) 完整模型 | ✓ | ✓ | ✓ | ✓ | 1.02 | 所有模块协同取得最优连续几何重建 |
关键发现¶
- 深度传播模块贡献最大:对比配置 (3) 与配置 (4),引入法线引导的深度传播后平均 CD 从 1.55 mm 锐降至 1.13 mm(提升幅度达 27.1%),直接解决了 3DGS 在弱纹理与稀疏几何盲区的深度漂移难题。
- 异常深度边缘平滑针对性消除网格碎裂:虽然在 DTU 全局指标上 \(\mathcal{L}_{ds}\) 使 CD 从 1.13 mm 进一步微调至 1.02 mm,但在定性可视化(原文 Fig. 9 与 Fig. 10)中,缺少 \(\mathcal{L}_{ds}\) 会导致重建网格出现明显的裂口和碎片;它精确补充了局部共面假设外扩失效时的边界平滑。
- 传播迭代与先验鲁棒性:迭代轮数 \(t\) 在 4 到 10 之间时,CD 从 1.126 mm 稳步下降到 1.021 mm;超过 10 步后精度饱和且略有微动,故定为 10(20 步传播总用时仅 0.008 秒,计算负担可忽略)。此外,更换不同法线估计器时,即使使用较早期的 Omnidata,CD 仍达到 1.14 mm,逼近或超越同期竞品,展现出强大的先验容错度。
亮点与洞察¶
- 将多视角一致性从「优化损失」降级为「置信度门控」:密集视角下重投影误差是极佳的端到端损失,但在稀疏小重叠视角下直接当损失优化会充斥误匹配梯度。本文巧妙地将其退居幕后作为置信度打分器,仅用于识别高保真锚点,规避了错误梯度的破坏。
- 「法线切面指引 + 掩码相乘过滤」的精巧几何几何学:巧妙将深度边缘与法线边缘的反向掩码相乘,不需昂贵的语义分割或大模型先验,便以纯几何操作剥离出了因高斯离散性产生的阶梯断层,把平滑约束精准加在病态裂缝上。
- 可复用的先验协同范式:单目法线比单目深度具有更好的几何一致性与无尺度歧义优势。本文将法线作为传播桥梁去修正稀疏深度,这一思想可无缝扩展至少视角室内点云补全或自动驾驶雷达与相机稀疏融合任务中。
局限与展望¶
- 弱纹理区初始置信度估计退化:作者指出,置信度由几何与光度一致性共同决定,若场景大面积缺乏纹理(如纯白无阴影墙面),光度 NCC 指标将失效甚至给出错误的高分,导致错误的深度被外推到邻域,引起局部形变。
- 局部共面假设对高曲率几何的局限:传播公式依赖邻域与中心点共面的强几何假设,对于极细小结构、复杂植物枝叶或剧烈折叠边缘,多轮传播容易抹平锐利边缘。
- 未来改进方向:可引入非局部法线感知注意力机制自适应调整传播权重,或结合单目曲率先验动态控制传播步长,以保护非平面微结构的重建精度。
相关工作与启发¶
- vs PGSR / 2DGS: 传统 2DGS 与 PGSR 面向密集视角多视角表面重建,在稀疏小重叠输入下由于缺乏密集重叠视图,表面出现大量孔洞与飞点(DTU CD 分别为 2.45 mm 与 2.38 mm);本文构建法线传播与边缘平滑,将 CD 压降至 1.02 mm。
- vs SparseRecon / NeuSurf: 基于隐式神经表面(SDF)的方法重建质量虽高,但需耗费数小时(SparseRecon 需 3.5 小时),且大重叠依赖度高;本文依托 3DGS 架构仅需 10 分钟和 3GB 显存,训练耗时缩短一个数量级以上,同时在 3 视角小重叠下精度更胜一筹。
- vs MAtCha / FatesGS: 同期基于 3DGS 的少视角重建工作在弱约束区容易出现高斯离散碎裂或直接发散(TNT 5 视角下 FatesGS F1 仅 0.014,MAtCha 为 0.072);本文以 0.081(5视角)和 0.293(20视角)全面领跑,表面平整度显著改善。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ (法线引导深度外拓与反常边缘掩码提取构思精巧,打通了单目几何先验与多视角一致性的协同)
- 实验充分度: ⭐⭐⭐⭐⭐ (DTU 15 场景评测严谨,TNT 环拍拓展与自采真实数据兼备,消融实验层次分明)
- 写作质量: ⭐⭐⭐⭐⭐ (逻辑推导清晰严密,Mermaid 流程与数学公式自洽互补)
- 价值: ⭐⭐⭐⭐☆ (为 3DGS 在极稀疏视点下的落地提供了轻量高效的几何约束方案,工程与实用价值高)