跳转至

Geometry-Propagated Gaussian Splatting for Aerial Sparse Novel View Synthesis

会议: ECCV 2026
论文: ECCV 2026 Official
代码: https://github.com/GeoProp-GS/GeoProp-GS
领域: 3D视觉
关键词: 3D高斯泼溅、稀疏视角合成、航拍三维重建、几何初始化、锚点约束优化

一句话总结

针对航拍稀疏视点下 SfM 特征匹配崩溃与大面积未观测盲区两大瓶颈,GeoProp-GS 提出深度引导几何初始化与锚点约束高斯优化,通过分层深度对齐与视点增广补全几何,并利用锚点-残差解耦将可靠几何传播至弱监督区域,在仅 3 个航拍视点下实现 SOTA 新视角合成。

研究背景与动机

3D 高斯泼溅(3DGS)凭借可微栅格化与高显式几何表达,已成为地面场景实时真实感新视角合成的主流范式,其在基础设施巡检、自主导航以及城市测绘等航拍任务中展现出巨大的部署潜力。然而,航拍应用天然受限于无人机续航时间、卫星轨道重访周期、气象窗口以及空域管制等物理约束,采集到的视点通常极其稀疏。标准 3DGS 强依赖稠密多视角重叠提供的光度梯度流,在稀疏视点下极易因监督不足而产生严重的悬浮伪影(floaters)、结构空洞以及大面积破损。

现有稀疏视角合成方案主要分为两类:基于优化的方法依赖 COLMAP 等传统运动恢复结构(SfM)重建的点云作为几何骨架,并辅以深度正则化或扩散先验;基于前馈的方法则试图通过神经网络直接回归高斯参数或代价体。然而,航拍场景存在大量平整屋顶、规则路网和重复立面等低纹理、强同质化图案,导致特征点提取匮乏且匹配退化;同时,大基线俯仰拍摄和轨道视线转角使得图像间视点重叠极少。实验证实,COLMAP 在此条件下输出的点云严重残缺,直接剥夺了优化方法的几何脚手架;前馈模型在均质纹理下亦无法解算准确的相机位姿与场景几何。因此,航拍稀疏 3DGS 的根本瓶颈在于几何初始化的彻底失效,而非单纯的后端优化技巧不足。

针对这一困境,本文选择跳出传统对特征匹配的刚性依赖,将单目几何先验转化为绝对度量一致的点云,并在初始化阶段主动补全未观测盲区,进而构建从已知区域向未知区域传播的稳定表征机制。本文的核心 idea 是:构建“深度引导几何初始化(DGI)+ 锚点约束高斯优化(AGO)”框架,先通过分层尺度校准将单目深度转化为稠密几何骨架并合成增广视点补齐盲区,再将盲区高斯解耦为可靠锚点与可学习残差,以架构内置先验驱动几何知识由观测区向弱监督区自适应传播。

方法详解

整体框架

GeoProp-GS 围绕“完整几何初始化”与“跨区域几何传播”两条主线展开。整个流水线首先通过 DGI 模块为场景建立全覆盖的初始点云集合 \(C_{\text{init}}\):对于已观测视角,采用分层深度引导稠密化(HDD)融合单目深度估计与稀疏 SfM 观测,校准生成度量一致的稠密点云 \(C_{\text{dense}}\);对于未观测视角,采用几何感知视点增广(GVA)结合扩散修复生成伪视点及提议点云 \(C_{\text{proposal}}\)。在优化阶段,系统将两组点分别具象为可靠高斯 \(G_{\text{reliable}}\) 与提议高斯 \(G_{\text{prop}}\),并通过 AGO 机制将提议高斯参数化为就近可靠锚点与微调残差,配合色彩统计正则化实现弱监督区域的稳定收敛。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["稀疏航拍图像输入<br/>Sparse Aerial Images"] --> B["阶段1:分层深度引导几何稠密化 (HDD)<br/>单目深度 + 全局局部多尺度度量校准"]
    B --> C["阶段2:几何感知视点增广 (GVA)<br/>外插伪视点投影 + 扩散修复深度提议"]
    C --> D["高斯属性解耦划分<br/>可靠高斯 G_reliable 与 提议高斯 G_prop"]
    D --> E["阶段3:锚点约束高斯优化 (AGO)<br/>锚点基底 + 可学习残差自适应传播"]
    E --> F["高保真三维高斯场景与新视角渲染"]

关键设计

1. 分层深度引导几何稠密化(HDD):突破特征匹配瓶颈重构稠密观测几何

在航拍弱纹理环境下,COLMAP 仅能三角化出极其稀疏且分布不均的点云。HDD 的目标是在不依赖稠密特征匹配的前提下,为观测视角生成高精度且具备真实度量尺度的点云。由于单目深度估计模型(如 Depth Anything V2)输出的相对深度缺乏绝对尺度且存在局部非线性畸变,算法引入分层校准策略(HCS)。首先在全局尺度上,利用稀疏 SfM 反投影深度 \(D_{\text{sparse}}\) 对单目相对深度 \(\hat{D}_i\) 进行带掩码的重复最小二乘拟合,解算全局缩放因子 \(\alpha\) 与平移偏置 \(\beta\):

\[\arg\min_{\alpha, \beta} \left\| M_{\text{sparse}} \odot (\alpha \hat{D}_i + \beta - D_{\text{sparse}}) \right\|_2^2\]

得到粗对齐深度 \(D_{\text{global}} = \alpha \hat{D}_i + \beta\)。为了消除航拍视线倾角带来的局部几何畸变,算法进一步在稀疏 SfM 点位计算深度残差偏差,并构建基于欧氏距离衰减的近邻加权局部校正场。离稀疏基准点越近的像素受到强残差校正,远离参考点的区域则平滑回退至全局解,并在图像边界施加中值滤波以抑制外推伪影。最终将校正深度结合相机内外参反投影至世界坐标系,得到具有完整表面覆盖度度量点云 \(C_{\text{dense}}\)。

2. 几何感知视点增广(GVA):扩散修复驱动的未观测盲区几何补全

仅处理观测视点无法消除极端稀疏输入(如仅 3 个视角)带来的巨大几何空洞。GVA 的设计初衷是在优化开始之前,主动将几何脚手架延伸至相机视锥之外的未观测区域。系统根据稀疏航拍轨迹在几何盲区外插伪位姿 \(P_h\),将已有稠密点云 \(C_{\text{dense}}\) 投影至该视角,渲染出部分 RGB 图像 \(I_{\text{partial}}\) 及遮挡掩码 \(M\)。随后调用流匹配扩散模型(FLUX.1 Kontext)执行上下文图像修复,填补缺失视角的纹理细节生成 \(I_{\text{complete}}\)。

虽然扩散模型生成的假想纹理缺乏严格的实况保真度,但前沿单目深度估计器主要依据全局几何构图与视觉透视先验推断三维结构,受局部假想色彩的影响极小。因此,GVA 对 \(I_{\text{complete}}\) 再次应用 Depth Anything V2 与分层校准策略 HCS,提取出高一致性的几何深度,并反投影获得提议点云 \(C_{\text{proposal}}\)。通过剔除与 \(C_{\text{dense}}\) 重叠的区域,最终构建出涵盖全场景范围的初始化点云 \(C_{\text{init}} = C_{\text{dense}} \cup C_{\text{proposal}}\)。

3. 锚点约束高斯优化(AGO):架构级锚点-残差解耦抑制盲区漂移

初始化后,点云被划分为来自真实视角的可靠高斯 \(G_{\text{reliable}}\) 和来自虚构伪视角的提议高斯 \(G_{\text{prop}}\)。提议高斯缺乏真实的训练视角光度监督,若直接参与标准梯度反向传播,极易因欠定性产生漂移形变或畸形膨胀。AGO 没有采用繁重的显式几何正则化损失,而是通过表示层面的参数分解施加隐式先验约束。对于每个提议高斯 \(g_k \in G_{\text{prop}}\),在空间中检索其欧氏距离最近的可靠高斯 \(g_a \in G_{\text{reliable}}\) 作为几何锚点:

\[a = \arg\min_{j \in G_{\text{reliable}}} \|\mathbf{x}_k - \mathbf{x}_j\|_2\]

将提议高斯的所有物理属性(中心坐标 \(\mathbf{x}\)、球谐色彩系数 \(\mathbf{c}\)、缩放尺度 \(\mathbf{s}\)、旋转四元数 \(\mathbf{q}\) 以及不透明度 \(\mathbf{o}\))均显式拆解为锚点基础值与可学习微调残差:

\[\mathbf{x}_k = \mathbf{x}_a + \Delta\mathbf{x}_k, \quad \mathbf{c}_k = \mathbf{c}_a + \Delta\mathbf{c}_k, \quad \mathbf{s}_k = \mathbf{s}_a + \Delta\mathbf{s}_k, \quad \mathbf{q}_k = \mathbf{q}_a + \Delta\mathbf{q}_k, \quad \mathbf{o}_k = \mathbf{o}_a + \Delta\mathbf{o}_k\]

分解在未激活参数空间进行,推理与光栅化时动态相加后经激活函数映射。当提议区域得不到充足光度梯度时,残差保持初始微小偏置,提议高斯自发跟随可靠锚点保持严谨的几何与色彩分布;只有在偶尔接收到微弱多视角一致梯度时才更新残差,从而将观测区域学习到的鲁棒几何知识自然扩散至边缘盲区。

损失函数 / 训练策略

模型底层优化器基于 FSGS 架构,关闭了激进的致密化与修剪机制,完全依赖高质量几何初始化点集。训练监督仅使用来自已观测真实视角的标准光度损失(\(L_1\) 损失配合 D-SSIM 结构相似度项)。为了防止弱监督区域提议高斯产生异常色彩偏移,额外施加提议色彩统计正则化(Proposal Color Statistical Regularizer),拉齐提议高斯与全局高斯 DC 色彩分量的均值和方差。优化在 10,000 次迭代后即告收敛,单场景训练耗时仅需约 6.1 分钟。

实验关键数据

主实验

评估在两大基准上展开:LEVIR-NVS 包含 16 个垂直俯视航拍场景,设定为极端困难的 3 视角训练条件;3D-AS 包含 9 个大倾角大范围轨道航拍场景,覆盖城市、乡村和港口环境,使用 7 视角训练。评价指标为 PSNR、SSIM 和感知质量 LPIPS。

数据集 / 场景 方法类别 代表方法 PSNR (dB) ↑ SSIM ↑ LPIPS ↓
LEVIR-NVS (3 views 全局均值) NeRF 基线 FreeNeRF 15.54 0.27 0.60
LEVIR-NVS (3 views 全局均值) 航拍专用 NeRF MPNeRF 21.72 0.80 0.19
LEVIR-NVS (3 views 全局均值) 传统 3DGS 3DGS (Vanilla) 20.20 0.72 0.23
LEVIR-NVS (3 views 全局均值) 稀疏 3DGS FSGS 20.93 0.71 0.27
LEVIR-NVS (3 views 全局均值) 稀疏 3DGS DNGaussian 17.48 0.49 0.44
LEVIR-NVS (3 views 全局均值) 稀疏 3DGS DropoutGS 19.31 0.56 0.43
LEVIR-NVS (3 views 全局均值) 扩散先验 3DGS Guidedvd-3DGS 17.05 0.47 0.49
LEVIR-NVS (3 views 全局均值) 前馈 3DGS NoPoSplat (ft) 19.75 0.57 0.24
LEVIR-NVS (3 views 全局均值) 前馈 3DGS MVSplat (ft) 17.30 0.39 0.43
LEVIR-NVS (3 views 全局均值) 本文方法 GeoProp-GS (Ours) 24.35 0.83 0.15
3D-AS (7 views, City Scene 0) 稀疏 3DGS FSGS 19.67 0.64 0.26
3D-AS (7 views, City Scene 0) 本文方法 GeoProp-GS (Ours) 22.20 0.75 0.18
3D-AS (7 views, Country Scene 2) 传统 3DGS 3DGS (Vanilla) 19.43 0.42 0.45
3D-AS (7 views, Country Scene 2) 本文方法 GeoProp-GS (Ours) 26.16 0.74 0.25
3D-AS (7 views, Port Scene 2) 稀疏 3DGS FSGS 24.07 0.86 0.14
3D-AS (7 views, Port Scene 2) 本文方法 GeoProp-GS (Ours) 26.49 0.89 0.10

在 LEVIR-NVS 极端 3 视角配置下,GeoProp-GS 的 PSNR 较次优的航拍定制模型 MPNeRF 跃升 2.63 dB(从 21.72 升至 24.35 dB),相较基线 FSGS 大幅提升 3.42 dB,LPIPS 降低 44.4%,彻底解决了稀疏航拍下浮动伪影和边缘模糊问题。

消融实验

消融实验深入验证了分阶段几何处理与锚点约束优化的必要性,同时考察了 HDD 模块作为即插即用点云生成器的泛化增益。

配置编号 观测区域策略 未观测盲区策略 PSNR (dB) ↑ SSIM ↑ LPIPS ↓ 说明
A1 (基线) COLMAP - 21.10 0.75 0.23 FSGS 默认框架,SfM 点云稀疏残缺
A2 HDD (Ours) - 21.57 0.82 0.15 引入单目分层校准,观测区域感知指标跃升
A3 (完整) HDD (Ours) GVA + AGO (Ours) 24.35 0.83 0.15 视点增广补齐盲区,锚点解耦稳定传播
B1 (即插即用) 3DGS 默认 COLMAP 初始化 20.20 0.72 0.23 原生 3DGS
B2 (即插即用) 3DGS + HDD 替换为 HDD 点云 21.80 (+1.60) 0.83 (+0.11) 0.14 (-0.09) 仅换点云即大幅改善 vanilla 3DGS
B3 (即插即用) FSGS 默认 COLMAP 初始化 20.93 0.71 0.27 原生 FSGS
B4 (即插即用) FSGS + HDD 替换为 HDD 点云 21.75 (+0.82) 0.80 (+0.09) 0.19 (-0.08) 仅换点云即显著降低 FSGS 伪影

此外,针对不同单目深度估计模型的替换测试显示,MiDas、Marigold 和 Depth Anything V2 驱动的完整系统 PSNR 分别达到 23.79 dB、23.93 dB 和 24.35 dB,全部显著优于表 1 中所有基准方法,表明该范式对深度先验来源具备极高的算法鲁棒性与正向收益。

关键发现

  • 盲区几何重构带来决定性跨越:单纯在观测区替换 HDD 点云(A2)仅带来 +0.47 dB 的 PSNR 增益(但结构与感知指标显著提升);而引入 GVA 与 AGO 协同处理盲区(A3)后,PSNR 瞬间暴涨 2.78 dB,证明极端稀疏航拍下未观测视锥的几何补全是阻断空洞破损的核心驱动力。
  • 初始化质量决定上限:与前沿免训练前馈初始化方案对比,VGGT(16.43 dB)与 DUSt3R(18.65 dB)在航拍均质纹理下严重失真,生成巨型退化高斯;而 HDD 生成的几何结构均匀规整,初始化即达 21.57 dB。
  • 训练开销极低:AGO 将先验直接编码进网络参数化表示中,避免了昂贵的逐步在线几何正交损失或视频扩散引导。训练 10K 步仅需 6.1 分钟和 2.73 GB 显存,相比同类扩散引导方案 Guidedvd-3DGS(2.5 小时、21.3 GB 显存)计算效率提升近 25 倍。

亮点与洞察

  • 将几何约束内置于参数化表示:AGO 巧妙将未观测区高斯解耦为“就近可靠锚点 + 残差”,摆脱了传统稀疏重建需要设计复杂几何/单应性约束损失的繁琐调参过程,天然兼顾了刚性结构约束与微调灵活性。
  • 解耦纹理与深度的扩散修复利用方式:作者洞悉扩散生成模型“色彩存在幻觉但宏观透视高度自洽”的特性,仅将 Inpainting 用于为单目深度网络提供上下文线索以提取三维空间结构,避免了扩散模型幻觉纹理污染三维辐射场的问题。
  • 高度通用的即插即用性:HDD 独立提取出的一致性稠密点云,可零成本作为 drop-in 替代品注入任何基于 3DGS 的现有工作(如使原生 3DGS 绝对提升 1.6 dB),在航拍测量与摄影测量工业流水线中极具落地价值。

局限与展望

  • 离线预处理阶段的时间开销:虽然 AGO 训练速度极快(6.1 分钟),但初始化阶段运行 GVA 生成多视角修复图像与反投影点云需要约 8 至 15 分钟(单张 RTX 4090),在实时应急测绘场景下仍有轻量化加速空间。
  • 依赖粗略初始位姿与少量有效点:分层尺度对齐(HCS)依赖 COLMAP 输出的最少有效稀疏点计算尺度与平移;在完全无纹理的极端水面或沙漠场景,若 COLMAP 连初始相机位姿与单点都无法估计,系统仍需额外的 GNSS/IMU 辅助定位支持。
  • 极端几何视角下的外推边界:当合成视点与训练视点夹角跨度极大且完全脱离地面先验时,单目深度估计器的外推精度可能下降,后续可探索结合航拍卫星数字高程模型(DEM)构建多级几何先验。

相关工作与启发

  • vs FSGS / DNGaussian:FSGS 采用基于未观测视角的几何先验与重投影约束,DNGaussian 引入深度归一化损失;但在航拍稀疏场景下,它们均严重受制于残缺的 COLMAP 初始点云,产生严重的空洞与畸变。GeoProp-GS 从初始点云生成源头上解决问题,并提供自适应锚点传播机制。
  • vs Guidedvd-3DGS / RI3D:传统扩散引导方法在每轮反向传播迭代中耗费大量显卡显存计算扩散得分蒸馏或在线修复;GeoProp-GS 将扩散修复前置于离线几何增广步骤,训练时显存保持在 2.73 GB,大幅加速收敛。
  • vs DUSt3R / VGGT:直接基于 Transformer 回归三维点与位姿的前馈模型在大范围航拍地表上面临跨视点配准坍塌;GeoProp-GS 采用混合范式,以单目绝对尺度标定弥补特征匹配不足,重建保真度远超端到端前馈模型。

评分

  • 新颖性: ⭐⭐⭐⭐ [针对航拍特殊几何难点,将单目深度校准、扩散盲区修复与锚点-残差参数化有机结合,设计新颖自洽]
  • 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 LEVIR-NVS 极端 3 视角与 3D-AS 大角度倾斜视点,提供多维度消融、点云可视化及即插即用扩展实验]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑链路清晰,问题瓶颈诊断深刻,方法阐述层次分明]
  • 价值: ⭐⭐⭐⭐⭐ [彻底攻克无人机航拍与稀疏遥感中 3DGS 容易崩塌的实用痛点,兼顾高渲染品质与极高训练效率]