跳转至

StratoSplat: Taming Layered Regularities for Sparse Aerial 3D Gaussian Splatting

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/keloee/StratoSplat
领域: 3D 视觉
关键词: 稀疏视角高斯泼溅, 航拍场景重建, 分层深度图像, 神经多平面高斯, 测试时自适应

一句话总结

针对无人机稀疏航拍视角下点云初始化缺失与视线过拟合退化问题,StratoSplat 利用重力方向分层几何先验,通过分层深度图像引导的深度扩散自适应与神经多平面虚拟高斯混合表征,实现了高质量几何补全与新视点渲染。

研究背景与动机

无人机航拍在城市规划、大尺度三维测绘、环境监测与自主导航等领域具有广泛应用。3D 高斯泼溅(3DGS)凭借逼真的渲染质量与实时推理速度,迅速成为新视点合成的核心技术。然而在实际无人机作业中,受限于电池续航、空域管制、极端天气及飞行几何等物理约束,采集到的多视角航拍图像往往极度稀疏且观测方向高度各向异性(多为倾斜俯影视角)。这种极端条件导致传统 3DGS 在航拍场景下面临严重的几何崩塌。

在稀疏航拍视角下,现有辐射场方法主要面临两大致命瓶颈。首先是初始化点云严重缺失:由于航拍影像中包含大面积弱纹理或无纹理区域(如建筑物屋顶、平整沥青路面、农田与水体),传统运动恢复结构(SfM,如 COLMAP)在特征匹配和三角测量阶段极易失败,生成带有大面积孔洞的残缺稀疏点云,导致 3DGS 初始化彻底失稳;尽管无人机搭载的 GNSS/IMU 能够提供可靠位姿,但缺乏致密几何点。其次是视线对齐退化(View-Aligned Degeneracies):在稀疏且各向异性的倾斜观测下,显式高斯缺乏跨视角几何约束,极易沿训练相机的视线方向拉长或排列,仅机械拟合训练视角的 2D 表观,在新视角观察时暴露出严重的针状或片状漂浮物伪影。通用的单目深度先验(如 DNGaussian)或视频生成先验(如 Guidedvd-3DGS)因严重的地面与俯视域差(Domain Gap)难以直接迁移,而前馈式高斯模型在稀疏航拍视角下更易产生训练视角超高拟合(如 TranSplat 训练集近 50dB、测试集仅 17dB)但新视点崩塌的假象。

这一系列退化现象的根本原因在于传统方法忽视了航拍场景天然具备的结构规律。与通用室内或单物体场景不同,航拍场景中的地表道路、建筑立面、屋顶及阶梯地形均沿重力方向呈现出高度一致的平行分层特征。核心 idea:将航拍场景沿重力方向天然分层的几何先验内化为强正则,前端借助分层深度图像(LDI)构建深度有序的全局记忆,指导单目深度扩散模型进行多视角一致的测试时自适应以补全致密初始化点云;后端引入锚定于可学习平行平面的神经多平面虚拟高斯,与显式高斯构建显隐混合表征,在联合优化中刚性约束视线退化。

方法详解

整体框架

StratoSplat 针对稀疏航拍图像输入(已知 GNSS/IMU 相机位姿),构建了“分层记忆引导初始化 + 神经多平面混合优化”的两阶段协同管线。在初始化阶段,框架从极稀疏的 SfM 三角化点出发,按视角重叠覆盖度依次处理输入图像,通过预训练深度扩散模型的测试时去噪后验逐步预测深度,并将多视角深度有序累加至以参考相机为基准的分层深度图像(LDI)几何记忆中。LDI 通过显式深度排序与阈值合并避免点云恶性膨胀,同时为后续视角反向渲染遮挡感知的可见性引导信号,驱使扩散模型输出稠密且多视角严格自洽的彩色点云 \(P_{\text{dense}}\)。在优化阶段,系统对 \(P_{\text{dense}}\) 进行奇异值分解(SVD)提取沿重力方向的主分层法向量,建立一组覆盖场景深度跨度的全局共享平行平面;基于连续坐标的紧凑神经隐式场查询相机光线与平面的交点,生成低频平滑的虚拟高斯(Virtual Gaussians),与由 \(P_{\text{dense}}\) 初始化的显式高斯(Explicit Gaussians)共同通过 \(\alpha\)-compositing 联合光栅化渲染,从而利用刚性平面锚定切断高斯沿任意单视角视线方向漂移的自由度。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["稀疏航拍图像 + GNSS/IMU 位姿"] --> B["分层记忆引导的测试时深度自适应<br/>LDI 有序存储 + 稀疏/可视引导优化"]
    B --> C["密集着色点云 P_dense"]
    C --> D["神经多平面高斯混合表征<br/>SVD 提取主法向 + 神经场预测虚拟图元"]
    D --> E["显隐非对称联合优化与几何正则<br/>显式捕捉局部高频 + 平面锚定抑制视线退化"]
    E --> F["高质量航拍新视点渲染"]

关键设计

1. 分层记忆引导的测试时深度自适应:解决弱纹理初始化空洞与域外深度多视角不一致

传统 SfM 三角测量在屋顶和道路等无纹理区域无法产生有效点,而直接加载地表预训练的单目深度网络又存在严重的俯影视角域差。针对该问题,StratoSplat 设计了一种基于分层深度图像(LDI)的序列测试时自适应策略。以参考相机 \(C_{\text{ref}}\) 为基准,图像每个像素坐标 \((u, v)\) 对应一个按深度单调递增排列的图层序列 \(\{\ell_k\}_{k=1}^{K_{u,v}}\),其中每层存储深度 \(d_k\)、三维世界坐标 \(\mathbf{p}_k\) 与颜色 \(\mathbf{c}_k\)(满足 \(d_1 < d_2 < \dots < d_{K_{u,v}}\))。在去噪时间步 \(t\) 下,通过扩散后验均值解码获得当前视角的中间深度预测 \(\hat{D}_i\),并通过可学习仿射参数校准至场景尺度 \(\hat{D}_i^{(m)} = \hat{D}_i \cdot \hat{a} + \hat{b}\)。为了驱动预测深度兼具局部锚定与全局几何一致性,定义复合自适应目标: $$ \mathcal{L} = \sum_{(u,v) \in \mathcal{P}i^{\text{SfM}}} |\hat{D}_i^{(m)}(u,v) - d|_1 $$ 其中第一项将深度硬锚定于 SfM 已知的稀疏三角化骨架点,第二项将预测结果约束至由当前 LDI 记忆反投影渲染的可见引导深度图 }^{\text{SfM}}| + \lambda_{\text{vis}} |(\hat{D}_i^{(m)} - D_i^{\text{guide}}) \odot M_i^{\text{vis}\(D_i^{\text{guide}}\)(配以可见掩膜 \(M_i^{\text{vis}}\))。在完成单视角去噪后,反投影得到的新点按深度顺序插入 LDI:若新点与既有图层深度差小于阈值 \(\epsilon_d\),则执行平均融合;否则新建分层。这种分层融合机制相较于无序点云堆积,能将点云冗余压缩 \(3.6\times\) 倍,同时保证无纹理区域补全后具有正确的深度层叠逻辑,反投影导出高质量稠密点云 \(P_{\text{dense}}\)。

2. 神经多平面高斯混合表征:利用重力方向全局平行平面消除视线对齐退化

即便获得了致密的初始化点云,显式 3D 高斯在缺乏稠密多视角交会光束监督时,仍倾向于退化为迎合训练视角相机的局部薄片或离群漂浮点。StratoSplat 针对航拍场景以水平地表与垂直高程为主导的几何特征,对点云 \(P_{\text{dense}}\) 去中心化后执行 SVD 分解,取最小奇异值对应的特征向量作为场景分层法向量 \(\mathbf{n} = V[:, \arg\min_j \Sigma_{jj}]\),其在物理上严格对齐垂直于地面的重力轴。在深度覆盖区间 \([d_{\min}, d_{\max}]\) 内均匀布置 \(K\) 个全局共享的平行虚拟平面 \(\pi_k: \mathbf{n}^\top \mathbf{p} + d_k = 0\)。对于训练视角发出的每一条相机光线 \(\mathbf{r}(t) = \mathbf{o} + t \mathbf{d}_p\),其与平面 \(\pi_k\) 的精确交点为: $$ \mathbf{p}_k = \mathbf{o} + t_k \mathbf{d}_p, \quad t_k = -\frac{\mathbf{n}^\top \mathbf{o} + d_k}{\mathbf{n}^\top \mathbf{d}_p} $$ 不同于离散存储的高斯图元,平面上的虚拟高斯属性由紧凑的连续隐式神经场 \(\Phi: \mathbb{R}^3 \to (\mathbf{c}_k, \tilde{\alpha}_k, \mathbf{s}_k, \mathbf{q}_k)\) 实时预测。连续坐标网络天然引入局部空间平滑性,且虚拟高斯的中心位置被死死锚定在平面交点 \(\mathbf{p}_k\) 上。为了防止近景平面累积不透明度过早遮蔽背景并破坏多层结构,引入深度距离调制偏置:\(\alpha_k = \sigma(\tilde{\alpha}_k + b(t_k))\),使得远景平面仍能获取充分梯度更新。

3. 显隐非对称联合优化与几何正则:高低频互补的分工协作渲染

场景由显式高斯集合 \(\mathcal{G}_{\text{exp}}\) 与平面虚拟高斯集合 \(\mathcal{G}_{\text{vir}}\) 联合表征,两者在渲染管线中按深度排序统一进行 \(\alpha\)-blending 积分。二者承担了非对称的物理角色:显式高斯 \(\mathcal{G}_{\text{exp}}\) 直接由 \(P_{\text{dense}}\) 生成,允许沿袭标准的自适应分裂、复制与剪枝(Densification & Pruning),并赋予球谐函数(SH)以拟合建筑物立面、门窗等复杂表观的高频局部变化与视角相关光泽;虚拟高斯 \(\mathcal{G}_{\text{vir}}\) 则被强制赋予视角无关的 Lambertian 颜色,且高斯中心不参与梯度更新。因为虚拟高斯的空间分布被刚性限制在固定方向的平行平面交点上,它从数学结构上切断了图元通过空间平移去过拟合单个斜向视线的路径。虚拟高斯构成了场景的低频几何骨架,显式高斯则紧贴骨架雕刻细节,彻底根除了浮空伪影与新视点下的空洞塌陷。

损失函数 / 训练策略

整个管线先进行约数十秒的离线深度自适应(在单卡 RTX 4090 上每视角处理约 12 秒),生成初始稠密着色点云 \(P_{\text{dense}}\)。随后进入高斯混合表征的联合训练阶段: - 光度重建损失:联合光栅化渲染图像与真值计算 \(\mathcal{L}_{\text{rgb}} = (1 - \lambda_{\text{ssim}}) \|\hat{I} - I\|_1 + \lambda_{\text{ssim}} (1 - \text{SSIM}(\hat{I}, I))\),其中 \(\lambda_{\text{ssim}} = 0.2\)。 - 透明度偏置设计:距离衰减偏置 \(b(t_k)\) 映射至 logit 区间 \([-4.6, 1.4]\),平衡近景与远景平面的透射率。 - 超参配置:可见性约束权重 \(\lambda_{\text{vis}} = 0.1\),3DAS 数据集层合并阈值 \(\epsilon_d = 0.02\),LEVIR-NVS 设为 \(0.55\)。训练仅需约 9 分钟即可完全收敛。

实验关键数据

主实验

论文在极具代表性的无人机航拍公开基准 LEVIR-NVS(3 个稀疏训练视角,涵盖高楼、校园、体育场、城镇、山区、厂区等 16 个场景)及大尺度 3DAS(7 个稀疏训练视角,涵盖城市、乡村、港口 9 个复杂大场景)上进行了严格对比。

表 1:LEVIR-NVS 数据集 3 视角输入定量对比(16 个场景平均值)

方法类型 方法 PSNR ↑ (dB) SSIM ↑ LPIPS ↓ 备注
NeRF 类 NeRF [34] 15.13 0.20 0.58 稠密视角基础模型,极度稀疏下崩塌
NeRF 类 DietNeRF [23] 15.71 0.24 0.57 语义一致性正则
NeRF 类 RegNeRF [36] 13.40 0.18 0.63 未观测视角退化严重
NeRF 类 FreeNeRF [52] 15.54 0.27 0.60 频域退火正则
NeRF 类 MPNeRF [18] 21.72 0.80 0.19 航拍专用多平面 NeRF,渲染较慢
3DGS 类 Vanilla 3DGS [25] 20.20 0.72 0.23 视线对齐退化严重,浮空针状伪影
3DGS 类 FSGS [64] 20.93 0.71 0.27 基于皮尔逊相关性的软深度监督
3DGS 类 DNGaussian [29] 17.48 0.49 0.44 硬单目深度先验受域差干扰,性能反降
3DGS 类 DropoutGS [51] 19.31 0.56 0.43 通用随机失活无法应对航拍稀疏
3DGS 类 Guidedvd-3DGS [62] 17.05 0.47 0.49 视频扩散与 DUSt3R 存在严重俯视域差
前馈式 NoPoSplat ft [53] 19.75 0.57 0.24 全场景微调版,无位姿预测
前馈式 MVSplat ft [7] 17.30 0.39 0.43 双视角立体匹配,跨度受限
前馈式 DepthSplat ft [50] 15.75 0.30 0.53 前馈深度匹配在航拍泛化受阻
前馈式 TranSplat ft [58] 16.79 0.29 0.56 训练集达 49.76dB,新视角严重过拟合
本文方法 StratoSplat (Ours) 24.48 0.83 0.15 较最强 3DGS 基线提升 3.55dB

消融实验

论文在 LEVIR-NVS 3 视角基准上逐步隔离验证了前端初始化模块、后端多平面表征以及核心正则设计的有效性。

表 2:初始化策略与表征设计消融对比(LEVIR-NVS 16 场景平均)

消融配置分类 具体方案配置 PSNR ↑ (dB) SSIM ↑ LPIPS ↓ 核心结论与机制分析
基础基线 Vanilla 3DGS (SfM 稀疏点 + 显式高斯) 20.20 0.72 0.23 稀疏点初始化不稳定,优化陷入局部极小
初始化变体 + DUSt3R 初始化 18.65 0.56 0.34 地表几何先验严重失真,引入大量假点
初始化变体 + VGGT 初始化 16.43 0.30 0.46 原生多视角模型在航拍域出现严重几何断层
初始化变体 + Depth Anything V3 (DA3) 初始化 20.49 0.71 0.23 尺度不自洽,仅微幅提升
初始化变体 + COLMAP MVS 密集匹配初始化 20.45 0.75 0.21 弱纹理区仍然大面积漏提点云
初始化变体 + Marigold 单目深度初始化 20.31 0.73 0.23 独立单视角扩散缺乏多视角深度一致性
初始化变体 + 分层记忆引导初始化 (LDI-guided Init) 21.00 0.77 0.18 相比 SfM 提升 0.8dB,提供完整稠密无孔骨架
表征变体 显式 3DGS (基于 LDI 点云优化) 21.00 0.77 0.18 缺乏连续平面正则,仍有视角偏向浮空物
表征变体 固定离散多平面高斯 (Fixed Multi-Plane GS) 21.81 0.79 0.16 离散图元缺乏空间连续性与邻域耦合
表征变体 神经多平面高斯 (w/o 深度不透明度偏置) 23.64 0.79 0.18 连续神经场发挥正则作用,但多层有早停坍缩
完整模型 StratoSplat (完整模型) 24.48 0.83 0.15 两模块紧密结合,比基线累计提升 4.28dB

表 3:几何记忆结构与效率消融(3DAS 城市场景 0,7 视角)

几何记忆结构方案 PSNR ↑ (dB) SSIM ↑ 点云数量 (Points) ↓ 预处理耗时 (s) ↓ 设计优势分析
无序三维点云直接拼接 (Point Cloud Accum.) 22.99 0.76 778,646 98 出现点云恶性累积与冗余冲突
分层深度记忆 (Layered Memory, Ours) 23.21 0.79 215,607 84 点数减少 72.3% (\(3.6\times\)),指标反增 0.22dB

关键发现

  • 分层几何记忆是解决域差与膨胀的双赢钥匙:直接堆积多视角反投影点会导致点云数量失控(近 78 万点);而利用航拍沿深度天然分层的物理特性,LDI 有序合并机制仅用 21.5 万点(减少 \(72.3\%\))就完成了弱纹理表面无缝填充,PSNR 反而超出 0.22dB。
  • 离散图元 vs 连续神经场:单纯在固定平面上撒离散高斯(Fixed Multi-plane GS)只能达到 21.81dB,而采用连续坐标神经网络 \(\Phi\) 预测图元属性后飙升至 23.64dB。这证实了连续隐式网络所具备的空间平滑诱导偏置(Inductive Bias)是规避视线过拟合的真正关键。
  • 透明度偏置至关重要:加入深度调制的透明度偏置 \(b(t_k)\) 为模型带来接近 0.84dB 的实质跃升(23.64dB \(\to\) 24.48dB),有效杜绝了光线在最外侧平面过早完全阻光、导致深层几何失去反向梯度的早停退化问题。
  • 位姿扰动敏感性:在深度自适应阶段对相机外参加入扰动(旋转 \(1.0^\circ\)、平移 \(0.002\) 场景尺度),PSNR 由 24.48dB 降至 23.21dB;但整体管线仍能维持高可用性,印证了无人机 GNSS/IMU 配合该框架足以胜任真实作业。

亮点与洞察

  • 物理先验替代大规模外挂模型:现有多数稀疏视角方法迷恋于引入十亿参数级的视频或通用深度大模型,却在航拍视角遭遇水土不服;StratoSplat 敏锐抓住“建筑地形皆顺应重力天然分层”这一最质朴的物理规律,仅用轻量级 SVD 与多平面神经场就彻底解决了顽疾。
  • 显隐结合的高低频分工机制:显式高斯擅长拟合高频锐利边缘,隐式神经多平面擅长提供低频刚性几何支撑。两者的非对称协作使得网络既保有 3DGS 的高动态渲染质感,又具备类似 NeRF 的几何抗畸变鲁棒性。
  • 可复用的迁移价值:基于 LDI 的测试时深度自适应管线并不局限于高斯泼溅,亦可完全无缝嫁接到稀疏重建中的隐式表征(如 Instant-NGP、SDF 表面重构)或航拍倾斜三维网格(Mesh)自动修补管线中。

局限与展望

  • 极端异形地貌适应性:方法假设主分层法向严格由重力控制(平行地面),对于悬崖峭壁、垂直峡谷或重度起伏的极端喀斯特地貌,单一全局共享平面组可能无法充分拟合局部剧烈倾斜的法向。
  • 位姿联合优化缺位:当前流程强依赖车载 GNSS/IMU 提供的精确先验位姿;一旦工业级无人机在城市峡谷出现 GPS 信号跳变或漂移,点云投影几何一致性将受损。未来可将位姿自适应联合修正嵌入 LDI 扩散去噪循环。
  • 动态物体干扰:航拍影像中偶发的移动车辆或行人在连续 LDI 更新中会被视为多层离群噪点,需在记忆合并时加入动态语义剔除机制。

相关工作与启发

  • vs MPNeRF [18]: MPNeRF 同样引入了多平面先验,但它是基于隐式 NeRF 体积渲染构建,训练耗时数小时且无法做到实时高帧率交互;StratoSplat 将多平面思想与 3DGS 显隐混合表征融为一体,渲染与训练速度均呈数量级提升,PSNR 反超 2.76dB。
  • vs FSGS [64] & DNGaussian [29]: 传统稀疏 3DGS 在训练阶段引入显式单目深度作为硬/软约束损失,极易受到单目深度图固有尺度漂移和边缘畸变的误导;StratoSplat 仅在初始阶段利用 LDI 记忆自适应生成高质量稠密点云,训练期摆脱深度图强绑定,避免了梯度污染。
  • vs Guidedvd-3DGS [62] & DUSt3R [45]: 基于生成式视频扩散与地面几何匹配的模型在航拍视角域差巨大;StratoSplat 表明利用无人机自身位姿与场景内源分层几何,远比盲目信任通用地表大模型更可靠。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 巧妙提炼重力分层物理先验,开创性地将 LDI 动态记忆与多平面神经高斯相结合。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 LEVIR-NVS 16 个场景与 3DAS 9 个大场景,消融实验逻辑严密,细致剖析了前馈模型的假性过拟合。
  • 写作质量: ⭐⭐⭐⭐⭐ 理论分析清晰,两大致命失效模式的剖析切中要害,逻辑自洽且实验说服力强。
  • 价值: ⭐⭐⭐⭐⭐ 为稀疏航拍遥感测量与低成本无人机实景三维重建提供了极具实用价值的高性能解决方案。