SkySplat-OV: Generalizable Language Gaussian Splatting for Open-Vocabulary Scene Understanding from Sparse Satellite Views¶
会议: ECCV 2026
论文: ECCV 原文
项目主页: https://skysplat-ov.github.io/
领域: 3D视觉
关键词: 3D高斯泼溅 / 开放词表场景理解 / 卫星遥感 / 稀疏视角 / 基础模型蒸馏
一句话总结¶
首个面向稀疏卫星遥感视角的通用型开放词表 3D 场景理解框架,通过将 RPC 有理多项式相机模型显式引入语言 3DGS 前馈管线,结合几何-辐射-语义融合(GRS-Fusion)与单目相对高程自监督,配合单阶段 SAM3 蒸馏,实现了无需场景级优化的秒级前馈几何重建与高一致性开放词表三维语义分割。
研究背景与动机¶
从稀疏卫星多视角影像中重建三维几何并实现开放词表语义理解,在城市规划、地表监测、灾害评估与大范围地理信息测绘中具有核心战略价值。然而,传统遥感场景理解方法普遍严重依赖密集的真值几何与人工语义标注进行监督训练,不仅数据标注代价极高,且模型被刚性限定在预设的闭集分类空间中,无法灵活识别开放世界中繁杂多样的新类别地物。近期在近景视觉领域兴起的神经辐射场(NeRF)与 3D 高斯泼溅(3DGS)虽然能够通过知识蒸馏将 2D 视觉语言模型(VLM/VFM)的泛化能力迁移到三维辐射场,但主流代表方法(如 Feature-3DGS、LangSplatV2、Sat-NeRF、SatGS)均遵循场景级逐场景优化范式(per-scene optimization),在处理单场景时需耗费数分钟至数小时的迭代时间,并且强烈依赖密集的重叠观测视角,完全无法适应现实卫星任务中覆盖稀疏、要求快速响应的应用需求。
近期涌现的前馈通用型(generalizable)3DGS 方法(如 MVSplat、LSM、Uni3R)通过深度网络直接端到端预测高斯参数并将语义特征单次前向提升至 3D 空间,显著提高了场景迁移性与重建速度。然而,将通用语言 3DGS 直接迁移到稀疏卫星遥感影像时,面临着三大物理与成像维度的核心挑战:其一,绝大多数遥感高轨对地观测卫星采用线阵推扫式(pushbroom)成像,必须依靠有理多项式系数(RPC)进行严格的非线性几何几何映射,常规针孔相机的透视投影假设在推扫成像下完全失效;其二,卫星重访轨道与气象条件限制导致输入视角往往仅有 2 到 3 个,稀疏观测下的跨视角几何约束极度匮乏,导致通用网络直接预测的高斯几何参数(中心与协方差矩阵)存在严重的高度坍缩与几何漂移;其三,卫星俯视拍摄场景覆盖面积宽广,地物在尺度分布上跨越多个数量级,小到独立车辆、大到连绵水体与大型建筑群并存,现有通用分割管线通常需要复杂的多阶段或多尺度级联蒸馏才能勉强维持分辨率,推理延迟与显存开销居高不下。
针对这一系列痛点,SkySplat-OV 选择将遥感专用的 RPC 严格成像模型深入集成到通用语言 3DGS 前馈架构中,并打破模态间的孤立预测范式,构建多模态协同表征与单阶段全自监督约束。核心 idea:将卫星 RPC 投影几何深度嵌入前馈 3DGS 代价体构建流程,通过 GRS-Fusion 模块统一融合几何、辐射与语义先验,并联合单目基础模型 DA3 的相对高程线索与单阶段 SAM3 视觉语言特征自监督,实现无需人工标注的秒级前馈几何重建与高一致性开放词表 3D 语义分割。
方法详解¶
整体框架¶
SkySplat-OV 接收 \(N\) 张稀疏卫星观测图像 \(\{I_i\}_{i=1}^N\) 及其对应的 RPC 有理多项式相机参数,整体处理流程分为四个核心阶段:多视角特征提取与基于 RPC 的几何初测、几何-辐射-语义多模态特征融合(GRS-Fusion)与高斯参数预测、基于视觉基础模型(VFM)对齐的多模态自监督训练,以及最终利用冻结的 SAM3 解码器实现的开放词表 3D 场景理解。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["稀疏卫星图像与 RPC 参数输入"] --> B["基于 RPC 的几何重建<br/>极线代价体构建与高度回归"]
B --> C["几何-辐射-语义融合 (GRS-Fusion)<br/>U-Net 多模态特征聚合与高斯参数预测"]
C --> D["单阶段 SAM3 蒸馏与自监督对齐<br/>RGB重建 + SAM3特征蒸馏 + DA3相对高度"]
D --> E["开放词表场景理解<br/>注入 SAM3 FPN 与解码器输出 3D DSM 语义"]
在推理阶段,网络通过单次前向传播直接推断出场景中全部高斯的几何、辐射和语言参数,将渲染的 3D 紧凑语义嵌入直接替换掉 SAM3 的图像编码器输出,输入至 SAM3 的特征金字塔网络(FPN)与交叉注意力解码器中,在文本提示词驱动下高效输出高保真跨视角一致的语义掩膜与数字表面模型(DSM)级三维语义图。
关键设计¶
1. 基于 RPC 模型的几何重建:推扫式成像下的代价体构建与高度回归
针对推扫式卫星成像无法直接使用标准对极几何(epipolar geometry)进行极线搜索的根本难题,系统显式利用有理多项式模型(RPC)在物方三维网格空间与像方像素坐标系之间建立严格的双向坐标变换。在通过轻量级 CNN 提取浅层特征并经由多视角 Transformer 进行跨视角注意力增强得到深层特征 \(\{F_i\}_{i=1}^N\) 后,算法针对参考视角特征图上的每个像素 \((u_i, v_i)\),在预设的高程范围等间距采集 \(M\) 个候选高度 \(\{h_m\}_{m=1}^M\)(默认 64 层),利用 RPC 投影变换严格反解出物方经纬度并重投影到源视图特征图 \(F_j\) 上的相应坐标: $$ (u_j^{h_m}, v_j^{h_m}) = \mathrm{RPC_Proj}(u_i, v_i, h_m) $$ 通过双线性插值采样源视图在该坐标下的特征向量,并与参考视角特征沿通道拼接构建出初始代价体。经由 3D 卷积沿高程维度进行正则化,得到高程维度的代价分布体 \(C_i\) 与归一化概率分布体 \(P_i\)。最后,通过沿高程维度的期望加权求和,端到端回归出高精度的连续初始高度图 \(H_i = \sum_{m=1}^M h_m P_i(h_m)\)。该高度图经由 RPC 反投影直接转换为三维物理坐标空间,为后续 3D 高斯的中心位置 \(\mu_m\) 提供高质量的绝对空间初始化。
2. 几何-辐射-语义融合(GRS-Fusion):稀疏约束下高斯参数的联合规整
针对仅有两到三张稀疏观测图像时空间几何约束严重不足、极易导致高斯球形态退化的问题,设计了 GRS-Fusion 模块作为统一的多模态特征枢纽。该模块并非独立推断各参数,而是系统性地整合了三类异构信息:几何几何信息(RPC 代价体特征 \(C_i\)、回归的高程图 \(H_i\)、由概率体峰值提取的匹配置信度图)、辐射度外观信息(多视角原始图像 \(I_i\)),以及语义表征信息(冻结 SAM3 提取的视觉语言特征 \(F_i^{\text{sam}}\) 以及 CNN/Transformer 拼接的多尺度多视角特征)。
这三组多模态特征在通道维度拼接后,输入轻量级 2D U-Net 进行交互式多模态特征重整与去噪,输出紧凑而信息密实的融合特征图 \(F_i^{\text{grs}} \in \mathbb{R}^{\frac{H}{s} \times \frac{W}{s} \times C_{\text{grs}}}\)。在预测各高斯参数时,采用分工明确的轻量预测头: - 语义参数预测头:将融合特征 \(F_i^{\text{grs}}\) 与上游特征送入卷积头,并显式引入 SAM3 原始语言特征 \(F_i^{\text{sam}}\) 的残差跳跃连接,稳定输出每个高斯的语言嵌入向量 \(f_m\); - 几何与外观预测头:融合特征与辐射信息拼接,由回归头估计用于构成协方差矩阵的高斯缩放系数 \(s_m\)、以四元数表示的旋转矩阵 \(R(\theta_m)\),以及高斯球颜色 \(C_m\); - 不透明度预测头:融合特征与几何置信度特征拼接,经轻量卷积输出不透明度系数 \(\alpha_m\)。多模态在统一表征下紧密耦合,极大抑制了稀疏视角下的悬浮漂移高斯伪影。
3. 单阶段 SAM3 蒸馏与单目相对高程自监督:大尺度跨模态表征对齐
针对传统开放词表 3DGS 往往需要繁琐的多阶段分层蒸馏才能应对复杂尺度的困局,本文引入单阶段端到端蒸馏机制,直接将遥感大模型基础能力植入 3D 高斯场。在渲染过程中,利用高斯泼溅光栅化(在局部视锥中将 RPC 视线切线近似为局部等效针孔相机),以相同的不透明度累积权重同时光栅化渲染出视点颜色图像 \(I^{\text{render}}\) 与 3D 语言特征图 \(F^{\text{render}}\): $$ I^{\text{render}} = \sum_{m=1}^M C_m \alpha_m \prod_{n=1}^{m-1}(1 - \alpha_n), \quad F^{\text{render}} = \sum_{m=1}^M f_m \alpha_m \prod_{n=1}^{m-1}(1 - \alpha_n) $$ 为了在完全无需标注的条件下完成高质量训练,框架构建了三位一体的自监督学习策略: 1. 辐射度与外观自监督:结合像素级均方误差(MSE)与感知损失(LPIPS),即 \(\mathcal{L}_{\text{rgb}} = \mathrm{MSE}(I^{\text{gt}}, I^{\text{render}}) + \mathrm{LPIPS}(I^{\text{gt}}, I^{\text{render}})\); 2. 语言特征空间蒸馏:渲染得到的特征图经过双层 MLP 投影头预测对齐的语言特征 \(\hat{F}^{\text{lang}}\),并通过余弦距离与 MSE 联合拉近其与冻结 SAM3 对应特征的分布:\(\mathcal{L}_{\text{lang}} = \mathrm{MSE}(F^{\text{lang}}, \hat{F}^{\text{lang}}) + (1 - \cos(F^{\text{lang}}, \hat{F}^{\text{lang}}))\); 3. 几何相对高度一致性监督:利用单目深度视觉大模型 Depth Anything v3(DA3)零样本推断出参考图的相对高程图 \(hei\),针对重建高程可能存在的全局尺度偏差,采用尺度与偏移不敏感的皮尔逊相关系数损失(Pearson Correlation Loss)进行几何约束: $$ \mathcal{L}_{\mathrm{hei}} = \frac{\mathrm{Cov}(hei, H_i)}{\sqrt{\mathrm{Var}(hei)\mathrm{Var}(H_i)}} $$ 总自监督损失函数联合三个分量进行端到端优化:\(\mathcal{L} = \mathcal{L}_{\mathrm{rgb}} + \mathcal{L}_{\mathrm{lang}} + \mathcal{L}_{\mathrm{hei}}\)。该设计在完全无需人工语义标注的前提下,将三维几何真实感、视觉观感与开放词表语义概念在单个 3D 高斯场中彻底拉齐。
损失函数 / 训练策略¶
模型采用完全自监督端到端训练,总优化目标为 \(\mathcal{L} = \mathcal{L}_{\mathrm{rgb}} + \mathcal{L}_{\mathrm{lang}} + \mathcal{L}_{\mathrm{hei}}\)。使用 AdamW 优化器,基础学习率设为 \(2 \times 10^{-4}\)。在构建代价体时,高程候选层数固定采样 64 层。训练全程在 8 张配备 24GB 显存的 NVIDIA GeForce RTX 4090 GPU 上进行,整个训练过程无需任何人工 3D 点云、DSM 真值或像素级语义真值介入。
实验关键数据¶
主实验¶
在两个广受认可的公开遥感三维基准 DFC19 与 SpaceNet4 上,对新视角合成图像质量(PSNR、SSIM、LPIPS)以及开放词表新视角语义分割能力(mF1、mIoU)进行严格评估。对比基线涵盖两类最先进方案:先通过 SOTA 遥感 3DGS(HiSplat)合成新视角再应用 2D 开放词表大模型(ProxyCLIP、Trident、SegEarth-OV)进行推断的复合管线,以及通用型 3D 视觉语言辐射场模型(LSM 与 Uni3R)。
| 数据集 | 方法类别 | 评估方法 | mF1 (%) ↑ | mIoU (%) ↑ | PSNR (dB) ↑ | SSIM ↑ | LPIPS ↓ |
|---|---|---|---|---|---|---|---|
| DFC19 | 2D OV 级联方案 | ProxyCLIP (HiSplat渲染) | 29.12 | 20.07 | 16.88 | 0.381 | 0.564 |
| 2D OV 级联方案 | Trident (HiSplat渲染) | 29.93 | 20.79 | 16.88 | 0.381 | 0.564 | |
| 2D OV 级联方案 | SegEarth-OV (HiSplat渲染) | 31.80 | 22.37 | 16.88 | 0.381 | 0.564 | |
| 通用 3D 方案 | LSM-2V | 31.42 | 19.95 | 15.71 | 0.402 | 0.603 | |
| 通用 3D 方案 | LSM-3V | 32.19 | 20.58 | 16.52 | 0.431 | 0.600 | |
| 通用 3D 方案 | Uni3R | 34.18 | 22.20 | 16.56 | 0.450 | 0.604 | |
| 本文方法 | SkySplat-OV | 62.42 | 48.12 | 17.63 | 0.531 | 0.443 | |
| SpaceNet4 | 2D OV 级联方案 | ProxyCLIP (HiSplat渲染) | 53.07 | 37.64 | 16.46 | 0.321 | 0.488 |
| 2D OV 级联方案 | Trident (HiSplat渲染) | 47.86 | 34.08 | 16.46 | 0.321 | 0.488 | |
| 2D OV 级联方案 | SegEarth-OV (HiSplat渲染) | 53.66 | 38.11 | 16.46 | 0.321 | 0.488 | |
| 通用 3D 方案 | LSM-2V | 46.76 | 31.22 | 17.05 | 0.257 | 0.655 | |
| 通用 3D 方案 | Uni3R | 43.08 | 28.58 | 16.54 | 0.258 | 0.654 | |
| 本文方法 | SkySplat-OV | 67.40 | 51.02 | 18.49 | 0.377 | 0.400 |
在跨数据集零样本泛化测试中,将仅在北美城市(DFC19 或 SpaceNet4)训练的模型直接在南美洲阿根廷圣费尔南多(MVS3D 数据集)上进行测试:在 DFC19 \(\to\) MVS3D 迁移中,SkySplat-OV 的几何重建 MAE 降至 4.28m(HiSplat 为 18.01m,LSM 为 11.37m),mIoU 达到 43.22%(最强基线仅 36.17%);在 SpaceNet4 \(\to\) MVS3D 迁移中,MAE 达到 4.37m,mIoU 达到 45.26%,展现了极强的跨地域地理泛化能力。
消融实验¶
在 DFC19 数据集上针对 GRS-Fusion 融合模块、单目相对高程监督(R.H.S.)以及单阶段特征蒸馏(F.D.)展开剥离消融:
| GRS-Fusion 模块 | 相对高程监督 (R.H.S.) | 特征蒸馏 (F.D.) | mF1 (%) ↑ | mIoU (%) ↑ | PSNR (dB) ↑ | SSIM ↑ |
|---|---|---|---|---|---|---|
| ✗ | ✗ | ✗ | — | — | 15.90 | 0.425 |
| ✗ | ✗ | ✓ | 50.20 | 37.28 | 15.68 | 0.420 |
| ✓ | ✗ | ✓ | 57.31 | 43.12 | 17.64 | 0.496 |
| ✗ | ✓ | ✓ | 60.65 | 46.38 | 17.23 | 0.526 |
| ✓ | ✓ | ✓ | 62.42 | 48.12 | 17.63 | 0.531 |
进一步对比特征蒸馏范式:若仅通过纯几何模型(如 SkySplat)合成新视角再后验接入 SAM3(SkySplat + SAM3),mIoU 仅为 22.44%;而 SkySplat-OV 将 SAM3 特征内化进 3D 语言场后,mIoU 飙升至 48.12%(提升超过 25.68 个百分点),同时渲染 PSNR 也由 17.53 dB 提升至 17.63 dB。
关键发现¶
- GRS-Fusion 奠定表征融合基础:消融表明,在引入特征蒸馏的基础配置下加入 GRS-Fusion,mIoU 从 37.28% 激增至 43.12%(+5.84%),PSNR 大幅跃升近 2.0 dB,充分证明多模态紧耦合对于稀疏视角下克服高斯参数几何畸变至关重要。
- 单目相对高程监督有效弥补稀疏约束不足:DA3 相对高程监督使模型在无绝对高程标签的情况下获得强烈的局部几何平滑先验,在加入 R.H.S. 后,mIoU 显著上涨至 48.12%,跨数据集测试中的高程 MAE 大幅下降超 70%。
- 对单场景优化范式实现压倒性提速:在 8 个典型感兴趣区域(AOI)的评测中,针对每个场景,S-NeRF 与 Sat-NeRF 需要 6-7 小时,Feature-3DGS 需要 3.82 小时,LangSplatV2 需要 2.92 小时。SkySplat-OV 采用单次前馈预测,单场景仅需 9.82 秒,实现了相比 LangSplatV2 约 1070 倍的推理加速,且平均 MAE 从最优基线的 4.68m 降至 2.77m,全场景平均 mIoU 从 22.71% 提升至 42.15%。
亮点与洞察¶
- RPC 严密模型的端到端语言 3DGS 嵌入:巧妙避开了传统计算机视觉方法强行将遥感图像假定为针孔相机所引入的系统几何畸变,将严密有理多项式投影直接贯穿到极线特征体构建与高斯初始化中,打通了遥感测绘物理模型与前沿隐式辐射场的壁垒。
- 单阶段轻量蒸馏实现视点一致性飞跃:将 SAM3 特征直接作为 3D 高斯可渲染属性进行端到端光栅化投影,彻底规避了逐帧 2D 独立推断所带来的跨视角闪烁与遮挡不一致问题,让 3D 高斯场天然成为跨视角统一的多模态语义载体。
- 基础模型跨界自监督的极佳实践:在缺乏真实三维遥感标签的严苛条件下,巧妙组合了单目几何大模型(DA3)的相对高程相关性与视觉语言大模型(SAM3)的语义先验,构建了兼顾几何精细度与语义丰富度的自闭环监督体系。
局限与展望¶
- 依赖 SAM3 语义边界对长尾地物泛化受限:开放词表语义质量高度绑定预训练 SAM3 的判别力,在面对遥感图像中特有的微小人造设施、高度模糊的地表阴影或特定军工民用混淆目标时,易产生误分割。
- 极度镜面高反与水体高程预测存在伪影:代价体匹配依赖局部纹理一致性,在强镜面反射的高光建筑屋顶或大面积无纹理平静水面区域,代价体高程置信度下降,容易导致局部高斯分布散乱。
- 未来方向:探索引入更高分辨率的时序遥感多模态大模型,并在高程回归中融合更严密的阴影形状恢复(Shape from Shading)先验,进一步攻克复杂城市密集阴影下的极精细重建难题。
相关工作与启发¶
- vs LSM / Uni3R: LSM 和 Uni3R 是针孔相机透视模型下的通用三维表征器,直接套用到大尺度推扫式卫星影像上会导致明显的几何变形与投影漂移。SkySplat-OV 显式嵌入 RPC 有理多项式相机模型,并在针孔消融对照实验中依然保持绝对领先,验证了专用多模态融合结构的优越性。
- vs LangSplatV2 / Feature-3DGS: 这类场景优化方法在单场景下利用多视角微调拟合语言场,训练耗时长达数小时且极度依赖密集视角。SkySplat-OV 通过前馈网络一次前向预测实现 1070 倍的推理加速,彻底摆脱了测试时繁重的梯度反向传播。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次将严密卫星推扫式 RPC 几何模型与通用语言 3DGS 结合,创新设计 GRS-Fusion 模块与单阶段端到端自监督范式。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 DFC19、SpaceNet4、MVS3D 等三大主流公开基准,跨越 8 个 AOI,完整包含主实验、跨数据集泛化、单场景优化对比与模块剥离消融。
- 写作质量: ⭐⭐⭐⭐⭐ 论证脉络条理清晰,公式符号严谨规范,图表详实且实验分析深入透彻。
- 价值: ⭐⭐⭐⭐⭐ 为超大范围空天遥感测绘与地理开放空间智能理解提供了高精度、秒级响应的极具实用价值的全新技术范式。