跳转至

Pixel-wise Geo-registration of Drone and Satellite Images

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/dshatwell23/skyreg-dataset
领域: 自动驾驶
关键词: 跨视角地理配准, 无人机影像, 卫星遥感, 前馈3D重建, 稠密地理定位

一句话总结

针对传统无人机-卫星跨视角定位局限于图像级相机中心估计且平面单应性难以应对大视差高程畸变的问题,本文提出基于前馈三维重建架构的几何感知配准模型 SkyReg 与首个像素级高精度地理基准 SkyReg-Bench,实现了鲁棒的高精度逐像素 GPS 坐标推算。

研究背景与动机

跨视角地理定位在无人机巡检、智慧城市规划、灾害应急评估及国防空间地理分析中具有极其关键的应用价值。然而,长久以来该领域主流研究范式主要受限于图像检索(从海量卫星影像库中检索最匹配瓦片)或 3-DoF 相机位姿回归(预测无人机相机在卫星图上的二维中心坐标与朝向)。这两类图像级定位范式本质上都将问题严重简化为单纯的相机中心估计。在现实无人机作业中,无人机通常处于倾斜视线与复杂立体城区之中,相机中心坐标发生微小的几米误差,映射到远处高大建筑、倾斜地表或动态目标上就会被放大为数十米乃至上百米的地理形变与投影漂移;真正迫切需要的是获取画面中每个可见像素点所对应的真实世界精确经纬度与物理三维位置。

另一方面,传统遥感测绘中的地理配准算法高度依赖于平面单应性假设或基于数字高程模型(DEM)的模板迭代匹配,往往仅能处理视差较小的同航天器平台或近正射影像。当面对极低空倾斜透视投影的无人机画面与近正射高空卫星图时,由于视角悬殊、透视缩放巨大、严重几何视差、遮挡以及两类模态在辐射测度上的非线性差异,经典的单应性变换(如基于 SuperPoint+SuperGlue 或 RoMa 预测单应矩阵)会出现严重的拓扑拉伸、剪切失真甚至配准完全崩溃;现有的基于多视角神经渲染的配准流程又必须依赖昂贵的多视点序列输入,无法满足单张无人机画面的实时对齐需求。加之业内长期缺乏具有稠密经纬度真值标注、三维深度与相机参数的大规模基准数据集,跨视角像素级配准的研究举步维艰。

本文的切入角度是打破二维像素特征匹配与单应性拟合的束缚,将基于前馈神经网络的稠密三维几何重建能力引入单图跨视角地理对齐中。核心 idea:利用前馈三维重建模型显式重构无人机与卫星视角的共享三维点云与相机参数,通过可微几何反投影构建跨视角三维翘曲映射,将无人机像素直接投影至已知大地参考系的卫星平面并双线性插值获得逐像素 GPS 坐标。

方法详解

整体框架

SkyReg 的推理管线主要包含两个紧密串联的阶段:前馈三维场景重构与像素级几何翘曲配准。系统输入包含两幅图像:一幅是在地心固定坐标系(ECEF)与 WGS-84 椭球体中具备精确相机内外参及地理参考系(或 DEM 高程)的正射/透视卫星参考影像 \(I_r\),以及一幅低空大倾角、完全没有任何先验位姿元数据的未标定无人机查询图像 \(I_q\)。首先,模型通过基于 Transformer 的前馈几何骨干网络(MASt3R)进行多视角特征交互与前向几何预测,联合预测出两幅图像在各自相机局部系下的三维点云分布、相机焦距与相对外参矩阵,并将无人机查询点云统一转换到参考影像的相机坐标系下;随后,算法调用参考图像的几何投影模型将三维点云重投影至参考视图网格,计算出高精度的空间翘曲函数,最终通过查找参考图像的全局经纬度椭球映射矩阵,完成无人机画面的逐像素 GPS 赋值或正射镶嵌拼接。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入数据对<br/>透视无人机图 + 地理参考卫星图"] --> B["前馈三维重建与位姿解算<br/>预测密集点云与相对几何变换"]
    B --> C["跨视角几何翘曲与空间重投影<br/>三维点云投影至参考图空间"]
    C --> D["逐像素 GPS 坐标推算与正射镶嵌<br/>WGS-84 经纬度映射与图层拼接"]

关键设计

1. 前馈三维重建与位姿解算:摆脱传统多视角匹配与二维平面假定的几何提升 传统单应性方法试图在无人机视角的透视图与卫星正射图之间直接寻找二维单应矩阵,但在建筑高程起伏与大视差场景下数学上不成立。SkyReg 采用前馈三维重建网络 MASt3R 作为几何推理主干,接收两幅图像对进行端到端特征匹配与三维空间提升。在单次前向过程中,网络输出两幅视图在参考系下的三维点云预测 \(X^{q,r} \in \mathbb{R}^{H \times W \times 3}\) 以及对应的置信度掩码。针对未标定的无人机相机,模型通过极小化重投影残差求解焦距 \(f_q^*\),并基于 Procrustes 算法求解无人机到卫星坐标系的旋转、平移和绝对尺度因子变换 \(\hat{P}^{q \to r}\): $$ \hat{P}^{q \to r} = \arg\min_{P} \sum_{\mathbf{x}_q} \left| h^{-1}(P \, h(X^{q,q}(\mathbf{x}_q))) - X^{q,r}(\mathbf{x}_q) \right| $$ 该设计将极端视角变换下的对应点搜索问题,提升为在三维欧氏空间内对物理几何结构的显式推断,从根本上消除了二维特征匹配在高空正射与低空透视之间因透视收缩导致的特征退化问题。

2. 跨视角几何翘曲与空间重投影:基于非平面三维投影的精确坐标映射 获得处于卫星参考相机坐标系下的无人机稠密三维点云 \(X^{q,r}(\mathbf{x}_q)\) 之后,SkyReg 无需借助外部 DEM 高程数据辅助迭代,而是直接利用参考视图的内参矩阵 \(K_r\) 实现闭式空间重投影: $$ \mathbf{x}'_q = \mathrm{warp}(\mathbf{x}_q) = h^{-1}(K_r X^{q,r}(\mathbf{x}_q)) $$ 该翘曲函数不仅建立了无人机像素与卫星像素之间精确的亚像素几何对应,更天然蕴含了无人机视锥体内不同高程障碍物、建筑外立面与地表平面的三维视差偏移。相比传统仿射或单应性变换强行拉平建筑物引起的剧烈畸变,基于三维重投影的翘曲函数在深度突变边缘表现出高度的结构保真度与抗遮挡鲁棒性。

3. 逐像素 GPS 坐标推算与正射镶嵌:向 WGS-84 地球椭球基准的大地测量统一 在将无人机每个像素成功重投影至参考卫星图像坐标 \(\mathbf{x}'_q\) 后,模型利用已标定的卫星参考图像与其关联的 WGS-84 椭球体空间变换函数 \(\mathcal{E}(\cdot)\),将参考平面网格上的连续像素坐标直接映射为三维地心地固坐标(ECEF)或地球经纬度 \((\phi, \lambda)\): $$ \mathbf{X}_{\mathrm{WGS84}} = \mathcal{E}(\mathrm{warp}(\mathbf{x}_q)) = \mathcal{E}\left(h^{-1}(K_r X^{q,r}(\mathbf{x}_q))\right) $$ 由于整个计算过程针对图像内的全部有效像素点并行计算,模型不仅能够输出稠密的整图经纬度坐标张量,还能将无人机 RGB 辐射纹理无缝反向重采样到卫星高精度底图上,实时生成无视差接缝的正射融合正射影像图(Mosaic),为后续目标级绝对坐标量测与动态变化检测提供底层支持。

损失函数 / 训练策略

SkyReg 采用置信度加权的三维点云回归损失函数对网络进行联合优化。对于视图 \(v\) 内的有效监督像素点 \(i \in \mathcal{D}^v\),回归损失度量归一化尺度后的预测三维点与真实几何点之间的欧氏距离,同时引入正则化项防止置信度坍缩: $$ \mathcal{L}{\mathrm{conf}} = \sum $$ 模型使用 AdamW 优化器,基础学习率设为 } \sum_{i \in \mathcal{D}^v} C_i^{v,1} \left| \frac{1}{z} X_i^{v,1} - \frac{1}{z} \bar{X}_i^{\bar{v},1} \right| - \alpha C_i^{v,1\(1 \times 10^{-4}\),权重衰减 0.05,批大小为 48 对图像。在 SkyReg-Train 上训练 20 个 epoch。为了保证模型兼备跨视角泛化能力并防止几何先验遗忘,每个训练 epoch 采用严格的多源混合采样:20k 对来自真实城市场景(Seattle 与 San Francisco 的 LiDAR 数据)、20k 对来自跨视角地标场景(Landmarks),以及 20k 对来自经典稠密三维数据集(ScanNet++、ARKitScenes 与 CO3D)。

实验关键数据

主实验

论文在 SkyReg-Bench 两个全新的未见分布测试集(包含芝加哥 13,191 组无人机测试图的 Urban 城区子集,以及包含 5 个非结构化/灾害场景 950 组无人机测试图的 Suburban 郊区子集)上开展了全面的像素级地理配准评测。对比基线涵盖经典的稀疏与稠密特征匹配与单应性估计方法(SuperPoint+SuperGlue、RoMa、RoMa Dense)。评价指标包含平均大地测量误差(Geodetic Error, GE,单位:米)以及在阈值 \(\tau \in \{20, 30, 40, 50\}\text{m}\) 下的配准召回率 Recall@\(\tau\)(%)。

数据集 方法 GE (m) ↓ Recall@20m (%) ↑ Recall@30m (%) ↑ Recall@40m (%) ↑ Recall@50m (%) ↑
Urban (CHI) SP+SG 209.40 1.40 1.94 2.34 2.82
Urban (CHI) RoMa 133.06 25.69 27.18 28.35 29.33
Urban (CHI) RoMa Dense 131.45 17.62 20.08 22.43 24.72
Urban (CHI) SkyReg (本文) 44.88 78.78 80.03 80.53 80.94
Suburban SP+SG 223.69 36.42 37.15 37.47 37.47
Suburban RoMa 112.10 60.00 61.26 62.25 63.15
Suburban RoMa Dense 111.25 51.89 52.52 53.57 54.42
Suburban SkyReg (本文) 21.34 74.94 93.57 97.78 98.52

除了像素级配准指标,论文进一步对比了图像级中值定位性能(Median-GPS Geo-localization),引入了经典的跨视角检索方法 TransGeo、University-1652 与迭代配准方法 EarthMatch。在 Urban 场景下,SkyReg 的定位中值误差仅为 36.40 m,远超 RoMa 的 104.70 m 与 TransGeo 的 160.98 m;在 Suburban 场景下,SkyReg 达到 21.45 m 的超高精度,Recall@50m 达到 95.27%。

消融实验

论文针对训练数据集的来源组合进行了细致的消融分析,分别测试了仅采用地标数据、仅采用城市场景数据以及多源联合训练在未见测试集上的中值定位泛化表现。

训练集配置 Urban GE (m) ↓ Urban R@20m (%) ↑ Urban R@50m (%) ↑ Suburban GE (m) ↓ Suburban R@20m (%) ↑ Suburban R@50m (%) ↑ 说明
仅 Landmark 子集 + 3D 数据 48.70 59.89 73.18 27.23 73.66 91.40 视点变化泛化较好但绝对误差较高
仅 Urban 子集 + 3D 数据 50.38 58.47 69.37 24.79 72.30 93.07 规则城区拟合较好但在复杂结构泛化偏弱
Landmark + Urban 联合训练 (Full) 36.40 66.72 81.57 21.45 75.32 95.27 多源互补显著降低跨域配准误差

关键发现

  • 相比最具竞争力的稠密特征匹配基准 RoMa,SkyReg 在 Urban 和 Suburban 未见测试场景下的像素级平均测量误差分别降低了 88.18 m 与 90.76 m,证明单应性平面对齐模型在大倾角和高视差场景下具有根本性缺陷。
  • Urban 城区的高层建筑物引起极剧烈的局部视差跳变,导致依赖平面单应性的算法出现大面积失真与发散(SP+SG 召回率低于 3%),而 3D 几何建模方案展现出超过 80% 的高稳定性。
  • 数据集消融实验表明,结合固定高度正射采样的 Urban 数据与具有随机广阔姿态采样的 Landmark 视角数据,能使前馈网络同时兼顾尺度先验与视点几何鲁棒性,相比单源数据误差降低超过 12-14 米。

亮点与洞察

  • 从相机中心回归到稠密三维几何对齐的范式重塑:传统定位只估计 3-DoF 相机位姿,本文首次通过前馈 3D 重建打通了单张未标定无人机视角到卫星图的大尺度非平面三维翘曲通道,真正实现了结构尺度的地理对齐。
  • 高质量物理基准数据集与完备标注:SkyReg-Train 与 SkyReg-Bench 创新性地融合了大规模空中激光雷达(USGS 3DEP)稠密网格三角化光线追踪,以及 Google Earth Studio 几何渲染,填补了遥感跨视角像素级真值基准的长期空白。
  • 可复用的通用三维与大地坐标系桥接机制:将视觉网络预测的相对相机系点云与 WGS-84 地球椭球闭式变换有机耦合,不仅可用于无人机侦察制导,还可直接迁移至航天遥感、车载倾斜相机与卫星底图的混合配准。

局限与展望

  • 极端光照与季节时相差异的依赖:当前训练数据多基于清晰晴天的三维点云与卫片渲染,面对恶劣天气、重度阴影或大范围季节植被变化时,前馈点云预测网络的稳定性仍有待验证。
  • 高动态移动物体的几何混淆:模型将场景假定为静态刚体,对于高架路上的快速车流或水体表面,点云预测可能会产生虚假高程突起,影响局部坐标插值的精度。
  • 端到端联合优化的拓展空间:目前几何重建与大地坐标查找是前后两阶段串联执行,未来可探索将大地物理约束(如重力方向垂直性、地表水平连续性)作为显式先验嵌入点云估计的主干网络中。

相关工作与启发

  • vs TransGeo & University-1652 等跨视角检索方法:此类方法仅输出粗粒度的瓦片级或图像级相机中心候选,无法感知无人机画面内的建筑几何与目标空间分布;SkyReg 实现了精细到每个像素的物理坐标解算。
  • vs SuperPoint+SuperGlue & RoMa 等特征匹配算法:传统方法试图基于特征匹配求解全局单应性矩阵(Homography),在起伏地形和垂直建筑立面下必然出现严重形变;SkyReg 显式恢复三维深度与空间位姿,能够精准还原视差遮挡。
  • vs 多视点神经渲染(如 NeRF/3DGS)配准方案:多视点方案往往需要无人机在目标区域环绕拍摄多张序列并消耗大量离线优化时间;SkyReg 基于前馈网络仅凭单张无人机画面即可在几百毫秒内完成几何解算。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次提出面向无人机-卫星图像跨视角像素级地理配准的显式三维几何前馈框架。
  • 实验充分度: ⭐⭐⭐⭐⭐ 构建了多城市激光雷达与地标综合基准,提供了完备的像素级指标、中值定位及消融分析。
  • 写作质量: ⭐⭐⭐⭐⭐ 问题切入精准,数学推导严谨,图表表达清晰,逻辑推演层层递进。
  • 价值: ⭐⭐⭐⭐⭐ 彻底打破了跨视角定位停留在图像级的瓶颈,对低空经济、无人机自主导航与灾害应急评估具有极高的实用价值。