Sector-Level Cross-View Geo-Localization with Implicit Orientation via Azimuthal Scanning¶
会议: ECCV 2026
论文: ECCV 原文
项目主页: https://1203ll.github.io/SectorGeo/
领域: 遥感与跨视角 / 图像检索
关键词: 跨视角地理定位、有限视场角、方位角扫描、扇区级匹配、隐式朝向估计
一句话总结¶
针对有限视场角地面视角与全向航拍视角间的几何与视场不匹配问题,本文提出扇区级跨视角地理定位(SLCVGL)新任务与 SectorGeo 框架,通过方位角扫描将航拍特征解耦为重叠扇区,以离散扇区检索实现精细子区域定位并隐式估计相机朝向,无需显式位姿标签回归。
研究背景与动机¶
跨视角地理定位(Cross-View Geo-Localization, CVGL)是 GPS 拒止或扰动环境下无人机自主导航、移动机器人精确定位与增强现实的核心技术。然而,地面图像与卫星/航拍图像之间存在剧烈的视角差异,主要表现为极端的几何形变、透视畸变与视觉表观不一致。现有的研究路线大致可划分为三大流派:基于全局特征检索的图像级地理定位、显式回归相机经纬度与旋转角的跨视角位姿估计,以及依赖目标边界框检测或分割的目标级定位。
然而,现有任务形态陷入了“粗粒度检索精度不足”与“细粒度定位代价过高”的两难困境。图像级定位(如 Sample4Geo、PLGeo)虽然在大规模检索中效率出众,但将整个航拍大图视为单一实体,无法告知地面相机处于航拍图的何处以及朝向何方;位姿估计算法则将问题建模为连续参数回归,受限于严格的两两匹配形式,在跨域大视差下优化极易震荡甚至发散;目标级定位又依赖极其昂贵的人工边界框或像素掩膜标注,无法在海量卫星数据中铺开。
回归物理本质,有限视场角(Limited Field-of-View, FoV)的地面相机仅能观察到局部水平方向,其在全向鸟瞰图上的投影天然对应于一个以相机为顶点向外辐射的楔形扇区(Wedge-shaped Sector),而扇区的张角正是相机的水平视场角,扇区所指的方位角即对应相机的物理朝向。核心 idea:将跨视角细粒度定位重构为扇区级跨视角地理定位(SLCVGL),利用方位角扫描将航拍特征切分为多个重叠扇区候选,通过离散扇区匹配同时显式锁定航拍图中的精细子区域并隐式解算地面相机朝向,在规避昂贵连续位姿回归的同时消解未观测区域的背景噪声。
方法详解¶
整体框架¶
SectorGeo 的核心思想是建立地面有限视场与空中全向特征之间的几何包含匹配关系。整个框架采用参数共享的双分支 ConvNeXt-Base 骨干网络:地面分支提取全局语义特征向量 \(\mathbf{f}^q \in \mathbb{R}^C\);航拍分支则保留空间特征图 \(\mathbf{F}^a \in \mathbb{R}^{C \times H \times W}\),并通过以图像几何中心为原点的旋转扇区掩膜,将特征图解耦为一组具有特定视场角和步长的方位角扇区特征序列 \(\mathbf{V}^a = \{\mathbf{v}_p\}_{p=1}^P\)。
在特征匹配阶段,网络由两条互补的分支并行处理:方位角对齐流(Azimuthal Alignment Stream, AAS)直接计算地面特征与各候选扇区的余弦相似度响应,作为轻量级几何先验确定最优扇区索引 \(p^*\);关系检索流(Relational Retrieval Stream, RRS)则通过方位角上下文聚合(ACA)调制地面线索,并利用跨扇区关系推理(CSRR)在全向图拓扑中建模扇区间的全局上下文一致性,计算出图像级检索得分 \(S_{ret}\)。推理时,模型先基于 \(S_{ret}\) 快速检索出 Top-\(K\) 候选航拍参考图,再由 AAS 直接在最优航拍图上定位最佳扇区并读出离散朝向角 \(\hat{\theta}\)。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入:地面查询图 Iq (FoV=ϕ)<br/>与航拍参考图 Ia (全向)"] --> B["双分支特征提取<br/>共享参数 ConvNeXt-Base"]
B --> C["方位角特征解耦<br/>旋转扇区掩膜与掩膜平均池化"]
C --> D["方位角上下文聚合<br/>方向自适应重构地面语义"]
D --> E["跨扇区关系推理<br/>自注意力图网络建模全局一致性"]
C --> F["方位角对齐流<br/>余弦相似度几何锚定最优扇区"]
E --> G["关系检索流输出<br/>图像级全局相似度得分 Sret"]
F --> H["扇区精定位与隐式朝向输出<br/>最优扇区 p* 与估计朝向 θ"]
G --> I["Coarse-to-Fine 联合推断"]
H --> I
关键设计¶
1. 方位角特征解耦:将连续鸟瞰空间离散化为方向感知特征序列
全向航拍图像包含了 360° 周围环境,而有限 FoV 地面图像仅覆盖其中一个局部锥形视锥。若直接将两者提取为单一全局向量进行度量,未被地面相机观测到的大面积天空与背景区域必将成为干扰噪声。为此,本文设计了基于旋转掩膜的特征解耦机制:根据查询视场角 \(\phi\) 和采样步长 \(\Delta\theta\)(满足候选数 \(P = \lfloor 360^\circ / \Delta\theta \rfloor\)),在航拍特征图尺寸 \(H \times W\) 上构造一组重叠的二值扇区掩膜 \(\{\mathbf{M}_p\}_{p=1}^P\)。通过对空间位置 \((h, w)\) 实施掩膜平均池化与 \(L_2\) 归一化,得到方向候选序列 \(\mathbf{V}^a = \{\mathbf{v}_p\}_{p=1}^P\): $\(\mathbf{v}_p = \left\| \frac{\sum_{h=1}^H \sum_{w=1}^W \mathbf{F}^a(h,w) \mathbf{M}_p(h,w)}{\sum_{h=1}^H \sum_{w=1}^W \mathbf{M}_p(h,w) + \epsilon} \right\|_2\)$ 这一步按有效像素面积归一化,既消除了由于边界截断导致的尺度不平衡,又将航拍空间特征转化为一组结构化对应于离散地理方位的特征序列。
2. 方位角上下文聚合与跨扇区关系推理:抑制单扇区局部歧义与假阳性
在关系检索流中,若孤立地比较地面特征与单个扇区,常会由于不同街区局部建筑或树木表观相似而诱发严重误配。为了解决视点不对称性并聚合全景上下文,模块分两步执行:首先,方位角上下文聚合(ACA)计算地面向量与各个航拍扇区的亲和度向量 \(\mathbf{A} = \text{LeakyReLU}(\mathbf{V}^a \mathbf{f}^q)\),经归一化与平滑 Softmax 得到权重,与地面特征加权外积重构出方向特定上下文 \(\mathbf{C}_g = \text{Softmax}(\mathbf{A} / \|\mathbf{A}\|_2) (\mathbf{f}^q)^\top\);随后,跨扇区关系推理(CSRR)将初值 \(\mathbf{E}_0 = (\mathbf{C}_g \odot \mathbf{V}^a)\mathbf{W}_t\) 中的每个扇区特征作为图节点,利用 \(T\) 层动态自注意力层更新各节点状态: $\(\mathbf{M}_t = \text{Softmax}\left((\mathbf{E}_{t-1}\mathbf{W}_Q)(\mathbf{E}_{t-1}\mathbf{W}_K)^\top\right), \quad \mathbf{E}_t = \text{ReLU}(\mathbf{M}_t \mathbf{E}_{t-1}\mathbf{W}_g)\)$ 最后对所有更新后的扇区特征进行平均池化与线性映射输出全局检索相似度 \(S_{ret}\)。该机制强制各个方向的局部匹配在航拍大图的全局空间几何关系下达成共识,有效压制了非正样本方向上的偶发局部虚警。
3. 真值软标签对齐机制:平滑连续朝向离散化误差
方位角对齐流以极轻量的余弦相似度计算 \(\mathbf{S}_{align} = \mathbf{V}^a \mathbf{f}^q \in \mathbb{R}^P\)。然而,在真实场景中地面相机的连续朝向 \(\theta_{gt}\) 几乎不可能精准落在某个离散采样步长 \(\Delta\theta\) 的中心线上。如果使用生硬的单热码(One-hot)标签进行交叉熵训练,会惩罚临近同样覆盖了目标视野的邻接扇区,导致梯度振荡与优化次优。本文采用几何软标签对齐机制:在连续角度空间中找到距离真实朝向最近的两个相邻扇区索引 \(\{p_1, p_2\}\),根据角距离进行线性插值赋予软权重 \(w_1, w_2\)(满足 \(w_1 + w_2 = 1\)),构建概率目标分布 \(\mathbf{y} \in \mathbb{R}^P\)。这种平滑监督保留了朝向的连续几何拓扑,显著增强了离散扇区判决的容错度与收敛平滑性。
损失函数 / 训练策略¶
训练采用联合多任务端到端优化,总损失为关系检索损失与方位角对齐损失的凸组合: $\(\mathcal{L} = \beta \mathcal{L}_{loc} + (1 - \beta) \mathcal{L}_{img}\)$ 其中,图像级检索损失 \(\mathcal{L}_{img}\) 采用带有可学习温度系数 \(\tau\) 的对称 InfoNCE 损失: $\(\mathcal{L}_{img} = -\frac{1}{B} \sum_{i=1}^B \log \frac{\exp(S_{ret}(i, i) / \tau)}{\sum_{j=1}^B \exp(S_{ret}(i, j) / \tau)}\)$ 扇区级对齐损失 \(\mathcal{L}_{loc}\) 采用软标签交叉熵准则: $\(\mathcal{L}_{loc} = -\frac{1}{B} \sum_{i=1}^B \sum_{p=1}^P y_p^{(i)} \log \left(\text{Softmax}\left(\mathbf{S}_{align}^{(i)}\right)_p\right)\)$ 在 CVUSA 乡村数据集上平衡系数 \(\beta\) 设为 0.9,而在密集城市场景的 CVACT 数据集上 \(\beta\) 设为 0.3;CSRR 迭代层数统一设为 \(T = 3\)。
实验关键数据¶
主实验¶
评估采用两种指标:衡量图像级检索准确率的传统指标 \(R@K\)(Recall at \(K\)),以及严苛的联合扇区级定位指标 \(S\text{-}R@K\)(要求图像级检索在 Top-\(K\) 命中且预测的扇区索引与最大权重真值扇区精准一致)。下表给出了在最严苛的极限视场角(\(70^\circ\) 和 \(90^\circ\))下,本文方法与主流先进算法在重新协议化的 CVUSA 与 CVACT 上的对比结果。
| 数据集 | FoV | 方法 | R@1 (%) | R@5 (%) | S-R@1 (%) | S-R@5 (%) |
|---|---|---|---|---|---|---|
| CVUSA | \(70^\circ\) | GeoDTR+ | 4.78 | 10.24 | 3.67 | 5.84 |
| CVUSA | \(70^\circ\) | Sample4Geo | 35.33 | 62.83 | 34.20 | 60.73 |
| CVUSA | \(70^\circ\) | ConGeo | 40.49 | 64.13 | 39.74 | 62.66 |
| CVUSA | \(70^\circ\) | PLGeo | 44.56 | 69.35 | 28.69 | 44.17 |
| CVUSA | \(70^\circ\) | Ours (SectorGeo) | 63.79 | 84.62 | 59.92 | 78.47 |
| CVACT | \(70^\circ\) | GeoDTR+ | 4.24 | 9.24 | 3.24 | 5.24 |
| CVACT | \(70^\circ\) | Sample4Geo | 6.96 | 18.73 | 6.24 | 16.69 |
| CVACT | \(70^\circ\) | ConGeo | 8.31 | 20.05 | 7.60 | 18.25 |
| CVACT | \(70^\circ\) | PLGeo | 11.33 | 26.47 | 9.78 | 21.97 |
| CVACT | \(70^\circ\) | Ours (SectorGeo) | 41.50 | 64.27 | 39.81 | 61.02 |
| CVUSA | \(90^\circ\) | PLGeo | 53.94 | 77.96 | 40.42 | 58.34 |
| CVUSA | \(90^\circ\) | Ours (SectorGeo) | 72.44 | 89.87 | 66.41 | 81.43 |
| CVACT | \(90^\circ\) | PLGeo | 19.69 | 36.47 | 15.53 | 26.55 |
| CVACT | \(90^\circ\) | Ours (SectorGeo) | 49.30 | 71.05 | 40.75 | 56.74 |
消融实验¶
在 CVUSA 数据集(\(\text{FoV}=180^\circ\))上对各核心组件及池化方式进行全面消融,验证各个模块对定位与检索的贡献。
| 配置 | CSRR | ACA | 池化策略 | R@1 (%) | R@5 (%) | S-R@1 (%) | S-R@5 (%) |
|---|---|---|---|---|---|---|---|
| w/o CSRR | ✗ | ✓ | Avg | 77.74 | 92.23 | 75.74 | 89.82 |
| w/o ACA | ✓ | ✗ | Avg | 84.48 | 94.81 | 82.86 | 91.97 |
| Max Pooling | ✓ | ✓ | Max | 81.40 | 94.20 | 79.60 | 91.12 |
| Mixed Pooling | ✓ | ✓ | Mix | 81.28 | 94.44 | 79.78 | 91.75 |
| Full Model | ✓ | ✓ | Avg | 87.87 | 96.75 | 83.67 | 91.12 |
关键发现¶
- 窄视场下性能飞跃明显:在 \(70^\circ\) 的超窄视场角下,现有基线方法整体出现灾难性衰退(CVACT 上 PLGeo 的 R@1 仅为 11.33%),而 SectorGeo 在 CVACT 上斩获 41.50% 的 R@1 与 39.81% 的 S-R@1,净提升超 30 个百分点。这证明在有效重合区域被极度压缩时,通过扇区扫描剥离无关方向的背景干扰是破解视差瓶颈的关键。
- CSRR 对图像级检索的全局一致性贡献最大:消融实验显示,移除 CSRR 图注意力模块会导致 R@1 骤降 10.13%(从 87.87% 跌至 77.74%),表明局部的单扇区相似度不足以确认全局定位,跨扇区的拓扑协同推理是排除局部相似误报的决定性屏障。
- 平均池化优于最大池化:在扇区特征聚合中,平均池化(87.87% R@1)显著优于最大池化(81.40% R@1)与混合池化(81.28% R@1)。这说明扇区表征更依赖区域内上下文的完整空间分布统计,而非被少量局部显著峰值所主导。
- 扫描步长的权衡机制:在步长敏感性实验中,\(\Delta\theta = 50^\circ\)(\(P=7\) 个扇区)取得最佳平衡。步长放大到 \(100^\circ\) 时量化误差急剧增大导致召回率下跌;而步长过度加密至 \(40^\circ\) 会带来过多的冗余候选并增加过拟合风险,轻微导致指标回退。
亮点与洞察¶
- 任务形式的升维破局:将原本棘手的“连续 3-DoF 刚体位姿回归”转化为几何约束下的“离散扇区匹配检索”。既保留了粗粒度检索的高效扩展性,又用零额外人工标注换取了精细的子区域定位与朝向推断。
- 检索与对齐的自洽双流耦合:RRS 与 AAS 并非简单并联,RRS 的全局判别损失通过梯度反向传播强化了主干特征的朝向敏感性,而 AAS 则为检索提供了可靠的几何局部锚点,两者协同使得模型在 \(R@K\) 与 \(S\text{-}R@K\) 之间维持极高的保真度。
- 软标签平滑的实用技巧:针对连续旋转空间与离散扫描窗口之间的量化裂隙,采用基于角距离的线性反比插值软标签,成功解决了传统分类交叉熵在临界角度处的惩罚失真,提供了平滑的优化曲面。
局限与展望¶
- 航拍中心视点假设:目前的扇区掩膜均默认以航拍图像正中心为极坐标原点进行旋转扫描。当真实地面车辆或拍摄者严重偏离卫星切片中心(即位于边缘或角落)时,扇区截断与径向偏差会导致几何形变与匹配退化。
- 固定 FoV 先验依赖:训练和推理过程依赖已知的地面水平视场角 \(\phi\)。对于手机或行车记录仪等焦距动态变化或相机内参未知的现实场景,需要拓展具备自适应视场角或多尺度多扇区联合扫描的能力。
- 三维地形与遮挡未建模:高楼密集的城市场景存在严重的高程差、建筑物立面重投影遮挡与阴影畸变,纯二维扇区投影尚未融入高度场与三维几何先验。
相关工作与启发¶
- vs PLGeo (ACM MM 2025): PLGeo 采用 Patch 级特征重排来抵抗旋转不一致,但仍停留在整图粗粒度检索层面;在 \(70^\circ\) CVACT 下 PLGeo 仅取得 11.33% R@1,而本文通过显式构建楔形扇区将 R@1 提升至 41.50%,且能直接输出精细朝向与所属扇区。
- vs SliceMatch (CVPR 2023): SliceMatch 尝试对切片特征应用环形卷积进行连续位姿回归,面临严苛的两两配对限制与复杂的优化障碍;本文将其离散化为轻量分类检索,无需位姿监督且便于扩展至海量数据库检索。
- vs ConGeo (ECCV 2024): ConGeo 通过对比学习增强对局部视差的鲁棒性,但未能将未观测区域作为空间噪声进行针对性过滤;本文提出的方位角解耦与 ACA 机制在数学上显式抑制了无观测视角的干扰。
评分¶
- 新颖性: ⭐⭐⭐⭐ [将有限 FoV 地面匹配重构为扇区级检索并隐式推断朝向,角度新颖且具有严谨的几何美感]
- 实验充分度: ⭐⭐⭐⭐⭐ [覆盖多种 FoV 限制、主干对比、严格的 S-R@K 评测、完整的消融实验与步长敏感性分析]
- 写作质量: ⭐⭐⭐⭐⭐ [动机叙述逻辑链严密,数学符号体系完备,图表清晰且消融深入]
- 价值: ⭐⭐⭐⭐ [为 GPS 拒止导航与无人机视觉定位开辟了兼顾效率与精细度的新路径,工程落地潜力大]