Recurrent Cross-View Object Geo-Localization¶
会议: ECCV2026
论文: ECCV 原文
代码: https://github.com/Temperature-ai/ReCOT.git
领域: 遥感 / 跨视角目标地理定位
关键词: 点提示、可学习 token、循环细化、SAM 蒸馏、分层注意力
一句话总结¶
ReCOT 用携带查询目标语义的可学习 token 反复读取卫星图特征,并以 SAM 蒸馏和参考特征增强改善循环输入,在 CVOGL 测试集上达到地面到卫星 48.10%、无人机到卫星 72.05% 的 [email protected],模型参数为 29.9M。
研究背景与动机¶
跨视角图像地理定位通常回答“这张照片是在哪里拍的”,而本文回答“照片里点选的那个物体,在卫星图的哪里”。 这两个问题不能互换:定位到拍摄相机附近,不等于找到了视野中的目标建筑。 本文的查询图可以来自地面或无人机,参考图则是高分辨率卫星图,输出是被指定物体在参考图中的边界框。 因此模型既要跨越外观和视角差异,也要区分同一查询场景内哪个物体才是用户指定的对象。 DetGeo 等方法把点提示编码后与查询特征融合,再生成参考图注意力,最后用检测头一次性回归位置。 当卫星图上有多个相似候选时,单次特征聚合容易把背景或错误建筑当作目标,后续检测头缺少重新检查证据的过程。
直接增加循环次数也并不充分,因为循环可能反复强化同一份错误证据。 点坐标只标记一个像素,不能天然说明目标的完整范围;参考特征又往往由大量背景主导。 ReCOT 因而把问题拆到两个互相依赖的层面:先使查询语义与参考证据更清楚,再允许定位状态多次修正。 SAM 在这里不是部署时的分割器,而是训练时帮助模型理解“这个点属于哪个物体”的教师。 参考特征增强也不是最终的一次性定位,而是给循环读取准备较少干扰的输入。 核心 idea:把跨视角目标匹配保存为可更新的 token 状态,用共享权重的多轮注意力逐步修正定位,同时通过语义监督和分层参考特征增强防止循环积累错误线索。
方法详解¶
整体框架¶
输入是查询图、查询图上的点提示,以及包含目标的卫星参考图。 Swin-t 图像编码器提取查询特征和多尺度参考特征,位置编码沿用 DETR 的方式。 整个过程依次包含“提示语义与蒸馏”“分层参考特征增强”“循环定位与 token 监督”三个设计。 查询分支先将可学习 token 与图像特征联合编码,再注入点提示;参考分支准备固定的目标相关特征,供 token 多次读取。 每轮都有边界框预测,测试时从输出框中选置信度最高者作为最终结果,而不是输出卫星图分割掩码。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
Query["查询图与点提示"] --> Prompt["提示语义与蒸馏"]
Teacher["SAM 查询掩码"] -.->|仅训练监督| Prompt
Reference["卫星图多尺度特征"] --> Enhance["分层参考特征增强"]
Prompt --> Enhance
Prompt -->|初始 token| Recur["循环定位与<br/>token 监督"]
Enhance -->|固定参考特征| Recur
Boxes["真实参考框"] -.->|仅训练监督| Recur
Recur -->|共享权重更新状态| Recur
Recur --> Output["目标框与置信度"]
关键设计¶
1. 提示语义与蒸馏:先让 token 理解场景,再知道点选的是谁
模型初始化一组可学习 token,其数量与通道维度决定语义状态的容量。 它们先沿空间维与查询图像特征拼接,通过多头自注意力吸收查询图的全局上下文,形成查询 token。 此时 token 表达的是“这幅图有什么”,尚未明确受点提示约束。 接下来,点提示嵌入通过交叉注意力与拼接特征交互,使查询特征和 token 都含有被指定对象的信息。 这里保留两种状态很重要:提示交互前的查询 token 用于粗筛参考区域,提示交互后的特征用于更精确的目标语义注入。 因此参考分支并不是从开始就要求一个点直接决定唯一的卫星候选。
为了教会查询特征识别目标范围,训练时把查询图和点提示送给 SAM,获得伪真值掩码。 从提示交互后的拼接特征中取出查询图部分,经轻量卷积头和 sigmoid 生成预测掩码。 该预测受到 SAM 掩码的二元交叉熵与 Dice 损失监督,从而把分割先验传入查询语义表示。 监督发生在查询视角,不要求 SAM 在卫星图上直接找到同一个物体。 推理不需要运行 SAM,所以教师的计算开销不会随着定位循环一起加入部署路径。 不过这种监督仍依赖伪掩码质量,论文没有证明教师在错误点提示下也能可靠提供目标范围。
2. 分层参考特征增强:先筛查询相关区域,再注入目标细节
RFEM 同时使用低分辨率语义特征和高分辨率细节特征,后者空间尺寸是前者的 2 倍。 低分辨率特征适合判断场景相关性,高分辨率特征保留目标边缘,但也包含更多背景干扰。 RFEM 首先对提示交互前的查询 token 做 softmax 加权聚合,得到描述整幅查询图的全局向量。 该向量与低分辨率参考特征做点积并经过 sigmoid,形成查询相关的空间注意力图。 注意力图被上采样后逐元素乘到高分辨率特征上,降低与查询场景无关区域的响应。 这一步寻找的是潜在相关区域,而不是声称已经完成对象身份匹配。
随后,经过空间筛选的高分辨率参考特征,通过交叉注意力读取带提示语义的查询与 token 特征。 粗筛阶段利用全局场景,细化阶段才使用目标级线索,这就是“空间注意力到交叉注意力”的层次。 处理结果再下采样,并经空间注意力和自注意力细化,得到最终参考特征。 循环定位期间这份参考特征保持固定,变化的是读取它的 token 状态。 这避免把多轮更新误解成多次重跑骨干网络或多次调用 SAM。 正文图 4 与结构描述支持这种信息流;个别符号的撇号在正文与图示间不一致,笔记按文字所述的提示语义区分状态。
3. 循环定位与 token 监督:同一份证据可以被逐步重新解释
每一轮以当前 token 为 query,以增强后的参考特征为 key 和 value,执行多头交叉注意力。 更新后的 token 进入线性预测层,产生该轮的位置估计;下一轮继续用更新后的状态读取参考图。 循环中的交叉注意力与线性预测层共享权重,因此增加轮数增加计算量,但不增加这组模块的参数量。 作者用注意力可视化解释:部分 token 逐渐聚焦目标,其他 token 的响应减弱并稳定在背景模式。 这是一种定性观察,不意味着每个 token 都必须代表一个独立目标,或每轮误差都严格下降。 正文后段把行为描述为残差修正,但提供的结构主要说明 token 更新与逐轮预测,笔记不额外推定具体边界框残差实现。
为避免 token 只学到无法定位的抽象语义,每轮还有直接的区域监督。 模型先对该轮 token 沿 token 维进行 softmax 加权汇总,再与固定参考特征相关,经过 sigmoid 得到参考图聚合响应。 真实边界框被转成框级二值掩码,用二元交叉熵与 Dice 损失监督该响应,这构成 token 引导损失。 这里的掩码来自框标注,并非精确的卫星图像素级分割标注,也不是 SAM 查询掩码。 两种辅助监督分别约束“点提示指向哪个查询对象”和“循环状态能否在参考图凸显这个对象”。 因此循环的收益建立在可读的参考证据和可定位的语义状态上,而不只是把同一检测头重复执行。
一个完整示例¶
考虑在地面照片中点选一栋建筑,然后在包含多个相似屋顶的卫星图上寻找它;这是机制说明,不是新增实验样本。 查询自注意力先编码街区上下文,点提示交互再把目标建筑与同图中的其他建筑区分开。 RFEM 用街区级相关性压低无关卫星区域,再把目标线索注入保留细节的高分辨率特征。 第一轮 token 可能仍偏向外观相近的错误建筑,后续轮次用更新的语义状态重新分配对候选区域的关注。 训练时每轮框预测与 token 响应都受监督,测试时则只有图像、点提示和共享权重循环,不读取真实框。 默认模型训练展开 6 步,在验证集选择推理 5 步;这里不能把 6 步训练误写为必须 6 步部署。
损失函数 / 训练策略¶
总目标由各轮 DETR 风格检测损失,以及各轮 token 引导损失和一次 SAM 蒸馏损失组成。 下面按第 3.4 节文字给出总目标的等价概括,未补写缓存中损坏的注意力或聚合原式:
两种掩码辅助目标都包含二元交叉熵与 Dice 损失,但监督来源、所在视角与作用对象不同。 正文没有在可读部分列出 DETR 检测损失的各项权重,因此不能把惯用超参数当作本文设置。 实验采用 4 张 NVIDIA GeForce RTX 4090、AdamW、batch size 16、初始学习率 \(2.5\times10^{-5}\) 和权重衰减 \(1\times10^{-4}\)。 各 CVOGL 方法训练至收敛,模型由验证集选出后在测试集评测。 推理步数按数据集在验证集选择,不是逐样本自适应停止;训练展开 6 步有助于学习多步更新行为。
实验关键数据¶
主实验¶
CVOGL 的两个方向各有 6,239 对图像,分别划分为 4,343 训练、923 验证、973 测试样本。 地面查询图为 \(512\times256\),无人机查询图为 \(256\times256\),卫星参考图为 \(1024\times1024\)。 [email protected] 与 [email protected] 是预测框和真实框 IoU 达到相应阈值的样本百分比,IoU 为交集面积除以并集面积。 它们不是米制地理误差,也不是逐像素分割准确率;每对图像只取最高置信度的输出框评测。 下表摘自原文表 4(第 13 页),准确率单位为 %;FPS 在无人机到卫星任务、单张 RTX 4090 上测量。
| 方法 | 地面 [email protected] | 地面 [email protected] | 无人机 [email protected] | 无人机 [email protected] | 参数 M | FPS |
|---|---|---|---|---|---|---|
| DetGeo | 45.43 | 42.24 | 61.97 | 57.66 | 73.8 | 29.5 |
| TROGeo | 51.08 | 46.56 | 76.16 | 68.96 | 71.3 | 13.5 |
| GeoFormer | 49.54 | 45.32 | 73.79 | 68.96 | 739.1 | 11.1 |
| ReCOT,1 步 | 49.74 | 46.25 | 78.31 | 71.74 | 29.9 | 27.2 |
| ReCOT,5 步 | 52.00 | 48.10 | 77.60 | 72.05 | 29.9 | 24.3 |
相对 TROGeo,5 步 ReCOT 的两个 [email protected] 分别高 1.54 和 3.09 个百分点,但并不比 DetGeo 更快。 同模型从 1 步到 5 步,地面 [email protected] 从 46.25% 升到 48.10%,无人机 [email protected] 只从 71.74% 升到 72.05%。 无人机 [email protected] 反而从 78.31% 降到 77.60%,所以“循环改善所有指标”不是表格支持的结论。
消融实验¶
下表摘自原文表 2(第 12 页),均为 CVOGL 测试集、5 步循环,准确率单位为 %。
| 配置 | 地面 [email protected] | 地面 [email protected] | 无人机 [email protected] | 无人机 [email protected] |
|---|---|---|---|---|
| 去掉 RFEM | 46.45 | 42.24 | 50.15 | 46.04 |
| 去掉 SAM 蒸馏损失 | 49.74 | 44.81 | 70.91 | 65.78 |
| 去掉 token 引导损失 | 50.57 | 47.58 | 72.05 | 66.80 |
| 完整模型 | 52.00 | 48.10 | 77.60 | 72.05 |
无人机 [email protected] 在去掉 RFEM 后下降 26.01 个百分点,远大于同模型增加循环次数的 0.31 个百分点收益。 这说明增强参考证据是强依赖项,不能把与旧模型的所有差距都归因于循环机制。 原文表 3(第 12 页)进一步显示,移除空间注意力图后无人机 [email protected] 为 70.30%,用低分辨率替代高分辨率分支则为 67.11%。 两种分辨率的角色并非可随意交换,目标细节对参考特征增强确有价值。
关键发现¶
原文表 1(第 11 页)在验证集选择步数:地面 [email protected] 在 1、5、6 步分别为 42.25%、43.66%、43.34%。 对应地面 FPS 为 26.9、24.1、23.4,增加步数有开销且并非单调收益;不要与测试集准确率混写。 CVOGL-few-shot 仅包含 4 个新类别、28 个训练样本和 24 个测试样本,每类训练 7 个样本。 模型从常规 CVOGL 检查点初始化后微调,所以下表不是零样本泛化结果。 下表摘自原文表 5(第 14 页),为无人机到卫星少样本测试集,准确率单位为 %。
| 方法 / 步数 | [email protected] | [email protected] |
|---|---|---|
| DetGeo | 16.67 | 16.67 |
| GeoFormer | 45.83 | 29.17 |
| OCGNet | 29.17 | 25.00 |
| ReCOT,1 步 | 37.50 | 25.00 |
| ReCOT,2 步 | 41.67 | 29.17 |
| ReCOT,4 步 | 45.83 | 33.33 |
| ReCOT,6 步 | 50.00 | 33.33 |
从 1 步到 6 步,少样本 [email protected] 提升 8.33 个百分点,但在仅 24 个测试样本上约对应多命中 2 个样本。 少样本结果支持进一步研究循环细化,不足以证明大规模开放类别泛化已经解决。
亮点与洞察¶
- 可学习 token 既表示查询意图,也作为循环状态,避免把查询理解和位置更新完全割裂;共享权重使推理深度成为不增加参数的调节量。
- SAM 的价值被压缩为查询分支的训练监督,不必把重型基础模型放到每轮推理中;这适合训练资源较充足、部署预算有限的场景。
- RFEM 的粗筛不使用点提示,而细化使用目标语义,显式区分“场景相关”和“目标相关”,比一次注意力承担两种任务更容易解释。
局限与展望¶
- 作者明确把逐实例自适应停止列为未来工作;当前数据集级固定步数仍可能对简单样本多算、对困难样本不够。
- 数据主要来自两个跨视角任务和很小的少样本集合,未提供跨城市、季节变化或参考图缺失目标等条件下的系统证据。
- SAM 伪掩码可能把点附近的错误区域作为监督;提示扰动和教师质量变化的鲁棒性值得单独评测,这是读者提出的方向。
- 缓存中的多条公式存在符号丢失,正文提及的补充材料未在本任务中提供;token 数量等额外超参数和细粒度实现不能据此确认。
相关工作与启发¶
- 对比 DetGeo、VAGeo、TROGeo:这些方法强调单次跨视角聚合与目标检测,ReCOT 让语义状态在固定参考特征上多次更新;但组件消融表明收益并非仅来自循环。
- 对比 CVM-Net、SAFA、GeoDTR+:图像级定位主要寻找相机或场景位置,本文按点提示寻找具体物体,因此不能把图像检索准确率直接当作对象定位能力。
- 联系 DETR、SAM 与循环匹配:ReCOT 结合检测式监督、提示分割先验与共享权重迭代;可迁移的启发是同时监督“状态能否指向目标”和“最终位置是否正确”,而非照搬特定遥感结构。
评分¶
- 新颖性: 4/5。把循环语义状态引入对象级跨视角定位有清晰任务针对性,底层注意力和蒸馏组件较成熟。
- 实验充分度: 4/5。包含主比较、循环步数、组件、多尺度和少样本分析,但后者规模较小。
- 写作质量: 4/5。任务与模块动机清楚,部分公式的缓存提取损坏限制了实现级核验。
- 价值: 4/5。以 29.9M 参数取得更强定位结果,不过推理速度与收益仍需按场景评估。