跳转至

SARA: Structure-Aware Riemannian-Guided Alignment for Drone Image-Text Retrieval

会议: ECCV 2026
论文: ECCV 原文
PDF: ECCV PDF
领域: 遥感
关键词: 无人机图文检索, 黎曼流形, 对称正定矩阵, 对数欧几里得度量, 结构感知对齐

一句话总结

提出结构感知黎曼引导对齐框架 SARA,通过对称正定(SPD)矩阵在黎曼流形上捕获无人机航拍影像的二阶空间拓扑与特征关联,并在切空间下借助对数欧几里得度量施加边际与条件分布对齐,攻克了常规欧氏嵌入在低空俯仰变换下的几何失真与跨模态误配难题。

研究背景与动机

无人机图文检索(Drone Image-Text Retrieval, DITR)在低空安防巡逻、灾害应急评估与城市动态监控中具有重要应用价值。与卫星正射影像或地面水平拍摄不同,无人机成像通常处于可变飞行高度与倾斜视角下,导致拍摄画面存在剧烈的视点变化、尺度漂移以及高度不规则的空间物体排布。现有主流方法大多沿用欧几里得空间下的对比学习或跨模态交互模型(如 VSE++、CLIP、VCSR 等),假设图文嵌入向量处于平坦的线性空间中,直接依赖内积或余弦距离进行语义相似度度量。

然而,视点变化给图像带来的几何空间形变本质上是非线性的。虽然物体的相对透视投影发生扭曲,但场景内部各实体间的内在拓扑与相对几何约束仍然保持稳定。常规欧几里得特征空间采用线性欧氏距离近似高度弯曲的非线性几何结构,不可避免地造成特征表示层面的几何失真(representation-level geometric inconsistency)。近来部分工作尝试引入非欧几何(如 MERU、HyCoCLIP 等双曲空间方法),但它们主要将流形视为全局树状语义层次的替代容器,未能在图像局部表征中显式建模高阶空间统计与几何拓扑结构,因而在结构复杂的低空遥感图文匹配中表现受限。

本文的切入点在于:应当借助具有内蕴度量特性的黎曼流形,以二阶特征统计量刻画抗视角形变的几何拓扑,从而有效弥补常规欧氏全局语义嵌入对结构信息感知不足的缺陷。核心 idea:构建结构感知黎曼引导对齐框架(SARA),采用对称正定(SPD)流形建模图文二阶结构拓扑,在切空间下利用对数欧几里得度量协同优化全局边际分布与细粒度条件分布对齐,并将流形结构先验与语义特征深度融合以实现几何一致的跨模态检索。

方法详解

整体框架

SARA 采用双分支解耦与多阶段对齐架构,整体输入为无人机图像 \(I \in \mathbb{R}^{3 \times H \times W}\) 与文本描述 \(T = \{w_1, \dots, w_L\}\)。语义分支通过 RestV2-Base 视觉主干与 BERT 文本编码器提取一阶全局语义向量 \(v_{\mathrm{sem}}\) 与 \(t_{\mathrm{sem}}\)。结构分支则由流形结构特征抽取(MSFE)模块将视觉特征图与文本 token 序列建模为对称正定(SPD)矩阵,在黎曼流形上执行层级流形变换后映射至切空间;接着由对数欧几里得结构对齐(LESA)模块在切空间下执行边际分布对齐(MDA)与条件分布对齐(CDA);最终将结构向量与语义向量融合,通过第二阶段对比学习输出判别性检索表示。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入:无人机图像与文本描述"] --> B["语义分支:提取全局语义特征"]
    A --> C["流形结构特征抽取 (MSFE)<br/>局部二阶协方差与流形层变换"]
    B --> D["语义对比对齐<br/>双向 InfoNCE 损失"]
    C --> E["对数欧几里得结构对齐 (LESA)<br/>切空间 MDA 与 CDA 分布对齐"]
    B & E --> F["语义-结构表征融合与第二阶段对齐<br/>联合向量映射与对称对比优化"]
    D & E & F --> G["输出:跨模态双向检索结果"]

关键设计

1. 流形结构特征抽取 (MSFE):在对称正定流形上捕获二阶拓扑依赖 针对一阶欧几里得特征无法保真刻画非线性空间布局与通道关联的痛点,MSFE 从视觉编码器第四阶段提取空间特征图 \(F_v \in \mathbb{R}^{C_v \times N}\)(其中 \(C_v\) 为通道数,\(N\) 为空间 token 数),构建局部特征二阶样本协方差矩阵: $\(C_I^{(0)} = \frac{1}{N}\sum_{i=1}^{N}(\mathbf{f}_v^{i} - \bar{\mathbf{f}}_v)(\mathbf{f}_v^{i} - \bar{\mathbf{f}}_v)^\top + \epsilon_I \mathbf{I}\)$ 加入扰动项 \(\epsilon_I \mathbf{I}\) 保证严格对称正定性,使 \(C_I^{(0)} \in \mathrm{Sym}_{C_v}^+\) 驻留在 SPD 黎曼流形上。为深层抽象该几何表征,模块串联设计了四种流形层级变换: - BiMap 层:在 Stiefel 流形约束的半正交权重 \(W_k\) 下执行非线性降维映射 \(C^{(k)} = W_k^\top C^{(k-1)} W_k\),严格保持流形几何与正定性; - ReEig 层:对矩阵进行特征值分解 \(C^{(k)} = U \Sigma U^\top\),通过下界阈值 \(\zeta > 0\) 截断特征值 \(\tilde{C}^{(k)} = U \max(\Sigma, \zeta \mathbf{I}) U^\top\),为 SPD 流形引入非线性整流; - ReCov 层:利用残差权重 \(\lambda\) 放大非对角线协方差成分 \(\bar{C}^{(k)} = \tilde{C}^{(k)} + \lambda (\tilde{C}^{(k)} - \mathrm{diag}(\tilde{C}^{(k)}))\),重点强化跨通道间的关联依赖; - LogEig 层:通过对数欧几里得变换将流形曲面上的 SPD 矩阵展开至其对应的切空间向量空间:\(\hat{C}^{(k)} = \log(\bar{C}^{(k)}) = U \log(\Sigma) U^\top\)。 在文本端,将最后一层 Transformer 输出的 token 嵌入经过轻量 MLP 后计算样本协方差,并使用共享半正交映射矩阵 \(W_s\) 投影至与视觉 SPD 同维的流形空间:\(C_T = \log(W_s \mathrm{Cov}(\mathrm{MLP}(F_t)) W_s^\top)\),形成文本的切空间二阶结构描述子。

2. 对数欧几里得结构对齐 (LESA):切空间中的粗细双层分布一致性约束 将 SPD 矩阵线性化至切空间后,由于图像与文本各自先验分布与表征密度的不对称性,两模态特征在流形切空间中仍存在全局漂移与局部错配。LESA 从宏观与微观两层构造几何对齐目标: 宏观层面实施边际分布对齐 (MDA),促使批次内两模态的 Fréchet 均值在切空间重合,缩小跨模态全局域差距: $\(\mathcal{L}_{\mathrm{MDA}} = \left\| \frac{1}{B}\sum_{i=1}^B C_I^{(i)} - \frac{1}{B}\sum_{i=1}^B C_T^{(i)} \right\|_F^2\)$ 微观层面实施条件分布对齐 (CDA),在语义配对正样本之间约束结构矩阵的对数欧几里得距离,确保共享相同语义的图文对具有相似的空间依赖结构: $\(\mathcal{L}_{\mathrm{CDA}} = \frac{1}{N_{\mathrm{pos}}}\sum_{i=1}^{N_{\mathrm{pos}}} \left\| C_I^{(i)} - C_T^{(i)} \right\|_F^2\)$ MDA 负责将双模态结构嵌入拉至流形切空间中统一的几何质心区域,CDA 则精准对齐实例级的几何细节,二者配合构成了稳健的非欧空间几何结构对齐机制。

3. 语义-结构表征融合与第二阶段对齐:双重空间互补与理论误差界约束 流形结构特征提供了视角不变的拓扑骨架,但跨模态检索仍需依赖精细的词汇级语义信息。SARA 设计了显式融合层,将全局语义向量与切空间矩阵的展平向量拼接并通过可学习映射投影为最终检索嵌入: $\(\mathbf{z}_I = W_f [v_{\mathrm{sem}} \,\|\, \mathrm{vec}(C_I)], \quad \mathbf{z}_T = W_f [t_{\mathrm{sem}} \,\|\, \mathrm{vec}(C_T)]\)$ 在归一化融合向量上计算第二阶段对称温度对比损失 \(\mathcal{L}_{\mathrm{fusion}}\),引导模型学习兼备全局语义判别力与局部拓扑一致性的多模态表示。 在理论层面,作者推导了期望对齐误差的泛化上界。假设相似度度量函数关于多模态组合距离 \(d_{\mathrm{comb}}(v, t)\) 具有 \(L\)-Lipschitz 连续性,且分类判别采用边际为 \(\gamma\) 的铰链代理损失 \(\phi_\gamma(z) = \max(0, 1 - z/\gamma)\),则跨模态误配指示误差的期望值满足: $\(\mathcal{E} = \mathbb{E}_{(v,t)} [\mathbb{I}\{\mathrm{mismatch}(v,t)\}] \le \frac{L}{\gamma} \mathcal{L}_{\mathrm{SARA}}\)$ 该理论证明表明,优化 SARA 的多任务几何目标函数严格等价于最小化真实检索误差的上界,为流形引导的收敛性与鲁棒性提供了严谨的数学支撑。

损失函数 / 训练策略

SARA 采用端到端分层联合优化,总目标函数定义为: $\(\mathcal{L}_{\mathrm{SARA}} = \mathcal{L}_{\mathrm{sem}} + \lambda_m \mathcal{L}_{\mathrm{MDA}} + \lambda_c \mathcal{L}_{\mathrm{CDA}} + \alpha \mathcal{L}_{\mathrm{fusion}}\)$ 其中 \(\mathcal{L}_{\mathrm{sem}} = \frac{1}{2}(\mathcal{L}_{\mathrm{v2t}} + \mathcal{L}_{\mathrm{t2v}})\) 为第一阶段语义 InfoNCE 损失。超参数根据敏感性实验设置为 \(\lambda_m = 0.3\)、\(\lambda_c = 0.7\)、\(\alpha = 0.7\)、对比温度系数 \(\tau = 0.07\)。模型基于 RestV2-Base 与 BERT-base-uncased 初始化,采用 Adam / 黎曼 Adam 优化器,学习率设为 \(2 \times 10^{-4}\),在单个 NVIDIA RTX A6000 GPU 上训练 50 个 epoch(批大小在 ERA 上为 120,在 UDV 上为 210)。

实验关键数据

主实验

在两个极具代表性的无人机跨模态基准(ERA 与 UDV)上对比当前 SOTA 方法,包含经典 CNN-RNN、主流 Transformer、大规模视觉语言预训练(VLP)以及非欧流形方法:

数据集 方法 类别 来源 图搜文 R@1 图搜文 R@5 图搜文 R@10 文搜图 R@1 文搜图 R@5 文搜图 R@10 平均召回 mR
ERA CLIP VLP ICML21 11.31 31.92 43.91 12.73 37.33 51.52 31.45
ERA PCME CNN-RNN CVPR21 14.69 35.30 49.15 13.85 42.87 60.64 36.08
ERA VCSR CNN-RNN TGRS24 15.65 38.28 53.49 13.69 46.31 66.37 38.96
ERA MSA Transformer TGRS24 18.04 50.54 64.86 19.93 41.22 55.74 41.72
ERA HCCM Transformer ACM MM25 19.93 39.19 56.76 18.58 45.20 59.93 39.93
ERA MERU* 双曲流形 TGRS24 6.22 21.37 32.98 7.41 21.06 32.33 20.18
ERA HyCoCLIP* 双曲流形 ICLR25 7.54 20.57 33.21 8.11 20.85 34.56 22.31
ERA SARA (本文) 黎曼流形 ECCV26 23.98 48.64 63.17 21.55 56.82 76.01 48.36
UDV CLIP VLP ICML21 6.35 20.26 29.99 4.25 16.15 26.09 17.18
UDV VCSR CNN-RNN TGRS24 7.33 22.25 32.11 6.45 22.25 33.61 20.67
UDV HCCM Transformer ACM MM25 7.97 19.60 28.38 7.43 22.60 29.97 19.33
UDV MERU* 双曲流形 TGRS24 2.63 8.92 15.23 2.38 13.51 15.24 9.12
UDV HyCoCLIP* 双曲流形 ICLR25 3.12 10.45 17.02 3.38 11.02 17.55 10.42
UDV SARA (本文) 黎曼流形 ECCV26 8.09 24.55 34.68 6.88 23.41 35.35 22.16

消融实验

在 ERA 与 UDV 两个数据集上系统验证 MSFE 的视觉结构特征(VSF)、文本结构特征(TSF)以及 LESA 的 MDA、CDA 各组件贡献:

配置 VSF TSF MDA CDA ERA 图搜文 R@1 ERA 文搜图 R@1 ERA mR UDV 图搜文 R@1 UDV 文搜图 R@1 UDV mR 说明
Baseline \(\times\) \(\times\) \(\times\) \(\times\) 17.90 18.91 44.11 6.85 6.55 21.02 纯欧氏双分支语义基线
m1 \(\checkmark\) \(\times\) \(\times\) \(\times\) 20.06 19.93 45.12 7.21 6.67 21.35 仅引入视觉二阶流形特征
m2 \(\times\) \(\checkmark\) \(\times\) \(\times\) 12.63 15.25 36.86 6.30 6.01 20.26 仅引入文本结构特征(性能显著退化)
m3 \(\checkmark\) \(\checkmark\) \(\times\) \(\times\) 18.71 22.63 45.43 7.38 6.79 21.57 结合双端结构特征但不加分布对齐
m4 \(\times\) \(\times\) \(\checkmark\) \(\checkmark\) 19.02 19.76 45.50 7.12 6.74 21.44 仅在平坦语义空间施加 MDA 与 CDA
m5 \(\checkmark\) \(\checkmark\) \(\checkmark\) \(\times\) 19.45 22.63 46.62 7.66 6.81 21.79 引入结构特征 + 全局边际分布对齐
m6 \(\checkmark\) \(\checkmark\) \(\times\) \(\checkmark\) 21.09 22.29 46.81 7.75 6.83 21.89 引入结构特征 + 细粒度条件分布对齐
SARA \(\checkmark\) \(\checkmark\) \(\checkmark\) \(\checkmark\) 21.55 23.98 48.36 8.09 6.88 22.16 完整模型(流形建模与两级对齐协同)

关键发现

  • 结构建模必须以视觉几何为锚点:单独引入视觉结构特征(m1)使 ERA 的 mR 从 44.11 稳步提升至 45.12;然而单独引入文本结构特征(m2)导致 mR 暴跌至 36.86。这是因为文本 token 的共现统计由句法驱动,强行构建 SPD 矩阵容易引入虚假拓扑依赖;只有当视觉几何提供先验锚点时,双端结构建模(m3)才能发挥协同增益(45.43 mR)。
  • 非欧度量与分布对齐的深度耦合:在平坦语义空间直接施加 MDA 和 CDA 损失(m4)增益极其有限(45.50 vs 44.11)。而当与 SPD 切空间特征结合时,MDA 与 CDA 分别带来 +1.19 和 +1.38 的 mR 跃升(m5、m6),二者合力达到 48.36 mR,证明流形几何与对数欧几里得距离是分布对齐生效的核心前提。
  • 对通用遥感场景的泛化性:在标准卫星遥感检索数据集 RSICD 与 RSITMD 上,SARA 分别取得 29.18 与 40.68 的 mR,全面超越 UniAdapter(27.54 / 39.23)与 SIPN(28.58 / 38.93),证明 SPD 二阶流形建模对于大范围高密度地物几何拓扑具有通用有效性。

亮点与洞察

  • 将对称正定流形二阶统计引入图文检索:区别于传统仅在平坦向量空间拉近余弦距离的范式,SARA 将无人机图像特征图转化为协方差 SPD 矩阵,利用非欧流形天然的曲率适应能力消除非线性视角形变干扰。
  • 对数欧几里得切空间下的宏观与微观协同对齐:巧妙结合 Fréchet 均值边际分布对齐(全局锚定)与正样本对条件分布对齐(局部精细),化解了非欧表征与离散文本表示之间的分布鸿沟。
  • 理论严密的泛化误差界约束:通过数学推导证明了综合损失函数是真实跨模态错配率的严格上界,跳出了单纯经验调参的试错框架。
  • 可迁移的流形即插即用范式:通过 BiMap、ReEig、ReCov 与 LogEig 组合构成的轻量 SPD 特征精炼流,可以作为即插即用模块推广至无人机目标检测、重识别或视角跨域匹配任务中。

局限与展望

  • 文本端流形先验较为脆弱:消融实验揭示单纯对文本 token 构建协方差矩阵会严重损害检索性能,说明自然语言缺乏天然的连续二维拓扑结构,未来需探索由句法依存树或场景图先验引导的文本流形建模方式。
  • 流形曲率固定与静态度量限制:当前采用固定的对数欧几里得度量展开切空间,无法根据高空与超低空不同场景自适应调节局部曲率,未来可探索可学习参数化黎曼度量(Learnable Riemannian Metrics)。
  • 细粒度混淆样本依然存在:检索可视化显示在多物体密集重叠或背景高度相似的极端场景下仍会出现语义混淆,需进一步引入细粒度实体级感知机制。

相关工作与启发

  • vs MERU / HyCoCLIP(双曲空间图文检索):双曲流形主要利用负曲率空间表示文本层级包含树状关系,但其无法有效处理视觉内部的二阶网格拓扑与视角非线性旋转;SARA 基于 SPD 正定矩阵与对数欧几里得度量建模空间协方差,与无人机倾斜摄影的几何形变特性更为契合。
  • vs VCSR / HCCM(欧氏无人机检索):VCSR 与 HCCM 依然在欧氏空间下设计注意力重加权或细粒度跨层级匹配,受限于欧氏空间的平坦假设;SARA 突破平坦约束,证明了非欧二阶统计先验能够大幅补足强视角扰动下的跨模态对齐能力。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次将对称正定(SPD)黎曼流形与对数欧几里得度量深入引入无人机图文检索,设计了兼顾流形变换与分布对齐的完整架构。
  • 实验充分度: ⭐⭐⭐⭐⭐ 覆盖无人机基准(ERA、UDV)与通用遥感基准(RSICD、RSITMD),消融完备且配备参数敏感度与 t-SNE 流形可视化。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑层层推进,公式规范克制,附带严格的泛化误差上界理论证明。
  • 价值: ⭐⭐⭐⭐⭐ 为俯仰视角剧烈变化的航拍跨模态对齐提供了坚实的非欧几何解决方案,理论与实验表现均十分出众。