Hierarchical Hyperbolic Representation Learning for Aerial-Ground Person Re-Identification¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/YangQiWei3/HiHR
领域: 遥感
关键词: 空地行人重识别、双曲表示学习、层次度量学习、跨模态提示对齐、洛伦兹流形
一句话总结¶
针对空地异构摄像头下视角剧变导致的表征塌陷难题,HiHR 首次引入分层双曲表征学习(HHL)与文本引导多粒度融合(TMF),在洛伦兹流形中解耦粗粒度跨视角身份一致性与细粒度视角特异性判别线索,在 CARGO 与 LAGPeR 等四大基准上取得最优或领先的检索表现。
研究背景与动机¶
行人重识别(Person Re-ID)是现代智能安防监控的核心技术,但绝大多数现有方法都假设摄像头部署在同一水平高度,局限于同构的地面对地面拍摄网络。随着无人机(UAV)巡检的普及,实际应用场景越来越依赖由高空无人机与地面监控组成的异构感知网络。无人机俯拍具备广域覆盖优势,但视角高度倾斜且尺度变化极大,而地面摄像头则提供正侧方近距离的丰富外观细节。这种极端的视角与成像机制差异,使得空地行人重识别(Aerial-Ground Person Re-ID, AG-ReID)面临显著的跨域外观鸿沟。
面对这一挑战,以往的 AG-ReID 方法大都遵循传统的欧氏空间强对齐范式,试图通过全局特征投影或原型对比强行拉近同一行人在空中和地面拍摄的图像。然而,这种直接强行拉平跨视角分布的做法存在致命缺陷:它过度强调跨视角的视角不变性(view-invariant),往往将特定视角下独有的判别细节(如俯视下的发型与头肩轮廓、平视下的下半身与鞋履纹理)当作噪声完全抹平,导致特征严重过平滑与表征塌陷。同时,现有工作多数仅依赖骨干网络的最后一层全局输出,忽略了中间层蕴含的结构与局部几何线索,使复杂跨视角匹配缺乏中低层细粒度证据支撑。
本文的切入视角是重新审视跨视角表征的几何本质:跨视角匹配天然具有“身份共性居顶、视角特异细节居底”的树状层次拓扑。而双曲空间由于其恒定负曲率带来的空间体积指数级膨胀,是天然适配树状层级关系的几何流形。本文的核心 idea 是构建分层双曲表征(HiHR)框架,通过文本引导多粒度融合(TMF)提取视角无关与视角感知特征,并在洛伦兹双曲流形中利用蕴涵锥(entailment cones)构建“粗粒度身份原型(父级)蕴涵细粒度视角特异特征(子级)”的层级几何约束,在保障全局跨视角身份可分性的同时,完整保留视角特有的判别细节。
方法详解¶
整体框架¶
HiHR 的整体推理流程包含三个紧密耦合的阶段:首先利用多粒度特征提取(MFE)从预训练 CLIP 的不同视觉层与双层文本提示中抽取多尺度表征;随后通过文本引导多粒度融合(TMF)完成跨粒度的自适应语义注入与补丁特征重聚合;最后通过分层双曲学习(HHL)将融合特征映射到洛伦兹双曲流形中,利用层级尺度分离与四重蕴涵锥正则化进行结构化对齐。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
IN["输入图像与双层提示词"] --> MFE["多粒度特征提取<br/>ViT 多层输出 + 视点双提示"]
MFE --> TMF["文本引导多粒度融合<br/>语义交叉注意力 + Patch 动态聚合"]
TMF --> HHL["分层双曲学习<br/>洛伦兹流形映射 + 蕴涵锥层级正则"]
HHL --> OUT["对数映射还原欧氏空间<br/>双级拼接输出检索特征"]
关键设计¶
1. 文本引导多粒度融合:跨层级视觉补丁与双层提示的语义绑定 单纯依赖骨干网络最后一层的全局分类标记往往会丢失中层几何结构与局部判别线索。针对这一缺陷,MFE 模块从预训练 CLIP 图像编码器的跨层深度 \(\{5, 8, 12\}\) 抽取包含 Class Token 与 Patch Tokens 的中间表征,并在文本端设计了视角无关提示(\(p_{vag}\):“A photo of [shared] person.”)与视角感知提示(\(p_{vaw}\):“A photo of [shared] person from [view-private] view.”)。为打破视觉与文本之间的模态鸿沟,TMF 模块以文本特征作为语义 Query,与多层抽取出的 Class Token 序列计算 Cross-Attention 得出动态注意力权重 \(\boldsymbol{\alpha}_k\): $\(\boldsymbol{\alpha}_k = \mathrm{softmax}\left(\frac{\mathbf{Q}_k \mathbf{K}^\top}{\sqrt{D}}\right),\quad \mathbf{t}_k = \boldsymbol{\alpha}_k \mathbf{V},\quad k \in \{vag, vaw\}\)$ 随后,模型直接复用该注意力权重 \(\boldsymbol{\alpha}_k\) 线性加权聚合多层视觉 Patch Tokens 得到 \(\mathbf{X}_k = \sum_{m=1}^M \alpha_k^{(m)} \mathbf{X}^{(l_m)}\),最后送入一个标准 Transformer 块完成全局语义标记与局部补丁的二次深度融合,输出两个互补的表征向量 \(\mathbf{s}_{vag}\)(视角无关,父级)与 \(\mathbf{s}_{vaw}\)(视角敏感,子级)。
2. 洛伦兹双曲层级映射与尺度分离初始化:树状几何的拓扑构建 在获得互补特征后,如何既让同一行人的特征在全局保持紧凑,又不抹杀特定视角的细粒度差异是核心难点。HHL 选取常负曲率 \(-c\)(\(c > 0\))的洛伦兹流形作为底层嵌入空间。为建立稳定的粗到细(coarse-to-fine)层级拓扑,模型在欧氏空间对两类特征进行模长归一化并施加显式可学习尺度分离: $\(\mathbf{g}^p = s_1 \frac{\mathbf{s}_{vag}}{\|\mathbf{s}_{vag}\|_2},\quad \mathbf{g}^c = s_1 s_2 \frac{\mathbf{s}_{vaw}}{\|\mathbf{s}_{vaw}\|_2},\quad s_1 > 0,\ s_2 > 1\)$ 其中 \(s_1\) 控制整体半径,\(s_2 > 1\) 强制使子级特征在几何上比父级特征离流形原点更远,契合双曲空间中“越接近边界、表征容量越呈指数膨胀”的几何特质,为细粒度视角特异性线索留出充裕的分离空间。随后通过原点指数映射 \(\exp_{\mathbf{o}}^c(\cdot)\) 将特征投影至双曲流形,得到双曲父特征 \(\mathbf{z}^p\) 与双曲子特征 \(\mathbf{z}^c\)。
3. 四重双曲蕴涵锥正则化与双层监督:约束子簇漂移并对齐模态 仅靠尺度分离无法避免细粒度子特征跨身份漂移与混叠。HHL 在批次内按身份计算父级特征欧氏均值原型并投影为双曲原型 \(\mathbf{z}^\pi\),为该身份划定双曲蕴涵锥 \(\omega(\mathbf{z}^\pi)\)(半开角取决于原型距原点距离)。若子嵌入点 \(\mathbf{z}^c\) 脱离原型的蕴涵区域,则触发惩罚: $\(\mathcal{L}_e(\mathbf{x}, \mathbf{y}) = \max\big(0, \phi(\mathbf{x}, \mathbf{y}) - \omega(\mathbf{x})\big)\)$ 为确保视觉与文本在层级语义上严格对齐,HHL 进一步引入了系统性的四重蕴涵锥约束(图 3):除了原型对视觉子特征的约束 \(\mathcal{L}_e(\mathbf{z}^\pi, \mathbf{z}^c)\) 之外,还包括父文本对子文本的约束 \(\mathcal{L}_e(\mathbf{z}_P^p, \mathbf{z}_P^c)\)、以及同级文本对图像特征的约束 \(\mathcal{L}_e(\mathbf{z}_P^p, \mathbf{z}^p)\) 和 \(\mathcal{L}_e(\mathbf{z}_P^c, \mathbf{z}^c)\)。同时,在监督信号上采用层级解耦策略:对父级特征 \(\mathbf{g}^p\) 施加全局跨视角标签平滑交叉熵与三元组损失 \(\mathcal{L}_g(\mathbf{g}^p)\) 驱动粗粒度跨视点身份紧凑,而对子级特征 \(\mathbf{g}^c\) 仅在同视点内采样正负样本计算 \(\mathcal{L}_{g,\mathrm{intra}}(\mathbf{g}^c)\),严防跨视角监督反向抹平视角特有细节。
损失函数 / 训练策略¶
整体训练联合优化双层度量监督与四重蕴涵正则项: $\(\mathcal{L} = \mathcal{L}_g(\mathbf{g}^p) + \mathcal{L}_{g,\mathrm{intra}}(\mathbf{g}^c) + \lambda_e \Big[ \mathcal{L}_e(\mathbf{z}^\pi, \mathbf{z}^c) + \mathcal{L}_e(\mathbf{z}_P^p, \mathbf{z}_P^c) + \mathcal{L}_e(\mathbf{z}_P^p, \mathbf{z}^p) + \mathcal{L}_e(\mathbf{z}_P^c, \mathbf{z}^c) \Big]\)$ 骨干网络采用 CLIP-ViT-B/16,图像缩放为 \(256 \times 128\),采用 Adam 优化器训练 60 轮(Batch Size 为 64,每身份采 4 张)。随机初始化模块学习率为 \(3.5 \times 10^{-4}\),预训练参数学习率为 \(5 \times 10^{-6}\)。默认超参数设为 \(c=1.0, \lambda_e=5, s_1=0.5, s_2=2.0\)。在测试阶段,直接通过双曲对数映射 \(\log_{\mathbf{y}}^c(\cdot)\) 将 \(\mathbf{z}^p\) 与 \(\mathbf{z}^c\) 映回欧氏正切空间,分别除以 \(s_1\) 与 \(s_1 s_2\) 恢复尺度后拼接为最终检索向量。
实验关键数据¶
主实验¶
论文在 AG-ReID、AG-ReID v2、CARGO 以及真实采集的 LAGPeR 四大公开基准上与主流方法展开全面评估。
原论文 Table 2:CARGO 合成大规模基准评测对比(%)
| 方法 | ALL mAP | ALL R1 | A→G mAP | A→G R1 | A→A mAP | A→A R1 | G→G mAP | G→G R1 |
|---|---|---|---|---|---|---|---|---|
| VDT [33] | 55.20 | 64.10 | 42.76 | 48.12 | 66.83 | 82.50 | 71.59 | 82.14 |
| SeCap [22] | 56.89 | 64.72 | 46.37 | 48.75 | 66.90 | 82.50 | 75.24 | 82.54 |
| GSAlign [13] | 57.95 | 65.06 | 61.55 | 64.89 | 65.55 | 80.00 | 73.86 | 83.04 |
| SAS-VPReID [31] | 58.48 | 64.42 | 57.36 | 58.51 | 63.41 | 70.00 | 76.90 | 83.93 |
| LATex [32] | 67.09 | 76.96 | 58.88 | 66.87 | 69.06 | 80.00 | 79.90 | 90.18 |
| HiHR (本文) | 67.52 | 74.36 | 70.53 | 75.53 | 69.60 | 75.00 | 80.93 | 87.50 |
在最具挑战性的空对地跨视角检索(A→G)协议下,HiHR 的 mAP 达到 70.53%,较此前最强方法 LATex(58.88%)提升了整整 +11.65% mAP,Rank-1 达到 75.53%(提升 +8.66%)。在 LAGPeR 真实数据集(原论文 Table 3)上,HiHR 在 A→G 协议下取得 33.80% mAP / 46.95% Rank-1,同样全方位超越基线。
消融实验¶
消融实验在 CARGO 数据集上系统检验各关键组件与损失项的有效性。
原论文 Table 4:核心模块分步消融(CARGO 数据集)
| 配置 | ALL mAP | ALL R1 | A→G mAP | A→G R1 | 说明 |
|---|---|---|---|---|---|
| Baseline (CLIP-ViT) | 63.61 | 68.23 | 66.06 | 66.02 | 纯欧氏度量基线 |
| + TMF | 65.46 | 72.08 | 69.50 | 70.28 | 引入文本引导多粒度融合,A→G mAP 涨 +3.44% |
| + TMF + HHL (Full Model) | 67.52 | 74.36 | 70.53 | 75.53 | 加入双曲层级学习,A→G mAP 进一步涨至 70.53% |
原论文 Table 5:四重蕴涵锥正则损失消融(CARGO 数据集)
| \(\mathcal{L}_e(\mathbf{z}^\pi, \mathbf{z}^c)\) | \(\mathcal{L}_e(\mathbf{z}_P^p, \mathbf{z}_P^c)\) | \(\mathcal{L}_e(\mathbf{z}_P^p, \mathbf{z}^p) + \mathcal{L}_e(\mathbf{z}_P^c, \mathbf{z}^c)\) | ALL mAP | ALL R1 | A→G mAP | A→G R1 |
|---|---|---|---|---|---|---|
| \(\times\) | \(\times\) | \(\times\) | 64.62 | 71.15 | 68.06 | 72.34 |
| \(\checkmark\) | \(\times\) | \(\times\) | 65.46 | 72.12 | 69.50 | 70.21 |
| \(\checkmark\) | \(\checkmark\) | \(\times\) | 65.71 | 72.44 | 68.21 | 71.28 |
| \(\checkmark\) | \(\checkmark\) | \(\checkmark\) | 67.52 | 74.36 | 70.53 | 75.53 |
关键发现¶
- 双曲层级约束与视点内细化的互补性:单靠欧氏空间的多粒度融合(TMF)虽然能提升表征能力,但在直接跨视角监督下仍会出现局部细节崩塌;HHL 通过引入洛伦兹流形与蕴涵锥,在保证身份收敛的同时将细粒度搜索空间拓展开,使跨视角 A→G 获得最高增益。
- 全排序质量(mAP)的显著提升:消融与主实验表明,HiHR 的增益普遍在全列表综合排序指标 mAP 上表现得尤为突出(CARGO A→G mAP 达 70.53%),说明双曲层次结构有效减少了非相关假阳性样本的排名靠前问题。
- 跨层级多粒度融合的选择:层选择实验证明 \(\{5, 8, 12\}\) 的跨层组合优于密集高层组合 \(\{10, 11, 12\}\),证明兼顾中间层结构语义与顶层语义至关重要,过多层简单堆叠反而会引入噪声。
亮点与洞察¶
- 将空地跨视角匹配问题映射为树状拓扑并引入双曲几何:传统方法将跨视角差异视为单纯的域偏置(Domain Shift)并强行对齐,HiHR 洞察到“同一身份下的不同视点”本质上是“共性父节点”与“个性子节点”的包含关系,利用洛伦兹流形的负曲率指数空间完美安放了视角特异性特征。
- 视觉层级与提示词层级的严格共轭对齐:不仅对图像特征做父子解耦,还在提示词端显式划分通用提示与视点专用提示,通过四重蕴涵锥让图文模态在不同抽象层级上保持对偶一致性,设计十分严谨优雅。
- 可迁移的层次化跨模态检索思想:这种“粗粒度保持跨域不变性 + 细粒度保留域内特异性 + 几何流形蕴涵正则”的设计,可以自然迁移至可见光-红外跨模态行人重识别(VI-ReID)、跨视角车辆检索等类似场景。
局限与展望¶
- 作者承认的局限:模型涉及双曲空间映射、双路 Transformer 交互以及多重双曲蕴涵计算,相较于纯欧氏单主干网络,训练阶段的数学计算开销和内存占用有所增加。
- 实际应用局限:测试阶段虽然将特征映射回欧氏空间拼接计算欧氏余弦距离以保持快速检索,但特征维度实际上翻倍为父子特征拼接,增大了大规模底库的存储与比对成本。
- 未来方向:探索直接在双曲空间内构建轻量索引与近似最近邻搜索(ANN),避免频繁在流形与切空间之间往返转换;同时可进一步拓展到多源异构无人机协同跟踪场景。
相关工作与启发¶
- vs VDT [33] / SeCap [22]: 以往工作尝试在欧氏空间内解耦视点相关与无关特征,但由于欧氏平直空间的容量受限,难以同时兼顾视点无关特征的跨视角紧凑与视点特异特征的自由度;HiHR 借助双曲几何天然容纳树状层级的优势,根治了强行对齐导致的细节塌陷。
- vs CLIP-ReID [14] / LATex [32]: 早期将 CLIP 引入 ReID 的方案主要采用单一全局提示或单一视点适配;HiHR 构建了 Dual-Level Prompts(双层提示),分别驱动全局语义与视角特异语义,并以语义为引导自适应聚合 Patch 级特征,粒度刻画更精细。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ [首次将分层双曲表示与蕴涵锥引入空地行人重识别,打破传统欧氏强对齐瓶颈]
- 实验充分度: ⭐⭐⭐⭐⭐ [在四大基准全面评测,包含跨层、损失项、提示类型及超参敏感性多维消融]
- 写作质量: ⭐⭐⭐⭐⭐ [动机叙述逻辑清晰,数学定义与框架图对应严密]
- 价值: ⭐⭐⭐⭐☆ [为异构跨视点检索提供全新的几何视角,兼具理论新意与落地效果]