QVAM: Query-guided View-aware Adaptive Modulation for Aerial-Ground Person Re-Identification¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/Sakuraandroxy/QVAM
领域: 遥感
关键词: 空地行人重识别 / 连续视角建模 / 自适应特征调制 / 跨视角原型对齐
一句话总结¶
针对无人机与地面监控间剧烈且连续的视角差异,QVAM 抛弃粗粒度二值视角解耦与刚性正交约束,利用可学习视角查询蒸馏局部细粒度视角线索,自适应调制 [CLS] 特征以过滤视角偏置,并结合双视角动量原型对齐损失实现判别性跨视角行人检索。
研究背景与动机¶
空地行人重识别(Aerial-Ground Person Re-Identification, AGPReID)旨在跨无人机(UAV)空中俯视镜头与地面固定/穿戴监控网络检索同一目标行人,是智能安防监控、大范围搜救与嫌疑人追踪的核心技术。相比传统同构地面相机网络,AGPReID 面临空中高空俯拍与地面平视之间的剧烈视角差异。这种差异会导致极其严重的跨视角特征未对齐现象——同一个人在俯视与平视下的外观投影截然不同,导致类内相似度骤降,而不同行人在高空俯视下的局部共性特征又容易引发类间混淆,使得常规 ReID 模型泛化性能严重退化。
为了弥合空地视角鸿沟,现有主流方法(如 VDT、SeCap)普遍采用粗粒度的二值标签(仅将视角分为“空中”或“地面”)来监督视角特异性特征学习,并通过正交损失强制视角特征与身份特征解耦。然而,无人机在实际巡检作业中伴随着飞行高度、俯仰角与拍摄距离的动态连续变化,空中视角本质上是高度连续且分布多样的,粗暴的二值标签无法表征这种连续视角漂移,造成空中视角特征内部碎片化。此外,刚性正交约束过于严苛:视角特异性特征与身份表征之间往往存在天然耦合(例如行人在俯视角度下的发型、肩部轮廓与体态依然具有身份判别力),强行正交化容易过度抹杀有价值的共享语义与身份判别线索。
针对上述两大约束,本文提出了一种基于视角查询引导的自适应特征调制框架(QVAM)。本文不再追求硬性的特征正交分离,而是通过隐式查询交互自适应提取细粒度的连续视角线索,以此指导动态通道调制,在滤除视角敏感偏置的同时最大程度保留身份判别信息。核心 idea:利用可学习视角查询从图像局部 patch 中蒸馏细粒度连续视角线索,自适应预测通道调制掩码以抑制 [CLS] 特征中的视角偏置,并结合双视角原型对齐损失在批次与记忆库双层级拉近空地特征分布。
方法详解¶
整体框架¶
QVAM 基于标准 Vision Transformer(ViT)骨干网络构建。输入空地行人图像首先被划分为不重叠的局部 patch 并送入 ViT 编码器,输出全局 [CLS] token 以及一组局部 patch token。随后,方法通过三大协同模块完成视角感知与特征调制:视角感知解码器(VAD)利用一组可学习视角查询与局部 patch token 交互,蒸馏出细粒度连续视角嵌入;自适应特征调制模块(AFM)结合身份全局上下文与视角查询嵌入,预测动态调制掩码对 [CLS] token 进行通道级缩放,生成视角色盲且保留身份判别力的特征;最后,跨视角原型对齐损失(CVPA)维护空地双视角动态记忆库,在批次质心与对向视角原型之间施加双层级对齐约束,引导全局特征分布对齐。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
IN["输入空地行人图像"] --> VIT["ViT 骨干网络<br/>提取 [CLS] 与 Patch Tokens"]
VIT -->|"Patch Tokens"| VAD["视角感知解码器 VAD<br/>可学习 Query 蒸馏连续视角线索"]
VIT -->|"[CLS] Token"| AFM["自适应特征调制 AFM<br/>身份注入 + 视角微调生成通道掩码"]
VAD -->|"视角查询嵌入 Q_view"| AFM
AFM -->|"视角不变量特征 f_inv"| OUT["跨视角原型对齐 CVPA<br/>动量双视角记忆库 + 批次与全局对齐"]
OUT --> LOSS["联合优化目标<br/>CE + Triplet + CVPA + 多样性与正则化"]
关键设计¶
1. 视角感知解码器:利用可学习查询蒸馏连续局部视角线索
以往工作依赖粗粒度二值分类标签(0/1)监督视角特征,无法感知飞行高度和俯仰角引起的渐变视角漂移。VAD 采用标准 Transformer 解码器结构,引入 \(L\) 个可学习视角查询向量 \(\mathbf{Q} \in \mathbb{R}^{B \times L \times C}\)。首先通过多头自注意力(MSA)建立查询之间的语义上下文关联,随后以这些查询作为 \(Q\),将骨干网络提取的局部 patch token \(\mathcal{T}_{\text{patch}} \in \mathbb{R}^{B \times N \times C}\) 作为 \(K\) 和 \(V\) 进行多头交叉注意力(MCA)聚合,经 FFN 投射后生成视角感知查询嵌入 \(\mathbf{Q}_{\text{view}}\):
为了防止多个查询在训练过程中发生模式坍塌、聚集于相似区域,本文提出了查询多样性损失 \(\mathcal{L}_{\text{div}}\)。该损失约束任意两个不同查询在 patch 维度的归一化注意力权重向量 \(\mathbf{a}_{i,j}\) 与 \(\mathbf{a}_{i,k}\) 保持正交,促使不同查询自主聚焦于行人人体的不同空间部位,从而全面捕获头部、肩颈、下肢等不同区域在俯仰角变化下的细粒度几何形变:
2. 自适应特征调制:由粗到细的身份保持通道调制
直接对特征进行正交投影容易误伤与视角纠缠的身份判别信息。AFM 模块采用动态通道加权机制,分两阶段生成通道调制掩码。首先是身份上下文注入:初始化一个共享可学习掩码向量 \(\mathbf{m} \in \mathbb{R}^{1 \times C}\),将其沿批次维度广播后与 [CLS] token \(\mathbf{x}_{\text{cls}}\) 融合,得到包含全局身份语义的中间掩码 \(\mathbf{m}' = \mathbf{m} + \text{FFN}(\mathbf{x}_{\text{cls}})\),确立特征选择的身份基准;随后是视角自适应细化:以 \(\mathbf{m}'\) 为查询,以经过自注意力建模的视角查询嵌入 \(\text{MSA}(\mathbf{Q}_{\text{view}})\) 为键和值执行交叉注意力,经 FFN 与 Sigmoid 激活函数映射到 \((0, 1)\) 区间,输出连续动态掩码 \(\mathbf{M} \in \mathbb{R}^{B \times C}\):
基于掩码 \(\mathbf{M}\),对原始 [CLS] 特征进行元素级乘法缩放,得到视角不变候选特征 \(\mathbf{f}_{\text{inv}} = \text{FFN}(\mathbf{x}_{\text{cls}} \odot \mathbf{M})\) 与被抑制的残差特征 \(\mathbf{f}_{\text{res}} = \text{FFN}(\mathbf{x}_{\text{cls}} \odot (1 - \mathbf{M}))\)。为了避免掩码权重大多游离在 0.5 附近导致通道语义划分模糊,引入掩码熵正则化损失 \(\mathcal{L}_{\text{reg}}\),以软约束推动掩码值远离不确定平衡态,明确各通道的抑制或保留倾向。
3. 跨视角原型对齐:双视角记忆库的跨视角原型拉近
仅依靠网络内部调制无法彻底消除特征在跨模态分布上的统计偏置。CVPA 构建空中与地面两个独立的身份原型记忆库 \(\mathbf{M}^A, \mathbf{M}^G \in \mathbb{R}^{I \times C}\)。在每个训练步骤中,首先计算当前批次中每个身份在空中与地面视角的局部质心 \(\boldsymbol{\mu}_i^A\) 与 \(\boldsymbol{\mu}_i^G\)。不同于传统对比学习在计算损失后再更新记忆库的惯例,QVAM 在损失计算前即利用动量衰减更新原型 \(\mathbf{p}_i^v \leftarrow \alpha \mathbf{p}_i^v + (1 - \alpha) \boldsymbol{\mu}_i^v\)。由于后续对齐仅与对向视角的历史原型对齐,天然不存在同视角信息泄漏风险,该策略能显著缓解记忆库冷启动问题。
对齐包含批次内对齐与记忆库级对齐两个互补层次:批次损失 \(\mathcal{L}_{\text{batch}}\) 最小化同一身份在当前 batch 内部空地质心的欧氏距离,增强即时相对拉近;记忆库损失 \(\mathcal{L}_{\text{mem}}\) 则强制空中批次质心逼近地面历史原型 \(\mathbf{p}_i^G\),同时地面批次质心逼近空中历史原型 \(\mathbf{p}_i^A\):
总对齐损失 \(\mathcal{L}_{\text{CVPA}} = \mathcal{L}_{\text{batch}} + \mathcal{L}_{\text{mem}}\) 确保了空地行人特征在全局语义空间中维持紧凑而一致的分布。
损失函数 / 训练策略¶
模型的总训练目标包含初始骨干网络监督、调制特征监督、分布对齐以及辅助正则化:
其中 \(\mathcal{L}_{\text{cls}}\) 对骨干输出的初始 [CLS] token 施加交叉熵与 Triplet 损失以保证基础判别力;\(\mathcal{L}_{\text{inv}}\) 对调制前后的特征施加 Triplet 损失,并对最终视角不变特征 \(\mathbf{f}_{\text{inv}}\) 施加交叉熵损失;超参数设置上,动量系数 \(\alpha = 0.9\),权重分别设为 \(\beta = 1\)、\(\gamma = 1\)、\(\xi = 0.01\)。模型在单张 NVIDIA RTX 3080 Ti 上训练,采用 ImageNet 预训练的 ViT-B/16,图片尺寸为 \(256 \times 128\),Batch Size 设为 128(32 个身份,每身份 4 张图像),SGD 初始学习率 \(8 \times 10^{-3}\),余弦退火衰减。
实验关键数据¶
主实验¶
在代表性空地跨视角重识别数据集 CARGO、真实数据集 AG-ReID 以及大规模多设备基准 AG-ReIDv2 上进行广泛评测。主要对比结果如下:
| 数据集 / 协议 | 评估指标 | 本文 (QVAM) | 之前 SOTA (SeCap / VIF) | 提升幅度 |
|---|---|---|---|---|
| CARGO (ALL) | Rank-1 / mAP / mINP | 78.85% / 71.02% / 60.25% | 68.59% / 60.19% / - (SeCap) | +10.26% / +10.83% |
| CARGO (A↔G) | Rank-1 / mAP / mINP | 72.50% / 64.41% / 52.78% | 69.43% / 58.94% / - (SeCap) | +3.07% / +5.47% |
| CARGO (A↔A) | Rank-1 / mAP | 85.00% / 79.63% | 80.00% / 68.08% (SeCap) | +5.00% / +11.55% |
| CARGO (G↔G) | Rank-1 / mAP | 91.07% / 82.62% | 86.61% / 75.42% (SeCap) | +4.46% / +7.20% |
| AG-ReID (A→G) | Rank-1 / mAP / mINP | 85.53% / 76.81% / 53.04% | 84.03% / 76.16% / - (SeCap) | +1.50% / +0.65% |
| AG-ReID (G→A) | Rank-1 / mAP / mINP | 88.46% / 80.52% / 55.12% | 87.32% / 79.19% / 52.98% (VIF) | +1.14% / +1.33% / +2.14% |
| AG-ReIDv2 (A→C) | Rank-1 / mAP | 88.41% / 82.29% | 88.12% / 80.84% (SeCap) | +0.29% / +1.45% |
| AG-ReIDv2 (W→A) | Rank-1 / mAP | 87.78% / 82.43% | 87.56% / 80.15% (SeCap) | +0.22% / +2.28% |
消融实验¶
在 CARGO 数据集上针对各个核心模块进行详细拆解实验(评估协议涵盖全库、跨视角与单视角):
| 配置 | ALL (Rank-1 / mAP) | A↔G (Rank-1 / mAP) | A↔A (Rank-1 / mAP) | G↔G (Rank-1 / mAP) | 说明 |
|---|---|---|---|---|---|
| ViT 骨干网络 | 71.15% / 62.21% | 59.38% / 53.46% | 82.50% / 68.04% | 83.93% / 75.54% | 基线 ViT-B/16 |
| + VAD | 74.36% / 67.63% | 64.38% / 59.86% | 80.00% / 74.08% | 86.61% / 79.74% | 仅添加视角感知解码器 |
| + AFM | 75.64% / 67.20% | 68.12% / 60.99% | 82.50% / 72.62% | 84.82% / 76.76% | 仅利用全局特征生成掩码调制 |
| + CVPA | 74.68% / 70.00% | 66.87% / 62.98% | 82.50% / 78.59% | 85.71% / 80.23% | 仅引入双视角原型对齐 |
| + VAD + AFM | 75.96% / 67.61% | 68.12% / 60.34% | 80.00% / 75.64% | 85.71% / 78.05% | 视角引导的特征调制 |
| Full Model (QVAM) | 78.85% / 71.02% | 72.50% / 64.41% | 85.00% / 79.63% | 91.07% / 82.62% | 完整模型(全部组件集成) |
关键发现¶
- 局部视角线索的关键作用:相比仅依靠全局身份语义调制(AFM-only),加入 VAD 后跨视角 A↔G 的 Rank-1 大幅提升 +3.74%(从 64.38% 增至 68.12%),证明可学习查询成功捕获了局部 patch 中随俯仰角变化的细微形变线索。
- 分布对齐与特征调制的强协同效应:在 VAD+AFM 结构上引入 CVPA 损失后,A↔G 的 Rank-1 进一步提高 +4.38%(从 68.12% 跃升至 72.50%),且在同视角协议 A↔A 和 G↔G 上亦分别提升 +5.00% 和 +5.36%,说明 CVPA 对抗了小批次内样本偏差,促使调制特征在全局分布上拉近。
- 超参数适度性与视角特征二象性:掩码熵正则化权重 \(\xi\) 在大于 0.1 后性能显著下降。这印证了论文的核心发现:视角相关通道并非纯粹的无用噪声,它们仍蕴含部分身份判别力,过度硬性的正则化(或二值化裁剪)会损害特征丰富度。视角查询数量 \(L\) 在 64 时达到最佳平衡,过多(\(L=128\))会因冗余查询关注到背景杂波而导致性能滑坡。
亮点与洞察¶
- 解耦观念的纠偏:打破了 AGPReID 领域长期依赖“二值标签监督 + 强制正交投影”的思维惯性,指出连续仰角变化无法由二值标签表征,且硬性正交会抹除视角与身份耦合的有用几何先验。自适应通道掩码调制提供了兼顾偏置滤除与身份保留的更优折中。
- 正交性多样化查询设计:在无显式边界框与空间监督的情况下,通过简单的注意力正交损失 \(\mathcal{L}_{\text{div}}\) 驱动多个可学习查询自发分散在人体头部、肩胸与下肢区域,实现了无监督的语义部位自适应感知。
- 跨视角原型反向更新与免泄露:针对重识别领域动量记忆库容易发生信息泄漏的顾虑,巧妙利用仅对齐对向视角(跨模态)原型的特性,在损失计算前即进行动量合并,从根本上消除了同视角泄露风险并解决了冷启动震荡。
局限与展望¶
- 计算开销略微增加:引入了额外的 Transformer 解码器层与动态交叉注意力计算,相较于纯单分支 ViT 骨干,在训练阶段的内存消耗与计算时间有所增加(尽管推理阶段主要使用调制后的 [CLS] 向量)。
- 极端光照与复杂遮挡工况:实验主要在白昼良好能见度场景及常规遮挡下验证;若无人机夜间巡航或面临密集树冠大面积重度遮挡,局部 patch 视角线索可能严重受损,影响 VAD 的特征蒸馏质量。
- 可拓展到跨模态空地检索:该查询引导的调制机制非常适合推广到红外-可见光空地夜间检索(RGB-IR AGPReID)或文本-空中视频跨模态行人定位任务中。
相关工作与启发¶
- vs VDT (CVPR 2024):VDT 在 [CLS] 层面引入固定的视角 token 并施加正交损失进行二值解耦;本文指出其正交损失过于刚性且二值分类无法适应高度与仰角连续变化,改用可学习视角查询蒸馏局部多尺度视角并做软性通道调制。
- vs SeCap (CVPR 2025):SeCap 采用自校准与自适应提示(Prompt)来学习视角不变局部特征;QVAM 专注于全局 [CLS] 特征的高效调制,并创新设计了双视角动量记忆库原型对齐损失,在 CARGO ALL 上取得了超越 SeCap 10 个百分点以上的显著优势。
- vs VIF (ICCV 2025):VIF 侧重于通过 Patch-Level RotateMix 等数据增强模拟视角变换;QVAM 则从特征架构与表示学习角度直接建模视角感知调制,二者在思路和技术维度上高度互补。
评分¶
- 新颖性: ⭐⭐⭐⭐ [针对连续视角与过度正交痛点,提出视角查询蒸馏与软性通道调制,视角独特且机理完备]
- 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 CARGO、AG-ReID、AG-ReIDv2 三大基准与多项协议,涵盖充足消融、参数敏感性分析与注意力可视化]
- 写作质量: ⭐⭐⭐⭐⭐ [叙述逻辑流畅,动机与实验结论高度自洽,图表清晰规范]
- 价值: ⭐⭐⭐⭐⭐ [为无人机空地立体安防监控与跨视角行人检索提供了突破性的技术基线,代码完全开源]