VIGA: View-Conditioned and Identity-Guided Adaptation for Aerial-Ground Person Re-Identification¶
会议: ECCV 2026
论文: ECCV 原文
PDF: 论文全文
领域: 人体理解
关键词: 空地行人重识别、视角条件化自适应、身份引导稀疏化、低秩自适应、软掩码衰减
一句话总结¶
针对无人机与地面监控跨平台行人重识别中的极度视角几何形变与显著背景噪声,VIGA 在特征激活层通过身份引导软掩码抑制背景并保持空间拓扑,在网络参数层通过视角条件化超网络动态生成低秩权重残差调制解码器变换,在 LAGPeR 与 AG-ReID.v2 数据集上取得 SOTA 检索表现。
研究背景与动机¶
随着无人机在安防巡检与智能监控中的广泛应用,空地行人重识别(Aerial-Ground Person Re-ID, AG-ReID)逐渐成为跨平台视觉分析的核心技术。与传统单一地基视角的重识别任务不同,空地场景下查询图像与候选库图像来源于截然不同的摄像机视角——高空大视野俯拍与地面水平平视。这种跨平台特性带来了两重严苛的分布偏移:一方面,无人机航拍视野广阔导致行人目标在图像中占比极低,周围充斥着大量地面杂波与动态背景干扰;另一方面,高空俯仰视角造成人体外形严重的非各向同性形变与尺度压缩,使得在地面视角中清晰可见的步态轮廓和衣物纹理发生剧烈畸变。
在特征激活层面,基于视觉 Transformer(ViT)的模型依赖注意力机制进行权重重分配,但 Softmax 的相对归一化只能在数值上相对抑制非相关区域,低权重的背景激活值仍然会沿着残差连接逐层累加并被放大,最终污染全局身份嵌入。现有的硬性 Token 剪枝方法虽然能过滤部分背景,却不可避免地破坏了特征图原有的 2D 空间拓扑结构与边缘连续性,容易切断人体关键语义过渡。在变换算子层面,传统模型使用单一共享骨干网络同时处理高空与地面输入,迫使前馈网络(FFN)在相互冲突的跨视角几何映射之间做出妥协,学到的是对两端都次优的折中表征;而先前的解耦或静态 Prompt 方案往往冻结骨干网络,未能在权重变换算子层面对几何偏移进行动态校正。
解决上述矛盾的切入点在于:既要在激活空间利用身份先验无损拓扑地精确抑制背景累积,又要在参数空间为异构视角提供动态、轻量的算子自适应能力。核心 idea:联合设计“激活层身份引导稀疏化”与“参数层视角条件化低秩调制”,前者以解耦的纯净身份表征为语义引导自适应软衰减背景噪声,后者利用视角 Token 驱动超网络动态合成解码器 FFN 的低秩权重残差,实现端到端的跨视角几何对齐与纯净表征学习。
方法详解¶
整体框架¶
VIGA 采用三阶段端到端网络架构:首先利用 ViT 骨干网络提取图像的多粒度表征并完成身份与视角的正交解耦;随后通过身份引导稀疏化(IGS)模块评估局部 Patch 与全局身份语义的相关性,对背景区域施加软掩码衰减以净化特征交互;最后将净化后的局部特征与身份特征送入视角条件化解码器(View-Conditioned Decoder),由视角 Token 通过超网络实时预测低秩残差矩阵以自适应调整 FFN 权重,完成跨视角几何对齐。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
IN["输入空地行人图像<br/>(航拍俯视 / 地面水平视)"] --> ENC["ViT 编码器提取特征<br/>cls Token + view Token + 局部 Patches"]
ENC --> S1["身份-视角解耦<br/>减法去偏置与正交角约束"]
S1 --> S2["身份引导稀疏化 (IGS)<br/>余弦相关度打分与软掩码衰减"]
S2 --> S3["视角条件化解码器<br/>双向交叉注意力交互"]
S3 --> S4["视角条件化低秩自适应 (VC-LoRA)<br/>超网络动态合成 FFN 权重残差"]
S4 --> OUT["判别性空地表征输出<br/>用于跨平台身份检索匹配"]
关键设计¶
1. 身份-视角解耦:减法去偏置与正交约束剥离视角干扰 针对传统全局分类 Token(\(f_{cls}\))容易将身份语义与摄像机视角先验严重纠缠的问题,模型在骨干网络中引入专用的视角 Token(\(f_{view}\))。在每个 Transformer 层级中,将视角 Token 作为当前相机几何特性的原型,通过减法操作从全局表征中显式剥离视角偏置: $\(F_{id}^{(l)} = \text{LayerNorm}(f_{cls}^{(l)} - f_{view}^{(l)})\)$ 为了确保身份特征 \(F_{id}\) 与视角特征 \(f_{view}\) 在表征流形上彻底解耦,避免残余视角信息渗透,网络在最终输出层施加严格的正交损失,最小化二者在角度空间中的余弦相似度平方,确保提取的身份表征对视角变化具备不变性。
2. 身份引导稀疏化(IGS):软掩码衰减抑制背景噪声并保留空间拓扑 为了解决无人机大视野图像中背景杂波顺着 Transformer 残差连接逐层扩散放大、污染身份特征的问题,同时避免硬剪枝破坏 2D 网格拓扑,IGS 模块将解耦后的全局身份向量 \(F_{id}\) 用作自顶向下的语义探针。首先计算每个局部 Patch 词元 \(f_i\) 与 \(F_{id}\) 的余弦相似度得分 \(s_i = \frac{F_{id}^\top f_i}{\|F_{id}\| \|f_i\|}\),该得分直接反映了局部区域属于行人前景的置信度。随后选取相关度最高的保留比例 \(\rho = 87.5\%\) 的 Patch 索引集合 \(\mathcal{I}_{top}\),对非人体主体区域赋予强衰减因子 \(\epsilon = 10^{-3}\) 构建确定性软掩码: $\(\mathcal{M}_i = \begin{cases} 1, & \text{若 } i \in \mathcal{I}_{top} \\ \epsilon, & \text{其他} \end{cases}\)$ 局部特征按元素与掩码相乘:\(\hat{f}_i = \mathcal{M}_i \cdot f_i\)。此设计完整保留了所有 \(L\) 个空间 Patch 的排列位置,既完全消除了硬截断带来的特征断崖,又将背景响应压低至几乎为零;位置编码在衰减后不回加到局部特征中,而是作为空间 Query 并行输入解码器,彻底阻断了背景噪声的再次放大。
3. 视角条件化低秩自适应(VC-LoRA):超网络动态调制解码器权重 针对静态解码器 FFN 无法同时兼容高空俯视挤压形变与地面直立形态这一几何映射冲突,VC-LoRA 在解码器前馈层中引入由输入视角动态调控的低秩自适应分支。解码器 FFN 的权重矩阵由静态基准权重 \(W_0\) 与视角条件增量 \(\Delta W\) 组合而成: $\(W(v) = W_0 + \alpha \Delta W, \quad \Delta W = A B\)$ 其中 \(A \in \mathbb{R}^{d_{in} \times r}\) 与 \(B \in \mathbb{R}^{r \times d_{out}}\) 为低秩分解矩阵(本方案设秩 \(r=16 \ll \min(d_{in}, d_{out})\)),二者并非静态参数,而是由轻量超网络 \(\Phi_A\) 和 \(\Phi_B\) 根据样本的视角 Token \(f_{view}\) 前向实时推断得到: $\(A = \Phi_A(f_{view}), \quad B = \Phi_B(f_{view})\)$ 超网络输出的低秩残差使得解码器能够在仅引入极少参数量(小于 1%)的前提下,根据输入是航拍还是地面自适应调整其非线性几何映射能力。在初始化时,矩阵 \(B\) 遵循 LoRA 惯例置零,使得训练起始阶段网络退化为标准预训练解码器,确保了动态参数训练的平稳收敛。
损失函数 / 训练策略¶
模型采用端到端联合优化,总目标损失函数由三项构成: $\(\mathcal{L}_{total} = \mathcal{L}_{id} + \lambda_1 \mathcal{L}_{view} + \lambda_2 \mathcal{L}_{orth}\)$ 1. 身份判别损失 \(\mathcal{L}_{id}\):由交叉熵分类损失与带难样本挖掘的 Triplet 损失(Hard-mining Triplet Loss)加权组成,作用于解码器聚合后的最终全局身份嵌入,强化同类特征聚集并推开异类样本。 2. 视角分类损失 \(\mathcal{L}_{view}\):采用标准交叉熵损失监督视角 Token \(f_{view}\) 预测航拍或地面的真实标签 \(v_i \in \{\text{aerial}, \text{ground}\}\),迫使该 Token 充分编码当前相机视角的几何与光照特征: $\(\mathcal{L}_{view} = -\frac{1}{B} \sum_{i=1}^B \log p(v_i \mid f_{view}^{(i)})\)$ 3. 正交约束损失 \(\mathcal{L}_{orth}\):通过惩罚身份特征与视角特征之间的内积平方,强制二者在隐空间方向正交: $\(\mathcal{L}_{orth} = \left( \frac{\langle F_{id}, f_{view} \rangle}{\|F_{id}\|_2 \|f_{view}\|_2} \right)^2\)$ 训练采用 ViT-B/16 作为骨干网络,输入图像分辨率调整为 \(256 \times 128\)。使用 SGD 优化器(动量 0.9,初始学习率 \(8 \times 10^{-3}\)),配合余弦退火策略训练 120 轮,Batch Size 设为 64(包含 16 个身份、每身份 4 张图像)。
实验关键数据¶
主实验¶
在代表性的大规模空地跨平台重识别数据集 LAGPeR(21 台摄像机、4,231 个身份)与 AG-ReID.v2(无人机、CCTV、穿戴式设备三平台共 1,605 个身份)上开展评测,评价指标为 Rank-1 准确率(%)与平均精度均值 mAP(%)。所有对比方案均采用 ViT 骨干网络以确保基准公平。
表 1:LAGPeR 数据集跨平台检索性能对比(A: 航拍视角, G: 地面视角) | 方法 | 骨干网络 | A → G Rank-1 | A → G mAP | G → A Rank-1 | G → A mAP | G → A+G Rank-1 | G → A+G mAP | |---|---|---|---|---|---|---|---| | ViT 基线 | ViT | 38.67 | 27.25 | 32.04 | 30.69 | 18.88 | 15.31 | | TransReID | ViT | 38.80 | 28.80 | 33.00 | 32.10 | 22.90 | 18.80 | | CLIP-ReID | CLIP-ViT | 24.40 | 17.60 | 21.30 | 20.80 | 12.30 | 10.20 | | MIP | ViT | 39.30 | 29.30 | 33.90 | 32.60 | 21.00 | 17.30 | | AG-ReID | ViT | 40.48 | 28.89 | 32.96 | 31.91 | 22.03 | 17.89 | | VDT | ViT | 40.15 | 28.97 | 33.55 | 31.98 | 19.50 | 16.45 | | SeCap | ViT | 41.79 | 30.37 | 35.26 | 33.42 | 24.39 | 19.24 | | VIGA (本文) | ViT | 43.47 | 31.52 | 36.05 | 34.44 | 25.11 | 20.18 |
表 2:AG-ReID.v2 数据集多平台交叉检索性能对比(C: 地面 CCTV, W: 穿戴式相机, A: 航拍无人机) | 方法 | 骨干网络 | A → C Rank-1 | A → C mAP | C → A Rank-1 | C → A mAP | A → W Rank-1 | A → W mAP | W → A Rank-1 | W → A mAP | |---|---|---|---|---|---|---|---|---|---| | BoT | ViT | 85.40 | 77.03 | 84.65 | 75.90 | 89.77 | 80.48 | 84.65 | 75.90 | | AG-ReID.v1 | ViT | 87.70 | 79.00 | 87.35 | 78.24 | 93.67 | 83.14 | 87.73 | 79.08 | | VDT | ViT | 86.46 | 79.13 | 86.14 | 78.12 | 90.00 | 82.21 | 85.26 | 78.52 | | AG-ReID.v2 | ViT | 88.77 | 80.72 | 87.86 | 78.51 | 93.62 | 84.85 | 88.61 | 80.11 | | SeCap | ViT | 88.12 | 80.84 | 88.24 | 79.99 | 91.44 | 84.01 | 87.56 | 80.15 | | VIGA (本文) | ViT | 88.88 | 82.37 | 88.96 | 81.51 | 90.36 | 84.39 | 87.95 | 81.75 |
消融实验¶
消融实验逐项验证各核心组件的有效性以及不同掩码策略的性能差异。
表 3:各模块在 LAGPeR 与 AG-ReID.v2 上的分步消融分析(数值为 %) | 配置 | LAGPeR A→G R-1 / mAP | LAGPeR G→A R-1 / mAP | LAGPeR G→A+G R-1 / mAP | AG-ReID.v2 A→C R-1 / mAP | AG-ReID.v2 C→A R-1 / mAP | 说明 | |---|---|---|---|---|---|---| | Baseline | 41.79 / 30.37 | 35.26 / 33.42 | 24.39 / 19.24 | 88.12 / 80.84 | 88.24 / 79.99 | 仅含解耦机制的基线 ViT | | + VC-LoRA | 42.78 / 31.00 | 35.36 / 34.00 | 24.39 / 19.90 | 88.12 / 82.01 | 88.18 / 81.20 | 引入视角条件化动态调制 | | + VC-LoRA + IGS (完整模型) | 43.47 / 31.52 | 36.05 / 34.44 | 25.11 / 20.18 | 88.88 / 82.37 | 88.96 / 81.51 | 结合软稀疏化与动态几何适配 |
表 4:IGS 软掩码与硬剪枝策略的检索性能对比 | 掩码策略 | LAGPeR A→G R-1 / mAP | LAGPeR G→A R-1 / mAP | LAGPeR G→A+G R-1 / mAP | AG-ReID.v2 A→C R-1 / mAP | AG-ReID.v2 C→A R-1 / mAP | AG-ReID.v2 W→A R-1 / mAP | |---|---|---|---|---|---|---| | 硬剪枝 (Hard Masking) | 41.76 / 30.65 | 34.60 / 33.67 | 25.25 / 19.89 | 88.67 / 82.40 | 87.85 / 81.36 | 87.63 / 81.07 | | 软掩码 (Soft Masking / VIGA) | 43.47 / 31.52 | 36.05 / 34.44 | 25.11 / 20.18 | 88.88 / 82.37 | 88.96 / 81.51 | 87.95 / 81.75 |
关键发现¶
- VC-LoRA 显著提升特征空间一致性:单独加入 VC-LoRA 后,AG-ReID.v2 在 A → C 上的 mAP 由 80.84% 提高到 82.01%,C → A 上的 mAP 由 79.99% 提升至 81.20%。这表明视角自适应的参数动态调整能更稳定地拉近高空与地面的复杂流形间距,提升更深层次的排序质量(mAP 增幅显著大于 Rank-1 增幅)。
- 软掩码显著优于硬剪枝:相比于直接抛弃局部 Token 的硬剪枝方案,软掩码在 LAGPeR A → G 协议下 Rank-1 提高了 +1.71%,在 G → A 上提高了 +1.45%。这是因为软衰减保留了人体完整的网格拓扑上下文,避免了边缘过渡处硬切断造成的几何线索丢失。
- 超参数敏感性:保留比例 \(\rho\) 在 87.5% 处取得峰值性能;过低的保留比例(如 50%)会损伤人体本身的判别线索,而保留全部 Token(100%)则会重新引入背景噪声。低秩维度 \(r\) 在 16 处达到最优平衡,过大的秩(32 或 64)在现有数据规模下会导致过拟合。
亮点与洞察¶
- 激活级与参数级双重校准:传统方案要么仅在特征输出层做特征剪除,要么通过全量微调增加开销。VIGA 将“激活层背景软过滤”与“算子层视角低秩调制”有机统一,以最小的参数计算开销同时攻克了背景噪声累积与几何映射冲突两大难题。
- 自顶向下的语义引导与拓扑无损:传统 Token 稀疏化多依据注意力权重绝对大小进行硬过滤,容易误删对比度偏弱的人体区域;IGS 创新性地利用解耦出的纯净身份特征作为自顶向下 Query 引导软衰减,既精准切断了背景残差传播,又完整维系了 2D 空间连续网格。
- 可复用的通用设计模式:基于超网络的视角条件化 LoRA(VC-LoRA)具备极高的通用性,该模块可即插即用迁移至其他跨域跨传感器任务中(如红外-可见光跨模态重识别、跨高度无人机跟踪),为多源感知下的参数轻量自适应提供了优秀范式。
局限与展望¶
- 作者承认的局限:模型依赖离散化的视角分类标签作为超网络输入。在连续变焦或相机俯仰角度连续变化的实际无人机巡检任务中,粗粒度的二元或三元视角标签无法精细建模连续倾角几何偏移。
- 潜在改进方向:可进一步将相机的连续姿态角(Pitch, Roll)或视差深度作为连续条件引入超网络输入;此外,目前保留比例 \(\rho\) 设定为全局固定超参数(87.5%),未来可探索基于图像显著性动态自适应预测最优保留比例。
相关工作与启发¶
- vs VDT (CVPR 2024): VDT 依赖减法解耦特征,但其骨干网络与解码器参数完全静态共享,无法解决算子层面的非线性几何映射冲突;VIGA 继承其减法解耦思想并加以正交角约束,进一步通过 VC-LoRA 赋予 FFN 视角专属调制能力,检索精度显著领先。
- vs SeCap (CVPR 2025): SeCap 通过在输入端引入静态 Prompt 进行跨视角自适应校准;VIGA 则深入解码器内部通过超网络动态生成权重残差,并在局部交互中结合了 IGS 拓扑软掩码,对高空稀疏目标周围的杂乱背景具备更强的抗噪能力。
- vs DTST (ICME 2025): DTST 采用动态硬剪枝丢弃背景 Token,易导致人体轮廓撕裂与优化不稳定;VIGA 采用确定性软掩码衰减,保留了全部网格位置与空间连续性,实验证明其在复杂跨视角下的整体鲁棒性明显更优。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ [双层自适应架构设计精巧,身份自顶向下引导与视角条件化 LoRA 结合紧凑]
- 实验充分度: ⭐⭐⭐⭐⭐ [涵盖 LAGPeR 与 AG-ReID.v2 全协议对比,消融、剪枝对比与参数敏感性分析详实完整]
- 写作质量: ⭐⭐⭐⭐⭐ [问题动机明确,公式定义严谨,方法逻辑链闭环完整]
- 价值: ⭐⭐⭐⭐☆ [为无人机巡检与空地多源跨域监控提供了高性能、低计算开销的通用范式]