Granular Semantic Cognition for Visible-Infrared Person Re-Identification¶
会议: ECCV 2026
论文: ECCV 原文
领域: 人体理解
关键词: 可见光红外跨模态行人重识别 / 细粒度语义认知 / 层次化原型细化 / 语义引导融合 / 跨身份解歧
一句话总结¶
针对红外模态缺失颜色信息导致跨模态对齐困难的痛点,提出细粒度语义认知方法(GSC),通过层次化原型细化与语义引导通道自适应融合将文本颜色线索精准补偿到红外相应局部,并设计融合加权身份对比损失消除跨身份语义歧义。
研究背景与动机¶
可见光-红外跨模态行人重识别(VI-ReID)在夜间和恶劣光照等智能监控场景中至关重要。然而,红外相机成像天然剥离了颜色与细致纹理,使得红外图像与全彩可见光图像之间存在巨大的跨模态分布鸿沟。现有主流方案或致力于挖掘模态共享特征空间,或借助生成对抗网络合成辅助样本;但前者在缺少关键颜色判别信息时检索上限受限,后者又极易引入生成伪影和训练不稳定性。
近期,引入文本描述作为辅助模态(如 TVI-LFM、CSDN 等)成为弥补红外缺失颜色线索的有力方向。然而,现有文本补偿方法大多停留在全局层面的粗粒度融合,直接将全局文本嵌入与图像特征做拼接或静态调制。这种机制的根本矛盾在于:行人着装在不同身体部位存在强烈的颜色异质性(例如红上衣配黑裤子),全局文本描述无法建立与红外图像局部解剖学结构的精准空间对应,极易将文本中的颜色先验错误扩散至不相关的身体区域。与此同时,传统基于原型学习的语义先验往往过于粗糙,难以聚焦于具体身体部位;而不同行人之间共享的普遍语义模式(如相似的身体构型或上衣先验)又会在融合时产生高度重叠的通道偏好,引发跨身份混淆。
为了克服这些局限,本文从细粒度局部语义认知与自适应补偿切入。核心 idea:通过多阶段层次化交互将可学习原型逐步细化为精准的局部身体语义,以此自适应生成通道级融合权重把文本颜色信息选择性注入红外特征对应区域,并借助融合加权身份对比损失约束融合行为以消除跨身份语义混淆。
方法详解¶
整体框架¶
GSC 的整体架构旨在建立红外局部结构与文本颜色先验之间的精细对应关系。网络采用 ResNet-50 作为视觉主干网络,提取可见光特征 \(F_{vis}\) 与红外特征 \(F_{ir}\),并利用文本编码器提取行人描述特征 \(F_t\)。整个系统包含两大核心模块与一个专有对比目标:首先由层次化细化模块(HRM)通过多阶段迭代逐步细化模态共享的原型先验;接着由语义引导调整模块(SAM)利用细化后的语义原型指导红外与文本的双向调制与通道级自适应融合;最终在身份分类和三元组约束之外,配合融合加权身份对比损失(\(\mathcal{L}_{FWIC}\))对样本的通道融合策略做身份级规整。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入:红外/可见光图像与文本描述"] --> B["层次化原型细化<br/>多阶段像素与原型交互"]
B --> C["语义引导通道调整<br/>双向调制与自适应融合"]
C --> D["融合加权身份对比约束<br/>身份一致融合行为正则"]
D --> E["跨模态行人特征判别与检索"]
关键设计¶
1. 层次化原型细化:逐阶段解耦并细化局部解剖学语义
为了解决传统原型学习颗粒度过粗、无法精确定位行人局部肢体部位的缺陷,HRM 引入了可学习语义原型 \(P^{(s)} = \{p_1^{(s)}, \dots, p_k^{(s)}\}\) 并配合可学习空间位置编码构建多阶段递进交互机制。在每个细化阶段 \(s\),模型首先计算像素级特征 \(t_{m,j}^{(s)}\) 与各原型归一化向量之间的余弦相似度,得到空间分配概率矩阵:
依据分配概率 \(S_m^{(s)}(i,j)\) 对全图空间特征加权求和,抽取出当前阶段各局部部位表征 \(g_{m,i}^{(s)}\)。随后,利用轻量级双层 MLP 对提取的部位特征进行局部增强,得到细化部位特征 \(\tilde{g}_{m,i}^{(s)}\),并将其通过概率权重反向广播回各个像素点,更新下一阶段的像素表征 \(T_{m,j}^{(s+1)} = T_{m,j}^{(s)} + \sum_{i=1}^k S_m^{(s)}(i,j)\tilde{g}_{m,i}^{(s)}\)。为防止不同原型退化为同质特征,HRM 引入原型多样性损失 \(\mathcal{L}_{pd}\) 惩罚不同原型在空间特征投影上的两两相关性,强迫 \(k\) 个原型各自分工并演进为互不重叠的高分辨率解剖学语义锚点。
2. 语义引导通道调整:基于局部语义先验的自适应色彩补偿
获得高保真的细粒度语义后,SAM 模块负责将文本中蕴含的色彩线索无歧义地整合至红外特征中。SAM 包含双向跨模态交互和通道门控两大机制:一方面,利用全局文本特征作为动态语义滤波器,通过深度方向相关(depthwise correlation)与红外特征逐像素交互,选择性增强红外图像中与外观描述相符的空间区域;同时利用红外特征全局平均池化的统计量对文本特征进行通道注意力重标定,注入视觉感知先验。另一方面,SAM 引入门控多层感知机,以 HRM 最终阶段输出的细粒度局部语义矩阵 \(P^{(s)}\) 为条件,自适应推导通道级融合权重向量:
其中 \(\delta\) 为 ReLU 激活函数,\(\sigma\) 为 Sigmoid 函数。最终的补偿特征通过加权聚合得到:\(\tilde{F}_{ir} = \boldsymbol{\alpha} \odot F_{ir} + (1 - \boldsymbol{\alpha}) \odot F_t\)。该机制使得与局部语义强相关的特征通道能够优先从文本中吸收特定身体部位的互补色彩,而无关通道则保留红外固有的几何轮廓结构,有效避免了全局注入造成的色彩污染。
3. 融合加权身份对比约束:抑制跨身份语义重叠导致的策略混淆
即使局部语义提取高度精确,不同行人依然可能共享相似的解剖学结构甚至穿搭风格(如均包含深色上衣语义),这导致模型对负样本对生成极其接近的通道融合偏好,诱发特征空间的身份混淆。为此,本文设计了融合加权身份对比损失(\(\mathcal{L}_{FWIC}\)),直接在融合权重空间施加身份级几何约束。为消除样本难易度和绝对尺度的干扰,模型首先对样本 \(i\) 的融合权重 \(\boldsymbol{\alpha}_i\) 进行 \(\ell_2\) 归一化得到 \(\tilde{\boldsymbol{\alpha}}_i\),并定义带温度系数 \(\tau\) 的融合策略相似度 \(s_{ij} = \tilde{\boldsymbol{\alpha}}_i^\top \tilde{\boldsymbol{\alpha}}_j / \tau\)。在此基础上构建对比目标:
该目标惩罚不同身份之间相似的通道融合行为,迫使属于同一身份的可见光与红外正样本对展现出一致的色彩补充模式,同时推开不同行人的融合策略,从根本上缓解跨身份的语义多义性。
损失函数 / 训练策略¶
网络采用端到端联合优化,总目标函数综合了分类、度量学习、原型多样性与融合正则:
其中 \(\mathcal{L}_{id}\) 为批量归一化特征上的交叉熵身份损失,\(\mathcal{L}_{tri}\) 为跨模态难样本三元组损失,\(\mathcal{L}_{cs}\) 为中心分离损失(通过边际参数 \(\rho_1, \rho_2\) 约束类内紧凑性与类间离散度),\(\lambda\) 为平衡 \(\mathcal{L}_{FWIC}\) 贡献的超参数(SYSU-MM01 上设为 1.0,LLCM 上设为 1.5)。模型在单张 NVIDIA RTX 4090 GPU 上训练,采用 SGD 优化器(动量 0.9),初始学习率通过 10 个 epoch 的预热逐步升至 0.1,并在第 20 和第 50 epoch 按 0.1 衰减。
实验关键数据¶
主实验¶
在三大权威跨模态行人重识别基准(SYSU-MM01、RegDB、LLCM)上与主流 SOTA 方法全面对比,GSC 均取得了领先指标。
| 数据集 | 评测协议 / 模式 | 本文 (GSC) | 之前SOTA (TVI-LFM / ICRE / DSFAD) | 相对提升 |
|---|---|---|---|---|
| SYSU-MM01 | All search (Rank-1 / mAP) | 89.6% / 90.8% | 84.9% / 81.5% (TVI-LFM) | +4.7% / +9.3% |
| SYSU-MM01 | Indoor search (Rank-1 / mAP) | 90.1% / 91.4% | 89.1% / 90.8% (TVI-LFM) | +1.0% / +0.6% |
| RegDB | IR → VIS (Rank-1 / mAP) | 91.2% / 87.0% | 90.2% / 84.3% (ICRE) | +1.0% / +2.7% |
| LLCM | IR → VIS (Rank-1 / mAP) | 58.8% / 64.9% | 58.4% / 64.7% (ICRE) | +0.4% / +0.2% |
消融实验¶
在 SYSU-MM01 (All search) 与 LLCM (IR→VIS) 上对各个模块逐步叠加的消融验证(以标准 ResNet-50 跨模态网络为基线):
| 配置 | SYSU-MM01 Rank-1 | SYSU-MM01 mAP | LLCM Rank-1 | LLCM mAP | 说明 |
|---|---|---|---|---|---|
| Baseline | 79.7% | 77.3% | 56.1% | 62.5% | 基础双流 ResNet-50 |
| + SAM | 83.6% | 80.6% | 57.6% | 63.5% | 引入粗粒度文本调整模块 (+3.9% R-1 / +3.3% mAP) |
| + SAM + HRM | 88.7% | 88.9% | 58.1% | 64.2% | 引入层次化语义细化 (+5.1% R-1 / +8.3% mAP) |
| + SAM + HRM + \(\mathcal{L}_{FWIC}\) (Full GSC) | 89.6% | 90.8% | 58.8% | 64.9% | 引入融合行为身份对比正则,达到最优性能 |
关键发现¶
- HRM 是精度突破的核心动力:在加入 SAM 的基础上,引入 HRM 带来高达 8.3% 的 SYSU-MM01 mAP 巨幅提升,证明没有经过多阶段细化的粗粒度原型无法为文本颜色注入提供可靠的空间位置锚点。
- 细化阶段数存在最优窗口:在 SYSU-MM01 all-search 上,HRM 阶段数从 2 增加到 6 时 Rank-1 持续从 83.1% 升至 89.6%,但升至 7 阶段后因过拟合与梯度退化滑落至 85.1%;在更易收敛的 indoor-search 与低照度 LLCM 上,最优阶段数分别为 3 和 5。
- 计算开销可控:完整 GSC 相比 Baseline 仅增加 67.31M 参数量和 1173MB 训练显存开销,换取全搜索模式下 +9.9% Rank-1 和 +13.5% mAP 的全面增益。
亮点与洞察¶
- 多阶段原型循环细化机制:不同于常规 ViT 单层 cross-attention 的被动交互,HRM 将原型向量与空间像素做反复“聚类提取-非线性增强-广播回写”,使得无监督原型自然蜕变为解剖学语义部件探测器。
- 融合策略层面的对比正则:创造性地将对比学习从特征表征空间拓展至通道门控权重空间,通过惩罚不同身份行人的同质化加权模式,从决策源头上隔绝了伪共享语义引起的属性错配。
- 可复用的跨模态补偿范式:将文本作为非对称属性补偿源(而非对称双模态匹配目标),该思路极易推广到红外-夜视、低光照-可见光、深度图增强等模态缺失场景。
局限与展望¶
- 作者承认的局限:模型所使用的语义原型数量 \(k\) 在训练前被固定为常数超参数,无法根据图像中行人可见身体部位的完整度(如被遮挡、截断)自适应动态调整。
- 潜在改进方向:当前文本描述依赖静态标注,未来可结合轻量化在端 VLM 实时根据红外先验提取动态对比性描述;同时可探索动态路由的原型学习机制,自动剪枝或扩展语义部件数量。
相关工作与启发¶
- vs TVI-LFM (NeurIPS 2024):TVI-LFM 侧重于利用大视觉语言模型生成离线丰富文本,并进行全局对齐与拼接;本文 GSC 指出全局拼接会造成局部色彩错配,通过层次化局部语义将文本色彩精细化路由至红外各身体部位,在 SYSU-MM01 all-search 上 mAP 超出 9.3 个百分点。
- vs CSDN (TMM 2024):CSDN 依靠 CLIP 学习文本描述并进行高层语义静态融合;本文 SAM 模块引入动态双向交互与通道级自适应门控,并通过 \(\mathcal{L}_{FWIC}\) 规整融合空间,显著提升了相似着装行人的区隔度。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ 局部原型多阶段循环提纯与融合权重对比损失设计构思巧妙且直击痛点。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖三大主流基准测试、详尽的模块消融、阶段数与参数敏感性分析及显存开销对比。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,图文与公式对应清晰,实验洞察深刻。
- 价值: ⭐⭐⭐⭐☆ 为跨模态非对称特征补偿与细粒度属性对齐提供了极具启发性的技术范式。