CMCC-ReID: Cross-Modality Clothing-Change Person Re-Identification¶
会议: ECCV2026
论文: ECCV 原文
代码: https://github.com/Xuan266/CMCC-ReID
领域: 人体理解
关键词: 行人重识别、可见光与红外、换装、特征解耦、原型学习
一句话总结¶
本文构建同时包含模态差异和换装变化的 SYSU-CMCC 基准,并用渐进式身份对齐网络 PIA 先解耦身份与服装、再进行双向原型对齐,在可见光到红外检索中取得 57.0% Rank-1 和 46.5% mAP。
研究背景与动机¶
行人重识别要在不同摄像头之间找到同一个人,但长期场景里外观变化不止一种。 白天可见光图像与夜间红外图像具有明显的成像差异,同一个人也可能在不同时间更换衣服。 可见光与红外重识别通常假设服装不变,换装重识别则主要在可见光条件下学习身份不变性。 这两个设定各自取得进展,却没有充分回答两种变化同时发生时应该对齐什么。 如果跨模态模型仍然依赖衣服,即使把两个模态的分布拉近,也可能只是强化错误的外观对应。
红外图像还使去除服装依赖本身更加困难:颜色与纹理信息减少,服装区域和其他身体区域的对比度降低。 作者用 CAL 的注意力图说明,能在可见光下抑制服装响应的模型,在红外条件下仍可能被服装区域主导。 图 2 的另一个观察是,直接使用 SAAI 不如其 ResNet-50 基线,而把其对齐模块接到 CAL 上才有一定收益。 这些结果支持一个具体判断:服装干扰不是跨模态对齐之后顺手消除的噪声,而是决定对齐是否有效的前提。 因此,PIA 并非简单把现成换装损失和模态对齐损失从头一起训练,而是先形成相对可靠的身份表示。
为检验这个判断,论文从 PRCC 与 SYSU-MM01 构建 SYSU-CMCC,而不是把两个数据集中的不同身份直接拼接。 PRCC camA/B 与 SYSU-MM01 cam1/2 中内容相同的样本充当跨数据集身份锚点,再人工核对 PRCC camC 与 SYSU-MM01 cam3/6。 保留下来的可见光和红外样本属于同一身份、不同服装;最终共有 214 个身份、18,375 张图像和 3 个摄像头。 新基准中的 Cam1/2 是穿服装 A 的红外图像,Cam3 是穿服装 B 的可见光图像,不能把这套新编号与来源摄像头编号混用。 核心 idea:先让身份分支减少对服装区域的依赖,再以模态内和模态间的身份原型约束进行对齐,避免把服装偏差当作身份知识传播。
方法详解¶
整体框架¶
PIA 使用共享卷积骨干处理可见光或红外行人图像,输出空间特征图。 双分支解耦学习 DBDL 将该特征图变成身份向量与服装向量,其中身份向量是后续检索表示。 双向原型学习 BPL 仅在第二阶段加入,为每个训练身份维护可见光和红外两套原型。 其模态内约束聚拢同身份样本,模态间约束把一个模态的样本拉向另一模态的同身份原型。 两个阶段改变的是训练目标,第二阶段并不丢弃 DBDL,也不是把第一阶段完全冻结。 图中的虚线表示训练监督;原型和分类标签不是测试时查询图像必须携带的输入。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
Input["可见光或红外图像"] --> Backbone["共享 ResNet-50"]
Backbone --> DBDL["双分支解耦学习<br/>DBDL"]
Labels["训练:身份与服装标签"] -.-> DBDL
DBDL --> Feature["身份向量"]
Feature -->|"第二阶段训练"| BPL["双向原型学习<br/>BPL"]
BPL -.->|"模态内与模态间监督"| DBDL
Feature -->|"测试"| Retrieval["跨模态图库排序"]
关键设计¶
1. 双分支解耦学习:抑制服装,但不把服装区域一刀切掉
DBDL 首先从共享特征图学习服装空间注意力,而不是调用一个外部服装分割器。 具体做法是沿通道分别进行最大池化和平均池化,把两张空间统计图拼接,经卷积与 sigmoid 得到服装权重。 最大池化保留强响应,平均池化保留更整体的响应分布,两者共同为服装分支提供空间选择。 服装权重与骨干特征逐元素相乘后做全局池化,形成服装向量;服装分类标签监督它确实捕获服装相关信息。 这种显式分支使网络有一个可以被识别、被约束的服装表示,而不只是期待身份分类器自行忽略衣服。
身份分支则根据同一服装权重进行平滑抑制,抑制程度由可学习系数控制。 作者没有采用把所有高服装响应区域完全清零的硬排除,因为这些位置也可能包含有用的身体结构信息。 例如衣服覆盖区域仍可能反映体形,直接删除会连同身份线索一起损失。 身份注意力加权后的特征经过池化得到身份向量,并接受身份分类监督。 两分支各自承担明确的判别目标,区别不在于输入不同,而在于空间选择和分类目标不同。 原文式 (2) 的文本提取丢失了运算符,因此这里说明平滑抑制机制,不将猜补表达式写成作者精确公式。
仅有两套分类头仍不能阻止身份向量保存服装信息,所以还需对两向量施加正交约束。 正文把该约束解释为归一化点积绝对值的平均惩罚,使身份与服装特征的方向相关性降低。 其目的不是让两个分类器互相竞争,而是减少两个表示空间共享服装线索的机会。 正交约束与空间抑制相互补充:前者约束向量关系,后者约束信息从哪些图像位置进入身份分支。 不过,低相关性并不等于统计独立,更不证明身份向量已经彻底去除了所有服装信息。 这是对正则项能力边界的解释,不能把作者的“解耦”表述理解为严格的因果识别保证。
2. 双向原型学习:同时稳定模态内身份簇与模态间对应
在第一阶段的身份特征基础上,BPL 为每个训练身份保存两个中心,分别代表可见光和红外。 保留两套中心的好处是能区分“同模态聚类不紧”和“跨模态身份不一致”这两个不同问题。 如果过早把所有模态混成单一中心,服装和成像造成的偏移可能被混在同一个目标里。 原型由同身份、同模态特征的均值初始化,并在迭代中用当前批次的身份均值进行动量更新。 默认动量为 0.9,使原型不会完全跟随单批样本的姿态和背景噪声变化。 原文初始化文字说使用全部同身份样本,式 (7) 附近却把归一化数量解释为批内样本数;复现时应核对代码,笔记不擅自消解这处歧义。
模态内学习把可见光样本拉向自身可见光身份原型,同时远离其他身份的可见光原型;红外分支同理。 它减少同身份在姿态、光照和其他外观因素下的分散,提供更稳定的身份簇。 模态间学习则交换目标原型集合:可见光样本对比红外原型,红外样本对比可见光原型。 正样本原型始终由身份标签决定,而不是靠衣服相似度或无监督近邻来选择。 以下是对式 (10) 至 (13) 可辨认结构的统一记号化概括,不是对受损公式的逐字复原:
其中 \(\mathbf f\) 来自模态 \(m\),\(y\) 是身份标签,\(K\) 是训练身份数,\(\mathbf p_k^n\) 是模态 \(n\) 的身份原型。 当 \(m=n\) 时是模态内对比,当 \(m\ne n\) 时是模态间对比;四个方向分别在对应样本上求平均。 温度 \(\tau=1/16\) 控制相似度分布的尖锐程度,分母覆盖目标模态中的全部训练身份原型。 因此 BPL 学习的不只是“两个模态越接近越好”,而是同身份跨模态接近、异身份仍然可分。 它作用于 DBDL 输出的身份向量,不把服装向量也拉到另一个模态的身份中心。 这种选择和延迟启用共同降低服装线索被原型长期记忆并强化的风险。
损失函数 / 训练策略¶
第一阶段联合训练共享骨干和 DBDL,以身份分类、服装分类和正交正则为目标,不启用 BPL。 第二阶段继续优化这些目标,并加入可见光、红外的模态内和双向模态间原型对比。 原文式 (14) 和 (15) 的提取不完整;尤其式 (15) 可辨认的权重位置与随后关于 \(\lambda_2\) 作用于模态内项的文字不一致。 因此这里不提供未经核实的完整总损失,只记录原文明示的 \(\lambda_1=0.5\)、\(\lambda_2=1.5\)。 训练共 90 个 epoch,在第 55 个 epoch 后启用第二阶段目标;这不是先独立训练两个网络再拼接。 骨干为 ImageNet 预训练 ResNet-50,移除最后一次空间下采样,以保留更细的空间响应。 实现使用全局平均池化和最大池化的拼接,并对最终特征施加 Batch Normalization。 输入尺寸为 \(384\times192\),增强包括随机水平翻转、随机裁剪和随机擦除。 Adam 初始学习率为 \(3.5\times10^{-4}\),每 30 个 epoch 缩小 10 倍,实验使用单张 NVIDIA A100。 每批包含 8 个身份,每个身份各取 4 张可见光和 4 张红外图像,总计 64 张,保证两个模态具有成对的身份监督。 测试时对查询与图库图像提取身份特征并进行检索;原文图 6 分析了测试特征的余弦距离。 正文没有详细给出完整测试实现或训练/测试身份划分数量,因此不额外推定重排序、图库抽样或部署耗时。
实验关键数据¶
主实验¶
下表摘自原文第 12 页表 2,所有方法在 SYSU-CMCC 上评估,不是各自在原始数据集上的成绩。 V2I 表示可见光查询检索红外图库,I2V 表示红外查询检索可见光图库,两方向都伴随服装变化。 Rank-1 是首个检索结果身份正确的查询比例,mAP 对每个查询的平均精度再求均值;表内单位均为百分比。
| 方法 | 原任务类型 | V2I Rank-1 | V2I mAP | I2V Rank-1 | I2V mAP |
|---|---|---|---|---|---|
| SAAI | VI-ReID | 20.4 | 21.2 | 19.1 | 19.2 |
| DEEN | VI-ReID | 28.3 | 24.8 | 24.7 | 28.5 |
| CAL | CC-ReID | 40.1 | 33.2 | 35.6 | 37.1 |
| CSCI | CC-ReID | 42.9 | 31.9 | 37.6 | 36.9 |
| CaAug | CC-ReID | 42.6 | 36.6 | 38.2 | 38.2 |
| PIA | CMCC-ReID | 57.0 | 46.5 | 50.4 | 50.3 |
PIA 相对 CaAug 的 V2I mAP 提高 9.9 个百分点,I2V mAP 提高 12.1 个百分点。 V2I Rank-1 的最强已有方法是 CSCI,而不是 CaAug;PIA 相对 CSCI 提高 14.1 个百分点。 这些比较支持本文在该联合变化基准上的优势,不代表 PIA 已在所有常规 VI-ReID 或 CC-ReID 数据集上领先。
消融实验¶
下表对应第 13 页表 3,基线为复现的 CAL,数值仍为 SYSU-CMCC 上的百分比。 “渐进”表示延迟启用原型学习;第 6 行特意去掉该策略,不能被视为渐进训练结果。
| 表 3 编号 | 配置 | V2I Rank-1 | V2I mAP | I2V Rank-1 | I2V mAP |
|---|---|---|---|---|---|
| 1 | CAL 基线 | 40.1 | 33.2 | 35.6 | 37.1 |
| 2 | 基线 + DBDL,不含正交项 | 43.2 | 35.7 | 38.6 | 38.7 |
| 3 | DBDL + 正交项 | 45.6 | 37.6 | 40.5 | 39.1 |
| 4 | 配置 3 + 渐进 + 模态内 BPL | 46.9 | 39.5 | 42.7 | 41.6 |
| 5 | 完整 PIA,加入模态间 BPL | 57.0 | 46.5 | 50.4 | 50.3 |
| 6 | 完整组件,但不采用渐进训练 | 42.8 | 35.4 | 42.6 | 40.7 |
关键发现¶
- 在已解耦且渐进训练的条件下,加入模态间对比使 V2I Rank-1 从 46.9 提升到 57.0,即增加 10.1 个百分点;这不是任意训练条件下的独立模块收益。
- 保留完整组件却取消渐进训练,V2I Rank-1 从 57.0 降至 42.8,降低 14.2 个百分点,说明优化顺序本身是关键变量。
- 不渐进的第 6 行相对第 3 行 V2I 更差、I2V 略好,因此原型约束并非在全部指标上都完全无效,而是不能稳定带来预期收益。
- 图 5a 显示第二阶段启动时间在所测试设置中以 55 最佳;正则权重附近较稳定,但动量过小或过大都会损害结果。
亮点与洞察¶
- 最有价值的判断是先检查“被对齐的是否真是身份”。这种诊断把对齐失败从容量不足问题转化为表示受到混杂因素污染的问题。
- 服装分支并非最终检索输出,却为身份分支提供可学习的抑制对象。软抑制也避免把衣服覆盖区域中的体形线索全部丢弃。
- 两套原型把模态内紧致性与模态间一致性分开建模。可迁移的启发是先稳定每个域内的类别表示,再安排跨域交互,但迁移效果仍需新实验。
局限与展望¶
- 评测只覆盖一个由既有数据重组的基准,尚缺独立采集场景和跨数据集泛化验证;214 个身份不能代表所有长期外观变化。
- 此基准把不同服装与不同模态配对,二者存在结构性耦合。读者建议补充服装与模态充分交叉的采集设计,以分别识别两种因素的影响。
- 缓存正文未交代训练/测试身份数量、完整图库抽样流程,也未报告多次运行方差;不能凭表格小数位把复现稳定性视为已解决。
- 多处公式提取受损,原型初始化范围与总损失权重仍有前述歧义;正文第 15 页特征分析还把方法写成“FID”,与 PIA 命名不一致。
- 作者称其为首个基准,但相关工作已引用 2024 年可见光与红外换装数据集研究;“首次”应视为作者对任务定位的主张,而非本文已独立核实的事实。
- 人工跨数据集核验改善身份一致性,却不替代隐私、同意和公平性审计;这些是此类身份关联基准用于现实场景前需要另行评估的边界。
相关工作与启发¶
- 与 CAL 对比:CAL 使用服装对抗学习减少服装依赖;PIA 显式学习双分支、施加正交约束,再把较纯净的身份表示送入跨模态原型训练。
- 与 SAAI 对比:SAAI 侧重语义对齐和亲和推断;本文强调对齐之前的服装抑制,图 2 的组合实验支持二者并不是简单互斥方案。
- 与 ProtoNCE 对比:PIA 沿用原型对比思想,但以监督身份标签维护两个模态的原型,并结合渐进训练;它不是无监督发现身份簇。
- 与 Wei 等人的 2024 年工作对比:论文参考文献 [44] 已研究自然场景中的可见光与红外换装数据;本文突出双重变化的耦合分析和两阶段方法,应谨慎表述先后关系。
评分¶
- 新颖性: 4/5。联合变化的问题分析与渐进优化有辨识度,但不能无保留重复首创基准主张。
- 实验充分度: 3/5。双向比较与组件消融较完整,独立数据集、方差和协议细节仍不足。
- 写作质量: 3/5。核心逻辑清楚,但初始化描述、权重说明及方法名称有需要核对之处。
- 价值: 4/5。对“先去混杂再对齐”的研究提供了具体基准和有说服力的条件性证据。