CGCC: Towards Generalizable Clothes-Changing Person Re-Identification¶
会议: ECCV 2026
论文: ECCV 2026 Oral/Poster
代码: https://github.com/zhi-time/CGCC
领域: 人体理解 / 自动驾驶
关键词: 换装行人重识别, 泛化性, 文本引导身份提纯, 奇异值分解, 正交投影
一句话总结¶
针对换装行人重识别在真实开放场景下泛化性差的问题,本文构建了首个涵盖多地域文化、气候光照及细粒度解耦文本标注的大规模合成基准 CGCC(4,101 个身份、21.7 万张图像),并提出基于子空间正交投影的文本引导身份提纯框架 TGIR,实现了跨域换装重识别精度的显著提升。
研究背景与动机¶
行人重识别(Person Re-ID)旨在跨不重叠的监控摄像机视角下检索特定目标行人。传统方法高度依赖短期内外貌不变性假设,当行人在长时序监控或跨场景活动中发生衣着更替时,依赖服装纹理的主流模型往往面临严重失灵。为此,学术界提出了换装行人重识别(Clothes-Changing Person Re-ID, CC-ReID)。然而,现有方法在面对真实世界的开放复杂场景时,泛化能力受到两方面的根本掣肘。
一方面,现有 CC-ReID 数据集在数据分布的多样性与语义细粒度上存在严重缺陷。多数早期数据集仅聚焦于单一的服装纹理变化,忽略了全球范围内地域文化差异对穿着习惯的深刻塑造,也未能系统耦合四季时序、昼夜光照以及极端天气等外部动态扰动;同时,数据标注仅停留在离散的身份 ID 与衣服标签,缺乏对行人细粒度外貌和场景上下文的连续语义描述,导致模型难以建立具有广泛泛化能力的判别表征。
另一方面,现有基于语义辅助监督的方法缺乏对身份无关干扰因素的全局系统建模。多数方案将衣服与环境作为孤立变量进行局部压制或对抗剔除,未能将其归纳为一个统一的“身份无关语义子空间”。这种局部视角使得模型无法从全局几何分布的视角厘清特征干扰的边界。核心 idea:通过构建耦合全球文化与时空动态的多因子基准 CGCC 提供结构化语义支撑,并提出 TGIR 框架利用 SVD 构建全局身份无关子空间并实施谱加权正交投影,形成“数据多样性扩增-语义子空间解耦”相互促进的泛化闭环。
方法详解¶
整体框架¶
TGIR 框架从语义子空间解耦的角度切入,将多模态大模型生成的结构化文本分解为身份相关的生物特征描述(\(T_{bio}\))以及身份无关的服装(\(T_{cloth}\))与环境(\(T_{env}\))描述。在训练阶段,框架通过两个协同模块精确提纯视觉特征:一是生物特征引导的原型对齐模块(BGPA),利用生物文本过滤低质量与偏置样本,自适应校准全局身份原型;二是谱感知正交投影模块(SAOP),利用环境与服装文本构建身份无关矩阵并进行奇异值分解(SVD),通过谱加权正交约束彻底剔除视觉特征中的干扰成分。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入图像 x 与解耦文本描述<br/>Tbio / Tcloth / Tenv"] --> B["多模态特征提取<br/>视觉编码器 Ei + 文本编码器 Et"]
B --> C["生物特征引导的原型对齐 (BGPA)<br/>一致性自适应动量校准全局原型"]
B --> D["谱感知正交投影 (SAOP)<br/>SVD 分解构建身份无关子空间基向量"]
C --> E["联合目标优化<br/>LID + LTriplet + LITC + LBGPA + LSAOP"]
D --> E
E --> F["推理阶段输出<br/>仅需视觉编码器提取纯净身份表征"]
关键设计¶
1. 融合全球文化与时空动态的 CGCC 数据集构建:打破单一变装场景的数据孤岛
真实场景下为同一身份采集极端多样化的服装和环境几乎无法实现且受制于隐私规范。本文以 MSMT17 为高质量种子数据源,首先采用 SCHP 躯干完整性检验、人像画质评估网络以及同一身份样本数超 20 张的阈值进行多级筛选,剔除运动模糊与严重遮挡样本。随后借助 ChatGPT 构建覆盖全球 6 大洲 66 个国家的地域服饰文化提示库,以及四季气象与功能服饰的时空动态提示库,并通过随机重组策略生成极端罕见场景提示,驱动 Qwen-Image-Edit 进行可控条件重绘。最后通过 Qwen3-VL 过滤人脸畸变与身份漂移样本,并自动生成结构化拆分的生物特征、服装和环境三维描述,最终建成涵盖 4,101 个身份、217,248 张高保真图像的综合性基准。
2. 生物特征引导的原型对齐 (BGPA):抵御风格偏置的自适应动量校准
传统特征原型聚合直接计算批次内视觉特征的算术均值,当某些样本受到强烈背景或特殊服饰偏置主导时,全局原型会发生不可逆的语义漂移。BGPA 引入轻量级适配器 Adapter 计算图像视觉特征 \(f_v^i\) 与对应生物文本特征 \(t_{bio}^i\) 的语义一致性置信度: $$ \alpha_i = \sigma(\text{Adapter}([f_v^i; t_{bio}^i])) $$ 基于置信度 \(\alpha_i\),计算该身份当前批次的加权特征中心 \(\bar{f}_k = \frac{\sum_{i \in \mathcal{B}_k} \alpha_i \cdot f_v^i}{\sum_{i \in \mathcal{B}_k} \alpha_i}\) 与批次平均可靠度 \(\bar{\alpha}_k\)。在更新全局原型 \(P_k\) 时,动态调节动量步长 \(\mu_k = (1 - m) \cdot \bar{\alpha}_k\): $$ P_k^{(t)} = (1 - \mu_k) P_k^{(t-1)} + \mu_k \bar{f}_k $$ 当样本质量高且符合生物特征时,以标准步长积极更新;面对严重失真或偏置样本时,\(\bar{\alpha}_k \to 0\) 从而冻结原型更新,确保类内聚类中心始终锚定内在本质身份。
3. 谱感知正交投影 (SAOP):基于 SVD 的全局干扰子空间彻底剥离
现有方法将衣服和环境孤立对待,难以把握非身份特征的分布流形。SAOP 将衣服文本特征 \(t_{cloth}\) 与环境文本特征 \(t_{env}\) 拼接构成身份无关语义矩阵 \(M_{irr} = [t_{cloth}; t_{env}] \in \mathbb{R}^{2N \times D}\),并执行奇异值分解: $$ M_{irr} \xrightarrow{\text{SVD}} U \Sigma V^T $$ 其中右奇异向量集合 \(V = \{v_1, v_2, \dots, v_D\}\) 构成了当前批次身份无关变异的正交基底,对应的奇异值 \(\lambda_1, \dots, \lambda_D\) 量化了各基向量方向上的方差强度。SAOP 设计了谱加权正交损失,强制视觉特征在该子空间上的投影能量最小化: $$ \mathcal{L}{SAOP} = \sum |f_v^T v_j|^2 $$ 通过严谨的正交投影,全局性剥离环境与服装引起的非刚性扰动,且无需侵蚀固有的人体骨骼与体态线索。}^D \frac{\lambda_j}{\sum_{d=1}^D \lambda_d
损失函数 / 训练策略¶
模型采用端到端联合训练策略,总损失由传统重识别监督、跨模态对比与两项核心提纯约束组成: $$ \mathcal{L}{total} = \mathcal{L}} + \mathcal{L{Triplet} + \mathcal{L}} + \mathcal{L{BGPA} + \mathcal{L} $$ 其中 \(\mathcal{L}_{ID}\) 与 \(\mathcal{L}_{Triplet}\) 分别为标准交叉熵损失和三元组损失;\(\mathcal{L}_{ITC}\) 为视觉特征与正例生物文本之间的图文对比损失;\(\mathcal{L}_{BGPA}\) 为视觉特征向校准身份原型聚集的原型对比损失;\(\mathcal{L}_{SAOP}\) 为上述谱加权正交损失。训练时视觉主干采用 EVA02-CLIP-L/14,文本端采用预训练 EVA02-CLIP-bigE-14,优化 60 个 epoch。文本模块和 SVD 运算仅在训练期充当监督信号,推理阶段仅执行纯视觉前向推理,无任何额外计算负担。
实验关键数据¶
主实验¶
论文重点评估了跨数据集泛化性能(Source \(\to\) Target)以及在各主流换装数据集上的同域性能。
表 1 展示了在 CGCC 上训练后直接跨域泛化至未知测试集(LTCC、PRCC、DeepChange)的零样本检索对比:
| 方法 | 预训练源域 | LTCC (R1 / mAP) | PRCC (R1 / mAP) | DEEP (R1 / mAP) | 平均指标 (R1 / mAP) |
|---|---|---|---|---|---|
| TransReID | CGCC | 21.9% / 9.2% | 37.1% / 32.5% | 46.7% / 12.7% | 35.2% / 18.1% |
| MADE | CGCC | 38.3% / 19.6% | 60.3% / 55.9% | 59.6% / 20.9% | 52.7% / 32.1% |
| Differ | CGCC | 36.2% / 17.7% | 55.4% / 50.6% | 57.9% / 20.0% | 49.8% / 29.4% |
| TGIR (本文) | CGCC | 40.3% / 19.1% | 62.0% / 56.9% | 62.1% / 22.4% | 54.8% / 32.8% |
表 2 展示了在 CGCC 数据集内部评测协议下的换装(CC)与同装(SC)指标对比:
| 方法 | 发表出处 | CC 换装 Rank-1 | CC 换装 mAP | SC 同装 Rank-1 | SC 同装 mAP |
|---|---|---|---|---|---|
| TransReID | ICCV 2021 | 41.0% | 17.0% | 75.0% | 47.5% |
| CAL | CVPR 2022 | 32.3% | 12.0% | 65.3% | 35.9% |
| MADE | CVPR 2024 | 51.2% | 23.3% | 81.2% | 54.9% |
| Differ | CVPR 2025 | 50.7% | 23.3% | 83.7% | 60.1% |
| Eva02-CLIP | arXiv 2024 | 54.7% | 26.3% | 85.0% | 62.0% |
| TGIR (本文) | ECCV 2026 | 57.3% | 28.1% | 86.0% | 64.3% |
消融实验¶
表 3 为在 CGCC \(\to\) PRCC 跨域设置下,TGIR 各核心模块对表征泛化性的消融分析:
| 实验序号 | 模型配置 | BGPA 原型对齐 | SAOP 正交投影 | Rank-1 (%) | mAP (%) |
|---|---|---|---|---|---|
| 1 | Baseline (Eva02-CLIP) | - | - | 54.5 | 50.6 |
| 2 | + BGPA | ✓ | - | 56.4 (+1.9) | 52.1 (+1.5) |
| 3 | + SAOP | - | ✓ | 59.0 (+4.5) | 55.3 (+4.7) |
| 4 | Full TGIR | ✓ | ✓ | 62.0 (+7.5) | 56.9 (+6.3) |
关键发现¶
- CGCC 跨域优势显著:对比基于真实大规模数据 LaST 训练的模型,在 CGCC 上训练的 MADE 在 DeepChange 上取得了 59.6% 的 Rank-1,大幅超越 LaST 训练的 51.4%(+8.2%),证明了耦合文化、季节与气象的多因子合成数据在提升泛化边界上的决定性作用。
- SAOP 模块起关键解耦作用:消融实验显示,单独引入 SAOP 即可使跨域 Rank-1 提升 4.5 个百分点,贡献大于单模态原型校准的 1.9 个百分点,验证了“将干扰视作子空间基底并进行正交滤除”相比传统局部判别的显著有效性。
- 同装与换装双向受益:在 CGCC 内部测试中,TGIR 在 CC 换装指标上领先最强竞品 2.6% R1 / 1.8% mAP 的同时,SC 同装指标也由 85.0% 提升至 86.0%,表明正交剥离并未损害刚性生物特征辨识力。
亮点与洞察¶
- 从局部压制到子空间谱正交投影:打破了过去将衣服或背景作为独立负样本惩罚的粗粒度做法,将文本编码的环境与衣着张量视作非结构化噪声的完整生成基底,利用 SVD 和奇异值加权建立正交惩罚,数学形式严密且具普适性。
- 合成数据与大模型闭环赋能:没有单纯依赖图像生成或盲目扩增,而是通过 ChatGPT 的先验知识库设计全球文化维度,结合 Qwen-Image-Edit 精确重绘与 Qwen3-VL 质检生成解耦描述,形成了“数据多样性拓展 \(\to\) 细粒度结构化监督 \(\to\) 算法子空间提纯”的自洽闭环。
- 零推理代价的跨模态训练范式:充分利用多模态大模型的文本生成能力弥补视觉数据标注匮乏,训练期借力大语言模型和 SVD 提纯,推理期纯视觉运行,完全规避了推理部署时的大模型算力消耗。
局限与展望¶
- 作者承认的局限:尽管 CGCC 显著拓展了换装场景的广度,但仍无法完全覆盖真实世界无约束环境中的所有穿搭变异;自动生成的文本描述在极低分辨率或极端严重遮挡下可能会丢失局部微观细节;此外,训练阶段引入大文本编码器和批次级 SVD 计算增加了一定的显存与时间开销。
- 拓展思考:当前 SVD 是在单一 Batch 内部构建临时子空间基向量,批次大小对奇异向量的稳定性可能存在约束。未来可探索引入跨 Batch 的全局记忆库或在线字典学习机制,维持一个更加平滑连续的动态环境基底;同时,该子空间剥离思路亦可迁移至跨天气自动驾驶目标跟踪等相关任务。
相关工作与启发¶
- vs Differ (CVPR 2025):Differ 同样尝试利用语义线索辅助解耦,但在抑制干扰时采用传统的对抗学习与实例级相似度惩罚,缺乏对干扰维度的全局几何正交约束。TGIR 进一步构建服装与环境联合矩阵,并使用 SVD 进行谱加权全局正交投影,跨域测试平均 R1 超出 Differ 5.0 个百分点。
- vs MADE (TMM 2024):MADE 采用掩码属性描述嵌入学习局部特征,依赖离散属性词汇表且计算复杂度较高。TGIR 通过开放词汇表连续文本生成和原型动态动量对齐,在保持轻量推理的同时显著增强了开放场景泛化性。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次将全局环境与服饰解耦为连续语义子空间并通过 SVD 正交化剥离,构思巧妙严谨。
- 实验充分度: ⭐⭐⭐⭐⭐ 兼顾跨数据集零样本迁移与多个主流数据集同域评测,消融严密详实。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑链路清晰,数学公式与动机推演浑然一体。
- 价值: ⭐⭐⭐⭐⭐ 开源的 CGCC 数据集填补了多因子换装重识别基准的空白,对行人理解与长时序安防监控意义重大。