Virtual Category-Guided Continual Generalized Category Discovery¶
会议: ECCV 2026
论文: ECCV 官方
PDF: EventHosts PDF
代码: https://github.com/Mrxjh105/VC-CGCD
领域: 自监督/表示学习
关键词: 持续广义类别发现, 虚拟类别学习, 扩展邻域对比学习, 开集识别, 伪标签消歧
一句话总结¶
针对无回放持续广义类别发现(C-GCD)中模糊无标签样本易引入伪标签噪声并偏向已知类的难题,本文提出通过虚拟类别学习为歧义样本构建优化缓冲,并结合扩展邻域对比学习强化新旧类别特征解耦,显著提升持续新类发现率并抑制灾难性遗忘。
研究背景与动机¶
面向开放环境的视觉智能系统(如具身机器人、自动驾驶与长周期监测)必须在不反复重训的前提下持续接纳新出现的视觉概念,同时维持对历史已知类别的识别能力。广义类别发现(GCD)打破了早期新类发现仅包含未知类的严苛假设,允许无标签数据中已知与未知类别混杂;而持续广义类别发现(C-GCD)进一步贴合真实流式场景,要求模型在离线已知类初始化后,仅接收无标签顺序数据流且无法保留历史样本,这使得传统的批量聚类机制完全失效。在无历史数据回放的约束下,模型面临极其严峻的稳定性与可塑性平衡困境。
当前 C-GCD 系统的核心瓶颈在于流式无标签数据中普遍存在的语义歧义性。数据流中不仅包含特征显著的已知类与清晰的新类样本,还存在大量位于决策边界附近或具有视觉重叠的模糊样本。现有方案通常依赖聚类分配、伪标签预测或近邻一致性假设,强行将这些不确定样本归入现有已知类或切分为新簇。在持续学习的级联更新中,这种过早的硬性错误指派会产生顽固的标签噪声,并引发确认偏差;由于无法重访旧数据,早期错误会在后续阶段被不断放大,且模型往往会产生偏向熟悉已知类的预测偏差,导致真正有助于刻画新决策空间的高难样本反而被严重误用或忽视。
解决该矛盾的关键切入点在于重塑模糊样本在优化过程中的参与方式:不应将每个无标签样本强行锚定到当前具体的语义类别中心,而应赋予模型一种受控容纳未决语义的缓冲机制。本文借鉴半监督学习中的思想并重构为持续学习范式,引入虚拟类别学习(VCL)为歧义样本分配临时虚拟标签作为中立优化方向,配合扩展邻域对比学习(ENCL)抵御特征漂移。核心 idea:将难以明确分类的歧义样本动态指派给自注意力生成的临时虚拟类别以构建无偏优化缓冲,同时通过二阶近邻扩展与自适应对比拉大类别间隙,在避免引入硬伪标签噪声的同时充分挖掘高难无标签样本的表征结构。
方法详解¶
整体框架¶
本文提出的 VC-CGCD 框架在多分支架构下运行。输入图像经过弱增强与强增强后,分别由教师编码器与学生编码器提取特征表征。框架由两个协同模块驱动:首先是虚拟类别学习(VCL)模块,它综合预测竞争度与师生一致性构建潜在类别(PC)集合,当样本存在类别混淆时动态关联由 Transformer 生成的临时虚拟权重向量,从优化损失中排除候选歧义类的梯度冲突;其次是扩展邻域对比学习(ENCL)模块,突破直接近邻的局限,融入近邻的近邻(二阶扩展)以捕捉隐式流形结构,增强表征空间中已知类与新类之间的判别分离度。最后将两项损失与底层 C-GCD 基线目标联合进行端到端优化。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["流式无标签图像输入<br/>弱增强与强增强双视图"] --> B["特征提取与预测竞争评估<br/>师生网络提取特征并计算Top-2分值与预测一致性"]
B --> C["潜在类别集合构建与歧义判别<br/>双重指标判定混淆样本并构建PC候选集"]
C --> D["虚拟类别学习<br/>动态生成虚拟权重并对PC外类别计算缓冲损失"]
D --> E["扩展邻域对比学习<br/>检索二阶扩展近邻并实施自适应间隙对比约束"]
E --> F["联合优化与流式类别发现<br/>端到端更新表征并平稳扩展已知类别空间"]
关键设计¶
1. 潜在类别集合构建与歧义判别:基于竞争度与一致性双重线索界定混淆样本 流式学习中单次预测的最高概率往往因持续分布漂移而不可靠,过早信任伪标签会导致错误累积。为精准筛选出位于决策模糊区的样本,本文结合了预测竞争度与师生网络一致性两条互补线索。竞争度指标通过衡量首选类别与次选类别的相对概率差距计算: $\(D_{\text{top2}} = \frac{p_{\text{1st}} - p_{\text{2nd}}}{p_{\text{2nd}}}\)$ 当 \(D_{\text{top2}}\) 低于设定阈值时,表明当前特征在多个顶层候选类之间竞争激烈。同时,框架比对教师网络预测标签 \(y'_t\) 与学生网络预测标签 \(y'_s\),两者的分歧直接表征了时序表征的不稳定性。由这两类信号共同提炼的候选语义构成潜在类别集合(Potential Category Set, PC)。若样本在 PC 集合中包含多个候选类别,则被标记为混淆样本(\(\delta_j = 1\)),从而避免仅凭单模态置信度直接丢弃或硬性分配。
2. 虚拟类别学习:利用自注意力虚拟权重构建中立优化缓冲 针对被标记为混淆的无标签样本,传统做法要么强行拉向某一伪标签中心引入错误梯度,要么直接丢弃导致无标签数据利用率低下。本文通过自注意力 Transformer 层动态生成一个与现有类别维度平行的虚拟分类器权重向量 \(w^v\)。对于混淆样本,优化目标不再是强行拟合特定真实类别,而是将其引向虚拟类别通道,同时将潜在类别集合 PC 中的所有模糊候选类从对比分母中屏蔽: $\(\ell_{\text{VC}} = \log \left( e^{l^v} + \sum_{i \notin \text{PC}}^K e^{l^i} \right) - l^v\)$ 其中 \(l^v\) 为特征与虚拟权重投影产生的虚拟 logit,\(l^i\) 为与第 \(i\) 个既有类别的投影。通过排除集合 PC 内的类别,模糊样本既不会对与其高度相似但无法确证的类别产生错误拉力,又能明确推离确信不相关的非候选负类,为特征演化提供了一条安全的中间缓冲带,使高难样本在不污染语义边界的前提下充分提供特征紧凑性约束。
3. 扩展邻域对比学习:引入二阶近邻与流形扩展提升新旧类别可分性 虽然虚拟类别为模糊样本提供了安全缓冲,但无标签流式更新会导致表征空间持续演变,仅依赖单阶 \(k\) 近邻进行对比聚类容易漏掉潜在的流形邻接样本,导致新旧类聚类边界模糊。本文将对比近邻池扩展至近邻的近邻(neighbors-of-neighbors)。对于样本 \(x_i\) 的每个一阶近邻 \(q \in N(x_i)\),进一步在其局部嵌入空间检索 \(m\) 个近邻,合并构建扩展近邻集合 \(E_M(x_i)\)。扩展损失定义为: $\(\ell_{\text{EN}} = -\frac{1}{m} \sum_{q \in E_M(x_i)} \log \frac{\exp(f_i \cdot f_q / \tau)}{\sum_{j=1}^m \exp(f_i \cdot f_j / \tau)}\)$ 在扩展近邻构建中,多次被命中的二阶近邻自然具有更高的语义紧密度与聚合权重。将经典一阶近邻对比 \(\ell_N\) 与扩展对比 \(\ell_{\text{EN}}\) 经权重系数 \(\beta\) 加权结合,不仅放大了对比正样本的多样性,更有效抵御了模型在新阶段学习时新类别与历史旧类之间的特征坍缩与混淆。
损失函数 / 训练策略¶
在每个在线会话 \(S_t\) 中,模型在无标签批次 \(\mathcal{B}\) 上联合优化整体损失函数: $\(\mathcal{L} = \mathcal{L}_{\text{VC}} + \lambda_1 \mathcal{L}_{\text{EN}} + \lambda_2 \mathcal{L}_{\text{baseline}}\)$ 其中 \(\mathcal{L}_{\text{VC}}\) 为对批次内所有混淆样本(\(\delta_j = 1\))计算的均值虚拟类别损失;\(\mathcal{L}_{\text{EN}}\) 为扩展近邻对比损失;\(\mathcal{L}_{\text{baseline}}\) 采用现有成熟 C-GCD 解耦去偏基线(如 Happy 框架)。超参数设定中,\(\mathcal{L}_{\text{VC}}\) 系数固定为参考基准 1.0,平衡系数设为 \(\lambda_1 = 0.8\)、\(\lambda_2 = 1.0\),近邻扩展权重 \(\beta = 0.1\),温度系数 \(\tau = 0.1\)。离线阶段训练 100 轮,在线每个会话训练 30 轮,采用 ViT-B/16 DINO 骨干网络与批大小 128,全过程无需回放任何历史图像。
实验关键数据¶
主实验¶
在 CIFAR-100、Tiny-ImageNet 和 ImageNet-100 三个权威 C-GCD 基准上评估全阶段及最终阶段(Session-5)的聚类准确率(ACC)。评价维度包含所有已知与新发现类别(All)、旧类别(Old)以及新引入类别(New)。
| 数据集 | 方法 | 初始离线 (All) | Session-1 (All/Old/New) | Session-5 最终 (All/Old/New) |
|---|---|---|---|---|
| CIFAR-100 | VanillaGCD | 90.82 | 72.32 / 78.50 / 41.40 | 51.36 / 53.70 / 30.30 |
| CIFAR-100 | SimGCD | 90.36 | 73.37 / 86.44 / 8.00 | 43.53 / 47.86 / 4.60 |
| CIFAR-100 | FRoST | 90.36 | 76.87 / 79.58 / 63.30 | 48.03 / 48.17 / 46.80 |
| CIFAR-100 | GM | 90.36 | 76.58 / 79.80 / 60.50 | 54.11 / 54.74 / 48.40 |
| CIFAR-100 | MetaGCD | 90.82 | 76.12 / 83.60 / 38.70 | 55.78 / 58.47 / 31.60 |
| CIFAR-100 | Happy | 90.36 | 80.40 / 85.26 / 56.10 | 59.99 / 60.96 / 51.30 |
| CIFAR-100 | Ours | 90.64 | 83.22 / 83.56 / 81.50 | 61.28 / 62.70 / 48.50 |
| Tiny-ImageNet | VanillaGCD | 84.20 | 55.93 / 58.92 / 41.00 | 45.94 / 48.06 / 26.90 |
| Tiny-ImageNet | FRoST | 85.86 | 75.15 / 78.56 / 58.10 | 40.15 / 42.73 / 16.90 |
| Tiny-ImageNet | GM | 85.86 | 76.42 / 82.40 / 46.50 | 46.90 / 50.62 / 13.40 |
| Tiny-ImageNet | Happy | 85.26 | 76.67 / 81.72 / 51.40 | 51.99 / 76.60 / 27.38 |
| Tiny-ImageNet | Ours | 85.15 | 77.15 / 80.88 / 58.50 | 53.25 / 75.98 / 30.52 |
| ImageNet-100 | Happy | 96.16 | 91.03 / 95.16 / 70.40 | 74.98 / 92.40 / 57.56 |
| ImageNet-100 | Ours | 96.21 | 91.10 / 95.52 / 69.00 | 76.72 / 91.88 / 61.55 |
消融实验与分析¶
在 CIFAR-100 与 Tiny-ImageNet 上对虚拟类别学习(VCL)与扩展邻域对比学习(ENCL)各组件进行逐项消融,报告跨所有持续阶段的平均 ACC。此外,分析兼顾遗忘度量 \(M_f\)(越低越好)与持续发现度量 \(M_d\)(越高越好)。
| 配置 / 模块组合 | CIFAR-100 (All / Old / New) | Tiny-ImageNet (All / Old / New) | 遗忘度 \(M_f\) (C100/Tiny) | 发现度 \(M_d\) (C100/Tiny) |
|---|---|---|---|---|
| 基线模型 (w/o VCL, w/o ENCL) | 69.00 / 71.82 / 51.36 | 63.22 / 79.79 / 35.23 | 29.40 / 8.66 (Happy) | 51.36 / 35.23 (Happy) |
| 仅加入 VCL (w/o ENCL) | 70.04 / 80.06 / 50.45 | 63.13 / 79.92 / 35.14 | - / - | - / - |
| 仅加入 ENCL (w/o VCL) | 69.57 / 80.96 / 51.10 | 64.22 / 78.93 / 40.22 | - / - | - / - |
| 完整模型 (VCL + ENCL) | 71.27 / 78.64 / 56.61 | 64.40 / 78.96 / 40.56 | 27.94 / 9.17 | 56.61 / 40.56 |
关键发现¶
- 新类发现能力跨代跃升:在持续发现指标 \(M_d\) 上,本文方法相比次优 SOTA(Happy)在 CIFAR-100 上从 51.36 提升至 56.61(+5.25%),在 Tiny-ImageNet 上从 35.23 提升至 40.56(+5.33%),且在 10 阶段长周期流式测试中(Table 3),平均准确率分别领先 Happy 达 1.90% 与 1.08%,验证了避免硬性伪标签指派在抑制错误累积上的长效价值。
- 双模块互补作用明确:消融数据表明,仅启用 VCL 主要显著拉升旧类保持精度(Old 从 71.82 跃升至 80.06),因其消除了歧义样本对既有类别的噪声冲击;仅启用 ENCL 则主导了新类判别边界的强化(New 提升至 51.10 / 40.22);两者协同优化下,新类发现度达到最高的 56.61,兼顾了旧类留存与新类扩张。
- 歧义样本与新误判为旧比例动态收敛:分析表明混淆样本比例在首个在线阶段初期产生波动后逐渐趋于平稳受控;同时,新类样本被错误归入旧类的比例在每个阶段内部持续下降,有力证明了中立虚拟缓冲机制成功阻断了模型偏向熟悉类别的认知惯性。
- 计算开销可控:结合 GPU 加速 FAISS 检索,加入 ENCL 后 CIFAR-100 每轮训练耗时仅从 338 秒增至 384 秒,显存占用从 17.9 GB 升至 18.8 GB,以极温和的工程代价换取了持续鲁棒性。
亮点与洞察¶
- 将预测不确定性转化为结构化缓冲而非硬丢弃:以往方法视低置信样本为有害噪声直接滤除,本文利用虚拟类别将歧义样本作为无偏几何锚点,既保留了样本的表征流形信息,又切断了错误伪标签梯度的注入通道。
- 双重准则联合感知流式表征漂移:同时耦合静态分类竞争度(\(D_{\text{top2}}\))与时序动态响应一致性(师生预测差异),使混淆样本识别兼备局部判别模糊性与时序演化不确定性双重敏感度。
- 二阶邻域流形扩展平滑聚类空间:在持续分布漂移下,直接一阶近邻极易受特征局部变形影响,二阶邻域自适应加权机制自然给予高连通度近邻更高信任度,为无监督聚类提供了致密的几何拓扑支撑。
局限与展望¶
- 虚拟类别容量假设较为固定:当前设计主要引入单一维度的虚拟类别权重作为缓冲通道,当单批次内同时遭遇跨多个极端异构语义的歧义样本时,单虚拟类别的表达容量可能面临瓶颈,未来可探索动态多虚拟槽位机制。
- 对初始特征抽取器质量仍有依赖:方法基于 DINO 预训练权重构建几何邻域,若上游骨干网络在特定细粒度长尾分布上的表征区分度极弱,初始拓扑失真可能会减弱二阶邻域对比的增益幅度。
- 拓展至多模态无标签流式发现:未来可将虚拟类别缓冲思想引入多模态大模型(VLM)的持续交互学习场景中,解决多模态流式数据对齐中的歧义归因问题。
相关工作与启发¶
- vs Happy [Ma et al., NeurIPS 2024]: Happy 侧重从损失重加权与预测校准角度缓解偏向旧类的偏差,但对高难模糊样本仍采用传统监督管道;本文从根源上改变歧义样本的优化路径,通过虚拟类别提供中立梯度缓冲,与基线目标正交互补。
- vs FRoST [Roy et al., ECCV 2022] & GM [Zhang et al., NeurIPS 2022]: FRoST 与 GM 分别采用特征冻结正则化与生长-合并架构扩展模型容量,但在处理无标签阶段新旧混杂数据时缺乏对边界模糊样本的防御;本文在不增加主干网络容量的轻量约束下,实现了更强的持续新类发现性能。
- vs AMEND [Banerjee et al., WACV 2024]: AMEND 在静态单阶段 GCD 中探索了扩展邻域,本文将其重构并深度适配至无回放持续流式场景,证明了二阶拓扑正则化在抵抗持续灾难性遗忘中的独特价值。
评分¶
- 新颖性: ⭐⭐⭐⭐ [将虚拟类别学习开创性引入无回放 C-GCD,构思巧妙且针对性极强]
- 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 3 大基准、多阶段及 10 阶段长周期演化评估,消融与动力学分析完备]
- 写作质量: ⭐⭐⭐⭐⭐ [逻辑严密,问题提出自然,公式与框架定义清晰自洽]
- 价值: ⭐⭐⭐⭐☆ [为开放世界流式感知与自监督持续发现提供了极具实用价值的范式参考]