跳转至

Combining Discrepancy-Confusion Uncertainty and Calibration Diversity for Active Fine-Grained Image Classification

会议: ECCV 2026
论文: CVF / ECCV 官方页面
领域: 其他 (主动学习 / 细粒度图像分类)
关键词: 主动学习, 细粒度图像分类, 局部特征融合, 差异混淆不确定性, 校准多样性

一句话总结

针对细粒度图像分类中类间视觉极度相似导致传统主动学习度量失效的痛点,DECERN 通过局部特征融合解耦并量化样本的结构稳定性与类别方向性,配合不确定性加权聚类与校准多样性采样,在极低标注预算下实现判别性样本的高效筛选。

研究背景与动机

深度神经网络的高性能表现高度依赖大规模有标签样本,但在考古器物、物种分类、医学等高度专业的细粒度领域,专家数据标注的时间与经济成本极为高昂。主动学习旨在通过在未标注数据池中迭代选择最具信息量的样本交由专家标注,从而在严格受限的预算内最大化模型增益。现有的主动学习策略通常分为基于不确定性、基于多样性以及两者结合的混合方法。然而,这些方法严重依赖模型在未标注样本上能够提供可靠的表征分布估计。

细粒度图像由于属于同一大类下的精细子类别,样本在浅层特征上高度一致,而在深度特征空间中也表现出广泛重叠的语义特征。这种特征分布的深度交织使得传统主动学习指标全面失灵:基于置信度、熵或边界间隔的不确定性方法难以准确定位真实的决策边界,容易受到模糊语义的噪声误导;而基于 CoreSet 或 K-Means 的多样性方法则容易将几何距离相近但语义不同的样本混淆,甚至选出大量冗余的类内样本。近期虽有基于特征融合(如 ALFA-Mix)的数据增强方法试图通过凸组合探测局部扰动,但其仅依赖伪标签翻转率来衡量样本价值,忽略了跨类别共享微观模式的细粒度样本,难以准确识别细微类别的敏感区域。

面对细粒度场景下特征相似度高与边界混淆的核心矛盾,本文的切入点是主动施加局部扰动以观察特征的鲁棒性偏移:在保留关键语义维度的前提下,通过向已标注类别的锚点注入局部扰动,可以有效探测样本在受到结构破坏时的漂移程度,以及面对相似类别时抗混淆的能力。核心 idea:通过梯度池化引导的局部特征融合解耦并衡量无标签样本的结构稳定性(差异不确定性)与类别方向性(混淆不确定性),进而借助不确定性加权聚类与融合全局锚点距离的校准多样性,实现局部代表性与全局多样性的协同采样。

方法详解

整体框架

DECERN 的核心流程由两大部分构成:第一阶段为基于局部特征融合的“差异-混淆不确定性”(Discrepancy-Confusion Uncertainty)评估与动态候选集筛选;第二阶段为基于“校准多样性”(Calibration Diversity)的不确定性加权多样性采样。

系统首先根据已标注数据池中各类别样本的表征与预测概率构建类别锚点。对于每一个未标注样本,利用梯度池化掩码定位关键判别特征,在特征空间与各类别锚点进行自适应权重的局部融合,并分别计算其结构稳定性(交叉熵差异)与类别方向性(信息熵混淆),加权聚合为实例级不确定性得分。随后,基于得分偏度建立自适应动态阈值筛选出高价值候选子集。最后,在候选集上执行不确定性加权 K-Means 聚类,并在每个聚类簇中挑选既靠近聚类中心又远离已标注全局锚点的样本,形成最终查询批次。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["未标注池样本 $z^u$ 与已标注类别锚点 $z^a$"] --> B["1. 显著性引导的局部特征融合<br/>梯度池化掩码定位判别维度并按置信度自适应插值"]
    B --> C["2. 差异-混淆双重不确定性度量<br/>交叉熵测结构稳定性 + 信息熵测类别方向性"]
    C --> D["偏度自适应动态阈值筛选<br/>基于分布偏度过滤得到高不确定性候选子集"]
    D --> E["3. 不确定性加权聚类与校准多样性采样<br/>簇中心局部代表性 + 锚点距离全局多样性协同挑选"]
    E --> F["专家标注并更新模型与数据池"]

关键设计

1. 显著性引导的局部特征融合:解耦结构稳定性与类别方向性

细粒度样本间的差异往往隐藏在微小局部的特异性区域,全局特征插值极易抹杀细微特征并引入大量背景噪声。为此,DECERN 设计了基于反向传播梯度的自适应局部融合机制。针对未标注样本 \(z^u\) 的伪标签预测,计算其在特征层的梯度并自适应池化为 100 个分箱,选取显著性最高的 top-\(\eta\) 个分箱并上采样回原始维度,构建二进制显著性掩码 \(M\)。局部特征融合定义为: $$ \phi(z^u, z^a_j; \alpha_j, M) = (1 - M) \odot z^u + M \odot \big((1 - \alpha_j) z^u + \alpha_j z^a_j\big) $$ 式中 \(\alpha_j\) 取样本在第 \(j\) 类的原始预测置信度 \(p^u_j\)。该设计的机理在于:对于高置信度所属类别赋予较大的 \(\alpha_j\),施加高强度的语义一致扰动,检验其混合表征是否仍能维持明确的类别指向;对于其他非置信类别则施加较小的 \(\alpha_j\),引入低强度的语义不一致微扰,测试其原有语义结构是否因局部轻微污染而发生剧烈崩溃。这使得微观判别维度的抗噪能力与类边界稳定性得以显式解耦。

2. 差异-混淆双重不确定性度量与动态自适应阈值

传统单一指标(如纯熵或纯预测翻转)无法区分样本是因为语义边界模糊而动摇,还是因为缺乏判别信号而全面混淆。DECERN 结合结构稳定性(差异)与类别方向性(混淆),计算融合后预测概率 \(p^m_j = \mathcal{F}_c(\phi(z^u, z^a_j; \alpha_j, M))\) 与基准预测 \(p^*_j\) 的差异。对于类别 \(j\),结合余弦相似度因子 \(\beta_j = 1 - \frac{1 + \cos(z^u, z^a_j)}{2}\),构建类别级不确定性得分: $$ \mathcal{S}_{dc}(p^_j, p^m_j; \beta_j) = \mathcal{H}(p^m_j)^{1 - \beta_j} + \mathcal{CE}(p^_j, p^m_j)^{\beta_j} $$ 并在所有类别与基准参考分布(原始预测 \(p^u\)、全局理论混合预测 \(p^b_j\)、局部理论混合预测 \(p^w_j\))上求平均,得到实例级总不确定性得分 \(\mathcal{S}\)。为了避免在主动学习各轮次中使用固定比例截断导致初期引入过多噪声或后期丧失多样性,模型引入结合均值 \(\bar{\mathcal{S}}\)、方差 \(\sigma\) 与偏度 \(\gamma\) 的动态阈值: $$ \zeta = \bar{\mathcal{S}} + \lambda \sigma \frac{\mathbb{E}[(S - \bar{\mathcal{S}})^3]}{\sigma^3} $$ 偏度动态反映了当前模型性能的进化状态与困难样本的集中度,仅选取 \(\mathcal{S} \ge \zeta\) 的样本构成高价值候选集 \(\mathcal{C}\)

3. 不确定性加权聚类与校准多样性采样:兼顾局部代表性与全局多样性

如果仅在高不确定性候选集中直接选取最难样本,极易出现相似边缘样本扎堆的采样冗余;而脱离不确定性的纯几何多样性采样又会引入大量远离边界的平凡样本。DECERN 首先以不确定性得分 \(\mathcal{S}\) 作为样本权重,在候选集 \(\mathcal{C}\) 的表征空间执行加权 K-Means 聚类,产生 \(B\) 个聚类簇(\(B\) 为本轮标注预算)。加权机制使簇中心天然向高不确定性区域倾斜。随后,在每个簇 \(\mathcal{C}_k\) 中,综合衡量样本与簇中心的距离(局部代表性)以及与所有已标注类别锚点 \(z_j^a\) 的最小余弦距离(全局多样性): $$ x^{s_k} = \arg\max_{x_i \in \mathcal{C}k} \left[ - \xi |z_i^u - z^{\mathcal{C}_k}|_2 + (1 - \xi) \min (1 - \cos(z_i^u, z_j^a)) \right] $$ 第一项选择靠近不确定性簇中心的原型样本,确保样本代表了未标注空间中关键的类内变异分布;第二项促使样本尽可能偏离已标注锚点所覆盖的已知知识区域,积极探索潜在未被充分学习的尾部区域与未知边界,从而在局部密集覆盖与全局探索之间达成精准平衡。

损失函数 / 训练策略

在每轮主动学习迭代中,所选取的 \(B\) 个样本经由人工标注后加入已标注集 \(\mathcal{D}^\ell\)。模型主干(ResNet50 或 ViT-Small)在更新后的已标注集上通过标准交叉熵损失进行全监督微调。训练采用 Adam 优化器,初始学习率为 0.001 并配合余弦退火策略,训练批大小固定为 128。每轮主动学习选择的样本量设定为 \(B = K \cdot N_c\)\(N_c\) 为类别总数,\(K \in \{1, 2\}\)),总共进行 8 个 AL 周期。超参数默认设为掩码比例 \(\eta=0.1\)、阈值偏度加权因子 \(\lambda=0.5\) 以及校准多样性权重 \(\xi=0.8\)

实验关键数据

主实验

论文在 7 个经典的细粒度图像数据集(Caltech101、BronzeDing 铜鼎考古数据集、CUB-200-2011、Flowers102、Food101、OxfordIIITPet、StanfordDogs)上进行了 39 种不同实验设置的评测。以下表格整理了在 Caltech101 与 BronzeDing 数据集上采用 ResNet50 主干、不同标注预算 \(B\) 下各主流主动学习基线与 DECERN 的 Top-1 准确率(%)对比:

数据集与预算设置 Random K-Means Margin CoreSet BADGE ALFA-Mix 本文 (DECERN) 较次优提升
Caltech101 (\(B = 1 \cdot N_c\)) 74.14 79.52 80.41 79.80 81.35 81.60 82.95 ± 0.37 +1.35%
Caltech101 (\(B = 2 \cdot N_c\)) 82.93 86.85 87.60 87.10 88.02 88.15 88.49 ± 0.37 +0.34%
BronzeDing (\(B = 1 \cdot N_c\)) 34.20 36.80 38.50 37.10 39.80 40.20 42.15 ± 0.45 +1.95%
BronzeDing (\(B = 2 \cdot N_c\)) 43.50 46.20 47.90 46.50 49.30 50.10 52.30 ± 0.40 +2.20%

(注:基线数据对应论文图 2 曲线对应周期收敛均值,完整模型均经过 5 次随机种子重复测验)

消融实验

论文在 Caltech101 数据集上(ResNet50 主干)针对不确定性模块(差异不确定性 \(\mathcal{S}_d\) 与混淆不确定性 \(\mathcal{S}_c\))及校准多样性采样中的各组成组件进行了严谨的消融实验(原论文 Table 1):

配置 / 变体 不确定性组件 多样性组件 \(B = 1 \cdot N_c\) Acc (%) \(B = 2 \cdot N_c\) Acc (%) 说明
Full model (DECERN) \(\mathcal{S}_d + \mathcal{S}_c\) 加权聚类 + 校准采样 82.95 ± 0.37 88.49 ± 0.37 完整模型
仅保留多样性 80.73 ± 0.69 87.08 ± 0.22 去除不确定性过滤,仅保留校准多样性
纯随机基线 74.14 ± 0.93 82.93 ± 0.47 无主动学习策略
移除混淆不确定性 (w/o \(\mathcal{S}_c\)) \(\mathcal{S}_d\) 82.10 ± 0.91 88.25 ± 0.42 仅量化结构稳定性,缺乏方向性判断
移除差异不确定性 (w/o \(\mathcal{S}_d\)) \(\mathcal{S}_c\) 82.43 ± 0.44 88.16 ± 0.42 仅量化混淆熵,缺少结构偏移惩罚
移除不确定性权重 (w/o Weighted) \(\mathcal{S}_d + \mathcal{S}_c\) 无权重聚类 82.39 ± 0.42 88.18 ± 0.59 聚类中心不受样本不确定性牵引
移除聚类直接排序 (w/o Clustering) \(\mathcal{S}_d + \mathcal{S}_c\) 无聚类采样 81.27 ± 0.36 88.43 ± 0.34 缺乏区域覆盖,容易产生高不确定性扎堆
移除锚点校准 (w/o Calibration) \(\mathcal{S}_d + \mathcal{S}_c\) 仅靠近簇中心 82.94 ± 0.88 88.04 ± 0.42 仅关注局部代表性,丧失对全局未知区域探索

关键发现

  • 双重不确定性的互补性:同时剥离 \(\mathcal{S}_c\)\(\mathcal{S}_d\) 导致模型在 \(B=1 \cdot N_c\) 下准确率骤降至 80.73%(下降 2.22%),且单独去除任一不确定性指标均出现约 0.5%~0.85% 的显著降幅,证实了细粒度分类必须同时对特征结构的崩溃脆弱性与语义指向的混淆性建模。
  • 采样类别分布均衡度:如图 3a 所示,传统方法(如 CoreSet、NoiseStability、K-Means)在细粒度特征高度密集的局部容易陷入严重的选择失衡(高分布熵差异),而 DECERN 通过不确定性加权与锚点距离校准,促使采样批次的类别分布维持极佳的平衡性,避免因个别容易混淆的类别过度采样导致的模型灾难性过拟合。
  • 高计算吞吐效率:如图 3b 所示,DECERN 在 Caltech101 单轮样本挑选耗时不足 50 秒,而依赖复杂梯度空间计算或图优化的 BADGE 耗时高达约 500 秒、UHerding 与 NoiseStability 耗时均超过 300 秒,DECERN 在获得更优精度的同时保持了近乎最快基线的计算效率。

亮点与洞察

  • 局部显著性掩码约束下的特征插值:传统特征混合常因全图线性融合破坏细粒度关键物种部位(如鸟喙、花蕊特征),DECERN 引入反向梯度池化保留前 10% 关键 bin,实现了在保全核心语义骨干下的精准局部探针扰动。
  • 基于偏度(Skewness)的动态采样门限:打破固定比例截断的机械范式,利用不确定性得分的经验偏度直接作为模型学习状态的自适应调节器,精准自适应主动学习早期与晚期候选池规模的动态演进。
  • 校准多样性实现局部与全局的双重锚定:将簇内“原型代表性”与跨类“全局发散性”显式建模在一个简洁的目标函数中,既保留了最具代表性的难分样本,又强制向未探索特征边界延伸。

局限与展望

  • 密集预测任务拓展受限:作者在结论中指出,当前 DECERN 的局部特征融合与锚点机制高度绑定于图像级分类表征,尚未在目标检测、语义分割等需要精细空间对应关系的密集视觉任务中验证可行性。
  • 依赖预训练特征初始质量:方法对类别锚点的计算建立在已有特征编码器的一定表征能力之上,若冷启动阶段特征塌缩严重或无标注样本极其极度稀疏,梯度反传掩码的定位精度可能会受到干扰。
  • 未来方向:探索免于全监督微调的自监督/大视觉模型零样本提示的主动学习扩展,以及针对不平衡长尾细粒度分布的自适应校准。

相关工作与启发

  • vs ALFA-Mix (CVPR 2022):ALFA-Mix 同样采用特征插值寻找难以分类的边缘样本,但它完全依赖扰动后伪标签是否翻转,缺乏对细微特征结构崩溃的精细定量,且容易受到假阳性标签翻转噪声干扰;DECERN 结合梯度池化局部掩码与差异-混淆双指标,在细粒度微小变异场景下定位更稳健。
  • vs BADGE (ICLR 2020) & CLUE (ICCV 2021):BADGE 与 CLUE 奠定了不确定性加权多样性采样的基础,但 BADGE 在输出层计算全量反传梯度矩阵计算开销巨大(耗时高出 10 倍以上),且两者均未对细粒度独有的跨类混淆模式进行解耦;DECERN 兼具极低的时间开销与显著更高的细粒度识别增益。

评分

  • 新颖性: ⭐⭐⭐⭐ [局部特征融合下的结构稳定性与方向性解耦设计精巧,动态偏度阈值切合实际需求]
  • 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 7 个细粒度数据集、39 种实验配置、两套骨干网络及 15 种对比基线,消融与效率分析非常完备]
  • 写作质量: ⭐⭐⭐⭐ [方法推导严谨,动机阐述自然连贯,符号与流程定义清晰]
  • 价值: ⭐⭐⭐⭐ [针对细粒度专业场景低成本标注痛点提供了切实有效且运行极快的主动学习落地方案]