From Predictions to Embeddings: Dual Knowledge Distillation for Instance-Dependent Partial Label Learning¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/ayunxiaobao/DKDP
领域: 模型压缩
关键词: 偏标记学习, 实例相关, 知识蒸馏, 标签消歧, 原型学习
一句话总结¶
针对实例相关偏标记学习(IDPLL)中候选标签语义高度混淆且非候选标签暗知识易被破坏的困境,提出双重蒸馏框架 DKDP,通过极小扰动的闭式约束投影校正教师输出分布,并引入在线类原型将可靠知识从预测空间延拓至特征嵌入空间。
研究背景与动机¶
偏标记学习(Partial Label Learning, PLL)作为一种典型的弱监督学习范式,为每个训练样本提供一个包含真实标签的候选标签集,有效缓解了精确人工标注的巨大开销。传统的 PLL 研究大多建立在实例无关假设(Instance-Independent PLL, IIPLL)之上,即候选集中的干扰噪声标签是从标签空间中均匀或随机抽样的,与样本的语义特征无关。然而,在真实场景中,标注者往往是因为类别之间外观、颜色或语义高度相似而产生混淆,这导致干扰标签强烈依赖于样本具体实例(Instance-Dependent PLL, IDPLL)。在这种更贴合实际的设定下,候选标签之间界限模糊,现有的自训练、流形传播或基于对比学习的消歧策略由于判别信号严重受损,往往遭遇性能断崖式下跌。
解决 IDPLL 的关键不仅在于从高混淆度的候选集中筛选出真实类别,更在于挖掘非候选标签中蕴含的“暗知识”(Dark Knowledge)。先验知识明确指出:任何合法样本的候选集中最低预测置信度,应当严格大于非候选集中的最高预测置信度。近期有研究尝试通过知识蒸馏(如 DIRK)引入教师模型提供软标签监督,但现存方案存在两项严重瓶颈:一是采用启发式缩放规则强行压制非候选标签概率,这种修正缺乏极小化扰动的理论保证,粗暴破坏了非候选标签原本携带的类别相对几何结构;二是仅在网络最终的 logits 输出层做单点校准,由于实例依赖引起的特征空间折叠与类簇混淆未被触及,模型在表示层依旧难以形成清晰的决策边界。
本文的切入角度是,将教师预测的校正严格建模为一个带先验不等式约束的极小扰动投影优化问题,推导其闭式解以最大化保留原始暗知识结构;同时构建与类原型对齐的几何桥梁,使校正后的软监督无损下沉到表示层。核心 idea:通过保结构的极小扰动闭式约束投影修正教师输出,严格满足候选概率高于非候选的偏标记先验,并结合在线更新的类原型相似度把可靠软监督从输出层延伸至嵌入层,形成输出与表征联动的双重蒸馏(DKDP)。
方法详解¶
整体框架¶
DKDP 的核心设计理念是“双重蒸馏”(Dual Distillation):在预测层传递保结构、满足先验的软概率分布,在表征层传递类簇分离、流形平滑的几何关系。整个流水线由教师网络与学生网络组成,二者均包含特征编码器与分类投影头。训练时,教师模型生成初始预测分布,随后通过极小扰动约束投影模块对分布进行闭式校准,消除违反偏标记先验的倒挂现象;学生网络一方面拟合校正后的教师预测,另一方面维护一组在线更新的类原型,将特征相似度分布与平滑后的置信分布对齐。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入样本与候选标签集 (x, S)"] --> B["教师模型前向预测 p^T"]
B --> C["1. 极小扰动约束投影<br/>闭式求解组间重标定因子 r*"]
C --> D["校正后教师目标分布 q*"]
D --> E["2. Logits 输出蒸馏<br/>交叉熵指导学生拟合 q*"]
D --> F["滑动更新置信目标 π"]
G["学生特征嵌入 e 与在线类原型 ω_c"] --> H["原型相似度概率 ν"]
F --> I["3. 细粒度语义蒸馏<br/>特征嵌入与原型几何对齐"]
H --> I
E --> J["联合优化目标 L = L_kd + β L_fd"]
I --> J
关键设计¶
1. 极小扰动约束投影:闭式求解保结构的分布重标定 直接使用动量更新的教师原始预测会导致蒸馏崩溃,因为网络早期输出往往将非候选类的概率预测得过高,违背了真实标签必然处于候选集 \(S\) 内的偏标记先验。为了既纠正倒挂又避免破坏非候选类之间的暗知识关联,本文将校正目标形式化为:在预测单纯形 \(\Delta^C\) 内寻找一个距离原始预测 \(p^T\) 的 KL 散度最小的分布 \(q^*\),满足严格分离约束 \(\min_{i \in S} q_i \ge \max_{j \notin S} q_j + \rho\),其中 \(\rho > 0\) 为微小的安全边界。
为规避每个迭代步高维单纯形数值优化的庞大计算开销,本文定义了候选重标定族(Candidate Re-scaling Family)。记候选集总概率质量为 \(P_S = \sum_{i \in S} p_i^T\),非候选集质量为 \(P_{\bar{S}} = 1 - P_S\)。对于标量因子 \(r > 0\),定义变换分布 \(q_i(r) = \frac{r p_i^T}{r P_S + P_{\bar{S}}}\)(当 \(i \in S\))以及 \(q_i(r) = \frac{p_i^T}{r P_S + P_{\bar{S}}}\)(当 \(i \notin S\))。令 \(p_{\min} = \min_{i \in S} p_i^T\),\(p_{\max} = \max_{j \notin S} p_j^T\),在 \(p_{\min} - \rho P_S > 0\) 条件下,满足不等式约束的最小缩放因子具备精确闭式解:
最终取 \(r^* = \max(1, r_{\min})\),即可通过代入重标定族得到闭式校正分布 \(q^* = q(r^*)\)。该设计在数学上严格保证了组内概率比例的恒定不变,以理论最优的极小修改达成了先验约束。
2. Logits 输出蒸馏:端到端传递校正后的可靠暗知识 获得满足先验的分布 \(q^*\) 后,输出层蒸馏旨在使学生模型的分类预测 \(f^S\) 充分拟合该软分布。相比于传统基于硬伪标签或均匀候选均分的监督方式,\(q^*\) 不仅显式放大了候选集内部最具潜力的类别概率,更完整保留了非候选类别之间反映视觉共性与混淆难度的暗知识比率。
学生网络在输出层采用标准的交叉熵蒸馏损失进行端到端优化:
教师模型参数 \(\theta^T\) 则不参与梯度反向传播,而是通过学生参数 \(\theta^S\) 的指数移动平均(EMA)进行动量更新:\(\theta^T \leftarrow m \theta^T + (1-m) \theta^S\)。这一机制保障了软监督信号随训练进程平滑演进,防止由错误候选引起的瞬时震荡。
3. 细粒度语义蒸馏:在线类原型驱动的表征空间结构对齐 在 IDPLL 中,高度相似的干扰类会使样本嵌入聚集在决策面附近,单纯的 logits 蒸馏无法约束潜在特征空间的拓扑几何。为此,本文为每个类别引入归一化的全局类原型 \(\boldsymbol{\omega}_c\)(\(c \in \{1, \dots, C\}\)),并在每个 mini-batch 内依据学生模型的候选集内预测高置信样本,按动量系数 \(\gamma\) 进行批次滑动更新:
其中 \(\bar{\boldsymbol{e}}_c\) 为当前 batch 中在候选集受限预测下分配到类 \(c\) 的样本嵌入均值。利用当前特征向量 \(\boldsymbol{e}_i\) 与所有类原型计算温度系数为 \(\tau\) 的余弦相似度分布 \(\boldsymbol{\nu}_i\),即 \(\nu_{ik} = \frac{\exp(\boldsymbol{e}_i \cdot \boldsymbol{\omega}_k / \tau)}{\sum_{c=1}^C \exp(\boldsymbol{e}_i \cdot \boldsymbol{\omega}_c / \tau)}\)。同时,将校正教师预测在候选集上归一化后的分布进行时序平滑得到目标分布 \(\boldsymbol{\pi}_i\)。细粒度语义蒸馏损失通过衡量二者的 KL 散度实现:
该机制迫使属于相同潜在真类的样本嵌入紧密靠近对应的类原型,并在空间上排斥错误候选与非候选类原型,拉开类间边界,形成稳定可分的流形结构。
损失函数 / 训练策略¶
模型的整体训练损失由 logits 输出蒸馏损失与细粒度语义蒸馏损失加权组合而成:
其中 \(\beta\) 为平衡两层蒸馏力度的超参数。在优化过程中,学生网络参数通过 AdamW 或 SGD 最小化 \(\mathcal{L}\),教师参数与类原型分别依据动量系数 \(m\) 与 \(\gamma\) 进行无梯度更新。实验中设置先验安全边界 \(\rho = 0.05\),在主流视觉主干(ResNet-18 与 ResNet-34)上端到端训练。
实验关键数据¶
主实验¶
论文在四个常用基准数据集(Fashion-MNIST, Kuzushiji-MNIST, CIFAR-10, CIFAR-100)及三个具有高度语义相似性的细粒度数据集(Flower-102, Oxford-IIITPet, CUB-200)上全面对比了 12 种主流 PLL 算法(涵盖 7 种 IIPLL 方法与 5 种专门设计的 IDPLL 方法)。下表分别汇总了基准数据集与细粒度数据集的分类准确率(原论文 Table 1 与 Table 2):
| 数据集 | 指标 | DKDP (本文) | 次优 SOTA (DIRK) | 提升幅度 |
|---|---|---|---|---|
| Fashion-MNIST | Top-1 Acc (%) | 91.81 ± 0.10 | 91.48 ± 0.21 | +0.33% |
| Kuzushiji-MNIST | Top-1 Acc (%) | 98.49 ± 0.05 | 96.80 ± 0.52 | +1.69% |
| CIFAR-10 | Top-1 Acc (%) | 93.64 ± 0.17 | 90.87 ± 0.25 | +2.77% |
| CIFAR-100 | Top-1 Acc (%) | 70.72 ± 0.20 | 68.77 ± 0.49 | +1.95% |
| Flower-102 | Top-1 Acc (%) | 48.92 ± 0.35 | 44.03 ± 0.02 | +4.89% |
| Oxford-IIITPet | Top-1 Acc (%) | 70.50 ± 0.49 | 64.95 ± 2.11 | +5.55% |
| CUB-200 | Top-1 Acc (%) | 54.04 ± 0.23 | 49.29 ± 1.00 | +4.75% |
消融实验¶
为了剖析极小扰动约束投影模块与细粒度语义蒸馏模块各自的贡献,作者在五种不同难度的视觉数据集上开展了递进消融评估(原论文 Table 4):
| 配置方案 | \(\mathcal{L}_{ce}\) | \(\mathcal{L}_{kd}\) | \(\mathcal{L}_{fd}\) | CIFAR-10 | CIFAR-100 | Flower-102 | 说明 |
|---|---|---|---|---|---|---|---|
| Full Model (DKDP) | ✓ | ✓ | ✓ | 93.64 | 70.72 | 48.92 | 完整双重蒸馏模型 |
| w/o \(\mathcal{L}_{fd}\) | ✓ | ✓ | ✗ | 90.89 | 68.05 | 44.36 | 去除原型语义蒸馏,仅保留输出层校准 |
| w/o \(\mathcal{L}_{fd} \ \& \ \mathcal{L}_{kd}\) | ✓ | ✗ | ✗ | 72.95 | 62.97 | 37.72 | 仅用基线自训练交叉熵,完全退化 |
此外,针对教师分布校准精度的定量分析(原论文 Table 3 与 Figure 4)表明,在相同的 CIFAR-10 样例上,DIRK 的启发式缩放产生激进修改,非候选类概率被压至 0.001 以下;而 DKDP 修正后的非候选类概率与原始预测的 KL 散度、全变差距离(TV)与 JS 散度均显著更低,有效避免了过度修正。计算开销方面(原论文 Table 5),在 CIFAR-10 上每个 epoch 耗时为 96s,与 ABLE(98s)基本相当,仅略高于 DIRK(71s),属于合理的性能与计算折中。
关键发现¶
- 原型语义蒸馏在细粒度高混淆场景增益最为显著:消融数据显示,移除 \(\mathcal{L}_{fd}\) 后,在简单数据集 KMNIST 上仅微跌 0.94%,而在高难度的 CIFAR-100 与细粒度 Flower-102 上分别骤降 2.67% 与 4.56%,证实了在类别界限模糊时,将可靠软知识延伸至特征空间是维持可分性的决定性因素。
- 极小扰动约束投影是防止蒸馏崩溃的基石:同时剥离 \(\mathcal{L}_{fd}\) 与 \(\mathcal{L}_{kd}\) 后,CIFAR-10 上的准确率从 93.64% 暴跌至 72.95%(-20.69%),表明缺乏满足先验的教师修正,模型会迅速陷入实例相关噪声的错误强化循环中。
- 超参数敏感度表现出宽平鲁棒性:参数分析显示,语义蒸馏权重 \(\beta\) 在宽幅区间内保持稳定高位;先验安全边界 \(\rho\) 在 0.05 处取得峰值,既保证了候选与非候选类的判别间距,又未对原始分布引入过大的人工畸变。
亮点与洞察¶
- 闭式极小修改的严谨数学形式化:不同于前序工作凭借经验超参强行缩放 logits,本文证明了在候选重标定族下,满足先验约束的最优投影存在解析闭式解,兼具计算高效性与理论解释性。
- 暗知识保真度与先验合规性的双赢:定量实验证实,DKDP 修正后的概率分布既严格落实了“候选胜于非候选”的弱监督基本法,又保持了非候选类之间的相对比例,使负类间的结构暗知识得以无损复用。
- 输出到表征的双层蒸馏范式:将传统局限于 softmax 输出的知识蒸馏扩展至与特征原型交互的嵌入空间,为处理各类标签噪声与弱监督表征坍缩问题提供了普适的方法论启示。
局限与展望¶
- 强依赖单步闭式族的表达能力:为追求闭式高效解,约束投影被限定在由单个标量 \(r\) 控制的候选重标定族内,未探索全单纯形上的广义 Bregman 投影,可能在极端多峰分布下存在次优性。
- 批次内原型更新的冷启动脆弱性:类原型更新依赖于学生模型的当前候选集受限伪标签,在极早期训练阶段,若候选集过大且初始主干判别力不足,可能引入有偏的均值原型偏移。
- 未来方向:可进一步将该双重蒸馏思想推广至实例相关偏多标签学习(Partial Multi-Label Learning)或开放集弱监督场景,并结合自适应温度系数动态调节类原型的排斥边界。
相关工作与启发¶
- vs DIRK (Wu et al., AAAI 2024): DIRK 首次尝试将知识蒸馏用于 IDPLL,但采用启发式分段缩放校正教师输出,破坏了原始暗知识几何且依赖强假设;本文提出闭式极小扰动投影,在严格满足先验的同时最大程度保留分布结构,并在 CIFAR-10 与 Oxford-Pets 上分别领先 2.77% 和 5.55%。
- vs PICO (Wang et al., ICLR 2022): PICO 利用对比学习与原型分类器协同消歧,但在 IDPLL 强特征关联噪声下易发生正负样本误配;本文以校准后的教师软概率平滑引导原型分布,有效避免了硬对比带来的误惩罚。
- vs POP (Xu et al., ICML 2023): POP 侧重于在训练过程中逐步剪除候选集中的负标签,但容易出现不可逆的误删积累;DKDP 始终保留完整分布的软监督梯度,容错性与鲁棒性显著更高。
评分¶
- 新颖性: ⭐⭐⭐⭐ [推导了先验约束下的极小扰动闭式投影解,提出输出与原型嵌入联动的双重蒸馏架构]
- 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 4 个基准数据集与 3 个细粒度数据集,对比 12 种算法,并包含严格的分布偏差定量分析与消融验证]
- 写作质量: ⭐⭐⭐⭐⭐ [数学推导清晰严谨,逻辑链路完备,图表绘制规范]
- 价值: ⭐⭐⭐⭐⭐ [为实例相关弱监督学习提供了理论自洽且计算轻量的落地范式,对蒸馏与表示学习结合有重要参考价值]