跳转至

Geometric Regularization for Long-Tailed Semi-Supervised Learning via Gaussian Feature Bridges

会议: ECCV 2026
论文: ECCV 原文
领域: 其他
关键词: 半监督学习, 长尾学习, 高斯特征桥, 几何正则化, 原型图谱

一句话总结

针对真实长尾半监督学习中伪标签漂移与尾类表征匮乏的难题,本文提出高斯桥一致性框架(GBC),在隐空间构建连接未标记样本与可靠类别锚点的高斯特征桥,并通过置信度引导的 BridgeMix 增强跨样本插值,实现显著优于既有 SOTA 的尾类泛化表现。

研究背景与动机

现实世界中的半监督学习(SSL)往往面临严重的类别不平衡与长尾分布挑战。当未标记数据存在未知的类别倾斜时,传统基于一致性正则化与阈值伪标签的方法极易产生确认偏差(Confirmation Bias):多数头类迅速垄断了学习信号并生成大量自信的伪标签,而少数尾类由于训练样本极其匮乏,不仅难以获得高质量的伪监督,其特征表征还会逐渐被头类侵蚀,发生严重的语义漂移(Semantic Drift)。现有的长尾半监督学习(LTSSL)方法多聚焦于输出端或对数几率(Logit)层面的启发式补偿,例如类别自适应阈值调整、输出分布对齐或损失重加权,这些手段未能深入特征流形内部直接规范不确定样本的表征演化轨迹。

这种失败的核心矛盾在于:未标记样本在早期或尾类上的特征表征高度不确定、噪声极大,而模型缺乏一种连续、几何平滑的机制,将这些处于决策边界附近的漂移特征引导至可靠的类别流形中心。纯粹基于输出硬/软过滤的做法容易导致尾类样本利用率过低,或者因错误累积而彻底退化。

受到统计力学中薛定谔桥(Schrödinger Bridge)理论在两个概率分布间建立最优随机过渡路径的启发,本文探索将可靠样本视为语义桥梁的端点,并在隐空间中显式铺设由未标记样本过渡到可靠类别原型的平滑轨迹。核心 idea:在隐特征空间构建类别条件高斯特征桥(Gaussian Feature Bridge)连接未标记样本与动态原型锚点,并结合置信度自适应特征混合(BridgeMix)与桥一致性约束,以几何插值正则化强制平滑决策边界。

方法详解

整体框架

GBC 框架的核心思想是将未标记样本的不确定表征向动态原型图谱(Prototype Atlas, PA)中检索出的高置信度类别锚点进行连续几何拉迁。整体流程分为四个紧密衔接的环节:首先,动态维护一个包含标注样本与高置信度伪标签样本的原型图谱,为各个类别提供干净的几何锚点;其次,未标记样本经弱增强预测后,若满足自适应置信度,则在倒数第二层特征空间构建与同类锚点相连的高斯特征桥,并通过轻量投影残差融入学生网络的前向传播;再次,构造端点几率对数插值的几何软目标,施加类别重加权的桥一致性损失;最后,结合样本置信度引导的 BridgeMix 机制,完成双样本双锚点的协同流形混合。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["未标记样本 x_u<br/>弱/强双路数据增强"] --> B["动态原型图谱检索<br/>类别锚点匹配与更新"]
    B --> C["高斯特征桥构建<br/>隐空间随机轨迹插值"]
    C --> D["残差特征融合与前向<br/>中心门控自适应注入"]
    D --> E["几何目标构造与一致性损失<br/>单纯形对数插值对齐"]
    E --> F["置信度引导 BridgeMix<br/>双样本双锚点流形正则化"]

关键设计

1. 动态原型图谱构建与自适应锚点检索:确保全类别流形锚点的纯净与多样

针对长尾分布下尾类缺乏可靠监督锚点的困境,模型在训练过程中维护一个类别索引的原型图谱 \(\mathcal{B} = \{(f_{\text{kp}}^c, c, \text{conf}, \text{src})\}\)。该图谱初始注入少量有标签真实样本,并在训练中动态接纳教师模型预测置信度超过类别自适应阈值 \(\tau_c\) 的未标记特征。为了避免头类样本膨胀挤占空间,图谱容量被严格限制在整个数据集的 2%~8%,并通过余弦距离门限剔除语义冗余样本,配合时间衰减机制淘汰陈旧伪锚点。若某极度稀疏的尾类在当前批次中无候选伪锚点,图谱自动回退至该类的指数移动平均(EMA)原型,确保头尾类别在特征空间始终具备稳定且抗噪的几何目标点。

2. 隐空间高斯特征桥与残差门控融合:实现可控平滑的表征转移

为了将处于决策边界周围甚至发生漂移的未标记特征平缓拉回真实类流形,GBC 在深度特征层(如 ResNet-50 的 Stage 4 输出)构建显式的高斯插值路径。对于未标记特征 \(f_u\) 与检索得到的同类锚点 \(f_{\text{kp}}\),桥上中间状态 \(f_t\) 定义为:

\[f_t = (1 - g(t)) f_u + g(t) f_{\text{kp}} + \sigma(t) \varepsilon\]

其中时间参数采用贝塔分布采样 \(t \sim \text{Beta}(2, 2)\) 并截断于 \([0.2, 0.8]\),单调路径函数直接取恒速轨迹 \(g(t) = t\),随机扩散项尺度设为 \(\sigma(t) = \nu \sqrt{t(1 - t)}\)\(\varepsilon \sim \mathcal{N}(0, \mathbf{I})\)。得到插值特征后,模型并不进行暴力硬替换,而是通过中心门控加权的残差更新将其软注入学生特征:

\[\tilde{f} = f_{\text{stu}} + \omega(t) \mathcal{P}(f_t - f_{\text{stu}})\]

门控权重 \(\omega(t) = 4t(1 - t)\) 在轨迹正中(\(t = 0.5\))赋予最大修正权重,以精准约束语义不确定性最高的过渡阶段,而轻量投影层 \(\mathcal{P}(\cdot)\) 确保了残差维度的几何对齐。

3. 几何目标插值与桥一致性正则化:平滑决策边界并抑制漂移

为了给中间桥接状态提供有意义的监督指引,目标分布不能简单采用线性概率加权,而必须在概率单纯形上保持端点几率的对数几何一致性。中间目标分布 \(q_t\) 由未标记预测 \(\hat{q}_u\) 与锚点预测 \(\hat{q}_{\text{kp}}\) 经几何插值生成:

\[q_t = \text{softmax}\big((1 - t)\log \hat{q}_u + t\log \hat{q}_{\text{kp}}\big)\]

配合类别频率重加权系数 \(w_c \propto (\bar{f} / f_c)^\gamma\)(其中 \(f_c\) 为类 \(c\) 的标注样本数,\(\bar{f}\) 为平均类频),桥一致性损失定义为:

\[\mathcal{L}_{\text{bridge}} = \mathbb{E}_{x_u, t}\left[ w_c \cdot \omega(t) \cdot \text{KL}\big(q_t \parallel p_\theta(x_u^{\text{strong}}; \tilde{f})\big) \right]\]

理论分析表明,最小化该损失等价于对学生网络的局部决策边界施加利普希茨连续性(Lipschitz Continuity)与曲率约束,期望曲率满足 \(\mathbb{E}_t[\kappa(\partial \mathcal{M}_c)] \le C_0 + C_1 \mathcal{L}_{\text{bridge}}^{1/2}\),从几何底层显著展平了类别分界面。

4. 置信度引导的 BridgeMix:以高确信样本驱动双向流形增强

常规 MixUp 采用对称随机权重,在长尾半监督场景中极易引入错误伪标签交叉污染。BridgeMix 将插值扩展到样本对与其对应锚点对之间,基于两者的预测置信度 \((o_i, o_j)\) 计算非对称系数:

\[\lambda_i = \frac{o_i}{o_i + o_j}\]

进而对样本特征与锚点特征分别施加混合:\(f_{u}^{\text{mix}} = \lambda_i f_i + (1 - \lambda_i) f_j\)\(f_{\text{mix}}^{\text{anchor}} = \lambda_i f_i^{\text{anchor}} + (1 - \lambda_i) f_j^{\text{anchor}}\)。随后在该混合端点上继续运行高斯特征桥与对数几何软目标对齐。高确信样本借此向低确信样本提供单向主导的表征牵引,有效收紧了基于经验拉德马赫复杂度(Rademacher Complexity)的泛化风险上界。

损失函数 / 训练策略

模型的总体优化目标由有监督交叉熵、无监督一致性损失与几何桥一致性损失共同构成:

\[\mathcal{L} = \mathcal{L}_{\text{sup}} + \mu \mathcal{L}_{\text{unsup}} + \beta \mathcal{L}_{\text{bridge}}\]

其中 \(\mu\) 为无监督项权重,\(\beta\) 在初始阶段线性预热至 0.75 以确保前期伪标签质量尚不稳定时不破坏表征空间。高斯桥噪声强度默认取 \(\nu = 0.10\)\(t\) 分布参数 \(\alpha = 2.0\)。对数运算前添加 \(\epsilon = 10^{-6}\) 的平滑因子以避免极端硬标签导致的数值下溢。

实验关键数据

主实验

论文在 CIFAR10-LT(含 consistent、uniform、reversed、middle、head-tail 五种无标记分布)以及大规模 ImageNet-127、ImageNet-1K 基准上进行了全面评测。

在 CIFAR10-LT 基准(\(N_1 = 500, M_1 = 4000\))上的主分类准确率对比如下:

方法 consistent (\(\gamma_\ell=100, \gamma_u=100\)) uniform (\(\gamma_\ell=100, \gamma_u=1\)) reversed (\(\gamma_\ell=100, \gamma_u=1/100\)) middle (\(\gamma_\ell=100, \gamma_u=100\)) head-tail (\(\gamma_\ell=100, \gamma_u=100\))
FixMatch 65.48 ± 0.81 72.49 ± 0.61 62.53 ± 0.95 65.95 ± 0.74 60.52 ± 0.93
w/ CReST+ 70.45 ± 0.63 84.96 ± 0.43 69.03 ± 0.71 72.47 ± 0.54 65.95 ± 0.76
w/ DASO 74.48 ± 0.51 89.52 ± 0.29 75.51 ± 0.52 78.53 ± 0.41 72.48 ± 0.62
w/ ACR 81.61 ± 0.33 92.09 ± 0.19 85.03 ± 0.28 73.62 ± 0.46 79.82 ± 0.39
w/ DyTrim 75.45 ± 0.36 90.12 ± 0.22 76.51 ± 0.41 78.94 ± 0.35 72.96 ± 0.42
w/ SimPro 85.66 ± 0.28 93.76 ± 0.10 85.84 ± 0.21 84.83 ± 0.20 82.98 ± 0.30
w/ SimPro + Manifold MixUp 89.14 ± 0.21 94.19 ± 0.09 86.11 ± 0.19 84.92 ± 0.21 83.63 ± 0.26
w/ GBC (本文) 92.30 ± 0.17 94.51 ± 0.07 86.78 ± 0.23 85.49 ± 0.19 84.50 ± 0.27

在大规模 ImageNet-127 及 ImageNet-1K 上的准确率对比如下(见原论文 Table 4):

数据集与分辨率 FixMatch SimPro Meta-Expert DyTrim GBC (本文) 相对 SimPro 提升
ImageNet-127 (\(32\times32, \gamma_t \approx 286\)) 29.7 ± 0.37 59.1 ± 0.23 60.3 ± 0.22 60.8 ± 0.25 61.9 ± 0.36 +2.8%
ImageNet-127 (\(64\times64, \gamma_t \approx 286\)) 42.3 ± 0.41 67.0 ± 0.22 67.4 ± 0.23 67.9 ± 0.23 68.6 ± 0.24 +1.6%
ImageNet-127 (\(64\times64, \gamma_t = 1\)) 46.7 ± 0.44 63.8 ± 0.23 64.8 ± 0.23 65.7 ± 0.28 67.0 ± 0.37 +3.2%
ImageNet-1K (\(64\times64, \gamma_t = 1\)) 25.0 ± 0.24 25.4 ± 0.24 26.1 ± 0.25 27.5 ± 0.26 +2.5%

消融实验

原论文 Table 5 在 CIFAR10-LT(\(\gamma_\ell = 100, \gamma_u = 100\))下对各个核心模块进行了细致的剥离验证:

配置 Top-1 准确率 (%) 说明
Full GBC 完整模型 92.3 ± 0.17 完整高斯桥一致性与 BridgeMix
去掉桥损失 (w/o \(\mathcal{L}_{\text{bridge}}\)) 86.1 ± 0.24 移除路径一致性损失,性能暴跌 6.2%
去掉高斯噪声 (w/o noise, \(\sigma(t) = 0\)) 90.2 ± 0.21 降为确定性线性插值,泛化显著下降
硬特征替换 (Hard bridge, \(\tilde{f} = f_t\)) 88.4 ± 0.19 缺少残差门控导致特征突变
去除类别重加权 (w/o reweighting, 均匀 \(w_c\)) 85.3 ± 0.22 尾类失去损失偏置,长尾性能恶化

此外,在注入层级选择(Table 1)上,ResNet-50 的 Stage 4(倒数第二层)取得最高的 92.30%,而在 Stage 2 注入仅取得 87.8%,表明深层语义特征是构建高斯桥的最佳场所;而在训练开销方面(Table 8),GBC 仅增加 1.7% 的单 Epoch 耗时(42.8s vs 42.1s)和 3% 显存,参数量仅从 25.6M 微增至 26.1M。

关键发现

  • 桥一致性是绝对核心贡献:移除 \(\mathcal{L}_{\text{bridge}}\) 会导致整体准确率发生最显著的跳水(92.3% \(\to\) 86.1%),说明单纯依靠原型记忆而缺乏沿路径的连续概率对齐无法阻止特征漂移。
  • 高斯随机扰动具有实质正则化价值:将高斯桥退化为无噪线性插值会损失 2.1% 的准确度,证明随机扩散项促使模型探索了锚点与样本邻域的局部流形,提升了判别边界的利普希茨鲁棒性。
  • 跨分布适应性与极端漂移自愈:在极其严苛的 reversed 分布(头尾未标记分布反转)下,GBC 在训练初期 KL 散度极高,但随后展现出最陡峭的单调衰减速度,并在 300 轮后超越其他基线收敛至最优解,证明其强力抑制了确认偏差滚雪球效应。

亮点与洞察

  • 薛定谔桥理论驱动的特征级连续插值:将随机最优控制与分布间最优转移思想巧妙引入深度特征学习,跳出了传统长尾半监督在分类头 logits 或硬阈值上打补丁的局限。
  • 置信度非对称的 BridgeMix 机制:常规 MixUp 在半监督长尾中容易将错误伪标签污染扩散,而 BridgeMix 以相对置信度构建权重比率,让可靠样本单向牵引不确定样本,构思简洁且无需额外复杂分支。
  • 理论推导完备自洽:论文不仅在经验上超越 SOTA,还从决策边界局部利普希茨连续性、边界期望曲率约束以及基于拉德马赫复杂度的泛化界三方面给出了闭环的数学支撑。

局限与展望

  • 类别自适应阈值对类别数的敏感性:在类别数较少(如 CIFAR10)时,严格的置信度阈值能持续提升性能;但在细粒度或大类别数数据集(如 CIFAR100)上,过高的阈值会导致尾类锚点召回率急剧下跌,必须精细调整 \(\tau_c\) 以平衡精度与覆盖度。
  • 依赖预设骨干特征空间质量:高斯桥构建严重依赖骨干网络深层特征的初级可分性,若在完全冷启动极少样本且无预训练的场景下,初始原型图谱若被严重噪声污染,可能削弱桥接的几何牵引力。
  • 未来方向:可进一步将高斯特征桥推广至连续时间神经常微分方程(Neural ODE)或连续一致性场,并在多模态长尾对齐任务中进行验证。

相关工作与启发

  • vs SimPro: SimPro 采用概率框架推导无偏伪标签分布,但在特征空间未显式建立连续路径约束;GBC 在其基础上增加了高斯特征桥与流形一致性正则,在 CIFAR10-LT 各种不平衡分布下均取得 1%~6.6% 的大幅度超越。
  • vs Manifold MixUp: Manifold MixUp 在随机样本隐状态间盲目插值,缺乏类别锚点的语义导向;GBC 构建的是“样本-高置信锚点”的有向几何桥,并在两端点混合时融合置信度权重,消除了盲目插值引入的离群噪声。
  • vs DyTrim: DyTrim 聚焦于输出端的动态 Logits 修剪以对抗长尾不平衡;GBC 证明了深入中间隐藏层的几何正则化比纯 Logit 过滤能更根本性地稳定特征表征。

评分

  • 新颖性: ⭐⭐⭐⭐☆ (将薛定谔桥与高斯特征插值引入长尾半监督表征学习,构思新颖)
  • 实验充分度: ⭐⭐⭐⭐⭐ (覆盖 CIFAR10/100、ImageNet 等多基准与多种未标记分布,消融与理论并重)
  • 写作质量: ⭐⭐⭐⭐⭐ (逻辑连贯清晰,理论推导严谨,图表表达准确)
  • 价值: ⭐⭐⭐⭐☆ (为现实中标签稀缺且分布不均的半监督表征对齐提供了极具启发性的几何正则化范式)