From Local Geometry to Global Pseudo-Labeling for Robust Positive–Unlabeled Learning under Covariate Shift¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/fira7s/S-PUNA
领域: 其他
关键词: 协变量偏移检测, 正样本无标记学习, 伪标签, 流形结构, 谱熵
一句话总结¶
针对协变量偏移下分布高度重叠导致经典 PU 学习失效的难题,本文提出几何感知的 S-PUNA 框架,利用 ViT 中间层特征流形双向扩展正负伪标签,并基于谱熵停机准则防止漂移,以弱监督范式匹敌全监督检测性能。
研究背景与动机¶
现代深度神经网络通常在源分布上训练并在相似测试分布上部署。当遭遇输入分布 \(P(X)\) 改变而条件标签映射 \(P(Y \mid X)\) 保持一致的协变量偏移(Covariate Shift)时,传统研究多侧重于提升模型的域泛化、域适应或对抗鲁棒性。然而,在 AI 生成内容鉴别、金融欺诈监测以及医疗影像诊断等安全敏感场景中,明确检测数据分布是否已经漂移并发出告警同样关键。现有协变量偏移检测主要依赖全监督分类器(如 DisCoPatch),这不仅要求预先收集昂贵且带标注的偏移负样本,而且在未知偏移模式不断涌现的现实环境中极其难以落地。
面对这一困境,利用正样本与无标签数据进行分类的正样本无标记(Positive-Unlabeled, PU)学习为弱监督检测提供了全新视角。然而,直接将经典 PU 经验风险最小化(如 nnPU、Dist-PU)应用于协变量偏移检测会遭遇理论与实践的双重瓶颈。传统 PU 风险估计器假设正负类分布具有足够的分离度;但在协变量偏移场景中,数据保留了完全一致的类别语义,仅有细微的统计或风格变化,导致在表征空间内正分布与偏移分布高度重叠,总体变差距离 \(\|P^+ - P^-\|_{TV}\) 接近于 0,Bayes 最优分类误差急剧增大。此时,全局风险估计器极易陷入严重的高方差与不稳定性,产生剧烈的伪标签污染。
本文认为,在分布高度混叠的协变量偏移体制下,不应强行在全局特征空间拟合无偏风险,而应基于流形假设,从局部几何拓扑出发逐步探索负样本的支撑流形。核心 idea:将协变量偏移检测形式化为双向对称的局部流形伪标签扩展任务,提出 S-PUNA 框架,通过谱熵停机准则严格切断高重叠区域的标签污染,并最终蒸馏至深度网络以平滑决策边界。
方法详解¶
整体框架¶
S-PUNA 的核心目标是从仅有的正样本基准集合(Positive Domain, PD)以及包含正样本与偏移样本的未标注混合池中,可靠分离出协变量偏移样本。整个流水线分为四个阶段:首先使用预训练 ViT 提取不易受高层语义过度抽象影响的浅中层特征(第 6 块);接着基于与正样本库的局部近邻距离初始化正负种子集合;随后执行对称的 \(k\)-NN 流形伪标签扩展;在此过程中持续监控负样本流形的协方差谱熵,一旦谱熵下降即刻停止扩展;最后通过知识蒸馏将非参数近邻伪标签迁移至紧凑的 MLP 分类器中。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入数据:标记正样本与无标签混合池"] --> B["ViT 中间层特征提取<br/>选用 Block 6 保留局部几何细节"]
B --> C["双向种子初始化与流形扩展<br/>动态构建正负样本近邻记忆库"]
C --> D["谱熵停机准则判定<br/>监控协方差特征值分布阻断语义漂移"]
D -->|谱熵稳定触发停止| E["深度网络知识蒸馏<br/>参数化分类器拟合平滑判定边界"]
关键设计¶
1. 双向对称近邻伪标签扩展:克服单向传播的决策边界偏移 经典基于近邻的 PU 方法通常只从正样本单向向外扩散正标签,导致负样本只能作为被动遗留的剩余集,在分布重叠区边界极易失真。S-PUNA 设计了对称的双向近邻标注机制。首先,在初始化阶段计算未标注样本 \(x \in \mathcal{X}_U\) 到正样本特征库的最短近邻距离 \(s_{orig}(x)\),取距离最小的 top-\(\alpha\) 个样本作为初始伪正样本集合 \(\hat{\mathcal{X}}_{U,P}^{(t_0)}\),取距离最大的 top-\(\alpha\) 个样本作为初始伪负样本集合 \(\hat{\mathcal{X}}_{U,N}^{(t_0)}\)。在随后的每一轮迭代 \(t\) 中,算法分别维护正样本库 \(\mathcal{X}_P^{(t)}\) 与负样本库 \(\mathcal{X}_N^{(t)}\),并对候选中样本计算其到正样本库的平均近邻距离 \(d_P(x)\) 与到负样本库的平均近邻距离 \(d_N(x)\)。通过设计综合评分差值: $\(s_t(x) = d_N(x) - d_P(x)\)$ 排序后将得分最高的 top-\(\beta\) 个样本划入正集合,得分最低的 top-\(\beta\) 个样本划入负集合。这种双向推挤的流形探索迫使负样本集合沿着远离正样本流形最大差异的方向逐渐铺展,显著拉大了两类经验支撑集在流形表层上的有效间隔。
2. 谱熵停机准则:阻断高重叠区域的负样本流形污染 迭代伪标签方法最致命的缺陷是语义漂移(Semantic Drift),即迭代后期负样本集合会侵入到与正样本重叠的高密度区域,造成严重的标注污染并破坏总体变差距离。为了给迭代提供严谨且敏感的停止信号,S-PUNA 引入了基于协方差矩阵谱分解的谱熵监控准则。在每轮迭代 \(t\) 中,计算当前已发现负样本集 \(\hat{\mathcal{X}}_{U,N}^{(t)}\) 的经验协方差矩阵 \(\Sigma_t\),并求解其归一化特征值谱 \(\{\lambda_1^{(t)}, \dots, \lambda_d^{(t)}\}\)(满足 \(\sum_i \lambda_i^{(t)} = 1\))。谱熵定义为: $\(H(\Lambda_t) = -\sum_{i=1}^d \lambda_i^{(t)} \log \lambda_i^{(t)}\)$ 谱熵反映了负样本在各主成分方向上的方差分布与内在流形维度。当负样本流形沿着同质方向正常探索扩展时,方差沿多轴展开,谱熵稳步上升;而一旦伪负样本开始错误吸收正样本而产生混合污染时,根据本文证明的引理,混合分布会导致主特征方向的谱分布发生各向异性畸变,进而引发谱熵的显著下降。因此,算法设定当 \(H(\Lambda_t) - H(\Lambda_{t-1}) < 0\) 时立刻强行终止流形扩展,从而自适应地在污染发生的第一时刻锁定最优边界。
3. 中间层几何保留与深度网络蒸馏:融合非参数精度与参数化平滑性 虽然基于 \(k\)-NN 的流形搜索具备无偏且贴合局部几何的优点,但非参数化近邻预测在推理阶段具有较高的方差,且计算复杂度随样本量线性增长。S-PUNA 在谱熵收敛截断后,将得到的最终标注数据集 \(\mathcal{D}_{anno} = \mathcal{X}_P^{(t)} \cup \hat{\mathcal{X}}_{U,N}^{(t)}\) 作为监督信号,在其上训练一个轻量级的多层感知机(MLP)参数化分类器 \(g_\omega\)。该阶段以标准交叉熵为损失函数: $\(\mathcal{L}(\omega) = -\frac{1}{|\mathcal{D}_{anno}|} \sum_{(x, \hat{y}) \in \mathcal{D}_{anno}} \mathrm{CE}\big(g_\omega(\phi(x)), \hat{y}\big)\)$ 蒸馏过程使得网络在保留 \(k\)-NN 捕获的精细局部流形拓扑的同时,通过参数平滑诱导了连续泛化的决策边界。此外,特征提取层特意固定在预训练 ViT 的第 6 块(Block 6),既避免了深层特征因过度关注高层分类语义而丢失协变量细节,又过滤了底层特征的像素级高频噪声。
损失函数 / 训练策略¶
在伪标签生成阶段,S-PUNA 是无梯度的非参数流形搜索,核心超参数为近邻数 \(k\)、初始种子数 \(\alpha\) 以及步长 \(\beta\);停机判定严格依据谱熵差值 \(\Delta H_t < 0\)。在蒸馏阶段,分类头 \(g_\omega\) 采用标准 Adam 优化器在 \(\mathcal{D}_{anno}\) 上进行参数优化,输入特征固定为 ViT Block 6 的冻结表征,训练过程轻量且收敛迅速。
实验关键数据¶
主实验¶
论文在 ImageNet-1K、TinyImageNet 和 EuroSAT 三个基准上构建了近偏移(Near Shift,如 ImageNet-V2、GenImage、EuroSAT-D)和远偏移(Far Shift,如 ImageNet-C、ImageNet-R、EuroSAT-C)测试集,并与代表性 PU 学习方法及近邻基线进行了全面对比。
| 基准数据集 | 方法分类与名称 | Near Shift AUROC (%) ↑ | Near Shift FPR95 (%) ↓ | Far Shift AUROC (%) ↑ | Far Shift FPR95 (%) ↓ | 平均 AUROC (%) ↑ | 平均 FPR95 (%) ↓ |
|---|---|---|---|---|---|---|---|
| ImageNet-1K | k-NN [40] | 54.40 ± 0.00 | 62.63 ± 0.00 | 74.79 ± 0.00 | 80.84 ± 0.00 | 64.59 ± 0.00 | 71.73 ± 0.00 |
| Dist-PU [41] | 84.48 ± 0.40 | 35.05 ± 0.93 | 96.70 ± 0.11 | 18.06 ± 0.58 | 90.59 ± 0.25 | 26.56 ± 0.75 | |
| saPU [9] | 82.93 ± 0.27 | 69.58 ± 1.01 | 95.09 ± 0.46 | 26.78 ± 2.33 | 89.01 ± 0.37 | 48.18 ± 1.67 | |
| DC-PU [24] | 60.61 ± 2.44 | 85.80 ± 1.03 | 70.51 ± 3.96 | 89.38 ± 10.83 | 65.56 ± 3.20 | 87.59 ± 5.93 | |
| LaGAM [26] | 83.01 ± 0.54 | 65.30 ± 1.96 | 96.50 ± 0.13 | 17.46 ± 0.71 | 89.75 ± 0.33 | 41.38 ± 1.33 | |
| S-PUNA w/o C (本文) | 95.81 ± 0.00 | 19.22 ± 0.00 | 95.95 ± 0.00 | 19.92 ± 0.00 | 95.88 ± 0.00 | 19.57 ± 0.00 | |
| S-PUNA w/ C (本文完整版) | 97.89 ± 0.13 | 9.69 ± 0.48 | 98.51 ± 0.08 | 7.36 ± 0.49 | 98.20 ± 0.10 | 8.52 ± 0.48 | |
| EuroSAT | Dist-PU [41] | 99.78 ± 0.13 | 0.72 ± 0.46 | 89.46 ± 0.50 | 49.97 ± 2.81 | 94.62 ± 0.31 | 25.35 ± 1.64 |
| LaGAM [26] | 99.33 ± 0.56 | 3.01 ± 3.39 | 86.24 ± 0.90 | 54.83 ± 3.24 | 92.79 ± 0.73 | 28.92 ± 3.32 | |
| S-PUNA w/ C (本文完整版) | 99.79 ± 0.05 | 0.65 ± 0.36 | 100.00 ± 0.00 | 0.00 ± 0.00 | 99.90 ± 0.03 | 0.33 ± 0.18 |
消融实验¶
论文针对未标注池中偏移样本比例(\(p\))以及特征提取层深度对模型性能的影响进行了系统消融。
| 实验配置 / 方法 | 特征提取层 | \(p = 5\%\) AUROC (%) | \(p = 25\%\) AUROC (%) | \(p = 50\%\) AUROC (%) | \(p = 75\%\) AUROC (%) |
|---|---|---|---|---|---|
| DC-PU | Block 6 | 73.08 | 68.00 | 65.56 | 72.19 |
| Dist-PU | Block 6 | 71.04 | 86.40 | 90.59 | 92.17 |
| LaGAM | Block 6 | 85.08 | 87.45 | 89.75 | 90.92 |
| saPU | Block 6 | 60.24 | 75.53 | 89.01 | 92.03 |
| S-PUNA w/ C (本文) | Block 11 | - | - | 97.03 | - |
| S-PUNA w/ C (本文) | Block 6 | 91.61 | 95.75 | 98.20 | 95.53 |
关键发现¶
- 近偏移场景的颠覆性优势:在最难区分的 ImageNet 近偏移(Near Shift)设置中,现有 PU 最强基准(Dist-PU)AUROC 仅为 84.48%,FPR95 高达 35.05%;而 S-PUNA w/ C 跃升至 97.89% AUROC,FPR95 暴降至 9.69%,大幅缩小了弱监督与全监督模型(如 DisCoPatch 平均 89.8% AUROC)的差距甚至反超。
- 蒸馏分类头的平滑效应:对比 S-PUNA w/o C(纯近邻非参数预测)与 S-PUNA w/ C,加入 MLP 蒸馏后 ImageNet 近偏移的 FPR95 从 19.22% 骤降至 9.69%,表明参数化网络有效消除了局部近邻搜索的毛刺噪声。
- 极端类别不平衡下的强鲁棒性:当未标注数据中偏移样本比例降至仅 \(5\%\) 时,基线方法如 saPU 崩溃至 60.24%,而 S-PUNA 依然维持在 91.61% 的高位,展现了极其可靠的先验普适性。
亮点与洞察¶
- 首次将正样本无标记学习引入协变量偏移检测,从理论上揭示了 \(\|P^+ - P^-\|_{TV} \to 0\) 时经典全局风险估计器失效的本质根源。
- 提出了基于谱熵降幅的自适应停机准则,巧妙利用污染混合流形在特征值谱上的异质坍缩特性,解决了伪标签自训练中最棘手的早停难题。
- 发现 ViT 中间层(第 6 块)特征对于细粒度几何与纹理扰动最敏感,既不同于浅层的像素冗余,也规避了深层的类语义过拟合,为域感知任务提供了实用的特征层选取经验。
局限与展望¶
- 算法严重依赖高质量的中间层预训练骨干网络,若骨干模型对特定物理域扰动缺乏表示敏感度,近邻流形度量可能失真。
- 迭代近邻搜索过程涉及多次 \(k\)-NN 距离计算,随着未标注样本池规模扩大到百万级,显存占用与索引检索开销将成为主要的计算瓶颈。
- 目前主要在静态图像域进行评估,未来可拓展至连续流式数据中的在线概念漂移与自适应持续学习检测。
相关工作与启发¶
- vs Dist-PU / nnPU: 传统 PU 方法致力于通过类先验或无偏风险估计从全局拉平期望损失,但在协变量偏移高重叠区域极易发生方差发散;S-PUNA 则放弃全局拟合,从局部流形出发双向生长伪标签,稳定性显著更优。
- vs DisCoPatch / DRCT: 全监督方法必须预先在特定损坏集上联合训练判别器,遇到未见过的偏移类型时泛化性不足;S-PUNA 仅需正样本即可自适应发现任意未知的潜在偏移,部署成本大幅降低。
- vs 经典 OOD 检测 (ReAct / ASH / ViM): 传统基于 Logit 或后验概率的 OOD 方法专门设计用于捕获语义偏离,在类别保持不变的协变量偏移上往往完全钝化;S-PUNA 证明了挖掘中间层几何拓扑是攻克协变量偏移的核心钥匙。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ 首次系统确立 PU 学习在协变量偏移检测中的范式,并给出谱熵停机的理论证明。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 3 个基准多达 21 种基线对比,覆盖从远近偏移到极端比例的全面验证。
- 写作质量: ⭐⭐⭐⭐⭐ 数学建模严密,从 Bayes 风险、全变差界到谱几何的理论逻辑链条清晰自洽。
- 价值: ⭐⭐⭐⭐☆ 为工业部署中的无监督/弱监督模型漂移监控提供了一种高性能且无需负样本标注的全新工具。