Distribution-Aware Feature Selection for Post-hoc Out-of-Distribution Detection¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/remic-othr/mfs-ood
领域: 医学图像
关键词: 分布外检测、特征选择、Wasserstein距离、跨域Mixup、事后检测
一句话总结¶
针对事后特征级分布外(OOD)检测常将高维特征等同对待的问题,本文提出基于边际 Wasserstein-1 距离的分布感知特征选择策略(MFS),配合跨域 Mixup 代理数据自适应筛选最具判别力的子空间,在零重训练的前提下显著提升检测性能并大幅降低推理耗时。
研究背景与动机¶
深度学习系统在自动驾驶、临床医疗等高风险场景中的应用日益广泛,然而传统模型默认测试数据与训练数据同分布,一旦面临未知的分布外(OOD)样本输入,常给出过度自信的错误预测,埋下严重的安全性隐患。为了赋予预训练模型识别未知输入的能力,事后(post-hoc)特征级检测方法因无需昂贵的重训练过程而备受青睐。代表性方案如马氏距离(MDS)和深度最近邻(kNN)通常直接依赖网络倒数第二层提取的全局特征向量;然而,这些高维特征表示中包含大量与下游分类强相关、但对区分 ID 与 OOD 毫无增益甚至充当噪声的维度,导致高维欧氏距离或协方差估计严重失真。
现有的特征修正策略要么采用主成分分析(PCA)等无监督子空间投影,忽略了 ID 与 OOD 之间的真实分布差异;要么依赖启发式的激活剪裁(如 ReAct)或基于 ID 类内方差的经验通道截断,未从分布差异的统计本质上衡量维度的可分离度。更深层的矛盾在于:在实际部署前,未知的目标 OOD 样本根本不可获取,使得直接计算最优判别子集面临严重的“无真实 OOD 监督”困境。
本文的切入角度是:深度神经网络在批归一化(BN)的正交化趋势与 ReLU 激活的稀疏性共同作用下,区分 ID 与 OOD 的判别信号在深层特征空间中天然呈现显著的轴对齐(axis-aligned)特性,且该特性在不同分布偏移间具有较好的迁移性。核心 idea:利用跨域 Mixup 构建轻量级代理 OOD 分布,通过一维 Wasserstein-1 距离无参数地高效量化每个特征维度的 ID/OOD 边际分离度,筛选出最具判别力的前 \(k\) 维特征子空间,以极低开销无缝增强现有事后特征检测器。
方法详解¶
整体框架¶
本文提出的边际特征选择(Marginal Feature Selection, MFS)是一种即插即用的事后预处理框架。整个流水线无需修改骨干网络权重,亦无需重新定义检测器的打分函数。对于给定的预训练分类模型,系统首先利用少量无语义重叠的跨域外部样本与 ID 样本生成混合代理数据;随后将 ID 与代理数据输入网络提取深层特征,分别构建每个特征维度上的一维经验分布;通过解析求解各维度的 Wasserstein-1 距离完成全局特征重要性排序,并依据验证集自适应确定保留比例 \(\alpha\);最终推理阶段仅在选定子空间上运行诸如 kNN 或 MDS 等基线检测器。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["ID 样本 + 跨域数据池"] --> B["跨域 Mixup 代理 OOD 分布构建<br/>按随机比率凸组合插值生成代理样本"]
B --> C["预训练骨干网络提取深层特征<br/>空间平均池化得到特征嵌入集合"]
C --> D["单维度 Wasserstein-1 距离特征选择<br/>经验累积分布差分积分计算单维可分离度"]
D --> E["保留比例自适应选择与保底回退<br/>代理验证集网格寻优,次优时保底全维"]
E --> F["下游事后检测器推理<br/>kNN / MDS / MDS++ 在精简子空间打分"]
关键设计¶
1. 跨域 Mixup 代理 OOD 分布构建:无真实 OOD 监督下的偏移模拟
在事后检测阶段,真实部署环境面临的 OOD 偏移模式先验未知且无法提前采集。若仅在 ID 样本内部进行传统数据混合,插值生成的表征依然紧紧贴附在 ID 特征流形内部,难以诱导出具有充分判别分离度的深层激活差异;而采用梯度对抗扰动(FGSM)生成的样本若遇到具备对抗鲁棒性的网络,其特征位移容易被严重抑制。为解决此问题,本文引入完全解耦的跨域图像池(例如医学图像分类模型引入自然图像,自然图像模型引入显微病理图像,彻底避免标签空间语义重叠),在批次内执行跨域凸组合插值:
其中 \(x_i\) 为 ID 输入,\(m_j\) 为跨域外部样本,混合比率 \(r_i\) 从离散集合 \(\{0.25, 0.5, 0.75\}\) 中均匀随机抽取。这种设计不仅无须额外的人工标注成本,而且通过离散混合比例诱导出一系列由近及远的渐进式分布偏移动态,能够有效将特征表征拉离 ID 主流形,为后续评估维度区分能力提供普适且稳定的基准分布。
2. 单维度 Wasserstein-1 距离特征选择:兼顾表达力与计算效率的分离度量化
评估高维特征空间中的 ID 与 OOD 联合可分离度在组合爆炸下无法穷举搜索,而直接进行全空间协方差矩阵操作计算开销高昂。作者通过正交旋转实验发现,DNN 的判别信号大多沿着特定坐标轴集中分布。基于这一洞察,MFS 将高维联合估计解耦为 \(D\) 个独立的单维度统计检验。为消除尺度差异,首先利用 ID 特征的最大最小值对各维度执行 Min-Max 归一化。随后,设某维度 \(d\) 上 ID 与代理 OOD 的经验样本分别为 \(\{a_1^{(d)}, \dots, a_N^{(d)}\}\) 与 \(\{b_1^{(d)}, \dots, b_M^{(d)}\}\),其经验累积分布函数(ECDF)分别为 \(F_\rho^{(d)}\) 和 \(F_\nu^{(d)}\)。一维 Wasserstein-1 距离可直接通过分布函数差的绝对值积分闭式计算:
在算法实现中,该积分转化为分别对 \(N\) 个 ID 特征标量与 \(M\) 个代理 OOD 特征标量进行排序后的闭式求和,整体时间复杂度仅为 \(\mathcal{O}(D(N \log N + M \log M))\)。相比于核化最大平均差异(MMD)的二次复杂度或 KL 散度在支集不重合时的数值溢出,Wasserstein-1 距离不仅完全无参数,还能无偏捕捉位置偏移、尺度离散及多峰形态差异。计算完成后,取各维度得分降序排列的前 \(k = \lfloor \alpha D \rfloor\) 个维度构成最优判别子空间 \(\mathcal{I}_k\)。
3. 保留比例自适应选择与保底回退:兼顾极端压缩收益与几何复杂性
不同网络架构与数据领域的潜在流形各异,某些任务的有效判别信息极度集中,而另一些则弥散在多个维度上,固定保留维度数量极易导致欠拟合或冗余引入。MFS 将保留比例 \(\alpha \in \{0.1, 0.2, \dots, 1.0\}\) 设为超参数,在代理验证集上执行轻量网格搜索,选取验证 AUROC 达到峰值的 \(\alpha^*\)。更为关键的是,该机制内置保底容错逻辑:当特征空间存在严重各向异性或方差主导效应导致任意降维子集均未超过全特征空间时,算法自适应选定 \(\alpha^* = 1.0\),严格等价退回原始基线检测器。这一设计确保了该方法在最坏场景下零负面影响,同时在绝大多数场景中通过丢弃 30% 到 99% 的无关特征,大幅消除距离度量中的维度诅咒与累积噪声。
一个完整示例¶
以 MIDOG 组织病理有丝分裂检测任务中的 kNN 检测器为例: 1. 提取表征:预训练 ResNet 倒数第二层输出维度为 \(D = 2048\)。 2. 代理生成与排序:将病理图像与 CIFAR-10 自然图像以比例 \(r \in \{0.25, 0.5, 0.75\}\) 混合,获得 1000 个代理 OOD 样本。对 2048 个维度分别计算归一化后 ID 与代理样本的一维 Wasserstein-1 距离并降序排序。 3. 验证寻优:在验证集上评估 \(\alpha \in [0.1, 1.0]\),发现在极度压缩的 \(\alpha = 0.01\)(仅保留 20 个维度)时验证性能即已达峰。 4. 测试打分:测试阶段输入测试样本特征,仅切片取出这 20 个维度的标量,在微型子空间内与 ID 样本计算 kNN 距离。不仅 AUROC 从 70.64 提升至 76.66,且特征维度减少 99%,使 kNN 距离搜索延迟降低约 97%。
实验关键数据¶
主实验¶
在涵盖 3 个医学图像基准(MIDOG、PhaKIR、OASIS-3,共 14 个数据集)和 2 个自然图像基准(CIFAR-10、ImageNet-1k,共 16 个数据集)上,全面评估了 cs-ID、near-OOD 和 far-OOD 三类场景的综合检测表现(AUROC / FPR@95)。各方法对比汇总如下:
| 方法 | 类别 | MIDOG (AUROC/FPR) | PhaKIR (AUROC/FPR) | OASIS-3 (AUROC/FPR) | CIFAR-10 (AUROC/FPR) | ImageNet1k (AUROC/FPR) | 平均 (AUROC↑ / FPR95↓) |
|---|---|---|---|---|---|---|---|
| kNN [83] | 距离基线 | 70.64 / 67.88 | 42.41 / 94.93 | 98.96 / 5.28 | 88.02 / 44.15 | 79.10 / 58.80 | 75.83 / 54.21 |
| kNN-MFS (本文) | 边际选择 | 76.66 / 60.68 | 42.41 / 94.93 | 99.55 / 2.82 | 88.41 / 42.93 | 81.37 / 55.64 | 77.68 / 51.40 |
| MDS [49] | 密度基线 | 70.91 / 69.73 | 61.33 / 79.65 | 97.49 / 7.86 | 84.54 / 52.35 | 64.60 / 76.11 | 75.77 / 57.14 |
| MDS-MFS (本文) | 边际选择 | 76.16 / 58.77 | 62.74 / 78.91 | 98.52 / 6.10 | 84.79 / 51.93 | 68.78 / 70.61 | 78.20 / 53.27 |
| MDS++ [64] | 归一化SOTA | 72.16 / 65.74 | 57.64 / 89.76 | 99.85 / 0.71 | 86.44 / 52.20 | 80.18 / 55.16 | 79.25 / 52.71 |
| MDS++-MFS (本文) | 边际选择 | 76.78 / 62.35 | 57.23 / 91.29 | 99.84 / 0.76 | 86.82 / 50.56 | 81.38 / 53.46 | 80.41 / 51.68 |
| Partial MDS [42] | 子空间降维 | 71.88 / 67.58 | 62.18 / 79.49 | 97.43 / 7.92 | 82.66 / 56.56 | 64.01 / 76.74 | 75.63 / 57.66 |
| Residual [88] | 子空间投影 | 72.79 / 66.23 | 63.81 / 79.08 | 97.95 / 6.78 | 82.74 / 56.70 | 58.80 / 84.93 | 75.22 / 58.74 |
| ViM [88] | 混合子空间 | 72.16 / 66.24 | 50.27 / 94.77 | 94.47 / 14.52 | 86.69 / 50.39 | 80.37 / 54.73 | 76.79 / 56.13 |
| ASH [19] | 激活修剪 | 67.78 / 80.59 | 66.88 / 71.73 | 79.57 / 40.70 | 79.50 / 81.73 | 83.82 / 50.76 | 75.51 / 65.10 |
| DICE [82] | 权重稀疏化 | 62.59 / 87.83 | 43.66 / 91.53 | 23.95 / 94.32 | 81.44 / 72.99 | 79.86 / 62.26 | 58.30 / 81.79 |
| DDCS [96] | 通道判别选择 | 69.97 / 76.45 | 49.27 / 81.63 | 63.81 / 62.92 | 81.03 / 73.30 | 80.91 / 57.64 | 69.00 / 70.39 |
| ActSub [101] | 残差子空间 | 69.94 / 70.83 | 52.15 / 81.98 | 91.19 / 26.98 | 80.70 / 64.27 | 86.12 / 44.76 | 76.02 / 57.76 |
消融实验¶
消融实验聚焦于特征散度度量方式与代理数据生成机制对检测性能的影响,测试结果在医学基准与自然图像基准上分别平均:
| 评估维度 | 具体配置 | kNN-MFS (Med / Nat) | MDS-MFS (Med / Nat) | MDS++-MFS (Med / Nat) | 核心特性说明 |
|---|---|---|---|---|---|
| 分布散度度量 | JS 散度 | 71.96 / 84.35 | 78.06 / 75.90 | 77.73 / 83.77 | 平滑对称,但在尾部差异敏感度略逊 |
| MMD (线性核) | 72.86 / 84.72 | 79.10 / 76.80 | 77.16 / 84.02 | 等价于均值嵌入差,计算极快但忽略高阶矩 | |
| MMD (RBF核) | 72.90 / 84.73 | 79.11 / 76.72 | 77.42 / 83.96 | 捕捉高阶分布特征,需中位数启发式带宽参数 | |
| Wasserstein-1 (本文) | 72.87 / 84.89 | 79.14 / 76.79 | 77.95 / 84.10 | 无参数、抗支集不相交,排序后 \(\mathcal{O}(N\log N)\) 闭式解 | |
| 代理生成机制 | FGSM 对抗扰动 (AD) | 72.79 / 84.84 | 76.42 / 77.19 | 76.85 / 84.01 | 依赖梯度反传,抗扰动模型易出现位移抑制 |
| 跨域 Mixup (MU, 本文) | 72.87 / 84.89 | 79.14 / 76.79 | 77.95 / 84.10 | 跨模态离散比率混合,诱导平滑连续且稳定的偏移动态 |
关键发现¶
- 显著且普适的性能提升与延迟下降:搭载 MFS 后,kNN、MDS 和 MDS++ 在全基准上的平均 AUROC 分别提高 1.85、2.43 和 1.16 个百分点,FPR@95 分别压低 2.81、3.87 和 1.03 个百分点。与此同时,MFS 将推理阶段的特征距离计算耗时平均削减了 58.89%(kNN)、27.03%(MDS)和 42.76%(MDS++)。在 MIDOG 上,仅保留 1% 的维度使 kNN 耗时降低 97% 的同时,AUROC 提升 5.74 个百分点。
- PhaKIR 失效案例剖析与白化矫正:在腹腔镜手术视频基准 PhaKIR 上,kNN-MFS 触发保底机制(\(\alpha=1.0\)),未能压缩维度。分析表明该任务特征空间呈现极端各向异性(anisotropic),ID 与 OOD 的判别信号广泛弥散在多个低方差维度中,而少数主导高方差维度占据了欧氏距离主干,使得直接切片会丢失微弱信号。实验证明引入特征白化(Whitening)平衡各维度方差后,kNN-MFS 得以迅速锁定判别子集,一举带来约 14 个百分点的 AUROC 爆发式提升。
- 跨架构与跨生成模型的表征迁移:不仅在常规 CNN(ResNet、MobileNetV2、ShuffleNetV2、VGG)上表现稳健,在 Swin Transformer 架构上 MFS 亦带来 AUROC 全面提升(kNN +0.21、MDS +0.25、MDS++ +1.71);甚至在仅有 4 个通道维度的 Stable Diffusion 2.1 隐空间 VAE 表征中,MFS 依然能在 MIDOG 和 CIFAR-10 上微调提升 MDS 检测表现。
亮点与洞察¶
- 深度特征的轴对齐可分离性:揭示了深层特征中 OOD 判别信息大多沿单维度坐标轴天然集中的几何现象,利用简单的单维累积分布积分即可精准定位有效维度,打破了“降维必做高阶联合投影”的思维惯性。
- 零真实负样本的跨域代理范式:通过跨域自然与医学数据的简单 Mixup,在零目标域先验下构造出通用偏移代理,且所选出的关键维度能够有效跨 OOD 数据集迁移。
- 精度与吞吐的双向解耦红利:传统特征增强方法往往以增加前向计算或多分支投影为代价,而 MFS 作为离线预处理掩码,在推理阶段纯靠特征切片降低维度,实现了“精度提升反伴随延迟腰斩”的双重收益。
局限与展望¶
- 作者指出的局限:在表征空间存在强各向异性或方差严重不平衡时(如 PhaKIR),高方差维度会遮蔽具备鉴别力的低方差维度,此时简单的边际单维筛选会退化为全维保留。
- 挖掘发现的局限:跨域 Mixup 依赖一个与 ID 无语义交叉的外部数据集,尽管构建门槛极低,但对于大规模多标签、细粒度或开放世界分类器,如何严格规避潜在语义污染仍缺乏自动化筛查机制。
- 未来改进思路:可探索在特征选择前引入轻量自适应白化或核化度量平衡方差,或将单维边际选择拓展为基于稀疏依赖图的小团簇联合选择。
相关工作与启发¶
- vs DICE / ASH / DDCS (边际选择/激活修剪):DICE 依赖权重大小进行静态剪枝,DDCS 仅依据 ID 类内方差与相似度衡量通道判别力,无法感知真正的分布偏移;ASH 则是对高激活值的粗暴掩码。MFS 首次引入真实的跨分布统计测度(Wasserstein 距离),直接衡量 ID 与 OOD 在维度上的累积分布差异,鲁棒性与泛化度远超同类边际方法。
- vs PCA-MDS / ViM / ActSub (子空间投影):ViM 与 ActSub 需要在完整特征协方差矩阵上求解主特征向量并投影到残差空间,推理时引入矩阵乘法开销且容易受协方差估计误差影响。MFS 保持原始轴坐标系,推理时直接索引切片,零额外投影计算,速度优势极为显著。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ 首次将 Wasserstein-1 距离引入事后特征选择,并系统验证了轴对齐判别结构与跨域 Mixup 代理的有效性。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 5 大基准、30 个子数据集,跨越医学影像与自然图像,实验覆盖 cs-ID/near-OOD/far-OOD 及跨架构分析。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑推导环环相扣,从经验证据到理论度量、失效案例分析深入透彻。
- 价值: ⭐⭐⭐⭐⭐ 即插即用、无重训练、精度与推理速度双重提升,对高可靠边缘端系统部署具有重大工程实用价值。