跳转至

Unified Multi-Layer Subspace Modeling for Cross-Domain OOD Detection

会议: ECCV 2026
论文: ECCV 官方海报
领域: 医学图像 / transfer_learning
关键词: 分布外检测、多层特征融合、主子空间建模、马氏距离、跨领域泛化

一句话总结

提出PRISM后验OOD检测方法,摒弃传统的单层特征提取与基于OOD数据校准的层级加权启发式策略,采用“先融合后建模”原则统一浅层与深层特征,并在分布内数据的主子空间上将投影马氏距离与正交残差能量无参相乘,在自然图像、医学影像与工业质检三大基准上取得93.92%的跨域SOTA平均AUROC。

研究背景与动机

深度神经网络在闭集分类任务中表现优异,但在面对未见过的分布外(Out-of-Distribution, OOD)样本时容易产生严重过置信的错误预测,这在医学内窥镜或病理切片诊断、工业产品瑕疵与异物分选等高安全要求场景下具有重大风险。为了在不重新训练网络、不破坏闭集精度的前提下保障系统安全,后验(post-hoc)OOD检测得到了广泛研究。主流方法通常依赖模型最终输出的分类置信度、未归一化对数概率(logits)或倒数第二层的高维特征嵌入(如基于马氏距离建模或近邻搜索)。然而,真实场景中的分布偏移模式极为多样,从低层次的纹理/传感器伪影到高层次的语义类别突变均有发生,单一深层特征往往高度特化于分布内(ID)分类任务,容易丢失对某些浅层异常敏感的底层信息。

这一局限的核心矛盾在于:不同领域与不同类型的OOD偏移对神经网络特征深度的敏感性截然不同,但现有多层OOD检测方案要么依赖硬性的人工层级选择,要么依靠保留的外部OOD验证集通过逻辑回归来校准层级权重(如MDSEns)。实验表明,在医学内窥镜(PhaKIR)或组织病理(MIDOG)数据上训练出的最佳层级权重倾向于浅层或中层,而在ImageNet上则高度集中于深层;甚至在同一医学领域内部切换近OOD验证子集,所学得的最优层权重也会发生剧烈漂移。这种依赖验证集校准的多层集成方案在跨领域迁移时极易过拟合特定的偏移模式,难以泛化到未知的新型偏移中。

本文的切入角度是:与其计算各层的独立OOD分数再进行脆弱的跨层加权聚合,不如从几何表征入手,将浅层至深层的多层特征直接拼合成统一的高维层次嵌入,并纯粹利用ID训练数据建立全局几何流形。核心 idea:提出PRISM框架,贯彻“先融合后建模”原则,将浅至深层池化特征统一拼接并在ID训练集上学习主成分子空间,将子空间内类条件马氏距离与子空间外正交残差能量以无参数乘积联合作为OOD异常度量。

方法详解

整体框架

PRISM采用完全基于ID数据的后验流程,整体由多层特征统一构建、ID主成分子空间估计、投影空间与正交残差双通道评分计算三个阶段组成。输入图像输入冻结的预训练骨干网络后,模型在多个深度层级均匀抽取特征图并进行全局池化与 \(\ell_2\) 归一化拼接,得到统一的多层层次化表征;随后利用在ID数据上拟合的主成分分析(PCA)将高维表征分解为主导语义变化的低维主子空间与正交残差子空间;最后在主子空间中度量类条件投影马氏距离,在正交空间度量残差能量,两者相乘生成最终的OOD判别分数。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入测试样本 x"] --> B["多层特征融合与规范化<br/>均匀层采样 + 全局池化 + L2归一化拼接"]
    B --> C["ID主子空间正交投影分解<br/>PCA基底 W 分解为投影 u(x) 与残差 r(x)"]
    C --> D["投影马氏距离度量<br/>子空间内类条件中心距离 sproj"]
    C --> E["正交残差能量度量<br/>子空间外未解释流形能量 sres"]
    D --> F["无参乘积联合评分<br/>sPRISM = - sproj * sres"]
    E --> F
    F --> G["决策输出<br/>高于阈值判定为ID,低于阈值判定为OOD"]

关键设计

1. 多层特征融合与规范化:消除空间依赖并均衡多层量纲 为了同时捕捉底层视觉纹理和高层语义模式,PRISM从分类器 \(f\)\(L\) 个均匀间隔的特征阶段抽取特征图 \(\{\phi^{(l)}(x)\}_{l=1}^L\)。对于CNN(通道数 \(C_l\)、分辨率 \(H_l \times W_l\)),使用全局平均池化(GAP);对于Vision Transformer(\(T_l\) 个通道维度为 \(C_l\) 的token),使用token平均操作。这一操作将空间维度消除,使得后续评分计算复杂度与输入图像分辨率解耦。不同层级的特征激活幅值差异较大,若直接拼接会导致深层或大尺度特征主导几何结构。为此,PRISM对每个单层池化向量进行独立的 \(\ell_2\) 范数归一化,再按序拼接为全局特征向量 \(z(x) \in \mathbb{R}^D\)(其中 \(D = \sum_{l=1}^L C_l\)): $\(\tilde{\phi}^{(l)}(x) = \frac{\mathcal{P}(\phi^{(l)}(x))}{\|\mathcal{P}(\phi^{(l)}(x))\|_2}, \quad z(x) = \left[\tilde{\phi}^{(1)}(x)^\top, \dots, \tilde{\phi}^{(L)}(x)^\top\right]^\top\)$ 该设计保证了浅层细节特征与深层抽象特征在统一向量空间中具有同等的几何影响权重,避免了人工赋予启发式层权重的需求。

2. ID主子空间建模与正交投影分解:提取低维流形语义基底 深度网络对ID样本的表示通常分布在一个低维流形附近。由于拼接后的维度 \(D\) 较大,若直接在该空间拟合全协方差矩阵,会受到协方差奇异性与噪声维度的干扰。PRISM纯粹利用ID训练样本 \(\{z(x_i)\}_{i=1}^N\) 计算全局经验均值 \(\mu = \frac{1}{N}\sum_{i=1}^N z(x_i)\) 和协方差矩阵,通过主成分分析(PCA)截取前 \(d\) 个最大特征值对应的正交特征向量构成投影矩阵 \(W \in \mathbb{R}^{D \times d}\)(全文固定默认 \(d=512\))。在推理阶段,任意样本的特征 \(z(x)\) 被显式正交分解为流形内投影坐标 \(u(x)\) 和正交残差向量 \(r(x)\): $\(u(x) = W^\top (z(x) - \mu), \quad r(x) = (I - WW^\top)(z(x) - \mu)\)$ 投影坐标 \(u(x)\) 刻画了样本在训练数据主导语义方向上的对齐程度,而残差向量 \(r(x)\) 则捕捉了训练集流形无法解释的偏离分量。

3. 投影马氏距离与残差能量协同:免调参的多维度异常度量 分布外样本的异常通常表现在两个互补维度:一部分OOD样本落入ID低维流形内但偏离了类别聚类中心(语义混淆型),另一部分OOD样本则偏离了整个ID流形(特征奇异型)。PRISM在 \(d\) 维投影空间中为每个ID类别估计均值 \(\hat{\mu}_c^u\) 及共享协方差矩阵 \(\hat{\Sigma}_u\),计算最小投影马氏距离异常值: $\(s_{\text{proj}}(x) = \min_{c \in \mathcal{Y}} \left(u(x) - \hat{\mu}_c^u\right)^\top \hat{\Sigma}_u^{-1} \left(u(x) - \hat{\mu}_c^u\right)\)$ 同时,利用正交投影性质 \(W^\top W = I\),无需显式重建特征即可高效计算残差能量: $\(s_{\text{res}}(x) = \|r(x)\|_2^2 = \|z(x) - \mu\|_2^2 - \|u(x)\|_2^2\)$ 两项均为非负异常程度指标。PRISM采用二者相乘的形式构成联合OOD判别分数: $\(s_{\text{PRISM}}(x) = - s_{\text{proj}}(x) \cdot s_{\text{res}}(x)\)$ 负号使得分数越大的样本越倾向于判定为ID。与传统的线性加权和相比,乘积形式无需任何权重平衡超参数,彻底排除了对任何辅助OOD验证集的依赖。

复杂度与推理开销

PRISM在推理时仅需三次轻量线性运算:向 \(d\) 维主子空间投影矩阵乘法 \(\mathcal{O}(BDd)\)、在降维空间计算到 \(K\) 个类别的马氏距离 \(\mathcal{O}(BdK)\) 以及利用向量范数差计算残差能量 \(\mathcal{O}(BD)\),其中 \(B\) 为batch size。由于 \(d \ll D\) 且完全避免了逐像素操作,在ImageNet-1k(ResNet-50)上测试,当batch size \(\ge 16\) 时,PRISM相比于简单的最大softmax概率(MSP)和优化版MDS++所带来的额外推理延迟低于1.0%。

实验关键数据

主实验

在涵盖自然图像(OpenOOD)、医学影像(OpenMIBOOD)和工业视觉(ICONIC-444)三大领域的跨域评测中,PRISM与22种主流后验OOD检测方法进行了全面对比(骨干网络包含ResNet-18、ResNet-50、R(2+1)D等)。如下表所示(摘自论文 Table 1,指标为平均 AUROC %):

方法 OpenOOD (IN-1k) OpenOOD 均值 MIBOOD (MIDOG) MIBOOD (PhaKIR) MIBOOD 均值 ICONIC-444 均值 全基准总均值
MSP [26] 77.94 81.49 64.23 39.99 57.82 73.06 70.79
MDS [38] 89.83 80.77 78.14 73.66 83.51 95.31 86.53
MDSEns* [38] 54.41 74.82 96.87 98.49 98.41 93.81 89.01
GRAM [58] 85.61 87.46 89.49 36.46 75.12 97.55 86.71
EBO [43] 41.68 70.06 66.54 32.94 55.10 67.26 64.14
ViM [71] 85.54 85.19 79.12 64.46 81.02 94.54 86.92
KNN [63] 85.64 86.00 76.17 51.12 75.52 92.47 84.66
MDS++ [50] 89.88 87.16 80.72 71.69 84.09 96.12 89.13
PRISM (本文) 89.96 90.36 91.99 92.60 94.86 96.56 93.92

*注:MDSEns需利用真实的OOD数据进行逻辑回归加权,在医学域表现虽高,但在ImageNet-1k上灾难性崩溃至54.41%;PRISM在纯ID设置下全域达到93.92%的最优均值。

消融实验

论文在Table 2中深入分析了核心评分组件的贡献以及PCA降维维度 \(d\) 的敏感度(AUROC ↑ / FPR95 ↓):

配置 / 维度 OpenOOD (IN-1k) OpenMIBOOD (医学) ICONIC-444 (工业) 全域综合 (AUROC / FPR95) 说明
\(s_{\text{proj}}\) 89.94 / 38.62 91.42 / 32.32 95.21 / 16.05 92.19 / 29.00 投影马氏项在自然与工业域主导
\(s_{\text{res}}\) 76.39 / 58.20 95.72 / 17.21 93.82 / 20.30 88.64 / 31.90 残差能量在医学域优势明显
完整PRISM (\(d=512\)) 89.88 / 35.83 94.86 / 21.10 95.67 / 14.02 93.47 / 23.65 乘积互补,跨域鲁棒性最佳
PCA \(d=128\) 88.94 / 39.81 94.83 / 22.91 95.56 / 14.54 93.11 / 25.75 维度敏感度极低
PCA \(d=256\) 89.67 / 36.93 95.24 / 21.19 95.59 / 14.46 93.50 / 24.19 性能高度稳定
PCA \(d=768\) 89.97 / 36.09 93.47 / 25.32 95.67 / 13.91 93.04 / 25.11 高维下轻微扰动

此外,在网络架构通用性测试中(Table 3),PRISM在ImageNet-1k使用ResNet-50 (89.96%)、Swin-T (90.91%) 和 ViT-B/16 (88.76%) 均取得领先成绩,平均AUROC达到89.88%;在ICONIC-444工业任务中横跨ResNet-18 (96.56%)、CCT-7/7x2 (94.65%) 与 ConvNeXt-S (95.79%),平均AUROC达到95.67%,展现了对CNN与Transformer架构的完全兼容。

关键发现

  • 两项度量的跨域互补性显著:投影马氏距离在自然图像与工业缺陷等类间结构明显的任务上表现更强,而正交残差能量则在组织病理等具有底层传感器伪影和组织结构差异的医学域极具辨识力。二者无参相乘后能自动兼顾流形内外异常。
  • OOD校准具有虚假繁荣与严重脆弱性:依靠OOD验证集调参的多层集成(如MDSEns)在特定医学切片任务中可达98.41%,但该超参在遇到新偏移(如ImageNet或工业异物)时急剧退化(FPR95暴增、AUROC崩至54.41%),彻底失去了部署可行性。
  • 子空间维度鲁棒性强:PCA子空间维度 \(d\) 在128到768的宽范围内平均AUROC波动不足0.5%,证明PRISM无需针对特定数据集繁琐寻优超参数。

亮点与洞察

  • “先融合后建模”打破了层级评分割裂的思维定式:以往多层方法在各层独立算分后再融合,丢失了浅层与深层特征之间的跨层相关性;PRISM将多层特征规范化拼接成统一流形,仅需一次统计建模即可囊括全局多尺度信息。
  • 流形内马氏距离与正交残差的无参数乘积联动:巧妙规避了传统加法融合中必须人为调节平衡系数(如 \(\alpha \cdot s_1 + \beta \cdot s_2\))的痛点,乘法使得只要样本在流形内发生类别偏离或流形外产生残差能量,整体异常分数都会被显著放大。
  • 普适部署的高性价比:通过全局池化解除空间尺寸绑定,并在低维PCA主空间完成主要代数运算,使整个多层检测对推理速度的影响降至1%以内,极利于工业级嵌入式落地。

局限与展望

  • 未能解决精细语义交叠与上下文歧义:在补充材料的假正例错误分析中,作者指出当OOD目标在局部视觉上与ImageNet某种类别极似、或仅作为背景次要物体出现时,PRISM仍会出现漏报;医学显微图像中由于染色和采集协议导致的域内细微变异也容易诱发偶发误报。
  • 特征阶段抽取仍依赖经验固定:当前对网络各stage输出的提取为均匀手工设定,未来可探索自适应注意力或可微分信息论准则来自动筛选对分布偏移最具有判别力的特征层。
  • 非线性流形建模的探索空间:目前采用线性PCA进行子空间逼近,面对高曲率的复杂非线性特征流形时可能存在残差估计偏置,结合轻量局部流形学习是潜在的演进方向。

相关工作与启发

  • vs MDS [38] / MDS++ [50]: MDS仅基于倒数第二层特征进行单层马氏建模,在浅层敏感的医学与工业场景下易漏检;MDS++虽然改进了协方差与归一化,但依然局限于单一深层;PRISM统合浅深多层并引入互补的正交残差信号,大幅改善跨域稳定性。
  • vs ViM [71]: ViM同样在深层特征上利用主子空间残差,但其结合的是输出层的最大Logit能量,且无法利用浅层纹理;PRISM在统一多层特征上同时构建子空间内马氏距离与流形外残差,两者均基于同一流形分解,几何自洽性更强。
  • vs MDSEns [38] / GRAM [58]: MDSEns依靠辅助OOD数据学习跨层逻辑回归权重,极易过拟合;GRAM依赖高阶Gram矩阵且在医学域大幅崩塌(36.46%);PRISM完全基于ID数据闭环拟合,不设可调跨层权重,实现了真正的Zero-OOD-Tuning。

评分

  • 新颖性: ⭐⭐⭐⭐ [打破多层独立打分的惯性,提出统一特征空间的主子空间正交分解与无参乘积评分,构思精巧清爽]
  • 实验充分度: ⭐⭐⭐⭐⭐ [覆盖自然OpenOOD、医学OpenMIBOOD和工业ICONIC-444三大权威基准,横跨22种对比SOTA与多种网络架构]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑层层递进,问题动机剖析透彻,图表自洽且严谨说明了OOD调优的缺陷]
  • 价值: ⭐⭐⭐⭐⭐ [为真实世界中极度缺乏先验OOD标签的高安全场景(医疗、工业)提供了一套开箱即用的高鲁棒分布外检测利器]