A Comprehensive Analysis about Unsupervised Outlier Detection for Images¶
会议: ECCV 2026
Paper: https://eccv.ecva.net/virtual/2026/poster/5320
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/9947.pdf
代码: https://github.com/zhliu-uod/VUOD
领域: 异常检测 / 图像异常检测
关键词: 无监督离群检测、局部可分性、全局可分性、伪标签、对比学习
一句话总结¶
VUOD 先用细粒度聚类与距离排序一致性筛选可靠正常/异常伪标签,再训练轻量特征映射并接入 OCSVM,使同一无监督图像离群检测框架能覆盖自然、工业和医学图像,CIFAR-10 的汇总 AUROC 从 FlexUOD 的 0.942 提升至 0.972。
研究背景与动机¶
图像离群检测不是普通的多类别识别:给定一批没有正常/异常标注的图片,需要为每张图输出异常程度,并让真正的异常尽量排在前面。 许多方法先用自然图像上预训练的 ResNet 或 CLIP 提取特征,再依据距离、密度或学习得到的阈值识别离群点。 这种做法在“汽车类别混入卡车”一类语义异常上有用,但工业划痕、局部结构缺陷或医学病灶未必在同一特征空间中足够突出。 如果正常与异常的原始分数已经混在一起,再精细的阈值学习也难以弥补表示本身的不足。
本文希望改进的是特征的可分性,而不是为每个应用另造一个检测器。 难点在于,没有标签就无法直接监督表示学习,而从一个不可靠的异常检测器生成伪标签,又容易把原来的错误固化进新表示。 作者因此把“哪些图片可以作为监督”改写成一个分布结构问题:局部聚类能否先找出较纯的小群体,全局距离排序能否判断这些群体更像正常数据还是异常数据? 这里的无监督也有明确边界:目标集合可以含有异常,模型在该集合上适配并对该集合评分,并不要求预先准备一份干净正常训练集。
这种设定特别适合批量数据筛查,但不等同于训练一次后直接处理未知测试流的常见工业检测协议。 论文把医学影像作为跨域评测之一,核心任务仍是通用的整图离群排序,而非专门的病灶诊断或定位。 核心 idea:先利用局部聚类和全局排序一致性寻找高置信度伪标签,再让对比学习重塑特征空间,使异常评分建立在更可分的表示上。
方法详解¶
整体框架¶
输入是一批混有正常图像和未知比例异常图像的目标数据,输出是每张图像的离群分数。 预训练骨干先提取整图特征,VUOD 在特征层运行“局部可分性聚类—全局可分性筛选—对比特征增强”,最后将增强特征交给单类支持向量机 OCSVM 评分。 这不是一个需要端到端微调视觉骨干的方案:论文描述的可学习增强器是两层 MLP,训练信号来自当前目标集合的伪标签。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["未标注目标图像<br/>预训练整图特征"] --> B["局部可分性聚类<br/>AP 生成细粒度簇"]
B --> C["全局可分性筛选<br/>修正中心并筛伪标签"]
C --> D["对比特征增强<br/>两层 MLP"]
D --> E["OCSVM<br/>全部图像的离群分数"]
需要区分两种“被筛掉”:生成伪标签时不确定的样本可以不参与监督,但最终评分仍覆盖整个输入集合。 如果下游需要真正删除异常图像,则还要把连续分数变成二元决策;这不是 AUROC 排序指标自动提供的能力。 论文在分类和三维重建应用中使用 FlexUOD 估计的异常比例确定分位数阈值,而不是把伪标签阈值直接当最终删除阈值。
关键设计¶
1. 局部可分性聚类:先找相对纯净的小群体,而不是立即判断每个样本
作者采用亲和传播聚类(Affinity Propagation,AP),以特征间负平方欧氏距离作为相似度,通过“责任度”和“可用度”消息交替更新选出代表点。 责任度反映某个候选点相比其他候选点有多适合代表当前样本,可用度则汇总其他样本对该候选点的支持程度。 其作用不是直接输出异常标签,而是让形态相近的样本先形成细粒度簇,而且无需预先给定簇数。 论文假设异常通常稀少、彼此差异较大且与正常分布不够接近,因此部分异常会组成小簇或单点簇,而不是完全混入正常大群体。
这种划分仍可能产生正常簇、异常簇和混合簇,所以“被聚成一簇”不等于“已经识别异常”。 它只是把后续监督判断的对象从单个不稳定样本变成具有局部一致性的群体。 相比 k-Means,AP 避免了事先选择 \(k\);论文也观察到 k-Means 更容易把稀少异常吸入最近的正常簇。 不过,AP 本身同样会分配样本到簇,不能将其解释为具有显式拒识标签的聚类算法;单点或小簇也不是必然的异常证据。 其可靠性仍取决于原始特征是否保存了一定局部结构。
2. 全局可分性筛选:用排序一致性修正被异常拉偏的正常中心
作者从一个简单全局参考出发:计算所有特征的均值,以每个样本到该均值的距离作为初始离群分数。 正常数据占主导时,总体均值有望接近正常中心,因此距离较大的点更可能异常。 文中的高维球壳分析提供了距离集中的直觉,但并不构成任意多峰数据都可按中心距离分离的保证。 当异常比例上升,总体均值会被异常拉偏;仅使用这个初始中心,排序质量就可能下降。
VUOD 因此为每个 AP 簇计算一个簇中心,再用“所有样本到这个簇中心的距离”生成另一份全局排序。 注意,比较对象不是簇内距离,也不是两个中心之间的距离,而是同一批全部样本在两个参考中心下的排序。 如果某簇与主要正常分布相容,它作为参考中心时产生的排序通常更接近总体参考;偏离正常分布的簇则可能产生不同排序。 论文用排序序列的 Spearman 相关系数绝对值定义排序一致性,随后对初始一致性值进行 min-max 归一化。 其核心指标可按原文式(5)写为:
这里 \(f_t\) 是到第 \(t\) 个簇中心的距离分数,\(f_{\mathrm{base}}\) 是到总体均值的距离分数。 作者先移除初始一致性低于 0.9 的簇,仅用保留特征重算中心,得到修正的全局距离排序。 这些“移除”只发生在构建参考中心的步骤,不意味着其他样本不再接受后续检测。 随后重新比较每个簇中心排序与修正排序:一致性高于 \(\epsilon^+=0.9\) 的簇提供正常伪标签,低于 \(\epsilon^-=0.5\) 的簇提供异常伪标签。 中间区间的簇不用于构造这两类监督,从而避免强迫混合簇或正常类内变化较大的簇接受不可靠标签。 两个阈值控制的是监督纯度与覆盖范围,不需要知道真实异常比例,但也意味着伪标签质量依赖上述结构假设。
3. 对比特征增强:只用可信样本教会轻量映射区分正常与异常
有了两个伪标签集合,作者从正常集合中抽取正常—正常正样本对,再从正常和异常集合中抽取正常—异常负样本对。 每个训练轮次重新采样,而不是一次生成所有可能的样本对,以避免样本对数量导致内存膨胀,并改善训练稳定性。 两层 MLP 包含 ReLU,输出经过 \(\ell_2\) 归一化;对比目标拉近正常样本对,同时把正常—异常样本对推到间隔之外。 论文将相似对记作 \(y=0\),不相似对记作 \(y=1\),负对的间隔参数为 1.0,并使用 Adam 优化映射参数。
这里没有要求所有异常都聚成同一个“异常类”,因为异常可能来自多种互不相似的分布。 直接将正常样本收拢、把异常相对于正常推开,更符合离群检测的结构,而非普通二分类中对两个类别对称建模的想象。 训练完成后,所有原始特征都通过这个映射,包括此前未进入伪标签集合的样本,再由 OCSVM 建模和评分。 因此,不确定样本的最终结论来自增强后的表示与评分头,而不是在第一轮筛选时被永久定性。 论文也测试了 Isolation Forest 和 LOF,图示结果支持特征增强对其他评分头同样有帮助;默认选择 OCSVM,并未把评分器本身作为新发明。
损失函数 / 训练策略¶
该方法的无监督性针对目标任务标签,而不是否认预训练骨干已经使用过外部数据。 适配阶段使用当前目标集合生成伪标签并训练 MLP,评分阶段仍在这一目标集合上运行,属于传导式设置。 自然图像实验使用 ResNet-50 和 CLIP;工业及医学实验使用 ResNet-18 和 Wide ResNet-101。 后两类任务合并原始训练集与测试集,包含正常和异常样本,而不是使用原始的“仅正常训练、独立测试”拆分。 缓存正文的部分公式抽取不完整,因此这里保留可核验的排序指标,并按原文文字解释对比目标,不补写无法核验的完整损失公式。 学习率、MLP 隐层宽度、训练轮数等细节在所读正文中没有给出,不应凭常见配置补齐。
实验关键数据¶
主实验¶
以下为原文表 1、表 2 的选取结果,指标均为整图 AUROC,越高越好;差值为 AUROC 的绝对差,不是相对百分比。 自然图像由一个类别构成正常样本,其余类别随机采样为异常;表 1 汇总两种骨干及六种异常比例(范围 0.01–0.5)的实验。 工业/医学结果使用合并后的原始训练集与测试集,并在下表中固定 ResNet-18,避免跨骨干比较。
| 数据集与设置 | 来源 | 对照方法 | 对照 AUROC ↑ | VUOD AUROC ↑ | 绝对差 |
|---|---|---|---|---|---|
| CIFAR-10,自然图像汇总 | 表 1 | FlexUOD | 0.942 | 0.972 | +0.030 |
| MIT-Places,自然图像汇总 | 表 1 | FlexUOD | 0.928 | 0.971 | +0.043 |
| MVTec-AD,ResNet-18 | 表 2 | LVAD | 0.779 | 0.911 | +0.132 |
| MPDD,ResNet-18 | 表 2 | RSRAE | 0.618 | 0.906 | +0.288 |
| RESC,ResNet-18 | 表 2 | FlexUOD | 0.948 | 0.901 | −0.047 |
对照选自对应表列中的强基线,不能由此推导 VUOD 在所有数据集、所有骨干上都最优。 尤其 RESC 的 ResNet-18 结果是明确反例;“跨域有效”不等于“没有失败条件”。 原文表 3 的 PaDiM、FRE、EfficientAD 也在含异常的同一目标集合上训练和测试,不能将其数值直接视为这些方法在标准工业协议下的表现。
消融实验¶
原文表 6 固定 OCSVM 评分头,比较原始特征与增强特征,结果按各域的两种骨干平均;数据构建沿用主实验。 这是对整个表示增强方案的消融,而不是分别移除 AP、均值修正和对比损失的独立组件消融。
| 数据集 | 原始特征 AUROC ↑ | 增强特征 AUROC ↑ | 绝对差 | 来源 |
|---|---|---|---|---|
| CIFAR-10 | 0.824 | 0.972 | +0.148 | 表 6 |
| MVTec-AD | 0.754 | 0.921 | +0.167 | 表 6 |
| MPDD | 0.575 | 0.916 | +0.341 | 表 6 |
| LiverCT | 0.597 | 0.825 | +0.228 | 表 6 |
MPDD 的 0.575→0.916 对应原文所说的约 59.3% 相对提升,但其 AUROC 绝对提升是 0.341,不能混写为 59.3 个百分点。 表 7 还检查了 CIFAR-10 的伪标签阈值:默认 \((0.9,0.5)\) 得到 0.972,\((0.9,0.6)\) 为 0.971,\((0.9,0.4)\) 为 0.970。 这些结果支持默认值附近较稳定,但该阈值实验只覆盖一个数据集,不能据此宣称任意域或任意阈值均稳定。
关键发现¶
- 最大的价值来自改变表示,而不只是替换最终评分头。表 6 的对照将 OCSVM 固定,更直接地展示了这一点。
- 整图表示不保证工业异常全部易解:表 2 中 Wide ResNet-101 在 MVTec-LOCO 上为 0.832,低于同表多数工业数据集,不能沿用正文“工业结果都超过 0.910”的笼统说法。
- 下游分类收益较温和:表 8 的 Imagenette/ResNet-18 Top-1 从 90.81% 到 91.45%,Top-5 从 99.11% 到 99.39%。这是过滤训练集后的分类收益,不是离群检测 AUROC。
- AP 的效率优势有条件:表 4 只有将 k-Means 的簇数设为 AP 所得簇数时支持 AP 更快;小 \(k\) 的 k-Means 更快,不能宣称 AP 普遍效率更高。
亮点与洞察¶
- 伪标签不必逐样本硬判。先辨别局部群体是否可靠,再从高置信度两端取监督,可以把不确定样本留给后续更好的表示处理。
- 比较的是“以谁为参考时全体样本的排序是否一致”,而非簇大小或单个距离阈值。这让局部结构与全局异常排序发生了具体联系。
- 特征增强与评分器解耦。已有预训练骨干和经典检测器得以保留,新增学习集中在轻量映射上,便于检验收益究竟来自哪里。
局限与展望¶
- 作者明确指出:框架围绕整图排序设计,对 patch/像素级异常分割可能不够有效;不能把医学 AUROC 解释成病灶定位能力。
- 阅读判断:正常分布占主导、异常较稀疏且局部可分是关键前提;复杂多峰正常数据或成簇的相似异常可能使中心和排序一致性失效。
- 阅读判断:AP 涉及样本两两关系,有限规模上的速度实验不能消除大集合的内存与计算问题;还需要单独评估在线或新增样本场景。
- 证据边界:本地正文完整到结论与参考文献,但未包含文中另行提及的附录;因此不复述无法看到的聚类可视化和三维重建输入细节。
- 复现边界:正文未完整报告所有训练超参数,也未给上述汇总表的误差区间;本文数值是作者报告结果,不是独立复现。
相关工作与启发¶
- 与 Multi-T / FlexUOD 相比:本文把重点前移到可靠监督与表示增强,而不满足于在原始特征的异常分数上寻找边界;最终应用中的二元过滤仍借用了 FlexUOD 的异常比例估计。
- 与 OCSVM 相比:OCSVM 是保留的经典评分头,不是被替代对象。核心比较应是同一评分头面对原始和增强表示时的差异。
- 与工业专用检测器相比:VUOD 追求跨域整图筛查,并使用含污染的传导式目标集合;专用方法的空间建模能力与标准干净训练协议不能被这组对照抹去。
评分¶
- 新颖性:3/5。将已有聚类、排序一致性和对比学习组合成跨域增强框架,主要贡献在监督构造与问题重新组织。
- 实验充分度:4/5。跨三个域、十四个数据集并有特征和阈值分析,但组件级隔离实验与统计不确定性仍不足。
- 写作质量:3/5。整体机制清楚,但个别概括与表格不一致,具体实现细节也需要代码补充。
- 价值:4/5。适合作为批量图像离群筛查的可复用基线,应用时应保留传导式协议和整图粒度的边界。