ArcAD: Anomaly-Rectified Calibration for Cold-Start Supervised Anomaly Detection¶
会议: ECCV 2026
Paper: https://eccv.ecva.net/virtual/2026/poster/5146
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/9081.pdf
代码: https://github.com/LGC-AD/ArcAD
领域: 异常检测
关键词: 工业异常检测、冷启动、超球面原型、最优传输、缺陷引导校准
一句话总结¶
ArcAD 不替换重建式工业异常检测器,而是在训练时用均衡的超球面正常原型、受原型约束的伪异常和少量真实缺陷校准潜在空间,使 Dinomaly 在 Real-IAD 多类别冷启动设置下的图像级 AUROC 从 88.8% 提升到 92.5%,推理仍使用原有重建误差。
研究背景与动机¶
工业异常检测常把正常产品的特征分布学好,再用偏离程度识别划痕、裂纹或结构缺陷。 Dinomaly、RD4AD、ReContrast 等重建式方法依靠正常样本训练,测试时比较原始特征与重建特征;它们不必事先穷举每一种缺陷。 但新产线刚上线时,正常样本也不充足,不同材质、纹理和局部结构未必都被覆盖。 此时重建损失只能间接塑造正常区域,潜在表示容易松散,模型对未见过的正常变化和异常变化都缺少清晰边界。
少量已标注缺陷看似可以补上这块信息,但直接训练正常/异常分类器又可能记住这几种已知缺陷。 本文希望保留重建式检测对未知异常的适用性,同时让稀缺异常发挥监督作用。 它关注的不是只有一张支持图的极端少样本协议,而是正常训练集被明显缩减、再加入少量真实异常的冷启动设置。 因此,问题的关键不是把异常类别分得越来越细,而是利用有限证据明确哪些方向应属于正常分布、哪些方向应被排除。
作者把这个任务放到单位超球面上处理:先去掉特征幅值差异,再用多个原型组织正常模式,以异常信号校准原型周围的空间。 这样,监督学习承担的是训练期的几何约束,而不是在部署时另加一个缺陷分类器。 核心 idea:把正常特征“拉”向均衡分配的多个原型,再把真实异常“推”离正常原型并拉向经过筛选的伪异常,从而只改变表示学习、不改变重建式异常评分。
方法详解¶
整体框架¶
输入包括有限的正常图像,以及带缺陷掩码的少量异常图像;输出仍是重建式骨干产生的异常分数图。 正常图像经过编码器、瓶颈和解码器形成重建支路,ArcAD 则在瓶颈的局部特征上增加训练约束。 具体依次涉及均衡原型建模、原型约束合成、缺陷引导校准和辅助判别约束;前三者提供局部几何结构,最后一项补充正常/异常的整体区分。 真实异常的掩码用于挑出异常图块,不能把缺陷图像中的所有位置都当成异常。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["正常图像与<br/>带掩码缺陷图像"] --> B["编码器与瓶颈特征"]
B --> C["均衡原型建模"]
C --> D["原型约束合成"]
D --> E["缺陷引导校准"]
B -->|"掩码筛选真实异常"| E
E --> F["辅助判别约束"]
F -.->|"训练期更新瓶颈"| B
B -->|"原有重建支路"| G["解码器与重建误差<br/>推理异常图"]
训练完成后,原型、合成机制和判别器不参与最终异常评分。 框架图中的回边表示优化约束,而不是测试时反复运行的迭代检测流程。 这也是“即插即用”的边界:接入的是重建式模型的潜在空间,不能据此推断它已经适用于任意检测架构。
关键设计¶
1. 均衡原型建模:让稀缺正常特征形成多个不塌缩的模式
瓶颈输出的每个图块特征先做 \(\ell_2\) 归一化,落在单位超球面上,后续主要比较方向而非长度。 作者用 von Mises–Fisher(vMF)分布解释这种方向聚类:原型代表平均方向,集中参数控制特征围绕该方向的紧密程度。 一个原型不足以表示不同正常纹理和结构,尤其当一个模型同时学习多个产品类别时,因此需要多个正常原型。 但直接聚类又容易让有限样本中的高密度模式占据大部分原型,较少出现的正常模式得不到足够表示容量。
Sinkhorn-based Prototype Modeling(SPM)先用余弦距离 K-means 初始化原型,再把图块到原型的软分配写成均衡最优传输问题。 分配矩阵 \(Q\) 的每一行对应一个图块,每一列对应一个原型;在偏好高余弦相似度的同时,满足以下约束:
第一项要求每个图块的分配权重合计为一,第二项要求每个原型接收相同的总权重,均衡的是批内分配质量而不是产品类别样本数。 Sinkhorn–Knopp 迭代对指数相似度矩阵交替缩放,得到满足约束的软分配。 随后以该分配为软目标,通过交叉熵让特征预测与之对齐;原型使用指数移动平均更新,构成类似 EM 的交替过程。 原型数量提供多模式容量,均衡约束防止少数原型独占样本,两者作用不同;均衡分配本身不等于证明未观测的正常模式已被覆盖。
2. 原型约束合成:排除仍然像正常特征的伪异常候选
真实缺陷太少,单靠它们难以形成稳定的异常约束,所以 ArcAD 从正常特征出发合成负样本。 每个正常锚点加入五次独立高斯扰动,每次都重新归一化到单位超球面,得到五个局部候选。 重新投影可避免特征仅靠幅值变大就成为容易识别的离群点,但这并不能保证每个候选都已离开正常区域。 有些扰动后的方向仍靠近某个正常原型,若直接给它们异常标签,就会把真实正常区域推散。
筛选时,对每个候选计算它与所有正常原型的最大余弦相似度,再保留该最大值最小的一个候选。 换言之,不只是远离出发点对应的原型,还要避免落入另一个正常原型附近;每个锚点最终只贡献一个伪异常。 这是在有限局部候选中选择相对最不像正常模式的方向,并非在整个超球面寻找最远点。 论文没有在这一机制中给出固定的边界距离保证,也不应把它改述成“选择最接近正常边界的候选”。
3. 缺陷引导校准:用真实缺陷决定正常区域应排除哪些方向
Defect-Guided Calibration(DGC)先把真实缺陷图像的掩码下采样到图块分辨率,只提取掩码标出的异常图块,再归一化到同一超球面。 这一步把图像级异常标签收紧为局部监督,避免把同一张缺陷图中的大面积正常背景也推离正常分布。 因此 ArcAD 使用的不只是少量异常图像,还使用了它们的缺陷位置标注。
校准包含两个互补方向:降低真实异常与其最相似正常原型的相似度,同时增强真实异常与合成异常集合的方向一致性。 前者使异常远离最容易混淆的正常模式,后者让稀少真实缺陷与数量较多的合成负样本形成更连贯的异常区域。 这里异常提供的是修正正常表示的信号,不是要学全所有可能缺陷的语义类别。 不过,把不同异常拉向共同区域也隐含了共享异常方向的假设,论文的整体结果并不能证明该假设对任意异质缺陷都成立。
4. 辅助判别约束:配合几何结构训练,而非接管推理评分
框架另外加入轻量判别器,例如两层 MLP,把正常特征标为零、真实和合成异常标为一。 判别器使用二元 Focal Loss,减轻正常样本占多数时的类别不平衡影响,并为潜在表示增加整体可分性的约束。 它与 SPM、DGC 的关系很重要:原型和对比约束先提供结构,判别器再强化区分,而不是仅靠分类监督自己发现稳定边界。 消融中,只给 Dinomaly 增加判别器反而降低性能,因此不能把 ArcAD 的效果归结为“多加一些异常标签”。
损失函数 / 训练策略¶
瓶颈同时接收正常重建损失、SPM 损失、DGC 损失和判别损失,后三项的权重均为 0.1。 解码器只由正常样本的重建损失更新,判别器参数只由判别损失更新;框架图中的编码器被冻结。 这意味着真实缺陷并没有被当作正常目标交给解码器学习重建,异常监督主要用于塑造瓶颈表示。 训练使用 AdamW,学习率为 \(2\times10^{-3}\),动量参数为 \((0.9,0.999)\),权重衰减为 \(10^{-4}\),各数据集训练 10,000 次迭代。 原型数量最终选择 \(K=500\);这一选择依据图像级与像素级结果,而非所有指标都在同一原型数量上达到峰值。
本地全文的式(2)—(10)存在明显的公式抽取缺损,尤其交叉熵和 DGC 损失中的运算符不完整。 因此这里只保留正文明确给出的分配约束,并用文字解释已核实的优化方向,不补写无法核对的损失表达式。 正文多次引用补充材料,但当前缓存只包含主文和参考文献;详细逐类结果及部分实现细节未据此补齐。
实验关键数据¶
主实验¶
以下选取论文表 1 的多类别设置:每个数据集内混合全部类别训练一个模型,ArcAD 以 Dinomaly 为骨干。 冷启动训练仅保留原正常训练集的 30%,再从原测试集抽取异常;异常占新训练集的比例通常为 10%,VisA 与 MANTA 为 5%。 被移出的正常训练图像进入新测试集,被用于训练的异常则不再留在测试集;各方法使用相同的重构后测试集。 无监督 Dinomaly 只用正常子集,ArcAD 额外使用异常及其掩码,所以这不是等监督信息的比较。 各分数按类别取平均,单位为百分数;I-AUROC、P-AUROC 和 P-F1-max 均为越高越好。 I-AUROC 衡量图像级异常排序,P-AUROC 衡量像素级排序,P-F1-max 是随阈值变化取得的最大像素 F1,不是固定部署阈值下的 F1。
| 数据集 | Dinomaly:I-AUROC / P-AUROC / P-F1-max | ArcAD:I-AUROC / P-AUROC / P-F1-max | I-AUROC 增益(百分点) |
|---|---|---|---|
| MVTec-AD | 99.6 / 98.3 / 68.4 | 99.7 / 99.2 / 68.9 | +0.1 |
| VisA | 98.4 / 98.9 / 53.9 | 98.9 / 99.0 / 54.9 | +0.5 |
| Real-IAD | 88.8 / 98.8 / 46.7 | 92.5 / 99.0 / 49.8 | +3.7 |
| MANTA tiny | 90.3 / 93.8 / 39.8 | 93.3 / 95.5 / 48.5 | +3.0 |
来源:表 1;数据划分见第 4.1 节,MANTA 使用 tiny 版本。 表 1 带星号的 Dinomaly 来自标准设置,不能作为上述同设置基线;例如其 MANTA P-F1-max 为 53.1,高于 ArcAD 的 48.5,因此不能把作者概括扩展为“超过表中所有参考数字”。
消融实验¶
下面均为 Real-IAD 多类别冷启动设置,数值单位为百分数,三个指标均向上为优。 选取表 4 的模块消融,并补充表 6 最能说明候选筛选必要性的一行;不同来源在表内明确区分。
| 配置 | I-AUROC | P-AUROC | P-F1-max | 来源与含义 |
|---|---|---|---|---|
| Dinomaly 基线 | 88.8 | 98.8 | 46.7 | 表 4,仅重建 |
| 仅增加判别器 | 87.8 | 98.5 | 45.5 | 表 4,无 SPM 与 DGC |
| 去掉 SPM | 91.7 | 98.9 | 49.3 | 表 4,取消均衡原型建模损失 |
| 去掉 DGC | 90.2 | 98.8 | 48.1 | 表 4,取消缺陷引导校准损失 |
| 不筛选伪异常 | 90.2 | 98.5 | 43.4 | 表 6,使用全部候选 |
| 完整 ArcAD | 92.5 | 99.0 | 49.8 | 表 4、表 6 |
关键发现¶
- DGC 的作用不止是多一个损失项:去掉它,I-AUROC 降低 2.3 个百分点,P-F1-max 降低 1.7 个百分点;去掉 SPM 时对应下降为 0.8 和 0.5 个百分点。
- 筛选伪异常对定位尤其关键:不筛选时 P-F1-max 为 43.4,完整模型为 49.8,相差 6.4 个百分点;“合成更多异常”不等于“获得更有效监督”。
- 效果不是简单的监督数据红利:仅增加判别器把 I-AUROC 从 88.8 降至 87.8,表明额外标签需要合适的表示约束才能发挥作用。
- 第 4.2 节表 3 中,即使 Real-IAD 的异常比例降至 3%,Dinomaly 加 ArcAD 的 I-AUROC 仍为 89.7,高于冷启动基线 88.8,但弱于 10% 异常比例时的 92.5。
亮点与洞察¶
- 把训练时的监督接口与测试时的评分接口分开。异常样本可以显式参与表示学习,而部署仍沿用熟悉的重建误差,无须换成另一个分类器。
- 正常原型兼任伪异常的质量检查器。它们既组织正常模式,也排除与任何已学正常模式过近的合成候选,让两个训练环节共享同一几何参照。
- 多原型和均衡分配解决不同问题。前者容纳正常数据的多模态结构,后者防止有限样本让分配集中到少数原型,不能把两者合称为普通聚类而忽略约束。
局限与展望¶
- 作者明确承认额外训练开销,主要来自原型优化与校准;未来方向是更轻量的实现。推理不新增评分模块不等于训练成本不变。
- 读者观察:冷启动使用原正常训练集的 30%,并不等价于固定一张或几张正常图像的极少样本任务,不宜外推到所有 few-shot 协议。
- 读者观察:方法需要真实缺陷的像素掩码;异常样本数量少,并不意味着位置标注成本可以忽略。
- 读者观察:主表没有多次随机划分的方差或置信区间,MVTec-AD 的 0.1 个百分点图像级增益不应被解释为已验证的稳定显著提升。
- 读者观察:均衡原型分配不必符合真实正常模式的长尾频率;当前结果支持其经验有效性,但没有证明在严重模式不均衡时仍总是合适。
相关工作与启发¶
- 对比 Dinomaly、RD4AD、ReContrast:这些方法提供重建骨干与推理分数,ArcAD 增加训练期的潜在空间约束。其价值是增强已有方法,而非提出新的测试期重建评分。
- 对比 SimpleNet、DRAEM:前者代表特征空间合成异常,后者代表图像层面的异常合成;ArcAD 的区别是超球面扰动后再用全部正常原型筛选,并与真实局部缺陷协同训练。
- 对比 DRA 等监督异常检测方法:ArcAD 更强调用已知异常修正正常边界,而不是仅学习已知异常的判别表示;不过表中的监督方法也存在骨干与优化方式差异,不能把性能差距全部归因于这一理念。
评分¶
- 新颖性:3.5/5。超球面、Sinkhorn 和异常合成本身并非新工具,面向冷启动重建模型的组合与监督接口较有针对性。
- 实验充分度:4/5。覆盖四个数据集、单/多类别和多个重建骨干,模块及合成策略消融较完整,但缺少统计波动报告。
- 写作质量:3.5/5。主文机制链条清楚,部分领先性概括需结合标准设置参考行辨析;本地公式抽取损坏不作为原论文写作缺陷扣分。
- 价值:4/5。适合已有重建式质检系统、能获取少量带掩码缺陷的部署场景,且不改变最终评分路径。