PADFormer: Pose-agnostic Anomaly Detection from Sparse View Images¶
会议: ECCV 2026
论文: ECCV 原文
领域: 目标检测
关键词: 姿态无关异常检测, 稀疏视角, 掩码图像重建, 空间变换网络, 动态补丁选择
一句话总结¶
针对工业检测中视角任意且多视角参考图稀疏的难题,PADFormer 抛弃耗时的显式 3D 重建流程,提出基于 ViT 的 2D 跨视角掩码重建框架,结合空间变换对齐、动态补丁选择与异常无关先验标记,仅需少量无位姿参考图即可在推理期通过多轮集成精准定位缺陷。
研究背景与动机¶
无监督视觉异常检测在工业质检与智能制造中扮演着核心角色。传统无参考图方法或少样本异常检测(FSAD)通常严格建立在“视角对齐”(pose-aligned)的假设之上,即待检样本与正常参考样本必须在固定、预设的相机视角下采集。然而在真实的制造与流水线巡检场景中,工件往往以任意未知姿态放置,缺陷可能出现在任何不可预知的视角甚至局部遮挡位置。当测试样本与参考视角的几何位姿存在显著偏差时,传统基于 2D 特征匹配或全局配准的方案便会彻底失效。
为了打破固定视角的枷锁,姿态无关异常检测(Pose-agnostic Anomaly Detection, PAD)应运而生。现有 PAD 方法主要依赖显式 3D 几何重建路线(如基于 NeRF 或 3D Gaussian Splatting 的 OmniAD、SplatPose、PIAD 等)。这些方法必须依赖成百上千张覆盖全方位的多视角图像以及精确的相机外参标注来预先拟合 3D 模型,且在测试阶段需要针对每张测试图单独运行昂贵的迭代式位姿估计与对齐优化。密集的参考图需求与缓慢的 3D 重建耗时构成了其落地应用的关键瓶颈,在现实中难以低成本获取数百张多视角密集标注数据。
面对密集 3D 重建的高昂代价,本文探索在纯 2D 图像空间直接完成任意未知位姿下的缺陷重建与定位。如果利用无缺陷样本训练跨视角掩码自编码器,模型便能学会将包含缺陷的查询图补全为视角完全一致、但缺陷被正常纹理替换的“无瑕疵孪生图”,从而通过图像差分直接检出异常。核心 idea:抛弃耗时的 3D 几何重建与测试期位姿优化,构建基于 ViT 的 2D 稀疏视角掩码重建框架,通过轻量级空间变换对齐与动态补丁检索从极少参考视角聚合特征,并在推理时使用多轮随机掩码集成与 CIELAB 方差滤波实现鲁棒的高精度异常检测。
方法详解¶
整体框架¶
PADFormer 采用端到端 Transformer 架构,旨在仅输入极少数(如 2~4 张)未知相机位姿的正常参考图集合 \(\{R_i\}_{i=1}^N\) 和单张待检查询图 \(Q\) 的情况下,直接重建出位姿与 \(Q\) 严格一致的无异常对应图 \(\tilde{Q}\)。整个流水线包含不对称掩码 ViT 编码、基于空间变换网络(STN)的特征对齐、结合空间与语义的动态补丁选择(DPS),以及融入全局/局部异常无关标记(AAT)的交叉注意力解码器。最后,在推理阶段采用多轮随机掩码集成并基于 CIELAB 色彩空间和方差一致性掩码滤除背景扰动,生成精准的像素级与图像级异常评分。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入:查询图 Q + 稀疏参考图集 {Ri}"] --> B["非对称掩码 ViT 编码<br/>查询图 40% 随机掩码,参考图全保留"]
B --> C["空间变换网络特征对齐<br/>轻量卷积预测仿射矩阵 θi 并双线性重采样"]
C --> D["动态补丁选择<br/>融合特征相似度与空间邻近度筛选 Top-k 补丁"]
D --> E["异常无关先验标记与交叉注意力解码<br/>结合 32 个全局标记与 M 个局部位置标记"]
E --> F["多轮集成推理与 CIELAB 滤波<br/>15 次掩码重建计算方差掩码,压制伪异常"]
F --> G["输出:像素级缺陷热力图与图像级异常分"]
关键设计¶
1. 空间变换网络特征对齐:消除视角差异引起的特征错位
在稀疏视角输入下,参考图像与查询图像之间存在不可忽视的 3D 旋转和视角差异。如果直接在原始特征网格上计算跨视角注意力,会导致注意力分布涣散且引入大量不相关的局部特征干扰。为此,PADFormer 引入轻量级空间变换网络(STN)在补丁特征层级进行几何预对齐。对于查询特征网格 \(\hat{\mathbf{f}}_\text{q} \in \mathbb{R}^{M \times d}\)(掩码位置由可学习嵌入填充)与参考特征 \(\mathbf{f}_{\text{r}i} \in \mathbb{R}^{M \times d}\),将它们沿通道拼接后送入一个包含两个小卷积层(核大小分别为 \(7 \times 7\) 和 \(5 \times 5\))与全连接层的定位网络,预测出针对该参考图的 6 自由度 2D 仿射变换参数 \(\theta_i\)。随后,仅对参考特征图执行双线性网格重采样生成对齐特征 \(\tilde{\mathbf{f}}_{\text{r}i}\),查询图坐标系保持不动作为基准。这种纯特征空间的轻量对齐大幅收缩了跨视角补丁检索的搜索空间,使后续匹配能够聚焦在具有几何相关性的物理区域。
2. 动态补丁选择:语义相似度与空间邻近度联合过滤
单张图像包含 \(M\) 个补丁,若将全量 \(N \cdot M\) 个参考补丁送入解码器计算全局交叉注意力,不仅计算复杂度激增,还会将大量视场外的无关背景补丁引入解码过程,削弱正常结构的重建保真度。为此,PADFormer 为每个查询补丁动态检索 Top-\(k\) 个最相关的对齐参考补丁。为了平衡长程语义对应与局部平滑约束,匹配得分结合了归一化余弦相似度与高斯空间邻近先验:
其中 \(\mathbf{p}_q^j\) 与 \(\mathbf{p}_{\text{ref}}^l\) 为特征图上的 2D 网格物理坐标,\(w=0.3\) 为平衡权重,\(\sigma=2.0\) 控制空间高斯衰减半径。每个查询位置仅保留综合评分最高的 \(k=10\) 个对齐参考补丁 \(s_j \in \mathbb{R}^{k \times d}\),既大幅加速了解码器推理,又有效防止了来自无关视角的噪声纹理干扰。
3. 异常无关先验标记与交叉注意力解码:双轨约束压制缺陷模式
当查询图像中的某些区域完全被异常破坏(例如大面积污渍、结构断裂)时,仅依赖参考图检索可能因视角覆盖不全而无法匹配到有效依据;而若自注意力过强,又容易导致解码器“忠实重建”出缺陷本身。PADFormer 在 8 层 ViT 解码器中引入两组可学习的异常无关先验记忆标记(Anomaly-agnostic Tokens, AAT):一组为 32 个全局共享标记 \(T_{\text{global}} \in \mathbb{R}^{32 \times d'}\),用于沉淀跨样本共性的正常外观与低频几何基底;另一组为 \(M\) 个位置敏感的局部标记 \(T_{\text{local}} \in \mathbb{R}^{M \times d'}\),捕获特定网格位置的几何先验。在解码器的交叉注意力层中,每个查询 token 联合 attend 到全局标记、展平的所有局部标记以及所检索到的 Top-\(k\) 参考补丁 \(s_j\)。由于全局和局部标记在仅包含正常样本的数据集上学习,它们构成了强大的正常流形约束,强行引导异常区域按正常先验“补全”而非“复制”,从而精准合成立场的无异常孪生图像。
4. 多轮集成推理与 CIELAB 滤波:方差一致性剥离假阳性
为了解决单次掩码可能漏掉待检缺陷区域的问题,PADFormer 在测试期执行 \(I=15\) 次前向推理,每次施加独立的随机 40% 掩码。由于单次掩码覆盖概率为 0.4,15 轮下任意图像补丁被至少掩码一次的概率达到 \(1 - (1-0.4)^{15} \approx 99.95\%\)。在误差评估上,模型将重建图上采样至原分辨率并转换至感知更均匀的 CIELAB 色彩空间,使用高斯滤波(\(\sigma=1.4\))平滑查询图以压制高频噪波,计算各通道均方误差:
更为精妙的是,工业图像中常出现批次微小色差或全局光照漂移等“罕见但正常”的模式。这些良性模式属于正常数据分布,模型在不同掩码下均能稳定重建,其在 15 轮重建中的跨轮方差 \(\text{Var}(x, y) = \frac{1}{I} \sum_{i=1}^I (E_i - \bar{E})^2\) 极小;相反,真实缺陷由于缺乏正常参考支撑,在不同可见上下文下重建极不稳定,呈现极高方差。因此,PADFormer 构造一致性掩码 \(\mathcal{M}(x,y) = \mathbb{I}[\text{Var}(x,y) > P_{50}(\text{Var})]\),仅保留方差高于中位数的区域作为最终异常图 \(\mathcal{E}(x,y) = \bar{E}(x,y) \mathcal{M}(x,y)\),从而干净利接地消除了光照偏移带来的系统性假阳性。
损失函数 / 训练策略¶
模型训练采用两阶段递进式训练策略,全程仅使用无异常图像: - 阶段一:视线内(Within-view)自增强预训练(50 epochs):以单张查询图像自身经过随机旋转和弹性变形增强后的视图作为参考图,迫使模型学习物体特征的几何不变性与本征几何表征,为跨物体泛化打下坚实基础。 - 阶段二:跨视角(Cross-view)统一训练(250 epochs):在整个数据集的所有类别上联合训练统一模型,参考图取自同类别物体的其他视角图像,使模型掌握跨视角合成与类别级先验。 - 优化目标:两阶段均采用均方误差与感知损失(Perceptual Loss)的加权组合:
模型使用预训练 MAE ViT 骨干网络,采用 Cosine 学习率调度,峰值学习率为 \(4 \times 10^{-4}\),在前 2500 步进行预热。
实验关键数据¶
主实验¶
在代表性的姿态无关异常检测基准 MAD-SIM 与 PIAD 数据集上,PADFormer 与主流 3D 重建类方法(OmniAD、SplatPose、PIAD)以及先进少样本异常检测方法(PromptAD、UniVAD)进行了严密对比。在极端稀疏参考视角设置下,PADFormer 展现出压倒性的优势:
| 数据集 | 参考数 | 指标 | PADFormer (本文) | 最佳基线 | 提升幅度 |
|---|---|---|---|---|---|
| MAD-SIM | 2-shot | Image-AUROC (%) | 78.8 | 57.9 (UniVAD) | +20.9% |
| MAD-SIM | 2-shot | Pixel-AUROC (%) | 89.2 | 82.2 (PIAD) | +7.0% |
| MAD-SIM | 4-shot | Image-AUROC (%) | 81.3 | 60.3 (PromptAD) | +21.0% |
| MAD-SIM | 4-shot | Pixel-AUROC (%) | 92.9 | 86.7 (SplatPose) | +6.2% |
| MAD-SIM | 4-shot | AUPRO (%) | 86.7 | 74.6 (SplatPose) | +12.1% |
| MAD-SIM | 10-shot | Image-AUROC (%) | 85.6 | 58.2 (PIAD) | +27.4% |
| MAD-SIM | All-shot | Image-AUROC (%) | 97.8 | 97.4 (PIAD) | +0.4% |
| PIAD | 2-shot | Image-AUROC (%) | 75.6 | 54.3 (UniVAD) | +21.3% |
| PIAD | 4-shot | Image-AUROC (%) | 80.7 | 59.2 (UniVAD) | +21.5% |
| PIAD | 4-shot | Pixel-AUROC (%) | 91.2 | 84.4 (PIAD) | +6.8% |
| PIAD | All-shot | Image-AUROC (%) | 95.4 | 94.7 (PIAD) | +0.7% |
注:在 All-shot 场景下,3D 重建类基线均采用针对每个类别单独训练(per-object training)的高昂模式,而 PADFormer 采用跨类别统一模型训练,不仅保持领先的 Image-AUROC,且完全摆脱了对相机外参的依赖。
消融实验¶
在 MAD-SIM 4-shot 设定下,论文对 PADFormer 各核心模块以及测试期度量指标进行了细致消融:
| 模块配置 (STN / DPS / AAT) | Image-AUROC (%) | Pixel-AUROC (%) | 结论说明 |
|---|---|---|---|
| Baseline (CroCo 风格 cross-attention) | 76.8 | 80.2 | 基础跨视角注意力,无对齐与显式先验 |
| + Dynamic Patch Selection (DPS) | 78.2 | 85.4 | 检索 Top-k 补丁过滤远端无关噪声 (+5.2% Pixel) |
| + STN 特征对齐 + DPS | 79.1 | 89.2 | 空间仿射对齐消除视角几何错位 (+3.8% Pixel) |
| + STN + DPS + AAT (完整模型) | 81.3 | 92.9 | 全局/局部先验标记引导无瑕疵补全 (+3.7% Pixel) |
不同异常误差评估空间与时间开销对比:
| 误差度量空间 | Image-AUROC (%) | Pixel-AUROC (%) | 单图推理耗时 (秒) | 特点与代价 |
|---|---|---|---|---|
| RGB 空间 | 78.8 | 86.4 | 0.6 | 最快但缺乏感知均匀性,边缘假阳性高 |
| CIELAB 空间 (本文默认) | 81.3 | 92.9 | 0.8 | 感知均匀度高,精确定位缺陷,性价比最优 |
| ViT 特征空间 | 83.5 | 91.3 | 2.1 | 图像级分类稍高,但耗时增加约 3 倍且像素级定位下降 |
关键发现¶
- 稀疏视角下 3D 重建全面坍塌:在 2-shot 和 4-shot 极端低视数下,基于 NeRF 或 3DGS 的 OmniAD 与 SplatPose 图像级 AUROC 跌落至 50% 上下(等同于随机猜测),原因是稀疏视角无法解算多视角密集点云与相机位姿,产生极其严重的重投影空洞与漂浮伪影;PADFormer 则凭借 2D 图像空间特征重建稳稳维持在 80% 以上。
- 空间变换与动态补丁不可或缺:动态补丁选择(DPS)让像素级定位跃升 5.2%,表明全量注意力的背景噪声是多视角缺陷重建的头号杀手;STN 的特征仿射变换进一步补足了视角形变补偿,令像素级 AUROC 逼近 90%。
- 一致性方差掩码价值显著:在消融实验中,仅依靠方差滤波(剔除低于 50 分位数的低方差区域)就为 Image-AUROC 带来了净胜 2.4% 的提升,证明其成功识别并排除了由光照漂移造成的系统性伪误差。
亮点与洞察¶
- 跳出 3D 范式桎梏的逆向思维:过去的 PAD 工作陷入了“姿态未知必须先求 3D”的思维定势,导致落地受限于高昂的密集多视角采集与相机标定。PADFormer 证明了通过不对称掩码 ViT 结合可学习先验,在纯 2D 特征空间完全可以完成跨视角几何信息搬运,将原本昂贵的 3D 重建降维为毫秒级的特征检索与补全。
- 方差一致性掩码的泛化价值:利用随机多次掩码生成的“重建一致性方差”来区分“正常光照偏移”(方差小)与“真实缺陷破坏”(方差大),这一设计极其聪明且无需额外参数,非常适合直接迁移至其他基于重构的工业生成式质检系统中。
- 统一模型 vs 逐物体特调:与所有 3D 竞争对手需要针对每个物体独立拟合 NeRF/3DGS 模型的沉重机制不同,PADFormer 能够跨越全部工业品类联合训练单一统一模型,展示出卓越的类间几何迁移能力。
局限与展望¶
- 固定 Patch 划分对尺度变化的适应性受限:模型沿用 ViT 的固定尺寸补丁(如 \(16 \times 16\)),在面对跨越十几个补丁的超大面积缺陷或极端细微的亚像素划痕时,特征均质化效应可能导致定位边界略微模糊。
- 多轮掩码推断的时间开销:为了达到 99.95% 的空间覆盖与稳定的方差滤波,推理时需要执行 15 次前向传播(约 0.8 秒/图),虽然远快于 3DGS 的测试期优化,但在 60 FPS 以上的超高速产线质检中仍存在吞吐瓶颈。未来可通过设计确定性最小覆盖掩码模式将推理轮数压缩至 3~4 次。
- 极端视角突变下的外推能力:当参考图与待检图的相机倾角超过一定阈值(例如完全背对)时,2D 仿射变换与补丁匹配难以无中生有推测背面结构,引入轻量化粗粒度位姿提示或多视几何先验将是重要的演进方向。
相关工作与启发¶
- vs OmniAD / SplatPose / PIAD: 上述代表方法依赖 NeRF/3DGS 进行显式 3D 几何建模,必须输入 200+ 张带有 GT 相机姿态的密集多视角图像,且测试阶段需执行梯度回传以优化未知位姿;PADFormer 彻底放弃 3D 重建与外参依赖,仅需 2~4 张未知姿态参考图,在 2D 图像特征空间内完成端到端掩码补全,效率与数据饥渴度显著改善。
- vs UniVAD / PromptAD (FSAD 基线): 经典少样本异常检测方法高度依赖查询图与参考图的“姿态对齐”先验,在遇到大角度视角旋转时特征匹配置信度剧烈衰退;PADFormer 通过空间变换对齐与跨视角两阶段预训练,兼具了少样本的数据敏捷性与抗姿态扰动的强健泛化力。
- vs CroCo / MAE (自监督跨视角掩码模型): CroCo 是面向通用多视角 3D 匹配的掩码框架,直接将查询图与参考图完整交互;PADFormer 将其重构为针对无监督异常检测的定制方案,提出仅在正常图上学习、STN 局部几何变换、以及利用异常无关标记(AAT)压制缺陷重现,实现了从“复现输入”到“无瑕疵修复”的本质跃迁。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ [首次在无需 3D 几何重建与相机外参的前提下解决稀疏视角姿态无关异常检测难题]
- 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 MAD-SIM、PIAD 以及 MVTec-AD、VisA 等多个主流基准,详细对比 2/4/10/All-shot 设定并提供详尽消融]
- 写作质量: ⭐⭐⭐⭐⭐ [逻辑层层递进,从 3D 重建的现实困境到 2D 掩码补全的推导清晰完整,架构设计优雅]
- 价值: ⭐⭐⭐⭐⭐ [大幅降低了工业级任意姿态缺陷检测的数据标注门槛与计算负载,极具工业落地与学术推广价值]