跳转至

HLRAD: High-dimensional Latent Representation for Unified Anomaly Detection

会议: ECCV 2026
论文: ECCV 原文
PDF: ECCV PDF
代码: https://github.com/xxx
领域: 目标检测
关键词: 统一无监督异常检测、高维隐表示、扩散 Transformer、选择性门控融合、维度扩展

一句话总结

HLRAD 针对多类别统一无监督异常检测,颠覆了传统低维隐空间压缩重构范式,通过扩散 Transformer 提取高维语义特征并结合升维投影 MLP 与宽隐空间解码器,在阻断恒等映射捷径的同时杜绝压缩信息损失,在 MVTec-AD、VisA 和 Real-IAD 等工业基准上刷新了像素级异常定位 SOTA。

研究背景与动机

无监督工业异常检测旨在仅利用正常样本进行建模,并在推理阶段精确识别并分割出偏离正常分布的各类缺陷。随着工业智能制造质检场景对可扩展性的严苛要求,传统为每个产品类别单独训练独立模型的单类别范式(Class-separated)因高昂的训练与维护成本逐渐被统一多类别异常检测(Unified Anomaly Detection)所取代。然而,在单一模型跨多类别重建的统一设定下,现有方法长期面临两大根本性困境:其一是捷径学习(Shortcut Learning)或恒等映射问题,模型倾向于学到直接拷贝输入的捷径通道,导致推理时异常缺陷也被无损复现;其二是表示空间的语义保真度匮乏,先前以 DiAD、HVQ-Trans 和 PMAD 为代表的方法普遍依赖连续或离散 Tokenizer 将输入强行压缩至极低维的隐空间,这不可避免地抹除了微弱而关键的局部纹理与细粒度几何细节,导致解码器无法准确重建正常的细长裂纹、划痕或边界结构。

即使是采用预训练骨干网络(如 ViTAD、Dinomaly)避免显式压缩的方法,也将解码器严格受限在预训练特征固有的原始维度空间(如 \(d_t=1024\))内。此外,预训练骨干通常在大规模自然图像上自监督学习,迁移到分布截然不同的工业纹理与零部件时容易产生系统性特征漂移,在跨类别统一重建时极易出现类别混淆与模糊退化。以往研究往往默认低维隐空间是生成模型产生编辑性的必要前提,但本文指出:隐空间的降维压缩并不是异常检测的必要约束,过度压缩带来的信息瓶颈才是限制重建精细度的真正根源。只要能够有效阻断输入到输出的恒等映射通道,解码器工作在高维空间反而能获得更强大的多类别多模态分布拟合能力。

基于这一洞见,本文反其道而行之,系统性探索了无低维压缩的“隐空间升维”新范式。核心 idea:摒弃低维隐空间压缩,通过冻结的扩散 Transformer 提取高维语义先验,借助注意力显著性选择性融合高维语义与原始纹理特征,并通过升维 MLP 与宽解码器在更高维隐空间中进行特征重建,彻底消除压缩信息损失并以随机扰动阻断捷径学习。

方法详解

整体框架

HLRAD 的整体架构围绕“高维语义提取 → 显著性门控融合 → 升维投影与宽空间解码 → 反向蒸馏异常评分”四阶流水线展开。输入工业图像首先通过冻结的 DINOv3-ViT-L 提取多层局部 Patch 特征;随后并行输入冻结的高维扩散 Transformer 编码器(DiT Encoder),在更高维度上重编码全局结构语义;接着利用主干最后一层的自注意力权重筛选出结构显著 Patch,通过自适应门控将高维语义特征注入到局部特征中;融合后的特征经由带有三重 Dropout 扰动的升维 MLP 投影至更宽的解码隐空间(\(d_d = 2048\)),由浅而宽的 Transformer 解码器重构多层目标特征;最后基于多层特征的余弦距离计算稠密像素级异常热力图与图像级异常评分。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入图像与多层特征抽取<br/>DINOv3-ViT-L 多层特征抽取与分组"] --> B["扩散 Transformer 隐式语义分支<br/>高维语义空间重编码与领域漂移消除"]
    A --> C["显著性导向的选择性门控融合<br/>注意力显著图引导的通道自适应融合"]
    B --> C
    C --> D["升维映射与高维隐空间解码<br/>三重 Dropout 升维 MLP + 宽隐空间重建"]
    D --> E["反向蒸馏余弦距离度量<br/>像素级与图像级异常定位与评分"]

关键设计

1. 扩散 Transformer 隐式语义分支:引入高维去噪先验破除工业领域特征漂移

针对预训练视觉编码器在工业领域面临的特征漂移以及单层特征语义表达受限的问题,HLRAD 引入了一个基于 Representation Autoencoders (RAE) 预训练的扩散 Transformer 编码器(DiT Encoder,深度 \(D_e=28\),隐层维度 \(d_s=1152\))。将主干抽取的特征 \(\bar{\mathbf{F}} \in \mathbb{R}^{N \times d_t}\) 通过可学习的升维线性层 \(\phi_{\text{in}}\) 映射到 DiT 的高维潜空间中,与正弦绝对位置编码 \(\mathbf{E}_{\text{pos}}\) 叠加后送入 28 层冻结的 DiT 模块,各模块内部采用旋转位置编码(RoPE)以及无条件可学习嵌入 \(\mathbf{c} \in \mathbb{R}^{d_s}\) 调制:

\[\mathbf{S}_e^{(0)} = \phi_{\text{in}}(\bar{\mathbf{F}}) + \mathbf{E}_{\text{pos}} \in \mathbb{R}^{N \times d_s}, \quad \mathbf{S}_e^{(j)} = \mathcal{B}_j(\mathbf{S}_e^{(j-1)}, \mathbf{c})\]

最终由降维线性层 \(\phi_{\text{out}}\) 将隐状态重新映射回主干特征维度 \(d_t\) 得到语义特征 \(\mathbf{S} \in \mathbb{R}^{N \times d_t}\)。整个 DiT 模块权重保持严格冻结,仅训练投影层与条件嵌入。该设计的精妙之处在于:一方面,DiT 工作维度 \(d_s > d_t\) 提供了比原始特征空间更庞大的信息容量,能够有效捕捉跨类别共存的深层分层语义结构;另一方面,DiT 在预训练阶段作为生成式去噪主干构建,天生具备对输入扰动的高鲁棒性,能够把工业领域样本与自然图像之间的域差异视作输入噪声进行抑制,显著提升了多类别无监督特征的泛化与稳定表达。

2. 显著性导向的选择性门控融合:按注意力显著性动态注入高维语义同时保留局部纹理

高维语义特征 \(\mathbf{S}\) 拥有丰富的全局结构关系与类别级先验,而原始特征 \(\bar{\mathbf{F}}\) 则忠实记录了像素邻域的高频局部纹理与边界形态。在工业异常检测中,若盲目用高维语义在所有位置替换原始特征,会导致对微弱孔洞、表面划痕等极度依赖细微纹理异常的漏检;反之若完全不引入高维语义,则难以识别物体结构错位或大部件缺失等全局语义异常。为此,SGF 模块从主干提取目标层的多头自注意力权重 \(\mathbf{A} \in \mathbb{R}^{N_h \times N \times N}\),对头维度平均计算每个 Patch 的全局注意力显著性得分 \(\alpha_i = \frac{1}{N_h} \sum_{h=1}^{N_h} \mathbf{A}^{(h)}[i]\)。显著性高的区域天然对应前景物体轮廓、关键结构构件与语义边界。

训练阶段,模型从区间 \([0, r_{\max}]\)(默认 \(r_{\max}=0.5\))均匀随机采样门控比例 \(r\),选取显著性最高的前 \(k = \lfloor r \cdot N \rfloor\) 个 Patch 构成选择集合 \(\mathcal{K}\)。对选中位置 \(i \in \mathcal{K}\),将两路特征通道拼接后通过可学习的仿射层与 Sigmoid 激活生成通道门控权重向量 \(\mathbf{g}_i \in [0, 1]^{d_t}\):

\[\mathbf{g}_i = \sigma(\mathbf{W}_g [\bar{\mathbf{F}}_i \,\|\, \mathbf{S}_i] + \mathbf{b}_g), \quad \hat{\mathbf{F}}_i = \begin{cases} (1 - \mathbf{g}_i) \odot \bar{\mathbf{F}}_i + \mathbf{g}_i \odot \mathbf{S}_i, & i \in \mathcal{K} \\ \bar{\mathbf{F}}_i, & i \notin \mathcal{K} \end{cases}\]

非显著区域(如背景纯色、平滑纹理基底)保持原始特征输入不变,彻底消除了全局语义对局部纯纹理的干扰。同时,随机采样门控比率 \(r\) 构成了结构化正则,强制解码器在语义增强与局部纹理交替暴露下学习健壮的正常重构模式,防止过拟合于某单一特征流。

3. 升维映射与高维隐空间解码:打破低维压缩瓶颈并通过扰动阻断恒等映射捷径

为了打破传统解码器维度上限并彻底杜绝低维信息瓶颈,HLRAD 采用了“升维 MLP + 宽解码器”的协同架构。融合特征 \(\hat{\mathbf{F}} \in \mathbb{R}^{N \times d_t}\) 在进入解码器之前,首先经过一个带有三重 Dropout 的两层升维 MLP,将其通道从 \(d_t=1024\) 剧烈扩展到 \(d_d=2048\)(隐藏层宽度高达 \(4d_d=8192\)):

\[\mathbf{H} = \text{Drop}_p\left( \mathbf{W}_2 \cdot \text{GELU}\left(\text{Drop}_p\left(\mathbf{W}_1 \cdot \text{Drop}_p(\hat{\mathbf{F}})\right)\right) \right) \in \mathbb{R}^{N \times d_d}\]

其中前置、激活后、后置的三重 Dropout 扰动(丢弃率 \(p=0.3 \sim 0.4\))在空间维度彻底打散连续特征流,切断了输入到解码端的直接通道复制路径,迫使解码器必须依赖学到的正常多类别高维分布模板完成修复。紧接着,由 \(D_d=8\) 层 Transformer 块构成的浅而宽的高维解码器在 \(d_d=2048\) 的宽裕通道下高效进行交叉模式推理与非线性还原,且在多头自注意力中引入概率为 \(p_h=0.1\) 的 DropHead 机制,阻断注意力头间的共适应。解码器在多层特征汇聚后通过线性层投影回 \(d_t\) 维度并施加 LayerNorm,与停止梯度的教师多层特征对齐。

损失函数 / 训练策略

模型采用反向蒸馏(Reverse Distillation)对齐范式,选取 DINOv3 主干中 8 个等间距层 \(\{4, 6, 8, 10, 12, 14, 16, 18\}\) 的特征,按深度分为 2 组进行特征聚合。训练损失为解码器投影输出与教师冻结特征之间的全局余弦距离损失:

\[\mathcal{L} = 1 - \frac{1}{|\mathcal{G}| \cdot N} \sum_{g \in \mathcal{G}} \sum_{i=1}^N \frac{\tilde{\mathbf{F}}_{g, i}^{\text{dec}} \cdot \bar{\mathbf{F}}_{g, i}^{\text{tea}}}{\|\tilde{\mathbf{F}}_{g, i}^{\text{dec}}\|_2 \|\bar{\mathbf{F}}_{g, i}^{\text{tea}}\|_2}\]

教师端施加 stop-gradient 阻断梯度反传。模型使用 AdamW 优化器(带 AMSGrad)与余弦衰减学习率调度,最大学习率 \(2 \times 10^{-4}\),在 8 张 NVIDIA A100 GPU 上统一训练 20,000 步。推理时,每个 Patch 位置的多层余弦距离直接作为异常响应,经双线性插值上采样恢复至原始图像分辨率生成异常分割图,取全图最大响应作为图像级异常评分。

实验关键数据

主实验

在统一无监督设置下,模型在经典的工业质检基准 MVTec-AD、VisA 以及规模宏大的多视角复杂基准 Real-IAD 上进行了全面评测,对比涵盖了基于特征蒸馏、扩散重构、状态空间模型和原型匹配的前沿 SOTA 方法。

数据集 指标 HLRAD (本文) 次优 SOTA (方法) 优势提升
MVTec-AD Image-AUROC 99.7 99.7 (INP-Former) 持平 / 领先
Image-AP 99.9 99.9 (INP-Former) 持平
Image-F1max 99.3 99.2 (INP-Former) +0.1%
Pixel-AUROC 98.6 98.5 (INP-Former) +0.1%
Pixel-AP 71.3 71.0 (INP-Former) +0.3%
Pixel-F1max 70.7 69.7 (INP-Former) +1.0%
VisA Image-AUROC 99.0 98.9 (INP-Former) +0.1%
Image-AP 99.0 99.0 (INP-Former) 持平
Image-F1max 96.6 96.6 (INP-Former) 持平
Pixel-AUROC 99.1 98.9 (INP-Former) +0.2%
Pixel-AP 55.5 53.2 (Dinomaly) +2.3%
Pixel-F1max 57.5 55.7 (Dinomaly) +1.8%
Real-IAD Image-AUROC 90.1 90.5 (INP-Former) -0.4%
Image-AP 87.5 88.1 (INP-Former) -0.6%
Image-F1max 81.1 81.5 (INP-Former) -0.4%
Pixel-AUROC 99.0 99.0 (INP-Former) 持平
Pixel-AP 47.7 47.5 (INP-Former) +0.2%
Pixel-F1max 50.5 50.3 (INP-Former) +0.2%

消融实验

1. 核心模块逐项消融验证 (MVTec-AD 与 VisA 综合评估) 检验语义编码器(Senc)、选择性门控融合(SGF)、升维投影 MLP(DM)与高维解码器(HD)的累加贡献:

实验配置 Senc SGF DM HD MVTec P-AP MVTec P-F1max VisA P-AP VisA P-F1max 说明
Baseline - - - - 69.3 69.2 53.2 55.7 原始维度原生重构基线
+ Senc ✓ - - - 70.4 69.9 54.0 56.5 引入高维 DiT 语义先验,P-AP 显著改善
+ Senc + DM ✓ - ✓ - 71.0 70.2 54.7 56.7 升维 MLP 及三重 Dropout 阻断恒等捷径
+ Senc + DM + HD ✓ - ✓ ✓ 71.2 70.5 55.3 57.2 宽解码器拓展通道容量 (\(d_d=2048\))
+ Senc + SGF + DM ✓ ✓ ✓ - 71.0 70.3 55.1 57.1 门控融合优化局部特征与语义注入平衡
Full HLRAD ✓ ✓ ✓ ✓ 71.3 70.7 55.5 57.5 四大组件协同,获得最优像素级指标

2. Tokenizer 表达保真度对比 (MVTec-AD 训练集正常样本重建误差) 为了直接验证升维范式是否优于低维压缩 Tokenizer,作者将升维 Tokenizer 与 DiAD 官方微调的连续 VAE Tokenizer 在相同空间分辨率下进行了重建损失横向比对:

重构损失类型 DiAD VAE Tokenizer (低维压缩) HLRAD 升维 Tokenizer (本文) 误差相对下降幅度
L1 Loss 0.0633 0.0213 -66.4%
L2 Loss 0.0100 0.0010 -90.0%
余弦距离 (Cosine Distance) 0.0280 0.0023 -91.8%

关键发现

  • 高维空间的像素级定位优势显著:HLRAD 在 MVTec-AD 上将 Pixel-F1max 提升到 70.7(相比次优提升 1.0%),在更富挑战性的 VisA 上将 Pixel-AP 显著提升 2.3%(达到 55.5%)。消融实验显示,单是把解码空间维度 \(d_d\) 从 768 拓展至 2048,VisA 的 Pixel-AP 就从 53.5% 单调递增至 55.5%,证明高维隐空间提供了充裕的几何与语义容量,大幅减少了由于低维降维丢失边缘细节导致的误判与边缘毛糙。
  • Tokenizer 重构损失骤降 90% 以上:在单样本正常重构保真度评测中,HLRAD 相比 DiAD 的连续 VAE Tokenizer,L2 误差下降 90.0%,余弦距离误差下降 91.8%,充分证明“降维压缩”过去作为异常检测生成式框架的标准前提并不成立,升维重构不仅能保留细粒度纹理,还能以更低偏差逼近真实正常分布。
  • 冻结优于微调,DiT 优于 CLIP:在语义编码器探索实验中,冻结 DiT 表现全面压制可微调 DiT 和 CLIP(MVTec Pixel-AP 达到 71.3 vs 可微调的 70.9,以及 CLIP 冻结的 69.8)。微调会导致语义编码器与解码器发生共适应(Co-adaptation),丧失作为独立语义瓶颈的能力;而 DiT 得益于生成式去噪预训练,对跨域工业特征分布偏移具备天然免疫力。

亮点与洞察

  • 反传统直觉的“升维重构”范式创新:过去异常检测普遍将自编码器的低维 Bottleneck 奉为金科玉律,认为降维是模型获得泛化与异常剔除能力的唯一手段;HLRAD 首次系统论证了升维不仅可行,且能以无损保真度大幅提升多类别统一检测的重构质量。
  • 高维语义与局部纹理的“显著性门控解耦”:通过注意力图自适应锁定显著语义区域进行高维特征注入,平滑低显著区域保留局部原始纹理,兼顾了微观表面缺陷(依赖细微纹理)与宏观结构缺失(依赖全局语义)的检测。
  • 三重扰动构建非接触式泛化防护墙:通过升维 MLP 的三段 Dropout 结合注意力层 DropHead,在不牺牲维度容量的前提下彻底斩断特征捷径复制,既享受了宽网络的强拟合力,又保证了异常样本在推理时的剧烈重构发散。

局限与展望

  • 类别剧烈增多时的图像级判别瓶颈:在包含 30 个复杂工业物体、11 万测试样本的 Real-IAD 上,HLRAD 的图像级指标(I-AUROC 90.1 / I-AP 87.5)略逊于 INP-Former(90.5 / 88.1)。作者坦承,当类别多样性急剧扩张时,单一模型对不同物体复杂正常模式的高维语义分布建模难度加大,容易对部分稀有正常视角模式欠拟合,导致全图级别置信度波动。
  • 高维解码器的显存与计算开销:解码空间宽度扩大至 \(d_d=2048\),且升维 MLP 中间层通道膨胀至 8192,虽然采用了相对浅层的 Transformer,但在面对高帧率实时在线质检流水线时,显存峰值与延迟相比轻量蒸馏方案仍有优化空间。
  • 未来方向:探索针对超大规模类别池的动态条件高维语义调制(如类别原型或轻量级视觉提示引流),在保持像素级无损定位精度的同时强化全局图像级判别鲁棒性。

相关工作与启发

  • vs Dinomaly / ViTAD: 后两者探索了直接在冻结视觉主干特征上做反向重构,但仍束缚于预训练主干的固定固有维度(\(d_t=1024\)),且缺乏工业领域特征漂移补偿机制;HLRAD 通过 DiT 语义分支引入去噪先验,并主动将解码空间升维至 2048,使 VisA 的 Pixel-AP 相比 Dinomaly 跃升 2.3%。
  • vs DiAD / HVQ-Trans: 这类方法采用连续 VAE 或离散 VQ Codebook 进行隐空间压缩以追求生成编辑性,但代价是造成高达 90% 以上的不可逆重建误差,造成细微缺陷定位发散;HLRAD 证明了通过升维加随机扰动同样能破除捷径,且重构保真度大幅提高。
  • vs INP-Former: INP-Former 聚焦于从单张图像内部提取内生正常原型来解决跨类混淆,偏向于图像级判别;HLRAD 则从隐表示空间拓扑容量的根本维度切入,在像素级缺陷定位精度与边界贴合度(Pixel-F1max / AP)上更具优势。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ [打破了异常检测必须在低维压缩瓶颈中重构的固有认知,首次验证了升维表示在统一异常检测中的显著优越性]
  • 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 MVTec-AD、VisA 及 Real-IAD 三大主流基准,详细做了 Tokenizer 保真度损失量化与各模块逐层消融]
  • 写作质量: ⭐⭐⭐⭐⭐ [动机叙述逻辑紧密,架构与设计点层层递进,消融对比与机制阐释极为详实透彻]
  • 价值: ⭐⭐⭐⭐⭐ [为多类别工业异常检测及无监督特征重建任务提供了全新的维度设计范式,工程应用与理论启发意义巨大]