跳转至

ReFP-AD: Rectified Flow Preconditioning for Energy-Based Anomaly Detection

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/CLendering/ReFP-AD
领域: 目标检测
关键词: 异常检测、能量模型、整流流、预条件化、朗之万动力学

一句话总结

针对高维视觉基础模型 Token 几何各向异性导致能量模型有限步 MCMC 采样发散的本质瓶颈,ReFP-AD 提出基于最优传输整流流的几何预条件机制,将未压缩的 1536 维特征映射至各向同性潜在空间,配合预条件随机梯度朗之万动力学与能量梯度范数评分,在统一工业异常检测基准上大幅刷新能量模型检测性能。

研究背景与动机

无监督视觉异常检测旨在仅利用无缺陷正样本训练模型,在测试阶段检出并定位形态未知的异常缺陷。随着多类别、跨材质的工业检测需求兴起,统一异常检测(Unified Anomaly Detection)要求单一网络同时适应几何、纹理各异的数十种物体类别。近年来,自监督视觉 Transformer(如 DINOv2)提取的高维稠密 Token 展现出极强的语义表征能力,大部分经典工作通过最近邻检索、内存库或子空间投影直接在预训练特征空间完成度量判决,但这本质上依赖启发式特征统计,缺乏严谨的显式生成式概率密度建模。

能量模型(EBM)通过标量能量函数赋予输入未归一化密度,在建模复杂多模态分布上具备天然的表达灵活性,因而成为异常检测的理想框架——正常样本处于能量曲面的低能低谷,异常样本则自然对应高能量状态。然而,在以 DINOv2 为代表的高维 Token 空间(例如 1536 维)中训练能量模型面临严重的动力学失稳。能量模型的最大似然训练依赖于负相位(Negative Phase)的马尔可夫链蒙特卡洛(MCMC)采样,实际应用中通常采用非平衡的有限步随机梯度朗之万动力学(SGLD)。标准朗之万采样假设底层扩散满足欧氏度量与各向同性高斯噪声,但视觉基础模型的 Token 分布呈现极度强烈的各向异性与跨维度高相关性,协方差矩阵条件数极大。这导致有限步动力学产生剧烈的“之字形”震荡与混合迟缓,负相位更新崩溃,以往 EBM 方法(如 MPDR)不得不将特征剧烈压缩至低维自编码器瓶颈(如 272 维),牺牲了细粒度定位所需的丰富语义细节。

本文的切入视角是:高维 Token 空间中能量模型训练的失稳不是网络容量或能量形式的缺陷,而是一个纯粹的几何匹配问题。既然欧氏朗之万动力学要求各向同性与良好的曲率条件,就应当在进入能量训练之前,对表征几何施加主动重参数化。核心 idea:利用最优传输耦合的整流流(Rectified Flow)构建连续时间输运映射作为几何预条件器,将高维强相关视觉 Token 映射至各向同性潜在空间,使得能量模型可在无降维约束的完整维度下通过预条件 SGLD 稳定训练,并直接基于能量曲面的恢复力梯度范数实现高精度异常检测与定位。

方法详解

整体框架

ReFP-AD 的整体流程由统一 Token 特征提取与标准化、最优传输整流流预条件化、基于 SGLD 适应度诊断的检查点优选、潜在空间无约束能量模型训练(pSGLD)以及能量曲面梯度范数推理评分五个阶段构成。

首先,输入图像经过冻结的 DINOv2 ViT-G/14 抽取多层深度特征并经逐类别 Z-score 标准化;接着,通过熵正则 Sinkhorn 最优传输耦合构建整流流速度场,将高维各向异性 Token 映射至各向同性高斯潜在空间;在训练流模型过程中,基于随机正交子空间计算谱条件数、交叉相关与重尾比率,配合拓扑保真约束选定最佳预条件检查点;随后,在良好条件的潜在空间中构建残差 MLP 能量函数,利用持久对比散度(PCD)与预条件 SGLD 稳定抽取负样本更新网络;最后,在推理阶段利用能量函数对潜在变量的反向恢复力梯度范数生成像素级缺陷图与图像级异常分数。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入图像与多层 Token 抽取<br/>DINOv2 ViT-G/14 均值池化与标准化"] --> B["最优传输整流流预条件化<br/>Sinkhorn OT 耦合与连续速度场输运"]
    B --> C["面向 SGLD 的流形验证与早停准则<br/>随机子空间谱特性评估与拓扑保真约束"]
    C --> D["预条件随机梯度朗之万动力学采样<br/>PCD 分层缓冲区与自适应对角预条件 pSGLD"]
    D --> E["能量曲面梯度范数异常评分<br/>潜在空间恢复力范数与 Top-1% 像素聚合"]
    E --> F["输出像素级异常分割图与图像级异常分数"]

关键设计

1. 最优传输整流流预条件化:以连续流变换重构采样几何

针对高维基础模型 Token 严重各向异性与大条件数导致欧氏朗之万采样剧烈震荡的痛点,该模块学习一个双射输运映射,将经验 Token 分布主动拉伸、解耦为良好条件的各向同性参考分布 \(p_{\text{prior}}(u) = \mathcal{N}(0, \tau^2 I)\),其中温度 \(\tau = 0.1\) 控制尺度缩放与收缩扩展平衡。输运过程由常微分方程(ODE)\(\dot{x}_t = v_\theta(t, x_t)\) 参数化。为避免轨迹交叉导致的输运低效,模型在数据 Token \(z \in \mathbb{R}^D\)(\(D=1536\))与高斯目标 \(u\) 之间建立基于对数域 Sinkhorn 迭代的熵正则最优传输耦合 \(\pi(z, u)\)。在时刻 \(t \in [0, 1]\) 沿直线插值路径 \(x_t = (1-t)z + tu\) 优化整流流速度网络: $$ \mathcal{L}{\text{RF}} = \mathbb{E} \left[ |v_\theta(t, x_t) - (u - z)|_2^2 \right] $$ 速度网络采用 EMA 权重维护,推理时通过 10 步四阶 Runge-Kutta(RK4)数值求解器积分完成 }[0, 1], (z, u) \sim \pi\(z \to u\) 的精确确定性坐标变换。这一几何重参数化完全解耦了表征空间调整与密度建模,不需要在网络主干中引入降维瓶颈。

2. 面向 SGLD 的流形验证与早停准则:几何诊断指导的检查点优选

针对常规整流流训练中低流匹配损失不能保证有限步朗之万动力学稳定混合、且容易过拟合甚至破坏数据流形拓扑的矛盾,本文建立了专门评估 MCMC 采样适应性的多指标几何诊断体系。由于直接对 1536 维协方差求逆存在数值不稳定性,模型将输运后的潜在变量 \(u\) 投影到固定的 \(k=128\) 维随机正交子空间中计算样本协方差矩阵 \(C\)。诊断体系综合量化三大 MCMC 核心失效模式:各向异性谱比值 \(\mathcal{P}_\kappa = \log(\lambda_{\max}(C)/\lambda_{\min}(C))\)、非对角交叉相关惩罚 \(\mathcal{P}_{\text{corr}} = \text{mean}(R_{\text{off}}^2)\),以及抑制重尾发散更新的极端分位数比率 \(\mathcal{P}_{\text{tail}} = q_{0.99}(\|u\|_2) / \text{median}(\|u\|_2)\)。将三者加权结合为全局固定的 SGLD 适应度评分: $$ \mathcal{F}(u) = \mathcal{P}\kappa + \frac{1}{2} \mathcal{P} $$ 为防止输运过程发生流形退化塌陷,模型以标准化空间与潜在空间两两距离的 Spearman 秩相关系数 }} + \frac{1}{5} \mathcal{P}_{\text{tail}\(\rho_t \ge 0.6\) 作为拓扑完整性安全门槛,仅在满足该拓扑约束的流形上通过最小化 \(\mathcal{F}(u_t)\) 动态执行早停,从而筛选出对有限步朗之万更新最为友好的特征流形。

3. 预条件随机梯度朗之万动力学采样:复杂能量曲面下的自适应负相位混合

针对跨品类统一异常检测中多模态能量曲面局部曲率剧烈变化、普通 SGLD 易出现模态塌陷与发散的问题,该设计在 PCD 架构中结合分层重放缓冲区与自适应对角预条件矩阵。维持包含 400,000 个状态的重放池,并在每批次注入 5% 来自正样本流形的分层重新初始化样本以均衡多类别模式。负样本更新过程执行 \(K\) 步自适应预条件朗之万动力学(pSGLD): $$ u_{k+1} = u_k - \frac{\eta}{2} M_k \nabla_u E_\phi(u_k) + \sigma \sqrt{\eta M_k} \, \xi_k, \quad \xi_k \sim \mathcal{N}(0, I) $$ 式中预条件矩阵 \(M_k = (\sqrt{v_k} + \epsilon)^{-1}\) 采用类似 RMSProp 的滑动二阶梯度矩更新 \(v_k = \beta v_{k-1} + (1-\beta)(\nabla_u E_\phi(u_k))^2\)。能量函数 \(E_\phi(u)\) 为 3 层残差 MLP,通过包含能量幅度正则与正样本梯度平滑惩罚的对比损失函数优化: $$ \mathcal{L}{\text{EBM}} = \mathbb{E}}[E_\phi(u)] - \mathbb{E{u^-}[E\phi(u)] + \alpha \mathbb{E}{u^\pm}[E\phi(u)^2] + \lambda \mathbb{E}{u^+}[|\nabla_u E\phi(u)|_2^2] $$ 超参数设为 \(\alpha = 0.1\)、\(\lambda = 10.0\)。自适应矩阵 \(M_k\) 抵消了局部曲率差异,使负样本仅需 20 至 40 步短链即可快速越过局部鞍点、实现高质量探索。

4. 能量曲面梯度范数异常评分:基于恢复力幅值的确定性局部偏离度量

针对传统归一化流或重构网络在分布外样本易出现虚假高似然或欺骗性完美重构的痼疾,该设计将训练好的能量曲面作为非归一化密度的严格判别面。正常样本经过流变换后聚集于能量势阱底部,局部梯度平缓;异常样本由于偏离训练分布流形,受到将其推回正常区域的显著势场恢复力。因此,单个 Patch Token 的异常度由其能量函数对输入坐标的一阶梯度模长直接给出: $$ S_{\text{patch}}(u) = |\nabla_u E_\phi(u)|_2 $$ 在推理阶段,所有 Patch 的评分映射回 2D 网格,经双线性插值上采样并施加方差 \(\sigma=4.0\) 的高斯平滑滤波生成高分辨率异常图;图像级异常分数则取平滑后像素分数最高的 Top 1% 均值,消除孤立噪声尖峰干扰。得益于预条件化构建的光滑势场,无需多轮前向扰动或昂贵重构即可获得鲁棒且尖锐的边界定位。

损失函数 / 训练策略

训练采用解耦的两阶段流程: 1. 整流流预训练阶段:在统一数据集所有正常样本 Token 上联合训练 8 层 MLP 速度网络,优化器为 Adam,学习率 \(5 \times 10^{-5}\),批大小 8192,训练至多 150 轮,应用 EMA(衰减率 0.999)。基于 \(\mathcal{F}(u)\) 指标配合容忍度 20 轮执行动态早停。 2. 能量模型训练阶段:冻结整流流检查点,使用 10 步 RK4 将 Token 积分至 \(u\) 空间。能量函数 \(E_\phi\)(3 层残差 MLP,隐藏层维度 1024)训练 15 轮,批大小 8192,Adam 初始学习率 \(10^{-5}\),权重衰减 \(10^{-5}\),在第 8、12 轮学习率衰减因子 \(\gamma=0.4\)。PCD 负采样设 \(K=60\) 步,步长 \(\eta=10^{-3}\),动量 \(\beta=0.99\),噪声标准差 \(\sigma=0.1\)。

实验关键数据

主实验

在严格统一(Unified)评估协议下,在工业异常检测主流基准 MVTec-AD(15 个类别)与 VisA(12 个类别)上进行全类别单模型统一训练与测试。对比方法涵盖统计基线模型、正规化流模型以及先进能量模型。

方法分类 模型 MVTec-AD I-AUROC (%) MVTec-AD P-AUROC (%) VisA I-AUROC (%) VisA P-AUROC (%)
基线方法 PaDiM 84.2 89.5 86.8 97.0
基线方法 MKD 81.9 84.9 74.2 93.9
基线方法 DRAEM 88.1 87.2 85.5 90.5
归一化流模型 FastFlow 91.8 96.0 77.2 95.1
归一化流模型 CFLOW 89.0 94.0 88.0 95.9
归一化流模型 HGAD 98.4 97.9 97.1 98.9
能量模型 EBM (Genc et al.) 72.0 70.7 - -
能量模型 MPDR† (稳定调优版) 96.0 96.7 86.5 96.5
本文方法 ReFP-AD (Ours) 98.6 97.9 97.3 99.0

在极具挑战的异质多类别 VisA 数据集上,相比同类能量模型代表基线 MPDR†,ReFP-AD 在图像级 AUROC 上大幅领先 +10.8%(97.3% vs. 86.5%),像素级 AUROC 达到 99.0%;在 MVTec-AD 上同样超越领先的层次化高斯流模型 HGAD,达到了 98.6% 的图像 AUROC 与 97.9% 的像素 AUROC。

消融实验

为系统分析几何预条件机制与各核心设计的有效性,论文开展了多组关键消融研究。

1. 采样几何与关键组件剥离消融(VisA 与 MVTec-AD)

实验配置 机制变动说明 MVTec-AD I-AUROC MVTec-AD P-AUROC VisA I-AUROC VisA P-AUROC
完整模型 (ReFP-AD) 完整最优传输流预条件 + pSGLD 98.6 97.9 97.3 99.0
去除流预条件 (w/o RF) 原始 1536 维各向异性 Token 直接跑 EBM 91.1 (-7.5) 95.8 (-2.1) 87.0 (-10.3) 96.6 (-2.4)
去除 SGLD 预条件 (w/o pSGLD) 使用标准无对角尺度调整的 SGLD - - 75.3 (-22.0) 94.3 (-4.7)
单类别独立训练模型 Per-Category 独立优化能量流形 99.2 (+0.6) 98.0 (+0.1) 97.7 (+0.4) 99.1 (+0.1)

2. 负采样步数 \(K\) 对动力学收敛的影响(统一 MVTec-AD)

SGLD 采样步数 (\(K\)) 图像 AUROC (%) 像素 AUROC (%) 动力学状态说明
\(K = 10\) 54.7 67.8 链条未充分探索,负样本质量极差,训练崩溃
\(K = 20\) 98.2 94.1 预条件使得流形平滑,20 步即可跨越势垒完成初步分离
\(K = 40\) 98.5 97.9 像素级定位能力完全饱和,负相位平衡建立
\(K = 80\) 98.6 97.9 性能平稳饱和,更长步数未见显著增益

3. 基础模型主干规模扩展性分析

主干特征提取器 特征维度 (\(D\)) MVTec-AD I-AUROC (%) MVTec-AD P-AUROC (%) VisA I-AUROC (%) VisA P-AUROC (%)
DINOv2 ViT-B/14 768 97.7 97.6 95.7 98.8
DINOv2 ViT-L/14 1024 97.6 97.6 96.7 98.9
DINOv2 ViT-G/14 1536 98.6 97.9 97.3 99.0

关键发现

  • 整流流预条件是高维 EBM 不发散的先决条件:去除最优传输流预条件后,VisA 的图像级指标断崖式下跌 10.3%(87.0%),MVTec-AD 下跌 7.5%(91.1%),直接证实了基础模型原始 Token 空间的强各向异性与高条件数正是阻碍有限步 MCMC 采样的物理元凶。
  • 自适应局域预条件 pSGLD 同样必不可少:在复杂多类别多模态曲面上,虽然整流流从全局上校正了特征尺度,但在局域曲率变化剧烈的能量谷底,标准 SGLD 的检测能力直接从 97.3% 暴跌至 75.3%,必须配合对角动量补偿 \(M_k\) 才能实现稳定负样本混合。
  • 有限步采样效率大幅跃升:得益于空间各向同性化,常规 EBM 需要数百步朗之万迭代才能混合的难题被彻底攻克,在 \(K=20\) 步时模型即达到了 98.2% 的图像级 AUROC,相比原始空间对采样的极端脆弱性实现了质的飞跃。
  • 统一建模与独立单类模型差距微乎其微:在单模型统一学习 12-15 种截然不同的工业外观类别分布时,ReFP-AD 相比独立为每类单独训练网络的上限仅微弱落后 0.4% 至 0.6%,证明了几何预条件化表征空间支持多模态能量拟合的广阔容量。

亮点与洞察

  • 将 EBM 训练失稳确立为几何度量失配而非模型容量问题:跳出了传统工作依赖自编码器降维瓶颈来强行稳定 MCMC 的思路,创造性地通过最优传输流在保全 1536 维全量空间语义的前提下重构度量空间。
  • 面向 MCMC 动力学的几何验证与早停机制:避免了流匹配损失与下游动力学混合质量脱节的常见陷阱,引入谱条件数与拓扑保真约束,确保预条件器精准服务于后续 Langevin 过程。
  • 可复用的高维表征 EBM 训练范式:不仅适用于工业异常检测,对于在扩散模型、多模态基础模型潜空间中构建显式能量模型、分类器引导或 OOD 检测,这种“先整流流预条件重塑空间,后施加 EBM 与 pSGLD 建模”的组合策略具有广泛的迁移参考价值。

局限与展望

  • 作者承认的推理延迟局限:推理阶段必须通过 10 步 RK4 求解 ODE 完成 Token 坐标转换,同时需对能量函数做反向传播以计算梯度范数,相比前向单步网络(如 SimpleNet)或 k-NN 查表具有更高的推理时延,更适合离线严苛质检而非超高帧率流水线。
  • 额外观察到的局限:当前模型在预处理阶段仍依赖逐类别的特征均值与方差做 Z-score 标准化,这隐含假定了测试样本具有已知的类别标签;若面对类别未知的完全开集多类别混合流水线,标准化统计量的无偏估计将面临挑战。
  • 未来改进方向:探索将预条件能量曲面知识蒸馏进轻量级前向单步评分网络,消除 ODE 数值积分与反向求导开销;同时可探索将自适应局域标准化内生到流模型网络中,迈向零类别先验的完全开集检测。

相关工作与启发

  • vs MPDR (Yoon et al., NeurIPS 2023):MPDR 同样探索 EBM 异常检测,但通过低维 CNN 自编码器瓶颈(272 维)与流形扩散恢复目标约束采样,在统一多类场景下极易数值失稳或损失定位精度;ReFP-AD 在 1536 维原始 Token 空间直接建模,通过流预条件消除各向异性,图像 AUROC 提升高达 10.8%。
  • vs HGAD (Yao et al., ECCV 2024):HGAD 采用分层高斯混合归一化流进行显式似然估计;ReFP-AD 则仅将流作为无监督几何重构工具,通过 EBM 梯度范数衡量偏离势场的恢复力,规避了纯似然估计在 OOD 区域出现高置信度假象的固有缺陷。
  • vs SimpleNet / PatchCore:此类基于判别合成噪声或特征内存库的方法虽推理迅速,但缺乏生成式概率密度基础;ReFP-AD 证明了显式概率密度模型在度量空间合理规整后同样能在多品类工业检测中达到媲美甚至超越判别式方法的顶尖性能。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次揭示基础模型 Token 的几何各向异性是 EBM 训练失稳的核心症结,提出流预条件与能量模型解耦的创新范式。
  • 实验充分度: ⭐⭐⭐⭐⭐ 在 MVTec-AD 与 VisA 严格统一协议下全面评测,涵盖步数、主干规模、预条件影响等多维度完备消融与显著定位可视化。
  • 写作质量: ⭐⭐⭐⭐⭐ 动机阐述深刻透彻,从理论诊断、几何重参数化到能量动力学链条逻辑极其清晰。
  • 价值: ⭐⭐⭐⭐⭐ 为基础模型高维潜空间中稳定训练无约束能量模型开辟了全新路径,对生成建模与 OOD 检测领域具有普适借鉴意义。