UniScale: Arbitrary-Scale Anomaly Generation¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/HUST-SLOW/UniScale
领域: 图像生成
关键词: 工业异常生成、小目标异常、扩散模型、多尺度训练、生成融合去噪
一句话总结¶
针对工业缺陷检测中真实异常样本匮乏且现有扩散模型因极端下采样导致小尺度缺陷特征严重丢失的问题,UniScale 提出了抑制插值误差的多尺度训练策略(EMT)与先生成后融合去噪策略(GFD),实现了兼顾局部精细纹理与全局位置先验的任意尺度高质量工业异常生成。
研究背景与动机¶
在现代工业制造中,表面缺陷与异常检测是保障产品良品率的关键工序。然而,在实际产线中,真实的缺陷样本天然极度匮乏,采集并标注足量且多样化的异常数据成本高昂且耗时漫长。近年来,基于扩散模型(如 AnomalyDiffusion、SeaS、DualAnoDiff 等)的工业缺陷合成方法逐渐成为缓解样本不平衡的核心途径。然而,现有方法普遍面临一个严重的系统性失效:无法真实生成微小尺度(small-scale,通常定义为小于 \(32 \times 32\) 像素)的异常。统计表明,小尺度异常在工业实际场景中极具代表性,以 VisA 数据集为例,小尺度缺陷占所有异常图像的比例高达 56.33%。
导致这一失效的核心技术瓶颈在于现代潜空间扩散模型的级联下采样压缩机制。在标准的 \(512 \times 512\) 分辨率输入下,VAE 编码器首先引入 \(8\times\) 的空间下采样,而 U-Net 内部去噪网络进一步执行空间压缩;更为关键的是,控制图文绑定的交叉注意力图通常在更低分辨率(如 \(16 \times 16\))生效,这导致相对于输入图像产生了高达 \(32\times\) 的复合下采样。对于小于 \(32 \times 32\) 像素的细微缺陷,其关键高频纹理信息在进入低维潜空间时几乎被彻底抹除或严重失真。因此,现有直接在原始全图上做微调优化的模型,其可学习文本嵌入根本无法捕捉到细微缺陷的表征,最终在推理时往往产生平滑模糊的斑块甚至生成失败。
解决该问题的直觉是裁剪局部并放大训练,但孤立的局部裁剪会破坏缺陷与产品结构之间的位置关联,而上采样插值畸变又会引入严重的伪影。本文的核心 idea 是:将细粒度局部纹理学习与宏观全局位置感知解耦为多尺度几何序列,通过引入跨尺度感知一致性约束抑制插值伪影,并在推理端采用由局部到全局的「先生成细微缺陷、后渐进对齐融合」去噪管线,彻底消除背景对微小异常的遮蔽。
方法详解¶
整体框架¶
UniScale 包含训练阶段的误差抑制多尺度训练策略(Error-Suppressed Multi-Scale Training, EMT)与推理阶段的先生成后融合去噪策略(Generation-then-Fusion Denoising, GFD)。在训练阶段,针对输入的异常样本,模型先提取缺陷最小外接正方形并以几何级数向外扩张生成多尺度裁剪图像序列,由全图(MaxSC)捕捉全局位置依赖,最小裁剪(MiniSC)保留高分辨率微小纹理,中间尺度(InterSC)平滑过渡。模型联合优化联合尺度损失(JS loss)与跨尺度感知损失(CSP loss),使共享文本嵌入既能学会位置敏感的外观,又抑制上采样引入的插值畸变。在推理阶段,给定正常底图和掩码,模型先在最小尺度下专注生成逼真的异常细节,再通过逐级下采样贴图配合轻量级条件融合去噪,逐步回填至全分辨率大图。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}, 'subGraphTitleMargin': {'top': 8, 'bottom': 16}}}%%
flowchart TD
subgraph S1["训练阶段:误差抑制多尺度训练 (EMT)"]
direction TB
A["输入真实异常图像与掩码"] --> B["多尺度几何扩张裁剪 (MSC)<br/>MaxSC / InterSC / MiniSC"]
B --> C["联合尺度扩散学习 (JS Loss)<br/>多尺度共享文本嵌入优化"]
B --> D["跨尺度感知一致性约束 (CSP Loss)<br/>逐级感知特征对齐抑制插值误差"]
end
subgraph S2["推理阶段:先生成后融合去噪 (GFD)"]
direction TB
E["输入正常底图与合成掩码"] --> F["多尺度裁剪准备<br/>构建金字塔底图与掩码"]
F --> G["最小尺度高保真异常生成<br/>50步 Blended Diffusion 专注纹理"]
G --> H["逐级像素贴片与对齐去噪<br/>缩放粘贴 + 10步融合消除边缘接缝"]
H --> I["输出全分辨率高质量异常图像"]
end
S1 -.->|优化所得文本嵌入 e| S2
关键设计¶
1. 多尺度几何扩张裁剪(MSC):兼顾宏观位置敏感与微观局部纹理
直接使用全图训练(MaxSC)能让模型通过 U-Net 的全局注意力学习到位置敏感的缺陷表观(例如裂纹在产品边缘暴露背景暗色,而在产品内部则呈现白色碎屑),但因分辨率不足导致微小缺陷特征稀释;而单纯裁剪缺陷局部(MiniSC)虽保留了丰富的微观纹理,却完全切断了与产品整体的拓扑位置关系,极易导致模型将边缘纹理错印在产品中心。为桥接两者,UniScale 引入了中间尺度裁剪(InterSC)。算法首先根据缺陷掩码的连通域计算最小外接正方形(边长为 \(l_1\))作为 MiniSC,随后以几何倍数 \(l_i = l_{i-1} \times \alpha\)(实验设定 \(\alpha=4\))围绕几何中心逐级向外扩张,直至达到全图尺度 \(S \times S\)(MaxSC)。通过将所有尺度的裁剪图像均双三次重采样至标准分辨率 \(S \times S\),构造出多尺度训练元组 \(\{(x_1^d, m_1^d), \dots, (x_n^d, m_n^d)\}\)。全尺度图像共享同一套优化中的文本嵌入 \(e\),使得文本概念能够端到端融合跨尺度的细节与语义。
2. 跨尺度感知一致性约束(CSP Loss):抑制重采样插值造成的伪特征漂移
将极小的缺陷区域通过插值强制放大到标准训练尺寸 \(S \times S\) 时,不可避免会产生模糊、锯齿和纹理畸变,如果直接让模型拟合这些失真图像,文本嵌入会学会错误的插值伪影,降低合成真实感。为此,UniScale 设计了跨尺度感知损失(CSP Loss)。在训练的前向去噪过程中,模型在当前时间步预测出噪声 \(\epsilon_\theta(z_{i,t}, t, e)\) 并单步还原出预测潜变量 \(\hat{z}_{i,0}\),再经由 VAE 解码得到各尺度的去噪预测图像 \(\hat{x}_i^d\)。对于较高分辨率的预测裁剪 \(\hat{x}_{i+1}^d\),利用对应尺度的空间比例将其缺陷中心区域重新裁剪并调整至 \(S \times S\),得到重采样预测块 \(\hat{x}_{i+1}^{cd}\)。随后借助预训练的感知特征提取网络 \(\mathcal{P}\),强行对齐相邻尺度的异常区域感知特征:
该损失与多尺度扩散重构目标 \(\mathcal{L}_{\text{JS}} = \sum_{i=1}^n m_i^d \odot \|\epsilon_i - \epsilon_\theta(z_{i,t}, t, e)\|_2^2\) 联合优化,总目标函数定义为 \(\mathcal{L} = \mathcal{L}_{\text{JS}} + \lambda \mathcal{L}_{\text{CSP}}\)(其中 \(\lambda = 0.001\))。CSP 损失强制要求跨尺度生成在感知语义上保持一致,有效过滤了单尺度插值带来的虚假高频,确保文本嵌入仅吸收真实的缺陷纹理。
3. 先生成后融合去噪(GFD):解耦缺陷构建与背景融合
传统的文本引导图像编辑方法(如常规单阶段 Blended Diffusion)在整幅图上去噪时,由于背景区域面积占据压倒性优势,全局交叉注意力机制往往被大面积的正常结构主导,细小的异常区域极易在潜空间去噪过程中被背景平滑抹除。为解决这一难题,UniScale 提出了 Generation-then-Fusion Denoising(GFD)。 在推理时,首先在待编辑正常图像上依据 Perlin 噪声生成随机缺陷掩码,并同样构建出从最小局部到全图的多尺度底图序列。生成过程分为两个阶段解耦执行: 第一阶段(异常生成):在最小尺度 \(i=1\) 下,仅针对高放大率的局部底图执行完整的 \(s=50\) 步 Blended Diffusion 迭代,在完全排除大面积背景干扰的前提下,充分激发文本嵌入引导模型生成极其清晰锐利的细粒度缺陷纹理 \(\hat{x}_1\); 第二阶段(渐进融合):对于后续每一个扩张尺度 \(i > 1\),先将前一尺度生成的缺陷图像 \(\hat{x}_{i-1}\) 与掩码按比例 \(1/\alpha\) 进行空间下采样,通过精确像素替换直接贴入当前尺度的底图 \(x_i^g\) 中;针对硬拼接可能引发的边缘接缝与光照不一致,模型仅对其施加轻度前向加噪,并在对应掩码约束下执行短暂的 \(s=10\) 步对齐去噪。这一过程沿尺度金字塔逐级向外传播,直至全图,既确保了微小缺陷的高保真呈现,又实现了与全图背景的无缝融合。
实验关键数据¶
主实验¶
论文在工业异常检测权威基准 VisA(12 个对象类)以及极具挑战性的 MVTec AD 2(8 个类别,包含纹理与物体,约 50% 为小缺陷)上进行了全面评测。评估维度包括生成样本的保真度/多样性(整体图像 IS/IC-LPIPS,异常区域局部 IS(a)/IC-LPIPS(a))以及将合成数据用于监督下游分割模型(BiSeNetV2)的下游增益。
| 数据集 | 方法 | IS ↑ | IC-LPIPS ↑ | 异常局部 IS(a) ↑ | 异常局部 IC-L(a) ↑ |
|---|---|---|---|---|---|
| VisA | DFMGAN (AAAI'23) | 1.25 | 0.25 | 1.38 | 0.05 |
| VisA | AnomalyDiffusion (AAAI'24) | 1.26 | 0.25 | 1.33 | 0.04 |
| VisA | DualAnoDiff (CVPR'25) | 1.26 | 0.25 | 1.80 | 0.06 |
| VisA | SeaS (ICCV'25) | 1.27 | 0.26 | 1.81 | 0.06 |
| VisA | UniScale (Ours) | 1.34 | 0.26 | 2.64 | 0.09 |
| MVTec AD 2 | DFMGAN (AAAI'23) | 1.39 | 0.29 | 1.04 | 0.05 |
| MVTec AD 2 | AnomalyDiffusion (AAAI'24) | 1.40 | 0.31 | 1.02 | 0.04 |
| MVTec AD 2 | DualAnoDiff (CVPR'25) | 1.46 | 0.31 | 1.19 | 0.05 |
| MVTec AD 2 | SeaS (ICCV'25) | 1.42 | 0.32 | 1.22 | 0.05 |
| MVTec AD 2 | UniScale (Ours) | 1.60 | 0.33 | 1.68 | 0.06 |
在下游异常定位评测中,使用 UniScale 生成的 1000 对图文掩码扩充训练集,在 VisA 上像素级 IoU 达到 30.15%(超越次优 SeaS 的 25.93%,绝对提升 4.22%);在更为严苛的 MVTec AD 2 数据集上,像素级 AUROC 达到 77.67%(相比次优 SeaS 的 71.12% 绝对提升 6.55%),像素级 IoU 达到 16.06%(相比 SeaS 的 12.37% 显著提升)。
消融实验¶
论文在 VisA 数据集上深入验证了核心模块有效性、尺度组合必要性、裁剪倍率 \(\alpha\) 以及去噪策略的影响。
| 变体 / 模块配置 | 局部 IS(a) ↑ | 局部 IC-L(a) ↑ | 像素 AUROC (%) ↑ | 像素 AP (%) ↑ | 像素 IoU (%) ↑ | 说明 |
|---|---|---|---|---|---|---|
| (a) 无 EMT (仅全图原始分辨率训练) | 1.84 | 0.05 | 93.72 | 30.76 | 19.04 | 缺乏多尺度局部细节,小缺陷完全无法表征 |
| (b) 无 CSP 损失 (仅 JS Loss) | 2.01 | 0.05 | 97.22 | 31.98 | 27.07 | 缺乏跨尺度感知对齐,插值伪影导致真实感不足 |
| (c) 无 GFD (单阶段全图去噪) | 2.08 | 0.05 | 96.03 | 33.62 | 27.97 | 单阶段去噪中背景主导注意力,小缺陷被大面积平滑 |
| (d) UniScale 完整模型 | 2.64 | 0.09 | 97.28 | 42.91 | 30.15 | 各组件高度协同,生成质量与检测指标均最优 |
| 去除 MaxSC (无全图尺度) | 2.58 | 0.07 | 96.03 | 33.62 | 27.97 | 失去全局位置依赖,边缘/内部缺陷表观混淆 |
| 去除 MiniSC (无极限紧凑裁剪) | 2.04 | 0.05 | 96.43 | 35.21 | 28.72 | 细微纹理丢失最严重,IS(a) 大幅暴跌 |
| 去除 InterSC (仅保留最大与最小尺度) | 2.18 | 0.05 | 93.48 | 34.17 | 29.97 | 尺度跳跃过大导致纹理与位置关系断层 |
此外,在裁剪扩张系数 \(\alpha\) 的实验中,\(\alpha=2\) 显存占用高达 24.61GB 但指标与 \(\alpha=4\) 接近;\(\alpha=8\) 与 \(\alpha=16\) 显存虽降低,但因尺度过渡断裂导致 IS(a) 分别跌至 2.55 与 2.34,验证了 \(\alpha=4\)(显存 20.86GB)为性能与开销的最优平衡点。而在 GFD 方案消融中,单纯生成后直接硬贴图(Gen + paste)由于边缘断裂导致 IoU 仅为 27.65%,仅在原图做一步融合(Gen + fusion@orig)也因缺乏多尺度上下文导致 AP 仅有 34.28%,证明逐级对齐融合必不可少。
关键发现¶
- 微小缺陷生成的致命弱点在于注意力的空间分辨率:常规单阶段扩散模型在整图去噪时,由于注意力主要在低分辨率粗网格(如 \(16 \times 16\))生效,微小目标难以获得足够显式的梯度引导;解耦为「先独立生成、后多步融合」是解决此类小目标扩散生成的通用范式。
- 中间尺度(InterSC)是位置与纹理桥接的必要链条:孤立地将极小尺度与全图混合训练并不能自动完成语义泛化,尺度间平滑的几何过渡保证了注意力机制在空间表观和局部纹理之间的连续插值。
- 感知一致性损失成功化解插值双刃剑:单纯放大图像必然引入插值模糊与人工高频,跨尺度感知对齐(CSP)巧妙地把多尺度放大转变为一种自监督一致性约束。
亮点与洞察¶
- 解耦生成与融合的推理设计(GFD):打破了端到端全图编辑的思维定式,将小缺陷生成拆解为「高倍放大局部的高保真刻画」与「多尺度金字塔级联降采样贴图融合」,从根源上杜绝了微小目标被宏观背景吞没的问题。
- 以 CSP 损失抵消图像放大带来的伪特征:针对微小目标裁剪放大不可避免带来的重采样畸变,引入跨尺度特征感知空间对齐,迫使可学习文本嵌入过滤重采样噪声,仅锚定真实的物理缺陷特征。
- 迁移潜力:该多尺度渐进式训练与去噪融合范式,可以直接迁移到遥感小目标检测生成、无人机图像微小构件缺陷合成以及医学影像微小病灶(如早期微小结节、微钙化点)的样本扩增任务中。
局限与展望¶
- 作者承认的局限:模型在训练阶段需要围绕异常连通域进行多尺度裁剪,如果单张图像内同时存在大量离散分布、尺度悬殊的多重缺陷,当前的单组连通域外接框扩张策略需要多次重叠裁剪,会带来显著的额外显存消耗。
- 自身发现的局限:目前文本嵌入微调依然依托于针对每个类别的独立优化(每个产品类别单独训练一套模型),尚未实现完全跨工业类别的 Zero-shot 统一异常扩散模型;此外,Perlin 噪声生成的掩码形态偏向几何平滑形态,对极细裂纹(如发丝纹)的几何先验模拟仍有提升空间。
- 改进思路:可结合多实例注意力解耦机制(如 MIGC),支持单图内离散多尺度缺陷的并行局部锚定与分发;同时可探索结合结构边缘引导(如 ControlNet 线稿)来提升极端微细划痕的几何真实感。
相关工作与启发¶
- vs SeaS (ICCV 2025):SeaS 采用分离与共享微调策略将背景与缺陷解耦,但在整图去噪时依然受制于全图注意力对小异常的压制;UniScale 进一步指出了极端下采样导致的细小缺陷特征丢失瓶颈,通过 EMT 多尺度几何扩张与 GFD 显式分段去噪,在小缺陷生成质量(VisA IS(a) 2.64 vs 1.81)上取得了实质性突破。
- vs AnomalyDiffusion (AAAI 2024):AnomalyDiffusion 解耦了外观与空间位置先验,但在单阶段扩散中同样无法生成微小划痕;UniScale 证明了仅靠位置先验无法对抗潜空间极端下采样,必须通过物理尺度的金字塔裁剪与自感知一致性约束来强制保留高频细节。
- vs Text2Traffic / SOEDiff (小目标编辑工作):先前的小目标编辑工作虽尝试联合训练局部放大块,但普遍忽略了放大重采样所引入的人工插值失真;UniScale 首次通过 CSP 损失约束跨尺度生成一致性,系统性解决了插值失真污染文本嵌入的隐患。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ [敏锐指出工业异常生成中微小缺陷丢失的本质原因,提出的 EMT 与 GFD 逻辑严密且高度实用]
- 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 VisA 与 MVTec AD 2,指标涵盖生成质量、多样性及下游分割/检测增益,消融实验异常扎实]
- 写作质量: ⭐⭐⭐⭐⭐ [动机明确,图文对照严谨,公式与多尺度算法细节交代详尽]
- 价值: ⭐⭐⭐⭐⭐ [直击工业表面缺陷检测真实痛点,代码开源且下游检测提升显著,具备极强的产线落地价值]