Rethinking Adversary in Semantic Segmentation: An Out-of-Distribution Perspective¶
会议: ECCV 2026
论文: ECCV 原文
领域: 语义分割
关键词: 语义分割、对抗攻击、分布外表征、对抗训练、超像素聚类
一句话总结¶
针对传统语义分割对抗攻击仅在分布内(ID)流形切向扰动以越过决策边界的局限,SegOOD 提出通过特征级 Wasserstein 分离与面积加权 KNN 分离目标将对抗表征显式推离 ID 流形,结合混合对抗训练大幅提升了防御 ID 与 OOD 混合扰动的综合鲁棒性。
研究背景与动机¶
语义分割作为自动驾驶和高风险视觉系统的核心感知模块,其像素级预测的稳健性直接关乎系统安全。近年来以 DDC-AT、SegPGD、CosPGD、SEA 和 RPPGD 为代表的对抗训练(Adversarial Training, AT)框架显著提升了模型抵抗白盒与黑盒攻击的能力。然而,现有对抗攻击机制几乎清一色属于“预测驱动型”(prediction-driven),即优化目标纯粹以最大化被误分类的像素数量或交叉熵损失为导向。
这种范式在理论与几何表征上暴露出了致命盲区:在数据流形和特征映射的光滑性假设下,仅以最大化预测损失为目标的极小扰动 \(\delta\) 会沿着分布内(ID)特征流形的切线方向移动。也就是说,对抗扰动诱发的特征虽然跨越了类别分类面误入其他 ID 类别,但依然停留在高密度的 ID 流形浅近邻域内,无法真正脱离 ID 流形几何。这就导致当前的对抗训练模型仅仅学会了在有限的 ID 区域内修补分类边界,从未在训练阶段经历过特征严重偏离、具有低密度或不确定性特征的非典型隐空间表征。
一旦测试阶段遭遇能够引导表征发生分布外(OOD)偏移的微小扰动,现有的鲁棒模型便迅速丧失抵抗能力。本文切入角度正是打破这种预测驱动的流形局限:既然传统攻击只做流形内的切向越界,能否显式在隐空间中构建分布偏离目标,构造具备 OOD 属性的对抗样本?核心 idea:提出 SegOOD 攻击框架,通过双端降维的特征 Wasserstein 距离(FWS)与防面积稀释的加权 KNN 距离(WKS)将像素表征显式拉离 ID 语义原型,并在对抗训练中解耦结合预测驱动攻击,构建抵抗流形内外全谱攻击的鲁棒分割模型。
方法详解¶
整体框架¶
SegOOD 的攻击目标是迫使对抗特征在潜变量空间中显著偏离干净数据的 ID 语义流形,使模型输出呈现低确定性与高自由能等 OOD 特性。为解决高分辨率全图密集计算度量的计算不可行性,SegOOD 采用了一种双端特征压缩机制:干净特征端通过训练集掩码平均池化压缩为全局类别原型;对抗特征端则通过特征感知的超像素聚类(F-SLIC)降维为局部超像素原型。在每次攻击迭代中,模型综合全局分布推离(LFWS)、局域强邻推离(LWKS)以及常规预测破坏损失(Lpred)生成多步梯度更新扰动。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入图像 x 与对抗样本 x_adv"] --> B["双端特征原型压缩<br/>ID原型EMA池化 + F-SLIC超像素聚合"]
B --> C["特征 Wasserstein 分离 (FWS)<br/>全局传输推离 ID 语义原型"]
B --> D["加权 KNN 分离 (WKS)<br/>面积感知防稀释的局部硬边界推离"]
C --> E["联合目标梯度迭代<br/>融合 Lpred + LFWS + LWKS 生成 OOD 对抗样本"]
D --> E
E --> F["解耦混合对抗训练<br/>ID扰动与OOD扰动分治监督"]
关键设计¶
1. 双端特征原型压缩与特征超像素聚类(F-SLIC):化解密集流形计算爆炸
要度量全图像素特征分布 \(Q=\{g_i(x_{\text{adv}})\}\) 与干净特征分布 \(P=\{g_i(x)\}\) 之间的差异,直接计算两组包含 \(N = H \times W\) 个像素点的经验分布距离会引发高达 \(\mathcal{O}(N^3)\) 的求解复杂度。SegOOD 在干净侧采用类感知全局原型 \(p_c\),利用训练集上置信度高于阈值 \(\tau\) 的像素进行掩码平均池化(Masked Average Pooling),在训练时以动量系数 0.99 进行 EMA 更新,将干净端压缩至 \(C\) 个类别原型 \(P=\{p_1, \dots, p_C\}\)。
而在对抗侧,对抗扰动破坏了语义连贯性,直接按类别做原型均值会引入严重噪声;传统 SLIC 超像素仅依赖 RGB 像素颜色与空间距离,忽视了深层隐特征在对抗状态下与底层像素脱节的现实。为此论文提出 F-SLIC,引入特征归一化负余弦相似度 \(d_f\) 与归一化空间欧几里得坐标距离 \(d_c\) 的综合距离: $\(D_{i,j} = \sqrt{(d_f)^2 + (d_c / m)^2}\)$ 其中 \(d_f = (1 - \frac{g_i \cdot g_j}{\|g_i\| \|g_j\|}) / 2 \in [0, 1]\),参数 \(m\) 权衡特征与空间紧凑度。利用 K-means 将整图聚类为 \(C\) 个特征感知超像素簇 \(\{s_1, \dots, s_C\}\),再对其做掩码均值池化得到超像素原型 \(Q=\{q_1, \dots, q_C\}\)。此举成功将双边点集复杂度从 \(N\) 降维至类别数 \(C\)。
2. 特征 Wasserstein 分离目标(FWS):宏观全局分布流形推离
在双端压缩至大小为 \(C\) 的集合后,利用 Wasserstein 距离度量将对抗超像素表征整体搬运至 ID 原型集合的最小转移代价,以此作为攻击最大化损失: $\(\mathcal{L}_{\text{FWS}} = \min_{\pi \in \Pi(P, Q)} \left( \sum_{i=1}^C \sum_{j=1}^C \pi_{ij} \|P_i - Q_j\|_2^2 \right)^{\frac{1}{2}}\)$ 由于矩阵规模收缩为 \(C \times C\),经典的线性规划解法复杂度被急剧压缩至 \(\mathcal{O}(C^3)\)。最大化该距离可以引导对抗超像素特征在整体统计分布上脱离 ID 类别的分布质心,迫使潜在表征朝低密度自由能空间迁移。
3. 加权 K 近邻分离目标(WKS):破除均值稀释的局部流形硬约束
尽管 Wasserstein 距离实现了全局分布推离,但宏观优化允许某些局部特征仍游离吸附在特定 ID 原型边缘。常规做法是施加局部 KNN 间隔约束:对每个对抗原型 \(q_i\),计算其与最近 \(K\) 个 ID 原型的平均余弦相似度 \(d_K(q_i, P)\),并惩罚超过安全边界 \(\gamma\)(实验取 0.3)的项。但论文指出均一超像素平均存在“均一稀释偏差”(Uniform Superpixel Averaging Bias,定理 2):当图像中存在一个占据全图绝大部分面积的主导超像素时,只要众多细碎小超像素被推得极远(\(d(q_i) \to 0\)),目标函数就会被分母 \(C\) 稀释到趋近于 0,使主导区域依然滞留在 ID 流形内部。
为此,论文提出利用超像素空间像素面积 \(|s_i|\) 进行显式面积加权的局部约束: $\(\mathcal{L}_{\text{WKS}} = \frac{1}{H \times W} \sum_{i=1}^C |s_i| \cdot \max \left( 0, -\gamma + d_K(q_i, P) \right)\)$ 面积大的主导语义区域获得更强的梯度推进信号,确保大尺寸连续前景在隐空间中亦发生实质性的 OOD 逃逸。
4. 解耦混合对抗训练(Ours-Sep):表征扰动与预测扰动的互补协同
在生成对抗样本时,综合目标为 \(\mathcal{L}_{\text{total}} = \beta_1 \mathcal{L}_{\text{FWS}} + \beta_2 \mathcal{L}_{\text{WKS}} + \beta_3 \mathcal{L}_{\text{pred}}\),在 PGD 框架下进行 \(l_\infty\) 投影更新(\(\epsilon = 8/255, \alpha = 3/255\))。在对抗训练阶段,论文发现直接采用统一联合损失生成对抗样本(Ours-Co)并非最优,而采用解耦分治训练策略(Ours-Sep)效果更佳:每个训练 batch 中,50% 样本由纯预测驱动的 \(\mathcal{L}_{\text{pred}}\) 生成,负责防御近邻决策边界翻转;另外 50% 样本由纯隐空间偏离驱动的 \(\mathcal{L}_{\text{OOD}} = \mathcal{L}_{\text{FWS}} + \mathcal{L}_{\text{WKS}}\) 生成,负责强化特征编码器抵抗 OOD 流形偏离的鲁棒性。二者互补提供了双维度的稳健防御。
实验关键数据¶
主实验¶
在 Pascal VOC 和 Cityscapes 两个基准数据集上,论文评估了针对 ResNet50-based PSPNet 和 DeepLabv3 的多种白盒与黑盒攻击抗性。对抗训练配置统一为 3 步或 7 步攻击样本训练,测试阶段使用 10 步白盒攻击评估。
Pascal VOC 上 PSPNet 与 DeepLabv3 在白盒攻击下的 mIoU 表现(原论文 Table 3 截选):
| 对抗训练策略 | 网络架构 | Clean mIoU (%) | PGD 攻击 (%) | SegPGD 攻击 (%) | RPPGD 攻击 (%) | SegOOD 攻击 (%) |
|---|---|---|---|---|---|---|
| 标准模型 (N/A) | PSPNet | 76.64 | 5.21 | 2.03 | 1.76 | 1.47 |
| SegPGD3-AT | PSPNet | 75.38 | 26.60 | 27.09 | 22.78 | 19.82 |
| RPPGD3-AT | PSPNet | 75.17 | 30.25 | 28.19 | 27.14 | 13.98 |
| Ours-Sep (3 iter) | PSPNet | 74.39 | 32.54 | 30.37 | 27.03 | 30.15 |
| SegPGD7-AT | DeepLabv3 | 74.46 | 30.95 | 29.55 | 24.61 | 15.48 |
| RPPGD7-AT | DeepLabv3 | 74.01 | 33.52 | 31.47 | 33.21 | 15.34 |
| Ours-Sep (7 iter) | DeepLabv3 | 73.88 | 35.27 | 34.86 | 32.97 | 35.11 |
Pascal VOC 与 Cityscapes 黑盒迁移攻击鲁棒性(原论文 Table 5 截选,PSPNet \(\to\) DeepLabv3 攻击):
| 训练策略 | 数据集 | 源 \(\to\) 目标 | SegPGD 黑盒 (%) | RPPGD 黑盒 (%) | AdvPatch 黑盒 (%) | SegOOD 黑盒 (%) |
|---|---|---|---|---|---|---|
| SegPGD3-AT | Pascal VOC | PSPNet \(\to\) DeepLabv3 | 13.34 | 9.17 | 27.19 | 8.05 |
| RPPGD3-AT | Pascal VOC | PSPNet \(\to\) DeepLabv3 | 17.79 | 15.10 | 31.96 | 10.41 |
| Ours-Sep | Pascal VOC | PSPNet \(\to\) DeepLabv3 | 22.96 | 19.55 | 37.28 | 19.30 |
| SegPGD3-AT | Cityscapes | PSPNet \(\to\) DeepLabv3 | 20.11 | 12.55 | 23.82 | 8.18 |
| RPPGD3-AT | Cityscapes | PSPNet \(\to\) DeepLabv3 | 23.56 | 16.73 | 35.26 | 12.27 |
| Ours-Sep | Cityscapes | PSPNet \(\to\) DeepLabv3 | 25.90 | 20.70 | 35.77 | 21.73 |
消融实验¶
在 Pascal VOC 上评估对抗目标组件贡献以及对抗侧聚类算法选择对攻击破坏力的影响(测试模型为 SegPGD3-AT PSPNet 与 CosPGD3-AT DeepLabv3,攻击迭代轮数为 10,mIoU 越低代表攻击力越强,原论文 Table 1 截选):
| 攻击目标配置 | Lpred | LFWS | LWKS | SegPGD3-AT PSPNet (mIoU %) | CosPGD3-AT DeepLabv3 (mIoU %) | 说明 |
|---|---|---|---|---|---|---|
| 纯预测驱动基线 | ✓ | - | - | 26.48 | 25.88 | 传统预测攻击,特征保留在 ID 附近 |
| 预测 + 全局推离 | ✓ | ✓ | - | 22.47 | 20.68 | 引入 Wasserstein 全局分离显著掉点 |
| 预测 + 局部推离 | ✓ | - | ✓ | 24.70 | 23.55 | 局部 WKS 提供稳定增益 |
| 纯 OOD 联合推离 | - | ✓ | ✓ | 25.12 | 22.80 | 无需交叉熵驱动即具备极强攻击破坏力 |
| 全目标组合 (SegOOD) | ✓ | ✓ | ✓ | 19.82 | 16.57 | 攻击力最强,相比纯预测基线压低 ~6-9% mIoU |
| 对抗特征聚类算法 | SegPGD3-AT PSPNet (mIoU %) | CosPGD3-AT DeepLabv3 (mIoU %) | 核心表现差异与分析 |
|---|---|---|---|
| 语义原型 (Prototype) | 34.85 | 30.17 | 对抗扰动破坏语义映射,类别原型中心严重失真 |
| 标准 SLIC | 24.91 | 25.54 | 仅依凭 RGB 颜色空间聚类,无法捕获深度特征语义变化 |
| F-SLIC (本文) | 19.82 | 16.57 | 特征余弦相似度与坐标协同,兼顾结构与隐空间拓扑 |
关键发现¶
- 传统对抗训练模型(如 RPPGD-AT、SegPGD-AT)在面对常规 ID 攻击时具备较高防护力(30%+ mIoU),但遭遇 SegOOD 时性能剧烈崩塌至 13.98% - 15.48%,暴露出对 OOD 隐空间扰动的严重脆弱性。
- 解耦对抗训练策略(Ours-Sep)优于联合优化(Ours-Co):将样本分别交由预测攻击与流形推离攻击生成,能使编码器兼顾决策面锐度与全局表征流形收缩,且干净数据精度仅微弱下浮不到 1%(Pascal VOC 76.64% \(\to\) 74.39%)。
- 仅用 3 步对抗迭代训练的 Ours-Sep 模型(Pascal VOC 上 30.15% SegOOD 抗性),便全面超越了用 7 步对抗迭代训练的既有 SOTA 模型,实现了极高训练计算性价比。
亮点与洞察¶
- 重构对抗攻击的流形视角:首次从数学假设与切向扰动出发,证明了传统基于交叉熵梯度的对抗攻击为何总是局限在 ID 流形边界附近,并开创性地将 OOD 诱导机制引入稠密分割对抗生成中。
- 双端自适应聚类消解 \(\mathcal{O}(N^3)\) 传输复杂度:将全局传输理论落地于像素级密集任务的关键在于巧妙的双端降维——干净端依靠 EMA 类别原型聚合,对抗端依靠 F-SLIC 特征超像素聚合,使得复杂度直接压缩到与图像分辨率无关的 \(\mathcal{O}(C^3)\)。
- 空间加权解决超像素尺寸偏差:揭示了未加权 KNN 距离在大目标背景主导下的梯度稀释失效问题,通过像素面积加权强行压制大块目标漂移,保证了对抗特征在空间尺度上的均匀推离。
局限与展望¶
- 类别原型更新依赖干净标注:干净特征端的 EMA 类别原型严重依赖精确标注与高质量语义,在半监督、弱监督或标注受噪的复杂场景下可能导致原型漂移。
- 超像素数目固定为类别数 \(C\):为维持与类别原型 \(C\) 的对称匹配,F-SLIC 将聚类簇数强行设为 \(C\),这在复杂多元城市场景(可能包含数十个细分语义实例)下可能受限于空间分辨率粒度。
- 潜在改进方向:可进一步将隐式流形推离与神经辐射场(NeRF)或开放词表多模态模型(如 CLIP/Segment Anything)结合,检验在大模型开放域表征下的泛化攻击与鲁棒性。
相关工作与启发¶
- vs SegPGD / CosPGD: SegPGD 引入自适应区域缩放,CosPGD 引入平滑余弦准则,但二者本质上均以输出端预测误导为导向,导致隐特征依然贴合 ID 流行;SegOOD 直接在隐空间显式构建 Wasserstein 分离损失,攻击效果跨越决策面并导致预测置信度坍塌。
- vs RPPGD: RPPGD 依靠类别原型指导区域划分来强化攻击,但其原型依旧局限于常规监督分类;SegOOD 将原型视作全局排斥源,配合 F-SLIC 超像素实现全图特征的反向流形推离。
- vs 传统 OOD 检测: 传统 OOD 检测致力于在推断阶段剔除未知样本,而 SegOOD 证明对抗扰动本身就能作为 OOD 诱导器,为在紧凑表征流形内训练具备内生抗性的神经网络提供了全新切入点。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 颠覆了传统预测驱动的攻击思维,从 OOD 隐特征流形视角开辟了语义分割对抗攻防的新范式。
- 实验充分度: ⭐⭐⭐⭐⭐ 覆盖白盒、黑盒、迁移攻击、能量分布、Softmax 熵可视化及详实消融,覆盖主流架构与基准数据集。
- 写作质量: ⭐⭐⭐⭐⭐ 理论命题定义严谨,定理推导自洽,方法论逻辑与实验分析层次分明。
- 价值: ⭐⭐⭐⭐⭐ 兼顾对抗鲁棒性与 OOD 防护,零推断额外开销,为自动驾驶等高安全分割系统提供了关键防护方案。