跳转至

Robustness Meets Uncertainty: Evidential Adversarial Training for Robust Selective Classification

会议: ECCV 2026
论文: ECCV 2026
代码: https://github.com/NicolasSournac/Robustness_Meets_Uncertainty.EV-AT
领域: AI 安全
关键词: 对抗鲁棒性, 不确定性估计, 选择性分类, 证据深度学习, 对抗训练

一句话总结

针对传统对抗训练导致预测不确定性排序劣化、选择性分类失准的问题,本文提出基于狄利克雷证据表示的对抗训练框架 EV-AT,在对数浓度空间统一约束预测均值与置信度漂移,显著拓宽了鲁棒性与不确定性权衡的帕累托前沿。

研究背景与动机

在自动驾驶、医疗诊断等安全关键视觉系统中,可靠的深度分类器不仅需要在遭遇恶意输入扰动时保持稳健,更需要具备精准的「知不知」能力。为此,选择性分类机制引入了不确定性拒识策略:当模型对当前输入的预测置信度不足时,主动弃权并移交兜底安全机制。要使选择性系统在对抗环境下正常运转,核心前提是扰动诱发的错误预测必须被赋予极高的不确定性以触发拒识,而非变成高置信度的致命盲区。

然而,现有的对抗训练研究往往将评价指标局限于对抗准确率,忽视了扰动对后验不确定性结构的隐性破坏。现有 SOTA 对抗防御在提升对抗准确率的同时,极易打乱不确定性分数的排序质量。大量对抗样本虽然诱发了分类错误,模型却依然输出极度自信的后验分布,导致错误样本在常规拒识阈值下直接逃逸,引发严重的静默失效。更棘手的是,由于缺乏标准化的评测基准,不同防御策略在架构、数据增强与威胁模型上的混杂因素使得鲁棒性与不确定性之间的权衡机制长期缺乏严格分析。

面对「对抗防御提升准确率却恶化风险覆盖曲线」的核心矛盾,本文的切入点在于跳出传统的 logits 空间对齐范式,借助证据深度学习将分类决策与证据强度解耦。核心 idea:将类别输出参数化为狄利克雷后验分布,在对数浓度空间直接构建证据对抗攻击与稳健证据对齐损失,通过联合约束预测均值漂移与后验证据衰减,实现兼具高对抗准确率与保真不确定性排序的选择性分类。

方法详解

整体框架

EV-AT 将模型输出转化为狄利克雷分布的浓度参数,使网络能够同时输出预测均值与作为认知不确定性代理的证据总量。在训练过程中,针对干净样本计算证据分类损失,同时在对数参数空间内通过多步 PGD 生成最大化破坏后验证据结构的对抗样本;随后通过稳健证据对齐损失约束干净与对抗特征在对数浓度空间的一致性,配合对抗权重扰动进行联合优化。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入样本 x"] --> B["狄利克雷参数化<br/>输出证据向量与浓度 α"]
    B --> C["证据分类学习<br/>边缘似然与均匀先验正则"]
    B --> D["证据导向对抗生成<br/>对数空间 PGD 扰动生成 x_adv"]
    D --> E["稳健证据对齐<br/>对数空间 IKL 散度一致性约束"]
    C --> F["联合目标优化<br/>主干损失 + 对齐惩罚 + AWP"]
    E --> F
    F --> G["熵阈值选择性分类<br/>高不确定性输入主动拒识"]

关键设计

1. 狄利克雷参数化:解耦类别概率均值与后验置信度强度

传统分类网络直接通过 Softmax 输出类别概率向量,这种设计无法区分样本究竟是拥有充分证据指向某一类,还是处于特征缺失的模糊状态。EV-AT 引入证据深度学习范式,由主干网络预测非负证据向量 \(e_\theta(x)\),并构造狄利克雷分布浓度参数 \(\alpha = e_\theta(x) + 1\)。由此得到的预测均值 \(\bar{\pi} = \alpha / S\)(其中总浓度 \(S = \sum_{c=1}^C \alpha_c\))对应于分类概率,而总浓度 \(S\) 则充当认知不确定性的直接度量。在推理决策阶段,选择性分类系统计算预测类别的香农熵 \(u(x) = H[\text{Cat}(\bar{\pi})]\) 作为综合不确定性分数,通过判定 \(u(x) \le \tau\) 决定接受预测或触发安全拒识。

2. 对数浓度空间映射:实现乘性证据稳定与后验方差控制

如果直接在原始浓度空间 \(\alpha\) 或均值空间 \(\bar{\pi}\) 进行对抗约束,无法对证据幅度的尺度变化提供对称且数值稳定的惩罚。EV-AT 映射到对数浓度空间 \(\eta = \log \alpha\)(即伪 logits 空间),使得 \(\eta\) 的加性扰动自然对应于浓度 \(\alpha\) 的乘性缩放。理论分析证明,当对数浓度漂移满足 \(\|\eta' - \eta\|_\infty \le \rho\) 时,总浓度比值严格受限于 \(e^{-\rho} \le S'/S \le e^\rho\),预测均值相对比值也满足 \(e^{-2\rho} \le \bar{\pi}'_c / \bar{\pi}_c \le e^{2\rho}\)。同时,由于狄利克雷后验方差满足 \(\text{Var}[\pi_c] \le \frac{1}{4(S+1)}\),在对数空间施加约束能够同时紧致限定后验均值漂移与后验方差发散,从数学上保证香农熵指标在对抗攻击下的连续性与决策边界稳定性。

3. 证据导向对抗生成:针对后验证据结构的最大化扰动攻击

常规对抗训练的内层最大化目标通常是最大化交叉熵损失,仅关注翻转分类硬标签,容易诱导模型生成高置信度的错误输出。EV-AT 设计了显式针对后验证据结构的对抗生成机制。在限定的 \(\ell_p\) 范数扰动球内,攻击者以随机初始化为起点,通过多步 PGD 寻找能够最大化干净样本与对抗样本在对数参数空间散度 \(D(\eta, \eta_{\text{adv}})\) 的扰动 \(x_{\text{adv}}\)。该攻击直接考验后验分布在扰动下的保真度,迫使对抗样本暴露出证据崩溃或过度自信的薄弱区域。

4. 稳健证据对齐:基于改进 KL 散度的后验一致性约束

在外层最小化更新中,EV-AT 兼顾干净样本的拟合质量与对抗扰动下的后验一致性。干净分支采用负对数边际似然损失与均匀狄利克雷先验 KL 正则化,抑制虚假证据的生成;扰动分支则通过稳健证据对齐项 \(\mathcal{L}_{\text{REA}} = D(\eta, \eta_{\text{adv}})\) 惩罚内层找到的最坏证据漂移。EV-AT 采用改进 Kullback-Leibler(IKL)散度来实例化差异度量 \(D\),为攻击生成与对齐优化提供稳定梯度。

损失函数 / 训练策略

EV-AT 的整体训练目标由干净证据分类损失 \(\mathcal{L}_{\text{EV}}\) 与加权稳健证据对齐损失 \(\mathcal{L}_{\text{REA}}\) 构成:

\[\mathcal{L} = \mathcal{L}_{\text{EV}}(\alpha, y) + \beta \mathcal{L}_{\text{REA}}(\eta, \eta_{\text{adv}})\]

其中 \(\mathcal{L}_{\text{EV}}\) 包含基于 II 型最大似然的负对数边际狄利克雷积分以及对错误类证据施加均匀先验的 KL 惩罚项。超参数 \(\beta\) 调控干净拟合与后验对齐的权衡(实验中通常取值 60~100 附近)。此外,训练流程中引入对抗权重扰动(AWP),在网络权重空间施加扁平极小值正则化,进一步防止鲁棒过拟合并提升选择性泛化边界。

实验关键数据

主实验

论文建立了涵盖 Clean、AutoAttack(AA,\(\ell_\infty, \varepsilon=8/255\))以及常见破坏(CIFAR-10-C)的统一选择性评测基准。在 WRN-34-10 骨干网络上,对比主流基线在不同数据增强协议下的分类准确率与广义风险覆盖曲线下面积(AUGRC,越低越好):

增强方案 方法 会议/期刊 准确率: Clean (%) 准确率: AA (%) 综合准确率: Clean/AA (%) AUGRC: Clean (↓) AUGRC: AA (↓) 综合 AUGRC: Clean/AA (↓)
Basic AT ICML'18 85.11 51.63 68.37 2.79 12.32 7.56
Basic AT-AWP NeurIPS'20 85.28 53.57 69.42 2.96 11.64 7.30
Basic TRADES ICML'19 84.53 52.92 68.73 3.83 12.82 8.32
Basic TRADES-AWP NeurIPS'20 84.89 55.85 70.37 3.58 11.26 7.42
Basic IKL-AT NeurIPS'24 85.04 56.18 70.61 3.48 11.27 7.38
Basic TRADES-EMFF TPAMI'25 84.97 50.35 67.66 3.67 14.03 8.85
Basic EV-AT (本文) - 88.16 55.38 71.77 2.20 10.70 6.45
AugMix AT ICML'18 83.38 52.17 67.78 3.51 12.35 7.93
AugMix AT-AWP NeurIPS'20 81.41 52.76 67.09 4.37 12.45 8.41
AugMix TRADES ICML'19 84.06 47.71 65.88 4.06 15.64 9.85
AugMix TRADES-AWP NeurIPS'20 84.64 52.37 68.50 3.90 13.00 8.45
AugMix IKL-AT NeurIPS'24 82.85 55.38 69.11 4.65 12.27 8.46
AugMix TRADES-EMFF TPAMI'25 84.23 49.90 67.07 4.25 14.52 9.38
AugMix EV-AT (本文) - 87.10 55.93 71.52 2.78 10.73 6.75

消融实验

在 CIFAR-10 / WRN-34-10(AugMix 增强)上,对目标组成模块以及核心设计空间进行了详细消融(报告 Clean 与 AA 的平均指标):

实验模块 / 变体 考察维度 准确率: Clean/AA (%) AUGRC: Clean/AA (↓) 说明
EV-AT w/ CE 干净损失替换 69.56 7.88 干净端换用交叉熵,不确定性度量失效导致 AUGRC 恶化
EV-AT w/o REA (\(\beta=0\)) 对齐损失去除 20.11 37.67 缺失对抗证据对齐,模型在攻击下发生严重证据崩溃
EV-AT w/o AWP 权重扰动去除 68.46 8.21 缺失权重平滑性正则,鲁棒泛化与不确定性均有掉点
EV-AT (完整模型) 全配置 71.51 6.67 具备最优的鲁棒性与低选择风险
对齐空间: \(\alpha\) 空间 对齐空间选择 67.32 10.26 原始浓度空间尺度敏感,梯度不稳定
对齐空间: \(\bar{\pi}\) 均值空间 对齐空间选择 64.64 10.43 仅对齐均值丢失了总浓度 \(S\) 维度的不确定性约束
对齐空间: \(\eta = \log \alpha\) 对齐空间选择 71.51 6.67 对数空间乘性稳定,同时约束分类均值与置信度强度
散度度量: \(L_2\) 对齐损失函数 69.81 7.64 欧氏距离无法充分刻画后验分布信息几何特性
散度度量: KL 对齐损失函数 70.61 7.60 标准 KL 散度略逊于解耦的 IKL
散度度量: IKL 对齐损失函数 71.51 6.67 优化最为平稳,实现最佳综合权衡

关键发现

  • SOTA 对抗防御存在不确定性排序陷阱:在基线中,IKL-AT 和 TRADES-AWP 拥有很高的对抗准确率,但其对抗 AUGRC 反而明显恶化(如 Basic 增强下 IKL-AT 的 AA AUGRC 高达 11.27);这证明仅最大化鲁棒分类边界会诱导极端的高置信度误判。
  • 对数浓度空间对齐是核心使能机制:消融显示,若将 REA 约束转移至均值空间 \(\bar{\pi}\) 或原始浓度 \(\alpha\),AUGRC 急剧劣化至 10 以上。只有在 \(\eta = \log \alpha\) 空间约束,才能保证总浓度与概率均值的双向乘性稳定。
  • 固定风险下的覆盖率显著提升:在 5% 的严格对抗选择风险(Coverage @ 5% Risk)约束下,TRADES-AWP 仅能保留 26% 的有效预测样本,IKL-AT 为 23%,而 EV-AT 保持了更高的可用覆盖率,大幅缓解了高对抗覆盖区间的静默失效问题。

亮点与洞察

  • 将选择性拒识机制与对抗防御深度解耦重构:指出对抗安全性评测中单一依赖鲁棒准确率的盲区,首次系统论证了「准确率上升但拒识排序失真」的系统级失效风险,为安全关键分类系统确立了可靠的研究范式。
  • 对数狄利克雷伪 logits 空间的严谨理论闭环:通过 Lemma 1~3 将对数浓度空间漂移有界性传导至总证据强度 \(S\)、预测均值 \(\bar{\pi}\) 以及香农熵连续性上,为特征扰动下的拒识稳定性给出了严密的理论保证。
  • 兼顾多维防御场景与泛化性:方法不仅在 AutoAttack 与多步 PGD 攻击下保持领先,在多尺度扰动预算(\(\varepsilon \in [0, 8/255]\))以及 CIFAR-C 常见图像破坏分布偏移下,均表现出极为一致的鲁棒-不确定性帕累托优势。

局限与展望

  • 计算复杂度与内存占用:尽管对抗微调不增加前向推理开销,但在训练阶段内层 PGD 攻击需要对多类对数浓度计算高阶导数,在大规模数据集与超深骨干网络上的显存与训练耗时有待进一步轻量化。
  • 任务形式局限于单标签图像分类:目前评测主要建立在 CIFAR 系列封闭集分类上,对于目标检测中的边界框不确定性、密集语义分割以及开放词表多模态任务的扩展性尚未得到充分验证。
  • 超参数敏感区间存在窄带效应:对齐损失权重 \(\beta\) 对模型表现至关重要,若 \(\beta\) 过小无法约束证据漂移,而 \(\beta\) 过大则产生过度正则化,在实际未知威胁场景下需要细致调优。

相关工作与启发

  • vs TRADES / TRADES-AWP: TRADES 通过平衡干净准确率与 logits 空间的对抗一致性来改善权衡,但未建模预测后验方差;EV-AT 引入狄利克雷高阶后验,将一致性扩展至兼顾分类均值与证据强度的对数浓度空间。
  • vs IKL-AT: IKL-AT 提出了基于解耦 KL 的对抗训练目标以优化传统 logits 分布;EV-AT 则借鉴 IKL 散度的数值稳定性,将其创新性地应用于狄利克雷参数空间的证据漂移对齐。
  • vs 传统证据深度学习 (EDL): 原生 EDL 模型在干净数据上具备良好的不确定性校准,但在对抗扰动下脆弱易崩;EV-AT 填补了 EDL 缺乏对抗防御机制的空白,通过对数空间证据对抗训练赋予其抵抗对抗样本欺骗的强健性。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 首次将证据深度学习与对抗对齐在对数浓度空间统一,系统剖析了鲁棒选择性分类的本质矛盾。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 4 种增强、2 种架构、2 类数据集、多类威胁模型及全维度消融,对比实验严密充分。
  • 写作质量: ⭐⭐⭐⭐⭐ 理论推导清晰完备,从问题暴露、理论支撑到实验验证脉络连贯、逻辑闭环。
  • 价值: ⭐⭐⭐⭐☆ 为自动驾驶等高风险场景下的「抗攻击 + 自知其误」可靠系统落地提供了极具实用价值的全新技术路径。