跳转至

Don’t Teach Instability, Teach Robustness: Selective Sensitivity Gating for Adversarial Distillation

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/JingqiJi03/AEGIS
领域: 模型压缩
关键词: 对抗鲁棒性蒸馏, 知识蒸馏, 稳定性惩罚, 敏感度门控, 对抗防御

一句话总结

针对传统对抗鲁棒性蒸馏盲目对齐教师锯齿状决策边界导致“稳定性惩罚”的缺陷,提出 AEGIS 框架,通过语义分类门控与敏感度校准门控双重解耦监督,使学生模型在 CIFAR-10 AutoAttack 下取得 53.22% 的鲁棒准确率(超越 ARD 3.12%),并在 \(\epsilon=16/255\) 极端扰动下保持近 50% 的防御性能。

研究背景与动机

对抗鲁棒性蒸馏(Adversarial Robustness Distillation, ARD)是将高过参数化防御大模型的抗扰动能力迁移至端侧轻量化模型的关键技术。传统方案无论是强行对齐对抗样本下的输出软概率分布,还是拟合输入梯度景观,本质上都依赖一个核心前提:鲁棒教师模型的决策边界是一个完美的几何黄金标准。然而在真实对抗训练场景中,教师模型常因严重的鲁棒过拟合(Robust Overfitting)而在局部区域形成极为粗糙、锯齿状(jagged)的决策边界,其梯度和局部概率变化往往包含大量对扰动高度敏感的噪声。

盲目强制学生模型在局部流形上完全匹配教师,会引发一种反直觉的“稳定性惩罚”(Stability Punishment)现象。在对抗扰动下,教师模型的置信度可能发生剧烈跌落(\(|\Delta p_t| \gg 0\)),而参数受限的学生模型由于网络容量较小天然具备平滑流形隐式正则化,其预测置信度反而更稳定(\(|\Delta p_s| \approx 0\))。在标准梯度或 logits 对齐目标下,优化算法会反向迫使学生模型增大自身的局部敏感度和梯度范数,从而惩罚并摧毁学生模型原本更稳定的几何性质,将教师的不稳定敏感度噪声强制注入轻量网络。

因此,对抗蒸馏的目标亟需从全局、无条件的盲目匹配,转向细粒度差分敏感度的条件过滤。蒸馏机制不仅需要纠正类别标签预测错误,更要避免在几何梯度层面盲目照搬教师的局部不稳定缺陷。核心 idea:提出 AEGIS(对抗误差门控与不稳定抑制)框架,在分类层面利用语义逻辑门控(SLG)在教师误判时回退至稳定干净 logits,在几何层面利用敏感度校准门控(SCG)解耦目标类与非目标类的微分概率对齐,仅在教师比学生更具局部抗扰能力时施加梯度约束,彻底切断教师敏感度噪声向学生的传播。

方法详解

整体框架

AEGIS 将对抗蒸馏过程解耦为双路门控监督体系:输入对抗样本 \(x_{adv} = x + \delta\) 后,首先由语义逻辑门控(SLG)评估教师的静态预测有效性,若教师受骗则将软标签目标重定向至教师对干净图像 \(x\) 的平滑输出,防止硬分类错误蔓延;同时,敏感度校准门控(SCG)在微分概率变化空间 \(\Delta \mathbf{p} = \mathbf{p}(x+\delta) - \mathbf{p}(x)\) 中运作,拆分为目标类敏感度抑制与非目标类暗知识结构化过滤两条支路,仅在学生比教师更脆弱时才开启几何对齐。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入样本 x 与对抗样本 x_adv"] --> B["教师模型与学生模型前向推理"]
    B --> C["语义逻辑门控<br/>评估对抗预测是否命中真实标签"]
    C -->|教师正确| D1["对抗 Logits 蒸馏"]
    C -->|教师错误| D2["干净 Logits 回退蒸馏"]
    B --> E["敏感度校准门控<br/>计算微分概率变动 Δp"]
    E --> F1["目标类敏感度校准<br/>对比学生目标跌落与教师最弱边界"]
    E --> F2["非目标类结构化过滤<br/>筛选未倒挂负类保留暗知识"]
    D1 & D2 --> G["综合损失优化反向传播"]
    F1 & F2 --> G

关键设计

1. 语义逻辑门控:在预测失效时动态回退至干净暗知识

在对抗攻击下,若教师自身对 \(x_{adv}\) 产生错误分类,继续强制学生拟合其对抗输出会导致错误的伪暗知识单向扩散。传统做法要么直接丢弃该样本(导致训练信号匮乏),要么用硬标签替换(损失类别间相似性信息)。SLG 构建了动态可靠性掩码 \(G_{SLC} = \mathbb{I}(\operatorname*{argmax} f_T(x_{adv}) = y)\)。当教师预测正确时,学生严格学习其在对抗扰动下的软分类边界;当教师被攻击击溃时,SLG 触发平滑回退机制,将蒸馏目标动态切换为教师在干净输入 \(x\) 上的未受损 logits \(f_T(x)\)

\[\mathcal{L}_{SLG} = \mathbb{E}_x \left[ G_{SLC} \mathcal{L}_{KL}\big(f_S(x_{adv}), f_T(x_{adv})\big) + (1 - G_{SLC}) \mathcal{L}_{KL}\big(f_S(x_{adv}), f_T(x)\big) \right]\]

这既完全切断了分类错误的传播,又完整保留了干净教师输出中细粒度的类别拓扑结构与暗知识。

2. 目标类敏感度校准:按关键脆弱点设定容忍界限

在局部几何流形上,对抗扰动本质是将样本推向最近的决策边界,这意味着所有非目标类中概率增加最大的类别 \(k^* = \operatorname*{argmax}_{k \neq y} (\Delta \mathbf{p}_T)_k\) 直接表征了教师模型最致命的几何脆弱点。若学生在真实类别上的置信度跌落速度比教师靠近这一临界边界的变化还要剧烈,说明学生此时在几何稳定性上确实落后于教师,需要被拉回;反之,若学生本身的跌落幅度更小(甚至保持稳定不变),强行对齐教师的波动会导致学生增大局部梯度范数 \(\|\nabla \mathbf{p}_S\|_2\),沦为“稳定性惩罚”。因此,TRD 引入自适应门控 \(G_{TC} = \mathbb{I}\big( (\Delta \mathbf{p}_S)_y < (\Delta \mathbf{p}_T)_{k^*} \big)\),其损失函数定义为:

\[\mathcal{L}_{TRD} = G_{TC} \cdot \left| (\Delta \mathbf{p}_S)_y - (\Delta \mathbf{p}_T)_{k^*} \right|^2\]

当学生的局部鲁棒性优于教师设定的容忍界限时,门控自动关闭,释放学生的自主几何优化空间。

3. 非目标类结构化过滤:规避倒挂负类以纯化暗知识

非目标类别之间的相对概率分布承载了丰富的流形拓扑信息,但对抗攻击经常导致教师在某些错误类别上的置信度异常抬升甚至反超真实标签。如果盲目对齐所有非目标类的概率变动 \(\Delta p_k\),会把这类严重的流形扭曲注入学生。NTRD 设计了一个逐类别掩码向量 \(G_{NTC} \in \{0, 1\}^K\),其中第 \(k\) 类的有效判定准则为 \(G_{NTC}^{(k)} = \mathbb{I}(p_k(x_{adv}) < p_y(x_{adv})) \cdot \mathbb{I}(k \neq y)\)。仅对那些教师仍然保持置信度优势的良态非目标类计算差分对齐:

\[\mathcal{L}_{NTRD} = \frac{1}{\sum_{k \neq y} G_{NTC}^{(k)}} \sum_{k \neq y} G_{NTC}^{(k)} \left| (\Delta \mathbf{p}_S)_k - (\Delta \mathbf{p}_T)_k \right|^2\]

通过过滤掉异常高估的干扰负类,使学生模型在学习平滑类间关联时免疫几何毛刺。

损失函数 / 训练策略

整个框架采用对抗训练的双层优化(Min-Max)范式。内层最大化针对学生与教师输出的 KL 散度生成最具杀伤力的对抗扰动 \(x_{adv} = x + \delta\)(满足 \(\|\delta\|_\infty \le \epsilon\));外层最小化联合优化分类纠偏与几何校准损失:

\[\min_{\theta_S} \mathbb{E}_{(x,y)} \left[ \mathcal{L}_{SLG} + \alpha \big( \mathcal{L}_{TRD} + \beta \mathcal{L}_{NTRD} \big) \right]\]

实验确定超参数 \(\alpha = 2.0\)\(\beta = 0.7\)。值得注意的是,门控开闭比例监控显示,随着训练推进,SCG 的开启率衰减速度显著快于 SLG,说明轻量化学生模型在训练中后期其局部流形平滑性已迅速超越过拟合的大教师,门控的主动切断精准保护了学生自主习得的高阶几何鲁棒性。

实验关键数据

主实验

在 CIFAR-10 数据集上,采用 WideResNet-34-10 作为教师模型,评估 ResNet-18 与 MobileNetV2 两种典型轻量化学生在不同攻击强度(\(\epsilon = 8/255\))下的防御表现(结果为 4 次随机种子的均值):

学生模型 蒸馏方法 Clean (%) FGSM (%) PGD-10 (%) PGD-20 (%) CW2 (%) AutoAttack (AA) (%) 平均准确率 (%)
ResNet-18 ARD [AAAI 2020] 85.10 61.40 55.29 53.91 79.74 50.10 60.09
ResNet-18 IAD [ICLR 2022] 83.26 61.83 57.73 56.76 79.38 52.20 61.58
ResNet-18 AdaAD [CVPR 2023] 84.16 59.87 56.26 55.43 80.23 51.41 60.64
ResNet-18 DGAD [ECCV 2024] 85.46 61.78 57.65 56.80 81.54 52.59 62.07
ResNet-18 IGDM [ICLR 2025] 82.21 60.51 57.15 56.57 78.91 51.80 60.99
ResNet-18 AEGIS (本文) 84.69 62.66 58.68 57.89 81.16 53.22 62.72
MobileNetV2 ARD [AAAI 2020] 82.91 58.66 53.94 53.00 78.20 48.41 58.44
MobileNetV2 DGAD [ECCV 2024] 84.07 59.85 55.95 55.11 79.99 50.90 60.36
MobileNetV2 IGDM [ICLR 2025] 80.48 58.72 55.40 54.92 77.00 49.83 59.17
MobileNetV2 AEGIS (本文) 84.43 60.98 56.74 56.08 81.20 51.34 61.26

消融实验

在 CIFAR-10 上基于 ResNet-18 学生与 WideResNet-34-10 教师,逐步引入各个核心模块的消融评测(基线为 AdaAD):

配置 Clean (%) FGSM (%) PGD-10 (%) PGD-20 (%) CW2 (%) AutoAttack (AA) (%) 说明
基线 (AdaAD) 84.16 59.87 56.26 55.43 80.23 51.41 无门控自适应蒸馏基准
+ SLG 84.66 61.54 57.74 57.08 80.76 53.11 仅启用语义分类回退门控,AA 大幅提升 1.70%
+ TRD 84.82 62.39 58.63 57.66 81.14 53.09 仅启用目标类敏感度校准,抑制过拟合梯度
+ NTRD 84.76 61.54 57.84 57.13 80.88 52.96 仅启用非目标类结构过滤
+ SLG + TRD 84.57 62.40 58.38 57.55 81.13 53.35 结合语义纠偏与目标类几何门控
+ SLG + NTRD 84.97 61.60 57.80 57.12 80.96 53.13 结合语义纠偏与非目标类暗知识
完整模型 (AEGIS) 84.69 62.66 58.68 57.89 81.16 53.22 全面协同,取得最高强攻击防御与最优平均性能

关键发现

  • 各组件独立且正交的贡献:单加 SLG 可使 AutoAttack 鲁棒准确率直接跃升 1.70%,证明静态标签层面的“干净 logits 回退”对防御灾难性误判极其关键;单加 TRD 带来了对 PGD-20 达 2.23% 的增益,证实了抑制教师不稳定梯度噪声能显著强化流形平滑性。
  • 高阶扰动下的极端韧性:在压力测试中,当扰动幅度逐步扩大至 \(\epsilon = 16/255\) 时,传统 ARD 与 IGDM 的防御准确率出现断崖式崩溃(跌破 40%),而 AEGIS 仍能维持接近 50% 的准确率,展现出卓越的几何边界抗穿透能力。
  • 轻量模型适配性:在深度可分离卷积构成的 MobileNetV2 上,由于参数容量极度紧凑,传统方法极易受教师梯度噪声干扰导致几何崩溃。AEGIS 成功将 MobileNetV2 的 AA 准确率拉升至 51.34%,甚至超越了许多方法在 ResNet-18 上的表现。

亮点与洞察

  • 发现“稳定性惩罚”的数学机制:论文从理论与经验两方面证明了强行逼近教师输出会导致学生在局部流形上增大梯度范数,揭示了过参数化防御大模型的过拟合脆弱点会成为蒸馏毒药。
  • 干净 logits 回退取代样本丢弃或硬标签替换:在分类失效时利用教师的干净输出充当锚点,既避免了硬标签的信息丢失,又完全隔绝了对抗扰动激发的错误传播。
  • 可复用的差分概率门控设计:使用微分概率空间 \(\Delta \mathbf{p}\) 替代未归一化的原始 logits \(\Delta \mathbf{z}\) 进行几何约束,天然聚焦在边界不确定样本上,可直接迁移推广到多模态防御或对抗大语言模型的蒸馏任务中。

局限与展望

  • 作者指出的局限:门控虽然切断了有害梯度的传播,但在对抗扰动生成阶段(内层优化),仍依赖标准的攻击迭代,未完全考虑学生自身最薄弱攻击方向与教师攻击方向的对齐解耦。
  • 探索与改进方向:当前 \(\alpha\)\(\beta\) 仍为全局固定超参数,未来可设计随模型局部置信度或训练进程动态退火的自适应平衡因子;同时可探索将此敏感度门控拓展至扩散模型生成鲁棒性保护与视觉大模型对齐中。

相关工作与启发

  • vs ARD [Goldblum et al., AAAI 2020]: 经典 ARD 假设教师是全局无偏差的防御神谕,无条件对齐全部样本 logits;本文揭示了教师过拟合流形带来的“稳定性惩罚”,通过双层门控进行条件性选择性对齐。
  • vs DGAD [Park & Min, ECCV 2024]: DGAD 仅在标签层面执行纠偏标签交换(Label Swapping),虽然在较弱的 CW 攻击或干净精度上表现不错,但无法防范几何梯度层面的局部振荡;AEGIS 兼顾了语义分类纠偏与梯度层面的流形校准,在最严苛的 AutoAttack 下大幅领先。
  • vs IGDM [Lee et al., ICLR 2025]: IGDM 通过匹配输入梯度直接追求局部平滑度,但无视了学生比教师更平滑时的负向反作用;AEGIS 在微分概率空间引入单向门控,杜绝了教师敏感度噪声对高鲁棒学生的逆向拖累。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次揭示并严谨形式化了对抗蒸馏中的“稳定性惩罚”现象,门控解耦设计视角独特且切中要害。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 CIFAR-10/100 与 Tiny-ImageNet,包含主流轻量网络、多种高强度白盒与集成攻击,消融与极端扰动实验非常扎实。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑闭环极佳,理论推导、经验散点图与消融设计层层推进,条理清晰。
  • 价值: ⭐⭐⭐⭐⭐ 为轻量化边缘模型的鲁棒部署提供了高实用价值的即插即用技术框架。