跳转至

GCMRD: Global Consistency Multi-teacher Robustness Distillation

会议: ECCV 2026
论文: ECCV 官方海报
领域: 模型压缩
关键词: 鲁棒性蒸馏, 对抗防御, 多教师蒸馏, 精度-鲁棒性权衡, 排斥正则化

一句话总结

针对双教师对抗鲁棒性蒸馏中教师协同不足与目标冲突导致的性能瓶颈,GCMRD 从内层最大化联合软标签攻击、全排斥负监督正则化以及自然教师对齐微调三个维度重塑蒸馏机制,显著提升了轻量级学生模型的自然精度与鲁棒性边界。

研究背景与动机

深度神经网络面对微小的对抗扰动表现出极度的脆弱性,这在自动驾驶、医疗诊断与金融系统等安全攸关场景构成了严峻的安全隐患。为了赋予网络抵御恶意攻击的能力,以对抗训练(Adversarial Training, AT)为代表的防御机制被广泛应用。然而,标准对抗训练计算开销巨大、严重依赖大容量模型参数,且直接在轻量化架构上训练时往往面临急剧的鲁棒性退化以及不可避免的“精度-鲁棒性”权衡(Accuracy-Robustness Trade-off)。为此,对抗鲁棒性蒸馏(Adversarial Robustness Distillation, ARD)应运而生,旨在通过专家策略让轻量学生模型从大容量教师模型中迁移对抗防御与干净泛化知识。从经典的 MTARD 到引入排斥正则化的 CIARD,双教师范式(自然教师负责提供干净特征、鲁棒教师提供抗攻击分布)已成为当前对抗模型压缩的主流基准。

然而,现有双教师鲁棒性蒸馏方案仍存在严重的监督信号未充分利用问题。首先,在内层对抗样本生成的最大化过程中,主流方法依然依赖硬标签交叉熵或者单一教师的 KL 散度,忽略了同时借助自然教师与鲁棒教师组合提供的软标签信息来挖掘兼顾两者的困难攻击样本。其次,针对自然教师在对抗样本上的错误预测,现有排斥机制(如 CIARD 中的 Push Regularization)仅单向推开学生的对抗特征,忽视了干净样本与这些错误模式之间的显式解耦,负监督约束不够充分。最关键的是,自然教师与鲁棒教师通常具备不同的骨干结构及完全不同的训练范式(标准经验风险最小化 vs 极大极小对抗鲁棒优化),二者在特征偏好与梯度空间上存在巨大的内在分歧与正交冲突。若在学生端直接强行拟合两个冲突的专家,会导致任务优化方向反复拉扯,制约最终 Pareto 前沿。

本文的切入角度是:必须将教师间的协作协同贯穿到对抗生成的源头、特征空间的推斥边界以及教师自身的循环演化中,使所有监督信号最终隐式锚定于一致的干净基准。核心 idea:构建全局一致性多教师鲁棒性蒸馏框架(GCMRD),通过双教师软标签联合最大化攻击、面向干净与对抗任务的双重全排斥正则化,以及以自然教师干净软预测为锚点微调鲁棒教师,实现全局协同优化。

方法详解

整体框架

GCMRD 围绕轻量学生网络 \(S\)、固定自然教师 \(T_{nat}\) 与动态鲁棒教师 \(T_{rob}\) 展开。输入样本 \(x\) 首先通过双教师生成联合对抗样本 \(x'\);随后,学生网络在干净样本 \(x\) 与对抗样本 \(x'\) 上的预测分布不仅要分别拟合对应教师的积极正监督,还要同时被推离自然教师的错误对抗预测以形成三元组式的间隔约束;最后,动态微调鲁棒教师时引入自然教师的干净软标签对齐,从而在全周期闭环中消解双任务冲突。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    In["输入干净样本 x"] --> Gen["多教师协作内层最大化 (MCIM)<br/>联合双教师软标签最大化 KL 生成 x'"]
    Gen --> S_Adv["学生网络前向计算<br/>S(x) 与 S(x')"]
    S_Adv --> Distill["双向正监督蒸馏<br/>S(x)↔Tnat(x) 与 S(x')↔Trob(x')"]
    S_Adv --> Repulsion["全排斥正则化 (FRR)<br/>S(x) 与 S(x') 同时推离 Tnat(x')"]
    Distill & Repulsion --> UpdateS["反向传播更新学生模型参数 θ_S"]
    In --> TeacherAlign["教师一致性微调 (CFT)<br/>Tnat(x) 引导微调 Trob(x) 与 Trob(x')"]
    TeacherAlign --> UpdateT["迭代更新鲁棒教师参数 θ_Trob"]

关键设计

1. 多教师协作内层最大化 (MCIM):挖掘跨教师一致的对抗难例

传统对抗样本生成通常仅最大化硬标签交叉熵,不仅容易陷入次优局部解,也忽略了暗知识所蕴含的类间结构。为此,MCIM 改为利用双教师在干净样本上的软输出加权散度作为对抗扰动的攻击目标:

\[\max_{\|x' - x\|_p \leq \epsilon} \Big( \mathcal{D}_{KL}(S(x') \parallel T_{nat}(x)) + \mathcal{D}_{KL}(S(x') \parallel T_{rob}(x)) \Big)\]

该设计的精妙之处在于:针对鲁棒教师的散度延续了软标签对抗攻击的平滑特性,而与自然教师预测的显式拉伸则迫使内层最大化主动探索对干净知识极具杀伤力的硬难样本。双教师加权驱动生成的扰动使得对抗样本同时具备针对两套表征的攻击破坏力,为外层蒸馏构筑了信息量更充沛的鲁棒训练环境。

2. 全排斥正则化 (FRR):构建三元组负监督约束边界

在面对对抗扰动时,自然教师往往会输出完全错误的置信度分布 \(T_{nat}(x')\)。CIARD 曾尝试将其作为负样本,单向推离学生的对抗输出 \(S(x')\)。GCMRD 进一步发现,仅推开对抗特征并不能保证干净流形免受错误预测吸引子的干扰。FRR 将排斥机制拓展为一个双路负监督项:

\[\mathcal{L}_{FRR} = \text{Push}(S(x'), T_{nat}(x')) + \text{Push}(S(x), T_{nat}(x'))\]

其中 \(\text{Push}(\cdot)\) 基于负向 KL 散度实现。该设计赋予了学生模型类似于度量学习中的三元组优化流形:一方面 \(T_{nat}(x)\)\(T_{rob}(x')\) 作为正锚点拉近干净与对抗分布;另一方面,\(T_{nat}(x')\) 被确立为对抗与干净输出必须共同背离的绝对负极。这种“一正一负双向钳制”促使干净任务与对抗任务在 logits 输出空间达成排斥一致性。

3. 教师一致性微调 (CFT):以自然先验化解跨模型梯度冲突

在长期蒸馏过程中,随着学生辨识力增强,固定的鲁棒教师常因对抗分布漂移而出现特征指导能力衰退。传统采用硬标签微调鲁棒教师的方式破坏了其原有的平滑边界,加剧了其与自然教师在决策偏好上的分歧。CFT 改为在训练后期以自然教师在干净样本上的软标签 \(T_{nat}(x)\) 作为统一 Oracle,联合指导鲁棒教师的微调:

\[\mathcal{L}_{rob\_teacher} = \mathcal{D}_{KL}(T_{rob}(x') \parallel T_{nat}(x)) + \mathcal{D}_{KL}(T_{rob}(x) \parallel T_{nat}(x))\]

通过将鲁棒教师在对抗样本 \(x'\) 和干净样本 \(x\) 下的预测一并约束在自然教师的干净流形附近,消除了两者架构差异与范式割裂导致的梯度正交冲突。所有学习目标直接或间接以自然教师为基准闭环,使得学生端两个任务的梯度夹角显著转向锐角协同。

损失函数 / 训练策略

学生模型的总优化损失为正向软标签蒸馏与全排斥负正则化的加权整合:

\[\mathcal{L}_{student} = \alpha \mathcal{D}_{KL}(S(x) \parallel T_{nat}(x)) + \beta \mathcal{D}_{KL}(S(x') \parallel T_{rob}(x')) - \lambda \Big( \mathcal{D}_{KL}(S(x') \parallel T_{nat}(x')) + \mathcal{D}_{KL}(S(x) \parallel T_{nat}(x')) \Big)\]

训练策略上,学生模型在 CIFAR-10/100 上训练 300 个 epoch,采用动量为 0.9 的 SGD 优化器,学习率以余弦退火从 0.1 衰减至 1e-5。鲁棒教师在前 50 个 epoch 保持冻结,后续以较小的 1e-5 学习率依据 \(\mathcal{L}_{rob\_teacher}\) 周期性更新。对抗训练样本生成采用 10 步 PGD 攻击,扰动上限 \(\epsilon = 8/255\),步长 \(2/255\)

实验关键数据

主实验

在 CIFAR-10 和 CIFAR-100 数据集上,以 ResNet-18 为学生模型(CIFAR-10 教师为 ResNet-56 与 WRN-34-10,CIFAR-100 教师为 WRN-22-6 与 WRN-70-16),评估多种典型白盒与黑盒攻击。

表 1:ResNet-18 在 CIFAR-10 与 CIFAR-100 上的白盒对抗鲁棒性(原论文 Table 2 节选)

攻击类型 防御方案 CIFAR-10 Clean (%) CIFAR-10 Robust (%) CIFAR-10 W-Robust (%) CIFAR-100 Clean (%) CIFAR-100 Robust (%) CIFAR-100 W-Robust (%)
FGSM CIARD 88.87 61.88 75.38 65.73 34.47 50.10
FGSM GCMRD (本文) 89.26 61.99 75.32 65.81 35.42 50.32
\(\text{PGD}_{SAT}\) CIARD 88.87 51.70 70.29 65.73 28.05 46.89
\(\text{PGD}_{SAT}\) GCMRD (本文) 89.26 52.84 71.05 65.81 28.84 47.33
\(\text{PGD}_{TRADES}\) CIARD 88.87 54.46 71.67 65.73 29.45 47.59
\(\text{PGD}_{TRADES}\) GCMRD (本文) 89.26 55.01 72.14 65.81 30.41 48.11
\(\text{CW}_{\infty}\) CIARD 88.87 50.61 69.74 65.73 24.43 45.08
\(\text{CW}_{\infty}\) GCMRD (本文) 89.26 51.42 70.34 65.81 25.89 45.85

消融实验

在 CIFAR-10 与 CIFAR-100 上以 ResNet-18 逐步验证各核心创新模块的贡献(原论文 Table 4 节选)。

表 2:GCMRD 各模块消融分析实验数据

配置说明 CIFAR-10 Clean CIFAR-10 \(\text{PGD}_{SAT}\) CIFAR-10 \(\text{CW}_{\infty}\) CIFAR-100 Clean CIFAR-100 \(\text{PGD}_{SAT}\) CIFAR-100 \(\text{CW}_{\infty}\)
Baseline (CIARD) 88.87% 51.70% 50.61% 65.73% 28.05% 24.43%
+ MCIM (双教师内层最大化) 86.42% 52.60% 51.30% 63.27% 28.74% 25.76%
+ FRR (全排斥正则化) 87.06% 52.75% 51.06% 64.94% 28.69% 25.72%
+ CFT (一致性教师微调) 89.37% 51.90% 50.85% 65.89% 28.10% 24.62%
GCMRD (完整方案) 89.26% 52.84% 51.42% 65.81% 28.84% 25.89%

关键发现

  • 各模块分工明确且互补:单加 MCIM 或 FRR 虽能明显抬升鲁棒性指标(如 CIFAR-10 \(\text{PGD}_{SAT}\) 分别提升至 52.60% 与 52.75%),但在缺乏全局对齐时会因攻击加剧导致干净精度下滑;CFT 的加入拉平了双教师偏好,使干净准确率回升到 89.26% 与 65.81%,实现了帕累托双赢。
  • 任务梯度冲突显著化解:梯度角余弦相似度分析显示,自然教师内部的两个任务梯度几乎正交(均值仅 0.0132),CIARD 学生端梯度相似度均值为 0.3735,而 GCMRD 学生端提升至 0.5798,说明两任务优化步调协同度大幅提升。
  • 黑盒迁移鲁棒性稳步提高:在针对 Square Attack(查询 100 次)的黑盒评估中,CIFAR-10 准确率达到 81.16%(优于 CIARD 的 80.03%),CIFAR-100 达到 50.01%(优于 CIARD 的 49.76%)。

亮点与洞察

  • 将错误预测化为双向负样本:将自然教师在对抗样本上的崩溃输出转化为干净与对抗流形共同的负排斥极,以无成本的副产物达成了强正则化效果。
  • 以自然 Oracle 实现闭环解耦:不强行在学生端生硬拉齐干净与对抗预测,而是用自然教师的干净软分布在教师端做单点锚定,巧妙绕开了多头监督的梯度冲突。
  • 对轻量级防御落地极具启发:证明了双教师模型中性能上限的瓶颈不仅在于教师容量,更在于协作协议的一致性设计,该范式可无缝拓展至视觉大模型的微调压缩。

局限与展望

  • 计算开销略有增加:MCIM 在生成对抗扰动时需要同时前向计算两个教师模型的软标签输出,相比单教师攻击增加了内层迭代的显存与计算时间。
  • 依赖高质量预训练自然教师:由于所有监督最终锚定在自然教师的干净先验上,若自然教师在复杂细粒度分类上存在系统性偏差,会导致误差级联传播。
  • 未来方向:可进一步探索动态调整各损失项权重(自适应 \(\alpha, \beta, \lambda\))的元学习策略,并将该一致性蒸馏范式推广至视觉语言大模型(VLM)的多模态越狱防护中。

相关工作与启发

  • vs MTARD: MTARD 静态固定两个专家教师并依赖损失加权机制,缺乏负监督与教师在线更新;GCMRD 引入了全排斥负监督和自适应教师微调,梯度协同度更高。
  • vs CIARD: CIARD 仅在对抗分支单侧使用 Push 损失且使用硬标签粗暴微调鲁棒教师;GCMRD 构建了干净与对抗兼顾的双向排斥,并以自然教师软标签驱动鲁棒教师柔性更新,全面优化了 trade-off。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 构思精巧地将一致性内化到生成、排斥和教师演化全流程,突破了双教师冲突难题。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 CIFAR-10/100 及 Tiny-ImageNet,白盒、黑盒及特征/梯度分析完整详实。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,图文对应清晰,动机推导与数学形式化自然顺畅。
  • 价值: ⭐⭐⭐⭐☆ 为轻量化对抗鲁棒部署提供了扎实有效的新范式。