跳转至

Improving Adversarial Robustness by Mitigating Instability through Relearning

会议: ECCV 2026
论文: ECCV 原文
领域: AI 安全
关键词: 对抗训练, 鲁棒过拟合, 鲁棒不稳定性, 重学习, 决策边界扭曲

一句话总结

针对对抗训练中后期鲁棒精度严重下降的鲁棒过拟合难题,本文首次揭示了模型跨轮次鲁棒稳定性持续恶化的反直觉现象(鲁棒不稳定性),提出基于历史多轮集成软标签的重学习对抗训练框架(RAT),在生成对抗样本与优化模型权重中引入稳定性约束,显著提升了基线对抗防御性能并消除了鲁棒过拟合。

研究背景与动机

对抗训练作为防御对抗攻击最主流且有效的手段,其本质是将经验风险最小化拓展为极大极小化博弈。然而,对抗训练普遍遭受严重的鲁棒过拟合困扰:模型在首次学习率衰减后,测试集上的鲁棒精度往往随训练轮次增加而急剧退化。传统应对过拟合的正则化策略如权重衰减、经典数据增强等不仅难以遏制这一现象,甚至效果不如提前终止(early stopping),而依赖生成模型合成海量额外数据的方法又面临极高的算力与样本生成成本。

针对该痛点,本文深入挖掘相邻训练轮次之间的模型动态,发现了一个违反直觉的现象:在经历一轮完整的对抗训练更新后,模型在完全相同的对抗样本上的分类表现反而劣于前一轮模型。作者将这一反常现象形式化为鲁棒不稳定性,并通过定义鲁棒稳定率(RSR)进行量化。理论分析与经验证据表明,常规对抗训练在不同扰动方向上呈现出非均匀的决策边界移动——模型在沿上一轮扰动方向提升鲁棒性的同时,却在当前扰动方向上恶化了判别能力,导致决策边界发生破坏性扭曲,而这种不稳定性的持续累积正是驱动鲁棒过拟合的关键诱因。

核心 idea:将对抗训练从单点记忆重构为时序连续的平滑演化,提出重学习对抗训练框架(RAT),在极大极小优化中引入历史模型集成引导的重学习软标签,形成对抗样本诱发不稳定性与模型训练强制鲁棒稳定性的全新博弈动态。

方法详解

整体框架

重学习对抗训练(RAT)在标准对抗训练的极大极小博弈中,引入了由时序历史预测聚合构成的重学习标签 \(p_i\),将单纯拟合对抗硬标签的目标转变为稳定继承历史有效防御知识的复合目标。整体流程包含三个交替推进的核心阶段:在攻击生成阶段,通过联合交叉熵与均方误差损失诱发对模型鲁棒稳定性的破坏;在模型权重更新阶段,联合优化分类精度与跨轮次软标签对齐;在轮次收尾阶段,利用当前模型的干净与对抗预测以动量机制平滑迭代重学习标签。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入数据对 (x, y) 与当前权重 θ"] --> B["阶段 1:生成不稳定诱发对抗样本<br/>联合梯度上升最大化 L_ce 与 L_mse"]
    B --> C["阶段 2:重学习模型权重优化<br/>最小化联合重学习损失 L_re 规整边界"]
    C --> D["阶段 3:动量时序集成更新<br/>融合干净与对抗预测平滑更新重学习标签 p"]
    D --> E["输出鲁棒模型权重与平滑更新历史"]

关键设计

1. 生成不稳定诱发对抗样本:在攻击阶段注入稳定性破坏目标 传统对抗样本生成仅最大化交叉熵损失以引发分类错误,忽略了决策边界在轮次更迭中的剧烈抖动。为了在极小极大博弈中显式逼出最脆弱的失稳方向,本文在内层极大化攻击中不仅要求样本跨越类别分界线,更要求其最大化偏离历史模型累积的鲁棒软知识。在生成第 \(k+1\) 步扰动时,样本在投影梯度上升中沿重学习损失的上升梯度演进:

\[ \widehat{x}_i^{k+1} = x_i + \text{clip}\left( \widehat{x}_i^k + \alpha \cdot \text{sign}\left( \nabla_{\widehat{x}_i^k} \left\{ \mathcal{L}_{ce}(f_\theta(\widehat{x}_i^k), y_i) + \omega \cdot \mathcal{L}_{mse}(f_\theta(\widehat{x}_i^k), p_i) \right\} \right) - x_i, -\epsilon, \epsilon \right) \]

该机制驱使对抗扰动主动寻找“破坏历史稳定性且导致误分类”的边界死角,为外层训练提供更具针对性的稳定化防御靶标。

2. 重学习模型权重优化:抑制决策边界剧烈重构 针对模型在轮次更新中“顾此失彼”造成的决策边界有害扭曲(在 \(\widehat{x}_{i-1}\) 处损失下降而在 \(\widehat{x}_i\) 处损失增加),外层训练不再单纯拟合对抗硬标签,而是通过重学习损失 \(\mathcal{L}_{re}\) 对输出概率分布施加平滑正则。损失函数结合了标准的交叉熵损失与对齐历史重学习标签 \(p_i\) 的均方误差约束:

\[ \mathcal{L}_{re}(\theta; \widehat{x}_i; y_i; p_i; \omega) = \mathcal{L}_{ce}(f_\theta(\widehat{x}_i), y_i) + \omega \cdot \mathcal{L}_{mse}(f_\theta(\widehat{x}_i), p_i) \]

均方误差项对预测分布的大幅突变施加二次惩罚,有效约束了跨轮次权重的更新剧烈程度,防止对个别极具攻击性的新扰动进行过激调整,从而避免了对先前轮次已有鲁棒特征的灾难性遗忘。

3. 动量时序集成更新:免除额外模型存储的多历史稳定聚合 若仅依赖上一轮单一模型权重作为监督信号,一旦某轮模型陷入局部退化,误差将在后续轮次中级联放大;然而保留所有历史模型参与反向传播在计算和显存上均不可行。本文采用基于样本维度的时序动量聚合策略,为每个样本维护一个重学习标签 \(p_i\)。在每个轮次更新后,先计算融合干净样本预测与对抗样本预测的辅助项 \(q_i = \gamma \cdot f_\theta(x_i) + (1-\gamma) \cdot f_\theta(\widehat{x}_i)\),随后通过动量系数 \(\eta\) 进行指数移动平均:

\[ p_i \leftarrow \eta \cdot p_i + (1 - \eta) \cdot q_i \]

将该递归公式展开后可知,\(p_i\) 本质上是以指数衰减权重对历史各轮次模型输出进行无偏集成,并以真实硬标签进行初始化。这一设计在完全不引入额外网络参数和梯度回传开销的前提下,构建了极度鲁棒且平滑的教师监督信号,促使决策边界平缓过渡而非颠覆性重建。

损失函数 / 训练策略

整个训练过程分为两个阶段:在初始阶段(首次学习率衰减前),由于模型尚未建立基础特征表达与鲁棒雏形,采用标准对抗训练确保模型快速掌握基础分类与对抗防御能力;在首次学习率衰减稍前阶段正式启动重学习对抗训练(RAT),重构极大极小目标:

\[ \min_\theta \sum_i \max_{\widehat{x}_i \in \mathcal{B}_\epsilon(x_i)} \left( \mathcal{L}_{ce}(f_\theta(\widehat{x}_i), y_i) + \omega \cdot \mathcal{L}_{mse}(f_\theta(\widehat{x}_i), p_i) \right) \]

采用 SGD 优化器,动量为 0.9,权重衰减为 \(5 \times 10^{-4}\),初始学习率为 0.1,并在第 100 轮和 150 轮分别衰减 10 倍。核心超参数缺省设置为动量衰减 \(\eta = 0.9\)、干净/对抗平衡因子 \(\gamma = 0.5\) 以及重学习权重 \(\omega = 30\)。

实验关键数据

主实验

在 CIFAR-10 和 CIFAR-100 数据集上,采用 ResNet-18 骨干网络,在标准 \(L_\infty\) 扰动预算(\(\epsilon = 8/255\))下对比基线对抗训练与融入重学习策略(+RE)的鲁棒表现。评估指标覆盖自然精度、PGD-20、Square Attack、CW 以及权威的 Auto Attack (AA),并汇报衡量鲁棒不稳定性的 RSR 指标(越接近 0 表明跨轮次越稳定)。

数据集 方法 自然精度 (%) PGD-20 (%) Square (%) CW (%) Auto Attack (%) RSR (%)
CIFAR-10 PGD-AT 82.40 41.40 59.97 40.98 40.74 -88.61
CIFAR-10 PGD-AT+RE 82.50 55.40 64.29 52.75 50.83 -22.80
CIFAR-10 TRADES 82.42 50.10 62.37 48.88 47.29 -100.90
CIFAR-10 TRADES+RE 82.58 54.66 63.61 51.29 49.76 -32.09
CIFAR-10 MART 82.18 48.45 60.13 45.81 43.61 -104.30
CIFAR-10 MART+RE 82.30 54.66 62.10 50.75 49.30 -29.42
CIFAR-10 AT-AWP 81.15 55.03 63.93 51.67 49.45 -45.36
CIFAR-10 AT-AWP+RE 81.18 57.23 63.19 52.74 51.23 -31.75
CIFAR-100 PGD-AT 58.08 20.81 31.14 21.15 19.69 -44.17
CIFAR-100 PGD-AT+RE 58.36 31.39 35.45 27.99 26.00 -20.66
CIFAR-100 TRADES 56.35 27.19 33.02 24.61 23.73 -56.95
CIFAR-100 TRADES+RE 58.35 30.92 35.10 26.68 25.42 -44.53
CIFAR-100 MART 55.19 24.13 30.93 22.37 21.00 -56.33
CIFAR-100 MART+RE 55.65 31.05 34.12 26.76 25.65 -29.37
CIFAR-100 AT-AWP 53.89 30.21 34.80 27.25 25.30 -15.79
CIFAR-100 AT-AWP+RE 54.88 32.11 34.61 27.75 25.87 -12.40

消融实验

在 CIFAR-10 数据集上采用 ResNet-18 骨干,系统性考察极大极小优化中重学习损失 \(\mathcal{L}_{re}\) 在不同阶段(生成对抗样本 Generate vs 训练权重 Train)的消融对比(评价指标采用 PGD-20 攻击下的最佳精度 Best、最终轮次精度 Final 以及退化量 Diff):

样本生成损失 权重训练损失 最佳精度 Best (%) 最终精度 Final (%) 性能退化 Diff (%) 说明
\(\mathcal{L}_{ce}\) \(\mathcal{L}_{ce}\) 50.70 41.40 -9.30 标准 PGD-AT 基线,严重鲁棒过拟合
\(\mathcal{L}_{ce}\) \(\mathcal{L}_{re}\) 54.49 51.58 -2.91 仅在训练阶段应用重学习,过拟合大幅缓解
\(\mathcal{L}_{re}\) \(\mathcal{L}_{ce}\) 53.70 49.08 -4.62 仅在生成阶段诱发失稳,倒逼模型鲁棒性
\(\mathcal{L}_{re}\) \(\mathcal{L}_{re}\) 56.02 55.40 -0.62 RAT 完整框架,过拟合几乎彻底消除

关键发现

  • 重学习损失的双阶段协同至关重要:仅在生成阶段或仅在训练阶段引入 \(\mathcal{L}_{re}\),性能退化分别为 -4.62% 和 -2.91%;而双阶段协同优化(RAT)将退化进一步收窄至 -0.62%,且最终鲁棒精度高达 55.40%(较基线 41.40% 绝对提升 14.00%),证明破坏失稳与强制稳定的对抗动态构成了强互补闭环。
  • RSR 与鲁棒过拟合呈显著强相关:基线 PGD-AT 在 CIFAR-10 上的 RSR 负偏高达 -88.61%,而在引入重学习机制后 RSR 迅速收敛至 -22.80%;TRADES+RE 和 MART+RE 同样使 RSR 绝对负值削减超过一半,直接印证了压制单轮更新中的判别失稳能够有效制止全局过拟合。
  • 即插即用性与跨架构普适性:重学习策略无论叠加在 PGD-AT、TRADES、MART 还是当时最佳的 AT-AWP 上,均能在保持甚至微幅提升自然精度的同时全面刷升 AA 鲁棒得分(在 AT-AWP 上于 WideResNet-34-10 上达到 61.21% 的最终鲁棒精度,Diff 仅为 -0.11%)。

亮点与洞察

  • 从微观跨轮次退化切入宏观过拟合现象:敏锐捕捉到相邻训练轮次模型在相同对抗样本上精度下滑的反直觉事实,开创性地提出了鲁棒稳定性(RSR)和鲁棒不稳定性概念,为常年机理不明的鲁棒过拟合问题提供了全新的微观动力学解释。
  • 巧用轻量时序动量集成绕过大模型教师依赖:打破了必须依赖预训练大模型或复杂蒸馏架构的传统范式,利用单模型训练轨迹中的指数移动平均低成本沉淀出高质量的历史预测软标签,不仅内存开销几乎为零,更使模型损失曲面(Loss Landscape)在主特征向量扰动下更加平坦。
  • 攻击诱发失稳与防御约束稳定的新博弈对局:重构了传统对抗训练仅依赖分类错误梯度的目标,在扰动生成中引入对抗失稳目标,训练中施加稳定恢复惩罚,形成自适应防御演化。

局限与展望

  • 引入阶段的经验性启发调度:当前策略依赖在学习率首次下降前若干轮手动介入,缺乏根据实时 RSR 监测值自动动态触发重学习机制的自适应门控机制。
  • 大模型端到端对抗微调的扩展验证尚不充分:论文主要在经典卷积架构(ResNet、WideResNet)及小型视觉 Transformer(ViT)上验证,对于更大规模多模态大模型或全参数指令微调在对抗训练中的适用性尚未深入探索。
  • 超参数敏感性权衡:动量项 \(\eta\) 与平衡权重 \(\omega\) 需针对不同网络尺寸进行微调,未来可探索自适应曲率自调节的损失加权机制。

相关工作与启发

  • vs PGD-AT (Madry et al., 2017): PGD-AT 仅使用硬标签进行静态极小极大优化,忽略了训练中后期决策边界剧烈摆动导致的严重过拟合;本文通过历史软标签重学习,在几乎不增加算力成本的前提下消除了过拟合。
  • vs FOMO (Ramkumar et al., 2024) / KD-SWA (Chen et al., 2020): 后两者依赖复杂的随机遗忘或后验权重平均,计算流程繁琐且对极端扰动适应慢;本文直接在样本级引入时序动量集成标签,平滑在线优化轨迹。
  • vs AT-AWP (Wu et al., 2020): AWP 侧重于显式扰动网络权重以平坦化损失曲面;本文与 AWP 正交互补,两者结合(AT-AWP+RE)在 CIFAR-10 上将 Auto Attack 提升至 51.23%,显示出极强的兼容量。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次提出鲁棒不稳定性的微观视界,重构了极大极小博弈的对抗动态。
  • 实验充分度: ⭐⭐⭐⭐⭐ 覆盖两大核心基准、四种主流防御基线、五种对抗攻击及损失曲面可视化,分析扎实。
  • 写作质量: ⭐⭐⭐⭐⭐ 概念界定严谨,理论推导与经验数据相互印证,行文流畅自洽。
  • 价值: ⭐⭐⭐⭐⭐ 无需额外算力与网络即插即用,显著缓解对抗训练领域长期存在的过拟合痛点。