跳转至

Rethink Backdoor Robustness in Vision Transformers

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/PKU-ML/ViT_backdoor
领域: AI 安全
关键词: 视觉Transformer, 后门攻击, 后门防御, 通道激活, 对抗扰动

一句话总结

论文揭示了此前文献中 ViT 易受后门攻击且防御易崩溃的结论源于 CNN 防御策略在 ViT 上的不当适配,在修正优化器与剪枝粒度后现有后门攻击可被轻易防御;据此提出基于通道激活对齐的增强攻击 CAT,通过对抗扰动压制触发器异常通道差异以有效规避净化防御。

研究背景与动机

视觉 Transformer(ViT)凭借多头自注意力机制和强大的长程依赖建模能力,在图像分类、语义分割以及生成模型等计算机视觉核心任务中取得了巨大成功。然而,在学术界与工业界积极推进 ViT 实际部署的同时,模型的可信度与安全性成为了制约其落地的关键瓶颈。后门攻击(Backdoor Attack)作为一种典型的隐蔽安全威胁,攻击者在训练阶段向少量样本注入特定触发器(Trigger)并篡改标签,使得被植入后门的目标模型在干净样本上保持极高的正常分类精度,而在遭遇带有触发器的输入时定向触发恶意误分类。在传统卷积神经网络(CNN)中,经过长期的攻防演进,基于微调(Fine-Tuning)或神经元剪枝(Pruning)等模型净化防御手段已经能够以极小的精度代价彻底清除后门。

但近期一系列针对 ViT 后门鲁棒性的研究(如 BackdoorBench 与 BadViT)却给出了截然相反的结论:文献普遍指出,现有后门攻击在 ViT 上表现出异常顽固的攻击成功率,而直接迁移自 CNN 的防御手段往往导致模型干净样本分类精度剧烈崩溃甚至防御完全失效。这一现象使学术界产生了一种广泛共识——ViT 由于缺乏卷积的归纳偏置而在后门防御上表现得更为脆弱。然而,后门攻击机制本身通常是模型无关的,CNN 与 ViT 在相同防御算法下的巨大表现鸿沟引起了本文作者的深思:这种所谓的“天然脆弱性”,究竟是源于 Transformer 架构本身的缺陷,还是源于防御基准评测时对 ViT 训练范式的错误适配?

深入审视现有评测细节可以发现,早期将 Transformer 引入计算机视觉的工作沿袭了“预训练用 AdamW、微调评测用 SGD”的混合设定,导致后门防御研究在对 ViT 进行微调净化时盲目继承了 SGD 优化器,而忽略了 ViT 架构在小样本微调时对 AdamW 的强依赖性;同时,基于剪枝的防御算法直接套用了 CNN 中针对 Normalization 层的通道剔除策略,但在 Norm 层大幅精简的 ViT 结构中导致了剪枝脱靶或全模型过拟合。核心 idea:本文通过修正优化器对齐与剪枝粒度彻底推翻了“ViT 难以防御后门”的悲观假设,并进一步发现后门防御能够生效的核心根源在于触发器引发了中间层通道激活的剧烈异常分布,据此提出通道激活攻击(CAT),通过在触发器中引入双分支对抗微扰来抹平中间层激活差异,使后门特征隐蔽融入良性分布以突破防御。

方法详解

整体框架

本文的方法论由两部分构成:首先是在防御端建立严谨适配的 ViT 净化基准,矫正以往研究中的评估偏差;随后是在攻击端针对净化防御的底层检测机制,提出新型通道激活攻击(Channel Activation Attack in ViT, CAT)。CAT 的核心流水线包括三个阶段:在代理 ViT 模型的高层特征处挂载轻量后门判别器与目标分类器、利用投影梯度下降(PGD)生成最小化通道激活分布差异的触发器对抗扰动、以及引入随机扰动掩码(RMP)以强化攻击在跨 ViT 骨干网络时的通用泛化能力。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入数据与触发器注入<br/>x_p = (1-m)⊙x + m⊙t"] --> B["防御端适配校准<br/>AdamW 优化器 + 线性层投影剪枝"]
    B --> C["通道激活对齐机制<br/>挂载判别器 BD 与分类器 TC 联合对抗"]
    C --> D["扰动随机掩码 RMP<br/>按 patch 随机丢弃微扰跨架构迁移"]
    D --> E["生成隐蔽毒化样本<br/>抹平中间层激活差异突破防御净化"]

关键设计

1. 防御端适配校准:优化器对齐与线性投影剪枝

针对以往研究中微调防御(FT)和对抗剪枝防御(ANP / AWM)在 ViT 上崩溃的痛点,本文对防御实现进行了关键的架构适配。在微调防御中,CNN 使用 SGD 优化器能够平稳收敛,但 ViT 在缺乏充足归纳偏置时对优化器动量与自适应步长极其敏感,盲目使用 SGD 进行微调会导致干净样本准确率(ACC)暴跌至 20% 以下。将优化器切换为 AdamW 并配合标准数据增强(如 Mixup、CutMix)后,仅需极少数干净样本微调即可在维持 95% 以上 ACC 的同时将攻击成功率(ASR)压缩至 1% 左右。在剪枝防御中,传统 ANP 针对卷积层前后的 Batch Normalization 层缩放参数进行掩码,但 ViT 中不仅移除了大量 Norm 层,其 LayerNorm 分布位置也无法覆盖 Transformer 的核心变换,导致剪枝失效;而 AWM 在小网络中使用的权重级掩码在 ViT 庞大参数量下会造成严重过拟合。本文提出直接对 Multi-Head Self-Attention(MHSA)与 MLP 块内的全连接线性投影层(Linear Projections)进行通道级掩码剪枝,既保证了对恶意表征的有效覆盖,又避免了过大的参数自由度,使剪枝防御在 ViT 上重新展现出与 CNN 相当的强大净化能力。

2. 通道激活对齐机制:双分支对抗扰动生成

防御端能够精准净化后门模型的根本原因在于,传统静态触发器在 ViT 中间特征层诱发了异常的通道激活尖峰。通过可视化 ViT-B 倒数第二层在干净样本与触发器样本下的各通道平均激活值,可以观察到触发器样本在特定通道上存在极其显著的激活偏移,而微调和剪枝正是利用这一差异选择性压制或剔除了异常通道。为了让后门攻击突破适配后的防御,CAT 将防御对抗建模为一个特征隐蔽化问题:在代理模型的最后 \(n\) 个 Transformer 块(默认 \(n=2\))引出中间特征 \(g_i(x)\),并分别训练轻量级的后门判别器 \(d_i(\cdot)\)(预测输入是否包含触发器)与目标分类器 \(f_i(\cdot)\)(在干净样本上预测真值、在触发器样本上预测目标后门类别 \(y_\text{tc}\))。为了同时压制触发器带来的可识别激活偏移并维持定向攻击意图,攻击者通过在触发器区域上优化微扰 \(\delta\) 来最大化联合目标:

\[\mathcal{L}(\mathbf{\delta}) = \sum_{i=L-n+1}^L \Big( (1-\gamma) \cdot \ell\big(d_i(\mathbf{g}_i(\mathbf{x} + \mathbf{m} \odot \mathbf{\delta})), y_\text{bd}\big) + \gamma \cdot \ell\big(f_i(\mathbf{g}_i(\mathbf{x} + \mathbf{m} \odot \mathbf{\delta})), y_\text{tc}\big) \Big)\]

其中 \(y_\text{bd}=1\) 对应触发器样本标签,\(\gamma \in [0, 1]\) 是平衡表征混淆与攻击效能的权衡超参数。由于神经网络的高非线性,通过有限步长 \(\ell_2\) 有界的投影梯度下降(PGD)算法进行更新:

\[\mathbf{\delta} \leftarrow \mathbf{m} \odot \Pi_\epsilon \Big( \mathbf{\delta} + \alpha \cdot \frac{\nabla_\mathbf{\delta} \mathcal{L}(\mathbf{\delta})}{\|\nabla_\mathbf{\delta} \mathcal{L}(\mathbf{\delta})\|_2} \Big)\]

这一机制通过极小的扰动迫使模型在中间层提取触发器特征时,其通道激活分布向正常样本收敛,从而使基于激活分布的剪枝和针对后门神经元的微调无法定位并抹去攻击特征。

3. 扰动随机掩码:跨架构补丁尺寸适应与泛化增强

在实际攻击场景中,攻击者通常只能在本地可控的白盒代理架构(如标准 ViT-B)上优化生成对抗扰动,而被攻击的下游受害者模型可能采用多尺度分层 Transformer(如 Swin-B)、引入通道交互的分支网络(如 XCiT-S)或具有不同 Patch 分割尺寸的变体。不同架构对局部敏感特征尺度的偏好差异极大,直接迁移单尺度优化的固定扰动容易导致迁移攻击成功率急剧退化。为此,本文设计了扰动随机掩码机制(Random Masking of Perturbation, RMP)。在每次迭代生成对抗扰动的中间步骤中,将扰动划分为尺寸更细粒度的规则小块(如 \(2 \times 2\) 像素的小 patch),并以一定概率随机丢弃(Drop)部分 patch 的扰动更新量。这种随机失活操作模拟了多尺度的视觉遮挡与重采样过程,打破了扰动对特定 Patch 切割网格的结构依赖,强迫对抗微扰在离散、非连续的空间模式下依然能够混淆 ViT 中间层的注意力聚合过程,从而显著提升了增强后门攻击在未知受害者 ViT 架构上的黑盒穿透力。

损失函数 / 训练策略

CAT 的生成过程完全在离线数据预处理阶段完成,无需修改受害者模型的训练目标。在代理模型训练阶段,判别器与分类器均采用标准交叉熵损失 \(\ell\);在对抗微扰生成阶段,采用 \(\ell_2\) 范数上界约束 \(\epsilon = 16/255\),步长 \(\alpha = 4/255\),迭代轮数固定为 PGD-10,权衡因子设为 \(\gamma = 0.6\)。对于整图型后门攻击(如 Blend),RMP 补丁丢弃率设为 0.1;对于局部补丁触发器攻击(如 BadNets),丢弃率设为 0.05。生成完成后,增强后的毒化数据集可直接发布给第三方或下游用户,受害者模型采用常规交叉熵进行标准有监督微调即可成功植入兼具高隐蔽性与强防御抗性的后门。

实验关键数据

主实验

主实验在 CIFAR-10 数据集上系统对比了六种经典后门攻击在经本文适配后的微调防御(FT, AdamW)和剪枝防御(ANP/AWM Adapted)下的表现,以及在搭载 CAT 攻击增强后的绕过能力。基准模型覆盖 ViT-B、DeiT-S、Swin-B、CaiT-S 和 XCiT-S。

攻击配置 目标模型 防御策略 干净样本精度 ACC (%) 防御前 ASR (%) 防御后 ASR (%) 攻击增强效益
BadNets (Vanilla) ViT-B FT (AdamW) 95.14 100.00 0.72 防御完全成功
BadNets + CAT (本文) ViT-B FT (AdamW) 95.12 100.00 65.01 +64.29% ASR
BadNets (Vanilla) ViT-B ANP (Adapted) 94.26 100.00 1.34 成功剔除恶意通道
BadNets + CAT (本文) ViT-B ANP (Adapted) 94.18 100.00 51.09 +49.75% ASR
Blend (Vanilla) Swin-B FT (AdamW) 95.30 100.00 37.86 具有一定净化效果
Blend + CAT (本文) Swin-B FT (AdamW) 95.22 100.00 89.75 +51.89% ASR
SIG (Vanilla) DeiT-S AWM (Adapted) 94.58 84.77 3.30 成功防御
SIG + CAT (本文) DeiT-S AWM (Adapted) 94.45 88.28 13.81 +10.51% ASR
BadNets (Vanilla) ViT-B AWM (Adapted) 95.02 100.00 0.71 防御完全成功
BadNets + CAT (本文) ViT-B AWM (Adapted) 94.95 100.00 6.78 提升突破概率

在 ImageNet 大规模基准上,针对 ViT 专属攻击(TrojViT、DBIA、BadViT)与结合 CAT 的对比同样显示,在适配后的模型无关防御面前,原有 ViT 专属攻击的 ASR 均被压制至 10% 以下(如 TrojViT 在 FT 下 ASR 仅为 0.12%);而 BadNets+CAT 在 AWM 防御下仍能保持高达 81.98% 的 ASR(对比原始 BadNets 的 24.32%)。

消融实验

消融实验在 CIFAR-10 数据集上评估了对抗微扰攻击(PA)与扰动随机掩码(RMP)两个核心模块在 ViT-B 和 Swin-B 模型上的独立与协同贡献(以 BadNets 攻击在 Fine-Pruning 防御下的 ASR 为基准)。同时对比了各攻击生成的隐蔽性度量指标(PSNR 与 SSIM)。

模型与配置 核心机制构成 FP 防御后 ASR (%) 增益 Δ PSNR (dB) SSIM
ViT-B (Baseline) Vanilla BadNets 触发器 0.91 基线 25.63 0.9997
ViT-B (w/o RMP) 仅引入对抗扰动 (PA) 14.54 +13.63% 58.86 0.9999
ViT-B (Full CAT) 完整模型 (PA + RMP) 27.90 +26.99% 58.86 0.9999
Swin-B (Baseline) Vanilla BadNets 触发器 11.49 基线 25.63 0.9997
Swin-B (Full CAT) 完整模型 (PA + RMP) 19.52 +8.03% 58.86 0.9999
对比基线 Blend 空间混合触发器 - - 22.26 0.7696
对比基线 SSBA 样本特异性不可见触发器 - - 25.39 0.8891

关键发现

  • 双重模块协同性:单独使用对抗微扰(PA)能够抹平部分异常通道从而降低被剪枝捕获的几率(ASR 提升 13.63%),但在遇到跨架构分块变化时泛化受阻;联合引入 RMP 随机补丁失活后,ASR 进一步跃升至 27.90%,验证了打破空间连贯性对跨架构攻击有效性的关键支撑。
  • 扰动预算与权衡系数敏感性:扰动预算 \(\epsilon\) 存在最优临界点(\(\epsilon = 16/255\)),预算过小时无法充分遮盖通道激活偏置,预算过大(\(\epsilon > 16/255\))则会破坏模型对后门触发器本身的语义记忆,导致 ASR 反转下降;权衡系数 \(\gamma = 0.6\) 取得最佳性能,证明平衡判别器混淆与分类器目标引导缺一不可。
  • 超越感官可见度的极高隐蔽性:CAT 仅在已有触发器表面叠加微量 \(\ell_2\) 约束微扰,其相对于原始毒化图像的 PSNR 达到 58.86 dB,SSIM 达到 0.9999,肉眼完全无法察觉任何人工修改痕迹,甚至优于以隐蔽著称的样本特异性后门攻击 SSBA。

亮点与洞察

  • 纠正领域实验偏见的方法学范例:指出前期文献宣称“ViT 对后门攻击天然防御崩溃”的论点完全建立在错误的优化器(SGD 微调)和脱靶的剪枝位置(针对不存在的 Norm 层)之上,为学术界提供了公正评测 ViT 安全性的基准指南。
  • 直击防御本质的表征伪装策略:揭示了现有模型净化防御的“阿喀琉斯之踵”是依赖中间通道激活异常这一统计先验,巧妙利用双分支对抗学习在特征空间隐形重塑后门信号,实现了从“空间视觉不可见”到“内部表征不可见”的范式进阶。
  • 即插即用且开销极低的跨架构泛化能力:CAT 的微扰生成完全在预处理阶段由代理模型快速离线完成(ImageNet 全集计算耗时小于 4 分钟),无需下游训练干预即可泛化穿透 Swin、DeiT 等异构 Transformer 架构。

局限与展望

  • 白盒代理模型的依赖性:微扰优化过程仍需依赖一个白盒 ViT 代理网络引出高层特征并反向传播梯度,在完全黑盒、无法获知任何模型结构线索的极端场景下,跨家族(如从纯 ViT 跨到混合 CNN-Transformer)的转移效果有待检验。
  • 防御协同演进的挑战:一旦防御方放弃传统的激活统计剪枝,转向基于注意力流追溯或因果特征解耦等全新范式,基于特征混淆的 CAT 扰动可能需要重新调整目标层与损失函数。
  • 未来改进方向:可进一步探索无需依赖判别器显式训练的无监督流形平滑微扰技术,并将通道激活隐形机制拓展至多模态视觉语言模型(VLM)与文本驱动的扩散模型后门注入中。

相关工作与启发

  • vs BackdoorBench / BadViT: 后者基于 SGD 微调和浅层 Norm 剪枝得出了 ViT 后门防御极其脆弱的结论;本文明确指出了其实现缺陷,证实当使用 AdamW 与线性层通道剪枝时,现有攻击在 ViT 上的 ASR 会被彻底粉碎至 1% 左右。
  • vs TrojViT / DBIA: 这类工作专门针对 Transformer 的注意力机制设计复杂的触发器注入或权重篡改方案;本文证实这些“ViT 专用攻击”在适配后的通用防御面前其实不堪一击(ASR 均降至 0.1%~0.4%),而 CAT 凭借特征通道激活伪装能够对各类防御展现出更强韧的逃逸能力。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 深入反思评测偏差并提出通道级激活对齐伪装,构思精巧直击攻防痛点。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 5 种 ViT 变体、6 种主流攻击、7 种防御策略及大规模 ImageNet 评测,证据链完备。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑层层推进,从打破盲目共识到发现激活异常再到构建增强攻击,结构严密清晰。
  • 价值: ⭐⭐⭐⭐⭐ 澄清了学界对 ViT 后门安全性的重大认知误区,为未来 ViT 鲁棒性评估建立了可靠基准。