跳转至

Indelible Backdoors: On the Limits of Post-Training Defenses

会议: ECCV 2026
论文: ECCV 2026
领域: AI 安全
关键词: 后门攻击 / 梯度对齐 / 后训练防御 / 费歇尔信息 / 持续学习安全

一句话总结

针对后训练微调与剪枝防御假定“良性与恶意信号可分离”的根本缺陷,本文提出一种基于费歇尔信息识别核心神经元并强制后门与良性任务梯度方向对齐的自适应后门攻击,使任何消除后门的防御尝试必然导致良性精度崩溃。

研究背景与动机

随着深度神经网络在安全攸关领域的广泛部署,后门攻击已成为人工智能安全中最隐蔽且危害严重的漏洞之一。攻击者在模型训练期向训练集注入微量触发器或操纵训练流程,使模型在良性测试样本上保持高分类准确率,而在检测到特定触发器时将预测结果强行导向攻击者设定的目标类别。在机器学习即服务(MLaaS)和基础模型持续微调的主流范式下,下游用户普遍缺乏对预训练数据的直接审查权限,因而高度依赖在本地收集的小规模纯净验证集上执行后训练防御——诸如微调(Fine-Tuning, FT)、神经注意力蒸馏(NAD)、重构神经元剪枝(RNP)、特征偏移微调(FST)以及基于权重变化相关性的重初始化(TSBD)等方案,试图通过灾难性遗忘擦除恶意后门特征。

然而,现有后训练防御方案在理论与实践层面均建立在一个未被严格审视的核心前提上:防御者假设良性任务与后门任务在表征空间或参数更新空间中是彼此解耦且正交的,只要借助少量纯净样本施加梯度更新或分布收紧,就能在无损良性准确率的前提下定向抑制后门激活通路。这种“通过纯净数据分离恶意信号”的假设在面对具备防御感知的自适应攻击者时存在致命软肋。一旦攻击者有意让后门任务的优化轨迹与良性任务深度纠缠,后训练防御的双重优化目标(“消除后门”与“保持纯净准确率”)就会陷入根本性的目标冲突。

针对这一被长期忽视的安全盲区,本文的切入点是探索后训练防御机制的理论与经验边界。攻击者通过代理模型预先测算良性任务的核心参数,并以此约束输入自适应触发器的生成方向,将后门梯度与良性梯度深度绑定。核心 idea:利用对角费歇尔信息矩阵(FIM)精确定位对良性任务最关键的神经元掩码,并在端到端训练触发器生成器时显式最大化后门与良性样本在这些核心神经元上的梯度余弦相似度,使后门特征深度寄生在良性任务主干电路上,迫使任何后门遗忘操作均不可逆地破坏良性分类精度。

方法详解

整体框架

本文提出的不可磨灭后门(Indelible Backdoors)攻击由三个串行阶段构成:首先在代理模型与纯净数据子集上计算费歇尔信息矩阵,识别决定良性分类决策的关键神经元并生成二值掩码;其次,引入输入自适应触发器生成器,在联合优化目标下引入梯度对齐损失(Gradient Alignment Loss),使触发样本产生的后门梯度与良性梯度在核心神经元上高度同向;最后,冻结触发器生成器并对受害模型进行标准监督训练,使训练出的模型在出厂时即具备抵御后训练清洗的天然纠缠特性。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["纯净样本子集 + 代理模型"] --> B["阶段 1:费歇尔信息核心神经元定位<br/>计算对角 FIM 提取 Top-k% 掩码"]
    B --> C["阶段 2:梯度对齐触发器生成器优化<br/>最大化关键神经元梯度余弦相似度"]
    C --> D["阶段 3:受害模型混合监督训练<br/>注入自适应样本级触发器并冻结"]
    D --> E["出厂受害模型<br/>抵御后训练微调与剪枝清洗"]

关键设计

1. 费歇尔信息核心神经元定位:量化良性任务决策主干

为了使后门梯度与良性梯度的纠缠具备最高破坏力,攻击者必须锁定那些对良性分类任务最不可或缺的模型参数,而非在噪声或低灵敏度权重上进行对齐。本文利用在纯净数据子集上训练的代理模型 \(f_{\text{sur},\theta}\),通过对角费歇尔信息矩阵(Fisher Information Matrix, FIM)对参数灵敏度进行实证估计。对于每个可训练参数 \(\theta_i\),其对角费歇尔值计算为:

\[F_i = \frac{1}{N} \sum_{n=1}^N \left( \nabla_{\theta_i} \mathcal{L}_{\text{CE}}(f_{\text{sur},\theta}(x_n), y_n) \right)^2\]

其中 \(\mathcal{L}_{\text{CE}}\) 为交叉熵损失,\(N\) 为估计所用的纯净样本批次数。在统计学习视角下,\(F_i\) 高的参数意味着在纯净样本间诱导出持续大幅且方向稳定的梯度信号,构成了模型良性决策边界的核心支撑;而 \(F_i\) 极低的参数对应的梯度大多相互抵消、处于近随机噪声状态。攻击算法选取前 \(k\%\)(默认取 10%)最高费歇尔值的参数构建每层二值重要性掩码 \(M_i\),使后续的后门梯度对齐精准收敛在这些承载良性核心功能的神经元上。

2. 梯度对齐触发器生成器优化:强制优化轨迹深度纠缠

传统的样本相关后门方法主要关注触发器在像素空间或特征空间的隐蔽性,并未考虑训练动态与防御防御梯度的相互作用。本文训练一个参数化触发器生成器 \(T_\phi(x)\),将良性图像 \(x\) 映射为扰动量并限制在扰动预算 \(\epsilon\) 内生成毒化样本 \(\tilde{x} = \text{clip}(x + \epsilon \cdot T_\phi(x), 0, 1)\)。在训练生成器时,设计了由四个子目标构成的多任务优化损失:

\[\mathcal{L}_T = \lambda_{\text{bd}} \mathcal{L}_{\text{bd}} + \lambda_{\text{align}} \mathcal{L}_{\text{align}} + \lambda_{\text{clean}} \mathcal{L}_{\text{clean}} + \mathcal{L}_{L_2}\]

其中 \(\mathcal{L}_{\text{bd}}\) 确保带触发样本被受害模型正确诱导至目标类别 \(c\),\(\mathcal{L}_{\text{clean}}\) 保留生成器前向时良性准确率,\(\mathcal{L}_{L_2}\) 压低触发器残差幅度。核心贡献在于引入对齐损失 \(\mathcal{L}_{\text{align}}\):对于每一可训练层 \(i\),提取掩码后的良性梯度向量 \(g_i^c = \text{vec}(M_i \odot \nabla_{\theta_i} \mathcal{L}_{\text{clean}})\) 与后门梯度向量 \(g_i^b = \text{vec}(M_i \odot \nabla_{\theta_i} \mathcal{L}_{\text{bd}})\),在所有 \(L\) 个目标层上最大化两者的余弦相似度:

\[\mathcal{L}_{\text{align}} = - \frac{1}{L} \sum_{i=1}^L \frac{g_i^c \cdot g_i^b}{\|g_i^c\|_2 \|g_i^b\|_2}\]

通过迫使后门梯度在核心神经元上与良性梯度完全同向,模型在拟合良性任务特征的同时自动加固了后门路径。下游防御者即便使用纯净数据执行再多的梯度下降微调,其对这些关键神经元的更新不仅不会抹除后门,反而会同步刷新后门权重。

3. 受害模型混合监督训练:出厂固化不可磨灭表征

在生成器 \(T_\phi\) 收敛后,攻击者将其参数彻底冻结。在构建交付给下游用户的投毒训练集时,攻击者仅需以极低的中毒比例 \(\rho\)(甚至低至 1%)对训练数据施加动态扰动并修改标签为目标类 \(c\)。由于每个毒化样本都携带由当前图像内容条件化生成的独特触发图样,传统的基于触发器模式逆向工程(如 Neural Cleanse、STRIP)的防御手段难以检测出统一的静态补丁。受害模型 \(f_\theta\) 在该混合集上完成端到端标准监督训练,梯度对齐先验使得后门激活路径不再是独立的旁路分支,而是与骨干特征抽取高度融合为不可切除的统一表征。

损失函数 / 训练策略

生成器训练采用网格搜索确定的权重超参组合:\(\lambda_{\text{align}} = 1.0\)、\(\lambda_{\text{bd}} = 2.0\)、\(\lambda_{\text{clean}} = 0.1\),扰动范数约束 \(\epsilon = 0.1\)。费歇尔信息矩阵在 1000 个纯净样本上计算,选取 Top 10% 神经元生成掩码。生成器训练 20 个 epoch,受害模型训练 100 个 epoch(学习率 0.01)。评估指标引入综合防御有效率(Defense Effectiveness Rate, DER):

\[\text{DER} = \frac{\max(0, \Delta \text{ASR}) - \max(0, \Delta \text{ACC}) + 1}{2}\]

该指标奖励防御方法对 ASR 的削减,同时严格惩罚良性精度 ACC 的退化。若防御者试图以牺牲正常可用性为代价降低后门(\(\Delta \text{ACC}\) 过大),DER 指标将直观暴露其防御失败。

实验关键数据

主实验

在 CIFAR-10 和 Tiny-ImageNet 两个代表性基准上,对比 7 种主流攻击方法(BadNets、Blended、WaNet、LC、Input-Aware、Narcissus、COMBAT)在 8 种后训练防御(FT、ANP、NAD、I-BAU、RNP、Unit、FST、TSBD)下的表现。以下展示 CIFAR-10 数据集上的核心对决结果:

防御方案 评估指标 BadNets WaNet Narcissus COMBAT 本文 (Ours) 表现分析
Pretrained ACC (%)
ASR (%)
91.44
94.41
92.67
99.54
93.09
94.64
93.94
94.47
93.27
100.00
初始模型均具备极高后门激活率与良性可用性
FT (标准微调) ACC (%)
ASR (%)
DER (%)
90.56
1.47
96.03
92.50
13.91
92.73
92.35
89.81
52.05
93.46
72.83
60.58
92.20
99.99
49.47
传统攻击 ASR 暴跌至 1%-14%,本文 ASR 保持 99.99% 毫无衰减
NAD (注意力蒸馏) ACC (%)
ASR (%)
DER (%)
89.33
2.08
95.11
91.88
9.98
94.39
91.27
88.06
52.38
93.48
70.96
61.52
91.54
99.97
49.15
注意力迁移无法剥离对齐后门,本文 ASR 维持 99.97%
I-BAU (双层超梯度) ACC (%)
ASR (%)
DER (%)
88.13
7.91
91.60
86.52
20.04
86.68
89.27
33.01
78.91
91.01
1.98
94.78
91.14
88.47
54.70
COMBAT 被完全清除至 1.98%,本文依然保持 88.47%
RNP (重构剪枝) ACC (%)
ASR (%)
DER (%)
87.63
3.76
93.42
90.34
0.17
98.52
92.97
91.52
51.50
91.40
24.23
83.85
86.03
96.51
48.13
剪枝核心神经元导致良性精度受创,后门存活率仍达 96.51%
FST (特征偏移微调) ACC (%)
ASR (%)
DER (%)
87.06
2.08
93.98
92.40
0.58
99.35
92.18
93.91
49.91
91.25
30.65
80.57
89.68
99.58
48.42
先进微调技术彻底失效,本文 ASR 高达 99.58%
TSBD (权重相关抑制) ACC (%)
ASR (%)
DER (%)
90.13
1.78
95.66
92.48
1.08
99.14
92.85
82.16
56.12
92.91
35.57
78.94
93.11
99.84
50.00
神经元重初始化后纯净微调反而强化了对齐后门

在更复杂的 Tiny-ImageNet 验证中,传统强力防御甚至出现灾难性失灵:例如针对本文攻击,Unit 防御将 ASR 降至 66.92% 的代价是 ACC 崩溃至 3.09%;FST 迫使 ASR 降至 21.38% 时 ACC 骤跌至 32.74%;而 TSBD 在维持 53.90% ACC 时遗留了高达 91.38% 的 ASR。

消融实验

消融实验深入检验扰动预算 \(\epsilon\) 与中毒比例 \(\rho\) 对攻击持久性的影响。下表系统评估了在不同噪声幅度 \(\epsilon\) 下受害模型对五种先进防御策略的抵抗韧性:

扰动预算 \(\epsilon\) Pretrained (ACC/ASR) NAD (ACC/ASR) I-BAU (ACC/ASR) Unit (ACC/ASR) FST (ACC/ASR) TSBD (ACC/ASR)
\(\epsilon = 0.100\) 93.27% / 100.00% 91.54% / 99.97% 91.14% / 88.47% 88.15% / 92.07% 89.68% / 99.58% 93.11% / 99.84%
\(\epsilon = 0.075\) 92.82% / 100.00% 90.21% / 98.88% 88.62% / 94.97% 87.61% / 96.62% 89.67% / 99.12% 91.44% / 97.44%
\(\epsilon = 0.050\) 92.96% / 99.99% 90.43% / 87.97% 90.45% / 72.43% 88.25% / 90.09% 89.70% / 87.02% 91.92% / 81.02%
\(\epsilon = 0.030\) 92.91% / 99.92% 89.98% / 57.06% 89.20% / 51.84% 87.77% / 69.06% 89.19% / 71.99% 91.92% / 47.76%

在中毒比例的消融中(表 4),即便将投毒率压缩至极端保守的 1%(\(\rho = 0.01\)),本文攻击在 FT(99.93% ASR)、NAD(99.93% ASR)、I-BAU(99.96% ASR)、Unit(99.29% ASR)以及 FST(99.77% ASR)下依然维持准饱和攻击成功率;反观 Narcissus 在投毒率 1% 时,其预训练 ASR 便从 94.64% 断崖式跌落至 38.26%,在微调后更是降至 33.56%。

关键发现

  • 纯净微调成为后门的加固器:在所有基于梯度更新的微调防御中(FT、NAD、FST、TSBD),由于后门梯度与纯净梯度在费歇尔核心参数上的余弦相似度极高,防御者注入纯净数据优化良性精度的过程,同时向后门特征补充了更新动力,导致微调轮次越多后门反而越牢固。
  • 剪枝与解耦操作陷入两难困境:剪枝类方案(如 ANP、RNP)依赖“后门神经元对良性任务非必需”的假设。一旦后门被绑定至高费歇尔信息神经元,剪枝操作直接诱发了对良性核心特征的损毁,致使良性精度与后门存活率发生不可调和的负相关坍塌。
  • 极佳的架构与跨算力泛化:跨越 PreAct-ResNet18、VGG19_BN、MobileNetV3-Large 直至视觉 Transformer(ViT-B/16),防御者预期的“安全舒适区(Sweet Spot,即 ACC 下降 \(\le 5\%\) 且 ASR \(\le 20\%\))”均无法达成,验证了梯度纠缠在底层数学优化机理上的普适性。

亮点与洞察

  • 将后门植入从表征分离升级为梯度同向纠缠:传统后门注重隐形或无标签,而本文开创性地从“后训练对抗动力学”视角出发,直接优化参数更新矢量的夹角,击中了后训练防御对纯净样本灾难性遗忘特性的根本依赖。
  • 以费歇尔信息矩阵作为解耦破坏的支点:巧妙借鉴模型保护与持续学习中的核心概念(EWC),不盲目对齐全网权重,而是紧扣 Top 10% 承载最大良性决策方差的关键参数,以极低优化代价换取最大防御阻抗。
  • 揭示了后训练防线不可持续的理论边界:系统证明了“仅凭无标签或纯净下游小数据集进行后验清洗”存在先天的安全盲区,为未来需要深入检查训练阶段表征纠缠或设计新型因果干预防御提供了坚实的威胁基准。

局限与展望

  • 白盒或强代理模型依赖:计算费歇尔信息矩阵与实施梯度对齐需要获取代理模型的架构与权重,在完全黑盒、异构模型结构或无代理训练权限场景下的迁移攻击效果仍待进一步增强。
  • 投毒标签策略仍采用脏标签(Dirty-Label):虽然本方法借助图像自适应生成器绕开了固定图案检测,但训练阶段依然修改了样本标签,易在严格的数据清洗或人工抽检流程中受到挑战;与 Clean-label 范式的深度融合是重要的演进方向。
  • 防御侧的反制可能:启发防御学者开发基于高阶 Hessian 矩阵不对称性探测、对抗扰动方向发散度测试或神经元因果介入的新型防御,摆脱对一阶纯净微调的单纯依赖。

相关工作与启发

  • vs Input-Aware & WaNet: 早期动态与形变后门仅从样本生成器角度规避通用补丁逆向检测,未对模型梯度的演进空间施加约束,在 TSBD 或 FST 等新式特征重构防御下极易被重置;本文则从参数优化轨迹上保证了后门的不可磨灭性。
  • vs Narcissus & COMBAT: 先进的 Clean-label 方案虽然具备标签隐蔽性,但在低投毒预算或强正则化剪枝(如 Tiny-ImageNet 上的 ANP/Unit)下表现出严重的脆弱性与精度折损;本文在全算力预算和复杂多模态骨干下均展现出一致的鲁棒性。
  • vs NAD & TSBD: 这类防御假设良性神经元与木马神经元可以通过注意力蒸馏或权重变化相关系数进行剥离;本文通过前验梯度对齐直接击碎了这一基本假设。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次从梯度对齐与参数敏感度纠缠的角度直击后训练防御的根本漏洞,设计构思兼具深度与启发性。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 7 种攻击基准、8 种先进防御、跨多数据集(CIFAR-10、Tiny-ImageNet)及 CNN/ViT 架构,消融与分析扎实详尽。
  • 写作质量: ⭐⭐⭐⭐⭐ 动机阐述逻辑清晰,数学公式精炼得当,实验现象分析透彻且切中要害。
  • 价值: ⭐⭐⭐⭐⭐ 明确指出了当前 MLaaS 体系下后训练清洗范式的安全边界,对推动新型自适应防御机制的研究具有重要参考价值。