跳转至

Learning with Bilevel-Minimax Optimization for Efficient and Reliable Transfer Attacks

会议: ECCV 2026
论文: ECCV 2026 Poster
代码: https://github.com/callous-youth/BMAT
领域: 语义分割
关键词: 对抗攻击迁移性, 双层极小极大优化, 初始扰动优化, 语义分割黑盒攻击, 替代模型自适应

一句话总结

针对传统基于替代模型的黑盒迁移攻击将初始化、扰动生成与模型自适应割裂优化的问题,本文提出 BMAT(双层极小极大对抗迁移攻击),将三者形式化为双层极小极大统一优化问题,通过软权重调制器与隐式梯度近似器实现高效协同求解,在图像分类与语义分割任务上显著提升跨架构黑盒迁移能力。

研究背景与动机

基于替代模型(Surrogate Model)的迁移对抗攻击旨在白盒模型上生成对抗样本,并将其直接迁移至未知黑盒受害者模型以造成错误预测。由于攻击者无需向目标系统发起任何交互式查询,迁移攻击在现实物理安全与视觉感知系统中构成了极其严重的威胁。为了提升对抗扰动的跨模型迁移性,既有研究主要聚焦于局部要素的设计:动量加速机制通过累加历史梯度稳定更新方向,输入变换策略通过尺寸缩放、平移或拼贴缓解对特定空间特征的过拟合,而模型集成方法则通过聚合多个白盒架构的梯度降低模型特异性偏差。

然而,这些方法本质上仍然依赖于割裂且启发式的单变量优化范式。迁移对抗攻击的有效性根本上取决于三个核心变量的三元耦合交互动态(Ternary Coupling Interaction):其一为初始扰动(Initialization Perturbation, IP),它决定了对抗搜索轨迹在损失曲面上的起点与探索区域;其二为对抗扰动本身,它负责捕捉并放大脆弱性特征;其三为替代模型参数,它直接塑造了反向传播的梯度曲面结构。现有工作通常将初始扰动设为零或随机噪声,将替代模型权重冻结为预训练静态参数,仅将优化集中于扰动向量本身。这种隔离设计导致变量间的优化动态相互脱节,使得攻击轨迹极易过拟合于静态替代模型的局部假象与高曲率尖锐极小点,在面临跨模型与跨架构迁移(如从 CNN 迁移至视觉 Transformer)时性能急剧衰退。

为了打破这种割裂范式,关键在于建立一个能够同时刻画并协同调度“初始化-扰动-替代模型”三元依赖关系的统一优化框架。本文的核心 idea 是:将迁移对抗攻击重构为双层极小极大优化问题(Bilevel-Minimax Optimization),外层基于伪替代模型反馈利用隐式梯度近似优化初始扰动以引导全局轨迹,内层通过极小极大对抗博弈联合更新扰动与替代模型的软权重以平滑损失曲面并提取跨架构通用梯度。

方法详解

整体框架

BMAT 将迁移攻击建模为自底向上的分层动态协调过程,系统输入为干净图像与初始标注,首先通过软权重调制器与隐式梯度近似器构建双层极小极大优化闭环,完成初始化种子的自适应学习;随后进入快速迁移阶段,将学得的初始化种子作为热启动输入,在原始替代模型上执行极速梯度迭代,输出最终的高迁移性对抗样本。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入干净图像与基础替代模型"] --> B["软权重调制器 (SWM)<br/>单步反向传播协同更新扰动与软权重"]
    B --> C["隐式梯度近似器 (IGA)<br/>共轭梯度求解超梯度并自适应优化初始扰动"]
    C --> D["两阶段快速迁移机制<br/>基于学成种子热启动生成高迁移性对抗样本"]
    D --> E["黑盒受害者模型迁移评测<br/>跨 CNN 与 Transformer 架构攻击验证"]

在第一阶段(学习初始扰动),外层优化在伪替代模型 \(\mathcal{P}\) 的监督下调整初始扰动 \(\boldsymbol{\delta}\),将其作为内层轨迹的种子;内层优化则在当前初始扰动 \(\boldsymbol{\phi}_0 = \boldsymbol{\delta}_t\) 的引导下,通过软权重调制器(SWM)交替更新扰动向量 \(\boldsymbol{\phi}\) 与替代模型的软权重 \(\boldsymbol{\omega}\),迫使替代模型在维持自然精度的同时自适应增强鲁棒性,从而提供更加平坦平滑的损失景观。外层利用隐式梯度近似器(IGA)避免代价高昂的内层展开反向传播,仅依靠隐式反馈高效更新初始扰动。在第二阶段(快速迁移),算法直接以优化后的 \(\boldsymbol{\delta}_T\) 作为扰动轨迹的热启动种子,仅需常规的符号梯度投影即可迅速收敛到高迁移性解。

关键设计

1. 软权重调制器 (SWM):单步反向传播下的扰动与软权重协同自适应

传统迁移攻击在固定的预训练替代模型上计算梯度,模型参数在攻击过程中完全静态,容易诱导扰动落入与该架构强相关的尖锐非通用极值点。软权重调制器针对这一痛点,在内层子问题中构建极小极大对抗目标函数:

\[ \min_{\boldsymbol{\phi} \in \mathcal{C}} \max_{\boldsymbol{\omega} \in \Omega} f(\boldsymbol{\phi}, \boldsymbol{\omega}) := -\mathcal{L}_{\text{s}}(\boldsymbol{\phi}, \mathcal{S}_{\boldsymbol{\omega}}; \mathcal{D}_i) - \tau \mathcal{R}(\mathcal{S}_{\boldsymbol{\omega}}; \mathcal{D}_i) \]

其中 \(\mathcal{L}_{\text{s}}\) 表示替代模型在扰动样本上的任务损失,\(\mathcal{R}(\mathcal{S}_{\boldsymbol{\omega}}; \mathcal{D}_i) := \mathcal{L}_{\text{s}}(\mathcal{S}_{\boldsymbol{\omega}}(u_i), v_i)\) 是自然精度正则项,\(\tau > 0\) 用于平衡模型鲁棒性与原始分类能力。由于最小化 \(-\mathcal{L}_{\text{s}}\) 等价于最大化对抗损失,该目标在优化扰动 \(\boldsymbol{\phi}\) 的同时,驱使替代模型权重 \(\boldsymbol{\omega}\) 在对抗样本上主动适应以抵御攻击。

在具体求解机制上,SWM 巧妙利用单次反向传播同时获取关于扰动与模型权重的梯度 \(\nabla_{\boldsymbol{\phi}} f_k\) 和 \(\nabla_{\boldsymbol{\omega}} f_k\)。在每一步内层迭代中,扰动执行带约束的梯度上升,而软权重则沿着梯度方向微调。为了防止替代模型参数偏离原始分布导致梯度崩溃,SWM 严格将初始预训练权重 \(\boldsymbol{\omega}_0\) 视为硬基线,每个批次开始时重置为 \(\boldsymbol{\omega}_0\),仅在当前样本对抗轨迹内部进行局部微调。这种设计不仅使损失曲面在十步之内显著平坦化,而且计算开销几乎与传统单次反向传播相当。

2. 隐式梯度近似器 (IGA):共轭梯度驱动的无展开初始扰动优化

现存初始化方法大多采用高斯噪声或基于模型集成的启发式微调,缺乏针对黑盒迁移能力的显式监督;若直接采用双层优化中的反向展开(Unrolling)机制计算初始扰动 \(\boldsymbol{\delta}\) 的超梯度(Hypergradient),由于内层包含 \(\tilde{K}\) 步联合更新,显式构建高阶计算图将引发极高的显存爆炸与计算瓶颈。隐式梯度近似器针对这一矛盾,引入外层伪替代模型目标函数:

\[ \min_{\boldsymbol{\delta} \in \mathcal{C}} F(\boldsymbol{\delta}, \boldsymbol{\phi}^*(\boldsymbol{\delta})) := -\mathcal{L}_{\text{p}}(\boldsymbol{\phi}^*(\boldsymbol{\delta}); \mathcal{P}, \mathcal{D}_i) \]

利用隐式函数定理(Implicit Function Theorem),在内层近似极小解 \(\boldsymbol{\phi}^*(\boldsymbol{\delta})\) 处推导超梯度解析形式:

\[ \nabla_{\boldsymbol{\delta}} F(\boldsymbol{\delta}, \boldsymbol{\phi}^*(\boldsymbol{\delta})) \approx -\left(\nabla^2_{\boldsymbol{\delta}\boldsymbol{\phi}} f\right)^\top \left(\nabla^2_{\boldsymbol{\phi}\boldsymbol{\phi}} f + \rho \mathbf{I}\right)^{-1} \nabla_{\boldsymbol{\phi}} F = -\left(\nabla^2_{\boldsymbol{\delta}\boldsymbol{\phi}} f\right)^\top \mathbf{h} \]

其中 \(\rho \mathbf{I}\) 为阻尼项以确保局部可逆性与数值稳定性。IGA 并不显式计算海森矩阵(Hessian)及其逆,而是将线性方程组 \(\left(\nabla^2_{\boldsymbol{\phi}\boldsymbol{\phi}} f + \rho \mathbf{I}\right) \mathbf{h} = \nabla_{\boldsymbol{\phi}} F\) 转化为二次型求解,并通过 Fletcher-Reeves 共轭梯度法(FR-CG)进行迭代计算。每次迭代仅需执行海森-向量积(Hessian-vector product),在极少的步数内即可收敛到高精度近似解 \(\mathbf{h}\)。随后通过映射更新初始扰动:

\[ \boldsymbol{\delta}_{t+1} \leftarrow \Pi_{\mathcal{C}}\left(\boldsymbol{\delta}_t - \alpha \cdot \text{sgn}\left((\nabla^2_{\boldsymbol{\delta}\boldsymbol{\phi}} f)^\top \mathbf{h}\right)\right) \]

该机制彻底摆脱了内层轨迹的反向存储需求,赋予初始扰动引导全局攻击轨迹逃离局部坏极小的能力。

3. 两阶段快速迁移机制:基于学成初始种子的低开销热启动攻击

在黑盒迁移攻击的大规模部署场景中,若在测试阶段对每个未知样本都执行完整的双层极小极大联合迭代,将引入显著的时间延迟。两阶段快速迁移机制将攻击流程清晰解耦为“阶段一:轨迹种子学习”与“阶段二:快速迁移生成”。

在阶段一中,算法在小步长内运行 \(T\) 轮外层迭代,通过 SWM 与 IGA 的交替反馈将初始扰动从随机先验引导为结构化的通用轨迹种子 \(\boldsymbol{\delta}_T\)。实验表明,该种子已经深度编码了跨架构的特征偏移方向(Feature Similarity Shift)。在阶段二中,算法直接以 \(\boldsymbol{\phi}_0 = \boldsymbol{\delta}_T\) 作为热启动起点,随后仅需在原始替代模型上运行常规的标准投影梯度上升更新:

\[ \boldsymbol{\phi}_{k+1} \leftarrow \Pi_{\mathcal{C}}\left(\boldsymbol{\phi}_k + \alpha \cdot \text{sgn}\left(\nabla_{\boldsymbol{\phi}}\mathcal{L}_{\text{s}}(\boldsymbol{\phi}_k; \mathcal{S}_{\boldsymbol{\omega}}, \mathcal{D}_i)\right)\right) \]

该机制确保攻击在 Phase-II 仅需 \(K\) 步常规前向/反向传播即可完成,既享有双层极小极大联合自适应带来的广义迁移优势,又保持了与常规攻击高度一致的高效吞吐率与工程易用性。

损失函数 / 训练策略

整个 BMAT 优化过程分为内层对抗博弈目标与外层超参数引导目标。内层针对样本批次输入 \((u_i, v_i)\),联合最小化扰动损失与最大化权重适应损失,设定自然精度平衡系数 \(\tau \in [0.1, 0.5]\),阻尼项系数 \(\rho = 10^{-3}\);外层优化迭代轮数设为 \(T \in [1, 3]\),内层步数 \(\tilde{K} \in [5, 10]\)。伪替代模型 \(\mathcal{P}\) 可灵活配置为辅助模型(如 Inception-v3 或 GCNet)或单个白盒替代模型自身的贝叶斯权重扰动采样版本,在严格保持黑盒威胁模型的前提下实现零额外受害者先验攻击。

实验关键数据

主实验

论文在 ImageNet 分类基准与 Cityscapes / ADE20K 语义分割基准上全面评估了 BMAT 的迁移攻击效能。表 1 汇总了在 Cityscapes 语义分割任务上,分别以 FCN、DeepLabV3-Res50(DLV3-R50)以及视觉 Transformer 架构的 Segformer 作为白盒替代模型时,针对 10 个未知黑盒受害者模型(涵盖 8 个 CNN 变体与 2 个 Transformer 变体)的迁移 mIoU 攻击结果。

替代模型 基础攻击方法 CNN 受害者: FCN CNN 受害者: UPerNet CNN 受害者: DLV3-R101 CNN 受害者: PSP-R101 Transformer: Segformer Transformer: Setr 攻击均值表现
干净数据 N/A 72.25 77.10 80.20 78.34 76.54 78.10 基准干净精度
FCN PGD 1.97 3.74 8.09 6.83 33.96 42.09 传统单级投影基线
FCN SegPGD 2.02 3.60 10.04 7.98 36.65 44.73 像素级优化基线
FCN MI 2.40 3.57 6.52 5.39 27.81 38.75 动量增强基线
FCN EBAD 2.00 3.83 8.40 7.05 33.91 42.10 多模型集成基线
FCN BMAT (本文) 1.75 2.74 5.30 4.44 26.58 38.35 跨模型迁移显著增强
DLV3-R50 PGD 7.55 4.85 15.02 11.43 41.04 48.37 CNN 内部与跨架构迁移受限
DLV3-R50 MI 5.57 4.29 9.55 6.52 32.99 43.38 动量方法提升 CNN 迁移
DLV3-R50 BMAT (本文) 2.60 1.96 4.54 3.57 28.53 42.61 mIoU 全面大幅降低
Segformer PGD 31.43 32.61 35.22 33.56 1.85 43.16 Transformer 难以迁移至 CNN
Segformer MI 24.09 24.37 26.21 23.03 2.09 38.95 跨架构迁移衰减明显
Segformer BMAT (本文) 10.48 13.08 14.10 11.11 2.70 37.52 跨架构迁移取得近 2× 降幅

同时,在受控算力预算(统一反向传播次数 Backward Passes = 40)下,BMAT 在 ImageNet 上的分类攻击成功率(ASR ↑)与计算开销对比如下:

攻击方法 算力预算 (BP) CNN 均值 ASR (%) CNN 集成防御 ASR (%) Transformer 均值 ASR (%) 总平均 ASR (%) 显存占用 (GB) 运行时间 (s)
PGD BP=10 10.93 5.73 7.16 8.24 3.21 2.68
PGD BP=40 11.05 5.25 6.70 8.00 3.22 3.15
RAP BP=40 7.31 4.67 3.71 5.44 3.75 3.07
RAP BP=400 13.74 6.46 7.47 9.68 5.46 6.91
BETAK BP=40 17.16 8.07 9.25 12.06 22.69 6.37
BMAT (本文) BP=40 22.52 8.75 11.34 15.03 7.89 4.64

消融实验

为了严格检验核心组件 SWM 与 IGA 的独立贡献及协同机制,下表展示了以动量攻击(MI)为基线时,在 Cityscapes 分割基准上逐一加入 IGA 和 SWM 的消融测试指标(mIoU ↓):

替代模型 攻击配置 FCN UPerNet DLV3-R101 PSP-R101 Segformer (ViT) Setr (ViT) 机制说明
FCN MI (基线) 2.40 3.57 6.52 5.39 27.81 38.75 原始动量扰动更新
FCN MI + IGA 1.56 2.40 4.64 4.29 27.16 40.07 轨迹种子显著增强同架构迁移,但跨架构泛化遇阻
FCN MI + IGA + SWM 1.75 2.74 5.30 4.44 26.58 38.35 软权重协同调制突破架构瓶颈,双向指标达到最优
DLV3-R50 MI (基线) 5.57 4.29 9.55 6.52 32.99 43.38 CNN 替代模型基线
DLV3-R50 MI + IGA 1.92 1.56 3.96 3.11 29.78 44.42 CNN 内部 mIoU 减半,但在 Setr 上出现略微退化
DLV3-R50 MI + IGA + SWM 2.60 1.96 4.54 3.57 28.53 42.61 成功修复 Transformer 跨架构退化,全面提升黑盒迁移

关键发现

  • SWM 与 IGA 的功能互补性:实验清晰揭示,单纯通过 IGA 学习初始扰动能够极大提升同构网络(CNN 至 CNN)的攻击迁移性,但在极端异构网络(CNN 至视觉 Transformer)上容易出现过拟合或退化;引入 SWM 对替代模型进行动态软权重对抗训练后,损失曲面被强制平滑,提供了跨架构的通用鲁棒特征,从而全面补齐了跨架构迁移短板。
  • 避免单层迭代的过拟合陷阱:在算力分析中,单纯将基线 PGD 的迭代步数由 10 步增加至 40 步并不能提升黑盒迁移率(平均 ASR 反而从 8.24% 衰退至 8.00%),证明盲目强化单层白盒优化只会加剧替代模型特异性过拟合;BMAT 在相同 40 次反向传播预算下实现了 15.03% 的 ASR,验证了分层解耦优化的优越性。
  • 单替代模型零先验可用性:在完全不引入额外辅助架构(仅使用单个白盒 ResNet-50 的贝叶斯权重扰动采样作为伪替代模型)的极严苛设定下,BMAT 依旧比 PGD 基线取得了 30.17% 的平均 ASR 相对提升,证明该收益源于其优化动力学本身而非多模型集成红利。

亮点与洞察

  • 将割裂的攻击启发式策略提升为数学严谨的双层极小极大理论:传统对抗迁移往往停留在调参或增加数据增强技巧,BMAT 首次将初始扰动、对抗扰动和模型参数三元耦合关系建模为 Bilevel-Minimax 问题,为黑盒迁移攻击提供了系统的优化理论支撑。
  • 单步反向协同更新与共轭梯度近似的高效工程设计:在内层通过共享反向传播图实现模型软权重与扰动梯度的零额外开销计算,在外层利用 Fletcher-Reeves 隐式共轭梯度规避内层展开求导,以极低的显存与时间开销解决了双层优化难以在深度视觉模型落地的顽疾。
  • 突破密集预测任务的跨架构迁移壁垒:以往从视觉 Transformer(如 Segformer)迁移至 CNN 分割网络极其困难,BMAT 将受害者模型的 mIoU 压低了近一倍(由 20%~30% 压低至 10% 左右),展现了极强的泛化能力。

局限与展望

  • 二阶梯度近似的计算延迟:尽管 IGA 避免了计算图展开与显式海森矩阵存储,共轭梯度求解仍需要执行多轮海森-向量积计算,导致整体单样本耗时约为传统单层攻击的 1.5~2 倍。未来可探索更轻量的一阶近似或梯度记忆外推机制。
  • 任务通用性仍待扩展:当前实验重点评估了图像分类与语义分割任务,尚未直接验证在目标检测、3D 点云感知或多模态视觉大模型(VLM)对抗对齐上的表现。

相关工作与启发

  • 对比 RAP (NeurIPS 2022):RAP 仅在单层极小极大框架下通过显式反向对抗扰动寻找平坦区域,计算消耗随步数剧增且无法建模初始扰动动力学;BMAT 在双层框架下同时将初始化与替代模型权重解耦纳入优化闭环,在 1/10 算力下展现出明显更优的迁移率。
  • 对比 BETAK (IJCAI 2024):BETAK 尝试通过双层优化推导初始扰动,但严重依赖于大开销的模型集成与展开截断,显存消耗高达 22.69GB;BMAT 借助 SWM 的单模型内层对抗与 IGA 隐式求解,在显存仅 7.89GB 的条件下取得了更优秀的攻击表现。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ [首次将迁移对抗攻击系统化形式化为双层极小极大优化框架,从理论上破解了初始化、扰动与替代模型的割裂耦合难题]
  • 实验充分度: ⭐⭐⭐⭐⭐ [覆盖分类与分割两大任务、30 余个未知受害者模型、12 种主流攻击基线,包含全面的算力归一化测试与严谨消融分析]
  • 写作质量: ⭐⭐⭐⭐⭐ [数学推导严密规范,问题提出与算法求解环环相扣,实验表格与机理解释详实深入]
  • 价值: ⭐⭐⭐⭐⭐ [为黑盒物理安全评测提供了极其坚固且实用的攻击基准,同时为深度学习中的双层极小极大高效求解提供了范例]