跳转至

Breaking Rigidity in Adversarial Patch Attacks

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/visheshrajput2408/SmuDPatch.git
领域: AI 安全
关键词: 对抗补丁攻击, 物理对抗防御, 视觉语言模型, 形状变形优化, 鲁棒性评测

一句话总结

针对现有对抗补丁攻击与防御严重依赖矩形或圆形等刚性固定形状这一结构性盲区,本文提出基于向心 Catmull-Rom 样条与两阶段进化搜索的平滑形变通用补丁生成框架 SmuDPatch,不仅跨 CNN、ViT、VLM 与检测器展现出极强的迁移攻击能力,更揭示了现有防御模型与多模态大模型的脆弱性并提供了通用基准。

研究背景与动机

深度神经网络(DNN)与多模态视觉语言模型(VLM)已广泛应用于人脸识别、自动驾驶等安防与任务关键型领域,但其对输入中的对抗扰动仍展现出普遍脆弱性。在物理世界可行性最高的对抗补丁攻击中,早期研究如 Brown 等人构建的经典攻击与 Pintor 等人设计的 ImageNet-Patch,几乎全部预设补丁具有正方形、矩形或圆形等固定刚性几何形状。这种长期固化的研究范式反向诱导现阶段的对抗补丁检测器(如 NAPGuard、AdvPatchXAI)乃至通用多模态大模型(如 LLaVA-NeXT、SAM-3)对特定规则边界形成了严重的形状归纳偏差,导致现有安全评测产生虚假的安全感。

打破刚性形状的核心矛盾在于:如何在保持物理可制造性与平滑自然外观的前提下,生成适用于全数据集并能跨不同模型架构泛化的“通用”(Universal)可变形补丁。现有为数不多的可变形补丁方法(如 DAPatch)多采用针对单张图像单独联合优化形状与纹理的局部策略,不仅导致补丁轮廓极其杂乱尖锐、难以物理打印部署,而且完全丧失了针对未见图像与跨模型的通用攻击迁移性;此外,形状离散栅格化与平滑几何轮廓之间不可导的鸿沟,也限制了端到端梯度的直接驱动。

本文的切入角度是解耦几何与纹理:先利用低维径向参数化空间配合向心 Catmull-Rom 样条构建无尖点、无自交的封闭平滑轮廓,并在固定面积预算约束下通过进化搜索确定最优通用几何拓扑;随后在大模型集成与物理仿射变换下通过梯度下降精细学习通用对抗纹理。核心 idea:将通用对抗补丁解耦为「基于向心样条的低维径向进化形状搜索」与「基于模型集成的鲁棒纹理梯度优化」两阶段序列框架,构建兼顾平滑物理可行性与高迁移攻击力的通用非刚性对抗补丁 SmuDPatch。

方法详解

整体框架

SmuDPatch 的核心流程分为形状进化优化与物理鲁棒纹理优化两个阶段。输入为待攻击的目标类别 \(y_t\)、ImageNet 采样图像集以及模型集成池;第一阶段将补丁轮廓参数化为 25 维径向向量,借助向心 Catmull-Rom 样条插值形成光滑闭合掩码,并在固定像素面积比例下以进化算法搜索能使短轮迭代损失最小的最佳几何形态;第二阶段冻结搜索得到的最佳掩码,对其施加模拟物理环境的旋转、平移仿射变换,并在 ViT、ResNet50 与 MobileNetV2 组成的多模型集成梯度驱动下迭代优化对抗纹理,最终输出通用的物理平滑形变对抗补丁。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入目标类别 & 训练图像集"] --> B["低维径向参数化与样条平滑插值<br/>N=25 锚点 + Catmull-Rom 曲线"]
    B --> C["等面积归一化基准<br/>固定约束约 5% 图像像素面积"]
    C --> D["两阶段进化形状搜索<br/>快速内层纹理优化反推适应度"]
    D --> E["模型集成与仿射变换纹理优化<br/>多架构梯度累加 + 物理变换稳健化"]
    E --> F["输出通用平滑形变对抗补丁 SmuDPatch"]

关键设计

1. 低维径向参数化与样条平滑插值:消除几何自交与尖锐伪影

针对以往形变补丁直接在稠密二值像素网格上优化所引发的破碎、锯齿及非物理连通性缺陷,本文将补丁几何形状严格约束为围绕中心点 \(c = (c_a, c_b)\) 的闭合星形凸包拓扑。系统在 \([0, 2\pi)\) 范围内均匀固定 \(N=25\) 个角度采样方向 \(\theta_i = \frac{2\pi i}{N}\),将几何自由度完全收敛于低维径向距离向量 \(\mathbf{r} = [r_0, r_1, \dots, r_{N-1}]\),对应的边界锚点坐标由式 \(P_i = [c_a + r_i \cos\theta_i, c_b + r_i \sin\theta_i]^T\) 确定。若直接用折线连接锚点必然产生折角和尖刺,因此本文引入向心 Catmull-Rom 样条(Centripetal Catmull-Rom Spline, CCRS),任意连续两点间的曲线段均由四邻域锚点计算得到:

\[C_i = \text{CCRS}(P_{i-1}, P_i, P_{i+1}, P_{i+2})\]

由全体曲线段闭合合并构建出光滑边界 \(\mu_{con} = \bigcup_{i=0}^{N-1} C_i\)。向心样条从数学机制上杜绝了局部自交环路(loops)与尖点(cusps),使得生成的补丁形态如水滴或卵石般圆润自然,满足真实物理打印与贴附的可行性要求。

2. 等面积归一化基准:解耦几何外形与扰动预算

在评估对抗补丁攻击效能时,扰动占据的图像像素面积是直接影响分类器置信度的决定性超参数;若形状改变伴随面积膨胀,便无法客观证明几何变形本身的攻击增益。为此,SmuDPatch 在每次生成候选样条闭合轮廓 \(\mu_{con}\) 后,首先通过多边形离散栅格化计算其实际包围面积 \(A(\mu_{con})\),随后严格对齐至预设的目标预算面积 \(A_{\text{target}}\)(基准设定为 \(224 \times 224\) 图像的 \(5\%\),即 2508 像素,消融中扩展至 \(8\%\) 与 \(10\%\))。系统以中心点为原点对所有轮廓点施加径向缩放因子:

\[s = \sqrt{\frac{A_{\text{target}}}{A(\mu_{con})}}\]

通过严格的面积一致性对齐,排除了“面积占优导致攻击增强”的混淆变量,确保所有形变增益完全来源于几何外形对网络深层特征图空间感受野的破坏能力。

3. 两阶段进化形状搜索:以纹理可扰动潜力指导非导拓扑演化

由于多边形样条曲线采样、多边形栅格化(rasterization)与二值阈值化均属于数学上的不可导操作,传统端到端反向传播无法直接更新径向参数 \(\mathbf{r}\)。本文设计了基于种群的进化搜索算法(种群大小 30,演化 20 代),每个个体即为一个径向向量 \(\mathbf{r}^{(k)}\)。为了客观衡量某一种几何轮廓的“潜在攻击上限”,算法为候选轮廓临时初始化随机噪声纹理,固定形状执行极少步(short inner optimization)的梯度下降攻击优化,以该短时优化达到的目标交叉熵损失 \(L_{\text{shape}}(\mathbf{r})\) 反向定义形状个体的适应度函数:

\[F(\mathbf{r}) = \frac{1}{L_{\text{shape}}(\mathbf{r}) + \varepsilon}\]

适应度越高代表该几何轮廓越容易在有限梯度步数内诱导模型发生错误分类。每一代依据适应度排序淘汰后 \(50\%\) 个体,保留精英父代并通过单点交叉与高斯变异生成子代,在几何探索与计算开销间取得了平衡。

4. 模型集成与仿射变换纹理优化:打造物理通用与跨架构迁移性

当进化搜索收敛并确定最佳全局几何掩码 \(\mu\) 后,进入第二阶段的通用纹理深度优化。为了使同一物理补丁能无差别地诱导不同模型错分类至指定类别 \(y_t\),且能抵御物理世界中相机视角与贴附角度的变化,优化目标显式整合了随机仿射变换分布 \(\mathcal{T}\)(旋转区间限制在 \([-\pi/8, \pi/8]\),平移偏离中心 \(\pm 68\) 像素以内以避免边缘越界)以及由三种结构迥异的模型组成的集成池:卷积主干 ResNet50、轻量化网络 MobileNetV2 以及无卷积诱导偏置的纯注意力架构 Vision Transformer (ViT)。优化阶段的最小化目标为:

\[\min_\delta \sum_{f \in \mathcal{F}_{\text{ens}}} \sum_{x_i \in \mathcal{D}} \mathbb{E}_{A \sim \mathcal{T}} \left[ \mathcal{L}_{\text{CE}}\left( f(x_i \oplus A(\mu \odot \delta)), y_t \right) \right]\]

在每个迭代 epoch 中,梯度在整个模型集成池与变换样本上累加,更新通用补丁参数 \(\delta\),赋予了补丁对抗纹理对局部感受野与自注意力机制的双重压制能力。

损失函数 / 训练策略

在纹理优化阶段,采用带动量的随机梯度下降(SGD),学习率设为 1.0,训练轮数为 2000 个 epoch。针对每个目标类别,从 ImageNet 验证集中排除目标类本身,随机采样 20 个不同类别的图像构建精简优化集。在计算资源上,整个两阶段流水线在单块配备 48GB 显存的 NVIDIA RTX A6000 GPU 上的 PyTorch 环境中完成。

实验关键数据

主实验

评估在 ImageNet 5000 张测试子集(遵循 RobustBench 评测协议)上针对 10 个预设目标类别的物理对抗补丁进行,涵盖 15 个主流 DNN 分类模型,划分为集成组(ENS)、标准单模型组(Standard)、对抗训练防御组(Adv)、数据增强组(Augm.)和超大数据预训练组(More-Data)。

表 1 汇报了传统 DAPatch、圆形补丁(Circle)与本文提出的平滑形变补丁(SmuDPatch)在干净准确率(Clean Acc)、防御鲁棒准确率(Robust Acc,越低越好)与攻击成功率(ASR,越高越好)上的对比表现。

评估指标 MobileNetV2 (ENS) ResNet50 (ENS) ViT (ENS) ResNet18 (Standard) GoogLeNet (Standard) Wong et al. [53] (Adv) Hendrycks [17] (Augm.) Yalniz [58]-b (More-Data)
Clean Acc (%) 71.9 76.7 80.9 69.7 69.8 53.5 76.8 82.1
DAPatch Robust ↓ (%) 60.5 66.9 79.0 59.6 60.1 47.0 73.6 77.3
DAPatch ASR ↑ (%) 1.4 3.5 0.8 0.6 0.8 0.1 0.3 1.7
Circle Robust ↓ (%) 46.3 49.7 74.2 53.7 55.3 41.1 64.1 69.3
Circle ASR ↑ (%) 17.9 27.9 7.4 2.3 4.0 0.2 5.8 8.7
SmuDPatch Robust ↓ (%) 31.6 28.5 65.5 45.5 46.0 38.4 52.2 56.8
SmuDPatch ASR ↑ (%) 44.2 62.1 20.4 12.0 18.4 0.2 24.2 26.9

消融与防御穿透实验

为了验证形状刚性破坏对前沿物理防御模型与多模态大模型的隐蔽穿透力,下表对比了通用方形补丁(Square)与 SmuDPatch 在前沿基于提示的分割大模型 SAM-3(8000 张图像,文本提示为 adversarial patch)以及下游通用目标检测器(5 种 SOTA 检测器)中的跨模态表现。

评测对象 / 架构 评估指标 刚性方形补丁 (Square) / Clean 平滑形变补丁 (SmuDPatch) 性能变化 / 降幅分析
SAM-3 分割检测 [6] mIoU (%) 39.54 9.41 相对断崖式下跌 -76.2%
SAM-3 分割检测 [6] mDice (%) 39.84 9.56 语义重合度暴跌 -30.28%
SAM-3 分割检测 [6] 检出命中数 (Dets/8000) 3212 / 8000 778 / 8000 检出率从 40.2% 萎缩至 9.7%
目标检测 Faster R-CNN mAP (%) 36.88 (Clean) 32.50 跨任务迁移导致性能掉点 -4.38
目标检测 YOLO-v11 mAP (%) 45.66 (Clean) 35.09 纯分类生成的补丁使检测掉点 -10.57
目标检测全网络平均 Average mAP (%) 41.86 (Clean) 36.63 未针对检测优化依然掉点 -5.23

关键发现

  • 形变补丁的通用化破局:在通用攻击设定下,单图优化的代表方法 DAPatch 彻底失效(在 ResNet50 上 ASR 仅为 3.5%);而 SmuDPatch 凭借解耦进化与平滑样条建模,在 ResNet50 上取得了 62.1% 的超高定向 ASR,将鲁棒准确率猛降至 28.5%,证明非刚性补丁完全可以兼备通用性与高攻击力。
  • 先进多模态与防御机制的严重盲区:针对基于提示的通用分割大模型 SAM-3,SmuDPatch 的 mIoU 仅有 9.41%(矩形补丁为 39.54%),8000 次测试中漏检多达 7222 次;多模态 VLM(LLaVA-NeXT)对矩形补丁检出 1704 次,但对 SmuDPatch 骤降至 765 次;专业补丁防御模型 NAPGuard 的 mAP 也从 64.07% 暴跌至 45.97%,坐实了现有防御普遍过度过拟合于规则几何外形。
  • 物理世界与跨任务迁移性:在四类实体日用品(橙子、刀、鼠标、遥控器)的 120 张物理实测图像中,ResNet50 的准确率从 66.6% 骤降至 2.5%,ViT 从 74.17% 降至 31.67%;且在未经目标检测针对性优化的前提下,直接致使 YOLO-v11 的 mAP 出现 10.57 的显著下降。

亮点与洞察

  • 向心样条参数化破除了“形变必破碎”的物理死穴:通过 25 维极坐标锚点与向心 Catmull-Rom 样条插值,在严格杜绝自交与尖角的同时保持了边界连续可控,使可变形补丁真正具备了可实际裁剪、打印和实物贴附的工程落地价值。
  • 反直觉的“两阶段序列胜过联合端到端”:论文巧妙规避了多边形光栅化不可导引发的梯度阻断瓶颈,证明通过短迭代内层纹理反馈指导外层几何进化,足以搜索出最优空间感受野拓扑,解耦设计远比强行松弛软掩码的联合优化更具稳定性。
  • 向防御社区提供高质量大尺度非刚性对抗基准:构建了包含 100,000 张 ImageNet-Patch 图像与 40,000 张 COCO OOD 物理形变补丁评测集,为学术界彻底破除刚性形状防御偏见、研发新一代结构不可知(shape-agnostic)防御算法奠定了关键基石。

局限与展望

  • 作者承认的局限:相较于白盒针对单一架构过拟合攻击,当前 SmuDPatch 的跨架构平均 ASR 仍有提升空间(例如在强对抗防御模型与特定视觉 Transformer 上的绝对定向攻击成功率相对较低)。
  • 实验与设定层面的局限:虽然在 120 张物理实物图像上完成了测试,但物理测试未全面引入光照剧烈变化、镜头大角度倾斜以及曲面布料褶皱等复杂真实环境仿真;此外,进化算法需要多次种群评估与短时纹理优化,单类补丁的生成时间成本显著高于固定形状补丁。
  • 具体改进方向:可进一步探索文中提出的可微平滑变体(Laplacian 金字塔混合与可微软掩码),将其与物理渲染器(Differentiable Renderer)深度融合,实现纹理环境自适应融合;同时可引入基于强化学习的多模态反馈,直接以多模态大模型的隐蔽度打分指导形状演进。

相关工作与启发

  • vs Brown et al. (2017) & Pintor et al. (2023) (ImageNet-Patch): 传统工作严格限定补丁为矩形或圆形等固定刚性几何,使模型防御产生假性安全;SmuDPatch 首次在通用攻击设定下实现平滑可变形拓扑,证明形状多样性对打破网络鲁棒性至关重要。
  • vs DAPatch (Chen et al., ECCV 2022): DAPatch 采用基于单图的单点射线多边形优化,形状边缘极其尖锐不自然且严重过拟合于单张图像,在全数据集通用攻击评测中近乎完全失效(ASR 仅 0.6%~3.5%);SmuDPatch 采用星形向心样条与进化搜索,生成平滑闭合且具备强大泛化能力的通用补丁(ASR 达 62.1%)。
  • vs NAPGuard [55] & AdvPatchXAI [24]: 现有 SOTA 防御模型针对固定形状补丁表现优异,但在面对平滑形变补丁时检测精度大幅滑坡(NAPGuard mAP 下降达 14.1%~29.9%);提示防御研究需摆脱对规整几何轮廓的特征依赖。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次系统性破除通用对抗补丁的刚性形状假设,提出基于向心样条与进化搜索的平滑形变攻击方案。
  • 实验充分度: ⭐⭐⭐⭐⭐ 覆盖 15 个分类模型、5 大检测器、SAM-3/LLaVA 等大模型、14 万张大尺度测试集以及 120 张物理实物测试。
  • 写作质量: ⭐⭐⭐⭐☆ 逻辑清晰,对几何参数化公式与图表对比阐述极为详尽,兼顾攻击效能与防御启示。
  • 价值: ⭐⭐⭐⭐⭐ 揭示了现有模型乃至前沿大模型对非刚性对抗特征的深层盲区,对构建下一代可信通用防御体系极具指引意义。