跳转至

Deformable and Multi-view Gradient-Aligned Physical Adversarial Camouflage

会议: ECCV 2026
论文: ECCV 2026 官方页面
领域: AI 安全
关键词: 物理对抗攻击, 3D 对抗伪装, 目标检测, 可变形纹理场, 一阶元优化

一句话总结

针对 3D 物理对抗伪装中视点离散更新导致的局部空间断裂与多视点破坏性梯度冲突两大难题,本文提出解耦内容与几何形变的可变形纹理场(DTF),并结合多步轨迹一阶元优化策略(GAMO)隐式最大化跨视点梯度对齐,显著提升了全向物理对抗伪装的泛化性与鲁棒性。

研究背景与动机

深度神经网络在现代目标检测系统(如自动驾驶与全景监控)中扮演着不可替代的角色。然而,深层检测器高度依赖局部特征线索的脆弱特性,使得其极易受到对抗样本的干扰。相比于受限于特定视角和安装平面的 2D 对抗补丁,全车身 3D 物理对抗伪装旨在优化目标三维网格表面贴图,实现全方位、多视角的持续逃逸。然而,由于 2D 静态纹理参数空间与 3D 动态物理观测视角之间存在固有的维度结构失配,在真实世界中合成鲁棒且连续的 3D 物理对抗贴图极具挑战性。

这种优化困难在物理渲染管线中集中表现为两大根本矛盾。其一为空间梯度的离散不连贯性:由于三维几何遮挡与视角投射,反向传播的梯度在每次迭代中仅回传至当前可视表面;这种由稀疏可见性引起的异步更新破坏了相邻像素间的空间相关性,诱发脆弱的高频噪点与纹理撕裂,导致在真实物理世界的抗扰动能力极差。其二为多视点梯度的方向冲突:在联合优化全向视点分布时,截然相反的视角(例如车头与车尾)产生的梯度常常呈现负余弦相似度。传统的联合优化或顺序更新机制仅仅简单累加或平均各个视角的梯度,引发严重的破坏性相互干扰(destructive interference),导致模型参数在局部鞍点振荡或发散,难以收敛到多视角共享的有效逃逸解空间。

针对上述两大约束,本文转换了优化思路:既不退回僵硬固定的刚性网格,也不依赖昂贵的显式多任务梯度投影。核心 idea:将 3D 贴图解耦为由低分辨率内容网格与几何形变场联合驱动的连续可变形纹理场(DTF),并基于多步局部探索轨迹设计梯度对齐元优化(GAMO),隐式最大化不同视点梯度的内积以引导参数收敛至协同防御逃逸流形。

方法详解

整体框架

本文提出的物理对抗伪装生成框架整体包含两大核心协同机制:前向合成端的可变形纹理场(Deformable Texture Field, DTF)与反向优化端的梯度对齐元优化(Gradient-Aligned Meta-Optimization, GAMO)。在参数表示上,算法放弃直接优化离散的高分辨率像素贴图,将其解耦为低分辨率内容网格(Content Grid)与流网格(Flow Grid)。通过双线性插值获得全分辨率密集变形场后进行可微逆向重采样,既引入平滑先验又允许几何自适应形变。在训练迭代中,框架将不同视点聚类视为独立子任务,在内循环执行局部视角的多步对抗探索更新,并在外循环利用探索位移执行元更新,隐式诱导跨视点梯度的同向对齐。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["初始化全局参数<br/>Θ = {内容网格 C, 流网格 F}"] --> B["可变形纹理场合成<br/>双线性密集形变场 + 逆向重采样"]
    B --> C["可微物理渲染<br/>网格 M 投影至多视点图像"]
    C --> D["局部多步探索轨迹<br/>重置动量并在当前视点迭代更新 k 步"]
    D --> E["梯度对齐全局元更新<br/>轨迹位移聚合与跨视点内积隐式最大化"]
    E --> F["输出高鲁棒物理伪装贴图 T"]

关键设计

1. 可变形纹理场:连续平滑先验与几何自适应表征的统一 针对像素级优化在稀疏可见性下产生高频噪点与空间撕裂的弊端,以及固定网格划分对表达能力的僵硬约束,本文将全分辨率纹理图 \(T \in \mathbb{R}^{H \times W \times 3}\) 解耦为两个低分辨率可学习控制网格:编码基础色彩模式的内容网格 \(C \in \mathbb{R}^{H' \times W' \times 3}\) 和编码局部几何偏移的流网格 \(F \in \mathbb{R}^{H' \times W' \times 2}\)(其中 \(H', W' \ll H, W\),例如实验中采用 \(64 \times 64\) 网格合成 \(2048 \times 2048\) 贴图)。系统首先通过双线性插值算子 \(\Phi\) 将稀疏流网格上采样为全分辨率密集形变场 \(\Delta P \in \mathbb{R}^{H \times W \times 2}\): $\(\Delta P(u) = \Phi(F)(u), \quad \forall u \in \Omega_{tex} = [0, 1]^2\)$ 随后利用可微逆向采样机制计算每个目标像素位置在内容网格空间中的对应坐标 \(p' = u + \Delta P(u)\),并通过对内容网格上最近邻的 4 个整数网格节点进行双线性插值合成最终颜色。双线性插值运算天然地将空间平滑性硬编码进参数化空间,保证相邻像素即使在不连续视角梯度监督下仍保持协同更新。同时,流网格 \(F\) 允许局部纹理模式发生弹性弯曲形变,使伪装图案能够自适应地将表现容量集中在显著的对抗语义区域,大幅拓宽了有效解空间。为避免产生过度扭曲而破坏实际打印可行性,施加 \(L_2\) 正则项 \(\mathcal{L}_{reg}(F) = \|F\|_2^2\) 约束形变幅度。

2. 梯度对齐元优化:基于轨迹动力学的跨视角无冲突收敛 传统多视角联合训练在简单平均各视角损失梯度时,由于跨视角梯度负余弦相似度导致破坏性相互抵消。本文将多视角伪装优化重构为双层元学习架构,定义全局元参数 \(\Theta = \{C, F\}\) 与局部探索参数 \(\phi\)。在每个训练回合中,首先令 \(\phi_0 \leftarrow \Theta\),并严格清空内循环优化器的历史动量状态以消除跨视角历史偏差;随后在当前采样的视点 \(v_t\) 下连续执行 \(k\) 步局部对抗优化: $\(\phi_{t+1} \leftarrow \phi_t - \eta \nabla_{\phi} \mathcal{L}(\phi_t, v_t)\)$ 该过程在局部损失曲面内累积动量探索多步轨迹,产生的净位移 \((\phi_k - \phi_0)\) 蕴含了该视角局部曲率的高阶导数信息。外循环根据此位移更新全局参数 \(\Theta \leftarrow \Theta + \epsilon (\phi_k - \Theta)\)。根据一阶元学习泰勒展开分析,该更新方向在数学上等价于有效逼近如下修正目标: $\(\Delta \Theta \approx -\mathbb{E}[g_i] + \frac{\eta(k - 1)}{4} \nabla_{\Theta} \mathbb{E}[g_i \cdot g_j]\)$ 其中第一项是传统的期望对抗损失梯度,而第二项则是内循环多步展开自然涌现的高阶梯度项,形式上精确等价于跨视点梯度内积 \(g_i \cdot g_j\) 的最大化正则项。该机制无需昂贵的二阶 Hessian 计算或复杂的每步梯度投影求解,即可引导参数自发收敛至梯度方向协同一致的鲁棒参数流形。

损失函数 / 训练策略

整个优化框架端到端运行。单步渲染与攻击损失函数由对抗逃逸损失和纹理形变正则项组成: $\(\mathcal{L} = \mathcal{L}_{adv}(f(\mathcal{R}(M, T, v)), y_{gt}) + \lambda \mathcal{L}_{reg}(F)\)$ 其中 \(\mathcal{L}_{adv}\) 旨在压低目标检测器 \(f\) 对前景真实类别 \(y_{gt}\) 的边界框置信度,\(\mathcal{R}\) 代表基于 PyTorch3D 的多视点可微渲染器,遮挡表面应用二值可见性掩码过滤无效反向传播。超参数设置上,内容与形变控制网格分辨率设为 \(64 \times 64\),形变正则化权重 \(\lambda = 0.01\),内循环探索步数 \(k = 16\),内循环学习率 \(\eta = 0.1\),单卡 NVIDIA A100 仅需训练 3 个 epoch 即可稳定收敛。

实验关键数据

主实验

在 CARLA 模拟驾驶环境(以 Audi E-Tron 为目标车辆,20,000 张随机视角与距离图像)及 1:24 比例物理模型打印实测中,论文全面对比了主流 3D 对抗伪装方案。检测性能评估采用目标类别的平均精度 [email protected](%),数值越低表明伪装隐匿与攻击效果越强。

下表展示了白盒模型 YOLOv3 训练出的伪装贴图在五大多样化黑盒目标检测器上的跨架构迁移性表现(涵盖现代卷积网络、视觉 Transformer 及视觉语言大模型):

方法 RTMDet ConvNeXt GLIP DINO Grounding DINO
Normal(无攻击) 94.49 95.36 96.24 85.95 91.24
DAS 92.61 83.92 95.54 79.11 83.69
FCA 71.56 56.95 82.58 60.26 72.12
DTA 72.18 61.02 80.84 35.12 62.60
ACTIVE 67.69 55.13 81.99 41.42 59.92
RAUCA 51.03 37.68 60.12 28.55 40.96
GRAC 52.90 32.66 41.42 23.03 47.39
Ours 45.44 27.84 43.72 13.36 35.56

在真实物理环境实物实验中(1:24 车模在全向多视点视频流下的评估,涵盖 0°、20°、45° 仰角),本文方案在白盒与黑盒模型下均实现最低的 [email protected]:

方法 YOLOv3 (0°) YOLOv3 (20°) YOLOv3 (45°) Faster R-CNN (0°) Faster R-CNN (20°) Faster R-CNN (45°)
Normal 98.01 94.70 88.08 99.45 97.42 94.70
DAS 85.43 68.21 73.51 91.39 84.77 80.79
FCA 72.85 52.32 54.30 98.01 84.77 68.87
DTA 68.87 43.71 35.10 89.40 80.79 60.93
ACTIVE 45.77 42.02 29.30 79.47 64.90 41.72
RAUCA 39.74 29.30 23.39 78.15 60.26 30.45
GRAC 41.72 26.44 20.53 74.17 54.30 27.08
Ours 34.53 23.39 18.53 70.20 41.15 23.39

消融实验

为验证可变形纹理场(DTF)与梯度对齐元优化(GAMO)两项模块的独立效能与协同互补性,论文在数字仿真环境下评测了各组合在不同仰角与检测器下的表现:

DTF GAMO YOLOv3 (0°) YOLOv3 (20°) YOLOv3 (45°) Faster R-CNN (0°) Faster R-CNN (20°) Faster R-CNN (45°) PVT (0°) PVT (20°) PVT (45°)
× × 61.70 42.02 17.06 85.17 41.15 20.70 80.12 46.65 25.82
✓ × 33.06 18.95 9.26 57.92 20.96 15.79 56.42 24.52 11.67
× ✓ 40.13 12.08 7.71 66.53 22.92 8.32 62.22 18.06 10.13
✓ ✓ 19.05 2.19 1.80 42.92 9.01 1.04 41.30 11.67 1.41

进一步固定 DTF 参数化表征,横向对比不同多任务梯度冲突处理算法:

梯度冲突优化策略 [email protected] (%) ↓ 跨视角梯度余弦相似度 ↑ 冲突比例 (Conflict Ratio) ↓
DTF (标准平均梯度) 40.26 0.0048 0.4871
DTF + PCGrad 20.25 0.0051 0.4709
DTF + MGDA 13.42 0.0063 0.4507
DTF + GRAC 12.34 0.0055 0.4494
DTF + GAMO (Ours) 7.68 0.0070 0.4345

关键发现

  • 单独引入 DTF 使 YOLOv3 在 0° 仰角下的 [email protected] 从 61.70% 直降至 33.06%,证明连续流插值机制极大消除了像素离散更新引发的高频脆弱噪点;单独引入 GAMO 则将该指标降低至 40.13%,验证了多视点冲突抑制的关键作用。两模块联合时,[email protected] 迎来断崖式下降至 19.05%(45° 俯角下甚至逼近 1.80%),表明空间连续性与多视角优化稳定性之间具有强大的正交乘数效应。
  • 在固定表征的梯度冲突算法横向对比中,GAMO 不仅取得最低的 AP(7.68%),还将平均跨视点梯度余弦相似度推升至最高(0.0070),梯度冲突率降至最低(0.4345),相比 PCGrad 与 MGDA 展现出压倒性的跨视点协同能力。
  • 在计算开销方面,GAMO 的单步计算量(140.84 GFLOPs, 135.17 ms)显著低于基于权重调整的 GRAC(8505.60 GFLOPs, 430.10 ms)与重度物理仿真的 RAUCA(973.21 GFLOPs, 265.67 ms),由于外循环仅为向量差分加权,未增加复杂的 Hessian 逆矩阵运算,具备极高工程实用价值。

亮点与洞察

  • 将一阶元学习内生的高阶对齐特性引入 3D 物理对抗领域:巧妙利用多步局部内循环位移展开自然涌现的 \(\nabla_\Theta (g_i \cdot g_j)\) 项,无需高计算复杂度的梯度投影求解器即可在几何全视角空间实现隐式梯度对齐。
  • 可微低分辨率流形重采样破解空间撕裂难题:以极低参数量的控制网格和可微流场(Flow Grid)替代像素优化,在严密保留平滑先验的同时通过自适应几何形变扩充局部特征扰动空间,同时天然适应实际喷涂与打印约束。
  • 可复用的通用设计:DTF 的解耦流场设计与 GAMO 的多任务无冲突元优化框架不仅可用于车辆对抗伪装,亦可直接迁移至一般三维物体表面的神经渲染拟合、多视角三维隐式表面对抗防御与跨域泛化攻击任务。

局限与展望

  • 真实光度与材质交互假设简化:当前物理渲染主要聚焦于几何视角变换与基础光照映射,未深入建模非朗伯体表面(如高光反射、各向异性涂层)及极端雨雪雾散射物理模型。
  • 双层元优化超参数敏感性:内循环步数 \(k\) 与学习率 \(\eta\) 对局部曲率探索具有较强依赖性,过大的 \(k\) 可能引发局部过拟合与内循环漂移,而过小则无法积累足够的梯度对齐高阶信息。
  • 未来方向:探索结合可微神经辐射场(NeRF)与 3D 高斯泼溅(3DGS)的材质交互对抗表征,并进一步研究针对多模态开放词表检测器的自适应文本语义对齐对抗纹理生成。

相关工作与启发

  • vs FCA / DAS: 早期方法直接在 2D UV 展开图上逐像素施加扰动,受制于视角遮挡与离散不连续性,极易过拟合特定数字视角且抗真实打印失真能力弱;本文的 DTF 保证了先验连续性并带来几何自适应表现力。
  • vs GRAC / PCGrad: PCGrad 与 GRAC 依赖显式的跨任务梯度投影或复杂的动态重加权方案,视点数量增多时计算开销与显存占用激增;本文的 GAMO 凭借一阶多步探索隐式实现更高质量的梯度对齐,算力消耗下降一个数量级。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次提出将可变形纹理场与一阶元学习隐式梯度对齐相结合解决 3D 物理对抗伪装瓶颈,理论分析清晰优雅。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 CARLA 大规模仿真、5 种主流跨范式黑盒检测器迁移、消融与梯度对齐深度分析,以及 1:24 比例真实车模物理实测。
  • 写作质量: ⭐⭐⭐⭐⭐ 问题定义直指痛点,数学推导完备自洽,图表与实验设置高度严谨。
  • 价值: ⭐⭐⭐⭐⭐ 深刻揭示了当前先进物体检测器在全视角物理世界的安全脆弱性,为自动驾驶与安防系统的物理防御评测提供了强基线。