跳转至

Generating Multi-view Adversarial Examples for Visual Geometry Grounded Transformer

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/qsong2001/mvap-g
领域: 3D视觉
关键词: 对抗攻击、3D视觉基础模型、多视角对抗扰动、VGGT、几何一致性

一句话总结

针对视觉几何大模型 VGGT 在多视角 3D 重建中的安全脆弱性,本文提出首个无需测试时迭代优化的前向多视角对抗扰动生成器 MVAP-G,通过跨视角对抗对齐与 DPT 多尺度解码,实现毫秒级生成多视角一致且肉眼不可见的对抗样本,使重建点云向原点塌陷并导致几何位姿全面崩塌。

研究背景与动机

随着 Visual Geometry Grounded Transformer (VGGT) 等 3D 视觉基础模型的兴起,多视角图像输入能够在单次前向传播中同时推断出精确的 3D 点云、深度图和相机位姿,极大地推进了自动驾驶、机器人导航与 SLAM 等安全关键领域的发展。然而,基础模型在享受强大几何表征能力的同时,其对对抗扰动的鲁棒性也面临严峻挑战。现有的 3D 对抗攻击手段主要依赖针对特定场景的逐实例迭代优化(如 PGD / FGSM 扩展),计算开销极大,单场景优化耗时往往高达数分钟,完全无法适应真实动态物理世界中连续变化的场景流。

通用的通用对抗扰动(Universal Adversarial Perturbations, UAPs)虽然能够提供“一次计算、处处适用”的极低推理开销,但由于其采用静态、与输入内容解耦的加性噪声模式,在面对包含复杂几何视差与多视角对应关系的 VGGT 时严重失效,无法跨多视角维持破坏力。另一方面,传统面向 2D 图像的生成式对抗网络(如 ATN、GAP)天然针对单张图像设计,既缺乏视角间的信息交互机制,也无法建模多视角输入下的三维几何相关性,导致扰动在穿过多视角 Transformer 的交叉注意力层时被几何融合机制轻易平滑与稀释。

面对这一困境,研究的核心诉求在于:如何在完全无需测试时迭代优化的前提下,仅靠单次前向推理就能自适应地输出具备视角间几何一致性、高攻击破坏力且肉眼不可见的多视角对抗扰动。核心 idea:设计一种基于 Transformer 架构与 DPT 密集预测头的前向多视角对抗扰动生成器 MVAP-G,通过跨视角对抗对齐(CAA)显式建模多视角间交互,并结合几何塌缩损失与动态感知正则化,实现毫秒级多视角一致对抗样本生成。

方法详解

整体框架

MVAP-G 的目标是给定输入多视角图像序列 \(\mathcal{S} = \{I_t\}_{t=1}^T\),在单次前向传播中直接预测对应的多视角扰动 \(\{\delta_t\}_{t=1}^T\),并约束每个视角的扰动幅度满足 \(\|\delta_t\|_\infty \le \epsilon\)。扰动注入后的图像 \(\hat{I}_t = I_t + \delta_t\) 送入预训练且参数冻结的 VGGT 模型 \(\mathcal{F}\) 后,使其输出的 3D 属性(特别是点云 \(\hat{P}\)、深度图和相机位姿)产生剧烈失真。

整个生成器采用 Transformer 编码器与 Dense Prediction Transformer (DPT) 解码头相结合的架构。多视角图像首先按 \(16 \times 16\) 分块并结合可学习的相机嵌入编码为初始 token;随后输入到融合了跨视角对抗对齐(CAA)的 Transformer 层中进行全序列跨视角几何交互;最后多层中间特征被抽取并通过多尺度 Reassemble 阶段逐步上采样和细化,输出全分辨率的无界扰动图,在推理时经截断后得到最终的对抗扰动。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["多视角输入序列 S = {I_t}<br/>分块嵌入 + 相机位姿编码"] --> B["跨视角对抗对齐 (CAA)<br/>自注意力与跨视角注意力联合交互"]
    B --> C["DPT 密集解码与特征重组<br/>抽取第 3/6/9/12 层特征逐级上采样"]
    C --> D["动态感知正则与截断裁剪<br/>LPIPS 控制感知隐蔽性 + 投影至 ε-ball"]
    D --> E["生成扰动序列 {δ_t} 叠加输入<br/>前向攻击冻结的 VGGT 模型"]
    E --> F["几何塌缩对抗目标<br/>引导输出 3D 点云收缩至原点 (0,0,0)"]

关键设计

1. 跨视角对抗对齐:建立全局视角交互以击破几何融合防御

VGGT 之所以对传统单视角或静态 UAP 扰动具备天然抵抗力,原因在于其内部的跨视角注意力机制能够聚合多视角冗余信息,从而自动平滑掉视角间不协调的局部孤立噪声。若要对多视角基础模型造成致命破坏,生成的扰动必须具备视角间的内容条件化与几何相关性。

MVAP-G 在 Transformer 主干的每一层引入了跨视角对抗对齐机制(Cross-view Adversarial Alignment, CAA)。对于第 \(l\) 层中的第 \(t\) 个视角,输入特征 token \(z_t^{(l-1)} \in \mathbb{R}^{N_p \times D}\)(其中 \(N_p = \frac{H}{16} \times \frac{W}{16}\),维度 \(D=384\)),CAA 计算该视角与全序列所有视角 \(k \in \{1, \dots, T\}\) 之间的注意力贡献总和: $\(A_t^{(l)} = \sum_{k=1}^T \mathbf{A}_{tk}^{(l)} = \sum_{k=1}^T \text{softmax}\left(\frac{\mathbf{z}_t^{(l-1)} (\mathbf{z}_k^{(l-1)})^\top}{\sqrt{D}}\right) \mathbf{z}_k^{(l-1)}\)$ 当 \(t = k\) 时退化为单视角内部的自注意力(捕获局部语义与纹理空间关系);当 \(t \neq k\) 时则执行跨视角交互(捕获视差、相对几何对应与可见性关系)。随后通过残差与 LayerNorm 更新特征:\(\mathbf{z}_t^{(l)} = \text{LayerNorm}(\mathbf{z}_t^{(l-1)} + \mathbf{A}_t^{(l)})\)。CAA 机制确保了生成的扰动不是割裂的单图伪影,而是协同变化的几何对抗波纹,彻底摧毁了 VGGT 利用多视角互补性修正几何预测的能力。

2. DPT 密集预测头与多尺度重组:高保真像素级扰动合成

为了将离散的 patch 级深层表征无损还原为连续且精细的像素级扰动,MVAP-G 避免使用简单的反卷积或浅层线性投影,而是借鉴了 Dense Prediction Transformer (DPT) 的分层重组机制。

生成器分别从编码器的第 3、6、9、12 层引出特征,通过可学习的读出矩阵 \(W_{\text{readout}}^{(l)}\) 映射为多尺度特征表示 \(\mathbf{h}_t^{(l)} \in \mathbb{R}^{N_p \times D}\)。接着,模型设计了 4 阶段的 Progressive Reassemble 流程(\(s=1 \sim 4\)),将各层特征与可学习的融合 token(\(K_s \in \{1, 4, 16, 64\}\))拼接并通过线性投影,逐级上采样到 \(H/2^s \times W/2^s\) 分辨率。在最终阶段,接入轻量级细化模块(包含 \(3 \times 3\) 深度可分离卷积与 \(1 \times 1\) 卷积),输出与原图尺寸完全相同的无界扰动 \(\tilde{\delta}_t \in \mathbb{R}^{H \times W \times 3}\)。在测试阶段,直接通过严格的数值截断算子 \(\delta_t = \text{clip}(\tilde{\delta}_t, -\epsilon, \epsilon)\),在确保符合 \(L_\infty \le \epsilon\) 扰动预算的同时保留了跨频段的高频攻击模式。

3. 几何塌缩对抗目标与两阶段渐进正则化:兼顾攻击杀伤力与视觉隐蔽性

设计针对 3D 基础模型的有效损失函数是攻击成功的核心。传统的 Chamfer Distance 目标计算复杂度高且优化梯度容易弥散。本文发现,破坏 3D 几何最直接且具普遍杀伤力的方式是将所有 3D 点坐标向原点 \((0,0,0)\) 强制拉扯坍缩。

为此,对抗攻击损失 \(\mathcal{L}_{\text{adv}}\) 直接定义为对抗点云 \(\hat{P}\) 的平均 \(L_2\) 范数最小化: $\(\mathcal{L}_{\text{adv}} = \frac{1}{|\hat{P}|} \sum_{p \in \hat{P}} \|p\|_2\)$ 这一损失能够迅速剥夺点云的空间方差与外接包围盒体积。然而,直接无节制地最小化该损失会导致生成器输出极为显眼的伪影,破坏不可见性。作者为此构建了多组件感知正则化损失: $\(\mathcal{L}_{\text{reg}} = \sum_{t=1}^T \left( \text{LPIPS}(\hat{I}_t, I_t) + \text{ReLU}(\|\delta_t\|_\infty - \epsilon) \right)\)$ 其中 LPIPS 在深度特征空间中严格约束扰动前后图像的感知距离,ReLU 项则在训练阶段施加软截断惩罚。总优化目标为 \(\mathcal{L}_{\text{total}} = \mathcal{L}_{\text{adv}} + \lambda \mathcal{L}_{\text{reg}}\)

损失函数 / 训练策略

整个优化流程分为两阶段训练策略: 1. 单视角大规模预训练阶段:在 COCO 数据集上使用 AdamW 优化器(学习率 \(1 \times 10^{-5}\))预训练生成器 400 万次迭代(4M iterations)。为了让模型先建立起对图像纹理与底层攻击先验的敏锐感知,在前 240 万次迭代中暂不加入正则化损失,直到第 2.4M 步时引入 \(\mathcal{L}_{\text{reg}}\) 共同优化,大幅降低直接在多视角数据集上从头端到端训练的收敛难度。 2. 多视角几何微调阶段:在 7 个真实与合成 3D 数据集(CO3Dv2、BlendMVS、ScanNet、Virtual KITTI、DTU、ETH3D、FlyingThings3D)上进行多视角微调。每个批次随机采样 2 到 10 个视角,输入图像最大分辨率缩放至 518 像素(与 VGGT 预处理对齐)。全流程仅需单张 NVIDIA RTX 4090 GPU 训练约 20 天,即可获得普适于任意未知场景的高效生成器。

实验关键数据

主实验

攻击效果通过衡量对抗点云相对于干净输入重建点云的偏移 Chamfer Distance (Shifted CD) 进行评测,数值越高表示攻击破坏程度越彻底。对比基准包括高斯随机噪声(Gaus. noise)、通用对抗扰动(UAP)以及基于迭代优化的经典对抗攻击 AP(分别优化 10 步与 20 步)。

方法 单前向步数 COCO (v=1) ImageNet (v=1) LLFF (v=1) LLFF (v=4) LLFF (v=8) LLFF (v=16) LLFF (v=25) CO3D (v=1) CO3D (v=4) CO3D (v=8) CO3D (v=16) CO3D (v=25)
Gaus. noise 1 0.534 0.505 0.912 0.900 0.941 0.949 0.982 0.678 0.666 0.671 0.632 0.672
UAP 1 0.565 0.556 0.940 0.964 0.980 1.010 1.043 0.673 0.675 0.671 0.673 0.659
AP (iter=10) 10 1.361 1.349 1.841 1.769 1.803 1.870 1.834 1.442 1.718 1.890 1.643 1.913
AP (iter=20) 20 1.535 1.584 1.842 1.811 1.817 1.882 1.925 1.889 1.892 1.958 1.875 2.000
MVAP-G (本文) 1 1.566 1.611 1.975 1.885 1.857 1.922 1.910 1.995 2.016 2.011 1.999 2.047

消融实验

消融实验验证了预训练策略、DPT 解码头、跨视角对抗对齐(CAA)以及感知正则化损失 \(\mathcal{L}_{\text{reg}}\) 对模型破坏力与隐蔽性的综合影响(指标为 1、2、4 视角下的平均值):

实验配置 攻击性能: CD ↑ 攻击性能: \(\mathcal{L}_{\text{adv}}\) 隐蔽性: PSNR ↑ 隐蔽性: LPIPS ↓ 说明
Baseline (Conv+Linear 解码) 0.58 0.400 21.1 0.400 无预训练/CAA/正则项,攻击力极度匮乏
+ Pre-training (COCO 预训练) 1.40 0.250 20.8 0.435 带来最大的攻击力增幅(CD 从 0.58 跃升至 1.40)
+ DPT head (密集预测重组头) 1.68 0.120 20.5 0.478 细化多尺度像素级扰动,进一步降低对抗损失
+ CAA (跨视角对抗对齐) 1.75 0.008 20.3 0.512 引入视角间几何交互,\(\mathcal{L}_{\text{adv}}\) 直降至 0.008
+ \(\mathcal{L}_{\text{reg}}\) (完整模型) 1.78 0.008 29.8 0.107 PSNR 飙升至 29.8 dB,LPIPS 大降至 0.107,完美隐形

关键发现

  • 推理效率与显存占用出现断代级跃升:传统迭代 AP 随着输入视角数增加(1 到 25 视角),每场景单次攻击需耗费 25 到 200 秒,且峰值显存飙升突破 30 GB;而 MVAP-G 仅需单次前向传播,推理时间稳定在 50 至 500 毫秒(ms 级),显存占用始终被压制在 14 GB 以下,具备真正的实时攻击能力。
  • 跨视角交互对抗几何聚合:在 \(v=32\) 大视角数量极端情况下,若去除 CAA 模块,VGGT 的多视角注意力机制能够部分重建出碎裂但依然可辨识的场景骨架;而在 CAA 完整驱动下,多视角扰动保持了深层几何协同,导致重建结果彻底粉碎为毫无结构的坍缩点云。
  • 几何崩溃的多米诺效应:虽然训练仅监督点云损失 \(\mathcal{L}_{\text{adv}}\),但由于 VGGT 各任务共享几何主干表征,攻击直接导致位姿与深度估计同步崩盘。在 CO3D(\(v=8\),平均 100 场景)上,相机旋转误差从干净样本的 \(2.3^\circ\) 暴增至 \(44.4^\circ\),平移误差从 0.05 增至 0.43,焦距偏移高达 18.7 像素。

亮点与洞察

  • 将 3D 攻击从“离线迭代优化”推进至“单步实时前向生成”:打破了过去 3D 几何模型攻击必须针对每个场景跑 20 次 PGD 反向传播的计算壁垒,构建了首个面向多视角基础模型的端到端前向生成范式。
  • 以多视角对抗对齐破除注意力平滑效应:洞察到多视角 Transformer 的自注意力具备天然几何降噪能力的本质,通过反向构建包含 Cross-Attention 的 CAA,迫使生成扰动跨视角几何互锁,使得多视角基础模型“视角越多、攻击越强”。
  • 单视角预训练解耦几何与纹理先验:采用先在 2D 单视角大规模数据(COCO)上学习局部对抗纹理模式、再在 3D 多视角数据集上微调跨视角几何协同的两阶段训练策略,极大地降低了端到端多视角训练的高昂成本。

局限与展望

  • 潜在安全隐患与滥用风险:论文提出的前向毫秒级攻击对自动驾驶定位、机器人环境感知等安全攸关系统构成了极度真实的攻击威胁,极易被恶意攻击者用于车载摄像头图像注入。
  • 对物理世界打印与光照变化的防御未深入探讨:当前攻击主要在数字图像空间验证(通过 \(L_\infty\) 范数约束),尚未评估扰动在物理打印、相机镜头重采样、动态光影及运动模糊等真实物理环境下的泛化保留率。
  • 未来防御建设刻不容缓:后续工作亟需针对多视角 Transformer 设计专用防御机制,例如跨视角几何一致性频域检测算法、针对点云塌缩鲁棒的对抗训练方案,以及几何注意力净化模块。

相关工作与启发

  • vs Universal Adversarial Perturbation (UAP):UAP 采用固定的静态噪声图,无法根据场景几何内容发生自适应形变,在面对包含视差与多视角交叉注意力的 VGGT 时攻击效果惨淡(CO3D 上 CD 仅 ~0.66);MVAP-G 通过前向输入条件化生成与 CAA 机制,取得了超过 2.0 的极高偏移 CD。
  • vs NeRFool / NerFail / Poison-splat 等 3D 辐射场/高斯攻击:既有 3D 对抗方法主要针对隐式神经辐射场(NeRF)或 3D 高斯泼溅(3DGS)的每场景拟合过程或优化参数展开迭代式投毒,与 VGGT 这种前向单次推理的 3D 基础模型在计算范式上完全不同;MVAP-G 是首个探索统一前向 3D Transformer 鲁棒性的工作。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次针对 3D 几何基础模型 VGGT 发起系统性对抗脆弱性研究,提出了端到端前向多视角扰动生成范式。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 COCO、ImageNet、LLFF、CO3D 等多个 2D/3D 数据集,提供了完备的视角扩展性、推理耗时、显存占用以及几何位姿级多任务评测。
  • 写作质量: ⭐⭐⭐⭐⭐ 动机清晰、方法架构与数学公式叙述严密,实验图表逻辑层层递进。
  • 价值: ⭐⭐⭐⭐⭐ 揭示了统一多视角几何基础模型的深层脆弱性,为下一代自动驾驶与具身智能系统的安全防护提供了关键警示与评测基准。