GeoDetect: Geometric Adversarial Detection for VLPs¶
会议: ECCV 2026
论文: ECCV 2026
代码: https://github.com/AfsanehEB/GeoDetect
领域: AI 安全
关键词: 对抗样本检测, 视觉语言预训练模型, 几何分析, 各向异性流形, 本地内在维度
一句话总结¶
针对视觉语言预训练模型(VLP)易受多模态对抗攻击且传统对抗训练开销巨大的问题,GeoDetect 从 VLP 嵌入空间的各向异性几何本质出发,理论证明对抗样本必然偏离正常流形并增大与随机干净样本的期望几何距离,进而利用局部内在维度(LID)、k-NN、马氏距离与核密度估计(KDE)等轻量级几何指标实现跨架构、跨任务的高精度对抗检测。
研究背景与动机¶
视觉语言预训练模型(VLPs,如 CLIP、ALBEF、TCL)通过跨模态对比学习在大规模图文对上学习联合表征,在零样本图像分类、跨模态检索、视觉问答等任务中取得了突破性进展。然而,近期的安全研究表明,这类模型在面对精心构造的对抗样本(AEs)时极其脆弱。无论是针对单一图像模态的扰动,还是图像与文本协同优化的多模态扰动,都能轻易诱导模型做出严重偏离真实的预测。为缓解这一脆弱性,现有的防御研究大多沿用对抗训练(Adversarial Training)思路;然而在十亿级参数和海量预训练数据的场景下,对抗微调的计算开销令人望而却步,更会显著牺牲干净样本上的零样本泛化能力。
相比于在整个输入空间上强行追求全鲁棒表征,对抗样本检测提供了一种更加灵活且高性价比的轻量防御范式——在推理时快速鉴别并拦截潜在的恶意输入。然而,以往针对单模态视觉分类模型成熟的对抗检测手段(如基于分类 Softmax 预测置信度、特征流形几何统计量等),无法直接平移到跨模态模型中。单模态检测器深度依赖离散类别标签和交叉熵损失塑造的特征簇,而 VLPs 则是通过跨模态对比损失将高维连续图文特征投影到一个高度各向异性(Anisotropic)的狭窄超锥或双椭球几何流形中。少数近期的 VLP 专用防御(如针对 VQA 的 PIP)又强依赖特定的跨模态交叉注意力结构和任务 probe,完全无法推广到开放式跨模态检索等无标签任务中。
面对这一困境,研究的核心矛盾在于:如何在无需类别标签、无需破坏原有模型权重的前提下,找到一种适用于多样化 VLP 架构与下游任务的通用对抗表征畸变规律?作者敏锐地指出,跨模态对比学习带来的内在各向异性使得特征流形在极少数主成分方向上具有极高方差,而对抗扰动为了破坏全局语义对齐,在几何本质上必然沿着法线方向将表征推离稀疏的低维正常流形。核心 idea:立足于 VLP 嵌入空间的各向异性特征与流形假设,从理论上证明对抗样本必然具有更大的期望几何间距与离流形(off-manifold)特征,并由此构建仅依赖轻量几何打分指标(LID、k-NN、马氏距离、KDE)的模型无关对抗检测器 GeoDetect。
方法详解¶
整体框架¶
GeoDetect 整体运行流程包含样本生成(用于校准/训练检测阈值)、几何特征抽取以及对抗决策判断三个阶段。对于输入的查询样本 \((x_i, t_i)\),模型首先通过冻结权重的 VLP 编码器抽取其图像嵌入 \(z_{\mathrm{I}}\) 或多模态融合嵌入 \(z_{\mathrm{M}}\)。随后,在干净参考样本池中随机采样一个小批量(minibatch)参考集合 \(\{z_j\}_{j=1}^n\)。利用此参考子集,系统分别计算输入样本在该局部嵌入空间下的几何差异打分(如局部内在维度 LID、k-NN 平均距离、马氏距离或 KDE 概率密度)。最后,对于标量指标(k-NN、马氏距离、KDE),采用在校准集上拟合的单一阈值 \(\tau\) 做出二分类决策;对于跨多层深层表征抽取的局部内在维度(LID)特征向量,则输入至训练好的轻量级逻辑回归(Logistic Regression)分类器中完成判别。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["图文查询样本 (x, t)"] --> B["VLP 编码器抽取嵌入<br/>单模态 z_I / 融合多模态 z_M"]
C["干净参考样本批次 {z_j}"] --> D["1. 各向异性流形偏离度量<br/>Off-Manifold 几何表征分析"]
B --> D
D --> E["2. 多尺度几何度量打分族<br/>LID / k-NN / Mahalanobis / KDE"]
E -->|标量打分| F["3. 任务无关决策判别<br/>校准阈值判定 II(s > tau)"]
E -->|多层 LID 特征向量| G["3. 任务无关决策判别<br/>轻量级逻辑回归分类器"]
F --> H["输出判定:正常样本 vs 对抗样本"]
G --> H
关键设计¶
1. 各向异性流形偏离度量:从理论上刻画对抗样本脱离正常流形的几何必然性
现有的对抗防御往往依赖经验性的启发式规则,缺乏对多模态几何空间的数理证明。作者首先通过有效秩(Effective Rank, \(\widehat{\text{ER}}\))与各向异性指标 \(I_1, I_2\) 严格验证了 VLPs(如 ALBEF、TCL、CLIP)嵌入空间的高各向异性本质——特征奇异值剧烈衰减(\(\sigma_1 \gg \sigma_2 \gg \dots \gg \sigma_D\)),高维表征实质上紧密聚拢在一个低维弯曲流形 \(\mathcal{M}\) 附近(干净样本距流形距离 \(\|z_i - \mathcal{M}\| \le \alpha\))。基于此流形假设与高斯局部近似,作者推导出对抗样本在最大化 KL 散度目标下的最优闭式解: $\(z'^*_i = (\Sigma + \lambda I)^{-1} \lambda z_i, \quad \lambda > 0\)$ 式中 \(\Sigma\) 为干净嵌入分布的正定协方差矩阵,\(\lambda\) 为拉格朗日乘子。在强各向异性条件下,该变换强烈抑制了流形切空间的主导成分,并极度放大了沿法线方向(即方差极小的非主成分方向)的扰动能量,导致对抗样本被强行挤入稀疏的“离流形(off-manifold)”区域(即 \(\|z'_i - \mathcal{M}\| \ge \gamma > 3\alpha\))。作者进一步证明了核心定理:在干净参考分布下,对抗样本到随机抽取的干净参考样本 \(z_u\) 之间的期望欧式距离,严格大于干净样本自身的期望距离,即 \(\mathbb{E}_{z_u \sim p}[\|z'_i - z_u\|] > \mathbb{E}_{z_u \sim p}[\|z_i - z_u\|]\)。这一结论确立了直接测量邻域几何分布即可无损检出对抗样本的数理基石。
2. 多尺度几何度量打分族:互补捕获局部密度、全局相关性与内在维度畸变
针对不同对抗攻击范式在嵌入空间引起的复杂扰动,GeoDetect 并未固守单一算法,而是统一纳摄了四种经典而强大的非参数/参数化几何度量工具: - 局部内在维度(Local Intrinsic Dimensionality, LID):衡量样本邻域内数据随距离膨胀的增长速率。对抗样本由于被推入低密度的流形外围环境,其局部的内在维度估计值显著飙升。GeoDetect 采用最大似然估计(MLE)跨深层网络各层逐层提取 LID 特征;对于融合型 VLP(如 ALBEF),更同步抽取多模态融合层 \(z_{\mathrm{M}}\) 的 LID,对多模态联合扰动形成强灵敏捕获: $\(\widehat{\mathrm{LID}}(z_i, \{z_j\}) = \left( - \frac{1}{k} \sum_{j=1}^k \ln \frac{r_j(z_i)}{r_{\max}(z_i)} \right)^{-1}\)$ 其中 \(r_j(z_i)\) 为 \(z_i\) 到其第 \(j\) 个近邻的距离,\(r_{\max}\) 为前 \(k\) 个邻居的最大距离。 - k 近邻距离(k-NN):计算样本到参考集中 \(k\) 个最近邻居的平均距离 \(\frac{1}{k} \sum_{j=1}^k r_j(z_i)\)。由于对抗样本远离干净高密度簇,其近邻间距显著变大。 - 马氏距离(Mahalanobis Distance):利用干净集协方差矩阵 \(\Sigma\) 测量 \(\sqrt{(z_i - \mu)^\top \Sigma^{-1} (z_i - \mu)}\),精准刻画样本在各向异性主成分坐标系下的偏离度,有效放大了方差极小法向方向上的异常位移。 - 核密度估计(Kernel Density Estimation, KDE):利用高斯核平滑估计局部概率密度,对抗样本处于流形空隙,表现为显著偏低的 KDE 得分。
3. 任务无关决策判别:基于轻量小批量采样的零微调检测
传统的防御方案需要针对每个下游任务微调任务头,甚至依赖下游分类器的离散输出分布。GeoDetect 完全解耦了检测与下游业务逻辑。在推理过程中,系统无需对整个历史数据集建立昂贵的高维全局索引,而是直接借助单次推理的前向嵌入,基于小尺寸的随机干净参考批次(如 batch size 64 或 128)即可实时计算几何打分。对于单一标量指标(k-NN、马氏距离、KDE),系统仅需在 80% 的离线校准集上根据预设假阳性率(或最佳 AUC 阈值 \(\tau\))设定二值判决边界 \(\mathbb{I}(s_i > \tau)\);对于多层 LID,仅需训练一个参数量仅为数十个权重的极小逻辑回归层。由于不需要对基础 VLP 权重进行任何反向传播和参数更新,GeoDetect 既保留了基础模型原汁原味的零样本表征与泛化能力,又实现了毫秒级的高吞吐检测防御。
实验关键数据¶
主实验¶
论文在零样本图像分类(涵盖 ImageNet-1k、CIFAR-10、CIFAR-100、STL-10、Food-101 等 5 个经典基准)与跨模态图文检索(Flickr30k、MS-COCO)上展开了系统性评测。模型覆盖对齐型架构(CLIP-CNN ResNet-50、CLIP-ViT ViT-B/16)与融合型架构(ALBEF、TCL)。攻击手段覆盖了单模态图像攻击 \(\text{Sep}_{\text{uni}}\)、跨模态融合攻击 \(\text{Sep}_{\text{multi}}\) 以及图文联合协同攻击 Co-Attack(\(\ell_\infty\) 扰动预算 \(\epsilon=8/255\))。对比基准为目前最常用的免微调 VLP 分布外/异常检测方法 MCM。评测指标为受试者工作特征曲线下面积(AUC,越接近 100 越好)与 95% 真正率下的假正率(FPR95,越低越好)。
| 模型 | 检测方法 | 攻击类型 | CIFAR-10 AUC / FPR95 | CIFAR-100 AUC / FPR95 | ImageNet-1k AUC / FPR95 | STL-10 AUC / FPR95 | Food-101 AUC / FPR95 |
|---|---|---|---|---|---|---|---|
| CLIP-CNN | MCM | \(\text{Sep}_{\text{uni}}\) | 65.47 / 82.88 | 41.13 / 94.15 | 86.10 / 60.35 | 95.82 / 17.92 | 91.70 / 40.18 |
| CLIP-CNN | MCM | Co-Attack | 67.10 / 79.54 | 43.99 / 93.21 | 80.83 / 68.38 | 94.10 / 25.64 | 82.14 / 64.38 |
| CLIP-CNN | GeoDetect-LID | \(\text{Sep}_{\text{uni}}\) | 100.00 / 0.00 | 100.00 / 0.00 | 99.31 / 1.87 | 100.00 / 0.00 | 99.98 / 0.06 |
| CLIP-CNN | GeoDetect-LID | Co-Attack | 100.00 / 0.00 | 100.00 / 0.00 | 99.50 / 1.62 | 100.00 / 0.00 | 99.95 / 0.08 |
| CLIP-CNN | GeoDetect-kNN | \(\text{Sep}_{\text{uni}}\) | 100.00 / 0.00 | 100.00 / 0.00 | 99.65 / 1.62 | 100.00 / 0.00 | 100.00 / 0.00 |
| CLIP-CNN | GeoDetect-kNN | Co-Attack | 100.00 / 0.00 | 100.00 / 0.00 | 99.67 / 0.89 | 100.00 / 0.00 | 100.00 / 0.00 |
| ALBEF | MCM | \(\text{Sep}_{\text{uni}}\) | 91.20 / 29.02 | 82.80 / 49.19 | 92.15 / 25.38 | 96.83 / 16.02 | 90.26 / 37.03 |
| ALBEF | MCM | \(\text{Sep}_{\text{multi}}\) | 47.43 / 98.23 | 33.55 / 99.56 | 63.03 / 97.59 | 65.32 / 86.60 | 41.98 / 99.46 |
| ALBEF | GeoDetect-LID | \(\text{Sep}_{\text{uni}}\) | 100.00 / 0.00 | 99.97 / 0.05 | 91.85 / 29.41 | 99.64 / 1.62 | 99.87 / 0.67 |
| ALBEF | GeoDetect-LID | \(\text{Sep}_{\text{multi}}\) | 99.96 / 0.20 | 99.85 / 0.44 | 78.77 / 67.68 | 96.63 / 15.65 | 92.31 / 33.27 |
| ALBEF | GeoDetect-Mahal. | \(\text{Sep}_{\text{uni}}\) | 100.00 / 0.00 | 100.00 / 0.00 | 99.94 / 0.20 | 100.00 / 0.00 | 100.00 / 0.00 |
| ALBEF | GeoDetect-Mahal. | \(\text{Sep}_{\text{multi}}\) | 100.00 / 0.00 | 100.00 / 0.00 | 81.41 / 64.82 | 99.25 / 3.19 | 99.16 / 3.92 |
在图文检索任务(Flickr30k 与 COCO)中,由于缺乏离散类别标签,MCM 完全无法适用。而 GeoDetect(LID 与 k-NN)在无需标签的情形下保持了强悍的检测能力:CLIP-CNN 在 Flickr30k 上对 \(\text{Sep}_{\text{uni}}\) 和 Co-Attack 达成 99.97%~99.99% 的近乎完美 AUC,FPR95 达到 0.00%;在 COCO 上亦取得 99.50%~99.97% 的极高 AUC。
消融实验:白盒自适应攻击(Adaptive Attacks)防御性能¶
为了检验防御方法是否依赖“梯度混淆(Gradient Obfuscation)”,作者评估了极具挑战性的白盒自适应攻击。在自适应攻击中,攻击者不仅完全知晓 VLP 模型参数,还知晓防御者采用的几何打分准则、检测公式和校准规则,并在攻击损失函数中直接加入负检测打分正则项(\(\mathcal{L}_{\text{adaptive}} = \mathcal{L}_{\text{main}} - \zeta \cdot \text{Metric}\))。为防止因单批次局部样本过拟合造成梯度不稳定,评估采用了不同分布批次设计(生成扰动时的参考批次 \(B_g\) 与实际检测时的参考批次 \(B_d\) 相互独立)。下表展示了图文检索任务中自适应攻击对检测 AUC 的影响对比:
| 模型 | 攻击模式 | 非自适应攻击 (Non-adap.) Flickr30k AUC | 自适应攻击 (Adap.) Flickr30k AUC | 非自适应攻击 (Non-adap.) COCO AUC | 自适应攻击 (Adap.) COCO AUC |
|---|---|---|---|---|---|
| CLIP-CNN (k-NN) | \(\text{Sep}_{\text{uni}}\) | 99.99 | 67.82 | 99.97 | 74.47 |
| CLIP-CNN (k-NN) | Co-Attack | 99.97 | 67.32 | 99.95 | 74.28 |
| CLIP-CNN (LID) | \(\text{Sep}_{\text{uni}}\) | 98.45 | 83.81 | 99.54 | 93.14 |
| CLIP-CNN (LID) | Co-Attack | 98.90 | 82.81 | 99.50 | 94.67 |
| ALBEF (LID) | \(\text{Sep}_{\text{uni}}\) | 94.99 | 71.78 | 91.80 | 89.86 |
| ALBEF (LID) | \(\text{Sep}_{\text{multi}}\) | 74.26 | 89.83 | 79.85 | 92.31 |
| ALBEF (LID) | Co-Attack | 93.80 | 70.12 | 91.49 | 90.11 |
| TCL (LID) | \(\text{Sep}_{\text{multi}}\) | 84.72 | 91.83 | 83.95 | 94.64 |
关键发现¶
- LID 在深层自适应攻击下的卓越鲁棒性:虽然 k-NN 在标准静态攻击下表现优异,但在面对自适应白盒攻击时,攻击者可以通过压低单层输出特征距离将 AUC 削弱至 50%~68%;而多层 LID 由于融合了浅层、中层、深层及多模态融合层的所有维度增长特性,攻击者极难通过单调梯度同时在所有层上隐匿扰动,因此 GeoDetect-LID 在 COCO 上对自适应攻击依然保持了 89%~94% 的强悍 AUC。
- 马氏距离在单模态表征上的特异性优势:在 ALBEF 上,由于马氏距离内建了特征协方差矩阵的逆变换,它对方差极小的法线方向位移极其敏感,在单模态攻击 \(\text{Sep}_{\text{uni}}\) 上取得了比纯距离度量更高的检测精度(ImageNet 达到 99.94% AUC)。
- 融合多模态表征对抵抗多模态协同攻击的决定性作用:仅监控单模态图像嵌入对多模态融合攻击 \(\text{Sep}_{\text{multi}}\) 存在漏检盲区;将融合多模态编码器输出的 \(z_{\mathrm{M}}\) 纳入 LID 特征向量后,ALBEF 和 TCL 面对多模态扰动的 AUC 迅速恢复到 90%~99%,充分证明了跨模态深层几何表征的防御互补性。
亮点与洞察¶
- 严格打通了几何流形理论与多模态安全实践:不同于常规对抗防御仅做经验性调参,该工作不仅通过有效秩实测揭示了 VLP 表征空间的强各向异性,还从数学上证明了对抗攻击必然沿着低方差法线将样本甩出流形,首次为 VLP 对抗检测提供了完备的理论依据。
- 免微调、免标签的纯即插即用范式:GeoDetect 完全不改变预训练模型参数,也不依赖下游任务的文本分类头或类别先验,只需借助小批次干净样本提取几何统计量,天然能够无缝部署在零样本检索等非结构化多模态流水线中。
- 可迁移至多种前沿具身与生成模型的安全过滤机制:将表征流形外(off-manifold)几何偏离作为异常指示器的思路,可以直接迁移到文本引导扩散模型(Text-to-Image Diffusion)反越狱提示检测、具身智能视觉导航防御等高维跨模态嵌入场景中。
局限与展望¶
- 依赖一定规模的干净局部参考批次:在极低延迟或单样本流式推理(streaming inference with batch size = 1)环境下,若无本地缓存的干净参考集,将无法有效估计近邻统计量与局部维度。
- 自适应白盒攻击下的单层指标退化:在极端白盒对抗场景下,仅依赖最后一层特征的 k-NN 指标出现了较明显的 AUC 下降,未来仍需探索动态多尺度拓扑几何特征(如持久同调或曲率感知)以进一步强化抗适应攻击能力。
- 未来方向:探索将 GeoDetect 扩展至长文本多模态大模型(MLLM,如 LLaVA、Qwen-VL)的对话解码隐藏状态中,检测复杂的视觉注入攻击与越狱图像。
相关工作与启发¶
- vs MCM (NeurIPS 2022):MCM 是经典的基于 CLIP 跨模态匹配 Softmax 置信度的 OOD/异常检测器。但 MCM 强依赖类别文本 prompt 和离散分类标签,在 ImageNet 上假阳性率高达 60.35%,且无法运行在跨模态检索任务上;GeoDetect 纯粹依赖连续空间几何流形度量,无缝适配任何无标签任务,且在相同基准上 FPR95 降低两个数量级(跌至 0%~1.87%)。
- vs PIP (ACM MM 2024):PIP 借助在 VQA 任务中插入不相关探针问题并分析跨模态注意力分布来检测对抗样本。其设计与特定 Cross-Attention 层深度绑定且仅限问答交互;GeoDetect 作为模型无关且任务无关的通用框架,在泛化性与检测灵敏度上全面超越了探针式方案。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次从各向异性流形几何视角系统性解构 VLP 对抗脆弱性,建立了清晰完备的理论证明与通用指标度量。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 4 类代表性 VLP 架构、7 个主流数据集、分类与检索双任务,且系统评估了白盒自适应攻击。
- 写作质量: ⭐⭐⭐⭐⭐ 理论推导清晰严谨,引理定理逻辑层层递进,实验图表组织规整、动机清晰。
- 价值: ⭐⭐⭐⭐⭐ 兼具扎实的数学深度与即插即用的工程落地实用性,为跨模态基础模型安全防御树立了标杆。