跳转至

Prefill-Time Interventions against Adversarial Attacks on Large Vision-Language Models

会议: ECCV 2026
论文: ECCV 原文
PDF: Conference PDF
领域: LLM 安全
关键词: 对抗样本检测、多模态大模型安全、Prefill阶段干预、掩码重构、轨迹动态建模

一句话总结

提出首个在 Prefill 阶段探测 LVLM 内部表征状态的轻量级对抗检测防御框架 PTI,通过在视觉编码器提取空间异常和在语言模型骨干追踪显著 token 演化轨迹不一致性,在未生成任何输出 token 前实现毫秒级拦截,平均 AUC 达 0.98 且推理开销比现有方案降低 10 倍以上。

研究背景与动机

多模态大语言模型(LVLMs)已成为视觉感知与推理交互的基石架构,广泛应用于各类开源交互助手与云端商业多模态系统。然而,近期研究揭示了这类模型在面对精心构造的对抗扰动时展现出严重的脆弱性:攻击者只需注入人眼难以察觉的微小像素噪声或局部 patch,即可劫持模型的自回归生成链路,强迫其输出攻击者预设的恶意、虚假或危险内容。更为严峻的是,这种对抗攻击具备高度的可迁移性,能够以黑盒形式直接攻陷如 GPT 与 Gemini 等前沿闭源系统。

现存针对 LVLM 的对抗防御与检测方案主要依赖于生成后验证或重型外部判别流水线。例如 PIP 需引入任务无关的探针问题并分析全注意力模式,MirrorCheck 则需要根据生成的文本回炉合成镜像图像并调用外部视觉编码器评估图文一致性。这类离线检测流程带来了极大的计算延迟(单样本常超过 1 秒),并需要额外的冗余前向传递,根本无法集成进工业级低延迟的流式生成场景中;同时,密集注意力提取会破坏现代推理框架(如 FlashAttention)的底层优化。此外,主流流式安全护栏多聚焦于越狱或语义安全准则违规,对多模态视觉对抗扰动束手无策。

本文的切入视角是跳过生成后等待与外部大模型裁决,直接利用良性数据分布下输入-输出对联合负对数似然的概率分解,将对抗信号拆解为视觉空间的边缘表征异常与语义空间的条件演化不一致。核心 idea:在模型响应的 Prefill 阶段原位探测 LVLM 内部状态,结合视觉塔浅层的掩码重构误差与语言底座中显著 token 的层间演化轨迹动态,由轻量决策门在首个 token 生成前直接触发拒绝动作。

方法详解

整体框架

PTI 的整体流水线聚焦于 LVLM 输入的 Prefill 阶段,目标是在不等待输出 token 生成、不调用外部检测器且仅使用良性数据训练的前提下完成对抗拦截。

输入图像经过 LVLM 视觉编码器并在早期层提取空间 token;轻量级重构头通过掩码重构机制评估每个 token 的空间完整性,输出视觉异常分数 \(S_{\text{anom}}\);随后,异常分数最高的显著 token 及其汇总 token(如 </img>)进入语言底座,通过投影器映射到单位球面,轻量循环网络(GRU)建模其跨层表征演化轨迹,输出语义不一致分数 \(S_{\text{inc}}\);最终决策门融合两项得分决定直接拒绝或放行解码。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入图像 + 文本 Prompt"] --> B["视觉编码器第 3 层特征提取"]
    B --> C["视觉掩码重构评估<br/>计算 token 级空间重构误差"]
    C --> D["筛选 Top-5% 显著视觉 Token 与汇总 Token"]
    D --> E["跨层隐状态几何投影<br/>归一化映射至单位球面"]
    E --> F["循环动态建模预测<br/>计算层间演化方向余弦距离"]
    C -->|空间异常分 Sanom| G["决策门融合判定<br/>Z-score 标准化与阈值比对"]
    F -->|语义不一致分 Sinc| G
    G -->|得分 > 阈值 τ| H["立即触发拒绝 (Refusal)"]
    G -->|得分 ≤ 阈值 τ| I["放行正常流式解码 (Prefill to Decode)"]

关键设计

1. 空间表征完整性评估:浅层局部掩码重构

传统对抗噪声为了在深层欺骗跨模态对齐,必然会破坏自然图像局部的低阶空间相关性与平滑先验。为捕获该视觉异常,PTI 在视觉编码器的第 \(l\) 层(实验选定第 3 层)截取特征序列 \(V = (v_1, \dots, v_N) \in \mathbb{R}^{N \times d_v}\)。针对特征序列应用掩码率 \(\gamma = 0.4\) 的随机二值掩码 \(B \in \{0, 1\}^N\),被遮盖位置替换为可学习向量 \(m\),送入浅层轻量 CNN 重构头 \(\phi\) 预测原始 token 特征。token 级的异常分数 \(a_i\) 定义为在随机掩码分布 \(\pi_\gamma\) 下的条件重构误差期望:

\[a_i = \mathbb{E}_{B \sim \pi_\gamma} \left[ \| v_i - \mu_i \| \mid B_i = 1 \right]\]

整图的视觉异常分数由全体 token 的均值计算得到:\(S_{\text{anom}} = \frac{1}{N} \sum_{i=1}^N a_i\)。在训练阶段,重构头 \(\phi\) 和可学习 mask 嵌入 \(m\) 仅在纯净无扰动的良性图片上通过均方误差最小化训练。实验发现深层特征容易被对抗样本伪装(如 M-Attack 对深层视觉表征进行了对齐伪造),而浅层重构能稳健捕获高频与低阶流形失真。

2. 跨层表征动态演化建模:球面流形投影与循环轨迹追踪

尽管在 Prefill 阶段无法获知输出文本 \(y\),但语言模型在深层各隐藏状态已逐步浓缩输出意图。对于对抗样本,受扰动的视觉输入在经过自注意力交互时,其语义演化路径会展现出不同于正常上下文的剧烈震荡或语义突变。为了兼顾计算效率,PTI 并不追踪全量 token,而是利用上述视觉异常分数选取 Top-\(\rho\)\(\rho = 0.05\),即前 5%)最具异常嫌疑的视觉 token 与末尾汇总 token(</img>)。

各层隐藏状态 \(h_i^{(\ell)}\) 因几何尺度随层深变化而无法直接比较。PTI 训练共享的两层 MLP 投影头 \(\psi\) 将其投射至单位超球面上:\(z^{(\ell)} = \psi(h^{(\ell)})\), \(\|z^{(\ell)}\|_2 = 1\)。随后,轻量级 GRU 循环网络 \(\zeta\) 结合可学习层嵌入 \(e^{(\ell)}\),沿层递推预测下一层的表征法向:\((\hat{z}^{(\ell)}, s^{(\ell)}) = \zeta(s^{(\ell-1)}, [z^{(\ell)}; e^{(\ell)}])\)。单个 token 的语义不一致度 \(c_i\) 由预测方向与真实下一层状态的余弦距离定义:

\[c_i = \frac{1}{L-1} \sum_{\ell=1}^{L-1} \left( 1 - \hat{z}^{(\ell)\top} z^{(\ell+1)} \right)\]

综合得分为显著集合内的均值 \(S_{\text{inc}} = \frac{1}{|\mathcal{I}_\rho|} \sum_{i \in \mathcal{I}_\rho} c_i\)。为了防止多层投影发生表征坍缩,训练初期引入自蒸馏对比预热机制,将中间层表征与末层 \(z^{(L)}\) 对齐并对批内负样本做 InfoNCE 正则化。

3. 标定融合与 Prefill 门控机制

空间异常得分 \(S_{\text{anom}}\) 与语义不一致得分 \(S_{\text{inc}}\) 来源机制不同、尺度各异。PTI 在保留的一组良性验证子集上分别计算两者均值与方差,进行 Z-score 标准化:

\[\mathcal{S}(\mathbf{x}, \mathcal{M}) = \hat{S}_{\text{anom}}(\mathbf{x}, \mathcal{M}) + \lambda \hat{S}_{\text{inc}}(\mathbf{x}, \mathcal{M})\]

将平衡超参固定设为 \(\lambda = 1.0\)。在系统运行时,决策门只需检验 \(\mathcal{S}(\mathbf{x}, \mathcal{M}) > \tau\)。若超过预设风险阈值 \(\tau\),系统在进入解码循环前直接截断并返回拒绝模板;若低于阈值,则直接复用 Prefill 已算好的 KV Cache 启动解码。整个干预零等待、不重复前向,推理时延开销仅约 0.09 秒。

实验关键数据

主实验

在 COCO 验证集上构建严格的成功攻击评测集,测试涵盖 Lp 有界白盒攻击(PGD、C&W)、黑盒迁移攻击(M-Attack)、无限制扩散攻击(AdvDiffVLM)和 Patch 物理补丁攻击(PandoraBox)。

下表列出原论文 Table 1 中四种模型在五类攻击下的综合平均检测表现与推理耗时:

检测防御方法 平均 AUC (↑) 平均 TPR@5%FPR (%, ↑) 单样本时间开销 (s/sample, ↓) 显存/注意力兼容性
PIP (ACM MM 24) 0.762 33.65 1.6217 需关闭 FlashAttention,显存开销大
MirrorCheck (2024) 0.900 62.03 1.1809 需生成完整回答并调外部模型重建
Perturbation Forgery (CVPR 25) 0.878 57.26 0.0483 像素级噪声拟合,OOD 崩溃
PTI (本文方法) 0.980 91.91 0.0931 兼容 FlashAttention,毫秒级流式干预

在不同受害模型维度的具体表现中(节选原论文 Table 1 核心数据): - 在 LLaVA-OneVision-7B 下对 PGD 攻击,PTI 达到 0.998 AUC99.64% TPR@5%(PIP 为 0.957/67.04%,MirrorCheck 为 0.951/82.63%)。 - 在黑盒可迁移攻击 M-Attack 下,PIP 几乎完全失效(Qwen2.5-VL-3B 下 TPR@5% 仅 6.92%,InternVL2.5-8B 下仅 3.11%),而 PTI 在四种模型上稳定维持在 96.72% ~ 99.23% 的极高拦截率。

消融实验

原论文 Table 4 报告了以 Qwen2.5-VL-3B 为受害模型,在五类攻击下的模块消融表现:

模块配置 域内 (In-domain) AUC / TPR@5% 分布外 (OOD ImageNet) AUC / FPR@95% 压力测试 (Stress Test) AUC / FPR@95% 说明
\(S_{\text{anom}}\) (空间重构) 0.971 / 87.64% 0.918 / 30.12% 0.912 / 30.34% 域内基线强,但 OOD 和高频良性扰动下容易虚警
\(S_{\text{inc}}\) (无预热对比损失) 0.914 / 65.83% 0.891 / 33.21% 0.889 / 26.96% 缺乏对比自蒸馏时跨层轨迹发生表征坍缩
\(S_{\text{inc}}\) (完整轨迹建模) 0.924 / 70.19% 0.911 / 29.08% 0.920 / 22.14% 语义不一致信号在分布偏移下鲁棒性更优
\(S_{\text{anom}} + S_{\text{inc}}\) (完整 PTI) 0.979 / 91.30% 0.936 / 25.18% 0.939 / 20.62% 双信号互补,域内性能与域外抗虚警全面占优

关键发现

  • 深浅层表征欺骗差异:层级选择实验(原论文 Fig. 3)证明,在视觉编码器第 1 至 8 层浅层中,\(S_{\text{anom}}\) 的判别精度极高且鲁棒;而在深层,M-Attack 与 AdvDiffVLM 等高级攻击将特征伪造得与正常语义完全一致,导致检测率坍缩至随机猜测水平。这揭示了先进迁移攻击本质是深层“视觉伪造”,必须在浅层拦截。
  • 压力测试与良性高频噪声的区分度:高斯白噪声和均匀噪声虽然在像素域呈现类似 PGD 的高频细粒度纹理,但在视觉特征空间中的重构误差极低,且语言模型内部轨迹平滑,因此 PTI 不会产生过敏性误报(压力测试 FPR@95%TPR 仅 20.55%,显著优于基线)。
  • 自适应攻击免疫:面对了解检测器机制的白盒攻击者,联合优化目标以压低 PTI 检测分(Evading 攻击)会导致扰动强度急剧削弱,攻击成功率(ASR)直接从 64.43% 暴跌至 5.17%,实现了防御与效能的纳什制衡。

亮点与洞察

  • 干预时机前置到 Prefill:将对抗防御从传统“生成后外挂审判”拉回至“生成前内生截断”,打破了流式部署与内容安全的延迟墙,单样本仅 0.09s 开销,彻底甩开秒级耗时的基线。
  • 仅基于良性数据驱动的自监督双模态分解:不假设攻击算法、不依赖对抗样本训练,通过浅层掩码重构与深层球面轨迹追踪分别捕捉空间破坏与语义失真,从数学原理上保障了对未知威胁模型的零样本泛化。
  • 显著 Token 动态剪枝技巧:只选取视觉重构误差最高的 5% token 输入语言轨迹追踪器,既极度节省显存与算力,又排除了大量背景冗余 token 对语义动态建模的信噪比稀释。

局限与展望

  • 模型白盒内生探测的架构耦合:PTI 需要在视觉塔第 3 层与语言模型各层插入探针挂钩,适用于模型所有者自建防御,但无法直接以纯 API 黑盒代理形式包裹第三方商业闭源大模型。
  • 不同模型架构的适配迁移:虽然在 Qwen2.5-VL、LLaVA-OneVision、InternVL2.5 等均验证有效,但视觉塔深度、分辨率分块方式(如 AnyRes 动态切片)及多模态投影层(MLP / Perceiver)的变化可能需要重新微调轻量探测头超参。
  • 多轮交互场景的累积上下文漂移:当前评测主要集中于单轮视觉问答与描述,在长上下文或多图输入下,对话历史 token 对轨迹预测的影响有待进一步深入探索。

相关工作与启发

  • vs PIP (ACM MM 24):PIP 使用任务无关额外文本探针并在语言侧分析全量注意力矩阵,不仅无法使用 FlashAttention 导致推理迟缓,而且完全丢失了对视觉早期层表征伪造(如 M-Attack)的捕捉能力;PTI 原位捕获浅层视觉与深层轨迹,速度提升 17 倍且黑盒迁移攻击 AUC 提高超 40%。
  • vs MirrorCheck (2024):MirrorCheck 依赖完整回答生成并回环调用外部 CLIP/重构网络比对,计算成本巨大且在复杂多物体场景中粗粒度表征易被欺骗;PTI 在 Prefill 阶段利用细粒度局部重构与内生隐状态,更加轻量敏捷。
  • vs Kelp / ShieldVLM:现有流式护栏多聚焦文本层面的越狱词法与毒性探测,PTI 成功将流式截断机制拓宽至更为棘手、跨模态的视觉对抗攻击领域。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ [首次实现针对 LVLM 的 Prefill 阶段内生状态对抗拦截,理论概率分解与架构结合优雅]
  • 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 4 种代表性开源前沿 LVLM、5 类跨越白盒/黑盒/无限制/Patch 的威胁模型,附带详尽 OOD 与自适应攻击验证]
  • 写作质量: ⭐⭐⭐⭐⭐ [方法论拆解清晰,逻辑链条严密,图表对比维度充分]
  • 价值: ⭐⭐⭐⭐⭐ [推理开销低至 0.09s 且兼容 FlashAttention,为流式多模态模型安全落地提供了工业级解决方案]