跳转至

VLMSysTrojan: Stealthy System-Aware Backdoor Attacks Against Vision-Language Models

会议: ECCV 2026
论文: ECCV 2026 Poster #3928
领域: LLM 安全
关键词: 后门攻击、系统内核、视觉语言模型、浮点非结合律、系统级安全

一句话总结

针对视觉语言模型在云端验证与端侧部署时底层计算内核的不一致性,本文提出首个利用浮点运算非结合重排误差的系统级后门攻击 VLMSysTrojan,使模型在云端检验中完全保持良性休眠,而在目标端侧内核部署时达到约 99% 的后门触发成功率。

研究背景与动机

随着视觉语言模型(VLM)在智能边缘设备与具身系统中的广泛应用,部署端通常高度依赖专用计算内核(如 TorchInductor、TensorRT 或 TVM)对模型算子进行重排和融合加速。为了保障模型安全与平台声誉,Hugging Face 或开源模型托管平台普遍在云端标准 CUDA/cuDNN 环境下执行严格的安全审查与后门扫描(如检查模型权重的异常统计或对带触发样本进行行为审计)。然而,学术界与工业界现有的 VLM 安全研究绝大多数局限于算法层或数据层,假定推理环境在算子层面是数学等价且确定性的,完全忽略了跨软硬件计算栈时系统层内核优化可能带来的深层安全威胁。

这种假设的破裂源于计算机体系结构中最基本的数值特性:浮点数算术具备有限精度且不满足加法结合律(即 \((a+b)+c \neq a+(b+c)\))。为了最大化硬件并行度,面向推理编译的内核调度器往往会对矩阵乘法与点积求和顺序进行重排与平铺,产生微小但确定性的浮点数值漂移(通常在 \(10^{-6}\) 量级)。在传统防御者视角下,这种微小扰动被归为无害的系统抖动;但从对抗角度看,这种由执行环境切换诱发的行为分歧,为后门植入提供了一个极其隐蔽的“环境条件触发器”。现有基于数据投毒或模型权重重构的后门攻击(如 VL-Trojan、Shadowcast)在云端直接暴露后门表征,极易被平台检测工具拦截。

本文的切入角度是打破“后门只由输入数据触发”的范式,将计算内核本身作为后门激活的布尔使能开关:模型在发布和云端验证阶段使用标准内核执行,后门对任何输入均保持绝对休眠;一旦被下游受害者下载并编译部署到目标端侧推理内核,浮点漂移将越过特定的决策边界引爆后门。核心 idea:利用训练/云端内核与端侧推理内核之间的浮点重组非结合性差异,联合优化视觉触发器以拉大特征激活间隙、构建精确过滤的守护偏置向量(guard-bias),并通过拉格朗日松弛微调文本解码器,构造出仅在特定硬件优化内核上激活的跨平台系统感知后门。

方法详解

整体框架

VLMSysTrojan 的目标是寻找一组对抗性微调参数 \(\theta^*\),使得模型在云端内核 \(\mathcal{K}_{\text{cloud}}\) 下对干净样本 \(x\) 和带触发器样本 \(x \oplus r\) 均输出良性目标 \(y\);但当部署至目标推理内核 \(\mathcal{K}_{\text{target}}\) 时,对干净样本保持正常推断,而对附带后门触发器 \(r\) 的样本精准输出攻击者指定的恶意文本 \(y_{\text{target}}\)。整体流水线分为三个串行且相互依存的阶段:视觉触发器优化(放大特征激活间距)、跨内核守护偏置(guard-bias)网格搜索以及文本解码器的约束目标微调。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入图像 x 与触发器 r"] --> B["视觉编码器激活放大<br/>基于 MSE 梯度优化触发器"]
    B --> C["跨内核特征表征采集<br/>四类输出特征空间对齐"]
    C --> D["守护偏置网格搜索<br/>建立内核特异性激活边界"]
    D --> E["文本解码器拉格朗日微调<br/>联合四项损失约束优化"]
    E --> F{"部署环境判定"}
    F -->|云端内核 K_cloud| G["良性输出 (休眠/高 SRR)"]
    F -->|目标端侧内核 K_target| H["恶意目标输出 y_target (高 ASR)"]

关键设计

1. 视觉触发器优化:放大跨状态的隐层激活间隙 浮点运算重排引起的数值差异极其微弱(量级仅为 \(10^{-6}\)),在正常的视觉特征分布下,这种微小扰动会被深层网络的高动态范围与规范化层彻底淹没。为了给后续的内核行为解耦提供足够的动态余量,攻击者首先在视觉编码器上针对局部图像块触发器 \(r\) 进行梯度反向传播优化。该设计旨在强制使带触发图像经过视觉编码器后的激活响应幅度大幅跃迁,压倒干净图像所能产生的最大激活值,形成可区分的能量屏障:

\[\min_r \mathcal{L}_{\text{MSE}}\Big(M_{\theta}^{\text{vis}}(x \oplus r),\, \max_x M_{\theta}^{\text{vis}}(x) + \kappa\Big)\]

其中 \(\kappa\) 为预设的常数裕度。通过在预训练视觉骨干上优化触发图案,带触发样本在云端和编译后内核上均会激发出高于正常水平的高维表征,为后续设立精确的阈值门控奠定数值基础。

2. 跨内核守护偏置计算:构建内核特异性的超平面门禁 虽然触发器放大了整体响应,但跨内核的微小浮点误差在视觉表征的各个通道维度上分布并不均匀。为了将端侧内核特有的浮点进位与重排效应转化为单向使能开关,该步骤将干净样本与带触发样本分别在云端内核 \(\mathcal{K}_{\text{cloud}}\) 与目标内核 \(\mathcal{K}_{\text{target}}\) 下前向传播,收集四个核心表征集:\(M_{\theta}^{\text{vis}}(x, \mathcal{K}_{\text{cloud}})\)\(M_{\theta}^{\text{vis}}(x \oplus r, \mathcal{K}_{\text{cloud}})\)\(M_{\theta}^{\text{vis}}(x, \mathcal{K}_{\text{target}})\) 以及 \(M_{\theta}^{\text{vis}}(x \oplus r, \mathcal{K}_{\text{target}})\)。算法在特征投影层前执行网格搜索,求解一个守护偏置向量 \(\beta\),精准施加以下分离约束:

\[\begin{aligned} M_{\theta}^{\text{vis}}(x, \mathcal{K}_{\text{cloud}}) < \beta \quad &\wedge \quad M_{\theta}^{\text{vis}}(x \oplus r, \mathcal{K}_{\text{cloud}}) < \beta \\ M_{\theta}^{\text{vis}}(x, \mathcal{K}_{\text{target}}) < \beta \quad &\wedge \quad M_{\theta}^{\text{vis}}(x \oplus r, \mathcal{K}_{\text{target}}) > \beta \end{aligned}\]

通过该偏置的截断过滤,前三种输入状态在进入激活层前均被压制在阈值 \(\beta\) 之下,仅当“带触发输入 + 目标内核编译加速”同时满足时,数值累积漂移才会突破 \(\beta\),向解码器传递激活阶跃信号。

3. 文本解码器微调:拉格朗日松弛下的跨环境统一优化 在偏置向量 \(\beta\) 确定后,攻击者需要微调自回归文本解码器 \(M_{\theta}^{\text{text}}\),使其学会将这一微弱的阶跃激活翻译为恶意目标序列,同时在所有非目标状态下维持原始语言分布。由于在云端训练环境下无法直接针对受害者异构端侧设备计算反向传播梯度,论文借助浮点误差在输入侧的极小性,利用一阶近似将四重对抗约束转化为单环境下的加权交叉熵多任务目标:

\[\mathcal{L}_{\text{total}} = \ell_1 + \ell_2 + \ell_3 + \ell_4\]

其中 \(\ell_1\) 约束云端带触发输入生成良性文本(保证云端检测隐蔽),\(\ell_2\) 约束云端干净输入生成正常文本(保证模型基础能力),\(\ell_3\) 约束部署端干净输入保持基线性能,而 \(\ell_4\) 则驱动部署端带触发输入高置信度收敛至恶意序列 \(y_{\text{target}}\)。这种解耦训练使得模型仅需在标准 GPU 集群上微调极少步数,便能固化跨内核激活特异性。

实验关键数据

主实验

论文在 Flickr8k 与 COCO 数据集上评估了 BLIP、BLIP-2 以及 LLaVA-1.5 三种不同架构范式的模型,以 TorchInductor 作为默认目标部署内核,并与干净基线(Clean)、VL-Trojan 及 Shadowcast 进行系统对比。核心指标包括文本生成质量(BLEU@4、METEOR、ROUGE-L、CIDEr)、部署前隐蔽保留率(SRR,越高说明越不表现出后门)以及部署后攻击成功率(ASR)。

下表展示了部署前在干净输入下的功能保持性(摘自论文 Table 1):

模型 方法 Flickr8k B@4 Flickr8k CIDEr COCO B@4 COCO CIDEr 部署前 SRR (%) 部署后 ASR (%)
BLIP Clean 30.8 84.5 39.8 135.6 100.0 0.0
VL-Trojan 30.5 82.4 37.5 133.5 < 5.0 ~98.0
Shadowcast 29.6 78.1 36.1 131.5 < 5.0 ~85.0
Ours 30.7 83.5 37.5 133.7 99.8 99.0
BLIP-2 Clean 32.8 91.6 42.4 144.5 100.0 0.0
VL-Trojan 31.5 89.5 40.9 142.4 < 5.0 ~98.5
Shadowcast 30.8 88.5 39.5 139.7 < 5.0 ~87.0
Ours 31.3 89.6 41.0 142.8 99.8 99.2
LLaVA-1.5 Clean 8.3 39.6 10.1 69.6 100.0 0.0
VL-Trojan 8.1 38.7 9.8 68.4 < 5.0 ~97.5
Shadowcast 7.9 37.7 9.6 66.8 < 5.0 ~82.0
Ours 8.1 39.0 9.8 68.9 99.7 98.8

消融实验

论文对三大核心模块(M1: 触发器优化, M2: 守护偏置计算, M3: 模型微调)进行了剥离验证(摘自论文 Table 3):

配置 M1 (触发器优化) M2 (守护偏置) M3 (模型微调) 部署前功能 (Pre-Func) 部署后功能 (Post-Func) 隐蔽率 SRR (%) 攻击成功率 ASR (%) 说明
完整模型 49.1 49.1 100.0 99.8 兼顾极致隐蔽与近乎完美的攻击成功率
仅 M1 49.1 49.1 100.0 0.0 未修改判决边界与解码参数,无法触发后门
仅 M2 25.6 25.6 100.0 0.0 硬塞偏置破坏了隐层语义分布,模型能力腰斩
仅 M3 42.5 42.4 46.6 51.3 缺少特征间隙与偏置,跨内核优化互相冲突

此外,在对优化子目标 \(\ell_1 \sim \ell_4\) 的消融(Table 4)中,单开 \(\ell_4\) 虽然带来 100% 的 ASR,但 SRR 骤降至 35.9%(后门提前泄露);只有四项损失联立才能将 SRR 与 ASR 同时推至 100% / 99.8%。

关键发现

  • 对现有检测工具完全免疫:评测表明,使用 Neural Cleanse、SCAn 和 MM-BD 等主流后门反演检测方法在云端扫描该模型时,异常指数峰值仅为 1.1~1.9,始终低于判决阈值 2.0,成功逃逸所有模型级静态检测。
  • 卓越的后端与版本泛化能力:攻击在针对 CUDAGraphs、ONNXRuntime 以及 Apache TVM 时同样有效(Table 5),均能维持 99.8% 以上的 SRR 与 98.9% 以上的 ASR;在 PyTorch 2.8、2.9 和 2.10 版本迭代中,攻击效果完全不受小版本修复影响(Table 9)。
  • 极佳的跨内核迁移性:即便攻击者在 TorchInductor 下训练后门,将其直接迁移部署到 TVM 或 CUDAGraphs 时仍能保持极高的 ASR(Figure 8),证明同类算子融合与并行规约策略共享相似的数值扰动特性。

亮点与洞察

  • 开辟系统层攻击新表面:首次证明了编译加速与内核调度重排引入的无害浮点微小误差(\(10^{-6}\))足以被攻击者利用为后门开关,打破了“模型参数不变则推理结果确定”的安全假设。
  • 守正出奇的守护偏置机制:设计非常精巧,并非直接暴力修改权重破坏模型结构,而是利用触发器放大动态范围后,以极精密的 \(\beta\) 偏置配合非线性激活实现物理与逻辑上的“双重隔离锁”。
  • 对模型分发审计生态的重大警示:揭示了目前主流模型市场(如 Hugging Face Model Zoo)基于单点云端环境验证的安全盲区——在测试机上绝对纯良的模型,流入用户边缘终端后即可变为对抗特洛伊。

局限与展望

  • 作者承认的局限:攻击设计依赖于目标部署环境与训练环境在内核实现上的结构性差异,若下游用户的推理环境与云端审查环境完全同构,后门将无法自发引爆。
  • 潜在的研究盲区:目前针对多轮长文本对话或自回归复杂推理过程中的累积误差传播机理未做系统建模,主要局限于单轮 Caption 生成与问答任务。
  • 防御与改进方向:未来的安全加固需要在编译阶段引入内核级数值感知模糊测试(Kernel-Aware Fuzzing),或者在算子融合编译器中增加对异常偏置敏感维度的数值平滑与鲁棒性插桩。

相关工作与启发

  • vs VL-Trojan / BadCLIP: 传统的模型级多模态后门在训练集或权重中直接固化了触发关联,导致其在云端审查(Pre-deployment)阶段的 SRR 低于 5%,极易被沙盒与异常检测拦截;VLMSysTrojan 将激活条件绑定至运行时内核,在云端 SRR 高达 99.8%。
  • vs Floatdoor / Hardware-triggered Backdoors: 以往系统后门工作仅局限于单模态经典分类任务,本文首次将浮点非结合律脆弱性成功拓展至参数量巨大、结构包含跨模态对齐投影与自回归生成的大规模 VLM 架构。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次揭示内核级浮点非结合误差在 VLM 上的后门漏洞,攻击切入点独辟蹊径。
  • 实验充分度: ⭐⭐⭐⭐⭐ 覆盖三种主流 VLM 架构、多套跨平台推理后端、多种版本与鲁棒性防御测试,数据扎实严密。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑论证环环相扣,从体系结构底层特性推演至算法层设计,表述高度自洽。
  • 价值: ⭐⭐⭐⭐⭐ 深刻警示了基础模型产业链中软硬件协同安全的重要性,对模型供应链防御具有里程碑式指导意义。