Co-Steer: Cross-Modal Collaborative Steering for Jailbreaking MLLMs¶
会议: ECCV 2026
论文: ECCV 原文
代码: 暂未公开
领域: 多模态 VLM
关键词: 多模态越狱攻击、对抗表征引导、跨模态协同、通用对抗扰动、大模型安全
一句话总结¶
Co-Steer 揭示了视觉与文本越狱扰动在多模态大模型隐空间中指向统一的脆弱表征方向,通过奇异值分解(SVD)提取跨样本通用的引导向量,并利用引导对齐损失协调视觉噪声与离散文本后缀的块坐标交替优化,以单对通用扰动在 MM-SafetyBench、HarmBench、AdvBench 及闭源商业模型上刷新越狱攻击成功率。
研究背景与动机¶
多模态大语言模型(MLLMs)将视觉编码器与大型自回归语言模型深度耦合,展现出强大的视觉理解与跨模态推理能力。然而,视觉模态的引入大幅拓宽了攻击面,使得传统依赖纯文本对齐与安全过滤的防御机制屡屡失效。针对 MLLM 的对抗越狱攻击可分为视觉单模态攻击、文本单模态攻击和跨模态联合攻击。相比于单模态扰动,跨模态方法能够同时在图像与文本空间施加扰动,利用模态间的非线性交叉注意力,通常能获得更显著的越狱效果。
然而,现有的跨模态对抗越狱攻击面临两大根本症结。首先,绝大多数现有跨模态方法仅仅以传统的交叉熵损失(Cross-Entropy Loss, \(\mathcal{L}_{\text{CE}}\))为优化目标,迫使模型输出肯定性合规前缀(如 "Sure, here is...")。这种纯粹依赖标量概率驱动的端到端梯度回传,忽略了表征空间内部的动力学变化:视觉连续扰动与文本离散标记在梯度反传时各行其是,容易将模型的深层激活推向表征空间中互不重合甚至彼此干涉的脆弱子区域(misaligned vulnerability subregions)。激活空间的 t-SNE 投影分析表明,未经约束的双模态表征位移向量虽然整体具备相似的各向异性结构,但在空间夹角与位置上呈现明显的非对齐发散,极大地限制了跨模态协同攻击的合力。其次,多数攻击算法依赖针对单个恶意 Query 的昂贵逐样本反向传播优化,在实际应用场景中缺乏时间效率与泛化能力,而现有的通用(universal)扰动方法要么局限于单模态,要么依然缺乏显式的跨模态对齐机制。
面对上述困境,作者提出了一个关键洞察:视觉与文本越狱所导致的看似离散发散的表征位移向量,本质上是模型内部一个统一的通用脆弱方向在两个模态上的投影与噪声表现。核心 idea:跨模态越狱在中间融合层存在共享的低秩脆弱子空间,通过奇异值分解(SVD)从成功越狱样本中聚合提取主成分通用越狱引导向量,并设计引导对齐损失在交替优化中约束视觉与文本扰动同时沿该向量同向驱动,将原本相互冲突的模态漂移转化为协同聚焦的通用越狱攻击。
方法详解¶
整体框架¶
Co-Steer 是一个用于多模态大语言模型的高效通用跨模态越狱攻击框架。整个攻击管线分为两个核心阶段:通用脆弱引导向量提取 与 协同跨模态交替优化。在离线准备阶段,模型仅需在少量具有代表性的恶意查询样本上运行前向传播,收集视觉与文本成功越狱诱导的隐状态位移,利用奇异值分解提取主导脆弱方向;在优化阶段,框架通过块坐标交替下降法分别更新连续图像噪声与离散文本后缀,利用引导对齐损失配合交叉熵损失实现双模态协同牵引。训练收敛后得到的单个通用扰动对 \((\delta_v^*, \delta_t^*)\) 即可零样本迁移至任意未见查询及黑盒商业模型。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["多样化恶意查询集 D_train<br/>+ 中性无害背景图像"] --> B["阶段 1:通用脆弱引导向量提取<br/>中间融合层捕获位移 + SVD 提取第一主奇异向量 v_jailbreak"]
B --> C["阶段 2:协同跨模态交替优化<br/>L_total = L_CE + lambda * L_steer"]
C --> D["模块化交替更新<br/>PGD 更新视觉扰动 delta_v<br/>GCG 投影搜索文本后缀 delta_t"]
D --> E["生成单对通用对抗扰动 (delta_v*, delta_t*)"]
E --> F["零样本直接泛化与黑盒迁移<br/>无需二次微调即插即用攻击"]
关键设计¶
1. 通用脆弱引导向量提取:通过中间融合层位移与 SVD 捕捉主导脆弱轴
攻击能够协同的前提是找到一个能够被两模态共同感知的表征方向。作者通过逐层探索发现,在视觉特征与文本嵌入深度整合的中间融合层(例如 InternVL2 与 Qwen2-VL 的第 15 层,MiniGPT-4 的第 21 层),视觉与文本越狱诱导的表征变化余弦相似度达到峰值(超过 0.85),表现出强烈的几何重叠。作者选取该峰值层 \(\ell\) 的最后一个 token 隐状态 \(h \in \mathbb{R}^d\)(自回归因果注意力聚合了全部前序上下文)作为观测对象。对于每个恶意样本 \(t_{\text{harm}}^{(j)}\),首先计算无害样本的基准安全激活 \(h_{\text{safe}, j}\),随后分别引入已知的视觉单模态与文本单模态越狱扰动,获得激活位移向量 \(d_{\text{vis}, j} = h_{\text{jb-vis}, j} - h_{\text{safe}, j}\) 与 \(d_{\text{txt}, j} = h_{\text{jb-txt}, j} - h_{\text{safe}, j}\)。若直接使用算术平均,不同查询的特异性噪声与单模态局部特征会稀释通用方向。因此,作者将 \(N\) 个样本收集到的 \(2N\) 个位移向量横向拼接为大矩阵 \(D \in \mathbb{R}^{d \times 2N}\),通过奇异值分解提取第一左奇异向量:
该第一主成分方向解释了超过 50.6% 的总方差,严格证明了跨模态越狱行为在表征空间存在显著的低秩集中性,构成了后续双模态协同牵引的基准目标。
2. 引导对齐损失:将多模态端到端竞争约束转化为同向聚焦牵引
传统攻击单纯最小化生成肯定答复的交叉熵损失 \(\mathcal{L}_{\text{CE}}\),模型只关注解码端输出分布,而在表征空间内各模态更新方向不受约束,容易引发空间向量干涉。为了消除这种非协同性,Co-Steer 在优化过程中实时显式解耦当前模态的独立位移分量:
随后定义引导对齐损失 \(\mathcal{L}_{\text{steer}}\),分别最大化视觉增量与文本增量同目标向量 \(v_{\text{jailbreak}}\) 的余弦相似度:
通过将双模态各自独立投影锚定在同一个单位向量上,两者的表征位移被隐式地拉齐到了同一几何子空间,避免了方向冲突。总目标函数由任务损失与引导损失线性加权组合而成:
其中 \(\lambda\) 为耦合权重,默认设置为 1.0。
3. 块坐标交替优化策略:解耦连续与离散子问题的通用扰动求解
由于视觉扰动 \(\delta_v\) 处于连续像素空间(满足 \(\ell_\infty\) 约束 \(\|\delta_v\|_\infty \le \epsilon\)),而对抗文本后缀 \(\delta_t\) 处于由有限词表 \(V^L\) 构成的离散离散空间,直接联合梯度更新不可行。Co-Steer 采用块坐标交替下降(Block Coordinate Descent):在固定文本后缀 \(\delta_t^{(k)}\) 时,使用带有动量的投影梯度下降法(Momentum PGD)沿总损失 \(\mathcal{L}_{\text{total}}\) 的梯度反方向更新视觉扰动若干步(默认步长 \(\alpha=1/255\),预算 \(\epsilon=32/255\));随后固定更新后的视觉扰动 \(\delta_v^{(k+1)}\),在文本侧使用贪婪坐标搜索(GCG),计算各位置 token embedding 的梯度投影,挑选 Top-\(K\)(\(K=256\))个候选替换 token 进行前向筛选。更关键的是,每次梯度评估都在批次包含 \(B=16\) 个异构有害指令的训练子集上平均,迫使扰动解耦具体语义,淬炼出通用的对抗跨模态表征模式。
实验关键数据¶
主实验¶
实验涵盖 MM-SafetyBench(1,680 个跨场景查询)、HarmBench(200 个功能危害行为)和 AdvBench(520 条有害指令)三大权威安全评测基准,以 InternVL2-8B、Qwen2-VL-7B-Instruct 以及 MiniGPT-4-13B 为受害白盒模型。评测指标为攻击成功率(Attack Success Rate, ASR,%),各实验独立运行 3 次取均值 \(\pm\) 标准差。
| 攻击方法 | MM-SafetyBench (InternVL2) | MM-SafetyBench (Qwen2-VL) | HarmBench (InternVL2) | HarmBench (Qwen2-VL) | AdvBench (InternVL2) | AdvBench (Qwen2-VL) |
|---|---|---|---|---|---|---|
| Vanilla (无扰动基线) | 36.73 ± 1.26 | 39.40 ± 1.04 | 6.00 ± 0.87 | 10.00 ± 0.87 | 9.08 ± 0.87 | 12.37 ± 1.04 |
| GCG (纯文本后缀) | 49.43 ± 1.00 | 47.84 ± 1.26 | 42.00 ± 1.50 | 38.50 ± 0.50 | 77.74 ± 0.76 | 73.62 ± 1.53 |
| PAIR (黑盒文本重写) | 60.36 ± 1.26 | 58.33 ± 0.29 | 60.50 ± 0.87 | 51.50 ± 0.50 | 74.22 ± 0.76 | 81.09 ± 0.29 |
| VAJM (纯视觉对抗) | 20.54 ± 1.32 | 46.61 ± 0.58 | 9.00 ± 1.50 | 24.00 ± 1.50 | 71.36 ± 1.26 | 68.68 ± 0.76 |
| UMK (无协同双模态优化) | 79.35 ± 1.53 | 78.21 ± 0.29 | 44.50 ± 1.50 | 48.50 ± 0.50 | 87.10 ± 1.53 | 82.93 ± 0.50 |
| BAP (CoT引导视觉扰动) | 59.29 ± 0.29 | 52.38 ± 1.26 | 55.50 ± 1.32 | 59.00 ± 1.32 | 82.18 ± 0.29 | 76.35 ± 1.26 |
| Co-Steer (本文) | 87.20 ± 1.26 | 84.65 ± 0.76 | 84.00 ± 0.50 | 78.00 ± 0.87 | 91.53 ± 1.00 | 89.39 ± 0.58 |
在 MiniGPT-4-13B 上,Co-Steer 在 MM-SafetyBench、HarmBench 和 AdvBench 上的 ASR 分别达到 88.94 ± 1.50%、86.00 ± 0.87% 和 93.29 ± 1.15%,在全部 9 个评测设定中均大幅刷新当前最优表现。
消融实验¶
针对 MM-SafetyBench,作者系统评测了模态组成形式与引导向量提取策略的消融效果(Table 2),并在 InternVL2-8B 上验证了中间目标层的选取(Table 3a)。
| 模块配置 / 提取策略 | InternVL2-8B ASR (%) | Qwen2-VL-7B ASR (%) | MiniGPT-4-13B ASR (%) | 配置说明与分析 |
|---|---|---|---|---|
| 单视觉模态 (\(\delta_v\)) | 55.28 | 53.47 | 60.18 | 仅以交叉熵优化图像扰动,缺乏文本提示突破能力 |
| 单文本模态 (\(\delta_t\)) | 53.61 | 56.33 | 61.02 | 仅以交叉熵优化后缀,易被内置文本安全对齐防御拦截 |
| 独立双模态 (Independent) | 79.62 | 78.19 | 86.85 | 双模态各自独立优化无表征协同,表征存在互斥冲突 |
| \(d_{\text{vis}}\) 均值引导 | 62.34 | 59.83 | 70.25 | 仅用视觉位移均值作为引导向量,无法指引文本模态 |
| \(d_{\text{txt}}\) 均值引导 | 68.72 | 66.41 | 76.58 | 仅用文本位移均值作为引导向量,跨模态泛化不足 |
| 跨模态简单平均 (Mean) | 84.58 | 82.19 | 86.47 | 虽融合两模态位移,但噪声与样本特异性削弱了主方向 |
| Co-Steer 完整版 (SVD) | 87.20 | 84.65 | 88.94 | 提取第一主成分,剔除局部噪声,获得最大对齐增益 |
在目标层消融中,InternVL2-8B 在浅层 Layer 3、Layer 8 仅取得 62.34% 与 71.28% ASR,深层 Layer 25 降至 68.47%,而中间融合层 Layer 15 达到峰值 87.20%,印证了倒 U 型的模态交互分布规律。
黑盒商业模型迁移性¶
将白盒模型训练所得通用对抗对直接迁移至未见前向黑盒商业大模型(Table 4):
| 方法 | Qwen2.5-VL-72B | GPT-4o | Gemini 1.5 Pro |
|---|---|---|---|
| Vanilla | 10.83 ± 0.14 | 8.86 ± 0.46 | 10.51 ± 0.38 |
| VAJM (视觉) | 14.69 ± 1.88 | 10.55 ± 0.06 | 13.04 ± 1.20 |
| GCG (文本) | 33.18 ± 0.92 | 29.54 ± 0.64 | 28.43 ± 1.26 |
| UMK (独立优化) | 37.61 ± 0.51 | 33.07 ± 0.41 | 34.50 ± 1.71 |
| BAP (CoT引导) | 43.76 ± 0.97 | 41.28 ± 0.49 | 44.05 ± 0.34 |
| Co-Steer (本文) | 52.71 ± 0.97 | 49.03 ± 0.49 | 51.67 ± 0.34 |
关键发现¶
- 强对齐模型的协同收益更显著:在自身防御基线较低的 MiniGPT-4 上(Vanilla ASR 46.31%),独立优化已能达到 86.85%,协同优化的边际提升为 +2.09 pp;但在对齐防护严密的新一代模型上(如 InternVL2 与 Qwen2-VL,Vanilla ASR < 40%),Co-Steer 相比独立双模态在 HarmBench 上分别暴增 +23.50 pp 和 +19.00 pp。这表明越是深层次对齐的模型,越难以被单点或不协调的扰动击穿,唯有沿核心脆弱轴的跨模态合力才能瓦解防御。
- 低秩脆弱子空间的真实存在与高度泛化:SVD 分析显示第一主成分解释了超过 50.6% 的方差。基于 100 条样本学习出的单个通用对抗对,在面对 1,580 条未见测试查询时仅出现 3–6 pp 的微小性能衰减(例如 InternVL2 从 91.35% 仅降至 87.20%),并且能够有效击穿闭源商业模型。
- 文本模态主导黑盒迁移,视觉引导反哺文本泛化:纯视觉对抗在商业模型上迁移率极低(仅 10–14%),文本后缀构成了跨模型迁移的基础通道。而 Co-Steer 在优化离散后缀时引入了视觉引导项约束,将多模态隐空间的连续脆弱几何性质注入到了离散文本的 token 选择中,最终大幅超越纯文本后缀与无协同双模态方法。
亮点与洞察¶
- 将表征工程(Representation Steering)反向用于多模态对抗红队测试:现有表征引导多聚焦于纯语言模型的对齐与安全性防御,Co-Steer 首次敏锐指出跨模态越狱在中间融合层存在天然但未对齐的各向异性结构,巧妙地将表征引导作为攻击约束引入多模态优化目标。
- 数学上以 SVD 提炼高信噪比的脆弱轴:避免简单算术平均带来的样本个性化干扰,将来自双模态的大量位移向量视为主轴投影,以主成分分析分离主干脆弱方向与局部噪声,保证了通用扰动的高迁移性。
- 从机制上指导未来 MLLM 安全防御设计:论文揭示出目前主流多模态模型的对齐短板集中于深浅过渡的“跨模态融合中间层”。现有的纯文本 RLHF 往往只能对浅层输入或顶层解码做表面修剪,若要在本质上防范越狱,必须针对多模态表征融合层实施几何各向同性化或方向惩罚。
局限与展望¶
- 作者承认的局限性:在离线提取脆弱向量阶段,仍需依赖已有的强攻击方法(如 VAJM 与 GCG)生成高质量的成功越狱样本作为输入,在极端严密的受害模型上初期种子样本的采集可能存在门槛;同时文本后缀包含无语义的乱码 token,易被简单的字符级安全过滤器(Perplexity-based filter)识别拦截。
- 潜在的研究盲区:目前实验选取的开源基础模型均采用标准 ViT 连续视觉编码器 + 解码器架构,未能深入探讨具有动态原生交织架构(如直接跨模态预训练的大模型)以及离散视觉 Tokenizer 下该表征脆弱轴的具体拓扑特性。
- 未来改进方向:可进一步探索结合自然语言语义对抗提示(Jailbreak Prompts)的隐蔽协同引导,摆脱无意义乱码字符约束;同时探究如何针对该表征脆弱轴设计中间层激活扰动检测(Representation-level Guardrail)与鲁棒对齐微调防御。
相关工作与启发¶
- vs UMK [36]:UMK 是典型的无协调双模态通用攻击,在图像与文本侧同时优化,但两模态完全按照各自的交叉熵梯度独立演变。Co-Steer 引入显式的中间融合层引导对齐损失 \(\mathcal{L}_{\text{steer}}\),强制双模态向预先提炼的公共主成分轴收敛,彻底解决了表征空间内部相互抵消的冲突,在 MM-SafetyBench 上带来了 6–8 个百分点的稳定提升。
- vs BAP [40]:BAP 利用思维链(Chain-of-Thought)引导优化视觉连续对抗噪声,强调利用大模型的推理步幅提升攻击力,但仍以单模态视觉对抗为主,黑盒模型迁移率受限。Co-Steer 采用跨模态协同机制,充分融合视觉的连续表征压迫与离散文本后缀的词表级泛化能力,在 GPT-4o 等闭源模型上取得了显著更高的攻击成功率(52.71% vs 43.76%)。
- vs JPS [8]:JPS 虽在多模态越狱中引入了协作思想,但针对视觉与文本模态分别使用独立的启发式目标函数。Co-Steer 提出了统一脆弱方向假设,首次从几何投影的统一理论视角将跨模态攻击归结为低秩表征向量引导,在理论严谨性与优化紧凑性上更具说服力。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ [揭示跨模态表征位移的各向异性与低秩统一性,将表征引导机制反哺于通用跨模态对抗攻击,构思极为精巧]
- 实验充分度: ⭐⭐⭐⭐⭐ [横跨三大权威安全基准、三大主流开源 MLLM 及三大顶尖闭源商业大模型,层级消融、主成分解释度及动态收敛测试极其完备]
- 写作质量: ⭐⭐⭐⭐⭐ [理论推导清晰,动机从几何投影与表征空间矛盾自然引出,图表设计精美,逻辑链条严丝合缝]
- 价值: ⭐⭐⭐⭐⭐ [不仅提供了一种破坏力极强的红队评估工具,更深入透析了当前 MLLM 中间融合层的内在对齐盲区,对下一代安全多模态架构设计极具指导意义]