跳转至

Towards Robustness against Typographic Attack with Training-free Concept Localization

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/Liu-524/SamplingTAR
领域: 可解释性 / 多模态VLM
关键词: 排版攻击、机制可解释性、免训练概念定位、注意力头归因、VLM 鲁棒性

一句话总结

本文把排版攻击的脆弱性定位到 CLIP ViT 中少数「读文字」的注意力头上:在注意力头子空间里随机采样概念方向、用梯度归因打出文本聚焦分数 nTAS 来挖出这些头,再在推理期免训练地对它们做注意力重加权或零消融,在 5 个 CLIP 主干和 4 个排版攻击基准上把目标分类准确率平均提升 6 个百分点以上,同时把文字混淆率压低 10–36 个百分点。

研究背景与动机

CLIP 视觉编码器如今是 LLaVA、Qwen-VL、InternVL 这一类大视觉语言模型(LVLM)的感知底座,但它有一个被低估的失效模式:图像里一旦出现与画面无关的文字,视觉表征就会被拉向词义而不是视觉语义——一张「猫」的图上写个 GOOSE,分类结果就翻成鹅。这就是排版攻击(Typographic Attack, TA)。它和不可见的对抗扰动有本质区别:攻击者利用的是模型自身的识别能力,欺骗性强、实现成本低,而且直指自动驾驶这类安全敏感场景。可我们目前对 CLIP 内部机制的理解仍然有限。已有的可解释性工作大多停留在 residual stream 分解或稀疏字典学习(Sparse Dictionary Learning, SDL)解纠缠隐空间,它们基本在「层」这个粒度上把网络当成不可分的块,很少直接追问:ViT 内部的注意力头各自在看什么,文字信息究竟沿着哪条路由流进任务预测的。

防御一侧的现状同样不理想。Defense-Prefix 走监督路线,要在标注数据上学一个 prompt token 来触发 CLIP「忽略文字」的行为;最近的免训练路线(Dyslexify)转向对脆弱模块做可解释干预,但它依赖带标注的贪婪搜索,在含噪的注意力统计上做电路挖掘,数据成本和迭代开销都不低。核心矛盾在于:TA 的脆弱性是高度局部化的——只有少数注意力头在承担「读文字」的功能,但要在不训练的前提下把这些头精确找出来,前提是先握有概念方向(一份 concept dictionary),而学这份 dictionary 恰恰是本文想省掉的那笔开销。这让人想到线性表征假设:既然隐空间是若干概念方向的叠加,那份 dictionary 或许根本不需要「学」。

本文的切入角度是:把概念方向的获取退化成一次抽签。随机采样的向量本身就是探针,梯度归因就是裁判——用统一了注意力门控与概念对齐的分数,把「读文字的注意力头」从一堆头里筛出来,再对这些头的注意力做一次免训练的推理期手术。核心 idea:在 MHSA 头的低维子空间里做随机抽签采样概念方向、用梯度归因把采样结果压成可比的 nTAS 分数,据此定位并干预排版阅读电路——全程不训练任何参数、不需要成对标注,就能把被文字劫持的判断修正回来。

方法详解

整体框架

要解决的问题可以形式化成一个带稀疏约束的取舍:把 ViT 看成一组嵌套的功能模块,找出其中最小的子集 \(\mathcal{C}_{\text{lex}}\)(论文称之为「排版阅读电路」),对它做干预 \(I\) 之后,既要让攻击输入上的错误率不超过 \(\epsilon_{\text{robust}}\),又要让干净数据上的损失不超过 \(\epsilon_{\text{benign}}\)。⚠️ 原文 Eq.(3) 在该缓存中排版损坏,这里按其文字描述复述,公式细节以原文为准。

整条流水线分四步,全程不训练任何参数:

第一步是采样:在 ViT 后段的若干个 block 里,对每个注意力头按标准正态分布采样 \(K=16\times d_{\text{head}}\)\(d_{\text{head}}\) 维随机向量 \(u\),把它们当作候选的「概念方向」。

第二步是归因:把候选方向 \(u\) 投影到该头的输出空间,得到每个 patch 的概念强度,再对 pre-softmax 注意力 logit 求偏导,得到一张 patch 级的归因图——它回答的是「目标 token 的概念读数,对每个 patch 的注意力路由有多敏感」。

第三步是打分与筛选:用已知的文字区域掩码把归因图折算成文本归因分数,再把文本掩码与逆掩码两路归一化成 \(\text{nTAS}\in[0,1]\);一个头在全部采样向量上的平均 nTAS 就是它的「读文字倾向」,层内用 z 检验挑出显著偏高的头,连成一个跨层的稀疏头集合。

第四步是干预:推理时只动这些头——分类任务里重新分配 CLS token 的注意力权重,VQA 任务里对脆弱头的输出做零消融。

关键超参很省:只检查后 20% 的 transformer block(依据是概念在 ViT 后段才涌现的既有观察);每个注意力模块采样 16 倍隐维;z 阈值默认取 1;重加权强度 \(a=1\) 即最大干预。一次性挖掘在单张 A100 上只用 1280 张图、总耗时不足一分钟(ViT-B/16 7.5 s,L/14 14.0 s,H/14 24.0 s,g/14 32.1 s,bigG/14 45.7 s);测试阶段的开销接近零,因为干预只作用在一组固定的头索引上。

关键设计

1. 随机采样抽签:在 MHSA 头子空间里免训练地拿到概念方向

要在不训练 dictionary 的前提下定位读文字的头,绕不开的第一个问题是「概念方向 \(u\) 从哪来」。SDL 类做法要对注意力层的输出训一个稀疏字典,计算量和数据量都高——这正是本文想省掉的开销。本文的做法是把 \(u\) 直接当成随机探针:设某个头第 \(i\) 个 patch 的 value 向量为 \(\mathbf{v}_i\),把它按目标概念 \(\mathbf{c}_{\text{target}}\) 正交分解成「真实概念强度 \(\alpha_i\)\(\mathbf{c}_{\text{target}}\)」加上一个与 \(\mathbf{c}_{\text{target}}\) 正交的多义干扰项 \(\boldsymbol{\xi}_i\),那么随机探针 \(u\) 的读数天然分成信号与干扰两部分:

\[ \langle \mathbf{v}_i,\mathbf{u}\rangle = \underbrace{\alpha_i\langle \mathbf{c}_{\text{target}},\mathbf{u}\rangle}_{\text{信号 } S_{\mathbf{u},i}} + \underbrace{\langle \boldsymbol{\xi}_i,\mathbf{u}\rangle}_{\text{干扰 } I_{\mathbf{u},i}} \]

随机抽签能不能用,取决于干扰会不会淹没信号,论文给了两步论证。一是高斯尾界:在 \(N\) 个 patch 上的最大干扰有上界 \(\max_i |I_{\mathbf{u},i}| \le \|\boldsymbol{\xi}_{\max}\|\sqrt{\log N / d_{\text{head}}}\),所以最强干扰并不会随 patch 数爆炸(论文把详细推导放在附录)。二是分离条件:只要最弱的一个 on-concept patch 的信号仍能压过最大干扰并留出余量 \(\tau\),这一个随机向量就同时把所有 on-concept patch 都标记对了,从而产出一张概念忠实的归因图;而排版攻击的构造本身保证了注入区域携带很强的词法概念,\(\alpha_k\) 被顶得远高于零。于是单次抽签的成功概率 \(p\) 只跟信噪比有关,要让「至少中一次奖」的概率达到 \(P_{\text{success}}\),所需样本数满足 \(K \ge \log(1-P_{\text{success}})/\log(1-p)\)

真正有意思的是「在哪个空间抽」。全局 residual stream 的维度是 \(d_{\text{model}}\),干扰项 \(\boldsymbol{\xi}_{\max}\) 里堆着所有头加起来的分量,范数大、\(p\) 小,\(K\) 会迅速膨胀到不可行;而把采样限制在单个头的 \(d_{\text{head}}\) 维子空间里,非本头的概念被推进零空间,\(\boldsymbol{\xi}_{\max}\) 的范数显著变小,\(p\) 随之上升,一个计算上可承受的 \(K\) 就能稳定抽中「中奖彩票」。这正是论文所称的「MHSA 瓶颈的优势」,也是它区别于「在整层隐空间上做随机探测」的关键——同样的抽签思路,换个空间就不可用了。

2. 归因到 QK 路由:用「注意力门控 × 边缘效用」把文本聚焦的头挑出来

有了候选概念方向,还需要一个可比的分数来回答「这个头到底是不是在读文字」。本文不看特征本身,而是看 QK 路由:把概念强度聚合到目标 token \(i\) 上记为 \(F_i(\mathbf{u})=\langle\mathbf{o}_i,\mathbf{u}\rangle=\sum_j A_{i,j}V_j(\mathbf{u})\),其中 \(A_{i,j}\) 是 softmax 之后的注意力权重、\(V_j(\mathbf{u})=\langle\mathbf{v}_j,\mathbf{u}\rangle\) 是 patch \(j\) 上的概念投影。把它对 pre-softmax logit \(s_{i,j}\) 求偏导,链式法则穿过后得到:

\[ \frac{\partial F_i(\mathbf{u})}{\partial s_{i,j}} = A_{i,j}\big(V_j(\mathbf{u}) - F_i(\mathbf{u})\big) \]

右边两项各有分工:\(A_{i,j}\) 是这个 patch 拿到的注意力门控,\(V_j(\mathbf{u})-F_i(\mathbf{u})\) 是它的边缘效用——这个 patch 的概念强度比当前聚合值高出多少。两者相乘意味着,一个 patch 要被归因为「带文字的源头」,必须既被模型真正注意到、又在概念上比周围更突出,只看其中任一项都不够:只信注意力权重会被 attention sink 之类的全局高权 patch 带偏,只看特征相似度则丢掉了「信息是否真的流进了目标 token」这一环。

打分时用已知的文字位置掩码把上式折成两类分数。Mask Attribution Score(MAS)只累加正向归因(与线性表征假设的加性一致),并按掩码大小归一;再把文本掩码 \(\mathbf{m}^+\) 与逆掩码 \(\mathbf{m}^-\)(CLS 位恒置零)两路相除,得到归一化的 Text Attribution Score:

\[ \text{nTAS}_i(\mathbf{m}^+,\mathbf{m}^-) = \frac{\text{MAS}_i(\mathbf{m}^+)}{\text{MAS}_i(\mathbf{m}^+) + \text{MAS}_i(\mathbf{m}^-)} \]

nTAS 落在 \([0,1]\),同时刻画「有多关注文字」和「有多不关注物体」,因此可以跨头、跨主干直接比较。一个头的最终得分是它在所有采样向量与增强无标注图片上的均值,然后在层内用 z 检验挑出显著偏高者(默认 \(z=1\),也支持用少量标定数据选阈值)。整条挖掘流程只用无标注图片加自动文字注入,是 label-free 的——这也是它相对 Dyslexify 的带标注贪婪搜索最直接的差别。

3. 推理期干预:对定位到的头做注意力重加权或零消融

定位出 \(\mathcal{C}_{\text{lex}}\) 之后,剩下的是「怎么动手」。对分类任务,ViT 有专门的 CLS token,文字信息是通过 patch token 的注意力被搬进 CLS 的,所以直接在 CLS 的注意力分布上做手术:给定控制参数 \(a\in[0,1]\),把原始注意力图 \(\mathbf{a}_{\langle\text{cls}\rangle}\) 重分配为

\[ \mathbf{a}'_{\langle\text{cls}\rangle}[i] = a\cdot\mathbb{I}(i=0) + \mathbf{a}_{\langle\text{cls}\rangle}[i]\cdot\frac{1-a}{\sum_{j=1}^{N-1}\mathbf{a}_{\langle\text{cls}\rangle}[j]}\cdot\mathbb{I}(i\neq 0) \]

即把 \(a\) 比例的注意力锁在 CLS 自己身上,剩下的 \(1-a\) 按原始比例摊给全部 patch token。这个设计的好处是保留了注意力图的归一化与原有的相对偏好,只等比压缩了 patch 侧的贡献,因此不会像硬置零那样连带毁掉该头承载的其他视觉信息;论文实验中取 \(a=1\) 做最大强度干预。

对 LVLM 情况不同:很多模型根本没有独立的 CLS token,视觉信息全靠 patch token 的嵌入往下传,注意力重加权无从下手,所以论文改用零消融——直接用零向量替换脆弱头的输出,把这条词法通路从视觉 token 流里切断。迁移到 LVLM 还要多解决一个前提:没有 CLS,归因的目标 token 是谁?论文取第一个视觉 token(固定在左上角)当 CLS 的代理,依据是 ViT 会用冗余 patch token 处理全局信息这一既有观察——第一个视觉 token 在 LVLM 里很可能已经自发承担了类似 CLS 的角色。这一选择让同一套采样—归因—干预流程无需重训、也无需改动模型架构,就能直接套到 Qwen3-VL、InternVL3.5、Gemma3 这些异构 LVLM 的视觉编码器上。

一个完整示例

拿 ViT-H/14 在 RTA-100 上的一个样本走一遍完整流程:

  • 输入:一张「猫」的图,图上被叠了白底黑字的 GOOSE
  • 采样:在后 20% 的 block 里,每个注意力头按 \(\mathcal{N}(0,\frac{1}{d_{\text{head}}}I)\) 采样 \(16\times d_{\text{head}}\) 个候选方向。
  • 归因:绝大多数随机向量和该概念无关,投出来的归因图是散乱的噪声,nTAS 很低;偶尔抽中一个对齐到「词法形状」的方向时,归因图会高度集中在文字的笔画区域(论文 Fig. 2 给出的这类向量 nTAS = 0.8980),该头在这一层的 z 分数随之明显偏高。
  • 筛选:层内 z 检验(\(z=1\))在 H/14 上选中 15 个注意力头(放宽到 \(z=0.5\) 得 24 个,收紧到 \(z=2.0\) 只剩 4 个)。
  • 干预:测试时对这 15 个头的 CLS 注意力按 \(a=1\) 重加权,patch 侧注意力被整体压掉。
  • 结果:同一张图,干预前模型顺着文字答成 goose,干预后回到 cat;在整个 RTA-100 上,H/14 的目标分类准确率从 53.4% 升到 76.2%,文字混淆率从 42.0% 降到 14.4%。

实验关键数据

主实验

表 1:跨主干的目标分类鲁棒性(零样本分类,OCA 越高越好、TCR 越低越好;箭头两侧为 基线 → 加干预)

模型 RTA-100 OCA RTA-100 TCR IN-100-Text OCA IN-100-Text TCR
ViT-B/16 56.3 → 68.7 (+12.4) 30.8 → 12.6 (−18.2) 54.6 → 74.2 (+19.6) 33.0 → 7.1 (−25.9)
ViT-L/14 54.6 → 68.9 (+14.3) 39.0 → 21.2 (−17.8) 58.2 → 74.9 (+16.7) 32.9 → 12.1 (−20.8)
ViT-H/14 53.4 → 76.2 (+22.8) 42.0 → 14.4 (−27.6) 56.6 → 79.1 (+22.5) 36.9 → 9.5 (−27.4)
ViT-g/14 50.3 → 68.8 (+18.5) 45.8 → 23.4 (−22.4) 57.0 → 76.4 (+19.4) 36.4 → 12.7 (−23.7)
ViT-bigG/14 61.0 → 75.7 (+14.7) 32.5 → 15.3 (−17.2) 62.3 → 80.6 (+18.3) 31.0 → 8.9 (−22.1)

表 2:与现有防御方法的平均准确率对比(%,IN-100 为干净图像、不带攻击)

方法 RTA-100 Disentangling PAINT IN-100-Text IN-100(干净)
Defense-Prefix(监督,需训练) 63.6 67.8 67.8 70.1 81.4
Dyslexify(免训练,本文复现) 67.0 67.6 70.1 72.8 81.3
Dyslexify*(原文报告口径) 68.5 70.7 72.2 81.0
本文(nTAS) 71.7 78.7 74.7 77.0 81.0

表 3:迁移到 LVLM 后的 VQA 准确率(RIO-Bench obj-attack 分片,格式为 基线 → 加干预)

模型 Easy Medium Hard 平均
Qwen3-VL-4B 68.29 → 69.71 65.67 → 66.52 54.90 → 55.53 62.95 → 63.92 (+0.97)
Qwen3-VL-8B 74.19 → 75.81 71.23 → 73.34 64.91 → 65.92 70.11 → 71.69 (+1.58)
Qwen3-VL-30B-A3B 67.34 → 69.11 66.71 → 66.87 60.90 → 62.35 64.98 → 66.11 (+1.13)
InternVL3.5-8B 63.87 → 63.96 60.77 → 61.18 50.09 → 50.28 58.24 → 58.47 (+0.23)
InternVL3.5-14B 56.95 → 57.01 55.65 → 55.37 46.62 → 46.87 53.07 → 53.08 (+0.01)
Gemma3-4B 47.98 → 49.72 46.46 → 47.98 38.60 → 40.52 44.35 → 46.07 (+1.73)
Gemma3-12B 49.91 → 52.27 48.74 → 49.84 46.08 → 47.22 48.24 → 49.78 (+1.53)

评测基准包括目标分类的 RTA-100、Disentangling、PAINT,以及作者用 Qwen-Image-Edit 在 ImageNet-100 上新建的 IN-100-Text(每张图注入一个语义冲突的类名,渲染风格共 7 种;像素级编辑区域在最大通道差 > 20/255 处的均值/中位数占比为 16.3%/11.5%),VQA 侧用专为排版攻击构建的 RIO-Bench。

消融实验

表 4:z 阈值敏感性(ViT-H/14,RTA-100)

z 阈值 选中头数 OCA TCR 干净 IN-100 准确率
0.5 24 75.9 14.0 83.2
1.0(默认) 15 76.3 15.4 83.3
2.0 4 66.5 27.1 83.9

表 5:随机种子稳定性(扩展比 16,4 个随机种子,均值 ± 标准差)

模型 RTA-100 OCA / TCR Disentangling OCA PAINT OCA
ViT-B/16 68.7 ± 0.0 / 12.6 ± 0.0 88.3 ± 0.0 73.8 ± 0.0
ViT-L/14 68.8 ± 0.1 / 21.3 ± 0.2 68.3 ± 0.0 68.9 ± 0.0
ViT-H/14 76.2 ± 0.1 / 14.1 ± 0.6 83.2 ± 1.9 77.2 ± 2.9
ViT-g/14 68.8 ± 0.0 / 23.4 ± 0.1 83.2 ± 3.1 75.7 ± 0.0
ViT-bigG/14 75.4 ± 0.2 / 15.7 ± 0.6 70.6 ± 2.6 75.0 ± 3.7

关键发现

  • 干预在所有主干、所有攻击基准上都有效:OCA 提升幅度 7.7–36.1 点(最小的 ViT-L/14 在 PAINT 上 +7.7,最大的 ViT-B/16 与 ViT-H/14 在 Disentangling 上均 +36.1),TCR 下降 10.7–36.1 点。ViT-H/14 在所有四个攻击基准上都是本文的最强配置(OCA 75.7–82.2)。
  • 增益不是靠牺牲干净性能换来的:在干净的 IN-100 上,本文 81.0 与 Defense-Prefix 81.4、Dyslexify 81.3 基本持平,论文报告精度损失不到 1%;干净 VQA 上的波动区间为 −0.3% ~ +0.6%。
  • 与训练型方法的对比:在四个攻击集上取平均,本文 75.5、Dyslexify(本文复现口径)69.4、Defense-Prefix 67.3,即相对先前免训练方法平均高 6.1 点、相对监督方法平均高 8.2 点。注意「Dyslexify*」一行是原论文自报数字(需在完整 ImageNet-100 训练集上迭代评估),与本文复现口径不可直接混比。
  • LVLM 上的收益明显不均匀:Qwen3-VL 三个规模一致为正(平均 +0.97 / +1.58 / +1.13),Gemma3 两个规模增益最大(+1.73 / +1.53),而 InternVL3.5 几乎不动(+0.23 / +0.01,其中 14B 在 medium 上还出现 −0.28)。论文没有解释 InternVL 系列为何不涨,这直接关系到「第一个视觉 token 可当 CLS 代理」这一假设的普适性。
  • 超参不敏感,只有阈值过硬才崩\(z\in\{0.5,1.0\}\) 时选中 24/15 个头,OCA 与 TCR 基本稳定(75.9/76.3、14.0/15.4),干净准确率也几乎不动(83.2/83.3);\(z=2.0\) 时只剩 4 个头,OCA 掉到 66.5、TCR 涨到 27.1,说明电路被砍得过于激进会漏掉真正负责词法读取的头。
  • 采样数在 8 倍隐维处就稳定:模块得分在随机种子间的标准差随采样扩展比上升而下降,8 samples/dim 之后跨 5 个主干都趋于平稳,继续加大采样收益有限——这为「每个模块采 16 倍隐维」的默认设置提供了依据。
  • 定性验证:归因到未对齐概念向量时输出弥散、无语义焦点的噪声图;对齐的向量则给出集中于文字笔画的图。高 nTAS 组与低 nTAS 组对照显示,nTAS 大小与词法聚焦程度正相关,支撑了用它来挖脆弱的词法电路。
  • ⚠️ 表格之间存在少量数字出入:ViT-H/14 的 RTA-100 TCR 在表 2、表 5 和正文 z 阈值讨论中分别为 14.4、14.1 ± 0.6、15.4;ViT-bigG/14 的 PAINT OCA 在表 2 为 79.6、表 5 为 75.0 ± 3.7,ViT-L/14 的 IN-100-Text TCR 为 12.1 vs 12.2。论文未说明这些是随机种子口径还是实验设置差异,此处按原文照录,不做统一。

亮点与洞察

  • 把 dictionary learning 换成「随机抽签 + 归因筛选」:省掉了训练稀疏自编码器的全部开销,且用干扰上界论证了「必须在 MHSA 头子空间采样」——同样的随机探测放到全局 residual stream 上,干扰范数随头数累积、所需样本数会爆炸。这是本文最有分量的一步,把线性表征假设与彩票假设拼成了一个可落地的免训练解释工具。
  • 归因式 \(\partial F/\partial s = A\cdot(V-F)\) 是本文最漂亮的设计:它把「被模型注意到」(注意力门控)和「概念上更突出」(边缘效用)两件事相乘,比只看注意力权重(容易被 attention sink 类的高权 patch 带偏)或只看特征相似度(丢失「信息是否流进目标 token」这一环)都更忠实,而且天然产出一张可可视化、可解释的 patch 级掩码。
  • 「第一个视觉 token = 涌现 CLS 代理」是便宜且可复用的 trick:它让一套为 CLS token 设计的归因流程零改动地迁移到没有 CLS 的 LVLM 上,思路(借用 register token / 冗余 patch token 承载全局信息的既有发现)可以搬到其他需要「给无 CLS 模型找一个聚合位置」的解释性工作里。
  • 干预算子的代价极低:只作用在一组固定的头索引上,测试时不引入任何额外计算;重加权保留了注意力归一化与相对偏好,只等比压缩 patch 侧贡献,比直接置零温和得多——这种「改分布而不改拓扑」的思路可以直接迁移到其他需要压制某类输入的推理期干预场景。

局限与展望

  • 依赖已知的文字位置掩码:MAS/nTAS 需要 \(\mathbf{m}^+\) 才能计算,论文靠自动文字注入增强来构造它。真实场景中文字位置未知,得先做文字检测或分割,这一步的误差会直接污染归因分数,进而影响电路挖掘——作者没有评估这种「掩码不完美」情形下的退化程度。
  • 重加权强度取 \(a=1\) 是最大强度,但缺少折中曲线:论文只在实验中把 \(a\) 设为 1,没有系统报告 \(a\) 从 0 到 1 的鲁棒性—干净性能权衡。对 CLS 侧注意力的「一刀切」压缩也可能连带压掉该头承载的非词法视觉信息,这一点在概念纠缠严重的头上风险更高。
  • LVLM 上增益有限且不均匀:InternVL3.5 两个规模几乎为零(+0.01 / +0.23),论文把它归因于模型硬件差异却未给机制解释。这暗示「第一个视觉 token 是涌现 CLS 代理」并非对所有架构成立,需要更系统的验证(例如直接比对不同位置 token 的归因图集中度)。
  • 干净性能评估面偏窄:只覆盖了 IN-100 分类与 RIO-Bench clean split 两类任务,对 captioning、visual grounding 等更依赖细粒度视觉信息的任务是否有副作用,论文没有涉及。
  • 概念方向的随机性带来的可复用性缺口:抽到的 \(u\) 是「中奖即用」的随机方向,不像稀疏字典那样给出稳定、可跨模型复用的概念基。多个主干之间实际抽到的概念是否语义一致,论文只用少数可视化样本做了定性说明。
  • 表内数字存在前后不一致(见「关键发现」末条),影响对具体增益的精确引用。
  • 可改进方向:把文字掩码的获取内化成方法的一部分(例如用归因图自身做无监督的文字区域发现);对 \(a\)\(z\) 做自动标定而非手选默认值;为「涌现 CLS 代理」给出可检验的判据,让 LVLM 迁移不再是碰运气。

相关工作与启发

  • vs Dyslexify:两者都是免训练、都对脆弱模块做电路挖掘,但 Dyslexify 依赖带标注的贪婪搜索在注意力统计上找模块,本文把「概念对齐」显式建模进归因分数,并用随机采样替代贪婪搜索。代价是本文需要一个已知的文字位置掩码,而 Dyslexify 不需要;本文自称相较它平均高 6.1 点,但两边都是「自报 + 复现」的混合口径,直接比大小需谨慎。
  • vs Defense-Prefix:监督式的 prompt token 学习,需要标注数据且不提供任何机制层面的解释;本文无需训练、无需成对标注,在攻击集上平均高出 8.2 点,干净准确率只低 0.4 点,同时给出可解释的电路定位。
  • vs 稀疏字典学习类可解释性(SDL / CLIP 头-层分解):这些工作训字典或做贪心文本描述搜索,把层当成不可分的块来分析;本文不训任何参数、把粒度下沉到注意力头,且明确指出「在全局流上做随机探测不可行、必须在头子空间做」。代价是失去了字典那种稳定的概念基与跨模型复用性。
  • vs RIO-Bench / TypoD 这类评测工作:它们揭示并量化 TA 脆弱性的普遍存在(含多图设置、自动驾驶场景下的真实文本干扰),本文则是在同一问题上的防御侧答案——用机制手段定位并切断词法通路,二者互补。

评分

  • 新颖性: ⭐⭐⭐⭐ 把随机采样当解释工具、并用干扰界论证「头子空间采样更优」是有分量的机制性论证,但梯度归因与电路挖掘的整体框架沿用前人较多。
  • 实验充分度: ⭐⭐⭐⭐ 5 个主干 × 4 个攻击基准、7 个 LVLM 配置,外加阈值/种子/采样数三重稳定性分析;但缺 \(a\) 的权衡曲线与更广的干净任务评估。
  • 写作质量: ⭐⭐⭐ 方法与理论部分脉络清楚,但表格之间存在多处数字不一致,个别符号定义需要回到附录才能对齐。
  • 价值: ⭐⭐⭐⭐ 免训练、可解释、推理期零开销的 TA 防御,对安全敏感的 VLM 部署有直接可用性;LVLM 上的收益虽小但方向明确。