DEX-AR: A Dynamic Explainability Method for Autoregressive Vision-Language Models¶
会议: ECCV 2026
论文: ECCV 2026
代码: https://walidbousselham.com/DEX-AR
领域: 可解释性
关键词: 可解释性、视觉语言模型、注意力梯度归因、自回归生成、注意力头筛选
一句话总结¶
DEX-AR 把每个生成步的注意力图对中间 logit 的梯度当作归因信号,再用"视觉 vs 文本最大梯度差"动态筛选注意力头与生成 token,为自回归 VLM 同时产出逐 token 与整句两个级别的图像热图,在 ImageNet/VQAv2 的扰动评测与 PascalVOC 的分割定位上稳定超过 Grad-CAM、注意力类与扰动类基线。
研究背景与动机¶
自回归视觉语言模型(LLaVA、BakLLaVA、PaliGemma、Florence-2 这一类)已经能看图问答、写描述,但要追问"模型说出的那个 dog 究竟看的是图像哪一块",却几乎没有现成工具。为分类任务设计的可解释性方法——Grad-CAM、Guided Backprop、Integrated Gradients——都假设模型输出是固定类别上的 logits,遇到逐 token 生成的文本序列就失去了归因目标;注意力类方法(Raw Attention、Attention Rollout)虽然天然适配 Transformer,但已有研究反复指出注意力权重本身不等于特征重要性,在视觉与文本 token 交替的多模态层里更不可靠;而针对 CLIP 这类对比模型发展出的解释方法(Chefer 等的注意力重加权、同作者的 LeGrad)处理的是静态的图像-文本对齐,无法表达"第 t 步生成的 token 依赖的是哪一段上下文"这种随时间变化的状态。
真正的困难有两层,一层是时序、一层是词性。时序上,同一块图像区域在不同生成步的作用完全不同——生成 dog 时它是关键证据,生成紧随其后的 and 时它毫无贡献,因此归因必须绑定到具体生成步,而不能像分类模型那样对整句输出只给一张图;因果注意力还让每个 token 的隐状态累积了前面全部上下文,早期 token 的归因偏差会顺着序列传播下去。词性上,一句 "The young woman is wearing a floral dress" 里只有 woman、floral、dress 受视觉证据支配,the、is、wearing 几乎完全由语言先验决定,如果把它们和内容词一起平均进同一张热图,解释会被大量与图像无关的 token 稀释成"到处都亮一点"。最接近的工作 TAM 用静态视觉特征加事后统计因果估计来缓解上下文干扰,但它并不在每个生成步上观察注意力动力学的动态变化。
本文的切入角度是:Transformer 每一层的注意力图本身就记录了"当前这个 token 看了谁",那么注意力图对当前预测 logit 的梯度就度量了"这一层这个头对这次预测有多敏感",再配上两个几乎不需要超参的筛选器(两者都用视觉与文本之间的最大梯度差构造),分别压掉以处理文本为主的头和由语言先验驱动的 token,归因自然收敛到真正被图像证据支撑的部分。核心 idea:把自回归 VLM 的解释拆成"逐 token 注意力梯度归因 + 动态头筛选 + 序列级 token 筛选"的两级加权,让每一步的解释只由真正依赖视觉证据的注意力通路与 token 构成。
方法详解¶
整体框架¶
先固定记号:视觉编码器把图像编码成 \(N\) 个视觉 token,与 \(T_c\) 个提示词上下文 token 拼成序列喂给 LLM;LLM 有 \(L\) 层、每层 \(h\) 个头,自回归生成 \(T_a\) 个回答 token。在第 \(t\) 步,序列长度为 \(N+T_c+t\),因果注意力保证前 \(N+T_c\) 个位置的表示不随生成推进而改变。DEX-AR 是一个完全事后(post-hoc)的方法:不训练任何模块、不修改模型权重、不需要设定阈值,等 VLM 把整句答案生成完之后再回溯每一步的解释。它的输入是图像、提示词和已生成的完整回答,输出是 \(T_a\) 张逐 token 热图(每个生成词一张,指出该词依赖的图像区域)加一张把整句聚合起来的序列级热图。
整条流程是:单次前向取各层在"被预测位置"上的中间 logit(logit lens)并对注意力图求梯度;只保留被预测 token 自己的查询行与视觉 token 的列;按"视觉 − 文本"最大梯度差给每个头加权(头筛选),得到逐 token 热图;再用同样的差值在"层 × 头"维度取最大给每个生成 token 加权(token 筛选),聚合成序列级热图。要强调的是,两级筛选量化的是同一件事——"这份注意力/这个 token 是否真的依赖图像"——但作用的对象不同:前者作用在头(空间维度的加权),后者作用在生成步(时间维度的加权)。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["图像 + 提示词 + 已生成回答"] --> B["逐 token 的注意力梯度归因"]
B --> C["动态注意力头筛选<br/>→ 逐 token 热图"]
C --> D["序列级 token 视觉相关性筛选"]
D --> E["序列级热图"]
关键设计¶
1. 逐 token 的注意力梯度归因:用中间层的注意力梯度锁定"这一步看了哪块图"
DEX-AR 不在最后一层上做归因,而是借助 logit lens:把第 \(l\) 层最后一个位置的隐状态直接过语言模型头,得到这一层"如果此刻就要输出"的中间 logits \(o^{l,t}=\text{LM\_Head}(Z^{l,t}_{-1})\in\mathbb{R}^{V}\),取其对应实际被采样词的那一个 logit \(\hat{o}^{l,t}\),再对第 \(l\) 层的注意力图 \(A^{l,t}\in\mathbb{R}^{h\times T_t\times T_t}\) 求偏导。敢用中间层是因为残差流结构保证中间隐状态对 LM head 而言并非分布外,论文的补充实验(Supp. Tab. 7)也确认改用中间特征后四个架构的 IoU 一致变好;而之所以对注意力图求梯度、而不是对输入像素或隐状态求梯度,是因为注意力图在 decoder-only、prefix-decoder 和 encoder-decoder 三类架构里都存在,同一套公式不改就能横跨四种 VLM。
得到梯度张量后只保留两部分:被预测 token 自己那一行(因果注意力下位置 \(n\) 的中间 logit 只依赖注意力矩阵的第 \(n\) 行),以及视觉 token 对应的那些列。剩下的 \(\nabla A^{l,t}_{-1,v}\in\mathbb{R}^{h\times N}\) 就是"每个头在这一步把多少预测敏感性放在图像上"的原始信号。此外,由于解释是事后做的、整句已经生成完,DEX-AR 可以把 \(T_a\) 次前向压成一次:提示词与全部回答拼成单条序列送入模型,因果掩码保证每个位置的隐状态与逐步生成时完全一致,不会有未来 token 的信息泄漏;更进一步,因为不同目标 token 的梯度只落在注意力矩阵互不相交的行上,把 \(T_a\) 个位置的 logit 相加、每层只做一次反向传播,就能恢复出数学上完全相同的逐 token 梯度。开销从 \(T_a\) 次前向 + \(T_a\times L\) 次反向降到 1 次前向 + \(L\) 次反向,\(T_a=100\) 时实测加速约 18 倍。
2. 动态注意力头筛选:只让"看图多于看字"的头说话
并不是所有头都在看图——很多头专门处理语法、指代和上下文,把它们的梯度一起加进来只会向热图注入噪声。消融实验很直白地印证了这一点:完全不做筛选时 SNR 只有 1.64(LLaVA)/ 5.27(BakLLaVA),而用全部梯度的均值来给头打分甚至比不筛选还差。DEX-AR 的做法是:对每个(层 \(l\)、头 \(i\)、生成步 \(t\))分别算它对视觉 token 与对文本 token 的梯度幅值最大值 \(S^{l,t,i}_{\text{img}}\) 和 \(S^{l,t,i}_{\text{text}}\),再取两者之差过 ReLU 作为该头的权重:
ReLU 让"看文本多于看图像"的头权重直接归零,因此既不需要设阈值、也不需要指定要保留多少比例的头——筛选强度完全由模型自己的梯度决定。这里用最大值而不是均值是关键:平均意义下小物体(网球)会被大区域(天空)淹没,而最大值抓的是最强的那条视觉证据,与目标的空间尺寸无关,跨物体大小的定位因此更准(论文 Sec. 4.5 给出了对照)。逐 token 热图就是所有头、所有层按该权重加权求和后 reshape 回二维网格并做 min-max 归一化:
由于 \(w^{l,t,i}\) 依赖生成步 \(t\),同一个头在不同 token 上的权重可以完全不同——这是方法名里 dynamic 的第一层含义。
3. 序列级 token 视觉相关性筛选:把纯语言 token 从聚合里剔出去
序列级热图如果对所有 token 一视同仁地平均,等于默认每个词都同等依赖图像,而事实上 the、is、wearing 这类词靠语言先验就能预测。DEX-AR 把梯度的含义读作"预测敏感度":某个特征的梯度幅值越大,说明扰动它会让模型对当前 token 的置信度掉得越厉害。于是用与头筛选完全相同的视觉−文本最大梯度差定义 token 的"视觉必要性",区别只在于这次要在层与头两个维度上取最大而不是再求和——因为这里要问的是"这个 token 有没有一条足够强的视觉证据链",只要存在一条依赖图像的通路,就不能断言它是纯语言驱动的:
\(\delta^t\) 为 0 的 token 会被彻底剔除出聚合,也就是"文本敏感度不低于视觉敏感度"的词完全不参与最后一张热图——这是 dynamic 的第二层含义:加权系数随生成步变化,且由模型自己的梯度决定。效果非常直接:PascalVOC-QA 上单独打开头筛选只把 SNR 从 9.16 提到 16.84,单独打开 token 筛选就能提到 89.29,两个一起到 96.12。也就是说,token 级筛选才是这套双重筛选里的主力,头筛选更像是先把噪声大的通路关掉、给 token 筛选一个干净的输入。
一个完整示例¶
输入一张图,提示词是 "What is the content of the image?",VLM 生成 "The image features a dog and a cat sitting together in a grassy field"。原文 Fig. 1 直接标出了这一句的逐 token 权重(⚠️ 以下读数按原文图示转录,分词边界可能有出入,以原文为准):内容词 dog 5.9、cat 5.2、grass(y) 4.1、sitting 3.5,together 只有 0.4,而 The、image、features、a、and、in 全部是 0。聚合序列级热图时,狗和猫这两个词贡献了绝大部分权重,冠词与介词被直接清零,模板句 "The image features…" 不会在热图上留下任何响应。
这些权重来自头筛选这一级。以某一层某个头为例(数值为示意,仅说明机制):若它对视觉 token 的最大梯度幅值是 0.8、对文本 token 是 0.2,那么它在这一步的权重是 0.6,它对应的梯度图以 0.6 的强度被加进 \(\bar{E}^{(t)}\);反过来,一个主要盯着上文文本的头,文本侧最大梯度 0.5、视觉侧只有 0.1,过 ReLU 后权重直接归零,它的梯度图完全不参与这一步的解释。原文 Fig. 1 把"w/ 头筛选"与"w/o 头筛选"、"w/ token 筛选"与"w/o token 筛选"两两对照:关掉头筛选时热图上出现散点状噪声,关掉 token 筛选时模板句带来的背景响应重新出现——两级筛选各自负责一类噪声,缺一不可。
实验关键数据¶
主实验¶
扰动评测(按原文 Table 1 重绘,只保留两个代表模型)。协议是:把热图分值最高的 \(p\%\) 像素(\(p\in\{0\%,10\%,\dots,90\%\}\))替换为数据集聚值像素,用归一化困惑度曲线下面积 AUC 衡量——正扰动越高说明被剔除的确实是关键区域,负扰动(去掉最低分像素)越低说明没把无关区域误判成重要区域。LLaVA-1.5 因注意力实现不暴露逐层注意力图而无法运行 Attention Rollout,原文 Table 1 未列该行。
| 模型 | 方法 | ImageNet Pos↑ | ImageNet Neg↓ | VQAv2 Pos↑ | VQAv2 Neg↓ |
|---|---|---|---|---|---|
| LLaVA-1.5 | Raw Attention | 2.17 | 1.01 | 0.88 | 0.89 |
| LLaVA-1.5 | GradCAM | 1.43 | 1.10 | 0.91 | 0.77 |
| LLaVA-1.5 | CheferCAM | 2.06 | 1.03 | 0.93 | 0.78 |
| LLaVA-1.5 | Attn×Grad | 1.94 | 1.00 | 0.90 | 0.80 |
| LLaVA-1.5 | Int.Grad | 1.63 | 1.52 | 0.91 | 0.80 |
| LLaVA-1.5 | RISE | 1.24 | 0.99 | 0.92 | 0.78 |
| LLaVA-1.5 | IIA | 1.66 | 0.90 | 0.92 | 0.77 |
| LLaVA-1.5 | DEX-AR | 2.31 | 0.96 | 0.93 | 0.77 |
| BakLLaVA-v1 | Raw Attention | 11.47 | 4.36 | 0.98 | 0.86 |
| BakLLaVA-v1 | Rollout | 6.13 | 3.12 | 0.95 | 0.90 |
| BakLLaVA-v1 | GradCAM | 7.49 | 4.39 | 1.01 | 0.86 |
| BakLLaVA-v1 | CheferCAM | 11.15 | 4.07 | 1.05 | 0.84 |
| BakLLaVA-v1 | Attn×Grad | 12.60 | 3.74 | 1.06 | 0.86 |
| BakLLaVA-v1 | Int.Grad | 13.50 | 12.77 | 1.03 | 0.84 |
| BakLLaVA-v1 | RISE | 6.39 | 3.87 | 1.09 | 0.86 |
| BakLLaVA-v1 | IIA | 11.08 | 3.77 | 1.02 | 0.86 |
| BakLLaVA-v1 | DEX-AR | 18.10 | 2.48 | 1.13 | 0.81 |
分割定位评测在 PascalVOC 上做(提示词为 "Classify the image",对图中所有物体的真值掩码评估,因此要求模型同时定位多个物体)。三个指标互补:soft-IoU 直接作用于连续归因图、不依赖阈值,IoU 在 20 个等距阈值上取最优,EPG 衡量落在物体掩码内的归因能量占比。
| 模型 | 方法 | soft-IoU↑ | IoU↑ | EPG↑ |
|---|---|---|---|---|
| LLaVA-1.5 | Raw Attention | 2.00 | 19.10 | 16.00 |
| LLaVA-1.5 | GradCAM | 10.20 | 28.90 | 19.30 |
| LLaVA-1.5 | CheferCAM | 1.60 | 21.01 | 17.10 |
| LLaVA-1.5 | Attn×Grad | 5.10 | 24.20 | 26.60 |
| LLaVA-1.5 | DEX-AR | 17.70 | 36.34 | 27.75 |
| PaliGemma | Raw Attention | 4.11 | 20.38 | 16.55 |
| PaliGemma | GradCAM | 8.44 | 22.55 | 26.95 |
| PaliGemma | Attn×Grad | 6.55 | 23.32 | 23.52 |
| PaliGemma | DEX-AR | 15.26 | 23.55 | 20.43 |
消融实验¶
双筛选消融在 PascalVOC-QA 上用 LLaVA-1.5-7B 做。该数据集由 PascalVOC 图像加模板化描述自动构造(如 "I see a {object 1} as well as a {object 2}"),因此能拿到"哪些 token 是填充词、哪些是内容词"的 token 级真值标注。
| 头筛选 | token 筛选 | SNR↑ | MSE↓ | EPG↑ |
|---|---|---|---|---|
| ✗ | ✗ | 9.16 | 0.13 | 44.96 |
| ✓ | ✗ | 16.84 | 0.10 | 63.38 |
| ✗ | ✓ | 89.29 | 0.11 | 92.50 |
| ✓ | ✓ | 96.12 | 0.12 | 95.04 |
头筛选策略消融(PascalVOC,不筛选 / 只取最大梯度 / 取 top-k% 梯度 / 全部梯度取平均):
| 头筛选策略 | LLaVA SNR↑ | LLaVA MSE↓ | BakLLaVA SNR↑ | BakLLaVA MSE↓ |
|---|---|---|---|---|
| 不筛选 | 1.64 | 0.33 | 5.27 | 0.15 |
| max(本文) | 3.64 | 0.22 | 6.02 | 0.14 |
| top 5% | 3.35 | 0.24 | 4.13 | 0.17 |
| top 50% | 1.45 | 0.34 | 1.62 | 0.27 |
| avg(全梯度均值) | 1.09 | 0.30 | 1.05 | 0.30 |
关键发现¶
- token 级筛选是主力,头筛选是清道夫。 单独打开 token 筛选把 SNR 从 9.16 拉到 89.29,单独打开头筛选只到 16.84;两者叠加到 96.12 说明它们处理的噪声几乎不重叠,是互补而非冗余。不过要注意 MSE 并不随筛选单调改善(0.13 → 0.10/0.11 → 0.12),"双筛选全面更好"只在 SNR 与 EPG 上成立。
- 视觉信息高度集中,所以选择性比覆盖面重要。 头筛选从 max 退到 top 5%、top 50% 再到全梯度平均,SNR 单调下滑且 avg 甚至不如不筛选(1.64 → 1.09),说明被平均进来的头基本是噪声源;这也解释了为什么最简单的 max 策略(等价于只保留一个最强的差)反而最好。
- 正扰动增益明显、负扰动增益不稳。 ImageNet 上 BakLLaVA 的 AUC 比 Attn×Grad 高 5.5(18.10 vs 12.60),但负扰动只有 2.48,且 PaliGemma 上 0.90 略逊于 GradCAM 的 0.87;VQAv2 上 BakLLaVA 的 1.13 也被 RISE 的 1.09 逼近。这与分割评测里"soft-IoU 大胜、EPG 在 PaliGemma 上输给 GradCAM"是同一个现象:DEX-AR 的图覆盖更全、更贴物体轮廓,但不是最高峰值的窄热图,而 EPG 与负扰动都偏好后者。
- 绝对定位精度仍然有限。 最好的 IoU 只有 36.34,说明归因图远不是分割掩码;作者也明确把分割定位定位成 spatial sanity check,主要评测是扰动忠诚度(faithfulness)。
- 速度是实用性的关键差异。 单张 ImageNet 图 DEX-AR 只要 0.71 秒,CheferCAM / Int.Grad / RISE / IIA 分别是 6.20 / 8.20 / 11.8 / 15.3 秒(8–21 倍差距),批量变体在 \(T_a=100\) 时再快 18 倍;对短答案 VQA(5–10 个 token)和分类(1–3 个 token)这类真实场景,这个成本才有可用性。
- 跨架构一致。 decoder-only(LLaVA-1.5、BakLLaVA)、prefix-decoder(PaliGemma)、encoder-decoder(Florence-2)三类架构上 DEX-AR 都领先,说明增益来自机制而不是某个模型的实现细节。
亮点与洞察¶
- 对注意力图求梯度,而不是对输入或隐状态求梯度。 这个选择让整套方法天然跨架构:只要模型有注意力图就能用,公式一行不用改。相比之下 Grad-CAM 需要卷积特征图、RISE 需要能反复前向,都被架构或成本绑住。
- 用"视觉减文本最大梯度差"当筛选器,是一个零超参、有物理直觉的设计。 没有阈值、没有保留比例、没有可训练参数,而且差值的符号天然对应"这个头/这个词是否更依赖图像"。取 max 而非 mean 也有明确解释——尺寸无关性——这是把"定位准确率受物体大小影响"这一具体痛点直接编码进了打分函数。
- 把梯度重新解释为"视觉必要性",顺手得到一个可复用的中间量。 \(\delta^t\) 是一个免费的逐 token 视觉依赖度分数:它可以反过来当幻觉检测器用(\(\delta^t\) 接近 0 却高置信度生成的 token,正是语言先验在编内容的地方),也可以做解码时的门控信号(对视觉依赖低的 token 降低采样温度或强制重新看图像)。
- 批量回传的"梯度行不相交"论证不只属于 DEX-AR。 任何对因果 LM 做逐 token 归因的方法都能复用这个技巧:把多个目标位置的 logit 相加、每层只反传一次,就得到数学上完全相同的逐 token 梯度。这是一个便宜的通用优化。
- 评测协议本身是贡献。 用归一化困惑度 AUC 替代"再请一个 LLM 打分"或人工打分,避免了外部模型偏见、给出了连续而非二值的分数;PascalVOC-QA 用模板化句式把"填充词 vs 内容词"的真值标注自动化,让 token 级筛选第一次可以被定量评测。
局限与展望¶
- 强白盒依赖。 方法需要逐层注意力图与反向传播。一个具体的旁证是:连 Attention Rollout 都无法在 LLaVA-1.5 上运行,因为它的注意力实现不暴露逐层图——换成 API 化的 VLM 或高度融合的推理实现(如 FlashAttention 路径)时,DEX-AR 面临的工程障碍只会更大。
- 评测范围偏旧偏小。 四个模型都是 7B 级别、偏早期的 VLM(LLaVA-1.5、BakLLaVA、PaliGemma、Florence-2),没有 Qwen2.5-VL、InternVL、GPT-4o 这类新一代模型;唯一最接近的竞争方法 TAM 的完整对比也被放在了补充材料里。
- 对开放生成的适用性存疑。 归一化困惑度需要参考答案(VQAv2 有 GT),自由描述、开放对话没有标准答案时这个指标不可用;PascalVOC-QA 的"填充词"真值来自固定模板,而在自由生成里这条界线会模糊得多——幻觉出来的物体、比喻性表达、模型自己编的细节,都不好判断该不该被剔除。
- ReLU 硬截断会误杀。 \(\delta^t\) 把"文本敏感度不低于视觉敏感度"的 token 直接清零,但文本证据强不等于没有用图像(例如模型先靠图像确认了类别名,再靠语言组织句子);两级筛选都建立在最大梯度上,对单个异常大的梯度值也比较敏感,容易受离群值影响。
- 扰动协议自身有伪影。 用数据集聚值像素替换 top-p 像素会引入分布外区域,负扰动时尤其容易把"重要区域"的判定框到背景上;论文用正负扰动双向评测部分缓解了这个问题,但没有从根本上消除。
- 可以往下走的方向: 把 \(\delta^t\) 与头权重软化、甚至做成可学习或可摊销(amortized)的模块,避免硬截断;把 \(\delta^t\) 用作解码时的幻觉抑制门控,把"解释"变成"干预";把批量回传技巧推广到任意因果 LLM 的逐 token 归因;在视频/音频自回归 VLM 上,token 筛选对应的时间维度筛选可以自然推广成时序定位。
相关工作与启发¶
- vs Grad-CAM / CheferCAM / Attn×Grad:三者都是"梯度 × 注意力"这一族,但 Grad-CAM 面向卷积特征图与分类 logits,CheferCAM / Attn×Grad 为对比模型与 encoder-decoder 设计、按层重加权静态注意力。DEX-AR 把归因目标换成每一层的中间 logits(logit lens)并绑定到具体生成步,在 soft-IoU 上达到它们的 1.7–11 倍(17.70 vs 10.20 / 1.60 / 5.10);但 EPG 在 PaliGemma 上输给 GradCAM,说明"图更全"与"图更尖"是两种取向,不能只用一个指标下结论。
- vs Attention Rollout:Rollout 直接聚合注意力权重、假设注意力可加、不使用梯度;DEX-AR 用梯度对注意力做敏感性加权。Rollout 在本文评测里几乎所有指标都靠后,且在 LLaVA-1.5 上因实现不暴露逐层图而根本无法运行。
- vs TAM:TAM 用静态视觉特征加事后统计因果估计来抑制上下文干扰,是本文最直接的对手;DEX-AR 的差别在于每个生成步都重新计算层次化梯度,因而能捕捉随步变化的注意力动力学,同时靠批量实现把成本压到 IIA / RISE / Int.Grad 的 1/8 到 1/21。
- vs RISE / Integrated Gradients:都是模型无关的扰动式/公理化方法,不需要访问注意力;代价是精度更低、成本高一个量级(11.8 / 8.2 秒每张图),而且它们给出的是输入像素级解释,不区分生成步。
- vs LeGrad:同作者的前作,面向 CLIP 这类对比模型、以特征形成敏感性做归因。DEX-AR 把同一族思路搬到自回归生成,真正的增量是引入了"生成步"与"token"这两个动态维度以及配套的筛选机制。
评分¶
- 新颖性: ⭐⭐⭐⭐ "梯度 × 注意力"这一族思路已有,但把它完整适配到自回归 VLM 并配上一套零超参的双层筛选(且筛选依据有尺寸无关性这样的具体论证),是明确的新贡献。
- 实验充分度: ⭐⭐⭐⭐ 4 个架构 × 2 个扰动数据集 + 分割定位 + 两组筛选消融 + 运行时分析,还额外贡献了 PascalVOC-QA 与归一化困惑度指标;短板是缺新一代 VLM、负扰动增益不稳定、TAM 对比放在补充材料。
- 写作质量: ⭐⭐⭐⭐ 方法与消融的因果链讲得清楚(为什么用 max 不用 mean、SNR 提升来自哪一级筛选都有交代),但公式排版有损坏,个别句子自相矛盾(把对比模型的解释方法说成"为自回归生成而设计"),Table 1 的双栏排版让行标签很容易读错。
- 价值: ⭐⭐⭐⭐ 提供了一个可直接使用的 VLM 归因工具和一套可复用的评测协议,\(\delta^t\) 与头权重这类中间量还有做幻觉检测、解码门控的二次开发空间。