跳转至

GridVQA-X: A Diagnostic Framework for Evaluating Multimodal Explainability Methods

会议: ECCV 2026
论文: ECCV 原文
代码: Hugging Face Dataset & Models
领域: 可解释性
关键词: 多模态可解释性、捷径学习、因果诊断基准、跨模态协同、视觉问答

一句话总结

针对现有后验多模态可解释性(MxAI)方法缺乏真值因果验证的瓶颈,本文构建了首个具备数学可证因果真值与捷径解耦特性的闭世界诊断基准 GridVQA-X,系统揭示了主流解释算法在识别空间关系协同与词袋匹配捷径时的严重失效。

研究背景与动机

视觉语言模型(VLM)与多模态大语言模型(MLLM)在图文融合推理任务中取得了突破性进展,但其高度纠缠的内部表征导致决策机制极度不透明,阻碍了其在医疗诊断等高风险关键场景中的可靠落地。为此,大量无需访问模型特定架构的后验多模态可解释性(MxAI)方法相继涌现,试图通过细粒度归因热图或全局模态交互标量来揭示跨模态特征协同过程。然而,由于真实世界多模态数据集分布高度复杂且噪声严重,人类标注既无法提供严格因果定义的模态归因真值,又极易在特征与标签间混入非意图统计偏置,使得针对 MxAI 算法本身的忠实性评估始终处于无真值参照的盲区。

更关键的矛盾在于跨模态捷径学习(Shortcut Learning)的普遍存在:多模态模型往往依靠浅层词袋匹配(如仅根据“红色”和“方块”单词检测对应实体),完全忽略“在……左侧”等空间几何关系约束,却能在普通测试集上获得虚假高分。当评估解释器时,现存评估协议根本无法分辨该解释器是在真实揭示模型的深层空间推理链路,还是在为一个仅仅依赖词袋捷径的黑盒模型“脑补”虚假的跨模态协同理由。若解释算法无法严格区分真实推理与浅层捷径,其给出的解释不仅毫无忠实性可言,反而会为人为偏差提供危险的伪可解释性背书。

本文的切入角度是构建一个完全可观测、因果完备且数学上保证唯一真值归因的闭世界合成宇宙。核心 idea:通过形式化空间约束生成具有唯一因果真值掩码的闭世界场景,分别训练具备真实多跳空间推理能力(\(M_{\text{pure}}\))与被结构化强制依赖词袋捷径(\(M_{\text{spur}}\))的孪生模型,构建首个零歧义的多模态可解释性诊断测试床 GridVQA-X。

方法详解

整体框架

GridVQA-X 的整体设计旨在为多模态可解释性提供严格受控且因果唯一的基准环境。框架首先定义了基于 2D 几何对象的完全可观测网格宇宙,通过形式化因果干预将无关背景干扰项的因果效应降为精确的零,从而在数学上锁定目标实体与定位锚点构成的唯一真值因果掩码。随后,框架通过受控的数据合成引擎构建两个平行的基准环境:\(D_{\text{pure}}\) 环境通过在锚点松弛区域主动注入对抗性混淆物体,打破词袋捷径与部分逻辑依赖;\(D_{\text{spur}}\) 环境则严格限制属性采样池,使得不经空间关系判定的浅层属性匹配具备 100% 预测力。在此基础上,基于统一架构分别训练对应真实空间协同机制的 \(M_{\text{pure}}\) 和依赖统计捷径的 \(M_{\text{spur}}\)。最后,利用这两套行为机制已知的基准模型对局部与全局 MxAI 方法展开归因质量与加性谬误评估。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["多模态查询参数与原子实体集合"] --> B["闭世界因果空间与四维分类参数化"]
    B --> C["对抗混淆区构建与鲁棒交集判定定理"]
    C --> D["双轨因果对照合成引擎与配对基准模型"]
    D --> E["多模态归因评测协议与加性谬误诊断"]
    E --> F["可解释性评估结论:局部失真与全局协同伪阳性"]

关键设计

1. 闭世界因果空间与四维分类参数化:形式化消除背景歧义并建立唯一因果真值

真实多模态基准的最大缺陷在于无法严格定义每个视觉像素或文本 token 对决策的因果贡献。GridVQA-X 将场景抽象为大小为 \(S \times S\) 的离散网格空间 \(V\),每个实体对象由颜色、形状和离散坐标三元组 \(o_i = (c_i, s_i, p_i)\) 唯一定义。多模态问题 \(Q\) 包含目标约束 \(T\)、空间参照锚点集合 \(A\) 以及连接它们的方向约束。根据 Pearl 的因果 do-演算,令非目标且非锚点的干扰对象集合为 \(\text{Dist} = V \setminus (A \cup T)\)。对任意干扰项施加干预改变其属性时,输出分布满足:

\[P(y \mid do(o_d \to o'_d)) = P(y), \quad \forall o_d \in \text{Dist}\]

即干扰物体集合对模型决策的因果效应在理论上严格为零,从而严格证明 \(A \cup T\) 构成了多模态查询 \(Q\) 唯一且无歧义的因果解释掩码。任何将归因权重分配给 \(\text{Dist}\) 的解释方法均可被数学判定为不忠实。此外,样本通过四元组 \(\mathcal{T} = (D, Q, F, \rho)\) 进行参数化控制:关系深度 \(D \in \{1, 2, 3\}\) 控制锚点数量与交集跳数;问题类型 \(Q\) 覆盖属性查询、纯形状、纯颜色、混合绑定及数量比较;任务形态 \(F \in \{0, 1\}\) 控制计数或存在性判断;网格密度 \(\rho \in \{d0.3, d0.7\}\) 控制干扰项拥挤度,全方位逼近现实多模态交互的复杂度。

2. 对抗混淆区构建与鲁棒交集判定定理:阻断局部逻辑与浅层匹配退化

在多跳空间推理中,模型极易产生局部逻辑分解捷径(Partial Logic),即在解析多约束交集时丢弃其中一个锚点条件,仅计算松弛区域却依然有概率猜对答案。为在纯净数据集 \(D_{\text{pure}}\) 中根除这种退化,本文提出了广义鲁棒交集判定准则:设锚点 \(i\) 的合法空间区域为 \(V_i\),所有排除锚点 \(k\) 后的松弛交集区域为 \(V_{-k} = \bigcap_{i \neq k} V_i\),真实目标合法区域为 \(V_{\text{target}} = \bigcap_{i=1}^M V_i\)。本文证明了只要相对补集(即混淆区域 \(C_k\))非空且必须部署至少一个具备目标属性的对抗干扰对象,局部逻辑捷径必然产生假阳性预测:

\[C_k = V_{-k} \setminus V_k = \left( \bigcap_{i \neq k} V_i \right) \setminus V_k\]

在此定理保障下,\(D_{\text{pure}}\) 采样逻辑主动计算每个锚点的 \(C_k\) 并在其中注入满足目标属性的对象。模型若试图丢弃任意锚点 \(k\),其检测到的目标候选集必将严格包含至少一个对抗干扰假阳性,导致计数超标或存在性误判,从而在优化损失中受到严厉惩罚,迫使模型学习跨模态实体间的真实多维几何交集。

3. 双轨因果对照合成引擎与配对基准模型:构建行为完全已知的受控解耦被测体

为了客观评测解释算法是否具备诊断捷径的能力,评估基准必须确切掌握底层被解释模型的真实思维链路。GridVQA-X 借助统一的跨模态检测 Transformer 架构(MDETR)和分阶段解释引导训练机制,利用数据生成引擎的分化构造了对照模型对。在 \(D_{\text{spur}}\) 中,算法通过限制负采样,确保网格内匹配目标属性的物体全都在合法交集区域内,使得词袋匹配捷径的预测成功率达到 100%;而在 \(D_{\text{pure}}\) 中,通过主动对抗混淆填充,纯词袋捷径的预测成功率骤降至 36.07%。

基于相同架构训练的基准模型 \(M_{\text{pure}}\) 在两阶段训练(阶段 1 为目标框定位对齐损失 \(L_{\text{ground}}\),阶段 2 为动态类别加权问答损失 \(L_{\text{QA}}\))下成功学到了稳健的几何推理能力;而 \(M_{\text{spur}}\) 则在 \(D_{\text{spur}}\) 环境中彻底坍缩为浅层词袋检测器。交叉验证表明,当将 \(M_{\text{spur}}\) 迁移到包含对抗混淆的 \(D_{\text{pure}}\) 时,其在 Depth-2 和 Depth-3 的复杂查询准确率直线下跌至 8% 和 14%,而在无空间关系的单属性查询上保持 100%。这种被数学严格锁定的行为差异构成了试金石:忠实的解释器必须在 \(M_{\text{pure}}\) 上给出聚焦于锚点与交集区域的归因,并在 \(M_{\text{spur}}\) 上暴露其对空间方向词和几何锚点的彻底漠视。

4. 多模态归因评测协议与加性谬误诊断:跨尺度度量空间精细度与协同单调性

针对输出形式各异的 MxAI 算法,GridVQA-X 建立了适配多模态特征的评测协议体系。对于局部解释算法(如 Dime、MultiSHAP、MultiViz),除了使用基于 Otsu 自适应二值化的交并比(IoU)评估定位精度外,核心采用相关质量精度(Relevance Mass Accuracy, RMA)来量化解释器在真值因果掩码 \(\text{Mask}\) 内的归因质量集中程度:

\[\text{RMA}(I_{\text{map}}, \text{Mask}) = \frac{\sum_{p \in \text{Mask}} |I_{\text{map}}(p)|}{\sum_{p \in V} |I_{\text{map}}(p)|}\]

对于输出单一全局协同交互标量 \(S_{\text{score}}\) 的全局解释算法(如 EMAP、InterSHAP、PID),本文提出了“加性谬误检查”(Additive Fallacy Check)。真实跨模态协同随着推理跳数(Depth 1 到 3)和锚点数量的增加,其协同交互标量必须呈现严格的单调递增;而对于依靠单模态词袋捷径的 \(M_{\text{spur}}\),该标量理论上应保持低位且对深度不敏感。这一检验能够直接诊断全局解释器是真实测算了跨模态互信息,还是误将单模态敏感性投射为协同效应。

实验关键数据

主实验

论文对主流局部解释算法在图像和文本模态上的归因表现进行了系统测试。评估涵盖 Pure 评测(\(M_{\text{pure}}\) on \(D_{\text{pure}}\))、Spurious 评测(\(M_{\text{spur}}\) on \(D_{\text{spur}}\))以及 Cross 评测(\(M_{\text{spur}}\) on \(D_{\text{pure}}\))。下表汇总了局部 MxAI 方法在视觉与文本模态上的 RMA 与 IoU 表现:

评估模态 解释算法 Pure 评测 RMA (%) (↑) Pure 评测 IoU (%) (↑) Spur. 评测 RMA (%) (↑) Spur. 评测 IoU (%) (↑)
视觉图像 Dime \(28.0 \pm 13.9\) \(20.5 \pm 10.2\) \(27.2 \pm 14.5\) \(18.2 \pm 10.0\)
视觉图像 MultiSHAP \(56.0 \pm 22.7\) \(50.0 \pm 22.6\) \(64.5 \pm 21.8\) \(46.2 \pm 23.1\)
视觉图像 MultiViz \(44.0 \pm 16.3\) \(4.7 \pm 3.3\) \(42.2 \pm 20.0\) \(6.7 \pm 4.5\)
文本语言 Dime \(43.0 \pm 26.8\) \(12.3 \pm 12.5\) \(37.5 \pm 25.9\) \(10.3 \pm 11.5\)
文本语言 MultiSHAP \(66.8 \pm 17.3\) \(46.7 \pm 18.9\) \(67.5 \pm 16.1\) \(40.2 \pm 19.9\)

消融实验与复杂性跨度分析

为检验全局可解释性方法随空间推理复杂度扩展时的忠实性,论文针对全局协同估计方法 EMAP 在不同推理深度(Depth 1, 2, 3)下的跨模态协同分数 \(S_{\text{score}}\) 进行了量化追踪。下表展示了 EMAP 在三种评测体制下的协同标量变化趋势,以及配对基准模型与通用开源模型在多跳混合空间推理(Mixed, Form 0, \(\rho=d0.7\))下的预测准确率对比:

评测机制 / 模型配置 Depth 1 指标 Depth 2 指标 Depth 3 指标 说明 / 趋势分析
EMAP Pure Eval 协同分 (%) \(78.6 \pm 16.7\) \(74.7 \pm 23.8\) \(64.1 \pm 28.2\) 违背加性假设,随推理跳数增加逆向衰减
EMAP Spur. Eval 协同分 (%) \(69.2 \pm 23.9\) \(65.7 \pm 24.4\) \(68.8 \pm 18.9\) 捷径模型上产生高协同伪阳性(幻觉协同)
EMAP Cross Eval 协同分 (%) \(59.4 \pm 27.3\) \(54.0 \pm 26.2\) \(65.0 \pm 17.6\) 捷径模型推理崩溃时依然测出近 60% 协同
基准模型 \(M_{\text{pure}}\) 准确率 (%) 100.0 100.0 100.0 稳健掌握多跳空间几何逻辑
基准捷径模型 \(M_{\text{spur}}\) 准确率 (%) 6.0 2.0 0.0 空间捷径失效导致准确率彻底归零
开源模型 Qwen3-VL-30B 准确率 (%) 14.0 10.0 10.0 顶尖开源 VLM 同样受到密集空间干扰严重影响
开源模型 Llava-1.5-7B 准确率 (%) 6.0 28.0 30.0 复杂网格下多跳定位能力薄弱

关键发现

  • 模型盲目性与意外忠实性:现有局部解释器无法分辨模型是在进行空间几何推理还是在依赖词袋捷径。MultiViz 在 \(M_{\text{pure}}\) 和 \(M_{\text{spur}}\) 上产生了统计学上完全一致的 RMA(\(\approx 44\%\) 与 \(42\%\));Dime 则因归因热图过度发散而“碰巧覆盖”了部分真实目标区域,形成虚假的忠实性幻觉。
  • 博弈论边际贡献偏好单独立项检测:MultiSHAP 在捷径模型 \(M_{\text{spur}}\) 上的 RMA 得分(64.5%)显著反超忠实模型 \(M_{\text{pure}}\)(56.0%)。这是由于 Shapley 交互指数在数学上更容易与独立的点对点特征检测器对齐,而面对高度非线性的多锚点几何约束交集时发生归因耗散。
  • 全局协同评估算法陷入“加性谬误”:EMAP 预测的跨模态交互比例在真实需要多步协同的 \(M_{\text{pure}}\) 上,随着锚点深度从 Depth 1 增至 Depth 3,竟然从 78.6% 逆向跌至 64.1%;而在彻底丧失空间理解的 \(M_{\text{spur}}\) 上却幻觉出近 70% 的协同分数。InterSHAP 同样出现相似的倒挂(从 0.921 跌至 0.629),表明当前全局解释方法根本无法度量真实世界中逐步递增的组合复杂度。
  • 存在性任务引发严重的干扰项泄漏:在存在性判断(Form 1)任务中,MultiSHAP 将大量权重赋给了符合目标颜色与形状的对抗混淆物体,完全无法过滤空间非法区域,导致其在单目标存在性任务中的 RMA 发生雪崩式暴跌。

亮点与洞察

  • 闭世界数学可证的零歧义因果真值:利用 Pearl do-演算将非相关干扰项因果效应收敛为零,首次在多模态 XAI 领域确立了无需依靠主观人工标注或代理度量的因果真值边界。
  • 以毒攻毒的“反向捷径”基准测试法:不直接去盲测未知的黑盒模型,而是通过数据生成算法构造在数学上只能通过词袋捷径求解的孪生对照模型,用已知机制反推可解释性算法的误判边界。
  • 直击可解释性算法的评估盲区:有力揭穿了当前主流 MxAI 算法“既不能甄别捷径、又会将发散噪音误判为高相关性、更会在简单模型上脑补复杂协同”的本质漏洞,为未来开发具备真实跨模态关系感知的新型解释器建立了不可绕过的诊断底线。

局限与展望

  • 作者承认的局限:GridVQA-X 目前处于 2D 离散几何抽象世界中,缺乏现实场景的连续语义空间分布与复杂背景纹理;此外,当前评测主要聚焦于空间几何定位与基础属性绑定,尚未涵盖时间序列因果、物理常识推理或高级数学逻辑等多模态协同维度。
  • 自身视角的局限:测试模型主要依托于MDETR这种基于显式框对齐的编码器-解码器架构,对于具备自回归长思维链(CoT)推理的最新端到端视觉语言生成模型(MLLM Rationale Generation),尚缺乏针对文本生成步序内部注意力轨迹的直接映射评估。
  • 改进与迁移思路:可将闭世界对抗混淆注入逻辑迁移至真实自然图像与具身智能模拟器中,通过物理引擎生成具备确定遮挡与拓扑因果图的评测序列;同时拓展测试床以检验 MLLM 在回答前生成的自然语言解释与视觉注意力之间的因果一致性。

相关工作与启发

  • vs CLEVR-XAI: CLEVR-XAI 提供了 3D 渲染场景的问题条件像素真值掩码,但仅限于单模态深度神经网络的视觉特征评估,未能考虑跨模态语义交互,且无法解耦底层黑盒模型的生成机制;GridVQA-X 则同时涵盖多模态交互、数学保证的因果真值以及配对的已知捷径/纯净模型。
  • vs OpenXAI: OpenXAI 是单模态表格与图像可解释性的标杆评测框架,但完全不支持跨越不同语义空间的图文模态融合评估;GridVQA-X 填补了跨模态协同可解释性诊断基准的空白。
  • vs DIME / MultiSHAP / MultiViz: 这些经典或最新的后验解释算法自称能够解耦单模态贡献与多模态交互;GridVQA-X 通过严格的反例实验证明,它们在面对真实空间推理与词袋捷径时大多产生退化甚至完全误判。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次建立具备数学可证因果真值与捷径解耦特性的多模态可解释性诊断基准。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 6 种主流局部与全局 MxAI 算法,兼顾视觉与文本双模态,提供完备的多维分类消融。
  • 写作质量: ⭐⭐⭐⭐⭐ 形式化理论推导严谨,因果 do-演算和定理证明自洽,实验分析层层推进。
  • 价值: ⭐⭐⭐⭐⭐ 为多模态可解释性领域敲响了警钟,提供了推动 MxAI 迈向真实因果忠实性的关键准绳。