Disentangling Hallucinations: Orthogonal Semantic Projection for Robust Interpretability¶
会议: ECCV 2026
论文: CVF / ECCV Poster
代码: https://emirhanbilgic.github.io/Orthogonal-Semantic-Projection
领域: 可解释性 / 多模态VLM
关键词: 视觉语言模型, 可解释性归因, 解释幻觉, 正交匹配追踪, 语义解耦
一句话总结¶
揭示了多模态可解释性归因方法普遍存在“解释幻觉”的根源是高维嵌入空间中的线性语义泄漏,并提出基于正交匹配追踪的即插即用几何干预方法 OSP,通过对文本嵌入做正交语义投影消除伪影信号。
研究背景与动机¶
视觉语言模型(如 CLIP、SigLIP)与多模态扩散模型(如 Stable Diffusion)已被广泛应用于自动驾驶、医疗图像合成和具身机器人等关键领域。为了理解这些黑盒模型并进行可信调试,研究者通常采用 GradCAM、LeGrad、CheferCAM 或 DAAM 等后验可解释性(XAI)方法生成空间归因图(Saliency Maps)。然而,当现有归因方法迁移到多模态架构时,普遍面临严重的“解释幻觉”(Explanation Hallucination):即使输入完全不存在于画面中的错误文本提示(例如图中只有狗,却提示查询“猫”或“羊”),归因图依然会高亮图像中的显著前景区域。这种“为了错误的理由给出看似合理的高亮”现象严重破坏了 XAI 的忠实度,阻碍了模型的可靠诊断。
传统研究通常将模型幻觉归咎于视觉编码器瓶颈或自回归解码缺陷,并在图像特征空间尝试概念分解(如 TextSpan 或 CBMs)。但本文发现,解释幻觉的本质并非空间定位不准,而是多模态嵌入空间几何特性的必然产物——即“线性语义泄漏”(Linear Semantic Leakage)。在对比学习训练的多模态高维空间中,不同语义类别的文本嵌入向量天然共享大量方向分量,成对余弦相似度极难为零(例如 ImageNet 1000 类的 499,500 个类别对之间余弦相似度均值高达 0.5925,最小相似度仍有 0.0967)。由于主流判别式与生成式归因方法在数学上均对文本嵌入呈线性或局部线性依赖,目标查询向量在非目标概念方向上的投影会不可避免地在归因图中激发出正比于原概念的“幽灵信号”(Ghost Signal)。
本文的核心切入点是:既然解释幻觉源于文本嵌入在连续表示空间中的非正交语义重叠,就不应在图像侧打补丁,而应在归因计算前对文本嵌入做先验几何干预。核心 idea:将文本嵌入净化建模为稀疏字典分解问题,利用正交匹配追踪(OMP)的残差严格正交性剔除干扰概念的共享语义,直接用正交投影后的残差向量指导归因,从数学上令归因模型对共享伪影完全免疫。
方法详解¶
整体框架¶
本文提出的正交语义投影(Orthogonal Semantic Projection, OSP)是一个无需重训模型的即插即用几何干预模块,适用于 CLIP、SigLIP 等判别式双塔架构以及 Stable Diffusion 等跨注意力生成式模型。整体流程包含三大核心阶段:首先针对目标查询概念构建包含干扰项的语义字典;接着在文本嵌入空间执行正交匹配追踪,提取与所有干扰原子严格正交的净化语义残差向量;最后将净化后的向量代入下游判别式归因方法(替换原始文本特征)或扩散模型 cross-attention 键向量中,生成忠实且无幻觉的高保真归因图。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["目标文本查询与图像输入"] --> B["语义字典构建<br/>视觉混淆项/共现上下文/语义上下位"]
B --> C["稀疏字典分解与净化<br/>OMP贪心搜索与Gram-Schmidt正交化"]
C --> D["正交残差特征投影<br/>生成与干扰原子严格正交的净化表征"]
D --> E["无幽灵信号的空间归因<br/>代入判别式归因权重或扩散键空间"]
关键设计¶
1. 线性语义泄漏理论推导:揭示归因幻觉的几何根源
现有判别式归因方法(GradCAM、LeGrad、CheferCAM、AttentionCAM)与生成式归因(DAAM)均可统一表示为视觉特征与文本嵌入的相互作用函数:
当图像中仅包含类别 \(A\) 时,若查询不存在的类别 \(B\),由于嵌入向量未正交(\(\langle a_A^{\text{txt}}, a_B^{\text{txt}} \rangle = \cos(\theta_{AB}) \neq 0\)),向量 \(a_B^{\text{txt}}\) 可正交分解为沿 \(a_A^{\text{txt}}\) 方向的投影分量与正交分量 \(a_{B\perp A}^{\text{txt}}\):
利用归因算子 \(f\) 对文本嵌入的线性性展开,得到 \(V_B(x) = \cos(\theta_{AB}) V_A(x) + f(\bar{a}^{\text{img}}, a_{B\perp A}^{\text{txt}})\)。第一项 \(\cos(\theta_{AB}) V_A(x)\) 即为直接诱发解释幻觉的“幽灵信号”(Ghost Signal)。只要相似度不为零,即使图像中完全没有类别 \(B\),模型也会高亮类别 \(A\) 的区域。这从数学上证明了非正交性是多模态归因幻觉的根本诱因。
2. 基于 OMP 的正交语义投影(OSP):数学消除共享语义泄漏
为了消除上述幽灵信号,OSP 将文本特征净化构建为稀疏编码问题。给定目标嵌入 \(a_{\text{target}}^{\text{txt}} \in \mathbb{R}^d\) 与干扰概念构成的语义字典 \(\mathbf{D} = [a_{D_1}^{\text{txt}}, \dots, a_{D_k}^{\text{txt}}] \in \mathbb{R}^{d \times k}\),目标是将其拆解为共享语义与独特语义两部分:\(a_{\text{target}}^{\text{txt}} = \mathbf{D}\boldsymbol{\alpha} + \mathbf{r}\)。OSP 利用正交匹配追踪(OMP)迭代贪心选择与当前残差内积最大的干扰原子并扩充激活集 \(\Lambda\):
在第 \(t\) 步通过最小二乘正交投影更新残差:\(\mathbf{r}^{(t)} = a_{\text{target}}^{\text{txt}} - \mathbf{D}_\Lambda (\mathbf{D}_\Lambda^\top \mathbf{D}_\Lambda)^{-1} \mathbf{D}_\Lambda^\top a_{\text{target}}^{\text{txt}}\)。OMP 具有基础数学定理保证:在停止步 \(T\) 时,最终残差向量 \(\mathbf{r}^{(T)}\) 与激活集中所有已选干扰原子严格正交,即 \(\langle \mathbf{r}^{(T)}, a_{D_i}^{\text{txt}} \rangle = 0, \forall i \in \Lambda\)。将单位化残差 \(\mathbf{r} = \mathbf{r}^{(T)} / \|\mathbf{r}^{(T)}\|_2\) 替换原查询向量,因内积为零,所有干扰概念方向对应的幽灵分量在解析上被彻底清零。
3. 多模态归因架构通用适配:覆盖判别式与扩散生成式模型
OSP 兼具极强的通用性与即插即用特性。对于判别式模型(CLIP、SigLIP),直接将归因公式中的原始文本特征 \(a_c^{\text{txt}}\) 替换为净化后的正交残差向量 \(\mathbf{r}\),计算得到 \(V_c^{\text{OSP}}(x) = f(\bar{a}^{\text{img}}, \mathbf{r})\),无需任何微调或网络反向重构。对于以 Stable Diffusion 为代表的扩散生成模型,归因源于 cross-attention 交叉注意力图(DAAM),OSP 深入到第 \(l\) 层第 \(h\) 个注意力头的键向量空间(Key Space),计算目标标记键向量 \(K_{(l,h)}^{\text{target}}\) 针对归一化干扰键向量 \(\hat{K}_{(l,h)}^{D_i}\) 的正交投影,定义键净化公式:
其中 \(\beta\) 控制抑制强度。由于注意力权重在 softmax 之前与键向量保持线性乘积关系,正交化后与干扰项对齐的注意力权重被彻底抑制,使扩散模型的概念归因严格聚焦于目标实体。
4. 结构化语义字典构建机制:多层级干扰语义建模
正交投影的净化质量取决于语义字典 \(\mathbf{D}\) 的覆盖完备度与精准性。本文探索并对比了四类字典构建策略:ImageNet 原生类别、融合 WordNet 语义关系的类别体系,以及通过大语言模型(Gemini 3 Flash、GPT-OSS 120B)提示生成的专用字典。其中性能最优的 LLM 策略设计了细粒度三层提示结构:包含 15 个视觉混淆项(Visual Confusers,与目标外观结构高度相似的物体)、15 个共现上下文概念(Co-occurring Context,常在同场景出现的背景或关联实体)以及 10 个层级语义概念(Semantic Hierarchy,包含 5 个上位词与 5 个下位词)。同时设置余弦相似度阈值过滤掉过于近似的同义概念,防止正交投影过度削减目标自身的本体语义。
实验关键数据¶
主实验¶
在 ImageNet-Segmentation 4,276 张带精确像素级标注的图像上评测,设置 Positive(目标存在)与 Negative(目标缺失的负样本提示)两组条件。AUROC 用于综合衡量区分真伪提示归因强度的能力(反映幻觉抑制水平),同时配合 mIoU 与 mAP 评估空间定位保真度。
| 方法 | 基础模型 | 提示类型 | mIoU (Base / +OSP / \(\Delta\)) | mAP (Base / +OSP / \(\Delta\)) | AUROC (Base / +OSP / \(\Delta\)) |
|---|---|---|---|---|---|
| LeGrad | CLIP | Pos \(\uparrow\) / Neg \(\downarrow\) | 58.66 / 61.33 (+2.67) | 82.49 / 85.74 (+3.25) | 79.62 / 80.64 (+1.02) |
| LeGrad | SigLIP | Pos \(\uparrow\) / Neg \(\downarrow\) | 49.51 / 51.18 (+1.67) | 78.32 / 78.78 (+0.46) | 74.42 / 74.73 (+0.31) |
| CheferCAM | CLIP | Pos \(\uparrow\) / Neg \(\downarrow\) | 48.71 / 51.32 (+2.61) | 80.36 / 82.60 (+2.24) | 77.63 / 80.14 (+2.51) |
| CheferCAM | SigLIP | Pos \(\uparrow\) / Neg \(\downarrow\) | 37.66 / 39.60 (+1.94) | 73.49 / 75.95 (+2.46) | 55.47 / 62.64 (+7.17) |
| AttentionCAM | CLIP | Pos \(\uparrow\) / Neg \(\downarrow\) | 40.14 / 47.96 (+7.82) | 70.34 / 76.62 (+6.28) | 52.68 / 67.73 (+15.05) |
| AttentionCAM | SigLIP | Pos \(\uparrow\) / Neg \(\downarrow\) | 50.01 / 52.12 (+2.11) | 80.20 / 80.81 (+0.61) | 80.49 / 83.45 (+2.96) |
| GradCAM | CLIP | Pos \(\uparrow\) / Neg \(\downarrow\) | 44.68 / 51.43 (+6.75) | 74.94 / 79.80 (+4.86) | 65.39 / 71.82 (+6.43) |
| GradCAM | SigLIP | Pos \(\uparrow\) / Neg \(\downarrow\) | 38.69 / 43.26 (+4.57) | 71.43 / 73.61 (+2.18) | 67.07 / 73.01 (+5.94) |
| DAAM | Stable Diffusion 2 | Pos \(\uparrow\) / Neg \(\downarrow\) | 65.71 / 66.34 (+0.63) | 88.55 / 89.76 (+1.21) | 83.07 / 85.48 (+2.41) |
消融实验:字典构建策略对比¶
对比 4 种语义字典在 9 个模型-方法组合上的平均性能指标变化(ImageNet-Segmentation):
| 字典构建策略 | 提示类型 | mIoU (Base / +OSP / \(\Delta\)) | mAP (Base / +OSP / \(\Delta\)) | AUROC (Base / +OSP / \(\Delta\)) |
|---|---|---|---|---|
| ImageNet Classes | Pos \(\uparrow\) / Neg \(\downarrow\) | 48.20 / 51.96 (+3.76) | 77.79 / 80.32 (+2.53) | 70.64 / 74.08 (+3.44) |
| ImageNet + WordNet | Pos \(\uparrow\) / Neg \(\downarrow\) | 47.98 / 51.40 (+3.42) | 77.79 / 80.32 (+2.53) | 70.43 / 73.90 (+3.47) |
| Gemini 3 Flash | Pos \(\uparrow\) / Neg \(\downarrow\) | 48.20 / 51.61 (+3.41) | 77.79 / 80.41 (+2.62) | 70.65 / 75.52 (+4.87) |
| GPT-OSS 120B | Pos \(\uparrow\) / Neg \(\downarrow\) | 48.20 / 51.34 (+3.14) | 77.79 / 80.29 (+2.50) | 70.65 / 76.26 (+5.61) |
关键发现¶
- 显著提升幻觉判别能力且不伤定位:OSP 在全部 9 个模型-方法配置下均带来了 AUROC 的全面提升(AttentionCAM on CLIP 提升达 +15.05,CheferCAM on SigLIP 提升 +7.17)。更重要的是,正向提示下的 mIoU 与 mAP 完全没有下降,反而普遍提升了 1.6% 至 7.8%,说明剔除共享语义后真实目标的边界响应更干净、对比度更高。
- 无需强依赖大语言模型:消融实验显示,即便使用无外部大模型的 ImageNet 原生类别字典或 WordNet 结构,AUROC 也能稳健提升 +3.44 至 +3.47,证明了正交几何投影机制本身的泛化能力;而引入结构化 LLM 字典(视觉混淆+上下文+上下位)能进一步将 AUROC 增益扩大至 +4.87 和 +5.61。
- 极端高效:OSP 仅在文本嵌入或键空间进行极小规模的贪心正交投影,单次干预耗时小于 1 秒,几乎无额外计算开销。
亮点与洞察¶
- 从文本几何空间逆向根治归因幻觉:不同于以往在像素或图像特征层面做注意力剪枝的复杂尝试,本文从数学上揭示了归因算子对文本特征的线性依赖与嵌入重叠正是“幽灵信号”的来源,将问题化繁为简为正交投影。
- OMP 正交残差的巧妙重构:传统稀疏编码通常关注逼近信号的稀疏系数,而 OSP 逆向思维,把 OMP 最终的“残差向量”作为核心纯化表示,利用正交性直接消除了所有字典干扰分量。
- 概念瓶颈模型(CBM)细粒度可解释性赋能:该正交投影思想不仅适用于整类判定,还能有效迁移到细粒度鸟类部位拆解等复杂概念解耦任务中,使原本黑盒的概念提取器具备清晰可信的空间依据。
局限与展望¶
- 字典构建对未登录词与复杂长文本的覆盖:当前主要依赖预设类别或结构化 LLM 生成三类干扰词,面对开放世界长文本复合提示词时,如何动态构建完备的干扰语义空间仍待探索。
- 过度投影导致本征语义削弱的风险:若干扰原子与目标语义距离过近(余弦相似度极高),投影后可能会残缺目标自身的核心特征,需精细设计相似度截断超参数。
- 尚未扩展至自回归 MLLM 解码:论文明确指出暂未覆盖端到端自回归多模态大语言模型(如 LLaVA),未来可探索将正交语义干预推广到自回归注意力层或视觉 token 投影层。
相关工作与启发¶
- vs TextSpan (ICLR 2024): TextSpan 尝试将图像表征分解到离散文本词汇空间以解释视觉表征,而 OSP 则从反方向直接在文本嵌入空间进行连续几何正交化,作为 XAI 的前置净化器。
- vs CHILI (TMLR 2025): CHILI 针对概念瓶颈模型解耦图像嵌入以定位概念像素,而 OSP 建立了针对多模态归因图幻觉的理论解析框架,并跨越判别式与扩散生成式两大架构实现即插即用。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次从高维嵌入几何与线性算子角度严格证明归因幻觉的数学成因,并提出用 OMP 残差做正交净化的新范式。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 CLIP/SigLIP/Stable Diffusion 三大底座与 5 种 XAI 算法,辅以 ImageNet/COCO 定量与 200 人用户评测。
- 写作质量: ⭐⭐⭐⭐⭐ 数学证明简洁自洽,图文对照严谨,消融实验逻辑闭环。
- 价值: ⭐⭐⭐⭐⭐ 即插即用且耗时极低(<1s),对多模态模型安全落地与透明化可信诊断具有重大实用价值。