跳转至

The Alignment Illusion in Multimodal Large Language Models

会议: NeurIPS2026
arXiv: 2609.30210
领域: 多模态 VLM
关键词: 表示相似性、权重诱导对齐、主角度间隙、视觉干预、任务相关性

一句话总结

本文在 13 个多模态大语言模型中用等范数噪声与无关图像检验内部视觉—文本对齐,发现共享 MLP 权重足以制造高相似度,并提出主角度间隙区分单方向塌缩与多方向结构,但明确指出几何结构不能单独证明模型使用了与问题相关的视觉内容。

研究背景与动机

分析多模态大语言模型(MLLM)时,常见做法是逐层比较视觉 token 与文本 token 的隐状态:如果 CKA、SVCCA 或子空间相似度随深度升高,就认为视觉信息逐渐融入语言表示。这些工具原本用于比较不同网络的表示;而 projector-LLM 架构把视觉和文本 token 拼成同一序列,让它们经过同一套注意力与 MLP 权重。两路表示变得相似,既可能来自有意义的跨模态交互,也可能只是同一组权重对任意输入施加了相似的几何偏置。

正常图文问答无法很好地区分这两种解释,因为图像通常既有自然结构,又与问题相关。本文首先在 projector 输出处把视觉 token 换成等范数高斯噪声:如果相似度确实代表内容利用,删除内容应该同时损害准确率和对齐。实际却是准确率明显下降,多个标量指标依然很高。接着用有结构但不相关的图像拆开“保留视觉结构”和“保留任务所需内容”,进一步检查即使更细的几何指标恢复了结构敏感性,是否仍会被误读为理解证据。

这不是一种提升问答准确率的新训练算法,而是对内部对齐指标的解释有效性进行审计。核心 idea:用受控视觉干预、共享权重机制分析和主角度谱联合判断相似度来自哪里,再把几何诊断与任务表现分开报告,而不是把高对齐直接当作内容级交互的证明。

方法详解

整体框架

研究对象是视觉编码器、projector 与语言模型串接的已发布 MLLM。视觉编码器产生图像特征,projector 将其映射到语言模型的嵌入空间,再与问题文本一同经过 Transformer;作者逐层取出两类 token 的表示,比较它们的几何关系和最终选择题准确率。

分析流程依次是“视觉流干预”“共享权重归因”“主角度间隙”“任务证据校准”:先制造内容缺失与内容错配,再定位高相似度的来源,最后检查谱诊断能识别什么、不能识别什么。下图表示实验分析流程,而不是新增网络;全部主实验使用已有权重做推理,线性探针单独使用类别标签训练,不向 MLLM 提供训练监督。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["图像与问题<br/>已发布 MLLM"] --> B["视觉流干预"]
    B --> C["共享权重归因"]
    C --> D["主角度间隙"]
    D --> E["任务证据校准"]
    E --> F["几何结构与准确率<br/>分开解释"]
    G["类别标签<br/>仅训练独立探针"] -.-> E

关键设计

1. 视觉流干预:把视觉内容、结构和尺度分开控制

Orig 使用当前问题所配图像的原始 projector 输出。Noise 则独立采样各向同性高斯向量,并逐 token 缩放到对应 Orig token 的范数;因此删掉的是视觉内容与方向结构,而不是简单把输入振幅变小。干预位于 projector 之后,保留视觉 token 接口,避免把视觉编码器失败与语言模型内部几何混为一谈。Irr 用另一道问题的图像重新计算 projector 输出,并在所有模型之间使用同一份固定错配;它保留自然图像结构,但不服务当前问题。Irr 的范数是实测近似匹配,不是像 Noise 那样强制逐 token 重标定。

两个辅助条件用于约束解释:Shuf 只打乱 Orig 的视觉 token 顺序,保留 token 内容;Text 完全移除视觉 token,提供语言先验基线。固定的 1,000 道 MMBench 问题贯穿所有模型与条件,因而比较的是相同问题上的干预效果,而非数据集变化。这个设计的重要性在于,Noise 与 Irr 不是同一种“坏图像”:前者没有自然视觉结构,后者有结构但缺少任务相关性。

作者还在线性插值中逐渐恢复原始 token,观察准确率与指标是否共同变化:

\[ V_{\alpha}=\alpha V_{\textsc{Orig}}+(1-\alpha)Z,\qquad \alpha\in[0,1]. \]

这里 \(Z\) 是上述等范数噪声。论文默认给出间隔 0.1 的 11 点网格,但附录 Table 11 明确有一部分模型只测了间隔 0.2 的 6 点;不能把所有模型写成完整 11 点实验。端点噪声做了范数匹配,也不意味着中间的线性混合向量始终保持原范数。

2. 共享权重归因:定位高相似度来自共同输出方向

归因不是从“模型共享权重”直接跳到结论,而是逐步排除替代解释。首先,把固定的 projector 视觉输出与逐层文本表示比较,最高主角度余弦仅为中等水平、接近随机参考;接近 1 的视觉—文本相似度,需要两路表示都经过语言模型。随后在相同目标层分别绕过 MLP 或注意力,记录下游最大相似度变化并对目标层求平均:MLP 的影响在全部 13 个模型中更大。这定位的是相似度放大的主要环节,不代表注意力对视觉问答不重要。

作者进一步检查 MLP 下投影 \(W_{\mathrm{out}}\) 的奇异值和左奇异方向。训练后的矩阵具有强于匹配随机矩阵的方向各向异性;视觉和文本都经过这个矩阵,就可能共同聚集到相同输出轴。实证上,Orig 与 Noise 的 MLP 输出子空间仍有很高的首主角度余弦,而视觉侧主角度基也明显偏向下投影的主输出子空间。随机初始化对照降低了 Noise 下的相似度,说明现象不仅由接口形状决定,还与训练后权重结构有关。

命题 1 给出的是有条件的几何界:若两个输出的首方向分别与同一个 \(U_1\) 相距不超过 \(\theta_X\) 和 \(\theta_Y\),则输出子空间的首主角度余弦满足

\[ \sigma_1(WX,WY)\geq\cos(\theta_X+\theta_Y). \]

界中不需要 \(X\) 与 \(Y\) 发生内容耦合,因此共同方向足以造成很高的子空间相似度。然而,“两路输出靠近同一方向”是前提,不是所有共享 MLP 都必然满足的定理;当角度和超过 \(\pi/2\) 时,右侧非正,界也不再提供有用的高相似度保证。它解释了为何高首余弦可能是权重诱导对齐,而不证明所有对齐都没有内容贡献。

3. 主角度间隙:看第二方向是否跟上第一方向

对每层视觉与文本 token 矩阵分别做 PCA,默认各保留 \(k=30\) 个方向,形成正交基 \(U_V,U_H\)。计算 \(U_V^{\top}U_H\) 的奇异值,得到从大到小排列的主角度余弦 \(\sigma_1,\sigma_2,\ldots\);它们衡量两个子空间在不同方向上的重合程度,不是普通 token 对之间的逐项余弦。传统首余弦只问“是否存在一对很接近的方向”,所以一个共同权重方向就能把它抬高。

Noise 下首方向仍然很强,但次级方向明显减弱;Orig 则保留较强的次级重合。作者据此定义主角度间隙(principal-angle gap,PA gap):

\[ \Delta_{\mathrm{PA}}^{(l)}=\sigma_1^{(l)}-\sigma_2^{(l)},\qquad \Delta_{\mathrm{PA}}=\frac{1}{L}\sum_{l=1}^{L}\Delta_{\mathrm{PA}}^{(l)}. \]

大间隙表示第一方向明显独占,符合单方向权重诱导塌缩;小间隙表示至少第二方向也接近第一方向,在本文控制条件下对应更丰富的结构。这个差值并没有识别物体、关系或答案,也没有测量所有方向的有效维数;尤其两个首余弦都低时,间隙小不能无条件读成“强而有用的对齐”。解释它时应同时看谱形状与任务对照。

定义中的全层均值与实验中的层裁剪要区分。排序表及附录相关性分析通常只用内部 80% 的层,剔除首尾各 10% 附近的层,减少输入几何和输出头影响。分级噪声实验中 PA gap 与准确率的预期关系为负:视觉内容逐渐恢复时,准确率上升,单方向独占减弱。

4. 任务证据校准:验证传播结构不等于验证答题相关性

Irr 让这种区别变得可检验:如果模型完全忽略无关图像,表现应接近 Text;如果自然视觉结构被处理但没有被正确筛选,Irr 可以保留多方向几何,却降低问答准确率。作者用 projector token 的均值特征训练独立 20 类逻辑回归探针,采用 5 折分层交叉验证;探针能识别附加无关图像自身的类别,却几乎不能识别当前问题需要的图像类别。这支持“投影器仍然编码了无关输入”,不是证明它已经理解问题。

在语言模型内部,作者用 Orig 构造每层主角度基,再对视觉 token 残差流施加带内或带外噪声。带内噪声来自该基张成的子空间,带外噪声来自其正交补;两者均归一化后按当地 token 范数乘同一相对幅度 \(\varepsilon\),文本 token 不受直接扰动。这样比较准确率下降,可以在控制扰动强度后判断共享子空间是否更敏感,而不是仅靠相似度猜测内容传播。

在 \(\varepsilon=1.0\) 时,带内扰动造成的准确率下降在全部 13 个模型中更大;在 \(\varepsilon=0.3\) 时方向仍一致,但差值都小于 1 个百分点。这类干预支持该子空间具有行为影响,仍不足以把 PA gap 变成逐题内容使用证据:改变重要方向会影响答案,不代表原图中的相关事实已被正确选择、推理和使用。

一个完整示例

以附录 Qwen2.5-VL-7B 为例,Orig 的问答准确率为 85.4%,内部 80% 层的平均 PA gap 为 0.166。把 projector token 换成等范数 Noise 后,准确率为 42.0%,间隙增至 0.294;但首主角度余弦只从 0.709 变为 0.690,单看这个指标很容易低估视觉内容丢失。

换成 Irr 后,间隙为 0.262,小于 Noise 的 0.294,说明几何上没有那么单方向化;准确率却进一步降到 36.1%,低于 Noise 与 Text 的 42.0%。同一模型就能出现“更有结构,但对当前问题更有害”的组合。这些值来自附录 Tables 8、18,不是从图中估读,也不是跨模型中位数。

损失函数 / 训练策略

本文不引入 MLLM 训练损失、不微调被评测模型,也不报告通过优化 PA gap 获得性能提升。主实验使用发布权重,随机初始化仅作为机制对照;唯一额外训练的是独立线性探针,采用带 \(\ell_2\) 正则的多类逻辑回归、\(C=1.0\) 和平衡类别权重。

实验关键数据

主实验

评测覆盖 LLaVA-OV、LLaVA-OV-1.5、Qwen2-VL、Qwen2.5-VL、InternVL3 五个家族,共 13 个模型,规模为 0.5B–72B。每个条件使用相同 1,000 道 MMBench 选择题;下面不是新模型与 SOTA 的竞赛,而是同一组模型在受控干预下的行为比较。

下表对应原文 Table 2,单位为百分点,方括号为跨模型四分位距;每列先求单模型配对差,再求组内中位数,不能用两组准确率中位数相减替代。

模型组 Noise−Orig Shuf−Orig Irr−Text Noise−Text Irr−Noise
全部,13 个 −45.2 [−46.6, −43.2] −0.8 [−1.9, −0.1] −5.0 [−5.9, −2.9] −2.1 [−3.7, +0.0] −2.5 [−4.6, −1.0]
<3B,3 个 −42.4 [−42.8, −40.1] −0.4 [−0.5, +0.0] −2.9 [−3.1, −1.9] −5.3 [−6.4, −4.0] +1.9 [+1.8, +3.3]
≥3B,10 个 −46.5 [−47.5, −44.1] −1.4 [−2.5, −0.3] −5.4 [−5.9, −4.7] −0.4 [−3.0, +0.9] −3.2 [−5.6, −2.4]

分级视觉退化的相关性汇总如下,对应 Table 1。表中保留作者报告值;附录 Table 12 的具体说明是先在每层跨 \(\alpha\) 求 Pearson \(r\),再把 \(\lvert r\rvert\) 在内部 80% 层平均,最后跨模型汇总。它不应被描述成直接对层均指标求一次相关性,也不是 13 个模型合并后的单一相关系数。

指标 平均 \(\lvert r\rvert\) 中位 \(\lvert r\rvert\) 最小 \(\lvert r\rvert\) \(\lvert r\rvert>0.80\) 的模型数 预期符号一致的模型数
首主角度余弦 \(\sigma_1\) 0.730 0.765 0.441 5/13 4/13
PR 0.775 0.767 0.527 6/13 9/13
谱熵 0.825 0.847 0.622 9/13 12/13
CKA 0.752 0.765 0.443 6/13 4/13
SVCCA 0.736 0.788 0.508 6/13 3/13
MIR 0.760 0.777 0.569 4/13 11/13
PA gap 0.894 0.917 0.655 12/13 13/13

PR 为主角度余弦之和的平方除以余弦平方和,谱熵则先把余弦归一化成和为 1 的权重再计算 Shannon 熵。二者衡量整个保留谱的分散程度,作为 PA gap 的谱基线;高绝对相关性仍须配合符号解释,因为同一指标可能在不同模型中反向变化。

消融实验

下表对应原文 Table 3,记录跨模型的层均指标中位数。箭头是作者采用的优选方向;“排在前”要求差距至少达到对应模型指标范围的 5%,完整排序指按优选方向得到 Orig、Irr、Noise 的顺序,而不是按准确率排序。

指标 Orig Irr Noise Orig 排在 Noise 前 Orig 排在 Irr 前 完整排序
\(\sigma_1\uparrow\) 0.705 0.664 0.830 3/13 11/13 2/13
CKA↑ 0.100 0.098 0.202 4/13 4/13 4/13
SVCCA↑ 0.496 0.474 0.579 3/13 13/13 2/13
MIR↓ 9.29 9.50 9.10 5/13 5/13 5/13
PA gap↓ 0.130 0.213 0.324 13/13 13/13 12/13

机制对照进一步支持这个解释:MLP 绕过效应的跨模型中位数为 0.036,注意力为 0.010,原文报告倍率为 3.5;这些展示值已四舍五入,不能自行用它们重算并替换倍率。Orig 与 Noise 的 MLP 输出子空间首主角度余弦中位数为 0.996;主角度基在下投影前 10 个左奇异方向上的投影能量为随机基线的 2.770–13.574 倍,中位数 9.972。

带内减带外准确率下降在 \(\varepsilon=1.0\) 下为 1.12–5.48 个百分点,中位数 2.38。无关图像自身类别探针准确率为 74.4%–78.5%,中位数 76.4%;问题所需类别为 5.5%–7.2%,中位数 6.4%,20 类随机水平为 5%。这些结果分别检验语言模型中的敏感方向与 projector 中仍存在的图像信息,不是同一个准确率指标。

关键发现

  • 原文报告 Orig、Irr、Noise 的跨模型准确率中位数分别为 85.4%、36.1%、39.0%,而 PA gap 中位数分别为 0.130、0.213、0.324。无关图像几何上比噪声更有结构,却不是更有用。
  • PA gap 在全部 13 个模型中把 Orig 排在 Noise、Irr 前,但完整三条件排序只有 12/13;不能写成所有模型都遵循同一个严格顺序。
  • 小模型组的 Irr−Noise 中位数为 +1.9 个百分点,大模型组为 −3.2 个百分点。无关图像是否比噪声更有害具有规模差异,不是逐模型普遍规律。
  • Shuf−Orig 中位数较小,但部分模型下降更明显;作者没有保存 Shuf 逐样本预测,所以其列不提供 bootstrap 区间或 McNemar 配对检验,不能据此宣称完全无影响。

亮点与洞察

  • 把诊断对象说清楚:指标究竟描述表示结构还是任务相关信息,是这篇论文最重要的区分。PA gap 的价值不在于替代任务评测,而在于避免首方向独占造成的误判。
  • 反事实比相关曲线更有解释力:等范数噪声检验内容缺失,无关图像检验结构与相关性分离,文本基线检验视觉是否带来净帮助。这套组合可用于审计其他多模态表示指标。
  • 机制与行为互相约束:绕过、权重谱、子空间扰动与探针各回答不同问题。把它们组合起来,比从一个高分数直接推断“模型理解图像”更可靠。

局限与展望

  • 范围限于 projector-LLM 架构、MMBench 固定选择题子集和相应视觉干预;开放式生成、视频、文档及智能体任务没有被直接验证。
  • PA gap 只看前两个主角度余弦,不保证识别所有多维结构,也不保证结构与答案相关。后续可以在任务条件下分析更完整的谱,并加入针对具体视觉事实的因果验证。
  • PCA 维数敏感性实验只覆盖两个模型,随机初始化只覆盖四个模型;不能把这些辅助结果扩成全部家族的全面稳健性证明。
  • 原文有统计口径与陈述不一致:Table 1 文字倾向于层均相关性表述,附录 Table 12 明确使用逐层相关后聚合;本文按后者说明计算流程,保留原报告数值。
  • 下投影谱附录同时写“12 个模型可用”与“全部 13 个值”,主文则写 13 个;覆盖数存在内部冲突。主文给约 1.2–1.6 的首二奇异值比,附录给 1.166–1.635,不能自行用其中一句消除覆盖数问题。
  • 主文称 Irr 在全部模型中低于 Text,但附录 Tables 6、8 的 OV-1.5-8B 为 Irr 38.9%、Text 38.7%,即 +0.2 个百分点。本文只据配对汇总报告总体负效应,不延续“每个模型都更低”的断言。
  • 不同附录实验的 Noise 端点准确率不完全相同,例如 Qwen2.5-VL-7B 的 Table 8 为 42.0%、Table 11 为 41.2%、Table 15 为 42.1%;原文未充分解释差异,本文不把不同运行强行合并为一条数值记录。

相关工作与启发

  • 对比 CKA、SVCCA 与经典主角度分析:这些工具提供表示比较方法,本文审计共享权重情境下的内容解释。问题不是这些数学量没有意义,而是从几何相似度到视觉内容使用之间缺少必要证据。
  • 对比 MIR 与多模态表示对齐研究:此前工作使用内部指标研究模态融合或共享任务表示,本文加入内容删除与错配对照,显示高指标可能混合权重诱导成分。今后训练诊断应把对齐曲线与受控行为差异并列。
  • 对比 rogue dimensions 与相似度可靠性研究:单模态分析已揭示少数主方向可能遮蔽表示质量,本文把这一问题落到两种模态共享下投影的场景,并用第二主角度补充首方向信息。
  • 对比视觉依赖评测与因果追踪:语言先验和无关图像干扰研究主要判断行为是否依赖视觉,因果追踪研究内容如何影响输出;本文连接这些问题与内部几何,但不声称几何指标已取代因果内容验证。

评分

  • 新颖性: 4/5 — 以反事实干预审计常见对齐解释,并将单方向机制与谱诊断联系起来。
  • 实验充分度: 4/5 — 13 个模型与多种互补控制较全面,但任务范围和辅助对照覆盖仍有限。
  • 写作质量: 3/5 — 结构与诊断边界清楚,若干覆盖数、聚合口径和逐模型陈述存在冲突。
  • 价值: 5/5 — 为多模态可解释性提供可复用的证据分层,防止把内部相似度误当成视觉理解证明。