跳转至

Multiple Images Distract Large Multimodal Models via Attention Fragmentation

会议: ECCV 2026
论文: ECCV 原文
领域: 可解释性
关键词: 多模态大模型, 多图理解, 注意力碎片化, 注意力池, 注意力重掩码

一句话总结

论文揭示了多图多模态大模型中因背景注意力池与因果掩码共同导致的“注意力碎片化”与近因偏差现象,并提出免训练的注意力重掩码机制(Attention Remasking, AR),通过屏蔽背景注意力池并利用首层文本-视觉接地先验动态打通跨图关键链路,显著提升多图推理精度并降低图像顺序敏感性。

研究背景与动机

多图视觉理解要求大语言-视觉模型(LMM)能够在多幅图像之间进行跨图对比、时序推理、实体检索与跨图线索聚合。然而,当前开源多模态大模型在此类任务上面临显著的性能瓶颈。在 MMIU 等多图基准评测中,专有商业模型(如 Gemini-3-Pro 达到 68.1%)与开源模型(如主流开源模型普遍徘徊在 56% 以下)之间存在巨大的精度断层,开源系统在需要跨多张图紧密结合视觉证据时表现极不稳定。

通过深入剖析主流自回归交错多图架构的内部注意力分布,论文发现了阻碍多图推理的核心机理障碍——注意力碎片化(Attention Fragmentation)。一方面,Transformer 结构由于 Softmax 归一化的固有特性,倾向于将多余的注意力数值存放在语义匮乏的背景 Patch 上,形成注意力池(Attention Sinks);在多图输入中,这些注意力池在每张图像相似的几何与背景位置规律性地反复出现。另一方面,自回归解码序列施加的因果掩码(Causal Masking)造成了跨图访问的不对称性:排在前面的图像面临更多下游 Query 的单向可见性,导致其背景注意力池积累了不成比例的巨额注意力份额。结合香农熵测量与 Pinsker 不等式推导,论文从数学上证明,这种高熵分散的图像级注意力与早期图像强注意力池的叠加,严格压缩了早期图像能够用于承载真正语义证据的非池注意力份额,从而在机制层面解释了长期困扰多图模型的近因偏差(Recency Bias)与图像次序敏感性。

面对这一结构性缺陷,现有的后 Softmax 比例重分配方法(如 VAR)无法打破因果掩码的单向壁垒,且会等比例继承原有的碎片化偏差;而全局双向注意力插值(如 SoFA)则因无差别引入未见图噪声而无法收敛焦点。本文切入角度在于:利用多模态模型浅层具备高保真文本-视觉自然对齐(Grounding)且尚未被深层注意力池破坏的特性,将首层指令注意力作为纯净的空间先验引导跨图链路解封。核心 idea:提出注意力重掩码(Attention Remasking, AR)策略,在深层预 Softmax 阶段列级阻断背景注意力池,并以首层指令-视觉接地先验动态稀疏解开后续图像任务相关标记的因果掩码,将释出的注意力预算定向注入跨图关键证据,无训练地消除注意力碎片化并拉平图像顺序偏差。

方法详解

整体框架

Attention Remasking(AR)是一种无需额外训练与参数微调的即插即用型推理期注意力编辑方法。其主要目标包含两项:一是从源头阻断深层各图像背景中不具备语义价值的注意力池吸收多余权重;二是以无污染的浅层语义线索为向导,跨越自回归因果掩码的单向阻隔,将回收的注意力份额精准定向重路由到后续图像中与文本指令高度相关的关键视觉区域。

该方法在深层(\(\ell > 1\))仅干预视觉标记到视觉标记之间的注意力打分矩阵子块,完全保留文本生成所需的自回归因果因果性。整个运行流程自上而下包含注意力池识别与阻断、首层接地先验提取与稀疏候选集构建、以及注意力权重定向重路由三个核心处理阶段。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["多图与文本输入序列"] --> B["视觉注意力池阻断<br/>列级屏蔽背景Sink标记"]
    B --> C["浅层接地引导的跨图稀疏解掩码<br/>首层文本视觉注意力提取先验"]
    C --> D["释出注意力质量定向重路由<br/>将Sink捕获权重注入前向相关标记"]
    D --> E["解耦注意力输出与多图推理预测"]

关键设计

1. 视觉注意力池阻断:列级屏蔽背景Sink标记

多图输入时,每张图像内部的大量背景标记因 Softmax 归一化限制而被迫承载过量权重,形成跨图像空间坐标高度重合的注意力吸收池。为了在机制上消除这种无语义汇聚,模型首先基于校准集上隐藏层特定维度的巨量激活(Massive Activations)统计量,度量每个标记状态 \(x\) 的池化倾向得分 \(\phi(x)\)

\[\phi(x) = \max_{d \in \mathcal{D}_{\mathrm{sink}}} \frac{x[d] - \mu_d}{\sigma_d}\]

当隐藏状态满足 \(\phi(x_j^{\ell-1}) \ge \tau\) 时,标记 \(j\) 在第 \(\ell\) 层被判定为视觉池标记,记入池标记集合 \(\mathcal{S}^\ell = \bigcup_{m=1}^M \mathcal{S}_m^\ell\)。对于所有层深 \(\ell > 1\),AR 直接在计算 Softmax 之前的注意力打分矩阵 \(Z^\ell\) 上执行列级掩蔽,将所有针对池标记键的打分设为极小值:\(\tilde{Z}_{i, j}^\ell = -\infty \quad (\forall i, \forall j \in \mathcal{S}^\ell)\)。这一操作阻断了所有 Query 对背景注意力池的无益灌注,强制将其释放为可用注意力预算,且实验证明单纯移除此类标记输入对模型基线预测几乎零翻转,证实其无直接语义贡献。

2. 浅层接地引导的跨图稀疏解掩码:首层文本视觉注意力提取先验

因果掩码 \(\mathcal{M}_{\mathrm{causal}}\) 限制了早期图像标记无法作为 Query 关注后续图像内容,导致跨图实体比对与全局证据协同在浅深层均受到机械隔断。为安全打开前向跨图链接而不引入冗余背景噪声,AR 利用了模型第一层(\(\ell=1\))在深层语义漂移与注意力池退化发生之前所展现的自然对齐特性。模型通过计算首层文本指令标记集合 \(T\) 对全部非池有效视觉标记 \(\mathcal{V}_{\mathrm{valid}} = \mathcal{V} \setminus \mathcal{S}^1\) 的全局关联度 \(P_{\mathrm{global}}(j) = \frac{1}{|T|} \sum_{t \in T} \alpha_{t, j}^1\),并以有效视觉池均值 \(\mu_{\mathrm{valid}}\) 为动态阈值实施均值注意力稀疏化:

\[\mathcal{U} = \left\{ j \in \mathcal{V}_{\mathrm{valid}} \mid P_{\mathrm{global}}(j) > \mu_{\mathrm{valid}} \right\}\]

对于处于第 \(m\) 张图像的任意视觉 Query \(i\),AR 仅对其解开其在输入序列后续图像(即所属图像序号大于 \(m\))中落在 \(\mathcal{U}\) 内的关键视觉标记集合 \(\mathcal{U}_i\)。随后在 \(\mathcal{U}_i\) 上将全局相关性归一化为先验路由概率分布 \(\pi_{i, j} = \frac{P_{\mathrm{global}}(j)}{\sum_{k \in \mathcal{U}_i} P_{\mathrm{global}}(k)}\)。这种设计确保了解开因果掩码的链接既稀疏又聚焦于指令关心的目标实体,避免全双向连接引入无序噪声。

3. 释出注意力质量定向重路由:将Sink捕获权重注入前向相关标记

在屏蔽掉注意力池后,若仅依赖常规 Softmax 重新归一化,原本陷入注意力池的权重将按原有比例机械稀释回剩余标记中,使早前图像的高熵与偏斜特征被全盘继承。AR 设计了闭式前向映射规则,将 Query \(i\) 原本被注意力池截留的注意量 \(\eta_i^\ell = \sum_{j \in \mathcal{S}^\ell} \alpha_{i, j}^\ell\) 精确转移给上述跨图相关集合 \(\mathcal{U}_i\)。其目标行注意力分布定义为:

\[\hat{\alpha}_{i, j}^\ell = \left(1 - \eta_i^\ell\right) \frac{\alpha_{i, j}^\ell}{\sum_{k \notin \mathcal{S}^\ell \cup \mathcal{U}_i} \alpha_{i, k}^\ell} \mathbf{1}\left[j \notin \mathcal{S}^\ell \cup \mathcal{U}_i\right] + \eta_i^\ell \, \pi_{i, j} \, \mathbf{1}\left[j \in \mathcal{U}_i\right]\]

在工程实现中,这一重加权分布无需显式物化稠密概率矩阵,而是通过设置打分偏移 \(\tilde{Z}_{i, j}^\ell = \log \hat{\alpha}_{i, j}^\ell + c_i^\ell\) 直接在 pre-softmax 阶段生效。对于 \(\ell > 1\) 的深层计算,AR 结合 PyTorch 的 scaled_dot_product_attention(SDPA)机制将稀疏掩码无缝分派至内存高效注意力后端,在保证零参数训练的同时实现了可与未编辑模型匹敌的高吞吐推理。

实验关键数据

主实验

论文在五大主流多图理解综合基准(MMIU、MuirBench、MIRB、LIBench 与 MIBench)上全面评测了 AR,对比基线包括标准未编辑模型、因果-双向注意力均匀插值方案 SoFA 以及后 Softmax 比例重分配方案 VAR。涵盖 LLaVA-OneVision-7B、Qwen3-VL-8B、InternVL3.5-8B 和 DeepSeek-VL2-Small 等代表性开源架构。

模型与配置 MMIU (Acc %) MuirBench (Acc %) MIRB (Acc %) LIBench (Acc %) MIBench (Acc %)
商业闭源 API
Gemini-3-Pro 68.1 65.7 72.5 70.3 69.9
GPT-5 65.3 65.9 69.6 70.2 70.0
LLaVA-OneVision-7B 36.9 35.0 47.9 53.5 53.8
+ VAR 38.0 35.5 48.7 54.2 55.0
+ SoFA 38.3 36.7 48.3 54.5 54.1
+ AR(本文) 41.2 39.6 51.9 57.7 58.6
Qwen3-VL-8B 55.6 51.3 65.6 61.2 63.5
+ VAR 55.9 51.4 66.0 61.7 63.5
+ SoFA 56.7 52.3 66.2 61.6 64.8
+ AR(本文) 59.4 54.9 69.2 65.5 67.6
InternVL3.5-8B 49.3 39.7 53.6 57.6 51.5
+ VAR 50.6 40.9 54.6 59.1 52.4
+ SoFA 50.5 41.3 54.9 59.3 52.7
+ AR(本文) 54.1 43.8 57.9 61.9 55.6
DeepSeek-VL2-Small 51.4 40.5 45.8 58.3 53.7
+ VAR 52.1 41.1 46.6 59.4 54.6
+ SoFA 52.3 41.1 46.5 60.1 55.0
+ AR(本文) 56.1 44.7 50.7 62.5 58.2

消融实验

1. 接地先验来源层消融(Layer Selection for Grounding Prior) 验证利用首层作为任务相关先验的假设。对比将提取路由掩码的层位置设为第 1 层(本文)、中间层 \(L/2\) 与最后一层 \(L\)

模型 先验来源层 MMIU (Acc %) MuirBench (Acc %) MIRB (Acc %) LIBench (Acc %) MIBench (Acc %)
Qwen3-VL-8B –(基线未编辑) 55.6 51.3 65.6 61.2 63.5
+ AR \(L\) 层(最后一层) 53.2 49.8 63.1 59.5 61.0
+ AR \(L/2\) 层(中间层) 54.8 50.9 64.8 60.6 62.4
+ AR(本文) 第 1 层(首层) 59.4 54.9 69.2 65.5 67.6
InternVL3.5-8B –(基线未编辑) 49.3 39.7 53.6 57.6 51.5
+ AR \(L\) 层(最后一层) 46.5 37.4 51.0 55.2 48.9
+ AR \(L/2\) 层(中间层) 48.7 39.1 52.8 56.9 50.8
+ AR(本文) 第 1 层(首层) 54.1 43.8 57.9 61.9 55.6

2. 计算效率与开销对比(NVIDIA A100 80GB, InternVL3.5-8B)

方法配置 平均延迟 / P90 (ms) 离线吞吐量 (samples/s) 显存峰值 (GB)
InternVL3.5-8B(原始) 280 / 330 3.6 15.2
+ SoFA 284 / 334 (+1.4%) 3.5 (-2.8%) 15.2 (+0.0%)
+ VAR 287 / 338 (+2.5%) 3.5 (-2.8%) 15.3 (+0.7%)
+ AR(本文) 288 / 339 (+2.9%) 3.5 (-2.8%) 15.3 (+0.7%)

关键发现

  • 首层纯净先验是解开掩码的唯一正确锚点:消融表明将接地先验换至中间层或最末层会急剧失效,末层引导甚至使 MMIU 准确率从 55.6% 骤降至 53.2%(负优化)。这证明深层注意力已被背景池严重污染,强行利用深层注意力解封跨图链路只会将噪声当成重点,倒逼模型关注错误特征。
  • 注意力池屏蔽与解掩码相辅相成:单独采用 Mask-only(仅屏蔽注意力池并原地重归一化)或 Unmask-only(仅放开前向跨图链接但不屏蔽注意力池),模型在 MMIU 上的增益均极其微弱,只有二者联动的 AR 才能彻底打碎高熵注意力碎片化。
  • 与定界符缩放(DTS)强正交:定界符缩放通过微调分隔标记隐状态强化图像边界、遏制噪声泄露,而 AR 专注于多图 Patch 间注意力的精准重定向;二者叠加在 MMIU 和 MuirBench 上带来了进一步的复合增益。
  • 有效消除近因偏差:在输入图像置换测试中,未编辑模型与 VAR 随着目标图像位置后移,准确率斜率明显上扬(后方图像严重主导决策);AR 不仅大幅平抑了因位置变换带来的精度波动,还将答案翻转率压缩至严格低于基线的置信区间。

亮点与洞察

  • 首次从机理上将多图近因偏差形式化为“注意力碎片化”:通过香农熵分析与 Pinsker 不等式严格证明,因果掩码的单向暴露使得先出现的图像背景积累更多注意力池,在总注意力近似均匀分散(高熵)的约束下,前半段图像可用于承载语义内容的非池净注意力预算被数学定理所挤压。
  • “以毒攻毒”的轻量无参设计:无需任何额外微调与下游任务数据,仅靠第一层前向传播产生的无污染注意力分布作为自监督先验,即可实现高效精准的重路由,端到端延迟开销仅增加不到 3%。
  • 解释了现代架构中文本门控机制(Gated Attention)未能根除多图视觉池的原因:Qwen3 等基础 LLM 虽已引入门控注意力消除文本池,但多图多模态模型中 Vision Transformer 的背景 Register 现象、全图背景的信息稀疏性以及缺少直接像素级梯度回传的弱监督机制,依然会导致视觉注意力池顽固残留。

局限与展望

  • 首层先验的泛化假设:AR 依赖“首层文本-视觉注意力具备准确自然接地能力”的观察。如果文本指令极其隐晦、需要深层次多步逻辑推断后才能确定与何种视觉实体关联,首层可能无法准确圈定有效候选集 \(\mathcal{U}\)
  • 图像数量规模极限:当前基准多涵盖 2 到 10 张以内的图像。对于超长视频或数十张极长图像输入,首层文本-视觉注意力的均值稀疏阈值可能因背景基数激增而出现统计漂移,需进一步探索分块或层次化解掩码机制。

相关工作与启发

  • vs VAR (Visual Attention Redistribution):VAR 仅在经过因果掩码后的 post-softmax 阶段按原非池标记权重比例做重分配,无法构建跨图前向连接,因而保留并放大了原有因果偏斜与分散;AR 直接在 pre-softmax 阶段编辑矩阵,不仅阻断注意力池,还主动打破因果掩码建立任务导向的跨图前向通道。
  • vs SoFA (Soft Attention):SoFA 使用连续标量权重在标准因果掩码与无掩码双向注意力之间进行全局线性插值,这种无差别的解封方式会向早期 Query 灌注大量未对齐的后续图像背景噪音,无法降低高熵碎片化;AR 则依赖首层接地先验进行稀疏选择性解掩码,只开放高相关特征链路。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 深入机理揭示了多图注意力碎片化及近因偏差的数学根源,提出免微调的首层自导向注意力重掩码机制。
  • 实验充分度: ⭐⭐⭐⭐⭐ 覆盖 5 项多图评测基准、4 款核心开源基座及 3 款扩展大规模底座,提供了完整的理论界证明、置换检验与消融分析。
  • 写作质量: ⭐⭐⭐⭐⭐ 概念界定严谨清晰,图表逻辑层次分明,数学推导与实验论证契合紧密。
  • 价值: ⭐⭐⭐⭐⭐ 即插即用、开箱即用,为低成本提升开源模型多图复杂推理能力提供了极具落地可行性的系统方案。