From Drop-off to Recovery: A Mechanistic Analysis of Segmentation in MLLMs¶
会议: ECCV 2026
论文: ECCV 原文
领域: 多模态VLM
关键词: 多模态大模型、语义分割、机制可解释性、线性探针、注意力阻断
一句话总结¶
本文不在 MLLM 上加任何新模块,而是用三组可干预的实验拆解适配器式 MLLM 的分割能力:逐层线性探针发现 adapter 把视觉特征投影进语言空间时出现表示 drop-off,而 LLM 各层又逐步把 mIoU 找回来;注意力阻断证明这种恢复不是残差连接的被动副作用,而是靠跨 token 注意力让分类正确的 token 充当「语义锚点」把误判邻居拉回正确标签;最后指出因果掩码让序列最前面的图像 token 缺乏全局上下文,这一损失可由图像 token 之间的双向注意力消除。
研究背景与动机¶
语义分割是机器人、AR/VR、自动驾驶和医学影像的基础能力。在纯视觉一侧,用对比学习或自监督蒸馏预训练的 ViT 早就是强特征提取器——它们的 patch 级嵌入本身就携带丰富的密集语义,接一个线性探针或轻量解码器就能迁移到分割上;SAM 系列进一步把专用编码器的上限推高。与此同时,多模态大模型(MLLM)在多模态推理、指令跟随和语言条件控制上表现出色,其中 adapter 式架构因为结构简单而格外流行:一个预训练视觉编码器、一个训练出来的 adapter 网络、一个预训练 LLM,前者的视觉嵌入被 adapter 映射进后者的 token 空间。正因如此,近两年出现了一批把 MLLM 改造成分割模型的工作,它们给 MLLM 接上 SAM 或用特殊的 [SEG] token 桥接语言推理与掩码预测,主张语言监督可以提升分割的可解释性,并支持传统分割模型做不到的指代式、指令驱动分割。
问题是,这些工作报告的都是系统级性能——加了 SAM、加了专门 token、微调过之后能打多少分——却没有人回答一个更基础的问题:把 MLLM 当作一个整体、在受控的探测协议下,它真的比它底下那个视觉编码器更会分割吗? 已有的诊断性分析给出的答案并不乐观:MLLM 不做任务特定微调时在经典视觉任务上可能反而退化,甚至会忽略自己视觉主干里已经编码好的视觉证据,在深度估计、对应关系这类视觉中心任务上被自己的编码器甩开,于是「LLM 是瓶颈」成了一个流行判断。但反向的证据同样存在:有工作发现生成式 MLLM 能从同一个冻结编码器里抽出比 CLIP 更多的视觉信息,也有工作发现 MLLM 的中间层比最后一层保留了更丰富的区域级描述。这些分析要么只做表征探测而不做因果干预,要么聚焦在分类、对应等通用感知任务上,没有落到语义分割——而分割恰恰是最需要逐 patch 空间保真度、也最能暴露表示退化的一类任务。
本文的切入角度是:不要笼统地问「MLLM 会不会分割」,而是把这个问题拆成三个可以分别做干预、各自可反驳的子问题。分割能力在这条流水线的哪一步被破坏?破坏了之后那一段回升是残差连接和归一化被动抹平的,还是注意力在主动搬运信息?如果存在结构性的位置缺陷,改动注意力掩码能补回多少、代价是什么?核心 idea:用「逐层线性探针定位现象 → 注意力阻断验证机制 → 图像 token 间的双向注意力消除结构瓶颈」这条干预链,把 MLLM 的分割能力分解为 adapter 处的表示 drop-off、由语义锚点驱动的跨 token 自精炼、以及因果掩码造成的早期 token 上下文饥饿这三件可以分别度量的事。
方法详解¶
整体框架¶
本文的输入是一张图像加一段文本提示,输出不是分割掩码,而是一份关于「分割能力住在 MLLM 栈的哪一层、靠什么机制维持」的机制性结论。整条分析链建立在同一个被解剖的对象上:一个标准的 adapter 式 MLLM,视觉编码器把图像切成 T 个不重叠 patch 并编码成 token 序列,adapter(两层 MLP)把它们投影进 LLM 的 d 维输入空间,图像 token 与 system token、文本 prompt token 一起被 LLM 逐层处理。论文在这条既有的流水线上不动任何结构,只在三个位置各放一把「手术刀」,而且每把刀都用同一把尺子度量——对图像 patch token 的隐状态训练线性探针,把逐 token 预测还原成二维分割图后算 mIoU 和 pixel accuracy,因此三组实验的结论可以逐层对齐、互相印证。
第一把刀是逐层线性探针,回答「在哪一层丢失、在哪一层恢复」;它给出的曲线是整个分析的起点,也抛出了下一个问题:曲线回升是被动平滑还是主动搬运。第二把刀是注意力阻断(attention knockout),专门用来排除「残差连接 + LayerNorm 被动解释」,把恢复归因到跨 token 注意力;它进一步暴露出「恢复依赖正确分类的锚点」这一条件,而这条件对序列早期的图像 token 并不成立。第三把刀是仅在图像 token 之间放开双向注意力,直接测试并解除因果掩码造成的这个位置瓶颈。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["图像 + 文本提示<br/>冻结的 adapter 式 MLLM"] --> B["逐层线性探针<br/>定位 drop-off 与 recovery"]
B --> C["注意力阻断<br/>验证跨 token 注意力是主动机制"]
C --> D["图内双向注意力<br/>解除早期 token 的上下文饥饿"]
D --> E["机制结论 + 架构设计建议"]
关键设计¶
1. 逐层线性探针:给分割信号在整条流水线上做一次 CT
以往关于「MLLM 能不能分割」的讨论都停在最终输出或系统级指标上,没人知道在这条流水线内部,编码器原本携带的空间信息是被保住了、弄丢了还是被增强了。本文的做法是把流水线拆成三个可比的观测点:视觉编码器输出、adapter 输出、以及 LLM 的每一个中间层。对于目标层 \(\omega\),冻结整个 MLLM,只为图像 token 那一部分抽隐状态 \(X^{(\omega)}\),然后在训练集上为每一层单独训练一个线性探针,用交叉熵让每个 token 独立分类,再把逐 token 的预测 reshape 回二维网格、上采样回原分辨率算像素级 mIoU。这里的关键在于「同一套流程、同一个协议」:视觉编码器输出、adapter 输出、每个 LLM 层都用完全相同的探针训练流程,唯一的区别是抽取哪个隐状态、隐状态维度是多少。正因为如此,层与层之间的 mIoU 差异只能归因于表示本身,而不是探针容量或训练条件的变化——这是逐层剖面能成立的前提。图像侧的具体设定是 336×336 输入、patch size 14,对应 \(T = 576\) 个图像 token;因为每个 token 对应固定的空间位置,逐 token 预测才能被还原成二维分割图。
被解剖的模型是三个 LLaVA-1.5 变体,都用 Vicuna-7B 当 LLM,只换视觉编码器:CLIP ViT-L/14@336、DINOv2 Large@336、SigLIP SO400M/14。三者都按标准两阶段流程训练(先在 558K 图文对上预训练 adapter,再在 665K 视觉指令数据上微调全模型),训练条件一致,所以编码器之间的差异不会被训练配方污染。评测用三个标准分割基准:ADE20K(150 类,室内外混合)、PASCAL VOC 2012(20 个前景类,用增强训练集)、Cityscapes(城市街景),主指标 mIoU、辅指标 pixel accuracy。三个编码器在文字对齐程度上的差异是刻意保留的——CLIP 和 SigLIP 用对比目标把视觉特征对齐到文本,DINOv2 是纯视觉编码器——这个变量后面会解释恢复强度的不同。
2. 注意力阻断:把「主动恢复」从「被动旁路」里择出来
逐层探针只能给出曲线,而曲线回升有两种很不一样的解释:一种是被动的,残差连接和 LayerNorm 把信息在层间平滑地传下去,mIoU 自然回暖;另一种是主动的,self-attention 真的在跨 token 搬运和整合信息。要区分这两者必须做干预。本文借用 Geva 等人在自回归语言模型中追踪信息流的 attention knockout 技术,但把它用在了一个不同的问题上:前人用 knockout 找「哪些 token 影响了模型生成的文本」,本文问的是「图像 patch token 之间的跨 token 注意力本身,是否驱动了空间表示的自精炼」。
具体流程是:给定一张测试图,先用探针得到每个图像 patch 的预测标签;选定一个要阻断的目标类 \(c\),取出被预测为 \(c\) 的 token 集合 \(B_c\);然后在每一个 LLM 层里,把所有图像 token 到 \(B_c\) 中任意 token 的注意力在 softmax 之前置为负无穷:
这个操作让类 \(c\) 彻底「隐身」:任何图像 token(包括类 \(c\) 自己的 token)都不能再看到它们。被阻断的 token 自己仍然可以看所有未被阻断的 token,所以它们的表示继续演化,只是失去了同类邻居带来的自强化。之后在每一层重新跑同一套逐层线性探针,就得到干预条件下的逐层分割曲线。实验挑的是未修改模型出现典型类混淆的 ADE20K 图像(例如地面真值是 ceiling 但被误判成 sky 的 patch),对同类图跑两个互补条件——阻断错误类、阻断正确类——再和未修改基线对比。这一设计的好处是两个条件互为对照:如果被错误分类的 token 在通过注意力主动强化错误,那么把它们静音应该让模型更快自修正;如果正确分类的 token 是语义锚点,那么把它们静音应该让模型更修不动。两个方向的预测是相反的,因此结论不容易被「改动本身就有影响」这种解释糊弄过去。
3. 图像 token 间的双向注意力:解除早期位置的上下文饥饿
第三把刀针对的是一个标准因果注意力固有的结构缺陷。图像 token 按光栅顺序(从左到右、从上到下)排在序列里,每个 token 只能注意到序列中位于它之前的 token:第一个图像 token 看不到任何其他图像 token,最后一个却能看到全部 \(T\) 个。对分割来说这很不合理——理想情况下每个 patch 都应该访问场景级上下文,而早期 token 拿不到。逐层探针的定性可视化直接印证了这一点:第一行、尤其是左上角的 token 经常被误分类,而且它们的准确率不随 LLM 层加深而改善,说明这不是一个能靠后面的层慢慢补救的问题,而是位置本身带来的持续性惩罚。
本文的改法是只放开图像 token 之间的注意力,其余 token 对一律保持因果掩码——图像内部双向、其他仍因果:
(原文式 2 的排版在缓存文本中损坏,此处按正文描述重写,⚠️ 以原文为准。)这一选择有意区别于 PaliGemma 的 prefix-LM 策略:后者把图像、system prompt、任务前缀等所有输入 token 一并设为双向,而本文只针对图像 token 之间的空间自精炼,把自回归文本生成所需的顺序结构完整保留下来。训练上仍然沿用 LLaVA-1.5 的两阶段配方(558K 图文对预训练 adapter、665K 指令数据微调全模型),两个阶段都用同一种注意力类型,因此两组模型的对比反映的是整条训练流程累积的注意力方向性效应;除此之外所有超参、训练数据和三个视觉编码器(CLIP、DINOv2、SigLIP)完全一致,对照组里只有掩码这一个变量在变。
一个完整示例¶
取一张 ADE20K 验证集里的室内场景图,地面真值中左上方是一大片 ceiling,而未修改模型把它的一部分 patch 判成了 sky——典型的天花板/天空混淆,也是本文反复用作案例的类对。
第一步,逐层探针。对这张图,在编码器输出、adapter 输出和每个 LLM 层分别抽出 576 个图像 token 的隐状态,用对应层的探针分类并拼回二维图。看到的现象是:adapter 输出的预测边界嘈杂、类间混淆明显,进入 LLM 之后早期几层里受影响区域的混淆开始减少,中后期层趋于稳定,但仍有少量 patch 停在 sky 上。
第二步,对同一张图跑两个阻断条件。阻断错误类(把所有被预测为 sky 的 token 对全体图像 token 的注意力置为 \(-\infty\))后,受影响区域在早期 LLM 层就已经翻回 ceiling,到最后一层残余误分类比未修改模型更少——因为产生错误吸引子的那些 token 被静音后,墙、地板这些正确分类邻居的上下文线索在注意力场里占了上风。反过来阻断正确类(静音 ceiling token)则明显更糟:误判为 sky 的 patch 在中后期层依然存在,那一层的区域分割质量掉到未修改模型之下,残余错误甚至更多。两个方向的差异把「跨 token 注意力在主动纠正错误」这件事钉死了。
第三步,看这张图的 patch 0(左上角)。在因果注意力模型里它没有任何视觉上下文可看,全层预测几乎不随层深变化,且与邻居不一致;换成图像内双向注意力后,它一次前向就能看到全部 576 个图像 token,该位置的 pixel accuracy 提升 14.35 个百分点,相对提升 23.2%。三组结果串起来给出的机制图景是:正确分类的 ceiling token 是语义锚点,而因果掩码恰恰让序列最前端的 token 拿不到这些锚点——恢复机制存在,但被位置结构局部地卡住了。
实验关键数据¶
主实验¶
逐层线性探针是本文的核心结果,主结论来自 ADE20K 上三个编码器的层间曲线(原文 Fig. 3)。原文以曲线形式报告,正文只给出方向性结论与少数具体数值,下表如实标注原文未报告的部分,不代为补数。
| 视觉编码器(LLM 均为 Vicuna-7B) | 编码器输出 → adapter 输出 | LLM 层恢复强度 | 峰值与编码器基线的关系 |
|---|---|---|---|
| CLIP ViT-L/14@336 | 小幅下降 | 最强 | 最终超过视觉编码器基线 |
| SigLIP SO400M/14 | 下降较大 | 有意义 | 原文未报告是否超过基线 |
| DINOv2 Large@336 | 下降较大 | 最弱 | 原文未报告,仅指出恢复明显弱于前两者 |
因果注意力与图像内双向注意力的对比同样是分割侧的核心结果(原文 Fig. 8),部分数值在正文中给出:
| 视觉编码器 | 因果注意力峰值 mIoU | 双向注意力峰值 mIoU | 峰值增益 |
|---|---|---|---|
| CLIP ViT-L/14@336 | 原文未报告 | 原文未报告 | +0.42 |
| DINOv2 Large@336 | 原文未报告 | 原文未报告 | +0.32 |
| SigLIP SO400M/14 | 35.39(第 12 层,之后随层深下降) | 41.26(第 32 层,单调提升) | +5.87(两值相减) |
双向注意力最大的风险是损害语言能力,原文在 9 个 VQA 基准上做了对照(原文 Tab. 1,LLM 均为 Vicuna-7B):
| 视觉编码器 | 注意力 | GQA | MMB | MMEP | MMEC | MMMU | POPE | SQAI | TextVQA | VizWiz |
|---|---|---|---|---|---|---|---|---|---|---|
| CLIP ViT-L/14 | 因果 | 62.6 | 66.4 | 1483 | 284 | 35.3 | 86.8 | 68.7 | 46.9 | 56.0 |
| CLIP ViT-L/14 | 双向 | 62.7 | 65.5 | 1538 | 288 | 36.2 | 86.9 | 69.7 | 47.0 | 57.5 |
| DINOv2 ViT-L/14 | 因果 | 62.1 | 57.7 | 1304 | 324 | 34.6 | 87.2 | 66.1 | 14.0 | 51.4 |
| DINOv2 ViT-L/14 | 双向 | 60.5 | 55.3 | 1247 | 326 | 32.4 | 85.1 | 66.3 | 13.7 | 45.8 |
| SigLIP SO400M/14 | 因果 | 61.1 | 63.7 | 1414 | 275 | 34.7 | 84.4 | 70.4 | 50.2 | 58.2 |
| SigLIP SO400M/14 | 双向 | 62.1 | 66.9 | 1402 | 298 | 34.9 | 84.8 | 70.7 | 53.6 | 53.3 |
注:MMEP / MMEC 为 MMEP-Bench 与 MMEC-Bench 上的分数,原文以表格原样给出,量纲与其余百分比指标不同,不可直接横向比较(⚠️ 以原文为准)。DINOv2 的 TextVQA 在两组设置下都只有 13.7–14.0,与其余编码器差距极大,原文未单独解释。
消融实验¶
本文的「消融」是对注意力通路做干预,输出是逐层分割图的定性对比(原文 Fig. 6),原文未给出对应数值,因此下表只记录方向性结论:
| 条件 | 干预操作 | 层间行为 | 相对未修改基线 |
|---|---|---|---|
| 未修改基线 | 无 | 早期层存在类混淆,中后期层逐步修正 | — |
| 阻断错误类(如 sky) | 所有图像 token → 被预测为 sky 的 token 的注意力置 \(-\infty\) | 受影响区域在早期层混淆即减少 | 自修正加速,最终层残余误分类少于基线 |
| 阻断正确类(如 ceiling) | 所有图像 token → 被预测为 ceiling 的 token 的注意力置 \(-\infty\) | 误分类 token 跨层持续更久 | 中后期层分割质量低于基线,残余错误更多 |
位置维度的分析则给出了具体数值:对前 50 个 patch 逐个统计 pixel accuracy(原文 Fig. 7),因果与双向的差距高度集中在序列最前端——patch 0 在因果注意力下看不到任何视觉上下文,双向注意力把它提升 14.35 个百分点(相对 23.2%),而差距随 patch 序号迅速衰减。
关键发现¶
- 瓶颈在 adapter,不在编码器。 三个编码器一致地在 adapter 处掉点,说明把视觉特征投影进 LLM 嵌入空间这一步以牺牲细粒度空间保真度为代价换取跨模态对齐;掉幅随编码器而变,CLIP 只是小幅下滑,DINOv2 与 SigLIP 掉得更多。
- LLM 层确实能把分割质量找回来,而且恢复方式和编码器是否文本对齐有关。 恢复曲线的形态是早期层陡升、中后期层进入平台;文本对齐的 CLIP 恢复最强,其 LLM 层表示最终超过视觉编码器基线,同为对比目标的 SigLIP 也有实质恢复,纯视觉的 DINOv2 恢复最弱。这指向一个可操作的判断:编码器表示空间与 LLM 嵌入空间的兼容程度,会影响 LLM 层能在多大程度上重精炼视觉特征。
- 几何证据与 mIoU 曲线互相印证。 对单张图的 576 个 patch 隐状态做 UMAP 投影可以看到:adapter 输出处不同语义类的 patch 严重交叠,缺乏类别级组织;随着层数加深同类 patch 逐渐聚拢,到第 20 层 floor、ceiling、wall、building 已经占据明显分离的区域,其中 wall 与 building 因为语义相似而彼此靠近。也就是说 LLM 不只是让特征变得更容易线性分开,而是把它们在表示空间里重新组织成语义一致的簇。
- 恢复是被跨 token 注意力主动完成的,不是被动副产品。 阻断错误类会加速自修正、阻断正确类会损害自修正,两个方向都成立,说明正确分类的 token 充当语义锚点,用注意力信号把误判的邻居拉向正确标签;这也解释了为什么这类分割错误常以成片、成对的形式出现(ceiling↔sky 这种类对),以及为什么在根本没有正确锚点可依的区域,恢复机制会失效。
- 恢复有明确的边界。 LLM 层提供的是结构和约束感知的精炼:它改善局部一致性、解决一部分类冲突,但无法恢复编码器特征里根本不存在的精细空间细节,也无法克服「整片区域都被系统性判错、找不到正确锚点」的编码器偏差。
- 因果掩码的代价是高度局部化的。 patch 0 的提升幅度(+14.35 个百分点)与差距随序号迅速衰减这两件事一起说明:一旦 token 能拿到哪怕少量视觉邻居,部分上下文就足以支撑自精炼;真正被因果掩码卡住的只是序列最前端的少数位置。
- 对 SigLIP 来说,因果掩码的影响不只是局部。 CLIP 与 DINOv2 的双向收益都只有零点几个 mIoU,与位置分析一致;SigLIP 却完全不同:因果注意力下恢复在第 12 层达到 35.39 的峰值后随层深下降,双向注意力则单调提升到第 32 层的 41.26。这说明对某些编码器,因果掩码会阻止深层继续受益,而不只是拖累前几个 patch。
- 放开图像内双向注意力的语言代价可控,但依赖编码器。 CLIP 与 SigLIP 在 9 个 VQA 基准上大体与因果基线持平(个别指标如 MMB、VizWiz 有涨有跌),DINOv2 则出现更广泛的回退(MMB 57.7→55.3、VizWiz 51.4→45.8、MMMU 34.6→32.4),与它在整个实验中表现出的弱文本对齐一致。
- 机制在 LLaVA 之外也成立。 除 LLaVA 外,论文还在 OneVision(SigLIP SO400M + Qwen2-7B)与 DeepSeek-VL(SigLIP-L 与 SAM-B 的混合视觉编码器 + DeepSeek-LLM 7B)上重复了逐层探针与注意力阻断,补充材料显示两者都复现了 drop-off/recovery 剖面与「语义锚点」效应——阻断错误类加速自修正、阻断正确类损害自修正。
亮点与洞察¶
- 把「MLLM 比它自己的编码器强吗」这个模糊问题改写成三个可反驳的因果问题,是本文最值得借鉴的地方:先用探针定位现象,再用阻断排除被动解释,最后用掩码消融定位结构瓶颈。每一步都设了一对方向相反的预测,因此结论不会因为「干预本身有副作用」而失去说服力。
- 语义锚点这个概念把现象和机制接上了。 正确分类的 token 不是被动结果,而是主动把误判邻居拉回来的信息源;这个视角同时解释了分割错误为什么成片出现、以及为什么没有正确锚点的区域无法自我修复,比单纯说「注意力有全局上下文」具体得多。
- 探针口径的统一是逐层分析能成立的前提。 编码器输出、adapter 输出和每个 LLM 层都用同一套线性探针、同样的训练条件,唯一变量是被抽取的隐状态,因此层间差异只能归于表示本身。这个「跨层同口径探针」的做法可以直接迁移到任何「某能力在流水线哪一层出现或消失」的诊断研究。
- 图内双向注意力是一个几乎零成本、且与既有架构选择殊途同归的改动。 STAMP 从系统设计出发让 mask token 之间双向、文本保持因果注意力;本文从内部探针和掩码消融出发得到同一架构结论,只是不做系统实现。两条独立路径指向同一设计,本身就是很强的证据。
- 三步分析法可以迁移到其他视觉中心任务。 对深度估计、对应关系、计数等任务,同样可以先用逐层探针找出瓶颈层,再用阻断判断恢复是否依赖跨 token 注意力,最后判断该改 adapter 还是改注意力掩码——这比直接微调一个更大的模型更有针对性。
- 「恢复有边界」这个负面结论同样有价值。 它把 MLLM 分割改进的方向从「堆更多 LLM 层/更多数据」拨回到「提高编码器特征的空间保真度」,因为 LLM 层补不回编码器里根本没有的细节。
局限与展望¶
- 作者承认的局限之一:实验以 LLaVA 型模型为起点,虽然换了三种视觉编码器、并在补充材料里加了 OneVision 与 DeepSeek-VL,但结论未必能推广到结构差异很大的架构(例如非 adapter 式、或视觉 token 与文本 token 高度交织的架构)。
- 作者承认的局限之二:线性探针可能低估真实分割能力,更强的任务头有可能把 adapter 输出中仍然存在但线性不可分的空间信息解出来。因此「adapter 处 drop-off 的绝对幅度」更应理解为线性可分性的下降,而不等于信息全部丢失——本文对此的表述比较克制,但读者在引用这个结论时需要注意这一层限定。
- 作者承认的局限之三:注意力阻断在所有层上全局生效,无法分离单层对自精炼的贡献。同时由于阻断是「让被阻断类不可见、但被阻断 token 仍可继续演化」,不能排除影响通过未阻断 token 的中介间接传导,因此「正确类 token 是锚点」这一结论在机制细节上还没有被完全隔离。
- 我注意到的局限:全文缺少一个关键对照——「直接用视觉编码器特征 + 同等容量解码器」在同一评测协议下的表现。没有这个外部基线,读者只能知道 MLLM 内部各层的相对变化,无法直接判断 MLLM 整体相对纯视觉方案是赢是输。此外探针的训练细节(迭代数、正则、是否早停)被放在补充材料,这类细节会直接影响跨层比较的公平性。
- 语言代价的结论也有边界:双向注意力只在图像 token 内放开,如果把文本 prompt token 一并纳入双向(即 prefix-LM 式设计),对分割的额外收益与语言能力的损失都还不清楚;SigLIP 的 VizWiz 从 58.2 掉到 53.3 也说明「不损语言」并非对所有指标成立。
- 具体改进方向:把全局阻断细化为按层、按注意力头的 knockout,定位真正承载语义锚点效应的头;用自动挖掘典型类对的方式替代人工挑图,把阻断实验从案例研究扩展为统计性分析;补充编码器特征 + 同容量解码器的外部基线,让「MLLM 是否值得」这个问题有一个干净的回答。
相关工作与启发¶
- vs LISA / GSVA / PixelLM / GLaMM / SAM4MLLM / OMG-LLaVA 等 MLLM 分割方法: 他们提出架构变体并报告系统级分割性能,关心的是「怎么做才能更强」——LISA 用
[SEG]token 把 MLLM 接到 SAM,GSVA 扩展出多个[SEG]/[REJ]token 处理多目标和空目标,PixelLM 走无 SAM 路线用多尺度 segment token 配轻量解码器。本文不训练任何分割模型,只回答「分割能力在这条栈里住在哪、靠什么机制恢复」,是诊断性的而非建设性的工作,与他们是互补关系而非竞争关系。 - vs STAMP: STAMP 从系统设计出发做非自回归的文本掩码预测,让 mask token 之间双向、文本保持因果注意力,是一个经验性的架构选择;本文第 5 节从逐层探针与掩码消融出发,独立地得到同一架构结论。两者互为印证,但本文不提供可用的分割系统。
- vs Fu et al.(VLM 忽略自身视觉表示)/ Zhang et al.(分类)/ Tong et al.(BLINK): 他们指出 MLLM 在视觉中心任务上退化,并把 LLM 视为主要瓶颈;本文聚焦语义分割,补上了他们缺失的因果干预,并给出更细致的图景——LLM 不只是瓶颈,它同时是恢复的来源,而且恢复强度取决于编码器表示空间与 LLM 嵌入空间的对齐程度,纯视觉编码器受益明显更少。
- vs Li et al.(生成式 MLLM 从同一冻结编码器抽出比 CLIP 更多信息)/ Liang et al.(中间层区域描述更丰富): 他们给出了「LLM 层内部信息更丰富」的观察;本文用逐层探针的 mIoU 剖面和 patch 隐状态的 UMAP 投影把这条观察量化成了具体轨迹——adapter 处各类交叠、数十层之内逐步重聚成语义簇——并进一步说明这种重聚是注意力驱动的、且受因果掩码局部限制。
评分¶
- 新颖性: ⭐⭐⭐⭐ 首次把逐层线性探针、注意力阻断与图内双向注意力掩码消融组合成一条干预链,系统回答 MLLM 分割能力的来源与边界,并把「主动恢复 vs 被动旁路」做成了可检验的因果问题;单项技术都是已有工具,新意在于问题拆解与组合。
- 实验充分度: ⭐⭐⭐ 三种编码器 × 三个分割基准 + 两个额外架构(OneVision / DeepSeek-VL,在补充材料)+ 9 个 VQA 基准的语言代价检验,覆盖面不错;但 knockout 与逐层探针的关键结果多以曲线呈现,正文未给逐层 mIoU 数值,且缺少与「编码器 + 同容量解码器」外部基线的对照。
- 写作质量: ⭐⭐⭐⭐ 三组实验层层递进、每步假设明确、结论带边界意识(明确写出「无法恢复编码器里不存在的细节」),叙事清楚;少数公式在版式上略欠打磨。
- 价值: ⭐⭐⭐⭐ 对设计分割 MLLM 有直接指导:主要瓶颈在 adapter 与因果掩码,而不是视觉编码器本身,且图像内双向注意力是一个低成本、基本不损语言的改动(收益集中在早期 token,对 SigLIP 尤其明显)。