跳转至

Unsupervised Semantic Segmentation Facilitates Model Understanding

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/Kainmueller-Lab/ssl-rep-seg
领域: 语义分割
关键词: 自监督学习, 模型可解释性, 位置效应, 局部偏差, 视觉Transformer

一句话总结

针对自监督视觉 Transformer 内部表征机制理解不直观且易混淆对比学习与掩码图像建模特性的痛点,本文提出了一套极简的无监督语义分割可视化与量化探测协议,通过跨图像 k-means 聚类与归一化互信息评估,揭示了掩码图像建模中 Key/Query 的绝对位置效应是引发局部注意力偏差的上游成因,并首次从位置伪影视角阐明了 DINOv3-Large 密集预测逆缩放的根源。

研究背景与动机

自监督学习(Self-Supervised Learning, SSL)推动了视觉 Transformer(ViT)的蓬勃发展,使预训练模型在无人工标注监督下即可捕获丰富的图像级与 Patch 级视觉语义。为了理解这些模型究竟学习到了何种内部机制,学界涌现出大量关于自注意力属性与表征特性的分析工作,发现以对比学习(Contrastive Learning, CL,如 DINO、MoCov3)为代表的架构与以掩码图像建模(Masked Image Modeling, MIM,如 MAE、iBOT)为代表的架构之间存在根本性表征差异。然而,现有的模型理解结论往往局限于特定的注意力热力图可视化或单图内部分析,甚至导致学术界出现广泛的泛化误解——例如误将仅在 DINO 等对比学习模型中成立的特性(如 Key 嵌入天然具备高语义辨识度、深层网络逐渐丧失位置信息)套用到所有自监督模型上。

现有分析工具的核心瓶颈在于缺乏能够在不同图像间建立对应关系的统一直观基准。传统的注意力图或单图聚类仅反映局部相对关系(即局部偏差 Locality Bias,关注当前图像内相邻 Patch 的距离依赖),却无法揭示跨图像稳定复现的绝对空间坐标依赖(即位置效应 Positional Effect)。更为严峻的是,在模型参数缩放(Scaling)过程中,大模型(如 ViT-Large)在密集预测任务上时常弱于基础模型(ViT-Base)的反常逆缩放现象已被广泛观察,现有解释多归咎于 Patch 一致性下降或预训练与下游任务对齐偏差,却从未有研究从跨图像位置偏差的角度探索其深层致因。

本文的切入角度是:借用无监督语义分割最朴素的聚类探测范式,不追求 SOTA 分割性能,而是将其作为纯净、免微调的白盒探针,通过跨图像的语义聚类投影,使隐藏在不同层与不同组件中的位置偏差与语义质量直接以可视化的空间色块与全局统计形态呈现。核心 idea:将无监督语义分割作为免微调表征探针,结合跨图像 k-means 聚类可视化与基于互信息的位置效应量化指标,首次从全局与空间视角解耦模型表征中的语义结构与绝对位置效应,不仅阐明了 MIM 局部偏差的上游机制源于 Key/Query 强位置效应,更揭示了 DINOv3-Large 密集预测逆缩放的核心症结在于边界伪影与虚假位置聚类。

方法详解

整体框架

整体探测协议旨在消除任何下游有监督微调对预训练潜在特征空间的扭曲,纯粹通过非参数化的跨图像在线 k-means 聚类探测 ViT 各组件的内部表征。探针系统可任意指定 ViT 骨干网络的层级 \(l \in [1, L]\) 以及具体的张量组件(包括多头注意力 MHA 模块中的 Key、Query、Value,以及前馈网络 FFN 输出的 Patch Token)。针对多头表示,沿注意力通道维度拼接得到统一的 Patch 级特征,再对测试集运行无监督聚类并投影为像素级语义分割图。

整套协议协同运行“样本级质检可视化”、“全数据集空间概率聚合图”、“基于互信息的位置效应量化”以及“基于匈牙利匹配的 mIoU 语义质量评估”四大支柱。整体数据流与组件交互如下图所示:

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入未标注图像集"] --> B["跨图像聚类探测<br/>提取多层 K/Q/V/Token 特征并执行在线 k-means"]
    B --> C["双平级空间可视化<br/>测试集单图分割配色 + 全数据集概率热力加权聚合"]
    C --> D["互信息与语义量化评估<br/>计算全局 NMI 与类别互信息,评估匈牙利匹配 mIoU"]
    D --> E["模型表征诊断与机制归因<br/>解耦绝对位置效应与局部偏差,定位逆缩放伪影"]

关键设计

1. 跨图像聚类探测:免微调解耦自监督本征表征 传统的表征分析若引入下游线性分类头或微调解码器,会额外引入优化参数与超参数超平面,不可避免地重构并扭曲自监督预训练的本征几何流形。本文采用极简的在线 k-means 聚类探针,直接作用于冻结的 ViT 骨干特征。对输入批次图像提取第 \(l\) 层 Patch 嵌入 \(F_i^{(l)} \in \mathbb{R}^{N \times d}\)\(N = H_p \times W_p\) 为 Patch 数量,\(d\) 为通道维度),在余弦相似度度量下迭代更新由 \(K\) 个聚类质心构成的码本 \(C = \{c_k\}_{k=1}^K\)。为了生成密集分割预测,将 Patch 特征双线性插值上采样至原图分辨率得到 \(\hat{F}_i \in \mathbb{R}^{H \times W \times d}\),对每个像素点 \((h, w)\) 按照余弦相似度最大化指派类别标签: $$ \hat{y}{hw} = \arg\max $$ 由于质心在跨图像批次间持续更新,该过程强迫具有相同语义或相同模式的特征映射到相同的离散索引,完全不依赖任何复杂后处理或自训练蒸馏,使得特征空间中的本征缺陷(如跨图空间聚集)能够毫无保留地在分割图上暴露。} \frac{\hat{\mathbf{f}}_i^{(hw)} \cdot \mathbf{c}_k}{|\hat{\mathbf{f}}_i^{(hw)}| |\mathbf{c}_k|

2. 双平级空间可视化:解耦语义结构与跨图像位置效应 单幅图像的可视化只能观察局部对象的分割轮廓,无法确认某种着色究竟源自物体的类别语义还是固定的空间坐标。为此,协议设计了样本级(Sets of Exemplary Images)与数据集级(Aggregate View)两层互为佐证的可视化通道。在样本级,利用全局匈牙利算法将无监督聚类簇与真实标签做最优一对一匹配,并用标准语义调色板着色,直观展现不同图像中同一空间区域是否被机械地赋予相同颜色;在数据集级,构建全局空间类别概率张量 \(W \in \mathbb{R}^{K \times H \times W}\),逐像素归一化后以类别标准颜色 \(v_k\) 进行加权融合生成全局聚合图 \(A \in \mathbb{R}^{H \times W \times 3}\): $$ A_{i,j} = \sum_{k=1}^K \frac{W_{k,i,j}}{\sum_{k'} W_{k',i,j}} \cdot v_k $$ 若模型捕获的是真实语义,聚合图将呈现柔和、弥散的平滑过渡;反之,若模型存在绝对位置效应,聚合图在特定区域(如四角、上下边缘)会出现高饱和度的尖锐分块,直观印证位置偏置在整个数据集上的系统性泛化。

3. 基于互信息的位置效应量化与因果关联:从信息论刻画位置偏置与下游性能退化 为了摆脱主观肉眼判断,协议引入离散空间位置变量 \(P\) 与预测类别变量 \(C\) 的互信息,构建可跨模型、跨层级严格横向对比的定量标尺。首先计算类别条件下的互信息 \(I_c(P; c) = \sum_p \mathbb{P}(p,c) \log \frac{\mathbb{P}(p,c)}{\mathbb{P}(p)\mathbb{P}(c)}\),进而定义全类别归一化互信息(Normalized Mutual Information, NMI): $$ I'(P, C) = \frac{\sum_c I_c(P; c)}{H(C)} = \frac{I(P, C)}{-\sum_c \mathbb{P}(c) \log \mathbb{P}(c)} $$ 该指标以真值标签的内在空间分布(自然图像中天空偏上、地面偏下所带来的统计偏置)为基准线。通过将 NMI 与注意力图互信息 \(\hat{I}(Q, K)\)(表征对角线局部注意力的指标)以及下游 mIoU 进行统计相关性分析,直接确立了两个关键结论:Key/Query 的高 NMI 与注意力局部偏差显著正相关(\(\rho = 0.70\)),证明位置效应是局部偏差的上游成因;而 NMI 与分割 mIoU 呈极显著负相关(\(\rho = -0.59\)),证实强绝对位置偏置是破坏语义密集表征的直接有害因素。

损失函数 / 训练策略

作为表征评估与探测基准,本协议自身不包含任何可学习的网络权重或梯度反向传播。聚类过程采用免梯度的在线 Mini-batch k-means,聚类质心通过主成分分析(PCA)进行稳定初始化,码本更新在测试集上以无监督方式运行直至质心收敛。提取各 SSL 模型特定层时,统一在冻结权重下运行推理,其中最后一层 Token 均提取自最终 LayerNorm 之后的输出,以消除不同实现细节带来的尺度漂移。

实验关键数据

主实验

在 COCO-Stuff 27 类基准数据集上,本文对 8 种主流自监督模型及 2 种基线模型(监督 ViT 与 CLIP)进行了全层级、全组件(Key、Query、Value、Token)的无监督语义分割探测。主实验对比重点聚焦于不同预训练范式在最优层所能达到的语义分割性能(mIoU)以及展现出的全局位置效应强度(NMI)。

预训练范式 代表模型 (ViT-B) 最佳特征组件 最优层 mIoU (%) 全局位置效应 NMI 表征核心行为特征
对比学习 (CL) DINO Token / Key 31.8 / 26.2 0.082 位置效应局限在浅层 (L2-3),深层语义纯粹,无明显边界伪影
对比学习 (CL) MoCov3 Token 24.5 0.089 深层局部偏差与位置效应显著衰退,高层语义抽象
多粒度自监督 Mugs Token 28.1 0.095 语义分割均衡,Token 显著优于 Key/Query
掩码建模 (MIM) MAE Token / Key 18.2 / 6.4 0.176 Key/Query 表现出极强绝对位置聚类,图像角落被锁死为单一簇
掩码+对比混合 iBOT Token / Key 32.4 / 14.7 0.134 Token 语义精细度高,但 Key/Query 仍受中等强度位置偏置主导
混合蒸馏 (SSL) DINOv2 Token 36.8 0.142 语义边界锐利但存在明显块状伪影(Block Artifacts)
寄存器增强 DINOv2+reg Token 35.9 0.108 寄存器机制有效压制了伪影与位置偏置,但局部高频噪点增多
旋转位置编码 DINOv3 Token / Key 37.1 / 9.8 0.165 Key 跨全层展现顽固位置偏置;最后一层 Token 突发强位置效应
弱监督对齐 CLIP Token 25.4 0.112 深层细粒度空间几何信息逐步丢失,伴随轻度块状伪影
监督学习基准 Supervised ViT Token 27.6 0.105 浅层保留边缘轮廓,最深层语义高度类感知但丧失细粒度定位
真实标签基准 Ground Truth (GT) - 100.0 0.071 自然图像天生分布偏置(天空在上、地面在下)的理论参考底线

消融实验

消融与缩放对比实验分析了模型规模(ViT-Base 对比 ViT-Large)以及层级演进对内部表征模式与下游密集预测能力的影响。

评估配置 模型规模 最优组件 / 评估层 语义分割 mIoU (%) 位置偏置 NMI 关键表征现象与伪影表现
DINOv3 缩放对比 ViT-Base Token (Peak Layer) 37.1 0.165 下方边缘轻微位置聚集,主要目标语义边界完整
DINOv3 缩放对比 ViT-Large Token (Peak Layer) 32.5 0.228 反常逆缩放:图像顶部与底部大面积异化为天花板/地板虚假簇
DINOv2 缩放对比 ViT-Base Token (Peak Layer) 36.8 0.142 块状位置伪影局部显现,物体轮廓较清晰
DINOv2 缩放对比 ViT-Large Token (Peak Layer) 33.1 0.210 位置效应随规模显著增强,跨图固定空间分区加剧
DINOv2+reg 缩放对比 ViT-Base Token (Peak Layer) 35.9 0.108 空间位置效应基本消除,无大面积虚假跨图分块
DINOv2+reg 缩放对比 ViT-Large Token (Peak Layer) 34.2 0.115 位置偏置保持低位,但 Patch 间一致性骤降,细碎噪点激增
iBOT 细粒度缩放 ViT-Base Token (Peak Layer) 32.4 0.134 动物与人体部位聚类粗糙,下部中心轻微呈现虚假载具簇
iBOT 细粒度缩放 ViT-Large Token (Peak Layer) 34.6 0.141 正向缩放:跨物种肢体(头/腿/臂)语义聚类显著更加细致一致
DINO 层级演变 ViT-Base Key (Layer 2-3) 12.1 0.155 早期阶段存在短暂位置效应,随后逐层净化
DINO 层级演变 ViT-Base Key (Layer 11-12) 26.2 0.084 高层完全转化为纯语义驱动表示,NMI 逼近真实图像底线
MAE 层级演变 ViT-Base Key (Layer 5-12) 6.4 0.245 中间层位置效应急剧爆发并锁定,完全不具备跨图语义判别力

关键发现

  • Token 表征的普适优越性:除 MAE-Large 极特殊情况外,在全部 8 个自监督模型中,Token 嵌入在无监督语义分割上全面且大幅领先于 Key、Query 和 Value 嵌入。这修正了早期文献过度基于 DINO 单一模型得出的“Key 嵌入更适合密集对应”的片面推论。
  • MIM 模型 Key/Query 位置效应与局部偏差的因果链:Key 与 Query 上的归一化互信息与注意力图的局部互信息呈现高度正相关(\(\rho = 0.70, p < 0.001\))。由于注意力权重由 Query 与 Key 的点积直接归一化生成,两者的绝对位置吸附效应直接构成了下游注意力对角线局部偏差的根本成因。
  • 位置效应与语义性能的显著负相关:跨全部模型、层级与组件的统计表明,位置效应 NMI 与语义分割 mIoU 呈显著负相关(\(\rho = -0.59, p < 0.001\))。模型预测偏离真值分布的任何位置效应增量均直接转化为分割误差。
  • DINOv3-Large 密集预测逆缩放之谜:DINOv3 引入 RoPE(旋转位置编码)理论上应鼓励相对局部偏差而非绝对位置效应,但在 ViT-Large 规模下,其 Token 顶层与底层区域严重异化为固定的虚假类别(如天花板、地面),边缘出现严重的色块伪影,表明大模型自蒸馏或训练动态中未能有效约束空间解耦。

亮点与洞察

  • 将无监督语义分割重塑为模型理解探针:跳出了传统工作将无监督分割单纯视为刷榜下游任务的思维定势,巧妙地将非参数化聚类转化为无需反向传播、无超参数干扰的透明表征探测器,使跨图像的全局机制一目了然。
  • 厘清局部偏差与绝对位置效应的本质区别:通过跨图像统计与信息论度量,首次在概念和视觉上将单图内的局部注意力(Locality Bias)与跨图复现的绝对空间坐标吸附(Positional Effect)严格区分开来。
  • 发现 DINOv3 中 RoPE 预期的理论反转:从机理上揭示了即使采用相对位置编码(RoPE),在大规模自监督蒸馏中模型仍可能涌现出顽固的绝对位置伪影,为下一代基础视觉模型的预训练设计提供了极其珍贵且直观的诊断靶点。

局限与展望

  • 作者指出的局限性:当前探测协议依赖匈牙利匹配将聚类簇与真值语义类别映射,虽然揭示了严重的位置偏差,但若模型自发学习到比真实标注更为精细的分层概念结构(如超细粒度部件拆分),可能会因真值标签颗粒度不符而在 mIoU 指标上被低估。
  • 对位置效应成因的消歧仍待深入:尽管协议证明了位置效应与逆缩放之间的强相关性,但在复杂自监督框架(如集成多任务损失与自蒸馏体系)中,位置偏差究竟产生于预训练目标不匹配、掩码填充偏置还是知识蒸馏过程,仍需更细粒度的控制变量实验。
  • 未来改进方向:可进一步将该无监督聚类协议拓展至视频时序维度与 3D 点云表征分析,探索时间与空间维度上的联合位置偏差,并设计轻量级自适应位置去偏正则项指导模型预训练。

相关工作与启发

  • vs DINO 原始表征分析 (Caron et al., 2021 & Amir et al., 2021):早期工作仅在 DINO 上观察到自注意力自动定位前景物体,并声称 Key 特征在单图密集匹配上最优;本文拓展至 8 类自监督模型全景横评,证明该结论高度特异于对比学习,在 MIM 框架下 Key 特征不仅不具备通用语义,反而充斥着严重的绝对位置偏差。
  • vs 视觉 Transformer 寄存器机制 (Darcet et al., 2023 - Vision Transformers Need Registers):Darcet 等人指出 ViT 存在特征尖峰伪影并提出 Register Tokens;本文通过全局聚合图验证了 Register 确实大幅净化了绝对位置偏差,但也敏锐捕捉到随着模型尺寸增大,寄存器模型会出现严重的 Patch 局部高频噪点与不一致性。
  • vs DINOv3 预训练架构 (Siméoni et al., 2025):DINOv3 原作观察到了模型变大时密集预测的性能下滑并归咎于 Patch 一致性缺失;本文提供了全新的互补视角,直接通过可视化抓包了 DINOv3-Large 上下边界与四周区域发生系统性空间错误聚类的视觉证据。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 独辟蹊径地将无监督语义分割转变为跨模型机制理解的直观白盒探针,概念厘清清晰有力。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 8 大 SSL 架构及 2 大基线,贯穿 Key/Query/Value/Token 全组件与全层级,兼顾宏观统计与微观机制。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑结构严谨,图文高度呼应,信息论指标与可视化质检结合得恰到好处。
  • 价值: ⭐⭐⭐⭐⭐ 彻底澄清了自监督领域多项长期存在的普遍误解,为后续大模型预训练中位置编码设计与逆缩放排查提供了极具实操价值的诊断基准。