跳转至

SPICE: Simple Polysemantic feature Interpretation via Clustering-based Explanations

会议: ECCV 2026
论文: ECCV 2026
领域: 可解释性
关键词: 多义性神经元 / 概念解耦 / 归因聚类 / 机械可解释性 / 视觉Transformer

一句话总结

针对深度视觉模型中单个神经元激活多个异构概念的多义性(polysemanticity)瓶颈,SPICE 提出了一种免设预设聚类数 \(K\) 且不依赖特定网络结构的归因足迹自适应聚类框架,首次实现了 CNN 与视觉 Transformer 在神经元概念解耦与宏观表征机制上的统一分析。

研究背景与动机

机械可解释性旨在解构神经网络内部的知识存储和特征加工逻辑。在计算机视觉领域,早期的神经元级可解释性方法通常假定单义性(monosemanticity),即默认每个通道或隐层神经元对应单一独立的视觉概念,并直接通过寻找最大激活样本集来赋予其语义标签。然而,随着对网络表征叠加机制(superposition)研究的深入,学术界逐渐认识到多义性(polysemanticity)才是深度模型普遍存在的固有属性:单个神经元往往同时被多种完全无关的视觉输入所激活。直接将这类神经元视为单一概念不仅严重损害了解释的保真度,也掩盖了网络内部真实的计算机制。

为剥离神经元混合的多种概念,现有研究主要探索了稀疏自编码器(SAE)或基于前驱归因足迹的聚类方法。然而,现有的归因聚类方案存在两个致命瓶颈:其一是结构泛化性不足,大部分现有工作严重依赖特定 CNN 的局部传播规则(如 CRP 语法规则),难以无缝拓展至以全局注意力为核心的现代视觉 Transformer;其二是可扩展性缺失,先验方法普遍依赖人工预设固定的概念簇数量 \(K\)(例如人工指定 \(K=2\)),面对大规模模型中成千上万个神经元各异的语义混杂度,人工搜索或固定 \(K\) 均不可行。此外,随着网络层数加深,特征各向异性导致归因向量趋于同质化,极大地阻碍了簇的有效分离。

本文的切入点在于回归网络的前驱计算流:一个多义性神经元激活不同的概念时,其背后依赖的前驱神经元激活组合与梯度归因必然展现出不同的模式。只要消除深度各向异性引起的尺度偏差,并自适应刻画神经元特异性的内聚力阈值,就能实现自动化的概念分离。核心 idea:通过前驱层 Input×Gradient 归因足迹刻画神经元激发路径,利用各向异性归一化与基于核密度估计的自适应内聚力阈值,实现免设簇数 \(K\)、跨 CNN 与 Transformer 架构通用的神经元多义性渐进解耦。

方法详解

整体框架

SPICE 的目标是在给定任意预训练视觉骨干网络与目标神经元的前提下,自动将其高激活样本集分解为若干具有高语义内聚力的概念子集。对于目标神经元,方法首先提取前驱层到该神经元的归因足迹并进行通道维度归一化;随后,利用自适应内聚力阈值估计器动态计算该神经元的相似度临界值;最后,通过渐进式贪心迭代聚类算法将满足内聚力条件的概念簇依次检出并剥离,剩余样本自适应收敛为细粒度概念。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["目标神经元高激活样本集<br/>CNN通道 / ViT隐层维度"] --> B["归因足迹表征与归一化<br/>前驱层Input×Gradient + 消除各向异性"]
    B --> C["自适应内聚力阈值估计<br/>95分位数与双峰KDE极大值选择"]
    C --> D["渐进式迭代聚类解耦<br/>动态增减k与贪心内聚判定"]
    D --> E["解耦概念子集输出<br/>多义概念分组与VLM自动标注"]

关键设计

1. 归因足迹表征与各向异性归一化:刻画前驱计算路径并消除深层特征坍缩

传统单神经元分析仅看输入样本,无法捕捉内部激发路径。SPICE 将第 \(l\) 层目标神经元 \(u^l\) 的概念溯源至第 \(l-1\) 层的前驱神经元集合。在 CNN 中每个特征图通道被视为一个神经元,在 Transformer 中每个隐层特征维度被视为一个神经元。由于位置维度上存在多个激活值,首先对空间位置或 patch 序列求和,得到标量目标值 \(\bar{a}_u(x) = \sum_{h,w} a_u(x)_{h,w}\)。针对高激活输入样本 \(x_i \in \mathcal{D}_{u^l}\),以前驱层各神经元的聚合激活向量 \(\bar{\mathbf{a}}^{l-1}(x_i)\) 和关于目标标量激活的梯度乘积计算 Input×Gradient 归因向量: $\(\boldsymbol{\phi}(x_i) = \bar{\mathbf{a}}^{l-1}(x_i) \odot \frac{\partial \bar{a}_{u^l}(x_i)}{\partial \bar{\mathbf{a}}^{l-1}(x_i)}\)$ 将样本的归因向量按行堆叠构成归因足迹矩阵 \(\mathcal{A}_{u^l}\)。针对网络深层特征各向异性(anisotropy)导致所有样本归因向量夹角异常缩小、相似度过高的退化问题,SPICE 在聚类前沿神经元维度执行归一化,强制聚类关注相对语义贡献模式而非全局绝对幅值,确保了深层解耦的稳健性。

2. 自适应内聚力阈值估计:兼顾浅层单峰长尾与深层双峰概念分化

为摆脱人工手动为每个神经元调参设定固定簇数 \(K\) 的局限,SPICE 引入内聚力指标 \(\text{Cohesion}(C)\),即簇内所有足迹样本对的平均余弦相似度。若采用全局静态阈值 \(\tau\),由于不同网络深度和不同神经元的表征紧密度差异极大,会导致大部分神经元无法检出任何有效簇或过度碎片化。经验统计发现,早期浅层神经元的足迹余弦相似度分布呈单峰长尾形态,而深层神经元随着高阶概念形成明显分化为双峰分布。因此,SPICE 将自适应阈值 \(\tau\) 定义为两类候选值的较大者: $\(\tau = \max \bigl( Q_{0.95}(S),\, p_2(S) \bigr)\)$ 其中 \(S\) 为当前未分配足迹样本两两间的余弦相似度集合,\(Q_{0.95}(S)\) 为其 95% 分位数,\(p_2(S)\) 为高斯核密度估计(Gaussian KDE)概率密度函数大于 0.1 的第二局部极大值点。当分布呈单峰时回退至分位数基准,确保在全网络深度下都能自适应锚定真正紧密的概念凝聚边界。

3. 渐进式迭代聚类解耦:无预设超参的数据驱动动态分离

在确定阈值 \(\tau\) 后,SPICE 采用渐进式贪心聚类策略来自动决定概念簇数量与成员归属。算法从聚类候选数 \(k=2\) 开始对当前未解耦的工作足迹集 \(\mathcal{A}'\) 执行划分。在每轮划分中,计算每个簇的平均内部相似度 \(\text{Cohesion}(C)\),一旦检出一个或多个满足 \(\text{Cohesion}(C) > \tau\) 的高内聚簇,即将其判定为已被成功解耦的稳定概念并固化,同时从工作集 \(\mathcal{A}'\) 中剔除这些样本;随后根据新检出的簇数量动态回退搜索步长 \(k \leftarrow \max(2, k - (|C_{\text{cohesive}}| - 1))\)。若当前 \(k\) 划分下无任何簇能达到内聚标准,则递增候选数 \(k \leftarrow k + 1\) 继续探查,直至剩余样本规模小于 \(k\)。剩余无法成簇的离群样本则退化为单样本概念。该流程既保证了解耦结果的高度纯净,又彻底避免了主观超参干预。

损失函数 / 训练策略

SPICE 属于完全免训练的事后可解释性(post-hoc interpretability)分析框架,不需要对被测视觉模型引入任何微调参数或辅助损失函数。在足迹计算时默认采用 Input×Gradient(计算速度快且与更复杂的 Integrated Gradients、GradientSHAP 性能相当)。对解耦出的概念簇,可选调用多模态大模型(如 GPT-4V)基于簇内代表样本生成语义文本描述。

实验关键数据

主实验

评估在 ImageNet 验证集上展开,覆盖 ResNet-50、ViT-B/16、DenseNet 和 CLIP ViT-B 四种主流骨干。概念可分离度(Separability)采用 CLIP 图像嵌入空间内的簇内相似度与簇间相似度的比值进行量化(数值越高表明解耦出的概念语义区隔越明确)。

模型 / 评估层级 PURE* (CVPR'24) LE (ICML'24) CPE (CVPR'25) SPICE (本文)
ResNet-50 L2.1 1.018 ± 0.031 1.112 ± 0.122 0.996 ± 0.014 1.092 ± 0.056
ResNet-50 L3.3 0.999 ± 0.012 1.108 ± 0.153 0.995 ± 0.007 1.160 ± 0.081
ResNet-50 L4.2 1.009 ± 0.071 1.187 ± 0.221 0.998 ± 0.011 1.291 ± 0.224
ViT-B B2 1.002 ± 0.010 1.199 ± 0.181 0.994 ± 0.009 1.137 ± 0.062
ViT-B B6 1.012 ± 0.013 1.185 ± 0.153 0.994 ± 0.009 1.240 ± 0.089
ViT-B B11 1.035 ± 0.025 1.357 ± 0.181 0.998 ± 0.018 1.577 ± 0.089
DenseNet L2.1 1.012 ± 0.028 1.090 ± 0.158 0.994 ± 0.007 1.071 ± 0.059
DenseNet L3.12 1.053 ± 0.054 1.062 ± 0.139 0.994 ± 0.005 1.114 ± 0.060
DenseNet L4.16 1.025 ± 0.035 1.191 ± 0.116 0.994 ± 0.009 1.033 ± 0.032
CLIP ViT-B B2 1.007 ± 0.018 1.088 ± 0.082 0.994 ± 0.008 1.090 ± 0.051
CLIP ViT-B B6 1.008 ± 0.016 1.165 ± 0.148 0.997 ± 0.009 1.212 ± 0.090
CLIP ViT-B B11 1.021 ± 0.040 1.244 ± 0.192 0.998 ± 0.013 1.410 ± 0.102

此外,针对不同激活区段(Top、Mid、Bottom 各 100 个样本)的鲁棒性测试表明,在传统基于文本先验方法(如 LE)严重退化的深层低激活区间(ViT-B B10 Bottom 区间 LE 骤降至 1.04),SPICE 仍保持高达 1.41 的可分离度。

消融实验

消融实验对比了阈值自适应策略对可分离度(Separability)与神经元覆盖率(Coverage,100个随机抽样神经元中至少检出一个满足内聚力簇的比例)的影响:

阈值机制配置 ResNet-50 L3.3 可分离度 ResNet-50 L3.3 覆盖率 ViT-B B6 可分离度 ViT-B B6 覆盖率 说明
固定 \(K=2\) (无 \(\tau\) 约束) 1.00 100 / 100 1.03 100 / 100 无内聚检验,强行二分导致概念混杂
全局静态阈值 \(\tau \ge 0.9\) 1.56 6 / 100 2.18 7 / 100 仅极少数极端神经元达标,覆盖率崩溃
全局静态阈值 \(\tau \ge 0.8\) 1.56 9 / 100 2.18 10 / 100 覆盖率仍然低于 10%
全局静态阈值 \(\tau \ge 0.7\) 1.39 27 / 100 1.88 21 / 100 覆盖率略有回升但依旧缺失泛化性
自适应 \(\tau\) (SPICE 完整设计) 1.15 100 / 100 1.25 100 / 100 兼顾 100% 神经元覆盖率与优秀可分离度

关键发现

  • 网络归纳偏置对多义性的宏观塑造:CNN 模型依靠局部卷积诱导偏置,在大部分网络层中稳定维持较多的细粒度概念,直到最末端池化层前才发生概念数急剧压缩;而 Vision Transformer 凭借全局自注意力交互,呈现出“中间层概念高度分化发散、深层向目标类别重新汇聚整合”的经典 U 型内聚度演变曲线。
  • 多义性形成机制的双重路径:对前驱回路的溯源分析揭示,并非所有多义神经元都源自语义关联。部分神经元表征相关语义(如电话听筒与拨号盘),前驱 top-50 神经元重合度达 42%;而另一些神经元则同时响应完全风马牛不相及的类别(如墨西哥卷饼与棒球),其前驱连接重叠率仅为 18%,证实其属于由容量压缩导致的真正特征叠加。

亮点与洞察

  • 摆脱人工启发式超参束缚:摒弃了以往方法对固定聚类数 \(K\) 的经验猜测,通过统计学 KDE 极值与分位数自适应界定概念边界,实现了真正端到端全自动化的多义性剖析。
  • 各向异性归一化的巧用:敏锐捕捉到深度网络中各向异性引起的表征坍缩现象,用极简的通道维度归一化化解了深层特征相似度虚高的难题,使聚类算法得以专注于相对贡献模式。
  • 可迁移的机制溯源范式:将单神经元解释与前驱归因足迹相结合的思路,为后续扩展到跨层子图回路(circuit)的细粒度追踪奠定了扎实的模块级分析工具。

局限与展望

  • 外部语义验证空间的局限性:论文的可分离度量化严重依赖 CLIP 视觉嵌入空间,由于 CLIP 擅长高层语义而对低级几何纹理不敏感,导致在极浅层(如 B2 层)所有基于 CLIP 的分离度指标区分度均受到一定压制。
  • 动态迭代聚类的计算开销:相比于预先固定 \(K\) 的单次聚类,自适应迭代探测算法对海量全网所有神经元展开全景分析时具有更高的计算复杂度。
  • 从孤立神经元走向完整回路:当前工作主要聚焦于单一目标神经元与其前驱单层之间的归因,未来可进一步拓展为端到端多层递归的概念解耦回路分析。

相关工作与启发

  • vs PURE (CVPR 2024): PURE 基于 CRP 语法与预设 \(K\) 分解多义神经元,仅适用于特定 CNN 结构且依赖人工设定簇数;SPICE 摆脱架构专有约束,首次统一了 CNN 与 ViT 的多义性分析,并自适应确定簇数。
  • vs CPE / LE (CVPR 2025 / ICML 2024): CPE 与 LE 强依赖多模态文本先验或外部 VLM 生成概念原型,易受文本-视觉未对齐偏差干扰且在低激活区失效;SPICE 从内部激活与梯度流纯内在提取足迹,对深层和低激活样本具备更坚固的鲁棒性。

评分

  • 新颖性: ⭐⭐⭐⭐☆ [设计了无需预设 K 的自适应内聚力阈值聚类,跨越架构壁垒统一了解耦分析]
  • 实验充分度: ⭐⭐⭐⭐⭐ [覆盖4类架构、多层级及全激活区间,兼具定性解构、定量指标与生成仿真验证]
  • 写作质量: ⭐⭐⭐⭐⭐ [动机链条严密自洽,方法论与实验图表呈现清晰规范]
  • 价值: ⭐⭐⭐⭐⭐ [为机械可解释性研究提供了通用的多义性分析基础设施,深化了对CNN与ViT表征差异的认知]