Verifying Cancer Segmentation in Vision Transformers via Internal Concepts¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/deep-real/CancerSegFailure
领域: 医学图像
关键词: 癌症分割 / 稀疏自编码器 / 机制可解释性 / 内部概念 / 错误感 (FOE)
一句话总结¶
针对视觉 Transformer(ViT)医学分割模型易产生解剖结构合理却致命的“静默失效”痛点,本文利用稀疏自编码器(SAE)从模型内部表征中捕获如同人类认知的“错误感”(Feeling of Error)信号,通过跨层概念聚合与轻量分类器在不牺牲分割精度的前提下精准检测分割失败并实现局域假阳性纠正。
研究背景与动机¶
在临床肿瘤学中,基于视觉 Transformer(如 MedSAM 等基础模型)的图像分割技术展现出巨大潜力,但其面临的最严峻挑战在于“静默失效”(silent failure)。即便是性能卓越的模型,也可能生成在解剖学形态上看似合理、实则完全错误的病灶分割掩膜,这在临床实践中极易诱发漏诊或过度活检的严重风险。由于放射科医生日常面临繁重的阅片负担,若要对模型生成的每个掩膜进行人工核验,会引发极高的认知负荷。传统的失败检测主要依赖模型输出层的统计启发式指标,例如最大预测概率、预测熵或能量分数(Energy score)。然而,这些输出级信号存在两大根本缺陷:其一,它们完全不具备可解释性与临床操作指导意义,仅能提示掩膜不可靠,却无法解释模型究竟因何出错;其二,依靠输出概率进行失败过滤存在难以调和的“敏感度-质量权衡”(sensitivity-quality tradeoff)——调高检测敏感度固然能拦截更多错误,却不可避免地将临界合格的切片误判为失效,强制舍弃或调整反倒造成整体分割 Dice 指标剧烈下滑(实验显示 F1 提升 20 点伴随 DSC 下降 8-10 点)。
这种表层信号的局限性促使我们思考:AI 模型是否在内部“知道”自己犯了错?在人类认知心理学中,存在一种被称为“错误感”(Feeling of Error, FOE)的自发感知机制,即个体在思考过程中若检测到认知冲突,会产生一种自发的不安感以标记潜在错误。既然输出层置信度常因过度校准失真,那么模型对错误的感知更可能隐藏在其内部计算轨迹之中。通过对 MedSAM 等模型中间激活进行机制可解释性探究,研究团队观察到一种显著的潜空间特征:当模型预测失败时,其内部激活的语义概念数量显著减少,且激活强度大幅下降(\(p < 10^{-5}\),效应量 Cohen's \(d = 1.8\))。这意味着神经网络内部确实天然编码了一种机理性的“错误感”,只是未直接反映于输出概率中。
本文的切入角度是越过黑盒的输出 logits,直接深入 ViT 的内部表征,借助稀疏自编码器将稠密多义的神经元激活解耦为与临床解剖对齐的可解释概念字典,并据此构建多尺度故障表征。核心 idea:利用分层稀疏自编码器抽取 ViT 内部的病灶与解剖概念,将模型潜在的“错误感”转化为结构化概念激活,并通过轻量级分类器学习跨层概念交互规律,从而同时达成精准的故障识别、病因归因以及分块级假阳性自适应修剪。
方法详解¶
整体框架¶
本文提出的故障检测与纠正框架包含两个核心阶段:分层内部概念抽取与基于概念交互的故障诊断。系统输入为医学影像(如前列腺 MRI 或胰腺 CT),首先送入预训练且参数冻结的 ViT 分割主干(如 MedSAM)前向传播;接着在选定的浅层、中层与深层网络中提取 patch 级别的中间特征,由预先训练好的稀疏自编码器(SAE)分别将其映射为稀疏概念激活向量;随后将跨层概念拼接得到全局故障表征,输入训练好的轻量分类器(XGBoost),输出全局失效概率与各概念重要度归因;最后,利用 patch 维度的故障得分对初始预测掩膜进行选择性修剪,滤除高风险假阳性区域。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入医学影像<br/>MRI / CT 切片"] --> B["冻结的 ViT 分割主干<br/>MedSAM 提取各层特征"]
B --> C["分块级分层概念提取<br/>跨浅/中/深层 BatchTopK SAE 稀疏解耦"]
C --> D["内部概念交互分类器<br/>XGBoost 建模概念协同与层间重要度"]
D --> E["分块级选择性故障纠正<br/>阈值过滤消除局部假阳性病灶"]
E --> F["输出校正后分割掩膜与可解释诊断报告"]
关键设计¶
1. 分块级分层概念提取:跨网络深度的空间粒度解耦
为了完整捕获从低级图像伪影(如运动模糊、低对比度噪声)到高级解剖语义混淆(如肿瘤与正常腺体边界混淆)的多层次失效诱因,方法避免拘泥于单一层,而在 ViT 主干中均匀跨层采样 \(L = \{1, 3, 5, 7, 9, 11\}\)。不同于自然语言处理或图像分类中对全图 token 进行池化聚合的做法,癌症分割是高度依赖空间分辨率的密集预测任务,全图池化会直接抹杀细微病灶的空间上下文。因此,针对输入图像 \(x\) 在各层提取的特征图 \(H_l(x) \in \mathbb{R}^{h \times w \times d}\),模型直接在每个空间 patch 位置 \((i, j)\) 上训练独立的 SAE 编码器 \(E_l: \mathbb{R}^d \to \mathbb{R}^D\)。
每个 SAE 采用超完备字典(\(D > d\),本文取字典大小 \(D = 1536\)),通过带约束的自编码重建将稠密向量转为单义的稀疏概念向量。各层生成的 patch 概念向量沿通道拼接后展平,得到能够覆盖网络全表征谱系的联合故障表征: $\(c(x) = \bigoplus_{l \in L} z_l(x) = \bigoplus_{l \in L} E_l(h_l(x)) \in \mathbb{R}^{|L| \cdot D}\)$ 经放射科专家对与标注病灶/器官重合度高(\(\text{IoU} \ge 0.5\))的概念进行临床验证,SAE 成功分离出了“前列腺外周带”、“移行带”、“腺体边缘”以及特异性的“肿瘤中心/边缘”等临床术语概念。当分割模型发生失误时,本应被激活的“肿瘤特异性概念”呈现显著失活状态,构成了稳定的机理标志。
2. 内部概念交互分类器:非线性共现建模与特征重要度归因
获取高维稀疏概念向量 \(c(x)\) 后,单独考察某个孤立概念往往无法鲁棒判定失效,因为医学病灶的误判往往源于概念间的反常协同(例如“局部高信号 + 移行带形态异常 + 缺乏清晰包膜边界”组合出现时暗示误诊)。为此,本文构建标记数据集 \(\mathcal{D} = \{(c_i, y_i)\}_{i=1}^N\),以真实 Dice 是否低于阈值 \(\tau\) 定义失败标签 \(y_i \in \{0, 1\}\),并采用梯度提升决策树(XGBoost)作为核心判别器 \(g: \mathbb{R}^{|L| \cdot D} \to [0, 1]\)。
XGBoost 能高效处理稀疏高维特征,自动挖掘跨越不同网络深度的概念非线性交互模式,同时避免了深度黑盒元模型的二次失真。更为关键的是,XGBoost 内置的增益(gain)重要度度量能够精确量化每个概念维度在失效判别中的贡献权重 \(w \in \mathbb{R}^{|L| \cdot D}\)。通过将前序重要度最高的分数映射回具体的 SAE 神经元及其空间激活热图,系统能够直接向临床医生揭示:“本次判断为失效,核心是因为深层网络未检出 #469 肿瘤概念,且中层 #1423 腺体边缘概念发生误激活”,实现了透明可审计的诊断闭环。
3. 分块级选择性故障纠正:兼顾保留真阳性的局部修剪
常规输出层置信度检测方法在判定某个预测失败后,只能粗暴地将整幅图像的掩膜全部废弃或强行施加全局形态学阈值,这必然导致大量原本分割完好的真阳性(True Positive)区域被误杀,从而损害整体 Dice。得益于在 patch 级别提取概念及计算分类得分的设计,本框架将故障校正形式化为一个空间局域的 patch 保留过滤问题。
对于初始分割掩膜 \(\hat{m}\) 中的每一个空间 patch 位置 \((i, j)\),直接获取其局域概念向量 \(c(x)_{ij}\) 并由分类器计算其失效风险得分 \(g(c(x)_{ij})\)。校正后的分割掩膜定义为: $\(\hat{m}_{\text{corrected}}(i, j) = \hat{m}(i, j) \cdot \mathbf{1}\left[ g(c(x)_{ij}) < \eta \right]\)$ 其中 \(\eta\) 为局部拒绝阈值。该设计允许模型仅精准剔除那些引起假阳性(False Positive)的错误高危 patch,而完整保留高置信度的真实病灶部分,彻底打破了传统方法中“提高查错灵敏度必以牺牲分割质量为代价”的 Pareto 僵局。
损失函数 / 训练策略¶
- 主干微调:分割主干采用 MedSAM,在针对无 prompt 自动分割改造后,利用 Focal Loss(参数设为 \(\alpha = 0.97, \gamma = 2\))在特定癌种数据集上进行微调,优化器使用 Adam,权重衰减为 \(1 \times 10^{-4}\),并配备指数学习率衰减调度器。
- SAE 训练:冻结微调后的分割主干,提取中间特征。SAE 训练遵循 BatchTopK 方案以维持严格的激活稀疏性,设置学习率为 \(1 \times 10^{-4}\),在各层特征上独立训练 5 个 epoch,设定超参数稀疏度 \(S = 8\)、字典大小 \(D = 1536\)。
- 分类器训练:基于分割训练集与验证集的真实分割质量(Dice 阈值 \(\tau\))自动构建 failure 标签样本对,通过标准正则化二元交叉熵目标拟合 XGBoost 判别器。
实验关键数据¶
主实验¶
论文在前列腺癌(PI-CAI 训练、Prostate158 跨域零样本迁移)及胰腺癌(PanTS)基准上展开评估。表 1 展示了模型在源域(PI-CAI)训练后直接跨域部署至未知领域(Prostate158)的零样本失败检测表现。输出层置信度基线在此严苛设置下几乎完全失效(AUROC 跌至接近 50% 的随机猜测水平),而本文基于内部概念的方法展现了极强的泛化能力。
表 1:在未知 Prostate158 数据集上的零样本失败检测性能对比(模型仅在 PI-CAI 上训练)¶
| 方法 | FPR95 (↓) | AUROC (↑) | AUPR (↑) |
|---|---|---|---|
| MaxProb | 100.0% | 50.0% | 64.4% |
| MeanProb | 100.0% | 52.6% | 65.1% |
| Entropy | 97.8% | 53.1% | 65.6% |
| Energy | 100.0% | 48.0% | 63.6% |
| 本文方法 (Ours) | 64.4% | 73.6% | 74.1% |
此外,在 Pareto 前沿对比实验中(原论文 Fig. 5),针对 PI-CAI 前列腺癌,本文方法打破了基线的 Pareto 权衡曲面,同时获得 +8.7 点 F1 提升与 +6.2 点 DSC 提升;在 PanTS 胰腺癌上,本文方法相较于基线前沿取得 +9.2 点 F1 提升与 +2.3 点 DSC 提升。
消融实验¶
表 2:SAE 架构超参数(稀疏度 \(S\) 与字典规模 \(D\))对性能的影响(原论文 Table 2)¶
| 字典规模 \(D\) | 稀疏度 \(S=4\) (DSC / F1) | 稀疏度 \(S=8\) (DSC / F1) | 稀疏度 \(S=16\) (DSC / F1) |
|---|---|---|---|
| \(D = 1536\) (\(768 \times 2\)) | 49.7% / 60.3% | 50.1% / 63.5% | 49.9% / 62.5% |
| \(D = 3072\) (\(768 \times 4\)) | 50.1% / 58.4% | 49.7% / 57.4% | 49.6% / 62.6% |
表 3:概念抽取层级来源对性能的影响(原论文 Table 3)¶
| 特征层来源 | 涵盖层数 \(L\) | 分割质量 DSC (↑) | 故障检测 F1 (↑) |
|---|---|---|---|
| Early (浅层) | Layer 1, 3 | 47.5% | 44.5% |
| Mid (中层) | Layer 5, 7 | 48.8% | 50.4% |
| Deep (深层) | Layer 9, 11 | 49.6% | 57.6% |
| All (全层联合) | Layer 1, 3, 5, 7, 9, 11 | 50.1% | 63.5% |
表 4:故障判别器分类模型选型消融(原论文 Table 4)¶
| 分类器类型 | 分割质量 DSC (↑) | 故障检测 F1 (↑) |
|---|---|---|
| Logistic Regression | 47.8% | 59.2% |
| Decision Tree | 48.5% | 58.7% |
| Random Forest | 44.6% | 57.0% |
| XGBoost (本文选用) | 50.1% | 63.5% |
关键发现¶
- 深层概念主导故障预测,多层互补不可或缺:从 Table 3 可以看出,深层概念(Layer 9, 11)包含了丰富的病理语义,其独立 F1 高达 57.6%,远优于浅层概念的 44.5%;但结合浅层、中层与深层的完整表征能将 F1 进一步推高至 63.5%,验证了低层形态异常与高层语义错误存在互补性。
- 医学图像适宜更紧凑的 SAE 字典:不同于大语言模型或自然语言视觉中动辄上万维的字典设置,医学影像中当 \(D = 1536, S = 8\) 时性能最佳,更大的字典(\(D=3072\))反而因特征过度稀疏分散削弱了下游分类器的聚合能力。
- 推断开销极低:在单张 RTX A6000 GPU 上,MedSAM 基础推理耗时 126.3 ms,常规挂载 6 个 SAE 编码器仅增加 4.6 ms 开销(+3.7%),即便启用全套故障诊断流水线(SAE 编解码 + XGBoost),耗时也仅为 176.5 ms,吞吐量维持在 5.66 张/秒,显存额外占用仅 60 MB(+1.8%),完全契合临床实时质控需求。
亮点与洞察¶
- “错误感”认知的具象化验证:首次利用机制可解释性手段证明,ViT 模型的分割错误在神经元隐空间内具有统计显著的表征贫瘠特征(激活概念数目和幅度骤减,\(p < 10^{-5}, d = 1.8\)),为“模型内部其实知晓自身预测存疑”提供了直接证据。
- 巧妙规避“敏感度-质量权衡”陷阱:以往依靠输出置信度或熵过滤容易把整个切片全盘否定,导致合格病灶误删;而本文将内部概念保留在 patch 粒度,实现像素级的假阳性病灶外科手术式剔除(如 Fig. 7 中将前列腺 MRI 样本的 DSC 从 74.1 纠正至 86.5)。
- 非纯文本对齐的可解释性优势:很多最具故障预测能力的神经元特征属于非语义(non-semantic)的底层处理表征,无需强行与人类先验自然语言对齐,契合医学深度网络表征机制的本质。
局限与展望¶
- 相关性表征而非因果机制:当前方法主要捕捉概念共现与故障的统计关联,尚未确立概念间的因果流动路径;未来可引入因果中介分析(causal mediation analysis)或因果抽象,实现对网络预测机制的主动干预与精准 debug。
- 癌种专用模型的泛化限制:目前 SAE 均按特定癌种独立训练,跨器官适配需重新训练;构建横跨脑、肝、肺、前列腺的多癌种通用 SAE 字典是重要演进方向。
- 缺失模态条件下的鲁棒性探索:临床环境中常存在 MRI 序列残缺(如缺失 ADC 或 DWI),将内部概念拓展至多模态自适应融合与模态插补具有重要实用价值。
相关工作与启发¶
- vs 输出层不确定性评估(MaxProb / Entropy / Energy Score):传统方法只看模型输出的最终概率分布,无法指出失误机理,且阈值敏感导致 DSC 严重下降;本文深入网络内部,利用中间激活的概念字典同时实现了失效定位、原因溯源和局部修复。
- vs 概念瓶颈模型(Concept Bottleneck Models, CBM):CBM 依赖繁琐的人工预定义概念标注并改变前向架构;本文采用无监督的 SAE 事后(post-hoc)即插即用挂载在冻结模型上,完全无需改动原分割主干。
- vs 视觉语言模型(Medical VLMs)概念对齐:医学 VLM 强制将视觉表征投射到离散文本空间,可能遗漏无法用现有医学词汇清晰描述的高维模式;本文 SAE 自主提取的概念不仅包含临床术语,还包含了对故障极其敏锐的非语义特征。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次从机制可解释性与内部概念角度提出并证实了医学 ViT 模型的“机器错误感”(FOE),视角独特且富有洞见。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖前列腺与胰腺多模态数据,包含严苛的跨域零样本评测、完备的各模块消融、分类器选型对比及实际推理延迟评测。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑主线极为清晰,图表设计精美,从认知科学隐喻自然过渡到数学与工程落地。
- 价值: ⭐⭐⭐⭐⭐ 为临床 AI 辅助诊断的“静默失效”提供了一种轻量、无需重训主干且具备高解释性的安全护栏方案。