CAR-MIL: Counterfactual Attention Regularization for Multiple Instance Learning¶
会议: ECCV 2026
论文: ECCV 2026 Poster
PDF: ECCV 2026 PDF
领域: 医学图像
关键词: 多示例学习 / 反事实解释 / 注意力正则化 / 计算病理学 / 全切片图像
一句话总结¶
针对注意力多示例学习中权重难以忠实反映实例证据且缺乏反驳证据建模的痛点,CAR-MIL 引入双分支反事实注意力正则化框架,在共享编码器与分类器的前提下迫使模型通过对注意力 logit 的微小结构化扰动诱导预测类别发生改变,从而解耦出互补的正向支持与反向质疑注意力分布,在 5 个数字病理数据集和合成基准上显著提升了分类性能与注意力归因忠实度。
研究背景与动机¶
在以全切片病理图像(WSI)分析为代表的弱监督学习任务中,多示例学习(MIL)已成为事实上的标准范式。传统的基于注意力的多示例学习方法(如 ABMIL、CLAM、TransMIL 等)通过为每个切片 patch 动态赋予注意力权重,将成千上万个实例特征加权聚合成包级(bag-level)表征。然而,现有范式存在两大根本瓶颈:其一,训练时注意力权重仅仅是分类损失优化的副产物,缺乏显式的注意力分布引导机制,极易导致注意力坍缩(attention collapse)或受背景间质等虚假相关性(spurious correlations)驱动,无法真实反映具有病理诊断价值的关键区域;其二,传统注意力机制本质上只建模了“支持”当前预测类别的正向证据,无法向病理医生呈现如果改动哪些区域会导致决策发生翻转的“反驳/质疑”证据,极大地限制了其临床解释性与可靠性。
尽管反事实解释(Counterfactual Explanations, CE)通过寻找使模型输出发生质变的最小输入改动,提供了一种天然区分“支持决策”与“挑战决策”证据的归因框架,但现有反事实解释方案普遍属于事后解释(post-hoc),需要针对训练好的模型反复优化输入空间扰动,计算成本极其高昂且无法在训练阶段反哺模型本身的特征与注意力学习;而少数尝试将反事实扰动引入训练的工作(如 CIA-MIL)则多采用无偏向的随机注意力扰动,缺乏对注意力重分布方向的结构化控制,常以牺牲下游分类性能为代价。
本文的切入角度是将反事实推理范式从传统的输入空间转移至注意力 logit 空间,并在模型训练阶段引入端到端可导的正则化约束。通过构建与主分支共享特征提取器和分类器的轻量反事实注意力分支,要求反事实注意力在与真实注意力保持极小分布距离的同时强行改变最终分类决策。核心 idea:在 MIL 训练中引入反事实注意力正则化,通过共享主干的轻量双分支结构与“预测发散-注意力邻近”的对偶约束,迫使预测翻转仅源自对少数关键实例注意力的微小结构化重分配,从而在提升分类鲁棒性的同时解耦出互补的支持性与反驳性注意力分布。
方法详解¶
整体框架¶
CAR-MIL 建立在标准注意力 MIL 的骨架之上,输入为包含 \(N\) 个实例 patch 的切片包 \(B = \{x_1, \dots, x_N\}\)。首先由预训练特征提取器 \(E\)(如 UNI 基础模型或 ResNet)独立提取各实例的特征向量 \(z_j = E(x_j) \in \mathbb{R}^d\)。随后,系统进入并行的双分支注意力计算流程:真实分支(Factual Branch)通过注意力网络 \(\psi\) 输出原始注意力 logit \(u\),经 Softmax 归一化后对实例特征进行加权求和,生成包表征并通过共享分类器 \(\varphi\) 预测包级别标签;反事实分支(Counterfactual Branch)使用结构完全一致但参数独立的轻量注意力模块 \(\psi_{\text{cf}}\) 输出反事实 logit \(u^{\text{cf}}\),同样送入共享分类器得到反事实预测。
在优化阶段,整个系统通过三项联合目标实施约束:真实分支保证包级诊断标签的准确性;反事实证据差分损失迫使两个分支在真实类别上的预测概率产生可控的分离与决策翻转;注意力 logit 邻近正则化则惩罚反事实分支与真实分支之间的分布偏离,确保两者的预测差异绝非来自全局随机漂移,而是来自对极少数关键判决实例注意力的精准重新调配。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入切片包<br/>N 个图像 Patch"] --> B["特征提取器 E<br/>获取实例特征 zj"]
B --> C["双分支证据解耦架构<br/>共享编码器与分类器"]
C --> D["反事实证据差分约束<br/>Ldiff: 强迫真实类别 logits 分离"]
C --> E["注意力 Logit 邻近正则化<br/>Ldiv: L1/余弦微小扰动约束"]
D --> F["联合优化与预测输出<br/>输出分类结果 + 支持/反驳双注意力图"]
E --> F
关键设计¶
1. 双分支证据解耦架构:以最小计算开销构建对称但权值独立的反事实注意力头
为了避免现有后验反事实方法动辄需要多次反向传播或输入级重采样的计算陷阱,CAR-MIL 将反事实扰动直接内化为与主干平行的轻量级注意力模块。给定提取好的实例特征集合 \(\{z_j\}_{j=1}^N\),真实分支与反事实分支分别计算其实例级注意力 logit: $\(u_j = \psi(z_j), \quad u_j^{\text{cf}} = \psi_{\text{cf}}(z_j)\)$ 随后两分支各自经过 Softmax 得到归一化权重 \(a\) 与 \(a^{\text{cf}}\),并加权池化出包表征 \(\hat{Z}\) 与 \(\hat{Z}^{\text{cf}}\),再送入参数完全共享的下游分类器 \(\varphi\),得到真实预测 logits \(F(u)\) 与反事实预测 logits \(F(u^{\text{cf}})\)。这一架构的精妙之处在于,编码器 \(E\) 与分类头 \(\varphi\) 是完全共享的,反事实分支仅额外引入了一个单层或双层轻量 MLP 注意力网络,推理时如果只需要标准预测甚至可完全冻结或移除反事实头,几乎不带来额外的显存与前向计算负担。更重要的是,两分支预测输出的所有差异,百分之百源于注意力权重分配向量的相对改动,从而将决策边界的对比分析精准隔离在注意力分配机制内部。
2. 反事实证据差分约束:利用边界 Margin 驱动反事实分支在真实标签上发生决策退化
如果只让反事实分支自由生成另一套分布,两分支可能各自走向互不相干的局部极小。为此,论文定义了两分支在 logit 空间的证据差分向量: $\(\Delta F(u, u^{\text{cf}}) = F(u) - F(u^{\text{cf}}) \in \mathbb{R}^K\)$ 对于真实标签类别 \(y \in \{1, \dots, K\}\),标量 \(\Delta F_y\) 衡量了真实分支相对于反事实分支在正确类别上的证据强度优势。为了强迫反事实分支针对真实类别产生显著的证据剥离,CAR-MIL 设计了反事实证据差分损失 \(\mathcal{L}_{\text{diff}}\): $\(\mathcal{L}_{\text{diff}} = \log \left( 1 + \sum_{k \neq y} \exp \left( -(\Delta F_y - \Delta F_k) \right) \right)\)$ 数学推导表明,当 \(\mathcal{L}_{\text{diff}} \le \varepsilon\) 时,对于任意非真实类别 \(k \neq y\),均满足边界不等式: $\(\Delta F_y - \Delta F_k \ge -\log(e^\varepsilon - 1)\)$ 这意味着通过最小化 \(\mathcal{L}_{\text{diff}}\),模型被强制要求真实分支不仅在类别 \(y\) 上占据主导,而且在由注意力改动诱发的证据落差中,类别 \(y\) 的衰减幅度要显著超过其他任何干扰类别。这保证了反事实头被定向引导去降低真实类别的置信度、削弱支持性 patch 的比重,从而完成精准的判别性证据剥离。
3. 注意力 Logit 邻近正则化:借助几何距离惩罚确保注意力变动的稀疏性与局部性
单纯依靠差分损失会导致反事实头彻底叛变、学习一套与真实切片毫不相关的全局平铺或相反权重。反事实解释的黄金法则是“最小扰动原则(Minimal Perturbation)”,即输出的翻转必须由最小限度的改动引起。为此,CAR-MIL 引入了邻近正则项 \(\mathcal{L}_{\text{div}} = D(u, u^{\text{cf}})\),直接在未归一化的 logit 空间约束两者的几何距离:
论文探索了两种几何测度:其一是归一化 \(L_1\) 距离: $\(D_{L_1}(u, u^{\text{cf}}) = \frac{1}{N} \sum_{j=1}^N \left| u_j - u_j^{\text{cf}} \right|\)$ 由于 \(L_1\) 范数天然具有稀疏诱导性质,该约束强烈迫使反事实分支仅选择性修改切片中极少数具有决定性权重的实例 patch,保持绝大多数背景与无关实例的权重纹丝不动。其二是余弦相异度距离: $\(D_{\cos}(u, u^{\text{cf}}) = 1 - \frac{\sum_{j=1}^N u_j u_j^{\text{cf}}}{\|u\|_2 \|u^{\text{cf}}\|_2}\)$ 余弦距离更关注注意力权重在不同实例子集上的方向性转移,具备尺度不变性,更适合那些类别间重叠度高、多示例相互竞争的复杂多分类场景。通过这一邻近约束,模型在训练反向传播中形成内生对抗:真实分支为了在被微扰反事实分支对照时维持最高置信度,必须将注意力坚决锚定在最不可辩驳的病理核心证据上;而反事实分支则学会将目光转移到那些反驳当前预测(例如在导管癌切片中关注周围良性增生组织)的潜在区域。
损失函数 / 训练策略¶
CAR-MIL 的完整训练目标为端到端多任务联合损失: $\(\mathcal{L} = \mathcal{L}_{\text{cls}} + \alpha \mathcal{L}_{\text{diff}} + \lambda \mathcal{L}_{\text{div}}\)$ 其中 \(\mathcal{L}_{\text{cls}} = \text{CE}(\hat{y}(u), y)\) 为真实分支的标准交叉熵分类损失,确保主分支预测性能;\(\alpha\) 与 \(\lambda\) 为平衡反事实差分与邻近惩罚的超参数。在优化策略上,使用 Adam 优化器,学习率设为 0.0002(在复杂多分类数据集 BRACS 上设为 0.0001),权重衰减设为 1e-5。在超参数选取上,实验表明 \(\alpha, \lambda \in [0.2, 1.0]\) 范围均能取得稳定收益,适度的正则化(如 0.2 或 0.8)能达到性能与解释性的最优折中。
实验关键数据¶
主实验¶
论文在五大公认的数字病理 WSI 数据集上开展了广泛评估,覆盖二分类分型、基因突变预测、多分类组织分型与淋巴结微转移检测四大任务,并均使用病理基础模型 UNI 提取的特征向量作为输入基准:
| 数据集 | 任务类型 | 评估指标 | CAR-MIL (最佳) | ABMIL 基线 | 次优基线 (模型) | 相对/绝对提升 |
|---|---|---|---|---|---|---|
| TCGA-BRCA | 乳腺癌亚型二分类 | AUC (%) / F1 (%) | 95.5±2.2 / 89.6±1.4 | 95.3±1.7 / 88.9±1.3 | 95.4±1.5 / 88.0±1.1 (MaxMIL) | AUC +0.2% / F1 +0.7% |
| TCGA-NSCLC | 肺癌亚型二分类 | AUC (%) / F1 (%) | 98.0±0.5 / 95.0±1.8 | 97.6±1.0 / 94.2±1.2 | 97.9±0.8 / 94.1±1.7 (CLAM) | AUC +0.4% / F1 +0.8% |
| TCGA-LUAD | TP53 基因突变预测 (困难) | AUC (%) / F1 (%) | 78.1±4.1 / 72.6±4.5 | 74.0±4.3 / 72.1±5.4 | 77.5±2.5 / 71.1±5.6 (CIA-MIL) | AUC +4.1% / F1 +1.5% |
| BRACS | 7分类乳腺组织分型 (困难) | BACC (%) / F1 (%) | 43.1±2.0 / 40.4±2.4 | 38.2±4.1 / 36.0±4.5 | 42.3±2.0 / 40.0±2.0 (DSMIL) | BACC +4.9% / F1 +4.4% |
| CAMELYON16 | 淋巴结转移检测 | AUC (%) / AUPRC+ (%) | 99.9±0.1 / 94.8±1.0 | 98.7±0.3 / 93.2±1.2 | 99.7±0.3 / 94.4±0.3 (CLAM) | AUC +1.2% / AUPRC+ +1.6% |
注:CAR-MIL 在 BRCA 上余弦变体 F1 为 89.6%,L1 变体 AUC 为 95.5%;在 LUAD 和 BRACS 上余弦变体显著优于 L1 与其他基线;在 CAMELYON16 上 L1 变体取得了 99.9% AUC 与 94.8% 的 patch 级 AUPRC+。
消融实验¶
1. 架构通用性消融:将 CAR 模块无缝迁移至不同 MIL 骨干网络
| 骨干模型 | 变体配置 | TCGA-BRCA AUC | TCGA-LUAD AUC | BRACS BACC | CAMELYON16 AUPRC+ |
|---|---|---|---|---|---|
| ABMIL | 原始基线 | 95.3 ± 1.7 | 74.0 ± 4.3 | 38.2 ± 4.1 | 93.2 ± 1.2 |
| ABMIL | + CAR (CAR-MIL) | 95.0 ± 1.7 | 78.1 ± 4.1 | 43.1 ± 2.0 | 94.8 ± 1.0 |
| DSMIL | 原始基线 | 94.1 ± 1.6 | 66.9 ± 4.7 | 42.3 ± 2.0 | 80.6 ± 11.2 |
| DSMIL | + CAR (CAR-DSMIL) | 94.5 ± 2.2 | 71.2 ± 4.1 | 42.5 ± 5.1 | 87.8 ± 2.9 |
| TransMIL | 原始基线 | 93.2 ± 2.7 | 71.7 ± 5.4 | 40.0 ± 3.6 | 28.2 ± 3.6 |
| TransMIL | + CAR (CAR-TransMIL) | 94.0 ± 1.3 | 73.6 ± 4.4 | 42.6 ± 6.1 | 32.6 ± 0.3 |
2. 合成基准 MNIST-bags 上的注意力证据一致性评估(AUPRC 评估)
| 数据集配置 | 评估模型 | 证据提取方式 | Bag AUC (%) | Instance AUPRC+ (%) | Instance AUPRC± (%) |
|---|---|---|---|---|---|
| Adjacent Pairs (上下文依赖) | ABMIL | Attention 权重 | 85.7 ± 5.9 | 76.9 ± 6.1 | 61.5 ± 0.9 |
| Adjacent Pairs (上下文依赖) | TransMIL | Rollout 注意力 | 94.6 ± 4.4 | 81.5 ± 6.9 | 61.7 ± 2.1 |
| Adjacent Pairs (上下文依赖) | CAR-MIL | Attention 权重 | 94.1 ± 5.9 | 85.7 ± 6.5 | 84.6 ± 5.2 |
| Four Bags (组合交互判断) | ABMIL | Attention 权重 | 99.1 ± 0.1 | 86.8 ± 0.2 | 53.1 ± 0.1 |
| Four Bags (组合交互判断) | TransMIL | Rollout 注意力 | 99.5 ± 0.1 | 81.6 ± 6.3 | 51.9 ± 0.8 |
| Four Bags (组合交互判断) | CAR-MIL | Attention 权重 | 99.6 ± 0.1 | 86.8 ± 0.6 | 89.7 ± 0.9 |
关键发现¶
- 任务越难收益越显著:在相对容易的二分类任务(BRCA 和 NSCLC)上,各主流方法的 AUC 均已超过 95%,CAR-MIL 保持甚至略微刷新了 SOTA;但在极具挑战性的 TP53 基因突变预测(TCGA-LUAD)和 7 分类病理亚型分类(BRACS)上,CAR-MIL 分别取得了 +4.1% AUC 和 +4.9% BACC 的巨大突破,表明反事实训练信号在消除复杂背景干扰、捕捉微弱弱监督关联时具有独特优势。
- 注意力与真实实例证据高度对齐:合成基准实验中,CAR-MIL 的 AUPRC±(正负反驳双向证据加权)达到了 84.6% 与 89.7%,相比 ABMIL 的 61.5% 和 53.1% 实现了跃升;而在真实 CAMELYON16 切片上,AUPRC+ 达到 94.8%,显著抑制了无病灶区域的假阳性虚高。
- MORF 扰动实验呈现严格单调递减:当按注意力重要性从高到低逐个剔除 Patch 时,CAR-MIL 预测概率呈现平滑、单调的断崖式下跌;相比之下,ABMIL 等传统方法呈现非单调甚至凸起震荡曲线,证明 CAR-MIL 的注意力排名真正反映了病理特征对决策的真实边际贡献。
亮点与洞察¶
- 将事后反事实解释转化为在训注意力归因驱动力:传统反事实方法只在训练完成后用于生成个案解释,CAR-MIL 创造性地构建了双分支端到端可导框架,将反事实约束作为正则化项直接注入注意力训练闭环,一举解决了“注意力不忠实”的根源问题。
- 自发解耦支持性与反驳性注意力:在病理切片可视化中,真实分支精准收敛于高度恶性的浸润性癌区域(DCIS),而反事实分支自发高亮出邻近的良性增生腺体或正常组织,两者 Spearman 秩相关系数呈现负相关(\(r = -0.67\)),为病理医生提供了前所未有的正反对比证据。
- 即插即用的模块化泛化能力:不仅适用于标准 ABMIL,当插入 DSMIL 和 TransMIL 等现代聚合器时,均在不改变其原本推断流水线的情况下全面提升了性能与解释力;且在 ResNet50 传统特征提取器下增益比在病理大模型 UNI 下更加显著。
局限与展望¶
- 作者承认的局限:目前反事实分支所预测的“替代类别”在多分类设置下由证据差分损失自由竞争决定(如在 Four Bags 中自动偏向最相近类别),虽然贴合数据本质分布,但尚未提供显式的人机交互机制来指定反事实翻转的目标类别。
- 进一步发现的局限:模型引入了 \(\alpha\) 和 \(\lambda\) 两个正则化超参数,虽然对常规变动不敏感,但在极端类别不平衡或极端长尾多标签切片数据集上,可能需要细致调整 L1 与 Cosine 的几何选择。
- 改进与拓展思路:可以将反事实注意力图作为主动学习(Active Learning)或弱监督语义分割辅助标注的先验引导信号;亦可探索将反事实分支拓展为交互式诊断调试工具,允许病理学家指定假设场景(如“如果切片不含坏死区域将如何判别”)。
相关工作与启发¶
- vs ABMIL [Ilse et al., ICML 2018]: ABMIL 仅依靠交叉熵损失间接学习注意力权重,容易被与类别弱相关的背景斑块绑架;CAR-MIL 增加了反事实分支与最小扰动约束,迫使注意力必须落在使类别得以成立的核心实例上,一举修复了注意力崩溃。
- vs CIA-MIL [Chraki et al., 2024]: CIA-MIL 同样试图探索反事实因果干预,但依赖无差别的随机注意力扰动作为诊断工具,常以降低下游分类性能为代价;CAR-MIL 采用可学习的对抗反事实头,在引导注意力可靠性的同时不仅不掉点,反而大幅提升了主任务表现。
- vs CLAM [Lu et al., Nat. Biomed. Eng. 2021]: CLAM 通过额外的示例级伪聚类 SVM 辅助监督来平滑注意力分布,需引入多重超参和复杂的聚类队列;CAR-MIL 仅通过轻量级双分支 logit 几何距离正则化即实现了更优秀的注意力定位保真度,架构更为轻盈优美。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ [首次将反事实解释思想转化为在训注意力几何正则化约束,构思精巧]
- 实验充分度: ⭐⭐⭐⭐⭐ [覆盖合成基准与 5 个主流病理 WSI 数据集,定量指标、MORF 敏感性与定性病理图谱分析俱全]
- 写作质量: ⭐⭐⭐⭐⭐ [数学推导严谨简洁,问题针对性极强,图表与论述逻辑自洽]
- 价值: ⭐⭐⭐⭐⭐ [计算病理学弱监督模型亟需高忠实度归因与临床解释性,该框架通用且即插即用]