Mechanistic interventions for explainable digital pathology uncovers adversarial vulnerabilities¶
会议: ECCV 2026
论文: ECCV 2026 Poster
领域: 医学图像
关键词: 数字病理学, 机械可解释性, 对抗鲁棒性, 稀疏自编码器, 激活补丁
一句话总结¶
针对数字病理深度模型易受对抗扰动攻击且黑盒不可解释的难题,本文提出结合稀疏自编码器与因果激活补丁的机制分析框架,揭示模型依赖染色伪影与扫描噪点等非形态学捷径,并设计机制引导的对抗训练(MIAT)精准正则化脆弱神经回路,在保持无扰动诊断精度的同时大幅提升对抗鲁棒性。
研究背景与动机¶
深度学习在数字病理全切片图像(WSI)的癌症自动分级任务中取得了极具竞争力的表现,已展现出革新临床诊断流程的巨大潜力。然而,临床病理诊断属于极高风险的医疗场景,端到端深度模型的“黑盒”属性与潜在的脆弱性构成了实际部署的核心阻碍。研究表明,深度神经网络极易受到细微甚至人眼不可察觉的对抗扰动攻击,导致肿瘤分级(如 Gleason 评分或 Nottingham 分级)发生严重偏差,这不仅直接威胁患者生命安全,亦违反了监管机构对医疗设备软件(SaMD)的透明性与合规性要求。
这种脆弱性的核心症结在于:现有病理模型往往习得了非临床意义的捷径特征(如制片过程中的染色不均、数字化扫描引入的高频噪点与压缩伪影),而非泛化性强的真实组织形态学表征;而在对抗防御侧,主流对抗训练(AT)或输入去噪方法均将鲁棒性视为笼统的经验优化问题,盲目在全网施加全局正则化,不仅引发特征过度平滑、显著牺牲干净图像(Clean)上的诊断准确率,更无法从机理上解释模型“究竟为何脆弱、脆弱特征在何处被激活与传递”。
本文的切入角度是引入前沿的机械可解释性(Mechanistic Interpretability)工具,将特征解耦与因果干预引入病理网络微观回路分析。核心 idea:利用稀疏自编码器(SAE)将高层特征解耦为形态学特征与伪影特征,并通过因果激活补丁(Activation Patching)定位驱动对抗失效的关键脆弱回路,进而提出机制引导对抗训练(MIAT),对脆弱神经回路施加精准正则化以实现鲁棒性与诊断精度的帕累托最优。
方法详解¶
整体框架¶
本文提出的 MIAT 框架主要包含三大递进阶段:首先,利用过完备稀疏自编码器(SAE)对病理模型倒数第二层的深层激活进行字典分解,将纠缠的特征空间拆分为单语义的组织形态学特征与非生物伪影特征;其次,通过因果激活补丁(Activation Patching)与路径补丁在网络各层进行因果干预实验,分离出对对抗攻击起充要作用的脆弱回路集合;最后,构建回路靶向对抗扰动并引入回路专异性一致性正则化损失,在训练中动态更新回路并定向加固脆弱神经通路。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入病理图像<br/>(Clean WSI 切片 / 对抗切片)"] --> B["特征解耦与因果回路发现<br/>倒数第二层 SAE 特征拆解"]
B --> C["靶向对抗样本生成<br/>最大化脆弱回路激活偏移"]
C --> D["回路专异性一致性正则化<br/>惩罚脆弱回路输出偏离"]
D --> E["动态回路迭代更新<br/>周期性重新发现与加固"]
E --> F["输出鲁棒病理模型<br/>兼顾高精度与抗扰动能力"]
关键设计¶
1. 特征解耦与因果回路发现:精准剥离非生物学伪影与脆弱神经通路
传统线性探测方法只能评估特征对分级标签的预测准确度,无法辨识表征背后是真实的腺体形态还是实验环境引入的捷径伪影。本文在模型倒数第二层激活向量 \(h \in \mathbb{R}^d\) 上引入过完备字典 \(D \in \mathbb{R}^{k \times d}\)(\(k=4096\),较特征维度 \(d\) 膨胀 4 倍),并结合稀疏编码 \(z \in \mathbb{R}^k\) 进行重构优化: $\(\mathcal{L}_{\text{SAE}} = \|h - D z\|_2^2 + \lambda \|z\|_1\)$ 通过最大激活样本检索与特征可视化分析,成功将解耦出的基底划分为病理形态学特征(如腺体形态、上皮细胞密度)与非形态学伪影(如 H&E 染色深浅、扫描仪噪声、JPEG 压缩块)。在此基础上,算法通过激活补丁执行双向因果干预:将对抗前向传播中的层激活替换为干净激活,若恢复正确预测则判定该层上游回路对鲁棒性充分;将干净前向传播中的层激活替换为对抗激活,若诱发误分类则判定该层下游回路对脆弱性必要,从而精确圈定对抗脆弱神经回路集合 \(\mathcal{C}\)。
2. 靶向对抗样本生成:定向激发脆弱神经通路的极端扰动
常规 PGD 攻击仅以交叉熵分类损失为优化目标,生成的对抗噪声弥散在整个特征空间中,难以针对性地诱导特定病理伪影的放大。MIAT 针对已定位的脆弱回路集合 \(\mathcal{C}\),专门构建了内层对抗生成目标,促使扰动直接最大化脆弱神经回路的激活偏移: $\(\delta^* = \arg\max_{\|\delta\|_p \le \epsilon} \sum_{a \in \mathcal{C}} \|a(x + \delta) - a(x)\|_2^2\)$ 其中 \(a(x)\) 为回路中指定神经元或特征在输入 \(x\) 下的前向激活。该设计迫使对抗样本精准击打对染色伪影和传感器噪声过敏的特定注意力头或卷积核,为后续防御训练提供了极高信噪比的对抗监督信号。
3. 回路专异性一致性正则化:外科手术式加固脆弱神经路径
传统对抗训练普遍采用全局经验正则化或全网扰动对抗,极易引起特征过度平滑,导致模型在未受扰动的真实病理组织切片上分类精度明显下滑。MIAT 提出仅针对脆弱回路 \(\mathcal{C}\) 施加选择性一致性约束,在总损失中定义: $\(\mathcal{L}_{\text{reg}} = \sum_{a \in \mathcal{C}} \|a(x') - a(x)\|_2^2\)$ 整体优化目标为分类交叉熵与回路正则项的加权联合: $\(\mathcal{L}_{\text{MIAT}} = \mathcal{L}_{\text{CE}}(f_\theta(x'), y) + \alpha \mathcal{L}_{\text{reg}}\)$ 其中 \(\alpha\) 控制回路约束强度。该项强迫模型在遭受对抗扰动时,脆弱回路的表征状态仍与纯净样本严格保持一致,从机制根源处切断对抗噪声借由伪影通路向最终诊断决策的传播。
4. 动态回路迭代更新:适配网络演化并保持靶向有效性
在模型参数迭代优化过程中,随着原脆弱回路被逐步约束与加固,模型可能会自适应地重构特征依赖,在其他子层或未受监控的通道中涌现出新的对抗漏洞。为此,MIAT 引入动态回路发现策略,在训练周期内定期重启轻量级 SAE 分解与因果激活补丁流程,动态更新脆弱回路集合 \(\mathcal{C}\)。这一闭环反馈机制确保了正则化项始终精准锚定当前模型的最薄弱环节,避免因静态回路掩码失真而退化为泛化能力差的局部防御。
实验关键数据¶
主实验¶
在 TCGA-Prostate(Gleason 肿瘤分级,约 50 万个 \(256 \times 256\) 切片)与 BreastPathQ(Nottingham 乳腺癌分级,约 30 万切片)两个真实临床病理基准上,评估 Vision Transformer(ViT-B/16)和 ResNet-50 在纯净输入(Clean)及 PGD (\(\epsilon=8/255\))、Carlini-Wagner (CW)、DeepFool 三种主流对抗攻击下的精度表现。
| 数据集 | 模型 | 训练方法 | Clean Acc (%) | PGD Acc (%) | CW Acc (%) | DeepFool Acc (%) |
|---|---|---|---|---|---|---|
| TCGA-Prostate | ViT-B/16 | Standard Clean | 88.2 | 12.5 | 18.3 | 22.1 |
| TCGA-Prostate | ViT-B/16 | Standard AT | 85.1 | 68.4 | 55.2 | 48.7 |
| TCGA-Prostate | ViT-B/16 | MIAT (本文) | 86.8 | 75.3 | 62.8 | 55.6 |
| TCGA-Prostate | ResNet-50 | Standard Clean | 86.5 | 10.8 | 15.7 | 19.4 |
| TCGA-Prostate | ResNet-50 | Standard AT | 83.9 | 62.1 | 50.3 | 44.2 |
| TCGA-Prostate | ResNet-50 | MIAT (本文) | 85.2 | 70.5 | 58.9 | 51.8 |
| BreastPathQ | ViT-B/16 | Standard Clean | 87.1 | 11.9 | 17.6 | 21.3 |
| BreastPathQ | ViT-B/16 | Standard AT | 84.3 | 65.8 | 53.1 | 47.2 |
| BreastPathQ | ViT-B/16 | MIAT (本文) | 85.9 | 73.7 | 60.4 | 54.1 |
| BreastPathQ | ResNet-50 | Standard Clean | 85.4 | 10.2 | 14.9 | 18.7 |
| BreastPathQ | ResNet-50 | Standard AT | 82.8 | 60.5 | 48.9 | 43.0 |
| BreastPathQ | ResNet-50 | MIAT (本文) | 84.6 | 69.2 | 57.3 | 50.5 |
消融实验与 SOTA 对比¶
在 TCGA-Prostate 基准上,针对 MIAT 的关键组件设计(正则化强度 \(\alpha\) 及回路选择机制)进行消融,并与主流防御基准 TRADES、MART 及 LAT 进行横向性能对比。
| 评估配置 / 防御方法 | 模型 | Clean Acc (%) | PGD Acc (%) | CW Acc (%) | 说明 |
|---|---|---|---|---|---|
| TRADES | ViT-B/16 | 84.3 | 65.2 | 52.1 | 全局权衡项,引起特征过平滑 |
| MART | ViT-B/16 | 83.8 | 67.5 | 54.8 | 聚焦对抗误分类样本 |
| LAT (Latent AT) | ViT-B/16 | 85.0 | 70.1 | 57.3 | 逐层潜在空间对抗 |
| MIAT (Full, \(\alpha=0.01\)) | ViT-B/16 | 86.8 | 75.3 | 62.8 | 完整模型:机制引导回路正则化 |
| 消融:\(\alpha=0\) (无回路正则) | ViT-B/16 | 85.1 | 68.4 | 55.2 | 性能完全退化至标准 AT |
| 消融:随机回路正则化 | ViT-B/16 | 84.9 | 68.6 | 55.0 | 随机选取非脆弱通道,无鲁棒增益 |
| TRADES | ResNet-50 | 83.1 | 63.5 | 50.8 | 卷积网络基线 |
| MART | ResNet-50 | 82.6 | 65.2 | 52.4 | 卷积网络基线 |
| LAT | ResNet-50 | 84.0 | 68.3 | 55.7 | 卷积网络分层基线 |
| MIAT (Full, \(\alpha=0.01\)) | ResNet-50 | 85.2 | 70.5 | 58.9 | 完整模型:兼顾精度与最高抗扰能力 |
关键发现¶
- 脆弱回路在网络架构中的分布规律:在 ViT 结构中,最易受攻击的脆弱回路高度集中于中间层(Layer 6–9),特定注意力头(如第 7 层的个别头)会在对抗扰动下强烈放大扫描仪噪点与背景伪影;而在 ResNet-50 中,脆弱回路更多分布在深层卷积块(Block 3 与 Block 4),直接响应高频噪声和组织染色不均。
- 因果干预的充要性验证:在 ViT 模型中,在第 6 层将对抗前向特征替换为纯净激活,可使 78.3% 的对抗误分类样本恢复正确预测(充要鲁棒源);反之在第 9 层注入对抗激活,直接导致 81.7% 的纯净样本预测崩溃。
- 表征距离与泛化权衡:MIAT 使得脆弱回路中纯净激活与对抗激活之间的平均 \(L_2\) 距离下降了 42.1%,直接验证了机制正则项的表征锚定效果;相比传统 AT 和 TRADES,MIAT 将纯净图像精度衰减控制在 1.4% 以内,同时实现了超过 7 个百分点的绝对对抗防御提升。
亮点与洞察¶
- 将前沿机械可解释性闭环赋能防御训练:不仅将 SAE 用于特征解耦的事后审计,更将因果激活补丁产出的脆弱回路图谱直接转化为对抗训练的可微损失惩罚,实现了从“机理解释”到“靶向防御”的工程闭环。
- 揭开病理网络对抗脆弱性的生物学/物理本质:量化证实模型有近 40% 的深层特征通道被染色深浅变异、数字化扫描条纹及压缩噪点等伪影占据,为理解高风险医疗 AI 的安全隐患提供了微观回路级依据。
- 满足高等级医疗器械(SaMD)监管审查需求:相较于常规端到端黑盒防御,MIAT 的神经回路审计报告能直接对接 FDA SaMD 与欧盟 MDR Class III 医疗器械对透明度、风险管理与可解释性的严苛准入规定。
局限与展望¶
- 回路离线发现的额外计算开销:训练阶段使用过完备 SAE(4096 维)及多轮逐层激活补丁需要可观的 GPU 显存与计算耗时;尽管推理期零开销,但在资源受限场景下初次训练门槛较高,后续可探索轻量化随机化 SAE 逼近方案。
- 应对自适应高级攻击者的潜在盲区:目前评估主要针对一阶梯度攻击(PGD、CW、DeepFool);面对深谙防御机制、专门绕过当前正则化回路的高阶自适应攻击者,动态回路更新频率与稳定界限仍需深入分析。
- 多中心多模态病理扩展挑战:实验主要覆盖了前列腺与乳腺两类常见肿瘤切片,未测试罕见病理亚型,且尚未扩展至结合基因组学或放射组学的多模态病理基础大模型。
相关工作与启发¶
- vs TRADES / MART 等传统对抗训练:传统防御在整体模型参数或全量特征上施加均匀的平滑约束,往往导致干净样本诊断准确率严重下跌(通常掉点 3%–5%);MIAT 通过因果定位靶向约束不足 10% 的脆弱神经回路,在大幅提升对抗鲁棒性的同时守住了纯净分类精度底线。
- vs 纯可视化或显著图(Grad-CAM、Deconvolution):传统显著图仅能提供像素级归因热力图,无法指出网络内部哪一个注意力头或通道造成了虚假关联;MIAT 借助 SAE 与激活补丁直接深入网络神经计算路径,提供可因果干预的模块化图谱。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ [首次将机械可解释性的 SAE 和因果激活补丁完整引入数字病理对抗脆弱性分析并形成靶向防御闭环]
- 实验充分度: ⭐⭐⭐⭐ [涵盖两大真实临床数据集、ViT 与 ResNet 双架构、多种攻击基线及充分消融,若补充自适应攻击评测更臻完美]
- 写作质量: ⭐⭐⭐⭐⭐ [理论阐述清晰严密,从临床痛点、机理解析到算法设计与监管合规层层递进]
- 价值: ⭐⭐⭐⭐⭐ [攻克高风险临床病理 AI 鲁棒性与可信解释性痛点,高度契合 FDA/MDR 医疗 AI 监管落地的实际诉求]