跳转至

Enhancing Interpretability in CLIP with Optimal Transport-based Submodular Optimization for Ophthalmic Imaging

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/SihongLu/OTSMDL
领域: 医学图像
关键词: 视网膜眼科图像、CLIP可解释性、次模优化、非平衡最优传输、超像素显著区域

一句话总结

针对 CLIP 在眼科医学影像中热图离散、背景杂乱且语义对齐弱的问题,本文提出 OTSMDL 框架,先利用三维次模评分构建高质量候选子集与源质量先验,再通过融合视觉与文本代价的非平衡最优传输进行全局重排序,精确定位病灶与解剖证据。

研究背景与动机

对比语言-图像预训练模型(CLIP)凭借强大的跨模态迁移能力,已被广泛迁移至眼底彩照与光学相干断层扫描(OCT)等视网膜影像辅助诊断任务中。然而,医学诊断具有高度的专业严谨性与伦理要求,仅输出类别概率往往难以建立医生与患者的临床信任;必须为预测结果提供空间定位准确、病理意义明确的视觉证据支持。现有的视觉可解释性方法(如基于梯度的 Grad-CAM/Grad-ECLIP、基于注意力传播的 Rollout/GAME 以及密集定位的 MaskCLIP/CLIPSurgery)大多面向以目标为中心的自然图像设计。当迁移至结构细微、病灶稀疏且背景复杂的眼科影像时,这些方法往往生成过度离散、充斥背景噪点或与文本语义失配的热图,无法连贯覆盖视盘/视杯复合体或微血管瘤等关键病理结构。

这种解释失效的根源在于:医学图像不仅语义鸿沟显著加剧,而且绝大部分区域为无病变背景,关键诊断证据往往仅存在于极其有限的解剖标志或离散病灶中。已有的次模子集选择方法(如 Less-is-More)虽然能够通过边际收益递减特性控制解释区域的紧凑性并压制冗余,但其严重依赖单向顺序贪心搜索,每一步仅关注局部边际增益,容易陷入局部最优,造成热图在解剖边界上的破碎与语义漂移。

为了克服纯贪心选择的近视性与传统热图方法的背景干扰,本文将病理证据定位建模为“次模驱动的候选初始化 + 最优传输全局一致性重排”的两阶段优化问题。本文的核心 idea 是:将次模打分不仅作为筛选初选候选集的效用指标,更作为最优传输的源质量分布先验,进而借助融合跨区域视觉凝聚度与图文语义一致性的非平衡最优传输机制,驱动所有候选超像素在全局代价矩阵下竞争与校准,实现紧凑且高保真的病理证据对齐。

方法详解

整体框架

OTSMDL 的处理管线分为三个协同阶段:超像素区域过分割、多维度次模效用初选、以及基于非平衡最优传输(Unbalanced Optimal Transport, UOT)的全局迭代重排。系统首先利用保持解剖边界的 SLIC 算法将输入图像分割为离散超像素,并通过多尺度视觉特征与文本嵌入计算重要性、对比度和独特性三项次模效用指标;随后通过边际递减准则生成初始候选子集并构建源分布;最后在视觉与文本双重传输代价的约束下求解非平衡 Sinkhorn 传输方案,聚合列向传输质量实现全局重排序与收敛迭代。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入眼科图像与目标文本"] --> B["超像素区域过分割<br/>SLIC保持病灶解剖边界"]
    B --> C["多维度次模效用打分<br/>融合重要性/对比度/独特性"]
    C --> D["边际收益递减子集初选<br/>构建初始集合与源分布质量先验"]
    D --> E["双重代价矩阵构建<br/>融合区域视觉凝聚与图文语义惩罚"]
    E --> F["非平衡最优传输全局重排<br/>Sinkhorn求解软匹配与列向权重聚合"]
    F -->|迭代收敛至稳定集合| G["高保真可解释性证据热图"]

关键设计

1. 超像素区域过分割:保持病变解剖边界

标准 ViT 的 Patch 切分会破坏微血管瘤、硬性渗出或视杯边缘等微小且不规则病理结构的连续性。为此,OTSMDL 采用基于颜色与空间邻近度的 SLIC 超像素聚类算法,将输入图像 \(I \in \mathbb{R}^{H \times W \times 3}\) 划分为 \(N\) 个不重叠且紧密贴合边缘的连通区域 \(R = \{R_i\}_{i=1}^N\)。每个超像素对应一个二值空间掩码 \(m_i \in \{0, 1\}^{H \times W}\),并提取出候选子图 \(I_i = I \odot m_i\)。该设计有效保留了复杂视网膜组织的几何边界形态,为后续的特征提取与区域级消融构建了高质量候选池 \(\mathcal{M} = \{I_i\}_{i=1}^N\)

2. 多维度次模效用打分:兼顾目标相关、类别鉴别与病灶异常

在候选池上,为了量化每个超像素对目标诊断类别 \(y\) 的解释价值,模型提取各区域经过 CLIP 图像编码器投影的特征 \(f_i\) 与目标文本嵌入 \(t_y\),从三个互补维度构建效用函数: - 类别对比度(Contrast):为抑制多病症或相邻分级间的模糊混淆区域,度量区域特征与目标类别的相似度相比于最强竞争类别 \(c \neq y\) 的净胜优势,即 \(s_i^{\text{con}} = \left[ \cos(f_i, t_y) - \max_{c \neq y} \cos(f_i, t_c) \right]_+\)。该设计确保仅对目标疾病具有特异鉴别力的区域获得高分。 - 目标重要性(Importance):结合局部匹配强度与全局消融影响。定义区域遮挡带来的预测置信度跌落差值 \(g_i = \max(0, \cos(F(I), t_y) - \cos(F(I \setminus m_i), t_y))\),与局部相似度相乘构成 \(s_i^{\text{imp}} = \cos(f_i, t_y) \cdot g_i\)。 - 视觉独特性(Uniqueness):基于眼科图像中典型病灶仅占极小面积且偏离健康背景均值的先验,计算区域特征与全局超像素均值特征 \(\bar{f} = \frac{1}{N} \sum_{j=1}^N f_j\) 的欧氏距离平方,即 \(s_i^{\text{uni}} = \| f_i - \bar{f} \|_2^2\),从而敏锐捕捉偏离均值的异常病理性孤立点。

三个指标通过加权求和并经 Min-Max 归一化为基础效用 \(\hat{s}_i\)。随后引入成对视觉冗余核 \(K_{ij} = \frac{1 + \cos(f_i, f_j)}{2}\)(令 \(K_{ii} = 0\)),定义边际增益:

\[\Delta(i \mid S) = \hat{s}_i - \lambda_{\text{dr}} \sum_{j \in S} K_{ij}\]

采用贪心算法逐步收集 \(K\) 个区域,构建出无冗余的初始候选子集 \(S_0\)

3. 双重代价矩阵构建:协调视觉连贯性与跨模态语义匹配

初始子集 \(S_0\) 虽然压制了冗余,但贪心搜索无法修正前序偏差。OTSMDL 将其作为最优传输的起点,在当前选中集 \(S^{(r-1)}\) 与全图所有候选超像素 \(\{1, \dots, N\}\) 之间构建大小为 \(K \times N\) 的传输代价矩阵 \(C^{(r)} = \alpha C_{\text{vis}}^{(r)} + \beta C_{\text{text}}^{(r)}\)。其中: - 视觉连贯代价\(C_{\text{vis}}^{(r)}(u, j) = \| f_u - f_j \|_2 + \| f_{u \cup j} - f_{S^{(r-1)}} \|_2\)。前项拉近特征相似区域,后项衡量合并区域 \(u \cup j\) 与当前整体选中集特征 \(f_{S^{(r-1)}}\) 的全局偏差,有效惩罚结构离散的孤立跳跃。 - 文本对齐代价:基于单区域与合并区域对目标文本的余弦相似度 \(\text{sim}_i = \cos(f_i, t_y)\),构造惩罚项 \(C_{\text{text}}^{(r)}(u, j) = (1 - \text{sim}_u) + (1 - \text{sim}_j) + (1 - \text{sim}_{u \cup j}) + |\text{sim}_u - \text{sim}_j|\),兼顾低对齐惩罚与两区域间的语义对称性。

4. 非平衡最优传输重排:松弛质量约束与全局共识聚合

经典平衡最优传输强制要求源与目标的严格质量守恒,导致大量质量被迫流向无病变的眼底背景区域。为此,模型采用非平衡最优传输(Unbalanced Optimal Transport, UOT),将源分布初始化为正比于基础效用的质量先验 \(a_i^{(r)} = \hat{s}_{u_i} / \sum_{j=1}^K \hat{s}_{u_j}\),目标分布设定为均匀先验 \(b = \frac{1}{N} \mathbf{1}\)。通过松弛边界质量守恒并采用快速 Sinkhorn 算法求解传输矩阵 \(\Pi^{(r)}\),使得质量能够灵活聚集于真正具备诊断价值的候选区。候选区域 \(i\) 接收到的全局共识重要性权重更新为:

\[w_i^{(r)} = \frac{\sum_u \hat{s}_u \Pi_{u, i}^{(r)}}{\sum_j \sum_u \Pi_{u, j}^{(r)}}\]

依据权重降序选取 Top-\(K\) 超像素刷新集合 \(S^{(r)}\),并在集合连续稳定若干轮(如 \(p=5\) 轮)后终止迭代,输出全局精炼的高置信度病理证据。

实验关键数据

主实验

评估在三类典型眼科任务(糖尿病视网膜病变分级、OCT 多疾病/黄斑裂孔分析、青光眼视盘评估)共 7 个数据集上开展,使用标准 Deletion AUC(越低越好)和 Insertion AUC(越高越好)衡量解释保真度。表 1 与表 2 汇报了核心基线对比结果。

表 1: 糖尿病视网膜病变(DR)数据集上的 Deletion / Insertion AUC 对比(以真实标签为目标)

方法 IDRiD Deletion (↓) IDRiD Insertion (↑) APTOS2019 Deletion (↓) APTOS2019 Insertion (↑) EyePACS Deletion (↓) EyePACS Insertion (↑)
Grad-ECLIP 0.397 0.427 0.361 0.399 0.159 0.237
GAME 0.357 0.305 0.363 0.226 0.151 0.123
Grad-CAM 0.493 0.300 0.471 0.287 0.243 0.128
M2IB 0.346 0.326 0.321 0.292 0.159 0.137
MaskCLIP 0.465 0.323 0.479 0.291 0.223 0.139
RISE 0.244 0.583 0.306 0.444 0.192 0.229
Rollout 0.356 0.286 0.347 0.236 0.169 0.113
Less-is-More 0.224 0.450 0.209 0.380 0.113 0.179
CLIPSurgery 0.329 0.413 0.337 0.281 0.138 0.182
LeGrad 0.350 0.393 0.402 0.365 0.139 0.245
LibraGrad 0.311 0.400 0.351 0.411 0.148 0.216
MDA 0.256 0.452 0.305 0.428 0.128 0.239
OTSMDL (Ours) 0.226 0.624 0.232 0.484 0.122 0.253

表 2: OCT 与青光眼数据集上的 Deletion / Insertion AUC 对比(以真实标签为目标)

方法 OCTDL Deletion (↓) OCTDL Insertion (↑) OCTID Deletion (↓) OCTID Insertion (↑) PAPILA Deletion (↓) PAPILA Insertion (↑)
Grad-ECLIP 0.307 0.208 0.433 0.511 0.230 0.702
GAME 0.235 0.208 0.400 0.265 0.280 0.577
Grad-CAM 0.339 0.192 0.449 0.480 0.256 0.573
M2IB 0.259 0.364 0.425 0.317 0.208 0.622
RISE 0.184 0.500 0.339 0.236 0.158 0.573
Less-is-More 0.221 0.337 0.379 0.506 0.089 0.678
LeGrad 0.245 0.365 0.402 0.433 0.190 0.721
LibraGrad 0.291 0.263 0.378 0.440 0.250 0.714
MDA 0.186 0.365 0.406 0.476 0.149 0.690
OTSMDL (Ours) 0.164 0.530 0.334 0.482 0.148 0.725

消融实验与结构一致性分析

作者在 IDRiD 与 OCTDL 数据集上分别消融了代价矩阵分量、打分函数以及最优传输匹配机制,同时在包含病灶分割金标准的 IDRiD 和 OIMHS 上测试了掩码定位精度(Dice / IoU)。

表 5: 视觉与文本传输代价消融实验(IDRiD 与 OCTDL 数据集)

视觉传输代价 (\(\alpha\)) 文本传输代价 (\(\beta\)) IDRiD Del. (↓) IDRiD Ins. (↑) OCTDL Del. (↓) OCTDL Ins. (↑)
\(\times\) \(\checkmark\) 0.226 0.601 0.168 0.528
\(\checkmark\) \(\times\) 0.274 0.487 0.203 0.359
\(\times\) (退化为纯次模贪心) \(\times\) 0.289 0.406 0.248 0.336
\(\checkmark\) \(\checkmark\) 0.226 0.624 0.164 0.530

表 6: 次模效用组件与最优传输变体消融(IDRiD 与 OCTDL 数据集)

配置 / 组件 IDRiD Del. (↓) IDRiD Ins. (↑) OCTDL Del. (↓) OCTDL Ins. (↑) 说明
完整模型(Default Settings) 0.226 0.624 0.164 0.530 三项打分 + 非平衡OT + 效用赋权源分布
平衡最优传输(Balanced OT) 0.313 0.426 0.293 0.346 强制质量守恒导致大量质量外溢至背景
均匀源分布 (\(a = \text{uniform}\)) 0.225 0.603 0.167 0.529 失去基础效用引导,插入性能下降
移除全部打分项 (\(\times \times \times\)) 0.233 0.566 0.173 0.506 纯依赖 OT 全局优化,表现仍具竞争力
仅保留重要性分项 (\(s^{\text{imp}}\)) 0.221 0.524 0.165 0.510 侧重删除收益,Deletion 占优但 Insertion 不足
仅保留独特性分项 (\(s^{\text{uni}}\)) 0.231 0.612 0.173 0.521 偏好孤立异常病灶,显著推高 Insertion

关键发现

  • 非平衡松弛是最优传输在医学场景生效的关键:将非平衡 OT 替换为经典平衡 OT 时,IDRiD 的 Insertion AUC 暴跌近 20 个点(0.624 \(\rightarrow\) 0.426),OCTDL 暴跌 18.4 个点(0.530 \(\rightarrow\) 0.346)。这表明眼科影像中强行均衡传输会迫使诊断质量分散在广阔的健康视网膜背景上。
  • 文本传输代价承担语义定向锚点:移除文本代价后,模型仅靠视觉自聚类,IDRiD 的 Insertion AUC 从 0.624 大跌至 0.487;而移除视觉代价仅轻微掉点至 0.601。文本对齐代价对于引导区域选择贴合特定病种描述起决定性作用。
  • 计算效率可临床实用:得益于一次性前向特征全局缓存与增量更新,OTSMDL 平均处理单张图像仅耗时 5.28 秒,峰值显存仅 \(\approx 6.4\) GB,显著快于前作 Less-is-More 的耗时,具备部署至日常辅助诊疗流水线的实用潜力。

亮点与洞察

  • 解耦“初选探索”与“全局仲裁”的双重机制:传统贪心次模选择一经选定便不可逆,容易被早期高亮但非特异的病斑带偏;OTSMDL 巧妙地将次模效用退化为源分布质量先验,把终审权交由全图最优传输,兼顾了局部高收益与全局一致性。
  • 适配眼科弱先验的非平衡传输建模:意识到病灶在视网膜视野中的极端稀疏性,果断摒弃经典 Monge-Kantorovich 的平衡约束,通过熵正则化非平衡 Sinkhorn 实现了病理特征到目标语义的自适应聚焦。
  • 跨模态特征代价矩阵的即插即用性:构建的视觉内聚性与跨模态对称惩罚无需修改 CLIP 主干网络权重,完全以事后(post-hoc)方式运行,可以无缝推广到各类通用或专科多模态大模型的视觉证据归因任务中。

局限与展望

  • 依赖预设超像素尺度与预算超参:SLIC 超像素划分尺度与保留区域数量 \(K\) 当前为全局固定值。在面对微动脉瘤(极微小)与大面积地图样视网膜萎缩(大尺度)并存的复杂多尺度病变时,固定超像素尺寸可能出现欠分割或过分割。
  • 非自适应的迭代终止准则:目前依赖预设的最大迭代轮数 \(R_{\max}=5\) 与稳定计数 \(p=5\),缺少面向不同病种严重程度自适应终止机制。
  • 未来方向:探索基于语义敏感度的多尺度自适应超像素或点云表示,并将连续松弛的非平衡最优传输拓展为端到端可导的弱监督病灶分割先验。

相关工作与启发

  • vs Less-is-More (Chen et al., ICLR 2024):两者均引入次模理论消除冗余;但 Less-is-More 采用纯序列贪心启发式,存在不可逆的短视缺陷,且在眼科背景下容易离散;OTSMDL 将贪心解仅作为初始化状态,通过后续的非平衡最优传输实现全局重排,在 IDRiD 上 Insertion AUC 领先达 17.4%(0.624 vs 0.450)。
  • vs 基于注意力的 Rollout / GAME:Rollout 等通过注意力权重级联传播推导热图,但在没有归纳偏置约束的 ViT 中易产生大量背景弥散噪声;OTSMDL 引入显式解剖超像素边界与文本语义惩罚,输出的证据结构高度紧凑且紧扣视盘/病灶。
  • vs 梯度类方法 (Grad-CAM / Grad-ECLIP / LeGrad):基于梯度反传的方法极易受到梯度饱和与高频噪声扰动;OTSMDL 通过基于消融与传输代价的扰动评估,生成与临床分割金标准(Dice/IoU)高度吻合的连贯掩码。

评分

  • 新颖性: ⭐⭐⭐⭐☆ (将次模打分作为先验与非平衡最优传输相结合,思路清晰巧妙)
  • 实验充分度: ⭐⭐⭐⭐⭐ (覆盖 7 个眼科多模态数据集、13 个对比基线,包含金标准分割与详尽消融)
  • 写作质量: ⭐⭐⭐⭐⭐ (形式化定义严谨,动机与实验分析逻辑链条闭环)
  • 价值: ⭐⭐⭐⭐☆ (为多模态医疗模型的高保真临床可解释性提供了极具实用价值的落地框架)