跳转至

Compact and Structurally Transparent Cervical Cytology with Geometry-Driven Features and Closed-Form Attention

会议: ECCV 2026
论文: ECCV Official
代码: https://github.com/Dichao-Liu/GeoCEAN
领域: 其他(建议:医学图像)
关键词: 宫颈细胞学、白盒模型、闭式注意力、自由能分配、结构可解释性

一句话总结

论文将宫颈细胞病理学临床筛查(初筛定位-精细阅片-归因诊断)流程内化为网络计算图,通过四个病理先验特征定义诊断势场并以自由能极小化求解出闭式空间注意力,结合固化几何算子与非负近对角混合的紧凑解析骨干网络,仅用 2.2M 参数就在 DSCC、SIPaKMeD 和 Herlev 上达到或超越大模型 SOTA,并实现了端到端从概念像素到预测对数的内生证据溯源。

研究背景与动机

宫颈癌是全球女性致死率极高的恶性肿瘤之一,但通过规范的宫颈细胞学(Pap 涂片/液基细胞学)筛查能够实现极高的早诊早治与预防效果。随着筛查量剧增,自动化阅片系统成为减轻病理技师负担的关键。然而当前绝大多数方法要么依赖通用的通用卷积或 Vision Transformer 骨干网络,要么堆叠多尺度模块与复杂分支;这些黑盒模型虽然在单数据集上能取得可观指标,但由于缺乏病理学先验,常常受限于染色差异、碎片杂质与细胞重叠带来的假象,跨数据集泛化性能波动极大。更严重的是,临床迫切需要可靠的诊断决策解释,而事后解释工具(如 Grad-CAM)并不参与模型的实际前向决策,其热力图往往弥散到背景染色和细胞质杂质区域,缺乏严格的病理机制对应与数学归因保证。

在真实的临床诊断流程中,病理学家遵循着高度结构化的阶梯流程:初筛技师首先根据核异质性快速圈定高疑可疑区域(where to look),主检医师对核膜、核质与极向等精细形态展开系统性研判(what is present),最后出具诊断报告并给出详实依据(how to decide)。现存模型的核心矛盾在于:通用深层网络靠自由学习的无约束通道变换来拟合全局特征,割裂了特征演化与生物学形态之间的对应关系;而白盒模型若脱离具体的病理先验,又难以在高度复杂的显微细胞多分类任务中兼顾轻量与判别力。

本文的切入角度是直接将临床阅片流程转化为数学上可解析求解的内生网络架构:用领域原生的几何形态特征构建诊断势场,把注意力分配严谨地建模为有限预算下的自由能极小化问题,并在特征提取中通过固化几何微分算子和非负近对角耦合约束特征演进。核心 idea:将宫颈细胞学筛查抽象为势场下的自由能最优分配(闭式注意力定位)与几何响应约束更新(解析骨干提取),通过端到端内生可溯源机制在仅 2.2M 参数下兼顾临床高透明度与跨数据集 SOTA 鲁棒性。

方法详解

整体框架

GeoCEAN(Geometry-driven Concept-Energy-Attention Network)整体架构严格对应临床阅片的三个核心阶段:初筛定位(Where to look)、形态研判(What to read)以及决策归因(How to decide)。输入细胞图像首先通过四个像素级病理形态算子提取先验概念图,经过严格单调校准与非负凸组合形成全图的“诊断异常势场”。将该势场的负值作为能量景观,在概率单纯形上通过求解带负熵正则项的自由能泛函极小化,以解析闭式推导出空间注意力分布;与此同时,图像经由轻量 stem 进入几何驱动的解析骨干网络(Analytic Backbone),利用固定的梯度与拉普拉斯微分算子、非负近对角通道混合以及凸残差更新提取特征;最后,注意力图与终端特征图通过可分离概率读出模块加权聚合,并直接输入线性分类头输出各类别 logits。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    IN["输入宫颈细胞图像 x"] --> C1["显式概念提取与单调校准<br/>核膜凹凸/排列紊乱/核浆比/核质粒度"]
    IN --> ST["轻量 Stem 下采样"]
    C1 --> POT["诊断势场与负能量景观构建<br/>V(u) 与 E(u) = -V(u)"]
    POT --> FEA["自由能分配与闭式空间注意力<br/>A* = softmax(-E/tau)"]
    ST --> BB["几何驱动解析骨干网络<br/>固定微分算子 + 非负近对角混合 + 凸残差更新"]
    FEA --> RO["可分离概率读出与内生证据溯源<br/>加权空间聚合与线性头"]
    BB --> RO
    RO --> OUT["类别对数 y 与概念-像素归因导数"]

关键设计

1. 显式病理概念提取与单调诊断势场构建:为初筛提供符合医学常识的先验场 针对深度网络对非诊断区域(杂质、染色聚集)假性响应的痛点,模型根据细胞病理学指南提炼出四大关键形态指标并进行显式计算。对二值化核掩模 \(n\) 及其单像素边界 \(\partial n\),计算核膜凹凸度 \(z_{\mathrm{rough}}\),即局部边界归一化的离散拉普拉斯边界通量;计算梯度方向的圆方差以评估细胞上皮极向排列紊乱度 \(z_{\mathrm{orient}}\);利用核区域与膨胀胞浆区域计算局部核浆比 \(z_{\mathrm{nc}}\);利用局部灰度方差的对数表示染色质颗粒粗糙度与异质性 \(z_{\mathrm{ent}}\)。为了保证医学特征的单调一致性,每个概念通过严格单调递增的线性变换 \(f_i(z)=a_i^+ z + b_i\)(其中斜率约束 \(a_i^+ > 0\))映射到统一尺度,再通过位于 3 维概率单纯形上的非负权重 \(\alpha \in \Delta_3\)\(\sum \alpha_i = 1, \alpha_i \ge 0\))融合为局部诊断异常势场:

\[V(u) = \sum_{i=1}^4 \alpha_i f_i(z_i(u))\]

非负单纯形与单调校准从数学上杜绝了病理特征逆序(rank inversion):在其他线索不变的前提下,核膜越凹凸或染色质越粗糙,绝不可能导致诊断势场 \(V(u)\) 的局部数值下降。

2. 自由能极小化与闭式空间注意力:将初筛注意力建模为能量分配 传统自注意力需要耗费大量可学习参数且注意力权重难以与物理语义严密绑定。本文将初筛过程建模为一个热力学平衡系统,定义局部能量景观为势场的相反数 \(E(u) = -V(u)\),使得临床异常证据最密集的核膜边缘和高核浆比区域天然对应能量最低的“深势阱”。在低分辨率特征格网 \(\Omega'\) 上的概率单纯形 \(\Delta\) 中,引入自由能泛函 \(\Phi(A) = \langle A, E \rangle - \tau H(A)\),其中 \(H(A) = -\sum A_u \log A_u\) 为香农熵,\(\tau > 0\) 为温度超参。自由能泛函平衡了向能量势阱聚集的注意力强度与全局覆盖熵。根据一阶拉格朗日最优性条件与泛函的严格凸性,可以直接解析推导出唯一的闭式最优注意力分布:

\[A^\star = \mathrm{softmax}(-E / \tau) = \mathrm{softmax}(V / \tau)\]

该公式完全无需引入任何额外的自注意力投影权重矩阵,前向过程直接完成注意力求解,彻底消除了传统注意力机制的黑盒参数负担。

3. 几何驱动的解析骨干网络:固化微分算子与非负近对角凸更新 为了杜绝深层网络在层叠传递中发生特征语义漂移和非可逆扰动,解析骨干的每一层都强制遵循严格的几何微分与约束优化。在每个特征块中,输入特征 \(X\) 首先通过固定的梯度微分算子 \(G_x, G_y\) 和离散拉普拉斯算子 \(\Delta\) 计算通道级的一阶梯度幅值 \(M_{\mathrm{gm}} = \sqrt{(G_x \ast X)^2 + (G_y \ast X)^2}\) 和二阶曲率响应 \(M_{\mathrm{lap}} = |\Delta \ast X|\)。接着,通过带正系数加权的 \(1 \times 1\) 非负近对角矩阵 \(\mathcal{M}\) 进行通道耦合:

\[\widehat{X} = \mathrm{BN}\Big(\mathcal{M}\big(a_{\mathrm{gm}} M_{\mathrm{gm}} + a_{\mathrm{lap}} M_{\mathrm{lap}}\big)\Big)\]

近对角带限约束强制要求解释相似几何现象的相邻通道进行交互,严格抑制跨通道的远场符号翻转干扰。在残差更新时,采用参数 \(\gamma \in (0, 1)\) 的凸组合步长:

\[X^{\mathrm{out}} = X + \gamma (\widehat{X} - X)\]

当边缘与曲率证据一致时,特征沿梯度方向更新;当证据发生冲突时,\(\gamma < 1\) 提供了局部的压缩收敛效应,确保特征深层演进始终稳定可控,与浅层概念保持几何共线。

4. 可分离概率读出与闭式内生证据溯源:从像素到 Logit 的端到端可导归因 将终端特征图 \(F\) 与闭式注意力 \(A^\star\) 结合,通过无参概率加权聚合得到紧凑全局表征 \(m = \sum_{u} A_u^\star F_{:, u}\),随后经由无偏置或线性分类权重 \(W_{\mathrm{cls}}\) 计算各类别的 logit \(y_c = \sum_{u} A_u^\star \langle w_c, F_u \rangle\)。由于前向各环节均具有严密的数学解析形式,类别 \(c\) 对位置 \(v\) 处第 \(i\) 个病理概念 \(z_i(v)\) 的边际效应具备闭式解析导数:

\[\frac{\partial y_c}{\partial z_i(v)} = \frac{\alpha_i f_i'(z_i(v))}{\tau} \Bigg( A_v^\star \langle w_c, F_v \rangle - \sum_{u \in \Omega'} A_u^\star A_v^\star \langle w_c, F_u \rangle \Bigg)\]

该公式使得临床医生无需依赖外部 Grad-CAM 等启发式事后解释工具,便可直接从数学层面精确量化“哪一个具体的显微病理特征、位于图像的哪个坐标、以多大的确定性促成了当前病理分级的诊断决策”。

损失函数 / 训练策略

模型训练采用完全标准的多分类交叉熵损失 \(\mathcal{L}_{\mathrm{cls}}(y, t)\),不需要辅助分割分支或复杂的多任务损失函数。在反向传播过程中,由于概念校准参数 \(a_i^+\) 限制在正数域、权重 \(\alpha\) 约束在概率单纯形上,且注意力为前向凸子问题的解析解,梯度能够沿着概念-注意力-Logit 的显式链路稳定传递。优化器采用 SGD(动量 0.9,权重衰减 \(5 \times 10^{-4}\),批大小 16),初始学习率为 0.004 并配合余弦退火策略,在从头训练(from scratch)的 300 个 epoch 内快速稳定收敛。

实验关键数据

主实验

在三个权威公开宫颈细胞学数据集上,采用统一的 5 折交叉验证(从头训练 protocol),GeoCEAN 与通用模型、轻量化网络、医学专用架构、宫颈特定 SOTA 及白盒模型进行了全面对比。下表列出 DSCC 数据集(表 1)的主实验数据:

模型分类 代表模型 准确率 ACC (%) F1-score (%) AUC (%) 参数量 (M) 计算量 (GFLOPs) 延迟 (ms)
(a) 通用骨干 ConvNeXtV2-T (CVPR'23) 84.7 ± 0.6 82.6 ± 1.0 94.6 ± 0.2 49.6 8.7 11.6
(a) 通用骨干 InceptionNeXt-S (CVPR'24) 86.7 ± 0.5 85.0 ± 0.5 96.1 ± 0.3 47.1 8.4 11.0
(b) 轻量网络 MobileNetV4 (ECCV'24) 85.2 ± 1.5 83.4 ± 1.9 94.1 ± 1.0 2.5 0.2 4.2
(b) 轻量网络 SHViT-S1 (CVPR'24) 88.5 ± 1.6 87.0 ± 1.7 96.0 ± 1.4 6.0 0.2 8.8
(c) 医学专用 MedViT (CIBM'23) 87.2 ± 2.3 85.7 ± 2.6 95.7 ± 1.4 31.2 5.9 17.4
(c) 医学专用 MedMamba (arXiv'24) 86.3 ± 0.8 84.6 ± 1.0 94.3 ± 0.7 14.0 2.0 10.1
(d) 宫颈专科 MSCCNet (BIBM'23) 87.8 ± 1.2 86.1 ± 1.1 95.2 ± 0.4 18.7 3.7 4.7
(d) 宫颈专科 Swin-GMRS (J-BHI'25) 89.5 ± 2.1 91.3 ± 1.8 96.9 ± 1.0 100.8 8.8 60.0
(e) 结构白盒 CRATE (JMLR'24) 84.6 ± 0.5 82.4 ± 0.7 94.5 ± 0.3 15.6 2.9 5.0
(e) 结构白盒 BDD Net (TIM'25) 81.5 ± 0.4 78.8 ± 0.4 92.5 ± 0.2 2.6 1.9 0.2
本文 GeoCEAN (Ours) 93.2 ± 0.2 92.6 ± 0.2 98.7 ± 0.1 2.2 0.4 5.4

在 Herlev 与 SIPaKMeD 两个基准上(表 2),GeoCEAN 同样表现出优异的跨域稳定性:在 Herlev 上达到 76.8 ± 2.4% ACC(大幅超越 Swin-GMRS 的 73.5% 与 MedMamba 的 73.5%);在 SIPaKMeD 上达到 98.5 ± 0.5% ACC 与 99.9% AUC(高于 Swin-GMRS 的 98.3%)。

消融实验

在 SIPaKMeD 数据集上对骨干架构阶段数、注意力下采样步长、凸残差步长及核心概念模块进行严格消融(表 6):

设定维度 实验变量/配置 ACC (%) F1-score (%) AUC (%) 说明分析
骨干阶段数 (Stages) 1 stage 82.4 ± 0.6 82.1 ± 0.5 96.3 ± 0.1 浅层几何表示能力不足
骨干阶段数 (Stages) 3 stages 96.5 ± 0.8 96.6 ± 0.7 98.9 ± 0.3 随着感受野扩大逐步提升
骨干阶段数 (Stages) 4 stages (默认基准) 98.5 ± 0.5 98.5 ± 0.4 99.9 ± 0.0 4 阶段达到性能饱和巅峰
骨干阶段数 (Stages) 5 stages 97.1 ± 0.8 97.0 ± 0.7 98.7 ± 0.3 过度下采样导致细节损失
注意力下采样步长 stride 4 25.8 ± 0.6 15.3 ± 0.5 83.6 ± 0.1 步长过密导致缺乏全局上下文与聚类坍缩
注意力下采样步长 stride 16 97.0 ± 0.8 97.0 ± 0.7 99.0 ± 0.3 局部上下文开始充足
注意力下采样步长 stride 32 (默认) 98.5 ± 0.5 98.5 ± 0.4 99.9 ± 0.0 最优分辨率网格平衡
凸残差更新步长 \(\gamma\) \(\gamma = 0.2\) 97.8 ± 0.6 97.7 ± 0.5 99.4 ± 0.1 更新偏慢但稳定
凸残差更新步长 \(\gamma\) \(\gamma = 0.5\) (默认) 98.5 ± 0.5 98.5 ± 0.4 99.9 ± 0.0 兼具更新动态性与收敛压缩性
凸残差更新步长 \(\gamma\) \(\gamma = 0.8\) 97.0 ± 0.7 97.0 ± 0.6 99.1 ± 0.2 步长过大导致振荡
概念与约束消融 w/o 非负单调约束 95.9 ± 0.7 95.6 ± 0.8 98.7 ± 0.4 允许负权引起特征逆序,显著掉点
概念与约束消融 w/o 核浆比 (N/C) 95.3 ± 0.8 94.9 ± 0.9 98.3 ± 0.5 掉点最多(-3.2%),核浆比是病理黄金指标
概念与约束消融 w/o 核膜粗糙度 96.4 ± 0.6 96.2 ± 0.7 98.9 ± 0.3 核膜病理边缘特征至关重要
概念与约束消融 w/o 上皮排列紊乱 96.9 ± 0.5 96.7 ± 0.6 99.1 ± 0.3 方向一致性损失降低细胞群判别力
概念与约束消融 w/o 染色质粗糙度 97.8 ± 0.3 97.6 ± 0.4 99.5 ± 0.2 细微核内颗粒纹理贡献稳定增益

关键发现

  • 病理概念的贡献层级清晰:在四大显微形态概念中,去掉核浆比(w/o N/C ratio)使准确率直接从 98.5% 跌至 95.3%(跌幅高达 3.2%),证明核质比是宫颈异常病变判定的决定性生物学标志;去掉非负单调约束后准确率下降 2.6%,表明防止概念到势场的符号反转与逆序对抗对于建立可信注意力至关重要。
  • 注意力网格步长呈现严苛敏感性:过细的网格(如 stride 4 仅 25.8% ACC、stride 8 仅 46.2% ACC)会导致注意力和特征读出彻底失效。这是因为单细胞尺度较小,极其精细的注意力网格无法提供足够的细胞级感受野支撑,使得 softmax 能量积分发生局部奇点崩溃;而在 \(1/32\) 下采样步长下,注意力获得了恰当的单细胞整体语义视场。
  • 卓越的零样本跨域迁移能力:在 DSCC 训练直接迁移到 Herlev 的无监督测试中(表 4),GeoCEAN 获得了 74.0 ± 3.8% ACC,显著超越了专科 SOTA Swin-GMRS(70.2%)和 RES_DCGAN(59.8%),证明将空间注意力锚定于领域不变量(几何与病理势场)能有效抵抗实验室间的染色与仪器漂移。

亮点与洞察

  • 将临床初筛流程严格形式化为自由能极小化闭式解:巧妙地将病理技师寻找病灶的过程映射为负能量势阱的搜索,推导出的闭式解不仅省去了海量的黑盒注意力权重,还将注意力权重视为严密的概率分配,数学优美且计算高效。
  • 微分几何算子与非负带限混合的深度协同:通过直接将一阶梯度与二阶拉普拉斯算子固化在骨干卷积中,配合近对角约束,强制深层神经元只能沿着特定几何特征演化,从结构上杜绝了深层特征图变成无法解释的“高维噪点”。
  • 完全内生的概念到预测闭式可微归因链:摆脱了后验解释器(Post-hoc CAM)计算与前向推理割裂的弊端,推导出的解析偏导数直接回答了临床医生关心的“具体何种形态改变促成了分类决定”,对严肃医疗 AI 的合规落地具有重大借鉴价值。

局限与展望

  • 依赖初步形态学分割与阈值处理的鲁棒性:四大病理特征的提取依赖 Otsu 阈值与形态学核掩模生成,在 DSCC 等低对比度或杂质严重的图像上,核膜粗糙度的符号单调一致性仅有 0.425,表明当输入切片存在重度杂质干扰时,前端传统图像学算法可能构成系统瓶颈。
  • 缺乏大规模全切片(WSI)临床多中心前瞻性盲测:目前实验均在剪切好的单细胞图像基准(DSCC、SIPaKMeD、Herlev)上展开,尚未扩展至包含数十万细胞的完整千兆像素级宫颈液基细胞学切片(WSI)。
  • 未来改进方向:可进一步引入可微分的轻量化端到端先验提取模块,并结合病理学专家交互界面,将该白盒架构扩展至 WSI 级弱监督宫颈癌大面积自动化筛查。

相关工作与启发

  • vs 通用与医学视觉骨干(ConvNeXtV2 / MedViT / MedMamba):通用架构依赖大规模参数拟合复杂纹理,缺乏医学显式先验,跨数据集测试极易受染色批次效应干扰导致崩塌;GeoCEAN 借助先验几何势场导航,以 2.2M 参数大幅击败 30M~100M 级的庞大网络。
  • vs 宫颈细胞专用模型(Swin-GMRS / MSCCNet):现有专科模型大多靠多任务损失或复杂的胶囊网络、生成对抗增强来硬拼指标,参数量超 100M 且完全依赖事后 Grad-CAM 解释,热力图常扩散到胞浆;GeoCEAN 闭式注意力与前向决策完全绑定,决策归因具有像素级确定性。
  • vs 通用白盒网络(CRATE / BDD Net):CRATE 等模型虽然通过稀疏率缩减推导编码器,但其数学约束是通用的信号处理先验,未融入医学特定形态学先验;GeoCEAN 将白盒设计推进到了领域特定原生语义(核膜、核浆比等)的深度融合。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次将自由能分配闭式注意力与几何驱动解析骨干融入宫颈细胞学,设计极其新颖严密。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 3 个基准数据集、5 组对照模型族、跨数据集零样本迁移与形态扰动消融,实验扎实全面。
  • 写作质量: ⭐⭐⭐⭐⭐ 数学推导严密规范,问题提出与临床流程高度契合,逻辑推演极其流畅。
  • 价值: ⭐⭐⭐⭐⭐ 在极轻量(2.2M)的前提下兼顾 SOTA 精度与内生结构可解释性,是高可信医疗 AI 的典范工作。