跳转至

PyraE2E: Enhancing End-to-End WSI Analysis via Cross-Scale Super-Resolution

会议: ECCV 2026
论文: ECCV 原文
领域: 医学图像
关键词: 全切片图像、端到端学习、超分辨率、多示例学习、跨尺度自监督

一句话总结

针对全切片病理图像(WSI)端到端训练受算力约束被迫采用低倍率小瓦片及随机采样导致形态细节丢失与监督稀疏的问题,PyraE2E 利用 WSI 内在的多分辨率金字塔结构,以空间对齐的高倍率瓦片构建跨尺度超分辨率重建辅助任务,配合嵌入式聚类评分采样与轻量化全局-局部解耦编码器,在保持低计算成本的同时显著提升了端到端病理表征质量与分类性能。

研究背景与动机

全切片病理图像(WSI)具有吉像素级别的超大尺寸,但在弱监督临床学习场景中通常仅提供单一的切片级诊断标签。主流的两阶段多示例学习(MIL)范式采用在自然图像(如 ImageNet)上预训练的冻结特征提取器离线抽取瓦片嵌入,再由 MIL 聚合器汇聚为切片级预测。然而,自然图像与病理组织形态之间存在巨大的领域鸿沟,冻结的离线特征难以自适应下游病理任务,成为制约模型性能进一步提升的结构性瓶颈。端到端学习通过将特征提取网络与切片级分类器联合优化,理论上能够让骨干网络直接吸收病理任务反馈、大幅缩减领域鸿沟,但在吉像素尺度下对整张切片进行端到端反向传播面临着严苛的显存与计算约束。

为将端到端反向传播控制在可行的显存预算内,现有端到端方案普遍采取妥协策略:一是被迫输入低放大倍率(如 5×)的小尺寸瓦片,并借助纯随机采样挑选少量瓦片输入网络;二是仅依赖极度稀疏的切片级标签通过长链路反向传播回传梯度。低倍率瓦片不仅严重模糊了细胞核内部结构等高频微观形态,还会压缩连续的组织结构单位(如腺体形态、肿瘤边界及间质浸润),而盲目随机采样又极易漏掉关键的局灶性病变组织。尽管自监督对比学习或蒸馏被尝试引入作为辅助目标,但它们往往停留在实例级或特征级的粗粒度约束;基于掩码图像重建的自监督虽具备像素级细粒度,但在整张 WSI 尺度下计算开销过大,依然难以直接嵌入全端到端训练闭环。

针对上述两难困境,病理全切片图像原生具备的多分辨率金字塔数据格式提供了全新的切入突破口:低放大倍率瓦片输入成本低廉但丢失微观形态,而与其在物理空间精确对齐的高倍率瓦片完整保留了亚细胞级别特征。与其承担直接编码高倍率图像的高昂计算代价,不如让网络以低倍率瓦片作为唯一输入,利用金字塔中天然对齐的高倍率图像作为重建监督目标。核心 idea:将 WSI 原生跨尺度金字塔重塑为像素与频域协同的超分辨率密集自监督信号,配合探索与利用兼顾的在线聚类评分采样及轻量化全局-局部解耦编码器,在保持低倍率输入计算开销的前提下引导表征捕获高倍率微观形态。

方法详解

整体框架

PyraE2E 的核心思想是在整个训练与推理阶段始终仅以低计算开销的低放大倍率(5×)瓦片作为输入,而将高倍率(20×)瓦片仅作为训练期的重建监督目标,从根本上兼顾了计算可控性与高分辨率形态感知。整体流程形成在线闭环:首先,嵌入式聚类评分采样模块(Cluster-Score Sampling)从整张 WSI 的低倍率金字塔层中筛选出代表性与高信息量兼备的瓦片子集;随后,轻量化全局-局部解耦编码器(GLP Encoder)对低倍率瓦片提取兼顾全局组织上下文与局部纹理的特征;提取得到的共享特征图被分流至双任务分支——超分辨率重建分支在像素域与傅里叶频域双重监督下重建对应空间区域的高倍率图像,而切片预测分支经空间注意力池化后输入 MIL 聚合网络生成切片级诊断预测,并将注意力分布与实例特征动态回传给采样模块刷新状态。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入:低倍率 WSI 金字塔层 (5×)"] --> B["嵌入式聚类评分采样<br/>探索与利用动态平衡分配配额"]
    B --> C["全局-局部解耦编码器 (GLP)<br/>通道划分与多尺度特征融合"]
    C --> D["跨尺度超分辨率分支<br/>PixelShuffle 重建对齐 20× 瓦片"]
    C --> E["切片级预测分支<br/>注意力池化与 MIL 聚合分类"]
    D --> F["空间 L1 损失 + 2D-FFT 频域损失"]
    E --> G["切片交叉熵损失 + 簇间 KL 正则"]
    E -.->|回传注意力评分与实例特征| B

关键设计

1. 嵌入式聚类评分采样:兼顾病变覆盖度与形态多样性的闭环瓦片选择机制

单纯依赖注意力的启发式采样极易陷入自强化的确认偏差,导致采样集迅速塌缩至少数极高分局部而丧失组织多样性;而纯随机采样又极度低效,在微小病变切片中大概率采到无诊断意义的正常组织或背景。为此,本文设计了无需外部繁重预处理的嵌入式采样模块,将多臂老虎机的“探索(Exploration)”与“利用(Exploitation)”机制深度整合至端到端训练流中。对于每张切片设定的单轮采样预算 \(K\),模块将其显式划分为未见集合 \(U\) 上的均匀随机探索配额 \(K_e\) 和已见集合 \(S\) 上的定向利用配额 \(K_r = K - K_e\)。系统在线动态维护每个实例的四元状态 \((a_i, \mathbf{f}_i, s_i, c_i)\),分别代表注意力分数、实例特征向量、被采样计数以及所属语义聚类类别。网络每隔 \(T_c\) 个 epoch 在累积的实例特征集上自适应执行 \(k\)-means 聚类以更新类别分配。在利用阶段,模块为每个聚类簇综合考量其样本规模 \(n_c\) 与平均注意力 \(\bar{a}_c\),按比例计算簇级配额权重 \(w_c\),并采用最大余数法(Largest-Remainder Method)将 \(K_r\) 配额精准分流至各个聚类簇。在经历前 \(T_w\) 个 epoch 的预热期后,簇内挑选不再随机,而是根据经采样频次惩罚后的综合重要性得分 \(r_i\) 挑选 Top-\(q_c\) 个瓦片:

\[r_i = \text{Norm}(a_i) \cdot \frac{1}{\sqrt{s_i + 1}}\]

该公式巧妙地在重视高注意力病变区域的同时,通过采样次数的平方根反比项压制已反复采样的冗余实例,强迫模型挖掘未被充分表征的潜在病理结构。前向传播后得到的最新特征与注意力通过指数移动平均(EMA)平滑更新实例状态,形成了自适应感知切片病变分布的闭环采样网络。

2. 全局-局部解耦编码器:极轻量通道分组与多尺度结构感知

端到端 WSI 训练中,由于反向传播需遍历骨干网络,传统重型注意力网络(如 ViT)的参数与激活显存占用难以承受。本文构建了轻量化的全局-局部解耦(GLP)编码器,由浅层卷积提取基础特征 \(F_0\) 后,级联 \(N=8\) 个相同的特征精炼块。每个块在结构上由全局-局部融合单元(GLFU)与分区空间混合器(PSM)组成,两部分均外包残差连接以确保深层梯度的稳定传递。在 GLFU 内部,通道被一分为二:全局分支先经步长为 \(s\) 的带跨步最大池化降采样以压缩空间并捕获大范围组织学上下文,再由 \(3\times3\) 深度可分离卷积(DWConv)提取低频宏观结构,并通过通道级方差自适应门控生成权重掩码与双线性上采样对全局流进行调制;局部分支则直接在原始分辨率下经过深度倍增的轻量级倒置残差卷积网络,精细提炼细胞轮廓和细微纹理。随后两者沿通道拼接并通过 \(1\times1\) 卷积投射回基准通道数。紧随其后的 PSM 模块仅选取局部通道子集(比例为 \(p\))施加 \(3\times3\) 空间卷积进行跨通道与跨位置交互,剩余的通道则直通保留原始表征,大幅削减了浮点运算量(FLOPs)。该设计在整个编码器仅引入 2M 极低参数量的前提下,兼备了捕捉宏观组织架构和微观病理细节的能力。

3. 跨尺度超分辨率辅助自监督:像素与频域协同的高倍率形态引导

为了使低倍率输入的骨干网络能够真正学习到高倍率下蕴含的亚细胞和微观组织学形态,PyraE2E 充分利用了 WSI 存储格式的天然层级金字塔。低放大倍率(5×)下的单个瓦片在物理空间上严格对应着高放大倍率(20×)下的一整组高分辨率瓦片区域。编码器最后一层输出与浅层直通特征求和得到融合特征图 \(\mathbf{z} = F_0 + F_N\),该特征被输入至由 \(3\times3\) 卷积与 PixelShuffle 层组成的超分辨率重建头,将特征在空间维度上重排放大 4 倍(即从 \(512\times512\) 上采样至 \(2048\times2048\)),生成重建的伪高分辨率图像 \(\hat{\mathbf{x}}^{\text{SR}}\)。为防止常规像素级 \(L_1\) 损失引发边缘过度平滑、掩盖关键染色颗粒感与核质细节的缺陷,模型同时在二维离散傅里叶变换(2D-FFT)频域空间构建强约束:

\[\mathcal{L}_{\text{PIX}} = \|\hat{\mathbf{x}}^{\text{SR}} - \mathbf{x}^{\text{HR}}\|_1, \quad \mathcal{L}_{\text{FFT}} = \|\mathcal{F}(\hat{\mathbf{x}}^{\text{SR}}) - \mathcal{F}(\mathbf{x}^{\text{HR}})\|_1\]

频域损失显式度量全频段尤其是高频分量的频谱差异,强迫低倍率编码器必须在其隐空间中编码高倍率图像特有的细胞核异型性、染色质颗粒分布及腺体边界的高频形态信息。值得强调的是,配对的高倍率切片仅在训练期作为重建目标参与反向传播,测试推理期完全不需要读取或加载任何高倍率数据,零额外开销地实现了高质量跨尺度表征迁移。

损失函数 / 训练策略

整个端到端网络通过联合多任务目标函数实现端到端梯度回传与参数同步更新:

\[\mathcal{L}_{\text{total}} = \alpha \mathcal{L}_{\text{PIX}} + \beta \mathcal{L}_{\text{FFT}} + \gamma \mathcal{L}_{\text{CE}} + \delta \mathcal{L}_{\text{KLD}}\]

其中 \(\mathcal{L}_{\text{CE}}\) 为切片级真实标签的交叉熵分类损失;\(\mathcal{L}_{\text{KLD}}\) 为簇内注意力 KL 散度正则项,其惩罚同一语义簇内注意力高度集中于极个别瓦片的倾向,促使切片级注意力权重在同类组织内部相对平滑分布,防止模型陷入注意力塌缩。实验采用默认超参数组合 \((\alpha, \beta, \gamma, \delta) = (1.0, 0.05, 0.5, 0.5)\)。每个 WSI 单轮采样 \(K=160\) 个低倍率(5×)瓦片,预热轮数 \(T_w=30\),聚类刷新周期 \(T_c=10\)。聚类簇数依据已见样本规模在 \(\{2, 4, 6, 8\}\) 中自适应选择。

实验关键数据

主实验

论文在三个经典的公开癌症 WSI 诊断数据集(TCGA-RCC 肾癌分型、TCGA-NSCLC 肺癌分型、TCGA-BRCA 乳腺癌分型)上开展了系统评测,对比涵盖传统两阶段离线特征提取算法、自监督方法、病理大模型基线以及端到端训练方法。

编码器架构 方法范式 端到端 (E2E) TCGA-RCC ACC (%) TCGA-RCC AUC (%) TCGA-NSCLC ACC (%) TCGA-NSCLC AUC (%) TCGA-BRCA ACC (%) TCGA-BRCA AUC (%)
ResNet ABMIL 89.1 ± 0.7 98.4 ± 0.4 88.3 ± 2.1 95.8 ± 1.4 88.9 ± 1.5 92.0 ± 3.3
ResNet CLAM 90.5 ± 0.9 98.7 ± 0.1 89.9 ± 2.1 95.5 ± 2.2 88.7 ± 1.2 93.5 ± 1.7
ResNet TransMIL 90.2 ± 0.9 97.9 ± 0.5 85.7 ± 1.9 93.7 ± 1.3 87.9 ± 1.8 91.9 ± 0.8
ResNet 2D Mamba 90.6 ± 1.5 98.3 ± 0.9 89.6 ± 1.7 96.2 ± 1.3 90.1 ± 1.7 94.0 ± 1.4
ResNet SimCLR-X 90.2 ± 1.7 97.7 ± 0.3 90.1 ± 2.2 96.7 ± 1.3 89.2 ± 2.3 92.9 ± 1.6
ResNet C2C 90.3 ± 0.7 98.0 ± 0.2 88.8 ± 1.7 94.8 ± 1.1 88.0 ± 1.9 88.6 ± 0.8
ResNet Streaming 90.2 ± 1.1 97.9 ± 0.2 90.2 ± 1.1 96.2 ± 0.4 88.0 ± 1.1 88.0 ± 2.9
ResNet ABMILX (E2E) 91.3 ± 1.3 98.1 ± 0.1 90.2 ± 1.0 96.3 ± 0.3 87.0 ± 3.9 90.1 ± 4.5
UNI (FM) ABMILX 91.5 ± 0.9 99.0 ± 0.2 90.1 ± 2.6 96.1 ± 2.1 93.2 ± 0.8 95.1 ± 0.5
CONCH (FM) ABMILX 92.8 ± 0.6 99.3 ± 0.3 91.8 ± 1.0 97.0 ± 0.6 92.0 ± 0.3 94.7 ± 0.9
GLP (Ours) PyraE2E-L 90.6 ± 2.0 97.8 ± 0.6 91.4 ± 0.8 97.5 ± 0.7 90.0 ± 0.7 92.5 ± 1.0
GLP (Ours) PyraE2E-X 93.1 ± 1.2 98.3 ± 0.2 92.0 ± 1.4 97.6 ± 0.4 90.5 ± 1.3 93.5 ± 0.7

消融实验

在 TCGA-NSCLC 数据集上使用 ABMILX 聚合器对采样机制组件与各项损失项的敏感性进行了细致解耦分析:

实验模块 / 变体 聚类指导 (Cluster) 注意力指导 (Attn.) 嵌入式闭环 (Emb.) 损失权重 \((\alpha, \beta, \gamma, \delta)\) ACC (%) AUC (%) 相比随机单轮增加时间 (Time)
纯随机采样基准 \((1.0, 0.05, 0.5, 0.5)\) 89.9 ± 0.8 96.3 ± 1.3 0.0 m
仅嵌入聚类 \((1.0, 0.05, 0.5, 0.5)\) 90.7 ± 0.9 97.0 ± 0.7 +3.3 m
外挂聚类策略 (C2C式) \((1.0, 0.05, 0.5, 0.5)\) 90.5 ± 0.7 96.9 ± 0.4 +8.1 m
外挂注意力策略 (CDSR式) \((1.0, 0.05, 0.5, 0.5)\) 91.1 ± 1.0 97.1 ± 0.6 +9.6 m
完整采样模块 (Default) \((1.0, 0.05, 0.5, 0.5)\) 92.0 ± 1.4 97.6 ± 0.4 +4.2 m
弱超分权重 (\(0.5\times \text{SR}\)) \((0.5, 0.025, 0.5, 0.5)\) 91.2 ± 1.3 97.2 ± 0.6 -
强超分权重 (\(2\times \text{SR}\)) \((2.0, 0.10, 0.5, 0.5)\) 91.8 ± 1.2 97.5 ± 0.4 -
去除频域损失 (w/o FFT) \((1.0, 0.0, 0.5, 0.5)\) 86.2 ± 1.8 93.6 ± 0.9 -
去除注意正则 (w/o KLD) \((1.0, 0.05, 0.5, 0.0)\) 90.5 ± 1.4 96.2 ± 0.6 -

此外,在模型计算开销与运行效率对比中(单张 NVIDIA A800 GPU 测算),PyraE2E 展现出极高性价比:其参数量仅为 2M(相比 UNI 的 307M、CONCH 的 90M、ResNet 基线的 21M~28M),推理时间仅 3.1 s/切片(UNI 需 17.0 s/切片,CONCH 需 7.8 s/切片),且训练仅耗时 1.1 天,完全省去了病理大模型数周甚至更长的大规模预训练消耗。在超分辨率质量方面,重建得到的 20× 瓦片在 TCGA-NSCLC 上达到了 \(25.1 \text{ dB}\) PSNR 与 \(0.67\) SSIM,在视觉与定量指标上均忠实复现了真实切片的形态结构。

关键发现

  • 频域重建损失 \(\mathcal{L}_{\text{FFT}}\) 对整体性能起到了决定性支撑作用。一旦移除该项(w/o FFT),分类 ACC 由 92.0% 陡降至 86.2%,AUC 下跌 4.0 个百分点。这证明了常规像素级 \(L_1\) 损失容易陷入高频模糊陷阱,而傅里叶变换约束能够强力驱动骨干网络敏锐捕获细胞染色核颗粒及微观边界特征。
  • 嵌入式聚类与注意力双重采样在效率和精度上全面超越外挂式采样机制。外挂聚类(+8.1m/epoch)和外挂注意力(+9.6m/epoch)引入了繁重外部预计算,而 PyraE2E 闭环内联采样仅需 +4.2m,同时取得了最优的 92.0% ACC,有效验证了在探索中保证覆盖率、在利用中按频次惩罚深入挖掘的策略价值。
  • 针对超分辨率损失权重的鲁棒性测试表明,在 \(0.5\times \sim 2.0\times\) 范围内模型性能均保持高度稳健(AUC 保持在 97.2%~97.6% 之间),说明跨尺度超分任务与切片级分类目标能够实现良性梯度正交共存,并未出现辅助任务反客为主扰乱主分类流的优化负迁移现象。

亮点与洞察

  • 就地取材的零标注跨尺度密集自监督:直接将数字病理全切片图像自带的多层级存储金字塔转变为天然的监督场,无需任何额外的像素级分割或人工标注,巧妙打破了端到端 WSI 学习中仅凭切片级标签反向传播导致的监督信号稀疏困局。
  • 低成本输入换取高阶形态表达的算力杠杆:全流程始终以轻量级的低倍率瓦片输入网络,避免了直接处理高倍率图像面临的组合爆炸式算力与显存消耗,却通过对齐高倍率图像重建的优化驱动,使轻量级编码器(仅 2M 参数)拥有了抗衡数百兆甚至吉级别参数病理基础大模型的诊断辨识力。
  • 探索与利用闭环的防塌缩瓦片采样:将强化学习中的探索-利用思想与病理先验有机融合,借助在线聚类保证组织类型的全景视野,利用访问频次惩罚打破注意力自我强化的局限盲区,为端到端序列学习提供了高质量、高代表性的样本动态供给。

局限与展望

  • 跨倍率配对对扫描对齐质量存在物理依赖:超分辨率像素与频域监督的前提是多倍率金字塔层之间具有严格的空间几何同态性。在少数旧式切片扫描仪或压缩变形严重的数字扫描格式中,层级降采样插值若存在像素空间漂移,可能会给超分辨率重建引入伪影或系统性位置噪声。
  • 多放大层级跃迁空间的进一步探索:本文目前聚焦于 \(5\times \to 20\times\)(4倍上采样)这一最经典跨度。未来工作可进一步探索更大幅度(如 \(2.5\times \to 40\times\) 的 16倍跃迁)或渐进式金字塔连续超分辨率架构,以期在更大感受野的整张玻片级别直接编码组织微环境架构。
  • 泛化至微血管浸润与基因突变预测等细粒度下游:当前评测主要集中在宏观癌症亚型分型任务上。未来值得将该范式推广至对微观亚细胞形态更为敏感的生物标志物量化、预后生存期分析以及基因表达空间分布预测中。

相关工作与启发

  • vs C2C / Streaming (经典端到端 WSI 学习):传统端到端方案多专注于梯度检查点技术或纯切片级弱监督下的工程性内存优化,瓦片采样多为随机或静态离线聚类,且网络只能被动适应低倍率图像的信息损耗;PyraE2E 通过引入主动在线闭环采样以及金字塔超分辨率密集重建,首次从表示学习的根本信息瓶颈上解决了低倍率输入表征退化的问题。
  • vs UNI / CONCH (病理视觉基础大模型):病理大模型依赖数百万计全切片瓦片的大规模离线自监督与多模态对比预训练,参数量动辄达上亿,但适配特定下游任务时常因下游显存制约而退化为冻结离线特征抽取器;PyraE2E 证明了在端到端联合训练框架下,依靠巧妙的跨尺度内部金字塔自监督,一个参数量仅 2M 的极紧凑模型完全可以在下游标准数据集上实现媲美顶级大模型的分类水准。
  • vs CDSR (病理跨域超分辨率方法):已有结合超分辨率的工作大多将超分作为独立的离线预处理增强步骤,或者作为二阶段特征提取的级联工具;PyraE2E 创新性地将超分辨率确立为端到端多任务学习的“自监督副驾驶”,在反向传播中同步淬炼骨干网络,推理时直接剥离超分头,兼得高表达质量与超低推理延迟。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 巧妙利用 WSI 内置金字塔构建跨尺度超分辨率密集自监督,破局端到端病理计算瓶颈的视角极具创造性。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖三大 TCGA 基准数据集、完备的消融对比、计算时延度量以及超分辨率重建保真度评测,论证严密自洽。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑主线极为清晰,图文呼应紧凑,公式推导严谨且不冗余。
  • 价值: ⭐⭐⭐⭐⭐ 为吉像素医学全切片图像端到端模型轻量化训练与高精度落地开辟了极具实用价值的技术路线。