跳转至

Y-diff: Structure-Texture Decoupled Diffusion Distillation for H&E-to-pCLE Translation

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/Hdw2agon/Y_diff
领域: 医学图像
关键词: pCLE / 无配对图像转换 / 结构纹理解耦 / 流匹配 / 知识蒸馏

一句话总结

Y-diff 用 DiffAE 语义编码与流匹配迁移 pCLE 纹理,用灰度结构约束和教师蒸馏保留 H&E 细胞形态,在小规模无像素配对数据上改善合成质量,并将下游细胞计数 MAPE 从 55.77% 降至 13.84%。

研究背景与动机

探头式共聚焦激光显微内镜(pCLE)能够在活体组织上获取细胞级影像,但采集与标注成本高,图像常有低对比度和模糊边界。相比之下,H&E 染色切片与细胞标注更容易获得。如果能把这些切片转换成具有 pCLE 外观的图像,同时保留原来的细胞位置和轮廓,就能沿用源域标签,为稀缺模态补充训练数据。

困难不只是把彩色图变成另一种色调。离体切片与活体内镜之间缺少可靠的逐像素对应,传统循环一致性、局部对比约束或针对弱配对虚拟染色设计的方法,可能在学习目标外观时改变细胞拓扑。直接在像素空间同时拟合组织结构和光学纹理,尤其容易把源域形态差异当作需要转换的内容。

核心 idea:先在全局语义空间学习“目标模态应有什么纹理”,再在源图像的空间约束下学习“如何把这种纹理画出来”,用冻结教师提供稳定的生成监督,而不是让同一个无配对映射同时承担两件事。

方法详解

整体框架

输入是一张 H&E 图像,输出是保留其细胞布局的伪 pCLE 图像。训练时还需要真实 pCLE 图像,但不要求它与输入逐像素配对。系统利用预训练 DiffAE 分出全局语义编码与扩散中间状态:语义路径负责目标纹理,源图像灰度特征与中间状态负责空间保留,学生去噪器将二者重新结合。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["H&E 输入"] --> B["语义纹理迁移<br/>DiffAE 与流匹配"]
    A --> C["时间条件结构约束<br/>灰度 SPNet"]
    A --> X["源图扩散中间状态"]
    B --> D["冻结教师蒸馏<br/>学生去噪器"]
    C --> D
    X --> D
    T["教师与真实 pCLE 语义"] -.->|仅训练:伪真值| D
    D --> O["伪 pCLE 图像"]
    R["真实 pCLE 图像"] -.-> E["目标域对抗监督"]
    O -.-> E
    E -.->|仅训练:优化学生| D

图中的教师和判别器仅用于训练。部署时保留语义编码、流匹配、源结构引导与学生采样,不需要一张真实 pCLE 图像作为参考。这里的“解耦”是通过信息路径和监督方式促成的建模偏置,并不是已证明两个潜变量完全统计独立。

关键设计

1. 语义纹理迁移:在压缩编码中学习模态转换

DiffAE 的语义编码器把图像压成全局编码,用于条件化 DDIM 去噪。作者先做替换实验:保留源 H&E 的扩散中间状态,仅换入 pCLE 的语义编码,就能明显改变生成外观。这支持语义编码携带颜色与光学纹理信息,但不能据此说它完全不包含结构或病理语义。

真正推理时没有目标图像提供这种编码,因此作者另训流匹配网络,将 H&E 语义分布搬运到 pCLE 语义分布。训练批次内先做最优传输配对,再在线性插值路径上拟合“目标编码减源编码”的速度;推理使用 Dopri5 求解对应 ODE,将源编码确定性地送到目标域。这里的批内配对是潜空间训练机制,不是临床上获得了真实组织配对,也不构成全局最优运输或无模式崩塌的保证。

2. 时间条件结构约束:让源灰度形态进入每一步去噪

仅改变语义条件仍可能造成结构漂移。SPNet 因而先将输入 H&E 转为灰度,减弱染色颜色对结构分支的影响,再用逐像素 MLP 提取结构特征。时间步嵌入通过 FiLM 调制各隐藏层,使同一源图像在不同去噪阶段提供不同强度的引导。

这种特征用于显式调制源域扩散状态,使学生在追随目标纹理时仍受到源位置布局的约束。逐像素操作本身不是细胞分割器,也不会单独推理邻域拓扑;结构保留来自该局部引导、源中间状态和去噪网络的共同作用。正文式 (6) 的运算符在缓存中缺失,虽然文字提到 sigmoid 与调制权重,本笔记不补造精确的相加或相乘形式。

3. 冻结教师蒸馏:把理想目标条件转为学生可学的监督

教师先在真实 pCLE 语义条件与 SPNet 结构约束下学习生成;进入蒸馏阶段后,教师与流匹配模块都冻结。教师使用真实目标域语义产生伪真值,学生使用从 H&E 迁移得到的语义生成图像,随后在像素、感知和语义特征空间对齐二者。

蒸馏分别使用 L1 距离、LPIPS 和 CLIP 特征余弦相似性,让学生不仅模仿像素,也接近教师的整体外观与高层表示。教师的优势来自训练时拥有真实目标语义,所以去掉学生、直接使用该语义的配置是 oracle 参考,而不是部署时可公平比较的替代方案。无像素配对条件下教师样本如何逐一绑定源结构,主文交代不够完整,复现仍需补充材料或代码。

4. 目标域对抗监督:补足伪真值对真实分布的约束

即使学生成功模仿教师,教师伪真值也不等于真实目标图像。作者因此加入判别器区分真实 pCLE 与学生输出,用目标域对抗监督促进外观分布接近。它与蒸馏监督分工不同:前者观察真实目标域,后者提供较稳定的样本级学习信号。

论文用 KL 散度为零描述理想的分布对齐目标,但实际训练判别器并不证明达到了该等式。相应消融也显示,去掉判别器后的结构与纹理指标下降,但收益大小仍取决于评估指标;不能将对抗监督解释为临床真实性或零幻觉的保证。

损失函数 / 训练策略

训练分两个阶段:先准备 oracle 教师并训练语义流匹配,再冻结二者训练学生。学生目标由蒸馏与对抗两部分加权组成;蒸馏内部又包含 L1、LPIPS 和 CLIP 项。原文若干总损失公式损坏,教师完整损失及详细超参数放在未提供的补充材料,本笔记只记录主文可确认的组成,不复原作者精确公式。

实验在单张 RTX PRO6000 上使用 Adam;教师训练 30 个 epoch,学生 10 个 epoch,均从预训练 DiffAE 初始化。扩散总时间步为 1,000,采样设置原为 50 步,截断比例 0.5,使前向和反向各执行 25 步。语义 ODE 的一次积分调用仍可能包含多次向量场计算,不能将其当作一次网络前向或将蒸馏误读为单步图像生成。

输入和输出均为 256×256。作者没有给出主文级的端到端延迟或高分辨率扩展验证,因此该方法的目标是生成质量与结构保持,而不是已经实现实时高分辨率内镜转换。

实验关键数据

主实验

CCD 包含结肠组织的 296 张离体 H&E 图像和 296 帧活体 pCLE;每模态划分为 240 张训练、56 张测试。它们只在大致解剖区域上相关,不存在像素级对应。SS 衡量结构相似性,LC 衡量亮度和对比度,Hist 衡量直方图相关性,LPIPS 衡量感知距离;主文未完整给出这些无配对指标的参考图选择和计算定义,复现时不能默认等同标准配对图像质量评测。

下表摘录 Table 1(a),数值保持原表精度;CycleGAN-T 指 CycleGAN-Turbo。

方法 SS ↑ LC ↑ Hist ↑ LPIPS ↓
CycleGAN 0.614 0.908 0.731 0.511
PPT 0.217 0.925 0.854 0.907
D-VST 0.103 0.953 0.853 0.811
UNSB 0.488 0.920 0.798 0.655
CycleGAN-T 0.316 0.887 0.672 0.777
Y-diff 0.689 0.939 0.868 0.495

Y-diff 在 SS、Hist 和 LPIPS 上领先,但 LC 低于 D-VST。这也说明仅贴近亮度和对比度,不足以说明细胞结构保留良好。弱配对 MIST ER-004 另用 4,000/1,000 张训练/测试样本验证;其任务与 CCD 不同,不应混成同一无配对临床数据结论。

消融实验

下表来自 Table 2,采用更高精度。oracle 行使用真实 pCLE 语义,不属于正常推理输入条件。

配置 SS ↑ LC ↑ Hist ↑ LPIPS ↓
无流匹配 0.5397 0.9339 0.8646 0.4810
无 SPNet 0.6090 0.9092 0.7814 0.4915
无判别器 0.6039 0.9199 0.7802 0.4992
完整学生 0.6892 0.9387 0.8684 0.4948
无学生,oracle 0.7015 0.9664 0.8807 0.4460

去掉流匹配使 SS 下降 0.1495,是这组模块消融中最大的结构退化;去掉 SPNet 也明显损伤 SS 与 Hist。不过无流匹配、无 SPNet 的 LPIPS 均略优于完整学生,说明完整模型没有在所有指标上支配所有消融。oracle 更好支持改善语义迁移仍有空间,但不是对任意生成模型的理论上界证明。

关键发现

下表来自 Table 3。下游采用 65 张专家标注 CCD 图像,按大致解剖位置固定划分为 35 张训练、30 张测试;使用 132 张 NuInsSeg H&E 样本生成伪 pCLE 并沿用细胞标签,增强 U-Net 的训练。

增强方式 MAE ↓ RMSE ↓ MAPE (%) ↓
不使用伪 pCLE 83.29 103.29 55.77
CycleGAN 伪 pCLE 63.71 73.17 30.86
Y-diff 伪 pCLE 28.43 34.30 13.84
  • MAPE 相对不使用伪 pCLE 下降 41.93 个百分点,支持该小样本设置下的增强价值;这不是诊断准确率提高 41.93%。
  • 三位病理专家对 30 对生成图像盲评,关注纹理真实性和形态保真。图注报告 Welch 检验 p<0.05,但缓存没有清晰的 MOS 数值,不能补造评分表。
  • MIST 中 Y-diff 的 A-PSNR 为 13.9396,低于 SynDiff 的 14.1787;跨任务效果也不能概括为所有指标全面最好。

亮点与洞察

  • 把训练时特权信息与部署输入分开。 教师能访问真实目标语义,学生学习的是用源图可获得的迁移语义接近该效果;这比直接把 oracle 结果当可部署性能更清楚。
  • 源标签可用性是关键价值。 合成图像不是只为视觉展示,而是希望保留细胞标注以支持下游训练。因此结构指标与计数验证比单独展示纹理更重要。
  • 消融揭示多目标折中。 更好的 LPIPS 并不必然对应更好的 SS,说明选择模型时应同时考察结构、外观及真正下游任务。

局限与展望

  • 临床范围很窄。 CCD 规模小,主要来自结肠;下游仅 30 张测试图像,主文未完整交代患者级拆分,不能据此推断跨医院、跨患者或疾病诊断收益。
  • 结构先验并非绝对保护。 灰度 SPNet 与蒸馏能够降低形态漂移,但不证明所有细胞拓扑不变;合成标签沿用仍需要细胞级错误审计。
  • 复现信息有缺口。 无配对指标参考协议、教师损失、蒸馏配对方式和部分权重需要补充材料;缓存中的损坏公式不宜猜补。
  • 效率与分辨率受限。 多步 DDIM 采样比 GAN 路径慢,目前为 256×256,未来可研究潜空间扩散和成像物理约束,但这些不是当前已验证能力。

相关工作与启发

  • DiffAE 与流匹配: 前者提供语义条件和可重建的扩散表示,后者在语义空间建模模态迁移;不能把潜空间运输等同于获得真实组织配对。
  • CycleGAN、UNSB 与 D-VST: 这些方法代表循环、扩散桥与虚拟染色路线。本文强调结构与纹理的分路监督,但比较限于给定数据、适配和训练协议。
  • 研究线索: 可把沿用的细胞标签与合成后专家标注逐对象匹配,分别测量细胞新增、消失和轮廓漂移,再判断计数改善是否掩盖局部结构错误;这是后续验证方向,不是论文已做实验。

评分

  • 新颖性: 4/5 — 将语义流匹配、空间约束和教师蒸馏组合用于困难的无配对 pCLE 转换。
  • 实验充分度: 3/5 — 有主结果、模块消融和下游验证,但临床样本与复现协议仍有限。
  • 写作质量: 3/5 — 双路径动机清楚,部分强结论及训练细节需要更精确说明。
  • 价值: 4/5 — 为稀缺内镜数据增强提供可行路线,但尚不能替代临床真实性验证。