跳转至

Histocomponent-driven Universal Model for Virtual Immunohistochemistry Multiplex Staining via Joint Manifold Evolution

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/DeepMed-Lab-ECNU/HUSE
领域: 医学图像
关键词: 虚拟免疫组化多重染色, 通用扩散模型, 流匹配, 混合专家模型, 联合流形锚定

一句话总结

针对通用虚拟免疫组化多重染色中外部文本提示引发的流形漂移与组织异质性建模缺失难题,HUSE 基于直接像素流匹配框架引入联合流形锚定、组织成分驱动混合专家以及表征冲突门控机制,并首创 mIF 驱动的多标记物生成范式,实现高保真“一对多”虚拟染色。

研究背景与动机

苏木精-伊红(H&E)染色是临床病理学诊断的黄金标准,但在肿瘤微环境解析与精准治疗方案制定中,通常必须联合免疫组织化学(IHC)染色在分子和蛋白表达层面提供关键的辅助诊断证据。然而,传统的物理 IHC 检查不仅消耗极为珍贵且有限的活检组织切片,而且受制于繁琐的多轮染色流程、高昂的试剂与人力成本以及组织淬灭等物理限制。基于深度学习的虚拟染色技术为解决这一瓶颈提供了无损的计算病理路径。早期的虚拟 IHC 研究多采用“一对一”独立转换模式,即针对单一生物标志物训练专用网络;但面对临床日常诊断中数十种常见的候选标记物,反复训练与部署独立模型的计算和维护成本极高,因此发展仅凭单一网络即可精准生成多种标志物的“一对多”通用模型成为学界的前沿焦点。

然而,现有的通用 IHC 虚拟染色模型存在两项本质缺陷。在全局架构层面,主流方法往往将 H&E 图像视作可编辑的普通底图,依赖任务特定的离散文本提示来引导目标标志物的生成。依据流形假设,高维病理图像分布在高度结构化的低维连续流形上,而病理图像具有密集精细的亚细胞形态、异质性细胞核与交错的基质纹理,每一张切片都独一无二,通用文本嵌入与真实的图像流形存在固有的语义鸿沟与几何失配。这种外部干预会将生成轨迹拖拽偏离真实的组织形态约束,引发严重的“流形漂移”与结构模糊问题。在局部特征建模层面,现有通用模型大多使用全图同质化的共享权重参数来强行拟合细胞核、间质基质与细胞质等截然不同的异质性组织成分,抹杀了特异性分子的空间分布差异;而少部分为每个标志物挂载独立解码器的多头架构本质上仍是多任务学习,随着标志物数量增长,参数量与算力开销急剧膨胀,完全丧失了可扩展性。

与此同时,通用模型的训练严重依赖大规模、高精度像素级对齐的 H&E 与多重标记数据矩阵,但公开临床数据集中普遍缺乏共定位的一对多配对切片。为此,本文摒弃外部文本引导的传统路径,从物理生物基底的一致性切入:H&E 与 IHC 是同一生物组织的互补观测,其底层数据流形本质高度耦合且空间对齐。核心 idea:将 H&E 图像作为持久结构支架在像素流空间中执行联合流形锚定以根除流形漂移,并引入由病理先验初始化的组织成分混合专家与表征冲突门控来精准补偿局部组织异质性,同时首创 mIF 驱动物理调制生成高精度 1(H&E):N(IHC) 训练矩阵。

方法详解

整体框架

HUSE 是一个基于流匹配(Flow Matching)的直接像素预测(x-prediction)通用扩散网络,以单一 H&E 图像为输入,通过条件标号映射精确合成任意指定标志物的高保真 IHC 图像。其输入端将加噪的目标 IHC 状态与未加噪的 H&E 结构支架在通道维度深度拼接,输入到由堆叠 Transformer 块组成的主干中,在保持微观拓扑的同时由标志物索引 token 进行引导;每个模块内部通过组织成分驱动的路由与专家网络,针对不同生物组织进行细粒度表征补偿与冲突纠正。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入:H&E 切片 x 与噪声状态 z_t"] --> B["联合流形锚定<br/>通道拼接作为结构持久支架"]
    B --> C["标志物类别嵌入<br/>索引映射为可学习条件 Token"]
    C --> D["组织成分驱动混合专家<br/>CLIP 原型指导路由分发至核/基质/胞浆专家"]
    D --> E["表征冲突门控<br/>动态监控共享特征位移并残差补偿"]
    E --> F["输出:特定标志物的高保真虚拟 IHC 图像"]

关键设计

1. 联合流形锚定:像素级结构支架约束抑制流形漂移 传统文本引导的扩散模型因外部向量空间与图像流形不一致而易发生流形偏移,且传统潜空间扩散(LDM)所依赖的 VAE 压缩会造成亚细胞染色质与核边界等细微形态不可逆的信息丢失。HUSE 采用直接预测干净数据的像素级流匹配(JiT 范式),将 H&E 图像 \(x \in \mathbb{R}^{H \times W \times 3}\) 视作整个生成演化过程中的不变量拓扑支架。对于标志物 \(m_k\) 对应的时间步 \(t \in [0, 1]\) 扰动状态 \(z_t = t y_{m_k} + (1 - t)\epsilon\),模型在输入层将 \(x\)\(z_t\) 进行通道级拼接: $\(\mathbf{X}_t = [x \mathbin{\Vert} \mathbf{z}_t] \in \mathbb{R}^{H \times W \times 6}\)$ 模型直接预测干净图像 \(\hat{y}_{m_k} = f_\theta(\mathbf{X}_t, t, e_k)\) 并通过速度场优化: $\(\mathcal{L}_{V} = \mathbb{E} \|v_{pred} - v_{target}\|^2 = \mathbb{E} \left[ \frac{1}{(1-t)^2} \|\hat{y}_{m_k} - y_{m_k}\|^2 \right]\)$ 在推理时,模型从纯高斯噪声与 H&E 支架拼接出发通过 ODE 积分求解,从而将整条演化轨迹牢牢锚定在 H&E 的生物拓扑结构上,彻底消除了流形漂移。

2. 组织成分驱动混合专家:先验初始化的生物特异性细粒度建模 通用模型的同质化参数往往无法兼顾不同微观组织区域的生物特性。Hi-MoE 打破“单组参数拟合全组织”的限制,构建了三个可学习的专精专家分支:细胞核专家(Nucleus)、间质专家(Stroma)与细胞浆/背景专家(Cytoplasm/Background)。为防止无约束聚类陷入语义混乱,模型构建了可学习原型矩阵 \(P \in \mathbb{R}^{K \times D}\) (\(K=3\)),并严格采用预训练 CLIP(ViT-B/32)提取的对应生物学概念特征对其赋予初值。在第 \(l\) 层,路由模块依据每个 token 特征 \(x_{l,i}\) 与原型的余弦相似度进行硬分配: $\(k_i^* = \arg\max_{k \in \{1, \dots, K\}} \frac{\mathbf{x}_{l,i} \cdot \mathbf{p}_k^\top}{\|\mathbf{x}_{l,i}\| \|\mathbf{p}_k\| \cdot \tau}\)$ 这种机制确保各个专家从一开始就具备明确的解剖学功能分工,能够专注于自身所辖生物结构的特定标志物表达模式。

3. 表征冲突门控:动态监测共享特征位移与残差补偿 当共享骨干网络在复杂组织交界区或高异质性区域尝试拟合不同标志物时(例如同在细胞核/浆界面的 CD3 与 panCK 表达差异),共享参数会出现表征认知冲突。为解决这一难题,HUSE 提出 RCG 模块作为动态观察与补偿器。所有 token 先经过共享专家 \(E_{shared}\) 提取通用形态,其特征位移定义为冲突量 \(\Delta_i = E_{shared}(\mathbf{x}_{l,i})\)。RCG 预测器在此基础上计算动态门控权重: $\(\alpha_i = \sigma\left( \mathbf{W}_{rcg} [\text{sg}(\mathbf{x}_{l,i}); \text{sg}(\Delta_i)] + b_{rcg} \right)\)$ 其中 \(\text{sg}(\cdot)\) 表示截断梯度操作,确保门控作为独立观察者而不破坏主干逻辑。最终该 token 的输出表示为共享特征与按需分配的专家残差之和: $\(\mathbf{x}_{out, i} = \mathbf{x}_{l,i} + E_{shared}(\mathbf{x}_{l,i}) + \alpha_i \cdot E_{k_i^*}(\mathbf{x}_{l,i})\)$ 当通用共享权重无法充分拟合复杂细节导致 \(\Delta_i\) 出现剧烈变化时,门控激活度 \(\alpha_i\) 显著升高,从而动态引入对应病理专家的特异性知识完成精细化补偿。

4. mIF 驱动的多标记物 IHC 生成范式:跨模态物理对齐构建训练矩阵 传统公开数据集缺乏单张 H&E 对应多种共定位 IHC 的 1:N 标注对。本文首次利用多重免疫荧光(mIF)具备天然共定位无移位、原位高精度对齐的独特优势,设计了基于物理色彩反卷积的跨模态生成范式。首先从输入 H&E 图像中反卷积提取苏木精(H)通道浓度图 \(C_H\) 捕获纯组织形态;随后对第 \(k\) 个荧光通道的归一化信号强度 \(C_{IF, k}\)\(C_H\) 进行物理驱动调制,合成虚拟二氨基联苯胺(DAB)显色通道浓度: $\(C_{DAB, k} = (C_{IF, k} \cdot \alpha \cdot \hat{C}_H) \cdot \beta\)$ 设置调制系数 \(\alpha = 0.6\) 与强度缩放因子 \(\beta = 0.8\)。最后将 \(C_H\) 与生成的 \(C_{DAB, k}\) 重新合成至明场色彩空间,构建出符合临床病理学视觉习惯的真实 1(H&E):N(IHC) 训练矩阵。

实验关键数据

主实验

论文在 Orion-CRC(结直肠癌 16 种标志物,256×256)与真实 MIST(乳腺癌 4 种标志物,512×512)两个数据集上进行了全方位评测。对比基线涵盖通用多标记模型(Multi-IHC、VIMs、PD-UniST)以及独立单标记模型(ASP、PSPStain、USIGAN)。KID 指标数值均按论文习惯放大 1000 倍。

数据集 指标 HUSE (本文) 最佳通用模型 (Multi-IHC / PDUnist) 领先幅度 最佳独立单标模型 (ASP / USIGAN / PSPStain)
Orion-CRC (16 标记平均) SSIM ↑ 0.829 0.813 (Multi-IHC) +0.016 0.807 (USIGAN)
PSNR (dB) ↑ 22.81 22.37 (Multi-IHC) +0.44 dB 22.72 (ASP)
KID (×10³) ↓ 19.93 35.87 (Multi-IHC) -15.94 24.75 (ASP)
MIST (4 标记平均) SSIM ↑ 0.361 0.256 (Multi-IHC) +0.105 0.174 (PSPStain)
PSNR (dB) ↑ 18.35 15.49 (PDUnist) +2.86 dB 13.43 (USIGAN)
KID (×10³) ↓ 54.78 87.35 (PDUnist) -32.57 56.04 (ASP)

计算复杂度方面,当分辨率从 256×256 扩展到 512×512 时,PDUnist GFLOPs 从 114.6 激增至 455.7,Multi-IHC 从 993.2 暴增至 3972.0;而 HUSE 依托可变 patch-size 的 Transformer 架构,GFLOPs 仅由 141.8 微调至 142.9,参数量稳定保持在 ~302M,展示出极其优异的高分辨率扩展性。

消融实验

消融实验验证了联合流形锚定(JMA)、组织成分专家机制(Hi-MoE)及表征冲突门控(RCG)的不可替代性(其中无 JMA 版本将 H&E 视作加噪初始输入):

配置 Orion-CRC SSIM ↑ Orion-CRC PSNR (dB) ↑ Orion-CRC KID ↓ MIST SSIM ↑ MIST PSNR (dB) ↑ MIST KID ↓ 说明
基础流匹配基线 0.449 17.40 90.58 0.280 16.43 165.63 无结构锚定,流形严重漂移
+ Hi-MoE + RCG 0.473 18.52 82.93 0.320 17.26 141.77 仅有专家但无支架约束
+ JMA 0.818 22.41 23.33 0.310 17.20 99.84 引入流形锚定,性能实现质的跃升
+ JMA + Hi-MoE 0.823 22.69 20.26 0.340 18.21 97.37 加入先验专家,提升组织特异性
完整模型 (JMA + Hi-MoE + RCG) 0.829 22.81 19.33 0.360 18.35 54.78 解决特征冲突,达到全局最优

此外,专家初始化策略对比表明,原型随机初始化(RI)导致专家职责模糊(Orion-CRC PSNR 降至 20.69 dB,MIST KID 飙升至 155.78);冻结 CLIP 原型(F)限制了特定病理域的自适应(Orion-CRC 21.70 dB);而使用可学习微调(L)的原型才能实现最佳效果(22.81 dB)。RCG 门控激活函数方面,Sigmoid(22.81 dB / 19.33 KID)显著优于恒等映射 Identity(20.72 dB / 32.84 KID)和 Tanh(21.54 dB / 24.67 KID)。

关键发现

  • JMA 是全局质量的基石:在去噪过程中直接将 H&E 拼接作为不可变支架,使得 SSIM 在 Orion-CRC 上暴涨 +0.369,彻底解决了以往无约束扩散模型中结构变形、核伪影与流形漂移的问题。
  • 资深病理学专家双盲临床评估:来自顶尖医院的三位资深病理学家对覆盖 16 个标记物的 160 余张合成图像在生物定位准确性、纹理真实度、荧光至明场强度映射三个维度打分,满分 5 分下达到平均 4.91 分,且 100% 样本获得 4 分或 5 分的高评,证实合成切片在结构逻辑与病理诊断质感上与真实染色难以区分。

亮点与洞察

  • 拓扑支架代替文本引导:深刻认识到病理切片细微异质性无法被一两句文本提示囊括的本质,创新性地把源 H&E 的生物学像素流形直接作为锚定支架,以极低代价消除了多任务条件生成的流形漂移。
  • 病理概念驱动的结构化 MoE:区别于自然图像盲目追求大参数量的通用 MoE,利用 CLIP 概念嵌入将专家显式绑定到细胞核、间质、细胞质三大基础生物学结构,且引入动态观察冲突的 RCG 模块,具备出色的解剖学可解释性。
  • 逆向利用 mIF 数据解决 1:N 缺乏痛点:以物理色彩反卷积巧妙激活了临床成本高但对齐极为完美的 mIF 公开数据,跨模态构建高保真 IHC 训练矩阵,为计算病理学下游的大模型训练开辟了全新的数据来源。

局限与展望

  • 极端异质病理变异的专家覆盖:目前的 Hi-MoE 仅划分为核、间质、细胞质/背景三类主流宏观成分,面对坏死区域、微钙化点、神经脉管侵犯等特殊病理亚结构时,固定的三专家划分可能粒度不足。
  • 全切片超高分辨率推理吞吐量:虽然 patch 层面通过可调节 patch-size 保证了 GFLOPs 的恒定,但面对数万乘数万像素的 WSI 全切片部署,迭代求解 ODE 的像素级流匹配扩散采样仍需进一步结合单步或少步蒸馏加速算法。

相关工作与启发

  • vs VIMs / PD-UniST:VIMs 和 PD-UniST 依赖文本提示向量跨模态注入指导扩散过程,但文本与复杂病理纹理天然存在语义断层,极易导致核边界模糊和流形漂移;HUSE 采用显式 JMA 支架结合类别索引 token,无需人工提示工程即可实现更高的结构保真度。
  • vs Multi-IHC:Multi-IHC 为每一个标志物构建专用独立解码器,当标志物达到数十种时参数量严重膨胀;HUSE 依托单干网络配合 Hi-MoE 共享架构,在 16 种标志物下仅需 302M 参数即可稳定运转,计算开销极其恒定。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 联合流形锚定机制与 mIF 跨模态物理调制数据范式设计极具开创性。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 2 个数据集共 19 种标志物,包含定量对比、消融、算力分析与三位资深病理学家双盲评审。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,数学表达与病理生物学直觉高度契合。
  • 价值: ⭐⭐⭐⭐⭐ 为无损、快速、低成本的高通量虚拟免疫组化多重染色提供了兼顾精度与算力扩展性的 SOTA 基准。