SeekFlow: Synergizing Radiology and Pathology Foundation Models for Precision Oncology via Knowledge-Guided Evidence Flow¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/HKU-MedAI/SeekFlow
领域: 医学图像
关键词: 多模态融合, 流匹配, 视觉语言基础模型, 证据理论, 精准肿瘤学
一句话总结¶
针对宏观放射学与微观病理学基础模型表征尺度失配与流形拓扑退化的问题,SeekFlow 构建临床原型锚定的证据流形,利用知识引导的连续流匹配实现拓扑保持的跨模态特征输运,并通过 Dempster-Shafer 证据理论分层聚合不确定性,在肿瘤分级、分期与生存分析多任务上达到 SOTA。
研究背景与动机¶
精准肿瘤学在临床诊断与疗效评估中高度依赖多学科会诊(Tumor Boards),需要协同分析宏观解剖尺度的放射影像(如 MRI、CT)与微观细胞尺度的病理切片(WSI)。随着生物医学视觉语言基础模型(VLFM,如 CONCH、BiomedCLIP)的快速发展,单模态特征提取已具备丰富的语义先验。然而,由于放射学和病理学配对数据稀缺且计算开销巨大,预训练兼顾宏微观尺度的统一全模态模型极具挑战,针对不同模态独立冻结的基础模型进行后验跨模态融合依然是实际临床落地的核心范式。
现有跨模态融合方案主要存在两大核心瓶颈:其一是静态映射导致的拓扑退化(Topological Degeneracy)。微观细胞形态与宏观器官解剖在空间分辨率上跨越多个数量级,两者的特征表征天然存在于拓扑不交叠的离散流形中。传统的交叉注意力机制或线性投影直接将异构 token 强行投影映射到共同空间,容易粗暴混合无关联的局部语义邻域,破坏模态内在几何结构并诱发特征坍塌;其二是黑盒协同引发的语义缠绕(Semantic Entanglement)。多数模型将特征压缩为一个不透明的稠密向量,无法解耦跨模态共性特征(如肿瘤坏死)与模态独有特征(如病理切片中的核分裂象、放射影像中的占位水肿),降低了临床可解释性与透明度。
面对离散流形间的巨大尺度鸿沟,特征融合不应是生硬的线性投影或注意力加权,而应当是一个平滑且保持内在几何拓扑的连续输运过程。核心 idea:将多模态融合重新表述为知识引导的连续流匹配(Flow Matching)输运问题,以临床指南知识驱动的可学习原型构建统一证据流形,通过连续速度场平滑输运视觉 token,并基于 Dempster-Shafer 证据理论实现感知不确定性的层次化证据合成。
方法详解¶
整体框架¶
SeekFlow 包含三大核心阶段:知识路由证据流形构建、知识引导连续证据流输运、以及感知不确定性的层次化证据聚合。首先,模型利用外部权威临床指南(如 WHO 分类标准、AJCC 分期手册)由大语言模型提取临床语义描述,建立由可学习高斯原型锚定的共享证据流形,并由知识路由器将视觉 token 软分配到模态共性或特异原型;随后,针对所分配的原型,通过最优输运(OT)生成微观目标并利用条件流匹配(CFM)学习连续向量场,通过常微分方程(ODE)积分实现几何拓扑保持的特征输运;最后,利用 Dempster-Shafer 证据理论量化模态内与模态间认知不确定性,抑制高不确定性原型并聚合生成鲁棒的患者级表征。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
IN["多模态输入<br/>放射学 MRI/CT + 病理学 WSI"] --> FE["冻结基础模型编码<br/>BiomedCLIP + CONCH"]
FE --> D1["1. 知识路由证据流形:解耦语义锚定"]
D1 --> D2["2. 知识引导证据流:连续流匹配输运"]
D2 --> D3["3. 层次化证据合成:证据理论聚合"]
D3 --> OUT["下游精准医疗预测<br/>肿瘤分级 / 分期 / 生存分析"]
关键设计¶
1. 知识路由证据流形:解耦语义锚定
为了消除宏微观模态之间的不对称性,SeekFlow 构建了一个由 \(K\) 个可学习高斯原型 \(\mathcal{P} = \{\mathcal{N}(\mu_k, \text{diag}(\sigma_k^2))\}_{k=1}^K\) 构成的统一证据流形。这些原型被显式划分为跨模态共用原型 \(\mathcal{P}_{\text{shared}}\)(表征两模态共有的临床征象,如坏死)和模态特异原型 \(\mathcal{P}_{\text{spec}}^{(m)}\)(表征放射学特有的水肿或病理学特有的核分裂象),并保留少量完全可学习的无先验原型以提供表征灵活性。模型基于 WHO 和 AJCC 临床指南,利用 LLM(如 Gemini)提取结构化临床视觉概念并由 VLFM 编码生成文本语义嵌入 \(t_k^{(m)}\)。
在路由过程中,输入投影特征 \(\tilde{x}_i^{(m)}\) 与临床概念嵌入计算先验余弦相似度 \(\ell_{\text{prior}}\), 并与轻量 MLP 路由网络输出结合形成后验路由对数几率 \(\ell_{i,k}^{(m)} = \mathcal{R}_\phi^{(m)}(\tilde{x}_i^{(m)})_k + \ell_{\text{prior},i,k} / \tau_p\)。与传统的竞争性 Softmax 不同,SeekFlow 采用 Sigmoid 门控机制 \(w_{i,k}^{(m)} = \sigma(\ell_{i,k}^{(m)}) \cdot A_{k,m}\)(\(A\) 为模态掩码),允许单个视觉 token 同时响应多个病理共存征象。为了防止原型表征退化并约束路由偏离先验,模型引入原型正交多样性损失 \(\mathcal{L}_d\) 与 KL 散度知识正则项 \(\mathcal{L}_k\):
2. 知识引导证据流:连续流匹配输运
传统的离散投影极易打破复杂病理/放射特征分布的几何拓扑,导致特征坍塌。SeekFlow 将特征映射转化为连续速度场上的常微分方程输运。为解决高维度和海量 token 全局匹配的计算瓶颈,训练采用类 EM 机制:在 E 步中,为每个 token \(i\) 依据路由权重采样单个目标原型 \(k_i\),并从该原型高斯分布中抽取 \(J\) 个支撑样本 \(z_j\)。通过构建兼顾几何欧氏距离与马氏密度一致性的代价矩阵 \(C_{ij} = C_{ij}^{\text{dist}} + (w_i - (1 - d_{Mj}))^2\),利用 Sinkhorn 算法求解熵正则最优输运计划 \(\gamma\),以重心投影得到微观输运目标 \(z_{i,k_i}^* = \sum_j \gamma_{ij} z_j / (\sum_j \gamma_{ij} + \epsilon)\),使得高置信度 token 输运至原型致密核心,模糊 token 输运至边缘。
在 M 步中,条件流匹配学习以时间标量 \(t\)、模态编码 \(c_m\) 和原型嵌入 \(c_k\) 为条件的自适应层归一化(AdaLN)MLP 速度场 \(v_\theta\),在插值测地线 \(x_t = (1-t)\tilde{x}_i + t z_{i,k_i}^*\) 上优化回归损失:
在正向推理阶段,通过 Top-\(K\) Gumbel-Sigmoid 激活掩码筛选激活 token,并利用一阶欧拉求解器对速度场进行沿时间维度的数值积分 \(\hat{x}_{i,k} = \tilde{x}_i + \int_0^1 v_\theta(x_t, t \mid c_m, c_k) dt\),使特征在光滑微分同胚变换下平稳流动至目标临床证据原型。
3. 层次化证据合成:证据理论聚合
由于全切片病理图像(WSI)生成的 token 数量(数千级别)远超放射学影像,直接扁平融合必然导致病理信息湮灭放射学特征。SeekFlow 提出分层聚合框架:在模态内部,利用多头门控注意力机制与路由器权重 \(w_{i,k}^{(m)}\) 联合加权,将输运后的 token 汇聚为模态特异的原型特征向量 \(h_k^{(m)} = \sum_i (\alpha_{i,k}^{(m)} \cdot w_{i,k}^{(m)}) \hat{x}_{i,k}^{(m)}\)。
在跨模态共识阶段,基于 Dempster-Shafer 证据理论(DST),通过带有 Softplus 激活的轻量 MLP 预测各模态对原型 \(k\) 的非负证据量 \(e_k^{(m)}\) 与信任度 \(b_k^{(m)} = e_k^{(m)} / (e_k^{(m)} + 1)\),得出原型全局认知不确定性 \(U_k = 1 / (\sum_m e_k^{(m)} + 1)\)。融合特征由信任度动态归一化合成:\(h_k^{\text{fused}} = \sum_m \frac{b_k^{(m)}}{\sum_{m'} b_k^{(m')} + \epsilon} h_k^{(m)}\)。在拼接患者分类 token 并输入自注意力网络时,注入不确定性偏置矩阵:
该偏置显式下调高不确定性原型在全脑/全组织决策时的注意力权重,并配合证据熵损失 \(\mathcal{L}_e = -\frac{1}{K}\sum_{k=1}^K \log(1 - U_k + \epsilon)\) 惩罚模态间的冲突与证据不足,实现高可信度的临床决策。
损失函数 / 训练策略¶
SeekFlow 采用端到端联合优化,总目标函数定义为:
其中 \(\mathcal{L}_{\text{task}}\) 在肿瘤分级与分期任务上采用交叉熵损失,在生存分析任务中采用 Cox 比例风险负偏似然损失。各辅助损失权重设定为:分类任务 \(\lambda_f = 0.1, \lambda_k = 0.5, \lambda_d = 1.0, \lambda_e = 0.01\);生存分析任务 \(\lambda_f = 1.0, \lambda_k = 1.0, \lambda_d = 1.0, \lambda_e = 0.01\)。模型采用 Adam 优化器,学习率 \(1 \times 10^{-4}\),权重衰减 \(1 \times 10^{-5}\),训练 20 个 epoch,特征嵌入维度 \(D=128\)。
实验关键数据¶
主实验¶
论文在三个多模态临床队列上进行全面验证:TCGA 胶质瘤(Glioma,WSI + MRI,包含 3 分类分级与 LGG/GBM 生存分析)、胃癌(Gastric Cancer,WSI + CT,生存分析)以及软骨肉瘤(Chondrosarcoma,WSI + MRI,包含 3 分类分级与 3 分类分期)。均采用严格的 10 折交叉验证(8:1:1 划分),评测指标采用均值与标准差。
表 1:肿瘤分类任务性能(分级与分期)
| 方法类型 | 方法 | TCGA 胶质瘤分级 (AUC↑ / ACC↑) | 软骨肉瘤分期 (AUC↑ / ACC↑) | 软骨肉瘤分级 (AUC↑ / ACC↑) |
|---|---|---|---|---|
| 单模态基线 | Radiology-Specific | 0.797±0.048 / 0.591±0.053 | 0.772±0.136 / 0.574±0.126 | 0.658±0.120 / 0.488±0.181 |
| 单模态基线 | ABMIL (Pathology) | 0.865±0.031 / 0.688±0.056 | 0.611±0.121 / 0.478±0.232 | 0.903±0.104 / 0.723±0.165 |
| 单模态基线 | TransMIL (Pathology) | 0.891±0.035 / 0.709±0.062 | 0.651±0.146 / 0.425±0.161 | 0.911±0.086 / 0.722±0.130 |
| 多模态融合 | Concat | 0.878±0.036 / 0.712±0.061 | 0.663±0.155 / 0.434±0.166 | 0.887±0.130 / 0.725±0.186 |
| 多模态融合 | MCAT | 0.882±0.024 / 0.697±0.069 | 0.719±0.105 / 0.531±0.164 | 0.924±0.069 / 0.782±0.148 |
| 多模态融合 | MOTCat | 0.886±0.027 / 0.682±0.065 | 0.681±0.140 / 0.502±0.159 | 0.918±0.053 / 0.809±0.166 |
| 多模态融合 | SurvPath | 0.890±0.016 / 0.706±0.038 | 0.686±0.122 / 0.488±0.102 | 0.890±0.081 / 0.761±0.115 |
| 多模态融合 | M4Survive | 0.882±0.030 / 0.718±0.053 | 0.714±0.141 / 0.501±0.219 | 0.914±0.103 / 0.785±0.123 |
| 多模态融合 | PIBD | 0.886±0.049 / 0.709±0.055 | 0.661±0.149 / 0.545±0.146 | 0.877±0.084 / 0.735±0.154 |
| 多模态融合 | CTF | 0.882±0.034 / 0.736±0.058 | 0.776±0.147 / 0.562±0.270 | 0.853±0.094 / 0.735±0.142 |
| 本文方法 | SeekFlow (Ours) | 0.901±0.011 / 0.739±0.055 | 0.820±0.087 / 0.595±0.128 | 0.931±0.077 / 0.832±0.127 |
表 2:多模态生存分析性能 (C-Index↑, mean ± std)
| 方法类型 | 方法 | TCGA-LGG | TCGA-GBM | Gastric Cancer |
|---|---|---|---|---|
| 单模态基线 | Radiology-Specific | 0.529±0.116 | 0.536±0.048 | 0.576±0.047 |
| 单模态基线 | ABMIL (Pathology) | 0.645±0.194 | 0.496±0.077 | 0.677±0.064 |
| 单模态基线 | CLAM (Pathology) | 0.669±0.164 | 0.452±0.083 | 0.726±0.051 |
| 单模态基线 | TransMIL (Pathology) | 0.730±0.199 | 0.488±0.097 | 0.722±0.056 |
| 多模态融合 | Concat | 0.683±0.169 | 0.484±0.084 | 0.697±0.046 |
| 多模态融合 | MCAT | 0.696±0.182 | 0.524±0.069 | 0.592±0.091 |
| 多模态融合 | MOTCat | 0.709±0.198 | 0.519±0.107 | 0.719±0.056 |
| 多模态融合 | SurvPath | 0.722±0.181 | 0.505±0.071 | 0.715±0.071 |
| 多模态融合 | PIBD | 0.686±0.153 | 0.550±0.124 | 0.697±0.052 |
| 多模态融合 | M4Survive | 0.752±0.144 | 0.485±0.044 | 0.679±0.061 |
| 多模态融合 | CTF | 0.713±0.179 | 0.525±0.096 | 0.721±0.031 |
| 本文方法 | SeekFlow (Ours) | 0.793±0.099 | 0.563±0.062 | 0.740±0.059 |
消融实验¶
论文在全部任务的宏平均指标上对架构与关键机制进行了彻底消融(完整模型基准:AUC 0.884, ACC 0.722, C-Index 0.699)。
表 3:SeekFlow 核心组件消融实验(跨所有任务宏平均)
| 消融维度 | 配置变体 | AUC ↑ | ACC ↑ | C-Index ↑ | 说明 |
|---|---|---|---|---|---|
| 完整模型 | SeekFlow (Full Model) | 0.884 | 0.722 | 0.699 | 完整三阶段流水线 |
| (1) 证据流形构建 | w/o 证据锚点 (Evidence Anchors) | 0.868 (-1.6%) | 0.687 (-3.5%) | 0.641 (-5.8%) | 移除临床原型语义锚定 |
| (1) 证据流形构建 | 纯共享原型 (All Shared) | 0.833 (-5.1%) | 0.671 (-5.1%) | 0.673 (-2.6%) | 破坏模态特异性表征解耦 |
| (1) 证据流形构建 | 纯模态特异原型 (All Specific) | 0.870 (-1.4%) | 0.718 (-0.4%) | 0.654 (-4.5%) | 缺乏跨模态共性语义流形 |
| (1) 证据流形构建 | 无知识先验 (No Knowledge Prior) | 0.867 (-1.7%) | 0.710 (-1.2%) | 0.674 (-2.5%) | 纯数据驱动导致语义偏移 |
| (1) 证据流形构建 | 纯知识先验 (Full Knowledge) | 0.867 (-1.7%) | 0.685 (-3.7%) | 0.617 (-8.2%) | 缺乏视觉数据自适应微调 |
| (2) 连续证据流 | 静态离散 OT 代替流匹配 (Flow Matching ⇒ OT) | 0.567 (-31.7%) | 0.507 (-21.5%) | 0.501 (-19.8%) | 退化为离散分配导致严重特征坍塌与梯度不稳定 |
| (2) 连续证据流 | 纯欧氏距离代价 (w/o Density Align) | 0.872 (-1.2%) | 0.715 (-0.7%) | 0.668 (-3.1%) | 忽略马氏密度导致原型核心对齐受损 |
| (3) 证据理论合成 | 扁平直接聚合 (Flat Aggregation) | 0.815 (-6.9%) | 0.663 (-5.9%) | 0.577 (-12.2%) | 病理海量 token 严重压制放射模态 |
| (3) 证据理论合成 | 标准门控池化 (Standard Gated) | 0.878 (-0.6%) | 0.717 (-0.5%) | 0.656 (-4.3%) | 模态内聚合缺乏路由引导 |
| (3) 证据理论合成 | 普通多头自注意力 (Multi-head Attn) | 0.837 (-4.7%) | 0.701 (-2.1%) | 0.663 (-3.6%) | 忽略认知不确定性引入冲突噪声 |
关键发现¶
- 连续输运对拓扑保持至关重要:消融实验中贡献最为剧烈的是「连续流匹配输运」。若保留原型空间但直接改用静态离散最优输运硬匹配,AUC 暴跌 31.7%(0.884 → 0.567),C-Index 跌落至 0.501(接近随机猜测)。这强力证明在宏微观跨模态场景下,离散硬匹配会导致不可逆的特征坍塌,而连续流匹配所诱导的光滑微分同胚是维持流形内在拓扑的决定性因素。
- 层次化证据理论有效化解 Token 数量失衡:在扁平聚合消融中,C-Index 下降达 12.2%。由于病理切片 patch 数量达数千,传统 Transformer 或全连接网络极易偏向病理学,使得放射学宏观解剖信息被稀释淹没;层次化 DST 聚合通过显式计算模态信任度与不确定性,保证了放射模态在肿瘤分期等宏观特征主导任务中的平权发言。
- 对骨干编码器与概念提取 LLM 具有高度鲁棒性:将病理基础模型从 CONCH 切换为 MUSK、放射模型从 BiomedCLIP 切换为 GenMedCLIP,或者将知识抽取 LLM 从 Gemini 3.0 Pro 换为 GPT-5.5 或 Grok 4.3,模型性能保持稳定(AUC 在 0.877~0.884 窄幅波动),证明收益源自结构化临床先验框架与流输运机制,而非依赖单一特定闭源模型。
亮点与洞察¶
- 将多模态融合升华为拓扑输运问题:摆脱了注意力加权与特征拼接等静态盲目投影的窠臼,首次引入条件流匹配(Flow Matching)平滑连接宏观与微观基础模型特征空间,在数学上保障了流形微分同胚与拓扑保持。
- 临床可解释的语义流形解耦:将隐空间显式锚定到“共性表征(如坏死)+ 模态特异表征(如核分裂象、占位水肿)”的临床原型上,既避免了黑盒融合的语义混沌,又为临床决策提供了清晰的循证溯源路径。
- 证据理论动态抑制多模态冲突:利用 Dempster-Shafer 理论量化每组临床原型的认知不确定性,并在自注意力层中作为对数偏置动态屏蔽争议特征,天然支持模态缺失场景(缺失模态生成近零信任度),具备极高的临床实用性。
局限与展望¶
- 作者承认的局限:目前验证主要局限在放射影像与病理 WSI 的双模态设定,尚未将体细胞突变、基因组学转录本(Genomics)等非成像多组学证据纳入连续证据流输运体系。
- 潜在优化空间:虽然采用 Top-\(K\) Gumbel 激活与重心投影加速了流匹配,但在推理阶段求解 ODE 仍需进行数值积分(如欧拉步长),相比简单的线性投影增加了一定的推理延时;未来可探索单步扩散整流(Rectified Flow 蒸馏)进一步提升推理吞吐量。
- 可迁移性:这种“临床概念知识图谱引导原型构建 + 连续流匹配输运”的范式,可以原样迁移到机器人跨传感器(RGB-D + 激光雷达 + 触觉)多尺度融合或自动驾驶中多视角传感器语义对齐任务。
相关工作与启发¶
- vs MCAT / MOTCat: MCAT 采用基因组作为 Query 对 WSI patch 进行单向交叉注意力聚合,MOTCat 引入离散最优输运计划对齐特征。两者的共同缺陷在于仅在静态特征间建立离散对应,无法对异构流形进行平滑连续形变;SeekFlow 证明了连续流场能够根本性解决跨尺度离散映射带来的流形拓扑坍塌。
- vs PIBD: PIBD 虽通过信息瓶颈尝试解耦模态共性与特异特征,但仍属于隐式向量压缩黑盒;SeekFlow 则引入结构化临床指南将原型直接具象化为病理学/放射学概念,在透明度和可解释性上显著占优。
- vs M4Survive / CTF: 现有多模态基础模型协同工作依赖于 adapter 或双向交叉微调,容易陷入对特定编码器权重的过拟合;SeekFlow 保持骨干完全冻结,即插即用且对多种 VLFM 展现出极高鲁棒性。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次将流匹配输运理论与临床指南驱动的原型流形相结合,彻底重构了宏微观医学多模态融合范式。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 3 种癌种、4 项分类与生存分析任务、10 折严格交叉验证,且包含机制级消融及骨干模型替换验证。
- 写作质量: ⭐⭐⭐⭐⭐ 动机阐述深刻,拓扑退化与语义缠绕的痛点分析鞭辟入里,数学公式与算法流程严谨清晰。
- 价值: ⭐⭐⭐⭐⭐ 对精准肿瘤学中异构基础模型协同应用提供了极具实用价值与可解释性的统一解决方案。