Multimodal LLMs Outperform Pathology Foundation Models in Cross-Domain Histological Similarity¶
会议: NeurIPS2026
arXiv: 2609.32876
论文: NeurIPS2026 Poster
领域: 医学图像
关键词: 组织学相似度、跨机构泛化、批次效应、相对相似度、多模态大语言模型
一句话总结¶
MOSAIC 用六个组织病理队列中的三图相似度选择,把同类跨域样本与异类同域样本直接对置,发现零样本多模态大语言模型通常比病理基础模型的欧式嵌入距离更能抵抗采集来源捷径,但优势不等于临床诊断能力,也不意味着跨域任务已经可靠解决。
研究背景与动机¶
计算病理基础模型通过大规模切片图块预训练,提供可复用的视觉表示;UNI2H、Virchow2 等模型的价值不仅在于接一个分类器,还在于支持跨医院检索、少样本迁移和多中心数据整合。 这些应用要求表示空间中的“近”主要反映组织形态,而不是染色颜色、扫描仪或制片过程。 然而,同一队列内的线性探测或近邻分类可能借助来源与类别的相关性取得好成绩,因此并不能排除模型把医院签名当成了生物学特征。
既有 Robustness Index、PathoROB 等研究已经指出病理表示包含明显的来源信息,但其分析通常需要连续嵌入,无法直接评估只输出文本选择的生成式多模态模型。 本文因此没有提出一个新病理编码器,而是构造一个双方都能回答的比较任务:给定参考图,选择“另一个来源的同类组织”,还是“相同来源的异类组织”。 这让形态一致性与采集风格一致性发生明确竞争,比随机挑两个候选更直接地暴露跨域捷径。
通用多模态模型能在推理时接收“比较细胞与组织结构、忽略非生物差异”的指令,提供一个与固定嵌入几何不同的参照。 如果它们能够成功,至少说明跨来源形态比较并非任务本身不可解;但这种参照不能单独证明具体训练目标就是失败原因。 核心 idea:用类别与来源相互冲突的三元组,统一测量编码器和生成式模型是否优先保留组织学相似性,而不是仅检查它们在同域分类上是否表现良好。
方法详解¶
整体框架¶
每次评估包含三张 H&E 组织学图块:参考图、一个同类正候选和一个异类负候选。 在跨域配置中,正候选必须来自另一张切片或另一家机构,负候选则与参考图共享对应层级的来源。 模型只需选择两个候选之一;评分依据是已有组织类别标签,不是模型自己的解释,也不是新收集的病理专家相似度标注。
编码器分别提取三图嵌入,以参考图到候选的欧式距离决定答案;多模态大语言模型则同时接收三图及文字提示,直接输出选择。 候选顺序随机化后,两种路线共享相同的二选一任务和 50% 随机基线。 这是一个评测协议而非训练网络,因此不把数据集、距离计算和提示词硬画成模型架构图。
MOSAIC 覆盖 HER2ST、CCTGS、TIGER 的跨切片比较,以及 CAMELYON16、TCGA、BEETLE 的跨机构比较。 六个队列涉及乳腺、结直肠和肺组织,类别粒度为 2–6 类;跨机构部分共涉及 9 个机构或组织来源站点。 全部配置合计 13,800 个比较三元组,其中跨域部分为 8,400 个:6,200 个跨切片和 2,200 个跨机构。 不要把 13,800 都解释成跨机构测试,也不要把原始数百万图块等同于实际比较次数。
关键设计¶
1. 来源冲突三元组:让技术捷径与组织类别产生相反答案
普通近邻评测中,同类别样本可能也来自相同医院,模型选对并不说明它利用的是形态。 本文让正候选保留参考图的类别但改变来源,负候选保留来源但改变类别,主动拆开这两种线索。 当模型选择负候选时,它并非简单地漏认某一类,而是在这个受控比较中把同源异类排在了跨源同类之前。 这使低于随机水平的结果尤其有信息量:它与系统性来源偏好相符,但仍需要避免把每次失败都归结为单一颜色因素。
三种比较层级各有用途。 同切片配置让三图都来自同一张切片,主要检查没有该层级来源冲突时的类别区分能力;跨切片配置让参考图与负候选来自同一张切片,正候选来自另一张切片。 跨机构配置则把约束提升到机构层级:参考图与负候选同机构,正候选异机构,前两者不必来自同一张切片。 附录还提供同机构对照,其图块也可来自机构内部的不同切片,因此“同机构”不能误读为“同切片”。
跨切片采样按有序正负类别对分层,每对抽取 100 次比较:HER2ST 的 5 类形成 20 对、共 2,000 次,CCTGS 的 6 类形成 30 对、共 3,000 次,TIGER 的 4 类形成 12 对、共 1,200 次。 跨机构采样按参考机构与正类别的组合,每组合 100 次,得到 CAMELYON16 的 400 次、TCGA 的 600 次和 BEETLE 的 1,200 次;负类别在可用异类中均匀抽取。 这种分层避免大类别完全主导任务,但其总体准确率仍反映人为设计的采样分布,不是医院真实病例分布下的性能。
2. 双路线共同选择:比较固定嵌入几何与可指令化的视觉判断
相对比较将各模型的输出压缩为一个共同问题:同类候选是否优于异类候选。 原文用相似度表示正确排序事件:
其中参考图与正候选同类,负候选异类;相对相似度准确率就是正确选择占有效比较的比例。 对于编码器,原文具体使用的不是余弦相似度,也不是经过下游分类器校准的分数,而是欧式距离:
模型选择距离更小的候选。
所以这里测到的是现有表示加指定距离规则的跨域排序能力,不能扩展为“该表示经任何适配后都无效”。
对 LLM,生物学导向提示要求关注细胞大小、形状、核特征,以及腺体组织、间质模式和细胞密度,同时忽略染色强度、成像伪影等非生物差异。
两种提示都要求以 JSON 的 more_similar_candidate 字段返回答案,正负候选随机放到位置 1 或 2。
评估共 17 个模型:5 个病理基础模型、6 个通用基础模型或提取的视觉编码器,以及 6 个生成式多模态模型。 其中 Qwen3.5、GLM-4.6V、Gemma 3 同时有完整模型与视觉编码器版本,为“看得到相同图像,但采用不同判断机制”提供了有用对照。 不过,LLM 还获得明确的任务指令并执行联合三图推理,而编码器使用固定距离规则;这是系统级比较,不是只改变一个训练目标的严格消融。
3. 分层统计与有效响应:不让总体均值掩盖困难组织对或拒答
总体准确率按有效比较汇总,另按参考类别和正负类别对检查表现,因此能区分“所有类别都略有改善”与“主要修复最困难的组织对”。 例如 HER2ST 中 UNI2H 对结缔组织与免疫浸润这一组织对仅有 25% 准确率,对癌组织与免疫浸润为 32%,说明来源竞争可能与形态相近的类别共同加剧错误。 同域对照则回答另一问题:低跨域准确率是否只因为模型根本不会区分类别。 HER2ST 上病理模型同切片表现较强、跨切片明显降低,支持“域变化暴露表示问题”的解释。
无有效输出的比较被排除,而不是计为错误。 这意味着 LLM 准确率是成功返回有效选择条件下的准确率;若难题更容易产生无效输出,排除机制就可能带来选择偏差。 附录 F 中 CAMELYON16 的 Qwen3.5 有效响应为 354/400,GLM-4.6V 为 370/400,HER2ST 的 GLM-4.6V 为 1,995/2,000,不能把它们当成完整覆盖的二选一系统。 更完整的后续报告应同时给响应覆盖率、有效响应准确率及将无效响应计错的敏感性分析。
统计检验仅覆盖 HER2ST 跨切片和 CAMELYON16 跨机构。 作者用 10,000 次比较级 bootstrap 给出 95% 置信区间,McNemar 检验只使用双方都有效的配对比较;不一致对数少于 25 时用精确二项检验,否则用连续性校正的卡方检验。 附录明确说明类别内最佳模型是事后选出的,检验属于探索性分析。 这些结果不应被解释成所有数据集、所有组织对都已获得相同强度的统计支持;比较级重采样也没有直接替代切片或机构级独立性评估。
损失函数 / 训练策略¶
本文不训练或微调模型,没有新增损失函数、优化器或监督学习阶段。 组织类别标签用于构造三元组和评分,不作为此次 LLM 推理的示例答案;“零样本”指没有为该任务额外训练或提供带标签示例,不保证预训练从未接触病理数据。
WSI 先经 Otsu 组织掩膜筛选,再以 512×512 像素窗口、256 像素步长切块,并保留前景比例至少 1% 的图块。 本地嵌入提取与模型推理使用 NVIDIA RTX 4090;输入 token 单价只是作者采用的成本代理,不能替代端到端延迟、输出 token 与检索系统总成本。
实验关键数据¶
主实验¶
下表摘录原文表 1、表 2 的总体准确率,保留其两位小数口径。 前三列为跨切片,后三列为跨机构;不是同一难度或同一类别粒度的六次重复实验。
| 模型 | HER2ST | CCTGS | TIGER | CAMELYON16 | TCGA | BEETLE |
|---|---|---|---|---|---|---|
| UNI2H | 0.46 | 0.59 | 0.19 | 0.61 | 0.31 | 0.56 |
| Midnight | 0.46 | 0.72 | 0.20 | 0.64 | 0.36 | 0.48 |
| Virchow2 | 0.46 | 0.71 | 0.23 | 0.63 | 0.44 | 0.57 |
| DINOv2 | 0.55 | 0.60 | 0.36 | 0.52 | 0.44 | 0.51 |
| Gemini 3 Flash | 0.55 | 0.75 | 0.35 | 0.71 | 0.55 | 0.54 |
| Gemini 3.1 Flash Lite | 0.53 | 0.72 | 0.37 | 0.73 | 0.56 | 0.58 |
| Qwen3.5 | 0.55 | 0.74 | 0.40 | 0.68 | 0.59 | 0.57 |
| GPT-5 Nano | 0.57 | 0.64 | 0.46 | 0.59 | 0.52 | 0.57 |
精确值显示,HER2ST 的 GPT-5 Nano 为 0.570,病理模型中最佳 Midnight 为 0.464;前者 95% CI 为 [0.547, 0.591],后者为 [0.442, 0.485]。 CAMELYON16 的 Gemini 3.1 Flash Lite 为 0.730,Midnight 为 0.640,对应 95% CI 为 [0.685, 0.775] 与 [0.593, 0.685]。 两组配对检验分别报告 p<0.0001 与 p<0.001;HER2ST 的 GPT-5 Nano 对 DINOv2 则为 p=0.153,不能宣称显著超过最佳通用编码器。
同域对照更直接显示“同域领先不保证跨域领先”。 下表同切片值取附录表 4,跨切片值取附录表 13,避免用两位小数计算精确降幅。
| HER2ST 模型 | 同切片准确率 | 跨切片准确率 | 降幅(百分点,按表值计算) |
|---|---|---|---|
| UNI2H | 0.728 | 0.459 | 26.9 |
| Midnight | 0.697 | 0.464 | 23.3 |
| Virchow2 | 0.735 | 0.459 | 27.6 |
| Gemini 3 Flash | 0.706 | 0.549 | 15.7 |
| GPT-5 Nano | 0.616 | 0.570 | 4.6 |
消融实验¶
提示消融只涉及两个模型与两个数据集,并非对六个队列全部验证。 下表来自原文表 3;提升为生物学导向提示减去最简提示后的百分点差。
| 模型与配置 | 生物学导向提示 | 最简提示 | 提升(百分点) |
|---|---|---|---|
| Gemini 3 Flash,HER2ST 跨切片 | 0.549 | 0.510 | 3.9 |
| GPT-5 Nano,HER2ST 跨切片 | 0.570 | 0.560 | 1.0 |
| Gemini 3 Flash,CAMELYON16 跨机构 | 0.705 | 0.668 | 3.7 |
| GPT-5 Nano,CAMELYON16 跨机构 | 0.590 | 0.555 | 3.5 |
生物学导向提示改善了四种配置,但最简提示并非普遍超过最佳病理模型。 CAMELYON16 上该说法适用于 Gemini 3 Flash 的 0.668 对 Midnight 的 0.640;GPT-5 Nano 的最简提示为 0.555,并不满足这一比较。
关键发现¶
- TIGER 上最佳 LLM GPT-5 Nano 的 0.46 仍低于 0.50 随机基线:相对提高不等于任务已经解决。
- TCGA 上 Qwen3.5 的精确值为 0.589,优于最佳通用编码器 Gemini Emb. 2 的 0.503,但其跨机构比较仍有大量错误。
- BEETLE 的最佳 LLM Gemini 3.1 Flash Lite 为 0.579,Virchow2 为 0.565,差距较小;不能把所有机构域变化描述成同样强的优势。
- 训练规模分析是不同模型之间的观察性比较,且 WSI、图块、图文对的计量不统一;它支持“已评模型的数据规模未保证鲁棒性”,不证明扩大数据必然无效。
亮点与洞察¶
- 把捷径暴露在比较关系里:不要求先训练分类头,就让来源一致与类别一致互相竞争。这个评测设计可用于检查其他医学图像表示是否依赖采集设备或数据中心。
- 相似性标准可在推理时指定:提示消融体现了生成式模型可以改变关注特征,而固定嵌入距离没有同样的即时接口。这提示表示学习可以借助关系监督,但本文尚未验证这种训练方案。
- 保留同域对照:同切片强、跨切片弱的反差比单一低分更能说明问题。它提醒评测者不要用一个良好的同域平均分代替域外审计。
局限与展望¶
- 范围有限:只测试 H&E 图块及六个队列,没有验证免疫组化、多重成像、整张 WSI 推理或前瞻性临床使用;零样本相似度选择不是临床诊断验证。
- 类别代替细粒度相似性:同类图块未必在形态上总比异类更接近,尤其“正常”或间质类可能高度异质。后续可加入独立专家关系标注并报告类别粒度敏感性。
- 有效响应选择偏差:排除无效输出可能改变 LLM 与编码器的比较集合。需同时报告覆盖率,并检查无效样本是否集中在困难类别或特定机构。
- 机制推断不足:提示策略、模型架构、训练数据、目标和计算量同时变化,尚不能因果确定语言推理或某一预训练目标解释了全部优势。
- 原文存在概括与表格不一致:正文与图 5 说明称 CAMELYON16、TCGA 上所有模型跨机构都下降,但 GLM-4.6V-enc. 的附录同机构值分别为 0.365、0.315,跨机构值为 0.580、0.403。本笔记保留这些数值,不将“全部下降”改写成经过验证的结论。
- 复现状态需区分承诺与可用资源:原文有“release MOSAIC”措辞,同时摘要与检查表说代码和数据将在录用后发布;缓存没有可核实的仓库链接,不能据此断言资源已公开。
相关工作与启发¶
- vs Robustness Index / PathoROB:这些工作分析表示邻域或嵌入鲁棒性,MOSAIC 用离散比较让生成式模型也参与。二者互补,离散选择并不能替代对整个嵌入空间的分析。
- vs 染色归一化、RandStainNA、STRAP:既有方法尝试削弱输入中的颜色或风格变化,本文直接检查模型能否跨越这些变化。要证明来源混淆主要由染色造成,还需要归一化前后的受控对照。
- vs 单图病理 VLM 分类评测:本文不让模型直接猜类别名,而是提供参考图与候选图进行关系判断。更强的视觉参照降低了任务歧义,但不能把这种任务优势等同于自由诊断能力。
评分¶
- 新颖性: 4/5 — 来源冲突三元组把病理表示鲁棒性与生成式视觉判断放入共同评测。
- 实验充分度: 4/5 — 六队列、17 模型和同域对照较完整,但有效响应与统计独立性仍需补充分析。
- 写作质量: 4/5 — 任务定义清楚,少数“所有模型”概括和资源发布状态需要更精确。
- 价值: 4/5 — 有助于跨中心表示与检索审计,尚不足以支持临床部署结论。