Toward Interpretable Analysis of Whole-slide Pathology Images via Large Language Model-based Agentic Reasoning¶
会议: ECCV 2026
论文: ECCV 2026
代码: https://github.com/G14nTDo4/PathAgent
领域: LLM推理 / 多模态VLM / 医学图像
关键词: 全切片病理图像, 智能体系统, 多步推理, 视觉问答, 可解释性
一句话总结¶
针对计算病理学中全切片图像(WSI)黑盒预测缺乏可解释性与诊断溯源的问题,PathAgent 提出了无需微调的 LLM 智能体框架,通过导航器筛选感兴趣区域、感知器提取微观形态特征以及执行器开展多步反思与自适应变焦,构建起贴近病理学家临床决策的透明证据轨迹。
研究背景与动机¶
全切片病理图像(Whole-slide Pathology Images, WSIs)通常包含高达十万乘十万(\(100\text{k} \times 100\text{k}\))量级的千亿像素,具有极度稀疏的微观病理线索与极其广阔的组织结构跨度。理想的计算病理学(Computational Pathology, CPath)系统不仅需要能够自主定位隐蔽病灶,还必须在连续变化的视野与倍率下进行符合病理学逻辑的循证推理。然而,现有的单体计算模型往往无法兼顾全局感知、局部细节与推理透明度:基于 CLIP 范式的跨模态对齐模型依赖固定的文本模板,缺乏长程生成与推演能力;通用或医学多模态视觉语言模型(VLM)受限于上下文窗口与感受野,只能将 WSI 粗暴下采样为缩略图或随机截取局部 patch,不可避免地丢失关键的组织微环境上下文;而近年涌现的 patch 聚合类大模型虽然能引入滑片级编码,但其诊断输出属于端到端的黑盒预测,缺乏可追溯、可审计的中间形态学证据支撑。
这种计算割裂与真实临床病理阅片流程存在根本性矛盾。病理医生在分析切片时,绝非一次性扫描全图直接下结论,而是一个高度反思、目标导向的渐进循环过程:首先在低倍镜(如 5×)下进行宏观概览并识别可疑的感兴趣区域(RoI),随后依据待解决的具体临床问题(如肿瘤浸润、核级或组织学分级),动态调整显微镜物镜倍率(如放大至 20× 或 40×)对细胞异型性与核分裂象等细微形态进行靶向核查,并在证据不足时主动调整视野重新寻迹,直到积累出足以支撑确诊的形态学证据链。
本文的切入角度是:无需昂贵的特定任务微调或额外构建黑盒多模态端到端模型,直接将成熟的病理视觉基础模型(如 PLIP、Patho-R1)与大语言模型的复杂规划能力解耦,通过交互式智能体架构复现病理学家的多尺度检查与审视逻辑。核心 idea:构建无需训练的病理智能体 PathAgent,将 WSI 分析解构为“导航器初筛-感知器形态描述-执行器多步反思推理”的动态闭环,由执行器依据当前证据充分性自适应决定横向扩展检索、纵向多倍率变焦或终结决策,形成全程可溯源的结构化证据轨迹。
方法详解¶
整体框架¶
PathAgent 将整个 WSI 的分析建模为一个序贯、循证的多步智能体决策过程。系统的形式化状态由分析状态集合 \(S_t\)、采取的动作 \(A_t\) 以及与问题相关的视觉发现 \(X_t\) 构成状态-动作-证据三元组轨迹 \(\{(S_t, A_t, X_t) \mid 1 \le t \le T\}\),其中 \(T\) 为最大计算迭代轮次预算。
系统包含三个核心协作模块:负责全片范围快速筛选病灶 patch 的导航器(Navigator)、负责针对指定 patch 提取精细形态学语言特征的感知器(Perceptor),以及负责全局任务规划、逻辑推演与行动决策的核心大脑执行器(Executor)。在每一个迭代轮次 \(t\) 中,执行器基于当前积累的累积描述进行多步反思:先生成预测与依据,再自省当前证据是否足以确诊,最后根据反思结论在三种动作之间动态转移——“动作 1:未检查区域新证据探索”、“动作 2:自适应多倍率变焦与状态整合”或“动作 3:综合多轮状态输出最终诊断结论”。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入:WSI 全切片与病理诊断问题 $q$"] --> B["导航器引导的证据检索<br/>计算切片图文相关度筛选候选切片"]
B --> C["感知器驱动的形态学线索抽取<br/>生成形态学描述并构建分析状态 $S_t$"]
C --> D["执行器多步反思推理<br/>预测答案、充分性检验与缺失信息探查"]
D -->|证据不充分且需扩大视野| E["未检查区域新证据探索<br/>基于指引检索新 RoI 补全上下文"]
D -->|证据不充分且需微观细节| F["自适应多倍率变焦与状态整合<br/>指定倍率细分与高倍局部特征追加"]
E --> C
F --> C
D -->|证据充分或到达最大迭代轮次| G["综合多轮状态输出最终诊断结论<br/>输出最终答案与可追溯证据链"]
关键设计¶
1. 导航器引导的证据检索:破解千亿像素全切片检索瓶颈
针对直接向大模型喂入十万级像素图像会迅速导致上下文崩溃且带来海量背景冗余的问题,PathAgent 引入病理 CLIP 模型(如 PLIP)构建导航器 \(F_N\)。在初始阶段,WSI 被预处理并切分为低倍率(5×)下的非重叠切片集合 \(X = \{x_i\}_{i=1}^N\)。导航器通过计算每个图像 patch 的视觉特征向量与输入病理问题 \(q\) 的文本特征嵌入之间的余弦相关度得分 \(r_i^1\): $\(X_1 = \{x_i \mid i \in \operatorname{Top}_{k_1}(\{r_i^1\}_{i=1}^N)\}\)$ 通过预先设定的比例系数 \(k_1 = \lceil 0.1 N \rceil\),将全图数万个 patch 迅速收敛至最具诊断信息量的 Top-10% 候选区域,既保留了潜在肿瘤病灶的分布范围,又将计算开销压缩至大模型可承受的合理空间内。
2. 感知器驱动的形态学线索抽取:跨模态精细表征病理特征
针对通用大模型直接阅读病理图像缺乏专业医学视觉落地能力的问题,感知器 \(F_P\) 采用前沿病理视觉语言大模型(如 Patho-R1)。对于导航器筛选出的候选 patch \(x_i \in X_1\),感知器首先以基础提示词获取通用的细胞架构与间质反应形态学描述 \(\operatorname{Des}(x_i)\)。更进一步,为防止通用描述遗漏关键诊断线索,感知器还会针对相关性最高的 Top 5 切片,注入专门的问题导向提示词(“Please describe the pathology features related to the question: [QUESTION] in this image”),提取导向性更强的病理表征。从而构建起包含倍率 \(M_1\)、切片左上角坐标 \(\operatorname{Loc}(x_i)\) 和语言描述 \(\operatorname{Des}(x_i)\) 的初始分析状态: $\(S_1 = \{(M_1, \operatorname{Loc}(x_i), \operatorname{Des}(x_i)) \mid x_i \in X_1\}\)$
3. 执行器多步反思推理:动态构建可溯源的诊断推理轨迹
针对传统病理端到端模型缺乏自我审视、容易在不确定情况下产生虚假幻觉的缺陷,执行器 \(F_E\) 将单步直接输出重构成三段级联推演链: - 预测答案(Predict Answer):基于当前累积状态 \(S_t\) 和问题 \(q\),给出推测答案 \(\hat{Y}_t\) 及详细的思考步骤 \(\hat{R}_t\); - 自省评估(Self Reflect):评判现有的形态学描述是否拥有足够的医学确证力以支持该诊断结论,输出二值信号 \(C \in \{\text{Yes}, \text{No}\}\); - 探查缺失信息(Explore Missing Info):当评估结论为“证据不足(No)”时,执行器明确生成缺失信息描述文本 \(I_t\)(如“需要确认是否存在浸润性生长与间质纤维化反应”),并研判是否需要放大视野,输出变焦指示 \(Z \in \{\text{Yes}, \text{No}\}\)、推荐目标倍率 \(M_t\) 及变焦理由。
4. 自适应多倍率变焦与状态整合:兼顾全局视野与细胞微观细节
针对复杂疾病分级(如 Nottingham 核分级)必须依赖高倍镜下核多形性与核分裂象等微观细节的临床特性,当执行器触发变焦动作(Action 2)时,系统将所选 patch 进一步在指定目标倍率 \(M_t\)(如 10×、20× 或 40×)下展开为精细切片集合 \(X_{\text{mag}}\)。为避免高倍切片暴涨带来的信息膨胀,导航器在 \(X_{\text{mag}}\) 内部根据缺失指引 \(I_t\) 二次筛选出最切题的局部切片 \(x_{\text{mag}}\),再由感知器给出高倍微观表征并并入当前状态集合: $\(S_t \leftarrow S_t \cup \{(M_t, \operatorname{Loc}(x_{\text{mag}}), \operatorname{Des}(x_{\text{mag}}))\}\)$ 在触发终结分析(Action 3)时,执行器自动对冗长多轮历史进行摘要精简,保留所有被采纳证据的空间坐标与倍率层级,生成完全与图像病灶锁定的可溯源诊断结论。
一个完整示例¶
以乳腺浸润性导管癌切片(TCGA-BH-A202-01Z)的诊断问题为例(“What type of carcinoma was found in the breast segmental mastectomy?”,选项包括 A. 浸润性导管癌, B. 乳头状瘤, C. 非特殊型, D. 纤维腺瘤样改变):
1. 第一轮(5× 概览):导航器初筛获取 5 个低倍切片。感知器提取特征,提示坐标 (16016, 7240) 区域可见导管结构和肿瘤分布,但细节模糊。执行器生成初步预测,随后在自省环节输出 {“sufficient”: “No”},并在缺失信息探查中指明:“导管结构清晰可见,但无法确认浸润边界及细胞异型性,需放大至 20× 进一步观察。”
2. 第二轮(20× 靶向变焦与检索):系统在 (16016, 7240) 周边及高倍采样区域展开,导航器命中关键切片 (64576, 14992)。感知器在 20× 下精确捕获到:“细胞核深染且大小形态显著不一,呈现高度细胞异型性;周围基质伴有明显的炎症与纤维化增生,呈现典型的浸润性浸润反应。”
3. 收敛确诊:执行器在第二轮反思中确认浸润性病理证据充足({“sufficient”: “Yes”}),随即锁定最终答案 A. invasive ductal carcinoma,并输出包含低倍与高倍坐标的完整诊断论证链。
损失函数 / 训练策略¶
PathAgent 采取完全的免训练(Training-free)架构。无需对基础大语言模型或视觉语言模型进行针对性的权重微调,完全依赖精心设计的提示词工程、约束性 JSON 状态机以及模块间跨尺度调用协议。推理时的计算预算严格受控:全切片初始化阶段统一采用 Trident 工具在 5× 倍率下切出 \(512 \times 512\) 像素 patch,第一轮检索比例固定为 \(k_1 = \lceil 0.1 N \rceil\),后续轮次补充检索比例设定为 \(k_t = \lceil 0.05 N \rceil\),最大交互上限 \(T=5\)。
实验关键数据¶
主实验¶
论文在五大具有挑战性的病理视觉问答基准上开展评估,涵盖切片级(SlideBench-VQA、WSI-VQA、WSI-Bench)与 RoI 局部级(PathMMU、PathVQA)场景。在离线配置(PathAgent-offline)下采用 PLIP + Patho-R1-7B + Qwen3-4B,在线配置(PathAgent-online)下将执行器替换为 Qwen3-235B-A22B。
以下为在切片级核心基准 SlideBench-VQA (BCNB) 以及 WSI-VQA 和 PathVQA 上的零样本问答性能对比(原论文 Table 1 核心数据):
| 方法 (输入形式) | 肿瘤类型 (Tumor Type) | 受体状态 (Receptor) | HER2 表达 (HER2) | 组织学分级 (Grading) | 分子亚型 (Subtype) | BCNB 平均准确率 (%) | WSI-VQA 准确率 (%) | PathVQA 准确率 (%) |
|---|---|---|---|---|---|---|---|---|
| Qwen3-VL (Thumbnail) | 41.48 | 50.63 | 19.37 | 25.95 | 11.03 | 30.70 | 21.84 | - |
| GPT-4o (Patch 随机30张) | 34.69 | 59.32 | 23.95 | 28.63 | 23.15 | 38.94 | 27.57 | 46.59 |
| LLaVA-Med (Patch) | 23.95 | 42.52 | 23.72 | 18.99 | 15.05 | 30.10 | 21.55 | 27.78 |
| Quilt-LLaVA (Patch) | 77.14 | 56.46 | 23.18 | 18.23 | 19.82 | 44.43 | 30.17 | 20.76 |
| WSI-VQA (Slide) | 3.90 | 40.82 | 10.53 | 30.00 | 0.00 | 23.35 | 46.90 | 33.59 |
| SlideChat (Slide) | 90.17 | 73.09 | 25.05 | 23.11 | 17.49 | 54.14 | - | 55.03 |
| WSI-LLaVA (Slide) | 85.32 | 60.89 | 24.75 | 46.28 | 29.20 | 52.68 | 54.63 | 54.97 |
| GIANT (Slide) | 57.37 | 42.55 | 14.79 | 48.52 | 26.63 | 44.97 | 47.05 | - |
| PathAgent-offline | 87.52 | 61.33 | 25.34 | 55.95 | 30.21 | 55.72 | 56.32 | 58.36 |
| PathAgent-online | 91.31 | 75.87 | 27.26 | 56.21 | 35.88 | 59.31 | 60.74 | 62.23 |
在 RoI 级基准 PathMMU 上的跨子集对比显示,PathAgent-online 取得了 72.54% 的平均准确率,超越了病理专家的平均水平(71.82%)以及此前最佳的 SlideChat(50.82%)。
消融实验¶
在 SlideBench-VQA (BCNB) 数据集上针对多步反思推理(Multi-Step Reasoning)与导航器(Navigator)的有效性消融(原论文 Table 4 核心数据):
| 多步反思推理 (MSR) | 导航器 (Navigator) | 肿瘤类型 (Tumor) | 受体状态 (Receptor) | HER2 表达 (HER2) | 组织学分级 (Grading) | 分子亚型 (Subtype) | BCNB 平均准确率 (%) | 平均迭代轮次 |
|---|---|---|---|---|---|---|---|---|
| ✗ | ✗ (随机采样) | 38.46 | 52.38 | 20.35 | 39.42 | 20.19 | 41.62 | 1.83 |
| ✓ | ✗ (随机采样) | 52.43 | 53.89 | 23.13 | 44.16 | 26.28 | 44.97 | 1.59 |
| ✗ | ✓ | 78.88 | 58.27 | 23.40 | 45.46 | 27.42 | 50.68 | 1.32 |
| ✓ | ✓ | 87.52 | 61.33 | 25.34 | 55.95 | 30.21 | 55.72 | 1.21 |
关键发现¶
- 多步推理与精准导航高度互补:单独引入导航器将准确率从 41.62% 大幅推升至 50.68%(+9.06%),表明准确捕获病灶切片是病理诊断的根本前提;单独引入多步反思推理将准确率提升至 44.97%,并在两者结合后达到 55.72%,平均迭代轮次从 1.83 显著缩减至 1.21,证明反思机制能够精准引导检索方向、加速收敛。
- 任务特异性受益不同:导航器对受体状态(Receptor Status)的提升最立竿见影(52.38% \(\to\) 58.27%),反映出有效空间定位对捕获局部特征的价值;而多步推理对分子亚型(Molecular Subtype)的改善最为显著(20.19% \(\to\) 26.28%),说明依赖复杂临床病理推论的高阶任务对反思推演链高度敏感。
- 初始切片比例的边际效应:实验证实切片采样比例在 10% 处达到性能峰值。进一步堆砌切片数量(如增至 15% 或 20%)反而会导致准确率从 55.72% 滑落,表明多模态特征过载与背景噪声会严重干扰大模型的临床推断。
亮点与洞察¶
- 完全免训练的协同架构:无需收集昂贵、难以标注的病理智能体微调轨迹数据集,直接通过模块化调度将现成视觉语言模型与大语言模型结合,即可取得匹敌乃至超越微调专有模型的效果,部署迁移成本极低。
- 可复现病理专家视角的真实证据链:在针对 22 名人类评估者开展的视觉图灵测试(Visual Turing Test)中,PathAgent 所选取的 RoI 与真实病理学家所选取的 RoI 鉴别准确率仅为 48.3%(接近 50% 的完全不可分水准),而随机切片辨识度高达 85.1%,有力证明了智能体选区高度契合临床直觉。
- 人机协同与可干预性极佳:系统支持临床病理学家在任何中间步骤无缝介入(如手工指定 RoI、审查描述或纠偏倍率)。统计检验表明,人类介入显著降低了模型迭代步数并提升了复杂病例的确诊率。
局限与展望¶
- 免疫组化指标的形态学上限:在 HER2 表达和微细组织学分级等任务上,纯视觉形态学推断的精度增益面临天花板(HER2 准确率在 27% 左右徘徊),因为真实临床中此类诊断高度依赖特异性免疫组化(IHC)染色或荧光原位杂交(FISH),难以单凭常规 H&E 切片的显微结构彻底解决。
- 导航器单次检索的召回瓶颈:在极个别复杂子集(如 PathCLS)中,由于病理切片词汇量特异性高,CLIP 文本编码器的零样本检索偶尔会错失微小弥漫病灶,亟待引入结合形态学聚类或空间拓扑图的复合导航策略。
相关工作与启发¶
- vs SlideChat / WSI-LLaVA:SlideChat 与 WSI-LLaVA 依赖庞大的多实例或滑片级下采样特征编码器,整个推理过程是“单次前向通过的黑盒映射”,无法对诊断依据溯源;PathAgent 采用显式状态机,推理过程中的每一处变焦与切片坐标均被记录,具备真正的临床可解释性。
- vs PathFinder / CPathAgent:PathFinder 等现有智能体依赖多阶段特定指令集微调或未开源的大规模病理专家轨迹;PathAgent 证明了通过优雅的反思-变焦逻辑调度现有成熟开源模型,在免微调条件下同样能达成更强的泛化能力。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ (巧妙将病理专家“宏观初筛-微观核查-自省修正”阅片心智解构为免训练的 Agentic 轨迹)
- 实验充分度: ⭐⭐⭐⭐⭐ (覆盖五大主流基准、消融完备、包含了严苛的人工协作实验与视觉图灵测试)
- 写作质量: ⭐⭐⭐⭐⭐ (架构逻辑清晰,实验指标可查,图表设计精美严谨)
- 价值: ⭐⭐⭐⭐⭐ (为十万级像素全切片图像的可解释分析提供了务实、高效、可落地的临床人机协同范式)