跳转至

Mimicking Radiologists: A Coarse-to-Fine Framework with Structural Sparse Tokens for Dual-LLM Computed Tomography Report Generation

会议: ECCV 2026
论文: CVF Open Access
代码: https://github.com/ccarliu/CTRG
领域: 医学图像
关键词: CT报告生成, 双LLM架构, 稀疏Token过滤, 注意力汇聚消除, 强化学习对齐

一句话总结

本文提出一种模拟放射科医生由粗到细视觉搜索流程的双LLM三维CT报告生成框架,通过结构全局Token初筛异常并引导多源局部Token过滤,结合GRPO协作对齐,在大幅压缩特征冗余的同时显著提升临床有效性与报告质量。

研究背景与动机

三维计算机断层扫描(CT)在临床诊断与治疗规划中起着决定性作用,但解读包含数百张切片的立体容积数据需要医生进行高强度的视觉排查与细微病灶辨识。在医疗资源紧张、阅片负荷沉重的临床一线,这种耗时耗力的人工流程极易引发疲劳,从而导致漏诊与报告延迟。利用大语言模型(LLM)的推理与生成能力自动化生成影像报告(CTRG)成为破局的关键方向。然而,3D CT数据呈现出独特的物理特性:体数据维度庞大、特征冗余度极高,而关键病灶往往高度稀疏且局限在局部解剖切片内。早期探索直接通过3D空间下采样池化连接大模型,造成了致命的局部病理信息丢失;近期引入分割先验提取器官特征的方法虽保留了区域信息,却忽视了器官内部的严重特征冗余;若单纯基于交叉注意力权重筛选Top-K局部Token,又会受到自注意力与交叉注意力中普遍存在的“注意力汇聚(sink tokens)”现象干扰,导致模型选出一堆低语义却高权重的全局背景Token,漏掉真正承载微小病灶的病理特征。

这一困境与资深放射科医生的临床阅片逻辑形成了鲜明对照。真实阅片实践中,医生绝非对海量体素做盲目平均,也不会仅凭局部直觉一窥全豹,而是遵循典型的“由粗到细(coarse-to-fine)”视觉搜索范式:先结合病史、主诉等临床元数据对全景图像做粗略通扫,建立初步的异常嫌疑列表;随后针对可疑解剖结构进行定向细览,重点捕捉局灶异常并核对阴性表现,最终形成条理严谨的诊断报告。现有单阶段或单LLM框架试图强行将粗粒度全貌感知与细粒度病理描述压入同一表示空间,不仅计算代价随Token暴增,也难以兼顾病理定位与文本生成。

本文的核心切入点在于将医生的粗细视觉搜索流程完整解构为双智能体分工协同体系:先由轻量异常提议LLM基于各解剖结构的单一全局Token预测候选异常,再以此异常为检索提示,通过多源加权过滤选出关键局部Token,最后由报告生成LLM撰写完整报告。核心 idea:构建由粗到细的双LLM报告生成范式,用掩码引导负熵损失提取结构解剖表征,以异常候选列表驱动局部Token多源加权过滤规避注意力汇,并引入GRPO强化学习缩小训练与推理阶段的异常分布鸿沟。

方法详解

整体框架

本文框架完整模拟放射科医生的诊断阅片链路,整体由四个核心阶段协同构成:结构化视觉Token提取、粗粒度异常候选提议、异常引导的局部Token过滤(AP-LTF)以及细粒度全文报告生成。首先,CT-ViT从三维CT扫描中抽取密集的立体图像Patch Token,并利用一组可学习的解剖结构查询向量,通过交叉注意力解构出各预定结构的全局摘要Token与候选局部Token池,并引入文本提示分割掩码计算稀疏负熵损失以约束特征边界。随后,异常提议大模型 \(D_\text{pro}\) 仅接收各结构的单一全局Token和临床元数据,生成患者特异性的结构异常候选名单。接着,该名单经由专用临床BERT编码为结构文本查询,在AP-LTF中联合余弦相似度、可学习打分与原始注意力权重对各结构局部Token进行多源打分,稀疏硬筛选出极具判别力的紧凑局部Token子集。最后,报告生成大模型 \(D_\text{ful}\) 整合全局Token、筛选后的局部Token及临床信息,生成符合医学规范的完整报告。为打通双LLM的协同瓶颈,训练末期使用GRPO以临床有效性与语言质量联合奖励强化 \(D_\text{pro}\),消除提议误差在两阶段间的级联放大。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["三维CT容积 + 临床元数据"] --> B["掩码引导稀疏负熵解耦<br/>CT-ViT抽取结构全局与局部Token池"]
    B --> C["双LLM由粗到细协同报告生成<br/>异常提议LLM输出候选异常简表"]
    C --> D["异常引导局部Token过滤<br/>融合相似度、线性判别与注意力权重"]
    D --> E["双LLM由粗到细协同报告生成<br/>报告生成LLM解码输出完整诊断报告"]
    E --> F["GRPO协作强化对齐<br/>联合CE-F1与BLEU-4优化异常提议策略"]

关键设计

1. 掩码引导稀疏负熵解耦:消除跨器官注意力泄漏

直接借助报告文本进行跨模态对比学习只能赋予结构查询弱监督信号,由于解剖边缘模糊和软标签扩散,局部Token的注意力往往溢出到非目标解剖区域。为强行约束解剖注意力聚焦而不增加推理延迟,本文引入通用医学分割模型(SAT)在离线阶段生成胸部CT解剖结构的3D掩码,并基于Patch空间重合度(重合体积比 \(\ge 30\%\) 即判定为结构内)构建结构二值掩码 \(\mathbf{M}\)。在此基础上设计掩码引导稀疏负熵损失 \(\mathcal{L}_\text{sparse}\),对跨越结构边界且注意力权重异常偏高的Token施加惩罚: $\(\mathcal{L}_\text{sparse} = \frac{1}{|\mathcal{H}|} \sum_{(i,j)\in\mathcal{H}} -\log(1 - \mathbf{A}^v_{i,j})\)$ 其中集合 \(\mathcal{H} = \{(i,j) \mid \mathbf{M}_{i,j} = 0 \land \mathbf{A}^v_{i,j} > \eta\}\) 严格限定在“位于结构外部但注意力权重超过阈值 \(\eta\)”的离群位置。该约束强制每个结构的注意力权重收敛在自身几何边界内部,从而在不增加测试期网络前向开销的前提下,显著增强了解剖局部表征的特异性与信噪比。

2. 异常引导局部Token过滤:破除注意力汇聚陷阱

标准自注意力机制与交叉注意力模型极易产生“注意力汇(sink tokens)”,即某些低语义信息含量的背景或边界Token吸收了极高的注意力权重。若如传统方法直接取注意力Top-K,将导致选出的Token充斥着无病理价值的平庸背景。针对这一瓶颈,本文提出异常引导局部Token过滤模块(AP-LTF)。首先将候选异常列表输入冻结的临床BERT提取结构文本查询 \(\mathbf{q}^t_i\);接着对初始局部Token池(\(K=200\))内的每个候选Token \(\mathbf{g}_{i,j}\) 计算三源融合判据: $\(s_{i,j} = \alpha_0 \operatorname{sim}(\mathbf{q}^t_i, \mathbf{g}_{i,j}) + \alpha_1 \operatorname{lin}(\operatorname{cat}(\mathbf{g}_{i,j}, \mathbf{q}^t_i)) + \alpha_2 \mathbf{A}_{i,j}^v\)$ 该得分全面兼顾了异常语义相关性(余弦相似度)、跨模态非线性判别交互(拼接后经可学习线性层变换)以及结构几何显著性(注意力权重 \(\mathbf{A}^v_{i,j}\))。随后通过Softmax归一化并选取最高的 \(K'=15\) 个Token。为克服离散Top-\(K'\)操作不可导的问题,前向传播执行硬筛选提取稀疏局部Token,反向传播采用直通估计器(Straight-Through Estimator, STE)传递连续梯度,配合结构对比损失 \(\mathcal{L}_\text{filt}\) 将筛选后的均值表征与真实解剖文本对齐,实现端到端抗注意力汇的病灶聚焦。

3. 双LLM由粗到细协同报告生成:解耦病变发现与语言组织

单模型直接生成CT报告往往面临多任务负迁移与容量瓶颈,极易出现病理幻觉与关键指征遗漏。本文将任务分工解耦为两个专职语言模型:异常提议模型 \(D_\text{pro}\) 负责“发现问题”,仅依赖各结构的单实体全局Token \(\mathbf{S}^v\) 与临床元数据,以链式自回归预测各解剖结构的异常摘要(平均每例CT仅45个Token);报告生成模型 \(D_\text{ful}\) 负责“详述诊断”,接收全局Token、AP-LTF精选的高判别力局部Token集 \(\{\mathcal{G}'_i\}\) 以及临床元数据。在 \(D_\text{ful}\) 的监督微调阶段,将真实标注解析出的异常简表作为前缀拼接在参考报告前组成目标序列,促使模型建立明确的病理认知关联与阴性排查逻辑。这一设计使得全图4096个初始Token被急剧压缩为每个结构1个全局加15个局部Token(10个结构共160个Token,压缩率达96.1%),使轻量级Llama-3.2-3B能够以极低的显存开销完成高质量三维密集生成。

4. GRPO协作强化对齐:抹平两阶段分布断层并纠正单向级联错误

在模型推理过程中,\(D_\text{ful}\) 接收由 \(D_\text{pro}\) 预测的候选异常,而在监督微调阶段 \(D_\text{ful}\) 是在真实异常前缀下训练的,两阶段输入分布存在天然的“暴露偏差(exposure bias)”。更为关键的是,若 \(D_\text{pro}\) 发生漏诊,该漏诊极易在下游级联扩散。为闭合这一分布鸿沟,本文冻结 \(D_\text{ful}\) 与AP-LTF,将 \(D_\text{pro}\) 视作待优化的策略网络 \(\pi_\theta\),采用群体相对策略优化(GRPO)进行联合强化对齐。对于每个CT样本采样 \(G\) 条异常提议路径,以最终生成的诊断报告的临床有效性(CE-F1)与语言学精确度(BLEU-4)构建复合奖励: $\(r = \lambda \cdot \text{CE-F1} + (1-\lambda) \cdot \text{BLEU-4}\)$ GRPO通过组内输出的相对优势标准化替代昂贵的Critic网络,并利用KL散度正则约束策略偏移。该机制不仅驱动 \(D_\text{pro}\) 输出最适配下游阅读器的候选,更赋予系统强韧的容错纠偏机制:得益于AP-LTF中的几何注意力分支,即便 \(D_\text{pro}\) 遗漏了某项异常,模型依然能挽救并召回27.2%的漏诊病变。

损失函数 / 训练策略

整个系统采用分阶段稳健流水线进行训练: 1. 阶段一(异常提议预热):采用自回归交叉熵损失单独微调 \(D_\text{pro}\),建立从全局视觉表征到病变列表的基础提议能力; 2. 阶段二(多模态对齐与滤波训练):冻结 \(D_\text{pro}\),使用复合损失联合优化CT-ViT、结构查询 \(\mathbf{Q}_v\) 及AP-LTF: $\(\mathcal{L}_\text{com} = \mathcal{L}_\text{so-pre} + \mathcal{L}_\text{sparse} + \mathcal{L}_\text{filt}\)$ 3. 阶段三(全局报告生成精调):冻结阶段二提取器,输入真实标注异常提示的Token流,通过异常前缀自回归损失 \(\mathcal{L}_\text{rg}\) 精调 \(D_\text{ful}\); 4. 阶段四(GRPO协作对齐):冻结 \(D_\text{ful}\) 与特征网络,通过组采样相对优势对 \(D_\text{pro}\) 进行策略梯度反传,优化目标为截断裁剪与KL惩罚结合的 \(\mathcal{J}_\text{GRPO}\)。

实验关键数据

主实验

在代表性的大规模真实胸部CT基准 CT-RATE(含25,692例CT及放射报告)与 CTRG-Chest-548K(含1,804例CT)上,本文方法与业界当前最强的CT报告生成基线进行了全方位对比。评测指标涵盖临床有效性指标(CE-Precision, CE-Recall, CE-F1)以及经典自然语言生成指标(BLEU-1, BLEU-4, METEOR, ROUGE-L)。

数据集 方法 CE-Pre. CE-Rec. CE-F1 BL-1 BL-4 MTR RG-L
CT-RATE R2Gen (EMNLP'20) 0.158 0.057 0.066 0.418 0.228 0.414 0.327
CT-RATE PromptMRG (AAAI'24) 0.364 0.297 0.299 0.486 0.214 0.438 0.389
CT-RATE 3D-CT-GPT (2024) 0.242 0.153 0.166 0.459 0.253 0.422 0.361
CT-RATE Reg2RG (TMI'25) 0.423 0.181 0.253 0.473 0.249 0.441 0.367
CT-RATE Liu et al. (IPMI'25) 0.337 0.366 0.315 0.540 0.289 0.472 0.385
CT-RATE Ours 0.467 0.429 0.415 0.535 0.305 0.481 0.396
CTRG-548K PromptMRG (AAAI'24) 0.311 0.347 0.301 0.477 0.283 0.485 0.494
CTRG-548K Liu et al. (IPMI'25) 0.434 0.413 0.393 0.545 0.326 0.509 0.497
CTRG-548K Ours 0.457 0.420 0.399 0.532 0.335 0.512 0.504

在领域专用的深度诊断评测中,针对放射学实体匹配的 RaTEScore 与基于LLM判别的 GREEN 评分上,本文在 CT-RATE 测试集同样取得突破:RaTEScore 达到 0.679(前SOTA Liu et al. 仅为 0.569),GREEN 评分达到 0.433,全面超越针对GREEN进行直接偏好优化的专用模型 \(\mu^2\text{tokenizer}\)(0.429)。

消融实验

在 CT-RATE 测试集上针对各新增模块与不同架构设计进行逐步消融验证,展示各设计对临床指征捕捉与语言生成的独立增益:

配置 核心改动 CE-Pre. CE-Rec. CE-F1 BL-1 BL-4 MTR RG-L
(a) Baseline 单LLM直接输入Top-10注意力Token 0.439 0.343 0.356 0.379 0.199 0.317 0.327
(b) + \(\mathcal{L}_\text{sparse}\) 引入解剖掩码负熵惩罚 0.464 0.367 0.377 0.375 0.192 0.317 0.322
(c) + AP-SFT 训练期加入真实异常前缀引导 0.468 0.397 0.394 0.524 0.282 0.477 0.389
(d) + AP-LTF 扩充至K=200并以提议异常滤波 0.461 0.418 0.391 0.514 0.289 0.447 0.377
(e) + GRPO (Full) 引入策略对齐消除双阶段分布差 0.467 0.429 0.415 0.535 0.305 0.481 0.396
(f) Single-LLM 单一模型兼顾异常提议与报告解码 0.451 0.390 0.381 0.424 0.302 0.393 0.366

关键发现

  • 临床有效性断层式领先:在 CT-RATE 基准上,本文相较于此前业内最佳方法(Liu et al.),将临床诊断核心指标 CE-F1 从 0.315 暴拉至 0.415,相对增益高达 32.0%;召回率(Recall)提升 17.2%,精确率(Precision)提升 10.4%,表明由粗到细的异常聚焦机制极大抑制了影像幻觉与漏诊。
  • 两阶段分布对齐是滤波生效的前提:对比配置 (c) 与 (d) 可发现,单纯加入 AP-LTF 虽能提升召回率(0.397 \(\to\) 0.418),但由于训练使用GT异常而测试依赖预测异常,分布偏移导致 F1 及多数语言学指标不升反降(F1 从 0.394 跌至 0.391)。唯有通过 GRPO 强化对齐 (e),才能激发局部病理筛选的全部潜力,将 F1 提升至 0.415。
  • 双LLM解耦显著优于单LLM多任务:配置 (f) 表明,强行让单个 3B LLM 同时承担异常提议与长报告生成,由于模型容量受限与多任务语义干扰,各项指标出现全线退化(CE-F1 暴跌 0.034,BL-1 狂降 0.111),证明“双智能体分工”在密集容积推理中的必要性。
  • Token压缩与注意力汇的权衡拐点:超参敏感性表明,初始池大小 \(K\) 与保留数 \(K'\) 呈鲜明的倒U型。当 \(K=200, K'=15\) 时达到最优点,总视觉Token压缩至 160 个(压缩率达 96.1%),在单张 V100 (32G) 即可完成高效推理,且时延(87s)较 7B 单模型 baseline(89s)更优。
  • 单向级联错误的突破机制:错误级联审计表明,\(D_\text{pro}\) 发生假阴性(漏诊)的病灶中,下游 \(D_\text{ful}\) 成功在最终报告中独立挽回了 27.2%,证实综合考量注意力权重的滤波打分能够越过文本提议的疏漏,将潜在病灶底层特征输送给解码端。

亮点与洞察

  • 将注意力汇消除引入医学影像报告:敏锐指出了多模态模型中“高注意力并不等同于病理显著性”的物理漏洞,通过异常语义提示与线性评分破除沉没Token支配,为细粒度病变定位提供了兼具稀疏性与判别力的新解法。
  • 轻量级双智能体与强化对齐机制:摒弃单纯依赖全参数大模型的暴力路线,采用两个解耦的 Llama-3.2-3B 分别模拟医生的粗筛与细读,并首次将 GRPO 引入 CTRG 以打通提议与生成的协作瓶颈,实现了小参数规模超越大参数模型的计算性价比。
  • 训练强先验与测试轻量化的优雅统一:在训练期巧妙引入开箱即用的 SAT 提示分割生成解剖掩码施加负熵约束,在测试阶段则彻底抛弃分割分支,兼顾了表征的空间纯粹性与临床部署的高效性。

局限与展望

  • 解剖结构级定位仍存分辨率上限:当前模型以预先定义的 10 个解剖结构为划分粒度,虽然有效规避了跨器官干扰,但对于肺部微小磨玻璃结节(GGO)或细小骨折等亚毫米级局部病变,仍存在特征平均化风险。未来可探索将病灶级别(lesion-level)的自适应动态锚框与稀疏Token相结合。
  • 缺少时间维度的对比阅片能力:临床真实场景下,CT阅片常高度依赖患者前次检查的历史对比(Prior CT Comparison),本框架目前聚焦于单次断层检查的由粗到细检索,尚未集成跨时相的动态病灶演进推理。
  • 模态迁移潜力广阔:该架构中由粗到细的视觉搜索与多源Token过滤策略高度通用,原则上可无缝迁移至 3D 增强核磁(MRI)、PET-CT 等其他大体量、病灶高稀疏的临床三维模态。

相关工作与启发

  • vs Liu et al. (IPMI 2025):此前方案直接依赖解剖查询从全图选取注意力权重最高的 Top-10 Token,极易被无病理语义的“注意力汇”占据;本文构建了从结构全局Token粗提议异常、再由异常反向引导多源打分精筛局部Token的全新闭环,在压缩率相当的前提下实现 CE-F1 超 30% 的跃升。
  • vs Reg2RG / MedRegion-CT:此类区域级方法要求在推理时强制运行沉重的 3D 分割网络以裁剪子器官容积,带来了高昂的计算负担与级联延迟;本文仅在训练期以掩码计算稀疏负熵损失,推理期零分割开销,工程落地性显著更优。
  • vs 3D-CT-GPT / M3D:早期 3D MLLM 多采用朴素的空间池化或整图下采样,导致微小病灶特征在全局压缩中被淹没殆尽;本文通过结构化查询与语义滤波实现了信息的“智能非均匀压缩”,为长序列高维体数据的表征压缩树立了标杆。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ [完整模拟放射医生由粗到细双阶段阅片范式,设计了抗注意力汇的AP-LTF并用GRPO实现两阶段协作闭环]
  • 实验充分度: ⭐⭐⭐⭐⭐ [在两大公开基准上详尽对比,涵盖传统NLG、临床CE、RaTEScore及GREEN指标,消融与级联审计极其透彻]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑架构清晰,临床动机与计算瓶颈结合自然,公式与图表表达严谨规范]
  • 价值: ⭐⭐⭐⭐⭐ [成功在 2×V100 硬件约束下以极高压缩率跑通 3D CT 密集生成,对大体量医学影像多模态落地具有极高借鉴意义]