DiffVP: Differential Visual Semantic Prompting for LLM-Based CT Report Generation¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/ArielTYH/DiffVP
领域: 医学图像
关键词: 3D CT报告生成 / 视觉语言模型 / 语义差异建模 / 正常参考先验 / 差异视觉提示
一句话总结¶
受放射科医师“认知减法(对正常解剖的比较推理)”启发,DiffVP 引入正常胸部 CT 扫描作为视觉参考先验,通过分层差异提取器在对齐的潜在语义空间中建模全局与局部病理差异,并将其映射为可学习的视觉前缀提示注入 LLaMA-2,在无需显式病灶分割的情况下显著提升报告的诊断敏感度与细粒度描述质量。
研究背景与动机¶
三维计算机断层扫描(3D CT)是现代临床中疾病筛查、诊断和治疗规划的核心影像手段,但由于 CT 体积数据庞大、切片数量繁多且病理表现极其细微,放射科医师需要逐层阅片并书写详尽报告,工作负荷极其繁重。近年来,以大语言模型(LLM)为基础的自动化医学报告生成技术快速兴起,代表性方案(如 R2GenGPT、Reg2RG 等)普遍采用编码器-解码器范式:先通过 3D 视觉编码器将 CT 体积编码为一组视觉标记(Visual Tokens),再将全部标记无差别地送入 LLM 中自回归解码生成报告文本。
然而,这种无差别的视觉标记输入策略与临床放射科医师的实际读片认知过程存在严重背离。在临床实践中,放射科医生并非孤立地审视病灶,而是以大脑中预存的“正常解剖结构先验”为基准,通过心理上的“认知减法”对比待查图像与正常状态之间的偏离。更重要的是,由于人体解剖结构的个体差异以及不可避免的配准误差,这种比较绝非低层级的像素级相减,而是一种高度抽象的语义级差异感知。现有单扫描(Single-scan)LLM 范式缺乏对比参考,而 3D CT 体积中骨骼、肌肉等正常解剖背景占据了绝大多数体素,稀疏微小的病灶特征极易被海量背景冗余所稀释,导致大模型倾向于生成笼统模版化的描述,遗漏病变亚型、尺寸量化及解剖亚区定位等高价值诊断细节。
针对这一核心矛盾,本文提出摒弃脆弱的底层像素减法与耗费繁琐标注的显式病灶分割,转而在紧凑的潜在语义空间中引入正常扫描作为对照先验,通过显式建模待查扫描相对于正常状态的语义偏差来重塑视觉特征权重。核心 idea:引入配对的正常胸部 CT 扫描作为对比先验,在重采样对齐的潜在标记空间中协同提取多尺度全局结构漂移与局部几何偏差,并将其投影为引导 LLM 解码的连续视觉差异前缀提示(Differential Visual Prompt),在隐式抑制冗余解剖的同时放大关键诊断信号。
方法详解¶
整体框架¶
DiffVP 的完整推理流水线包含三个核心阶段:双路体素特征提取与潜在空间对齐、分层差异表征提取以及差异到前缀提示的生成与多模态序列组装。给定患者的待测 3D CT 体积 \(X\) 以及从正常参考库中选取的无异常对照 CT 体积 \(X_{\text{ref}}\),系统首先利用参数冻结的 3D ResNet-18 提取密集体素级特征,并通过共享潜在查询的 Q-Former 风格重采样器将高维体素特征压缩到固定的紧凑标记空间中,分别得到结构对齐的目标特征 \(I\) 与参考特征 \(I^r\)。随后,分层差异提取器(HDE)从全局和局部两个互补维度计算差异张量 \(\Delta_{\text{global}}\) 与 \(\Delta_{\text{local}}\);差异-提示词生成器(DPG)将二者融合并投影扩展为连续的视觉前缀提示 \(\Delta_{\text{prompt}}\);最后将差异前缀与原始视觉标记、冻结分类器预测的疾病语义先验及指令提示拼接,输入经 LoRA 微调的 LLaMA-2 中自回归生成诊断报告。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入:待查 CT 卷 X 与正常对照 CT 卷 X_ref"] --> B["3D ResNet-18 编码与共享查询重采样<br/>得到对齐潜在标记 I 与 I^r"]
B --> C["分层差异提取器<br/>全局 Transformer 算子与局部距离加权聚合"]
C --> D["差异-提示词生成器<br/>MLP 融合与序列扩展为 16 维视觉软前缀"]
D --> E["诊断语义锚定与混合序列构建<br/>拼接差异前缀、原图特征、分类语义与指令"]
E --> F["LLaMA-2 解码器 (LoRA 微调)<br/>自回归输出结构化临床放射学报告"]
关键设计¶
1. 分层差异提取器:解耦全局结构漂移与局部病理偏离
3D CT 容积内的病理改变具有多尺度特性,既包含器官形态扭曲、纵隔移位等大范围解剖形态变异,也涵盖细小肺结节、局部亚段肺不张等微小结构异常。针对这一特性,分层差异提取器(HDE)放弃脆弱的直接体素差分,在重采样得到的固定长度潜在标记空间中构建全局与局部双重算子: - 全局 Delta 算子:引入可学习的全局差异查询向量 \(\delta \in \mathbb{R}^d\),将其与目标标记 \(I\) 和参考标记 \(I^r\) 拼接后送入一层 Transformer 层进行联合跨注意力交互,提取查询向量对应的输出隐状态: $\(\Delta_{\text{global}} = \mathcal{D}_{\text{diff}}(I, I^r) = \operatorname{Transformer}_\theta([\delta; I; I^r])_\delta\)$ 该算子聚合了整扫描维度的宏观语义与解剖漂移信息。 - 局部 Delta 算子:为了捕获局部病灶的偏离强度且不破坏解剖连续性,该算子直接在成对的对齐潜在标记 \((I_i, I^r_i)\) 上运作,依据二者在潜在度量空间中的欧氏几何距离动态赋予归一化权重 \(w_i\): $\(w_i = \frac{\|I_i - I^r_i\|_2^2}{\sum_{j=1}^N \|I_j - I^r_j\|_2^2 + \epsilon}\)$ 随后对残差向量进行距离加权聚合,生成局部偏差表征 \(\Delta_{\text{local}} = \sum_{i=1}^N w_i (I_i - I^r_i)\)。该机制完全无参,使得语义偏离最大的病理区域能够在统计上占据绝对主导地位,有效抵御正常解剖微小形变带来的噪声干扰。
2. 差异-提示词生成器:将潜在几何偏差投影为连续视觉软前缀
提取出的全局与局部差异特征仍位于视觉特征空间,无法直接为自回归文本模型所理解。差异-提示词生成器(DPG)通过通道拼接融合 \(\Delta_{\text{global}}\) 与 \(\Delta_{\text{local}}\),利用多层感知机(MLP)投影矩阵将其投影并重塑为与语言模型词嵌入空间维度一致的连续软前缀: $\(\Delta_{\text{prompt}} = \operatorname{Projector}([\Delta_{\text{global}}; \Delta_{\text{local}}]) \in \mathbb{R}^{p \times d_{\text{LLM}}}\)$ 实验表明,将前缀标记长度设为 \(p=16\) 时模型表现达到最优峰值。这 16 个差异提示标记被置于语言模型输入序列的最前列,在自回归因果注意力机制中充当强引导先验,动态调整后续所有视觉标记的注意力分布,迫使模型将计算资源集中在病变区域,从而抑制骨骼和肌肉等无病变解剖背景的过度表达。
3. 诊断语义锚定与混合序列构建:兼顾原图完整解剖与显式疾病先验
若仅向 LLM 提供差异提示,模型可能会丢失患者完整的全局解剖背景(如各器官的相对空间关系和正常解剖上下文)。因此,DiffVP 采用互补的混合输入序列构建方案,将四个异构组件在序列维度拼接为 \(\mathcal{X}_{\text{in}} = [\Delta_{\text{prompt}}; I; E; T]\): - \(\Delta_{\text{prompt}}\):16 个连续可学习的视觉差异前缀标记; - \(I\):目标 CT 经重采样得到的原始视觉标记,确保整体生理结构的完整保留; - \(E\):利用在独立 18 类常见胸部疾病(如心脏扩大、肺气肿、结节等)上离线预训练且参数冻结的 3D ResNet-18 分类器预测的高置信度疾病类别,转化为离散文本锚点注入,提供顶层疾病先验并避免训练信息泄露; - \(T\):结构化的指令提示文本,规范生成报告的格式要求。
损失函数 / 训练策略¶
系统采用多任务联合优化策略,总体损失函数由报告文本生成损失与辅助疾病分类损失加权构成: $\(\mathcal{L}_{\text{total}} = \mathcal{L}_{\text{gen}} + \mathcal{L}_{\text{cls}}\)$ 其中报告生成损失 \(\mathcal{L}_{\text{gen}}\) 针对真实报告序列 \(Y = \{y_1, \dots, y_L\}\) 采用自回归标准负对数似然损失(Negative Log-Likelihood, NLL): $\(\mathcal{L}_{\text{gen}} = -\sum_{t=1}^L \log P(y_t \mid y_{<t}, \mathcal{X}_{\text{in}}; \theta)\)$ 辅助分类损失 \(\mathcal{L}_{\text{cls}}\) 基于 \(K=18\) 个疾病标签采用二元交叉熵损失(BCE),用于正则化视觉编码表示并保障诊断语义的一致性。视觉编码器与预训练分类网络保持冻结,仅训练 Q-Former 重采样器、HDE 差异算子、DPG 投影器以及通过 LoRA 微调的 LLaMA-2-7B 语言骨干,在 4 块 NVIDIA H20 GPU 上使用学习率 \(5 \times 10^{-5}\) 训练 10 个 epoch。
实验关键数据¶
主实验¶
论文在两大公开三维胸部 CT 数据集 RadGenome-ChestCT(25,692 对扫描报告,官方切分 24,128 训练 / 1,564 测试)和 CTRG-Chest-548K(1,804 对扫描报告)上进行了全面评测,对比了通用多模态基座大模型(RadFM、M3D)以及专业级 3D 报告生成方法(R2GenGPT、MedVInT、CT2Rep、Reg2RG)。评价指标涵盖自然语言生成质量(BLEU-1~4、ROUGE-L、METEOR)以及基于 RadBERT 抽取的 18 类病理临床有效性指标(Clinical Efficacy, CE: Precision、Recall、F1-Score)。
| 数据集 | 方法 | 年份 | BLEU-1 | BLEU-2 | BLEU-3 | BLEU-4 | ROUGE-L | METEOR |
|---|---|---|---|---|---|---|---|---|
| RadGenome-ChestCT | RadFM† | 2023 | 44.20 | 34.49 | 28.06 | 23.65 | 31.53 | 39.94 |
| M3D† | 2023 | 43.57 | 34.48 | 28.54 | 24.49 | 32.61 | 39.95 | |
| R2GenGPT | 2023 | 43.28 | 34.11 | 28.16 | 24.16 | 32.26 | 39.85 | |
| MedVInT | 2024 | 44.28 | 34.91 | 28.75 | 24.60 | 32.58 | 40.39 | |
| CT2Rep | 2024 | 44.42 | 34.43 | 27.94 | 23.56 | 30.99 | 40.16 | |
| Reg2RG | 2025 | 47.25 | 36.49 | 29.57 | 24.87 | 36.65 | 44.07 | |
| DiffVP (本文) | 2026 | 58.16 | 48.74 | 40.93 | 34.28 | 32.32 | 47.40 | |
| CTRG-Chest-548K | RadFM† | 2023 | 48.66 | 40.28 | 34.73 | 30.89 | 49.08 | 49.18 |
| M3D† | 2023 | 46.27 | 39.02 | 34.23 | 30.86 | 50.24 | 49.26 | |
| R2GenGPT | 2023 | 41.82 | 36.37 | 32.70 | 30.10 | 50.93 | 47.05 | |
| MedVInT | 2024 | 47.38 | 39.60 | 34.28 | 30.68 | 49.53 | 49.32 | |
| CT2Rep | 2024 | 42.28 | 36.16 | 32.08 | 29.19 | 50.17 | 47.00 | |
| Reg2RG | 2025 | 49.63 | 41.43 | 35.91 | 32.04 | 47.76 | 49.71 | |
| DiffVP (本文) | 2026 | 50.37 | 46.57 | 41.94 | 37.57 | 45.00 | 50.44 |
在 RadGenome-ChestCT 的临床有效性(CE)评测中,DiffVP 的各项指标对比显著:
| 方法 | 模型类型 | 临床精准率 (Precision) | 临床召回率 (Recall) | 综合 F1 值 (F1-Score) |
|---|---|---|---|---|
| RadFM† | 视觉语言基座大模型 | 0.382 | 0.131 | 0.195 |
| M3D† | 视觉语言基座大模型 | 0.407 | 0.090 | 0.148 |
| R2GenGPT | 专用报告生成模型 | 0.340 | 0.066 | 0.110 |
| MedVInT | 专用报告生成模型 | 0.377 | 0.148 | 0.212 |
| CT2Rep | 专用报告生成模型 | 0.317 | 0.089 | 0.139 |
| Reg2RG | 专用报告生成模型 | 0.423 | 0.181 | 0.253 |
| DiffVP (本文) | 专用报告生成模型 | 0.366 | 0.496 | 0.421 |
消融实验¶
论文在 RadGenome-ChestCT 上系统验证了各核心模块的增益贡献,并对视觉前缀长度 \(p\) 进行了超参敏感性剖析:
| 配置编号 | 全局算子 \(\Delta_{\text{global}}\) | 局部算子 \(\Delta_{\text{local}}\) | 诊断锚点 \(E\) | BLEU-1 | BLEU-4 | METEOR | ROUGE-L | CE Precision | CE Recall | CE F1-Score |
|---|---|---|---|---|---|---|---|---|---|---|
| Baseline | - | - | - | 55.29 | 33.17 | 44.11 | 31.94 | 0.295 | 0.109 | 0.159 |
| #1 | - | - | ✓ | 55.62 | 33.44 | 44.80 | 32.35 | 0.311 | 0.217 | 0.256 |
| #2 | ✓ | - | ✓ | 57.46 | 33.20 | 46.63 | 32.08 | 0.373 | 0.459 | 0.411 |
| #3 | - | ✓ | ✓ | 57.68 | 33.89 | 47.67 | 32.76 | 0.360 | 0.464 | 0.406 |
| Ours (完整) | ✓ | ✓ | ✓ | 58.16 | 34.28 | 47.40 | 32.32 | 0.366 | 0.496 | 0.421 |
视觉前缀长度 \(p\) 对生成质量的影响(RadGenome-ChestCT):
| 前缀长度 \(p\) | BLEU-1 | BLEU-2 | BLEU-3 | BLEU-4 | METEOR | ROUGE-1 | ROUGE-2 | ROUGE-L |
|---|---|---|---|---|---|---|---|---|
| \(p=4\) | 53.97 | 44.29 | 36.37 | 29.72 | 43.37 | 59.63 | 38.41 | 31.46 |
| \(p=8\) | 57.98 | 48.60 | 40.78 | 34.13 | 47.96 | 63.48 | 42.60 | 32.43 |
| \(p=16\) (默认) | 58.16 | 48.74 | 40.93 | 34.28 | 47.40 | 63.52 | 42.63 | 32.32 |
| \(p=24\) | 56.89 | 47.46 | 39.79 | 33.32 | 47.33 | 62.33 | 41.49 | 32.27 |
| \(p=32\) | 56.24 | 46.51 | 38.43 | 31.53 | 46.19 | 61.82 | 40.38 | 31.23 |
关键发现¶
- 临床召回率实现质的飞跃:完整模型在 RadGenome-ChestCT 上的临床召回率(CE Recall)达到 0.496,相较于先前最强方法 Reg2RG(0.181)提升了 174%,CE F1 从 0.253 跃升至 0.421。这直接证明了正常参考先验能够有效打破大模型只关注大面积显著解剖结构的局限,将关注力牵引至隐蔽、微小或多发性的阳性病理改变。
- 全局与局部互补分工明确:消融实验表明,单加全局 Delta 算子(#2)带来高 Precision(0.373)和较好的整体语义一致性;单加局部 Delta 算子(#3)在 METEOR 和 ROUGE-L 上表现突出;当二者结合时,长距离 n-gram 精准匹配指标 BLEU-4 达到最高的 34.28,病理检出平衡度最佳。
- 语义层级比较远优于像素层级减法:在特征层级对比实验中,潜在语义差异计算在 BLEU-1 和 CE-F1 上均显著压制像素级直接相减(Pixel-level Diff)。这是因为 3D CT 体积由于呼吸相差异和刚体/非刚体形变,像素级差分会引入大量假阳性边缘伪影,而潜在标记经过语义池化,天然具有配准鲁棒性。
- 注意力稀疏化聚集:对潜在标记几何距离的重要性分布分析表明,基线模型的标记重要性分布接近均匀分布(无法区分病灶与正常背景),而注入 \(\Delta_{\text{prompt}}\) 后呈现高度稀疏性,前 8 个标记便捕获了 45% 的重要性权重,与临床医生聚焦异常病灶的阅片规律高度吻合。
- GPT-5 临床轴评估全面领先:在利用 GPT-5 作为裁判模型(LLM-as-a-Judge)开展的双盲成对评估中,DiffVP 在细粒度(Granularity, 74.7% 胜率)、病灶定位(Localization, 74.0% 胜率)、量化描述(Quantification, 73.3% 胜率)以及临床敏感度(Sensitivity, 63.7% 胜率)五个维度均以悬殊优势胜出。
亮点与洞察¶
- “认知减法”向视觉软提示的优雅转化:将放射科医师对比正常解剖的临床直觉,抽象为共享查询潜在空间中的局部距离加权与全局注意力聚合,并以 Soft Visual Prefix 形式注入 LLM,无需复杂的两阶段显式分割掩码即可实现无监督的病理注意引导。
- 度量空间加权残差的无参设计:局部 Delta 算子采用归一化欧氏距离直接计算自适应权重,完全无参且可解释性极高,不仅大幅降低了额外网络参数和显存开销,还从数学机制上保证了偏离正常先验越大的区域权重越集中。
- 可复用的差分模态迁移范式:该范式不仅适用于 3D 胸部 CT,其“正常参考库采样 + 共享潜在空间重采样 + 差分软提示”的管线能够平滑迁移至 3D 脑部 MRI 肿瘤监测、胸腹多期增强 CT 对比等纵向病灶演进或异常检测任务中。
局限与展望¶
- 正常对照选取依赖标注先验:当前方案需要从训练集和测试集中基于报告无异常的文本规则筛选出专门的“正常参考池”,并采用随机配对策略。若面对罕见扫描部位或缺乏明确正常阴性报告的极端小样本场景,构建可靠的正常参考集将受到限制。
- 参考扫描与待测样本的生理异质性未显式建模:目前的参考扫描配对采用随机抽取,未根据患者年龄、性别、体型或扫描造影期相做细粒度的生理条件匹配,可能在极端形态差异下引入轻微的生理偏离噪声。
- 未来方向:未来可探索免参考集的主动生成式参考(例如利用 3D 生成模型条件重建患者自身的伪正常 CT),或设计自适应检索机制按解剖和患者元数据动态匹配最相似的正常参考扫描。
相关工作与启发¶
- vs Reg2RG (TMI 2025): Reg2RG 严重依赖预先训练的解剖器官分割网络来提取解剖区域特征与文本对齐,流程依赖繁琐的标注掩码且难以覆盖器官外游离病灶;DiffVP 采用隐式差异建模与前缀提示,无需任何解剖分割先验即可让模型自主聚焦变异区域,BLEU-4 提升了 +9.41(34.28 vs 24.87),CE 召回率更是提升了将近两倍。
- vs DiffRGenNet (MIDL 2025) & 传统差分方案: 传统医学图像差分多局限于 2D X 光片上的简单特征向量相减或提取孤立图像块,破坏了 3D 容积数据的跨切片空间连续性;DiffVP 是首个在 3D CT 完整体素标记序列上分层构建全局 Transformer 与局部几何距离加权差分的框架,并创新性地将差异升格为 LLM 的可学习前缀提示,而非仅作为下游解码器的附加隐变量。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐(巧妙模拟放射科医生认知减法,开创性地将 3D CT 语义差异转化为 LLM 视觉前缀提示)
- 实验充分度: ⭐⭐⭐⭐⭐(在两大主流大规模 CT 数据集上评测,覆盖 NLG 指标、RadBERT 临床指标、消融实验、距离分布分析以及 GPT-5 五维临床裁判)
- 写作质量: ⭐⭐⭐⭐⭐(动机阐述深刻,方法数学推导清晰严密,实验图表极为详实直观)
- 价值: ⭐⭐⭐⭐⭐(大幅突破 3D CT 报告生成的临床敏感度与细粒度量化瓶颈,为多模态临床决策支持系统提供了极具启发性的技术路线)