Flexible Control of 3D CT Generation via Text and Semantically-Defined Segmentation Prompts¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/batmanlab/MedSynV2
领域: 医学图像
关键词: 3D CT生成、可控生成、扩散Transformer、流匹配、多模态引导
一句话总结¶
提出了MedSynV2,通过视频分词器联合表征3D CT与任意单个病灶/解剖分割掩码,结合复合文本提示与门控注意力DiT,实现了仅需局部语义掩码或放射学报告的高分辨率3D CT灵活可控生成。
研究背景与动机¶
三维计算机断层扫描(3D CT)体积图像生成在医学影像中扮演着重要角色,涵盖保护患者隐私的数据增强、逆问题求解的图像先验构建以及放射科住院医师规范化培训等关键任务。然而,在保证解剖一致性的前提下实现高分辨率 3D CT 的精细可控合成极具挑战性。现有方法主要沿袭两条控制路径:基于放射学文本报告的生成模型(如 GenerateCT、MedSyn、Text2CT)以及基于全器官语义分割掩码的引导模型(如 MAISI、3D MedDiffusion)。放射学报告虽具备高度的临床表达灵活性,但其文本用词往往属于粗略定性描述,根本无法精确限定病灶的微观三维位置、几何边缘形态与病变浸润范围;而全语义分割方法虽能提供显式空间约束,却严苛依赖包含数十乃至上百个解剖类别的完整器官标注,推理成本极高且严重削弱了未定义组织的生成多样性。
这一局限的核心矛盾在于:临床实际应用中往往仅关注某单个特定异常病灶(如孤立肺结节、局部胸腔积液或特定肺叶),但现有模型既无法仅凭单器官/单病灶的二值掩码生成真实连贯的全身上下文,也难以将掩码的空间引导与长篇放射学报告的细粒度病理特征无缝协同。若强行使用全器官分割,不仅数据标注昂贵,而且一旦引入未见过的病灶类型就必须重新训练模型。
为了打破全器官掩码依赖与纯文本空间失控的双重壁垒,本文提出将空间二值掩码与文本语义解耦赋予意义。核心 idea:提出 MedSynV2 框架,将任意单器官或病灶二值掩码通过共享视频分词器投影至隐空间并与噪声潜变量早期通道拼接,同时将掩码语义前缀与长篇放射学报告拼合为复合文本提示,在门控注意力扩散 Transformer(DiT)中实现报告文本与局部几何掩码的任意组合可控生成。
方法详解¶
整体框架¶
MedSynV2 的整体生成管线基于潜变量整流流(Latent Rectified Flow)公式构建,利用修改后的 Diffusion Transformer(DiT)在隐空间内从高斯噪声直接预测清晰数据潜变量(\(x_0\) 预测模式)。系统输入支持四种模式的任意组合:仅放射学报告、仅单个病灶/解剖分割掩码、报告与掩码协同引导、或纯无条件生成。输入的三维 CT 卷与分割掩码首先经过仿射对齐消除体位方差,由基于 Open-Sora 微调的三维视频分词器编码为共享通道隐变量;分割掩码的语义身份通过前置提示词(cm)与长篇报告(cr)拼接为复合文本序列,由医学 CXR-BERT 提取嵌入;随后在 DiT 中通过多头自注意力、多头交叉注意力及深度可分离卷积实现特征演进,最后通过常微分方程(ODE)求解器逐步去噪并解码输出 \(448 \times 448 \times 448\) 体积图像。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
In["输入:3D CT卷 x 与 可选二值掩码 m<br/>及 可选放射学报告"] --> T1["共享视频分词器与隐空间投影<br/>Open-Sora 3D VAE 编码为同维度潜变量"]
T1 --> T2["通道早期融合与复合提示编码<br/>拼接 [zt; zm] Patchify 并连接掩码语义与报告文本"]
T2 --> T3["门控注意力 DiT 骨干网络<br/>多头自注意力 + 文本交叉注意力 + 深度可分离卷积"]
T3 --> T4["条件整流流速度场训练与 ODE 采样<br/>v-loss 拟合流匹配矢量场,Dormand-Prince 50步求解"]
T4 --> Out["输出:高分辨率 3D CT 体积图像 x_hat_0"]
关键设计¶
1. 共享视频分词器与隐空间投影:消解 3D 掩码与图像特征异构壁垒
三维高分辨率医学图像体素维度巨大(\(448 \times 448 \times 448\)),直接在体素空间进行扩散训练会导致显存爆炸。以往方法通常使用专用分割编码器,进一步增加了网络参数与显存开销。本文将三维 CT 扫描沿轴状位切片视作时序视频序列,基于预训练 Open-Sora 视频分词器在 CT-Rate 图像数据上进行微调。图像 \(x\) 被编码为潜变量 \(z_0 = \text{Enc}(x) \in \mathbb{R}^{(n_d \times n_h \times n_w) \times n_c}\),具体维度压缩至 \((112 \times 56 \times 56) \times 4\)。关键机制在于,分割掩码 \(m\) 同样直接送入同一冻结的图像编码器获得 \(z_m = \text{Enc}(m)\),无需为掩码额外设计特征提取分支。这使得图像潜变量与空间掩码在统一表征流形上对齐,在将 \(z_t\) 与 \(z_m\) 进行通道拼接后 Patchify 处理,完全不增加序列 token 数量(保持 43,904 个 tokens),以极低计算代价实现了三维空间精确几何先验的注入。
2. 复合提示策略与门控注意力:平衡长文本推理与任意单器官语义定义
单目标二值分割掩码本身缺乏类别标签(不同于多类别 one-hot 张量),同一团块状掩码在临床上可能对应肺结节、胸腔积液或心脏边缘。为此,本文设计了复合文本提示 \(c_{\text{text}}\):在前置位置放置掩码身份描述语句 \(c_m\)(例如 "I give you segmentation of <The Heart>",若无掩码则填充空条件声明),后接可选的长篇放射学报告 \(c_r\)(拼接 Findings 与 Impressions,最长 512 tokens)。在 DiT 的跨注意力层中,针对放射学长文本易引发“注意力沉降”(Attention Sink)且后半部分临床病理词常被忽视的问题,引入门控注意力机制(Gated Attention):
通过门控向量 \(G_h\) 对跨注意力输出实施非线性稀疏调制,使模型能够均匀关注报告中后段关键病变描述,彻底打通局部空间提示与长篇全局病理描述的协同控制。
3. 块后深度可分离卷积:强化三维局部连续性与解剖一致性
标准 DiT 架构采用全注意力机制建立全局 token 关联,但其自注意力偏重长程上下文建模,容易破坏 CT 图像在切片与切片、体素块与体素块间的细微解剖连续性,导致冠状位与矢状位出现伪影与断层。为了增强局部几何归纳偏置,本文在每个 DiT Block 的多头注意力与前馈网络之后,追加轻量级三维深度可分离卷积(Depth-Sep-Conv):
该模块在通道内部和空间维度分别执行卷积操作,以极低的参数量强化了邻近 patch 之间的局部纹理平滑性与器官边界连贯性。定性对比显示,加入深度可分离卷积后,肺血管树分叉、支气管壁及胸膜界面的细微结构边缘显著清晰,彻底消除了由于 Patch 切割导致的网格状边缘伪影。
损失函数 / 训练策略¶
模型采用基于潜变量的条件整流流(Conditional Rectified Flow)目标函数训练。设 clean 潜变量为 \(z_0\),高斯噪声为 \(\omega \sim \mathcal{N}(0, I)\),线性插值轨迹构建为 \(z_t = (1-t)z_0 + t\omega\)(\(t \in [0, 1]\))。网络直接预测干净潜变量 \(z_\theta(z_t, t, c)\),对应的整流流速度场与损失函数定义为:
在训练过程中采用多模态条件随机 Dropout 策略:在每个批次内,样本随机分布为(1)仅放射学报告、(2)仅带语义描述的分割掩码、(3)报告与掩码双模态具备、(4)无条件生成。当掩码缺失时设置 \(z_m = 0\)。模型在单卡 A100 GPU 上采用 AdamW 优化器、学习率 \(10^{-4}\) 进行训练,batch size 为 1 配合 4 步梯度累积。推理阶段采用 Dormand-Prince 常微分方程求解器,仅需 50 步积分即可恢复高质量 \(z_0\) 并解码得到最终 CT 图像。
实验关键数据¶
主实验¶
实验基于 CT-Rate 数据集(25,692 对胸部 CT 与报告),在四个临床对比度窗口(肺窗、血管窗、软组织窗、骨窗)下,针对轴位(XY)、矢状位(YZ)、冠状位(ZX)三个正交切面全面评测仅输入文本报告时的 FID 分数。
| 模型 | 肺窗 Mean FID ↓ | 血管窗 Mean FID ↓ | 软组织窗 Mean FID ↓ | 骨窗 Mean FID ↓ |
|---|---|---|---|---|
| GenerateCT (ECCV 2024) | 14.27 | 10.37 | 12.54 | 8.71 |
| MedSyn (TMI 2024) | 12.83 | 15.72 | 17.52 | 7.44 |
| Text2CT (arXiv 2025) | 12.58 | 9.35 | 11.96 | 7.36 |
| MedSynV2 (Ours) | 9.59 | 6.46 | 8.47 | 4.58 |
在语义一致性评测中,采用 Pillar-0(11 个窗口)计算文本到图像(T2I)CLIP-Score,并利用零样本 CT-CLIP 评测 18 类病理分类准确度:
| 来源 / 模型 | Pillar-0 T2I (%) ↑ | Pillar-0 I2I (%) ↑ | 分类 AUROC (%) ↑ | 分类 F1 (%) ↑ |
|---|---|---|---|---|
| Real (真实参考) | 26.36 | — | 67.34 | 58.95 |
| GenerateCT | 22.10 | 32.11 | 50.57 | 26.33 |
| MedSyn | 22.75 | 44.59 | 51.32 | 40.12 |
| Text2CT | 25.80 | 49.38 | 50.96 | 37.43 |
| MedSynV2 (Ours) | 27.61 | 46.79 | 52.24 | 48.40 |
消融与下游增强实验¶
作者在 SemiSeg 磨玻璃影(GGO)分割数据集上测试生成数据对真实训练集的下游增强效用。对比使用 50 例真实图像、416 例合成图像以及混合数据集(466 例)训练标准 UNet 的分割性能:
| 训练数据配置 | 样本量 | Dice (%) ↑ | Jaccard (%) ↑ | ASD (pixel) ↓ | HD95 (pixel) ↓ |
|---|---|---|---|---|---|
| 真实数据 (Real) | 50 | 58.78 | 43.49 | 21.65 | 65.33 |
| 合成数据 (Synthesized) | 416 | 48.82 | 32.30 | 56.32 | 10.61 |
| 混合增强 (Combined) | 466 | 68.13 | 54.27 | 43.32 | 4.69 |
| Inf-Net (领域基线) | — | 62.41 | 45.35 | 32.67 | 20.63 |
| MedPSeg (SOTA模型) | — | 65.20 | 48.13 | 28.45 | 5.51 |
关键发现¶
- 各向同性一致性突破:GenerateCT 由于在轴位切片超分辨率合成,导致矢状位(YZ 14.07)与冠状位(ZX 21.71)断层严重;MedSynV2 利用 3D DiT 与深度可分离卷积实现了全局连续性,在肺窗冠状位 FID 达到 11.40(大幅优于 Text2CT 的 17.69),整体平均 FID 提升达 24%。
- 数据增强收益显著:仅用 416 例由掩码与文本合成的 CT 样本补充真实数据后,下游 GGO 分割模型的 Dice 从 58.78% 飙升至 68.13%(相对提升 +9.35%),HD95 从 65.33 骤降至 4.69,甚至显著超越了专门设计的 SOTA 模型 MedPSeg(65.20%),证明其生成的解剖与病理特征具备强泛化价值。
- 放射科专家双盲评估高度一致:两位分别拥有 4 年和 17 年临床经验的放射科医师在 150 例双盲评测中,认定合成样本的 Match(40/36例)与 Partial Match(18/30例)分布与真实图像高度吻合,Not Match 仅占极低比例(17/9例),证实生成结果符合真实生理与病理表型。
亮点与洞察¶
- 解耦掩码与语义的“即插即用”控制:将空间轮廓通过视频 VAE 与隐变量通道拼接,将语义类别完全交由前置文本 \(c_m\) 指定。这一设计彻底摆脱了传统 ControlNet 必须预定义固定 \(N\) 类全器官语义分割的枷锁,赋予用户仅提供单个病灶二值掩码即可生成完整扫描的极致自由度。
- 三维医学生成的单卡平民化实践:通过统一 3D 视频分词器将 \(448^3\) 空间压缩至 \(112 \times 56 \times 56 \times 4\),配合通道合并 Patchify,在不增加 token 序列长度的前提下实现了单卡 A100 的完整训练与 50 步高速采样。
- 疾病渐进模拟的可泛化性:借助 SDEdit 范式,模型展示了从健康肺叶出发、逐步注入胸腔积液掩码、再引入微小转移性结节的多阶段疾病演变模拟能力,为临床教学和病理 progression 仿真开辟了新范式。
局限与展望¶
- 跨中心与扫描机型域偏移:模型当前主要在 CT-Rate 数据集上完成对齐与训练,对低剂量扫描(LDCT)、不同层厚参数或严重对比剂伪影的多中心 CT 泛化鲁棒性仍待检验。
- 复杂重叠多病灶的语义消歧:当同时输入相互接触或在解剖上重叠的多个掩码时,简单的单通道二值拼接与串联前置文本可能会出现局部属性混淆,未来可探索多通道实例级独立掩码注入机制。
相关工作与启发¶
- vs MedSyn:MedSyn 在体素域直接处理多分辨率生成且在特定数据集上训练,生成软组织窗时伪影较多且对解剖掩码约束松散(器官易溢出掩码边界);MedSynV2 转向潜变量流匹配与通道早期融合,掩码对齐极为严格且生成保真度更高。
- vs MAISI-v2:MAISI 系列依赖覆盖 100+ 类别的全器官分割掩码才能启动生成,缺乏放射学文本支持;MedSynV2 支持单病灶二值掩码、长篇文本报告或二者的灵活组合,在临床实用性和生成多样性上具备明显优势。
评分¶
- 新颖性: ⭐⭐⭐⭐ [创新地将单二值掩码的空间引导与前置文本语义解耦,突破了全器官分割依赖]
- 实验充分度: ⭐⭐⭐⭐⭐ [四大对比度窗口正交面FID、双CLIP评分、下游分割增强与放射科双盲测试一应俱全]
- 写作质量: ⭐⭐⭐⭐⭐ [问题提炼精准,架构与数学表达清晰流畅,定性图示与消融设计严谨]
- 价值: ⭐⭐⭐⭐⭐ [为医学可控 3D CT 合成确立了灵活多模态条件标杆,代码开源具有重要实用价值]