Atlas is Your Perfect Context: One-Shot Customization for Generalizable Foundational Medical Image Segmentation¶
会议: ECCV 2026
Paper: https://eccv.ecva.net/virtual/2026/poster/3573
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/2028.pdf
代码: https://github.com/yuyi1005/AtlasSegFM
领域: 医学图像
关键词: 单样本分割、解剖图谱、医学图像配准、测试时适应、自适应融合
一句话总结¶
AtlasSegFM 用一例带标注的解剖图谱自动提示冻结的医学分割基础模型,再通过测试时学习的逐体素融合保留两者优势,在 SegRap 上把 nnInteractive 五点击基线的 Dice 从 50.02 提高到 69.19,但仍依赖支持病例与目标病例的解剖对应关系。
研究背景与动机¶
医学交互分割基础模型解决了“无需为每个器官重新训练分割器”的部分问题,却没有解决“怎样准确传达当前临床任务”。一个点击只能说明大致位置,未必说明应该包含哪些结构、在哪里截断、是否需要区分相邻组织。nnInteractive、MedSAM2 在常见结构上可以依靠预训练知识理解提示,但面对细小危及器官、复杂血管或少见标注约定时,更多点击也不一定能补足任务上下文;而且每个新病例都要交互,难以批量处理同一临床流程中的病例。
另一条路线是上下文学习:提供一例影像及其掩码,让模型理解“这次要分割什么”。UniverSeg、Iris 等方法为此预先训练跨任务匹配能力,代价是需要专门组织大量标注任务,也不容易直接利用不断更新的现成基础模型。传统图谱配准恰好拥有相反优势:无需先学习新类别,只要把支持影像配准到查询影像,就能转移已有标签;但形变匹配不完美,转移的边界常常粗糙,局部细节也容易错位。
本文没有再训练一个统一分割基础模型,而是让图谱承担“解释任务”的职责,让已有基础模型承担“恢复局部形状”的职责,再判断不同位置应该信谁。这里的 one-shot 指每个分割上下文只有一个带标注的支持病例,并不表示推理过程完全没有参数更新。核心 idea:把配准后的解剖图谱同时用作自动提示和结构先验,以冻结基础模型细化局部边界,再利用支持标签构成的循环监督在测试时学习空间自适应融合。
方法详解¶
整体框架¶
输入是一对支持影像与支持掩码,以及一幅没有标注的查询三维影像;输出是查询坐标系中的目标结构掩码。 对于多类别数据,每个类别单独视为一个分割上下文,而不是默认一次支持提示就完成全部类别识别。 流程依次包含图谱配准与提示生成、冻结基础模型细化、图谱—模型自适应融合三个环节。 配准同时产生粗掩码和空间变换:前者为分割模型提供任务上下文,后者让最终预测能够返回支持坐标系接受监督。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["支持影像与标签<br/>查询影像"] --> B["图谱配准与提示生成"]
B --> C["冻结基础模型细化"]
B -->|图谱粗掩码| D["图谱—模型自适应融合"]
C -->|模型预测| D
D --> E["查询分割结果"]
D -.->|回到支持空间计算损失| F["支持标签监督"]
F -.->|仅更新融合估计器| D
基础模型始终冻结;需要更新的是配准网络和轻量融合估计器。 因此,这不是仅做一次前向传播的免训练方法,也不是用查询真值微调大模型。 图中的循环专门表示融合阶段的测试时优化,配准网络另由支持—查询影像相似度优化。 对于不接受提示的 vesselFM,第二阶段直接输入查询影像,图谱仍通过第三阶段影响最终结果。
关键设计¶
1. 图谱配准与提示生成:把单例标注变成查询空间中的解剖上下文
支持掩码不能直接叠到新病例上,因为体位、器官大小和扫描几何都会变化。 作者先做刚性和仿射预配准,再采用 Recursive Deformable Pyramid(RDP)的双流编码器与金字塔解码器,从粗到细估计非刚性形变。 关键改动不在于重新提出 RDP,而在于把其优化方式改为针对当前图谱—查询对的测试时拟合,不要求收集目标任务的训练集。 预配准先消除明显的位置和尺度偏差,避免后续形变网络同时承担大幅全局对齐与细节校正。
原文式(2)的目标可写为:
这里优化的是影像相似度,不是查询分割标签;实现使用归一化互相关(NCC)。 同一个变换施加到支持标签后,得到查询空间中的图谱粗掩码。 它不仅标记目标所在位置,还携带目标范围和合理形状,因此比单个稀疏点更接近“临床任务的示例”。 这一先验也有边界:如果查询中存在支持病例没有的病灶,空间对应本身就不能创造缺失的病灶概念。
粗掩码可以适配不同提示接口:取最大连通区域的质心生成点击,在中间轴向切片上取包围框,或直接提供掩码。 文中点和框遵循单切片提示协议;nnInteractive 由此推断三维体积,MedSAM2 从中间切片向两个方向传播。 默认使用掩码提示,并不等于必须人工标注每个查询病例的掩码:查询掩码来自支持标签的自动形变转移。 这种接口转换是连接经典图谱方法与现成基础模型的关键,不需要改变后者的网络结构。
2. 冻结基础模型细化:利用预训练表征,而不是把配准结果直接当答案
配准后的标签有整体结构,却可能在细小边界和局部形状上不准确。 对于 nnInteractive 和 MedSAM2,查询影像与自动生成的提示共同进入冻结模型,由模型根据实际影像内容重新估计目标掩码。 这样,配准并非最终判决,而是给基础模型一个有形状、有范围的任务起点。 相比每个病例重新提供一至五个点击,人工标注成本被转移为每个上下文一次完整支持标注;两种成本不能只按“点击次数”直接等同。
这个阶段也并不保证基础模型总能纠错。 如果模型在预训练中偏好把某个解剖结构视为整体,它可能忽略支持标签中的人为分区;如果目标不常见,局部预测也可能不可靠。 因此作者保留图谱掩码,而不是只把它用完即弃,下一阶段还会重新比较图谱与模型的判断。 血管实验采用非交互的 vesselFM,它不接收点、框或掩码,直接产生自身预测,再与图谱结果融合;不能把这条分支描述成“图谱提示提升了 vesselFM”。
3. 图谱—模型自适应融合:利用循环监督决定每个体素应该信谁
固定比例融合假设整幅图中两个来源的可信度不变,这不适合“整体结构对、局部边界错”的图谱,也不适合“局部外观好、任务理解错”的基础模型。 作者用一个轻量三维编码器预测逐体素增益图,再通过 sigmoid 将门控限制在 \([0,1]\)。 门控较大时更依赖图谱,较小时更依赖基础模型,因此同一器官不同部位可以采用不同来源。 本地全文抽取的式(4)缺失部分运算符,式(1)、式(3)也有排版损坏;此处不补写无法逐字核验的融合公式,以上机制由第 3.3 节正文明确支持。
融合估计器并非只看两个二值标签。 输入特征包含归一化查询影像、两路预测的 logit 表示、有符号 logit 差、软掩码分歧以及各自的熵图。 影像提供局部解剖证据,分歧指出需要裁决的位置,熵则提供不确定性线索;这些信息共同进入三维编码器,而不是把较低熵机械地等同于正确。 因此这里的“可靠性”是通过后续优化学习的门控,不是已经得到统计校准保证的置信概率。
没有查询真值时如何训练这道门控,是该设计最重要的一步。 模型先在查询空间生成融合预测,再通过反向形变送回支持空间,与唯一可用的支持标签计算 Dice 损失。 梯度只更新融合估计器,不更新分割基础模型。 这不是支持标签直接与自身比较:中间经过了形变、基础模型重预测、融合和逆向映射;但监督仍来源于同一支持病例,也仍受配准质量影响。
一个完整示例¶
以 Pengwin 的骨盆 CT 为例,先选择一例已标注目标骨结构的支持病例,再处理另一例未标注查询 CT。 刚性、仿射和非刚性配准把支持标签转移到查询坐标系,得到一个可能边界不准、但能表达目标范围的粗掩码。 将这个粗掩码作为 nnInteractive 的掩码提示,由冻结模型补充查询影像中的局部边界信息。 融合估计器随后读取两路预测与查询影像,输出空间门控;每次融合结果回到支持空间后都可接受支持标签监督。 最终保留的是查询空间中的融合掩码,而不是回到支持空间后的结果。 这个例子说明完整数据流,不把数据集平均分数误当作某一个病例每一步的分数。
损失函数 / 训练策略¶
- 配准阶段:使用 NCC,学习率 \(10^{-4}\),针对当前支持—查询对优化 300 次迭代。
- 融合阶段:使用上述循环变换 Dice 损失,学习率 \(10^{-5}\),优化 100 次迭代。
- 冻结范围:分割基础模型不更新;查询真值不进入两阶段优化。
- “无需额外训练数据”不等于没有测试时计算,论文中的两个可学习组件都在推理期间执行参数更新。
实验关键数据¶
主实验¶
第 4 节报告六个数据集:HaN-Seg、SegRap、Pengwin、AVT,以及内部数据 Fe-MRA 和 BrainRT。 采用五折交叉验证,每折从剩余验证集合选一例作为支持,每个类别视为独立上下文;作者声明六个数据集均不在 nnInteractive 的训练语料中。 下表摘选原文表 1—3 的结果,Dice 与 NSD 均按百分数报告,越高越好;差值为 Dice 百分点。 这些是论文协议下的结果,不是前瞻性临床验证。
| 数据集 / 任务 | 本文基础模型 | 对照方法 | 对照 Dice ↑ | 本文 Dice ↑ | Dice 差值 | 本文 NSD ↑ |
|---|---|---|---|---|---|---|
| HaN-Seg / 危及器官(表 1) | nnInteractive | nnInteractive-5 | 55.29 | 63.71 | +8.42 | 77.80 |
| SegRap / 危及器官(表 1) | nnInteractive | nnInteractive-5 | 50.02 | 69.19 | +19.17 | 87.39 |
| Pengwin / 骨盆骨(表 1) | nnInteractive | nnInteractive-5 | 93.63 | 95.50 | +1.87 | 96.96 |
| BrainRT / 危及器官(表 2) | nnInteractive | nnInteractive-5 | 39.09 | 77.07 | +37.98 | 77.55 |
| AVT / 血管(表 3) | vesselFM | nnInteractive-5 | 83.38 | 81.34 | -2.04 | 未报告 |
交互基线的点击从查询真值采样,属于部署时不可得的理想定位信号;本文的查询提示则完全来自图谱配准。 但本文额外使用了一例完整支持标注与测试时优化,两种交互和计算预算并不相同,AVT 行还使用了不同基础模型。 因此不能把结果解释为相同资源下单纯更换提示的全面胜利:AVT 上本文 Dice 就低于 nnInteractive-5。 同一 AVT 表中的本文 clDice 为 72.04、HD95 为 30.84,而 nnInteractive-5 为 70.52、43.69,体现了重叠与中心线、边界指标并不总是同向排序。
消融实验¶
原文表 4 为组件递增实验,以下只选 Pengwin 与 HaN-Seg 两列,指标均为 Dice(%,越高越好)。 前半部分考察图谱配准,后半部分考察基础模型与融合;不是一条从首行到末行严格连续的单因素训练序列。
| 配置(表 4) | Pengwin Dice ↑ | HaN-Seg Dice ↑ |
|---|---|---|
| 仅图谱配准 | 63.24 | 37.32 |
| 加刚性预配准 | 70.55 | 41.89 |
| 再加仿射预配准 | 82.75 | 48.72 |
| 独立 nnInteractive,单点提示 | 72.09 | 42.42 |
| 基础模型改用图谱提示 | 94.56 | 61.74 |
| 再加自适应融合 | 95.50 | 63.71 |
Pengwin 的图谱提示阶段较单点基线增加 22.47 个百分点,融合再增加 0.94 个百分点;HaN-Seg 的融合增益是 1.97 个百分点。 这支持“先把上下文给对,再做局部融合”的解释,而不是把全部收益都归给最后的门控网络。 表 5 在 RTX 4090、BrainRT 危及器官任务的一幅 \(256\times256\times240\) 影像上报告约 1.8 分钟:配准约 1.5 分钟,融合约 0.3 分钟,基础模型约 0.01 分钟。 8.6M 是需要学习的配准与融合参数量,不是包含冻结基础模型在内的系统总参数量;该计时也不能直接视为所有数据集的平均时延。
关键发现¶
- 提示生成带来的增益大于最终融合,但预配准本身已显著改善图谱质量,三者不能互相替代。
- 小结构收益突出:BrainRT 危及器官 Dice 达 77.07;这仍是分割基准结果,不能直接推出临床决策收益。
- 表 3 的 AVT clDice 为 72.04,而相邻正文写 72.07,本笔记以表格为准;该表不支持“本文所有 Dice 都第一”的笼统结论。
亮点与洞察¶
- 图谱是可执行的任务示例,而非一句语义描述。通过空间对齐,支持标注中的范围和形状约定可直接转化为现有模型能接受的输入。
- 图谱既是提示,也是需要保留的独立预测来源。基础模型偏离任务意图时,融合仍有机会利用结构先验修正,而不必完全相信预训练知识。
- 循环监督把唯一标注复用于查询空间的适应。它节省查询标注,但没有消除配准与支持病例选择带来的假设。
局限与展望¶
- 作者明确指出对病灶分割不够适用:局灶病变往往不满足支持与查询之间稳定的解剖对应,显著解剖差异也会导致失败;其未来方向包括多图谱策略与更好的提示生成。
- 作者展示了把左右下颌骨错误合并、未恢复完整主动脉弓的案例。前者涉及标注约定与模型解剖先验冲突,后者涉及支持—查询匹配困难,说明高重叠分数并不保证结构定义完全正确。
- 从读者角度看,循环损失仍会继承同一支持标签及形变误差,不能作为查询结果正确性的独立检验;约 1.8 分钟的测试时更新也不适合直接称为实时交互。
- 原文存在额外数值口径问题:Fe-MRA 的独立 vesselFM Dice 在表 3 为 60.31、表 4 为 55.28,当前全文未解释差异,因此本笔记不据此计算该基线的提升。缓存含完整方法与实验,但没有独立补充材料;NSD 容差等复现实验细节在所读正文中未明确给出。
相关工作与启发¶
- 对比 RDP / 传统图谱分割:本文复用配准网络,改变为单对影像的测试时优化,并把转移标签交给基础模型细化;额外收益伴随每对病例的优化开销。
- 对比 nnInteractive / MedSAM2:不是提出新的交互分割骨干,而是以支持图谱自动构造上下文,再保留图谱参与融合;基础模型仍有其固有结构偏好。
- 对比 UniverSeg / Iris:不重新训练专用上下文分割器,而是连接现成基础模型与显式空间对应;这种可复用性以结构一致性假设为代价。
评分¶
- 新颖性: 3.5/5 — 图谱、基础模型与测试时循环融合的组合清楚实用,基础组件本身已有较多先例。
- 实验充分度: 3.5/5 — 六个数据集、多类模型及组件分析较完整,但部分数字不一致,支持选择与临床部署仍需更充分验证。
- 写作质量: 3/5 — 主流程与实现可理解,但表文不一致及抽取公式损坏增加核验成本。
- 价值: 4/5 — 为单例定制三维解剖分割提供了可落地思路,适用范围应限定在具有可配准结构的任务。