A Dual-space Patch-driven Complementary Learning Framework for Semi-supervised Multi-organ Segmentation¶
会议: ECCV 2026
论文: https://eccv.ecva.net/virtual/2026/poster/3317
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/928.pdf
领域: 医学图像
关键词: 半监督多器官分割、类别不平衡、局部增强、共现解耦、对比学习
一句话总结¶
DPCL 用稀有类别与预测不确定性共同引导局部裁剪,再以全图—局部伪标签融合和互补对比学习减少相邻器官的特征混淆,在 Synapse 的 2 个有标注病例设置下获得 68.89% 平均 Dice。
研究背景与动机¶
半监督医学分割希望以少量精细标注带动更多未标注扫描,但多器官任务并不只是把二分类扩展成更多输出通道。 同一张腹部切片中,肝脏等大结构提供大量训练像素,胰腺、胆囊等小结构却既少见又难辨认;标注病例越少,这种监督不均衡越明显。 一致性正则化和伪标签可以扩大训练信号,却不保证新增信号能覆盖小器官,也不保证模型的高置信度预测是正确的。
更隐蔽的问题是器官共现:相邻器官经常同时出现,网络可能把邻居的外观或位置线索当成目标器官的证据。 这种依赖会产生错误激活,而且错误区域也可能具有很高置信度,因而仅靠置信度过滤无法彻底消除。 论文把类别不平衡和共现混淆联系起来:小器官不仅被大器官淹没,其表示还可能被共同出现的大器官牵引;仅重新加权损失不能直接解决这种特征纠缠。
DPCL 因而先改变模型在图像空间里“看哪里”,再约束它在特征空间里“区分什么”。 局部裁剪增加困难结构的有效曝光,类别原型和对比目标则要求网络真正区分局部同时出现的器官,同时维持全局类别边界。 核心 idea:用类别稀有度与不确定性选择有价值的局部视野,并让局部共现判别和全局类别判别互补,而不是把更多高置信度像素等同于更可靠的学习。
方法详解¶
整体框架¶
输入是有标注和无标注的 CT/MRI 图像,实际实验先将三维体数据转成二维切片。 每张完整切片保留全局视野,同时产生多个局部图像块;学生网络学习分割,教师网络为无标注样本生成预测。 网络沿用 U-Net,但将完整图像与裁剪图像的归一化统计分开,其他表征计算共享。
图像空间的处理包含“双先验裁剪”“双归一化”和“伪标签融合”:前两者让局部视野既有针对性又不污染全图统计,第三者利用全图与局部预测的互补性训练学生。 特征空间的“互补共现对比”则只用有标注图像构建可靠类别原型,同时约束局部类别表示和全图像素表示。 这些分支是训练阶段的协作;推理时只输入完整图像,不必再次裁剪和融合局部预测。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["有标注与无标注<br/>完整切片"] --> B["双先验裁剪"]
B --> C["双归一化<br/>全图与局部编码"]
C -->|"无标注预测"| D["伪标签融合"]
C -->|"有标注特征"| E["互补共现对比"]
D --> F["联合训练<br/>分割与对比目标"]
E --> F
F --> G["推理仅用全图<br/>输出器官分割"]
关键设计¶
1. 双先验裁剪:同时照顾少数类和难判区域
随机裁剪可能反复抽到背景或容易识别的大器官,因此 DPCL 按像素采样权重选择裁剪中心。 类别先验来自当前图像的各前景类别像素频数,通过对数重加权提高稀有类别的相对权重;不确定性先验则来自预测概率的熵。 高熵意味着多个类别概率相近,常见于边界或外观模糊区域,但高熵本身并不能区分“小器官”与“大器官上的难点”。 将二者相乘,可以优先关注既稀有又难判的区域,而不是只追逐全图最不确定的位置。
具体地,原文式(5)把“1 加像素熵”与对应类别权重相乘,再加一个正的小常数,以保留非零采样机会。 熵的定义为 \(\mathcal H(P_j)=-\sum_{k=0}^{K-1}P_j(k)\log P_j(k)\),其中 \(P_j(k)\) 是像素 \(j\) 属于类别 \(k\) 的概率。 有标注图像用真实标签计算类别频数,结合学生预测;无标注图像改用教师的全图伪标签和概率图。 随后按权重分布随机采样中心,记录裁剪坐标,使图像块标签、局部预测和全图位置能够对应。 默认每张图取 4 个 \(64\times64\) 图像块,而不是把全图均匀切成互不重叠的网格。
2. 双归一化:共享识别能力,不混用两种视野的统计
局部图像块不是完整图像的简单“小副本”:背景比例、器官占比和强度分布都可能变化。 若两类输入共同更新一套归一化统计,局部增强反而可能引入分布冲突,使全图分割受损。 DPCL 将 U-Net 中的归一化层替换为双归一化(Dual Normalization,DN),分别维护全图与裁剪输入的均值、方差和仿射参数。 两套统计通过各自的指数移动平均更新,但这不等于训练两套互不相关的分割骨干。
这样,卷积特征仍能从两种视野共同学习,而归一化处理知道当前特征来自哪一种输入分布。 对局部图像学到的小器官外观可以影响共享表示,同时避免直接把局部强度统计套到完整图像上。 推理只用完整图像,所以不需要维护额外的局部推理分支;不过训练时额外图像块仍然带来计算开销。
3. 伪标签融合:逐像素选择全图或局部更确定的判断
教师分别处理弱增强的完整图像和图像块,学生对无标注样本处理强增强版本。 首先把教师的局部预测按裁剪坐标放回全图位置;如果多个图像块覆盖同一像素,就选预测熵最低的那个,而不是直接平均。 随后比较合并后的局部预测与全图预测,在有局部覆盖的位置优先选熵更低的一方;没有局部覆盖时保留全图预测。 这使局部边界细节有机会纠正粗糙的全图判断,也允许全局上下文否决缺少上下文的局部误判。
选中的类别标签形成统一伪标签,其对应最大类别概率再接受置信度阈值 \(\gamma_1\) 的过滤。 因此,熵负责“选哪一种视野”,最大概率阈值负责“这个像素是否值得监督”,二者作用不同。 最终伪标签通过坐标对应监督学生的全图和局部分割,并使用无监督 Dice 损失。 这一机制并未证明低熵预测一定正确:它只是改进可用监督的选择,仍需后续特征约束处理高置信度共现错误。
4. 互补共现对比:局部重点分开邻居,全局保持全部类别边界
学生特征经过投影头后形成用于对比学习的表示。 类别原型只从有标注数据计算:先用真实标签确定类别,再保留该类预测概率不低于 \(\gamma_2=0.9\) 的像素,并平均其投影特征。 全图与裁剪图像各自产生类别表示,再共同更新一个按类别维护的动量原型库,原型动量为 0.99。 包含小器官的图像块提供更有针对性的更新,缓解少数类原型出现次数少、更新缓慢的问题。 需要区分这里的原型构建和后面的局部查询:局部类别语义按真实标签平均图像块内同类特征,原型构建才明确采用上述可靠性过滤。
图像块对比损失(PBC)把某个局部类别语义作为查询,以同类全局原型为正样本,只把当前图像块中共同出现的其他类别原型作为负样本。 它没有平均对待所有负类,而是聚焦当前确实容易混淆的邻居,让局部边界附近的类别表示被直接拉开。 全局对比损失(GBC)则以有标注全图的像素特征为查询,拉近真实类别原型,并与全部类别原型比较。 因此,原文式(18)的查询是像素特征,并不是简单让两份同类原型彼此靠近。
两个损失共享由全图和局部共同更新的原型库,才形成全局语义与局部细节之间的联系。 只有 PBC 时,不共现的类别缺少直接区分压力;只有 GBC 时,针对相邻器官的困难关系可能被全局平均目标稀释。 组合两者的目的,是同时保留局部重点判别与全局类别一致性,而非堆叠两个作用完全相同的对比项。
损失函数 / 训练策略¶
有标注数据的全图和局部分支使用交叉熵与 Dice 损失;无标注数据使用经过置信度过滤的伪标签监督。 总目标来自原文式(19):
原文取 \(\lambda_u=0.25\),对比损失权重采用高斯预热 \(\lambda_m(t)=0.1\exp[-5(1-t/t_{\max})^2]\)。 先逐步建立可用表示,再提高对比约束强度,比训练一开始就强迫不稳定原型承担较大监督更合理。 实现使用 256 维投影特征、SGD、0.9 动量、0.0001 权重衰减和 0.01 初始学习率,配合多项式衰减,训练 30,000 次迭代。 有标注和无标注数据的批大小均设为 6,实验硬件为 NVIDIA 3090;所有体数据先转换为 \(256\times256\) 二维切片。 正文没有清楚交代教师参数更新的具体规则,因此这里不把常见 Mean Teacher 的 EMA 设置当成本论文已验证的实现细节。
实验关键数据¶
主实验¶
下表选取原文表 1、表 2 的关键设置,Dice 越高越好,ASD 为以体素计的平均表面距离、越低越好。 每行比较同一数据集、同一标注设置;对照项按该设置下表内最高平均 Dice 选择,并非意味着它在 ASD 上也最优。 “增益”由表中 Dice 相减得到,单位为百分点,不沿用正文部分存在疑点的相对提升百分比。
| 数据集与标注设置 | 对照方法 | 对照 Dice / ASD | DPCL Dice / ASD | Dice 增益 |
|---|---|---|---|---|
| Synapse,1/18 训练病例有标注(论文称 5%) | ABD | 53.57 / 32.84 | 61.48 / 23.78 | +7.91 |
| Synapse,2/18(论文称 10%) | AD-MT | 62.73 / 22.25 | 68.89 / 14.84 | +6.16 |
| FeTA2021,3/56(论文称 5%) | AD-MT | 68.31 / 4.60 | 70.04 / 4.58 | +1.73 |
| SegTHOR,3/28(论文称 10%) | FixMatch | 76.65 / 4.20 | 78.18 / 3.26 | +1.53 |
| ACDC,7/70(论文称 10%) | CGS | 89.83 / 0.68 | 90.47 / 0.28 | +0.64 |
划分为 Synapse 18 例训练、12 例测试;FeTA2021 为 56/8/16;SegTHOR 为 28/4/8;ACDC 为 70/10/20,后三者顺序为训练/验证/测试(第 4.1 节)。 论文说明方法采用相同有标注/无标注数据设置,并以 U-Net 为主要比较骨干,但 DPCL 增加了训练图像块和对比计算,不能据此声称等训练算力。 ACDC 的 M3HL 在表 2 中同时列出复现 Dice 88.83 和原报告 Dice 90.47;DPCL 与后者持平,不能称为超过所有既有报告值。 此外,Synapse 10% 的 SKCDF ASD 为 12.38,优于 DPCL 的 14.84,因此“所有指标全面领先”并不成立。
消融实验¶
以下选自表 3,全部为 Synapse、2 个有标注训练病例和 12 个测试病例的同一评测设置。 局部增强包含裁剪及伪标签相关训练;第一行同时保留 DN,不能误称为纯监督基线。
| 配置 | Dice (%) ↑ | ASD(体素)↓ |
|---|---|---|
| 局部增强 + DN,不使用 PBC/GBC | 64.55 | 20.85 |
| 局部增强 + DN + PBC | 66.17 | 16.11 |
| 局部增强 + DN + GBC | 67.50 | 15.88 |
| 局部增强 + PBC + GBC,不使用 DN | 64.84 | 20.48 |
| 完整 DPCL | 68.89 | 14.84 |
完整模型相对去掉 PBC 的配置提高 1.39 个 Dice 百分点,相对去掉 GBC 提高 2.72 个百分点,相对去掉 DN 提高 4.05 个百分点。 这支持两种对比目标互补,同时说明共享全图/局部网络时,归一化分布冲突并非可以忽略的实现细节。 但局部增强行已经加入无标注学习,不能把它相对纯监督模型的全部提升都归因为裁剪操作本身。
关键发现¶
- 表 4(c) 中,均匀采样、不确定性采样、类别频数采样和组合采样的 Dice 分别为 65.57、67.54、66.10 和 68.89。组合优于单一先验,证据更支持“互补”,而不是其中一个先验完全替代另一个。
- 表 4(a–b) 的测试范围内,4 个图像块、边长 64 最优;更多图像块并不持续改善结果。这个结论只限于该 Synapse 设置,不是跨器官数据集的通用最优值。
- 表 1 的 Synapse 10% 胰腺 Dice 为 54.90,仍远低于肝脏的 91.21。DPCL 缓解了困难类别问题,但没有消除不同器官之间的性能差距。
亮点与洞察¶
- 把训练曝光与判别目标一起设计。 采样决定网络经常看见什么,PBC 决定它必须区分什么;只增加少数类图像块而不约束邻居关系,并不能保证减少共现混淆。
- 区分预测可靠性与表示可分性。 熵选择和概率阈值改善伪标签来源,对比目标则处理仍可能高置信度出错的特征,二者承担不同职责。
- 增强主要留在训练阶段。 图像块训练与双归一化让全图模型吸收局部细节,测试仍仅处理全图;这不等于论文已证明训练成本或推理延迟不变。
局限与展望¶
- 原文证据边界: 正文没有独立局限性讨论,也未报告多次随机种子均值、标准差或显著性检验。仅 1–2 个有标注病例的结果可能依赖病例选择,这是阅读者的评估,不是作者已经量化的结论。
- 阅读者判断: 原型仅来自高置信度有标注像素,有助于避开伪标签噪声,但极难类别可能连可靠原型样本都不足。局部采样只能改善曝光,无法凭空补充缺失的标注外观。
- 适用范围: 实验基于二维切片,未验证三维空间连续性、跨中心外部测试或临床部署;四个数据集上的结果不能直接等同于临床泛化保证。
- 文本与复现缺口: 第 4.4 节正文写完整模型 Dice 为 68.67,而表 1、3、4 一致为 68.89,部分消融增幅也与表格不符。本笔记统一采用表格值并明确计算百分点差值。
- 材料边界: 可用本地全文包含 18 页正文与参考文献;正文提及的额外超参数附录不在该缓存中。未据此补写温度、伪标签阈值或教师更新等未核实参数,代码链接亦未提供。
相关工作与启发¶
- vs BCP / ABD: 二者通过双向复制粘贴或位移改善有标注与无标注数据的利用;DPCL 额外让采样位置由类别与不确定性决定,并显式约束共现器官表示。
- vs PH-Net: PH-Net 利用困难图像块的对比学习服务乳腺病灶分割;DPCL 面向多类别情形,把当前图像块中共同出现的类别作为有针对性的负类集合。
- vs CGS / SKCDF: 它们分别强调通用/专用分割协作或语义知识互补;DPCL 的切入点是两种视野的统计隔离与局部—全局特征约束,而不是简单增加分割头。
评分¶
- 新颖性: 3.5/5。把类别感知裁剪、域相关归一化与两种对比目标组合得有针对性,但各基础机制并非全新。
- 实验充分度: 3.5/5。四个数据集和逐模块消融较完整,欠缺多次运行统计、计算成本和外部泛化验证。
- 写作质量: 3/5。问题与框架清楚,但结果正文与表格不一致,部分实现细节交代不足。
- 价值: 4/5。对少标注多器官分割提供可解释、测试流程较简洁的训练改造方案。