SCDL: Synergistic Confidence-Dispersion Learning for Semi-Supervised Video Polyp Segmentation¶
会议: ECCV 2026
论文: ECCV 官方
代码: https://github.com/Yuanqin-He/SCDL
领域: 医学图像 / 视频理解
关键词: 半监督学习, 视频息肉分割, 置信度-离散度协同, 谱凸优化伪标签筛选, 上下文一致性扰动
一句话总结¶
针对结直肠内窥镜视频中息肉与正常组织对比度低、伪标签过自信错误累积的难题,SCDL 提出原型引导自适应细化、谱凸优化置信度-离散度伪标签筛选与上下文一致性扰动,构建闭环半监督协同学习框架,在 SUN-SEG 上以多标注比例刷新 SOTA。
研究背景与动机¶
早期检测和切除结直肠腺瘤性息肉是预防结直肠癌(CRC)最关键的临床手段。近年来,基于深度学习的全监督息肉分割算法在静态结肠镜图像上取得了显著成果,但在动态结肠镜视频中,由于忽略了帧间时序关联,往往无法保持时序稳定性和鲁棒性。为此,视频息肉分割(VPS)模型应运而生。然而,视频级逐像素标注成本极其高昂、耗时耗力,导致高质量标注数据在临床实际中极度匮乏,严重制约了 VPS 模型的临床落地。
半监督视频息肉分割(SSVPS)试图通过少量标注帧引导大量无标注帧的学习。然而,主流半监督语义分割通常依赖“高置信度即高质量”的伪标签自训练假设,这一假设在结肠镜视频场景下被严重破坏。内窥镜视频具有独特的物理退化特性:息肉与周围黏膜组织对比度极低且纹理高度相似、镜头运动剧烈导致帧间形变大、以及反光与遮挡引发的连续低质量帧。这些因素极易诱发神经网络的“盲目过自信”,在低对比度边缘产生高置信度但完全错误的伪标签。更为严重的是,视频时序关联机制会像滚雪球一样将错误的伪标签沿时间轴跨帧级联放大,造成时序预测崩溃;与此同时,传统固定阈值策略长期忽略低置信度区域,导致严重的区域监督偏差。
要突破半监督视频息肉分割的瓶颈,不能仅靠单一置信度启发式阈值或割裂的时序模块,而必须建立预测可靠性辨析与难区分特征强化的闭环反馈。核心 idea:将伪标签选择建模为置信度与残差离散度联合特征空间下的谱凸优化分离问题,结合原型引导的时空自适应细化(PAR)与掩蔽高置信度区域以倒逼难例重构的上下文一致性扰动(CCP),形成特征增强、无阈值伪标签精选与抗偏置重构的协同自监督闭环。
方法详解¶
整体框架¶
SCDL 的核心思想在于通过数据前向流动与梯度反向反馈构建闭环协同网络。系统输入包括少量带标注视频帧序列与大量无标注视频序列。对于无标注视频帧,框架采用弱-强一致性增强机制,包含原型引导自适应细化(PAR)、谱凸优化分离(SCOS)与上下文一致性扰动(CCP)三个互相依存的模块:首先由 PAR 提取高分辨率空间特征并聚合时序原型记忆,生成判别性时空表征;随后 SCOS 提取像素预测的最大概率与残差离散度,通过谱凸优化无启发式阈值地导出样本自适应可靠性指示图与软加权图;最后 CCP 利用可靠指示图生成空间补丁掩模,有针对性地遮盖高置信度区域,迫使网络仅凭周围低置信度模糊区域及历史时序记忆重构全局语义。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
In["输入视频帧序列<br/>有标注帧 + 无标注帧"] --> PAR["原型引导自适应细化 (PAR)<br/>IOF浅深融合 + EOF跨帧注意力 + OPG聚类原型"]
PAR --> SCOS["谱凸优化分离 (SCOS)<br/>联合最大置信度与残差离散度,凸优化求自适应掩码"]
SCOS -->|软权重掩码| LossA["标准弱-强一致性损失<br/>加权抑制不确定噪声"]
SCOS -->|二值可靠区域划分| CCP["上下文一致性扰动 (CCP)<br/>掩蔽高置信度补丁,倒逼模糊边界特征学习"]
CCP --> LossM["扰动重构一致性损失<br/>由模糊区域上下文反推语义"]
LossA & LossM --> Opt["闭环联合优化<br/>梯度反向传播持续强化 PAR 表征判别力"]
关键设计¶
1. 原型引导自适应细化(PAR):解耦时空先验与低对比度息肉特征重塑 结肠镜视频中息肉与周围黏膜的低对比度以及快速晃动导致的帧间不连续是表征失效的主因。PAR 模块通过三步渐进式融合消除模糊性。首先是隐式目标感知融合(IOF):网络浅层编码丰富局部细节纹理,深层编码全局语义,PAR 维持一个容量为 \(T=8\) 的先进先出(FIFO)记忆库存储历史高层特征,以当前帧深层特征为 Query,历史记忆为 Key 和 Value 计算跨注意力得到时序增强特征 \(F_t^{mem}\),并与浅层多尺度特征经过轻量卷积压缩后逐点相加,弥合息肉与正常组织的空间反差。接着是显式目标感知融合(EOF):将融合特征与前一帧上下文 \(R_{t-1}^c\) 拼接后降维,再与历史帧提取的息肉物体原型集合 \(\mathcal{P}_t\) 进行跨注意力交互,以紧凑的原型先验纠正形变与对比度退化。最后是目标感知原型生成(OPG):在当前帧预测的掩码区域内,利用最远点采样(FPS)提取 \(k\) 个代表性种子点,执行单轮 \(k\)-means 聚类并取簇内空间特征均值作为局部原型,推入历史原型库循环更新。
2. 残差离散度理论与谱凸优化分离(SCOS):突破单一置信度的伪标签无阈值自适应筛选 传统伪标签阈值法仅依赖最大分类概率 \(p_n(k^\star)\),但在过自信的低对比度区域极易误选高概率错误标签。论文从熵最小化原理出发进行了严谨的理论分析:理想分类分布在非最大概率处呈平坦残差分布,通过二阶泰勒展开,交叉熵可逼近为: $$ \mathrm{CE}(p_n, \tilde{q}) \approx -\log p_n(k^\star) + \varepsilon \frac{(C-1)^3}{2(1-p_n(k^\star))^2} v_n $$ 其中残差离散度定义为 \(v_n \triangleq -\frac{1}{C-1} \sum_{k \neq k^\star} \Delta_k^2\)(\(\Delta_k\) 为非主类别概率相对于均值的分散度偏差)。该式揭示出:可靠预测必须同时具备高最大置信度与高残差离散度;当 \(p_n(k^\star) \to 1\) 时,\(v_n\) 的权重系数爆炸式上升,使得残差离散度成为过自信区域最具辨别力的鉴别指标。为此,SCOS 将每个像素表征为二维向量 \(h_n = [p_n(k^\star), v_n]^T\),把自适应伪标签筛选转化为特征矩阵的谱可分性优化问题: $$ \max_{S} \mathrm{Tr}(S^T \Phi^T \Phi S), \quad \text{s.t. } S \in {0, 1}^{HW \times 2} $$ 利用 Ky Fan 定理进行谱松弛求解,避免了人为指定启发式门限的认知偏差,并通过高斯分布核映射导出样本级自适应平滑加权图 \(M_t\),实现高可靠像素全权重保留、模糊像素平滑软衰减。
3. 上下文一致性扰动(CCP):以可信区域掩蔽驱动模糊边界语义重构 如果半监督训练长期仅对高置信度像素施加监督,模型将持续规避困难区域,导致网络在病灶模糊边缘产生严重的监督偏置和决策盲区。CCP 提出反向扰动策略:利用 SCOS 识别的可靠像素区域 \(M_t = 1\),以补丁边长 \(s=32\)、掩蔽比例 \(\theta=0.5\) 随机屏蔽高质量预测补丁,生成掩模输入 \(\tilde{x}_t^u = x_t^u \odot R_t\)。由于息肉高确信度的主体区域被遮盖,模型无法投机取巧,必须迫使其结合周围残存的低置信度边缘上下文以及 PAR 模块所保存的历史时序先验,对被遮盖的目标语义进行跨时空反向推断与重构。这一机制强行打通了可靠区域与边缘模糊区域之间的特征互信息流动,彻底根除了半监督学习中的区域选择偏置。
损失函数 / 训练策略¶
总体训练目标由有监督损失与无监督自训练损失联合构成: $$ \mathcal{L} = \mathcal{L}S + \mathcal{L}_U = \mathcal{L}_S + \lambda_1 \mathcal{L}_u^a + \lambda_2 \mathcal{L}_u^m $$ 其中 \(\mathcal{L}_S\) 为标注帧的标准交叉熵损失,\(\mathcal{L}_u^a\) 为弱-强一致性自训练损失,\(\mathcal{L}_u^m\) 为经 CCP 掩模扰动后的语义重构一致性损失。两项无监督损失均由 SCOS 导出的样本自适应图 \(M_t\) 逐像素软加权调控: $$ \mathcal{L}_u^a = \frac{1}{B_U} \sum}^{B_U} M_t \odot \mathrm{CE}\big(\hat{yt^u, \mathcal{F}(A_s(A\omega(x_t^u)))\big) $$ $$ \mathcal{L}u^m = \frac{1}{B_U} \sum_t^u)\big) $$ 训练超参数默认设置 }^{B_U} M_t \odot \mathrm{CE}\big(\hat{y}_t^u, \mathcal{F}(\tilde{x\(\lambda_1 = 0.5, \lambda_2 = 0.5\)。模型使用 SGD 优化器,批大小为 8,骨干初始学习率为 \(1\times 10^{-3}\),解码器学习率设为骨干的 10 倍以加速收敛,图像裁剪为 \(352 \times 352\),总计训练 60 个 epoch。在推理阶段,SCOS 与 CCP 作为纯训练期策略被完全剔除,完全不增加额外推理延迟。
实验关键数据¶
主实验¶
在规模最大的公开视频息肉分割基准 SUN-SEG(分为 Easy 和 Hard 两组测试子集,涵盖 seen 与 unseen 场景)上,SCDL 在 1/16、1/8、1/4、1/2 四种极低标注比例下均系统性超越了包括自然图像半监督(NIS)、图像息肉分割(IPS)、自然视频分割(NVS)以及代表性视频息肉分割(VPS)方法:
| 模型 | 骨干网络 | 任务范式 | 1/16 标注 (Easy) | 1/16 标注 (Hard) | 1/8 标注 (Hard) | 1/4 标注 (Hard) | 1/2 标注 (Hard) |
|---|---|---|---|---|---|---|---|
| Corrmatch | Res2Net-50 | NIS | \(S_\alpha\): 80.92 / Dice: 71.25 | \(S_\alpha\): 79.85 / Dice: 69.98 | \(S_\alpha\): 80.82 / Dice: 72.45 | \(S_\alpha\): 84.52 / Dice: 76.02 | \(S_\alpha\): 84.95 / Dice: 77.42 |
| ACL-Net | Res2Net-50 | IPS | \(S_\alpha\): 81.69 / Dice: 73.43 | \(S_\alpha\): 81.38 / Dice: 71.76 | \(S_\alpha\): 81.53 / Dice: 73.21 | \(S_\alpha\): 86.04 / Dice: 77.32 | \(S_\alpha\): 86.08 / Dice: 78.93 |
| PedSemiSeg | Res2Net-50 | IPS | \(S_\alpha\): 81.42 / Dice: 71.79 | \(S_\alpha\): 80.73 / Dice: 70.84 | \(S_\alpha\): 81.93 / Dice: 73.74 | \(S_\alpha\): 85.24 / Dice: 76.74 | \(S_\alpha\): 85.63 / Dice: 78.35 |
| IFR | Res2Net-50 | NVS | \(S_\alpha\): 81.05 / Dice: 71.38 | \(S_\alpha\): 80.12 / Dice: 70.25 | \(S_\alpha\): 81.05 / Dice: 72.68 | \(S_\alpha\): 84.73 / Dice: 76.23 | \(S_\alpha\): 85.18 / Dice: 77.65 |
| TDC | Res2Net-50 | NVS | \(S_\alpha\): 81.39 / Dice: 71.72 | \(S_\alpha\): 80.51 / Dice: 70.64 | \(S_\alpha\): 81.29 / Dice: 72.92 | \(S_\alpha\): 85.09 / Dice: 76.59 | \(S_\alpha\): 85.43 / Dice: 77.90 |
| TCCNet | Res2Net-50 | VPS | \(S_\alpha\): 80.63 / Dice: 74.18 | \(S_\alpha\): 79.87 / Dice: 73.42 | \(S_\alpha\): 81.43 / Dice: 76.62 | \(S_\alpha\): 84.78 / Dice: 79.02 | \(S_\alpha\): 85.64 / Dice: 80.83 |
| SSTAN | Res2Net-50 | VPS | \(S_\alpha\): 81.93 / Dice: 75.27 | \(S_\alpha\): 81.37 / Dice: 74.51 | \(S_\alpha\): 82.89 / Dice: 77.70 | \(S_\alpha\): 86.18 / Dice: 80.14 | \(S_\alpha\): 87.16 / Dice: 81.96 |
| PSDNet | PVTv2-b2 | VPS | \(S_\alpha\): 87.09 / Dice: 83.07 | \(S_\alpha\): 86.76 / Dice: 81.29 | \(S_\alpha\): 87.52 / Dice: 82.54 | \(S_\alpha\): 87.64 / Dice: 83.36 | \(S_\alpha\): 88.10 / Dice: 83.77 |
| SCDL (Ours) | Res2Net-50 | VPS | 87.52 / 83.48 | 87.17 / 81.66 | 88.05 / 82.98 | 88.13 / 83.94 | 88.62 / 84.28 |
| SCDL (Ours) | PVTv2-b2 | VPS | 89.37 / 85.91 | 88.59 / 83.76 | 89.04 / 84.62 | 89.31 / 85.44 | 89.51 / 86.09 |
消融实验¶
在 SUN-SEG-Hard 数据集(1/2 标注划分)下,对核心模块拆解及推理效率进行消融评估:
| 配置 | Dice (%) | GFLOPs | 参数量 (M) | 说明 |
|---|---|---|---|---|
| Baseline | 80.21 | 92.82 | 41.38 | 固定阈值自训练基线 |
| w/ PAR | 82.36 | 107.29 (+14.47) | 42.43 (+1.05) | 引入原型自适应时空细化 |
| w/ SCOS + CCP (w/o PAR) | 83.24 | 94.90 (+2.08) | 41.38 (+0) | 仅引入伪标签选择与扰动 |
| w/ PAR + SCOS (w/o CCP) | 83.72 | 107.29 (+14.47) | 42.43 (+1.05) | 具备置信度-离散度精选但无反向扰动 |
| SCDL (Full Model) | 84.28 | 109.37 (+16.55) | 42.43 (+1.05) | 完整协同闭环学习架构 |
关键发现¶
- SCOS 与 CCP 带来纯粹的训练收益:SCOS 和 CCP 在推理期完全不参与前向计算,推理端仅增加 PAR 引入的 1.05M 参数量与 14.47 GFLOPs 计算开销,却带来了超过 4% 的 Dice 增益,性能-效率平衡极其优异。
- 残差离散度与凸优化的去噪威力:在仅用 1/16 标注帧的极端匮乏场景下,SCDL 在 Hard 子集上的 Dice 达到 81.66%,比传统半监督基线提升了 11.68%,证明了抑制过自信伪标签传播的巨大价值。
- 卓越的零样本跨数据集泛化能力:在仅用 SUN-SEG 训练且未经任何微调的前提下,SCDL 在全新数据集 CVC-ClinicDB 上取得了 94.12% 的 \(S_\alpha\) 和 91.53% 的 Dice,显著优于先前最强方法 PSDNet(91.84% / 89.67%),证实模型学到了内窥镜病灶的本质不变表征而非特定数据集的域分布。
亮点与洞察¶
- 残差离散度突破传统置信度单一盲区:通过泰勒级数展开从交叉熵分解严格证明了非主类别预测离散度在过自信状态下的高阶敏感性,用数学解析消除了人工启发式设定阈值的试错成本。
- 反常识的“遮蔽高置信度”扰动策略:与传统数据增强随机抹除不同,CCP 专门遮盖高确定性区域,倒逼网络从原本被弃用的低置信度模糊区域提取有效线索,将负向监督偏差反转为强化学习动力。
- 时序原型存储与轻量推理结合:将高分辨率特征提取与跨帧原型库交互限制在紧凑的 \(k=5\) 聚类中心内,兼顾了长程时序一致性维护与临床实时帧率要求。
局限与展望¶
- 极端光影与极小病灶的分割鲁棒性仍有待提升:内窥镜视频中的强烈镜面高光反射会导致视野局部完全信息过曝,且当下采样倍率过高时,极微小且扁平的息肉容易与周围红斑黏膜产生不可逆的特征纠缠。
- 未来方向:可进一步探索高动态范围(HDR)图像解耦与抗强反光模块,并在原型聚合中引入亚像素或多尺度空间注意力,提升极微小病灶的时空追踪稳定性。
相关工作与启发¶
- vs TCCNet / SSTAN:先前半监督 VPS 模型主要依赖隐式时空交叉注意力传递时序线索,但对无标注帧生成的噪声伪标签缺乏主动过滤与纠偏机制;SCDL 通过引入残差离散度与凸优化分离,主动切断了错误伪标签在时序上的滚雪球效应。
- vs UniMatch / SoftMatch:传统半监督通用方法要么采用固定高阈值造成严重边界欠拟合,要么假设高斯先验调整阈值;SCDL 首次利用多维预测分布谱松弛求解无参数自适应阈值,更契合医学影像弱对比度特质。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ [残差离散度理论结合谱凸优化伪标签筛选,形式优美且针对性极强]
- 实验充分度: ⭐⭐⭐⭐⭐ [四种标注比例、消融详实、包含泛化性 zero-shot 验证与计算复杂度审计]
- 写作质量: ⭐⭐⭐⭐⭐ [数学推导严密自洽,框架逻辑闭环清晰]
- 价值: ⭐⭐⭐⭐⭐ [显著降低临床内窥镜视频逐像素标注成本,工程部署友好]