跳转至

FSD-Net: Foundation-Guided Spatiotemporal Distillation for Video Polyp Segmentation

会议: ECCV 2026
论文: ECCV 原文
领域: 医学图像
关键词: 视频息肉分割、时空知识蒸馏、弱监督学习、基础模型、循环一致性

一句话总结

针对结肠镜视频息肉分割中逐帧密集像素级标注成本过高及肠道褶皱遮挡导致伪标签漂移的问题,FSD-Net 利用冻结的 SAM 基础模型构建语义流蒸馏、遮挡感知循环一致性约束与动量原型重识别机制,使轻量级学生网络仅凭稀疏关键帧标注即实现超越全监督模型的实时高精分割。

研究背景与动机

结直肠癌是全球发病率与死亡率位居前列的恶性肿瘤,结肠镜检查中的早期息肉筛查与切除能够直接阻断恶变进程并显著提升患者生存率。尽管基于深度学习的自动息肉分割取得了显著进展,但主流方法长期将结肠镜视频简化为孤立静态图像的集合,忽略了帧间固有的时空连续性,在息肉发生剧烈形变、相机运动模糊或镜下快速移动时极易出现漏检与时序闪烁。为此,视频息肉分割(VPS)致力于引入时空上下文以稳定预测,但其训练高度依赖高成本的逐帧像素级密集金标准;临床专家标注不仅耗时繁琐,在大规模数据集中更是难以规模化,稀疏标注下的标签高效学习因而成为临床落地的迫切需求。

然而,现存弱监督或半监督视频分割方案在内窥镜环境下极易失效。传统方法主要依赖低级光流估计或局部块特征匹配在已标注关键帧与未标注帧之间传播监督信号,但肠道内部普遍存在非刚性蠕动、黏膜反光与积液干扰,导致光流场充满噪声并引发严重的误差累积与边界漂移。更为棘手的是由肠壁皱襞引发的动态遮挡问题:当息肉暂时隐入黏膜褶皱并在数秒后重新出现时,传统时序循环一致性框架缺乏高层语义可见性判断,会盲目强制帧间对齐,迫使网络在正常黏膜组织上虚构出大量假阳性息肉掩码;这种错误的梯度累积进一步破坏了特征记忆,导致目标重现后跟踪彻底丢失。

针对光学运动线索脆弱与循环对齐盲目两大瓶颈,本文将监督范式从不稳定的像素流切换为高层语义流。模型利用冻结的视觉基础模型 SAM 充当时空教师,借助其丰富的语义表征与不确定性度量指导轻量学生网络;同时引入能动态阻断错误梯度的可见性门控,并在重现时唤醒长时记忆。核心 idea:以冻结的 SAM 基础模型为时空教师引导轻量学生网络,通过不确定性加权语义流蒸馏、遮挡感知循环一致性与动量更新原型重识别,在稀疏标注下建立抗遮挡、免漂移且具备实时临床推理能力的闭环视频息肉分割框架。

方法详解

整体框架

FSD-Net 的目标是在极度稀疏标注(每 5 帧视频仅标注首帧)的设定下,训练一个紧凑高效的视频息肉分割学生网络。系统由两大部分构成:完全冻结参数的 SAM-ViT-B 教师模型 \(\Phi_T\),以及由 PVTv2-B0 编码器配合轻量级 FPN 解码器组成的紧凑学生网络 \(\Phi_S\)(参数量仅 12.7M,FLOPs 仅 18.4 GFLOPs)。

在训练阶段,输入长度为 \(T\) 的视频片段 \(V = \{I_t\}_{t=1}^T\)。首帧使用专家提供的二值掩码 \(M_1\) 作为基准,教师模型在时间维度向前递归传递语义并生成后续帧的伪标签 \(\hat{M}_t\);学生网络则单帧独立预测各时刻的分割概率图 \(P_t\)。为确保闭环时空约束,系统将学生当前的预测掩码 \(P_t\) 作为提示信号送回教师模型进行逆向追踪,逆向推导前一时刻的掩码 \(\tilde{M}_{t-1}\),并结合动态可见性评分与动量原型记忆计算综合监督损失。在临床推理阶段,庞大的教师模型被完全舍弃,仅由轻量学生网络执行纯前向推理,在单张 RTX 4090 上达到 46.7 FPS 的高帧率。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入结肠镜视频序列<br/>(仅首帧带真实标注)"] --> B["语义流蒸馏<br/>冻结 SAM 教师前向追踪与不确定性加权"]
    B --> C["遮挡感知循环一致性<br/>逆向推导与动态可见性门控截断"]
    B --> D["原型重识别<br/>动量更新全局记忆与重现激活"]
    C --> E["联合时空损失优化<br/>蒸馏损失 + 循环损失 + 平滑约束"]
    D --> E
    E --> F["部署端轻量学生网络<br/>(PVTv2-B0 + FPN, 46.7 FPS 实时推理)"]

关键设计

1. 语义流蒸馏:置信度加权的高层语义跨帧前向传播

针对传统光流在结肠镜黏膜反光与非刚性蠕动下极易发散崩塌的问题,该模块摒弃低级像素级运动场,改用冻结的 SAM-ViT-B 编码器提取深层不变语义。在稀疏监督序列中,仅首帧拥有金标准掩码 \(M_1\),教师模型根据前一帧图像与前一帧伪标签自递归推导出当前帧的掩码预测 \(\hat{M}_t\)。然而,基础模型在内窥镜复杂场景下的伪标签不可避免存在边界噪点。为此,模块设计了像素级确定性置信度矩阵 \(Q_t\),结合 SAM 预测的整体 IoU 分数 \(s_t^{iou}\) 与各像素的前景概率 \(p_t = \sigma(z_t)\) 过滤不可靠监督: $\(Q_t = s_t^{iou} \cdot |2p_t - 1|\)$ 该式中 \(|2p_t - 1|\) 在概率接近 0 或 1 时达到最大响应,在模糊过渡带(\(p_t \approx 0.5\))自动衰减为零。随后将 \(Q_t(x, y)\) 作为逐像素空间权重乘入二值交叉熵损失 \(\mathcal{L}_{BCE}\),在全序列平均后得到蒸馏损失 \(\mathcal{L}_{distill}\)。这强制轻量学生网络专注于拟合高置信区域,有效阻止了不可靠伪标签边缘带来的梯度污染。

2. 遮挡感知循环一致性:动态可见性门控阻断盲目循环监督

传统时序循环一致性假设目标在连续帧中永不消失,当息肉滑入结肠黏膜皱褶深处发生暂时性遮挡时,反向对齐机制会强制要求从空缺背景中回溯出历史目标,导致模型在正常肠壁上凭空臆造出大量假阳性高光斑块。为破解此悖论,该模块在当前预测 \(P_t\) 逆向推算历史掩码 \(\tilde{M}_{t-1}\) 的闭环中引入全局可见性系数 \(v_t \in [0, 1]\): $\(v_t = \mathrm{mean}_{\Omega_t}(Q_t) \cdot \min\left(1, \frac{|\Omega_t|}{|\Omega_{t-1}| + \epsilon}\right)\)$ 其中 \(\Omega_t = \{p_t > 0.5\}\) 为当前帧检测到的前景像素集合。当前景因遮挡发生剧烈收缩时,面积比率项急剧下降,进而压低 \(v_t\)。系统进一步设定可见性容忍阈值 \(\tau\)(文中设为 0.80),构造自适应权重截断函数 \(w_t = \max(0, v_t - \tau)\)。在目标完全隐蔽或严重残缺的帧,权重 \(w_t\) 严格置零,动态阻断逆向均方误差损失 \(\mathcal{L}_{MSE}\) 的反向传播;仅在息肉清晰可见时才恢复时序双向对齐,彻底根除了动态遮挡期间的假阳性妄想。

3. 原型重识别:动量全局特征记忆与重现激活机制

长时遮挡往往伴随镜头的快速晃动与视角剧变,极易引发不可逆的特征漂移与跟踪丢失。原型重识别模块利用学生网络的轻量特征提取器将每帧映射至下采样特征图 \(F_t \in \mathbb{R}^{D \times H' \times W'}\),首帧利用掩码 \(M_1\) 池化出初始息肉语义原型 \(C_1\)。在后续高置信度帧中,模块采用动量系数 \(\alpha = 0.90\) 执行平滑更新: $\(C_t = \alpha C_{t-1} + (1 - \alpha) \frac{\sum_{x,y} F_t(x,y) \cdot \hat{M}_t(x,y)}{\sum_{x,y} \hat{M}_t(x,y)}\)$ 在息肉遮挡期间,更新暂停以维持原型纯度。对于任意待测帧,计算特征图所有空间位置与记忆原型 \(C_{t-1}\) 的余弦相似度矩阵 \(S_t(x, y)\),并捕获全局最大响应峰值 \(s_t^{max} = \max_{x,y} S_t(x,y)\)。当 \(s_t^{max}\) 超过重识别阈值 0.72 时,判定目标脱离遮挡重新进入视场,瞬间触发新的提示信号唤醒时空跟踪流,实现长期断点后的无缝跟踪恢复。

损失函数 / 训练策略

模型采用端到端联合优化,除了加权语义流蒸馏损失 \(\mathcal{L}_{distill}\) 和遮挡感知循环一致性损失 \(\mathcal{L}_{cycle}\) 外,还引入了相邻预测帧间的时序平滑正则化项 \(\mathcal{L}_{smooth}\),通过惩罚连续帧预测概率图的绝对差异来消除内窥镜视频中的边缘高频抖动: $\(\mathcal{L}_{smooth} = \frac{1}{T-1}\sum_{t=2}^T \sum_{x=1}^H \sum_{y=1}^W |P_t(x,y) - P_{t-1}(x,y)|\)$ 总损失函数为三者的线性加权组合: $\(\mathcal{L}_{total} = \lambda_1 \mathcal{L}_{distill} + \lambda_2 \mathcal{L}_{cycle} + \lambda_3 \mathcal{L}_{smooth}\)$ 实验中超参数配置为 \(\lambda_1 = 1.0, \lambda_2 = 0.5, \lambda_3 = 0.2\)。网络在单个 RTX 4090 GPU 上使用 AdamW 优化器、初始学习率 \(1 \times 10^{-4}\) 及余弦退火策略训练 50 个 epoch,输入尺寸统一为 \(352 \times 352\)

实验关键数据

主实验

在最具权威性的结肠镜视频息肉分割基准 SUN-SEG(包含 Easy 和 Hard 两大测试子集)、视频基准 CVC-612 以及跨域未见静态基准 CVC-300 上进行了全面对比。评估指标包括均值 Dice(mDice)、均值交并比(mIoU)以及边界 Hausdorff 距离(mHD,单位 mm)。

方法 年份 主干网络 监督类型 SUN-SEG-Easy mDice / mIoU / mHD SUN-SEG-Hard mDice / mIoU / mHD CVC-612 mDice / mIoU / mHD CVC-300 mDice / mIoU / mHD
DCNet 2023 PVT-V2 全监督 78.36 / 68.63 / 29.24 75.04 / 65.55 / 28.48 88.21 / 80.85 / 25.77 86.24 / 78.25 / 18.26
PNS+ 2022 Res2Net-50 全监督 79.26 / 70.24 / 26.38 76.51 / 68.11 / 28.67 90.06 / 83.43 / 21.79 86.59 / 78.24 / 15.98
META-UNet 2023 ResNet-34 全监督 81.17 / 72.43 / 25.71 80.16 / 70.55 / 26.27 90.64 / 84.39 / 20.49 86.64 / 78.55 / 16.02
Polyp-SAM-FS 2023 ViT-B 全监督 81.33 / 73.18 / 25.19 80.52 / 71.33 / 25.82 90.47 / 84.58 / 21.29 86.83 / 78.72 / 16.53
MedSAM 2024 ViT-B 半监督基础 69.04 / 60.29 / 220.35 68.23 / 58.71 / 207.92 76.08 / 66.82 / 182.58 79.02 / 70.69 / 113.32
SAMUS 2024 ViT-B 半监督基础 81.99 / 73.37 / 25.55 80.41 / 71.37 / 26.44 90.23 / 83.68 / 23.98 86.81 / 79.23 / 16.12
SP-SAM 2025 ViT-B 半监督基础 84.34 / 77.21 / 22.36 83.25 / 73.34 / 24.86 90.47 / 85.06 / 21.15 87.09 / 79.52 / 14.98
VP-SAM 2024 ViT-B 半监督基础 84.83 / 77.48 / 21.72 84.11 / 75.04 / 22.52 91.12 / 85.15 / 20.24 87.17 / 79.41 / 14.33
FSD-Net (免提示) 2026 PVTv2-B0 稀疏蒸馏(本文) 85.62 / 78.16 / 21.22 85.28 / 77.16 / 21.38 92.33 / 86.79 / 19.34 88.26 / 80.17 / 14.06
FSD-Net (单点提示) 2026 PVTv2-B0 稀疏蒸馏(本文) 87.56 / 80.04 / 19.80 87.04 / 79.20 / 20.64 93.54 / 88.83 / 17.86 89.93 / 82.38 / 12.38

消融实验

1. 核心模块正交消融分析(SUN-SEG 官方测试集)

配置编号 SFD OACC PRM SUN-SEG-Easy mDice (%) SUN-SEG-Easy mIoU (%) SUN-SEG-Easy mHD (mm) SUN-SEG-Hard mDice (%) SUN-SEG-Hard mIoU (%) SUN-SEG-Hard mHD (mm)
1 85.62 79.50 20.85 79.42 70.15 25.66
2 85.11 79.05 20.55 79.15 71.04 24.89
3 85.26 78.42 20.97 79.56 70.33 24.12
4 86.65 79.80 20.30 85.31 76.54 21.05
5 86.20 79.67 20.40 85.11 76.88 21.45
6 86.90 79.78 20.90 85.79 76.02 21.11
7 (全模型) 87.56 80.04 19.80 87.04 79.20 20.64

2. 关键模块机制对比消融(Hard 子集重点对比)

实验组别 变体设置 SUN-SEG-Hard mDice (%) SUN-SEG-Hard mIoU (%) SUN-SEG-Hard mHD (mm) 说明
运动线索建模 Baseline (光流传播) 75.24 64.88 31.45 低级光流在黏膜反光与形变下严重漂移
+ 空间知识蒸馏 78.37 67.52 28.16 仅做静态单帧特征蒸馏,提升有限 (+2.64% mIoU)
+ SFD (本文语义流) 79.42 70.15 25.66 不确定性加权语义流大幅提升 (+5.27% mIoU)
循环一致性策略 Baseline + SFD 79.42 70.15 25.66 未加时序反向闭环
+ 标准循环一致性 78.56 69.87 26.36 盲目对齐反向传播错误梯度,性能反降 (-0.86% mDice)
+ OACC (遮挡感知门控) 85.31 76.54 21.05 动态阻断遮挡帧梯度,mDice 剧增 +5.89%,mHD 骤降 4.61mm
原型记忆机制 Baseline + SFD + OACC 85.31 76.54 21.05 缺少长期跨遮挡记忆
+ 静态原型 (Static) 85.35 78.10 20.65 无法适应息肉持续大形变,提升微弱
+ PRM (动量更新原型) 87.04 79.20 20.64 动量跟踪息肉形态演变,有效重激活长时遮挡再现目标

关键发现

  • 遮挡门控是跨越难例鸿沟的最核心模块:盲目引入标准循环一致性在 Hard 子集上反而造成 0.86% 的 mDice 下降与 0.70 mm 的边界距离恶化;而一旦引入基于可见性评分的 OACC 门控,mDice 强力跃升 5.89%(从 79.42% 升至 85.31%),证明及时抑制遮挡引起的假阳性幻觉对时序模型至关重要。
  • 动量更新是维持重识别生命力的关键:静态原型由于无法应对结肠内窥镜下非刚性息肉的剧烈视角与几何畸变,对 mDice 提升仅为 0.04%;而引入 \(\alpha = 0.90\) 的动量更新后,使 Hard 子集 mDice 最终登顶 87.04%,余弦响应峰值在重现瞬间即达 0.72 以上。
  • 可见性容忍阈值 \(\tau\) 呈现凸形敏感区间:当 \(\tau\) 从 0.60 增至 0.80 时,Hard 子集 mDice 从 84.66% 攀升至 87.04%;过低(0.60)会导致微弱遮挡过早截断有效梯度,过高(0.95)则无法过滤严重的遮挡噪声,导致 mDice 回落至 86.12%。
  • 标注效率极优:仅凭 5 帧片段中的首帧单张掩码,免提示学生网络在 Hard 子集上即取得 85.28% mDice,大幅超越全监督前沿模型(META-UNet 的 80.16% 与 Polyp-SAM-FS 的 80.52%),同时在部署端将参数量压缩至 12.7M,达到 46.7 FPS 的高实时性。

亮点与洞察

  • 高层语义流取代脆弱低级光流:传统视频分割过度信任的像素运动场在结肠镜的非刚性蠕动与液体反光下极易崩塌,而 SAM 冻结特征提供的语义关联天然具备高层几何不变性与鲁棒性。
  • 循环对齐的否定之否定设计:循环一致性是无监督/弱监督视频学习的经典基石,但本文敏锐指出了其在目标遮挡消隐时的“强制脑补”致命伤,通过可见性门控赋予了模型“知其不可对齐而放弃”的自省能力。
  • 训练重型蒸馏与部署纯轻量推理的彻底解耦:将包含数亿参数的 SAM-ViT-B 教师完全限制在离线训练阶段,学生端采用 PVTv2-B0 + FPN 仅耗 1.62GB 显存并跑满 46.7 FPS,兼顾了前沿基础模型的特征深度与手术室边端设备的低延迟需求。

局限与展望

  • 极端扁平病灶的可见性估计风险:OACC 的动态门控严重依赖基础教师模型给出的置信度。对于与周边黏膜颜色、纹理与平整度高度一致的无蒂/扁平息肉(Flat Polyps),教师模型本身可能误判为背景,导致学生网络过早抑制梯度。
  • 超长时镜头回退与视角断裂:PRM 原型库基于动量滑动更新。若结肠镜发生剧烈回拉导致息肉脱出视野长达数分钟,再次进镜时的光照与视角形变可能超出动量记忆的捕获范围。
  • 未来改进方向:引入单目深度先验与结肠腔 3D 几何拓扑重建以增强空间维度的物理遮挡推断,并对学生模型结合结构化剪枝与 INT8 量化,进一步推动软硬件一体化的嵌入式内窥镜内建系统落地。

相关工作与启发

  • vs PNS+ / META-UNet (全监督 VPS): 这类全监督模型高度依赖逐帧像素级真值,且计算开销较大。本文仅需 20% 的稀疏标注,在 SUN-SEG-Hard 上 mDice 反超 META-UNet 达 6.88%,展现出基础模型蒸馏在数据效率上的代际优势。
  • vs VP-SAM / SP-SAM (半监督基础模型迁移): 现有基础模型工作通常在测试时仍需保留沉重的 ViT-B 主干并频繁依赖点/框交互提示,推理延迟无法满足实时临床要求。本文在免提示(prompt-free)纯轻量前向模式下不仅性能反超 VP-SAM(85.28% vs 84.11%),推理速度更达 46.7 FPS。
  • vs 传统循环一致性视频分割方法 (如 Cen et al., Wu & Wang): 传统方法缺乏语义可见性建模,在遮挡消失场景下必然产生假阳性漂移。本文提出的动态遮挡截断机制具有普适性,可直接迁移至一般目标视频分割、内窥镜手术器械追踪等含频繁遮挡的动态视频任务。

评分

  • 新颖性: ⭐⭐⭐⭐ [将基础模型作为时空蒸馏教师并提出遮挡感知门控循环机制,构思巧妙]
  • 实验充分度: ⭐⭐⭐⭐⭐ [三大基准双子集详尽评测,正交消融与单模块机制对比极为扎实]
  • 写作质量: ⭐⭐⭐⭐⭐ [动机链条推导极其清晰,图表完备,数学公式与物理机制严丝合缝]
  • 价值: ⭐⭐⭐⭐⭐ [精准击中临床结肠镜标注昂贵与实时处理瓶颈,具有重大的实际落地潜力]