OBBSeg: Irregular Lesion Segmentation under Oriented Bounding Box Annotations¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/StarLxc3/OBBSeg
领域: 医学图像
关键词: 医学图像分割, 弱监督分割, 定向包围框 (OBB), 形状偏置, 提示引导
一句话总结¶
针对医学图像中不规则/各向异性病灶在传统弱监督下缺乏方向约束且易受矩形边界偏置干扰的问题,本文提出了基于定向包围框(OBB)的弱监督分割范式 OBBSeg,通过可微的 Mask-to-OBB(M2O)投影损失消除几何矩形偏置,并在编码器端引入提示驱动的前景增强与差异对比模块,以极低的标注成本取得了逼近全监督的分割性能。
研究背景与动机¶
在计算机辅助诊断与治疗规划中,精确勾勒医学图像中的解剖结构与病理病灶区域是疾病筛查和定量评估的基石。然而,以 U-Net 及其衍生结构为代表的全监督分割模型极度依赖精细的像素级标注。对于轮廓不规则、边界模糊且长宽比悬殊的复杂病灶,人工逐像素绘制掩码极其繁琐耗时,平均单张图像标注耗时长达 90 秒以上,成为限制深度分割模型在临床场景规模化落地的核心瓶颈。
为了缓解密集标注的沉重负担,点、涂鸦(scribble)和水平正交包围框(AABB)等弱监督标注策略相继被引入医学图像分割中。尽管这些粗粒度标签大幅削减了人工成本,但所能提供的几何结构约束却十分薄弱。尤其是传统的水平正交包围框,完全忽略了目标的轴向旋转与空间方向性。当病灶呈现狭长条状或斜向分布时,水平正交框不可避免地包揽了大量的正常组织背景噪声;而在相邻病灶紧密排列的区域,正交框更会发生大面积重叠与归属混淆,导致网络难以学习到可靠的边界表征。
引入具备旋转自由度的定向包围框(Oriented Bounding Box, OBB)能够以微小的标注增量(仅需标定 4 个顶点,人均耗时约 17.8 秒)提供紧凑的几何范围与方向先验,但直接以 OBB 作为刚性掩码监督又会陷入严重的“矩形形状偏置”,驱使模型倾向于预测规则的方块。核心 idea:构建以定向包围框为中介监督的 OBBSeg 范式,通过可微的 Mask-to-OBB 旋转投影机制在保留病灶范围与主轴朝向的同时彻底剥离矩形边缘偏置,并结合编码器级的前景自适应增强与对比放大,以弱监督成本实现匹敌全监督的精准病灶分割。
方法详解¶
整体框架¶
OBBSeg 的整体架构以分层视觉主干(如 ViT / SAM2 编码器或 Res2Net50)为基础,划分为四个特征提取阶段。输入图像在各特征层级中,不仅接受逐级提炼的稀疏提示掩码指导,还通过双路互补的前景增强模块抑制正常组织的假阳性干扰。在监督层面,模型摆脱了传统的硬阈值或粗糙盒约束,设计了针对 OBB 的几何对齐投影管道与跨阶段提示监督,使网络仅在真实的病灶几何外延和主轴方向上接受强约束,而将具体的轮廓形状生成自由度留给数据驱动的表征学习。
整个流水线由输入特征出发,依次经由提示辅助前景增强、差分对比前景增强,生成软掩码预测后,再送入 Mask-to-OBB 投影变换模块与多尺度一致性约束中进行端到端优化。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入图像与多尺度特征"] --> B["提示辅助前景增强 PAFE<br/>提示掩码滤波抑制背景"]
B --> C["差分对比前景增强 DBFE<br/>前景-背景差异化对比放大"]
C --> D["特征解码与软掩码预测"]
D --> E["Mask-to-OBB 变换<br/>旋转仿射→轴向投影→最小融合"]
E --> F["多目标联合损失<br/>M2O几何损失 + 层次提示损失 + 尺度一致性"]
关键设计¶
1. 提示辅助前景增强:在编码器浅层利用稀疏提示阻断背景干扰
传统的提示型分割模型(如 SAM / SAM2)通常将点、框或涂鸦提示编码后仅在解码器阶段注入,这使得强大的图像编码器在早期特征提取时缺乏明确的目标导向,容易在复杂的医学图像背景中耗散表征容量。OBBSeg 提出了提示辅助前景增强(PAFE),将用户提供的稀疏提示(点、框、涂鸦或圆)离线生成的二值化提示掩码 \(p_i\) 逐步插值缩放至各阶段特征图 \(x_i\) 的对应分辨率。通过对特征图与提示掩码执行逐元素相乘,直接滤除大部分非病灶背景噪声;同时引入残差旁路将原始特征图直接相加,即 \(x_e = x_i + p_i \odot x_i\),有效避免了稀疏或局部不完整的提示掩码意外截断尚未被完全覆盖的病灶边缘信息。
2. 差分对比前景增强:显式放大弱对比度下的前景背景判别度
医学影像中病灶边缘往往呈现弱对比度、浸润性浸润及灰度模糊,病灶内与病灶外的组织特征极其相似,单纯依靠前景相乘难以完全界定边界。差分对比前景增强(DBFE)通过显式计算前背景特征差异来强化判别力。模块首先利用提示掩码的补集 \((1 - p_{i+1})\) 提取背景区域特征,经全局平均池化(Average Pooling)压缩为整幅图像的背景语义向量 \(x_e'\);随后从阶段特征 \(x_e\) 中减去该背景表征得到差异特征因子,并再次通过前景掩码 \(p_{i+1}\) 进行聚焦门控;最后通过残差分支融入原特征中: $\(x_{i+1} = x_e + (x_e - x_e') \odot p_{i+1}\)$ 这种前背景差分运算相当于在特征空间强制做局部背景消除,大幅拉大了不均匀病灶像素与邻近健康组织的特征距离。
3. Mask-to-OBB(M2O)损失:通过几何投影彻底消除矩形形状偏置
弱监督中使用包围框最根本的弊端是几何形状先验带来的偏置:直接把框当做正样本标签监督会导致网络倾向于生成矩形掩码。为了从根本上化解这一矛盾,M2O 损失通过一系列可微矩阵几何操作对模型预测的软掩码 \(s\) 进行解耦与重构: - 实例切分与仿射校正:根据目标物体的 OBB 掩码 \(b_m\),提取单实例预测子掩码 \(s_m = s \odot b_m\);解析该 OBB 的顺时针旋转角度 \(\theta_m\),构造仿射变换矩阵 \(R_m\),利用双线性插值网格变换(Warp)将倾斜的预测掩码校正为与坐标轴水平/垂直对齐的状态 \(s_a = \text{Warp}(s_m, R_m)\)。 - 轴向最大投影:沿水平与垂直轴分别对校正后的 \(s_a\) 执行最大值池化投影,得到水平与垂直维度的一维最大概率向量 \(s_h = \max(s_a, \text{axis}=1)\) 与 \(s_v = \max(s_a, \text{axis}=0)\)。这一步完全抹去了病灶内部精细轮廓和局部边界起伏,仅萃取并锁定了其实际空间展宽与中心位置。 - 最小化融合与反向仿射:将 \(s_h\) 与 \(s_v\) 分别沿宽度与高度方向复制平铺为二维图,并通过逐像素最小化操作完成重构:\(s_{hw} = \min(s_h, s_w)\);随后应用逆变换矩阵 \(R_m^{-1}\) 将 \(s_{hw}\) 逆时针旋转 \(\theta_m\) 复原为原始姿态 \(s_o\)。 - 多目标合并与对齐监督:对于图像中存在的多个病灶,将所有实例重构结果通过逐像素最大值池化融合成统一掩码 \(s_t = \max(s_o^1, \dots, s_o^M)\)。由于 \(s_t\) 本身已经过最大投影降维重构为平整的包围盒分布,此时直接与地面真值 OBB 标签 \(y\) 计算二元交叉熵损失与 Dice 损失便不会向预测器灌输矩形先验,真正做到“用框约束范围,由特征自发决定边界”。
4. 层次化提示监督:保障多阶段演进与任意提示形态自适应
为弥补 OBB 弱监督在目标中心语义上的稀疏性,OBBSeg 引入层次化提示监督(Prompt Supervision Loss, LPS)。该机制对各中间特征阶段输出的粗掩码 \(p_i\) 以及最终预测 \(s\) 统一施加与用户输入提示 \(p\) 的对齐损失: $\(\mathcal{L}_{\text{PS}} = \mathcal{L}(s, p) + \sum_{i=1}^4 \mathcal{L}(p_i, p)\)$ 该损失函数具备自适应多模态提示的能力,针对点(Point)、涂鸦(Scribble)、边界盒(Box)与圆(Circle)分别构建对应的偏监督损失算子,仅在用户有明确标注的确信像素点上计算梯度,既避免了未标注区域的噪声假阳性,又为网络浅层特征提供了从粗到精的稳健引导。
损失函数 / 训练策略¶
模型的整体训练目标由 M2O 几何对齐损失 \(\mathcal{L}_{\text{M2O}}\)、层次化提示监督损失 \(\mathcal{L}_{\text{PS}}\) 以及跨尺度一致性损失 \(\mathcal{L}_{\text{SC}}\) 线性加权组成: $\(\mathcal{L}_{\text{total}} = \mathcal{L}_{\text{M2O}} + \mathcal{L}_{\text{PS}} + \lambda \mathcal{L}_{\text{SC}}\)$ 其中 \(\mathcal{L}_{\text{M2O}} = \mathcal{L}_{\text{BCE}}(s_t, y) + \mathcal{L}_{\text{Dice}}(s_t, y)\);\(\mathcal{L}_{\text{SC}}\) 借鉴 WeakPolyp 的尺度一致性策略,强制模型在不同尺度缩放输入下产生结构自洽的预测。
在训练策略上,实验基于两块 NVIDIA RTX 4090 GPU,采用 AdamW 优化器(初始学习率 \(1\times 10^{-4}\),权重衰减 \(5\times 10^{-4}\)),批大小设为 16,共训练 16 个 epoch。当采用 SAM2 编码器时,主干网络预训练权重全程冻结,仅更新 OBBSeg 专属设计的轻量化模块,使得模型参数量与训练开销极为轻巧。
实验关键数据¶
主实验¶
在 5 个标准化息肉基准数据集(ClinicDB, ColonDB, ETIS, Kvasir, Endo)以及视频息肉数据集 SUN-SEG 上,OBBSeg 与代表性全监督模型和主流弱监督方法进行了全面对比(评估指标为 Dice %):
| 方法 | 年份/来源 | 监督类型 | ClinicDB | ColonDB | ETIS | Kvasir | Endo | FSPD Avg. | SUN-SEG Avg. |
|---|---|---|---|---|---|---|---|---|---|
| U-Net | MICCAI 2015 | 全监督 | 82.3 | 51.2 | 39.8 | 81.8 | 71.0 | 56.1 | - |
| PraNet | MICCAI 2020 | 全监督 | 89.9 | 70.9 | 62.8 | 89.8 | 87.1 | 74.0 | 67.7 |
| CASCADE | WACV 2023 | 全监督 | 94.3 | 82.5 | 80.1 | 92.6 | 90.5 | 84.7 | - |
| EMCAD | CVPR 2024 | 全监督 | 95.2 | 92.3 | 92.3 | 92.8 | - | 92.6 | - |
| MedSAM2 (Box) | 2025 | 全监督+提示 | 94.6 | 91.7 | 93.2 | 94.4 | 93.7 | 92.8 | - |
| WeakPolyp | MICCAI 2023 | 传统弱监督 | 85.2 | 74.5 | 71.1 | 86.1 | 84.8 | 76.7 | 79.8 |
| WeakPolyp + M2O | 本文基准增强 | 弱监督(OBB) | 89.2 | 75.9 | 72.4 | 90.0 | 90.0 | 79.0 | 81.0 |
| SAM2 + OBBSeg (Point) | 本文 | 弱监督+提示 | 91.9 | 87.3 | 86.9 | 91.2 | 92.1 | 88.5 | 90.0 |
| SAM2 + OBBSeg (Scribble) | 本文 | 弱监督+提示 | 92.4 | 89.2 | 90.4 | 94.2 | 92.6 | 90.6 | 92.1 |
| SAM2 + OBBSeg (Box) | 本文 | 弱监督+提示 | 95.1 | 93.1 | 92.7 | 95.7 | 94.3 | 93.6 | 94.7 |
| SAM2 + OBBSeg (Circle) | 本文 | 弱监督+提示 | 95.1 | 93.8 | 92.9 | 95.7 | 94.8 | 94.0 | 95.0 |
在跨模态任务中,OBBSeg 同样展现出强大泛化能力:在皮肤病灶数据集(ISIC2017 / ISIC2018)上取得 94.4% 的平均 Dice;在甲状腺及乳腺肿瘤超声数据集(TN3K / DDTI / BUSI)上达到 92.0% 的平均 Dice;在多器官 CT 数据集 Synapse 上平均 Dice 达到 88.2%。
消融实验¶
在五大息肉数据集上对核心组件的剥离实验清晰印证了各设计的贡献度(Dice %):
| 配置编号 | Base (SAM2+OBB) | \(\mathcal{L}_{\text{M2O}}\) | \(\mathcal{L}_{\text{PS}}\) | DBFE | PAFE | 无提示模式 | +Point | +Scribble | +Box | +Circle |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | ✓ | 77.2 | - | - | - | - | ||||
| 2 | ✓ | ✓ | 80.5 | - | - | - | - | |||
| 3 | ✓ | ✓ | ✓ | 83.3 | 78.2 | 78.5 | 82.4 | 82.5 | ||
| 4 | ✓ | ✓ | ✓ | 81.3 | - | - | - | - | ||
| 5 | ✓ | ✓ | ✓ | ✓ | 83.6 | 81.7 | 86.4 | 91.5 | 91.8 | |
| 6 (完整模型) | ✓ | ✓ | ✓ | ✓ | ✓ | - | 88.5 | 90.6 | 93.6 | 94.0 |
此外,针对细长各向异性病灶(长宽比大于 2)的专项测试表明,加入 M2O 损失后细长病灶的分割 Dice 提升高达 +5.3%(FSPD: 65.9% \(\to\) 71.2%;SUN-SEG: 76.2% \(\to\) 81.5%),证明方向敏感的 OBB 对狭长病灶具有压倒性优势。
关键发现¶
- M2O 损失的核心脱偏作用:在不使用任何额外提示信息的纯离线设置下,仅仅将传统边界框替换为 OBB 并加入 M2O 损失,Base 模型的分割指标直接从 77.2% 飙升至 80.5%(+3.3%),若直接在 WeakPolyp 基线模型上叠加 M2O 损失,五大息肉平均 Dice 从 76.7% 提升至 79.0%,且在细长病灶上取得 5.3% 的显著涨幅,充分证实了 M2O 成功剥离了矩形假阳性边界。
- PAFE 与 DBFE 的互补增益:DBFE 在缺乏精确前景提示时增益有限(从 80.5% 到 81.3%),而一旦在提示监督 \(\mathcal{L}_{\text{PS}}\) 赋予高质量前景引导后,DBFE 与 PAFE 联手激发出极大威力,Box 提示下 Dice 从 82.4% 跃升至 93.6%,直接跨入全监督梯队。
- 标注容错与成本性价比:OBB 角度扰动在 \(\pm 30^\circ\) 范围内性能波动小于 2.3%,内边距(Padding)扩展 15 像素对精度几乎无影响。在真实人类标注实验中(平均偏差 21.20%),传统弱监督 WeakPolyp 剧烈暴跌 12.2%,而引入 M2O 的模型仅微降 1.5%,证明其对临床标注手误具有极强抗噪弹性。
亮点与洞察¶
- 将旋转仿射变换与投影融合可微化嵌入损失计算:巧妙地将旋转、一维极大值极化与反投影结合,完全抹去了不规则病灶的局部边界轮廓信息,只保留空间展布与主轴方向,使得模型无法走捷径拟合矩形边角,是一套通用的防边缘偏置范式。
- 将提示信息前置至骨干网络编码器:打破了传统 SAM 类架构“通用编码器提取 + 解码器注入提示”的定势,在编码浅层便通过逐元素滤波与前背景差分运算定向剪枝无关背景,大幅减轻了编码器在复杂医学背景中的语义混淆。
- 可复用的迁移价值:M2O 损失由纯矩阵与空间网格映射实现,不增加任何推理开销,既能作为即插即用损失直接嫁接至 Res2Net、Swin 等卷积/变换器架构,也可直接扩展到遥感图像、工业缺陷检测等同样存在大倾角、细长异形目标的弱监督分割任务中。
局限与展望¶
- 复杂拓扑与管状结构的表征瓶颈:作者指出由于 M2O 依赖沿坐标轴的连续极大值投影,当遇到具有复杂分叉树状拓扑(如全身视网膜血管网、气道树等)时,轴向投影可能会丢失多分支间的连通性与拓扑中空信息。
- 时序与原生 3D 体素扩展缺位:当前方法主要面向静态 2D 医学切片,未原生建模多期动态增强扫描或超声内窥镜视频中的时间连续性;在 3D CT/MRI 体积数据中,当前主要采用逐切片 2D 拟合,尚未原生定义 3D 定向包围盒(OBB-3D)的流形对齐。
- 未来改进方向:可进一步探索自适应轮廓演化机制与混合级弱监督(如极少量点标注协同 OBB 粗标),以及在 3D 医学体数据中构建各向异性张量场引导的弱监督形变模型。
相关工作与启发¶
- vs WeakPolyp:WeakPolyp 采用传统正交水平框(AABB)配合正向-反向投影来抑制矩形偏置,但在遇到各向异性或倾斜病灶时,正交框本身就存在巨大的外接背景面积。OBBSeg 引入具方向敏感度的 OBB 并推导了带旋转仿射的 M2O,从源头上压缩了背景冗余,在细长病灶上实现了超出 5.3% 的大幅超越。
- vs MedSAM / SAM2:原生 SAM2 将提示定位为交互解码器的先验条件,对全无提示的自动分割支持不足且编码器缺乏病灶靶向性。OBBSeg 将提示引导融入编码器内部做动态特征增强(PAFE+DBFE),不仅能处理多种几何形态提示(Point, Box, Scribble, Circle),还能在无提示的全自动推理下保持高精度。
评分¶
- 新颖性: ⭐⭐⭐⭐ [首次在医学图像弱监督分割中系统化引入定向包围框,并提出了数学严谨、完全可微且消偏彻底的 Mask-to-OBB 投影机制]
- 实验充分度: ⭐⭐⭐⭐⭐ [跨越 5 种成像模态、13 个公开数据集、20 种对比基线,包含极具说服力的人工标注耗时分析与角度/位移鲁棒性扰动实验]
- 写作质量: ⭐⭐⭐⭐⭐ [论文逻辑严密,图表设计极其直观,几何推导与算法流程叙述清晰透明]
- 价值: ⭐⭐⭐⭐⭐ [以接近水平框的标注成本撬动了比肩全监督的分割精度,在临床高通量图像分析与数据标注降本增效上具有显著落地价值]