IP-SAM: Rethinking Prompt-Conditioned Segmentation for Prompt-Absent Deployment¶
会议: ECCV 2026
论文: ECCV 官方
领域: 医学图像
关键词: 提示空间条件化、无提示部署、SAM2适配、伪装目标检测、息肉分割
一句话总结¶
针对无外部提示部署场景下分割大模型提示接口失效的结构性矛盾,IP-SAM 提出提示空间条件化范式,通过自提示生成器合成互补的前背景连续提示并经冻结提示编码器投射至原生流形,结合非对称提示空间门控抑制背景伪影,在仅调优 21.26M 参数下实现 SOTA 性能。
研究背景与动机¶
以 SAM 与 SAM2 为代表的提示驱动视觉分割基础模型改变了交互式图像分割的研究范式,其通过点、边界框或粗掩码等显式空间提示引导掩码解码器完成高精度的目标轮廓解析。然而,在诸多现实部署场景中,系统往往需要在完全脱离人工交互、且无前置目标检测器生成先验提示的条件下全自动运行,即处于严格的「无提示部署」(Prompt-Absent Deployment)状态。这导致基础模型的固有推理链路遭遇结构性失配:掩码解码器在预训练时高度依赖提示信号的激活与对齐,而在实际自动化部署时却无法获得任何外部空间指引。
现有将提示分割模型迁移至自动化无提示任务(如伪装目标检测 COD、医学内窥镜息肉分割等)的策略,大多退化为「特征空间适配」路径——即在图像编码器中插入适配器(Adapters)、构建多尺度侧向融合模块或替换整个下游解码头。尽管特征层面的微调能够在一定程度上提升任务适应性,但它们普遍绕过了基础模型原生的提示编码与交互接口,导致预训练提示流形处于闲置或弱激活状态,无法充分释放基础模型沉淀的几何与边界先验。另一方面,部分尝试自动化生成离散几何提示(如预测伪点、包围盒)的方法,在强伪装与低对比度场景下极易因目标与背景纹理混淆而发生严重的位置偏移,进而将假阳性噪声注入解码流程;且直接进行前背景特征的对称融合往往会进一步放大欺骗性干扰。
面对这一矛盾,本文提出从「提示空间」(Prompt-Space)视角重新审视无提示适配问题。既然模型最擅长根据提示流形内的空间先验执行解码,那么与其绕开提示接口,不如将无提示任务的空间探索需求翻译为模型原生可识别的内部提示。核心 idea:构建自提示生成器合成互补的前背景密集与稀疏内生提示,将其连续响应注入冻结的 SAM2 提示编码器以激活原生提示流形,并在解码前通过非对称提示空间门控实施背景抑制,在无外部提示下重构纯正的提示驱动解码机制。
方法详解¶
整体框架¶
IP-SAM 的核心思想是将自动化无提示分割重构为「内生提示合成 \(\to\) 冻结提示编码 \(\to\) 提示空间非对称门控 \(\to\) 提示条件解码」的端到端管线。系统输入输入图像 \(I\),首先通过带有 LoRA 轻量微调的 SAM2 冻结图像编码器提取多尺度视觉特征,并取高层语义嵌入 \(E \in \mathbb{R}^{C \times H \times W}\)(分辨率为输入图像的 \(1/16\))。接着,自提示生成器(SPG)利用可学习任务查询从图像嵌入中解耦出互补的前景内生提示与背景内生提示。所生成的连续实值密集 Logits 与稀疏标记被直接送入 SAM2 保持冻结的原生提示编码器,映射至预训练提示嵌入空间。在送入解码器之前,提示空间门控(PSG)利用背景提示嵌入对前景提示嵌入施加非对称抑制,消除伪装纹理造成的虚警,最后由定制掩码解码器在净化后的提示条件指引下输出高质量分割掩码。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入图像 I"] --> B["SAM2 图像编码器 (LoRA)<br/>提取高层语义嵌入 E"]
B --> C["自提示生成与冻结流形投影<br/>SPG合成前背景连续提示并经冻结编码器映射"]
C --> D["提示空间非对称门控 (PSG)<br/>利用背景嵌入构造门控抑制前景虚警"]
D --> E["提示条件引导解码与语义锚定<br/>融合净化嵌入与传播标记驱动掩码解码"]
E --> F["预测粗掩码 Mc 与精细化残差输出"]
关键设计¶
1. 自提示生成与冻结流形投影:将空间线索映射至预训练原生提示流形 在伪装和复杂病灶场景下,依赖启发式规则或预测离散的边界框/点提示极易漂移并产生不可逆的定位错误。为提供平滑且具不确定性表达能力的空间引导,IP-SAM 设计了双分支自提示生成器(Self-Prompt Generator, SPG)。SPG 采用包含可学习任务查询 \(Q \in \mathbb{R}^{N \times d}\) 的双层双向 Transformer 解码器架构,在展平的图像语义特征 \(E\) 上执行交叉注意力交互,分别提取互补的前景与背景上下文。SPG 不输出离散坐标,而是直接预测连续的密集提示 Logits \(P^+, P^- \in \mathbb{R}^{1 \times 128 \times 128}\)、连续稀疏提示标记 \(S^+, S^- \in \mathbb{R}^{K \times C}\),以及专用于下游掩码解码的语义传播标记 \(T_{\text{prop}} \in \mathbb{R}^{K_m \times C}\)(与 SAM2 的掩码标记维度严格一致)。
关键机制在于流形对齐与无阈值化输入:真实世界中基础模型的掩码提示输入通常被视为二值掩码,但本方法直接将实数值连续 Logits \(P^\pm\) 输入保持严格冻结的 SAM2 原生提示编码器 \(\mathcal{E}\),得到密集提示嵌入 \(Z^\pm = \mathcal{E}(P^\pm) \in \mathbb{R}^{C \times H_e \times W_e}\);稀疏标记 \(S^\pm\) 则叠加预训练点类型嵌入形成稀疏条件 \(U^\pm\)。实测表明,二值化或温度平滑均会损失细粒度的空间不确定性置信度,而保持实值 Logits 既能与冻结提示编码器兼容,又能保留丰富的边界软概率分布。冻结提示编码器可防止下游任务特定噪声损坏预训练提示流形,使空间线索在原生几何先验约束下被正确解析。
2. 提示空间非对称门控:利用背景嵌入主动抑制欺骗性虚假激活 在极度相似的前背景纹理(如拟态伪装或早期息肉黏膜)中,常规特征融合倾向于对称拼接或相加,这极易强化背景欺骗性纹理,诱发严重的假阳性泄漏。即便提示编码器能将背景先验 \(P^-\) 映射为嵌入向量 \(Z^-\),若将两者对称送入解码器,模型仍会被虚假纹理误导。为此,IP-SAM 提出提示空间门控(Prompt-Space Gating, PSG),将负向分支严格定位于「解码前的单向抑制约束」。
PSG 首先对背景密集嵌入 \(Z^-\) 进行浅层特征变换得到未激活背景线索 \(B = \phi_{\text{feat}}(Z^-)\) 及局部门控决策图 \(G\): $\(G = \sigma(\phi_{\text{gate}}(B)), \quad \widetilde{Z}^+ = Z^+ \odot (1 - G)\)$ 其中 \((1 - G)\) 对正向密集提示嵌入 \(Z^+\) 中与背景高度相关的虚假激活施加空间抑制,生成净化后的特征 \(\widetilde{Z}^+\)。随后,模块通过融合块 \(\psi\) 将拼接特征 \([\widetilde{Z}^+, B]\) 映射回 \(C\) 通道,并采用以未抑制的正向提示 \(Z^+\) 为基准的锚定残差连接: $\(Z = \psi([\widetilde{Z}^+, B]) + Z^+\)$ 之所以锚定到原始 \(Z^+\) 而非被门控削弱的 \(\widetilde{Z}^+\),是因为抑制门控在滤除伪影时可能轻微衰减细小前景边界;以 \(Z^+\) 为残差支架能完整保全正向提示拓扑,使卷积融合块仅专注于补偿提示空间噪声并消除孤立假阳性。
3. 提示条件引导解码与语义锚定:多维提示协同与多尺度边缘精细化 经过提示空间门控净化后,提示条件被送入下游掩码解码器。为了全面激活基础模型的解码潜力,IP-SAM 构造了多维协同提示输入:将正负两路稀疏提示标记拼接为统一稀疏条件 \([U^+; U^-]\),同时使用 SPG 前景分支产出的传播标记 \(T_{\text{prop}}\) 替换 SAM2 解码器中默认的静态掩码标记,保留原生 IoU 预测标记 \(T_{\text{iou}}\)。解码器 \(\mathcal{D}\) 在图像全局特征 \(E\)、净化密集提示嵌入 \(Z\)、联合稀疏标记以及语义输出标记驱动下生成粗糙掩码 \(M_c\): $\(M_c = \mathcal{D}(E, Z, [U^+; U^-], [T_{\text{iou}}; T_{\text{prop}}])\)$ 此外,模型提供了两项即插即用的轻量增强组件:一是侧向抑制模块(Lat.),利用切断梯度的粗掩码软门控 \(\sigma(M_c)\) 对多尺度 FPN 特征执行空间掩蔽,降低非目标区域干扰;二是像素精细化头(Ref.),在低通道瓶颈下融合粗掩码、净化提示嵌入和多尺度特征,通过零初始化卷积输出高频残差校正 \(M = M_c + \mathcal{R}(\cdot)\),提升极细微边缘(如触角、微小黏膜凹陷)的定位精度。
损失函数 / 训练策略¶
整个系统端到端联合训练。SPG 前背景提示通过互补交叉熵损失监督,确保双分支各自捕获目标与背景特征: $\(\mathcal{L}_{\text{SPG}} = \text{BCE}(\sigma(P^+), Y) + \text{BCE}(\sigma(P^-), 1 - Y)\)$ 其中 \(Y\) 为二值真值标签。掩码解码损失 \(\mathcal{L}_{\text{mask}}\) 由标准二值交叉熵(BCE)、IoU 损失与 L1 损失线性组合而成。整体目标函数为: $\(\mathcal{L} = \lambda_{\text{spg}}\mathcal{L}_{\text{SPG}} + \lambda_c \mathcal{L}_{\text{mask}}(M_c, Y) + \lambda_r \mathcal{L}_{\text{mask}}(M, Y)\)$ 实验中权重均设为 \(\lambda_{\text{spg}} = \lambda_c = \lambda_r = 1.0\)。参数优化方面,提示编码器保持完全冻结,SAM2 图像编码器的注意力投影层(QKV 及输出投影)插入 Rank=32 的 LoRA 适配器,其余参数仅包含轻量的 SPG、PSG 与任务定制解码器,总可训练参数量严格控制在 21.26M。在单张 RTX 3090 上采用 AdamW 优化器(初始学习率 \(1 \times 10^{-4}\),Batch Size=1)训练 100 个 Epoch 即可收敛。
实验关键数据¶
主实验¶
在伪装目标检测四大主流基准(CAMO、CHAMELEON、COD10K、NC4K)上,与纯专用检测模型及基于 SAM/SAM2 的适配方法进行无外部提示下的定量对比(评估指标包括平均绝对误差 MAE \(\downarrow\)、加权 F 值 \(F_\beta^\omega \uparrow\)、结构度量 \(S_m \uparrow\) 和增强对齐度量 \(E_\phi \uparrow\)):
| 数据集 | 指标 | IP-SAM (本文) | ZoomNeXt (专用SOTA) | SAM2-Adapter (SAM2适配) | SAM2 (零提示基线) |
|---|---|---|---|---|---|
| COD10K | MAE \(\downarrow\) / \(S_m \uparrow\) | 0.017 / 0.906 | 0.018 / 0.898 | 0.020 / 0.891 | 0.132 / 0.669 |
| COD10K | \(F_\beta^\omega \uparrow\) / \(E_\phi \uparrow\) | 0.838 / 0.947 | 0.834 / 0.939 | 0.814 / 0.936 | 0.287 / 0.531 |
| CAMO | MAE \(\downarrow\) / \(S_m \uparrow\) | 0.032 / 0.912 | 0.041 / 0.892 | 0.048 / 0.884 | 0.198 / 0.658 |
| CAMO | \(F_\beta^\omega \uparrow\) / \(E_\phi \uparrow\) | 0.878 / 0.946 | 0.857 / 0.935 | 0.817 / 0.915 | 0.348 / 0.506 |
| CHAMELEON | MAE \(\downarrow\) / \(S_m \uparrow\) | 0.018 / 0.920 | 0.020 / 0.903 | 0.025 / 0.909 | 0.182 / 0.660 |
| NC4K | MAE \(\downarrow\) / \(S_m \uparrow\) | 0.026 / 0.911 | 0.030 / 0.902 | 0.030 / 0.906 | 0.159 / 0.722 |
在医学息肉分割跨数据集泛化任务上(在 Kvasir-SEG 训练,在 CVC-ClinicDB 与 ETIS 零样本泛化测试):
| 数据集 | 指标 | IP-SAM (本文) | LACFormer (专病SOTA) | SAM2-Adapter | MDSAM |
|---|---|---|---|---|---|
| Kvasir-SEG (域内) | mDice \(\uparrow\) / mIoU \(\uparrow\) | 0.913 / 0.861 | 0.906 / 0.851 | 0.899 / 0.846 | 0.906 / 0.851 |
| Kvasir-SEG (域内) | \(S_m \uparrow\) / MAE \(\downarrow\) | 0.929 / 0.025 | 0.922 / 0.029 | 0.918 / 0.031 | 0.922 / 0.028 |
| CVC-ClinicDB (跨域) | mDice \(\uparrow\) / mIoU \(\uparrow\) | 0.840 / 0.778 | 0.826 / 0.758 | 0.801 / 0.738 | 0.796 / 0.724 |
| ETIS (跨域) | mDice \(\uparrow\) / \(S_m \uparrow\) | 0.764 / 0.868 | 0.798 / 0.884 | 0.733 / 0.847 | 0.753 / 0.858 |
消融实验¶
核心模块逐级叠加消融(在 COD10K 与 CAMO 上评测):
| 配置 | 可训练参数 (M) | COD10K MAE \(\downarrow\) | COD10K \(S_m \uparrow\) | CAMO MAE \(\downarrow\) | CAMO \(S_m \uparrow\) | 说明 |
|---|---|---|---|---|---|---|
| 基线 (LoRA + 解码器 + 零提示) | 9.15 | 0.024 | 0.857 | 0.043 | 0.859 | 缺失提示,性能严重受抑 |
| + 自提示生成器 (SPG) | 17.00 | 0.022 | 0.872 | 0.041 | 0.875 | 激活提示流形,误差初步收敛 |
| + 提示空间门控 (PSG) | 18.98 | 0.019 | 0.893 | 0.034 | 0.902 | 滤除背景假阳性,CAMO大幅跃升 |
| + 侧向抑制 (Lat.) | 19.13 | 0.018 | 0.899 | 0.032 | 0.907 | 压制多尺度特征边缘杂散响应 |
| + 像素精细化 (Ref., 完整模型) | 21.26 | 0.017 | 0.906 | 0.032 | 0.912 | 细节边界对齐,达到最优指标 |
提示空间门控与交互算子设计对比:
| 算子设计 | 可训练参数 (M) | COD10K MAE \(\downarrow\) | CAMO MAE \(\downarrow\) | 说明 |
|---|---|---|---|---|
| 无交互 (弃用背景 \(Z^-\)) | 19.27 | 0.020 | 0.040 | 缺失背景约束,误检率上升 |
| 差分融合 (\(Z^+ - Z^-\)) | 19.93 | 0.019 | 0.038 | 对称减法易削弱脆弱的前景响应 |
| 拼接融合 (\([Z^+; Z^-]\)) | 20.37 | 0.019 | 0.038 | 对称特征混合放大欺骗性纹理 |
| 锚定至门控后特征 \(\widetilde{Z}^+\) | 21.26 | 0.019 | 0.039 | 门控弱化前景导致残差优化受阻 |
| 非对称门控 (锚定 \(Z^+\), 本文) | 21.26 | 0.017 | 0.032 | 隔离背景伪影并完整维持前景拓扑 |
关键发现¶
- 提示空间流形激活的核心价值:在消融实验中,若直接把 SPG 的输出作为最终分割掩码(Full-SPG Direct),其 COD10K MAE 仅为 0.025;而将同一输出路由进冻结提示编码器并在提示流形内解码后,MAE 迅速优化至 0.017。这证明了性能增益并非单纯源于 SPG 的特征抽取参数量,而是将线索引入预训练提示空间所产生的正向几何约束增益。
- 背景非对称约束至关重要:PSG 模块带来的性能跃升是整个体系中最显著的,特别是在背景高度杂乱的 CAMO 数据集上,引入 PSG 直接将 MAE 从 0.041 骤降至 0.034。特征图可视化证实,PSG 成功在目标外围构建了深蓝色的「背景隔离环」,主动截断了伪装区域向外蔓延的特征假阳性。
- 解耦调优防止灾难性漂移:若放开提示编码器一同微调(Trainable Prompt Encoder),COD10K MAE 反而从 0.017 劣化至 0.019。保持提示编码器严格冻结,能够将 SAM 预训练的大规模几何空间基底作为锚点,抵御下游极端混淆数据对表示空间的扭曲。
亮点与洞察¶
- 范式转换(特征空间绕行 \(\to\) 提示空间重连):打破了过去无提示适配领域盲目堆叠特征适配器或侧向连接的惯性思维,提出将密集前背景假设作为内生连续提示重定向至冻结提示编码器,用模型最擅长的方式解锁了基础模型的预训练潜力。
- 背景提示的非对称负反馈机制:洞察到在强混淆任务中背景信息不可简单以对称方式拼接,PSG 创造性地将负向提示嵌入构建为空间抑制门控,实现了在特征进入解码器前的先验降噪。
- 超轻量参数下的泛化迁移力:仅调优 21.26M 参数,不仅在伪装目标检测四大基准上全面击败全量参数微调的专用架构,还能无需任何超参数修改无缝迁移到医学息肉病灶分割领域,展示出在二值前景-背景分割任务上的高度可移植性。
局限与展望¶
- 二值前背景假设的范围局限:当前架构专为前景-背景二值分割任务(如 COD、SOD、息肉分割)设计,依赖成对的互补前背景查询;若迁移至 COCO 风格的多类别多实例分割或开放词表目标解析,内生提示的构造与分配机制需要进一步重构。
- 基础模型尺度的强依赖性:实验表明在较小的 SAM2-T 或 SAM2-B 骨干上,内生提示的前背景可分性显著降低,可能导致负向分支过度抑制边缘目标。未来可探索置信度感知与自适应抑制强度的门控机制。
相关工作与启发¶
- vs SAM-Adapter / SAM2-Adapter: 后者通过在 Transformer 块旁路插入轻量 MLP 适配器进行特征空间干预,但本质上使得提示编码器处于空置状态;本文则保留提示交互通道,将生成式内生提示直接映射入预训练提示流形,解码效果更具几何结构一致性。
- vs AutoSAM / RSPrompter: 这类方法通常训练辅助网络预测显式的离散点坐标或边界框;在伪装严重的环境下离散坐标预测容错率极低,容易因跳变产生严重误报。IP-SAM 坚持全流程采用连续概率 Logits 与密集嵌入,保留了平滑的空间不确定性。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 颠覆了无提示分割任务绕开提示编码器的惯性方案,建立了优雅的提示空间内生重定向与非对称门控体系。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 4 个伪装基准、3 个医学息肉基准,提供完备的逐模块消融、多种控制对比及详细的特征层决策图可视化。
- 写作质量: ⭐⭐⭐⭐⭐ 概念界定严谨,从接口失配问题引申到方法演进逻辑通顺,实验支撑密实自洽。
- 价值: ⭐⭐⭐⭐⭐ 为基础大模型在无人工交互边缘设备与自动化流水线中的高效落地提供了极具参考价值的轻量级通用方案。