Iterative Refinement of Semantic and Spatial Representations for Open-Vocabulary Camouflaged Object Segmentation¶
会议: ECCV 2026
论文: ECCV 2026
领域: 语义分割
关键词: 开放词汇伪装目标分割 / SAM 2 / 迭代细化 / 类别重排序器 / 分割调制器
一句话总结¶
针对开放词汇伪装目标分割中单向一次性语义注入导致的错误累积难题,本文提出 ISSR 框架,通过空间感知类别重排序器与语义分配调制器构建闭环双向交互,使空间掩码结构与文本语义表示在多轮迭代中交替校准,在 OVCamo 基准上将 cSm 指标大幅提升 14.4%。
研究背景与动机¶
伪装目标分割(Camouflaged Object Segmentation, COS)旨在从复杂背景中识别并精确分割出具有高度视觉相似性的物体,在场景解析、自动驾驶以及医疗影像等领域具有重要应用。传统 COS 方法大多建立在闭集假设之上,依赖于预定义的类别空间与固定的训练数据分布。当模型被部署至不断涌现未见类别的真实开放环境时,其泛化能力与可扩展性受到严重制约。为突破这一瓶颈,开放词汇伪装目标分割(Open-Vocabulary COS, OVCOS)应运而生,试图借助大规模视觉-语言模型(如 CLIP)的零样本迁移能力,实现对任意未见伪装类别的检测与分割。
然而,现有 OVCOS 方法普遍沿用「先分类后分割」的单向两阶段范式:首先利用 CLIP 匹配出类别的文本语义,随后将该类别语义作为静态先验直接注入下游分割网络中生成空间掩码。这种设计潜在地假设类别辨识与空间定位可以在单次前向推理中有效解耦,且初始语义预测一旦生成便不可更改。在伪装场景中,前景目标与背景模式高度混淆,语义识别与空间定位实际上存在强烈的互相依赖关系。单次分类中极微小的语义偏差都会在后续分割中被级联放大,导致灾难性的分割失败;而现有框架完全缺乏利用分割过程中逐步成型的空间结构反馈反向修正语义分类的机制,一旦早期分类出错便陷入无法自愈的死局。
深入分析可以发现,尽管 CLIP 的 Top-1 预测在伪装场景下极易受背景干扰而发生抖动,但真实类别仍以极高概率保留在 Top-N 候选预测中。这表明语义失败的根源并非模型缺乏概念表征,而是在缺乏空间几何约束时一次性排序的不可靠性;同时,分割模型迭代生成的粗糙掩码天然包含了宝贵的前背景分离线索,足以用来剔除背景干扰并校准分类。核心 idea:将类别语义与空间掩码解耦为动态演化的状态变量,构建空间结构感知的类别重排序器与语义可分配的分割调制器,通过语义引导空间分割、空间掩码反哺语义重排的闭环交替迭代,使双向表征在动态交互中渐进自纠错与相互增益。
方法详解¶
整体框架¶
ISSR(Iterative Semantic and Spatial Refinement)冻结预训练 CLIP 的图像与文本编码器以及 SAM 2 的图像编码器,重点在两模型之间构建双向交互桥梁。整个系统包含两大核心模块:空间结构感知的类别重排序器(Category Re-ranker)与语义可分配的分割调制器(Segmentation Modulator),并辅以共享的连续可学习文本提示(Learnable Prompt)机制。
在推理过程中,系统采用交替优化的闭环迭代:在第 \(t\) 轮迭代中,由重排序器输出的当前语义状态通过调制器注入 SAM 2 的编码特征与掩码解码器之间,生成更新的空间掩码;随后,该空间掩码作为显式的前景几何先验,引导重排序器聚焦局部前景区域并融合多尺度 CLIP 视觉特征,对 Top-N 候选类别进行区域级视觉一致性重排,得到更精准的语义状态并输入第 \(t+1\) 轮迭代。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入图像与候选文本"] --> B["连续可学习文本提示<br/>构建上下文向量与类别匹配"]
B --> C["空间结构感知的类别重排序器<br/>结合掩码先验与多层特征重排 Top-N"]
C --> D["语义可分配的分割调制器<br/>动态平衡细粒度交互与全局类别先验"]
D --> E["SAM 2 掩码解码器<br/>生成前景空间掩码"]
E -->|空间掩码反馈反哺分类| C
E -->|达到迭代步数 t=3| F["输出最终类别与精准分割掩码"]
关键设计¶
1. 空间结构感知的类别重排序器:利用分割先验与多层视觉特征校准 Top-N 类别置信度 针对伪装场景下 CLIP 全局特征容易受复杂背景干扰而导致全局 Top-1 排序失真的问题,重排序器并不直接依赖静态相似度,而是建立在 Top-N 候选集与空间掩码的联合约束之上。首先,输入图像经过冻结的 CLIP 图像编码器提取归一化特征 \(f\),与文本嵌入矩阵 \(W\) 计算相似度对数并取 Softmax,截取前 \(N\) 个最高概率的候选类别 \(\{(c_i, s_i)\}_{i=1}^N\)。针对每个候选类别 \(c_i\),构建紧凑的低维排序特征向量: $\(r_i = \left[ s_i, \frac{i}{N}, s_i - s_1 \right]^\top\)$ 该向量显式联合编码了绝对置信度、候选相对顺位以及与当前 Top-1 的置信度落差。随后,重排序器引入 CLIP 视觉编码器第 12、16、18 层的中间特征,经空间池化得到多尺度紧凑表征 \(\{v^{(m)}\}\),以弥补顶层语义表征中丢失的中层纹理与结构信息。更关键的是,引入当前轮次由 SAM 2 生成的空间掩码 \(M\),作为空间加权掩码约束视觉特征汇聚,强制模型关注潜在前景区域并过滤背景伪装纹理。重排序模块通过轻量多头自注意力与多层感知机计算各候选的分数增量,并采用边界成对排序损失进行监督: $\(\mathcal{L}_{cls} = \frac{1}{|\mathcal{P}|} \sum_{(p, n) \in \mathcal{P}} \max \left(0, \gamma - (\hat{s}_p - \hat{s}_n) \right)\)$ 将优化空间局限在局部 Top-N 集合中,有效消除了全局无关负样本带来的梯度噪声,实现了对混淆候选的高置信度修正。
2. 语义可分配的分割调制器:动态解耦并自适应加权细粒度语义交互与类别级约束 在语义向分割模型注入的过程中,细粒度的局部跨模态交互有助于定位概念响应区域,而高层全局类别先验则能压制歧义误检;然而两者的最优平衡随场景复杂度剧烈变化,固定的特征融合极易导致欠约束或过度拟合先验。调制器置于 SAM 2 图像编码器与掩码解码器之间,首先利用模态专属的门控网络将 SAM 2 视觉特征 \(F_{sam}\) 与 CLIP 文本特征 \(F_{clip}\) 投影对齐为 \(V_i\) 和 \(S_t\)。两者的像素级相加特征 \(F_{fus}\) 作为 Query,以 \(V_i\) 作为 Key 和 Value 输入多头交叉注意力,得到细粒度空间增强表征 \(F_{att}\)。同时,计算跨模态关联图 \(R = V_i \odot S_t\),对注意力特征实施初级调制 \(F_{rel} = F_{att} \odot R\)。为了引入强监督的全局类别锚点,重排序预测出的 Top-1 文本向量被展平为全局条件向量 \(c_{top}\),作用于关联特征得到类别感知表征 \(F_{cat} = F_{rel} \odot \text{Flatten}(\text{CLIP}(\text{Top-1}))\)。系统引入一个可学习的标量参数 \(s\) 生成自适应权重因子 \(\lambda = \sigma(s)\),并令 \(\alpha = \lambda, \beta = 1 - \lambda\),对细粒度交互与全局类别约束执行自适应凸组合: $\(F_{mod} = \alpha \cdot F_{att} + \beta \cdot F_{cat}\)$ 该机制让网络自主依据伪装场景中物体的隐蔽程度,在局部引导与全局约束之间取得最佳平衡。
3. 连续可学习文本提示:替换手工离散模板消除先验偏置 传统基于手工模板(如 "a photo of a [CLS]")的提示工程依赖专家经验,难以捕捉伪装目标特有的隐蔽外表属性与形态变异。本文引入可学习的连续提示向量替代离散模板。对于基类集合中的任意类别 \(c\),其文本提示定义为包含 \(l\) 个连续上下文向量与真实类别名称嵌入的拼接序列: $\(P_c = [p_1, p_2, \dots, p_l, cls_c]\)$ 其中连续向量 \(\{p_i\}_{i=1}^l\) 与 CLIP 文本词向量维度对齐并在训练中通过反向传播联合优化,且在所有类别间全局共享。当测试阶段遇到未见新类别时,仅需保持优化好的上下文字符串不变,直接替换末尾的类别名称嵌入 \(cls_{novel}\),从而以极低参数量平滑迁移至开放词汇伪装场景,极大提升了模型对未见隐蔽实体的泛化表征能力。
4. 语义-空间双向交替迭代:跨轮闭环修正消除初始语义偏差 为彻底打破单向两阶段流水线的局限,模型将整个推理过程表述为一个状态交替优化系统。记第 \(t\) 步的语义状态为 \(s^{(t)}\),空间掩码状态为 \(M^{(t)}\)。初始语义状态 \(s^{(0)}\) 由 CLIP 依据图像全局相似度计算出的 Top-N 文本嵌入加权和进行软初始化。在随后的每一轮迭代中,两个状态按如下闭环方程同步滚动: $\(\begin{cases} s^{(t+1)} = \mathcal{R}\left(\{e(c_i)\}_{i=1}^N, f_I, M^{(t)}\right) \\ M^{(t+1)} = \mathcal{S}\left(I, s^{(t+1)}\right) \end{cases}\)$ 在第 \(t\) 轮中,SAM 2 解码出的粗分割掩码 \(M^{(t)}\) 充当前景关注区域的注意力遮罩,帮助重排序器 \(\mathcal{R}\) 滤除无关背景噪声,在前景聚焦区域上重新对比 Top-N 类别的视觉吻合度,从而修正错误的语义标签;校准后的语义向量 \(s^{(t+1)}\) 随即输入调制器驱动的空间更新算子 \(\mathcal{S}\),指导 SAM 2 在下一轮生成边界更锐利、结构更完整的新掩码 \(M^{(t+1)}\)。这种闭环机制赋予了模型显式的自我纠错能力。
损失函数 / 训练策略¶
整个框架采用端到端联合训练策略,总损失函数综合了分割几何质量与类别重排序准确率: $\(\mathcal{L}_{total} = \mathcal{L}_{BCE}^\omega + \mathcal{L}_{IoU}^\omega + \mathcal{L}_{dice} + \mathcal{L}_{cls}\)$ 其中分割部分结合了加权二值交叉熵损失 \(\mathcal{L}_{BCE}^\omega\)、加权交并比损失 \(\mathcal{L}_{IoU}^\omega\) 以及 Dice 损失 \(\mathcal{L}_{dice}\),从像素级分类、区域重合度以及全局集合重叠三个维度对 SAM 2 输出的掩码施加多重几何约束,特别强化了对伪装弱边缘像素的惩罚力度;分类部分则由针对 Top-N 候选集的边界成对排序损失 \(\mathcal{L}_{cls}\) 构成。在训练期间,重排序器输入直接使用 Ground Truth 掩码以保证梯度方向稳定;在推理测试阶段,则完全采用 SAM 2 自主生成的掩码,实现免标注部署。训练优化器采用 AdamW,初始学习率为 \(1\times 10^{-6}\),权重衰减为 \(5\times 10^{-4}\),批大小为 4,输入图像统一调整至 \(384 \times 384\) 分辨率。
实验关键数据¶
主实验¶
在开放词汇伪装目标分割权威基准 OVCamo 上,本文将 ISSR 与代表性开放词汇语义分割(OVSS)方法以及前沿 OVCOS 专用方法(OVCoser、SuCLIP)进行量化对比。评价指标涵盖结构度量 \(cSm\)、加权 F 值 \(cF_\beta^\omega\)、平均绝对误差 \(cMAE\)、平均 F 值 \(cF_\beta\)、增强对齐度量 \(cEm\) 以及交并比 \(cIoU\)。
| 模型 | 视觉骨干 / 文本设置 | cSm ↑ | cFβω ↑ | cMAE ↓ | cFβ ↑ | cEm ↑ | cIoU ↑ |
|---|---|---|---|---|---|---|---|
| SimSeg | CLIP-ViT-B/16 / CoOp | 0.053 | 0.049 | 0.921 | 0.056 | 0.098 | 0.047 |
| OVSeg | CLIP-ViT-L/14 / 手工提示 | 0.024 | 0.046 | 0.954 | 0.056 | 0.130 | 0.046 |
| ODISE | CLIP-ViT-L/14 / 扩散生成 | 0.187 | 0.119 | 0.700 | 0.211 | 0.298 | 0.167 |
| SAN | CLIP-ViT-L/14 / 侧边适配 | 0.275 | 0.202 | 0.612 | 0.220 | 0.318 | 0.189 |
| CAT-Seg | CLIP-ViT-L/14 / 代价聚合 | 0.181 | 0.106 | 0.719 | 0.123 | 0.196 | 0.094 |
| FC-CLIP | CLIP-ConvNeXt-L / 卷积冻结 | 0.080 | 0.076 | 0.872 | 0.090 | 0.191 | 0.072 |
| OVCoser | CLIP-ConvNeXt-L / CamoPrompts | 0.579 | 0.490 | 0.336 | 0.520 | 0.616 | 0.443 |
| SuCLIP | CLIP-ConvNeXt-L / 上下文感知提示 | 0.667 | 0.594 | 0.242 | 0.633 | 0.722 | 0.540 |
| ISSR (Ours) | CLIP-ViT-L/14 / 连续可学习提示 | 0.723 | 0.663 | 0.211 | 0.693 | 0.762 | 0.611 |
除了在开放词汇设置下大幅领先,本文在传统闭集伪装目标分割基准(CAMO、COD10K、NC4K)上也与当前 SOTA 专用模型进行了跨任务能力评测:
| 方法 | CAMO (Sm ↑ / Fβw ↑ / MAE ↓) | COD10K (Sm ↑ / Fβw ↑ / MAE ↓) | NC4K (Sm ↑ / Fβw ↑ / MAE ↓) |
|---|---|---|---|
| SINet | 0.745 / 0.712 / 0.092 | 0.776 / 0.667 / 0.043 | 0.808 / 0.768 / 0.058 |
| ACUMEN | 0.886 / 0.850 / 0.039 | 0.852 / 0.761 / 0.026 | 0.874 / 0.826 / 0.036 |
| VSCode | 0.873 / 0.820 / 0.046 | 0.869 / 0.780 / 0.025 | 0.882 / 0.841 / 0.032 |
| ZoomNeXt | 0.874 / 0.839 / 0.047 | 0.887 / 0.818 / 0.019 | 0.892 / 0.852 / 0.030 |
| SAM2-UNet | 0.884 / 0.861 / 0.042 | 0.880 / 0.789 / 0.021 | 0.901 / 0.863 / 0.029 |
| CamoDiffusion | 0.878 / 0.853 / 0.042 | 0.881 / 0.814 / 0.020 | 0.893 / 0.859 / 0.029 |
| CFF-KDNet-P2 | 0.870 / 0.833 / 0.048 | 0.889 / 0.821 / 0.021 | 0.897 / 0.854 / 0.030 |
| ISSR (Ours) | 0.896 / 0.870 / 0.039 | 0.898 / 0.832 / 0.019 | 0.905 / 0.883 / 0.028 |
消融实验¶
为验证各个设计组件的有效性,作者以冻结的 CLIP 与 SAM 2 构成最基础的单向 baseline,逐步加入各个模块进行剥离验证:
| 实验编号 | 模块组合配置 | cSm ↑ | cFβω ↑ | cMAE ↓ | cFβ ↑ | cEm ↑ | cIoU ↑ | 说明 |
|---|---|---|---|---|---|---|---|---|
| No. 1 | Baseline (CLIP + SAM 2) | 0.658 | 0.615 | 0.268 | 0.620 | 0.711 | 0.534 | 单向无迭代基线 |
| No. 2 | + 类别重排序器 (R) | 0.678 | 0.634 | 0.256 | 0.645 | 0.730 | 0.557 | 纠正 Top-1 语义偏差 |
| No. 3 | + 分割调制器 (M) | 0.697 | 0.642 | 0.242 | 0.660 | 0.743 | 0.576 | 强化跨模态空间对齐 |
| No. 4 | + 连续可学习提示 (L) | 0.711 | 0.651 | 0.230 | 0.679 | 0.749 | 0.599 | 消除人工模板偏置 |
| No. 5 | + 闭环迭代机制 (I) (Full Model) | 0.723 | 0.663 | 0.211 | 0.693 | 0.762 | 0.611 | 多轮双向交替细化 |
针对核心超参数与模块构成的深入消融分析如下: 1. 迭代轮数 \(t\) 的影响:当迭代步数 \(t\) 从 1 增至 3 时,\(cSm\) 从 0.714 稳步升至 0.723,\(cIoU\) 从 0.597 提升至 0.611;但当步数进一步增至 4 或 5 时,性能出现微小下滑(\(t=5\) 时 \(cSm\) 跌至 0.711,\(cIoU\) 降至 0.586),这说明适度多轮交互能有效纠偏,但过度迭代容易导致细微误差累积并丧失语义多样性。 2. 候选集大小 Top-N:随着候选池从 2 扩增至 10,\(cSm\) 从 0.703 单调上升至 0.723;当扩大至 12 和 14 时略微退化(\(N=14\) 时 \(cSm\) 降至 0.714),表明 \(N=10\) 在捕获真值候选与避免无关负样本干扰之间达到最佳平衡。 3. 提示词长度 \(l\):当长度 \(l=16\) 时达到最优性能(\(cSm=0.723\)),过短(\(l=4, 8\))表征容量不足,过长(\(l=32, 64\))则由于可学习 token 冗余增加导致优化难度上升。 4. 重排序器输入组合:仅使用原始排序得分时 \(cSm\) 仅为 0.711;同时引入图像多尺度特征后增至 0.715;引入掩码先验后增至 0.717;当同时联合排序分数、视觉特征与空间掩码时达到峰值 0.723。
关键发现¶
- 双向交互显著突破单向性能上限:对比组件消融实验 No. 1 与 No. 5,引入完整的闭环双向交互使 \(cSm\) 净增 6.5 个百分点,\(cIoU\) 净增 7.7 个百分点,且在可视化定性对比中(如变色龙、猎豹、雪鸟等样本),消除了大量假阳性背景碎块和漏检现象。
- 空间掩码是分类纠错的核心支撑:重排序器输入消融证明,若缺乏空间掩码 \(M\) 的局部加权聚焦,多尺度特征在复杂伪装纹理下的重排能力将大打折扣;掩码先验为语言模型提供了极其关键的前景感知几何切片。
- 开放词汇与闭集性能双赢:借助基础视觉大模型 SAM 2 的泛化表征能力与轻量调制机制,该模型在无需大量全参数重训的前提下,不仅刷新了 OVCOS 纪录,还在 CAMO、COD10K 等闭集任务上超越了专用全监督 SOTA 模型。
亮点与洞察¶
- 将单向流水线转变为状态动态演化系统:打破了过去将多模态语义输出固化为一次性静态先验的思维惯性,将语义标签与空间掩码建模为交替滚动的动态状态变量,赋予模型在推理阶段显式的自纠错能力。
- 低维排序特征设计极其克制实用:重排序器没有构建庞杂的多模态交叉层,而是将绝对置信度、顺位比率及与最高分的落差压缩为 3 维特征向量,配合多尺度局部特征池化,在极低计算开销下完成了候选重排序。
- 多任务泛化迁移潜力:利用空间先验修正类别置信度、并利用校准语义引导分割的闭环逻辑,可自然泛化至弱监督目标定位、小样本实例分割以及高杂波红外弱小目标探测等高度依赖局部几何与全局语义协同推理的下游领域。
局限与展望¶
- 作者承认的局限性:当前框架主要针对单前景类别的典型伪装场景设计,在应对单幅图像内同时存在多个不同类别的多目标、多类别复合伪装场景时,缺乏显式的实例解耦与多标签细粒度语义推理能力。
- 多轮迭代带来的推理时延增加:将推理步数设为 \(t=3\) 意味着 SAM 2 解码器与重排序模块需串行执行 3 次前向计算,尽管主要骨干处于冻结状态,但相较于纯一次性前向模型而言,测试期计算时间有较为可观的增长。
- 未来改进方向:可探索自适应早停机制(根据相邻轮次掩码的 IoU 变化量动态决定迭代轮数),并将框架扩展至开放词汇伪装全景分割与视频时序伪装跟踪任务。
相关工作与启发¶
- vs OVCoser:OVCoser 是首个 OVCOS 基线,采用一次性类别语义注入指导卷积分支,缺乏反馈通路;ISSR 引入 Top-N 动态重排与三轮闭环交互,在 OVCamo 上将 \(cSm\) 从 0.579 提升至 0.723(提升 14.4%)。
- vs SuCLIP:SuCLIP 采用基于注意力的上下文感知提示机制来缓解歧义,但依然属于单向推理范式;本文在提示学习基础上进一步构筑了空间掩码向语义分类反哺的闭环通道,\(cIoU\) 较 SuCLIP 高出 7.1 个百分点。
- vs SAM2-UNet:SAM2-UNet 是闭集下基于 SAM 2 的强大分割网络,但不具备跨模态语义交互与开放词汇识别能力;本文在保持 SAM 2 强大几何分割能力的同时,通过调制器赋予其精准的语言语义引导能力。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ 创新性地在开放词汇伪装分割中引入掩码引导的类别重排序与交替闭环迭代机制,立意新颖且切中痛点。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖了 OVCOS 全套评价指标、三个传统闭集基准横向对比以及极为详尽的模块/超参数剥离实验。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑严谨,问题陈述与图表设计清晰明了,数学表达准确自洽。
- 价值: ⭐⭐⭐⭐☆ 为困难环境下的跨模态开放词汇理解提供了极具参考价值的「空间反哺语义」解题思路。