跳转至

CURE: Contextual Debiasing and Unbiased Refinement for Training-Free Open-Vocabulary Semantic Segmentation

会议: ECCV 2026
论文: ECCV 原文
领域: 语义分割
关键词: 开放词表语义分割, 视觉语言模型, 特征去偏, 异常Token剔除, 空间相关性细化

一句话总结

针对基于预训练视觉语言模型的免训练开放词表语义分割中全局上下文偏置导致的特征同质化与定位退化问题,提出无需额外训练的 CURE 框架,通过异常 Token 剔除重建、非异常均值去偏以及中层特征空间相关性细化三阶段,显著提升稠密预测质量并消除大容量模型的性能倒挂。

研究背景与动机

近年来以 CLIP 为代表的视觉语言模型(VLM)在图像级图文对齐上取得了巨大成功,极大推动了开放词表语义分割(OVSS)的发展。由于免训练(Training-free)方案直接利用预训练视觉编码器对图像 Patch 进行密集特征提取并与类别文本嵌入计算相似度,无需依赖昂贵的人工标注和繁琐的微调重训,因而在开放世界泛化和动态场景适应中展现出独特优势。然而,现有免训练方法在密集像素预测时常常遭遇严重的定位模糊与假阳性伪影,难以精准解析细粒度目标边界。

这种性能瓶颈的本质根源在于 VLM 预训练目标的图像级全局约束与稠密像素级语义对齐之间的核心矛盾。在以 [CLS] 词元为核心的对比学习目标驱动下,ViT 深层块中的图像 Patch Token 会过量吸纳整幅图像的全局上下文信息,导致空间局部辨别力被严重稀释。实证分析表明,深层网络中约 3.5% 的 Patch Token 会展现出异乎寻常的极高 \(L_2\) 范数(范数大于 40),且其注意力模式高度复制 [CLS] 词元的全局漫散分布,这类异常 Token 的分类准确率普遍低至 20% 以下。更为棘手的是,即便在非异常 Token 中,也弥漫着不可忽视的隐式全局偏置,且随着主干网络容量从 ViT-B 提升到 ViT-L,全局偏置的纠缠效应进一步加剧,反常地导致大容量模型在未去偏时的分割性能反而低于小模型。

现有相关工作(如 SCLIP、ClearCLIP、ResCLIP)主要集中在对最后几层的自注意力权重矩阵进行启发式重标定(例如去除残差与 FFN、平均 Query-Query 与 Key-Key 矩阵),但它们既未剔除破坏局域特征的高范数异常离群值,也未消除非异常表征中普遍残留的全局漂移分量。核心 idea:将深层 Patch 表征显式分解为局部真实语义与全局干扰偏置,先通过“剔除并邻域重建”根除显式高范数异常 Token,再利用非异常经验质心减除隐式全局均值漂移,最后引入无偏的中层空间自相关先验细化最终表征,实现无侵入、免训练的高保真局部语义恢复。

方法详解

整体框架

CURE 旨在不对预训练视觉编码器做任何结构破坏或参数更新的前提下,以后处理特征去偏与细化流水线净化最终输出特征。其输入为输入图像经预训练 ViT 编码器提取的多层表征,输出为各像素位置与候选类别文本嵌入匹配后的最终语义分割掩码。整个处理流程解耦为三个递进阶段:首先,通过异常 Token 剔除与重建(RR)净化倒数第二层特征中范数畸高、模式退化的显式离群点;随后,通过全局上下文去偏(GCD)估计并扣除非异常 Token 中的隐式共享全局分量;最后,借助空间相关性细化(SCR)模块,利用较浅中层注意力特征构建的空间语义亲和矩阵,对去偏后的深层特征进行空间一致性增强与语义边界重校准。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入图像与 ViT 多层特征抽取"] --> B["异常Token剔除与重建 (RR)<br/>高范数阈值过滤 + 切比雪夫近邻均值重建"]
    B --> C["全局上下文去偏 (GCD)<br/>非异常 Token 经验质心对齐与均值残差剥离"]
    A -.->|提取中层第 m 层特征与 Value 向量| D["空间相关性细化 (SCR)<br/>中层双重亲和度矩阵调制深层去偏表征"]
    C --> D
    D --> E["文本嵌入余弦相似度匹配与分割掩码输出"]

关键设计

1. 异常Token剔除与重建(Reject and Reconstruct, RR):根除显式高范数全局伪影

针对深层特征中少数 Token 因过度吸收全局信息而退化为类似 [CLS] 的全局汇聚点(Attention Sink)且分类精度急剧下降的痛点,RR 模块通过两阶段机制进行显式清除与无损修复。在剔除阶段,模块监控倒数第二层(第 \(L-1\) 层)所有 Patch Token \(x_i\) 的 \(L_2\) 范数,一旦超过预设硬阈值(默认 \(\tau = 40\)),即判定该 Token 为被全局上下文严重污染的离群点并予以丢弃。在重建阶段,依据自然图像语义在局部空间维度的连续平滑假设,利用未被丢弃的有效邻域 Token 对离群位置进行均值加权重建。对于位于二维网格位置 \(p=(i,j)\) 的离群点,其局部邻域根据切比雪夫距离(阈值设定为 2,对应周围 \(5 \times 5\) 窗口内的有效 Token 集合 \(V(p)\))界定,其重构特征计算公式为:

\[\tilde{x}_p = \frac{1}{|V(p)|} \sum_{q \in V(p)} x_q\]

该设计不仅直接阻断了高范数伪影在后续相似度匹配中的主导干扰,而且通过局部上下文平滑完整保持了目标区域的几何连续性。

2. 全局上下文去偏(Global Contextual Debiasing, GCD):剥离隐式共享全局漂移

尽管 RR 模块消除了极端离群点,但非异常 Token 内部依然潜伏着由图像级对比预训练目标诱发的全局同质化背景漂移。根据高维统计学性质,图像中各个彼此独立的局部语义区域在高维表征空间中呈现近似正交分布,而模型对整图共享的上下文残差往往沿着同一主方向集中。因此,GCD 将每个 Patch Token 假定为局部固有语义与全局共享偏置的加性组合:\(x_i = x_i^{\text{semi}} + x_i^{\text{bias}}\)。GCD 并非简单、粗暴地减去图像的 [CLS] 词元([CLS] 往往高度浓缩了整图的显著前景类别语义,直接减除会误伤有效信号导致性能剧烈波动),而是通过计算经 RR 模块过滤后所有有效 Token 的经验均值作为无偏的全局偏置向量估计:

\[\hat{x}_{\text{bias}} = \frac{1}{n} \sum_{i=1}^n \tilde{x}_{i, \text{RR}}\]

进而使用可调节强度因子 \(\alpha\) 对特征进行线性残差消去:

\[x_{i, \text{GCD}} = x_{i, \text{RR}} - \alpha \cdot \hat{x}_{\text{bias}}\]

在 ViT-B/16 中 \(\alpha\) 取 0.25,而在全局偏置更为严重的 ViT-L/14 中 \(\alpha\) 提升至 0.40。该模块在纯几何代数层面剥离了共模干扰,显著拉开了不同语义类别之间的特征角距离。

3. 中层空间相关性细化(Spatial Correlation Refinement, SCR):借力中层浅层几何先验重构局部一致性

虽然特征在深层完成了去偏,但深层 ViT 在多头自注意力和多层下采样传递后已损失了部分局部微观边界信息;而在浅层/中层,Token 之间的异常偏置尚未严重积累,保留了高度忠实于图像色彩、纹理和边缘的细粒度空间拓扑结构。为避免直接改动中层表征破坏 VLM 的零样本通用对齐基座,SCR 采用跨层导引策略:提取适度中层(ViT-B/16 为第 3 层,ViT-L/14 为第 6 层)的 Patch 特征矩阵 \(X^m \in \mathbb{R}^{N \times d}\) 与 Value 向量矩阵 \(V^m \in \mathbb{R}^{N \times d}\),分别构建反映空间共线性的特征自相似矩阵以及反映语义区分性的 Value 相似矩阵,加权融合成综合空间亲和矩阵 \(\mathcal{A}_{\text{SCR}} \in \mathbb{R}^{N \times N}\):

\[\mathcal{A}_{\text{SCR}} = X^m \cdot (X^m)^T + V^m \cdot (V^m)^T\]

随后,利用该亲和矩阵对经 GCD 去偏后的最终表征 \(X_{\text{GCD}}\) 执行扩散式滤波细化:

\[X_{\text{SCR}} = \mathcal{A}_{\text{SCR}} \cdot X_{\text{GCD}}\]

经过 SCR 聚合后,相同物体内部的 Patch 表征高度协同对齐,而物体边界与背景之间的对比过渡更加陡峭清晰,有效克服了传统免训练方法边缘锯齿与同质区域空洞的顽疾。

损失函数 / 训练策略

CURE 为完全免训练(Training-free)纯推理后处理框架,整个流程在推理阶段完成,不引入任何可学习参数,亦无需反向传播梯度或微调优化。最终分割掩码通过计算细化后特征 \(X_{\text{SCR}}\) 与工程化提示词(如 "a photo of {class} in the scene")经由 CLIP 文本编码器生成的类别原型 \(X_{\text{text}}\) 之间的逐点余弦相似度并取最大响应得到:

\[M = \arg\max_{c \in C} \left( \cos(X_{\text{SCR}}, X_{\text{text}}^c) \right)\]

评估时遵循标准滑动窗口推断协议,针对高分辨率城市街景(Cityscapes)采用 \(560\) 分辨率与 \(224 \times 224\) 窗口(步长 112),其余数据集统一缩放短边至 \(448\) 并使用 \(448 \times 448\) 窗口(步长 224),不施加任何额外密集 CRF 等后处理。

实验关键数据

主实验

在五个代表性开放词表语义分割基准数据集(PASCAL VOC 2012、PASCAL Context、ADE20K、Cityscapes、COCO-Stuff)上,对比主流训练型及免训练方案,并测试 CURE 即插即用增强各类基线的通用表现。

方法 来源 / 会议 免训练 (TF) 主干网络 VOC20 PC59 ADE20K Citysc. C-Stf 平均 (Avg.)
GroupViT CVPR 2022 否 ViT-B/16 79.7 23.4 9.2 11.1 15.3 27.7
TCL CVPR 2023 否 ViT-B/16 77.5 30.3 14.9 23.1 19.6 33.1
ReCLIP CVPR 2024 否 ViT-B/16 75.8 33.8 14.3 19.9 20.3 32.8
CLIP-DINOiser ECCV 2024 否 ViT-B/16 80.8 36.0 20.1 31.1 24.6 39.2
CLIP-DINOiser w/ CURE 本文增强 否 ViT-B/16 83.8 38.6 21.5 34.2 26.4 41.5 (+2.3)
原生 CLIP ICML 2021 是 ViT-B/16 41.7 9.1 2.2 6.6 4.4 12.8
原生 CLIP w/ CURE 本文增强 是 ViT-B/16 77.1 23.7 10.0 21.7 15.8 29.7 (+16.9)
MaskCLIP ECCV 2022 是 ViT-B/16 60.2 26.1 12.2 25.7 16.4 28.1
MaskCLIP w/ CURE 本文增强 是 ViT-B/16 64.3 32.5 15.9 33.9 21.2 33.6 (+5.5)
SCLIP ECCV 2024 是 ViT-B/16 78.1 33.0 14.6 32.3 21.1 35.8
SCLIP w/ CURE 本文增强 是 ViT-B/16 79.2 38.2 18.6 37.0 25.5 39.7 (+3.9)
ClearCLIP ECCV 2024 是 ViT-B/16 80.9 35.9 16.7 32.0 23.9 37.9
CURE (ClearCLIP基座) 本文 是 ViT-B/16 82.1 38.7 18.4 35.7 25.8 40.1 (+2.2)
ResCLIP CVPR 2025 是 ViT-B/16 85.3 36.9 17.6 35.9 24.6 40.1
ResCLIP w/ CURE 本文增强 是 ViT-B/16 86.4 38.9 18.8 37.9 25.9 41.6 (+1.5)
SCCLIP TIP 2025 是 ViT-B/16 84.3 40.1 20.1 41.0 26.6 42.4
SCCLIP w/ CURE 本文增强 是 ViT-B/16 84.7 40.3 20.4 42.3 26.6 42.9 (+0.5)
原生 CLIP ICML 2021 是 ViT-L/14 15.7 4.5 1.3 3.2 2.4 5.4
MaskCLIP ECCV 2022 是 ViT-L/14 30.1 12.6 7.0 12.0 8.9 14.1
MaskCLIP w/ CURE 本文增强 是 ViT-L/14 57.2 29.3 17.2 26.3 19.5 29.9 (+15.8)
SCLIP ECCV 2024 是 ViT-L/14 60.3 20.5 7.0 21.1 13.1 24.4
SCLIP w/ CURE 本文增强 是 ViT-L/14 82.6 36.6 19.3 37.9 24.3 40.1 (+15.7)
ClearCLIP ECCV 2024 是 ViT-L/14 80.0 29.6 15.0 31.8 19.9 35.3
CURE (ClearCLIP基座) 本文 是 ViT-L/14 83.3 35.7 18.7 36.9 23.6 39.6 (+4.3)
ResCLIP CVPR 2025 是 ViT-L/14 86.6 32.9 16.8 33.7 22.3 38.5
ResCLIP w/ CURE 本文增强 是 ViT-L/14 87.4 36.1 18.7 38.6 24.6 41.1 (+2.6)
SCCLIP TIP 2025 是 ViT-L/14 88.3 40.5 21.5 41.1 26.9 43.7
SCCLIP w/ CURE 本文增强 是 ViT-L/14 88.5 41.2 22.0 42.4 27.1 44.2 (+0.5)

消融实验

基于 ViT-B/16 架构在 ADE20K、PASCAL Context (PC59) 及 Cityscapes 数据集上对三大核心模块进行系统消融分析,验证各项设计的独立效能与复合互补性。

配置 RR (异常剔除重建) GCD (全局去偏) SCR (空间细化) ADE20K PC59 Citysc. 三数据集平均 说明
基线 (ClearCLIP) - - - 16.7 35.9 32.0 28.2 原始未经去偏与细化的表征
仅加入 RR ✓ - - 17.0 36.5 33.1 28.9 剔除极端高范数离群点 (+0.7%)
仅加入 GCD - ✓ - 17.3 36.3 33.8 29.1 消除共享全局上下文偏置 (+0.9%)
仅加入 SCR - - ✓ 17.3 37.3 33.7 29.4 引入中层几何空间先验 (+1.2%)
RR + GCD ✓ ✓ - 17.5 36.9 34.2 29.5 显式与隐式去偏联合 (+1.3%)
RR + SCR ✓ - ✓ 17.5 37.6 34.0 29.7 剔除异常后注入中层关联 (+1.5%)
GCD + SCR - ✓ ✓ 18.2 38.4 35.2 30.6 隐式去偏与中层关联协同 (+2.4%)
完整模型 (CURE) ✓ ✓ ✓ 18.4 38.7 35.7 30.9 三模块完整协同达到最佳 (+2.7%)

全局去偏策略消融(GCD 对比简单减除 [CLS])

去偏机制设计 ADE20K PC59 Cityscapes 平均 (Avg.) 机制表现与分析
CURE (去除 GCD) 17.5 37.6 34.0 29.7 缺少隐式去偏,深层共享背景偏置残留
直接减除 [CLS] Token 向量 17.9 36.9 34.7 29.8 PC59 反常下跌 0.7%,因 [CLS] 包含主干任务语义,粗暴减除损伤有用前景
CURE (采用 GCD 经验均值质心) 18.4 38.7 35.7 30.9 在所有数据集稳定显著提升,精准剥离共模漂移

关键发现

  • 大模型性能倒挂现象的逆转:未经过偏置抑制时,ViT-L/14 由于参数量大、对对比图像级损失拟合强,其全局偏置比 ViT-B/16 更加极端,导致 SCLIP 在 ViT-L/14 下的平均 mIoU 仅有 24.4%,远落后于 ViT-B/16 的 35.8%。CURE 将 ViT-L/14 的 SCLIP 暴拉 15.7% 达到 40.1%,一举反超小模型,彻底释放了大容量视觉编码器的特征潜力。
  • 长尾小样本与背景类别的显著收益:在包含背景类的基准(VOC21、PC60)上,CURE 为 ClearCLIP 分别带来 +4.3% 和 +2.6% 的 mIoU 提升;在 Cityscapes 与 ADE20K 的长尾类别子集上(占比小于 1% 的小物体),CURE 分别使 ClearCLIP 和 SCLIP 获得 1.9% 与 3.4% 的提升,证明去除全局同质偏置能有效唤醒对小面积稀缺目标的辨别力。
  • 极低的计算与延迟开销:在单张 NVIDIA RTX 3090 上,基线 ClearCLIP 计算量为 34.9 GFLOPs、吞吐量为 35.3 IPS;完整挂载 CURE 后的运算量仅增至 35.0 GFLOPs,推理吞吐仍维持在 32.3 IPS,几乎零代价实现性能阶跃。

亮点与洞察

  • 离群点不仅是伪影,更是破坏局部语义的元凶:文章洞察到深层 ViT 中高范数 Token(范数 > 40)的行为与 [CLS] 高度拟合,直接用局部空间切比雪夫均值重构该点,以极其轻量优雅的操作切除了模型“注意力黑洞”。
  • 加性分解与高维正交假设的精妙契合:避免复杂的神经网络重调,借助高维统计中局部语义相互正交、全局偏置高度共线的特性,直接求取非离群点的经验均值即可高保真拟合偏置向量,解决了长久以来减 [CLS] 掉点、不减 [CLS] 偏置严重的顽疾。
  • 跨层特征先验借力打力:不破坏中层权重,而是将中层干净的自相关与 Value 亲和结构作为滤波算子作用于去偏后的深层语义,既保住了 CLIP 顶层的强语义泛化性,又追回了底层精准的空间边界。

局限与展望

  • 极端大目标或与背景极度相似区域的欠分割:作者指出当单个前景物体几乎占据整张画面或前景颜色与背景极其接近时,GCD 计算出的全局经验均值容易卷入过多该物体自身的特征成分,相减后导致局部特征过度衰减或边缘平滑。
  • 超细微结构在重构中的弱势:RR 模块依赖切比雪夫局域均值重构,若离群点恰好处在单像素细长电线、细枝等极端微弱结构上,局部平均可能会轻微模糊这类精细几何形态。
  • 未来方向:探索依据特征局部方差动态自适应调整去偏强度 \(\alpha\),或者结合自适应聚类质心而非单纯全图平均,进一步兼顾超大前景与超微结构的边缘锐度。

相关工作与启发

  • vs ClearCLIP / SCLIP: 现有免训练 OVSS 仅在最终自注意力矩阵的运算逻辑上做文章(如削减残差或重加权 Query-Key 相似),把所有 Token 一视同仁;本文指出高范数离群 Token 的毒性和深层共享偏置是核心病灶,通过显式切除与隐式减除直击痛点。
  • vs 训练型方法 (GroupViT / TCL / ReCLIP): 训练型方法需要耗费大量 GPU 算力重新在大规模图文对或无标注数据上微调掩码生成器,且易破坏原本预训练模型的开放词表自由度;CURE 为纯推理阶段即插即用技术,无需任何数据重训即可超越早期的弱监督训练模型。
  • 迁移启发:CURE 中的“高范数异常检测 + 局部平滑重建”及“正交无偏均值残差剥离”机制,不仅适用于语义分割,还能自然推广至开放词表目标检测、实例分割以及基于多模态大模型的密集视线追踪和区域描述任务中。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 深入剖析免训练 OVSS 中注意力同质化与高范数离群值的机理,提出轻量而数学自洽的三阶段去偏框架。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 5 个权威基准、两种主干架构(ViT-B 与 ViT-L)、6 种主流免训练及训练型基线,消融与超参分析详尽。
  • 写作质量: ⭐⭐⭐⭐⭐ 结构清晰紧凑,图表表现力强,问题动机与方法推导逻辑非常流畅。
  • 价值: ⭐⭐⭐⭐⭐ 作为完全免训练的即插即用插件,以极低计算成本普遍提点 2.8%~7.7% mIoU,并彻底逆转了大模型性能倒挂现象,具有很高的实用价值。