跳转至

Learning Accurate Segmentation Purely from Self-Supervision

会议: ECCV 2026
论文: ECCV Official
代码: https://geshang777.github.io/Selfment/
领域: 语义分割
关键词: 自监督学习, 显著性检测, 伪装目标检测, 图割, 迭代优化

一句话总结

Selfment 提出了一个完全无需人工标注、预训练分割模型(如 SAM)或 CRF 等后处理的前景分割框架,通过自监督视觉基座提取的 dense 特征构建 patch 亲和图并用归一化割(NCut)初始化,引入基于特征空间聚类的迭代 Patch 优化(IPO)消除谱松弛噪声,并以此伪标签监督轻量投影头联合优化对比与区域一致性损失,在无监督显著目标检测与零样本伪装目标分割上均大幅刷新 SOTA。

研究背景与动机

密集对象分割长期以来严重依赖人工标注的精细掩码,然而像素级密集标注代价高昂、难以规模化扩展,且带有强烈的先验偏差。为降低标注成本,近年弱监督方法尝试引入点、涂鸦或运动轨迹等提示,或直接借助现成预训练大模型(如 SAM)通过提示微调生成伪标签。但这本质上依然依赖人工引导或预训练分割模型的归纳偏置,并未解决一个根本性科学问题:计算机视觉模型能否完全从海量无标签图像中,自主发现并精准分割出目标前景?

自监督视觉表征(尤其是 DINO 系列与具备 Gram Anchoring 稳定特征的 DINOv3)展示了强大的对象中心化自组织语义,同类别或同物体的图像块在特征空间呈现天然的密集相似性聚类。基于此,TokenCut 等方法将自监督特征映射为图结构并利用归一化割(NCut)进行二分图划分。然而,由于相似度阈值离散化构建图结构的粗糙性以及谱松弛(Spectral Relaxation)带来的逼近误差,纯 NCut 生成的二分掩码往往噪声极重、空间连续性差,必须依赖双边滤波(Bilateral Solvers)、密集 CRF 或复杂的形态学后处理修饰,这削弱了自监督“端到端自主发现”的初衷,且在输入分辨率增大时极易退化崩溃。

本文的核心思考在于:自监督大模型的全局稠密嵌入本身就蕴含了高信噪比的语义几何结构,NCut 谱图划分虽粗糙,但其二阶特征向量(Fiedler 向量)已提供了足够可靠的前背景粗划分种子;不必借用外部平滑先验,直接在原特征空间通过迭代中心重聚类就能自我净化。核心 idea:利用自监督特征的局部与语义自洽性,先以 NCut 提取粗糙双分割先验,设计带有方向一致性约束的特征空间迭代 Patch 优化(IPO)平滑谱松弛噪声,进而以提纯的掩码为自监督信号训练轻量感知头,实现纯自监督的高清精细分割。

方法详解

整体框架

Selfment 的核心工作流包含四个阶段:特征提取、NCut 粗划分、特征空间迭代 Patch 优化(IPO)以及自监督轻量头微调。给定输入图像,先经冻结的自监督骨干网络(如 DINOv3-7B)提取密集 patch 特征,计算 patch 亲和矩阵并求解广义特征值问题得到第二小特征向量,由均值阈值与种子连通分量得到粗二值掩码;随后进入 IPO 模块,通过特征空间的前背景均值迭代聚类与方向一致性约束快速收敛出贴合边缘的高质量伪标签;最后,利用提纯掩码作为自监督信号,优化包含两层全连接与分类器的轻量投影头,联合特征对比损失与软 Dice 损失,使网络输出兼顾语义一致性与边缘致密性。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入图像 (H×W×3)"] --> B["自监督特征提取<br/>DINOv3 冻结抽取密集 Patch 特征"]
    B --> C["NCut 亲和图粗二分<br/>构造 Patch 相似度图求 Fiedler 向量"]
    C --> D["迭代 Patch 优化 (IPO)<br/>特征空间聚类更新中心 + 方向防翻转"]
    D --> E["自监督轻量头训练<br/>伪标签联合优化 对比/Dice/BCE 损失"]
    E --> F["高分辨率前景分割预测"]

关键设计

1. 谱图割初始二分:基于 Fiedler 向量的无监督语义种子发现

为摆脱人工先验并定位前景主体,首先将骨干提取的归一化 patch 嵌入 \(\{f_i\}_{i=1}^N\) 构建为无向加权图 \(\mathcal{G}=(\mathcal{V},\mathcal{E})\)。相邻两 patch 的亲和度定义为内积阈值截断:

\[A_{ij} = \begin{cases} \langle f_i, f_j \rangle, & \text{if } \langle f_i, f_j \rangle > \tau \\ \epsilon, & \text{otherwise} \end{cases}\]

其中阈值 \(\tau=0.2\)\(\epsilon\) 为维持图连通性的极小常数。令度对角矩阵 \(D_{ii} = \sum_j A_{ij}\),求解拉普拉斯广义特征值问题 \((D - A)\mathbf{x} = \lambda D \mathbf{x}\)。舍弃对应常数全联通解的最小特征值,取第二小特征值对应的特征向量 \(x_2\)(Fiedler 向量)。以 \(x_2\) 的全局均值作为二值化切分阈值,再选取 \(x_2\) 中绝对值最大点(即响应最显著的语义种子)所在的最大连通域作为初始粗糙前景掩码 \(y^{(0)}\)。该设计纯粹依赖注意力几何关系自发锚定物体中心区域。

2. 迭代 Patch 优化(IPO):特征流形内的聚类自净化

NCut 因谱松弛和稀疏亲和图截断,边缘常伴有锯齿和误判噪点。IPO 摒弃任何外部 CRF,直接在自监督特征空间内展开自适应微调。将所有 patch 归一化为 \(\tilde{f}_i = f_i / \|f_i\|_2\)。根据前一轮分割划分前景集 \(\mathcal{F}^{(t)}\) 与背景集 \(\mathcal{B}^{(t)}\),计算两个动态语义中心:

\[\mu_f^{(t)} = \frac{1}{|\mathcal{F}^{(t)}|} \sum_{i\in\mathcal{F}^{(t)}} \tilde{f}_i, \quad \mu_b^{(t)} = \frac{1}{|\mathcal{B}^{(t)}|} \sum_{i\in\mathcal{B}^{(t)}} \tilde{f}_i\]

在每次迭代中,所有 patch 基于与当前两中心的余弦相似度重新分配标签:若 \(\langle \tilde{f}_i, \mu_f^{(t)} \rangle > \langle \tilde{f}_i, \mu_b^{(t)} \rangle\) 则划为前景,反之为背景,并重新计算新中心。迭代进行 \(T=20\) 次(实验显示通常 10 次即可稳定收敛)。为了防止聚类在迭代震荡中发生前背景标签反转(Label Flipping),算法固定初始参考差分向量 \(r = \mu_f^{(0)} - \mu_b^{(0)}\);当检测到 \(\langle (\mu_f^{(t+1)} - \mu_b^{(t+1)}), r \rangle < 0\) 时,主动翻转标签维持语义指向一致性。

3. 自监督感知头:对比表征与几何紧凑性联合驱动

经 IPO 提纯的掩码虽准确,但逐图进行谱图分解与迭代计算推理开销大且缺少全局语义判别力。因此引入可端到端前向推理的极轻量投影头(仅 0.54M 参数,两层含 ReLU 的 MLP \(\phi_\theta\) 接分类头 \(W_c\))。将 patch 特征映射为高维嵌入 \(z_i \in \mathbb{R}^d\) 与前后景分类 logits \(l_i\)。模型以 IPO 生成的高质量伪标签 \(y_i\) 为目标,通过复合多重约束自监督优化: - 区域对比损失 \(\mathcal{L}_{\text{con}}\):受 InfoNCE 启发,计算 \(\ell_2\) 归一化特征间的相似度 \(S_{ij} = z_i^\top z_j / \tau\)。将属于相同伪标签类别的 patch 作为正样本对 \(\mathcal{P}_i\),同图不同伪标签类别的 patch 作为负样本对,拉近同区域嵌入、推开异质区域,强化特征判别力; - 几何软 Dice 损失 \(\mathcal{L}_{\text{Dice}}\):定义预测概率 \(p_i = \sigma(l_i^{(1)})\) 与伪标签间的连续重叠度,驱动连续块状连通并缓解前景像素占比失衡:

\[\mathcal{L}_{\text{Dice}} = 1 - \frac{2 \sum_i p_i y_i + \epsilon}{\sum_i p_i^2 + \sum_i y_i^2 + \epsilon}\]

结合常规的逐 patch 二元交叉熵损失 \(\mathcal{L}_{\text{BCE}}\),总目标为 \(\mathcal{L}_{\text{total}} = 0.1 \mathcal{L}_{\text{con}} + 1.0 \mathcal{L}_{\text{Dice}} + 1.0 \mathcal{L}_{\text{BCE}}\)。冻结骨干仅微调投影头,使推理时单张图片只需单次前向传导即可直出平滑精细掩码。

损失函数 / 训练策略

  • 自监督训练集规模:仅随机抽取 DUTS 训练集中的 1,000 张无标签图像,训练 3 个 epoch 即可充分收敛。
  • 计算加速:骨干网络(DINOv3-7B)全程完全冻结,预先提取并缓存所有图像的 patch 特征存入高速存储,训练过程仅优化 0.54M 参数量的轻量头,8×A100 仅耗时 27.6 分钟。
  • 高分辨率泛化:虽然训练仅在 \(768 \times 768\) 分辨率进行,但由于投影头仅为逐 patch 线性变换,测试时直接输入 \(1280 \times 1280\)\(2048 \times 2048\) 图像不仅不退化,反而因 patch 网格更密集而获得更锐利的细节(如路牌细小文字)。

实验关键数据

主实验

在无监督显著性目标检测(USOD)四大基准上,Selfment 大幅超越此前基于自监督特征图割的代表方案(TokenCut, SelfMask, FOUND 等)。同时,直接零样本迁移到极具挑战性的伪装目标检测(COD)基准,甚至媲美有监督 SOTA。

表 1:无监督显著性检测对比(摘自原论文 Table 1,无任何后处理)

方法 ECSSD \(F_{\max} \uparrow\) ECSSD IoU \(\uparrow\) DUTS \(F_{\max} \uparrow\) DUTS IoU \(\uparrow\) HKUIS \(F_{\max} \uparrow\) HKUIS IoU \(\uparrow\) PASCAL-S \(F_{\max} \uparrow\) PASCAL-S IoU \(\uparrow\)
TokenCut-768 [48] 87.8 75.9 73.0 60.5 82.2 64.0 76.2 61.3
TokenCut-1280 [48] 86.7 75.0 68.1 55.9 79.6 64.9 80.0 60.2
SelfMask-768 [40] 91.9 77.2 79.4 62.4 89.8 74.4 86.0 61.8
FOUND-768 [42] 91.4 78.9 76.4 64.8 87.7 68.4 85.4 63.7
Selfment-768 (本文) 95.3 82.4 85.1 66.6 93.9 80.0 91.5 71.2
Selfment-1280 (本文) 95.9 84.3 86.4 68.4 94.4 81.6 91.7 71.6

表 2:伪装目标检测(COD)零样本泛化评测(摘自原论文 Table 2)

方法类别 方法名 CHAMELEON \(S_m \uparrow\) CHAMELEON \(F_\beta^\omega \uparrow\) CAMO \(S_m \uparrow\) CAMO \(F_\beta^\omega \uparrow\) COD10K \(S_m \uparrow\) COD10K \(F_\beta^\omega \uparrow\) NC4K \(S_m \uparrow\) NC4K \(F_\beta^\omega \uparrow\)
完全有监督 SINetv2 [10] .888 .816 .820 .743 .815 .680 .847 .770
完全有监督 FSPNet [17] .908 .851 .856 .799 .851 .735 .879 .816
完全有监督 BiRefNet [54] .929 .911 .932 .914 .913 .874 .914 .894
无监督基线 TokenCut [48] .654 .496 .633 .498 .658 .469 .725 .615
无监督基线 UCOD-DPL [50] .864 .825 .793 .747 .834 .763 .850 .818
纯自监督 Selfment (本文) .910 .843 .869 .792 .873 .754 .902 .836

消融实验

表 3:各组件累积贡献消融分析(ECSSD 数据集,500 张子集训练,摘自原论文 Table 3)

配置 BCE Dice Con. \(F_{\max} \uparrow\) IoU \(\uparrow\) Acc \(\uparrow\)
NCut (基线) - - - 74.7 63.9 86.2
+ IPO - - - 79.5 73.2 87.8
+ 自监督训练 - - 88.3 80.4 94.4
+ Dice 损失 - 88.9 81.3 94.7
+ 对比损失 - 88.9 81.4 94.7
+ Dice & 对比损失 (完整模型) 89.1 81.5 94.8

关键发现

  • IPO 模块有效性:仅在 NCut 基础上引入 IPO 聚类迭代优化,在无需任何训练参数的前提下,\(F_{\max}\) 从 74.7% 跃升至 79.5%,IoU 提高 9.3%(从 63.9% 到 73.2%),表明自监督特征空间均值聚类对克服谱松弛截断噪声极度有效。
  • 大模型 Scaling 规律的反常现象:实验对比发现,TokenCut 和 FOUND 在使用 DINOv3-7B 等超大模型时性能不升反降(FOUND 甚至因背景种子细粒度语义敏感而训练崩溃、\(F_{\max}=0\));唯独 Selfment 具备正向 Scaling 效应,从 DINO-Base 到 DINOv3-7B 保持持续大幅增益。
  • 高分辨率鲁棒性:传统图割方法(如 TokenCut)当分辨率升至 1280 或 2560 时,亲和图拉普拉斯矩阵求解趋向发散或产生大量碎斑,指标普遍下滑(如 TokenCut 在 DUTS 上从 73.0 跌到 68.1);而 Selfment 在训练仅为 768 的情况下,推断分辨率扩展到 1280 时全指标正向增长(DUTS \(F_{\max}\) 达 86.4%)。

亮点与洞察

  • 特征流形闭环自优化(IPO):利用自监督表示内在的局部连贯性与全局相关性,在特征空间通过简单 K-Means 变体配合差分向量方向锁,在毫秒级内实现了传统密集 CRF 或双边滤波需要数秒才能达到的边缘保真度。
  • 真正极简的端到端自监督范式:完全摆脱了近两年无监督分割领域高度依赖 SAM 提示微调的伪“自监督”趋势,不掺杂任何人工标注诱导偏置;仅靠 1000 张无标注自然图和 0.54M 参数量的轻量头,训练 27 分钟即可生成工业级高质量掩码。
  • 跨骨干架构通用性:不仅适配 DINO 系列,在 Perception Encoder (PE) 和 TIPSv2 等不同目标预训练的 ViT 骨干上,Selfment 均比 TokenCut 取得 30% 以上的 \(F_{\max}\) 绝对增益,证明这套“图割种子 + 空间聚类收敛 + 伪标签蒸馏”范式的普适价值。

局限与展望

  • 依赖初始单一物体的连通假设:NCut 第二小特征向量默认以绝对值最大响应点作为前景种子连通域提取,面对多目标复杂共存或多实例分散遮挡场景时,易遗漏非主体的次要目标。
  • 骨干特征抽取显存开销:采用 DINOv3-7B 进行密集 patch 提取时显存占用极高,虽然训练通过缓存离线化规避,但实时推理阶段端侧设备若无法承载大模型前向,退回小骨干仍有一定性能让步。
  • 未来方向:探索多重特征向量联合聚类以自然支持多目标/无监督全景分割;将 IPO 思想前置并入自监督预训练的稠密对齐目标中,促进自监督模型直接内生出目标级掩码输出能力。

相关工作与启发

  • vs TokenCut [48]:TokenCut 直接依靠 ViT 注意力特征跑 NCut,由于缺乏特征平滑和自纠错机制,必须强行外挂 Bilateral Solver 等后处理工具,且高分辨率下性能大幅退化;Selfment 通过 IPO 纯特征空间聚类自净化并蒸馏轻量预测头,完全摆脱后处理且分辨率可任意扩展。
  • vs FOUND [42] / SelfMask [40]:FOUND 强依赖背景种子的距离启发式引导,在 DINOv3 等超大参数细粒度表征下会产生大量噪声碎片导致训练崩溃;Selfment 的全局自适应中心均值迭代能天然吸收 DINOv3 的高维语义优势。
  • vs 基于 SAM 的弱监督方法 (如 Int, Relax SAM):近年许多无监督工作实质使用了在海量人工标注掩码(SA-1B)上预训练的 SAM 提供 prompt 引导;Selfment 从底层特征到分割头彻底拒绝外部人工标注偏置,是纯粹自底向上的视觉基元聚类。

评分

  • 新颖性: ⭐⭐⭐⭐☆ [摆脱对外部平滑先验与 SAM 的依赖,提出优雅直观的 IPO 闭环特征重聚类与自监督蒸馏管线]
  • 实验充分度: ⭐⭐⭐⭐⭐ [详尽评测四大显著性与四大伪装目标基准,消融实验严格,包含多分辨率、多骨干对比]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑层层递进,方法原理阐述直观清晰,图表数据规整详实]
  • 价值: ⭐⭐⭐⭐⭐ [为纯自监督高精目标分割树立了标杆,极低训练成本即可赋能无标签数据伪标签标注与掩码生成]