跳转至

Seeing as Humans Do: Learning from Motion to Segment Anything Without Supervision

会议: ECCV 2026
论文: ECCV 原文
代码: 待开源(论文暂未提供官方代码仓库)
领域: 语义分割
关键词: 无监督学习, Segment Anything, 运动感知分组, 对比学习, 零样本分割

一句话总结

MoSA 提出了一种无需人工标注的三阶段无监督分割框架,通过视频运动分割先验、多尺度感知分组对比学习与全图/交互式模型适配,仅利用无标注视频与极少量无标注静态图像便实现了比肩全监督 SAM 的零样本通用分割能力。

研究背景与动机

通用分割大模型(如 SAM)推动了计算机视觉零样本泛化能力的大幅跃升,但其成功高度依赖包含数千万人工标注掩码的海量数据集(如 SA-1B)。昂贵的人工标注不仅形成了模型持续扩展的数据瓶颈,也限制了在缺乏标注的新领域中构建基础分割模型的能力。为此,无需任何人工标注的无监督通用分割成为了极具潜力的研究方向。现有的无监督分割路线主要分为静态图像方案与视频动态方案:基于图像的方法(如 CutLER、UnSAM)严重依赖自监督静态特征(如 DINO)的聚类或分层生成,缺乏物理世界中持续时间维度的观察支撑;而早期的无监督视频对象分割虽然利用了光流和运动线索,却极易过拟合到运动物体表面,不仅无法理解多粒度的结构(如物体的子部件),更严重欠缺泛化到静止物体(如屋顶瓦片、背景家具)的能力。

这一困境的核心矛盾在于:运动信号虽然天然提供了物体与背景分离的物理感知边界,但运动伪标签具有极高的稀疏性与局部性;传统分割目标函数(如交叉熵或 Dice 损失)会粗暴地将无运动的静态实体压制为背景,造成不可调和的负监督。此外,从连续多帧提取的运动线索通常只有粗粒度或单一运动块,无法涵盖从部件到完整实体的多层级视觉认知。

本文从人类早期视觉发展理论(特别是格式塔心理学的共同命运原则)中获得启发,探索人类如何从婴儿时期观察动态世界中内化出普适的“物体性”(Objectness)感知,并将这种能力自发迁移到静态场景。核心 idea:将大规模无标注视频解构为多粒度运动伪标签,借助多头感知分组模型进行 Patch 级跨尺度对比学习,促使模型将运动驱动的感知边界内化为纯外观驱动的通用物体性表征,最终无监督迁移至高分辨率交互式分割架构中。

方法详解

整体框架

MoSA 整体分为渐进递进的三个阶段。第一阶段构建多粒度运动分割(MGMS)管线,利用合成视频数据预训练两个互补的运动分割模块,随后在海量真实无标注视频上规模化生成部件级与前景级运动伪标签,并经严格质量评分过滤;第二阶段构建基于 ViT 的感知分组模型(PGM),引入多尺度预测头与感知分组对比学习(PGCL)损失,迫使模型利用局部特征内聚度挖掘未标注的潜在物体;第三阶段采用离线感知分组推理生成高分辨率伪掩码,并适配训练全图分割(Mask2Former)与点提示交互式分割(Semantic-SAM)模型,达成无监督的 Segment Anything 范式。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入:海量真实无标注视频<br/>Kinetics-700 / BDD100K / YouTube-8M"] --> B["阶段 1:多粒度运动伪标签生成<br/>ROSM + MFSM 双路光流分割 + 质量过滤"]
    B --> C["阶段 2:感知分组对比学习<br/>多尺度 Head + 锚点 Patch 区域内聚对比"]
    C --> D["阶段 3:无监督交互与全图分割适配<br/>高分辨率瓦片推理 + Mask2Former / Semantic-SAM"]
    D --> E["输出:零样本通用分割能力<br/>全图多粒度实例分割与点提示分割"]

关键设计

1. 多粒度运动伪标签生成:分解刚体局部运动与整体非刚体前景 真实视频往往包含复杂的相机移动、透视形变与非刚体运动,单一网络难以同时捕捉细粒度部件与完整物体。为解决运动模式尺度混杂问题,设计了基于合成视频训练的双路互补模块:刚体目标分割模块(ROSM)基于 SOLOv2 架构,以双向光流为输入,专门捕捉满足单应透视变换的局部相干运动区域(例如摆动的手臂或轮子);运动前景分割模块(MFSM)基于 U-Net 架构,提取整帧中所有处于运动状态的连通前景,擅长处理人体等复杂非刚体目标。二者生成的掩码再通过结合置信均值 \(S_{\text{maskness}}\) 与边缘梯度占比 \(S_{\text{sharpness}}\) 的综合质量评分进行严格筛选,确保了从 10,000 小时视频中提纯出的 2,100 万条伪标签兼具边缘锋利度与内部一致性。

2. 感知分组对比学习:摆脱稀疏运动监督负惩罚的内聚目标 运动伪标签虽然准确度高,但在单张静止图像中天然具有空间稀疏性(例如一只老虎仅有抬起的脚爪被识别出运动)。若直接应用传统的 BCE 或 Dice 分割损失,其余静止的身体和背景物体将被全部视为负类遭受梯度惩罚;而固定 Slot 容量的机制又难以应对开放场景的不定数量与多粒度层次。为此,设计了感知分组对比学习(PGCL)机制:在 ViT 输出特征上,设置 \(K\) 个并行的线性投影头各自负责不同尺度范围的物体;在给定伪掩码内随机采样锚点 Patch 特征 \(f_t^k\),计算该锚点与同头下全图所有 Patch 特征 \(f_j^k\) 的余弦相似度 \(s_{t,j}^k\),并通过可学习温度参数 \(\tau_k\) 与 Sigmoid 函数映射为归属同一实体的概率 \(p_{t,j}^k\)。该机制仅在锚点与掩码内构筑正样本对、与掩码外部构筑负样本对,让模型自主学习“哪些相邻及相似外观的区域应当聚拢为实体”,从而将稀疏的运动先验顺滑泛化到整图未标注的静止物体上。

3. 无监督交互与全图分割适配:高分辨率瓦片融合与提示对齐 PGM 预训练受限于视频分辨率(\(512 \times 512\))且不具备提示交互能力。为构建端到端的 Segment Anything 系统,将冻结的 PGM 作为伪标注器,对高分辨率静态图片采用多尺度重叠滑动窗口(Tiling)推理,计算候选特征的成对相似度,配合密集条件随机场(Dense CRF)细化边缘,并在反投影拼接后应用 NMS 生成全图多粒度伪标签。随后仅采样 1% 的 SA-1B 无标注图像:一方面监督 Mask2Former 解码器输出全局实例;另一方面在每个伪掩码前景区域内随机采样单个正点模拟用户交互,微调 Semantic-SAM 的 Swin-Tiny 架构,赋予模型根据单个点击解耦不同粒度掩码的交互能力。

损失函数 / 训练策略

在第二阶段中,PGM 采用 AdamW 优化器,基础学习率为 \(1 \times 10^{-4}\),Batch Size 设为 32。模型引入 Copy-Paste 数据增强来提高复杂遮挡下的抗干扰能力。对于输入图像的 \(N\) 个 Token 与采样的 \(N_a\) 个掩码锚点,PGCL 损失在 \(K\) 个尺度头间求平均:

\[ \mathcal{L}_{\text{PGCL}} = - \frac{1}{K N_a N} \sum_{k=1}^{K} \sum_{t=1}^{N_a} \sum_{j=1}^{N} \Big[ m_{t,j} \log p_{t,j}^k + (1 - m_{t,j}) \log (1 - p_{t,j}^k) \Big] \]

其中 \(m_{t,j} \in \{0, 1\}\) 表示 Patch \(j\) 与锚点 Patch \(t\) 是否同时落在同一运动伪掩码内。第三阶段全图 Mask2Former 训练 8 个 Epoch,学习率 \(5 \times 10^{-5}\),权重衰减 0.05;提示交互模型基于 Semantic-SAM 架构,完全无需人工标注数据。

实验关键数据

主实验

在涵盖物体级别与部件级别的 7 个主流公开分割基准(COCO、LVIS、ADE20K、EntitySeg、SA-1B、PartImageNet、PACO)上,以无监督全图分割平均召回率(AR)为主要评估指标,MoSA(仅用 ResNet-50,23M 参数)取得了显著优于既有无监督方法的表现,甚至在部件级数据集上超越了由 1,100 万全监督数据训练的 SAM(ViT-B,85M 参数)。

数据集 / 任务 评估指标 MoSA (Ours, RN-50) UnSAM (RN-50) SAM (全监督, ViT-B) 相比前SOTA (UnSAM) 提升
平均表现 (7 数据集 Avg.) AR 42.1 39.2 42.1 +2.9
COCO 全图分割 AR 43.5 40.5 49.6 +3.0
LVIS 全图分割 AR 42.2 37.7 46.1 +4.5
ADE20K 全图分割 AR 38.4 35.7 45.8 +2.7
EntitySeg 实体分割 AR 41.1 39.6 45.9 +1.5
SA-1B 全图分割 AR 48.2 41.9 60.8 +6.3
PartImageNet 部件分割 AR 52.7 51.6 28.3 +1.1
PACO 部件细粒度分割 AR 28.4 27.5 18.1 +0.9
COCO 点提示分割 (MaxIoU) MaxIoU 41.6% 40.3% 52.1% +1.3%
COCO 点提示分割 (OracleIoU) OracleIoU 63.4% 59.5% 68.2% +3.9%

注:UnSAM 采用了经人工监督标注训练的 CascadePSP 边缘细化模型,并非完全无监督方法;MoSA 保持了纯粹的无监督学习设定。

消融实验

消融实验重点验证了 PGM 学习目标函数及 MGMS 伪标签生成中两模块的必要性(在 1,000 张 SA-1B 图像上评测 AR1000、小尺寸 \(AR_s\)、中尺寸 \(AR_m\) 与大尺寸 \(AR_l\)):

实验组别 配置方案 \(AR_{1000}\) \(AR_s\) \(AR_m\) \(AR_l\) 核心结论与分析
PGM 损失函数消融 标准 BCE + Dice 3.8 1.2 2.8 6.6 传统损失把稀疏运动外区域误标为负类,模型发生灾难性压制
PGM 损失函数消融 Slot Attention (256 slots) 8.2 5.2 8.6 8.7 固定槽位容量受限于开放世界不确定实体数,且容易过拟合特定类别
PGM 损失函数消融 PGCL (本文提出) 28.3 14.7 26.6 36.1 对比式特征空间内聚策略使模型成功掌握通用物体性先验
MGMS 伪标签构成 仅保留 ROSM (刚体分割) 28.8 20.6 31.1 28.7 局部刚体变换擅长小物体与局部部件,但在大目标上受限
MGMS 伪标签构成 仅保留 MFSM (运动前景) 34.7 13.7 34.9 43.1 连通前景擅长宏观大物体,但完全损失了细小部件感知
MGMS 伪标签构成 ROSM + MFSM (完整模型) 36.6 20.6 35.4 45.1 双模块在多尺度多粒度上形成了高度互补的最优表现

关键发现

  • PGCL 对抗稀疏标注灾难:在面对运动视频衍生的不完整伪标签时,传统的密集分割目标函数近乎失效(仅 3.8 AR),而 PGCL 依靠特征级内聚学习实现了 28.3 AR,验证了局部自发聚类是跨越伪标签稀疏性的关键钥匙。
  • 部件感知优势明显:得益于物理世界中局部相对运动的固有属性,MoSA 在 PartImageNet 和 PACO 上分别达到 52.7% 与 28.4% 的 AR,大幅反超完全依赖人类语义标注的 SAM(分别为 28.3% 与 18.1%),说明无监督运动感知挖掘出的细粒度部件远比人工标注丰富细致。
  • 多头与数据量扩展性优异:预测头从 1 个增加至 4 个时,AR 从 27.9% 稳步提升到 36.6%,体现了尺度解耦的有效性;预训练无标注视频从 100 小时扩增至 10,000 小时,AR 呈现显著的非饱和增长(16.8% \(\rightarrow\) 28.3% \(\rightarrow\) 36.6%),具备类似基础大模型的良好 Scaling 潜力。

亮点与洞察

  • 从动态物理先验迁移至静态视觉认知:将认知发展心理学中的格式塔“共同命运”法则具象化为工程管线,证明无需任何人工语义引导,仅凭时间维度的光流变化即可内化出极其强大的静态物体感知能力。
  • 纯粹无监督下的泛化突破:不同于前代方法 UnSAM 暗中借助监督精炼器 CascadePSP,MoSA 全流程贯彻无监督学习原则,且在提示交互任务上以 1/3 的参数量和 1/100 的图像数据逼近了全监督 SAM 的效果。
  • 可复用的多尺度对比分组范式:提出的 PGCL 多头尺度解耦对比机制不仅适用于视频运动伪标签,也可直接迁移至其它具有稀疏、高噪声特性的自监督掩码生成任务中。

局限与展望

  • 复杂场景下的光流误差累积:第一阶段高度依赖高质量的双向光流估计。在强烈相机晃动、极端低照度或反光严重的视频序列中,光流伪影仍会导致生成形变怪异的候选掩码。
  • 多阶段训练管线相对冗长:从合成视频训练、真实视频推断伪标签、PGM 预训练,再到适配 Mask2Former 与 Semantic-SAM,整体包含四个串联的优化阶段,未能实现彻底的单阶段端到端自监督联合优化。
  • 未来演进方向:探索将视频自监督表征与基于扩散模型的时空先验相结合,构建完全统一、支持连续视频流无监督在线自进化的端到端 Foundation Segmentation 架构。

相关工作与启发

  • vs CutLER / UnSAM: CutLER 与 UnSAM 均从单张静态图像的 DINO 特征聚类出发提取伪掩码,且 UnSAM 依赖全监督的 CascadePSP 进行后处理优化;MoSA 从无标注动态视频中提取物理世界的一致性运动线索,不仅实现了完全无监督的干净闭环,且在部件级分割上更具细粒度优势。
  • vs DyStaB / DIOD: 现有的运动到物体性自监督方法(如 DyStaB、DIOD)将训练目标局限于特定运动前景实体的分割,存在严重的运动偏差且无法处理复杂静止物体;MoSA 借助 PGCL 对比学习解耦了运动监督与外观表征,实现了从动态运动先验向全图通用静止物体乃至手绘草图的强力零样本泛化。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 成功将格式塔运动感知理论工程化为高可扩展的三阶段无监督 Segment Anything 系统,PGCL 设计独到。
  • 实验充分度: ⭐⭐⭐⭐⭐ 覆盖 7 个全图评估基准与点提示交互评测,包含多尺度、数据量与组件消融,对比详实。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑严谨,结构层层递进,从认知动机到技术实现的叙述极具说服力。
  • 价值: ⭐⭐⭐⭐⭐ 为计算机视觉摆脱海量手工密集标注、利用海量无标注视频构建通用视觉基础模型提供了极具前景的范式。