MobileSAM2: Lightweight Segment Anything in Images and Videos via Hypergraphical Knowledge Distillation¶
会议: ECCV 2026
论文: ECCV 2026
领域: VLM效率 / 模型压缩 / 语义分割
关键词: 视频分割, 知识蒸馏, 超图建模, 轻量化模型, 具身智能
一句话总结¶
针对 SAM2 参数量过大无法在边缘端部署的问题,提出基于超图知识蒸馏(HyperKD)的 MobileSAM2,通过构建时序与多粒度超图建模高阶依赖,结合渐进式模型收缩搜索轻量骨干,在仅需约 10% 训练数据下实现高效高精度的图像与视频分割。
研究背景与动机¶
大视觉基础模型(如 SAM 及 SAM2)在大规模视觉数据驱动下展现出了前所未有的零样本交互式分割能力。其中 SAM2 首次将可提示分割无缝扩展至视频领域,依赖包含超 10 万视频和 4000 万掩码标注的大规模数据集 SA-V,模型学习到了鲁棒的跨帧时序关联以及粗细多粒度的概念理解。然而,SAM2 巨大的参数量与计算开销(仅其 Hiera-L 图像编码器参数即超过 212M,单卡推理容易引发内存溢出)严重限制了其在移动手机、无人机、机器人等边缘受限硬件上的实时部署。
这种计算沉重性与边缘端部署需求之间的矛盾十分尖锐。传统知识蒸馏方法大多基于朴素的特征对齐(如 FitNet)或简单的两节点图关系(Pairwise Graph),难以刻画复杂场景中跨帧多实体之间的高阶关联与时序一致性,同时也无法继承教师模型自顶向下的多粒度(物体、部件、子部件)层级表征。在仅具备有限算力与训练样本(例如仅使用约 10% SA-V 数据)的前提下,如何高效、无损地将 SAM2 隐式编码的时序与多粒度知识迁移到极轻量网络,是实现轻量级视频通用分割亟待攻克的难题。
本文的切入角度是:利用能够天然建模多对多高阶关联的超图结构,显式解耦并提取教师模型表征中的时序关联与粒度层级。核心 idea:提出超图知识蒸馏框架(HyperKD),显式构建 Patch 级/实例级时序超图与多粒度层级超图并对齐学生网络,结合渐进式架构收缩搜索出轻量化骨干家族 MobileSAM2,实现边缘端低延迟、高保真的全能分割。
方法详解¶
整体框架¶
MobileSAM2 的核心在于使用轻量化图像编码器替换原本沉重的 Hiera-L,同时冻结并复用 SAM2 现存的轻量级记忆模块(Memory Module)、提示编码器(Prompt Encoder)和掩码解码器(Mask Decoder,三者合计参数量不足 12M)。训练阶段仅使用未标注视频序列(约 10% 的 SA-V 数据),以预训练 SAM2-L 为教师模型,通过 HyperKD 引导轻量学生编码器学习。整体管线包含特征级基础对齐、时序超图蒸馏(Temporal HyperKD)以及粒度超图蒸馏(Granularity HyperKD),并借助渐进式模型收缩策略确定最优学生架构。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入未标注视频序列与提示"] --> B["阶段1:时序超图蒸馏<br/>提取跨帧Patch与实例级时序高阶依赖"]
B --> C["阶段2:粒度超图蒸馏<br/>按多层掩码池化并构建跨粒度关联"]
C --> D["阶段3:渐进式模型收缩与搜索<br/>多维度收缩搜索最优轻量Hiera骨干"]
D --> E["MobileSAM2边缘端部署推理"]
关键设计¶
1. 时序超图蒸馏:显式捕获跨帧高阶一致性
针对传统蒸馏方法仅做逐点特征拟合而丢失跨帧时序动态关联的痛点,该模块将视频特征图解构为超图结构。具体而言,分别构建 Patch 级时序超图 \(G_t^{Pa} = (V_t^{Pa}, E_t^{Pa})\) 和实例级时序超图 \(G_t^{Ins} = (V_t^{Ins}, E_t^{Ins})\)。Patch 级节点直接由特征图网格构成,实例级节点则根据教师模型预测的高置信度掩码进行区域平均池化生成。为了突破传统两两配对图的局限,模块采用 \(\epsilon\)-球距离阈值建立超边,连接邻域内所有满足特征相似度阈值的节点集合: $\(E = \{\text{ball}(v, \epsilon) \mid v \in V\}\)$ $\(\text{ball}(v, \epsilon) = \{u \mid \text{dist}(x_u^I, x_v^I) < \epsilon, u \in V\}\)$ 其中关联矩阵采用余弦距离定义:当 \(u\) 属于以 \(v\) 为中心的超边时,\(H(u,v) = 1 - \frac{\langle x_u^I, x_v^I \rangle}{\|x_u^I\|\|x_v^I\|}\),否则为 0。学生网络按相同规则构建关联矩阵 \(H_s^{Pa}\) 与 \(H_s^{Ins}\),通过最小化两者的 L1 范数差异实现时序高阶依赖的迁移: $\(\mathcal{L}_{THKD} = \|H_t^{Pa} - H_s^{Pa}\|_1 + \|H_t^{Ins} - H_s^{Ins}\|_1\)$
2. 粒度超图蒸馏:解耦并迁移多层级概念表征
针对视频中物体往往具有整体、局部、微小部件等多尺度层级结构,单层监督易引发细节分割退化的问题,设计粒度超图蒸馏。给定教师模型预测的 \(M\) 个不同分割粒度掩码 \(m(i, j)\),对当前帧特征进行掩码平均池化以提取粒度节点 \(V_t^{Gran}\): $\(\mathcal{V}_t^{Gran} = \{\text{MaskedAveragePooling}(z_t^I(i, j), m(i, j)) \mid j = 1, \dots, M\}\)$ 基于上述节点同样采用 \(\epsilon\)-球聚类构建跨粒度的超边集合 \(E_t^{Gran}\) 及其关联矩阵 \(H_t^{Gran}\)。学生网络利用教师掩码进行对应池化并构建 \(H_s^{Gran}\),损失函数定义为: $\(\mathcal{L}_{GHKD} = \|H_t^{Gran} - H_s^{Gran}\|_1\)$ 该设计为时序超图提供了正交的多粒度互补知识,使轻量模型能够从容应对粗细粒度不同的可提示分割需求。
3. 渐进式模型收缩与搜索:Pareto最优的轻量Hiera骨干
针对现有轻量化骨干(如 TinyViT)在直接移植进 SAM2 框架时架构与任务不适配、性能损耗大的痛点,采用渐进式模型收缩策略设计了一族专用轻量 Hiera 骨干。将收缩因子参数化为 4 个关键维度:各阶段嵌入维度 \(\Gamma_{Emb}\)、各阶段 block 数量 \(\Gamma_{Blk}\)、各阶段局部自注意力窗口尺寸 \(\Gamma_{WinSiz}\) 以及多头自注意力的注意力头扩展比率 \(\Gamma_{HExp}\)。以 HyperKD 损失作为搜索引导,迭代压缩模型规模,最终导出 5.84M(MobileSAM2-5M)、10.37M(MobileSAM2-10M)以及 23.74M(MobileSAM2-23M)三个不同计算梯度的最优模型变体。
损失函数 / 训练策略¶
总体训练目标由基础特征层 L1 损失与两项超图蒸馏损失联合加权构成: $\(\mathcal{L}_{total} = \|z_t^I - z_s^I\|_1 + \alpha \cdot \mathcal{L}_{THKD} + \beta \cdot \mathcal{L}_{GHKD}\)$ 实验中设定 \(\alpha = 1, \beta = 1\)。训练过程仅使用来自 SA-V 人工标注子集的 11K 视频(约为全量数据的 10%),采用 AdamW 优化器,初始学习率设为 \(5 \times 10^{-4}\),在单张 A100 (80GB) 上以 batch size 为 5、每个样本取 8 帧序列训练 5 个 epoch,总计耗时 65 小时。
实验关键数据¶
主实验¶
在两个通用 VOS 数据集(MOSE val、DAVIS 2017 val)、长程 VOS 数据集(LVOS val)以及视频任意分割基准(SA-V val、SA-V test)上与多种代表性方法进行全面对比。
| 模型 | 蒸馏方法 | 参数量 (M) | MOSE val (J&F) | DAVIS 2017 val (J&F) | LVOS val (J&F) | SA-V val (J&F) | SA-V test (J&F) |
|---|---|---|---|---|---|---|---|
| SAM2 Base+ (全量数据/256卡) | - | 68.7 | 72.8 | 88.8 | 75.8 | 72.2 | 74.7 |
| SAM2 Large (全量数据/256卡) | - | 212.1 | 74.6 | 89.2 | 81.7 | 74.5 | 76.0 |
| SAM2-TinyViT-5M (10%数据/单卡) | No Distill | 5.4 | 26.0 | 30.4 | 30.8 | 28.4 | 27.7 |
| SAM2-TinyViT-5M (10%数据/单卡) | FitNet | 5.4 | 33.8 | 38.7 | 37.7 | 34.3 | 35.1 |
| MobileSAM2-5M (10%数据/单卡) | FitNet | 5.8 | 36.6 | 41.5 | 39.7 | 38.2 | 39.3 |
| MobileSAM2-5M (10%数据/单卡) | CIRKD | 5.8 | 36.8 | 43.3 | 41.2 | 38.3 | 38.6 |
| MobileSAM2-5M (10%数据/单卡) | FAKD | 5.8 | 37.7 | 42.5 | 41.0 | 39.6 | 39.9 |
| MobileSAM2-5M (Ours) | HyperKD | 5.8 | 44.6 | 51.0 | 48.8 | 49.2 | 49.4 |
| SAM2-TinyViT-11M (10%数据/单卡) | FitNet | 11.2 | 36.4 | 40.0 | 39.8 | 37.8 | 39.0 |
| MobileSAM2-10M (10%数据/单卡) | FAKD | 10.4 | 41.3 | 46.7 | 44.0 | 42.4 | 43.3 |
| MobileSAM2-10M (Ours) | HyperKD | 10.4 | 48.7 | 54.2 | 51.8 | 49.9 | 50.0 |
| SAM2-TinyViT-21M (10%数据/单卡) | FitNet | 21.2 | 44.9 | 49.0 | 47.0 | 45.8 | 45.6 |
| MobileSAM2-23M (10%数据/单卡) | FAKD | 23.7 | 60.6 | 65.0 | 63.4 | 62.0 | 62.7 |
| MobileSAM2-23M (Ours) | HyperKD | 23.7 | 65.8 | 72.1 | 69.0 | 66.4 | 67.8 |
消融实验¶
在 LVOS 验证集上对 HyperKD 各组件的独立贡献以及与传统图蒸馏方法进行了深入消融分析。
| 模型配置 | Patch-wise 时序超图 | Instance-wise 时序超图 | Granularity 粒度超图 | LVOS val (J&F) |
|---|---|---|---|---|
| MobileSAM2-23M (无蒸馏基线) | - | - | - | 44.8 |
| + Patch-wise THKD | ✓ | - | - | 62.9 |
| + Instance-wise THKD | - | ✓ | - | 64.4 |
| + 双时序超图组合 | ✓ | ✓ | - | 64.4 |
| + 单粒度超图 | - | - | ✓ | 63.1 |
| MobileSAM2-23M 完整模型 | ✓ | ✓ | ✓ | 69.0 |
此外,针对超图建图的距离阈值 \(\epsilon\),当 \(\epsilon\) 从 0.5 增加至 1.5 时,J&F 分数分别为 65.2、68.4、69.0、68.1、62.0,表明 \(\epsilon=1.0\) 在保证特征连通度与防止过平滑(Over-smoothing)之间取得了最佳平衡。对比传统两节点图蒸馏方法,Context Matters 取得 60.7 J&F,IntRA-KD 取得 60.9 J&F,而 HyperKD 达到 69.0 J&F,证实了超图建模高阶关系的显著优越性。在移动端 GPU(RTX 4060 8GB)实测中,SAM2-Large 发生 OOM,而 MobileSAM2-5M、10M 和 23M 分别达到了 13.3 FPS、10.8 FPS 和 8.2 FPS 的稳定推理速度。
亮点与洞察¶
- 将超图理论首次引入视觉大模型视频分割知识蒸馏:传统成对图(Pairwise Graph)无法建模三个及以上实体共同参与的高阶上下文,超图结构成功将时序沿线的多帧多尺度语义关联统一显式表达。
- 正交互补的双重超图设计:Patch-wise 与 Instance-wise 时序超图保障时间轴上的跟踪一致性,Granularity 超图则刻画概念的局部与整体层级从属关系,二者正交互补,大幅提升了对复杂遮挡与细粒度结构的鲁棒性。
- 架构搜索与蒸馏目标紧密结合:突破了传统使用通用分类轻量骨干(如 TinyViT)粗暴适配分割任务的惯例,借助渐进式模型收缩搜索出原生契合分层自注意力的轻量 Hiera 变体。
- 具身智能下游泛化卓越:将 MobileSAM2-23M 作为感知前端接入 CaP-Agent0 并在 LIBERO-PRO 上评测,平均任务成功率达 21.8%,显著高于同量级的 SAM2-TinyViT-21M(19.3%),为边缘机器人板载部署提供了高性能感知方案。
局限与展望¶
- 建图计算开销依赖近邻搜索:超图构建采用基于 \(\epsilon\)-球的全特征距离计算与阈值筛选,当视频序列帧数较长或单帧分辨率极大时,节点两两相似度矩阵的显存与计算消耗会上升。
- 提示采样策略相对固定:蒸馏训练中主要依赖固定 4×4 均匀网格提示生成教师监督,未充分引入交互式多轮点/框修正提示的动态分布。
- 未来方向:可进一步探索动态稀疏超图以降低建图复杂度,并将 HyperKD 推广至开放词表视频定位与多模态交互生成任务。
相关工作与启发¶
本研究紧密依托 SAM2 奠定的视频交互式记忆架构基础,并将 Hinton 开创的知识蒸馏体系从特征对齐(FitNet)和成对关系对齐(RKD、CIRKD)拓展至基于超图的高阶关系建模领域(结合了 HGNN 与超图学习理论)。给后续研究的启发在于:对于具有强时序与多尺度特性的视觉基础模型,单纯模仿中间层响应往往效率低下;显式构建高阶拓扑结构并将其作为几何不变量进行迁移,能够以少量的训练预算激发出小模型接近大模型的表征潜能。
评分¶
- 新颖性: 4.5 / 5.0(首次将超图结构引入 SAM2 类视频分割大模型的知识蒸馏)
- 实验充分度: 4.5 / 5.0(涵盖通用 VOS、长程 VOS、SA-V、具身智能及跨模型 TrackAnything 验证)
- 写作质量: 4.5 / 5.0(结构严谨完整,逻辑推导清晰,实验消融详实)
- 价值: 4.5 / 5.0(极大地推动了 SAM2 在移动设备与具身智能机器人上的轻量化实时落地)