SOVTrack: Open-Vocabulary Multi-Object Tracking with Self-Supervised Pseudo Labeling and Feature Distillation¶
会议: ECCV 2026
论文: ECCV 原文
PDF: ECCV PDF
代码: https://github.com/zekunqian/SOVTrack
领域: 视频理解
关键词: 开放词表多目标跟踪, 自监督伪标签, 基础模型蒸馏, SAM2, 双向时序验证
一句话总结¶
针对开放词表多目标跟踪中新类别泛化差与视频时序动态利用不足的问题,SOVTrack 利用检测器引导与双向时序循环闭环验证自动挖掘高质伪标签及置信度,并通过解耦的双分支架构将 SAM2 的多线索表征对抗蒸馏至目标级跟踪器,仅需 10K 真实视频帧即可在 TAO 基准上刷新 SOTA。
研究背景与动机¶
多目标跟踪(MOT)正从行人和车辆等封闭集类别向开放真实世界的全类别目标演进,这催生了开放词表多目标跟踪(OVMOT)任务。然而,绝大多数现有 OVMOT 方法仍然沿用传统闭集训练范式,仅在基础类别(Base classes)监督下训练基于外观的目标关联特征,导致模型在推理阶段面对未见过的长尾或新类别(Novel classes)时泛化能力急剧衰减。这一现象与开放词表检测/分割领域借助大规模多模态模型所取得的突破形成了鲜明对比,其核心症结在于跟踪任务尚未真正实现将通用特征迁移到时间维度目标关联上的范式跃迁。
近期代表性工作 MASA 尝试利用单图分割模型 SAM 与合成几何变形构建图像对伪标签,但这套范式存在两大致命缺陷:一是合成图像对完全丢失了真实视频中连贯的时序动态、物体遮挡与真实运动模式,且其仅凭分割置信度阈值进行静态过滤,缺乏时序一致性约束,极易引入空间漂移噪声,更无法评估样本难度以动态指导学习;二是监督信号仅停留在目标级别的对比学习,完全浪费了基础模型内部丰富的高阶时序与时空线索,导致其即便耗费 50 万对图像,性能收益依然十分有限。
面对这一矛盾,本文的切入点是将视频基础模型 SAM2 的通用跨时序追踪表征直接转化为无监督目标级跟踪能力,但 SAM2 本身是依赖提示词的像素级 VOS 模型,若直接使用其自动分割容易产生跨物体错误与弱光碎片化。核心 idea:通过检测器引导与双向 VOS 循环闭环验证自动生成高质伪标签并量化帧级难度,再构建解耦外观对比学习与多线索对抗蒸馏的双分支架构,以极低视频样本代价全面继承 SAM2 的时序泛化表征。
方法详解¶
整体框架¶
SOVTrack 整体包含两个核心协同模块:双向伪标签生成机制(DDPL)与双分支关联架构(Dual-Branch Association)。在数据准备阶段,DDPL 首先借助检测器在视频中提取候选框作为正向提示词驱动 SAM2 进行正向视频分割追踪,并在终止帧提取边界框作为反向提示词进行反向 VOS 追踪,通过前后时序循环闭环交并比(Cycle-IoU)强力滤除误检与漂移轨迹,同时计算各帧重合度作为难度置信度。在模型训练阶段,共享 ResNet-50 主干的双分支架构分别承载正交目标:对比分支专注于基于伪标签的外观判别学习;对抗分支则将检测器分类、定位与隐式关联特征投影对齐后,通过多线索对抗蒸馏(MCAD)逼近 SAM2 的内部指针特征;最终根据 DDPL 赋予的动态置信度自适应融合两分支特征输出最终关联向量。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["原始无标注视频帧序列"] --> B["检测器引导初筛<br/>提取感兴趣目标候选框"]
B --> C["双向循环闭环验证<br/>正反向 VOS 轨迹时序一致性校验"]
C -->|时序重合度超阈值| D["高质量伪标签生成与帧级难度评估"]
D --> E["双分支关联架构<br/>共享 ResNet-50 主干网络"]
E --> F["对比分支:外观判别相似度学习"]
E --> G["对抗分支:多线索对抗特征蒸馏 (MCAD)"]
F --> H["自适应特征动态融合<br/>按置信度自适应加权"]
G --> H
H --> I["输出强泛化目标关联特征"]
关键设计¶
1. 检测器引导的双向循环闭环验证:兼顾无监督初始化质量与跨时序轨迹自过滤 直接在视频首帧用 SAM2 自动生成掩码极易在复杂或弱光场景下产生跨物体粘连或破碎小区域,从而导致后续跟踪严重漂移。为此,SOVTrack 首先使用预训练检测器提取显著感兴趣目标候选框作为 SAM2 的初始提示框,避开纯底层无语义分割的碎裂干扰。在给定帧 \(t\) 选出高置信度候选框 \(\mathbf{P}^t = \{\mathbf{b}_i^t \mid \mathbf{d}_i^t \in \mathcal{D}^t, s_i^t > \theta_{\text{det}}\}\) 后,驱动 SAM2 正向跟踪 \(K\) 帧得到前向轨迹 \(\mathcal{T}^{\text{fwd}}\);接着提取第 \(t+K\) 帧掩码边界框作为反向提示框,执行反向 VOS 生成反向轨迹 \(\mathcal{T}^{\text{bwd}}\)。两者的起始帧交并比定义为循环一致性指标: $\(\mathcal{S}_{\text{cycle}}^{i,t} = \text{IoU}\left(\mathbf{b}_i^t, \mathbf{b}(m_i^{t,\text{bwd}})\right)\)$ 仅保留 \(\mathcal{S}_{\text{cycle}}^{i,t} > \theta_{\text{cycle}}\) 的轨迹作为可信伪标签,直接剔除漂移轨迹与虚警误检。
2. 细粒度帧级追踪难度评估:为自适应多模态表征融合提供动态先验 通过循环闭环检验的轨迹虽然在宏观时序上全局可靠,但在经过遮挡、光照突变或非刚性形变时,不同中间帧的跟踪难度大相径庭。传统的伪标签往往给整条轨迹赋予统一权重,忽略了难度的局域性。SOVTrack 巧妙复用正向和反向 VOS 生成的时序掩码,计算每个中间帧 \(t+k\) 处的正反向外接矩形框 IoU,构建帧级置信度评分: $\(\mathcal{C}_i^{t+k} = \text{IoU}\left(\mathbf{b}(m_i^{t+k,\text{fwd}}), \mathbf{b}(m_i^{t+k,\text{bwd}})\right)\)$ 该分值精细刻画了该帧的跟踪难度:高分代表目标形态平稳、简单,仅凭判别性外观特征即可稳健关联;低分则提示局部发生遮挡或形变,必须依赖更丰富的语义与时空线索补偿。
3. 多线索对抗蒸馏(MCAD):从像素级基础模型向目标级关联表征迁移 为了将 SAM2 内部蕴含关联、定位与语义分类的多线索跨注意力对象指针 \(\mathbf{h}_{\text{SAM2}}^{i,t+k} = \text{CrossAttn}(\mathbf{f}_{\text{img}}^{t+k}, \mathbf{f}_{\text{prompt},i}, \mathbf{f}_{\text{memory}}^{i,t+k})\) 充分注入跟踪器,对抗分支从检测器中并行提取分类线索 \(\mathbf{f}_{\text{cls}}\)、定位线索 \(\mathbf{f}_{\text{loc}}\) 与隐式关联线索 \(\mathbf{f}_{\text{assoc}}\)。通过线性投影网络统一维度后,经由可学习的多层感知机融合得到 \(\mathbf{f}_{\text{fused}}\)。直接点对点回归容易产生模态分布平滑,因此设计判别器网络 \(D\)(三层 MLP 配合 LeakyReLU 与 Dropout)区分融合特征与真实 SAM2 特征。生成端以最小化均方误差损失 \(\mathcal{L}_{\text{dist}}\) 与对抗欺骗损失 \(\mathcal{L}_{\text{adv}} = -\mathbb{E}[\log D(\mathbf{f}_{\text{fused}})]\) 联合优化,迫使跟踪器在特征分布层面完全吃透基础模型的跨时序时空关联先验。
4. 难易度感知自适应特征融合:动态平衡外观判别性与通用语义鲁棒性 对比分支专注于在伪标签监督下学习外观特征 \(\mathbf{f}_{\text{app}}\),对已知常规目标极为敏锐;而对抗分支输出的蒸馏特征 \(\mathbf{f}_{\text{fused}}\) 对新类别与遮挡场景表现出极强的鲁棒性。为实现二者的有机统一,系统构建轻量预测网络输出外观可靠度得分 \(\hat{\mathcal{R}}_{\text{reliability}}^{i,t+k} = \text{sigmoid}(\text{FC}_{\text{pred}}([\mathbf{f}_{\text{cls}}^{\text{proj}}; \mathbf{f}_{\text{loc}}^{\text{proj}}; \mathbf{f}_{\text{assoc}}^{\text{proj}}]))\),并通过均方误差损失约束其拟合来自 DDPL 的细粒度置信度 \(\mathcal{C}_i^{t+k}\)。最终按预测可靠度插值得到最终关联特征: $\(\mathbf{f}_{\text{final}}^{i,t+k} = \hat{\mathcal{R}}_{\text{reliability}}^{i,t+k}\mathbf{f}_{\text{app}}^{i,t+k} + (1 - \hat{\mathcal{R}}_{\text{reliability}}^{i,t+k})\mathbf{f}_{\text{fused}}^{i,t+k}\)$ 并在最终特征上施加对比损失 \(\mathcal{L}_{\text{fusion}}\),确保综合表征在全局特征空间中保持高度的类内紧凑性与类间分离度。
损失函数 / 训练策略¶
系统采用两阶段训练策略:第一阶段在 LVIS 基础类别上预训练检测器 20 个 epoch,随后冻结或用于离线生成 DDPL 伪标签;第二阶段在仅 10K 视频帧构成的无标注片段上,在 4 张 RTX 3090 GPU 上联合微调双分支网络 20 个 epoch。整体训练目标函数由五项协同构成: $\(\mathcal{L}_{\text{total}} = \mathcal{L}_{\text{app}} + \mathcal{L}_{\text{MCAD}} + \mathcal{L}_{\text{reliability}} + \mathcal{L}_{\text{fusion}} + \mathcal{L}_{\text{loc}}\)$ 其中 \(\mathcal{L}_{\text{loc}}\) 采用 Smooth L1 损失,以 SAM2 生成的高精度时序掩码外接矩形作为定位伪真实框监督检测器的回归分支,进一步强化几何定位精度;判别器则通过交叉熵判别损失在交替优化步骤中独立更新。
实验关键数据¶
主实验¶
在开放词表跟踪权威评测基准 TAO(基于 LVIS 词表划分 Base 与 Novel 类别)上,以 TETA(Tracking Every Thing Accuracy)及其三个解耦子指标(定位 LocA、关联 AssocA、分类 ClsA)评估验证集与测试集表现。所有对比方法均基于 ResNet-50 主干。
| 数据集 / 集合 | 方法 | 基础类 TETA | 基础类 LocA | 基础类 AssocA | 新类 TETA | 新类 LocA | 新类 AssocA |
|---|---|---|---|---|---|---|---|
| TAO 验证集 | OVTrack (CVPR'23) | 35.5 | 49.3 | 36.9 | 27.8 | 48.8 | 33.6 |
| TAO 验证集 | MASA (CVPR'24) | 36.9 | 55.1 | 36.4 | 30.0 | 54.2 | 34.6 |
| TAO 验证集 | SLAck (ECCV'24) | 37.2 | 55.0 | 37.6 | 31.1 | 54.3 | 37.8 |
| TAO 验证集 | OVTR (ICLR'25) | 36.6 | 52.2 | 37.6 | 31.4 | 54.4 | 34.5 |
| TAO 验证集 | TRACT (ICCV'25) | 38.5 | 55.0 | 39.0 | 31.3 | 52.7 | 37.8 |
| TAO 验证集 | SOVTrack (本文) | 40.1 | 58.1 | 42.3 | 35.7 | 59.0 | 42.4 |
| TAO 测试集 | OVTrack (CVPR'23) | 32.6 | 45.6 | 35.4 | 24.1 | 41.8 | 28.7 |
| TAO 测试集 | SLAck (ECCV'24) | 34.7 | 52.5 | 35.6 | 27.1 | 49.1 | 30.0 |
| TAO 测试集 | TRACT (ICCV'25) | 36.2 | 52.3 | 39.1 | 27.3 | 48.2 | 30.7 |
| TAO 测试集 | SOVTrack (本文) | 39.2 | 57.3 | 43.1 | 28.9 | 50.5 | 33.0 |
在计算开销方面,SOVTrack 在 RTX 3090 上推理速度达 12.1 FPS(接近 MASA 的 13.4 FPS);离线生成伪标签阶段仅需 3.6 GPU 小时,相比 MASA 的全图分割耗时(227.8 GPU 小时)减少了 63 倍,且训练帧数仅为其 2%(10K 帧 vs 500K 图像对)。
消融实验¶
基于 TAO 验证集对 SOVTrack 各组件模块与训练目标进行系统性消融分析:
| 配置 / 变体 | 基础类 TETA | 基础类 AssocA | 新类 TETA | 新类 AssocA | 说明 |
|---|---|---|---|---|---|
| SOVTrack (完整模型) | 40.1 | 42.3 | 35.7 | 42.4 | 完整双分支 + DDPL 框架 |
| 去掉循环闭环过滤 (w/o Cycle Filtering) | 38.1 | 38.4 | 32.2 | 37.6 | 噪声伪标签导致新类关联与综合性能断崖式下跌 |
| 采用 SAM 自动分割生成提示框 | 38.8 | 40.2 | 32.5 | 37.3 | 空间碎片化与跨物体缺陷使新类 TETA 掉点 3.2% |
| 去掉对比分支 (w/o Contrastive Branch) | 38.8 | 38.9 | 34.4 | 40.8 | 基础类外观判别力显著受损 (-1.3% TETA) |
| 去掉对抗分支 (w/o Adversarial Branch) | 39.3 | 40.9 | 33.0 | 37.8 | 缺乏通用表征蒸馏,新类 TETA 下降 2.7% |
| 去掉自适应特征融合 (w/o Adaptive Fusion) | 38.8 | 39.9 | 33.2 | 39.7 | 缺乏按难度的动态调节,新类 TETA 下跌 2.5% |
| 去掉对抗蒸馏 (仅保留 L2 蒸馏) | 39.3 | 40.7 | 34.2 | 40.1 | 分布对齐缺失导致表征迁移效果减弱 |
| 去掉定位伪标签监督 \(\mathcal{L}_{\text{loc}}\) | 38.9 | 41.6 | 32.8 | 40.9 | 失去 SAM2 优质边界框修正,新类 LocA 掉点 3.7% |
关键发现¶
- 新类别时序关联能力产生质变:在新类别目标上,SOVTrack 的 AssocA 达到 42.4%,较此前 SOTA(SLAck 37.8%)大幅跨越 4.6 个百分点,且新类关联精度与基础类(42.3%)完全持平,证明通用基础模型蒸馏彻底抹平了新旧类别间的时序追踪泛化鸿沟。
- 循环闭环是自监督时序质量的生命线:去掉 DDPL 的双向时序循环闭环后,新类 TETA 暴跌 3.5%(35.7% \(\to\) 32.2%),AssocA 暴跌 4.8%,说明无监督挖掘视频伪标签的关键并不在于数据规模,而在于双向时序闭环提供的强几何过滤能力。
- 双分支架构分工明确且高度互补:消融显示对比分支主要巩固基础类别判别力(贡献 +1.3% Base TETA),而对抗蒸馏分支则是新类别泛化的核心引擎(贡献 +2.7% Novel TETA);配合帧级难度感知的自适应融合,让两者在不同跟踪状态下实现了最优动态协同。
亮点与洞察¶
- 将 VOS 追踪轨迹转化为闭环假设检验:通过在首尾帧执行前后双向追踪并以边界框 IoU 闭环判定可靠性,以极低计算代价化解了无监督目标生成的假阳性与漂移困境。
- 多线索表征对抗迁移:不仅蒸馏外观,更整合分类、定位与隐式时序线索,并通过对抗判别器拉近与 SAM2 内部对象指针的特征流形分布,避免了传统 L2 均方误差导致的高维特征过度平滑。
- 极高的数据与算力性价比:仅用 10K 视频帧与 3.6 小时的基础模型处理时间,便全面超越了需要 50 万图像对预训练的 MASA,证明了真实视频时序动态对目标跟踪模型不可替代的重要性。
局限与展望¶
- 作者承认的局限:框架高度依赖前置目标检测器的初始建议质量,若场景中存在检测器在首帧完全漏检的小目标或极端遮挡物体,双向闭环机制将无法激活。
- 潜在改进方向:当前双向追踪仅在局部固定长度窗口(\(K\) 帧)内执行,未能显式建模跨超长视频片段的长周期目标重识别与轨迹生死周期管理;未来可探索将大语言模型推理引入时序不确定性判定中。
相关工作与启发¶
- vs MASA (CVPR 2024):MASA 使用单图 SAM 分割配合人造仿射几何变换生成 50 万静态图像对,不仅丢失了真实物理运动与遮挡动态,且仅做目标级对比学习;SOVTrack 直接从真实原始视频挖掘时序伪标签,通过双向闭环与多线索对抗蒸馏,在数据量缩减 98% 的前提下显著超越其精度。
- vs OVTrack / SLAck (CVPR 2023 / ECCV 2024):以往方法要么受困于闭集监督在未见类别上的灾难性遗忘,要么仅停留在启发式的启发特征拼接;SOVTrack 首次将视频大模型 SAM2 的内部时空表征无缝下放至目标级轻量跟踪器中,展现了多任务知识蒸馏在时序视频领域的巨大潜力。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ [设计了闭环自检验的自监督视频伪标签机制与多线索对抗蒸馏架构]
- 实验充分度: ⭐⭐⭐⭐⭐ [在开放词表权威基准 TAO 上进行了详尽的指标拆解、模块消融与算力对比]
- 写作质量: ⭐⭐⭐⭐⭐ [逻辑严密流畅,图表信息充实且核心公式直击关键机制]
- 价值: ⭐⭐⭐⭐⭐ [为自监督开放词表视频跟踪树立了高数据效率的全新范式]