跳转至

Motion-aware Sparse Pipeline for Lightweight Object Tracking

会议: ECCV 2026
论文: ECCV 2026 Poster
代码: https://github.com/TsingWei/MaST
领域: 视频理解
关键词: 视觉目标跟踪, 稀疏化流水线, 运动先验, 轻量级视觉Transformer, 端到端稀疏预测头

一句话总结

针对单流视觉Transformer跟踪器因早期注意力发散导致剪枝滞后、以及密集预测头破坏稀疏收益的核心瓶颈,MaST在首层引入高斯运动先验引导单步稀疏化并设计“先打分、单次回归”的非结构化稀疏预测头,在端侧设备上以近两倍的推理速度刷新SOTA。

研究背景与动机

基于单流视觉Transformer(One-stream Vision Transformer)的目标跟踪器通过自注意力机制联合建模模板与搜索区域的交互,取得了突破性的跟踪精度。然而,自注意力随token序列长度呈二次方增长的计算复杂度带来了巨大的计算开销,严重阻碍了其在无人机、移动机器人等低功耗边缘设备上的实时落地。虽然模型瘦身和动态自适应推理能够在一定程度上减少平均延迟,但要么牺牲判别力,要么因单帧可变计算量导致边缘硬件调度与排期极度不稳定。

利用视觉Transformer的离散token特性进行token剪枝(Token Pruning)成为加速跟踪的直接路径。然而,现有稀疏跟踪方法存在两大系统性断层:其一,早期编码器层的注意力响应极其发散且噪声严重,模型尚未形成对目标的准确定位,导致现有工作只能保守地在深层网络中多轮逐步剪枝(如第4、7、11层),使得计算占比极高的浅层网络依然不得不完整计算所有全量token;其二,后端的预测头通常采用密集的卷积层,强依赖规则的2D网格结构,迫使稀疏token必须补零并反向重塑(pad & reshape)为密集特征图,不仅造成大量无效计算,而且在高剪枝率下若目标中心点被剔除还会导致严重的位置预测漂移。

这一困境的核心矛盾在于:单靠单帧外观层面的浅层交叉注意力无法在早期可靠地辨识关键token,而密集预测头又吞噬了稀疏化带来的算力节省。诊断性实验表明,如果引入真实目标位置的空间先验,即使在第1层直接剪掉67%的token,精度也几乎不受损失。基于“跟踪任务中相邻帧运动具有平滑时序连续性”的先验事实,本文将时序引导前置到浅层token筛选环节,并彻底重构输出头。核心 idea:将前一帧的历史高斯运动先验注入浅层交叉注意力得分,实现编码器第一层的可靠单步稀疏筛选,并构建“先分类打分、仅针对最高分token单次回归”的原生稀疏预测头,实现从token处理到边界框解码的端到端全链路稀疏化。

方法详解

整体框架

MaST整体框架由三个核心阶段串联而成:输入序列补丁嵌入与模板-搜索联合编码、运动感知引导的浅层token单步剪枝、以及基于非结构化稀疏token的目标解码。给定模板图像 \(Z \in \mathbb{R}^{3 \times H_z \times W_z}\) 与当前搜索区域图像 \(X \in \mathbb{R}^{3 \times H_x \times W_x}\),系统将其切分为不重叠的补丁并映射为token序列。序列送入Transformer编码器后,在首层即由通用稀疏化模块完成关键token保留,后续所有编码层均在被压缩的非结构化稀疏token集上运行,最后由全稀疏预测头直接解算目标边界框。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入模板与搜索区域补丁序列"] --> B["运动感知单步稀疏化<br/>融合浅层注意力与高斯运动先验"]
    B --> C["稀疏Transformer编码层<br/>仅计算Top-K保留Token序列"]
    C --> D["先打分单次回归稀疏头<br/>打分分支全局评估目标锚点"]
    D --> E["单次边界框回归解码<br/>针对最高置信度锚点直接解码"]

关键设计

1. 运动感知单步稀疏化:打破浅层注意力发散瓶颈

针对浅层交叉注意力由于缺乏语义抽象而高度发散、无法区分目标与背景的痛点,该设计通过引入上一帧目标的时序空间先验来校准注意力分布。在编码器中,搜索区域token表示为查询 \(Q_x \in \mathbb{R}^{P_x \times d}\),模板token表示为键 \(K_z \in \mathbb{R}^{P_z \times d}\)。为了控制计算量,模型仅提取模板中心补丁token \(k_c \in \mathbb{R}^d\) 作为紧凑代表,计算每个搜索token \(q_i\) 与其的缩放点积并归一化为原始外观重要性得分 \(s_i\)。同时,利用上一帧预测的目标边界框 \(b_{t-1} = (x_{t-1}, y_{t-1}, w_{t-1}, h_{t-1})\) 构建以历史中心为核的2D高斯运动窗口:

\[G_t(u, v) = \exp \left( -\frac{(u - x_{t-1})^2}{2\sigma_x^2} - \frac{(v - y_{t-1})^2}{2\sigma_y^2} \right)\]

其中 \((u, v)\) 为搜索区域token对应的空间坐标,标准差设定为 \(\sigma_x = \gamma w_{t-1}, \sigma_y = \gamma h_{t-1}\)(比例系数 \(\gamma = 0.5\))。最终重要性得分通过逐元素加权求得:

\[w_i = G_t(u_i, v_i) \cdot s_i\]

该机制赋予历史运动邻域内的token更高的保留权重,即使在编码器第1层也能精准抑制离散背景噪声,实现一次性保留Top-\(K\)个搜索token \(\mathcal{L}_K \in \mathbb{R}^{N_K \times d}\),避免了多阶段渐进剪枝带来的算力滞后。

2. 先打分单次回归稀疏头:消除密集网格重构开销

针对传统卷积预测头必须把稀疏token填充重塑回2D特征网格、在空白位置空转计算且受中心token误裁影响的瓶颈,该模块采用纯MLP构架,直接在非结构化的稀疏token集合 \(\mathcal{L}_K = \{\mathbf{f}_k\}_{k=1}^{N_K}\) 及其附带的原始坐标锚点 \(p_k = (u_k, v_k)\) 上进行无序前向传播。为了最大限度降低回归计算负担,预测头解耦为“先全局粗打分、再单点精确回归”的级联逻辑。

打分分支 \(g_s\) 计算每个保留token的置信度标量 \(s_k \in \mathbb{R}\),并通过ArgMax选出全局置信度最高的目标中心token索引 \(k^* = \arg\max_k s_k\)。随后,回归分支 \(g_r\) 仅对这一个选中的token特征 \(\mathbf{f}_{k^*}\) 执行单次边界框偏移量预测 \(\Delta_{k^*}\),并结合其存储的原生坐标锚点直接解码输出真实边界框 \(\hat{\mathbf{b}} = \mathrm{Decode}(\mathbf{p}_{k^*}, \Delta_{k^*})\)。该设计使打分计算量与稀疏token数 \(N_K\) 线性相关,而边界框回归的复杂度被完全压缩为常数级 \(\mathcal{O}(1)\),彻底根除了密集特征图填充与重复计算。

损失函数 / 训练策略

MaST采用端到端联合训练策略。在训练阶段,稀疏化保留率采用渐进式预热(Warm-up)调度,使得网络在训练初期适应完整特征分布后再逐步适应高压缩率。网络总损失由打分分支分类损失与回归损失加权组成:

\[L_{\text{head}} = L_{\text{cls}}(\{s_k\}) + \lambda_{\ell_1} L_{\ell_1}(\hat{\mathbf{b}}_{k^{\text{gt}}}, \mathbf{b}) + \lambda_{\text{GIoU}} L_{\text{GIoU}}(\hat{\mathbf{b}}_{k^{\text{gt}}}, \mathbf{b})\]

其中 \(k^{\text{gt}} = \arg\min_k \|\mathbf{p}_k - \mathbf{c}\|\) 为距离真实标注框中心 \(\mathbf{c}\) 最近的稀疏锚点token,回归损失权重固定为 \(\lambda_{\ell_1} = 5\) 与 \(\lambda_{\text{GIoU}} = 2\)。模型优化器采用AdamW,权重衰减为 \(10^{-4}\),编码器主干学习率设为 \(4 \times 10^{-5}\),其余结构为 \(4 \times 10^{-4}\),在单张RTX 3090上使用128的批大小共迭代300个epoch。

实验关键数据

主实验

在LaSOT、TrackingNet和GOT-10k三大通用基准上,MaST系列(nano、tiny、small)与现存代表性轻量化单目标跟踪器在端侧设备上的速度与精度对比如下表所示:

模型 会议/年份 MACs (G) LaSOT AUC LaSOT PNorm TrackingNet SUC TrackingNet PNorm GOT-10k AO RPi 5 (FPS) Jetson Nano (FPS)
MaST-nano Ours 0.585 58.6 67.7 77.2 82.5 61.6 30.1 230
AsymTrack-T AAAI 2025 0.708 60.8 68.7 76.2 80.9 62.3 18.1 99
FEAR-XS ECCV 2022 0.532 53.5 - - - 61.9 19.5 146
LightTrack CVPR 2021 0.483 53.8 - 72.5 77.8 61.1 13.4 124
MaST-tiny Ours 0.836 63.8 72.2 80.1 85.3 66.6 22.6 152
AsymTrack-S AAAI 2025 0.806 62.8 71.2 77.9 82.2 65.5 15.6 88
FARTrackpico ICLR 2026 1.080 58.6 67.1 75.6 81.3 62.8 17.2 134
HiT-Small ICCV 2023 1.130 60.5 68.3 77.7 81.9 62.6 21.5 106
MaST-small Ours 1.820 65.8 74.7 82.3 87.1 70.0 7.5 98
FERMT ECCV 2024 2.310 65.1 74.6 80.8 80.9 69.6 7.9 84
FARTracktiny ICLR 2026 2.650 63.2 71.6 80.7 85.6 70.6 6.9 87
AsymTrack-B AAAI 2025 1.810 64.7 73.0 80.0 84.5 67.7 6.2 57

消融实验

为严格解耦不同稀疏化策略、预测头设计以及剪枝层数对跟踪性能的影响,基于ViT-Tiny主干在LaSOT与边缘硬件上的消融评测如下:

1. 编码器稀疏化准则消融(LaSOT & 运算吞吐量)

稀疏化引导准则 LaSOT AUC LaSOT PNorm 编码器 MACs (M) RPi 5 (FPS) Orin Nano (FPS)
无剪枝基线 (None) 64.0 74.2 1752 9.1 94
仅跨注意力 (Attention) 60.5 71.9 824 22.9 157
辅助预测子网络 (Prediction) 59.4 71.4 874 21.5 138
仅运动窗口先验 (Motion) 62.6 72.2 824 23.5 169
跨注意力 + 运动先验 (Ours) 63.8 73.6 824 22.6 152

2. 预测头架构设计消融(LaSOT & 预测头复杂度)

预测头类型 定位范式 密集输入 AUC 稀疏输入 AUC 密集头 MACs (G) 稀疏头 MACs (G) RPi 5 帧率 (FPS)
Loc Tokens (MixFormerV2) 全局定位 59.0 57.9 1.76 0.845 23.9
Transformer Decoder 全局定位 61.4 60.1 1.88 0.833 22.7
3×3 Conv-stacked (OSTrack) 锚点密集回归 65.0 64.1 2.39 1.463 13.8
MLP Dense (LoRAT) 锚点密集回归 64.0 63.8 1.81 0.872 21.3
MLP Sparse (Ours) 先打分单次回归 64.0 63.8 1.75 0.836 23.2

关键发现

  • 运动先验是早期剪枝的核心救星:单纯依赖浅层跨注意力筛选token会使LaSOT AUC从64.0骤跌至60.5,而叠加高斯运动窗口后,仅以第1层单步剪枝就收回了63.8的AUC,几乎追平稠密未剪枝上限,且端侧推理速度提升2.5倍。
  • 浅层单步剪枝比多层渐进剪枝具有明显速度优势:在Layer 1实施剪枝与在Layer 6剪枝相比,AUC仅相差0.14(63.82 vs 63.96),但树莓派帧率从10.1 FPS翻倍至22.6 FPS,证明算力压制越靠前性价比越高。
  • 先打分单次回归彻底释放硬件稀疏收益:传统3×3卷积头在接收稀疏特征时因填补reshape开销限制在13.8 FPS,而全稀疏MLP头通过锚点查找与单次回归直接飙升至23.2 FPS,且精度完全没有损耗(63.8 AUC)。

亮点与洞察

  • 将跟踪时序平滑性转化为静态计算剪枝准则:巧妙地将传统跟踪中用于后处理加权排查边界跳跃的高斯窗/汉宁窗前移到了编码器首层的token选择机制中,用极低的先验计算成本化解了浅层注意力混乱的固有缺陷。
  • 原生全稀疏预测头消除了端到端算力泄漏:打破了“稀疏主干后接密集输出头”的惯性设计,利用无序token保留的原始坐标网格作为稀疏锚点,将空间密集的回归过程收敛为常数时间查找。
  • 对边缘设备算力调度的极高友好性:相比于输入自适应动态提前退出(Early Exit)造成的非恒定帧延迟,MaST坚持确定性的Top-\(K\)预算单步压缩,在树莓派与Jetson上提供了高度平稳、可预测的硬件利用率。

局限与展望

  • 作者承认的局限:在高分辨率图像输入下(如384×384搜索区域),在第一层执行稀疏化之前,补丁切分与首层注意力的初始序列依然较长,未能在分词阶段前进一步抑制高分辨率带来的计算浪涌。
  • 实验与假设条件的局限:高斯运动窗口强烈假设相邻帧目标位移平滑且无突发剧烈跳变;当面对相机视角剧烈剧跳或目标遭遇超长时间全遮挡再现时,固定尺度的历史运动先验可能产生偏向旧位置的归纳偏置。
  • 未来改进思路:可探索将输入自适应的粗粒度区域补丁筛选置于Patch Embedding之前,或引入自适应卡尔曼滤波动态调节高斯窗口的标准差,增强极端快动场景下的鲁棒性。

相关工作与启发

  • vs OSTrack (ECCV 2022): OSTrack采用基于交叉注意力的渐进式多轮token剪枝,并使用3×3卷积密集头。MaST证明了渐进式剪枝在浅层算力浪费严重,通过运动先验实现了首层单步直接剪枝,并用原生稀疏头取代了卷积密集头,速度近乎翻倍。
  • vs AsymTrack (AAAI 2025): AsymTrack通过非对称双流结构压缩模板侧运算,但在搜索区域的密集计算依然显著。MaST在单流架构下直接从序列两端(浅层剪枝+尾部单次回归)进行空间裁剪,在同等MACs下获得了明显更高的端侧实际FPS与精度。
  • vs LoRAT (ECCV 2024): LoRAT将跟踪头替换为MLP以加速密集推理。MaST进一步将MLP改造成基于稀疏锚点的“先打分、单次回归”模式,展示了非结构化token在无需网格恢复的前提下直接回归边界框的完整可行性。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 首次将时序运动高斯先验与原生非结构化稀疏预测头结合,成功攻克跟踪器首层单步高压缩剪枝难题。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖多个主流公开评测集(LaSOT, TrackingNet, GOT-10k, UAV123, NFS, VastTrack),并在RPi5、CPU与Jetson Orin Nano上给出了极其详实的真实硬件延迟评测。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑结构严密,诊断性实验(Fig. 2)直击行业痛点,消融实验设计非常全面。
  • 价值: ⭐⭐⭐⭐⭐ 为轻量级视觉Transformer跟踪器在超低算力边缘终端上的工程落地提供了极具参考价值的端到端稀疏设计范本。