跳转至

GAP-Track: Bridging the Resolution Gap for Cross-Resolution RGBT Tracking

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/shijiahahaha/GAPTrack
领域: 目标检测
关键词: RGBT跟踪、跨分辨率跟踪、知识蒸馏、特征重构、极坐标几何损失

一句话总结

针对边缘端低算力与有限带宽导致的低分辨率输入性能坍塌问题,GAP-Track 结合训练期掩码残差重构、极坐标几何敏感损失与分层知识蒸馏,在不增加推理额外开销的前提下实现了跨分辨率高精度 RGBT 跟踪。

研究背景与动机

在全天候自动驾驶和安防监控等无人系统中,可见光与热红外(RGBT)多模态目标跟踪因两种模态的互补特性而具有不可替代的作用。可见光图像具备丰富的纹理细节与清晰边缘,但在低照度或浓雾场景下易失效;热红外传感器则依赖热辐射成像,能够在黑夜或恶劣气象中突出目标轮廓。然而在真实的边缘计算与无人机边缘机载平台上,硬件计算能力极其受限,多模态高分辨率视频流的实时传输亦受制于网络通信带宽。将高分辨率输入下采样至低分辨率甚至超低分辨率(如 \(1/2\)\(1/4\) 分辨率)是边缘部署不可避免的妥协方案,可将通信带宽骤降至 \(6.25\%\) 并极大压缩显存占用。

然而现有的先进 RGBT 跟踪器在面对输入分辨率急剧下降时,通常会出现剧烈的性能崩塌。这种退化主要由两个核心矛盾引起:首先是空间模糊性加剧,下采样直接剔除了大量细粒度几何纹理与边界轮廓线索,使得原本中等大小的目标在特征图上缩减为仅占数个像素的模糊光斑;其次是跨模态空间对应关系的退化,在极低分辨率下可见光与红外通道之间的对齐难度成倍增加,严重削弱了跨模态特征融合的判别力。此外,传统的边界框回归损失(如平滑 L1、L2 或标准 IoU 损失)在目标极其稀疏、边界模糊的情况下,会因中心点梯度平缓或尺度过小而陷入梯度消失与“优化死区”,引发严重的中心点漂移与尺度估计失准。

直接对低分辨率学生模型进行跨模态特征对齐或单纯从高分辨率教师模型进行常规蒸馏,由于分辨率跨度巨大往往难以收敛至优秀特征空间。本文的切入角度是:必须从“训练期特征表示重构”与“优化目标几何敏感度”双向协同发力,在训练阶段倒逼学生骨干网络编码失真的细粒度几何与语义线索,并在推理阶段将所有辅助分支完全舍弃以保持零额外算力。核心 idea:提出 GAP-Track 跨分辨率跟踪框架,通过辅助生成重构(AGR)迫使低分辨率特征恢复高频结构,引入极坐标几何敏感(PGS)损失破解低分辨率下的中心漂移与梯度消失,并依托分层知识蒸馏(HKD)为极端降采样构建平滑学习轨迹。

方法详解

整体框架

GAP-Track 采用端到端的教师-学生架构。训练阶段,高分辨率输入被下采样成多尺度低分辨率 patch 输入学生网络,提取出低分辨率特征;为了弥合分辨率落差,框架设计了三大协同机制,且全部仅在训练阶段作为辅助监督者运作:一是辅助生成重构模块(AGR)通过随机掩码与轻量残差生成器还原教师级特征,增强骨干网络的高频表示能力;二是分层知识蒸馏(HKD)根据分辨率梯度自适应引入中间半分辨率教师模型以平滑知识传递;三是极坐标几何敏感损失(PGS)对跟踪头预测框进行角度与径向解耦监督,攻克小目标中心漂移。推理阶段,教师网络、生成器分支和蒸馏约束全部剥离,仅保留极轻量的学生骨干与跟踪头,以极低 FLOPs 实现实时精准跟踪。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["多模态低分辨率输入<br/>RGB & TIR Patch"] --> B["学生骨干网络提取特征<br/>Fs 低分辨率特征图"]
    B --> C["辅助生成重构<br/>双线性插值 + 随机掩码 + 残差生成器"]
    B --> D["分层知识蒸馏<br/>自适应中间尺度教师多级特征对齐"]
    B --> E["跟踪预测头<br/>预测目标中心与宽高"]
    E --> F["极坐标几何敏感损失<br/>极坐标解耦位置 + 方差自适应尺度惩罚"]

关键设计

1. 辅助生成重构:利用掩码残差学习倒逼骨干编码丢失的细粒度结构

常规知识蒸馏直接强制让低分辨率特征拟合高分辨率特征,学生往往只能机械记忆模糊插值像素,无法自发挖掘缺失的高频边缘。针对这一痛点,GAP-Track 引入了辅助生成重构任务(AGR)。给定学生提取的低分辨率特征 \(F_s \in \mathbb{R}^{C \times H_s \times W_s}\),先经双线性插值上采样对齐空间尺寸得到 \(F_{up}\),随后引入空间二值掩码 \(M \in \{0, 1\}^{H \times W}\) 生成带遮挡特征 \(F_{masked} = F_{up} \odot M\)。为了避免常规重构网络训练不稳定的问题,模块采用轻量级 CNN 残差生成器 \(G\),仅预测需要补偿的高频细节残差: $\(F_{rec} = F_{up} + G(F_{masked})\)$ 通过内容损失督导 \(F_{rec}\) 逼近高分辨率教师特征 \(F_t\)。掩码约束迫使网络无法仅从局部像素走捷径,必须从周围上下文推断出缺失的目标轮廓;残差结构则使生成器专注于高频补偿而非基础语义重构。最关键的是,生成器 \(G\) 在测试阶段直接舍弃,实现了在推理零开销前提下显著提升低分辨率骨干的特征判别力。

2. 极坐标几何敏感损失:极坐标空间解耦与二阶梯度敏感性抑制中心漂移

在输入图像降维到 \(64 \times 64\) 等极端分辨率时,传统基于笛卡尔坐标的 L2 或 IoU 损失在目标中心附近存在大面积“梯度死区”(Gradient Dead Zone),梯度随偏移量减小而线性消失,导致预测框在极小物体上产生不可接受的中心漂移。为此,本文设计了极坐标几何敏感损失(PGS),将其解耦为尺度敏感损失 \(\mathcal{L}_S\) 与极坐标位置敏感损失 \(\mathcal{L}_{PLS}\): $\(\mathcal{L}_{PGS} = \mathcal{L}_S \cdot \mathcal{L}_{PLS}\)$ 在位置敏感分支中,将预测中心 \(c_p=(x_p, y_p)\) 与真值中心 \(c_{gt}=(x_{gt}, y_{gt})\) 相对于搜索区中心 \((x_c, y_c)\) 投影到极坐标空间,得到径向距离 \(d_i\) 与方位角 \(\theta_i\)。位置损失定义为径向敏感项与角度敏感项的乘积: $\(\mathcal{L}_{PLS} = \left( 1 - \frac{\min(d_p, d_{gt})}{\max(d_p, d_{gt})} \right) \cdot \frac{4}{\pi^2}(\theta_p \theta_{gt})^2\)$ 由于极坐标变换具有非线性的雅可比矩阵(Jacobian Matrix),其关于空间坐标的导数包含正比于 \(1/d\) 的项。当距离 \(d \to 0\) 时,该项有效抵消了微小位移带来的梯度衰减,在目标中心处形成漏斗状的陡峭优化曲面,彻底消除了梯度死区。在尺度敏感分支中,设计了方差感知加权因子 \(w\) 调制交并比: $\(w = \frac{\min(|A_p|, |A_{gt}|) + \text{Var}(|A_p|, |A_{gt}|)}{\max(|A_p|, |A_{gt}|) \cdot \text{Var}(|A_p|, |A_{gt}|)}\)$ 该权重在尺度偏差较大时放大惩罚,强力杜绝低分辨率下目标框收敛至局部次优尺寸。

3. 分层知识蒸馏:以半分辨率中间教师搭建跨尺度认知桥梁

当输入从全分辨率(\(256 \times 256\))直接坠入 \(1/4\) 分辨率(\(64 \times 64\))时,因感受野、降采样率及跨模态特征表征能力的断层式差距,一步到位的特征对齐会带来严重的学习难度与梯度震荡。GAP-Track 提出了分层知识蒸馏(HKD)机制。对于标准 \(1/2\) 分辨率学生,模型直接从全分辨率教师中蒸馏特征;而对于极限 \(1/4\) 分辨率学生,框架策略性地引入训练完毕的优秀 \(1/2\) 分辨率模型作为中间过渡教师。通过可学习的变换层 \(\phi(\cdot)\)(由 \(1 \times 1\) 卷积与双线性插值构成)匹配多阶段特征维度,分层蒸馏损失在多个主干阶段自适应平衡: $\(\mathcal{L}_{HKD} = \sum_{i} \alpha_i F_{\mathcal{T}}^i \phi(F_{\mathcal{S}}^i)\)$ 该分层跳板让学生网络先在易于理解的中间尺度建立多模态关联,再向极度退化的微小输入迁移,保证了剧烈跨分辨率优化下的平滑收敛。

损失函数 / 训练策略

GAP-Track 的联合优化目标由辅助生成重构损失 \(\mathcal{L}_{AGR}\)、极坐标几何敏感损失 \(\mathcal{L}_{PGS}\) 以及分层知识蒸馏损失 \(\mathcal{L}_{HKD}\) 加权组成: $\(\mathcal{L}_{total} = \lambda_{AGR}\mathcal{L}_{AGR} + \lambda_{PGS}\mathcal{L}_{PGS} + \lambda_{HKD}\mathcal{L}_{HKD}\)$ 模型基于 PyTorch 在单张 NVIDIA RTX 3090 GPU 上进行训练,主干网络采用 DropMAE 预训练权重初始化,优化器采用 AdamW,初始学习率设为 \(1 \times 10^{-4}\),权重衰减为 \(1 \times 10^{-4}\),batch size 为 32,每个 epoch 采样 60,000 张图像,总共训练 30 个 epoch。

实验关键数据

主实验

在两个权威的大规模 RGBT 跟踪基准 LasHeR 与 RGBT234 上,作者全面评测了 GAP-Track 在全分辨率、半分辨率(\(1/2\))以及极限四分之一分辨率(\(1/4\))下的跟踪精度。

数据集 分辨率配置 指标 GAP-Track (本文) CKD (基线/前SOTA) 提升 / 表现差距
LasHeR Full Res (\(256 \times 256\)) PR / SR / NPR 71.8 / 57.1 / 67.9 73.2 / 58.1 / 69.3 保持高位基础性能,仅微弱差距
LasHeR Half Res (\(128 \times 128\)) PR / SR / NPR 67.6 / 52.9 / 63.3 65.7 / 51.5 / 61.6 +1.9% PR / +1.4% SR / +1.7% NPR
LasHeR Quart. Res (\(64 \times 64\)) PR / SR / NPR 57.2 / 43.7 / 52.7 44.1 / 35.3 / 39.4 +13.1% PR / +8.4% SR / +13.3% NPR
RGBT234 Full Res (\(256 \times 256\)) PR / SR 87.4 / 64.8 90.0 / 67.4 保持具有竞争力的基础跟踪精度
RGBT234 Half Res (\(128 \times 128\)) PR / SR 84.2 / 62.5 83.3 / 60.7 +0.9% PR / +1.8% SR
RGBT234 Quart. Res (\(64 \times 64\)) PR / SR 75.5 / 54.5 68.2 / 47.8 +7.3% PR / +6.7% SR

在计算复杂度方面,GAP-Track 在保持与基线完全相同参数量(183.43M)与 FLOPs(1/4 分辨率下仅 11.70G FLOPs,相较全分辨率 117.01G 骤降 \(90\%\))的前提下,性能取得巨大飞跃。此外,将 GAP-Track 作为训练期即插即用正则器植入到 AAAI 2025 最强通用单目标跟踪器 SUTrack 时,在 LasHeR (RGBT)、LaSOT (纯RGB) 以及 VisEvent (RGBE事件相机) 三大模态与基准上均取得全面一致增益(分别带来 \(+0.7\%\) SR、\(+1.1\%\) AUC 和 \(+0.9\%\) AUC)。

消融实验

作者在 LasHeR 数据集上对各核心组件进行逐步剥离与消融验证,涵盖 \(1/2\) 分辨率与极具挑战性的 \(1/4\) 分辨率场景:

配置 AGR HKD PGS Half Res (PR/SR/NPR) Quart. Res (PR/SR/NPR) 说明
Baseline - - - 65.7 / 51.5 / 61.6 44.1 / 35.3 / 39.4 基础学生模型,低分辨率崩溃
+ AGR - - 66.8 / 52.3 / 62.4 49.7 / 39.2 / 44.1 恢复高频语义,1/4下PR大幅回升+5.6%
+ AGR + PGS - 67.6 / 52.9 / 63.3 54.1 / 41.8 / 48.8 极坐标二阶梯度加持,1/4下PR再升+4.4%
Full Model (+HKD) 67.6 / 52.9 / 63.3 57.2 / 43.7 / 52.7 梯级教师平滑过渡,最终在1/4下达最优

关键发现

  • AGR 模块解决“看清什么”,越极端降采样增益越显著:在 \(1/4\) 极限降采样下,加入 AGR 使 PR 从 \(44.1\%\) 飙升至 \(49.7\%\)\(+5.6\%\)),Grad-CAM 热力图表明其彻底矫正了低分辨率导致的注意力涣散与多模态错位。
  • PGS 损失解决“定在何处”,精准斩断中心点漂移:在 \(1/4\) 分辨率下,PGS 为已经具备结构恢复能力的特征再带来 \(+4.4\%\) PR 与 \(+2.6\%\) SR 的增益,理论分析与 3D 损失曲面证实其非线性雅可比矩阵有效消除了中心零点梯度死区。
  • 分层蒸馏(HKD)是跨巨大分辨率鸿沟的必要缓冲:对于从全分辨率直接到 \(1/4\) 分辨率的学生,直接监督易受挫,而半分辨率中间教师搭建的认知梯度带来了额外 \(+3.1\%\) PR 的提升。

亮点与洞察

  • 训练期计算换取推理期零开销:将计算密集的生成重构网络与极坐标复杂变换全部限制在反向传播期,测试阶段直接剥离,实现了模型参数量与推理 FLOPs 的“零额外负担”,极其贴合边缘设备落地需求。
  • 用极坐标几何变换解决经典梯度消失的新思路:巧妙利用极坐标距离反比项(\(1/d\))产生的强二阶导数特性,重构损失优化景观,打破了传统小目标检测中 L2/IoU 在接近真实边界时梯度枯竭的物理固有缺陷。
  • 高阶任务与退化输入的通用正则器范式:不仅能处理 RGBT,还成功迁移到纯 RGB 跟踪与 RGB-Event 神经拟态事件跟踪架构,证明了“生成辅助补偿 + 几何极坐标损失”是应对视觉退化跟踪的通用方案。

局限与展望

  • 时序连续性建模尚有留白:目前 GAP-Track 主要侧重于单帧空间几何与跨模态特征维度的分辨率弥合,在极端低分辨率下若遭遇连续遮挡或剧烈光照跳变,尚未结合历史多帧时序记忆库来弥补空间信息缺失。
  • 动态分辨率自适应机制有待探索:目前的降采样尺度为固定比例(1/2 或 1/4),未来可探索根据边缘设备瞬时电量或网络拥塞动态自适应切换分辨率的弹性跟踪机制。

相关工作与启发

  • vs CKD (Coupled Knowledge Distillation, ACM MM 2024):CKD 侧重于在标准分辨率下耦合模板与搜索区域特征来跨越模态鸿沟,但在低分辨率下缺乏高频重构能力;GAP-Track 则进一步攻克了物理分辨率鸿沟,在 1/4 分辨率下以相同算力大幅领先 CKD 超过 13 个百分点。
  • vs DropMAE / ViTKD:传统掩码自编码器多用于自监督预训练;本文创新地将掩码重建机制改造为残差驱动的“跨分辨率超分蒸馏桥梁”,只学高频残差,收敛更快且针对性更强。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 极坐标敏感损失解决中心梯度死区的思路新颖,残差掩码超分蒸馏架构设计严谨。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 LasHeR、RGBT234、LaSOT、VisEvent 四大基准,详尽的消融、参数量与 FLOPs 剖析。
  • 写作质量: ⭐⭐⭐⭐⭐ 动机阐述自然流畅,数学推导与损失景观可视化极具说服力。
  • 价值: ⭐⭐⭐⭐⭐ 为边缘设备部署 RGBT 实时多模态系统提供了极其务实高效的范式。