跳转至

Local-to-global Cross-modal Coordination for Self-supervised RGB-T Tracking

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/zyyyya/LGCTrack
领域: 自监督/表示学习
关键词: RGB-T tracking, 自监督学习, 单目标跟踪, 跨模态协同, 闭环验证

一句话总结

针对自监督 RGB-T 目标跟踪在前向-后向循环验证中因双模态可靠性动态失衡所导致的伪标签噪声放大与模态漂移,LGCTrack 提出了编码器分层局部协同(HLC)与转向阶段全局协同(TGC)的双粒度控制机制,在无需密集人工标注的前提下超越已有自监督方案并逼近全监督性能。

研究背景与动机

单目标跟踪是计算机视觉的基础任务,在智能监控、机器人与自动驾驶中具有关键应用。近年来基于 Transformer 架构与大规模可见光数据集的单模态跟踪器取得了长足进步,但在低照度、严重阴影与极端外观形变等恶劣成像条件下,仅依赖可见光(RGB)容易丢失目标。引入对光照不敏感的热红外(TIR)模态构成 RGB-T 双模态跟踪,能够有效在互补波段间实现全天候稳定定位。然而,现存表现优异的 RGB-T 跟踪器高度依赖逐帧密集的人工包围框标注,多模态长视频标注代价极其昂贵,极大限制了模型的大规模扩展能力。

这一瓶颈促使学界转向自监督 RGB-T 跟踪的研究,主流范式基于前向-后向循环一致性(forward-backward cycle-consistency),利用视频时序连续性自生成伪标签实现自闭环验证。但在真实的跨模态跟踪场景中,RGB 与 TIR 的可靠性在不同时间片段具有极强的动态差异:当某一模态遭遇热交叉(thermal crossover)或可见光过曝时,无监督的伪标签质量急剧下降。传统跨模态交互若不加甄别地进行特征融合,不可靠的模态噪声便会在双流网络之间交叉传播,并在前向跟踪转向后向验证的关键节点引发目标语义崩溃,最终导致循环检验误差雪崩。

解决循环自监督 RGB-T 跟踪的核心矛盾在于:既需要在特征抽取时充分挖掘互补信息,又要严防不可靠模态的主动污染;尤其在由前向转向后向的关键转折时刻,必须锁定目标语义以防全循环漂移。核心 idea:将跨模态协同解耦为编码器层级自适应门控的局部协同(HLC)与前向-后向转折点的全局语义交叉重构协同(TGC),在多粒度闭环控制下自主过滤伪标签噪声并抑制模态漂移。

方法详解

整体框架

LGCTrack 构建在双流 ViT 骨干网络与循环时序自闭环验证机制之上,其总体流水线包含前向跟踪、转向期全局状态重构、后向时序回溯与闭环自监督四个核心步骤。模型在可见光与热红外流中分别维护一组紧凑的目标全局状态 Token \(S=(s^{\mathrm{rgb}}, s^{\mathrm{tir}})\) 与图像 Token。在初始帧 \(t_0\) 给定模板区域后,双流编码器在前向逐帧预测目标包围框,各编码器层通过分层局部协同(HLC)实现可控互补融合;当跟踪推进至尾帧 \(N\) 时,进入关键转向阶段,转向全局协同(TGC)利用跨模态空间注意力重构全局 Token 并将其交叉写入对偶模态分支以初始化反向跟踪;后向跟踪器逆序回溯至起始帧 \(t_0\),通过预测框与初始真实框之间的闭环验证损失驱动端到端参数更新。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入双模态视频序列<br/>RGB与TIR双流输入"] --> B["前向跟踪: 分层局部协同<br/>逐层自适应门控互补交互"]
    B --> C["尾帧转向: 转向阶段全局协同<br/>跨模态注意力重构Global Token"]
    C --> D["跨模态交叉写入初始化<br/>反向时序引导与模态解耦"]
    D --> E["后向逆序跟踪验证<br/>双流网络回溯至初始帧"]
    E --> F["闭环验证损失优化<br/>Focal + GIoU + L1回溯对齐"]

关键设计

1. 分层局部协同(HLC):层级门控的可靠性感知跨模态交互

在自监督前向-后向闭环中,缺乏逐帧人工标注来约束中间特征表示。若两模态之间采用常规的无条件全融合,一旦某一模态出现传感器退化或干扰(如强反光或热背景混叠),错误线索会迅速污染另一路原本清晰的模态。为实现受控的信息交换,HLC 以旁路分支的形式嵌入双流编码器的每一个 Transformer Block 中。具体而言,对第 \(l\) 层中的可见光与热红外特征 \(F_m^{(l)}\)\(m \in \{\mathrm{rgb}, \mathrm{tir}\}\),其对偶模态记为 \(\bar{m}\)),分别投影出各自分支的查询、键、值矩阵。以单模态查询向对偶模态的键值交互捕获跨模态依赖,生成互补表示 \(C_m\)

\[C_m = \mathcal{M}\left(\mathrm{Softmax}\left(\frac{Q_m K_{\bar{m}}^T}{\sqrt{d}}\right) V_{\bar{m}}\right)\]

其中 \(\mathcal{M}(\cdot)\) 为轻量 Linear-GELU 变换。为了动态抑制不可靠线索的侵入,HLC 将原始模态特征与跨模态特征拼接,利用双层 MLP 与 Sigmoid 函数预测逐 Token 的自适应标量门控因子 \(g_m \in [0, 1]\)

\[g_m = \sigma\left(W_{\mathrm{gate}}^m [F_m^{(l)}; C_m]\right)\]

门控因子自适应度量对偶模态的可靠程度。随后结合初始化为 0 的可学习缩放参数 \(\alpha_m\),将门控调控后的跨模态增量以残差形式注入主干流:\(F_m' = F_m^{(l)} + \mathrm{MSA}(\mathrm{LN}(F_m^{(l)})) + \alpha_m \, g_m \odot C_m\),再经由标准 FFN 完成该层更新。该设计在全部 12 层编码器中逐层递进,既最大化挖掘互补特征,又有效隔离了局部坏帧的噪声蔓延。

2. 转向阶段全局协同(TGC):转折点全局 Token 跨模态重构与交叉注入

在闭环自监督跟踪中,转向阶段(即前向末帧向后向首帧切换)是整个循环稳定性的致命阿喀琉斯之踵。前向轨迹末尾各模态累积的局部单模态漂移若直接原样继承给后向跟踪,将沿着逆向回溯路径持续发散放大。TGC 专门作用于前向-后向切换点,其输入为前向终点汇聚了目标紧凑语义的全局 Token \(s_{\mathrm{turn}}^m\) 与当前帧对偶模态的空间图像 Token \(F_N^{\bar{m}}\)。TGC 强制全局 Token 通过交叉注意力机制聚合对偶模态的空间上下文,生成经跨模态校准的全新全局表示 \(\tilde{s}_{\mathrm{turn}}^m\)

\[\tilde{s}_{\mathrm{turn}}^m = \mathrm{Proj}\left(\mathrm{Softmax}\left(\frac{Q(s_{\mathrm{turn}}^m) K(F_N^{\bar{m}})^T}{\sqrt{d}}\right) V(F_N^{\bar{m}})\right)\]

更关键的是,在初始化后向跟踪时,模型摒弃同模态继承,实施对偶交叉注入策略:将 RGB 引导更新得到的全局 Token \(\tilde{s}_{\mathrm{turn}}^{\mathrm{rgb}}\) 注入 TIR 分支作为初始全局指导,而将 TIR 生成的 \(\tilde{s}_{\mathrm{turn}}^{\mathrm{tir}}\) 注入 RGB 分支。这种对偶交叉写入打破了单模态在转向点的误差惯性,迫使网络在端到端闭环下学习双模态互相校验的稳健表征。在推理阶段,该模块直接作为轻量算子承接上一帧全局状态的自校准更新。

损失函数 / 训练策略

训练过程输入长度为 \(N\) 帧的双模态未标注视频片段及首帧初始框 \(b_{t_0}^{gt}\)。前向跟踪递归推进至帧 \(N\),经 TGC 校准后反向逆序跟踪至帧 \(t_0\),得到回溯预测包围框 \(\tilde{b}_{t_0}\)。端到端训练目标仅在闭环终点施加监督,约束回溯结果逼近初始参考框:

\[\mathcal{L} = \mathcal{L}_{\mathrm{cls}}(\tilde{b}_{t_0}, b_{t_0}^{gt}) + \lambda_{\mathrm{giou}}\mathcal{L}_{\mathrm{giou}}(\tilde{b}_{t_0}, b_{t_0}^{gt}) + \lambda_{L_1}\mathcal{L}_1(\tilde{b}_{t_0}, b_{t_0}^{gt})\]

其中分类损失 \(\mathcal{L}_{\mathrm{cls}}\) 为 Focal Loss,边界框回归分别使用 GIoU 损失与 Smooth-L1 损失,权重沿用标准设置设为 \(\lambda_{\mathrm{giou}}=2\)\(\lambda_{L_1}=5\)。模型以 SSTrack 预训练权重初始化,采用 AdamW 优化器(学习率 \(10^{-4}\),权重衰减 \(10^{-4}\)),在 4 张 RTX 4090 或国产 Atlas 800T A3 上训练 10 个 epoch,每个 epoch 采样 \(3 \times 10^4\) 个训练视频对。

实验关键数据

主实验

在三个标准 RGB-T 跟踪基准(LasHeR、RGBT234、GTOT)上进行定量评测。LGCTrack 在全部自监督方法中均以显著优势刷新 SOTA,且大幅收窄与全监督前沿跟踪器的性能代差,在 GTOT 上甚至超越了部分全监督方法(如 CAFormer)。

表 1:三大 RGB-T 基准评测对比(截取原论文 Table 1 核心自监督方法与代表性全监督基线)

方法 来源 监督类型 LasHeR PR (%) LasHeR NPR (%) LasHeR SR (%) RGBT234 PR (%) RGBT234 SR (%) GTOT PR (%) GTOT SR (%)
APFNet AAAI 22 Full 50.0 - 36.2 82.7 57.9 90.5 73.7
CMD CVPR 23 Full 59.0 54.6 46.4 82.4 58.4 89.2 73.4
CAFormer AAAI 25 Full 70.0 66.1 55.6 88.3 66.4 91.8 76.9
S2OTFormer TOMM 24 Self 39.8 - 29.5 68.4 47.7 83.1 70.2
GDSTrack IJCAI 25 Self 45.9 39.3 35.4 70.9 48.5 73.9 59.8
SSTrack AAAI 25 Self 54.8 49.8 38.4 78.5 55.8 79.4 65.3
LGCTrack (本文) ECCV 2026 Self 59.5 55.3 45.7 84.7 62.0 91.9 77.6

注:相比自监督 SOTA 方法 SSTrack,LGCTrack 在大尺度基准 LasHeR 上实现 PR +4.7%、NPR +5.5%、SR +7.3% 的全面飞跃;相比 GDSTrack,LasHeR PR 提升达 13.6 个绝对百分点。

消融实验与架构分析

表 2:核心模块与交互设计消融(汇总原论文 Table 3 与 Table 4)

实验组别 配置 / 变体 LasHeR PR (%) LasHeR NPR (%) LasHeR SR (%) RGBT234 PR (%) RGBT234 SR (%) 说明
模块贡献 (Tab. 3) Baseline (独立单模态) 54.8 49.8 38.4 78.5 55.8 仅自监督单流循环
模块贡献 (Tab. 3) 仅加入 HLC 58.3 54.1 43.9 81.4 59.7 逐层特征交互增益明显
模块贡献 (Tab. 3) 仅加入 TGC 55.7 51.0 42.6 81.3 57.4 转向点语义校准有效
模块贡献 (Tab. 3) 完整 LGCTrack (HLC + TGC) 59.5 55.3 45.7 84.7 62.0 双粒度协同达到最佳
交互设计 (Tab. 4) Vanilla 顶层直接相加融合 58.3 53.3 41.7 80.8 57.3 浅层融合易传导噪声
交互设计 (Tab. 4) HLC (移除动态门控) 58.2 54.2 44.4 83.0 60.4 缺乏可信度筛选略有退化

表 3:转向阶段 TGC 更新策略与推理时效分析(汇总原论文 Table 6 与 Table 8)

分析维度 配置 / 方法 LasHeR PR (%) RGBT234 SR (%) 参数量 (M) 计算量 FLOPs (G) 运行帧率 (FPS)
TGC 转向更新策略 (Tab. 6) 直接交换 Global Token (Dir.) 58.9 60.8 - - -
TGC 转向更新策略 (Tab. 6) 经 TGC 校准后写回同模态 (Self) 58.4 60.2 - - -
TGC 转向更新策略 (Tab. 6) TGC 校准后交叉注入对偶模态 (Cross) 59.5 62.0 - - -
复杂度与速度对比 (Tab. 8) GDSTrack (IJCAI 25, Self) 45.9 48.5 202.1 129.4 15.0
复杂度与速度对比 (Tab. 8) STTrack (AAAI 25, Full) - - 128.3 181.2 42.4
复杂度与速度对比 (Tab. 8) LGCTrack (本文) 59.5 62.0 167.1 178.4 52.0

关键发现

  • 双粒度协同缺一不可:消融显示单加 HLC 让 LasHeR SR 提升 5.5%(从 38.4% 到 43.9%),单加 TGC 提升 4.2%(至 42.6%),二者结合进一步跃升至 45.7%,证实特征层渐进交互与转向阶段全局锁定具有强正交互补性。
  • 动态门控的防御价值:若去掉 HLC 的动态门控机制,LasHeR PR 由 59.5% 跌至 58.2%,RGBT234 SR 由 62.0% 跌至 60.4%,表明在无人工强监督条件下,无差别吸收另一模态的信息容易被局部失效模态带偏。
  • 对偶交叉写入构建有效约束:Tab. 6 证实将转向全局 Token 写回自身模态(58.4% PR)明显弱于交叉写入对偶模态(59.5% PR)。交叉注入打破了单模态分支的自恋惯性,强制要求可见光分支能理解热红外的上下文线索。
  • 高帧率兼具实用性:LGCTrack 在 RTX 4090 上跑出了 52.0 FPS 的实时速度,远高于自监督前代 GDSTrack(15.0 FPS),在保持高效算力的同时实现了轻量化部署。

亮点与洞察

  • 闭环系统中的两级防御设计:论文敏锐抓住了循环自监督在长时序中必然遭遇的两大痛点——特征抽取时的“模态互扰”与回溯转折点的“语义突变”,用 HLC 与 TGC 在局部与全局层级形成闭环咬合,逻辑极其严密。
  • 反直觉的对偶交叉写入策略:TGC 并没有采用让各模态自顾自校准的思路,而是将 RGB 生成的语义赋予 TIR 分支回溯、TIR 语义赋予 RGB 分支回溯。这种“背靠背”监督倒逼跨模态特征空间达成真正的本质自对齐。
  • 通用循环自监督迁移潜力:该机制不仅适用于可见光-红外跟踪,其“层级门控过滤 + 转向端点语义交叉重构”范式可直接迁移至可见光-深度(RGB-D)、事件相机(RGB-E)以及视频跨视角跟踪等任何具备多源异构互补特征的时序自监督任务中。

局限与展望

  • 极端双盲场景下的失效风险:若目标同时遭遇全黑且强背景热源混叠(双模态同时失效),自监督闭环将失去任何可靠针尖参照物,导致整段伪标签崩溃。
  • 固定视频切片窗口假设:实验中前向-后向回溯多固定在相对规整的短视频序列内(如特定批次帧长),缺乏对上千帧长时间跨度中大尺度目标形变与长期出视野重新进入的自适应重拾机制。
  • 未来改进方向:可考虑将轻量级时空记忆库(Memory Bank)融入闭环验证,在回溯时参考历史高置信度多帧模板,而非仅靠首尾两点形成闭环。

相关工作与启发

  • vs SSTrack (AAAI 2025):SSTrack 主要探索实例级对比学习与时序循环关联,但在跨模态交互时缺乏细粒度的可靠性度量。LGCTrack 在其骨干基础上增加了层级门控 HLC 和转折点全局重构 TGC,在 LasHeR 上取得了 +7.3% 的巨大成功率代差。
  • vs GDSTrack (IJCAI 2025):GDSTrack 是早期的自监督 RGB-T 探索者,但存在严重的推理时延(15 FPS)和模态漂移累积问题。LGCTrack 通过双粒度协同有效压制噪声,精度大幅领先 10~16%,帧率更是飙升至 52 FPS。
  • vs 全监督方法 (ViPT / CAFormer):全监督依靠海量人工标签修正模态融合权值,而 LGCTrack 证实通过纯粹的时序几何闭环约束与交叉模态互验,无标注自监督表征已能完全抗衡甚至小幅超越全监督模型(如 GTOT 91.9% vs 91.8% PR)。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 创新性地在时序闭环自监督中引入两级协同机制,转折点对偶交叉注入设计亮眼。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖三大主流基准、详尽属性分析、各模块深度消融及真机 Atlas 适配复现。
  • 写作质量: ⭐⭐⭐⭐⭐ 问题定义直切要害,架构与公式推导干净自洽,图表组织逻辑清晰。
  • 价值: ⭐⭐⭐⭐☆ 大幅缩小了自监督 RGB-T 跟踪与全监督跟踪的鸿沟,代码开源具有极高工程实用性。