跳转至

SelfMOTR: Revisiting MOTR with Self-Generating Detection Priors

会议: ECCV 2026
论文: ECCV 原文
代码: https://medem23.github.io/SM
领域: 目标检测
关键词: 多目标跟踪、端到端跟踪、自生成检测先验、查询干扰、注意力质量

一句话总结

针对端到端 Transformer 多目标跟踪中检测与关联查询在联合解码时的相互干扰问题,SelfMOTR 提出无需外部检测器的自生成检测先验方案,通过轻量级检测前向计算生成内生 4D 锚框与置信度调制提案,在 DanceTrack 与 Bird Flock Tracking 上刷新了端到端跟踪纪录。

研究背景与动机

基于 Transformer 的端到端多目标跟踪(MOT)架构(如 MOTR)通过引入时序查询传递机制,将新目标发现(检测)与轨迹延续(关联)整合到统一的可学习流程中,免除了传统 tracking-by-detection 范式中繁复的人工启发式规则与离群组件微调。然而,这类端到端模型长期面临两大核心痛点:一是其原生检测精度显著落后于同等数据训练的独立目标检测器;二是联合优化检测与关联导致了严重的监督失衡,解码器中的跟踪查询(Track Queries)往往主导了绝大部分正样本标签,导致检测查询(Detect Queries)表征训练不足、对新目标的捕捉能力劣化。

现有工作(如 MOTRv2、MOTRv3)通常依赖外部预训练检测器(如 YOLOX)引入硬性检测框或软标签蒸馏先验,或者像 CO-MOT 那样引入复杂的 shadow queries 与竞争标签分配机制。外部检测器的引入固然有效缓解了解码负担,却打破了端到端模型的自包含性与紧凑性,引入了巨大的额外参数量与特征不对齐问题。然而,一个耐人寻味的经验事实是:如果在推理阶段将 MOTR 的跟踪查询完全移除,模型本身的检测 mAP 会呈现出爆发式回升(提升 6.3 AP)。这强力证明了端到端 Transformer 的瓶颈并非表征容量不足,而是联合解码时检测查询与跟踪查询之间的直接注意力干扰。

从解码器内部的交互动力学来看,常规联合解码会导致严重不均衡的自注意力分布——部分检测查询过早地被现有轨迹主导(形成类似 LLM 中的注意力沉聚现象),丧失独立发现新目标的能力;另一部分检测查询则极度局域化,无法获得充分的场景上下文。本文的切入角度是:与其舍近求远引入异构外部检测器,不如直接在模型内部解耦候选发现与关联。核心 idea:利用模型自身共享的编码器与轻量化检测前向过程,自生成与解码器参数完全对齐的 4D 空间检测先验,并将其作为自提案查询与跟踪查询联合输入解码器进行优化与关联,实现纯内生、无检测器依赖的端到端解耦跟踪。

方法详解

整体框架

SelfMOTR 的核心逻辑是将单帧的处理拆解为“先自生成检测先验、再联合关联解码”的两步紧凑流程,同时保持主干网络与 Transformer 编码器、解码器的权重共享。给定当前视频帧 \(t\),模型首先抽取图像多尺度特征,并在不引入历史跟踪查询的前提下,运行一次轻量级的纯检测前向过程,提取出高质量的自生成候选边界框。接着,经过置信度筛选与正弦位置编码调制后,将生成的提案查询与从上一帧通过查询交互模块(QIM)传递而来的跟踪查询拼接,送入共享解码器完成最终的多任务精细回归、分类与时序关联。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["当前帧图像与 Backbone 特征"] --> B["自生成检测先验<br/>纯检测前向生成 4D 锚框"]
    B --> C["置信度调制提案查询<br/>4D 锚框位置 + 周期编码内容"]
    C --> D["时序跟踪查询拼接<br/>结合上一帧 QIM 传递的跟踪查询"]
    D --> E["共享解码器联合优化<br/>解耦空间发现与轨迹关联"]
    E --> F["当前帧轨迹与新目标输出"]

关键设计

1. 自生成检测先验:解耦空间候选发现与时序关联 联合解码模式下,检测查询在尚未形成明确空间假设前便与高响应的跟踪查询发生自注意力交互,极易被轨迹特征同化而遗漏新目标。为此,SelfMOTR 设计了完全内生的纯检测前向分支:在编码器特征之上,仅输入可学习检测查询进行单次前向解码,输出 \(N_{\mathrm{det}}\) 个初始预测 \(\hat{\mathbf{y}}_k = (\hat{\mathbf{b}}^{\mathrm{det}}_k, \hat{c}^{\mathrm{det}}_k)\),其中 \(\hat{\mathbf{b}}^{\mathrm{det}}_k \in \mathbb{R}^4\) 表示 4D 锚框坐标,\(\hat{c}^{\mathrm{det}}_k \in [0, 1]\) 为前背景分类置信度。由于该分支完全屏蔽了历史跟踪查询的干扰,模型内隐的强大学习容量得以彻底释放,能够在当前帧建立起无偏的新目标分布假设。

2. 置信度调制提案查询:构建原生对齐的输入 Token 为了将无偏的检测先验无缝转化为解码器可识别的提案 Token,模型设定置信度阈值 \(c_{\mathrm{prop}}\)(默认设为保守宽松的 0.05 以保证召回率),筛选出高置信度预测集 \(\mathcal{Q} = \{(\hat{\mathbf{b}}^{\mathrm{det}}_k, \hat{c}^{\mathrm{det}}_k) : \hat{c}^{\mathrm{det}}_k > c_{\mathrm{prop}}\}\)。每个筛选出的目标被转化为一个显式提案查询 Token \(\mathbf{z}^{\mathrm{prop}}_k\):其空间位置部分直接复用预测的 4D 锚框,即 \(\mathbf{z}^{\mathrm{prop}}_{\mathrm{pos},k} = \hat{\mathbf{b}}^{\mathrm{det}}_k\);而内容表征部分则由全局共享的可学习提案查询 \(\mathbf{q}^{\mathrm{prop}}\) 与置信度的正弦-余弦位置编码(PE)共同调制合成: $\(\mathbf{z}^{\mathrm{prop}}_{\mathrm{content},k} = \mathbf{q}^{\mathrm{prop}} + \mathrm{PE}(\hat{c}^{\mathrm{det}}_k)\)$ 此外,系统额外保留一个固定的小容量可学习锚框集合(\(N_{\mathrm{learned}}=10\)),用于兜底未被初始检测捕获的潜在边缘实例。该设计使得提案查询天然具备精准的几何初始化和置信度线索,且参数空间与主干网络完全同源,无需外部模型映射。

3. 共享解码器联合优化:平衡注意力质量与双重监督 在时序跟踪阶段,将置信度调制的自提案查询 \(\mathcal{Q}^{\mathrm{prop}}_t\) 与来自上一帧的跟踪查询 \(\mathcal{Q}^{\text{track}}_{t-1}\) 直接拼接,送入完全共享参数的 Transformer 解码器。此时,解码器不再需要分心于在庞大的特征图上“盲猜”新目标位置,其内部自注意力得以从失衡的极端状态解脱出来。论文通过提出的 跟踪注意力质量(Track Attention Mass, \(\tilde{M}_i\)) 诊断指标证实,常规 MOTR 的检测查询注意力在后期层级呈现双极化塌缩(要么被跟踪查询过度主导,要么彻底脱离全局上下文,且香农熵严重下降),而 SelfMOTR 使得注意力质量稳定分布在健康的 0.4 适度区间且维持高达 0.85 的香农熵。全流程采用联合多任务损失端到端训练: $\(\mathcal{L} = \mathcal{L}_{\text{MOTR}} + \lambda_{\text{prop}} \mathcal{L}_{\text{prop}}\)$ 其中 \(\mathcal{L}_{\text{prop}}\) 由 Focal Loss、\(\ell_1\) 边界框损失和 GIoU 损失组成,超参数 \(\lambda_{\text{prop}} = 0.5\)。

损失函数 / 训练策略

模型采用两阶段协同端到端优化。第一阶段检测分支利用当前帧真值框进行匈牙利二分图匹配,计算 \(\mathcal{L}_{\text{prop}}\);第二阶段跟踪分支利用连续多帧片段(\(N_{\text{clip}}=5\))计算标准 MOTR 时序集体平均损失(CAL),涵盖跟踪目标跨帧匹配的分类与框回归误差。优化器选用 AdamW,权重衰减设为 \(1 \times 10^{-4}\),主干网络学习率设为 \(2 \times 10^{-5}\),Transformer 模块学习率设为 \(2 \times 10^{-4}\)。在 DanceTrack 上联合 CrowdHuman 合成伪轨迹预训练 10 个 epoch,并在第 8 epoch 衰减学习率;进入跟踪阶段时保留 QIMv2 查询交互机制与去噪查询(Query Denoising)策略。

实验关键数据

主实验

在非线性运动极端复杂、外观高度一致的 DanceTrack 测试集上,SelfMOTR 在完全无需外部检测器的端到端(End-to-End)阵营中取得了极具竞争力的性能表现,并大幅领先经典两阶段与图结构方法。同时在高度动态的飞鸟集群跟踪(BFT)与高遮挡密集动物跟踪(AnimalTrack)上创下同类最佳纪录。

方法类型 模型 HOTA ↑ DetA ↑ AssA ↑ IDF1 ↑ MOTA ↑
非端到端 ByteTrack 47.4 71.0 32.1 53.9 89.6
非端到端 OC-SORT 55.1 80.3 38.3 54.6 92.0
非端到端 MOTRv2(带 YOLOX-X) 69.9 83.0 59.0 71.7 91.9
端到端 TransTrack 45.5 75.9 27.5 45.2 88.4
端到端 MOTR(基线) 54.2 73.5 40.2 51.5 79.7
端到端 MeMOTR 68.5 80.5 58.4 71.2 89.9
端到端 SambaMOTR 67.2 78.8 57.5 70.0 88.1
端到端 MOTRv3 68.3 – – 70.1 91.7
端到端 CO-MOT 69.4 82.1 58.9 71.9 91.2
端到端 SelfMOTR(本文) 69.2 80.9 59.3 72.5 89.9

在极度考验复杂非线性运动的跨域数据集上,SelfMOTR 展现了卓越的鲁棒性:在 BFT 数据集上达成 71.1 HOTA(超越所有对比方法包括非端到端 SOTA),在 AnimalTrack 上达成 45.5 HOTA 与 53.7 IDF1(较 TrackFormer 提升高达 +14.5 HOTA)。

消融实验

1. 检测-关联冲突消融(验证查询相互干扰的消除效果)

模型方案 引入跟踪查询(Track Q) AP ↑ AP50 ↑ AP75 ↑ 推理帧率(FPS)
MOTR 基线 ✗ 66.3 85.5 70.7 –
MOTR 基线 ✓ 60.0 (-6.3) 78.1 (-7.4) 63.7 (-7.0) 24.8
SelfMOTR(本文) ✗ 71.2 90.6 76.6 –
SelfMOTR(本文) ✓ 70.9 (-0.3) 89.4 (-1.2) 76.3 (-0.3) 20.7

2. 解码器参数共享 vs 独立双解码器对比(DanceTrack 测试集)

解码器设计 HOTA ↑ DetA ↑ AssA ↑ IDF1 ↑ MOTA ↑
独立双解码器(Dual Decoder) 66.2 80.6 54.5 69.1 90.0
权重共享解码器(SelfMOTR) 69.2 80.9 59.3 72.5 89.9

3. 先验注入机制形式消融(DanceTrack 验证集)

先验注入策略 HOTA ↑ DetA ↑ AssA ↑ IDF1 ↑ MOTA ↑
MOTR 基线 51.2 68.8 38.4 49.1 74.4
+ 检测预训练全模型迁移 51.5 (+0.3) 69.0 (+0.2) 38.7 (+0.3) 49.4 (+0.3) 73.8 (-0.6)
+ 仅冻结查询预训练(Query Pret.) 52.7 (+1.5) 68.0 (-0.8) 41.1 (+2.7) 51.9 (+2.8) 72.5 (-1.9)
+ 教师检测蒸馏(Distillation) 52.1 (+0.9) 72.0 (+3.2) 37.9 (-0.5) 50.8 (+1.7) 80.1 (+5.7)
+ 显式锚框提案(Anchor Proposal) 58.0 (+6.8) 71.2 (+2.4) 47.5 (+9.1) 59.5 (+10.4) 79.2 (+4.8)

关键发现

  • 冲突近乎归零:基线 MOTR 加入跟踪查询后 AP 发生剧烈滑坡(\(-6.3\) AP),而 SelfMOTR 的性能衰减仅为微小的 \(-0.3\) AP,充分表明自生成提案使检测分支与关联分支达成解耦和谐。
  • 权重共享优于双解码器:与采用独立参数生成提案的双解码器结构相比,共享解码器参数在保持轻量的同时,AssA 提升达 \(+4.8\),IDF1 提升 \(+3.4\)。这证实自生成先验在相同的特征投影空间中能建立更好的表征对齐。
  • 浅层检测即可饱和:检测前向过程仅需 3-4 层解码器即可使最终跟踪指标进入平台期,计算开销极低。主干特征仅抽取一次,整体在 Tesla L40S 上可达 20.7 FPS。

亮点与洞察

  • 自包含先验的优雅替代:彻底摆脱了此前 MOTRv2/v3 必须绑死外部大检测器(如 YOLOX 99M 参数)的笨重架构,以仅 42M 的纯 Transformer 紧凑参数量,达到了与两阶段甚至外接先验相当的 SOTA 水平。
  • 注意力质量诊断(Track Attention Mass):借鉴大语言模型注意力沉聚(Attention Sink)现象,形式化定义了检测查询对跟踪查询的注意力占比和归一化香农熵,深刻揭示了多任务 Transformer 查询退化的根本原因。
  • 高度泛化至无外观先验场景:在依赖复杂形变而非纯外观特征的 BFT(飞鸟群)和小规模密集数据 AnimalTrack 上表现尤为突出,证明几何驱动的内生锚框提案在跨物种与复杂运动中具备极强通用性。

局限与展望

  • 纯检测精度略受限于主干容量:相较于搭载重型检测骨干的 MOTRv2,SelfMOTR 的原生提案 AP 仍存在差距(71.2 vs 79.7),导致纯检测 DetA 指标略低于配备百兆级检测器的外部先验方案。
  • 双前向解码时延:虽然主干网络特征无需重复提取,但双 pass 解码依然引入了约 4ms 延迟(24.8 FPS 降至 20.7 FPS)。未来可进一步探索单 pass 内利用前序注意力头自解耦提案的稀疏解码机制。

相关工作与启发

  • vs MOTR / TrackFormer: 传统端到端 Transformer 盲目混叠检测与跟踪查询,造成注意力沉聚与检测塌缩;SelfMOTR 通过内部纯检测前向生成 4D 锚框,保持无外部依赖的同时化解了相互干扰。
  • vs MOTRv2 / MOTRv3: 后者通过引入独立训练的 YOLOX 外部检测器注入检测框与蒸馏监督,大幅增加了系统复杂性与特征失配风险;SelfMOTR 用自身轻量前向替代了外部模型,参数量从 141M 骤降至 42M,且时序关联度更高(AssA 更强)。
  • vs CO-MOT: CO-MOT 采用繁复的 shadow queries 和竞争匹配算法来保留目标候选项;SelfMOTR 从几何锚框生成的根源切入,以直观明了的自提案替换通用查询,管线更加简洁健壮。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 敏锐抓住了 Transformer 内部自潜伏检测能力,首创无外部检测器的自生成检测先验机制。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 DanceTrack、BFT、AnimalTrack 三大典型基准,消融实验详实透彻,诊断分析极具说服力。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,图表信息充沛,引入注意力质量指标洞察深入。
  • 价值: ⭐⭐⭐⭐⭐ 为纯 Transformer 端到端跟踪重新指明了自包含发展路径,具有高度的工程指导与理论参考意义。