跳转至

FusionTrack: Collaborative Multi-Object Tracking with Arbitrary Multi-UAVs

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/aircas501/FusionTrack
领域: 视频理解
关键词: 多视角多目标跟踪、多无人机协同、跨视角关联、端到端Transformer、层次聚类

一句话总结

针对任意无人机集群下视场动态重叠、目标频繁进出与视角外观剧烈形变挑战,FusionTrack 抛弃传统“先单视角跟踪后关联”的割裂范式,通过轨迹记忆池与轨迹身份池的双向特征融合联合优化跟踪与重识别,并结合带空间近邻过滤的视点感知层次聚类实现高精度跨视角协同追踪。

研究背景与动机

无人机集群多目标跟踪(MVMOT)是城市精细化治理与低空安防的核心技术。然而单架无人机受限于视场狭窄以及机动飞行带来的本征运动扰动,在开阔复杂场景下极易因目标尺度突变、动态遮挡而丢失轨迹。引入多机协同虽能扩展感知时空边界,但在开放低空环境中,无人机飞行航迹不受约束,导致各机视场重叠区域动态漂移、视界边界任意进出,且视角高度俯仰角差异引发严重的几何形变与外观不一致,给跨相机身份一致性关联带来了极大挑战。

现有 MVMOT 基准(如 MvMHAT、CityFlow、DIVOTrack)大多依赖固定机位或预先标定的相机拓扑,无法如实反映动态机群任意机位下的复杂拓扑演化。方法层面,绝大多数方案沿用“先跟踪后跨视角匹配”的两阶段范式(如基于 ByteTrack 生成单视角 tracklet,再依靠独立 ReID 提取特征或依赖单应性矩阵与矩阵分解关联)。此类串行流程具有不可逆的级联误差放大效应:单机漂移与 ID 切换会直接摧毁全局关联,而跨视角关联推理阶段又无法反哺或修正单视角的跟踪预测。

本文从 Transformer 的端到端目标查询表征机制切入,打破跟踪与重识别的割裂壁垒。核心 idea:构建轨迹记忆池与全局轨迹身份池的双向融合机制(OFM),利用跨视角全局身份先验反哺单机检测跟踪 queries 抑制漂移,同时结合带空间近邻几何过滤的视点感知层次聚类(VHC),在统一闭环中实现任意动态视角的协同跟踪。

方法详解

整体框架

FusionTrack 包含单机特征提取、单视角检测与跟踪解码器、轨迹记忆池(Tracklet Memory Pool, TMP)、轨迹身份池(Trajectory Identity Pool, TIP)、目标融合模块(OFM)以及推理阶段的视点感知层次聚类(VHC)。

输入为 \(C\) 个同步无人机视角的视频帧 \(I = \{I_t^c\}_{c=1,t=1}^{C,T}\)。单机采用 ResNet-50 骨干网络配合 Transformer 编码器提取特征。单视角跟踪器通过检测解码器输出检测嵌入 \(E_D^t\),与上一时刻活跃轨迹查询 \(Q_T^{t-1}\) 拼接后输入跟踪解码器更新轨迹查询 \(Q_T^t\)。随后进入双向特征融合:一方面利用跨帧时间衰减注意力和轻量投影将近期轨迹查询聚合为判别性 ReID 特征 \(F_{id}^t\) 并动量更新至全局 TIP;另一方面通过跨视角融合将 TIP 的全局跨机身份表征逆向投影并注入当前单视角轨迹查询,形成闭环互促。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}, 'subGraphTitleMargin': {'top': 8, 'bottom': 16}}}%%
flowchart TD
    A["多无人机同步输入帧<br/>C 个视角图像序列"] --> B["ResNet-50 + 编码器<br/>多尺度特征提取"]
    B --> C["单视角跟踪与检测解码<br/>检测与轨迹 Query 迭代"]
    C --> D["双向轨迹与身份池融合<br/>TMP 时序聚合与 TIP 全局更新"]
    D --> E["跨帧与跨视角双向自适应注入<br/>OFM 特征双向投影与闭环修正"]
    E --> F["视点感知层次聚类推理<br/>VHC 掩码约束+近邻过滤+时序投票"]
    F --> G["协同跟踪输出<br/>单机轨迹与全局一致身份"]

关键设计

1. 双向轨迹与身份池融合:打破单视角跟踪与全局跨机 ReID 的单向割裂

单视角跟踪查询侧重于局部时空连续性平滑,而跨机多目标关联则高度依赖对视角外观突变不敏感的全局判别性特征。为此,系统设立轨迹记忆池(TMP)维护长度为 \(\tau\) 的滑动时间窗口缓存近期轨迹查询 \(\{Q_T^{t-\tau}, \ldots, Q_T^t\}\)。通过轻量线性映射 \(\phi_1\) 将局部跟踪空间映射到重识别子空间,并由多层前馈网络 \(f\) 聚合时序上下文生成 ReID 嵌入 \(F_{id}^t = f(\mathrm{Concat}(\{\phi_1(Q_T^{t-\tau}), \ldots, \phi_1(Q_T^t)\})) \in \mathbb{R}^d\)。在全局层面维护轨迹身份池(TIP),利用动量规则平滑跨时序与跨视角的全局身份表达:\(F_R^t = \mu F_R^{t-1} + (1-\mu) F_{id}^t\)。这种解耦又联动的记忆池架构,为双向协同提供了稳定的特征承载容器。

2. 跨帧与跨视角双向自适应注入:时空上下文与跨机先验闭环反哺

在目标融合模块(OFM)中,首先执行跨帧时序融合。当前轨迹查询 \(Q_T^t\) 作为 Query,与 TMP 历史查询进行交叉注意力交互。为了体现近期观测权重大于远期记忆的客观规律,引入基于时间差 \(\Delta t\) 的指数衰减自适应加权机制:

\[W = \exp(-\alpha \cdot \Delta t)\]

通过加权缩放点积注意力 Softmax 计算融合特征,抑制遮挡与模糊期的特征污染。紧接着执行跨视角逆向融合:从全局 TIP 中提取各机多视角共享的身份表征平均值 \(\mathrm{Avg}(F_R^t|_{1}^C)\),与单机轨迹查询拼接后,经逆向投影变换 \(\phi_2\) 映射回跟踪特征空间更新轨迹查询:

\[Q_T^{t''} = Q_T^t + \phi_2(\mathrm{Concat}(Q_T^t, \mathrm{Avg}(F_R^t|_{1}^C)))\]

这一操作使单机轨迹预测获得了来自其它协同无人机的全局视觉支撑,当某视角无人机遭遇树木遮挡或强逆光时,其他优质视角的身份上下文可主动矫正其单机跟踪漂移。

3. 视点感知层次聚类推理:几何拓扑近邻过滤与滑动窗口投票

在推断阶段,直接基于余弦相似度匹配容易陷入局部最优与多对一冲突。视点感知层次聚类(VHC)设计了严格的双重排他规则:规则一限制同相机同帧内的物体距离为无穷大(掩码 \(M_1\) 禁止机内虚假自匹配);规则二确保已配对目标不会与其他视角的冗余候选重复匹配。算法先基于互近邻 Top-K (\(k=5\)) 构造稀疏候选图 \(M_2\),大幅缩减全局聚类耗时。

为过滤外观极其相似(如多辆同色白车)引起的跨视角匹配混淆,提出空间近邻过滤机制(NFM):对于候选匹配对 \((i, j)\),考察二者在各自画面中的空间局部邻域点集 \(\mathcal{N}(i)\)\(\mathcal{N}(j)\),要求两集合间已配对近邻比例超过阈值 \(\delta\)(大于 50%)才保留该边,利用空间群聚刚性剔除离群孤立误匹配。最终,引入滑动窗口投票机制(SWV,窗口尺寸 5),只有当连续历史帧中超过半数支持该全局身份跳变时才正式更新 ID,从根本上压制了偶发性抖动与闪烁漂移。

损失函数 / 训练策略

为保障端到端优化稳定性,采取三阶段递进式训练策略:前 20 轮仅监督单视角跟踪分支(\(\mathcal{L}_T = \mathcal{L}_{cls} + \mathcal{L}_{reg} + \mathcal{L}_{giou}\));随后的 20 轮引入跨视角 ReID 分支;最后 60 轮进行全模块联合优化。总损失采用基于同方差不确定性自适应平衡机制:

\[\mathcal{L}_{total} = e^{-\omega_1}\mathcal{L}_T + e^{-\omega_2}\mathcal{L}_R + \omega_1 + \omega_2\]

其中 \(\mathcal{L}_R = \mathcal{L}_{id} + \mathcal{L}_{trip} + \mathcal{L}_{rc}\)。特别地,为防止双向投影映射 \(\phi_1\)\(\phi_2\) 出现特征空间退化,设计了双向循环重建正则化损失:

\[\mathcal{L}_{rc} = \frac{1}{N} \left( \| Q_T^t' - \phi_2(\phi_1(Q_T^t')) \|_2^2 + \| R_T^t - \phi_1(\phi_2(R_T^t)) \|_2^2 \right)\]

有力保障了跟踪隐空间与重识别特征空间在前向和逆向转换时的高度自洽。

实验关键数据

主实验

在本文提出的任意视角无人机集群基准 MDMOT 以及 4 个经典跨视角多目标跟踪公开数据集(CAMPUS、WILDTRACK、MvMHAT、DIVOTrack)上与现有代表性方法进行了全面评测。在 MDMOT 上,FusionTrack 相比之前的 SOTA 方法取得了明显突破。

数据集 方法 CVMA (↑) CVIDF1 (↑) 备注
MDMOT OSNet 50.1 45.5 传统外观 ReID
MDMOT Strong 52.3 51.4 强基线 ReID
MDMOT Citytrack 57.3 56.1 多相机跟踪
MDMOT MvMHAT 78.8 63.7 自监督多视角跟踪
MDMOT CrossMOT 78.5 72.9 协同跟踪基线
MDMOT GMT 79.9 73.8 此前最强多视角跟踪方法
MDMOT FusionTrack (本文) 81.8 75.5 较 GMT 提升 +1.9 / +1.7
CAMPUS GMT / 本文 66.4 / 68.6 66.8 / 67.5 提升 +2.2 / +0.7
WILDTRACK GMT / 本文 61.7 / 62.5 72.0 / 72.3 提升 +0.8 / +0.3
MvMHAT GMT / 本文 94.1 / 94.8 95.6 / 95.9 提升 +0.7 / +0.3
DIVOTrack GMT / 本文 74.5 / 74.8 73.2 / 77.5 CVIDF1 大幅提升 +4.3

消融实验

在 MDMOT 基准上逐模块剖析训练阶段(跨帧时序融合、跨视角身份注入、循环重建损失)与推理阶段(VHC 层次聚类、SWV 时序投票、NFM 局部近邻过滤)对多视角跟踪准确率的影响(对应原论文 Table 4):

配置 / 实验阶段 训练组件组合 推理组件组合 CVMA (↑) CVIDF1 (↑) 说明
Base 训练模型 无跨帧 / 无跨视角 / 无 \(\mathcal{L}_{rc}\) VHC + SWV + NFM 76.5 66.8 缺乏特征融合与正则,较完整模型下降 -5.3 / -8.7
+ 跨帧融合 引入时序加权注意力 VHC + SWV + NFM 78.8 72.2 时序长程记忆大幅增强时序身份连贯性
+ 跨视角融合 跨帧 + 跨视角逆向注入 VHC + SWV + NFM 79.5 74.3 多机跨视场互补提升表征判别力
完整训练 (w/o 推理约束) 全部训练模块完整 仅基础 VHC 77.1 72.3 无后处理抑制,聚类产生歧义误配
+ SWV 投票机制 全部训练模块完整 VHC + SWV 79.2 74.1 时序滑动窗口平抑偶发 ID 切换
对比全局匹配基准 全部训练模块完整 匈牙利匹配 + SWV + NFM 78.5 73.3 传统二分图匹配面对复杂聚类逊于 VHC
Full Model (完整方案) 跨帧 + 跨视角 + \(\mathcal{L}_{rc}\) VHC + SWV + NFM 81.8 75.5 各项模块协同达到最优性能

关键发现

  • 在单视角跟踪(SVT)任务中(原论文 Table 3),FusionTrack 同样展现出领先优势:在 Transformer 系列追踪器中取得最佳综合性能,达到 88.75 MOTA、89.22 MOTP、93.06 IDF1 与 84.88 HOTA,同时将身份跳变错误(IDS)压缩至 81 次(大幅低于 TransTrack 的 202 次与 COMOT 的 101 次),证明跨机特征闭环对抑制单机漏检与漂移有实质改善。
  • 循环重建正则化损失 \(\mathcal{L}_{rc}\) 对跨视角身份判别力提升至关重要:加入后使 CVMA 从 79.5 跃升至 81.8(+2.3),CVIDF1 从 74.3 提升至 75.5(+1.2),表明正逆向双射约束有效避免了高维查询向 ReID 特征投影时的坍缩失真。
  • 局部空间近邻一致性过滤(NFM)与滑动窗口投票(SWV)对于解决动态机群视场晃动下的多机模糊匹配具有互补性,二者结合让 VHC 相比孤立聚类提高 4.7 点 CVMA 与 3.2 点 CVIDF1。

亮点与洞察

  • 闭环双向特征互促机制:不同于以往单向传递检测结果给 ReID 模型的做法,FusionTrack 通过 OFM 将全局轨迹身份特征直接逆向投影并叠加到检测跟踪 queries 中,让下游全局识别信息实时反哺上游边界框跟踪。
  • 空间拓扑近邻几何过滤(NFM):利用刚性车流或行人行进中与周围伴随目标的相对拓扑关系作为第二重几何校验,极其巧妙地破除了多机航拍下“同车型同颜色”难以纯凭外观区分的 ReID 瓶颈。
  • 构建高密度任意视角机群基准 MDMOT:填补了机群动态无约束航行与视角动态重叠领域的空白,单帧平均包含 20.34 个目标,相比此前数据集具备更高的密度与时空运动复杂度。

局限与展望

  • 推理延迟与算力瓶颈:单卡 NVIDIA A800 上系统综合帧率约为 3.9 FPS,主要时延开销集中于多路单视角 Transformer 解码器(占比超 80%),尚未达到机载嵌入式计算平台的超轻量实时要求。
  • 极端视角与恶劣光照适应性:尽管提出了近邻拓扑校验,但在无人机执行大角度俯仰滚转机动或夜间高噪点低照度场景下,局部拓扑结构的剧烈变形依然可能造成近邻集合失准。
  • 未来方向:探索并行多视角解耦追踪管线与轻量化查询蒸馏,并尝试融合无人机自带的 GPS/IMU 飞控位姿先验辅助粗对齐。

相关工作与启发

  • vs. ByteTrack / FairMOT 等单机跟踪方案:传统单视角方法在遇到大面积树冠遮挡或超出单机视野时必然造成轨迹断裂;本文利用无人机网络跨机视场拼接与 TIP 身份池,实现了目标从单机盲区重新驶出后的毫秒级无缝重捕获。
  • vs. GMT / CrossMOT 等两阶段多机协同方案:以往方法多采用固定的单应性映射变换或离散的二阶段匈牙利匹配,当无人机连续颠簸飞行破坏水平面假设时即刻失效;FusionTrack 构建端到端全局闭环表征与 VHC 聚类,免除了苛刻的单应矩阵对齐预设。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 首次针对无约束动态机群 MVMOT 建立基准,提出双向闭环特征互促机制。
  • 实验充分度: ⭐⭐⭐⭐⭐ 覆盖自建大基准及 4 个经典公开数据集,单视角与多视角指标消融非常详实。
  • 写作质量: ⭐⭐⭐⭐⭐ 流程图逻辑严谨清晰,数学表达克制精准,问题背景与机制阐述条理透彻。
  • 价值: ⭐⭐⭐⭐☆ 为低空无人机集群协同感知、车流安防管控提供了行之有效且开源的端到端范式。