Progressively Spiral Mamba Fusion for Multimodal Tracking¶
会议: ECCV 2026
论文: ECCV 原文
领域: 视频理解
关键词: 多模态目标跟踪 / 状态空间模型 / Mamba / 螺旋扫描 / 跨层特征交互
一句话总结¶
针对多模态跟踪中跨模态交互局限于离散层、忽视单模态层间互补及二次计算复杂度高的问题,PSMTrack 提出贯穿浅深层的渐进式 Mamba 架构,结合差异引导双向增强、动态稀疏路由跨层交互以及局部-全局混合螺旋扫描融合,在保持近似线性计算复杂度的同时显著提升了 RGB-X 目标跟踪精度。
研究背景与动机¶
单目标跟踪(SOT)旨在仅凭初始帧给定的先验边界框,在后续连续视频序列中对目标进行稳健的空间定位。然而在实际应用中,常规单模态 RGB 跟踪器频繁遭受严峻环境干扰的挑战,如极端光照突变、剧烈遮挡、高速运动引发的运动模糊以及复杂背景干扰。引入辅助传感模态(如热红外 TIR、深度图 Depth、事件相机 Event,统称 RGB-X)凭借物理成像机理的互补优势,能够提供关键的结构轮廓、辐射温差或微秒级运动边缘,从而成为突破跟踪鲁棒性瓶颈的必由之路。
然而,现有多模态跟踪方法在特征交互和融合机制上存在两个关键瓶颈。其一,主流方案大多借助跨模态注意力机制(Cross-modal Attention)或轻量适配器(Adapters)融合两路特征。由于自注意力机制计算复杂度随视觉 Token 长度呈二次方增长,跨模态注意力往往只能插入在网络的少数几个离散深层,导致中浅层模态互补信息利用不足;而轻量适配器若在所有层密集插入并拉长序列,又会带来严重的计算开销。其二,现有方案普遍忽视了单模态内部的跨层互补价值:浅层高分辨率特征富含细腻的几何纹理与边界,深层低分辨率特征提供判别性极强的高阶语义,单纯依赖最后一层输出进行跨模态交互,不仅容易丢失精细定位线索,还会引起时序上下文信息的退化。
面对多模态高计算开销与跨层信息割裂的核心矛盾,本文的切入角度是引入具有线性复杂度长序列建模能力的选择性状态空间模型(Mamba),并针对多模态跟踪的物理空间与层级特性进行定制重构。核心 idea:将多模态跟踪分解为「逐层差异引导增强、动态稀疏跨层聚合、局部至全局空间螺旋融合」的三阶段渐进建模管线,以纯线性复杂度完成细粒度边界矫正与全局语义对齐。
方法详解¶
整体框架¶
PSMTrack 的整体流程围绕双流视觉骨干网络展开。输入跟踪模板与搜索区域的 RGB 图像及对应的辅助模态 \(X\)(TIR/Depth/Event),首先被切块投影为视觉 Token 序列,并送入双分支 Transformer 编码层。在骨干网络演进过程中,每层 Transformer 块之后均嵌入差异引导的双向状态空间 Mamba 增强模块(DBME),实现无通道/序列变形的逐层互补注入;在骨干特征提取末端,跨层交互模块(CLI)借助可学习路由自适应挑选具有代表性的多层特征,融合浅层细节与深层语义;最后,混合螺旋 Mamba 融合模块(HSMF)在空间上依次执行局部小块内双向螺旋扫描与整图全局螺旋扫描,产出统一的多模态融合表征,并送入全卷积预测头(FCN)完成分类与边界框回归。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["RGB 与 X 模态输入<br/>模板帧与搜索帧 Patch 投影"] --> B["双分支 Transformer 逐层提取"]
B --> C["差异引导双向 Mamba 增强 (DBME)<br/>模态差分提取 + 正反向 SSM 门控残差注入"]
C --> D["动态路由与跨层交互 (CLI)<br/>Top-k 稀疏层选择 + SCSA去噪 + AConv/SCConv"]
D --> E["混合螺旋 Mamba 融合 (HSMF)<br/>k×k局部双向螺旋对齐 + 全图全局螺旋上下文"]
E --> F["跟踪预测头<br/>目标分类与边界框坐标回归"]
关键设计¶
1. 差异引导的双向状态空间 Mamba 增强:逐层注入细粒度互补线索
现有方法要么通过简单的特征拼接输入 Transformer,缺乏显式的差异感知,要么为了节省计算仅在深层做单向提示,导致互补信息流失。DBME 模块针对此痛点,以轻量级方式部署在全部 12 层 Transformer 之后,既不改变 Token 序列长度也不改变通道维度。针对空间连续性,模块首先对每种模态的视觉序列分别执行正向和反向序列扫描,获得具有空间双向上下文的响应特征: $\(F_i^{r\text{-}f} = \Phi_{\mathrm{SSM}}(F_i^r), \quad F_i^{r\text{-}b} = \mathrm{flip}\left(\Phi_{\mathrm{SSM}}\left(\mathrm{flip}(F_i^r)\right)\right)\)$ 在模态交互路径上,模块直接计算当前层两模态特征的绝对差分 \(F_i^d = |F_i^r - F_i^x|\),以显式提取模态间的不一致区域和互补线索。差分特征经过 Mamba 模块进行选择性状态建模后,经 \(\tanh\) 激活函数归一化并滤除共模噪声,形成跨模态注入权重。最后将双向增强特征与差异门控相乘,通过线性投影 \(\Phi_L\) 残差回加到原始特征: $\({F'_i}^r = \Phi_L\left((F_i^{r\text{-}f} + F_i^{r\text{-}b}) \odot \tanh(\mathrm{Mamba}(F_i^d))\right) + F_i^r\)$ \(X\) 模态同样对称执行该操作。这种逐层双向引导机制确保了各模态在深层演进中不断净化目标响应并抑制背景混淆。
2. 动态路由跨层交互:自适应聚合浅层纹理与深层语义
单纯依赖骨干网络最后一层的输出进行下游融合会遗忘对精确定位极为关键的浅层高分辨率细节(如边缘、拐角和局部纹理),而人工手动指定固定层拼接又缺乏对复杂场景动态变化的适应性。CLI 模块引入了一种模态共享的轻量级路由机制 \(R\),接收所有 \(L\) 层特征的通道拼接输入,经全局池化 \(P(\cdot)\) 与 MLP 映射输出各层的选择置信度得分 \(s^n\): $\(s^n = \mathrm{MLP}(P([F_1; F_2; \dots; F_L]))\)$ 网络动态挑选得分最高的 Top-\(k\) 层特征(最终层作为固定共享专家始终被保留),按通道拼接后送入跨层融合网络。为了解决简单拼接导致的通道冗余与空间错位,CLI 级联了空间与通道协同注意力(SCSA)进行显式去噪与标定;随后,采用 \(1\times 1\) 自适应卷积(AConv)替代传统非因果状态空间二象性(NC-SSD)中的固定线性层,并引入空间与通道重构卷积(SCConv)替代常规深度可分离卷积(DWConv),在维持 \(3\times 3\) 感受野的同时抑制弱纹理和遮挡带来的虚假激活。最后将选定层的交互特征等权求和,获得兼顾语义判别力与空间精度的跨层表征 \(F = \sum_{l \in S} F_{\text{interaction}}^l\)。
3. 混合螺旋 Mamba 融合:局部双向对齐与全图长程空间建模
在多模态进入定位预测头之前,不同传感器在空间视场和分辨率响应上的非均匀性极易导致语义碎片化与边界漂移。若采用全局自注意力则计算代价不可承受。HSMF 模块构建了一种局部与全局分层级联的二维螺旋扫描 Mamba 架构。首先将两模态通道拼接得到 \(F = \mathrm{Concat}(F^{\mathrm{RGB}}, F^X)\)。 - 局部螺旋阶段:将全图划分为若干不重叠的 \(k \times k\) 局部网格窗口。在每个窗口内,按照从外向内、从内向外的两条相反螺旋轨迹组织 Token 序列并送入 Mamba。由于螺旋路径连续贯穿邻域空间,局部 Mamba 能够自适应对齐模态视差,抑制单模态特有的噪声与伪边缘,仅保留双模态一致支撑的稳定目标区域。 - 全局螺旋阶段:直接将上一阶段输出的整幅 \(H \times W\) 特征图按全局螺旋轨迹展开为一维序列。与常规行优先展开(Raster Scan)不同,螺旋遍历使得在二维平面上邻近的像素在展开序列中保持相对紧邻,避免了换行扫描带来的空间几何断裂。全局 Mamba 沿空间向心/离心传播全局上下文,即便目标局部遭受重度遮挡或光照缺失,亦能从未受损的全局区域拉取连续先验,输出具备全局一致性的高判别特征 \(F_{\mathrm{fusion}}\)。
损失函数 / 训练策略¶
跟踪器沿用全卷积网络(FCN)定位头,且在多模态微调阶段保持预测头参数冻结。损失函数由目标分类加权 Focal Loss \(\mathcal{L}_{\mathrm{cls}}\)、边界框重叠广义 IoU 损失 \(\mathcal{L}_{\mathrm{giou}}\) 以及平滑 \(\mathcal{L}_1\) 回归损失组合而成: $\(\mathcal{L}_{\mathrm{total}} = \mathcal{L}_{\mathrm{cls}} + \lambda_1 \mathcal{L}_{\mathrm{giou}} + \lambda_2 \mathcal{L}_1\)$ 其中平衡超参数设置为 \(\lambda_1 = 2\)、\(\lambda_2 = 5\)。双分支骨干网络使用单模态视觉跟踪基座模型 OSTrack 进行权重预初始化,优化器采用 AdamW,初始学习率为 \(10^{-5}\),权重衰减为 \(10^{-4}\)。在 RGB-T(LasHeR)、RGB-D(DepthTrack)和 RGB-E(VisEvent)基准上分别微调 50、30 和 70 个 Epoch。
实验关键数据¶
主实验¶
PSMTrack 在涵盖热红外(RGB-T)、深度(RGB-D)以及事件流(RGB-E)的 5 个主流学术基准上与前沿 SOTA 跟踪器展开了全面评测。在单个 NVIDIA RTX 4090 显卡上,模型推理速度达到 43.6 FPS,兼具极高精度与实时跟踪效能。
原论文 Table 1、Table 2 与 Table 3 的主要定量评测结果对比如下:
| 数据集 | 模态 | 评估指标 | 本文 (PSMTrack) | 前序 SOTA (STTrack) | 优势提升 |
|---|---|---|---|---|---|
| LasHeR | RGB-T | 精确率 PR (%) / 成功率 SR (%) | 76.5 / 61.2 | 76.0 / 60.3 | +0.5 / +0.9 |
| RGBT234 | RGB-T | 最大精确率 MPR (%) / 最大成功率 MSR (%) | 91.2 / 67.3 | 89.8 / 66.7 | +1.4 / +0.6 |
| DepthTrack | RGB-D | 召回率 Re (%) / 精确率 Pr (%) / F-score (%) | 64.2 / 64.3 / 64.2 | 63.4 / 63.2 / 63.3 | +0.8 / +1.1 / +0.9 |
| VOT-RGBD2022 | RGB-D | EAO (%) / 准确率 (%) / 鲁棒性 (%) | 77.8 / 82.9 / 93.5 | 77.6 / 82.5 / 93.7 | +0.2 / +0.4 / -0.2 |
| VisEvent | RGB-E | 成功率 AUC (%) / 精确率 Pr (%) | 62.7 / 79.9 | 61.9 / 78.6 | +0.8 / +1.3 |
消融实验¶
为系统分析 DBME、CLI 和 HSMF 各关键模块的必要性,论文以完整 PSMTrack 为基准,在 LasHeR、DepthTrack 和 VisEvent 数据集上进行了组件消融(原论文 Table 4):
| 配置编号 | DBME | CLI | HSMF | LasHeR (PR / SR) | DepthTrack (F-score) | VisEvent (AUC / Pr) | 说明 |
|---|---|---|---|---|---|---|---|
| Ours | ✓ | ✓ | ✓ | 0.765 / 0.612 | 0.642 | 0.627 / 0.799 | 完整模型 |
| 变体 1 | × | ✓ | ✓ | 0.752 / 0.605 | 0.636 | 0.623 / 0.789 | 移除逐层差分双向 Mamba 增强 |
| 变体 2 | ✓ | × | ✓ | 0.753 / 0.607 | 0.636 | 0.624 / 0.793 | 移除动态跨层特征交互 |
| 变体 3 | ✓ | ✓ | × | 0.748 / 0.603 | 0.632 | 0.616 / 0.775 | 移除螺旋 Mamba 替换为简单通道拼接 |
| 变体 4 | × | × | ✓ | 0.733 / 0.596 | 0.624 | 0.614 / 0.772 | 仅保留末端螺旋融合 |
此外,针对 CLI 内部组件的渐进增益(原论文 Table 5),在 LasHeR (SR) 指标上:原始 NC-SSD 基线得分为 60.5%,加入 AConv 与 SCConv 后提升至 60.9%,进一步结合 SCSA 达到 61.2%;针对动态层选择数目 \(k\) 的消融(原论文 Table 6),\(k=3\) 在三个数据集上均取得最佳折中(LasHeR: 61.2%, DepthTrack: 64.3%, VisEvent: 62.7%),过少(\(k=1\) 为 60.7%)信息融合不充分,过多(\(k=4\) 为 60.8%)则引入额外冗余。
关键发现¶
- 末端空间融合是防守基本盘:消融实验表明,移除 HSMF 模块(变体 3)将直接导致 LasHeR PR 剧降 1.7%(从 76.5% 跌至 74.8%),VisEvent Pr 下滑 2.4%(从 79.9% 跌至 77.5%)。这证实了直接通道拼接无法弥合跨模态的物理空间视差与噪声扰动,局部加全局螺旋交互是实现目标判别性定位的核心屏障。
- 差分感知与双向扫描相辅相成:DBME 模块通过正反向 SSM 增强了目标边界的轮廓连续性,差分特征的 Mamba 门控过滤则避免了将背景共模噪声双向放大。移除 DBME(变体 1)导致 LasHeR 掉点 1.3% PR,证明浅层骨干特征的逐层交互不可或缺。
- 跨层聚合的最佳有效深度:实验证明并不是选取的层越多越好,\(k=3\) 能够最稳健地兼顾高层语义(共享专家第 12 层)与前序细节层;盲目增加聚合层数引入的高频背景杂波反而削弱了跟踪判别力。
亮点与洞察¶
- 模态差分与状态空间的有机结合:利用两模态绝对差分作为显式空间引导输入 Mamba,经非线性门控动态调制原始特征流,以接近零计算代价的残差形式实现了跨模态在骨干浅深层的双向净化。
- 空间几何保真的螺旋扫描范式:摒弃传统 1D 线性展开或横纵双向扫描对二维空间邻域关系的割裂,提出局部小块内加全局整图的二维螺旋扫描顺序,在保持 Mamba 线性计算开销的前提下,显著强化了空间连续性与各向同性上下文聚合。
- 轻量即插即用的通用 RGB-X 适配架构:冻结预训练单模态定位头,通过渐进式 Mamba 模块无缝适配 TIR、Depth、Event 三种异构模态,以 43.6 FPS 兼顾边缘设备实时性要求与算法精度。
局限与展望¶
- 作者承认的局限:模型依赖配对的 RGB-X 训练数据,在传感器完全失步、严重视场畸变或某模态数据完全缺失时的退化自愈机制尚未深入讨论;当前螺旋扫描轨迹具有固定几何半径与旋转方向,对不规则细长物体的空间各向异性建模灵活性仍有提升空间。
- 潜在改进方向:可进一步探索内容自适应动态扫描轨迹,例如基于显著性先验引导螺旋中心动态偏移;此外,将时序跨帧历史状态(Memory SSM)与当前的帧内跨模态螺旋 Mamba 深度交融,有望在长时遮挡重现场景下带来更大的时空增益。
相关工作与启发¶
- vs STTrack:STTrack 侧重于利用跨模态 Mamba 引入时序状态生成器建模跨帧历史,但在帧内空间融合上依赖离散交叉特征;PSMTrack 聚焦于单帧内多模态特征的深浅层交互与局部-全局螺旋空间建模,在 LasHeR、DepthTrack 和 VisEvent 上全面超越 STTrack(LasHeR PR 76.5% vs 76.0%)。
- vs SDSTrack / OneTracker:此类工作基于 Transformer 适配器(Adapters)或提示微调(Prompt Tuning),难以避免多层密集堆叠带来的显存上升与弱交互问题;PSMTrack 借助 Mamba 线性复杂度优势实现全层嵌入与稠密跨层路由,在计算开销与跟踪性能上均展现出明显优势。
评分¶
- 新颖性: ⭐⭐⭐⭐☆(将二维螺旋扫描机制与 Mamba 结合用于多模态融合,思路清晰巧妙)
- 实验充分度: ⭐⭐⭐⭐⭐(覆盖 RGB-T/D/E 三大模态 5 个主流公开基准,包含完整组件与参数消融)
- 写作质量: ⭐⭐⭐⭐☆(结构完整,公式与模型图表规范清晰,动机陈述严谨)
- 价值: ⭐⭐⭐⭐☆(为多模态目标跟踪领域轻量高效的跨模态空间融合提供了高参考价值的设计范式)