High-Throughput Event-Based Feature Detection and Tracking on an Embedded CPU¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://0thane.github.io/SPEEDTrack/
领域: 其他
关键词: 事件相机, 特征检测, 特征跟踪, 嵌入式计算, 任务图调度
一句话总结¶
针对事件相机极高事件率与边缘嵌入式端受限算力之间的严峻矛盾,本文提出无深度学习且无需 GPU 的 SPEEDTrack 系统,基于动态运动驱动并发分片与任务图调度架构,在单颗嵌入式 CPU 上实现了超越传感器平均事件率的高吞吐实时特征检测与跟踪。
研究背景与动机¶
事件相机凭借微秒级时间分辨率、超高动态范围和极低功耗特性,正在成为无人机自主敏捷导航、头戴式扩展现实(AR/VR)等边缘具身智能设备的核心视觉感知模态。然而在实际边缘部署中,事件视觉算法必须维持极高吞吐量以实时消化传感器源源不断输出的异步事件流(通常高达每秒数百万甚至数千万事件)。现有绝大多数事件特征检测与跟踪算法要么依赖沉重且高能耗的深度神经网络与 GPU 加速(如基于注意力机制的 ETAP 或循环网络),难以塞入功耗受限的边缘平台;要么依赖传统固定的时间窗口或固定事件数进行累加成帧,无法适应多变的动态场景与剧烈运动,导致快动时运动模糊、慢动时数据过度稀疏。
更深层次的瓶颈在于算力架构与算法结构的严重脱节:经典非学习方法大多采用按线程分工的串行流水线,难以多核并发处理多个输入分片,且跨线程复杂同步频繁引起 CPU 核心闲置;而现有基于迭代优化或局部模板搜索的跟踪器(如 HASTE、RATE)每特征算力开销巨大,吞吐量往往远低于真实场景的平均事件率。一旦事件率超越系统处理吞吐量,系统就必须被迫在线抽样事件,破坏了时空连续性并错失高速动态感知机会。
面对高动态跟踪精度与超低计算预算的尖锐权衡,本文摒弃沉重的神经模型与全局串行依赖,转而探索底层硬件特质与事件流时空稀疏性的深度协同。核心 idea:构建运动驱动并发分片(MDCS)架构,将事件流按局部运动密度自适应切分为自治且解耦的时空微片,配合任务图动态调度最大化多核 CPU 并发利用率,并在微片内完成序数表面角点检测与局部线性小轨迹拟合,最后由轻量卡尔曼滤波实现跨片关联。
方法详解¶
整体框架¶
SPEEDTrack 将连续异步事件流 \(\mathcal{E}_T = \{e_i\}_{i=1}^{N_T}\) 转化为高吞吐特征轨迹集合 \(\mathcal{T}_j\),整体由四个高度解耦且各司其职的模块组成:首先由活动分片器(Activity Slicing)根据像素激活密度动态截取运动自适应分片;随后在每个分片内部并行运行片内序数表面角点检测(Slice-Local Corner Detection),快速提取显著角点;接着在片内拟合时空线性模型生成特征小轨迹(Tracklet Detection);最后通过全局任务图调度(Task-Graph Scheduling)将生成的小轨迹输入轻量卡尔曼滤波跟踪器完成时空匹配与状态更新。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["异步事件流输入<br/>(t, x, y, p)"] --> B["活动分片<br/>根据活跃像素平均事件数动态成片"]
B --> C["片内序数表面角点检测<br/>局部事件索引+分类忽略掩膜"]
C --> D["片内特征小轨迹生成<br/>局部时空最小二乘线性拟合"]
D --> E["任务图调度与卡尔曼滤波跟踪<br/>动态线程调度+KD树关联更新"]
E --> F["输出全局稳定特征轨迹<br/>实时低延迟位置与速度"]
关键设计¶
1. 活动分片:按动态运动密度自适应界定计算边界 固定时长分片在高速运动时会导致严重过载与拖尾,固定事件数分片在静止无纹理区域又会跨越过长时间跨度。为克服这些缺陷,本文定义分片活动度指标 \(\alpha\),即当前切片 \(\mathcal{S}_j\) 内累积的总事件数与触发过事件的非零活跃像素数量之比: $\(\alpha = \frac{|\mathcal{S}_j|}{A_{\text{active}}}, \quad A_{\text{active}} = |\{(x,y) \mid \mathbf{A}(x,y)=1\}|\)$ 其中 \(\mathbf{A}(x,y)\) 记录该像素在当前片内是否发生过事件响应。系统以传感器不应期百倍的周期采样检查 \(\alpha\);一旦 \(\alpha\) 达到设定阈值 \(\alpha_{\text{th}}\)(默认设为 3),即刻封闭本片并启动新片。这一机制保证了无论相机运动快慢,每一个分片在时空上都具备统计一致的有效边缘结构与信息密度,静止时极少出片降频节能,剧烈运动时高频并发切片捕捉极速突变。
2. 片内序数表面角点检测:解耦全局状态并利用忽略掩膜加速 传统 eHarris 角点检测维护全局事件表面,需要全局读写锁,不仅打乱多核流水线还消耗大量内存带宽。本文将角点提取严格限制在单个分片内,构建片内专属的序数表面 \(\mathbf{\Sigma}_o(x,y)\),仅记录该像素在当前片内的最新事件序号 \(c\)。在以当前事件为中心的局部窗口内,仅当非零事件数满足最小数量要求时,才根据第 \(\Theta\) 大的序号截取局部二值特征块并与 Sobel 算子卷积计算 Harris 响应矩阵与打分 \(H(e'_c)\)。此外,本文引入轻量像素分类忽略掩膜 \(\mathbf{V}(x,y)\),将平坦区域记为 0、边缘记为 1、强角点记为 2。后续事件仅在对应像素分类值为平坦(0)时才重新计算 Harris 响应,若落在已判定的边缘或角点位置则直接跳过繁重矩阵运算,在极大削减冗余浮点开销的同时抑制了空间角点聚集。
3. 片内特征小轨迹生成:时空局部线性拟合解耦片间依赖 常规特征跟踪往往强依赖帧间密集光流或跨时隙全局跟踪链,这在无 GPU 的嵌入式 CPU 上会造成严重的串行瓶颈。得益于活动分片在时空尺度上的自适应收敛,角点在单个极短切片内的位移严格服从匀速直线近似:\(x(t) = v_x t + b_x\),\(y(t) = v_y t + b_y\)。系统对片内角点进行局部密度统计并实施半径为 \(r_{\text{suppress}}\) 的非极大值抑制(NMS),筛选出密度最高的关键角点,并在局部时空邻域内通过最小二乘法封闭解求出水平和垂直速度向量与起点、终点时空坐标,封装为极短小轨迹 \(f_k = \langle \boldsymbol{\tau}_{\text{start}}^{(k)}, \boldsymbol{\tau}_{\text{end}}^{(k)} \rangle\)。各切片的小轨迹生成完全自包含、零锁并发,使得各 CPU 核心无需跨核心通信即可全速运行。
4. 任务图调度与卡尔曼滤波跟踪:解耦并发执行与轻量全局时空关联 为打破传统流水线将固定阶段绑定到固定线程而导致的严重核心闲置与等待瓶颈,本文将整个计算流程表达为无环计算任务图。切片级运算被标记为具备无限并发度的节点,由轻量级任务图运行时调度器根据依赖关系即时派发给任意空闲的 CPU 核心。而在分片之后的小轨迹汇总层,系统维护一组轻量级恒定速度卡尔曼滤波器,状态向量仅包含位置与速度 \([x, y, v_x, v_y]^\top\)。对进入的新小轨迹集,利用 KD 树在匹配半径 \(r_{\text{match}}\) 内以空间距离快速完成贪心匹配与滤波更新;同时设立 \(g \times g\) 像素的主动跟踪网格,抑制已有轨迹周围重复生成新跟踪,对丢失匹配的轨迹及时淘汰,从而以极其轻量的代数计算实现了跨越数秒的全局长时轨迹稳定延续。
实验关键数据¶
主实验¶
在真实高动态事件基准 EDS 数据集(含手持剧烈运动与复杂光照场景)和经典 EC 数据集上,采用稳定特征寿命(SFA,Stable Feature Age)与期望特征寿命(EFA,Expected Feature Age)对各跟踪器进行全面对标。所有对比方法均使用相同的初始角点输入,且不开启中间新生轨迹以严格隔离底层跟踪能力。
| 方法 | 输入模态 | EDS: SFA ↑ | EDS: EFA ↑ | EC: SFA ↑ | EC: EFA ↑ |
|---|---|---|---|---|---|
| EKLT | Events+Frames | 0.230 | 0.150 | 0.795 | 0.760 |
| DeepEvT | Events+Frames | 0.480 | 0.400 | 0.815 | 0.805 |
| EM-ICP | Events Only | 0.115 | 0.090 | 0.320 | 0.310 |
| HASTE | Events Only | 0.070 | 0.050 | 0.425 | 0.410 |
| AEB-Tracker | Events Only | 0.300 | 0.290 | 0.540 | 0.460 |
| DeepEvT* | Events Only | 0.515 | 0.430 | 0.785 | 0.770 |
| ETAP | Events Only (GPU) | 0.742 | 0.613 | 0.870 | 0.851 |
| SPEEDTrack (本文) | Events Only (CPU) | 0.558 | 0.421 | 0.822 | 0.713 |
在双目相对位姿估计评估(计算 2 秒内立体视角对由特征匹配求解基础矩阵的旋转误差 AUC)中,SPEEDTrack 在 EC 数据集上达到 14.4% (5°)、20.8% (10°)、27.2% (20°),在 EDS 数据集上达到 10.9% (5°)、14.0% (10°)、17.5% (20°),在全部纯事件方法中位居第二,仅次于利用大规模神经特征先验训练的 SuperEvent(EC: 22.7%/35.8%/46.7%),大幅领先传统方法 RATE、LLAK 和 EventPoint。
消融实验¶
消融实验在 NVIDIA Jetson Orin NX 嵌入式开发板上开展(仅调用 8 核 Arm Cortex A78AE CPU 与 16GB 内存,整机平均功耗仅 12W),测量全流水线在嵌入式硬件上的真实延迟、事件处理吞吐量及跟踪精度。
| 配置 | 延迟 (µs) | 吞吐量 (Mev/s) | EDS SFA | EDS EFA | EC SFA | EC EFA | 说明 |
|---|---|---|---|---|---|---|---|
| 固定时间分片 (15ms) | 71.2 | 4.01 | 0.401 | 0.298 | 0.658 | 0.541 | 失去运动自适应性,快动拖尾慢动稀疏 |
| 最近邻小轨迹替代 KF | 45.1 | 5.02 | 0.438 | 0.330 | 0.829 | 0.672 | 算力虽省但缺乏动力学平滑导致寿命下降 |
| 禁用忽略掩膜 (重算 H) | 83.2 | 3.52 | 0.491 | 0.375 | 0.774 | 0.662 | 重复计算 Harris 响应大幅拖慢流水线 |
| 线程绑定并发 (传统分工) | 96.4 | 2.97 | 0.558 | 0.421 | 0.822 | 0.713 | 精度一致但跨线程等待引起算力严重浪费 |
| 完整模型 (SPEEDTrack) | 49.7 | 4.92 | 0.558 | 0.421 | 0.822 | 0.713 | 兼具极致吞吐、微秒级延迟与最优精度 |
关键发现¶
- 任务图并发调度(MDCS)对吞吐量的影响最为显著:当改用传统按模块绑死线程的并发模式时,吞吐量由 4.92 Mev/s 暴跌至 2.97 Mev/s(下降近 40%),延迟从 49.7 µs 恶化到 96.4 µs。这证明了消除线程锁并让计算密集型分片自由在任意空闲多核上并发展开的架构决定性价值。
- 忽略掩膜(Ignore Mask)是角点提取能够跑满嵌入式 CPU 的最核心算法 Trick:省去针对边缘与角点像素冗余计算的 Harris 矩阵,直接使吞吐量提升约 40%(从 3.52 升至 4.92 Mev/s),延迟从 83.2 µs 压缩近半。
- 活动分片机制彻底解决了快慢动态的失真问题:固定 15ms 窗口使 EDS 上的 SFA 从 0.558 骤降至 0.401,验证了根据单位活跃像素事件密度动态决定分片边界对维持下游几何特征稳定性的关键作用。
亮点与洞察¶
- 算法与嵌入式多核硬件的协同协同设计:打破了学术界堆叠复杂深度网络才能获取长程跟踪精度的惯性,证明了通过重新审视计算粒度与硬件线程调度,精简的传统几何特征检测与关联在多核嵌入式 CPU 上同样可以逼近深度模型的长寿跟踪表现。
- 自适应活跃像素密度分片(Activity Slicing):用最极简的除法公式(事件数/激活像素数)构建了对场景几何结构与相机瞬时运动高度鲁棒的分片指标,以极低的检测开销实现了稳定图像等价时空流形。
- 片内自包含小轨迹(Self-Contained Tracklets):将传统全局跟踪的跨时间步状态依赖斩断,转化为片内闭式线性回归与片间卡尔曼滤波两级架构,从而天然契合现代多核 CPU 的无锁并行计算。
局限与展望¶
- 依赖时空光滑性与总线带宽瓶颈:算法假设事件在微小切片内沿直线均匀分布,在超极端运动剧烈震颤或光照阶跃导致的极高频事件风暴下,受制于 USB 传输物理带宽可能发生硬件丢包,破坏局部线性假设。
- 周期光源伪影干扰:由于事件相机响应所有亮度变化,交流电照明环境下的工频闪烁会产生大量非自身运动诱发的虚拟事件与假特征轨迹。
- 失锁重捕获机制缺失:当前卡尔曼滤波器采用贪心匹配,一旦特征因大面积遮挡或剧烈转向丢失,系统无法在后续场景中重新识别同一特征,未来需要融合轻量 SLAM 局部地图或全局拓扑字典完成闭环重定位。
相关工作与启发¶
- vs ETAP / DeepEvT / SuperEvent: 基于学习的最新 SOTA 方法依赖 Transformer、记忆网络或稠密特征图卷积,需要消耗数十瓦乃至上百瓦的高性能 GPU;SPEEDTrack 完全不依赖 GPU,仅凭 12W 的嵌入式 CPU 即实现了接近深度模型的跟踪寿命,为受限边缘机器人提供了切实可行的工程范式。
- vs eHarris / eFAST / FA-Harris: 经典角点检测要么计算耗时长(eHarris),要么检测到的角点几何稳定性差、跨时间难以关联(eFAST);SPEEDTrack 提出的片内序数表面与忽略掩膜在保留 eHarris 几何判别力的同时,实现了近一个数量级的吞吐加速。
- vs HASTE / RATE: 传统异步跟踪器采用局部模板在连续事件流上按特征逐个非线性优化,计算复杂度随跟踪特征数迅速膨胀;SPEEDTrack 通过片内小轨迹回归加卡尔曼滤波解耦了特征规模,在高特征密度下依然能保持数兆事件每秒的超高吞吐。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ [将活动自适应分片与任务图无锁调度深度融合于事件视觉,软硬件协同范式新颖]
- 实验充分度: ⭐⭐⭐⭐⭐ [涵盖角点稳定性、特征寿命、相对位姿估计以及嵌入式真实硬件消融与实车实况演示]
- 写作质量: ⭐⭐⭐⭐⭐ [逻辑紧凑,系统设计动机明确,软硬件瓶颈剖析深刻透彻]
- 价值: ⭐⭐⭐⭐⭐ [为微型无人机、AR/VR 眼镜等低功耗极端算力受限平台的实时事件特征跟踪树立了新标杆]