跳转至

Event-LiDAR: 3D Eventification for Efficient Point Cloud Processing

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/scsrp/event-lidar
领域: 自动驾驶
关键词: 3D事件化, 激光雷达点云, 时序冗余消除, 3D目标检测, 高效感知

一句话总结

针对多帧激光雷达点云处理中显著的时空冗余,Event-LiDAR 提出了一种无需学习的 3D 事件化前处理范式,利用局部一阶几何模型逼近相邻帧几何演变并提取难以预测的有符号结构偏差作为 3D 事件,在保持检测精度几乎无损的同时削减 72% 的点数并带来最高 23% 的端到端推理加速。

研究背景与动机

现代自动驾驶与具身感知系统普遍依赖高频(如 10–20 Hz)、高分辨率激光雷达持续扫描三维环境。为了捕捉道路参与者的动态运动并补全稀疏几何,主流感知管线通常将连续的多帧点云拼接输入到 3D 检测网络中。然而,这种密集的多帧聚合机制蕴含着巨大的时序冗余:在连续扫描中,道路、建筑物、路旁绿化等大面积静态背景在几何上保持高度一致,系统却反复对这些几乎不变的点云进行全局体素化、特征提取与时空聚合,导致计算负载激增、显存占用高昂且部署延迟居高不下。

虽然视频编码领域(如 MPEG 预测残差编码)与事件相机(Event Camera)早已验证了“仅编码动态变化”能够成倍降低数据吞吐,但在 3D 激光雷达点云上实现类似的事件化却面临严峻的技术阻碍。与规则稠密的 2D 像素阵列不同,3D 点云具有空间稀疏、非均匀分布与强视点依赖等特性。直接在深度图或范围图像(Range Image)上做差分,会因粗糙的角分辨率和量化误差产生随距离迅速放大的虚假响应;而若直接比较体素占用或采用最近邻点差分,自车运动带来的视点变化、遮挡关系改变以及帧间光束采样点的随机偏移,会导致静态背景的大量点被误判为“发生变化”,从而产生严重的虚假事件并破坏冗余消除效果。即便是近期采用无对应点残差保留策略的方法(如 FSD++ 的 RPP),也容易将视点新观测到的静态结构误认作动态残差。

本文针对该核心矛盾提出,不能把简单的“缺失对应关系”等同于“真实物理运动”,而应将 3D 事件提取建模为稀疏、视点依赖观测下的局部时序几何估计问题。通过建立前一帧点云构成的局部一阶连续几何曲面,并向新观测区域合理外推,系统能够有效预测并剔除由自车运动和常规几何延伸带来的可预测变化。核心 idea:将 3D 事件提取形式化为时序局部几何估计问题,利用前一帧构建的局部一阶线面模型拟合几何演变并向外推演,仅提取一阶模型无法解释的有符号几何偏差作为 3D 事件,以毫秒级轻量前处理实现高保真、高稀疏的时序点云事件化。

方法详解

整体框架

Event-LiDAR 作为一个轻量级、无需标注且与检测骨干解耦的 3D 点云前处理前端,其目标是在保留运动与几何突变线索的同时,剔除历史帧中可被局部几何预测的冗余点。整个时序微分流程包含四大步骤:首先,利用自车位姿对当前扫描进行自车运动补偿,将其对齐至前一扫描坐标系;其次,在等距柱状投影域建立邻域网格索引,快速检索前一帧的近邻点集并拟合局部一阶几何图元(直线或平面);接着,计算当前点到预测图元的投影与有符号几何偏差,并对外推区域进行一致性度量;最后,结合偏差幅度阈值判定事件触发状态,并输出携带时序偏差残差特征的稀疏事件化点云。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["当前原始点云与自车位姿"] --> B["自车运动补偿与等距柱状网格索引<br/>坐标系对齐与前帧O(1)近邻查询"]
    B --> C["局部一阶几何建模与正负有符号偏差度量<br/>拟合局部线面图元并计算投影偏差"]
    C --> D["面向视点外推的冗余抑制与事件触发<br/>外推连续背景并依据自适应阈值剪枝"]
    D --> E["事件感知网络重构与3D目标检测<br/>浅层算力重分配匹配稀疏事件输入"]

关键设计

1. 自车运动补偿与等距柱状网格索引:消除跨帧视点位移并实现近邻极速检索

为了消除自车运动造成的虚假几何位移,设当前扫描在自身传感器坐标系下的点集为 \(\hat{P}_t\),系统利用短时间隔内(\(\le 0.1\text{ s}\))由轮速计或惯导估计的刚体变换矩阵 \(T_t \in \text{SE}(3)\),将当前帧点云逆向对齐到前一帧 \(P_{t-1}\) 的坐标系中: $\(P_t = T_t \hat{P}_t\)$ 由于点云在 3D 连续空间内极为稀疏,传统的 \(k\text{d}\)-tree 搜索难以满足车载毫米级感知的低延迟需求。为此,Event-LiDAR 将前一帧点云 \(P_{t-1}\) 投影至等距柱状投影域(Equirectangular Projection Domain),构建二维极坐标角度网格索引。对于任意补偿后的当前点 \(p \in P_t\),系统能在平均 \(O(1)\) 常数时间内检索到其在前帧投影域内的局部近邻点集 \(\mathcal{N}(p) \subset P_{t-1}\),为后续瞬时图元构建奠定了计算效率基础。

2. 局部一阶几何建模与正负有符号偏差度量:以极简解析图元替代耗时曲面拟合

传统最近邻距离极易受激光束线间距与角采样密度的影响,静态地面或墙面上的采样落点微调常被误判为大残差。Event-LiDAR 摒弃复杂的迭代曲面拟合,直接依据近邻点数目解析构造局部一阶几何模型 \(\mathcal{M}(p) \subset \mathbb{R}^3\):当近邻包含 3 个非退化点时构造局部平面,包含 2 个点时构造局部线段,并支持“面 \(\to\) 线 \(\to\) 点”的瞬时回退,完全避免了 SVD 或非线性优化的开销。随后,将当前点 \(p\) 正交投影到一阶局部模型 \(\mathcal{M}(p)\) 上获得几何参考足点: $\(\Pi(p) = \arg\min_{x \in \mathcal{M}(p)} \|p - x\|_2\)$ 为了在稀疏点集上保留几何趋近或背离的物理动向,模型定义有符号距离偏差 \(\Delta d(p) = \phi(p) \|p - \Pi(p)\|_2\),其中符号由传感器测距大小决定: $\(\phi(p) = \text{sign}(\|p\|_2 - \|\Pi(p)\|_2)\)$ 当足点 \(\Pi(p)\) 落在邻域点构成的凸包区域内部时该计算为内插,而当足点落在外部时则被视作外推。

3. 面向视点外推的冗余抑制与事件触发机制:防止新观测视点盲区产生虚假激活

自车前行时,视点变化不可避免地会在连续帧间暴露全新视野区域(如道路前方的新地面或建筑拐角)。传统残差方法因这些区域缺乏前帧近邻而全部标记为“新变化”,造成冗余点重新涌现。Event-LiDAR 观察到绝大多数环境背景属于低频平滑几何结构,因此即使邻域支持不足以构成内插,仍沿已有扫描线与局部法向将 \(\mathcal{M}(p)\) 向外平滑推演。只有当实测偏差 \(|\Delta d(p)|\) 显著超出基于测距的模型与传感器不确定度阈值 \(\tau(r_{\min})\) 时,才真正触发事件: $\(E(p) = \begin{cases} 1, & \text{若 } |\Delta d(p)| > \tau(r_{\min}) \\ 0, & \text{其他} \end{cases}\)$ 其中 \(r_{\min} = \min(\|p\|_2, \|\Pi(p)\|_2)\)。在工程实践中,阈值可设定为与测距解耦的基准常数 \(\tau_0\)(如 nuScenes 设为 0.072 m,Waymo 设为 0.069 m),使点云事件保留率精准收敛在预设预算内(通常约为 20%)。

4. 面向稀疏时空事件的事件感知网络重构:算力前置以充分捕获运动线索

事件化后的点云由多帧全点云压缩为“单帧完整全扫描 + 历史时序事件点”(\(1\text{F}+(N-1)\text{T}\))或纯时序事件流(\(N\text{T}\)),每个点编码为增广特征向量 \(f = (x, y, z, r, t_{\text{offset}}, \Delta d)\)。由于输入点云呈现极高稀疏性且高度聚焦于运动边界,传统针对均匀稠密点云设计的骨干网络在浅层容易存在特征捕获不足的问题。为此,Event-LiDAR 针对 PTv3 等骨干提出了事件感知(Event-Aware, EA)网络结构设计:在保持总体参数量基本不变(如 15.6M 调整为 15.7M)的前提下,将后级计算通道和深度向前级倾斜,分配更多表征容量给初始输入阶段与浅层体素层。这种算力前置重分配策略在输入点数大幅减少时能够以极小的计算代价显著放大微弱事件信号的特征响应。

损失函数 / 训练策略

Event-LiDAR 属于即插即用的无监督前处理模块,前处理阶段本身不包含可学习参数,亦无需反向传播梯度。在下游 3D 目标检测任务中,完全遵循所选骨干网络(如 CenterPoint 与 PTv3)的标准检测损失,包括分类热图 Focal Loss、边界框回归 L1/Smooth L1 损失以及方向角和速度预测损失。训练时采用 AdamW 优化器,初始学习率设为 \(3 \times 10^{-4}\),批大小为 16。由于输入点数减少了 70% 以上,点云加载与骨干前向耗时大幅减少,不仅加快了端到端推理,还带来了 14%–23% 的端到端训练加速。

实验关键数据

主实验

在 nuScenes(10 帧多扫描)与 Waymo Open Dataset(3 帧多扫描)上,基于 CenterPoint 和 Point Transformer V3 (PTv3) 对比了 Event-LiDAR 与多种基线和前处理策略的检测性能与推理延迟。

数据集 骨干网络 输入模式 / 方法 点数削减 (Pt. Red.) 推理耗时 (ms) 加速比 mAP / L2 mAP NDS / L2 mAPH
nuScenes CenterPoint 10F (全量基线) 0.0% 39.1 1.00× 59.6 65.9
nuScenes CenterPoint 10R (随机采样 20%) 80.0% 34.3 1.14× 49.9 59.5
nuScenes CenterPoint 10T (本文纯事件) 79.9% 34.9 1.12× 58.7 65.1
nuScenes CenterPoint 1F+9T (本文混合) 71.9% 35.9 1.09× 59.5 65.5
nuScenes PTv3 10F (全量基线) 0.0% 71.2 1.00× 63.5 68.5
nuScenes PTv3 10R (随机采样 20%) 80.0% 53.3 1.34× 53.2 61.5
nuScenes PTv3 10M (Mapless-MOS) 79.7% 51.1 1.39× 51.4 59.8
nuScenes PTv3 10V (FSD++ RPP) 79.4% 58.1 1.23× 54.9 62.5
nuScenes PTv3 10D (M-detector) 79.1% 46.6 1.53× 34.2 49.8
nuScenes PTv3 10T (本文纯事件) 79.9% 53.4 1.33× 61.8 67.3
nuScenes PTv3 1F+9T (本文混合) 71.9% 57.8 1.23× 63.1 68.1
Waymo CenterPoint 3F (全量基线) 0.0% 39.4 1.00× 67.7 66.2
Waymo CenterPoint 1F+2T (本文混合) 53.5% 35.6 1.10× 67.1 65.6
Waymo PTv3 3F (全量基线) 0.0% 87.9 1.00× 69.7 68.3
Waymo PTv3 1F+2T (本文混合) 53.5% 73.1 1.20× 68.8 67.5

消融实验

1. 几何图元拟合类型消融与点类型保留率分析

下表展示了在 nuScenes 数据集上,不同事件化与采样策略对动态物体点、静态物体点以及背景点的留存比例对比。

方法 / 配置 动态物体点保留率 (%) 静态物体点保留率 (%) 背景点保留率 (%) 说明
Random (20%) 20.1 20.0 20.0 无差别均匀削减
Height Filtering H(0.3m) 83.4 82.5 41.7 去除部分地面,但冗余削减有限
Height Filtering H(80%) 8.0 7.5 21.3 强行提升阈值导致前景目标严重丢失
Range Image I (残差图像) 33.6 23.3 19.8 深度离散化误差导致动态聚焦较弱
\(T_{\text{point}}\) (点级距离) 36.5 16.6 20.4 缺乏表面拟合,漏失较多目标点
\(T_{\text{line}}\) (线模型,本文默认) 51.4 28.4 19.6 兼顾极低计算耗时与极高目标留存
\(T_{\text{plane}}\) (面模型) 53.4 28.1 19.2 动态目标保留率最高,计算略增

2. 事件感知(EA)网络容量重分配效果消融

在 nuScenes 上基于 PTv3 评估事件感知网络(将容量重分配至输入浅层)在全量帧与事件化混合输入下的影响(参数量基准约 15.6M–15.7M)。

输入配置 启用 EA 结构 参数量 (#Param) 推理耗时 (ms) mAP (%) NDS (%) 每毫秒精度收益 \(\Delta\text{mAP}/\Delta t\)
10F 15.6M 61.6 62.3 67.7
10F 15.7M 71.2 63.5 68.5 0.125
1F+9T 15.6M 52.3 62.0 67.1
1F+9T 15.7M 57.8 63.1 68.1 0.207

关键发现

  • 信息保留优势压倒随机下采样与 MOS 方法:在 nuScenes 上,当削减 80% 点数时,均匀随机采样导致 PTv3 的 mAP 骤降 10.3%(从 63.5% 跌至 53.2%);而基于物理运动分割的 MOS 方法(如 Mapless-MOS 与 M-detector)由于滤除了所有静态物体,导致检测 mAP 崩塌至 34.2%–51.4%。Event-LiDAR 依靠局部一阶几何逼近,保留了 51.4% 的动态点和 28.4% 的静态物体边界点,使 10T 的 mAP 仍高达 61.8%,1F+9T 更达到 63.1%(基本逼平全量基线 63.5%)。
  • 计算提速主要集中于骨干网络:对 PTv3 进行模块级运行耗时剖析显示,1F+9T 模式将骨干特征提取部分的耗时直接缩减了 32%,10T 纯事件模式在骨干部分加速达 48%。这表明高计算复杂度的 3D 稀疏卷积/自注意力模型能够从几何事件化带来的点数稀疏化中获益最多。
  • 前处理超低开销确保净吞吐收益:Event-LiDAR 单线程 CPU SIMD 实现单帧仅耗时 0.34 ms(nuScenes)与 1.64 ms(Waymo),对比之下,M-detector 多线程处理每帧需要 26.8 ms 至 78.9 ms。超轻量的前处理保证了下游网络节省的算力能够实打实转化为端到端推理净提速。
  • 对位姿噪声与垂直线数具有极高鲁棒性:在 Waymo 上将参考帧垂直线数从 64 线降至 32 线甚至 16 线时,L2 mAP 仅产生微小的波动(66.5% \(\to\) 66.5% \(\to\) 66.2%);在自车位姿中注入远超车载 IMU 漂移量级的平移与旋转高斯扰动后,mAP 与 NDS 表现依然平稳无突变。

亮点与洞察

  • 将 3D 事件化解构为解析曲面估计问题:避开了传统投影深度图差分的距离量化误差,直接在 3D 传感器坐标系中利用等距柱网格和相邻点构建线面图元,既没有曲面拟合优化负担,又消除了视点变化带来的伪事件。
  • 平滑外推机制攻克新观测视点误判:针对车身前行引发的前方视野盲区突现,引入一阶曲面几何外推,避免了将低频延伸的静态地面与墙体误认为运动事件,解决了“无对应点 \(\ne\) 动态事件”的行业痛点。
  • 针对事件化稀疏特性的事件感知网络设计:发现多帧稀疏事件流能容忍浅层网络容量扩增,通过在总参数量守恒下将骨干算力从深层迁移到浅层,以更高的单位耗时精度收益(\(\Delta\text{mAP}/\Delta t = 0.207\) vs 0.125)补全稀疏信号表征。

局限与展望

  • 依赖连续帧间的自车运动先验:方法依赖短时间内的自车位姿对齐(如基于轮速计或 IMU),若在极端剧烈抖动、传感器失步或恶劣天气引发位姿发散时,几何投影偏差可能会产生局部误检。
  • 纯动态极端场景与单帧冷启动:当车辆在静止状态首次冷启动或仅有单帧输入时,无法执行跨帧时序微分;同时,当前方法主要将事件作为下游检测的特征输入,尚未扩展至点级稠密运动估计或时序跟踪滤波。
  • 未来方向:作者指出可探索在单帧输入下通过时序递归传播维护隐式几何参考曲面,并推广至在线 SLAM 建图、端到端点云压缩与开放场景动态感知。

相关工作与启发

  • vs FSD++ (RPP): FSD++ 采用体素级残差探测(RPP),仅通过寻找前一帧是否存在对应点来剔除冗余点。然而其忽略了视角变换引起的静态新观测点,容易在路面和开阔区域产生大量虚假激活;Event-LiDAR 引入一阶局部模型与外推机制,大幅提升了保留点的信噪比。
  • vs LiDAR MOS (Mapless-MOS / M-detector): 传统的激光雷达移动物体分割(MOS)旨在识别严格的动态目标,导致路旁停放车辆、交通标志等静态前景目标被彻底滤除,造成检测性能断崖式下跌;Event-LiDAR 的目标是冗余削减而非语义运动分类,通过适度保留不可预测的高频边缘与静态物体结构,实现了高效与高精度的统一。
  • vs 2D Range Image Differencing: 基于范围图像做逐像素深度差分受制于角分辨率离散化和远距离精度发散;Event-LiDAR 在 3D 原生坐标系下计算欧氏/正交有符号偏差,不受投影网格分辨率劣化干扰。

评分

  • 新颖性: ⭐⭐⭐⭐ [跳出传统 2D 深度差分与无对应点残差思维,提出基于解析一阶几何时序估计的 3D 事件化范式]
  • 实验充分度: ⭐⭐⭐⭐⭐ [跨 nuScenes 和 Waymo 双主流数据集,覆盖 CenterPoint 与 PTv3 两种架构,包含详尽的前处理延迟、位姿噪声与线数消融]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑层层递进,对视点依赖性与几何外推的阐述深刻透彻,图表规整严密]
  • 价值: ⭐⭐⭐⭐⭐ [即插即用、单线程不到 1ms 的 CPU 前端,在不损失检测精度的前提下削减 70%+ 点数,对车载边缘算力部署具有极高的工业实用价值]