Learning to Suppress SPAD-based LiDAR Flare¶
会议: ECCV 2026
论文: ECCV 2026
领域: 自动驾驶
关键词: SPAD 激光雷达、耀斑抑制、多回波表征、语义分割、物理先验
一句话总结¶
针对 SPAD 激光雷达在高反物体(如交通标志)下因堆积效应和光学串扰产生虚假结构与几何畸变的痛点,本文将耀斑抑制重构为语义分割任务,提出结合第一/第二回波与环境光信息的物理启发网络 PILF,并基于预测掩码进行局部回波替换恢复真实几何。
研究背景与动机¶
基于单光子雪崩二极管(SPAD)的激光雷达凭借单光子级超高灵敏度和精准的直接飞行时间(d-ToF)测距能力,正迅速成为自动驾驶和移动机器人领域的核心感知传感器。然而,当探测视场中出现路标、车尾反光板、反光背心等高逆反射表面时,短时间内涌入的大量光子会诱发严重的雪崩二极管饱和堆积(pile-up)效应,并伴随阵列相邻像素间的光学串扰。这种光电物理特性会在点云中产生大面积蔓延的“激光雷达耀斑(LiDAR Flare)”,不仅使物体轮廓严重外扩畸变,还会在半空中形成虚假障碍物,极大危害自动驾驶的安全决策。
面对耀斑干扰,传统方案主要聚焦于硬件隔离设计(如微深槽隔离、芯片上时间门控)或低级信号处理(如直方图峰值抑制、异步采样滤波)。这些方法虽然在特定标定条件下能部分削弱伪影,但本质上高度依赖系统具体参数和人工先验规则,面对复杂道路多变的反射强度与天气光照时泛化能力极弱。更关键的矛盾在于:传统雷达数据管线为压缩下游带宽与降低计算延迟,通常只保留“首回波(First Echo)”的深度与强度生成点云,把后续回波丢弃。然而在强耀斑区域,首回波恰恰被光学串扰带来的虚假提前光子占据,而真实的物体表面反射信号其实完好地隐藏在次回波(Second Echo)之中。
为了突破传统管线的规则瓶颈并充分释放底层硬件的潜能,本文不再依赖脆弱的手工滤波,而是首次将 SPAD 耀斑抑制问题重构为基于多模态投影表征的语义分割任务。核心 idea:直接利用 SPAD 测量的物理机制,构建包含首回波、次回波与环境光照的 7 通道物理投影表征,利用深度分解与物理感知编码解耦多模态特征,并通过回波感知融合精准分割耀斑与高反核心区,最终通过无缝回波替换纠正点云深度。
方法详解¶
整体框架¶
PILF 的输入为传感器原生角度对齐的 7 通道柱面全景图(Range View),涵盖首回波的三项物理测量(强度 \(I_1\)、深度 \(D_1\)、脉宽 \(P_1\))、次回波的三项测量(\(I_2, D_2, P_2\))以及环境光照通道 \(L\)。输入经非线性能量转换和归一化后,并行送入两路物理分支:一路保留首回波的完整几何细节,另一路对双回波执行深度分解(Depth Decomposition, DD)以聚集特定距离下的多回波信息并稀释散斑噪声。两路分支共享物理感知编码器(Physics-Aware Encoder, PAE)以独立提取各通道的几何-光度特征,随后送入回波感知融合模块(Echo-Aware Fusion, EAF)结合环境光引导实现跨回波与跨深度的自适应加权。融合后的多通道特征由配备水平一维多头注意力解码器的轻量 U-Net 预测三分类掩码(耀斑、高反核心、背景)。最后,掩码指导管线在原始传感器数据中将耀斑像素的首回波替换为对应的次回波,输出无失真的纯净几何点云。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["7通道SPAD表征<br/>(I1,D1,P1, I2,D2,P2, L)"] --> B["深度分解 (DD)<br/>按首回波划分离散深度区间"]
A --> C["首回波直通流 (x1)"]
B --> D["物理感知编码 (PAE)<br/>DWConv + 元函数元调制 + GroupConv"]
C --> D
D --> E["回波感知融合 (EAF)<br/>环境光嵌入 + 深度权重 + 空间门控"]
E --> F["定向注意力 U-Net<br/>水平约束多头注意力解码"]
F --> G["回波级掩码替换<br/>耀斑像素替换为次回波测量"]
G --> H["耀斑抑制后纯净点云与深度图"]
关键设计¶
1. 深度分解(Depth Decomposition, DD):在距离维度离散化空间以聚集连贯结构并分散散斑噪声
在实际采集场景中,SPAD 的次回波信号往往夹杂着大量无规律分布的随机散斑噪声,如果简单地将两次回波特征进行通道拼接,不仅会给网络引入巨大的噪声干扰,还会破坏首回波原有的空间几何一致性。作者观察到,真实的物理耀斑及其高反核心在空间深度上具有很强的局部连续性,而且被第一回波耀斑掩盖的物体真实表面,其次回波深度与周围未受干扰的真实表面高度吻合。为了在利用次回波补全信息的同时抑制空间随机噪声,PILF 根据首回波的测距动态范围 \(D\),将其等间隔离散化为 \(N\) 个深度分桶(Depth Bins,实验设 \(N=16\))。
对于第 \(n\) 个深度区间 \(d_n = [\frac{(n-1)D}{N}, \frac{nD}{N})\),网络根据首回波深度 \(d(i, j)\) 生成空间二值掩码 \(B^{(n)}\),并将该掩码分别作用于首回波 \(x_1\) 和次回波 \(x_2\),提取分桶特征: $$ \hat{x}^{(n)} = B_1^{(n)} \odot x_1 + B_2^{(n)} \odot x_2, \quad n=1, \dots, N $$ 通过将两个回波在相同深度区间内聚合,被首回波过度遮蔽的物体轮廓在对应深度的切片中得以显现,而随机分布的离群噪声被稀释分散到不同的桶中,显著提升了信噪比与类间可分性。
2. 物理感知编码器(Physics-Aware Encoder, PAE):解耦异构物理响应并抑制高动态非线性畸变
在 Range View 的同一网格点上,强度(光子计数)、深度(到达时间)和脉冲宽度(时间展宽)从不同物理维度描述回波特性。然而,强逆反射会导致接收器饱和、脉冲明显拓宽以及时间游走造成的深度漂移,使各通道的物理响应在空间局部出现不一致。若直接使用普通卷积混合所有模态,会导致物理混叠(Physical Aliasing),破坏局部几何语义。
PAE 首先采用深度可分离卷积(Depth-Wise Conv)对各模态独立提取空间特征,得到 \(x_{\text{dw}}\)。为了抑制极端饱和和深度异常值带来的物理不稳定响应,网络利用元函数 \(\psi\) 生成自适应调制权重 \(x_{\text{meta}}\): $$ x_{\text{meta}} = \psi(\text{Conv}{1 \times 1}(x)) $$ 其中元函数选取高斯型衰减函数 }\(\psi(x) = \exp(-x^2)\),能够平滑且极具选择性地压制由过饱和光子引起的极端脉冲激活。随后,通过分组卷积(GroupConv)整合跨通道上下文,并与原特征进行残差门控融合: $$ \text{PAE}(x) = x_{\text{dw}} + \text{GroupConv}{3 \times 3}(x $$ PAE 保证了网络在提取深层空间语义的同时,保持各物理测量维度的纯净度与数值稳定性。}}) \odot x_{\text{meta}
3. 回波感知融合(Echo-Aware Fusion, EAF):自适应平衡首次回波置信度与环境光照上下文
在非耀斑区域,首回波的几何结构最精准,无需过多引入次回波;而在耀斑爆发区,首回波完全失效,次回波具有决定性主导地位。静态的特征叠加无法应对这种空间与深度维度的置信度剧烈动态变化。EAF 首先将环境光通道 \(x_0\) 编码为环境先验 \(x_{\text{amb}}\) 并与各回波特征拼接,利用卷积与 LayerNorm 稳定大动态范围特征的批次统计量。
接着,EAF 通过全局自适应最大池化分别提取首回波特征 \(x_{\text{f}}\) 与各深度分桶特征 \(\hat{x}_{\text{f}}^{(n)}\) 的通道描述子: $$ z_{\text{f}} = \text{MaxPool}(x_{\text{f}}), \quad z_{\text{f}}^{(n)} = \text{MaxPool}(\hat{x}{\text{f}}^{(n)}) $$ 在深度维度,网络通过可学习线性投影 \(\ell\) 预测每个深度区间的置信权重 \(w_{\text{d}}^{(n)}\);在空间维度,利用承载强几何信息的首回波特征生成空间调制门控 \(w_{\text{e}} = \sigma(\text{Conv}_{3 \times 3}(x_{\text{f}}))\)。最终完成两级自适应融合: $$ x \right) $$ 这一设计完美契合光子沿深度传播积分后再投射至视场平面的物理过程,实现了耀斑区域次回波强补全与正常区域首回波几何高保真的统一。}} = x_{\text{f}} + w_{\text{e}} \odot \sum_{n=1}^N \left( w_{\text{d}}^{(n)} \hat{x}_{\text{f}}^{(n)
4. 硬件兼容的无损回波级掩码校正:基于时序先验的原生数据重构
得到高精度的三分类掩码 \(M\) 后,算法直接在传感器原生数据格式上执行修正,完全绕过开销巨大的 3D 点云体素滤波或网格重构。由于耀斑物理成因是串扰诱发的提前光子触发雪崩,导致真假回波顺序颠倒。PILF 对于被判定为耀斑的像素位置(\(M(i,j)=1\)),直接用该像素采集到的真实次回波替代首回波: $$ E'{i,j,0,:} = \begin{cases} E $$ 由于所有雷达标定头、时间戳及传感器元数据均原样保留,经过校正的原始数据能够即插即用地上送给下游任何基于标准 LiDAR 数据的感知模块(如 3D 目标检测、点云里程计),展现了极强的工程实用性。}, & M(i,j)=1 \ E_{i,j,0,:}, & M(i,j)=0 \end{cases
实验关键数据¶
主实验¶
实验在基于索尼 IMX459 SPAD 激光雷达采集的 FLARE 数据集上进行,涵盖城市道路、隧道、高架、反光路牌及交通灯等多种复杂驾驶场景。基线涵盖经典 2D 分割网络、前沿 3D 点云网络及 Range View (RV) 专用网络。评价指标采用针对耀斑的 Flare IoU、高反核心的 Core IoU 以及总体 mIoU。
表 1:FLARE 数据集上与各类语义分割方法的定量对比(摘自原文 Table 1)
| 方法类型 | 方法 | 输入格式 | Flare IoU (%) | Core IoU (%) | mIoU (%) |
|---|---|---|---|---|---|
| 2D 分割 | FCN [Long et al., 2015] | \((I_{1,2}, D_{1,2}, P_{1,2}, L)\) | 57.08 | 69.22 | 63.15 |
| 2D 分割 | DeepLabV3+ [Chen et al., 2018] | \((I_1, D_1, P_1)\) | 63.21 | 75.34 | 69.28 |
| 2D 分割 | DeepLabV3+ [Chen et al., 2018] | \((I_{1,2}, D_{1,2}, P_{1,2}, L)\) | 67.72 | 76.56 | 72.14 |
| 2D 分割 | OCRNet [Yuan et al., 2020] | \((I_1, D_1, P_1)\) | 63.85 | 72.89 | 68.37 |
| 2D 分割 | OCRNet [Yuan et al., 2020] | \((I_{1,2}, D_{1,2}, P_{1,2}, L)\) | 65.69 | 73.48 | 69.59 |
| 2D 分割 | SegFormer [Xie et al., 2021] | \((I_{1,2}, D_{1,2}, P_{1,2}, L)\) | 52.26 | 69.92 | 61.09 |
| 2D 分割 | Mask2Former [Cheng et al., 2022] | \((I_{1,2}, D_{1,2}, P_{1,2}, L)\) | 52.95 | 69.21 | 61.08 |
| 3D 分割 | PVCNN [Liu et al., 2019] | \((x, y, z, I_1)\) | 35.40 | 42.10 | 38.75 |
| 3D 分割 | RandLA-Net [Hu et al., 2020] | \((x, y, z, I_1)\) | 65.40 | 68.20 | 66.80 |
| 3D 分割 | Cylinder3D [Zhou et al., 2020] | \((x, y, z, I_1)\) | 70.17 | 72.57 | 71.37 |
| 3D 分割 | PTv3 [Wu et al., 2024] | \((x, y, z, I_1)\) | 57.01 | 54.17 | 55.59 |
| RV 分割 | RangeNet++ [Milioto et al., 2019] | \((D_1, x, y, z, I_1)\) | 48.83 | 46.69 | 47.76 |
| RV 分割 | SalsaNext [Cortinhal et al., 2020] | \((D_1, x, y, z, I_1)\) | 65.66 | 76.74 | 71.20 |
| RV 分割 | RangeViT [Ando et al., 2023] | \((D_1, x, y, z, I_1)\) | 56.34 | 57.38 | 56.86 |
| 本文方法 | PILF (Ours) | \((I_{1,2}, D_{1,2}, P_{1,2}, L)\) | 78.58 | 80.06 | 79.32 |
此外,在抑制后的深度几何误差评估中(以人工标注掩码校正为真实参考),PILF 显著压低了测距误差:
表 2:耀斑抑制前后的深度误差对比(摘自原文 Table 2)
| 评测区域 | 抑制阶段 | MSE (均方误差) | MAE (平均绝对误差) | 相对降幅 (%) |
|---|---|---|---|---|
| 耀斑区域 (Flare) | 抑制前 (Before) | 0.2275 | 0.3849 | - |
| 耀斑区域 (Flare) | 抑制后 (After) | 0.0321 | 0.0613 | 85.89% (MSE) / 84.08% (MAE) |
| 前景区域 (Foreground) | 抑制前 (Before) | 0.1447 | 0.2447 | - |
| 前景区域 (Foreground) | 抑制后 (After) | 0.0219 | 0.0413 | 84.85% (MSE) / 83.11% (MAE) |
消融实验¶
消融实验深入验证了超参数设置、输入模态组合、数据增强以及核心网络模块的有效性。
表 3:深度分桶数 \(N\) 与 PAE 元函数 \(\psi(x)\) 的消融(摘自原文 Table 3)
| 深度分桶数 \(N\) | mIoU (%) | 元函数 \(\psi(x)\) | mIoU (%) |
|---|---|---|---|
| \(N = 4\) | 78.21 ± 0.73 | \(1 / (1 + x^2)\) | 77.62 ± 0.30 |
| \(N = 8\) | 77.87 ± 0.46 | \(1 / \exp(x^2)\) | 78.49 ± 0.29 |
| \(N = 16\) | 78.49 ± 0.29 | \(\cos(\frac{\pi}{2} \cdot \tanh(x))\) | 77.67 ± 0.41 |
| \(N = 32\) | 77.28 ± 0.60 | \(1 / (1 + \|x\|)\) | 77.83 ± 0.22 |
表 4:关键模块与输入模态的逐步消融结果(摘自原文 Table 4)
| 配置分组 | 实验变量 | 测试配置细节 | mIoU (%) |
|---|---|---|---|
| 模态消融 | 仅首回波 | 无 \(x_2\)、无 \(x_0\) | 75.18 ± 0.45 |
| 模态消融 | 首回波 + 次回波 | 含 \(x_2\)、无 \(x_0\) | 75.56 ± 0.81 |
| 模态消融 | 首回波 + 环境光 | 无 \(x_2\)、含 \(x_0\) | 77.67 ± 0.22 |
| 模态消融 | 完整模态 | 含 \(x_2\) + 含 \(x_0\) | 78.49 ± 0.29 |
| 模块消融 | 简化骨干网络 | 仅基础 Conv 替换 PAE/EAF, \(N=1\) | 64.41 ± 0.35 |
| 模块消融 | 引入 PAE | 仅 PAE 模块 | 71.01 ± 0.49 |
| 模块消融 | 引入 PAE + EAF | 加入深度分解与回波融合 | 75.40 ± 0.54 |
| 模块消融 | 完整模型 (PILF) | PAE + EAF + 水平注意力解码器 | 78.49 ± 0.29 |
关键发现¶
- 3D 与通用 2D 网络在物理先验上的缺失:通用点云网络(如 PVCNN、PTv3)由于仅依赖首回波构建的 3D 坐标 \((x,y,z)\),在空间中看到的耀斑就是“真实存在的离散团簇”,极易误判,mIoU 显著落后于 PILF 达 20%~40%。
- 核心模块贡献度显著:从基线逐步添加 PAE(+6.60%)、EAF(+4.39%)及定向注意力机制(+3.09%),使 mIoU 从 64.41% 跃升至 78.49%,表明物理感知解耦与自适应跨回波聚合是解开 SPAD 耀斑的关键。
- 环境光与次回波的强互补性:单靠首回波性能仅为 75.18%,引入环境光后提升至 77.67%(有助于将反光材质与过度曝光区分开),再联合次回波互补深度信息,达到最高 78.49%。
亮点与洞察¶
- 任务视角重构的工程智慧:将原本棘手的低级信号处理难题,转化为数据驱动的 2D Range View 语义分割任务。既避开了耗时繁重的 3D 点云处理,又完全不需改动硬件,单帧耗时仅 37 ms(单卡 RTX 3090),满足 10 fps 在线运行要求。
- “坏首回波换好次回波”的物理本质闭环:巧妙利用 SPAD 雪崩击穿的时序物理先验,意识到耀斑不是“噪声”,而是“被提前截胡的假首回波”。通过分割网络定位欺骗区后直接进行回波替换,完美无损还原底层场景结构。
- FlareAug 解决极度不平衡数据分布:真实路测中背景:耀斑:高反核心的像素比例极度失衡(约为 100:2:1)。针对物理耀斑横向扩散特性设计的分侧(左右半图)“裁剪-拼接”增强策略,使模型在小样本条件下快速学到鲁棒的泛化表征。
局限与展望¶
- 极端多回波污染与次回波缺失:作者指出,当高反目标过近或反射极度剧烈导致次回波同样被饱和破坏时,回波替换策略将失去有效基准,面临欠校正或深度空洞问题。
- 对特定水平扩散先验的依赖:当前网络解码器中的单向注意力和 FlareAug 策略均针对该款特定 SPAD 传感器的水平串扰方向定制,若换用具有纵向或各向同性光学串扰特征的新架构芯片,需要重新调整注意力几何约束。
- 未来方向:探索端到端联合下游感知任务(如 3D 目标检测与语义占用预测),将耀斑掩码和多回波特征直接作为感知头的置信度权重输入,实现更高层次的感知鲁棒性。
相关工作与启发¶
- vs 传统硬件与信号处理方法(如 Chen et al. [3], Jahromi & Kostamovaara [17]):传统方法依赖手工设定阈值、门控窗口和复杂的硬件物理隔离,在跨环境、动态曝光下泛化性差;本文采用数据驱动学习,自适应拟合非线性光子响应,鲁棒性与精度大幅提升。
- vs 稠密波形全波形雷达去鬼影方法(如 Ghost-FWL [Ikeda et al., 2026], Scheuble et al. [31]):现有波形去噪方法假设能够获取连续密集的飞行时间直方图全波形,数据带宽开销极其庞大;本文立足车载工业落地的实际带宽限制,仅依赖首次回波及环境光离散表征,更贴合量产车载芯片架构。
- vs 经典 3D 点云分割(如 Cylinder3D [41], SalsaNext [8]):3D 空间方法割裂了点云形成过程中的光子时序到达关系,将受损的首回波当作真实空间点;本文立足物理成因,在 Range View 下联合多回波信息,以极低算力达成了领先的抑制效果。
评分¶
- 新颖性: ⭐⭐⭐⭐☆(首次将 SPAD 耀斑抑制形式化为多模态语义分割任务,回波替换逻辑极具物理美感)
- 实验充分度: ⭐⭐⭐⭐⭐(基于索尼 IMX459 实测雷达构建首个专用数据集 FLARE,对比 2D/3D/RV 多类基线,消融完备且有深度几何误差验证)
- 写作质量: ⭐⭐⭐⭐⭐(物理建模清晰,图表绘制精美,问题阐述与设计动机逻辑严密)
- 价值: ⭐⭐⭐⭐⭐(直击固态 SPAD 激光雷达上车的关键安全隐患,具备极高的自动驾驶工业落地与学术启发价值)