Explainability-aware Frustum Attack: Exposing Structural Vulnerabilities in LiDAR-Based 3D Object Detectors¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/SecMindLab/Saliency_LiDAR
领域: 自动驾驶
关键词: 3D目标检测, 点云显著图, 积分梯度, 视锥对抗攻击, 对抗鲁棒性
一句话总结¶
本文提出面向车载激光雷达目标检测的显著性分析框架 SALL,通过积分梯度跨场景聚合生成类别级通用显著图,并基于此设计了视锥对抗攻击 EFA,仅扰动少量关键角向视锥即导致目标检测失效,揭示了检测器特征高度集中于稀疏几何边缘的结构性脆弱性。
研究背景与动机¶
基于车载激光雷达(LiDAR)的 3D 目标检测模型是自动驾驶感知系统的安全基石。然而,深度神经网络在点云表征下的结构脆弱性机理仍未被充分解析。此前关于 3D 对抗鲁棒性的解释性研究主要局限于离散 CAD 物体分类任务(如 ModelNet40),通过积分梯度计算关键点集。但这类工作脱离了真实的自动驾驶场景——在真实行车环境中,背景杂波、遮挡、距离衰减引起的点云稀疏性,以及检测流程中锚框提议、边界框回归与非极大值抑制(NMS)的存在,彻底改变了模型的决策与依赖结构。
另一方面,针对自动驾驶的主动激光雷达欺骗攻击(LiDAR Spoofing)已从早期的单点微调演进到视锥级别的大范围物理隐藏攻击(如 PRA、HFR、A-HFR)。这类攻击利用激光发射硬件扰动目标所在视锥内的所有返回脉冲,破坏力显著,但存在严重的效率瓶颈:由于缺乏对检测器内部决策机理的理解,攻击者往往采取地毯式无差别攻击(如覆盖目标涉及的全部 30° 角向视锥),这不仅需要极其庞大的攻击预算,还极易引发高频激光发射器的硬件过热与实车跟踪失准。
由此产生的核心矛盾在于:粗暴的整视锥攻击破坏力强但物理成本与能耗极高,而微小扰动的点级别攻击操作隐蔽却难以稳定击穿复杂检测流水线。要破解这一僵局,必须弄清楚检测器在复杂 3D 场景中究竟依赖哪些局部空间结构,以及这种几何依赖在不同实例、不同模型与不同数据集之间是否具备通用性。核心 idea:利用积分梯度跨实例聚合提炼出类别级通用 3D 显著图,并据此设计几何一致的视锥攻击策略(EFA),仅针对决定检测器生死的极少部分关键视锥施加光束受限扰动,以最小物理开销实现高效的目标隐形。
方法详解¶
整体框架¶
本文构建了集“显著性归因挖掘”与“定向视锥对抗攻击”于一体的双阶段闭环框架。第一阶段为 SALL(Saliency-LiDAR),负责从原始连续 3D 点云场景中提取目标点云,利用基于物理参考基点的积分梯度计算点级归因值,经自适应体素化投影将其标准化为二维贡献矩阵,并在多场景、多检测器间求和聚合,形成目标类别的通用二维显著图。第二阶段为 EFA(Explainability-aware Frustum Attack),将待攻击场景中的目标按激光雷达方位角离散化为若干微元视锥,依据 SALL 通用显著图的权重对视锥的重要性进行排序,优先对最关键的视锥实施光束一致的距离位移或点消除扰动,最终合成逼真的对抗场景。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["原始输入点云场景 S"] --> B["目标点云提取与背景分离"]
B --> C["实例级积分梯度的自适应投影与场景聚合<br/>计算点级归因并聚合为通用显著图"]
C --> D["保持物理光束一致性的视锥几何建模<br/>按雷达方位角划分 1° 微元视锥索引"]
D --> E["显著性先验引导的最小预算扰动选择<br/>依据显著图排序优先扰动关键视锥"]
E --> F["扰动点与背景点融合"]
F --> G["对抗点云场景 S' 输出至检测器"]
关键设计¶
1. 实例级积分梯度的自适应投影与场景聚合:消除行车实例差异并提取跨模型共性
在真实行车环境中,同类目标(如汽车)在不同距离、朝向与遮挡状态下具有截然不同的点云密度与空间外形,单实例逐点计算的梯度极度嘈杂且无法复用。为获得对整个目标类别普适的结构归因,SALL 对积分梯度(Integrated Gradients, IG)进行了物理感知与结构维度的双重重构。首先,在计算目标点云 \(T^i\) 的积分梯度时,将起点设定为感兴趣区域(Region of Interest, ROI,将目标真值框外扩 1.5 倍)的最近角点或激光雷达传感器原点 \(b_0 = (x_0, y_0)\),以严格遵守点云沿光束传播的物理约束。目标点 \(p_j\) 沿差值向量 \(z_j = (x_j - x_0, y_j - y_0)\) 线性插值演化: $\(p_j' = p_j + \frac{N}{M} z_j, \quad N \le M\)$ 将插值后的目标与真实背景合并输入目标检测器 \(D\),通过与预测框的 IoU 匹配筛选出最优检测分支并回传梯度,在 \(M=25\) 个积分步长内累积得到单场景点级显著图 \(C_p\)。随后,针对不同目标尺寸各异的问题,采用自适应体素索引(Adaptive Indexing):将点云转换至目标自身的局部包围框坐标系下,根据当前 ROI 尺度动态设定体素间距,将 3D 点级归因自适应投影汇总至固定的 \(64 \times 32\) 二维水平像素贡献矩阵 \(C_v\) 中。最后,对成百上千个场景的 \(C_v\) 实施矩阵累加,得到类别级通用显著图 \(C_{uv} = \sum_{k} C_v^{(k)}\)。该设计不仅滤除了单个场景特有的偶发噪声,更揭示出关键几何模式:PointPillars 等检测器高度依赖车辆左前角点,而 SECOND 则高度聚焦于车身边缘的典型“L 形”轮廓。
2. 保持物理光束一致性的视锥几何建模:将连续 3D 空间严格映射至激光雷达角分辨率
物理世界中的硬件激光欺骗无法随意凭空挪动独立离散点,而必须沿着激光雷达发射与接收脉冲的光路方向施加作用。为了使攻击在数字与物理层面均具备严密的合理性,EFA 构建了高精度的光束一致性视锥离散化机制。以激光雷达发射光心 \(P_0 = (x_0, y_0, z_0)\) 为原点,将提取出的目标点云 \(T^i\) 中的任意空间点 \(P_j = (xj, yj, zj)\) 计算其水平方位角 \(D_j\): $\(D_j = \arctan\left(\frac{y_j - y_0}{x_j - x_0}\right) \times \frac{180^\circ}{\pi}\)$ 通过遍历包含目标外扩包围框角点在内的所有几何点,确定该目标在雷达视场中的最小方位角 \(D_{\min}\)。随后,以匹配主流激光雷达角分辨率的固定步长 \(D_{\text{step}} = 1^\circ\) 为微元基准,为每一个目标点计算其所归属的相对视锥索引 \(f_{id}\): $\(f_{id} = \left\lfloor \frac{D_j - D_{\min}}{D_{\text{step}}} \right\rfloor\)$ 这一视锥离散化彻底将目标从非结构化的 3D 点集重构为角向连续排布的射线束集合。通过将 2D 柱状投影索引与体素网格无缝对接,使上游生成的二维显著性先验矩阵能够直接映射为对应角向视锥的物理关键性打分。
3. 显著性先验引导的最小预算扰动选择:以稀疏视锥打击打破无差别泛扰动依赖
传统视锥攻击假定必须封锁覆盖整个物体的连续 30° 广角范围,极易遭遇发射机过热和能量耗尽。EFA 摒弃了随机或居中覆盖的经验假设,提出了“关键视锥优先”(Critical Frustum First)的预算分配准则。在选定受限视锥数量预算 \(B\)(如 \(B \le 15\) 或针对行人 \(B \le 3\))后,算法根据映射到该视锥内所有点对应的 \(C_{uv}\) 显著性分值总和对所有候选视锥降序排列,仅锁定贡献度最高的前 \(B\) 个角向视锥。在扰动执行端,EFA 模块化解耦了选择与实施:既支持完全剔除视锥内脉冲的“移除扰动”(Remove Perturbation,模拟脉冲压制拦截),也支持沿各自光路射线方向前后移动反射点的“移位扰动”(Shift Perturbation,模拟脉冲延时与提前伪造)。实验揭示了一个深刻机理:攻击有效性的决定性因素是“视锥选择算法”,而在选准高显著性视锥的前提下,无论是移位还是直接抹除,对检测器网络高层特征与包围框提议的破坏效果几乎相同。这使攻击者在硬件受限时,只需对极少数关键方位发射微弱欺骗信号,即可破坏检测器的边缘拓扑关联。
一个完整示例¶
以一辆处于本车前方 5–8 米处的轿车为例,目标占据水平视场约 30 个连续的 \(1^\circ\) 角向视锥。若采用常规 HFR 或 PRA 基线攻击,需连续发射覆盖全部 30 个视锥的激光扰动,易导致物理器件过热。而在 EFA 流程中: 1. SALL 先行加载离线聚合生成的通用车辆显著图(\(64 \times 32\) 矩阵,高权重高度集中在车辆边缘轮廓和面对雷达的 L 形转角处); 2. EFA 实时计算目标所覆盖的 30 个视锥编号 \(f_{id} \in [0, 29]\),并将每个视锥内包含的激光点反向投影至显著图网格中,累加得到 30 个视锥的显著性分值向量; 3. 算法输出显著性排序,发现仅靠最左侧轮廓和拐角处的第 4、5、6、12、13 号等 10 个视锥便汇聚了超过 70% 的正向判别置信度; 4. 攻击系统仅针对这 10 个关键视锥施加光束沿线脉冲延时(Shift)或拦截(Remove),其余 20 个视锥保持真实环境点云原貌; 5. 该扰动使 PointPillars 的前向置信度由 0.92 骤降至 0.18,未能通过检测阈值,在无需攻击目标主体中央大片平坦区域的前提下,以仅三分之一的物理扰动预算成功隐藏该车。
实验关键数据¶
主实验¶
评估在 KITTI 与 nuScenes 验证集上展开,受测检测器包括柱状表征模型 PointPillars 与三维稀疏卷积模型 SECOND。关注目标为近处车辆(5–8 m)与易受威胁的行人目标(0–20 m)。对比基线为此前顶会发表的 SOTA 视锥攻击方法 HFR 与 PRA。
| 数据集 / 目标类型 | 攻击方法 | 扰动视锥预算 | 攻击成功率 (ASR %) | 相比全视锥基准开销下降 |
|---|---|---|---|---|
| nuScenes (Car) | PRA (基线) | 20 视锥 | 73.47% | 0% (参考基准) |
| nuScenes (Car) | HFR (基线) | 20 视锥 | 78.29% | 0% (参考基准) |
| nuScenes (Car) | EFA (SALL-Shift, 本文) | 20 视锥 | 96.55% | 0% (+18.26% ASR) |
| nuScenes (Car) | EFA (SALL-Shift, 本文) | 10 视锥 | 78.50% | -50.0% 视锥需求 |
| KITTI (Car) | PRA (基线) | 20 视锥 | ~62.00% | 0% (参考基准) |
| KITTI (Car) | HFR (基线) | 20 视锥 | ~67.00% | 0% (参考基准) |
| KITTI (Car) | EFA (SALL-Shift, 本文) | 20 视锥 | 97.00% | 0% (+30.00% ASR) |
| KITTI (Car) | EFA (SALL-Shift, 本文) | 15 视锥 | ~75.00% | -25.0% 视锥需求 |
| KITTI (Pedestrian) | PRA (基线) | 3 视锥 | 73.61% | 0% (参考基准) |
| KITTI (Pedestrian) | HFR (基线) | 3 视锥 | 74.25% | 0% (参考基准) |
| KITTI (Pedestrian) | EFA (SALL-Shift, 本文) | 3 视锥 | 97.00% | 0% (+22.75% ASR) |
消融实验¶
显著图跨模型与跨数据集迁移性测试(基于 KITTI 与 nuScenes 数据集,Car 类别在 20 或 30 视锥预算下的攻击成功率 ASR %):
| 显著图来源 (Map Src.) | 目标评测模型 / 数据集 | 攻击成功率 (ASR %) | 关键机制与说明 |
|---|---|---|---|
| SECOND (KITTI) | SECOND | 88.12% | 单一检测器同源攻击 |
| PointPillars (KITTI) | SECOND | 94.84% | 跨模型迁移提升 6.72%,证明通用边缘特征强于单模型噪声 |
| Joint (PointPillars+SECOND) | SECOND | 95.29% | 跨架构聚合增强共同关键区域、压制特异性噪声 |
| SECOND (KITTI) | PointPillars | 97.63% | 单向跨模型保持极高攻击有效性 |
| PointPillars (KITTI) | PointPillars | 98.88% | 同源攻击基准 |
| Joint (PointPillars+SECOND) | PointPillars | 99.44% | 联合显著图达到最高破坏率 |
| KITTI (PointPillars) | nuScenes | 96.64% | 跨数据集完全泛化,无需重新在目标域运行 IG |
| nuScenes (PointPillars) | KITTI | 83.82% | 稀疏传感器数据集向密集数据集迁移依然保持高威慑 |
| Joint (KITTI+nuScenes) | nuScenes | 96.90% | 多源数据聚合显著图综合泛化能力最强 |
关键发现¶
- 选择策略起决定性作用,扰动形式影响轻微:在固定 30 视锥预算下,基于 SALL 的关键视锥优先选择策略能将目标召回率彻底压低至 0.0,而随机选择视锥需要消耗多达 50 个视锥(即整车及周围扩增区域的全部点云)。只要准确定位关键几何位置,无论是将点移位还是直接删除,破坏力差异几乎为零。
- 距离越远的目标越脆弱:远距离(如 25 米)的车辆因其原本点云表征即高度稀疏,仅施加 5 个微元视锥的扰动就能让 94.5% 的车辆直接隐形。
- 显著图具备跨模型与跨数据源超强通用性:由 PointPillars 提炼的显著图去攻击 SECOND,攻击成功率反而比 SECOND 本身导出的显著图高出近 7 个百分点(94.84% vs 88.12%)。这有力证实了显著图捕获的是 3D 物体在点云传感器观测下的本质拓扑脆弱点(如物体外轮廓 L 形分界面),而非过拟合特定网络参数的梯度伪影。
亮点与洞察¶
- 从离散样本诊断跃迁为类别通用物理先验:不同于以往每攻击一个新目标都需重新反向传播迭代优化的“实例级对抗样本”,SALL 借助自适应体素网格将多样化的行车点云投影对齐并累加,成功提炼出全类别统一的物理脆弱面。这种通用显著图支持近乎零耗时的离线加载与在线极速打击。
- 戳破 3D 深度感知的“空间冗余”幻觉:业界通常假设全景激光雷达拥有成千上万个空间反射点,具备天然的几何冗余与防篡改能力。本文用严谨的数学归因证明,现代 3D 检测器的大脑深处其实只紧盯着极少数关键特征(如几何边沿的微小突变),这一认知为设计新型空间冗余感知架构敲响了警钟。
- 可复用的物理鲁棒性评估范式:本文建立的“物理连续光束建模-微元划分-显著性引导索引”流程不仅适用于激光雷达对抗攻击,还能无缝迁移到雷达(4D Radar)等基于射线的空间传感器鲁棒性分析中。
局限与展望¶
- 作者承认的局限:目前研究主要聚焦于单帧单传感器感知(LiDAR-only 3D 检测),尚未延伸评估在时序多帧融合(Multi-frame temporal tracking)或相机-激光雷达多模态融合感知系统中的鲁棒性表现。
- 外部观察的局限:攻击模型依赖于能够获取目标实时的外扩几何边界框以进行视锥划分,若感知管线在上游引入基于空域密度的动态前置滤波,可能会在一定程度上干扰视锥索引的精准对齐;此外,在超高速颠簸行驶中,激光发射硬件的抖动可能对 \(1^\circ\) 精度视锥的命中率产生更高要求。
- 改进与防御思路:现有的基于几何阴影(Shadow-based)的被动防御方案在 KITTI 上产生了高达 60.96% 的虚警率,无法区分自然稀疏与恶意抹除;未来的根本防御必须从检测模型内部入手,在训练目标中引入空间依赖发散正则项(Spatial Reliance Diversification),强制特征编码器综合利用物体内部反射面,避免决策权重过度倾斜于极端边缘。
相关工作与启发¶
- vs Tan et al. (WACV 2023):Tan 等人首次利用积分梯度定位离散点云分类(ModelNet40 CAD 模型)的关键点;本文将这一思想推向真实的动态行车场景,克服了多目标检测、杂波干扰、距离稀疏性与多阶段流水线的挑战,并首次实现了跨场景/跨架构的通用显著图聚合。
- vs HFR / A-HFR (NDSS 2024 / NDSS 2025):HFR 等工作侧重于物理硬件发射与大范围整视锥覆盖欺骗,缺乏对模型内部决策敏感度的理解,攻击开销大且受限于发射器发热;本文提出的 EFA 利用 SALL 显著图将攻击视锥预算压减了 25%–50%,在更严苛的高速受限物理工况下(50 km/h)依然保持超过 92% 的致盲成功率。
- vs ORA (AutoSec 2021):ORA 采用局部点级位移进行欺骗;本文将 SALL 扩展至点级攻击后,以 600 个点即可达到 ORA 1200 个点的破坏效果,在点级别与视锥级别双双证明了解释性引导对攻击能效比的巨大提升。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次将积分梯度解释性方法成功升级为类别级通用的 3D 激光雷达先验,并在自动驾驶真实行车场景中打通“解释-攻击”闭环。
- 实验充分度: ⭐⭐⭐⭐⭐ 覆盖 KITTI 与 nuScenes 双主流数据集、PointPillars 与 SECOND 两大经典模型,涵盖跨模型、跨数据集、物理硬件发射误差及多种行车车速下的全面严谨评测。
- 写作质量: ⭐⭐⭐⭐⭐ 问题意识鲜明,数学表述与物理约束紧密结合,动机到方案的逻辑推演非常顺畅。
- 价值: ⭐⭐⭐⭐⭐ 揭示了自动驾驶 3D 感知在特征依赖上的本质结构脆弱性,为下一代鲁棒感知架构与物理防御机制的研发提供了极具启发性的基准。