跳转至

Ray-Path-Aware Virtual Point Removal on 2D Layer-Wise Nearest Point Map

会议: ECCV 2026
论文: ECCV 官方页面
领域: 自动驾驶 (Autonomous Driving) / 3D 视觉 (3D Vision)
关键词: 虚拟点去除、LiDAR 点云、等距柱状投影、光线路径感知注意力、多回波表征

一句话总结

针对激光雷达扫描反射物体(如玻璃幕墙)时产生的结构性虚假镜像点问题,本文首次摆脱显式三维反射面拟合与局部对称性假设,提出在二维等距柱状投影域下基于分层最近点图(Layer-Wise Nearest Point Map)与光线路径感知注意力(Ray-Path-Aware Attention)的端到端去除框架,将 F1 分数提升至 0.7895~0.8062 并实现超两个数量级的计算加速。

研究背景与动机

激光雷达(LiDAR)凭借高精度几何探测能力已成为自动驾驶与高精建图的核心传感器,而多回波技术的普及进一步增强了对复杂多径反射与半透明障碍物的穿透感知。然而,当发射的激光脉冲穿过玻璃、大理石或抛光金属等高反射率介质时,光束往往发生镜面反射击中其他物理物体,但传感器仍按照直线飞行时间(ToF)记录测距。这一物理机制导致点云中出现形貌结构完整、空间密度一致但并不对应真实物理实体的“虚拟点(Virtual Points)”。由于这些虚拟点在局部具有连续合理的几何外貌,传统的几何统计滤波与密度聚类算法难以将其滤除,严重威胁下游的目标检测、点云配准、定位建图与障碍物避碰安全。

以往的单帧虚拟点去除方案普遍依赖多阶段几何流水线,即“反射区域检测 \(\rightarrow\) 显式 3D 反射平面拟合 \(\rightarrow\) 跨平面镜像对称性校验”。这种多阶段范式存在根本性的结构缺陷:真实场景中玻璃表面的点云往往稀疏、不完整或存在污损,表面法向量的微小估计偏差以及反射介质的粗糙度都会在空间投影中产生剧烈发散;一旦前序反射面提取出现误差,后续的对称性检验便会全盘失效,导致误差在阶段间严重累积。此外,跨视点多帧方法受制于动态物体干扰与高精度位姿同步,难以在单帧感知中部署。

面对这一矛盾,本文摒弃了在非结构化 3D 点云中显式寻找并拟合反射面的传统思路,转而从传感器成像物理本质出发:核心 idea:将虚拟点去除重构为 2D 等距柱状投影(ERP)域下的光线对齐几何推理任务,通过构建保留连续几何的多回波分层最近点图,并引入沿真实反射物理光路约束特征聚合的 Ray-Path-Aware Attention,使网络在免除显式表面拟合的前提下端到端学习实体与虚像之间的反射对称性。

方法详解

整体框架

本文提出的端到端网络直接以包含真实点与虚拟点的原始 3D LiDAR 点云为输入,首先通过投影变换将其映射到二维等距柱状投影(ERP)空间,并构建分层最近点图(Layer-Wise Nearest Point Map, LNPM)。随后,基于带有对称注意力块(Symmetry Attention Block)的 U-Net 编解码器在 2D 像素域学习虚假点判别特征,最后经过逻辑回归输出像素级分类标签,并通过 LNPM 的逆映射反投影恢复出滤除虚拟点的干净 3D 点云。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    In["输入 3D 点云<br/>含真实点与反射虚拟点"] --> LNPM["分层最近点图表征<br/>沿发射光线对齐多回波并保留几何连续性"]
    LNPM --> Enc["U-Net 编码器<br/>步长卷积下采样提取多尺度多层特征"]
    Enc --> SAB["对称注意力块<br/>光线路径感知注意力 + 法向量估计 + LeFF + GPSA"]
    SAB --> Dec["U-Net 解码器<br/>转置卷积上采样重建全分辨率多层特征"]
    Dec --> Pred["2D 像素多层标签预测<br/>二值分类输出虚拟点概率图"]
    Pred --> Unproj["2D 到 3D 逆映射反投影<br/>按最近参考距离将预测结果赋给原始 3D 点"]
    Unproj --> Out["输出纯净 3D 点云<br/>完全滤除反射虚像并保留真实物理几何"]

关键设计

1. 分层最近点图(Layer-Wise Nearest Point Map):克服传统区间切片的几何离散化断裂
传统的 2D 距离图(Range Map)仅保留单条光线上的首个或最近回波,丢弃了反射虚像的多回波关键信息;而简单的多层切片方法通常将距离范围划分为固定区间并将 3D 点分配到对应深度桶内,这极易在区间边界处截断连续物体表面,并将镜面对称的一对真实点与虚拟点孤立在不同切片中,阻碍空间对应关系的建立。为此,LNPM 采用以“层(Layer)”为中心的分配机制:对于 ERP 网格中的每个像素 \((u, v)\),聚集对应入射光线 \(R(u, v)\) 上的所有多回波候选点 \(S(u, v)\)。设预设的 \(L\) 个深度参考层各自具有基准距离 \(d_i\),第 \(i\) 层像素值由离该基准距离绝对差最小的实际测距点填充: $\(M_i(u, v) = \|\hat{p}_j\|, \quad \text{其中} \quad \hat{p}_j = \arg\min_{p_j \in S(u, v)} |\|p_j\| - d_i|\)$ 这一设计具有独特的物理自适应性:在无反射的正常光线上,所有层均采样同一个实体点,自然保持了物体表面的致密性与连续性;而在遭遇反射介质的穿透/多回波光线上,不同层会分别命中真实反射介质点及后方的虚拟镜像点。当参考距离介于真实点与虚拟点之间时,两者甚至能够同时显现在相邻的层级中,为后续注意力机制捕捉镜像线索提供了结构化的 2D 连续输入。

2. 光线路径感知注意力(Ray-Path-Aware Attention):将反射光学轨迹注入特征交互空间
在通用的 Transformer 注意力机制中,全局全连接计算代价巨大且极易与背景自然对称物(如对称建筑物柱子、成排窗框)产生虚假匹配;而局部窗口注意力又无法跨越长距离检索虚像。本文从物理光学出发,利用第一层最近点图 \(M_1\)(对应光线首先击中的介质表面)估计局部法向量 \(N(u, v)\)。结合入射激光方向矢量 \(r = R(u, v)\),利用镜面反射定律解析计算反射光线方向: $\(\bar{r} = r - 2(r \cdot n)n\)$ 根据多回波集合中的最大最小测距限制光线行程 \([t_{\min}, t_{\max}]\),在 3D 空间中沿光路均匀离散采样点集 \(Q(u, v) = \{o + t\bar{r} \mid t \in [t_{\min}, t_{\max}]\}\),再将其重新投影回 ERP 域,得到一条连接真实发射原点与潜在虚假镜像区域的 2D 弯曲投影轨迹。网络仅在投影光路沿线的 \(K\) 近邻像素子集内执行注意力特征加权聚合,强行将注意力的感受野约束在符合波动光学传播规律的真实物理轨迹上。

3. 对称注意力块(Symmetry Attention Block):局部几何、跨层交互与物理对称的一体化融合
为了协同处理层内几何形貌与跨层光路依赖,模型设计了复合型的 Symmetry Attention Block。该模块由三部分组合而成:首先通过局部增强前馈网络(LeFF)利用深度可分离卷积提取每层内的细粒度局部几何特征,强化表面曲率与边缘细节;接着通过全局位置自注意力(GPSA)促进全高度与全方位视角下不同参考深度层之间的长程信息流动;最后由 Ray-Path-Aware Attention 执行沿光学轨迹的定向约束聚合。三者互补,形成了一个无须显式重建反射平面、却能内生性感知反射几何对称特性的紧凑表征空间。

4. 2D 到 3D 严格一致的逆映射反投影(2D-to-3D Unprojection)
模型最终在 2D ERP 域输出大小为 \(H \times W \times L\) 的二值概率图 \(\hat{Y}\)。在将分类结果映射回 3D 点云时,为了消除分配歧义,对于任意原始 3D 点 \(p\),根据其到原点的实际测距 \(\|p\|\) 逆向检索距离最近的预设参考层编号 \(\hat{i} = \arg\min_i |\|p\| - d_i|\),并在 ERP 坐标 \((u, v) = \Pi_{\text{ERP}}(p)\) 处查询预测标签 \(\hat{Y}_{\hat{i}}(u, v)\)。若分类置信度超过 0.5 则标记为虚拟点并彻底删除。整个逆映射过程与前向 LNPM 投影严格对偶,无需任何启发式聚类或空间后处理清洗步骤。

损失函数 / 训练策略

网络直接在具有确定光线对应关系的 ERP 2D 网格上监督训练。由于激光雷达扫描存在视场角限制与空载区域,定义有效回波掩膜 \(V \in \{0, 1\}^{H \times W \times L}\),仅对实际存在点云采样的网格位置计算带掩码的二值交叉熵(BCE)损失: $\(\mathcal{L} = -\frac{1}{|V|} \sum_{(u, v, i) \in V} \left[ y_i(u, v) \log \hat{y}_i(u, v) + (1 - y_i(u, v)) \log(1 - \hat{y}_i(u, v)) \right]\)$ 模型首先在基于 Semantic3D 生成的大规模合成反射数据集(3,000 个含点级标签的 3D 点云)上预训练 100 个 epoch,建立鲁棒的通用几何反射先验;随后在真实雷达数据集(如 UNIST LS3DPC 或 3DRN)上进行 20 个 epoch 的微调,有效避免了小规模真实雷达标注数据的过拟合风险。

实验关键数据

主实验

论文在两个真实世界地面三维激光雷达数据集(UNIST LS3DPC 与 3DRN)上进行了全面评测,对比了三种代表性多阶段流水线方法(Yun and Sim [25]、Lee et al. [11]、Fang et al. [3])。

方法 微调数据 (FT) UNIST 精确率 (Prec.) UNIST 召回率 (Rec.) UNIST F1 分数 UNIST 平均耗时 3DRN 精确率 (Prec.) 3DRN 召回率 (Rec.) 3DRN F1 分数
Yun and Sim (PAMI 2019) - 0.7206 0.7475 0.7151 2h 5m 0.5361 0.7192 0.6143
Lee et al. (RA-L 2023) - 0.6089 0.7906 0.6848 2h 2m - - -
Fang et al. (ISPRS 2025) - 0.7627 0.7534 0.7580 37m 43s 0.7436 0.8291 0.7840
本文方法 (仅合成数据预训练) - 0.7959 0.7238 0.7541 8.2s 0.8043 0.7711 0.7874
本文方法 (跨数据集微调) 3DRN / UNIST 0.8194 0.7618 0.7895 8.2s 0.8239 0.7894 0.8062

(注:表 1 实验数据摘自原文 Table 1。在跨数据集微调评估中,评估 UNIST 时使用 3DRN 微调模型,评估 3DRN 时使用 UNIST 微调模型,展现了极强的领域泛化能力。)

消融实验

论文在 UNIST 数据集上对 2D 投影建图策略、注意力机制变体以及法向量估计算法的鲁棒性进行了系统的消融分析。

消融配置 / 注意力模块 精确率 (Prec.) 召回率 (Rec.) F1 分数 核心差异说明 (摘自原文 Table 2a)
Naive projection (固定距离区间投影) 0.1715 0.2768 0.2043 固定深度桶截断表面连续性,性能发生断崖式下跌
ViT (标准全局自注意力) 0.6456 0.6613 0.6533 缺乏物理先验,极易在无反射物体处产生虚假关联
UFormer (局部窗口增强 Transformer) 0.5456 0.7427 0.6290 局部注意力机制无法捕获长程跨空间镜像对称关系
H-win (水平条形窗口注意力) 0.5331 0.8654 0.6597 虽能扩大水平搜索但误删大量真实结构,精确率极低
H-win + V-win (十字交叉窗口注意力) 0.6360 0.7293 0.6794 启发式固定轴向搜索,无法匹配任意倾斜的反射光线
本文完整方法 (LNPM + Ray-Path Attention) 0.8194 0.7618 0.7895 光学光路物理约束使虚假点判别达到最佳精度与平衡

针对法向量噪声的鲁棒性测试(Table 2b):当将默认的 3D PCA 法向量替换为计算速度更快的 2D 深度图梯度估计(2D Depth)时,F1 分数仍维持在 0.7705;当人为在表面法向中加入 \([0, 9^\circ]\) 的均匀噪声扰动时,F1 从 0.7895 仅微跌至 0.7516;即使注入 20% 的 \([30^\circ, 50^\circ]\) 极端离群值误差,F1 仍保留在 0.7306,验证了本框架对粗糙或低质法向量输入具有很强的容错宽容度。

关键发现

  • 投影表示是性能分水岭:将 LNPM 替换为固定深度区间的 Naive projection 时,F1 指标从 0.7895 骤降至 0.2043(下降达 74%)。这表明 multi-return 点云在 2D 空间的几何连续性维护是卷积与注意力网络能够生效的底层先决条件。
  • 推理效率呈跨越式突破:传统几何流水线受制于反复的 3D 空间邻域搜索与拟合,单帧处理耗时普遍在 30 分钟至 2 小时以上(Yun & Sim 耗时 2h 5m,Fang et al. 耗时 37m 43s);而本文方法将全部计算折叠入 2D 卷积网络与沿线注意力,单帧推理仅需 8.2 秒,加速比超 270~900 倍。
  • 高精确率保障真实物体不被误删:在点云清洗任务中,误将真实障碍物当成虚假点删除(低 Precision)对于自动驾驶等下游控制来说是致命隐患。本文在仅使用合成数据预训练时即达到 0.7959 的精确率,微调后达 0.8194,在 PR 曲线上全面包络传统方法。

亮点与洞察

  • 从“显式面拟合”跃迁至“光路几何隐式推理”:巧妙避开了不可靠的三维玻璃平面提取,将复杂的镜面反射几何通过斯涅尔定律直接投射为 ERP 域上的一维连续光学路径,化繁为简。
  • 层对齐的最近点图表征(LNPM):打破了固定深度切片导致表面碎裂的认知定式,基于每个参考距离动态采样最近回波,让无反射光线致密平滑、反射光线自动分层,是处理多回波 LiDAR 数据的优秀通用范式。
  • 可迁移的物理光路约束机制:将光学传播轨迹作为注意力掩码的设计思路,可以无缝迁移至车载自动驾驶 LiDAR 的前风挡玻璃二次反射滤除、水面/积水倒影去噪以及室内移动机器人的镜面建图纠错任务中。

局限与展望

  • 平面镜面单次反射假设:该框架目前主要针对单次镜面反射建模(如平面玻璃、整洁大理石面),对于曲面镜反射(如凹凸曲面后视镜)或多重连续弹跳反射(如两块镜面之间的无限嵌套虚像),反射轨迹公式将不再保持简单的一维曲线映射。
  • 对初始法向估计的最低依赖:尽管消融实验证明其对法向量噪声具有较强鲁棒性,但若第一层物理反射介质完全透明且未返回任何有效首波,系统将无法正确初始化表面法向量,从而导致反射轨迹引导失效。
  • 车载动态高帧率实时性优化:尽管 8.2 秒的处理时间相比传统数小时已有实质性飞跃,但要满足自动驾驶 10Hz(100ms)的车载在线处理要求,仍需对 ERP 分辨率压缩、网络轻量化及 TensorRT 部署做进一步工程优化。

相关工作与启发

  • vs Yun and Sim [24, 25]: 传统方法依赖 RANSAC 拟合 3D 玻璃平面并依靠严苛的局部镜面对称几何距离判断虚假点,极易被环境中真实的对称物(如成排建筑立柱)误导,且耗时高达 2 小时以上。本文采用全场景 ERP 视场建模,利用全局语义与定向光路注意力区分物理对称与反射虚像,兼顾高精度与秒级推理。
  • vs Lee et al. [11]: 虽引入了基于学习的反射识别模块,但整体框架仍未脱离两阶段耦合流水线,上游反射面估计误差会直接向下游传递放大。本文为纯粹的单阶段端到端网络,前后向映射严格可逆,无累积漂移。
  • vs Fang et al. [3]: 结合了光学与辐射测量(强度)信息的多阶段算法,但在缺少雷达反射强度字段的数据集(如 3DRN)上无法完整复现或性能受限。本文仅依靠几何坐标与多回波结构即可工作,适用性与泛化度更广。

评分

  • 新颖性: ⭐⭐⭐⭐⭐(首次将 LiDAR 虚假反射点去除转化为 ERP 域物理光路引导的端到端学习任务,表征与注意力构思新颖。)
  • 实验充分度: ⭐⭐⭐⭐⭐(自建 3,000 例物理光线追踪合成基准,在真实 UNIST 与 3DRN 两个权威实测数据集上进行了 cross-dataset 评测与详尽消融。)
  • 写作质量: ⭐⭐⭐⭐⭐(动机阐述逻辑清晰严密,Mermaid 级流程图与光学光路示意图配合得当,数学公式精炼克制。)
  • 价值: ⭐⭐⭐⭐⭐(不仅在指标与计算效率上实现了质的飞跃,更为多回波激光雷达点云的几何表示和光学去噪提供了极具启发性的技术路线。)