HVA-Fusion:Hierarchical Velocity-Aware 4D Radar-LiDAR Fusion for Robust 3D Object Detection¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/wujingxian1/HVA-Fusion
领域: 自动驾驶
关键词: 4D毫米波雷达、激光雷达融合、3D目标检测、多模态融合、恶劣天气鲁棒性
一句话总结¶
针对激光雷达在恶劣天气下失效及4D毫米波雷达点云稀疏且多普勒径向速度无法表征真实运动状态的问题,本文提出了分层速度感知融合框架 HVA-Fusion,通过真实运动速度估计、Pillar级邻域自适应交互、RCS引导的高斯特征稠密化以及BEV级双向可变形注意力门控,实现了全天候高精度3D目标检测。
研究背景与动机¶
在自动驾驶与机器人三维感知系统中,基于激光雷达(LiDAR)的3D目标检测凭借其精准的几何结构重建能力长期占据主导地位。然而,激光雷达采用的近红外波长在遇到雨、雪、浓雾或扬尘等恶劣气象条件时,光束极易发生强烈的散射与衰减,导致点云发生灾难性退化甚至完全失效。与之相比,4D成像毫米波雷达凭借较长的毫米工作波长,展现出极强的全天候穿透能力,并且能够提供独特的微多普勒速度及雷达散射截面(RCS)信息。但受制于硬件孔径限制,4D雷达点云天生具有角分辨率粗糙、点稀疏以及杂波噪声显著的缺陷。
将两者的互补优势结合成为应对恶劣天气感知的必然路径,但现存的多模态融合范式存在多重瓶颈。首先,现有工作往往仅对原始径向速度做幅值或平方等浅层处理,忽略了径向速度仅是视线方向投影的本质,当目标横向运动时视线分量趋近于零,致使动目标混同于静态背景。其次,LiDAR与4D雷达在点密度、几何精度和物理属性上存在显著异构鸿沟,现有早期拼接或单一特征空间融合强依赖刚性几何对齐,无法自适应纠偏传感器标定误差与局部空间偏移。此外,4D雷达的极端稀疏性极易导致多模态交互时雷达特征被激光特征淹没,而传统时序多帧累加又会在动态场景中引入运动伪影和空间错位;在恶劣天气或强多径干扰下,缺乏动态门控机制还会引入负迁移。
本文的切入角度是:必须将4D雷达的物理运动先验显式转化为真实运动速度,并在特征抽象的不同层级建立从局部自适应到全局可变形交互的双阶段融合管线。核心 idea:通过预测逐点运动朝向恢复真实运动速度并过滤杂波,继而在Pillar空间利用雷达局部密度自适应引导跨模态局部注意力,随后在BEV空间借助RCS与距离先验通过高斯扩散稠密化雷达特征,并由多尺度双向可变形注意力门控实现抗失真、抗恶劣天气的稳健融合。
方法详解¶
整体框架¶
HVA-Fusion 的整体输入包含原始 4D 毫米波雷达点云与 LiDAR 点云。系统首先在点云级利用运动速度估计与编码(MVEE)模块恢复真实速度并滤除背景杂波;随后各自完成 Pillar 划分,并在 Pillar 特征空间通过跨模态渐进式自适应(CPA)模块执行局部邻域注意力交互与特征传播(Stage-I 局部融合);针对 4D 雷达特征的稀疏性,在投影到 BEV 空间前引入 RCS 引导的高斯生成(RGG)模块对雷达特征进行物理感知的自适应稠密化;最后,在 BEV 空间构建多尺度双向可变形注意力门控(MS-BDDG)模块(Stage-II 全局融合),消除空间未对齐歧义并动态抑制退化模态的噪声,将融合特征送入检测头输出最终的 3D 边界框与类别。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入:4D雷达点云 + LiDAR点云"] --> B["运动速度估计与编码 (MVEE)<br/>朝向预测推导真实速度 + 前景滤波"]
B --> C["Pillar 编码与特征提取"]
C --> D["跨模态渐进式自适应 (CPA)<br/>密度感知自适应 k-NN + 局部交叉注意力"]
D --> E["RCS 引导的高斯生成 (RGG)<br/>物理与可学习尺度融合 + 距离自适应高斯扩散"]
E --> F["多尺度双向可变形注意力门控 (MS-BDDG)<br/>三层金字塔可变形交互 + 模态自适应门控抑制"]
F --> G["检测头输出 3D 边界框与类别"]
关键设计¶
1. 运动速度估计与编码(MVEE):从视线径向投影中显式恢复目标真实动态速度
针对雷达原始多普勒速度 \(v_r\) 及其自车运动补偿后的绝对径向速度 \(v_a\) 仅反映沿雷达视线方向 \(\beta = \arctan(y/x)\) 投影分量的缺陷,当目标实际运动朝向 \(\alpha\) 与视线存在夹角时(如行人横向穿行),\(v_a\) 严重衰减导致动态特征失效。MVEE 引入一个轻量 PointNet++ 结构预测逐点的运动朝向角 \(\alpha\)(以正 x 轴为基准),在训练期以真实 3D 边界框的朝向 \(\alpha_{\text{heading}}\) 作为监督信号计算方向损失 \(L_{\text{dir}}\): $\(L_{\text{dir}} = \frac{1}{N} \sum_{i=1}^{N} (1 - \cos(\alpha_i - \alpha_{\text{heading}}))\)$ 通过计算朝向与视线的夹角 \(\theta = \alpha - \beta\),显式推导出物体的真实运动速度标量估计值 \(v_{\text{pred}}\): $\(v_{\text{pred}} = \begin{cases} \frac{v_a}{\cos\theta}, & \text{if } |\cos\theta| > 10^{-1} \\ 10 \cdot v_a, & \text{otherwise} \end{cases}\)$ 该真实速度作为高辨识度动态特征与原始点特征拼接,同时模块附带一个基于分割头的二分类前景概率预测,滤除置信度低于阈值的杂波噪声点,显著强化了行人和骑行者等低 RCS 小目标在复杂动态背景下的辨识度。
2. 跨模态渐进式自适应(CPA):局部密度感知的 Pillar 空间自适应邻域交互
针对传统硬性几何拼接对传感器标定误差和局部扰动极为敏感的问题,CPA 将融合拆解为“同格传播”与“局部邻域自适应匹配”两步走。首先在同一 Pillar 坐标内通过多模态编码器(MME)计算双模态点集间的统计均值距离与特征均值,完成初步双向特征丰富并池化为 Pillar 级特征 \(f^l\) 与 \(f^r\)。在此基础上,由于雷达特征在空间中分布极不均匀,CPA 在每个 LiDAR Pillar 周围设定局部搜索半径 \(r_l\),根据该半径内的雷达点统计密度动态调节 k-NN 搜索的采样容量 \(k_l\)。随后以 LiDAR Pillar 特征作为 Query,自适应搜索得到的临近雷达特征集合作为 Key 和 Value 进行交叉注意力加权: $\(\hat{f}_i^l = \sum_{j \in \mathcal{N}_i^r} \text{Softmax}\left(\frac{f_i^l (f_j^r)^T}{\sqrt{d}}\right) f_j^r\)$ 雷达支持密集的区域赋予激光特征更强的前景置信度加权,稀疏杂波区域则受到抑制,从特征提取底层柔性缝合了两模态的语义与几何鸿沟。
3. RCS 引导的高斯生成(RGG):物理尺寸先验与可学习距离调制的雷达特征稠密化
针对4D雷达点云天生稀疏且易在融合阶段被激光特征主导乃至淹没的问题,RGG 依据物体的雷达散射截面(RCS)与物理反射面积呈正相关的物理本质,将离散的雷达 Pillar 特征通过各向同性高斯核扩散生成连续的特征场。高斯核的标准差扩散尺度 \(\sigma_i\) 由物理先验与自适应神经网络协同生成:物理基准尺度 \(\sigma_i^{\text{base}}\) 经 Sigmoid 函数对 RCS 建立单调递增映射以保证物理可信度;可学习细化项 \(\sigma_i^{\text{learn}}\) 通过 MLP 自适应拟合非线性场景;最终结合归一化欧氏距离 \(d_i\),得到距离加权截断尺度: $\(\sigma_i = \text{clip}\left(d_i \cdot \left(\gamma \sigma_i^{\text{base}} + (1 - \gamma) \sigma_i^{\text{learn}}\right), \sigma_{\min}, \sigma_{\max}\right)\)$ 对于每个特征栅格,聚集其高斯覆盖范围内的所有雷达 Pillar 并进行高斯权重归一化求和 \(f^g = \frac{\sum w_i f_i^r}{\sum w_i}\),滤除权重低于 0.1 的边缘,经轻量 MLP 映射为稠密的雷达 BEV 特征 \(F^r\),既规避了时序多帧累加导致的运动畸变,又大幅缓解了中远距离目标的稀疏退化。
4. 多尺度双向可变形注意力门控(MS-BDDG):抗对齐漂移与退化抑制的 BEV 全局融合
在 BEV 空间,为解决传感器坐标变换残留的方位角噪声与形变失配,MS-BDDG 构建了 3 层多尺度特征金字塔(\(D \in \{1, 2, 3\}\)),浅层强化几何互补,深层强化语义对齐。在每一层级中,引入可变形交叉注意力(Deformable Cross-Attention),分别交替将 LiDAR 特征与 4D 雷达特征互换作为 Query 和 Value,使得采样点偏置 \(\Delta p_{hqk}\) 能够自适应寻找跨模态的对应物,消除刚性投影错位。此外,考虑到极端恶劣天气下 LiDAR 严重失效或雷达多径散射造成的噪声干扰,模块在每一尺度引入轻量模态自适应门控网络: $\(w^m = \text{Sigmoid}(\text{Conv}_{3\times3}(F_D^f)), \quad m \in \{l, r\}\)$ 通过计算两模态与初步融合特征的交互关联,输出像素级通道权重 \(w^m\) 并对单模态特征执行元素乘法抑制。最后将三层尺度特征拼接,确保在任一传感器降质时自适应切断受污染特征的传播通道。
损失函数 / 训练策略¶
模型采用端到端联合训练多任务总损失: $\(L_{\text{all}} = \beta_{\text{cls}} L_{\text{cls}} + \beta_{\text{loc}} L_{\text{loc}} + \beta_{\text{mask}} L_{\text{mask}} + \beta_{\text{dir}} L_{\text{dir}}\)$ 其中超参数设定为 \(\beta_{\text{cls}} = 1.0, \beta_{\text{loc}} = 2.0, \beta_{\text{mask}} = 2.0, \beta_{\text{dir}} = 1.1\)。分类与前景点 mask 采用 Focal Loss,位置回归与方向预测损失采用 Smooth L1 Loss。此外,设计了随机模态丢弃(Random Modal Dropout)训练策略:以概率 \(P_{\text{drop}} = 0.2\) 触发模拟传感器失效,并依据阈值随机将雷达或激光 BEV 特征置零,大幅提升模型在单传感器受损场景下的鲁棒性。
实验关键数据¶
主实验¶
在 K-Radar、View-of-Delft (VoD) 和 TJ4DRadSet 三大主流 4D 雷达基准数据集上进行了全面评估。
1. K-Radar 恶劣天气数据集轿车(Sedan)检测对比(IoU=0.5,%)
| 方法 | 模态 | AP3D (全天候) | 正常天气 | 浓雾 (Fog) | 暴雨 (Rain) | 冻雨 (Sleet) | 小雪 | 大雪 (Heavysnow) |
|---|---|---|---|---|---|---|---|---|
| RTNH | 4D Radar | 37.4 | 37.6 | 41.2 | 29.2 | 49.1 | 63.9 | 43.1 |
| PointPillars | LiDAR | 22.4 | 21.8 | 28.2 | 27.2 | 22.6 | 23.2 | 12.9 |
| RTNH | LiDAR | 37.8 | 39.8 | 59.8 | 28.2 | 31.4 | 50.7 | 24.6 |
| InterFusion | LiDAR+Radar | 17.5 | 15.3 | 47.6 | 12.9 | 9.33 | 56.8 | 25.7 |
| 3D-LRF | LiDAR+Radar | 45.2 | 45.3 | 51.8 | 38.3 | 23.4 | 60.2 | 36.9 |
| L4DR | LiDAR+Radar | 53.5 | 53.0 | 73.2 | 53.8 | 46.2 | 52.4 | 37.0 |
| HVA-Fusion (本文) | LiDAR+Radar | 65.7 | 63.8 | 79.7 | 65.5 | 60.7 | 77.1 | 57.7 |
2. View-of-Delft (VoD) 数据集验证集检测性能对比(AP %)
| 方法 | 模态 | 全区域 Car | 全区域 Ped. | 全区域 Cyc. | 全区域 mAP | 驾驶区 Car | 驾驶区 Ped. | 驾驶区 Cyc. | 驾驶区 mAP |
|---|---|---|---|---|---|---|---|---|---|
| PointPillars | LiDAR | 65.55 | 55.71 | 72.96 | 64.74 | 81.10 | 67.92 | 88.96 | 79.33 |
| InterFusion | L+R | 67.50 | 63.21 | 78.79 | 69.83 | 88.11 | 74.80 | 87.50 | 83.47 |
| MutualForce | L+R | 71.67 | 66.26 | 77.35 | 71.76 | 92.31 | 76.79 | 89.97 | 86.36 |
| L4DR | L+R | 69.10 | 66.20 | 82.80 | 72.70 | 90.80 | 76.10 | 95.50 | 87.47 |
| SVEFusion | L+R | 71.83 | 67.85 | 83.97 | 74.55 | 90.91 | 79.37 | 96.31 | 88.86 |
| ELMAR | L+R | 76.41 | 69.34 | 78.91 | 74.89 | 91.74 | 81.35 | 93.01 | 88.70 |
| HVA-Fusion (本文) | L+R | 70.12 | 72.46 | 83.96 | 75.51 | 90.91 | 78.03 | 96.51 | 88.48 |
消融实验¶
在 VoD 数据集上对各核心模块的累积和独立贡献进行了系统消融(基线为直接拼接雷达与激光 BEV 特征的 L4DR 架构):
| 配置编号 | MVEE | CPA | RGG | MS-BDDG | 全区域 mAP (%) | 驾驶区 mAP (%) | 贡献说明 |
|---|---|---|---|---|---|---|---|
| 1 (Baseline) | 70.99 | 83.95 | L4DR 直接拼接基线 | ||||
| 2 | ✓ | 73.36 (+2.37) | 85.35 (+1.40) | 真实运动速度估计与杂波滤波显著提升动态小目标感知 | |||
| 3 | ✓ | ✓ | 73.71 (+0.35) | 88.14 (+2.79) | Pillar局部自适应交互在特征密集区带来显著增益 | ||
| 4 | ✓ | ✓ | ✓ | 74.11 (+0.40) | 88.24 (+0.10) | RCS与距离引导的高斯扩散有效缓解远距点云稀疏 | |
| 5 | ✓ | ✓ | 74.02 | 88.01 | 仅使用BEV级可变形对齐,缺少局部渐进先验 | ||
| 6 | ✓ | ✓ | ✓ | 74.20 | 87.92 | 去除 CPA 导致缺乏 Pillar 级局部细粒度对齐 | |
| 7 | ✓ | ✓ | ✓ | 74.77 | 88.43 | 去除 RGG 导致雷达特征未被有效稠密化 | |
| 8 (完整模型) | ✓ | ✓ | ✓ | ✓ | 75.51 (+4.52) | 88.48 (+4.53) | 四大模块全协同,取得最佳全区域感知指标 |
关键发现¶
- 恶劣天气展现极致抗降质韧性:在 K-Radar 的大雪(Heavysnow)场景下,激光单模态检测 AP3D 仅有 12.9%~24.6%,而 HVA-Fusion 达到 57.7% AP3D,相比顶尖基线 L4DR(37.0%)提升高达 +20.7%,充分印证了模态自适应门控与雷达物理先验在极端降质下的抗噪能力。
- 动态弱小目标感知飞跃:在 VoD 全区域评测中,行人(Pedestrian)AP 达到 72.46%,比 SOTA 基线高出约 3%~6%。这主要归功于 MVEE 模块解耦推导真实矢量速度,解决了小目标横向移动时视线多普勒接近于零的传统漏检难题。
- Pillar 与 BEV 双阶互补协同:消融表明,缺少 Pillar 级的 CPA 模块,仅靠 BEV 级的 MS-BDDG 只能达到 74.20% mAP;反之缺少 MS-BDDG 只能达到 74.11% mAP。两者结合达 75.51%,证实了先底层局部邻域适配、后顶层可变形全局对齐的两阶段层级递进设计的合理性。
- 推理耗时表现:在单张 NVIDIA H20 GPU 上,HVA-Fusion 总推理延迟为 148 ms(基线占 85 ms,MVEE 26 ms,CPA 5 ms,RGG 4 ms,MS-BDDG 28 ms),在提供极强稳健性的同时保持了可接受的计算开销。
亮点与洞察¶
- 多普勒真实运动状态的几何解耦:巧妙利用 PointNet++ 预测运动朝向角,并与传感器极坐标视线角相减,通过反余弦关系显式还原目标三维空间真实运动速度。这一物理机制将雷达多普勒从“盲目的辅助数值”转变为“具备高语义区分度的动态特征”。
- 物理先验驱动的各向同性高斯特征稠密化:不同于传统的时序多帧累加导致的运动伪影,RGG 利用目标几何尺寸与 RCS 反射强度之间的物理相关性,引入距离与网络自适应调节的高斯核扩散,在单帧内完成了雷达特征空间的保真稠密化。
- 双向可变形交叉注意力解耦空间失配:将可变形 DETR 的稀疏采样点偏置思想引入多模态 BEV 特征对齐,解决了 4D 雷达方位角低分辨率和标定微小误差造成的特征模糊,搭配门控机制实现了全天候抗退化。
局限与展望¶
- 各向同性高斯核对非对称目标的几何模糊:当前 RGG 模块采用各向同性高斯扩散,对于行人等近距离细长型或形状不规则目标,容易抹平边界轮廓,导致在 VoD 驾驶区近距离行人检测上的增益受到抑制;未来需探索各向异性(Anisotropic)或语义轮廓感知的椭圆高斯扩散。
- 极端雾天下复杂反射率骑行者的局部关联合理性下降:在 VoD-Fog 4级极端浓雾仿真下,自行车的金属辐条与车轮旋转会产生复杂的微多普勒频谱,当激光点云极度稀疏劣化时,CPA 局部的几何邻域硬关联可能产生错误匹配;作者提出未来应引入信噪比(SNR)感知的动态交互强度自适应调节策略。
相关工作与启发¶
- vs L4DR (AAAI 2025): L4DR 使用多模态 Pillar 交互并在 BEV 阶段通过直接拼接融合。本文在 L4DR 基础上引入了 MVEE 真实速度解耦、CPA 局部密度自适应搜索、RGG 高斯扩散以及可变形注意力门控,在 K-Radar 全天候平均 AP3D 上实现从 53.5% 到 65.7% 的大幅跨越。
- vs InterFusion / 3D-LRF (CVPR 2024): 传统融合方法仅使用径向速度标量或依靠单一特征空间完成交互。HVA-Fusion 建立了“点云级运动恢复 → Pillar 级局部自适应交互 → BEV 级高斯稠密化与可变形门控融合”的严密分层递进架构,为多模态自动驾驶全天候感知提供了新范式。
评分¶
- 新颖性: ⭐⭐⭐⭐ [从径向速度推导真实运动速度并结合物理RCS高斯扩散的设计切中4D雷达感知痛点]
- 实验充分度: ⭐⭐⭐⭐⭐ [覆盖K-Radar恶劣天气、VoD实测及浓雾仿真、TJ4DRadSet等多个benchmark,消融详尽]
- 写作质量: ⭐⭐⭐⭐⭐ [逻辑层层递进,动机与架构设计前后呼应,实验分析深入透彻]
- 价值: ⭐⭐⭐⭐⭐ [为多模态自动驾驶高鲁棒全天候感知提供了切实可行且性能强劲的高效两阶段融合方案]