UECP: Uncertainty-Enhanced Collaborative Perception¶
会议: ECCV 2026
论文: ECCV 原文
领域: 自动驾驶
关键词: 协同感知, 不确定性量化, 激光雷达点云密度, BEV特征融合, 鲁棒性
一句话总结¶
针对协同感知中分类置信度图易诱发虚警自强化与特征污染的痛点,UECP 提出基于物理传感器点云密度的不确定性图,并通过不确定性加权下采样与残差融合模块实现鲁棒高效的多智能体 BEV 特征聚合。
研究背景与动机¶
协同感知是自动驾驶突破单车视距受限、视线遮挡与盲区感知的关键技术。在早、中、晚期融合范式中,基于鸟瞰图(BEV)特征交互的中间融合因在通信开销与检测性能间取得了最佳平衡,成为当前学界与工业界的主流研究方向。然而,在车路协同与车车协同等真实复杂开放场景中,视角差异、传感器异构、空间标定误差以及通信时延会不可避免地引入大量协同噪声。如何为参与协同的每个智能体寻找客观、可靠的感知证据,以精确量化并动态赋权各智能体的特征贡献,是保证协同融合增益与鲁棒性的核心难题。
现有主流协同感知方法(如 Where2comm、HEAL 等)大多依赖与检测分类头联合训练的置信度图(confidence map)来指导特征融合与通信稀疏化。然而,分类置信度本质上是模型关于目标语义后验概率的推断,高度耦合于检测器本身的预测偏差与分类噪声。这种耦合带来了致命的“置信度自强化”恶性循环:当某一智能体产生虚警(False Positive)高响应时,其自发预测的高置信度会误导融合模块过度信任并广播该错误特征,进而污染整个协同网络的感知表征;而在远距离或点云稀疏区域,弱置信度往往导致有效特征被硬阈值过滤或过度惩罚,产生漏检(False Negative)。
根本症结在于缺乏一种独立于检测头预测结果、具有明确物理意义的传感器观测置信度度量。在激光雷达检测任务中,空间遮挡、截断效应、远距离发散以及镜面反射等各类不确定性来源,在物理上均唯一且直接地表现为局部激光点云回波密度的急剧衰减。基于这一深刻物理洞见,本文将局部点云密度作为感知可靠性的客观物理代理,提出独立建模且与检测预测解耦的不确定性图。在协同感知视角下,高不确定性不再意味着“应当直接丢弃”,而是表明该空间区域“极度渴望邻居智能体的先验补充与协同支援”。核心 idea:利用激光雷达点云密度显式构建物理不确定性图以解耦检测分类噪声,并通过不确定性感知金字塔融合网络(UAPF)将可靠度先验贯穿下采样保真与自车残差交互全流程,实现抗噪、抗时延与抗位姿偏差的高鲁棒协同感知。
方法详解¶
整体框架¶
UECP 框架由单智能体 BEV 特征编码、物理不确定性预测头、跨智能体坐标对齐与高效通信、以及不确定性感知金字塔融合模块(UAPF)构成。每个智能体独立利用 PointPillars 骨干提取局部输入点云的 BEV 特征,同时通过专门的不确定性分支预测表征传感可靠性的密集不确定性图。在协同交互阶段,协作者将自身特征与标量不确定性图投影至自车统一坐标系;UAPF 模块随后以粗到细的金字塔多尺度结构,利用不确定性引导下采样与残差融合,最终输出高质量增强特征送入 3D 目标检测头。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["多智能体原始传感器输入<br/>自车与协作车点云"] --> B["BEV 特征编码<br/>PointPillars 投影提取局部特征"]
B --> C["物理不确定性建模<br/>点云密度监督与边缘一致性回归"]
C --> D["跨智能体位姿对齐与单通道通信<br/>统一坐标投影与极低带宽交互"]
D --> E["不确定性加权下采样<br/>可靠度加权平均池化与金字塔构建"]
E --> F["不确定性引导的残差融合<br/>空间平滑权重分配与自车残差更新"]
F --> G["多尺度粗到细特征聚合与 3D 检测输出"]
关键设计¶
1. 物理不确定性建模:解耦感知噪声与置信度自强化
传统检测置信度无法提供无偏的物理置信线索,极易在融合阶段放大虚警。针对该痛点,本文提出由独立不确定性分支预测密集不确定性图 \(\mathcal{U}_i \in [0, 1]^{H \times W}\)。其真实监督信号直接源自原始激光雷达点云投影:将点云以 \(\Delta x = \Delta y = 0.4\,\text{m}\) 分辨率统计每个网格内的点数密度 \(\mathcal{D}_i\),经归一化后定义真实不确定性 \(\mathcal{U}_i^{\text{gt}} = \text{norm}(\mathcal{D}_i)\),点云越稀疏代表不确定性越高。该设计不仅完全解耦于检测头,而且高密度的背景区域提供了极为可靠的“无目标”物理负证据,有力压制背景虚警。
为了使网络能够从抽象深层 BEV 特征中准确回归出连续物理密度并保持物体的几何轮廓,模型采用连续焦距回归与 Sobel 梯度一致性联合损失进行监督: $\(L_{\text{un}} = \alpha \frac{1}{HW} \sum_{x,y} |e_i[x,y]|^{\rho} (1 - \alpha) + w_g \left(\|\nabla_x \mathcal{U}_i - \nabla_x \mathcal{U}_i^{\text{gt}}\|_1 + \|\nabla_y \mathcal{U}_i - \nabla_y \mathcal{U}_i^{\text{gt}}\|_1\right)\)$ 其中 \(e_i = \mathcal{U}_i - \mathcal{U}_i^{\text{gt}}\) 为预测误差,\(\rho\) 为调节难易样本权重的焦距指数,\(\nabla_x, \nabla_y\) 为固定的 Sobel 梯度算子。这种设计既强迫模型关注低密度边缘区域的精细拟合,又保留了空间感知边界的锐利度。
2. 不确定性加权下采样:保真多尺度特征金字塔构建
在构建多尺度 BEV 特征金字塔时,传统的最大池化(Max-Pooling)容易被局部突变噪声主导,而平均池化(Avg-Pooling)则会不可避免地稀释高响应关键目标特征。为克服特征压缩过程中的信息退化,本文提出了不确定性加权下采样模块(UWD)。其核心机制是将预测得到的物理不确定性转化为可靠度权重 \((1 - \mathcal{U})\),通过局部加权平均自适应筛选高可信特征。
在尺度 \(s\) 下,降采样特征图 \(\mathcal{F}_s\) 的计算形式为两个标准平均池化操作的逐元素点商: $\(\mathcal{F}_s = \frac{\mathrm{AvgPool}_s\left(\mathcal{F} \odot (1 - \mathcal{U})\right)}{\mathrm{AvgPool}_s(1 - \mathcal{U}) + \epsilon}\)$ 其中 \(\mathrm{AvgPool}_s\) 指定池化核与步长,\(\epsilon = 10^{-8}\) 为数值防零极小项。在该公式中,高置信度(低不确定性)网格的特征在局部窗口中获得绝对主导权,而高噪声、被遮挡区域的扰动特征则被自动抑制。这种计算方式完全复用了高度优化的标准池化算子,在零额外参数的情况下实现了保真度极高的跨尺度语义传递。
3. 不确定性引导的残差融合:以自车为锚点的鲁棒协同交互
多智能体特征聚合中最棘手的问题是低质协作数据对自车原本准确表征的二次污染。为此,不确定性引导的残差融合模块(UGRF)采用“自适应置信衰减赋权 + 自车锚定残差更新”的双重防御机制。对于自车及所有对齐后的邻居智能体 \(n \in \mathcal{N}(i)\),首先基于各自分离的不确定性图计算归一化空间交互权重 \(\lambda_n\): $\(\lambda_n = \frac{\exp(-\gamma \mathcal{U}_n) v_n}{\sum_{m=1}^{N} \exp(-\gamma \mathcal{U}_m) v_m + \epsilon}\)$ 其中 \(\gamma = \mathrm{softplus}(\tilde{\gamma}) > 0\) 为可学习的自适应衰减缩放因子,\(v_n \in \{0, 1\}^{H \times W}\) 为空间对齐后的视场有效性掩码。权重图随后通过 \(3 \times 3\) 高斯平滑滤波以消除邻域突变。
在完成协作特征加权求和后,UGRF 不直接使用聚合特征覆盖自车特征,而是构建残差更新结构: $\(\hat{\mathcal{F}}_i = \mathcal{F}_i + \beta \cdot \phi_{\text{post}}\left(\sum_{n=1}^{N} \lambda_n \mathcal{F}_n - \mathcal{F}_i\right)\)$ 其中 \(\phi_{\text{post}}\) 为轻量级卷积细化网络,\(\beta \in (0, 1)\) 为自适应门控系数。该设计严格以自车感知特征 \(\mathcal{F}_i\) 为主干基准,仅将跨车协作提取的增量证据作为受控残差信号注入。当协作方受恶劣天气、通信丢包或视角遮挡导致不确定性普遍较高时,权重自动向自车倾斜,有效杜绝了协同噪声崩溃风险。
损失函数 / 训练策略¶
模型端到端训练总损失由多任务联合构成: $\(L_{\text{total}} = \lambda_{\text{reg}} L_{\text{reg}} + \lambda_{\text{cls}} L_{\text{cls}} + \lambda_{\text{dir}} L_{\text{dir}} + \lambda_{\text{un}} L_{\text{un}}\)$ 其中 \(L_{\text{reg}}\) 为 3D 边界框 Smooth L1 回归损失,\(L_{\text{cls}}\) 为目标分类 Focal Loss,\(L_{\text{dir}}\) 为朝向分类交叉熵损失,\(L_{\text{un}}\) 为式 (4) 中定义的不确定性图监督损失。网络基于 AdamW 优化器,采用 One-Cycle 学习率调度策略在单代码库中统一训练 60 个 epoch。
实验关键数据¶
主实验¶
在车路协同真实基准 DAIR-V2X 以及车车协同真实基准 V2V4REAL 上,以 PointPillars 为主干,与无协同基线及当前代表性 SOTA 协同感知方法进行了严格评测,结果如下表所示:
| 数据集 | 方法 | [email protected] (%) | [email protected] (%) | [email protected] (%) | 性能提升与特点 |
|---|---|---|---|---|---|
| V2V4REAL (车车协同) | No Collaboration | 46.12 | 44.03 | 27.71 | 单车基线 |
| F-Cooper | 47.97 | 40.83 | 30.64 | 最大值融合 | |
| AttnFuse | 48.18 | 40.06 | 28.75 | 注意力融合 | |
| V2VNet | 45.12 | 43.24 | 31.75 | 图神经网络消息传递 | |
| V2X-ViT | 40.11 | 37.18 | 24.53 | 空间注意力机制 | |
| CoBEVT | 63.13 | 60.10 | 33.94 | 稀疏 Transformer | |
| Where2comm | 49.61 | 45.10 | 34.45 | 基于分类置信度稀疏通信 | |
| Who2comm | 52.99 | 46.80 | 18.14 | 握手机制通信 | |
| HEAL | 51.57 | 48.70 | 35.24 | 异构自适应特征融合 | |
| CodeFilling | 60.15 | 59.78 | 35.07 | 码本压缩协同 (次优) | |
| UECP (本文) | 65.69 | 63.38 | 38.90 | 较次优提升 +2.56 / +3.28 / +3.66 | |
| DAIR-V2X (车路协同) | No Collaboration | 59.97 | 54.23 | 41.27 | 单车基线 |
| F-Cooper | 76.94 | 70.57 | 54.65 | 最大值融合 | |
| AttnFuse | 69.83 | 64.06 | 48.98 | 注意力融合 | |
| V2VNet | 69.25 | 65.52 | 47.84 | 图网络协同 | |
| V2X-ViT | 77.28 | 72.47 | 57.97 | 异构注意力 | |
| CoBEVT | 75.67 | 69.34 | 49.77 | 轴向自注意力 | |
| Where2comm | 74.92 | 67.90 | 48.86 | 空间置信度掩码 | |
| Who2comm | 77.08 | 71.22 | 52.17 | 握手交互 | |
| HEAL | 79.11 | 73.95 | 55.56 | 异构兼容模型 | |
| CodeFilling | 79.85 | 75.18 | 57.26 | 离散码本重构 (次优) | |
| UECP (本文) | 81.78 | 77.59 | 61.12 | 较次优提升 +1.93 / +2.41 / +3.15 |
消融实验¶
1. 核心模块累积贡献消融(DAIR-V2X 验证集)
| 配置编号 | 不确定性图 (UM) | 多尺度金字塔 (MS) | 加权下采样 (UWD) | 残差融合 (UGRF) | [email protected] (%) | [email protected] (%) | [email protected] (%) | 说明与增益分析 |
|---|---|---|---|---|---|---|---|---|
| 1 | - | - | - | - | 76.94 | 70.57 | 54.65 | F-Cooper Max 融合基线 |
| 2 | ✓ | - | - | - | 78.52 | 72.39 | 56.92 | 引入物理不确定性引导 (+2.27@70) |
| 3 | ✓ | ✓ | - | - | 79.98 | 75.73 | 59.74 | 引入多尺度金字塔骨干 (+2.82@70) |
| 4 | ✓ | ✓ | ✓ | - | 80.08 | 76.05 | 60.63 | 引入 UWD 保真降采样 (+0.89@70) |
| 5 (Full) | ✓ | ✓ | ✓ | ✓ | 81.78 | 77.59 | 61.12 | 完整模型:引入 UGRF 残差 (+0.49@70) |
2. 关键设计细节细粒度消融(DAIR-V2X 验证集)
| 消融维度 | 具体配置 | [email protected] (%) | [email protected] (%) | [email protected] (%) | 结论与分析 |
|---|---|---|---|---|---|
| 金字塔尺度 | (1) 单尺度 | 80.03 | 75.43 | 59.03 | 缺乏高低语义多感受野交互 |
| (2, 1) 双尺度 | 81.00 | 76.12 | 59.79 | 性能稳步上升 | |
| (4, 2, 1) 三尺度 | 81.78 | 77.59 | 61.12 | 粗到细分层特征融合表现最佳 | |
| 指导图类型 | 无指导图 (No Map) | 77.89 | 72.63 | 55.91 | 缺失空间感知质量量化先验 |
| 传统分类置信度 (Confidence) | 78.68 | 73.60 | 56.47 | 存在虚警自强化缺陷,提升有限 | |
| 纯真实点云密度 (Density-direct) | 81.73 | 77.28 | 60.77 | 略逊于学习版不确定性 | |
| 学习不确定性图 (Uncertainty) | 81.78 | 77.59 | 61.12 | 经网络提炼出超越原始计数的语义模糊度 | |
| 融合算子 | 最大值 (Max) | 80.33 | 75.13 | 57.66 | 极易吸收单点极值噪声 |
| 均值 (Mean) | 80.93 | 76.01 | 59.86 | 稀释强感知智能体贡献 | |
| 加权累加 (Sum) | 81.78 | 77.59 | 61.12 | 完整保留多源增强信息且残差稳定 |
关键发现¶
- 高精度阈值下优势尤为显著:UECP 在严格的 [email protected] 指标上展现出大幅领先优势(DAIR-V2X 达 61.12%,V2V4REAL 达 38.90%,分别比次优 SOTA 高出 3.15% 与 3.66%),证明物理不确定性成功消除了传统方法中因置信度虚高导致的低精度预测框污染,定位回归更严谨。
- 即插即用泛化性极强:将 Where2comm 和 HEAL 中的传统置信度图直接无缝替换为 UECP 学习的不确定性图,两者的平均 AP 分别提升了 +3.71% 和 +2.03%,且在 [email protected] 上分别暴涨 +5.86% 与 +3.37%,彻底打破了协同感知的置信度自强化死锁。
- 极佳抗干扰与轻量化表现:在位姿漂移噪声(\(\sigma \in [0, 1]\,\text{m}\))与通信传输延迟(\(0 \sim 500\,\text{ms}\))压力测试中,UECP 的性能衰减速率显著低于其余密集交互方法;同时,全系统仅需传输 1 个额外的不确定性图通道(以 \(C=256\) 计,带宽开销仅增加约 \(0.39\%\)),参数量仅 8.34M,推理速度达到 9 FPS。
亮点与洞察¶
- 物理点云密度作为不确定性代理的去偏价值:将激光雷达点云物理回波密度作为先验监督,成功将融合引导信号与检测分类头解耦。这种设计不仅使空旷背景区域的“可靠负证据”有效压制虚警,更杜绝了传统协同感知中假阳性特征相互借力放大的系统性漏洞。
- 下采样与残差融合的可靠性闭环:UWD 通过两路平均池化点商以极低计算代价实现了无噪多尺度压缩;UGRF 则以自车为基底将协同信息转化为受控残差,使系统在邻车提供劣质或延迟特征时能够优雅降级,极大增强了工程部署鲁棒性。
- 即插即用的通用赋能属性:只需额外传输一个标量不确定性通道即可直接赋能 Where2comm、HEAL 等任意中间融合算法,在保持超低通信开销的同时带来显著的高精度增益,可平滑扩展至多模态与异构协同系统。
局限与展望¶
- 作者承认的局限:物理不确定性图的真实值构建目前依赖于激光雷达点云的空间密度分布;在仅依赖纯视觉相机的低成本协同感知配置下,缺少直接的深度点云物理测量,不确定性的显式建模方式需要重构。
- 实验假设局限:尽管在模拟位姿噪声和时延下进行了稳健性测试,但当前真实数据集验证仍主要局限于相对理想的时空标定同步场景,在极端丢包率(如信道中断)及动态非刚性恶劣天气扰动(如暴雨、浓雾导致点云严重虚假衰减)下的鲁棒性边界仍待进一步探索。
- 未来改进方向:可探索将基于体素或深度的隐式几何不确定性推广至跨模态相机-激光雷达协同框架,并设计结合历史时序轨迹补偿的时空联合不确定性滤波网络。
相关工作与启发¶
- vs Where2comm: Where2comm 依赖检测分类头输出的空间置信度图来进行通信裁决与特征加权,极易遭受置信度自强化导致的高虚警率;UECP 采用由物理点云密度监督的不确定性图,从根源上将感知可靠性与分类打分彻底解耦,在 [email protected] 指标上超越其 12.26%(DAIR-V2X)。
- vs HEAL: HEAL 侧重于解决异构模型间的特征空间兼容性,但其交互权重依然缺乏客观物理度量支撑;UECP 不仅能以插件形式直接提升 HEAL([email protected] 提升 +3.37%),其自车残差更新范式更提供了极其稳固的抗噪边界。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 巧妙提出将激光雷达物理密度作为不确定性监督代理,从物理根源上解耦协同感知特征赋权与检测分类噪声。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖车路与车车两大权威真实基准,具备主结果、两阶段消融、外挂即插即用验证、位姿时延抗噪评测及可视化分析。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑结构严密,数学表达紧凑克制,深入揭示了置信度自强化痛点与物理残差融合机制。
- 价值: ⭐⭐⭐⭐⭐ 仅引入 0.39% 的额外通信开销与 8.34M 轻量参数,即在 AP@70 取得突破性进展,对真实自动驾驶车路协同落地极具参考意义。