HERO: Heterogeneous Evidential Robust Object-Level Collaborative Perception¶
会议: ECCV 2026
论文: ECCV 原文
领域: 自动驾驶
关键词: 协同感知, 目标级融合, 证据深度学习, 异构感知, 位姿误差与时延鲁棒性
一句话总结¶
针对异构多智能体协同感知中特征级融合带宽开销大且依赖协同训练、传统目标级融合受制于位姿偏置与异步延迟的难题,HERO 提出基于证据深度学习的轻量提案协议,创新性地将融合决策解耦为语义证据的 Beta-sum 累加与几何边界框的最大证据精选,配合马氏距离门控关联、时效性衰减与无监督位姿细化,以每帧仅约 2 KB 的通信带宽达到了特征级 SOTA 级别的 3D 检测精度与更强的扰动鲁棒性。
研究背景与动机¶
网联自动驾驶中的协同感知(Collaborative Perception)通过车车(V2V)与车路(V2I)多视角信息聚合,能够有效穿透视觉盲区与遮挡、扩展有效探测距离。然而现实落地场景天然具有强烈的异构性(Heterogeneity)与开放性:不同智能体搭载的传感器配置(如激光雷达与相机模组)各异,本地目标检测网络架构与训练域也大相径庭。主流的特征级(Feature-level)融合方法虽然精度出众,但通常假设特征空间完全兼容且依赖多智能体端到端协同联合训练,每帧传输密集的 BEV 特征图导致通信开销高达数兆字节(MB/frame),在真实无线通信带宽与开放车队部署中极其苛刻。
相比之下,直接交换稀疏 3D 边界框提案的目标级(Object-level)晚期融合天然解耦了底层检测器架构,仅需每帧千字节(KB/frame)的极低通信带宽,最契合开放系统的工程部署。然而传统的晚期融合协议仅包含粗糙的“3D 边界框坐标 + 标量置信度”,在异构智能体间缺乏鲁棒关联所需的完备信息:首先,各智能体定位噪声尺度不同且存在未知系统性偏置(Pose bias),固定 IoU 阈值极易引发误匹配或漏匹配;其次,异构网络输出的原始标量得分无法跨模型校准对齐,“得分最高”并不等价于“几何最可靠”;最后,无线传输的时延(Asynchronous delay)导致接收到的陈旧提案产生严重的空间漂移,盲目对边界框坐标取平均反而会将自车原本高精度的几何估计拉偏变劣。
针对这一系列系统性扰动,本文的核心切入点在于:目标级协同中“目标是否存在(语义)”与“目标精确位于何处(几何)”面临的误差统计特性本质不同——多智能体观测对物体存在性是可相互印证、正向累加的,而几何边界框则极易被带偏置的外部信源污染,直接平均只会放大系统误差。核心 idea:为每个稀疏提案配备基于证据理论的语义(Beta 分布)与几何(正态-逆伽马 NIG 分布)不确定性统计量,将融合决策显式解耦为“语义证据多方累加(Beta-sum)”与“几何边界框最可靠信源单选(Max-evidence selection)”,并以此驱动延迟补偿门控与免协同训练的自车位姿自矫正。
方法详解¶
整体框架¶
HERO 是一个专为异构、带宽受限且存在位姿与时延扰动的真实 V2X 环境设计的目标级协同感知框架。其系统主要由“智能体本地证据感知检测头”与“自车(Ego)侧多阶段鲁棒融合引擎”两大部分组成。在本地端,各异构智能体独立训练各自的检测网络,输出带有 Beta 分布语义证据与 NIG 分布几何不确定性的稀疏 3D 边界框,并按证据感知联合得分筛选 Top-K 提案发送至网络。自车接收到各协作者的提案后,首先执行坐标系粗对齐与时效性计算,接着利用自车提案作为锚点运行无监督的检测级位姿精细化(DPR)消除平移偏置,随后通过考虑运动膨胀的双门控马氏距离完成多源提案聚类,最后在每个聚类内实施解耦融合:语义采用 Beta-sum 累加增强置信度,几何则从最可信源直接抽取边界框,输出高精度、高鲁棒的 3D 目标检测结果。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入: 异构智能体稀疏证据提案<br/>(3D Box + Beta 语义 + NIG 几何)"] --> B["双重门控与马氏关联<br/>空间距离 + 不确定性自适应门控"]
B --> C["检测级位姿细化 DPR<br/>自车锚点粗聚类加权残差校正"]
C --> D["时效性衰减与运动方差补偿<br/>几何/语义不对称衰减 + 方差膨胀"]
D --> E["解耦融合: 语义 Beta-sum 与几何最大证据精选<br/>存在性多方证据累加 + 边界框最可靠源单选"]
E --> F["输出: 最终高质量 3D 检测结果"]
关键设计¶
1. 证据检测头与证据感知稀疏化:显式表征语义与几何双重不确定性
传统检测头仅输出离散类别的标量概率和确定性边界框坐标,使得自车在融合时无法判别异构模型预测的真实可靠度。HERO 引入证据深度学习(Evidential Deep Learning, EDL),在每个本地检测器分支构建共轭先验参数。对于目标存在性(语义),输出二项分类 Beta 参数 \((\alpha^+, \alpha^-)\)(满足 \(\alpha^\pm \ge 1\)),定义总证据强度为 \(S = \alpha^+ + \alpha^-\),物体存在概率均值为 \(p = \alpha^+ / S\),语义认知不确定性定义为 \(u = 2 / S\)。对于 3D 边界框回归(几何),在每个预测维度输出正态-逆伽马(NIG)分布参数 \((\gamma, \nu, \alpha_r, \beta_r)\),其中伪计数 \(\nu\) 代表该回归维度的有效观测样本数。通过计算 7 个边界框维度的平均伪计数 \(\bar{\nu}\),构建认识不确定性代理指标: $\(u_{\text{epi}} = \frac{1}{\bar{\nu} + 1}\)$ 同时从 NIG 分布导出 BEV 平面预测方差 \(\sigma_{i,x}^2, \sigma_{i,y}^2\) 作为定位随机不确定性。为在严苛带宽约束下(如 2 KB/帧)仅保留最高价值的提案,本地智能体利用联合得分 \(s = (1 - u)p = \frac{(S-2)\alpha^+}{S^2}\) 进行非极大值抑制(NMS)后筛选 Top-K 提案,兼顾了高分类置信度与强支持证据。
2. 双重门控与马氏距离关联:适应多智能体异质噪声尺度的自适应聚类
传统晚期融合将多智能体边界框直接合并后执行 NMS,本质上把协同感知退化为简单的“去重”,丢弃了有价值的同源观测支持;且固定 IoU 门槛在存在定位扰动时极易失效。HERO 将冗余性转化为证据聚合的契机,先将协作者提案投影至自车坐标系,再采用几何距离与马氏距离双重门控判定提案 \(i, j\) 是否同源: $\(d_{\text{mah}}^2(i, j) = \sum_{k \in \{x,y\}} \frac{(x_{i,k} - x_{j,k})^2}{\sigma_{i,k}^2 + \sigma_{j,k}^2 + \epsilon} \le \tau_{\text{mah}}, \quad \text{且 } \|x_i - x_j\| \le \tau_{\text{abs}}\)$ 其中 \(\epsilon\) 为数值稳定项。马氏门控能根据各自的预测方差弹性缩放匹配包容度:对定位方差大的弱提案放宽空间距离容限,对高精高确定性提案采用更紧致的门控,避免跨目标强行合并。基于总证据 \(S\) 降序贪婪成簇,并强制每个簇内每个智能体至多贡献一个提案,为后续的证据合成建立干净的多源对应。
3. 时效性衰减与运动方差补偿:建模语义与几何的时间不对称漂移
无线通信中的多径传播、排队及重传会导致不同程度的异步通信延迟 \(\Delta t\)。HERO 针对目标在短时间尺度下“类别属性稳定、空间几何快速漂移”的物理规律,构建了非对称的半双曲衰减函数: $\(f_{\text{geo}}(\Delta t) = \frac{1}{1 + \left(\frac{v_{\text{max}} \cdot \Delta t}{d_{\text{ref}}}\right)^2}, \quad f_{\text{sem}}(\Delta t) = \sqrt{f_{\text{geo}}(\Delta t)}\)$ 其中 \(v_{\text{max}}\) 为场景预期最大车速,\(d_{\text{ref}}\) 为特征定位尺度(通常取车辆宽度量级)。\(f_{\text{sem}}\) 衰减速度显著慢于 \(f_{\text{geo}}\),反映出“500 毫秒前的观测仍大概率是机动车,但其位置可能已漂移数米”的领域先验。同时,在跨时延提案匹配时,将受最大车速截断的运动方差 \(\sigma_{\text{gate}}^2 = \min((v_{\text{max}}\Delta t_{ij})^2, \sigma_{\text{cap}}^2)\) 补偿到马氏门控的分母中,既防止因目标运动导致的漏匹配,又通过上限截断杜绝了大延迟下匹配过于泛滥的误合并。
4. 检测级位姿细化(DPR):免协同训练的自车锚定两阶段平移校正
由于 GPS 误差或标定漂移,协作车发出的提案在自车视角下往往存在整体性的平移系统偏置。HERO 设计了轻量级的检测级位姿精细化(DPR)模块,该模块无需任何外部真值或模型联合训练,纯粹在推理阶段通过两次关联完成。自车首先以自身可靠提案为几何基准(Anchor),在初次粗关联形成的包含自车与协作者 \(a\) 的共有目标簇 \(c\) 中,计算 BEV 坐标残差 \(r_{a,c} = x_c^{(e)} - x_c^{(a)}\)。结合证据强度、NIG 几何不确定性与提案时效性赋权 \(w_{a,c}\),求解协作者 \(a\) 的全局平移偏置: $\(\Delta t_a = \frac{\sum_c w_{a,c} r_{a,c}}{\sum_c w_{a,c}}\)$ 在完成该补偿对协作者所有提案进行刚体修正后,重新触发双门控聚类。这一设计通过纯推理端两遍前向,在几乎零计算开销的前提下消解了传感器外部位姿漂移。
5. 解耦融合准则:语义 Beta-sum 累加与几何最大证据精选
这是 HERO 最具启发性的核心设计。在获得目标簇 \(C\) 后,传统算法常对边界框坐标取协方差加权平均,但这在协作者存在单侧系统性偏置时会产生致命缺陷——几何平均会将自车原本无偏的高精度预测拖偏,直接导致高 IoU 指标(如 AP70)断崖式下跌。为此,HERO 提出完全解耦的融合逻辑: - 语义证据累加(Beta-sum):利用共轭分布可加性,将簇内所有有效提案的伪计数按可靠度 \(r_i = \text{clip}(1 - u_{\text{epi},i}, r_{\text{min}}, 1)\) 和语义时效性 \(f_{\text{sem}}(\Delta t_i)\) 加权累加: $\(\alpha^{*+} = 1 + \sum_{i \in C} r_i f_{\text{sem}}(\Delta t_i) (\alpha_i^+ - 1), \quad \alpha^{*-} = 1 + \sum_{i \in C} r_i f_{\text{sem}}(\Delta t_i) (\alpha_i^- - 1)\)$ 融合成簇的总置信度 \(c^* = p^* (1 - u^*)\),其中 \(p^* = \alpha^{*+} / S^*, u^* = 2 / S^*\)。 - 几何边界框精选(Max-evidence selection):坚决摒弃坐标数值平均,而是依据证据、几何可靠度与几何时效性的综合乘积,挑选单一最可靠的提案输出: $\(i^* = \arg\max_{i \in C} \left( S_i \cdot r_i \cdot f_{\text{geo}}(\Delta t_i) \right)\)$ 该机制确保了几何形态始终由最具确定性、最新鲜的单一源头完整提供,从根本上免疫了相关位姿偏置带来的几何畸变。
损失函数 / 训练策略¶
HERO 中各个智能体的感知模型完全独立训练,不设跨智能体的梯度回传与协同损失。模型训练分为两阶段: 1. 热身阶段:使用常规 Focal Loss 进行分类热身,并结合 Smooth-L1 Loss 稳定 3D 边界框回归,使各异构模型获得可靠的基础特征提取能力。 2. 证据微调阶段:冻结或微调主干,分类头采用 Beta-EDL 损失(包含负对数边际似然损失与针对误分类的狄利克雷/Beta 认知不确定性 KL 正则项),边界框回归头采用负对数正态-逆伽马(NIG)似然损失与结合误差项的不确定性正则惩罚项,促使网络在预测误差较大处自发输出高不确定性参数。
实验关键数据¶
主实验¶
论文在仿真数据集 OPV2V-H(包含 PointPillars-LiDAR [LP]、SECOND-LiDAR [LS]、EfficientNet-Camera [CE]、ResNet-Camera [CR] 异构配置)以及真实车路协同数据集 DAIR-V2X 上展开全面评估。
表 1:OPV2V-H 数据集上随着协作智能体数量增加的 3D 检测精度对比
| 方法 | 融合类型 | 通信量 (log2 B/f) | LP + CE (AP50 / AP70) | LP + CE + LS (AP50 / AP70) | 4 智能体全集 (AP50 / AP70) |
|---|---|---|---|---|---|
| F-Cooper | 特征级 | ~23.5 | 0.842 / 0.686 | 0.843 / 0.686 | 0.843 / 0.686 |
| DiscoNet | 特征级 | ~23.5 | 0.865 / 0.716 | 0.870 / 0.720 | 0.869 / 0.720 |
| AttFusion | 特征级 | ~23.5 | 0.864 / 0.696 | 0.867 / 0.697 | 0.868 / 0.694 |
| CoBEVT | 特征级 | ~20.5 | 0.877 / 0.734 | 0.897 / 0.750 | 0.900 / 0.754 |
| HEAL | 特征级异构 | ~21.0 | 0.875 / 0.782 | 0.922 / 0.853 | 0.923 / 0.855 |
| STAMP | 特征级异构 | ~17.0 | 0.829 / 0.709 | 0.837 / 0.725 | 0.831 / 0.718 |
| CodeFilling | 编码压缩 | ~22.0 | 0.882 / 0.751 | 0.916 / 0.786 | 0.916 / 0.787 |
| GenComm | 生成协同 | ~14.0 | 0.892 / 0.733 | 0.924 / 0.774 | 0.925 / 0.775 |
| HERO (本文) | 目标级 | ~11.0 (约 2 KB) | 0.881 / 0.788 | 0.922 / 0.840 | 0.922 / 0.841 |
表 2:真实场景 DAIR-V2X (V2I) 与 OPV2V-H (V2V) 双智能体异构配置 AP50 表现
| 方法 | DAIR-V2X: LP + LS | DAIR-V2X: LP + CE | DAIR-V2X: LP + CR | OPV2V-H: LP + LS | OPV2V-H: LP + CE | OPV2V-H: LP + CR |
|---|---|---|---|---|---|---|
| F-Cooper | 0.545 | 0.627 | 0.611 | 0.868 | 0.844 | 0.828 |
| DiscoNet | 0.634 | 0.576 | 0.621 | 0.895 | 0.861 | 0.867 |
| AttFusion | 0.661 | 0.649 | 0.623 | 0.891 | 0.863 | 0.839 |
| CoBEVT | 0.692 | 0.638 | 0.660 | 0.934 | 0.860 | 0.865 |
| HEAL | 0.770 | 0.659 | 0.682 | 0.942 | 0.875 | 0.862 |
| CodeFilling | 0.706 | 0.671 | 0.662 | 0.926 | 0.882 | 0.877 |
| GenComm | 0.642 | 0.641 | 0.641 | 0.936 | 0.892 | 0.891 |
| HERO (本文) | 0.823 | 0.744 | 0.753 | 0.933 | 0.881 | 0.880 |
消融实验¶
表 3:关键模块(DPR 位姿校正与时延补偿)在严重噪声下的消融分析(OPV2V-H,位姿扰动 \(\sigma=0.6\) m/deg 且时延 200 ms)
| 配置方案 | DPR 位姿修正 | 时延补偿 (Freshness) | AP50 | AP70 | 说明与分析 |
|---|---|---|---|---|---|
| 基线(无校准) | ✗ | ✗ | 0.737 | 0.661 | 空间位姿偏置与时序陈旧导致关联发生畸变 |
| 仅加入 DPR | ✓ | ✗ | 0.816 | 0.710 | 消除刚体系统误差,AP50 显著提升 7.9% |
| 仅加入时延补偿 | ✗ | ✓ | 0.825 | 0.736 | 抑制陈旧几何污染,AP70 提升明显(+7.5%) |
| 完整 HERO 模型 | ✓ | ✓ | 0.831 | 0.737 | 双重校准协同工作,综合指标达到最强抗扰水平 |
表 4:几何与语义融合规则解耦对比(AP50 / AP70)
| 几何融合规则 | Clean (理想环境) | N+D (噪声0.6 + 时延200ms) | 语义融合规则 | Clean (理想环境) | N+D (噪声0.6 + 时延200ms) |
|---|---|---|---|---|---|
| max-evidence (本文) | 0.902 / 0.810 | 0.831 / 0.737 | beta-sum (+rel, 本文) | 0.902 / 0.810 | 0.831 / 0.737 |
| mean-box (坐标均值) | 0.890 / 0.783 | 0.824 / 0.661 | beta-sum (w/o rel) | 0.887 / 0.804 | 0.832 / 0.732 |
| PoE (专家乘积) | 0.891 / 0.784 | 0.828 / 0.737 | score-mean (+rel) | 0.854 / 0.755 | 0.768 / 0.673 |
| max-score (最高得分) | 0.906 / 0.826 | 0.626 / 0.496 | score-mean (w/o rel) | 0.846 / 0.752 | 0.746 / 0.648 |
关键发现¶
- 解耦融合规则的必要性得到坚实证明:表 4 表明,如果几何边界框采用常规的
mean-box均值策略,在噪声和时延下 AP70 暴跌至 0.661(较本文方案下降达 7.6%);而完全依赖置信度分数的max-score在干净场景看似最优,但在扰动下因分数未校准直接崩塌(AP70 暴跌至 0.496)。相反,语义采用beta-sum累加支持度,几何坚持max-evidence单选,达成了最优的抗扰稳态。 - 真实车路协同(DAIR-V2X)的飞跃式突破:在真实 V2I 场景下,路端与车端存在巨大的视角和感知能力落差,信源选择冲突率(高语义置信度但几何质量低下)极高(如 LP + CE 组合下冲突率高达 72.6%)。HERO 依靠基于 NIG 不确定性导出的几何可靠度权重进行过滤,在 DAIR-V2X 三种组合上均大比例超越已有 SOTA(如在 LP + CE 上较 HEAL 提升达 +8.5% AP50)。
- 通信体积压缩达 3 个数量级:在维持与顶级特征级融合架构(HEAL、CoBEVT)相当的 AP 指标下,HERO 仅传输稀疏提案,每帧数据包体积仅约 2 KB(\(\log_2 \text{Bytes} \approx 11\)),相比稠密 BEV 特征传输(\(\sim 2-8\) MB/帧,\(\log_2 \text{Bytes} \approx 21-23\))实现了超 1000 倍的带宽节省。
亮点与洞察¶
- 精辟的“语义累加、几何精选”解耦哲学:深刻洞察了多传感器数据融合在物理层面的统计非对称性——语义属于离散分类证据,多信源可交换并产生更确定性的后验收敛;而几何坐标属于空间连续回归,异构系统的系统性偏差不满足独立同分布假设,均值融合只会产生负迁移。这一原则为目标级融合设计树立了新典范。
- 免协同训练的即插即用范式:完全规避了跨机构、跨厂商智能体必须共同联合微调特征对齐层的不可行前提。各车辆或路侧单元仅需在本地感知头输出共轭分布参数,自车即可通过纯推理侧的 DPR 与马氏聚类完成自适应鲁棒融合。
- 时间与空间不确定性的优雅统一:将通信延迟 \(\Delta t\) 转化为非对称的语义/几何时效性权重,并将预估运动方差直接注入马氏空间门控分母,统一将时间延迟、空间位姿偏差与网络内在预测不确定性融入统一的贝叶斯证据框架。
局限与展望¶
- 目标级表征能力受限导致长尾假阳性:作者承认,与保留整场上下文的特征级方案相比,目标级交换的特征高度压缩,自车缺乏细粒度的背景特征来进行二次语义校验;在复杂动态车流中容易产生长尾低置信度虚警(False Positives)。
- DPR 依赖自车存在重叠有效观测:DPR 位姿校准的前提是自车与协作车拥有共同视场并检出了同源目标簇作为锚点。若自车完全处于遮挡或无目标开阔区域,位姿偏置估计将退化为依赖历史滤波或直接失效。
- 未来方向:可在自车侧引入时间跨度的时序追踪一致性约束(Temporal Tracking Consistency),或在极低带宽下增补极为轻量的实例级判别特征向量,以进一步抑制长尾误检并提升单目相机的深度估计稳定性。
相关工作与启发¶
- vs HEAL (arXiv 2024):HEAL 针对异构协同感知设计了跨模态特征金字塔对齐机制,但属于特征级融合,通信带宽需求高且需要两两配对联合训练。HERO 转向目标级,无须特征对齐与协同微调,在真实 DAIR-V2X 场景中全面反超 HEAL。
- vs OptiMatch (IV 2023) / VIPS (MobiCom 2022):两者均为考虑位姿扰动或时延的目标级融合工作,但依赖传统的启发式贪婪匹配或固定阈值图匹配,置信度缺乏校准。HERO 引入 Beta/NIG 双重证据,在严重噪声(\(\sigma=0.4\))下 AP50 领先 OptiMatch 达 18.4%,且无需复杂的多帧航迹关联图计算。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐(首次将证据理论与“语义累加、几何单选”解耦策略系统性引入异构目标级协同感知)
- 实验充分度: ⭐⭐⭐⭐⭐(仿真 OPV2V-H 与真实 DAIR-V2X 双基准,覆盖多智能体扩展、多模态异构组合、位姿与时延应力测试及深入的消融实验)
- 写作质量: ⭐⭐⭐⭐⭐(问题剖析一针见血,数学推导与物理机制交代清晰自洽,图表完备)
- 价值: ⭐⭐⭐⭐⭐(彻底解决了车路协同在现实落地中面临的异构互操作性、高通信带宽成本与标定漂移三大核心痛点,具有极高的工程应用与学术启发价值)