跳转至

When the City Teaches the Car: Label-Free 3D Perception from Infrastructure

会议: ECCV 2026
论文: ECCV 官方主页
代码: https://jinsuyoo.info/civet
领域: 自动驾驶
关键词: 3D目标检测, 无标注学习, 车路协同, 路侧感知, 伪标签蒸馏

一句话总结

提出路侧基础设施自监督教学(infrastructure-taught)范式,利用固定路侧单元(RSU)在静止视角下的时序一致性无标注自学3D检测器,并将预测广播聚合为车端伪标签,使自车摆脱对人工真值标签与在线V2X通信的依赖,在CARLA CIVET基准上达到82.3%的车辆检测AP(对齐全监督上界的87%)。

研究背景与动机

自动驾驶系统要实现高可靠的3D环境感知,长期以来极度依赖大规模自车视角的传感器采集与昂贵的人工三维标注。然而,由于不同城市与区域在道路几何、基建设施及交通流模式上存在巨大异质性,自动驾驶系统在扩展到新城市时不得不陷入反复收集、人工标注、重新训练的恶性循环,有限的人工标注产能与开放道路环境的分布复杂性之间存在着结构性失配。与此同时,现有无标注或自监督3D目标检测方案大多基于自车中心视角展开,自车在动态移动过程中的连续遮挡、视场受限以及点云稀疏等问题,使得自车仅靠自身观测挖掘高质量无监督伪标签的难度极高。

但现实城市交通体系正在发生深刻变革:为了构建智能网联协同交通系统(C-ITS),全球众多城市的交叉路口与关键路段正广泛密集地架设路侧感知单元(Roadside Units, RSU)。与时刻处于剧烈运动和视距受限状态的车端传感器相比,固定部署的RSU拥有全天候不变的观察视点、高位俯视的宽阔视场以及稳定的背景几何。如果能够让RSU充当无监督的本地专家教师,在车辆穿行城市时为车端提供感知监督信号,便能彻底打破跨地域扩展必须依赖密集人工标注的困境。

然而,将车端标注压力简单转嫁给路侧并不能解决问题——若成千上万的RSU本身仍需海量人工标注来训练模型,标注成本并未减少。这项工作的核心切入点正是RSU具备的独特性质——静止性(Stationarity):固定位置的RSU能够对同一物理场景进行全天候重复观测,背景区域在时序上恒定静止,而前景交通目标则呈现高度动态的生灭特征,这为纯粹无标注的目标发现提供了天然的时序对比约束。核心 idea:利用固定路侧单元(RSU)在静止视点下的背景稳定性与时序对比无标注自学局部3D检测专家,并在车端穿行时通过无线广播与坐标对齐聚合高质量伪标签,最终离线蒸馏出一个在推理阶段完全无需基建支持与在线通信的独立自车3D检测器。

方法详解

整体框架

本文提出的“城市教学(Infrastructure-Taught)”框架构建了一个完全无需人工标注的端到端学习闭环,主要由三个离线/在线协同的阶段组成:第一阶段在路侧离线自监督学习,各静止RSU利用长时序背景稳定性和点云持久度自学局部3D检测器;第二阶段在线广播与自车标签聚合,当自车穿行于RSU覆盖区域时,接收各路侧专家的3D边界框预测,通过外参刚体变换投影到自车自车坐标系下,经过距离加权NMS与质量过滤聚合成车端伪标签;第三阶段车端离线训练与独立部署,车端利用聚合的多源伪标签离线训练通用的车端3D目标检测器(如CenterPoint或PointPillars),训练完成后车端模型独立部署于开放道路,测试阶段无需任何路侧设备或V2X无线通信链路。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["路侧非标注时序LiDAR点云流"] --> B["阶段1:静止RSU无标注时序自学<br/>持久度评分(PP Score) + 跟踪平滑修正"]
    B --> C["局部专精的RSU 3D检测器"]
    C --> D["阶段2:路侧预测在线广播与空间对齐<br/>刚体变换投影 + 距离加权NMS融合"]
    E["自车行驶LiDAR采集数据"] --> D
    D --> F["聚合生成的高质量自车3D伪标签集"]
    F --> G["阶段3:自车感知模型离线蒸馏与训练<br/>CenterPoint / PointPillars骨干学习"]
    G --> H["独立自车3D感知系统<br/>测试期零路侧依赖 / 无需V2X通信"]

关键设计

1. 静止RSU无标注时序自学:利用场景恒常性自监督提取目标真型 为了避免在路侧引入人工标注开销,第一阶段充分利用RSU视点的绝对静止特性。由于背景几何(地面、建筑、行道树、立柱等)在长时间跨度内高度稳定,而车辆、行人等运动物体在空间中频繁转移,系统采用时序持久度评分(Persistence Point Score, PP Score)来定量评估点云中各点的空间出现频率:在长时序帧中反复出现的背景点被赋予高持久度评分并被快速剔除,瞬时出现的低持久度点被标记为前景运动候选。随后应用DBSCAN聚类生成初始粗糙的3D检测候选框。为了消除点云距离远近造成的尺寸畸变与假阳性扰动,算法进一步引入基于卡尔曼跟踪的时序平滑机制:跟踪同一运动目标的全生命周期轨迹,选取目标在二维水平面内距离RSU最近(点云分辨率最高、反射最完整)的那一帧所估计的三维几何包围盒尺寸,统一回溯纠正并更新该目标整条轨迹上的边界框尺寸,最终生成高几何一致性的路侧伪标签,训练专属于该路口视角的本地检测器。

2. 空间坐标对齐与距离加权NMS:多教师预测的鲁棒车端融合 当装备有传感器的自车行驶穿过城市路网时,在通信范围内(设定最大通信距离为160米)与多个RSU发生视场重叠。各RSU利用本地训练完成的模型对当前场景进行实时推理,并将输出的3D边界框预测 \(Y_{R_i}\) 通过无线广播发送至自车。车端通过已知的外参标定矩阵 \(T_{R_i \to E}\) 将接收到的3D框统一转换到当前自车的自车坐标系下: $$ \tilde{Y}{R_i} = T) $$ 针对多路侧设备交叉覆盖区域导致的同目标重叠预测与视距衰减误差,系统设计了基于距离加权的非极大值抑制(Distance-Weighted NMS)策略。由于激光雷达随着测量距离增加会出现发散衰减与测量误差增大,每个候选框的置信权重被显式赋以目标到对应RSU欧氏物理距离的倒数: $$ w = \frac{1}{| p_{\text{obj}} - p_{R_i} |_2} $$ 优先保留距离更近、观测几何更清晰的RSU所给出的预测框,并以0.1的低IoU阈值滤除重复预测。同时剔除自车视距过远或点云极其稀疏的无效框,从而在车端生成整洁致密的自车伪标签数据集。}(Y_{R_i

3. 离线车端知识蒸馏:从多局部教师到泛化自车的解耦泛化 路侧单点检测器因过拟合于自身特定视角的几何结构与背景,难以直接泛化至其他路口更无法胜任自车前视视角(在跨视角评估中性能骤降至极低水平)。第三阶段的核心机制是将全城各处分布式的“局部专家RSU”预测,转换为统摄全城不同路况的多视角监督信号。自车将整个驾驶轨迹中累积的多路段时空连续传感器数据 \(X_E\) 与对齐聚合伪标签 \(Y_E\) 汇聚为训练集 \(D_E = \{(X_E, Y_E)\}\)。车端3D目标检测器(如CenterPoint、PointPillars)采用完全标准的目标检测损失函数在 \(D_E\) 上进行端到端离线训练。由于该过程只在离线阶段进行,最终训练得到的自车模型彻底摆脱了测试阶段对路侧设施、定位同步精度或无线通信带宽的任何物理依赖,实现了“城市作为分布式教师,车辆作为自律学生”的范式解耦。

损失函数 / 训练策略

车端检测器与RSU检测器均采用标准3D检测损失函数联合优化,包含热力图高斯焦点损失(Focal Loss)监督目标中心位置,以及Smooth-L1损失监督目标尺寸、中心点三维偏移量、偏航角(Yaw)与速度向量。RSU自监督训练设置初始学习率为 \(5 \times 10^{-4}\),在第10和第15个epoch衰减至0.1倍,共训练20轮。在广播模拟中,为验证真实物理环境下的鲁棒性,显式引入了 \(100\,\text{ms}\) 的传输延迟以及高斯位置扰动(\(\sigma = 0.2\,\text{m}\))与偏航角扰动(\(\sigma = 0.05\,\text{rad}\)),验证了启发式边界框细化(Box Refinement)在应对通信扰动时的增益。

实验关键数据

主实验

实验基于在CARLA与V2Xverse仿真构建的多智能体基准数据集 CIVET 进行评测,包含4个城镇(Town 1, 2, 7, 10),每个城镇部署12个RSU(全量共48个RSU),涵盖城乡不同交通密度分布。在密集城市场景 Town 10 中,以BEV AP(汽车IoU阈值0.5,行人和骑行者阈值0.3)为主评测指标。

表1:Town 10 核心城镇基础设施自监督教学评估(对应原论文 Table 1)

检测器架构 阶段1路侧监督源 阶段1方法 通信噪声 伪标签细化 车辆 AP (Car) 行人 AP (Ped.) 骑行者 AP (Cyc.) 平均 AP (Avg.)
PointPillars 12个RSU(无监督) PP score 74.3 77.0 68.0 73.1
PointPillars 12个RSU(无监督) PP score + 跟踪 79.3 77.5 79.0 78.6
PointPillars 12个RSU(无监督) PP score + 跟踪 80.3 49.1 69.6 66.3
PointPillars 12个RSU(无监督) PP score + 跟踪 76.5 52.7 79.8 69.7
PointPillars 12个RSU(全监督) 人工真值 92.1 82.2 92.8 89.0
PointPillars 自车真值(上限★) 纯车端全监督 94.4 88.0 93.7 92.0
CenterPoint 12个RSU(无监督) PP score 78.7 78.3 61.1 72.7
CenterPoint 12个RSU(无监督) PP score + 跟踪 82.3 79.3 68.5 76.7
CenterPoint 12个RSU(无监督) PP score + 跟踪 80.4 52.3 66.4 66.4
CenterPoint 12个RSU(无监督) PP score + 跟踪 77.7 56.0 75.7 69.8
CenterPoint 12个RSU(全监督) 人工真值 93.9 84.4 93.4 90.6
CenterPoint 自车真值(上限★) 纯车端全监督 94.4 91.8 96.6 94.3

消融实验

表2:4个城镇跨地域扩展性研究(48个RSU,跨城乡联合评测,对应原论文 Table 4)

自车检测器 阶段1路侧监督源 通信噪声 伪标签细化 车辆 AP (Car) 行人 AP (Ped.) 骑行者 AP (Cyc.) 综合平均 AP
PointPillars 48个RSU(无监督) 84.1 78.4 80.2 80.9
PointPillars 48个RSU(无监督) 80.4 56.8 77.8 71.7
PointPillars 48个RSU(无监督) 81.7 63.9 81.7 75.8
PointPillars 4镇自车全监督真值(上限) 92.4 89.3 94.6 92.1
CenterPoint 48个RSU(无监督) 82.7 81.0 78.3 80.7
CenterPoint 48个RSU(无监督) 78.2 53.5 72.5 68.1
CenterPoint 48个RSU(无监督) 80.5 66.4 81.5 76.1
CenterPoint 4镇自车全监督真值(上限) 91.0 90.6 95.3 92.3

表3:与纯车端无监督感知方法的互补性实验(PointRCNN,动态目标检测 AP,对应原论文 Table 5)

监督信息来源 通信传输噪声 动态目标检测 AP (Dyn.) 说明与增益分析
MODEST (纯车端自监督) 18.0 传统自车移动点云持久度挖掘
Oyster (纯车端自监督) 39.8 纯车端先进自监督基线
本文路侧教学 (Ours) 62.0 显著超越纯车端无监督基线 (+22.2 AP)
本文路侧教学 (Ours) 49.9 即使存在噪声仍超越Oyster 10.1 AP
Oyster + 本文路侧教学 (联合互补) 64.9 车端自监督与路侧监督融合最佳 (+2.9 AP)
Oyster + 本文路侧教学 (联合互补) 59.5 融合车端后抗通信噪声能力大幅提升 (+9.6 AP)

关键发现

  • 无标注路侧教学无限逼近全监督上限:在CenterPoint检测器上,纯无监督路侧自学所提供的伪标签教学使自车达到了82.3%的车辆AP与76.7%的平均AP,逼近自车全监督上界(94.3% Avg AP)的81%以上效能,且与使用人工全监督标注的RSU教师(90.6% Avg AP)差距极小。
  • 行人目标对空间与时延对齐极度敏感:引入时延与位置扰动后,汽车类别AP仅微跌约2%(82.3% \(\to\) 80.4%),但行人类别AP发生断崖式下跌(79.3% \(\to\) 52.3%)。这是由于行人空间体积小、激光反射点较少,外参和时延导致的几十厘米级错位即可导致伪标签与自车点云严重失配。而引入启发式框细化(Refine)后,行人AP由52.3%回弹至56.0%(在PointPillars上从49.1%回升至52.7%)。
  • RSU点位与数量的扩展收益显著:在4、8、12个RSU扩展实验中,车端感知性能呈单调上扬曲线;点位消融表明,交叉路口(Intersection)部署因汇聚复杂多向交通流,其伪标签丰富度与质量显著优于直线道路(Linear)或拐角(Corners)布局(路口布局的Car/Ped/Cyc AP达到56.9/37.2/46.3,大幅超越直线布局的36.1/15.3/12.9)。
  • 强大的无监督领域自适应潜力:将乡村城镇(Town 7)训练的模型直接置于高密度城市(Town 10)测试时,车辆AP因域漂移跌至59.2%;仅通过收集城市当地路侧无标注伪标签进行微调,车辆AP跃升至81.9%,骑行者AP更达到76.1%(超越了城市从零训练的68.5%),展现出即插即用的跨域泛化价值。

亮点与洞察

  • 重构车路协同范式的时空解耦设计:不同于既往V2X工作聚焦于推理期在线特征融合(极度依赖超低延迟车路通信且无法在无基建路段行驶),该工作首次将RSU定位于“训练期无监督教师”。车路通信仅在训练集伪标签收集阶段发生,测试期自车完全独立推理,兼具了高拓展性与极端工况下的安全性。
  • 破解无监督标注转移的“死循环”:巧妙利用路侧静态传感器“永恒不变的背景”破解了无监督3D目标发现的先验瓶颈。静止视点使移动物体的时空持久度对比变得极其纯粹,从而能够完全抛弃人工标注训练出高质量的路侧专精检测器。
  • 与车端自监督算法的正交互补性:车端感知长于近场高密度精细特征,路侧高位感知长于广角大视场与抗前车遮挡。实验证明路侧伪标签与Oyster等车端自监督方法结合能产生强烈的正交增益(融合后抗噪AP提升近10个点),证明了多重视角无监督融合的研究前景。

局限与展望

  • 目前仅限于动态目标发现:依赖PP Score时空持久度差异的底层机制决定了该方案主要对汽车、行人和骑行者等动态前景有效;对于长期违规停放的静止车辆或固定障碍物,其在时序上与背景逐渐混同,尚需引入更深层的语义或基础模型先验进行区分。
  • 跨视角点云稀疏度与遮挡视差:路侧高位向下俯视与车载水平前向视角在点云分布模式上存在内在差异,高位俯视下的完整几何轮廓投射到低位车端视点时,可能出现部分伪标签对应区域车端点云完全被遮挡的空框问题,需要更稳健的视线可见性检查(Ray-casting / Visibility Check)。
  • 仿真到现实环境的迁移考验:当前研究在高拟真CARLA多智能体仿真环境中完成。真实世界的真实物理RSU面临震动引起的微小标定漂移、复杂天气(雨雪雾导致透镜污染)以及更加杂乱的非结构化道路目标,需要在真实公开V2X测试床中进一步验证域适应稳定性。

相关工作与启发

  • vs 传统车路协同感知 (如 V2X-Sim, RCooper, DAIR-V2X): 传统协同感知需要车辆和路侧在运行推理期间通过无线网络高频交换特征图或检测框,对网络抖动极其脆弱,且依赖路侧全监督标注。本文将基础设施的作用彻底限定在训练期无标注伪标签生成,推理时车端零通信独立行驶。
  • vs 纯车载端自监督感知 (如 MODEST, Oyster, LISO): 车载端单车自监督受制于自车运动带来的视点变化与动态物体多普勒畸变,运动目标与静态背景难以彻底解耦。本文证明路侧静止观测能提供显著更高质量的目标时空聚类先验,两者结合相较单车自监督带来20+ AP的跨越式性能提升。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 颠覆了车路协同必须依赖在线推理通信的思维定势,首创路侧无监督教师训练独立车载检测器的闭环。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖城乡4个城镇、48个RSU的扩展性验证,兼具通信扰动、网络拓扑、传感器消融与域自适应深度分析。
  • 写作质量: ⭐⭐⭐⭐⭐ 框架三阶段叙事严谨清晰,问题定义直击自动驾驶高昂标注成本痛点。
  • 价值: ⭐⭐⭐⭐⭐ 为未来智慧城市与高等级无人驾驶系统的融合发展提供了极具落地可行性的无标注数据闭环路线。