Learning Ego-Centric BEV Representations from a Perspective-Privileged View: Cross-View Supervision for Online HD Map Construction¶
会议: ECCV 2026
论文: ECCV 2026
代码: https://github.com/DriverlessMobility/CrossViewSupervision
领域: 自动驾驶
关键词: BEV 感知, 在线高精地图构建, 跨视角监督, 特权信息, 特征对齐
一句话总结¶
把与 ego 坐标系精确配准的航拍俯视图当作只在训练期可用的「特权视角」,用一个冻结的航拍编码器为相机 BEV 编码器提供稠密的 BEV 特征级对齐监督(归一化 + 通道仿射适配器稳定跨模态对齐),在不改变推理架构的前提下把 StreamMapNet 在 nuScenes/AID4AD 上的 mAP 从 34.1 提到 38.0(60×30 m)和从 22.4 提到 32.3(100×50 m,相对 +44%)。
研究背景与动机¶
高精地图长期是自动驾驶定位、运动预测与行为规划的关键先验,但它采集昂贵、维护费力,遇到施工、临时改道、季节变化这类动态环境就很难规模化。于是研究重心转向「无图/轻图」感知:让车直接从车载传感器在线推断结构先验,其中在线高精地图构建(online HD map construction)最受关注——车辆用当前观测实时预测局部矢量地图(车道边界、车道分隔线、人行横道),从而摆脱对预建地图的依赖。以 StreamMapNet、MapTR/MapTRv2、VectorMapNet 为代表的 BEV 方法已经能把多相机输入转成结构化矢量输出,在标准基准上表现很强。
问题在于,这类相机 BEV 感知在本质上是 ego-centric 的:车只能从有限的视场观察场景,全局空间结构必须从局部的、带透视畸变的证据里反推。结果是 BEV 编码器容易产出局部不一致甚至碎裂的表示,越到远处越严重——那里视觉线索稀疏、信息密度急剧下降。更麻烦的是监督信号的作用方式:绝大多数方法只在解码成语义/矢量化地图输出之后施加下游任务损失,对中间 BEV 特征的几何结构没有直接约束。也就是说,编码器「长成什么形状」这件事,训练时几乎没人管。一个自然的追问是:能不能在训练阶段就把 BEV 编码器往全局一致的空间表示上引导?
航拍影像恰好提供了互补的俯视视角:路面布局、连通性、长距离空间关系在俯视图里是直接可见的,不受遮挡和透视畸变影响。AID4AD 数据集把航拍影像配准到 nuScenes 的 ego 局部坐标系,建立了航拍图与 ego-centric BEV 表示之间的像素级对应,这让航拍图不再只能用于融合推理,还可以当成跨视角的训练信号。已有的融合方案确实能提升结构完整性和大尺度几何一致性,但要求双编码器、且推理时航拍图必须持续可用,部署代价高。本文的核心 idea 是把 ego 对齐的航拍视角当作一种「特权视角」——它只在训练时存在,通过稠密的 BEV 特征对齐把全局结构先验蒸馏进相机编码器,推理时把特权分支整体摘掉,模型在架构、输入和耗时上与原版相机模型完全一致。
方法详解¶
整体框架¶
方法是一个训练期专用的双分支框架,实例化在 StreamMapNet 之上。学生分支是 StreamMapNet 的 BEVFormer 式相机编码器:输入 6 路同步环视图像,通过可变形注意力把多视角特征聚合成一张统一的 BEV 特征图。教师分支是一个在 AID4AD 上预训练好的航拍编码器(ResUNet,ResNet 主干 + U-Net 解码器),输入与 ego 坐标系配准的航拍裁剪,输出同样是一张 BEV 特征图。两条支路的特征图形状完全相同,都是 \(C\times H\times W = 256\times 50\times 100\)。由于 AID4AD 已经完成像素级配准,两张特征图的同一个空间位置对应地面上的同一块区域,因此不需要任何投影、采样或空间变换,就可以直接逐位置比较。训练时用一个轻量的 MSE 对齐损失把学生特征拉向教师特征,教师始终保持冻结;推理时只保留相机分支,结构、输入和运行时间与 StreamMapNet 完全一致。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["6 路环视图像"] --> B["相机 BEV 编码器<br/>StreamMapNet 主干"]
C["ego 对齐航拍裁剪"] --> D["特权航拍教师<br/>ResUNet,冻结"]
B --> E["通道归一化 + 仿射适配器<br/>仅损失路径生效"]
D --> F["稠密 BEV 对齐损失"]
E --> F
F -->|"λ_bev 加权"| G["总损失<br/>分类 + 回归 + BEV"]
B --> G
G --> H["推理:仅相机分支<br/>架构 / 输入 / 耗时不变"]
关键设计¶
1. 特权航拍教师:把俯视角的稠密结构先验冻结成 BEV 教师
「perspective-privileged view」(视角特权)在这里的含义很具体:训练阶段可以拿到、但部署阶段拿不到的信息,本文特指与 ego 局部坐标系精确配准的航拍俯视图。之所以值得把它当教师,是因为相机视角的结构信息在空间上是不均匀的——近处密集、远处稀疏且被遮挡,而俯视角下道路布局与连通性在整幅图上同等可见,长距离上也保持稳定。作者的做法是复用 AID4AD 上训练好的航拍建图网络作为教师:该网络遵循 ResUNet 结构(ResNet 主干加 U-Net 解码器),从高分辨率航拍图产出度量一致的 BEV 特征,这些特征里已经编码了车道边界、道路边缘和交叉口拓扑。教师在整个训练过程中被冻结,只提供特征目标、不参与梯度更新,因此它的行为不会漂移,学生面对的是一个稳定的回归目标。这一步也解释了为什么本文与 LiDAR-相机蒸馏或扩散式精修不同:后两者的监督信号仍然来自 ego 感知域内部,而俯视角的结构信息在大范围空间上是稳定的,是一种「视角本身带来」的先验,而不是对同一视角信息的再加工。
2. 通道归一化 + 仿射适配器:让异构视角的特征空间可比
直接对两张来自完全不同模态的特征图做逐点 MSE 有一个隐含假设——它们的数值尺度可比,而这在现实中并不成立:航拍分支处理的是正射 RGB 图像、由卷积编解码器产出,相机分支处理的是多视角图像、由可变形注意力聚合而成,两者的特征统计量和归纳偏置差异很大。One-for-All 已经系统指出,异构蒸馏中特征统计与归纳偏置的不匹配会阻碍直接的特征迁移,这恰好解释了为什么「不加处理直接对齐」只能拿到部分收益。本文的对策很轻:在计算对齐损失之前,先把两张 BEV 特征图做逐通道归一化,压掉量级差异;再在学生分支上加一个仿射适配器,对用于监督的那份相机特征做逐通道的缩放与平移 \(\tilde F_c = \gamma_c F_c + \beta_c\),其中每个通道有自己的可学习参数 \(\gamma_c,\beta_c\)。适配器只在损失路径上生效,推理时连同教师分支一起被移除,编码器本身没有任何改动。
这个设计的效果在消融里非常直接:100×50 m 设置下,完全不做归一化也不做适配器时跨视角监督已经把 mAP 从 22.4 推到 28.9,说明即便存在模态漂移,航拍信号本身仍然带着可用的结构信息;补上归一化后跃升到 31.5,说明尺度差异是跨视角对齐里最主要的那部分失配;再加仿射适配器进一步到 32.3,用来补偿剩余的逐通道偏移。更有意思的是特征相似度分析给出的解释:随着归一化和适配器的引入,学生与教师之间的 CKA(线性中心化核对齐,对等距缩放和正交变换不变,衡量的是两个特征空间的结构相似性而非逐点相似性)中位数保持稳定,而 R²(教师特征能否被学生特征线性重建)却逐步下降。也就是说,这两个组件主动放松了逐点数值拷贝,让对齐从「模仿具体数值」转向「保持空间结构对应」——这与异构蒸馏里「保留可迁移的空间结构比最大化数值重建更重要」的经验一致,也解释了为什么更强的数值拟合并没有换来更好的 mAP。
3. 稠密 BEV 对齐损失:把监督从「语义输出」搬回「特征空间」
第三个设计是监督落点本身的选择。现有做法要么走语义路线——接一个轻量分割头、用真实地图栅格化的目标去监督 BEV 特征,要么走同域蒸馏或扩散精修路线,但它们要么把稠密的空间结构压缩成离散的语义类别(类别边界处的几何细节被丢掉),要么仍然局限在 ego 感知域。本文直接把对齐做在共享的 BEV 特征空间里,损失就是两张特征图的逐元素均方误差:
监督信号因此是逐 BEV 位置、逐通道的稠密几何结构,而不是经过解码和量化之后的语义标签。这一点在实验里被专门对照过:在同样的 100×50 m 设置下,用 MapTRv2 风格的辅助损失(轻量分割头 + 真值导出的目标)只能把 mAP 从 22.4 提到 23.3,把权重加大到 3 和 5 分别是 22.4 和 22.8,都远低于 CVS 的 32.3。这排除了「涨点只是因为多了一个 BEV 层级的辅助目标」这一解释——增益来自跨视角的稠密结构监督本身。作者对此的解读是:航拍监督提供的是稠密的结构引导,这是基于离散化语义地图目标的监督所触及不到的。
一个完整示例¶
取一个 nuScenes 训练样本走一遍。6 路环视图像进入 BEVFormer 式相机编码器,经可变形注意力聚合出一张 \(256\times 50\times 100\) 的 BEV 特征图;同一时刻、同一场景的 ego 对齐航拍裁剪(由 AID4AD 提供,已配准到同一局部坐标系)进入冻结的 ResUNet 航拍编码器,产出另一张同样是 \(256\times 50\times 100\) 的特征图。由于两张图共享同一个 ego 对齐的 BEV 栅格,第 \((h,w)\) 个位置天然对应地面上的同一块区域,无需任何投影或重采样即可直接配对。相机特征先做逐通道归一化,再送入仿射适配器得到 \(\tilde F^{\text{cam}}\);两张图逐元素求平方差、取全图均值得到 \(\mathcal{L}_{\text{bev}}\);它与解码器的分类损失、几何回归损失按 \(\lambda_{\text{bev}}\) 加权求和。反向传播时梯度只回到相机编码器和适配器,航拍教师整条支路冻结、不更新。推理时教师分支与仿射适配器一并移除,前向路径退化成原版 StreamMapNet——输入仍然是 6 路图像,输出仍然是矢量地图,参数量和耗时都没有变化。
损失函数 / 训练策略¶
解码器沿用 StreamMapNet:分类头用 Focal Loss(\(\mathcal{L}_{\text{cls}}\)),几何头用基于线的 L1 损失(\(\mathcal{L}_{\text{reg}}\))。总目标是在此基础上加一项加权的 BEV 对齐损失:
\(\lambda_{\text{bev}}\) 控制航拍监督的相对强度,负责在特征级引导与主任务预测目标之间配比。训练用 AdamW,初始学习率 \(1.25\times10^{-4}\)、余弦退火、batch size 4,在单张 NVIDIA L40S 上完成;学习率为单卡训练做了调整,其余架构、训练与评测设置全部与 StreamMapNet 保持一致,以保证观察到的差异只能归因于航拍引导的监督。监督权重在 60×30 m 的 RoI 下取 \(\lambda_{\text{bev}}=60\),在 100×50 m 下取 70。
实验关键数据¶
主实验¶
数据集为 nuScenes + AID4AD 的跨视角扩展,采用 StreamMapNet 沿用、由 Roddick 与 Cipolla 提出的地理分离划分(StreamMapNet 曾量化指出原版 nuScenes 划分中训练帧与测试帧的地理重叠约 84%,因此地理分离下的泛化更值得评测)。指标为各类别与总体的 mAP,类别包括人行横道(APped)、车道分隔线(APdiv)和车道边界(APbound);60×30 m 区域的 mAP 在 \(\{0.5,1.0,1.5\}\) m 距离阈值上取平均,100×50 m 区域在 \(\{1.0,1.5,2.0\}\) m 上取平均。所有结果都在完全相同的相机单模态推理条件下取得。
| RoI | 方法 | APped↑ | APdiv↑ | APbound↑ | mAP↑ | 相对提升 |
|---|---|---|---|---|---|---|
| 60×30 m | StreamMapNet | 32.2 | 29.3 | 40.8 | 34.1 | – |
| 60×30 m | StreamMapNet + CVS | 40.1 | 30.3 | 43.5 | 38.0 | +11%(+3.9) |
| 100×50 m | StreamMapNet | 25.6 | 17.4 | 24.3 | 22.4 | – |
| 100×50 m | StreamMapNet + CVS | 40.3 | 25.8 | 30.7 | 32.3 | +44%(+9.9) |
两个 RoI 上跨视角监督都稳定优于基线,且增益随范围扩大而显著放大:60×30 m 下 mAP 从 34.1 升到 38.0,三个语义类别全线上涨;100×50 m 下从 22.4 升到 32.3(绝对 +9.9),其中人行横道一类涨了 14.7 个点。这与动机里「ego-centric 观测在远处变得稀疏、结构歧义最大」的判断一致。
消融实验¶
在 100×50 m 设置下固定其他配置,考察归一化与仿射适配器的作用(全部模型 \(\lambda_{\text{bev}}=70\)):
| 配置 | mAP↑ | Δ(相对基线 22.4) | 说明 |
|---|---|---|---|
| 无归一化、无适配器 | 28.9 | +6.5 | 直接对齐已有明显收益,但受模态漂移拖累 |
| + 仅归一化 | 31.5 | +9.1 | 修正跨模态尺度差异,是最大的一步提升 |
| + 归一化 + 仿射适配器 | 32.3 | +9.9 | 完整 CVS,补偿残余的逐通道偏移 |
另外两组对照(同为 100×50 m):
| 对照维度 | 配置 | mAP | 说明 |
|---|---|---|---|
| 监督形式 | MapTRv2 风格辅助损失(权重 1 / 3 / 5) | 23.3 / 22.4 / 22.8 | 轻量分割头 + 真值目标,远低于 CVS 的 32.3 |
| 监督形式 | CVS(本文) | 32.3 | 稠密特征级跨视角对齐 |
| 教师架构 | ResUNet(原) | 教师侧 47.3 → 学生 32.3 | 教师精度最低,学生最好 |
| 教师架构 | ResUNet++ | 教师侧 52.2 → 学生 30.5 | 教师更准,学生反而更差 |
| 教师架构 | UNet++ | 教师侧 55.0 → 学生 32.2 | 与 ResUNet 教师基本持平 |
关键发现¶
- 收益随 RoI 增大而放大,这是本文最有说服力的一条证据:标准 60×30 m 下 +3.9 mAP,扩展到 100×50 m 后 +9.9 mAP。说明航拍监督补的正是 ego-centric 观测在大范围上的结构性短板,而不是简单地改善近处预测。
- 归一化是稳定跨视角对齐的关键,适配器是精细补充:无归一化 28.9 → 仅归一化 31.5(+2.6),再加适配器 32.3(+0.8)。尺度失配占了大头,逐通道偏移是次要项。
- CKA 稳定而 R² 下降:三个受监督变体的 CKA 中位数相当,R² 却随归一化和适配器的加入逐步降低。结合 mAP 的消融可以推断——保留空间对齐的激活结构(CKA)比最大化逐点数值重建(R²)更重要,这也解释了为什么「更强的数值拟合」并不等于更好的建图效果。
- 教师侧精度不能预测学生收益:ResUNet++ 教师比原 ResUNet 教师准 4.9 个点,对应的学生却从 32.3 掉到 30.5;UNet++ 教师精度最高(55.0)对应的学生(32.2)也只是与原来持平。补充材料里的教师特征可视化给出了一种解释——ResUNet++ 教师的激活更不局部化、频率更高,可迁移性反而更差。同时把学生 BEVFormer 编码器从 1 层加到 2 层没有实质变化,说明瓶颈不在学生容量,而在教师表示的可迁移性。
- 雨天场景的相对退化被显著压缩:补充材料的初步分析显示,CVS 把雨天场景的相对性能下降从 21.2% 降到 10.0%。这是一个很值得注意的副产品——特权视角监督似乎提升了模型在视觉证据劣化时的鲁棒性。
- 监督权重需要按 RoI 分别设定(60 与 70),论文没有报告权重扫描曲线,这项工作留给了读者。
亮点与洞察¶
- 训练-推理解耦的「特权视角」范式:把只在训练时可得的额外视角当成特权信息源,用特征级对齐把它压缩进学生编码器,推理时整条支路被摘除。架构、输入、耗时三项都不变,意味着它可以作为插件叠到任意现有多相机 BEV 管线上,不需要新传感器或新基础设施——这是它相比融合方案最本质的优势。
- 「不需要投影」是这套监督成立的关键前提:航拍图已经配准到 ego 局部坐标系,教师和学生输出的特征图共享同一个 BEV 栅格,所以跨视角监督退化成了一次逐元素的 MSE,完全没有跨视角几何变换的工程复杂度。反过来说,这套方法的可行性高度依赖配准质量,是整个设计的阿喀琉斯之踵。
- CKA/R² 这对诊断指标可以迁移:用「结构相似性(CKA)稳定 + 数值重建(R²)下降」来解释「为什么加了适配器反而更好」,把「蒸馏里到底该模仿什么」这个模糊问题拆成了两个可测量的维度。任何跨模态/跨架构蒸馏工作都可以复用这套诊断来判定对齐是在学结构还是在背数值。
- 用监督形式的对照实验排除平凡解释:专门训练了 MapTRv2 风格的 BEV 层级辅助损失并在多个权重下对比,主动堵住「涨点只是多了个辅助任务」这条质疑路径,实验设计意识很好。
- 教师选择的结论有反直觉价值:「教师越准,学生越好」在这个跨视角场景下不成立,可迁移性取决于中间表示里有多少空间结构是学生能接住的。这个观察对后续做特权视角监督、跨模态蒸馏的人都直接有用。
局限与展望¶
- 依赖精确 ego 对齐的航拍影像(作者明确承认的首要限制)。公开正射影像、商业卫星图、无人机拍摄这些来源本身不缺,但「与 ego 局部坐标系的精确度量配准」是硬要求,AID4AD 提供的是半自动高精度配准流程。要推广到更大数据集和更多部署区域,配准流程的自动化与规模化是必须迈过的一道坎。
- 验证范围窄:AID4AD 目前只为 nuScenes 提供跨视角对齐的航拍图,因此实验只在 nuScenes 上完成,地图类别也只有人行横道、车道分隔线、车道边界三类。作者提出扩展到 Argoverse 2 之类的数据集以覆盖更多传感器配置与地理环境,但尚未做。
- 教师训练成本未量化:方法需要一个预先训练好的航拍建图教师,论文没有报告教师训练的开销、也没有分析配准误差对下游学生性能的敏感性——这两点对实际部署决策很重要。
- 训练开销的定量报告缺失:文中只说推理时零开销,但训练期多了一个前向的教师分支和一份航拍输入,显存与单步时间的增量没有给出数字,读者无法直接估算复现成本。
- 超参需按 RoI 手调:\(\lambda_{\text{bev}}\) 在 60×30 m 用 60、100×50 m 用 70,缺少权重敏感性扫描,不清楚这个区间有多宽。
- 监督形式的对照还不够彻底:与 MapTRv2 风格辅助损失的对比只试了权重 1/3/5 三个点,没有探索分割头的容量、目标编码方式等其他设计维度;结论「辅助损失不行」在更宽的设计空间里是否仍成立,值得再确认。
- 可延伸:既然特权视角监督改善的是编码器的空间结构,那它是否也能用于占据预测、运动预测这类同样依赖 BEV 空间推理的任务?作者把这条列为未来工作,是这套范式的自然延伸。
相关工作与启发¶
- vs StreamMapNet:本文的基线就是它,方法完全不动其架构与训练配置(除学习率按单卡调整),只在训练期外挂一条航拍教师分支和一项特征对齐损失,因此增益可以干净地归因于跨视角监督。优势是插拔式、零推理代价;劣势是引入了对航拍配准数据的依赖。
- vs MapDistill / DistillBEV / BEV-LGKD:这些工作同样做「训练时用强模态、推理时只用相机」,但教师与学生处在同一个 ego 感知域内(LiDAR 或 LiDAR-相机融合)。本文把监督来源换成了一个不同视角——俯视角的结构信息在大空间范围上不受遮挡与透视畸变影响,因而能提供同域蒸馏给不出的长距离全局结构。
- vs AID4AD 的融合式方案:融合方案需要双编码器且推理时航拍图必须持续可用,结构完整性与大尺度一致性更好,但部署代价高;CVS 只把航拍图当训练信号,用「训练时的一次性数据可得性」换「推理时的零额外依赖」。
- vs BEVDiffuser / MapDiffusion / DifFUSER 等扩散类方法:它们把扩散用在推理阶段的特征去噪或解码精修,仍局限在 ego 感知域内部且带来推理开销;CVS 的增益全部来自训练期的表示塑造,不改变推理路径。
- vs One-for-All:本文显式继承了它关于「异构蒸馏中特征统计与归纳偏置不匹配会阻碍直接迁移」的结论,并把它作为设计依据——归一化与仿射适配器正是为缓解这种不匹配而加的轻量对齐机制。
评分¶
- 新颖性: ⭐⭐⭐⭐ 把「训练期特权视角 + 稠密 BEV 特征对齐」这套组合用于在线建图,思路清晰且与同域蒸馏、辅助损失形成了明确区分;单点机制不算全新,但问题定位和跨视角这一角度有独立价值。
- 实验充分度: ⭐⭐⭐ 主结果覆盖两个 RoI 并做了归一化/适配器消融、监督形式对照和教师架构对照,方向克制而有针对性;但只有 nuScenes 一个数据集、缺少训练开销和权重敏感性的定量报告。
- 写作质量: ⭐⭐⭐⭐ 动机链条清楚,特征空间分析(CKA/R²)把「为什么这样设计」讲到了表示层面而不是只靠 mAP;部分公式在缓存文本中有损坏,机制描述仍可完整还原。
- 价值: ⭐⭐⭐⭐ 训练-推理解耦让它可以直接插进现有多相机 BEV 管线,零推理开销;「教师侧精度不预测学生收益」「结构对齐优于数值模仿」这两条结论对更广的特权视角监督与跨模态蒸馏研究有直接的参考意义。