跳转至

SGC-Lane: Monocular 3D Lane Detection with Standard-Definition Map Guidance and Lane Completion

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/FuqingJIang/SGC-Lane
领域: 自动驾驶
关键词: 3D车道线检测、单目视觉、标准定义地图先验、车道线补全、序列一致性

一句话总结

针对单目 3D 车道线检测中 2D 到 3D 几何推断不适定与远端截断问题,SGC-Lane 利用粗粒度 SD 道路级中心线结合前视动态车道宽度预测进行车道概率图引导,并通过基于步长一致性约束的 SCC-Head 完成端点聚类补全,在 OpenLane 上取得 65.6% F1-score。

研究背景与动机

单目 3D 车道线检测作为自动驾驶感知系统的重要支撑,凭借传感器低成本优势获得了广泛关注。然而,从单张 2D 图像恢复三维物理空间的车道线几何本质上属于严重的不适定反问题。在实际道路场景中,长距离感知模糊、急转弯、起伏坡道以及车辆密集遮挡,使得视觉特征难以提供足够精确且连续的深度与几何证据。虽然高精地图(HD Map)可以提供丰富的几何与拓扑先验,但其高昂的数据采集与实时更新成本阻碍了大规模落地。相比之下,标准定义导航地图(SD Map)覆盖范围极广且易于获取,但在车道线感知中鲜有成功应用:SD 地图仅包含米级误差的“道路级中心线”,将同向行驶的多条车道粗略抽象为单一拓扑线,与真实的具体车道物理边缘存在严重的表征鸿沟与对齐偏差。

与此同时,当前主流的 3D 车道线检测多采用沿纵向深度预采样的稀疏点集表示。受限于标注生成时的截断策略与视觉视野边界,模型预测的车道线往往在端点处呈现提前截断与断裂现象。现有的端点修补方法(如 EP-Head)仅针对每个采样点独立回归端点距离,容易受个别点误差影响而产生不稳定的补全预测,没有利用稀疏点集天然固有的沿纵轴等间距结构约束。

为了打破 SD 地图先验难以引导精细车道线、以及稀疏点预测容易断裂的两大瓶颈,本文将粗粒度地图引导与结构化端点补全融合到一个统一框架中。核心 idea:利用前视图像特征动态预测道路宽度,将道路级 SD 中心线法向扩展为多条候选车道边缘概率图以引导前视特征聚焦与局部空间注意力初始化,同时引入固定纵向步长二阶差分一致性损失与端点聚类机制,实现低成本地图辅助下几何完备的单目 3D 车道线重建。

方法详解

整体框架

SGC-Lane 采用基于查询的单目 3D 车道线感知流程,核心包含两个主要阶段:第一阶段由前视引导地图编码器(FV-Guided Map Encoder)将粗糙的 SD 道路中心线转换为车道概率图和车道感知特征;第二阶段利用局部空间交叉注意力(LSCA)将先验注入车道查询,并经过解码器与步长一致性补全头(SCC-Head)输出精确补全的 3D 车道线。

输入包含单目相机前视图像与空间窗口(\(x \in [-15\,\text{m}, 15\,\text{m}], y \in [3\,\text{m}, 103\,\text{m}]\))内的 SD 地图道路中心线集合 \(\mathcal{M} = \{C_i\}_{i=1}^N\)。通过 FV-Guided Map Encoder,系统预测每条道路中心线对应的车道宽度 \(\hat{w}_i\),沿着曲线法向生成 \(\beta\) 条平行车道边界,投射至前视平面得到车道概率图 \(\mathcal{H}\) 以及结构化地图特征 \(\mathbf{M}_{\text{map}}\)。车道概率图通过可学习门控增强前视视觉特征;随后,车道查询(Lane Queries)在 LSCA 模块中根据其预测的地面粗略坐标,自适应检索局部 \(K\) 个最近的先验地图特征进行交互融合。最后,LATR 风格的解码器结合非均匀透视感知采样平面(NUS-Plane)生成车道几何点,并由 SCC-Head 回归出具有二阶差分一致性的端点偏移量,通过聚类输出完整的 3D 车道线。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    InImg["前视图像"]
    InMap["SD地图道路中心线"]

    subgraph S1["前视引导地图编码器"]
        direction TB
        FVE["FV特征与全局上下文提取"]
        CW["动态车道宽度预测<br/>法向扩展β条候选车道线"]
        Heatmap["地面到图像投影与栅格化<br/>生成车道概率图 H"]
        MapFeat["几何与位置嵌入生成<br/>车道感知地图特征 M_map"]
        FVE --> CW
        CW --> Heatmap
        CW --> MapFeat
    end

    InImg --> FVE
    InMap --> CW

    Gate["可学习门控加权<br/>概率图调制前视特征"]
    Heatmap --> Gate
    InImg --> Gate

    subgraph S2["局部空间交叉注意力 LSCA"]
        direction TB
        QGen["点感知查询构建<br/>Q_lane ⊕ Q_point"]
        Loc["粗略地面坐标预测 (x, y)"]
        TopK["Top-K 局部空间先验检索"]
        CA["交叉注意力特征融合"]
        QGen --> Loc --> TopK --> CA
    end

    Gate --> QGen
    MapFeat --> TopK
    MapFeat --> CA

    Dec["LATR 解码器迭代优化<br/>融合非均匀透视采样平面 NUS-Plane"]
    CA --> Dec

    subgraph S3["步长一致性补全头 SCC-Head"]
        direction TB
        OffPred["逐点端点偏移量预测 (s_k, e_k)"]
        ConsLoss["二阶步长差分一致性约束"]
        Clust["端点候选集自适应聚类"]
        OffPred --> ConsLoss
        OffPred --> Clust
    end

    Dec --> OffPred
    Clust --> Out["输出最终完整 3D 车道线"]

关键设计

1. 前视引导地图编码器:从道路级粗拓扑到车道级几何先验 SD 地图中的道路中心线仅表征道路整体走向,无法指示具体的车道边界线,且存在数米的横向偏移误差。为克服这一表征鸿沟,本模块首先利用坐标编码器将中心线采样点 \(p_{i,j}\) 映射为点级特征 \(f_{i,j}\),经均值池化得到中心线表示 \(\bar{F}_i\);同时,将前视视觉特征全局池化得到的图像上下文向量 \(v_{\text{ctx}}\) 广播至各中心线,通过轻量 MLP 动态回归对应的车道宽度: $\(\hat{w}_i = \text{MLP}(\phi(\bar{F}_i, v_{\text{ctx}}))\)$ 获得 \(\hat{w}_i\) 后,沿每个采样点的法向矢量向两侧平移,先将单一道路中心线扩展为 \(\beta\) 条平行车道中心线,再进一步平移 \(\pm \frac{1}{2}\hat{w}_i\) 衍生出左、右车道物理边缘。将这些空间曲线投影回前视图像平面并进行高斯平滑栅格化,生成车道概率热力图 \(\mathcal{H} \in [0, 1]^{H \times W \times 1}\);同时,结合点坐标编码与沿线位置编码构建出车道感知地图特征 \(\mathbf{M}_{\text{map}}\)。这一设计将不确定的粗糙道路先验动态转化为了兼顾视觉实际测量的车道级空间约束。

2. 局部空间交叉注意力:空间约束下的局部先验注入 若直接将包含大量车道先验的地图特征全局与前视查询进行注意力计算,容易导致远距离特征混叠与巨大的计算开销。LSCA 模块采用由粗到细的空间局部检索策略。查询生成器首先将实例级查询 \(\mathbf{Q}_{\text{lane}}\) 与可学习点嵌入 \(\mathbf{Q}_{\text{point}}\) 广播相加得到逐点查询 \(q_p \in \mathbb{R}^C\)。针对每个逐点查询,利用小型 MLP 预估其对应的地面横向位置 \(\hat{x}_p\),并与该点预设的纵向锚点坐标 \(\hat{y}_p = y_{\text{anchor}}[p]\) 配对,得到参考坐标 \((\hat{x}_p, \hat{y}_p)\)。随后,模块计算该坐标与所有地图特征三维坐标 \(\mathbf{C}_{\text{map}}\) 的欧氏距离,仅检索距离最近的 \(K\) 个局部地图 token: $\(\text{idx}_p = \operatorname{TopK}_K \big(-\|\mathbf{C}_{\text{map}} - (\hat{x}_p, \hat{y}_p)\|_2\big)\)$ 查询 \(q_p\) 仅以此局部特征集作为键值对进行交叉注意力融合,精准吸收几何先验信息,避免了全局误匹配。

3. 步长一致性补全头:基于稀疏点序列约束的端点聚类恢复 稀疏点集沿纵轴(\(Y\) 轴)具有严格的等间距采样先验,这意味着沿车道前进时,各采样点到车道起点与终点的纵向距离差应呈现均匀渐进变化。传统方法单独预测每个点的补全距离,容易因单点视觉模糊导致补全截断或发散。SCC-Head 要求每个采样点锚点 \(p_k = (x_k, y_k, z_k)\) 预测其相对于起点和终点的位移偏移量 \(\hat{s}_k, \hat{e}_k\)。通过最小化连续点位移增量的二阶差分,显式施加步长一致性约束: $\(\mathcal{L}_{\text{sy-cons}} = \frac{1}{M-2} \sum_{k=2}^{M-1} \left| \Delta \hat{s}^y_k - \Delta \hat{s}^y_{k-1} \right|, \quad \Delta \hat{s}^y_k = \hat{s}^y_{k+1} - \hat{s}^y_k\)$ 在推理阶段,所有锚点预测的起点与终点候选位置 \(p_k + \hat{s}_k\)\(p_k + \hat{e}_k\) 被送入轻量聚类算法 \(\mathcal{K}\) 中,通过聚类中心稳健得出最终端点,并沿预设 \(Y\) 轴间隔自动补充缺失的几何点,消除长距离或遮挡导致的截断碎段。

损失函数 / 训练策略

模型采用端到端多任务监督训练。总损失包含车道几何回归损失、分类损失、可学习门控与车道宽度监督,以及专门针对端点一致性的 SCC-Head 损失: $\(\mathcal{L}_{\text{SCC}} = \mathcal{L}_{\text{base}} + \lambda_{\text{sy}}\mathcal{L}_{\text{sy-cons}} + \lambda_{\text{ey}}\mathcal{L}_{\text{ey-cons}}\)$ 其中 \(\mathcal{L}_{\text{base}}\) 为预测偏移与真实端点偏移之间的平均 L1 距离,超参数设置为 \(\lambda_{\text{sy}} = 1.0, \lambda_{\text{ey}} = 1.0\)。骨干网络采用 ResNet-50,输入图像分辨率调整为 \(720 \times 960\)。采用 AdamW 优化器,初始学习率 \(2 \times 10^{-4}\),遵循余弦退火策略,在 8 张 NVIDIA RTX 4090 GPU 上分布式训练 24 个 epoch,全局批大小为 32。

实验关键数据

主实验

在公开的大规模 3D 车道线感知基准 OpenLane 验证集上,SGC-Lane 与主流单目 3D 车道线检测方法进行了定量对比(对应论文 Table 1):

方法 骨干网络 F1-score (%) ↑ 近端 X 误差 (m) ↓ 远端 X 误差 (m) ↓ 近端 Z 误差 (m) ↓ 远端 Z 误差 (m) ↓
PersFormer (ECCV 2022) EfficientNet 50.5 0.485 0.553 0.364 0.413
Anchor3DLane (CVPR 2023) ResNet-18 53.1 0.300 0.311 0.103 0.139
BEV-LaneDet (CVPR 2023) ResNet-34 58.4 0.309 0.659 0.244 0.631
LATR (ICCV 2023) ResNet-50 61.9 0.219 0.259 0.075 0.104
LaneCPP (CVPR 2024) EfficientNet 60.3 0.264 0.310 0.077 0.177
GLane3D (CVPR 2025) ResNet-50 63.9 0.193 0.234 0.065 0.090
SC-Lane (ICCV 2025) ResNet-50 64.3 0.227 0.251 0.088 0.128
Chang et al. / EP-Head (CVPR 2025) ResNet-50 64.7 0.205 0.255 0.074 0.105
SGC-Lane (本文) ResNet-50 65.6 0.204 0.254 0.076 0.107
GLane3D (CVPR 2025) Swin-B 66.0 0.170 0.203 0.063 0.087
SGC-Lane (本文) Swin-B 68.0 0.197 0.237 0.072 0.101

同时,在各类极端与复杂工况子集下,SGC-Lane 在大部分场景均刷新了 SOTA(对应论文 Table 2):上下坡(Up&Down)F1 达 56.9%(提升 1.6%);急弯场景(Curve)达 72.4%(提升 0.9%);交叉路口(Intersection)达 57.1%(提升 1.0%);汇合/分流场景(Merge&Split)达 65.5%(平最佳),夜间(Night)达 58.6%。

消融实验

为验证各个核心模块(SD-Map 先验模块、SCC-Head 补全头、NUS-Plane 非均匀透视采样平面)的有效性,在 OpenLane 数据集上开展了系统性消融研究(对应论文 Table 3):

实验编号 SD-Map SCC-Head NUS-Plane F1-score (%) ↑ 增益 (Gain) ↑ 近端 X 误差 (m) ↓ 远端 X 误差 (m) ↓ 近端 Z 误差 (m) ↓ 远端 Z 误差 (m) ↓ 说明
Exp 1 - - - 61.9 - 0.219 0.259 0.075 0.104 基线 LATR
Exp 2 - - 63.4 +1.5 0.208 0.241 0.072 0.103 仅引入 SD 地图先验
Exp 3 - - 64.4 +2.5 0.231 0.284 0.079 0.111 仅引入 SCC-Head
Exp 4 - 65.3 +3.4 0.217 0.256 0.078 0.108 结合地图与补全头
Exp 5 - 64.7 +2.8 0.233 0.275 0.078 0.109 补全头 + 非均匀采样
Exp 6 65.6 +3.7 0.204 0.254 0.076 0.107 完整 SGC-Lane 模型

此外,在控制基线为 LATR 的条件下单独对比端点补全策略(对应论文 Table 4):原基线 LATR 为 61.9%;加入 EP-Head 后为 63.1%;替换为本文提出的 SCC-Head 后达到 64.4%,净提升 1.3%,验证了二阶差分一致性建模与聚类的优越性。

关键发现

  • 单独使用 SD 地图先验(Exp 2)使 F1 提升 1.5% 且显著降低了横向与垂直空间定位误差(近端 X 误差从 0.219m 降至 0.208m),表明软引导机制能有效过滤地图偏差、提供可靠的拓扑约束。
  • 单独使用 SCC-Head(Exp 3)使 F1 大幅提升 2.5%,但由于外推恢复了部分模糊远端,定位误差出现轻微上升(近端 X 误差升至 0.231m);当将 SD 地图先验与 SCC-Head 联合使用时(Exp 4),地图先验精准约束了补全搜索空间,既享受了完备补全带来的高召回,又恢复了低定位误差(近端 X 误差重新降至 0.217m),二者展现出高度的互补效应。
  • 在复杂几何拓扑场景中优势最为突出,如急弯坡道与交叉路口,因为地图先验打破了纯前视图像视距局限,辅助模型构建了超出局部视距的连贯车道拓扑。

亮点与洞察

  • 将粗粒度拓扑先验解耦并自适应扩展为车道边界:通过结合全局视觉上下文动态回归车道宽度 \(\hat{w}_i\),将米级误差的单条道路中心线沿法线衍生为物理车道线对,巧妙化解了 SD 地图与具体物理车道之间的尺度表征不一致问题。
  • 利用稀疏采样固有的物理等距性构建二阶差分约束:敏锐捕捉到车道稀疏点集在纵轴均匀采样的结构先验,提出二阶差分恒定损失代替绝对步长预测,有效防止了端点回归的发散与抖动。
  • 透视感知非均匀平面与局部空间交叉注意力的轻量协同:在保持轻量化解码器不变的前提下,通过近密远疏的非均匀采样平面与基于局部坐标 Top-K 检索的 LSCA,兼顾了高分辨率近景精度与远景计算效率。

局限与展望

  • 地图依赖与退化鲁棒性:方法假设能够获得对应道路片段的 SD 导航地图中心线,在地图缺失或定位漂移极为严重的无图/非结构化道路下,先验增益可能退化。
  • 极端恶劣天气的细小碎片捕获:在雨雪等恶劣天气场景下,F1 稍逊于自底向上基于密集关键点图推理的方法(如 GLane3D),表明基于稀疏回归的框架对于极度碎片化的线段捕获仍有改进空间。
  • 未来方向:作者指出后续可结合时序多帧融合(Temporal Fusion)以及引入更为鲁棒的显式单目深度估计模块,进一步提升 3D 车道线检测的动态时空一致性。

相关工作与启发

  • vs LATR (ICCV 2023):LATR 是单目 3D 车道线检测的重要 Transformer 基线,但缺乏外部先验且未解决端点截断问题。SGC-Lane 以 LATR 为基础,引入 SD 地图引导与 SCC-Head,在同等 ResNet-50 骨干下将 F1 显著提升 3.7%(从 61.9% 提升至 65.6%)。
  • vs EP-Head / Chang et al. (CVPR 2025):EP-Head 率先探索了通过预测距离来补全截断车道,但其点预测相互独立易产生毛刺;SGC-Lane 引入沿纵轴步长差分一致性约束与聚类,补全模块单独带来的增益高出 EP-Head 1.3%(64.4% vs 63.1%)。
  • vs SMERF / SEPT (2024-2025):先前的 SD 地图辅助方法主要聚焦于 BEV 空间的中心线拓扑生成;本文首次在单目 3D 物理车道线检测任务中实现从道路中心线到物理边界线的端到端自适应映射与软门控引导。

评分

  • 新颖性: ⭐⭐⭐⭐☆(在单目 3D 物理车道线检测中创新性引入 SD 地图自适应宽度扩展,并提出了基于稀疏点序列结构一致性的端点补全头)
  • 实验充分度: ⭐⭐⭐⭐⭐(在大型基准 OpenLane 上与 8 种主流模型详尽对比,涵盖细分子场景分析、系统消融与补全头严谨对照)
  • 写作质量: ⭐⭐⭐⭐⭐(概念界定精准,公式推导严谨,架构图清晰,问题定义与动机阐述高度自洽)
  • 价值: ⭐⭐⭐⭐☆(为利用低成本常规车载导航地图增强量产级单目 3D 感知系统提供了极具落地可行性的范式)