跳转至

RePL: Pseudo-label Refinement for Semi-supervised LiDAR Semantic Segmentation

会议: ECCV 2026
论文: ECCV 官方
代码: 待开源
领域: 自动驾驶
关键词: 半监督学习、LiDAR语义分割、伪标签精炼、掩码重构、点云感知

一句话总结

针对室外半监督 LiDAR 语义分割中伪标签噪声引发的确认偏差难题,RePL 通过置信度与双模型一致性检测潜在错误体素,并借助掩码重构机制与可学习 token 主动精炼伪标签,在无需逐数据集微调超参的情况下刷新 nuScenes-lidarseg 与 SemanticKITTI 的 SOTA 记录。

研究背景与动机

室外激光雷达(LiDAR)点云的 3D 语义分割是自动驾驶车辆与智能移动机器人感知周围环境的核心基石。为了给数以百万计的稀疏 3D 点云分配精确的语义类别标签,传统全监督网络极度依赖昂贵且耗时的人工逐点稠密标注。为了打破这一标注瓶颈,半监督学习(Semi-supervised Learning, SSL)受到了广泛关注——其核心目标是在仅有极少部分场景带有真值标注的前提下,充分挖掘海量未标注点云数据中蕴含的几何结构与语义线索。

当前主流的 3D 半监督点云分割方案主要依赖一致性正则化(如 LaserMix、AIScene、IT2)或对比学习策略(如 GPC、Lim3D、DDSemi)。然而,这些自训练机制存在一个根深蒂固的致命脆弱性:模型对伪标签中存在的噪声极易产生确认偏差(Confirmation Bias)。当网络盲目信任自身生成的低质量伪标签并以此作为监督信号迭代更新时,初始预测中的错误将在训练过程中被不断强化和传播,最终导致分割性能在长周期训练中停滞甚至显著恶化。

为了应对含噪伪标签,近期的应对手段多偏向于事后处理(Post-hoc),例如设定硬性置信度阈值直接丢弃低置信度体素,或是依据置信度对未标注损失进行动态加权衰减。这些策略本质上只是在伪标签生成后被动地调整样本利用权重或裁剪监督范围,治标不治本,不仅白白丢弃了大量具有潜在信息量的边缘与困难区域点云,更未能从源头上提升伪标签的质量。核心 idea:将半监督伪标签的噪声管理范式从「事后被动丢弃」转变为「源头主动修复」,通过教师-学生一致性自适应检测错误候选体素,并基于掩码重构机制(Masked Reconstruction)借助可学习 token 和全局上下文恢复出高质量的精炼伪标签。

方法详解

整体框架

RePL 的核心架构由两个紧密协同的子模块组成:一是经典的教师-学生分割主网络(Teacher-Student Segmentation Networks),二是本文提出的核心创新模块——伪标签精炼器(Pseudo-label Refiner Network)。系统将输入的无规则 3D 激光点云体素化为规则网格 \(X \in \mathbb{R}^{C \times H \times W \times L}\)。在无标注点云流转过程中,EMA 动量更新的教师网络产生初始预测;随后,精炼器根据教师与学生网络的类别一致性及场景自适应置信度分位数圈定不可靠体素掩码;接着,不可靠区域的预测向量被替换为可学习的 mask token,并与输入点云特征拼接后输入精炼器进行掩码重构;最后,可信体素与重构体素融合生成最终精炼伪标签,通过对称交叉熵和场景混合策略反哺学生网络的半监督优化。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入体素点云 X"] --> B["学生网络预测 P 与教师网络预测 Q"]
    B --> C["置信度一致性错误检测与随机掩码<br/>比较预测类别与场景自适应分位数阈值"]
    C --> D["基于可学习 Token 的掩码重构精炼<br/>可疑体素替换为 Token T 并由精炼器补全"]
    D --> E["组装精炼伪标签<br/>可靠区域取教师预测 + 修复区域取精炼输出"]
    E --> F["稀疏监督下的精炼器三元强化训练<br/>真值监督 + 负学习约束 + LaserMix场景混合"]
    E --> G["对称跨熵稳健半监督协同优化<br/>对称交叉熵 SCE + Lovász-Softmax + 场景混合"]
    F -.->|更新参数| D
    G -.->|EMA 动量更新| B

关键设计

1. 置信度一致性错误检测与随机掩码:自适应捕获潜在错误体素并强化泛化能力

传统伪标签阈值筛选常依赖预设的全局固定硬阈值,但在自动驾驶场景下,点云密度随探测距离迅速衰减,全局硬阈值极易误伤远距离低反射率的稀疏区域。为此,RePL 提出了兼顾双模型共识与局部场景统计特性的自适应筛选准则。对于给定体素 \(\omega\),分别计算学生网络最大分类概率与教师网络最大分类概率,并以该场景内所有体素置信度的第 \((100 - \kappa)\) 百分位数作为各自的场景自适应动态阈值(实验中 \(\kappa = 40\%\))。一个体素只有在同时满足「学生与教师预测类别完全一致」且「双模型置信度均高于自身动态阈值」时才被判定为可靠体素;其余所有体素均被标记为潜在错误候选并形成错误掩码 \(M = 1 - \mathbf{1}_{\text{rel}}\)。此外,若仅在错误掩码区域训练精炼器,网络容易走捷径而死记易错区域的特定局部模式;为此,训练阶段额外注入伯努利随机掩码 \(R \sim \text{Bernoulli}(\sigma)\)\(\sigma = 0.15\)),构成综合掩码 \(\tilde{M} = M \lor R\)。随机遮蔽迫使精炼器跳出局部记忆,学会利用全局 3D 几何与长程上下文先验来推断被遮挡区域的正确语义。

2. 基于可学习 Token 的掩码重构精炼:无损保留几何信息的主动语义恢复

直接抛弃低置信度体素会破坏路面、植被及长距离物体的连续拓扑结构,导致网络无法学到完整的场景几何。借鉴掩码自编码器(MAE)在表征学习中的成功经验,RePL 创造性地构建了基于连续向量空间的伪标签重构机制。对于教师网络的初始预测张量 \(Q \in \mathbb{R}^{K \times H \times W \times L}\),将所有被综合掩码 \(\tilde{M}\) 标记为不可靠的位置替换为一个连续的可学习掩码标记(learnable mask token)\(T \in \mathbb{R}^K\),生成带有遮蔽的预测张量:

\[\bar{Q} = (1 - \tilde{M}) \odot Q + \tilde{M} \odot T\]

该 mask token 在训练过程中随网络反向传播共同优化,充当了待重构语义潜变量的通用占位符。精炼器网络 \(g(\cdot)\) 接收原始激光点云体素特征 \(X\) 与遮蔽预测张量 \(\bar{Q}\) 的通道级拼接特征作为输入,并输出经过空间与上下文修复的精炼预测 \(\hat{Q} = g(X, \bar{Q})\)。在推理生成伪标签时,去除随机掩码,仅将错误候选掩码 \(M\) 处替换为重构值,并与可信区域中保留的原教师高置信预测无缝拼合为最终离散标签 \(\tilde{Y}\)。这种设计不仅杜绝了信息丢弃带来的几何拓扑断裂,更将离散的硬分类猜测转化为连续隐空间的平滑插值与纠偏。

3. 稀疏监督下的精炼器三元强化训练:真值指导、负学习与混合场景跨域泛化

在半监督设定下,带真值标注的数据极度稀缺,精炼器若仅依靠有限标注样本的预测残差进行训练,极易对少量标注场景过拟合,难以应对未标注数据中复杂多变的误分类形态。为了攻克这一瓶颈,RePL 为精炼器量身打造了由三部分构成的复合优化目标。第一,在有标注数据上,仅对被遮蔽的体素位置计算真值监督损失 \(\mathcal{L}_{\text{sup}}^r\)(结合交叉熵与 Lovász-Softmax)。第二,在纯未标注数据上,由于缺乏确切的正向监督标签,直接施加伪标签硬监督会引入二次噪声;本文引入负学习(Negative Learning)策略,提取教师预测的 Top-\(k\)\(k=3\))类别作为潜在候选池,而对其余极不可能属于的低概率类别施加抑制性交叉熵惩罚:

\[\mathcal{L}_{\text{unl}}^r = -\frac{1}{N_u} \sum_{j=1}^{N_u} \frac{1}{|\mathcal{N}_j(\omega)|} \sum_{k \in \mathcal{N}_j(\omega)} \log\big(1 - [\hat{Q}_j]_{k,\omega}\big)\]

其中 \(\mathcal{N}_j(\omega)\) 表示不属于 Top-\(k\) 的候选集合。第三,利用 LaserMix 算子将有标注激光帧与无标注激光帧按倾角平面切片混合,生成兼具高误差率与丰富多样性的合成点云 \(X_m\)。通过迫使精炼器在合成场景中重建标注部分的遮蔽标签,使其在不接触未标注真值的前提下,充分暴露于跨距离、跨反射率的真实误差分布之中。精炼器的总体训练损失直接定义为三者之和 \(\mathcal{L}_{\text{sup}}^r + \mathcal{L}_{\text{unl}}^r + \mathcal{L}_{\text{mix}}^r\),无需额外繁琐的超参数平衡。

4. 对称跨熵稳健半监督协同优化:防止误差反弹的渐进双向监督

即便经过精炼器修正,伪标签中仍可能存在个别极具欺骗性的残余噪声。若在未标注点云上直接使用标准交叉熵监督学生网络,高置信度的残余错误会导致网络过度自信,引发梯度异常膨胀。为此,学生网络在未标注数据上采用了对称交叉熵(Symmetric Cross-Entropy, SCE)结合 Lovász-Softmax 的稳健损失函数:

\[\mathcal{L}_{\text{unl}}^s = \frac{1}{N_u} \sum_{j=1}^{N_u} \Big( \mathcal{L}_{\text{ce}}(P_j, \tilde{Y}_j) + \mathcal{L}_{\text{ce}}(\tilde{Y}_j, P_j) + \lambda_{\text{ls}} \mathcal{L}_{\text{ls}}(P_j, \tilde{Y}_j) \Big)\]

对称项 \(\mathcal{L}_{\text{ce}}(\tilde{Y}_j, P_j)\) 为预测分布提供了类似熵惩罚的隐式正规化效果,有效遏制了学生网络盲目逼近错误伪标签的倾向。此外,学生网络同样接受基于 LaserMix 的标注点云与带精炼伪标签点云的混合增强训练 \(\mathcal{L}_{\text{mix}}^s\)。在反向传播过程中,精炼器与学生分割网络的优化路径之间显式切断梯度流(stop-gradient),彻底规避了双模型联调时的对抗性相互干扰与崩溃风险。

理论分析与增益条件

论文从理论上严格探讨了伪标签精炼相比于从零预测的优越性及其成立边界:

  1. 精炼任务难度界定(Proposition 1):记原始分割任务为 \(Z: X \to Y\),精炼任务为 \(Z': (X, T) \to Y\)(其中 \(T\) 为教师提供的先验预测信息)。根据条件熵的单调性,必然有 \(H(Y \mid X, T) \le H(Y \mid X)\),即精炼任务的不确定性永远不高于从原始点云直接分割,证明了引入先验预测辅助重构的天然降维优势。
  2. 正向增益充要条件(Proposition 2):设错误候选掩码内的真实错误占比(精度)为 \(\pi_j\),精炼器在该区域纠正错误的概率为 \(q_j\),而误将原本正确体素改错的概率为 \(r_j\)。精炼提升该场景准确率的充要条件为净收益指标 \(\zeta_j > 0\)
\[\zeta_j := \pi_j \frac{q_j}{q_j + r_j} - (1 - \pi_j)\frac{r_j}{q_j + r_j} > 0 \iff r_j < \frac{\pi_j}{1 - \pi_j} q_j\]

在 SemanticKITTI 实测中,1% 标注下错误候选掩码精度 \(\pi = 0.917\)(允许误改率高达纠正率的 11.05 倍),50% 标注下 \(\pi = 0.983\)(允许误改率高达纠正率的 57.8 倍)。这表明 RePL 所需的理论边界极其宽泛,即使采用简单的置信度共识检测,也能稳稳落入正向收益区间。

实验关键数据

主实验

主实验在规模庞大的 nuScenes-lidarseg(16 类)和经典 SemanticKITTI(19 类)上全面展开,涵盖 1%、10%、20% 及 50% 四种严苛标注比例。分割主干网络统一采用 Cylinder3D。

数据集 标注比例 纯监督基线 之前 SOTA(方法名) 本文 (RePL) 提升幅度 (vs 纯监督 / vs SOTA)
nuScenes-lidarseg 1% 50.9 60.0 (FrustrumMix) 60.0 +9.1 / =0.0
nuScenes-lidarseg 10% 65.9 72.1 (IT2) 74.4 +8.5 / +2.3
nuScenes-lidarseg 20% 66.6 73.5 (IT2) 75.0 +8.4 / +1.5
nuScenes-lidarseg 50% 71.2 74.1 (IT2) 75.8 +4.6 / +1.7
nuScenes (平均) - 63.7 69.3 (IT2) 71.3 +7.6 / +2.0
SemanticKITTI 1% 45.4 56.2 (LaserMix++) 54.7 +9.3 / -1.5
SemanticKITTI 10% 56.1 63.3 (AIScene) 62.5 +6.4 / -0.8
SemanticKITTI 20% 57.8 63.7 (AIScene) 63.2 +5.4 / -0.5
SemanticKITTI 50% 58.7 64.9 (FrustrumMix) 65.9 +7.2 / +1.0
SemanticKITTI (平均) - 54.5 61.5 (AIScene/FrustrumMix) 61.6 +7.1 / +0.1

注:AIScene 与 FrustrumMix 均针对各数据集单独调试了关键超参数,而 RePL 在两个基准的所有实验中均固定同一套超参数,展现出极强的开箱即用鲁棒性。在弱监督 ScribbleKITTI 上,RePL 同样取得 56.1 平均 mIoU,全面领先以往方法。

消融实验

1. 精炼器与分割网络各损失分量贡献(nuScenes-lidarseg 1% 比例)

模型分支 损失配置组合 理论增益指标 \(\zeta\) 验证集 mIoU (%) 说明与影响分析
Refiner 消融 仅监督基线 (Sup-only) - 50.9 初始分割性能
Refiner 消融 \(+\mathcal{L}_{\text{sup}}^r\)(标注数据掩码重构) 0.327 57.2 仅利用标注误差,初具纠偏能力 (+6.3)
Refiner 消融 \(+\mathcal{L}_{\text{sup}}^r + \mathcal{L}_{\text{unl}}^r\)(引入负学习) 0.353 58.7 压制低概率类别,提供无标注安全监督 (+1.5)
Refiner 消融 全量精炼损失(\(+\mathcal{L}_{\text{sup}}^r + \mathcal{L}_{\text{unl}}^r + \mathcal{L}_{\text{mix}}^r\) 0.430 60.0 场景混合暴露丰富误分类模式,达到最优 (+1.3)
Student 消融 \(\mathcal{L}_{\text{sup}}^s + \mathcal{L}_{\text{unl}}^s\)(精炼伪标签训练) - 58.1 初步引入精炼监督信号 (+7.2)
Student 消融 \(\mathcal{L}_{\text{sup}}^s + \mathcal{L}_{\text{unl}}^s\) (去掉 SCE,使用标准 CE) \(+ \mathcal{L}_{\text{mix}}^s\) - 58.0 缺乏对称熵约束易受残留噪声误导 (-2.0)
Student 消融 全量学生网络优化(\(\mathcal{L}_{\text{sup}}^s + \mathcal{L}_{\text{unl}}^s + \mathcal{L}_{\text{mix}}^s\) - 60.0 对称交叉熵与场景混合协同带来最佳泛化

2. 错误候选掩码质量与设计策略敏感性

掩码生成策略 / 机制设定 验证集 mIoU (%) 核心观察与结论
无精炼基线 (Baseline Teacher) 57.0 直接使用教师网络初始伪标签的性能
随机掩码 25% 比例 57.6 盲目遮蔽仅带来轻微正则化提升 (+0.6)
随机掩码 50% 比例 58.2 盲目遮蔽 50% 带来有限增益 (+1.2)
随机掩码 75% 比例 58.7 遮蔽过多时接近重新生成,提升受限 (+1.7)
本文启发式共识掩码 (Ours) 60.0 准确命中真实错误体素,带来显著净收益 (+3.0)
理想真值掩码 (Oracle Mask) 67.3 完美指示错误位置时的理论上限,展示巨大潜力空间
纯丢弃对照组 (Discard Baseline) 53.5 仅丢弃错误掩码体素而不做重构,性能暴跌且劣于自训练 (54.3)
去除精炼器随机掩码 (w/o Random Masking) 57.7 缺乏随机扰动时精炼器死记硬背局部缺陷,性能下滑 2.3%

关键发现

  • 重构机制优于被动丢弃:对照实验中,若将检出的不可靠体素直接从无标注损失中剔除(Discard Baseline),模型仅得 53.5 mIoU,甚至明显落后于保留全部未精炼伪标签的标准自训练基线(54.3 mIoU)。而 RePL 掩码重构达到了 60.0 mIoU,有力证实了主动重构保留几何结构拓扑的重要性。
  • 长尾与稀有小类别收益最为巨大:在 1% 标注下,RePL 在 16 个类别中有 14 类均取得显著提升。样本极度匮乏的小物体表现尤为亮眼,例如交通锥(样本占比 0.09%,\(\Delta\text{IoU} = +7.86\))、行人(占比 0.27%,\(\Delta\text{IoU} = +6.47\))、人工设施(+4.41)及植被(+5.35),伪标签整体平均 IoU 从 59.42 跨越式跃升至 62.07。
  • 全距离跨度无死角受益:在 0–10m、10–20m、20–30m 以及 30–40m 各探测距离区间内,伪标签精炼分别实现了 +1.95、+1.30、+1.34 和 +1.26 的稳定 IoU 增长,打破了传统重构难以兼顾远距离稀疏点的顾虑。
  • 计算代价适中且主干架构通用:在单个 RTX 6000 Ada 上测试,增加精炼器仅使推理延迟由 0.43s 微增至 0.68s(+0.25s),显存增加 396MB,却换来了 +9.1 mIoU 的巨大增益;在换用基于 Transformer 的 SphereFormer 架构后,RePL 依然取得了从 50.7 到 56.5 mIoU 的稳健涨幅。

亮点与洞察

  • 将过滤范式升维为生成补全:传统半监督学习面对噪声伪标签总是习惯于「断舍离」(丢弃或降权),而 RePL 借助掩码语言/图像建模(MAE)的哲学,把含噪伪标签看作局部受损的特异模态,用连续可学习 token 补全语义,实现了从「过滤减法」到「修复加法」的跨越。
  • 轻量而严谨的理论收敛保证:通过理论证明了条件熵不等式与精炼正向增益条件,清晰刻画了掩码精度 \(\pi\)、纠错率 \(q\) 与误改率 \(r\) 之间的数学边界,为看似启发式的半监督微调策略提供了扎实的理论底座。
  • 无需繁琐调参的跨域通用性:以往顶级方法常在不同数据集上设定截然不同的超参(例如不同的混合切片比例或损失权重),RePL 依靠自适应置信度分位数机制与三元自平衡损失,在两大最具代表性的室外基准上实现了全套超参数完全一致的最优表现。

局限与展望

  • 共识性过度自信导致的漏检盲区:目前的错误掩码依赖教师与学生网络的置信度共识,当两座网络因视角或先验缺陷同时陷入过度自信(Jointly Overconfident)的系统性误判时,该区域会被错误地漏标为「可靠」,从而逃脱精炼修复。
  • 对大面积连续路面的轻微误修:在细粒度分析中,如可行驶表面(Drivable Surface, -1.47 IoU)和人行道(Sidewalk, -2.40 IoU)等大尺度背景类出现了细微的负迁移,这主要归因于精炼器偶发的高频过纠正(Over-correction)。
  • 未来演进方向:作者指出,未来可将启发式的统计共识掩码升级为端到端可学习的错误定位网络(Error Localization Network, ELN),进一步逼近理想 Oracle 掩码(67.3 mIoU)的潜能边界。

相关工作与启发

  • vs LaserMix / AIScene / FrustrumMix: 以往先进方法重心聚焦于点云空间的精巧数据混合(如按激光扫描线倾角或视锥划分切片)以构建一致性扰动,但本质上依然把模型预测原封不动地当真值用;RePL 吸收了 LaserMix 的混合优势,更关键的是嵌入了独立的 Refiner 模块专门对混合伪标签执行源头修复。
  • vs 传统阈值过滤 (FixMatch / GPC / Lim3D): 传统过滤直接丢弃可疑点,造成不可逆的 3D 几何断裂;RePL 证明了用可学习 mask token 进行上下文重构可以比单纯过滤多获取 6.5 mIoU 的净收益。
  • vs ST++ / ELN: 2D 领域的误差定位与精炼多用于图像重采样或自训练分段挑选;RePL 首次将可学习掩码补全成功迁移至非结构化、稀疏分布的 3D 室外激光点云体素空间中。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次在 3D 半监督点云分割中引入基于可学习 token 的掩码重构伪标签修复范式,打破了长期以来的被动丢弃成见。
  • 实验充分度: ⭐⭐⭐⭐⭐ 覆盖两大经典室外基准与弱监督基准,涵盖 4 种数据比例、理论推导、详尽消融、距离区间分析、长尾分析及替代主干验证。
  • 写作质量: ⭐⭐⭐⭐⭐ 数学建模严整清晰,概念动机阐释层层递进,方法图解与逻辑链条衔接高度自洽。
  • 价值: ⭐⭐⭐⭐⭐ 为自动驾驶工业界低成本开发高精度 3D 感知系统提供了通用且极具工程落地价值的技术范例。