跳转至

GhostPoint: Self-Supervised Representation Learning by Hallucinating Occluded LiDAR Structure

会议: ECCV2026
论文: ECCV 2026
领域: 自监督/表示学习
关键词: LiDAR 点云, 自监督预训练, 3D 目标检测, 遮挡建模, 自蒸馏

一句话总结

GhostPoint 指出 LiDAR 自监督预训练的学习信号几乎只定义在可见表面的回波点上、对遮挡与无回波区域不加约束,于是用「实例体素膨胀」在伪实例周围生成同时含可见、掩码与无回波体素的邻域体素集,让一个轻量预测器从观测上下文幻觉出这些位置的特征,并用不对称教师目标(占据体素对齐教师编码器、无回波体素对齐教师预测器)把伪遮挡与真遮挡统一到同一个自蒸馏目标下,在 nuScenes 与 Waymo 上把预训练骨干的下游 3D 检测推到 SOTA(全参数微调后 nuScenes 67.5 mAP / 71.2 NDS)。

研究背景与动机

LiDAR 3D 目标检测是自动驾驶感知的核心环节,它要给出物体的位置、朝向与完整范围,直接服务于避障、运动规划与多目标跟踪。但训练这样的检测器需要大规模精确的 3D 框标注,代价高昂;而自动驾驶车队每天产生的无标注激光雷达日志几乎无限。自监督学习因此成为一条自然的规模化预训练路径:先在海量无标注点云上学一个编码器,再迁移到下游任务。这类方法大多走教师—学生自蒸馏路线(Sonata、DOS),或者在掩码输入上做重建/占用预测(Occ-MAE、NOMAE、GD-MAE)。它们在语义分割、全景分割这类逐点任务上的迁移效果已经接近监督训练,看起来一切顺利。

问题出在检测上。作者先做了一组直接的对照实验:冻结预训练编码器、只训一个轻量解码器,统一用 PTv3 做骨干以保证可比。结果 SSL 方法在 nuScenes 语义分割上能到 79–80 mIoU,几乎追平监督的 PTv3(80.3);但换成 3D 检测,同一批编码器与监督基线(63.8 mAP / 68.4 NDS)之间就有明显缺口,最强的 PointINS 也只有 56.7 mAP / 62.5 NDS。更值得注意的是一个负结果:给 PointINS 补上框拟合与框回归头之后,性能不升反降(56.7 → 56.2 mAP)。作者的结论很尖锐——问题不是「缺乏几何监督」,而是观测本身不完整:回归目标仍然来自那簇被遮挡的点,定义在可见点上的几何目标会原样继承它想要纠正的偏差。因此实例感知的预训练是必要的,但并不充分。

要把这个现象解释清楚,需要一个表示层面的说法。设 \(V = V_o \cup V_u\) 是全场景体素集,\(V_o\) 是有实测回波的占据体素、\(V_u\) 是无观测体素。transformer 编码器(如 PTv3)只在 \(V_o\) 上运行,对 \(v \in V_u\) 不产生任何表示;于是 SSL 目标天然定义在 \(V_o\) 上,鼓励的表示是与观测测量对齐的。这对逐点任务并无问题——语义标签本身也只定义在 \(V_o\) 上。但检测的标注不一样:一个框 \(B_k\) 描述的是物体在 \(V\) 中的完整范围,包含被遮挡的部分。检测微调时模型必须越过稀疏回波去外推,而 SSL 预训练只约束了占据体素上的表示质量,二者之间存在系统性的表示错配,在遮挡严重的室外 LiDAR 场景里尤其致命。

核心 idea:与其在可见表面上加更强的几何监督,不如把「无观测区域」直接变成预训练目标——用实例体素膨胀在伪实例周围生成同时包含可见、掩码与无回波体素的邻域体素集,让一个轻量预测器从观测上下文幻觉出这些位置的特征,并用不对称教师目标(占据体素对齐教师编码器、无回波体素对齐教师预测器)把伪遮挡与真遮挡统一到同一个自蒸馏目标下。

方法详解

整体框架

GhostPoint 是一个建立在自蒸馏之上的 LiDAR 预训练框架,输入是一次 LiDAR 扫描,输出是一个对遮挡更鲁棒的编码器。它的整体流程是:把一次扫描增广成两个独立视图,每个视图都让教师编码器看未掩码的点、学生编码器看随机掩码后的子集;在编码器级蒸馏之外,额外用教师特征聚类出伪实例、把实例占据栅格膨胀出一片邻域体素集 \(Q\),让学生在一个轻量预测器的帮助下对 \(Q\)非可见的体素做出语义与几何预测,而这些预测的目标由「占据体素取教师编码器、无回波体素取教师预测器」的不对称方式专门构造出来。预训练结束后,邻域采样与预测器被整体丢弃,只留下编码器接 CenterPoint 检测器。

具体地,教师接收 \(P\),学生接收 \(P\) 的随机掩码子集 \(P_{vis}\)。体素化后记 \(V_o\) 为教师视图的占据体素、\(V_{vis} \subseteq V_o\) 为学生视图的占据体素,被掩掉的占据体素为 \(V_{mask} = V_o \setminus V_{vis}\)。学生与教师共享架构,教师参数是学生的 EMA,两侧都通过 Softmap 头(原型软分配)与 Offset 头(中心偏移预测)形成伪实例并给出编码器级的基础学习信号。GhostPoint 在此之上加了一条预测分支,把监督延伸到 \(Q\) 里的遮挡空间;\(Q\) 相对掩码被划分成 \(Q_{vis} = Q \cap V_{vis}\)\(Q_{mask} = Q \cap V_{mask}\)\(Q_{unobs} = Q \setminus V_o\) 三部分,后续所有初始化与损失都在这个划分上定义。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["随机掩码双视图<br/>教师看全量 / 学生看掩码"] --> B["教师编码器 + 学生编码器<br/>Softmap 头 / Offset 头"]
    B --> C["实例体素膨胀的邻域采样"]
    C --> D["轻量预测器与 KNN 空间初始化"]
    D --> E["非对称教师目标与两级蒸馏"]
    E --> F["预训练编码器<br/>→ CenterPoint 3D 检测器"]

关键设计

1. 实例体素膨胀的邻域采样:把查询点放到物体旁边,而不是均匀撒在自由空间

要在没有标签的情况下建模不可见区域,首先得决定新查询放在哪里。在室外场景尺度上于自由空间均匀采样在算力上不可行,而且撒出来的绝大多数是背景位置,根本没有结构可预测(NOMAE 就受制于此)。作者的观察是:LiDAR 回波在空间上本就是聚簇的,而缺失的物体表面最可能出现在已观测实例占用的邻接处(遮挡、无回波缝隙都发生在物体边界附近),远离任何实例的体素则基本都是背景。于是采样分两步:先做可见性过滤,丢掉在学生视图里被完全掩掉的伪实例(一个实例只要还剩至少一个可见体素就保留),得到剩余实例占据体素的并集 \(V_o^{inst}\);再用一个尺寸 \(k_s > 1\) 的 3D 核对该二值占据栅格做膨胀,得到候选邻域 \(Q_{dil} \supseteq V_o^{inst}\)。为控制开销,再从 \(Q_{dil}\) 中采固定大小的子集 \(Q\)(默认只取一半,见消融),后续查询与损失都在这个固定集合上做。

膨胀操作是整个方法的枢纽:它把「被观测到的物体外壳」向外推出一圈,新激活的体素正好落在「紧贴已知物体、但雷达没打到」的位置——这既避免了自由空间均匀采样的浪费,又保证了监督信号大概率落在真正的物体结构上。\(k_s\) 控制扩张范围,消融显示它在 5 处取到峰值,再增大就会灌入过多背景体素、稀释实例信号;聚类半径 \(\tau_d\)、最小簇尺寸 \(\tau_{min}\) 与子采样比例是配套的三个超参。

2. 轻量预测器与 KNN 空间初始化:把观测上下文传播进空体素

\(Q\) 里既有占据体素也有新激活的无回波体素,但学生编码器只在可见占据子集 \(Q_{vis}\) 上有 token,\(Q \setminus Q_{vis}\) 没有任何输入表示,预测器无从下手。所以这些位置的 token 必须先被显式造出来。默认方案是距离加权 KNN 插值:对每个待初始化的体素 \(q\),取离它最近的 \(k = 3\) 个可见占据体素,按其三维中心距离的倒数加权求特征和。

\[\tilde{\mathbf{f}}_q = \sum_{v \in \mathcal{N}_k(q)} w_v \mathbf{f}_v, \qquad w_v = \frac{1/d_v}{\sum_{v' \in \mathcal{N}_k(q)} 1/d_{v'}}\]

其中 \(d_v = \|c(v) - c(q)\|_2\) 是体素中心距离,\(\mathbf{f}_v\) 是学生编码器在可见占据体素 \(v\) 上的特征。作者也试了更省事的替代方案:\(Q \setminus Q_{vis}\) 上的所有体素共用一个可学习 mask token。

初始化后的 token 与 \(Q_{vis}\) 上的编码器 token 一起送进轻量预测器 \(G_\theta\)(两个 PTv3 风格的 transformer block),通过在全部 token 上做自注意力,把可见体素的信息聚到新 token 里。为了让预测器只精炼新查询的位置,可见 token 采用恒等覆盖:把预测器输入前的可见特征直接抄到输出后的对应位置,\(Q_{vis}\) 上的表示不被改动,预测器的输出只保留在 \(Q \setminus Q_{vis}\) 上。这一步很关键——它保证了预测分支不会反过来污染编码器级的表示,两条监督路径各自作用于自己的体素集合。随后 Softmap 头与 Offset 头把这些特征映射成 \(Q\) 上的语义与几何预测。

3. 非对称教师目标与两级蒸馏:只在无回波处幻觉,让伪遮挡与真遮挡共用一个目标

有了预测,接下来的问题是拿什么去监督它。\(Q\) 里既有雷达真实打到的占据体素(含被掩掉的),也有根本没回波的空体素——后者没有任何标签,也没有教师编码器 token 可用。作者的做法是构造一份不对称的教师目标,锚定在实测占据体素上、只在无回波空间里幻觉:对占据体素 \(Q \cap V_o\)(包含 \(Q_{mask}\)),目标 Softmap 与 offset 直接取自教师编码器的表示,因为这里有 LiDAR 回波作支撑;对无回波体素 \(Q_{unobs}\),因为没有编码器 token,改用教师预测器的输出作目标,由它在完整(未掩码)体素集条件下给出基于上下文的语义与几何预测。教师预测器本身是学生预测器的 EMA,随着训练推进,这些幻觉目标会越来越准。

真正让设计闭合的是监督范围的选择:预测器级损失施加在 \(Q_{\neg vis} = Q \setminus Q_{vis} = Q_{mask} \cup Q_{unobs}\) 上,也就是说,「被伪遮挡的占据体素」与「真正无观测的体素」被放进同一套 Softmap + offset 目标里。学生为了补上伪遮挡(掩码遮挡)必须学会从上下文推断缺失结构,而这个能力被要求原样迁移到真遮挡上——全程不需要任何标注。这也是本文与掩码重建类方法最本质的区别:MAE 式的做法是「把看到的点藏起来再重建」,重建目标仍然是观测过的表面;GhostPoint 把目标直接放在从未被观测过的空间里,并用伪遮挡作为可监督的「练习场」。

一个完整示例

以一段含多辆车的 nuScenes 扫描为例。教师视图体素化后得到数万个占据体素 \(V_o\),学生视图按 0.6 的比例随机掩码(掩码块尺寸 1 m),剩下 \(V_{vis}\)。教师编码器特征经 Offset 头预测中心偏移,再用 BFS 在 PIT 归一化的预测质心上做聚类(近邻数 20、搜索半径 5 m),把非地面点分组成若干伪实例,小于 10 个点的连通分量被丢弃。假设其中一辆车聚成一个实例,它的占据体素有一部分恰好落在掩码区里——只要还有至少一个体素可见,这个实例就被保留。

接着用 \(k_s = 5\) 的核膨胀该实例的占据栅格,候选邻域从可见的那半个车身向外扩出一圈,把车身背面与侧面的无回波体素激活进来;按 0.5 的比例采样出固定大小的 \(Q\)。此时 \(Q\) 中的体素分成三类:可见占据(直接用学生编码器特征)、被掩码的占据(KNN 插值初始化)、无回波(KNN 插值初始化)。插值 token 与可见 token 一起过两层预测器做自注意力,可见位置被恒等覆盖回去。最后 Softmap 与 Offset 头只在 \(Q \setminus Q_{vis}\) 上出预测:被掩码的体素对齐教师编码器给出的目标,无回波体素对齐教师预测器的幻觉目标。两者共用同一个损失。

损失函数 / 训练策略

GhostPoint 在两个层级上做蒸馏。编码器级沿用标准自蒸馏:在可见占据体素 \(V_{vis}\) 上,教师与学生的编码器输出分别过原型头得到 Softmap 分布、过 Offset 头得到中心偏移,构成语义损失 \(\mathcal{L}_{\text{sem,vis}}\)(对 Softmap 分布做 KL 散度)与几何损失 \(\mathcal{L}_{\text{geo,vis}}\)(同时约束偏移的幅度与方向,即幅度差加上 \(1 - \cos\) 项)。预测器级在非可见邻域体素 \(Q_{\neg vis}\) 上沿用同一对语义与几何目标,只是目标来源按上面说的方式不对称地选取。

\[\mathcal{L} = \underbrace{\mathcal{L}_{\text{sem,vis}} + \lambda\,\mathcal{L}_{\text{geo,vis}}}_{\text{编码器级}} + \underbrace{\mathcal{L}_{\text{sem},\neg\text{vis}} + \lambda\,\mathcal{L}_{\text{geo},\neg\text{vis}}}_{\text{预测器级}}\]

⚠️ 原文该式在 PDF 文本提取中损坏,此处按上下文与消融设置重建,符号细节以原文为准。\(\lambda = 0.1\) 用于平衡语义与几何两项。

训练采用两阶段预热再联合优化:前 10% 的 epoch 只训编码器的 Softmap 分支以稳住表示;接下来 10% 打开编码器的 offset 分支与预测器分支,并把这两路的梯度从学生编码器上 detach 掉;之后才端到端优化全部组件。附录显示性能对预热比例并不敏感((0.1, 0.1) 最好,59.5 mAP;其它组合在 59.2–59.4 之间),前提是保持这个两阶段顺序。这一安排的必要性在消融中很明显:不加预热的预测器只带来 57.2 mAP,而两阶段预热后是 59.5。

其余设置:AdamW + 余弦退火,学习率 2e-4,weight decay 4e-2,batch size 16,掩码率 0.6、掩码块 1 m,预训练 50 个 epoch,\(k_s = 5\)(占用膨胀)、\(k = 3\)(token 初始化)、\(\lambda = 0.1\),Zipf 原型形状参数 \(\alpha_{zipf} = 1.3\),教师/学生温度分别为 0.035 / 0.05。预训练用 2 张 H200 做 DDP,下游微调单张 H200。开销方面,GhostPoint 预训练 26 小时,对比 PointINS 的 20 小时与 DOS 的 15 小时,多出的约 30% 全部来自邻域采样与预测器;两者在下游微调时都被丢弃,因此下游成本与先前方法完全一致。

实验关键数据

主实验

表 2 在 nuScenes 与 Waymo 上比较了最近的自监督方法,分 decoder probing(冻结 PTv3 编码器、从零训 CenterPoint 其余部分)与全参数微调两种协议。nuScenes 用 mAP 与 NDS,Waymo 用 L2 难度下的 AP。

方法 nuScenes mAP (probe) nuScenes NDS (probe) Waymo mAP (probe) nuScenes mAP (ft) nuScenes NDS (ft) Waymo mAP (ft)
PTv3 (监督) 63.8 68.4 67.9
PSA 41.3 52.8 42.4 63.9 68.9 68.1
SONATA 44.6 55.0 47.4 64.2 69.0 68.6
NOMAE 53.5 60.1 52.4 65.8 69.8 69.5
DOS 55.4 61.6 57.1 65.5 69.7 69.2
PointINS 56.7 62.5 57.5 66.3 70.1 69.5
GhostPoint 59.5 64.2 60.0 67.5 71.2 70.1

probing 协议下 GhostPoint 比次优 SSL 方法高 2.8 mAP / 1.7 NDS(nuScenes)与 2.5 mAP(Waymo);全参数微调下增益进一步放大,nuScenes 达到 67.5 mAP / 71.2 NDS,比监督训练的 PTv3 基线(63.8 mAP)高出 3.7 mAP。定性上(图 4),GhostPoint 能唯一正确检出中远距离被部分遮挡的车辆,减少重复框并改善朝向,但作者也承认它偶尔仍会在空处产生幻觉框。

消融实验

表 3 从 PointINS 基线出发逐个加组件(nuScenes,decoder probing):

配置 mAP NDS 说明
基线 (PointINS) 56.7 62.5
+ 邻域采样(无预测器,直接 KNN 插值) 57.3 62.7 只把监督信号延伸进遮挡区域就已有效
+ 预测器(无预热) 57.2 63.0 NDS 有涨但 mAP 反而略降
+ 预测器(一阶段预热) 58.5 63.6 mAP 开始明显提升
+ 预测器(两阶段预热) 59.5 64.2 完整模型
+ 框回归 59.1 63.9 加框回归反而掉点

为确认增益真的来自「幻觉」而不是「多了一个正则项/多了几个监督位置」,表 4 做了三组控制实验:

配置 mAP NDS 说明
PointINS 56.7 62.5 基线
+ 不幻觉(预测器只作用于掩码观测点) 57.3 63.1 只有轻微正则化收益
+ Zero targets(保留 ghost 邻域,目标置零偏移 + 均匀 Softmap) 57.6 63.3 仅再多一点点
+ Swap(用等量幻觉点替换掩码点) 59.4 64.1 与完整模型持平
GhostPoint 59.5 64.2 完整模型

标签效率

表 5 给出 nuScenes 上只用 0.1% / 1% / 10% 标注时的检测性能:

方法 0.1% mAP 0.1% NDS 1% mAP 1% NDS 10% mAP 10% NDS
PTv3 (监督) 18.1 35.3 37.3 48.0 57.9 65.0
NOMAE 30.5 46.8 45.7 56.0 59.7 66.6
DOS 34.0 49.1 49.0 58.0 61.4 67.4
PointINS 34.8 50.8 50.8 60.2 62.1 67.8
GhostPoint 36.9 52.1 53.1 62.5 63.5 68.8

关键发现

  • 幻觉目标本身是增益来源,不是正则化、也不是监督点变多。 表 4 的三组控制实验把可能性逐一排除:只在掩码观测点上监督(不幻觉)只涨 0.6 mAP;保留 ghost 邻域但把目标置零几乎不再涨;用等量幻觉点替换掩码点则与完整模型持平。三者合起来说明,起作用的是「物体邻接无观测区域里那些有信息量的幻觉目标」。
  • 预测器需要预热,且深度不必深。 无预热的预测器(57.2 mAP)甚至不如只加邻域采样(57.3 mAP),两阶段预热后才拉开到 59.5。图 5 显示:不做 KNN 初始化时性能随预测器深度涨到 3 块即平台;有 KNN 初始化后整体更高且从 2 块起就稳定,说明一份空间连贯的初始猜测能显著减轻预测器负担。
  • 「补几何监督」解决不了错配。 给 PointINS 加框回归(表 1,56.7 → 56.2)与给 GhostPoint 加框回归(表 3,59.5 → 59.1)两次都是掉点,从两个方向印证了论文的核心判断:限制不在缺失的几何学习,而在观测的不完整。
  • 稀疏与小标注预算下收益最大。 0.1% 标注时比次优方法高 2.1 mAP / 1.3 NDS,1% 时扩大到 2.3 mAP / 2.3 NDS;10% 标注(63.5 mAP / 68.8 NDS)已基本追平全标签监督训练的 PTv3(63.8 / 68.4)。Waymo 上同样全面领先,行人与骑行者这两个遮挡最严重的类别增益最大。
  • 不是靠牺牲逐点能力换检测精度。 nuScenes 线性探测下语义分割 74.2 mIoU,基本追平最强 SSL 基线 PointINS(74.4);全景分割反而最好,62.8 PQ,比 PointINS 高 0.6、比 DOS 高 5.4,SQ/RQ 也在 SSL 方法中居首(84.6 / 73.2)。
  • 跨数据集与跨架构都能迁移。 Waymo 预训练 → nuScenes 探测达到 43.4 mAP / 54.1 NDS,比 PointINS 高 1.8 / 1.7。把 PTv3 换成 CenterPoint 的稀疏 CNN 骨干时,直接用 GhostPoint 预训练 CNN 迁移效果一般(探测 48.0 L2 mAP),但用一个冻结的 GhostPoint PTv3 教师去蒸馏该 CNN 能到 57.3,全参数微调后 67.2,优于同架构直接预训练(65.4)与监督 CNN 基线(64.5)。
  • 对损坏更鲁棒。 Robo3D 上的 nuScenes-C 评测中,GhostPoint 取得最高 mRR(97.5)与最低 mCE(68.8),在 mCE 上明显优于 PointINS(70.4)和 DOS(71.2)。
  • 超参稳健。 膨胀核 \(k_s\) 在 5 处见峰、KNN 邻居数 \(k\) 在 3 之后即平台;无回波体素子采样比例在 0.5 处最好(58.9 / 59.5 / 59.2 对应 0.2 / 0.5 / 0.8),过低时新体素集中在实例边界、覆盖不足,过高时无观测区目标噪声变大;两阶段预热比例在 0.1–0.2 内波动小于 0.3 mAP。

亮点与洞察

  • 把「不可观测」变成可监督的目标,而不是靠更强的几何损失去逼近它。 关键的一步不是设计更复杂的回归头,而是认识到伪遮挡(人为掩码)与真遮挡在表示层面是同一类缺失,于是可以用前者当练习场、把学到的补齐能力直接迁移到后者。这个「用可监督的缺失模拟不可监督的缺失」的思路可以迁移到任何存在系统性观测盲区的模态:例如 radar 的稀疏回波、事件相机的运动模糊盲区、深度传感器的透明表面失效。
  • 膨胀采样是一个几乎零成本的归纳偏置注入。 与其在自由空间里均匀撒查询点(浪费算力且绝大多数是背景),不如直接对已发现实例的占据栅格做 3D 膨胀,让新查询天然贴在物体边界上。这是一个一行代码级的操作,却同时解决了「放哪里」和「有没有结构可学」两个问题,值得作为通用 trick 迁移到任何需要主动选择查询位置的自监督框架。
  • 恒等覆盖(identity overwrite)保证了双路监督互不干扰。 预测器在全部 token 上做自注意力以求简洁,但输出只在非可见位置被采用,可见 token 直接从前一级抄过来。这样预测分支无论怎么训,都不会把梯度灌回编码器的可见表示,两个层级的蒸馏各自干净地作用于自己的体素集合——这是很多「多分支自监督」设计容易踩的坑。
  • 不对称目标的构造把教师的能力差异用到了极致。 有回波的地方用教师编码器做目标(可靠但只覆盖可见面),没回波的地方用教师预测器做目标(猜测但覆盖全空间),再加上教师预测器本身是学生的 EMA,幻觉目标会随训练自我提升。这个「按证据可得性分层选目标」的模式可以直接复用。

局限与展望

  • 作者承认的局限有两点:probing 协议下性能仍落后于全监督训练;尚未在其他受遮挡影响的稀疏感知模态(如 radar)上验证。
  • 幻觉目标最终来自教师预测器自己的猜测,没有任何真实几何约束兜底。定性结果也显示,物体因严重遮挡而极度稀疏时幻觉无法恢复完整形状,且对背景离群点敏感,会导致实例边界模糊或被错误延伸(图 4 第二行也承认偶发空处幻觉框)。这意味着错误可能被自我强化。
  • 预训练开销比 PointINS 高 30%(26h vs 20h),且方法引入了一组彼此耦合的超参(膨胀核 \(k_s\)、聚类半径 \(\tau_d\)、最小簇尺寸 \(\tau_{min}\)、无回波体素子采样比例),论文虽给出了敏感性分析,但在新数据集上仍需要调。
  • 验证范围限于 nuScenes 与 Waymo 两个自动驾驶数据集,未覆盖室内或非驾驶场景。
  • 可能的改进方向:引入占用预测或多帧时序累积点云作为更可靠的幻觉监督信号(把「自我猜测」锚定到跨帧一致性上);把 \(k_s\) 做成随实例尺度自适应而非全局固定;在训练中显式降权背景离群体素以缓解边界污染。

相关工作与启发

  • vs DOS / PointINS(自蒸馏与实例感知): 它们把实例感知引入预训练,但目标仍定义在可见回波点上,实例质心也只由观测点决定,遮挡下会偏向可见表面。GhostPoint 沿用它们的学生—教师与 Softmap/offset 机制作为基础信号,但把监督范围扩展到 \(Q \setminus Q_{vis}\),并用教师预测器的幻觉覆盖无回波空间。区别的核心是「表示定义域」:前者的表示只在 \(V_o\) 上有意义,后者要求在 \(V_u\) 上也被约束。
  • vs NOMAE / Occ-MAE(掩码占用建模): 它们把无点回波的体素视为空、在局部邻域与多尺度上重建占用率。GhostPoint 与其共享「只重视局部邻域」的动机,但把无点体素显式当成「潜在被遮挡空间」来预测特征而非当作空,且不需要占用标签。消融也显示,单纯把监督延伸到遮挡区(加邻域采样)只能涨 0.6 mAP,真正起作用的是幻觉目标的内容
  • vs PSA(姿态与尺寸感知的 SSL): PSA 走的是另一条路——把物体尺寸、朝向等几何先验显式编码进 pretext task。它在探测协议下表现最弱(41.3 mAP),说明手工设计的几何代理任务在室外 LiDAR 场景里迁移有限;GhostPoint 证明了不引入任何几何先验、只把监督域扩到未观测空间同样(且更有效)能改善检测。
  • vs 点云补全(PCN / FoldingNet / 隐式占用网络): 它们同样以推理未观测几何为目标,但依赖完整形状或框标注做监督,且只在推理时作为独立的补全工具使用。GhostPoint 共享「建模未观测结构有价值」的直觉,但把它改造成纯自监督的表示学习目标,服务的是下游感知而非形状输出。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 「把预训练目标从可见表面搬到未观测体素」这个问题定位本身就很准,实例体素膨胀 + 不对称教师幻觉目标的组合是干净的原创设计,且对「为什么补几何监督没用」给出了可复现的负结果论证。
  • 实验充分度: ⭐⭐⭐⭐⭐ 两个数据集、探测与微调两种协议、标签效率、分割迁移、跨数据集、跨架构、OOD 鲁棒性、运行时与五组超参敏感性分析,还专门做了三组控制实验把「幻觉 vs 正则化」拆干净,论证链条完整。
  • 写作质量: ⭐⭐⭐⭐ 问题形式化(表示错配)清晰,图表与消融的对应关系明确;方法部分符号偏多,个别公式在原文排版中不够易读。
  • 价值: ⭐⭐⭐⭐⭐ 在 LiDAR 自监督预训练这个竞争激烈的方向上把下游检测显著推高(微调后超监督基线 3.7 mAP),且预测器与采样模块在下游可完全丢弃,落地成本为零。