GhostPoint: Self-Supervised Representation Learning by Hallucinating Occluded LiDAR Structure¶
会议: ECCV2026
论文: ECCV 2026
领域: 自监督/表示学习
关键词: LiDAR 点云, 自监督预训练, 3D 目标检测, 遮挡建模, 自蒸馏
一句话总结¶
GhostPoint 指出 LiDAR 自监督预训练的学习信号几乎只定义在可见表面的回波点上、对遮挡与无回波区域不加约束,于是用「实例体素膨胀」在伪实例周围生成同时含可见、掩码与无回波体素的邻域体素集,让一个轻量预测器从观测上下文幻觉出这些位置的特征,并用不对称教师目标(占据体素对齐教师编码器、无回波体素对齐教师预测器)把伪遮挡与真遮挡统一到同一个自蒸馏目标下,在 nuScenes 与 Waymo 上把预训练骨干的下游 3D 检测推到 SOTA(全参数微调后 nuScenes 67.5 mAP / 71.2 NDS)。
研究背景与动机¶
LiDAR 3D 目标检测是自动驾驶感知的核心环节,它要给出物体的位置、朝向与完整范围,直接服务于避障、运动规划与多目标跟踪。但训练这样的检测器需要大规模精确的 3D 框标注,代价高昂;而自动驾驶车队每天产生的无标注激光雷达日志几乎无限。自监督学习因此成为一条自然的规模化预训练路径:先在海量无标注点云上学一个编码器,再迁移到下游任务。这类方法大多走教师—学生自蒸馏路线(Sonata、DOS),或者在掩码输入上做重建/占用预测(Occ-MAE、NOMAE、GD-MAE)。它们在语义分割、全景分割这类逐点任务上的迁移效果已经接近监督训练,看起来一切顺利。
问题出在检测上。作者先做了一组直接的对照实验:冻结预训练编码器、只训一个轻量解码器,统一用 PTv3 做骨干以保证可比。结果 SSL 方法在 nuScenes 语义分割上能到 79–80 mIoU,几乎追平监督的 PTv3(80.3);但换成 3D 检测,同一批编码器与监督基线(63.8 mAP / 68.4 NDS)之间就有明显缺口,最强的 PointINS 也只有 56.7 mAP / 62.5 NDS。更值得注意的是一个负结果:给 PointINS 补上框拟合与框回归头之后,性能不升反降(56.7 → 56.2 mAP)。作者的结论很尖锐——问题不是「缺乏几何监督」,而是观测本身不完整:回归目标仍然来自那簇被遮挡的点,定义在可见点上的几何目标会原样继承它想要纠正的偏差。因此实例感知的预训练是必要的,但并不充分。
要把这个现象解释清楚,需要一个表示层面的说法。设 \(V = V_o \cup V_u\) 是全场景体素集,\(V_o\) 是有实测回波的占据体素、\(V_u\) 是无观测体素。transformer 编码器(如 PTv3)只在 \(V_o\) 上运行,对 \(v \in V_u\) 不产生任何表示;于是 SSL 目标天然定义在 \(V_o\) 上,鼓励的表示是与观测测量对齐的。这对逐点任务并无问题——语义标签本身也只定义在 \(V_o\) 上。但检测的标注不一样:一个框 \(B_k\) 描述的是物体在 \(V\) 中的完整范围,包含被遮挡的部分。检测微调时模型必须越过稀疏回波去外推,而 SSL 预训练只约束了占据体素上的表示质量,二者之间存在系统性的表示错配,在遮挡严重的室外 LiDAR 场景里尤其致命。
核心 idea:与其在可见表面上加更强的几何监督,不如把「无观测区域」直接变成预训练目标——用实例体素膨胀在伪实例周围生成同时包含可见、掩码与无回波体素的邻域体素集,让一个轻量预测器从观测上下文幻觉出这些位置的特征,并用不对称教师目标(占据体素对齐教师编码器、无回波体素对齐教师预测器)把伪遮挡与真遮挡统一到同一个自蒸馏目标下。
方法详解¶
整体框架¶
GhostPoint 是一个建立在自蒸馏之上的 LiDAR 预训练框架,输入是一次 LiDAR 扫描,输出是一个对遮挡更鲁棒的编码器。它的整体流程是:把一次扫描增广成两个独立视图,每个视图都让教师编码器看未掩码的点、学生编码器看随机掩码后的子集;在编码器级蒸馏之外,额外用教师特征聚类出伪实例、把实例占据栅格膨胀出一片邻域体素集 \(Q\),让学生在一个轻量预测器的帮助下对 \(Q\) 中非可见的体素做出语义与几何预测,而这些预测的目标由「占据体素取教师编码器、无回波体素取教师预测器」的不对称方式专门构造出来。预训练结束后,邻域采样与预测器被整体丢弃,只留下编码器接 CenterPoint 检测器。
具体地,教师接收 \(P\),学生接收 \(P\) 的随机掩码子集 \(P_{vis}\)。体素化后记 \(V_o\) 为教师视图的占据体素、\(V_{vis} \subseteq V_o\) 为学生视图的占据体素,被掩掉的占据体素为 \(V_{mask} = V_o \setminus V_{vis}\)。学生与教师共享架构,教师参数是学生的 EMA,两侧都通过 Softmap 头(原型软分配)与 Offset 头(中心偏移预测)形成伪实例并给出编码器级的基础学习信号。GhostPoint 在此之上加了一条预测分支,把监督延伸到 \(Q\) 里的遮挡空间;\(Q\) 相对掩码被划分成 \(Q_{vis} = Q \cap V_{vis}\)、\(Q_{mask} = Q \cap V_{mask}\) 与 \(Q_{unobs} = Q \setminus V_o\) 三部分,后续所有初始化与损失都在这个划分上定义。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["随机掩码双视图<br/>教师看全量 / 学生看掩码"] --> B["教师编码器 + 学生编码器<br/>Softmap 头 / Offset 头"]
B --> C["实例体素膨胀的邻域采样"]
C --> D["轻量预测器与 KNN 空间初始化"]
D --> E["非对称教师目标与两级蒸馏"]
E --> F["预训练编码器<br/>→ CenterPoint 3D 检测器"]
关键设计¶
1. 实例体素膨胀的邻域采样:把查询点放到物体旁边,而不是均匀撒在自由空间
要在没有标签的情况下建模不可见区域,首先得决定新查询放在哪里。在室外场景尺度上于自由空间均匀采样在算力上不可行,而且撒出来的绝大多数是背景位置,根本没有结构可预测(NOMAE 就受制于此)。作者的观察是:LiDAR 回波在空间上本就是聚簇的,而缺失的物体表面最可能出现在已观测实例占用的邻接处(遮挡、无回波缝隙都发生在物体边界附近),远离任何实例的体素则基本都是背景。于是采样分两步:先做可见性过滤,丢掉在学生视图里被完全掩掉的伪实例(一个实例只要还剩至少一个可见体素就保留),得到剩余实例占据体素的并集 \(V_o^{inst}\);再用一个尺寸 \(k_s > 1\) 的 3D 核对该二值占据栅格做膨胀,得到候选邻域 \(Q_{dil} \supseteq V_o^{inst}\)。为控制开销,再从 \(Q_{dil}\) 中采固定大小的子集 \(Q\)(默认只取一半,见消融),后续查询与损失都在这个固定集合上做。
膨胀操作是整个方法的枢纽:它把「被观测到的物体外壳」向外推出一圈,新激活的体素正好落在「紧贴已知物体、但雷达没打到」的位置——这既避免了自由空间均匀采样的浪费,又保证了监督信号大概率落在真正的物体结构上。\(k_s\) 控制扩张范围,消融显示它在 5 处取到峰值,再增大就会灌入过多背景体素、稀释实例信号;聚类半径 \(\tau_d\)、最小簇尺寸 \(\tau_{min}\) 与子采样比例是配套的三个超参。
2. 轻量预测器与 KNN 空间初始化:把观测上下文传播进空体素
\(Q\) 里既有占据体素也有新激活的无回波体素,但学生编码器只在可见占据子集 \(Q_{vis}\) 上有 token,\(Q \setminus Q_{vis}\) 没有任何输入表示,预测器无从下手。所以这些位置的 token 必须先被显式造出来。默认方案是距离加权 KNN 插值:对每个待初始化的体素 \(q\),取离它最近的 \(k = 3\) 个可见占据体素,按其三维中心距离的倒数加权求特征和。
其中 \(d_v = \|c(v) - c(q)\|_2\) 是体素中心距离,\(\mathbf{f}_v\) 是学生编码器在可见占据体素 \(v\) 上的特征。作者也试了更省事的替代方案:\(Q \setminus Q_{vis}\) 上的所有体素共用一个可学习 mask token。
初始化后的 token 与 \(Q_{vis}\) 上的编码器 token 一起送进轻量预测器 \(G_\theta\)(两个 PTv3 风格的 transformer block),通过在全部 token 上做自注意力,把可见体素的信息聚到新 token 里。为了让预测器只精炼新查询的位置,可见 token 采用恒等覆盖:把预测器输入前的可见特征直接抄到输出后的对应位置,\(Q_{vis}\) 上的表示不被改动,预测器的输出只保留在 \(Q \setminus Q_{vis}\) 上。这一步很关键——它保证了预测分支不会反过来污染编码器级的表示,两条监督路径各自作用于自己的体素集合。随后 Softmap 头与 Offset 头把这些特征映射成 \(Q\) 上的语义与几何预测。
3. 非对称教师目标与两级蒸馏:只在无回波处幻觉,让伪遮挡与真遮挡共用一个目标
有了预测,接下来的问题是拿什么去监督它。\(Q\) 里既有雷达真实打到的占据体素(含被掩掉的),也有根本没回波的空体素——后者没有任何标签,也没有教师编码器 token 可用。作者的做法是构造一份不对称的教师目标,锚定在实测占据体素上、只在无回波空间里幻觉:对占据体素 \(Q \cap V_o\)(包含 \(Q_{mask}\)),目标 Softmap 与 offset 直接取自教师编码器的表示,因为这里有 LiDAR 回波作支撑;对无回波体素 \(Q_{unobs}\),因为没有编码器 token,改用教师预测器的输出作目标,由它在完整(未掩码)体素集条件下给出基于上下文的语义与几何预测。教师预测器本身是学生预测器的 EMA,随着训练推进,这些幻觉目标会越来越准。
真正让设计闭合的是监督范围的选择:预测器级损失施加在 \(Q_{\neg vis} = Q \setminus Q_{vis} = Q_{mask} \cup Q_{unobs}\) 上,也就是说,「被伪遮挡的占据体素」与「真正无观测的体素」被放进同一套 Softmap + offset 目标里。学生为了补上伪遮挡(掩码遮挡)必须学会从上下文推断缺失结构,而这个能力被要求原样迁移到真遮挡上——全程不需要任何标注。这也是本文与掩码重建类方法最本质的区别:MAE 式的做法是「把看到的点藏起来再重建」,重建目标仍然是观测过的表面;GhostPoint 把目标直接放在从未被观测过的空间里,并用伪遮挡作为可监督的「练习场」。
一个完整示例¶
以一段含多辆车的 nuScenes 扫描为例。教师视图体素化后得到数万个占据体素 \(V_o\),学生视图按 0.6 的比例随机掩码(掩码块尺寸 1 m),剩下 \(V_{vis}\)。教师编码器特征经 Offset 头预测中心偏移,再用 BFS 在 PIT 归一化的预测质心上做聚类(近邻数 20、搜索半径 5 m),把非地面点分组成若干伪实例,小于 10 个点的连通分量被丢弃。假设其中一辆车聚成一个实例,它的占据体素有一部分恰好落在掩码区里——只要还有至少一个体素可见,这个实例就被保留。
接着用 \(k_s = 5\) 的核膨胀该实例的占据栅格,候选邻域从可见的那半个车身向外扩出一圈,把车身背面与侧面的无回波体素激活进来;按 0.5 的比例采样出固定大小的 \(Q\)。此时 \(Q\) 中的体素分成三类:可见占据(直接用学生编码器特征)、被掩码的占据(KNN 插值初始化)、无回波(KNN 插值初始化)。插值 token 与可见 token 一起过两层预测器做自注意力,可见位置被恒等覆盖回去。最后 Softmap 与 Offset 头只在 \(Q \setminus Q_{vis}\) 上出预测:被掩码的体素对齐教师编码器给出的目标,无回波体素对齐教师预测器的幻觉目标。两者共用同一个损失。
损失函数 / 训练策略¶
GhostPoint 在两个层级上做蒸馏。编码器级沿用标准自蒸馏:在可见占据体素 \(V_{vis}\) 上,教师与学生的编码器输出分别过原型头得到 Softmap 分布、过 Offset 头得到中心偏移,构成语义损失 \(\mathcal{L}_{\text{sem,vis}}\)(对 Softmap 分布做 KL 散度)与几何损失 \(\mathcal{L}_{\text{geo,vis}}\)(同时约束偏移的幅度与方向,即幅度差加上 \(1 - \cos\) 项)。预测器级在非可见邻域体素 \(Q_{\neg vis}\) 上沿用同一对语义与几何目标,只是目标来源按上面说的方式不对称地选取。
⚠️ 原文该式在 PDF 文本提取中损坏,此处按上下文与消融设置重建,符号细节以原文为准。\(\lambda = 0.1\) 用于平衡语义与几何两项。
训练采用两阶段预热再联合优化:前 10% 的 epoch 只训编码器的 Softmap 分支以稳住表示;接下来 10% 打开编码器的 offset 分支与预测器分支,并把这两路的梯度从学生编码器上 detach 掉;之后才端到端优化全部组件。附录显示性能对预热比例并不敏感((0.1, 0.1) 最好,59.5 mAP;其它组合在 59.2–59.4 之间),前提是保持这个两阶段顺序。这一安排的必要性在消融中很明显:不加预热的预测器只带来 57.2 mAP,而两阶段预热后是 59.5。
其余设置:AdamW + 余弦退火,学习率 2e-4,weight decay 4e-2,batch size 16,掩码率 0.6、掩码块 1 m,预训练 50 个 epoch,\(k_s = 5\)(占用膨胀)、\(k = 3\)(token 初始化)、\(\lambda = 0.1\),Zipf 原型形状参数 \(\alpha_{zipf} = 1.3\),教师/学生温度分别为 0.035 / 0.05。预训练用 2 张 H200 做 DDP,下游微调单张 H200。开销方面,GhostPoint 预训练 26 小时,对比 PointINS 的 20 小时与 DOS 的 15 小时,多出的约 30% 全部来自邻域采样与预测器;两者在下游微调时都被丢弃,因此下游成本与先前方法完全一致。
实验关键数据¶
主实验¶
表 2 在 nuScenes 与 Waymo 上比较了最近的自监督方法,分 decoder probing(冻结 PTv3 编码器、从零训 CenterPoint 其余部分)与全参数微调两种协议。nuScenes 用 mAP 与 NDS,Waymo 用 L2 难度下的 AP。
| 方法 | nuScenes mAP (probe) | nuScenes NDS (probe) | Waymo mAP (probe) | nuScenes mAP (ft) | nuScenes NDS (ft) | Waymo mAP (ft) |
|---|---|---|---|---|---|---|
| PTv3 (监督) | 63.8 | 68.4 | 67.9 | — | — | — |
| PSA | 41.3 | 52.8 | 42.4 | 63.9 | 68.9 | 68.1 |
| SONATA | 44.6 | 55.0 | 47.4 | 64.2 | 69.0 | 68.6 |
| NOMAE | 53.5 | 60.1 | 52.4 | 65.8 | 69.8 | 69.5 |
| DOS | 55.4 | 61.6 | 57.1 | 65.5 | 69.7 | 69.2 |
| PointINS | 56.7 | 62.5 | 57.5 | 66.3 | 70.1 | 69.5 |
| GhostPoint | 59.5 | 64.2 | 60.0 | 67.5 | 71.2 | 70.1 |
probing 协议下 GhostPoint 比次优 SSL 方法高 2.8 mAP / 1.7 NDS(nuScenes)与 2.5 mAP(Waymo);全参数微调下增益进一步放大,nuScenes 达到 67.5 mAP / 71.2 NDS,比监督训练的 PTv3 基线(63.8 mAP)高出 3.7 mAP。定性上(图 4),GhostPoint 能唯一正确检出中远距离被部分遮挡的车辆,减少重复框并改善朝向,但作者也承认它偶尔仍会在空处产生幻觉框。
消融实验¶
表 3 从 PointINS 基线出发逐个加组件(nuScenes,decoder probing):
| 配置 | mAP | NDS | 说明 |
|---|---|---|---|
| 基线 (PointINS) | 56.7 | 62.5 | — |
| + 邻域采样(无预测器,直接 KNN 插值) | 57.3 | 62.7 | 只把监督信号延伸进遮挡区域就已有效 |
| + 预测器(无预热) | 57.2 | 63.0 | NDS 有涨但 mAP 反而略降 |
| + 预测器(一阶段预热) | 58.5 | 63.6 | mAP 开始明显提升 |
| + 预测器(两阶段预热) | 59.5 | 64.2 | 完整模型 |
| + 框回归 | 59.1 | 63.9 | 加框回归反而掉点 |
为确认增益真的来自「幻觉」而不是「多了一个正则项/多了几个监督位置」,表 4 做了三组控制实验:
| 配置 | mAP | NDS | 说明 |
|---|---|---|---|
| PointINS | 56.7 | 62.5 | 基线 |
| + 不幻觉(预测器只作用于掩码观测点) | 57.3 | 63.1 | 只有轻微正则化收益 |
| + Zero targets(保留 ghost 邻域,目标置零偏移 + 均匀 Softmap) | 57.6 | 63.3 | 仅再多一点点 |
| + Swap(用等量幻觉点替换掩码点) | 59.4 | 64.1 | 与完整模型持平 |
| GhostPoint | 59.5 | 64.2 | 完整模型 |
标签效率¶
表 5 给出 nuScenes 上只用 0.1% / 1% / 10% 标注时的检测性能:
| 方法 | 0.1% mAP | 0.1% NDS | 1% mAP | 1% NDS | 10% mAP | 10% NDS |
|---|---|---|---|---|---|---|
| PTv3 (监督) | 18.1 | 35.3 | 37.3 | 48.0 | 57.9 | 65.0 |
| NOMAE | 30.5 | 46.8 | 45.7 | 56.0 | 59.7 | 66.6 |
| DOS | 34.0 | 49.1 | 49.0 | 58.0 | 61.4 | 67.4 |
| PointINS | 34.8 | 50.8 | 50.8 | 60.2 | 62.1 | 67.8 |
| GhostPoint | 36.9 | 52.1 | 53.1 | 62.5 | 63.5 | 68.8 |
关键发现¶
- 幻觉目标本身是增益来源,不是正则化、也不是监督点变多。 表 4 的三组控制实验把可能性逐一排除:只在掩码观测点上监督(不幻觉)只涨 0.6 mAP;保留 ghost 邻域但把目标置零几乎不再涨;用等量幻觉点替换掩码点则与完整模型持平。三者合起来说明,起作用的是「物体邻接无观测区域里那些有信息量的幻觉目标」。
- 预测器需要预热,且深度不必深。 无预热的预测器(57.2 mAP)甚至不如只加邻域采样(57.3 mAP),两阶段预热后才拉开到 59.5。图 5 显示:不做 KNN 初始化时性能随预测器深度涨到 3 块即平台;有 KNN 初始化后整体更高且从 2 块起就稳定,说明一份空间连贯的初始猜测能显著减轻预测器负担。
- 「补几何监督」解决不了错配。 给 PointINS 加框回归(表 1,56.7 → 56.2)与给 GhostPoint 加框回归(表 3,59.5 → 59.1)两次都是掉点,从两个方向印证了论文的核心判断:限制不在缺失的几何学习,而在观测的不完整。
- 稀疏与小标注预算下收益最大。 0.1% 标注时比次优方法高 2.1 mAP / 1.3 NDS,1% 时扩大到 2.3 mAP / 2.3 NDS;10% 标注(63.5 mAP / 68.8 NDS)已基本追平全标签监督训练的 PTv3(63.8 / 68.4)。Waymo 上同样全面领先,行人与骑行者这两个遮挡最严重的类别增益最大。
- 不是靠牺牲逐点能力换检测精度。 nuScenes 线性探测下语义分割 74.2 mIoU,基本追平最强 SSL 基线 PointINS(74.4);全景分割反而最好,62.8 PQ,比 PointINS 高 0.6、比 DOS 高 5.4,SQ/RQ 也在 SSL 方法中居首(84.6 / 73.2)。
- 跨数据集与跨架构都能迁移。 Waymo 预训练 → nuScenes 探测达到 43.4 mAP / 54.1 NDS,比 PointINS 高 1.8 / 1.7。把 PTv3 换成 CenterPoint 的稀疏 CNN 骨干时,直接用 GhostPoint 预训练 CNN 迁移效果一般(探测 48.0 L2 mAP),但用一个冻结的 GhostPoint PTv3 教师去蒸馏该 CNN 能到 57.3,全参数微调后 67.2,优于同架构直接预训练(65.4)与监督 CNN 基线(64.5)。
- 对损坏更鲁棒。 Robo3D 上的 nuScenes-C 评测中,GhostPoint 取得最高 mRR(97.5)与最低 mCE(68.8),在 mCE 上明显优于 PointINS(70.4)和 DOS(71.2)。
- 超参稳健。 膨胀核 \(k_s\) 在 5 处见峰、KNN 邻居数 \(k\) 在 3 之后即平台;无回波体素子采样比例在 0.5 处最好(58.9 / 59.5 / 59.2 对应 0.2 / 0.5 / 0.8),过低时新体素集中在实例边界、覆盖不足,过高时无观测区目标噪声变大;两阶段预热比例在 0.1–0.2 内波动小于 0.3 mAP。
亮点与洞察¶
- 把「不可观测」变成可监督的目标,而不是靠更强的几何损失去逼近它。 关键的一步不是设计更复杂的回归头,而是认识到伪遮挡(人为掩码)与真遮挡在表示层面是同一类缺失,于是可以用前者当练习场、把学到的补齐能力直接迁移到后者。这个「用可监督的缺失模拟不可监督的缺失」的思路可以迁移到任何存在系统性观测盲区的模态:例如 radar 的稀疏回波、事件相机的运动模糊盲区、深度传感器的透明表面失效。
- 膨胀采样是一个几乎零成本的归纳偏置注入。 与其在自由空间里均匀撒查询点(浪费算力且绝大多数是背景),不如直接对已发现实例的占据栅格做 3D 膨胀,让新查询天然贴在物体边界上。这是一个一行代码级的操作,却同时解决了「放哪里」和「有没有结构可学」两个问题,值得作为通用 trick 迁移到任何需要主动选择查询位置的自监督框架。
- 恒等覆盖(identity overwrite)保证了双路监督互不干扰。 预测器在全部 token 上做自注意力以求简洁,但输出只在非可见位置被采用,可见 token 直接从前一级抄过来。这样预测分支无论怎么训,都不会把梯度灌回编码器的可见表示,两个层级的蒸馏各自干净地作用于自己的体素集合——这是很多「多分支自监督」设计容易踩的坑。
- 不对称目标的构造把教师的能力差异用到了极致。 有回波的地方用教师编码器做目标(可靠但只覆盖可见面),没回波的地方用教师预测器做目标(猜测但覆盖全空间),再加上教师预测器本身是学生的 EMA,幻觉目标会随训练自我提升。这个「按证据可得性分层选目标」的模式可以直接复用。
局限与展望¶
- 作者承认的局限有两点:probing 协议下性能仍落后于全监督训练;尚未在其他受遮挡影响的稀疏感知模态(如 radar)上验证。
- 幻觉目标最终来自教师预测器自己的猜测,没有任何真实几何约束兜底。定性结果也显示,物体因严重遮挡而极度稀疏时幻觉无法恢复完整形状,且对背景离群点敏感,会导致实例边界模糊或被错误延伸(图 4 第二行也承认偶发空处幻觉框)。这意味着错误可能被自我强化。
- 预训练开销比 PointINS 高 30%(26h vs 20h),且方法引入了一组彼此耦合的超参(膨胀核 \(k_s\)、聚类半径 \(\tau_d\)、最小簇尺寸 \(\tau_{min}\)、无回波体素子采样比例),论文虽给出了敏感性分析,但在新数据集上仍需要调。
- 验证范围限于 nuScenes 与 Waymo 两个自动驾驶数据集,未覆盖室内或非驾驶场景。
- 可能的改进方向:引入占用预测或多帧时序累积点云作为更可靠的幻觉监督信号(把「自我猜测」锚定到跨帧一致性上);把 \(k_s\) 做成随实例尺度自适应而非全局固定;在训练中显式降权背景离群体素以缓解边界污染。
相关工作与启发¶
- vs DOS / PointINS(自蒸馏与实例感知): 它们把实例感知引入预训练,但目标仍定义在可见回波点上,实例质心也只由观测点决定,遮挡下会偏向可见表面。GhostPoint 沿用它们的学生—教师与 Softmap/offset 机制作为基础信号,但把监督范围扩展到 \(Q \setminus Q_{vis}\),并用教师预测器的幻觉覆盖无回波空间。区别的核心是「表示定义域」:前者的表示只在 \(V_o\) 上有意义,后者要求在 \(V_u\) 上也被约束。
- vs NOMAE / Occ-MAE(掩码占用建模): 它们把无点回波的体素视为空、在局部邻域与多尺度上重建占用率。GhostPoint 与其共享「只重视局部邻域」的动机,但把无点体素显式当成「潜在被遮挡空间」来预测特征而非当作空,且不需要占用标签。消融也显示,单纯把监督延伸到遮挡区(加邻域采样)只能涨 0.6 mAP,真正起作用的是幻觉目标的内容。
- vs PSA(姿态与尺寸感知的 SSL): PSA 走的是另一条路——把物体尺寸、朝向等几何先验显式编码进 pretext task。它在探测协议下表现最弱(41.3 mAP),说明手工设计的几何代理任务在室外 LiDAR 场景里迁移有限;GhostPoint 证明了不引入任何几何先验、只把监督域扩到未观测空间同样(且更有效)能改善检测。
- vs 点云补全(PCN / FoldingNet / 隐式占用网络): 它们同样以推理未观测几何为目标,但依赖完整形状或框标注做监督,且只在推理时作为独立的补全工具使用。GhostPoint 共享「建模未观测结构有价值」的直觉,但把它改造成纯自监督的表示学习目标,服务的是下游感知而非形状输出。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 「把预训练目标从可见表面搬到未观测体素」这个问题定位本身就很准,实例体素膨胀 + 不对称教师幻觉目标的组合是干净的原创设计,且对「为什么补几何监督没用」给出了可复现的负结果论证。
- 实验充分度: ⭐⭐⭐⭐⭐ 两个数据集、探测与微调两种协议、标签效率、分割迁移、跨数据集、跨架构、OOD 鲁棒性、运行时与五组超参敏感性分析,还专门做了三组控制实验把「幻觉 vs 正则化」拆干净,论证链条完整。
- 写作质量: ⭐⭐⭐⭐ 问题形式化(表示错配)清晰,图表与消融的对应关系明确;方法部分符号偏多,个别公式在原文排版中不够易读。
- 价值: ⭐⭐⭐⭐⭐ 在 LiDAR 自监督预训练这个竞争激烈的方向上把下游检测显著推高(微调后超监督基线 3.7 mAP),且预测器与采样模块在下游可完全丢弃,落地成本为零。