RGB-Pointmap Pretraining for Unified 3D Scene Understanding¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://yebulabula.github.io/UniScene3D/
领域: 3D 视觉
关键词: 3D 场景理解、点图预训练、RGB-Pointmap、几何对齐、多模态学习
一句话总结¶
UniScene3D 提出了基于多视角图像与世界坐标点图(RGB-Pointmap)的统一 3D 场景表征预训练框架,通过 Patch 级早期融合继承 2D 大模型先验,并结合跨视角几何对齐与指称定位对齐等多尺度目标,在视角定位、场景检索与 3D VQA 等任务上均取得 SOTA 表现。
研究背景与动机¶
通过将 3D 编码器与预训练视觉-语言基础模型(如 CLIP)对齐进行 3D 表征学习已成为主流范式。然而,选择何种 3D 输入模态直接决定了表征能力的上限。传统点云虽然保留了严密的 3D 几何,但其不规则、无序的散点结构与主流网格化(grid-based)架构天然冲突,难以直接复用大规模 2D 预训练模型中沉淀的丰富视觉先验;多视角图像和深度图虽然维持了规则的 2D 栅格,却缺乏统一世界坐标系下的全局 3D 几何一致性,使得跨视角的全局空间推理极易失效。近期兴起的点图(Pointmap)虽把 3D 世界坐标组织成图像栅格,兼具 3D 坐标与 2D 网格结构,但纯点图只记录坐标、完全丢失了颜色与纹理等关键外观线索,在依赖细粒度视觉属性的场景下寸步难行。
不仅如此,现有基于多视角的预训练方法大多对各个视角进行孤立处理,未能利用场景内多视角点图之间天然存在的跨视角几何重叠与物体可见性语义关联,容易受制于单视角的局部可观测性与视角遮挡。这种“外观与几何剥离”以及“多视角间割裂处理”的矛盾,制约了通用 3D 场景表征的发展。
针对上述瓶颈,UniScene3D 提出联合建模多视角图像与点图的外观与几何信息,并显式构建跨视角的几何与语义一致性约束。核心 idea:将多视角 RGB 图像与世界坐标点图在 Patch 嵌入层进行早期相加融合以深度复用 2D 预训练先验,并通过跨视角 Chamfer 几何相似度软分布对齐与基于 3D 掩码相交的指称视角对齐,构建几何一致且语义丰富的统一 3D 场景表征。
方法详解¶
整体框架¶
UniScene3D 接收由 \(V\) 个视角组成的对齐多视角图像-点图对(RGB-Pointmap)输入。其中每个视角的点图通过相机内外参由深度图反投影到统一世界坐标系中构建。网络在 Patch Embedding 阶段进行两模态的早期融合,并拼接一个可学习的类别标记输入到多层标准 Transformer 块中,提取每个视角的表征向量,进而通过平均池化获得场景级表征。在预训练过程中,模型受到跨视角几何对齐、指称视角对齐、视角级图文对齐和场景级图文对齐共四个多尺度目标的联合监督。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
In["多视角 RGB-Pointmap 输入<br/>(RGB 图像 + 世界坐标点图)"] --> EarlyFusion["1. Patch 级早期融合<br/>两路投影向量逐元素相加并保留 2D 先验"]
EarlyFusion --> Backbone["Transformer 编码器主干<br/>多视角 class token 与 patch token 交互"]
Backbone --> Lgeo["2. 跨视角几何对齐<br/>基于 Chamfer 距离软目标的跨视角空间一致性"]
Backbone --> Lground["3. 指称视角对齐<br/>基于 3D 掩码可见性相交的物体文本-视角对齐"]
Backbone --> GlobalAlign["4. 批次级多尺度图文对齐<br/>视角级与场景级全局对比学习"]
Lgeo --> TotalLoss["联合预训练总损失 L_total"]
Lground --> TotalLoss
GlobalAlign --> TotalLoss
关键设计¶
1. Patch 级早期融合:零额外参数保留 2D 基础模型先验 纯点图缺失外观属性,而晚期融合或额外引入投影映射层会破坏预训练权重或因随机初始化导致泛化性骤降。为此,UniScene3D 基于预训练 2D 图像编码器 FG-CLIP 初始化,将 RGB 图像与世界坐标点图分别通过图像 patch 映射层 \(\phi_I\) 与点图 patch 映射层 \(\phi_P\)(两者参数和结构完全相同且共享预训练初始化)。提取两路 patch token 后直接进行逐元素相加: $\(z_v = \phi_I(I_v) + E_{pos} + \phi_P(P_v)\)$ 该设计让几何坐标直接在最前端注入到特征流中,使得后接的 Transformer 块能够直接协同推理外观与空间位置,同时完全不需要针对拼接通道训练从零初始化的降维层,最大限度保留了 2D 视觉先验的泛化性。
2. 跨视角几何对齐:基于 Chamfer 距离排序的软标签对比学习 多视角表征的嵌入空间应当能够反映真实三维空间的邻近程度:几何重叠度高、空间相近的视角其表征距离应更近,而较远视角应自然拉开。UniScene3D 计算同场景内视角 \(v\) 与 \(u\) 点图之间的双向 Chamfer 距离 \(CD(P_v, P_u)\),并按几何相近程度对其他视角升序排序得到位次索引 \(r_v(u)\)。为防止硬对比将原本重叠率很高的次近邻错误判定为绝对负样本,设计了由排序温度参数 \(\tau_r\) 控制的软目标概率分布: $\(p_{v,u}^{\text{soft}} = \frac{\exp(-r_v(u)/\tau_r)}{\sum_{k\in\mathcal{V}_S\setminus\{v\}}\exp(-r_v(k)/\tau_r)}\)$ 并将该软分布与硬最近邻目标 \(p_{v,u}^{\text{hard}}\) 按比例 \(\alpha\) 插值得到综合目标分布 \(p_{v,u} = \alpha p_{v,u}^{\text{hard}} + (1-\alpha) p_{v,u}^{\text{soft}}\)。通过以点积相似度 logits 最小化与该目标分布的交叉熵损失 \(\mathcal{L}_{\text{geo}}\),强制表征空间编码出连续、鲁棒的场景几何拓扑。
3. 指称视角对齐:基于 3D 几何可见性的跨视角语义对齐 不同视角尽管观察角度不同,但往往共同观测到场景中的关键目标物体。为了捕获跨视角的实例级语义共享,UniScene3D 引入指称视角对齐。对于预训练数据集中给定的物体及其文本描述嵌入 \(t_o\),算法通过检查视角点图 \(P_v\) 是否与物体的 3D 真实语义掩码产生空间相交,精确判断视角 \(v\) 是否可观测到物体 \(o\)。所有有效相交构成立体正样本对 \((v, o) \in \mathcal{P}\),并通过双向对比损失驱动优化: $\(\mathcal{L}_{\text{ground}} = -\frac{1}{2|\mathcal{P}|} \sum_{(v,o)\in\mathcal{P}} \left[ \log\frac{\exp(s_{v,o})}{\sum_{o'\in\mathcal{O}_S}\exp(s_{v,o'})} + \log\frac{\exp(s_{v,o})}{\sum_{v'\in\mathcal{V}_S}\exp(s_{v',o})} \right]\)$ 该目标将物体级细粒度描述与所有可观测到该物体的视角表征强力绑定,使共享同一物体语义的视点自然聚集,显著强化了跨视角的局部语义辨识力。
4. 批次级多尺度图文对齐:视角级与场景级全局判别性约束 为了赋予模型在不同场景之间的全局判别能力,除了场景内的几何与语义对齐外,UniScene3D 还在整个训练批次内施加视角级与场景级的图文对齐。视角级损失 \(\mathcal{L}_{\text{view}}\) 对齐单个视角的表征 \(h_v\) 与对应的视角描述文本嵌入;场景级损失 \(\mathcal{L}_{\text{scene}}\) 则将场景内全部视角的表征平均池化后得到场景向量 \(\bar{h}_s\),并与整场全局描述文本嵌入对齐。最终结合几何与指称目标形成联合多任务损失,全面覆盖局部与全局表征。
损失函数 / 训练策略¶
模型整体预训练损失函数定义为四个目标的加权求和: $\(\mathcal{L}_{\text{total}} = \lambda \mathcal{L}_{\text{geo}} + \mathcal{L}_{\text{ground}} + \mathcal{L}_{\text{view}} + \mathcal{L}_{\text{scene}}\)$ 其中 \(\lambda = 0.1\)。训练在 ScanNet、3RScan 和 ARKitScenes 共 6,562 个室内场景上展开,采用 ViT-B/16 架构(输入分辨率 224×224)。每个场景采样 32 个最大覆盖视角,几何插值系数设为 \(\alpha = 0.7\),排序温度 \(\tau_r = 0.35\)。采用 AdamW 优化器训练 80 个 epoch,学习率采用余弦退火策略从 \(1 \times 10^{-4}\) 衰减至 \(1 \times 10^{-5}\)。
实验关键数据¶
主实验¶
论文在视角定位(Viewpoint Grounding,零样本)、跨模态场景检索(Scene Retrieval,零样本,文本数 \(n=5\) 与 \(n=10\))以及下游 3D VQA 微调上与多类主流架构进行了全面对比。
| 任务 / 数据集 | 输入模态 | 指标 | UniScene3D (本文) | 前任 SOTA (POMA-3D / 基线) | 性能增益 |
|---|---|---|---|---|---|
| 视角定位 ScanRefer | RGBP vs PM | R@1 (%) | 38.6 | 16.4 (POMA-3D) / 22.2 (SigLIP2) | +22.2 / +16.4 |
| 视角定位 Nr3D | RGBP vs PM | R@1 (%) | 25.2 | 13.6 (POMA-3D) / 18.8 (SigLIP2) | +11.6 / +6.4 |
| 视角定位 Sr3D | RGBP vs PM | R@1 (%) | 23.6 | 10.2 (POMA-3D) / 13.4 (FG-CLIP) | +13.4 / +10.2 |
| 场景检索 ScanRefer (\(n=5\)) | RGBP vs PM | R@1 (%) | 22.4 | 13.8 (POMA-3D) | +8.6 |
| 场景检索 ScanRefer (\(n=10\)) | RGBP vs PM | R@1 (%) | 33.4 | 20.4 (POMA-3D) | +13.0 |
| 场景类型分类 (ScanNet 21类) | RGBP vs PM | 0-shot 准确率 (%) | 70.7 | 63.9 (POMA-3D) / 49.5 (FG-CLIP) | +6.8 / +21.2 |
| 场景类型分类 (ScanNet 21类) | RGBP vs PM | 10-shot 准确率 (%) | 83.7 | 74.1 (POMA-3D) / 77.9 (SigLIP2) | +9.6 / +5.8 |
| 3D VQA (ScanQA) | RGBP vs PM | EM@1 (%) | 23.2 | 22.3 (POMA-3D) / 20.9 (FG-CLIP) | +0.9 / +2.3 |
| 3D VQA (SQA3D) | RGBP vs PM | EM@1 (%) | 52.5 | 51.1 (POMA-3D) / 49.5 (FG-CLIP) | +1.4 / +3.0 |
| 3D VQA (Hypo3D) | RGBP vs PM | EM@1 (%) | 35.2 | 33.4 (POMA-3D) | +1.8 |
消融实验¶
论文在 ScanRefer、Nr3D、Sr3D 等多个基准上对核心模块(表 8)及融合策略(表 7)进行了详尽消融分析。
| 模型配置 | ScanRefer R@1 | Nr3D R@1 | Sr3D R@1 | 场景分类 0-shot | 模块说明与核心影响 |
|---|---|---|---|---|---|
| UniScene3D (完整模型) | 38.6 | 25.2 | 23.6 | 70.7 | 具备全部模块的最优表征 |
| 去掉图像输入 (w/o image) | 37.6 | 23.7 | 23.1 | 67.2 | 丢失颜色与纹理外观线索,依赖纯点图 |
| 去掉点图输入 (w/o pointmap) | 28.8 | 21.3 | 18.5 | 68.9 | 丢失 3D 空间坐标,定位性能大幅跌落 |
| 去掉几何对齐 (w/o \(\mathcal{L}_{\text{geo}}\)) | 38.2 | 23.2 | 23.0 | 68.7 | 跨视角空间连续性受损,多任务轻微下降 |
| 去掉指称对齐 (w/o \(\mathcal{L}_{\text{ground}}\)) | 18.5 | 15.6 | 11.5 | 68.5 | ScanRefer 定位断崖式下跌 (-20.1%) |
| 融合方式消融 (ScanRefer) | - | - | - | - | - |
| 完整模型 (逐元素相加) | 38.6 | - | - | - | 维持预训练权重的标准加法融合 |
| 随机初始化点图 Patch Embed | 38.0 | - | - | - | 不复用预训练 Patch Embed 权重 |
| 去掉位置编码 (w/o Pos. Encoding) | 37.2 | - | - | - | 缺少 Patch 空间位置编码 |
| 拼接 + 线性映射 (Concat + Proj) | 36.5 | - | - | - | 额外映射层冷启动损害预训练先验 |
关键发现¶
- 指称视角对齐 \(\mathcal{L}_{\text{ground}}\) 是视角定位的决定性驱动力:去掉该损失后,ScanRefer 上的 R@1 从 38.6% 骤降至 18.5%,跌幅超过 50%。这证明通过 3D 掩码相交建立明确的物体文本与视角关联是实现精确定位所必需的。
- 外观与几何缺一不可:消去点图会导致 ScanRefer R@1 剧降 9.8%(38.6% \(\to\) 28.8%),证明纯 RGB 缺乏 3D 度量尺度;而消去图像输入则在需要颜色辨析的场景下失效(如识别“绿色座椅”),两者结合实现了能力互补。
- 简单相加融合优于拼接映射:拼接两模态后经线性映射降维(Concat + Projection)的表现(36.5%)明显逊于简单的 element-wise 相加(38.6%),表明冷启动训练新增投影层反而破坏了 2D 骨干的预训练泛化能力。
- 稀疏视角的优异鲁棒性:视角数量分析表明,UniScene3D 在仅输入 16 个视角时的场景检索指标已超越了 POMA-3D 使用 32 个视角的指标,展示了更强的视角紧凑性与鲁棒性。
亮点与洞察¶
- 优雅的 2D-3D 架构兼容性:利用世界坐标点图的网格化属性,以零新增复杂结构的 Patch 相加融合将 3D 几何注入 2D 视觉 Transformer,成功无缝继承 2D 大规模预训练模型的先验知识。
- 基于 Chamfer 几何排序的软目标构造:避免将空间相邻的视角粗暴划分为绝对负样本,通过 Chamfer 距离排序和温度加权构建连续概率分布,使几何特征空间的拓扑关系平滑合理。
- 可复用的通用场景预训练策略:指称对齐借助 3D 掩码的空间相交判定自动建立正样本映射,这一弱监督思想可轻松迁移至室外自动驾驶多相机环视表征或机器人具身多视角感知等任务中。
局限与展望¶
- 固定分辨率与模型尺寸约束:当前仅在 224×224 分辨率与 ViT-B/16 尺度上进行了预训练,未来向更大尺寸的基础模型(如 ViT-L/G)以及动态/高分辨率输入扩展时的开销与表现仍待验证。
- 预训练数据规模仍受限于室内场景:预训练主要在约 6,500 个室内重建场景上进行,尽管已优于传统点云预训练,但相比 2D 领域的数十亿图文对仍存在数量级差距,尚未覆盖复杂的超大尺度室外开放场景。
- 依赖相对准确的几何内外参反投影:世界坐标点图的高度准确依赖于精准的深度和相机内外参,若在真实低成本传感器噪声或建图漂移下,点图坐标失真对多视角几何对齐的影响尚未进行全面鲁棒性评估。
相关工作与启发¶
- vs POMA-3D: POMA-3D 是首个采用点图进行 3D 预训练的工作,但其仅输入纯几何坐标点图、缺失图像外观纹理,且采用复杂的 JEPA 式多阶段训练。UniScene3D 创新性引入 RGB-Pointmap 联合输入与多模态跨视角对齐目标,在 ScanRefer 定位上性能翻倍,训练更高效。
- vs 纯点云方法 (Uni3D / 3D-VisTA / SceneVerse): 传统点云网络无法直接加载 2D 网格化预训练权重,在低标注(zero-shot / few-shot)场景分类与检索中泛化较弱。UniScene3D 依托点图的 2D 兼容性与 FG-CLIP 初始权重,各项零样本指标显著领跑。
- vs 多视角纯图像方法 (DFN / SigLIP2): 纯图像模型缺乏绝对空间距离与物理尺度概念,在涉及空间跨度、尺寸(如“最长的长椅”)的 3D 定位任务上表现受限。UniScene3D 的点图分支补齐了严密的物理坐标信息。
评分¶
- 新颖性: ⭐⭐⭐⭐ [结合 RGB 与点图早期融合,并提出 Chamfer 排序几何对齐与掩码可见性指称对齐,设计自洽巧妙]
- 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 3D 定位、检索、低样本分类及 3 个 3D VQA 权威基准,消融与对比维度非常扎实]
- 写作质量: ⭐⭐⭐⭐⭐ [逻辑严密,图表清晰,问题痛点到机制设计的论证条理分明]
- 价值: ⭐⭐⭐⭐ [为通用 3D 场景基础模型的输入模态与预训练对齐范式提供了重要的标杆与实践路径]