GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://gapmllm.github.io/
领域: 多模态VLM
关键词: 3D空间感知, 多模态大模型, 几何对齐预训练, 多尺度特征融合, 隐式几何先验
一句话总结¶
GAP-MLLM 提出了首个面向纯 RGB 视频输入多模态大模型的几何对齐预训练范式,通过视觉提示驱动的稀疏几何-语义联合预训练任务与逐层门控融合/DeepStack注入机制,在仅极少稀疏点监督下彻底激活了 MLLM 的公制度量空间感知能力。
研究背景与动机¶
多模态大语言模型(MLLMs)在图像与视频的高层语义推理上展现出卓越的能力,但在具身智能与物理世界交互中,如何仅依靠纯 RGB 画面感知精确的三维空间几何,一直是学术界的核心难题。受限于激光雷达或密集 3D 点云标注的高昂采集成本,近期研究倾向于利用前馈 3D 重建模型(如 VGGT、DUSt3R)提取像素级对齐的隐式几何先验,并将其特征馈入大语言模型以支撑 3D 视觉定位、密集描述和 3D 检测。然而令人困惑的是,这类基于隐式先验的纯视觉方法与显式输入 3D 点云的方法之间,始终存在着明显的性能鸿沟。
深入剖析现有范式可以发现,该性能差距的根源并非前馈重建模型提供的几何先验不足,而是由于训练范式中普遍存在「几何与语义失衡」的严重错位。当前主流方法往往直接将几何编码器最后一层的特征与视觉特征简单相加或拼接,便直接投入到以自然语言文本为主导的下游任务中进行微调。在文本生成损失的强力主导下,未经过专门几何对齐的多模态骨干网络容易将微弱的隐式几何特征淹没或边缘化,导致深层表征中结构感知难以被有效激活。此外,几何编码器在不同网络层级呈现出截然不同的注意力分布与抽象层次,单一末层特征的静态融合完全忽略了由全局轮廓到局部细节的层级几何线索。
针对上述两大约束,本文主张在下游任务适配前引入显式的几何激活阶段。核心 idea:提出面向纯视觉多模态大模型的几何对齐预训练范式(GAP-MLLM),通过视觉提示引导的稀疏点图与语义联合预测任务显式激活三维度量感知,并设计逐层自适应门控融合与多模态 DeepStack 机制,实现层级几何先验与语言表征的协同增强。
方法详解¶
整体框架¶
GAP-MLLM 整体架构设计旨在从单目多帧图像序列和自然语言指令中,端到端解析出具备物理公制度量的三维空间结构与语义内容。系统由并行的视觉编码分支(Qwen3-VL 视觉编码器)与几何先验分支(VGGT 前馈重建编码器)、多层门控特征融合模块以及视频 LLM 解码器构成。
对于输入的 \(n\) 帧连续图像序列 \(\{I_i\}_{i=1}^n\) 和文本查询 \(Q\),视觉与几何编码器分别抽取每一层(总共 \(L\) 层,实验中设 \(L=24\))的多尺度视觉特征图与几何特征图。两路分支在空间上均通过统一的 \(2\times 2\) patch 合并层进行下采样对齐。随后,每层对齐后的特征送入独立的逐 token 门控网络进行动态权重调配,输出层级融合表征。在进入 LLM 解码器时,第 \(L\) 层的最终融合特征作为主要前缀嵌入与文本嵌入拼接,而选定的浅层和中间层融合特征(第 5, 11, 17 层)则通过多模态 DeepStack 策略直接加到解码器前几个 Transformer 块的隐藏状态中,防止空间几何信息在多层因果自注意力解码中被文字表征冲淡。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入多帧图像序列与文本查询"] --> B["双分支并行编码与 Patch 合并<br/>视觉分支 + VGGT 几何分支"]
B --> C["逐层门控特征融合<br/>Token 级动态计算几何-语义权重"]
C --> D["多模态 DeepStack 分层注入<br/>中间层注入隐状态 + 顶层接入主输入"]
D --> E["两阶段下游任务推理<br/>目标关键帧索引定位与 3D Box 回归"]
关键设计¶
1. 稀疏几何-语义联合预训练:统一第一帧度量坐标系下的空间激活
纯 RGB 序列推断 3D 结构的一大痛点是尺度模糊与多任务坐标系不统一。为此,GAP-MLLM 确立了以序列第一帧相机为基准的绝对公制度量坐标系(单位为米,数值统一保留两位小数)。更重要的是,为了在语言主导优化前唤醒模型的度量空间感知,本文设计了稀疏视觉提示驱动的预训练任务:在给定 4 帧图像序列中,于特定像素处施加红十字视觉标记,要求模型同时输出该采样点的真实三维空间坐标 \((x, y, z)\) 及其对应的语义类别标签 \(c\)。
这一设计看似简单,却极其高效。训练中采样约 500K 个点,但由于每次仅在稀疏像素点施加监督,有效像素监督总量仅相当于两张 \(680\times 480\) 图像的像素规模。实验证明,几何点位预测强迫模型理解像素与三维世界的投影映射,而语义标签的同步预测则保证了视觉-语言原本的表征空间不被单一度量回归破坏,二者相互约束,使模型即使在微量数据下也能快速激活强健的公制几何意识。
2. 逐层门控特征融合:打破单层静态相加的多尺度动态调配
先验分析发现,几何编码器各层的全局注意力分布差异巨大,浅层关注局部结构细节,深层建立跨视角全局对应关系;若如以往方法仅取最后一层几何特征进行相加,会导致几何信息表达失真与结构偏差。为实现细粒度融合,GAP-MLLM 在视觉与几何两分支的 patch 聚合层后,针对每一层 \(j \in \{1, 2, \dots, L\}\) 引入了独立的轻量化两层 MLP 门控模块:
其中 \(\sigma\) 为 Sigmoid 激活函数,\([\cdot, \cdot]\) 为特征拼接,\(\odot\) 为逐元素乘法。门控系数 \(g_{i,j} \in [0, 1]\) 允许模型在不同网络深度与图像的不同空间位置自主决定语义与几何的比重。可视化分析证明,中间层门控自发为几何先验赋予极高权重(充分提取几何拓扑),而在顶层则赋予视觉语义更高权重,有效避免了强行静态融合引发的模态相消。
3. 多模态 DeepStack 分层注入与两阶段下游微调:几何深度保持与解耦推理
即使通过门控融合得到了优良的多尺度表征,直接送入单一 LLM 输入端依然面临信息衰减的风险。本文借鉴 DeepStack 思想,将选定的深浅中间层融合特征 \(\mathcal{T}_{i,m}^S\)(\(m \in \{5, 11, 17\}\))直接残差加到 LLM 解码器前几层的隐藏状态中,形成持续的跨层几何激励。
在下游任务适配上,针对单步回归在长视频序列中难以兼顾时序定位与几何精度的问题,GAP-MLLM 采用两阶段解耦范式:以 3D 视觉定位为例,阶段一输入多帧序列,LLM 输出目标出现的最优目标帧索引 \(I_t\);阶段二将序列重新组织、以 \(I_t\) 作为第一帧参考坐标系,再精准输出目标的九自由度 3D 包围框 \((x, y, z, w, h, d, \psi, \theta, \phi)\)。两阶段策略大幅降低了解码空间的搜索复杂度,保证了预测结果严格符合第一帧的物理公制度量。
损失函数 / 训练策略¶
训练过程采用两阶段范式:第一阶段为稀疏几何-语义联合预训练,第二阶段为下游任务混合微调。在预训练和微调阶段均保持视觉编码器与 VGGT 几何编码器完全冻结,只对多层门控融合模块与 LLM 主干进行可学习参数更新。优化器采用 Adam,学习率峰值为 \(1\times 10^{-5}\),warm-up 比例为 0.03,各训练 1 个 epoch。预训练阶段 batch size 设为 32,下游微调阶段 batch size 设为 16。
实验关键数据¶
主实验¶
在 3D 视觉定位(ScanRefer)、3D 密集描述(Scan2Cap)以及 3D 视频目标检测(EmbodiedScan)三大任务上,GAP-MLLM 与当前 SOTA 纯 RGB 基准和部分显式 3D 输入模型展开了全面对比。
表 1:ScanRefer 与 Scan2Cap 任务对比结果
| 数据集 / 任务 | 模型 | 3D 输入 | 主指标 1 | 主指标 2 | 主指标 3 |
|---|---|---|---|---|---|
| ScanRefer (定位) | Video-3D LLM [59] | 是 (点云) | [email protected]: 58.1 | [email protected]: 51.7 | - |
| ScanRefer (定位) | SPAR [57] | 否 (RGB) | [email protected]: 31.9 | [email protected]: 12.4 | - |
| ScanRefer (定位) | VG-LLM-4B [58] | 否 (RGB) | [email protected]: 36.4 | [email protected]: 11.8 | - |
| ScanRefer (定位) | VG-LLM-4B (w/ GAP) | 否 (RGB) | [email protected]: 49.7 | [email protected]: 23.2 | - |
| ScanRefer (定位) | GAP-MLLM-3B (本文) | 否 (RGB) | [email protected]: 53.1 | [email protected]: 26.0 | - |
| Scan2Cap (描述) | Video-3D LLM [59] | 是 (点云) | [email protected]: 80.0 | [email protected]: 40.2 | [email protected]: 61.7 |
| Scan2Cap (描述) | VG-LLM-4B [58] | 否 (RGB) | [email protected]: 78.6 | [email protected]: 40.9 | [email protected]: 62.4 |
| Scan2Cap (描述) | VG-LLM (w/ GAP) | 否 (RGB) | [email protected]: 80.6 | [email protected]: 41.1 | [email protected]: 62.8 |
| Scan2Cap (描述) | GAP-MLLM-3B (本文) | 否 (RGB) | [email protected]: 84.7 | [email protected]: 42.1 | [email protected]: 63.1 |
表 2:EmbodiedScan 数据集 3D 视频目标检测结果(IoU 0.25)
| 模型 | 3D 输入 | 4帧设置 Precision | 4帧设置 Recall | 4帧设置 F1 | 6帧设置 Precision | 6帧设置 Recall | 6帧设置 F1 |
|---|---|---|---|---|---|---|---|
| SpatialLM [35] | 是 (显式3D) | 40.8 | 23.7 | 29.1 | 42.1 | 26.1 | 31.1 |
| VG-LLM-4B [58] | 否 (RGB) | 41.7 | 35.7 | 38.2 | 39.7 | 34.0 | 36.4 |
| VG-LLM-8B [58] | 否 (RGB) | 43.4 | 39.6 | 41.2 | 43.5 | 38.7 | 40.8 |
| VG-LLM-4B (w/ GAP) | 否 (RGB) | 47.0 | 41.2 | 43.5 | 48.8 | 40.2 | 43.6 |
| GAP-MLLM-3B (本文) | 否 (RGB) | 54.2 | 48.1 | 50.6 | 52.9 | 45.4 | 48.5 |
消融实验¶
表 3:核心模块消融实验(3D 视频目标检测 4帧设置)
| 模型配置 | 稀疏联合预训练 (A) | 多层门控融合 (B) | Precision (%) | Recall (%) | F1 (%) | 说明 |
|---|---|---|---|---|---|---|
| VG-LLM-4B 基线 | ✗ | ✗ | 41.7 | 35.7 | 38.2 | 传统单层融合直接微调 |
| VG-LLM-4B + A | ✓ | ✗ | 44.1 | 39.6 | 41.4 | 仅引入稀疏预训练 (F1 +3.2) |
| VG-LLM-4B + B | ✗ | ✓ | 43.3 | 36.9 | 39.4 | 仅引入多层门控 (F1 +1.2) |
| VG-LLM-4B + A + B | ✓ | ✓ | 47.0 | 41.2 | 43.5 | 两者组合 (F1 +5.3) |
| GAP-MLLM-3B 基线 | ✗ | ✗ | 48.8 | 42.1 | 44.7 | Qwen3-VL 基础架构 |
| GAP-MLLM-3B + A | ✓ | ✗ | 52.7 | 45.9 | 48.7 | 稀疏预训练显著涨点 (F1 +4.0) |
| GAP-MLLM-3B + B | ✗ | ✓ | 51.8 | 44.6 | 47.5 | 多层门控融合提升 (F1 +2.8) |
| GAP-MLLM-3B (Full) | ✓ | ✓ | 54.2 | 48.1 | 50.6 | 完整模型性能最优 (F1 +5.9) |
表 4:特征融合方式对比(GAP-MLLM-3B)
| 融合策略 | Precision (%) | Recall (%) | F1 (%) |
|---|---|---|---|
| 直接逐元素相加 (Add) | 51.7 | 45.3 | 47.9 |
| 静态加权相加 (Weighted) | 51.4 | 45.5 | 47.8 |
| 交叉注意力机制 (Cross-Attention) | 52.7 | 46.3 | 49.1 |
| 逐层门控自适应融合 (Gated, 本文) | 54.2 | 48.1 | 50.6 |
关键发现¶
- 稀疏预训练贡献最显著:在无几何编码器的纯 Qwen3-VL 上,仅加入稀疏联合预训练就能让 3D 检测 F1 从 39.7 跃升至 42.4(提升 2.7 个百分点);在引入 VGGT 几何编码器后,稀疏预训练使 GAP-MLLM-3B 的 F1 进一步提升 4.0 个百分点,证实几何激活是破局关键。
- 几何与语义联合监督具有协同互促效应:消融实验显示,如果预训练只预测 3D 坐标而去掉语义分类,ScanNet 公制度量评估误差从 0.0616m 劣化至 0.0630m,3D 检测 F1 从 41.4 跌至 40.1,证明语义上下文能够显著约束和稳定三维度量回归。
- 跨层权重分布符合认知直觉:门控参数可视化明确显示,模型在网络中间层将近 60%-70% 的权重倾斜给几何先验特征,而在接近输出的顶层则将重心重新交还给视觉语义表征。
亮点与洞察¶
- 极小样本激发出强大的空间感知泛化:预训练仅需在 500K 样本中每张图标注一个像素点的 3D 坐标与类别(实际像素监督量等价于 2 张普通图像),即可在视觉语言模型内部唤醒公制度量感,为低成本构建 3D 具身基础模型提供了极高性价比的范例。
- 通用可插拔性强:GAP 预训练范式不仅在 Qwen3-VL 上表现出众,直接移植到前代 VG-LLM-4B 上亦实现 ScanRefer [email protected] 从 36.4% 暴涨至 49.7%,证明该方法具备跨架构通用性。
- 两阶段解耦降低学习难度:将三维视觉定位拆解为「定位最优帧索引」加「局部绝对坐标回归」,有效规避了在非定常视角相机坐标系下多步长时序回归的累积误差。
局限与展望¶
- 依赖第一帧视角的参考系局限:模型要求所有三维边界框与坐标均基于第一帧相机参考系,当输入视频序列较长、相机存在剧烈大范围位移或累积漂移时,早期坐标系的几何一致性可能面临退化。
- 预训练语义边界粒度较粗:由于预训练仅采用稀疏点提示监督,预测得到的密集语义图在物体交界边缘处存在轻微平滑与模糊现象。
- 未来方向:探索与在线 SLAM 姿态图优化相结合的长序列空间感知,以及结合自回归点图补全实现更高分辨率的度量级场景理解。
相关工作与启发¶
- vs VG-LLM [58]: VG-LLM 仅利用几何编码器最后一层特征直接微调,在下游语言损失下几何特征被弱化;本文不仅设计了逐层门控与 DeepStack 融合,而且通过稀疏几何预训练显式激活了几何表征,检测 F1 实现近 10 个百分点的大幅反超。
- vs SpatialLM [35] & Video-3D LLM [59]: 后两者严重依赖昂贵且稠密的显式三维点云输入;GAP-MLLM 证明纯单目 RGB 视频借助前馈重建的隐式几何先验,在合理对齐预训练下即可达到甚至超越显式 3D 输入的精度与召回率。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ 提出稀疏点提示的几何-语义联合预训练任务,角度新颖,思路精简有效。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 3D 定位、密集描述、检测和度量重建全套评估,消融实验深入详尽。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密流畅,图表与动机分析清晰透彻。
- 价值: ⭐⭐⭐⭐⭐ 为单目纯视觉 MLLM 赋予高精度 3D 空间度量感知提供了实用且高效的基础范式。