OpenSpatial: A Principled Data Engine for Empowering Spatial Intelligence¶
会议: ECCV 2026
论文: ECCV 官方页
代码: https://github.com/VINHYU/OpenSpatial
领域: 多模态VLM
关键词: 空间智能、数据引擎、3D 有向框、视觉语言模型、数据合成
一句话总结¶
OpenSpatial 把「空间训练数据怎么造」做成一个开源、可复现的数据引擎:以世界坐标系的 3D 有向框(OBB)为统一基元,用「人工标注 + 自动化 3D lifting」两条路产出场景级 3D 框,再经投影/过滤/掩码精修转成对象–帧索引,最后由场景图程序化枚举生成单视图与多视图两类 QA,据此合成 300 万样本的 OpenSpatial-3M,让多个开源 VLM 在 BLINK/AllAngles/VSI/MMSI 等空间基准上平均提升 14.1%(最好一档 19%),同时基本不损伤通用多模态能力。
研究背景与动机¶
多模态大模型已经从图文对齐走到了指令跟随:模型能对一张图写出令人信服的描述,也能完成复杂的跨模态问答。但它们的空间能力明显落后于语义表达能力——说得出「桌上有个杯子」,却常常测不准相机到杯子的距离、维持不住两个视角之间的一致性、也建不起一张可用的空间认知地图。而这些能力恰恰是具身决策与机器人操作的前提。正因为如此,近两年出现了大量「空间化」的 VLM(引入 3D 编码器或深度/定位工具)以及一批专门的评测基准,指标确实在涨,但涨幅在任务之间、场景之间很不均匀——同一个方法在某些视角类任务上突飞猛进,换到度量类或场景级任务上几乎不动。这种不均匀本身就指向一个判断:瓶颈不只在模型架构,而在空间泛化的地基。
这个地基就是数据。当前以数据为中心的空间智能工作有两个系统性障碍。其一是多样性不足:现有的空间 VQA 语料大量集中在室内、固定视角与少数物体类别上,模型因此在基准上分数很高却缺少真实环境所需的通用性,作者称之为「空间近视(spatial myopia)」。其二是更致命的封闭性:主流工作的数据由不透明的私有流水线产生,对外只发布一份固定的、处理好的数据集(有时还是子集),生成引擎本身不公开。结果是社区既无法做受控消融去回答「到底是哪个数据设计在起作用」,也无法在自己的场景上一致地扩规模,更无法把数据生产当作一个可调试的系统来迭代——每条工作线都成了互不相通的孤岛。
本文的切入角度是把问题从「发布一个更大的数据集」换成「发布一套可复用的数据基础设施」。OpenSpatial 因此不是一个语料包,而是一台引擎:它把空间监督的每一环(几何表示、标注来源、质量过滤、任务合成)都显式暴露出来,既支持最高精度的人工标注,也支持把网络野生视频自动「升维」成 3D 监督,从而让规模、任务覆盖与数据质量三者都可以单独调节和归因。核心 idea:用世界坐标系下的 3D 有向框作为贯穿始终的几何基元,把 2D 视觉线索与 3D 度量属性对齐;在它之上,标注来源可插拔(人工或自动 lifting)、质量校验可开关(视锥与占位过滤)、任务覆盖可枚举(场景图驱动的双路 QA),从而把空间数据生产变成一个透明、可扩展、可做消融的系统。
方法详解¶
整体框架¶
OpenSpatial 要解决的是「空间监督从哪来、怎么保证干净、怎么覆盖足够广的任务」这一整条链路的问题,它的输入是多视图图像或视频关键帧(含位姿),输出是成对的图像-问题-答案样本。整条流水线是分级的:先得到场景级的 3D 有向框,再把场景级标注降到帧级变成可用的对象属性,最后在属性之上合成任务。引擎刻意让每一级都产出一种规范化的中间表示,这样上游换标注来源、下游换任务类型都不需要重写中间环节。
具体地,第一步产出所有可见物体的场景级 3D 有向框(OBB),有两条互补的路:追求精度的人工标注(沿用 EmbodiedScan 协议的物体级 3D 标注),以及追求规模的自动化 3D lifting——从关键帧出发做逐视图物体识别与实例掩码提取,在 3D 空间中关联合并实例并拟合凸包得到有向框。两条路的产物被统一成同一种规范格式:一张场景 mesh 加一组物体对齐的 3D 框。第二步把这些场景级框投影到每一帧,经过视锥剔除与基于深度占位的遮挡校验,再借掩码精修与语义标签,沉淀成一份跨帧一致的对象–帧索引(3D/2D 框、掩码、局部点云、标签、度量标志位)。第三步在这份索引上开出两条标注分支:单视图 QA 从每帧的场景图出发、配一张高亮被问物体的标记图来消除指代歧义;多视图 QA 则抽取共享同一批 3D 框的视角对,构建跨视图统一场景图后生成一致性类问题。最终产物是 OpenSpatial-3M:300 万样本、覆盖 5 大类能力(空间测量 SM、空间关系 SR、相机感知 CP、多视图一致性 MC、场景感知推理 SAR)、细分为 19 个子任务,并按由自我中心观测到稳定世界坐标理解的递进课程组织。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["多视图图像 / 视频关键帧"] --> B["3D 有向框为中心的统一表示<br/>世界坐标 OBB · 视点无关"]
B --> C["人工标注<br/>EmbodiedScan 协议"]
B --> D["自动化 3D lifting<br/>识别 → 掩码 → 3D 融合 → 凸包"]
C --> E["属性化对象–帧索引<br/>投影 → 视锥/占位过滤 → 掩码精修"]
D --> E
E --> F["场景图驱动的双路 QA 合成<br/>单视图锚点 + 多视图配对"]
F --> G["OpenSpatial-3M<br/>3M 样本 · 5 大类 · 19 子任务"]
除了这条主链路,引擎还做了一层正交的吞吐工程:绝大多数组件并行执行;相邻阶段之间用消息队列做异步流水,使当前阶段在推理一批数据时上一阶段已在处理下一批;对共享中间特征的任务(例如同一帧被多个任务复用)建立自动复用机制避免重复计算。论文报告这些优化带来了数倍到十余倍不等的加速(Fig. 6 中标注为 ×3.1 / ×2.7 / ×1.5 / ×12,⚠️ 正文未逐一说明每个倍数对应的具体组件,以原文为准)。
关键设计¶
1. 以 3D 有向框为中心的统一表示:给每个物体一个视点无关的世界坐标锚点
空间理解需要一个稳定的 3D 场景状态——物体在视角变化与遮挡下仍保持同一份位置、尺寸、朝向与相互关系。仅用 2D 标签做不到这一点:同一物体在不同帧里的投影框形状、大小、位置全都在变,跨帧关联只能靠外观匹配猜。稠密 3D 重建(mesh、体素)虽然几何精确,但采集与标注成本高、格式重,很难扩展到野外来源。OpenSpatial 选有向框(OBB)作为中间层:每个物体参数化为 \((x, y, z, x_l, y_l, z_l, r, p, y)\),即世界坐标下的中心、沿三轴的边长,以及 Roll/Pitch/Yaw 三个姿态角,全部定义在全局世界坐标系并采用 Z 轴朝上的约定。
这个选择的价值不在精度而在于它刚好编码了空间推理所需的最小 3D 结构:深度、尺度、朝向都在,足以支撑度量关系、拓扑关系与方向关系;同时它紧凑、易批量处理、标注成本远低于稠密重建。更关键的是它视点无关——同一个物体跨帧只有唯一一个 3D 锚点,于是「哪些物体在两帧里是同一个」这个问题变成纯粹的几何计算,而不是外观匹配;一致投影、遮挡过滤、框条件下的掩码精修也都因此可以对得上。消融很直接:在同样 200k ScanNet 数据上把表示换成以点云为中心,BLINK 从 60.3 掉到 57.2、CV-3D 从 89.9 掉到 83.7——点云只覆盖物体的可见部分,缺失的背面让测量类问答从根上就生成不准。
2. 自动化 3D lifting:把野生视频升维成可用的 3D 框,把数据来源从室内扩展到野外
人工 3D 标注精度高但耗时且难以规模化,而且它依赖已标注的室内数据集(EmbodiedScan 汇集的 ScanNet、Matterport3D、ARKitScenes 等),场景数天然有上限、环境也高度偏向室内——这正是「空间近视」在数据源一侧的根源。为了突破这个上限,论文给引擎加了第二条标注路:从视频关键帧或多视图图像出发,先用 Gemini 做逐视图的物体识别,用 SAM 提取实例掩码;再在 3D 空间中对跨视图实例做关联与合并;最后对合并后的点集拟合凸包,得到有向框。整个过程不需要任何人工 3D 标注,因此可以吃到未经整理的网络户外视频。论文在 ScanNet 的 30 个随机场景上以 EmbodiedScan 标注为参照做了量化验证:过滤前精确率 76.3%、召回率 67.9%;过滤后精确率 80.2%、召回率 67.5%——精确率上升而召回率基本不动(略降 0.4),说明过滤器主要拦掉的是错误框。作者明确表示这里刻意优先保精确率而非召回率,因为下游 VLM 训练里一个错框会直接教会模型错误的几何关系,比漏掉一个物体危险得多。
这条路的意义不是「多一个数据来源」,而是让规模与多样性脱钩于人工预算。论文单独验证了它:只用 200k 由 lifting 产生的数据训练 Qwen2.5-VL,BLINK 从 55.3 涨到 62.2、3DSR 从 49.0 到 54.3、CV-3D 从 73.8 到 87.9、RealWorldQA 从 68.1 到 71.8,四项全部上涨且幅度不小——说明自动化升维出来的框虽然不如人工精确,但作为训练监督已经足够有效。
3. 属性化对象–帧索引:投影 + 双重过滤 + 掩码精修,把场景级框变成可信的帧级监督
拿到场景级 3D 框并不等于拿到可用的训练数据,因为监督最终要落在「某一张图 + 一句话」上。如果只是把 3D 框粗暴投影到每一帧,会出现两类脏样本:物体根本不在相机视锥内,以及物体投影进了画面但被前景严重遮挡、只剩下一个角。后者尤其致命——模型被要求根据这一帧回答该物体的尺寸或距离,而这一帧里根本看不到它,模型只能学会编造。OpenSpatial 因此做了两道过滤后再加上一步精修。第一道是视锥剔除;第二道是基于深度的占位校验:把投影出的 2D 框内的像素用深度图和相机内外参反投影回世界坐标,形成一个局部点云,然后计算这些点落在该 3D 框内部的体积占位率,占位率低于阈值的框被丢弃。这一步把「投影上在框内」和「在 3D 里真的属于这个框」区分开来,是遮挡与截断的判别器。
通过过滤的框还用同一条点云像素路径继续产出监督信号:点云像素先给出粗掩码,再交给 SAM 精修成紧贴物体外观的 2D 实例掩码。这一步不只是为了好看的掩码,更让引擎对语义重复的自动标注有了鲁棒性——当 lifting 因关联失败而产出两个语义相近的重复物体时,掩码可以作为可靠的实例指示符,把原本模糊的指代变成确定的像素证据,掩码还可以进一步转成框或关键点作为空间提示。最后,所有属性(掩码、2D/3D 框、局部点云、物体标签)被汇总成一份跨帧的结构化索引,并给每个物体打一个度量标志位:标记该框是否对应真实世界尺度;一旦为假,所有测量类问答一律跳过,宁缺毋滥。这道过滤的价值在消融里非常突出:同样是 3D 框中心表示,去掉过滤后 BLINK 从 60.3 跌到 56.6、VSI 从 41.7 跌到 32.1、CV-3D 从 89.9 跌到 78.2,三个指标甚至低于直接用点云中心的版本——也就是说「框中心表示」的好处有一大半是过滤挣来的,两者是一个不可拆的组合。
4. 场景图驱动的双路 QA 合成:单视图给显式锚点,多视图靠共享 3D 框配对
有了干净的索引,剩下的是任务覆盖问题。如果只围绕单一的「看图回答位置」合成数据,模型就会变成作者所说的「空间近视」——在单一分布的基准上高分,换场景则失效。OpenSpatial 的做法是用场景图程序化枚举物体、属性与物体间关系,把问题空间铺开到测量、关系、相机/视角变化、多视图一致性与场景级推理上,并且开成两条在监督形式上不同的分支。单视图分支在每一帧上构建结构化场景图,并渲染一张带视觉标记的图,把被问到的物体高亮为显式锚点。这一步针对的是指代歧义:场景里常常有多个语义相近的实例(两三把同样的椅子),纯文本描述无法唯一定位,模型答错其实不是空间能力问题而是没搞清问的是哪一个;标记图把「问的是它」变成像素级事实。在此之上生成物体–物体、物体–环境的关系查询(左右、前后、遮挡关系)、属性比较(大小、相对深度)以及依赖当前视角的上下文推理。
多视图分支的目标是跨视角空间推理,难点在配对:视角对必须有足够的重叠,才能让人(和模型)通过共同可见的物体建立对应关系;但如果两个视角几乎重合,又失去了视角变化带来的推理意义。这里 3D 框再次成为解法——因为框锚定在世界坐标系,它们是天然的视点无关引用,于是「两帧里哪些是同一个物体」可以直接由几何决定。引擎据此只采样共享一部分 3D 框的视角对,同时满足上下文重叠与视角多样性两个条件。对每个视角对构建统一的多视图场景图、把跨视角实例合并之后,生成的问题包括视角变化下的重识别、相机变化推理,以及在允许时的一致性/测量校验。这类监督强迫模型维持一份跨视角持续存在的 3D 表示,而不是把每张图当作独立场景来处理——这也是它能把 BLINK、AllAngles、MMSI 这类多图/多视角基准拉开 10 分以上差距的主要原因。
损失函数 / 训练策略¶
引擎本身不含新的训练目标,全部实验采用标准的监督微调(SFT)。协议对齐 VST:训练 1 个 epoch,单次使用 32 张 NVIDIA GPU、全局 batch size 128,优化器 AdamW,基础学习率 \(5\times10^{-5}\),并对视觉编码器采用更小的解耦学习率 \(5\times10^{-6}\)。数据配比上,为在提升空间智能的同时保住通用多模态能力,采用 1:1 的混合策略:一半来自 LLaVA-OneVision 的通用多模态数据,一半来自 OpenSpatial-3M;主实验中还额外混入 SenseNova-800K 以补足语料未充分覆盖的空间推理维度。
实验关键数据¶
主实验¶
在统一的评测代码库与各模型原生系统提示下比较,空间侧采用 8 个基准(BLINK、AllAngles、ERQA、VSI、3DSR、MMSI、CVBench-3D、RealWorldQA),并以 3D-Avg 作为空间侧总平均。所有 OpenSpatial 模型相对各自同参数基线全面提升:
| 基座模型 | 3D-Avg | BLINK | AllAngles | VSI | 3DSR | MMSI | CV-3D |
|---|---|---|---|---|---|---|---|
| InternVL2.5-8B | 51.6 | 54.9 | 48.9 | 39.3 | 51.0 | 28.6 | 79.9 |
| + OpenSpatial 数据 | 59.3 (+7.7) | 63.5 (+8.6) | 58.3 (+9.4) | 56.7 (+17.6) | 52.0 (+1.0) | 38.7 (+10.1) | 93.8 (+13.9) |
| InternVL3-8B | 53.2 | 55.7 | 50.5 | 38.7 | 52.7 | 30.9 | 86.0 |
| + OpenSpatial 数据 | 59.8 (+6.6) | 66.0 (+10.3) | 58.3 (+7.8) | 57.4 (+18.7) | 53.5 (+0.8) | 38.6 (+7.7) | 93.7 (+7.7) |
| Qwen2.5-VL-7B | 50.0 | 55.3 | 50.1 | 36.0 | 49.0 | 26.5 | 73.8 |
| + OpenSpatial 数据 | 59.5 (+9.5) | 65.9 (+10.6) | 58.4 (+8.3) | 56.7 (+20.7) | 53.2 (+4.2) | 39.6 (+13.1) | 92.5 (+18.4) |
| Qwen3-VL-8B | 56.7 | 66.1 | 49.5 | 55.6 | 52.8 | 28.1 | 90.8 |
| + OpenSpatial 数据 | 62.1 (+5.4) | 68.2 (+2.1) | 59.8 (+10.3) | 61.6 (+6.0) | 56.2 (+3.4) | 41.9 (+13.8) | 94.0 (+3.2) |
| VST-7B-SFT(先前空间模型) | 57.9 | 62.1 | 49.5 | 55.3 | 53.3 | 33.3 | 94.8 |
| Gemini-2.5-Pro(闭源参考) | 62.4 | 70.6 | 61.3 | 48.4 | 57.6 | 36.9 | 91.3 |
另外与开源空间数据集的等规模对比(统一在 Qwen2.5-VL 上按同一协议训练,均取约 500k–800k 规模):
| 数据源 | 规模 | 平均偏差 MAD | 标准差 | BLINK | AllAngles | MMSI | CV-3D |
|---|---|---|---|---|---|---|---|
| Cambrian-S | 590k | −6.0 | 5.4 | 54.1 (−10.1) | 48.6 (−5.3) | 29.2 (−7.1) | 75.3 (−17.9) |
| SenseNova-SI | 800k | −6.5 | 7.0 | 59.7 (−4.5) | 47.5 (−6.4) | 36.3 | 69.0 (−24.2) |
| VST | 500k | −2.8 | 3.9 | 61.4 (−2.8) | 50.7 (−3.2) | 32.4 (−3.9) | 93.2 |
| OpenSpatial(子集) | 500k | −2.5 | 4.4 | 64.2 | 53.9 | 34.7 (−1.6) | 91.8 (−1.4) |
表中「−」为该数据源与同列最好结果的差距。MAD 越接近 0、标准差越小,说明该数据在各类基准上表现得越均衡。OpenSpatial 子集与 VST 都属「均衡型」(MAD −2.5 / −2.8),而 Cambrian-S 与 SenseNova-SI 波动明显更大(MAD −6.0 / −6.5),只在 VSI、MMSI 等特定基准上突出——论文据此判断两类数据互补,因此在主实验中把 SenseNova-800K 也混进训练。
消融实验¶
| 配置 | BLINK | AllAngles | VSI | CV-3D | 说明 |
|---|---|---|---|---|---|
| Qwen2.5-VL-7B(无空间数据) | 55.3 | 50.1 | 36.0 | 73.8 | 基座 |
| + 点云中心表示 | 57.2 | 49.7 | 37.2 | 83.7 | 换成点云基元,AllAngles 反而低于基座 |
| + 3D 框中心表示 | 60.3 | 53.2 | 41.7 | 89.9 | 完整设计 |
| + 3D 框中心(去掉过滤) | 56.6 | 47.0 | 32.1 | 78.2 | 无占位/视锥过滤,多数指标低于点云版本 |
以上均在 ScanNet 来源、每份约 200k 样本下复现。3D lifting 的质量与数据有效性单独验证如下:
| 配置 | 指标 | 数值 | 说明 |
|---|---|---|---|
| lifting 过滤前 | 精确率 / 召回率 | 76.3% / 67.9% | ScanNet 30 个随机场景,对照 EmbodiedScan |
| lifting 过滤后 | 精确率 / 召回率 | 80.2% / 67.5% | 精确率 +3.9,召回率 −0.4,刻意优先精确率 |
| 不加 lifting 数据(200k) | BLINK / AllAngles / ERQA / VSI | 64.3 / 56.2 / 41.8 / 55.2 | 仅用人工标注来源 |
| 加入 lifting 数据(200k) | BLINK / AllAngles / ERQA / VSI | 65.9 / 58.4 / 41.8 / 56.7 | ERQA 持平,其余三项上升 |
规模维度的消融(数据量、模型量、数据源):
| 维度 | 配置 | 3D-Avg | 关键列 |
|---|---|---|---|
| 数据规模 | 20% → 40% → 60% → 80% → 100% | 57.6 → 58.5 → 58.6 → 59.2 → 59.7 | BLINK 64.9→65.9;MMSI 34.7→39.6;VSI 51.8→56.7 |
| 模型规模 | Qwen2.5-VL 3B / 7B / 32B | 56.1 / 59.7 / 61.3 | BLINK 61.0 / 65.9 / 68.2;AllAngles 53.0 / 58.4 / 63.3 |
| 数据源扩展 | 200k 基线 → 仅加 3D lifting 数据 | — | BLINK 55.3→62.2;3DSR 49.0→54.3;CV-3D 73.8→87.9;RealWorldQA 68.1→71.8 |
关键发现¶
- 表示方式与过滤是一体的,不能拆开看。 单独换成 3D 框中心能把 CV-3D 从 73.8 推到 89.9,但把同一个表示上的占位过滤拿掉,CV-3D 立刻掉回 78.2,BLINK 甚至跌到 56.6(低于点云版本的 57.2)。论文给出的定性解释是:被遮挡物体的框投影到帧上仍「看起来在画面里」,不过滤就会让模型学会对着看不见的物体编造几何——这是整篇论文里最有说服力的一次消融。
- 3D lifting 是有效的独立数据源,而非人工标注的廉价替代。 在完全相同的 200k 预算下,把 lifting 数据加进来就能让 BLINK +1.6、AllAngles +2.2、VSI +1.5;如果只用 lifting 数据从零训练,四项指标相对基线全线上涨(CV-3D 甚至 +14.1)。这说明瓶颈在「场景与视角的覆盖」而非标注的绝对精度。
- 空间基准的提升与数据规模正相关但边际递减。 3D-Avg 随数据量从 20% 到 100% 单调上升(57.6→59.7),但单个基准并不严格单调(例如 ERQA 在 40% 时最高 42.1,Full 时反而 41.8;RealWorldQA 在 40% 时 71.1、Full 时 68.3)。作者据此给出一个偏悲观的判断:继续提升空间智能需要指数级更大的数据。模型规模的趋势则干净得多,3B→7B→32B 在几乎所有列上单调上升,说明更大的容量能把引擎供给的监督更充分地内化。
- 任务之间是互补而非冗余的。 逐任务热力图显示不同任务在不同基准上有各自的收益足迹:空间测量(SM)类任务主要抬升度量型评测,相机感知(CP)类任务主要增强对外参与本征运动的解读、在需要精确视角意识的多视图基准上收益最大。逐步叠加任务的实验里,整体平均曲线稳定上升(偶尔因数据分布偏移或多任务梯度冲突出现局部平台甚至小回落),说明任务多样性确实在缓解单任务学习的局限。
- 通用能力基本保住,但并非无损。 MMB 与 MMMU 大体维持,MMStar 出现掉点(InternVL3-8B −3.9、InternVL2.5-8B −0.8),说明 1:1 混合策略缓解而非消除了空间数据带来的分布偏移。
- 基座兼容性有差异,场景覆盖仍是短板。 Qwen3-VL-8B 与这套数据的配合最好(3D-Avg 62.1,已接近 Gemini-2.5-Pro 的 62.4),论文归因于其 SigLIP 视觉编码器带来的更强视觉感知。但在桌面级和户外场景上提升明显偏小,作者承认这是当前数据分布偏向室内所致。
亮点与洞察¶
- 把「数据质量」做成了可开关、可归因的旋钮,而不是一句宣传语。 论文最有价值的不是 3M 这个数字,而是它证明了「拿掉占位过滤会掉多少分」这种问题可以被回答——因为整条流水线的每一环都是显式的、可替换的。这种「数据集即基础设施」的形态对任何数据驱动的领域都可迁移:把标注来源、质量校验、任务合成拆成可独立消融的模块,而不是打包成一个语料。
- 用「共享 3D 框」来定义多视图视角对,把配对问题变成几何问题。 视角对选择本是个容易写得很含糊的经验规则(重叠多少算够?),这里因为所有物体都有世界坐标锚点,可以直接形式化为「共享至少一批 3D 框」,同时满足重叠与多样性。这个思路可以迁移到任何需要构造成对跨视角监督的任务(ego-exo 视频、多相机驾驶数据)。
- 刻意用精确率换召回率。 过滤后精确率 80.2% 而召回率几乎不动,说明滤掉的主要是错框;对于「一个错框会教会模型一个错误几何关系」的下游训练任务,这个取舍方向是对的,而且论文把它明确写出来并给了验证,而不是默默调参。
- 度量标志位(metric flag)这种小设计值得注意。 让每个物体自带一个「这个框是否为真实尺度」的布尔标记,为假就跳过所有测量类问答——用一个极小的机制防止了一整类系统性噪声监督。类似做法可以迁移到深度估计、尺寸回归等任何依赖绝对尺度的合成数据管线。
- 把「空间近视」这个失效模式命名清楚了。 论文反复强调的失败不是模型不会答题,而是高分但不可迁移。这提示评测空间能力时应当同时看均衡性(论文用 MAD 与标准差量化),而不是只看单个基准的最高分。
局限与展望¶
- 作者承认的局限有三处:桌面级与户外场景的提升明显偏小,原因是当前数据分布仍偏向室内;数据规模继续扩大需要指数级投入,边际收益递减;3D lifting 的精确率虽经过滤提升到 80.2%,但仍有约两成噪声框进入训练。
- 值得注意的设计取舍:论文把「人工标注」与「自动 lifting」当成两条并行路线而不是级联路线,因此 lifting 的错误无法被人工标注校正;同时
metric flag这类质量信号只在测量类任务上生效,关系类与推理类任务仍然会吃到错误框带来的错误空间关系。 - 多视图分支的视角对选择依赖「共享 3D 框」这一充分条件,对于视图重叠很少但确实存在的对应关系(例如大视角变化下的同一物体)会直接放弃,这可能是 AllAngles 类基准上仍有提升空间的原因之一。
- 实验上,主结果的对照基线是各模型的原版权重,没有与「同等规模的通用数据继续训练」这一强基线对比,因此「空间增益来自数据内容而非仅仅来自额外训练量」这一点还留有疑问;SenseNova-800K 的混入也让主结果的归因变得不够干净(子集对比在 Tab. 2 中做了剥离,但主表没有)。
- 可改进方向:把 lifting 与人工标注做成「自动产出候选 → 人工/校验模型修错」的级联,用人工预算换掉那 20% 的噪声;把度量标志位扩展成连续置信度并对关系类任务也做加权;针对桌面/户外场景定向采集或合成以补上分布短板。
相关工作与启发¶
- vs VST: VST 同样从 EmbodiedScan 出发做空间数据,本文的训练协议也沿用 VST,但 VST 发布的是固定数据集,本文发布的是可插拔引擎,并额外补了相机感知、多视图一致性、场景感知推理三类任务;等规模(500k)对比下两者均衡性接近(MAD −2.5 vs −2.8),OpenSpatial 在 BLINK、AllAngles 上更高(64.2 / 53.9 vs 61.4 / 50.7),VST 在 CV-3D 更强(93.2 vs 91.8)。
- vs SenseNova-SI: SenseNova-SI 走的是更大规模(800k)的封闭数据集路线,在 VSI、MMSI 等特定基准上很强(VSI 58.8),但跨基准均衡性差(MAD −6.5、标准差 7.0)。本文没有选择正面对抗,而是判断两类数据互补,把 SenseNova-800K 混进训练——这既是务实的选择,也说明「开放引擎」与「强单点数据」并非替代关系。
- vs SpatialVLM / SpatialRGPT: 这两者是「合成大规模空间 VQA」的开创工作,但监督主要建立在 2D 检测框与深度估计之上,缺少世界坐标下的物体级 3D 结构;本文的 OBB 基元让跨帧关联与遮挡过滤成为几何计算,这是它们在多视图一致性任务上难以做到的。
- vs Spatial-MLLM / VLM-3R / 3DThinker: 这些工作靠外接 3D 编码器或重建模块把几何先验塞进模型,属于架构侧改造;本文走的是纯数据侧路线,在通用 VLM 上仅靠 SFT 就拿到 3D-Avg 59–62 的提升,说明相当一部分「空间缺陷」可以被数据补上而不是必须改架构——这两条路线的收益是否可以叠加,是一个目前还没有答案的问题。
- vs Cambrian-S: 同样关注空间监督,但 Cambrian-S 的数据分布更偏,在 VSI 上很强(57.0)而在 CV-3D 上明显弱(75.3),与本文的均衡取向形成对照。
评分¶
- 新颖性: ⭐⭐⭐⭐ 3D 有向框作为数据引擎基元、以及用共享 3D 框定义多视图视角对,是有辨识度的设计;「发布引擎而非数据集」的定位也切中要害,但具体组件(SAM 掩码、场景图枚举 QA)多为已有技术的系统性组合。
- 实验充分度: ⭐⭐⭐⭐⭐ 8 个空间基准 + 3 个通用基准、4 个基座模型、表示/过滤/lifting/数据量/模型量/数据源/任务多样性七类消融,还给出了 MAD 与标准差的均衡性分析,数据引擎类论文里相当扎实。
- 写作质量: ⭐⭐⭐⭐ 设计原则讲得清楚、动机与消融对得上;扣分在于部分表格编号与正文引用不一致(正文称 Tab. 6 处实为 Tab. 7)、Fig. 6 的效率倍数未标注对应组件,个别基线名有拼写错误(如 Tab. 2 的 "Cambrain-S")。
- 价值: ⭐⭐⭐⭐⭐ 开源引擎 + 3M 数据集 + HuggingFace 发布,直接降低了社区生产空间监督的门槛,且其模块化让「哪种数据设计有效」变成可复现的问题,对具身智能与机器人方向的后续工作有基础设施级价值。