MV-STRIDE: Enabling MLLMs to Master Multi-View Spatial Reasoning via Hierarchical Capability Modeling¶
会议: ECCV 2026
论文: ECCV 2026 Oral/Poster
代码: https://co1dspring.github.io/MV-STRIDE/
领域: 多模态VLM / 3D视觉
关键词: 多视角空间推理, 多模态大模型, 分层能力建模, 思维链蒸馏, 强化学习
一句话总结¶
针对现有多模态大模型在多视角下缺乏连贯3D空间认知的问题,MV-STRIDE提出分层能力建模框架与跨视角依赖约束机制,结合“感知-建模-推理”问题群构建与SFT-冷启动-RL三阶段训练,使8B开源模型在多视角基准MMSI-Bench上取得38.9%的SOTA表现。
研究背景与动机¶
近年来,多模态大语言模型(MLLMs)在2D视觉理解及单视角基础感知任务中取得了显著进展,但在具身智能与自动驾驶所需的多视角空间推理场景下依然面临严峻瓶颈。在MMSI-Bench、ViewSpatial-Bench等评测中,开源乃至前沿闭源模型与人类之间存在巨大差距。人类能够自然地将不同视点观测到的局部物体与结构映射并融合成内在的3D认知地图,从而自如地执行视点变换与任意空间关系判定;而现有多模态模型在跨视角物体匹配、多视角几何一致性维持以及视点依赖推理上极易失效,其失败的核心根源多在于场景级重构和跨视角对应能力的缺失,而非孤立的单图物体识别错误。
造成该瓶颈的关键症结在于现有空间推理数据集的数据架构缺陷。主流空间数据集主要聚焦单视角2D平面,无法支撑3D几何认知地图的建立;近期虽有部分工作引入多视角数据,但大多局限于深度估计、位姿回归等低级定量感知任务,未能引导模型掌握结构化的高级空间推理。更严重的是,现有数据集普遍采用扁平化的任务组织方式,忽视了空间感知、场景理解与逻辑推理之间的层级递进关系,导致任务可被单视角表面纹理等捷径利用,模型缺乏从基础几何感知向复杂多步空间推理过渡的清晰认知路径。
本文的切入角度是:模拟人类空间认知的递进规律,将多视角空间推理显式解构为具有强依赖关系的层级认知系统,并通过几何约束杜绝单视角退化解。核心 idea:提出基于“单视角空间感知(Level I)→ 跨视角3D一致场景理解(Level II)→ 多视角高级语境推理(Level III)”的分层能力建模框架,构建带有跨视角强制依赖约束的数据集 MV-STRIDE,并通过认知问题群聚合与 SFT-CoT冷启动-GRPO强化学习三阶段渐进训练,诱导模型内生出严谨可解释的3D认知与计算能力。
方法详解¶
整体框架¶
MV-STRIDE通过显式建模空间能力依赖关系,解决多视角多步几何推理难题。整个系统包含数据生成与递进训练两个核心阶段:在数据构建侧,依托 Infinigen 过程化合成场景与 ScanNet++ 真实室内三维重建,采用自顶向下的分解策略,先生成受单视角不可解约束的 Level III 复杂语境推理问题,再逆向拆解出作为认知前提的 Level I 与 Level II 子问题,汇聚成空间认知过程问题群(Question Groups)并合成高质量 CoT 监督;在模型训练侧,基于 Qwen3-VL-8B-Instruct 实施“基础多任务SFT → CoT冷启动微调 → GRPO多视角强化学习”三阶段渐进对齐。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}, 'subGraphTitleMargin': {'top': 8, 'bottom': 16}}}%%
flowchart TD
A["多源3D场景输入<br/>Infinigen合成引擎 + ScanNet++真实重建"] --> B["分层能力与认知问题群生成<br/>Level I感知 / Level II建模 / Level III推理"]
B --> C["跨视角强制依赖约束过滤<br/>视角重叠筛选 + 消除单视角捷径"]
C --> D["认知引导的思维链合成<br/>子问题前置条件驱动 + LLM语言整合"]
D --> E["渐进式三阶段训练策略<br/>Stage 1 SFT → Stage 2 冷启动 → Stage 3 GRPO"]
E --> F["输出:具备内部3D一致性的推理结果<br/>精确相机位姿估计 + 跨视角空间关系判断"]
关键设计¶
1. 分层能力与认知问题群生成:构建认知闭环与能力解耦机制
针对传统多视角任务组织扁平、跳跃性大的问题,本文依据人类空间认知的由浅入深过程,将空间推理能力严格解构为三层递进体系:Level I 关注以自身为中心(egocentric)的单视角几何感知,包含物体2D/3D包围框定位、相机俯仰角、绝对深度、相机-物体偏航角等度量感知,防止错误几何信息向下游传播;Level II 聚焦双视角间的3D一致性建模,涵盖跨视角物体对应匹配与相机6-DoF相对位姿估计(平移量与旋转角),促使模型形成全局场景表征;Level III 则是最高阶的语境推理,包含跨视角物体计数、尺寸度量对比、物体朝向判定以及跨坐标系的空间方位推断(如物体-物体、相机-物体、相机-区域)。在构建时,算法以 Level III 为顶点,自顶向下反向推导出完成该任务所必需的 Level I 和 Level II 前提能力,并将同场景同视角集合下的三层任务绑定为一个“空间认知过程问题群”。这一设计确保高阶推理严格建立在可验证的感知与几何基底之上。
2. 跨视角强制依赖约束过滤:消除单视角伪解与局部捷径
针对多视角推理数据极易被单视角先验信息走捷径(shortcut)破解的隐患,本文在视点与物体对筛选中设计了严格的几何依赖约束规则。首先设定视点间距与重叠度阈值,剔除视角变换过大(无共同参照物)或过小(退化为微变单视角)的视角对,要求视点间保留充足的重叠锚点物体。其次,对 Level III 的所有问题施加确定性单视角不可解约束:被查询的两个关键空间实体绝不同时出现在任一单个视点中,或者强制要求以视点 A 的相机坐标系去推断仅在视点 B 中可见物体的绝对朝向与位置关系。实证验证显示,在 1K 条抽样的 Level III 问题上,先进模型 Gemini-3-Flash 仅凭借单视角输入的准确率骤降至 31.5%,而输入完整多视角时提升至 41.2%,证明该约束有效封堵了单视角捷径,倒逼模型必须跨视角融合几何拓扑。
3. 认知引导的思维链合成:端到端逆向逻辑蒸馏
传统的 CoT 标注往往依赖人工标注或由 LLM 自行发散生成,极易产生几何幻觉和事实脱节。MV-STRIDE 充分利用问题群中内生的问题依赖图谱,将 Level III 任务所对应的 Level I 目标定位、角度估计与 Level II 的相机平移/旋转真实真值按逻辑拓扑排序,形成确凿的中间状态链条。随后,利用前沿大语言模型充当语言整合器,严格将这些带有精准 3D 几何真值的中间感知结果无缝串联为“第一阶段:单视角局部感知 → 第二阶段:跨视角3D空间建模与位姿推导 → 第三阶段:多视角语境推理”的三段式结构化思维链。该自动化管线兼具可扩展性与可解释性,抽样质检显示 QA 准确率达 88.0%,CoT 逻辑准确率高达 97.5%。
4. 渐进式三阶段训练策略:从模仿学习到内生3D一致性探索
为了让模型平稳掌握复杂多视角推理,训练划分为递进的三大阶段:Stage 1 为基础空间多任务 SFT,使用 60% 场景中提炼的 313.8K 混合级别 QA 数据与开源通用空间数据,以短答形式为 Qwen3-VL-8B-Instruct 注入基础几何与空间常识;Stage 2 为 CoT 冷启动微调,选取 20% ScanNet++ 场景构建的 19.0K 高质量思维链数据,以较低学习率训练模型掌握显式 3D 思维链推理范式;Stage 3 为多视角强化学习,基于群组相对策略优化(GRPO),在 24.8K 经过经验正确率初筛的中等难度高阶样本上开展强化探索(每个 prompt 采样 8 个 rollout)。通过这一阶段,模型克服了单纯 SFT 的模板机械模仿,学会在内心自发建立虚拟 3D 坐标并主动解算相机旋转平移,实现了主动的空间逻辑一致性自洽。
实验关键数据¶
主实验¶
在四大多视角与 3D 空间推理基准(MMSI-Bench、ViewSpatial-Bench、3DSR-Bench、CV-Bench)上,MV-STRIDE 显著超越同量级基线,并在多个关键评测集上击败甚至逼近超大体量闭源模型:
| 模型 | 参数量 | MMSI-Bench (Avg) | ViewSpatial-Bench (Avg) | 3DSR-Bench (Avg) | CV-Bench (Avg) |
|---|---|---|---|---|---|
| GPT-5 [34] | 闭源专有 | 41.90% | - | 66.70% | - |
| GPT-4o [18] | 闭源专有 | 32.10% | 34.98% | 60.30% | 78.90% |
| Gemini2.5-Pro [9] | 闭源专有 | 37.60% | - | 64.30% | - |
| InternVL3-78B [50] | 78B | 28.90% | - | 61.30% | - |
| Qwen2-VL-72B-Instruct [37] | 72B | 31.50% | - | 57.50% | - |
| InternVL3-38B [50] | 38B | 29.00% | - | 59.10% | - |
| Qwen2.5-VL-7B-Instruct [4] | 7B | 26.80% | 36.85% | 53.20% | 73.00% |
| Base Model (Qwen3-VL-8B) [3] | 8B | 29.20% | 40.51% | 59.98% | 84.31% |
| MV-STRIDE-SFT (Stage 1) | 8B | 37.20% | 50.28% | 65.52% | 86.39% |
| MV-STRIDE-RL (Stage 3) | 8B | 37.50% | 49.30% | 59.43% | 85.94% |
| MV-STRIDE-SFT (Full) | 8B | 38.90% | 48.35% | 64.51% | 86.73% |
在最具代表性的多视角基准 MMSI-Bench 上,MV-STRIDE-SFT (Full) 达到 38.90%,较原始基线飙升 9.7 个百分点,全面超越 78B 参数量的 InternVL3 以及 GPT-4o(32.10%)。在细分维度上,如相机运动估计(Motion-Camera)达到 45.95%(超过 GPT-5 的 32.40%),相机-物体相对空间关系(PR C-O)达到 66.28%(远超 GPT-5 的 48.80%)。同时在 ViewSpatial-Bench 上取得全场最高的 50.28%,展现了强悍的多视角几何鲁棒性。
消融实验¶
为明确合成数据与真实数据源的互补性,论文在 MMSI-Bench 上对 Level III 训练数据源进行了严格等量控制实验:
| 数据源配置 | Infinigen 样本量 | ScanNet++ 样本量 | MMSI-Bench (Acc) | 说明 |
|---|---|---|---|---|
| Base Model | - | - | 29.20% | 未在 MV-STRIDE 上微调的初始基线 |
| Synthetic Only (仅合成) | 99.3k | - | 36.70% | 纯过程化生成,几何绝对精确但具域差异 |
| Real-world Only (仅真实) | - | 99.5k | 37.50% | 真实重建场景,纹理真实但受限采集分布 |
| Hybrid (半合成半真实混合) | 49.7k | 49.8k | 38.00% | 保持样本总量约 100k,性能优于任一单一来源 |
| Unified (全量合成+真实联合) | 99.3k | 99.5k | 39.40% | 两者互补协同,达到最佳表现 |
关键发现¶
- 数据源协同增益机制:合成数据(Infinigen)具备零噪声的几何位姿与三维边界标注,帮助模型建立绝对精确的几何概念;真实场景(ScanNet++)提供了贴近现实的复杂纹理与不规则杂乱度。两者等量混合(Hybrid)比纯合成高 1.3%,全量联合微调则带来超过 10% 的相对基线提升。
- 训练阶段消融与“推理成本(Reasoning Tax)”:消融显示若跳过 Stage 1 直接训练,模型在高阶空间任务中因缺乏几何底座而无法收敛;跳过 Stage 2 冷启动直接 RL 则会导致思维链逻辑混乱崩溃。同时,从 Stage 1 短答直接输出转向 Stage 2/3 的长思维链生成时,由于生成分布迁移,模型在个别直接匹配基准上出现轻微精度波动(Reasoning Tax),但在质性评测中,Stage 3 模型展现出显式的三维空间解算能力(如自主输出“向左平移0.85米、偏航旋转30.5度”),真正具备了物理世界一致性。
亮点与洞察¶
- 拓扑前置条件约束下的自动化 CoT 蒸馏:跳出了传统让 LLM 自由看图猜 CoT 的不可靠模式,巧妙地以底层 Level I / II 真值作为逻辑支点,由大模型完成语言缝合,以近乎零成本实现了高精度、强几何对齐的万级长链思维标注。
- 由表及里的三维认知跃迁:不同于以往将多视角推理简化为端到端黑盒分类,MV-STRIDE 促使 8B 模型自发展现出“识别单图物体定位 → 跨图计算相机位姿矩阵变换 → 重建全局空间相对朝向”的白盒推理路径,为具身智能世界模型的空间推理训练提供了通用范式。
局限与展望¶
- 动态场景与时间维度缺失:MV-STRIDE 目前的场景资产建立在静态多视角重叠帧上,未考虑动态移动物体或时变光照干扰,未来可向连续视频与动态具身轨迹扩展。
- 推理步长与计算开销:三阶段 CoT 推理引入了长 token 序列,在实时自动驾驶或机器人低延迟控制场景下存在推理延迟瓶颈,未来探索轻量化推理压缩或测试时自适应预算缩放将是关键演进方向。
相关工作与启发¶
- vs SpatialVLM / SpatialRGPT:早期工作多聚焦于单视角 2D/3D 伪标签生成,主要依赖估计器拟合单视角深度;MV-STRIDE 显式引入多视角刚体几何变换约束,并从源头上通过不可解过滤排除了单图伪解。
- vs MultiSPA / ViewSpatial:现有基准与数据多将多视角空间理解视作平铺孤立的任务,或过度侧重底层几何测量;MV-STRIDE 首次构建了自顶向下的层级依赖体系,打通了“感知-建模-高阶推理”的全链条。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次提出多视角空间推理的分层能力建模与单视角不可解约束,设计极具创新性。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 4 大主流基准,详细对比数十种闭源与开源模型,提供深入的数据源与阶段消融。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑结构严谨,认知心理学依据与数学几何约束论述详实清晰。
- 价值: ⭐⭐⭐⭐⭐ 显著刷新开源模型多视角空间推理 SOTA,为 VLM 具身空间认知提供了强有力的数据与训练方案。