跳转至

SpaR3D-MoE: Adaptive 3D Spatial Reasoning from Sparse Views Meets Geometry-Inductive Mixture-of-Experts

会议: ECCV 2026
论文: ECCV 原文
领域: 3D视觉 / 多模态VLM / LLM推理
关键词: 3D空间推理, 稀疏视角, 混合专家系统, 多模态大模型, 时空流形采样

一句话总结

针对多模态大模型在稀疏视角下拓扑断裂与模态竞争的瓶颈,SpaR3D-MoE 提出时空流形自适应采样提取关键帧,并构建由指令与位姿感知的异构几何归纳混合专家架构,在无需昂贵 3D 资产的前提下刷新 VSI-Bench、ScanQA 与 SQA3D 的最先进性能。

研究背景与动机

三维空间推理是具身智能体感知复杂物理世界、理解空间拓扑关系并完成指令落地的核心能力。现有多模态大语言模型(MLLM)在二维图像与视频语义理解上取得了显著进展,但在物理三维世界中往往面临严重的表示鸿沟,在绝对度量估算、相对朝向判断与长程路径规划等任务上极易产生空间幻觉。其根源在于标准视觉编码器在语义对齐过程中压缩了细粒度几何与深度结构,无法直接支撑精细的三维物理几何对齐。

为弥合二维语义与三维几何之间的差距,现有方法分化为两条技术路线:一种是显式引入点云、深度图或三维网格等几何代理并借助 PointNet++ 等三维编码器映射至文本空间,这虽提供了强几何先验,但严重受制于深度传感器或高成本三维重建流程,且点云固有稀疏性会导致丰富视觉外观细节的流失;另一种则是仅依赖纯 RGB 序列的可扩展方案(如 Spatial-MLLM、VG LLM),利用预训练几何基础模型(如 VGGT)从单目输入中隐式提取结构特征。然而,纯 RGB 方案目前受制于两大深层瓶颈:在采样层面,现有方法依赖均匀采样或离散体素最大化启发式规则,割裂了场景连续的时空拓扑流形,引入大量冗余背景的同时丢弃了关键拓扑视角;在多模态融合层面,静态且均质的单体浅层融合(Monolithic Shallow Fusion)无差别地将异构外观纹理与隐式几何投影至共享空间,面对不同空间任务需求时引发严重的跨模态表征竞争。

核心 idea:将稀疏视角三维空间推理重构为“流形保真采样 + 任务自适应异构路由”的双阶段闭环,通过基于时空图的最远点采样筛选关键视角,并利用指令与相机位姿联合引导的多模态专家混合系统(MoE)解耦并分流多层次几何交互。

方法详解

整体框架

SpaR3D-MoE 将端到端稀疏视角三维空间推理拆解为两个协同子问题:首先在时空流形上进行信息最大化采样,在极端稀疏约束下提取具备拓扑连通性的高质量关键帧序列;随后将多模态特征输入由指令与相机位姿共同引导的条件路由机制,动态分派至架构各异的几何归纳专家组,自适应完成跨模态几何融合与大语言模型自回归推理。

整个系统的输入由连续机载视频观测与自然语言空间任务指令构成。系统首先通过自适应时空流形采样(ASMS)从视频中蒸馏出高信息量的稀疏关键帧;随后通过 Qwen3-VL 提取指令与二维视觉 token,同时通过预训练几何模型 VGGT 提取对应帧的隐式三维几何特征与六自由度相机位姿;接着,指令-位姿感知路由器(IPAR)结合多模态意图与运动偏置计算各专家的激活权重;四个架构异构的几何归纳专家分别执行纯加性融合、语义-几何交叉注意力、基于超网络的位姿动态调制以及重力对齐结构先验滤波;最后,聚合的多模态 token 输入 LLM 解码器生成最终空间推理文本,整体流程由主生成损失与辅助负载均衡损失端到端协同优化。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["长视频输入 + 语言指令"] --> B["自适应时空流形采样<br/>图距离度量与运动质量门控"]
    B --> C["多模态表征提取<br/>视觉 / 几何 / 位姿 / 文本"]
    C --> D["指令与位姿感知路由<br/>跨模态意图融合与位姿偏置注入"]
    D --> E["异构几何归纳专家组<br/>E0纯加性 / E1交叉注意 / E2位姿自适应 / E3重力结构"]
    E --> F["自适应多模态特征聚合"]
    F --> G["大语言模型自回归解码<br/>生成物理对齐的三维推理回答"]

关键设计

1. 自适应时空流形采样:消除序列冗余并保持拓扑连通 针对均匀降采样割裂场景连续流形以及孤立视角启发式算法遗漏关键转折点的问题,该设计建立在显式近似场景低维时空流形的几何图结构之上。算法首先将密集视频降采样至宏观候选池,随后定义综合图边权度量 \(D(i, j)\),有机融合三维平移距离、几何视向变化与时序间隔: $\(D(i, j) = \bar{D}_{trans}(i,j) + \gamma \bar{D}_{geo}(i,j) + \omega \bar{D}_{tmp}(i,j)\)$ 其中 \(\bar{D}_{trans}\) 是由 VGGT 估计的六自由度相机中心的三维平移归一化欧式距离,提供轨迹空间覆盖度;\(\bar{D}_{geo}\) 是 VGGT 隐式三维特征的余弦相异度,防止在同一物理位置产生视线停滞的冗余采样;\(\bar{D}_{tmp}\) 为归一化帧间时间差,保持时序连贯。为防止最远点采样锚定在白墙等无纹理无效区域,设计引入节点质量评分 \(S_i\),利用视觉 patch token 中 Top-\(K_v\) 的平均 L2 范数表征前景信息丰富度,并叠加瞬时相机速度的指数衰减项抑制运动模糊。最终,采样转化为受运动感知质量门控 \(M(i)\) 调控的最远点采样(FPS)过程,对低质量帧施加软惩罚,从密集候选集中筛选出保留拓扑连通性的稀疏关键帧。

2. 指令与位姿感知路由:解耦多模态交互并动态分派专家 针对传统单体结构中静态浅层投影导致的表征竞争,该设计构建了以指令和相机运动为先验的动态条件调度器。路由器接收指令 token \(q\)、二维视觉 token \(v\)、三维几何 token \(g\) 和相机位姿特征 \(p\)。不同于单纯的文本或图像路由,\(q, v, g\) 经线性映射后拼接输入意图混合器(Intent Mixer MLP)捕捉跨模态高阶语义交互,而相机位姿特征 \(p\) 则经过独立线性映射后直接作为全局空间偏置累加至路由 logit 空间: $\(L = \text{MLP}([\mathbf{W}_q q\,;\,\mathbf{W}_v v\,;\,\mathbf{W}_g g]) + \mathbf{W}_p p\)$ 该设计使模型不仅能感知任务属于度量估计还是语义寻物,更能感知当前视角在大基线位移中的视点跃迁,由此生成 Top-K 专家的动态激活概率,确保不同难度和模态偏向的 token 走入解耦的处理通路。

3. 异构几何归纳专家组:分工实现多层次跨模态几何融合 为避免传统 MoE 中专家同质化导致的表征退化,系统专门定制了四个在计算机制与几何归纳偏置上完全异构的专家模块: - 整体表征专家(E0):采用轻量纯加性归一化 \(E_0(v, g) = \text{RMSNorm}(v + g)\)。此设计刻意保留基础融合操作,其价值在于为无需复杂几何变换的普通感知 token 提供低开销通道,避免高阶复杂专家被基础特征处理稀释专有算力。 - 几何-语义交叉注意力专家(E1):以视觉 token 为 Query,三维几何 token 为 Key 和 Value 构建多头交叉注意力,即 \(E_1(v, g) = \text{RMSNorm}(v + \text{CrossAttn}(Q=v, K=g, V=g))\)。该模块实现二维外观与三维几何的精细局部密集对齐,专攻细粒度多目标空间关系定位。 - 位姿条件动态适配器专家(E2):针对稀疏视角间的大基线视差,利用超网络(HyperNet)将相机位姿特征 \(p\) 动态编码为低秩适配权值,直接作用于几何嵌入的动态子空间投影与恢复,输出以自适应缩放残差叠加至视觉 token。该专家等效于可学习的隐式坐标变换器,显著缓解了稀疏视点下的空间失准。 - 重力对齐结构专家(E3):引入一组可学习的重力对齐物理结构探针 \(\Phi \in \mathbb{R}^{N_p \times D}\),捕捉水平地板、天花板等主导物理基准面。几何特征映射至结构子空间后与探针计算交叉亲和度生成结构掩码,过滤无序杂乱几何噪声,经关系映射网络注入视觉特征,为绝对尺度估算提供稳定的全局物理坐标锚点。

损失函数 / 训练策略

模型采用端到端联合训练策略,总损失由自回归语言生成损失 \(\mathcal{L}_{gen}\) 与辅助路由负载均衡损失 \(\mathcal{L}_{moe}\) 线性组合而成: $\(\mathcal{L} = \mathcal{L}_{gen} + \lambda_{moe} \mathcal{L}_{moe}\)$ 其中 \(\mathcal{L}_{moe} = N_e \sum_{i=1}^{N_e} \bar{P}_i \rho_i\),\(N_e\) 为专家总数(\(N_e=4\)),\(\bar{P}_i\) 为全 batch token 在专家 \(i\) 上的平均路由概率,\(\rho_i\) 为专家 \(i\) 被选入 Top-K 激活集合的实际频率。该均衡损失惩罚概率分布与激活频率的协方差,强力防止路由塌缩至单一专家,保证四大专家的协同多样性与梯度更新平稳性。

实验关键数据

主实验

在涵盖 9 类空间推理任务的 VSI-Bench 基准上,SpaR3D-MoE 以仅 32 帧稀疏输入大幅超越了包括商业闭源模型与大参数量开源模型在内的所有对比基线。

模型 输入形态 / 帧数 平均分 (Avg.) 路径规划 (Route Plan) 相对朝向 (Rel. Dir.) 绝对距离 (Abs. Dist.) 房间大小 (Room Size)
GPT-4o API / 密集帧 34.0 31.5 41.3 5.3 38.2
Gemini-1.5-Pro API / ~85帧 45.4 36.0 46.3 30.9 43.6
InternVL3-78B 开源 / 密集帧 48.5 28.9 39.5 53.7 39.5
Qwen3VL-8B 开源 / 密集帧 55.7 32.5 46.3 45.8 60.3
Spatial-MLLM-4B 空间感知 / 密集帧 48.4 33.5 46.2 34.8 45.1
SpaR3D-MoE (本文) 纯RGB / 仅32帧 63.5 44.0 70.1 48.0 69.6

在 3D 具身问答基准 ScanQA 与 SQA3D 上的表现同样卓越:在 ScanQA 验证集上达到 30.4 EM@1 与 101.5 CIDEr,超越了依赖显式点云的 Video-3D LLM(30.1 EM@1)与 3D-LLaVA(92.6 CIDEr);在 SQA3D 测试集上达到 58.3 EM@1,创下纯视频输入模型的最优记录。

消融实验

在 VSI-Bench 上对各专家的功能隔离度与路由输入有效性进行消融分析:

配置 平均分 (Avg.) 路径规划 (Route Plan) 相对朝向 (Rel. Dir.) 绝对距离 (Abs. Dist.) 说明
SpaR3D-MoE (完整模型) 63.5 44.0 70.1 48.0 32帧 ASMS + 完整 IPAR 与 4 专家
去除 E0 (整体表征专家) 61.8 41.3 65.6 46.3 基础 token 被迫挤占高级专家算力
去除 E1 (几何交叉注意力) 62.8 43.0 69.7 47.3 局部几何细粒度对齐能力受损
去除 E2 (位姿动态适配器) 59.3 38.8 60.4 42.2 掉点最剧烈(-4.2),视角失准无法对齐
去除 E3 (重力对齐结构) 62.4 40.0 68.6 47.5 拓扑规划与物理尺度锚定削弱
基础路由器 (仅视觉+几何) 61.2 39.0 67.5 46.0 无指令与位姿显式先验引导
+ 位姿偏置注入 (\(p\)) 62.5 42.0 68.5 47.2 运动信息为视点敏感任务带来显著增益(+1.3)
+ 文本意图引导 (\(q\)) 61.8 41.5 66.0 46.5 语义引导提升任务自适应分流(+0.6)

同时,采样策略消融显示:在 32 帧设置下,ASMS 相比均匀采样(Uniform 62.4)全面领先达到 63.5,在路径规划任务上实现了 10.6% 的相对提升(44.0 vs 39.8);即便压缩到 16 帧,ASMS 仍能维持 61.9 的高水准,显著优于 8 帧极端配置(57.8)。

关键发现

  • 位姿自适应专家 E2 是长基线稀疏视角下的最核心支柱:消融 E2 导致全模型总体下降 4.2 分,并在相对朝向(暴跌 9.7 分)与路径规划(暴跌 5.2 分)中造成毁灭性破坏,证明稀疏视角下的视角大基线位移必须通过位姿自适应变换校准坐标系。
  • 保留“简单专家”E0 能够防御高阶专家能力稀释:屏蔽基础加法专家 E0 反而使模型总分下降 1.7 分,原因在于简单语义背景 token 若无合适归宿,将被强行送入高阶交叉注意力和位姿专家,破坏了高阶专家的专业化收敛。
  • 位姿与文本联合路由显著优于纯特征路由:单纯依赖视觉与几何特征的 Base Router 仅能取得 61.2 分,加入位姿偏置后跃升至 62.5 分,证明显式几何运动先验能为路由决策提供关键的条件偏置。

亮点与洞察

  • 将 MoE 机制引入 3D 空间推理的跨模态融合层:打破以往单体线性投影强制共用通道的旧框架,以架构异构的专家分工成功解耦了“度量尺度”、“坐标转换”与“语义接地”的相互干扰。
  • 以时空流形图与运动质量门控革新帧采样:摒弃粗暴的均匀下采样或耗时体素重建,将视频关键帧选取建模为图空间质量调控的最远点采样,兼顾空间覆盖率与画面抗模糊质量。
  • 无需显式 3D 传感器与密集重建即可超越 3D 专用模型:在 ScanQA 和 SQA3D 上以纯 RGB 稀疏帧战胜利用密集三维点云的 Video-3D LLM,展现了隐式几何特征与自适应路由结合的巨大潜力。

局限与展望

  • 依赖离线全局视频流形的预构建:ASMS 采样需要预先获取视频的完整轨迹与候选帧特征构建时空图,难以直接应用于在线连续视频流或低延迟实时具身控制场景。
  • 底层隐式几何特征高度依赖单目先验模型:系统的 3D 几何与相机位姿输入强依赖于预训练 VGGT 模型的输出精度,当遇到剧烈反光、动态移动物体或严重遮挡时,误差可能沿流水线传导。
  • 未来方向:作者提出未来将探索在线因果视频流的时空空间推理;同时可引入基于强化学习的多跳自省机制,进一步提升长程多房间导航推理能力。

相关工作与启发

  • vs 显式 3D 大模型 (如 3D-LLM, Chat-Scene, Video-3D LLM):显式模型需要高精度 RGB-D 点云或耗时的三维网格重建,硬件成本高且损失细粒度纹理;SpaR3D-MoE 仅靠稀疏单目 RGB 视频,借助 VGGT 与异构专家实现同等乃至超越的点云级三维空间推理能力。
  • vs 纯 RGB 空间大模型 (如 Spatial-MLLM, VG LLM):先前的 RGB 方案使用均匀帧采样与单体静态融合,容易在视角稀疏时丢失拓扑连通并陷入模态竞争;SpaR3D-MoE 通过 ASMS 保证流形拓扑连续性,并首创 HGI-MoE 实现任务感知的动态几何解耦路由。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ [首创面向 3D 空间推理的异构混合专家系统,并提出基于时空流形图的自适应关键帧采样]
  • 实验充分度: ⭐⭐⭐⭐⭐ [在 VSI-Bench、ScanQA、SQA3D 三大基准与细粒度任务上开展全面评测与深度消融]
  • 写作质量: ⭐⭐⭐⭐⭐ [理论推导严密、架构图示清晰、动机与实验分析紧扣且逻辑自洽]
  • 价值: ⭐⭐⭐⭐⭐ [为具身智能与大模型空间理解摆脱高成本点云传感器依赖开辟了一条高精度、可扩展的全新技术路线]