Stream3D-VLM: Online 3D Spatial Understanding with Incremental Geometry Priors¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://stream3d-vlm.github.io/
领域: 多模态 VLM
关键词: 3D视觉语言模型、流式视频理解、空间智能、增量几何先验、自回归流式控制
一句话总结¶
Stream3D-VLM 提出了首个仅依靠单目流式视频的在线 3D 视觉语言模型,通过自回归 next-token 预测自主学习响应时机,利用轻量级 VSFI 模块增量注入前馈重建几何先验,并结合几何自适应体素压缩(GAVC)实现长时序视频流下高效实时的 3D 空间理解与交互。
研究背景与动机¶
多模态大语言模型(MLLMs)在图文推理与交互领域的爆发,推动着空间智能(Spatial Intelligence)加速渗透到具身机器人、智能移动终端及 AR/VR 眼镜等物理现实场景中。为了让模型在三维物理世界中具备可靠的感知与推理能力,早期的 3D 大多模态模型普遍依赖显式三维传感器数据(如点云、网格或深度图)进行指令微调。然而,这类高精度 3D 标注数据的采集成本极其高昂、规模极其受限,不仅难以支撑模型向百亿参数规模扩展,也割裂了与海量无标注 2D 互联网视频的互通;近期基于前馈 3D 重建技术的方案虽能仅依靠单目 RGB 视频提取空间线索,但现有 3D 视觉语言模型无一例外均停留在离线(offline)推理范式,必须预先获取全局 3D 场景观测或预先截取好的完整视频片段,无法适应当下持续流入的流式视频环境。
在现实的具身交互与可穿戴场景中,视频是以单向时间轴实时流式涌入的,系统面临着两个核心矛盾。其一,模型不仅需要理解“回答什么”,还必须在连续无缝的帧序列中自主决策“何时保持静默、何时主动触发回答”,而现有的 2D 在线视频模型主要针对第一人称动作预测与视频叙事等高层时序识别,欠缺底层几何与物体-相机空间距离的度量能力,即使强行用 3D 数据微调,在复杂空间推理任务上也表现欠佳;其二,随着在线交互时间不断推移,未压缩的视觉 token 将带来上下文线性膨胀,导致内存溢出与灾难性的解码延迟,而现有的 2D token 剪枝手段仅依据语义相似度或注意力热力图裁剪,极易破坏 3D 物理空间固有的几何拓扑完整性。此外,学术界此前极度匮乏带有精准时间戳和度量级几何标注的大规模在线流式 3D-语言交互训练数据与系统化评测基准。
面对上述两难困境,本文的切入点是将流式交互决策统一于大语言模型原生的自回归生成目标中,并借助在线流式前馈 3D 重建模型提供增量几何先验,从而完全摆脱对离线场景假设与显式 3D 传感器的依赖。核心 idea:基于 LLM 原生自回归目标引入流式控制标记学习何时响应,通过 VSFI 模块增量注入轻量前馈 3D 重建几何先验,并设计基于 3D 空间坐标聚类的 GAVC 模块自适应压缩视觉 token,实现仅凭流式 RGB 视频的高效实时 3D 空间理解。
方法详解¶
整体框架¶
Stream3D-VLM 将连续输入的单目 RGB 视频流建模为严格按时间排序的流式序列,在用户于任意时间戳发出文本指令后自主决策何时作答。系统整体流程包含三大核心阶段:首先通过自回归流式控制机制预测特殊决策标记,决定在当前帧保持静默继续摄取还是触发回答;接着通过视觉-空间特征融合模块(VSFI)在线接入 StreamVGGT 提取的潜在 3D 几何与相机位姿先验,与 2D 视觉语义在特征层面深度融合;最后通过几何自适应体素压缩模块(GAVC)将 2D patch 反投影至 3D 坐标空间并执行空间聚类压缩,以恒定开销输入预训练大语言模型生成精准回答。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入流式 RGB 视频帧与文本查询"] --> B["自回归流式控制机制<br/>next-token 预测 <SEP> 摄取或 <END> 触发"]
B --> C["视觉-空间特征融合模块<br/>VSFI 增量注入 StreamVGGT 几何与相机 token"]
C --> D["几何自适应体素压缩<br/>GAVC 空间 K-Means 聚类与双重注意力聚合"]
D --> E["LLM 自回归生成时空 3D 回答"]
关键设计¶
1. 自回归流式控制机制:将响应时机决策统一于原生 next-token 预测
现有的离线 3D 模型在流式部署时每接收一个新帧都不得不重新遍历历史全部上下文来判断是否响应,造成极为严重的冗余推理与延迟抖动。为了让模型拥有“自主感知作答时机”的能力,Stream3D-VLM 充分复用大语言模型的自回归序列建模范式,将流式控制直接重构为特殊的 token 预测任务。具体地,模型引入了两个决策控制标记:<SEP>(流式延续标记,指示当前帧未满足作答条件,模型继续接收下一图像帧并保持静默)和 <END>(响应触发标记,指示目标物体已出现或历史时空线索已充分闭环,立即截断流式输入并转入文本回答生成)。在训练过程中,模型修改训练标签掩码,对决策 token 和文本内容进行端到端联合监督,损失函数定义为流式决策交叉熵与标准语言建模损失的加权和:
$$ \mathcal{L} = \lambda \mathcal{L}{\text{stream}} + \mathcal{L} $$
其中 }\(\mathcal{L}_{\text{stream}}\) 仅在决策标记集合 \(\mathcal{D} = \{ \texttt{<SEP>}, \texttt{<END>} \}\) 上计算交叉熵,\(\lambda\) 调节时机决策与文本质量之间的平衡。通过这种设计,模型在推断每帧时仅需前向解码一个 token 即可决定当前行为,彻底摆脱了外部启发式规则或额外时序检测分支。
2. 视觉-空间特征融合模块:增量注入前馈重建几何与相机先验 单目 2D 视频天然存在深度歧义与物理度量缺失,直接用于 3D 定位与距离估计极度不可靠,而传统方法依赖的点云输入又无法扩展。Stream3D-VLM 设计了轻量级的 Visual-Spatial Feature Integration (VSFI) 模块,借力流式前馈 3D 重建基础模型 StreamVGGT 在线提取并增量注入几何先验。针对输入的第 \(t\) 帧图像,MLLM 原生视觉编码器提取出 2D 语义视觉 tokens \(\mathbf{H}^{\text{2D}}_t \in \mathbb{R}^{N \times D_{\text{vis}}}\);与此同时,StreamVGGT 的空间编码器输出潜在几何 tokens \(\mathbf{G}_t \in \mathbb{R}^{K \times D_{\text{geo}}}\) 以及表征全局相机运动与场景尺度的相机 token \(\mathbf{c}_t \in \mathbb{R}^{1 \times D_{\text{geo}}}\)。两者拼接后通过两层 MLP 映射至视觉特征空间: $$ \mathbf{H}^{\text{3D}}t = \text{MLP}([\mathbf{c}_t ; \mathbf{G}_t]) \in \mathbb{R}^{(K+1) \times D $$ 随后,模块以 2D 视觉 tokens }}\(\mathbf{H}^{\text{2D}}_t\) 作为 Queries,将几何特征 \(\mathbf{H}^{\text{3D}}_t\) 作为 Keys 和 Values,利用堆叠的跨模态交叉注意力(Cross-Attention)层进行特征查询与融合,并辅以残差连接 \(\mathbf{H}^{\text{f}}_t \leftarrow \mathbf{H}^{\text{f}}_t + \mathbf{H}^{\text{2D}}_t\) 保留 2D 原生纹理细节。这种流式单向特征注入既保留了视觉语义,又赋予每个视觉 token 显式的度量级三维空间上下文。
3. 几何自适应体素压缩:基于 3D 空间坐标聚类削减长上下文冗余 随着在线交互时长增加,未受控的视觉 token 会引起 KV 缓存无限膨胀,严重制约在线系统的实时性。传统的 2D 压缩方法仅凭注意力权重或网格降采样剪枝,忽略了视点运动引起的空间分布变化,极易将三维空间中连续分布的物体结构截断。本文提出了即插即用的 Geometry-Adaptive Voxel Compression (GAVC) 模块。利用 StreamVGGT 预测的度量深度图与相机内外参,首先将每个 2D patch 的像素坐标 \((u_j, v_j)\) 反投影至物理世界 3D 坐标: $$ \mathbf{p}_{t,j} = \mathbf{E}_t^{-1} \left( D_t(u_j, v_j) \mathbf{K}_t^{-1} [u_j, v_j, 1]^\top \right) $$ 将融合特征加上正弦 3D 位置编码提升为带物理坐标的体素 \(\mathbf{v}_{t,j} = \mathbf{H}^{\text{f}}_{t,j} + \text{PE}(\mathbf{p}_{t,j})\),并在 GPU 上对当前帧的体素点集并行执行空间 K-Means 聚类,将其划分为 \(K\) 个在空间上紧密邻近的三维簇 \(\mathcal{C}_k\)。在簇内聚合时,设计了兼顾特征相似度与物理空间距离的双重注意力机制: $$ w_j = \alpha s^{\text{f}}_j + (1 - \alpha) s^{\text{p}}_j, \quad s^{\text{f}}_j = \text{cos}(\mathbf{v}_j, \bar{\mathbf{v}}_k), \quad s^{\text{p}}_j = \exp\left(-\frac{|\mathbf{p}_j - \bar{\mathbf{p}}_k|^2}{\sigma_k^2}\right) $$ 加权归一化后聚合得到簇中心特征 \(\mathbf{v}'_k = \sum_{j \in \mathcal{C}_k} w_j \mathbf{v}_j\)。该设计在压缩率高达 50%~75% 的同时,完好保留了物理实体几何边界与关键空间特征。
损失函数 / 训练策略¶
模型基于 Qwen2.5-VL(提供 3B 和 7B 两档底座),搭配预训练的 StreamVGGT-1B 作为空间编码器。训练阶段完全冻结视觉编码器与 StreamVGGT 空间编码器,仅对轻量级 VSFI 模块与 LLM 主干网络进行微调。模型在自建的 1M+ 流式时空 3D 问答数据集和 VSI-590K 混合数据上进行单轮(1 epoch)全端到端指令微调,使用 AdamW 优化器,设置权重衰减为 0.03。在线推理时视频默认以 1 FPS 流式接入,借助底层 KV 缓存复用历史帧 token 状态,避免历史重计算,实现单帧端到端亚秒级响应。
实验关键数据¶
主实验¶
Stream3D-VLM 在自建的在线基准 Stream3D-Bench(覆盖 29 项时空 3D 任务、518 个真实视频、10,037 个测试样本)上与专有商业模型及各类开源模型进行了全面对比。流式评测特别引入了回答时机准确率指标(Answer-Timing Accuracy, ATA),用以衡量响应时间与真值时间戳的对齐精度。
| 方法 | 类型 | 总体均分 ↑ | 回溯记忆 (NA / MCA / OEA) | 实时感知 (NA / MCA / OEA) | 前向监控 (NA / MCA / OEA) | 时机准确率 (ATA) ↑ | 首字时延 (TTFT) ↓ | 端到端时延 ↓ | 显存占用 ↓ |
|---|---|---|---|---|---|---|---|---|---|
| GPT-4o | 商业 API | 28.0 | 10.5 / 36.3 / 24.9 | 31.1 / 34.8 / 51.1 | 10.2 / 29.9 / 23.0 | 55.9% | - | - | - |
| GPT-5 | 商业 API | 35.0 | 18.7 / 44.1 / 33.6 | 38.0 / 46.2 / 52.8 | 12.9 / 30.6 / 37.7 | 61.7% | - | - | - |
| LLaVA-Video-7B | 开源 2D | 20.4 | 12.7 / 34.6 / 11.4 | 21.6 / 28.6 / 38.0 | 10.2 / 20.3 / 6.5 | 55.5% | 650ms | 2.84s | 25.8G |
| InternVL3.5-8B | 开源 2D | 27.0 | 21.4 / 36.2 / 17.6 | 28.2 / 38.2 / 42.4 | 25.2 / 25.8 / 8.2 | 23.0% | 1771ms | 6.72s | 43.1G |
| Qwen2.5-VL-7B | 开源 2D | 22.5 | 11.6 / 36.3 / 13.6 | 23.1 / 33.2 / 39.4 | 11.3 / 28.4 / 5.5 | 19.2% | 325ms | 3.16s | 40.0G |
| VideoLLM-online-8B (FT) | 在线 2D 流式 | 34.6 | 28.8 / 40.9 / 27.8 | 31.3 / 37.9 / 44.6 | 38.2 / 32.7 / 29.2 | 70.2% | 120ms | 1.29s | 28.4G |
| Qwen2.5-VL-7B (FT) | 在线 2D 流式 | 47.8 | 45.6 / 56.6 / 45.4 | 45.7 / 44.6 / 48.7 | 46.6 / 57.4 / 39.8 | 73.1% | 106ms | 0.53s | 36.8G |
| Stream3D-VLM-4B (本文) | 在线 3D | 54.6 | 58.1 / 61.2 / 45.2 | 58.8 / 57.3 / 52.8 | 55.3 / 60.6 / 41.9 | 75.4% | 43ms | 0.24s | 20.7G |
| Stream3D-VLM-8B (本文) | 在线 3D | 58.8 | 59.8 / 67.9 / 50.5 | 61.4 / 61.5 / 54.3 | 58.1 / 66.7 / 49.4 | 86.7% | 62ms | 0.39s | 36.6G |
同时,为验证流式设计是否损害离线通用 3D 空间推理,模型在权威离线空间基准 VSI-Bench 以及传统 3D 场景理解任务(ScanQA, ScanRefer, Scan2Cap)上进行了严格评估:Stream3D-VLM-8B 在 VSI-Bench 上斩获 65.9% 的平均准确率,显著超越了离线专用模型 VLM-3R-8B(60.9%)与商业模型 Gemini-2.5 Pro(51.5%);在 ScanQA(CIDEr 104.5 vs SOTA 102.1)与 ScanRefer([email protected] 52.5 vs SOTA 51.7)上也全面刷新了仅凭视频输入的最佳纪录。
消融实验¶
消融实验重点验证了流式控制损失权重、VSFI 几何先验建模以及 GAVC 空间压缩模块的有效性。
VSFI 几何先验建模消融分析: | 配置设置 | Stream3D-Bench (NA / MCA / OEA) | VSI-Bench (NA / MCA) | 说明 | |---|---|---|---| | Baseline (纯 2D 视觉) | 46.0 / 52.9 / 44.6 | 42.9 / 46.2 | 无显式几何引导,数值空间度量大幅退化 | | w/o 相机 token | 55.4 / 60.4 / 46.3 | 60.5 / 61.4 | 失去全局位姿先验,全场景相对运动推理受损 | | w/o 几何 token | 52.9 / 58.6 / 50.2 | 56.1 / 55.7 | 失去细粒度 3D 几何,空间度量与尺寸估计急剧滑坡 | | 特征融合:逐元素相加 | 57.6 / 65.8 / 49.2 | 63.5 / 63.4 | 简单相加引发模态表征语义冲突 | | 特征融合:拼接 + MLP | 53.5 / 60.3 / 50.1 | 60.8 / 62.1 | 线性混合表达容量有限,多模态交互不足 | | 完整模型 (VSFI 交叉注意力) | 59.8 / 65.4 / 51.4 | 65.7 / 66.0 | 跨模态查询机制能自适应按需索取几何信息,效果最优 |
GAVC 空间压缩与基线对比(50% 保留率): | 压缩策略 | 空间几何感知 | Stream3D-Bench (NA / MCA / OEA) | ScanQA (BLEU-4 / CIDEr / EM) | 说明 | |---|---|---|---|---| | Random Pruning | 否 | 35.6 / 40.2 / 36.8 | 8.5 / 72.4 / 18.8 | 随机丢弃彻底粉碎了 3D 几何的连续拓扑 | | Average Pooling | 否 | 47.8 / 52.9 / 45.2 | 11.4 / 94.5 / 24.0 | 固定降采样模糊了细小实体的几何边界 | | VisionZip | 否 | 49.2 / 53.8 / 41.6 | 13.0 / 87.2 / 24.4 | 仅依 2D 语义注意力剪枝,丢失关键度量信息 | | GAVC (本文) | 是 | 59.8 / 65.4 / 51.4 | 17.8 / 104.5 / 30.9 | 基于三维空间坐标聚类与双重注意力,几乎无损压缩 |
关键发现¶
- 几何先验是突破空间认知瓶颈的关键:对比 Baseline 可以发现,缺乏 StreamVGGT 几何先验时,模型在 Stream3D-Bench 的数值问答(NA)落后近 14 个百分点,证实了纯 2D 视觉模型无法凭空“脑补”度量级 3D 空间结构。
- 空间引导的 token 压缩能兼顾极速与高保真:在 GAVC 模块支撑下,即便将视觉 token 保留率降低至 50% 甚至 25%,模型的回答准确率与时机对齐率(ATA)依旧保持平稳,而端到端时延由数秒锐减至 0.39s(4B 模型更达到 0.24s),展现出无与伦比的边缘设备部署亲和力。
- 流式决策损失的超参敏感性:在损失权重实验中,\(\lambda=2.0\) 实现了时机准确率(86.7%)与语言生成综合性能的最佳权衡,过大的 \(\lambda=3.0\) 会压制文本生成的表达流畅度,而过小的 \(\lambda=1.0\) 会导致模型响应迟钝(ATA 降至 80.3%)。
亮点与洞察¶
- 架构构思精巧:将流式视频“何时回答”的控制权与“回答什么”的生成逻辑,全部收敛在大语言模型原生的 next-token 预测目标中,仅用
<SEP>与<END>两个标记就打通了流式自主对话,无需构建繁琐的外部决策头。 - 空间拓扑感知的压缩哲学:打破了 2D 视频 token 剪枝沿用特征相似度的固有惯性,通过相机参数将像素反投影至三维物理坐标空间进行体素聚类,将 3D 几何拓扑作为第一先验来引导压缩。
- 规模化数据与基准基石:开发了自动化流水线生成 100 万级带显式时间戳的高质量时空 3D 问答对,并推出了涵盖 29 项细分任务的 Stream3D-Bench,创立了针对流式时机对齐的 ATA 评估标准,为领域树立了完整的基准生态。
局限与展望¶
- 严重依赖上游前馈重建模型的稳定性:VSFI 和 GAVC 的空间推理质量高度受制于 StreamVGGT 估算的单帧深度与相机位姿,在剧烈镜头摇晃、极速运动模糊或大面积反光/无纹理墙面等严苛环境下,几何先验若出现漂移,将直接波及下游问答精度。
- 默认采样率上限(1 FPS):当前主要在 1 FPS 设定下验证,面对需要毫秒级瞬时反应的高动态自主避障或快速机械臂抓取任务,事件检测粒度仍有提升空间。
- 具身行动闭环拓展:目前模型专注于输出多模态时空语言回答,未来可进一步联合具身机器人连续动作轨迹(Action Chunks)输出,演进为在线感知-推理-控制端到端空间智能体。
相关工作与启发¶
- vs 传统离线 3D LMM (如 3D-LLM, LEO, LLaVA-3D):传统方案必须输入离线扫描的点云网格或人工截取的静态视频片段,无法处理连续流式输入;Stream3D-VLM 首次实现了基于单目流式视频的任意时刻在线交互。
- vs 在线 2D 视频模型 (如 VideoLLM-online, VideoChat-Online):2D 在线模型缺乏三维空间概念与度量深度感知,在涉及距离、方位及相机运动的推理上几乎不可用;Stream3D-VLM 借助 VSFI 模块补全了几何短板。
- vs 前馈单目空间推理模型 (如 Spatial-MLLM, VLM-3R):离线前馈模型虽引入了几何先验,但无法自主控制交互时序,且长视频推理开销巨大;Stream3D-VLM 兼顾了时序自适应响应与 GAVC 高效压缩,且在离线基准 VSI-Bench 上指标反超专门设计的离线 SOTA。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次构建了单目流式视频在线 3D 视觉语言模型,将自回归决策与增量几何先验完美统一。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 29 项自建在线任务基准、离线空间基准 VSI-Bench 及三大经典 3D 场景理解任务,消融实验严谨详实。
- 写作质量: ⭐⭐⭐⭐⭐ 动机阐述自然流畅,数学形式化表达严密,图表信息充实且富有层次。
- 价值: ⭐⭐⭐⭐⭐ 填补了在线流式 3D 空间交互的空白,对下一代具身机器人与 AR/VR 空间智能助手具有极高参考价值。