VoxAnchor: Explicit Voxel-Semantic Grounding for Spatial Understanding in Videos¶
会议: ECCV 2026
论文: ECCV 2026
代码: https://github.com/Embrace-Arch/VoxAnchor
领域: 3D视觉
关键词: 视频空间推理, 3D显式对齐, 体素感知注意力, 具身多模态大模型, 度量感知
一句话总结¶
针对视频多模态大模型因 2D 投影坍缩导致的实体空间混淆与绝对尺度缺失问题,VoxAnchor 提出将视觉 token 与 DA3 几何先验显式反投影至统一 3D 体素网格,通过体素感知注意力约束物理局部交互,在仅 4B 参数下取得 VSI-Bench (66.8%) 与 VSTI-Bench (66.3%) SOTA。
研究背景与动机¶
视频空间推理是具身智能与多模态大模型(MLLM)的核心基石,要求智能体在第一人称或动态视角下不仅能识别物体与动作,更能感知连续空间布局、物体绝对物理尺度以及自身移动轨迹。相比静态单图因缺乏时间几何约束而固有的尺度歧义,连续视频序列天然包含运动视差与视点变换,为构建连续且稳定的 3D 物理表征提供了充分线索。然而,现有视频大模型结构上仍将连续视频视为离散的 2D 帧序列,注意力机制受限于 2D 像素层面的平面邻近性,无法在视点大幅漂移下保持跨帧实例一致性。
这种架构缺陷导致了严重的“空间混淆”(Spatial Conflation):模型缺乏显式的 3D 空间锚点,容易将不同空间位置但外观相似的独立实体误认为同一物体(例如将两只不同位置的红色杯子混为一谈),或者在相机移动时彻底丢失物体的连续身份追踪。现存缓解方案中,基于世界模型生成新视角的探索容易因概率采样带来幻觉与时空不一致;而直接引入 VGGT 等 3D 基础模型隐式特征的方法,又因其仅具备相对重构尺度且视觉-语言模型潜在空间被语义归纳偏置主导,难以实现严谨的真实世界度量感知(如物体距离和尺寸的米级回归)。
本文从视频作为“动态 3D 世界向 2D 时间流形连续投影”的物理本质出发,认为破局关键在于逆转投影过程,将离散观察锚定于显式物理空间。核心 idea:通过双流结构并行提取语义 token 与 DA3 度量几何先验,利用逆投影将其显式映射入连续 3D 体素网格并通过空间哈希分配体素 ID,构建基于物理同位置约束的体素感知注意力(Voxel-Aware Attention)来指导 MLLM 推理,彻底消除 2D 平面虚假邻近对空间推理的干扰。
方法详解¶
整体框架¶
VoxAnchor 的整体推理管线由双流时空语义编码、几何-语义适配器(Geo-Semantic Adapter)、3D 投影与体素化以及体素感知注意力交互(Voxel-Aware Attention)四大模块组成。模型输入连续视频帧序列,输出针对空间度量或位置关系查询的准确文本回答。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400, 'subGraphTitleMargin': {'top': 8, 'bottom': 16}}}}%%
flowchart TD
In["输入视频序列 V (T 帧)"] --> DualStream
subgraph DualStream["双流时空语义编码"]
direction TB
SemStream["语义流 (Qwen3-VL 视觉编码器)<br/>提取 2D 语义视觉 Token Fsem"]
GeoStream["几何流 (Depth Anything 3)<br/>回归深度图 D、内参 K、外参轨迹 E、几何特征 Fgeo"]
end
DualStream --> Adapter["Geo-Semantic 适配器:多尺度结构注入与原型对齐<br/>层次化融合与实例原型 InfoNCE 正则化生成 3D 一致 GeoSem 特征"]
SemStream --> Unproj["3D 投影与体素化:逆投影到统一物理空间<br/>解析式逆投影 (d·K⁻¹[u,v,1]ᵀ) → s=0.5m 体素化与空间哈希分配 ID"]
Adapter --> Unproj
Unproj --> VAA["体素感知注意力:物理局部性掩码交互<br/>基于体素 ID 重合生成稀疏掩码 M (同体素为 0,否则 -∞) 引导 Q-KV 注意力"]
VAA --> LLM["MLLM 语言解码器 (Qwen3-VL-4B LoRA)<br/>输出绝对度量与空间推理文本回答 A"]
整个管线首先并行提取高级语义与精确度量结构参数,接着在适配器中完成跨分辨率语义-几何对齐,随后将 2D 特征逆投影至绝对 3D 世界坐标系,最后在稀疏体素掩码约束下执行交叉注意力交互并输入语言模型完成推理。
关键设计¶
1. 双流时空语义编码:解耦高层语义与绝对度量先验
以往模型直接将几何特征与语义 token 早期混杂输入,导致视觉语言模型内部强烈的语义偏置压制了细粒度几何信息。VoxAnchor 采用严格解耦的双流编码策略:语义流采用 Qwen3-VL 视觉编码器提取形状为 \(T \times \frac{H}{16} \times \frac{W}{16} \times C_s\) 的 2D 视觉语义 token \(F_{sem}\);几何流引入具备确定性逆渲染特性的 3D 基础模型 Depth Anything 3(DA3),单次前向直接回归出逐帧度量绝对深度图 \(D \in \mathbb{R}^{T \times H \times W}\)、相机内参矩阵 \(K\) 以及自车运动外参轨迹 \(E\),同时抽取其骨干网络第 9、25、39 层中间几何特征 \(F_{geo} \in \mathbb{R}^{T \times \frac{H}{14} \times \frac{W}{14} \times C_g\)。解耦设计使得绝对物理尺度先验在进入空间推理前不受语义抽象的影响。
2. Geo-Semantic 适配器:多尺度结构注入与实例原型正则化
为了弥合 DA3 几何特征(富含 3D 结构但缺乏类别语义)与 Qwen3-VL 视觉 token(语义抽象丰富但丢失绝对几何)之间的表征鸿沟,适配器首先通过融合模块构建几何特征瓶颈,再通过带有门控跳跃连接的渐进上采样块,在 1/7、1/4 和 1/1 分辨率下将几何与 RGB 纹理逐步调制进语义流,经 \(1 \times 1\) 卷积与 \(L_2\) 归一化输出全分辨率连续度量空间场。为保证在相机剧烈自运动下目标实体的跨帧一致性,适配器在轻量预训练阶段利用帧级实例掩码将前景像素聚合为动态原型 \(p_k\),并通过基于原型的 InfoNCE 对比损失进行正则化:
其中 \(N_{fg}\) 为前景像素总数,\(K\) 为动态推断的实例数量,\(\tau\) 为温度系数。配合实例内紧凑性与实例间间隔惩罚,确保相同物体在跨视角运动中保持几何与语义完整性。
3. 3D 投影与体素化:逆投影到统一物理空间
模型通过解析式逆投影算子,利用 DA3 回归的绝对深度与相机位姿,将 2D 图像平面上的视觉语义 token 与经过适配器强化的 GeoSem 特征精确反投影至世界 3D 坐标空间。对于像素坐标 \((u, v)\) 处的特征点,其对应的 3D 世界坐标 \(p_{world} \in \mathbb{R}^3\) 计算如下:
随后,连续的三维世界空间被离散化为规则的立方体三维体素网格,体素边长设置为 \(s = 0.5\text{ m}\)。利用空间哈希函数为落入网格的所有特征分配全局唯一的体素 ID(\(H\)),从而使原本离散无序的 2D 观察 token 获得了物理空间中显式的绝对度量地址。
4. 体素感知注意力:基于物理局部性的稀疏掩码交互
为了彻底替换掉基于 2D 平面像素邻近的虚假聚合逻辑,VoxAnchor 在 LLM 之前重构了注意力路由机制。以未投影的 2D 视觉 token 作为 Queries (\(Q\)),以经过 Geo-Semantic 适配器增强的 3D 一致 GeoSem 特征作为 Keys (\(K\)) 和 Values (\(V\))。利用两者的体素哈希 ID 重合情况动态生成稀疏体素掩码 \(M\):
其中空间惩罚项定义为硬约束:若两者的体素 ID 一致(\(H_i = H_j\),代表处于同一物理体积空间),则 \(M_{i,j} = 0\);若不一致则 \(M_{i,j} = -\infty\)。该操作扩展为多头注意力机制并在所有注意力头上统一施加,严格将特征交互限制在几何一致的局部 3D 邻域内,从根本上阻断了非局部视点畸变导致的实体空间混淆。
损失函数 / 训练策略¶
训练分为两个阶段进行: 1. 阶段一(适配器预训练):在 InsScene-15K 数据集上对比预训练 Geo-Semantic Adapter,利用 DA3 的第 9、25、39 层几何特征,在单张 NVIDIA L40 GPU 上通过公式 (1) 的 InfoNCE 目标与原型间隔惩罚优化实例几何一致性。 2. 阶段二(多模态空间微调):在 VSI590K 与 VSTI-Bench 训练集上微调 2 个 epoch。冻结 Qwen3-VL 视觉编码器、DA3 主干网络以及预训练完成的 Geo-Semantic Adapter,仅更新体素感知注意力模块以及 Qwen3-VL 语言模型的 LoRA 参数(rank \(r=128\), \(\alpha=256\))。采用 AdamW 优化器,学习率设为 \(1 \times 10^{-4}\),全局批量大小为 64,在 4 张 NVIDIA A800 GPU 上并行训练。
实验关键数据¶
主实验¶
在考察时空动态与相机位姿推理的 VSTI-Bench 以及全面评估 3D 空间认知与绝对测量的 VSI-Bench 上,VoxAnchor 均刷新了 SOTA,超越了参数量大数倍的模型。
表 1: VSTI-Bench 3D 时空推理基准评估对比
| 模型类别 | 模型名称 | 平均分 (Avg.) | 相机-物体绝对距离 | 相机位移 | 相机运动方向 | 物体-物体相对位置 | 相机-物体相对距离 |
|---|---|---|---|---|---|---|---|
| 商业闭源模型 | GPT-4o | 38.2 | 29.5 | 23.4 | 37.3 | 58.1 | 42.5 |
| 商业闭源模型 | Gemini-1.5 Flash | 32.1 | 28.5 | 20.9 | 24.4 | 52.6 | 33.9 |
| 开源通用 VLM | InternVL2-40B | 43.2 | 11.9 | 34.9 | 33.3 | 63.8 | 72.2 |
| 开源通用 VLM | Qwen2.5-VL-72B | 40.3 | 18.0 | 10.0 | 41.0 | 74.2 | 58.4 |
| 开源通用 VLM | LLaVA-NeXT-Video-72B | 44.0 | 32.3 | 10.5 | 48.1 | 78.3 | 50.9 |
| 开源通用 VLM | Qwen3-VL-4B (Base) | 39.7 | 29.5 | 32.9 | 46.0 | 68.6 | 25.2 |
| 空间增强模型 | VLM-3R-7B | 58.8 | 39.4 | 39.6 | 60.6 | 86.5 | 68.6 |
| 本文方法 | VoxAnchor-4B (Ours) | 66.3 | 40.5 | 46.1 | 83.6 | 89.5 | 71.9 |
表 2: VSI-Bench 综合空间理解基准对比(数值问答 NC 与多选问答 MCA)
| 模型分类 | 模型 | 平均分 | 物体计数 | 绝对距离 | 物体尺寸 | 房间尺寸 | 相对距离 | 相对方向 | 路径规划 | 接近顺序 |
|---|---|---|---|---|---|---|---|---|---|---|
| 商业闭源 | GPT-4o | 34.0 | 46.2 | 5.3 | 43.8 | 38.2 | 37.0 | 41.3 | 31.5 | 28.5 |
| 商业闭源 | Gemini-1.5 Pro | 45.4 | 56.2 | 30.9 | 64.1 | 43.6 | 51.3 | 46.3 | 36.0 | 34.6 |
| 开源基础 | Qwen3-VL-4B | 54.8 | 62.6 | 44.5 | 70.3 | 63.9 | 56.4 | 46.3 | 32.0 | 62.3 |
| 空间增强 | VG-LLM-8B | 50.7 | 67.9 | 37.7 | 58.6 | 62.0 | 46.6 | 40.7 | 32.4 | 59.2 |
| 空间增强 | VLM-3R-7B | 60.9 | 70.2 | 49.4 | 69.2 | 67.1 | 65.4 | 80.5 | 45.4 | 40.1 |
| 空间增强 | GS-Reasoner-7B | 64.7 | 69.1 | 61.9 | 70.0 | 65.7 | 65.4 | 88.9 | 44.3 | 52.3 |
| 本文方法 | VoxAnchor-4B (Ours) | 66.8 | 66.3 | 52.6 | 72.5 | 71.0 | 67.3 | 80.0 | 46.4 | 78.0 |
消融实验¶
消融实验在 VSTI-Bench 上全面验证了各结构组件与 3D 几何先验源的选择合理性。
表 3: 3D 几何基础模型选择消融 (VSTI-Bench)
| 配置 | 平均分 | 相机-物体绝对距离 | 相机位移 | 相机运动方向 | 物体-物体相对位置 | 相机-物体相对距离 | 说明 |
|---|---|---|---|---|---|---|---|
| Baseline (Qwen3-VL-SFT) | 54.4 | 36.0 | 32.7 | 53.6 | 79.1 | 70.6 | 无 3D 增强微调基线 |
| + VGGT | 59.5 | 38.6 | 40.5 | 62.3 | 86.4 | 70.0 | 引入 VGGT 相对几何 |
| + IGGT | 60.7 | 38.0 | 41.1 | 65.8 | 87.3 | 71.3 | 实例增强相对几何 |
| + DA3 (Depth Anything 3) | 63.0 | 40.0 | 43.9 | 73.2 | 87.1 | 71.0 | 具备绝对度量深度的几何主干 |
表 4: 核心结构组件消融 (固定 DA3 几何主干,VSTI-Bench)
| Voxel-Aware Attention | Geo-Semantic Adapter | 平均分 | 相机-物体绝对距离 | 相机位移 | 相机运动方向 | 物体-物体相对位置 | 相机-物体相对距离 | 说明 |
|---|---|---|---|---|---|---|---|---|
| ✗ | ✗ | 63.0 | 40.0 | 43.9 | 73.2 | 87.1 | 71.0 | 仅标准交叉注意力融合 DA3 特征 |
| ✓ | ✗ | 64.5 | 39.4 | 43.0 | 79.2 | 89.9 | 73.0 | 引入体素物理局部性掩码 (+1.5%) |
| ✓ | ✓ | 66.3 | 40.5 | 46.1 | 83.6 | 89.5 | 71.9 | 完整模型:增加适配器多尺度与原型对齐 (+1.8%) |
关键发现¶
- 度量先验对绝对尺度的决定性作用:如表 3 所示,具备度量回归头的 DA3 (63.0%) 显著优于基于无尺度相对重构的 VGGT (59.5%) 与 IGGT (60.7%)。尤其在相机运动方向上,DA3 带来从 53.6% 到 73.2% 的跃升,证明绝对公制深度是建立稳定物理参考系的关键。
- 体素掩码抑制空间混淆的直接收益:表 4 显示,仅将全局交叉注意力替换为基于体素 ID 重合的稀疏掩码约束,相机运动方向即从 73.2% 飙升至 79.2% (+6.0%),物体间相对位置从 87.1% 升至 89.9% (+2.8%),充分证实阻断 2D 平面虚假邻近交互对空间关系判定的必要性。
- 参数量小却大幅超越巨型模型:4B 参数的 VoxAnchor 在绝对距离估计上达 52.6%,而 GPT-4o 仅有 5.3%,InternVL2-40B 仅有 11.9%(表 1、表 2),证明严谨的空间几何归纳偏置远比单纯堆砌语言参数更有效。
亮点与洞察¶
- 将 2D 视频理解升维为 3D 体素空间交互:打破了常规 MLLM 将帧序列拍平的范式,通过解析几何将像素逆投影到 3D 网格并采用空间哈希建立地址索引,使视频跨帧追踪获得了坚实的物理坐标承载。
- 硬空间局部性约束替代软注意力:直接将注意力权重在非同体素区域置为 \(-\infty\),以极度轻量的离散空间掩码消除语义混淆,兼顾了推理效率与严格的物理自洽。
- 度量深度与多尺度语义的优雅结合:通过轻量预训练的 Geo-Semantic Adapter,既利用了 DA3 带来的度量级深度几何,又保持了 Qwen3-VL 强大的语义表征,为具身智能导航与操作规划提供了即插即用的时空感知底座。
局限与展望¶
- 强依赖单目几何估计算法的质量:反投影精度受 DA3 深度与位姿预测精度的上限约束,在极端光照、严重动态物体模糊或无纹理大白墙场景下可能引入位姿漂移。
- 体素网格固定分辨率的尺度权衡:当前采用固定的 \(s = 0.5\text{ m}\) 体素网格,虽然在大场景相机自运动与房间尺度上表现优异,但在桌面上精细操作级小物体(如钥匙、笔)定位时分辨率可能偏粗糙;未来可引入八叉树或自适应稀疏网格分层表示。
- 计算与内存开销扩展至长视频:随着视频时长增长,全局体素哈希表条目膨胀,未来可探索局部滑动窗口或时空拓扑图更新机制以支撑超长视频具身漫游。
相关工作与启发¶
- vs VG-LLM / Spatial-MLLM: 它们利用 VGGT 特征作为外挂隐式 token 输入 LLM,空间尺度仍具有相对性;VoxAnchor 借助 DA3 获取绝对公制深度,并通过逆投影构建显式体素物理空间约束,在绝对距离和尺寸度量上具有压倒性优势。
- vs GS-Reasoner: GS-Reasoner 依赖 VGGT-SLAM 实时构建 3D 点云并使用 PTv3 提取点云特征,流程复杂且依赖重构质量;VoxAnchor 采用前向双流加空间哈希体素掩码,架构更为直接轻量且易于端到端训练。
- vs Cambrian-S: Cambrian-S 探索纯 2D 无辅助编码器的自监督时空感知;VoxAnchor 则表明在当下阶段,结合高精度几何基础模型的显式度量反投影能够以更小的数据和模型规模实现更精准的物理测量推理。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 巧妙提出显式体素反投影与体素感知注意力,彻底解决 2D 投影引起的空间混淆。
- 实验充分度: ⭐⭐⭐⭐⭐ 在 VSTI 与 VSI 两大时空与空间基准上取得 SOTA,消融实验涵盖先验模型选择与组件解耦。
- 写作质量: ⭐⭐⭐⭐⭐ 框架设计逻辑自洽,物理动机与数学建模严密清晰。
- 价值: ⭐⭐⭐⭐⭐ 为具身智能体与多模态大模型的 3D 物理空间感知提供了极具实用价值的轻量级范式。