Imaginative Perception Tokens Enhance Spatial Reasoning in Multimodal Language Models¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/m-bigverdi/IPT
领域: VLM Reasoning
关键词: 空间推理, 多模态大模型, 想象感知标记, 统一多模态模型, 视点变换
一句话总结¶
提出想象感知标记(Imaginative Perception Tokens, IPT),通过统一多模态模型在推理中显式生成未观测空间配置下的中间感知表征(新视角/鸟瞰图),显著提升多模态语言模型的 3D 空间推理能力并展现强大的表征迁移性。
研究背景与动机¶
空间推理一直是视觉语言模型(VLM)的核心瓶颈。现有多模态模型在基础目标识别和属性描述上表现出色,但在处理 3D 空间关系时极其脆弱,尤其是当场景需要视角转换、遮挡穿透或跨多视点信息整合时(如 ViewSpatial-Bench、3DSRBench 与 MindCube 所揭示的失效)。人类在解决此类空间问题时,天然依赖心理模拟与空间想象——例如当被问及“走到拐角左转会看到什么”或“房间里一共有几张椅子”时,人脑会自主在大脑内部构建未见视角的场景图像,或将局部观察缝合成一张连贯的全局俯视地图。
然而现存的 VLM 增强技术大多建立在显式可见结构上。文本思维链(Textual CoT)试图将复杂的 3D 变换、遮挡几何与透视投影强行序列化为自然语言字符串,这种模态错配(Modality Mismatch)不仅冗长繁琐,还频繁引入空间幻觉;而近期的视觉草稿本(Visual Sketchpad)或深度/边界框标记(Perception Tokens),本质上是在当前可见的输入像素上做提取、标注或局部细化,无法凭空推断因视角受限而未直接观测到的隐式空间几何。
面对这种“关键推理信息在输入中根本不可见”的本质难题,本研究选择回归人类空间智能的本质机制:让模型在回答问题前,首先在潜空间或视觉输出端外化出未观测状态下的感知预测。核心 idea:引入想象感知标记(IPT)作为中间表征,迫使统一多模态模型生成符合场景先验但当前未观测的中间视觉状态(如目标新视角图像、路径侧视观测或全局俯视 BEV 地图),以此为物理基础再推理最终空间答案。
方法详解¶
整体框架¶
本文基于具备原生图文交错理解与生成的统一自回归模型 BAGEL 构建两阶段推理框架。输入由一组观测图像 \(I_{\text{obs}} = \{I_1, \dots, I_k\}\) 及自然语言空间提问 \(Q\) 构成。模型首先联合上下文生成反映任务所需未见空间配置的想象感知标记 \(\hat{I}_{\text{imag}}\);随后将生成的想象结果重新注回多模态上下文序列中,结合原始观察联合自回归预测最终答案 \(A\)。
整个方法的数据流与交互架构如下所示:
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
In["输入观测图像与空间提问<br/>I_obs + Q"] --> T1["三项空间想象基准构建<br/>PET新视角 / PT侧视图 / MVC俯视图"]
T1 --> T2["统一多模态混合专家主干<br/>BAGEL MoT架构 + 语义与潜变量双重表征"]
T2 --> T3["流匹配生成想象感知标记<br/>Rectified Flow去噪生成中间潜变量"]
T3 --> T4["感知注入与跨模态解答生成<br/>解压图像注回序列并预测最终答案"]
T4 --> Out["输出最终空间推理答案<br/>预测选项 A"]
关键设计¶
1. 三项空间想象基准构建:面向未见空间结构的因果探针
传统空间基准多为判别式问答,模型容易依赖语言先验与可见捷径答题。本文针对人类核心空间想象能力,构建了三项必须依赖“无中生有”构造空间表征的任务体系,并分别匹配真实世界物理渲染作为 ground-truth 想象目标。视角转换(Perspective Taking, PET)要求模型基于单个第一人称视角和地面标记点“X”,推断位移并旋转 90° 后的目标相对方位与距离变化,其想象目标为目标坐标下的新视角渲染图;路径追踪(Path Tracing, PT)提供俯视地图与首尾第一人称视野,要求推测沿路径中点侧方可见的物体,其想象目标为中点处的地面侧视图像;多视角计数(Multiview Counting, MVC)输入多张局部室内视图,要求克服严重遮挡与跨视角重复计算全局物体数目,其想象目标为将多视角聚合为一览无余的顶视鸟瞰(BEV)地图。三大任务在 AI2-THOR、Habitat、ScanNet++ 等仿真与真实场景中构建了超 86k 训练样本与人工校验评测集。
2. 统一多模态混合专家主干:无损连接视觉理解与生成的表征底座
外化生成未见视觉表征并无缝用于后续推理,要求模型单体内置双向图文交错能力。本文采用统一 Transformer 专家混合架构(Mixture-of-Transformer-Experts, MoT)的 BAGEL-7B。该主干在每层共享自注意力机制下,分流设置专门负责理解的 Transformer Expert 与负责图像生成的 Transformer Expert。图像在序列中拥有双重投影:输入图像由 SigLIP2 ViT 编码提取语义理解标记(\(U\)),同时由 FLUX 变分自编码器(VAE)提取高保真潜变量生成标记(\(G\))。这种设计消除了传统管道中“外挂图像生成扩散模型”带来的上下文截断与离线调用延迟,使得语言提问、输入图像、未见视角的中间想象以及最终推理答案全部在同一个自回归注意力上下文窗口中深度交互。
3. 流匹配生成想象感知标记:几何受约束的高保真连续去噪
模型生成的想象不能是无约束的文生图幻想,必须与当前场景的可见布局、物理遮挡与几何刚性严格自洽。本文在潜变量空间采用基于整流流(Rectified Flow)的速度场预测机制,通过流匹配损失约束模型从高斯噪声中还原未见视角的潜变量:
其中 \(C\) 包含前置观测与指令条件,\(G_0 \sim \mathcal{N}(0, I)\) 为随机噪声,\(G_{\text{gt}}\) 为由 3D 真实环境渲染得到的目标视角真值潜变量。流匹配训练迫使生成专家在模型深层内部构建场景的三维一致性表征。
4. 感知注入与跨模态解答生成:想象闭环驱动的下游多任务优化
在推理阶段,模型完成整流流积分采样生成未见视角的潜变量 \(\hat{G}_{\text{imag}}\) 后,经由 VAE 解码器重建物理图像 \(\hat{I}_{\text{imag}}\),并即刻通过 SigLIP2 与 VAE 重新映射,以双重标记格式注回多模态上下文:\(C^\uparrow = [C, \text{ViT}(\hat{I}_{\text{imag}}), \text{VAE}(\hat{I}_{\text{imag}})]\)。模型随后通过语言建模自回归损失联合优化最终答案序列:
多任务加权总损失为 \(\mathcal{L}_{\text{total}} = \omega_{\text{fm}} L_{\text{fm}} + \omega_{\text{lm}} L_{\text{lm}}\)。这使得模型在训练期间将空间几何推断梯度直接回传到底层特征中,而在推理时既支持显式生成图像辅助推理,亦支持在潜空间隐式完成想象后直接输出答案(answer-only)。
一个完整示例¶
以多视角计数(MVC)任务为例,输入由一个杂乱办公室内的 4 张局部视角照片及提问“场景中一共有几张办公椅?”构成。各局部照片中椅子存在严重遮挡且同一张椅子在相邻视角中反复出现。模型接收 4 张输入图的理解与生成标记后,进入 IPT 生成阶段:流匹配机制在 1024×1024 高分辨率潜空间中去噪生成出整间办公室的顶视俯瞰 BEV 图像。在这张生成的 BEV 图中,所有局部的三维坐标被统一投影并去重,8 张椅子以独立的俯视二维空间占位清晰排布。随后,模型将生成的 BEV 图像重新编码注回上下文,回答生成层直接通过 BEV 视角完成去重与计数,精准输出正确选项“8”,彻底避免了文本计数中因无法跨视角空间对齐导致的漏数与复读错误。
实验关键数据¶
主实验¶
主实验在 AI2-THOR 域内评测集以及跨环境迁移集(Habitat 用于 PET,Matterport3D 真实全景标注用于 PT)上展开,全面对比了闭源商业模型、主流开源 VLM、统一多模态模型以及不同训练策略的 BAGEL 变体。
| 模型 | 类型 | PET (AI2-THOR) | PT (AI2-THOR) | MVC (AI2-THOR) | PET (Habitat OOD) | PT (Real OOD) |
|---|---|---|---|---|---|---|
| GPT-5 | 闭源商业 VLM | 79.8% | 60.2% | 53.5% | 69.3% | 80.9% |
| GPT-5.2 | 闭源商业 VLM | 45.5% | 32.9% | 44.2% | 54.0% | 63.0% |
| Gemini 3 Flash | 闭源商业 VLM | 55.0% | 42.3% | 56.9% | 51.3% | 83.2% |
| Qwen3-VL-8B | 开源开源 VLM | 52.0% | 35.9% | 43.8% | 46.7% | 64.1% |
| Janus-Pro-7B | 统一生成理解模型 | 51.8% | 33.5% | 33.1% | 44.7% | 35.3% |
| Chameleon 7B | 统一早期融合模型 | 34.3% | 16.3% | 5.4% | 47.3% | 24.5% |
| Bagel (base) | 统一主干基线 | 40.3% | 29.9% | 35.4% | 62.7% | 42.7% |
| Bagel (label-only) | 仅答案微调 | 97.5% | 65.7% | 63.9% | 82.0% | 54.7% |
| + Text CoT | 文本思维链微调 | 83.1% | 49.7% | 62.3% | 70.3% | 52.2% |
| + IPT (本文) | 想象感知标记微调 | 96.8% | 49.0% | 67.3% | 87.0% | 57.5% |
| + Mixed Training | IPT + 纯标签混合微调 | 97.8% | 66.7% | 62.3% | 87.7% | 58.6% |
消融实验¶
1. 想象潜变量分辨率消融(Latent Resolution Ablation)
评估生成中间想象图像的分辨率(从 Latent-4 的 64×64 到 Latent-64 的 1024×1024)对下游空间推理精度的直接影响。
| 潜变量规格 | 像素分辨率 | PET (AI2-THOR) | PET (Habitat OOD) | MVC (AI2-THOR) | 说明 |
|---|---|---|---|---|---|
| Latent-4 | 64 × 64 | 87.4% | 73.3% | 53.5% | 画面严重模糊,丢失局部相对空间关系 |
| Latent-16 | 256 × 256 | 95.3% | 81.0% | 56.2% | 粗粒度几何轮廓可见,精度明显跃升 |
| Latent-32 | 512 × 512 | 95.0% | 87.0% | 58.9% | 跨域泛化峰值,细节与泛化平衡最好 |
| Latent-64 | 1024 × 1024 | 96.8% | 83.3% | 63.1% | 域内细节最丰富,域内准确率达到最优 |
2. 思维模态与推理模式消融(Modality & Inference Mode)
在 AI2-THOR 基准上对比中间思维模态(文本 CoT vs. 视觉 IPT)以及推理阶段的执行模式(显式生成思维、隐式直接回答、真值上限)。
| 训练监督信号 | 推理模式 | PET 准确率 | PT 准确率 (EgoDir) | MVC 准确率 | 核心分析 |
|---|---|---|---|---|---|
| Text CoT | w/ text 生成文本思维 | 83.1% | 53.1% | 61.5% | 文本序列化空间几何困难,引入大量噪声 |
| Text CoT | answer-only 直接回答 | 78.3% | 55.8% | 62.3% | 缺乏视觉结构支撑,泛化能力弱 |
| IPT (本文) | w/ image 显式生成想象 | 96.8% | 50.4% | 67.3% | MVC 显著受益于显式俯视 BEV 地图去重 |
| IPT (本文) | answer-only 隐式空间推理 | 96.8% | 61.1% | 62.3% | PT 任务避免了生成瑕疵干扰,内化表征强 |
| IPT (Oracle) | w/ GT image 注入真值图像 | 96.7% | 86.7% | 67.3% | PT 从 50.4% 跃升至 86.7%,显示巨大生成潜能空间 |
关键发现¶
- 文本思维链在空间推理中的负迁移效应:在多项任务中,Text CoT 表现明显不如仅用答案监督的 Label-Only 模型(例如在 PET 上从 97.5% 暴跌至 83.1%,PT 上从 65.7% 跌至 49.7%)。空间坐标与几何遮挡很难用一维线性文本精准表达,迫使模型在训练中把宝贵容量浪费在生成冗长且充满空间幻觉的自然语言描述上,造成灾难性干扰。
- 想象监督内化为强大的隐式空间先验:在 PT 与 PET 任务中,即便在推理时不调用耗时的图像扩散生成(answer-only 模式),仅通过训练阶段注入 IPT 监督损失,模型的准确率依然大幅超越基线与开源模型。这证明流匹配视觉目标的监督直接塑形了模型底层的 3D 隐式表征。
- 生成质量是复杂几何任务的胜负手:真值想象(GT Image)消融表明,当直接向模型提供完美的侧视真实图像时,PT 准确率由 50.4% 暴涨至 86.7%(+36.3%)。这说明当前模型的几何推理逻辑本身足够成熟,真正的瓶颈在于复杂路径下中间视觉图像的生成保真度。
亮点与洞察¶
- 将视觉生成从“消费级出图”重定义为“认知级中间计算”:以往多模态模型的生成能力仅用于以文生图或图像编辑,IPT 将高保真连续流匹配生成转换为模型解决 3D 空间不可见难题的功能性推理步骤,设计构想极其优雅。
- 发现空间推理在推理时的“隐式计算红利”:证明了视觉中间生成任务可以充当强正则项;模型在测试时无需付出额外的图像生成采样开销,仅利用其训练期间建立的视觉结构注意力即可获得极高精度。
- 可泛化至多类几何下游任务:在非直接匹配任务(如 ScanNet 真实计数、MindCube 抽象几何魔方、All-Angles-Bench 全视角匹配)中,经过 IPT 数据训练的主干均获得 7~12% 的普遍增益,证明空间想象数据具有跨任务底座赋能价值。
局限与展望¶
- 复杂轨迹生成质量受限带来下游累损:在路径追踪(PT)等多阶段长程几何变换中,模型自主生成的侧视图像常伴随透视畸变与物体漂移,导致显式生成推理时的效果反而不及隐式直接回答。
- 依赖昂贵的 3D 物理模拟引擎进行真值监督:当前高质量的中间想象图像(真实新视角、真值 BEV)高度依赖 AI2-THOR 与 Habitat 等仿真器的渲染能力,在纯自然开放场景中大规模采集成对的未见视点真值代价高昂。
- 后续改进方向:可探索测试时搜索机制(Test-Time Compute),通过自洽性评分或几何重投影校验闭环筛选最优的生成想象标记;同时结合轻量 3D 高斯泼溅(3DGS)隐式辐射场作为更具物理约束的中间表征。
相关工作与启发¶
- vs Visual Sketchpad / MVoT: Visual Sketchpad 等方法依赖模型在输入画布上进行涂鸦、画框或轨迹绘制,处理的本质上是输入视线内“已经可见”的信息;而 IPT 专注于“无中生有”的未观测视角合成,填补了不可见几何区域的认知空白。
- vs Textual Chain-of-Thought: 文本思维链试图以文字序列描述几何变换矩阵与相对位姿,面临严重的模态表达瓶颈;IPT 遵循“在何种模态产生的问题便在何种模态思考”的原则,将几何计算保留在视觉空间。
- vs 外部工具调用流水线: 相比外挂 Stable Diffusion 或零样本 NeRF 重建工具的管线化方法,IPT 内嵌于统一自回归 MoT 架构中,全链路梯度端到端可导,保证了上下文语义无损交互。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ [首次提出将统一模型的交错生成能力作为未见空间推理的中间感知计算底座]
- 实验充分度: ⭐⭐⭐⭐⭐ [覆盖仿真与真实世界三大典型空间任务,包含丰富的跨域迁移、分辨率与模态消融]
- 写作质量: ⭐⭐⭐⭐⭐ [问题提炼深刻,动机推导自然有力,对比论证扎实客观]
- 价值: ⭐⭐⭐⭐⭐ [为解决多模态大模型的空间智能与几何推理痛点开辟了极具前景的通用范式]