Diffusion-Based Immersive Visual Reasoning¶
会议: ECCV 2026
论文: ECCV 原文
领域: 多模态VLM / LLM推理
关键词: 沉浸式视觉推理, 扩散模型, 视觉语言模型, 主动感知, 视口选择
一句话总结¶
针对 360° 沉浸式场景中局部可观测性导致传统 VLM 表现不佳的问题,DIVR 将推理重构为去噪扩散引导的概率置信度迭代演化过程,通过隐式假设精炼器与推理引导观察器的闭环协同,实现动态视口主动感知与多步证据聚合,在多项 360° VQA 基准上显著超越 SOTA。
研究背景与动机¶
在虚拟现实(VR)、增强现实(AR)以及移动具身机器人等前沿应用中,360° 全景视觉理解扮演着核心角色。与传统窄视场(FoV)图像不同,沉浸式全景场景具有天然的局部可观测性:全景视野范围极为广阔,回答一个复杂问题所需的关键视觉证据往往零散分布于全局画面的不同角落,甚至完全处于智能体当前视口之外。这迫使智能体不能仅仅充当被动观察者,而必须具备根据当前推理需求自主决策“往哪看”的主动探索能力。
然而,现有多模态视觉语言模型(VLM)普遍受制于僵化的“先看后想”(look first, think later)开环范式。为了适配全景图像,现有做法通常分为两类:一是直接输入整幅等距柱状投影(Equirectangular)全景图,利用球面注意力进行压缩编码,但严重的几何畸变与全局信息过载极易淹没高频细节;二是将场景预先切分为固定的视口集合(如立方体贴图的 6 个面或基于眼动热力的静态显著性裁剪)进行并行处理。这两种方案的共同致命缺陷在于切断了感知与推理之间的实时动态反馈——智能体只能在预先固定的静态观测集合上进行开环推理,一旦初始采样遗漏了非显著却攸关推理成败的微小线索(例如隐蔽门框或吊灯装饰),推理链条便无法挽回地走向崩溃。
打破这一瓶颈的关键在于将沉浸式视觉推理重塑为一个动态闭环系统,让未决的推理状态主动调度感知,再由新获取的感知证据反哺修正推理假设。核心 idea:将沉浸式视觉推理重构为去噪扩散引导的概率置信度迭代更新过程,通过隐式假设精炼器(LHR)与推理引导观察器(RGO)的紧密闭环,实现从高不确定性初始状态到高确定性推理链的主动视口探索与证据收敛。
方法详解¶
整体框架¶
DIVR 的核心思想是将多步视觉推理形式化为一个条件反向扩散过程。模型通过连续语义空间中的隐式推理假设向量 \(z_t \in \mathbb{R}^D\) 追踪当前解题规划与信念状态。推理从最大不确定性的标准高斯噪声 \(z_T \sim \mathcal{N}(0, \mathbf{I})\) 开始,历经 \(T\) 个离散步长,逐步去噪演化为完全由多步视觉证据接地的确定性假设 \(z_0\)。
在每个时间步 \(t \in \{T, \dots, 1\}\),系统在感知与推理构成的正反馈回路中循环推进:首先,推理引导观察器(RGO)依据当前尚未完全消除不确定性的假设状态 \(z_t\) 与自然语言问题 \(q\),从全景候选视口中主动挑选最具信息增益的下一个视口,提取视觉特征并更新时序累积观测表示;随后,隐式假设精炼器(LHR)以当前视觉累积线索与问题构成的条件特征作为键值,对假设向量执行一步交叉注意力条件去噪,产生精炼后的下一步假设 \(z_{t-1}\)。历经 \(T\) 轮动态探索与去噪后,完全收敛的假设 \(z_0\) 作为前缀 token 送入基础 VLM 解码器,自回归生成最终答案。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["全景图像 + 输入问题"] --> B["初始高斯噪声假设 zT"]
B --> C["推理引导观察器<br/>Gumbel-Softmax 选择视口与 GRU 累积"]
C --> D["隐式假设精炼器<br/>Transformer 交叉注意力条件去噪"]
D -->|更新推理假设 zt-1| C
D -->|完成 T 轮去噪收敛至 z0| E["VLM 解码器<br/>前缀提示生成最终预测"]
关键设计¶
1. 隐式假设精炼器(LHR):基于扩散去噪的假设迭代演化 传统神经符号推理或硬编码思维链在局部可观测环境下极易因早期观测缺失导致推理步骤断裂,而直接自回归生成离散文本 CoT 又难以提供平滑的探索控制梯度。LHR 创新性地将推理状态表征为连续潜空间向量 \(z_t\),将不确定性的消除建模为逆扩散过程。LHR 由 \(L=6\) 层 Transformer 堆叠构成,在每个反向步 \(t\),它利用独立 MLP 分别投影当前假设 \(z_t\) 与正弦时间步编码 \(t\) 并求和构建 Query,将拼接了问题特征 \(q\) 与累积视觉特征 \(x_t\) 的条件向量 \(c_t = [q; x_t]\) 投影为 Key 和 Value。通过多头交叉注意力,潜在假设主动检索视觉累积证据中与当前推理缺口相匹配的信息,预测出注入的高斯噪声分量 \(\boldsymbol{\epsilon}\),进而解析重构出置信度更高的假设状态 \(z_{t-1}\)。连续空间的渐进演化保证了推理信念在面对不完全信息时的平滑过渡与容错能力。
2. 推理引导观察器(RGO):任务驱动的可微主动视口感知策略 被动的全景等距采样或通用的显著性模型只能捕获视觉反差强烈的区域,无法捕捉看似平庸却承载推理关键逻辑的中间节点(例如通向另一个房间的门廊)。RGO 将视口决策转变为由推理状态实时驱动的主动检索策略。在 \(K=36\) 个覆盖不同视场角与空间朝向的候选视口集合中,3 层带 GELU 和 LayerNorm 的 MLP 策略网络 \(\pi_\phi\) 联合处理拼接向量 \([z_t; q; v_k]\),计算第 \(k\) 个视口的效用标量 \(u_k = \text{MLP}_\phi([z_t; q; v_k])\)。为了在端到端训练中保持梯度反向传播,模型引入 Gumbel-Softmax 重参数化技巧获得各视口的采样概率: $\(p_k = \frac{\exp((u_k + g_k)/\tau)}{\sum_{j=1}^{K} \exp((u_j + g_j)/\tau)}\)$ 其中 \(g_k \sim \text{Gumbel}(0, 1)\),\(\tau\) 为退火温度。基于 \(p_k\) 加权选取的视口特征 \(\hat{v}_t\) 输入至门控循环单元(GRU)进行时序拓扑更新,输出历史观测聚合嵌入 \(O_{\ge t}\),再经适配器映射为 token \(x_t\)。随着 \(z_t\) 的去噪演进,RGO 的搜索策略从最初的发散式探索自适应收敛为精确定向检视。
3. 教师知识蒸馏与闭环联合训练:推理轨迹与任务目标端到端优化 为了让连续潜空间中的假设向量 \(z_0\) 具有明确的语义指向,同时避免人工密集标注多步思维链的昂贵成本,框架设计了一套离线知识蒸馏机制。利用前沿大模型 GPT-5 作为被动教师,以全景图、问题、真实答案以及基于眼动热力图和抑制返向(Inhibition-of-Return)机制挑选的显著视口为上下文,生成高质量的自然语言推理推导过程(rationale)。该文本经语言编码器投影后的特征直接作为目标真实假设 \(z_0\)。整体网络通过多任务联合损失函数端到端训练: $\(\mathcal{L}_{\text{total}} = \mathcal{L}_{\text{diff}} + \lambda \mathcal{L}_{\text{cls}}\)$ 其中扩散损失 \(\mathcal{L}_{\text{diff}} = \mathbb{E}_{t, \boldsymbol{\epsilon}}[\|\boldsymbol{\epsilon} - s_\theta(z_t, t, c_t)\|^2]\) 监督 LHR 对去噪过程的准确重构,而任务分类损失 \(\mathcal{L}_{\text{cls}} = -\log p(y | z_0, c_0)\) 利用交叉熵监督最终 VLM 对答案的判别。两者联合优化促使策略网络 \(\pi_\phi\) 学习到的不仅是相关视野,更是能最大程度降低推理熵值的有效观测路径。
一个完整示例¶
考虑全景空间推理中的复杂多跳查询:“厨房是否与一个挂有吊灯的房间相连?” 1. 初始阶段(\(t=T\)):假设向量 \(z_T\) 处于全噪声状态,对应“需寻找厨房并探查相邻空间吊灯”。RGO 策略网络输出初级视口决策,定位到具有炉灶和橱柜的高显著性区域(视口 1,厨房)。 2. 第一轮去噪(\(t \to t-1\)):视口 1 的特征经 GRU 累积,LHR 结合问题完成第一步去噪,假设状态更新为“厨房已确认,下一步需寻找通往邻近房间的通道”。此时 RGO 忽略厨房内部高显著物体,主动选择看似低显著但具空间连通性的门廊边缘(视口 2)。 3. 最终收敛(\(t \to 0\)):视口 2 的门道特征输入 LHR,假设向量去噪收敛至 \(z_0\)(“已进入相邻大厅,需搜寻天花板光源”)。RGO 获得精准聚焦引导,直接转向天花板非显著区域抓取吊灯细节(视口 3),VLM 解码器基于充分的视觉证据自信输出最终答案“Yes”。
实验关键数据¶
主实验¶
论文在三个全景基准上开展评估:IQVA(动态全景视频关键帧 VQA)、360+X(全景多模态理解基准)以及 Zillow Indoor(ZInD 室内 360° 空间布局推理,分为单视口 Easy 与多视口跨区域 Hard 子集)。基线包括球面专用模型 SPHTR、高分辨率模型 SLiME-8B 以及强闭源基线 GPT-5 在三种输入格式下的表现。
| 模型 | 输入策略 | IQVA 准确率 (%) | 360+X 准确率 (%) | ZInD Easy (%) | ZInD Hard (%) |
|---|---|---|---|---|---|
| SPHTR | 等距柱状投影 (Equirectangular) | 45.96 | 48.26 | 57.73 | 23.55 |
| SLiME-8B | 等距柱状投影 (Equirectangular) | 41.78 | 48.62 | 61.48 | 28.46 |
| SLiME-8B | 立方体贴图 (Cubemap) | 46.50 | 54.18 | 63.90 | 33.35 |
| SLiME-8B | 显著性视口 (Saliency) | 53.43 | 54.41 | 65.85 | 34.14 |
| GPT-5 (Zero-shot) | 等距柱状投影 (Equirectangular) | 47.78 | 50.36 | 61.04 | 33.30 |
| GPT-5 (Zero-shot) | 立方体贴图 (Cubemap) | 53.42 | 56.47 | 65.82 | 35.49 |
| GPT-5 (Zero-shot) | 显著性视口 (Saliency) | 55.84 | 58.62 | 68.01 | 35.64 |
| DIVR + GLM-4.1V-9B | 主动闭环 (DIVR) | 56.61 | 63.77 | 71.33 | 41.36 |
| DIVR + Qwen2.5-VL-7B | 主动闭环 (DIVR) | 56.75 | 64.72 | 70.45 | 41.89 |
消融实验¶
消融实验以 Qwen2.5-VL-7B 为底座,深入剖析了推理模块(LHR)与感知策略(RGO)在各子任务上的独立与协同贡献:
| 推理模块配置 | 感知视口策略 | IQVA 准确率 (%) | 360+X 准确率 (%) | ZInD Easy (%) | ZInD Hard (%) |
|---|---|---|---|---|---|
| w/o LHR(直接证据推理) | 静态显著性预采样 (Saliency) | 52.69 | 56.72 | 67.30 | 36.98 |
| w/o LHR(直接证据推理) | 启发式 CLIP 相似度 (CLIP) | 53.22 | 57.90 | 67.57 | 39.23 |
| w/o LHR(直接证据推理) | 主动策略网络 (RGO) | 54.24 | 58.51 | 68.34 | 39.44 |
| LHR(扩散去噪精炼) | 静态显著性预采样 (Saliency) | 53.46 | 57.71 | 66.39 | 37.58 |
| LHR(扩散去噪精炼) | 启发式 CLIP 相似度 (CLIP) | 55.14 | 58.59 | 67.40 | 38.68 |
| LHR(扩散去噪精炼) | 主动策略网络 (RGO) | 56.75 | 64.72 | 70.45 | 41.89 |
关键发现¶
- 复杂多跳推理优势显著:DIVR 在需要跨房间、多角度收集线索的 ZInD Hard 数据集上提升最为显著,相对静态显著性 GPT-5 取得了超过 6.2% 的绝对准确率提升(41.89% vs 35.64%),证实了开环静态切片在复杂长程推理场景中的固有短板。
- 动态闭环优于特征调优:从等距柱状全景图切换为立方体贴图或显著性裁剪仅带来 2%~5% 的边际改善,而接入 DIVR 闭环感知机制后性能实现质的飞跃(360+X 从 55.92% 激增至 64.72%),证明性能提升的源泉是交互范式而非单纯的输入表征工程。
- 双模块高度协同:去掉 LHR(仅保留 RGO)或去掉 RGO(采用静态视口)均会导致模型性能明显回落;当二者结合时,学习到的视口序列在 IQVA 上相比人类凝视注视点展现出更高的扫描路径显著性(NSS 达到 0.49 对比基线的 0.36,KL 散度由 2.68 降至 2.34),表明模型学会了类人的目标驱动式探索。
- 推理步数具备弹性权衡:在计算代价与性能权衡中,仅采用 \(T=5\) 步反向扩散即可达到 38.46% 准确率(处理速度 3.57 QPS,已超越所有开环 baseline);拓展至 \(T=20\) 步时准确率进一步攀升至 41.89%(速度 1.08 QPS),展现了 test-time compute 调节灵活性。
亮点与洞察¶
- 将推理不确定性形式化为扩散去噪:巧妙地将概率扩散模型的去噪数学机制迁移到抽象思维链的信念更新中,避开了符号规划在部分可观测场景下的不可微与脆弱性,赋予连续状态向量动态自愈与迭代消除歧义的能力。
- Gumbel-Softmax 实现感知-推理端到端闭环:通过离散动作的可微连续松弛,使下游 VQA 分类损失能够直接回传指导上游视口选择策略,促使策略网络主动过滤非关键的视觉干扰,专注于逻辑推演瓶颈。
- 通用可迁移的主动感知框架:该范式不仅适用于 360° 图像,而且对超大分辨率千兆像素遥感解译、长视频时序自适应跳帧检视以及具身智能体的主动凝视控制等具有重要的跨任务借鉴价值。
局限与展望¶
- 计算时延随扩散步数线性增加:多步反向去噪过程需要在每个时间步串行计算视口特征与交叉注意力,导致推理延迟相对单阶段模型有所升高(\(T=20\) 时为 1.08 QPS),在超低延迟交互场景中存在部署开销。
- 依赖离线教师模型生成蒸馏伪标签:目标推理假设 \(z_0\) 依赖 GPT-5 结合先验知识的蒸馏,若离线教师在极冷门或复杂物理因果场景中产生幻觉推导,可能在潜空间引入先验噪声偏差。
- 未来改进方向:可探索引入一致性模型(Consistency Models)或少步快速采样技术将反向步长压缩至 2-4 步;同时结合在线强化学习(如 PPO/GRPO)直接以任务奖励为导向端到端自进化探索策略,摆脱对教师模型密集推导的强依赖。
相关工作与启发¶
- vs SPHTR / 静态全景模型:传统方法试图在特征提取层通过球面卷积或变形网络纠正全景图的几何拉伸,本质仍是被动开环感知;DIVR 将重点转移至动态序列采样,通过局部无畸变视口的主动规划彻底规避了几何扭曲与信息淹没。
- vs 具身 VQA(Embodied VQA)系统:具身探索方法将视觉推理与复杂的物理导航轨迹规划强行交织在一起,受制于奖励稀疏与 Sim2Real 差距;DIVR 剥离了物理位移的冗余物理约束,纯粹聚焦于“往哪看”的主动信息获取闭环,建立了一个轻量、稳健且数学形式完备的推理机制。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ [首次将去噪扩散模型与 360° 沉浸式主动视口选择深度结合,开创了感知-推理动态闭环新范式]
- 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 3 个全景基准、多尺度输入策略、细致的模块与时序耦合消融,以及与人类眼动热力的系统对比]
- 写作质量: ⭐⭐⭐⭐⭐ [数学推导严谨,动机阐述层次清晰,质性推理轨迹对比图直观且具有说服力]
- 价值: ⭐⭐⭐⭐⭐ [为局部可观测大场景下的多模态大模型推理提供了极具启发性的概率演化解题思路]