跳转至

CabinSI: Omni-Cabin Spatial Reasoning through Explicit Visual Cognitive Maps

会议: ECCV2026
论文: https://eccv.ecva.net/virtual/2026/poster/3315
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/916.pdf
领域: 视觉语言推理
关键词: 全座舱空间推理、多视角理解、视觉认知地图、参考系变换、指代表达定位

一句话总结

CabinSI 用 3,758 个真实场景样本评估车内外空间关系与指代定位,并把多相机观察转换成问题相关的俯视认知地图,使 Qwen2.5-VL-7B 在 RelCabin 上的总体准确率从 25.31% 提升到 41.17%,但感知误差与跨座舱定位仍是明显瓶颈。

研究背景与动机

智能座舱中的“左边”并不是一个固定的图像方向。乘客说“我左后方的苹果”,模型既要识别说话者及其参考方向,也要把其他相机看到的物体放回共同空间;当指令变成“那辆白车”时,车内的手势或朝向又可能决定应当选择哪一个车外目标。Talk2Car、DriveLM 等基准主要围绕外部交通环境,多图输入本身也不保证模型理解各幅画面的几何对应关系。

这种困难不能简单归结为物体识别能力不足。即使每个画面都能找到车、乘客和障碍物,模型仍可能把图像左侧误当成目标对象的左侧,或被重复视角和背景细节干扰。CabinSI 因而同时评估 RelCabin 的关系回答与 RefCabin 的目标定位,并要求部分样本真正依赖多视角或车内外信息,而不是给单图问题附加几张无关图片。

作者进一步借鉴 Ego3D-VLM 的认知地图:先解决“哪些对象相关、它们在共同参考系中在哪里”,再让多模态大模型处理关系。核心 idea:把多视角像素中的空间关系外化为问题相关的俯视地图,让模型读一个简化但几何对齐的场景,而不是在杂乱的原始图像中隐式完成参考系转换。

方法详解

整体框架

输入是同步的多视角图像和自然语言问题,输出按任务分为方向答案或目标定位结果。共同前端经过问题预解析、目标检测与深度投影,形成带语义标签的二维认知地图;RelCabin 在图上判断相对方向,RefCabin 则结合属性和位置约束选择目标节点。方向估计在 RefCabin 中是可选组件,不应理解成所有实验都使用了精确的人体朝向。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    Input["同步多视角图像<br/>自然语言问题"] --> Parse["问题预解析"]
    Parse --> Map["几何认知地图"]
    Orient["可选方向估计"] -.-> Map
    Map --> Relation["地图关系推理"]
    Map --> Selection["地图节点选择"]
    Relation --> Answer["RelCabin 方向答案"]
    Selection --> Box["RefCabin 目标定位"]

关键设计

1. 问题预解析:先明确要看哪些对象与视角

直接把整句指令交给检测器,或把所有相机中的对象都放进地图,会把语言歧义和视觉冗余一并带入推理。作者先让 LLM 解析问题,提取涉及的对象及语义上需要的视角,再用指代表达理解模型在相应图像中获得边界框。这里既要保留待查询对象,也要保留参考对象;例如问“从黑色轿车的角度看,自车在哪里”,只检出黑色轿车并不足以求解两者关系。

这种筛选不是几何推理的替代,而是决定几何前端处理什么。论文比较了完整句子、规则提取对象与 GPT 提取对象:在同样仅输入地图的条件下,规则方案为 37.48%,GPT 方案为 47.46%。这说明高质量语义定位是地图有效的前提,不能把最终收益全部归给深度估计或俯视渲染。缓存没有给出完整解析提示词,因而不能据此声称具有可直接复现的提示模板。

2. 几何认知地图:让不同相机中的位置共享一个参考系

几何前端沿用 Ego3D-VLM 的基本路线:取检测框中心,在该像素读取度量深度,用相机内参反投影到相机坐标系,再通过已知或估计的外参转换到统一坐标系。原文还说明以行人、轿车等类别的典型尺寸进行关系尺度归一化,以缓解深度不准导致的距离失真。这里用的是物体中心的近似位置,不是重建每个物体的完整三维形状;中心深度落在遮挡物上时,后续推理仍可能使用错误布局。

CabinSI 的关键调整是将这些位置压缩成统一俯视平面的对象节点,并渲染成带标签和前后左右方向的视觉地图。原文用 \(M=\{(o_i,x_i,y_i)\}_{i=1}^{N}\) 描述它,其中 \(o_i\) 是语义对象实例,\((x_i,y_i)\) 是共享平面坐标。作者追求的是足以保持相对关系的近似布局,而非高精度三维重建;地图的“图”属性主要体现为显式节点与可计算的空间关系,论文没有提出新的图神经网络。

检测框、对象身份、来源视角与地图节点之间需要保持对应,才能让后续节点选择关联回图像目标。原文给出了这些输入输出关系,但没有充分展开跨视角重复实例合并、具体标定误差处理或坐标归一化参数。缓存中的投影公式存在抽取损坏,这里只保留文字明确支持的流程,不把补写的标准投影式冒充论文原式。

3. 地图关系推理:让 RelCabin 只读空间结构

对 RelCabin,最终 MLLM 接收问题和渲染后的认知地图,而不接收地图的文本序列化;最佳消融配置还去掉了原始相机图像。视觉地图上仍可有对象名称与方向标签,“不用文本地图”不是“图上不能出现文字”,而是不额外提供一份坐标列表让模型从文本求答案。地图将外观识别已经产生的结果固定下来,使问题更接近在统一坐标系中做参考对象定位、视角转换和方向分区。

例如相机图像中一个对象出现在右侧,不代表它在问题所指定参考对象的右侧。统一布局把两种方向区分开,模型应围绕参考对象解释前后左右。论文把这一能力交给读取地图的 MLLM,没有提供足够信息把它描述为一套已实现、完全确定的角度阈值分类器。去掉原图后的增益也很重要:同为 GPT 实体解析与图像地图,保留目标视角时为 35.06%,不保留原图时为 47.46%,表明更多视觉证据在此并不必然更好。

4. 地图节点选择:把 RefCabin 定位变成带约束的候选消歧

RefCabin 不仅需要回答方向,还要确定指令指的是哪个对象。作者先生成候选,再把表达拆成类别、颜色、身份等语义属性,以及“在栏杆处”“在自车旁边”等关系约束,在认知地图上联合判断。可选的方向估计能为乘客指向或朝向相关表达提供额外信息。与直接生成坐标相比,这种方式使输出首先受现有候选对象约束,而不是让语言模型凭图像印象自由输出一个框。

原文将目标选择表示为以下形式;这里仅规范化缓存中被拆散的排版,\(\mathcal O\) 表示候选对象集合:

\[ o^*=\arg\max_{o_i\in\mathcal O} f_{\mathrm{sel}}(o_i,q_{\mathrm{ref}}). \]

\(f_{\mathrm{sel}}\) 联合衡量语义相容性与空间一致性。空间表达可对应邻近阈值或相对次序等几何谓词,但原文没有给出评分权重、阈值数值或新的可训练打分器。应把这个式子理解为节点选择的任务定义,而非已经公开全部细节的优化算法。选中的节点对应图像中的候选目标,最终仍按边界框定位准确率评估;候选漏检时,地图不能凭空恢复一个正确目标。

一个完整示例

以论文图 5 的问题为例:从前视图中停在栏杆旁的黑色 BMW 掀背车的视角看,自车在哪里?预解析先明确黑色 BMW、自车及相关前向视角;定位和深度信息随后把这两个对象放入共同俯视平面,而不是直接使用各相机里的左右位置。MLLM 在地图上以 BMW 为参考判断自车方向,图示答案为“后方”。

如果问题改为图 6 的“定位栏杆旁的那辆黑色 BMW 掀背车”,同一布局的用途就变为候选选择:颜色与车型缩小语义候选,和栏杆的空间关系完成消歧,再输出相应目标。这里复述的是论文示意流程,没有虚构候选数量、坐标、置信度或成功率。

损失函数 / 训练策略

论文把认知地图构造作为现有模型之上的后处理式流程,主要实验改变输入表示与推理方式,而非提出新的端到端训练目标。缓存没有报告新的损失函数、学习率、训练轮数或完整训练划分,不应补成“使用某种监督微调训练地图生成器”。由图像生成模型直接产出地图是作者提出的未来方向,不是本文已经完成的训练模块。

实验关键数据

CabinSI 共 3,758 个样本,含 1,121 个 RelCabin 和 2,637 个 RefCabin。RelCabin 的车内单视角、车内多视角、车外多视角分别为 250、101、770 个;RefCabin 的统计段落列出 250 个车内单视角、194 个车内多视角、514 个车外单视角和 1,679 个跨座舱多视角样本。

RelCabin 的开放问答由 LLM 判断预测与真实方向是否语义一致,选择题则按选项匹配计算准确率。RefCabin 以预测框与任一真实框的 IoU 严格大于 0.5 为正确。下表准确率均为百分数,增益用百分点,不混作相对百分比。

主实验

RelCabin 骨干 原始输入 Overall 加入本文框架 Overall 增益
Qwen2.5-VL-7B 25.31 41.17 +15.86
Qwen3-VL-4B 27.17 44.46 +17.29
Qwen3-VL-8B 33.59 45.92 +12.33

来源为原文表 2。三个规模均受益,但最好的总体结果仍只有 45.92%,不能据此认为座舱空间理解已接近解决。

消融实验

RelCabin 车外多视角配置 原图输入 地图表示 准确率
原始基线 多视角 30.09
规则实体解析 全部多视角 图像 32.99
规则实体解析 仅目标视角 图像 33.15
规则实体解析 图像 37.48
GPT 实体解析 仅目标视角 文本加图像 33.20
GPT 实体解析 仅目标视角 图像 35.06
GPT 实体解析 图像 47.46

来源为原文表 3。只改变视角筛选时,32.99 到 33.15 仅增加 0.16 个百分点;在仅地图条件下改进实体解析,37.48 到 47.46 增加 9.98 个百分点;同为 GPT 解析与图像地图,去掉目标视角原图带来 12.40 个百分点增益。不同因素存在组合关系,不能把这些差值相加当作独立贡献。

RefCabin 配置,Qwen2.5-VL-7B 车内单视角 车内多视角 跨座舱多视角 Overall
直接预测框 49.41 14.95 未报告 未报告
候选生成加选择,无地图 48.26 22.16 29.32 39.48
候选生成加选择,有地图 52.90 24.23 30.33 40.40

来源为原文表 4,选列展示而非重新计算 Overall。地图相对已有候选选择方案的跨座舱增益为 1.01 个百分点,总体增益为 0.92 个百分点;车内多视角中,候选选择本身先带来 7.21 个百分点,地图再带来 2.07 个百分点。表 4 另列车外多视角结果,但统计段落没有对应的 RefCabin 子集数量,因此这里不猜测其样本来源或总体聚合分母。

关键发现

  • 人工地图实验表 5 的标题说明每种设置 100 个样本、共 300 个。GPT-5.2 的车内单视角、车内多视角和车外多视角准确率分别从 17、12、38 提升到 96、95、74,支持“布局质量限制推理”的解释。
  • 人工地图并非对每个模型、每个子集都更好:Qwen2.5-VL-7B 在车外多视角上,预测地图为 50,人工地图为 38。不能沿用正文的概括,把人工地图称为严格性能上界。
  • 表 5 的 Overall 不是三个各 100 样本子集的简单平均,缓存未明确其聚合权重。以上仅比较原表的子集值,不把它与全量主实验混算。

亮点与洞察

  • 把“多图理解”推进到“共同参考系理解”。地图不是给模型添加一份描述,而是主动移除与空间判断无关的外观信息,消融中去掉原图反而获益正是这一设计的证据。
  • 关系推理与指代定位共享对象布局,但保留不同输出协议。这让研究者能区分模型不会判方向,还是候选生成及目标消歧出了问题,而不是用一个混合分数掩盖失败来源。
  • 可迁移的是任务相关的空间中间表示,而非必须追求精确三维重建。用于室内交互等场景时,可先验证位置与参考方向是否足够,再决定是否需要昂贵的几何精度。

局限与展望

  • 作者指出遮挡、杂乱布局和跨座舱关系仍然困难,主要瓶颈在地图感知质量。深度、检测、标定或实体解析的错误都会进入中间表示,去掉原图也意味着推理模型失去回看外观纠错的机会。
  • 从读者角度看,近似二维布局对高度、伸手交互和姿态变化的表达能力有限。可考虑带不确定性的节点、局部高度信息,以及仅在证据冲突时回查原始视角,但这些均是改进建议,不是论文已验证的模块。
  • 实验报告存在需要澄清之处:RefCabin 子集统计与表 4 不完全对应;人工地图实验的总体聚合口径不清。缓存也未给出充分的跨视角实例合并、完整提示词、时延和组件成本信息,复现与部署仍有缺口。
  • 跨座舱定位仅为 30.33%,且没有报告端到端安全交互验证。不能把离线定位和问答结果外推为可可靠执行车辆操作的系统。

相关工作与启发

  • 与 Ego3D-VLM 相比:本文继承检测、深度及统一坐标的认知地图路线,重点调整为问题筛选后的视觉俯视表示,并扩展到座舱内外任务。价值在任务定义与表示选择的验证,不应表述为首次发明认知地图。
  • 与 Talk2Car、DriveLM 相比:这些工作主要围绕车外语言定位或驾驶问答,CabinSI 强调乘客与外部目标之间的共同参考系。基准范围不同,不能用本文准确率直接比较它们的整体优劣。
  • 与直接多视角 MLLM 推理相比:本文把空间结构显式化,降低原图中的干扰,但增加了对前端几何正确性的依赖。一个有价值的后续实验是系统扰动地图位置及朝向,区分模型对布局噪声和语言歧义的敏感度。

评分

  • 新颖性:4/5。全座舱任务和纯视觉认知地图输入有明确价值,几何前端主要继承已有工作。
  • 实验充分度:3/5。覆盖多个骨干、输入消融与人工地图分析,但统计口径和复现细节尚不充分。
  • 写作质量:3/5。核心流程直观,部分结果概括过强,表格与统计说明仍需对齐。
  • 价值:4/5。为座舱空间智能提供了可分解的评测入口,同时清楚暴露了感知与推理之间的瓶颈。