CabinSI: Omni-Cabin Spatial Reasoning through Explicit Visual Cognitive Maps¶
会议: ECCV2026
论文: https://eccv.ecva.net/virtual/2026/poster/3315
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/916.pdf
领域: 视觉语言推理
关键词: 全座舱空间推理、多视角理解、视觉认知地图、参考系变换、指代表达定位
一句话总结¶
CabinSI 用 3,758 个真实场景样本评估车内外空间关系与指代定位,并把多相机观察转换成问题相关的俯视认知地图,使 Qwen2.5-VL-7B 在 RelCabin 上的总体准确率从 25.31% 提升到 41.17%,但感知误差与跨座舱定位仍是明显瓶颈。
研究背景与动机¶
智能座舱中的“左边”并不是一个固定的图像方向。乘客说“我左后方的苹果”,模型既要识别说话者及其参考方向,也要把其他相机看到的物体放回共同空间;当指令变成“那辆白车”时,车内的手势或朝向又可能决定应当选择哪一个车外目标。Talk2Car、DriveLM 等基准主要围绕外部交通环境,多图输入本身也不保证模型理解各幅画面的几何对应关系。
这种困难不能简单归结为物体识别能力不足。即使每个画面都能找到车、乘客和障碍物,模型仍可能把图像左侧误当成目标对象的左侧,或被重复视角和背景细节干扰。CabinSI 因而同时评估 RelCabin 的关系回答与 RefCabin 的目标定位,并要求部分样本真正依赖多视角或车内外信息,而不是给单图问题附加几张无关图片。
作者进一步借鉴 Ego3D-VLM 的认知地图:先解决“哪些对象相关、它们在共同参考系中在哪里”,再让多模态大模型处理关系。核心 idea:把多视角像素中的空间关系外化为问题相关的俯视地图,让模型读一个简化但几何对齐的场景,而不是在杂乱的原始图像中隐式完成参考系转换。
方法详解¶
整体框架¶
输入是同步的多视角图像和自然语言问题,输出按任务分为方向答案或目标定位结果。共同前端经过问题预解析、目标检测与深度投影,形成带语义标签的二维认知地图;RelCabin 在图上判断相对方向,RefCabin 则结合属性和位置约束选择目标节点。方向估计在 RefCabin 中是可选组件,不应理解成所有实验都使用了精确的人体朝向。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
Input["同步多视角图像<br/>自然语言问题"] --> Parse["问题预解析"]
Parse --> Map["几何认知地图"]
Orient["可选方向估计"] -.-> Map
Map --> Relation["地图关系推理"]
Map --> Selection["地图节点选择"]
Relation --> Answer["RelCabin 方向答案"]
Selection --> Box["RefCabin 目标定位"]
关键设计¶
1. 问题预解析:先明确要看哪些对象与视角
直接把整句指令交给检测器,或把所有相机中的对象都放进地图,会把语言歧义和视觉冗余一并带入推理。作者先让 LLM 解析问题,提取涉及的对象及语义上需要的视角,再用指代表达理解模型在相应图像中获得边界框。这里既要保留待查询对象,也要保留参考对象;例如问“从黑色轿车的角度看,自车在哪里”,只检出黑色轿车并不足以求解两者关系。
这种筛选不是几何推理的替代,而是决定几何前端处理什么。论文比较了完整句子、规则提取对象与 GPT 提取对象:在同样仅输入地图的条件下,规则方案为 37.48%,GPT 方案为 47.46%。这说明高质量语义定位是地图有效的前提,不能把最终收益全部归给深度估计或俯视渲染。缓存没有给出完整解析提示词,因而不能据此声称具有可直接复现的提示模板。
2. 几何认知地图:让不同相机中的位置共享一个参考系
几何前端沿用 Ego3D-VLM 的基本路线:取检测框中心,在该像素读取度量深度,用相机内参反投影到相机坐标系,再通过已知或估计的外参转换到统一坐标系。原文还说明以行人、轿车等类别的典型尺寸进行关系尺度归一化,以缓解深度不准导致的距离失真。这里用的是物体中心的近似位置,不是重建每个物体的完整三维形状;中心深度落在遮挡物上时,后续推理仍可能使用错误布局。
CabinSI 的关键调整是将这些位置压缩成统一俯视平面的对象节点,并渲染成带标签和前后左右方向的视觉地图。原文用 \(M=\{(o_i,x_i,y_i)\}_{i=1}^{N}\) 描述它,其中 \(o_i\) 是语义对象实例,\((x_i,y_i)\) 是共享平面坐标。作者追求的是足以保持相对关系的近似布局,而非高精度三维重建;地图的“图”属性主要体现为显式节点与可计算的空间关系,论文没有提出新的图神经网络。
检测框、对象身份、来源视角与地图节点之间需要保持对应,才能让后续节点选择关联回图像目标。原文给出了这些输入输出关系,但没有充分展开跨视角重复实例合并、具体标定误差处理或坐标归一化参数。缓存中的投影公式存在抽取损坏,这里只保留文字明确支持的流程,不把补写的标准投影式冒充论文原式。
3. 地图关系推理:让 RelCabin 只读空间结构
对 RelCabin,最终 MLLM 接收问题和渲染后的认知地图,而不接收地图的文本序列化;最佳消融配置还去掉了原始相机图像。视觉地图上仍可有对象名称与方向标签,“不用文本地图”不是“图上不能出现文字”,而是不额外提供一份坐标列表让模型从文本求答案。地图将外观识别已经产生的结果固定下来,使问题更接近在统一坐标系中做参考对象定位、视角转换和方向分区。
例如相机图像中一个对象出现在右侧,不代表它在问题所指定参考对象的右侧。统一布局把两种方向区分开,模型应围绕参考对象解释前后左右。论文把这一能力交给读取地图的 MLLM,没有提供足够信息把它描述为一套已实现、完全确定的角度阈值分类器。去掉原图后的增益也很重要:同为 GPT 实体解析与图像地图,保留目标视角时为 35.06%,不保留原图时为 47.46%,表明更多视觉证据在此并不必然更好。
4. 地图节点选择:把 RefCabin 定位变成带约束的候选消歧
RefCabin 不仅需要回答方向,还要确定指令指的是哪个对象。作者先生成候选,再把表达拆成类别、颜色、身份等语义属性,以及“在栏杆处”“在自车旁边”等关系约束,在认知地图上联合判断。可选的方向估计能为乘客指向或朝向相关表达提供额外信息。与直接生成坐标相比,这种方式使输出首先受现有候选对象约束,而不是让语言模型凭图像印象自由输出一个框。
原文将目标选择表示为以下形式;这里仅规范化缓存中被拆散的排版,\(\mathcal O\) 表示候选对象集合:
\(f_{\mathrm{sel}}\) 联合衡量语义相容性与空间一致性。空间表达可对应邻近阈值或相对次序等几何谓词,但原文没有给出评分权重、阈值数值或新的可训练打分器。应把这个式子理解为节点选择的任务定义,而非已经公开全部细节的优化算法。选中的节点对应图像中的候选目标,最终仍按边界框定位准确率评估;候选漏检时,地图不能凭空恢复一个正确目标。
一个完整示例¶
以论文图 5 的问题为例:从前视图中停在栏杆旁的黑色 BMW 掀背车的视角看,自车在哪里?预解析先明确黑色 BMW、自车及相关前向视角;定位和深度信息随后把这两个对象放入共同俯视平面,而不是直接使用各相机里的左右位置。MLLM 在地图上以 BMW 为参考判断自车方向,图示答案为“后方”。
如果问题改为图 6 的“定位栏杆旁的那辆黑色 BMW 掀背车”,同一布局的用途就变为候选选择:颜色与车型缩小语义候选,和栏杆的空间关系完成消歧,再输出相应目标。这里复述的是论文示意流程,没有虚构候选数量、坐标、置信度或成功率。
损失函数 / 训练策略¶
论文把认知地图构造作为现有模型之上的后处理式流程,主要实验改变输入表示与推理方式,而非提出新的端到端训练目标。缓存没有报告新的损失函数、学习率、训练轮数或完整训练划分,不应补成“使用某种监督微调训练地图生成器”。由图像生成模型直接产出地图是作者提出的未来方向,不是本文已经完成的训练模块。
实验关键数据¶
CabinSI 共 3,758 个样本,含 1,121 个 RelCabin 和 2,637 个 RefCabin。RelCabin 的车内单视角、车内多视角、车外多视角分别为 250、101、770 个;RefCabin 的统计段落列出 250 个车内单视角、194 个车内多视角、514 个车外单视角和 1,679 个跨座舱多视角样本。
RelCabin 的开放问答由 LLM 判断预测与真实方向是否语义一致,选择题则按选项匹配计算准确率。RefCabin 以预测框与任一真实框的 IoU 严格大于 0.5 为正确。下表准确率均为百分数,增益用百分点,不混作相对百分比。
主实验¶
| RelCabin 骨干 | 原始输入 Overall | 加入本文框架 Overall | 增益 |
|---|---|---|---|
| Qwen2.5-VL-7B | 25.31 | 41.17 | +15.86 |
| Qwen3-VL-4B | 27.17 | 44.46 | +17.29 |
| Qwen3-VL-8B | 33.59 | 45.92 | +12.33 |
来源为原文表 2。三个规模均受益,但最好的总体结果仍只有 45.92%,不能据此认为座舱空间理解已接近解决。
消融实验¶
| RelCabin 车外多视角配置 | 原图输入 | 地图表示 | 准确率 |
|---|---|---|---|
| 原始基线 | 多视角 | 无 | 30.09 |
| 规则实体解析 | 全部多视角 | 图像 | 32.99 |
| 规则实体解析 | 仅目标视角 | 图像 | 33.15 |
| 规则实体解析 | 无 | 图像 | 37.48 |
| GPT 实体解析 | 仅目标视角 | 文本加图像 | 33.20 |
| GPT 实体解析 | 仅目标视角 | 图像 | 35.06 |
| GPT 实体解析 | 无 | 图像 | 47.46 |
来源为原文表 3。只改变视角筛选时,32.99 到 33.15 仅增加 0.16 个百分点;在仅地图条件下改进实体解析,37.48 到 47.46 增加 9.98 个百分点;同为 GPT 解析与图像地图,去掉目标视角原图带来 12.40 个百分点增益。不同因素存在组合关系,不能把这些差值相加当作独立贡献。
| RefCabin 配置,Qwen2.5-VL-7B | 车内单视角 | 车内多视角 | 跨座舱多视角 | Overall |
|---|---|---|---|---|
| 直接预测框 | 49.41 | 14.95 | 未报告 | 未报告 |
| 候选生成加选择,无地图 | 48.26 | 22.16 | 29.32 | 39.48 |
| 候选生成加选择,有地图 | 52.90 | 24.23 | 30.33 | 40.40 |
来源为原文表 4,选列展示而非重新计算 Overall。地图相对已有候选选择方案的跨座舱增益为 1.01 个百分点,总体增益为 0.92 个百分点;车内多视角中,候选选择本身先带来 7.21 个百分点,地图再带来 2.07 个百分点。表 4 另列车外多视角结果,但统计段落没有对应的 RefCabin 子集数量,因此这里不猜测其样本来源或总体聚合分母。
关键发现¶
- 人工地图实验表 5 的标题说明每种设置 100 个样本、共 300 个。GPT-5.2 的车内单视角、车内多视角和车外多视角准确率分别从 17、12、38 提升到 96、95、74,支持“布局质量限制推理”的解释。
- 人工地图并非对每个模型、每个子集都更好:Qwen2.5-VL-7B 在车外多视角上,预测地图为 50,人工地图为 38。不能沿用正文的概括,把人工地图称为严格性能上界。
- 表 5 的 Overall 不是三个各 100 样本子集的简单平均,缓存未明确其聚合权重。以上仅比较原表的子集值,不把它与全量主实验混算。
亮点与洞察¶
- 把“多图理解”推进到“共同参考系理解”。地图不是给模型添加一份描述,而是主动移除与空间判断无关的外观信息,消融中去掉原图反而获益正是这一设计的证据。
- 关系推理与指代定位共享对象布局,但保留不同输出协议。这让研究者能区分模型不会判方向,还是候选生成及目标消歧出了问题,而不是用一个混合分数掩盖失败来源。
- 可迁移的是任务相关的空间中间表示,而非必须追求精确三维重建。用于室内交互等场景时,可先验证位置与参考方向是否足够,再决定是否需要昂贵的几何精度。
局限与展望¶
- 作者指出遮挡、杂乱布局和跨座舱关系仍然困难,主要瓶颈在地图感知质量。深度、检测、标定或实体解析的错误都会进入中间表示,去掉原图也意味着推理模型失去回看外观纠错的机会。
- 从读者角度看,近似二维布局对高度、伸手交互和姿态变化的表达能力有限。可考虑带不确定性的节点、局部高度信息,以及仅在证据冲突时回查原始视角,但这些均是改进建议,不是论文已验证的模块。
- 实验报告存在需要澄清之处:RefCabin 子集统计与表 4 不完全对应;人工地图实验的总体聚合口径不清。缓存也未给出充分的跨视角实例合并、完整提示词、时延和组件成本信息,复现与部署仍有缺口。
- 跨座舱定位仅为 30.33%,且没有报告端到端安全交互验证。不能把离线定位和问答结果外推为可可靠执行车辆操作的系统。
相关工作与启发¶
- 与 Ego3D-VLM 相比:本文继承检测、深度及统一坐标的认知地图路线,重点调整为问题筛选后的视觉俯视表示,并扩展到座舱内外任务。价值在任务定义与表示选择的验证,不应表述为首次发明认知地图。
- 与 Talk2Car、DriveLM 相比:这些工作主要围绕车外语言定位或驾驶问答,CabinSI 强调乘客与外部目标之间的共同参考系。基准范围不同,不能用本文准确率直接比较它们的整体优劣。
- 与直接多视角 MLLM 推理相比:本文把空间结构显式化,降低原图中的干扰,但增加了对前端几何正确性的依赖。一个有价值的后续实验是系统扰动地图位置及朝向,区分模型对布局噪声和语言歧义的敏感度。
评分¶
- 新颖性:4/5。全座舱任务和纯视觉认知地图输入有明确价值,几何前端主要继承已有工作。
- 实验充分度:3/5。覆盖多个骨干、输入消融与人工地图分析,但统计口径和复现细节尚不充分。
- 写作质量:3/5。核心流程直观,部分结果概括过强,表格与统计说明仍需对齐。
- 价值:4/5。为座舱空间智能提供了可分解的评测入口,同时清楚暴露了感知与推理之间的瓶颈。