CrossView: Can Vision-Language Models Reason Across Cameras?¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://utaustin-swarmlab.github.io/CrossView
领域: LLM推理
关键词: 多相机协同推理, 视觉语言模型, 跨视角视频问答, 时空场景图, 上下文缩放
一句话总结¶
针对现有视觉语言模型普遍基于单相机评测的局限,本文构建了首个涵盖自动驾驶、安防监控、人机交互与机器人操作四大真实多视角领域的评测基准 CrossView,揭示出现有前沿 VLM 在跨机时空缝合、跨视角实例计数与最优视角选择等任务上存在普遍而显著的多相机推理鸿沟。
研究背景与动机¶
现代大型视觉语言模型(LVLM)与长视频理解基准(如 Video-MME、LongVideoBench 等)在单视角视频问答上已逼近饱和水准,甚至在多项基准上达到了接近人类的准确率。然而,在自动驾驶、全域智能安防监控、第一人称人机协同以及机器人灵巧操作等实际部署场景中,物理系统无一例外依赖于多相机传感器网络构成的多重视角——自动驾驶系统需要实时融合环视相机的视野以通过复杂路口,机械臂需要联动腕部相机与头顶俯视相机以实现精准避障与抓取,安防系统则需要在离散且视场不重叠的广域监控流中追踪目标。
然而,多相机视频理解绝非单相机任务的数据量简单线性叠加,它带来了两项前沿模型从未在预训练中系统学习过的质性挑战:一是上下文规模暴增(Context Scaling),当输入由 \(N\) 路并发视频流构成时,所需的视觉 token 上下文呈数量级扩展,迅速击穿了现存长上下文模型的有效注意力窗口;二是跨视角时空几何推理(Cross-View Spatial Reasoning),模型不仅需要单视角的时序与视觉理解,更必须执行“时空缝合(spatio-temporal stitching)”,即辨别视野重叠与非重叠区域、判断哪个视角为特定子任务提供最具决定性的线索(相机识别与视角选择)、跨分散视角排重并聚合证据(如全局物体实例计数),以及跨异构机位进行时序动作因果溯源。
现有涉及多相机的数据集要么高度特化于低层感知与鸟瞰图(BEV)几何重建(如 nuScenes-QA 局限于单一视角的感知问答,nuScenes 传统任务仅输出 3D 边界框与轨迹),要么仅聚焦于狭隘的动作熟练度分析(如 Ego-Exo4D),普遍缺乏迫使模型直接对原始、并发、多路异构视频流进行端到端语义时空推理的系统化基准。核心 idea:本文构建了跨越 4 个核心领域、包含 6,000 个复杂问答对的多相机视频问答基准 CrossView,通过两阶段时空场景图与程序化生成引擎构建天然需要跨机证据整合的问题,全面压力测试并量化当前 VLM 的跨相机推理盲区。
方法详解¶
整体框架¶
CrossView 的基准构建采用严密的“两阶段生成管线(Two-Stage Pipeline)”:第一阶段构建时空场景图(Spatio-Temporal Scene Graph, STSG),对来自多源多相机异构数据集的几何坐标、激光雷达点云、物体轨迹以及高阶语义活动描述进行全局对齐与时间间隔合并;第二阶段采用程序化锚点-目标生成引擎(Grounding-Target Question Generation Engine),严格依据 STSG 的拓扑约束采样事件锚点、目标问答元组以及针对性的干扰项,最终借助语言模型润色为无幻觉的自然语言多选与摘要问题。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["多源多相机数据源<br/>nuScenes / MEVA / Ego-Exo4D / AgiBot"] --> B["阶段1:时空场景图构建 (STSG)<br/>点云/边界框对齐 + VLM语义动作标注 + 关系图快照"]
B --> C["阶段2:程序化锚点-目标问答生成引擎<br/>时空谓词采样 + 拓扑因果约束 + 三类负样本生成"]
C --> D["跨视角任务体系分类<br/>时序排序 / 空间关系 / 实例计数 / 最优视角 / 场景摘要"]
D --> E["多视角视觉输入评估策略<br/>Uniform独立采样 vs. Stitched拼接全景采样"]
关键设计¶
1. 时空场景图构建 (STSG):多源异构感知元数据的统一时空沉淀 为了杜绝问答生成中大模型的逻辑幻觉,基准构建的第一步必须建立在具备严格物理时空约束的结构化知识底座之上。STSG 将 nuScenes(自动驾驶)、MEVA(广域安防监控)、Ego-Exo4D(第一/第三人称协同)与 AgiBot(双臂具身操作)四大源数据集统一重构。针对定位数据,nuScenes 引入 3D LiDAR 点云精细化标定物体空间坐标,其余数据集则融合原生 3D 或 2D 边界框轨迹;针对语义动作,对于缺乏原生细粒度描述的 nuScenes 与 AgiBot,利用 InternVL-3.5 38B 对裁剪目标边界框执行以物体为中心的活动识别,Ego-Exo4D 与 MEVA 则直接对齐原生动作标签;随后利用 GPT-5.2 在时间戳级别聚合得到全场景描述。在此基础上,引擎计算相机全视角下所有实体两两之间的空间方向谓词(如 behind、near、left、right)、三维朝向偏角差以及相对欧氏距离,并将物体维持相同活动的连续时间戳区间聚合为事件时隙 \([t_{start}, t_{end}]\)。最终,每个时间戳 \(t\) 产生图快照 \(G_t = (N_t, E_t)\) 并按时间顺序串联成全景场景图 \(G\)。
2. 程序化锚点-目标问答生成引擎:基于拓扑图查询的硬核跨视角问答合成 为了确保生成的 6,000 道题目无法被单相机投机取巧解答,生成引擎采用“锚点-目标(Grounding-Target)”架构直接对 STSG 执行结构化图查询。时序维度上,采样锚点事件 \(E_g\) 与目标事件 \(E_t\),建立严密的时序算子(Before: \(E_t.end < E_g.start\);After: \(E_t.start > E_g.end\);During: 两个事件的时序交集超过短事件时长的 50%;In-between: 目标事件完全落在不重叠的两个锚点事件时隙之间)。空间维度上,延伸出空间到时序(以某一相机捕捉的空间相对状态为锚点,查询紧接着发生的目标活动)与时序到空间(以特定时序动作为边界,查询对应时空中另一相机的空间相对布局)两类交叉问答。为防止大模型通过语言先验走捷径,引擎系统化注入三类硬负样本:空间干扰项(同一时间但错误空间方向)、时序干扰项(正确事件但发生于错误时段)以及存在性干扰项(场景中压根不存在的目标物体)。
3. 多任务跨视角评测体系:全方位考察多相机核心推理能力 基准精细划分出六大类评测任务,总计 6,000 道题目(每类 1,000 题;覆盖 2 到 8 个并发同步视频流): - 时序推理与事件排序(Temporal & Event Ordering):考察从交替切换、并发演进的多个视频流中还原 3 到 5 个离散事件严格真实发生顺序的能力。 - 跨视角空间几何推理(Spatial Reasoning):针对非自身参考系(Frame-of-Reference)计算三维四元数旋转与局部相对坐标,评测跨镜头真实世界公制空间临近度判断。 - 跨镜头实例计数(Cross-View Counting):必须跨越多个有遮挡、视角重叠或目标跨视场移动的机位,追踪全局唯一身份标识符(UID),杜绝重复计数或漏计。 - 最优视角选择(Best-Camera Selection / Camera-ID):根据特定动作的遮挡关系与清晰度,从 2-8 个机位中判断哪个相机提供了最长久、无遮挡的核心视觉证据。 - 全局场景摘要(Global Scene Summarization):对跨相机的全域时空演进给出综合叙述,采用 ROUGE 指标独立评估。
4. 视角组织模式对比(Uniform vs. Stitched):上下文结构对跨机理解的影响 为了探索输入表示形式对跨视角时空对齐的影响,研究对比了两种主流组织方案:一是 Uniform 独立采样,即每路相机视频流各自均匀抽取 \(N\) 帧(Qwen、GPT、Gemma 设为 16 帧/相机;InternVL 设为 4~8 帧),作为交错的多图/视频序列输入;二是 Stitched 空间拼接采样,在同一时间戳下将所有机位画面拼接为一张统一的全景复合大图,再随时间采样拼接序列。该对比直接揭示了不同模型在多图注意力机制与单图多宫格空间注意力分配上的结构性偏差。
实验关键数据¶
主实验¶
评估覆盖了四大前沿模型家族共 11 个模型(GPT-5.2、Qwen2.5/Qwen3 系列、InternVL2/2.5/3.5 系列、Gemma-3 系列)。下表展示了各模型在车辆视角(nuScenes)与机器人操作(AgiBot)子集上的均匀采样多选准确率(%)。
| 模型家族 | 具体模型 | nuScenes 计数 | nuScenes 事件排序 | nuScenes 空间推理 | nuScenes 时序推理 | AgiBot 时序推理 | AgiBot 事件排序 |
|---|---|---|---|---|---|---|---|
| Qwen | Qwen2.5-3B | 32.5 | 36.8 | 30.1 | 32.2 | 52.0 | 50.8 |
| Qwen | Qwen2.5-7B | 27.5 | 24.4 | 45.9 | 21.6 | 58.8 | 54.4 |
| Qwen | Qwen3-4B | 46.6 | 46.4 | 28.9 | 33.8 | 66.4 | 49.2 |
| Qwen | Qwen3-8B | 43.2 | 41.2 | 33.1 | 36.0 | 69.6 | 49.2 |
| InternVL | InternVL2-8B | 28.8 | 36.8 | 37.3 | 29.2 | 42.0 | 40.4 |
| InternVL | InternVL2.5-8B | 37.1 | 28.4 | 32.1 | 33.4 | 60.0 | 46.4 |
| InternVL | InternVL3.5-4B | 40.2 | 30.0 | 26.1 | 38.4 | 52.8 | 42.0 |
| InternVL | InternVL3.5-14B | 46.2 | 36.4 | 43.3 | 44.8 | 54.8 | 47.6 |
| GPT | GPT-5.2 | 47.8 | 29.2 | 36.5 | 25.4 | 66.8 | 66.0 |
| Gemma | Gemma-3-4B | 44.7 | 41.6 | 18.6 | 38.2 | 50.8 | 36.8 |
| Gemma | Gemma-3-12B | 43.8 | 43.2 | 26.4 | 35.6 | 60.4 | 41.2 |
在人居与广域监控子集(Ego-Exo4D 与 MEVA)上的表现进一步印证了跨机推理瓶颈:GPT-5.2 在 Ego-Exo4D 的最优相机选择任务上仅取得 34.6% 准确率,在 MEVA 复杂广域场景下时序仅 23.3%、计数仅 27.8%;所有开源模型在最优视角选择任务上准确率普遍徘徊在 20%~38% 之间,极度接近 4 选项随机猜测基线(25%)。
消融与分析实验¶
为了严格证明 CrossView 问题确实必须融合多相机证据而无法靠单视角投机解决,作者以 Qwen2.5-7B-Instruct 为基准进行了单视角输入与多视角输入的对比,并在不同采样策略间进行了消融。
1. 单视角 vs. 完整多视角输入消融(Qwen2.5-7B)
| 数据集 | 输入设置 | 实例计数 (%) | 时序推理 (%) | 事件排序 (%) | 空间推理 (%) |
|---|---|---|---|---|---|
| Ego-Exo4D | 完整多相机基线 | – | 45.2 | 49.2 | – |
| Ego-Exo4D | 仅最优外视角 (Best Exo) | – | 40.7 (-4.5) | 47.3 (-1.9) | – |
| Ego-Exo4D | 仅第一人称视角 (Ego) | – | 40.4 (-4.8) | 48.8 (-0.4) | – |
| nuScenes | 完整6相机基线 | 27.5 | 21.6 | 24.4 | 45.9 |
| nuScenes | 仅前方单一相机 (Front) | 18.7 (-8.8) | 21.6 (±0.0) | 32.0 (+7.6) | 41.5 (-4.4) |
2. 独立采样 (Uniform) vs. 全景拼接采样 (Stitched) 对比(Qwen2.5-7B)
| 数据集 | 采样输入方式 | 实例计数 (%) | 时序推理 (%) | 事件排序 (%) | 空间推理 (%) |
|---|---|---|---|---|---|
| nuScenes | Uniform 独立多流采样 | 27.5 | 21.6 | 24.4 | 45.9 |
| nuScenes | Stitched 拼接全景大图 | 38.0 (+10.5) | 26.2 (+4.6) | 39.6 (+15.2) | 46.3 (+0.4) |
| AgiBot | Uniform 独立多流采样 | – | 58.8 | 54.4 | – |
| AgiBot | Stitched 拼接全景大图 | – | 58.4 (-0.4) | 48.4 (-6.0) | – |
| MEVA | Uniform 独立多流采样 | 11.1 | 49.2 | 83.2 | 17.6 |
| MEVA | Stitched 拼接全景大图 | 13.3 (+2.2) | 52.2 (+3.0) | 70.9 (-12.3) | 34.2 (+16.6) |
关键发现¶
- 模型参数规模无法自然消除多相机推理盲区:即便是参数规模庞大且在单视角评测中几乎刷榜的 GPT-5.2,在 nuScenes 的时序推理(25.4%)和事件排序(29.2%)上表现极为疲软,在 Ego-Exo4D 的最优机位判断上也仅有 34.6%,表明单纯增加语言与单图自监督预训练无法使模型自发习得跨摄像机几何关联。
- 跨机合成任务是核心重灾区:需要跨越时间与空间共同去重的“跨视角实例计数”(nuScenes 上绝大多数模型低于 47%,MEVA 上普遍低于 25%)与需要全局空间元数据感知的“最佳视角选择”成为最难任务,反映出模型普遍缺乏多机位目标重识别(Re-ID)与视锥感知能力。
- 环境规模与机位密度决定任务难度:环境受限、背景干净的双视角机械臂操作(AgiBot)准确率最高(时序可达 69.6%),而视野广阔、多路相机离散分布的室外安防(MEVA)全面崩溃(生成式摘要 ROUGE-L 低至 4~11)。
- 帧拼接采样显著增强环视几何协同:在六路环视具有极强空间连续性的 nuScenes 上,使用 Stitched 策略将同一时间戳各机位拼接为单张全景图后,计数猛增 10.5 个百分点,事件排序暴增 15.2 个百分点;在广域 MEVA 空间推理上大幅提升 16.6 个百分点,但在无明显空间拓扑重叠的简单场景(AgiBot)中拼接反而因缩小了单个画面分辨率而引入了视觉噪点。
亮点与洞察¶
- 多相机时空场景图(STSG)的零幻觉构建机制:通过融合激光雷达点云与预训练 VLM 的局部感知生成底层时空场景图,再利用硬编码拓扑谓词生成结构化问答,从源头确保了复杂跨视角题目的物理事实自洽性,摆脱了单纯利用大模型合成数据时常见的时空事实幻觉。
- 单相机退化测试验证了“不可替代性”:对比实验证明剥离其他机位仅保留单机视角会导致计数与空间指标严重断崖式下跌,扎实证明了 CrossView 的问题绝非单视角能投机解决的“伪多机问题”,确立了基准的基石价值。
- 揭示了“多图拼接”对抗“超长上下文注意力分散”的实用价值:显式拼接将多相机跨视角的几何对齐从跨多图像 token 的长程注意力检索,转化为局部二维卷积与网格空间自注意力的直接建模,为后续多视角具身与驾驶多模态大模型的输入表征设计提供了直接启发。
局限与展望¶
- 受限于源数据集的静态相机标定:目前场景主要依赖静态环视或固定机位监控网络,缺乏机动无人机与多动态视角主体并发交互的自由非标定视点场景。
- 缺乏连续帧密集视频流输入:受限于现有前沿模型的最大上下文窗口限制,目前基准主要在 4~16 帧均匀抽样下评测,未能在高帧率全时序流上完全释放长视频多机推理的全部潜力。
- 改进方向:未来可探索开发轻量级跨视角对齐适配器(Cross-View Adapter),在不拼接图像的前提下引入外参姿态偏置(Camera Pose Embedding),引导模型在隐空间完成视锥缝合。
相关工作与启发¶
- vs nuScenes-QA / NuPlanQA: 现有驾驶领域问答数据虽源于多相机,但绝大多数问题只绑定在前方或单相机视锥内部,模型可退化为单图感知;CrossView 强制要求跨多相机排重(如计数)与跨视场运动因果推断。
- vs Ego-Exo4D / EgoExoBench: 现有第一/第三人称基准主要评测两机位之间的知识迁移与动作对应(Viewpoint Correspondence),CrossView 拓展到 2 至 8 路异构机位,并涵盖全局空间谓词计算与多视角场景摘要。
- vs 3D-LLM / BEVFormer: 现有 3D 视觉大模型依赖昂贵的三维点云重建或显式 BEV 投影特征表征;CrossView 强调大模型直接基于原始并发多路 2D 视频流端到端完成时空隐式推理的能力。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次系统化定义并构建多相机多领域视频问答基准,切中当前 VLM 单视角评测的巨大盲区。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 4 大模型家族 11 款主流基座,横跨四大领域六大任务,设计了单视角与拼接采样的细致消融。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑结构严谨,问题定义清晰,实验发现直击核心痛点,图表丰富自洽。
- 价值: ⭐⭐⭐⭐⭐ 为具身智能、自动驾驶与广域安防领域的多模态大模型研发指明了跨相机架构演进的全新方向。