Kilometer-Vision: A New Frontier for Large-Scale Spatial Awareness in VLMs¶
会议: ECCV 2026
论文: ECCV 原文
项目: https://perception-test-challenge.github.io/kilometervision.html
领域: 多模态VLM
关键词: 空间智能, 城市尺度理解, 地标与路线, 认知地图, 路径积分
一句话总结¶
KilometerVision 是首个评估多模态大模型在真实世界长达 1 公里、最长 10 分钟视频中城市级空间智能的基准,基于认知科学的地标-路线-地图三层范式设计了 1000 道五选一视频问答,揭示出当前顶尖 VLM 严重缺乏物理路径积分与几何概览认知、高度依赖 2D 视觉匹配和 OCR 文本走捷径的本质缺陷。
研究背景与动机¶
空间智能是通用智能的关键基石。自然界生物依据各自感知演化出精妙的空间表征:信鸽依赖地磁场定向,蝙蝠通过超声波回声测距,人类则融合视觉与本体感觉形成内在的“心智地图”(Mental Map),从而跨越广阔空间进行导航与路径规划。然而,当前在海量互联网多模态数据上预训练的大型视觉语言模型(VLM)是否真正具备对现实物理环境的大尺度空间表征能力,始终缺乏系统性检验。此前空间评测大多局限于桌面与室内小场景的目标空间关系推断,或基于合成模拟环境与厂房尺度(如 VSI-Bench、Thinking in Space),其视频长度短、空间跨度小,无法反映现实物理世界真实漫游时的全局空间认知。
之所以大尺度地理空间认知评测此前极难开展,关键瓶颈在于真实城市视频的长时程空间真值难以低成本、高精度地规模化获取。人工绘制真实漫游路径不仅极其耗时(每 1 小时视频需约 6 小时标注),而且仅能记录二维轨迹而完全丢失精确的六自由度相机姿态;若采用特制传感器(如 ARIA 智能眼镜)采集,则严重受限于硬件普及度和特定采集者,无法复用全球海量公开实拍视频。这使得社区长期缺乏覆盖长距离、复杂转弯与闭环场景的标准基准。
本文的切入契机是:利用 Google 视觉定位系统(VPS)结合少量人工起终点锚定,构建一套自动、稳健的大规模城市视频位姿反演管线,首次将认知心理学经典的“地标-路线-地图”(Landmark-Route-Map)空间发育认知理论形式化为可量化的长视频评测协议。核心 idea:将城市级空间智能按认知科学解耦为地标锚定、路线追踪与概览地图三层递进任务,通过 1 公里级真实漫游视频评测揭示模型是形成了真正的物理几何心智地图,还是仅靠 2D 外观模式与文本识别走认知捷径。
方法详解¶
整体框架¶
KilometerVision 基准由大规模真实视频位姿反演管线与认知分层多模态评测体系两大部分构成。首先,从全球各城市的 YouTube 漫游实拍视频中筛选出 235 个时长约 1 小时的高清视频(共计约 288 小时)。仅由标注员标记视频起始与终点的经纬度(耗时仅约 5 分钟),随后通过双向加权 VPS 迭代定位算法解算出 1 FPS 下整段视频的高精度经纬度轨迹与相机旋转四元数,构建出物理真值坐标链。
在此基础上,基准选取最长 10 分钟(对应行人正常步行约 1 公里)的视频切片,严格依据认知科学的三个表征层次构建了 1000 道 5 选 1 多选视频问答(QA),涵盖地标识别与测距、罗盘绝对朝向、闭环检测(Loop Closure)、路线文本摘要,以及带/不带文本路网底图的轨迹匹配和起终点直线欧氏距离估计。评测采用多选题形式,不仅统一标准化了不同模型族的输出接口,更能直接检查模型的思维链(Thinking Traces),剖析其空间决策机制。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["真实城市漫游长视频<br/>235个视频/288小时/起终点GPS"] --> B["双向加权VPS位姿反演<br/>1 FPS轨迹与旋转四元数提取"]
B --> C["DTW路径校准与异常过滤<br/>结合Routes API生成金标轨迹"]
C --> D["认知分层多任务构建<br/>1000道5选1多模态视频QA"]
D --> E["地标层:地标识别与欧氏测距<br/>高置信度关键帧/视线距离判定"]
D --> F["路线层:罗盘朝向追踪与闭环检测<br/>路径积分/累积航向/重访时间判定"]
D --> G["地图层:概览知识与拓扑轨迹匹配<br/>空载底图/带注记底图/起终点直线距离"]
关键设计¶
1. 双向加权VPS位姿反演管线:极低成本提取大尺度连续真值轨迹
以往获取真实世界大尺度视频的相机轨迹与位姿需要笨重的定位硬件或耗时数小时的手工测绘。本文基于 Google 视觉定位系统(VPS),设计了由粗到精的多程位姿估计流程。标注员仅需 5 分钟在地图上标记视频首尾帧的大致经纬度;正向遍历视频帧(1 FPS),利用前一帧定位结果作为当前帧 VPS 邻域检索先验(限制在 100 米内),根据置信度动态更新当前经纬度 \((lat, lon)\)、旋转四元数 \(rot \in \mathbb{R}^4\) 与平移变换;随后从终点帧开始逆向运行一次 VPS 检索。最终对正向与反向估计值按置信度加权融合,并进行最后一轮加权均值初始化校验。针对无纹理走廊或特征贫瘠区域,采用动态时间规整(DTW)对比人工抽样标注基准,滤除超出容差阈值的漂移片段,以单日算力完成了 288 小时长视频的高精度姿态真值构建。
2. 认知分层三阶任务体系:从局部视标到全局概览心智地图
借鉴认知科学经典理论,人类对未知环境的空间认知由浅入深分为三个层次: - 地标层(Landmarks):考察模型在长视频中定位显著视觉地标的能力。输入一段视频与一张候选地标图片(筛选自 VPS 高置信度非极大值抑制帧,或未在视频出现的负样本),要求判断该地标是否在视频中出现;若出现,进一步估计地标位置到视频终点帧的直线视线距离(Euclidean Distance)。该任务不仅考察“大海捞针”式的 2D 实例检索,更探测地标在三维空间中的尺度锚定能力。 - 路线层(Routes):考察第一人称视角下的自身运动感知与路径积分(Path Integration)。包含罗盘朝向任务(给定起始朝向,累积估计行走至终点时的 8 航向之一:N, NE, E, SE, S, SW, W, NW);闭环检测任务(判断视频终点位置是否在早先走过,若重访则指出具体的重访时间分钟数,空间重访判定阈值为 4 米半径内);以及路线摘要任务(从 5 组转向指令中选出符合全程转弯行为的序列描述)。 - 概览地图层(Survey Knowledge / Maps):大尺度空间认知的最高阶段,即跳脱第一人称体验、形成鸟瞰式异中心(Allocentric)心智地图。设计了地图轨迹匹配任务(从 5 幅俯瞰地图轨迹图中选择正确路线,并拆分为“带文字路名注记”与“去除文字/地标图标的纯路网”两种变体以诊断文本捷径),以及起终点欧氏距离估计(在漫游多条非直线街巷后,判断起始点与结束点之间的直线几何距离,干扰项确保与真值相距 100 米以上)。
3. 对比消融与思维链探针:剥离纯文本推理与浅层外观作弊
为排除模型直接通过自然语言世界知识或盲猜答案,基准引入了空白视频帧的盲测基线(Blind Baseline),验证任务必须依赖真实视觉输入。更关键的是,设计了三组受控探针: - 信息剥离与特权输入:向模型额外注入连续绝对 VPS 坐标、相机偏航角(Yaw)数据,检验模型在零样本下能否解析并利用几何遥测信号; - 地图图文解耦消融:对比输入完整地图(含路名/地标注记)与去除文字注记的空地图,剖析模型究竟是在做几何拓扑匹配还是单纯依赖 OCR 文本线索做语义匹配; - 思维链行为审计:利用 VLM 的推理轨迹(Thinking Traces),逐步骤分析模型在回答闭环检测与路线匹配时,是依靠三维路径追踪推导,还是退化为粗暴的单帧外观暴力比对。
实验关键数据¶
主实验¶
基准在五大主流多模态模型上进行了系统评测,包括商用旗舰闭源模型 GPT-5、Claude Opus、Gemini 2.5 Flash 以及开源模型 Qwen2.5-VL-72B 和 PLM-8B。为公平对比,默认采用均匀采样 32 帧配置,同时在 337 道题的人工抽样集上建立了人类基准(人类以 30 FPS 观看视频,每题 10 人独立作答,标注者一致性为 0.76),并运行了输入纯白图像的 Gemini 盲测基线。
| 模型 / 系统 | 地标识别与测距 (Landmark) | 罗盘朝向 (Compass) | 路线摘要 (Route Summary) | 轨迹匹配-含文本 (Map Trace w/ text) | 轨迹匹配-无文本 (Map Trace w/o text) | 闭环检测 (Loop Closure) | 欧氏距离 (Euclidean Dist.) | 全局平均准确率 (%) |
|---|---|---|---|---|---|---|---|---|
| 随机盲测基准 (Chance) | 20.0 | 20.0 | 20.0 | 20.0 | 20.0 | 20.0 | 20.0 | 20.0 |
| Gemini 2.5 Flash (盲测) | ~20.0 | ~20.0 | ~20.0 | ~20.0 | ~20.0 | ~20.0 | ~20.0 | ~20.0 |
| PLM-8B (32 frames) | ~22.0 | ~21.0 | ~23.0 | ~20.5 | ~19.5 | ~24.0 | ~21.0 | ~21.6 |
| Qwen2.5-VL-72B (32 frames) | ~23.5 | ~22.0 | ~26.0 | ~22.0 | ~20.0 | ~28.0 | ~22.5 | ~23.4 |
| Claude Opus (32 frames) | ~34.0 | ~28.0 | ~42.0 | ~31.0 | ~22.0 | ~58.0 | ~25.0 | ~34.9 |
| Gemini 2.5 Flash (32 frames) | ~38.0 | ~31.0 | ~42.2 | ~28.6 | ~28.6 | ~62.0 | ~28.0 | ~36.9 |
| GPT-5 (32 frames) | ~45.0 | ~36.0 | ~54.0 | ~38.0 | ~29.0 | ~78.0 | ~32.0 | ~44.6 |
| GPT-5 (500 frames) | ~52.0 | ~48.0 | ~67.0 | ~49.0 | ~38.0 | ~88.0 | ~42.0 | ~54.9 |
| 人类基准 (Human) | 78.4 | 68.2 | 74.5 | 76.0 | 71.8 | 52.1 | 78.0 | 71.3 |
注:五选一选择题随机猜测概率为 20.0%。人类在闭环检测上由于长时间观看容易疲劳漏检,得分仅 52.1%,落后于强力检索匹配的 GPT-5 和 Gemini 2.5 Flash;而在其他依赖空间路径积分和概览心智地图的任务上,人类均大幅超越所有 VLM。
消融实验¶
针对 Gemini 2.5 Flash 进行了特权信息辅助与多模态线索剥离消融实验,分析模型在有无视频、有无地图注记以及注入航向/GPS 时的表现变化:
| 实验配置 (Gemini 2.5 Flash) | 路线摘要 (Route Summary Acc %) | 轨迹匹配-含文本 (Map Trace w/ text Acc %) | 轨迹匹配-无文本 (Map Trace w/o text Acc %) | 核心现象与说明 |
|---|---|---|---|---|
| 原始基准 (仅视频 + 选项) | 42.2 | 28.6 | 28.6 | 无额外特权先验输入 |
| + 注入相机偏航角 (+Yaw) | - | ~29.2 | ~28.0 | 航向角数值未带来有效几何增益 |
| + 注入连续位姿 (+Yaw +VPS) | - | ~29.5 | ~28.8 | 裸坐标文本无法直接被模型解析利用 |
| 引入带文字地图辅助 | 49.0 (+6.8) | - | - | 丰富文字地名提供了跨模态匹配捷径 |
| 引入无文字路网地图辅助 | 37.4 (-4.8) | - | - | 纯几何拓扑无文本辅助反而干扰模型 |
| 引入标准文本路线摘要辅助 | - | 34.7 (+6.1) | 26.5 (-2.1) | 仅在有文字地图上显效,纯几何地图仍受损 |
| 完全剥离视频 (No video) | 53.1 (+10.9) | 46.3 (+17.7) | 38.1 (+9.5) | 去除复杂视频干扰后,模型转入纯图文对应模式得分反弹 |
关键发现¶
- 地标识别极强但空间尺度坍塌:在针对地标与闭环的细粒度分解中,VLM 展现出极其优异的 2D“视觉存在性判定”(Visual Recognition,仅判断是否见过该物体或地点),GPT-5 与 Claude Opus 在该项上准确率均超过 80%~90%;然而一旦要求推算该地标到当前位置的直线物理距离(Distance),准确率暴跌至 25% 左右的随机水平。模型知道“看到了什么”,却完全不知道它在三维物理世界中“相对于自己究竟在哪”。
- 闭环检测的超人表现源于暴力帧匹配而非心智地图:GPT-5 与 Gemini 2.5 Flash 在闭环检测上大幅超越人类(78%~88% vs. 52.1%)。分析模型的 Thinking Traces 发现,模型完全没有构建任何拓扑回环路径,而是通过海量隐空间注意力进行全视频关键帧暴力特征比对。这种机制一旦遇到远处相似的雕像或重复店铺等视觉假阳性线索,就会出现严重误判。
- 航向积分与几何概览几乎完全失效:罗盘方位任务要求跟踪累积转弯角,所有 32 帧模型的表现均徘徊在 28%~36%(随机基线为 20%);即使将视频抽样帧数扩大到 500~600 帧,Gemini 2.5 Flash 依然停滞在 38% 左右,仅 GPT-5 能通过极大的长上下文算力勉强拉升至 57%。
- 剥离视频反而涨点的“注意力干扰”怪象:在路线摘要和地图匹配消融中,直接丢弃视频、仅让模型比对地图注记与路线文本描述,准确率反而从 42.2% 飙升至 53.1%(路线摘要)、28.6% 飙升至 46.3%(地图匹配)。这证明当前 VLM 根本不具备将动态第一人称连续画面映射到静态俯瞰拓扑地图的能力,其所谓的大尺度推理实质是 OCR 文本关联。
亮点与洞察¶
- 认知发育范式在长视频大模型评测中的精准落地:将人类空间认知的地标-路线-地图(Landmark-Route-Map)三阶段理论,转化为具有严格物理真值的标准化长视频 QA 基准,成功撕下了当前多模态模型在表面语言流畅度下的空间认知伪装。
- 基于 VPS 与 DTW 的全自动高精度位姿低成本反演:巧妙融合 Google VPS 图像定位先验与双向置信度加权,结合 DTW 容错校验,仅需 5 分钟人工标注即可将任意 1 小时公开漫游视频自动化标定为米级精确轨迹,为物理世界视频数据资产的二次挖掘提供了范式。
- 揭示了 VLM 空间智能中“视觉-文本匹配捷径”的普遍本质:系统性实验揭示了当前模型无法内生三维空间深度与路径积分机制;它们在长空间任务中的成功高度依赖文字路标读取(OCR)与暴力图像比对,为具身智能与通用世界模型的设计指明了真正的短板。
局限与展望¶
- 被动观察与具身闭环的主动感知鸿沟:基准所使用的视频均为人类被动漫游实拍,缺少机器人自主移动时的前庭信号(Vestibular Signals)、本体感觉与动作交互回环。人类在纯被动观察下空间认知也会大幅受损,未来需探索结合具身模拟器的主动式大尺度探索基准。
- 离散选择题形式对连续几何表征的刻画有限:为适应通用 VLM 的文本接口并获取思维链,当前基准将空间状态离散化为 5 选 1 问答。虽然通过时间召回与负样本间隔保证了区分度,但仍无法直接评估模型内部潜空间中连续度量深度图或拓扑度量图的几何保真度。
- 特权传感器融合需定向架构微调探索:实验显示模型直接接收坐标与朝向文本(Prompt-level injection)并不能提升性能,未来工作亟需设计显式融合里程计、IMU 与地图先验的多模态连续架构。
相关工作与启发¶
- vs. VSI-Bench / Thinking in Space: 早期空间智能基准主要关注室内房间或工厂级别的小尺度静态场景(空间跨度通常在数十米内),视频通常仅 1~3 分钟。KilometerVision 将评估范围拓展至真实城市级 1 公里、最长 10 分钟漫游,首次直面物理世界大尺度下的路径漂移与拓扑闭环挑战。
- vs. Aria Everyday Activities / 经典视觉 SLAM 数据集: 传统 SLAM 基准严重依赖穿戴式高精度传感器与专业采集团队,且仅能评测纯几何位姿误差。本文通过 VPS 技术将普通互联网公开长视频低成本转化为基准,并通过自然语言接口将空间几何问题与多模态通用理解结合。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次提出真实世界 1 公里城市尺度长视频空间智能评测,成功将认知科学三阶理论工程化落地。
- 实验充分度: ⭐⭐⭐⭐⭐ 覆盖五大代表性商业/开源 VLM、长帧率拓展、人类对齐、特权数据消融及详尽的推理链定性分析。
- 写作质量: ⭐⭐⭐⭐⭐ 动机阐述深刻,实验设计层层递进,深入透彻地指出了模型依赖文本捷径的核心矛盾。
- 价值: ⭐⭐⭐⭐⭐ 为具身智能、空间大模型及世界模型的几何与时间表征发展提供了里程碑式的严苛诊断工具。