LangLoc: “Tell Me What You See”¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://rzninvo.github.io/Lang-Loc/
领域: AI 安全 / 3D 视觉 / 多模态 VLM
关键词: 室内定位 / 自然语言定位 / 3D 场景图 / 视线投射打分 / 贝叶斯消歧对话
一句话总结¶
LangLoc 是首个无需相机图像、仅凭自由自然语言环境描述即可在已知 3D 室内场景中实现高精度定位的系统,通过双分支 GATv2 检索粗场景、光线投射可见性计算 2D 位姿与朝向,并利用主动贝叶斯对话将中位误差降至亚米级。
研究背景与动机¶
确定自身所处的精确空间位姿是室内导航、机器人辅助、增强现实及应急响应等位置感知服务的底层基石。当前主流定位范式高度依赖视觉输入,即移动设备采集连续图像或视频流上传至服务端,通过特征匹配、场景坐标回归(如 ACE、DSAC)或分层重定位(如 InLoc、HLoc)求解 6-DoF 相机位姿。然而,依赖图像在室内受限环境下暴露了严重短板:频繁的图像与视频回传极其消耗带宽;在家庭私密空间、实验室或医院等敏感场所,拍摄图像不可避免会泄露用户的隐私与敏感个人信息;而在纹理匮乏的白墙或弱光照等无特征区域,非专业用户往往难以主动构图拍出具有判别力的图像。
相比之下,自然语言描述提供了一种兼具极高隐私安全性、超低带宽且无需任何光学摄像传感器的全新交互通道。例如,用户仅需陈述“我正站在书架前,左手边是蓝色沙发,对面是电视机”,便能传递出高密度拓扑与语义线索。但此前基于语言的定位探索几乎全部停留在粗粒度的场景检索阶段,例如 Text2Pos 将文本与室外粗点云单元对齐,Text2SGM 将文本场景图与 3D 场景图匹配以检索目标房间,完全无法解析房间内部观察者具体的局部空间坐标与视线朝向。室内同质化严重,同一房间内不同观测视角往往共享大体相同的物体语义标签,仅在细微的相对几何距离与几何可见性上存在差异,纯文本缺乏直接的度量先验,难以转化为连续空间坐标。
针对上述挑战,本文的核心视角是:观察者所描述的物体集合及其相对方位,本质上受制于站立点视锥体的物理遮挡与可见性约束;如果空间中存在对称或同质语义的多峰歧义,系统应主动向观察者发起高信息增益的二值化问答以压缩不确定性。核心 idea:构建解耦的“双分支图检索粗定位-物理光线投射网格打分细定位-信息增益驱动的主动贝叶斯消歧问答”三阶段管线,彻底摆脱光学相机约束,实现基于纯自然语言的细粒度室内连续 2D 位姿与视向估计。
方法详解¶
整体框架¶
LangLoc 的推理流程由三个有机级联的阶段组成:给定用户的自由自然语言描述 \(T\) 与已知 3D 室内场景数据库 \(\mathcal{D}\),首先将文本解析为文本场景图 \(G^t\),通过双分支图注意力网络检索候选场景;随后在检索得到的最佳 3D 场景网格上建立稠密可行走地面网格,利用几何光线投射模拟视线遮挡,根据匹配物体的可见性与邻近度综合打分估计初始 2D 坐标与视向;当后验概率呈现多峰分布或置信度不足时,激活交互式对话模块,自适应挑选期望信息增益最大的是非问题向用户提问,经贝叶斯更新收敛至最终位姿。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["自然语言环境描述 T"] --> B["文本场景图解析<br/>抽取实体标签与相对空间关系"]
B --> C["双分支 GATv2 跨模态场景检索<br/>几何与关系分支自适应门控融合"]
C --> D["目标 3D 场景网格与地面采样"]
D --> E["基于网格光线投射的可见性与邻近度打分<br/>稠密评估候选 2D 坐标与视向角"]
E --> F{"后验是否具有多峰歧义"}
F -->|无歧义或高置信度| G["直接输出位姿估计 (c, θ)"]
F -->|多峰分布 / 存在歧义| H["信息增益驱动的主动贝叶斯消歧问答<br/>生成针对性是非题并更新参考帧后验"]
H -->|后验收敛达到阈值| G
关键设计¶
1. 双分支 GATv2 跨模态场景检索:解决稀疏文本图与稠密 3D 场景图的几何语义不对称
文本场景图与数据库 3D 场景图虽然都遵循节点-边的图结构,但二者在特征模态上天然非对称:3D 场景图节点包含真实世界 3D 质心 \(\mathbf{c}_i \in \mathbb{R}^3\)、平均 RGB 颜色 \(\mathbf{k}_i \in \mathbb{R}^3\) 与 CLIP 文本特征 \(\phi(l_i) \in \mathbb{R}^{512}\)(总维度 518),边包含空间相对向量与包围球半径;而纯文本图仅包含语义标签与定性关系描述,完全缺失底层点云颜色和度量坐标。若强制对齐容易导致模型偏置。为此,系统在文本端对缺失的几何与颜色维度采用零填充,并构建几何与关系解耦的双分支网络。几何分支在 \(k=5\) 空间近邻间基于相对位移 \(\Delta\mathbf{c}_{ij}\)、距离度量及包围半径传递 GATv2 消息,而关系分支使用 CLIP 对关系谓词字符串编码后传递拓扑语义消息。两分支通过学习得到的逐节点动态门控向量 \(\boldsymbol{\alpha}_i = \sigma(\text{MLP}([\mathbf{g}_i \mathbin{\|} \mathbf{t}_i]))\) 实现自适应融合:
在文本图中,门控网络自动抑制缺乏有效数值的几何分支并侧重关系语义。最终图向量融合了全局唯一标签集合的全局 CLIP 描述子 \(\mathbf{u}(G)\),在对比损失下训练。测试阶段结合图嵌入余弦相似度、全局描述子相似度与标签 Jaccard/F1 重合度联合排序,极大提高了在 55 个完整全场景检索下的抗干扰能力。
2. 基于网格光线投射的可见性与邻近度位姿打分:无图像下确定室内 2D 坐标与视线方向
获得目标 3D 场景后,核心挑战是如何将语言中出现的实体转化成可度量的连续空间坐标。系统观察到:观察者必须身处一个使得文本中提及的所有物体均在物理视线范围内且相互通视的站立点。模型首先通过 Word2Vec 余弦相似度贪婪指派文本实体到 3D 实例质心 \(\boldsymbol{\mu}_o\);接着在场景可行走地面按照步长 \(\Delta=0.25\text{ m}\) 均匀离散采样候选站立点 \(\mathbf{c}_k \in \mathbb{R}^2\),并将虚拟人眼抬高至固定视平线高度 \(h=1.6\text{ m}\)。对于每个候选网格点与匹配物体,直接在 3D 三角网格模型上投射单条视线检测物理遮挡。候选点的综合适应度打分由可见物体数量的指示函数累加项与距离衰减的邻近度奖励联合决定:
其中 \(d_{ko}\) 为水平欧氏距离,\(w_d\) 与 \(\tau_d\) 调节距离偏好。打分经温度归一化为 Softmax 空间概率分布。在朝向上,模型通过滑动虚拟相机的水平视场角(FoV)视锥体,选取能够同时框入最多可见物体的视向范围,取这些可见方向矢量的归一化均值作为该站立点的估计视线朝向 \(\hat{\theta}_k \in \mathbb{S}^2\)。
3. 基于最大信息增益的交互式贝叶斯多轮问答:主动消除同质化视角的位姿多峰歧义
室内空间常存在对称布局或同质物体群(例如会议室中的两排对称座椅、多个相似沙发卡座),单轮陈述不可避免地会在相距甚远的两个位置产生同等强度的打分峰值。为彻底打破对称多峰歧义,系统构建了基于代表性参考帧的主动问答消歧机制。系统预先从场景历史轨迹中利用两阶段行列式点过程(DPP)筛选高语义多样性且空间去重的高质量关键帧集 \(\{(\mathbf{t}_j, \theta_j)\}\),将稠密网格打分平滑投影至该离散参考帧集合构成先验 \(p_0(j)\)。在对话循环中,候选问题池涵盖物体标签是否存在以及物体对之间的空间方位关系。系统计算每个候选是非题 \(q\) 的先验回答概率 \(p(a \mid q)\) 以及给定回答后后验熵的加权期望,贪婪挑选期望信息增益最大化的问题向用户提问:
针对用户回答 \(a\),引入考虑误报与无法作答惩罚的软似然模型 \(\mathcal{L}(a \mid j)\),通过贝叶斯定理实时更新后验分布 \(p(j) \leftarrow p(j)\mathcal{L}(a \mid j) / \sum_{j'} p(j')\mathcal{L}(a \mid j')\)。当后验最大峰的置信度超过设定阈值或达到预设交互轮次上限时终止提问,直接取后验峰值对应参考帧的真实位姿作为输出。
一个完整示例¶
假设用户在包含客厅与餐厅的开阔套房中描述:“我在一张木桌旁,左侧有靠背椅,前方不远处有立式台灯。” 1. 场景检索:抽取实体木桌、靠背椅、立式台灯及其相对拓扑,双分支 GATv2 准确从候选全场景集中将该套房排在 Top-1。 2. 网格光线投射:在地面生成 400 个候选网格点。餐厅餐桌与书房工作台均符合“桌+椅”,因此在地面概率图上形成了间距达 4.2 米的两个强局部极值峰。初始估计存在多峰歧义,非对话模式下单点质心误差可能高达 1.8 米,但在 Top-10 候选中真实位置排名前列。 3. 主动消歧对话:系统检测到后验双峰并计算信息增益,选出最高判别力问题:“你是否能看到冰箱?”(餐厅可见冰箱,而书房被墙面完全遮挡,回答概率各占约 50%)。用户回答“Yes”,后验迅速向餐厅区域坍缩,次轮补充确认“椅子是否在桌子正下方”,最终后验置信度达到 0.94,锁定位姿并计算视向,将位置误差从 1.74 米迅速缩减至 0.28 米。
损失函数 / 训练策略¶
场景检索模块中,双分支 GATv2 编码器采用 InfoNCE 对比损失进行全图表示学习:
温度超参 \(\tau=0.07\)。采用 AdamW 优化器,学习率设为 \(5 \times 10^{-4}\),权重衰减 \(10^{-4}\),50% 负采样比例,并施加范数上限为 1.0 的梯度截断,共训练 70 个 epoch。对于细定位与消歧模块,打分与贝叶斯更新属于确定性解析几何运算与概率推断,无需梯度训练,具备零样本在全新 3D 重建场景上快速部署的能力。
实验关键数据¶
主实验¶
论文基于 3RScan 构建的 ScanScribe 检索基准,以及 100 场景受控子集与 1300 完整场景的 LangLoc 细粒度定位基准开展全面评估。
表 1:ScanScribe 检索基准上的召回率对比(Recall@k, %)(选自原文 Table 1 与 Table 3)
| 检索评估协议 / 方法 | Top-1 | Top-2 | Top-3 | Top-5 | 说明 / 机制 |
|---|---|---|---|---|---|
| 10 候选场景池 (Table 1) | |||||
| Text2Pos (fine-tuning) | 10.30 ± 0.93 | 20.74 ± 1.32 | 31.65 ± 1.45 | 53.42 ± 1.68 | 跨模态点云-文本特征粗匹配 |
| CLIP2CLIP | 33.09 ± 0.21 | 52.53 ± 0.24 | 65.98 ± 0.21 | 82.69 ± 0.13 | 渲染多视角图像与文本直接对齐 |
| Text2SGM (cos-sim) | 68.27 ± 2.05 | 84.95 ± 1.62 | 91.65 ± 1.23 | 97.14 ± 0.76 | 单分支 3D 场景图匹配 SOTA |
| Text2SGM (ret-based) | 68.61 ± 0.04 | 85.00 ± 0.02 | 91.57 ± 0.01 | 96.99 ± 0.00 | 基于检索特化的场景图匹配基线 |
| LangLoc (本文) | 76.70 ± 4.58 | 90.40 ± 2.73 | 96.10 ± 1.58 | 98.90 ± 1.22 | 双分支 GATv2+CLIP,超越先前 SOTA 8.1% |
| LLM 生成自然查询 (Table 3) | 减少词汇重合度,检验口语泛化 | ||||
| CLIP2CLIP | 33.07 ± 0.21 | 52.52 ± 0.23 | 66.00 ± 0.21 | 82.78 ± 0.13 | 零阶视角匹配,受词汇变异冲击严重 |
| Text2SGM (cos-sim) | 34.22 ± 1.77 | 56.67 ± 1.70 | 68.78 ± 2.35 | 82.11 ± 1.23 | 依赖固定类别词汇,泛化断崖式下跌 |
| LangLoc (本文) | 59.50 ± 5.26 | 76.40 ± 4.94 | 87.80 ± 3.12 | 96.20 ± 2.27 | 超先前 SOTA 25.3 个百分点 |
消融实验¶
细粒度位姿估计在 3RScan 与 ScanNet 两个具代表性的 100 场景子集上的消融与基线对比如下。
表 2:细粒度室内位姿估计性能及模块消融(选自原文 Table 4)
| 测试集 | 评估模型 / 配置 | Top-10 均值位置误差 (m) ↓ | 预测位置均值误差 (m) ↓ | 预测位置中位数误差 (m) ↓ | 视向角均值误差 (deg) ↓ | 视向角中位数误差 (deg) ↓ | 3D 视锥 IoU ↑ |
|---|---|---|---|---|---|---|---|
| 3RScan | Midpoint (几何中心点) | – | 1.416 | 1.347 | – | – | – |
| VLM (Qwen2.5-VL-2B 零样本) | – | 1.582 | 1.420 | 85.48 | 85.54 | 0.062 | |
| LangLoc (无对话消歧) | 1.037 | 1.712 | 1.551 | 46.07 | 37.24 | 0.172 | |
| LangLoc (带对话消歧) | 0.983 | 0.926 | 0.799 | 39.52 | 33.37 | 0.342 | |
| ScanNet | Midpoint (几何中心点) | – | 1.279 | 1.098 | – | – | – |
| VLM (Qwen2.5-VL-2B 零样本) | – | 1.382 | 1.099 | 93.96 | 91.27 | 0.030 | |
| LangLoc (无对话消歧) | 1.254 | 1.676 | 1.314 | 42.67 | 34.66 | 0.236 | |
| LangLoc (带对话消歧) | 0.532 | 0.593 | 0.069 | 23.77 | 5.12 | 0.593 |
关键发现¶
- 对话机制对消歧与误差降低具有决定性作用:在 3RScan 数据集上,引入主动贝叶斯消歧问答后,中位位置误差从无对话的 1.551 米锐减至 0.799 米,降幅达 48.5%;在 ScanNet 上由于平均可见物体数量更稠密(平均 6 个 vs 4 个),信息增益收敛更快,中位数误差甚至进一步被压缩至 0.069 米(约 7 厘米),视向角中位误差降低至 5.12 度。
- 纯 VLM 零样本俯瞰推理缺乏度量与朝向感知能力:Qwen2.5-VL-2B 接收俯视渲染图与自然文本后,角度均值误差高达 85 度以上,接近纯随机猜测(90度),3D 视锥 IoU 仅为 0.030–0.062。这表明单纯依靠多模态大模型的视觉自注意力无法精准解算空间物理遮挡与真实几何射线几何。
- Midpoint 基线具有“小房间假象”欺骗性:室内房间面积通常有限,静态中心点机械式地与室内所有网格点保持平均 1.3 米左右的距离,但它完全丧失了朝向感知与局部视点特征,实用价值为零。而 LangLoc 的 Top-10 位置误差均值(0.983m / 0.532m)显著优于几何中心,说明真实位姿稳定处于高概率极大值网格内。
亮点与洞察¶
- 隐私保护与极端轻量化的定位范式:与依赖高分辨率图像与连续视频上传的传统视觉定位相比,LangLoc 仅接收短文本输入,计算开销与网络传输比特率降低数个数量级,在医院、机密研发机构等无相机准入场景提供了可行的定位手段。
- 免训练的几何视线投射定位机制:在第二阶段中,利用已知的 3D 室内三角网格执行物理光线投射,以几何约束取代不可靠的黑盒数值回归,具有天生的跨场景物理泛化能力与可解释性。
- 主动信息增益问答设计:将后验概率分布转换为贪婪选择信息增益最大的离散问题,把定位从“静态单向接收”升级为“人机协同主动求证”,为多模态实体具身智能体与人类的交互提供了可复用的决策框架。
局限与展望¶
- 依赖预构建的高精度 3D 语义网格:当前管线要求环境提前完成稠密 3D 扫描并建立拥有实例语义标签的 3D 场景图,对于未建立精细数字孪生的全新开放场景难以即时生效。
- 大空间多重复杂陈设下的多轮交互开销:在布局高度重复对称、缺乏显著地标的极端场景中,需要较多交互轮次才能彻底消除对称歧义,对用户的回答耐心与准确度提出了较高要求。
- 未来演进方向:可探索将底层对齐目标由稠密 3D 网格放宽至建筑 CAD 平面底图或粗糙 2D 户型图,并引入开放词表(Open-Vocabulary)开放世界 3D 基础表征,从而大幅降低建图前置成本。
相关工作与启发¶
- vs Text2Pos [CVPR 2022]:Text2Pos 仅在室外尺度下将文本与粗粒度点云单元做粗匹配检索;LangLoc 深入室内环境,提出了完整的视网格光线投射计算,将精度提升到米级乃至厘米级具体坐标与视向。
- vs Text2SGM [ECCV 2024]:Text2SGM 将场景图匹配用于判断房间索引(Scene Retrieval),但止步于粗检索,无法获得房间内的观察者坐标;LangLoc 继承了场景图建模思路,不仅提出双分支结构大幅提升了场景检索精度(Top-1 跃升 8.1%),还开创性地拓展了细粒度 2D 位姿与朝向的完整管线。
- vs DiaLoc [CVPR 2024] & SQA3D [ICLR 2023]:DiaLoc 与 SQA3D 关注具身导航或 3D 问答,通常以图像或点云为主要输入;LangLoc 则将对话作为纯文本定位中的贝叶斯不确定性缩减工具,通过主动信息增益算法实现闭环校正。
评分¶
- 新颖性: 5/5 (首次系统性定义并解决了纯自然语言描述下的室内细粒度 2D 位姿与视向估计任务)
- 实验充分度: 4.5/5 (涵盖 3RScan、ScanNet 与真实人类交互 Pilot,主观问答与受控协议划分严谨)
- 写作质量: 5/5 (结构层次分明,方法图、公式推导与实验分析紧密扣合)
- 价值: 4.5/5 (在隐私敏感场景、弱光盲区以及助老助残人机协作中具有重要的应用落地前景)