跳转至

SAFE-EQA: Semantic-Aware Efficient Exploration for Embodied Question Answering

会议: ECCV 2026
论文: CVF Open Access
代码: https://github.com/yjtang249/SAFE-EQA
领域: 机器人/具身智能
关键词: 具身问答 (EQA)、语义感知路径规划、旅行商问题 (TSP)、拓扑地标图、自适应重规划

一句话总结

针对具身问答中基于前沿探索导致的局部贪心徘徊与高频 VLM 查询开销,SAFE-EQA 将主动探索建模为基于拓扑地标图的语义感知旅行商问题 (TSP),配合前沿触发的自适应重规划与分层图匹配应答,在匹敌与超越 SOTA 精度与探索效率的同时削减 27.8%~45.6% 的 Token 消耗。

研究背景与动机

在具身智能系统中,具身问答(Embodied Question Answering, EQA)要求智能体置身于完全陌生的三维室内环境,通过自主导航移动、动态收集视觉观测证据,最终准确回答具有开放性的自然语言问题。与常规的全局三维重建或被动视觉问答不同,EQA 的核心在于“目标导向的主动探索”——智能体必须结合常识语义推理与空间拓扑结构,迅速锁定与问题最相关的物理区域,例如听到“咖啡杯在厨房桌上吗”时应优先探索餐厨区域而非卧室,从而在有限的时间步长内获取高置信度的决定性证据。

然而,当前主流基于视觉语言模型(VLM)引导的 EQA 探索范式面临着严重的效率与鲁棒性瓶颈。一方面,现有多依赖于经典的前沿探索(Frontier-Based Exploration, FBE)框架,智能体在局部已探索与未探索边界上逐帧做出单步贪心决策。这种近视的单步规划严重缺乏全局拓扑感知与长程时空协调,极易导致智能体在相近房间或死角处反复震荡、频繁绕路折返,甚至因视野死角漏检关键物证;另一方面,现有方法往往在每个导航步长都频繁唤醒大模型进行下一点目标决策与置信度检验,这不仅引入了难以承受的在线推理延迟(单次 VLM 调用常需数秒至十余秒),还导致 API Token 消耗急剧膨胀,严重阻碍了具身系统在低功耗边缘端与实时环境下的部署。

本文的切入角度在于:不应在边界前沿点上做碎片化、近视的单步贪心抉择,而应将已知场景的连续可通达空间离散化为全局拓扑地标,把长程探索组织为兼顾几何路程代价与语义目标优先级的连续旅行路线。核心 idea:将 EQA 探索形式化为基于拓扑 Voronoi 地标图的在线语义感知旅行商问题(Semantic-Aware TSP),输出平滑的多步局部轨迹以大幅减少 VLM 交互频次,并引入前沿触发的自适应打断与分层图匹配应答机制,实现兼具全局一致性与即时响应性的高效证据搜集。

方法详解

整体框架

SAFE-EQA 的工作流分为两大部分:离线预处理与在线多模块协同探索。预处理阶段首先利用大语言模型(LLM)解析输入自然语言问题 \(q\),抽取出目标实体及其空间/属性关系,构建目标图(Goal Graph)以指导后续语义引导与终结判断。在在线探索阶段,智能体持续接收 RGB-D 观测并更新 3D 场景图(Scene Graph)与二维占据栅格;系统基于自由空间增量构建 Voronoi 地标图(Landmark Graph),并利用 LLM 针对子图计算任务相关度,生成连续的语义热力图(Semantic Map)。全局规划器在提取的地标与前沿集合上求解语义感知 TSP,生成多步访问轨迹。探索过程中,仅当检测到高优先级前沿时触发局部打断重规划;仅当场景图与目标图粗筛匹配命中时,才唤醒 VLM 结合精选关键帧生成最终回答。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入自然语言问题 q 与 RGB-D 观测"] --> B["预处理:目标图构建<br/>LLM 提取目标实体与空间关系"]
    B --> C["增量场景构建<br/>3D 场景图 + 2D 语义图 + Voronoi 地标图"]
    C --> D["语义感知巡回规划<br/>结合测地距离与语义折扣求解 TSP"]
    D --> E["边界触发自适应重规划<br/>VLM 局部研判高优先级前沿并插队"]
    E --> F["多步平滑轨迹执行<br/>控制器循迹减少单步高频交互"]
    F --> G["分层图匹配与条件应答<br/>粗定位→LLM过滤→VLM终止判决"]
    G -->|未达置信阈值| C
    G -->|置信应答| H["输出最终答案并终止"]

关键设计

1. 语义感知巡回规划:将全局拓扑探索解耦为语义加权的旅行商优化 针对传统前沿探索步步贪心、轨迹破碎且极易遗漏关键区域的问题,本文通过在二维可导航自由空间上增量提取 Voronoi 图来抽象出场景的拓扑地标骨架 \(L_t = \{l_{t,i}\}\)。地标节点间以测地线连通,并滤除与已有地标或智能体已走过轨迹相距 1.2 米以内的冗余点。为了将目标先验融入全局路线选择,系统把场景图按连通分量切分子图,利用 LLM 评判其与问题的关联度 \(\tau_i \in [0, 1]\),并通过累积加权平滑投影到可通达区域的二维语义图 \(S(p)\)。在规划时,不再单纯最小化几何距离,而是计算每个候选地标在全局语义图上的归一化语义权重 \(s_i\),进而赋予测地距离一个语义折扣因子 \(\lambda_i = 1 - w_{sem} \cdot s_i\)。优化目标被定义为加权旅行商问题: $\(\mathcal{TSP}(p_r, \Pi) = \min_{\Pi} \sum_{i=1}^{n-1} \left[ \lambda_i \cdot \mathrm{dist}(\pi_{i-1}, \pi_i) \right]\)$ 当某地标语义得分极高时,其间距权重 \(\lambda_i\) 显著缩减,驱使全局最优路径在兼顾总行程不过度膨胀的前提下,自发地将高潜能语义区域排入首要访问次序,彻底规避了盲目折返。

2. 边界触发自适应重规划:局部 Top-k 求解与前沿抢占机制 完全固定的长程 TSP 规划无法实时响应行进途中突然露出的关键视野。为了在长程一致性与动态灵活性之间取得平衡,SAFE-EQA 提出了边界触发的自适应打断机制。系统实时维护由边界聚类映射到最近地标的前沿集合 \(F'_t\);当智能体视野检测到新的近距离前沿时,提取各候选前沿的朝向快照与当前计划中下一地标的观测画面,一次性打包交由 VLM 做轻量化优先级仲裁。若 VLM 判定新前沿具有更高探索价值,则将其关联地标置为新参考点 \(p_r\) 并触发重规划;若否,则坚决沿原路线平滑行驶。为了避免全局 TSP 频繁求解打乱后续队列,重规划仅在局部筛选出的 \(k\) 个高优先级地标集合 \(L_s\) 上展开,优先级得分综合了距离阻尼与 Sigmoid 缩放后的语义强弱: $\(Pri_i = \frac{s_i^\alpha}{(d_i + \epsilon)^\beta}\)$ 系统仅对这 \(k\) 个地标在参考点 \(p_r\) 引导下重新求解局部 TSP 获得子序列 \(\Pi_s\),再直接与未被选中的远端地标队列做保序拼接。这种局部调整既保留了对关键突发线索的毫秒级反应能力,又保证了全局轨迹平滑不震荡。

3. 分层图匹配与条件应答:两阶段粗精过滤阻断无谓 VLM 调用 传统 EQA 系统在每个物理位姿都调用一次大模型评估当前画面的答题置信度,造成了极大的算力浪费与时延瓶颈。SAFE-EQA 引入分层图匹配(Hierarchical Answering Module)。第一阶段为粗定位过滤:系统定期利用开词表嵌入向量,将输入问题生成的目标图 \(G_{goal}\) 与在线累积的 3D 场景图 \(G_{scene}\) 做跨图节点特征匹配,定位出语义交集锚点,并提取其在场景图中的 \(k_n\) 阶邻域子图 \(G'_{scene}\);第二阶段为精细语义验证与按需答题:将子图节点的文本标签与问题 \(q\) 一同输入 LLM,判定是否已实质性捕获候选实例 \(T_{scene}\)。仅当候选集合非空时,系统才从基于共视聚类构建的极小关键帧集(Minimal Keyframe Set \(K\))中调取对应视角的紧凑快照,唤醒多模态大模型 VLM 执行最终判定。已判决过但未形成置信答案的锚点被打上休眠标记,直到其拓扑关系刷新才允许复评,从源头上阻断了静态重复查询。

实验关键数据

主实验

论文在基于 HM3D 场景的三大权威具身问答评测基准上进行了系统测试:包含 184 道开放式问题的 OpenEQA (A-EQA split)、覆盖 174 个复杂室内场景的 EXPRESS-Bench,以及去除多选题选项、改造为开放式问答的 HM-EQA†。采用大模型匹配打分(LLM-Match,0~100 分)与路径长度加权探索效率(LLM-Match SPL)作为核心指标,并对比了全流程 LLM/VLM Token 消耗总量。

数据集 指标 SAFE-EQA (本文) 3D-Mem (CVPR'25) Fine-EQA (ICCV'25) 相对 baseline 提升
OpenEQA LLM-Match (↑)
LLM-Match SPL (↑)
Token 消耗 (↓)
56.4
53.9
10,585.8
52.6
42.0
19,488.7
43.8
26.6
-
+3.8 分
+28.3% 效率
-45.7% Token
EXPRESS-Bench LLM-Match (↑)
LLM-Match SPL (↑)
Token 消耗 (↓)
63.3
53.5
14,991.5
67.5
50.3
23,270.1
51.4
28.1
-
精度相当 (-4.2)
+6.4% 效率
-35.6% Token
HM-EQA† LLM-Match (↑)
Token 消耗 (↓)
59.2
16,214.1
59.0
22,461.7
44.2
-
+0.2 分
-27.8% Token

消融实验

论文通过针对路径规划策略与优先级评估模块(PA)的消融验证了各核心设计的独立价值。

表 1:路径规划策略消融(OpenEQA 评测集) | 规划配置 | 规划机制说明 | LLM-Match SPL (↑) | 单场景 Token 总消耗 (↓) | |---|---|---|---| | 纯几何距离 TSP (Distance-only) | 仅按拓扑地标测地距离求解 TSP 环线 | 45.7 | 14,376.9 | | 语义感知 TSP (Semantic-aware, 本文) | 引入语义折扣因子 \(\lambda_i\) 优先访问高潜能区 | 53.9 (+17.9%) | 10,585.8 (-26.4%) |

表 2:前沿优先级评估(PA)消融(EXPRESS-Bench 长轨迹子集 > 25m) | 配置 | 机制说明 | 平均轨迹长度 (m, ↓) | 单场景 Token 消耗 (↓) | |---|---|---|---| | w/o PA (无前沿自适应打断) | 严格按既定地标巡视,忽略突发高价值前沿 | 39.4 (+20.5%) | 35,921.3 | | w. PA (保留前沿评估机制, 本文) | 遇到潜力前沿快照由 VLM 仲裁插队 | 32.7 (-17.0%) | 38,753.2 (+7.9%) |

关键发现

  • 语义引导对探索效率起决定性作用:相比仅考虑几何最短距离的传统地标 TSP,赋予语义折扣的 Semantic-aware TSP 将探索效率 SPL 从 45.7 提升至 53.9(+17.9%),同时由于目标锁定速度大幅加快,避免了盲区无谓徘徊,全流程 Token 消耗降低了 26.4%。
  • 前沿优先级仲裁(PA)以极低代价换取大幅路径压缩:在超过 25 米的复杂长距离场景下,虽然开启 PA 会因额外的快照仲裁带来微量 Token 上浮(+7.9%),但它成功规避了错失近邻房门入口导致的超长绕路,使得物理巡检路径直接从 39.4 米缩短至 32.7 米(缩短 17.0%)。
  • 运行耗时分布极度亲和边缘端部署:耗时统计显示,轻量化的 TSP 局部求解单次仅需 0.31 秒,而极度昂贵的 VLM 回答预测(11.88 秒/次)与前沿评估(4.32 秒/次)由于受到图匹配与边界阈值的严密管控,单步触发频率仅为 0.24 次与 0.18 次,彻底瓦解了全流程时延瓶颈。

亮点与洞察

  • 拓扑地标骨架与连续 TSP 建模的有机融合:打破了学术界长久以来将“语义导航”等同于“单步局部前沿贪心打分”的思维惯性,将探索转化为离散地标图上的全局巡回优化,既利用 Voronoi 图保证了空间覆盖连贯性,又通过语义权值引导了宏观搜索重心。
  • “平时大步快走,突发精准打断”的混合调度哲学:多步轨迹执行大幅降低了频繁请求闭环带来的网络与计算抖动;而以前沿视野突变为触发条件的轻量级仲裁机制,巧妙攻克了经典全局规划在未知环境中响应迟钝的弊端。
  • 跨图粗定位到紧凑关键帧集的过滤体系可高频复用:场景图-目标图拓扑粗筛与共视关键帧结合的应答过滤方案,完全独立于导航底座,可以直接迁移至 Embodied-RAG、开放环境物体寻获及移动机器人巡检等长程任务中。

局限与展望

  • 作者承认的局限:系统对 3D 场景图构建的质量存在较强依赖。在极端弱光、严重反射或空旷杂乱场景下,2D 实例分割投影到 3D 聚类的误差可能传导至子图语义评分,导致语义折扣计算失准。
  • 实验假设与现实差距:实验在 Habitat-Sim 仿真环境(HM3D 真实室内扫描网格)中展开,假设了相对理想的底盘运动与局部避障,尚未充分考虑真实机械狗或轮式机器人在复杂地毯、门槛及动态人员干扰下的滑移与位姿漂移。
  • 改进思路与未来方向:未来可探索引入端侧轻量化视觉特征模型在线自监督校正拓扑地标,并将局部避障代价更平滑地编码进测地距离矩阵;同时可尝试将 VLM 前沿仲裁蒸馏至本地小参数多模态模型中,进一步压缩端侧延迟。

相关工作与启发

  • vs 3D-Mem (CVPR 2025):3D-Mem 侧重于利用三维分层记忆与共视关键帧解决信息存储与检索问题,但在路径规划上仍偏向局部单步决策;SAFE-EQA 吸收了其紧凑关键帧存储的优势,但重点革新了路径规划内核,将单步近视探索重构为全局语义 TSP,在保持极高问答水平的同时实现了更短的路径长度与更优的 SPL(OpenEQA 上 53.9 vs 42.0)。
  • vs Explore-EQA (arXiv 2024):Explore-EQA 依赖密集前沿采样与步步置信度轮询;SAFE-EQA 则以拓扑地标图为骨架、以图匹配为应答门控,VLM 调用频次下降数倍,Token 消耗下降 45% 以上。
  • vs VoroNav (ICML 2024) / CogNav (ICCV 2025):两者均使用 Voronoi 图做目标驱动导航,但主要针对已知明确类别目标的寻物任务(ObjectNav);本文进一步将 Voronoi 地标拓扑与开放式问答语义关联度无缝耦合为动态赋权 TSP,拓展了图拓扑规划在复杂非结构化问答任务中的边界。

评分

  • 新颖性: ⭐⭐⭐⭐☆ [将 EQA 探索创新性地抽象为拓扑 Voronoi 地标图上的语义感知 TSP 规划,结合前沿仲裁打断,构思新颖巧妙]
  • 实验充分度: ⭐⭐⭐⭐⭐ [在 OpenEQA、EXPRESS-Bench 与 HM-EQA 三大主流基准上全面对比了精度、路径效率、Token 开销及逐模块消融]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑架构清晰严密,从痛点剖析到数学形式化再到实验论证环环相扣,图表详实]
  • 价值: ⭐⭐⭐⭐☆ [对低延迟、低算力开销的实用化具身智能移动智能体探索与环境理解提供了非常扎实的可复用工程思路]