Sentinel: Embodied Cooperative Spatial Reasoning and Planning¶
会议: ECCV 2026
论文: ECCV 2026 Poster
代码: https://github.com/UMass-Embodied-AGI/Sentinel
领域: 多模态VLM / 机器人/具身智能
关键词: 具身智能, 多智能体协作, 空间推理, 路径重规划, 动态环境避障
一句话总结¶
针对城市场景下多具身智能体在动态哨兵威胁中缺乏空间协作能力的难题,本文提出基准 Sentinel Challenge 与框架 CoSaR,将结构化空间记忆与视觉语言模型重规划相融合,实现了高效避障与快速会合。
研究背景与动机¶
多智能体协同是具身人工智能走向开放物理世界的必由之路。人类在城市尺度环境中能够天然地展开协作:通过语言商定安全便利的集结点、实时共享道路阻断与危险源信息,并根据环境动态推演调整路线。然而,现有多智能体具身系统大多局限于小规模且静态的室内家居环境(如基于 CoELA 的物品重排任务)。一旦将协作尺度推向广袤的城市户外空间,智能体之间的距离急剧拉大,视野受限且难以直接碰面,传统依赖局部避障与固定全局路线规划的范式便彻底失效。
在城市尺度多智能体协作中,核心矛盾在于全局粗粒度先验与局部高动态威胁之间的严重割裂。一方面,移动导航依赖的地图工具通常只能提供类似点到点路标的粗略导航骨架,无法感知实时动态风险;另一方面,环境中普遍存在巡逻或静止的动态危险源(即哨兵),智能体若仅凭各自局部的第一人称视野摸索,既难以在去中心化通信中达成兼顾所有人通行成本的最佳集结点,又极易在前往集结点的路上遭遇哨兵捕获。同时,端到端多智能体强化学习(如 MAT)受限于城市级巨大的状态与动作空间,很难收敛到鲁棒策略。
为了打破静态封闭环境与动态城市尺度的鸿沟,本文将研究视角聚焦于“协作空间智能”(Cooperative Spatial Intelligence)。核心 idea:构建一套融合多模态感知、自然语言通信与经典图算法的协作空间推理框架 CoSaR,利用结构化空间记忆动态追踪队友与危险源,并借助视觉语言模型(VLM)在示意图上的空间推理能力实现航路重规划与安全会合。
方法详解¶
整体框架¶
CoSaR 将去中心化多智能体协同问题形式化为带通信的部分可观测马尔可夫决策过程(DEC-POMDP-COM)。系统整体包含感知模块、通信模块、空间记忆核心、空间感知推理引擎以及执行与导航模块。智能体在每个周期获取第一人称 RGB-D 传感器输入、地图工具返回结果与队友的自然语言通信,提取出目标实体、哨兵警戒状态、队友坐标与预计到达时间(ETA),并在共享语义层维护统一的空间记忆;当推理引擎检测到路径与危险区重叠时,触发基于 VLM 的航路重构与底层安全控制。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["环境输入<br/>RGB-D / 队友消息 / 地图工具响应"] --> B["多模态感知与语义解析<br/>Grounding DINO + SAM 2 + 文本抽取"]
B --> C["结构化空间记忆维护<br/>占用栅格 / 危险区 / 队友位姿 / ETA图"]
C --> D["空间感知推理与决策<br/>查询 / 通信 / 导航 / 等待 四元动作"]
D -->|路径安全| E["底层局部路径追踪<br/>A* 局部规划与应急避让"]
D -->|遭遇危险区| F["航路重规划与多模态空间对齐<br/>VLM 示意图重构 + 地图路网校准"]
F --> E
E --> G["执行底层运动并向队友广播更新"]
关键设计¶
1. 结构化空间记忆维护:打通异构空间知识的统合表征
传统具身智能体在开放通信时往往直接拼接非结构化文本历史,极易遗忘几何空间约束并引发幻觉。CoSaR 设计了一套多层级持久化空间记忆,将物理几何与语义信息解耦并存。在几何底层,智能体通过体素网格(Voxel Grid)更新可通行地表占用图,并将感知与通信识别到的哨兵位置膨胀为危险区(Danger Zones);在协作层,智能体维护一张动态位姿注册表(Pose Registry)与到各候选地点的到达时间估计图(ETA Map)。当接收到其他智能体发来的自然语言时,模块自动抽取出三元组信息并填入该记忆,使模糊的语言交互沉淀为显式的空间几何拓扑。
2. 空间感知推理与决策:兼顾认知开销的按需推理
去中心化智能体必须在自主探索与集体行动之间做权衡。CoSaR 引入大语言模型作为认知推理中枢,以结构化空间记忆为上下文提示词,统筹评估当前集结目标与个人行进计划。智能体从四类高层动作中择优选择:调用地图工具(Query)、广播对齐消息(Communicate)、向既定地点移动(Navigate)以及保持静止同步进度(Wait)。为杜绝每步调用大模型所带来的高昂推理开销与动作迟滞,该模块采用事件驱动机制激活:仅当接收到新消息、感知到新出现的哨兵、检测到集结点产生分歧,或常规周期到达 120 秒超时触发时才唤醒大模型进行重规划。
3. 航路重规划与多模态空间对齐:弥合大模型空间几何幻觉与可执行性
当全局路线穿过哨兵的动态危险区时,直接基于栅格网格搜索可能陷入局部死锁,而单纯依赖语言模型又无法生成连续物理合法的轨迹点。CoSaR 提出了航路重规划方案:首先从地图工具拉取一张粗粒度 2D 顶视鸟瞰占用图,将当前自车位姿、已知哨兵危险区和原失效轨迹渲染为示意图(Schematic Spatial Map);随后将带坐标标注的示意图输入 VLM,利用其宏观视觉推理能力直接在图像空间提出避让拐点坐标;最后,为了消除 VLM 生成坐标的数值漂移,系统将这些粗略坐标输入地图工具的 QueryRefinedRoute 接口,投影回最近的有效连通图路标节点并串接为平滑可通行的折线,若多次重试未果则安全降级为危险区剪枝启发式算法。
一个完整示例¶
假设 3 名智能体 Alice、Bob、Charlie 初始分散在 800m × 800m 的城市三端。首先,Alice 查询地图工具获取自身与备选集结点的距离,通过自然语言向全局广播:“我距离中心广场(Plaza)预计 12 分钟,建议大家前往广场集结”。Bob 解析消息后更新自身 ETA Map,确认自己到广场仅需 10 分钟并同意方案;Charlie 此时在拐角处通过 Grounding DINO 与 SAM 2 检测到前方出现巡逻哨兵,立刻将哨兵坐标广播并标记为危险区。Alice 的原定参考路径恰好穿透该危险区,系统随即触发航路重规划:生成叠加了危险红圈与原蓝路线的示意图发送给 VLM,VLM 推理出向东侧街道迂回的一组粗略路标点,地图工具将其吸附到合法道路并生成新路径,3 名智能体在零捕获前提下顺利会合。
实验关键数据¶
主实验¶
实验基于 Virtual Community 平台构建的 24 个 800m × 800m 真实城市级别场景(每个场景包含 50–150 个预定义集结点、最多 15 名智能体与 20 个哨兵),在 14 个测试场景下对比了 6 种代表性基线。下表展示了 5 名智能体面对 10 个哨兵挑战时的主实验平均结果(最大步数 1500 步)。
| 方法 | 哨兵类型 | 成功率 (%) ↑ | 被捕获率 (%) ↓ | 检测率 (%) ↓ | 耗时 (Steps) ↓ | 移动距离 (m) ↓ |
|---|---|---|---|---|---|---|
| Oracle Centered | 10 静止哨兵 | 7.14 | 51.43 | 1.80 | 1429.86 | 1800.07 |
| Oracle Centered w/ DZ | 10 静止哨兵 | 11.90 | 39.29 | 1.86 | 1401.40 | 1598.50 |
| MCTS Planner | 10 静止哨兵 | 10.71 | 47.38 | 2.21 | 1371.26 | 2206.20 |
| RoCo [29] | 10 静止哨兵 | 26.19 | 26.90 | 1.13 | 1255.81 | 1333.27 |
| CoELA [65] | 10 静止哨兵 | 16.67 | 25.24 | 1.08 | 1340.77 | 1522.53 |
| MAT [58] | 10 静止哨兵 | 0.00 | 35.71 | 1.13 | 1500.00 | 1453.82 |
| CoSaR (本文) | 10 静止哨兵 | 32.14 | 21.43 | 1.27 | 1194.45 | 1552.45 |
| Oracle Centered | 10 巡逻哨兵 | 14.29 | 28.57 | 1.50 | 1367.07 | 1401.93 |
| Oracle Centered w/ DZ | 10 巡逻哨兵 | 29.76 | 22.14 | 1.66 | 1228.89 | 1381.91 |
| MCTS Planner | 10 巡逻哨兵 | 15.48 | 40.48 | 2.02 | 1338.67 | 2226.39 |
| RoCo [29] | 10 巡逻哨兵 | 29.76 | 28.57 | 1.73 | 1306.00 | 1480.76 |
| CoELA [65] | 10 巡逻哨兵 | 26.19 | 17.62 | 0.94 | 1304.94 | 1436.53 |
| MAT [58] | 10 巡逻哨兵 | 7.14 | 20.24 | 0.78 | 1447.17 | 1269.10 |
| CoSaR (本文) | 10 巡逻哨兵 | 32.14 | 27.62 | 2.22 | 1246.86 | 1577.99 |
在真值感知(Oracle Perception)辅助配置下,CoSaR 在 10 静止哨兵下的成功率跃升至 53.57%(被捕获率低至 9.05%),大幅超越 RoCo 的 46.43% 与 CoELA 的 34.52%。
消融实验¶
在 5 智能体、10 静止哨兵环境下逐步剥离 CoSaR 关键模块的消融评测数据如下:
| 配置 | 成功率 (%) ↑ | 被捕获率 (%) ↓ | 检测率 (%) ↓ | 耗时 (Steps) ↓ | 移动距离 (m) ↓ | 说明 |
|---|---|---|---|---|---|---|
| CoSaR 完整模型 | 32.14 | 21.43 | 1.27 | 1194.45 | 1552.45 | 包含所有协同与重规划机制 |
| w/o 航路重规划 (Route Refinement) | 26.19 | 28.80 | 1.18 | 1243.31 | 1446.25 | 重试上限置零,无法主动绕行危险区 |
| w/o 消息解析器 (Message Analyzer) | 19.26 | 31.38 | 1.29 | 1310.20 | 1488.76 | 无法沉淀通信中的位姿与 ETA 图 |
| w/o 空间记忆 (Spatial Memory) | 21.42 | 31.19 | 1.27 | 1283.70 | 1489.28 | 决策时禁用 ETA 图与位姿底账 |
| w/o 应急避让 (Emergency Avoidance) | 24.05 | 31.95 | 1.15 | 1268.58 | 1513.40 | 遭遇突发哨兵时不执行就近规避 |
关键发现¶
- 消息解析与空间记忆是协作基石:去掉消息解析器导致成功率暴跌 12.88 个百分点(从 32.14% 降至 19.26%),被捕获率从 21.43% 升至 31.38%。这证明如果没有结构化空间记忆将自然语言转为几何坐标与时间约束,语言通信便退化为无效闲聊。
- 效率与安全性的权衡本质:CoELA 虽然在部分指标下被捕获率稍低(如巡逻哨兵下 17.62%),但其原因并非导航更敏捷,而是由于缺乏动态空间指导导致大量智能体停滞在初始室内安全点不敢外出,最终超时失败;CoSaR 则以更短的耗时(1194.45 步)兼顾了快速出击与高成功率。
- 基座模型通用性验证:将 GPT-4o 替换为开源的 Qwen3-VL-30B-A3B-Instruct 后,在 5 智能体 5 静止哨兵场景下依旧斩获了 60.71% 的成功率与 7.69% 的极低被捕获率(GPT-4o 为 67.85% / 5.00%),证明框架不绑定私有模型。
亮点与洞察¶
- 拓扑地图与视觉大模型的互补闭环:利用 2D 鸟瞰图将高维环境投影为可直观推理的视觉提示,依靠 VLM 输出宏观绕行意图,再借助地图路标图投影(QueryRefinedRoute)校正幻觉,巧妙规避了传统轨迹生成中连续数值回归极其不稳定的缺陷。
- 事件驱动式神经-符号协同架构:将耗费计算的高层大模型规划限制在“突发事件/语义分歧/定时器唤醒”关键节点上,低层则全权委托给确定性图算法(Dijkstra、A*),兼顾了宏观协作协商的智能深度与底层微观控制的响应实时性。
局限与展望¶
- 复杂遮挡与高层建筑视野局限:目前的俯视示意图假设 2D 平面投影,但在多层立交或高度密集的摩天大楼区域,2D 鸟瞰图无法有效表达 3D 遮蔽关系与纵向通行通道。
- 哨兵运动规律的静态假设:危险区当前采用围绕瞬时位置的几何缓冲膨胀,尚未引入对哨兵巡逻路径的轨迹预测模型(如卡尔曼滤波或轨迹意图辨识),在高速巡逻下可能预测滞后。
- 通信带宽与丢包假设理想化:系统默认广播通信通道无丢包且无延迟,未来可拓展至带通信距离限制、带噪声传输的多智能体拓扑组网。
相关工作与启发¶
- vs CoELA [65]: CoELA 开创了 LLM 驱动多智能体交互的模块化范式,但仅在封闭小尺度室内通过纯语言规划协作;CoSaR 将其扩展到 800m × 800m 城市空间,核心增量在于空间记忆与跨模态地图路网重规划。
- vs RoCo [29]: RoCo 采用“预先协商、随后执行”的静态协商模式,无法应对环境中持续移动的动态威胁;CoSaR 通过事件驱动与局部应急避让机制,实现了执行期的动态连续重规划。
- vs MAT [58]: MAT 作为集中式强化学习基线,在城市大范围连续空间下难以收敛且成功率几乎归零;CoSaR 展现了基础模型零样本推理与传统路径规划结合在开放尺度下的显著优越性。
评分¶
- 新颖性: ⭐⭐⭐⭐☆(在开放城市场景下开创性地提出协作空间智能基准与示意图重规划闭环)
- 实验充分度: ⭐⭐⭐⭐⭐(涵盖 14 个大场景、不同哨兵行为、消融分析与开源基座对比,数据扎实)
- 写作质量: ⭐⭐⭐⭐⭐(问题建模严谨,图文对应清晰,DEC-POMDP-COM 形式化规范)
- 价值: ⭐⭐⭐⭐☆(为具身智能从室内走向广域群体协作、智慧城市低空/地面协同提供了标杆参考)