跳转至

Seek to Segment: Active Perception for Panoramic Referring Segmentation

会议: ECCV 2026
论文: ECCV 2026 Poster
代码: https://henghuiding.com/APRS/
领域: 语义分割
关键词: 全景视觉, 主动感知, 指称图像分割, 空间视觉记忆, 具身智能

一句话总结

针对传统指称分割被动依赖静态单视角的瓶颈,本文提出主动全景指称分割任务(APRS)与智能体 PanoSeeker,通过显式全景空间记忆 EgoSphere 消除探索死循环,结合两阶段 SFT 与 GRPO 强化学习,实现了高效的主动寻物与精准对齐分割。

研究背景与动机

指称图像分割(Referring Image Segmentation, RIS)要求模型根据自然语言指令定位并分割出目标物体。近年来,结合大语言模型与多模态大模型的推理分割技术(如 LISA、VisionReasoner)取得了显著进展,但在具身智能与真实机器人应用场景中,这些方法显露出致命的被动性:它们严格假设目标始终完整出现在预先截取的静态单视角图像中。真实的具身智能体处于连续的三维或 \(360^\circ\) 全景环境中,所指示的目标往往处于智能体初始视野之外,或者需要基于跨视角的空间方位关系(如“床对面的地柜”、“植物旁边的垃圾桶”)进行多步跨视角推理。

要在连续 \(360^\circ\) 环境中实现主动寻物与分割,现有路线面临严峻的权衡困境。一方面,基于点云或 3D Gaussian Splatting 的显式三维建模方案虽然能够提供精细的几何布局,但依赖昂贵的全场景扫描与实时 3D 重建,算力消耗与硬件门槛极高,难以轻量化部署。另一方面,直接处理二维展开的等矩形全景图(ERP)会引入严重的球面畸变与接缝伪影;而若将环境机械切分为独立透视视角序列,又会割裂全局空间拓扑,极易使智能体陷入重复打转与视角遗忘的“死循环”。

本文切入的角度是:利用易获取的高分辨率全景图像模拟连续主动感知,既免去了高昂的 3D 重建开销,又能保留连续环境的完整球面几何。本文的核心 idea 是构建主动全景指称分割框架 PanoSeeker,通过显式空间视觉记忆画布 EgoSphere 动态拼接局部观测,将全景主动寻物转化为全景画布上的视觉“填空”,并引入多步 SFT 与 GRPO 强化学习两阶段后训练,驱动智能体以最短测地线路径探索环境并完成视点对齐分割。

方法详解

整体框架

PanoSeeker 的核心运行闭环包含环境感知、记忆更新、路径规划决策以及终端对齐分割四个步骤。智能体从初始朝向出发,受限于局部视场角(水平 \(120^\circ\),垂直 \(90^\circ\)),在每一步获取当前透视观察;通过逆球极切面投影将观测增量融合进固定尺寸的等矩形全景记忆图 EgoSphere;视觉语言模型(Qwen3-VL-8B)联合输入局部高频细节、全局记忆图以及语言指令,输出下一步视点旋转动作或终止信号;一旦生成终止信号,系统启动主动视点对齐机制,修正边界截断偏差并由分割大模型输出像素级掩码。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入:用户自然语言指令 + 初始视角观察"] --> B["显式空间视觉记忆 EgoSphere<br/>逆透视投影拼接 ERP 画布"]
    B --> C["空间提示增强与跨视角推理<br/>十字准星 + 经纬网格 + 历史轨迹线"]
    C --> D["PanoSeeker 策略网络<br/>联合局部细节与全局记忆预测动作"]
    D -->|继续探索| E["执行视点旋转增量 (Δθ, Δϕ)"]
    E --> B
    D -->|发现目标输出 STOP| F["主动视点对齐与分割<br/>目标居中对齐 + SAM-3 生成高质量掩码"]
    F --> G["输出:精准像素级目标分割掩码"]

关键设计

1. 显式全景空间记忆 EgoSphere:消除历史冗余与死循环搜索 在受限视场角下连续搜索目标时,传统智能体依赖纯文本动作日志或单帧视觉缓存,极易丢失空间连续性,导致在同一区域反复打转。针对这一痛点,EgoSphere 摒弃不断变长的序列化历史,将空间记忆形式化为一个分辨率固定为 \(1024 \times 512\) 的等矩形全景图(ERP)画布 \(M \in \mathbb{R}^{H \times W \times 3}\),初始化为全零张量。在每一步 \(t\),智能体基于当前相机姿态 \((\theta_t, \phi_t)\) 获取局部透视观察 \(V_t\),通过逆日晷切面(Gnomonic)投影将局部图像反投影回单位球面,并像素级更新至 ERP 画布: $\(M_t = M_{t-1} \oplus \text{Proj}^{-1}(V_t, \theta_t, \phi_t, \psi)\)$ 其中全零区域直观指示了尚未被感知的未探索边界(Frontier)。这种机制将随交互步数无限增长的历史信息压缩为恒定长度的全局上下文,彻底消除了历史序列过长带来的上下文退化与推理延迟。

2. 空间提示增强与跨视角推理:将主动探索转化为画布填空 即使拥有累积的 ERP 全景画布,VLM 仍难以精准估算物理偏转角度并建立自身朝向与全局场景的几何对应。为此,EgoSphere 在画布上直接渲染三种几何视觉提示(Visual Prompts):第一,在当前视野中心绘制高亮十字准星,打通自中心视点与异中心全景的对齐基准;第二,叠加每隔 \(30^\circ\) 的经纬度辅助网格,为大模型提供直观的绝对角位移尺度;第三,将历史轨迹线 \(\{(\theta_1, \phi_1), \dots, (\theta_{t-1}, \phi_{t-1})\}\) 绘制为带箭头的连续有向路径。这三重几何线索将复杂的跨视角三维搜索,转换为类似直观的视觉“填空”任务,模型只需判断目标可能隐匿的未探索黑区或参考地标的相对角度,即可规划下一步动作。

3. SFT 与 GRPO 两阶段协同优化:兼顾专家探索轨迹与测地线路径效率 纯模仿学习容易让智能体在分布外场景迷失,而直接强化学习则受困于动作空间巨大和稀疏奖励。本文采用两阶段联合训练:第一阶段是有监督微调(SFT),在高质量专家轨迹数据集上,通过最小化专家动作的负对数似然损失函数训练 PanoSeeker,使模型掌握基本的视角调整常识与语义对齐能力;第二阶段采用免 Critic 的组相对策略优化(GRPO),在探索阶段引入测地线距离密集效率奖励 \(R_{\text{eff}}\): $\(R_{\text{eff}} = \gamma \left[ \text{dist}(V_{t-1}, V^*) - \text{dist}(V_t, V^*) \right] - \eta\)$ 每次视角更新若缩短与目标真实方位的球面测地线距离即可获得正向奖励,单步步长则伴随固定惩罚 \(\eta\) 抑制冗余徘徊。在生成终止符时结算终端奖励 \(R_{\text{term}}\)(成功命中给予基准奖励与 IoU 加权分,失败则施加重罚)。这一策略显著压缩了无效探索步数,迫使智能体学习接近理论最短路径的规划策略。

4. 主动视点对齐与分割:消除视野截断并稳定掩码质量 在主动寻物结束时,目标往往出现在视野边缘或被部分截断,直接套用静态分割模型容易产生严重边缘破损与欠分割。为此,PanoSeeker 在预测终止信号 [STOP] 的同时输出初始检测框 \(B\);随后启动主动视点对齐机制,基于 SAM-3 的追踪与中心对齐能力,计算目标质心与当前光学中心的偏角偏移 \((\Delta\theta^*, \Delta\phi^*)\),驱动相机执行一次微小的居中微调,使目标完整呈现在视场正中心后再生成最终分割掩码 \(S\)。这有效消除了视野边界截断对分割精度的负面影响。

损失函数 / 训练策略

在 SFT 阶段,模型基于专家轨迹集合 \(\mathcal{D}_{\text{expert}}\) 优化交叉熵损失: $\(\mathcal{L}_{\text{SFT}} = - \mathbb{E}_{\mathcal{T} \sim \mathcal{D}_{\text{expert}}} \sum_{t=1}^{T} \log p_{\theta}(a_t \mid V_t, M_t, I)\)$ 在 RL 阶段,基于每组采样得到的 \(G\) 条轨迹奖励计算优势函数 \(A_i = (r_i - \text{mean}(\{r_g\})) / \text{std}(\{r_g\})\),使用带截断机制和 KL 散度约束的 GRPO 目标函数联合优化 LoRA 参数,兼顾策略更新幅度与泛化稳定性。

实验关键数据

主实验

论文在构建的包含 7,420 组样本、4,971 个全景场景的 APRS 基准上进行了全面评测,对比了静态全景输入、启发式固定扫描以及主动 VLM 智能体三类方案。

表 1:APRS 基准主流方法定量对比(对应原文 Table 2) | 方法类别 | 模型 | 记忆机制 | 成功率 SR (%) ↑ | 平均步数 AS ↓ | 路径加权成功率 SPL ↑ | 平均交并比 mIoU (%) ↑ | |---|---|---|---|---|---|---| | 静态单图直接处理 | VLT (ICCV'21) | ✗ | 46.7 | 1.0 | - | 34.7 | | 静态单图直接处理 | CRIS (CVPR'22) | ✗ | 55.4 | 1.0 | - | 39.2 | | 静态单图直接处理 | LISA (CVPR'24) | ✗ | 64.1 | 1.0 | - | 44.5 | | 静态单图直接处理 | SAM4MLLM (ECCV'24) | ✗ | 62.3 | 1.0 | - | 46.2 | | 静态单图直接处理 | VisionReasoner (ICLR'26) | ✗ | 66.2 | 1.0 | - | 47.7 | | 预设启发式扫描 | VLT (ICCV'21) | ✗ | 28.4 | 4.6 | 0.14 | 22.1 | | 预设启发式扫描 | LISA (CVPR'24) | ✗ | 42.3 | 5.2 | 0.22 | 34.1 | | 预设启发式扫描 | VisionReasoner (ICLR'26) | ✗ | 49.5 | 4.9 | 0.26 | 39.9 | | 主动探索智能体 | Qwen3-VL-30B-Thinking | 文本日志 | 62.9 | 8.0 | 0.29 | 51.0 | | 主动探索智能体 | Gemini-3-Flash | 文本日志 | 64.9 | 6.8 | 0.31 | 51.4 | | 主动探索智能体 | GPT-5.2 | 文本日志 | 69.1 | 6.2 | 0.36 | 53.2 | | 主动探索智能体 | PanoSeeker (本文) | EgoSphere | 75.4 | 4.8 | 0.57 | 55.8* |

*注:静态方法单次前向处理整张全景图,步数固定为 1.0,SPL 不适用。

消融实验

消融实验逐项验证了空间记忆、有监督微调以及强化学习策略对整体性能的增益。

表 2:PanoSeeker 核心模块消融对比(对应原文 Table 3) | 变体配置 | 训练方式 | 显式记忆 EgoSphere | GRPO 强化学习 | 成功率 SR (%) ↑ | 平均步数 AS ↓ | SPL ↑ | mIoU (%) ↑ | 说明 | |---|---|---|---|---|---|---|---|---| | (a) 零样本基线 | 无训练 | ✗ | ✗ | 41.6 | 12.4 | 0.14 | 28.5 | 缺乏记忆导致死循环打转 | | (b) 引入空间记忆 | 无训练 | ✓ | ✗ | 56.5 | 8.7 | 0.26 | 39.9 | 记忆地图阻止重复扫描 (+14.9% SR) | | (c) 引入 SFT 训练 | 专家轨迹 SFT | ✓ | ✗ | 70.3 | 6.2 | 0.40 | 50.7 | 掌握动作语义映射 (+13.8% SR) | | (d) 完整框架 (本文) | SFT + RL | | | 75.4 | 4.8 | 0.57 | 55.8 | GRPO 显著压缩无效步数 (SPL +0.17) |

表 3:零样本设定下不同记忆结构对比(对应原文 Table 4) | 记忆形式 | 文本日志 | 视觉历史格式 | 成功率 SR (%) ↑ | 平均步数 AS ↓ | SPL ↑ | mIoU (%) ↑ | 说明 | |---|---|---|---|---|---|---|---| | 无记忆基线 | ✗ | ✗ | 41.6 | 12.4 | 0.14 | 28.5 | 盲目随机选择 | | 文本动作日志 | ✓ | ✗ | 50.3 | 9.9 | 0.21 | 35.7 | 纯语言难以建模球面拓扑 | | 视觉图像缓存 | ✗ | 5 帧透视切片 | 46.8 | 10.5 | 0.17 | 32.0 | 离散切片缺乏全局坐标系 | | 混合缓存形式 | ✓ | 5 帧透视切片 | 43.6 | 11.0 | 0.15 | 30.6 | 图文模态线索冲突反而降点 | | EgoSphere (本文) | | 1 张 ERP 画布 | 56.5 | 8.7 | 0.26 | 39.9 | 几何连续投影效果显著占优 |

关键发现

  • EgoSphere 空间记忆是打破死循环的根基:在零样本设定下,单纯加入 EgoSphere 即可将成功率从 41.6% 跃升至 56.5%,平均步数从 12.4 步缩减至 8.7 步;相比于多帧透视缓存(46.8%),EgoSphere 的单张连续 ERP 投影彻底解决了离散视角割裂空间关系的痛点。
  • GRPO 是最大化探索效率的核心驱动力:在拥有 SFT 的基础上,引入强化学习后成功率进一步从 70.3% 提升至 75.4%,更为关键的是 SPL 指标从 0.40 飙升至 0.57(相对提升 42.5%),平均探索步数由 6.2 步骤降至 4.8 步,证明密集测地线距离奖励极大修正了人类专家标注中潜在的冗余步数。
  • 主动搜索在全景指称理解中全面压制静态方案:即使是百亿参数级别的 VisionReasoner,在展开的全景图上直接做静态分割,mIoU 也仅有 47.7%,而参数量远小于通用超大模型的 PanoSeeker(基于 8B 模型微调)达到了 55.8% mIoU,证明面对畸变全景与复杂空间指称时,“主动转头看”比“全景一眼看”具有根本性的表征优势。

亮点与洞察

  • 将球面几何映射与 2D 画布填空巧妙结合:传统具身寻物往往滑向沉重的 3D 点云渲染或 NeRF/3DGS 重建,PanoSeeker 借助等矩形全景图的数学投影,将 3D 旋转感知投影为单张 2D 记忆画布,在极低计算开销下维持了恒定长度的上下文窗口。
  • 视觉提示(十字准星 + 网格 + 轨迹)赋予普通 VLM 空间度量感:VLM 本身缺乏对连续物理旋转角(\(30^\circ\)\(60^\circ\))的内在度量能力,在记忆画布上叠加离散经纬网格与当前视角十字准星,将抽象连续运动控制巧妙转换为基于视觉参考系的目标定位。
  • 可迁移的具身感知范式:EgoSphere 这种“局部视场感知 + 球面累积画布 + 密集位移奖励”的机制,可以无缝迁移至四足机器人巡检、室内服务机器人指称抓取等连续主动感知任务中。

局限与展望

  • 纯旋转视角假设忽略了位姿平移(Translation):当前任务基于固定的单点球面全景展开,智能体只能原地调整偏航与俯仰(\(\Delta\theta, \Delta\phi\)),无法在物理空间中自主平移避障或跨房间移动。
  • 极点区域的投影拉伸与伪影干扰:等矩形全景图在天顶与地底(高纬度区)存在固有的非线性几何拉伸,当目标物体处于极高或极低俯仰角时,投影到记忆画布的畸变可能干扰 VLM 的语义判断。
  • 未来改进方向:可进一步将 EgoSphere 扩展至具备连续平移(6-DoF)的拓扑全景图节点网络,并融合深度先验构建局部的轻量化拓扑记忆图。

相关工作与启发

  • vs LISA / VisionReasoner (静态指称分割):LISA 等静态模型假设目标已处于当前静态透视视野内,面对 \(360^\circ\) 环境只能一次性处理充满畸变的全景图或依赖启发式穷举;PanoSeeker 赋予智能体主动探索和调整视角的能力,在更少冗余计算下实现更高质量分割。
  • vs MemGPT / VisMem (智能体记忆):现有智能体记忆方案要么是纯文本对话日志堆叠,要么是离散历史图像序列排队,上下文长度与检索延迟随交互步数急剧膨胀;EgoSphere 将连续观测投射至固定分辨率的 360° ERP 画布,维持常数级上下文长度且几何拓扑严格连续。
  • vs Refer360 / REVERIE (具身全景指称导航):Refer360 等任务依赖密集的逐步导航指令或离散全景选择,本质是底层指令跟随;APRS 要求智能体单靠目标语义描述与空间相对关系自主控制细粒度视角偏转与像素级分割。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次提出主动全景指称分割任务 APRS,设计了具有常数上下文与几何连续性的 EgoSphere 全景空间记忆。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 4,971 个场景与 4 种空间推理难度,完整对比静态、启发式与主动智能体三类基线,消融分析细致扎实。
  • 写作质量: ⭐⭐⭐⭐⭐ 任务定义数学表述清晰,动机切入准确,方法图与实验可视化直观易懂。
  • 价值: ⭐⭐⭐⭐☆ 为真实机器人主动感知与全景具身智能体提供了一个轻量、低成本且极具挑战性的新基准。