Panoramic Affordance Prediction¶
会议: ECCV 2026
论文: ECCV 原文
领域: 机器人 / 具身智能
关键词: 全景视觉, 可用性预测, 具身智能, 视觉网格提示, 自适应注视
一句话总结¶
针对具身智能中针孔相机视野狭窄、观察碎片化的核心瓶颈,本文首次探索全景可用性预测(Panoramic Affordance Prediction),构建了包含 1,003 张 12K 原生全景图像与 1.3 万问答对的首个基准 PAP-12K,并提出仿人眼中央凹视机制的免训练框架 PAP,实现全景场景下对极具形变、跨边界及极端尺度变化物体的稳健交互区域分割。
研究背景与动机¶
在具身智能中,可用性预测(Affordance Prediction)指引智能体理解环境中“哪些物体可供交互”以及“如何交互”,是连接高层任务规划与底层机械控制的关键桥梁。然而,现有的可用性预测方法几乎无一例外地建立在传统针孔相机(Pinhole Camera)模型之上。由于针孔相机视野极其狭窄,智能体面临严重的“管窥效应”(tunnel vision),环境感知被割裂为局部、离散的视场切片。在真实物理世界中,机器人为了寻找操作目标不得不反复调整机身朝向,不仅大幅增加了机械运动能耗与时间开销,更致命的是容易遗漏侧后方与外周视野中的关键环境线索,导致任务规划陷入局部最优乃至完全失效。
引入 \(360^\circ\) 全景视觉是打破这一局限的天然选择。全景相机单次曝光即可捕获全局空间拓扑与环境上下文,已被广泛应用于机器人自主导航与 SLAM。然而,全景图像通常以等矩形投影(Equirectangular Projection, ERP)格式展开,这给可用性预测引入了三项严苛的物理与几何挑战:极地附近的极端拉伸形变(Geometric Distortion)、目标在广角视野下占比极度悬殊的极端尺度变化(Extreme Scale Variations,小目标像素占比可低于 0.0038%,而大目标可达 39%),以及物体在图像左右边界被硬性撕裂的边界不连续性(Boundary Discontinuity)。现存为透视图像设计的 SOTA 可用性模型(如 A4-Agent、Affordance-R1 等)直接应用于全景图像时,因严重的域差异与注意力分散而出现断崖式性能崩溃。
为了克服现有基础模型在全景图像上的表征失配,本文的切入角度是模仿人类视觉的“中央凹-外周”两阶段注视机制:人类在广阔场景中并非以均一分辨率扫视,而是先用外周视觉进行粗粒度线索定位,再转动眼球将中央凹对准目标并投影视网膜进行高敏锐度解析。核心 idea:将全景可用性预测解耦为仿生中央凹视流水线,通过网格提示在下采样全景图上递归路由锁定目标,再利用球面切平面自适应注视消除几何畸变与边界截断,最后在透视域调用 2D 视觉基础模型精确分割并逆映射回全景空间。
方法详解¶
整体框架¶
PAP 采用全流程免训练(training-free)的从粗到细流水线架构,包含三大核心阶段:首先利用视觉网格提示与递归视觉路由(Recursive Visual Routing)粗定位交互目标,接着通过自适应注视(Adaptive Gaze)将球面局部区域无畸变地投影至透视切平面,最后利用级联可用性定位(Cascaded Affordance Grounding)提取像素级掩码并逆投影回原始 ERP 图像。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
Input["输入:12K 全景等矩形投影 (ERP) 图像 I_ERP<br/>与交互任务指令 T"] --> RVR["视觉网格提示与递归视觉路由<br/>4×3 离散网格选择 + 尺度判断与动态下采样"]
RVR --> AG["自适应注视投影<br/>经纬度对齐 + 自适应 FoV 球面切平面投影"]
AG --> CAG["级联式可用性定位与逆映射<br/>Rex-Omni 目标检测 + SAM-2 细粒度掩码分割<br/>+ 逆透视球面投影"]
CAG --> Output["输出:全景等矩形图上的高精度可用性掩码 M_ERP"]
关键设计¶
1. 视觉网格提示与递归视觉路由:将连续坐标回归转化为离散选择并动态缩放
多模态大语言模型(VLM)擅长理解高层任务并推断需要什么工具,但在超高分辨率全景图像中直接回归连续坐标时常因注意力稀释而严重失准。为此,该模块在 ERP 图像上叠加 \(4 \times 3\) 的数字网格提示(编号 1 至 12),引导 VLM 输出具体工具描述 \(T_{obj}\) 并选择目标所在的网格编号,将难以优化的连续坐标预测转换为离散的多模态选择题。面对微小物体在全景中占比极低的问题,算法采用递归缩放策略:若目标跨越多个网格判定为大尺度目标并立即终止路由;若目标局限于单一网格,则将其裁剪后叠加子网格进行下一轮推理。为控制计算开销,系统在首轮输入时将全景图激进下采样至 \(2000 \times 1000\)(约 \(1/6\) 比例),第二轮局部裁剪图则采用轻度下采样 \(1500 \times 1000\)(约 \(1/2\) 比例),在严苛的 token 预算内兼顾全局上下文与局部高保真像素细节。
2. 自适应注视投影:基于球面切平面的免训练域自适应
直接在 ERP 裁剪图上执行分割会遭遇预训练基础模型的严重域漂移,因为 ERP 图像存在纬度相关的几何拉伸且左右边界两极断裂。受人类转头凝视机制启发,自适应注视模块将虚拟相机的光轴主点对准选定网格中心的经纬度坐标 \((\phi_c, \theta_c)\),并根据网格的空间尺寸自适应调整视场角(FoV),将该局部球面区域投影至切平面上获得标准透视图像 \(I_{persp}\)。该几何变换在连续的球面流形上执行,从根本上消除了纬度拉伸形变,将微小物体放大至标准透视分辨率,并让跨越左右边界断裂的连续物体在切平面投影中自然拼接还原,无需对下游基础模型做任何全景微调即可无缝复用其 2D 视觉先验。
3. 级联式可用性定位与逆映射:解耦语义推理与细粒度掩码分割
在生成的无畸变局部透视图像 \(I_{persp}\) 上,系统通过两阶段级联架构实现像素级分割。首先由开词表目标检测器(Rex-Omni)接收由 VLM 提取的具体目标名称 \(T_{obj}\),在无背景干扰的透视局部图中定位目标边界框 \(B\) 与关键点 \(P\)。相比直接使用复杂的长句任务指令在全景图中搜索,基于具体名词的局部检测彻底卸下了语义猜测的负担,极大降低了误检率。随后,边界框与关键点作为密集空间提示输入 SAM-2-Large,由其生成高质量的实例分割掩码 \(M_{persp}\)。最终,算法通过逆透视-球面变换矩阵,将透视局部掩码无缝反向重映射回原始 \(11904 \times 5952\) 分辨率的 ERP 全景空间中,合成全局掩码 \(M_{ERP}\)。
损失函数 / 训练策略¶
PAP 是完全免训练(training-free)的流水线框架。推理阶段主干 VLM 采用 Qwen3-VL-32B,开词表检测器采用 Rex-Omni,分割模型采用 SAM-2-Large。所有组件均以零样本(zero-shot)方式直接部署,不引入任何梯度更新或参数微调。
实验关键数据¶
主实验¶
PAP-12K 数据集包含 1,003 张 \(11904 \times 5952\) 分辨率的真实原生全景图像、6,103 个标注物体实例以及 13,493 个推理型问答对。实验采用四个互补指标:样本级平均 IoU(gIoU)、全数据集累计 IoU(cIoU)、阈值为 0.5 的精度(\(P_{50}\))以及在 0.5 到 0.95 区间步长 0.05 的平均精度(\(P_{50-95}\))。
| 方法 | gIoU (%) ↑ | cIoU (%) ↑ | \(P_{50}\) (%) ↑ | \(P_{50-95}\) (%) ↑ | 推理时间 |
|---|---|---|---|---|---|
| OV-Seg | 29.48 | 17.85 | 32.00 | 18.80 | \(\sim\)8s |
| LISA | 15.21 | 16.34 | 13.66 | 8.30 | \(\sim\)7s |
| VisionReasoner | 49.33 | 44.64 | 51.06 | 38.06 | \(\sim\)12s |
| AffordanceVLM | 9.66 | 13.11 | 8.96 | 5.41 | \(\sim\)7.8s |
| Affordance-R1 | 51.80 | 50.32 | 55.47 | 40.70 | \(\sim\)10.4s |
| A4-Agent (2nd) | 62.55 | 49.97 | 67.09 | 54.28 | \(\sim\)11.8s |
| PAP (本文) | 71.56 | 62.30 | 75.49 | 64.97 | \(\sim\)10s |
在难度分级测试中(Hard 子集定义为物体面积占全图比 \(>30\%\) 或 \(<0.1\%\)、或跨越图像左右两端边界截断的样本,占数据约 30%):
| 难度子集 | 方法 | gIoU (%) ↑ | cIoU (%) ↑ | \(P_{50}\) (%) ↑ | \(P_{50-95}\) (%) ↑ |
|---|---|---|---|---|---|
| PAP-12K-Hard | A4-Agent (2nd) | 42.75 | 36.42 | 46.48 | 30.38 |
| PAP (本文) | 60.35 | 52.59 | 63.82 | 52.17 | |
| 提升 (\(\Delta\)) | +17.60 | +16.17 | +17.34 | +21.79 | |
| PAP-12K-Normal | A4-Agent (2nd) | 70.91 | 54.94 | 75.79 | 64.36 |
| PAP (本文) | 76.40 | 65.20 | 80.52 | 70.49 | |
| 提升 (\(\Delta\)) | +5.49 | +10.26 | +4.73 | +6.13 |
消融实验¶
消融实验在随机采样的 10% PAP-12K 测试集上进行,分析提示风格、递归视觉路由以及自适应注视的作用。
提示风格消融(思维链 CoT 与视觉网格提示 VGP):
| 思维链 (CoT) | 视觉网格提示 (VGP) | gIoU (%) ↑ | cIoU (%) ↑ | \(P_{50}\) (%) ↑ | \(P_{50-95}\) (%) ↑ |
|---|---|---|---|---|---|
| ✗ | ✗ | 57.70 | 57.68 | 60.76 | 50.52 |
| ✗ | ✓ | 69.56 | 61.05 | 74.02 | 61.90 |
| ✓ | ✗ | 67.22 | 58.75 | 70.61 | 60.51 |
| ✓ | ✓ | 71.56 | 62.30 | 75.49 | 64.97 |
自适应注视 (AG) 与递归视觉路由 (RVR) 消融:
| 实验配置 | 评测范围 | gIoU (%) ↑ | cIoU (%) ↑ | \(P_{50}\) (%) ↑ | \(P_{50-95}\) (%) ↑ |
|---|---|---|---|---|---|
| 无自适应注视 (w/o AG) | 全集 | 64.99 | 55.43 | 68.43 | 56.37 |
| 完整模型 (w/ AG) | 全集 | 71.56 | 62.30 | 75.49 | 64.97 |
| 去掉 RVR (单步网格) | 全集 | 70.56 | 57.05 | 74.43 | 63.23 |
| 引入 RVR (递归路由) | 全集 | 72.69 | 63.85 | 76.29 | 66.13 |
| 去掉 RVR | Hard 子集 | 57.37 | 34.81 | 61.00 | 47.65 |
| 引入 RVR | Hard 子集 | 62.40 | 47.11 | 64.89 | 53.64 |
关键发现¶
- 自适应注视是跨越域鸿沟的核心:去除自适应注视模块、直接在 ERP 裁剪区域运行 OVD 和 SAM 会导致 gIoU 下降 6.57%、\(P_{50-95}\) 骤降 8.60%。这证实了透视基础模型在未校正的经纬拉伸曲面上存在剧烈的特征失配。
- 递归视觉路由对极难样本至关重要:在全部测试集上,RVR 带来 +6.80% 的 cIoU 提升;而在尺度极端、边界撕裂的 Hard 子集上,RVR 带来的 cIoU 增益高达 +12.30%(从 34.81% 跃升至 47.11%),充分证明粗到细的逐级缩放机制有效解决了全景广角下微小物体的遗漏问题。
- 视觉网格锚点优于纯文本描述:仅给 VLM 文本空间描述而不叠加图像网格(Row 1 与 Row 3)时,gIoU 分别下降 11.86% 和 4.34%,说明显式的视觉离散网格为 VLM 提供了直观的空间参照系,显著缓解了高分辨率下的空间幻觉。
亮点与洞察¶
- 仿生注视机制巧妙架起 2D 基础模型与全景视觉的桥梁:不依赖昂贵的全景数据标注或参数微调,通过几何投影将不规则 ERP 球面映射为平面透视切片,直接盘活了成熟的 2D 检测与分割大模型。
- 视觉网格提示将回归难题转化为离散选择:避开了让多模态大模型直接预测精确数值坐标的短板,用简单的 \(4 \times 3\) 编号网格引导模型分步定界,可扩展到其他全景目标定位任务。
- 首个原生 12K 全景可用性基准 PAP-12K:不同于以往合成或多视角拼接数据集,该基准使用专业 360 相机真实采集成百个室内场景,并设计了尺度多变与边界截断样本,极具应用评测价值。
局限与展望¶
- 计算依赖多模型串联调度:流水线串联了 Qwen3-VL-32B、Rex-Omni 与 SAM-2-Large,整体推理耗时约 10 秒。在对交互延迟要求极高的实时机械臂抓取任务中仍显过长。
- 局限于静态 2D/全景像素掩码预测:当前基准与方法聚焦于图像平面的可用性分割,尚未联合估计交互点的 3D 抓取位姿(6-DoF Grasp Pose)与深度信息,距离直接驱动机械臂执行仍需外挂位姿估计器。
- 未来方向:探索端到端原生轻量化全景可用性模型,以及结合全景深度图构建三维全景空间中的具身操作点估计。
相关工作与启发¶
- vs A4-Agent [49]: A4-Agent 在传统透视单目图像上提出了解耦推理与感知的智能体框架;而本文首次将可用性预测拓展至 \(360^\circ\) 全景视觉,针对 ERP 带来的几何畸变、边界割裂和极端尺度变化专门设计了网格递归路由与球面切平面注视机制,在全景难例上实现了大幅性能超越。
- vs Affordance-R1 [36] 与 RAGNet [38]: 这类方法侧重在透视图像上利用强化学习或微调多模态大模型进行可用性推理;但当面对 12K 全景输入时,其注意力稀释与坐标回归偏差严重,且完全无法应对 ERP 两极畸变。PAP 表明免训练的几何适配与视觉提示配合即可显著超越微调基线。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次提出全景可用性预测任务,开创性构建原生 12K 数据集并设计仿人眼注视的免训练方案。
- 实验充分度: ⭐⭐⭐⭐⭐ 全面覆盖主流基准对比、难度分级测试以及组件消融,指标详实严密。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑结构严谨,问题陈述与仿生机制阐述清晰流畅。
- 价值: ⭐⭐⭐⭐⭐ 为具身智能全景环境交互感知提供了全新的基准数据集与行之有效的范式。