OpenPanoD: Aligning Multimodal Prompts and Spherical Representations for Open-Vocabulary Panoramic Detection¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/hangxu-hdu/OpenPanoD
领域: 目标检测
关键词: 全景目标检测、开词表检测、多模态提示、球面几何表示、GeoFormer
一句话总结¶
针对全景开词表目标检测中纯文本提示的上下文语义歧义与等距柱状投影几何畸变双重瓶颈,OpenPanoD 提出融合文本描述与图像样例的多模态提示编码器,结合基于细分二十面体准均匀球面网格的 GeoFormer 图像编码器,实现了兼具泛化性与几何保真度的开词表 360 度目标检测。
研究背景与动机¶
全景图像目标检测(Panoramic Object Detection)赋予了机器人、无人驾驶与虚拟现实系统 360 度全方位无死角感知能力。然而,现有全景检测器普遍依赖预定义类别的闭集(Closed-set)监督范式,无法识别开放动态环境中的新颖目标。将开放词表检测(Open-Vocabulary Detection, OVD)拓展至全景场景的关键在于实现任意输入提示(Query)与图像特征的高精度跨模态对齐,但在全景数据中,这一对齐过程同时遭遇了语义端与视觉几何端的双重阻碍。
在提示查询侧,现存开词表检测主要依赖 CLIP 等视觉语言模型的纯文本提示。全景图像由于视场广阔、场景复杂且实体共现频繁,文本提示极易受到共现上下文的错误引导(例如包含人与篮球的区域常被文本提示高置信度误判为共现频率极高的篮球)。视觉提示虽能提供细粒度视觉特定性,但对抽象概念泛化能力弱且示例采集代价高,单纯依靠单模态提示无法在泛化与精准之间取得平衡。而在视觉特征侧,等距柱状投影(Equirectangular Projection, ERP)会使两极严重拉伸、边界割裂,基类目标尚可通过训练拟合畸变表象,未见的新类目标则完全缺乏畸变先验,导致无畸变的高层语义提示与严重几何扭曲的图像特征难以建立可靠关联。
为此,本研究打破了以往仅在平面图像上研究提示设计、或仅在闭集上设计球面卷积的割裂局面,将全景开词表检测重新形式化为抗语义歧义与抗几何畸变的联合对齐问题。核心 idea:在查询侧构建融合文本通用概念与视觉具体样例的多模态提示编码器,在图像侧通过基于细分二十面体准均匀球面网格的 GeoFormer 提取无投影畸变表征,由统一跨模态检测头联合对齐实现鲁棒的零样本全景目标检测。
方法详解¶
整体框架¶
OpenPanoD 接收全景输入图像与目标类别的多模态提示作为输入,输出对应的视场包围框(BFoV 或面向旋转的 RBFoV)。框架整体分为三阶段流水线:首先,在提示生成侧,离线构建类别文本描述与视觉样例库,经过两路独立投影 MLP 映射至统一的 256 维检测提示空间;其次,在图像特征侧,GeoFormer 将 ERP 图像特征重采样至准均匀正二十面体球面顶点,注入三维笛卡尔坐标位置编码并通过堆叠的球面注意力层聚合全景长程上下文;最后,跨模态解码器将类别均值提示扩展为实例查询并与球面图像特征交叉注意力交互,解耦预测边界框坐标并计算多模态最大相似度分类分数,配合有监督对比学习损失联合优化。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入全景图像与多模态输入"] --> B["多模态提示生成<br/>文本描述 + 视觉样例离线提取与MLP投影"]
A --> C["球面准均匀网格构建<br/>细分二十面体采样 + 3D位置编码"]
C --> D["GeoFormer球面注意力<br/>消除极点畸变与环绕不连续性"]
B --> E["统一检测头与跨模态解码<br/>实例查询采样 + 图像-提示交叉注意力交互"]
D --> E
E --> F["预测解耦与多任务损失<br/>BFoV/RBFoV回归 + 最大相似度分类 + 对比损失"]
关键设计¶
1. 多模态提示生成:融合语义泛化性与视觉具体特异性 纯文本提示在密集全景场景中极易受到背景与共现物体的上下文偏置干扰,而纯视觉提示又缺乏抽象概念的高层概括力。本文设计了文本与视觉互补的双模态提示库构建机制。在文本分支中,利用大语言模型(DeepSeek)针对目标类别生成 \(K_t=10\) 条涵盖简单类名与细致属性特征的描述短语,经冻结的 CLIP 文本编码器提取特征后取均值: $\(e_t = \frac{1}{K_t} \sum_{i=1}^{K_t} \text{CLIP}_{\text{text}}(\text{phrase}_i)\)$ 在视觉分支中,为杜绝全景测试集泄漏,严格从 ImageNet-21K 检索候选图像,利用 ImageNet-1K 分类器置信度或与文本提示的 CLIP 相似度精选出排名前 \(K_v=5\) 张最具代表性的高质量正例图像,经 CLIP 图像编码器平均得到视觉原型嵌入 \(e_v\)。随后,采用两组独立的双层 MLP 将两模态特征投影到 256 维任务特定空间,分别记为 \(p_c^t\) 与 \(p_c^v\)。该设计在保持离线提取效率的同时,让模型在解码阶段享受紧凑的类别先验,在分类时则可充分利用细粒度实例线索。
2. 球面准均匀网格构建与 GeoFormer:解耦 ERP 极地畸变与边界断裂 直接在 ERP 平面图像特征图上提取常规网格补丁会导致两极区域采样密度失衡、实体形变剧烈且横向 \(360^\circ\) 边界处产生特征割裂。为此,GeoFormer 采用二十面体递归细分(Subdivided Icosahedron)算法在三维单位球面上构建准均匀离散顶点集合。针对球面上每个三维坐标顶点 \(s_i = (x_i, y_i, z_i)\),通过反三角变换逆投影回经纬度坐标,再映射为 ERP 特征图上的连续浮点坐标 \((u_i, \nu_i)\): $\(\theta_i = \operatorname{atan2}(y_i, x_i), \quad \phi_i = \arcsin(z_i)\)$ $\(u_i = \frac{\theta_i + \pi}{2\pi} W, \quad \nu_i = \left(\frac{\phi_i + \pi/2}{\pi}\right) H\)$ 模型通过水平循环填充(Horizontal Circular Padding)的双线性插值从 ERP 特征图中抽取初始球面标记 \(x_i^0\),完美维系了全景左右边缘的跨界连续性。为进一步赋予网络严格的三维空间拓扑感知,将顶点的三维笛卡尔坐标 \([x_i, y_i, z_i]\) 经轻量 MLP 映射后与图像特征线性相加得到输入标记 \(x_i^{\text{in}}\),并在堆叠的多层球面自注意力模块中开展无变形失真的全景全局信息交互。
3. 统一检测头与混合提示策略:解耦实例预测与多模态最大相似度匹配 为使检测头既能利用提示的全局类别先验,又能精确区分同类下的不同实体,模型引入提示驱动的实例查询扩展机制。解码器采用类别均值提示 \(\bar{p}_c = \frac{1}{|\mathcal{P}_c|}\sum_{p\in\mathcal{P}_c} p\) 作为基础原型,并为每个类别叠加上 \(K\) 个可学习的实例偏移向量 \(o_k\): $\(\mathbf{P}_{c,k}^0 = \bar{\mathbf{p}}_c + \mathbf{o}_k, \quad c=1,\dots,N_c, \; k=1,\dots,K\)$ 所生成的查询向量进入 \(L\) 层 Transformer 解码器,交替执行与 GeoFormer 球面特征的多头交叉注意力(MHCA)以及查询之间的自注意力(MHSA)。在分类决策端,模型打破了以往仅对单一均值特征打分的局限,将最终检测嵌入 \(z_i\) 与类别提示集合 \(\mathcal{P}_c = \{p_c^t, p_c^v\}\) 内的所有具体模态原型分别计算余弦相似度并取最大值: $\(s_{i,c} = \max_{j: \text{label}(p_j)=c} \left[ \alpha \cdot \operatorname{sim}(\mathbf{z}_i, \mathbf{p}_j) + \beta \right]\)$ 其中 \(\alpha, \beta\) 为可学习的缩放与偏置标量。最大池化匹配使得预测无论与具象视觉特征高度吻合还是与抽象概念对齐均能激发高置信度。
损失函数 / 训练策略¶
模型仅在基类(Base categories)标注数据上端到端优化,CLIP 文本与视觉主干权重完全冻结。总体优化目标由三部分构成: $\(\mathcal{L} = \lambda_{\text{cls}} \mathcal{L}_{\text{cls}} + \lambda_{\text{ct}} \mathcal{L}_{\text{ct}} + \lambda_{\text{box}} \mathcal{L}_{\text{box}}\)$ 1. 分类损失 \(\mathcal{L}_{\text{cls}}\):基于多模态最大相似度匹配分数 \(s_{i,c}\) 构建的标准 Focal Loss,有效克服开放词表背景与前景类别不平衡。 2. 有监督对比学习损失 \(\mathcal{L}_{\text{ct}}\):为防止跨模态投影层坍缩并强化类别表征辨识度,显式拉近匹配实体嵌入 \(z_i\) 与其所属类别的所有正样本提示 \(\{p^+\}\),推远其他所有类别的负样本提示 \(\{p^-\}\)(温度系数 \(\tau=0.07\)): $\(\mathcal{L}_{\text{ct}} = \sum_{i \in \mathcal{M}} -\log \frac{\sum_{p^+\in\mathcal{P}_i} \exp(\operatorname{sim}(\mathbf{z}_i, \mathbf{p}^+)/\tau)}{\sum_{p^+\in\mathcal{P}_i} \exp(\operatorname{sim}(\mathbf{z}_i, \mathbf{p}^+)/\tau) + \sum_{p^-\in\mathcal{N}_i} \exp(\operatorname{sim}(\mathbf{z}_i, \mathbf{p}^-)/\tau)}\)$ 3. 边界框回归损失 \(\mathcal{L}_{\text{box}}\):结合平滑 L1 损失与适用于球面目标角度不确定性的高斯标签分布学习(GLDL)损失,自适应回归 BFoV/RBFoV 参数。
实验关键数据¶
主实验¶
实验在两大主流全景基准 360-Indoor(BFoV,37 类:30 基类/7 新类)和 PANDORA(RBFoV 旋转框,47 类:40 基类/7 新类)上开展。评价指标为在球面 Sphere-IoU=0.5 阈值下的基类 mAP、新类 mAP 及二者的调和平均(Harmonic Mean, HM)。所有对比方法均迁移适配为全景框回归并使用相同基类子集微调。
| 数据集 | 方法 | 提示类型 | 图像主干 | \(\text{mAP}_{\text{base}}\) | \(\text{mAP}_{\text{novel}}\) | HM |
|---|---|---|---|---|---|---|
| 360-Indoor | ViLD | Text Prompt | ResNet-50 | 17.4 | 13.8 | 15.4 |
| GroundingDINO | Text Prompt | ResNet-50 | 26.5 | 20.8 | 23.3 | |
| YOLO-World | Text Prompt | YOLOv8-M | 27.9 | 26.6 | 27.2 | |
| Prompt-DINO | Text Prompt | ViT-L | 28.3 | 26.8 | 27.5 | |
| DINOv | Visual Prompt | Swin-L | 22.3 | 20.7 | 21.5 | |
| T-Rex2 | Visual Prompt | Swin-L | 21.4 | 19.6 | 20.5 | |
| OpenPanoD (Ours) | Text Prompt | GeoFormer | 30.5 | 29.8 | 30.1 | |
| OpenPanoD (Ours) | Visual Prompt | GeoFormer | 25.9 | 25.5 | 25.7 | |
| OpenPanoD (Ours) | Multimodal Prompt | GeoFormer | 35.3 | 33.9 | 34.6 | |
| PANDORA | ViLD | Text Prompt | ResNet-50 | 14.5 | 11.1 | 12.6 |
| GroundingDINO | Text Prompt | ResNet-50 | 23.9 | 18.8 | 21.0 | |
| YOLO-World | Text Prompt | YOLOv8-M | 26.8 | 25.3 | 26.0 | |
| Prompt-DINO | Text Prompt | ViT-L | 27.1 | 25.5 | 26.3 | |
| DINOv | Visual Prompt | Swin-L | 20.8 | 18.9 | 19.8 | |
| OpenPanoD (Ours) | Text Prompt | GeoFormer | 29.6 | 28.7 | 29.1 | |
| OpenPanoD (Ours) | Visual Prompt | GeoFormer | 25.4 | 24.9 | 25.1 | |
| OpenPanoD (Ours) | Multimodal Prompt | GeoFormer | 34.4 | 31.3 | 32.8 |
消融实验¶
1. 核心模块与组件消融(在 PANDORA 数据集上的增量验证)
| 配置编号 | 文本提示 | 视觉提示 | 监督对比损失 \(\mathcal{L}_{\text{ct}}\) | 球面编码器 GeoFormer | \(\text{mAP}_{\text{base}}\) | \(\text{mAP}_{\text{novel}}\) | HM | 说明 |
|---|---|---|---|---|---|---|---|---|
| (1) | ✓ | 27.6 | 24.9 | 26.2 | 平面 ERP 编码器 + 单模态文本基线 | |||
| (2) | ✓ | ✓ | 29.7 | 26.1 | 27.8 | 引入视觉原型补充外观细节 (+1.2% novel) | ||
| (3) | ✓ | ✓ | ✓ | 31.5 | 29.6 | 30.5 | 引入对比学习强化特征区分度 (+3.5% novel) | |
| (4) | ✓ | ✓ | ✓ | ✓ | 34.4 | 31.3 | 32.8 | 完整模型:引入 GeoFormer 矫正几何畸变 (+1.7% novel) |
2. 图像编码器架构对比消融
| 图像编码器结构 | 空间几何处理方式 | \(\text{mAP}_{\text{base}}\) | \(\text{mAP}_{\text{novel}}\) |
|---|---|---|---|
| 标准 ViT | 平面 ERP 规则网格采样 | 31.5 | 29.6 |
| SphereUFormer | 球面 U 型局部注意力机制 | 33.1 | 30.2 |
| GeoFormer (本文) | 细分二十面体准均匀网格 + 全局球面注意力 | 34.4 | 31.3 |
关键发现¶
- 多模态提示互补性显著:对比实验表明,纯文本提示容易受环境语境偏置影响(如 360-Indoor 上文本版 29.8% novel),纯视觉提示受限于单样本覆盖度(25.5% novel),两者结合后激增至 33.9% novel(+4.1 个百分点),证实了自然语言泛化力与图像原型特异性结合的必要性。
- 几何畸变是未见类识别的关键屏障:在消融中将平面 ViT 替换为 GeoFormer 后,新类检测率从 29.6% 提升至 31.3%。相比基类,新类提升幅度尤其依赖几何真实性,因为基类可通过海量数据记忆扭曲形状,而零样本新类完全缺乏畸变投影先验,依赖未扭曲的高保真表征与语义对齐。
- 提示数量的饱和与敏感性特征:提示数量实验显示,文本提示在 \(K_t=10\) 时取得最佳效果,进一步增加至 20 性能轻微回落;视觉提示在 \(K_v=5\) 时达到峰值(360-Indoor 25.5%,PANDORA 23.3%),若引入过多视觉样本反而会掺入检索噪声或语义偏离样本,降低表征纯度。
亮点与洞察¶
- 提示端与几何端联合对齐的全局设计视角:该论文敏锐抓住全景开词表检测的核心症结不是单纯引入 CLIP,而是解决全景大视野下的“文本上下文偏置”与“两极投影几何扭曲”,通过多模态融合与球面正二十面体几何建模实现闭环。
- 严谨的无泄露视觉库检索与最大相似度分类:采用 ImageNet-21K 检索并通过分类器打分/CLIP 相似度两级筛选构建原型库,且完全避开全景测试集;分类时采用 max-similarity 聚合保留细粒度线索,结构设计工整且具备良好的即插即用泛化价值。
- 球面变换与水平循环填充的有机整合:GeoFormer 将球面三维顶点映射回 ERP 时巧妙结合了 Horizontal Circular Padding,用极简算子彻底消除了全景左右拼接接缝处的特征突变与注意力断裂。
局限与展望¶
- 计算复杂度随网格细分层级提升:GeoFormer 采用全局球面自注意力机制,当二十面体细分频次提高以捕捉超小目标时,标记数量急剧增加带来较高的显存与计算开销,未来可探索球面线性注意力或自适应可变形稀疏网格。
- 依赖现成 ImageNet 库的视觉原型覆盖盲区:视觉提示构建依赖 ImageNet-21K 的名词匹配,对于极端罕见名词、专业工商业构件或复合概念短语,无法有效检索到精准的孤立物体白底样例。
- 下游全景任务拓展潜力:当前架构验证了 BFoV 与 RBFoV 检测,未来可进一步拓展至 360 度全景 3D 边界框预测(3D Oriented BBox)、全景全景分割(Panoptic Segmentation)以及视频时空目标追踪。
相关工作与启发¶
- vs GroundingDINO / Prompt-DINO: 后者是平面图像开词表检测的代表作,依赖平面特征提取与纯文本或简单图像引导。OpenPanoD 针对 360 度 ERP 特有的两极极度畸变设计了 GeoFormer 准均匀球面编码,并在解码头显式融合语言泛化与图像特异性,在新类上领先 Prompt-DINO 超过 5.8~7.1 个百分点。
- vs SphereUFormer / SphereNet: 现有球面专用网络多针对常规闭集任务设计,侧重局部卷积或局部窗口注意力,缺乏与大语言模型/CLIP 跨模态潜空间的对齐机制。OpenPanoD 首次将球面几何表示与多模态开放词表提示深度结合,填补了全景零样本感知的空白。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次系统性提出全景开放词表目标检测框架,将多模态提示对齐与准均匀球面表征结合。
- 实验充分度: ⭐⭐⭐⭐⭐ 覆盖两大权威全景基准(水平/旋转框),与 9 种代表性 SOTA 模型全面对比,消融实验设计清晰完整。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑结构严谨,图表清晰,问题剖析深入直击全景几何与多模态对齐的本质痛点。
- 价值: ⭐⭐⭐⭐⭐ 为具身智能、扫地机器人及全景安防提供了强健的零样本全方位感知基石。