跳转至

OmniPoint: Universal Monocular Metric Pointcloud from Any Camera

会议: ECCV 2026
论文: ECCV 原文
项目主页: https://omnipoint.github.io/
领域: 3D视觉
关键词: 单目度量点云估计、任意相机模型、射线距离解耦、双向几何数据增强、自适应几何先验注入

一句话总结

OmniPoint 提出了首个统一任意相机模型(针孔、鱼眼、360° 全景)的单目度量点云重建框架,通过射线方向与径向距离解耦表征、解耦点云学习目标、双向 3D 数据增强以及平滑几何先验注入机制,实现了对全景/大视场与常规透视图像的 SOTA 零样本度量几何重建。

研究背景与动机

从单张图像恢复度量级 3D 几何结构是计算机视觉的核心基石之一。随着大规模 3D 数据集和基础视觉大模型(如 DINOv2)的飞速发展,现代单目深度估计方法已经展现出强大的泛化能力。然而,现有几何重建体系严重割裂,不同成像传感器被固化在相互孤立的特定网络中:绝大多数方法严格依赖透视针孔相机假设,使用平面深度 \(z\) 或其倒数作为回归目标;少数工作针对全景相机或鱼眼相机设计专用展开与反投影模型,却完全无法互通;面对真实机器人或自动驾驶平台搭载的异构环视传感器套件时,工程上不得不部署多套孤立模型,带来高昂的计算冗余与传感器融合障碍。

导致这种割裂的核心矛盾在于投影模型的刚性绑定与无针孔真实 3D 数据的极端稀缺。常规平面深度在视场角接近 180° 时数值发散到无穷大,且在相机后方(\(z < 0\))完全无定义,天然无法表征全景;如果转为让网络端到端直接预测 3D 坐标 \((x, y, z)\),又强行将不同镜头的非线性投影畸变与场景本身的物理结构距离混杂在同一个隐空间中,引发严重的优化冲突;此外,LiDAR 稀疏点云或相机内参等辅助几何先验在接入网络时往往引发严重的特征分布漂移。

本文的切入角度是:将相机的光学投影几何与场景本身的物理空间跨度完全解耦,让光线吸收镜头畸变,让距离承载纯粹的物体结构。核心 idea:将单目度量点云重建统一表征为像素级射线方向与径向距离的乘积 \(P = d \cdot r\),配合真值射线引导的解耦点云损失、透视与全景双向 3D 空间数据增强,以及带有状态嵌入与高斯平滑的几何先验注入机制,构建全相机通用的单目度量点云大模型。

方法详解

整体框架

OmniPoint 接收任意相机捕获的单张 RGB 图像 \(\mathbf{I}\) 以及可选的几何先验(相机内参 \(K\)、稀疏深度点云 \(\mathbf{S}\)),端到端输出稠密的度量 3D 点云图 \(\hat{\mathbf{P}}\) 与无效天空掩码。模型将每个像素的 3D 坐标分解为单位射线方向 \(\hat{\mathbf{r}}\)、径向结构距离 \(\hat{d}\) 以及全局度量尺度因子 \(s\)。整个系统基于 DINOv2-ViT 骨干网络配合 DPT 预测头构建,输入端通过可学习状态嵌入与高斯平滑消除先验切换时的特征漂移,输出端通过解耦目标函数引导网络分别掌握任意光线几何与不变场景距离。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入图像与可选先验<br/>RGB 图像 + (内参 K / 稀疏深度 S)"] --> B["自适应几何先验注入<br/>状态嵌入指示 + 矢量化高斯平滑稠密化"]
    B --> C["双向 3D 数据增强<br/>透视向任意合成 + 任意向透视自监督闭环"]
    C --> D["射线与距离解耦表征<br/>单位方向向量 r + 标量径向物理距离 d"]
    D --> E["解耦点云学习目标<br/>GT 射线约束结构距离 + 独立射线角方向回归"]
    E --> F["输出稠密度量点云<br/>P = s * d * r 及天空无效区域掩码"]

关键设计

1. 自适应几何先验注入:消除多模式输入的特征分布漂移并稳健稠密化稀疏测量 当模型在纯 RGB、RGB+内参、RGB+稀疏深度或多先验组合之间自由切换时,输入通道与特征统计量的瞬态变化会严重破坏 ViT 骨干特征的稳定性。为此,OmniPoint 引入了可学习的输入状态嵌入(\(e_{\text{intrinsic}}\) 与 \(e_{\text{depth}}\)),根据对应先验的存在与否动态自适应切换指示向量并注入 Token 序列,直接从根源上消解网络对先验模式的认知歧义。针对 LiDAR 或 SfM 提供的非规则、带有离群噪声的稀疏深度 \(\mathbf{S}\),直接输入离散点会导致梯度剧烈震荡。该设计先对有效深度按均值进行全局归一化,消除绝对尺度敏感性,继而采用全矢量化高斯溅射(Gaussian Splatting)对稀疏点向外半径 \(r\) 范围内进行自适应加权平滑: $\(w(\Delta u, \Delta v) = \exp\left(-\frac{\Delta u^2 + \Delta v^2}{2\sigma^2}\right)\)$ 其中核宽 \(\sigma\) 随深度绝对值成正比缩放以保持相对平滑度,所有像素贡献通过 scatter-add 并行聚合生成空间连续的平滑深度图 \(\mathbf{D}_{\text{smooth}}\),与有效性二值掩码拼接后经轻量卷积送入骨干,使模型兼具单目几何预测与极高精度深度补全/稠密化能力。

2. 双向 3D 数据增强:在真实空间打通透视真值与无标注全景域的监督鸿沟 针对鱼眼和 360° 全景领域高质量 3D 真值极度匮乏的根本瓶颈,单纯在 2D 像素空间做平移旋转无法模拟复杂透镜畸变。OmniPoint 在 3D 几何空间构建了双向互补的数据流水线。正向的“透视到任意(Perspective-to-Any)”将丰富的室内外大规模针孔数据集反投影为稠密点云,构建虚拟鱼眼和等距柱状全景相机模型重新投影,配合遮挡剔除掩码生成高保真合成真值对;反向的“任意到透视(Any-to-Perspective)”则从互联网采集的海量无标注全景图像中采样透视视锥切片,利用强大的针孔预训练模型生成伪深度标签,重新投影拼接回全景坐标系实施自监督微调。值得注意的是,训练时每次仅采样单个切片以避免跨 patch 深度不一致引发冲突,二者协同彻底激活了网络对非针孔畸变的感知力。

3. 射线与距离解耦表征:将镜头畸变几何与场景物体物理距离剥离 传统将深度参数化为垂直于图像平面的标量 \(z\) 在视角达 180° 时趋于无穷大且无法描述相机后方点;而直接预测全局 Cartesian 坐标 \((x, y, z)\) 则强行迫使模型在隐空间记忆并混杂不同镜头的非线性投影映射 \(F: (u, v) \mapsto (x, y, z)\),造成优化瘫痪。OmniPoint 将每个像素的 3D 点参数化为单位射线方向 \(\mathbf{r} \in \mathbb{R}^3\) 和沿该方向的径向标量距离 \(d \in \mathbb{R}^+\): $\(\mathbf{P}_i = d_i \cdot \mathbf{r}_i\)$ 所有与相机传感器硬件相关的光学畸变、内参视场均被单位射线 \(\mathbf{r}\) 完全吸收,而标量径向距离 \(d\) 转化为纯粹的相机无关场景几何结构。无论输入来自超广角镜头还是窄视场针孔,相同的物体表面在相同位置具有完全一致的径向距离预测规律,消除了跨相机几何学习的结构性冲突。

4. 解耦点云学习目标:阻断光线方向与结构距离之间的梯度交叉污染 如果采用朴素的端到端点云 L1 损失 \(\sum_i \|\hat{d}_i \hat{\mathbf{r}}_i - d_i \mathbf{r}_i\|_1\),一旦网络预测出略有偏离的射线方向 \(\hat{\mathbf{r}}_i\),即便径向距离 \(\hat{d}_i\) 已经完全准确,合成的 3D 点依然会产生巨大欧氏偏差,导致反向传播时对本已准确的距离分支施加惩罚,特别是在鱼眼边缘等大畸变区域会造成致命的梯度扰动。OmniPoint 提出了真值射线对齐的解耦损失: $\(\mathcal{L}_{\text{ray}} = \sum_i \|\hat{\mathbf{r}}_i - \mathbf{r}_i\|_1, \quad \mathcal{L}_{\text{point}} = \sum_i \|s^* \cdot \hat{d}_i \cdot \mathbf{r}_i - d_i \cdot \mathbf{r}_i\|_1\)$ 其中 \(s^*\) 是通过 ROE 在线尺度对齐算出的最优点云缩放因子。在 \(\mathcal{L}_{\text{point}}\) 中,预测的标量距离沿真值射线 \(\mathbf{r}_i\) 投射生成代理 3D 点,使得距离误差与射线误差严格隔离,彻底消除了相互牵制,显著提升了重建点云的高频锐度与空间一致性。

损失函数 / 训练策略

除 \(\mathcal{L}_{\text{ray}}\) 与 \(\mathcal{L}_{\text{point}}\) 外,模型还结合了度量对齐损失 \(\mathcal{L}_{\text{metric}} = \|\log(\hat{s}) - \text{stopgrad}(\log(s^*))\|_1\) 以从大尺度数据中恢复绝对全局度量尺度,并引入表面法向量平滑一致性损失 \(\mathcal{L}_{\text{normal}}\) 与局部结构损失 \(\mathcal{L}_{\text{local}}\) 保持几何细节。训练分为三阶段进行:(1) 在 72 张 A100 GPU 上基于大规模透视数据集以批大小 576 预训练 10k 步;(2) 结合真实与双向合成的鱼眼/全景数据微调 5k 步;(3) 冻结骨干网络,使用 SegFormer 伪标签通过 \(\mathcal{L}_{\text{mask}}\) 专训天空掩码头,避免无穷远区域干扰重建。

实验关键数据

主实验

在跨越窄视场(8 个透视数据集:NYUv2、KITTI、ETH3D、iBims-1、GSO、Sintel、DIODE、HAMMER)、大视场鱼眼(KITTI360)以及 360° 全景图像(Stanford2D3D-S、PanoSUNCG)的零样本几何评估中,OmniPoint 展现出全面的领先优势。

方法 针孔/窄视场 (S.FoV)
Depth Rel↓ / \(\delta_1\)↑
针孔/窄视场 (S.FoV)
Point Rel↓ / \(\delta_1\)↑
鱼眼/大视场 (L.FoV)
Depth Rel↓ / \(\delta_1\)↑
鱼眼/大视场 (L.FoV)
Point Rel↓ / \(\delta_1\)↑
360° 全景图像
Depth Rel↓ / \(\delta_1\)↑
360° 全景图像
Point Rel↓ / \(\delta_1\)↑
Depth Anything V2 6.35 / 95.0 — / — — / — — / — — / — — / —
Metric3D V2 6.06 / 95.3 — / — — / — — / — — / — — / —
UniDepth V2 4.23 / 96.6 6.06 / 95.1 7.81 / 93.0 18.4 / 79.6 19.3 / 69.5 102.8 / 2.89
Depth Pro 5.28 / 95.6 7.49 / 93.3 26.6 / 54.6 36.2 / 35.5 — / — — / —
MoGe V2 3.98 / 96.8 5.59 / 95.5 12.0 / 85.0 23.4 / 60.9 25.1 / 56.1 102.8 / 2.85
UniK3D 4.14 / 96.7 5.61 / 95.5 8.77 / 92.7 11.5 / 90.6 10.4 / 90.0 11.4 / 89.4
DA2 (全景专用) — / — — / — — / — — / — 6.65 / 94.7 7.30 / 94.0
OmniPoint (本文) 4.04 / 96.8 5.55 / 95.6 6.37 / 94.0 6.66 / 93.8 5.79 / 95.1 5.90 / 95.1

在六个基准数据集的零样本度量深度(Metric Depth \(\delta_1\) ↑)评估中,OmniPoint 同样超越了专有模型,并且在添加先验后实现了飞跃:

配置 / 方法 NYUv2 KITTI ETH3D iBims-1 DIODE HAMMER 平均指标 (Mean)
ZoeDepth 91.9 85.4 33.7 67.2 29.3 3.23 51.8
Depth Pro 91.9 38.3 32.8 81.5 37.7 63.0 57.5
UniDepth V2 92.8 95.4 69.5 93.2 51.8 46.8 74.4
MoGe V2 96.1 62.9 90.8 83.0 66.4 65.6 77.5
UniK3D 94.4 93.6 83.7 92.8 73.0 58.3 82.6
OmniPoint (无条件) 86.2 88.0 91.8 87.7 73.3 73.8 83.5
OmniPoint (+ 内参 K) 88.3 90.7 93.0 88.3 75.2 74.5 85.0
OmniPoint (+ 稀疏深度 D) 98.5 98.4 94.1 99.0 98.4 99.3 98.0

消融实验

针对关键设计组件的消融验证证明了每一项机制的不可或缺性:

实验研究维度 消融配置 评测场景 / 指标 数值结果 机制分析说明
表征方式消融 Ray + D (本文) 鱼眼 Point Rel↓ / 全景 Depth Rel↓ 6.37 / 5.79 射线与距离解耦,避免网络混杂镜头畸变
表征方式消融 直接回归 XYZ 坐标 鱼眼 Point Rel↓ / 全景 Depth Rel↓ 6.74 / 6.28 跨相机投影模型引发优化冲突,边缘失真明显
监督损失解耦 P + GT Ray (本文) 点云 Rel↓ / \(\delta_1\)↑ 5.55 / 95.6 隔离射线误差,保证距离梯度不受方向干扰
监督损失解耦 朴素点云 L1 (P) 点云 Rel↓ / \(\delta_1\)↑ 5.65 / 95.2 射线误差反向污染准确距离,引发局部扭曲
监督损失解耦 完全独立回归 (D + Ray) 点云 Rel↓ / \(\delta_1\)↑ 7.88 / 93.5 缺乏 3D 几何约束,点云整体结构发生塌陷
数据增强消融 P2A + A2P (完整双向) 360° 全景 Depth Rel↓ / \(\delta_1\)↑ 5.79 / 95.1 兼备高精度合成几何与真实无标注场景多样性
数据增强消融 仅 P2A (透视到全景) 360° 全景 Depth Rel↓ / \(\delta_1\)↑ 6.21 / 94.5 带来最大幅度性能跃升,弥补全景真值缺失
数据增强消融 仅 A2P (全景自监督) 360° 全景 Depth Rel↓ / \(\delta_1\)↑ 8.21 / 90.9 单一伪标签存在漂移,需配对合成数据作锚点
数据增强消融 无双向数据增强基线 360° 全景 Depth Rel↓ / \(\delta_1\)↑ 8.45 / 89.8 严重过拟合于极端匮乏的非针孔监督样本
条件先验注入 完整先验注入机制 稀疏引导 Depth Rel↓ / \(\delta_1\)↑ 3.21 / 98.2 状态嵌入与矢量高斯平滑协同消除分布扰动
条件先验注入 移除高斯平滑 (w/o Smooth) 稀疏引导 Depth Rel↓ / \(\delta_1\)↑ 3.80 / 97.5 离散非规则输入造成梯度剧烈震荡
条件先验注入 移除状态嵌入 (w/o State) 稀疏引导 Depth Rel↓ / \(\delta_1\)↑ 3.38 / 97.7 缺失模式指示导致 ViT 骨干特征产生歧义

关键发现

  • 大视场与全景跨域性能发生质变:常规针孔 SOTA 模型(如 MoGe V2、UniDepth V2)在 360° 全景的点云评估中完全崩溃(Point Rel 超过 100,\(\delta_1\) 仅不到 3%),而 OmniPoint 依靠解耦表征在全景图像上取得了 5.79 的 Depth Rel 和 5.90 的 Point Rel,甚至击败了全景专用大模型 DA2(6.65 Rel)。
  • 几何先验注入展现出无缝的补全能力:当注入稀疏深度时,模型平均度量准确率从 83.5% 跃升至 98.0%,同时加入内参时相对点云误差进一步压低至 3.59 Rel,证明了多源几何条件与单目主干之间的协同增强效应。

亮点与洞察

  • 射线-距离显式因式分解的普适性:将相机几何投影与场景欧氏距离通过物理向量严格正交分解,取代了以往基于球谐函数(Spherical Harmonics)平滑导致的高频畸变边缘模糊,使单个模型无需任何架构分支改动即可自适应全种类镜头。
  • 真值射线代偿的解耦损失设计:通过在点损失中采用真值射线作为骨架(\(s^* \cdot \hat{d}_i \cdot \mathbf{r}_i\)),在数学上切断了误差反向传播中的链式耦合,这种机制对于多目标或复合物理参数预测任务具有极高的借鉴价值。
  • 状态指示嵌入消除条件退化:利用二进制切换的 Learnable State Embedding,让单一主干在不损失单目泛化能力的前提下平稳扩展为高质量深度稠密化模型,避免了条件分支带来的微调灾难性遗忘。

局限与展望

  • 极端动态与半透明场景的反射假影:全景图像中镜面反射以及大范围高动态光照可能导致射线方向出现局域折射偏移,目前模型尚未显式建模非朗伯体表面的光学物理过程。
  • 稀疏先验分布不均时的边缘过渡:虽然高斯平滑解决了离散点局部震荡,但在极端稀疏或单侧集中采样的边界过渡区域,平滑半径与实际物体几何断裂处的自适应匹配仍有提升空间。
  • 未来方向:可进一步将该相机通用的射线-距离解耦表征推广至时间序列单目视频重建与 4D 动态场景几何感知中。

相关工作与启发

  • vs UniK3D: UniK3D 尝试利用球谐函数建模光线场以统一相机,但受制于非针孔数据的缺乏以及球谐函数固有的过平滑缺陷,在鱼眼与全景边缘大变形区域出现严重几何扭曲;OmniPoint 采用显式单位射线向量并配合双向 3D 增强,全景误差降低近 50%。
  • vs MoGe V2 / Depth Pro: 优秀的针孔度量深度与点云模型,但由于根本绑定在平面深度或前向截锥空间内,在面对鱼眼与 360° 图像时几何预测彻底崩溃;OmniPoint 在保持针孔顶尖精度的同时补全了全视场盲区。
  • vs PromptDA / PriorDA: 现有的条件提示深度模型仅支持针孔相机且仅能在带提示模式下运作;OmniPoint 不仅支持任意相机,且在无先验与带先验模式间做到了零退化的自由切换。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次提出真正统一任意相机类型与动态先验的解耦点云范式,双向几何增强设计极具洞察力。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 29 个训练集及 11 个跨视场基准,对比覆盖度量深度、相对几何、消融实验与先验稠密化。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,图文定义清晰,理论推导与工程设计完全闭环。
  • 价值: ⭐⭐⭐⭐⭐ 为通用机器人与具身智能在异构传感器下的空间几何感知提供了统一可靠的基础模型。