PRISM-VO: Scale-Aware Visual Odometry Using Photometric Plenoptic Bundle Adjustment¶
会议: ECCV 2026
论文: ECCV 原文
项目主页: https://prism-vo.github.io/
领域: 3D视觉
关键词: 全光相机 / 光场视觉里程计 / 光度平差 / 绝对尺度估计 / 聚焦全光相机
一句话总结¶
针对聚焦全光相机的成像物理特性,PRISM-VO 构建了端到端光度全光光束法平差(Bundle Adjustment)框架,将单帧微透镜视差提供的度量尺度深度先验与滑动窗口多视角时间光度一致性联合优化,无需外部传感器即可实现高精度、抗漂移的尺度可感知视觉里程计。
研究背景与动机¶
在机器人自主导航、自动驾驶以及虚拟与增强现实系统中,实时六自由度位姿估计与稠密或稀疏三维重建是环境感知的核心基石。传统单目相机凭借小巧紧凑、成本低廉以及高分辨率的特点得到了广泛部署,但其固有的投影几何缺陷导致单目视觉里程计(如 ORB-SLAM、DSO、DPVO)存在未知的尺度不确定性与严重的尺度漂移,无法直接输出真实物理世界的绝对公制度量。虽然双目立体相机、RGB-D 传感器和飞行时间(ToF)相机能够在一定程度上补齐尺度信息,但它们往往受到物理基线长度、红外主动光有效测距范围、室外强光干扰或传感器体积功耗的严苛限制,在狭小空间或微型机器人平台上难以灵活适配。
聚焦全光相机(Focused Plenoptic Camera 2.0)在主镜头与感光芯片之间引入微透镜阵列(Micro-Lens Array, MLA),能够在单次曝光中同时记录光线入射的位置与角度信息,形成由成千上万个微图像组成的密集光场观测。这种特殊光学构造使得单目体积大小的传感器不仅具备极深的景深,还能利用微透镜之间的微小基线形成多视差观测,在单帧内直接解算度量深度。然而,现有全光视觉里程计(如 SPO)多停留在仅依靠连续两帧微图像做半稠密直接对齐的初级阶段,缺乏跨多帧的时间多视角几何约束与联合平差优化,在面对快速运动、光照扰动或复杂纹理时极易产生累积漂移;而传统基于针孔模型的直接法多视角平差又完全违背了全光相机的非单中心透视成像几何。
解决这一难题的核心矛盾在于:如何在统一的非线性优化框架内,既精确建模全光相机复杂的非线性光线投射几何,又充分兼顾单帧微透镜视差的瞬时尺度度量与跨帧大基线的时间多视角光度约束,实现二者在不确定性层面的最优融合。核心 idea:显式建模聚焦全光相机的虚拟图像投影几何,将单帧微图像提取的高斯逆虚深度先验及其方差与多帧滑动窗口光度残差联合构建非线性最小二乘能量函数,通过曲率自适应跨模态加权实现高精度、抗漂移的尺度可感知光度平差优化。
方法详解¶
整体框架¶
PRISM-VO 的系统架构由基于全光相机模型的前端直接跟踪与后端全光滑动窗口光束法平差协同构成。系统输入为聚焦全光相机采集的原始光场图像(Raw Plenoptic Image),首先经过预处理管线生成完全对焦图像(Totally Focused Image)、虚深度图(Virtual Depth Map)以及对应的虚深度不确定度图(Virtual Depth Uncertainty Map)。前端直接利用多尺度完全对焦图像金字塔与参考关键帧执行从粗到细的直接光度对齐,估计当前帧位姿初值;后端维护包含数个关键帧的滑动窗口,提取高梯度且低不确定度的候选点,将时序多视角光度残差与单帧全光逆虚深度残差联合构建为非线性最小二乘优化问题,利用 Schur 补进行边缘化与高斯-牛顿状态迭代求解。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["原始全光图像输入<br/>Raw Plenoptic Image"] --> B["多尺度全光图像与深度金字塔<br/>方差加权下采样与不确定度传递"]
B --> C["自适应逆深度截断与点选择<br/>梯度多样性与逆深度方差加权"]
C --> D["前端粗到细直接光度跟踪<br/>完全对焦图像多视角对齐初值"]
D --> E["光度全光滑动窗口平差<br/>光度残差与全光逆虚深度联合建模"]
E --> F["曲率自适应跨模态残差加权<br/>高斯-牛顿曲率匹配与对数时间平滑"]
F --> G["尺度可感知度量轨迹与稀疏点云<br/>Schur补边缘化历史关键帧"]
关键设计¶
1. 多尺度全光图像与不确定度金字塔:保真微透镜视差高斯分布
为了克服传统直接法在单尺度图像上收敛半径有限的问题,系统必须构建多尺度金字塔。但与普通针孔图像不同,全光相机的虚深度 \(v = B/b\)(其中 \(B\) 为微透镜到传感器的距离,\(b\) 为微透镜到主镜头虚像平面的距离)具有特殊的统计性质:其逆虚深度 \(\rho_v = 1/v\) 正比于微透镜之间的亚像素视差,在测量误差下服从高斯分布。为了在降采样过程中不破坏这一度量先验,系统对完全对焦图像采用标准 \(2 \times 2\) 像素块平均,而对逆虚深度图则采用方差倒数加权平均,在粗尺度层上赋予高置信度测量更大的权重:
与之对应,粗尺度逆虚深度的方差 \(\bar{\sigma}_{\rho_{v,i}}^2\) 则通过对邻域有效子像素求调和平均传递:\(\bar{\sigma}_{\rho_{v,i}}^2 = |\mathcal{N}_x^{(i)}| / \sum_{k \in \mathcal{N}_x^{(i)}} (\sigma_{\rho_{v,k}}^2)^{-1}\)。这种设计不仅精确滤除了无效或极高噪声的深度像素,而且保证了金字塔各层级在优化时均具备严密的方差统计基础。
2. 自适应逆深度截断与定向梯度点选择:聚焦高信噪比近景
由于微透镜基线极短,全光相机对远距离物体的视差敏感度随距离平方迅速衰减,远景深度估计的不确定度显著上升。若无差别地采样全图边缘,不可靠的远距离深度先验将恶化位姿尺度。为此,PRISM-VO 引入基于场景整体逆深度分布的自适应百分位数截断机制。系统根据当前帧所有有效像素的平均逆虚深度 \(\rho_{v,\text{av}}\) 计算归一化截断因子 \(w_{\text{cut}} = (\rho_{v,\text{av}} - \rho_{v,\text{f}}) / (\rho_{v,\text{n}} - \rho_{v,\text{f}})\),并在预设的置信百分位上下界 \([p_{\min}, p_{\max}]\) 之间动态计算有效深度截断阈值:
在特征点候选采样时,系统结合完全对焦图像的图像梯度幅值 \(\nabla I(\mathbf{x}_V)\) 与随机抽样的单位方向向量 \(\mathbf{d}\) 计算投影梯度得分,以鼓励边缘方向的多样性;同时引入深度加权因子 \(w_d(\mathbf{x}_V)\)。对于具有有效低方差深度的点赋予极高权重,而对缺乏可靠深度的点赋予较小权重但保留采样机会,从而在保证大尺度视觉追踪覆盖面的同时,将度量尺度锚定在近景可靠几何结构上。
3. 光度全光平差与投影显式建模:多视角大基线与微透镜视差联合解算
系统将待优化状态向量定义为滑动窗口内关键帧的六自由度位姿 \(\boldsymbol{\xi} \in \mathfrak{se}(3)\)、仿射光度参数 \(a, b\) 以及各采样点的相机坐标系逆深度 \(\rho_C\)。设宿主帧 \(i\) 中的虚图像点为 \(\mathbf{x}_{V,i}\),利用全光投影模型 \(\Pi_{\text{pl}}\) 及其逆投影 \(\Pi_{\text{pl}}^{-1}\),将其变换到目标帧 \(j\) 的虚图像坐标 \(\mathbf{x}_{V,j}\):
系统不仅计算补偿了相机曝光时间与光照仿射变化的光度残差 \(r^{\text{photo}}\),还显式引入逆虚深度几何残差 \(r^{\text{depth}} = \rho_v - \rho_v^{\text{meas}}\)。由于全光逆虚深度测量误差严格服从正态分布,其二次能量项天然适合直接加权优化,单个深度残差的权重直接设为其方差倒数 \(w_l^{\text{depth}} = (\sigma_{\rho_{v,l}}^2)^{-1}\)。极其精妙的是,\(r^{\text{depth}}\) 仅依赖于目标点自身的逆深度参数 \(\rho_C\),对位姿增量 \(\boldsymbol{\xi}\) 和光度参数的雅可比严格为零,这使得加入几何深度先验后完全没有破坏高斯-牛顿 Hessian 矩阵的原有稀疏块箭头结构(Block-Arrowhead Structure),保持了 Schur 补边际化与消元的高计算效率。
4. 曲率自适应跨模态残差加权:动态平衡光度一致性与几何测距
光度残差与深度几何残差分属不同物理维度,其残差幅值与优化梯度量级在不同场景结构下差异悬殊:当相机贴近物体时,微透镜视差极其显著、几何约束主导;当相机面对空旷开阔场景时,微透镜视差趋近于零、尺度难以直接测准,此时时间大基线的光度连续性占据绝对主导。PRISM-VO 设计了基于高斯-牛顿曲率匹配的自适应平衡因子 \(\eta\)。系统在每次迭代中通过计算光度项与深度项相对于逆深度参数的雅可比曲率比值来实时估算瞬时权重 \(\bar{\eta}\):
为了防止数值抖动引起轨迹震荡,系统在对数域中通过一阶指数低通滤波进行时序平滑:\(\eta_{k+1} = \exp\left( (1-\alpha) \ln \eta_k + \alpha \ln \bar{\eta} \right)\)。该机制使得优化器能够在无需人工微调超参数的前提下,自主感知几何与纹理信息源的信噪比迁移,实现平稳的轨迹估计。
损失函数 / 训练策略¶
系统采用纯几何与光度优化框架,无需离线深度网络训练。滑动窗口内联合最小化的总能量函数包含鲁棒加权的光度残差项与自适应加权的全光深度残差项:
其中 \(\|\cdot\|_\gamma\) 表示 Huber 鲁棒核函数,用于削弱动态遮挡与局部非朗伯反射引起的离群值干扰;\(w_k^{\text{photo}}\) 包含局部图像梯度加权;\(w_l^{\text{depth}} = (\sigma_{\rho_{v,l}}^2)^{-1}\) 为基于视差方差的高斯不确定度权重。在优化求解阶段,采用阻尼 Levenberg-Marquardt 算法更新状态增量 \((\mathbf{H} + \mu \mathbf{I}) \delta \mathbf{s} = -\mathbf{b}\)。滑窗滑动时,利用 Schur 补将移出视窗的关键帧及其观测点进行边缘化,将历史几何约束凝聚为高斯先验代入后续优化。
实验关键数据¶
主实验¶
PRISM-VO 在由 Zeller 等人采集的同步双目与全光视觉里程计公开数据集(Raytrix R5 全光相机,包含 11 个百米级大闭环室内外序列)以及 LiFMCR 室内高精度多视角全光数据集(两台高分辨率 Raytrix R32 全光相机,配备毫米级 Vicon 动捕系统真值)上进行了全方位评测。
在双目与全光闭环漂移评测中,针对轨迹首尾通过 \(\mathrm{Sim}(3)\) 对齐计算整条轨迹的累积绝对尺度误差 \(d'_s = \max\{d_s, d_s^{-1}\}\)、尺度漂移率 \(e'_s = \max\{e_s, e_s^{-1}\}\)、轨迹整体对齐误差 \(e_{\text{align}}\) 以及旋转误差 \(e_r\)。下表给出了 PRISM-VO 与当前最先进全光直接里程计 SPO 在 11 个长序列上达到高/中/粗三种精度阈值的序列占比统计:
| 评估指标与精度阈值 | PRISM-VO (本文) | SPO (基线全光VO) | 相对优势说明 |
|---|---|---|---|
| 绝对尺度误差 \(d'_s \le (1.05 / 1.10 / 1.30)\) | 5 / 8 / 10 | 5 / 7 / 9 | 绝大部分序列绝对尺度误差受控在 10% 以内 |
| 尺度漂移率 \(e'_s \le (1.05 / 1.10 / 1.30)\) | 7 / 7 / 10 | 7 / 8 / 9 | 高精度段保持一致,鲁棒性更强(覆盖 10 条) |
| 整体轨迹对齐误差 \(e_{\text{align}} \le (1\% / 2\% / 4\%)\) | 4 / 6 / 10 | 2 / 6 / 9 | 高精度序列数翻倍(4 条 vs 2 条),显著降低畸变 |
| 累计旋转误差 \(e_r \le (1^\circ / 2^\circ / 4^\circ)\) | 6 / 8 / 10 | 3 / 7 / 8 | 旋转漂移大幅收敛,\(e_r \le 1^\circ\) 占比提升 100% |
在 LiFMCR 数据集 7 个极具挑战性的室内近景物体环绕序列中,PRISM-VO 与最先进的单目直接法 DSO、特征点法 ORB-SLAM3 以及深度学习光流追踪里程计 DPVO 进行了绝对轨迹均方根误差(RMSE)对比(平移误差 \(\text{RMSE}_t\) 单位为 mm,旋转误差 \(\text{RMSE}_r\) 单位为 \(^\circ\)):
| 场景序号与名称 | PRISM-VO (本文) \(\text{RMSE}_t\) / \(\text{RMSE}_r\) | DSO \(\text{RMSE}_t\) / \(\text{RMSE}_r\) | ORB-SLAM3 (mono) \(\text{RMSE}_t\) / \(\text{RMSE}_r\) | DPVO \(\text{RMSE}_t\) / \(\text{RMSE}_r\) |
|---|---|---|---|---|
| 01 Plants | 41.66 / 2.98 | 59.32 / 48.56 | 271.24 / 98.79 | 607.44 / 3.62 |
| 02 Bike | 57.81 / 6.09 | 112.56 / 21.24 | 316.78 / 25.66 | 356.60 / 2.60 |
| 03 Lab | 38.34 / 2.86 | 326.70 / 1.97 | 123.20 / 10.71 | 169.23 / 2.04 |
| 04 Electronics | 10.53 / 2.83 | 150.89 / 87.20 | 261.02 / 45.97 | 268.47 / 3.01 |
| 05 Desk | 9.32 / 2.89 | 239.16 / 9.15 | 121.64 / 56.93 | 219.66 / 2.92 |
| 06 Tools | 12.21 / 3.31 | 543.90 / 164.22 | 773.65 / 153.28 | 704.67 / 163.09 |
| 07 Machinery | 110.87 / 11.86 | 253.36 / 162.17 | 225.55 / 21.12 | 5.87 / 1.99 |
消融实验¶
论文通过递进式组件消融实验,在全光闭环数据集上检验了各核心模块对累积误差抑制的作用:
| 模型配置变体 | 核心改动说明 | 绝对尺度观测性 | 尺度漂移与轨迹一致性表现 |
|---|---|---|---|
| (1) 针孔基线 (Pinhole Baseline) | 采用中心透视投影模型,完全忽略全光成像几何与微透镜视差 | 无法获得物理绝对尺度 | 累积漂移显著,\(e_{\text{align}}\) 曲线缓慢爬升 |
| (2) 全光深度初始化 + 投影建模 | 引入全光相机投影模型 \(\Pi_{\text{pl}}\) 与单帧深度初始化,但无深度残差平差 | 获得可用的绝对度量尺度 | 尺度漂移显著收缩,平差中仍受时序光度误差累积影响 |
| (3) 完整 PRISM-VO 系统 | 联合逆虚深度残差、方差倒数先验加权以及动态曲率平衡因子 \(\eta\) | 精确物理尺度且高度稳定 | 尺度一致性与对齐误差全面最优,10/11 序列高精度收敛 |
关键发现¶
- 光度时序大基线与微透镜小视差的互补性:单帧全光成像的微透镜基线极短,测距有效范围通常受限在几米以内,但其尺度绝对可靠;而多帧时间连续位移提供了米级的大基线,能精准约束远景旋转与平移方向。二者结合彻底打破了单目尺度漂移与双目体积限制的固有权衡。
- 方差加权与曲率自适应是联合优化的稳定器:消融实验表明,如果不使用基于视差方差的加权与基于 Hessian 矩阵曲率的动态加权因子 \(\eta\),深度残差在开阔远景处会因极端噪声破坏多视角光度对齐,或者在近景处被密集像素光度梯度压制。曲率自适应加权使得系统在不同场景中具备类似生物视觉的注意力切换能力。
- 近距离复杂光学场景下的极端鲁棒性:在电风扇护网格栅、半透明叶片、高反光金属等极端工况下,由于视差重叠与非朗伯效应,ORB-SLAM3 与 DSO 均发生严重跟踪丢失;而 Intel RealSense D455 结构光深度相机则出现大面积空洞与深度飞点。PRISM-VO 利用微透镜多视角光线汇聚特性与完全对焦图像,成功实现了毫米级的高稳定轨迹追踪。
亮点与洞察¶
- 将光度平差拓展至非标准单中心光学系统:传统 DSO 类算法高度绑定于单中心针孔或鱼眼模型,PRISM-VO 首次在滑窗直接平差中完整推导了全光虚拟像平面的正逆投影微分雅可比,为计算成像与机器人定位的交叉提供了可复用的数学范式。
- 不破坏 Hessian 稀疏性的几何先验融入技巧:逆虚深度残差只与路标点自身的深度参数相关,而与相机位姿及光度仿射变量严格解耦。这一巧妙特性使得引入度量几何先验并未增加任何额外的非零非对角块,完全保留了舒尔补消元的计算优势。
- 跨模态残差自适应曲率配平策略:直接法中光度误差(灰度差)与几何误差(逆深度差)由于量纲与信噪比异构,极难人工调参。基于高斯-牛顿曲率商的动态跟踪与对数平滑机制,提供了一种通用且优雅的异构多传感器目标平衡思路。
局限与展望¶
- 硬件视场角受限与光学分辨率折中:受微透镜阵列光线分割物理限制,在相同感光靶面上,全光相机的等效空间分辨率与视场角(FoV)显著低于普通单目相机,在开阔室外高速场景中提取的有效边缘密度较低。
- 远距离绝对尺度衰减:当场景深度超过全光相机超焦距极限时,微透镜间的亚像素视差降至噪声水平以下,此时系统退化为仅依靠时序光度约束的弱尺度感知状态,长距离绝对尺度保持仍需依赖闭环检测或惯导(IMU)融合。
- 未来改进方向:引入轻量级学习型光场特征匹配增强大位移前端跟踪能力;结合紧耦合视觉-惯性导航(VIO)架构,利用 IMU 高频动力学先验进一步拓展动态大范围场景下的适用边界。
相关工作与启发¶
- vs SPO (Semi-dense Plenoptic Odometry): SPO 仅在前后相邻帧之间利用微图像进行直接光流对齐,缺乏多帧滑窗平差与边缘化先验;PRISM-VO 构建了完整的多帧光度平差后端与曲率自适应不确定度加权,将累积旋转误差与轨迹对齐畸变降低了数倍,并在 SPO 跟踪失败的序列上实现了稳定运行。
- vs DSO (Direct Sparse Odometry): DSO 依赖单目针孔投影,只能在射影重构空间中求解任意尺度的相对运动;PRISM-VO 将 DSO 的光度能量公式与聚焦全光相机投影几何深度融合,引入具有物理尺度的逆虚深度残差,在无需外部标定物或惯导的前提下赋予了直接法度量尺度感知能力。
- vs DPVO / DROID-SLAM: 基于深度学习的光流/深度 SLAM 虽然利用海量数据先验提升了跨视角鲁棒性,但在未微调的新型光学系统或微透镜图像上泛化受阻且无法直接解算度量尺度;PRISM-VO 坚持基于纯物理光度与几何优化,计算透明、可解释性强且具备先天的物理度量尺度。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次提出面向聚焦全光相机的稀疏光度滑动窗口平差框架,设计了严密的不确定度传递与曲率自适应跨模态平衡。
- 实验充分度: ⭐⭐⭐⭐⭐ 在包含百米级室外回路与毫米级动捕真值的两个标准全光公开数据集上完成详实对比与递进消融。
- 写作质量: ⭐⭐⭐⭐⭐ 几何推导严谨自洽,系统框架层级清晰,实验图表与动机分析极具说服力。
- 价值: ⭐⭐⭐⭐⭐ 为紧凑型微型机器人、内窥医疗内镜等严苛空间受限场景下的尺度可感知单目化 SLAM 提供了极具前景的技术路线。