跳转至

PixVOD: Pixel-Distributed Direct Visual Odometry and Depth Estimation

会议: ECCV 2026
论文: ECCV 2026
项目页: https://www.shinjeongkim.com/pixvod/
领域: 3D视觉
关键词: 视觉里程计 / 像素处理器阵列 / 高斯置信度传播 / 深度估计 / 直接法跟踪

一句话总结

针对近传感器计算范式(Pixel Processor Array),提出首个基于高斯置信度传播(GBP)与局部关键帧锚定的完全像素级分布式直接法视觉里程计与深度估计框架 PixVOD,仅通过局部邻域通信即可实现全局 6DoF 相机运动共识与度量尺度深度恢复。

研究背景与动机

在机器人导航与可穿戴边缘计算等高帧率、低延迟、严苛功耗约束的场景中,传统机器视觉架构普遍遵循“传感器采集图像—通过高速总线传输全部原始像素—由中央处理器(CPU/GPU)集中式解算”的范式。这种分离架构在面对每秒数百乃至数千帧的视觉流时,面临高带宽传输能耗巨大、总线拥塞和延迟累积的结构性瓶颈。焦平面传感器处理器(Focal-Plane Sensor-Processor)与像素处理器阵列(Pixel Processor Array, PPA,如 SCAMP 芯片系列)通过在每个感光像素内集成可编程处理单元与局部寄存器,允许在感光单元局部就地计算,为打破算力与能耗墙提供了根本途径。

然而,如何将全局几何估计任务下沉至像素阵列是一项极具挑战性的命题。此前的 PPA 视觉里程计与 SLAM 探索仅在像素端执行特征提取与轻量匹配,随后仍必须将特征数据传出至片外中央处理器求解 6DoF 位姿优化;而近期针对在片几何估计的研究(如 PixRO 和 BP-SF)要么仅局限于纯旋转跟踪,要么依赖深度传感器输入。在单目纯视觉设定下,相机全局 6DoF 运动是一个全图共享的全局变量,而场景深度又与位姿紧密耦合且尺度未定。在每个像素仅具备极小局部内存与直接邻近通信能力的物理约束下,如何建立全局运动共识并稳定估计度量几何,构成了分布式视觉里程计的核心矛盾。

本文由此提出,稠密直接法几何估计比稀疏特征法更适合映射至像素处理器阵列,因为真实场景的连续性先验天然契合局域网格约束。核心 idea:将单目 6DoF 相机位姿与稠密深度联合估计建模为全图像素级高斯因子图,通过分片层级恒等因子传递运动共识、结合法向量积分因子约束局域几何,并在高帧率视觉流中引入局部关键帧锚定机制调节有效基线,借助高斯置信度传播(GBP)实现纯像素端就地收敛。

方法详解

整体框架

PixVOD 面向像素处理器阵列架构设计,全流程无需集中式全局内存访问。算法输入为连续高帧率单目图像与片上轻量卷积网络预测的逐帧表面法向量图,输出为全局一致的 6DoF 相机位姿变换与当前关键帧的稠密对数深度图。系统在每个像素节点上维护一个复合流形变量,并构建包含光度误差因子、先验因子、相机运动恒等因子以及法向量积分几何因子的分布式因子图,利用高斯置信度传播交替进行因子线性化、局部消息传递与信念更新。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入:连续图像帧对 (Is, It) 与表面法向量"] --> B["复合流形变量初始化<br/>逐像素存储局部位姿 SE(3) 与对数深度 R"]
    B --> C["局部光度因子构建<br/>像素级局部 Warp 采样与残差计算"]
    C --> D["分片层级恒等因子传播<br/>四叉树局部消息传递实现全局 6DoF 共识"]
    D --> E["法向量积分因子约束<br/>水平与垂直相邻像素表面法向几何对齐"]
    E --> F["局部关键帧锚定策略<br/>跨多目标帧固定参考基线与迭代 GBP 求解"]
    F --> G["输出:全局一致 6DoF 位姿与稠密深度图"]

关键设计

1. 复合流形变量与局部光度因子:像素级解耦的直接法跟踪

传统直接法视觉里程计依赖全局图像访问构建非线性最小二乘目标 \(\arg\min_\mu \sum_{p} \rho(\| I_s[p] - I_t[\mathcal{W}(p; \mu)] \|)\),但在像素阵列中无法集中存储整幅图像。PixVOD 在每个像素 \(p_i\) 本地分配一个状态变量 \(v_i = \mu_i \in \langle SE(3), \mathbb{R} \rangle\),其中前 6 个自由度 \(\mu_{i,[0:6]} \in SE(3)\) 表示该像素持有的全局相机运动估计,第 7 个标量分量 \(\mu_{i,[6]} \in \mathbb{R}\) 代表该像素的局部对数深度(实际深度为 \(\exp(\mu_{i,[6]})\))。将直接法光度能量分解为完全局部的单像素因子: $\(E_D^i(\mu_i) = \frac{1}{2} \rho \left( \left\| I_s[p_i] - I_t[\mathcal{W}(p_i; \mu_i)] \right\|_{\Lambda_D}^2 \right)\)$ 其中 \(\mathcal{W}(p_i; \mu_i) = \pi(K \exp(\mu_{i,[0:6]}) K^{-1} \pi^{-1}(p_i, \exp(\mu_{i,[6]})))\) 为几何投影映射。各像素仅需通过局部路由机制读取目标帧在扭曲位置的插值强度,从而消除了全局图像缓冲区的依赖。

2. 分片层级恒等因子:四叉树结构加速全局 6DoF 位姿共识

若仅依赖光度因子,低纹理或退化区域的像素将陷入局部极值,导致各像素的位姿估计严重发散。为在分布式架构中强制所有像素对单一刚体运动达成共识,系统在像素间引入正则化“恒等”因子: $\(E_R^{i,j}(\mu_{i,[0:6]}, \mu_{j,[0:6]}) = \frac{1}{2} \left\| \mu_{i,[0:6]} \boxminus \mu_{j,[0:6]} \right\|_{\Lambda_R}^2\)$ 虽然最简单的拓扑是仅在网格直接邻近像素间连接,但在纯局部网格上传递信息收敛缓慢。PixVOD 借鉴 PixRO 的分片层级(Sharded Quadtree)拓扑结构,构建多层虚拟聚合节点。随着树层级的上升,高层节点聚合更大范围的视野信息,其信息矩阵精度加倍(即噪声协方差 \(\sigma_R, \sigma_P\) 逐层减半),驱动全局共识在极少数邻近跳数(Hop)内快速扩散,兼顾了芯片布线局限性与收敛速度。

3. 法向量积分几何因子:光度驱动的稠密深度估计

单目纯光度估计在弱纹理区域极易退化,无法恢复连续几何。相比于全局上下文依赖极强的深度预测,表面法向量作为局部差分量可由轻量 CNN 在片上高效预测。PixVOD 引入双边法向量积分(BINI)的稀疏几何因子,约束相邻像素沿水平与垂直轴的对数深度差与局部法向斜率相一致: $\(E_{N_x}^{i, j}(\mu_{i,[6]}, \mu_{j,[6]}) = \frac{1}{2} \left\| (\mu_{j,[6]} - \mu_{i,[6]}) + \frac{n_x}{\tilde{n}_z} \right\|_{\Lambda_N}^2, \quad E_{N_y}^{i, j}(\mu_{i,[6]}, \mu_{j,[6]}) = \frac{1}{2} \left\| (\mu_{j,[6]} - \mu_{i,[6]}) + \frac{n_y}{\tilde{n}_z} \right\|_{\Lambda_N}^2\)$ 其中 \(\tilde{n}_z\) 为图像平面归一化法向量分量。光度因子与法向因子共同作用:法向积分保证平滑表面的几何连续性,而跨帧光度对应则在深度不连续边缘提供拉扯力并锚定绝对尺度,弥补了纯法向积分在深度断裂处尺度漂移的缺陷。

4. 局部关键帧锚定策略:调控有效基线与解决退化

PPA 片上处理可达到数百至上千 FPS,使相邻连续帧位移微小。然而,若直接在极微小位移的相邻帧间逐帧运行 6DoF 里程计并简单累积位姿,系统会陷入严重的几何退化——旋转与平移在极短基线下高度耦合,致使尺度与平移方向不可观测。PixVOD 提出局部关键帧跟踪策略:固定一个参考关键帧 \(I_s\) 并提取其几何法向先验,在后续多个连续目标帧 \(I_t\)(如 100~300 帧)到达时,所有像素变量始终相对于参考关键帧优化位姿。该策略主动维持了充沛的有效三角化视差,大幅拓宽了优化收敛域,同时变量状态在进入新帧时热启动继承,确保了极速收敛。

损失函数 / 训练策略

系统采用非线性高斯置信度传播(GBP)求解复合流形上的联合后验极大化。对于流形变量 \(v = \bar{\mu} \diamondplus \tau\),其中局部切空间微扰 \(\tau \in \langle \mathfrak{se}(3), \mathbb{R} \rangle\),残差通过一阶泰勒展开与右雅可比近似:\(r(\bar{\mu} \diamondplus \tau) \approx \bar{r} + \bar{J}\tau\)。

鲁棒核函数选用 Huber 损失,阈值设为 \(t_{\text{huber}} = 400\)。叶子节点超参数配置为:光度因子协方差 \(\sigma_D = 5 \times 10^{-3}\),位姿先验协方差 \(\sigma_P = 1.0\),恒等因子协方差 \(\sigma_R = 4 \times 10^{-4}\),法向因子协方差 \(\sigma_N = 10^{-3}\)。高层分片节点按层将 \(\sigma_P, \sigma_R\) 减半。算法采用 JAX 在 GPU 上进行完全向量化的并行仿真,每目标帧同步迭代 100 轮交替消息传递与信念更新,最终各像素位姿取均值作为整机位姿输出。

实验关键数据

主实验

评估在 Replica 数据集(office_0, office_1, office_2, office_3)上开展,图像分辨率为 \(128 \times 128\),通过 ScLERP 将轨迹插值 10 倍以模拟真实 PPA 高帧率输入。对比集中式基线(Gauss-Newton + IRLS 联合优化)与不同帧率更新策略下的相对位姿跟踪误差(平移误差 \(\|t_{\text{est}} - t_{\text{gt}}\|_2 / \|t_{\text{gt}}\|_2\) 与旋转测地误差):

优化架构 / 帧率配置 通信范式 内存访问机制 收敛迭代次数 (Per Frame) 相对平移误差 (Median) 相对旋转误差 (Median)
Centralized (IRLS + GN) 集中式全图通信 全局共享内存访问 ~1,500 - 2,500 0.06 - 0.08 0.04 - 0.06
PixVOD (Framerate 10) 纯像素局部通信 分布式像素私有内存 100 (累积 ~4,500) 0.14 - 0.18 0.10 - 0.15
PixVOD (Framerate 5) 纯像素局部通信 分布式像素私有内存 200 0.16 - 0.20 0.12 - 0.17
PixVOD (Framerate 0.2) 纯像素局部通信 分布式像素私有内存 5,000 0.85 - 1.15 0.75 - 1.05

注:集中式方法虽然收敛速度与极限精度更高,但依赖昂贵的片外总线与集中式内存;PixVOD 在 Framerate 10 与 5 表现稳健,而在 Framerate 0.2 因跨步过大超出直接法收敛域而发散。

消融实验

消融实验重点验证了光度引导对法向量积分深度精度的提升,以及在不同结构几何先验下的位姿跟踪鲁棒性:

实验组别 结构先验类型 / 几何配置 平移基线范围 (m) / 测试条件 绝对深度误差 / 相对位姿误差 (Median) 性能表现说明
深度重建对比 纯法向积分 (BINI) [10] Baseline: 0.015 - 0.285 m Depth Abs Error: ~0.26 - 0.38 m 缺乏光度边界约束,存在严重尺度漂移
深度重建对比 PixVOD (BINI初始化 + 光度引导) Baseline: 0.075 - 0.165 m Depth Abs Error: ~0.06 - 0.12 m 深度误差降低 60% 以上,准确拉开边缘断裂
几何先验消融 Ground-Truth Depth GT Geodesic: 0.02 - 0.38 Relative Pose Error: ~0.08 - 0.12 理论最优上限
几何先验消融 Ground-Truth Normal GT Geodesic: 0.02 - 0.38 Relative Pose Error: ~0.15 - 0.24 全流程基准配置,全域稳定收敛
几何先验消融 DSINE 预测法向量 [4] GT Geodesic: 0.02 - 0.20 Relative Pose Error: ~0.18 - 0.28 真实模型预测,精度接近真值先验

关键发现

  • 光度对法向积分的增益显著:仅使用 BINI 法向积分时,重建深度在跨物体的深度不连续处无法正确定标尺度;PixVOD 借助双帧光度对应拉开深度断裂两端,将绝对深度误差从 0.30m 压制至 0.08m 左右。
  • 高帧率与基线长度存在最优权衡:帧率过低(如 0.2)单帧位移过大,直接法落入局部极值;帧率过高且逐帧微分跟踪时,视差退化引发平移与旋转解耦失败。局部关键帧机制巧妙维持了 0.05~0.15m 的适中基线,处于误差敏感度的最优凹陷区。
  • 对实用法向预测具有高度容忍度:使用轻量预测模型 DSINE 估计的表面法向量替代真值法向,位姿跟踪误差仅轻微上升约 15%~20%,证明系统在未来装载紧凑型在片神经网络时具备实用可行性。

亮点与洞察

  • 算法与硬件协同的计算范式迁移:打破传统 VO 必须依赖中心化 CPU/GPU 的既定认知,证明通过高斯置信度传播,各像素仅凭借直接相邻网格交换局部高斯信息,即可协同达成全局刚体位姿共识。
  • 法向与光度的互补闭环:法向量预测具有天然的局部性、适合片上轻量 CNN 提取,而光度匹配提供了全局一致的投影几何;二者结合既规避了单目稠密深度的病态性,又克服了法向积分的尺度漂移。
  • 关键帧锚定破解直接法退化:在高帧率芯片上摒弃朴素的帧间微分迭代,转而通过时间窗口上的局部关键帧锚定控制有效视差,为基于事件相机或极高帧率 PPA 的视觉里程计设计提供了普适经验。

局限与展望

  • 硬件仍为 GPU 仿真阶段:当前在 NVIDIA RTX 4090 上采用 JAX 进行并行仿真验证,真实 PPA 芯片(如 SCAMP)目前仅支持定点或微小模拟内存,完整浮点 Lie 代数运算与高斯协方差反转需要下一代 PPA 芯片硬件支持。
  • 恒等因子连接拓扑的布线代价:分片四叉树连接能有效加速收敛,但相比纯二维网格增加了片上布线复杂度。后续需探索纯网格局部通信下更高效的加速技巧。
  • 未来向非刚体场景流拓展:若在运动因子中逐渐放宽各像素位姿严格相等的约束,该框架可自然退化并推广至像素级非刚体 3D 场景流与动态物体位姿估计。

相关工作与启发

  • vs SCAMP-VO / Bit-VO [8, 32]: 早期 PPA 里程计仅在焦平面完成 FAST 角点与二进制描述符提取,几何优化必须传出至外部 CPU;PixVOD 实现了首个全流程在片直接法位姿与稠密深度联合估计。
  • vs PixRO [2]: PixRO 首次展示了基于 GBP 的像素级旋转跟踪(3DoF),但未涉及平移与深度;PixVOD 将流形状态拓展至 \(\langle SE(3), \mathbb{R} \rangle\),解决了 6DoF 运动与度量深度的强耦合难题。
  • vs BINI [10]: BINI 是离线集中式的双边法向量积分方法;PixVOD 发掘了其优化的空间稀疏性并映射至分布式因子图,融入光度约束实现了实时的尺度恢复与联合优化。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ [首次实现全像素分布式 6DoF 视觉里程计与深度估计,为下一代焦平面感算一体芯片提供了前瞻算法理论]
  • 实验充分度: ⭐⭐⭐⭐☆ [详尽对比集中式基线、深入消融基线距离与法向先验,若能在真实物理芯片样机上流片部署则更完备]
  • 写作质量: ⭐⭐⭐⭐⭐ [数学推导严密规范,流形表示与因子图拓扑结构表达清晰直观]
  • 价值: ⭐⭐⭐⭐⭐ [引领感算一体(On-Sensor Computing)在复杂 3D 几何感知方向的重要突破]