跳转至

Gravity-aware partially calibrated absolute pose estimation from affine- or rotation-covariant features

会议: ECCV 2026
论文: ECCV 2026 论文
领域: 3D 视觉
关键词: 绝对位姿估计, 相机标定, 重力先验, 仿射对应, 极小求解器

一句话总结

针对未知焦距相机的绝对位姿估计(PnPf),本文结合 IMU 重力先验与局部特征的几何属性(仿射或旋转协变),推导全新多项式几何约束并构建出单仿射对应求解器 UP1PfAC 与双旋转协变特征求解器 UP2PfORI,将最小样本需求骤降至 1 或 2 个特征,在保持解析求解高效性的同时大幅提升 RANSAC 鲁棒定位速度与焦距恢复精度。

研究背景与动机

在扩展现实(XR)、自主无人机以及多用户协作混合现实等前沿应用中,设备需要在预先构建的三维场景地图中实现快速且精确的绝对全局定位。传统的视觉定位管线核心是透视 n 点(Perspective-n-Point, PnP)问题,但在诸如消费级智能手机和可穿戴头显等开放场景下,查询图像的焦距通常未知或随着自动对焦发生动态变化,因此必须同时求解相机位姿与焦距(即半标定或部分标定绝对位姿估计,PnPf)。经典的点特征 PnPf 问题自由度为 7,至少需要 3.5 到 4 个 2D-3D 点对应;而在高外点率的真实复杂环境中,假设生成所需的 RANSAC 采样迭代次数随最小样本数指数级暴增,极大地制约了定位系统的实时性与功耗表现。

与此同时,现代智能移动设备普遍内置了高精度的惯性测量单元(IMU),能够以极低延迟可靠地提供重力矢量,从而消除相机的俯仰角(pitch)和横滚角(roll),将相机的未知旋转自由度收敛为绕重力轴单自由度的偏航角(yaw)。以往的重力对齐绝对位姿求解器(如 UP2P、UP1SIFT)大多强假设相机内参完全已知,而少数支持未知焦距的重力对齐求解器(如 UP2.5Pf)依然仅使用纯点坐标,忽略了局部特征描述子(如 SIFT、ORB 或深度特征 AffNet、S3Esti)中内在蕴含的局部几何变换信息(尺度、旋转与仿射协变)。如何将 IMU 重力先验与局部特征几何无缝融合以估计未知焦距,在几何视觉领域仍是一片空白。

将仿射特征引入未知焦距的绝对位姿求解,核心难点在于未知焦距会使局部仿射映射与投影方程出现高阶非线性耦合与单项式膨胀,导致传统代数消元法难以推导出紧凑、低秩且数值稳定的闭式解析解。本文的切入角度是利用重力对齐解耦旋转自由度,将相机绝对位姿与焦距参数化引入局部仿射和方向协变约束中,证明所得线性方程组具有独特的零空间结构。核心 idea:利用 IMU 重力先验固定两个旋转自由度,并将未知焦距引入局部仿射与旋转协变几何关系中,推导关于偏航角半角切和焦距的多项式约束,构建仅需 1 个仿射对应(UP1PfAC)或 2 个旋转协变特征(UP2PfORI)的四次方程解析求解器,并在闭式解分支中复用多余约束实现无冗余假设筛选。

方法详解

整体框架

本文提出的位姿与焦距联合估计流程从查询图像与 3D 点云匹配出发。输入为带有未知焦距 \(f\) 的查询图像、由 IMU 测得的重力方向、以及参考图像中的 2D 特征与对应 3D 地图点坐标及其表面法向量。求解管线根据特征提取器的类型分别走入两套紧凑极小求解器分支:若特征具备完整仿射局部几何(如 SIFT/AffNet),调用 UP1PfAC 求解器;若仅具备旋转方向协变性(如 ORB/SuperPoint+方向估计),则调用 UP2PfORI 求解器。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入:查询图像 + IMU 重力先验 + 3D-2D 对应"] --> B["重力对齐与未知参数化<br/>固定俯仰/横滚,偏航角设为 r=tan(θ/2),焦距归一化"]
    B --> C{"特征几何类型分支"}
    C -->|单仿射对应| D["UP1PfAC:5×4 矩阵零空间约束消元<br/>行列式因子分解获得关于 r 的四次多项式"]
    C -->|双旋转协变特征| E["UP2PfORI:平移消元与方向协变耦合<br/>构建 2×2 多项式系统并解析消元求解 r"]
    D --> F["回代求解焦距 f 与三维平移 t"]
    E --> F
    F --> G["多余几何残差验证:单解筛选<br/>消除代数伪解,仅向 RANSAC 输出唯一最优假设"]
    G --> H["输出:高精位姿 (R, t) 与内参 f"]

在整体框架中,系统首先利用 IMU 重力矢量构建旋转矩阵 \(R_{xz}\),将相机的全局旋转解耦为已知对齐分量与绕垂直轴的未知单参数旋转 \(R_y(\theta)\),并采用半角正切参数化 \(r = \tan(\theta/2)\) 消除三角函数。随后建立参数化矩阵方程组,通过巧妙的零空间条件消除平移向量,构造关于 \(r\) 的四次多项式并求得解析闭式解,最后利用未参与求解的剩余约束方程进行残差校验,直接挑选出唯一的物理真解送入 GC-RANSAC 框架。

关键设计

1. 重力对齐下的焦距-仿射耦合约束推导:消除高阶耦合与单项式膨胀

在世界坐标系下,查询相机与参考相机之间的局部仿射变换矩阵 \(A\) 依赖于相对旋转 \(R\)、平移 \(t\)、3D 表面法向量 \(n_{\text{ref}}\) 及场景深度 \(d\)。当查询相机焦距 \(f\) 未知时,图像归一化坐标由 \(p_{\text{query}}\) 变为 \(p_{\text{query}}/f\),仿射特征矩阵发生尺度缩放 \(A \mapsto (f_{\text{ref}}/f) A\)。若直接联立投影方程与仿射微分,方程将包含 \(r\)\(f\) 与平移分量的高次非线性项。作者将仿射矩阵四个元素展开,发现仿射方程与投影方程对查询相机平移向量 \(t_{\text{query}}\) 保持天然的线性依存关系。通过对仿射行展开方程和点投影方程两边同乘以消元因子 \(m f\)(其中 \(m\) 包含深度与投影分量),构造出统一的齐次线性方程系统:

\[\begin{bmatrix} a_1 / f \\ a_2 / f \\ a_3 / f \\ a_4 / f \end{bmatrix} = \frac{d}{m} \begin{bmatrix} (b r_{11} - p'_{\text{ref}, 1} n_{\text{ref}, 1}) - \frac{p_{\text{query}, 1}}{f} (b r_{31} - p'_{\text{ref}, 3} n_{\text{ref}, 1}) \\ (b r_{12} - p'_{\text{ref}, 1} n_{\text{ref}, 2}) - \frac{p_{\text{query}, 1}}{f} (b r_{32} - p'_{\text{ref}, 3} n_{\text{ref}, 2}) \\ (b r_{21} - p'_{\text{ref}, 2} n_{\text{ref}, 1}) - \frac{p_{\text{query}, 2}}{f} (b r_{31} - p'_{\text{ref}, 3} n_{\text{ref}, 1}) \\ (b r_{22} - p'_{\text{ref}, 2} n_{\text{ref}, 2}) - \frac{p_{\text{query}, 2}}{f} (b r_{32} - p'_{\text{ref}, 3} n_{\text{ref}, 2}) \end{bmatrix}\]

该形式将未知焦距 \(f\) 的非线性影响精确限制在线性矩阵系数中,使得后续矩阵代数消元成为可能。

2. UP1PfAC 极小求解器:单仿射对应的 4 阶代数降维与零空间消元

使用单仿射对应时,系统包含 4 个仿射约束与 2 个点投影约束,共 6 个方程,而未知数仅有 5 个(偏航角参数 \(r\)、平移向量 \(t_{\text{query}} \in \mathbb{R}^3\) 和焦距 \(f\)),构成了超定系统。为避免高阶代数簇求解,UP1PfAC 暂时舍弃最后 1 个仿射方程,将剩余 5 个方程紧凑写为关于增广平移向量 \([t_{\text{query}}^\top, 1]^\top\) 的齐次线性方程组 \(M(r, f) [t_{\text{query}}^\top, 1]^\top = 0\),其中 \(M(r, f)\)\(5 \times 4\) 矩阵。由于系统具有非零解,该矩阵的所有 \(4 \times 4\) 子行列式必须全为 0。作者通过代数结构分析发现,矩阵中引入的变量 \(\xi = f_{\text{ref}} f (1 + r^2)\) 使得非平凡子行列式能够提取出非零公因式 \((1 + r^2)^2 f^2\),剩余多项式对焦距 \(f\) 呈现严格的线性关系:

\[(1 + r^2)^2 \bar{M}(r) \begin{bmatrix} f \\ 1 \end{bmatrix} = \mathbf{0}\]

其中 \(\bar{M}(r)\) 是一个 \(2 \times 2\) 的多项式矩阵。令其行列式 \(\det(\bar{M}(r)) = 0\),即可导出关于旋转变量 \(r\) 的四次多项式方程 \(\bar{h}(r) = 0\)。四次方程可直接通过 Ferrari 公式获得解析闭式解,随后依次通过线性回代计算出 \(f\)\(t_{\text{query}}\),耗时仅数微秒。

3. UP2PfORI 极小求解器:双旋转协变特征与跨参考图像解耦

对于缺乏完整仿射变换、仅具备特征局部主方向的特征检测器(如 ORB、SuperPoint),作者利用两个旋转协变特征构建 UP2PfORI 求解器。此时每个点提供 2 个点投影方程(共 4 个方程线性包含平移),而方向协变消去尺度后提供 1 个与平移完全无关的标量方程。将 4 个投影方程组成 \(4 \times 4\) 齐次矩阵 \(M\),其行列式条件 \(\det(M) = 0\) 在消除平凡因子后给出关于 \((r, f)\) 的约束 \(\bar{g}(r, f) = 0\)。将其与其中一个方向协变约束联立,再度形成针对未知焦距 \(f\) 为线性的 \(2 \times 2\) 系统:

\[\bar{M}_{\text{ori}}(r) \begin{bmatrix} f \\ 1 \end{bmatrix} = \mathbf{0}\]

\(\det(\bar{M}_{\text{ori}}(r)) = 0\) 同样得到关于 \(r\) 的四次方程,保证了至多 4 组闭式解。更关键的是,该求解器允许两个特征点来自不同的参考图像(跨参考图像),极大地丰富了全局定位建图中的采样组合空间。

4. 多余约束代数残差验证:单解筛选策略

代数求解器计算出的四次多项式通常包含多达 4 个实数根,传统求解器往往将所有实数解全部作为假设抛给 RANSAC,导致内点验证时间成倍增加。本文设计的两套求解器均巧妙利用了推导初期舍弃的未用方程:UP1PfAC 复用被舍弃的第 4 个仿射方程(式 10),UP2PfORI 则复用第 2 个方向协变方程(式 11)。在求解出 4 组候选解 \((r, f, t_{\text{query}})\) 后,直接代入被保留的多余方程计算代数残差,选取残差最小的单组解作为最终输出。这种闭环机制将假设集直接压缩为 1,使得在现代鲁棒估计流程(如 GC-RANSAC)中假设生成和模型评估的开销降至极限。

实验关键数据

主实验

论文在大型真实室外视觉定位基准 Cambridge Landmarks 与 Aachen Day-Night v1.1 上对求解器进行了全面评测,采用 Graph-Cut RANSAC (GC-RANSAC) 配合非线性优化。在 Cambridge Landmarks 数据集上,分别使用深度特征 SuperPoint + LightGlue + S3Esti 与经典 SIFT + 最近邻匹配对比了定位中值误差与耗时。

特征类型 求解器 GreatCourt (cm / ° / ferr / ms) KingsCollege (cm / ° / ferr / ms) OldHospital (cm / ° / ferr / ms) ShopFacade (cm / ° / ferr / ms) StMarysChurch (cm / ° / ferr / ms)
SP+LG+S3Esti P4Pf (点基线) 61.5 / 0.14° / 0.010 / 26.9 36.3 / 0.30° / 0.011 / 48.3 58.7 / 0.42° / 0.015 / 40.9 14.6 / 0.30° / 0.011 / 39.9 23.9 / 0.32° / 0.014 / 42.3
SP+LG+S3Esti P3.5Pf (点基线) 61.3 / 0.14° / 0.010 / 28.0 36.0 / 0.30° / 0.011 / 45.2 58.0 / 0.42° / 0.015 / 38.6 14.6 / 0.30° / 0.011 / 41.4 23.9 / 0.32° / 0.014 / 41.2
SP+LG+S3Esti UP2.5Pf (点+重力) 61.6 / 0.14° / 0.010 / 23.8 35.9 / 0.29° / 0.011 / 41.1 57.2 / 0.42° / 0.015 / 38.0 14.4 / 0.30° / 0.011 / 35.4 23.7 / 0.32° / 0.013 / 37.0
SP+LG+S3Esti UP1PfAC (本文) 57.7 / 0.13° / 0.009 / 22.6 35.6 / 0.28° / 0.012 / 39.9 52.3 / 0.38° / 0.013 / 34.2 10.6 / 0.26° / 0.008 / 33.9 22.6 / 0.31° / 0.014 / 34.3
SP+LG+S3Esti UP2PfORI (本文) 57.9 / 0.13° / 0.009 / 24.0 35.3 / 0.28° / 0.012 / 41.7 52.2 / 0.37° / 0.014 / 37.1 10.9 / 0.26° / 0.008 / 34.3 22.9 / 0.31° / 0.014 / 38.2
SIFT+NN P4Pf (点基线) 75.8 / 0.16° / 0.011 / 23.3 37.9 / 0.31° / 0.012 / 41.9 51.1 / 0.39° / 0.017 / 25.9 11.2 / 0.28° / 0.008 / 23.6 28.7 / 0.37° / 0.018 / 28.4
SIFT+NN UP2.5Pf (点+重力) 75.6 / 0.16° / 0.011 / 20.5 37.8 / 0.31° / 0.012 / 40.1 51.9 / 0.39° / 0.017 / 24.2 11.2 / 0.28° / 0.008 / 20.6 28.4 / 0.38° / 0.018 / 26.4
SIFT+NN UP1PfAC (本文) 70.5 / 0.15° / 0.012 / 16.7 37.6 / 0.30° / 0.012 / 35.5 48.4 / 0.33° / 0.018 / 21.0 11.1 / 0.27° / 0.008 / 20.8 27.7 / 0.38° / 0.017 / 24.2
SIFT+NN UP2PfORI (本文) 70.8 / 0.15° / 0.011 / 17.7 37.8 / 0.30° / 0.012 / 35.4 50.4 / 0.36° / 0.018 / 23.8 11.0 / 0.27° / 0.008 / 21.6 28.1 / 0.38° / 0.018 / 27.1

在更具挑战性的 Aachen Day-Night v1.1 数据集上(包含光照骤变、多相机混杂与夜间弱光),本文求解器在召回率与焦距估计精度上均展现出明显优势:

特征配置 求解器类型 白天召回 (0.25m/2°, 0.5m/5°, 5m/10°) 夜间召回 (0.25m/2°, 0.5m/5°, 5m/10°) 相对焦距误差 (ferr) 运行时间 (ms)
SP+LG+S3Esti P4Pf 46.1% / 70.0% / 96.8% 54.5% / 74.9% / 95.8% 0.010 16.7
SP+LG+S3Esti P3.5Pf 45.6% / 69.7% / 96.7% 54.5% / 74.9% / 95.3% 0.010 20.3
SP+LG+S3Esti UP2.5Pf 46.5% / 68.8% / 96.6% 55.0% / 73.8% / 95.3% 0.010 18.6
SP+LG+S3Esti UP1PfAC (本文) 48.5% / 70.8% / 97.9% 60.2% / 80.1% / 97.4% 0.009 16.7
SP+LG+S3Esti UP2PfORI (本文) 48.4% / 71.2% / 98.2% 62.3% / 80.1% / 97.4% 0.009 19.8
SIFT+NN P4Pf 37.4% / 57.0% / 85.9% 19.4% / 20.9% / 26.2% 0.019 37.9
SIFT+NN UP2.5Pf 37.9% / 57.4% / 85.4% 18.8% / 21.5% / 26.2% 0.018 32.2
SIFT+NN UP1PfAC (本文) 38.8% / 58.6% / 86.3% 18.3% / 22.0% / 27.2% 0.017 28.0
SIFT+NN UP2PfORI (本文) 39.7% / 58.4% / 86.3% 19.4% / 22.5% / 26.7% 0.017 30.8

消融与敏感性分析

论文在合成环境下测试了无噪声纯代数求解耗时(单次调用)、数值稳定度(无噪声误差分布)以及对不同物理噪声源的敏感性:

求解器 最小样本类型 未知焦距支持 单次求解时间 (ns) 无噪声中值旋转误差 无噪声中值焦距误差 50% 外点耗时达到 400 内点
P3.5Pf 3.5 点 19,118 ns \(< 10^{-13}\) \(< 10^{-13}\) 约 0.85 ms
P4Pf 4 点 3,179 ns \(< 10^{-14}\) \(< 10^{-14}\) 约 0.60 ms
UP2.5Pf 2.5 点 + 重力 642 ns \(< 10^{-14}\) \(< 10^{-14}\) 约 0.35 ms
UP1PfAC (本文) 1 仿射对应 + 重力 2,586 ns \(< 10^{-14}\) \(< 10^{-14}\) 约 0.15 ms
UP2PfORI (本文) 2 旋转特征 + 重力 2,149 ns \(< 10^{-14}\) \(< 10^{-14}\) 约 0.22 ms
UP2P (基线) 2 点 + 重力 否 (已知) 484 ns \(< 10^{-15}\) - -
UP1SIFT (基线) 1 SIFT + 重力 否 (已知) 1,448 ns \(< 10^{-14}\) - -
P1AC (基线) 1 仿射对应 否 (已知) 2,740 ns \(< 10^{-13}\) - -

关键发现

  • 样本数决定 RANSAC 真实耗时:尽管 UP2.5Pf 求解器单次执行极快(642 ns),但在 RANSAC 鲁棒框架下,由于 UP1PfAC 只需 1 个特征对应即可生成假设,其在 50% 外点率下找到内点集合的速度比 UP2.5Pf 快 2 倍以上,比纯点 P3.5Pf/P4Pf 快 4-6 倍;当外点率升至 70% 时,传统 4 点法时间呈指数爆炸,而单对应/双对应求解器耗时保持极其平缓。
  • 高噪声容忍度与稳定性:在加入 1.2 像素图像噪声和 0.2° IMU 测量偏差的实际场景中,UP1PfAC 与 UP2PfORI 估计出的焦距相对误差稳定在 0.8%-1.4% 区间,优于传统 PnPf 求解器的 1.5%-1.9%,证明仿射微元和旋转先验对几何畸变提供了强力正则化约束。
  • 单仿射 vs 双旋转的权衡:UP1PfAC 拥有最强的几何表达能力和最少的样本数需求,综合定位精度最高;而 UP2PfORI 特征提取负担更轻(如利用 ORB 的二值计算或轻量旋转估计),且天然支持特征来自不同参考帧的跨图像匹配,两者形成了互补的技术选型空间。

亮点与洞察

  • 将局部高阶微分与 IMU 重力先验成功耦合至部分标定 PnP:以往工作要么用重力求解已知内参位姿,要么在相对位姿中求解焦距,本文首次将重力与仿射几何闭环于绝对位姿与未知焦距估计,填补了代数视觉求解器的理论空白。
  • 巧妙的增广平移矩阵零空间降维设计:利用 \(5 \times 4\) 矩阵 \(M(r,f)\)\(4 \times 4\) 子行列式消除未知平移,再借助多项式矩阵的线性焦距依赖,将复杂的非线性代数几何直接化简为单变量四次方程,保证了严格闭式解和纳秒级求解效率。
  • 复用剩余约束以实现零多余假设筛选:在极小求解器内部利用未参与四次方程推导的冗余多项式计算代数残差,实现 4 选 1 的快速过滤,向 RANSAC 仅提供单解假设,从源头上切断了假设分支冗余引起的算力浪费。

局限与展望

  • 依赖准确的局部平面与法向量先验:UP1PfAC 的局部仿射关系假设 3D 点处于局部切平面上并需要 3D 表面法向量 \(n\);若离线 SfM 地图稀疏、法向量估算噪声极大或物体表面处于极端高曲率边界,仿射近似精度会受损。
  • 平移估计受焦距-深度模糊影响:相比于完全标定的求解器(如已知焦距的 P1AC/UP2P),部分标定方法均不可避免地受焦距与相机距离的尺度耦合影响,在深度分布单一或大退化视角下平移估计精度略逊于已知内参解法。
  • 未来方向:探索与神经隐式场(NeRF / 3D Gaussian Splatting)稠密几何法向的联合优化,以及将求解器集成至面向轻量移动 XR 头显的片上实时紧耦合 VIO/SLAM 初始化模块中。

相关工作与启发

  • vs P4Pf / P3.5Pf (Kukelova et al. / Larsson et al.): 传统部分标定方法仅依赖 3.5 到 4 个无方向点匹配,无法利用 IMU 传感器;本文引入重力对齐和局部仿射特征,将最小样本量从 4 压缩到 1,使 RANSAC 在高外点场景下的采样次数和总体执行时间呈数量级下降。
  • vs UP2.5Pf (Kukelova et al.): UP2.5Pf 虽融合了重力方向,但仍需要 2.5 个点且无法从单个目标识别区域解算位姿;本文 UP1PfAC 仅需 1 个仿射对应,且导出的四次方程具有唯一的无冗余残差筛选机制。
  • vs UP1SIFT / P1AC (Ventura et al.): UP1SIFT 与 P1AC 假设相机内参严格已知且固定,无法应对变焦相机或未标定移动终端;本文将未知焦距作为代数变元引入特征微分约束,打破了内参已知的强假设边界。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ [首次推导了重力先验与仿射/旋转协变特征下的部分标定绝对位姿多项式极小求解器]
  • 实验充分度: ⭐⭐⭐⭐⭐ [涵盖了严格的无噪声数值稳定性验证、多重噪声敏感度消融、RANSAC 运行效率对比以及 Cambridge 与 Aachen 两个经典大规模实景基准]
  • 写作质量: ⭐⭐⭐⭐⭐ [数学推导清晰规整,矩阵结构化降维过程严密且代数直觉表达极佳]
  • 价值: ⭐⭐⭐⭐⭐ [为消费级 XR 头显和移动机器人提供了一种兼具未知变焦标定与纳秒级求解的高吞吐全局定位利器]