CAM3R: Camera-Agnostic Model for 3D Reconstruction¶
会议: ECCV 2026
论文: ECCV 原文
领域: 3D视觉
关键词: 3D重建 / 相机无关模型 / 鱼眼与全景 / 射线解耦 / 全局对齐
一句话总结¶
针对前向三维重建基础模型受限于针孔假设、在广角与非透视镜头下严重退化的问题,CAM3R 将两视角几何解耦为球谐光线方向场与径向距离/相对位姿,并提出光线感知全局对齐,实现了无需标定即可跨全景、鱼眼及针孔相机的高保真三维重建。
研究背景与动机¶
从无姿态、无内参的单/多视角图像中恢复密集三维几何结构,是计算机视觉领域的基石任务。近年来以 DUSt3R、MASt3R、VGGT 和 \(\pi^3\) 为代表的三维几何基础模型,通过在大规模三维数据上预训练,实现了无需传统运动恢复结构(SfM)复杂流程的单次前向三维点云回归。然而,这些模型无一例外地建立在针孔相机(Pinhole Camera)模型假设之上,其训练数据绝大多数来自透视视角图像。当面对现实机器人导航、自动驾驶以及消费级全景相机中广泛使用的非线性光学系统(如鱼眼镜头、360° 全景镜头)时,强烈的径向畸变与大视场角会导致这些基础模型的几何推断严重崩溃,甚至产生严重弯曲的面片和完全发散的位姿估计。
面对大视场畸变图像,业界常见的妥协方案是在输入基础模型之前先进行图像去畸变(Rectification)。但这一预处理手段存在显著缺陷:它会将高曲率的边缘区域过度拉伸甚至直接裁剪丢弃,造成大面积有效视野损失;而且多阶段级联流水线极易引发误差累积,违背了端到端前向推断简洁鲁棒的初衷。虽然近期如 UniK3D 等方法探索了像素到连续三维光线的直接映射以摆脱预定义内参模型,但它们均局限于单目深度估计,无法利用多视角视差与三维上下文线索,无法泛化到跨视角位姿估计与多视角密集重建。
在多视角几何中打破相机模型束缚的核心矛盾在于:既要对任意畸变光学的单视角入射光线方向建立无偏表达,又要从不同视角、甚至异构光学传感器之间联合提取三维对应关系并统一到无失真的世界坐标系中。核心 idea:将两视角前向预测严格解耦为提取内在镜头几何的球谐光线方向场,与捕捉跨视角视差的径向距离及相对刚体位姿,并通过纯光线一致性的空间图剪枝与交替优化实现多视角全局对齐。
方法详解¶
整体框架¶
CAM3R 的整体前向流水线由成对的两视角前向网络与多视角光线感知全局对齐两大部分组成。在两视角前向网络中,模型接收一对任意光学镜头拍摄的无标定图像,将其送入并行解耦的两个核心模块:共享光线模块(Ray Module, RM)回归每个像素的连续光线方向单位向量,跨视角模块(Cross-view Module, CVM)通过交叉注意力机制回归沿光线的径向距离、置信度图以及两视角间的相对刚体位姿变换。随后,光线方向与径向距离逐像素相乘生成局部相机坐标系下的稠密三维点云,并通过相对位姿转换到参考视角。在多视角阶段,由两阶段场景图剪枝筛选可靠边,并在纯三维空间通过交替优化求解全局相机轨迹与尺度因子。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入未标定图像对<br/>I1 与 I2"] --> B["球谐函数光线解耦表示<br/>回归连续单位光线场"]
A --> C["跨视角径向距离与相对位姿回归<br/>解耦几何距离与刚体变换"]
B --> D["非对称角度与尺度锚定监督<br/>分位数惩罚与局部点云规范化"]
C --> D
D --> E["局部点云融合与参考帧对齐<br/>Xi,i = di · ri 经 P2→1 变换"]
E --> F["光线感知图剪枝与交替全局对齐<br/>两阶段剪枝与尺度位姿交替优化"]
F --> G["全局一致性场景点云与相机位姿"]
关键设计¶
1. 球谐函数光线解耦表示:参数化任意镜头几何并打破针孔先验
以往三维基础模型直接回归第一视角坐标系下的绝对笛卡尔点云 \((X, Y, Z)\),将相机镜头投影、场景几何深度以及双目相对位姿高度纠缠在一起。针对非线性大视场畸变,CAM3R 将每个像素的成像光线方向从三维距离中完全解耦。对于单张输入图像 \(I_i\),共享的几何视觉编码器提取类别 token,经由 Transformer 光线编码层(T-Enc)回归一组有限阶数 \(L\) 的球谐函数(Spherical Harmonics, SH)展开系数 \(\mathbf{c}_{l,m}^i\)。通过反向球谐变换,任意像素坐标 \(\mathbf{u}=(u, v)\) 在球面投影域 \(\psi(\mathbf{u}) = (\theta, \phi)\) 下连续重建出归一化的单位光线方向向量 \(\mathbf{d}_i(\mathbf{u}) \in \mathbb{S}^2\):
这一设计的优势在于球谐基函数的连续平滑性能够以极低维的紧凑参数拟合任意复杂畸变曲面(无论是等距鱼眼还是等矩柱面全景),且支持任意分辨率查询,彻底摆脱了经典针孔多项式内参标定模型的过拟合与视野限制。
2. 跨视角径向距离与相对位姿回归:解耦场景深度与空间外参
在光线方向确定后,三维重建的本质退化为求解各像素沿该光线射出的三维欧几里得距离。与透视几何中定义的沿光轴深度(Z-depth)不同,广角与全景镜头下光轴深度在边缘区域会发散或失去物理意义,CAM3R 采用对任意镜头均有良好定义的径向距离(Radial Distance)\(r_i(\mathbf{u}) \in \mathbb{R}^+\)。跨视角模块采用孪生 ViT 提取两图特征,送入由自注意力和交叉注意力交织的双分支 Transformer 解码器进行跨视角线索交互。解码器后接密集预测头(DPT)输出正值径向距离 \(r_i\) 及关联的置信度图 \(\sigma_i\)。局部点云直接由元素级乘积构建:\(X^{i,i}(\mathbf{u}) = \mathbf{d}_i(\mathbf{u}) \cdot r_i(\mathbf{u})\)。为了将第二视角点云无歧义地整合到第一视角的局部参考系,解码模块附加相对位姿网络,显式回归相对旋转矩阵 \(R_{2\to 1} \in \mathrm{SO}(3)\) 和单位平移方向 \(\hat{\mathbf{t}}_{2\to 1} \in \mathbb{S}^2\)。此举彻底打破了 DUSt3R 将第二视角相机内参与外参隐式混杂在单点云输出中的结构缺陷。
3. 非对称角度与尺度锚定监督:防向内塌缩并化解尺度歧义
在网络联合训练阶段,直接使用常规 \(L_1\) 或 \(L_2\) 损失函数监督光线角度,会导致模型严重偏向训练集中占多数的窄视角针孔图像,引发光线向内塌缩的预测偏置。CAM3R 引入非对称角度分位数回归损失 \(\mathcal{L}_A\),当预测角度小于真实角度时施加更严厉的惩罚:
对于局部点云点云回归,采用尺度归一化因子 \(\eta_i\) 消除绝对尺度歧义:
同时,相对位姿网络由测地线旋转损失 \(\mathcal{L}_{\mathrm{rot}}\) 与尺度锚定平移损失 \(\mathcal{L}_{\mathrm{trans}}\) 联合约束,其中平移真值乘以预测点云与真值点云模长之比 \(\tilde{s}\)(阻断梯度回传),使相对平移方向与当前几何尺度严格对齐。
4. 光线感知图剪枝与交替全局对齐:在无失真三维光线空间优化一致性
当扩展至多张无序图像集合时,传统的基于针孔重投影误差的光束法平差(BA)会因非线性畸变而彻底失效。CAM3R 构建穷举场景图并执行两阶段剪枝:第一阶段通过双向位姿一致性检查,剔除旋转偏差超过阈值 \(\tau_{\mathrm{rot}}\) 或平移方向相反的反向不可逆边;第二阶段在三维空间计算重叠区域的互近邻(Mutual Nearest Neighbor, MNN)对应点,剔除有效重叠低于 20% 的伪连接(如视觉相似的对称或重复物体)。在完成剪枝后,聚合各图像所有入射边的高置信度光线与尺度对齐后的径向距离,固化为各相机的局部几何先验 \(\mathbf{x}_i(\mathbf{u}) = R_i(\mathbf{u}) D_i(\mathbf{u})\)。随后建立基于置信度加权的三维全局优化目标:
优化过程采用多阶段交替策略:先固定尺度优化位姿,再固定位姿矫正尺度,经过数轮迭代稳定相机轨迹后,再联合微调所有位姿与尺度参数,在保持局部高质量几何刚性的前提下有效消除了长序列轨迹漂移。
损失函数 / 训练策略¶
模型总训练损失为三者的加权和: $\(\mathcal{L}_{\mathrm{total}} = \lambda_A \mathcal{L}_A + \lambda_{\mathrm{regr}} \mathcal{L}_{\mathrm{regr}} + \lambda_{\mathrm{pose}} \mathcal{L}_{\mathrm{pose}}\)$ 网络采用双阶段渐进式课程训练策略(Curriculum Learning):第一阶段仅在同构相机对(如全景-全景、针孔-针孔)上进行预训练(CAM3R-homo),专注于学习单相机光学系统内的多视角几何对应;第二阶段引入异构相机图像对(如全景-针孔、鱼眼-全景)进行混合微调,从而掌握跨光学特性的广义几何映射。优化器使用 AdamW,初始学习率为 \(5 \times 10^{-5}\),辅以线性预热与余弦衰减,在 4 张 NVIDIA H200 GPU 上利用跨数据集均衡采样训练完成。
实验关键数据¶
主实验¶
论文在包含全景、鱼眼及透视镜头的五个基准数据集上进行了广泛评估,包括 2D3DS、MegaDepth、360Loc、ADT 以及用于零样本评测的 CO3Dv2。
表1:两视角相对位姿估计精度评估(RRA@15° 与 RTA@15°,数值越大越好)
| 模型 | 2D3DS (全景) RRA / RTA | MegaDepth (针孔) RRA / RTA | CO3Dv2 (零样本) RRA / RTA | 360Loc (全景) RRA / RTA | ADT (鱼眼) RRA / RTA |
|---|---|---|---|---|---|
| DUSt3R | 10.6 / 6.0 | 95.6 / 80.8 | 94.7 / 43.1 | 0.0 / 0.0 | 91.0 / 63.6 |
| MASt3R | 18.3 / 9.3 | 69.7 / 56.4 | 98.4 / 33.4 | 39.8 / 5.3 | 96.6 / 63.5 |
| Pow3R | 7.5 / 6.0 | 96.2 / 74.2 | 95.8 / 38.3 | 0.0 / 0.0 | 96.6 / 79.2 |
| VGGT | 11.8 / 11.0 | 98.0 / 88.2 | 90.9 / 29.4 | 37.8 / 11.1 | 92.7 / 82.9 |
| \(\pi^3\) | 16.8 / 11.4 | 99.8 / 93.3 | 90.7 / 22.7 | 38.5 / 13.0 | 97.5 / 93.8 |
| CAM3R-homo | 65.4 / 56.8 | 97.2 / 92.6 | 96.1 / 66.5 | 58.3 / 54.7 | 98.2 / 93.4 |
| CAM3R (完整模型) | 97.7 / 94.3 | 96.8 / 94.2 | 97.5 / 88.2 | 96.0 / 91.0 | 99.0 / 95.0 |
表2:三维点云重建质量与径向距离精度综合对比(点云指标 Acc/Comp/CD 越低越好,NC 越高越好;径向距离 Abs Rel 越低越好,\(\delta_1\) 越高越好)
| 数据集及测试模式 | 模型方法 | 点云 Acc \(\downarrow\) | 点云 Comp \(\downarrow\) | 法线 NC \(\uparrow\) | Chamfer CD \(\downarrow\) | 距离 Abs Rel \(\downarrow\) | 距离 \(\delta_1\) \(\uparrow\) |
|---|---|---|---|---|---|---|---|
| 2D3DS (全景-针孔-鱼眼) |
VGGT \(\pi^3\) CAM3R |
0.520 0.325 0.059 |
1.101 0.399 0.077 |
0.443 0.474 0.970 |
1.022 0.602 0.068 |
0.276 0.217 0.053 |
0.625 0.710 0.954 |
| 360Loc (全景-针孔-鱼眼) |
VGGT \(\pi^3\) CAM3R |
0.890 0.630 0.071 |
3.665 1.405 0.056 |
0.547 0.595 0.977 |
2.270 1.017 0.064 |
0.436 0.333 0.011 |
0.385 0.547 0.994 |
| MegaDepth (标准双针孔) |
VGGT \(\pi^3\) CAM3R |
0.034 0.013 0.032 |
0.076 0.058 0.022 |
0.907 0.921 0.901 |
0.027 0.024 0.026 |
0.016 0.010 0.012 |
0.987 0.996 0.996 |
| ADT (针孔-鱼眼) |
VGGT \(\pi^3\) CAM3R |
0.260 0.166 0.016 |
0.162 0.084 0.013 |
0.653 0.763 0.982 |
0.211 0.125 0.014 |
0.067 0.040 0.018 |
0.547 0.737 0.966 |
| CO3Dv2 (零样本跨模态) |
VGGT \(\pi^3\) CAM3R |
0.093 0.113 0.052 |
0.221 0.109 0.084 |
0.613 0.616 0.676 |
0.157 0.111 0.068 |
0.035 0.027 0.024 |
0.985 0.997 0.986 |
消融实验¶
表3:网络架构解耦必要性演进与消融对比(两视角相对位姿精度 RRA@15° / RTA@15°)
| 架构迭代版本 | 2D3DS RRA / RTA | MegaDepth RRA / RTA | CO3Dv2 (零样本) RRA / RTA | 360Loc RRA / RTA | ADT RRA / RTA |
|---|---|---|---|---|---|
| Vanilla DUSt3R (基线模型) | 10.6 / 6.0 | 95.6 / 80.8 | 94.7 / 43.1 | 0.0 / 0.0 | 91.0 / 63.6 |
| Fine-tuned DUSt3R (Stage 1) (在畸变混合数据上暴力微调) |
17.8 / 10.9 | 94.2 / 72.5 | 94.3 / 52.7 | 13.0 / 9.2 | 87.5 / 65.4 |
| CAM3R (Final - Stage 3) (球谐光线解耦 + 相对位姿网络) |
97.7 / 94.3 | 96.8 / 94.2 | 97.5 / 88.2 | 96.0 / 91.0 | 99.0 / 95.0 |
关键发现¶
- 纯数据微调无法打破表象退化:如消融实验表 3 所示,直接将 DUSt3R 架构在包含大视场畸变的混合数据上进行暴力微调,在 2D3DS 上的旋转精度仅能从 10.6% 提升至 17.8%,位姿估计依然彻底溃败。这证明了传统笛卡尔点云回归模型无法直接学习非线性相机投影与三维结构的强耦合,必须从数学表达上将光线方向与径向深度严格解耦。
- 逐像素距离合理不等于三维结构正确:从表 2 可以发现,\(\pi^3\) 和 VGGT 在 CO3Dv2 上能取得极高的单像素距离阈值准确率(\(\delta_1 = 0.997\)),但其重建点云的倒角距离(CD)却高达 0.111,几乎是 CAM3R(0.068)的两倍。因为笛卡尔坐标强行拟合非透视光路时会导致点云整体沿径向发生弯曲变形,使得局部深度看似合理而整体三维刚体结构完全失真。
- 光线感知全局对齐抑制累积漂移:在多视角重建轨迹评测中,用 DUSt3R 的针孔全局对齐替换 CAM3R 的光线感知全局对齐后,平均准确率(mAA@30)在 2D3DS 上由 73.5% 暴跌至 38.8%,轨迹绝对误差(ATE RMSE)由 1.8 恶化至 2.4,充分证明了在畸变光路下脱离三维光线一致性假设进行传统对齐会带来严重的尺度塌缩与漂移。
亮点与洞察¶
- 球谐连续参数化相机光线:将未标定相机的内参估计规约为紧凑连续的球谐多项式展开,既无需显式预设 Brown-Conrady 或鱼眼多项式内参模型,又能以极小的计算开销表示任意奇形怪状的非线性光路。
- 投影不变量径向距离的设计选择:抛弃了只在透视镜头下成立的 \(Z\) 轴深度,改用沿发射光线的径向距离作为跨视角回归目标,使预测目标与相机姿态和光学镜头彻底解耦,实现了真正意义上的相机无关性。
- 从两视角到多视角的双层图优化鲁棒性:通过几何互近邻与双向旋转闭环对边进行两阶段强力剪枝,并用各视角 consensus 光线固定几何形状,将多视角非凸问题转化为稳健的刚体位姿与单尺度优化,收敛稳定且能抵抗视觉重复模式(Doppelgangers)的干扰。
局限与展望¶
- 双 ViT 分支带来的显存与计算开销:光线模块与跨视角模块采用各自独立的 ViT 主干,在处理长序列高分辨率图像时显存占用较高(两视角单次前向约 14.5 GB),未来可通过特征蒸馏或统一多任务共享编码器进行轻量化压缩。
- 全连通图推断的计算复杂度:构建多视角场景图需要进行 \(\mathcal{O}(N^2)\) 次成对推断,当输入图像规模达数百张时初始推断耗时显著,未来可结合稀疏视图检索器或多视角注意力机制扩展为多帧联合网络。
- 室外超大场景与极稀疏视角的局限:在极端大尺度无纹理区域(如开阔天空或低光照环境),缺乏足够的几何置信度支持,光线场与径向距离会出现局部噪声点。
相关工作与启发¶
- vs DUSt3R / MASt3R: DUSt3R 统一了单次前向稠密重建,但直接输出第一视角坐标系下的绝对三维点云,死死绑定了针孔投影先验;在鱼眼和全景图像上完全失效。CAM3R 将光线方向与径向距离解耦,并在显式位姿指导下变换点云,在保持针孔性能的同时实现了全景与鱼眼下的高保真重建。
- vs UniK3D: UniK3D 首次探索了单目图像上的连续光线回归与径向深度估计,但仅停留在单目层面,无法感知双目视差与外参位姿。CAM3R 将其升级为两视角交叉注意力架构,引入相对位姿网络并构建了多视角光线全局对齐管线。
- vs \(\pi^3\) / VGGT: \(\pi^3\) 与 VGGT 通过置换等变性与大模型容量提升了视角鲁棒性,但在异构光学和大视场数据上因缺乏光线物理建模依旧产生弯曲失真。CAM3R 证明了显式建模相机光线几何是实现真正通用三维视觉大模型不可或缺的物理归纳偏置。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ [首次实现前向三维几何大模型的相机无关化,提出优雅的球谐光线解耦与径向距离回归架构]
- 实验充分度: ⭐⭐⭐⭐⭐ [全面评测全景、鱼眼、针孔及其混合视角,包含两视角、多视角位姿及稠密三维点云多维度指标与架构演化消融]
- 写作质量: ⭐⭐⭐⭐⭐ [逻辑极为严密,数学符号规范,框架图与问题动机高度自洽]
- 价值: ⭐⭐⭐⭐⭐ [为机器人全景感知、车载大广角环视与混合现实等非针孔光学设备的三维重建提供了里程碑式的开源解决方案]