Wid3R: Wide Field-of-View 3D Reconstruction via Camera Model Conditioning¶
会议: ECCV 2026
论文: ECCV 2026 / 项目页
领域: 3D视觉
关键词: 宽视场三维重建、前馈重建、球谐射线表示、相机模型 token、鱼眼与全景相机
一句话总结¶
Wid3R 把多视图前馈重建的输出从「点图」改成「球谐射线方向 + 沿射线径向距离」的解耦表示,并用可学习的相机模型 token 显式条件化共享主干,使同一个网络无需标定和去畸变就能对鱼眼、360° 畸变图像单次前向预测稠密点图与相机位姿;在 Zip-NeRF(鱼眼)上把 AUC@30° 从 π3 的 40.94 提到 74.61,在 Stanford2D3D(360°)上从之前最好的 2.60 提到 79.93。
研究背景与动机¶
过去两年多视图前馈几何模型进步很快:DUSt3R 把重建变成「一对图像进、一张点图出」的回归问题,Spann3R 加上外部空间记忆做增量重建,VGGT 用大规模数据和全局世界坐标系取回尺度与鲁棒性,π3 用置换等变的架构消掉参考视图选择带来的方差。但这些方法有一个共同的、写进架构和训练数据里的前提——输入图像要么来自针孔相机,要么已经被标定、去畸变、校正过。这个前提不只是实验设置的一部分:网络的输出头直接逐像素回归三维点或深度,「像素 → 三维点」的映射被隐式假设成透视投影;训练集也清一色是透视图像。后果是系统性的——把一张鱼眼图喂进 VGGT,网络只能把它当成一张「奇怪的针孔图」,图像中心的预测勉强可用,越靠近视场边缘几何误差越大;360° 图像更极端,其中没有任何一个像素落在针孔视锥内。
而现实里的相机恰恰大量偏离针孔假设。机器人、自动驾驶环视、AR/VR 以及大场景建图系统普遍使用鱼眼相机和全景相机,目的就是在有限数量、有限视角的布设下最大化覆盖、减少盲区。要沿用已有的前馈模型,工程上的做法是先标定、再去畸变、然后当作透视图像处理:这条流水线既增加环节,又在重采样时丢信息(越靠近原始视场边缘的像素被压缩得越厉害,畸变模型估计误差也越大)。已有的宽视场学习方案也还没补上这个缺口——DAC 把不同相机投影到统一的等距柱状空间、UniK3D 在射线空间里用球谐做单目几何估计,两者都只做单视图的深度或点图,不输出相机位姿也不做多视图联合重建;而 360° 多视图的经典做法(EDM 稠密匹配 + IM360 + SfM + 光束平差)虽然精度可用,却依赖全对稠密匹配,一个场景要几分钟到半小时。
本文的切入角度是把「畸变」从表示里移出去:如果像素从一开始就被表示成一条三维射线方向加一个沿该射线的距离,那么投影模型只影响角度那一半,尺度那一半是干净的、与相机模型无关的。核心 idea:用「球谐射线(角度模块)+ 径向距离与不确定度(径向模块)」替换点图头,把相机模型编码成可学习的 token 作为显式条件注入完全共享的网络,再配合按相机类型混合的训练数据与针孔→鱼眼增广,使一个前馈模型同时覆盖针孔、鱼眼与 360° 相机,且推理时既不需要标定也不需要去畸变。
方法详解¶
整体框架¶
Wid3R 的输入是 N 张可能带畸变的宽视场图像,外加每张图对应的一个相机模型 token(针孔 / 鱼眼 / 360° 三选一);输出是每张图在其自身相机坐标系下的稠密点图、每张图的相机位姿,以及用单一尺度对齐后的全局点云。整条链只有一次前馈:图像先过 DINO 主干与特征聚合模块(这部分连同位姿头一起沿用 π3 的预训练权重),聚合后的逐像素特征不再直接回归点图,而是分成两路——角度模块在相机 token 条件下预测一组球谐系数,据此展开出每个像素的三维射线方向;径向模块沿该射线预测一个径向距离和它的不确定度。两者逐元素相乘得到局部点图(\(\hat{\mathbf{P}}_i=\hat{\mathbf{R}}_i\odot\hat{\mathbf{D}}_i\)),位姿头给出位姿,最后由一个在所有视图间共享的尺度因子把它们拼到同一个世界坐标系。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["多视图宽视场图像<br/>针孔 / 鱼眼 / 360°"] --> B["DINO 编码 + 特征聚合<br/>π3 预训练初始化"]
B --> C["相机模型 token<br/>选择并注入相机先验"]
C --> D["射线解耦表示<br/>角度模块 → 球谐射线 R<br/>径向模块 → 距离 D 与不确定度 U"]
D --> E["位姿头 → 位姿 T<br/>点图 P = R ⊙ D"]
E --> F["单尺度对齐 → 全局点云<br/>定位 / 重建"]
与常见前馈模型的区别集中在两点:输出参数化(点图头被拆成角度、径向两个头,尺度与方向解耦)和条件化方式(「这是哪种相机」从网络必须自己隐式推断的东西,变成与图像并列的显式输入)。
关键设计¶
1. 相机模型 token:把「这是哪种相机」从隐式推断变成显式输入
现有前馈模型面对畸变图像时没有任何渠道知道成像几何,能依靠的只有图像统计;而在视场边缘,同样的像素位移在不同投影模型下对应的三维方向差异极大,网络只能折中。Wid3R 在问题定义阶段就把相机模型 token \(\mathbf{C}_i\) 与图像 \(\mathbf{I}_i\) 并列写成网络输入,让网络在预测几何时明确知道自己在看哪一类相机。
具体地,token 是一个可学习的嵌入(针孔、鱼眼、360° 各一个),它不参与主干特征提取,而是作为条件去调制角度模块的球谐系数预测;除此之外的全部网络参数在三种相机之间完全共享。共享是刻意的:360° 几何标注样本只占总训练图像的不到 1%,若为它单开一套参数,这点监督撑不起来;共享主干加一个 token 的差异,等于让 360° 走「借用」针孔与鱼眼统计量的路。消融支持这个判断(Table 7):在同一套混合相机数据上,去掉 token 后 Stanford2D3D 的 Acc 均值从 0.248 退化到 0.284、N.C. 从 0.706 掉到 0.680。
token 只要求网络知道「相机族」,不要求任何标定参数(焦距、主点、畸变系数都不需要),比显式相机模型(Kannala–Brandt、Double Sphere、Mei 模型等)轻得多,也避开了复杂模型标定本身误差大、不稳定的问题。代价是它只能区分训练时见过的几类相机:遇到没见过的投影模型,无法靠 token 插值精确表达。
2. 射线解耦表示:球谐射线方向 + 径向距离,取代点图头
点图头把「像素 → 三维点」当成一个整体回归,这个映射在针孔下近似线性,在鱼眼与 360° 下却是高度非线性的,而且在视场边缘病态——越靠近极点,单位像素对应的方向变化越剧烈,网络不得不花容量去拟合投影本身而不是场景。更隐蔽的麻烦在监督上:常用的尺度对齐损失以「垂直深度」为权重,而宽视场下垂直深度不是一个良定义的量。
本文改用逐像素射线表示,射线方向由角度模块给出。角度模块不直接回归方向向量,而是以相机 token 为条件预测一组球谐系数 \(\mathbf{k}^{lm}_i(\mathbf{C}_i)\),再用预先固定的球谐基 \(Y^{lm}(\cdot,\cdot)\) 展开方向:
其中 \(l,m\) 为球谐的阶与次,\(\theta,\phi\) 为球坐标下的极角与方位角。球谐基在单位球面上光滑且紧致,任意中心投影相机的「像素 → 方向」映射都能用有限个系数很好地逼近,所以同一个头天然覆盖针孔、鱼眼与 360°;又因为 \((\theta,\phi)\) 与三维方向之间存在双射,360° 相机「背后」的方向(\(\theta\) 跨过半空间)也能被正常表示,这是任何以图像平面为参数域的表示做不到的。径向模块则沿每条射线只预测一个标量(径向距离)和它的不确定度,尺度信息被完全隔离在这一路。
解耦之后,畸变只污染角度分支,而角度分支有球谐这个强先验兜底;尺度只走径向分支,训练时因此可以用统一的径向距离加权(见后文损失)。又因为不依赖显式相机模型,推理阶段既不做标定也不做去畸变,天然回避了重采样带来的信息损失。
3. 宽视场数据配方与几何一致的增广
这里的痛点有两个。一是监督极不均衡:训练集里 360° 图像占比不到 1%,而且 360° 数据沿轨迹天然稀疏(每个视点已经能看到整个环境),相邻帧的重叠可能很小,比针孔序列更难学多视图对应。二是「重叠」本身就是前馈多视图模型的学习前提,但宽视场序列的相机位置分布往往很不均匀,随机抽若干张图进一个 batch,很可能抽出一组几乎不重叠的视图,训练信号随之退化。
数据侧的做法是把 9 个数据集(TartanAirV2、ASE、Hypersim、KITTI-360、360Loc、Matterport3D、ScanNet++、EDEN、VKITTI,5 个合成 + 4 个真实)按针孔 / 鱼眼 / 360° 三类组织起来联合训练,用相机族的多样性补 360° 样本绝对数量的不足。采样侧用相机位置的两两距离构造距离矩阵,再对负距离做 softmax 得到概率矩阵,让空间上更近、更可能重叠的视图有更大概率被采进同一 batch。增广侧最关键的是相机增广:把针孔图像和它的深度反投影成点云,再重新投影到一个随机采样的畸变相机模型上(配合 softmax splatting 保留细节),等价于从大量针孔数据里凭空造出鱼眼监督;对 ERP(等距柱状)图像则利用「一张 ERP 覆盖整个视球」的性质,随机采方位角 \(\in[0,2\pi]\)、俯仰角 \(\in[0,\pi]\) 旋转图像、深度与位姿,同一场景的多视图施加同一组变换以保持几何一致。
三个设计互补:token 提供「知道是什么相机」的接口,射线表示提供「能表示任何相机」的容量,数据配方提供「学得动」的监督。消融显示这种互补在稳定性上体现得最明显——只用 360° 数据训练时 Acc 均值 0.220、标准差 0.187,加入针孔数据后方差降到 0.099,加入针孔 + 鱼眼后进一步降到 0.089(Table 7a)。
一个完整示例¶
以 Fig. 1 的鱼眼设置为例:输入 20 张同场景鱼眼图(统一 resize 到 518×336),每张配一个「鱼眼」token。DINO 主干抽出逐像素特征,特征聚合模块在 N 个视图之间交换一次信息(这一步与位姿头都已由 π3 预训练)。随后角度模块在鱼眼 token 条件下为每张图的每个像素输出一组球谐系数,展开成该像素的三维射线方向——这些方向不必关于图像中心对称,所以鱼眼边缘被强烈拉伸的像素也能拿到正确指向;径向模块再为每条射线回归一个径向距离与不确定度,两者相乘得到该视图局部坐标系下的点图。位姿头同时给出 20 个位姿,最后解一个全局共享尺度把它们对齐到同一世界坐标系。换成 360° 相机时流程完全一样,只是 token 换成「360°」,同一套权重即可处理跨越整个视球的图像;换成 Fig. 1 的 18 张 360° 图时前馈仍只跑一次,Matterport3D 这类大场景整条链约 3 秒(Table 4)。
损失函数 / 训练策略¶
所有监督都在「局部点图 + 单一未知尺度」的框架下定义。因为每张图的点图在自己相机坐标系里,跨视图存在尺度歧义,Wid3R 沿用 π3 的假设——所有视图共享一个未知但一致的尺度 \(s\),并解出 MoGe 式的最优对齐:
权重用的是沿射线的径向距离 \(\mathbf{D}_{i,j}\) 而不是垂直深度,这是为任意相机模型做的必要替换(宽视场下垂直深度没有定义)。点图损失就是带 \(s^*\) 的加权 L1。
其余各项:法向损失约束由 8 邻域叉积算出的预测法向与真值法向之间的夹角;位姿损失定义在相对位姿 \(\mathbf{T}_i^{-1}\mathbf{T}_j\) 上,旋转项取测地距离(旋转矩阵之积的迹),平移项用 Huber 损失以压制离群,且平移同样乘上 \(s^*\) 以与点图落到同一尺度;射线损失针对宽视场训练样本少的问题沿用 UniK3D 的非对称角度损失,对 \(\theta\) 与 \(\phi\) 两个角分量分别加权、并对误差方向不对称(原文给出 \(\beta=0.75\);该式在缓存文本中受 OCR 损坏,具体形式 ⚠️ 以原文为准);径向损失是径向距离的 L1;不确定度损失则让预测的不确定度去拟合径向误差本身,即让网络学会预判自己哪里会错。
总损失为加权和,权重 \(\lambda_{normal}=10\)、\(\lambda_{pose}=0.1\)、\(\lambda_{ray}=1.0\)、\(\lambda_{rad}=1.0\)、\(\lambda_{uncer}=0.1\)。优化用 Adam,初始学习率 \(5\times10^{-5}\) 并按迭代指数衰减,输入统一 518×336;编码器、特征聚合与位姿头从 π3 预训练权重初始化,其余组件从头训练,整体端到端。显存决定每 batch 的最大帧数——RTX A6000 上 12 帧、H100 上可到 24 帧,这不是无关紧要的工程细节:消融显示每 batch 帧数从 12 提到 24,Acc 均值从 0.248 降到 0.197、N.C. 从 0.706 升到 0.729(Table 7c)。
实验关键数据¶
主实验¶
评测全部是零样本:模型只在自建的混合宽视场数据上训练,直接测 FIORD(鱼眼)、Zip-NeRF(鱼眼)、Stanford2D3D(360°),不做任何微调。「Ours (π3)」是同样数据、但保留 π3 原点图头的对照,用来分离「数据」和「射线表示 + token」各自的贡献。
Table 2 零样本位姿(RRA@30 / RTA@30 / AUC@30,越高越好):
| 方法 | FIORD RRA@30↑ | FIORD RTA@30↑ | FIORD AUC@30↑ | Zip-NeRF RRA@30↑ | Zip-NeRF RTA@30↑ | Zip-NeRF AUC@30↑ | S2D3D RRA@30↑ | S2D3D RTA@30↑ | S2D3D AUC@30↑ |
|---|---|---|---|---|---|---|---|---|---|
| VGGT | 82.34 | 84.01 | 44.63 | 64.42 | 65.29 | 20.68 | 19.30 | 33.14 | 2.60 |
| π3 | 85.48 | 87.42 | 48.35 | 82.65 | 86.66 | 40.94 | 19.94 | 31.99 | 2.06 |
| Ours (π3 基线) | 99.87 | 96.39 | 72.56 | 83.04 | 89.48 | 64.44 | 82.91 | 87.83 | 62.14 |
| Ours (Wid3R) | 100.0 | 93.38 | 68.20 | 93.34 | 95.15 | 74.61 | 94.05 | 93.29 | 79.93 |
Table 3 用绝对/相对误差复核(越低越好):Wid3R 在 Stanford2D3D 上把 π3 的 ATE 2.83 降到 1.11、RPE rot 从 91.13 降到 18.99;Zip-NeRF 上 ATE 1.83(VGGT)→ 0.49、RPE rot 34.41 → 7.72;FIORD 上 ATE 0.53(π3)→ 0.44,RPE rot 13.45 → 3.27。
Table 5 点图估计(Acc./Comp./N.C.,Acc./Comp. 越低越好、N.C. 越高越好;下表取 Mean,Med. 见原文):
| 方法 | ScanNet++ Acc.↓ | ScanNet++ Comp.↓ | ScanNet++ N.C.↑ | Matterport3D Acc.↓ | Matterport3D Comp.↓ | Matterport3D N.C.↑ | Stanford2D3D Acc.↓ | Stanford2D3D Comp.↓ | Stanford2D3D N.C.↑ |
|---|---|---|---|---|---|---|---|---|---|
| VGGT | 0.135 | 0.068 | 0.704 | 0.327 | 1.756 | 0.530 | 0.387 | 2.115 | 0.536 |
| π3 | 0.086 | 0.037 | 0.739 | 0.315 | 1.308 | 0.539 | 0.380 | 0.745 | 0.557 |
| Ours (π3 基线) | 0.027 | 0.014 | 0.781 | 0.161 | 0.142 | 0.610 | 0.211 | 0.273 | 0.596 |
| Ours (Wid3R) | 0.018 | 0.012 | 0.803 | 0.094 | 0.087 | 0.790 | 0.197 | 0.172 | 0.729 |
消融实验¶
Table 7 在 Stanford2D3D 的 360° 设定上做点图估计(该数据集本身不在训练集中),逐项拆开相机 token 与训练数据配比、以及每 batch 帧数的作用:
| 研究 | 每 batch 帧数 | 相机 token | 针孔 | 鱼眼 | 球面 | Acc. 均值↓ | Acc. 标准差↓ | Comp. 均值↓ | Comp. 标准差↓ | N.C. 均值↑ |
|---|---|---|---|---|---|---|---|---|---|---|
| (a) | 2~12 | ✓ | ✗ | ✗ | ✓ | 0.220 | 0.187 | 0.355 | 0.416 | 0.710 |
| (a) | 2~12 | ✓ | ✓ | ✗ | ✓ | 0.254 | 0.099 | 0.166 | 0.243 | 0.698 |
| (a) | 2~12 | ✓ | ✗ | ✓ | ✓ | 0.593 | 0.101 | 0.120 | 0.136 | 0.686 |
| (a) | 2~12 | ✓ | ✓ | ✓ | ✓ | 0.248 | 0.089 | 0.146 | 0.164 | 0.706 |
| (b) | 2~12 | ✗ | ✓ | ✓ | ✓ | 0.284 | 0.103 | 0.152 | 0.178 | 0.680 |
| (c) | 2~24 | ✓ | ✓ | ✓ | ✓ | 0.197 | 0.113 | 0.172 | 0.257 | 0.729 |
关键发现¶
- 对 360° 而言,数据配比带来的收益主要体现在稳定性和完整度上,而不只是精度均值。 只用 360° 数据训练时 Acc 均值为 0.220 但标准差高达 0.187、Comp 均值 0.355;加入针孔数据后标准差降到 0.099,再叠加鱼眼数据后为 0.089、Comp 均值降到 0.146。这说明混合相机训练真正的作用是让共享参数从别的相机类型里获得额外监督,缓解 360° 监督稀缺导致的过拟合。
- 鱼眼数据对 360° 的帮助最大也最不稳定。 在 360° + 鱼眼这一行,Comp 均值降到全表最低的 0.120、Acc 中位数 0.126 也是最好的一档,但 Acc 均值反而涨到 0.593(标准差 0.101),说明少量场景上出现了很大的离群误差——均值与中位数在这一行严重分叉,读这张表不能只看均值。
- 相机 token 一致有效但幅度有限。 (a) 全数据(0.248 / 0.146 / 0.706)对比 (b) 去掉 token(0.284 / 0.152 / 0.680),三项指标同向变好;这与「token 只提供相机族先验、真正的知识在共享主干里」的定位一致。
- 每 batch 帧数是一条被硬件卡住的性能曲线。 12 帧 → 24 帧让 Acc 均值 0.248 → 0.197、N.C. 0.706 → 0.729,但 Comp 均值反而从 0.146 升到 0.172、标准差从 0.164 升到 0.257。作者的解释是更多视图让模型学到更丰富的多视图注意力模式,这也意味着该方法在消费级显存上尚未跑满。
- 大场景定位:注册率追平 SfM,精度有得有失、速度快两个数量级。 Table 4 在 Matterport3D 三个场景上,Wid3R 三个场景都是满额注册(37/37、20/20、31/31),与 EDM + IM360 持平;AUC@10 在 Scene2 上 84.77 明显高于 EDM + IM360 的 66.87,但在 Scene1(72.81 vs 84.53)与 Scene3(89.40 vs 92.18)略低。最关键的是耗时:整条链约 3 秒,而 SfM 方案约 3–30 分钟,因为它不需要任何全对稠密匹配与迭代优化。
- 单目 360° 深度:分布指标很强,绝对误差不占优。 Table 6 在 Matterport3D 上,Wid3R 的 δ1.25 为 0.948(表中最高,Depth Anywhere 0.917、ACDNet 0.900),但与 Depth Anywhere 在 δ1.25² 上同为 0.976、δ1.25³ 上落后(0.984 vs 0.991);AbsRel 0.227 弱于专门做 360° 深度的 Depth Anywhere(0.085)与 DAC(0.156)。考虑到 Wid3R 是多视图模型、训练时还混了针孔与鱼眼数据,这个结果说明它学到了可用的 360° 深度结构,但并不是单目深度 SOTA。
亮点与洞察¶
- 射线表示把「相机模型」从网络要拟合的东西变成了表示的一部分。 因为「像素 → 方向」用固定的球谐基展开、只有系数需要预测,网络学的是「这台相机大致长什么样」的低维修正量,而不是从零拟合一个非线性映射;再加上 \((\theta,\phi)\) 与三维方向双射,360° 背后半空间的方向也能被表示——这是以图像平面为参数域的点图头根本做不到的。
- 解耦角度与径向,让畸变和尺度各自只污染一个分支。 这个拆分的巧妙之处在于它同时解决了两件事:畸变(只影响方向)有了球谐先验兜底,尺度(只影响半径)则可以用与相机模型无关的径向距离来加权监督。其中「把尺度对齐损失里的垂直深度换成径向距离」是一处极小但必须的改动,任何要在宽视场下做几何监督的工作都可以直接复用。
- 用相机 token + 相机增广把稀缺监督问题转成数据互通问题。 360° 标注不到总数据的 1%,硬碰硬做不了;本文的思路是让三种相机共享权重、靠 token 区分,再用针孔→鱼眼的重投影增广人为扩充宽视场监督。消融显示这一策略的最大收益是方差而不是均值,这一点对任何「某类数据极少」的多任务训练都有参考价值。
- 前馈几何模型相对 SfM 的效率优势在宽视场上被放大了。 360° SfM 必须做全对稠密匹配(EDM)加光束平差,精度高但代价是分钟级;Wid3R 把这个过程压到秒级且注册率不降,说明「用大模型换掉迭代优化」这条路在宽视场设置下同样成立。
局限与展望¶
- 作者承认的局限是目前不显式建模动态场景,未来计划引入含动态内容的数据集并设计处理场景动态的模块。这对实际采集的 360° 数据(行人、车辆、反光面)是很现实的限制。
- token 只能表达训练时见过的相机族(针孔 / 鱼眼 / 360°),遇到未见过的投影模型(例如特定非中心相机、极端畸变模型)无法通过插值精确表达;推理时也需要知道「这张图是哪类相机」,只是不需要完整标定。一个自然的改进方向是把 token 换成对相机参数的连续条件(如把焦距比、畸变系数编码进条件向量),让模型在相机族内部也能插值。
- 训练数据里 360° 占比不到 1%,作者用混合相机训练来缓解,但消融也显示鱼眼 + 360° 组合的 Acc 均值反而从 0.220 涨到 0.593(中位数却最好),说明少样本场景上仍存在不安定的离群失败,稳定性还没有被完全解决。
- 在单目 360° 深度上 AbsRel 0.227 明显弱于专门方法(Depth Anywhere 0.085),在大场景定位上 Scene1/Scene3 的 AUC 也低于 EDM + IM360,说明这套表示在精度上并不是全面碾压:它的优势在通用性、零样本与速度,而不是每一张榜。
- 方法整体建立在 π3 的预训练权重之上(编码器、特征聚合、位姿头),因此仍然依赖针孔大规模预训练这一环节;论文没有报告完全从头训练时的表现,也没有给出球谐阶数 \(L\) 的取值与敏感性分析。
相关工作与启发¶
- vs DUSt3R / VGGT / π3: 它们把多视图几何做成前馈回归,但输入被假设为针孔或已整流图像,输出为点图,尺度靠单一共享尺度对齐;Wid3R 沿用 π3 的置换等变主干(因而继承了「参考视图选择不敏感」的性质)与尺度对齐思路,把输出头换成球谐射线 + 径向距离,并加上相机 token。区别不在主干而在表示与条件化,因此 Wid3R 的改动可以看作对这类前馈模型的一次「输出层 + 输入条件」的通用升级。
- vs UniK3D / DAC: UniK3D 同样在射线空间里用球谐建模,但只做单目点估计、不输出位姿也不做多视图联合;Wid3R 把它扩展成多视图重建,并新增了相机 token 与径向不确定度这一路。DAC 走的是另一条路——把各种相机投影到统一的等距柱状空间再估深度,属于「统一参数域」而非「统一射线空间」。本文的多视图场景与它们单视图的定位不同,任务难度不可直接比大小。
- vs IM360 + EDM(360° SfM 流水线): 他们靠稠密匹配 + 三角化 + 光束平差得到高精度位姿与稀疏/稠密点云,代价是全对匹配与迭代优化(分钟级);Wid3R 用一次前馈直接预测点图,秒级完成且注册率持平,在部分场景 AUC 更高、部分场景略低。两者的取舍是典型的「精度上限 vs 吞吐与部署成本」。
- vs MoGe / Metric3D(单目点图 + 规范相机): 它们用 canonical camera / 最优对齐处理相机几何,但主战场是透视图像的单目度量深度;Wid3R 的贡献是把「相机几何」从规范相机变换升级为显式的相机模型条件 + 射线表示,并把它放到多视图位姿与点图联合估计的场景里。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首个面向畸变宽视场(含 360°)多视图前馈重建的方法,射线解耦表示 + 相机模型 token 的组合干净且此前无人做过。
- 实验充分度: ⭐⭐⭐⭐ 位姿、点图、大场景定位、单目深度四条线都测了,消融同时覆盖数据配比、token 与帧数;但缺少球谐阶数与 token 设计的更细粒度消融,部分消融行均值与中位数严重分叉。
- 写作质量: ⭐⭐⭐⭐ 动机链条清楚(前馈模型的针孔偏置 → 宽视场需求 → 射线表示),方法分节合理;部分公式在公开 PDF 中排印与 OCR 受损,复现细节(球谐阶数、token 维度)需要看补充材料。
- 价值: ⭐⭐⭐⭐⭐ 直接打开了前馈几何模型在鱼眼/全景上的适用范围,且推理不需要标定与去畸变,对机器人、AR/VR 与大场景建图这类实际部署很有吸引力。