跳转至

Argus: Metric Panoramic 3D Reconstruction for Indoor Scenes

会议: ECCV 2026
论文: ECCV 原文
项目主页: https://argus-paper.realsee.ai
领域: 3D视觉
关键词: 全景3D重建, 度量尺度, 前馈网络, 共视参考帧选取, 几何分解监督

一句话总结

针对室内无序全景图像重建中参考视角漂移与尺度模糊问题,Argus 提出了可学习的共视感知参考帧选取机制与过完备几何分解监督策略,在首个大规模全景 RGB-D 数据集 Realsee3D 上实现了单次前馈、高精度的室内度量级 3D 重建。

研究背景与动机

全景相机凭借 \(360^\circ \times 180^\circ\) 的超大水平与垂直视场角,正逐渐成为室内三维资产采集、机器人具身智能以及数字孪生建模的首选载体。相比于视场狭窄的透视相机,单张全景图即可覆盖房间内绝大多数可视表面,少量视点即能形成高重叠度观测,天然契合稀疏视角下快速前馈重建的范式。然而,现有的前馈三维重建大模型(如 DUSt3R、VGGT、MapAnything)几乎完全是在透视图像数据集上训练得到的,由于等距柱状投影(ERP)存在两极严重畸变与非均匀像素分布,现有模型在直接处理全景输入时会发生严重的几何退化与结构断裂;此外,学术界长期缺乏拥有高精度绝对物理度量的大规模室内全景 RGB-D 基准,制约了该领域的发展。

在真实的室内全景数据采集流程中,相机捕获的位置通常是稀疏且无序的。主流前馈模型通常预先设定固定参考帧(例如默认取序列的第一帧)作为世界坐标系的原点。当采集序列的第一帧恰好落在房间角落、门后或边缘遮挡区域时,该参考视角的视锥与其他视点间的共视约束严重不足,极易引发累积误差和灾难性的全局位姿漂移。另一方面,端到端直接从二维图像回归三维世界坐标点云,是将透视解算、深度预测、相对旋转与空间平移完全糅杂在一起的黑盒过程,多任务学习的梯度相互干扰,难以保证相机坐标系与世界坐标系间预测几何的一致性。

本文的核心切入点是:利用全景固有的共视拓扑结构自适应推选最佳几何基准,同时显式拆解像素到世界坐标的多阶段正向与逆向投影。核心 idea:通过轻量共视 Transformer 动态预测全局最优参考视角以锚定绝对度量世界坐标系,并引入过完备几何分解与跨坐标双向联合约束,实现无序稀疏全景图像下单次前馈的稳健室内度量级 3D 重建。

方法详解

整体框架

Argus 接收任意无序的稀疏室内全景 ERP 图像集合作为输入,经过两阶段 Transformer 与专用预测头,直接输出所有视角的绝对相机位姿、度量深度图以及多空间点云。系统流程分为三个核心阶段:首先利用 DINOv2 提取单帧 patch 表征,并通过轻量共视 Transformer 预测视点全局共视得分,通过最大化操作自适应选取最优参考帧并对齐坐标锚点;随后将视点特征与相机 Token 传入深层几何 Transformer 进行充分的跨视角几何推理;最终分别通过位姿 MLP 与多尺度 DPT 预测头回归相机位姿、深度与不同坐标系下的几何点云,并在训练中通过可逆变换施加全阶段闭环联合约束。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["无序全景图像输入<br/>ERP 图像预处理与极区裁剪"] --> B["共视感知参考帧选取<br/>预测全局连通度并动态选定基准帧"]
    B --> C["跨视角几何表征推理<br/>Geometry Transformer 交替自注意力"]
    C --> D["过完备几何分解预测<br/>位姿/深度/相机点云/旋转点云/世界点云"]
    D --> E["双向交叉坐标联合约束<br/>跨坐标闭环变换与梯度互促监督"]
    E --> F["输出绝对度量级 3D 场景重建"]

关键设计

1. 共视感知参考帧选取:消除无序采集下的全局位姿累积漂移 现有前馈模型对输入顺序极其敏感,若固定以第一帧作为全局坐标系基准,边缘视点的弱共视将导致灾难性漂移。Argus 在特征提取后引入一个仅包含 2 层交替注意力(视图内与视图间自注意力)的轻量级 Covisibility Transformer。该模块以各视图的 Patch Token 和新增的共视 Token 为输入,通过 MLP 输出每个视角的全局共视得分预测值 \(\hat{\mathbf{C}} \in \mathbb{R}^N\)。训练时,标签由位姿和深度计算的全局共视连通图经 Dijkstra 算法推导获得,采用二值交叉熵损失 \(\mathcal{L}_{\text{covis}}\) 监督;推理时,模型直接通过 \(\arg\max\) 选取得分最高的视角作为全局世界坐标系的原点,并赋予其专属的参考相机 Token。由于 \(\arg\max\) 具有天然的排列等变性,无论输入全景的初始顺序如何被打乱,网络均能稳定选中位于场景视觉中心的枢纽帧,从根本上抑制了全局坐标系统的旋转和平移漂移。

2. 全景过完备几何分解:显式解耦像素到三维空间的映射阶段 直接让单路网络从像素预测世界坐标点云,优化难度高且容易产生虚假几何。针对 ERP 全景无内参焦距模糊的特性,Argus 将单个视角的像素到世界三维点映射显式解构为四个独立物理阶段:由球面单位向量乘以深度得到相机坐标系点云 \(P_c = D \odot P_u\);由旋转矩阵变换至参考帧对齐的旋转点云 \(P_r = R P_c\);再通过平移变换进入世界坐标系 \(P_w = P_r + t\);并建立对应的逆向解析变换。在网络输出端,除相机位姿预测头外,特别设计了多个并行的 DPT 预测头分别独立预测深度 \(\hat{D}\)、相机点云 \(\hat{P}_c\)、旋转点云 \(\hat{P}_r\) 以及世界点云 \(\hat{P}_w\)。每个预测头均配有置信度预测分支,对三维点云坐标采用扩展动态范围的逆对数变换函数 \(f(x) = \text{sign}(x) \cdot (\exp(|x|) - 1)\),显著降低了多阶段多任务联合学习时的优化梯度阻力。

3. 双向交叉坐标联合约束:多分支相互校准的闭环梯度增强 为避免各个几何预测头沦为互不连通的独立拟合,Argus 提出了强一致性的几何联合损失函数 \(\mathcal{L}_{\text{joint}}\)。网络将某一分支预测的中间几何表示(例如预测的深度 \(\hat{D}\)),代入另一分支预测的相机运动变换(如预测位姿 \(\hat{R}, \hat{t}\)),映射推导出相邻阶段的三维表示,并与真值计算误差: $$ \mathcal{L}{\text{joint}} = \mathcal{L}_p\bigl(\Phi}(\hat{D})\bigr) + \mathcal{Lp\bigl(\Phi}(\hat{Pc, \hat{R})\bigr) + \mathcal{L}_p\bigl(\Phi}(\hat{Pr, \hat{t})\bigr) + \mathcal{L}_p\bigl(\Phi}(\hat{Pw, \hat{t})\bigr) + \mathcal{L}_p\bigl(\Phi}(\hat{Pr, \hat{R})\bigr) + \mathcal{L}_d\bigl(\Phi_c)\bigr) $$ 因为输入联合损失项的变量全部为网络各自分支的实时预测输出,变换公式构成了完全可微的正反向计算图,这使得位姿旋转、平移、局部深度与空间点云的梯度在反向传播中充分交融、互相校验。值得注意的是,在推理部署阶段,中间的多个点云 DPT 预测头可以直接切断,仅保留位姿和深度头即可完成高精度几何解算,实现了零额外开销的高效推理。}(\hat{P

4. 无歧义绝对度量尺度的直接预测:消除多视度量模糊 透视相机的投影矩阵存在焦距与场景深度的内在尺度两义性,传统方法往往需要额外的度量标定网络或复杂的尺度对齐优化。而在等距柱状全景投影模型中,像平面各像素的二维坐标 \((u, v)\) 与球坐标纬度 \(\theta = (\frac{v}{H} - 0.5)\pi\)、经度 \(\phi = (\frac{u}{W} - 0.5)2\pi\) 之间是绝对刚性对应的,光线方向向量不存在焦距伸缩模糊。依托 Realsee3D 中激光雷达与高精度 PBR 渲染建立的毫米级绝对公制度量真值,Argus 只需对训练真值统一除以全局固定缩放因子 \(s=10\) 进行归一化,网络无需外部尺度先验即可直接输出真实的公制尺度预测结果。

损失函数 / 训练策略

模型采用端到端多任务联合监督,总损失函数定义为: $$ \mathcal{L} = 0.1 \cdot \mathcal{L}{\text{covis}} + \mathcal{L}}} + \mathcal{Ld + \mathcal{L}} + \mathcal{L{rp} + \mathcal{L} $$ 其中位姿损失 } + \mathcal{L}_{\text{joint}\(\mathcal{L}_{\text{cam}} = \mathcal{L}_q + \mathcal{L}_t\) 包含四元数旋转与尺度平移的 L1 损失,并引入基于预测置信度的自适应不确定度加权与正则项;深度损失 \(\mathcal{L}_d\) 结合了多尺度梯度损失与预测不确定度加权;点云损失 \(\mathcal{L}_p\) 针对各坐标系下的点坐标 L1 距离与法向量余弦相似度进行联合约束。

网络基于 AdamW 优化器在 24 张 NVIDIA H20 GPU 上分布式训练 36 小时(共 99K 次迭代),初始权重迁移自 VGGT。训练时每批次随机抽取同一场景内的 2 至 28 张连通全景图,图像分辨率统一调整为 \(560 \times 196\)(裁剪掉上下各 15% 极度畸变的极区像素),并配合色调抖动、高斯模糊以及全景水平循环位移(模拟绕 Y 轴的随机 Yaw 轴旋转),显著增强了模型的泛化鲁棒性。

实验关键数据

主实验

论文在全新构建的 Realsee3D 基准上(包含 1,000 个真实场景与 9,000 个高保真合成场景),与基于全景数据微调的主流 SOTA 方案(VGGT360、MapAnything360、\(\pi^3_{360}\))进行了多视角位姿估计、多视角深度估计与点云重建的全方位评估。

表 1:Realsee3D 真实与合成子集上的多任务综合对比 | 评测任务与指标 | 数据集划分 | VGGT360 | MapAnything360 | \(\pi^3_{360}\) | Argus (本文) | 相对优势 / 增益 | | :--- | :--- | :---: | :---: | :---: | :---: | :---: | | 相机位姿 ATE \(\downarrow\) (m) | Real | — | 0.134 | — | 0.096 | 误差降低 28.4% | | 相机位姿 ATE \(\downarrow\) (m) | Synthetic | — | 0.087 | — | 0.027 | 误差降低 69.0% | | 位姿可接受率 A.R. \(\uparrow\) (%) | Real | — | 94.0 | — | 98.2 | 提升 +4.2% | | 位姿可接受率 A.R. \(\uparrow\) (%) | Synthetic | — | 99.3 | — | 99.8 | 提升 +0.5% | | 位姿 AUC@\(10^\circ\) \(\uparrow\) (%) | Real | 83.00 | 85.37 | 85.92 | 85.52 | 与顶尖 baseline 相当 | | 位姿 AUC@\(10^\circ\) \(\uparrow\) (%) | Synthetic | 95.38 | 95.11 | 96.58 | 97.29 | 相比 SOTA 提升 +0.71% | | 度量深度 AbsRel \(\downarrow\) | Real | — | 0.070 | — | 0.050 | 误差降低 28.6% | | 度量深度 AbsRel \(\downarrow\) | Synthetic | — | 0.063 | — | 0.035 | 误差降低 44.4% | | 度量深度 \(\delta_1\) \(\uparrow\) (%) | Real | — | 46.31 | — | 66.28 | 阈值精度提升 +19.97% | | 度量深度 \(\delta_1\) \(\uparrow\) (%) | Synthetic | — | 74.64 | — | 91.24 | 阈值精度提升 +16.60% | | 度量点云 Acc. \(\downarrow\) (m) | Real | — | 0.089 | — | 0.056 | 几何精度提升 37.1% | | 度量点云 Comp. \(\downarrow\) (m) | Real | — | 0.075 | — | 0.063 | 完整度提升 16.0% | | 度量点云 N.C. \(\uparrow\) | Real | — | 0.825 | — | 0.894 | 法向量一致性显著提升 |

消融实验

在 Realsee3D 合成测试集上对模型核心模块逐步消融,评估绝对度量预测指标(包括绝对轨迹误差 ATE、深度 AbsRel 以及点云精度):

表 2:Realsee3D 合成子集上的核心组件消融分析 | 配置与消融项 | 深度 AbsRel \(\downarrow\) | 深度 \(\delta_1\) \(\uparrow\) (%) | 深度 RMSE \(\downarrow\) | 点云 Acc. \(\downarrow\) | 点云 Comp. \(\downarrow\) | 点云 N.C. \(\uparrow\) | 位姿 ATE \(\downarrow\) (m) | 结论与机制分析 | | :--- | :---: | :---: | :---: | :---: | :---: | :---: | :---: | :--- | | Full Model (完整模型) | 0.035 | 91.24 | 0.139 | 0.020 | 0.015 | 0.939 | 0.027 | 具备最优全局几何精度 | | w/o 共视参考帧选取 | 0.037 | 90.45 | 0.142 | 0.024 | 0.017 | 0.923 | 0.060 | ATE 飙升 122%,位姿基准失稳 | | w/o 几何联合损失 \(\mathcal{L}_{\text{joint}}\) | 0.047 | 90.71 | 0.158 | 0.020 | 0.015 | 0.937 | 0.049 | 跨阶段一致性破坏,深度与位姿双降 | | w/o 相机点云损失 \(\mathcal{L}_{cp}\) | 0.055 | 89.90 | 0.161 | 0.020 | 0.015 | 0.936 | 0.047 | 局部三维梯度缺失,深度指标大幅衰退 | | w/o 旋转点云损失 \(\mathcal{L}_{rp}\) | 0.045 | 90.55 | 0.159 | 0.020 | 0.015 | 0.937 | 0.051 | 相对姿态约束变弱,轨迹误差增大 | | w/o \(\mathcal{L}_{cp}\) & \(\mathcal{L}_{rp}\) | 0.055 | 89.75 | 0.160 | 0.020 | 0.015 | 0.936 | 0.048 | 仅靠世界坐标点云,优化难度剧增 | | w/o 所有点云损失 (\(\mathcal{L}_{cp}, \mathcal{L}_{rp}, \mathcal{L}_{wp}\)) | 0.075 | 88.52 | 0.169 | — | — | — | 0.061 | 退化为纯位姿+深度预测,各指标垫底 |

关键发现

  • 参考视角决定全局位姿稳定性上限:去除共视参考帧动态选择模块后,位姿绝对轨迹误差 ATE 从 0.027m 暴增至 0.060m(上升 122%)。这证明在无序全景序列中,自适应挑选场景视觉中心帧建立全局坐标系,是阻断长程累积漂移的关键。
  • 相机坐标系点云监督对深度的反哺效应显著强于旋转点云:单独去除 \(\mathcal{L}_{cp}\)(AbsRel 升至 0.055)比单独去除 \(\mathcal{L}_{rp}\)(AbsRel 升至 0.045)对深度质量的损害更大。尽管 \(P_c\)\(D\) 在数学上可通过光线方向直接换算,但高维点云空间的法向与欧氏距离损失在反向传播中提供了更加平滑的曲面约束。
  • 推理极其高效:在单张 H20 GPU 上处理 16 帧输入耗时仅 0.66 秒(显存占用 3.54GB),处理 128 帧全屋全景仅需 10.55 秒(显存占用 7.22GB),具备直接部署至工业界大规模云渲染与实勘产线的潜力。

亮点与洞察

  • 拓扑引导的锚点自洽机制:通过可学习的 Covisibility Transformer 与 \(\arg\max\) 选帧,巧妙赋予网络对无序图像集合的置换等变性,既克服了固定参考帧的脆弱性,又避开了全图成对约束带来的 \(O(N^2)\) 计算瓶颈。
  • 过完备分解与推理零负担的完美平衡:训练阶段开辟多个中间坐标系几何预测头并构建闭环联合损失,最大化多任务几何互促效应;而在推理阶段无缝摘除冗余点云头,兼具训练强监督与推理超轻量的双重优势。
  • 填补全景度量基准空白:构建了兼具真实激光雷达扫描与高精物理渲染(UE5 光追 + PBR)的大规模室内数据集 Realsee3D,为社区从透视视角走向全视场前馈 3D 重建奠定了坚实基石。

局限与展望

  • 场景尺度扩展瓶颈:当前模型参数与显存设计主要针对单层室内多房间建筑,当视角规模扩展到超大型商业综合体或数千张航拍/开阔街景全景时,全注意力机制的显存仍会受限,探索尺度无关的局部图匹配与滑动窗口机制是未来方向。
  • 非刚体与镜面反射挑战:虽然合成数据覆盖了 5 种不同日夜光照,但真实室内环境中的大面积穿透性玻璃幕墙、镜面与移动人员仍可能干扰共视网络对有效重叠度的判定。

相关工作与启发

  • vs VGGT / VGGT-Omega: VGGT 奠定了透视图像多视角交替注意力和前馈几何回归的基础,但其固定参考帧策略在无序全景图像输入时极易因边界帧退化;Argus 引入共视感知选帧与全景几何分解,在全景多视角深度与位姿精度上全方位超越 VGGT360。
  • vs MapAnything: MapAnything 提出了通用度量尺度预测范式,但在无序全景场景下的位姿与点云重建误差显著高于 Argus(例如 Real 集点云误差高出 37%);Argus 证明了结合全景刚性投影特性的专用几何分解设计能带来更纯粹的度量收敛。
  • vs \(\pi^3\): \(\pi^3\) 通过成对排列等变架构解决无序问题,但两两约束计算复杂度高且从零训练难度极大;Argus 通过可学习共视帧结合单参考基准分支,在享受参考帧平滑优化特性的同时实现了轻量级置换鲁棒性。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 首次将自适应共视参考帧选取与过完备几何分解引入全景度量前馈重建任务。
  • 实验充分度: ⭐⭐⭐⭐⭐ 构建了包含 10K 场景、近 30 万视点的 Realsee3D 大规模基准,多任务对比与消融详尽扎实。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,图表详实,几何公式拆解与实验分析清晰透彻。
  • 价值: ⭐⭐⭐⭐⭐ 彻底打通了全景室内 3D 重建的度量尺度瓶颈,对空间计算、虚拟房产与具身导航具有重要工程与学术价值。