跳转至

CasaMaestro: Multi-View Panoramas for House-Scale 3D Reconstruction

会议: ECCV 2026
论文: ECCV 原文
代码: https://george-attano.github.io/CasaMaestro
领域: 3D视觉
关键词: 全景3D重建, 房屋尺度重建, 多视角全景, 相机位姿估计, 跨视角注意力

一句话总结

CasaMaestro 是首个面向房屋级场景的无外参多视全景前馈 3D 重建模型,仅需 20~50 张稀疏全景图,即可联合直接回归各视角绝对度量深度与全局对齐的相机位姿,实现全屋厘米级点云重建。

研究背景与动机

面向家庭部署的具身智能系统对大范围真实住宅环境的快速、度量一致性三维重建提出了紧迫需求。构建高保真仿真环境过去主要依赖高成本的专业激光雷达(LiDAR),而近期兴起的 3D 视觉基座模型(如 VGGT、π3、Depth Anything 3 等)虽然展现了单次前馈生成 3D 的潜力,但绝大多数建立在传统针孔相机(pinhole camera)假设之上。针孔相机的视场角极度狭窄(通常只有几十度),要在跨多房间的住宅尺度下实现完整覆盖,往往需要成百上千甚至上万张密集图像序列;这不仅造成极高的数据采集与计算开销,更导致长序列累积漂移、局部特征缺失及位姿闭环崩溃。

为了提高重建效率,已有研究探索利用 360° 等矩形投影(ERP)全景图,但现有全景 3D 方法要么局限于单图深度估计,缺乏相对位姿推断;要么局限于短基线、2~5 张图的微型物体/单房间场景(如 PanoSplatt3R),在面对稀疏多房间采集时完全失效。另一些依赖视频流的位姿网络(如 PanoPose、SPR)对视角重叠度要求极其严苛,在住宅级大位移采样下极易丢失匹配。核心矛盾在于:大尺度室内稀疏全景采集带来了极大的视点位移与跨房间遮挡,现有主干网络既要兼顾精细的局部致密深度预测,又必须跨全局视角建立全局自洽的几何位姿对齐。

本文的核心 idea 是遵循极简主义视觉基座模型架构,采用单套参数的交替注意力 DINOv2 主干提取多视表示,结合解耦的跨视角自注意力轻量位姿解码器与保真实 3D 几何的 ERP 旋转数据增强,直接从数十张无外参稀疏全景中联合预测度量深度与相机位姿。

方法详解

整体框架

CasaMaestro 接收 \(V\) 张未经标定的稀疏全景图像作为输入(典型为 20~50 张全景图),整体管线包含三个核心阶段:第一阶段采用单一轻量 DINOv2 ViT 主干网络,通过在浅层保留单视角自注意力和深层引入视角展平的跨视角全局自注意力,提取多视尺度自适应稠密特征;第二阶段采用 DPT 解码头基于中间特征金字塔预测每张全景图的度量绝对深度图;第三阶段通过专用的轻量级跨视角相机位姿解码器解耦全局几何对齐,直接回归每个视角的平移向量与四元数旋转;最后将预测的度量深度结合预测外参反投影为全屋 3D 点云。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["稀疏多视角全景输入<br/>V 帧 RGB 图像,无外参"] --> B["交替多视注意力主干<br/>前 L 层单视局部,后续跨视全局展平"]
    B --> C["分层特征提取与解耦<br/>稠密预测特征 + 顶层场景级表征"]
    C --> D["DPT 深度解码头<br/>多尺度特征融合,回归度量深度"]
    C --> E["跨视角位姿解码器<br/>视角级自注意力,解耦全局对齐"]
    D --> F["全屋 3D 点云反投影<br/>度量尺度、跨房间无漂移一致覆盖"]
    E --> F

关键设计

1. 交替多视自注意力主干:统一单视局部建模与跨视全局信息交换

面对大尺度室内稀疏全景,主干网络既要保持对高失真单张 ERP 全景图像局部纹理结构的表征能力,又要在不同房间、不同视点之间建立长程关联。传统方案往往引入复杂的多流网络或专门的 360 特征算子,增加了计算负担。CasaMaestro 坚持极简纯 Transformer 设计,仅通过在推理前向传播中重排 token 维度实现跨视角交互。对于 \(B\) 个样本、每样本 \(V\) 个视角、每视角 \(N\) 个 patch、维度为 \(D\) 的特征张量,在前 \(L_{\text{local}}\) 层,将视角维度折叠进 batch 维度(形状变为 \((BV) \times N \times D\)),执行标准单视图局部自注意力,确保浅层表征与单图基座预训练对齐;从 \(L_{\text{local}}\) 层开始,模型在局部注意力和全局跨视注意力之间交替,在全局步将张量展平为 \(B \times (VN) \times D\),让来自全部视角的 token 可以在标准自注意力中自由交互,零参数增加地注入全局上下文信息。

2. 跨视角位姿解码器:将全局几何对齐从稠密表征中显式解耦

如果在主干网络末端直接接简单线性层或独立 MLP 逐帧独立回归位姿(如 Depth Anything 3 的做法),会导致各视角的相机外参缺乏显式的全局约束。由于主干网络的核心任务是提取通用且精细的密集视觉特征以支撑深度预测,强行要求主干在单一向量中同时解决跨视角几何奇异性与位姿模糊,会损害局部密集深度精度。CasaMaestro 设计了一个专用的轻量级相机位姿解码头:首先将主干输出的顶层多视特征投影到维度 \(D\),经过残差 MLP(前向放大比率 \(r\))做单视角 token 提炼,随后在视角维度(长度为 \(V\))施加专门的多头跨视角自注意力模块。该模块显式聚焦于视点之间的全局刚体相对变换,最后分别通过两个线性头预测平移向量 \(\hat{t} \in \mathbb{R}^3\) 和四元数 \(\tilde{q} \in \mathbb{R}^4\),并通过显式 \(L_2\) 归一化输出合法旋转:

\[ \hat{q}_{b,v} = \frac{\tilde{q}_{b,v}}{\max(\|\tilde{q}_{b,v}\|_2, \epsilon)} \]

由于全景图水平视场固定为 360°、垂直视场固定为 180°,无需预测内参视角 FOV,位姿解码头输出直接构成标准相机外参,极大地简化了几何对齐流程。

3. ERP 等矩形投影旋转数据增强:严格保几何一致性的视角分布扩增

现有室内全景数据集中,同一房屋内的全景采集往往具有几乎相同的水平朝向(Yaw 差异极小),缺乏真实的任意相机旋转多样性,严重制约了模型在无约束视角下的泛化能力。CasaMaestro 提出了一种基于球面积分光线重映射的显式 ERP 旋转增强策略。该方法在合成场景中为每个视角独立采样偏航角 \(\psi \sim \mathcal{U}(0, \pi)\)、俯仰角 \(\theta\) 和翻滚角 \(\phi\)(截断高斯分布),构建旋转矩阵 \(R = R_z(\psi) R_y(\theta) R_x(\phi)\)。对尺寸为 \(H \times W\) 的目标全景,先将每个像素坐标 \((u, v)\) 映射到球面方向射线 \(d_{\text{out}}\),旋转至源坐标系 \(d_{\text{src}} = R d_{\text{out}}\),再反算回源全景像素坐标并执行双线性插值与水平周期性环绕采样。RGB 与真实度量深度图严格同步重映射,且相机外参矩阵 \(T_{c2w}\) 的旋转块同步右乘更新:

\[ R_{c2w} \leftarrow R_{c2w} R \]

该增强在严格保真 3D 几何与投影物理规律的前提下,为稀疏全景生成了丰富的多视位姿对,显著强化了跨视角姿态对齐网络对极端朝向变换的鲁棒性。

损失函数 / 训练策略

模型采用端到端联合训练策略,在 4 块 NVIDIA A100 GPU 上使用 Adam 优化器训练 20 个 epoch,学习率为 \(5\times 10^{-5}\),batch size 为 1,输入视角数量范围为 20 到 50 张。主干网络基于 Depth Anything 3 初始化。损失函数由多尺度深度预测损失 \(\mathcal{L}_{\text{depth}}\) 与相机位姿损失 \(\mathcal{L}_{\text{pose}}\) 联合构成:位姿损失结合了平移分量的 \(L_1\) 误差与单位四元数旋转几何测地误差。

实验关键数据

主实验

论文在真实世界室内场景数据集 Realsee-Real 与合成场景数据集 Realsee-Syn 上全面测试了相机位姿估计性能。指标包含阈值 10°/20°/30° 下的 AUC、平均旋转误差(Rot. Mean,单位:度)、平均平移误差(Trans. Mean,单位:厘米)以及综合位姿误差(Pose Mean)。

表 1: Realsee-Real 真实场景相机位姿估计对比(原论文 Table 1)

方法 AUC@10 ↑ AUC@20 ↑ AUC@30 ↑ 旋转平均误差 (°) ↓ 平移平均误差 (cm) ↓ 位姿平均误差 ↓
PanoPose* [32] 0.042 0.115 0.166 62.20 58.27 90.12
SPR* [46] 0.086 0.145 0.191 59.43 56.12 86.23
VGGT [37] 0.189 0.313 0.388 37.74 32.31 47.65
VGGT-Finetune* 0.276 0.379 0.411 30.12 10.23 38.42
PI3 [41] 0.222 0.365 0.450 26.69 25.48 36.61
PI3-Finetune* 0.301 0.397 0.510 21.36 7.442 28.97
DepthAnything3 [15] 0.083 0.173 0.235 54.57 49.79 69.51
InfiniteVGGT [44] 0.271 0.412 0.487 29.82 4.488 30.01
CasaMaestro (Ours) 0.727 0.859 0.903 2.608 2.132 3.225

注:* 表示在 Realsee 训练集微调或重新实现。在真实场景下,CasaMaestro 的 AUC@30 达到 0.903,较此前最优结果(0.510)大幅提升 77.1%(AUC30 相对增幅达 84%),旋转误差从 21.36° 降至 2.61°,平移误差降至 2.13 cm。

表 2: 未见数据集零样本度量深度估计对比(原论文 Table 4)

方法 Replica (AbsRel ↓) Replica (\(\delta_1\) ↑) PanoSUNCG (AbsRel ↓) PanoSUNCG (\(\delta_1\) ↑) HM3D (AbsRel ↓) HM3D (\(\delta_1\) ↑)
PanoFormer [29] (单视) 0.076 0.945 0.054 0.978 0.151 0.742
DA2 [13] (单视) 0.070 0.966 0.060 0.976 0.164 0.751
DAP [16] (单视) 0.124 0.878 0.130 0.841 0.143 0.749
PanoPose* [32] (多视) 0.116 0.937 0.094 0.955 0.215 0.708
CasaMaestro (Ours) 0.058 0.970 0.042 0.988 0.105 0.921

消融实验

论文系统分析了模型规模(DINO-Base 与 DINO-Large)、跨视位姿解码器(PoseDecOurs vs. 线性头 PoseDecLinear)以及 ERP 旋转数据增强(ERPAug)对位姿和深度估计指标的影响。

表 3: 核心组件消融实验(原论文 Table 5)

序号 主干规模 位姿解码器 ERP数据增强 AUC@10 ↑ AUC@30 ↑ 旋转误差 (°) ↓ 平移误差 (cm) ↓ AbsRel ↓ \(\delta_1\)
DINO-Base 线性解码头 0.302 0.568 24.39 17.85 0.092 0.920
DINO-Base 本文位姿解码器 0.629 0.831 3.192 2.834 0.077 0.939
DINO-Base 线性解码头 0.512 0.772 2.175 2.375 0.111 0.970
DINO-Base 本文位姿解码器 0.688 0.891 2.547 2.404 0.075 0.956
DINO-Large 线性解码头 0.297 0.598 24.41 16.32 0.077 0.939
DINO-Large 本文位姿解码器 0.707 0.871 2.102 2.175 0.076 0.973
DINO-Large 线性解码头 0.604 0.815 2.132 2.265 0.080 0.938
⑧ (全模型) DINO-Large 本文位姿解码器 0.792 0.927 1.553 1.682 0.078 0.975

关键发现

  • 跨视角位姿解码器的引入构成了位姿估计精度的决定性跃升:在 DINO-Base 下,对比 ① 和 ②,AUC@30 从 0.568 飙升至 0.831,旋转误差从 24.39° 剧降至 3.19°;训练损失收敛速度对比显示,带有跨视位姿解码器的模型仅需 3 个 epoch 即可达到线性解码头 10 个 epoch 以上的收敛水平。
  • 单纯堆叠主干参数量(从 Base 到 Large)在没有专门几何解码设计时对大位移位姿预测帮助极其有限(① 与 ⑤ 的 AUC@10 分别为 0.302 和 0.297),证明大基线稀疏位姿对齐瓶颈在于全局几何对齐机制本身,而非特征提取网络的参数规模。
  • ERP 旋转数据增强提供了至关重要的视角扰动正则化:在配备跨视位姿解码器的完整模型中(⑥ 对比 ⑧),AUC@30 进一步从 0.871 增至 0.927,旋转误差压低至 1.55°,且在未见数据集(HM3D/Replica)上表现出优异的零样本泛化能力。

亮点与洞察

  • 极简多视基座设计:不依赖针对全景投影设计的复杂变形卷积或多分支网络,仅通过对通用 DINOv2 在深层交替展平视角 token 序列,即以极低工程复杂度实现了跨视图大范围特征联动。
  • 解耦几何对齐的高效位姿头:避免了将全景大位移外参回归的沉重几何对齐压力强加于底层密集特征提取,通过一个极轻量的视角维注意力解码器,兼顾了精细的单视角深度图预测和全局自洽的外参估计。
  • 物理保真的 ERP 几何重映射增广:巧妙利用全景图球面射线与外参的刚体旋转数学对应关系,无需额外三维渲染即可高效生成任意视角朝向的多视真值对,解决了现有全景数据集偏航角单一的历史缺陷。

局限与展望

  • 动态物体与遮挡感知:当前假设室内场景处于完全静态,若场景中存在走动的人员或移动宠物,跨视角几何一致性假设会受到干扰;未来可引入运动分割掩码机制过滤动态伪影。
  • 极端光照与大盲区连通:对于跨楼层、极狭窄通道或门窗全闭的多房间场景,若视角间重叠过少(如隔门无视线直达),模型纯粹依赖视觉先验容易出现跨房间坐标系微小偏转;可结合室内拓扑平面图先验进一步加固全局一致性。

相关工作与启发

  • vs Depth Anything 3 / VGGT: 针孔视觉基座模型依赖高频密集视频流采集,在跨房间室内大尺度重建中因长序列误差累积容易发生灾难性漂移;CasaMaestro 表明利用全景宽视场可以以极少(20~50 张)的观测点实现更精准的房屋级度量几何重建。
  • vs PanoPose / SPR: 现有多视全景位姿估计网络高度依赖稠密视频帧与高视点重叠率,面对大位移稀疏跳跃采集直接崩溃;CasaMaestro 通过跨视角 Transformer 注意力机制彻底解除了对小基线连续运动的依赖。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首个面向房屋尺度、稀疏多视全景图的前馈无标定度量 3D 重建基座模型。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖真实与合成数据集上的位姿误差评估、跨三套未见数据集的零样本深度评测以及详实的模块消融。
  • 写作质量: ⭐⭐⭐⭐⭐ 动机阐述深刻,结构设计清晰精炼,图表逻辑完备。
  • 价值: ⭐⭐⭐⭐⭐ 为具身智能闭环仿真环境获取全屋尺度的高精度、高效率 3D 资产提供了极具实用价值的范式。