跳转至

Latent Fusion: Decoding Consolidated 3D Geometry from Feed-forward Geometry Transformer Latents

会议: ECCV 2026
论文: ECCV 官方页面
代码: https://lorafib.github.io/fus3d/
领域: 3D 视觉
关键词: 几何变换器、有向距离场(SDF)、体素查询、前馈3D重建、多视角特征融合

一句话总结

本文提出 Fus3D,抛弃了传统几何变换器“逐图预测再后验融合”的范式,直接利用可学习规范化体素查询从前馈几何变换器(VGGT)的中间多视角隐空间中交替 cross/self-attention 聚合 3D 几何特征并回归稠密 SDF,实现了无需位姿、无累积噪声且未观测面几何补全优异的单次前馈重建。

研究背景与动机

从无序多视角图像或稀疏视频中重建高质量三维几何是机器人空间感知、场景交互及语义理解的核心基石。近年来以 DUSt3R、VGGT 和 DA3 为代表的前馈多视角几何变换器(Feed-Forward Geometry Transformers, FFGT)取得了突破性进展,模型通过大规模预训练习得了极其强大的全局空间与几何先验,能够摆脱传统特征匹配与相机标定的严苛约束,直接单次前馈预测每张图的深度、点图以及相机参数。

然而,现存前馈几何方法在组装完整三维场景时存在一个根本性的架构瓶颈:它们普遍依赖“先逐视角预测、再后验融合”(Predict-then-fuse)的二阶段模式,即先由 2D 解码头输出单视角点云或深度图,再通过 TSDF 融合或泊松重建拼成 3D 网架。这种解耦设计导致了两个对称的双向缺陷:在稀疏视角输入时,变换器学到的跨视角全局几何先验被局限在各个局部单视角平面内,未观测区域完全缺失几何约束,使得后验融合留下大面积孔洞;而在密集多视角输入时,各视角间微小的几何预测不一致性会在几何融合空间中累积放大,引入高频噪声,严重削弱表面重建保真度。

解决此矛盾的切入点在于重新审视几何变换器的中间表征:FFGT 的多层帧间交互实际上已经建立起了极其丰富的联合三维世界表征,只因在最终环节强行路由到 2D 预测头而被丢弃。本文的核心 idea 是跳过逐视角预测与后向几何拼合,设计位置条件化的规范体素查询直接深入几何变换器的中间隐空间,通过交替跨注意力与自注意力将 2D 多视角特征提升为稠密 3D 体素隐网格,并前馈回归连续有向距离场(SDF)。

方法详解

整体框架

Fus3D 的整体流水线包含三个紧密协作的阶段:首先利用多视角几何变换器主干(VGGT)提取未校准输入图像的多层 2D 联合几何特征;随后通过 3D 提取变换器(Extraction Transformer, E)引入位置条件化的规范嵌入作为体素查询,交替执行 2D-to-3D 跨注意力与 3D 体素自注意力,分级吸收多视角多层次特征;最后由三维卷积解码头(\(H_{3D}\))将聚合完成的结构化体网格直接映射为稠密有向距离场(SDF)。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["多视角无位姿图像集合"] --> B["多视角几何变换器主干<br/>VGGT提取多阶段2D中间特征"]
    C["3D位置条件化规范嵌入<br/>16³体素网格空间坐标注入"] --> D["交替跨注意力与自注意力<br/>2D-to-3D特征提升与空间扩散"]
    B --> D
    D --> E["稠密三维体素隐网格<br/>聚合完整全局几何先验"]
    E --> F["轻量卷积解码头<br/>上采样输出64³高保真SDF"]
    F --> G["有效性感知SDF监督<br/>屏蔽非水密缺陷与符号翻转"]
    G --> H["最终稠密3D几何表面"]

关键设计

1. 3D位置条件化规范嵌入:跨越二维到三维的维度鸿沟 前馈多视角变换器的输出是平铺的 2D patch token 序列,而目标几何重建是三维空间场,直接将非结构化 2D 隐特征映射到 3D 网格极易导致空间错位或过拟合。Fus3D 借鉴神经连续空间记忆的思想,引入一组与场景图像无关的可学习规范嵌入 \(z_{3D}\)(空间分辨率为 \(16^3\),特征通道 \(d=2048\)),并将这 \(16^3\) 个体素在其所在空间包围域 \(\Omega\) 内的三维中心坐标线性投影后加权注入。该规范嵌入构成了初始三维记忆状态,为后续无投影(projection-free)的注意力聚合提供了固定的世界坐标空间锚点,摆脱了对相机内参及显式反投影射线采样的依赖。

2. 交替跨注意力与自注意力:渐进式多尺度特征提升 为将主干模型不同深度的几何抽象完整吸纳进 3D 隐空间,3D 提取变换器 \(E\) 采用多阶段交错堆叠结构。以规范体素嵌入作为 Query,以 VGGT 骨干网第 \(b\) 个中间阶段提取的 2D 图像特征 \(z^{2D}_b\)(共 4 个阶段)作为 Key 和 Value,首先通过 2D-to-3D 跨注意力(Cross-Attention)让每个空间体素自适应聚焦在所有视角中最具几何贡献的图像补丁;紧接着通过 3D 全局自注意力(Self-Attention)将局部更新信息在整个三维体素网格内进行空间扩散与一致性平滑。这 4 个层级的特征注入完整重复 2 轮,构建了共 8 个变换器模块构成的提取流,使最终的隐特征 \(\hat{z}_{3D}\) 充分凝聚了物体的对称性、类别先验与遮挡区域的连贯填充结构。

3. 轻量卷积解码头与尺度自适应域选择:高效回归稠密距离场 在获得 \(16^3 \times 2048\) 的结构化三维隐网格 \(\hat{z}_{3D}\) 后,Fus3D 采用全卷积上采样解码器 \(H_{3D}\) 将特征分辨率从 \(16^3\) 逐步上采样映射至 \(64^3\) 的稠密 SDF 网格 \(\hat{f}_{X_\Omega}\)。与传统隐式神经表示依赖坐标级 MLP 逐点密集查询不同,体素卷积解码能够极大地保持局部空间拓扑的连贯性,并在不到 3 秒内直接完成全场推理。此外,针对任意兴趣区域(ROI),模型通过调整输入体素坐标的缩放与平移,衍生出可变域版本 Fus3D+,实现了对局部细节或变尺度物体的任意空间裁剪与聚焦重构。

4. 有效性感知SDF监督:抵御非水密与局部不可见数据缺陷 在实际大规模 3D 数据集(如 Objaverse 和 DTU)中,许多网格存在内部中空、自交或非水密(non-watertight)开口缺陷,导致网格内外符号难以界定,直接施加经典 SDF 损失会产生灾难性的虚假符号翻转。Fus3D 设计了有效性掩码 \(M_{val}\) 与 Eikonal 掩码 \(M_{eik}\):\(M_{val}\) 识别真值 SDF 明确可靠的区域;\(M_{eik}\) 则直接在真值场上计算 Eikonal 正则,凡是梯度幅值严重偏离 1 的区域均被判定为符号混乱区。在 \(M_{eik}\) 之外,损失函数平滑退化为无向距离损失(Unsigned Distance Loss),从而只惩罚距离绝对值偏差而不强加符号监督,极具鲁棒性地解锁了海量非水密 CAD 资产的监督潜力。

损失函数 / 训练策略

模型综合采用二阶段训练策略。第一阶段在低分辨率(\(16^3\))下使用单层线性解码器预热,仅由基础 SDF 距离损失 \(\mathcal{L}_{SDF}\) 与 VGGT 自带的相机位姿损失 \(\mathcal{L}_{cam}\) 监督;第二阶段接入完整卷积解码头 \(H_{3D}\),联合全网格与表面采样点进行全局高分辨率回归:

\[\mathcal{L}_{tot} = \lambda_s \mathcal{L}_{SDF}(X_S) + \mathcal{L}_{SDF}(X_\Omega) + \lambda_\nabla \mathcal{L}_{\nabla}(X_\Omega) + \lambda_{eik} \mathcal{L}_{eik}(X_\Omega) + \lambda_{cam} \mathcal{L}_{cam}\]

其中 \(X_S\) 为在物体几何边界 \(\partial S\) 附近采样的密集点集,\(X_\Omega\) 为三维规则网格中心点。损失项包括真值适配的加权 L1 距离损失、空间有限差分梯度损失 \(\mathcal{L}_\nabla\) 以及 Eikonal 正则项 \(\mathcal{L}_{eik}\)。优化器采用 AdamW,辅以余弦学习率衰减与轻量级 LoRA 骨干微调。

实验关键数据

主实验

在 DTU 数据集的前馈无位姿评估中,Fus3D 与代表性泛化隐式 SDF 方法(VolRecon、UFORecon,均由 VGGT 预测姿态驱动)进行了严谨对比。实验划分了视角重叠充分的有利视角组(Favorable: 23, 24, 33)和基线极宽、重叠极小的严苛视角组(Unfavorable: 1, 16, 36)。

方法 相机姿态来源 有利配置 \(CD \downarrow\) 有利配置 \(D_{GT \to P} \downarrow\) 有利配置 \(D_{P \to GT} \downarrow\) 严苛配置 \(CD \downarrow\) 严苛配置 \(D_{GT \to P} \downarrow\) 严苛配置 \(D_{P \to GT} \downarrow\)
VolRecon COLMAP (†) 2.905 2.331 3.478 5.781 3.811 7.751
UFORecon COLMAP (†) 2.771 2.101 3.440 3.275 2.252 4.298
VolRecon 预测姿态(前馈) 3.678 3.369 3.987 8.878 5.869 11.887
UFORecon 预测姿态(前馈) 3.415 2.989 3.841 4.942 3.737 6.146
Fus3D (本文) 无需姿态(端到端) 2.432 1.804 3.059 3.525 2.814 4.236

在 Objaverse 测试集(170 个未见场景,输入视角数为 8)上,将 Fus3D 与微调后的 VGGT 配合后验融合方案(TSDF 融合与 Poisson 重建)进行定量比较:

方法 \(F_\epsilon \uparrow\) \(F_{0.5\epsilon} \uparrow\) \(CD \downarrow\) \(EMD \downarrow\) \(SDF_{MAE} \downarrow\)
Fus3D (本文) 0.83 0.51 0.021 0.019 0.004
\(\text{VGGT}_{ft} + \text{TSDF}\) 0.80 0.43 0.022 0.014 0.023
\(\text{VGGT}_{ft} + \text{Poisson}\) 0.70 0.38 0.044 0.052 –
\(\text{VGGT (原始)} + \text{TSDF}\) 0.35 0.12 0.080 0.082 0.136
\(\text{VGGT (原始)} + \text{Poisson}\) 0.29 0.10 0.121 0.788 –

消融实验

针对空间查询机制及可变视域域选择(Variable \(\Omega\) 与 Default \(\Omega\))的消融分析如下:

配置 可变域 \(F_{0.5\epsilon} \uparrow\) 可变域 \(CD \downarrow\) 默认域 \(F_{0.5\epsilon} \uparrow\) 默认域 \(CD \downarrow\) 说明
Fus3D+ (完整空间查询) 0.281 0.018 0.467 0.021 可学习规范嵌入 + 3D位置编码
Fus3D+ w/o Q (仅线性位置) 0.274 0.021 0.466 0.022 去除可学习嵌入,仅保留线性坐标映射

关键发现

  • 在 DTU 严格前馈姿态未知评估中,Fus3D 的 Chamfer Distance 相比 UFORecon 提升了 28.7%(有利组 2.432 vs 3.415)并在严苛跨视角组提升了 28.6%(3.525 vs 4.942),甚至逼近了依赖离线 COLMAP 姿态的 UFORecon(3.275),证明端到端隐空间提升能极大弥补缺少标定参数的短板。
  • 在 Objaverse 的连续视角缩放实验中,Fus3D 展现出极佳的扩展性:在 2 个稀疏视角下凭借骨干网几何先验生成完整闭合表面;在 24 个密集视角下不仅没有像 TSDF 融合基线那样因微小多视角误差累加而劣化,指标反而单调上升,且 \(SDF_{MAE}\) 误差仅为 TSDF 的 17.4%(0.004 vs 0.023)。
  • 对提取所得特征 \(\hat{z}_{3D}\) 进行 PCA 分析发现,前几个主要成分不仅沿三维空间平滑过渡并精确追踪 SDF 零等值面,还在同类别资产(如汽车、人体)间呈现出明显的跨物体语义部件对齐性。

亮点与洞察

  • 范式颠覆(Paradigm Shift):精准指出了前馈几何模型中“预测-融合”范式所固有的稀疏截断与误差累积双重痛点,确立了从 2D 多视角变换器隐层直接抽取结构化三维场的纯前馈路线。
  • 无需投影几何映射(Projection-free 2D-to-3D Lifting):巧妙使用 3D 坐标初始化的规范体素记忆结合交替注意力,绕过了传统显式投影射线采样的计算开销与标定误差敏感性。
  • 有效性解耦监督技巧:通过局部真值 Eikonal 项自动构造动态平滑掩码,在有缺陷的开放网格上平滑切换至无向距离监督,极大拓展了真实世界非水密网格训练的包容度。

局限与展望

  • 输出网格分辨率受限:受制于稠密三维体素网格的显存消耗,\(64^3\) 的分辨率导致极微小的几何高频雕刻细节容易被过度平滑,未来可引入八叉树、稀疏哈希体素或多尺度金字塔解码器。
  • 全局视域先验假设:规范体素网格需大致预设目标物体的三维包围框空间范畴,虽然 Fus3D+ 探索了可变域裁剪查询,但在无限大复杂室内外大场景下的无界延展性仍待进一步检验。
  • 主干单向抽取未闭环:当前提取变换器仅作为只读消费者从冻结/微调的 VGGT 中提取特征,未来若将 3D 空间状态反向反馈给 2D 主干,有望形成更强大的交互式时空持续三维感知流。

相关工作与启发

  • vs VGGT / DUSt3R: 后者均在二维图像平铺层级分别预测深度、点云和位姿,必须依赖外挂的 TSDF 或 Poisson 进行物理拼合;Fus3D 则将 VGGT 视为纯粹的特征抽取器,所有 3D 表面由隐式体素直接解码,彻底根除了后验拼接导致的开洞与累积噪点。
  • vs VolRecon / UFORecon: 两者均依赖精确的已知相机内外部参数来构造 3D 代价体(Cost Volume);Fus3D 是完全无需测试时相机位姿的端到端单次前馈架构,且重建速度提升数倍。
  • vs LRM / MeshLRM: 传统三维大模型多采用 3D-to-3D 预训练自编码器构建三维空间,高度依赖昂贵的真值 3D 数据集输入;Fus3D 直接将大规模 2D 几何预训练先验转移至 3D 空间,显著降低了数据壁垒。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次打破几何变换器 2D 预测头加后验融合的常规,提出规范体素查询的直接前馈 3D SDF 抽取范式。
  • 实验充分度: ⭐⭐⭐⭐☆ 覆盖 DTU、Objaverse 双基准,兼顾严苛视角、连续视角缩放曲线及隐空间 PCA 几何可解释性探测。
  • 写作质量: ⭐⭐⭐⭐⭐ 动机阐述极具说服力,架构图清晰连贯,对传统 TSDF 误差的数学机理解析透彻。
  • 价值: ⭐⭐⭐⭐⭐ 为前馈大模型通往真正原生、连续、无缝的三维空间表征提供了极具前景的架构指引。