跳转至

AVSplat:Dense-View Feed-Forward 3D Gaussian Splatting with Assist-View Preconditioning

会议: ECCV 2026
论文: ECCV 原文
领域: 3D 视觉
关键词: 3D高斯泼溅, 前馈三维重建, 无位姿重建, 密集视角扩展, 体素融合

一句话总结

针对无位姿前馈 3D 高斯泼溅在密集视角输入下由于全局注意力弥散和体素均值融合导致的重建退化问题,AVSplat 提出了辅助视角预处理机制与占用率引导的自适应温度体素融合,成功恢复了视角数量增加时性能持续上升的正向缩放特性。

研究背景与动机

基于前馈几何基础模型(如 DUSt3R、MASt3R 与 VGGT)的无位姿 3D 高斯泼溅(3DGS)近年来取得了显著进展。不同于传统需要针对每个场景耗时数十分钟甚至数小时进行逐场景逆向优化的方法,前馈 3DGS 仅需一次网络前向推理即可联合预测相机内参、外参以及密集的 3D 高斯椭球体参数,实现了实时的全新视角合成。在直觉上,向模型提供更密集的输入图像应当提供更全面的几何遮挡约束与更丰富的外观纹理,从而单调提升三维重建质量。

然而现有的前馈框架(例如 AnySplat 等)在将输入从稀疏视点(3-16 视角)扩展到密集视点(32-72 视角)时,重建质量往往出现停滞甚至逆向退化。这种反常现象主要源于现有架构中两个关键阶段的固有缺陷:其一是基于 Transformer 的全局多视角特征聚合模块。在缺乏先验位姿的条件下,全局 Softmax 注意力需要在超长序列中寻找对应点。随着输入图像数量增加,无关候选 token 迅速膨胀,注意力分布变得极度平坦和弥散,使得真正具备共视几何约束的关键对应点权重被稀释,破坏了跨视角几何一致性。其二是高斯体素化融合阶段。为了消除冗余并降低光栅化负担,空间中落入同一体素内的多个高斯通常被直接执行加权平均。而在密集视角下,单个体素内的占用率急剧升高,均匀加权平均充当了低通滤波器,高频表面纹理和细微几何结构被大量弱置信度的高斯候选强行抹平。

为了打破这一瓶颈,本文的目标是让密集的额外输入视角成为增强几何与细节的有效信号,而非干扰项。核心 idea:在全局注意力计算之前为每个视点引入轻量级辅助视角预处理以注入紧致的共视场景上下文,并在高斯聚合阶段采用基于体素占用率与几何一致性的自适应温度融合机制,从聚合与表征两端彻底消除密集视角下的性能退化。

方法详解

整体框架

AVSplat 接收任意无校准、无位姿的多视角图像序列作为输入。首先通过几何感知编码器提取单张图像的局部 patch 嵌入和视角级全局描述符。在进入计算代价昂贵的多视角全局聚合之前,系统执行辅助视角预处理(Assist View Preconditioning, AVP):利用全局描述符与 token 级覆盖率目标,贪心挑选出少量互补且高相关的辅助视角,通过一次轻量级跨视角交互将场景上下文预先注入当前视点。随后,带有上下文先验的 token 被送入全局几何注意力层与解码器,预测出相机位姿、深度图以及稠密的 3D 高斯基元集合。最后,生成的 3D 高斯被送入占用率引导的体素融合(Occupancy-guided Voxel Fusion, OVF)模块:根据体素内的点云空间离散度和高斯占用数量动态调节 Softmax 锐化温度,过滤低权重离群点并融合出紧致的高精度高斯表征,经可微光栅化完成最终渲染。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}, 'subGraphTitleMargin': {'top': 8, 'bottom': 16}}}%%
flowchart TD
    A["输入未校准多视角图像序列"] --> B["几何感知特征提取<br/>Patch 嵌入与视角描述符"]
    B --> C["覆盖驱动的辅助视角选择<br/>相似度粗筛 + 覆盖率次模贪心"]
    C --> D["轻量级辅助视角预处理<br/>交叉注意力上下文注入与门控残差"]
    D --> E["全局多视角几何聚合与解码<br/>相机位姿、深度与高斯基元预测"]
    E --> F["自适应温度体素融合<br/>占用率调制与几何方差滤波"]
    F --> G["紧致 3D 高斯表征与可微光栅化渲染"]

关键设计

1. 辅助视角预处理:构建兼顾覆盖度与互补性的局部上下文以聚焦全局匹配

全局注意力在长序列下容易产生概率发散,导致匹配模糊。针对此问题,本文没有直接将全部 token 送入全局全连接注意力,而是在进入全局网络前为每个视点 \(s\) 精选出 \(K\) 个辅助视点构成集合 \(\mathcal{A}(s)\)(实验中 \(K=4\))。候选池首先通过视点全局均值嵌入 \(\mathbf{z}_s\) 与其他视点的余弦相似度选出 Top-\(M\) 个邻居 \(\mathcal{N}(s)\)。为了避免入选视角彼此雷同或无法完整覆盖参考视角的局部区域,本文定义了一个基于次模性(Submodular)的覆盖目标函数:

\[ F(\mathcal{A}) = \frac{1}{P}\sum_{p=1}^{P}\max_{t\in\mathcal{A}} s_{t,p} + \beta\,\frac{1}{K}\sum_{t\in\mathcal{A}} q_t - \lambda\,\frac{1}{K(K-1)}\sum_{t,u\in\mathcal{A}, t\neq u} m_{tu} \]

式中第一项衡量辅助集合对视点 \(s\) 中每个 patch token \(p\) 的最大投影特征相似度覆盖,第二项 \(q_t\) 评估辅助视点的特征方差置信度,第三项惩罚入选视点之间的成对冗余相似度。借助单调次模函数的贪心选择更新规则 \(\mathcal{A}_{k+1} = \mathcal{A}_k \cup \{\arg\max_{t} \Delta F(t \mid \mathcal{A}_k)\}\),以极低开销快速完成构建。确定辅助集后,当前视点通过单次交叉注意力交互提取辅助特征 \(\widetilde{\mathbf{X}}_s = \operatorname{softmax}\bigl(\frac{1}{\sqrt{d}}\mathbf{Q}_s \mathbf{K}_s^\top\bigr)\mathbf{V}_s\),并通过随训练步数动态递增的门控残差 \(\mathbf{X}_s^{\text{out}} = \mathbf{X}_s + \gamma(g)\widetilde{\mathbf{X}}_s\) 输出给全局注意力。该设计将搜索有效对应的负担前置,使全局注意力直接聚焦于几何兼容区域。

2. 占用率引导的体素融合:利用自适应温度与几何一致性保全密集高频细节

传统前馈 3DGS 将投影到同一体素 \(v\) 内的高斯候选集合 \(\mathcal{G}_v\) 执行简单加权平均,在密集视角导致高占用率(\(n_v\) 很大)时会造成明显的过度平滑。本文提出了占用率与空间一致性双重调制的自适应融合温度 \(\tau_v\)

\[ \tau_v = \operatorname{clip}\left(\tau_{\min}, \; \tau_0 \left(\frac{n_v}{n_{\mathrm{ref}}}\right)^{-\alpha} \psi_v, \; \tau_{\max}\right) \]

其中基准温度 \(\tau_0=0.7\),占用率调节指数 \(\alpha=0.5\),参考计数 \(n_{\mathrm{ref}}=8\)。几何一致性因子 \(\psi_v = \frac{1}{1 + \lambda \sigma_v^2}\) 由体素内点位坐标相对均值中心的空间离散方差 \(\sigma_v^2\) 确定。在占用率极高且点位紧密一致的区域,\(\tau_v\) 自动降温,经过 Softmax 权重计算 \(w_i = \frac{\exp(\tau_v c_i)}{\sum_j \exp(\tau_v c_j)}\) 后形成极为尖锐的权重分布,让置信度最高的高斯主导属性,保留微小纹理;而在稀疏视点或低占用区域,温度自动升高,呈现平缓融合以容纳多方视角互补。最后,对排序后的候选截取前 80% 累积质量截断低权离群值,融合出最终体素高斯特征 \(\mathbf{f}_v\) 与空间坐标 \(\mathbf{p}_v\)

损失函数 / 训练策略

模型在 DL3DV 数据集(超过 10,000 个真实复杂场景)上端到端训练。训练采用 AdamW 优化器,学习率设为 \(1\times 10^{-4}\),权重衰减为 \(5\times 10^{-2}\),使用 Cosine 退火调度与 2,000 步 warmup,总训练迭代步数为 40,000 步。在单张 NVIDIA A100 (80GB) 上以批大小 1 运行,并开启激活值检查点(Activation Checkpointing)与混合精度训练。每个训练批次随机采样 4 到 24 个输入视角。在前 1,500 步训练中冻结辅助视点分支的梯度更新,辅助视角融合门控因子 \(\gamma(g)\) 在 2,000 步后经 8,000 步从 0 线性上升至 1,以确保全局网络与辅助先验平稳对齐。

实验关键数据

主实验

论文在 Mip-NeRF 360、VR-NeRF 以及包含 140 个场景的 DL3DV 测试集上全面对比了主流前馈方法(包括 NoPoSplat、FLARE 与 AnySplat)。在密集输入设置(32、48、64 视角)下,基线方法如 NoPoSplat 和 FLARE 均由于显存溢出(OOM)无法运行,AVSplat 则保持了优异的渲染精度和鲁棒的缩放特性。

表 1:密集视角输入下全新视角合成量化对比(摘自原文 Table 1)

数据集 视角数 指标 AnySplat (基线) AVSplat (本文) 相对增益 / 趋势
DL3DV 32 views PSNR (dB) ↑ / SSIM ↑ / LPIPS ↓ 21.05 / 0.680 / 0.284 21.54 / 0.710 / 0.266 +0.49 dB / SSIM +0.030
DL3DV 48 views PSNR (dB) ↑ / SSIM ↑ / LPIPS ↓ 21.04 / 0.678 / 0.281 21.60 / 0.713 / 0.265 +0.56 dB / 持续上升
DL3DV 64 views PSNR (dB) ↑ / SSIM ↑ / LPIPS ↓ 21.14 / 0.684 / 0.282 21.67 / 0.717 / 0.265 +0.53 dB / 无密集退化
Mip-NeRF 360 32 views PSNR (dB) ↑ / SSIM ↑ / LPIPS ↓ 18.22 / 0.445 / 0.369 18.71 / 0.483 / 0.365 +0.49 dB / SSIM +0.038
Mip-NeRF 360 64 views PSNR (dB) ↑ / SSIM ↑ / LPIPS ↓ 19.23 / 0.500 / 0.365 20.11 / 0.528 / 0.366 +0.88 dB / SSIM +0.028
VR-NeRF 64 views PSNR (dB) ↑ / SSIM ↑ / LPIPS ↓ 21.26 / 0.719 / 0.350 21.70 / 0.723 / 0.363 +0.44 dB

消融实验

论文在 DL3DV 64 视角设定下分析了两个核心模块的具体贡献。

表 2:DL3DV 64 视角输入下的模块消融分析(摘自原文 Table 2)

配置方案 PSNR (dB) ↑ SSIM ↑ LPIPS ↓ 核心作用说明
Baseline (AnySplat 架构基线) 21.14 0.684 0.282 密集输入下注意力分散且体素过度平滑
+ Fusion only (仅加入占用率引导体素融合) 21.57 0.692 0.272 贡献主要单点画质增益(PSNR +0.43 dB)
+ Assist + Fusion (完整 AVSplat 模型) 21.67 0.717 0.265 进一步提升结构感知与极长序列下的稳定性

表 3:全局注意力诊断与重叠压力测试(摘自原文 Table 3)

测试项目 评测指标 / 视角条件 AnySplat (基线) AVSplat (本文) 诊断结论
注意力质量 (16 视角) 归一化熵 (Entropy) ↓ 0.693 0.642 注意力分布更加收敛聚焦
注意力质量 (16 视角) 极线带能量占比 (GeoMass@1patch) ↑ 0.286 0.374 几何匹配相容区域能量提升 30.8%
ACID 重叠压力测试 PSNR @ 48 views (dB) ↑ 23.12 23.15 视点高度重叠场景基准性能一致
ACID 重叠压力测试 PSNR @ 72 views (dB) ↑ 22.45 23.24 基线大幅衰退 0.67 dB,本文反向提升 0.09 dB

关键发现

  • 分工明确的双模块驱动:消融实验揭示,占用率引导体素融合(OVF)贡献了 64 视角下单点图像质量提升的大部分(PSNR 从 21.14 dB 提升至 21.57 dB),而辅助视角预处理(AVP)则负责拉直注意力发散的根因,主导密集视角扩展的稳定性。
  • 逆转密集视角退化诅咒:在 ACID 数据集的极端视角重叠测试中,随着视点数由 48 增加至 72,AnySplat 的 PSNR 从 23.12 dB 骤跌至 22.45 dB(衰减 0.67 dB),而 AVSplat 逆势上升至 23.24 dB,在 72 视角下形成了 0.79 dB 的明显优势。
  • 注意力集中度显著增强:几何相容极线带上的注意力能量(GeoMass@1patch)从 0.286 提高到 0.374,相对增益达到 30.8%,相当于随机基准带的 3.7 倍集中度。

亮点与洞察

  • 次模贪心辅助视角选择:利用单调次模函数的贪心更新机制兼顾局部 token 特征覆盖度与视点间多样性,巧妙以近乎线性的小常数开销锁定了最具互补信息的辅助视角集合。
  • 自适应温度调控高斯归属:将热力学温度概念引入体素合并过程,把体素点云方差与高斯计数反比例映射到锐化指数,优雅解决了密集视角下均值模糊与离群噪点难以权衡的问题。
  • 前馈 3D 重建的“预处理分治”思想:证明了在长序列 Transformer 架构中,不必盲目扩展全局全注意力层,通过前置轻量局部视角交互能以更小计算量显著抑制注意力稀释。

局限与展望

  • 稀疏视角下的预处理收益有限:由于 AVP 依赖至少数个高质量候选视角构建互补集,在输入仅有 3-4 张稀疏视点时无法形成有效的辅助集合,文中在此阶段只得被迫禁用 AVP。
  • 静态体素网格分辨率约束:当前的自适应融合仍然建立在固定尺寸的空间体素网格上,对于大场景跨尺度视角(极远景与超近景穿插)难以动态自适应调整体素粒度。
  • 改进方向:探索与层次化八叉树或无网格近邻图结构结合的连续自适应高斯聚类机制,并将辅助视角选择拓展为端到端可学习的动态拓扑路由。

相关工作与启发

  • vs AnySplat: AnySplat 开创了利用类 VGGT 架构进行无位姿前馈 3DGS 重建的先河,但在密集视点下遭遇注意力弥散与体素均值平滑的双重退化;AVSplat 精准针对这两处结构缺陷提出 AVP 与 OVF,在相同算力与内存规模下首次实现了密集视角正向收益。
  • vs NoPoSplat / FLARE: NoPoSplat 与 FLARE 主要面向稀疏视点(3-16 视角),在拓展至 32 视角以上时均发生严重的显存溢出(OOM);AVSplat 的设计天然适应超多视角长序列,展现出良好的工程落地拓展性。
  • vs ZPressor: ZPressor 通过显式瓶颈压缩跨视角特征以支撑 100+ 视角输入;AVSplat 则通过输入端上下文预注入和输出端体素自适应锐化保留高频细节,两者在超密集视角重建中具有极佳的互补潜力。

评分

  • 新颖性: ⭐⭐⭐⭐ [针对前馈 3DGS 密集视角退化病灶提出的 AVP 与自适应温度体素融合方案立意深刻且构思精巧]
  • 实验充分度: ⭐⭐⭐⭐⭐ [覆盖三大基准评测、消融实验、跨视角注意力熵与极线能量诊断,以及高密度重叠压力测试]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑层层递进,对退化机理的剖析透彻,公式表达规范且图表传达清晰]
  • 价值: ⭐⭐⭐⭐ [解决了前馈 3DGS 迈向实用密集照片重建时的核心扩展瓶颈,对长序列几何注意力设计有广泛参考意义]