跳转至

InceptionGS: Generative Bootstrapping for Large-Scale Gaussian Splatting under Unstructured View Sampling

会议: ECCV 2026
论文: ECCV 2026 Poster
领域: 3D视觉
关键词: 大规模场景重建, 3D高斯泼溅, 非结构化视角采样, 生成引导与自举, 几何条件扩散模型

一句话总结

针对真实大规模场景采集存在的视角非结构化与局部观测稀缺问题,InceptionGS 将 PGSR 的 G-buffer 几何特征引入条件扩散模型构建场景自适应生成先验,并通过可靠光度融合与朗之万动力学重要性采样软性自举优化 3DGS 场,在无额外真实采集的前提下显著消除大视角伪影并降低 32% 的 FID。

研究背景与动机

构建大规模真实场景的高质量数字化 3D 资产,是虚拟现实、电影工业与游戏制作的关键基石。用户期望能够以任意视角和尺度穿梭于地标级大场景中,获得沉浸且物理一致的漫游体验。然而,真实大规模场景的采集极易陷入“非结构化视角采样”(unstructured view sampling)的困境:一方面,受限于地形几何与拍摄轨迹,相机运动往往极其复杂且视角密度高度非均匀,宏观全局与近景细节交替穿插;另一方面,由于场景体量庞大、采集成本高昂或局部可达性受限,完全各向同性地覆盖每个死角几乎是不可能的。这导致场景大部分区域覆盖充足,但在特定视角或结构转角处不可避免地存在严重的视角匮乏。

面对这种非结构化采样分布,现有的两大范式均表现出明显的脆弱性。传统的基于重建的新视角合成(如 3D Gaussian Splatting 及其变体)高度依赖密集的重叠观测,一旦漫游视角偏离训练轨迹,渲染质量便急剧崩塌,产生大量的模糊、空洞与针状拉伸伪影,而针对大场景补充物理采集在实际工程中极为繁琐耗时。另一侧,基于生成的先验修复方法(如条件图像或视频扩散模型)尝试借助大规模网络数据补全未知视角,但通用扩散模型极难泛化至复杂的大规模真实地标(如蜿蜒的长城或具有繁复斗拱挑檐的传统古建),且以低质量伪影 RGB 或 Plücker 射线编码为条件难以维持严苛的长期 3D 几何一致性,极易滋生结构漂移与外观幻觉。

重建能提供与场景绑定的真实几何骨架,而生成能提供富有真实质感的高频外观统计,二者天然互补。本文的核心切入点在于打通重建与生成的正向自举闭环:不再直接在带有严重伪影的低质 RGB 渲染上修图,而是从更鲁棒、满足平面正则化的几何表面切入,让扩散模型自适应学习该场景局部的几何-外观对应规律,再反向将生成结果平滑融入 3DGS 优化。核心 idea:将几何重建与扩散生成相互嵌套自举,利用初始高斯重构的动态几何缓存(法线、不透明度与多分辨率哈希特征)微调场景自适应扩散先验,并在视角空间借助光度融合与朗之万重要性采样实现软性伪视角引导,达成大场景 3DGS 的无缝自我进化。

方法详解

整体框架

InceptionGS 的整体架构由两个核心阶段构成:第一阶段为“场景自适应生成(Generative Adaptation)”,在利用带平面正则约束的 3DGS(基于 PGSR)对多视角图像进行初始优化的同时,动态光栅化几何缓存(法线图、不透明度掩码和多分辨率哈希特征图),作为 ControlNet 的条件输入微调预训练隐扩散模型(LDM),学习该特定大场景的局部几何-外观对应统计分布;第二阶段为“高斯场自举(Gaussian Bootstrapping)”,针对产生渲染伪影的目标视角,通过近邻视角位姿插值生成候选虚拟视角集合,在虚拟视角上利用可靠投影光度线索对扩散生成图像进行置信度融合,并采用基于朗之万蒙特卡洛(LMC)的视角空间重要性采样动态调度虚拟视角监督,软性更新 3DGS 场。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["多视角图像输入<br/>非结构化稀疏采样"] --> B["阶段1:几何感知扩散微调<br/>动态G-buffer光栅化 + ControlNet联合优化"]
    B --> C["阶段2:候选虚拟视角生成<br/>位姿聚类检索 + 四元数球面插值"]
    C --> D["阶段3:可靠光度融合<br/>深度投影变形 + 置信度阈值掩码补全"]
    D --> E["阶段4:视角空间重要性采样<br/>LMC后验能量引导 + 动态软性更新3DGS"]
    E --> F["高保真完整3DGS大场景输出"]

关键设计

1. 几何感知扩散微调:利用动态 G-buffer 建立精准的几何-外观对应映射

直接以含有严重伪影的 3DGS 渲染 RGB 作为扩散修复的条件,不仅会导致扩散模型将伪影视作真实纹理,更无法保证跨视角一致性。相比极其敏感的外观纹理,场景几何具有天然的 3D 刚性一致性,且在平面正则约束下更为平滑鲁棒。InceptionGS 基于 PGSR 构建基础场,将每个高斯椭球体局部扁平化为平面,并通过单视角法线平滑、归一化互相关(NCC)光度一致性与多视角几何重投影约束构建高质量表面。在优化过程中,实时动态光栅化三组几何流形表征构成 G-buffer 条件 \(R = (N, O, F) \in \mathbb{R}^{H \times W \times (3 + 1 + Z)}\):渲染平面法线图 \(N\)、前景累积不透明度掩码 \(O\),以及引入的可学习多分辨率表面感知哈希特征图 \(F\)。利用局部图像块 \(\hat{I}\) 及其对齐的几何块 \(\hat{R}\) 微调预训练 LDM 的 ControlNet 参数 \(\theta\),令去噪网络在共享卷积核的局部自相似性驱动下学习该场景特有的纹理分布: $$ \mathcal{L}{D} = \mathbb{E}) - \epsilon|_2^2\right] $$ 其中 }\left[|\epsilon_{\theta}(z_t, t, \hat{R\(z_t\) 为潜变量加噪状态。在全图推理时,采用 MultiDiffusion 滑动窗口融合各扩散轨迹,确保生成的高分辨率图像 \(I^* = \mathcal{D}(z_0^*)\) 既贴合底层表面几何,又具备逼真的局部材质。

2. 候选虚拟视角生成:基于空间邻近度与四元数插值的伪视角轨迹构建

为了消除视场严重受限区域的浮空与模糊,不能仅仅对孤立的目标错误视角做单点修复,否则极易陷入局部过拟合破坏 3D 连贯性。对于检测到或指定的瑕疵目标视角 \(j^\star\),InceptionGS 在相机中心与光轴朝向构成的混合度量空间中,检索出 \(K\) 个最近邻的真实训练相机视角 \(V_{\text{src}}^{(j^\star)}\)。接着,在目标视角 \(j^\star\) 与每个近邻视角 \(i \in V_{\text{src}}^{(j^\star)}\) 之间,对相机中心执行线性位姿插值,对旋转姿态执行四元数球面线性插值(SLERP): $$ V_{\text{vrt}} = \left{\text{interp}(j^\star, i, l) \mid i \in V_{\text{src}}^{(j^\star)}, l \in [L]\right} $$ 由此在 3D 空间中离散采样出 \(|V_{\text{vrt}}| = LK\) 个沿相机视线平滑过渡的候选虚拟视角点集,为后续高斯场的空间平滑自举修复搭建稳定的几何支撑轨迹。

3. 可靠光度融合:利用真实观测线索与置信掩码修正高频生成偏移

虽然条件扩散模型能够补全合理的宏观结构,但在 VAE 编解码及潜空间去噪过程中,仍不可避免地存在域偏移和高频真实纹理细节模糊的问题。如果直接将纯生成图像作为伪真值注入重建,会抹杀真实采集的精细高频信号。InceptionGS 引入基于图像的局部变形融合机制:在虚拟视角 \(j \in V_{\text{vrt}}\) 下,利用初始几何深度图将近邻真实观测图像 \(\{I_i\}\) 重投影并变形至该视角得到 \(\{I_{i \to j}\}\),并结合视线可见性与深度遮挡距离设置保守阈值 \(\delta\) 计算混合权重 \(W_{i \to j}\),聚合得到具备真实高频纹理的混合投影图像 \(\widetilde{I}_j = \sum_{i} W_{i \to j} I_{i \to j}\)。随后,构造可靠性二值掩码 \(M\),将可信投影区域保留,仅将无可靠观测或发生遮挡的空缺区域由扩散生成图像 \(I^*_j\) 补齐: $$ I^{}_{j} \leftarrow M \circ \widetilde{I}_j + (\mathbf{1} - M) \circ I^{}_{j} $$ 融合后的参考图既继承了真实影像的像素级高频细节,又借助生成先验完成了未知死角的逼真填充。

4. 视角空间重要性采样:基于朗之万蒙特卡洛(LMC)的自适应软性平衡机制

若对候选集 \(V_{\text{vrt}}\) 内的所有虚拟视角一刀切地执行强监督更新,极易导致生成先验过度暴露,干扰甚至破坏原有已充分收敛的高质量重建区域。InceptionGS 设计了基于朗之万动力学(LMC)的自适应重要性采样算法。将当前 3DGS 渲染图像 \(C_q\) 与融合生成图像 \(I^*_q\) 之间的 \(L_1\) 偏差建模为后验分布能量项 \(P = \exp(\|C_q - I^*_q\|_1)\)。相机姿态向量 \(v \in \mathbb{R}^7\)(由平移与四元数构成)在随机热噪声 \(\eta \sim \mathcal{N}(0, 1)\) 与后验对数梯度的联合驱动下沿能量流向更新: $$ \hat{v}{\tau+1} = v\tau + a \nabla_{v_\tau} \log P + b \eta $$ 由于预先渲染并缓存了 \(V_{\text{vrt}}\) 上的生成参考图像,算法将连续更新的 \(\hat{v}_{\tau+1}\) 离散量化为 \(V_{\text{vrt}}\) 中欧氏距离最近的视角 \(q\),在此视角下反向传播损失更新高斯场参数。该策略使得优化自适应地聚焦于“当前重建与生成先验冲突最大、信息量最丰富”的区域,而在已良好吻合的视角平稳收敛。

损失函数 / 训练策略

在第一阶段(生成微调),3DGS 几何场与 ControlNet 联合优化,总目标包含 3DGS 渲染损失 \(\mathcal{L}_C = (1-\lambda_1)\mathcal{L}_1 + \lambda_1 \mathcal{L}_{\text{D-SSIM}}\)、PGSR 几何正则化项 \(\mathcal{L}_G = \lambda_{SV}\mathcal{L}_{SV} + \lambda_{MVC}\mathcal{L}_{MVC} + \lambda_{MVG}\mathcal{L}_{MVG}\),以及 ControlNet 的扩散去噪损失 \(\mathcal{L}_D\)

在第二阶段(自举更新),针对自适应选中的虚拟视角 \(j\),采用两段式自适应光度/感知混合损失: $$ \mathcal{L}P^{(j)} = \begin{cases} \lambda_2 \mathcal{L}(C_j, I^}j), & \text{if } \mathcal{L}(C_j, I^}_j) \le \tau \ \lambda_1 \mathcal{L}_1(C_j, I^j) + \lambda_2 \mathcal{L}(C_j, I^}_j), & \text{otherwise} \end{cases} $$ 当 3DGS 渲染与生成图像的结构相似性损失低于门限 \(\tau\) 时,切换至高阶感知监督(LPIPS),防止刚性像素损失带来的模糊模糊效应;当结构差异较大时则以像素与结构重建损失为主,确保宏观对齐。整个过程支持多轮迭代自举(Iterative Bootstrapping),针对不同缺陷区域逐步修复。

实验关键数据

主实验

评估在具有挑战性的大规模场景数据集 GigaNVS 以及经典数据集 MipNeRF360 上进行。通过最远点采样将视点聚为 6 类,随机选出一类并留出 90% 的视点作为非结构化稀疏缺失区域评测集,其余区域留出 5% 评估基础保真度。

数据集 指标 本文 (Ours Full) 最佳扩散基线 (Difix3D+) 原始重建基线 (PGSR) 提升幅度 (vs 最佳扩散)
GigaNVS (大规模复杂场景) PSNR ↑ 17.24 15.86 16.54 +1.38 dB
GigaNVS LPIPS ↓ 0.360 0.418 0.438 -13.9% (改善)
GigaNVS FID ↓ 64.42 71.39 91.27 -9.8% (改善)
MipNeRF360 (常规无界场景) PSNR ↑ 20.72 19.08 18.92 +1.64 dB
MipNeRF360 LPIPS ↓ 0.297 0.321 0.315 -7.5% (改善)
MipNeRF360 FID ↓ 62.78 66.73 83.59 -5.9% (改善)

对比其他前沿视频/扩散方法(如 MVSplat360 的 FID 为 168.62,AC3D 的 FID 为 177.49,SEVA 的 FID 为 135.48),InceptionGS 在图像保真度与感知分布指标上展现出压倒性优势。

消融实验

消融实验重点验证了光度融合(Photometric Blending, PB)、视角空间重要性采样(View-adaptive Sampling, VS)以及场景生成微调(Fine-Tuning, FT)三大机制的贡献。下表展示了 GigaNVS 与 MipNeRF360 上的消融数据:

配置 GigaNVS PSNR ↑ GigaNVS LPIPS ↓ GigaNVS FID ↓ MipNeRF360 PSNR ↑ MipNeRF360 FID ↓ 说明
Ours (Full) 17.24 0.360 64.42 20.72 62.78 完整模型
w/o PB (无光度融合) 16.97 0.376 73.35 20.48 64.89 缺少可靠真实纹理约束,FID与感知质量恶化
w/o VS (无视角自适应采样) 16.88 0.394 72.89 20.28 66.59 均匀伪视角监督引发与重建冲突,导致过拟合
w/o FT (无场景自适应微调) 14.97 0.610 176.40 17.09 164.67 依赖通用先验引发严重幻觉与空间不一致

在极度稀疏的破坏性鲁棒性测试中(在 MipNeRF360 Room 场景中将可见视角从 4 个缩减为 2 个),PSNR 仅从 26.82 微降至 26.60,FID 仅从 50.89 略升至 53.35;且当虚拟视角数量缩放为 0.5× 或 1.5× 时指标依然保持坚挺(PSNR 在 16.24~16.30 波动),证明该机制对视角数量与稀疏程度具有出色的鲁棒性。

关键发现

  • 场景自适应几何微调是性能提升的核心基石:去掉 FT(即使用未针对该场景几何微调的通用扩散模型)导致 GigaNVS 上的 FID 从 64.42 暴跌至 176.40,说明通用扩散先验无法直接解决长城、复杂古建等特殊大场景的精细重构,动态绑定的 G-buffer 条件不可或缺。
  • 软性自举有效阻断负迁移:在迭代自举测试(TW-Pavilion 场景)中,针对同一视角连续进行两轮自举(\(j^{\star(2)} = j^{\star(1)}\))表现出极高数值稳定性(PSNR 14.53 vs 14.66);针对不同欠观测区域(\(j^{\star(2)} \ne j^{\star(1)}\))递进修复时,PSNR 由 14.53 提升至 16.28,FID 由 143.93 锐降至 53.79,原有良好区域未受任何破坏。

亮点与洞察

  • 以几何为桥梁解耦跨模态先验迁移:相比于直接在低质量伪影图像上做图像修补(Image Inpainting),利用 3DGS 提取的表面法线、透明度及哈希几何特征具备严格的 3D 不变性。这一设计巧妙绕开了跨视角外观不一致的痛点,用几何自相似性大幅提升了扩散模型的控制精度。
  • 朗之万动力学视角挖掘避免了死板配额:通过后验误差引导的连续位姿扰动与离散虚拟视点量化匹配,将有限的生成与优化算力自适应倾斜至伪影最显著的关键死角,无需繁复的手工视点调度工程。
  • 可增量自适应进化的 3DGS 修补范式:支持“发现伪影视角 \(\to\) 局部自举修复 \(\to\) 固化成果”的渐进式闭环,无需重新从零训练或人工返场采集,为数字孪生与元宇宙大场景资产的长期维护提供了绝佳路径。

局限与展望

  • 计算时间与显存开销较高:作者在正文中坦承,第一阶段场景自适应微调需耗时约 30 分钟(显存峰值约 30GB),第二阶段自举优化需耗时约 25 分钟(显存峰值约 15GB),整体耗时限制了瞬时快速重建场景。
  • 极端大盲区的几何外推依赖性:若某特定区域在所有输入视角中完全无射线击中,导致初始 PGSR 无法构建出基本的粗糙几何表面,以几何为条件的扩散模型将失去先验指导基础。
  • 未来改进路径:探索测试时自适应(Test-Time Training, TTT)架构或前馈式多视角几何特征注入模型,以进一步压缩每场景单独微调的昂贵时间开销。

相关工作与启发

  • vs PGSR / 3DGS:纯重建方案依靠光度损失与局部几何平滑正则优化高斯椭球,但在视角覆盖极度不均衡或缺失处必然产生撕裂拉伸;InceptionGS 在其几何骨架之上引入了生成扩散的统计分布外推能力,填补了纯重建方法的感知死角。
  • vs Difix3D+ / ViewCrafter / AC3D:现有的生成式 NVS 基线通过单步图像去噪或外接视频扩散模型为未知视角注入纹理,但普遍以易带伪影的粗糙 RGB 或相机射线为条件,在超大复杂场景中产生剧烈漂移和结构幻觉;InceptionGS 通过局部 G-buffer 与 ControlNet 联合适配,并借助光度融合过滤生成噪声,保证了极高的几何一致性。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 巧妙打通了 3DGS 动态表面几何提取与潜在扩散微调的双向嵌套自举机制。
  • 实验充分度: ⭐⭐⭐⭐⭐ 在 GigaNVS 大场景基准上进行了严苛的非结构化聚类留出评测,消融与鲁棒性实验详实。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑严谨清晰,问题切入点与架构设计高度吻合。
  • 价值: ⭐⭐⭐⭐⭐ 为超大规模野外场景数字化资产处理提供了优雅实用的去伪影修复范本。