跳转至

Fast and Compact 3D Gaussian Splatting with Polarized Opacity Prior

会议: ECCV 2026
论文: ECCV 原文
领域: 3D视觉
关键词: 3D Gaussian Splatting, 极化不透明度先验, 模型压缩, 高效训练, 早期光线终止

一句话总结

针对传统 3DGS 因“先致密化后剪枝”引发的严重模型膨胀与梯度泄漏问题,本文提出极化不透明度先验(POP)与 L2 误差比例梯度的协同优化框架,使重要高斯趋向完全不透明、冗余高斯自然消亡,在减少近 90% 高斯数量的同时大幅缩短训练耗时并保持高保真渲染质量。

研究背景与动机

3D 高斯泼溅(3D Gaussian Splatting, 3DGS)凭借显式高斯椭球基元与高效的瓦片光栅化渲染,确立了高质量实时新视角合成的全新基准。然而,其实际部署和训练扩展受到严重的“模型膨胀(Model Bloat)”困扰。标准 3DGS 采用“先致密化后剪枝(densify-then-prune)”的启发式策略,在优化初期无节制地分裂和克隆基元,随后依赖每 3000 次迭代重置不透明度的激进手段来剔除冗余高斯。这种机制不仅在训练过程中产生大量内存开销,而且导致数百万几乎不贡献几何与外观价值的低不透明度高斯长期驻留。统计显示,在典型场景中超过 33.7% 的高斯不透明度低于 0.1,却无法被有效清除。

造成低不透明度高斯顽固存活的本质原因在于“梯度泄漏(Gradient Leakage)”:在标准 alpha blending 渲染中,哪怕高斯的不透明度接近于零,只要多视角大量像素的反向传播梯度发生累加,就足以抵消衰减惩罚并逃避剪枝阈值,使无用基元在参数空间中随机漂移。如果尝试朴素地将所有高斯的不透明度强行拉高到 1,标准 3DGS 所采用的 L1 与 SSIM 损失又会引发剧烈伪影——因为 L1 损失梯度的模长与实际像素重构误差无关(恒定为常量符号梯度),无法在强正则化干扰下自适应压制误差。

本文的核心切入点在于:高斯基元演化的稳定性取决于重建梯度与不透明度正则化之间的动力学协同。核心 idea:通过 L2 重构损失提供与误差成比例的自适应梯度约束,并结合极化不透明度先验(POP)将主导像素渲染的关键基元推向完全不透明(触发早期光线终止),同时将冗余基元抑制至全透明并自然剪枝,从根本上摒弃周期性不透明度重置。

方法详解

整体框架

本文方法的优化管线围绕“自抑制增长的紧凑表征”展开。输入为 SfM 初始稀疏点云和多视角参考图像,输出为紧凑高保真的 3D 高斯基元集合。在每一次前向渲染过程中,光栅化器计算像素颜色并动态追踪每个高斯所主导的像素数量;随后在反向传播阶段,联合执行 L2 误差比例更新、非梯度主导的模糊致密化(Blur-based Densification)以及极化不透明度先验(POP)驱动的双向正则化。整个训练过程无需震荡性的全局不透明度重置,基元数量平稳收敛。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入:多视角图像 + SfM点云"] --> B["前向 Alpha Blending 渲染<br/>累积穿透率与主导计数 Di"]
    B --> C["L2 损失与误差自适应梯度<br/>梯度大小正比于颜色差 Δc"]
    B --> D["极化不透明度先验 POP<br/>重要基元 oi→1,非重要基元 oi→0"]
    B --> E["自适应模糊致密化<br/>基于主导像素数 Di 触发分裂/克隆"]
    C & D & E --> F["连续自然剪枝与参数更新<br/>无需启发式 Opacity Reset"]
    F --> G["紧凑高保真 3DGS 场景表征"]

关键设计

1. L2 重构损失与误差自适应梯度:化解强正则化下的优化冲突 标准 3DGS 依赖 L1 损失进行图像重构,但 L1 梯度对像素颜色偏差 \(\Delta c = c(p) - c_{\text{GT}}(p)\) 仅取符号函数,梯度幅值恒为常量 \(\frac{1}{3HW}\),完全忽略了局部重构误差的大小。当引入不透明度正则化项时,L1 梯度无法在误差严重区域提供足够强的修正力,从而产生严重的斑驳伪影。本文改用 L2 损失作为主重构目标,其梯度为: $$ \frac{\partial \mathcal{L}_2}{\partial c(p)} = \frac{2\Delta c}{3HW} $$ 由于梯度幅值与绝对误差 \(|\Delta c|\) 严格呈线性关系,模型在偏差巨大的区域能够施加成倍的纠偏力量,有效稳定了基元向高不透明度迁移过程中的数值收敛。此外,在训练平稳期,L2 梯度天然比 L1 梯度更小,避免了高频振荡。

2. 基于主导计数的自适应模糊致密化:解决小梯度下的欠致密化 改用 L2 损失后,整体梯度的平均幅值下降,使得原版 3DGS 依赖视空间视差梯度的分裂/克隆阈值机制难以被触发,导致平滑模糊区域欠致密化。为此,本文设计了非梯度驱动的模糊致密化策略。对于每个像素 \(p\),定义其最大透射贡献对应的高斯索引为 \(i^*(p) = \arg\max_i (T_i \alpha_i)\)。在各训练视角上,累加高斯 \(G_i\) 担任主导角色的像素总数,获得主导计数 \(D_i\)。当且仅当 \(D_i > \tau_{\text{blur}} = \theta_{\text{blur}} \cdot H \cdot W\) 时,将该高斯纳入致密化候选集。本文针对 L2 的特性将 \(\theta_{\text{blur}}\) 设为 \(2 \times 10^{-5}\),同时根据高斯当前尺度自适应选择克隆或分裂,有效规避了过度碎片化,使细节与表面覆盖率达到平衡。

3. 极化不透明度先验(POP):双向不透明度极化与阻断梯度泄漏 为根除冗余基元并加速渲染,POP 依据高斯是否在当前视角至少主导了一个像素(即重要性掩码 \(M_{\text{imp}, i} = \mathbb{I}(D_i > 0)\))对高斯群体实行双向驱动: $$ \mathcal{L}{\text{POP}} = \frac{1}{N) $$ 对主导核心画面的关键基元,}}} \sum_{i=1}^N (1 - o_i) M_{\text{imp}, i} + \frac{1}{N - N_{\text{imp}}} \sum_{i=1}^N o_i (1 - M_{\text{imp}, i\(M_{\text{imp}, i} = 1\),第一项强制驱动其不透明度 \(o_i \to 1\)。这促使累积穿透率 \(T_i = \prod_{j=1}^{i-1} (1 - \alpha_j)\) 沿光线极速衰减,迅速触发早期光线终止(Early Ray Termination, \(T \le 10^{-4}\)),大幅削减每像素参与计算的高斯数量并显著加快前向/反向速度。对未主导任何像素的冗余基元,\(M_{\text{imp}, i} = 0\),第二项持续惩罚并压制其不透明度 \(o_i \to 0\)。这不仅截断了其在视空间的反向梯度流、从根源上消除梯度泄漏,而且使其能够迅速跌破极低剪枝阈值而被安全剔除,完全取代了传统破坏收敛稳定性的 Opacity Reset。

损失函数 / 训练策略

总训练损失函数定义为: $$ \mathcal{L} = (1 - \lambda_{\text{SSIM}}) \mathcal{L}2 + \lambda}} \mathcal{L{\text{D-SSIM}} + \lambda $$ 其中权重设定为 }} \mathcal{L}_{\text{POP}\(\lambda_{\text{SSIM}} = 0.01\)\(\lambda_{\text{POP}} = 0.001\)。在训练调度上,总迭代步数为 30k 步;致密化在 0.5k 至 15k 步之间以每 100 步的周期执行;POP 正则化仅在 0 至 15k 步启用以指导几何拓扑构建;模糊致密化模块仅在 3k 至 7k 步激活,在模型形成宏观布局后再补充细分密度,15k 步后冻结拓扑结构,仅优化基元属性。

实验关键数据

主实验

在 Mip-NeRF 360 与 Deep Blending 基准数据集上,本文方法在保持与 3DGS 相当的渲染保真度前提下,高斯数量缩减近 90%,训练耗时缩短至原版的 20% 左右。所有对比基线均在同一块 NVIDIA RTX 4090 GPU 上进行公平复现与评测。

表 1: Mip-NeRF 360 与 Deep Blending 数据集定量评测(原论文 Table 1)

数据集 方法 基元数量 (Num) ↓ 训练耗时 (s) ↓ 模型大小 (MB) ↓ PSNR ↑ SSIM ↑ LPIPS ↓
Mip-NeRF 360 3DGS [14] 2,509k 1,304 595 27.250 0.811 0.226
Gsplat [29] 3,168k 886 713 27.661 0.824 0.166
PUP-3DGS [11] 312k 1,216 74 26.772 0.795 0.258
Mini-Splatting [7] 495k 896 117 27.605 0.833 0.202
Taming-3DGS [19] 346k 329 82 27.147 0.772 0.294
Speedy-Splat [10] 279k 728 66 26.926 0.783 0.294
本文方法 (Ours) 268k 279 60 27.013 0.760 0.277
Deep Blending 3DGS [14] 2,484k 1,197 588 29.847 0.907 0.089
PUP-3DGS [11] 282k 1,205 67 29.471 0.903 0.103
Taming-3DGS [19] 294k 282 69 29.886 0.905 0.270
Speedy-Splat [10] 250k 667 59 29.632 0.904 0.108
本文方法 (Ours) 118k 256 27 28.626 0.869 0.266

消融实验

消融实验逐项验证了 L2 损失、基于模糊的致密化(Blur)以及极化不透明度先验(POP)各模块的不可或缺性。

表 2: 各模块消融分析实验(原论文 Table 3)

配置 (L2 / Blur / POP) Mip-NeRF 360 (Num / Time / PSNR) Tanks & Temples (Num / Time / PSNR) Deep Blending (Num / Time / PSNR) 结构特性说明
✓ / ✗ / ✗ 210k / 271s / 26.57 221k / 271s / 23.53 193k / 259s / 28.51 仅使用 L2,梯度过小导致致密化不足,欠拟合
✓ / ✓ / ✗ 583k / 343s / 27.22 557k / 267s / 23.71 297k / 275s / 28.56 恢复模糊致密化但无 POP,基元数量大幅膨胀
✓ / ✗ / ✓ 140k / 264s / 26.28 157k / 176s / 23.46 94k / 254s / 28.43 仅依靠 POP 抑制,无补充致密化,容量受限
✓ / ✓ / ✓ (完整模型) 268k / 279s / 27.01 269k / 209s / 23.62 118k / 257s / 28.63 协同达到紧凑度、高画质与超快训练的最优平衡

表 3: POP 与传统 Opacity Reset 的对比消融(原论文 Table 5)

机制 Mip-NeRF 360 (Num / Time / PSNR) Tanks & Temples (Num / Time / PSNR) Deep Blending (Num / Time / PSNR) 训练稳定性表现
Opacity Reset 548k / 328s / 26.82 432k / 247s / 22.91 234k / 270s / 28.51 每3k步出现剧烈PSNR下跌与震荡,耗时耗算力
POP (本文) 268k / 279s / 27.01 269k / 209s / 23.62 118k / 257s / 28.63 梯度平滑单调收敛,基元数减半且渲染指标显著更优

关键发现

  • 早期光线终止大幅加速训练:如图 4b 所示,POP 将每个像素平均遍历的高斯数量从 baseline 的 80+ 骤降至 40 左右,光栅化正向与反向耗时直接减半。
  • 平滑收敛取代震荡恢复:如图 7 所示,依赖周期性 Opacity Reset 的方法每隔 3000 步就会出现基元暴跌和重建指标重挫,优化器需要浪费几千步用噪声梯度重新恢复几何;而 POP 使基元数量平稳演进,全程无中断。
  • 致密化窗口的黄金区间:在模糊致密化步数消融(Table 4)中,过早停止(3k–4k 步)会导致容量不足(Mip-NeRF 360 PSNR 仅 26.54),而持续到 15k 步则引入 2-3 倍冗余基元(562k)且画质提升微弱,3k–7k 步兼顾了最佳结构覆盖与精简度。

亮点与洞察

  • 透视机制的精准打击:揭示了 3DGS 冗余基元无法通过传统剪枝清除的物理机制在于多像素微弱累积的“梯度泄漏”,通过双向 POP 从光线积分数学层面上切断了无用基元的反向传播通道。
  • 误差比例梯度的协同救赎:敏锐地发现 L1 损失与不透明度正则化在优化动力学上的结构性冲突,通过 L2 梯度与重构误差的线性正比关系,化解了表面致密化与去伪影的矛盾。
  • 极简主义工程实现:无需引入复杂的神经网络 MLP 解码、额外网格拓扑或底层 CUDA 重构,仅在原生 3DGS 目标函数中加入两项简洁优雅的数学先验,便达成了 SOTA 级别的紧凑度与训练提速。

局限与展望

  • 高频精细纹理轻微退化:由于基元总数较原版压缩了近一个数量级,在超高频复杂纹理区域(如细密叶脉、文字细节)可能出现轻微模糊或覆盖缝隙。
  • 启发式阶段调度的泛化性:模糊致密化激活窗口固定在 3k–7k 步,对于尺寸跨度极大或几何复杂度极高的特殊非均匀场景可能需要微调超参数。
  • 缺少量化压缩后处理:本文目前聚焦于“优化期内在紧凑表征”,若后续结合矢量量化(VQ)、Morton 码排序或熵编码,存储体积有望进一步下降一个数量级。

相关工作与启发

  • vs 3DGS [14]: 原版采用“盲目分裂 + Opacity Reset”的激进膨胀逻辑,造成数百万基元泛滥;本文通过 POP 与 L2 梯度约束实现自稳态生长,去除了周期性重置,训练耗时减少 75% 以上,基元数量减少约 90%。
  • vs Mini-Splatting [7] & PUP-3DGS [11]: Mini-Splatting 仅进行分裂操作导致微观基元积聚,PUP-3DGS 需要在后处理阶段计算繁重的高阶 Fisher 信息矩阵进行敏感度剪枝;本文在优化端到端完成剪枝,无需耗时的后处理步骤。
  • vs Taming-3DGS [19] & Speedy-Splat [10]: Taming-3DGS 依赖复杂的抛物线采样调度和多阶段控制,Speedy-Splat 依赖定制的双重空间剪枝;本文仅通过损失函数与先验设计即获得了比两者更快的训练速度与更紧凑的模型体积。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 深刻指出 3DGS 梯度泄漏问题,提出形式极其简洁高效的双向极化不透明度先验。
  • 实验充分度: ⭐⭐⭐⭐⭐ 在三大主流基准上全面对比了画质、显存、基元数、训练速度及全套消融实验。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,图文对照直观,问题定义与理论推导清晰明了。
  • 价值: ⭐⭐⭐⭐⭐ 几乎零推理/工程迁移门槛,可直接作为后续所有 3DGS 衍生工作的基础训练标准。