跳转至

SkipGS: Post-Densification Backward Skipping for Efficient 3DGS Training

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/ASU-ESIC-FAN-Lab/SkipGS
领域: 3D视觉
关键词: 3D高斯泼溅, 训练加速, 反向传播跳过, 稠密化后微调, 新视角合成

一句话总结

SkipGS 针对 3D 高斯泼溅(3DGS)稠密化后阶段反向传播耗时占比超 60% 且大量收敛视角梯度收益衰减的瓶颈,提出视角自适应反向门控机制,在保持全前向统计跟踪的同时选择性跳过冗余反向传播,并结合预热自校准预算约束,在保持画质几乎无损的前提下使稠密化后训练时间减少 42.0%、端到端训练提速 23.1%。

研究背景与动机

3D 高斯泼溅(3DGS)通过可微分光栅化渲染数百万个各向异性 3D 高斯椭球,实现了极高画质的实时新视角合成,已成为三维重建领域的核心基准。然而,3DGS 的优化过程通常需要数万次迭代,训练成本极其昂贵,成为交互式场景捕获和大规模应用的严重瓶颈。当前学术界对 3DGS 训练加速的探索高度聚焦在「图元维度(Primitive Dimension)」,即通过训练期或后处理剪枝(如 FastGS、LightGaussian)压缩高斯数量,或在自适应稠密化过程中引入算力/内存预算(如 Taming 3DGS)。这类方法本质上都在优化单次迭代中参与渲染的高斯点数量,却完全忽略了 3DGS 训练过程特有的时序阶段性结构。

深入剖析 3DGS 的训练动态可以发现,其优化被天然划分为两个截然不同的阶段:前期的稠密化阶段(通常为 0 至 15k 步)高斯数量迅速激增、几何拓扑剧烈变动;而进入稠密化后阶段(Post-Densification,15k 至 30k 步)时,高斯总数被完全冻结(饱和在数百万级别),进入纯粹的参数精细微调阶段。耗时与梯度分析表明,在稠密化后阶段,反向传播计算占单步总耗时的 62% 以上,是绝对的运行时间瓶颈;与此同时,单个高斯的梯度范数相比前期衰减了约 2 倍并趋于平缓,但 Adam 动量惯性使得更新范数维持在相对高位,这意味着许多被采样的视角已经接近收敛,其反向传播产生的弱信息梯度对场景更新贡献极其微弱。然而,现存 3DGS 框架依然对每一个随机采样的训练视角无差别执行完整反向传播。

既然不同视角的收敛速率存在显著的空间异质性,且后期反向传播成本极高而收益递减,那么是否可以只在采样视角具备显著优化收益时才执行反向传播?本文的核心 idea 是:将 3DGS 稠密化后训练建模为受限反向门控(Constrained Backward Gating)问题,在每步无条件执行轻量前向传播以实时维护各视角损失基线的同时,基于归一化偏差评分自适应跳过收敛视角的冗余反向传播,并辅以预热期自校准的累积反向预算下限机制以规避梯度饥饿,实现无须修改渲染器与图元表示的即插即用式正交加速。

方法详解

整体框架

SkipGS 的核心理念是在 3DGS 的稠密化后微调阶段(默认从 \(T_d = 15\text{k}\)\(T = 30\text{k}\))引入视角自适应反向门控机制。整个流水线分为「预热校准」与「受限反向门控」两个时序阶段。在门控阶段,系统对每个采样的训练视角始终运行标准前向渲染计算光度损失,无条件更新该视角的历史指数移动平均(EMA)基线;随后通过计算当前损失相对基线的偏差评分,判断该视角是否处于误差反弹或欠优化状态;若偏差评分不高于阈值则提议跳过反向计算,但在执行跳过前需通过累积预算控制器检验,确保全局反向比例不低于预热期自动校准的安全下限。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["采样训练视角 v_t 并执行前向渲染<br/>计算当前光度损失 L(t)"] --> B["视角自适应偏差评分<br/>对比当前损失与历史基线得到 s"]
    B --> C["门控跳过测试与统计解耦更新<br/>s > 1 提议反向,s <= 1 提议跳过;无条件更新 EMA 基线"]
    C --> D{"当前是否提议跳过<br/>(s <= 1) ?"}
    D -->|否: s > 1| F["执行反向传播与 Adam 参数更新<br/>累加反向计数 b = b + 1"]
    D -->|是: 提议跳过| E{"预热自校准与累积预算下限控制<br/>累积反向比例 rho_cum < rho_min ?"}
    E -->|是: 触发预算强制覆盖| F
    E -->|否: 允许跳过| G["跳过反向传播与参数更新<br/>仅保留前向耗时,进入下一迭代"]
    F --> H["进入下一迭代 (t = t + 1)"]
    G --> H

关键设计

1. 视角自适应偏差评分:基于独立 EMA 基线的相对损失偏差度量 在 3DGS 训练后期,不同视角的可见性、遮挡关系以及镜面高光等视相关效应各异,导致视角间的收敛难度严重不均;使用单一全局损失阈值极易误杀复杂视角的有效更新,或在简单视角上产生无谓空转。SkipGS 为每个训练视角 \(v\) 维护独立的损失指数移动平均(EMA)基线 \(\bar{\mathcal{L}}_v\)。当在迭代步 \(t\) 采样到视角 \(v_t\) 时,系统首先通过当前前向损失 \(\mathcal{L}_{v_t}^{(t)}\) 与其上一轮观察到的历史基线 \(\bar{\mathcal{L}}_{v_t}^{(t-1)}\) 计算无量纲的归一化偏差评分: $\(s_{v_t}^{(t)} = \frac{\mathcal{L}_{v_t}^{(t)}}{\bar{\mathcal{L}}_{v_t}^{(t-1)} + \epsilon}\)$ 其中 \(\epsilon = 10^{-8}\) 为数值稳定常数。若该视角此前从未被采样过,则初始化 \(s \leftarrow +\infty\) 确保执行反向传播。当偏差评分 \(s > 1\) 时,说明当前观察到的误差高于该视角的近期平均水平(发生了损失尖峰或几何/纹理退化),优化潜力大,判定为高价值梯度样本;反之,若 \(s \le 1\),表明当前渲染质量优于或等于近期基准,继续反向传播仅能提供边际递减的微弱梯度,门控机制提议跳过反向传播。

2. 门控跳过测试与统计解耦更新:始终前向跟踪、按需反向传播 传统跳步策略往往直接跳过整个迭代,导致模型丧失对被跳过样本的动态感知,极易在场景发生协同变化时引发跟踪脱节。SkipGS 坚持「前向传播常开」原则:前向渲染计算开销极低(仅占迭代耗时的约 38%),而反向传播(梯度回传、原子操作累加、坐标与协方差微分)占据了 62% 以上的耗时。门控跳过测试公式表示为: $\(g_t(v_t) = \mathbb{I}\left[s_{v_t}^{(t)} > 1\right]\)$ 无论门控决策 \(g_t(v_t)\) 最终是 1 还是 0,SkipGS 均在评分计算完成后无条件执行该视角 EMA 基线的更新: $\(\bar{\mathcal{L}}_{v_t}^{(t)} = \beta \bar{\mathcal{L}}_{v_t}^{(t-1)} + (1 - \beta) \mathcal{L}_{v_t}^{(t)}\)$ 超参数默认设为 \(\beta = 0.95\)。这种解耦机制确保了 EMA 基线始终紧密跟踪当前高斯场对该视角的最新前向表达能力,绝不会因为反向传播被跳过而导致基线停滞在过时的历史状态。

3. 预热自校准与累积预算下限控制:防止梯度饥饿的全局稳定性屏障 单纯依据瞬时偏差评分进行跳步极具风险:如果大量视角连续多轮满足 \(s \le 1\),模型将长期得不到反向梯度,导致高斯参数被局部最优或 Adam 动量耗尽所冻结,引发严重的画质退化。为此,SkipGS 建立了从预热统计到运行时累积预算的双层保障机制。首先,在稠密化刚结束的 \(W\) 步(默认 \(W = 500\))内执行无条件反向传播的热身,同时在后台记录虚拟门控的触发比例: $\(\hat{\rho}_W = \frac{1}{|\mathcal{T}_W|} \sum_{i \in \mathcal{T}_W} g_i(v_i)\)$ 其中 \(\mathcal{T}_W\) 表示采样视角已有 EMA 历史的热身迭代集合。随后在 \(t = W + 1\) 步,根据场景天然的收敛陡峭度自动校准该场景的最小反向预算比例: $\(\rho_{\min} = \rho_{\mathrm{lo}} + (1 - \rho_{\mathrm{lo}}) \hat{\rho}_W\)$ 系统全局固定基础保底比例 \(\rho_{\mathrm{lo}} = 0.5\)。在后续门控阶段,算法实时维护稠密化后阶段的累积反向比例 \(\rho_{\mathrm{cum}}(t-1) = b / \max(t-1, 1)\)\(b\) 为实际执行反向的累计次数)。一旦 \(\rho_{\mathrm{cum}}(t-1) < \rho_{\min}\),即使当前视角的偏差评分 \(s \le 1\),预算控制器也会强行将门控判定重写为 \(g_t \leftarrow 1\),强制执行反向传播。这一设计构筑了绝对的梯度供给底线,完全消除了繁琐的人工逐场景超参微调。

一个完整示例

假设一个场景在 \(T_d = 15\text{k}\) 结束稠密化,进入 SkipGS 阶段: 1. 预热期(\(t = 1 \sim 500\):所有采样视角均执行前向和反向传播。期间,后台检测发现只有 30% 的迭代发生了损失反弹(\(s > 1\)),即 \(\hat{\rho}_W = 0.30\)。系统在第 501 步自动校准出该场景的最小反向预算:\(\rho_{\min} = 0.5 + (1 - 0.5) \times 0.30 = 0.65\)(即要求整个后半程至少有 65% 的步数执行反向)。 2. 正常跳步:在第 2000 步采样到视角 A,历史基线 \(\bar{\mathcal{L}}_A = 0.0420\)。前向渲染得到当前损失 \(\mathcal{L}_A^{(2000)} = 0.0415\)。计算偏差评分 \(s = 0.0415 / 0.0420 = 0.988 \le 1\),提议跳过。检查当前累积反向比例 \(\rho_{\mathrm{cum}} = 0.68 > 0.65\),安全允许跳过;于是立即更新视角 A 的 EMA 基线,省略昂贵的反向与 Adam 更新,节省超过 60% 的单步时间。 3. 预算强制介入:在第 8000 步采样到视角 B,计算偏差评分 \(s = 0.97 \le 1\),提议跳过。但此时由于近期连续跳步,累积反向比例滑落至 \(\rho_{\mathrm{cum}} = 0.648 < 0.65\)。预算控制器立即触发强制覆盖,将门控置为 1,执行完整的反向传播并令 \(b \leftarrow b + 1\),使累积反向比例重回安全区间。

损失函数 / 训练策略

SkipGS 完全不改动底层 3DGS 的优化目标与光栅化管线。光度损失函数依旧采用复合损失: $\(\mathcal{L} = (1 - \lambda) \mathcal{L}_1 + \lambda (1 - \text{SSIM})\)$ 其中权重固定为 \(\lambda = 0.2\)。当门控决定反向传播时,误差梯度照常通过 2D 投影协方差、透射率累积公式回传至高斯均值、旋转四元数、缩放尺度、不透明度及球谐函数系数,并由 Adam 优化器更新参数;跳过反向时,参数与优化器状态完全冻结。所有测试均在单张 NVIDIA RTX Ada 5000(32GB)GPU 上采用统一超参评测:\(W = 500\)\(\beta = 0.95\)\(\rho_{\mathrm{lo}} = 0.5\),无需针对任何数据集重新搜索调优。

实验关键数据

主实验

在 Mip-NeRF 360、Deep Blending 与 Tanks & Temples 三大标准真实场景数据集上,将 SkipGS 作为即插即用插件部署在 Vanilla 3DGS 以及 5 种前沿高效 3DGS 算法(涵盖剪枝压缩、紧凑稀疏化与受限生长架构)之上。下表汇总了 Mip-NeRF 360 数据集的全场景平均画质指标与端到端训练耗时(\(T_{\text{total}}\))及稠密化后阶段耗时(\(T_{\text{post}}\)):

数据集 / 基础方法 配置 PSNR (dB) ↑ SSIM ↑ LPIPS ↓ \(T_{\text{total}}\) (s) ↓ \(T_{\text{post}}\) (s) ↓
Mip-NeRF 360 (Vanilla 3DGS) Baseline 27.52 0.816 0.215 1705.7 939.6
Mip-NeRF 360 (Vanilla 3DGS) + SkipGS (Ours) 27.52 0.816 0.217 1311.1 (-23.1%) 545.0 (-42.0%)
Mip-NeRF 360 (FastGS) Baseline 27.56 0.798 0.261 181.9 87.2
Mip-NeRF 360 (FastGS) + SkipGS (Ours) 27.51 0.797 0.262 164.5 (-9.6%) 69.8 (-20.0%)
Mip-NeRF 360 (Taming 3DGS) Baseline 27.94 0.822 0.207 1339.0 757.0
Mip-NeRF 360 (Taming 3DGS) + SkipGS (Ours) 27.92 0.822 0.209 974.0 (-27.3%) 392.0 (-48.2%)
Mip-NeRF 360 (GaussianSpa) Baseline 27.61 0.826 0.213 2640.9 1485.0
Mip-NeRF 360 (GaussianSpa) + SkipGS (Ours) 27.60 0.825 0.215 2490.9 (-5.7%) 1335.0 (-10.1%)
Mip-NeRF 360 (LightGaussian) Baseline 27.49 0.810 0.230 240.0 240.0
Mip-NeRF 360 (LightGaussian) + SkipGS (Ours) 27.46 0.809 0.231 204.8 (-14.7%) 204.8 (-14.7%)
Mip-NeRF 360 (Speedy-Splat) Baseline 27.11 0.799 0.263 1099.8 492.0
Mip-NeRF 360 (Speedy-Splat) + SkipGS (Ours) 27.08 0.799 0.264 1030.8 (-6.3%) 423.0 (-14.0%)

在 Deep Blending 与 Tanks & Temples 数据集上,加速收益与画质保真度同样显著: - 在 Deep Blending 上,Vanilla 3DGS 搭配 SkipGS 后,\(T_{\text{post}}\) 从 965.5s 下降至 602.0s(节省 37.6%),端到端耗时降低 21.2%,PSNR 甚至微升 0.09 dB(29.79 → 29.88 dB);Taming 3DGS + SkipGS 的 \(T_{\text{post}}\) 更是减少了 49.4%(620.0s → 314.0s),PSNR 达到 29.95 dB。 - 在 Tanks & Temples 上,Vanilla 3DGS 的 \(T_{\text{post}}\) 缩减 36.8%(545.5s → 344.5s),端到端提速 20.2%;FastGS + SkipGS 的后半段耗时压缩至惊人的 38.4s。

消融实验

在 Mip-NeRF 360 上,选取 GaussianSpa 与 Taming 3DGS 两个不同机制的高效基线,深入探究反向预算控制(Backward Budget Control)机制的必要性:

基线方法 配置 PSNR (dB) ↑ SSIM ↑ LPIPS ↓ \(T_{\text{post}}\) (s) ↓ 说明
GaussianSpa Baseline 27.61 0.826 0.213 1485.0 原始完整反向训练
GaussianSpa + SkipGS (完整模型) 27.60 0.825 0.215 1335.0 提速 150s,PSNR 仅微跌 0.01 dB
GaussianSpa + SkipGS (移除预算控制) 27.23 0.804 0.249 1026.0 时间虽省 459s,但 PSNR 暴跌 0.38 dB
Taming 3DGS Baseline 27.94 0.822 0.207 757.0 原始完整反向训练
Taming 3DGS + SkipGS (完整模型) 27.92 0.822 0.209 392.0 提速 365s (48.2%),画质几乎完全持平
Taming 3DGS + SkipGS (移除预算控制) 27.27 0.795 0.260 161.0 极度激进跳步使 PSNR 剧降 0.67 dB

关键发现

  • 预算控制是质量守恒的决定性基石:消融表明,若完全由无约束的偏差评分判定跳步,系统会产生严重的级联休眠(过激跳步),导致 \(T_{\text{post}}\) 虽然大幅削减,但在 Taming 3DGS 上 PSNR 出现了 0.67 dB 的灾难性下跌。自动校准预算机制通过适度牺牲小部分极限加速比,成功消除了梯度饥饿,将质量损失严格压制在 0.02 dB 以内。
  • 正交性与叠加收益极佳:由于 SkipGS 控制的是「是否执行反向」这一时间维度的离散决策,与所有在空间维度减少高斯点数的方法(剪枝、压缩、稀疏化、生长限制)完全正交。在业界最快的 FastGS 上,SkipGS 仍能斩获 20.0% 的稠密化后加速,证明其正交叠加特性具有普适性。
  • 高斯总数完全不变:Vanilla 3DGS 在全场景平均的高斯图元数在加入 SkipGS 前后严格保持在 2.739M,证明所有加速与存储开销完全源自反向算力的削减,渲染期推理性能毫无损耗。

亮点与洞察

  • 抓住阶段异质性做计算剪枝:敏锐地将加速切入点聚焦于「稠密化后的收敛长尾」,在反向传播占 62% 计算负荷但梯度收益大幅衰减的窗口精准施策,巧妙避开了前期破坏拓扑生长与分裂的风险。
  • 极度轻量的自适应设计:每个视角仅额外保存一个浮点数的 EMA 统计量,无任何复杂的超网络、策略网络或离散采样维护开销,保持了纯粹极简的工程美感与确定性加速。
  • 前向跟踪与反向决策解耦:坚持「常开前向更新基线、条件触发反向更新参数」,彻底解决了传统跳步策略导致历史统计量与当前模型状态脱节的失真难题。

局限与展望

  • 受限于静态场景假设:作者在结论中明确指出,当前评测与设计均基于静态三维场景;在动态场景或 4D 高斯泼溅中,由于物体存在时序形变与拓扑位移,损失波动更加剧烈,现有的简单 EMA 基线可能需要引入时空平滑或运动感知机制。
  • 前向传播依然占据计算开销:SkipGS 虽跳过了反向传播,但每步仍需执行前向渲染与损失计算。对于分辨率极高或超大视角场景,前向开销仍不可忽视,未来可探索多视角批次采样与局部特征缓存结合的联合跳步。
  • 跳过决策粒度为全视角:当前反向跳步以单张图像为最小原子单位;若图像中局部区域已完美收敛而微小前景尚有缺陷,全视角的粗粒度决策可能仍存在细粒度算力冗余,可探索分块(tile-level)的反向掩蔽机制。

相关工作与启发

  • vs 图元压缩方法 (FastGS, LightGaussian, Speedy-Splat):图元压缩方法通过删减不重要的高斯点来降低单步负载,但这会改变最终的高斯表达规模,并对光栅化渲染器提出特定架构要求;SkipGS 聚焦于反向传播的时机调度,完全不改变图元表示与渲染器,两者可无缝叠加实现双重提速。
  • vs 高斯生长控制方法 (Taming 3DGS):生长控制方法在稠密化阶段约束高斯的膨胀分裂预算,主要优化前半程的内存与计算开销;SkipGS 则在稠密化停止后的精细微调阶段接管调度,二者形成完美的时序阶段互补(在 Taming 3DGS 上稠密化后耗时直接减半)。
  • vs 传统重要性采样与难例挖掘:传统方法通常改变视角采样的先验概率分布(可能破坏 SGD 样本无偏性并增加采样复杂度),而 SkipGS 保留原始均匀随机采样以维护经验风险最小化框架,仅在计算图层面动态斩断反向反传分支,实现更优雅健壮。

评分

  • 新颖性: ⭐⭐⭐⭐☆ [敏锐洞悉 3DGS 稠密化后期的反向计算冗余,开辟了正交于图元维度的计算门控新方向]
  • 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 3 大标杆数据集、6 种 SOTA 基础框架,消融充分且详尽分析了反向耗时机理]
  • 写作质量: ⭐⭐⭐⭐⭐ [动机链条严丝合缝,图表展示极其清晰,公式与数学推导规范严密]
  • 价值: ⭐⭐⭐⭐⭐ [即插即用、完全正交且代码开源,可零成本嵌入现有任意 3DGS 训练管线实现即时提速]