跳转至

NanoGS: Training-Free and Lightweight Gaussian Splat Simplification

会议: ECCV 2026
论文: ECCV 原文
项目主页: https://saliteta.github.io/NanoGS/
领域: 3D视觉 / 模型压缩
关键词: 3D高斯泼溅, 模型轻量化, 免训练简化, 矩匹配, 边缘折叠

一句话总结

NanoGS 提出了一个免训练、高效率的 3D 高斯泼溅简化框架,通过构建空间稀疏 KNN 邻域合并图、基于 I-Divergence 评估局部两高斯混合分布的逼近代价,并借助保质量矩匹配(MPMM)闭式合并高斯基元,在无需渲染反向传播和多视角图像监督的条件下实现高达 1000 倍的极端图元化简。

研究背景与动机

3D 高斯泼溅(3DGS)通过各向异性 3D 高斯集合与自适应密度调控,实现了高保真度、实时 1080p 的新视角合成,迅速成为神经辐射场(NeRF)等隐式表征的主要替代方案。然而,为了精确捕捉精细几何结构与复杂视依赖外观,3DGS 重建模型通常需要包含数百万个高斯基元,这导致模型文件常达数百兆甚至数吉字节。海量图元不仅带来巨大的存储空间与网络传输压力,更在渲染阶段显著加剧了图元深度排序与可微光栅化的显存与算力负载,直接制约了其在移动端与边缘设备上的广泛部署。

现有的高斯压缩与轻量化方案主要分为两类:一类侧重于位级压缩,如矢量量化、熵编码与球谐系数降阶,但图元总数并未实质减少;另一类采用图元级剪枝或重训稀疏化,通过渲染灵敏度评分、蒸馏或最优传输(如 GHAP、LightGS、PUP 3D-GS)来缩减图元规模。然而,这些方法几乎全部强依赖于 GPU 密集型后优化以及带精确位姿的校准多视角图像。在实际工程落地中,许多 3DGS 资源源于单图前向重建、跨模态扩散生成、网格/点云直接转换或交互式编辑工具,真实的多视角参考图像往往不可获取;同时,内容创作者无法预知客户端设备的显存上限,为每种硬件预算重复数小时的 GPU 重训既不现实,还会因启发式重采样视点引发严重的浮空伪影(floaters)。

面对端侧设备算力不对称、训练监督图像缺失以及实时在线精简需求,3DGS 迫切需要一种不改动底层数据格式、可在 CPU 上极速运行的免训练模型级后处理简化方案。本文的切入角度是跳出光栅化梯度回传的框架,直接将 3DGS 模型视为无序三维非归一化高斯混合体,解耦出候选拓扑选取、合并代价度量与基元融合算子三大独立阶段。核心 idea:构建空间稀疏 KNN 邻域图以限制局部合并候选集,采用蒙特卡洛 I-Divergence 与外观距离联合度量两高斯近似失真,并通过保质量矩匹配(MPMM)算子在闭式解下实现保几何尺度与不透明度饱和的批量贪心边折叠。

方法详解

整体框架

NanoGS 的核心思想是将包含 \(N\) 个图元的无序高斯集转化为稀疏图上的局部边折叠问题,其完整流程由四个模块构成:初始透明度过滤、稀疏邻域合并图构建、I-Divergence 几何与外观合并代价评估、保质量矩匹配算子(MPMM)融合,以及迭代式的批处理边折叠与周期性邻域刷新。方法首先剪枝掉不可见的微弱漂浮物图元,随后在当前高斯中心上构建空间 KNN 图,将候选对复杂度从 \(O(N^2)\) 压缩到 \(O(kN)\);对每条候选边评估融合误差,贪心选择相互不重叠的低代价边并行执行矩匹配合并,并在图元减少后周期性更新 KNN 拓扑,直至达成预设压缩比例 \(\rho\)

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入 3DGS 图元集合<br/>中心 / 协方差 / 不透明度 / 球谐"] --> B["不透明度初筛<br/>预先滤除极小不透明度噪声浮空基元"]
    B --> C["稀疏邻域合并图与渐进式边折叠<br/>在空间中心构建 KNN 候选图 (K=16)"]
    C --> D["I-Divergence 几何失真与外观融合代价<br/>蒙特卡洛采样估计混合两高斯近似散度与特征方差"]
    D --> E["保质量矩匹配 (MPMM)<br/>质量加权更新均值/协方差,透光率并集融合不透明度"]
    E --> F{"是否达到目标图元压缩比 ρ?"}
    F -->|否,需继续化简| G["周期性邻域刷新<br/>更新新生成图元空间坐标并重建局部 KNN 边"]
    G --> C
    F -->|是,化简完成| H["输出标准 3DGS 紧凑模型<br/>完全兼容已有光栅化管线与下游熵编码"]

关键设计

1. 稀疏邻域合并图与渐进式边折叠:将二次方候选搜索收敛为局部轻量图运算

在全局尺度上为 \(N\) 个高斯基元评估两两合并代价需要 \(O(N^2)\) 计算复杂度,当场景图元达到数百万时直接计算完全不可行。此外,空间距离较远的高斯基元融合必然会导致灾难性的体积膨胀与几何失真。为此,该设计基于三维空间中心坐标 \(\mu_i\) 构建无向 \(k\) 近邻图 \(G=(V, E)\),将每个高斯仅与其空间相邻的 \(k\) 个最近邻基元相连(默认 \(k=16\)),从而将边候选集严格控制在 \(|E| = O(kN)\) 的局部空间内。

在每一轮折叠阶段,算法根据计算得到的边代价,以贪心匹配策略选取一组互不相交(disjoint)的极小代价边集合并行折叠,单轮折叠可直接削减约一半的选中图元。由于高斯合并后空间位置和局部密度发生变化,固定拓扑会遗漏新产生的邻近合并机会,NanoGS 采用周期性局部邻域刷新机制重新执行快速 KNN 查询,使得空间聚集的新图元能够动态连接,既保证了极端压缩比下的几何连通性,又维持了纯 CPU 处理下的秒级执行吞吐。

2. I-Divergence 几何失真与外观融合代价:信息论驱动的混合高斯逼近度量

传统网格简化常采用二次误差度量(QEM),但高斯基元具备概率密度、各向异性扩散和透光率等连续体积特性,简单的几何欧氏距离无法真实反映融合前后的辐射场畸变。若两个高斯之间存在显著间隔(双峰分布),将其强行合并为一个单高斯会产生严重的空间弥散或概率质量丢失。为了量化将两高斯混合体近似为单一高斯所带来的几何失真,NanoGS 将每个高斯 \(i\) 视为未归一化的连续质量密度: $\(p_i(x) = w_i \mathcal{N}(x; \mu_i, \Sigma_i), \quad w_i = (2\pi)^{3/2} \alpha_i \prod_{k=1}^3 s_{i,k}\)$ 其中 \(s_{i,k}\) 为三轴缩放尺度,\(\alpha_i\) 为不透明度。定义二元归一化混合分布 \(\tilde{p}_{ij}(x) = \frac{w_i}{W} \mathcal{N}(x; \mu_i, \Sigma_i) + \frac{w_j}{W} \mathcal{N}(x; \mu_j, \Sigma_j)\)(其中总质量 \(W=w_i+w_j\)),并以矩匹配生成的单高斯 \(q_m(x) = \mathcal{N}(x; \mu_m, \Sigma_m)\) 进行逼近。几何合并失真定义为二者之间的 I-Divergence(广义 KL 散度): $\(\mathcal{D}_{\mathrm{geo}}(i, j) = \mathrm{I}(\tilde{p}_{ij} \parallel q_m) = \int \tilde{p}_{ij}(x) \log \frac{\tilde{p}_{ij}(x)}{q_m(x)} dx\)$ 由于对数混合项无闭式解,算法通过极轻量的固定蒙特卡洛抽样进行高效近似。同时,外观差异项定义为球谐颜色特征向量之间的欧氏距离平方 \(\mathcal{D}_{\mathrm{app}}(i, j) = \|f_i - f_j\|_2^2\)。综合代价结合了几何与外观失真,使得系统优先折叠空间高度重叠、法向尺度一致且颜色接近的高斯对。

3. 保质量矩匹配(MPMM):基于空间质量加权与概率并集的不透明度闭式融合

选定合并对 \((i, j)\) 后,必须确定新生成图元 \(m\) 的三维几何中心、各向异性协方差、不透明度及球谐特征。传统矩匹配通常仅依赖不透明度作为加权系数,容易导致微小但高不透明度的边缘噪点错误主导大体积半透明表面,引发孔洞与表面撕裂。MPMM 核心切入点是将每个高斯在三维空间积分的总质量 \(w_i = (2\pi)^{3/2} \alpha_i \prod_{k} s_{i,k}\) 作为物理权重,综合考量图元体积与不透明度。新均值 \(\mu_m\) 与球谐特征 \(f_m\) 均采用质量加权计算: $\(\mu_m = \frac{w_i \mu_i + w_j \mu_j}{W}, \quad f_m = \frac{w_i f_i + w_j f_j}{W}\)$ 为了保证空间分布的二阶统计一致性,融合协方差 \(\Sigma_m\) 显式分解为核平均与核膨胀两部分: $\(\Sigma_m = \frac{1}{W} \sum_{k \in \{i, j\}} w_k \Sigma_k + \frac{1}{W} \sum_{k \in \{i, j\}} w_k (\mu_k - \mu_m)(\mu_k - \mu_m)^\top\)$ 第一项保持了两高斯内部的固有几何形状与方向,第二项色散项(dispersion)则显式捕捉两均值中心在空间上的分离程度,促使合并后的包络椭球自适应膨胀以完整覆盖双峰区域。对于不透明度,采用 Porter-Duff source-over 透光率相乘的并集规则:\(\alpha_m = 1 - (1 - \alpha_i)(1 - \alpha_j) = \alpha_i + \alpha_j - \alpha_i \alpha_j\)。该饱和闭式表达确保了合并区域的光线阻挡能力不发生衰减,从根本上抑制了极端压缩率下物体变薄、镂空的伪影。

一个完整示例

以合成场景中两个临近的高斯图元 \(i\)\(j\) 为例:图元 \(i\) 为主体表面大尺寸高斯,缩放尺积为 0.08,不透明度 \(\alpha_i = 0.8\);图元 \(j\) 为局部补丁高斯,缩放尺积为 0.02,不透明度 \(\alpha_j = 0.6\)。 1. 计算质量权重:图元 \(i\) 的质量权重 \(w_i \propto 0.08 \times 0.8 = 0.064\),而 \(j\) 的质量权重 \(w_j \propto 0.02 \times 0.6 = 0.012\)。总质量权重中图元 \(i\) 占据约 84.2%。 2. 几何与外观融合:新高斯中心 \(\mu_m\) 被拉向占据主导地位的图元 \(i\),其球谐颜色向量 \(f_m\) 绝大部分保留图元 \(i\) 的基色,有效抑制了小噪点的颜色偏移。 3. 协方差与扩散:若两高斯中心距离微小,色散项接近零,新协方差矩阵主要继承两者的主轴方向;若存在微小错位,第二阶散度项自动增大主轴半径,形成一个平滑包裹两者的椭球体。 4. 不透明度叠加:根据透光率乘积,新不透明度 \(\alpha_m = 1 - (1 - 0.8)(1 - 0.6) = 0.92\),确保遮挡物不会因图元合并而变淡透光。

实验关键数据

主实验

在 NeRF-Synthetic、Mip-NeRF 360、Tanks & Temples 以及 Deep Blending 四大基准数据集(共 21 个场景)上,对压缩比 \(\rho \in \{0.1, 0.01, 0.001\}\)(即保留 10%、1%、0.1% 图元)进行全面评估。所有方法均不进行压缩后的微调以体现免训练后处理的纯粹能力。下表汇总了主干基准上的 PSNR、SSIM 与渲染帧率 FPS(对比方法包括 LightGS、PUP3DGS 与 GHAP):

数据集 压缩比 \(\rho\) LightGS [NeurIPS 24] PUP3DGS [CVPR 25] GHAP [NeurIPS 25] 本文 (NanoGS) 相比最强基线提升
NeRF-Synthetic 0.1 21.25 / 0.875 / 2205 20.24 / 0.860 / 2341 20.09 / 0.838 / 2487 25.81 / 0.910 / 2450 +4.56 dB
(完整: 33.66 / 0.970) 0.01 15.76 / 0.807 / 2571 13.26 / 0.786 / 2676 12.81 / 0.776 / 2679 22.28 / 0.858 / 2598 +6.52 dB
0.001 12.64 / 0.796 / 2624 11.31 / 0.792 / 2839 11.07 / 0.791 / 2916 19.04 / 0.822 / 2641 +6.40 dB
Mip-NeRF 360 0.1 19.38 / 0.588 / 727 15.59 / 0.513 / 996 17.35 / 0.444 / 1224 21.97 / 0.582 / 1015 +2.59 dB
(完整: 27.46 / 0.815) 0.01 14.39 / 0.389 / 1526 10.19 / 0.161 / 2408 10.62 / 0.174 / 2557 19.39 / 0.470 / 2006 +5.00 dB
0.001 11.97 / 0.278 / 2071 8.81 / 0.056 / 2650 8.52 / 0.035 / 2623 17.20 / 0.430 / 2194 +5.23 dB
Tanks & Temples 0.1 17.50 / 0.642 / 1108 12.71 / 0.564 / 1283 15.34 / 0.487 / 1666 17.94 / 0.626 / 1430 +0.44 dB
(完整: 23.63 / 0.847) 0.01 12.29 / 0.441 / 1996 8.22 / 0.266 / 2434 8.43 / 0.220 / 2659 15.29 / 0.501 / 2326 +3.00 dB
0.001 9.36 / 0.341 / 2419 6.78 / 0.162 / 2593 5.33 / 0.026 / 2670 13.54 / 0.457 / 2487 +4.18 dB
Deep Blending 0.1 24.28 / 0.816 / 891 19.65 / 0.755 / 1325 21.75 / 0.739 / 1376 26.29 / 0.839 / 1202 +2.01 dB
(完整: 29.56 / 0.903) 0.01 18.28 / 0.712 / 1879 8.83 / 0.282 / 2478 11.36 / 0.435 / 2583 23.12 / 0.780 / 2132 +4.84 dB
0.001 13.41 / 0.616 / 2296 7.06 / 0.073 / 2672 7.06 / 0.061 / 2627 19.42 / 0.739 / 2322 +6.01 dB

消融实验

消融实验探究了候选图构建方式(KNN 邻域图 vs 八叉树 Octree)、初始不透明度初筛过滤,以及合并几何时代价函数(基于信息论的 I-Divergence vs 均方误差 MSE 替代)对化简质量的影响。下表汇报了 NeRF-Synthetic 与 Mip-NeRF 360 在不同压缩比下的 PSNR / SSIM:

数据集 配置说明 \(\rho = 0.1\) \(\rho = 0.01\) \(\rho = 0.001\) 说明
NeRF-Synthetic 完整模型 (Full) 25.81 / 0.910 22.28 / 0.858 19.04 / 0.822 完整 KNN + 初筛 + I-Divergence
去除 KNN 图 (w/o KNN, 改用 Octree) 25.53 / 0.905 20.74 / 0.839 15.85 / 0.800 极端比率下 PSNR 骤降 3.19 dB
去除不透明度过滤 (w/o filtering) 24.99 / 0.904 22.01 / 0.858 18.87 / 0.822 噪声漂浮物参与合并略微损耗画质
去除 I-Divergence (w/o I-div, 改用 MSE) 25.65 / 0.908 22.15 / 0.854 18.80 / 0.819 缺少概率分布真实度量导致细微失真
Mip-NeRF 360 完整模型 (Full) 21.97 / 0.582 19.39 / 0.470 17.20 / 0.430 真实无界场景下的最高保真度
去除 KNN 图 (w/o KNN, 改用 Octree) 21.53 / 0.537 17.82 / 0.444 14.11 / 0.382 结构性邻域错配导致极端比率剧降 3.09 dB
去除不透明度过滤 (w/o filtering) 18.24 / 0.504 15.47 / 0.421 14.67 / 0.401 真实场景大量半透明浮空物严重拉低渲染分数
去除 I-Divergence (w/o I-div, 改用 MSE) 21.61 / 0.566 19.19 / 0.467 16.98 / 0.426 连续各向异性分布逼近精度退化

关键发现

  • 极端压缩下的断崖式对比:在常规轻度压缩(\(\rho=0.1\))下,各剪枝基线尚能维持轮廓;但当深入到极端压缩(\(\rho=0.01\)\(\rho=0.001\))时,基于重要性剪枝的方法(LightGS、PUP3DGS)由于直接删减图元造成严重几何孔洞,GHAP 缺乏图像重训同样发生结构溃缩。NanoGS 在所有数据集上的 PSNR 均稳居第一,且在 \(\rho=0.001\) 时平均超越最强基线多达 5.46 dB。
  • KNN 局部拓扑与初筛的互补性:八叉树粗暴的空间网格划分在细粒度表面合并时容易发生跨边界错误连接,使得 \(\rho=0.001\) 下 NeRF-Synthetic 掉点达 3.19 dB;而真实室外场景(Mip-NeRF 360)中背景存在大量极低不透明度的悬浮杂质,初筛能够直接避免这些杂质在贪心合并中将前景有用高斯向外拖拽扩散。
  • 纯 CPU 处理极度高效且正交互补:在室外大场景(原始 1122 MB)中,NanoGS 在单 CPU 上仅需 88 秒即可完成 10 倍化简(GPU 仅需 17 秒);因其完整保留标准 3DGS 原生参数结构,下游可直接级联 SOG 等熵编码与量化算法,在已有化简基础上再额外获得 6.35 倍位级存储压缩。

亮点与洞察

  • 解耦的免训练模块化架构:将图元化简拆解为候选拓扑、代价函数与合并算子三个独立正交维度。这一设计不仅解释了免训练化简的有效性本质,更为未来引入感知/语义权重甚至逆向高斯超分辨率裂变提供了标准接口。
  • 物理自洽的保质量矩匹配机制:巧妙地将各向异性三维椭球的体积与不透明度积定义为连续质量,将均值迁移与协方差膨胀建立在严格的二阶物理矩上,彻底攻克了传统合并中图元面积收缩与表面撕裂的结构性难题。
  • 开箱即用的格式兼容性与泛化能力:无需反向传播梯度、无需渲染视点,完全在原生 3DGS 属性空间内执行闭式运算,使得来自单图生成、文字生成 3D 及无多视角相机的三维模型均可获得即插即用的轻量化支持。

局限与展望

  • 动态时空场景的延展受限:目前框架主要针对静态 3DGS 场景设计,对于 4D 动态高斯(携带时间变形场或物理驱动属性)的邻域跟踪与速度矢量矩匹配尚需进一步探索。
  • 各向异性极端细长基元的近似边界:当相交合并的两个高斯长宽比极其悬殊(如发丝或纤细电线)时,单高斯矩匹配的膨胀项容易造成局部几何过度模糊,未来可探索多对一(Many-to-one)或局部非各向同性自适应混合。
  • 球谐高阶视依赖特征的平权简化:当前外观代价仅计算球谐系数的二范数差,对复杂高频镜面反射(如高光走位)在合并后容易产生轻微对比度平滑,引入视锥权重或感知损失将是潜在改进方向。

相关工作与启发

  • vs LightGS [Fan et al., NeurIPS 2024]: LightGS 依赖图像重投影灵敏度进行重要性剪枝与显存恢复微调;NanoGS 无需任何多视角训练图像,直接在图元空间进行矩匹配合并,在极度缺图元(\(\rho=0.001\))下避免了表面的穿孔断裂。
  • vs GHAP [Wang et al., NeurIPS 2025]: GHAP 基于最优传输进行全局混合高斯化简,但其强烈依赖后续的外观优化阶段来恢复纹理;NanoGS 依靠保质量矩匹配和 I-Divergence 代价,在纯免训练推导下即保持了优异的色彩与几何保真度。
  • vs H3DGS [Kerbl et al., TOG 2024]: H3DGS 将矩匹配融合固化在预设的包围体层次结构(BVH)与重训流程中用于实时动态 LOD 渲染;NanoGS 则将候选拓扑与合并代价解耦,专注于永久性离线紧凑化,合并层次结构是基于代价驱动的自然涌现产物。

评分

  • 新颖性: ⭐⭐⭐⭐ [解耦免训练高斯合并架构,提出保质量矩匹配与 I-Divergence 组合代价]
  • 实验充分度: ⭐⭐⭐⭐⭐ [跨 4 个标准数据集、21 个场景、3 档极端化简比率,对比完备且包含 CPU/GPU 时间分析]
  • 写作质量: ⭐⭐⭐⭐⭐ [结构严谨,数学推导直观清晰,三阶段模块化叙述层次分明]
  • 价值: ⭐⭐⭐⭐⭐ [工业落地价值极高,彻底摆脱多视角相机与 GPU 重训依赖,兼容任意 3DGS 光栅化器]