RaPTGS: Render-Agnostic Post-Training Compression of 3D Gaussian Splatting¶
会议: ECCV 2026
论文: ECCV 2026
领域: 3D视觉
关键词: 3D高斯泼溅, 后训练压缩, 渲染无关剪枝, 体素质量补偿, 矢量量化
一句话总结¶
针对现实资产分发中缺失训练视点与渲染管线的严格“纯模型”后训练场景,RaPTGS 提出结合不透明度、形状各向异性与尺度感知高频外观能量的渲染无关多准则剪枝,配合免训练的体素质量补偿、分度数球谐矢量量化以及基于空间重排序的熵编码,实现了 30 倍的高保真极速压缩。
研究背景与动机¶
3D 高斯泼溅(3DGS)凭借连续高斯图元的高效光栅化,在实时、高保真新视角合成任务中取得了巨大成功。然而,逼真场景往往需要数百万个包含位置、尺度、旋转、不透明度以及高阶球谐(SH)系数的多属性高斯,导致模型存储体积动辄达到数百兆乃至数吉字节,极大地阻碍了 3D 资产的云端分发、移动端缓存与边缘设备部署。为了缓解这一瓶颈,学术界提出了大量剪枝、量化与结构化压缩方案。
现有压缩方法普遍存在一个严苛的前提假设:它们重度依赖对原始多视角训练图像、相机位姿或渲染管线本身的访问。例如,基于敏感度分析或视点可见性的剪枝算法(如 LightGaussian、MesonGS、POTR)需要执行大量前向光栅化或反向传播来评估高斯贡献,而微调方案(如 PUP 3D-GS、MesonGS-FT)则需要进行耗时的重训练。然而,在现实的资产归档、第三方分发与即插即用场景中,用户通常只能拿到最终训练好的 3DGS 模型文件,原始采集图像与 SfM/COLMAP 元数据往往缺失、私有或难以一同传输。在这种纯模型(model-only)约束下,若仅采用简单的全局不透明度阈值进行无监督剪枝,又会灾难性地抹除纤细几何、树叶枝杈或文字纹理等高频细节。
针对这一困境,本文的切入角度是:直接从高斯图元本身的几何与外观参数中解耦出内在重要性,完全脱离视点渲染循环与重训练。核心 idea:构建由不透明度显著性、形状各向异性强度与尺度感知外观能量组成的多准则极大池化重要性指标,实现渲染无关的高斯剪枝;随后通过解析几何的体素质量补偿保守恢复局部体积覆盖,再辅以分度数球谐矢量量化与空间重排序熵编码,在免微调、免渲染的前提下达成高效保真压缩。
方法详解¶
整体框架¶
RaPTGS 严格在“纯模型(model-only)”约束下工作,其压缩流水线分为四个阶段: 1. 渲染无关剪枝(Render-Agnostic Pruning):通过计算每个高斯图元的几何与外观代理指标(不透明度显著性、形状各向异性、尺度感知外观能量),经百分位数归一化后执行最大池化打分,全局保留 Top-\(K\) 个高斯; 2. 剪枝后几何精化(Post-Pruning Refinement / VMC):将空间离散化为自适应体素网格,通过体素质量补偿(Voxel Mass Compensation)解析计算剪枝前后的质量比率,等比膨胀保留高斯的轴向尺度并施加最大尺度截断,免训练弥合局部空洞; 3. 分度数球谐系数矢量量化(Degree-wise SH Quantization):将高阶 AC 球谐系数按阶数 \(\ell \in \{1, 2, 3\}\) 分组,在全局比特预算约束下基于重构误差动态分配各阶码本位宽,经 K-Means 聚类生成码本与索引表; 4. 属性空间重排序与熵编码(Attribute Compression):利用 Hilbert 空间填充曲线初排与并行窗口化 2-opt 局部重排最小化高斯位置流的 \(\ell_1\) 路径长度,配合均匀量化与无损熵编码进一步消除数据冗余。
整体流水线如下图所示:
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入: 预训练 3DGS 模型<br/>(位置、尺度、旋转、不透明度、SH)"] --> B["渲染无关多准则剪枝<br/>OS + SAS + SAE 百分位最大池化"]
B --> C["体素质量补偿 (VMC)<br/>网格质量守恒与保守尺度截断"]
C --> D["分度数球谐矢量量化<br/>AC SH 按阶分组与比特预算优化"]
D --> E["属性空间重排序与熵编码<br/>Hilbert 粗排 + 并行 2-opt 精排"]
E --> F["输出: 30× 紧凑压缩模型<br/>(无损熵编码流与码本映射表)"]
关键设计¶
1. 渲染无关多准则重要性评分:解耦视点依赖的图元筛选
传统方法依赖多视点渲染积分计算图元重要性,纯模型场景下不可行;若退化为单一的不透明度过滤,又会因平滑表面大高斯透明度高、纤细边缘小高斯透明度适中而误删结构细节。本文通过三个互补的内在物理代理来判定高斯重要性。首先定义高斯图元的线性几何延展度 \(e_i = s_{i,x} + s_{i,y} + s_{i,z}\),避免乘积体积在扁平高斯上退化为零的问题。三个代理准则为: - 不透明度显著性(Opacity Salience, OS):\(\mathrm{OS}_i = \alpha_i\),反映 Alpha 混合的潜在能见度; - 形状各向异性强度(Shape Anisotropy Strength, SAS):利用最大与最小尺度分量之比衡量几何特异性,并以对数衰减与不透明度加权,定义为 \(\mathrm{SAS}_i = \alpha_i \log\left(\frac{\max(s_{i,x}, s_{i,y}, s_{i,z})}{\min(s_{i,x}, s_{i,y}, s_{i,z}) + \varepsilon}\right)\),强力保留细丝、边缘与平坦表面; - 尺度感知外观能量(Scale-Aware Appearance Energy, SAE):衡量高阶(\(\ell \ge 1\))球谐系数的视点依赖复杂度。为防止线性尺度过度惩罚承载高频纹理的微小高斯,算法将有效延展度下限截断为 \(\tilde{e}_i = \max(e_i, e_{\min})\)(其中 \(e_{\min}\) 使得极小高斯占场景总足迹的 15%),定义为 \(\mathrm{SAE}_i = \alpha_i \tilde{e}_i \sum_{\ell \ge 1} \|c_i^{(\ell)}\|_2\)。
三者量纲迥异,算法对每个准则在全体 \(N\) 个高斯中计算百分位排名 \(\pi(\cdot) \in [0, 1]\),最终得分通过最大池化(逻辑“或”)聚合: $\(\mathcal{I}_i = \max\Big(\pi(\mathrm{OS}_i), \pi(\mathrm{SAS}_i), \pi(\mathrm{SAE}_i)\Big)\)$ 该设计确保任一高斯只要在能见度、几何特异性或视点依赖纹理任一方面突出即被保留,只剔除三维度均无贡献的冗余图元。
2. 体素质量补偿(VMC):无渲染反馈下的几何覆盖解析修复
大比例剪枝后,被删图元所占据的空间会出现局部覆盖空洞与半透明稀疏化。由于脱离训练图像无法进行反向传播微调,必须采用解析几何方式恢复局部支撑质量。算法首先通过二分查找自适应确定体素网格尺寸 \(h^*\),使有效体素总数近似等于保留的高斯数量 \(|G'|\)。定义单个高斯的空间支撑质量为 \(\mathrm{SSM}_i = \alpha_i e_i = \alpha_i (s_{i,x} + s_{i,y} + s_{i,z})\),体素 \(v\) 的总体质量为该体素内所有高斯支撑质量之和: $\(\mathcal{M}_v = \sum_{g_i \in \mathcal{V}_v} \alpha_i (s_{i,x} + s_{i,y} + s_{i,z})\)$ 随后计算剪枝前后体素内的质量衰减比率 \(\rho_v = \mathcal{M}_v^{\mathrm{pre}} / \mathcal{M}_v^{\mathrm{post}}\),并将其作为补偿膨胀因子施加到保留高斯的三个尺度轴上。为避免极端稀疏区域因 \(\mathcal{M}_v^{\mathrm{post}}\) 极小导致高斯无限膨胀产生浮空伪影,算法引入保守截断机制:记录剪枝前该体素内高斯在各个轴向上的最大尺度值 \(\max_{g_i \in \mathcal{V}_v} s_{i,k}\),膨胀后的高斯尺度被严格截断在该原始局部上限之内,实现了兼顾局部填充与边界清晰度的免训练修复。
3. 分度数球谐矢量量化与空间重排序熵编码:高阶属性的高密度压缩
3DGS 中高阶球谐系数(AC SH)占据了超过 75% 的原始存储,但不同阶数球谐的频率特性和方差差异显著。算法将 AC 球谐系数按度数划分为三组:\(L_1 \in \mathbb{R}^9\)、\(L_2 \in \mathbb{R}^{15}\)、\(L_3 \in \mathbb{R}^{21}\)。在总比特预算 \(B = b_1 + b_2 + b_3\) 约束下,通过最小化加权均方重构误差优化全局比特分配: $\(\min_{b_1 + b_2 + b_3 = B} \sum_{i=1}^3 d_i \mathrm{MSE}_{L_i}(b_i), \quad d_i = 3(2\ell_i + 1)\)$ 利用 K-Means 为各阶生成规模为 \(K_i = 2^{b_i}\) 的紧凑码本,并记录高斯索引映射。
在底层编码阶段,针对高斯属性散乱存储导致熵编码压缩率低的问题,算法利用 16 位量化的高精度位置坐标引导序列重排序。为最小化高斯序列相邻点之间的 \(\ell_1\) 路径距离 \(L(\pi) = \sum \|x_{\pi_i} - x_{\pi_{i+1}}\|_1\),提出两阶段优化:第一阶段通过 Axes-to-Transpose 快速计算 3D Hilbert 曲线编码进行全局粗排;第二阶段在窗口 \(W = |G'|^{1/3}\) 内设计基于模运算解耦的并行窗口化 2-opt 启发式局部交换算法,迭代直到路径改善率低于 0.1%。空间高度局部化的高斯属性随后经过均匀量化(尺度/旋转/不透明度 7 位,SH 码本 8 位),输入 JPEG XL 无损熵编码器,将模型体积压缩至极限。
损失函数 / 训练策略¶
该方法属于完全免微调(Fine-tuning-free)、免优化器迭代的后处理算法,无需渲染损失或梯度反向传播。关键超参数包括:剪枝比例 \(p \in [0.35, 0.45]\),球谐总比特预算 \(B \in [28, 36]\)(各阶候选位宽 \(b_i \in \{8, \dots, 14\}\)),体素匹配目标 \(V^* = |G'|\),以及 2-opt 局部搜索窗口 \(W = |G'|^{1/3}\)。
实验关键数据¶
主实验¶
在 Mip-NeRF 360、Tanks & Temples 以及 Deep Blending 三大标准评测数据集上,将 RaPTGS 与未压缩 3DGS、免微调基线(FlexGaussian、MesonGS)、带微调基线(MesonGS-FT、PUP 3D-GS)进行定量评测,如下表所示(存储体积单位为 MB):
| 数据集 | 指标 | 本文 (RaPTGS) | 原始 3D-GS | FlexGaussian (免微调) | MesonGS (免微调) | MesonGS-FT (需微调) |
|---|---|---|---|---|---|---|
| Mip-NeRF 360 | PSNR↑ / SSIM↑ / LPIPS↓ | 26.41 / 0.782 / 0.252 | 27.09 / 0.805 / 0.226 | 26.31 / 0.775 / 0.254 | 26.30 / 0.785 / 0.250 | 26.98 / 0.799 / 0.240 |
| 模型大小 (Size)↓ | 25.95 MB | 795.26 MB | 42.40 MB | 28.29 MB | 28.34 MB | |
| Tanks & Temples | PSNR↑ / SSIM↑ / LPIPS↓ | 22.97 / 0.823 / 0.203 | 23.38 / 0.841 / 0.182 | 22.52 / 0.807 / 0.215 | 23.02 / 0.828 / 0.198 | 23.28 / 0.834 / 0.194 |
| 模型大小 (Size)↓ | 13.64 MB | 421.90 MB | 16.31 MB | 16.51 MB | 16.56 MB | |
| Deep Blending | PSNR↑ / SSIM↑ / LPIPS↓ | 29.36 / 0.899 / 0.248 | 29.52 / 0.902 / 0.243 | 28.65 / 0.887 / 0.265 | 29.22 / 0.898 / 0.250 | 29.45 / 0.902 / 0.247 |
| 模型大小 (Size)↓ | 24.51 MB | 703.77 MB | 25.60 MB | 27.62 MB | 27.70 MB |
在压缩耗时对比上(Intel Ultra 9 285K + RTX 5080),RaPTGS 表现出数量级的速度优势: - Mip-NeRF 360: FlexGaussian 为 42.44s,MesonGS 为 199.97s,本文仅需 7.60s; - Tanks & Temples: FlexGaussian 为 30.25s,MesonGS 为 227.43s,本文仅需 5.78s; - Deep Blending: FlexGaussian 为 44.20s,MesonGS 为 159.23s,本文仅需 7.70s。
此外,在前传神经网络压缩模型 FCGS 的跨模型对比中,FCGS 在 16GB 显存设备上面对 30k 完整模型全部 OOM,即使在轻量级 7k 模型上(如 bonsai/kitchen/train),RaPTGS 依然以 2.8GB 左右的超低峰值显存(FCGS 需 10.5-13.5GB)和约 2 倍更紧凑的体积(bonsai-7k: 8.61 MB vs 17.78 MB)大幅胜出。
消融实验¶
1. 流水线阶段级联消融(Mip-NeRF 360, \(p=0.45, B=32\)):
| 流水线阶段 | PSNR (dB)↑ | SSIM↑ | LPIPS↓ | 模型体积 (MB)↓ | 累计耗时 (s)↓ | 说明 |
|---|---|---|---|---|---|---|
| 原始 3D-GS | 27.09 | 0.805 | 0.226 | 795.26 | - | 原始基线 |
| + 多准则剪枝 | 26.57 | 0.793 | 0.238 | 437.39 | 0.18 | 仅剔除 45% 无效高斯 |
| + 体素质量补偿 (VMC) | 26.74 | 0.795 | 0.237 | 437.39 | 0.21 | 体积不变,PSNR 提升 +0.17 dB |
| + SH 矢量量化 | 26.40 | 0.788 | 0.249 | 119.93 | 3.31 | AC SH 大幅精简,体积锐减 72% |
| + 属性均匀量化 | 26.24 | 0.778 | 0.255 | 32.66 | 5.13 | 几何属性定点化 |
| + Hilbert 排序重排 | 26.24 | 0.778 | 0.255 | 25.39 | 5.19 | 空间局部连续性压缩增益 |
| + 2-Opt 局部精细重排 | 26.24 | 0.778 | 0.255 | 24.55 | 6.08 | 进一步收缩位置残差熵 |
| 完整流水线 (Full Pipeline) | 26.24 | 0.778 | 0.255 | 24.55 | 7.93 | 压缩比达 32.4×,耗时不到 8 秒 |
2. 剪枝准则与聚合机制消融(Mip-NeRF 360, \(p=0.45\)):
| 变体配置 | PSNR (dB)↑ | SSIM↑ | LPIPS↓ | 说明 |
|---|---|---|---|---|
| 仅不透明度 (Only OS) | 25.77 | 0.781 | 0.241 | 严重损失高频结构与边缘 |
| 仅各向异性 (Only SAS) | 25.93 | 0.782 | 0.242 | 忽视视点依赖与平滑表面 |
| 仅外观能量 (Only SAE) | 25.37 | 0.782 | 0.247 | 缺乏几何与透明度约束 |
| 剔除不透明度 (w/o OS) | 26.54 | 0.792 | 0.239 | 指标全面轻微下滑 |
| 剔除各向异性 (w/o SAS) | 26.53 | 0.792 | 0.239 | 细丝几何保持能力受损 |
| 剔除外观能量 (w/o SAE) | 25.98 | 0.783 | 0.239 | 严重破坏视点高频纹理 (-0.59 dB) |
| SAE 无下限截断 (w/o clamp) | 26.46 | 0.791 | 0.240 | 微小高斯被过度误剪 |
| 求和聚合 (Sum Pooling) | 26.48 | 0.792 | 0.237 | 单维度特长易被平均化掩盖 |
| 最大池化聚合 (Max Pooling, 本文) | 26.57 | 0.793 | 0.238 | 逻辑“或”最佳保留互补特性 |
关键发现¶
- 多准则最大池化的互补性:单靠不透明度剪枝在 \(p=0.45\) 时 PSNR 仅为 25.77 dB,而结合各向异性与外观能量的多准则最大池化可达 26.57 dB(+0.80 dB)。尤其 SAE 外观能量的引入贡献了高达 0.59 dB 的提升;最大池化避免了单一指标的劣势拖累综合得分,充当了精准的“只要有一项不可替代就保留”的保真门控。
- VMC 的无损回血效应:在不增加任何图元数量的前提下,VMC 通过物理支撑质量守恒使得 PSNR 直接回升 0.17 dB,尤其在剪枝率 \(p > 0.4\) 的较稀疏区域,VMC 弥补空洞的效果尤为显著。
- 空间重排对熵编码的巨大赋能:Hilbert 排序结合并行 2-opt 优化在不改变渲染指标的前提下,将量化模型存储体积从 32.66 MB 压降至 24.55 MB(节省 25% 空间),证实了降低 1D 扫描几何路径长度对消除残差熵的核心价值。
亮点与洞察¶
- 彻底摆脱渲染视点与相机的枷锁:颠覆了传统 3DGS 压缩必须依靠训练图像多视角渲染计算可见性的常规认知,利用三项内在解析指标完美逼近了图元的全局显著性,使脱机、无标定参数的通用 3D 资产快速压缩成为可能。
- 解析质量守恒代替迭代微调:提出体素质量补偿(VMC)与局部尺度上限截断,以不到 0.05 秒的解析计算替代了传统需要数分钟的多轮光栅化微调,为免训练后处理开辟了优雅的物理几何路径。
- 高度优化的工业级加速设计:通过并行窗口化 2-opt 解决百万级图元 TSP 路径规划难题,将整个 30 倍压缩流程严格压缩在 8 秒之内,显存占用不足 3GB,完全适配消费级硬件与边缘工作流。
局限与展望¶
- 缺乏视线遮挡(Occlusion)的动态感知:由于完全不进行任何光栅化渲染,算法无法感知高斯之间的视线遮挡关系。在深层内部完全被遮挡但自身外观能量较高的高斯可能被保留,导致超高剪枝比(如 \(p > 0.6\))时相比依赖渲染的方法(如 MesonGS)性能落差加大。
- 超高压缩比下 VMC 补偿上限:VMC 依赖局部残留的高斯图元进行质量膨胀;当某一局部区域图元几乎被全部清空时,VMC 因尺度上限保护而无法无中生有恢复几何,且缺乏图像反馈指导。
- 未来展望:作者指出未来可探索在纯模型约束下引入轻量级的“自渲染合成视点(Self-rendered Synthetic Views)”,仅在模型内部自主生成稀疏视点获取遮挡线索,兼顾纯模型独立性与遮挡感知能力。
相关工作与启发¶
- vs LightGaussian / MesonGS: 后者均依赖训练相机视点执行前向渲染或计算全局显著度得分,MesonGS 甚至需要反向微调;RaPTGS 仅依赖模型参数本身,耗时由数百秒降低至数秒,且摆脱了对数据集和位姿的依赖。
- vs FCGS: FCGS 虽同为免优化器方案,但采用前传自编码器神经网络,参数庞大且极其消耗显存(在 16GB 设备上 30k 场景全线 OOM);RaPTGS 采用轻量解析算法,显存占用降低 4.5 倍以上,完全兼容大场景。
- vs 传统纯不透明度阈值剪枝: 简单不透明度过滤会导致严重欠拟合和高频细节丢失;RaPTGS 的形状各向异性与外观能量能够强力护航细长边缘与高频复杂视效。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ (在纯模型场景下首次构建完善的渲染无关多准则剪枝与解析质量补偿流水线)
- 实验充分度: ⭐⭐⭐⭐⭐ (在三大基准上全面对比免微调、带微调、视频编解码及前传网络方法,消融实验详实)
- 写作质量: ⭐⭐⭐⭐⭐ (逻辑清晰,动机切入精准,数学推导与实验分析极为严谨)
- 价值: ⭐⭐⭐⭐⭐ (高度契合 3D 资产分发与边缘渲染的工业落地需求,具备极佳的工程实用价值)