跳转至

EGGS: Explicitly Granular 3D Gaussian Splatting via Luma-Aware and Volume-Preserving Attribute Factorization

会议: ECCV 2026
论文: ECCV 原文
领域: 3D视觉
关键词: 3D高斯泼溅, 神经渲染, 3DGS压缩, 属性因子分解, 神经场

一句话总结

针对 3DGS 显式属性存储极度膨胀的痛点,EGGS 提出基于亮度的球谐 DC 压缩与保体积尺度因子分解,将每个高斯显式属性降至极简维度(最低仅 9 维),配合轻量全局 MLP 隐式估计重建,将场景存储压缩至数兆字节并保持超过 140 FPS 的高质量实时渲染。

研究背景与动机

3D 高斯泼溅(3DGS)凭借其基于各向异性高斯图元的显式场景表达与平铺式可微光栅化,在保持高质量自由视点合成的同时实现了突破性的实时渲染速度。然而,为了逼真地重构复杂真实场景,3DGS 往往需要数百万个图元。每个高斯图元均显式存储了三维中心坐标、不透明度、四元数旋转、三维各向异性尺度以及高达多阶的球谐函数(SH)系数,这导致单个场景的数据体积动辄达到数百兆乃至数吉字节,极大地阻碍了 3D 资产在移动终端、XR 头显等资源受限设备上的快速传输与高效部署。

现有针对 3DGS 存储开销的优化主要分为三类路径:通过重要性修剪降低图元数量、基于矢量量化与熵编码的传统数据压缩、以及借助神经场预测部分属性的混合表达。然而,现有隐式或混合方法在压缩尺度和基色等核心属性时面临两难困境:若直接对三维尺度因子采用朴素的单维度残差分解,由于隐式尺度在无约束优化下极易发生数值发散,导致优化崩溃;若完全去除球谐基底直流分量(DC)的显式存储,重建图像质量又会发生剧烈劣变。

本文的切入角度在于:视知觉对亮度和色度的敏感度天然不对称,且几何尺度的优化稳定性本质上依赖于体积约束而非单轴自由度。核心 idea:通过基于 YUV 空间主导亮度的 DC 分量单维显式压缩与保体积尺度因子分解,将每个高斯的显式属性极致压缩至仅 9 维,结合轻量局部特征与全局 MLP 隐式网络实现高质量属性重建与可配置码率控制。

方法详解

整体框架

EGGS 的整体目标是将传统 3DGS 每个图元包含的数十个显式参数压缩为一个极紧凑的显式基底加全局轻量解码器的混合表征。对于场景中的每一个高斯图元 \(G_i\),EGGS 仅保留 4 类显式存储信息:三维中心坐标 \(p \in \mathbb{R}^3\)、一维尺度幅值 \(s_m \in \mathbb{R}^1\)、一维直流亮度 \(k^0_Y \in \mathbb{R}^1\) 以及 \(D_L\) 维的可配置局部特征 \(f_L \in \mathbb{R}^{D_L}\)(当 \(D_L=4\) 时,单图元显式维度仅为 9 维)。

在解码与重建阶段,EGGS 通过 6 个极轻量的单隐层全局 MLP(隐层仅 64 神经元)完成所有隐式属性的恢复。中心坐标 \(p\) 经过位置编码(PE)与位置网络 MLP\(_\text{Pos}\) 生成隐式位置特征,并与显式局部特征 \(f_L\) 拼接构成混合特征 \(f_H\)。混合特征作为条件输入,驱动其余属性网络并行预测非直流球谐系数 \(k^{1+}\)、旋转四元数 \(r\) 以及不透明度 \(o\)。同时,\(f_H\) 参与专门设计的直流色度分支与尺度因子分支,最终解码恢复出标准 3DGS 所需的全套几何与辐射属性并送入可微光栅化管线。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    In["显式高斯输入<br/>p ∈ R³, sm ∈ R¹, k0Y ∈ R¹, fL ∈ R^DL"] --> Enc["特征拼接融合<br/>PE(p)过MLP_Pos 与 fL拼接得到混合特征 fH"]
    Enc --> D1["1. 亮度感知直流分量表征<br/>fH经MLP_UV预测色度k0_UV,拼合k0Y转RGB得k0"]
    Enc --> D2["2. 保体积尺度因子分解<br/>fH经MLP_Scale预测各向异性因子sf,零均值指数调制sm"]
    Enc --> D3["3. 紧凑混合隐式属性估计<br/>fH并行解码非DC球谐k1+、旋转r与不透明度o"]
    D1 --> Out["高保真 3DGS 属性输出与实时光栅化"]
    D2 --> Out
    D3 --> Out

关键设计

1. 亮度感知直流分量表征:消除基底色彩冗余并保留核心结构

球谐函数第 0 阶直流分量 \(k^0\) 决定了高斯图元的基准色彩,直接影响场景的基础亮度和主色调。以往混合压缩方法要么直接显式存储 3 维 RGB 直流值,带来不小的存储负担,要么完全隐式预测却导致颜色漂移与结构模糊。EGGS 借鉴经典数字视频编码思想,利用人类视觉系统对亮度细节高度敏感、对色度变化容忍度高的特性,将三维 RGB 直流分量投影至 YUV 颜色空间。

在显式存储中,EGGS 仅保存代表场景轮廓、阴影与纹理结构的主导亮度标量 \(k^0_Y \in \mathbb{R}^1\)。而感知敏感度较低的二维色度分量 \(k^0_{UV} \in \mathbb{R}^2\) 则交由色度网络 MLP\(_\text{UV}\) 以混合特征 \(f_H\) 为输入隐式预测。最终将显式亮度与隐式色度拼接后反变换恢复为完整 RGB 直流分量: $\(k^0 = \text{YUV-to-RGB}([k^0_Y, \text{MLP}_\text{UV}(f_H)])\)$ 该设计将关键的直流基底存储开销削减了三分之二,在视觉无损的前提下极大地压缩了显式属性体积。

2. 保体积尺度因子分解:解决单维度尺度优化的数值发散崩溃

3DGS 中每个高斯的三维尺度向量 \(s \in \mathbb{R}^3\) 控制其各向异性空间伸展。直接采用单维度基底尺度 \(\gamma\) 与未约束隐式残差向量相乘的朴素分解策略在训练中极易崩溃,原因在于反向传播中隐式因子的各轴分量会无约束发散,使得图元几何膨胀或退化至奇异状态。EGGS 提出保体积约束机制,将尺度分解为显式尺度幅值标量 \(s_m \in \mathbb{R}^1\) 和由尺度网络 MLP\(_\text{Scale}\) 预测的三维各向异性因子向量 \(s_f \in \mathbb{R}^3\)。

为了彻底消除隐式尺度的发散风险,EGGS 强制对预测的因子 \(s_f\) 进行轴向零均值中心化,使得各轴指数调制的几何平均值严格归一: $\(s_i = s_m \cdot \exp(s_{f,i} - \bar{s}_f), \quad \bar{s}_f = \frac{1}{3} \sum_{j \in \{x,y,z\}} s_{f,j}\)$ 由于三个空间轴的指数偏置项在求积时完全相互抵消: $\(\prod_{i \in \{x,y,z\}} s_i = s_m^3 \cdot \exp\left(\sum_{i \in \{x,y,z\}} (s_{f,i} - \bar{s}_f)\right) = s_m^3\)$ 每个高斯图元的物理体积严格由唯一的显式参数 \(s_m^3\) 恒等约束锁定。无论内部隐式因子如何调整各向异性长宽比,图元总体积都不会发生不受控的爆炸性扩张,从数学原理上保障了极端压缩条件下的训练收敛性。

3. 紧凑混合隐式属性估计与可配置率失真控制:兼顾超小体积与灵活精度调控

除尺度与 DC 之外,非直流球谐高阶项 \(k^{1+}\)、四元数旋转 \(r\) 及不透明度 \(o\) 均统一由以混合特征 \(f_H = [f_L, \text{MLP}_\text{Pos}(\text{PE}(p))]\) 为输入的专用单隐层 MLP 输出。为了确保全管线的轻量性与可部署性,所有 MLP 均采用仅 64 个隐藏神经元的紧凑结构,MLP\(_\text{Pos}\) 采用 ReLU 激活,其余网络采用 LeakyReLU 激活,并在 MLP\(_\text{Scale}\) 输出端使用 \(3 \cdot \tanh(\cdot)\) 限幅以进一步增强稳定性。

在量化与熵编码阶段,EGGS 对中心坐标 \(p\) 应用 MPEG G-PCC 点云压缩标准,对标量属性 \(s_m\) 和 \(k^0_Y\) 应用标量/矢量量化(VQ),对局部特征 \(f_L\) 采用子矢量量化(SVQ),并经过霍夫曼编码与 LZMA 压缩打包。更为重要的是,EGGS 将局部特征维度 \(D_L\) 设计为在 4 到 12 之间灵活可配置的超参数。相比粗暴地修剪高斯图元数量破坏场景空间几何密度,在保持高斯骨干的前提下平滑调控 \(D_L\) 能在更宽广的码率区间内取得远优于单纯稀疏化的率失真(RD)权衡。

损失函数 / 训练策略

EGGS 构建于 Mini-Splatting2 基础之上,总训练步数为 20,000 步。前 8,000 步沿用 Mini-Splatting2 的致密化与简化策略以建立高质量高斯几何骨架;在第 8,000 步时,引入 EGGS 的显式与隐式属性解耦表示;在第 13,000 步时,执行基于累积重要性度量的图元简化剔除;从第 19,000 步起,初始化并微调 VQ 与 SVQ 码本直至收敛。

实验关键数据

主实验

在 Mip-NeRF360、Tanks&Temples 和 Deep Blending 三大经典数据集上,EGGS 与当前最先进的 3DGS 压缩及代表性基线进行了全面对比(在 RTX 4000 Ada GPU 上测量渲染帧率):

数据集 方法 SSIM ↑ PSNR (dB) ↑ LPIPS ↓ 体积 (MB) ↓ FPS ↑
Mip-NeRF 360 3DGS (原始基线) 0.809 27.26 0.221 641.04 60
Scaffold-GS 0.811 27.73 0.227 170.03 67
Mini-Splatting2 0.814 27.21 0.224 146.04 162
HAC++ (highrate) 0.810 27.79 0.231 18.05 63
LocoGS-L 0.809 27.34 0.226 13.68 100
OMG-XL 0.818 27.28 0.218 6.82 119
EGGS-XS (本文极小版) 0.793 26.47 0.254 2.67 189
EGGS-L (本文标准版) 0.817 27.45 0.221 6.21 140
Tanks & Temples 3DGS (原始基线) 0.852 23.75 0.169 371.32 92
Mini-Splatting2 0.841 23.15 0.185 84.03 301
HAC++ (highrate) 0.852 24.24 0.176 10.07 84
LocoGS-L 0.843 23.75 0.192 10.68 144
OMG-XL 0.847 23.63 0.178 4.26 223
EGGS-XS (本文极小版) 0.812 22.46 0.231 1.33 389
EGGS-L (本文标准版) 0.842 23.74 0.192 3.14 287
Deep Blending 3DGS (原始基线) 0.907 29.81 0.237 581.95 66
Mini-Splatting2 0.912 30.00 0.241 153.53 255
HAC++ (highrate) 0.906 30.13 0.257 6.43 103
LocoGS-L 0.905 30.19 0.245 12.99 122
OMG-XL 0.909 29.87 0.246 5.56 221
EGGS-XS (本文极小版) 0.904 29.77 0.262 2.53 220
EGGS-L (本文标准版) 0.911 30.21 0.242 5.45 197

消融实验

表1:直流分量显式维度消融(Luma-based DC 表征有效性)

显式 DC 配置 SSIM ↑ PSNR (dB) ↑ LPIPS ↓ 存储体积 (MB) ↓ 说明
0 维(完全隐式预测) 0.965 26.59 0.242 3.87 缺乏基底约束,质量明显劣变(PSNR 下降 0.43 dB)
1 维(本文基于亮度 YUV) 0.967 27.02 0.226 4.62 以最小体积增量逼近 3 维性能(PSNR 仅微差 0.08 dB)
3 维(常规显式 RGB) 0.967 27.10 0.223 5.17 增加 12% 存储体积,画质提升边际递减

表2:尺度因子分解与保体积约束稳定性分析(跨 13 个场景各 10 次试验)

尺度分解方案 训练成功率 (%) ↑ 平均 PSNR (dB) ↑ 平均 SSIM ↑ 体积 (MB) ↓ 说明
朴素 1D 分解 Baseline 73.8% (部分场景仅 30%) 27.20 0.827 4.86 隐式因子无界发散,在 Train 等挑战场景频繁优化崩溃
本文保体积分解 (Ours) 100.0% (所有 13 场景满分) 27.18 0.833 4.62 零均值指数调制彻底解决发散问题,实现绝对稳健收敛

关键发现

  • 极端压缩极限:EGGS-XS 在三大测试集上全部刷新了现有 SOTA 的最小体积纪录(如 Tanks&Temples 仅 1.33 MB,Mip-NeRF 360 仅 2.67 MB),相较未压缩的 3DGS 压缩了 200 到 280 倍,同时保持了近 200–390 FPS 的超高光栅化速度。
  • 亮度感知解耦的非对称收益:消融表明将 0 阶 SH 压缩为一维亮度是性价比最高的设计。相较于完全隐式预测(0 维),1 维亮度让 PSNR 跃升了 0.43 dB,完全达到了传统 3 维存储的收敛曲线,但节省了三分之二的 DC 显式数据流。
  • 几何骨架保全优于极端剪枝:率失真消融(\(D_L\) 在 4 到 12 调节)证明,在追求高画质区间时,适度缩小特征维度 \(D_L\)(例如在 L 配置下从 12 调至 8)所保留的结构与渲染质量远好于直接裁剪高斯点云密度的方案。

亮点与洞察

  • 知觉非对称性在 3D 属性中的映射:EGGS 首次将经典数字视频处理中的 YUV 色彩分离思想引入 3DGS 球谐系数压缩,用一维显式亮度锚定几何轮廓与纹理基底,把低频色度完全交给轻量网络推断,优雅破解了 DC 存储臃肿的顽疾。
  • 保体积约束实现零崩溃的优雅数学闭环:通过对隐式各向异性因子施加轴向零均值归一化,使得指数调制在体积计算中自发对消,用数学恒等式将单维尺度与三维形状的优化完全解耦,既大幅精简参数又杜绝了尺度爆炸。
  • 可复用的率失真控制理念:传统 3D 压缩往往死磕点云剪枝,EGGS 展示了调整每个基元特征维度 \(D_L\) 能够提供更平滑、更保真度的率失真过渡曲线,为边缘端高质量 3D 内容流式传输提供了重要范式。

局限与展望

  • 作者承认的局限:在极端压缩配置(EGGS-XS)下,高频复杂镜面高光与半透明反光区域(如 Truck 场景的车窗反光和 Flowers 细碎花蕊)存在微小的平滑与模糊现象。
  • 自身发现的局限:目前高斯解码依赖前向多层 MLP 推理,虽然仅有 64 个隐层单元,但在从压缩包解压并烘焙回显式 3DGS 属性时需要一次性图元级前向计算;若要在不支持着色器解算的极端轻量终端渲染,必须先在内存中展开为标准高斯。
  • 改进思路:未来可探索将轻量 MLP 直接编译为自定义 CUDA/WebGPU 光栅化渲染着色器内部指令,实现无需全局显存解压的“直接流式渲染”。

相关工作与启发

  • vs LocoGS: LocoGS 同样尝试使用基底尺度 \(\gamma\) 与哈希网格预测残差,但缺乏体积约束导致其在复杂场景下经常发散崩溃;EGGS 提出的保体积指数归一化彻底解决了数值崩溃,成功率达 100%,且文件体积仅为其三分之一至二分之一。
  • vs OMG: OMG 显式存储多维特征 \(T\) 和 \(V\) 来重建属性;EGGS 进一步将显式属性收敛至亮度标量与保体积尺度,极小版本(1.33–2.67 MB)远小于 OMG-XS(2.44–4.04 MB),且渲染帧率更具优势。
  • vs HAC++: HAC++ 依赖复杂的上下文自回归锚点建模,虽然在部分场景的极限 PSNR 略高,但编码复杂度和解码渲染延迟较大(63–93 FPS);EGGS 无需复杂熵模型解码,实时渲染速度高达 140–389 FPS。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 巧妙利用 YUV 亮度和保体积恒等式对 3DGS 关键属性做降维,数学表达极为干净利落。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 13 个场景的稳定性压力测试、完备消融实验以及全方位 SOTA 指标对比。
  • 写作质量: ⭐⭐⭐⭐⭐ 动机阐述清晰,数学推导直观优雅,实验与率失真分析逻辑严密。
  • 价值: ⭐⭐⭐⭐⭐ 将兆字节级别的 3DGS 压缩至数 MB 的轻量文件,且保持两百帧以上渲染速率,具备极高工程应用与商用价值。