NRF-GS: Neural Residual Fields for Expressive and Compact Gaussian Splatting¶
会议: NeurIPS 2026(Accepted,按任务清单)
arXiv: 2609.37115
领域: 3D 视觉
关键词: 高斯泼溅、神经残差场、视角相关外观、频率分解、紧凑场景表示
一句话总结¶
NRF-GS 用共享的低频/高频神经残差分支替换逐高斯球谐外观,在不改增密与剪枝规则的情况下,以更少的高斯获得更高的平均 PSNR,但并非在感知质量或渲染速度上全面胜出。
研究背景与动机¶
3D 高斯泼溅(3DGS)的效率来自显式几何与可微光栅化:每个高斯负责一片空间区域,颜色随观察方向变化,再按深度顺序合成图像。标准外观表示通常使用三阶球谐(SH),每个高斯保存 48 个颜色系数。它计算便宜,却难以描述很窄的高光或复杂的方向变化。当单个高斯无法拟合这些变化时,优化过程可能通过增加高斯来补偿,形成不完全由几何细节决定的表示冗余。
直接加入神经网络也不自动解决问题。VDGS 将预测与高斯位置、相机位置等属性结合;GSNB 在球谐上叠加神经基,增加了外观容量,也带来额外存储与计算。NRF-GS 的切入点更窄:保留高斯位置和协方差,只让共享网络承担逐高斯基础颜色之外的方向残差。不同高斯通过紧凑潜特征表达各自的外观,而不是各自持有一套完整的方向函数。
方向残差仍有过拟合风险,尤其是视角覆盖稀疏的室外场景。本文因此不把全部 Fourier 频带送入一个网络,而是保留稳定的低频路径,让高频贡献按高斯和当前视角自适应调制。核心 idea:提高单个高斯的方向外观表达力,并以共享、受限且分频的残差表示减少靠增密补偿外观不足的需求。
方法详解¶
整体框架¶
输入是带相机位姿的多视角图像;场景仍由显式高斯构成,每个高斯保存位置、协方差、基础颜色、基础不透明度和一个 32 维潜特征。对于当前相机,先计算相机到高斯的方向及距离,再将方向编码拆成低频和高频两组。
共享残差表示把同一个潜特征交给两条分支:低频分支预测平滑颜色残差与不透明度残差;高频分支预测精细颜色残差与调制权重。受限残差合成将它们加到基础外观上,随后使用原有高斯光栅器输出图像。训练监督来自渲染图像与观测图像,而不是逐高斯材质标签;推理时只需要已优化的场景与目标相机。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["高斯属性 + 目标相机"] --> B["共享残差表示"]
B --> C["低频分支"]
B --> D["高频分支"]
C -->|颜色与不透明度残差| E["受限残差合成"]
D -->|颜色残差与调制权重| E
E --> F["标准光栅器 → 图像"]
G["训练:观测图像"] -.->|像素监督与反向传播| F
关键设计¶
1. 共享残差表示:把基础颜色和方向变化分开存储
NRF-GS 不用网络重新生成整个场景,也不让网络预测高斯几何。每个高斯仍拥有显式的位置和协方差,基础颜色承担主要的、与视角无关的漫反射成分。网络只学习相对于这个基础颜色的修正,因此来自各个视角的共同信息可以先落到稳定的基础项,网络容量则留给方向变化。这是一种外观参数化分工,并不是具有物理约束的 BRDF 或可重光照材质分解。
每个高斯的 32 维潜特征由训练共同优化,并由整个场景共享的多层感知机(MLP)解码。共享的是函数参数,不是所有高斯的颜色或潜特征;不同潜特征允许同一函数在不同表面表现出不同的方向响应。网络不直接输入完整的协方差等几何属性,但其输出仍会通过渲染损失影响几何优化,所以“解耦”应理解为表示结构,而不是梯度上的完全隔离。
当前方向由高斯中心指向相机中心,并先归一化;距离另取对数作为标量输入,使用小常数避免零距离的数值问题。距离在这里提供观察尺度与视差的线索,使相同方向编码在近处和远处可以对应不同外观修正;它不是额外测得的深度监督。原文只报告去掉距离后的重建退化,并未证明这一输入精确遵循物理反射规律。
这种设计的预算必须同时计算逐高斯潜特征和共享解码器。正文按每个高斯 32 维潜特征、3 个基础颜色参数及 1 个基础不透明度参数,合计 36 个外观相关参数,再加两条分支共约 6.7k 个网络参数;与 48 个 SH 系数相比,作者给出约 25% 的逐高斯外观参数节省。这个口径不是完整场景字节数:几何参数、精度、优化器状态及基线不透明度的计数口径仍需另算,不能把“6.7k 网络”当成整幅场景的存储成本。
2. 低频分支:平滑方向外观与不透明度一起修正
方向 Fourier 编码使用 3 个频带。低频分支读取原始方向及第 0 个频带,同时读取潜特征、基础颜色、基础不透明度和对数距离;输出一个 RGB 残差,以及一个用于更新不透明度的中间量。它承担较平滑、较广泛的方向变化,让高频分支不必重新拟合基础趋势。
不透明度只由低频分支修正是一个重要限制,而非遗漏。颜色变化会影响局部外观,不透明度变化则进一步影响后方高斯的透射与遮挡;如果让它随高频方向信号剧烈波动,容易产生不稳定的合成与闪烁。本文保留随视角调整不透明度的能力,但不给高频分支这项权限。其消融显示,去掉不透明度残差会损失 0.35 dB 的平均 PSNR,不过论文没有给出独立的时序闪烁量化。
3. 高频分支:用可学习门控选择精细方向效应
高频分支使用剩余频带,并读取同一个潜特征、基础颜色与距离;它不读取基础不透明度,也不预测不透明度。输出除了 RGB 残差,还有一个标量调制信号,经 sigmoid 转换后控制高频颜色贡献。因此调制可以随高斯和当前输入改变,并不是给整幅场景设置一个固定高频比例。
为何需要分支而不是仅扩大网络?低频趋势往往得到更多视角的共同支持,高频方向效应却可能只在少数观察中出现。把两者混合拟合容易把稀疏信号也当成必须解释的细节。分频加门控提供更合适的结构偏置:低频持续表达,局部高频有选择地参与。附录的 Bicycle 和 Stump 正好显示单分支训练分数更高、测试分数却更低,支持过拟合解释;这不是高频编码本身必然有害的结论。
两个分支分别使用 64 个隐藏单元和 ReLU,采用 tiny-cuda-nn 的 FullyFusedMLP。无分频消融使用 128 个隐藏单元,网络参数约 8.0k,略多于完整模型约 6.7k;因此其退化不能简单归因于网络较小。反过来,这个对照也不是完全相同架构的“只移除门控”实验,论文没有单独拆出门控的贡献。
4. 受限残差合成:控制改变量,而非重新生成外观
两条颜色残差先相加,其中高频项乘调制权重,再经 tanh 与尺度因子限制幅度,最后加到基础颜色上。原文式 (8) 的机制为:
这里的限制施加在合成残差上,而不是分别限制两条原始分支输出。颜色尺度取 0.2,使网络从基础外观附近做修正;这减少了早期优化中直接覆盖基础颜色的风险,但也限制了单次方向残差能够表达的幅度。
不透明度由基础值加上受限的低频更新,原文式 (9) 为:
不透明度尺度同样取 0.2。需要区分“更新有界”和“最终不透明度合法”:即使基础值位于 0 到 1,加减一个有界残差也不自动保证最终结果仍在该区间。缓存正文没有说明最终是否另做 clamp 或重新参数化,不能自行补上这一实现步骤。修正后的颜色和不透明度送入原有光栅化与前向合成流程,几何表示和增密、剪枝规则仍保持不变。
一个完整示例¶
考虑 Kitchen 场景中承担亮面外观的一个高斯。相机移动后,它的位置和协方差不会因为前向计算而被神经网络替换,但相机相对方向与距离会改变,进而改变两个分支的输入。基础颜色提供稳定底色,低频分支修正宽范围颜色变化和不透明度,高频分支在相关视角增强精细颜色变化;二者经受限残差合成后参与当前像素的深度排序与合成。
训练中,合成图像仍需匹配真实视图,误差会同时优化显式场景参数、潜特征和共享网络。更好的方向拟合可能降低增密规则触发的需求,最终产生较少高斯,但这不表示每一步增密判据被改写。附录表 6 的 Kitchen 平均点数为 3DGS 的 1.818M 对 NRF-GS 的 0.652M,PSNR 为 31.46 对 32.10;这些是整场景优化结果,不是这个示意高斯的单点测量。
损失函数 / 训练策略¶
论文在标准 3DGS 训练管线中联合优化显式高斯、潜特征与共享残差网络,并保留原有增密与剪枝启发式。像素层重建监督经可微光栅器反向传播;缓存没有列出 NRF-GS 独立的新损失公式或完整损失权重,因此此处不把惯常的 3DGS 损失写成作者明确给出的配置。
正式训练前有短暂 warmup,每个视图执行一次,使网络先预测零颜色残差和中性不透明度状态。目的是从与视角无关的基础外观开始,避免网络过早拟合方向噪声。原文没有详述 warmup 的损失形式、优化器学习率或训练迭代数,复现时仍需实现说明。
实验关键数据¶
主实验¶
主表取自原文表 3,点数单位为百万,时间为训练分钟;PSNR 越高越好,LPIPS 越低越好。MipNeRF360 为 9 场景、DL3DV 为从 10k 场景中随机选取的 9 场景、Tanks and Temples(TnT)为 19 场景;采用原文所述 1:8 划分。实验硬件为 RTX 3090 24GB、24 核 CPU、64GB RAM,MipNeRF360 约 1400p,其余约 960p。
| 数据集 | 方法 | 点数 M | 训练 min | PSNR | LPIPS |
|---|---|---|---|---|---|
| MipNeRF360 | 3DGS | 3.359 | 26.46 | 27.40 | 0.184 |
| MipNeRF360 | VDGS | 3.548 | 41.27 | 27.65 | 0.186 |
| MipNeRF360 | NRF-GS | 1.656 | 31.38 | 27.86 | 0.191 |
| MipNeRF360* | 3DGS | 2.605 | 24.22 | 27.74 | 0.199 |
| MipNeRF360* | VDGS | 2.828 | 36.70 | 28.03 | 0.200 |
| MipNeRF360* | GSNB | 2.667 | 59.06 | 27.71 | 0.201 |
| MipNeRF360* | NRF-GS | 1.361 | 28.83 | 28.27 | 0.205 |
| DL3DV | 3DGS | 1.158 | 12.74 | 29.48 | 0.088 |
| DL3DV | VDGS | 1.404 | 21.15 | 29.92 | 0.089 |
| DL3DV | GSNB | 1.032 | 25.28 | 30.60 | 0.086 |
| DL3DV | NRF-GS | 0.595 | 14.52 | 30.82 | 0.089 |
| TnT | 3DGS | 1.868 | 15.35 | 23.85 | 0.165 |
| TnT | VDGS | 2.113 | 26.37 | 24.12 | 0.163 |
| TnT | GSNB | 1.705 | 35.75 | 23.92 | 0.164 |
| TnT | NRF-GS | 1.040 | 19.91 | 24.68 | 0.164 |
MipNeRF360* 排除了 GSNB 显存溢出的 Bicycle 与 Garden,不能与完整 9 场景均值直接混比。相对 3DGS,三个完整数据集的点数分别减少约 50.7%、48.6%、44.3%,PSNR 增加 0.46、1.34、0.83 dB。推理平均速度为 NRF-GS 105 FPS、3DGS 115 FPS、VDGS 65 FPS、GSNB 92 FPS:紧凑不等于更快。
消融实验¶
原文表 1 的 MipNeRF360 消融如下;保留其 SSIM 列名,不自行改成主表的 MS-SSIM。
| 配置 | PSNR | SSIM | LPIPS | L1 |
|---|---|---|---|---|
| 完整模型 | 27.86 | 0.814 | 0.191 | 0.029 |
| 无低高频拆分 | 27.38 | 0.796 | 0.211 | 0.032 |
| 无不透明度残差 | 27.51 | 0.801 | 0.195 | 0.031 |
| 无距离输入 | 27.65 | 0.809 | 0.201 | 0.031 |
原文表 2 将外观拟合与几何、可见性、光栅化分离。前两行在 328 个点/采样像素下近似匹配可学习参数预算;第三行是更稠密的真实图像外观拟合,不是完整 3D 场景的新视角重建。
| 外观拟合设置 | 点数 | SH / NRF 参数 | SH / NRF PSNR |
|---|---|---|---|
| 合成 5 阶 SH 目标 | 328 | 15,744 / 15,707 | 21.1 / 29.0 |
| 真实 BTF 像素 | 328 | 15,744 / 15,707 | 27.8 / 28.8 |
| 真实 BTF 图像 | 160k | 7.68M / 5.60M | 31.3 / 31.9 |
真实图像实验正文描述为 200×200,表 2 却列出 160k 点;缓存未解释两种统计口径,此处保留而不推断点数来源。该表报告的是 SH/NRF 整体外观拟合预算,不可只拿共享 MLP 参数当 NRF 成本,也不可把第三行称为严格等内存实验。
关键发现¶
- 分频的平均 PSNR 贡献最大:去掉它下降 0.48 dB,去掉不透明度或距离分别下降 0.35、0.21 dB。更大的单分支仍较差,支持结构偏置优于单纯增大容量。
- 附录表 4 中,Bicycle 的单分支训练/测试 PSNR 为 27.34/23.71,完整模型为 26.11/25.06;Stump 为 31.06/25.06 对 30.10/26.39。训练更好却测试更差是分频抑制过拟合的关键证据。
- PSNR 优势不是所有场景与所有指标都成立:附录 Bicycle 中 NRF-GS 为 25.06,低于 3DGS 的 25.17;主表完整 MipNeRF360 的 LPIPS 为 0.191,也差于 3DGS 的 0.184。
- 原文有需保留的记录差异:消融正文多次指向表 2,实际对应表 1;正文概括 PSNR 增益约 0.3–0.8 dB,但 DL3DV 相对 3DGS 的主表差值为 1.34 dB。表 3 与附录表 5 也存在细小不一致,例如子集 NRF-GS PSNR 28.27/28.28、MS-SSIM 0.815/0.814,以及完整 MipNeRF360 的 VDGS L1 0.029/0.030。本笔记主结果统一引用表 3,不静默合并。
亮点与洞察¶
- 外观容量会影响几何复杂度。相同增密规则下点数变化说明高斯数量不只反映几何细节,也反映单个基元是否能解释视角变化;不过目前证据支持一种优化机制解释,不是对所有场景的因果定理。
- 残差共享比完整外观共享更克制。基础颜色保留局部、稳定的锚点,场景级函数专注于方向变化,使共享学习不必承担全部漫反射内容。
- 对颜色与不透明度使用不同频率权限值得复用。高频只改变颜色,不直接扰动透射,提示显式渲染中的不同属性不应一概使用相同的高容量预测器。
局限与展望¶
- 作者承认逐高斯网络评估增加计算,训练和平均 FPS 均不及纯解析 3DGS;仍依赖准确相机位姿与初始化,未专门联合优化运行时或完整内存开销。
- 合成拟合采用五阶 SH 目标,能够证明三阶 SH 的容量限制,但不能替代复杂真实材质评估;DL3DV 只使用随机选取的 9 场景,不能外推整个 10k 数据集。
- 分频、门控与双分支结构一起变化,尚不能单独量化每个设计的贡献。最终不透明度的合法区间处理、warmup 细节和不同预算口径也需要实现澄清。
- 后续可在固定总存储或固定 FPS 下比较外观容量与点数分配,再联合剪枝、量化和神经评估加速;这是研究建议,不是本文已经验证的结果。
相关工作与启发¶
- vs 3DGS:将独立三阶 SH 外观改成潜特征加共享残差场,保留显式几何与光栅器。优势是平均 PSNR 与点数,代价是神经评估开销及部分 LPIPS 退化。
- vs VDGS:同样学习视角相关颜色与不透明度,本文强调外观潜特征、残差锚点及分频结构,不直接以完整高斯参数建模。报告速度优于 VDGS,但这不是单一因素的等架构比较。
- vs GSNB / Latent-SpecGS:GSNB 增补神经基,Latent-SpecGS 在图像空间解码漫反射与镜面分量;本文在高斯层直接生成外观残差。Latent-SpecGS 未纳入基准,不能据此宣称超过它。
评分¶
- 新颖性: 4/5。共享外观并非首创,残差锚点与分频权限的组合及点数关联有明确价值。
- 实验充分度: 4/5。包含控制外观拟合、三个数据集和消融,但预算口径与部分数值记录仍需澄清。
- 写作质量: 4/5。机制总体清楚,存在表号误指与正文/附录数值差异。
- 价值: 4/5。为紧凑高斯表示提供可组合的外观建模方向,但不是无代价的加速或全面感知质量提升。