跳转至

SharpGS: Sharpness-Preserving 3D Gaussian Splatting with Differentiable Blur-Driven Density Control

会议: ECCV 2026
论文: ECCV 官方页面
领域: 3D 视觉
关键词: 3D Gaussian Splatting, 密度控制, 可微模糊, 新视角合成, 高频细节恢复

一句话总结

针对 3D 高斯泼溅(3DGS)依靠位置梯度进行密度控制难以敏感捕获高频边界与纹理细节的瓶颈,SharpGS 提出将模糊作为感知线索,通过 CUDA 可微模糊模块动态评估基元级模糊程度,并结合平滑区正则化与软不透明度衰减,在显著减少基元数量的同时大幅提升精细重建质量。

研究背景与动机

新视角合成是计算机视觉、虚拟现实与沉浸式媒体渲染的基础任务。近年来,3D 高斯泼溅(3DGS)凭借显式 3D 高斯基元表示与快速 2D 投影栅格化,彻底规避了神经辐射场(NeRF)中耗时的高密度光线步进采样,实现了实时的视线合成。然而,标准 3DGS 依赖视空间位置梯度作为基元分裂或克隆(densification)的判定依据。这种基于梯度统计的密度控制机制存在显著盲区:在缺乏足够几何细节的高频纹理区或复杂边缘处,高斯基元的位置梯度可能趋于饱和或互相抵消,导致尺寸过大的高斯基元过度覆盖细致区域,形成欠致密化(under-densification)并产生视觉模糊。

为了缓解这种过重建与模糊伪影,先前工作尝试引入频域正则化(如 FreGS、Wavelet-GS)、深度与误差驱动重划分(如 Revising-3DGS、ConeGS)或基于梯度的改进(如 AbsGS、Pixel-GS)。然而,频域解耦通常带来高达 1.8 倍以上的基元数量暴增和显存负担;像素误差方法在复杂高频纹理处易引发过度平滑;而单纯降低 3DGS 梯度阈值虽然增加了点数,质量提升却极其微弱。这表明,梯度的空间分布并不能直接度量局部的视觉细节缺失,现有机制缺乏能够直接度量真实图像与渲染图之间高频粒度失配的感知指标。

本文的切入视角源于一个核心物理直觉:当 3DGS 基元欠致密化时,其局部重建效果在视觉上极其接近经过低通模糊的真实图像(Ground-Truth, GT)。如果能将真实图像根据局部欠拟合程度进行自适应模糊,则模糊程度的大小便直接指示了该区域细节未被解析的严重程度。核心 idea:引入基于 CUDA 实现的可微模糊作为感知线索,端到端学习每个 3D 高斯基元的模糊程度 \(\sigma\),配合平滑背景细节先验惩罚与高模糊基元软不透明度衰减,实现兼顾紧凑体积与高锐利度的新型密度控制。

方法详解

整体框架

SharpGS 的核心流程在标准 3DGS 优化回路中无缝嵌入了可微模糊分析与双重冗余抑制机制。整个系统由三个协同流组成:首先,在渲染通道中,显式 3D 高斯基元经栅格化生成渲染图 \(I_{\text{gs}}\),同时投影并光栅化每个基元的模糊参数得到像素级模糊图 \(\sigma_{\text{pix}}\);其次,可微模糊流水线以 \(\sigma_{\text{pix}}\) 为空间可变核对真实图像 \(I_{\text{gt}}\) 进行 2D 高斯卷积得到模糊真实图 \(\hat{I}_{\text{gt}}\),并通过联合细节感知损失优化基元级模糊参数 \(\sigma_i\);最后,在致密化控制阶段,依据优化出的 \(\sigma_i\) 放宽位置梯度阈值以精准补全高频结构,并周期性执行模糊自适应软不透明度衰减与平滑区正则化,抑制天空等平滑区域或异质重叠区域的冗余基元。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入视点与当前 3D 高斯基元集合"] --> B["1. 可微模糊驱动的粒度不匹配感知<br/>光栅化生成渲染图与像素模糊图,卷积 GT"]
    B --> C["2. 细节感知正则化<br/>平滑区背景先验惩罚抑制误增"]
    C --> D["3. 模糊自适应软不透明度衰减<br/>按模糊度衰减异质区域重叠大基元"]
    D --> E["致密化判定与基元重整<br/>高模糊区域放宽梯度分裂,低贡献基元剪枝"]
    E --> F["输出紧凑且高保真的 3DGS 场景表征"]

关键设计

1. 可微模糊驱动的粒度不匹配感知:将欠致密化映射为自适应模糊核以精确定位高频缺失 标准 3DGS 将多个 3D 高斯投影为 2D 椭球并通过透明度混合计算颜色。从空间采样的角度,单个基元在投影中心周围的颜色可看作局部对 GT 像素的加权聚集(gather-form)。当邻近基元尺度相近且出现欠致密化时,复合渲染图像 \(I_{\text{gs}}(p)\) 在宏观上等价于真实图像 \(I_{\text{gt}}\) 经过各向同性高斯核 \(H_{\sigma_{\text{pix}}(p)}\) 卷积后的退化效果: $\(I_{\text{gs}}(p) \approx \hat{I}_{\text{gt}}(p) = \int_{u \in \Omega(\sigma_{\text{pix}}(p))} H_{\sigma_{\text{pix}}(p)}(u) I_{\text{gt}}(p-u) \, du\)$ 基于这一物理等价性,模型为每个高斯基元分配一个可学习的标量模糊度 \(\sigma_i\)(通过 Sigmoid 激活并缩放到最大上限 \(k_\sigma = 20\),初始化为 0.3),并构建 CUDA 加速的可微 2D 高斯模糊卷积模块(卷积半径为 \(3\sigma_{\text{pix}}\))。在反向传播中,主差异损失 \(L_p = (1 - \lambda_{\text{dssim}}) \|I_{\text{gs}} - \hat{I}_{\text{gt}}\|_1 + \lambda_{\text{dssim}} (1 - \text{SSIM}(I_{\text{gs}}, \hat{I}_{\text{gt}}))\) 促使模糊后的真实图贴近当前渲染图。当渲染图完美呈现高频细节时,\(\sigma_{\text{pix}} \to 0\) 即可匹配;反之,若局部存在因基元过大导致的模糊,反向传播便迫使对应的基元产生较大的 \(\sigma_i\)。该模糊度不干扰常规颜色和坐标更新,专门为密度控制提供局部欠拟合的直观感知指示。

2. 细节感知正则化:构建空间纹理先验惩罚平滑区域以避免伪阳性致密化 仅依据渲染与模糊 GT 的匹配度极易在无纹理的平滑区域(如无云天空、纯色墙面)引发伪阳性。由于这些区域即便受到大幅度模糊卷积,图像像素值变化依然微乎其微,导致该区域基元的 \(\sigma_i\) 可以随意取大而不显著影响 \(L_p\) 损失,进而被误判定为高频缺失而触发不必要的分裂。针对该问题,设计了基于真实图像空间结构的细节权重图 \(w_d\):预先使用固定大尺度高斯核(半径 60,对应 \(\sigma_{\text{pix}}=20\))对真实图像进行重度模糊,并计算 GT 与重度模糊图在各像素的 L1 与 SSIM 差异。在平滑区域,重度模糊前后差异微弱,\(w_d\) 接近于 0;而在纹理丰富区域 \(w_d\) 显著变大。据此构建细节感知正则项: $\(L_{\text{reg}} = (1 - w_d) \frac{\sigma_{\text{pix}}}{k_\sigma}\)$ 将其与主损失整合为总模糊优化目标 \(L_\sigma = (1 - \lambda_\sigma) L_p + \lambda_\sigma L_{\text{reg}}\)\(\lambda_\sigma = 0.1\))。\(L_{\text{reg}}\) 显式拉低平滑背景中基元的模糊度预测,有效消除了固有平滑区域中的高斯过度增殖。

3. 模糊自适应软不透明度衰减:按模糊程度阶梯式削弱大尺度冗余基元 细节感知正则化成功压制了同质大平滑面,但在异质交织区域(如草地前背景穿插、自行车辐条与地面交界),覆盖大面积底色的大尺寸高斯与高频前景混合,导致大基元的 \(\sigma_i\) 被周边高频区域强行拉高,容易引发反复冗余分裂。标准 3DGS 仅每隔 3000 次迭代粗暴地将所有基元不透明度归零,缺乏对基元重要性的差异化处理。SharpGS 提出每 500 次迭代执行一次高频软不透明度衰减(Soft Opacity Attenuation),根据基元归一化模糊度平滑推移基元不透明度 \(o_i\) 向基准衰减值 \(\tau_m = 0.5\) 靠拢: $\(o_{\text{new}} = \left(1 - \left(\frac{\sigma_i}{k_\sigma}\right)^\gamma\right) o_i + \left(\frac{\sigma_i}{k_\sigma}\right)^\gamma \tau_m\)$ 其中 \(\gamma = 0.01\)。对于具有极高模糊度的可疑基元,其衰减幅度显著增大。如果在后续迭代中该基元无法通过积极贡献渲染梯度来重新建立起高不透明度,其最终将在剪枝步骤中被彻底剔除。此机制在保持高频轮廓清晰的同时,消除了多余的半透明冗余块。

损失函数 / 训练策略

SharpGS 的训练完全保持 3DGS 基础属性(均值、协方差、球谐系数、不透明度)的标准损失 \(L_{\text{gs}} = (1 - \lambda_{\text{dssim}})\|I_{\text{gs}} - I_{\text{gt}}\|_1 + \lambda_{\text{dssim}}(1 - \text{SSIM}(I_{\text{gs}}, I_{\text{gt}}))\)\(\lambda_{\text{dssim}} = 0.2\))不变,保证基础几何与外观优化稳定性。独立反向流 \(L_\sigma\) 专供更新基元模糊参数 \(\sigma\)。在每轮密度精炼判定中,基元分裂与克隆采用双路径准则:若位置梯度 \(\nabla_p L_{\text{gs}} \ge \tau_p\),或者基元模糊度超过阈值 \(\sigma \ge \tau_\sigma\) 且满足松弛梯度要求 \(\nabla_p L_{\text{gs}} \ge \tau_p \cdot k_p\)(默认 \(\tau_\sigma = 2, k_p = 0.05\)),则判定触发致密化。致密化完成后,全部基元的 \(\sigma\) 重置为初值 0.3,避免历史累计偏置。

实验关键数据

主实验

在三个标准新视角合成基准数据集(Mip-NeRF360、Tanks&Temples、Deep Blending)上对 SharpGS 进行了全面验证。各方法均在单张 NVIDIA A6000 GPU 上训练 30,000 步。主实验对比了原生 3DGS、先进抗混叠与几何变体以及集成 SharpGS 后的性能指标与存储/显存开销。

方法 / 数据集 Mip-NeRF360 PSNR ↑ Mip-NeRF360 SSIM ↑ Mip-NeRF360 LPIPS ↓ Mip-NeRF360 基元数 ↓ Tanks&Temples PSNR ↑ Tanks&Temples SSIM ↑ Tanks&Temples LPIPS ↓ Tanks&Temples 基元数 ↓ Deep Blending PSNR ↑ Deep Blending SSIM ↑ Deep Blending LPIPS ↓ Deep Blending 基元数 ↓
3DGS [16] 27.414 0.812 0.218 3350K 23.655 0.844 0.179 1893K 29.394 0.898 0.248 2833K
3DGS (\(\tau_p=1.6\times 10^{-4}\)) 27.541 0.818 0.205 4763K 23.772 0.848 0.169 2551K 29.176 0.896 0.247 3653K
Mip-Splatting [40] 27.557 0.816 0.217 3271K 23.963 0.852 0.176 1864K 29.598 0.904 0.243 2961K
Pixel-GS [45] 27.537 0.822 0.190 5622K 23.759 0.853 0.151 4598K 28.812 0.891 0.252 4623K
FDS-GS [42] 27.556 0.822 0.208 1542K 23.990 0.859 0.145 1530K 29.794 0.905 0.232 1711K
SteepGS [33] 26.999 0.792 0.249 2182K 23.393 0.838 0.193 1365K 29.418 0.903 0.252 1604K
Compact-GS [20] 26.989 0.796 0.245 1469K 23.360 0.831 0.199 928K 29.701 0.900 0.256 1142K
Ours + 3DGS 27.576 0.820 0.190 3083K 23.821 0.850 0.152 1658K 29.679 0.900 0.237 1836K
Ours + Mip-Splatting 27.679 0.824 0.199 2905K 24.047 0.856 0.162 1629K 29.802 0.906 0.237 1809K
Ours + Pixel-GS 27.652 0.822 0.182 4218K 23.900 0.855 0.138 2999K 29.620 0.897 0.235 2687K
Ours + FDS-GS 27.696 0.826 0.203 1501K 24.230 0.866 0.139 1499K 29.841 0.907 0.231 1491K
Ours + SteepGS 27.333 0.811 0.213 2112K 23.563 0.843 0.173 1206K 29.592 0.903 0.245 1315K
Ours + Compact-GS 27.070 0.805 0.225 1530K 23.560 0.836 0.189 906K 29.886 0.904 0.249 1028K

消融实验

以 3DGS 为基线,逐步验证可微模糊模块(Diff. blur)、细节感知正则化(\(L_{\text{reg}}\))和软不透明度衰减(Opacity att.)的贡献:

实验配置 Mip-NeRF360 PSNR/LPIPS/基元数 Tanks&Temples PSNR/LPIPS/基元数 Deep Blending PSNR/LPIPS/基元数 机制验证说明
基线 3DGS [16] 27.414 / 0.218 / 3350K 23.655 / 0.179 / 1893K 29.394 / 0.248 / 2833K 原生梯度控制基线
+ 可微模糊 (Diff. blur) 27.594 / 0.185 / 4213K 23.685 / 0.143 / 2586K 29.626 / 0.231 / 2565K 引入模糊线索有效提升细节与感知指标,但基元数量明显激增
+ 可微模糊 + \(L_{\text{reg}}\) 27.570 / 0.189 / 3621K 23.709 / 0.152 / 1977K 29.617 / 0.236 / 2140K 平滑背景正则化有效削减 14%~23.6% 冗余基元,保持高质量
+ 可微模糊 + 不透明度衰减 27.605 / 0.185 / 3520K 23.839 / 0.141 / 2061K 29.693 / 0.232 / 2197K 软衰减有效剔除异质区域大基元,基元削减达 16%~20.3%
完整模型 (FULL) 27.576 / 0.190 / 3083K 23.821 / 0.152 / 1658K 29.679 / 0.237 / 1836K 综合两项正则化,基元数比单纯可微模糊降低高达 35.2%,优于原始 3DGS

关键发现

  • 感知指标提升显著:SharpGS 与 3DGS 结合后,Mip-NeRF360 上的 LPIPS 从 0.218 显著下降至 0.190,Tanks&Temples 上从 0.179 降至 0.152。这直接印证了模糊度作为感知线索对于消除人眼敏感的模糊与涂抹伪影具有极强指导性。
  • 高频保真与紧凑表示双赢:简单降低原始 3DGS 梯度阈值至 \(\tau_p=1.6\times 10^{-4}\) 虽然使基元数暴增至 4763K(+42%),但 PSNR 仅微增至 27.541 dB;而 Ours+3DGS 在仅使用 3083K 基元(比 3DGS 少 8%)的条件下取得了更高的 27.576 dB,证明了精准致密化的优越性。
  • 超参数稳定性极高:在用于细节感知权重图 \(w_d\) 的大尺度核半径消融中,测试 \(r \in \{30, 60, 90\}\) 时,Mip-NeRF360 上的 PSNR 稳定在 27.564~27.585 dB,基元数在 3076K~3116K 波动,说明该先验仅提供粗粒度结构指导,无须繁琐的超参微调。

亮点与洞察

  • 将反演难题重构为正向模糊匹配:传统方法试图在频域或梯度空间直接侦测高频缺失,极易受高频噪声干扰且计算复杂。本文巧妙地将"判断渲染图丢失了哪些细节"反向转化为"对真实图像进行何种程度的高斯平滑才能吻合当前渲染",在像素空间直接使用平滑且数值稳定的 2D 卷积完成了高敏感度感知度量。
  • 与主流 3DGS 范式的即插即用协同:SharpGS 的可微模糊管线独立于颜色与几何属性优化,仅输出用于分裂控制的模糊度 \(\sigma\) 与衰减系数。在与 Pixel-GS、Mip-Splatting、FDS-GS 等各异架构的结合中均取得了稳定的质量飞跃与基元削减(如在 Pixel-GS 上将 Mip-NeRF360 基元数从 5622K 大幅压减至 4218K 并进一步改善 LPIPS)。
  • 极小训练开销实现端到端优化:得益于定制的 CUDA 前向与反向内核,可微模糊管线在 1256×828 分辨率下每步仅增加 2.52 ms 的极轻量耗时,完全消除了基于神经网络的可感知度量(如 LPIPS 反传需要数小时)带来的训练阻塞。

局限与展望

  • 跨分辨率自适应缩放敏感性:由于基元模糊度 \(\sigma_i\) 在像素空间反传学习,当训练与推理分辨率发生明显偏离时(例如在 \(\times 1.25\) 超高分辨率下),相同几何结构对应更多像素,容易诱导更激进的基元分裂。虽然论文提出了归一化修正项 \(\tilde{\sigma}_i = \sigma_i / s\),但在动态多尺度视角交互下的泛化性仍有待进一步自动化调优。
  • 极端光照变化与运动模糊混淆:若输入多视角训练图像本身包含运动模糊或景深虚化,可微模糊模块可能误将拍摄缺陷识别为重建欠致密化,导致在离焦背景处产生不必要的点云过度细分。未来可探索将去模糊神经场与可微模糊密度控制进行联合解耦解算。

相关工作与启发

  • vs 3DGS [16] / AbsGS [37] / Pixel-GS [45]: 传统及演进方法均以视空间位置梯度为主判据,容易在高频饱和区或平滑边缘失效;SharpGS 直接以图像域可微模糊程度作为感知线索,辅以松弛梯度判定,定位细致纹理更加精准。
  • vs FreGS [43] / Wavelet-GS [46]: 频域方法利用傅里叶变换或小波分解实现渐进式频带正则化,但计算复杂且导致基元数激增(FreGS 基元数常为基线 1.8 倍以上);SharpGS 规避了昂贵的全局频域变换,利用局部可微模糊保持了紧凑的基元规模。
  • vs Revising-3DGS [28] / ConeGS [1]: 纯像素误差引导容易使细小纹理被平滑抹去,且依赖外部深度先验(如 iNGP)进行尺码推断;SharpGS 依靠可微模糊直接捕捉结构粒度失配,在高频区域细节更锐利且计算用时明显更短(如 Bicycle 场景比 LPIPS 引导快数倍)。

评分

  • 新颖性: ⭐⭐⭐⭐ [将模糊感知作为 3DGS 粒度失配指标并设计配套的可微模糊与双重正则化,构思新颖优雅]
  • 实验充分度: ⭐⭐⭐⭐⭐ [横跨三大代表性数据集,集成测试 6 种主流 3DGS 变体,包含完备的消融分析与替代线索横向对比]
  • 写作质量: ⭐⭐⭐⭐⭐ [数学推导流畅,直觉动机阐述清晰,图表结构完整且呈现直观]
  • 价值: ⭐⭐⭐⭐ [即插即用且开销极小,为 3DGS 几何致密化与高质量新视角渲染提供了极具实用价值的新工具]