跳转至

Do Flat Minima Improve Sparse Novel View Synthesis?

会议: ECCV 2026
论文: ECCV 原文
代码: https://bbangsik13.github.io/FASR
领域: 3D 视觉
关键词: 稀疏新视角合成、3D 高斯泼溅、平坦极小值、损失景观锐度、结构感知正则化

一句话总结

本文首次深入探究了稀疏新视角合成中损失锐度与泛化性的关系,揭示出全局追求平坦极小值会抹杀高频细节的本质矛盾,提出了依据局部图像结构自适应调节扰动半径与正则权重的结构感知锐度正则化(FASR),在显著抑制漂浮物的同时完整保留边缘高频纹理。

研究背景与动机

基于 3D 高斯泼溅(3DGS)与神经辐射场(NeRF)的新视角合成技术在密集输入视角下取得了卓越的真实感渲染效果,然而在极度稀疏的输入视角设定下,模型极易对有限的训练视角发生过拟合。在未见的新视角中,这种过拟合通常表现为严重的几何失真、模糊伪影以及脱离实际物体表面的空间“漂浮物”(floaters)。现有工作通常依赖引入外部单目几何先验(如深度估计、法线先验)、稠密对应匹配模型或集成式正则化,但这些策略大多依赖笨重的预训练先验网络,极少有研究从三维表示底层优化过程与损失景观(loss landscape)特性的角度切入解决该欠定问题。

深度学习理论普遍认为,收敛于平坦极小值(flat minima)有利于缩小泛化鸿沟,以锐度感知最小化(SAM)为代表的优化算法在分类与下游泛化任务中屡获成功。然而,本文发现将平坦极小值优化直接迁移到新视角合成时,盲目降低全局损失锐度并不能保证更佳的泛化表现。这一反直觉现象的根源在于重建任务对不同空间区域的几何敏感度存在天然差异:表征高细节区域(如物体锐利边缘、精细纹理)的高斯基元,其微小位移就会引起投影像素色彩的剧烈变动,天然需要局部锐利的损失景观才能精确锚定几何边界;反之,平坦低细节区域(如背景平滑区域、纯色天空)以及空间中的虚假漂浮物,本身对扰动极度敏感且极易产生虚假极小值,因而急需平坦化以实现跨视角泛化。若无差别地施加全局平坦约束,必然会导致高细节区域被过度平滑惩罚,而低细节区域未能获得充分正则化。

针对这一矛盾,本文提出了一种无需外部大模型先验的结构感知锐度正则化策略(Structure-Aware Sharpness Regularization, FASR)。核心 idea:根据输入图像局部几何结构构建容差图,自适应调整每个高斯基元的最差扰动半径与正则化权重——在高细节边缘区缩小扰动并降低锐度惩罚以保全精细结构,在平坦低细节区放大扰动并强化锐度惩罚以压制离群漂浮物,从而达成泛化与细节重建的统一。

方法详解

整体框架

所提方法 FASR 作为即插即用的通用优化策略,作用于 3D 高斯基元(均值中心 \(\mu_i\)、旋转四元数 \(q_i\)、三轴缩放尺度 \(s_i\))的迭代优化流程中。系统首先基于输入图像的梯度构建 2D 几何容差图(Geometric Tolerance Map),量化各像素到最近高细节边缘的测地距离。在每次前向迭代中,基元通过投影中心索引局内容差并经透视几何变换映射到 3D 扰动容限,据此实施结构感知的局部极大最差情况扰动(Structure-Aware Perturbation),得到扰动参数 \(\hat{\mathcal{G}}\)。随后,在最差损失与经验损失之间采用结构感知的动态加权机制(Structure-Aware Regularization Weighting)进行梯度反向传播,实现对高细节区保锐度、对平坦区强制平坦化的解耦调控。

整体优化流程如下图所示:

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入多视角稀疏图像"] --> B["几何容差图构建<br/>梯度检测与边缘距离变换"]
    B --> C["高斯基元投影与3D容差映射<br/>像素距离经透视深度换算"]
    C --> D["结构感知锐度扰动<br/>自适应扰动半径最差情况探索"]
    D --> E["最差损失计算与动态加权<br/>高细节保锐度与平滑区强制平坦"]
    E --> F["高斯参数梯度更新<br/>抑制漂浮物并保留锐利边缘"]

关键设计

1. 几何容差图构建:量化局部图像结构对几何扰动的敏感度

为了度量场景中各区域对高斯形变或微移的渲染敏感度,本文在输入图像平面定义几何容差图 \(\Gamma^v(p)\)。设 \(H^v\) 为视图 \(v\) 中具有显著图像梯度的高细节像素集合(如边缘与丰富纹理)。像素 \(p\) 处的容差定义为其到最近高细节像素的欧几里得距离:

\[\Gamma^v(p) = \min_{p' \in H^v} \|p - p'\|_2\]

由此,靠近精细边界的区域其容差值趋近于 0,即使微小几何微调也会产生剧烈图像变化;而处于平滑内部的区域则具有极大的容差值,较大幅度的高斯摆动对主干渲染影响有限。该距离直接反映了局部几何对投影基元摄动的物理容忍范围。

2. 结构感知锐度:基于透视几何投影的自适应扰动半径

传统的 SAM 在全模型参数空间施加固定的全局扰动半径 \(\rho\),这会导致边缘高斯的扰动越界越过极小值边界,同时平滑区域的弱小漂浮物无法被充分激发。本文将扰动计算解耦至每个独立高斯基元的几何属性 \(\theta_i \in \{\mu_i, q_i, s_i\}\)。通过将高斯中心 \(\mu_i\) 投影到相机平面得到 2D 投影坐标 \(\mu'_i\),查询容差图获取局部容差 \(\gamma_i = \Gamma^v(\mu'_i)\)。根据透视投影原理,图像平面的 2D 偏移量 \(\gamma_i\) 对应于三维物理空间中的位移需乘以尺度因子 \(d_i / f\)(其中 \(d_i\) 为高斯在当前相机坐标系下的深度,\(f\) 为相机焦距)。结合该尺度关系,高斯几何属性的最坏情况扰动定义为:

\[\hat{\theta}_i = \theta_i + \gamma_i \frac{d_i}{f} \rho_\theta \frac{\nabla_{\theta_i} \mathcal{L}}{\|\nabla_{\theta_i} \mathcal{L}\|_2}\]

这一结构感知设计确保了在高细节敏感区域施加微弱扰动,避免对局部目标最大值发生过冲震荡,而在平坦区实施较大幅度探索,精准定位真实的最差损失状态。

3. 结构感知正则化动态加权:按区域精细调控平坦化惩罚强度

在推导出最差情况参数 \(\hat{\mathcal{G}}\) 并计算最差损失 \(\hat{\mathcal{L}}\) 后,优化目标需要联合权衡经验拟合与损失锐度。如果对所有基元施加相同比例的平坦化惩罚,高细节高斯的高锐度将被强行抹平造成模糊。本文根据归一化容差设计基元级的动态加权方案,定义正则化权重 \(\bar{\gamma}_i = 0.95 \cdot \gamma_i / \gamma_{\max}\)\(\gamma_{\max}\) 为全图最大容差,0.95 为经验上界)。加权后的总体优化损失函数为:

\[\mathcal{L}_{\text{total}} = \mathcal{L} + \frac{\bar{\gamma}_i}{1 - \bar{\gamma}_i} (\hat{\mathcal{L}} - \mathcal{L}) = \frac{1 - 2\bar{\gamma}_i}{1 - \bar{\gamma}_i} \mathcal{L} + \frac{\bar{\gamma}_i}{1 - \bar{\gamma}_i} \hat{\mathcal{L}}\]

当高斯位于精细边缘时,\(\bar{\gamma}_i \to 0\),锐度正则项基本消失,完全退化为追求极高精度的经验经验拟合损失,允许损失景观保持锐利;当高斯位于平坦低频区域或悬空漂浮物附近时,\(\bar{\gamma}_i \to 0.95\),平坦极小值约束占据主导,强制该区域极小值变得平坦,从而剔除因欠定监督造成的尖锐局部假极小值(即漂浮物)。

损失函数 / 训练策略

整体算法在每个训练迭代中先计算前向经验渲染损失 \(\mathcal{L}\),对各高斯参数计算一阶导数;依据各高斯中心对应的 3D 容差半径沿梯度上升方向计算扰动参数 \(\hat{\mathcal{G}}\) 并重新渲染获得最坏情况损失 \(\hat{\mathcal{L}}\);最后按自适应权重加权后反向传播更新原始参数 \(\mathcal{G}\)。该优化不引入额外的网络参数,计算开销可控,可无缝替换原生 Adam 优化步。

实验关键数据

主实验

在经典的真实场景基准 LLFF(极稀疏 3 视角配置)与 MipNeRF-360(12 视角配置)上,将本文方法(FASR)无缝嵌入到标准 3DGS 以及结合先验的最前沿稀疏视角高斯方法中(各运行多轮取均值与方差):

数据集 / 基线方法 配置 PSNR ↑ SSIM ↑ LPIPS ↓
LLFF (3 views) 3DGS [ACM TOG'23] 19.810 ± .339 .6790 ± .0078 .2145 ± .0065
3DGS + Ours 20.783 ± .300 .7197 ± .0032 .1965 ± .0034
CoR-GS [ECCV'24] 20.185 ± .142 .7015 ± .0040 .2029 ± .0035
CoR-GS + Ours 20.862 ± .154 .7283 ± .0042 .1932 ± .0030
DropGaussian [CVPR'25] 20.461 ± .212 .7070 ± .0045 .2064 ± .0047
DropGaussian + Ours 20.853 ± .227 .7295 ± .0045 .1969 ± .0040
NexusGS [CVPR'25] 21.048 ± .049 .7382 ± .0008 .1776 ± .0009
NexusGS + Ours 21.348 ± .078 .7511 ± .0012 .1714 ± .0011
SE-GS [ICCV'25] 20.725 ± .217 .7203 ± .0049 .1861 ± .0058
SE-GS + Ours 21.141 ± .223 .7403 ± .0042 .1803 ± .0038
MipNeRF-360 (12 views) 3DGS [ACM TOG'23] 18.903 ± .179 .5499 ± .0036 .3734 ± .0042
3DGS + Ours 19.303 ± .185 .5622 ± .0051 .3552 ± .0047
CoR-GS [ECCV'24] 19.515 ± .243 .5733 ± .0049 .3741 ± .0066
CoR-GS + Ours 19.805 ± .233 .5833 ± .0058 .3681 ± .0069
DropGaussian [CVPR'25] 19.514 ± .199 .5722 ± .0042 .3657 ± .0036
DropGaussian + Ours 19.625 ± .254 .5750 ± .0053 .3627 ± .0051
NexusGS [CVPR'25] 18.506 ± .098 .5222 ± .0031 .3587 ± .0021
NexusGS + Ours 18.736 ± .103 .5316 ± .0034 .3522 ± .0024
SE-GS [ICCV'25] 19.931 ± .288 .5930 ± .0063 .3702 ± .0054
SE-GS + Ours 20.135 ± .232 .5960 ± .0059 .3644 ± .0052

消融实验

在 LLFF 数据集上对结构感知锐度(SAS,Structure-Aware Sharpness)与结构感知正则化权重(SAR,Structure-Aware Regularization weight)进行逐步消融验证:

SAM 基线 SAS (结构感知扰动) SAR (自适应加权) PSNR ↑ SSIM ↑ LPIPS ↓ 说明
19.810 ± .339 .6790 ± .0078 .2145 ± .0065 原生 3DGS 基线,严重过拟合与漂浮物
20.198 ± .218 .6958 ± .0034 .2095 ± .0036 原生 SAM:全局平坦化使精细边缘明显模糊
20.570 ± .161 .6980 ± .0037 .2142 ± .0042 仅自适应加权:边缘锐度有所保留
20.560 ± .259 .7116 ± .0038 .2023 ± .0032 仅自适应扰动半径:大幅改善局部极大值探索
20.783 ± .300 .7197 ± .0032 .1965 ± .0034 完整模型(Ours Full):指标达到最优且视觉最清晰

关键发现

  • 损失锐度与泛化误差并非单调线性相关:在 Lego 场景可视化中,原生 SAM 获得了最低的 Hessian 最大特征值 \(\lambda_{\max} = 1.88 \times 10^{-3}\)(远低于 3DGS 的 \(2.81 \times 10^{-3}\)),但在测试集上的平均误差(.03269)反而明显劣于本文方法(.03078,\(\lambda_{\max} = 2.77 \times 10^{-3}\))。这证明在新视角合成中,一味追求极致平坦会破坏高细节重建,适度的局部锐度是必不可少的。
  • 欠定稀疏度越高,提升越为显著:按多视角共视程度(Covisibility)分级评估,在只有 1 个视角覆盖的极欠约束区域(Covisibility 1),本文带来的平均误差降低达到 \(-0.0142 \pm .0074\);而在 3 个视角共同覆盖的区域(Covisibility 3)改善量为 \(-0.0066 \pm .0043\)。表明损失景观平坦化对于缺乏多视角三角交汇约束的“自由度过大”区域具有极其强悍的泛化约束作用。
  • 跨范式通用泛化能力:除了 3DGS,该核心思想还能拓展至其他平坦极小值优化器(如随机权重扰动 RWP,PSNR 从 20.079 提升至 20.650)、动态场景流式 3D 高斯(减少时序抖动,mTV 从 .1109 降低到 .0989),以及经典隐式 NeRF 架构(FreeNeRF 的 PSNR 从 19.523 提升至 19.584)。

亮点与洞察

  • 打破“越平坦越泛化”的传统认知盲区:文章明确提出新视角合成具有空间异构性——高细节高斯参数必须在参数空间拥有局部较陡峭的锐利极小值以锚定亚像素级结构,而平滑区域与背景伪影需要平坦极小值,指出了传统全局优化理论在三维辐射场重建中的盲区。
  • 优雅的 2D 容差向 3D 扰动几何投影机制:不依赖深度学习先验模型,直接利用图像梯度距离结合透视反投影尺度 \(d_i / f\) 确定 3D 高斯扰动幅度,计算极其精巧、轻量且具备严谨的投影几何可解释性。
  • 纯优化层面的即插即用泛化器:无须修改网络渲染管线,无须引入单目深度估计或扩散模型先验,直接作为优化器插件即可与 DropGaussian、NexusGS、CoR-GS 等正交叠加,带来几乎免费的全面性能增益。

局限与展望

  • 计算开销较原生 SGD/Adam 有所上升:因为在最差扰动计算步骤需要进行额外的反向传播计算梯度与前向重渲染,整体迭代训练时间相比标准 3DGS 大约增加了一倍左右。
  • 强依赖初始视角的梯度图质量:几何容差图的有效性高度取决于输入图像边缘检测的准确度,如果稀疏输入图像中存在大面积复杂运动模糊、强噪声或低照度曝光不足,容差距离计算可能会退化。
  • 未来方向:可进一步探索自适应动量与历史 Hessian 信息的免重测扰动近似技术以缩减训练耗时,并将结构感知平坦化理念推广到前馈式通用大尺度 3D 重建基础模型中。

相关工作与启发

  • vs SAM (Sharpness-Aware Minimization): SAM 是通用的平坦极小值优化器,但全局施加各向同性扰动,导致 3DGS 出现严重模糊;本文提出了结构感知锐度(SAS)和自适应权重(SAR),在高细节区保留必要的锐度,在低细节区强化平坦性。
  • vs Sparfels: Sparfels 同样尝试最小化稀疏视角的“最差情况损失”,但其简化为冻结高斯均值、仅用光线色彩方差作为代理上限;本文则直接对所有高斯几何参数进行端到端的最差扰动探索,能够有效抑制色彩匹配但几何错误的悬浮伪影。
  • vs 现存稀疏 3DGS 方法 (NexusGS, CoR-GS): 现有方法多聚焦于外部模型先验(如基础深度模型)或结构正则约束;本文专注于最底层的参数损失景观优化,与现有方法完全正交,二者叠加可取得更高的新视角质量。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ [首次揭示稀疏新视角合成中损失锐度与泛化性的非单调关系,提出结构感知平坦极小值优化机制]
  • 实验充分度: ⭐⭐⭐⭐⭐ [覆盖静态/动态、显式 3DGS/隐式 NeRF、多类优化器与最前沿多视角基线,消融与损失景观可视化极其详实]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑严密,图文对应清晰,从现象发现到机制推导层层推进]
  • 价值: ⭐⭐⭐⭐⭐ [为新视角合成提供了全新的优化算法理论视角,普适性与实用价值极高]