PaD-GS: Leveraging Distortion Map for Panoramic Gaussian Splatting¶
会议: ECCV 2026
论文: ECCV Official
代码: https://github.com/CosyXu/PaD-GS
领域: 3D 视觉
关键词: 3D Gaussian Splatting, Panoramic Image Rendering, Distortion Map, Equirectangular Projection
一句话总结¶
PaD-GS 针对全景等矩形投影(ERP)固有几何畸变导致的伪影与几何模糊,构建了基于极角的畸变图,并提出结合全局特征解码与局部不透明度自适应调制的双阶机制,实现了显著优于已有方案的全景新视角合成质量。
研究背景与动机¶
全景图像的新视角合成(Novel View Synthesis)在虚拟现实、机器人自主漫游以及大尺度三维场景重建中扮演着不可替代的角色。相比于传统基于神经辐射场(NeRF)的全景渲染方案因庞大体素查询和低效体素采样带来的计算瓶颈,3D 高斯泼溅(3DGS)凭借其显式表征与极快的显卡栅格化速度,成为全景沉浸式渲染的高潜力新范式。现有方法通常通过在光栅化管线中引入等矩形投影(Equirectangular Projection, ERP)函数将 3DGS 扩展到全景图像,或尝试通过联合优化相机参数来缓解位姿与视角失真。
然而,这类现有方法在实际渲染中仍普遍受到全景严重畸变的严重困扰。等矩形投影在将球面映射到二维平面时引入了剧烈非均匀畸变,特别是随着极角增大、靠近极点两极时,微小立体球面面积元在平面图像上的展开比例呈现 \(\frac{1}{\cos\theta}\) 的急剧放大。现存方案大都仅停留在投影公式层面的局部几何适配或增加冗余高斯球补偿,高斯基元本身的表征学习过程未曾感知这种非均匀畸变,导致高畸变区域的高斯累积产生严重的不透明度累积偏差,渲染结果出现显著的边缘模糊、细长几何断裂与颜色不一致。
针对全景畸变在全图分布极度不均且直接干扰高斯生成的痛点,本文提出不应仅在栅格化外层被动适配投影,而应将几何畸变显式量化并引导高斯表征的全生命周期学习。核心 idea:从全景成像物理几何出发构建每个像素的畸变程度图(Distortion Map),并提出由全局解码到局部不透明度抑制(whole-to-partial)的双重畸变感知网络,使高斯基元天然具备抗畸变能力。
方法详解¶
整体框架¶
PaD-GS 以同一场景采集的全景图像及对应 SfM 稀疏点云为输入。首先基于体素化将点云中心划分为体素锚点(Voxel Anchors)。在训练与渲染前向过程中,系统通过构建的物理全景畸变图(Distortion Map)赋予表征抗畸变特性。整个架构由全局到局部逐级展开:先由“畸变感知高斯解码模块”结合可学习锚点特征、视角方向、相机距离与畸变程度,解码出完整的高斯几何与颜色属性;再由“畸变感知不透明度调制模块”依据所处区域的畸变强弱,自适应抑制高失真区域高斯基元的不透明度过贡献;最终送入全景高斯栅格化器渲染出高质量全景图。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["SfM 稀疏点云 + 全景视角输入"] --> B["全景畸变图构建<br/>极角推导面积膨胀比"]
B --> C["畸变感知高斯解码<br/>锚点特征与畸变图联合解码"]
C --> D["畸变感知不透明度调制<br/>高畸变区域自适应抑制"]
D --> E["全景 3DGS 栅格化渲染<br/>球面积加权损失监督"]
关键设计¶
1. 全景成像物理畸变图构建:从几何本质解析像素膨胀率
现有工作往往忽视了等矩形投影畸变的确定性数学规律。设相机坐标系下空间三维点为 \((x, y, z)\),其在单位球上的方位角与极角分别为 \(\phi = \arctan(y, -x)\) 与 \(\theta = \arctan(z, \sqrt{x^2+y^2})\)。映射至 \(W \times H\) 的全景图像平面后,球面面积微元 \(dA_{\text{sphere}} = \cos\theta d\phi d\theta\) 对应的图像面积微元为 \(dA_{\text{erp}} = dudv = \frac{WH}{2\pi^2} d\phi d\theta\)。两者的面积缩放比严格正比于 \(\frac{1}{\cos\theta}\),即极角越偏离赤道(\(\theta \to \pm\frac{\pi}{2}\)),像素平面产生的拉伸畸变越剧烈。
为了将这一连续几何特征规范化并输入神经网络,作者将极角归一化至 \([0, 1]\) 之间(0 表示无畸变的赤道 \(\theta=0\),1 表示畸变最严重的极点),构建出单通道畸变图 \(\Omega \in \mathbb{R}^{H \times W}\): $\(\Omega(u, v) = 1 - \cos^2\theta = 1 - \cos^2\!\left(\frac{\pi}{H}v - \frac{\pi}{2}\right)\)$ 该畸变图每个像素的灰度值精确量化了该位置的失真严重度,为后续高斯生成与不透明度调整提供了无额外推理开销的物理先验。
2. 畸变感知高斯解码模块:在基元生成阶段注入全局畸变先验
传统 3DGS 独立优化每个离散高斯的均值与协方差,在全景大范围畸变区域容易陷入局部过拟合或长轴发散。PaD-GS 采用体素锚点表征机制,每个锚点 \(V^k\) 携带可学习特征向量 \(f^k \in \mathbb{R}^C\)、缩放因子 \(l^k\) 以及 \(N\) 个局部偏移 \(\{P_i^k\}_{i=1}^N\)。锚点中心投影至全景平面后,直接索引获取对应的畸变值 \(\Omega^k\)。
随后,将锚点特征 \(f^k\)、畸变值 \(\Omega^k\)、相对于相机中心的欧氏距离 \(\delta^k\) 以及视角观察方向 \(d^k\) 拼接,共同输入三个专属 MLP(不透明度 MLP、颜色 MLP 与协方差 MLP): $\(\{o_i^k, c_i^k, S_i^k, R_i^k\}_{i=1}^N = \mathcal{F}_{\{\text{opa}, \text{col}, \text{cov}\}}(f^k, \Omega^k, \delta^k, d^k)\)$ 高斯中心坐标则由 \(\mu_i^k = X^k + l^k \cdot P_i^k\) 得到。通过在网络输入端直接加入 \(\Omega^k\),解码网络能够在特征级感知当前位置的几何扭曲倾向,从而自适应预测更合理的基元协方差缩放与初始透明度。
3. 畸变感知不透明度调制模块:抑制高失真区域的累积伪影
即便网络全局学习了畸变特征,由于高畸变区域(如天花板、地面两极)投影后像素占比较大,大量重叠的高斯在 \(\alpha\)-blending 累积阶段依然极易引发过度曝光与弥散状模糊。为解决部分属性(局部不透明度)的过量贡献问题,该模块建立细粒度自适应调控机制。
对于畸变极小的赤道平缓区域,系统最大限度保留全解码输出的不透明度以维持高保真纹理细节;而对畸变严重的区域,则引入惩罚系数进行线性衰减。最终参与光栅化的高斯有效不透明度 \(\hat{o}_i^k\) 计算为: $\(\hat{o}_i^k = o_i^k \cdot (1 - \tau \cdot \Omega^k)\)$ 其中 \(\tau\) 为调制强度超参数(实验中设定为 0.9)。该设计在局部层面直接削弱了极点不稳定高斯的累积穿透率,彻底改善了高畸变区域的细长杆件与背景伪影。
损失函数 / 训练策略¶
PaD-GS 的总目标函数结合了像素级加权 \(\mathcal{L}_1\) 损失与结构相似性损失 \(\text{SSIM}\)。为了杜绝赤道与极点像素因面积微元膨胀比例不同导致的训练梯度失衡,设计了依据球面面积比反向加权的权重图 \(M \in \mathbb{R}^{H \times W}\): $\(\mathcal{L} = (1 - \lambda) \| M \odot (\hat{I} - I) \|_1 + \lambda (1 - \text{SSIM}(M \odot \hat{I}, M \odot I))\)$ 权重图取值为 \(M(u, v) = \cos\theta = \cos\left(\frac{\pi}{H}v - \frac{\pi}{2}\right)\),平衡不同极角位置像素在球面实际积分中的贡献。模型在单张 NVIDIA RTX 3090 Ti 上训练 30,000 步,在 1500 至 15,000 步间每 100 步进行高斯稠密化与剪枝。
实验关键数据¶
主实验¶
在代表性室内全景数据集 360Roam(11 个场景)和室外全景数据集 Ricoh360(12 个场景)上,与主流全景渲染 SOTA 方法(NeRF 类 EgoNeRF,以及全景 3DGS 方案 OP43DGS、ODGS、OmniGS、SPaGS)进行了充分对比。
| 数据集 | 指标 | PaD-GS (本文) | SPaGS [18] (次优) | OmniGS [19] | EgoNeRF [4] | 相对提升 |
|---|---|---|---|---|---|---|
| 360Roam (Indoor 平均) | SSIM ↑ | 0.821 | 0.788 | 0.799 | 0.725 | +0.022 (+2.7%) |
| PSNR ↑ | 26.02 | 24.90 | 24.84 | 23.70 | +1.12 dB | |
| LPIPS ↓ | 0.227 | 0.288 | 0.272 | 0.435 | -0.045 (-16.5%) | |
| Ricoh360 (Outdoor 平均) | SSIM ↑ | 0.845 | 0.835 | 0.825 | 0.766 | +0.010 (+1.2%) |
| PSNR ↑ | 26.54 | 26.20 | 26.00 | 25.28 | +0.34 dB | |
| LPIPS ↓ | 0.184 | 0.192 | 0.212 | 0.292 | -0.008 (-4.2%) |
(注:数据源自原文 Table 1 与 Table 2。对比方法 OP43DGS 在 Ricoh360 室外大场景上因显存占用过大全部 OOM 崩溃。)
消融实验¶
在 360Roam 的 Bar 场景与 Ricoh360 的 Cat-tower 场景上,针对畸变感知解码(DAGD)、不透明度调制(DAOM)以及球面积损失加权图 \(M\) 进行了逐步拆解验证。
| 配置 | 360Roam (Bar) SSIM / PSNR / LPIPS | Ricoh360 (Cat-tower) SSIM / PSNR / LPIPS | 说明 |
|---|---|---|---|
| Baseline (全景 3DGS) | 0.786 / 22.29 / 0.257 | 0.776 / 24.92 / 0.226 | 未加入畸变感知机制的基础全景 3DGS |
| + DAGD | 0.801 / 23.13 / 0.240 | 0.797 / 25.36 / 0.208 | 引入畸变图指导全局高斯解码,PSNR 显著提升 0.84/0.44 dB |
| + DAGD + DAOM (w/o M) | 0.804 / 23.24 / 0.245 | 0.808 / 25.60 / 0.194 | 叠加局部不透明度自适应调制,抑制高畸变累积 |
| Full Model (PaD-GS) | 0.808 / 23.40 / 0.230 | 0.812 / 25.75 / 0.187 | 完整模型(含球面积归一化加权图 \(M\)),达到最优综合表现 |
(注:数据源自原文 Table 3。)
关键发现¶
- 由全局到局部层层递进:消融表明 DAGD 奠定了基础特征生成的准确性,使室内
Bar场景 PSNR 从 22.29 跃升至 23.13 dB;而 DAOM 则专注于净化局部高畸变噪点,进一步带来 0.11~0.24 dB 涨幅与感知质量(LPIPS 降低 0.010~0.014)的改善。 - 细长细微结构保真度极高:在椅腿、树干及天花板线缆等容易被全景畸变扯断的结构上,可视化对比(Fig. 4 & 5)显示 OmniGS 和 SPaGS 产生大面积结构断裂与模糊伪影,PaD-GS 则保持了极佳的几何边缘平滑度与结构连续性。
- 效率与精度的权衡:训练时间约 1.35~1.66 小时,渲染速度达到 23~30 FPS。虽然略慢于纯栅格化优化的 SPaGS(78~83 FPS),但彻底解决了 OP43DGS 显存爆炸(OOM)问题,并在 PSNR 上领先 SPaGS 多达 1.12 dB。
亮点与洞察¶
- 物理导向的无开销先验注入:作者没有依靠复杂的黑盒神经网络去隐式学习畸变,而是直接从球面微元与全景平面的雅可比面积比中精确导出畸变图 \(\Omega(u, v) = 1 - \cos^2\theta\),零参数代价赋予了网络强健的物理约束。
- Whole-to-Partial 两阶段解耦设计:将高斯属性解码(整体特征建模)与不透明度调制(局部光栅化累积调优)解耦。避免了单点改动引起的表征能力退化,使抗畸变能力贯穿生成到渲染全过程。
- 对大场景和室外环境的高鲁棒性:室外全景常常具有大跨度深度差异和强烈极点畸变,现有方法如 OP43DGS 无法承受高分辨率下的几何形变计算,PaD-GS 通过锚点结合轻量 MLP 稳定训练,未发生显存溢出。
局限与展望¶
- MLP 解码带来的额外推断时延:与纯显式直接存储所有高斯参数的原生 3DGS 相比,锚点驱动结合 MLP 解码带来了计算开销,渲染帧率处于 23~30 FPS(实时边缘),未来可探索将 MLP 解码后的属性进行静态烘焙(Baking)以释放百帧以上的渲染潜力。
- 对极重度动态物体或位姿不准的鲁棒性:当前流程依然严重依赖前序 SfM(如 OpenMVG)的点云质量和精确相机位姿。如果采集设备存在较大缝合误差(Stitching seams)或动态物体未遮罩,畸变图引导可能受到局部错位干扰。
相关工作与启发¶
- vs OmniGS [19]: OmniGS 提出基于 GPU 的等矩形全景光栅化器,极大加速了全景 3DGS,但高斯表征本身是标准各向异性高斯,没有感知极点拉伸;PaD-GS 沿用了其栅格化管线,但重构了高斯学习与透明度抑制机制,在室内场景 PSNR 高出 1.18 dB。
- vs SPaGS [18]: SPaGS 采用光线投射与 AABB 包围盒实现超快渲染(80+ FPS),但缺乏针对高纬度畸变的针对性表征优化,在两极边缘区域出现显著伪影;PaD-GS 在保真度、细节锐利度及感知指标上全面胜出。
- vs SC-OmniGS [9] / Seam360GS [29]: 这两类方案侧重于相机内参/外参自标定以及接缝优化,而 PaD-GS 则从高斯表征的生成与空间属性调制切入,两者在技术路线上互补,未来可尝试结合。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ (从成像物理出发推导畸变图并设计由粗到细的抗畸变高斯学习机制,构思简洁优雅)
- 实验充分度: ⭐⭐⭐⭐⭐ (在室内与室外两大全景基准 23 个场景上全面评测,指标扎实,消融清晰)
- 写作质量: ⭐⭐⭐⭐⭐ (几何推导严谨清晰,系统架构与动机呼应紧密)
- 价值: ⭐⭐⭐⭐☆ (为 VR/全景三维重建领域提供了抗畸变高斯泼溅的标准参考范式,代码开源)