跳转至

SubSplat: High-Resolution Pixel-aligned 3DGS via Sub-pixel Gaussian Reparameterization

会议: ECCV 2026
论文: ECCV 官方页面
领域: 3D 视觉
关键词: 3D 高斯泼溅、像素对齐模型、通用新视角合成、亚像素重参数化、高分辨率渲染

一句话总结

SubSplat 通过亚像素高斯重参数化器(SPGR)与可变形注意力多视图特征聚合,在保持主干网络低分辨率输入与低延迟的前提下,将每个锚点主高斯在 3D 空间细分为多个精细亚像素图元并守恒重分配不透明度,彻底解决了像素对齐 3DGS 在高分辨率渲染上面临的二次计算膨胀与欠参数化伪影矛盾。

研究背景与动机

基于前馈神经网络的像素对齐 3D 高斯泼溅(Pixel-aligned 3DGS)摆脱了传统 3DGS 对逐场景耗时优化的强依赖,能够从稀疏的多视角图像中快速前向预测高斯参数,实现了出色的跨场景通用新视角合成能力。然而,当前的像素对齐方法通常在固定的输入图像网格上预测图元,高斯基元总数与输入的空间分辨率呈内生绑定关系。当面对现代 AR/VR 设备与高清显示所苛求的高分辨率(如 \(1024 \times 1024\) 及以上)渲染需求时,这种固定的网格架构陷入了极其尖锐的质量与效率权衡。

若为了提升图元密度而直接将输入图像分辨率提升到与目标渲染相同的尺寸,主干网络(特征提取、交叉注意力与平面扫描代价体)的前向计算开销与显存占用将呈现二次方暴增(分辨率翻倍导致计算量跃升 4 倍),不仅导致推理延迟急剧恶化,甚至频繁引发显存溢出(OOM);反之,若保持低分辨率输入以控制计算预算,直接将预测出的粗稀疏高斯图元投影光栅化到高分辨率屏幕上,则高斯图元相对于目标屏幕像素严重欠参数化(Under-parameterization),造成严重的模糊、边缘闪烁以及光晕伪影。而若在二维图像空间施加双线性插值或超分辨率后处理网络,又无法弥补底层 3D 几何与纹理细节的缺失,极易引入跨视角不一致的伪影。

本文的切入角度是打破「特征计算网格分辨率」与「3D 高斯图元密度」之间的强耦合,让重量级主干网络始终稳定运行在低分辨率网格上,而在 3D 几何重参数化阶段轻量高效地衍生高密度图元。核心 idea:引入亚像素高斯重参数化器(SPGR),利用三阶段可变形注意力聚合的多视图几何与外观上下文,将每个粗粒度主高斯几何细分为 \(K\) 个亚像素 3D 图元,并基于视锥视网膜足迹守恒地重分配不透明度与调制颜色,以极低开销恢复高频结构细节。

方法详解

整体框架

SubSplat 接收稀疏视角的低分辨率图像(如 \(256 \times 256\)),端到端合成高分辨率(如 \(512 \times 512\)\(1024 \times 1024\))的新视角图像。整个系统分为三个紧密协同的阶段:首先,采用像素对齐主干网络预测初始的主高斯参数集 \(\mathcal{A}\) 和球谐系数 \(\mathcal{H}\);其次,构建基于可变形注意力的特征聚合机制,分别提取引导结构形变的多视图几何描述符与外观描述符;最后,送入亚像素高斯重参数化器(SPGR),由专属的几何预测头与外观预测头分别预测每个图元的空间几何偏移(位置、深度残差、各向异性缩放、局部旋转)以及外观调整(足迹感知不透明度分配、颜色调制因子),生成密集的亚像素高斯,最终由可微分高斯光栅化器实时渲染输出。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    In["稀疏低分辨率多视角图像<br/>(如 256×256)"] --> Init["主干网络初始化<br/>预测主高斯集合 A 与球谐系数 H"]
    Init --> FA["多视图特征聚合<br/>三阶段可变形注意力提取几何与外观描述符"]
    FA --> Geom["几何重参数化 (SPGR 几何头)<br/>预测亚像素 3D 偏移、深度残差与旋转缩放"]
    FA --> App["外观重参数化 (SPGR 外观头)<br/>足迹感知不透明度守恒分配与颜色调制"]
    Geom --> Prims["K 个高密度亚像素 3D 高斯图元<br/>(K = 4 或 16)"]
    App --> Prims
    Prims --> Rast["可微高斯光栅化渲染<br/>实时高分辨率新视角输出"]

关键设计

1. 多视图可变形注意力特征聚合:解耦几何导向与外观增强 为了给后续的亚像素分裂提供细致且视角一致的上下文线索,方法没有直接依赖单视角的粗特征,而是构建了多视图特征聚合网络。对于每个主高斯 \(p\),首先将其空间位置、各向异性尺度、四元数朝向以及不透明度通过小型 MLP 映射后投影相加,得到几何查询向量 \(\mathbf{z}^g_p\);随后利用相机投影矩阵将高斯中心投影到各参考视角,借助堆叠的三阶段可变形注意力层(Deformable Attention)由局部到全局捕获跨视角特征,生成几何描述符 \(\mathbf{f}^g_p\)。在此基础上,外观特征聚合以扁平化的球谐系数嵌入为查询 \(\mathbf{z}^a_p\),并将几何描述符 \(\mathbf{f}^g_p\) 作为条件输入协同驱动可变形注意力采样。这一解耦且条件级联的设计让几何网络明确“在哪里对齐边界”,外观网络明确“在哪里强化纹理”,确保分裂后的图元具备高度的跨视图多致性。

2. 几何重参数化:视线光线对齐的亚像素 3D 偏移与协方差更新 几何重参数化头 \(g_\theta\) 将每个主高斯的几何描述符 \(\mathbf{f}^g_p\) 映射为 \(K\) 个亚像素图元的几何扰动向量,其中 \(K\) 是目标分辨率与输入分辨率的面积缩放比(例如 \(2\times\) 超分时 \(K=4\)\(4\times\) 超分时 \(K=16\))。为了保持 3D 空间结构的严谨性,模型选取主高斯可见且正深度最小的参考相机作为基准视图,在相机平面内以规则网格为基础预测 2D 亚像素偏移 \((\Delta u_k, \Delta v_k)\),并通过相机内参将其反投影到视线光线上;同时预测沿视线方向的有界深度残差 \(\Delta \hat{z}_k = \tanh(\Delta z_k)\)。世界坐标系下的亚像素中心位置表达为: $$ \mathbf{\mu}{p,k} = \mathbf{\mu}_p + R $$ 此外,各亚像素图元通过预测的对数残差 } \begin{bmatrix} z_{\text{sel}} \frac{\Delta u_k}{f_x} \ z_{\text{sel}} \frac{\Delta v_k}{f_y} \ \Delta \hat{z}_k \end{bmatrix\(\Delta \log \mathbf{s}_k\) 和轴角旋转增量 \(\Delta \mathbf{r}_k\) 独立调节局部协方差:尺度更新为 \(\mathbf{s}_{p,k} = \mathbf{s}_p \odot \exp(\Delta \log \mathbf{s}_k)\),旋转则将增量四元数复合至原四元数上 \(q_{p,k} = \text{norm}(q_p \otimes q(\Delta \mathbf{r}_k))\)。各图元得以自主发生各向异性拉伸与微旋转,从而紧密贴合复杂的细微几何表面。

3. 足迹感知不透明度守恒分配与颜色调制:兼顾锐利边界与抗锯齿 如果直接分裂高斯而不控制不透明度,密集体积叠加将导致严重的过饱和与伪影。外观头 \(h_\phi\) 预测未归一化的分配 logits \(\ell_k\) 和有界颜色增益 \(\gamma_k\)。为了避免细小高斯在边缘处虚化,模型通过投影雅可比矩阵 \(J_p\) 计算各图元在屏幕空间的投影足迹面积 \(\tilde{A}_k \approx \sqrt{\det(J_p \Sigma_k J_p^\top)}\),并定义逆面积加权权重 \(\tilde{w}_k = \frac{\text{softmax}(\ell_k)}{\tilde{A}_k + \varepsilon}\)。图元最终的不透明度 \(\alpha_k\) 计算公式为: $$ \alpha_k = \alpha_p \cdot \frac{\tilde{w}_k}{\sum_j \tilde{w}_j} $$ 该设计优先将不透明度赋予屏幕投影足迹更小的图元,从而大幅增强物体边缘与高频结构的锐利度,同时天然满足 \(\sum_{k=1}^K \alpha_k = \alpha_p\) 的总不透明度守恒约束。球谐颜色则施加乘性增益 \(\mathbf{h}_{p,k} = \gamma_k \mathbf{h}_p\) 以校准局部光泽。此外,为抑制微小图元在高分辨率视网膜下可能产生的频闪和失真,模型引入了最小投影面积下界约束 \(A_{\min}\) 进行抗锯齿夹紧(Anti-aliasing Clamping)。

损失函数 / 训练策略

模型端到端训练,损失函数由渲染视图与真实图像(GT)之间的 \(\ell_2\) 光度重建损失与 LPIPS 感知损失加权组成: $$ \mathcal{L} = \mathcal{L}2 + \lambda \mathcal{L} $$ 超参数 }\(\lambda\) 遵循通用基准设置为 0.05。网络在单张 NVIDIA A100 (80GB) GPU 上使用 Adam 优化器与 OneCycleLR 学习率调度策略(初始最大学习率 \(2 \times 10^{-4}\),含 2K 步预热)迭代训练 300K 步,批大小为 12。针对极高分辨率评测(如 \(1024 \times 1024\)),模型在 \(128 \times 128 \to 512 \times 512\)\(4\times\) 放大设置下预先训练,并无缝泛化至 \(256 \times 256 \to 1024 \times 1024\) 的前向推理。

实验关键数据

主实验

在代表性的大规模场景数据集 RealEstate10K(室内/室外大基线场景)和 ACID(自然景观)上,使用统一的 \(256 \times 256\) 输入图像,并在 \(2\times\)\(512 \times 512\))和 \(4\times\)\(1024 \times 1024\))两种高分辨率屏幕输出下评估多视角重建能力。

数据集 输出尺度 指标 PixelSplat MVSplat DepthSplat HiSplat 本文 (SubSplat) 优势/提升
RealEstate10K \(512 \times 512\) (\(2\times\)) PSNR↑ 23.44 19.46 19.54 23.26 25.52 +2.08 dB vs PixelSplat
RealEstate10K \(512 \times 512\) (\(2\times\)) SSIM↑ 0.789 0.751 0.720 0.803 0.850 +0.047 vs HiSplat
RealEstate10K \(512 \times 512\) (\(2\times\)) LPIPS↓ 0.227 0.269 0.309 0.207 0.167 -0.040 vs HiSplat
RealEstate10K \(1024 \times 1024\) (\(4\times\)) PSNR↑ 21.44 16.98 16.29 22.05 22.65 +0.60 dB vs HiSplat
RealEstate10K \(1024 \times 1024\) (\(4\times\)) SSIM↑ 0.767 0.671 0.587 0.779 0.781 +0.002 vs HiSplat
RealEstate10K \(1024 \times 1024\) (\(4\times\)) LPIPS↓ 0.323 0.424 0.461 0.309 0.268 -0.041 vs HiSplat
ACID \(512 \times 512\) (\(2\times\)) PSNR↑ 24.41 18.38 17.19 23.59 26.03 +1.62 dB vs PixelSplat
ACID \(512 \times 512\) (\(2\times\)) SSIM↑ 0.709 0.645 0.535 0.724 0.775 +0.051 vs HiSplat
ACID \(512 \times 512\) (\(2\times\)) LPIPS↓ 0.292 0.349 0.469 0.273 0.216 -0.057 vs HiSplat
ACID \(1024 \times 1024\) (\(4\times\)) PSNR↑ 22.95 16.57 16.32 22.03 23.35 +0.40 dB vs PixelSplat
ACID \(1024 \times 1024\) (\(4\times\)) SSIM↑ 0.661 0.616 0.630 0.674 0.674 持平最强基线
ACID \(1024 \times 1024\) (\(4\times\)) LPIPS↓ 0.409 0.489 0.476 0.388 0.330 -0.058 vs HiSplat

在保持目标渲染分辨率为 \(512 \times 512\) 时,对比各模型在延迟与峰值显存上的成本表现(基于单张 NVIDIA A100 GPU 测试):

方法 输入分辨率 输出分辨率 延迟 (ms)↓ 峰值显存 (GB)↓ PSNR↑ SSIM↑ LPIPS↓
PixelSplat \(512 \times 512\) \(512 \times 512\) 561 9.56 24.80 0.839 0.190
MVSplat \(512 \times 512\) \(512 \times 512\) 131 4.27 24.98 0.842 0.172
TranSplat \(512 \times 512\) \(512 \times 512\) 192 5.14 23.50 0.804 0.197
DepthSplat \(512 \times 512\) \(512 \times 512\) 123 4.58 24.70 0.851 0.170
HiSplat \(512 \times 512\) \(512 \times 512\) 1960 4.87 25.34 0.850 0.168
本文 (SubSplat) \(256 \times 256\) \(512 \times 512\) 42 1.57 25.52 0.850 0.167

相比于将输入推高至 \(512 \times 512\) 的基线,SubSplat 仅凭 \(256 \times 256\) 输入不仅画质更优,且延迟低至 42ms(达到 24 FPS 实时帧率),耗时仅为 MVSplat 的约 1/3、PixelSplat 的 1/13、HiSplat 的 1/46,显存占用仅 1.57 GB。

消融实验

在 RealEstate10K 上分别针对模块消融以及可变形注意力阶段数进行测试:

配置 / 阶段 \(K=4\) (\(512\times512\)) PSNR↑ \(K=4\) SSIM↑ \(K=4\) LPIPS↓ \(K=16\) (\(1024\times1024\)) PSNR↑ \(K=16\) SSIM↑ \(K=16\) LPIPS↓
基线 (MVSplat) 19.46 0.751 0.269 16.98 0.671 0.424
+ 亚像素重参数化 (SPGR) 25.15 (+5.69) 0.843 0.173 19.49 (+2.51) 0.736 0.415
+ 特征聚合 (完整模型) 25.52 (+0.37) 0.850 0.167 22.65 (+3.16) 0.781 0.268
可变形注意力 (DA) 阶段设置 PSNR↑ SSIM↑ LPIPS↓ 说明
单阶段 DA (One-stage) 23.94 0.833 0.194 基础多视图特征采样
双阶段 DA (Two-stage) 24.52 0.839 0.183 渐进式多尺度特征聚合
三阶段 DA (完整模型) 25.52 0.850 0.167 相比单阶段 PSNR 提升 +1.58 dB

关键发现

  • SPGR 是画质飞跃的根本驱动:在 \(K=4\) 分辨率缩放时,单纯引入亚像素重参数化器便使得 PSNR 从基线的 19.46 dB 跃升至 25.15 dB(净增 +5.69 dB),证明将固定像素网格解耦为 3D 亚像素图元有效根除了欠参数化模糊。
  • 特征聚合在极端缩放尺度下至关重要:当缩放尺度扩展到 \(K=16\)\(1024 \times 1024\) 渲染)时,仅靠 SPGR 的几何推断容易出现多视角几何退化(PSNR 仅 19.49 dB),而加入多视图可变形注意力特征聚合后,PSNR 显著回升 +3.16 dB 达到 22.65 dB,说明高倍率细节细分高度依赖跨视角的局部到全局上下文约束。
  • 对比 2D 图像超分辨率:在相同输入下,MVSplat 配合图像空间超分辨率模型 HiT-SR 耗时增加至 215ms 且 PSNR 仅 23.88 dB,还因多视角不一致产生振铃现象;而 SubSplat 在 3D 空间直接细分图元,以 42ms 极快速度取得 25.52 dB,验证了在 3D 图元空间进行密度扩展远优于 2D 图像后处理。

亮点与洞察

  • 3D 空间的频域解耦与密度扩展:传统通用 3DGS 强行通过增大输入网格来增加图元,计算代价以 \(\mathcal{O}(H W)\) 乃至二次方增长。SubSplat 巧妙地将昂贵的深度特征提取保留在低频空间,而在紧凑的几何属性空间进行轻量级的高频图元倍增,实现了计算开销与表示容量的优雅解耦。
  • 足迹反比的不透明度分配律:利用投影雅可比矩阵估计各子图元在屏幕空间的投影面积并进行反比加权,在严格维持 \(\sum \alpha_k = \alpha_p\) 总量守恒的同时,自适应把不透明度集中到小尺度图元上,显著强化了高频纹理与几何边缘的锋利度。
  • 轻量即插即用的工业级部署价值:SubSplat 保持了单卡 24 FPS 的实时渲染性能且显存占用极低(1.57 GB),这对于算力与内存极端受限的移动端 AR/VR 头显设备进行高清通用 3D 重建具有非常直观的借鉴意义。

局限与展望

  • 可变密度控制与自适应细分缺失:当前模型采用统一的固定细分因子 \(K\)(例如全图所有主高斯均细分为 4 或 16 个),导致在开阔无纹理的平坦区域产生冗余计算。未来可引入内容感知的自适应图元密度控制,在平坦区合并而在高频边缘区密集细分。
  • 大倍率超分的幻觉边界:当目标分辨率超越 \(4\times\)(如 \(8\times\) 乃至 \(16\times\))时,仅依赖低分辨率输入的几何与外观线索可能面临先验不足,未来可考虑融入多模态生成式扩散先验(Diffusion Priors)以补充极端微观细节。

相关工作与启发

  • vs MVSplat [Chen et al., ECCV 2024]: MVSplat 依赖固定网格且单像素只预测单个高斯,直接推向高分辨率时面临二次计算激增或欠参数化模糊;SubSplat 沿用其高效代价体主干,但在其后级联 SPGR 模块,实现了超 3 倍的吞吐加速与高达 6 dB 的高分辨率重构增益。
  • vs HiSplat [Tang et al., 2024]: HiSplat 通过三阶段特征多尺度提取高斯图元以改善质量,但前向推理极其耗时(延迟高达 1960ms);SubSplat 则将多尺度特征用于指导紧凑轻量的重参数化头,以 42ms 实时性能达到甚至超越 HiSplat 的重建质量。
  • vs PixelSplat [Charatan et al., CVPR 2024]: PixelSplat 在每个像素预测固定 3 个高斯,但在输入分辨率受限时依旧无法动态缩放至高清视网膜;SubSplat 依据渲染目标分辨率动态确定 \(K\),并具备严格的足迹守恒重分配机制。

评分

  • 新颖性: ⭐⭐⭐⭐ [构思精巧,将像素对齐 3DGS 的高分辨率渲染瓶颈转化为 3D 图元级亚像素重参数化问题]
  • 实验充分度: ⭐⭐⭐⭐⭐ [评测涵盖两大数据集、两种高倍缩放比例、完备的延迟/显存分析以及深入的模块与阶段消融]
  • 写作质量: ⭐⭐⭐⭐⭐ [论文逻辑极其严密,问题陈述、数学公式推导与图表呈现清晰规整]
  • 价值: ⭐⭐⭐⭐⭐ [攻克了前馈 3DGS 难以兼顾实时推理与高分辨率保真度的核心矛盾,对学术界与工业落地极具参考意义]