Fourier Splatting: Generalized Fourier encoded primitives for scalable radiance fields¶
会议: ECCV 2026
论文: ECCV 原文
领域: 3D 视觉
关键词: 高斯泼溅、平面基元、傅里叶边界参数化、细节层次 (LoD)、可扩展表示
一句话总结¶
本文把平面面元的边界从"固定圆盘"换成一条由傅里叶级数定义、可以随时截断的闭合曲线,让基元自身携带连续可调的细节层次:同一个训练好的模型只要在渲染时少传几个傅里叶系数,就能得到更低码率/更低细节的画面,无需重训或剪枝,在 Mip-NeRF 360 上取得平面基元方法中最好的 PSNR 与 SSIM。
研究背景与动机¶
显式基元泼溅已经成为实时新视角合成的主流路线。3DGS 用百万级各向异性高斯做光栅化,把 NeRF 的逐射线体渲染换成 tile 级并行光栅化,从而在实时的前提下拿到高保真画面;但它的基元是一个形状固定的平滑椭圆核,支撑集无限、轮廓永远平滑。此后一大批工作都在"换基元"上做文章:GES 把径向衰减推广成带可学形状参数的指数族,Deformable Beta Splatting 用紧支撑的 Beta 核,3D-HGS 把高斯沿平面切成半核,DRK 用可学基函数参数化径向轮廓,3D Convex Splatting 换成光滑凸体,Quadratic Gaussian Splatting 把面元从平盘弯成抛物面;平面路线则是 2DGS / Gaussian Surfels 把椭球压扁成有向面元,Triangle Splatting 干脆渲染可微三角形,BBSplat 给每个 billboard 平面配上纹理与 alpha 掩码。这些设计的共同特点是:每个基元的表达能力由架构设计决定,训练完就冻结,之后既不会变复杂也不会变简单。
于是提升保真度只剩下一条路——增加基元数量,高频细节靠"铺更多基元"而不是"让基元自己更复杂"来换取,显存、渲染与传输带宽随之线性上涨。另一条并行的研究线是 Level-of-Detail 层级:Octree-GS、LODGE 维护不同层级的 LoD 高斯并按渲染距离裁剪、混合,LOD-GS 在三角汤里嵌入高斯再降采样。它们确实能压缩码率、提升实时性,但可扩展的唯一轴是基元数量:变简单靠删高斯,变复杂靠加高斯,每个基元本身始终不变。这就是本文针对的核心矛盾:保真度被死死绑在基元数量上,而降级只能以"整块空间被丢掉"为代价——论文的定性图里 Octree-GS 降级时画面上的主体物会直接消失,而基元自身的几何复杂度在训练结束那一刻就失去了可调性。而实际上,把一条曲线从 6 个频率分量降到 1 个,本来就是最自然的"降精度"方式。
本文的切入角度是把可扩展性内建进基元本身:不去减少"有多少个基元",而是降低"每个基元有多复杂"。核心 idea:用可截断的傅里叶编码描述子参数化平面面元的边界,让"保留多少个频率分量 K"直接充当连续可调的细节层次;再用直通估计器把梯度外延到基元边界之外、用 HYDRA 在 MCMC 密度化框架内把多叶瓣的复杂基元分解成更简单的子基元,从而在固定基元预算下把这些形状稳定地优化出来。
方法详解¶
整体框架¶
输入是多视角图像(配合 SfM 点云初始化位置),输出是一组可直接 tile 光栅化的平面基元。每个基元沿用 2DGS 的面元形式:切平面中心、朝向四元数、不透明度、球谐颜色,并额外携带两样东西——把边界形状写成傅里叶级数的振幅与相位,以及一个控制衰减窗软硬的 sharpness \(\sigma_i\)。渲染仍走 2DGS 那条管线:像素光线与面元平面求交得到切平面坐标 \((u_j, v_j)\),在切平面内计算不透明度,再按深度前向合成;区别在于把"固定圆盘上的二维高斯衰减"换成"傅里叶边界内的幂衰减窗",并为这个硬边界补上只在反向传播生效的平滑替代梯度。训练整体在 MCMC 密度化框架(3DGS-MCMC)里进行,HYDRA 负责把已经长出多叶瓣的大基元拆成更简单的子基元。训练完成后模型持有 \(K=6\) 个频率分量,部署时可以按需截断到 \(1 \sim 6\) 个,同一个模型直接给出不同细节层次的画面。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入:多视角图像<br/>+ SfM 点云"] --> B["傅里叶编码基元<br/>K_active=1 起步"]
B --> C["幂窗前向 + STE 反向<br/>边界外梯度外延"]
C --> D["HYDRA 分解 + 重定位<br/>MCMC 密度化保持分布"]
D -->|每轮密度化迭代| C
D -->|训练结束| E["截断傅里叶系数<br/>运行时任意 LoD"]
边界形状的定义。 在基元自己的切平面里,把光线交点 \((u_j,v_j)\) 转成相对中心的极坐标:径向距离 \(\rho_j\)、极角 \(\theta_j\)。边界半径是关于角度的傅里叶多项式取模:
其中 \(R_i\) 是外接半径(限定基元最大范围),\(c_{i,k}\) 是第 \(k\) 个复系数,振幅 \(\bar r_{i,k}\) 与相位 \(\phi_{i,k}\) 都可学。这里要特别注意"傅里叶编码加在哪":它加的不是 NeRF 那种位置编码,也不是方向上的球谐,而是切平面极坐标下这条几何边界的半径函数——编码的是形状本身。\(k=0\) 项是直流分量,给出统一的基础半径;第 \(k\) 项给边界带来 \(k\) 重角向起伏。\(K=1\) 时只剩直流项,边界退化成半径 \(R_i\bar r_{i,0}\) 的圆,正好回到标准圆盘基元——也就是说 2DGS 是本文 \(K=1\) 的特例,这也是"scalable"的物理含义:扩展的是基元自身的形状复杂度/频率细节,而不是场景规模或基元数量。
关键设计¶
1. 傅里叶编码基元:用带归一化约束的可截断边界把形状变成可调参数
痛点是前面说的:现有基元的形状在训练后是架构常量。这里把形状改写成一组频率分量,于是"要多少细节"变成"保留几个分量"这种可以在推理时现场决定的事。为了保证这个多项式有意义,还需要一个容易被忽略的约束:每个频率都会往边界半径上贡献一份振幅,若不限制,各振幅之和可能超过外接半径 \(R_i\),边界就会捅出外接圆。论文用平方-\(\ell_1\) 归一化,即把归一化振幅定义为原始振幅的平方除以所有原始振幅平方和,使 \(\sum_k \bar r_{i,k}=1\)。由于每一项非负且和为 1,三角不等式保证任意角度下 \(r_i(\theta)\le R_i\),边界不会越界。这个约束还有个附带好处:截断高频分量时,剩下的低阶分量仍然满足归一化(只是总和小于 1),画面只会变简单、不会突然出现越界伪影,这正是"单模型多 LoD"能成立的前提。
需要诚实指出一个隐含限制:\(r_i(\theta)\) 是角度的单值函数(radial function),所以这个描述子只能表达关于基元中心星形(star-shaped)的闭合区域,画不出带孔洞或强凹陷的非星形轮廓。论文在形状多样性上给出的例子都是花瓣状、多叶瓣这类星形曲线。
2. 幂窗前向 + 直通估计器反向:让边界既能收缩也能扩张
前向渲染沿用 Triangle Splatting 的 power window 思路,但改写进极坐标。像素到边界的带符号距离就是 \(\varphi_j=\rho_j-r_i(\theta_j)\),\(\varphi_j\ge 0\) 的像素直接丢弃,因此基元是紧支撑的——这一点与 3DGS 的无限支撑高斯不同,也更贴合"面元=表面"的假设。像素不透明度是该距离的幂窗:把归一化的内部距离 \((r_i(\theta_j)-\rho_j)/r_i(\theta_j)\) 取 \(\sigma_i\) 次幂,再乘基元不透明度 \(o_i\);窗口在中心取峰值、在边界归零,\(\sigma_i\) 控制衰减曲线——论文给的示意里 \(\sigma=0.001\) 近似硬边、\(\sigma=8\) 则是很软的过渡,且它是可学的,于是每个基元能自适应地选择"硬边贴几何"还是"软核抗锯齿"。
问题出在反向传播。硬截断 \(\max(0,\cdot)\) 在边界外制造了一片零梯度死区:外部像素的渲染贡献严格为 0,对傅里叶系数的梯度也就为 0,而梯度信号绝大多数来自内部像素,净效果是边界不断收缩;优化为了让画面覆盖够大,只能去放大外接半径 \(R_i\)——用整体等比放大来补偿,而不是让傅里叶系数学出更复杂的形状,于是基元停在近圆形上。
解决办法是借直通估计器把前向和反向解耦。前向渲染完全不变,仍由硬窗决定图像;反向时把硬窗换成在边界两侧都有非零梯度的平滑替代 \(\tilde w\):
其中 \(x\) 是未截断的归一化距离(\(x>0\) 在内、\(x<0\) 在外),\(\beta,\gamma\) 是固定超参(论文取 \(\beta=3,\gamma=0.5\))。第一项是 \(\max(0,x)^{\sigma_i}\) 的平滑近似,在内部与真实前向窗基本吻合;第二项那个加性 sigmoid 保证即便 \(x<0\) 也有 \(\partial\tilde w/\partial x\neq 0\),让紧贴边界外侧的像素也能给傅里叶系数送去梯度。这样边界在优化中既能收缩也能扩张,系数才真正有机会去学复杂形状,而不是靠 \(R_i\) 兜底。一个细节是梯度路由:外部像素在前向贡献为零,因此它们的 STE 梯度只回传给傅里叶系数 \(c_{i,k}\),位置与朝向的梯度仍只由内部像素提供——因为光度损失在外部并不成立。
3. HYDRA 分解与面元友好的 MCMC 密度化:在固定预算下把形状安置对
训练采用 3DGS-MCMC 框架:把 SGD 更新解释为 SGLD,基元是目标分布 \(P(g)\propto\exp(-\mathcal{L})\) 的样本,密度化(增删搬移)是一次必须保持 \(P(g_{\text{new}})=P(g_{\text{old}})\) 的确定性状态转移。把这套机制搬到平面基元上要改两处。
第一处是去掉位置噪声。3DGS-MCMC 会按 3D 协方差缩放、并与不透明度成反比地给基元位置加 SGLD 噪声来鼓励空间探索;但对平面面元,这种噪声会把它推离切平面(尤其在尚未收敛或处在高体积频率的区域),而子基元又继承父基元的朝向,扰动一旦发生就破坏了平面约束,\(P(g_{\text{new}})\) 不再成立。做法是直接不加位置噪声,代价是重建不足区域(高位置梯度处)可能在两次密度化之间被漏采——补这个洞的就是 HYDRA。
第二处是重定位公式要重新推导。把死基元搬到活基元处、用 \(N\) 个同位置子基元替换父基元时,要求渲染图不变。不透明度有与核无关的闭式解 \(o_{\text{new}}=1-(1-o)^{1/N}\);半径则要把父基元功率窗在切平面上的极坐标积分,与 \(N\) 个子基元合成透射率的积分相等——把逐子基元的透射率用二项式定理展开、逐项在极坐标下积分,原本高斯核留下的 \((\sigma+1)(\sigma+2)\) 因子被一组交替二项式和替代:
死亡准则综合三条:不透明度低于 \(\tau_o\)、最近若干视角上的最大混合权重 \(\max_j(\alpha_{i,j}T_{i,j})\) 低于 \(\tau_I\)、以及被观测到的帧数少于 \(V_{\min}\);新建基元有一个 epoch 的宽限期。补充基元时按不透明度或逆锐度 \(1/\sigma_i\) 交替加权采样(两者对应不同的局部收敛节奏),采到的基元用 \(N=2\) 公式生两个子基元:一个留在采样位置,另一个在切平面内做 \(\eta\epsilon,\ \epsilon\sim\mathcal{N}(0,I)\) 的随机偏移——这个克隆噪声虽然只值 0.05 dB,但它让新增基元在面元平面内随机分布,避免所有子基元挤在同一条角向上。
HYDRA(Hybrid Decomposition for Rendering-Aware Preservation)针对的正是"不加位置噪声"留下的缺口:先用绝对梯度累积(AbsGS 的做法)找出高梯度的欠重建基元,再分两种情况处理。尺度保持拆分针对小基元:缩小外接半径、在切平面内对称偏移放两个子基元,仍走 \(N=2\) 的质量保持公式。学习式叶瓣分解针对已经长出复杂多叶瓣边界的大基元——此时几何拆分已经不够,硬拆出来的子基元既装不下原有形状也贴不上局部几何。做法是在边界上采样 \(M\) 个角度、找出 \(S\) 个最深的"谷"作为分割点,把边界切成 \(S\) 个角段;一个预训练 MLP \(f_\psi\) 接收父基元的锐度与系数、以及该段的质心 \((r_M,\theta_M)\) 和角范围 \((\theta_{\min},\theta_{\max})\),输出子基元的锐度、振幅、相位、切平面内的极坐标偏移 \((\Delta r,\Delta\theta)\)、不透明度与外接半径。子基元继承父基元的颜色与朝向,父基元删除,净增 \(S-1\) 个基元。这样"分解"本身是由数据学出来的,而不是靠预设的几何规则,因此能吃下多叶瓣这种几何拆分处理不了的情况。
损失函数 / 训练策略¶
总损失是光度损失(\(\ell_1\) 与 D-SSIM 的加权和)加上 2DGS 的深度畸变损失与法向一致性损失,后两项分别抑制渲染深度分布的弥散、把面元法向 \(t_w\) 拉向由深度导出的表面法向。实现上取 \(K=6\) 个频率、球谐 3 阶(48 个系数),加上中心 3、朝向 4、不透明度 1、外接半径 1、锐度 1 与 12 个傅里叶参数,共 70 个参数/基元。傅里叶多项式用 Horner 法求值:\(w=e^{\mathrm{i}\theta}=(\cos\theta,\sin\theta)\) 直接由切平面坐标 \(u_j/\rho_j,\ v_j/\rho_j\) 得到,完全避开三角函数调用,从 \(k=K-1\) 往下做复数乘加递推,共 \(K-1\) 次复数乘加(每个频率约 8 次运算),再取模得到 \(r_i(\theta)\)。训练调度的关键一步是前期只激活最低频分量(\(K_{\text{active}}=1\))以先立住全局结构,第 600 次迭代再解冻其余频率系数——不让低频主导挡住细纹理的获取。截断之所以是"最优降级",是因为傅里叶基正交:\(K\) 项多项式用前 \(K-1\) 项逼近的最优 \(L_2\) 解就是直接截断,剩余项不需要任何调整。
实验关键数据¶
实验在 Mip-NeRF 360(5 个室外 + 4 个室内场景)与 Tanks and Temples(2 个大场景)上做,指标为 PSNR / SSIM / LPIPS,评测协议沿用 Triangle Splatting 并直接引用其发表的基线数字(其余结果取自 Deformable Beta Splatting)。对比对象覆盖隐式方法(Mip-NeRF 360、Zip-NeRF)、体积基元(3DGS、3DGS-MCMC、DBS、3DCS、Gabor Splatting、GES)与平面基元(2DGS、Triangle Splatting、BBSplat)。
主实验¶
| 方法 | Mip-NeRF 360 Avg. PSNR↑ | SSIM↑ | LPIPS↓ | T&T PSNR↑ | SSIM↑ | LPIPS↓ |
|---|---|---|---|---|---|---|
| Mip-NeRF 360 (隐式) | 27.35 | 0.792 | 0.237 | 22.22 | 0.759 | 0.257 |
| Zip-NeRF (隐式) | 28.42 | 0.826 | 0.189 | – | – | – |
| 3DGS (体积) | 26.98 | 0.813 | 0.214 | 23.14 | 0.841 | 0.183 |
| 3DGS-MCMC (体积) | 27.84 | 0.850 | 0.210 | 24.29 | 0.860 | 0.190 |
| DBS (体积) | 28.13 | 0.827 | 0.234 | 24.85 | 0.870 | 0.140 |
| 2DGS (平面) | 26.84 | 0.804 | 0.252 | 23.13 | 0.831 | 0.212 |
| BBSplat (平面) | 26.49 | 0.778 | 0.236 | 25.12 | 0.868 | 0.172 |
| Triangle Splatting (平面) | 26.98 | 0.812 | 0.191 | 23.14 | 0.857 | 0.143 |
| Ours (K=6) | 27.65 | 0.824 | 0.193 | 24.15 | 0.868 | 0.137 |
平面基元中本文在 Mip-NeRF 360 上 PSNR / SSIM 均为最优,相对 Triangle Splatting 提升 0.67 dB、相对同源的 2DGS 提升 0.81 dB;Tanks and Temples 上拿到所有基线里最好的 LPIPS(0.137),PSNR 与 SSIM 也保持在同一档(SSIM 与 BBSplat 的 0.868 持平)。
⚠️ 需要指出一处正文与表格不一致:论文正文称在 Mip-NeRF 360 上"平面方法中所有指标第一",但表中本文平均 LPIPS 为 0.193,略逊于 Triangle Splatting 的 0.191(室外 0.217 对 0.217 持平,室内 0.162 对 0.160 略差);以官方表格为准。另外表中 3DGS-MCMC 与 DBS 带 †/‡ 标记,其设置与其余行可能不完全同口径。
消融实验¶
| 配置 | PSNR↑ | SSIM↑ | LPIPS↓ | 说明 |
|---|---|---|---|---|
| Full model | 24.15 | 0.868 | 0.137 | 完整模型(Tanks and Temples) |
| w/o 叶瓣分解 (HYDRA) | 23.93 | 0.847 | 0.141 | −0.22 dB,朴素几何拆分吃不下多叶瓣基元 |
| w/o STE | 23.81 | 0.842 | 0.147 | −0.34 dB,最大跌幅,边界外无梯度导致优化停在近圆形 |
| w/o 克隆噪声 | 24.10 | 0.845 | 0.138 | −0.05 dB,新增基元的角向多样性下降 |
可扩展性 / 压缩分析¶
等基元预算对比(Tanks and Temples,均为 960K 基元):
| 方法 | 基元数 | PSNR↑ | SSIM↑ | LPIPS↓ | FPS | 显存 | 训练时长 |
|---|---|---|---|---|---|---|---|
| 2DGS | 960K | 22.94 | 0.827 | 0.160 | 182 | 1.4 GB | 12 min |
| Ours (K=6) | 960K | 23.79 | 0.853 | 0.156 | 135 | 2.08 GB | 41 min |
用 ISO V3C 编解码器压缩、逐个基元独立码流(同一场景,不同保留频率数 \(K\)):
| 保留频率 K | 1 | 2 | 3 | 4 | 5 | 6 |
|---|---|---|---|---|---|---|
| 字节/基元 | 61.92 | 64.52 | 67.13 | 69.67 | 72.21 | 74.89 |
| PSNR↑ | 12.66 | 16.74 | 19.18 | 20.77 | 21.81 | 22.40 |
| SSIM↑ | 0.53 | 0.66 | 0.74 | 0.79 | 0.82 | 0.84 |
| LPIPS↓ | 0.45 | 0.35 | 0.27 | 0.22 | 0.19 | 0.17 |
从 \(K=1\) 到 \(K=6\),每个基元只多传约 13 字节,PSNR 就从 12.66 涨到 22.40(⚠️ 注意这是压缩码流下的数字,与未压缩的 24.15 dB 不是同一口径,不要直接对比);截断系数得到的是"每个基元独立"的码流,天然适配按属性独立编码的编解码器,也让渐进式传输变得简单。⚠️ 论文 Fig. 7 / Fig. 8 里还给出了截断时的速度与率失真曲线(\(K=1\) 约 22.44 dB / 112.4 FPS,\(K=6\) 为 24.15 dB / 80.8 FPS,以及与 Octree-GS 的率失真对比),这些数字读自图中标注,以原文为准。
关键发现¶
- STE 是最关键的一环:去掉它掉 0.34 dB,是三项消融里最大的跌幅,且失效模式很明确——边界外没有梯度,基元无法长大去覆盖欠重建区域,优化停在圆形附近。这也说明"把硬边界的梯度接出来"不是锦上添花,而是这套基元能训起来的前提。
- HYDRA 的价值集中在大基元上:去掉叶瓣分解掉 0.22 dB。朴素几何拆分处理不了已经长出多叶瓣的大基元,只能勉强切成形状不对的碎片;用 MLP 在角段上学出子基元则能真正把复杂形状分解成贴合局部几何的简单件。
- 可扩展性的代价很低但也不是免费:从 \(K=6\) 截到 \(K=1\) 只换来约 30% 的 FPS 提升(80.8 → 112.4),说明傅里叶求值本身开销不大(Horner 递推每个频率约 8 次运算);但基元变复杂后整体更贵:等 960K 预算下训练从 2DGS 的 12 分钟涨到 41 分钟、显存从 1.4 GB 涨到 2.08 GB、帧率从 182 降到 135 FPS(仍属实时)。
- 降级方式比剪枝更"温和":与 Octree-GS 这类按数量裁剪的方法相比,本文降级是"每个基元都变简单",因此不会出现主体物整块消失的情况,画质是均匀退化——这是论文定性论证的核心卖点,但定量证据目前只有率失真曲线,规模也仅限 Tanks and Temples 的 2 个场景。
亮点与洞察¶
- 把"细节层次"从数量轴搬到形状轴:以往 LoD 全是"删/加基元",本文让"保留几个频率分量"成为新的缩放轴,且因为傅里叶基正交,截断天然就是最优 \(L_2\) 近似,不需要任何重训或后处理。这个"正交基 + 直接截断 = 免费降级"的组合非常干净。
- STE 的用法很贴切:硬边界可微渲染(三角形、凸体、Mesh)普遍会遇到边界外零梯度的问题。本文不是把边界软化(那会丢掉硬边的好处),而是只把梯度"编造"到边界外、前向渲染保持不变,还顺手做了梯度路由——外部像素的梯度只给形状系数、不给位置朝向。这个 trick 可以直接搬到任何带硬截断的可微光栅化器上。
- HYDRA 把"分解"变成学出来的:用 MLP 在边界上找谷、按角段生成子基元,本质是"学习式自适应细分",比固定几何规则更能匹配已经演化出复杂形状的父基元;这类思路可以迁移到 mesh 细分、点云上采样、NeRF 网格的层级构建。
- 平方-\(\ell_1\) 归一化的意义被讲清了:它既保证边界不越界(几何正确性),又保证截断后仍然合法(可扩展性前提),是把"参数化"和"可截断"焊在一起的那颗螺丝。
局限与展望¶
- 作者承认的最大局限是码率:本文优先优化"给定基元预算下的保真度",而不是最小化压缩/传输所需的比特数。作者提出的方向是引入尺度正则,鼓励长出更少、更大、更复杂的基元,用高 \(K\) 边界的频率表达力去替代"一堆简单面元的密铺",从而真正降低码率。
- 训练成本明显更高(同预算 41 min vs 12 min,显存 2.08 vs 1.4 GB),且需要额外训练一个 MLP 分解器,pipeline 比 2DGS 复杂不少。
- 表达范围受"星形区域"限制:\(r(\theta)\) 单值意味着带孔洞或强凹陷的非星形轮廓画不出来;对这类几何,多叶瓣分解能缓解但不能从根上解决。
- 可扩展性的论证偏向带宽/码率一侧,"场景规模"意义上的可扩展性并没有被直接验证——Tanks and Temples 只用 2 个大场景,也没有与 Octree-GS 等层级方法做等比特率下的完整定量对比(目前只有率失真曲线)。
- 一个值得做的对照是:把"截断傅里叶系数"与"直接剪掉同样比例的基元"放在同一比特预算下比较,才能真正证明形状轴比数量轴更优。
- 若能按视距/重要度动态决定每个基元保留几个频率(而非全局统一截断),就能把 LoD 变成视点自适应的渐进式传输,这条与 Octree-GS 式层级结构结合的空间还没被填。
相关工作与启发¶
- vs 2DGS:2DGS 提供了本文继承的全部脚手架——面元参数化、光线-平面求交、tile 合成、深度畸变与法向一致性损失,但它的基元是固定圆盘上的二维高斯。本文把"圆盘"换成傅里叶边界、把"高斯衰减"换成幂窗,\(K=1\) 时严格退化为 2DGS,同预算下 PSNR 从 22.94 提到 23.79。差别可以概括为:2DGS 的形状是常量,本文的形状是参数。
- vs Triangle Splatting:同样有硬边界、同样用幂窗,但三角形只有 3 个顶点、形状固定,且没有可截断的细节层次。本文借鉴了它的幂窗与部分训练策略(死亡准则里的观测帧数、交替采样等),在 Mip-NeRF 360 平均上高出 0.67 dB;代价是每个基元的求值更贵、参数量更大。
- vs BBSplat / 3D Convex Splatting:BBSplat 让每个 billboard 携带纹理+alpha 掩码,把"外观"的可变性做进了基元,Tanks and Temples 上 PSNR 最高(25.12);3DCS 用光滑凸体换硬边。本文的可变性做在几何边界上而非外观上,且额外带来可截断的 LoD,这是它们都不具备的能力。
- vs 3DGS / 3DGS-MCMC(体积基元):3DGS 的椭球无限支撑、形状固定;3DGS-MCMC 提供了本文的优化框架,但它给位置加 SGLD 噪声、按 3D 协方差缩放,对面元并不适配——本文去掉位置噪声并把重定位公式按幂窗重推。总体结果上本文仍落后最强的体积方法(DBS 28.13 / 3DGS-MCMC 27.84 对本文 27.65 dB),论文的表述是"与体积方法竞争而不总是超越",这点在阅读时需要保留。
- vs Octree-GS / LODGE / LOD-GS(层级 LoD):它们的可扩展轴是基元数量,降级靠删除并按距离过滤;本文的可扩展轴是基元自身的频率细节,降级是让每个基元变简单,因此不会整块丢内容,并且码流可以按基元独立切分,更容易与编解码器配合。两者并不互斥——论文也指出把本文的基元与经典剪枝结合才是完整的带宽受限方案。
评分¶
- 新颖性: ⭐⭐⭐⭐ "首个天然可扩展的基元"这一提法成立,把 LoD 从数量轴搬到形状轴是真正的视角转换;技术组件(傅里叶边界、STE、MCMC 重定位)多为已有思路的组合与适配。
- 实验充分度: ⭐⭐⭐ 基准覆盖与消融都够,但可扩展性一侧只有 2 个场景、缺少等比特率下与剪枝方法的完整定量对比,且正文有一处与表格不一致的结论。
- 写作质量: ⭐⭐⭐⭐ 动机链条清楚,公式推导(尤其重定位的幂窗积分)交代得比较完整;正文个别处(如形状类 splat 的引用方式、图表数字标注)略显粗糙。
- 价值: ⭐⭐⭐⭐ 给"带宽受限下的高保真渲染"提供了一个新的可调轴,且可与现有剪枝/层级方案叠加;代价是训练成本与实现复杂度上升,短期更可能作为现有 splatting 管线的一个可选基元扩展。