Drop-In Perceptual Optimization for 3D Gaussian Splatting¶
会议: ECCV 2026
论文: ECCV 原文 / 项目页
领域: 3D 视觉
关键词: 3D Gaussian Splatting、感知优化、Wasserstein 失真、人类主观偏好研究、率失真压缩
一句话总结¶
本文把 3DGS 训练用的 2D 失真损失本身当作唯一的设计变量,系统比较了原始 L1+SSIM、L1+L2+MS-SSIM+LPIPS 复合损失与 Wasserstein 失真(WD)三类目标,并用 39,320 次成对人工评分的大规模主观研究定胜负,选出 WD 的轻正则版本 WD-R:只替换损失、不改任何 3DGS 算法,就能在人工偏好上达到原损失的 2.3 倍以上、比 Perceptual-GS 高 1.5 倍,且在 Mip-Splatting、Scaffold-GS 与压缩场景中同样生效(压缩场景约省 50% 码率)。
研究背景与动机¶
3DGS 的渲染结果最终是给人看的,但绝大多数 3DGS 方法在训练时依赖的是 Kerbl 等人留下的 L1+SSIM 这类「临时拼起来」的逐像素损失,这类损失优化出来的纹理往往过平滑、发糊。感知度量(如 LPIPS)常被拿来做评测,可它究竟能不能用来做优化目标,一直缺少严格验证;再往下,各种"感知优化"技巧也从未被人类偏好研究检验过。对呈现给人类视觉的内容建模缺位,会直接导致表征容量被浪费:花在不可感知细节上的每一个高斯、每一个 bit,都换不来任何感知收益——这在需要压缩存储或传输 3DGS 表征时尤其致命。
已有的改进大多是"间接"或"局部"的:Perceptual-GS 用 Sobel 边缘检测去引导高斯致密化,Pixel-GS 改的是像素感知的梯度累积与剪枝策略,FreGS 用频率正则、EGGS 用边缘引导。这些工作同时改动模型、优化流程与损失,把"人类视觉建模"和"3DGS 算法设计"耦合在一起,既难以隔离收益来源,也缺乏通用性。
本文真正要处理的矛盾在于:损失函数在 3DGS 里不是普通的目标函数——由于自适应致密化靠梯度幅值触发,损失的量纲会直接影响高斯数量的增长,所以"更强的感知损失"很可能是在偷偷用更多泼溅数(splat)与更大的模型换质量,不同损失之间的比较必须先把表征预算对齐;与此同时,LPIPS 这类感知度量本身是逐点的深度特征距离,与人类对纹理的感知并不一致,单看指标无法判断输赢。于是本文的切入角度是彻底解耦:把 3DGS 的初始化、致密化、剪枝全部冻结,只替换损失里的失真项 \(D(\cdot)\),再用一次 3DGS 领域前所未有的大规模人类偏好研究当裁判。核心 idea:把"人类视觉建模"整体外包给一个 2D 失真项——在 VGG 特征空间中比较局部统计量(局部均值与标准差)而不是逐像素差值,并用少量原始像素损失做轻正则(WD-R),从而在不改任何 3DGS 算法、不增加泼溅数的前提下,拿到能被人类偏好证实的感知提升。
方法详解¶
整体框架¶
方法本体极其简单:它不新增模块、不改网络,只是把 3DGS 训练循环中那一步"渲染图与真值图之间的失真"换成另一个函数。标准 3DGS 从 SfM 点云初始化一组建模为 3D 高斯原语的场景,每个原语由中心、协方差、颜色、不透明度参数化;可微光栅化器把它们投影到 2D 并按深度做 alpha 混合,得到渲染图 \(\hat{x}\),再与真值 \(x\) 算失真。这个失真产生两路梯度:一路更新高斯参数,另一路按梯度幅值驱动自适应致密化(增点)与低不透明度剪枝(删点)——也就是说,目标函数同时决定了"参数怎么调"和"表征长成什么样"。
本文的改动量就是这一处:把失真项 \(D(x,\hat{x})\) 从原始的 L1+SSIM 换成复合损失、WD 或 WD-R,其余(初始化、光栅化、致密化阈值、剪枝规则)全部保持原样,不引入任何 3D 空间上的特殊约束或启发式。论文在两种任务设定下考察这件事:表征任务直接最小化 \(\gamma\,D(x,\hat{x})\);可变码率压缩任务在此之上加入熵编码带来的码率项 \(\lambda R_\theta(G)\),在感知质量与存储成本之间做权衡。由于整套流程都走可微渲染,"可插拔"在实现上就是训练循环里换一个 loss 计算函数,外加上一小段使用原始损失的预热期(见下节训练策略)。
关键设计¶
1. 用 WD 换掉逐像素失真:在 VGG 特征空间比局部统计量,而不是比像素
逐像素损失(L1、SSIM)和 LPIPS 都有一个共同弱点:它们是逐点比较的。论文用一张 1D 示意图点破这件事——两条纹理只差 180° 相位,逐点差异极大,但肉眼看上去几乎一样。WD(Wasserstein Distortion)换了个比较方式:对每一张 VGG 特征图、每一个空间位置,先用一个尺寸为 \(\sigma\) 的池化核算出局部的均值 \(\mu\) 与标准差 \(\nu\),再比较这两组统计量的差异,最后在所有特征图与所有位置上聚合。按原文正文的表述,其形式为
其中带上标的量是在重建图上算的局部统计量,\(\mu\)、\(\nu\) 分别为局部一阶与二阶矩。⚠️ 原文 Eq. (4) 在缓存中是排版公式,此式按正文文字重建,精确形式以原文为准。
这么设计的依据来自人类视觉系统的模型:外周视觉是对局部池化区域上的汇总统计量编码,而不是精确的逐点像素值(metamers of the ventral stream、Rosenholtz 等)。因此只要局部统计量对上了,逐点差别很大的纹理也会被感知为相似——这正好把"纹理重采样"这类人眼不敏感的差异从优化目标中释放出去。池化核 \(\sigma\) 是这个度量的旋钮:\(\sigma\) 越大,聚合范围越广、对纹理重采样越宽容;\(\sigma \to 0\) 则退化成逐点距离。论文取常数 \(\sigma=4\),并明确说明这是在其评测分辨率下的"强配置"而非普适最优(最优 \(\sigma\) 可能取决于输入分辨率与观看距离)。由于局部均值/方差对输入可微,梯度可以顺畅地穿过池化回传到高斯参数,优化器于是被直接奖励去匹配纹理统计量,而不是去死磕像素值;其几何后果是高斯变得更各向异性、更"针状",用拉长的椭圆去贴合局部结构,从而更擅长表达高频细节与细纹理。
2. WD-R:加一点原始像素损失,专治 WD 的"蛛网状"伪影
WD 单独当目标并不总是稳。作者发现它在两种情形下会出问题:一是 3D 空间中训练样本稀少的区域,二是泼溅预算被压得很紧的时候。此时 WD 可以用少数几条高度拉长的高斯去"骗过"局部统计量(毕竟是深度特征空间里的均值与标准差),于是生成蛛网状的细丝结构去粗略(但经济)地模仿纹理,视觉上并不好看;而逐像素损失不会这样,代价是把纹理抹平。把全局缩放因子调大(多给泼溅)也能缓解,但会从 4.5M 涨到 7.2M。
于是本文提出 WD-R,在 WD 之上叠加一份轻量的原始像素损失:
其中 \(\mathcal{L}_{\text{orig}}\) 就是原始的 L1+SSIM 损失,\(\gamma\) 是逐数据集的整体缩放(见设计 3),\(\beta\) 选得足够小,使像素项只起"轻度像素保真正则"的作用、WD 始终是主导的感知项。效果是在几乎不增加泼溅数的情况下(4.5M → 4.4M)压掉蛛网伪影,同时在感知指标与人工偏好上双双更好。值得注意的是,作者在讨论里点出这个反直觉现象:WD 在图像压缩里单独当失真损失很稳、不会引起训练不稳定,但换到 3D 场景优化就不完全如此,根因仍未查清——本文给的是经验性的正则补救。
3. 用全局缩放 γ 把"损失量纲"与"泼溅预算"解耦
因为致密化由梯度幅值触发,损失的整体尺度会间接决定高斯长多少——这意味着直接比较两种损失,会把"损失好不好"和"表征容量给了多少"混在一起。论文的处理是:只调式中的全局缩放 \(\gamma\)(逐数据集设定),其余超参全部冻结,让不同方法的最终高斯数量彼此对齐,且比较都发生在相同或更低的预算下(更少的泼溅数、或更小的模型体积)。这条看似只是实验协议,实际是本方法能被称为 drop-in 的前提:它保证了 WD-R 的收益来自"损失去看什么",而不是"多给了多少容量"。事实也确实如此——WD-R 在多项感知指标上领先的同时表征更紧凑,例如 BungeeNeRF 上把高斯数从原始损失的 6.92M 降到 4.89M。
损失函数 / 训练策略¶
表征任务的目标是最小化 \(\gamma D(x,\hat{x})\);压缩任务的目标是 \(\min_{G,\theta} D(x,\hat{x}(G)) + \lambda R_\theta(G)\),其中码率项用的是神经压缩里的常用形式 \(R_\theta(G)=\mathbb{E}[-\log_2 p_{\hat{y}}(\hat{y})]\),即高斯的量化隐编码 \(\hat{y}\) 与学习到的参数化熵模型 \(p_{\hat{y}}\) 之间的香农交叉熵,\(\lambda\) 控制质量与存储的权衡——注意存储大小并不只由高斯数量决定,还取决于参数冗余与熵编码的概率建模。压缩实验在 \(\lambda \in [3^{-2}, 3^{-5}]\) 上扫描。
复合损失采用 \(\mathcal{L}_{\text{comp}} = \omega_1\mathcal{L}_{L1} + \omega_2\mathcal{L}_{L2} + \omega_3\mathcal{L}_{\text{MS-SSIM}} + \omega_4\mathcal{L}_{\text{LPIPS}}\),权重由消融选出并全程固定为 \(\omega_1=0.05,\ \omega_2=0.30,\ \omega_3=0.60,\ \omega_4=0.10\)。LPIPS 这个细节值得记一笔:训练用 LPIPS-AlexNet、评测用 LPIPS-VGG,以免对训练度量过拟合,也与 3DGS 文献的评测惯例保持一致。
所有模型训练 30k 迭代,各基线沿用其公开配置。WD 类目标不是一上来就接管:先按标准 3DGS 损失预热 3k–5k 迭代,再切换到感知目标(与感知训练、对抗训练的 warm-up 做法一致),这也解释了为什么"插入到哪一步"在本方法里是一个需要交代的细节。开销方面,作者采用的 WD 实现未做优化,单迭代时间约为原始 3DGS 的 4.5 倍;通过缓存真值的 VGG 特征、剪掉零权重的 VGG 金字塔层,在损失与梯度 bit-exact 不变的前提下把 WD 的单迭代时间压缩了约 48%,相对开销降到约 2.8 倍。这大概是这个方法落地时最实际的成本项。
实验关键数据¶
主实验¶
标准 3DGS 框架下不同失真损失在 21 个场景(Mip-NeRF 360 共 9 个,其中室内 4 个、室外 5 个;Deep Blending 2 个;Tanks & Temples 2 个;BungeeNeRF 8 个)上的感知指标对比(论文 Table 1 摘录,室内/室外划分沿用 Perceptual-GS 的做法):
| 数据集 | 方法 | 泼溅数 #G | LPIPS↓ | DISTS↓ | FID↓ |
|---|---|---|---|---|---|
| Mip-NeRF 360 (室内) | 原始损失 (L1+SSIM) | 1.42M | 0.188 | 0.158 | 80.70 |
| Mip-NeRF 360 (室内) | Pixel-GS | 2.49M | 0.177 | 0.147 | 73.36 |
| Mip-NeRF 360 (室内) | Perceptual-GS | 1.58M | 0.170 | 0.142 | 69.86 |
| Mip-NeRF 360 (室内) | 复合损失 | 1.99M | 0.171 | 0.143 | 82.17 |
| Mip-NeRF 360 (室内) | WD | 1.46M | 0.152 | 0.117 | 65.59 |
| Mip-NeRF 360 (室内) | WD-R | 1.49M | 0.147 | 0.114 | 67.80 |
| Mip-NeRF 360 (室外) | 原始损失 | 4.52M | 0.244 | 0.218 | 104.88 |
| Mip-NeRF 360 (室外) | Pixel-GS | 7.40M | 0.206 | 0.186 | 65.49 |
| Mip-NeRF 360 (室外) | Perceptual-GS | 3.55M | 0.206 | 0.188 | 58.97 |
| Mip-NeRF 360 (室外) | 复合损失 | 6.50M | 0.216 | 0.199 | 59.09 |
| Mip-NeRF 360 (室外) | WD | 3.54M | 0.228 | 0.178 | 65.69 |
| Mip-NeRF 360 (室外) | WD-R | 3.47M | 0.206 | 0.168 | 59.25 |
| BungeeNeRF (室外) | 原始损失 | 6.92M | 0.098 | 0.106 | 62.23 |
| BungeeNeRF (室外) | Pixel-GS | OOM(Pompidou 场景) | — | — | — |
| BungeeNeRF (室外) | Perceptual-GS | 4.97M | 0.095 | 0.103 | 58.23 |
| BungeeNeRF (室外) | 复合损失 | 11.30M | 0.197 | 0.200 | 101.66 |
| BungeeNeRF (室外) | WD | 4.67M | 0.116 | 0.100 | 50.68 |
| BungeeNeRF (室外) | WD-R | 4.89M | 0.092 | 0.087 | 46.21 |
⚠️ 上表数字摘自缓存中的 Table 1;该表在缓存里存在列串行,个别单元格(如室外区块的 CMMD)无法可靠还原,故此处只保留 LPIPS/DISTS/FID 三列,精确数值以原文为准。
人工偏好研究(Bradley–Terry 模型 + 贝叶斯 Elo 聚合,盲测 A/B 呈现同一 704×704 随机裁剪块并给出真值参考):
| 对比 | Elo 差 | 被偏好倍数 | 规模 |
|---|---|---|---|
| WD-R vs 原始损失 | >150 | >2.3× | 主研究 320 人 / 30,720 次成对比较(室内+室外) |
| WD-R vs Perceptual-GS | 72 | >1.5× | 同上 |
| WD-R vs Mip-Splatting | 105.7 | 1.8× | 86 人 / 4,880 票 |
| WD-R vs Scaffold-GS | 223.2 | 3.6× | 93 人 / 3,720 票 |
全部研究合计 428 名参与者完成 39,320 次成对评分。此外,压缩设定下 WD 类目标在整条率失真曲线上给出最好的 LPIPS/DISTS/FID,换算成同感知质量下约 50% 的码率节省。
消融实验¶
损失组合本身的对比(以 BungeeNeRF 室外 8 场景为例,含各自最终的泼溅数):
| 配置 | 泼溅数 #G | LPIPS↓ | DISTS↓ | 说明 |
|---|---|---|---|---|
| 原始损失 L1+SSIM | 6.92M | 0.098 | 0.106 | 基线,纹理过平滑 |
| 复合损失 L1+L2+MS-SSIM+LPIPS | 11.30M | 0.197 | 0.200 | 堆更多度量反而全面变差、泼溅数暴涨 63%,因此被排除在人工研究之外 |
| WD(无正则) | 4.67M | 0.116 | 0.100 | 泼溅数最省、DISTS 优于原损失,但 LPIPS 反而更差,且出现蛛网状伪影 |
| WD-R(本文) | 4.89M | 0.092 | 0.087 | 三项感知指标最优,泼溅数比原损失少约 29% |
跨框架泛化(只改训练目标、框架原样保留):
| 框架 | 数据集 | 指标 | 原始 | + WD | + WD-R |
|---|---|---|---|---|---|
| Mip-Splatting | Mip-NeRF 360 室内 | #G / LPIPS↓ | 1.81M / 0.152 | 1.55M / 0.134 | 1.69M / 0.123 |
| Mip-Splatting | Mip-NeRF 360 室外 | #G / LPIPS↓ | 5.71M / 0.193 | 5.68M / 0.202 | 5.37M / 0.181 |
| Scaffold-GS | Mip-NeRF 360 室内 | 模型大小 / LPIPS↓ | 99.5 MB / 0.166 | 98.4 MB / 0.143 | 93.9 MB / 0.140 |
| Scaffold-GS | Mip-NeRF 360 室外 | 模型大小 / LPIPS↓ | 220.7 MB / 0.273 | 215.8 MB / 0.245 | 223.5 MB / 0.233 |
关键发现¶
- 收益来自"看什么",不是"给多少容量"。WD-R 在多数据集上同时做到更优感知指标与更少泼溅数(BungeeNeRF 6.92M → 4.89M),这也是设计 3 中预算对齐协议要证明的核心结论;Scaffold-GS 上模型体积基本持平(甚至略降)而 LPIPS 从 0.166 降到 0.140。
- 三类感知度量并不总是一致,这恰恰是论文要开人类研究的原因。BungeeNeRF 上 WD 的 LPIPS(0.116)反而差于原始损失(0.098),但同一配置下 DISTS(0.100 vs 0.106)、FID(50.68 vs 62.23)与 CMMD 更好——单项指标无法裁决,加上 \(\beta\) 正则后 WD-R 才在所有指标上反超。
- PSNR/SSIM 的取舍在正文中不可核实。论文正文只报感知度量,PSNR 与 SSIM 放在附录 E.1,因此"感知提升是否以 PSNR 为代价"这一点无法从缓存正文直接读出(⚠️ 需查附录原文)。能确定的是:人工研究是在同时给出真值参考图的前提下做的盲测,所以至少在人类偏好维度上是净收益;同时论文也明确不主张 PSNR 类的提升。
- 朴素地堆度量会失败。复合损失把 LPIPS 直接放进优化目标,反而在多数数据集上不如原始损失,并且严重抬高泼溅数(BungeeNeRF 11.30M),说明"加入感知度量"本身不是解法,"如何定义失真"才是。
- 感知优化会改变高斯的几何形态。WD 类目标让高斯更各向异性:Barcelona 场景上协方差有效秩(erank)的中位数从 1.55 降到 1.12(erank 趋近 1 表示针状、趋近 3 表示各向同性;定义为 \(\text{erank}(G_k)=\exp(-\sum_{i=1}^{3}q_i\log q_i)\),\(q_i=s_i^2/\sum_j s_j^2\),\(s_i\) 为协方差矩阵的奇异值)。泼溅密度热图显示 WD-R 把容量集中到纹理密集的教堂区域,而原始损失在全图更均匀。
- 失败边界很明确:WD 单独使用时,在训练视角稀疏、泼溅预算被严格限制的区域会产生蛛网状伪影(Bicycle 场景),靠加大 \(\gamma\) 缓解会把泼溅数从 4.5M 推到 7.2M,用 WD-R 只需 4.4M 即可压掉;Pixel-GS 在 BungeeNeRF 的 Pompidou 场景直接 OOM。
亮点与洞察¶
- 把"人类视觉建模"从 3DGS 算法里彻底剥离,只留 \(D(\cdot)\) 一个接口。已有工作(Perceptual-GS 的 Sobel 边缘、Pixel-GS 的像素感知梯度、FreGS 的频率正则)都把感知建模与致密化策略耦合在一起,收益归因困难、也难以移植;本文把它压缩成一个损失替换,于是能直接叠加在 Mip-Splatting、Scaffold-GS、Comp-GS 上做正交增益。这个"把变量收敛到一处"的研究品味本身值得借鉴。
- 用"局部统计量"而非"逐点值"定义失真,是把纹理重采样从损失里解放出来的关键。相位差 180° 的纹理在像素域天差地别、在局部均值/方差域几乎相同——这个观察既解释了 WD 为什么能恢复细节,也解释了它为什么会在预算紧时"作弊"出蛛网纹理(统计量被满足 ≠ 结构被重建),一体两面。
- \(\sigma\) 是一个可解释的旋钮:\(\sigma \to 0\) 退化为逐点距离,\(\sigma\) 变大则更宽容。它天然给出了一个"感知预算"的连续调节维度,比手调损失权重更有物理含义。
- 用人类偏好研究(Bradley–Terry / 贝叶斯 Elo)当最终裁决,并且把 Elo 差换算成"被偏好倍数"(>150 对应 2.3×)来读,这在 3DGS 领域是第一次;对任何声称"感知更好"的工作,这都是一个可复制、成本可控的验证范式。
- 可直接迁移:任何以 2D 渲染图为监督信号的 3D 表示学习(NeRF、2DGS、avatar/人体重建、视频重建)都能把 \(D\) 换成 WD-R;压缩侧则更直接——率项不变、感知质量变好,等价于同质量省码率(本文实测约 50%),可无缝并入现有神经压缩式 3DGS 管线。
- 一个实打实的工程 trick:缓存真值的 VGG 特征、剪掉零权重的 VGG 金字塔层,在损失与梯度 bit-exact 不变的情况下省下约 48% 的单迭代时间。任何用冻结特征网络做损失的工作都能照搬。
局限与展望¶
- 作者承认,WD 单独作为 3D 场景优化目标会出蛛网状伪影,且"根因是什么、怎么根治"仍是开放问题;WD-R 只是经验性的正则补救,\(\beta\) 需要调。
- \(\sigma=4\) 是"评测分辨率下的强配置而非普适最优",最优值可能随输入分辨率与观看距离变化;论文探索的空间可变 \(\sigma\)(附录 C.2)偶尔能改善结构化纹理(例如英文文字)的重建,但整体指标与固定 \(\sigma=4\) 相近、还引入了额外复杂度。
- 开销仍是硬约束:相对原始 3DGS 约 2.8 倍的训练时间,且必须依赖 VGG 特征;作者也指出对抗损失会更贵,而"把泼溅数直接写进优化目标做端到端率-容量-感知联合优化"留作未来工作。正文未给出完整的训练时间/显存对比表。
- 人工研究的证据强度存在不均衡:主研究 320 人 / 30,720 次比较,但两个泛化结论只来自 86 人与 93 人的子研究(4,880 / 3,720 票),"1.8×""3.6×"的换算完全建立在 Bradley–Terry/Elo 模型假设上,未报置信区间的具体数值。
- 我的补充:对比表把 WD-R 的收益与"同等或更低泼溅预算"绑定,但预算对齐靠逐数据集手调 \(\gamma\),这本身引入了每数据集的一次搜索成本,论文没有给出该搜索的代价;此外正文把 PSNR/SSIM 全部推到附录,削弱了"感知提升是否以保真度换取"这一读者最关心问题的可核查性。
- 可改进方向:一是给 WD 的伪影一个结构性解释(例如把局部统计量的匹配约束在至少有足够训练视角覆盖的区域),减少对正则项的依赖;二是把 \(\sigma\) 与分辨率、视角密度绑定成自适应策略,而不是靠空间可变 \(\sigma\) 这类工程补丁;三是把泼溅数/模型体积显式写进目标,让"感知-容量"的权衡可端到端优化,而不是靠外部调 \(\gamma\) 对齐。
相关工作与启发¶
- vs 原始 3DGS (Kerbl et al.): 他们定义了 L1+SSIM 这一事实标准损失,本文在此基础上只换损失、同框架同致密化策略,因此对比最干净;结果是人工偏好 2.3 倍以上、同时泼溅数更少(BungeeNeRF 4.89M vs 6.92M),说明原损失确实是感知质量的瓶颈。
- vs Pixel-GS / Perceptual-GS: 他们通过改密度控制来提升感知锐度(像素感知梯度累积 / 基于 Sobel 的边缘引导致密化),属于"改算法",且都显式约束高斯增长;本文只改损失,在同等或更低预算下感知指标与人工偏好均胜出,并且在 Barcelona 场景上 Perceptual-GS 会过度强调线性结构,说明边缘启发式的先验是有限的。二者思路正交,理论上可叠加。
- vs FreGS / EGGS / Analytic-Splatting / Mip-Splatting: 频率正则、边缘引导、解析积分/多尺度滤波分别属于致密化启发式与抗锯齿架构改进;本文用 Mip-Splatting 做实验平台证明了感知损失替换与这类架构改进互补(+WD-R 在室内外 LPIPS 分别降到 0.123 / 0.181)。
- vs Scaffold-GS: 结构化锚点表征以模型体积而非泼溅数度量紧凑性,本文在其上只改训练目标就让 LPIPS 从 0.166/0.273 降到 0.140/0.233,模型体积基本不变甚至更小,说明感知优化与表征结构的设计也是正交的。
- vs Comp-GS / 神经压缩方向: 后者把率失真优化引入 3DGS,本文说明在率项不变的条件下换感知损失即可换来约 50% 的码率节省;反过来,WD 在图像压缩文献里表现稳定、在 3D 场景优化里却需要正则,这个差异本身是一个值得追的开放线索。
评分¶
- 新颖性: ⭐⭐⭐⭐ 方法本身是把已有的 WD 度量搬进 3DGS 并加一项像素正则(WD-R),技术增量不大;但"把感知损失当作唯一变量做系统研究"的框架、以及 3DGS 领域首次大规模人类偏好研究,构成了实打实的贡献。
- 实验充分度: ⭐⭐⭐⭐⭐ 4 个数据集 21 个场景 × 3 类框架(标准 / 抗锯齿 / 结构化)+ 压缩率失真曲线,39,320 次人工评分,并辅以 erank 与泼溅密度等机制分析,还有一个诚实报告的失败案例(Bicycle 蛛网伪影)。
- 写作质量: ⭐⭐⭐⭐ 结构清楚、结论克制(明确声明 \(\sigma=4\) 非普适最优、伪影根因未知、PSNR 仅置附录),讨论部分不回避反直觉现象;扣分在于关键保真度指标被推到附录、预算对齐的搜索成本未交代。
- 价值: ⭐⭐⭐⭐⭐ 一个几乎零集成成本、可插拔、且经人类偏好验证的损失替换,直接可用于现存 3DGS 管线;压缩侧约 50% 的码率节省也具备明确的工程价值。