AdaptiveSplat: Texture Aware Controllable 3D Gaussian Allocation for Feed-Forward Reconstruction¶
会议: ECCV2026
Paper: https://eccv.ecva.net/virtual/2026/poster/4240
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/5054.pdf
项目: AdaptiveSplat
领域: 3D视觉
关键词: 三维高斯剪枝、前馈重建、小波纹理能量、可控预算、新视角合成
一句话总结¶
AdaptiveSplat 先按局部纹理复杂度决定哪些三维高斯可以删,再让掩码条件高斯头一次性重预测保留高斯的属性,在不做测试时场景优化的情况下实现可控稀疏重建,剪去 80% 高斯时仍在 RE10K 上达到 20.740 dB PSNR。
研究背景与动机¶
像素对齐的前馈三维重建把每个输入像素映射为一个高斯,省去了逐场景拟合,但也把图像采样密度直接变成了三维表示密度。一面平整、颜色均匀的墙与一块纹理丰富的布料会分到相似密度的高斯;前者存在大量冗余,后者却需要局部细节支撑。增加输入视图还会扩大表示,而不保证新增高斯都提供新的信息。
直接剪掉低透明度或低贡献高斯并不能解决全部问题:原来的尺度、透明度与颜色是在密集表示下预测的,移走一批高斯后,幸存者未必能覆盖空出的区域,渲染就会出现黑块。逐场景微调可以补救一部分,却放弃了前馈重建的时延优势;若某个局部区域已被删空,邻近高斯过度扩张又会带来团块状伪影。真正要联合处理的是“在哪里保留代表”和“这些代表如何适应新的邻域”。
本文利用自然图像高频信息通常稀疏且局部集中的经验,把纹理能量作为分配容量的线索,并通过三维位置与颜色聚类让剪枝以局部表面区域为单位进行。核心 idea:在低纹理区域保留少量代表、优先保护高纹理细节,并将剪枝掩码送入高斯预测头,使幸存高斯在同一次前馈过程中学会承担被删除高斯的覆盖责任。
方法详解¶
整体框架¶
输入为多视图 RGB 图像和用户指定的剪枝比例。预训练多视图骨干生成点图与视觉特征:稀疏视图实现采用 MASt3R,密集视图实现采用 VGGT,二者不要求输入相机位姿;论文也在需要位姿的 MVSplat 上实现了该策略。输出是能够用于新视角渲染的紧凑三维高斯集合,而不是一张经过修补的二维图像。
流程分为三项相互依赖的设计。小波纹理能量衡量输入图像哪里需要细节;超簇预算剪枝把该信号汇总到三维局部区域并生成逐视图二值掩码;掩码条件高斯头接收骨干特征和掩码,预测保留高斯的新属性。点图提供几何位置,掩码决定保留索引,高斯头负责让剩余表示适应稀疏结构。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
Input["多视图图像"] --> Texture["小波纹理能量"]
Input --> Backbone["多视图骨干<br/>点图与视觉特征"]
Texture --> Pruning["超簇预算剪枝"]
Backbone -->|点图| Pruning
Budget["用户剪枝比例"] --> Pruning
Pruning -->|二值掩码与保留索引| Head["掩码条件高斯头"]
Backbone -->|视觉特征| Head
Head --> Output["紧凑高斯集合<br/>新视角渲染"]
关键设计¶
1. 小波纹理能量:把高频细节需求变成局部可计算信号
对每幅图像做单层二维离散小波变换(DWT),得到水平、垂直与对角三个高频细节分量,再将对应位置的系数绝对值相加。对于第 \(k\) 个视图,这个局部能量的定义是:
这里的能量是图像高频响应,不是物理能量,也不是渲染误差的直接估计。绝对值避免不同方向响应正负抵消,多个方向共同响应使边缘与细密纹理获得较高分数。纯色墙面通常得分较低,壁纸或织物的得分较高,由此为“哪里可以少放高斯”提供排序依据。
这一设计不需要先渲染大量候选视图来估计每个高斯的重要性,因而适合前馈流程。但图像高频不等于三维几何复杂度:平面上的细密图案、镜面高光同样会产生强响应。后续聚类为信号补上空间结构,却不能把纹理和真实几何完全分离。
2. 超簇预算剪枝:在局部表面留下代表,而不是把区域直接删空
将所有视图的点图合并,每个点带有三维坐标和 RGB 颜色,在六维 \((x,y,z,r,g,b)\) 空间执行 K-means,形成 \(K\) 个互不重叠的 SuperCluster,本文称为超簇。位置接近且颜色相似的点倾向于进入同一区域,从而把独立像素的剪枝组织成局部表面级的分配。对簇内各点所关联输入像素的纹理能量取平均,就是该超簇的排序分数。默认 \(K=300\)。
用户控制的是删除比例 \(\beta\),而不是保留比例。在原文像素对齐的形式化设定中,\(m\) 个分辨率为 \(H\times W\) 的视图产生 \(N=mHW\) 个候选高斯,目标保留数量为:
因此 \(\beta=0.8\) 表示保留约 20%,不能将其解读为保留 80%。按原文图 4 的操作说明,超簇按平均纹理能量由低到高考虑剪枝;对选中的低能量簇,按簇内纹理能量保留排名最高的 10%,即默认局部保留比例 \(\gamma=0.1\),高能量簇则完整保留。这里的 10% 是局部规则,不是全场景必须只保留 10%。
最终保留索引会映射回每个输入视图,形成像素级二值掩码,1 表示对应高斯留下、0 表示删除。这既是输出集合的选择依据,也是下一模块的条件输入。相比把某一片区域完全移除,在区域内部保留代表可以为后续尺度调整提供更合适的中心位置,避免只能让相邻表面的高斯跨区域补洞。
需要保留一个复现边界:第 3.2 节关于“最大索引”、累计保留数量和最后一簇剩余预算的文字公式,没有清楚纳入图 4 所说的“高能量簇完整保留”,因此不能直接据此写出严格满足预算的完整算法。以上说明区分了清晰的预算目标、图示的选择原则与未澄清的边界处理;本笔记不自行补造取整、截断和最后一簇分配规则。六维坐标与颜色的尺度归一化细节也未在所读正文中交代。
3. 掩码条件高斯头:让留下的高斯知道哪些邻居消失了
如果先用固定高斯头预测密集属性,再仅根据掩码删除部分结果,幸存者仍保持密集表示下的尺度与透明度,空洞就很难消除。AdaptiveSplat 使用基于 DPT 的高斯头,增加卷积层融合多视图 ViT 特征与二值掩码,重新预测保留索引的各向异性尺度、旋转四元数、透明度和球谐颜色系数。原文该头的输出列表不包含中心坐标,中心来自前面的点图,不能将其描述为重新优化全部几何位置。
掩码的作用不只是最终乘一次零或一,而是告诉预测头当前局部邻域还有哪些高斯。相同视觉特征在不同掩码下可以得到不同属性:一个原先只负责小范围覆盖的高斯,在周围代表减少后可以扩大尺度;高频区域保留较多中心,便不必用少数大高斯硬覆盖细节。图 9 的尺度分布分析支持低纹理区域高斯变大的趋势,但并不意味着算法显式规定了某个统一放大倍数。
这也解释了两个容易混淆的消融:固定高斯头检验的是“是否需要重新学习稀疏后的属性”,去掉二值掩码则检验“一个经过训练的头是否还需要知道当前剪枝布局”。二者不是同一实验。整个方案需要离线训练条件预测头,但推理时无需为每个新场景再迭代拟合。
一个完整示例¶
考虑两张同时包含素色墙面与纹理沙发的室内图像,这是说明机制的示意输入,不是新增实验。用户设定 \(\beta=0.8\) 后,总保留目标是 \(\lfloor0.2N\rfloor\)。小波给墙面较低、织物较高的局部能量;六维聚类再把空间相近、颜色相似的点组织成超簇,避免仅依据二维图像位置把无关表面混为一组。
选中的低能量墙面簇依据局部规则保留少量代表,细节簇优先得到保护。若某个被完整执行 10% 局部规则的簇恰有 100 个候选点,就留下其中纹理能量最高的 10 个;这一数字仅说明局部规则,不声称已经解释全局预算的边界处理。随后掩码与视觉特征共同进入高斯头,墙面代表可以扩大覆盖范围,沙发则由较密的高斯承载纹理,最终直接渲染目标视图。
损失函数 / 训练策略¶
训练时从 \(\beta\sim U[0,1)\) 采样剪枝比例,使同一个高斯头接触不同稀疏度,避免只适应单一预算。监督来自目标相机视角:用保留高斯渲染图像,与真实目标图像计算像素重建误差,并加入 LPIPS 感知项。正文说明感知权重 \(\lambda=0.001\);缓存中公式 (1) 的运算符和排版损坏,因此这里仅保留能核实的损失组成,不重建不确定的完整公式。
实验使用一张 NVIDIA A100 40GB,每个数据集训练 48 GPU 小时。RE10K、ACID 和 DL3DV 使用论文所述的训练测试划分;稀疏视图评测输入 2 张图,密集视图评测输入 6、9、16、32 张图。正文推理设置明确写 \(\beta\in[0,0.8]\),另有关于 0.9 的分析讨论,不能把后者扩写为全部数据集上已系统验证的默认范围。
实验关键数据¶
主实验¶
下表摘录原文表 1、表 2。PSNR 单位为 dB,越高越好;LPIPS 越低越好,SSIM 越高越好。按第 5.1 节,所列外部剪枝基线允许逐场景微调,而 AdaptiveSplat 本身保持前馈推理;因此这是预算约束下的实际方案比较,不能视为仅替换剪枝模块、训练条件完全相同的消融。
| 数据集 / 输入 | 方法 | 剪枝比例 | PSNR | LPIPS | SSIM |
|---|---|---|---|---|---|
| ACID / 2 视图 | HiSplat + LightGaussian | 0.4 | 19.785 | 0.604 | 0.566 |
| ACID / 2 视图 | AdaptiveSplat | 0.4 | 22.549 | 0.299 | 0.640 |
| ACID / 2 视图 | AdaptiveSplat | 0.8 | 21.055 | 0.342 | 0.593 |
| RE10K / 2 视图 | HiSplat + LightGaussian | 0.4 | 16.598 | 0.596 | 0.558 |
| RE10K / 2 视图 | AdaptiveSplat | 0.4 | 22.294 | 0.235 | 0.735 |
| RE10K / 2 视图 | AdaptiveSplat | 0.8 | 20.740 | 0.272 | 0.692 |
| DL3DV / 6 视图 | AnySplat + LightGaussian | 0.4 | 11.361 | 0.671 | 0.262 |
| DL3DV / 6 视图 | AdaptiveSplat | 0.4 | 20.448 | 0.334 | 0.601 |
| DL3DV / 6 视图 | AnySplat + LightGaussian | 0.8 | 9.169 | 0.697 | 0.177 |
| DL3DV / 6 视图 | AdaptiveSplat | 0.8 | 20.049 | 0.408 | 0.556 |
剪枝从 40% 增至 80% 时,RE10K 的 PSNR 从 22.294 降至 20.740,DL3DV 六视图从 20.448 降至 20.049;表示变稀疏并非没有质量代价,但本文退化较平缓。DL3DV 的 LPIPS 同时从 0.334 增至 0.408,说明不能只凭较小的 PSNR 下降断言感知细节完全不受影响。
消融实验¶
原文表 3,固定 \(\beta=0.4\)。每个结果单元依次为 PSNR / LPIPS / SSIM;保留原表精度,不混用主表的舍入值。
| 配置 | ACID | RE10K | 检验对象 |
|---|---|---|---|
| 去掉纹理排序 | 21.31 / 0.326 / 0.623 | 20.73 / 0.260 / 0.713 | 改为随机选择超簇剪枝,仍训练模型 |
| 去掉自适应高斯头 | 17.44 / 0.445 / 0.490 | 19.81 / 0.399 / 0.617 | 用固定预训练头预测后直接选择 |
| 去掉二值掩码输入 | 22.52 / 0.318 / 0.642 | 20.06 / 0.339 / 0.656 | 训练预测头,但不给剪枝布局 |
| 完整模型 | 22.55 / 0.299 / 0.639 | 22.29 / 0.235 / 0.735 | 纹理排序、属性适应和掩码共同使用 |
ACID 完整模型的 SSIM 在表 3 为 0.639,在表 1 为 0.640;这里按各自原表记录,不能把差异悄悄改成一致值。去掉掩码后 ACID 的 SSIM 反而是 0.642,因此“所有组件都提升每一项指标”不成立。
关键发现¶
- 属性适应是最强的单项证据:去掉自适应头,ACID PSNR 下降 5.11 dB,RE10K 下降 2.48 dB,说明单靠聪明地删点还不够。
- 掩码收益依赖数据集:RE10K 去掉掩码下降 2.23 dB,ACID 仅下降 0.03 dB,但后者 LPIPS 从 0.299 恶化至 0.318;收益并不均匀。
- 表 4 中 \(K=300\) 与 \(K=400\) 的 PSNR 分别为 22.549 和 22.559,增益已很小;\(\gamma=0.05/0.10/0.15/0.20\) 对应 21.796/22.549/21.587/22.262,默认 0.10 最好,但变化并非单调。
- 渲染速度以每个剪枝强度合成 1000 个新视图测量,图示报告高剪枝下 FPS 增加。缓存未给出可可靠读取的 FPS 或延迟数值,不能据此编写加速倍数。
亮点与洞察¶
- 剪枝和重参数化必须联合考虑。固定中心的剩余高斯可以通过尺度、透明度与外观适应新布局,表示压缩并不必然等于先删除再逐场景补救。
- 显式二值掩码是预算控制与视觉预测之间的接口。它提供具体空间布局,比只给一个全局稀疏率更能说明哪里需要扩大覆盖,消融在 RE10K 上支持这一点。
- 区域级分配比单高斯全局排名多了一层结构约束。先保留局部代表、再调整其属性的思路值得迁移到其他稀疏表示,但不是本文已验证的通用结论。
局限与展望¶
- 作者明确承认:带高频图案的平滑表面以及镜面高光仍是困难情形。纹理能量无法独立判断复杂外观到底需要更多几何还是更强的外观模型,未来需要联合纹理与几何判断。
- 复现细节仍有缺口。预算边界公式与图 4 的保留规则不完全自洽,所读正文也未说明坐标和颜色的归一化;这些细节可能直接影响簇划分及实际保留数量。
- 多数据集证据不等于所有泛化结论均已核验。DTU 零样本结果和 Tanks and Temples 结果被放在补充材料中,当前缓存仅含正文及参考文献,本笔记不报告其分数。
- 更少高斯不等于整条流水线显存按比例下降。作者说明 GPU 显存负载与基础模型相同,且仍需稠密骨干、聚类和掩码构建;应分别测量一次性重建成本、峰值显存及后续多视图渲染成本。
- 后续可加入几何置信度与跨视图一致性信号,并给出严格预算处理的伪代码、统一硬件端到端延迟和无剪枝基线曲线。这些是笔记提出的验证方向,不是作者已经完成的实验。
相关工作与启发¶
- 与 NoPoSplat、HiSplat、AnySplat 的关系:这些方法提供稀疏或密集视图的前馈高斯表示,本文主要解决它们的表示密度缺乏显式控制的问题,而不是重新提出一个基础多视图几何骨干。
- 与 EAGLES、LightGaussian、PUP-3DGS 的区别:这些压缩方法依靠贡献度、重要性或不确定性选择高斯;本文通过纹理组织区域级分配,并训练预测头适应剪枝。表中结果只代表论文构造的前馈迁移评测,不能泛化为它们在原始逐场景重建任务中同样弱。
- 与 WaveNeRF 的联系:两者都利用小波刻画频率信息,但本文将它用于高斯预算与剪枝布局,关键收益来自频率线索和条件属性预测的结合,而不是单纯引入 DWT。
评分¶
- 新颖性: 4/5。纹理、区域代表与掩码条件属性预测结合紧密,创新集中于可控前馈稀疏化,而非基础骨干。
- 实验充分度: 4/5。主文覆盖多个数据集、预算和组件消融,但补充材料结果未在当前缓存提供,端到端成本证据也不够完整。
- 写作质量: 3/5。动机与可视化直观,但预算规则存在歧义,主表与消融表个别数值有细微差异。
- 价值: 4/5。将紧凑表示与免测试时优化结合,适合需要重复渲染的工作流;实际部署收益还需核算骨干与聚类成本。