跳转至

PriSplat: Propagating Reliable Multi-view Information for Distractor-Free 3DGS

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/yun-seo/PriSplat.git
领域: 3D 视觉
关键词: 3D 高斯泼溅、无干扰物重建、多视角信息传播、3D感知图像修复、新视角合成先验

一句话总结

PriSplat 改变了无干扰物 3DGS 仅依靠掩码清零丢弃监督信号的传统范式,通过几何感知支持视角选择与掩码感知快速权重更新,将大规模新视角合成先验改造为 3D 修复谐波器,为被遮挡背景合成具备几何一致性的伪真实标签,在 On-the-go 基准上取得了 23.11 dB PSNR 的全场景最优去伪影重建质量。

研究背景与动机

3D Gaussian Splatting(3DGS)凭借显式场景基元表征与极其高效的渲染优化管线,已成为高保真新视角合成(NVS)的核心基石。然而,标准 3DGS 严格建立在全静态场景假设之上;当采集输入处于非受控的真实开放环境(in-the-wild)时,行人、过往车辆等瞬态干扰物(transient distractors)频繁闯入相机视线,破坏了多视角几何一致性。观测视角间的表征冲突不仅向优化过程注入大量高频噪声,还会诱发严重的几何畸变与模糊。

为了消除此类动态干扰,现有的无干扰物 3DGS 方法普遍采取“残差检测与掩码剔除”策略:先通过语义模型或重投影残差定位干扰物区域,随后在损失函数中将对应像素置零以阻断梯度反向传播。然而,这种简单的掩码清零操作在剔除噪声的同时也强行剥离了关键的几何监督信号。被遮挡区域失去多视角约束后,优化过程极易陷入单视角过拟合与欠约束状态,致使重建结果在新视角合成中饱受悬浮伪影(floaters)、鬼影(ghosting)以及局部几何坍塌的困扰。即便部分前沿工作尝试引入 2D 扩散生成模型进行填补,但纯 2D 先验缺乏三维空间几何感知,往往凭空幻觉出跨视角冲突的纹理细节;加之在早期粗糙渲染图上做条件引导,极易形成误差滚雪球效应。

面对这一两难困境,本文发现未受限图像集合中存在天然的多视角冗余:某个被动态目标彻底遮挡的背景区域,在相邻或其它观察机位中往往清晰可见,存在可靠的潜在多视角证据。既然新视角合成在本质上就是一个参考多视角的补全过程,完全可以直接利用大规模视角合成先验来汇聚多视角信息,把空洞掩码主动转化为高质量的几何一致伪真值。核心 idea:将预训练新视角合成先验重构为 3D 感知修复引擎,配合掩码感知快速权重更新防止干扰物渗漏,并以 Fisher 信息密度与空间-角度约束筛选可靠支持视角,从而为 3DGS 注入密集且几何自洽的背景监督。

方法详解

整体框架

PriSplat 的核心流程紧密嵌入在 3DGS 的整体优化迭代中,从传统的“被动忽略干扰”演进为“主动传播可靠信息”。算法执行包含三个关键阶段:掩码预测、几何感知支持视角检索以及多视角修复谐波化。

在训练初期,系统采用轻量 MLP 动态估计各视角干扰物掩码,执行基础的掩码重构预热,避免高斯基元早期拟合移动物体。当整体粗粒度几何趋于稳定后(迭代至 10k 步),系统冻结并切入多视角谐波化阶段(持续至 20k 步):针对带有遮挡掩码的目标视角,算法根据几何互补性筛选最优质的支撑机位集合,经由掩码感知快速权重更新适配场景记忆,合成具备严格 3D 结构一致性的完整伪真实背景;随后以全图密集重构损失监督 3DGS 进一步消除悬浮碎片;最后在收敛阶段(20k 至 30k 步)切换回纯净背景的高精度微调。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入非受控多视角图像集合"] --> B["动态干扰物掩码预测<br/>轻量网络定位瞬态移动物体"]
    B --> C["阶段1:掩码优化预热<br/>无干扰物像素粗优化 3DGS 几何"]
    C --> D["阶段2:几何感知支持视角选择<br/>Fisher信息密度 + 空间距离 + 视线夹角"]
    D --> E["阶段2:多视角谐波器修复<br/>掩码感知快速权重更新 + 跨视角特征融合"]
    E --> F["密集伪真值监督 3DGS 迭代<br/>消除空洞欠约束与悬浮伪影"]
    F --> G["阶段3:精细化掩码微调<br/>收敛至干净无伪影三维高斯辐射场"]

关键设计

1. 几何感知支持视角选择:结合 Fisher 信息密度与空间-角度约束筛选无遮挡参照

若为被遮挡区域盲目选择相邻机位(例如简单的欧氏距离 KNN),所选视角自身极有可能同样被移动干扰物遮盖,或者视线与待修补表面夹角过大产生严重拉伸,从而向网络输入模糊甚至自相矛盾的信号。为确保所引用的多视角线索坚实可靠,PriSplat 建立了一套联合信息密度与几何姿态的严密筛选准则。

针对目标视角 \(t\) 的遮挡区域,令 \(\mathcal{G}_t^{\mathrm{rel}}\) 表示投影落入该掩码内的三维高斯基元集合。对于任一候选参考视角 \(s \in \mathcal{S}_t\),其支持度首先取决于该视角能否清晰、高灵敏度地观察到这批高斯基元。算法引入基于 Fisher 信息矩阵的敏感度指标衡量像素对高斯参数扰动的响应强度:

\[r_{t,s} = \frac{1}{|\mathcal{G}_t^{\mathrm{rel}}|} \sum_{k \in \mathcal{G}_t^{\mathrm{rel}}} \mathbb{I} \left[ g_k \text{ is well-observed in view } s \right]\]

式中指示函数 \(\mathbb{I}[\cdot]\) 依赖对应视线下渲染颜色对高斯参数的梯度范数平方判定。在此基础上,为了抑制远距离视角导致的视差失真并防止视线掠射,算法乘上空间位移权重 \(w_{\mathrm{dist}}(t, s) = \exp(-\|c_t - c_s\|_2 / \sigma_{\mathrm{dist}})\) 与视线夹角权重 \(w_{\mathrm{ang}}(t, s) = \max(0, v_t \cdot v_s)^{k_{\mathrm{ang}}}\),最终合成综合可靠性得分 \(\rho_{t,s} = r_{t,s} \cdot w_{\mathrm{dist}}(t,s) \cdot w_{\mathrm{ang}}(t,s)\)。通过设定绝对阈值 \(\tau\) 与相对峰值阈值 \(\tau_{\mathrm{rel}}\) 过滤低质视角,且仅在可靠支撑视角数量 \(| \mathcal{S}_t^{\mathrm{sup}} | \ge K_{\min}\) 时才触发修复,杜绝了低信息量视角导致的错误填充。

2. 3D 感知多视角谐波器与掩码感知快速权重更新:重构 NVS 先验为结构一致修复引擎

传统 2D 扩散修图模型无法保证跨机位生成的纹理在三维空间严格对齐。PriSplat 独辟蹊径,将大规模基于 Transformer 架构的新视角合成模型改造为 3D 感知修复网络。由于 NVS 模型天生依靠多视角输入提取空间几何 token 并通过自注意力交互,只要输入纯净的互补视角,模型即可依据刚体姿态条件推理出目标机位的遮挡内容。

然而,常规 NVS 架构在测试时会将所有输入 patch 写入轻量场景内部记忆(Fast-weights \(W\))。若支撑视角中残留微小干扰物碎片,这些动态错误表征会直接污染模型内部权重。为此,PriSplat 提出了掩码感知快速权重更新(Mask-aware Fast-weight Update)。模型计算输入 Query 和 Key token 之间的语义对齐度 \(\alpha = \langle Q, K \rangle_{\mathrm{token}}\),并生成自适应衰减门控 \(b = \sqrt{\sigma(\alpha)}\),以此显式重新加权被更新的键值对:

\[\Delta W = \texttt{Update}(W; b \odot K, b \odot V, \eta), \qquad W' \leftarrow W + \Delta W\]

被门控抑制后的权重 \(W'\) 仅沉淀属于静态三维背景的共性特征。最后通过查询目标位姿特征 \(Q_t\),生成兼具照片级真实感与精确透视对应关系的补全图像 \(\hat{I}_t = \texttt{Harmonizer}(\{(\tilde{I}_j, P_j)\}, P_t)\)

3. 三阶段渐进式混合监督策略:解耦几何粗建、密集去伪影与最终外观收敛

模型并未在全部 30k 迭代中全程开启大模型谐波器,而是设计了时间分段的混合监督机制。在 0~10k 步,仅依靠掩码重构损失 \(\mathcal{L}_{\mathrm{mask}}\) 让高斯点云在无干扰物像素处快速成型,形成相对可信的粗略三维结构,以便准确计算高斯在遮挡区域的 Fisher 投影信息。

在 10k~20k 步,系统激活谐波监督:对于满足支撑视角数量门槛的目标图像,直接将其全分辨率伪真值图像 \(\hat{I}_i\) 接入包含 L1 与 D-SSIM 的全图监督:

\[\mathcal{L}_i^{\mathrm{stage2}} = \sum_{p \in \Omega} \mathcal{D}(f_{p,i}(\theta), \hat{I}_i(p))\]

对于未能选出充足可信支持视角的图像,则自适应退水保留原始掩码损失 \(\mathcal{L}_{\mathrm{mask}}\)。在最后的 20k~30k 步,模型停用谐波生成器并切回纯真实无遮挡像素的精调,彻底消除生成式伪真值可能携带的轻微模糊或平滑偏差,实现兼顾高频细节与全局无伪影的平衡。

实验关键数据

主实验

论文在 On-the-go 真实世界动态干扰基准数据集的 6 个标准场景上进行了全面评测,涵盖低遮挡(Mountain、Fountain)、中度遮挡(Corner、Patio)以及重度遮挡(Spot、Patio-high)多种挑战环境。评价指标包括峰值信噪比(PSNR↑)、结构相似性(SSIM↑)以及基于 AlexNet 的感知相似度(LPIPS↓)。对比基准包括 SLS-mlp、WildGaussians、OCSplats、ForestSplats、HybridGS、DeSplat、DeGauss 和 RobustSplat 等前沿方案。

场景类别 场景名称 指标 PriSplat (本文) RobustSplat [16] DeSplat [61] 提升 (vs 最佳基线)
低遮挡 (Low) Mountain PSNR / SSIM / LPIPS 21.65 / 0.7080 / 0.1688 21.42 / 0.6934 / 0.1761 19.92 / 0.6696 / 0.1780 +0.23 dB / -0.0073 LPIPS
低遮挡 (Low) Fountain PSNR / SSIM / LPIPS 21.42 / 0.7066 / 0.1590 20.97 / 0.6967 / 0.1603 20.66 / 0.6830 / 0.1673 +0.45 dB / +0.0099 SSIM
中遮挡 (Medium) Corner PSNR / SSIM / LPIPS 25.98 / 0.8569 / 0.0992 25.76 / 0.8513 / 0.1077 24.61 / 0.8178 / 0.1312 +0.22 dB / -0.0085 LPIPS
中遮挡 (Medium) Patio PSNR / SSIM / LPIPS 21.97 / 0.8215 / 0.1052 21.94 / 0.8182 / 0.1054 21.63 / 0.8122 / 0.1093 +0.03 dB / +0.0033 SSIM
高遮挡 (High) Spot PSNR / SSIM / LPIPS 25.15 / 0.8070 / 0.1149 24.95 / 0.8035 / 0.1179 24.53 / 0.7830 / 0.1521 +0.20 dB / -0.0030 LPIPS
高遮挡 (High) Patio-high PSNR / SSIM / LPIPS 22.48 / 0.7559 / 0.1593 22.08 / 0.7538 / 0.1622 21.34 / 0.7377 / 0.1880 +0.40 dB / +0.0021 SSIM
平均性能 (Mean) 全场景平均 PSNR / SSIM / LPIPS 23.11 / 0.7760 / 0.1344 22.86 / 0.7710 / 0.1387 22.28 / 0.7589 / 0.1543 +0.25 dB / -0.0043 LPIPS

(数据源自原论文 Table 1,DeGauss 在 Mountain 场景下 PSNR 为 21.71 dB,但在 Patio-high 等高遮挡场景及平均指标上均落后于本文方法。)

消融实验

论文通过系统消融验证了多视角谐波化、支持视角筛选机制、持续掩码优化以及掩码感知快速权重更新的核心有效性(原论文 Table 2 均值结果):

实验配置变体 谐波化 (Harmonization) 阈值门控 (Threshold) 视角选择策略 (Selection) 动态掩码 (Mask) 快速权重门控 (Mask-aware) PSNR↑ SSIM↑ LPIPS↓ 配置说明
(a) 纯掩码基线 22.86 0.7710 0.1387 类似 RobustSplat,仅将遮挡像素损失置零
(b) 盲目 KNN KNN 22.72 0.7673 0.1415 视角选择不当导致引入严重修补错误,指标反降
(c) 全局几何选择 几何感知 22.85 0.7711 0.1375 虽有几何考量但不做门控截断,弱视角依然有害
(d) 阈值门控 KNN KNN 22.89 0.7706 0.1386 过滤部分视角,但缺乏三维遮挡可见性建模
(e) 冻结掩码预测 几何感知 22.89 0.7712 0.1404 不继续更新掩码预测器,残留掩码漏洞未修正
(f) 无权重掩码门控 几何感知 22.93 0.7736 0.1373 缺少式 (6) 的 token 衰减门控,部分干扰特征渗漏
(g) 完整模型 (Ours) 几何感知 23.11 0.7760 0.1344 协同发挥最优表现,较纯掩码基线大幅提升

此外,论文还对比了生成先验选择(原论文 Table 5):在相同训练设定下,基于 LaMa 的 3DGIC(PSNR 22.26 dB)与基于 FLUX 的 RogSplat(PSNR 21.62 dB)由于缺乏多视角严密几何一致性,指标均大幅逊于 PriSplat 的 23.11 dB。

关键发现

  • 几何感知视角筛选是修复质量的决定性前提:在消融实验中,配置 (b) 仅使用基于欧氏位姿的 KNN 支持视角,其 PSNR(22.72 dB)甚至跌破了完全不使用修复的纯掩码基线 (a)(22.86 dB)。这证明了如果辅助视角无法清晰覆盖遮挡背景或自身带有遮挡物,盲目生成的新视角伪真值反而会注入强烈的跨视角冲突,直接破坏整体 3DGS 优化。
  • 高遮挡场景收益尤为显著:在重度遮挡的 Patio-high 场景中,PriSplat 的 PSNR 达到 22.48 dB,较经典掩码基线 RobustSplat(22.08 dB)提升了 0.40 dB。定性可视化显示,基线由于背景像素大面积缺失,渲染出的庭院地面不仅布满颗粒状悬浮高斯,整体还带有弥漫性雾霭感;PriSplat 成功恢复了地面平整地砖结构与高频纹理。
  • 中间阶段注入引导的先验调度哲学:在超参数分析(Table 3a)中,将谐波伪真值限制在 10k~20k 中期进行密集优化的配置(23.11 dB)明显优于贯穿全程的 10k~30k 设定(22.92 dB)与 5k~30k 设定(22.86 dB)。这揭示了生成式 3D 先验最适合在场景骨架初成时“填补几何盲区”,而在收敛晚期必须移去外部生成伪真值,交由纯真实原始测量驱动收敛。

亮点与洞察

  • 新视角合成先验的逆向赋能:不同于学界机械地将 Stable Diffusion、LaMa 或 FLUX 等 2D/文生图模型强行套用到 3D 修补的做法,PriSplat 洞察到 NVS 模型的本质就是“以位姿为条件的参考图像补全”,开辟了直接用 NVS 先验充当多视角 3D 修复谐波器的新路径。
  • 基于 Fisher 信息的遮挡可见性量化:巧妙地将 3DGS 高斯基元投影反向梯度范数(Fisher 敏感度)用于判断候选机位对被遮挡背景的监督有效性,将抽象的“是否被遮挡”转化为可量化计算的敏感度密度指标,理论扎实且工程实现轻巧。
  • 极具性价比的训练开销控制:尽管引入了大型多视角前传网络,但得益于仅在中间 10k 步内有选择地针对达标视角单次前向(每机位约 4.36 秒),整体显存峰值仅为 7.3 GB,总训练时长 0.38 小时,相较于耗时 7.41 小时的高成本动静解耦方法 DeGauss,在实用落地层面优势明显。

局限与展望

  • 光照变化与极端反光未显式解耦:论文作者承认,当前方法假定支撑视角与目标视角之间的静态背景满足朗伯漫反射一致性,若场景跨越较长采集周期并伴随剧烈日光转移、阴影移动或复杂镜面高光,生成的伪真值可能引入色调不均问题。
  • 极端稀疏或无冗余观测的退化风险:若某一背景区域在所有训练视角中均被完全遮挡(如盲区完全无支撑视角,即 \(|\mathcal{S}_t^{\mathrm{sup}}| < K_{\min}\)),算法将回退为原始掩码抑制策略,无法无中生有地建立背景结构。
  • 后续演进方向:未来可探索将环境光照嵌入(Appearance Embedding)与多视角谐波器特征深度结合,使得生成伪真值能自适应目标机位的曝光与光影条件;同时探索将 3D 修复扩散模型与隐式几何表征联合后优化的可能性。

相关工作与启发

  • vs RobustSplat [16] / SpotLessSplats [48]:传统基于掩码剔除的方案只负责在反向传播中“阻断脏数据”,却导致遮挡区域沦为无监督的几何飞地,进而催生大量的空气浮渣高斯;PriSplat 保持其优异掩码识别能力的同时,通过 3D 谐波器重新铺设密集的背景监督信号,彻底铲除了悬浮伪影产生的温床。
  • vs RogSplat [25] / 3DGIC [18]:先前尝试利用生成先验的工作依赖 2D 图像修复模型(如 FLUX、LaMa),其单帧生成缺乏刚性多视角投影约束,容易产生跨视角纹理闪烁与几何撕裂;PriSplat 改用以相机外参为刚性条件的大规模 NVS 架构并加入掩码门控,保证了重构内容在 3D 空间内的严丝合缝。

评分

  • 新颖性: ⭐⭐⭐⭐☆ (打破单纯掩码抑制的思维定式,将 NVS 预训练大模型优雅改造为 3D 一致的多视角修复引擎)
  • 实验充分度: ⭐⭐⭐⭐⭐ (On-the-go 与 RobustNeRF 多场景细致对比,消融实验涵盖视角检索各分量、快速权重门控与生成先验选型)
  • 写作质量: ⭐⭐⭐⭐⭐ (问题定义清晰尖锐,方法动机环环相扣,图表直观且结构层次极为严密规范)
  • 价值: ⭐⭐⭐⭐☆ (为复杂野外开放环境下的 3DGS 真实重建提供了高质量、可扩展的全新解决方案)