跳转至

FillGS: Filling Observation Gaps in 4D Gaussian Splatting via Viewpoint-Time Selection and Generative Refinement

会议: ECCV 2026
论文: ECCV 原文
项目主页: https://otonari726.github.io/fillgs/
领域: 3D 视觉
关键词: 4D高斯泼溅, 动态新视角合成, 主动视角选择, 视频扩散模型, 时空稀疏观测

一句话总结

针对稀疏多视角视频下 4D 高斯泼溅因时空观测空缺导致的动态模糊与伪影,FillGS 通过渲染敏感度与运动感知观测稀疏度主动筛选极具信息量的虚拟时空视角,利用视频扩散模型增强渲染图像,并结合几何匹配与运动共视掩码进行鲁棒微调,显著提升了动态场景插值与外推的几何与纹理保真度。

研究背景与动机

4D 高斯泼溅(4DGS)凭借显式点基元表示与快速光栅化渲染,已成为动态复杂场景实时渲染与新视角合成的前沿方案,在虚拟现实、影视制作与具身交互等领域展现出巨大潜力。然而,现有 4DGS 高度依赖密集且多视角的同步相机覆盖。在实际真实场景采集受限的稀疏视角配置下,相机的空间覆盖严重受限,导致大量时空区域缺乏足够的多视角观测约束;特别是场景中包含高速剧烈运动的动态物体时,由于目标在特定空间位置仅被极少数甚至单帧相机瞬间捕获,关联的 4D 高斯基元受到的光度与几何几何约束极为微弱,渲染新视角或跨时步视角时极易滋生严重的破绽、伪影与过度平滑。

为弥补物理相机采集不足的缺陷,近期涌现出借助 2D/3D 扩散生成模型作为前验来修复渲染视角的方案。然而,生成先验的有效性极度敏感于用于生成增强的虚拟视角的选取策略。现有方法大多采用经验式启发规则,例如简单地在已有训练相机间做线性几何插值,或在视角空间内均匀随机采样。这类策略在静态场景中尚可最大化空间包围度,但在动态 4D 场景中却存在根本性缺陷:动态场景中的观测稀疏性不是纯粹的空间属性,而是随着物体运动在空间与时间维度联合动态演化的。简单基于静态空间覆盖或无差别均匀采样的虚拟相机,极易错失那些由于剧烈运动而在特定时间点急需补充约束的时空关键区域,既浪费了扩散模型的生成开销,又无法精准靶向优化最欠约束的高斯基元。

此外,直接将生成模型合成的虚拟视图充当真实监督信号还会带来虚假幻觉与几何冲突。如果在原本已有充足真实观测支持的区域强行引入生成监督,或者将包含生成伪影的区域未加过滤地用于反向传播,就会破坏原有的几何一致性。核心 idea:将 4DGS 时空空缺填补建模为主动视角选择与可信生成引导问题,依据局部渲染敏感度与运动感知观测稀疏度主动定位欠约束时空虚拟视角,并通过跨视角几何匹配一致性与动态共视掩码过滤生成幻觉,仅在不可靠区域实现高保真互补微调。

方法详解

整体框架

FillGS 整体流程分为四个紧密耦合的阶段:首先在稀疏视角输入上预训练基础 4DGS 模型;接着执行主动时空虚拟视角选择,先通过扰动敏感度挖掘局部不稳定的训练视角作为探索起点,再融合局部扰动与全局轨迹采样生成候选集,并以运动感知观测缺陷度对候选打分;随后将选定虚拟视角的渲染帧组装为时空 patch,输入微调后的时空视频扩散模型中完成内容修补与纹理增强;最后通过几何特征匹配置信度与动态共视权重过滤伪影,对 4DGS 进行鲁棒微调。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入:稀疏多视角动态视频"] --> B["阶段 1:4DGS 基础模型训练"]
    B --> C["阶段 2:敏感度探索起点选择<br/>综合重构误差与有限差分扰动敏感度"]
    C --> D["阶段 3:局部与全局虚拟视角候选生成<br/>位姿扰动与全局边界框采样轨迹插值"]
    D --> E["阶段 4:运动感知观测稀疏度评分<br/>结合高斯速度与时序观测次数筛选最佳视角"]
    E --> F["阶段 5:时空视频扩散模型增强<br/>时空 patch 条件补全与一致性精炼"]
    F --> G["阶段 6:双重可信度掩码鲁棒微调<br/>几何匹配置信度与运动共视权重联合调制"]
    G --> H["输出:高保真 4DGS 动态辐射场"]

关键设计

1. 敏感度探索起点选择:利用有限差分代理不确定性定位薄弱时空锚点

为了高效探索虚拟相机,必须首先确定从哪一个已有的时空观测点出发进行局部或全局辐射。由于未观测视角在真实场景中缺乏标注真实图像,无法直接评估其重构误差。作者发现,在 4DGS 中,凡是未被充分多视角约束的高斯基元,其空间不确定性极高,微小的相机位姿变化或时间偏移就会急剧改变参与投射和混合的高斯集合及其透射率权重,导致渲染输出发生剧烈突变。因此,渲染输出对微小外扰动的敏感度是表征重构认知不确定性的天然代理。

系统对每个已观测时空视角 \(v\) 计算探索优先级得分 \(\mathcal{E}(v)\),综合基准重构误差与有限差分扰动波动: $$ \mathcal{E}(v) = \mathcal{L}(v) \cdot \mathcal{V}(v) $$ 其中 \(\mathcal{L}(v)\) 为观测视角下的归一化重构误差(使其在数据集层面的均值为 1);\(\mathcal{V}(v)\) 为视角在位姿与时间微小扰动下的归一化局部变化量: $$ \mathcal{V}(v) = \sum_{\delta \in \mathcal{D}} w_\delta \left| \hat{I}\theta(v \oplus \delta) - \hat{I}\theta(v \ominus \delta) \right|_2^2 $$ 扰动集合 \(\mathcal{D}\) 涵盖 3 个平移方向、3 个旋转方向以及 1 个时间偏移。该指标实质上近似了渲染函数关于位姿扰动的局部 Lipschitz 常数,优先挑选出重构误差大且外推高度不稳定的观测视角作为下一步时空探索的起点。

2. 局部与全局双重候选生成:兼顾局部邻域稳定与全局盲区穿透

仅在局部微小扰动容易陷入局部极小且无法跨越相机间的开阔盲区,而纯全局随机采样又易偏离有效重建流形。因此,FillGS 采用局部与全局协同的候选相机生成机制。

在局部策略中,系统围绕已选起点施加 6 个平移扰动与 4 个旋转扰动,同时在该时间步选取与其最邻近的两个训练相机并生成插值相机,共生成 12 个局部候选,既探索邻域又向已有视角形成桥接过渡。在全局策略中,系统根据起点相机与同时间步邻近相机的位置构建边界框,并按局部最大移动步长进行外扩,在该扩展包围框内均匀采样 12 个候选空间点,其朝向通过邻近观测视角的朝向插值得到;选定全局候选点后,重新找寻同时间步最近的训练相机并在二者之间插值构建一条连续平滑的相机轨迹。这种双尺度生成机制保证了候选空间在覆盖近邻几何与大范围外推时均具有合理的视角连续性。

3. 运动感知观测稀疏度评分:基于粒子速度与观测频次量化信息增益

静态视角选择往往只计算高斯的绝对可见次数,但在 4D 场景中,静态背景高斯在全时序各相机下均被重复记录,其观测计数天然极高;反观快速移动的物体,在单帧中一闪而过,其空间位置转瞬即逝。若仅靠静态可见性,相机采样将被静态物体主导,完全忽略动态剧烈运动物体的观测空缺。

针对该痛点,FillGS 为每个 4D 高斯基元 \(g_i\) 建立基于时间的观测次数表 \(C_{g_i}(t)\) 以及速度模长 \(s_{g_i}(t)\),提出运动感知观测缺陷度指标 \(D_{g_i}(t)\): $$ D_{g_i}(t) = \frac{s_{g_i}(t)}{1 + C_{g_i}(t)} $$ 当高斯基元运动速度大且观测次数少时,\(D_{g_i}(t)\) 显著增大,表明其处于高度欠约束状态;反之,低速或静止且观测充分的高斯基元缺陷度极低。在为候选视角打分时,系统直接将 \(D_{g_i}(t)\) 赋作高斯的辐射属性光栅化渲染到候选相机视锥中,并计算该渲染特征图的像素均值。均值最高的候选视角意味着其视锥内捕获了最多高速度、少观测的急需补充约束的 4D 高斯,从而在主动视角选择意义上实现最大化的信息增益。

4. 几何匹配与运动共视双重掩码微调:严防生成幻觉侵蚀真实结构

经由视频扩散模型生成的图像虽然细节丰富,但不可避免地存在空间形变、纹理漂移或生成幻觉,直接当作伪真实标签会严重污染高斯几何。微调机制必须满足两个基本原则:不破坏已有观测已经精确约束的区域,且严格剔除扩散模型生成的错误结构。

为此,FillGS 构建了两种互补的空间掩码: - 几何匹配一致性掩码:利用密集特征匹配模型 RoMa v2 计算生成虚拟视图与两幅相邻时间与视角的真实训练图像之间的密集对应置信度,取二者的逐像素最大置信度形成置信度图。由于几何幻觉区域与真实视角的特征匹配极低,该掩码能精准切除生成的失真区域。 - 运动感知共视掩码:将归一化后的运动感知缺陷度 \(D_{g_i}(t)\) 反向映射为高斯权重。对于已有大量真实视角覆盖的区域赋以极小权重,抑制虚假修改;而对稀疏观测、高动态欠约束区域赋以大权重,使扩散模型的正向补全能力精确注入薄弱盲区。通过两层掩码联合调制光度损失,实现了 4DGS 稳健、无损的高保真增量微调。

损失函数 / 训练策略

基础 4DGS 采用 E-D3DGS 架构,在训练 30,000 次迭代的主流程中,每隔 6,000 次迭代触发一次主动视角选择,每次生成 20 条优化虚拟轨迹进行生成增强并并入微调批次。微调损失基于调制后的 L1 损失与 D-SSIM 损失联合优化: $$ \mathcal{L}{\text{ft}} = \sum(p) \right] $$ 通过该损失函数,梯度更新被严格限制在几何可信且急需补充的时空区域中。}} M_{\text{conf}}(p) \cdot M_{\text{covis}}(p) \left[ (1 - \lambda_{\text{ssim}}) |I_{\text{gen}}(p) - \hat{I}(p)| + \lambda_{\text{ssim}} \mathcal{L}_{\text{D-SSIM}

实验关键数据

主实验

评估在稀疏双相机输入设置下进行(训练仅用 2 台相机,测试涵盖插值与外推视角)。实验在多视角视频基准 Neural 3D Video(6 个场景)与 Technicolor(5 个场景)上展开,指标涵盖 PSNR、SSIM、LPIPS、FID 以及 DINOv2 特征余弦相似度。

表 1:Neural 3D Video 数据集主对比实验(双相机稀疏配置)

方法 / 视角选择策略 插值 PSNR↑ 插值 SSIM↑ 插值 LPIPS↓ 插值 FID↓ 外推 PSNR↑ 外推 SSIM↑ 外推 LPIPS↓ 外推 FID↓
E-D3DGS 基线 (无生成) 20.42 0.775 0.293 129.33 14.68 0.723 0.363 160.01
插值视角选择 (GS-GS 方案) 20.75 0.777 0.293 120.08 14.75 0.716 0.370 157.52
FisherRF 视角选择 (Fisher 信息) 21.01 0.774 0.303 135.36 15.59 0.716 0.373 180.27
覆盖度 (3D) 选择 (ExploreGS) 19.91 0.754 0.317 148.68 15.30 0.700 0.388 175.53
覆盖度 (4D) 选择 (逐帧时空扩展) 19.09 0.737 0.325 140.19 15.51 0.681 0.407 182.99
FillGS (本文方法) 21.73 0.792 0.256 83.81 16.24 0.740 0.312 137.32

表 2:Technicolor 数据集主对比实验(双相机稀疏配置)

方法 / 视角选择策略 插值 PSNR↑ 插值 SSIM↑ 插值 LPIPS↓ 插值 FID↓ 外推 PSNR↑ 外推 SSIM↑ 外推 LPIPS↓ 外推 FID↓
E-D3DGS 基线 19.63 0.606 0.378 137.86 16.10 0.690 0.341 131.48
插值视角选择 19.90 0.612 0.376 115.24 16.88 0.701 0.338 123.77
FisherRF 视角选择 20.08 0.614 0.421 152.56 18.32 0.646 0.444 163.51
覆盖度 (3D) 选择 20.12 0.622 0.370 106.63 17.61 0.710 0.332 110.54
覆盖度 (4D) 选择 20.03 0.619 0.373 110.07 17.68 0.717 0.329 106.47
FillGS (本文方法) 22.55 0.748 0.250 73.44 19.88 0.720 0.315 106.45

消融实验

表 3:视角选择策略与核心模块消融实验(Neural 3D Video 数据集)

实验配置 插值 PSNR↑ 插值 SSIM↑ 插值 LPIPS↓ 插值 FID↓ 外推 PSNR↑ 外推 LPIPS↓ 外推 FID↓
完整模型 (FillGS) 21.73 0.792 0.256 83.81 16.24 0.312 137.32
去除起点选择 (w/o starting selection) 21.06 0.773 0.286 126.78 15.75 0.393 144.98
去除敏感度指标 (w/o sensitivity) 21.24 0.763 0.279 100.77 16.01 0.379 146.25
去除误差指标 (w/o error) 21.52 0.766 0.275 100.14 16.22 0.377 142.81
去除候选评分 (w/o candidate selection) 21.13 0.778 0.282 113.72 15.07 0.391 147.03
去除观测计数项 (w/o count) 20.55 0.768 0.294 135.20 15.66 0.346 150.63
去除运动速度项 (w/o speed) 21.06 0.761 0.283 106.35 15.79 0.350 146.81
去除全局候选生成 (w/o global candidate) 21.39 0.778 0.283 116.88 15.85 0.353 150.18
随机视角选择 (Random) 20.59 0.762 0.295 130.43 15.07 0.384 172.37
负向反向选择 (Negative Selection) 20.31 0.765 0.294 129.30 15.06 0.379 175.95

表 4:微调权重策略消融实验(Neural 3D Video 数据集)

微调权重配置 插值 PSNR↑ 插值 SSIM↑ 插值 LPIPS↓ 插值 FID↓ 外推 PSNR↑ 外推 LPIPS↓ 外推 FID↓
完整模型 (双掩码微调) 21.73 0.792 0.256 83.81 16.24 0.312 137.32
无任何权重掩码 (w/o weight) 20.05 0.716 0.334 128.57 14.70 0.409 167.40
去除几何一致性掩码 (w/o consistency mask) 21.26 0.778 0.283 107.96 15.81 0.355 149.50
去除共视缺陷度掩码 (w/o co-visibility mask) 21.96 0.780 0.270 98.43 15.93 0.359 153.95
对比: 3DGS-Enhancer 加权方案 21.41 0.763 0.281 100.11 15.48 0.374 156.29
对比: ExploreGS 加权方案 20.97 0.770 0.287 109.74 15.14 0.353 151.38
对比: UA-4DGS 加权方案 19.96 0.745 0.322 135.11 14.69 0.419 201.89

关键发现

  1. 主动探索的绝对收益:在 Neural 3D Video 上,FillGS 在插值场景相比基线 PSNR 提升 1.31 dB,FID 从 129.33 骤降至 83.81(下降超 35%);在 Technicolor 上插值 PSNR 更是从 19.63 跃升至 22.55 dB(提升近 3 dB),FID 达到惊人的 73.44,大幅消除了快速运动轮廓的破损与撕裂。
  2. 时空运动感知的必要性:传统仅追求空间覆盖度的方案(如 ExploreGS 3D/4D)由于盲目倾向大角度外推而忽视了相机间隙内的快速运动,其性能甚至落后于简单的基线插值;而将缺陷度评分中的运动速度项 \(s_{g_i}(t)\) 去除后,模型插值 PSNR 明显跌落 0.67 dB,证实了动态建模中对高斯速度赋权的核心作用。
  3. 一致性掩码是防御生成幻觉的第一道防线:在微调消融中,直接无掩码微调会导致外推 PSNR 从 16.24 跌至 14.70 dB,甚至差于未引入生成的基线;去除几何一致性掩码会导致感知指标 FID 急剧恶化(从 83.81 升至 107.96),表明跨视角特征匹配过滤是防止生成幻觉侵蚀物理辐射场的关键防护罩。

亮点与洞察

  • 扰动敏感度充当免显式不确定性评估代理:无需引入复杂的贝叶斯集成或昂贵的采样开销,直接利用微小位姿/时间有限差分扰动计算局部输出方差,优雅刻画了 4DGS 的重构认知不确定性。
  • 将运动速度纳入观测缺陷度量化:颠覆了静态主动视角仅看空间重叠计数的局限,通过速度模长除以时序观测频次,精准捕捉了高速动态区域在时空维度上的瞬时信息空缺。
  • 双重掩码解耦可靠性与必要性:利用 RoMa v2 几何匹配置信度评判生成像素的“可信度”,同时利用高斯缺陷度共视权重评判更新该区域的“必要性”,形成了严密闭环的增量微调约束。

局限与展望

  • 底层 4DGS 表征能力上限:当场景中包含拓扑剧烈改变或复杂非刚体高频流动时,底层 4DGS 变形场可能本身就缺乏足够容量拟合,即便扩散模型输出了完美图像,高斯球也可能无法收敛到正确位置。
  • 扩散模型生成视角的有效范围边界:扩散模型的增强能力受其先验分布限制,若主动视角采样的相机偏离训练视角过远(严重超出模型泛化范围),扩散模型自身将产生无法修复的严重伪影,导致无效计算。
  • 未来方向:探索与 4D 大规模前向重建模型(如 4D Large Reconstruction Models)的联合自适应采样,并在主动视角选择中显式建模扩散模型自身的生成置信度约束边界。

相关工作与启发

  • vs ExploreGS [ICCV 2025]: ExploreGS 专为静态场景设计,仅依靠维护统一的视线角度覆盖图选择虚拟视角;FillGS 指出其在动态场景下会过度偏向外推而丢失快速运动细节,通过联合建模高斯速度与时序观测次数,实现了时空维度的精准填补。
  • vs GS-GS [CVPR 2025] / UA-4DGS [NeurIPS 2024]: 前者仅在训练相机间做简单几何插值,无法主动探测视锥外的时空盲区;后者采用静态高斯不确定性赋权。FillGS 实现了主动时空全局与局部探索,并采用基于 RoMa 特征匹配与动态缺陷度的双重自适应掩码。

评分

  • 新颖性: ⭐⭐⭐⭐☆ [将主动视角选择引入动态 4DGS 视频生成增强,提出扰动敏感度与运动感知缺陷度]
  • 实验充分度: ⭐⭐⭐⭐⭐ [精心构建稀疏双相机插值与外推全新基准划分,消融实验详实充分]
  • 写作质量: ⭐⭐⭐⭐⭐ [方法叙述层层递进,动机痛点清晰,指标设计直击物理本质]
  • 价值: ⭐⭐⭐⭐☆ [为少视角动态 4DGS 重建与视频生成先验结合提供了标准范式与开箱即用的主动探索框架]