跳转至

Unified Panoramic–Gaussian Representation for Monocular 4D Scene Synthesis

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/LogosRoboticsGroup/PanoGaussian
领域: 视频生成 / 3D 视觉
关键词: 单目4D场景合成、动态高斯泼溅、全景表征、视频扩散先验、未观测区域外推

一句话总结

针对单目视频 4D 重建局限于已知视角插值且生成先验大视角外推易几何畸变的难题,PanoGaussian 提出全景-高斯统一表征,通过全景轨迹协同对齐、基于固定 4D 几何的渐进式视点外推与掩膜蒸馏优化,实现了大视角变化下几何自洽且物理真实的未观测区域 4D 场景合成。

研究背景与动机

从单目视频重建 4D 动态场景是沉浸式内容创作与虚拟现实的核心技术,但现有动态重建方案(如动态 NeRF 与 4D 高斯泼溅)本质上都被建模为视点插值任务。这意味着算法只能在观测相机的已知运动轨迹范围内进行内插,一旦相机视角外推到未观测区域,就会因为缺乏外观与几何先验而导致严重的画面缺失、空洞与结构坍塌,无法恢复场景全貌。

为补全未观测区域,直观的思路是引入相机条件控制的视频生成扩散模型作为动态先验进行外推。然而,纯视频级生成模型缺乏显式的 3D 几何约束,且现有模型多在随机且微小的相机轨迹扰动下训练,泛化到大幅度视角偏移时极易产生几何撕裂与透视扭曲。尽管全景坐标系具备天然的 360° 全局视野并能提供空间连续性,但全景投影下动态物体的非刚性运动会导致剧烈的形状与尺度变形,无法直接用于物理真实的 4D 建模。

这一困境的核心矛盾在于:未见视角的场景补全需要全景域的全局探索视野,而动态物体的运动保真度又高度依赖显式 3D 物理几何的刚性约束。核心 idea:将全景空间全局探索与显式动态高斯泼溅表征深度融合,以对齐的全景轨迹引导视频扩散先验进行渐进式外推,并将补全结果通过掩膜像素对齐蒸馏回动态高斯场,在抑制误差累积的同时实现大视角几何一致的 4D 场景合成。

方法详解

整体框架

PanoGaussian 的输入为单目动态视频,输出为具备未观测区域完整几何与外观的动态 4D 高斯场。整体系统围绕“全景轨迹对齐—渐进几何外推—高斯掩膜蒸馏”三大阶段展开:首先,利用基线 4D 高斯骨干提取观测视角的相机位姿与稳健深度,将点云反投影后映射到全景球面坐标系作为全局场景原点;其次,在全景切平面上均匀构建多方向的渐进式外推轨迹,利用冻结的真实观测几何对视频帧进行重投影与掩膜外推,交由预训练全景视频扩散先验进行去噪补全;最后,利用生成的新视角视频与对应的高斯渲染帧构建区域掩膜 MSE 损失,反向优化高斯场并密集初始化新高斯基元,形成两者的闭环对齐。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入单目视频与 4D 高斯骨干"] --> B["全景轨迹协同对齐<br/>反投影点云至球面全景域"]
    B --> C["固定几何引导的渐进式视点外推<br/>切向多轨迹迭代翘曲与扩散修复"]
    C --> D["掩膜引导的高斯几何蒸馏<br/>区域自适应 MSE 细化 4D 高斯场"]
    D --> E["大视角几何自洽 4D 场景渲染输出"]

关键设计

1. 全景轨迹协同对齐:打通生成先验训练与推理的空间域差异

以往的视点扩散模型在随机小轨迹上训练,而在大范围场景外推推理时需要大角度相机输入,训练与推理之间的域漂移会导致生成崩塌。PanoGaussian 提出统一的全景轨迹范式:在训练阶段,基于预训练 TrajectoryCrafter,在 OpenVid 大规模动态视频数据集上沿着固定的全景仰角与随机全景方向进行双重重投影,训练视频扩散先验感知全景视角的空间连续性与视差约束;在推理阶段,利用 4D 高斯骨干(MoSca)从单目输入帧 \(I_t\) 中提取时序深度 \(D_t\) 与相机参数 \([R_t, K_t]\),通过反透视投影解算世界空间 3D 点云 \(P_t = \Phi^{-1}([I_t, D_t], R_t, K_t)\)。以该点云中心 \(P^c = (x_c, y_c, z_c)\) 作为全景球面原点建立极坐标系 \((\phi, \theta)\),使初始视向严格对齐基准轴。这种训练与推理在统一全景几何协议下的协同设计,从根本上消除了生成先验跨视角推理时的几何不稳定性。

2. 固定几何引导的渐进式视点外推:从结构上阻断误差级联累积

直接使用扩散模型一次性生成大幅度偏航视角往往会导致内容撕裂与幻觉漂移,而自回归式级联外推则会导致先前生成的伪影被递归放大。针对此痛点,PanoGaussian 在全景球面上定义 \(M=8\) 个均匀分布的切向探索方向 \(d_m = (\cos(2\pi m / M), \sin(2\pi m / M))\),每个方向按固定角步长 \(\alpha=15^\circ\) 进行 \(E=6\) 次视点外推,累积旋转量由切向旋转轴 \(a_m\) 确定:

\[\mathbf{s}_{m,e} = \mathbf{n}\cos(e\alpha) + (\mathbf{a}_m \times \mathbf{n})\sin(e\alpha)\]

在每个扩展步 \(e\) 的图像翘曲(warping)过程中,算法严格采用原始真实视频帧 \(V_{\text{src,inf}}\) 结合冻结的 4D 高斯几何深度进行反投影与正向重采样,而非直接对上一步骤生成的幻觉图像进行二次翘曲。随后,生成未投影区域的二值掩膜 \(M_e\),将带有缺失空洞的中间视频 \(V_{e,\text{warped}}\) 送入视频扩散先验仅对掩膜区域执行内容修复与细节增强,生成精细化视频 \(V_{e,\text{refined}}\)。由于已知几何区域始终由可信观测源强约束,幻觉内容被严格隔离在未见区域,实现了结构层面的误差零累积。

3. 掩膜引导的高斯几何蒸馏与协同细化:物理先验与全局探索的双向闭环

全景投影生成的视频虽然补全了未见区域,但在非刚性物体运动时不可避免地伴随尺度与局部形变拉伸,缺乏严谨的 3D 刚性与运动连续性。为了将生成视频的外观与动态先验沉淀到显式物理结构中,PanoGaussian 引入掩膜细化正则化项。在每个高斯优化迭代周期内,通过光栅化从高斯场中渲染出沿外推轨迹 \(P_{e,t}\) 对应的预测视频 \(V_{e,\text{render}}\),并仅在未知区域二值掩膜 \(M_e\) 内计算均方误差损失:

\[\mathcal{L}_{\text{refine}} = \text{MSE}(M_e \cdot V_{e,\text{refined}},\, M_e \cdot V_{e,\text{render}})\]

在优化过程中,未见区域依据扩散补全的外观自适应密集化并初始化新的 3D 高斯基元,配合 MoSca 运动脚手架的刚性与平滑几何正则化项联合更新,无需依赖单帧深度估计网络的不稳定预测。每隔 2,000 次高斯迭代,系统根据更新后的 4D 高斯深度再次更新全景轨迹的几何引导,使显式高斯物理先验与扩散生成探索交替增益,最终输出统一且无畸变的 4D 动态场景。

损失函数 / 训练策略

扩散模型训练基于 OpenVid-1M 数据集,输入分辨率为 \(384 \times 672\)、时长 49 帧,仅微调 Ref-DiT 模块中的 cross-attention 与 patch embedding 权重,采用 AdamW 优化器,学习率为 \(2 \times 10^{-6}\),迭代训练 25,000 步。 场景测试时优化(Test-Time Adaptation)阶段,以预训练 MoSca 为 4D 高斯骨干,总优化步数为 10,000 次,掩膜细化损失权重 \(\lambda_{\text{refine}} = 0.1\)。每 2,000 步高斯迭代触发一次全景渐进外推先验更新。单场景优化耗时约 2.0 小时(其中 4D 高斯拟合占 1.4 小时,扩散生成占 0.6 小时),单场景高斯场推理渲染速度达 32.42 FPS。

实验关键数据

主实验

论文在极具挑战性的单目视频动态场景基准 DyCheck iPhone 数据集上进行了全面评测。评测指标除常规的全图指标(PSNR / SSIM / LPIPS)和共视区指标(mPSNR / mSSIM / mLPIPS)外,专门引入未观测区域指标(uPSNR / uSSIM / uLPIPS,在测试集视线与训练集非重叠区域计算),直接量化模型外推推理能力。

Table 1: Comparison with reconstruction-based and generation-based methods on the DyCheck iPhone dataset (原论文 Table 1 核心数据):

方法 类型 PSNR (dB) ↑ SSIM ↑ LPIPS ↓ mPSNR (dB) ↑ uPSNR (dB) ↑ uSSIM ↑ uLPIPS ↓
4D G.S. 传统重建 15.71 0.450 0.398 16.54 12.82 0.302 0.452
Shape-of-Motion 传统重建 16.79 0.510 0.391 17.32 14.84 0.321 0.448
MoSca 传统重建 17.31 0.573 0.354 19.32 14.23 0.295 0.461
Cat4D 扩散生成 15.91 0.427 0.398 17.39 14.06 0.351 0.428
TrajectoryCrafter 扩散生成 13.58 0.373 0.483 15.48 10.88 0.315 0.441
CogNVS 扩散生成 16.94 0.449 0.598 18.63 14.97 0.371 0.487
4DGT 前馈模型 15.04 0.446 0.423 16.12 12.11 0.301 0.450
PanoGaussian (本文) 全景高斯统一 18.71 0.598 0.323 19.85 16.72 0.495 0.385

在常规 Nvidia Dynamic 数据集(以视角内插为主)上,PanoGaussian 同样保持了领先的重建精度(原论文 Table 2):PSNR 达到 26.75 dB,LPIPS 为 0.069,优于 MoSca 的 26.72 dB / 0.070 和 4D G.S. 的 21.45 dB / 0.199,表明引入未观测区域外推先验丝毫不会削弱已知视角的保真度。

消融实验

论文在 DyCheck 数据集上对系统核心组件进行了逐一消融(原论文 Table 3 核心数据),并针对渐进外推步数进行了误差扩散稳定性分析(原论文 Table 4):

Table 3: Quantitative ablation on different components of the system on DyCheck dataset:

配置说明 PSNR (dB) ↑ SSIM ↑ LPIPS ↓ uPSNR (dB) ↑ uSSIM ↑ uLPIPS ↓ 说明
Full Model (PanoGaussian) 18.71 0.598 0.323 16.72 0.495 0.385 完整模型,所有指标达到最优
平面外推 + 4DGS (Planar with 4DGS) 16.47 0.550 0.377 14.25 0.302 0.445 缺失全景坐标,未见区 uPSNR 骤降 2.47 dB
全景外推无高斯细化 (Pano w/o 4DGS) 17.12 0.555 0.358 15.08 0.421 0.418 缺乏 3D 几何蒸馏,动态形变拉伸严重
去除全景轨迹预训练 (w/o Pano Training) 18.46 0.584 0.327 16.32 0.476 0.397 扩散先验未对齐全景协议,大角度下产生畸变
去除渐进式扩展 (w/o Progressive Exp.) 17.51 0.576 0.351 15.22 0.446 0.417 一步到位外推导致生成破碎和几何错位
完全去除高斯泼溅 (w/o Gaussian Splatting) 14.67 0.392 0.445 12.61 0.314 0.482 纯 2D/全景视频流,缺乏空间连贯物理结构

Table 4: 渐进扩展步数下的误差稳定性分析(原论文 Table 4):

外推步数 (Expansion Step) 6 步 12 步 18 步 24 步
全局 PSNR / 未见区 uPSNR (dB) 18.71 / 16.72 18.72 / 16.74 18.69 / 16.68 18.68 / 16.66

关键发现

  • 全景与高斯的协同是性能基石:完全去除高斯显式表征后,PSNR 暴跌 4.04 dB,uPSNR 暴跌 4.11 dB;而去除全景几何改为平面外推后,未观测区域 uPSNR 也直降 2.47 dB,表明全景提供全局覆盖、高斯提供物理刚性约束,二者缺一不可。
  • 结构化设计彻底切断误差级联传递:从 Table 4 可以看到,随着外推步数从 6 步大幅增加到 24 步,uPSNR 维持在 16.72 dB 至 16.66 dB 的窄幅区间内,波动低于 0.08 dB。这有力地印证了“采用原始观测固定深度几何进行翘曲、掩膜限定局部损失”这一设计的有效性,证明渐进外推未引入误差累积。

亮点与洞察

  • 将生成先验与显式几何在全景协议下统一:过往工作要么让 3DGS 强行插值产生空洞,要么让视频扩散模型自由发挥导致几何扭曲。PanoGaussian 找到了全景坐标这一优雅的桥梁,既具备 360° 视网膜式视场,又通过 3D 点云球心反投影与显式高斯无缝咬合。
  • 避免多轮重生成误差扩散的掩膜翘曲隔离机制:在长距离轨迹外推中,大多数自回归管线都会因为“用生成物作为下一次输入”而崩塌。本文始终以原始单目帧和稳健高斯深度为几何锚点,将扩散模型的职责精准限定在“缺失掩膜内部补全”,这一设计思想极具工程通用性。
  • 测试时代价合理的协同蒸馏:借助高效的 3DGS 光栅化与轻量化掩膜细化损失,单场景总优化时间仅需约 2.0 小时,远低于 Shape of Motion 的 4.2 小时,展现了极佳的实用化潜力。

局限与展望

  • 向外发散视角的约束减弱:论文明确指出,该方案在以物体为中心的向心环绕拍摄场景(inward-facing)表现最佳;对于向外发散或视野深度极大的开阔场景,远景缺乏足够的多视角共视几何锚点,外推边界质量有所下滑。
  • 对视频生成先验的质量依赖:虽然高斯场提供了物理约束,但未见区域的纹理真实度与动态合理性仍上限于底层视频扩散模型的能力,扩散模型偶发的时序闪烁或语义幻觉可能渗入高斯场。
  • 端到端加速与实时化探索:单场景仍需约 2.0 小时的测试时优化,尚不能支持交互式实时漫游创建;未来探索免逐场景优化的全景前馈 Transformer 架构将是重要的演进方向。

相关工作与启发

  • vs MoSca / Shape of Motion 等 4D 重建方法:此类方法依靠单目先验与低维运动流建模动态场景,但在视线不可见的盲区完全失效(在 DyCheck 上生成大片白色空洞);PanoGaussian 借助全景扩散先验成功跨越了“仅内插”到“兼顾外推”的鸿沟。
  • vs TrajectoryCrafter / CogNVS 等可控视频生成模型:此类方法能沿相机轨迹外推,但缺乏全局 3D 几何一致性,大角度下建筑物与人体严重扭曲变形;PanoGaussian 通过将生成视频反向蒸馏至 3D 动态高斯基元,确保了多视角漫游下的结构刚性与时序连贯性。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次将全景轨迹范式与动态高斯泼溅紧密结合,系统性解决了单目 4D 动态场景大视角未观测区域合成的难题。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 DyCheck、Nvidia、Kubric-4D 及野生视频,设计了独立的未观测区域度量指标与渐进扩展稳定性分析,消融扎实。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,图文对照清晰,动机阐述直指现有痛点与核心矛盾。
  • 价值: ⭐⭐⭐⭐⭐ 为单目视频 4D 场景重建扩展至 360° 全景沉浸式漫游与数字孪生提供了极具参考价值的范式。