跳转至

PASTEL: Panoramic Alignment for Monocular 4D Scene Reconstruction

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/LogosRoboticsGroup/PASTEL
领域: 3D视觉
关键词: 单目4D重建、全景对齐、生成先验、轨迹规划、高斯泼溅

一句话总结

PASTEL 将单目动态视频的相机外推从难以求解的高维 3D 笛卡尔空间转化到结构化的 2D 全景球面域,通过自适应外推轨迹与动静解耦投影引导视频扩散先验,并利用不可见与不可靠区域掩码实施策略性监督,实现了高几何一致性的无边界 4D 场景重建。

研究背景与动机

从随手拍摄的单目视频中重建具备几何一致性与运动连贯性的 4D 动态场景,是虚拟现实(VR)和具身智能(Embodied AI)的基础技术支撑。近年来,以 4D 高斯泼溅(4D GS)和神经辐射场(NeRF)为代表的动态新视角合成方法在多视角输入下取得了突破性进展。然而,当输入退化为单目视频时,现有方法面临着视场角(FoV)有限与严重自遮挡的固有瓶颈:纯重建类算法完全依赖输入像素的监督信号,根本无法推断摄像机可视范围之外的“不可见区域”(Invisible Regions),导致在大位移视角漫游时场景边界断裂、内容缺失。

为了填补不可见区域,一种直观思路是引入基于相机控制的视频生成扩散模型作为生成先验(Generative Priors)进行画面外推(Outpainting)。然而,扩散去噪固有的随机性会导致纹理细节跳变甚至全局色调漂移,直接将其伪标签注入 4D 高斯重建会引发剧烈的多视角几何冲突与鬼影伪影;更关键的是,相机偏离原视频轨迹越大,生成先验需要凭空脑补的内容就越多,伪影也越严重。因此,外推轨迹的选取必须在“最大化探索未知区域”与“最小化视角偏离及视角重叠”之间达成精密平衡。

如果直接在未受约束的 3D 笛卡尔空间中寻找包含 \(L\) 个视点的 \(M\) 条平滑相机轨迹,算法需要联合优化规模达 \(M \times L \times 4 \times 4\) 的庞大参数矩阵,这使得轨迹规划陷入病态的高维搜索空间,极易陷入断裂或局部重叠的次优视角。核心 idea:将不可解的高维 3D 笛卡尔场景探索重构为球形 2D 全景空间中的方向性连续扩展,利用全景域确定的可见性边界自适应规划平滑外推轨迹,结合动静聚合翘曲为扩散先验提供几何约束,并通过不可见与不可靠双重置信度掩码进行策略性伪监督优化。

方法详解

整体框架

PASTEL 的核心在于将 3D 空间中离散视锥的探索转化为连续全局全景域中的确定性规划与蒸馏。整个流程由单目预处理与全景对齐、全景自适应轨迹规划、动静解耦全视场扩展、以及策略性掩码蒸馏监督四个阶段串联而成。输入为单目视频序列及预先估计的单目深度、相机位姿与光流动态掩码;输出为经扩散生成先验补全、可在宽基线视角下连贯漫游的 4D 运动支架(Motion Scaffolds)表征。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["单目视频输入<br/>RGB帧 + 深度估计 + 相机位姿 + 动态掩码"] --> B["全景场景重构与球面中心滤波<br/>反投影至3D点云,百分位去噪求中心并映射至2D球面全景"]
    B --> C["自适应外向轨迹规划<br/>2D全景等角度射线 + 深度安全约束R + SLERP插值生成平滑轨迹"]
    C --> D["动静解耦全视场外推<br/>静态点云时序合并与动态单帧翘曲,合成基准指导视频"]
    D --> E["视频扩散生成先验精修<br/>以翘曲视频为条件进行受限去噪,生成外推候选视频"]
    E --> F["策略性置信度监督<br/>识别视锥外不可见掩码与低SSIM不可靠掩码,定向约束4D重建"]
    F --> G["高质量无边界4D场景输出<br/>3D/4D高斯泼溅连续渲染"]

关键设计

1. 全景场景重构与球面中心滤波:从高维笛卡尔到连续2D球面的降维

传统的轨迹搜索必须在全 3D 笛卡尔空间中枚举 6-DoF 外参矩阵,计算复杂度随轨迹长度急剧膨胀且极易生成不合理的视点。PASTEL 改变坐标基准,将全时序观测投影到球形全景域中。系统首先利用估计的深度图与相机内外参将单目 \(T\) 帧视频反投影到世界坐标系生成 3D 点云序列。为了避免近处动态前景对象对几何球心产生严重偏移干扰,算法先过滤掉深度值最小的 30% 点云,再对剩余点求均值确定稳健的场景全景球心 \(P_c = (x_c, y_c, z_c)\)

随后,所有 3D 点 \(p_t^j = (x_t^j, y_t^j, z_t^j)\) 依据极坐标变换重新投影到全景平面: $\(\theta_t^j = \operatorname{atan2}(y_t^j - y_c, x_t^j - x_c), \quad \phi_t^j = \arcsin\left(\frac{z_t^j - z_c}{\|p_t^j - P_c\|_2}\right)\)$ 再线性缩放为分辨率 \(w_p \times h_p\) 的全景图像素坐标 \((u_t^j, v_t^j)\)。通过这一投影,每帧图像覆盖的视锥在全景域中退化为连续的点集 \(\mathcal{M}_t\)。高维的 6-DoF 相机位姿搜索被压缩为全景球面二维切平面上的方向性连续射线搜索,使不可见区域的边界具备了全局几何明确性。

2. 自适应外向轨迹规划与安全深度约束:最大化探索边界与最小化视角偏差

在全景投影域中,系统沿圆周均分 \(M\) 个扩展方向 \(d_m = (\cos(2\pi m / M), \sin(2\pi m / M))\),从而保证全方位探索且轨迹间重叠最小。针对每个方向 \(d_m\),必须选定一个起始相机视点作为外推基底。为防止起始视点距离前景运动物体过近造成穿模、遮挡或几何奇异,PASTEL 引入了依赖于场景中位深度的安全有效半径约束 \(R = \operatorname{median}(\|p - P_c\|_2) \cdot \tan(\alpha)\),其中 \(\alpha\) 为角步长。

算法在满足安全距离的点集 \(\Omega_R\) 内,选取投影内积最大的观测点对应相机作为起始相机 \(c_m\): $\(c_m = \arg\max_{t} \max_{j \in \Omega_R} \left[ \left(u_t^j - \frac{w_p}{2}\right) d_{m,u} + \left(v_t^j - \frac{h_p}{2}\right) d_{m,v} \right]\)$ 确定起始视点后,沿方向 \(d_m\) 在全景空间推进并反向映射回 3D 空间获取外推相机位置,其姿态强制对准球心 \(P_c\)。最终,在新相机 \((\tilde{R}_{t,m}, \tilde{\mathbf{t}}_{t,m})\) 与原始视频相机 \((R_t, \mathbf{t}_t)\) 之间采用球面线性插值(SLERP)处理旋转、线性插值处理平移,生成 \(L\) 帧平滑相机轨迹。这种设计规避了突变跳跃,为后续扩散先验提供了极其稳定的几何条件。

3. 动静解耦的全视场外推与策略性置信度监督:隔离生成幻觉的掩码蒸馏

获取新相机轨迹后,直接送入扩散模型仍会导致背景闪烁。PASTEL 提出动静解耦的几何前馈策略:利用光流动态掩码分离静态背景点云 \(\mathcal{P}_t^{\text{static}}\) 与前景动态点云。所有时间步的静态点云在世界坐标下合并为全局致密背景 \(\bigcup_{t=1}^T \mathcal{P}_t^{\text{static}}\) 并投影到新轨迹视角生成静态图像 \(I_t^{\text{static}}\);动态点云则按对应帧单帧翘曲生成 \(I_t^{\text{moving}}\),融合构成翘曲视频 \(I_t^{\text{warped}} = I_t^{\text{static}} \cup I_t^{\text{moving}}\)。该翘曲视频作为刚性几何锚点送入受控视频扩散模型(TrajectoryCrafter)生成修复视频 \(\tilde{V}'\)

为防止扩散模型天生带有的光照色差或结构幻觉破坏已建好的高质量区域,PASTEL 构建了双重置信度掩码进行策略性监督: - 不可见掩码 \(M_t^{\text{invisible}}\):标记翘曲帧中空缺无像素区域(无效值记为 -1); - 不可靠掩码 \(M_t^{\text{unreliable}}\):计算 4D 高斯渲染图与几何翘曲图之间的结构相似性,判定 \(\operatorname{SSIM}(I_t^{\text{render}}, I_t^{\text{warped}}) < \epsilon\)(默认 \(\epsilon = 0.3\))的边缘和遮挡失真区域。

最终重建时,仅对两类掩码的并集 \(M_t^{\text{refine}} = M_t^{\text{invisible}} \cup M_t^{\text{unreliable}}\) 施加生成视频的监督损失: $\(\mathcal{L}_{\text{refine}} = \mathcal{L}_{\text{rgb}}(M_t^{\text{refine}} \cdot I_t^{\text{render}}, M_t^{\text{refine}} \cdot I_t^{\text{refined}})\)$ 该策略将扩散模型严格限制在盲区与失真区,牢固保护了单目输入原生区域的保真度。

损失函数 / 训练策略

PASTEL 底层采用 4D 运动支架(MoSca)表征,优化共进行 6000 步。总监督目标由两部分组成:在原生观测视角下采用标准 4D 高斯泼溅的光度与几何正则化监督;在规划的外推轨迹视角下采用精修损失 \(\mathcal{L}_{\text{refine}}\) 进行伪监督。预处理(单目深度 UniDepth、点追踪位姿 BootsTAPIR 与 RAFT 光流)耗时约 5 分钟,轨迹展开与 TrajectoryCrafter 生成耗时约 10 分钟,场景联合优化耗时约 1.5 小时,渲染速度达到 38 FPS。

实验关键数据

主实验

在单目动态场景基准 DyCheck IPhone 数据集上评估。该数据集提供共视掩码(covisibility mask),除了常规共视区域指标(mPSNR, mSSIM, mLPIPS)外,本文特别评估了涵盖相机视锥外不可见区域的全局全图指标(PSNR, SSIM, LPIPS)。

原论文 Table 1 对比如下(Rec. 表示重建时间/小时,FPS 表示渲染帧率):

方法 类型 PSNR↑ SSIM↑ LPIPS↓ mPSNR↑ mSSIM↑ mLPIPS↓ Rec. (h) FPS
4D GS 纯重建 15.71 0.450 0.398 16.54 0.594 0.347 1.2 44
Shape-of-Motion 纯重建 16.79 0.510 0.391 17.32 0.598 0.296 2.0 40
MoSca 纯重建 17.33 0.572 0.355 19.32 0.706 0.264 1.3 38
USPLAT4D 纯重建 17.63 0.583 0.341 19.63 0.716 0.250 - -
Cat4D 生成先验 15.91 0.427 0.398 17.39 0.607 0.341 - -
TrajectoryCrafter 纯生成 12.71 0.324 0.519 14.24 0.417 0.519 - -
CogNVS 生成先验 15.42 0.362 0.689 16.94 0.449 0.598 - -
PASTEL (本文) 全景对齐+先验 18.54 0.582 0.335 19.75 0.739 0.247 1.5 38

在更大视角位移的 Kubric-4D 数据集上(原论文 Table 2),PASTEL 全图 PSNR 达到 22.75 dB(优于 CogNVS 的 22.63 dB 与 TrajectoryCrafter 的 20.93 dB),LPIPS 降低至 0.212(优于 CogNVS 的 0.232),验证了广角大位移下的外推能力。

消融实验

原论文 Table 3 在 DyCheck 数据集上系统消融了各模块的有效性:

配置 PSNR↑ SSIM↑ LPIPS↓ mPSNR↑ mSSIM↑ mLPIPS↓ 说明
完整模型 (Full model) 18.54 0.582 0.335 19.75 0.739 0.247 完整系统表现最佳
移除全景改为线性外推 15.73 0.497 0.370 19.42 0.728 0.249 缺少全景结构,全图 PSNR 剧降 2.81 dB
笛卡尔空间 Top-K 采样 17.31 0.548 0.352 19.55 0.733 0.251 从 100 条随机轨迹中选覆盖率最高仍落后 1.23 dB
移除轨迹对齐平滑插值 17.87 0.572 0.342 19.57 0.736 0.247 突变视点导致生成先验抖动,全图指标下跌
移除动静解耦视场扩展 17.44 0.564 0.357 19.45 0.733 0.250 背景缺少时序聚合,扩散模型产生几何幻觉
移除策略性监督 14.09 0.306 0.548 14.80 0.506 0.445 扩散幻觉全局污染,PSNR 暴跌 4.45 dB

关键发现

  • 策略性监督是整个系统稳定收敛的生命线:若不加选择地接受视频生成模型的全图输出,模型所有指标出现崩溃式下跌(PSNR 从 18.54 dB 跌至 14.09 dB,LPIPS 恶化至 0.548)。这表明扩散模型固有的色彩偏差与几何幻觉如果无差别渗透到原生可视区,将彻底摧毁 4D 重建的高频细节。
  • 全景球面域远胜笛卡尔空间启发式搜索:即使在 3D 笛卡尔空间随机生成 100 条轨迹并选出覆盖最大的 Top-K 轨迹(Cartesian-TopK),全图 PSNR 仍比全景方案低 1.23 dB;若采用简单的沿原视线线性推进,PSNR 骤降 2.81 dB。全景域为轨迹生成提供了全局拓扑连续性,保证了多轨迹探索互不遮挡、均匀向外。

亮点与洞察

  • 空间重构的巧思:没有陷入在庞大高维笛卡尔矩阵中用数值优化强行解相机的泥潭,而是换位思考将场景映射为 2D 连续全景,使“哪里看得见、哪里看不见、往哪走能探知更多”变成一目了然的射线规划问题。
  • 动静点云时序汇聚作为生成硬锚点:利用动态掩码将多帧静态背景“积攒”成更大范围的全局点云,为扩散模型提供了极具鲁棒性的边界外底图,大幅降低了扩散生成盲目幻想空无一人场景的随机度。
  • 双重置信度掩码设计:将 SSIM 结构相似度作为动态质量过滤器,与几何可见性掩码结合,形成对外部生成先验的“安全隔离区”,既吃到了扩散模型天马行空脑补边缘的红利,又免受幻觉污染原生高精度的代价。

局限与展望

  • 对单目几何前置估计的依赖:流程依赖 UniDepth、BootsTAPIR 和 RAFT 等前置模型的质量,极度反光、低光照或深度估计大范围崩溃的序列可能导致全景反投影点云畸变。
  • 外推距离存在物理上限:由于轨迹始于可视边界且朝向场景中心倾斜,当前方案主要胜任视锥外向环绕或中等范围外推,对于大纵深穿透到完全被阻挡的深层封闭房间内部仍存在探索瓶颈。
  • 离线两阶段耗时:依赖生成模型产生引导视频并在 4D GS 上进行多轮伪监督优化,难以做到实时重建与交互式动态生成。未来可结合端到端可微全景前馈网络加速这一管线。

相关工作与启发

  • vs MoSca [16] / USPLAT4D [8]:二者为当前顶尖的单目 4D 高斯纯重建方法,但重建边界死死受限于输入视频视锥,视锥外空洞或拉伸严重;PASTEL 以 MoSca 为骨架,通过全景规划引入受控扩散先验,全图 PSNR 较 MoSca 提升 1.21 dB,较 USPLAT4D 提升 0.91 dB。
  • vs Cat4D [31] / CogNVS [4] / TrajectoryCrafter [35]:基于扩散先验的新视角合成方法具有强大的外推能力,但由于去噪随机性,多视角合成缺少严格的三维/四维几何约束,直接渲染时频繁闪烁且存在色差;PASTEL 将生成模型限制在全景几何翘曲锚点与掩码蒸馏管线中,兼顾了生成创造力与几何物理一致性。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ [将单目4D未见区域外推降维到2D全景域进行平滑轨迹规划,构思巧妙新颖]
  • 实验充分度: ⭐⭐⭐⭐⭐ [在DyCheck、Kubric-4D和复杂运动自遮挡真实场景上全面测评,消融细致深刻]
  • 写作质量: ⭐⭐⭐⭐⭐ [公式推导精炼,核心动机叙述流畅,图表传达清晰准确]
  • 价值: ⭐⭐⭐⭐⭐ [为将扩散生成先验无缝集成进单目动态三维/四维重建提供了极具启发性的通用设计范式]