跳转至

Minute4D: Training High-Fidelity 4D Gaussian Splatting in One Minute

会议: ECCV 2026
论文: ECCV 2026
领域: 3D 视觉
关键词: 4D高斯泼溅, 动态新视角合成, 单目动态重建, 密度控制, 3D点追踪

一句话总结

针对非受限单目视频动态三维重建中相机与物体运动耦合、视角覆盖匮乏及优化极其缓慢的痛点,Minute4D 结合基础模型驱动的分割追踪几何补全与多视角光度误差引导的 4D 高斯自适应密度控制,将 4D 高斯泼溅优化耗时压缩至约 40 秒(提速超 5 倍),并在渲染保真度与显存开销上刷新 SOTA。

研究背景与动机

从日常手持设备拍摄的无标定随手拍视频中重建 4D 动态场景并合成高质量自由新视角,是机器人导航、自动驾驶和虚拟/增强现实的核心使能技术。然而,单目动态视频的重建极具挑战:移动相机与非刚性运动物体的耦合使得传统运动恢复结构(SfM)无法稳定估计相机姿态;动态物体的频繁自遮挡导致单帧投影存在严重的几何缺失;更关键的是,现存隐式神经辐射场(NeRF)以及基于形变场扩展的 4D 高斯方法往往需要数小时甚至数天的耗时训练,即使是最新的高效工作(如 Instant4D)仍需数分钟,且容易陷入单帧过拟合。

这一困境的核心矛盾在于:单帧深度反投影得到的几何点云缺乏跨时间维度的对应关联,导致 4D 高斯基元仅能机械地过拟合到单帧可见区域,在未观测或遮挡视角下留下严重的几何空洞与撕裂伪影;而在高斯演化过程中,传统基于单帧梯度的分裂与剪枝机制会引入海量的冗余高斯球,导致显存膨胀与计算浪费,极大地制约了 4D 场景重建的收敛速度。

为了破除上述几何不完整与优化低效的瓶颈,本文提出一种全新的单目 4D 高斯极速重建范式。核心 idea:利用 SAM2 语义先验与 TAPIP3D 持续 3D 点追踪联合补全遮挡区域的动态几何骨架,并构建融合时序边缘概率与多视角绝对光度误差的自适应密度控制策略,在彻底消除高斯冗余的同时实现一分钟内的极速高保真 4D 泼溅收敛。

方法详解

整体框架

Minute4D 的全流程以任意无标定单目视频序列 \(I = \{I_i\}_{i=1}^N\) 作为输入,目标是构建显式 4D 高斯场景表征,以支持在任意时间戳 \(t^*\) 和任意相机位姿 \(P^* \in SE(3)\) 下的高保真实时渲染。整个系统由预处理几何恢复、分割-追踪几何增强模块、以及损失引导的 4D 高斯密度控制优化三大部分串联组成。

首先,系统通过深度视觉 SLAM 框架 MegaSaM 联合解算相机外参、内参、逐帧度量深度以及运动概率图,由深度反投影与体素网格哈希降采样生成初始粗糙点云。随后,分割-追踪几何增强模块利用 SAM2 精细化运动分割掩码,并借助 TAPIP3D 预测动态点的三维全时程轨迹,将跨帧可见的几何结构回填至当前帧被遮挡区域,生成几何完整的高质量增强点云作为 4D 高斯初始基元。最后,在 4D 高斯泼溅参数优化过程中,系统周期性采样多帧视图计算光度误差图,根据时序边缘分布权重对高斯基元分配致密化与剪枝得分,自适应控制高斯数量并剔除冗余,最终实现极低显存占用与极速收敛。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["单目动态视频输入<br/>无标定/非受限连续帧"] --> B["MegaSaM 几何初始化<br/>解算相机位姿/深度/运动概率"]
    B --> C["分割-追踪几何增强<br/>SAM2 语义细化掩码 + TAPIP3D 跨帧点轨迹补全"]
    C --> D["4D 高斯场景表征构建<br/>4D 协方差 + 4D 柱面谐波函数初始化"]
    D --> E["损失引导密度控制<br/>多视角光度误差图 + 时序高斯权重精准致密化与剪枝"]
    E --> F["高保真 4D 场景呈现<br/>40 秒极速收敛 / >1200 FPS 实时渲染"]

关键设计

1. 分割-追踪几何增强:跨帧对应与遮挡区域几何补全 单目视频中运动物体往往存在频繁的自遮挡或视角盲区。如果直接像此前方法那样仅依据单帧深度反投影生成点云,4D 高斯基元将严重缺乏全局一致性,导致视角切换时出现空洞与闪烁伪影。为了提供完备的几何初始化,该设计先对 MegaSaM 预测的运动概率图设定阈值 \(\tau_{motion}=0.7\) 得到粗糙运动掩码,以第一帧粗掩码的前景像素作为提示词送入 SAM2 进行跨帧实例追踪;为捕获后续帧中新出现的动态目标,每隔 \(B\) 帧从后续粗掩码中减去已有追踪掩码,将残差新区域再次送入 SAM2 补充追踪,获得时间连贯的高精度精细掩码 \(M^r\)。

在完成动静态解耦后,该模块利用预训练 3D 点追踪模型 TAPIP3D 对动态区域点云进行显式轨迹追踪。为了避免全像素密集查询带来的算力负担,该模块以固定步长均匀采样动态点作为查询锚点 \(y_{i^*}\),批量预测其贯穿整个视频时间序列的完整三维轨迹 \(\{y_i\}_{i=1}^N\): $$ {y_i}{i=1}^N = f\phi(X, y_{i^}), \quad i^ \in {1, \ldots, N} $$ 通过将各采样点的时间跨帧轨迹与原始点云 \(X\) 取并集,构建出补全了遮挡部分几何细节的增强点云 \(X' = \bigcup_y \{y_i\}_{i=1}^N \cup X\)。由于同一物体在不同时刻暴露的不同表面被显式缝合到了整个时间轴上,4D 高斯在初始化阶段就具备了精准且完整的空间结构,从根源上杜绝了帧间过拟合。

2. 损失引导密度控制:多视角误差与时序加权的高斯数量自适应调控 传统 3D/4D 高斯泼溅通常依据单帧视图下的屏幕空间位置梯度模长来决定高斯的克隆或分裂,而剪枝仅粗暴针对极低不透明度或过大尺寸。这种单视角、纯梯度的启发式策略极其容易产生大量无效高斯基元,引发显存暴涨与优化迟滞。针对该瓶颈,Minute4D 提出一种完全基于多视角渲染光度平均绝对误差(MAE)的自适应调控机制。在致密化触发步,随机抽取 \(K=10\) 帧真实图像与渲染图像计算逐像素误差图 \(e_i^{u,v} = \mathbb{E}_c | \hat{I}_i^{u,v} - \bar{I}_i^{u,v} |\),经 Min-Max 归一化并以阈值 \(\tau_{error}=0.1\) 过滤掉低误差背景噪声,获得精炼误差图 \(E_i^{refined} = E_i \odot \mathbb{I}(\text{Normalize}(E_i) > \tau_{error})\)。

将三维中心为 \(\mu_j\) 的 4D 高斯 \(G_j\) 投影至采样帧获得 2D 投影覆盖范围 \(\Omega_i^j\)。考虑到 4D 高斯在时间维度上的边缘分布符合一维正态分布 \(p^j(i) = \frac{1}{\sqrt{2\pi}\sigma_t^j} \exp\left(-\frac{(i-\mu_t^j)^2}{2(\sigma_t^j)^2}\right)\),该高斯在不同时间戳对画面的几何影响力显著不同。因此,致密化得分被定义为以该高斯时间边缘概率为权重的多视角精炼误差累加均值: $$ s_{den}^j = \frac{1}{K} \sum_{i=1}^K \sum_{q \in \Omega_i^j} p^j(i) \cdot E_i^{refined}(q) $$ 当 \(s_{den}^j > \tau_{den}\)(设为 0.001)时触发分裂与复制。对于高斯剪枝,该设计进一步引入多视角光度复合损失 \(L^i = (1-\lambda) L_1^i + \lambda L_{SSIM}^i\) 作为帧级衰减退化权重,定义剪枝得分为: $$ s_{pru}^j = \text{Normalize}\left( \sum_{i=1}^K \left( \sum_{q \in \Omega_i^j} p^j(i) \cdot E_i^{refined}(q) \right) \cdot L^i \right) $$ 若 \(s_{pru}^j > \tau_{pru}\)(设为 0.009),说明该高斯持续落在高误差且图像质量恶化的区域,无法有效重建有效纹理,直接予以彻底剔除。该策略将高斯基元数量精准约束在必要几何表面上,实现了高达 13 倍的优化提速和近 9 倍的显存压缩。

损失函数 / 训练策略

在 4D 高斯优化阶段,网络监督信号完全由单目输入视频序列的真实帧提供。损失函数采用复合光度损失,由像素级 \(L_1\) 绝对误差与结构相似性误差 \(L_{SSIM}\) 加权求和: $$ L_{total} = (1 - \lambda) L_1(\hat{I}i, \bar{I}_i) + \lambda L_i) $$ 其中超参数 }(\hat{I}_i, \bar{I\(\lambda\) 设定为 0.2。整个优化过程极为紧凑:在 Dycheck iPhone 和 DAVIS 数据集上仅需迭代 5,000 步,在 NVIDIA Dynamic 数据集上仅需迭代 1,500 步。整个训练过程在单张 NVIDIA A6000 GPU 上耗时仅数十秒即可彻底收敛,无需预先离线运行耗时数小时的 COLMAP 位姿标定。

实验关键数据

主实验

论文在真实手持采集的 Dycheck iPhone 数据集(包含强视差与非刚性运动)以及 NVIDIA Dynamic 数据集(多相机稀疏采样的动态场景)上展开了系统性评测。在 Dycheck iPhone 数据集上,无标定条件下 Minute4D 相比此前最佳的 Instant4D(Full) 实现了 +1.25 dB 的 PSNR 飞跃,同时优化时间从 0.12 小时(约 7.2 分钟)大幅压缩至 0.008 小时(约 28.8 秒),显存从 8 GB 压减至 1.0 GB。

在 NVIDIA Dynamic 数据集上,Minute4D 取得了所有 Pose-free(基于 Visual SLAM)方法中的最高渲染质量(PSNR 24.73 dB),不仅训练速度领先(0.006 小时,约 21.6 秒),其推理渲染帧率更高达 1218 FPS。

方法 相机标定方式 Dycheck PSNR (dB) ↑ NVIDIA PSNR (dB) ↑ 训练耗时 Runtime (h) ↓ 峰值显存 Mem (GB) ↓ 渲染帧率 FPS ↑
D-NeRF Ground Truth 21.50 - > 24 12 < 1
RoDynRF Ground Truth 16.80 25.89 (COLMAP) 22 15 0.42
4D-GS Ground Truth / COLMAP 21.64 21.45 1.2 21 43
Deform3D Ground Truth 22.63 - - - -
RoDynRF (w/o pose) 无标定 (联合优化) 14.90 - 22 15 -
RoDyGS 视觉几何模型 (MASt3R) 17.37 - 1.0 - -
4DGS* Visual SLAM - 18.34 0.16 - 98
InstantSplat* Visual SLAM - 22.56 0.15 - 117
Instant4D (Lite) Visual SLAM (MegaSaM) 23.02 - 0.03 1.1 -
Instant4D (Full) Visual SLAM (MegaSaM) 24.52 23.99 0.12 / 0.02 8.0 822
Minute4D (本文) Visual SLAM (MegaSaM) 25.77 24.73 0.008 / 0.006 1.0 1218

消融实验

消融实验在 Dycheck iPhone 数据集上定量验证了各个核心模块的有效性。去除分割-追踪几何增强模块(w/o Seg-Track)导致 PSNR 从 25.77 dB 剧跌至 24.60 dB(下降 1.17 dB),SSIM 从 0.717 下滑至 0.628,证明跨帧轨迹补全对恢复动态物体完整几何至关重要;而去除损失引导密度控制(w/o Loss-Guided)后,渲染质量虽微弱变动,但训练耗时从 29.22 秒骤增至 397.73 秒(暴增超 13 倍),峰值显存从 1088 MB 暴涨至 9406 MB(膨胀近 9 倍),有力佐证了该密度控制策略在压制高斯冗余与实现极速优化上的决定性价值。

配置 PSNR (dB) ↑ SSIM ↑ 优化时间 Runtime (s) ↓ 峰值显存 Mem (MB) ↓ 说明
完整模型 (Full Settings) 25.77 0.717 29.22 1088 完整模型:高保真且 29 秒极速收敛
去除分割-追踪增强 (w/o Seg-Track) 24.60 0.628 31.78 1064 质量明显跌落(-1.17 dB),遮挡面产生明显空洞与伪影
去除损失引导密度控制 (w/o Loss-Guided) 25.74 0.694 397.73 9406 耗时暴增 13.6 倍,显存膨胀 8.6 倍,累积海量冗余高斯

关键发现

  • 双模块互补闭环:几何增强模块专精于“几何完整性(提升上限)”,而损失引导密度控制专精于“去冗余与极速收敛(压低成本)”,二者结合使得单目 4DGS 首次在 1 分钟算力预算下兼得优于离线复杂方案的保真度。
  • 动态遮挡区域修补效果显著:定性结果(如风车叶片、奔跑骆驼、跳跃人像)显示,传统方法在物体运动旋转时由于单帧缺失导致渲染断裂或模糊,而 Minute4D 能完整保留边缘与动态面。
  • 超强时序渲染效率:在维持极高质量重建的同时,高斯基元总数的自适应收敛使得渲染速度飙升至 1218 FPS,为动态场景在新视角下的低延迟交互式预览与实时推流提供了现实可行性。

亮点与洞察

  • 基础模型几何先验与可微渲染的优雅解耦:将重型模型(SAM2、TAPIP3D)的推断局限在离线快速预处理阶段,仅仅为高斯提供高完备度的点云脚手架,而把高斯泼溅本身的优化控制在 5000 步以内轻量级迭代,兼具了大模型的泛化性与显式光栅化的极速特性。
  • 时间边缘概率加权的时空自适应密度控制:改变了以往仅看空间梯度的局限,将 4D 高斯的时序高斯分布方差与均值作为时间权重引入误差投影,使高斯分裂与修剪更具物理意义,是 4D 高斯演化机制的重要技术贡献。

局限与展望

  • 对 SLAM 位姿估计与深度质量存在前置依赖:算法强依赖 MegaSaM 的前置位姿与深度输出,若输入视频存在极端运动模糊、完全纹理缺失或超大范围剧烈动态遮挡导致 SLAM 跟踪失败,下游的几何增强与高斯渲染质量将受牵连。
  • 长序列与拓扑形变极端场景的扩展性:当前实验主要针对百帧级别的日常短视频片段,针对数千帧的超长动态场景,固定频率的采样追踪与全局 4D 高斯管理仍需引入层次化时序分块(Temporal Partitioning)架构。

相关工作与启发

  • vs Instant4D: Instant4D 同样采用 MegaSaM 进行初始化并在数分钟内训练,但其直接依据每帧深度反投影初始化高斯,缺乏帧间对应关系,极易导致单帧过拟合;Minute4D 通过 SAM2+TAPIP3D 补全遮挡轨迹,并用光度误差与时序正态分布引导密度控制,优化速度提速超 5 倍且 PSNR 高出 1.25 dB。
  • vs 4D-GS (Wu et al.) / Deformable 3DGS: 后者通常基于空间形变场(MLP 或 HexPlane),形变网络的连续反向传播计算代价沉重,训练常需 1-2 小时;Minute4D 采用显式时间维度的 4D 高斯与直接多视角光度误差剪枝,不仅免除了形变网络开销,更摆脱了 COLMAP 离线标定的枷锁。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 巧妙融合 2D 基础分割与 3D 点追踪弥补单目动态自遮挡缺陷,并提出了基于时序加权误差图的 4D 高斯密度控制。
  • 实验充分度: ⭐⭐⭐⭐⭐ 覆盖 Dycheck iPhone、NVIDIA Dynamic 及 DAVIS 三大权威基准,速度、显存、渲染帧率与画质多维度指标扎实。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,图文对照自洽,方法论阐述与数学公式简洁清晰。
  • 价值: ⭐⭐⭐⭐⭐ 首次将单目无标定动态 4DGS 重建优化时间压缩至数十秒级别并实现实时渲染,对动态 3D 生成与移动端具身视觉落地具有重大实用价值。