跳转至

MoBa-GS: Learning a Spatially-Varying Motion Basis over a Dynamic Canonical Space for 4D Reconstruction

会议: ECCV 2026
论文: CVF Open Access
代码: https://github.com/tgy1221/MoBa-GS
领域: 3D 视觉
关键词: 4D重建、3D高斯泼溅、运动基底分解、动态规范空间、非刚性形变

一句话总结

MoBa-GS 通过提出由时间基底转向空间变化运动基底的结构倒置范式,将 4D 高斯形变解耦为低频动态规范空间与局部空间运动基底的稀疏线性组合,在无需 SfM 点云先验与随机初始化条件下实现了高保真非刚性 4D 重建,并借助时间不变缓存达成超过 163 FPS 的实时渲染与 16 倍以上的训练加速。

研究背景与动机

基于 3D 高斯泼溅(3DGS)的动态场景四维重建与新视角合成,是沉浸式虚拟现实、具身感知与人机交互等领域的核心基础。然而,将显式 3D 高斯扩展至时空 4D 领域时,现有方法普遍面临运动与几何交织、非刚性形变表征能力受限以及对初始化先验过度依赖的瓶颈。目前主流动态 3DGS 方案主要沿袭两条技术路线:第一条路线采用单一整体形变网络(Monolithic Deformation MLP),直接从时空坐标预测每个高斯的平移、旋转与尺度变化;这种设计将几何结构与时序位移强行绑定,在联合优化过程中极易引发严重的“移动目标(moving target)”震荡与几何过拟合。第二条路线则尝试引入运动分解,例如基于全局共享的时间基底(Time-Basis)轨迹来拟合场景动态;但该范式隐式假设全场共享少数刚性运动轨迹,面对衣物褶皱、流体或独立非刚性扭曲等异构局部运动时,全局时间基底的秩会发生爆炸并迅速失真。

更关键的工程痛点在于,上述两类方法均严重依赖 COLMAP 等运动恢复结构(SfM)生成的稀疏点云进行初始化。而在复杂动态场景中,剧烈运动的目标区域往往因特征跨帧失配导致 SfM 点云严重缺失或充满外点,一旦失去高质量初始点云先验,现有网络极易陷入拓扑崩溃或产生大量漂浮伪影。此外,全局变形网络在渲染阶段需对每个高斯逐帧调用 MLP 推理,带来了高昂的显存与计算开销,制约了实时高帧率交互。

面对上述两难困境,本文的核心洞见在于:高频非刚性运动虽然在全局空间高度复杂,但在微观局部空间却天然落在低秩流形上,不同物理材质(如刚性骨架与弹性布料)的运动潜能完全取决于其所处的空间位置。核心 idea:打破传统的全局时间基底范式,提出“空间变化运动基底(Spatially-Varying Motion Basis)”的结构倒置,先由轻量基运动网络拟合低频动态规范空间,再由静态空间坐标预测局域运动基底字典并结合动态混合权重线性合成非刚性形变,构成无需 SfM 先验的隐式神经骨架。

方法详解

整体框架

MoBa-GS 采用“先粗后精、空间解耦”的层级化 4D 重建架构。系统输入为单目或多视角动态 RGB 视频帧及其时间戳 \(t\),输出为各时序步下精确形变并完成渲染的 3D 高斯集合。整个管线主要由三大协同模块构成:首先,基础运动网络(Base Motion Network)作为时间低通滤波器,从时间输入提取粗粒度位移,将静态规范高斯驱动至动态规范空间,吸收相机抖动或全局漂移等低频运动;其次,基底预测器(Basis Predictor)仅基于高斯的静态空间位置,前向预测每个坐标专属的局部空间运动基底(Local Spatial Basis),该基底具有时间不变性并在稳定后直接固化缓存;再次,权重预测器(Weight Predictor)根据动态规范坐标与高频时间编码,输出对应的动态时序混合权重,通过与局部基底做轻量点积合成高频残差位移。在几何演化过程中,算法辅以运动引导稠密化机制与位置退火策略,确保有限几何容量精准分配给动态复杂区域并消除晚期过拟合。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入:静态规范高斯 p_canon 与时间戳 t"] --> B["动态规范空间构建<br/>低频时间嵌入与轻量MLP预测粗位移"]
    B --> C["空间变化运动基底解耦<br/>静态位置预测局域基底与动态状态预测权重"]
    C --> D["时不变基底缓存与残差合成<br/>显存固化基底矩阵与稀疏线性加权"]
    D --> E["时空协同训练与退火优化<br/>运动引导稠密化与解耦交替退火调度"]
    E --> F["输出:高保真时序形变高斯与实时渲染图像"]

关键设计

1. 动态规范空间构建:解耦低频全局漂移以稳定参考系

为了从根本上缓解固定原点(fixed origin)带来的优化发散问题,模型首先构建自适应演化的动态规范空间。如果直接让高频形变场拟合包含整体平移在内的全部运动,微小的低频漂移就会污染局部精细几何的梯度传播。为此,基础运动网络 \(D_{\text{base}}\) 被显式设计为时间域低通滤波器,它是一个极度轻量化的 4 层 MLP(隐层维度 128),仅接收带有低最大频次(\(L=4\))的时间位置编码 \(\gamma_{L=4}(t)\)。网络输出基础位移 \(\Delta \mathbf{p}_{\text{base}}\),将静态规范坐标 \(\mathbf{p}_{\text{canon}}\) 平移映射为时变动态规范坐标:

\[\mathbf{p}'(t) = \mathbf{p}_{\text{canon}} + \Delta \mathbf{p}_{\text{base}}(\gamma_{L=4}(t))\]

该动态规范参考系充当了粗运动先验,先行吸收了场景刚性迁移与全局低频趋势,从而将后续残差形变网络的学习空间严格收敛至局部的非线性扰动。

2. 空间变化运动基底解耦:构建局部低秩物理运动字典

针对传统全局时间基底无法跨区域适配异构非刚性运动、以及直接回归形变缺乏几何约束的缺陷,本文提出了空间变化运动基底(Spatially-Varying Motion Basis)。其核心机制是将高频残差运动正交拆解为“空间运动基底场”与“时序系数激活场”。基底预测器 \(B\)(2 层 MLP,隐层维度 256)仅以静态规范位置 \(\mathbf{p}_{\text{canon}}\) 的空间位置编码为输入,输出 \(K\) 个局域三维基底向量,组合为局域基底投影矩阵:

\[\mathbf{V}(\mathbf{p}_{\text{canon}}) = [\mathbf{b}_1, \dots, \mathbf{b}_K] = B(\gamma_{\text{pos}}(\mathbf{p}_{\text{canon}})) \in \mathbb{R}^{3 \times K}\]

与此同时,具有更高表达能力的权重预测器 \(W\)(8 层 MLP 主干,隐层维度 256)以动态规范坐标 \(\mathbf{p}'(t)\) 与高频时间位置编码 \(\gamma_{L=10}(t)\) 为联合输入,预测一组稀疏的时变标量混合权重 \(\mathbf{w}(\mathbf{p}', t) = [w_1, \dots, w_K]^\top \in \mathbb{R}^K\)。最终的残差三维位移 \(\Delta \mathbf{p}_{\text{res}}\) 由二者线性投影合成:

\[\Delta \mathbf{p}_{\text{res}} = \mathbf{V}(\mathbf{p}_{\text{canon}}) \mathbf{w}(\mathbf{p}', t) = \sum_{k=1}^K w_k(\mathbf{p}', t) \mathbf{b}_k(\mathbf{p}_{\text{canon}})\]

权重预测网络的分支头还同步输出旋转残差 \(\Delta \mathbf{q}\) 与尺度残差 \(\Delta \mathbf{s}\)。这种构造天然构成了隐式神经骨架(Implicit Neural Scaffold):强迫时空位移落在局部低维运动流形上,既为各空间点赋予了独立的运动学表征自由度(刚性点基底各向同性分散、非刚性变形点基底高度方向聚焦),又对解空间施加了天然的流形正则,使得网络在脱离 SfM 稀疏点云而仅从纯随机高斯点集初始化时,仍能稳健收敛至精细几何与平滑轨迹。

3. 时不变基底缓存与残差合成:剔除运行时 MLP 计算冗余

在动态 3DGS 渲染场景中,逐点逐帧运行多层感知机是导致推理延迟激增的罪魁祸首。由于基底预测器 \(B\) 的输入严格且仅依赖于空间静态规范坐标 \(\mathbf{p}_{\text{canon}}\),基底矩阵 \(\mathbf{V}(\mathbf{p}_{\text{canon}})\) 具备完全的时间不变性(Time-Invariant)。在训练中后期规范空间几何形态趋于稳定之后,系统只需单次执行前向推理,将所有高斯点的空间基底张量预先计算并显存固化(Cache)。在实时渲染推理阶段,模型彻底绕过基底 MLP 的计算开销,仅运行轻量权重预测并执行向量点积求和,将复杂的时空形变计算降维为纳秒级的矩阵-向量乘法,实现了计算与存储的双重极简化。

4. 时空协同训练与退火优化:运动引导稠密化与解耦交替退火

为了解决几何演化与运动拟合相互干扰引发的“移动目标”发散,以及传统 3DGS 仅凭视点梯度盲目稠密化静态纹理的问题,MoBa-GS 引入了协同训练闭环: - 运动引导稠密化(Motion-Guided Densification):将高斯分裂与克隆扩展为时空重要性采样。仅当高斯 \(G_i\) 同时满足视空间投影梯度超过几何阈值 \(\tau_{\text{grad}}\),且时变位移模长超过运动幅度阈值 \(\tau_{\text{motion}}\) 时才允许执行稠密化:

\[\text{Densify}(G_i) \quad \text{if} \quad \|\nabla_{\mathbf{xyz}}(G_i)\| > \tau_{\text{grad}} \quad \land \quad \|\Delta \mathbf{p}_i(t)\| > \tau_{\text{motion}}\]

该机制自动屏蔽了高频静态背景区域,使有限的高斯几何容量高度聚焦于剧烈形变的动态前景。 - 解耦交替优化与位置退火(Decoupled Alternating Optimization & Positional Annealing):训练采用阶段交替解耦调度。在第 1 阶段(形变专注),冻结规范高斯参数,仅优化形变网络 \(N_{\text{def}}=2\) 步;在第 2 阶段(几何专注),冻结形变网络,仅优化规范高斯参数 \(N_{\text{geo}}=1\) 步。当迭代轮数达到退火阈值 \(i_{\text{anneal}}\) 时,启动位置退火调度,逐步冻结规范空间坐标的学习率 \(\eta_{\mathbf{p}}(i)\),迫使运动网络完全接管残余时空方差,从而彻底切断后期几何过拟合的恶性循环。

损失函数 / 训练策略

模型采用端到端自监督优化,仅依赖多视角/单目 RGB 图像监督,完全无需深度图或 2D 追踪先验。渲染图像 \(C(p)\) 与真实图像 \(\hat{C}(p)\) 之间的联合光度损失函数定义为:

\[\mathcal{L} = (1 - \lambda_{\text{dssim}}) \cdot \|\hat{C} - C\|_1 + \lambda_{\text{dssim}} \cdot \mathcal{L}_{\text{dssim}}(\hat{C}, C)\]

训练在单张 NVIDIA A100 GPU 上执行,基底数量默认设为 \(K=8\)。此外引入动态加速度正则惩罚,对静止区域施加强刚性约束,同时对高速运动点呈指数衰减权重,赋予动态前景充分的形变灵活性。

实验关键数据

主实验

在代表性真实单目动态数据集 NeRF-DS(包含 7 个复杂非刚性场景)上,MoBa-GS 与代表性动态 3DGS 基线方法进行了系统评测,如表 1 所示。在全部 7 个场景中,MoBa-GS 在均值 PSNR 和 SSIM 上均夺得 SOTA,不仅大幅领先经典的 4DGS 与 SC-GS,在细节保留和抗运动模糊方面亦显著优于 D-MiSo。

表 1: NeRF-DS 数据集定量评测对比(7 个真实动态场景)

方法 As (PSNR/SSIM) Basin (PSNR/SSIM) Bell (PSNR/SSIM) Cup (PSNR/SSIM) Plate (PSNR/SSIM) Press (PSNR/SSIM) Sieve (PSNR/SSIM) 均值 PSNR↑ 均值 SSIM↑ 均值 LPIPS↓
3D-GS [18] 22.69 / 0.802 18.42 / 0.717 21.01 / 0.789 21.71 / 0.830 16.14 / 0.697 22.89 / 0.816 23.16 / 0.820 20.29 0.782 0.292
Deformable-GS [50] 26.22 / 0.881 19.65 / 0.791 25.08 / 0.842 24.66 / 0.887 20.29 / 0.808 25.35 / 0.858 25.08 / 0.869 23.76 0.848 0.180
SC-GS [16] 24.47 / 0.847 19.30 / 0.806 21.98 / 0.801 20.08 / 0.740 19.92 / 0.814 24.89 / 0.870 25.12 / 0.896 22.25 0.824 0.203
D-MiSo [36] 26.06 / 0.881 19.79 / 0.784 24.75 / 0.851 24.36 / 0.885 20.50 / 0.805 25.71 / 0.864 26.12 / 0.885 23.90 0.851 0.151
4DGS [43] 25.68 / 0.885 19.26 / 0.817 23.22 / 0.853 24.04 / 0.893 18.55 / 0.760 24.13 / 0.822 22.88 / 0.830 22.54 0.837 0.212
Motion-GS [56] 25.97 / 0.868 19.80 / 0.779 23.99 / 0.809 24.36 / 0.860 20.41 / 0.793 25.86 / 0.861 25.62 / 0.847 23.71 0.831 0.240
MoBa-GS (本文) 26.48 / 0.885 19.80 / 0.798 25.23 / 0.847 24.79 / 0.894 20.86 / 0.823 25.96 / 0.877 25.86 / 0.878 24.14 0.857 0.197

在具备剧烈形变与相机运动的 HyperNeRF 数据集上,MoBa-GS 同样在所有测试场景中刷新了最高平均渲染质量,在含极细微几何形变的 'Banana' 与 'Broom' 场景提升尤为突出(见表 2)。

表 2: HyperNeRF 数据集定量对比

方法 3D Printer (PSNR/SSIM) Chicken (PSNR/SSIM) Broom (PSNR/SSIM) Banana (PSNR/SSIM) 均值 PSNR↑ 均值 SSIM↑
SC-GS [16] 19.33 / 0.60 22.46 / 0.63 20.26 / 0.49 21.63 / 0.80 20.92 0.63
D-MiSo [36] 20.13 / 0.66 23.66 / 0.70 20.86 / 0.31 25.22 / 0.80 22.47 0.62
Deformable-GS [50] 20.18 / 0.64 22.68 / 0.60 20.54 / 0.34 24.85 / 0.78 22.06 0.59
MotionGS [56] 20.47 / 0.61 22.23 / 0.61 19.64 / 0.25 21.51 / 0.51 20.96 0.50
MoBa-GS (本文) 20.51 / 0.67 23.77 / 0.70 21.03 / 0.32 25.62 / 0.80 22.73 0.63

消融实验

在 NeRF-DS 全量 7 个场景上的模块级消融与基底数量 \(K\) 敏感度分析如表 3 所示。

表 3: NeRF-DS 模块消融与基底容量敏感度分析

模型配置 PSNR↑ SSIM↑ LPIPS↓ 性能变化说明
MoBa-GS (完整模型, \(K=8\)) 24.14 0.857 0.197 完整模型达到最佳重构保真度
去除位置退火 (w/o Positional Annealing) 23.87 0.850 0.210 缺乏退火导致规范空间晚期过度拟合训练视角,PSNR 下降 0.27 dB
去除运动稠密化 (w/o Motion Densification) 23.83 0.849 0.207 几何容量盲目均摊于静态背景,动态复杂区域欠拟合,PSNR 下降 0.31 dB
去除运动基底 (w/o Motion Basis) 23.48 0.841 0.221 退化为普通 Base+Residual MLP,PSNR 剧降 0.66 dB,流形约束失效
基底数量 \(K = 2\) 23.54 0.840 0.222 低秩严重受限,欠拟合高频非刚性形变,PSNR 跌落 0.60 dB
基底数量 \(K = 4\) 23.62 0.847 0.216 表达容量次优,PSNR 较最优配置低 0.52 dB
基底数量 \(K = 16\) 23.54 0.845 0.216 冗余自由度诱发视角过拟合与非刚性抖动,PSNR 回落 0.60 dB
基底数量 \(K = 32\) 23.44 0.841 0.218 容量过度膨胀,退化效应加剧,验证呈现对称 U 型容量曲线

表 4: 训练效率与模型紧凑度对比(NeRF-DS 数据集单卡 A100)

场景 D-MiSo [36] 训练时间 MoBa-GS 训练时间 MoBa-GS 渲染帧率 (FPS)↑ 高斯数量 (K)↓ 存储占用 (MB)↓
As 2h 47m 13m 181 28 8.73
Basin 2h 38m 15m 146 41 11.96
Bell 3h 14m 18m 103 61 16.63
Cup 4h 00m 11m 150 37 10.92
Plate 2h 47m 9m 149 35 10.42
Press 1h 54m 12m 174 31 9.56
Sieve 3h 52m 15m 237 37 10.88
均值 (Mean) ~3h 27m ~13m (16x加速) 163 FPS 39K 11.3 MB

关键发现

  • 运动基底分解是性能基石:剥离空间基底后,单纯的粗细 MLP 级联产生高达 0.66 dB 的暴跌,证实非刚性动态必须依赖局部低维物理空间解耦,否则网络难以在无先验条件下寻优。
  • 基底容量 \(K=8\) 呈现严格的对称 U 型平衡:\(K\) 过小(\(K=2,4\))限制了局部运动学表达自由度,而 \(K\) 过大(\(K \ge 16\))引入了冗余维度破坏流形约束导致过拟合;\(K=8\) 成为结构正则的最佳平衡点。
  • 极致的高效性与紧凑性:得益于时不变基底缓存与解耦交替训练,平均收敛耗时从 SOTA 基线(D-MiSo)的 3.5 小时骤降至 13 分钟(16 倍加速);平均仅需 39K 个高斯与 11.3 MB 存储即可达到 163 FPS 的超实时渲染。

亮点与洞察

  • 空间与时间基底的结构倒置:打破了 DynMF 等方法沿用全局时间轨迹基底的思维定势,巧妙地让空间静态坐标承载运动基底算子,让时间承载标量激活权重。这一倒置直接将变形推理降阶为时不变矩阵乘法,完美兼顾了物理异构表达力与运行时缓存。
  • 摆脱 SfM 依赖的隐式神经骨架:空间基底对位移空间的低维投影本质上为高斯云提供了内在的物理流形正则,无需手工设计的平滑度损失,直接允许网络从纯随机分布点云自底向上收敛出高精拓扑。
  • 可复用的时空退火与重要性采样:运动引导稠密化与位置退火解决了困扰动态 3DGS 优化的“移动目标”漂移顽疾,这一即插即用的训练策略可无缝迁移至各类基于显式图元或锚点的 4D 动态表示框架中。

局限与展望

  • 拓扑剧烈撕裂与新物体进入的建模局限:动态规范空间与空间基底假设场景拓扑在时间域上具备连续拉伸同胚性,当面对流体泼洒、物体剧烈断裂或视野外全新物体突入时,连续拉格朗日变形场可能出现表征瓶颈。
  • 复杂阴影与光照突变解耦尚不彻底:当前外观仍基于球谐函数(SH)直接预测,强时变阴影可能被权重预测器误当做几何位移进行补偿。
  • 改进展望:未来可探索将空间基底机制与前馈大模型(如 DUSt3R/VGGT)输出的时空先验相结合,在保持毫秒级缓存推理的同时增强对跨视角开放拓扑的泛化鲁棒性。

相关工作与启发

  • vs DynMF [19]: DynMF 采用全局时间基底,全场景所有点共用相同的时间轨迹词典,面对刚柔混合场景极易引发基底秩爆炸;MoBa-GS 实施结构倒置,学习局域空间变化基底,使刚性与柔性区域拥有独立的运动子空间。
  • vs Deformable-GS [50] / SC-GS [16]: 后者依赖单一庞大 MLP 强行拟合时空映射,几何与运动纠缠严重且必须依赖 COLMAP 点云初始化;MoBa-GS 引入低频动态规范空间与空间运动基底双重解耦,支持纯随机初始化并借助缓存达到 163 FPS 极速渲染。
  • vs D-MiSo [36]: D-MiSo 训练极慢(平均单场景超过 3.4 小时)且渲染偏向平滑;MoBa-GS 训练仅需 13 分钟(提速 16 倍),且以更高的 PSNR/SSIM 保留了运动边界的锋利边缘。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 颠覆性提出空间变化基底倒置范式,彻底摆脱全局时间基底与 SfM 强先验束缚。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 NeRF-DS 与 HyperNeRF 双基准,提供了详尽的收敛耗时、存储紧凑度、FPS 及全维度消融分析。
  • 写作质量: ⭐⭐⭐⭐⭐ 动机阐述深刻,数学流形约束机制推导严谨,图表表达极具说服力。
  • 价值: ⭐⭐⭐⭐⭐ 极速训练(<18min)、小模型体积(~11MB)与高帧率实时推理(>163FPS)为 4D 动态内容落地铺平了道路。