MVFusion-GS: Motion-Variance Guided Temporal Attention for High-Quality Dynamic Gaussian Splatting¶
会议: ECCV 2026
论文: ECCV 2026
代码: https://github.com/toseeai-com/MVFusion-GS
领域: 3D 视觉
关键词: 动态高斯泼溅, 运动方差, 时序注意力, 动静解耦, 干扰消除
一句话总结¶
针对动态 3D 高斯泼溅中变形网络缺乏显式运动感知导致动静态解耦不彻底的瓶颈,提出结合全局运动方差引导先验与局部时序 Cross-Attention 的即插即用精炼模块,兼获干净静态背景与高保真动态前景。
研究背景与动机¶
基于变形场(deformation fields)的动态 3D 高斯泼溅(3DGS)近年来在动态场景高保真重建与无干扰物(distractor-free)静态重建两类代表性任务中取得了显著进展。动态场景重建追求精确拟合前景形变轨迹,而无干扰物重建则旨在从偶发拍摄的自然视频中剥离行人、车辆等移动物体,恢复出纯净的静态背景。以 DeGauss 为代表的双分支解耦框架通过引入静态高斯集合与 HexPlane 变形的前景高斯集合,配合可学习的混合掩码尝试兼顾两者。
然而,现有时空变形网络通常仅基于局部时空坐标网格预测形变残差,缺乏对高斯基元整体运动幅度和跨帧时序依赖的显式感知。面对低幅度、偶发或短暂运动的物体,变形网络极易发生欠拟合,未能输出足够的形变偏移量,导致算法将移动前景误判为静止结构。这些残留的“伪静态”高斯点直接污染静态分支,在无干扰物重建背景中留下挥之不去的鬼影残差,同时也使得动态前景区域的拟合模糊失真。
本文的切入视角在于:既然单一时空网格难以分辨微弱运动与静止背景,就应当为变形网络显式注入全局运动统计与局部时序上下文。核心 idea:通过周期性采样变形轨迹计算跨越全局时间跨度的 13 维运动方差先验以指导动静粗分离,并结合中心查询的局部时序注意力聚合短时上下文,以即插即用方式在特征空间精炼高斯形变预测。
方法详解¶
整体框架¶
MVFusion-GS 整体基于解耦动态-静态高斯泼溅架构构建,将基线变形网络视为粗预测器,在特征空间注入运动感知表征。系统由两条互补分支协同工作:运动方差引导精炼(MVG)模块在训练中周期性统计每个高斯点的全局位移、旋转与尺度方差,构建全局运动特征;MotionFormer 时序注意力(MFTA)模块在局部滑动窗口内将当前查询高斯与时序邻近高斯进行 Cross-Attention 交互。两路运动特征与基线时空特征无缝拼接融合后,直接传入原始变形预测头输出精炼形变残差,更新动态高斯分支并与静态高斯分支进行掩码混合渲染。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
In["输入动态高斯基元 & 时间戳 t"] --> BaseFeat["基线时空变形网络<br/>提取粗变形特征 h_base"]
BaseFeat --> MVG["运动方差引导精炼 (MVG)<br/>全局轨迹特征 + 局部方差词典"]
BaseFeat --> MFTA["MotionFormer 时序注意力 (MFTA)<br/>时序滑动窗口 Cross-Attention"]
MVG --> FeatFusion["特征空间残差融合<br/>h_base + h_MVG + h_MFTA"]
MFTA --> FeatFusion
FeatFusion --> HeadDecode["原始变形预测头 Φ<br/>输出精炼形变量 ΔG_d"]
HeadDecode --> Render["双分支高斯渲染与掩码合成<br/>分离纯净静态背景与高精动态前景"]
关键设计¶
1. 运动方差引导精炼 (MVG):通过全局时序统计提取显式运动先验
针对传统时空网格对微弱运动欠拟合、容易将缓慢移动的高斯误判为静态点的问题,MVG 模块在训练过程中每隔固定步数周期性采样时间戳,利用当前变形网络预测所有动态高斯的完整位移、旋转和尺度轨迹,无需反向传播梯度。随后在时间维度统计其均值与方差,组装成 13 维全局运动特征向量:包含 3 维位置均值与 3 维位置方差、标量旋转幅度的均值与方差、各向同性及各向异性对数尺度变化的均值与方差,以及一个综合运动强度分数。为了兼顾全局先验与瞬时剧烈变化,该模块同时维护一个按极稀疏时间戳存储并在查询时线性插值的局部滑动窗口位移方差词典。两项统计量经轻量 MLP 映射为运动特征向量 \(h_{\text{MVG}}\),为网络注入清晰的动静分离先验。
2. MotionFormer 时序注意力 (MFTA):基于局部上下文聚合高斯邻近动态
全局方差特征虽能有效度量长期运动幅度,但无法捕捉物体在相邻帧之间的时序连续性与瞬时交互。MFTA 模块以当前查询时间戳为中心构建局部时序窗口,为中心帧与前后邻近帧分别提取包含时空特征、粗变形预测和瞬时局部运动方差的复合时序 token。随后以当前帧 token 作为 Query,前后邻域 token 作为 Key 与 Value 进行 Cross-Attention 计算:
该设计使得高斯点能够根据自身的局部运动强度显式借调相邻帧的信息,消除单一时间步预测的模糊与突变,输出时序运动特征 \(h_{\text{MFTA}}\)。
3. 特征空间即插即用残差融合:零侵入集成与渐进式三阶段训练
为了最大程度兼容现有的各类型动态高斯变形架构(如 4DGS、DeGauss),MVG 与 MFTA 均完全在特征空间运行。基线时空特征与两个模块生成的运动特征求和融合后,直接送入参数结构保持不变的原生变形解码头 \(\Phi\) 中预测精炼量,无需修改后端栅格化管线或预测头结构。整个系统采用渐进式三阶段训练策略:第一阶段仅优化初始几何结构并执行密集化;第二阶段激活基线时空变形网络学习基础形变,并在末尾开始采样轨迹统计数据;第三阶段全面开启零初始化的 MVG 与 MFTA 分支进行端到端联合训练。推理阶段则直接复用缓存的全局运动描述符,时序模块亦可根据算力需求灵活关闭。
损失函数 / 训练策略¶
总体训练目标结合光度重构损失与正则化项:
其中 \(\mathcal{L}_{\text{rgb}}\) 为基于 \(L_1\) 范数的光度重构误差,\(\mathcal{L}_{\text{ssim}}\) 约束图像结构相似性,\(\mathcal{L}_{\text{reg}}\) 施加高斯尺度的各向异性与比例正则约束。实验在单张 NVIDIA RTX 3090 GPU 上使用 Adam 优化器训练 30,000 轮;MVG 模块每 2000 轮采样 \(K=64\) 个时间戳刷新一次统计缓存;MFTA 模块的时序窗口大小设为 \(w=5\) 帧。
实验关键数据¶
主实验¶
在 NeRF On-the-go(消除行人等瞬时动态干扰、评估纯净静态背景视图合成质量)以及 Neu3D(多视角复杂动态场景全身重建)数据集上进行了全面评估。
表 1: NeRF On-the-go 数据集无干扰物静态场景重建定量对比
| 方法 | Mountain (PSNR / SSIM / LPIPS) | Corner (PSNR / SSIM / LPIPS) | Patio-High (PSNR / SSIM / LPIPS) | Mean (PSNR↑ / SSIM↑ / LPIPS↓) |
|---|---|---|---|---|
| RobustNeRF | 17.54 / 0.496 / 0.383 | 23.04 / 0.764 / 0.244 | 20.54 / 0.578 / 0.366 | 19.64 / 0.583 / 0.369 |
| 3DGS | 19.40 / 0.638 / 0.213 | 20.90 / 0.713 / 0.241 | 17.29 / 0.604 / 0.363 | 19.30 / 0.668 / 0.253 |
| WildGaussians | 20.43 / 0.653 / 0.255 | 24.16 / 0.822 / 0.139 | 22.23 / 0.725 / 0.206 | 22.16 / 0.746 / 0.182 |
| DeSplat | 19.59 / 0.715 / 0.175 | 26.05 / 0.885 / 0.095 | 22.59 / 0.845 / 0.125 | 22.58 / 0.813 / 0.130 |
| SpotlessSplats | 21.64 / 0.725 / 0.195 | 25.77 / 0.877 / 0.117 | 22.98 / 0.808 / 0.155 | 23.42 / 0.813 / 0.145 |
| DeGauss | 22.31 / 0.746 / 0.163 | 25.94 / 0.869 / 0.078 | 23.35 / 0.799 / 0.124 | 23.91 / 0.819 / 0.113 |
| MVFusion-GS (本文) | 22.44 / 0.755 / 0.127 | 25.58 / 0.868 / 0.061 | 23.20 / 0.805 / 0.097 | 23.94 / 0.826 / 0.085 |
表 2: Neu3D 数据集动态场景重建定量对比
| 方法 | Cut Beef (PSNR / SSIM / LPIPS) | Cook Spinach (PSNR / SSIM / LPIPS) | Flame Steak (PSNR / SSIM / LPIPS) | Mean (PSNR↑ / SSIM↑ / LPIPS↓) |
|---|---|---|---|---|
| K-Planes | 31.82 / 0.966 / 0.114 | 32.60 / 0.966 / 0.114 | 32.39 / 0.970 / 0.102 | 31.63 / 0.964 / 0.117 |
| 4DGS | 32.66 / 0.946 / 0.053 | 32.46 / 0.949 / 0.052 | 32.75 / 0.954 / 0.040 | 31.12 / 0.937 / 0.058 |
| MangoGS | 33.28 / 0.949 / 0.043 | 32.83 / 0.947 / 0.042 | 34.11 / 0.958 / 0.035 | 31.89 / 0.940 / 0.052 |
| DeGauss | 32.56 / 0.957 / 0.042 | 32.61 / 0.950 / 0.041 | 32.75 / 0.955 / 0.034 | 31.52 / 0.942 / 0.047 |
| MVFusion-GS (4DGS 插件版) | 33.31 / 0.952 / 0.052 | 33.01 / 0.954 / 0.051 | 33.45 / 0.957 / 0.039 | 31.66 / 0.942 / 0.057 |
| MVFusion-GS (完整解耦版) | 33.62 / 0.960 / 0.040 | 33.41 / 0.954 / 0.039 | 34.13 / 0.959 / 0.032 | 32.07 / 0.943 / 0.046 |
消融实验¶
表 3: 各核心模块消融实验(Neu3D 与 NeRF On-the-go)
| 配置 | Neu3D PSNR↑ / SSIM↑ / LPIPS↓ | NeRF On-the-go PSNR↑ / SSIM↑ / LPIPS↓ | 说明 |
|---|---|---|---|
| w/o MVG & MFTA (基线变形) | 31.52 / 0.942 / 0.047 | 23.86 / 0.807 / 0.122 | 去除所有运动感知精炼模块 |
| w/o MVG (无运动统计先验) | 31.64 / 0.937 / 0.052 | 23.87 / 0.810 / 0.114 | 仅依靠 MFTA 时序注意力 |
| w/ MVG (仅位置方差) | 31.93 / 0.943 / 0.046 | 23.92 / 0.815 / 0.096 | MVG 中仅使用 3D 位置方差而不用 13D 特征 |
| w/o MFTA (无时序注意力) | 31.78 / 0.942 / 0.047 | 23.89 / 0.820 / 0.089 | 仅使用 MVG 统计先验,缺失短时交互 |
| 替换为 Self-Attention | 32.01 / 0.943 / 0.046 | 23.93 / 0.822 / 0.090 | 不做 Query-Centered Cross-Attention |
| 完整模型 (Full Model) | 32.07 / 0.943 / 0.046 | 23.94 / 0.826 / 0.085 | MVG (13D) + MFTA Cross-Attention 协同工作 |
关键发现¶
- 运动统计先验(MVG)提供了关键的判别增益:从基线到引入仅位置方差即实现 Neu3D PSNR 提升 0.41 dB,而完整的 13D 全局特征进一步兼顾旋转和尺度动态,证明旋转与尺度变化对复杂关节运动至关重要。
- 时序 Cross-Attention(MFTA)显著改善局部突变与模糊:去掉 MFTA 后 Neu3D PSNR 下降 0.29 dB,且在视觉上火焰、水流等快速运动区域容易丢失精细边缘;改用标准 Self-Attention 效果逊于以当前帧为 Query 的 Cross-Attention。
- 在无干扰物重建中,感知质量指标(LPIPS)提升极为显著(由 0.113 降至 0.085),彻底消除了 DeGauss 中常见的半透明行人残影与路面涂抹现象。
亮点与洞察¶
- 无梯度的周期性轨迹方差离线采样:无需维持极长的反向传播计算图,仅利用周期性前向评估构建 13 维统计特征与稀疏时间字典,在极低内存开销下为网络提供了全局动态先验。
- 动静解耦任务与动态拟合任务的双向统一:揭示了干扰物消除(动静分离)与动态重建并非割裂的目标,更准确的运动感知使低幅度前景正确归入动态分支,同时成就了更纯净的背景与更锐利的前景。
- 即插即用的特征空间残差接口:既能作为 DeGauss 解耦框架的升级补丁,亦能直接插拔于单分支 4DGS 架构中,均带来稳定性能飞跃。
局限与展望¶
- 依赖基线变形场的初筛质量:若初始几何或基线变形网络在严重遮挡下发生严重塌缩,采样得到的轨迹方差将丧失判别力,可能导致少量“伪静态”残影仍无法完全清除。
- 极端缓慢运动与材质光照变化的混淆:对于移动极为微弱的物体(如风吹微动的树叶)或随时间渐变的光照反射,当前纯基于位移/尺度/旋转的统计量可能难以与真正的静态几何稳定区分。
- 未来方向:探索与基础 2D/3D 大模型先验(如 DINO 特征或单目深度模型)协同的显式高斯重分配策略,进一步增强严重欠观测条件下的鲁棒性。
相关工作与启发¶
- vs DeGauss: DeGauss 提出了静态/动态双分支高斯及掩码混合机制,但变形网络仅靠时空网格推断,对短暂/缓慢运动欠拟合,静态背景残留鬼影;本文引入 MVG 全局统计与 MFTA 局部时序注意力,彻底重分配伪静态高斯点。
- vs 4DGS / SC-GS: 4DGS 和 SC-GS 侧重利用 HexPlane 或稀疏控制节点表达连续时空场,缺乏对高斯基元整体运动历史的显式特征化;本文提出的 MVG/MFTA 模块可作为通用插件直接提升 4DGS 的建模精度(Neu3D 平均 PSNR 提升 0.54 dB)。
- vs SpotlessSplats / WildGaussians: 此类方法主要借助预训练 DINO 或扩散模型特征在 2D 像素层做掩码过滤;本文立足于 3D 高斯原语本身的运动轨迹方差,更轻量且直接对齐物理几何运动。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ [将全局运动轨迹方差统计与时序 Cross-Attention 相结合解决高斯泼溅动静解耦残留问题,构思精巧实用]
- 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 NeRF On-the-go、RobustNeRF 和 Neu3D 三大主流基准,详细对比了动静态多项指标及各模块消融]
- 写作质量: ⭐⭐⭐⭐⭐ [问题提炼深刻,动机明确,方法架构与实验图表自洽且逻辑清晰]
- 价值: ⭐⭐⭐⭐☆ [作为即插即用模块能够直接赋能多种现有动态 3DGS 算法,工业落地与学术扩展性兼备]