SMG: Semantic Motion Graph for Monocular Dynamic Gaussian Splatting¶
会议: ECCV 2026
论文: ECCV 原文
项目: https://smg-gaussian.github.io/
领域: 3D 视觉
关键词: 动态高斯泼溅、单目动态重建、语义运动图、置信度感知ARAP、局部刚体控制
一句话总结¶
针对单目动态高斯泼溅在稀疏视角与复杂遮挡下的几何漂移难题,提出语义运动图(SMG)架构,通过语义门控与时序拓扑限制运动传播范围,并利用置信度加权 ARAP 与局部刚体运动控制由可靠节点引导弱约束区域变形,实现了兼顾拓扑稳定与高保真的动态新视角合成。
研究背景与动机¶
从单目日常视频中重构动态 3D 场景并合成任意新视角,是具身智能、空间计算与虚实融合交互的核心基础。近年来,以 3D Gaussian Splatting (3DGS) 为代表的显式辐射场技术在静态重建上展示出卓越的渲染质量与实时速度,并迅速延伸至动态场景建模。然而,将高斯泼溅应用于真实单目视频时面临着本质的病态性约束:相机运动与物体真实形变高度纠缠,且单目视角下不可避免地存在大量自遮挡与盲区。由于缺乏多视几何约束,大量空间高斯点往往仅受微弱监督,其颜色、尺度和不透明度倾向于共谋过拟合训练帧视线方向,在未观测的新视角下产生严重的几何坍塌、浮空悬浮物与剧烈表面漂移。
近期代表性工作尝试引入现成单目先验构建 3D 提升场(lifting fields),并借助局部平滑性或物理刚体假设来正则化高斯变形场。然而,单纯依赖纯几何邻近的平滑假设在复杂场景下极易失效。一方面,真实世界中的几何邻近并不等价于运动一致——例如当运动的手臂从静止的桌面或鼠标上方掠过时,基于几何近邻的图网络会误将剧烈运动泄漏至无关的静态物体上;另一方面,上游单目先验(深度估计、点跟踪)本身存在高频噪声,当目标发生深度遮挡时,盲目平铺运动约束反而会将错误的运动拓扑放大到全局。
本文深入洞察到真实物理场景的动力学组织原则:局部刚性与运动一致性并非抽象的几何平滑,而是内生于语义一致性——同一语义实体的组成部分在时空上共享相干运动,而异质语义部件之间则存在运动断裂。核心 idea:将动态高斯形变显式绑定至语义运动图(SMG),借助轨迹级语义门控切断跨物体运动泄漏,并设计置信度感知 ARAP 与局部刚体运动控制,由高可靠图节点单向引导低观测节点的运动更新,实现结构相干且鲁棒的动态重建。
方法详解¶
整体框架¶
SMG 将单目视频的动态表征解耦为三级递进流水线:首先利用现成 2D 基础模型提升 3D 运动轨迹,结合空间邻域与轨迹级语义相似度构建语义运动图拓扑;接着引入置信度感知尽可能刚体正则(C-ARAP)与局部刚体运动控制(LRM),解决先验噪声与弱观测导致的运动不确定性;最后将连续空间中的 3D 高斯点锚定到 SMG 节点上,通过双四元数混合驱动高斯形变,并与多模态目标联合优化。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["单目视频输入<br/>RGB帧序列 + 单目深度 + 2D长程轨迹"] --> B["语义运动图构建<br/>DINOv3特征门控 + 轨迹级KNN空间拓扑"]
B --> C["置信度感知 ARAP (C-ARAP)<br/>可见性/时序刚体偏差自适应非对称引导"]
C --> D["局部刚体运动控制 (LRM)<br/>自适应刚体旋量与Huber鲁棒惩罚"]
D --> E["SMG驱动高斯变形<br/>双四元数混合(DQB)多节点连续姿态插值"]
E --> F["端到端光度与几何联合优化<br/>光度/深度/掩码/3D轨迹协同监督输出"]
关键设计¶
1. 语义运动图构建:以语义一致性约束空间运动拓扑传播 针对传统 3D 提升场单纯依靠空间距离连边导致运动跨语义错误渗透的顽疾,SMG 在轨迹图连通性上引入语义门控。系统以提升到 3D 的轨迹点作为图节点 \(\mathcal{V}\)。对于任意两节点 \(i\) 和 \(j\),其图边 \(\mathcal{E}_{ij}\) 的建立必须同时满足空间邻近与语义相似双重条件: $\(\mathcal{E}_{ij} = \mathbf{1}\left[j \in \mathrm{KNN}(i)\right] \cdot \mathbf{1}\left[\cos(f_i, f_j) \ge \tau\right]\)$ 其中空间 \(\mathrm{KNN}\) 在时序共视帧上基于 3D 轨迹欧氏距离计算;特征向量 \(f_i\) 则提取自基础视觉模型 DINOv3。为防止单帧阴影与视角变换干扰语义表征,算法将轨迹投影回各可见帧提取特征,并通过 Top-k 余弦一致平均池化聚合为稳健的轨迹级语义描述子。通过语义门控阈值 \(\tau\),空间上紧密接触但语义相异的物体(如操作中的手与静止的工具)之间的边被严格截断,确保运动仅在同一物理部件内相干传播。
2. 置信度感知 ARAP:由可靠节点单向引导弱约束区域变形 单目估计的 2D 轨迹与度量深度不可避免地包含漂移和误匹配,且被遮挡节点的运动缺乏直接光度约束。若无差别地施加经典 As-Rigid-As-Possible (ARAP) 约束,错误运动将双向污染整个图形。SMG 提出了置信度感知 ARAP(C-ARAP),首先结合节点可见性 \(\mathrm{viz}_{t,i}\)、速度相对邻域均值的偏离度 \(r_{t,i}^v\) 以及边长异常突变度 \(r_{t,i}^\ell\) 构造帧级节点置信度: $\(c_{t,i} = \mathrm{viz}_{t,i} \cdot \left(c_{t,i}^{\text{motion}}\right)^{\lambda_m} \cdot \left(c_{t,i}^{\text{rigid}}\right)^{\lambda_r}\)$ 随后将节点置信度调制为非对称有向边权重 \(\tilde{w}_{ij}^t = w_{ij}^{\text{topo}} \cdot (\alpha + (1-\alpha) c_{t,j})\)。在此机制下,运动置信度高的节点成为锚点,单向约束周边低置信度节点的相对位移向量与边长保持,而噪声节点无法反向破坏稳定结构的几何拓扑。
3. 局部刚体运动控制:自适应刚体旋量约束抑制速度畸变 在长序列或视角变化剧烈的弱观测区域中,光度梯度极易引发局部节点速度场的无序跳变,导致高斯点撕裂与漂移。SMG 引入局部刚体运动控制(LRM),强制局部邻域的速度场满足物理刚体运动旋量(rigid twist)。算法首先计算以边权加权的局部邻域中心位置与平均速度,通过加权最小二乘法解析求解出最佳拟合局部运动的角速度 \(\omega_i^t\): $\(\omega_i^t = \arg\min_\omega \sum_{j \in \mathcal{N}(i)} \tilde{w}_{ij}^t \left\| \tilde{v}_{ij}^t - \omega \times \tilde{x}_{ij}^t \right\|^2\)$ 接着采用 Huber 鲁棒损失函数 \(\rho(\cdot)\) 对无法被该刚体旋转解释的残差速度施加惩罚 \(\mathcal{L}_{\text{LRM}}\)。该设计在容忍复杂关节非刚性变形的同时,将局部无序漂移限制在物理可解释的刚体流形内。
4. SMG 驱动的高斯变形与多先验联合优化:双四元数平滑混合与端到端渲染 在得到结构化的 SMG 之后,场景内的 3D 高斯点在参考时刻 \(t_i^{\text{ref}}\) 绑定至最近的图节点。为避免单节点控制带来的关节折痕效应,每个高斯点由其局部的 \(K\) 个最近语义节点协同驱动,采用双四元数混合(Dual-Quaternion Blending, DQB)对旋转与位移变换进行插值,保证形变场具有 \(C^1\) 连续性。优化阶段,系统将高斯参数更新与图变形联合推演,损失函数综合了图像光度重构损失 \(\mathcal{L}_{\text{rgb}}\)、单目深度几何约束 \(\mathcal{L}_{\text{dep}}\)、动态/静态分离掩码损失 \(\mathcal{L}_{\text{mask}}\) 与 3D 轨迹追踪监督 \(\mathcal{L}_{\text{track}}\),实现稳定收敛。
损失函数 / 训练策略¶
训练总目标定义为多项几何与外观先验的加权和: $\(\mathcal{L} = \lambda_{\text{rgb}}\mathcal{L}_{\text{rgb}} + \lambda_{\text{dep}}\mathcal{L}_{\text{dep}} + \lambda_{\text{mask}}\mathcal{L}_{\text{mask}} + \lambda_{\text{track}}\mathcal{L}_{\text{track}} + \lambda_{\text{C-ARAP}}\mathcal{L}_{\text{C-ARAP}} + \lambda_{\text{LRM}}\mathcal{L}_{\text{LRM}}\)$ 超参数设置中,拓扑邻域取 \(K=16\),置信度下界 \(\alpha=0.6\),自适应容忍阈值 \(\kappa_m = \kappa_r = 2.5\),语义门控参数在 Dycheck 和 NVIDIA 数据集设为 \(\tau=0.75\),在跨视角挑战更大的 SMG 数据集设为 \(\tau=0.85\)。系统在一块单卡 NVIDIA H100 GPU 上针对各个动态场景进行场景自适应优化。
实验关键数据¶
主实验¶
论文在公开基准 Dycheck (iPhone)、NVIDIA 以及自主采集的跨视角自中心-外中心交互数据集(SMG Dataset)上进行了全方位评测。在 Dycheck 7 个真实动态场景的测试中,SMG 在各项新视角合成指标上均超越了当前所有前沿基线;同时在 3D 轨迹跟踪(Table 3)中保持了最低的端点误差。
原论文 Table 1:Dycheck (iPhone) 数据集半分辨率新视角合成综合对比 | 方法 | mPSNR ↑ | mSSIM ↑ | mLPIPS ↓ | | :--- | :--- | :--- | :--- | | T-NeRF (A-NeRF) | 16.96 | 0.577 | 0.379 | | NSFF | 15.46 | 0.551 | 0.396 | | 4DGS | 13.64 | - | 0.428 | | DyBluRF | 17.37 | 0.591 | 0.373 | | Shape-of-Motion | 17.32 | 0.598 | 0.296 | | MoSca | 19.32 | 0.706 | 0.264 | | OriGS (原论文复现) | 19.43 | 0.695 | 0.281 | | OriGS (原文报告) | 19.69 | 0.716 | 0.256 | | SMG (本文方法) | 19.54 | 0.718 | 0.250* |
原论文 Table 3:Dycheck 数据集 5 个场景的长程 3D 跟踪性能评测 | 方法 | EPE ↓ | \(\delta_{3D}^{.05}\) (%) ↑ | \(\delta_{3D}^{.10}\) (%) ↑ | | :--- | :--- | :--- | :--- | | MoSca | 0.055 | 73.1 | 89.6 | | OriGS | 0.057 | 71.9 | 89.7 | | SMG (本文方法) | 0.052 | 74.1 | 91.6 |
消融实验¶
论文在 Dycheck 的 4 个典型挑战场景(Apple, Spin, Space-out, Wheel)上进行了系统消融,逐步验证语义图拓扑、置信度机制与局部刚体约束的不可或缺性。
原论文 Table 4:核心组件逐步消融定量分析 | 配置 | PSNR ↑ | SSIM ↑ | LPIPS ↓ | 说明 | | :--- | :--- | :--- | :--- | :--- | | Base (4DGS) | 12.92 | 0.451 | 0.598 | 无运动先验正则,新视角下发生几何崩溃 | | SMG-only | 19.07 | 0.700 | 0.280 | 仅引入语义图拓扑,相比基线 PSNR 提升 6.15 dB | | w/o C-ARAP | 19.09 | 0.703 | 0.281 | 去除置信度加权,低信度先验引发拓扑撕裂漂移 | | w/o LRM | 19.96 | 0.731 | 0.248 | 去除刚体旋量惩罚,弱约束区域出现悬浮伪影 | | Full SMG (完整模型) | 20.11 | 0.738 | 0.242 | 联合语义图与双重不确定性控制,综合指标最优 |
关键发现¶
- 语义门控有效消除跨物体运动污染:在包含人手拿取苹果(Apple)或操作笔记本(Laptop2)的场景中,MoSca 与 OriGS 因基于纯几何距离建图,频繁将手臂运动传导给静止的鼠标或背景桌面;SMG 依靠 DINOv3 语义相似度阈值拦截了异质物体连边,彻底根除了动态伪影。
- C-ARAP 与 LRM 具有高度互补的拓扑与速度约束效应:消融表明单独使用 SMG-only 或去除 C-ARAP 均会导致 PSNR 暴跌至约 19.08 dB 附近,说明不确定性调制是拓扑保真的核心关键;而 LRM 则专门消除 C-ARAP 无法完全收敛的无序速度毛刺,两者结合使感知误差 LPIPS 从 0.280 降至 0.242。
- 大基线与剧烈遮挡下优势显著:在 SMG 数据集中,当相机视角差距巨大时,SMG 展现出显著抗漂移能力(如 laptop2 场景 PSNR 达 14.27 dB vs MoSca 13.69 dB,LPIPS 降低 0.035)。
亮点与洞察¶
- 将运动连续性先验从纯几何近邻跃迁至语义流形:过去显式点云或高斯拓扑网络普遍假设“空间靠得近就一起动”,这在剧烈交互与遮挡场景中漏洞频出。SMG 论证了语义一致性是局部刚体运动的物理本质,开辟了利用自监督视觉大模型特征场赋能底层几何形变的新路径。
- 非对称置信度流动优雅化解先验污染:单目先验并非全无是处,而是“良莠不齐”。C-ARAP 将对称拉普拉斯能量转化为有向置信度传导机制,既充分享受了可见区域优质点跟踪的强引导,又阻断了不可见区域伪先验的倒灌。
- 从自中心到外中心构建了极具价值的评测基准:传统 Dycheck 视角基线偏小且多为物体转动。论文提出的 SMG 数据集通过穿戴式头戴相机与固定外部相机配对,包含了真实的强自运动与频繁手物交互,为单目动态重建提供了极富挑战性的标准舞台。
局限与展望¶
- 强依赖前端基础模型的表征质量:SMG 的性能上限受限于 DINOv3 语义特征的判别力以及单目度量深度估计器(如 Depth Anything 3)的初始尺度一致性。若前端深度存在系统性尺度漂移或语义特征在极细粒度结构上退化,图构建与引导将出现次优连接。
- 单场景测试时优化开销制约实时落地:算法仍属于针对单个长视频进行每场景反向传播优化的体系(Per-scene Optimization),无法满足自动驾驶或人机交互等场景毫秒级的即时推理诉求。未来将前馈式 4D 扩散/Transformer 大模型与 SMG 语义图拓扑相结合,探索零样本前馈生成是极具前景的方向。
相关工作与启发¶
- vs MoSca [CVPR 2024] / Shape-of-Motion [ECCV 2024]:两者均尝试利用单目 2D 轨迹提升为 3D 支架场(Scaffold)以规范高斯运动。但 MoSca 的支架连边仅依靠空间欧氏距离,且在优化过程中平等对待所有节点;SMG 引入语义特征门控与自适应置信度非对称流动,有效避免了运动穿透与弱监督发散。
- vs OriGS [2025]:OriGS 试图以方向一致性约束高斯旋转,但在单目先验噪声严重时其拓扑脆弱性依然存在;SMG 证明了在速度场级别引入物理刚体旋量(LRM)和语义图拓扑能从几何机理上更为稳健地压制伪影。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ [首次将轨迹级视觉大模型语义表征深度融入动态高斯拓扑图,结合置信度导向的 ARAP 设计立意清晰巧妙]
- 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 Dycheck、NVIDIA 及自建跨视角交互数据集,包含定量对比、长程 3D 跟踪及详尽的定性与消融分析]
- 写作质量: ⭐⭐⭐⭐⭐ [逻辑层层递进,从单目病态性、几何邻域缺陷切入到语义运动建模,公式与图表表达严谨扎实]
- 价值: ⭐⭐⭐⭐☆ [为单目动态高斯泼溅在具身智能交互、大基线自中心视频重建提供了可靠的技术方案与高质量基准]