跳转至

TRiGS: Temporal Rigid-Body Motion for Scalable 4D Gaussian Splatting

会议: ECCV 2026
论文: ECCV 2026
项目页: TRiGS project page
领域: 3D 视觉
关键词: 4D 高斯泼溅、刚体运动建模、SE(3) 指数映射、动态场景重建、长序列可扩展性

一句话总结

TRiGS 把每个高斯基元的运动写成 se(3) 上的连续刚体轨迹——耦合指数映射给出旋转与平移、可见性窗口内的二次 Bézier 残差刻画非线性、逐基元局部锚点充当独立旋转中心——从而在 0.5M 基元、160 MB 的恒定预算下,把 SelfCap 的 600/900/1200 帧序列和 N3V 上的渲染质量同时推到最高。

研究背景与动机

从多视角视频重建动态场景是 VR/AR 与自由视点渲染的基础问题。3D 高斯泼溅把静态场景做到了实时高保真之后,4D 扩展迅速分成两条路线:一条是隐式形变场(Deformable-3DGS、DASH、LocalDyGS),用一个规范空间加神经场描述每帧的形变;另一条是显式路线(4DGS、STGS、Ex-4DGS 直到 FTGS),直接优化 4D 基元本身,或用显式函数参数化运动。显式路线目前在短片段上性能最好,代价是给了高斯极大的时序自由度——基元可以在任意时刻出现与消失,局部运动常用分段线性速度加一段很短的时序不透明度窗口来近似。

问题恰恰出在这份"自由"上。真实的运动轨迹是弯曲的,而线性假设天生无法跟随曲率:随时间推移,基元的线性外推会逐渐偏离真实几何,模型只能用不断删除、分裂、重建基元的方式去掩盖越积越大的空间错配。论文把这种现象称为时序碎片化(temporal fragmentation):物体丢失了长期的时序身份(同一块几何在相邻时刻由完全不同的基元负责),基元数量被迫持续增长。表现为两个直接后果——显存随序列长度膨胀(FTGS 从 600 帧到 1200 帧基元翻倍、显存 490 MB 涨到 977 MB;GIFStream 更涨到 2825 MB),以及质量随长度下滑(FTGS 的 PSNR 从 26.23 掉到 25.41)。更深一层的原因是,这类方法把旋转和平移当作两组独立参数分别优化,二者在渲染目标下可以互相补偿,形成大量近似等价的解,运动分解因此纠缠、误差随时间漂移;再加上所有基元共享同一个全局旋转中心,多个部件各自独立转动的场景根本无法被正确表达。

本文的切入点是:与其让基元"自由地"逐时刻乱动再靠数量补齐误差,不如把运动约束成一条连续且几何自洽的刚体轨迹核心 idea:在 se(3) 李代数上做层级参数化(可学习的基项 + 可见性窗口内的二次 Bézier 残差)并经指数映射得到耦合的 SE(3) 变换,绕每个基元自己的局部锚点施加;配合固定预算下的运动引导重定位,让少量基元就能长期跟随复杂非线性运动。

方法详解

整体框架

输入是标定的多视角动态视频,输出是可做新视角合成的时变场景表示。场景表示为一组 3D 高斯基元:每个基元有规范空间的均值 \(\mu_i\)、协方差 \(\Sigma_i\)、不透明度 \(\alpha_i\),外加两个时间参数——中心时刻 \(\mu_{t,i}\) 与时序尺度 \(s_{t,i}\),它们共同定义一个高斯型的时序可见性,把基元的"活跃区间"限制在中心时刻附近。查询任意连续时刻 \(t\) 时,基元的均值与协方差都由运动模型给出,再走 3DGS 的光栅化流程渲染。

整条管线可以概括为:用 RoMa 稠密匹配得到的点云初始化规范空间高斯 → 把运动参数化为 se(3) 上的系数 → 用可见性窗口内的二次 Bézier 残差对它做非线性精修 → 指数映射成耦合的 SE(3) 变换、绕局部锚点施加到基元上 → 泼溅渲染并以光度/SSIM 加运动正则监督;训练过程中每 100 次迭代做一次运动引导的重定位,在固定的基元预算内把容量从低不透明度的冗余基元搬到运动复杂的区域。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["RoMa 点云初始化<br/>+ 规范空间高斯"] --> B["耦合刚体运动参数化<br/>se(3) 指数映射"]
    B --> C["层级 Bézier 残差分解<br/>可见性窗口内平滑精修"]
    C --> D["局部锚点为中心的形变<br/>锚点投影规固定"]
    D --> E["泼溅渲染<br/>光度 + SSIM 监督"]
    E -->|每 100 次迭代| F["运动引导的重定位<br/>固定预算下容量再分配"]
    F --> B

关键设计

1. 耦合刚体运动参数化:让旋转与平移由同一个指数映射一起决定

要把单个高斯的位置写成刚体运动,最直接的写法是 \(\mu_i(t)=R_i(t)\mu_i+p_i(t)\),但把 \(R_i(t)\)\(p_i(t)\) 当两组互不相干的参数去优化是病态的——在渲染损失下旋转和平移能互相补偿,存在一整个连续族的近似等价解,优化因此纠缠、误差随时间累积漂移。TRiGS 的做法是干脆不在 SE(3) 上优化,而是在它的李代数 se(3) 上优化一个随时间变化的系数 \(\zeta_i(t)=(\omega_i(t),\nu_i(t))\),把从中心时刻到 \(t\) 的相对"对数参数"取为 \(\zeta_i(t)\Delta t\),再用指数映射一次性还原出旋转和平移:

\[\mathbf{T}_i(\mu_{t,i}\to t)=\exp\!\big(\hat{\mathbf u}_i(t)\big)=\begin{bmatrix}\mathbf R_i(t)&\mathbf p_i(t)\\ \mathbf 0&1\end{bmatrix},\qquad \mathbf u_i(t)=\zeta_i(t)\,\Delta t,\quad \Delta t=t-\mu_{t,i}\]

这里 \(\hat{\cdot}\) 是 se(3) 的标准 wedge 算子。展开后,旋转部分由 \(\phi_i(t)=\omega_i(t)\Delta t\) 走 Rodrigues 公式得到,平移部分不是自由参数,而是由 SO(3) 的左雅可比决定:\(\mathbf p_i(t)=J(\phi_i(t))\,\upsilon_i(t)\),其中 \(\upsilon_i(t)=\nu_i(t)\Delta t\)。这样做有两个直接好处。其一,\(\Delta t=0\)\(\mathbf u_i=0\),于是 \(\mathbf T_i(\mu_{t,i})=\mathbf I\) 恒成立——每个基元在自己的中心时刻严格回到规范位姿,轨迹不会相对该时刻漂移,也不需要额外引入解纠缠损失。其二,平移不再独立,而是"旋转轴作用之后剩下的那个位移",这正是刚体运动的几何含义;消融里 Naive SE(3)(仍用全局原点、且旋转平移独立优化)是全部配置中最差的一组,从经验上印证了这个耦合不是可有可无的工程细节。

2. 层级 Bézier 残差分解:只在基元真正被监督的时序窗口内刻画曲率

se(3) 系数虽然是连续函数,但若只取一个常数 twist,轨迹仍然是代数螺线,刻画不了真实的非线性加减速。TRiGS 把 \(\zeta_i(t)\) 分解成一个可学习的基项 \(\zeta_i^{\mathrm{base}}\) 和一段时间相关的残差 \(\zeta_i^{\mathrm{res}}(\tau)\),残差用二次 Bézier 曲线表示:基项承担整体的主导运动趋势,Bézier 曲线负责在其上做平滑的细粒度修正。这里有一个容易被忽略但很关键的设计——相加发生在李代数里而不是变换层面:se(3) 是向量空间,两个系数相加仍然是一个合法的 se(3) 元素,指数映射之后依然得到严格的刚体变换;若改成在 SE(3) 里叠乘一个残差变换,残差本身就必须是刚体变换,表达力反而被削弱。

残差的定义域被刻意收窄到基元有效的时序窗口 \(W_i=[\mu_{t,i}-2s_{t,i},\ \mu_{t,i}+2s_{t,i}]\) 内。理由来自时序不透明度 \(\gamma_i(t)=\exp\!\big(-(t-\mu_{t,i})^2/(2s_{t,i}^2)\big)\):它随距离迅速衰减,窗口之外的基元几乎拿不到任何梯度。在弱监督区域让模型自由外推只会带来漂移,所以作者把全局时间映射到窗口内的归一化坐标 \(\tau\in[0,1]\) 并做截断,再在 \(\tau\) 上定义残差:

\[\zeta_i^{\mathrm{res}}(\tau)=(1-\tau)^2\zeta_i^{(0)}+2(1-\tau)\tau\,\zeta_i^{(1)}+\tau^2\zeta_i^{(2)},\qquad \zeta_i(t)=\zeta_i^{\mathrm{base}}+\zeta_i^{\mathrm{res}}(\tau)\]

其中 \(\zeta_i^{\mathrm{base}},\zeta_i^{(0)},\zeta_i^{(1)},\zeta_i^{(2)}\in\mathfrak{se}(3)\) 都是可学习参数,旋转与平移分量一并被参数化——这也是它区别于"只给平移套样条"的做法:消融中的 Linear + Bézier 配置只对无约束的平移使用非线性曲线,PSNR 仅从 24.83 提升到 25.10,远不及把曲率放进 se(3) 的 Full 模型,说明非线性轨迹本身并不能替代几何一致性。

3. 局部锚点为中心的形变:每个基元自己的旋转中心 + 消歧的规范固定

把 SE(3) 变换直接作用在式 \(\mu_i(t)=R_i(t)\mu_i+p_i(t)\) 上,隐含假设所有基元绕同一个中心旋转;而真实动态场景里不同部件(四肢、车轮、被摆动的物体)各自有自己的转动中心。TRiGS 因此给每个基元配一个可学习的局部锚点 \(a_i\in\mathbb R^3\),让变换绕它发生:\(\mu_i(t)=R_i(t)\,(\mu_i-a_{i,\perp}(t))+a_{i,\perp}(t)+p_{i,\parallel}(t)\)

但锚点本身不是唯一可辨的——同一段形变可以被无数个 \((a_i,p_i(t))\) 组合解释,直接优化会产生另一种歧义。作者用一步规范固定(gauge fixing)消掉它:由于 \((I-R_i(t))\bar\omega_i(t)=0\)(绕自身轴旋转不改变轴方向),锚点沿旋转轴的分量落在这个变换的零空间里,从平移中根本观测不到。于是把锚点投影到垂直于旋转轴的平面上,\(a_{i,\perp}(t)=a_i-\langle a_i,\bar\omega_i(t)\rangle\bar\omega_i(t)\),平移部分也只保留沿旋转轴的分量 \(\upsilon_{i,\parallel}(t)=\langle\upsilon_i(t),\bar\omega_i(t)\rangle\bar\omega_i(t)\)。经过这一步,\(a_i\)\(p_i\) 的分解唯一,优化不再在等价解之间来回摆动——消融里去掉规固定是所有优化项中掉点最多的(PSNR 26.05 → 25.15),可见歧义不只是理论问题,它直接让平移分量失稳。协方差同步只做旋转 \(\Sigma_i(t)=R_i(t)\,\Sigma_i\,R_i(t)^\top\),方向跟随刚体转动、形状保持不变;原文把 SE(3) 指数映射的闭式、规固定的推导与小角度数值稳定化放在了补充材料里。

4. 运动引导的重定位:固定预算下把容量搬到真正需要的区域

在标准 3DGS 里,误差靠梯度驱动的 densification 不断分裂基元来消除——而基元数量的增长正是长序列塌陷的根源。TRiGS 反其道而行:整个训练不启用标准 densification,把基元总数锁死在 0.50M,改用一个周期性的重定位策略在常量预算内重新分配容量。每 \(N=100\) 次迭代,按不透明度把基元分成两组——低于阈值 \(\tau_\alpha=0.005\) 的冗余组 \(\mathcal I=\{i\mid\sigma(\alpha_i)<\tau_\alpha\}\) 与活跃组 \(\mathcal A\),然后从活跃组按权重 \(q_i\propto s_i\) 采一个"信息量大"的源基元,把它克隆出来替换 \(\mathcal I\) 中的一个元素;被替换者退出,总数不变。采样权重综合了基元的不透明度与运动难度线索(缓存中的该式排版损坏,具体权重定义见补充材料,⚠️ 以原文为准)。效果是把容量主动推向运动复杂、渲染误差大的区域,而不是等梯度去分裂新基元:这正是论文能用 0.5M 基元覆盖 1200 帧的原因,也是它显存恒定的直接来源。

损失函数 / 训练策略

总目标在 3DGS 的渲染损失之外加了运动正则项:

\[\mathcal L=\lambda_{img}\mathcal L_{img}+\lambda_{ssim}\mathcal L_{ssim}+\lambda_{reg}\mathcal L_{reg}+\lambda_{motion}\mathcal L_{motion}+\lambda_{rigid}\mathcal L_{rigid}\]

其中 \(\mathcal L_{reg}\) 沿用 FTGS 对基元参数的约束。\(\mathcal L_{motion}=\|b_i\|_2^2\) 惩罚二次 Bézier 控制点的二阶差分 \(b_i=\zeta_i^{(0)}-2\zeta_i^{(1)}+\zeta_i^{(2)}\),即残差曲线的"加速度"——旋转与平移分量都算,用来抑制轨迹的突然折弯,让窗口内的运动保持时间上平滑。\(\mathcal L_{rigid}\) 则鼓励空间近邻的运动一致:以规范空间中的 k 近邻为图(\(K=3\)),用基元 DC 球谐颜色 \(c_i\) 构造外观亲和度 \(K_{ij}\) 作为软权重,去对齐邻居的基项运动,使区域内部运动连贯、同时保留物体边界处的运动不连续(避免跨物体错误耦合)。超参为 \(\lambda_{reg}=0.01\)\(\lambda_{motion}=10^{-4}\)\(\lambda_{rigid}=1.0\)\(\lambda_c=50\);用 Adam 训练 30k 迭代,设置与 3DGS 一致;点云初始化来自 RoMa,全部实验在单张 RTX 4090 上完成。

实验关键数据

主实验

在 SelfCap 上把原始序列编辑成 600/900/1200 帧三种长度,考察长时序稳定性与可扩展性(表 1,自复现的 FTGS 标 *):

序列长度 指标 TRiGS FTGS* LocalDyGS 4DGS STGS
600 帧 PSNR↑ / SSIM↑ / LPIPS↓ 26.67 / 0.937 / 0.113 26.23 / 0.913 / 0.121 25.49 / 0.858 / 0.240 24.30 / 0.860 / 0.227 24.17 / 0.844 / 0.161
900 帧 PSNR↑ / SSIM↑ / LPIPS↓ 26.32 / 0.916 / 0.120 25.86 / 0.898 / 0.132 23.51 / 0.838 / 0.280 23.48 / 0.851 / 0.240 23.01 / 0.864 / 0.136
1200 帧 PSNR↑ / SSIM↑ / LPIPS↓ 26.05 / 0.904 / 0.099 25.41 / 0.871 / 0.146 24.24 / 0.884 / 0.116 23.28 / 0.851 / 0.233 25.34 / 0.734 / 0.100

标准长度基准 N3V 上同样领先(表 2),其中 † 为原论文自报结果、* 为本文复现:

方法 PSNR↑ DSSIM₁↓ DSSIM₂↓ LPIPS↓
FTGS† 32.97 0.028 0.014 0.043
FTGS* 32.80 0.021 0.040
LocalDyGS 32.28 0.028 0.014 0.043
Swift4D 32.23 0.014 0.043
DASH 32.22
Ex4DGS 32.11 0.030 0.015 0.048
STGS 32.05 0.026 0.014 0.044
4DGS 32.01 0.014 0.055
TRiGS 33.36 0.019 0.010 0.031

效率是这篇论文最有说服力的一张表(表 3):TRiGS 在三种长度下都维持 0.5M 基元、160 MB、110+ FPS,而对手的基元数与显存随序列单调上涨。

方法 600 帧(FPS / 基元 / 显存) 900 帧 1200 帧
GIFStream 94 / 6.47M / 1586 MB 98 / 8.85M / 2169 MB 102 / 11.53M / 2825 MB
4DGS 43 / 2.51M / 4665 MB 43 / 2.70M / 5021 MB 44 / 2.70M / 5015 MB
STGS 90 / 1.31M / 190 MB 83 / 2.01M / 291 MB 90 / 2.45M / 355 MB
FTGS* 113 / 2M / 490 MB 110 / 3M / 733 MB 106 / 4M / 977 MB
TRiGS 116 / 0.5M / 160 MB 111 / 0.5M / 160 MB 120 / 0.5M / 160 MB

消融实验

核心组件消融在 1200 帧序列上进行(表 4)。需要说明的是:Full TRiGS 因采用重定位而严格锁在 0.50M 基元、不做标准 densification,而被消融的基线配置被有意放开了梯度 densification——目的是测量各运动模型的上限能力,把它们硬压在 0.50M 会因无法跟踪轨迹而直接渲染崩溃。

配置 轨迹建模 锚点 基项参数化 PSNR↑ SSIM↑ LPIPS↓ 基元数 显存
Baseline Linear None 24.83 0.865 0.162 2.10M 512 MB
Naive SE(3) Rigid Body Origin SO(3)×R³ 23.95 0.842 0.198 2.85M 694 MB
Local SE(3) Rigid Body Local se(3) 25.52 0.891 0.125 0.60M 185 MB
Linear + Bézier Non-linear None 25.10 0.873 0.145 1.85M 450 MB
Full TRiGS Non-linear Local se(3) 26.05 0.904 0.099 0.50M 160 MB

优化组件消融同样在 1200 帧上(表 5):

配置 PSNR↑ SSIM↑ LPIPS↓ 说明
w/o Gauge Fixing 25.15 0.880 0.134 去掉锚点规固定,掉点最多(−0.90)
w/o Rigid Reg. 25.48 0.885 0.128 邻居运动失去对齐,表面出现轻微撕裂
w/o Motion Smoothness 25.66 0.892 0.115 轨迹抖动、时间上不一致
w/o Motion-guided Relocation 25.80 0.897 0.108 冗余基元无法回收,表征容量下降
Full TRiGS 26.05 0.904 0.099 完整模型

关键发现

  • 规固定是单项收益最大的设计:去掉它 PSNR 掉 0.90(26.05 → 25.15),比去掉任何一项正则都多。原因在方法里已经埋下——锚点沿旋转轴的分量处在 \((I-R)\) 的零空间,不消歧就会让平移分量的优化长期失稳,这属于"优化地形"层面的病态而非建模能力不足。
  • 独立的旋转/平移参数化是有害的,不只是不够好:Naive SE(3)(全局原点 + SO(3)×R³ 解耦优化)拿到全场最低的 23.95 PSNR,甚至低于纯线性基线(24.83)。这直接支撑了论文的核心论点——几何约束必须与耦合参数化同时成立,只加旋转不加耦合反而引入更多漂移自由度。
  • 显式模型的质量与规模并非必须绑定:允许 Naive SE(3) 分裂到 2.85M 基元、让 Baseline 分裂到 2.10M 基元后,它们仍达不到 0.50M 基元的 TRiGS(26.05)。也就是说,靠堆数量补轨迹误差是无效的——轨迹误差不解决,多出来的基元只是在掩盖结构错位,代价是 3-4 倍的显存。
  • 长度衰减的斜率差异比绝对值更说明问题:从 600 帧到 1200 帧,FTGS 的 PSNR 掉了 0.82(26.23 → 25.41)、显存涨了 2 倍;TRiGS 只掉 0.62(26.67 → 26.05)且显存恒定。对手在长序列上出现的是运动区域的 ghosting、模糊与结构退化(四肢、车轮等快速运动部位),而 TRiGS 在同样位置仍保留锐利细节。
  • 跨长度的普适性:在只有约 300 帧的 N3V 上,TRiGS 依然以 33.36 PSNR / 0.031 LPIPS 领先,说明它不是在长序列上靠某种折中取胜——每个基元的运动表达能力提升在所有长度上都有效。
  • 需要留意的对照口径:FTGS 官方代码未公开,表 1/3 中的 FTGS* 是作者复现的结果。复现在 N3V 上(32.80 对原文自报的 32.97)基本对齐、略低,这个差距在 1200 帧这种长序列上会被放大多少并没有被单独量化,长序列对比因此存在残余不确定性。

亮点与洞察

  • 把"运动表达能力"和"基元数量"解耦:主流做法是让基元更自由(可以任意出现/消失、短生命期、分段线性),出问题就加基元;TRiGS 反着来,把运动模型做厚、把基元预算钉死,再用重定位把这点预算推到难区。这个"加约束、减资源"的思路对任何资源受限的时序表示都值得借鉴。
  • 在向量空间里相加、在群上求值:把基项与 Bézier 残差都定义在 se(3) 里再相加、最后统一过指数映射,是这篇论文最精巧的一步——既获得了叠加多个运动来源的自由,又不破坏刚体性。反过来,若在 SE(3) 里叠乘,残差也被迫是刚体变换,表达力反而变弱。
  • 用可见性给参数化"划界":时序不透明度本来只是渲染时的可见性权重,这里被二次利用为"这个基元在哪段区间内真正被监督"的判据,进而成为 Bézier 残差的定义域与 clamp 边界。把正则/参数的活跃区间和梯度的实际支撑集对齐,是避免弱监督区漂移的通用手法,可以迁移到任何带时间窗或空间窗的表示上。
  • 规固定消除零空间歧义\((I-R)\bar\omega=0\) 这个恒等式把"锚点沿轴分量不可观测"变成了一条可以解析去除的自由度,代价为零、收益最大。凡是"旋转中心 + 平移"这类分解里存在不可辨识方向的设定(如两视图相对位姿、骨骼关节中心估计),都可以套用同一套投影消歧。

局限与展望

  • 刚体假设对非刚体形变是硬约束:协方差只做旋转 \(\Sigma(t)=R\Sigma R^\top\),基元不能拉伸、剪切或改变尺度,均值也只能沿刚体轨迹走。布料飘动、流体、烟雾、软体挤压这类真实形变只能靠大量基元各自刚性运动去"拼"出来,恰好是论文想避免的路径。论文自己也把"几何一致的刚体运动"作为前提陈述,没有讨论拓扑变化(撕裂、新表面出现)。
  • 依赖稠密匹配的点云初始化:全部实验用 RoMa 点云初始化,且强调"公平比较时所有方法用同一点云"。初始化质量对长序列的影响、以及在没有可靠稠密匹配的场景(弱纹理、反光)下是否会退化,论文没有给出敏感性分析。
  • 评测场景是编辑拼接出来的长序列:600/900/1200 帧是把原始 SelfCap 视频"编辑"构造的,并非原生拍摄的长视频。这种构造方式对运动统计与轨迹连续性的影响未被讨论,真实长视频(含场景切换、相机大幅运动)下的表现仍是未知。
  • 训练成本缺失:论文只报告了推理 FPS 与显存,没有给出训练墙钟时间或单卡 4090 上的训练开销。考虑到每个基元要额外优化锚点、se(3) 基项与三个 Bézier 控制点,训练成本与 3DGS/FTGS 的对比是读者会关心的数据。
  • 重定位的采样权重不透明:采样概率 \(q_i\propto s_i\) 依赖"归一化难度线索",正文把定义放在补充材料里(缓存中该公式排版损坏),而重定位的贡献在消融中并不小(−0.25 PSNR)。这部分的消融(换用不同难度线索、不同重定位周期)在正文中没有展开。
  • 可改进方向:把 \(J(\phi)\upsilon\) 换成带尺度/剪切的仿射指数映射(如允许对称的形变自由度)可以在保持"连续、少基元"优点的同时覆盖非刚体;把时序窗口的长度 \(s_{t,i}\) 也纳入重定位的决策(当前重定位只调整基元分布,不调整时间覆盖)可能进一步减少长序列中段的空白。

相关工作与启发

  • vs FTGS(FreeTimeGS): FTGS 是本文最直接的基线与对比对象——它用平移线速度加短时序不透明度窗口,让基元"随时随处出现",在 3DGS 之上把时序自由度开到最大。TRiGS 保留它的时序可见性设定与部分正则,但把运动模型从 \(\mu_i+v_i(t-\mu_{t,i})\) 换成完整的 SE(3) 层级轨迹。结果是 TRiGS 在短序列上更好、在长序列上的优势扩大(600→1200 帧质量差从 0.44 拉到 0.64 PSNR),而基元数只有其 1/4 到 1/8。
  • vs 4DGS / STGS / Ex-4DGS: 它们分别用 4D 体素-平面分解、时空特征、全显式基元参数化运动,共同点是运动参数彼此独立优化、缺乏几何耦合约束,长序列上基元与显存同步膨胀(4DGS 在 SelfCap 上稳定占用约 5 GB)。TRiGS 的差别不是模块替换,而是把"运动必须几何自洽"当作先验写进参数化里。
  • vs 隐式形变场(Deformable-3DGS / DASH / LocalDyGS): 这类方法以规范空间加神经场描述形变,本身没有显式的时序身份概念,长时间跨度下形变误差累积,需要靠正则与初始化调参抑制漂移;LocalDyGS 把场景切分到多个局部空间,思路与 TRiGS 的"局部锚点"有相通之处,但局部性来自空间划分而非运动模型本身。
  • vs Shape-of-Motion(样条运动先验): 该工作用自适应样条从单目视频重建 4D,同样强调运动的连续性;TRiGS 与它的区别在于把连续性建立在 SE(3) 刚体结构上,并且面向多视角长序列的可扩展性。需要说明的是,Shape-of-Motion 在本文中只出现在引用与相关工作里,并未进入任何对比表格,因此不能据此推断两者的相对性能(⚠️ 原文未做此实验)。

评分

  • 新颖性: ⭐⭐⭐⭐ 把 se(3) 指数映射、李代数内的层级 Bézier 残差与局部锚点规固定组合成一套完整的运动参数化,思路清晰且每项都有对应的消融支撑;单项技术(指数映射、Bézier、锚点)都非首创,价值在于"几何耦合"这一统一视角。
  • 实验充分度: ⭐⭐⭐⭐ SelfCap 三种长度 + N3V 的横纵向对比、四组消融(核心组件与优化项分开)、效率表都齐备;扣分在于长序列是对原视频编辑构造的、最强对手只能用自复现结果、训练成本未报告。
  • 写作质量: ⭐⭐⭐⭐ 动机链条(时序碎片化 → 基元增殖 → 显存爆炸)讲得很清楚,消融的论证与第 3 节的理论分析互相呼应;部分公式在排版上被拆散(尤其重定位的采样权重),需要对照补充材料阅读。
  • 价值: ⭐⭐⭐⭐ 在"长视频 4D 重建"这个显存受限的实际问题上给出了一个低成本、可直接替换运动模块的方案,160 MB / 1200 帧 / 110+ FPS 的常数开销很有实用说服力;最大的不确定性是刚体先验能覆盖多少真实场景。