跳转至

title: >- [论文笔记] Forge4D: Feed-Forward 4D Human Reconstruction and Interpolation from Uncalibrated Sparse-View Videos description: >- [ECCV2026][3D视觉][4D人体重建] Forge4D通过尺度对齐、流式状态token、双向运动匹配和遮挡感知高斯融合,从未标定稀疏视角视频重建人体与交互物体,并合成新视角和中间时刻。 tags: - ECCV2026 - 3D视觉 - 4D人体重建 - 高斯泼溅 - 新时刻合成 date: 2026-09-17


Forge4D: Feed-Forward 4D Human Reconstruction and Interpolation from Uncalibrated Sparse-View Videos

会议: ECCV2026
论文: ECCV 原文
领域: 3D 视觉
关键词: 4D人体重建、未标定稀疏视角、流式重建、稠密运动、新时刻合成

一句话总结

Forge4D将动态人体与交互物体的重建拆成尺度一致的流式3D高斯预测和双向稠密运动匹配,再通过遮挡感知融合生成中间时刻;在DNA-Rendering的新时刻与新视角联合评测中达到29.0378 dB PSNR,无需输入相机标定参数。

研究背景与动机

自由视点人体视频需要解决两件不同的事:既要从没有拍摄过的方向观察人,也要在没有拍摄到的时刻生成合理姿态。 衣物、手持物体和身体各部分可能具有不同运动,因此恢复一串静态模型并不自动得到连续的4D表示。 逐场景优化的动态NeRF或高斯方法通常依赖标定好的密集相机与长时间优化,难以满足稀疏采集和交互使用。 VGGT等几何模型让未标定图像的前馈重建成为可能,但点云本身并不等于具有高质量外观的可渲染资产。 AnySplat等方法进一步输出3D高斯,却仍以单个时刻为中心,没有直接给出中间时刻的运动。

把这些静态模型逐帧运行还有一个隐蔽问题:同一人体在相邻帧中可能被恢复到不同尺度。 这时表面上观察到的位移混合了真实动作与坐标尺度变化,后续运动学习就会把重建误差误当成物体运动。 直接将所有时间和视角的图像token送进全局注意力虽然能交换信息,却让显存和交互延迟随序列增长。 另一种依赖SMPL-X等参数化人体模板的路线能约束身体运动,但不容易覆盖自由衣物形变和复杂人类与物体交互。 因此,本文需要的是不依赖人体模板、又在时间上具有可比几何坐标的可渲染表示。

作者选择先保证相邻时刻各自的3D高斯可靠且尺度一致,再学习两组高斯之间的稠密对应。 这样,缺乏真实3D运动标注的问题可以转化为可观察的约束:移动后的高斯是否能够重现相邻帧,其投影运动是否符合图像光流。 中间帧不是独立生成的图像,而是由两端的3D表示运动到目标时刻后组合得到,因此还可以继续改变观察相机。 核心 idea:把4D重建变成“时间对齐的3D高斯流 + 显式双向运动匹配”,再根据遮挡关系融合两端表示,而不是直接回归一个纠缠几何与运动的整体。

方法详解

整体框架

输入是按时间对应的多个未标定RGB视频,主要实验使用4个输入视角;“未标定”指模型使用时无需提供输入相机参数,不表示训练不使用真实相机信息。 输出包括各输入时刻的像素对齐3D高斯、相邻时刻间的双向3D运动,以及用于合成中间时刻的融合函数。 每个高斯具有位置、不透明度、颜色、旋转和尺度,不依赖预设人体网格或骨骼绑定。 网络以预训练VGGT为基础,用DPT预测头将几何特征变成可供高斯泼溅渲染的属性。

整体依次经过尺度对齐重建、流式状态记忆、双向运动匹配和遮挡感知融合。 前两者建立时间上可比的关键帧几何,第三者说明这些几何点如何移动,最后一步决定哪些移动后的高斯应合并、哪些应保留。 训练按静态重建、流式对齐、运动与融合分阶段推进;使用时按视频时间更新状态,再对已经获得的相邻关键帧区间进行插值。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
        Input["未标定多视角视频"] --> Metric["尺度对齐重建"]
        Metric --> State["流式状态记忆"]
        State --> Motion["双向运动匹配"]
        State -->|两端高斯| Fusion["遮挡感知融合"]
        Motion -->|运动与对应关系| Fusion
        Fusion --> Output["中间时刻高斯<br/>新视角渲染"]
        Cameras["训练:真实相机<br/>与多视角图像"] -.-> Metric
        Adjacent["训练:相邻帧渲染<br/>与伪光流"] -.-> Motion
        Middle["训练:中间时刻图像"] -.-> Fusion

关键设计

1. 尺度对齐重建:先让几何和监督相机处于可兼容的尺度

VGGT预测的几何采用内部尺度,而数据集真实相机的平移使用现实尺度。 如果直接拿后一种相机去渲染前一种几何,即使相对形状正确,也会因为相机与点云尺度不一致得到错误图像。 因此,作者不是只给高斯头增加一个图像损失,而是同时处理监督坐标系的尺度歧义。 在相机旋转与平移方向已经合理的前提下,各输入相机平移长度的比例应该对应同一个尺度因子。 模型利用这些比例的平均值构造metric gauge,将新视角相机对齐到内部几何尺度,再施加图像监督。

相机损失约束旋转、归一化平移方向、各相机的相对尺度一致性,以及尺度预测头的输出。 尺度头学习该对齐因子,使模型使用时能够从图像预测现实尺度,而不需要再次读取真实输入相机。 这应理解为训练先验支撑的尺度估计,不是从任意未标定图像无条件恢复绝对长度的几何保证。 高斯属性头则通过输入视角和留出视角的渲染监督共同学习,防止模型只在给定视角看起来正确。 原文表7中移除尺度对齐后静态PSNR降至13.2884,说明这个步骤直接关系到优化是否能稳定进行。

2. 流式状态记忆:用递归状态传递时间信息,而非堆叠全部视频token

独立重建每一帧并不能保证不同时间的尺度一致,而全序列注意力又会累积大量图像token。 Forge4D引入可学习状态token,把已经看到的帧的信息压入递归更新的状态。 当前帧读取历史状态时,当前特征作为Query,状态token作为Key和Value,获得时间上下文。 更新状态时,角色反过来:状态token作为Query,读取当前帧特征,再把更新后的状态交给下一帧。 这不是简单给每帧贴一个时间标签,而是让历史几何信息持续影响当前重建。

与此同时,metric gauge从单时刻的多相机一致性扩展到跨相机、跨时间的一致性。 序列中的尺度预测因此受到共享尺度约束,避免身体在相邻帧中无缘无故变大或缩小。 状态记忆解决信息传递的计算组织,时间尺度监督解决传递什么约束,两者作用并不相同。 这种结构避免把全部历史图像显式送入一次全局注意力,但不能据此断言任意长度视频都完全没有漂移。 原文表7中的状态token消融支持时间对齐有益,论文没有在这里提供完整的长时漂移曲线。

3. 双向运动匹配:让高斯移动到相邻帧,而不只要求中间图像好看

新帧到达后,运动模块读取当前帧和上一帧的骨干中间特征,通过跨帧注意力建立对应。 模块包含与骨干数量相同的注意力块,并汇集这些块的输出,由运动DPT头预测像素对齐的3D运动。 它同时得到当前高斯向上一帧移动的后向运动,以及上一帧高斯向当前帧移动的前向运动。 因此,每个端点都有自己的几何和出发运动,不需要假定两帧高斯天然具有相同索引。

没有真实稠密3D运动标注时,只用中间帧的图像误差可能允许不合理运动被其他高斯属性补偿。 重定向损失把问题收紧:先仅改变当前高斯的位置,保留颜色、不透明度、旋转和尺度,然后在相邻时刻的相机下渲染。 位置变化可由原文第9页的重定向关系表达为:

\[ \mathbf{P}_i^{t\to t-1}=\mathbf{P}_i^t+\mathbf{M}_{i,1}^t. \]

这里的运动是相邻端点之间的位移,目标是让移动后的高斯重现另一时刻的外观。 需要注意监督对象的层级:第9页式(6)比较的是重定向高斯的渲染与相邻帧重建高斯的渲染,而不是提供真实3D点对应标签。 这些相邻帧重建本身已受到真实多视角图像监督,因而能作为运动学习的视觉约束。 引言对此有更概括的真实图像监督表述,本笔记保留方法节给出的具体区分。

作者再用SEA-RAFT产生二维伪光流,将预测3D运动投影到图像平面后进行比较。 前后向光流的循环一致性用于降低遮挡区域的权重,避免把不可见点的错误光流当作强监督。 这项约束补充了重定向渲染的歧义,但伪光流并不等于真实3D运动真值。 中间时刻的位置采用相邻帧之间的匀速假设:距离出发端点越远,施加的端点位移比例越大。 因此,“任意时刻”在这里是相邻已知时刻之间可查询的插值,不是对尚未观察到的未来进行预测。

4. 遮挡感知融合:只合并可对应的重复高斯,保留单侧可见内容

把两端高斯各自移动到目标时刻后,直接拼接会留下重复表面,直接平均则可能破坏遮挡边界。 Forge4D利用二维和三维运动的一致性判断两端点能否可靠对应。 具体做法是将一个高斯按3D运动送到相邻帧,同时通过投影光流在相邻帧检索候选高斯,再比较两者的3D位置距离。 若距离超过阈值,论文将其视为遮挡相关的不一致点,保留该端高斯而不强行融合。 距离较小的对应点则交给两层MLP融合属性,减少两端重复表示。

最终中间表示由保留下来的遮挡高斯和已经融合的非遮挡高斯共同组成,再从目标相机进行渲染。 融合MLP通过真实中间时刻图像的光度损失训练,不是运动学习之后完全固定的平均算子。 这个区别解释了为什么融合不只是节省高斯数量,还会影响亮度抖动和时序稳定性。 但这里的遮挡判定依赖预测运动与几何一致性,是模型估计而不是外部提供的可见性真值。

一个完整示例

设同一动作的4个视角都提供了时刻0和1的图像,目标是在时刻0.5从另一个相机观察人体及手持物体。 模型先利用尺度对齐重建两个端点,状态token把时刻0的信息传递到时刻1,使两端几何更容易比较。 运动模块随后预测0到1、1到0的高斯位移;匀速假设下,两端各移动其对应端点位移的一半。 如果手臂表面在两端都可可靠对应,融合MLP合并移动后的重复高斯。 如果物体遮挡让某些点只在一端可信,遮挡分支保留这些点,避免在融合时直接抹掉。 最后渲染时刻0.5的3D高斯,改变目标相机即可得到该中间时刻的新视角。 这是机制示例而非新增实验;它也说明系统必须看到时刻1,才能完成该区间的双向插值。

损失函数 / 训练策略

第一阶段组合相机损失、输入视角光度损失和留出新视角光度损失,建立静态重建能力。 光度监督包含L2、SSIM和LPIPS项;第二阶段再用跨时间的相机与尺度约束训练流式对齐。 第三阶段将运动匹配和新时刻融合监督组合起来,正文明确给出的损失关系为:

\[ \mathcal{L}_{4D}=\mathcal{L}_{\mathrm{matching}}+\mathcal{L}_{\mathrm{fusion}}, \qquad \mathcal{L}_{\mathrm{matching}}=\mathcal{L}_{\mathrm{flow}}+\mathcal{L}_{\mathrm{retarget}}. \]

骨干使用VGGT预训练权重,尺度头、位置与颜色偏移头以及相关注意力和运动模块采用零初始化。 训练数据来自DNA-Rendering的2,078个人体与物体交互视频序列,域内测试保留10个不同身份的全部序列。 当前全文缓存未包含文中引用的补充材料,无法核实其更完整的优化超参数和合成数据构建细节。 式(2)、式(3)、式(5)至式(8)的部分字符或排版受损,因此这里不重建相机损失、光流掩码或融合算子的完整精确公式。

实验关键数据

主实验

下表摘录原文第10页表1与表2;“输入时刻”测新视角,“新时刻”同时测插值和新视角。 主要条件为4个输入视角、约45度相机夹角,通常在518×518分辨率评测;GPS-Gaussian和L4GM使用512×512。 PSNR越高越好,单位为dB;SSIM越高越好,LPIPS越低越好。表中保留基线是否需要相机参数,避免抹平输入条件差异。

来源与时刻 数据集 方法 输入相机参数 PSNR SSIM LPIPS
表1,输入时刻 DNA-Rendering GPS-Gaussian 需要 24.2963 0.9247 0.0867
表1,输入时刻 DNA-Rendering AnySplat 不需要 26.1157 0.9430 0.1513
表1,输入时刻 DNA-Rendering Forge4D 不需要 29.8167 0.9606 0.0542
表1,输入时刻 Genebody AnySplat 不需要 25.8010 0.9287 0.1355
表1,输入时刻 Genebody Forge4D 不需要 28.0819 0.9523 0.0548
表2,新时刻 DNA-Rendering L4GM 需要 18.0325 0.9152 0.1367
表2,新时刻 DNA-Rendering Forge4D 不需要 29.0378 0.9566 0.0535
表2,新时刻 Genebody L4GM 需要 14.8572 0.9144 0.1727
表2,新时刻 Genebody Forge4D 不需要 27.4247 0.9459 0.0601

消融实验

下表摘录原文第14页表7中能清楚对应的行,场景为DNA-Rendering;静态和动态两组使用不同评测任务,不能混作同一消融基线。 原缓存的光流和高斯融合两行发生排版粘连,这里不猜配其数字。

评测任务 配置 PSNR SSIM LPIPS
静态新视角 完整模型 29.8167 0.9606 0.0542
静态新视角 去掉尺度对齐 13.2884 0.1194 0.2184
新时刻与新视角 完整模型 29.0378 0.9566 0.0535
新时刻与新视角 去掉状态token 28.5555 0.9513 0.0592
新时刻与新视角 去掉重定向损失 28.4124 0.9530 0.0573

关键发现

  • 新时刻合成保持了较强的跨数据集效果:Genebody上Forge4D为27.4247 dB,L4GM为14.8572 dB;这对应本文稀疏视角设置,不是对所有输入配置的普遍排序。
  • 尺度对齐是稳定训练的前提;在动态组,移除重定向损失和状态token都降低PSNR,支持“对应学习”和“时间对齐”并非可省步骤。
  • 第14页报告无融合时TL-STD为0.9446,有融合时为0.5379,前者高75.6%;该指标表示时间亮度标准差,越大意味着亮度抖动越明显,但缓存正文没有给出完整计算协议。
  • 第14页表6在H200上报告完整模型224.27 ms、4.45 FPS,插值10步后为225.10 ms、44.42 FPS;输出帧率增加主要来自插值,不能称为44.42 FPS的新输入重建。
  • 数值边界:表6另列10步插值1.46 ms,与总延迟行及第15页叙述不能完全对齐;第11页声称相对AnySplat“最高+2.28 dB”,但表1的DNA-Rendering差值为3.7010 dB。本笔记保留表格数值,不统一改写原文。

亮点与洞察

  • 尺度不是评测前的附带校正,而是影响新视角监督和运动学习的共同变量。先固定其一致性,才能避免把几何坐标漂移当作人体运动。
  • 重定向监督把渲染器变成运动匹配的检验器。它要求端点资产本身移动正确,而不仅是让新时刻图像看起来合理。
  • 遮挡区域不应一律交给平均融合。本文保留单侧证据的思路可用于其他时序点云或高斯资产融合,但仍需针对各自几何误差重新设计对应判定。

局限与展望

  • 作者明确指出大幅运动和较长帧间隔会降低性能,因为对应变少且匀速假设不再可靠。更高阶运动建模是合理方向,但本文未验证它的收益。
  • 主要输入覆盖人体正面,并使用4个视角;不能据此推断对单目、任意相机布局或完全不可见背部也同样稳定。
  • 真实尺度和稠密运动的定量验证使用合成MetaHuman4D,而非真实场景的完整运动真值。第12页表4的尺度点距离为0.0264 m,第13页正文写为0.02 m,应保留这个精度差异。
  • 双向插值依赖后一端点已经到达,H200上的输入处理速率也只有4.45 FPS。低延迟直播与高帧率插值输出是两种不同的系统要求。
  • 本缓存没有补充材料或可核验的代码链接,不能完整复现基线相机优化、运动真值构建与全部损失细节。

相关工作与启发

  • VGGT / AnySplat:前者提供几何先验,后者代表未标定输入的静态高斯重建;Forge4D进一步处理跨时间尺度一致性与新时刻资产合成,见原文第4至7页。
  • L4GM / SpaceTimeGS:二者具备新时刻合成能力,因此进入表2比较;本文强调在未标定稀疏多视角条件下学习人体特定的重建与运动先验,而非只比较表示形式。
  • POMATO / SEA-RAFT:前者在第12页表5作为稠密运动基线,后者为训练提供伪光流;几何对应与可渲染外观约束的结合,是比单独依赖二维运动更值得迁移的设计。
  • SMPL-X类模板方法:它们通过人体结构获得可动画化约束,Forge4D则选择像素对齐高斯来容纳衣物和交互物体。代价是不能自然获得模板模型的骨骼语义与动作控制接口。

评分

以下为阅读者主观评价,采用5分制,不是论文报告的实验指标。 - 新颖性: 4/5。把尺度对齐、流式重建和运动匹配结合得较完整,关键价值在约束之间的配合。 - 实验充分度: 4/5。有域内、域外、真实采集和消融评测,但运动与尺度真值主要来自合成数据。 - 写作质量: 3/5。方法分阶段逻辑清晰,正文与表格的若干数值不一致及缓存公式损坏增加核验成本。 - 价值: 4/5。对无需输入标定的人体与物体4D重建有实际参考价值,但输入延迟与大运动局限仍明显。