跳转至

JacobianAvatar: Temporally Consistent Semi-rigid Avatar Reconstruction from a Monocular Video

会议: ECCV 2026
论文: ECCV 官方页面
领域: 人体理解
关键词: 数字人重建, 神经雅可比场, 半刚性形变, 泊松求解器, 3D高斯泼溅

一句话总结

针对单目视频中人体自遮挡与非刚性动态导致的伪影与几何失真,JacobianAvatar 提出分层神经雅可比场建模半刚性形变,并结合带屏蔽项的泊松求解器、SDF法向正则与形变引导残差光流损失,实现了时序高度连贯的高保真可驱动人体化身重建。

研究背景与动机

从单目视频中重建具有逼真外观且可驱动的三维人体化身(Avatar)是虚拟现实、人机交互与视觉特效领域的核心课题。主流的半刚性形变建模范式通常将骨骼驱动的线性混合剥皮(Linear Blend Skinning, LBS)与局部非刚性形变相结合,以刻画衣服褶皱和姿态相关的几何细节。然而,绝大多数现有工作依赖单一姿态驱动的表面顶点偏移回归,不仅忽略了织物惯性、身体接触与运动速度等历史依赖效应,还过度依赖逐帧光度重构损失;在缺乏显式几何与运动约束的情况下,极易在大幅度运动和视角外推时产生时序闪烁、几何拉伸甚至将 2D 纹理错误烘焙进 3D 几何的伪影(Texture-copying artifacts)。

这一困境的核心矛盾在于:单目视频观测天然存在严重的自遮挡(如腋下、大腿内侧与背面)以及稀疏视角下的几何二义性,现有的隐式神经表示(如 NeRF 或 SDF)在空间拓扑快速变化时提取网格易失真且渲染速度慢,而显式 3D Gaussian Splatting(3DGS)虽渲染高效,但受限于模板骨架刚性,难以自适应地约束不可见区域的局部面积与法向连续性。直接优化每个面的形变梯度又会使泊松重构在未观测区域发散,破坏全局形状先验。

本文的切入角度是:利用神经雅可比场(Neural Jacobian Fields, NJF)在连续三角网格上显式表征每个面元(Face)的形变梯度,并从分层细化、全局形状正则与时序亚像素对应三个维度重构求解约束。核心 idea:构建由粗到细的分层神经雅可比场预测姿态驱动的半刚性形变,通过引入带屏蔽项的泊松求解器与 SDF 空间法向正则锚定不可见区域,并借助形变引导的残差光流损失显式对齐 3D 顶点投影流与 2D 稠密光流,实现拓扑保持且时序高度连贯的单目动态人体化身重建。

方法详解

整体框架

JacobianAvatar 的整体流水线分为规范模型初始化与分层动态化身建模。系统首先基于动量人体骨骼(MHR)初始化规范网格,借助可微网格渲染器与预训练视觉基础模型(Sapiens)预测的法向图和前景掩膜联合优化顶点位置与各帧骨骼姿态,得到精细化的基准网格 \(M^c\) 及其两级细分网格 \(M^f\)。随后,系统以由粗到细的策略训练两个多层感知机网络预测面元雅可比矩阵:粗粒度网络捕捉大范围全局形变,细粒度网络融合浅层特征并学习高频折痕;预测出的雅可比场通过引入屏蔽项的线性泊松系统解算顶点新位置。在网格表面完成几何与法向条件下的颜色拟合后,系统在网格面元上锚定 3D 高斯(3DGS),并通过形变引导的残差光流损失强力约束前后帧动作一致性,最终支持高保真、实时动态渲染。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["单目视频帧序列 + 初始 MHR 规范网格"] --> B["预处理阶段<br/>Sapiens 法向与掩膜引导的可微网格优化"]
    B --> C["分层神经雅可比场<br/>粗细双层 MLP 预测面元形变梯度"]
    C --> D["带屏蔽项的泊松求解器<br/>Cholesky 分解求解全局连续顶点位移"]
    D --> E["几何约束与时序正则<br/>SDF 空间法向对齐 + 形变引导残差光流损失"]
    E --> F["网格锚定 3DGS 渲染<br/>面元局部偏移与高斯属性的光度重构输出"]

关键设计

1. 分层神经雅可比场:解耦全局刚性骨架形变与局部高频褶皱 传统方法直接回归三维顶点的局部偏移量,在复杂姿态变化下容易造成表面自相交或局部网格拓扑塌陷。JacobianAvatar 将形变解耦为面元局部的形变梯度(雅可比矩阵 \(J_i \in \mathbb{R}^{3\times 3}\))。为了同时捕捉肢体剧烈摆动带来的一阶形变与衣物布料产生的细微折痕,方法引入了两阶段分层神经架构:首先在粗网格 \(M^c\) 上利用空间三平面(Tri-plane)特征提取器 \(\mathcal{E}^c\) 和 MLP \(\psi^c\) 预测粗级雅可比场 \(J_i^c = \psi^c(\mathbf{z}_i^c, \theta)\);随后在细分网格 \(M^f\) 上,细级网络 \(\psi^f\) 将粗层空间特征 \(\mathbf{z}_i^c\) 与细层特征 \(\mathbf{z}_i^f\) 拼接作为输入,条件化于当前帧姿态参数 \(\theta\) 预测细粒度雅可比场 \(J_i^f\)。这种从宏观到微观的渐进式形变建模保证了网格在学习局部丰富褶皱的同时,不会因高频噪声破坏整体骨架轮廓。

2. 带屏蔽项的泊松求解器:抑制未观测与弱纹理区域的形变发散 在得到预测的雅可比场 \(\mathbf{J}\) 后,必须通过最小化形变梯度与雅可比矩阵的狄利克雷能量将其转化为全局连续的网格顶点位置 \(\Phi\)。标准泊松求解器仅约束梯度的局部一致性,在单目视频存在盲区(如背面、腋下)时,未观测面元的雅可比矩阵缺乏光度梯度监督,极易引起整片区域网格剧烈拉伸与失真。为此,本文在能量泛函中引入屏蔽项(Screening Term),将顶点位置软锚定在初始规范网格 \(\mathcal{V}\) 上: $$ (L + \lambda_{\Phi} I)\Phi = \mathcal{A} \nabla \mathbf{J} + \lambda_{\Phi} \mathcal{V} $$ 其中 \(L\) 为余切拉普拉斯矩阵,\(I\) 为单位矩阵,\(\mathcal{A}\) 为网格面元质量矩阵。通过引入常数权重 \(\lambda_{\Phi}\)(粗网格设为 5,细网格设为 1),线性系统不仅能保持局部剪切与拉伸变形,还能利用可微 Cholesky 分解稳定高效地求解,杜绝单目输入中看不见的局部表面漫无目的地飞散。

3. SDF 空间法向正则:利用全局几何先验纠正翻转与伪影 单目视角的极端遮挡和稀疏性往往导致面元在迭代优化中发生法向反转(Flipped faces)或局部凹陷。JacobianAvatar 借助初始粗网格 \(M^c\) 构建三维离散有符号距离场(SDF)体素网格,并利用该体积先验约束形变后的规范化身表面法向。通过在变形网格的面中心和顶点处计算 SDF 的空间梯度,并取其反向归一化向量作为伪真值几何法向 \(\hat{\mathbf{n}}_{\text{SDF}}\),构建余弦相似度正则损失: $$ \mathcal{L}{\text{SDF}} = \lambda}} \sum_{a_i \in \mathcal{F}} \left( 1 - \hat{\mathbf{n}i^a \cdot \mathbf{n}}}(x_i) \right) + \lambda_{\text{vertex}} \sum_{v_j \in \mathcal{V}} \left( 1 - \hat{\mathbf{n}j^v \cdot \mathbf{n}(v_j) \right) $$ 该先验促使雅可比矩阵在隐空间沿着邻近等值面平滑演化,有效杜绝了不可见区域背部的突兀凹凸和几何错位。}

4. 形变引导的残差光流损失:跨帧显式亚像素运动对齐 逐帧独立计算的光度误差无法惩罚运动过程中的时序闪烁与滑移。JacobianAvatar 显式建立 3D 几何形变与 2D 稠密运动场之间的映射关系。对于相邻时刻 \(t\) 与 \(t-1\),将经过 NJF 形变和 LBS 蒙皮变换后的三维顶点投影到图像平面,获取像素级位移作为顶点属性,在渲染视口生成二维流场图 \(\mathbf{W}^t\)。为了避免传统直接对比光流带来的噪声污染,系统借助预训练光流估计网络 \(\mathcal{F}\)(基于 WAFT 架构)计算残差光流: $$ \Delta\mathbf{W}^t = \mathcal{F}(\mathbf{I}^t, \mathbf{I}^{t-1}, \mathbf{W}^t), \quad \mathcal{L}_{\text{residual}} = |\Delta\mathbf{W}^t|_1 $$ 当 3D 形变预测的 2D 投影位移与真实帧间运动完全对齐时,预训练流网络给出的修正量 \(\Delta\mathbf{W}^t\) 为零。该损失强力约束了复杂衣物和关节在动态时序中的亚像素对应,大幅提升了动态渲染的连续性。

损失函数 / 训练策略

模型的训练分步解耦进行。在网格优化阶段,总损失涵盖图像重构(\(\mathcal{L}_{\text{L1}}, \mathcal{L}_{\text{lpips}}, \mathcal{L}_{\text{ssim}}\))、Sapiens 伪真值监督的法向余弦损失 \(\mathcal{L}_{\text{normal}}\) 与掩膜损失 \(\mathcal{L}_{\text{mask}}\)、残差流损失 \(\mathcal{L}_{\text{residual}}\)、SDF 正则 \(\mathcal{L}_{\text{SDF}}\) 以及拉普拉斯平滑项。在随后的 3DGS 阶段,Gaussians 锚定于各网格面元,通过优化尺度、偏移与残差流损失对齐整幅视频画面。模型在单张 NVIDIA RTX 6000 Ada GPU 上端到端训练约 10 小时。

实验关键数据

主实验

论文在 MonoPerfCap、DNA-Rendering 和 NeuMan 三个真实单目基准数据集以及合成数据集 SynWild 上进行了详尽评测。在 MonoPerfCap 上评估新视角外推能力;在 DNA-Rendering 上评估宽松衣物的新视角合成;在 SynWild 上通过 ICP 对齐真实网格评测几何指标(Chamfer Distance \(CD \times 1000\)、Normal Error \(NE\) 以及 \(F_1\) 分数)。

数据集 指标 本文 (Ours) 次优 SOTA 提升/对比优势
MonoPerfCap PSNR ↑ 31.83 30.47 (ExAvatar) +1.36 dB
MonoPerfCap SSIM ↑ 0.978 0.980 (ExAvatar) -0.002
MonoPerfCap LPIPS (×100) ↓ 1.67 1.95 (GoMAvatar) -0.28
DNA-Rendering PSNR ↑ 29.90 29.46 (Vid2Avatar) +0.44 dB
DNA-Rendering LPIPS (×100) ↓ 2.19 2.37 (LSAvatar) -0.18
SynWild CD (×1000) ↓ 2.46 2.55 (LSAvatar) -0.09
SynWild Normal Error (NE) ↓ 0.091 0.091 (Vid2Avatar) 持平最优
SynWild F1@1cm ↑ 0.397 0.346 (Vid2Avatar) +0.051 (+14.7%)
SynWild F1@2cm ↑ 0.681 0.647 (Vid2Avatar) +0.034 (+5.3%)

消融实验

在 SynWild 数据集的 00000_random 场景中,作者针对四个核心组件进行独立消融以评估几何质量的影响:

配置 CD (×1000) ↓ NE ↓ 说明
Full model (本文完整模型) 3.01 0.102 几何与法向误差均达最优
w/o \(\mathcal{L}_{\text{SDF}}\) 3.51 0.113 去除 SDF 正则,罕见可见区域(如背部)严重变形,CD 恶化 16.6%
w/o \(\mathcal{L}_{\text{residual}}\) 3.01 0.106 去除残差光流损失,自遮挡区域(如腋下)出现几何伪影,法向误差显著升高
w/o Screened Poisson solver 3.28 0.106 移除屏蔽项退化为标准泊松,局部发生明显非物理拉伸,CD 显著上升
w/o Coarse-to-fine Strategy 2.96 0.107 缺少粗层引导,虽点距偏差相当,但表面产生高频毛刺与法向噪声(NE 升高)

关键发现

  • SDF 空间正则对全局拓扑稳定性贡献最大:去掉 \(\mathcal{L}_{\text{SDF}}\) 后,Chamfer Distance 从 3.01 剧烈恶化至 3.51,尤其在背部等单目视线盲区产生严重的凹凸伪影,证明隐式距离几何先验对解算欠定单目雅可比场不可或缺。
  • 残差流有效根除局部遮挡伪影:\(\mathcal{L}_{\text{residual}}\) 虽在整个人体尺度上对全身体积(CD)影响有限,但对法向误差(NE)改善极为显著(从 0.106 降至 0.102),能够精准压制腋下和大腿交界处由于遮挡产生的流动漂移。
  • 显式网格解耦避免了纹理复制伪影:传统隐式 SDF 方法(Vid2Avatar、LSAvatar、FacAvatar)在衣物带有高频印花图案时,极易将 2D 图案凹凸误当成几何褶皱刻入网格表面(Texture-copying artifacts);JacobianAvatar 依靠分层形变场独立于外观更新,法向图平滑干净。

亮点与洞察

  • 神经雅可比场向单目动态数字人的巧妙迁移:以往 NJF 多用于有完整 3D 监督的网格对齐,本文通过在泊松方程中引入基于初始姿态的屏蔽项(Screened Poisson),将其扩展至仅有弱单目视频投影监督的场景,兼顾了局部保角保形变能力与边界稳定性。
  • 以 2D 光流残差闭环矫正 3D 动态一致性:不同于常规粗暴计算预测流与 2D 光流的距离,本文巧妙利用预训练光流网络的残差流更新机制(\(\mathcal{F}\) 预测残差 \(\Delta \mathbf{W}\)),促使几何投影位移成为光流搜索的最优起点,实现了极低噪声的亚像素时序对齐。
  • 显式几何与 3DGS 渲染的优雅协同:以显式三角网格为主体承载变形,避免了隐式场 Marching Cubes 提取网格时的开裂和粗糙感,再在各面元锚定 3DGS,既拥有显式网格强大的空间形变鲁棒性,又具备高斯泼溅极快的实时渲染速率与细腻外观。

局限与展望

  • 极端宽松服饰建模受限:模型底层的粗级骨架仍严重依赖标准人体裸模(MHR / SMPL-X)的 LBS 蒙皮权重。对于长裙、大衣等运动与内部身体解耦明显的极宽松服饰,纯骨骼引导的雅可比场仍难免出现拉扯变形。
  • 暂未整合精细面部表情与手势:当前管线主要聚焦于躯干与四肢的半刚性衣服褶皱形变,未单独建立面部 Blendshapes 或手部专用形变参数网络,在需要高精微表情呈现的近景对话交互中略显不足。
  • 未来方向:可进一步探索将物理布料模拟先验注入细粒度雅可比场的自监督学习中,并将面部参数模型与全身体态联合驱动。

相关工作与启发

  • vs Vid2Avatar / LSAvatar / FacAvatar: 此类基于隐式 SDF 与 NeRF 的化身方案在几何提取时依赖 Marching Cubes,不仅运算迟缓,而且几何与纹理耦合导致印花被刻进法向;本文采用显式分层网格与 NJF 求解,几何平整无噪,在 SynWild 上的 F1@1cm 指标领先 5.1 个百分点。
  • vs ExAvatar / GoMAvatar: 此类基于显式网格锚定 3DGS 的方法受限于骨架刚性或简单位移偏移,遇到复杂衣物褶皱时缺乏物理形变约束;本文引入受控泊松求解器与残差流约束,在 MonoPerfCap 上渲染指标(PSNR 31.83 vs 30.47)展现出更强的跨姿态与新视角外推泛化力。

评分

  • 新颖性: ⭐⭐⭐⭐☆ [将神经雅可比场引入单目动态人体建模,设计了屏蔽泊松求解器与形变引导残差流损失]
  • 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 4 个公开数据集,兼顾渲染保真度、新视角外推以及真实 3D 几何法向精度评测]
  • 写作质量: ⭐⭐⭐⭐⭐ [动机链条清晰,数学推导完备,问题针对性强且图表详实]
  • 价值: ⭐⭐⭐⭐☆ [为单目视频高保真半刚性数字人重建提供了兼具拓扑稳定性和实时渲染潜力的通用方案]