Instant Expressive Gaussian Head Avatars at Over 100 FPS¶
会议: ECCV 2026
论文: ECCV 原文
领域: 3D 视觉
关键词: 3D高斯泼溅, 头部虚拟化身, 前馈编码器, 特征空间形变, 实时人像动画
一句话总结¶
论文针对人像动画在推理速度、3D多视角一致性与面部表情表现力之间的“三难困境”,提出了一种解耦运动基向量的特征空间前馈高斯形变机制,辅以扩散先验蒸馏策略,在保持严格3D一致性与细腻微表情的同时实现了107.31 FPS的高速动画渲染。
研究背景与动机¶
从单张面部肖像即时重建出支持自由视角观察与动态表情驱动的4D数字人化身,是虚拟现实、数字孪生与视频会议中的核心需求。近年来,基于2D视频扩散模型的人像动画方法在面部微表情、褶皱与唇形同步等细节保真度上取得了显著突破,但这类方法依赖昂贵的多步迭代去噪过程,推理延迟高且缺乏真正的底层3D几何表示,在大角度视角变换或连续旋转时常出现严重的几何畸变、纹理漂移与时间闪烁。
为了确保视角一致性,另一类前馈3D人像生成方法引入了神经辐射场(NeRF)或3D高斯泼溅(3DGS)。然而,早期3D方法多依赖预定义的3D变形模型(如3DMM或FLAME)作为运动先验,受限于线性基底的表达空间,难以建模皱眉、皱鼻或不对称微表情;后续尝试纯数据驱动的3D隐式方法(如基于全局三平面残差与多层自注意力融合)虽然拓宽了表现力,但在每个动画帧都需要进行全局上下文特征聚合,导致计算负载激增,推理帧率普遍停留在几帧到十几帧每秒。这导致现有方案陷入了速度、3D一致性与表情丰富度无法兼得的“人像动画三难困境”(Portrait Animation Trilemma)。
本文的切入角度是:无需在全局3D结构(三平面)上反复执行沉重的注意力特征融合,而是将静态3D几何与动态面部运动完全解耦到离散的3D高斯基元上,让每个高斯携带个性化的静态运动基向量并在高维特征空间独立形变。核心 idea:将面部运动建模为解耦运动基向量在高维特征空间的局部轻量残差预测,并通过正脸化扩散先验与多视角几何监督进行蒸馏,实现端到端107 FPS的高保真3D一致人像动画。
方法详解¶
整体框架¶
整体框架包含单目3D高斯提升重建与轻量特征形变驱动两个核心阶段。在重建阶段,前馈编码器接收源图像 \(I_s\) 并将其提升为带有96通道的三平面特征表示,通过光线投射与重要性采样离散化出约20万个3D高斯基元,每个基元从三平面中解耦提取几何特征 \(f_i\) 与静态运动基向量 \(m_i\)。在动画阶段,预训练的运动编码器提取源图与驱动图的1D紧凑运动系数,轻量级运动解码器利用AdaLN机制调制每个高斯的运动基向量,直接预测特征残差 \(\delta f_i\)。最终,叠加残差的高维特征向量被非线性MLP解码为3D高斯的几何与外观属性,并通过可微光栅化高效渲染出任意视角的驱动结果。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["单张源人像图像 $I_s$"] --> B["前馈三平面提升与运动基向量解耦<br/>编码96通道三平面并采样几何特征 $f_i$ 与静态运动基 $m_i$"]
C["驱动图像 $I_d$ 与源图像 $I_s$"] --> D["紧凑运动系数提取<br/>冻结运动编码器 $M$ 输出1D运动系数 $M(I_s), M(I_d)$"]
B --> E["高维特征空间局部形变机制<br/>AdaLN调制运动基 $m_i$ 并通过轻量MLP预测残差 $\delta f_i$"]
D --> E
E --> F["高斯属性非线性解码与光栅化渲染<br/>解码高斯位置/尺寸/旋转/不透明度/颜色并渲染为 $I'_d$"]
F --> G["驱动重演视角输出(107.31 FPS)"]
关键设计¶
1. 基于三平面的高斯采样与个性化运动基向量解耦:彻底免除逐帧三平面重建计算 传统的隐式3D动画方法(如Portrait4D或VOODOO-XP)在每一帧驱动时都必须重新计算或更新整个人脸的全局三平面特征网格,引入了极大的计算冗余。本文改造了LP3D的2D到3D提升架构,将单张源图像编码为包含96个通道的神经三平面 \(\{T_{xy}, T_{yz}, T_{zx}\}\)。通过从固定前置视角发射光线并结合不透明度两步重要性采样,确定约20万个空间点位置 \(x_i\)。查询三平面时,前48个通道聚合生成静态几何与外观特征 \(f_i \in \mathbb{R}^{48}\),后48个通道则生成专属的运动基向量 \(m_i \in \mathbb{R}^{48}\)。该基向量 \(m_i\) 类似于经典面部混合变形(blendshape)或面部肌肉系统中的局部变形基底,但在训练中纯数据驱动学习,能够紧凑编码个体特异性的运动潜能(如局部皱纹伸缩性),且在整段动画序列中保持冻结,使源人像的3D提升只需在初始帧执行一次(耗时仅约20ms)。
2. 高维特征空间局部形变机制:摆脱低维空间形变的表征瓶颈 现有的动态3DGS方法大多选择直接在低维物理空间中对高斯属性施加位移残差(例如直接预测位置偏移 \(\Delta \mu\)、旋转 \(\Delta q\) 和缩放 \(\Delta s\))。然而,低维几何空间的形变往往难以刻画复杂的非线性微表情、不对称皱鼻以及面部光影重合引起的颜色和微细透明度变化。本文提出在高维特征向量空间对高斯基元进行局部形变:利用预训练且冻结的运动编码器 \(M\) 提取源图与驱动图的紧凑运动系数 \(M(I_s), M(I_d) \in \mathbb{R}^{512}\),拼接后作为条件输入单层自适应层归一化(AdaLN)模块,调制各高斯的运动基向量 \(m_i\)。接着,通过仅含单隐藏层(96个单元)的紧凑MLP运动解码器 \(\Psi\) 独立输出特征残差 \(\delta f_i\):
高斯属性解码器 \(\Phi\) 同样为单隐藏层MLP,直接将叠加扰动后的48维特征非线性映射为高斯的位置 \(\mu_i\)、尺度 \(s_i\)、四元数旋转 \(q_i\)、不透明度 \(o_i\) 和颜色 \(c_i\)。由于每个高斯基元仅依赖自身的 \(m_i\) 与全局标量系数完成局部更新,完全摒弃了跨空间网格的全局交叉注意力交互,计算复杂度极低,同时让网络能够自主在平滑的高维流形上捕捉阴影、细微皱纹与大幅度几何变形。
3. 前额化扩散先验蒸馏与多视角几何解耦监督:兼取表达力并消除2D幻觉 为了在缺乏大规模极端表情3D多视角真实数据集的情况下学习细腻微表情,作者利用前沿2D面部扩散模型X-NeMo构建训练集(覆盖FFHQ的6万个真实身份,每人合成8种极端表情)。然而直接使用2D扩散驱动的多视角图像会导致视角漂移与幻觉几何。本文提出严格的两阶段几何先验解耦策略:首先利用预训练的LP3D模型将真实人像前额化(frontalize),X-NeMo仅在正脸视角下驱动生成极端表情,规避了大姿态下扩散模型的结构崩塌与纹理幻觉;随后,在训练循环中实时调用冻结的LP3D模型从正脸驱动图生成随机视角图像作为多视锥立体几何监督,确保渲染出的新视角 \(I'_d\) 在3D几何上严格刚性一致。
损失函数 / 训练策略¶
模型采用自重演(self-reenactment)目标进行端到端优化,总损失函数联合了像素级与感知级监督:
其中,超参数配置为 \(\lambda_{\text{L1}} = 1.0\),\(\lambda_{\text{LPIPS}} = 1.0\),身份保持损失权重 \(\lambda_{\text{ID}} = 0.1\)。为了强化面部关键活动区域的保真度,\(\mathcal{L}_{\text{Detail}}\)(权重0.1)专门对眼睛与嘴唇区域计算局部高权重L1损失;\(\mathcal{L}_{\text{Norm}}\)(权重0.001)正则化预测特征残差 \(\delta f_i\) 的平均L2范数以促使运动稀疏化;\(\mathcal{L}_{\text{adv}}\)(权重0.025)引入条件于运动系数的对抗判别器以增强高清细节生成。训练基于Adam优化器,学习率为 \(5\times 10^{-5}\),批量大小为32,渲染分辨率从64递增渐进式提升至512。
实验关键数据¶
主实验¶
在VOODOO-XP包含极端表情与大视角的测试集上进行跨身份驱动(Cross-reenactment)定量评测,结果如原论文Table 2所示(MEt3R衡量多视角3D稠密不一致性,EMO衡量情绪相似度,AED衡量FLAME表情系数平均距离,APD衡量姿态误差,FPS在NVIDIA 6000 Ada GPU上端到端流式测得):
| 方法类别 | 方法名称 | MEt3R ↓ | ID ↑ | EMO ↑ | AED ↓ | APD ↓ | FPS ↑ |
|---|---|---|---|---|---|---|---|
| 2D | LivePortrait | 0.033 | 0.74 | 0.716 | 0.810 | 0.026 | 78.12 |
| 2D | HYPortrait | 0.032 | 0.74 | 0.752 | 0.900 | 0.077 | 0.01 |
| 2D | X-NeMo | 0.035 | 0.72 | 0.760 | 0.805 | 0.032 | 0.03 |
| 3D | GAGAvatar | 0.034 | 0.77 | 0.654 | 0.888 | 0.025 | 0.41 |
| 3D | InvertAvatar | 0.028 | 0.80 | 0.565 | 0.891 | 0.049 | 0.07 |
| 3D | VOODOO-XP | 0.032 | 0.77 | 0.699 | 0.903 | 0.028 | 5.45 |
| 3D | Portrait4D-v2 | 0.035 | 0.79 | 0.589 | 0.886 | 0.029 | 14.50 |
| 3D(本文) | Ours | 0.028 | 0.76 | 0.785 | 0.731 | 0.028 | 107.31 |
注:原论文Table 2中,本文方法取得了全场最低的表情误差AED(0.731)与最高的情绪表达得分EMO(0.785),同时以107.31 FPS的端到端吞吐量大幅领先所有基线。
消融实验¶
在VOODOO-XP测试集上评估各关键模块对自重演(Self-reenactment)性能的影响(分辨率 \(128 \times 128\),对应原论文Table 3):
| 实验配置 | MEt3R ↓ | PSNR ↑ | SSIM ↑ | LPIPS ↓ | AED ↓ | IoU ↑ | 模型显存占用 ↓ | 推理 FPS ↑ |
|---|---|---|---|---|---|---|---|---|
| Ours 完整模型 | 0.073 | 23.18 | 0.785 | 0.104 | 0.507 | 0.88 | 0.32 GB | 132.87 |
| 替换为 DINO-v2 运动编码器 | 0.074 | 22.88 | 0.776 | 0.110 | 0.597 | 0.87 | 4.32 GB | 22.47 |
| 替换为真实数据集(CelebVText) | 0.073 | 23.10 | 0.782 | 0.109 | 0.543 | 0.88 | 0.32 GB | 132.87 |
| 替换为低维物理空间形变(Spatial Def.) | 0.075 | 23.27 | 0.788 | 0.109 | 0.634 | 0.89 | 0.27 GB | 141.61 |
关键发现¶
- 特征空间形变是捕捉细腻表情的关键:当退化为传统动态3D高斯的物理空间位移(Spatial Deformation)时,虽然由于略过了非线性解码器使FPS小幅提升至141.61,但表情误差AED从0.507大幅恶化至0.634,无法生成生动的局部微皱纹与不对称肌群运动。
- 合成扩散先验的必要性:改用真实视频数据集(CelebVText)训练后,由于真实视频中极端表情和大幅度运动样本稀缺,模型在面对激烈表情驱动时表现出明显的表情淡化(muted expressions),AED由0.507恶化至0.543。
- 轻量解耦运动架构的极致效率:静态特征提升耗时仅20ms且只需单次计算,驱动阶段每个高斯基元仅经由单隐藏层MLP并行更新,显存占用仅0.32 GB至0.4 GB,运行速度达到107.31 FPS,较扩散模型(0.01~0.03 FPS)快了3~4个数量级。
亮点与洞察¶
- 巧妙的解耦基向量设计:将三平面通道拆分为48维几何特征与48维运动基向量,赋予了每个高斯基元类似于传统动画中局部混合变形(blendshape)的自适应动态潜能,既保证了个体身份特异性,又免去了逐帧聚合全局上下文的注意力开销。
- 高维特征空间形变的表达力优势:揭示了3D高斯在低维欧氏坐标系中直接位移的局限,利用高维隐空间的光滑流形映射非线性微表情与局部阴影变化,以极低的参数代价换取了媲美甚至超越2D扩散模型的表情丰富度。
- “正脸扩散合成 + 跨视锥多视角蒸馏”的先验迁移范式:巧妙化解了2D扩散模型强大动态先验与多视角几何漂移之间的矛盾,为利用2D基础模型指导3D/4D前馈生成提供了标准范式。
局限与展望¶
- 复杂几何配件重建困难:对于精细透明或薄壁物体(如带有高反射或折射的眼镜、复杂头饰),受限于前馈单目提升与固定分辨率高斯采样,难以精确还原微细几何边缘与光影变化。
- 解耦光照与反射的不足:当前高斯的外观属性未显式分离光照、法线与表面材质,在大范围动态光影变化场景下可能产生轻微烘焙感。
- 驱动模态可拓展性:目前主要展示了基于单张参考图像的表情驱动,未来可进一步将语音音频或文本指令映射至1D紧凑运动系数,实现多模态全驱动数字人系统。
相关工作与启发¶
- vs LivePortrait / X-NeMo(2D驱动方法):2D方法受限于多步去噪(X-NeMo仅0.03 FPS)或缺乏显式3D几何,大角度视角下存在严重闪烁变形;本文在保持严格3D一致性(MEt3R 0.028优于X-NeMo的0.035)的同时,将推理速度推升到107 FPS。
- vs Portrait4D-v2 / VOODOO-XP(3D三平面隐式驱动):先前3D方法在三平面网格上执行密集全局自注意力融合,推理帧率受限(5.45~14.50 FPS);本文通过局部高斯基元独立形变,摆脱了全局注意力计算瓶颈,帧率提升7~20倍。
- vs GAGAvatar / InvertAvatar(3DMM参数化驱动):参数化模型受限于线性先验,无法逼真呈现皱鼻、不对称动态等微表情;本文采用无参数模型的数据驱动隐式形变,表情距离AED显著更优(0.731 vs 0.888~0.891)。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐(解耦运动基向量与高维高斯特征空间形变设计精巧,有效打破了三难困境)
- 实验充分度: ⭐⭐⭐⭐⭐(涵盖自重演、跨身份重演、微表情分析及全模块消融,对比基线全面且翔实)
- 写作质量: ⭐⭐⭐⭐⭐(逻辑链条清晰,图表与三难困境对比可视化生动直观)
- 价值: ⭐⭐⭐⭐⭐(端到端107 FPS的高保真实时表现为低延迟XR与具身智能人机交互落地提供了极具实用价值的范式)