RegHead: Non-Humanoid Head Blendshapes via Feed-Forward Registration¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://snap-research.github.io/RegHead/
领域: 3D 视觉
关键词: 非人形态头像、Blendshapes、前向配准、随机锚点、实时重定向
一句话总结¶
针对非人形态 3D 头部缺乏拓扑对应与表情标注数据的难题,RegHead 构建了约 2 万个涵盖统一定义表情词表的非人头像数据集,并提出拓扑无关的密集随机锚点运动表征与粗到细前向配准网络,无需真实对应标签即可单次前向输出语义一致的 Blendshapes 并实现人类面部驱动的实时表情重定向。
研究背景与动机¶
构建可驱动的非人形态 3D 头部数字人(如动漫角色、动物化身与奇幻生物)在虚拟社交、AR 交互与游戏娱乐中需求巨大。传统的 Blendshape 线性混合模型依赖固定的一组表情基底和共享的顶点拓扑,能够通过低维权重向量提供高效、直观且支持跨身份重定向的实时动画接口。然而,现有的 Blendshape 自动化方案高度绑定于人脸参数化先验(如 3DMM),当面对具有长吻部、异形口鼻、下颌特殊开合等非人形态解剖结构时,既有人脸模板与预定义骨骼先验彻底失效;而若完全依赖人工逐帧绑定或基于逐实例的非刚性曲面配准优化,耗时极长且不可扩展。
要实现非人形态 Blendshape 的高效自动化构建,现有前沿方法主要卡在三个相互交织的瓶颈:第一,大规模且语义一致的 2D 跨身份表情生成数据极度匮乏,现成图像编辑模型难以在保持非人身份不变的同时稳定触发特定的局部表情动作;第二,现代 3D 生成模型虽然能根据各表情图像重构出独立 3D 网格,但不同表情网格之间不存在顶点对应关系(Topology-unregistered),且基于隐式场或逐序列网格优化的方法推理耗时巨大(单网格往往需数分钟到半小时);第三,非人头部的表情运动具有极强的局部性与物种特异性(例如眼睑眨动、特殊口角拉扯),全局网格形变或稀疏骨骼绑定网络难以兼顾大范围位移与微米级局部几何精细度。
本文切入的角度是:摆脱预定义骨骼与人脸模板的束缚,通过编辑模型将艺术精修词表规模化拓展为大规模跨身份表情数据集,进而将传统耗时的逐实例非刚性配准过程参数化为一个通用的前向深度神经网络。核心 idea:构建约 2 万个具有共享表情词表的非人形态 3D 数据集,提出无模板、无骨骼的密集随机锚点运动表征,并结合粗到细的双阶段特征匹配前向配准网络,在仅依赖点云可微渲染监督下端到端预测从静态中性网格到各表情的 Blendshape 变形基底。
方法详解¶
整体框架¶
RegHead 的输入为一个目标身份的中性网格 \(\tilde{\mathcal{M}}_0\) 以及该身份在预定义表情词表 \(\mathcal{E}=\{e_t\}_{t=1}^T\) 下未建立顶点对应关系的独立表情几何网格 \(\{\tilde{\mathcal{M}}_t\}_{t=1}^T\)。整个系统的输出是与中性网格保持严格相同顶点拓扑与点序的语义 Blendshape 基底 \(\{B_t\}_{t=0}^T\)。
整体前向管线分为三个协同模块:首先,将中性网格与目标表情网格体素化并提取融合多视角未投影语义分割的多模态体素 Token;其次,在中性表面密集采样无固定坐标的随机锚点,通过全局匹配器先聚合长程上下文、预测粗略形变以使锚点进入正确的位移吸引盆;随后,多半径有效性感知结构化模板在体素特征场中收集邻域 Token,由局部匹配器计算残差相似度变换并更新锚点;最后,通过线性混合蒙皮(LBS)将稀疏锚点位移传播至中性网格的密集表面查询点,并采用高斯泼溅可微点云渲染计算光度与几何损失进行自监督训练。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入:中性网格与目标表情网格<br/>体素化与多视角投影特征提取"] --> B["密集随机锚点采样<br/>无模板表面控制点与稀疏到稠密权重"]
B --> C["全局粗匹配阶段<br/>长程交叉注意力对齐大范围刚体/颌骨运动"]
C --> D["结构化多半径模板邻域检索<br/>结合有效性掩码过滤空白体素"]
D --> E["局部精匹配与锚点图融合<br/>局部交叉注意力预测相似度残差变换"]
E --> F["输出:语义对应 Blendshapes<br/>支持低维权重线性混合与实时人脸驱动重定向"]
关键设计¶
1. 密集随机锚点运动表征:摆脱拓扑与骨骼先验的局部自适应控制 针对非人类物种千差万别的头骨形态与软组织分布,传统基于固定关节点或预设模板网格的参数化方法根本无法覆盖长嘴、异形眼眶等奇异解剖结构。本文提出一种完全拓扑无关的密集随机锚点(Dense Stochastic Anchors)表征:在中性网格表面随机撒布 \(K=3000\) 个锚点作为局部几何形变控制节点。至关重要的是,模型在训练时每个迭代都重新随机采样锚点位置,既不冻结也不将锚点坐标作为可学习参数优化。这种训练期随机重采样机制强制网络学习到“对锚点几何排布不敏感”(Layout-invariant)的变形预测能力。在将锚点位移传递给密集查询点时,预先根据局部马氏距离归一化计算各点与其最近的 \(K'=10\) 个锚点之间的混合蒙皮权重,单次前向通过各锚点的局部相似度变换加权求和,即可保证形变支撑域高度局部化,计算代价与锚点数保持严格线性关系。
2. 粗到细前向配准匹配器:大尺度位移与微表情的协同求解 在从体素特征中预测各锚点形变时,若直接使用局部邻域匹配,当下颌张开等大范围运动发生时,位移量往往远超局部检索半径,造成局部匹配器在错误的解剖部位迷失;而单纯全局注意力又难以还原眼睑开闭等高度微小的局部纹理变化。RegHead 创新性地构建了双阶段匹配机制:第一阶段全局匹配器(Global Matcher)将中性锚点 Token 与目标网格中全局有效体素 Token 进行全局交叉注意力交互,输出粗略锚点变换 \(\mathcal{T}_k^{t,0}\) 并将锚点粗变形到目标位置附近;第二阶段局部匹配器(Local Matcher)以粗对齐后的锚点为中心,构建结构化多半径球壳模板(Multi-radius Stencil),在目标体素场中采样不同半径厚度壳层上的特征,并引入有效性掩码(Validity Mask)剔除网格外部空白体素,最后通过局部交叉注意力计算残差形变 \(\Delta \mathcal{T}_k^t\),两者复合生成最终的锚点相似度变换 \(\mathcal{T}_k^t = \Delta \mathcal{T}_k^t \circ \mathcal{T}_k^{t,0}\)。
3. 无需真值对应的可微高斯渲染端到端监督 现实中无法获取非人形态网格跨表情间的逐顶点配对真值(No Ground-Truth Point Correspondence)。为彻底解决自监督训练难题,RegHead 将变形后的查询点云与目标网格提取的密集表面点云均建模为各向同性 3D 高斯点(Isotropic Gaussian Splats),在随机虚拟相机位姿下执行可微投影渲染。网络同时计算预测渲染图与真实渲染图之间的颜色光度差异、感知相似度(LPIPS)以及眼睛语义区域的分割一致性损失;同时对粗变形锚点施加与目标降采样点云之间的 Chamfer Distance 几何距离惩罚: $\(\mathcal{L}_{\mathrm{rend}} = \mathbb{E}_{\pi}\Big[ \|\mathcal{R}_{\mathrm{rgb}}(\hat{\mathbf{Q}}^t;\pi) - \mathcal{R}_{\mathrm{rgb}}(\mathbf{P}^t;\pi)\|_1 + \lambda_{\mathrm{lpips}}\mathcal{L}_{\mathrm{lpips}} + \lambda_{\mathrm{seg}}\|\mathcal{R}_{\mathrm{seg}}(\hat{\mathbf{Q}}^t;\pi) - \mathcal{R}_{\mathrm{seg}}(\mathbf{P}^t;\pi)\|_1 \Big]\)$ 该设计使网络在纯无监督几何匹配下能够稳定收敛,不仅避免了表面网格可微光栅化的网格撕裂问题,还借助 2D 渲染反向传播得到了极其平滑连续的非刚性变形场。
4. 基于轻量映射网络的实时人脸表情重定向 获得拓扑统一且具备标准语义基底的 Blendshape 后,为实现虚拟主播、元宇宙社交中的低延迟驱动,系统接入通用单目人脸追踪管线提取真人面部的 3DMM 表情系数与头部姿态。通过训练一个极轻量的离线 MLP 网络 \(g_\psi\),直接将人脸 3DMM 表情系数线性投射为非人形态 Blendshape 词表的权重系数 \(\mathbf{w}^t = g_\psi(\mathbf{w}^{\mathrm{hum}})\),避免了每帧运行非刚性匹配重优化的延迟,配合头部刚体位姿变换,实现了在普通算力设备上高帧率驱动异形生物头部。
损失函数 / 训练策略¶
模型总训练损失函数由渲染一致性损失 \(\mathcal{L}_{\mathrm{rend}}\) 与粗匹配锚点几何损失 \(\mathcal{L}_{\mathrm{coarse}}\) 加权组合而成: $\(\mathcal{L} = \mathcal{L}_{\mathrm{rend}} + \lambda_{\mathrm{coarse}} \mathcal{L}_{\mathrm{coarse}}, \quad \text{其中} \quad \mathcal{L}_{\mathrm{coarse}} = \mathrm{CD}(\mathbf{A}^t, \mathbf{P}_{\mathrm{sub}}^t)\)$ 训练采用 AdamW 优化器(学习率 \(1\times 10^{-4}\),权重衰减 \(10^{-4}\)),在 32 张 A100 (80GB) GPU 上使用混合精度训练 2000 个 Epoch,在约 1500 Epoch 时达到平稳收敛。
实验关键数据¶
主实验¶
实验在包含 200 个未见测试身份、每个身份 7 种标准表情的测试集上展开全面评测。对比基准涵盖当前最具代表性的网格运动前向网络 ActionMesh,以及优化基准 V2M4 和 T2Bs。评估涵盖渲染图像质量指标(PSNR、SSIM、LPIPS)与多视角首击可见几何曲面指标(Chamfer 距离 CD、绝对深度误差 D-Err、法线一致性 N-Cons、轮廓交并比 Sil. IoU),并记录单身份生成耗时。
| 方法 (Method) | PSNR ↑ | SSIM ↑ | LPIPS ↓ | CD ↓ | D-Err. ↓ | N-Cons. ↑ | Sil. IoU ↑ | 推理耗时 (Time) ↓ |
|---|---|---|---|---|---|---|---|---|
| ActionMesh (前向) | 22.2731 | 0.8989 | 0.0654 | 0.00513 | 0.01032 | 0.9103 | 0.9739 | \(\sim\)5 s |
| V2M4 (逐实例优化) | 22.7849 | 0.9056 | 0.0660 | 0.00959 | 0.01827 | 0.9039 | 0.9567 | \(\sim\)100 s |
| T2Bs (视频生成+优化) | 23.4349 | 0.9064 | 0.0568 | 0.00387 | 0.00711 | 0.9160 | 0.9851 | \(\sim\)1800 s |
| RegHead (本文) | 23.8421 | 0.9078 | 0.0551 | 0.00358 | 0.00613 | 0.9192 | 0.9865 | \(\sim\)5 s |
消融实验¶
消融实验系统验证了运动表征设计(表 a)与前向配准模块(表 b)的关键超参数与架构选择:
| 模块类别 | 实验配置 | PSNR ↑ | SSIM ↑ | LPIPS ↓ | 说明与结论 |
|---|---|---|---|---|---|
| 运动表征消融 | 完整模型 (Ours, K=3000, 随机锚点) | 23.842 | 0.9078 | 0.0551 | 兼顾全尺度覆盖与微细节保持 |
| 固定锚点 (Fixed anchors) | 23.323 | 0.9044 | 0.0610 | PSNR 显著下降 0.52 dB,验证随机采样对形变泛化与排布不变性的重要性 | |
| 稀疏锚点 (300 anchors) | 22.226 | 0.8987 | 0.0629 | 控制点稀疏导致局部细微表情形变能力坍塌 | |
| 移除语义分割通道 (w/o seg.) | 23.391 | 0.9056 | 0.0575 | 缺失眼部等显式先验,局部细微特征定位能力衰退 | |
| 配准网络消融 | 完整模型 (Ours, 全局+局部匹配) | 23.842 | 0.9078 | 0.0551 | 粗到细分层匹配性能最佳 |
| 移除局部匹配阶段 (w/o local) | 22.138 | 0.8963 | 0.0635 | 性能发生最严重劣化(PSNR 跌幅 1.7 dB),表明局部精细匹配是还原微表情的主导力量 | |
| 移除全局匹配阶段 (w/o global) | 23.660 | 0.9062 | 0.0577 | 缺少长程粗对齐导致大位移锚点易陷入局部局部极小 | |
| 替换为普通 kNN 邻域 (kNN neighbors) | 23.055 | 0.9044 | 0.0574 | 固定 Token 预算下,常规 kNN 空间采样易聚集,结构化多半径模板覆盖更均匀稳定 |
关键发现¶
- 局部匹配是表情几何保真的绝对基石:消融数据显示,去掉局部匹配器会导致 PSNR 暴跌 1.704 dB,几何重建误差大幅上升,表明全局粗对齐仅能对齐轮廓大势,眼睑、嘴唇的微动形变完全由结构化模板局部匹配提供。
- 随机重采样带来显著几何鲁棒性:将动态随机锚点替换为固定锚点,PSNR 下降了 0.52 dB。随机重采样有效消除了网络对特定采样点网格模式的过拟合,具备更强的表面覆盖连续性。
- 速度与精度双重碾压:相比于 T2Bs 耗时 1800 秒的繁琐可变形高斯反向优化,RegHead 仅需约 5 秒单次前向推理即可构建高精度对应 Blendshape,速度提升两个数量级以上,且在各项渲染与几何误差指标上全面占优。
亮点与洞察¶
- 拓扑无关与参数化解耦的非人形态建模范式:以往数字人高度依赖 FLAME、SMPL 等人脸人身预定义模板拓扑,导致非人生物长期依赖手工绑定。RegHead 展示了如何用密集随机锚点和体素隐空间跨越任意奇异网格拓扑的鸿沟。
- 粗到细的双阶结构化空间检索模板:在体素空间中设计多半径壳层结构化采样并结合有效性掩码,巧妙替代了常规在点云中易受密度分布扰动的欧氏 kNN,极具工程复用价值。
- 零对应真值的高斯可微渲染自监督管线:摆脱对三维对应点真值的依赖,利用可微 3D 高斯投影进行 RGB 与语义图渲染监督,为几何非刚性配准任务提供了一条极具泛化性的训练新思路。
局限与展望¶
- 极端异形生物解剖结构的语义泛化边界:对于昆虫、多足类或面部结构与一般动物相去甚远的极端长尾物种,眼鼻口的语义定义本身具有歧义,当前统一词表下的表情迁移可能产生解剖学不合理的扭曲。
- 上游 3D 生成质量对最终 Blendshapes 的误差级联:作为下游配准模型,如果上游多视角编辑或 3D 表面重构存在严重破面、拓扑空洞或身份特征漂移,RegHead 也会忠实保留甚至放大这类瑕疵。
- 未来方向:探索支持拓扑突变(如嘴巴从完全闭合无缝隙网格张开产生内腔)的接触感知机制,以及将骨骼绑定与皮肤形变联合自监督学习的端到端框架。
相关工作与启发¶
- vs ActionMesh [31]:ActionMesh 侧重于通用 3D 动力学与整体刚性运动预测,缺乏专门针对精细表情的局部注意力机制,对眼周、嘴部微小形变欠拟合严重;RegHead 引入多半径结构化体素局部匹配,在几乎相同的秒级前向推理时间下,几何精度与局部形变保真度显著更优。
- vs V2M4 [4] & T2Bs [22]:V2M4 和 T2Bs 依赖基于视频或网格序列的逐实例慢速测试时优化(单例耗时数分钟至半小时),不仅速度缓慢,还易陷入局部次优;RegHead 通过大规模离线自监督训练,将耗时的对应匹配过程完全摊销为前向网络计算,耗时缩减至 5 秒并取得更低的几何深度与法线误差。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次系统性解决非人形态头部 Blendshape 的端到端前向生成与实时人脸驱动难题,提出的随机锚点与多半径体素匹配构思巧妙。
- 实验充分度: ⭐⭐⭐⭐⭐ 提供了详实的跨渲染指标、三维曲面可见几何多项度量以及极其深入的模块级消融与耗时对比。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑结构严密清晰,对非人形态数字人面临的瓶颈与自身技术解法阐述极为透彻。
- 价值: ⭐⭐⭐⭐⭐ 大幅降低了影视、游戏与 AR 领域非人形态角色表情绑定的技术门槛,具有极高的工业实用价值。