PHOSA: Photorealistic 3D Sign Avatar Modeling and Benchmark¶
会议: ECCV 2026
论文: ECCV 原文
项目: https://naaapi.github.io/PHOSA
领域: 人体理解
关键词: 手语数字人, 3D高斯泼溅, SMPL-X拟合, MVSign基准, 局部运动解耦
一句话总结¶
针对手语生成中网格数字人缺乏真实感、通用人体身姿表示难以捕捉手部精细构型与面部微表情的问题,本文构建了首个由聋人专家联合设计的 16 视角高分辨率多视角手语基准 MVSign,并提出融合多先验的混合 SMPL-X 拟合管线以及部位解耦且具备局部运动学解耦的 3D 高斯手语化身表征。
研究背景与动机¶
手语生成(Sign Language Production, SLP)作为连接健听人与听障社群的重要桥梁,长期以来面临驱动表现力不足的瓶颈。近期的手语生成工作虽在动作序列预测上取得进展,但在视觉呈现上普遍依赖 SMPL-X 等参数化人体网格模型。这类粗糙的网格渲染缺乏真实的几何细节与动态皱褶,更难以再现人类手语交流中至关重要的丰富面部表情和指尖构型,导致听障人群在使用时体验生硬、可理解度受限。因此,构建能够由参数化骨骼驱动、同时具备高保真外观的可驱动数字人化身成为迫切需求。
然而,构建逼真的可驱动手语虚拟人面临两大学术壁垒。一方面是针对手语的高质量基准数据严重匮乏:现有的多视角人体数据集(如 DNA-Rendering、HumanRF 等)几乎只关注大范围的躯干和四肢动作,对手部微动作和面部口型缺乏近距离视角与密集标注;而现有手语数据集(如 PHOENIX14T、How2Sign)主要面向手语翻译与动作生成,多为单视角低清视频且缺乏用于神经渲染的精确三维重建参数。另一方面,精细局部运动的建模极其困难:现有基于 3DGS 的可驱动身姿表征(如 AnimatableGaussians 等)普遍采用全身体姿整体映射,导致网络注意力被躯干的大尺度运动主导,快速运动且高度易产生遮挡的手部往往退化为模糊伪影。
本文的切入点在于“数据采集-参数拟合-表征解耦”全链路协同突破:首先与聋人专家联合规范手部基础词汇与多情境句子,搭建多视角高精采集阵列并研发融合多模型的混合 SMPL-X 标注方案;其次在神经表征中解除手部与躯干在姿态参数空间的强耦合。核心 idea:通过联合构建 16 视角高精多视角手语基准 MVSign,提出融合多模型优势的鲁棒混合 SMPL-X 拟合管线,并设计身体-头部-手部独立分支及局部手部运动学解耦的 3D 高斯虚拟人表征,从根本上解决手部微动模糊与身姿耦合泛化差的难题。
方法详解¶
整体框架¶
PHOSA 的完整技术体系涵盖 MVSign 数据构建与标注管线、运动感知数据采样,以及基于解耦 3DGS 的手语虚拟人建模三大部分。在建模阶段,系统输入目标驱动姿态 \(\Theta\),首先通过线性混合蒙皮(LBS)生成变形网格,并将顶点坐标渲染为规范空间模板上的姿态位置图;随后将姿态图送入独立专门化的 StyleUNet 网络,分别预测身体、头部和手部的规范高斯属性,最后经逆蒙皮与可微高斯光栅化生成最终图像。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["多视角手语输入视频<br/>16视角 RGB 2048×2448"] --> B["混合 SMPL-X 拟合管线<br/>DWPose+HaMeR三角化+INFERNO表情"]
B --> C["运动感知数据采样<br/>运动模糊多指标过滤 + 姿态距离均衡"]
C --> D["解耦手语化身表征<br/>身体/头部/手部分离 + 手部局部运动学解耦"]
D --> E["三分支 StyleUNet 属性预测<br/>预测规范空间高斯偏移与外观"]
E --> F["LBS 观察空间变换与可微渲染<br/>局部聚焦损失引导高保真合成"]
关键设计¶
1. 混合 SMPL-X 拟合管线:融合多重先验以克服复杂手姿与表情估计失效 手语动作包含密集的手部自遮挡、复杂指形接触和细腻口型,单一的全身位姿估计算法无法获得高质量的 SMPL-X 标注。PHOSA 构建了一套两阶段融合拟合方案:首先在 2D 阶段利用 DWPose 检测各视角初始关键点,接着使用专注于手部网格恢复的 HaMeR 模型提取各视角更为精细的 MANO 手部参数及手部 2D 关键点,直接替换掉 DWPose 中易错的手部点位;随后借助 16 视角标定内外参,通过多视角三角化优化获得高精度 3D 骨架点 \(\hat{J}^{3D}\)。在此基础上,通过最小化结合 Geman-McClure 鲁棒核的重投影与 3D 点拟合误差求解全身体态 \(\theta\) 与体型 \(\beta\): $$ \min_{\theta, \beta, \psi} \sum_{i=1}^N \sum_{j \in \mathcal{J}} \rho\left( R_\theta(J(\beta))j - \hat{J}^{3D} \right) + \gamma |\psi|^2 $$ 由于全身骨架关键点对于面部微表情表征过于稀疏,管线进一步引入专门针对人脸精细几何的面部模型 INFERNO,单独提取高保真表情参数 \(\psi\) 替换骨骼拟合出的面部参数。最后,采用前一帧收敛参数热启动当前帧以及 SmoothNet 滤波,消除时间维度的高频抖动,为虚拟人训练提供精准的时序对齐骨架真值。
2. 运动感知数据采样策略:剔除运动模糊与再平衡手部姿态分布 手语动作节奏极快且手部常常出现高速甩动,即使在 25fps 下局部帧依然存在显著的运动模糊;同时,真实视频中包含大量双手自然下垂的静止过渡帧,若直接均匀采样,模型会陷入对手部静止帧过拟合、对关键构型欠拟合的局部极值。针对这一数据痛点,PHOSA 引入两步式运动感知采样策略:第一步设置三大复合指标联合过滤模糊帧,包括 DWPose 的手部置信度评分(模型检测先验)、手部裁剪区域的拉普拉斯梯度(量化局部边缘清晰度),以及由拟合骨骼轨迹推导的手部线速度(物理动力学约束);第二步基于 SMPL-X 姿态参数在特征空间计算手势相似度距离并聚类,主动下采样并裁剪占比过高的手部垂落静止样本,使得各类语义手势的分布达到均衡,保证了后续高斯属性回归的训练稳定性。
3. 解耦手语化身表征与局部运动学解耦:打破躯干-手部几何纠缠 传统身姿高斯表征将全身姿态参数投影为全局姿态图,导致手部的高频特征被大范围躯干位移稀释。PHOSA 将全身 3D 高斯显式解耦为身体(BodyNet)、头部(HeadNet)和手部(HandNet)三大独立分支,各分支采用专用的 StyleUNet 在规范空间预测高斯属性(中心偏移量 \(\Delta P\)、旋转、缩放、不透明度和颜色)。更关键的是,作者提出了局部手部运动学解耦(Partial Hand Kinematic, PHK):在渲染手部姿态图 \(P_{\text{hand}}\) 时,将躯干所有骨骼关节点强制固定在规范参考位姿(Canonical Pose),仅保留手腕及手指关节的自由度,将双手网格渲染为上下双视角正交投影图。这一设计切断了躯干位姿对手部局部几何坐标的强干扰,使 HandNet 能够专注于手形本身的时空流形变化,极大增强了未见手语动作下的手部外观泛化能力。
损失函数 / 训练策略¶
为使三个独立网络输出的规范高斯与底层网格精密贴合,网络预测的是相对于 SMPL-X 模板顶点的相对偏移量 \(\Delta P\) 而非绝对空间坐标。整体优化损失函数结合了全局光度项、解剖区域聚焦项与几何正则项: $$ \mathcal{L} = \mathcal{L}1 + \lambda}} \mathcal{L{\text{SSIM}} + \lambda}} \mathcal{L{\text{LPIPS}} + \lambda}} \mathcal{L{\text{hand}} + \lambda}} \mathcal{L{\text{head}} + \lambda |\Delta P|_2^2 $$ 其中,}\(\mathcal{L}_{\text{hand}}\) 与 \(\mathcal{L}_{\text{head}}\) 分别对 Sapiens+SAM 生成的手部与头部掩码区域计算加权 L1 损失(超参数设为 \(\lambda_{\text{hand}} = 3\)、\(\lambda_{\text{head}} = 3\)),强制梯度聚焦在最具语义沟通价值的高频区域;\(\lambda_{\text{offset}} = 0.005\) 约束高斯中心不偏离人体骨架流形;姿态图分辨率设定为身体 \(1024 \times 512\)、手部 \(256 \times 256\)、头部 \(256 \times 128\)。模型在单张 NVIDIA RTX 3090 GPU 上即可完成完整训练。
实验关键数据¶
主实验¶
论文在多视角 MVSign 数据集和真实网络单视角手语视频两个评测集上进行了全面量化对比。基线包含 SplattingAvatar、GaussianAvatar、AnimatableGaussians、EVA 以及 Mmlphuman,统一采用 SMPL-X 骨骼驱动。
表 1:MVSign 与单视角网络手语视频的主实验对比(对应原论文 Table 10)
| 设置与方法 | 全身 PSNR↑ | 全身 SSIM↑ | 全身 LPIPS↓ | 手部 PSNR↑ | 手部 SSIM↑ | 手部 LPIPS↓ | 面部 PSNR↑ | 面部 SSIM↑ | 面部 LPIPS↓ |
|---|---|---|---|---|---|---|---|---|---|
| 多视角 MVSign | |||||||||
| SplattingAvatar [47] | 23.71 | 0.9625 | 0.0494 | 15.64 | 0.6762 | 0.3884 | 16.90 | 0.7633 | 0.2423 |
| GaussianAvatar [20] | 24.23 | 0.9633 | 0.0428 | 16.30 | 0.6833 | 0.3082 | 17.78 | 0.7737 | 0.2086 |
| AnimatableGS [30] | 25.09 | 0.9647 | 0.0465 | 16.95 | 0.7002 | 0.3135 | 18.63 | 0.7842 | 0.2230 |
| EVA [19] | 25.56 | 0.9667 | 0.0436 | 17.43 | 0.7154 | 0.2869 | 19.21 | 0.8000 | 0.1964 |
| Mmlphuman [57] | 25.91 | 0.9652 | 0.0460 | 17.41 | 0.7084 | 0.2675 | 19.38 | 0.8025 | 0.1869 |
| PHOSA (Ours) | 27.03 | 0.9689 | 0.0393 | 18.55 | 0.7325 | 0.2568 | 20.60 | 0.8189 | 0.1757 |
| 单视角真实网络视频 | |||||||||
| SplattingAvatar [47] | 18.71 | 0.9198 | 0.1223 | 16.37 | 0.6572 | 0.3114 | 16.97 | 0.7243 | 0.2751 |
| GaussianAvatar [20] | 18.90 | 0.9261 | 0.0918 | 16.30 | 0.6668 | 0.2797 | 17.29 | 0.7178 | 0.2157 |
| AnimatableGS [30] | 19.34 | 0.9252 | 0.0954 | 17.42 | 0.6951 | 0.2799 | 17.65 | 0.7277 | 0.2561 |
| EVA [19] | 19.22 | 0.9250 | 0.0966 | 17.49 | 0.6958 | 0.2588 | 17.75 | 0.7381 | 0.2132 |
| Mmlphuman [57] | 19.61 | 0.9239 | 0.1023 | 16.90 | 0.6645 | 0.2607 | 17.88 | 0.7284 | 0.2374 |
| PHOSA (Ours) | 20.39 | 0.9334 | 0.0773 | 18.70 | 0.7189 | 0.2289 | 18.84 | 0.7502 | 0.1864 |
消融实验¶
为验证解耦表征以及局部运动学解耦的独立贡献,论文从单高斯图基线出发进行逐级消融。同时,验证了混合拟合对下游虚拟人渲染精度的关键影响。
表 2:解耦表征与局部手部运动学解耦消融(对应原论文 Table 7)
| 模型配置 | 全身 PSNR↑ | 全身 SSIM↑ | 全身 LPIPS↓ | 手部 PSNR↑ | 手部 SSIM↑ | 手部 LPIPS↓ | 面部 PSNR↑ | 面部 SSIM↑ | 面部 LPIPS↓ | 说明 |
|---|---|---|---|---|---|---|---|---|---|---|
| Baseline (单一全身图) | 25.24 | 0.9570 | 0.0490 | 16.65 | 0.6912 | 0.3759 | 18.47 | 0.7948 | 0.2167 | 未做部位解耦 |
| + DR (解耦表征) | 26.28 | 0.9607 | 0.0430 | 17.53 | 0.7174 | 0.3188 | 20.53 | 0.8099 | 0.1731 | 拆分身体/头/手独立预测 |
| + PHK (局部手部运动学解耦) | 27.93 | 0.9665 | 0.0388 | 18.74 | 0.7322 | 0.2666 | 21.50 | 0.8253 | 0.1595 | 固定躯干保留手部灵活性 |
表 3:混合 SMPL-X 拟合管线消融(对应原论文 Table 2)
| 拟合配置 | 全身 PSNR↑ | 全身 SSIM↑ | 全身 LPIPS↓ | 手部 PSNR↑ | 手部 SSIM↑ | 手部 LPIPS↓ | 面部 PSNR↑ | 面部 SSIM↑ | 面部 LPIPS↓ | 说明 |
|---|---|---|---|---|---|---|---|---|---|---|
| w/o Hybrid Fitting | 23.58 | 0.9637 | 0.0618 | 16.82 | 0.7371 | 0.2987 | 16.62 | 0.7923 | 0.2435 | 仅用 DWPose 单视角拟合 |
| w Hybrid Fitting | 26.90 | 0.9722 | 0.0370 | 18.85 | 0.7704 | 0.2301 | 20.51 | 0.8499 | 0.1665 | 融合 HaMeR 与 INFERNO |
关键发现¶
- 局部运动学解耦是手部细节突破的决定性杠杆:从表 2 可见,单纯引入三部位解耦(+DR)虽能带来全图改善,但手部 LPIPS 仍停留在 0.3188;进一步引入局部运动学解耦(+PHK)后,手部 LPIPS 显著压降至 0.2666,PSNR 提升 1.21 dB,证明将手部姿态与躯干位置剥离极大减轻了网络拟合姿态空间非线性相关的负担。
- 混合拟合是高质量神经渲染的前提基础:表 3 与 SGNify 动捕对比(原论文 Table 3)证明,若直接使用通用 DWPose,手部误差大导致高斯渲染全身 PSNR 仅 23.58 dB;而混合方案使左/右手顶点误差分别低至 14.11mm 与 13.79mm,下游渲染全身 PSNR 直接跃升至 26.90 dB。
- 听障人群主观盲测大幅领先:在 20 位聋人参与者的用户调研中(原论文 Table 9),PHOSA 在可理解度(56.8% vs 次优 20.8%)、手/面清晰度(53.0% vs 次优 25.2%)、时序稳定性(62.4% vs 次优 18.6%)及美学偏好(51.2% vs 次优 22.0%)全部取得绝对优势。与原始网格相比,82.5% 的参与者认为真实虚拟人更有利于理解手语语义。
亮点与洞察¶
- 手语领域首个高分辨率多视角专家级基准:MVSign 彻底填补了以往动捕数据集无多视角高保真图像、通用人体渲染数据集无复杂手语动作的空白,其 5 位母语签署者、16 视角同步采集(2048×2448)与严格的 IRB 合规设计为未来手语视觉研究建立了标准基石。
- 解耦姿态投影巧妙规避非局部运动干扰:局部运动学解耦将手部从躯干运动链中“摘取”并在规范参考系下独立渲染姿态图,这一设计非常巧妙,有效避免了手臂摆动引起手部特征图剧烈平移带来的学习难度,非常适合迁移到其他高频灵巧操作数字人(如乐器弹奏、精细手工等)。
- 动捕多模型模块化协同范式:不盲目追求单端到端模型,而是将 DWPose(骨架全局)、HaMeR(局部手部精确网格)、多视角几何三角化以及 INFERNO(精细面部表情)进行管线化串联,这种工程与算法融合的思路对高质量动捕落地具有极高参考价值。
局限与展望¶
- 三网络并行推理速度受限:由于引入了针对身体、头部和手部的三组独立 StyleUNet,渲染帧率受制于三路卷积网络的串并行前向计算开销,目前难以直接部署在移动端或实现超高帧率实时交互。
- 跨人泛化仍需额外微调:当前模型基于特定采集人进行高斯拟合与驱动,尚未具备零样本输入单张照片即生成可驱动全身手语化身的能力。
- 未来方向:探索轻量化紧凑型网络(如轻量级 MLP 或知识蒸馏)替代庞大的 StyleUNet;引入手语手势语法物理接触约束,进一步消除双手交互时的穿模现象。
相关工作与启发¶
- vs AnimatableGaussians [30]: AnimatableGaussians 使用单张全局姿态位置图预测整身 3D 高斯,手语场景下剧烈的手指动作会被躯干大幅运动淹没;PHOSA 引入三部位解耦与局部手部运动学解耦,手部细节保真度与几何鲁棒性大幅提升。
- vs EVA [19]: EVA 关注单目输入下的表现力虚拟人建模,并尝试解决手部不对齐;但其缺乏多视角真实数据监督且未解除运动学耦合,在面对快速连续手语手势时手部严重失真,而 PHOSA 在多视角基准和解耦架构上均建立起显著优势。
- vs SGNify [15] / NSA [2]: SGNify 与 NSA 重点关注手语动作估计与生成,主要产物为低自由度网格;PHOSA 则打通了从高精度多视角 SMPL-X 拟合到可微高斯光栅化的高保真照片级外观渲染全链路。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ (构建了首个多视角手语高斯基准,提出优雅的局部运动学解耦与混合拟合管线)
- 实验充分度: ⭐⭐⭐⭐⭐ (多视角基准+单视角野外视频双重评估,兼备严谨消融与母语聋人用户主观评测)
- 写作质量: ⭐⭐⭐⭐⭐ (问题定义明确,图表逻辑清晰,全链路工程与理论结合紧密)
- 价值: ⭐⭐⭐⭐⭐ (显著推动听障社群无障碍沟通的可视化表现力,开源基准具有重要社区价值)