FlexiAvatar: Unified 3D Gaussian Human Avatars Under Arbitrary Body Visibility¶
会议: ECCV 2026
论文: ECCV 2026 原文
领域: 3D视觉
关键词: 3D高斯泼溅, 人体数字人重建, 可见性感知优化, 任意身体可见度, SMPL-X
一句话总结¶
针对现有单目人体数字人重建方法普遍假设全身可见而在局部视野下产生严重几何畸变与纹理漂移的问题,FlexiAvatar 提出首个面向任意身体可见度的统一 3D 高斯重建框架,通过光栅化可见性感知修剪抑制不可见区域的虚假梯度传播,结合遮挡鲁棒的 SMPL-X 跟踪、局部特异性残差细化与扩散旋转纹理补全,在全身、半身及纯头部场景下均显著超越现有专用与通用基线。
研究背景与动机¶
构建逼真且可动作驱动的三维人体数字人(Animatable 3D Human Avatars)是增强现实/虚拟现实、影视特效、远程协同交互与虚拟数字人产业的核心使能技术。近年来,3D 高斯泼溅(3D Gaussian Splatting, 3DGS)凭借其显式表征的高几何保真度与毫秒级实时可微渲染速度,迅速取代了传统计算繁重的神经辐射场(NeRF),成为单目视频驱动人体数字人重建的核心范式。然而,以 GART、GaussianAvatar、ExAvatar 和 Vid2AvatarPro 为代表的现有代表性 3DGS 人体数字人方案均建立在一个严苛的前提假设之上:输入视频序列必须具备完整且持续的全身可见度。但在真实的日常视频通话、电视脱口秀访谈、网络短视频或影视镜头中,画幅往往存在剧烈的主动裁剪、上半身近景特写乃至纯头部构图,呈现出高度碎片化且动态变化的可见度谱系。
在局部可见或严重遮挡的输入条件下,现有的技术方案陷入了严重的结构性困境。一方面,面向全身构建的通用 3DGS 方法(如 ExAvatar)盲目地为全身体表网格(如 SMPL-X)绑定高斯基元,并在缺少观测证据的条件下强制执行全身体表联合优化;这不仅导致下肢或足部等未观测区域生成大量的悬浮浮渣(Ghost Artifacts)与拓扑漂移,更严重的是,梯度会经由共享的三平面(Triplane)神经特征场反向回传并扩散,间接腐蚀本已清晰可见的胸腹部和面部纹理。另一方面,现有的局部专用方案(如面向纯头部的 RGBAvatar、InsTaG 或面向半身的 GUAVA)在网络架构层面被固化在特定的身体裁剪尺度,既无法向上泛化到全身驱动,也无法向下适应特写变焦,迫使工程实践不得不为不同的镜头视野分别维护彼此割裂的专用流水线。
这种技术割裂的核心矛盾在于:如何在单一且统一的参数化人体表征底座下,使高斯几何与外观优化过程严格且动态地受限于有效视觉证据,并在完全未见视角下提供合理先验而不干扰观测区域。核心 idea:FlexiAvatar 提出了一个基于可见性感知修剪的统一 3D 高斯人体数字人框架,通过光栅化可见率统计与自适应 Otsu 阈值仅优化受视觉证据支持的高斯基元,融合遮挡鲁棒的置信度掩膜 SMPL-X 拟合、局部特异性时空残差细化与扩散驱动的全景旋转纹理补全,以单一管线实现全身、半身与纯头部的超高质量数字人重建。
方法详解¶
整体框架¶
FlexiAvatar 从任意可见度的单目视频输入出发,首先利用置信度加权的整个人体关键点与面部几何先验拟合高精度的个性化 SMPL-X 规范网格,并利用预训练姿态引导视频扩散模型(MimicMotion)生成 360° 旋转辅助视频以补全未见区域纹理。接着,规范空间中的人体顶点绑定 3D 高斯基元,通过投影至可学习的三平面(Triplane)特征场解码出静态几何/外观与姿态依赖的动态变形。在初始预热阶段后,系统根据高斯光栅化足迹统计每个高斯的可见率,运用 Otsu 自适应阈值进行可见性感知修剪,完全切断不可见基元对重构与正则化损失的虚假梯度贡献;同时,针对面部与双手激活局部特异性隐式残差 MLP 补偿高频动态纹理。最后,变形后的高斯经过 SMPL-X 线性混合蒙皮(LBS)变换至目标姿态,并通过 3DGS 渲染出最终图像。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["单目视频输入<br/>(任意可见度)"] --> B["遮挡鲁棒的可见性感知 SMPL-X 跟踪<br/>置信度掩膜关键点与面部先验对齐"]
A --> C["扩散驱动的全景旋转视频生成<br/>MimicMotion 生成 360° 辅助视角补全背部纹理"]
B --> D["规范空间混合网格-高斯表征<br/>三平面正交投影解码静态与动态形变属性"]
C --> E["基于证据统计的可见性感知高斯优化<br/>热身后 Otsu 自适应阈值剪枝与双向损失掩膜"]
D --> E
E --> F["局部特异性隐式残差外观细化<br/>面部与双手专属轻量 MLP 补偿高频时空色彩"]
F --> G["SMPL-X 线性混合蒙皮与 3DGS 渲染<br/>输出高质量可驱动人体数字人"]
关键设计¶
1. 遮挡鲁棒的可见性感知 SMPL-X 跟踪:消除视野外关节点对拓扑拟合的几何污染 在半身或近景特写视频中,现成的整个人体位姿估计器(如 SMPLer-X)会在画幅之外的不可见关节(如腿部、足部)上预测极不可靠的伪关键点,若直接施加 2D 重投影监督,会导致参数化人体模型陷入畸变姿态,破坏全身规范模板的准确性。为此,本文引入置信度阈值 \(\tau=0.4\) 的二值可见性掩膜 \(\mathbf{m}_j \in \{0, 1\}\),将 2D 关节点重投影损失严格限制在明确可见的身体关键点上: $$ \mathcal{L}{\text{kpt}} = \sum_j \right|_1 $$ 其中 } \mathbf{m}_j \left| \Pi\big(V_j(\boldsymbol{\theta}, \boldsymbol{\beta}, \Delta \mathbf{J})\big) - \mathbf{K\(\Pi\) 为相机透视投影函数,\(V_j\) 是由关节姿态 \(\boldsymbol{\theta}\)、体型 \(\boldsymbol{\beta}\) 及可学习关节点个性化偏移量 \(\Delta \mathbf{J}\) 决定的 3D 关节坐标,\(\mathbf{K}_j\) 为目标 2D 关键点。为进一步捕捉面部细粒度身份特征,方法将 SMPL-X 面部网格与预先拟合的 FLAME 模板通过复合几何损失 \(\mathcal{L}_{\text{sface}}\) 进行对齐(涵盖顶点 L1 距离、曲率拉普拉斯平滑度以及边长拓扑一致性约束),并配合对称性约束与形变正则化项 \(\mathcal{L}_{\text{sreg}}\)。通过在所有可见度设定下统一人体 SMPL-X 参数化底座,消除了在头部场景下切换至专用模型(如 FLAME)的管线割裂。
2. 基于证据统计的可见性感知高斯优化:切断共享特征场向不可见区域的梯度泄露 在基于三平面(Triplane)的隐式-显式高斯架构中,所有高斯基元的属性均由共享平面特征插值解码而来。当处理半身或头部视频时,下肢等完全未被观测的区域若参与前向光栅化或反向传播,观测区域图像损失产生的梯度将穿透共享三平面,向不可见的高斯反向传播并产生伪梯度,反向污染邻近可见躯干的高斯属性。为从源头切断这一干扰,本文构建了每个高斯基元 \(i\) 的统计可见率: $$ v_i = \frac{1}{F} \sum_{f=1}^{F} v_i^f $$ 其中 \(v_i^f\) 是高斯基元 \(i\) 在第 \(f\) 帧的光栅化二值可见标志。模型在前 2,000 轮预热训练中优化所有高斯以建立稳定的几何拓扑与可见性统计;预热结束后,系统利用 Otsu 算法自适应地对可见率分布 \(\{v_i\}\) 进行双峰直方图聚类,自动选取使类内方差最小的最优阈值 \(\tau^*\)。可见率低于 \(\tau^*\) 的高斯基元将直接被移出前向光栅化列表,并在重构损失和拉普拉斯平滑正则项中被完全掩膜。这一设计彻底阻断了不可见区域对可见躯干的梯度污染,并在头部和半身场景下将待优化与渲染的高斯基元总数削减达 13.8% 至 49.7%,显著降低显存开销并提升渲染帧率。
3. 局部特异性隐式残差外观细化:高频面部表情与手指纹理的动态补偿 基础高斯模型经由全局三平面特征插值与解码后,在呈现高频动态细节(如微笑时的眼角唇周皱纹、手部屈伸时的指缝微褶皱)时易出现平滑与模糊。针对这一瓶颈,FlexiAvatar 设计了基于连续隐式函数的局部特异性外观残差细化模块。该模块由三个专用的轻量级 MLP 分别建模面部、左手与右手。给定高斯中心空间坐标 \(\boldsymbol{\mu} \in \mathbb{R}^3\)、时间戳 \(t\) 与局部骨骼姿态 \(\boldsymbol{\theta}\),首先通过高频多尺度正弦位置编码 \(\gamma(\cdot)\) 构造时空特征向量,各专属 MLP 仅在对应部位处于可见状态时被激活,预测局部动态色彩补偿项 \(\Delta \mathbf{C}_{\text{res}}(\gamma(\boldsymbol{\mu}), \gamma(t), \boldsymbol{\theta})\)。在 2,000 轮几何粗收敛后开启该残差分支,最终色彩叠加为: $$ \mathbf{C}{\text{final}} = \mathbf{C}}} + \Delta \mathbf{C{\text{pose}} + \Delta \mathbf{C} $$ 这种解耦设计使得基础表征专注于鲁棒的全局形变,而局部网络精准恢复微小表情与手势变化,大幅强化了数字人的拟真度。}
4. 扩散驱动的全景旋转纹理补全:无幻觉填补背部等持久不可见视角的纹理空缺 单目正向视频重建面临的另一固有限制是背面视角的彻底不可见。现有方法若直接利用 2D 扩散先验对不可见部位施加 SDS 类似正则,往往在局部可见视频上诱发严重的过度饱和或多头/穿模幻觉。为此,FlexiAvatar 引入基于 MimicMotion 的姿态引导视频扩散先验,输入单张清晰源图像,生成一段受控的人体 360° 旋转辅助视频序列。该序列自然揭示了背部、后脑勺及侧面盲区的外观线索。在联合训练时,模型以 1:1 的等概率随机交替采样真实观测帧与生成旋转帧,并对生成帧的重构损失施加降权调整,以防生成视频中的微小虚影干扰真实几何。该机制在不污染正面真实纹理的前提下,为不可见区域注入了与主体身份高度一致的全景纹理。
损失函数 / 训练策略¶
模型采用端到端联合训练策略,在单张 NVIDIA RTX A6000 GPU 上以 batch size 为 1 迭代训练 30,000 步,初始学习率设为 \(1 \times 10^{-3}\)。整体目标函数定义为: $$ \mathcal{L} = \lambda_{\text{L1}} \mathcal{L}1 + \lambda}} \mathcal{L{\text{ssim}} + \lambda}} \mathcal{L{\text{lpips}} + \lambda}} \mathcal{L{\text{face}} + \lambda $$ 其中,}} \mathcal{L}_{\text{reg}\(\mathcal{L}_1\)、\(\mathcal{L}_{\text{ssim}}\) 与 \(\mathcal{L}_{\text{lpips}}\) 作用于裁剪的人体前景区域,分别惩罚像素级绝对误差、局部结构相似度偏差以及感知特征层面的模糊;面部一致性损失 \(\mathcal{L}_{\text{face}} = \|I_{\text{mesh}} - I_{\text{gt}}\|_1\) 在面部区域通过可微网格渲染固定的平均 UV 纹理,约束面部高斯基元严格保持身份一致性;几何与外观正则项 \(\mathcal{L}_{\text{reg}}\) 包含拉普拉斯平滑项,并结合二值可见性掩膜 \(\mathbf{m}_i\),仅对有效观测到的高斯基元施加平滑,避免对未见区域造成过度平滑或伪结构拟合。
实验关键数据¶
主实验¶
论文在全身(NeuMan、ZJU-MoCap、WildAvatar)、半身(TalkShow)以及纯头部(INSTA)三大不同可见度场景下开展了详尽的对比实验。在所有任务上均取得了显著超越现有最先进方法的定量指标。
表 1:NeuMan 全身数据集重建性能对比¶
| 方法 | 类别 | PSNR ↑ | SSIM ↑ | LPIPS (×100) ↓ |
|---|---|---|---|---|
| HumanNeRF | 隐式 NeRF | 27.06 | 0.967 | 1.90 |
| InstantAvatar | 隐式 NeRF / 快速 | 28.47 | 0.972 | 2.80 |
| NeuMan | 神经辐射场 | 29.32 | 0.972 | 1.40 |
| Vid2Avatar | 无遮罩隐式场 | 30.70 | 0.980 | 1.40 |
| 3DGS-Avatar | 3DGS 显式形变 | 28.99 | 0.974 | 1.60 |
| GaussianAvatar | 3DGS 显式姿态驱动 | 29.94 | 0.980 | 1.20 |
| Vid2AvatarPro | 通用先验 3DGS | 32.71 | 0.983 | 1.19 |
| ExAvatar | 全身表达 3DGS | 34.80 | 0.984 | 0.90 |
| FlexiAvatar (Ours) | 统一可见性感知 3DGS | 35.77 | 0.987 | 0.83 |
表 2:TalkShow 半身数据集对比(上半身可见)¶
| 受试者 (Subject) | 方法 | PSNR ↑ | SSIM ↑ | LPIPS (×100) ↓ |
|---|---|---|---|---|
| Oliver | GART | 24.14 | 0.927 | 7.76 |
| GUAVA (半身专用) | 26.76 | 0.890 | 12.17 | |
| ExAvatar (全身通用) | 29.13 | 0.938 | 2.29 | |
| Ours | 29.80 | 0.952 | 1.81 | |
| Conan | GART | 26.89 | 0.974 | 5.56 |
| GUAVA (半身专用) | 29.70 | 0.928 | 7.69 | |
| ExAvatar (全身通用) | 35.66 | 0.980 | 3.61 | |
| Ours | 36.73 | 0.984 | 2.82 | |
| Chemistry | GART | 22.28 | 0.914 | 11.89 |
| GUAVA (半身专用) | 26.85 | 0.920 | 7.15 | |
| ExAvatar (全身通用) | 25.67 | 0.922 | 10.29 | |
| Ours | 27.80 | 0.935 | 9.67 |
表 3:INSTA 纯头部数据集对比(头部可见)¶
| 方法 | 类别 | PSNR ↑ | SSIM ↑ | LPIPS (×100) ↓ |
|---|---|---|---|---|
| FlashAvatar | 嵌入式 3DGS | 27.44 | 0.912 | 11.05 |
| FATE | 全头编辑 3DGS | 27.85 | 0.942 | 5.68 |
| MonoGaussianAvatar | 点基元头部 3DGS | 28.91 | 0.945 | 7.43 |
| SplattingAvatar | 网格嵌入 3DGS | 29.03 | 0.932 | 10.35 |
| GaussianAvatars | 骨骼驱动头部 3DGS | 29.10 | 0.945 | 8.61 |
| GaussianBlendShapes | 混合形状驱动 | 30.01 | 0.947 | 9.17 |
| RGBAvatar | 在线紧凑基元 (专用 SOTA) | 32.72 | 0.953 | 6.04 |
| FlexiAvatar (Ours) | 统一框架 (无专设模型) | 33.04 | 0.953 | 5.63 |
消融实验¶
表 4:核心组件消融(NeuMan 全身与 INSTA 纯头部基准)¶
| 测试基准 | 配置 / 消融项 | PSNR ↑ | SSIM ↑ | LPIPS (×100) ↓ | 模块贡献说明 |
|---|---|---|---|---|---|
| NeuMan (全身) | Full Model (完整模型) | 35.77 | 0.987 | 0.83 | 融合所有设计的最优配置 |
| w/o refinement (移除局部残差细化) | 34.90 | 0.985 | 0.86 | PSNR 大幅下降 0.87 dB,高频面部表情与手指纹理变模糊 | |
| w/o gen. data (移除扩散旋转生成视频) | 35.29 | 0.986 | 0.92 | 新视角下背部与不可见区域产生明显纹理缺失伪影 | |
| INSTA (纯头部) | Full Model (完整模型) | 33.04 | 0.953 | 5.63 | 完整模型 |
| w/o visibility-aware opt. (移除可见性感知优化) | 32.15 | 0.949 | 5.80 | PSNR 下降 0.89 dB,不可见下半身虚假梯度回传破坏头部重建 | |
| w/o SMPL-X opt. (移除置信度掩膜跟踪) | 31.07 | 0.934 | 7.60 | 性能发生最严重跳水(PSNR 暴跌 1.97 dB),未见关节误估计彻底扭曲规范模板 |
表 5:高斯数量与推理渲染效率分析¶
| 输入场景 | 方法 | 高斯数量 (#G) | 资产显存 (MB) | 动画耗时 (ms) | 渲染耗时 (ms) | 总体帧率 (FPS) ↑ |
|---|---|---|---|---|---|---|
| 纯头部 (INSTA) | ExAvatar | 167,390 | 8.94 | 32.175 | 2.098 | 29.18 |
| Ours | 84,095 (-49.7%) | 4.49 (-49.8%) | 24.135 (-25.0%) | 1.410 (-32.8%) | 39.15 (+34.2%) | |
| 半身 (TalkShow) | ExAvatar | 167,390 | 8.94 | 30.239 | 1.966 | 31.06 |
| Ours | 144,350 (-13.8%) | 7.71 (-13.8%) | 28.127 (-7.0%) | 1.408 (-28.4%) | 33.87 (+9.1%) |
关键发现¶
- SMPL-X 置信度拟合是局部视野下的第一生命线:在纯头部设定中,去掉关节点可见性掩膜优化(w/o SMPL-X opt.)导致 PSNR 骤降 1.97 dB、LPIPS 从 5.63 恶化至 7.60。这证明如果输入画幅缺失下肢时未对关键点检测器施加置信度过滤,强行拟合整个人体姿态会使不可见关节产生严重畸变并彻底拖垮规范模板。
- 可见性感知优化同时带来保真度跃升与结构性减负:通过 Otsu 自动阈值剪枝,在纯头部场景下排除了近 50%(从 16.7 万降至 8.4 万)的多余高斯基元,显存占用直接腰斩(8.94 MB 降至 4.49 MB),渲染与驱动帧率从 29.18 FPS 跃升至 39.15 FPS(加速 34.2%),并且有效阻断了未见区域对可见区域的梯度反向污染(PSNR 提升近 0.9 dB)。
- 局部残差细化有效解耦了全局与微观动态:局部细化模块(refinement heads)仅增加极小计算量,却使 NeuMan 上的 PSNR 从 34.90 dB 提高至 35.77 dB,定性观察显著恢复了清晰的指节纹理、眼部神态与衣物高频皱褶。
亮点与洞察¶
- 自适应可见性修剪机制:利用光栅化足迹统计高斯可见率,并巧妙借助经典的 Otsu 二值化算法自动寻优分界阈值,无需针对不同裁剪比例人工微调超参数,自适应阻断了三平面特征场的伪梯度交叉污染。
- 以单一底座打破全身/局部建模的生态藩篱:过去学界在头部、上半身与全身任务上各立山头(FLAME 专攻头部、GUAVA 专攻上半身、ExAvatar 专攻全身)。FlexiAvatar 证明了只要引入严谨的可见性掩膜机制,统一的 SMPL-X 骨架结合 3DGS 就能在所有子尺度上超越对应的专用 SOTA 模型,极大地降低了工业化部署与维护多套流水线的门槛。
- 扩散旋转视频作为非对称先验:不同于在 3D 优化循环中直接跑耗时易崩溃的 SDS 分数蒸馏,本文仅离线调用一次轻量级姿态引导视频生成模型(MimicMotion)合成 360° 旋转视角,并采取重构损失降权约束,以极低训练代价优雅解决了单目正面重建中背部纹理缺失的物理难题。
局限与展望¶
- 复杂动态松散衣物的非刚性建模瓶颈:与当前大多数基于 SMPL-X 线性混合蒙皮驱动的 3DGS 方案一致,FlexiAvatar 对于宽松长裙、飘逸外套等与人体骨架运动脱耦的复杂拓扑非刚性形变,仍然缺乏显式的物理动力学模拟能力。
- 生成视频的跨视角几何与光照不一致性风险:扩散生成模型合成的 360° 旋转视频在细微纹理和复杂阴影过渡上可能与真实观测帧存在微小的不一致,虽然降权损失有所缓解,但在极度严苛的视角合成下仍有轻微的光照跳变可能。
- 改进方向:未来可将可见性感知掩膜拓展至形变感知掩膜,动态识别正在经历剧烈非刚性形变的衣物区域,并引入非刚性时空场或基于物理的仿真约束实现衣物动力学的高保真捕捉。
相关工作与启发¶
- vs ExAvatar: ExAvatar 是目前最具代表性的表达型全身 3DGS 数字人,但在处理局部视野时强制优化全部身体顶点高斯,导致下肢产生大量浮空杂斑与几何漂移,且通过共享三平面污染躯干;FlexiAvatar 通过可见性感知统计与 Otsu 剪枝切断了伪梯度,并在半身与纯头部任务上实现了超越 ExAvatar 的保真度与显著降低的显存/时延开销。
- vs GUAVA: GUAVA 是针对单张图像的上半身 3DGS 模型,但其受限于单帧单视角输入且缺乏跨视角的几何一致性约束,无法灵活迁移至全身或头部;FlexiAvatar 利用连续视频的动态线索、扩散辅助视角与局部残差细化,在 TalkShow 半身上大幅超越 GUAVA(PSNR 领先达 3.06 到 7.03 dB)。
- vs RGBAvatar & FATE: RGBAvatar 与 FATE 是纯头部的 SOTA 方法,依赖专门的面部混合形状或预设头部边界,无法扩展到全身;FlexiAvatar 证明了统一的 SMPL-X 架构在引入面部 FLAME 先验与局部残差网络后,纯头部的 PSNR(33.04 dB)可直接反超专用头部模型 RGBAvatar(32.72 dB)。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次提出针对单目视频任意可见度谱系的统一 3DGS 数字人框架,提出的自适应 Otsu 可见性优化和渐进式局部残差细化设计优雅且有效。
- 实验充分度: ⭐⭐⭐⭐⭐ 跨越全身(NeuMan、ZJU-MoCap、WildAvatar)、半身(TalkShow)与纯头部(INSTA)共五大基准,包含了深入的消融实验、计算耗时与显存占用统计,实测数据完备。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密、动机阐述直击现有 3DGS 假设漏洞,图文对应清晰,方法设计层层递进。
- 价值: ⭐⭐⭐⭐⭐ 彻底打破了数字人领域“专视专用”的技术割裂格局,为工业级跨端视频通话、特写与全身动作捕捉提供了高效率且高保真的单一管线基座。