SplatCtrlA: Generalizable Single Image to Fully Controllable 3D Avatar¶
会议: ECCV 2026
论文: ECCV 原文
PDF: ECCV PDF
领域: 人体理解
关键词: 3D高斯泼溅, 单图人体重建, 可控数字人, SMPL-X, 前馈生成
一句话总结¶
针对单张图像生成可驱动 3D 人体化身时纹理模糊、肢体畸变与面部/手部失控等问题,SplatCtrlA 提出了基于 SMPL-X UV 高斯表征的前馈生成框架,结合 2.85 万个 3D 几何一致高斯数字人数据集、几何与色彩解耦的输入感知解码器以及高斯混合面部增强模块,实现了秒级生成支持 360 度全身姿态、细腻表情与逼真手势的高保真 3D 数字人。
研究背景与动机¶
从单张肖像或全身照片重建可驱动的 3D 人体化身(3D Human Avatar),是沉浸式虚拟现实、影视动画与具身智能人机交互的核心技术基石。然而,单视角重建天然是一个严重不适定的病态逆问题:输入图像仅包含有限视角的表观投影,遮挡区域的纹理补全、复杂非刚性衣服褶皱的变形场预测以及极具辨识度的面部微表情与手部细微关节运动,都对模型的生成泛化能力提出了严苛挑战。近期基于 2D 视频扩散模型的方法虽然能生成视觉生动的动作视频,但在长序列或大角度视角变换下极易发生身份漂移和肢体结构抖动,且多步去噪推理耗时过长,难以保证严格的 3D 空间一致性。
基于 3D 高斯泼溅(3DGS)的隐式/半显式表征因其实时渲染速度与天然的多视角一致性,成为了 3D 数字人领域的新宠。然而,现有的单图 3D 重建方法大多仅面向静态场景,无法实现姿态驱动;而引入扩散先验的单人定制化优化方案虽然质量较高,却需要针对每个个体耗费数小时进行独立优化,无法满足即时生成需求。近年涌现的前馈大重建模型(如 IDOL、LHM、GUAVA 等)试图将 LRM 范式迁移至人体化身生成,但受限于两方面短板:一是现有合成训练数据集缺乏严格的 3D 几何一致性(如 2D 扩散生成的视频帧间存在细微几何漂移与手指错位),导致模型学到的表征出现纹理溢色与手指畸变;二是传统图像编码器在提取特征时存在不可逆的高频信息损失,反投影解码时由于人体骨骼对齐误差而出现贴图错位,且普遍忽视了面部口唇牙齿与手部微结构的精细建模。
本文的切入角度是:必须将具备几何拓扑先验的参数化模型(SMPL-X)与 3D 高斯泼溅在 UV 参数空间深度解耦绑定,通过构建大规模具有显式 3D 几何一致性的高斯数字人合成数据集解决数据源头失真问题,并设计让输入图像色彩直接穿透到解码端的输入感知机制。核心 idea:构建基于 SMPL-X UV 空间的高斯前馈大模型,通过 2.85 万高质量 3DGS 数据集提供强几何监督,利用解耦几何与色彩的语义引导输入感知解码器消除对齐误差,并级联专用头模高斯混合网络与手部高权重拉普拉斯正则化,达成全身、手势与表情完全解耦可控的单图秒级高保真数字人生成。
方法详解¶
整体框架¶
SplatCtrlA 采用单次前馈回归架构,其核心管线分为图像编码、输入感知解耦解码、面部精细增强以及几何正则化监督四个阶段。整个系统输入一张全身 RGB 图像 \(I\) 以及局部裁剪超分的头部图像 \(I_{head}\),在规范化人体空间(Canonical Space)中直接预测基于 SMPL-X UV 展开图的 3D 高斯属性贴图,最后借助线性混合蒙皮(LBS)将规范空间高斯场高效驱动到任意目标姿态与表情。
整体数据流如下所示:首先,主干网络采用冻结的 Sapiens-1B 视觉大模型提取全身与头部特征,经 UV Transformer 将屏幕视口特征投影转换至 SMPL-X 的 UV 特征空间 \(F_{uv}\);随后,输入感知解码器分为两路级联处理——先通过 UV 网格逆投影获取可见区网格纹理并预测高斯几何变形量,再利用变形后的高斯中心结合 2D 语义先验修正投影坐标,解码完整高斯颜色与尺度;接着,引入由高质量真实人头视频预训练的独立头部小模型,通过基于零卷积的 StyleUNet 高斯混合网络无缝融入面部区域;最终通过光度重建损失与手部强正则化约束完成端到端训练。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["单张全身图像 + 裁剪超分头部图像"] --> B["UV 高斯人体参数化与双分支图像编码<br/>Sapiens 特征提取 + UV Transformer 空间映射"]
B --> C["几何与色彩解耦的输入感知解码<br/>UV 网格逆投影定几何 + 语义引导高斯逆投影定色彩"]
C --> D["局部先验驱动的高斯混合面部增强<br/>独立高分辨率头模 + 零卷积 StyleUNet 无缝融合"]
D --> E["结构防畸变几何正则化<br/>形变/尺度截断 + 手部百倍拉普拉斯平滑"]
E --> F["规范空间 UV 高斯阿凡达<br/>经 LBS 蒙皮驱动全身姿态/手势/表情"]
关键设计¶
1. UV 高斯人体参数化与双分支图像编码:将隐式辐射场与显式网格解耦映射到统一 UV 空间
传统点云或三维体素回归网络难以直接兼容先进的 2D 卷积和 Transformer 架构。为了兼顾 3D 高斯泼溅的高效光栅化渲染与二维神经网络的强表征能力,模型选择在 SMPL-X 参数化模型的 UV 展开空间中构建 3D 高斯场 \(G = \{\mu, \alpha, r, s, c\}\),其中包含高斯中心位置 \(\mu\)、不透明度 \(\alpha\)、四元数旋转 \(r\)、三维缩放尺度 \(s\) 以及颜色 \(c\)。为了充分利用 SMPL-X 提供的强人体几何先验,网络并不直接回归高斯绝对坐标,而是预测基于标准网格表面顶点位置 \(\hat{\mu}\) 与旋转 \(\hat{r}\) 的空间偏移量,即 \(\mu = \hat{\mu} + \delta \mu\) 与 \(r = \hat{r} \cdot \delta r\)。
在特征提取方面,单张图像由于分辨率有限,面部信息极易被整个人体特征稀释。为此,系统采用双分支编码:输入全身图像 \(I\) 的同时提取经过超分辨率增强的人脸区域 \(I_{head}\),两者送入冻结参数的 Sapiens-1B 骨干网络提取图像 token,并在通道维度进行拼接拼接: $\(F = \mathcal{E}_{sapiens}(I) \oplus \mathcal{E}_{sapiens}(I_{head})\)$ 随后,拼接后的全局特征结合可学习的位置编码 \(F_{pos}\),输入多层 UV Transformer 进行特征重采样与自注意力交互。自注意力机制能够跨空间区域聚合长程依赖,有效推断并补全不可见背部和被遮挡区域的人体特征,最后经 CNN 上采样模块输出分辨率为 \(768 \times 768\) 的高分辨率 UV 特征图 \(F_{uv}\)。
2. 几何与色彩解耦的输入感知解码:用网格逆投影与语义引导高斯逆投影保全细节纹理
单纯依赖深度神经网络特征直接回归高斯颜色贴图,不可避免地会丢失输入图像中的高频细节(如织物纹理、文字图案等),导致前馈生成结果偏向平滑和模糊。如果简单将输入图像色彩按网格反向投影到 UV 空间,又会因为 SMPL-X 拟合粗糙、衣服轮廓超出裸体模型表面以及视角自遮挡等原因造成严重贴图错位和黑边伪影。针对此矛盾,本文设计了两步解耦的输入感知解码机制。
第一步是网格逆投影(Mesh Inverse)辅助几何解码:对于 UV 贴图上的每个有效高斯像素,根据 SMPL-X 规范网格的光栅化映射找到其表面坐标 \(\hat{\mu}_k\),利用相机内外参投影回输入图像 \(I\) 并结合可见性掩码 \(M_{uv}\) 提取可见区网格色彩 \(\hat{I}_{uv}\)。几何解码器将其与 \(F_{uv}\) 拼接,直接回归出高斯位置形变 \(\delta \mu\) 与不透明度 \(\alpha\)。第二步是语义引导的高斯逆投影(Gaussian Inverse)辅助色彩解码:因为高斯点实际分布在偏离网格表面的衣物和头发外层(\(\hat{\mu} + \delta \mu\)),使用更新后的三维高斯中心再次投影回输入图像获取高斯逆色彩图 \(I_{uv}\)。为防止边缘轮廓处的跟踪误差造成背景像素污染前景色,引入二维人体语义分割图 \(S\) 进行校正:每个高斯点与其所属身体语义类别绑定,当投影落入不匹配语义区域时,自动纠正到最近的同语义像素坐标。最终由色彩解码器输入 \(F_{uv} \oplus I_{uv}\) 预测旋转偏移 \(\delta r\)、尺度 \(s\) 与颜色 \(c\)。
3. 局部先验驱动的高斯混合面部增强:通过双模型融合与零卷积微调攻克面部微表情
全身合成数据集往往受限于整体分辨率,人脸区域在全图仅占几十像素,难以学到眼睛、牙齿、唇部等复杂肌肉运动的高频表现。为了打破这一分辨率与动态表达的瓶颈,本文引入了一个专门的高分辨率人头重建模型,并在输出端使用高斯混合网络进行平滑融合。
该头部模型架构与全身网络一致,但将 UV Transformer 深度减半(\(D/2\)),且仅处理裁剪后的高分辨率人脸 token,并基于 5,253 段高分辨率真实人头视频进行专注预训练。为了消除全身模型与头部专用模型在颈部和面部边缘交界处的明显缝隙与色差,设计了一个轻量级高斯混合网络(Gaussian Blending Network)。该网络由 StyleUNet 主干和零卷积层(Zero Convolution)构成,以面部 UV 掩码为引导,接收两套模型预测的拼接属性贴图,输出平滑无缝的最终 UV 高斯属性。零卷积确保了在训练初始阶段网络输出全为零残差,仅在后续反向传播中学习微弱的局部边界修补量,避免破坏全身模型原有的全局一致性。
4. 结构防畸变几何正则化:借助形变阈值与百倍手部拉普拉斯平滑稳定精细肢体
单图预测具有强烈的深度不确定性,在没有强约束的情况下,高斯基元极易在反向传播中发生剧烈的非物理漂移,形成细长尖锐的针状高斯斑或散落的浮游噪声,尤其在手部和复杂关节处会导致手指崩解或肢体穿模。为此,本文针对高斯几何场设计了三重显式正则化项。
首先是位置偏移阈值截断损失 \(\mathcal{L}_{pos}\),限制每个高斯点偏离 SMPL-X 网格表面的位移不得超过预设阈值 \(\epsilon_{pos}\): $\(\mathcal{L}_{pos} = \frac{1}{N_{gs}} \sum_{i=1}^{N_{gs}} \max(\|\delta \mu_i\|_2 - \epsilon_{pos}, 0)\)$ 其次是尺度宽高比惩罚损失 \(\mathcal{L}_{sca}\),避免高斯体退化为极扁平或极尖锐的针状形态: $\(\mathcal{L}_{sca} = \frac{1}{N_{gs}} \sum_{i=1}^{N_{gs}} \left( \frac{s_i^{max}}{s_i^{min}} - \epsilon_{sca} \right)\)$ 最后,根据网格表面的拓扑连接关系,对相邻高斯点的位置形变 \(\delta \mu\)、尺度 \(s\) 与颜色 \(c\) 计算拉普拉斯平滑损失 \(\mathcal{L}_{lap}\)。尤为关键的是,针对传统前馈大模型极易崩塌的手部区域,特别将手部高斯的拉普拉斯平滑损失权重放大了 100 倍(\(\times 100\)),强行锁定手指之间的骨骼局部连续性,确保手势在复杂姿态驱动下依然形态自然。
损失函数 / 训练策略¶
模型采用端到端渲染反向传播训练,总损失函数包含光度监督损失与高斯几何正则化项: $\(\mathcal{L}_{total} = \mathcal{L}_{photometric} + \mathcal{L}_{reg}\)$ 其中光度重建损失在渲染视口下计算预测图像与真值之间的像素级 L1 损失和感知损失: $\(\mathcal{L}_{photometric} = \lambda_{rgb}\mathcal{L}_1(I_{gt}, I_{pred}) + \lambda_{per}\mathcal{L}_{lpips}(I_{gt}, I_{pred})\)$ 正则化项由位置约束、尺度约束和拉普拉斯平滑项加权构成: $\(\mathcal{L}_{reg} = \lambda_{pos}\mathcal{L}_{pos} + \lambda_{sca}\mathcal{L}_{sca} + \lambda_{lap}\mathcal{L}_{lap}\)$
训练在 8 张 NVIDIA A100 GPU 上进行,耗时约 5 天,批大小为 8。优化器采用 Adam,初始学习率 \(4\times 10^{-4}\),并设置 6,000 步的 warm-up 预热阶段。UV 贴图分辨率设为 \(768 \times 768\),总高斯数量约为 32 万(320,000)。正则化超参数设为 \(\epsilon_{pos} = 0.05\)、\(\epsilon_{sca} = 5\);各损失项权重分别为 \(\lambda_{rgb} = 30\)、\(\lambda_{per} = 10\)、\(\lambda_{pos} = 10\)、\(\lambda_{sca} = 50\)、\(\lambda_{lap} = 10^4\)。全身模型收敛后,头部专用模型在相应超参下训练 15,000 步,高斯混合网络随后以 \(4\times 10^{-6}\) 的微小学习率再微调 15,000 步。
为了给模型提供高质量的 3D 监督信号,作者构建了一个包含 28,500 个独立身份的 3D 高斯数字人合成数据集(Gaussian Avatar Dataset)。利用 Flux 提示词生成高质量多样性全身肖像,通过 MimicMotion 视频扩散模型生成多姿态动态帧作为伪监督,随后通过快速 3DGS 优化重建出具备显式 3D 几何一致性的数字人资产,每个身份渲染 15 帧多视角多姿态图像参与训练。此外,混合了 THuman2.1(3D 真实扫描)、HuGe100K 筛选子集以及 5,253 段高分辨率人头真实视频,彻底消除单源数据集偏差。
实验关键数据¶
主实验¶
评估在三个公开基准测试集上展开:THuman2.0 测试集(100 个身份的 3D 扫描数据)、NeuMan 测试集(包含全部 6 个复杂真实场景序列)以及 Seamless Interaction 交互测试集(随机抽选 100 段高保真动捕视频)。评测指标包含均方误差(MSE)、峰值信噪比(PSNR)、结构相似性(SSIM)和感知相似度(LPIPS)。与业内具有代表性的前馈 3D 高斯单图人体生成模型 IDOL、GUAVA 和 LHM 进行横向对比。
| 数据集 | 方法 | MSE(\(\times 10^{-3}\)) ↓ | PSNR ↑ | SSIM ↑ | LPIPS ↓ |
|---|---|---|---|---|---|
| THuman2.0 | IDOL | 10.841 | 19.995 | 0.912 | 0.0907 |
| GUAVA | 9.727 | 20.239 | 0.886 | 0.0765 | |
| LHM | 9.951 | 20.276 | 0.917 | 0.0858 | |
| Ours (SplatCtrlA) | 6.440 | 22.542 | 0.931 | 0.0653 | |
| NeuMan | IDOL | 7.262 | 22.072 | 0.961 | 0.0424 |
| GUAVA | 7.365 | 21.875 | 0.904 | 0.0666 | |
| LHM | 6.469 | 23.139 | 0.964 | 0.0332 | |
| Ours (SplatCtrlA) | 5.904 | 23.489 | 0.964 | 0.0329 | |
| Seamless | IDOL | 4.551 | 23.685 | 0.929 | 0.0650 |
| GUAVA | 4.483 | 24.125 | 0.929 | 0.0645 | |
| LHM | 3.776 | 24.383 | 0.935 | 0.0582 | |
| Ours (SplatCtrlA) | 3.595 | 24.858 | 0.936 | 0.0542 |
此外,针对 32 名专业受试者进行盲测用户调研(User Study),统计在面部表达、手势自然度、着装躯干还原度以及综合整体品质上被评为最优的百分比:
| 评估维度 | IDOL | GUAVA | LHM | 本文 (Ours) |
|---|---|---|---|---|
| 面部保真度 (Face) | 4.8% | 13.5% | 17.3% | 64.4% |
| 手部结构 (Hand) | 3.9% | 20.4% | 7.8% | 67.9% |
| 服饰躯干 (Clothed Body) | 2.9% | 11.5% | 10.6% | 75.0% |
| 整体综合质量 (Overall Quality) | 1.9% | 9.6% | 10.6% | 77.9% |
消融实验¶
消融实验在 Seamless Interaction 数据集上进行,逐一验证合成数据集、输入感知机制、高斯逆投影以及语义引导对最终渲染表现的必要性(为保证纯粹评估身体与纹理建模能力,消融指标计算时对面部区域进行了掩膜遮蔽处理):
| 配置 | MSE(\(\times 10^{-3}\)) ↓ | PSNR ↑ | SSIM ↑ | LPIPS ↓ | 说明 |
|---|---|---|---|---|---|
| Full model (完整模型) | 3.527 | 24.949 | 0.9365 | 0.0527 | 包含所有模块与 3DGS 数据集 |
| w/o GA data (移除高斯数字人数据集) | 5.283 | 23.037 | 0.9326 | 0.0676 | 仅用 2D 合成数据,PSNR 骤降 1.91 dB |
| w/o input-aware (移除输入感知解码) | 5.281 | 23.114 | 0.9328 | 0.0684 | 纯隐式特征解码,纹理锐度与细节丢失 |
| w/o GauInverse (移除高斯逆投影) | 5.846 | 22.733 | 0.9320 | 0.0669 | 仅靠粗网格投影,衣服外缘色彩错位最严重 |
| w/o semantic (移除语义引导) | 3.953 | 24.477 | 0.9328 | 0.0583 | 缺乏语义纠错,边缘像素溢色导致感知分下降 |
关键发现¶
- 3D 几何一致性数据集是提升生成上限的基石:当移除自行构建的 3D 高斯数字人数据集(w/o GA data)转而依赖类似于 IDOL 的 2D 扩散生成数据集时,PSNR 大幅下跌 1.91 dB,LPIPS 恶化至 0.0676。定性观察表明,2D 视频扩散生成的伪多视角图像帧间存在几何漂移,导致网络学到的高斯表征产生严重的模糊与“纹理渗色(texture-bleeding)”,尤其手指关节错乱碎裂。
- 解耦的输入感知机制对高频纹理还原至关重要:完全去除输入感知解码(w/o input-aware)后模型虽然能生成大致外形,但服饰图案和徽标完全模糊失真;若仅使用静态网格逆投影而放弃高斯逆投影(w/o GauInverse),在偏离人体表面的宽松衣物与发型轮廓处会出现大面积色彩伪影与投影撕裂(MSE 劣化达到 5.846);而语义引导则进一步解决了投影误投在背景或异类肢体上的边缘渗色问题。
- 面部与手部专项模块精准攻克“恐怖谷”:定性对比直观证明,针对面部的独立高分辨率模型结合零卷积高斯混合,成功恢复了清晰的牙齿微结构与眼神聚焦,彻底消除了全身模型常有的死板“面具脸”;同时手部 100 倍拉普拉斯平滑将用户调研中的手部最佳率提升至 67.9%,显著拉开了与 LHM(7.8%)和 IDOL(3.9%)的代际差距。
亮点与洞察¶
- 3DGS 表征与 UV 拓扑的深度契合:将 3D 高斯空间坐标与属性直接展开为 UV 纹理贴图,巧妙地搭建起了离散 3D 几何与 2D 现代卷积/Transformer 架构之间的桥梁,既保留了 3DGS 极低开销的实时光栅化渲染性能,又能直接复用预训练 2D 大模型的视觉先验。
- 几何与色彩的交替解耦迭代投影:先用网格逆投影指导几何偏移回归,再用修正后的高斯空间坐标做二次反向投影提取色彩,并施加 2D 语义纠错。这一设计在不增加复杂重参数化模块的前提下,彻底解决了参数化模型无法贴合衣物发丝的几何偏差痛点。
- 零卷积残差混合策略迁移性强:在融合全身大模型与局部专用模型(如人脸、手部)时,采用 StyleUNet + Zero Convolution 只学习边缘缝隙的微小修正量,该方案可以无缝扩展到鞋子、首饰或特定服饰模块的独立增强。
局限与展望¶
- 极端光照下的鲁棒性不足:由于训练管线中依赖的大规模高斯数字人数据主要合成自扩散模型生成的人体图像,整体光照偏向均匀漫反射,在面对强方向光、剧烈阴影或逆光等现实复杂摄影环境时,高斯色彩贴图容易固化输入光影,导致在极端新视角渲染时出现光照不自洽。
- 超精细发丝与微结构的表达上限:基于 SMPL-X UV 参数化的拓扑约束在处理远离身体表面的飘逸长发、细长发丝以及蓬松百褶裙等大跨度外凸几何时仍然受限,偶有几何平滑化倾向。
- 未来方向:可在数据构建流中引入重照明(Relighting)和内生反照率(Albedo)解耦机制;同时探索引入少量稀疏点云扩散先验,以在保持前馈效率的同时增强对自由形态外突几何(如长裙、爆炸头)的自适应拟合。
相关工作与启发¶
- vs IDOL [CVPR 2025]: IDOL 同样基于单图前馈预测人体高斯,但其完全依赖缺乏 3D 刚性一致性的 2D 扩散合成数据集(HuGe100K),且缺乏显式的几何位移与尺度正则化,导致在复杂手势下手指断裂粘连、纹理模糊。SplatCtrlA 构建了严格具备 3D 多视角几何一致性的高斯数据集,配合解耦输入感知解码与手部强正则,在 THuman2.0 上的 PSNR 高出 2.55 dB。
- vs LHM [ICCV 2025]: LHM 使用大规模真实视频训练,擅长宏观身体动作,但由于忽略了面部表情和手指动态解耦,手部在大幅度动作下产生剧烈漂移破碎,且面部呈现僵硬静态。SplatCtrlA 通过独立头部预训练模型与零卷积高斯混合网络,在保持全身高质感的同时实现了牙齿和眼神级别的面部驱动(用户调研面部最佳率达到 64.4% 对 17.3%)。
- vs GUAVA [ICCV 2025]: GUAVA 依赖逆向纹理贴图,但仅能处理上半身正向说话人场景,且对追踪贴合误差极其脆弱。SplatCtrlA 实现了全 360 度全身数字人建模,并通过高斯逆投影与语义校正攻克了追踪失准导致的贴图错位。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ 提出了一整套利用 3DGS 合成一致性数据集、几何色彩解耦逆投影解码及零卷积局部混合的前馈可控数字人系统方案,工程与算法设计高度精妙。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 THuman2.0、NeuMan 与 Seamless 三大权威基准,包含完整定性对比、消融分析及 32 人专业用户调研,数据充实详尽。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,图文对照呼应紧凑,从痛点剖析到模块设计娓娓道来。
- 价值: ⭐⭐⭐⭐☆ 推进了单图前馈生成高保真、全可控 3D 数字人技术的实用化落地,对数字人交互、游戏制作与虚拟现实内容生产具有重要借鉴意义。