跳转至

DiGS-Avatar: Single-Image Animatable 3D Human Reconstruction via UV-Space Diffusion

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/KLMAV-CUC/DiGS-Avatar
领域: 3D 视觉
关键词: 3D人体重建、可驱动数字人、3D高斯泼溅、隐式扩散模型、UV空间补全

一句话总结

DiGS-Avatar 将单视角可驱动 3D 人体重建重新表述为规范 UV 隐空间的扩散补全任务,借助多视角教师网络蒸馏几何一致的隐空间骨架,并通过跨注意力语义聚合模块注入高层外观特征,仅耗时 0.71 秒即可从单张图像生成高保真且天然支持骨骼驱动的 3D Gaussian 人体模型。

研究背景与动机

从单张图像重建高保真、可动画驱动的 3D 人体在虚拟现实、游戏娱乐和具身智能等场景具有重要价值。然而,由于衣物纹理多样、非刚性形变剧烈、人体姿态复杂以及背部和自遮挡区域的存在,单视角人体三维重建在数学上属于严重欠定的逆问题。早期的纯确定性前馈回归方法(如 IDOL、LHM)虽然推理速度快,但由于缺乏强生成先验,容易产生过度平滑的几何结构,且在不可见视角无法脑补出合理的细节;而近年来兴起的多视角扩散模型先合成多视角图像再重建 3D 高斯,不仅多阶段开销巨大,还常因生成视角间微小的几何冲突导致贴图漂移与破面。

为规避多视角视差不一致,部分工作尝试构建原生 3D 扩散模型(如 SyncHuman、TRELLIS),直接在三维体素或三平面隐空间进行扩散建模。然而原生 3D 方法严重依赖密集的 3D 几何真值监督,并且高维体素计算极其沉重,动辄耗费几十秒的单图推理时间与数千 GPU 时的训练成本,难以应用于交互式场景。这就构成了一个关键矛盾:现存方案要么在确定性回归中牺牲高频细节,要么在多视角扩散中牺牲视角几何一致性,要么在原生 3D 扩散中被沉重计算拖垮。

本文给出的切入思路是:既然 SMPL-X 参数化模型提供了连续且唯一的二维表面参数化坐标,那么人体几何与外观完全可以解构到规范的展开表面上。核心 idea:将单图 3D 人体重建重新建模为规范 UV 隐空间的 2D 扩散补全任务,借助多视角教师网络蒸馏出视点一致的伪真值隐结构,再通过跨注意力语义聚合(GASA)注入高层语义细节并直接解码为拓扑绑定的 3D 高斯图元。

方法详解

整体框架

DiGS-Avatar 的整体处理流程建立在规范 UV 表面对齐的空间中。在推理阶段,给定单张未标定的人体参考图像 \(I_\text{ref}\),模型分别提取用于刻画紧凑几何结构的 VAE 隐式特征以及基于冻结 DINOv3 的高维外观语义特征。单视角 VAE 特征通过基于 SMPL-X 的逆纹理映射投射到规范 UV 空间形成局部可见的残缺潜码,随后由条件 2D 扩散模型预测补全未见区域,生成完整的规范 UV 隐式骨架。紧接着,几何对齐语义聚合模块(GASA)将多层外观特征通过分级跨注意力逐步注入该隐式骨架,最后由 UV-to-3DGS 解码器将高分辨率 UV 特征图解码为相对于 SMPL-X 顶点的显式 3D 高斯图元,天然支持线性混合蒙皮(LBS)动画驱动。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["单张输入图像 + SMPL-X 参数"] --> B["多视角教师蒸馏与单视隐空间补全<br/>VAE逆投影与条件扩散生成完整UV骨架"]
    B --> C["分级跨注意力语义聚合 (GASA)<br/>DINOv3深/中/浅层语义无损注入"]
    C --> D["规范 UV-to-3DGS 属性解码与驱动<br/>相对偏移量回归与快速 LBS 蒙皮"]
    D --> E["高保真可驱动 3D 虚拟人"]

关键设计

1. 多视角教师蒸馏与单视隐空间补全:以纯 2D 任务实现内建 3D 几何一致性

单视角输入下,不可见区域的真实全景 UV 潜码在物理上不可直接观测,若直接用单视监督训练扩散模型容易引发几何歧义。为此,DiGS-Avatar 构建了一个多视角教师网络:在训练阶段输入同一人物的 \(N\) 个已知姿态视角图像,利用附加 Plücker 光线嵌入的 UV-Alignment Transformer 进行特征融合,跨视角消除几何冲突,生成严格几何对齐的高质量完整 UV 隐变量 \(Z_\text{VAE} \in \mathbb{R}^{32 \times 32 \times 32}\) 作为伪真值骨架。在学生端,输入图像经 VAE 编码并逆投影至 UV 空间后形成局部可见潜码,条件扩散模型 \(D_\theta\) 在教师提供的无噪真值 \(x_0 = Z_\text{VAE}\) 监督下学习去噪: $$ \mathcal{L}\text{diff} = \mathbb{E} \left[ |\epsilon - \epsilon_\theta(x_t, t, \xi)|^2_2 \right] $$ 其中条件向量 \(\xi = F_\text{ref}^\text{VAE} \oplus F_\text{ref}^\text{app} \oplus N_\text{ref}^\text{SMPL-X}\) 显式融合了 VAE 结构特征、DINOv3 外观特征与 SMPL-X 表面法向图。这一设计完全摆脱了推理期昂贵的多视角图像生成与体素 3D 卷积,将高维生成任务简化为高效且天然视角一致的 2D 修复。

2. 分级跨注意力语义聚合(GASA):克服 VAE 压缩失真的渐进式细节注入

标准 VAE 的隐空间高度紧缩(空间分辨率仅 \(32 \times 32\)),虽然具备出色的几何拓扑骨架表达能力,但不可避免地丢失了织物褶皱、面部轮廓及服饰图案等高频微结构细节。为了在不破坏拓扑骨架一致性的前提下找回高频质感,GASA 模块引入预训练且权重冻结的 DINOv3 视觉骨干,将提取的 768 维特征切分为深层(\(F_\text{deep}^\text{app}\))、中层(\(F_\text{mid}^\text{app}\))与浅层(\(F_\text{shallow}^\text{app}\))三组。随后在 UV 空间执行三级粗到细的跨注意力注入与空间上采样: $$ Z^{(1)} = \text{CrossAttn}{32}(Z\text{VAE}, F_\text{deep}^\text{app}) $$ $$ Z^{(2)} = \text{CrossAttn}{64}(\text{Upsample}(Z^{(1)}), F\text{mid}^\text{app}) $$ $$ F_\text{UV} = \text{CrossAttn}{128}(\text{Upsample}(Z^{(2)}), F\text{shallow}^\text{app}) $$ 以 \(Z_\text{VAE}\) 及其上采样特征图作为 Query,分级外观特征作为 Key 和 Value,既保持了严谨的几何轮廓约束,又高效恢复出高达 \(128 \times 128\) 分辨率的丰富纹理细节。

3. 规范 UV-to-3DGS 属性解码与驱动:拓扑锚定的局部偏移预测

为使重建的人体模型天然具备实时动画驱动能力,模型避免使用黑盒变形场,而是将高斯基元严格绑定到 SMPL-X 参数化网格的局部流形上。解码器将高分辨率特征图 \(F_\text{UV}\) 映射为多通道高斯属性图,每个高斯基元 \(G_k\) 的中心位置 \(\mu_k\)、缩放 \(s_k\) 与旋转 \(r_k\) 均表示为相对于对应 SMPL-X 规范顶点初始属性 \((\hat{\mu}_k, \hat{s}_k, \hat{r}_k)\) 的显式偏移量: $$ \mu_k = \hat{\mu}_k + \delta \mu_k, \quad s_k = \hat{s}_k \odot \delta s_k, \quad r_k = \hat{r}_k \cdot \delta r_k $$ 由于所有高斯图元均直接绑定在 SMPL-X 网格表面,用户在新视角与新骨骼姿态下仅需调用标准的线性混合蒙皮(LBS)即可即时完成驱动渲染,彻底消除了神经隐式场在剧烈肢体旋转时容易出现的“纹理滑动”(texture sliding)与几何撕裂问题。

损失函数 / 训练策略

模型采取分阶段渐进式训练方案。教师网络首先在多视角数据集上联合训练 VAE、GASA 及 3DGS 解码器,总损失由渲染保真项与高斯中心偏移正则化构成:\(\mathcal{L}_\text{teacher} = \mathcal{L}_\text{photo} + \lambda_\text{off} \|\delta \mu_k\|_2^2\),其中 \(\mathcal{L}_\text{photo} = \mathcal{L}_\text{MSE} + \lambda_\text{VGG} \mathcal{L}_\text{VGG}\)。冻结教师提取的潜码后,学生端扩散模型以教师产出的 \(Z_\text{VAE}\) 为基准,利用去噪扩散损失 \(\mathcal{L}_\text{diff}\) 与渲染损失 \(\mathcal{L}_\text{photo}\) 联合优化: $$ \mathcal{L}\text{student} = \mathcal{L}\text{diff} + \lambda_\text{photo} \mathcal{L}_\text{photo} $$ 推理时采用 Soft Blending Euler 采样器(20 步,无分类器引导系数 CFG=0.1),单张 GPU 显存占用低且全流程单图推理仅需 0.71 秒。

实验关键数据

主实验

论文在三个代表性的人体数据集(合成数据集 HuGe100K,高精度真实扫描数据集 THuman 2.1 与 2K2K)上进行全方位视角重建对比,每项评估固定输入为正视图,以未见视角作为真值评估新视角合成质量(指标包含 PSNR、SSIM 以及感知误差 LPIPS)。

表 1:域内数据集定量重建性能对比(摘自原论文 Table 1,* 表示支持即时骨骼动画驱动)

方法 HuGe100K (PSNR ↑ / SSIM ↑ / LPIPS ↓) THuman 2.1 (PSNR ↑ / SSIM ↑ / LPIPS ↓) 2K2K (PSNR ↑ / SSIM ↑ / LPIPS ↓)
SIFU 18.44 / 0.921 / 0.095 16.82 / 0.926 / 0.095 18.54 / 0.931 / 0.091
Human3Diffusion 18.09 / 0.893 / 0.101 15.67 / 0.902 / 0.105 19.29 / 0.908 / 0.079
IDOL* 22.75 / 0.926 / 0.084 18.82 / 0.937 / 0.077 18.17 / 0.916 / 0.092
LHM* 21.76 / 0.919 / 0.065 19.62 / 0.931 / 0.072 20.67 / 0.918 / 0.073
TRELLIS 18.24 / 0.895 / 0.093 16.52 / 0.910 / 0.094 18.72 / 0.907 / 0.084
SyncHuman 17.52 / 0.893 / 0.092 17.04 / 0.911 / 0.089 20.27 / 0.917 / 0.069
DiGS-Avatar (本文)* 25.32 / 0.940 / 0.039 21.45 / 0.938 / 0.060 22.22 / 0.919 / 0.064

表 2:SIZER 零样本泛化表现与计算效率对比(摘自原论文 Table 2)

方法 SIZER PSNR ↑ SIZER SSIM ↑ SIZER LPIPS ↓ 训练开销 (GPU小时) 单图推理耗时 (秒) ↓
SIFU 19.30 0.905 0.101 - 30.0
Human3Diffusion 19.14 0.904 0.088 ~960 28.0
IDOL* 21.90 0.922 0.075 ~768 2.25
LHM* 23.45 0.929 0.064 ~2,496 5.13
TRELLIS 19.94 0.916 0.078 ~10,000 7.43
SyncHuman 19.56 0.916 0.074 - 51.0
DiGS-Avatar (本文)* 23.54 0.932 0.065 ~60 0.71

消融实验

为明确各个模块的不可替代性,作者在 HuGe100K 测试集上进行了系统消融分析。

表 3:关键模块定量消融分析(摘自原论文 Table 3)

实验变体配置 PSNR ↑ SSIM ↑ LPIPS ↓ 核心说明
教师网络上限 (Teacher) 26.18 0.942 0.037 多视角输入下的几何潜码质量理论上限
移除教师蒸馏 (w/o Teacher) 19.03 0.804 0.168 缺乏视点对齐的真值潜码,潜码拓扑严重崩塌
移除 GASA 语义注入 (w/o GASA) 22.52 0.915 0.084 纯依赖压缩 VAE 导致高频纹理严重模糊平滑
替换为标准 LDM-UNet 17.39 0.790 0.204 常规 UNet 无法有效建模高维压缩 UV 空间的长程依赖
移除条件引导 (w/o condition) 23.26 0.936 0.061 缺失法向与外观条件导致未见视角对齐能力削弱
移除扩散去噪损失 (w/o \(\mathcal{L}_\text{diff}\)) 15.98 0.785 0.226 去掉核心扩散驱动目标后无法有效补全未见区域
完整模型 (Ours full)* 25.32 0.940 0.039 单视角输入下性能逼近多视角教师理论上限

关键发现

  1. 多视角教师监督是决定性基石:消去教师网络后,PSNR 从 25.32 骤降至 19.03,LPIPS 恶化超过 4 倍(0.039 增至 0.168)。这证明单凭单视角自监督无法消除展开 UV 空间的几何歧义,教师的多视角融合为学生提供了关键的结构锚点。
  2. GASA 是高频质感的直接源泉:去掉 GASA 后,虽然整体几何大体保持,但由于 VAE 潜码 \(32 \times 32\) 尺度的空间压缩失真,LPIPS 显著上涨至 0.084,PSNR 下降了 2.80 dB,图像呈现严重塑料感与过度平滑。
  3. 计算效率与成本具备压倒性优势:在单张 A100 GPU 上,DiGS-Avatar 的完整重建仅需 0.71 秒,相比原生 3D 扩散基线 SyncHuman(51 秒)提速超 70 倍,相比轻量前馈回归模型 IDOL(2.25 秒)快 3 倍,且训练开销仅约 60 GPU 小时,具备极高部署价值。

亮点与洞察

  • 将 3D 重建升维降解为规范 2D 隐式修复:利用人体几何在拓扑上可由 SMPL-X 唯一展开的数学性质,回避了开销极大的体素/三平面三维扩散,从根源上消除了多视角图像拼接的不一致性。
  • 解耦“紧凑几何骨架”与“高阶外观语义”:让低维 VAE 潜码专注于稳定、低频且无歧义的拓扑空间,将高频精细纹理全权交由 DINOv3 与跨注意力机制按需聚合,兼顾了生成先验的稳定性与纹理锐利度。
  • 可复用的拓扑绑定设计范式:将 3D 高斯基元作为 SMPL-X 网格顶点的局部位移偏移量进行回归,使得几何重建与骨骼动画蒙皮天然无缝兼容,避免了后续复杂的非刚性配准。

局限与展望

  • 受制于 SMPL-X 骨骼模板的拓扑表达范围:由于高斯基元是基于 SMPL-X 顶点偏移生成的,当面对极度宽松的非刚性服饰(如蓬蓬裙、流动长袍)或极端剧烈且偏离人体运动学范围的姿态时,顶点局部偏移机制难以捕捉大范围拓扑脱节。
  • 对初始单图姿态估计精度的敏感性:在真实复杂测试集上依赖 Multi-HMR 预测 SMPL-X 参数,若人体姿态和体型回归出现显著偏差,逆纹理映射与法向图条件输入可能产生累积几何误差。
  • 未来改进方向:可探索更高分辨率的分块 UV 潜码,并在网格外围引入松弛的自由高斯图元层,以优雅适配超大形变服饰与随身携带的大型道具。

相关工作与启发

  • vs IDOL / LHM(确定性前馈回归):IDOL 和 LHM 依赖确定性模型直接预测规范高斯属性,缺乏生成式探索能力,背部与被遮挡区域必然过度平滑。DiGS-Avatar 引入 2D 扩散隐式补全,在不可见视角能够生成富含合理细节的高频纹理,PSNR 分别高出 2.57 dB 与 3.56 dB。
  • vs Human3Diffusion / SIFU(多视角图像扩散与纹理修复):前者在图像像素空间生成多视角照片再行拟合,容易出现视差微抖动和视角几何缝合瑕疵;DiGS-Avatar 在单张展开的规范 UV 空间内进行全局补全,表面每个像素位置天然且唯一对应身体物理点,在数学上规避了视角冲突。
  • vs SyncHuman / TRELLIS(原生 3D 生成模型):原生 3D 扩散依赖沉重的体素化三维网格或多阶段同步,单张生成耗时数十秒且计算昂贵。DiGS-Avatar 纯粹在 2D 展开流形上运算,仅需 0.71 秒完成高质量推理,效率提升 70 余倍。

评分

  • 新颖性: ⭐⭐⭐⭐ [将 3D 人体重建优雅规约为规范 UV 隐空间修复,并构建教师-学生多视几何蒸馏框架,构思清晰巧妙]
  • 实验充分度: ⭐⭐⭐⭐⭐ [涵盖三大基准集及 SIZER 零样本泛化测试、真实世界图像验证、完整的定量消融与详尽的计算效率对比]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑严密,图表清晰自洽,公式与架构叙述精炼准确]
  • 价值: ⭐⭐⭐⭐⭐ [兼顾毫秒级极速推理与高保真可驱动表现,为轻量级单图 3D 数字人生成落地提供了高度实用的范式]