Identity-Preserving Human Reconstruction from a Single Image via 3D Token Inference¶
会议: ECCV 2026
论文: ECCV 原文
领域: 3D 视觉
关键词: 3D人体重建, 身份保持, 稀疏体素表示, 3D Token 推理, 3D ID Adapter
一句话总结¶
本文提出身份保持的大型人体三维重建模型(IPRM),通过在基于 SMPL 的稀疏体素空间中利用基于可见性的交叉注意力显式冻结可见身份 token 并推断不可见区域,结合 3D 身份分支引导的 3D ID Adapter 消除解码漂移,在约 0.6 秒的前馈推理中实现了高几何保真度与强身份一致性的 3DGS 和 Mesh 重建。
研究背景与动机¶
从单张自然场景图像中重建逼真、带衣着的三维人体模型,在虚拟现实、游戏开发、影视制作与数字人动画等领域具有极高的应用价值。早期的单目人体重建方法多依赖隐式表面重建或参数化模型回归,但受限于几何质量与表达精度;近期基于 2D 多视角扩散生成的方法虽然能脑补未见区域的纹理,但在多视角一致性上存在固有硬伤,极易引入肢体扭曲、手指缺失或断裂等伪影,且多步去噪推断导致重构耗时动辄数分钟,难以满足实时交互需求。
与此同时,近期兴起的前馈式大重建模型(Large Reconstruction Models, LRMs)尝试将单图重建提速至秒级。然而现有人体重建框架(如 LHM 等)大多直接在参数化人体网格(SMPL)表面进行高密度点采样,并以全局 2D 图像特征作为条件更新所有 3D 点 token。这种「2D 条件 token 推理」机制存在两大致命瓶颈:其一,由于 SMPL 无法精确贴合宽松衣物(如裙子、阔腿裤),点投影极易发生拓扑偏差,且海量点特征计算开销巨大;其二,全局跨模态更新让网络在推理未见区域时无差别地改写了输入视角的已有特征,导致三维重建在面部、手部与服饰图案上发生严重的身份漂移(Identity Drift),无法严格对齐输入图像中的真实身份。
针对上述核心矛盾,本文提出摒弃不可靠的表面点采样与全局 2D 条件更新,转而在几何鲁棒的三维空间中建立身份对齐的特征表达。核心 idea:将单目三维人体重建锚定在基于 SMPL 的稀疏体素空间,利用基于可见性的交叉注意力在冻结可见身份 token 的前提下显式推理不可见区域,并在解码阶段引入并行 3D 身份引导分支(3D ID Adapter)进行 token 级特征注入,实现不到 1 秒的高保真、强身份一致性前馈人体重建。
方法详解¶
整体框架¶
IPRM 的整体架构包含两个阶段的前馈流程。在第一阶段,给定单张输入人体图像 \(I\) 及其估计的 SMPL-X 模型,IPRM 构建围绕 SMPL 网格的稀疏体素空间,提取图像 DINOv2 特征并反投影至占据体素中,经视角法向计算与射线遮挡剔除将体素划分成「可见身份 token」与「不可见待推断 token」。随后,身份感知 3D Token 推理模块(Identity-aware 3D Token Inference Module)通过多层基于可见性的交叉注意力,利用可见 token 推断不可见 token,并结合由可见与不可见人体特征拼接而成的自适应 3D 人体特征(Adaptive 3D Human Feature)完成三维几何与语义补全,输出完备的 3D 稀疏体素特征 \(V_{\text{3D}}\)。在第二阶段,完备的三维体素特征输入专用的编码器-解码器架构,解码生成高斯泼溅(3DGS)或多边形网格(Mesh);为了彻底杜绝从体素空间向显式表达映射过程中的身份漂移,解码网络中引入了平行的 3D 身份分支与 3D ID Adapter,以 token 级粒度施加输入视角的可见身份引导。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["单张输入图像 + SMPL-X 粗网格"] --> B["SMPL 稀疏体素空间构建与投影<br/>DINOv2 特征反投影与可见性分类"]
B --> C["可见身份 token 与不可见待推理 token"]
C --> D["基于可见性的交叉注意力推理<br/>冻结可见身份 token 仅更新不可见区域"]
D --> E["自适应 3D 人体特征全局细化<br/>可见与不可见人体全局先验约束"]
E --> F["完备 3D 稀疏体素特征"]
F --> G["3D ID Adapter 引导的特征解码<br/>并行 3D 身份分支注入 Key/Value 约束"]
G --> H["前馈输出 3DGS / Mesh 重建结果<br/>整流程耗时约 0.63 秒"]
关键设计¶
1. 基于 SMPL 的稀疏体素 token 化:提升拓扑鲁棒性与计算效率
针对 SMPL 表面密集点采样在面对宽松服饰时严重失准、且海量点计算开销巨大的缺陷,IPRM 提出在 SMPL 模型周围的三维网格空间中定义稀疏体素(Sparse Voxel)。通过筛选被 SMPL 几何体占据的有源体素格子,模型不仅勾勒出人体粗糙几何框架,还建立起对 SMPL 估计误差更具鲁棒性的局部邻域三维空间。输入图像经 DINOv2 提取特征后反投影到对应体素内,形成单视角体素序列 \(T = (z_i, f_i)_{i=0}^{N-1}\),其中 \(z_i \in \{0, 1, \dots, n-1\}^3\) 为有源体素三维网格索引,\(f_i\) 为投影特征向量。体素分辨率默认设置为 \(n=128\)。紧接着,算法通过计算体素法向量与相机光线的夹角进行背面剔除,并沿光线步进检测遮挡体素,精确构建出二值可见性掩码 \(M\),将所有体素划分为可见身份 token \(T_V\) 与待推断的不可见 token \(T_I\)。这种表示有效将单目视角下的明确观测区域与遮挡未知区域在三维坐标系下严格解耦。
2. 身份感知 3D Token 推理模块:严格冻结已知身份并补全遮挡结构
以往方法在 Transformer 中将所有 3D token 统统经由自注意力或以 2D 图像特征为 condition 进行更新,不可避免地破坏了已知视角已对齐好的高精度纹理与面部几何。本文设计了基于可见性的交叉注意力块(Visibility-based Cross-Attention),以不可见 token \(T_I\) 作为 Query,以可见身份 token \(T_V\) 作为 Key 和 Value,使得信息仅从已知区域向未知区域单向传导,从而在数学上严格保证了可见身份 token \(T_V\) 在整个推断过程中保持不变。为了解决跨可见与不可见区域边界处的连续性问题并补充人体专属全局语义,模型进一步引入自适应 3D 人体特征(Adaptive 3D Human Feature)。网络利用专用的人体特征提取器获得可见侧全局向量 \(\mathcal{P}_V\),并通过交叉注意力由推断出的 \(T_I\) 预测不可见侧全局向量 \(\mathcal{P}_I\),将二者拼接形成全人体先验 \(\mathcal{P}_{3D} = \mathcal{P}_V \parallel \mathcal{P}_I\),用以对所有体素进行上下文校准与连贯性增强:
3. 3D ID Adapter 与并行身份分支:消除解码映射中的身份漂移
在将完整的 3D 体素特征 \(V_{\text{3D}}\) 送入编码器-解码器生成 3DGS 参数(高斯中心偏移、颜色、旋转、缩放、不透明度)或 Mesh 的符号距离场(SDF)时,直接映射往往因为隐空间解码的多义性导致面部和衣服标识细节退化。传统的 2D ID Adapter 依靠 2D 图像特征交叉注意力提供条件,但在 3D-2D 跨空间对齐上能力有限。IPRM 提出了专用的 3D ID Adapter 机制:构建一个与主重建分支结构对称的并行身份分支(Identity Branch)。该分支仅以单视角可见体素特征 \(V_S\) 为输入,以输入视角原图为重建监督目标,专门学习从 2D 图像提取 3D 身份条件 token。在主重建分支(Target Branch)的自注意力层中,借鉴 ReferenceNet 的设计思想,用身份分支中可见 token 对应的 Key 和 Value 替换主分支自注意力层中的 Key 和 Value,同时保持 Query 不变;不可见 token 则保留主分支内部的 Key/Value。这种三维同构空间下的 token 级特征注入,使得可见区域的显式高斯或网格在解码时始终受到原图强约束,彻底根除了身份漂移问题。
损失函数 / 训练策略¶
IPRM 采用分阶段解耦的训练策略: 1. 第一阶段(3D Token 推理训练):利用多视角渲染图反投影并池化聚合得到真实三维体素特征 \(V_{\text{3D}}^{\text{GT}}\) 作为监督信号,利用均方误差损失(3D MSE Loss)优化身份感知 3D Token 推理模块。使用 AdamW 优化器,初始学习率为 \(2 \times 10^{-3}\),训练 200,000 次迭代。 2. 第二阶段(编码器-解码器与 3D ID Adapter 联合训练):冻结第一阶段模块,微调预训练的 3D 编码器-解码器架构与并行身份分支。对于 3DGS 解码分支,结合多视角渲染与真实图像计算 \(L_1\) 损失、结构相似度损失(D-SSIM)以及感知损失(LPIPS);对于 Mesh 解码分支,在体素顶点输出有符号距离场(SDF),由等值面提取网格,并通过渲染法向图与深度图计算 \(L_1\) 损失。身份分支仅由输入视角的图像进行重构监督,同时在两分支的身份视角特征间添加一致性约束损失。第二阶段初始学习率设为 \(5 \times 10^{-4}\),训练 100,000 次迭代。
实验关键数据¶
主实验¶
在合成数据集(Synthetic Data)与 THuman2.1 基准数据集上评估 3DGS 重建性能,测试指标包括全视角渲染质量(PSNR、SSIM、LPIPS)、输入视角身份保持度(PSNR(I))与人脸一致性误差(Face Consistency, FC↓),并对比单卡推理时间与显存开销。
| 方法 | 类别 | Synthetic PSNR↑ | Synthetic SSIM↑ | PSNR(I)↑ | FC↓ | THuman PSNR↑ | THuman SSIM↑ | 推理时间 | 显存占用 |
|---|---|---|---|---|---|---|---|---|---|
| GTA (NeurIPS 2023) | 2D 先验 | 17.03 | 0.919 | 17.66 | 0.051 | 19.61 | 0.834 | 0.68s | ≈8GB |
| SIFu (CVPR 2024) | 2D 隐式 | 16.68 | 0.917 | 19.22 | 0.060 | 19.44 | 0.831 | 0.65s | ≈9GB |
| DreamGaussian (ICLR 2024) | SDS 优化 | 18.54 | 0.917 | 19.47 | 0.056 | - | - | 2 min | ≈8GB |
| SiTH (CVPR 2024) | 扩散生成 | - | - | - | - | 18.46 | 0.820 | 45.12s | ≈21GB |
| PSHuman (CVPR 2025) | 多视角扩散+雕刻 | 17.56 | 0.921 | 21.44 | 0.037 | 20.85 | 0.864 | 1 min | ≈40GB |
| Trellis* (CVPR 2025) | 通用 3D 扩散微调 | 21.67 | 0.921 | 21.99 | 0.058 | 21.33 | 0.886 | 4.20s | ≈11GB |
| LHM-0.5B (ICCV 2025) | 2D 条件 3D Token | 25.18 | 0.951 | 26.64 | 0.035 | - | - | 2.01s | ≈18GB |
| IPRM (本文) | 3D Token 推理 | 27.04 | 0.954 | 28.90 | 0.033 | 26.74 | 0.948 | 0.63s | ≈9GB |
在 THuman2.1 数据集的 Mesh 重建对比中(评估 Chamfer Distance CD↓、Point-to-Surface P2S↓ 和 Normal Consistency NC↑): - 优化型方法 PSHuman(带单例迭代优化)指标为 CD: 0.4399, P2S: 0.4077, NC: 0.8504; - 本文 IPRM(纯前馈无需任何逐例优化,耗时仅 0.63s)取得 CD: 0.4458, P2S: 0.4331, NC: 0.8504,达到与优化算法高度相当的几何重建质量,并大幅优于 ICON (CD 0.6146)、ECON (CD 0.6725) 和 GTA (CD 0.5791)。 - 在 CustomHumans 测试集上,IPRM 的 PSNR 达到 29.33 dB,人脸一致性误差 FC 降至 0.035,显著优于 LHM-0.5B(28.31 dB, FC 0.039)。
消融实验¶
在 Synthetic Data 上对核心模块与表征方式进行消融,验证各组件对输入视角身份一致性与整体保真度的作用:
| 配置 | PSNR(I)↑ | SSIM↑ | LPIPS↓ | 说明与分析 |
|---|---|---|---|---|
| Full Model (IPRM 完整模型) | 28.90 | 0.954 | 0.03 | 默认采用 \(n=128\) 稀疏体素与完整结构 |
| w/o 特征投影 (w/o Feature Project) | 17.01 | 0.911 | 0.10 | 仅用位置编码初始化体素,丢失直接图像纹理投影,严重溃败 |
| 体素分辨率降低 (Voxel \(n=64\)) | 27.36 | 0.930 | 0.05 | 分辨率粗化损失细粒度几何,但推理速度略快 (0.48s vs 0.63s) |
| w/o 可见性交叉注意力 (替换为自注意力) | 27.87 | 0.952 | 0.04 | 未见区推理时污染了可见身份 token,PSNR(I) 显著下降 1.03 dB |
| w/o 自适应 3D 人体特征 | 28.54 | 0.953 | 0.03 | 缺失不可见区域的人体专属先验,边界过渡与结构平滑度受损 |
| w/o 身份条件引导 (w/o Condition) | 25.80 | 0.950 | 0.04 | 解码过程完全缺乏身份约束,发生严重身份漂移 |
| 采用传统 2D 图像条件 (w/ 2D ID Adapter) | 26.42 | 0.952 | 0.04 | 2D 特征与 3D 体素跨域对齐困难,身份增益远不及 3D ID Adapter |
关键发现¶
- 3D ID Adapter 对身份保持起决定性作用:完全不加条件引导时,输入视角 PSNR(I) 仅为 25.80 dB;引入传统 2D 图像特征交叉注意力仅微增至 26.42 dB;而通过并行身份分支引入 3D 身份 token 替换 Key/Value 后,PSNR(I) 骤升至 28.90 dB(净增 3.10 dB),证明三维同域空间的 token 级引导能极大抑制解码过程中的身份漂移。
- 可见性交叉注意力有效保护已知观测:将可见性交叉注意力换成传统的全自注意力层,会导致已知区域的特征被不可见区域预测过程反向稀释,输入视角 PSNR(I) 掉点超过 1 dB。
- 稀疏体素赋予宽松衣物极强容错率:对于宽大裙摆和阔腿裤,由于真实几何严重偏离 SMPL 紧身网格,基于 SMPL 表面的点采样方法会出现明显的撕裂和塌陷,而基于空间的稀疏体素表示能稳定囊括衣物外轮廓,重建出平滑连续的外观。
亮点与洞察¶
- 3D 空间的「见与未见」显式因果推断:以往大重建模型大多直接依赖 2D 扩散或无差别全量注意力更新,而本文在三维空间通过几何投影与遮挡光线追踪构建可见性掩码,用交叉注意力实现了「可见指导不可见、不可见不回传可见」的单向信息流,概念简洁且机制严格保真。
- 并行 3D 身份分支与 ReferenceNet 式特征替换:巧妙避开了 2D 特征向 3D 解码器交叉注意力注入时的跨模态对齐摩擦,利用仅在输入视角监督的轻量 3D 身份分支生成原生 3D token 替换 Key/Value,为三维生成模型的条件注入提供了极具参考价值的范式。
- 秒级前馈且兼顾双重表征:第一阶段推理约耗时 0.2 秒,第二阶段解码约耗时 0.4 秒,全流程约 0.63 秒即可一次性输出高质量 3DGS 与 Mesh,摆脱了扩散模型的迭代多步采样与逐例优化依赖,显存占用控制在 9GB 左右,具备极高的工程落地价值。
局限与展望¶
- 极端姿态与超体格外饰的重构失真:由于体素生成依赖 SMPL-X 提供初始空间定位,当人体处于极度扭曲的姿态,或穿着极其夸张的蓬蓬裙、携带大型道具(如乐器、背包)时,部分几何超出 SMPL 局部包围体素范围,会导致重建缺失或边缘截断。
- 依赖预训练人体基础模型的通用性:自适应人体特征依赖预训练的人体视觉特征模型(如 Sapiens),在罕见人种装扮或特殊服饰下的泛化性受限于上游特征提取器。
- 未来改进方向:可考虑将通用 3D 生成先验(如开放域物体扩散模型)与人体 SMPL 先验动态自适应融合,解耦人体主体与外部道具/超大衣物的建模;同时,由于 IPRM 前馈速度极快,可作为各类高精细化逐例微调算法的极佳几何与外观初值。
相关工作与启发¶
- vs LHM (Large Animatable Human Reconstruction Model):LHM 采用在 SMPL 网格表面密集采样点特征并借助全局 2D 图像特征进行全自注意力更新,容易在面部和手部产生身份漂移且无法处理宽松服装;IPRM 采用基于 SMPL 的空间稀疏体素作为几何载体,通过可见性交叉注意力单向推断遮挡区域,并在解码器端加入 3D ID Adapter,全面刷新了身份一致性与重建精度。
- vs PSHuman:PSHuman 依赖多视角 2D 扩散模型脑补多视角视图,并配合耗时约 1 分钟且需约 40GB 显存的逐例雕刻网格优化算法;IPRM 采用全前馈两阶段 3D Token 推理流程,用时仅 0.63 秒、显存仅需约 9GB,且在网格重建质量指标上与之相当,在实时交互场景优势巨大。
- vs Trellis:Trellis 将稀疏体素应用于开放域 3D 生成,但缺乏人体解剖先验与单图可见性对齐机制;IPRM 将稀疏体素引入人体 SMPL 参数化空间,利用可见性掩码与对称身份分支解决了单目人体重建特有的身份漂移瓶颈。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ 提出在 SMPL 稀疏体素空间中基于可见性掩码做单向 3D Token 推理,并设计 3D ID Adapter 替代传统 2D 引导,思路清晰且针对性强。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 3DGS 与 Mesh 双表征评测,在 Synthetic Data、THuman2.1 及 CustomHumans 上完成多项对比与细致消融,推理速度与显存对比详尽。
- 写作质量: ⭐⭐⭐⭐⭐ 动机阐述深刻,方法框架结构紧凑,图表逻辑自洽,三维与二维特征空间的利弊分析透彻。
- 价值: ⭐⭐⭐⭐⭐ 实现约 0.6 秒的单图高质量身份保持三维人体前馈重建,显存占用小,兼顾 3DGS 实时渲染与 Mesh 驱动,应用前景广阔。