GenLCA: 3D Diffusion for Full-Body Avatars from In-the-Wild Videos¶
会议: ECCV2026
论文: ECCV 原文
项目: GenLCA
领域: 人体理解 / 3D 视觉
关键词: 可驱动数字人、3D 扩散、部分可观测性、可见性监督、多模态编辑
一句话总结¶
GenLCA 将真实视频编码成结构化 3D 高斯令牌,只用可见区域监督扩散模型,在百万级身份数据上学习可由文本和图像控制的全身数字人,兼顾生成质量、编辑能力与面部和身体动画。
研究背景与动机¶
可驱动数字人不仅需要从一个角度看起来像人,还要在转身、换姿态和改变表情后保持一致。 传统采集依赖同步多视角设备或充分覆盖身体的单目视频,能得到可靠监督,却难以扩展到大量身份和服装。 合成数据较易扩充,但材质、面部细节和服装外观与真实人像存在分布差异。 利用 2D 扩散先验逐个优化 3D 人物的 SDS 方法又容易出现不自然风格,并为每个资产付出较长优化时间。 因此,原生 3D 生成缺少的并不只是更强的去噪器,还包括可规模化获取、外观真实且能够动画化的训练表示。
现实视频提供了另一种规模来源,但视频中的人往往只露上半身,或者始终正对镜头。 前馈重建模型可以把这些图像转换为完整形状的令牌张量,却不能保证张量的每个位置都有可靠观测。 例如,上半身视频可能产生透明的下肢,而正面视频重建出的背部容易模糊。 如果把整份重建结果当作准确的 3D 真值,生成模型就会把这些失败模式也学成正常人体分布。 问题于是从“怎样补齐每个训练样本”转为“怎样保留它已经可靠提供的信息,同时不把猜出来的部分当监督”。
GenLCA 复用 LCA 的可驱动重建表示,把不同身份对齐到同一组人体查询点,再逐位置判断监督是否有效。 这种空间对应关系让来自不同视频的局部观测可以共同支撑全身分布学习,而不要求每条视频都完整拍到一个人。 少量覆盖充分的采集数据仍参与训练,因此它不是完全依靠残缺视频、也不是摆脱重建先验的方案。 核心 idea:把不完整的 2D 视频变成局部可信的 3D 令牌,用可学习占位特征隔离无效输入,再仅在可见区域学习生成分布。
方法详解¶
整体框架¶
训练时输入的是同一身份的视频帧;部署时的生成条件则可以只有文字、身体部位图像或涂鸦,两者不能混为一谈。 流水线依次使用结构化数字人令牌化、保点压缩、可见性感知训练和多模态流生成。 输出不是一组互不一致的 2D 视图,而是能交给同一解码器驱动和渲染的 3D 高斯表示。 令牌化与可见性计算负责准备训练数据,压缩器先单独训练,随后扩散模型在压缩潜空间学习。 生成时从噪声得到完整潜表示,经压缩器解码恢复高斯令牌,再由姿态和表情条件控制动画。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["训练:同一身份视频帧"] --> B["结构化数字人令牌化"]
B --> C["保点压缩"]
B -->|渲染贡献生成掩码| D["可见性感知训练"]
C --> D
D -.->|占位输入与掩码监督| E["多模态流生成"]
F["生成:噪声与文本、<br/>部位图像或涂鸦"] --> E
E --> G["潜表示解码与数字人解码<br/>姿态、表情驱动高斯渲染"]
关键设计¶
1. 结构化数字人令牌化:让视频观测落到统一的人体位置
LCA 接收同一身份的 4 张身体图像和 4 张面部图像,先由 Sapiens 提取图像特征。 身体帧优先选择偏航角差异大的视角,以扩大可见范围;面部图像来自随机采样视频帧后的脸部裁剪。 在模板人体网格上固定采样 8,192 个查询点,所有身份共享这组点,而不是各自生成无序点云。 Transformer 联合处理图像特征与查询点位置编码,为每个点输出一个 1,024 维高斯令牌。 因此令牌索引具有跨身份一致的空间含义,后续才可能在对应位置应用掩码和位置编码。 这里的结构化不是获得了准确人体真值,而是给重建结果提供了统一、可操作的坐标组织。
每个令牌通过轻量 MLP 解码成 8 个高斯,合计 65,536 个高斯;该总数由原文令牌数和每令牌高斯数相乘得到。 数字人解码器同时接收姿态与表情参数,输出随驱动条件变化的高斯属性。 随后使用线性混合蒙皮(LBS)变形,并通过高斯泼溅完成渲染。 这条路径让生成模型继承已有表示的身体与面部驱动能力,不必把动画控制重新编码成扩散条件。 但它也继承 LCA 的表达上限:解码器不能表达的姿态相关细节,不会仅因生成先验更强就自动出现。 主文第 6 页和图 2 给出了这套接口;更细的 LCA 内部训练描述被指向补充材料附录 B。
2. 保点压缩:缩小通道而不破坏可见性对应关系
原始令牌形状为 \(8{,}192\times1{,}024\),直接建模既昂贵,也把扩散学习放在高维重建特征空间。 压缩器将其变成 \(8{,}192\times8\) 的潜表示,只压缩通道,不减少查询点数量。 通道维缩小 128 倍,但这不是总计算量或显存必然缩小 128 倍,因为注意力仍处理相同数量的位置。 编码器和解码器交替使用 MLP 调整通道、自注意力融合特征,并持续加入相同查询点的位置编码。 保持点数不变,使一个可见性标签仍可直接对应一个潜令牌,而不必把遮挡状态重新投影到另一套空间。
编码器的 7 个块依次采用 [512, 256, 128, 64, 32, 16, 8] 通道。 解码器的 5 个块采用 [32, 64, 128, 512, 1024] 通道,恢复原始高斯令牌供 LCA 解码。 训练同时约束重建令牌的 L1 误差和 KL 散度,前者保留可解码信息,后者约束潜空间分布。 正文将潜表示编码写为 \(Z=E(T,X)\),其中查询点 \(X\) 也参与编码。 缓存第 7 页的式 (1) 排版损坏,且相邻句子的编码器、解码器字母说明存在对调,本笔记采用架构与上述编码关系,不拼补作者的精确公式。 可见性策略作用于压缩后的扩散训练;不能据此声称压缩器本身也用了同样的掩码目标。
3. 可见性感知训练:同时隔离无效输入与无效监督
掩码依据实际渲染贡献计算,而不是仅凭模板表面法向判断一个点是否朝向相机。 作者将重建高斯按输入身体图像对应的相机和姿态渲染,再用梯度衡量各高斯对图像的贡献。 贡献很低的高斯视为不可见;一个令牌解码出的 8 个高斯中,若至少 2 个在至少一个输入视图中可见,该令牌才有效。 这一步把输入图像提供的证据追踪回规范人体位置,能区分可信的正面区域和重建器猜测出的背部或下肢。 主文没有给出低贡献阈值的具体数值或完整梯度实现,因此不能把这个规则当作无需补充细节即可复现的算法。
在扩散输入中,无效潜令牌被跨身份共享的可学习占位特征替换,避免其模糊外观经注意力影响有效区域。 在损失端,只对有效区域计算加权监督,避免迫使模型拟合透明腿部或错误背部。 这两个操作互补:只屏蔽损失并不消除输入污染,只替换输入却仍监督错误目标也不合理。 占位特征不是该身份缺失部位的真值,也不同于要求模型恢复人为遮掉图像块的 MAE 目标。 模型利用不同样本可见令牌之间的语义关系学习整体分布,而不是在每个训练样本上获得不可见区域的准确答案。 作者用固定零令牌替代可学习占位特征时观察到不自然颜色,说明“无效”也需要适合模型内部表征的编码方式。
4. 多模态流生成:在共享 3D 潜空间接入文本和局部外观条件
生成网络使用双流 MMDiT 块,潜令牌与条件令牌分别计算注意力查询、键和值,再拼接执行联合注意力。 注意力输出重新拆回各自分支继续处理,不同条件模态也采用独立分支。 时间步负责调制;潜令牌的查询和键加入人体点位置编码,保留每个令牌所对应的位置。 网络由 28 个块组成,通道数 1,024,注意力头数 16,FFN 比例 4.0,查询和键使用 RMSNorm。 这些选择将文字语义或图像外观与人体空间对齐,但生成对象始终是 3D 潜表示,而不是先独立生成多个视角。
文本由 MetaCLIP huge 编码,涂鸦和身体部位图像由带 registers 的 DINOv2 big 编码。 身体部位分支接收 5 张部位图像,并拼接其嵌入;正文举出的部位包括头发、面部与上衣。 训练均匀选择纯文本、纯图像、文本加图像这 3 种条件组合。 若选中的组合含图像,再均匀选择涂鸦或身体部位图像,以支持不同粒度的外观控制。 作者展示了文本、图像与涂鸦的连续编辑,但具体编辑算法被放在未提供的补充材料中。 因此本笔记只确认条件接口和展示能力,不把它擅自描述为某种潜空间反演、局部冻结或特定重采样方案。
一个完整示例¶
考虑一段主要拍摄正面上半身的视频,这是对原文问题设置的流程示例,不是新增实验。 LCA 将 4 张身体帧和 4 张脸部裁剪变成统一的 8,192 个令牌,面部和胸前可能可靠,背部及腿部可能不可靠。 压缩器保持这 8,192 个位置,渲染贡献掩码标出其中有观测依据的部分。 训练去噪器时,不可信位置输入占位特征,损失只要求模型解释可信位置,其他视频则可以提供腿部或背面的信息。 生成时,用户可以给面部图像和服装描述,从噪声采样完整潜表示,再恢复令牌并指定新的姿态、表情进行渲染。 这种完整输出来自学习到的先验,不代表系统找回了原视频中从未拍摄到的真实服装背面。
损失函数 / 训练策略¶
完整令牌数据集包含 1,117,411 个身份,其中真实场景视频为 1,113,476 条,另有 2,737 个棚拍身份和 1,198 个手机转身采集身份。 作者从采集数据中选择 1,000 个高质量身份作为测试集;总数据规模不能直接解释为扣除测试集后的训练身份数。 Sapiens 还承担身体分割和背景移除,每张输入图像附有文字、涂鸦与身体部位条件标注。 压缩器使用 32 张 A100、批量 256 训练 1 天;L1 权重为 1.0,KL 权重在前 10K 次迭代从 \(10^{-3}\) 增至 \(10^{-2}\)。 其学习率在前 1K 次迭代从 \(4\times10^{-10}\) 预热到 \(4\times10^{-4}\)。 GenLCA 使用 rectified flow 的条件流匹配目标,最小噪声参数为 \(\sigma_{\min}=10^{-5}\),监督受有效区域掩码限制。 生成网络使用 64 张 A100、批量 128 训练 4 天,前 1K 次迭代学习率从 \(2\times10^{-10}\) 增至 \(2\times10^{-4}\)。 训练以 0.25 的概率将条件令牌替换为零以支持无分类器引导,这与无效 3D 位置使用可学习占位特征是两件事。 生成使用显式 Euler 求解器和 50 步采样;图 5 示例采用 CFG 5.0,不能据此假定所有实验使用同一引导强度。
实验关键数据¶
主实验¶
表 2(第 13 页)的文本生成比较使用 50 条提示,每种方法生成 50 个数字人,每个数字人取正面、侧面、背面共 3 张图像评估。 BLIP-VQA 和 Text CLIP 衡量语义对齐,CLIB-FIQA 衡量面部质量,HyperIQA 衡量整体图像质量,均为越高越好。 Text CLIP 的正文描述是渲染图像预测描述与原提示的 CLIP 特征比较;缓存未提供进一步的精确计算定义,本表遵循原表方向。 以下节选保留质量、语义、分布距离与时间,FID 的参考分布为使用相同提示生成的 2D 扩散图像。
| 方法 | BLIP-VQA ↑ | Text CLIP ↑ | CLIB-FIQA ↑ | HyperIQA ↑ | 2D 扩散参考 FID ↓ | 推理时间 ↓ |
|---|---|---|---|---|---|---|
| TADA | 0.50 | 0.71 | 0.48 | 55.02 | 188.19 | 2.5 h |
| HumanGaussian | 0.62 | 0.73 | 0.39 | 33.61 | 239.33 | 1.2 h |
| DreamWaltz-G | 0.58 | 0.75 | 0.50 | 59.33 | 175.23 | 3.0 h |
| TeRA | 0.42 | 0.67 | 0.44 | 44.01 | 151.80 | 12 s |
| SIGMAN | 0.29 | 0.58 | 0.42 | 56.11 | 280.06 | 3 s |
| GenLCA | 0.64 | 0.76 | 0.55 | 63.05 | 160.91 | 12 s |
同一表 2 的图像条件评估分别使用 THuman 2.0 的 200 张图像和 HuGe100K 的 200 张图像,以输入对应的真值图像为 FID 参考。 原文只比较支持图像条件的 SIGMAN 与 GenLCA;其他方法未评估,不应记作性能为零。
| 图像条件方法 | THuman 2.0 FID ↓ | HuGe100K FID ↓ |
|---|---|---|
| SIGMAN | 121.40 | 160.48 |
| GenLCA | 96.03 | 76.50 |
消融实验¶
图 7 与第 5.3 节(第 14 页)提供定性消融,没有可核验的逐项数值分数;下表按作者报告整理,不编造下降幅度。
| 配置 | 改动 | 原文报告的结果 |
|---|---|---|
| 完整模型 | 可见性监督、可学习占位特征、真实场景数据均保留 | 图示作为外观和文本对齐参照 |
| 去掉可见性感知训练 | 所有有效和无效令牌均作输入并参与损失 | 背部和下半身明显模糊、透明 |
| 去掉可学习占位特征 | 保留可见性处理,但无效区域改为固定零令牌 | 颜色不自然 |
| 去掉真实场景数据 | 仅用 3,000 个室内采集身份 | 过拟合,难以生成符合文本的结果 |
关键发现¶
GenLCA 的 HyperIQA 为 63.05,高于 DreamWaltz-G 的 59.33;图像条件 HuGe100K FID 为 76.50,低于 SIGMAN 的 160.48。 但以 2D 扩散图像为参考的 FID 是 TeRA 的 151.80 更好,而非 GenLCA 的 160.91;作者将其解释为 TeRA 更贴近合成训练分布。 12 s 是表中报告的生成时间,不是动画帧率,也不是所有方法在已核实同一硬件上的严格加速比;SIGMAN 的 3 s 仍更快。 表 3(第 13 页)中,30 名参与者各评价随机分配的 10 个数字人案例,使用 5 分制观看旋转视频。 GenLCA 的语义对齐、多视角一致性、视觉质量、几何质量分别为 4.56、4.68、4.65、4.63;这是主观几何质量,不是几何误差测量。 消融支持“监督可靠性、占位表示、数据多样性各有作用”,但没有数值证据比较三者贡献大小。
亮点与洞察¶
- 将残缺 3D 重建视为“部分有效监督”,比把所有伪标签当真更符合视频采集现实。扩展数据源不必以先修复所有缺失区域为前提。
- 统一人体查询点既服务解码,也连接压缩、位置编码与可见性掩码。表示设计因此直接决定监督策略是否可实施。
- 输入端占位与输出端掩码同时使用,针对的是两条不同的污染路径。可迁移的思路是将证据缺失与真实低值特征明确区分。
局限与展望¶
- 作者明确指出动画受继承的 LBS 约束;极端姿态、罕见提示和覆盖不足仍会失败,背部细节可能过平滑或缺失。
- 当前缓存包含主文和参考文献,未包含被反复引用的补充材料。编辑实现、可见性阈值及部分评估细节无法从本缓存完整复现。
- 评述:文本评估只有 50 个提示,图像 FID 每个数据集只用 200 张输入;这些结果不足以证明所有身份、服装与姿态子群都同样可靠。
- 评述:百万级数据与预训练 LCA 共同决定结果,不能将全部增益归因于扩散架构;真实视频授权、身份隐私和数据可获取性也需要独立核查。
- 后续可加强重建器和驱动模型,并按部位覆盖程度量化失败率;这比单纯增加生成质量均分更能检验可见性策略的边界。
相关工作与启发¶
- 对比 LCA:LCA 从观测图像重建可驱动令牌,GenLCA 在其表示上学习可采样、可条件控制的分布。它不是以生成器替代所有重建和驱动环节。
- 对比 TADA / HumanGaussian / DreamWaltz-G:这些 SDS 路线用 2D 先验逐资产优化,本文采用一次训练后在原生 3D 潜空间采样;表 2 的时间优势伴随较高前期训练成本。
- 对比 TeRA / SIGMAN:差别不仅是网络结构,还在于真实场景部分观测能否进入训练;不同参考分布的 FID 必须分开解释。
- 对比 MAE:MAE 的掩码通常要求恢复被主动隐藏的内容,本文掩码表示原本就不可靠的监督。可学习占位特征不意味着存在缺失区域真值。
评分¶
- 新颖性: 4/5,将可驱动重建令牌与部分可观测生成训练结合,主要价值在训练数据范式。
- 实验充分度: 4/5,覆盖自动指标、用户研究和关键消融,但定性消融与有限提示规模限制结论力度。
- 写作质量: 4/5,主线清晰,编辑与底层重建细节依赖补充材料。
- 价值: 5/5,为真实视频规模化训练可驱动 3D 数字人提供了具体路线,但复现资源门槛较高。