跳转至

COSY: Compositional 3DGS Synthesis for Disentangled Human Head Editing

会议: ECCV 2026
论文: ECCV Official
领域: 3D 视觉
关键词: 3D高斯泼溅、组合式生成对抗网络、解耦编辑、人头合成、无监督语义解耦

一句话总结

COSY 提出了一种无需显式几何先验或精确分割掩码的组合式 3D 高斯泼溅(3DGS)生成对抗网络,将人头解耦为头发、皮肤、眼镜和躯干四个独立子生成器,并通过共享几何与光照上下文向量保持全局一致性,实现了高保真、零干扰的实时 3D 人头属性编辑。

研究背景与动机

逼真可控的三维人头合成在虚拟现实、影视制作、游戏互动和数字人仿真中占据核心地位。这些场景普遍要求在对发型、配饰等局部语义属性进行交互式编辑的同时,严格保持人物原本的身份特征与底层三维几何结构。近期涌现的 3D-aware GAN(如基于 NeRF 的 EG3D 以及基于 3D 高斯泼溅的 CGS-GAN)能够仅从非结构化的 2D 真实人像图像集中自监督学习出显式 3D 结构,并具备实时渲染能力与平滑的潜空间结构,成为单张图像 3D 人形重建与编辑的理想框架。

然而,现存 3D GAN 的核心困境在于其无条件全局潜空间的高度语义纠缠。由于真实人像数据集中普遍存在天然的属性偏差与强统计相关性(例如发色与肤色往往紧密绑定、特定发型与配饰非独立共存),在无条件全局潜空间中进行微调或利用分类器寻找线性编辑方向(如 GANSpace、InterFaceGAN、StyleFlow)时,往往不可避免地导致非编辑区域发生连带形变或身份漂移。例如在尝试添加眼镜时,面部轮廓、发际线甚至背景往往发生显著突变;而基于参考图的特征混合与 2D 分割引导方案则丧失了自由探索潜空间的能力,且耗时漫长难以做到实时交互。另一方面,以往尝试多模块生成的探索往往强行依赖外部 FLAME 模板网格或严苛的 2D 分割掩码监督,限制了无模板复杂拓扑(如蓬松卷发、多样化眼镜框架)的建模表达。

本文的核心切入点是打破单一黑盒生成器的结构,将人头结构显式拆解为语义独立的子生成器分支,仅利用极弱的稀疏信号(如 RGB 颜色直方图与布尔存在性标识)诱导网络自发完成语义解耦,杜绝几何模板依赖。核心 idea:构建由头发、面部、眼镜和躯干独立子生成器构成的组合式 3DGS 架构,通过条件属性的局部注入与全局形状/光照上下文向量的最小化解耦通信,在无显式分割掩码监督下实现即插即用、完全解耦的实时 3D 人头属性合成与编辑。

方法详解

整体框架

COSY 的核心架构以非受限点云变换器 CGS-GAN 为单模块基础,整体流水线分为四个协同阶段:首先由 Transformer 主干网络从输入潜编码生成共享特征,并将其拆解分配至头发(Hair)、面部(Skin/Face)、眼镜(Glasses)和躯干(Torso)四个专职子生成器分支;随后各子生成器独立生成局部的 3D 高斯图元;接着在解码层引入稀疏局部条件(颜色调制或透明度开关)约束各区域职责范围;最后将各子分支的高斯基元直接拼接为一个全局 3DGS 场景,通过可微 3DGS 渲染器投影出高分辨率图像并交由全局判别器进行真伪判断。为了确保在推理阶段任意组合不同子生成器潜编码时不产生接缝断裂或光照打架,系统引入了训练期潜变量随机混合、共享形状上下文与光照上下文向量通信机制。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    In["输入潜编码 z<br/>+ 全局上下文 (wShape, wLight)"] --> Partition["主干网络特征解耦与分发<br/>拆分为头发/面部/眼镜/躯干特征"]
    Partition --> SubGens["四路独立 3DGS 子生成器<br/>独立生成局部无约束高斯点云"]
    SubGens --> SparseMod["稀疏属性驱动的解码层约束<br/>颜色直方图调制 + 布尔开关"]
    SparseMod --> Mixing["训练期随机潜变量混合机制<br/>跨身份随机互换子分支特征"]
    Mixing --> GlobalReg["双重上下文正则与 EMA 几何先验<br/>对齐全局轮廓/光照,补全面部额头"]
    GlobalReg --> SplatCompose["全局 3DGS 图元直接拼接<br/>可微光栅化渲染全图并判别"]

关键设计

1. 稀疏属性驱动的非受限组合式 3DGS 架构:摆脱模板先验实现语义自隔离

传统组合式生成方法通常强依赖 FLAME 网格形变先验或密集的 2D 分割掩码监督,无法处理复杂发型和多样化配饰。COSY 针对这一瓶颈,为头发、皮肤、眼镜和躯干分配独立参数的 CGS-GAN 子生成器,并通过差异化的稀疏条件引导其自发专业化。对于眼镜等“加性组件(Additive Components)”,仅输入一个表示是否存在该组件的布尔标志 \(b \in \{0, 1\}\);当 \(b=0\) 时,直接强制大幅压低该分支高斯基元的透明度(Opacity)使其完全隐形。如果眼镜生成器越权生成了面部或眼部组织,在 \(b=0\) 时这些组织就会随之缺失而在全局判别器处遭受重罚,从而倒逼眼镜分支精准自限。对于皮肤、头发和躯干等“永久组件(Permanent Components)”,论文摒弃密集的掩码输入,仅在对应局部区域内统计一个极稀疏的 10-bin RGB 颜色直方图作为调制条件,并在最终的 Color Mod 解码层直接映射为高斯球的基底颜色属性。由于颜色条件仅作用于局部的最终解码层且不改变 3D 点位几何,即使在测试阶段输入完全未见过的分布外(OOD)极端发色或肤色,也仅改变高斯颜色而几何形态完全稳定,成功将外观属性与几何形状彻底隔离。

2. 训练期潜变量随机混合机制:无缝闭合跨组件拼接裂痕

若仅在训练期各子生成器使用同一身份的潜编码独立推导,在推理阶段将身份 A 的发型直接移植到身份 B 的脸上时,各模块交界处往往会出现明显的空间缝隙或图元穿模混乱。COSY 提出了直接在训练前向传播中执行潜变量随机混合(Latent Mixing)的策略:在主干特征送入子生成器前,系统以特定概率(默认 10%)随机抽取批次内另一样本的特征替换当前样本的某一组件(例如将样本 A 的头发分支替换为样本 B 的头发分支)。混合拼接后合成完整的全局 3D 高斯场景并送入未经分割掩码裁剪的全局判别器。判别器直接在整图尺度上对拼缝处的裂纹、空洞或伪影给予对抗损失惩罚,迫使每个子生成器在隐式学习中自动保持边缘平滑过渡与尺度自适应,使得推理时任意交叉组合子模型均具备极强的组合鲁棒性。

3. 共享几何与光照上下文最小化通信:全局一致性与身份解耦的平衡

潜变量混合虽然增强了组件兼容性,但在跨样本拼装时引入了新矛盾:若各子模块完全缺乏全局共识,可能导致成年人的面部拼上婴儿尺寸的发髻,或者各部位受光方向严重冲突;但若引入过多全局共享信息,又会导致局部编辑时发生全局身份漂移。COSY 设计了两个极简且严格受限的共享上下文向量 \(w_{\text{Shape}} \in \mathbb{R}^{512}\)\(w_{\text{Light}} \in \mathbb{R}^{512}\),且在潜变量混合期间始终不被置换。对于形状上下文 \(w_{\text{Shape}}\),网络将其严格限定仅输入到各子生成器最终的 xyz 坐标解码小 MLP 中,由于该轻量 MLP 容量受限,杜绝了其借道泄漏身份纹理的可能,仅能协调统一的头部宽高尺度;对于光照上下文 \(w_{\text{Light}}\),由于单纯的末端解码器无法合成复杂阴影与高光反射,网络将其直接注入输入潜编码,同时引入针对光照变化的 LPIPS 感知正则化损失,严厉惩罚除全局明暗与阴影变化外的任何纹理/几何变动。此外,针对头发遮挡容易诱导面部生成器在发际线处“偷工减料”留下破洞的问题,引入了针对面部点云与透明度的指数移动平均(EMA)面部几何正则化,强制面部生成器完整填满整个饱满前额,彻底杜绝了更换发型时暴露颅骨空洞的缺陷。

损失函数 / 训练策略

COSY 采用非饱和对抗损失(Non-saturating Adversarial Loss)配合 \(R_1\) 梯度正则项进行整体优化。鉴于生成器内部已完全解决语义隔离,判别器输入为拼接渲染后的全局图像,并将相机位姿参数与拼接后的颜色直方图/布尔标志向量联合拼接调节判别特征。关键正则化包括:光照感知一致性损失 \(\mathcal{L}_{\text{light}} = \text{LPIPS}(I_{w_{\text{Light}}^1}, I_{w_{\text{Light}}^2})\)(约束两渲染图的感知距离均值在 0.3 附近,保持几何恒定而仅改变明暗);以及 EMA 面部几何正则化损失 \(\mathcal{L}_{\text{EMA}}\),惩罚当前步面部子生成器的 Gaussian 空间坐标与透明度分布与全局滑动平均完整面部几何的偏差。训练时采用 FFHQC 高清人脸数据集,在 512×512 与 1024×1024 分辨率下进行多尺度渐进或稳定对抗训练,潜变量混合概率严格设定为 10%。

实验关键数据

主实验

论文在 FFHQC 数据集上系统对比了最新无条件 3DGS GAN 及同类可编辑基线的生成质量(以不含视角先验偏置的 \(\text{FID3D}\) 衡量),并在 1000 组无眼镜样本上添加眼镜或变换发型,在 BiSeNet 划定的无关区域上计算 \(\text{LPIPS}\) 变化量(稳定性,越低越解耦),同时统计目标属性召回率(Recall)。

表 1: FFHQC 数据集上的 3D 图像生成质量(FID3D)(对应原文 Table 1)

方法 类别 FID3D ↓ (512×512) FID3D ↓ (1024×1024)
GSGAN 层次化无约束点云 3DGS 7.68 -
GGHead 基于 FLAME 模板网格 3DGS 7.78 14.27
CGS-GAN 无约束多视角一致 3DGS 4.53 5.25
Cond CGS-GAN 朴素条件注入基线 4.52 -
COSY (Ours) 组合式多子分支 3DGS 4.42 5.43

注:EGG3D 包含背景建模,在带背景 FFHQ-512 上 FID 为 7.51,因指标对背景高度敏感而不列入无背景直接对比。

表 2: 编辑属性时的非相关区域 LPIPS 稳定性与眼镜召回率对比(对应原文 Table 2 & Table 3 整合)

编辑方法 类型 眼镜编辑无关区 LPIPS ↓ 发型编辑无关区 LPIPS ↓ 目标眼镜生成召回率 (Recall) ↑
GANSpace 潜空间无监督 PCA 遍历 0.254 0.165 50.8% (0.508)
InterFaceGAN 潜空间预训练分类器边界 0.196 - 63.2% (0.632)
StyleFlow 连续正规化流条件重映射 0.172 0.133 94.8% (0.948)
Cond CGS-GAN 全局单一生成器条件基线 0.239 0.149 95.2% (0.952)
COSY (Ours) 组合式独立分支解耦架构 0.016 0.014 99.7% (0.997)

消融实验

针对训练期潜变量混合概率(Latent Mixing Probability)以及光照/几何正则化展开了系统的定量与定性消融,分析了独立性与组件兼容性之间的权衡。

表 3: 不同潜变量混合概率下的生成质量(FID)与混合组合质量(FIDMix)消融(对应原文 Table 4)

潜变量混合概率 (Mixing Prob.) 全局生成质量 FID ↓ 跨身份混合生成质量 FIDMix ↓ 说明
0% (无混合训练) 4.88 10.51 未经混合训练,推理时跨身份组件拼装出现严重缝隙与瑕疵
10% (本文默认) 4.42 8.32 在单体生成质量与跨身份组合质量之间取得最佳平衡
20% 4.98 9.07 混合比例增加,生成器需耗费过多容量拟合组合过渡
30% 5.16 8.49 全局图元质量开始受到负面干扰
40% 5.97 6.53 组合场景虽拟合更顺滑,但常规单图生成质量明显劣化 (FID 恶化至 5.97)

关键发现

  • 结构化物理隔离碾压潜空间编辑:从表 2 可见,即便采用高精度的 StyleFlow 或条件 GAN,其无关区域 LPIPS 扰动仍在 0.13~0.24 之间(表明面部或发型发生肉眼可见的漂移);而 COSY 将扰动直接降至 0.014~0.016(微弱数值变化仅来自眼镜高斯在面部投射的微弱软阴影),且属性召回率达到惊人的 99.7%,证明物理分支解耦在根本上消除了统计伪相关。
  • 混合比例 10% 是临界甜蜜点:完全不进行混合(0%)会导致拼合质量恶化(FIDMix 达 10.51),而过度的混合强制(40%)又会使得单体逼真度显著滑坡(FID 升至 5.97)。10% 的随机采样足以让判别器在全局尺度上消除拼接接缝,同时将 FID 锁定在最优的 4.42。
  • 极简上下文通信防止容量劫持:将 \(w_{\text{Shape}}\) 严格阻断在末端位置解码器,既成功实现了对瘦长、圆润等宏观头型的整体适配,又彻底杜绝了身份特征的交叉渗透。

亮点与洞察

  • 极度轻量化的无监督弱监督解耦哲学:没有采用任何沉重的 FLAME 3D 形变模板,也没有在训练循环中引入繁重的 2D 逐像素掩码判别,仅凭 10-bin 粗糙颜色直方图与 0/1 开关便倒逼出四个边界清晰的 3DGS 语义子网络,极其优雅且泛化力强。
  • 将属性操作转化为高斯基元的原生运算:添加或移除配饰直接等价于激活或压制对应子网络高斯球的透明度,调换发型等价于更换局部输入向量,从根本上杜绝了扩散模型中反反复复微调或复杂的注意力掩码注入。
  • 可复用的模块化范式扩展空间:这种“主干拆分-局部子分支独立表征-末端受限上下文微调-全局判别反传”的范式可以无缝外推至全身 Avatar(身体与衣服解耦以实现虚拟试衣)或自动驾驶 3D 资产生成(底盘、车壳、轮毂自由拼配)。

局限与展望

  • 组件粒度与交互接触面受限:当前预设的四个组件边界相对平滑,对于复杂穿戴(如需要与发型产生复杂物理压迫形变的帽子、头盔)或者下颌密集的胡须,目前独立的子生成器难以表达复杂的跨模块几何形变与物理碰撞响应。
  • 光照解耦依赖经验阈值:光照上下文的正则化完全依赖于将感知距离均值调谐至 0.3 附近的敏感惩罚因子,若调节不当,容易在“光照不动”与“轻微身份变动”之间失衡,缺乏更显式的物理可解耦光照模型(如结合球谐函数或环境光图)的支持。

相关工作与启发

  • vs CGS-GAN / GSGAN: 均采用无约束点云生成 3DGS,但原方案为单一整体潜空间,发色与发型高度纠缠且无法做局部编辑;COSY 继承其多视角一致性的同时,将其改造成多分支组合式架构,彻底解锁无瑕疵编辑能力。
  • vs EGG3D / GGHead: 后者严重依赖预设的 FLAME 人脸网格模板,在建模长发、蓬松发型和非贴脸镜框时受到几何拓扑先验的严重束缚;COSY 保持完全自由的点云拓扑结构,几何自由度大幅提升。
  • vs GANSpace / InterFaceGAN / StyleFlow: 传统方案在后处理阶段寻找全局潜空间方向,难逃数据集内置的特征偏差(如改发型导致脸型变形);COSY 从前向生成机制层面实现物理级隔离。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ [抛弃显式网格与密集分割掩码,用极简弱条件驱动非受限 3DGS 组合式语义自解耦,设计构思极具新意]
  • 实验充分度: ⭐⭐⭐⭐⭐ [指标涵盖 FID3D、LPIPS 稳定性、召回率及细致的组件遍历消融,数据扎实且对比基线完善]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑层层递进,从痛点剖析、架构演进到多组件协同机制阐述透彻清晰]
  • 价值: ⭐⭐⭐⭐⭐ [为高质量、实时可交互、零漂移的 3D 头像数字人编辑与合成数据生成开辟了极具前景的实用范式]