FlowFace: Rectifying Identity Conditioning with Riemannian Geometry for Face Generation¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/SunFly0/Flowface
领域: 人体理解
关键词: 人脸个性化、黎曼几何、扩散模型、BCH展开、条件空间几何整流
一句话总结¶
FlowFace 针对现有免微调人脸定制方法在欧氏条件接口处属性耦合漂移与编辑次序敏感的问题,提出基于纤维丛解耦的双流流形编码器、基于截断 BCH 展开的李代数属性融合,并在训练期引入局部 SPD 度量约束测地线一致性,在完全不修改推理采样器的情况下显著提升了身份保持度、组合编辑稳定性与图像质量。
研究背景与动机¶
基于扩散模型(如 SDXL)的人脸个性化生成近年来经历了从测试期单主体优化到免微调适配器(Adapter)的技术演进。包括 IP-Adapter、InstantID 和 PhotoMaker 在内的主流方案,通常提取参考人脸的身份表征后,通过词元替换、拼接、直接相加或残差交叉注意力将其注入到文本条件空间或 UNet 的特征流中。尽管扩散模型的去噪 UNet 本身具有高度非线性,但条件注入接口本质上仍停留在平直的欧氏空间中,将面部身份和各类控制属性视为相互独立的线性偏移量。然而,人脸数据的有效语义分布集中在高度弯曲且紧密耦合的低维流形上,在迭代去噪过程中,反复执行平直欧氏加法极易将中间条件状态推向低密度或语义不合法的区域,导致明显的身份漂移、大姿态下的纹理泄漏以及背景失真。
这种几何与代数失配在组合属性编辑场景下尤为突出。在用户认知中,人脸属性的组合在语义上具有交换律,例如对同一张人脸无论先施加“微笑”还是先施加“衰老”,理论上应当收敛到完全一致的生成结果。但在现有的线性和注意力注入接口下,操作看似是线性的,去噪过程中的非线性跨步累积却会导致严重的编辑次序依赖性:不同属性提示词的注入顺序常常导致面部结构和身份特征的剧烈波动。以往将扩散模型推广至流形几何的工作往往需要在推理采样步骤中显式求解测地线微分方程或流形 SDE,对于高分辨率大规模扩散模型而言计算开销巨大且数值敏感,难以工程落地。
本文的核心切入点在于解耦训练期几何重塑与推理期采样效率:与其在推理阶段运行昂贵的流形数值积分,不如在训练阶段对条件空间的几何结构进行整流,使标准欧氏运算的轨迹自然逼近测地线一致的流形路径。核心 idea:通过纤维丛双流编码器解耦姿态几何与语义身份,引入基于截断 BCH 展开的李代数交互项吸收属性耦合偏差,并在训练期借助局部正定度量张量实现测地线一致性正则化,在保持标准 DDIM 采样效率的同时实现鲁棒的人脸个性化生成。
方法详解¶
整体框架¶
FlowFace 整体构建于冻结的 SDXL-base-1.0 骨干网络之上,在保持扩散模型 VAE、文本编码器和去噪 UNet 完全冻结的前提下,仅训练轻量级的几何条件模块。给定 \(N\) 张参考人脸图像以及包含属性编辑的文本提示词,系统首先提取参考人脸的身份嵌入向量并输入双流流形编码器,将其解耦为几何姿态基流与身份语义纤维流,融合成词元级流形坐标;随后,当面临多个属性的组合编辑时,利用 SIREN 隐式神经表示构建属性向量场,并通过二阶截断 Baker-Campbell-Hausdorff (BCH) 公式显式计算李括号交互项,完成条件流更新;接着,更新后的流形坐标经由重采样器映射为固定数量的身份上下文词元,通过人脸区域门控机制残差注入到 UNet 交叉注意力层;最后,在训练阶段引入局部对称正定 (SPD) 度量网络及测地线与协变加速度正则项,整流条件空间的内蕴几何。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["参考人脸图像集 + 文本属性提示词"] --> B["双流流形编码器<br/>Base几何流与Fiber语义流解耦"]
B --> C["李代数属性融合<br/>SIREN向量场与截断BCH展开"]
C --> D["训练期度量整流<br/>局部SPD度量与测地线一致性"]
D --> E["区域门控交叉注意力注入<br/>固定步长DDIM生成目标图像"]
关键设计¶
1. 双流流形编码器:解耦几何姿态与语义身份 现有适配器常直接将参考图像的人脸特征送入投影网络,导致表情、头部姿态等几何瞬态变化与本质身份特征相互缠结,在面对大角度偏转或夸张表情时极易出现特征泄露。受微分几何中纤维丛(Fiber Bundle)概念的启发,FlowFace 将面部特征解构为底空间(Base Space)与纤维(Fiber):底流 \(B = f_{\text{base}}(E)\) 专门捕捉姿态、朝向等对几何敏感的变化量,而纤维流 \(F = f_{\text{fiber}}(E)\) 则专注于保留本质身份特征。在编码过程中,纤维流通过自注意力层提取多参考图间的共性身份,并由底流预测出的联络转移信号 \(\phi(B)\) 进行几何调制: $\(F' = F + \text{SelfAttn}(F) + \phi(B)\)$ 最终的词元级流形坐标由两者经由层归一化融合生成:\(U = \text{LN}(W_b B + W_f F') \in \mathbb{R}^{B \times N \times d_m}\)。随后通过池化操作获得全局坐标 \(u = \text{Pool}(U)\)。这种非对称的单向调制机制确保了语义身份在姿态变换下的稳定性,并通过 Perceiver 架构的重采样器压缩为 \(T=16\) 个紧凑的身份上下文词元 \(T_{\text{id}}\)。
2. 李代数属性融合:截断BCH展开显式建模编辑交互 当对人脸进行多重属性组合编辑(如同时应用“微笑”和“衰老”)时,传统向量相加假设各属性相互正交,但在真实生理结构中这些属性在肌肉形变和皮肤纹理上高度耦合,直接相加会导致去噪轨迹在不同属性排列次序下产生分歧。FlowFace 将每个属性编辑建模为流形坐标空间上的光滑向量场 \(V(\cdot; a): \mathbb{R}^{d_m} \to \mathbb{R}^{d_m}\),由正弦周期激活函数的 SIREN 网络参数化以保证高阶导数的数值稳定性。对于两个属性场 \(X(\cdot) = V(\cdot; a_x)\) 与 \(Y(\cdot) = V(\cdot; a_y)\),其非交换几何交互由李括号(Lie Bracket)显式刻画: $\([X, Y](u) = J_Y(u)X(u) - J_X(u)Y(u)\)$ 其中各项通过雅可比向量积(JVP)高效计算。FlowFace 采用截断至二阶的 Baker-Campbell-Hausdorff (BCH) 公式生成合成编辑场: $\(V_{\text{fused}}(U) = X(U) + Y(U) + \frac{1}{2}[X, Y](U)\)$ 调换编辑次序时,李括号项由于反对称性仅反转符号,从而将原本不受控的次序漂移收敛为具有明确几何解释的一阶修正项。更新后的坐标 \(U^+ = U + \eta V_{\text{fused}}(U)\) 重新输入重采样器生成 \(T_{\text{id}}\),无需对 UNet 去噪结构进行任何复杂改动。
3. 训练期度量整流:测地线一致性与局部度量重塑 为了避免在推理期进行开销巨大的黎曼流形积分,FlowFace 提出了“训练期几何整流、推理期欧氏直行”的松弛策略。度量网络将池化坐标 \(u\) 映射为下三角 Cholesky 因子 \(L(u)\),其对角元素通过 Softplus 加正偏置保证非零,由此构造出处处严格正定的局部黎曼度量张量 \(G(u) = L(u)L(u)^\top \succ 0\)。模型在训练中对任意两对参考样本 \((I_1, I_2)\) 沿连接直线进行 \(S=20\) 段离散化采样,计算直线路段上的离散测地长度代理: $\(d_g(u_1, u_2) = \sum_{s=1}^{S} \sqrt{\Delta u^{(s)\top} G(m^{(s)}) \Delta u^{(s)}}\)$ 将其与预训练人脸识别特征的感知距离 \(d_{\text{perc}}(I_1, I_2) = 1 - \cos(\bar{e}_1, \bar{e}_2)\) 对齐,构成测地线一致性损失 \(\mathcal{L}_{\text{geo}}\)。此外,为了抑制向量场的高频抖动,引入协变加速度正则项 \(\mathcal{L}_{\text{cov}} = \mathbb{E}[\|J_V(u)V(u; a)\|_{G(u)}^2]\),惩罚向量场沿自身流线的方向导数范数。这一组合强制将语义空间的弯曲信息内化到坐标编码与度量约束中,使简单的欧氏线性更新也能自然贴合高密度数据流形。
4. 区域门控交叉注意力注入:空间隔离人脸与背景特征 在扩散生成过程中,若全局注入人脸参考特征,容易造成人脸纹理外溢至背景,或者背景光影污染面部轮廓。FlowFace 在 SDXL 交叉注意力层中设置独立于文本分支的人脸注入通道。利用人脸语义分割掩码 \(M \in [0, 1]^{H_m \times W_m}\),在 UNet 第 \(\ell\) 层将其下采样并展平为空间注意力门控向量 \(g_\ell\)。最终隐藏层特征计算为: $\(H_\ell^{\text{out}} = H_\ell^{\text{txt}} + \alpha \cdot \Big(g_\ell \odot \text{Attn}(Q_\ell, K_\ell^{\text{id}}, V_\ell^{\text{id}})\Big)\)$ 其中 \((K_\ell^{\text{id}}, V_\ell^{\text{id}})\) 由身份词元 \(T_{\text{id}}\) 线性投影所得,\(\alpha\) 控制人脸特征注入权重。该设计实现了人脸区域与非人脸背景在注意力层级的精确空间解耦。
损失函数 / 训练策略¶
整个框架的联合优化目标由三部分构成: $\(\mathcal{L} = \mathcal{L}_{\text{denoise}} + \lambda_{\text{geo}}\mathcal{L}_{\text{geo}} + \lambda_{\text{cov}}\mathcal{L}_{\text{cov}}\)$ 其中 \(\mathcal{L}_{\text{denoise}}\) 为标准的 SDXL 潜在去噪均方误差损失,超参数设为 \(\lambda_{\text{geo}} = 0.1\) 与 \(\lambda_{\text{cov}} = 0.1\)。训练全程冻结 SDXL 的 VAE、文本编码器与 UNet 主干网络,仅反向传播更新双流流形编码器、重采样器、向量场 SIREN、度量网络和注入投影层。在 4 张 NVIDIA RTX 4090 GPU 上使用 Adam 优化器,固定学习率 \(1 \times 10^{-4}\),Batch Size 为 4,迭代训练 100k 步。推理阶段完全采用标准的 DDIM 采样器(默认步数与无分类器引导 scale=7.5),推理计算开销与常规轻量 Adapter 处于同一量级。
实验关键数据¶
主实验¶
评估在基于 FFHQ 和 CelebA-HQ 构建的无泄漏人脸聚类基准(5,000 个测试身份)上展开。主要对比免微调人脸个性化主流方法。评估指标包含:SimRef(生成图与 \(N\) 张参考图的最大 ArcFace 余弦相似度)、SimTarget(生成图与留出同身份测试图的余弦相似度)、Paste Score(\(\text{SimRef} - \text{SimTarget}\),越低代表对参考图单纯复制记忆的倾向越弱,泛化能力越强)、CLIP-T 文本对齐度以及图像质量指标 FID。
| 方法 | SimRef ↑ | SimTarget ↑ | CLIP-T ↑ | Paste ↓ | FID ↓ |
|---|---|---|---|---|---|
| IP-Adapter | 64.5 | 55.8 | 73.6 | 8.7 | 89.2 |
| FastComposer | 56.2 | 48.6 | 75.4 | 7.6 | 92.5 |
| InstantID | 68.7 | 58.3 | 71.8 | 10.4 | 82.4 |
| PhotoMaker | 62.8 | 54.2 | 74.5 | 8.6 | 86.7 |
| StoryMaker | 65.4 | 56.8 | 74.8 | 8.6 | 85.3 |
| HiFi-Portrait | 71.8 | 60.4 | 72.5 | 11.4 | 79.2 |
| FlowFace (本文) | 71.3 | 64.8 | 77.2 | 6.5 | 76.8 |
消融实验¶
消融实验逐一替换 FlowFace 的核心模块以验证其不可替代性:去除流形编码器(替换为普通的单流 MLP)、去除李括号融合(替换为简单的向量相加 \(X + Y\))、去除测地线一致性正则项 \(\mathcal{L}_{\text{geo}}\) 以及去除协变平滑正则项 \(\mathcal{L}_{\text{cov}}\)(替换为有限差分惩罚)。
| 配置 | SimTarget ↑ | CLIP-T ↑ | Expr.Acc ↑ | FID ↓ | 说明 |
|---|---|---|---|---|---|
| FlowFace (完整模型) | 64.8 | 77.2 | 52.4 | 76.8 | 全功能系统 |
| w/o 流形编码器 | 48.3 | 68.5 | 38.2 | 95.4 | 替换为普通单流 MLP,身份与表情严重缠结 |
| w/o 李括号融合 | 52.1 | 71.2 | 42.6 | 88.7 | 退化为普通线性相加,组合编辑出现干扰 |
| w/o 测地线正则化 | 55.7 | 74.8 | 45.3 | 82.1 | 未约束度量张量与感知距离,流形脱靶 |
| w/o 协变加速度正则化 | 58.4 | 75.1 | 47.8 | 79.5 | 向量场出现高频抖动,微调平滑性受损 |
关键发现¶
- 双流流形编码器与李代数融合贡献最大:去除双流编码器导致留出目标相似度 SimTarget 暴跌 16.5 个点(从 64.8 降至 48.3),证明姿态几何与身份特征的纤维丛解耦是解决大姿态下身份崩塌的基石;去除李括号融合使 SimTarget 下降 12.7 个点且表情准确率 Expr.Acc 显著下降,印证了显式二阶交互项对解决属性耦合干涉的关键作用。
- 次序敏感度大幅降低:在双属性与三属性组合编辑测试中,替换为线性相加后次序偏差指标 OrderGap-ID 从 0.052 剧增至 0.146,而 FlowFace 将三属性排列的最坏差距 Worst PermGap-ID 从 0.291 压缩至 0.118,全属性编辑成功率从 58.4% 提升至 81.2%。
- 参考图数量与推理吞吐权衡:参考图数量在 \(N=4\) 时达到性能拐点(SimTarget=64.8),继续增至 8 张收益趋于饱和(SimTarget=66.2);在推断时间上,二阶 BCH 截断(\(r=2\))仅需 12.4s 显存占用 10.5GB,与 InstantID(11.7s, 9.6GB)相比仅微增不足 1 秒,却获得了显著更优的生成质量与身份忠实度。
亮点与洞察¶
- 训练期整流代替推理期黎曼积分:以往几何生成模型将流形 SDE 强行嵌入去噪步,导致计算量无法承受;本文巧妙地利用局部正定度量学习与测地线距离对齐作为“隐式导轨”,在训练阶段纠偏条件潜空间,使得推理阶段采用普通直行也能走在流形高密度区。
- 李括号作为属性非对称交互的几何解:敏锐地指出了扩散模型去噪步骤累积破坏交换律的物理本质,用李代数中经典的反对称一阶交互项对冲了属性输入次序引起的不一致,为多概念组合编辑提供了极具数学美感且行之有效的范式。
- 纤维丛诱导的人脸表征解耦:将复杂的姿态形变与不变的身份特征从几何学视角抽象为底空间与纤维束,通过单向联络转移实现非对称调制,相比于传统的对抗解耦损失更加稳定可靠。
局限与展望¶
- 极端大角度姿态与严重遮挡时的鲁棒性:当参考图像存在超过 60 度的大角度侧脸或面部被大面积墨镜、口罩遮挡时,InsightFace 初始提取的身份先验本身存在退化,纤维流无法完全重建丢失的面部细节。
- 高阶李括号截断项的计算折中:当前主模型截断在二阶项(\(r=2\)),虽然控制在单次 JVP 开销内,但对于 4 个以上极度复杂的相克属性联合微调,更高阶的泊松括号相互作用仍被忽略,存在进一步展开或自适应截断的探索空间。
- 向通用主体定制迁移的潜力:本文主要基于人脸关键点与先验识别模型设计,未来可推广至多类别物体的可控组合生成,建立通用的几何引导扩散调节框架。
相关工作与启发¶
- vs IP-Adapter / PhotoMaker: IP-Adapter 通过解耦交叉注意力注入图像特征,PhotoMaker 通过堆叠多图特征投影至文本词元空间。二者均在平直欧氏空间完成特征混合,遇到姿态大幅变动或多属性同时修改时易出现特征泄露与身份失真。FlowFace 引入了纤维丛几何解耦与李括号交互,从数学本质上约束了条件的内蕴流形。
- vs InstantID: InstantID 借助 ControlNet 强行引入关键点密集面部骨架控制,虽能保持姿态,但往往过度刚性地锁死面部几何,限制了夸张表情与艺术风格的编辑灵活性。FlowFace 将几何流作为调制信号而非绝对硬约束,在保持高达 52.37% 表情准确率的同时保留了更丰富的风格多模态分布。
- vs 黎曼扩散模型 (Riemannian Diffusion Models): 传统黎曼扩散方法要求在流形切空间中每步进行黎曼对数映射、指数映射与漂移项校正,在 SDXL 这类高分辨率模型上速度极慢且难以稳定训练。FlowFace 证明了“训练期通过度量代理监督整流、推理期维持标准采样”的松弛方案兼具理论严密性与工程实用性。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次将纤维丛解耦、李代数 BCH 属性融合与局部黎曼度量整流系统性引入免微调扩散人脸生成,数学框架严谨精巧。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 5,000 个测试身份的大规模基准、细粒度 3D 表情与动作单元定量分析、次序敏感性排列检验及详尽的表征探测诊断。
- 写作质量: ⭐⭐⭐⭐⭐ 论文动机清晰明确,数学公式推导扎实,图表逻辑严密,消融与对比实验层层递进。
- 价值: ⭐⭐⭐⭐⭐ 为解决扩散模型多属性组合编辑中的冲突与漂移问题提供了全新的非欧氏几何视角,代码已开源且实用性极高。