跳转至

MagicMakeup: A Region-Controllable Diffusion Transformer for High-Fidelity Makeup-Transfer

会议: ECCV 2026
论文: ECCV 原文
代码: https://vivocameraresearch.github.io/magicmakeup
领域: 其他
关键词: 局部可控彩妆迁移、扩散Transformer、注意力门控、跨模态解耦、高分辨率基准

一句话总结

针对传统人脸彩妆迁移中区域溢色、身份与妆容概念耦合及真实配对数据匮乏的难题,本文提出基于扩散Transformer的MagicMakeup框架,通过Token对齐的区域注意力门控与跨模态感知引导实现眼唇及整脸的高保真局部迁移,并构建了基于真实彩妆局部卸妆的1024×1024高清基准。

研究背景与动机

人脸彩妆迁移(Makeup-Transfer)旨在将参考人脸上的眼影、口红等妆容色彩、质感与风格精准迁移到源人脸,同时严格保留源人脸的身份特征与面部几何结构。随着虚拟试妆和个性化数字人等产业级应用的发展,用户不再满足于单一的全脸粗粒度换妆,而是对眼周、唇部等特定面部区域的独立编辑、多参考图混合试妆以及超高清毛孔级质感提出了严苛要求。然而,现有基于生成对抗网络(GAN)或扩散模型(Diffusion Models)的方法在走向精细化落地时面临着根本性的技术瓶颈。

这种困境的核心矛盾体现在三个相互交织的维度:首先,空间控制粒度存在注意力失配。现有扩散方法大多面向全脸迁移设计,即使直接在像素空间引入分割掩码,掩码在降采样与多头注意力交互中也会发生表征错位,导致妆容色彩不可避免地渗漏到非目标区域;其次,双图像条件输入下存在概念模糊性。模型难以在潜空间中清晰解耦“源图保留身份结构”与“参考图迁移妆容属性”的边界,常将参考者的五官几何错误地注入输出,或在保护源身份时过度削弱妆容浓度;最后,高质量配对监督数据严重匮乏。真实世界中同身份、同光照、同表情的“素颜-带妆”图像极难采集,而采用文生图或直接贴妆合成的伪数据往往缺乏真实彩妆的高频纹理细节,还会引入严重的身份形变与域偏移。

面对上述挑战,作者改变了以往“在素颜人脸上合成妆容”的合成惯性,提出以真实彩妆人脸为基底通过高保真局部卸妆构建配对数据,并在多模态扩散Transformer架构内部直接重塑注意力与概念交互机制。核心 idea:在 DiT 多模态注意力中构建 Token 对齐的区域对数门控以彻底截断非目标区交叉注意力渗漏,结合显式分离保留与迁移指令的跨模态感知引导,实现精细区域级高保真妆容迁移。

方法详解

整体框架

MagicMakeup 整体基于多模态扩散 Transformer(MM-DiT)构建,其端到端生成流程涵盖双图视觉 Token 化、文本指令概念拆分、Token 对齐的区域门控注意力交互以及跨模态感知动态调制。输入包含源人脸图像 \(\mathbf{I}_s\)、参考彩妆图像 \(\mathbf{I}_r\)、面部区域掩码(源掩码 \(\mathbf{M}_s\) 与参考掩码 \(\mathbf{M}_r\))以及编辑指令文本 \(\mathbf{T}\)。图像经过冻结的视觉骨干网络与 VAE 编码为潜空间 Token 序列 \(\mathbf{X}_s\)\(\mathbf{X}_r\),生成过程以高斯噪声潜变量 \(\mathbf{X}_n\) 为起点逐步去噪。在每一个去噪步长中,TARG 模块根据降采样后的区域掩码强制约束注意力流动,CMPG 模块则提取概念引导特征调制图像与文本流,最终由图像解码器输出兼顾高保真妆容与精准身份保持的目标图像 \(\mathbf{I}_o\)

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["多模态输入: 源人脸 Is、参考图 Ir、区域掩码 Ms/Mr 与指令文本 T"] --> B["Token-Aligned Region Gating (TARG)<br/>将像素掩码投射为注意力对数门控截断溢色"]
    B --> C["Cross-Modal Perception Guidance (CMPG)<br/>解耦保留与迁移概念并动态调制图文表征"]
    C --> D["Real Makeup Removal Pipeline<br/>真实彩妆局部卸妆配对与形变几何解耦"]
    D --> E["MM-DiT 联合去噪与高分辨率解码重建<br/>输出区域精确受控且身份保真的彩妆图像 Io"]

关键设计

1. Token-Aligned Region Gating (TARG):在注意力潜空间对齐像素掩码消除跨区域溢色 传统基于扩散模型的人脸编辑在引入空间控制时,通常在像素空间直接使用硬掩码或通过图像拼接强加先验。但在自注意力与交叉注意力计算中,Token 之间的全局感受野会导致眼影或口红的特征向量向脸颊、额头等未选定区域扩散弥散,形成明显的脏色斑块和边界失真。为从机理上杜绝跨区域泄漏,TARG 将源图与参考图的精细区域掩码(全脸、眼部或唇部)通过最近邻插值下采样并展平至与 MM-DiT 注意力层 Token 网格严格对齐,分别生成潜空间查询门控向量 \(\mathbf{m}_q \in \{0, 1\}^{L_n}\) 与参考键门控向量 \(\mathbf{m}_k \in \{0, 1\}^{L_r}\)。在计算潜空间查询与参考键的注意力分数矩阵时,引入加性对数掩码矩阵 \(\mathbf{M}\)

\[ \mathbf{M}_{i,j} = \begin{cases} 0, & \mathbf{m}_q(i) = 1 \text{ 且 } \mathbf{m}_k(j) = 1 \\ -\infty, & \text{其他情况} \end{cases} \]

加性掩码直接作用于缩放点积注意力公式 \(\text{Attn}(Q, K, V) = \text{Softmax}\left(\frac{QK^T}{\sqrt{d_k}} + \mathbf{M}\right)V\) 中。当潜变量 Token 位于目标编辑区域之外时,对应的掩码项取极小负常数,使得该位置对参考图所有 Token 的注意力权重严格归零。这种硬门控机制既完整保留了模型在目标编辑区内部建模复杂材质质感的能力,又完全隔绝了非编辑区域对参考图像的注意力依赖,彻底避免了背景几何畸变和非目标器官误染。

2. Cross-Modal Perception Guidance (CMPG):双向解耦身份保留与妆容迁移的语义概念 在双图像条件输入体系下,模型极易产生“概念混淆”:要么将参考图像中模特的骨骼脸型或特定微表情当作妆容的一部分迁移过来,造成身份泄露;要么将源图的五官色度过度保留,导致上妆效果寡淡。CMPG 从语义提示词 \(\mathbf{T}\) 中显式抽取保留概念短语 \(\mathbf{C}_s\)(如面部结构、身份特征)与迁移概念短语 \(\mathbf{C}_r\)(如特定色号口红、渐变眼影),构建 \(( \mathbf{C}_s, \mathbf{I}_s )\)\(( \mathbf{C}_r, \mathbf{I}_r )\) 两个解耦交互对。模块首先通过联合自注意力将文本概念嵌入与视觉骨干网络深层提取的图像 Token 相互对齐,生成概念响应特征 \(\tilde{\mathbf{X}}_C\)\(\tilde{\mathbf{X}}_I\),并通过最大相似度池化筛选出最具概念代表性的 Top-\(k\) 视觉查询 Token \(\mathbf{Q}\)

\[ \mathbf{Q} = \text{Top-}k\left(\tilde{\mathbf{X}}_I \cdot \text{Max}(\tilde{\mathbf{X}}_I \tilde{\mathbf{X}}_C^T)\right) \]

随后,这组紧凑的视觉证据 \(\mathbf{Q}\) 作为共享锚点,分别与图像后三层的多层视觉上下文存储库以及概念文本 Token 执行双路交叉注意力更新。提炼出的调制向量经过自适应层归一化(AdaLayerNorm)后,文本调制量仅切片写回文本序列中对应的概念 Token 区段,图像调制量则通过交叉注意力适配器注入 DiT 的视觉流。这种双向互锁的动态调制让网络在每个去噪时间步均清晰感知“保护源图身份”与“汲取参考质感”的职责,有效切断了属性与身份间的寄生耦合。

3. Real Makeup Removal Pipeline:从真实彩妆图像反向局部卸妆构建高保真配对数据 针对现有伪配对数据纹理失真与域偏移的缺陷,本文反其道而行之:与其在素颜上用 AI 凭空绘制高频妆容,不如从真实高质量彩妆图像出发做局部“卸妆”。卸妆过程本质上是减去局部外观层,人脸原生的底层骨骼几何天然受到强约束,能最大程度还原未上妆的自然皮肤分布。数据流水线从 50,000 张 \(1024 \times 1024\) 真实彩妆肖像出发,经过人脸检测与分辨率过滤后保留 3,000 张高标准图像,按全脸、眼部、唇部分组后,利用 FLUX-Kontext 执行针对性局部卸妆生成候选图像。

为了保证配对样本在像素级与几何级的绝对严谨,团队构建了四级严格过滤级联链: - 面部几何与形变过滤:利用 DFA-MobileNet 提取关键点对齐人脸,利用 AdaFace 计算余弦特征相似度剔除身份变形或未发生改变的候选,并通过眼睑轮廓差和牙齿暴露差严格剔除眨眼或微表情漂移; - 残留卸妆过滤:计算目标区域的局部颜色直方图变化,确保彩妆被彻底洗净,并以身份相似度与局部色差构成的平衡得分优选最佳配对; - 区域精度过滤:强制要求目标区域内产生显著色彩差值,而目标区域外(如发际线、面颊、背景)的差值被压制在近零水平,剔除全局泛白等误伤样本。 最终精选出 6,772 对高保真、同身份、带有精准区域标签的训练对(整脸 2,392 对、眼部 2,224 对、唇部 2,156 对)。在参考图构建上,通过选取与彩妆源图身份差距极大的目标人脸,基于 478 个 MediaPipe 密集关键点和 Delaunay 三角剖分进行分段仿射形变,成功构造出妆容质感一致但脸型几何完全割裂的独立参考样本。

损失函数 / 训练策略

模型采用 8 卡 NVIDIA A100 80GB GPU 训练,每卡 Batch Size 为 2,优化器选用 AdamW,学习率设为 \(5 \times 10^{-5}\),迭代优化 36,000 步。为保持基础生成模型强大的图像先验并兼顾计算效率,DiT 骨干网络冻结主体权重,采用 LoRA 形式进行微调,LoRA Rank 设为 256。训练阶段文本提示词限制在预定义的类别描述中,训练目标基于 Flow Matching / 扩散重建损失。推理阶段设置 28 步采样步长,分类器自由引导尺度(CFG scale)设为 2.5,以兼顾质感饱和度与结构稳定性。

实验关键数据

主实验

评估在两组 \(1024 \times 1024\) 高清测试基准(MakeupHQ-Synthetic 和 MakeupHQ-Real)及公开低分辨率基准 Makeup-Wild(\(256 \times 256\))上展开。评测指标包括衡量妆容风格与细节相似度的 DINO-I 与 CLIP-I、基于 AdaFace 提取特征衡量人脸身份保真度的 Face-ID、衡量非编辑背景区域均方误差的 L2M 以及衡量图像分布质量的 FID。主要对比结果如下表所示:

数据集 指标 CPM [26] EleGANt [42] SSAT [34] CSD-MT [36] SHMT [35] MAD [31] Stable-Makeup [44] Flux-Makeup [48] 本文 (Ours)
MakeupHQ-Synthetic
(\(1024 \times 1024\))
DINO-I ↑
CLIP-I ↑
Face-ID ↑
L2M ↓
FID ↓
0.625
0.777
0.400
1610.94
72.19
0.520
0.744
0.796
2148.09
86.84
0.461
0.698
0.684
2816.61
120.19
0.576
0.796
0.563
3334.56
83.90
0.488
0.710
0.824
823.66
92.60
0.500
0.727
0.590
180.67
91.37
0.612
0.789
0.569
101.42
69.73
0.576
0.765
0.806
111.48
64.12
0.660
0.816
0.730
56.37
59.24
MakeupHQ-Real
(\(1024 \times 1024\))
DINO-I ↑
CLIP-I ↑
Face-ID ↑
L2M ↓
FID ↓
0.575
0.722
0.361
2158.13
99.11
0.534
0.733
0.755
4038.09
97.25
0.448
0.665
0.641
3138.46
131.55
0.596
0.772
0.522
5572.25
91.93
0.482
0.682
0.777
593.03
115.32
0.476
0.703
0.539
183.09
119.16
0.616
0.774
0.525
163.98
81.34
0.552
0.745
0.792
104.46
85.43
0.623
0.799
0.706
49.77
76.27
Makeup-Wild
(\(256 \times 256\))
DINO-I ↑
CLIP-I ↑
Face-ID ↑
L2M ↓
FID ↓
0.608
0.621
0.406
605.86
86.59
0.587
0.640
0.777
1540.74
94.20
0.569
0.581
0.706
2709.62
109.18
0.602
0.640
0.499
2151.73
94.71
0.564
0.586
0.847
1246.03
103.27
0.545
0.609
0.598
169.28
105.79
0.619
0.637
0.721
71.53
85.13
0.568
0.621
0.928
42.61
88.71
0.581
0.665
0.884
25.84
92.92

消融实验

在 MakeupHQ-Synthetic 数据集上对眼部、唇部以及全脸编辑任务进行消融测试,基准模型为去除 TARG 和 CMPG 的基础 DiT,变体 2 引入 TARG,变体 3 为同时引入 TARG 与 CMPG 的完整模型,结果如下表所示:

编辑区域 变体配置 TARG CMPG Face-ID ↑ DINO-I ↑ CLIP-I ↑ 说明
Eyes (眼部) Variant 1
Variant 2
Variant 3
×

×
×
0.870
0.890
0.922
0.791
0.799
0.801
0.883
0.890
0.904
基础DiT模型
+TARG后溢色抑制,非目标区保真提升
完整模型,眼影质感与语义对应进一步增强
Lip (唇部) Variant 1
Variant 2
Variant 3
×

×
×
0.879
0.885
0.971
0.653
0.659
0.673
0.877
0.870
0.884
基础DiT模型
+TARG截断唇部特征对眼周扩散
完整模型,唇部饱和度与唇纹细节最佳
Face (全脸) Variant 1
Variant 2
Variant 3
×

×
×
0.805
0.857
0.858
0.733
0.712
0.753
0.833
0.811
0.840
基础DiT模型
+TARG防止背景和发际线受到面部注意力拉扯
完整模型,妆容浓度与五官立体感全面提升

关键发现

  • L2M 呈现数量级降低证实空间精准度:在 \(1024 \times 1024\) 分辨率下,传统方法如 CPM、EleGANt、CSD-MT 的 L2M 普遍在 1500 至 5500 之间,主要原因是非目标区域与背景发生面部重缩放和拉伸变形。MagicMakeup 在该指标上骤降至 56.37(Synthetic)和 49.77(Real),相比竞争对手 Stable-Makeup(101.42 / 163.98)和 Flux-Makeup(111.48 / 104.46)降低了一半以上,证明 TARG 对非编辑区域的原样保留能力极其优异。
  • 妆容忠实度与身份保持的健康平衡:部分 SOTA 方法(如 Flux-Makeup)报告了略高的 Face-ID,但在 DINO-I 与 CLIP-I 妆容特征相似度上明显落后,定性可视化显示这是由于其妆容迁移极其保守、几乎未改变颜色所致。MagicMakeup 在斩获最高 DINO-I(0.660 / 0.623)和 CLIP-I(0.816 / 0.799)的同时,依然维持了极具竞争力的 Face-ID,实现了迁移深度与身份保持的Pareto最优。
  • 模块贡献路径清晰自洽:消融实验清晰展现了两个模块的协同分工:TARG 作为硬门控优先拉升 Face-ID(如眼部从 0.870 升至 0.890,全脸从 0.805 升至 0.857),有效清除非目标区的误染色;CMPG 则通过软语义交互进一步拉动 DINO-I 与 CLIP-I(眼部提升至 0.801 / 0.904,唇部 Face-ID 飙升至 0.971),让眼影与唇膏的渐变质感完全对齐参考图。

亮点与洞察

  • 注意力级别的精确对数门控设计:突破了以往单纯将像素掩码拼接或做图像 Alpha 融合的局限,直接在多模态 DiT 的交叉注意力对数域注入硬约束掩码,从底层注意力图计算上封死跨区域特征扩散通道,机制极其简洁且零增加推理参数。
  • “卸妆胜于上妆”的数据逆向工程思维:敏锐指出了生成模型在无中生有合成彩妆时易受伪影干扰、破坏真实皮肤质感的痛点,反向借助 SOTA 图像编辑工具执行局部卸妆构造配对,搭配四重几何与色度过滤器,为业界产出了首个 1024 级别的超高清区域彩妆基准。
  • 跨模态感知引导下的语义解耦策略:将复杂的“保身份、移妆容”双重目标拆解为两组概念-图像对,通过 Top-\(k\) 视觉表征提取机制锁定核心证据,动态切片写回文本与图像流,为两幅输入图像的条件生成任务提供了极具参考价值的解耦范式。

局限与展望

  • 作者指出的局限:系统目前支持整脸、眼部和唇部三大核心区域的独立与混合控制,尚未将控制粒度下探到腮红、高光、阴影修容等更小局部的独立操控;同时,在极度侧脸的大偏航角姿态下,受限于训练集中极端姿态彩妆样本的天然稀缺,侧边阴影区域的妆容可能出现不完全迁移。
  • 自身分析的局限:数据构建高度依赖 FLUX-Kontext 的卸妆质量,若卸妆过程中引入微妙的皮肤纹理过度平滑(磨皮效应),可能使模型学到轻微的滤镜平滑先验;此外,TARG 采用硬掩码边界,在眼影外缘需要人工构建径向渐变软掩码,过渡区的平滑度对关键点定位精度有较高敏感性。
  • 后续改进方向:可引入连续可微的软区域注意力度量,将腮红与修容作为连续属性图层建模;结合 3D 稠密人脸网格或 UV 展开图,解决大角度极端侧脸下的自遮挡与透视失真问题。

相关工作与启发

  • vs Stable-Makeup [44]: Stable-Makeup 采用 CLIP 文本引导与人脸控制模块驱动扩散迁移,但缺乏注意力的 Token 级物理阻断,容易出现跨区域渗色与背景微变形;本文通过 TARG 从注意力层面彻底切断溢出通道,并在非编辑区 L2M 误差上实现 50% 以上的降低。
  • vs MAD [31]: MAD 尝试通过交叉域扩散实现区域级彩妆应用,但在高分辨率下计算开销极大且容易发生概念混淆;本文借助 DiT 单双流架构与 CMPG 概念对齐,在 1024 分辨率下兼具高效推理与高纯度语义解耦。
  • vs Flux-Makeup [48]: Flux-Makeup 依赖前向贴妆合成数据进行 DiT 训练,生成结果偏向保守以维持身份,导致彩妆细节缺失;本文采用真实彩妆局部卸妆配对与形变分离参考技术,在大幅提升妆容质感(DINO-I 0.660 vs 0.576)的同时保持了极佳的几何结构。

评分

  • 新颖性: ⭐⭐⭐⭐☆ (注意力空间 Token 对齐门控与卸妆数据配对构建思路新颖实用)
  • 实验充分度: ⭐⭐⭐⭐⭐ (覆盖超高清合成、超高清真实及低分辨率野外三大基准,定量指标与定性消融极其扎实)
  • 写作质量: ⭐⭐⭐⭐⭐ (逻辑链条清晰紧凑,图表表现力与问题定义非常明确)
  • 价值: ⭐⭐⭐⭐⭐ (对于虚拟试妆、数字人驱动及局部可控图像编辑等工业落地场景具有极高的实用价值)