ID-PreFeR: ID-Preserving Face Restoration with Mixed Data Quality¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://eccv.ecva.net/virtual/2026/poster/3808
领域: 图像恢复
关键词: 人脸恢复, 扩散模型, 身份保持, 混合数据质量, 个性化注入器
一句话总结¶
针对个性化人脸恢复中参考图质量参差不齐且全模型微调成本高的瓶颈,ID-PreFeR 提出仅优化跨注意力 LoRA 的免正则化轻量注入器、结合 MLLM 提示词与 Min-SNR-γ 的身份-质量解耦训练策略,以及推理阶段的身份保持采样,在仅需单张高质量参考图时即可实现 SOTA 级别的身份保真度与细节恢复。
研究背景与动机¶
现实拍摄场景中的低质量人脸图像极为普遍,如手机远摄小人脸、夜景拍摄或网络传输中经历重度压缩与退化的肖像。盲人脸恢复旨在从模糊、低分辨率、噪声以及压缩失真交织的低质观测中重构高质量面部。然而,人脸恢复本质上是一个高度不适定的病态逆问题,同一低质输入往往对应着多种在感知上合理但细节各异的高质量解。由于人类视觉认知系统对人脸五官与局部几何特征高度敏感,细微的结构漂移都会导致明显的“身份叛变”。传统依赖 GAN、VQ 代码本或通用扩散先验的无参考人脸恢复方法,由于缺乏目标个体的特异性先验,在重度退化下极易退化成陌生人的面部。
为了解决身份漂移难题,近期的个性化人脸恢复方法引入了同一目标的参考图像来引导重建。然而,现有范式普遍陷入了两大核心困境:其一是个性化优化负担沉重。主流扩散模型方案往往需要微调大部分甚至全部网络参数,并为每个身份存储整套模型;为避免灾难性遗忘与语义漂移,还必须依赖大规模类别正则化数据集,导致训练与存储开销难以承受。其二是对高质量参考图存在极强的依赖性。既有方法假设参考图像均为清晰的高清图,但在真实用户相册或实际采集中,获取的多张参考图难免混杂着模糊、低清或噪点。一旦低质量参考图比例上升,现有方法便容易把参考图中的退化伪影误学为该身份的专属特征,造成恢复结果质量断崖式下跌。
面对“轻量化部署需求”与“非理想混合质量参考”的现实约束,本文的切入角度是:解耦身份特征与图像退化,并将个性化参数严格约束在极小范围。核心 idea:构建参数量仅占主干 0.25% 的跨注意力 LoRA 注入器,利用潜空间先验损失摆脱外部正则化数据,并通过 MLLM 生成的质量感知提示与 Min-SNR-γ 加权彻底解耦身份与退化残留,配合推理期反向梯度采样牢牢锚定身份保真度。
方法详解¶
整体框架¶
ID-PreFeR 将流程拆分为单目标轻量个性化微调(训练阶段)与冻结主干的目标人脸恢复(推理阶段)。在训练阶段,算法仅针对目标身份的极少数混合质量参考图,微调 SDXL Decoder 中跨注意力层的 LoRA 权重以及可学习的提示词词素;主干网络权重全部冻结,并引入基于类别提示词的潜空间先验损失防止语言漂移,从而完全无需引入额外的通用正则化图像集。在推理阶段,学习到的轻量级适配器被即插即用装载至冻结主干,以低质人脸为控制条件执行潜扩散逆过程;同时,在反向去噪的末期步骤中,引入身份保持采样,通过人脸识别特征的余弦相似度梯度轻度校准预测噪声。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入:少数混合质量参考图"] --> B["轻量级个性化注入器<br/>LoRA 微调 Cross-Attention + 潜空间先验损失"]
B --> C["身份-质量解耦策略<br/>MLLM 质量感知 Prompt + Min-SNR-γ 加权"]
C --> D["生成目标身份专用适配器(仅 6.41M 参数)"]
D --> E["低质人脸条件反向扩散<br/>结合 ControlNet 浅层条件引导"]
E --> F["身份保持采样<br/>逆扩散末期基于 ArcFace 梯度的噪声修正"]
F --> G["输出:高保真高细节恢复人脸"]
关键设计¶
1. 轻量级个性化注入器:摆脱外部正则化数据的极简适配
传统扩散个性化方法往往为了维护通用生成先验而需要混合数千张同类别真实图进行正则化,训练繁琐且每个个体需持久化完整权重。为了将优化与存储负担降至最低,ID-PreFeR 冻结了 SDXL 主干网络 \(\theta^*\),仅在 U-Net Decoder 的跨注意力层中植入低秩适配器(LoRA,秩设为 16),可训练参数量压缩至 6.41M(约占 SDXL 的 0.25%,权重文件仅约 13MB)。针对参数微调易引发的语言漂移问题,方法摒弃了繁重的正则化数据集,设计了轻量潜空间先验损失:
其中 \(y\) 为包含专用标识符的个性化提示(如 a photo of a [V] face),而 \(y^*\) 则为剔除标识符的通用类别提示(如 a photo of a face)。通过强制个性化网络在通用提示下输出的潜空间预测噪声逼近原始冻结模型,使网络仅在专用标记激活时更新身份特定表征,成功实现了完全摆脱外部正则化图像的轻量化个性化。
2. 身份-质量解耦策略:防止将低质伪影固化为身份特征
当给定的参考图像包含模糊或压缩失真时,朴素微调极易使模型把退化噪点学习成该人脸的固有属性。ID-PreFeR 采用双重视角进行解耦:首先借助轻量级多模态大模型(MLLM)对每张参考图进行二值质量判定(清晰 HQ / 模糊 LQ),并在训练提示词中构建显式质量词元,形成 a [Q] [V] face 结构,其中 \([Q] \in \{[Q_{\text{HQ}}], [Q_{\text{LQ}}]\}\) 分别以 sharp 和 blurry 文本嵌入初始化并与 \([V]\) 联合优化。在测试推理阶段,直接剥离质量词元 \([Q]\) 仅保留身份词元 \([V]\),迫使质量词元吸收特定退化,而 \([V]\) 仅沉淀跨样本一致的本质身份特征。
进一步地,从潜在扩散正向退化推导可知,低质样本潜编码满足 \(z_{\text{LQ}} = z_{\text{HQ}} + \epsilon_{\text{deg}}\)。代入扩散正向加噪公式后,加噪隐变量在信噪比 \(\text{SNR} = \bar{\alpha}_t / (1 - \bar{\alpha}_t)\) 极高的低步长(low timestep)区间,退化项 \(\omega_t \epsilon_{\text{deg}}\) 会剧烈干扰去噪学习,诱导适配器拟合高频退化。为此,ID-PreFeR 引入 Min-SNR-\(\gamma\) 加权扩散损失:
固定超参数设为 \(\gamma = 5\)。该加权机制在低步长高 SNR 阶段硬性截断了退化残差对梯度的支配性放大,压制对伪影的过拟合,使网络聚焦于低频几何骨干与稳定的身份骨架。
3. 身份保持采样:推理期无损反向梯度校准
在极端工况下(例如参考集中仅有 1 张高质量图像,其余全为低质),由于潜在目标分布模糊,逆扩散轨迹仍可能产生残留身份偏移。为此,ID-PreFeR 提出在推理生成时引入无需修改模型权重的测试期导引——身份保持采样。方法利用冻结的人脸识别特征提取器 \(f_{\text{face}}\)(ArcFace),预先提取与输入人脸姿态结构最相近的参考图嵌入 \(f_{\text{face}}(x_{\text{ref}})\)。在反向去噪过程的最后若干步中,通过单步去噪潜变量重构估计图像 \(\hat{x} = \mathcal{D}(\hat{z})\),并在预测噪声上沿人脸余弦相似度的梯度方向执行轻量单步上升(步长 \(\delta=0.05\)):
由于该导引仅在合成轮廓基本确定、主要刻画人脸五官精细特征的末端扩散时间步触发(默认迭代步数 \(K_{\text{ID}}=1\)),因此既不会破坏扩散先验的自然纹理生成能力,又能以极小的计算代价将生成的面容精确拉回到目标人物特征空间中。
损失函数 / 训练策略¶
整个微调阶段的总优化目标为加权扩散损失与潜空间先验损失的复合: $\(\mathcal{L}_{\text{total}} = \mathcal{L}_{\text{LDM}} + \lambda_{\text{reg}} \mathcal{L}_{\text{reg}}\)$ 模型基于 SDXL 架构,在 Decoder 跨注意力模块上添加秩 \(r=16\)(\(\alpha=16\))的 LoRA 权重,采用 AdamW 优化器,在 FP16 精度、Batch Size 为 4 的配置下优化 500 个 step。LoRA 参数的学习率设为 \(1 \times 10^{-3}\),质量词元 \([Q]\) 与身份标识符 \([V]\) 的学习率设为 \(5 \times 10^{-4}\)。每个身份的训练仅需约 4.2 分钟即可完成收敛。
实验关键数据¶
主实验¶
在公开基准数据集 CelebRef 上,将 ID-PreFeR 与 4 种无参考盲人脸恢复方法(GFPGAN、CodeFormer、DiffBIR、AuthFace)以及 6 种个性化/基于参考的人脸恢复方法(DMDNet、FaceMe、Gen2Res、InstantRestore、RestorerID、ReF-LDM)进行了系统评测。
| 方法 | 参考图规格 (Ref. spec.) | PSNR↑ | SSIM↑ | LPIPS↓ | CLIPIQA↑ | MANIQA↑ | ID 相似度↑ |
|---|---|---|---|---|---|---|---|
| GFPGAN | 无参考 (×) | 25.50 | 0.748 | 0.301 | 0.503 | 0.449 | 0.613 |
| CodeFormer | 无参考 (×) | 25.07 | 0.726 | 0.388 | 0.598 | 0.429 | 0.586 |
| DiffBIR | 无参考 (×) | 25.29 | 0.690 | 0.401 | 0.615 | 0.504 | 0.562 |
| AuthFace | 无参考 (×) | 25.32 | 0.683 | 0.294 | 0.699 | 0.643 | 0.649 |
| DMDNet | 仅高质量 (HQ) | 25.04 | 0.712 | 0.316 | 0.613 | 0.491 | 0.635 |
| FaceMe | 混合质量 (LQ & HQ) | 25.82 | 0.724 | 0.265 | 0.646 | 0.504 | 0.704 |
| Gen2Res | 混合质量 (LQ & HQ) | 24.30 | 0.748 | 0.424 | 0.491 | 0.331 | 0.446 |
| InstantRestore | 仅高质量 (HQ) | 24.65 | 0.722 | 0.297 | 0.561 | 0.488 | 0.769 |
| RestorerID | 仅高质量 (HQ) | 22.72 | 0.636 | 0.434 | 0.717 | 0.574 | 0.522 |
| ReF-LDM | 仅高质量 (HQ) | 23.58 | 0.676 | 0.244 | 0.669 | 0.562 | 0.695 |
| Ours (ID-PreFeR) | 混合质量 (LQ & HQ) | 25.51 | 0.729 | 0.242 | 0.701 | 0.649 | 0.767 |
| Input | N/A | 24.58 | 0.714 | 0.672 | 0.309 | 0.144 | 0.613 |
| Ground truth | N/A | +∞ | 1.000 | 0.000 | 0.650 | 0.546 | 1.000 |
注:原论文 Table 1 数据。ID-PreFeR 是全场唯一在混合数据质量条件下取得最低 LPIPS(0.242)、最高 MANIQA(0.649)并且 ID 保持得分(0.767)比肩仅依赖纯 HQ 参考图的 InstantRestore(0.769)的方案。
消融实验与稳健性分析¶
针对各模块的有效性与在不同高质量参考图数量(#HQ \(\in \{5, 3, 1\}\))下的稳健性,作者给出了细致的消融分析。
| 配置 / 变体 | 参数量 | PSNR↑ | SSIM↑ | LPIPS↓ | CLIPIQA↑ | MANIQA↑ | ID↑ (#HQ=5) | ID↑ (#HQ=3) | ID↑ (#HQ=1) |
|---|---|---|---|---|---|---|---|---|---|
| 完整模型 (Ours) | 6.41 M | 25.51 | 0.729 | 0.242 | 0.701 | 0.649 | 0.7671 | 0.7641 | 0.7613 |
| 去除先验保持损失 (w/o prior reg) | 6.41 M | 25.52 | 0.731 | 0.245 | 0.699 | 0.624 | 0.7460 | - | - |
| 去除身份-质量解耦 (w/o IDQ disent.) | 6.41 M | 25.57 | 0.698 | 0.279 | 0.674 | 0.555 | 0.7664 | 0.7631 | 0.7632 |
| 去除身份保持采样 (w/o IDPS) | 6.41 M | 25.07 | 0.696 | 0.281 | 0.666 | 0.554 | 0.7338 | 0.7325 | 0.7317 |
| LoRA 全部跨注意力层 (LoRA all CA) | 11.82 M | 25.34 | 0.709 | 0.289 | 0.621 | 0.489 | 0.7450 | - | - |
| LoRA 跨注意力及自注意力 (CA & SA) | 12.57 M | 25.45 | 0.720 | 0.290 | 0.599 | 0.472 | 0.7560 | - | - |
注:原论文 Table 3 与 Table 4 数据。
关键发现¶
- 对极低 HQ 参考图的极限抗跌性:当参考集中的清晰图像数量从 5 骤降至 1(其余全为低质图)时,ID-PreFeR 的身份相似度几乎保持恒定(0.7671 \(\to\) 0.7641 \(\to\) 0.7613),相比之下,去除身份保持采样后 ID 分数全面滑坡至 0.731 左右,证明 IDPS 是锁死身份保真的核心防线。
- 解耦模块主导感知质量:在仅有 1 张 HQ 参考图时,去除解耦模块在数值上 ID 略有波动(0.7632),但在视觉呈现上却会严重退化并引入大量高频噪点与模糊伪影(LPIPS 从 0.242 恶化至 0.279,MANIQA 从 0.649 跌落至 0.555)。解耦模块与 Min-SNR-\(\gamma\) 的核心职能在于“洗净退化”,保障视觉纯净度。
- 轻量微调胜过重度微调:将 LoRA 扩展到全部跨注意力与自注意力层(参数量翻倍至 12.57M)不仅增加了显存开销,更导致文本控制力弱化和感知指标下降(LPIPS 恶化至 0.290,CLIPIQA 跌至 0.599),证明约束在 Decoder 跨注意力层并辅以潜空间先验监督在人脸个性化中达到了最佳的平衡点。
亮点与洞察¶
- MLLM 赋能的解耦提示设计:巧妙借用轻量 MLLM 的图像质量判定能力,用
sharp/blurry初始化质量词元,在训练时利用词元吸收退化模式、在测试时移除词元仅保留纯净身份向量,避免了繁重的退化模拟网络构建。 - 信噪比视角剖析退化过拟合:从扩散加噪机理切入,指明低步长高 SNR 阶段是模型把参考图退化残差误当做真实身份特征的根本成因,以优雅的 Min-SNR-\(\gamma\) 截断加权从数学根源上扼制了伪影过拟合。
- 0.25% 极小增量实现消费级适配:全模型仅需训练与存储 6.41M 参数(约 13MB 存储空间),单人脸训练用时仅 4.2 分钟,彻底打破了个性化扩散必须存储数 GB 模型和数千张正则图的落地瓶颈。
局限与展望¶
- 饰品与装饰特征的抵消现象:当多张参考图像在妆容、眼镜、首饰等方面不一致时,模型倾向于学习跨样本的共同均值,从而导致耳环或眼镜等部件在恢复结果中出现不确定性或部分消失。
- 反向引导增加推理耗时与显存:身份保持采样需要在去噪后几个 step 经过 VAE Decoder 解码并在人脸识别网络上反向传播计算梯度,使得单张图推理时间从 5.6s 增至 29.0s,显存从 24GB 增加到 34.8GB,对端侧实时部署提出了优化挑战。
相关工作与启发¶
- vs DMDNet / FaceMe: 传统参考人脸恢复(如 DMDNet)依赖特征字典对齐,遇到大姿态差异与低质量参考图容易几何崩溃;FaceMe 等近期工作缺乏显式解耦,在混合参考质量下性能大幅衰退。本文在混合质量(LQ & HQ)下依然保持高度鲁棒。
- vs DreamBooth / Textual Inversion: 经典个性化生成需要海量类别正则图像来对抗语言漂移,且通常耗费十几分钟;ID-PreFeR 提出潜空间先验损失 \(\mathcal{L}_{\text{reg}}\),以冻结主干为参照物直接正则化,实现了完全零正则图像依赖的超轻量微调。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ 引入质量感知词元解耦退化残差,并结合 Min-SNR-γ 截断和逆扩散末期人脸梯度引导,思路清晰完整。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖合成基准 CelebRef、大规模 FFHQ-Ref-Moderate 以及真实采集的手机移动端评测,指标扎实详尽。
- 写作质量: ⭐⭐⭐⭐⭐ 动机阐述自然流畅,数学推导与直觉机理契合,图表信息充实且对照清晰。
- 价值: ⭐⭐⭐⭐⭐ 直击相册与移动端人脸修复中“参考图不可避免存在低画质”的工程痛点,极具实际应用前景。