跳转至

InstantRetouch: Personalized Image Retouching without Test-time Fine-tuning

会议: ECCV 2026
论文: ECCV 官方页面
领域: 图像生成
关键词: 个性化图像重修、非对称自编码器、检索增强重修、无微调风格迁移、真实感风格迁移

一句话总结

提出了无需测试时微调的通用个性化图像重修框架 RefRetouch(论文题名 InstantRetouch),通过 LoRA 适配的孪生 SigLIPv2 编码器与色彩空间轻量条件 MLP 解码器解耦内容与修图风格,并结合检索增强重修(RAR)实现多参考样例的内容自适应风格聚合与零样本真实感风格迁移。

研究背景与动机

图像重修旨在提升摄影作品的美学观感与叙事氛围,但由于色彩美感本身高度主观,不同用户的修图品味与调色习惯存在显著差异。现有自动化修图模型(如 3D LUT 系列、深度双边学习等)通常针对全局专家数据集固化特定调色风格,若要适配新用户,往往需要重新收集大量成对数据并重新训练网络,极大限制了实际部署。为解决个性化需求,已有研究探索利用少量参考样例进行测试时个性化调色,但现有基于风格分类(如 StarEnhancer)、度量学习(如 PieNet)或标准残差自编码(如 MSM)的方案,其隐空间往往将图像语义内容与调色风格严重缠结,在面对未见构图与新场景时迁移鲁棒性差。

这种失败的核心矛盾在于:用户在真实场景下的修图偏好是「内容自适应」且可能多变的(例如过曝场景压高光、欠曝场景提暗部、不同光照采用差异化冷暖调),而现有个性化方法通常将多张参考图的嵌入进行简单全局均值池化,忽视了输入图像与参考样例之间的内容相关性;同时,基于元学习或大模型上下文生成的方案受限于上下文长度与合成伪配对分布,难以泛化到真实复杂的多风格混合修图场景。

本文的切入角度是:解耦修图风格表征必须从结构不对称入手,强迫解码器在纯像素色彩空间映射,从而将语义内容抽离、仅由潜变量承载色彩与影调变换机制;进而借助输入特征的色调相似度动态检索最具上下文关联的参考样例。核心 idea:构建非对称自编码器(孪生 SigLIPv2 编码器 + 逐像素色彩域条件 MLP 解码器)提取内容解耦的修图风格隐码,并提出检索增强重修(RAR)机制,依据查询图与参考图的色调相似度检索 top-\(K\) 参考对加权聚合风格潜变量,实现完全无需测试时微调的内容自适应个性化重修。

方法详解

整体框架

RefRetouch 由两个核心阶段构成:风格提取阶段与自适应应用阶段。在风格提取阶段,非对称自编码器(Asymmetric Auto-Encoder)中的孪生编码器读取用户提供的参考原图与其修图目标图,输出低维解耦风格隐向量;在自适应应用阶段,检索增强重修(Retrieval-Augmented Retouching, RAR)计算未见查询图像与所有候选参考图输入特征的色调余弦相似度,检索最相似的 top-\(K\) 个参考对并进行 Softmax 加权融合,最终送入轻量条件 MLP 解码器重构出高保真修图图像。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["用户参考对 (x_i, y_i)"] --> B["非对称自编码器<br/>孪生SigLIPv2提取风格隐码 z_i"]
    C["查询输入图像 x_q"] --> D["检索增强重修 RAR<br/>基于色调内容特征算相似度 s_i"]
    B --> E["Top-K 筛选与 Softmax 加权聚合<br/>融合成查询风格潜变量 z_q"]
    D --> E
    E --> F["色彩空间条件 MLP 解码器<br/>逐像素注入风格潜变量 z_q"]
    C --> F
    F --> G["个性化重修输出 y_hat_q"]

关键设计

1. 非对称自编码器:结构与空间非对称的内容-风格彻底解耦

以往自编码架构常采用镜像 U-Net 预测图像残差,这使得网络参数容易隐式记住原图的语义空间分布,造成风格隐码中混杂场景内容。本文设计了在网络结构和作用空间上均非对称的自编码体系:编码端采用基于 SigLIPv2 的孪生视觉骨干网络,通过对所有注意力层线性权重引入 Rank=16 的可训练 LoRA 适配层,分别接收参考原图 \(x \in \mathcal{X}\) 与修图目标图 \(y \in \mathcal{Y}\),池化特征拼接后经全连接投影输出 \(d=2048\) 维风格隐向量 \(z = E_\theta(x, y)\);解码端则设计为极其轻量的条件多层感知机(Conditional MLP),完全在色彩空间执行逐像素映射 \(\mathbb{R}^3 \to \mathbb{R}^3\)。该架构迫使解码器无法借助空间卷积记忆局部结构,必须且仅能依赖风格潜变量 \(z\) 来执行全局色彩、对比度与色调曲线变换,从而实现风格与语义内容的严格解耦。

2. 逐层潜变量加性注入:高效控制色彩变换流向

为了让轻量解码器平滑吸收高维修图风格信息,条件 MLP 依次包含一个将 RGB 像素映射至 128 维特征的输入层,以及隐藏维度分别为 \([256, 512, 3]\) 的 3 个条件 MLP 块。所有隐藏层均使用 ReLU 激活,最后一层经由 Sigmoid 约束输出至 \([0, 1]\) 归一化区间。不同于复杂的交叉注意力(Cross-Attention)或自适应层归一化(AdaLN),本文通过微型线性投影层将 2048 维隐向量 \(z\) 映射至各中间层的特征维度,并直接加权相加(Additive Conditioning)注入。消融实验证实,加性注入在保持超轻量计算的同时,显著避免了交叉注意力在纯色彩逐点变换上的过拟合震荡。

3. 检索增强重修(RAR):色调感知检索与动态权重融合

面对包含多张历史修图样例(如不同曝光、不同光照或混合调色)的用户参考集 \(\mathcal{P} = \{(x_i, y_i)\}_{i=1}^M\),传统全局平均池化会抹平特定场景的个性化处理逻辑。RAR 模块利用 LoRA 适配后的 SigLIPv2 提取查询图像 \(x_q\) 的内容嵌入 \(c_q\) 以及各参考输入图 \(x_i\) 的嵌入 \(c_i\)。在特征空间中,该适配骨干网络已从通用高层语义对齐转向色调与光影线索感知。计算余弦相似度 \(s_i = \frac{c_q \cdot c_i}{\|c_q\| \|c_i\|}\) 后,筛选出相似度最高的 top-\(K\)(默认 \(K=3\))个最匹配参考样例集合 \(\mathcal{N}_K\),并以温度超参 \(\tau=0.1\) 进行 Softmax 归一化聚合:

\[w_i = \frac{\exp(s_i / \tau)}{\sum_{j \in \mathcal{N}_K} \exp(s_j / \tau)}, \quad z_q = \sum_{i \in \mathcal{N}_K} w_i z_i\]

聚合得到的综合风格隐码 \(z_q\) 与查询图像 \(x_q\) 输入条件 MLP 解码器,即可合成符合当前光影上下文的个性化调色结果 \(\hat{y}_q = D_\phi(x_q, z_q)\)。

4. 零样本真实感风格迁移:输入自循环构造伪参考对

本框架还天然支持单张非配对参考图的无监督真实感风格迁移(Photorealistic Style Transfer)。面对任意给定的非配对风格参考图 \(y_{style}\) 与待处理内容图 \(x_q\),算法将内容图 \(x_q\) 直接作为伪参考输入原图,与 \(y_{style}\) 构成伪参考对 \((x_q, y_{style})\) 输入编码器生成风格隐码 \(z = E_\theta(x_q, y_{style})\),解码器随即将该风格施加到 \(x_q\)。由于非对称自编码器仅捕捉色调分布与光影映射梯度,能够完全忽略两张图之间的语义鸿沟,无需任何微调即可直接实现高质量的自然色彩迁移。

损失函数 / 训练策略

模型在构建的 95,000 张成对图像数据集上进行预训练。训练过程固定配对数据的监督目标,使用标准 \(\ell_1\) 逐像素重构损失优化网络参数:

\[\mathcal{L}_{\text{recon}} = \mathbb{E}_{(x, y) \sim \mathcal{D}} \| D_\phi(x, E_\theta(x, y)) - y \|_1\]

训练时从图像中随机裁剪 \(384 \times 384\) 分辨率区域,Batch Size 设为 8,基于 Adam 优化器训练 180,000 步。

实验关键数据

主实验

论文在单风格一致性基准 VCIRB、多风格一致性基准 PPR10K-Groups 以及多风格不一致历史修图基准(MIT-FiveK 与 PPR10K)上进行了全面评估。下表汇总了在 VCIRB 与 PPR10K-Groups 上的定量对比结果:

数据集 方法 PSNR (1 Ref)↑ PSNR (Max Ref)↑ SSIM (1 Ref)↑ SSIM (Max Ref)↑ LPIPS (1 Ref)↓ LPIPS (Max Ref)↓
VCIRB StarEnhancer 21.00 21.27 (4 Ref) 0.864 0.868 (4 Ref) 0.123 0.120 (4 Ref)
VCIRB MSM 17.69 18.53 (4 Ref) 0.822 0.836 (4 Ref) 0.164 0.150 (4 Ref)
VCIRB MSM† (Retrained) 24.35 25.28 (4 Ref) 0.900 0.905 (4 Ref) 0.097 0.093 (4 Ref)
VCIRB VisualCloze 19.81 12.05 (4 Ref) 0.765 0.378 (4 Ref) 0.173 0.591 (4 Ref)
VCIRB VisualCloze† (Retrained) 23.91 24.70 (4 Ref) 0.830 0.825 (4 Ref) 0.077 0.079 (4 Ref)
VCIRB RefRetouch (本文) 29.13 29.82 (4 Ref) 0.963 0.965 (4 Ref) 0.048 0.046 (4 Ref)
PPR10K-Groups StarEnhancer 19.16 19.36 (6 Ref) 0.875 0.866 (6 Ref) 0.102 0.119 (6 Ref)
PPR10K-Groups MSM 18.86 18.59 (6 Ref) 0.877 0.878 (6 Ref) 0.154 0.155 (6 Ref)
PPR10K-Groups MSM† (Retrained) 19.27 18.16 (6 Ref) 0.876 0.866 (6 Ref) 0.149 0.170 (6 Ref)
PPR10K-Groups VisualCloze 15.04 7.74 (6 Ref) 0.453 0.246 (6 Ref) 0.220 0.844 (6 Ref)
PPR10K-Groups VisualCloze† (Retrained) 21.12 20.98 (6 Ref) 0.832 0.812 (6 Ref) 0.097 0.112 (6 Ref)
PPR10K-Groups RefRetouch (本文) 22.51 25.27 (6 Ref) 0.932 0.961 (6 Ref) 0.065 0.043 (6 Ref)

注:† 表示使用本文收集的高质量 Lightroom 预设数据集重训练的基线版本。

在包含 20/50/100 张多样化历史修图参考对的 MIT-FiveK 与 PPR10K 评估中,本文方法同样表现优异:在 MIT-FiveK(100 参考对)上,本文 PSNR 达到 23.34 dB(SSIM 0.920),优于免微调的 MSM(22.05 dB)以及需要专有训练的 RSFNet(22.66 dB)和 AdaInt(22.49 dB);在 PPR10K(100 参考对)上,本文达到 22.47 dB(SSIM 0.942),全面超越各类通用免微调方法。

消融实验

针对非对称自编码器的关键组件(编码骨干、解码架构、条件注入方式)在验证集上的重构性能消融结果如下表所示:

实验编号 编码器骨干 解码器架构 注入机制 PSNR (dB)↑ SSIM↑
1 (本文完整设计) SigLIPv2 + LoRA 逐像素条件 MLP 加性注入 (Add) 32.40 0.977
2 ResNet-50 逐像素条件 MLP 加性注入 (Add) 30.00 0.971
3 SigLIPv2 (冻结) 逐像素条件 MLP 加性注入 (Add) 23.41 0.931
4 SigLIPv2 + LoRA 空间卷积 U-Net 隐式残差注入 29.58 0.944
5 SigLIPv2 + LoRA 逐像素条件 MLP 自适应层归一化 (AdaLN) 31.93 0.977
6 SigLIPv2 + LoRA 逐像素条件 MLP 交叉注意力 (Cross-attn) 22.66 0.880

在 RAR 模块的参考样本选择消融中,在 MIT-FiveK(给定 100 张参考对)设定下:仅取 \(k=1\) 时 PSNR 为 21.94 dB;取 \(k=3\) 提升至 23.34 dB;取 \(k=5\) 进一步达到 23.82 dB;若不进行检索而直接平均所有 100 张参考对的风格隐码(All),性能骤降至 21.94 dB。

关键发现

  • 非对称设计是解耦的根基:将解码器限制在逐像素色彩空间(MLP)相比空间卷积 U-Net 带来了 +2.82 dB 的 PSNR 增益(实验 1 vs 4)。这证明了限制解码器的空间表达能力反向迫使编码器将语义结构彻底丢弃,仅提取纯粹的全局色彩与影调变换规则。
  • LoRA 适配引发特征偏向转移:未微调的冻结 SigLIPv2 仅取得 23.41 dB,而加入 LoRA 适配后飙升至 32.40 dB。特征检索可视化显示,LoRA 微调使视觉骨干从识别高层物体类别转向捕捉曝光、白平衡与对比度等色彩影调统计量。
  • 检索优于简单平均:在多风格或历史修图场景下,简单对全部样本求平均会混淆不同场景(如室内暖光 vs 室外冷调)的修图规则;而 RAR 仅挑选最相关的 top-\(K\) 样例聚合,使多参考场景下的 PSNR 随参考图增加单调提升(PPR10K-Groups 上从 1 张的 22.51 dB 跃升至 6 张的 25.27 dB)。

亮点与洞察

  • 结构与空间的双重非对称性设计:通过强大的 LoRA-adapted 基础大模型提取紧凑的 1D 风格向量,再交由零空间卷积的纯色域 MLP 解码,用极简的体系打破了图像重修中内容与调色特征纠缠的宿疾。
  • 检索增强在连续信号控制中的优雅落地:将大模型领域成熟的 RAG 范式迁移至图像色彩个性化迁移中,以轻量余弦相似度检索匹配样本,自然解决了用户修图偏好与拍摄内容紧密绑定的非刚性映射问题。
  • 零成本跨任务泛化能力:将内容图自身作为伪输入与目标风格图组成伪配对,使得专为成对修图设计的自编码模型不改一行业务逻辑即可开箱支持真实感风格迁移,体现出通用潜在空间的强大鲁棒性。

局限与展望

  • 仅支持全局均匀色调调整:当前条件 MLP 为逐像素点操作,缺乏空间局部感知,无法实现人像面部局部磨皮/提亮或天空蒙版局部压暗等区域级局部精细重修。
  • 对局部极端光影反差的表达受限:对于存在大光比阴影、局部过曝逆光的复杂场景,全局 1D 潜变量难以精确控制空间非均匀分布的阶调映射。
  • 未来方向:作者指出可结合空间分解机制或引入区域语义分割掩码(如掩膜条件引导),将全局 MLP 扩展为区域自适应局部调色架构。

相关工作与启发

  • vs StarEnhancer / PieNet: StarEnhancer 依赖固定类别分类器,无法泛化到开放式新风格;PieNet 采用对比度量学习导致隐空间粒度粗糙。本文通过重构驱动的自编码与 LoRA 适配,实现了连续且细粒度的开放风格表征。
  • vs MSM (Masked Style Modeling): MSM 采用 U-Net 架构容易在解码时泄露语义空间信息,且其元学习依赖人工退化的伪配对。本文采用非对称 MLP 解码保证内容解耦,并通过真实 Lightroom 预设构建大规模数据集,重构与迁移保真度显著超越 MSM。
  • vs VisualCloze 等视觉上下文生成大模型: VisualCloze 等扩散模型基于 Transformer 处理 2D Patch,计算开销极其庞大且在多张参考图下性能严重衰退。本文在单张图推理耗时与显存消耗上极具工程优势,且多图扩展性能表现稳健。

评分

  • 新颖性: ⭐⭐⭐⭐ [非对称色彩自编码器与检索增强重修架构设计精巧,思路自洽]
  • 实验充分度: ⭐⭐⭐⭐⭐ [覆盖单风格、多风格一致、多风格不一致及风格迁移四大场景,消融详实]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑严密,图表清晰,对解耦机制的论述十分透彻]
  • 价值: ⭐⭐⭐⭐⭐ [真正做到了无需测试时微调的高保真端侧修图个性化,工程落地价值极高]