跳转至

Enlightening Photographic Style Transfer with a Self-Supervised Photographic Embedding

会议: ECCV 2026
论文: ECCV 原文
项目页: https://petal-pku.pages.dev/
领域: 图像生成
关键词: 摄影风格迁移, 自监督学习, 图像调色, 查找表LUT, 连续特征表征

一句话总结

PETAL提出了一种结合自监督摄影风格增强与CIE-Lab空间直方图引导的摄影风格嵌入网络,并通过风格差值驱动轻量级自适应5D神经LUT,在无需测试时优化的前提下实现了保真度与感官质量兼优的摄影风格迁移。

研究背景与动机

风格迁移是计算机视觉领域的经典课题,但学术界长期的关注点大多集中在艺术风格迁移(如油画笔触与抽象纹理重绘)或粗粒度的全局色彩平衡调整上。真正的摄影修图(Photographic Style Transfer)截然不同:摄影师通过曝光、对比度、色温、色调曲线以及暗角等平滑空间效应来烘托影调氛围,这种风格本质上具有微妙、连续且保留底层结构纹理的特性。现有的图像特征提取器大多依赖语义分类或离散文本监督(如CLIP、DINO),离散文字标签(如“暗”与“微暗”)完全无法刻画连续渐进的曝光或色偏,直接用于引导风格迁移极易导致特征错配与质感失真。

另一方面,传统基于查找表(LUT)的图像增强与迁移方法虽然具备空间独立、不破坏原图细节纹理的优势,但在面对多样化、复合型的摄影风格时,往往因缺乏精细且对齐的参考风格描述,导致迁移结果出现不真实的对比度崩塌或色彩漂移。如果采用基于扩散模型或深层特征统计的方案,又极易破坏几何结构并引入高昂的计算开销。

因此,构建一个能够精确感知连续摄影调色差异、不受语义内容干扰的表征空间,是打通高保真摄影风格迁移的核心瓶颈。本文的核心 idea 是解耦语义与影调,利用反向摄影风格增强构建互为硬负例的成对样本,在CIE-Lab空间结合全局直方图交叉注意力自监督预训练摄影风格嵌入,并以该嵌入驱动轻量级5D自适应神经LUT实现零测试时优化的精准风格迁移

方法详解

整体框架

PETAL由两个阶段解耦构成:第一阶段为摄影风格嵌入网络(Photographic Style Embedding Network \(\mathcal{M}\)),用于从任意参考图中提取对内容不敏感、对影调敏感的紧致摄影风格向量;第二阶段为轻量级自适应5D神经LUT(Adaptive Neural LUT),以内容图和参考图的摄影嵌入差值为调制条件,完成像素级颜色与平滑空间映射。

整个推理管线无需测试时优化,输入内容图像和参考图像后,前向传递即可实时输出高质量调色结果。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入:内容图与风格参考图"] --> B["CIE-Lab 直方图与 ViT 双路编码<br/>解耦亮度色度并提取全局影调分布"]
    B --> C["自监督摄影风格对比学习<br/>局域视差正例与反向增强硬负例约束"]
    C --> D["自适应 5D 神经 LUT 空间调制<br/>嵌入差值条件化 AdaIN 仿射变换"]
    D --> E["输出:高保真摄影风格迁移图像"]

关键设计

1. CIE-Lab 直方图与 ViT 双路编码:解耦解构空间与全局统计分布

传统RGB表征中亮度和色彩高度耦合,直接提取特征容易使模型混淆内容语义与曝光色温。PETAL首先将图像变换至CIE-Lab色彩空间,从而将亮度通道与色度通道显式解耦。随后,网络兵分两路:主干采用视觉Transformer(ViT)提取图像局部补丁(Patch Tokens)与全局[CLS]特征;辅助路则通过可微的逆二次核函数,计算亮度一维直方图 \(h^L \in \mathbb{R}^H\) 与色度二维联合直方图 \(h^{ab} \in \mathbb{R}^{H \times H}\)

\[ h^L(i) = \sum_{p=1}^N \mathcal{K}(I^L(p), b_i), \quad h^{ab}(i, j) = \sum_{p=1}^N \mathcal{K}(I^a(p), b_i)\mathcal{K}(I^b(p), b_j) \]

其中 \(\mathcal{K}\) 为平滑核函数,\(b_i, b_j\) 为直方图bin中心。两类直方图经独立轻量编码器处理后拼接为 \(H_{Lab}\),并通过交叉注意力模块注入到ViT的各层Patch表示中。最后,全局[CLS]标记与经过可学习自适应池化 \(\mathcal{P}(\cdot)\) 的Patch Tokens拼接并映射为最终风格向量 \(z = h([V^{\text{cls}}; \mathcal{P}(V^{\text{p}})])\),使嵌入同时具备宏观影调分布与局域调色特征。

2. 自监督摄影风格对比学习:利用反向可微编辑构造高难度负例

缺乏精细连续的摄影风格标签是训练风格表征的主要障碍。文本监督粒度太粗,而传统的空间切片对比容易将局部光照变化错误地当作全局风格差异。PETAL设计了摄影风格增强机制(Photographic Style Augmentation, PSA),包含曝光、对比度、饱和度、高光/阴影及色温等可微调色算子集合 \(f(I, \{\xi_i\})\),其中 \(\xi_i \in [-1, 1]\)

针对同一张图片采样的局部重叠裁剪块,施加相同随机参数的一组局部视图作为正例,拉近其特征距离以获得对空间位置与轻微几何平移的鲁棒性(样本内损失 \(\mathcal{L}_-\));同时,对相同裁剪块施加相反参数 \(f(I, \{-\xi_i\})\) 制造风格截然相反但内容与构图严格一致的反向样本,作为强负例进行互斥约束(样本间损失 \(\mathcal{L}_+\))。此外,为了防止表征丢失具体的色彩统计量,网络引入直方图重构分支,以Hellinger距离监督从Patch特征重构原始直方图(\(\mathcal{L}_{\text{rec}}\))。

3. 自适应 5D 神经 LUT 空间调制:保纹理与平滑渐变的高效前向映射

传统全局3D LUT无法建模暗角、渐变等摄影常见的位置相关效果,而高维卷积网络又极易引发色彩斑块和几何走样。PETAL提出以像素颜色(Lab通道)和归一化空间物理坐标(xy坐标)构成的5D神经查找表。该神经LUT由 \(1 \times 1\) 卷积构成的浅层编码器 \(\mathcal{E}\) 和解码器 \(\mathcal{D}\) 组成,保证各像素计算严格局域化,杜绝跨像素空间混合导致的纹理模糊。

在特征空间中,利用两个轻量级MLP预测参考风格 \(M(I_s)\) 与内容风格 \(M(I_c)\) 之间的均值与方差差值,对内容特征执行AdaIN式重归一化:

\[ \hat{I} = \mathcal{D}\left( \tilde{\mu} + \frac{x_c - \mu(x_c)}{\sigma(x_c) + \epsilon} \odot \tilde{\sigma} \right) \]

其中 \(\tilde{\mu} = \mu(x_c) + g_\mu(M(I_s)) - g_\mu(M(I_c))\)\(\tilde{\sigma} = \sigma(x_c) + g_\sigma(M(I_s)) - g_\sigma(M(I_c))\)。当参考图与内容图风格趋同或相同时,差值自动归零,模型退化为恒等变换,极大提升了连续调色与多次连续编辑的数值稳定性。

损失函数 / 训练策略

整个系统采用两阶段训练。 第一阶段预训练摄影风格嵌入网络 \(\mathcal{M}\),损失函数定义为:

\[ \mathcal{L}_{\mathcal{M}} = \mathcal{L}_- + 0.5 \cdot \mathcal{L}_{\text{rec}} + 0.1 \cdot \mathcal{L}_+ \]

其中 \(\mathcal{L}_-\) 采用SimSiam式的stop-gradient机制对齐正样本中心,\(\mathcal{L}_+\) 采用二值交叉熵拉开相反增强样本对,\(\mathcal{L}_{\text{rec}}\) 为重构亮度和色度直方图的Hellinger距离。 第二阶段冻结网络 \(\mathcal{M}\),端到端训练神经LUT参数。通过PSA生成内容-目标风格配对数据,综合监督像素级均方误差(MSE)、LPIPS感知损失、基于预训练嵌入余弦相似度的风格损失 \(1 - \langle M(\hat{I}), M(I_s) \rangle\) 以及恒等映射损失 \(\| \mathcal{D}(\mathcal{E}(I_c)) - I_c \|_2^2\)

实验关键数据

主实验

论文在风格检索(PPR10K subset、FiveK-Concept、InsRank)和摄影风格迁移(PPR10K subset、PST50)基准上进行了系统测试。

在摄影风格检索任务中,PETAL的嵌入显著超越现有通用多模态特征(如CLIP、SigLIP-2、DINOv3)以及传统艺术风格表征(如CSD、Gram、ColorD):

模型类别 检索方法 PPR10K R@1 (%) PPR10K mAP (%) FiveK R@1 (%) FiveK mAP (%) InsRank R@1 (%) InsRank \(\rho\)
通用表征 CLIP 0.08 31.62 0.89 9.72 34.38 15.32
通用表征 DINOv3 1.48 30.81 0.02 8.42 43.75 25.31
艺术/颜色表征 CSD 6.77 38.44 8.35 17.85 37.50 40.94
艺术/颜色表征 ColorD 65.80 64.15 45.45 41.25 46.88 13.44
同目标微调 DINOv3* 59.30 61.78 34.72 36.61 34.38 15.31
本文方法 PETAL (Ours) 74.27 71.99 52.94 51.84 62.50 52.19

在摄影风格迁移定量对比中,PETAL在保真度和结构保持指标上全面领先,同时处理 \(1080 \times 1920\) 高清图像仅需 0.23 秒:

方法 推理耗时 (s) PPR10K LPIPS↓ PPR10K PSNR↑ PPR10K SSIM↑ PST50 LPIPS↓ PST50 PSNR↑ PST50 SSIM↑
SALUT 0.3117 0.2464 16.47 0.6307 0.1557 21.93 0.8733
Modflow 0.3680 0.2160 19.64 0.7914 0.1707 20.01 0.8599
Deep Preset 0.0329 0.1717 20.88 0.8137 0.1365 23.40 0.8895
Neural Preset N/A 0.1377 19.12 0.8048 0.1210 22.61 0.8975
Pixelmator Pro N/A 0.1207 19.43 0.8825 0.1526 21.60 0.8684
PETAL (Ours) 0.2306 0.1027 21.80 0.8710 0.1021 24.63 0.9272

消融实验

论文在表格3中系统分析了色彩空间选择、各网络模块与自监督损失项的贡献:

消融配置 PPR10K R@1 (%) PPR10K mAP (%) FiveK R@1 (%) PST50 LPIPS↓ PST50 PSNR↑ PST50 SSIM↑
RGB 色彩空间替代 Lab 70.34 69.16 51.21 0.1068 22.22 0.9120
去除直方图交叉注意力 68.93 66.44 50.29 0.1120 22.24 0.9005
仅保留 [CLS] 标记 73.74 70.01 49.17 0.1131 23.11 0.9086
[CLS] + 均值池化替代自适应池化 68.91 66.53 50.48 0.1149 22.49 0.9001
去除直方图重构损失 \(\mathcal{L}_{\text{rec}}\) 66.98 66.06 45.86 0.1354 21.69 0.8967
去除正样本聚集损失 \(\mathcal{L}_-\) 36.09 45.42 18.64 0.1249 23.47 0.9063
去除硬负例排斥损失 \(\mathcal{L}_+\) 67.53 65.03 51.79 0.1071 22.41 0.9045
完整模型 (Complete) 74.27 71.99 52.94 0.1021 24.63 0.9272

关键发现

  • 样本内损失是收敛根基:去掉样本内对齐损失 \(\mathcal{L}_-\) 导致PPR10K的R@1直接从 74.27% 暴跌至 36.09%,证明使同图像局域裁剪对齐是建立稳定特征空间的前提。
  • 反向硬负例有效防止语义退化:去除PSA构建的反向硬负例损失 \(\mathcal{L}_+\) 后,R@1与mAP显著下滑,表明对比相同内容、相反色彩的样本成功阻断了模型偷懒走语义匹配的捷径。
  • 直方图信息是ViT的有效互补:移去直方图编码与交叉注意力会使得迁移结果的直方图相关性(H-Corr)从 0.5220 跌至 0.4436,表明纯Transformer架构在捕获全图连续色彩概率分布上存在天然盲区,显式直方图注入必不可少。

亮点与洞察

  • 将摄影调色定义为连续特征空间:摒弃粗糙的语言提示或离散类别标签,用自监督对抗抖动将连续光影调校引入对比学习框架,填补了计算机视觉在专业摄影嵌入上的表征空白。
  • 差值驱动的5D神经LUT:通过 \(M(I_s) - M(I_c)\) 动态调制AdaIN均值与方差,既保证了恒等变换(相同风格不串色)的严格数学性质,又赋予了 \(1 \times 1\) 卷积极轻量的计算开销与无伪影的纹理保持能力。
  • 多轮编辑与风格线性插值特性良好:由于表征空间光滑且神经LUT具备自洽性,对两个参考风格的嵌入做线性插值可以直接生成平滑过渡的混合影调,且连续多次迁移不会破坏图像基底细节。

局限与展望

  • 缺少局部人脸与语义级针对性修饰:当前模型侧重全图及平滑渐变式影调迁移,尚不能针对人脸肤色、特定主体(如眼眸、唇色)进行局部特异性白平衡与磨皮处理,在极端人像修图场景下可能不够细致。
  • 未能覆盖非色彩类的艺术颗粒质感:摄影风格有时包含胶片噪点、高光光晕(Halation)或颗粒感等物理质感,当前的5D LUT结构只改变像素色彩坐标,无法无中生有合成高频纹理特效。
  • 未来方向:可进一步结合轻量人脸解析先验进行多区域语义调色,或引入参数化胶片颗粒生成器以扩展到全流程胶片模拟。

相关工作与启发

  • vs Neural Preset / Deep Preset: 后者依赖离散预设参数拟合或简单的颜色判别器,遇到黑白高反差或冷暖对撞风格极易欠迁移;PETAL通过专用的自监督摄影嵌入实现了更宽广风格域的精准捕获。
  • vs SA-LUT: SA-LUT引入空间自适应4D LUT但在特征提取上依赖普通CNN,导致复杂影调下对比度失真;PETAL利用Lab直方图交叉注意力的ViT表征与5D坐标映射,消除了光影失真。
  • vs 扩散模型类调色 (如DiffRetouch): 扩散模型虽然理解力强但耗时达数秒且易篡改原有像素纹理;PETAL基于 \(1 \times 1\) 神经LUT只需 0.23 秒,完全无视分辨率限制且保真度极高。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次提出面向摄影风格的自监督反向增强对比学习与5D自适应神经LUT联合架构。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖三套风格检索基准、两套风格迁移评测、消融实验、用户主观调研及t-SNE可视化。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑缜密,问题定义清晰,数学推导与实验论证严谨自洽。
  • 价值: ⭐⭐⭐⭐⭐ 为手机相册一键修图、专业后期风格模仿提供了极具工业落地价值的高效轻量解决方案。