Through Van Gogh’s Eyes: Global Style Transfer with Diffusion Model¶
会议: ECCV 2026
论文: ECCV 2026 Poster
领域: 图像生成
关键词: 全局风格迁移、扩散模型、h空间引导、内容对齐引导、艺术图像生成
一句话总结¶
提出全局风格迁移(GST)新范式,通过在扩散模型瓶颈层 h-space 训练轻量残差风格提取函数消除文本偏置,并结合无需训练的 CLIP 语义级内容对齐引导(CAG),实现从艺术家完整作品集学习全局风格分布并迁移至内容图像。
研究背景与动机¶
艺术图像合成的核心目标在于重现目标艺术家的视觉表现风格与独特审美视角。长期以来,这一领域主要存在两大范式:传统神经风格迁移(NST)与基于文本提示词(如 "in the style of Van Gogh")的文生图(T2I)扩散模型。然而,传统风格迁移依赖单幅或极少数参考作品将风格迁移至内容图,本质上是“一对一”(One-to-One)映射,极易陷入单幅作品的局部颜色与笔触过拟合,完全无法刻画艺术家在数百上千幅画作中形成的整体风格分布。而直接在文生图扩散模型中使用艺术家姓名作为条件虽然具有生成灵活性,却面临严重的文本诱导偏置(text-dependent bias),往往模式坍缩至《星月夜》等极少数标志性名作的旋涡与厚重笔触中,严重削弱了艺术风格的真实多样性。
这种两难局面的核心矛盾在于:刻画艺术家真正的视觉风格需要从其整个画作全集中聚合高阶分布,但现有注入机制要么在像素/特征统计上被单图绑定,要么在跨模态文本对齐中被提示词先验绑架。要跳出这一瓶颈,就必须摆脱以单图为参考或以文本为桥梁的传统路径,探索一种直接从海量视觉画作中汲取统计共性、同时对内容图像提供可控几何形变的新机制。
本文的核心思路是重新定义艺术图像合成为“多对一”(Many-to-One)的全局风格迁移(GST)范式。核心 idea:在扩散模型 U-Net 瓶颈层的语义 h-space 中以恒定无方差的通用文本提示训练轻量风格提取函数,学习纯粹源自视觉统计的艺术家全局残差偏置,并结合基于 Tweedie 预估与深层 CLIP 感知特征的免训练内容对齐引导,在实现艺术家级全局风格分布迁移的同时保留内容语义与结构。
方法详解¶
整体框架¶
全局风格迁移(GST)以单张内容图像 \(I_c\) 与目标艺术家的 \(K\) 幅画作全集 \(I_s = \{i_s^1, i_s^2, \dots, i_s^K\}\) 为输入。整个流水线包含两个协同的核心组件:离线阶段的全局风格引导(GSG)与采样阶段的内容对齐引导(CAG)。在离线训练阶段,全局风格引导在固定的极简提示词("A painting")约束下,通过噪声重构任务训练轻量级风格提取函数(SEF)\(f_t\),使其在扩散模型 U-Net 瓶颈层的 \(h\)-space 中捕捉艺术家作品集的全局风格残差偏移量 \(\Delta \mathbf{h}_t\)。在推理采样阶段,内容图像 \(I_c\) 首先通过 DDIM Inversion 映射为噪声潜变量 \(z_T\);在随后的逆向去噪过程中,模型通过非对称反向过程将 \(\Delta \mathbf{h}_t\) 注入瓶颈层以驱动全局风格化,同时利用基于 Tweedie's 公式的一步清洁潜变量逼近与 CLIP 深层特征梯度实施内容对齐引导,兼顾内容大局结构保持与艺术风格化形变。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入:画作全集 Is 与内容图 Ic"] --> B["阶段1:全局风格引导 (GSG)<br/>固定提示词下在 h-space 训练轻量 SEF ft"]
B --> C["阶段2:DDIM 反演与非对称采样<br/>内容图反演至 zT,注入全局残差偏置 Δht"]
C --> D["阶段3:内容对齐引导 (CAG)<br/>Tweedie 逼近结合深层 CLIP 梯度修正潜变量"]
D --> E["输出:艺术家级全局风格化图像 x0"]
关键设计¶
1. 全局风格引导:在 h 空间中学习无文本偏置的艺术家级残差分布 为了摆脱文本提示词对扩散先验的强偏置,并避免对单幅参考画作过拟合,模型选择在 U-Net 瓶颈层的激活特征空间(即 \(h\)-space)建模风格。经验证,即使在不同扩散时间步 \(t\) 加入高斯噪声腐蚀,\(h\)-space 的特征向量在 t-SNE 降维投影中依然能为不同艺术家保持高度清晰的聚类边界,证实其承载了稳定的高阶艺术风格语义。为此,定义轻量级风格提取函数(SEF)\(f_t(h_t; \theta)\),它是一个单隐藏层 MLP,采用零初始化(Zero-initialization)策略以防止初始随机扰动。在训练时,艺术家的所有画作样本均强制绑定相同的极简固定提示词 \(y = \text{“A painting”}\),使文本条件的方差降为零,迫使 \(f_t\) 完全基于视觉重构损失学习艺术家全集的视觉统计共性: $\(\mathcal{L}_{\text{SEF}} := \mathbb{E}_{z \sim \mathcal{E}(x), \epsilon_t, t} \left\lVert \epsilon_\theta(z_t, t, \tau_\phi(y) \mid \Delta \mathbf{h}_t) - \epsilon_t \right\rVert_2^2\)$ 其中 \(\Delta \mathbf{h}_t = f_t(h_t; \theta)\)。在反向扩散采样时,通过非对称逆向公式仅将残差加到预测干净图像的项 \(P_t(\epsilon_\theta(z_t \mid \Delta \mathbf{h}_t))\) 中,而保持去噪方向项 \(D_t(\epsilon_\theta(z_t))\) 不变,实现了纯视觉驱动且保留生成保真度的全局风格注入。
2. 内容对齐引导:深层感知驱动的免训练结构保持与艺术形变 传统风格迁移容易僵硬地冻结低级轮廓或由于强制像素对齐而破坏艺术变形。真实画家的创作过程往往保留场景的高层抽象语义结构,同时允许笔触与形体产生符合个人特质的几何扭曲。受随机微分方程(SDE)条件采样与 Tweedie's 公式启发,本文设计了免训练的感知引导机制。在逆向扩散的每一时间步 \(t\),首先利用 Tweedie's 公式由当前带噪潜变量 \(z_t\) 逼近干净潜变量 \(\tilde{z}_0\),并通过解码器得到粗略重构图像 \(\tilde{x}_0 \approx \mathcal{D}(\tilde{z}_0 \mid z_t)\)。随后计算解码图像 \(\tilde{x}_0\) 与当前步解码图像 \(x_t = \mathcal{D}(z_t)\) 在预训练 CLIP 图像编码器深层(第 11 层)特征之间的感知距离: $\(\ell(z_t) = \left\lVert \mathcal{E}_{\text{CLIP}}^l(\tilde{x}_0) - \mathcal{E}_{\text{CLIP}}^l(x_t) \right\rVert_2\)$ 将此感知距离的梯度作为外部引导项直接修正潜变量轨迹:\(\tilde{z}_t = z_t - s \nabla_{z_t} \ell(z_t)\)(其中 \(s\) 为引导强度参数)。由于选用 CLIP 较深网络层提取高阶全局语义与构图空间,模型既规避了底层特征对边缘/颜色的机械约束,又为画布提供了合理的艺术性几何形变自由度。
损失函数 / 训练策略¶
风格提取函数 \(f_t\) 参数极少,直接在扩散骨干冻结的情况下采用 Adam 优化器训练。训练过程中,从艺术家画作集合中随机采样画作 \(I_s^k\),经前向扩散加噪后在固定 prompt 下进行噪声残差拟合。实验表明,训练轮次对捕捉笔触质感至关重要:在 10-20 epoch 时模型生成风格趋同,而在 200 epoch 左右能够充分学得各艺术家独特的调色板、质感细节与笔触走势。在采样阶段,配合标准 Classifier-Free Guidance(CFG)以及 DDIM 反演,无需对内容图像微调任何参数即可完成高保真端到端风格迁移。
实验关键数据¶
主实验¶
评估在 WikiArt(艺术画作全集)与 VanGogh2Photo(真实摄影内容图像)基准上展开,采用评估风格与内容保真度的 ArtFID、综合生成质量 FID、内容结构保持指标 CFSD,以及衡量风格多样性与防模式坍缩的 CLIP-Div 和 1-Precision(1-Prec.)。定量对比涵盖基线文生图 Stable Diffusion(S.D)、Textual Inversion、Custom Diffusion 以及 LoRA 微调。
| 艺术家 | 方法 | FID (↓) | ArtFID (↓) | CFSD (↓) | CLIP-Div (↑) (Ours/Real) | 1-Prec (↑) |
|---|---|---|---|---|---|---|
| Van Gogh | S.D | 11.97 | 23.78 | 0.7428 | 0.178 | 0.257 |
| Textual Inversion | 7.67 | 13.68 | 0.1674 | 0.220 | 0.550 | |
| Custom Diffusion | 9.49 | 14.71 | 0.1208 | 0.289 | 0.933 | |
| LoRA based Fine-tuning | 11.01 | 21.38 | 0.1886 | 0.261 | 0.913 | |
| Ours (GST) | 9.46 | 19.25 | 0.2896 | 0.297 / 0.335 | 0.988 | |
| Chagall | S.D | 16.26 | 32.44 | 0.3117 | 0.224 | 0.844 |
| Textual Inversion | 11.72 | 21.15 | 0.1683 | 0.238 | 0.877 | |
| Custom Diffusion | 18.06 | 26.70 | 0.1108 | 0.289 | 0.962 | |
| LoRA based Fine-tuning | 17.30 | 32.59 | 0.1674 | 0.266 | 0.928 | |
| Ours (GST) | 13.25 | 26.39 | 0.2626 | 0.311 / 0.293 | 0.977 | |
| Renoir | S.D | 16.72 | 33.70 | 0.1584 | 0.225 | 0.987 |
| Textual Inversion | 12.14 | 21.99 | 0.1100 | 0.238 | 0.895 | |
| Custom Diffusion | 15.15 | 22.77 | 0.1160 | 0.294 | 0.987 | |
| LoRA based Fine-tuning | 15.36 | 29.23 | 0.1749 | 0.279 | 0.988 | |
| Ours (GST) | 12.27 | 24.70 | 0.1566 | 0.318 / 0.313 | 0.999 |
消融实验¶
消融实验重点验证内容对齐引导(CAG)对内容保持与保真度的核心作用,以及 CAG 中 CLIP 引导层级选取对生成质量的影响。
| 配置 / 变体 | FID (↓) | ArtFID (↓) | 说明 |
|---|---|---|---|
| Ours w/o CAG | 11.05 | 22.45 | 移除 CAG 引导,结构崩溃严重,ArtFID 显著恶化 (+3.20) |
| Ours (Full Model, Layer 11) | 9.46 | 19.25 | 完整模型:高层语义引导兼顾艺术变形与宏观内容结构 |
| CLIP 引导层级消融 (定性) | |||
| - 低/中层 (Layer 1~9) | - | - | 约束过于局限在底层颜色与纹理边缘,产生房状伪影或失真 |
| - 高层 (Layer 11) | - | - | 提取抽象高层语义,原图场景拓扑保持最稳定且自然契合风格 |
关键发现¶
- 风格多样性高度契合真实艺术分布:在所有三位代表性艺术家的评测中,GST 的 CLIP-Div 得分(如梵高 0.297 vs 真实作品集 0.335、夏加尔 0.311 vs 真实 0.293、雷诺阿 0.318 vs 真实 0.313)均大幅超越传统微调方法,说明该方法摆脱了单一画作过拟合,真正重构了画家的全局色彩与笔触分布。
- 卓越的防记忆坍缩能力:GST 在衡量防记忆能力的 1-Precision 上全面达到顶峰(雷诺阿达 0.999,梵高达 0.988),远超 Textual Inversion 与基线 SD,表明生成图像不是机械拼贴已有画作样本,而是根据全局分布进行的全新创作。
- CAG 与 CLIP 层级的关键解耦:移除 CAG 会使 ArtFID 从 19.25 急剧恶化到 22.45;且只有在深层(Layer 11)施加感知约束,才能解耦局部笔触变形与全局内容拓扑,低层约束反而会阻碍艺术家的笔触重构并引入结构噪点。
亮点与洞察¶
- 多对一范式革新:摆脱了传统风格迁移将“单幅画作”等同于“风格”的狭隘设定,建立从整部艺术全集学习风格分布的 Many-to-One 机制,消除了风格化过程中的实例级偏置。
- 无文本方差的 h-space 纯视觉引导:通过将所有样本绑定到相同的恒定通用提示词(
"A painting"),巧妙利用残差 offset 在高层潜在语义空间建模风格,以零文本方差彻底剥离了文生图模型的文本诱导偏置与刻板印象。 - 免训练感知梯度回传:借助 Tweedie's 公式将隐式去噪轨迹与 CLIP 深层语义特征梯度直接连接,既免除了针对每张内容图微调的计算开销,又优雅实现了“大体神似而笔意形变”的高阶艺术自由度。
局限与展望¶
- 计算与画作规模依赖:学习具有代表性的全局风格特征需要目标艺术家具备数十至数百幅数字化作品库,对于留存作品极少(如仅存数幅画作)的艺术家难以充分拟合稳定的全局流形。
- 不同艺术时期风格漂移未细分:许多著名画家一生中经历了鲜明的风格转变(如毕加索的蓝色时期与立体主义时期),当前框架直接在艺术家名下混合全部作品学习单一分布,未来可引入时间轴或流派子空间聚类。
- 超参权衡敏感度:风格引导权重 \(w\) 与内容对齐强度 \(s\) 仍需人工平衡,针对构图极其复杂的高动态真实照片时仍偶有风格侵蚀内容边界的现象。
相关工作与启发¶
- vs 传统神经风格迁移 (如 StyleInjection, StyTR2, CSGO):传统方法依赖单张风格参考图,将多图结果平均会造成灾难性的模糊与不协调;GST 则是分布级建模,生成兼具全局调色板、笔触和特征形变的高阶艺术作。
- vs 个性化生成方法 (Textual Inversion, Custom Diffusion, DreamBooth):个性化方法容易将风格与特定主题概念强绑定或过拟合标志性名作;GST 通过零方差文本条件与轻量瓶颈残差网络,完全基于视觉统计建模,多样性指标与真实作品集完美重合。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次提出 Many-to-One 全局风格迁移范式,彻底摆脱单图过拟合与文本偏置。
- 实验充分度: ⭐⭐⭐⭐⭐ 指标全面覆盖保真度、多样性与防记忆度,消融对比深入透彻。
- 写作质量: ⭐⭐⭐⭐⭐ 概念清晰,形式化表述与算法流程图逻辑严密。
- 价值: ⭐⭐⭐⭐⭐ 为艺术计算、数字人文遗产数字化与风格化扩散模型提供了极具启发性的技术路线。