跳转至

High-Resolution Artwork Outpainting with Global Blueprint Guidance and Layout Control

会议: ECCV 2026
论文: ECCV 2026
代码: https://github.com/poohoh/BlueOut
领域: 图像生成
关键词: 图像外延 / 艺术画作 / 布局控制 / 蓝图引导 / 扩散模型

一句话总结

提出两阶段艺术画作高分辨率外延框架 BlueOut,先生成低分辨率全局蓝图并显式注入边界框布局条件,再基于前向扩散低频保留性质初始化多块噪声并注入全局引导特征,实现高质量、强布局可控且可跨 GPU 并行的高分辨率画面拓展。

研究背景与动机

图像外延(Image Outpainting)旨在将图像边界向外延展,生成与原画在风格、色调及语境上无缝衔接的完整场景。在沉浸式投影、数字展览与虚拟现实等艺术画作重现任务中,需要将经典名画适配至超宽画布或全新画幅比例,同时必须严格维持原作构图平衡与精湛笔触。与传统图像修复(Inpainting)周围均存在已知像素约束不同,外延在无边界的外围区域进行内容合成,面临极高的不确定性与更强的全局语义一致性挑战。

现有主流基于扩散模型的高分辨率外延方案主要依赖滑动窗口的渐进式扩展(Progressive Outpainting,如 ProOut)。然而这类范式存在三大内在瓶颈:第一,缺乏先验的全局规划机制,渐进式生成仅能依赖局部拼接与中间画布条件,导致早期生成的瑕疵在后续步骤中不断累积(Error Accumulation),引发严重的结构失真与全局构图失衡;第二,缺乏细粒度空间布局控制能力,仅靠文本提示词无法精准指定外延区域内特定物体(如人像、花饰、皇冠)的具体位置与尺度大小;第三,时序串行生成引入了极高的推理延迟,局部窗口必须逐个按顺序去噪,无法发挥现代多 GPU 硬件的并行吞吐优势。

本文的切入视角在于:高分辨率外延的核心并非无序的局部像素延展,而是需要「全局蓝图指导局部细节」。通过将任务解耦为宏观全局规划与微观局部合成两个阶段,全局蓝图不仅提供稳定的语义骨架,还能通过前向扩散的低频保留特性直接赋予并行局部块一致的初始几何结构。核心 idea:构建全局蓝图引导的两阶段外延框架,Stage 1 利用布局适配器在全局低分辨率视角下规划场景宏观结构与实例边界框,Stage 2 借助前向扩散低频保留特性初始化局部噪声,并在全局特征与空间位置编码协同引导下实现跨 GPU 的高效并行局部高分辨率合成。

方法详解

整体框架

BlueOut 整体架构解耦为两个阶段:第一阶段负责全局结构规划与实例布局注入,第二阶段负责高分辨率局部块的并行精细去噪合成。

在 Stage 1 中,系统输入待延展的原图及其外围掩码,用户可指定一组边界框与语义文本作为局部实例控制。网络在优化初始噪声后,通过布局适配器(Layout Adapter)与门控融合器(Gated Fuser)将实例 token 注入 9 通道 SD Inpainting U-Net,生成整幅画面的低分辨率全局蓝图 \(\hat{x}^g\),同时在去噪的每个时间步抽取并缓存门控融合器的特征,构成全局引导特征库 \(\mathcal{F}\)。

在 Stage 2 中,完整高分辨率画布被划分为环绕原图的 8 个带重叠边界的局部区域(四正方向与四角)。系统先将 Stage 1 蓝图上采样并切分为局部块,基于全局统一采样的噪声图进行前向扩散加噪,为每个局部块构建兼具全局低频结构与无缝重叠边界的初始噪声。随后,各个局部块被分发至不同 GPU 独立去噪,去噪过程中各块通过门控融合器同步接收来自 Stage 1 对应时间步的全局引导特征 \(\mathcal{F}\) 与自身全局坐标位置 token \(p_i\)。在每个去噪步内,对重叠边缘进行隐空间加权平均平滑,去噪完成后按预定义优先级拼接,并将未经修改的原始图像回贴至中央区域。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    In["源图像 + 外展掩码 + 用户布局边界框"] --> S1["全局蓝图生成与实例级布局注入<br/>AAM 优化噪声 + Layout Adapter 注入实例 token"]
    S1 --> Blueprint["低分辨率全局蓝图 ˆx_g + 引导特征库 F"]
    Blueprint --> InitNoise["结构对齐初始噪声构建<br/>蓝图上采样切块 + 前向扩散低频保留 + 全局共享噪声"]
    InitNoise --> S2["空间感知并行局部块补全<br/>注入全局特征 F 与位置 token p_i,多 GPU 并行去噪"]
    S2 --> Blend["隐空间重叠均值融合 + 像素级拼接回贴原图"]
    Blend --> Out["高分辨率无缝艺术画作外延结果"]

关键设计

1. 全局蓝图生成与实例级布局注入:解耦全局规划与局部生成 传统渐进式外延缺乏宏观视野,极易产生构图偏移与漂移失真。Stage 1 采用预训练冻结的 SD Inpainting U-Net 骨干,输入包括掩码图像 \(\tilde{x}^g\) 与全局掩码 \(m^g\)。在去噪前,模型先采用注意力对齐度量(Attention Alignment Measure, AAM)对初始高斯噪声 \(z_T^g\) 进行优化,强制外延区域的空间 token 在初始去噪步充分关注源图像区域,避免生成与原图语义断裂的无关内容。为了赋予用户精准的空间控制权,模型引入了基于 Fourier 频域映射的 Layout Adapter,将第 \(k\) 个实例的边界框 \(b_k\) 坐标与经 CLIP 编码的物体文本嵌入 \(e_k = \mathcal{T}(d_k)\) 拼接映射为实例条件 token \(c_k = \text{MLP}([\gamma(b_k); e_k])\),汇聚为条件矩阵 \(C\)。随后,在 U-Net 各 Transformer 块插入零初始化的门控融合器(Gated Fuser),通过交叉注意力机制动态将 \(C\) 注入图像特征 \(H_t^g\): $\(F_t^g = H_t^g + \alpha_g \cdot \text{Attn}\Big(Q(H_t^g), K([H_t^g; C]), V([H_t^g; C])\Big)\)$ 其中 \(\alpha_g\) 为可学习门控参数。去噪过程中各步的特征 \(F_t^g\) 被实时存入全局特征库 \(\mathcal{F} = \{F_t^g\}_{t=1}^T\),去噪终止后由 VAE 解码得到全局蓝图 \(\hat{x}^g = \mathcal{D}(z_0^g)\)。

2. 基于前向扩散低频保留的结构对齐初始噪声构建:打通宏观蓝图与微观初始状态 以往级联模型通常需要额外的超分辨率网络逐像素升采样,不仅计算沉重,且难以利用扩散模型自身的高清补全能力;而直接随机初始化多局部块噪声则会导致各块语义完全脱钩。本文洞察到扩散模型前向加噪过程中的「低频保留特性(Low-Frequency Preservation)」——在常规噪声调度下,即便加噪至终点时刻 \(T\),高频纹理虽已彻底破坏,但图像的大尺度低频宏观结构与轮廓依然存留。系统将 Stage 1 蓝图 \(\hat{x}^g\) 升采样至目标画布分辨率后切分为 8 个局部 patch,分别编码为隐变量 \(z_{\text{bp}}^{(i)} = \mathcal{E}(\text{Crop}_i(\text{Up}(\hat{x}^g)))\)。随后,在全画布全局隐空间采样单一全局高斯噪声 \(\epsilon^{\text{full}} \sim \mathcal{N}(0, I)\),并通过前向扩散公式构造第 \(i\) 个块的初始噪声: $\(z_{T, \text{init}}^{(i)} = \sqrt{\bar{\alpha}_T} z_{\text{bp}}^{(i)} + \sqrt{1 - \bar{\alpha}_T} \text{Crop}_i(\epsilon^{\text{full}})\)$ 由于各局部块共享同一张大尺度噪声图的对应截块,相邻 patch 在重叠区域的随机扰动完全一致;同时低频分量确保了所有并行局部块在去噪伊始便共享全局蓝图规划的几何骨架。

3. 全局特征协同与空间感知并行的局部块补全:消除时序依赖的高速合成 为了彻底解决滑动窗口的串行延迟瓶颈,Stage 2 将 8 个局部块完全分配至各计算单元并行去噪。然而,单纯依赖初始噪声仍无法杜绝多块在深度去噪阶段发生内容漂移。为此,Stage 2 设计了轻量级的空间位置编码与全局特征联合注入机制。对于第 \(i\) 个局部块,位置网络将该 patch 在全画布中的坐标框 \(b_i^p\) 与可学习的空 token \(n_\emptyset\) 映射为全局位置 token \(p_i = \text{MLP}([\gamma(b_i^p); n_\emptyset])\)。在 Stage 2 U-Net 的门控融合层中,当前块特征 \(H_t^{(i)}\) 同时与来自 Stage 1 对应步的全局引导特征 \(F_t^g\) 以及位置编码 \(p_i\) 进行交叉注意力融合: $\(\tilde{H}_t^{(i)} = H_t^{(i)} + \alpha_p \cdot \text{Attn}\Big(Q(H_t^{(i)}), K([H_t^{(i)}; F_t^g; p_i]), V([H_t^{(i)}; F_t^g; p_i])\Big)\)$ 位置 token \(p_i\) 明确告知网络当前块处于画布的具体相对朝向,而 \(F_t^g\) 注入全局语境,从而在多 GPU 独立去噪的同时实现多块语义高度协同。在去噪的每一步中,重叠区域的目标像素通过隐空间均值融合(Overlap Blending)保持平滑过渡,并在最终解码后采用 First-Win 策略拼接并回贴原始输入图。

损失函数 / 训练策略

Stage 1 与 Stage 2 均采用两阶段解耦优化方案,基础 SD Inpainting U-Net 权重全部冻结,仅微调额外引入的轻量级适配与融合模块。两阶段均采用标准的噪声预测均方误差(MSE)损失进行监督: $\(\mathcal{L}_{\text{S1}} = \mathbb{E}_{z_0^g, \epsilon, t} \left[ \left\| \epsilon - \epsilon_{\theta_1}(z_t^g, t; \tilde{x}^g, m^g, \mathcal{B}, c_G) \right\|_2^2 \right]\)$ $\(\mathcal{L}_{\text{S2}} = \mathbb{E}_{i, z_0^{(i)}, \epsilon, t} \left[ \left\| \epsilon - \epsilon_{\theta_2}(z_t^{(i)}, t; \tilde{x}^{(i)}, m^{(i)}, F_t^g, p_i, c_L) \right\|_2^2 \right]\)$ 在训练 Stage 2 时,Stage 1 模型保持冻结仅作为特征抽取器。模型在 HumanArt、WikiArt 与 LAION-5B 高分辨率艺术画子集上训练,使用 AdamW 优化器(学习率 \(5 \times 10^{-5}\),批大小 512),推理时采用 DDIM 采样(30 步,无分类器引导缩放 CFG=3.0)。

实验关键数据

主实验

在 IconArt 评估集上,采用默认遮罩比例 \(\rho = 0.333\)(生成区域为原图尺寸的约 225%),对比了当前代表性外延方法在图像质量、布局准确度及推理速度上的表现。

方法 FID ↓ pFID256 ↓ pFID512 ↓ CLIP-S ↑ CLIP-A ↑ AP ↑ IoU ↑ 推理耗时 (s) ↓
真实参考 (GT) – – – – – 0.5903 0.7716 –
PQDiff (copy) 25.3032 41.1501 31.8283 0.2031 5.0144 0.2903 0.4304 –
SD Inpainting 10.7598 9.5336 7.6219 0.2007 6.7041 0.3526 0.5539 13.43
PowerPaint 10.5374 9.4403 7.4834 0.2003 6.4423 0.3537 0.5503 13.99
ProOut 10.3032 9.2854 7.2515 0.2052 6.8585 0.3595 0.5623 18.31
BlueOut (Ours) 9.3064 9.0635 6.7514 0.2033 6.7949 0.4336 0.6382 7.50
BlueOut (Ours*) 9.0729 9.0577 6.6609 0.2055 6.8766 0.4363 0.6361 7.50

注:Ours* 表示在 Stage 1 交叉注意力层之后抽取全局引导特征,使得注入 Stage 2 的特征更强地融合文本提示条件。推理耗时为 8-GPU 并行环境下的单图生成均值(100 样本测试)。

消融实验

消融实验验证了将全局蓝图有效传递并约束 Stage 2 并行去噪的各关键组件贡献(包括引导特征、块位置 token 和前向扩散初始化):

配置 FID ↓ pFID256 ↓ pFID512 ↓ CLIP-S ↑ CLIP-A ↑ 说明
SD Inpainting (纯并行) 37.2675 17.6093 20.3705 0.1932 5.8696 仅用隐空间重叠均值融合,无全局蓝图约束
移除全局引导特征 (w/o Guidance) 22.2319 12.6436 11.7879 0.1940 5.8561 缺失蓝图语义 context,各块细节严重失谐
移除块位置 token (w/o Patch Token) 17.9578 10.7008 8.7402 0.1990 6.2209 局部块缺乏全图绝对坐标,布局产生空间漂移
移除前向扩散初始化 (w/o Forward Diff) 9.6048 9.1144 6.9442 0.2020 6.7598 纯高斯噪声启动,依靠跨注意力引导但收敛稍劣
完整模型 (Full Model) 9.3064 9.0635 6.7514 0.2033 6.7949 三位一体,实现全局结构统一与局部高精细度

关键发现

  • 去噪特征与位置编码是并行合成的决定性支柱:消融数据显示,如果仅依靠 MultiDiffusion 式的边缘平滑(SD Inpainting 并行版),FID 高达 37.27;去掉全局特征引导后 FID 急剧恶化(从 9.31 恶化至 22.23),说明局部块之间必须依赖蓝图多层次语义特征的统领,无法仅通过相邻交界的像素平滑来建立全局连贯性。
  • 高外延倍率下的极强鲁棒性:在 Cleveland Museum of Art 与 Art Institute of Chicago 收集的风景画集测试中,当外延比例从 200% 增加至 600% 时,ProOut 的 FID 从 56.22 恶化至 89.84,而 BlueOut 的 FID 仅从 44.87 上升至 81.86,始终维持最领先的生成品质,证明先定宏观骨架能有效免疫极深扩展带来的误差爆炸。
  • 并行吞吐实现 2.4 倍推理加速:在 8 卡 GPU 环境下,并行合成使得单图生成耗时由 ProOut 的 18.31s 缩短至 7.50s(加速 2.44×);即便是单卡匹配设置下(15.73s),也优于串行滑窗的 ProOut(18.31s)。

亮点与洞察

  • 扩散前向过程低频保留特性的巧妙重用:以往图像生成常将初始时刻 \(t=T\) 简单假设为各向同性白噪声,本文敏锐地将 FreeInit 揭示的加噪衰减差异引入外延初始化,无需额外训练级联超分网络,用最优雅的加噪公式赋予了所有并行去噪进程统一的几何初值。
  • 显式空间布局注入填补艺术画作交互空白:以往外延仅能依赖粗粒度的文本指令进行无差别扩展,无法应对策展人对特定元素摆放的定制需求;本文将 InstanceDiffusion 的边界框机制引入全局蓝图生成,实现高精度的对象定位(AP 达 0.4363,大幅超越基线的 0.3595)。
  • 解耦「规划」与「渲染」的高分辨率范式:将昂贵的高分辨率像素生成与宏观语义规划在空间与流程上解耦,既杜绝了渐进式滑窗拼接的时序误差累积,又天然契合多卡分布式集群,为超高分辨率画作扩展提供了极具工程价值的通用范式。

局限与展望

  • 极端几何比例下的局部 patch 分配灵活性:目前标准测试主要采用围绕中心的 8 块对称划分,面对极大宽高比的长卷轴式(Scroll Painting)极度横向延展时,需要更动态自适应的块划分与拓扑通信机制。
  • 多卡通信开销与重叠均值操作:在每一步去噪中进行跨卡隐变量均值聚合需要 GPU 之间的频繁同步,在分布式集群网络带宽受限时可能削弱并行吞吐优势。
  • 复杂透视与光影的全局一致性约束:虽然边界框能控制物体的几何摆放,但如果原画带有非常特殊的非线性透视或强方向光源,低分辨率蓝图有时难以捕捉精细的高频光影投射走向。

相关工作与启发

  • vs ProOut (Song et al., ICCV 2025):ProOut 是艺术画作高分辨率外延的代表性工作,通过渐进式滑窗和中间全局提示进行扩展。本文指出了其核心缺陷在于没有显式的预先全局规划,导致时序误差累积且推理缓慢;本文引入两阶段全局蓝图与并行 patch 机制,在质量超越的同时提速 2.4 倍,并独创性地赋予了布局控制能力。
  • vs MultiDiffusion (Bar-Tal et al., ICML 2023) / Follow-Your-Canvas (Chen et al., AAAI 2025):MultiDiffusion 仅在去噪步骤中对重叠区域进行平均融合以平滑接缝,缺乏对各块全局语义的统一调度。本文证明了单纯边缘融合在大幅面外延时表现糟糕,必须结合全局特征注入与前向扩散低频初始化,才能在保证无缝拼接的同时维持全局画风与构图和谐。

评分

  • 新颖性: ⭐⭐⭐⭐☆ [两阶段蓝图引导与前向加噪低频初始化的构想设计巧妙,有机统一了全局规划与局部并行]
  • 实验充分度: ⭐⭐⭐⭐⭐ [覆盖多分辨率、多倍率拓展、布局控制及详尽消融,多项定性与定量对比翔实]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑层层递进,对痛点、机制与系统架构的阐述清晰明确]
  • 价值: ⭐⭐⭐⭐⭐ [攻克了高分辨率外延的核心速度与累积误差瓶颈,在文博展览、宽屏自适应重制等实际场景中实用价值显著]