跳转至

UltraGen: Efficient Ultra-High-Resolution Image Generation with Hierarchical Local Attention

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/PeterYYZhang/UltraImageGen/
领域: 图像生成
关键词: 扩散模型, 超高分辨率图像生成, 局部注意力, 层次化引导, 计算效率

一句话总结

针对文生图扩散 Transformer 在 4K/8K 超高分辨率下自注意力计算爆炸与高分辨率训练数据匮乏的双重瓶颈,提出 UltraImageGen 框架,通过窗口优先排列的局部窗口注意力将序列复杂度从二次方降至近线性,并结合位置缩放的低分辨率潜变量提供全局语义锚点与 LoRA 轻量联合去噪,无需任何原生高分辨率数据即可实现高质量、超 10 倍加速的 8K 级图像生成。

研究背景与动机

随着数字艺术、高精度广告渲染以及虚拟现实等场景对视觉细节要求的持续提升,合成兼具微观纹理与宏观结构保真度的超高分辨率(4K 至 8K 及以上)图像已成为生成模型的核心需求。然而,当前主流基于 Diffusion Transformer(如 FLUX.1、SD3、PixArt)的最先进文本到图像模型,其实际生成能力仍普遍被禁锢在 1K 至 2K 分辨率以下。一旦尝试将其外推至 4K,空间 token 数量将激增至数万量级,极大地制约了超高分辨率图像在工业级管线中的落地。

限制现有模型向超高分辨率拓展的核心症结来自相互交织的两大瓶颈:其一是计算复杂度与显存开销的二次方膨胀,全注意力机制的计算开销随着分辨率以 \(O(N^2)\) 速度暴增,生成 4K 图像(65,536 个 token)相比 1K 图像计算量剧增 256 倍,即便是最先进的 FlashAttention 也会瞬间触发显存溢出;其二是原生高质量 4K/8K 图像-文本对数据集极度匮乏且采集标注成本高昂,促使许多现有方案依赖合成高分辨率数据重新微调,不仅引发严重的长宽比敏感与伪影问题,还需要成百上千 GPU 小时的训练算力;而免训练的外推方法(如 DemoFusion、I-MAX、CLEAR)往往伴随沉重的迭代采样延迟、边界缝合断裂或解剖结构错乱(如多指、面部变形)。

本文的切入视角在于观察到超高分辨率图像生成的本质结构特性:图像的远距离长程依赖主要决定画面的宏观构图与语义布局,而微观的高频纹理只依赖局部的空间上下文。因此,无需在全序列上执行全局密集的昂贵注意力,而是可以将生成任务进行层次化解耦——在微观尺度限制注意力于固定大小的硬件对齐局部窗口,而在宏观尺度通过经过空间缩放的低分辨率语义图像作为锚点注入全局上下文。核心 idea:将高分辨率扩散去噪解耦为窗口优先排列的硬件对齐局部窗口注意力和位置尺度投影的低分辨率全局引导路径,仅需基于通用 1K 数据训练轻量 LoRA 联合去噪投影层,即可在无需任何原生高分辨率数据的前提下实现近线性复杂度、10 倍以上加速且结构高度自洽的 4K/8K 图像合成。

方法详解

整体框架

UltraImageGen 围绕预训练多模态扩散 Transformer(MMDiT)架构进行模块化改造。模型将输入的高分辨率带噪潜变量划分为固定大小的非重叠局部窗口,并通过窗口优先的 token 序列重排保证自注意力操作始终映射在 GPU 友好的稠密局部计算块上,同时避免 RoPE 位置编码超出预训练感知范围;同时引入一个低分辨率潜变量,通过坐标缩放将其空间位置与高分辨率网格对齐,作为全局语义锚点;最后,在 MMDiT 块中通过专用的复合注意力掩码与轻量 LoRA 适配层实现高低分辨率的联合去噪。在推理阶段,系统进一步利用低分辨率引导图对高分辨率初始潜变量进行加噪热启动,大幅削减早期去噪步数。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入文本提示词与超高分辨率生成请求"] --> B["阶段1:窗口优先局部窗口划分<br/>256×256 窗口重排与局部自注意力"]
    B --> C["阶段2:低分辨率坐标缩放全局引导<br/>ρ=4 缩放映射与 RoPE 锚点注入"]
    C --> D["阶段3:轻量 LoRA 联合去噪与流匹配<br/>仅更新低分辨率引导分支 Q/K/V 投影"]
    D --> E["阶段4:引导加权热启动采样加速<br/>插值加噪跳过早期去噪步骤"]
    E --> F["输出 4K/8K 超高分辨率逼真图像"]

关键设计

1. 窗口优先排列的局部窗口注意力:将二次方复杂度降为近线性并锚定相对位置编码

直接在超高分辨率潜变量 \(X \in \mathbb{R}^{H \times W}\) 上执行密集自注意力会导致计算复杂度从 1K(4096 个 token)到 4K(65536 个 token)急剧暴增 256 倍。为此,方法将高分辨率空间网格切分为固定大小的局部窗口 \(x_i \in \mathbb{R}^{l \times l}\)。在 \(16\times\) VAE 下采样设置下,选取 \(l=16\)(对应图像空间 \(256 \times 256\) 像素块),使计算复杂度降为 \(O(\lceil \frac{H}{l} \rceil \lceil \frac{W}{l} \rceil \cdot l^4) \approx O(N \cdot l^2)\),在 4K 下实现高达 256 倍的注意力计算量削减。更为关键的是,传统光栅扫描(raster-scan)展开的 token 会让同一二维窗口内的相邻像素在序列上被隔得很远,无法适配底层 GPU tile 运算。本文提出窗口优先(window-first)token 重排机制,直接按窗口次序重组 token 序列,使得注意力矩阵计算直接退化为 GPU 原生支持的高效密集块(dense local block),完美契合 FlashAttention-2 与 SageAttention 的硬件分块(如 Q-block=128、K-block=64)。此外,窗口优先排布限制每个窗口内部 token 相对距离始终处于预训练模型熟悉的 \(256 \times 256\) 局部 RoPE 动态范围内,彻底规避了高分辨率直接推理时的位置外推退化,同时允许窗口边界相邻 token 进行跨窗口交互以消除拼缝伪影。

2. 尺度对齐低分辨率全局引导:以锚点约束宏观布局与跨区域语义自洽

纯粹的局部窗口注意力容易丢失大尺度的语义一致性,引发多头、肢体杂乱或全局结构崩塌。本文的核心见解是:远距离语义约束主要决定主体拓扑与构图,不需要高频细节。因此,系统引入一路并行的低分辨率引导潜变量 \(X_{lr} \in \mathbb{R}^{h \times w}\),其长宽缩放比例定义为 \(\rho = \frac{H}{h}\)(在兼顾计算与效果下设置为 \(\rho=4\))。为了让低分辨率 token 与高分辨率像素对齐,系统将低分辨率像素索引 \((m, n)\) 线性缩放到全局高分辨率坐标系:

\[(\tilde{m}, \tilde{n}) = (\rho \cdot m, \rho \cdot n)\]

缩放后的低分辨率 token 作为物理意义上的锚点(anchors),通过精心构造的注意力掩码矩阵 \(M\) 与高分辨率序列混合:文本 token 与自身和高分辨率 token 交互;高分辨率 token \(X\) 在关注自身窗口及相邻边界 token 的同时,交叉注意力关注文本与对应的低分辨率锚点 \(X_{lr}\);而 \(X_{lr}\) 内部进行全局全自注意力交互。这种设计既维持了全局长程依赖的语义纽带,又支持递归级联(高分辨率图像可继续充当下一次超分辨率的低分辨率引导),实现向 8K 甚至更高画幅的无缝泛化。

3. 轻量 LoRA 联合去噪与流匹配微调:仅基于通用 1K 数据实现高分辨率泛化

引入低分辨率序列 \(X_{lr}\) 扩展了输入为 \([C_T; X; X_{lr}]\),由于位置坐标经过了 \(\rho\) 倍缩放,RoPE 位置编码的频率响应发生了系统性偏移。若直接复用原投影权重,会导致引导信息失真。为此,本文设计了参数高效的非对称联合去噪机制:高分辨率图像分支 \(X\) 严格冻结并复用预训练模型的全部 \(Q, K, V\) 投影矩阵,以无损保留底座强大的局部微观生成与纹理合成能力;而仅对处理 \(X_{lr}\)\(Q, K, V\) 投影层挂接轻量 LoRA(rank=16, \(\alpha=16\)),得到适配投影矩阵 \(\tilde{Q}, \tilde{K}, \tilde{V}\)。联合注意力公式表示为:

\[\text{MMA}([X; X_{lr}]) = \text{Softmax}\left(\frac{[Q(X), \tilde{Q}(X_{lr})][K(X), \tilde{K}(X_{lr})]^T \cdot M}{\sqrt{d}}\right) [V(X), \tilde{V}(X_{lr})]\]

训练基于标准流匹配目标函数进行优化:

\[\mathcal{L}_{\text{FM}}(\theta; C_T, X_{lr}) = \mathbb{E}_{t, X_t}\left[ \| f_\theta(X_t, t, C_T, X_{lr}) - u_t(X_t; C_T, X_{lr}) \|^2 \right]\]

值得强调的是,训练仅需使用底座模型在通用 \(1024 \times 1024\) 分辨率下合成的 10,000 张图像样本配对 \(256 \times 256\) 引导图,全程无需任何一张真实或昂贵的原生 4K 训练数据。

4. 引导加权热启动采样加速:绕过早期低频去噪步骤

在扩散与流匹配生成过程中,前期的去噪迭代主要负责构建宏观低频轮廓,而后期的迭代才逐步细化高频纹理。由于低分辨率引导图 \(X_{lr}\) 已经提前捕获了完整的宏观空间结构,高分辨率初始潜变量从纯高斯白噪声从头采样会造成严重的计算冗余。UltraImageGen 提出一种双频段加权热启动策略:首先对已生成的低分辨率潜变量进行插值上采样并施加锐化,随后按照中间时刻 \(t\) 的扩散噪度分布为其加噪,构建参考潜变量 \(X_t^{\text{ref}} = \text{Interpolate}(X_{lr})\);高分辨率起始潜变量随后被初始化为高斯随机噪声与参考结构的插值融合:

\[X_t^{\text{hr}} = \alpha X_T + (1 - \alpha) X_t^{\text{ref}}, \quad \text{其中 } \alpha = \frac{t}{T}\]

该设计直接注入了低频先验,使得高分辨率生成得以安全跳过早期漫长且计算密集的去噪阶段,在保证细节生成自由度的同时将推理迭代耗时削减 30% 以上。

损失函数 / 训练策略

模型采用 Flow Matching(流匹配)监督范式,优化目标为神经网络预测的速度场 \(f_\theta\) 与真实插值速度场 \(u_t\) 之间的均方误差。优化器配置采用 Pyriology 调度器,基础学习率为 1.0,权重衰减设定为 0.01,开启偏差校正(bias correction)与平滑预热机制。微调在 2 块配备 48GB 显存的 NVIDIA RTX A6000 Ada GPU 上进行,单卡批大小为 1,梯度累积步数为 4,仅训练 20,000 步即可收敛。推理时,RoPE 编码的 NTK 外推因子设置为 10,并关闭动态调度位移。

实验关键数据

主实验

在由 GPT-4o 生成的 1,000 条涵盖多类别的高质量 Prompt 评测集上,对比 4K 分辨率下的主观与客观生成表现。FID 指标以 LAION-High-Resolution 中 10,000 张真实图片为基准,并引入局部的 FIDpatch 与 ISpatch 衡量局部细节真实度。

方法 类型 CLIPIQA ↑ FID ↓ FIDpatch ↓ IS ↑ ISpatch ↑ CLIPscore ↑
SANA 4K训练 0.4457 76.31 74.27 16.68 14.02 0.3197
Diffusion-4K 4K训练 0.3012 121.85 120.59 14.39 10.77 0.2844
UltraPixel 4K训练 0.4421 77.42 70.94 16.98 13.26 0.3251
URAE 4K训练 0.4369 67.39 62.56 17.11 12.39 0.3204
FLUX+BSRGAN 超分管线 0.3897 71.39 63.45 17.08 12.87 0.3210
UltraFlux 4K微调 0.4371 75.89 65.12 17.01 13.24 0.3165
DemoFusion 免训练 0.4392 74.89 66.37 16.23 13.02 0.3187
DiffuseHigh 免训练 0.4221 81.54 73.35 16.15 13.08 0.3175
HiDiffusion 免训练 0.4021 172.46 217.49 9.43 8.12 0.3129
I-MAX 免训练 0.4381 70.33 65.67 16.50 12.69 0.3211
HiFlow 免训练 0.4407 69.18 63.72 17.13 13.43 0.3113
CLEAR+SDEdit 线性化注意力 0.4352 88.23 87.19 16.84 13.78 0.3221
Ours (FLUX.1) 层次化局部 0.4505 67.03 61.78 17.21 13.31 0.3231
Ours (FLUX.2) 层次化局部 0.4594 61.38 59.82 18.02 14.93 0.3267

在硬件推理效率方面,生成单个 4K 图像潜变量(65,536 tokens),各 FLUX.1 底座方法的耗时与显存对比呈现压倒性优势:

方法 总推理延迟 (s) 单步迭代耗时 (s) 显存增量 (GB)
FLUX (原生 FlashAttention) 659.35 23.20 57.16
URAE 509.88 18.21 52.81
I-MAX 299.10 17.89 47.81
HiFlow 272.79 15.00 47.83
CLEAR + SDEdit 536.79 21.57 50.16
Ours 152.21 7.81 39.71 (附加仅 7.3GB)

消融实验

消融实验重点验证了局部窗口大小(\(ws\))与高低分辨率比例(\(\rho\))对图像生成质量的影响。

配置 窗口大小 \(ws\) 缩放比 \(\rho\) FID ↓ FIDpatch ↓ 说明
默认极速配置 256 4 67.23 61.46 兼顾极佳细节与最小计算量
较小下采样比 256 2 67.19 62.28 全局引导计算量提升,质量无明显增益
中等窗口 512 4 66.31 63.48 FID 轻微优化但局部 patch FID 略有劣化
大窗口 1024 4 67.83 62.61 注意力计算量增大 16 倍,但性能并未提升

此外,注意力连接模式的消融显示: - 缺失低分辨率引导(去掉 \(X_{lr}\)):高分辨率生成彻底失去全局统摄力,人物面部出现多头、五官分裂以及严重的纹理杂乱。 - 缺失跨窗口边界交互(仅自身窗口内自注意力):各局部窗口由于独立生成,在边界处出现明显的网格化拼接缝隙;而加入相邻窗口交互仅增加不足 2% 的计算开销,便能完全消除拼缝痕迹。

关键发现

  • 局部窗口尺寸与硬件粒度的甜点平衡:将图像窗口固定在 \(256 \times 256\)(潜变量 \(16 \times 16\))时,生成的感知细节(FIDpatch 61.46)已经饱和。进一步盲目扩大窗口不仅带来 \(O(l^2)\) 的开销增长,对质量提升几乎无贡献;而更小的窗口则无法充分利用 GPU 针对 128/64 块大小的分块计算特性。
  • 高阶外推的吞吐爆炸与极端加速:在 8K 分辨率极端压力测试下,常规 FlashAttention 显存开销极大并难以承载,而 UltraImageGen 在注意力层实现 130.4 倍浮点计算量(FLOPs)削减,单步迭代提速 6.93 倍,整机推理延迟实现 10.77 倍缩短。
  • 跨分辨率一致性(Resolution-Agnostic):在 GenEval 评测中,模型从 1K 到 4K 的综合得分保持完全平稳(0.66 ~ 0.67),单物体识别(0.98)、属性绑定(0.45)与计数能力(0.74 ~ 0.75)在尺度跃迁中未发生任何退化。

亮点与洞察

  • 窗口优先 token 重排消弭硬件与数学的双重鸿沟:通过将 2D 空间窗口直接连续映射至序列首端,既完美利用了 GPU 底层对密集矩阵乘法的硬件加速,又将相对位置编码牢牢锁死在预训练阶段所见的 \(256 \times 256\) 范围内,以极简工程手段化解了超长序列的位置外推难题。
  • 语义-细节两路解耦彻底甩开 4K 数据包袱:发现长程语义与高频纹理的尺度分离特质,利用低分辨率锚点统领全局构图,使得模型仅需在廉价的 1K 合成数据上微调极小体量的 LoRA 矩阵,打破了超高分辨率必须重度依赖原生 4K/8K 庞大训练集的行业惯例。
  • 架构完全正交,天然支持时间蒸馏与递归级联:该设计与底座推理加速技术(如 FLUX.2-Klein 4 步蒸馏)及更高画幅递归生成无缝兼容,在蒸馏后 4K 生成耗时压缩至 30 秒以内,8K 压缩至 2 分钟以内,具备极强的工业级量产落地价值。

局限与展望

  • 作者承认的局限:极端极限尺度(如 16K 以上)下的显存与计算仍需分级级联多轮生成,若引导分辨率过低可能导致跨度过大的微小对象出现局部不连贯;此外,局部窗口间的边界注意力尽管只有 2% 开销,但仍依赖工程定制化的注意力算子支持。
  • 拓展思考:当前方法主要依赖预训练文本编码器与静态语义提示,在处理超大规模密集文本描述时,全局低分辨率引导可能出现极小目标属性绑定的细节丢失。未来可探索将层级稀疏注意力和自适应窗口切分进一步扩展至超长高清视频(4K Video Diffusion)生成任务中。

相关工作与启发

  • vs CLEAR / GRAT (线性化/邻域注意力): CLEAR 等方法试图通过局部邻域注意力或线性卷积替换加速生成,但在超高分辨率下若要维系质量必须逐步扩大邻域半径,导致计算开销退化,且容易丢失全局语义一致性不得不依赖 SDEdit 修补;本文通过固定的局部小窗口与尺度对齐低分辨率全局引导解耦,实现真正无视分辨率的线性扩展。
  • vs SANA / PixArt-Σ (原生 4K 预训练): SANA 等方案需要昂贵的成百万张原生超高分辨率图像进行多阶段预训练,并高度依赖线性注意力机制带来的模糊/局部混淆缺陷;本文完全零原生 4K 数据,直接插拔式复用成熟底座 FLUX,成本微乎其微。
  • vs HiFlow / I-MAX (免训练外推): HiFlow 和 I-MAX 虽然不需微调,但在高分辨率下去噪过程易产生明显的对角线高频条纹与伪影,且每步仍需密集全注意力计算;本文通过轻量 LoRA 微调引导路径,既保证了生成画质的清晰细腻,又实现了超过 10 倍的端到端吞吐暴增。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 窗口优先局部注意力结合尺度对齐低分辨率全局锚点的思想极具启发性,优雅兼顾了硬件友好度与长程自洽性。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 4K 全面对比(14 个基线)、GenEval 跨分辨率评估、8K 极限压测、显存与延迟硬核测试及详尽消融。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑结构严谨清晰,问题定义切中当前超高分辨率文生图痛点,方法阐述层次分明。
  • 价值: ⭐⭐⭐⭐⭐ 为学术界与工业界提供了一种无需 4K 训练数据、硬件极其友好的超高分辨率生成标准化范式。