跳转至

HRDiT: Training-Free High-Resolution Image Generation with Off-the-Shelf Diffusion Transformer Models

会议: ECCV 2026
论文: ECCV 原文
领域: 图像生成
关键词: 文本到高分辨率图像生成 / 扩散Transformer / 免训练扩展 / 空间位置对齐 / 自适应注意力剪枝

一句话总结

针对开箱即用扩散 Transformer(DiT)在免训练生成高分辨率图像时面临的“空间错乱”与“二次方耗时激增”两大核心阻碍,HRDiT 通过操纵 token 索引的“绑定-滑动”空间位置对齐机制恢复位置区分度,并利用单次前向泰勒展开结合整数规划实现头自适应注意力剪枝,在无需任何额外训练的前提下显著提升了 2K、4K 及 8K 图像生成的视觉保真度与合成速度。

研究背景与动机

近年来,文本驱动的高分辨率图像生成在数字艺术、商业广告及游戏制作中展现出巨大的实用价值。现有方案大致分为两派:基于训练的方法专门针对高分辨率微调或重训生成器,但往往依赖海量计算资源和超高分辨率配对数据;相比之下,免训练(training-free)方法试图直接激发低分辨率(如 1024×1024)预训练扩散模型的潜力,以极高灵活性实现大图合成。然而,既往免训练研究几乎全面围绕经典 U-Net 架构展开(如 ScaleCrafter、HiDiffusion 与 FreeScale)。随着以 Stable Diffusion 3 与 FLUX 为代表的扩散 Transformer(Diffusion Transformer, DiT)在常规分辨率上展现出压倒 U-Net 的强大生成能力,学术界与工业界迫切需要将此类强大的开箱即用 DiT 迁移至超高分辨率场景,但目前关于 DiT 模型的免训练高分辨率适配仍存在严重空白。

当研究人员尝试将现成 DiT 直接输入高分辨率高斯噪声,或者迁移既有面向 DiT 的渐进式流方法(如 I-Max)时,模型会遭遇两大致命瓶颈。首先是严重的“空间结构错乱”(spatial disorder):直接上采样或平铺生成的大图经常出现明显的物体重复、结构肢解与解剖学扭曲;其次是“生成时间过长”(long generation time):由于多头注意力机制对 token 数量具备二次方计算复杂度(\(O(T^2)\)),当生成分辨率扩展至 8K 时,多头注意力计算时间占总推理耗时的比例超过 90%,在 FLUX 上单张生成甚至长达 1385 秒以上,严重丧失实用性。

深入剖析两者的根因可以发现:理论上,高分辨率下 token 数量急剧增加,但 DiT 预训练位置编码的“表达力”(expressiveness)存在伪维度上界约束,导致注意力层中成对位置信号无法被有效区分,从而诱发空间坍塌;而计算上,不同注意力头在不同分辨率和位置上的重要性高度非均衡,现有视觉剪枝要么需要训练,要么粗暴采用全局一致的局部滑动窗口,容易破坏全局长程语义。本文的核心 idea 是:通过在输入位置函数前对 token 索引进行“绑定与滑动”双重变换以恒定复杂度重塑位置区分力(SPA),同时借助单次前向泰勒展开量化各头注意力敏感度并通过整数规划求解头自适应最优感受野窗口(HAP),以纯推理期架构调整实现高质量高效率的高分辨率 DiT 合成。

方法详解

整体框架

HRDiT 专为适配开箱即用 DiT 模型而设计,无需接触训练数据或更新权重。整个流水线包含两个相互解耦、正交起效的核心组件: 1. 空间位置对齐模块(Spatial Position Alignment, SPA):在每次注意力的位置编码注入阶段,拦截原始 token 序列索引,通过将 token 分组编包(Bundle)降低位置集合基数,再通过边界连续平移(Slide)多路并行集成,赋予模型跨分辨率的精确位置鉴别力,消除空间重叠与错乱。 2. 头自适应注意力剪枝模块(Head-adaptive Attention Pruning, HAP):在推理前运行极其轻量的单次准备步骤,利用单次全注意力前向与泰勒展开,可靠评估每个注意力头在不同感受野下的图像质量衰减量与计算开销,随后以整数线性规划(ILP)在全局算力预算约束下为每个头指派最优局部窗口,并预编译为高性能 FlashInfer GPU 算子,在推理时无损剪除冗余注意力交互。

方法的整体执行流水线与数据流向如下图所示:

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["高分辨率噪声潜在变量输入<br/>T 个视觉 token"] --> B["空间位置对齐 (SPA)<br/>Bundle 分组与 Slide 边界滑动"]
    B --> C["注意力贡献计算<br/>并行均值 c_ij^(SPA)"]
    C --> D["单次离线分析与 ILP 求解 (HAP)<br/>泰勒展开度量损失 + 整数规划"]
    D --> E["头自适应窗口核函数执行<br/>各头分配最优注意力视野"]
    E --> F["高分辨率图像潜变量输出<br/>经 VAE 解码为高保真大图"]

关键设计

1. 空间位置对齐(SPA):通过索引映射重塑位置编码表达力 在主流 DiT(如 FLUX、SD3)中,注意力计算对空间信息的感知均依赖于位置函数 \(f_{pe}\)。将 token 输入投影到注意力层时,位置信号被注入到 Query、Key 和 Value 向量中。定义 \(c_{i,j} = g(x_i, x_j, f_{pe}(i,j))\) 为 token \(j\) 对 token \(i\) 注意力输出的成对贡献。论文证明,通过距离度量 \(dis_g\) 划分的成对位置集合可区分度 \(h(T)\) 受函数类伪维度 \(\xi\) 的上界压制: $\(h(T) \le \lambda \cdot \Big(\sup_{S_{pe}}|g(x_i, x_j, f_{pe}(i,j))|\Big)^{2\xi}\)$ 当图片分辨率从 1K 扩展到 4K/8K 时,token 数量 \(T\) 急剧膨胀,理想状态下需要 \(h(T) = |S_{pe}|\) 以保障任意两点可辨识。然而实际测试中 FLUX 生成 4K 图像时满足该条件的比例不足 10%,绝大部分成对位置差异降至不可区分阈值 \(\epsilon\) 以下,导致空间坍塌。

为了在免训练前提下解决此问题,SPA 从位置函数输入端介入,采用两大互补操作: - Bundle(绑定):将相邻 token 顺序聚合成若干包(bundle),用包索引 \(\phi_{bundle}(i)\) 代替原始索引 \(i\) 喂入 \(f_{pe}\)。中间包大小设定为 \(N\),首包大小为 \(N_1\)\(1 \le N_1 \le N\))。这一操作将位置函数输入的多样性从 \(T\) 骤降至 \((T+N-N_1)/N\),直接减小了 \(|S_{pe}|\) 的规模,使模型恢复了粗粒度的宏观位置辨识力。但单一 Bundle 会抹平同包内 token 的位置差异。 - Slide(滑动):为了找回细粒度的内部区分度,SPA 构建了 \(N\) 种不同的映射函数 \(\{\phi_{bundle}^{(N_1=1)}, \dots, \phi_{bundle}^{(N_1=N)}\}\),通过让首包大小 \(N_1\) 从 1 依次递增到 \(N\),形成逐级右移的滑动边界。任意两个 token 在这 \(N\) 组包索引序列中构成的编码向量具有严格唯一性。

在推理过程中,模型将 \(N\) 路并行的包索引注意结果取算术平均,得到最终的注意力贡献: $\(c_{i,j}^{SPA} = \frac{1}{N} \sum_{n=1}^{N} g\bigg(x_i, x_j, f_{pe}\Big(\phi_{bundle}^{(N_1=n)}(i), \phi_{bundle}^{(N_1=n)}(j)\Big)\bigg)\)$ 该计算完全可借助张量并行完成,在 4K 生成中仅带来极微弱的时延增加(如 FLUX 仅从 203 秒增至 212 秒),却能彻底根除由于位置编码过载引发的形变与重影。

2. 泰勒展开单次评估(HAP Step 1):零开销定量注意力头敏感度 针对长耗时问题,粗暴对所有注意力头采用固定尺寸的局部窗口会大幅劣化图像质量,因为不同注意力头的分工具有高度特异性:部分头专注于局部纹理,而另一些头负责维持全局构图与语义对齐。若要针对性裁剪,传统的敏感度估算需要对 \(N_{head}\) 个头在 \(N_{scope}\) 种候选窗口下进行暴力网格搜索(需要 \(N_{head} \times (N_{scope}-1)\) 次模型前向),计算开销不可承受。

受到 MoA 方法启发,HAP 提出了基于一阶泰勒展开的高效近似策略。在离线准备阶段,仅需使用极少量校验 Prompt 执行单次全注意力前向。设目标图像生成的最终损失为 \(L\),当前注意力头的注意力矩阵为 \(A \in \mathbb{R}^{T \times T}\)。当将某头的注意力范围限制在候选窗口 \(n_{scope}\) 时,落在该窗口之外被丢弃的 token 索引对集合记为 \(S_{omit}^{(n_{scope})}\)。结合 Softmax 归一化特性,该头在该窗口下的图像质量退化量 \(I_q(n_{head}, n_{scope})\) 可直接由单次前向的注意力权重与梯度精确解析估计: $\(I_q(n_{\text{head}}, n_{\text{scope}}) \approx \sum_{(u,v) \in S^{(n_{\text{scope}})}_{\text{omit}}} \left( \frac{\partial L}{\partial A(u,v)} \cdot (-A(u,v)) - \sum_{w \in \{1\dots T\} \setminus \{v\}} \frac{\partial L}{\partial A(u,w)} \cdot \frac{A(u,w) \cdot A(u,v)}{1 - A(u,v)} \right)\)$ 与此同时,对应的计算开销 \(I_c(n_{head}, n_{scope})\) 直接定义为该窗口参与计算的有效 token 计数。整个校准过程耗时不足 1 小时,彻底避免了代价昂贵的重复前向。

3. 整数规划求解全局剪枝窗口(HAP Step 2):算力约束下的帕累托最优配置 在获得所有候选窗口的质量损伤 \(I_q\) 与计算成本 \(I_c\) 后,HAP 将全局配置抽象为带约束的组合优化问题。设定目标整体计算开销比例为 \(r_c \in [0, 1]\)(例如在实验中统一设为极具挑战性的 \(r_c = 0.1\),即仅保留 10% 的理论注意力计算量): $\(\min_{\{n_{\text{scope}}^{(1)}, \dots, n_{\text{scope}}^{(N_{\text{head}})}\}} \sum_{n_{\text{head}}=1}^{N_{\text{head}}} I_q\big(n_{\text{head}}, n_{\text{scope}}^{(n_{\text{head}})}\big) \quad \text{s.t.} \quad \sum_{n_{\text{head}}=1}^{N_{\text{head}}} I_c\big(n_{\text{head}}, n_{\text{scope}}^{(n_{\text{head}})}\big) \le r_c \times \sum_{n_{\text{head}}=1}^{N_{\text{head}}} I_c(n_{\text{head}}, N_{\text{scope}})\)$ 该问题形式化为标准整数线性规划(ILP),使用开源求解器(如 Gurobi)在数分钟内即可求出全局最优解。最终求解出的各头异构窗口在推理前预编译为 FlashInfer GPU 算子,使得长程注意力头保留广阔全局野,而局部注意力头聚焦核心邻域,既斩断了 90% 的注意力计算冗余,又完全保全了生成质量。

一个完整示例

假设在一处生成 4K 图像(潜在特征 token 数量 \(T=4096\))的 DiT 模型中配置 Bundle 参数 \(N=4\)。 1. SPA 阶段:对于 token 索引 \(i=5\),分别代入 \(N_1 \in \{1, 2, 3, 4\}\)。当 \(N_1=1\) 时,\(\phi_{bundle}^{(1)}(5) = \lceil (5-1)/4 \rceil = 1\);当 \(N_1=2\) 时,包映射为 \(1\);当 \(N_1=3\) 时,包映射为 \(1\);当 \(N_1=4\) 时,包映射为 \(1\)。不同位置的 token(例如 \(i=4\)\(i=5\))在四组滑动窗口下的包编码由滑动边界自然错开,使得成对相对距离信息在被送入位置函数时既保持了聚合后的平滑度(防止超出表达力界限),又通过多路集成恢复了逐点区分性。 2. HAP 阶段:系统共有 24 个注意力头,候选窗口离散划分为 50 级(\(N_{scope}=50\))。经过离线泰勒解析与整数规划,全局语义头(例如负责文本对齐的交叉关联头)被分配满配窗口 \(n_{scope}=50\)(保留 100% 视野),而大量背景纹理细节头则被压缩至仅包含紧邻 \(10\%\)\(5\%\) 邻域的极小局部窗口。FlashInfer 算子按此表动态索引,直接将注意力前向复杂度压缩至原先的约十分之一。

实验关键数据

主实验

实验基于 NVIDIA H200 GPU 展开,采用 LAION-5B 随机抽取的 1000 条 Prompt 进行客观评测。主实验对比了 U-Net 代表方案(SDXL + FreeScale)、DiT 直接扩展基线,以及 DemoFusion、DiffuseHigh、I-Max、FreCaS、HiFlow 等代表性免训练方法。评价指标涵盖全图 FID/KID、局部块指标 FIDp/KIDp、CLIP 分数以及单张图生成延迟(Latency)。

表 1:2K 与 4K 分辨率图像生成性能对比(摘自原论文 Table 1)

分辨率 模型底座 方法 FID ↓ FIDp ↓ KID ↓ KIDp ↓ CLIP Score ↑ Latency (s) ↓
2K SDXL + FreeScale 73.23 65.04 0.0093 0.0132 30.57 26
SD3 Direct 81.34 70.88 0.0215 0.0194 30.23 17
SD3 + DemoFusion 72.21 59.24 0.0132 0.0125 31.40 35
SD3 + DiffuseHigh 70.57 57.39 0.0119 0.0112 31.59 20
SD3 + HiFlow 70.49 57.35 0.0126 0.0110 31.62 18
SD3 + HRDiT (Ours) 67.90 52.59 0.0081 0.0073 31.81 11
FLUX Direct 73.96 69.56 0.0173 0.0164 29.63 47
FLUX + DemoFusion 68.95 60.53 0.0127 0.0120 30.83 94
FLUX + DiffuseHigh 67.40 58.63 0.0115 0.0108 31.01 52
FLUX + I-Max 68.37 56.96 0.0121 0.0106 30.67 85
FLUX + HiFlow 67.45 56.79 0.0117 0.0105 30.73 49
FLUX + HRDiT (Ours) 64.42 51.55 0.0074 0.0067 31.27 35
4K SDXL + FreeScale 74.85 68.89 0.0112 0.0157 30.49 248
SD3 Direct 84.29 74.45 0.0243 0.0231 30.18 108
SD3 + DemoFusion 73.39 60.75 0.0141 0.0133 31.16 229
SD3 + DiffuseHigh 71.88 58.76 0.0130 0.0126 31.35 115
SD3 + HiFlow 71.39 58.40 0.0133 0.0118 31.59 112
SD3 + HRDiT (Ours) 68.63 53.04 0.0089 0.0079 31.79 58
FLUX Direct 75.68 72.73 0.0192 0.0188 29.57 203
FLUX + DemoFusion 71.18 62.38 0.0150 0.0142 30.48 649
FLUX + DiffuseHigh 69.23 59.13 0.0132 0.0125 30.97 215
FLUX + I-Max 70.11 59.83 0.0142 0.0133 30.52 484
FLUX + HiFlow 68.36 57.43 0.0124 0.0114 30.62 209
FLUX + HRDiT (Ours) 64.91 51.84 0.0078 0.0074 31.17 116

在极高分辨率 8K(8192×8192)场景下,HRDiT 优势进一步放大。如原论文 Table 3 所示:SD3 搭配 HRDiT 耗时仅 454 秒(FID 69.51),而 DemoFusion 耗时高达 2720 秒且 FID 仅 76.07;FLUX 搭配 HRDiT 耗时仅 827 秒(FID 65.73),而直接生成需 1708 秒(FID 78.47),DemoFusion 更是高达 5749 秒。

消融实验

为验证 SPA 与 HAP 各自的作用,论文在 4K FLUX 上进行了严格拆解:

表 2:HRDiT 核心模块消融实验(摘自原论文 Table 2,4K FLUX)

方法配置 FID ↓ FIDp ↓ KID ↓ KIDp ↓ CLIP Score ↑ Latency (s) ↓ 说明
FLUX (Direct) 75.68 72.73 0.0192 0.0188 29.57 203 原始基线,严重空间错乱且耗时长
Ours (w/o SPA) 75.85 72.83 0.0195 0.0192 29.55 110 仅使用 HAP 剪枝,耗时减半但结构依然崩溃
Ours (w/o HAP) 64.82 51.81 0.0076 0.0074 31.19 212 仅使用 SPA 对齐,质量最佳但耗时居高不下
Ours (Full) 64.91 51.84 0.0078 0.0074 31.17 116 完整模型:质量几乎无损,耗时降低约 45%

关键发现

  1. 模块正交且相辅相成:SPA 专攻空间质量,去除 SPA 后 FID 剧烈恶化超过 10.9 个点(从 64.91 恶化至 75.85),表明位置对齐是保证高分辨率语义不坍塌的核心;HAP 专攻效率,加入 HAP 将 4K FLUX 耗时从 212 秒压至 116 秒(节约 45.3% 耗时),且 FID 仅微弱波动 0.09,验证了头自适应分配的高精准度。
  2. 超越传统流扩散与修补方案:对比目前前沿的 HiFlow 与 I-Max,HRDiT 不仅在所有质量指标上均取得显著优势(4K FLUX 下 FID 降低 3.45~5.2 点),且推理速度比 I-Max 快 4.1 倍(116s vs 484s)。

亮点与洞察

  • 从理论上直击位置编码表达力瓶颈:不仅停留在经验性调参,而是将 LLM 领域的伪维度理论迁移到视觉扩散模型中,指出 \(h(T) \le \lambda \cdot (\sup |g|)^{2\xi}\) 这一数学边界,从机理上解释了为什么现成 DiT 生成大图会“无端”产生重影与错乱。
  • 无需改动模型权重的纯索引操纵:SPA 巧妙通过 Bundle 压缩位置集基数、Slide 恢复点间唯一性的策略,仅在输入端改写 token 标号,完全保持了预训练注意力的内部算子完整性与模型通用性。
  • 将一阶泰勒展开与整数规划引入 DiT 剪枝:克服了传统局部窗口在无微调情况下破坏全局语义的顽疾,以极低的一次性校准开销实现了算力与感知质量的帕累托最优配置,这一设计思路对扩散视频生成(DiT Video)与超长序列视觉模型同样具备高度借鉴意义。

局限与展望

  • 离线准备阶段的依赖性:HAP 虽然只需执行一次,但依然需要约 1 小时的前置校准和求解流程,且当前参数(如 \(r_c=0.1\))针对特定分辨率需要分别校准,缺乏随任意动态比例实时调节的弹性。
  • 非规则纵横比的泛化:实验主要覆盖了正方形分辨率(2K×2K、4K×4K、8K×8K),对于超宽比例(如 8:1 的全景图)下 Bundle 和 Slide 的滑动步长设置仍需进一步探索自适应几何对齐策略。
  • 未结合潜在时序步动态剪枝:当前 HAP 在所有去噪时间步(Timesteps)采用相同的注意力窗口,而扩散模型前期偏好大尺度构图、后期偏好高频细节,若能引入时间步敏感的动态窗口分配,有望实现更激进的推理加速。

相关工作与启发

  • vs DemoFusion / DiffuseHigh / HiFlow:这类方案重点在于改写扩散去噪的反向采样轨迹(如尺度平滑融合、引导流对齐),往往带来数倍的采样延迟;HRDiT 聚焦于 DiT 核心架构内部的位置编码表达力与注意力机制,不仅在根本上解决了空间解构问题,更实现了推理端提速。
  • vs I-Max:I-Max 仅适用于 Rectified Flow 模型(如 FLUX),且需要复杂的流投影步骤;HRDiT 具备广谱适用性,无缝兼容 SD3 与 FLUX,且在质量和速度上均大幅碾压 I-Max。
  • vs 传统视觉窗口剪枝(如 Window Attention / Neighborhood Attention):传统方法采用刚性的均匀几何窗口,必须配合重新微调才能防止伪影;HRDiT 的 HAP 敏锐抓住了多头特异性,对语义大头保留全图交互,无需重训即实现了高质量加速。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次从理论与架构层面系统剖析 DiT 在免训练超分辨率下的瓶颈,提出 SPA 与 HAP 协同设计。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 2K/4K/8K 极限分辨率,在 SD3 与 FLUX 两大主流 DiT 上提供详尽主客观指标、消融与延迟对比。
  • 写作质量: ⭐⭐⭐⭐⭐ 理论推导扎实,动机阐述层层递进,方法与实验图表自洽详尽。
  • 价值: ⭐⭐⭐⭐⭐ 为现成开源 DiT 模型在大图生成领域的低成本落地提供了标准化、即插即用的工程与算法典范。