跳转至

Region-Aware Test-Time Scaling for Compositional Image Generation

会议: ECCV 2026
论文: ECCV 原文
领域: 图像生成
关键词: 测试时计算扩展 (TTS), 组合图像生成, 区域感知生成, 扩散模型, 链式思维规划

一句话总结

针对全局测试时采样在复杂空间关系与多对象组合生成中出现的“扩展瓶颈”,提出区域感知测试时扩展框架 RAS,将区域分解作为独立扩展维度,通过仅在前期去噪步注入区域引导实现精准属性绑定与全局结构协同,仅需 2 个样本即可追平基线 32 次采样的对齐效果。

研究背景与动机

近年来文本到图像扩散模型与流匹配模型在生成真实感和高分辨率画质上取得了显著突破,伴随大语言模型中测试时计算扩展(Test-Time Compute Scaling)的成功,以 Best-of-N 候选重采样为代表的推理时扩展方法逐渐成为进一步提升视觉生成对齐能力的有效手段。然而,现有的视觉测试时扩展方法主要依赖全局维度的随机探索,例如通过不同噪声种子进行多次重采样的噪声扩展(Noise Scaling),或者调用大语言模型对全局提示词进行重写与增广的提示词扩展(Prompt Scaling)。

这种纯全局探索范式在面对包含复杂多对象、精确空间方位及属性绑定的多约束组合生成时显得极其低效。统计分析表明,空间位置约束(如“背包下方的猫”)在模型的无引导采样分布中属于极端稀疏的长尾低概率模态:在 100 个位置测试提示词中,超过 30% 的提示词即便采样 32 次其成功率也低于 10%,测试时扩展迅速遭遇边际效应递减的“扩展瓶颈”(Scaling Plateau)。其核心症结在于全局文本条件与局部细粒度约束之间的颗粒度错位——全局噪声扰动无法定向改变语义拓扑,而早期去噪阶段若一旦锁定了错误的对象布局,后续步骤几乎无法完成全局纠错。

受区域控制生成技术的启发,本文从任务分解的全新视角重构测试时计算空间。既然让模型联合满足多物体交织的复杂关系极其困难,但让模型在指定局部空间生成单一物体却十分稳定,那么通过思维链(CoT)将复合提示词拆分为空间区域子任务,就能将原本稀疏的有效生成解空间显著稠密化。核心 idea:将区域分解作为测试时计算扩展的全新正交轴,构建无须训练的区域感知生成原语 RAG,仅在去噪早期注入局部区域引导以锁定物体拓扑与空间布局,并基于区域-提示词-噪声联合配置空间开展 Best-of-N 扩展(RAS),以最小推理代价实现复杂组合生成的高效缩放。

方法详解

整体框架

RAS 整体管线包含两层核心结构:外层的区域感知测试时扩展(RAS)搜索与内层高效的无训练区域感知生成(RAG)原语。对于用户输入的复杂组合提示词,系统首先借助大语言模型(如 GPT-4o)开展链式思维(CoT)场景规划与重述,解析出全局重述提示词、多个语义区域的空间掩码(Bounding Boxes)以及针对各区域的细粒度局部子提示词。在内层生成中,扩散模型在前 \(T_{\mathrm{rag}}\) 个去噪步骤(通常仅占总步数的 10%)并行演化全局潜变量与局部裁剪潜变量,并通过归一化掩码加权融合,在锁定空间拓扑后无缝切回标准全局扩散以完成细节精修。在外层扩展中,RAS 允许在噪声种子、全局提示词变体以及区域规划配置所组成的联合空间中抽取候选样本并由验证器挑选最优图像。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入组合提示词 p"] --> B["CoT 场景分解与区域规划<br/>生成全局描述与区域掩码及子提示词"]
    B --> C["早期双路去噪阶段 (t < T_rag)<br/>全局潜变量与局部潜变量并行演化"]
    C --> D["区域潜变量归一化加权融合<br/>局部属性注入与空间边界对齐"]
    D --> E["后期单路全局去噪 (t ≥ T_rag)<br/>消除边界伪影并精细化整体质感"]
    E --> F["联合配置空间 Best-of-N 采样<br/>验证器评分挑选最优生成图像"]

关键设计

1. 链式思维场景规划与重述:解耦复合约束并稠密化解空间

现有模型对多物体属性绑定和相对方位的敏感度不足,直接输入全局提示词往往导致对象漏画或属性错配。针对该问题,RAS 在推理起点利用 LLM 执行 CoT 场景分解。LLM 不仅把原始简略文本扩写为光照、背景与构图丰富的全局提示词 \(\tilde{p}\),更进一步将画面划分为 \(R\) 个空间子区域 \(\{r_i\}_{i=1}^R\)。每个区域分配一个边界框掩码 \(M_i \in [0, 1]^{H \times W}\) 与专有子提示词 \(p_i'\)。通过将全局复合关系显式转化为“在特定区域生成特定特征的物体”,原本极为罕见的空间组合构型被分解为基座模型极易满足的单目标生成子任务,从根本上克服了全局噪声搜索在长尾分布中的命中率难题。

2. 早期区域潜变量并行演化与加权融合:平衡局部拓扑引导与全局语义协调

传统基于布局的图像生成方法常在全部去噪步骤施加区域限制,这不仅带来与区域数量线性增长的巨大计算开销,还极易在物体边界处产生生硬的接缝伪影。RAS 提出将采样解耦为“前期区域定结构”与“后期全局精修”两阶段。在去噪初始阶段(\(t < T_{\mathrm{rag}}\),例如 30 步中的前 3 步),每个区域从全局潜变量中裁剪出初始局部潜变量 \(\mathbf{z}^{(i)}_0 = M_i \odot \mathbf{z}_0^{(g)}\),随后局部潜变量在各自子提示词 \(p_i'\) 驱动下更新,同时全局潜变量在全局提示词下演化:

\[\mathbf{z}_t^{(i)} = f_\theta(\mathbf{z}_{t-1}^{(i)}, \phi(p_i'), t), \quad \mathbf{z}_t^{(g)} = f_\theta(\mathbf{z}_{t-1}^{(g)}, \phi(p), t)\]

为了使局部语义精准写入主干,对重叠区域掩码进行归一化修正 \(\tilde{M}_i = \frac{M_i}{\sum_j M_j + \varepsilon}\),并按权重 \(\alpha_t\) 将各区域潜变量回填融合至全局潜变量:

\[\mathbf{z}_t = (1 - \alpha_t) \mathbf{z}_t^{(g)} + \alpha_t \sum_{i=1}^R \tilde{M}_i \odot \mathbf{z}_t^{(i)}\]

当步数达到 \(T_{\mathrm{rag}}\) 之后,模型完全丢弃局部潜变量分支,退化为常规的单路全局去噪 \(\mathbf{z}_t = f_\theta(\mathbf{z}_{t-1}, \phi(p), t)\)。早期注入足以牢固确立物体的大致轮廓与位置排布,有效防止了属性泄漏;而后期全局扩散则利用自注意力机制自适应消除掩码边缘的阶跃伪影,在仅增加约 10% 恒定推理开销的条件下获得了高度自然的图像连贯性。

3. 区域维度扩展机制与配置空间优化:突破传统 Best-of-N 单一维度的局限

传统的视觉测试时扩展仅将初始随机噪声种子 \(z_0\) 作为自由度(噪声扩展),或者仅重写全局提示词(提示词扩展)。RAS 将单个候选样本建模为超维配置元组 \(\xi = (\mathbf{z}_0, \tilde{p}, \{(M_i, p_i')\}_{i=1}^R, T_{\mathrm{rag}})\),正式将“区域轴”(包含空间框位置与区域提示词)作为全新的搜索自由度。在总采样预算为 \(N\) 的约束下,RAS 可以灵活配置噪声重采样、全局提示词扰动以及区域布局重规划的预算分配比。各候选样本并行生成后,统一输入验证器模型 \(V(I_k, p)\) 计算图文匹配与结构满足度得分,最终依据下式筛选出全局最优输出:

\[I^\star = \arg\max_{k \in \{1,\dots,N\}} V(I_k, p)\]

实验探究表明,在固定采样预算下,纯噪声搜索或纯提示词搜索均非最优解,将部分算力分配至区域维度能够产生显著的互补增益。

损失函数 / 训练策略

本方法完全属于测试时免训练范式(Training-Free),不涉及任何对扩散主干模型、文本编码器或大语言模型的参数更新。所有的空间控制与组合能力均来自推理时的 CoT 区域规划与潜在特征早期的结构化融合。

实验关键数据

主实验

在代表性的组合生成基准 GenEval 上,论文将 RAS 部署于 FLUX.1-dev 和 SANA-1.0-1.6B 主干,与未经扩展的基础模型、提示词重写方法(RePrompt、RePrompt+GRPO)以及多种测试时扩展基线(Noise Scaling、Prompt Scaling、Reflect-DiT、ReflectionFlow)进行了定量对比。

表 1: GenEval 基准上的定量评测结果(节选代表性配置与模型)

方法 / 模型 采样数 (N) Overall ↑ Single ↑ Two ↑ Counting ↑ Colors ↑ Position ↑ Attribution ↑
FLUX.1-dev (Vanilla) 1 0.67 0.99 0.81 0.75 0.80 0.21 0.48
+ Reprompt 1 0.72 0.99 0.79 0.68 0.84 0.51 0.52
+ Reprompt+GRPO 1 0.76 0.99 0.87 0.77 0.85 0.62 0.49
+ RAS (Ours) 1 0.77 0.99 0.84 0.76 0.84 0.67 0.54
+ Noise Scaling 32 0.85 1.00 0.96 0.91 0.91 0.52 0.78
+ RAS (Ours) 2 0.85 0.99 0.94 0.84 0.88 0.77 0.66
+ Prompt Scaling 32 0.87 0.99 0.94 0.85 0.91 0.80 0.71
+ RAS (Ours) 4 0.88 0.99 0.94 0.88 0.88 0.88 0.70
ReflectionFlow 32 0.91 1.00 0.98 0.90 0.96 0.93 0.72
+ RAS (Ours) 8 0.91 1.00 0.98 0.93 0.93 0.88 0.75
+ RAS (Ours) 32 0.92 1.00 0.99 0.92 0.93 0.93 0.76

消融实验与分析

表 2: 固定总预算为 8 时不同扩展维度分配对 Position 任务准确率的影响 (Table 3)

噪声采样数 (#Noise) 全局提示词数 (#Global) 区域规划数 (#Region) Position 准确率 (%) 说明
8 1 - 82% 纯噪声扩展(基线),缺乏显式空间控制
8 1 1 89% 单一区域规划注入,即便无区域重采样也有显著跃升
1 8 8 90% 纯提示词与区域规划扩展,无随机噪声多样性
4 2 2 91% 平衡配置,略偏向噪声探索
2 4 4 92% 最优平衡分配:适度噪声扰动 + 充分的区域与提示词搜索

表 3: 规划器鲁棒性及组件消融 (GenEval Position 任务, Table 4)

配置组件 准确率 (Acc. ↑) 说明
FLUX vanilla 0.21 原始基线,位置空间关系生成极差
+ LLM Rewrite 0.40 引入全局文本重写,带来有限的语义清晰度提升
+ LLM Plan + RAS (单样本) 0.60 引入区域规划与早期区域注入,直接跃升 20 个百分点
+ Best-of-2 (RAS N=2) 0.77 配合轻量 Best-of-2 扩展,达到高可靠性

表 4: T2I-CompBench 细粒度对齐评测与美学质量对比 (Table 5)

模型 属性-颜色 ↑ 属性-形状 ↑ 属性-纹理 ↑ 关系-空间 ↑ 关系-非空间 ↑ 复杂组合 ↑ HPSv3 美学评分 ↑
Vanilla FLUX 0.8821 0.7304 0.8662 0.5442 0.8823 0.8308 9.22
RPG (ICML 2024) 0.8902 0.7534 0.8952 0.7042 0.9025 0.8358 9.08
RAS (本文方法) 0.8921 0.7790 0.9107 0.7310 0.9133 0.8425 9.20

关键发现

  • 采样效率发生数量级跃升:在 FLUX.1-dev 上,RAS 仅使用 2 个样本即可达到 0.85 的总体得分,直接追平噪声扩展需要 32 个样本才能勉强达到的水平,采样数量压缩至 \(\frac{1}{16}\)。端到端测速显示,在 NVIDIA H100 GPU 上,达到同等或更高精度时 RAS 实现了 7.5 倍的整体推理加速。
  • 攻克空间关系的绝对短板:原始 FLUX 在 GenEval Position(空间位置关系)上的表现极弱,得分仅为 0.21;即便利经 32 次纯噪声采样也仅能提升至 0.52。而引入区域轴后,RAS 在 N=2 时即达到 0.77,N=4 时达到 0.88,彻底改变了复杂空间结构生成的概率空间形态。
  • 扩展维度的协同效应:消融实验揭示,单一维度的极化分配并非最佳。在总计算量固定的情况下,结合适度噪声扰动与区域提示词探索(如 2 噪声 × 4 提示词 × 4 区域)能取得 92% 的最高成功率,印证了“区域轴”与随机种子的强互补性。
  • 兼顾高保真组合与美学自然度:T2I-CompBench 评测表明,以往全流程施加区域控制的 RPG 方法会因过度约束导致美学得分下降(HPSv3 从 9.22 降至 9.08),而 RAS 凭借早期仅 10% 步数的注入机制,在大幅刷新空间关系(0.7310 vs 0.7042)的同时,HPSv3 保持在 9.20,几乎无损画质真实感。

亮点与洞察

  • 将空间区域升格为测试时计算扩展的一等公民:敏锐地指出此前视觉 TTS 过于局限于大语言模型借来的“噪声种子”或“重写搜索”,创新地将视觉任务特有的空间几何分解引入扩展搜索空间,使长尾空间关系不再被动依赖随机碰撞。
  • 仅在去噪前期的轻量区域注入策略:观察到扩散轨迹在前期确定宏观轮廓和拓扑、在后期雕琢细节与光影的物理特性,通过仅在 \(t < T_{\mathrm{rag}}\) 进行区域裁剪与融合,以极其微小的 10% 恒定延迟完全避免了物体边缘割裂伪影。
  • 免训练且与现有验证器高度解耦:无需对底层生成骨干与规划模型进行昂贵微调,可作为插件无缝叠加在 FLUX、SANA 等多种新型生成器及现成验证器(如 SANA-Verifier)之上,即插即用。

局限与展望

  • 对大模型空间规划能力的强依赖:当场景极其复杂、包含密集多物体及嵌套拓扑关系时,规划器 LLM 容易生成重叠混乱或不符合物理规律的边界框,进而导致生成失败;目前需引入人工几何硬约束规则辅助兜底。
  • 并行采样的算力开销:虽然采样样本总数大幅下降,但由于当前默认采用并行采样范式,在显存受限的边缘设备上若无法大批量并发,仍需要一定的单卡排队时间;后续可探索轻量顺序反思(Sequential Reflection)机制以进一步压缩峰值计算负荷。

相关工作与启发

  • vs Noise Scaling / Prompt Scaling: 传统的噪声扩展仅改变扩散轨迹初始点,提示词扩展仅改变全局文本条件,两者在面对空间关系多约束时均面临低概率模式的组合爆炸瓶颈;RAS 引入空间区域解耦,直接引导局部生成,大幅抬高了有效候选样本的分布密度。
  • vs RPG (Recaption, Planning and Generating): RPG 在整个扩散去噪全周期内持续对各子区域进行跨注意力或潜变量限制,计算量随区域数量线性增长且易产生局部接缝;RAS 仅在前 10% 去噪步介入,后期依靠全局注意力自愈,不仅计算代价近乎恒定,画质整体协调性也更加优异。
  • vs Reflect-DiT / ReflectionFlow: 反思微调类工作需要利用 VLM 评判反馈并对生成器进行昂贵的后训练对齐;RAS 坚持纯推理阶段、完全免微调的轻量定位,通用性与落地门槛显著更优。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次系统性提出将空间区域分解作为视觉测试时计算扩展(TTS)的核心搜索维度,打破了单一依赖噪声和全局提示词的局限。
  • 实验充分度: ⭐⭐⭐⭐⭐ 在 GenEval 与 T2I-CompBench 上进行了详尽的跨主干验证,包含细致的计算代价测算、多维度预算分配消融及规划器鲁棒性分析。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,图表对比直观生动,方法动机阐述清晰透彻。
  • 价值: ⭐⭐⭐⭐⭐ 为解决多模态文生图领域的复杂空间与组合属性绑定难题提供了极为实用的免微调落地范式,对扩散模型测试时推理优化极具启发性。