i-Design: Step-by-Step Graphic Layout Design with Progressive Aesthetic Policy Optimization¶
会议: ECCV 2026
论文: ECCV 原文
领域: 多模态VLM / 视觉语言推理
关键词: 平面布局生成、渐进式决策、审美策略优化、多模态大模型、强化学习
一句话总结¶
针对传统单阶段布局生成忽略设计迭代反馈且易致视觉失衡的缺陷,i-Design 将 2D 图文排版重塑为基于已渲染局部画布逐步放置元素的分组轨迹决策过程,并提出结合渐进式模仿学习与真值锚定共识图在线强化学习的审美策略优化范式,在几何对齐与多模型审美胜率上均大幅超越现有 SOTA。
研究背景与动机¶
自动平面图文布局生成(2D Graphic Layout Generation)是海报排版、网页 UI 构建、幻灯片制作与数字出版的核心驱动力。高质量的设计不仅依赖元素几何坐标的合理分布,更依赖视觉层级、阅读动线、对齐张力以及留白平衡等高度感性且复杂的审美规范。早期规则系统与能量模型受限于硬编码约束,泛化能力薄弱;随着深度生成模型与多模态大语言模型(如 LayoutTransformer、LayoutDiffusion、PosterLLaVA、LayoutNUWA 等)的兴起,基于序列化或扩散过程的端到端生成显著提升了多样性。然而,绝大多数现有方案均将布局生成定义为“单阶段一键生成(Single-shot Prediction)”,强行要求模型在单次前向推理中同时预测所有图文元素的绝对坐标。
这种单阶段建模严重违背了人类真实设计的认知迭代机理。专业设计师在创作时极少一蹴而就,而是遵循“放置核心锚点元素 \(\to\) 观察当前画面的视觉权重与平衡 \(\to\) 渐进安排次要内容 \(\to\) 动态避让微调”的闭环反馈流。单阶段生成缺乏中间视觉反馈,元素间极易发生错位重叠、视觉失衡或逻辑遮挡;更关键的是,主流训练直接采用坐标层面的监督回归或交叉熵损失,僵硬地惩罚了合理的审美排版变体,而在渲染图像层面对审美质量直接进行强化微调的技术(如偏好对齐)在平面排版领域尚处于起步阶段,且既有尝试大多局限于静态离线偏好,无法探索多步生成轨迹。
这引出了一个核心科学问题:能否将平面布局生成建模为渐进式、带渲染视觉反馈的轨迹级决策过程,并通过在线审美强化学习驱动生成器自我演化?本文的切入角度是,借助视觉语言模型(VLM)强大的空间理解与多模态感知能力,让模型在每一步观察已渲染的中间画布,递进放置下一组元素,同时利用专有审美判别器对多路轨迹进行图共识排序优化。核心 idea:将布局生成建模为序列化部分渲染反馈下的多步分组决策过程,通过渐进式模仿学习(PIL)构建鲁棒几何先验,并利用真值锚定共识图的渐进式审美策略优化(PAPO)实现在线轨迹级审美奖励回传。
方法详解¶
整体框架¶
i-Design 将排版任务解耦为多步轨迹推演。对于包含 \(N\) 个图文元素的集合 \(E=\{e_i=(p_i, s_i, \tau_i)\}_{i=1}^N\)(包含位置、尺寸与类别),模型按 \(z\)-order 顺序将其划分为 \(G = \lceil N/k \rceil\) 个有序放置组 \(A = \{A_1, \dots, A_G\}\),每组包含至多 \(k\) 个元素。在每一步 \(g\),底层渲染引擎 Skia 将历史已放置元素合成局部画布图像 \(C_{g-1}\);多模态编码器与解码器将画布感知、元素文本/图像内容与待预测标记融合,自回归预测后续所有组的位置。在推理阶段,模型仅真实落盘渲染当前组 \(A_g\),更新画布后进入下一轮,形成完整的推演轨迹。模型训练分为预训练、渐进式模仿学习(PIL)与渐进式审美策略优化(PAPO)三个阶段。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
In["输入待排版元素集合<br/>(类别/内容/图文特征)"] --> S1["分组与局部画布表征<br/>(按z-order划分组/Skia渲染中间态)"]
S1 --> S2["渐进式模仿学习 (PIL)<br/>(基于部分画布自回归监督预热)"]
S2 --> S3["渐进式审美策略优化 (PAPO)<br/>(在线动态采样多条排版候选轨迹)"]
S3 --> S4["真值锚定审美共识图评估<br/>(DesignSense成对判别/PageRank排序)"]
S4 --> Out["高审美协同最终布局生成<br/>(兼具几何精度与视觉平衡)"]
关键设计¶
1. 分组与局部画布表征:将连续设计过程离散化为具身视觉反馈闭环 以往的交互式或自回归布局模型通常逐个 token 展开,无法获得图形渲染层面的整体感官反馈;而单阶段生成则完全丧失了中间纠错能力。i-Design 采用基于元素层叠层次(\(z\)-order)的确定性分组策略,将 \(N\) 个元素划分为 \(G\) 组,每组规模设定为 \(k \approx \lceil\sqrt{N}\rceil\)。在第 \(g\) 步,已放置元素 \(e_i \in E^{<g}\) 拥有完整的边界框离散化标记,并经由 Skia 引擎渲染生成中间画布图像 \(C_{g-1} = \mathcal{R}(E^{<g})\);未放置元素则仅保留类别与内容描述。多模态提示语将已放置和待放置元素的口述表征有序拼接,连同视觉画布一同送入基于 InternVL-3 8B 的多模态架构 \(M_{\text{Layout}} = (f_{\text{enc}}, L_\theta)\)。这种设计既保留了未安排元素的全局设计意图,又让模型能够在具象化的当前视觉底板上感知空白区域、色调与视觉重心,从而决定下一组元素的恰当落点。
2. 渐进式模仿学习(PIL):通过多阶段局部画布条件化训练建立全局空间几何先验 直接引入无约束的强化学习容易导致动作空间搜索爆炸与几何发散,因此必须先通过监督学习注入稳定的排版语法。在 PIL 阶段,系统利用真值布局模拟设计演进过程:在训练步 \(g\),先渲染前 \(g-1\) 组的真实坐标得到真值局部画布 \(C_{g-1}^{GT}\),以此为视觉上下文,驱动模型直接预测剩余所有组的连续轨迹序列 \(A_{g:G}^{GT}\)。损失函数最小化模型在所有未来组 token 上的负对数似然: $\(\mathcal{L}_{\text{PIL}}(\theta) = -\sum_{h=g}^G \log \pi_\theta(A_h \mid C_{g-1}^{GT}, \mathcal{P}_g^E, Z_g)\)$ 这一训练机制使模型在面对任意半成品画布时,不仅学会如何放好紧随其后的当前组 \(A_g\),还能长程预演未来元素的全局承载空间,有效缓解了贪婪局部决策导致的“后期无处可放”问题。
3. 渐进式审美策略优化(PAPO):基于真实渲染判别与真值锚定共识图的有向在线强化学习 几何坐标的重合度(如 IoU)无法完全等同于人眼所感知的版面美感。为使模型学会视觉和谐度,PAPO 阶段引入在线强化学习(改编自 GSPO)。策略网络针对给定输入动态采样 \(m\) 条完整的候选排版轨迹 \(\mathcal{Z} = \{\zeta_1, \dots, \zeta_m\}\),并将其真实渲染为位图 \(L_i = \mathcal{R}(\zeta_i)\)。为防止审美评价偏移并提供稳定基准,真值布局图像 \(L_{GT}\) 被强制作为锚点混入评估候选池 \(\mathcal{L} = \{L_{GT}, L_1, \dots, L_m\}\)。系统采用开源专有布局判别器 DesignSense 对候选池中的布局对进行双向比对构建偏好有向图,并通过有向图上的迭代幂法计算每个布局的稳健审美强度得分: $\(S(L_i) = (1 - \gamma) \sum_{L_j \in \mathcal{N}^-(L_i)} \frac{S(L_j)}{|\mathcal{N}^+(L_j)|} + \frac{\gamma}{|\mathcal{L}|}\)$ 基于此得分,轨迹奖励结合了自身绝对美学表现与真值相对偏离项:\(r(\zeta_i) = S(L_i) + \alpha \exp\big(\beta(S(L_i) - S(L_{GT}))\big) + r_{\text{fmt}}\)。由于轨迹奖励在完成全部放置后评定,来自同一画布状态的所有后续组共享相同的标量优势函数 \(A_g^{\text{adv}} = r(\zeta) - b_g\),并在 token 级别累计策略梯度。这一机制保证了长程轨迹中的每一个决策点都能公平分摊全局审美反馈,促使模型学会全局协同与留白调度。
损失函数 / 训练策略¶
整个训练流水线分为三步: 1. 预训练初始化:在 148k 张图文布局数据集上进行 2 个 epoch 的多模态基座微调,构建基础空间坐标离散化编码(224 个离散位置 token)与文本-图形关联能力; 2. PIL 微调:在 Crello 数据集的 75% 划分上训练 5 个 epoch,利用多阶段随机切分的真值画布监督学习中间态条件化生成; 3. PAPO 在线对齐:在 Crello 剩余 25% 划分上执行 1 个 epoch 的在线 RL 微调。采样轨迹数 \(m=4\),阻尼因子 \(\gamma=0.85\),奖励缩放系数 \(\alpha=0.1\)、敏感度 \(\beta=1\),有效批大小为 128,采用 8 张 NVIDIA A100 (80GB) 进行分布式协同训练。
实验关键数据¶
主实验¶
在两个极具代表性的排版基准 Crello(专业平面/海报设计)与 WebUI(真实网页界面排版)上评估,对比指标包含几何重合度 Mean IoU(%)以及基于前沿大模型(GPT-4o 与 o3)的审美两两胜率 Win Rate(%)。
| 数据集 | 模型 | 参数量 | Mean IoU (↑) | GPT-4o 胜率 (%) | o3 胜率 (%) |
|---|---|---|---|---|---|
| Crello | FlexDM | - | 12.71 | - | - |
| Crello | LayoutDETR | - | 15.04 | 1.71 | 0.62 |
| Crello | LACE | - | 23.18 | 0.85 | 0.09 |
| Crello | PosterLLaVA | - | 25.18 | 2.19 | 1.01 |
| Crello | LayoutNUWA | - | 25.74 | 4.18 | 1.93 |
| Crello | LaDeCo | - | 35.25 | 14.42 | 8.73 |
| Crello | AesthetiQ | 8B | 42.83 | 15.74 | 8.04 |
| Crello | i-Design | 1B | 23.83 | 2.85 | 1.13 |
| Crello | i-Design | 2B | 30.96 | 6.74 | 1.98 |
| Crello | i-Design | 4B | 43.47 | 17.59 | 10.37 |
| Crello | i-Design | 8B | 48.27 | 27.64 | 19.03 |
| WebUI | Desigen | - | 15.36 | 4.81 | - |
| WebUI | LayoutDETR | - | 16.11 | 5.27 | - |
| WebUI | LACE | - | 17.88 | 5.27 | - |
| WebUI | PosterLLaVA | - | 30.19 | 14.73 | - |
| WebUI | LayoutNUWA | - | 32.16 | 15.28 | - |
| WebUI | LaDeCo | - | 41.16 | 19.49 | - |
| WebUI | AesthetiQ | 8B | 48.29 | 24.48 | - |
| WebUI | i-Design | 1B | 39.24 | 18.03 | - |
| WebUI | i-Design | 2B | 43.18 | 21.40 | - |
| WebUI | i-Design | 4B | 47.86 | 24.35 | - |
| WebUI | i-Design | 8B | 53.71 | 31.29 | - |
消融实验¶
1. 强化学习策略与真值锚定效应消融 (Crello, i-Design-8B)
| 训练策略配置 | Mean IoU (↑) | GPT-4o 胜率 (%) | o3 胜率 (%) | 机制说明 |
|---|---|---|---|---|
| i-Design-8B + PIL | 44.39 | 20.41 | 15.28 | 仅采用监督式渐进模仿学习 |
| i-Design-8B + PIL + AAPA | 46.62 | 25.60 | 16.79 | 引入前人静态偏好对齐方法 |
| i-Design-8B + PIL + PAPO (无真值锚定) | 45.19 | 23.04 | 15.39 | 移除图排序中的真值参考项 |
| i-Design-8B + PIL + PAPO (完整模型) | 48.27 | 27.64 | 19.03 | 在线探索 + 真值锚定共识图 |
2. 放置组大小 \(k\) 与分组策略消融 (Crello, i-Design-8B)
| 变量类别 | 具体配置 | Mean IoU (↑) | GPT-4o 胜率 (%) | o3 胜率 (%) | 核心结论 |
|---|---|---|---|---|---|
| 分组大小 \(k\) | \(k = N\) (单阶段生成) | 40.28 | 17.64 | 13.59 | 丧失中间视觉反馈,几何与美感显著衰退 |
| 分组大小 \(k\) | \(k = 1\) (单元素极端自回归) | 47.72 | 27.13 | 18.31 | 步数过多增加累积误差且计算昂贵 |
| 分组大小 \(k\) | \(k = \lceil\sqrt{N}\rceil\) (默认折中配置) | 48.27 | 27.64 | 19.03 | 最佳平衡点,保留上下文且全局推理稳健 |
| 分组策略 | 随机打乱分组 (\(\sqrt{N}\)) | 43.27 | 15.04 | 6.11 | 中间画布视觉混乱,破坏空间连续性 |
| 分组策略 | GPT-4o 语义聚类分组 | 46.21 | 29.23 | 19.91 | 美感略有提升,但需额外调用 LLM 产生额外开销 |
| 分组策略 | \(z\)-order 确定性分组 (默认) | 48.27 | 27.64 | 19.03 | 免外部调用,几何与审美综合表现最优 |
关键发现¶
- 渐进反馈打破单阶段天花板:当组大小设为 \(k=N\)(退化为单次直接生成)时,Mean IoU 骤跌 7.99%,GPT-4o 胜率暴跌 10.00%。这强有力证明了中间真实渲染画布作为具象视觉反馈对于排版纠偏与空间分配的必要性。
- 真值锚定防止强化学习“审美漂移”:在 PAPO 中剥离真值锚定布局(w/o GT)会导致 mIoU 下降 3.08%,GPT-4o 胜率跌落 4.60%。纯粹的判别器内部相对打分极易陷入局部欺骗或结构坍塌,真值作为拓扑图锚点起到了强大的正向拉紧作用。
- 模型体量展现出明确扩展律:从 1B 扩展至 8B,i-Design 在 Crello 上的 mIoU 从 23.83% 跃升至 48.27%,GPT-4o 胜率从 2.85% 跃升至 27.64%,说明更强大的 VLM 底座对空间美学感知与复杂布局约束的捕捉能力显著增强。
- 真实用户研究印证算法优势:在 4 种方法的盲测用户偏好评估中,i-Design 斩获 52.9% 的最高赞成率,远超前 SOTA AesthetiQ(40.7%)、LayoutNUWA(3.6%)与 LACE(2.8%)。
亮点与洞察¶
- 设计范式的人性化重塑:突破了长期以来学术界习惯将排版简化为“一揽子坐标预测”的粗暴假设,开创性地将人类设计师的“试探-观摩-补全”渐进逻辑形式化为可微/强化学习闭环。
- 真值图共识强化学习机制(PAPO):利用 DesignSense 构建双向成对比较图,并借助类似 PageRank 的平滑幂迭代求解全局稳健得分,有效克服了传统奖励模型单点评分方差大、评分标准飘移的顽疾。
- 可复用的通用设计启示:把复杂大图/复杂文档的排版任务拆解为 \(z\)-order 序列分组并辅以 \(k \approx \lceil\sqrt{N}\rceil\) 的半局部分析,不仅能推广至幻灯片、UI 界面布局,还可以迁移到基于 VLM 的具身规划与图表装配任务中。
局限与展望¶
- 依赖预定义层叠顺序(\(z\)-order):当前默认采用 \(z\)-order 进行分组,对含有极端前景-背景非线性嵌套逻辑的异形设计可能不是绝对最优,探索端到端动态自适应分组策略是未来方向。
- 在线采样渲染的时延开销:PAPO 训练中需要在每次迭代实时调用图形库 Skia 渲染位图并运行外部 VLM 判别器,单卡吞吐量低于离线静态偏好微调,训练资源门槛相对偏高。
- 高阶设计属性的缺失:当前模型主要预测边界框坐标与尺寸(\(p_i, s_i\)),对于文字字体选型、层级字号、调色盘色彩搭配与透明度混合等深层设计维度的联合决策尚未完全覆盖。
相关工作与启发¶
- vs AesthetiQ:AesthetiQ 首次在排版中引入 VLM 偏好微调,但采用的是单阶段生成和静态离线偏好,容易受到坐标刚性惩罚;i-Design 改为在线多轨迹采样与真值锚定共识图,在 Crello 上实现了 +5.44% mIoU 和 +11.90% GPT-4o 胜率的大幅跃升。
- vs LaDeCo:LaDeCo 探索了逐步元素摆放,但依然停留在监督学习范式,缺乏对最终渲染视觉效果的端到端审美反馈;i-Design 结合了渐进模仿与审美强化学习,在 WebUI 上将胜率从 19.49% 提升至 31.29%。
- vs LayoutNUWA & PosterLLaVA:后者依赖纯语言模型或静态视觉引导,单阶段推导容易出现字图穿透与留白失衡;i-Design 引入逐步渲染中间态作为硬反馈,有效消除了布局错位。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次将逐步生成决策流与图共识在线审美策略优化有机融合,范式颠覆性强。
- 实验充分度: ⭐⭐⭐⭐⭐ 覆盖两大 Benchmark、从 1B 到 8B 全尺度对比、四个维度的扎实消融以及真人用户评测。
- 写作质量: ⭐⭐⭐⭐⭐ 形式化定义严谨自洽,图表完备,逻辑链条流畅。
- 价值: ⭐⭐⭐⭐⭐ 为自动化平面排版与具身图文设计系统提供了切实可行、极具启发性的工程与算法范本。