跳转至

FlowLess: Controlling Abstract Image Generation

会议: ECCV 2026
论文: ECCV 原文
领域: 图像生成
关键词: 抽象图像生成、Flow 模型、视觉抽象集、逐部分调制、极简主义构图

一句话总结

FlowLess 提出了一种通过视觉抽象集(非语义图元与构图细节)可控生成抽象图像的自监督框架,利用几何数据增强与逐部分调制隐式学习抽象自由度,并通过覆盖率分数实现抑制冗余生成先验、合成纯粹极简构图的灵活控制。

研究背景与动机

现代大规模文本到图像生成模型(如基于扩散与整流流的 DiT 架构)虽然在根据文本提示合成写实、高保真图像方面展现出惊人的生成能力,但在面对非语义抽象图元的组合与极简主义艺术创作时,往往陷入生成先验的束缚。正如建筑理论家阿尔伯蒂(Leon Battista Alberti)在文艺复兴时期所阐述的古典美学——“美是各部分之间深思熟虑的和谐,增之一分、减之一分、改动一处皆损其美”;现有的生成模型天生倾向于“添枝加叶”,用海量的纹理与细节填满画布,用户极难控制生成模型在面对抽象元素时的表现力与极简程度。

现有的视觉条件控制方案主要聚焦于具象实体的定制组合或全局风格与空间布局的刚性约束。然而,在以几何抽象、极简插画、笔触印章为代表的抽象艺术创作中,艺术家通常需要根据一组不具备独立语义的离散视觉基元(如几片水彩污斑、几条墨迹、若干几何矢量块),自由拼贴并重构出多样的具体语义概念。现有模型要么对输入几何施加了过强的空间网格限制,要么在全局风格迁移中丢失了离散图元的几何边界,完全无法提供一种既能保持特定图元几何、又能宽松演绎其它图元的细粒度抽象控制机制。

本文的切入角度是:如果打破“将参考图像视为语义主体或全图风格”的传统范式,将视觉输入解构为非语义的视觉抽象集,并借助流匹配模型的调制空间进行逐元素特征注入,就能赋予用户调节抽象等级与生成冗余度的自由。核心 idea:构建包含离散视觉基元与交互关系的视觉抽象集,通过自监督多级几何增强与逐部分调制残差,让流模型在联合序列中学习多级抽象演绎,并由全局覆盖率分数精准控制生成画面的极简抽象度。

方法详解

整体框架

FlowLess 构建了一个自监督训练流匹配微调范式。系统以图元解构与交互关系为起点,将输入图像拆解为由若干不重叠图元与图元间局部交互细节组成的视觉抽象集;在训练时,系统对提取的图元施加多级几何扰动并引入随机丢弃,计算出当前输入图元占全图的覆盖率;随后,扩展的 DiT 序列同时接收文本、噪声图像与抽象图元嵌入,并通过在调制层中注入逐图元增强残差与全局覆盖率残差,实现对流场速度预测的细粒度多重条件约束;在推理阶段,用户不仅能为每个图元指定保持原样、宽松演绎或定位补全的生成角色,还能通过覆盖率分数直接调控生成画面脱离画布冗余的极简抽象程度。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入样本<br/>SVG矢量 / 光栅插画"] --> B["自监督抽象集解构<br/>图元分割 + 关系图局部渲染"]
    B --> C["多级几何扰动与丢弃<br/>三级几何变换 + 覆盖率计算"]
    C --> D["扩展序列与逐图元调制<br/>DiT序列拼接 + 调制残差注入"]
    D --> E["覆盖率引导的极简抽象控制<br/>全局覆盖率调制 + 速度场预测"]
    E --> F["输出抽象图像<br/>兼顾概念叙事与纯粹图元构图"]

关键设计

1. 自监督抽象集解构:从成对图像中自动分离非语义图元与构图细节

针对抽象图像生成缺乏“基元集合与成品图像”配对监督数据的根本痛点,该设计提出了自动化解构与关系拓扑构建流程。对于原生具有图元路径信息的 SVG 矢量图像,直接提取其内部各 Path 与几何形状基元;对于更具丰富艺术纹理但难以直接拆解的标准光栅图像,利用 SAM 分割模型在密集网格上提取基础图斑,并通过关系感知修复模型将相交与重叠区域的遮挡部分补全,从而获得相互独立的基础图元。为了弥补离散基元丢失图元相对空间与材质叠加逻辑的问题,算法在所有图元对之间构建关系图,当两图元存在包含、相交或邻近关系时建立边,并在交界处截取固定半径的局部圆形细节视图,作为图元交互关系的视觉代理输入。

2. 扩展序列与逐图元调制:在调制空间解耦不同图元的抽象演绎自由度

传统条件控制往往将参考图像通过注意力或全局拼接注入模型,难以对集合内不同图元赋予差异化的控制严格程度。FlowLess 在微调预训练整流流模型(Flux.1-dev)时,将视觉抽象集编码后的嵌入向量序列直接追加至 Transformer 的输入序列中,与文本嵌入、图像 Patch 嵌入共同参与全注意力交互:

\[Z = \{z_{\text{text}}^{i}\}_{i=1}^{\#\text{text}} \cup \{z_{\text{image}}^{i}\}_{i=1}^{\#\text{image}} \cup \{z_{\text{abs}}^{i}\}_{i=1}^{\#\text{abs}}\]

为了让网络理解各图元在几何形变上的容忍度,针对不同图元施加的三级几何扰动(原位固定、中心旋转缩放、随机裁剪去轮廓)以及局部关系细节,模型在 DiT 的调制空间中学习了对应的离散扰动残差向量 \(\Delta_{\text{aug}}\)。通过将扰动残差逐通道叠加到该图元对应嵌入的调制向量上(\(\hat{y}_i = y + \Delta_{\text{aug}}\)),网络学会了根据调制信号决定是严格保全图元轮廓(Preserve 模式),还是仅抽取其颜色与材质自由重构成新物体部件(Free-use 模式),亦或是作为背景基底进行单图元延展补全(Complete 模式)。

3. 覆盖率引导的极简抽象控制:以连续变量调控模型的表现力与极简度

为了解决文本提示与参考图像无法度量“生成模型应该添加多少额外装饰”的固有缺陷,FlowLess 引入了连续覆盖率分数机制。在训练过程中,设图像包含的真实总图元数为 \(A\),每次随机抽取 \(n\) 个图元输入模型(覆盖率 \(\tilde{c} = n / A \in [0, 1]\))。模型利用傅里叶特征映射将连续标量 \(\tilde{c}\) 投影至高维空间,再通过 MLP 回归出专属于图像 Patch 嵌入的全局调制残差 \(\Delta_{\text{cov}}\)。在推理阶段,当用户将覆盖率设为较低值(如 0.1)时,模型被允许发挥强生成先验,填补丰富的背景与装饰细节;而当用户将覆盖率提升至 1.0 时,流模型受到严格约束,仅依靠用户给定的离散抽象集图元构建主体,抑制一切多余装饰,从而达成真正符合阿尔伯蒂美学准则的极简主义构图。

损失函数 / 训练策略

模型基于预训练的 Flux.1-dev 进行端到端整流流微调,优化目标保持标准速度匹配均方误差不变:

\[\mathcal{L}_{\theta} = \mathbb{E}_{t, x_0, p, x_1} \left[ \left\| v_{\theta}(x_t, t, p, Z_{\text{abs}}) - (x_1 - x_0) \right\|^2 \right]\]

训练阶段采用余弦调度器并施加 \(2\log(2)\) 的 log-SNR 偏移以加大高噪声时间步权重,采用 64 块 TPU-v3 进行 ZeRO 显存切分与数据并行。训练混合了 100K 组至少包含 3 条路径的高质量 SVG 图元和 50K 组利用 Gemini 生成描述、由 Flux.1-dev 合成并自动拆解的光栅插画,单批次容量达 512 个图元集对,迭代 4K 步即可收敛。

实验关键数据

主实验

评估基于包含 100 个由 Gemini 自动生成的具象概念文本提示和 10 套覆盖水彩、墨迹、记号笔、矢量图元的多风格抽象集(共合成 1,000 张图像样本)。客观指标采用 CLIP Score 评估文本对齐度,采用基于 DINOv2 特征空间的双向 Chamfer 相似度评估生成图像与输入图元集的一致性(Set Alignment);主观指标通过 20 名受试者参与的 1-vs-1 双选实验(共 480 组比对),统计用户偏好 FlowLess 胜过各基线的百分比。

方法 文本对齐度 (CLIP) ↑ 图元集对齐度 (DINO Chamfer) ↑ 用户偏好率 (User pref.)
InstantStyle 0.185 ± 0.046 0.454 ± 0.064 78.1%
OmniControl 0.242 ± 0.033 0.409 ± 0.061 88.3%
DreamO 0.235 ± 0.033 0.419 ± 0.062 93.5%
Qwen-Image-Edit 0.239 ± 0.029 0.419 ± 0.067 79.1%
Flux.2-dev 0.239 ± 0.029 0.429 ± 0.062 93.7%
Flux.2-dev + MMPE 0.207 ± 0.043 0.467 ± 0.078 80.9%
Ours (Free-use) 0.196 ± 0.045 0.475 ± 0.073 74.5%
Ours (Preserve) 0.172 ± 0.046 0.495 ± 0.065 —

注:用户偏好率汇报的是受试者在 1-vs-1 对比中认为 FlowLess (Free-use) 更好地利用给定图元表现抽象概念的胜率。在所有对比中,FlowLess 均取得显著优势。

消融实验

消融实验重点验证了不同训练数据模态混合配比对抽象表达能力的影响,以及图元覆盖率 \(\tilde{c}\) 与调制模式在对齐权衡中的定量表现。

训练配置 / 模态 覆盖率设定 \(\tilde{c}\) 图元集对齐度 文本对齐度 构图特性与失效分析
纯 SVG 数据训练 0.1 → 1.0 连续扫描 0.420 ~ 0.435 0.150 ~ 0.170 艺术纹理严重受限,生成图像单薄且质感偏低
纯光栅数据训练 \(\tilde{c} \le 0.4\) 0.435 ~ 0.455 0.220 ~ 0.230 文本遵循性良好,但在少数图元时无法抑制多余装饰
纯光栅数据训练 \(\tilde{c} > 0.5\) 急剧退化 (< 0.44) 0.160 ~ 0.170 训练样本缺少极端少图元样本,高覆盖率极简泛化失败
混合全模型 (Free-use) \(\tilde{c} = 0.1 \to 1.0\) 0.445 → 0.475 0.228 → 0.196 随覆盖率提升平滑过渡,在材质自由复用与构图极简间取得平衡
混合全模型 (Preserve) \(\tilde{c} = 0.1 \to 1.0\) 0.465 → 0.495 0.210 → 0.172 严格锚定轮廓几何,在最高覆盖率下达到最高基元保真度

关键发现

  • 生成表现力与几何保真度的权衡规律:提高覆盖率分数 \(\tilde{c}\) 会使模型收缩生成自由度,主动剔除非抽象集图元,使 DINO Chamfer 相似度大幅上升(在 Preserve 模式下最高达 0.495),但同时会轻微牺牲通用文本对齐度(CLIP 从约 0.23 降至 0.17~0.19),这客观印证了纯粹抽象艺术在脱离自然写实语义时所具有的形式独立性。
  • 混合数据模态的互补性:纯 SVG 训练虽然图元解构纯净,但缺少自然写实笔触和复杂材质,合成质量糟糕;纯光栅训练虽然风格多样,但因 SAM 提取的图元数量偏多(峰值在 20~60 个),导致模型无法适应 5~8 个图元的极度少样本场景。两者按 2:1(100K:50K)混合训练是模型实现高质感与极简抽象泛化的最关键使能因素。
  • 逐图元异构控制的有效性:在自由复用(Free-use)模式下,模型能够将圆形笔触灵活变为大象的滑轮鞋;而在保持(Preserve)模式下,相同的墨斑能被严格保持原形作为花朵主体。此外,利用固定的基础图元(Fixed 模式)进行画面补全(Completion),能围绕单一图形生成完全不同的数十种创意实体。

亮点与洞察

  • 将美学哲学具象为模型超参数:论文巧妙将文艺复兴大师阿尔伯蒂“无饰即美”的抽象美学理念,转化为 DiT 调制层中的“连续覆盖率变量”,首次让扩散/流模型具备了显式调控“画得多还是画得少”的极简控制维度。
  • 自监督图元解构与多级扰动注入:无需任何昂贵的人工抽象艺术标注,通过矢量提取与光栅分割修复自动生成图元,并用三级几何扰动残差教导流匹配模型在不同抽象等级(几何严苛保留 vs 语义抽象解构)之间平滑插值。
  • 跨概念视觉组件重构能力:证明了同一套离散水彩或墨水几何块,可以像积木一样拼装出诸如“吹萨克斯的鸟”、“水母”、“大象”等完全不同的语义实体,为图形设计、图标生成与品牌抽象视觉延展提供了全新的通用范式。

局限与展望

  • 复杂语义逻辑的构图局限:当目标文本提示涉及复杂的空间逻辑关系或过于具象的多实体交互时,受限于抽象图元的形状表达力,模型可能会出现语义拼贴生硬或无法准确传达动作意图的情况。
  • 极端几何与材质跨越的适配断层:若输入的抽象图元极度单一(如仅有一条简单黑线),且强行设置 Preserve 模式去匹配高度具象且结构复杂的文本时,画面容易产生几何撕裂或强行嵌入的不和谐感。
  • 未来向时序动态领域的延展:作者指出未来不仅可以结合多模态大模型增强对复杂抽象构图的语义理解,更可将该理念拓展至视频生成领域,提取并控制非语义的时序动作律动、抽象动画节律或流体动力学特效。

相关工作与启发

  • vs InstantStyle / OmniControl / DreamO: 这些先进的参考图条件生成模型主要将输入图片视为整体风格参考或特定具象物体主题(Subject),在条件注入时往往引入了全局纹理或先验结构,导致生成画面充满多余装饰;FlowLess 能够实现图元级的细粒度离散拼贴,并提供极简构图控制。
  • vs CLIPDraw / VectorFusion / Word-As-Image: 早期抽象合成方法主要依赖基于可微矢量光栅化的逐实例测试时优化,推理极其耗时且难以通用泛化;FlowLess 基于大规模预训练整流流模型进行自监督微调,以单次前向扩散采样即可高质量完成各种抽象艺术创作。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次系统性提出面向离散非语义图元的抽象图像生成与表现力控制框架,切入点与构思极具启发性。
  • 实验充分度: ⭐⭐⭐⭐☆ 定量涵盖双向 DINO 特征 Chamfer 匹配与主观双盲评测,消融分析透彻,且展示了单图元保持、关系引导及图像补全等多类创意应用。
  • 写作质量: ⭐⭐⭐⭐⭐ 引用阿尔伯蒂美学文脉作为开篇立论,逻辑严密,图文对照详尽,方法与数学推导清晰流畅。
  • 价值: ⭐⭐⭐⭐☆ 为数字艺术设计、插画生成与品牌创意设计开辟了全新的非语义图元可控生成范式。