跳转至

InnoText: A Unified Model for Visual Text Generation and Editing

会议: ECCV 2026
论文: ECCV 原文
领域: 图像生成
关键词: 视觉文本生成 / 视觉文本编辑 / 扩散Transformer / 字体尺度感知调制 / 双语图文基准

一句话总结

基于 Flux.1 Fill 扩散 Transformer 架构,通过双联画(Diptych)上下文输入范式、字体尺度感知调制(FSAM)与小字符感知数据增强(SCAA),实现中英文视觉文本生成与局部编辑的高精度统一建模。

研究背景与动机

基于扩散模型的生成技术已在自然图像合成中取得了令人瞩目的进展,但将其扩展到包含文字的场景图像生成(Visual Text Generation)与局部文本编辑(Visual Text Editing)时,依然面临严峻的保真度瓶颈。视觉文本要求文字具备严格的笔画拓扑几何规范、字符间距一致性以及语义可读性。早期基于 UNet 架构的模型(如 AnyText、AnyText2)受限于局部卷积感受野与较弱的长程语义关联能力,在处理复杂背景、非平整表面或长文本行时极易产生笔画畸变、字形扭曲和局部伪影;而新近兴起的 Diffusion Transformer(DiT)方法(如 TextFlux)虽展现出更强的细粒度建模潜力,却普遍局限于单一的文本生成或单一的文本编辑任务,导致训练流程冗余、生成风格割裂,难以在跨任务间迁移共享表征。

更严峻的挑战来自于复杂字形与极端尺度问题。现有方法大多主要面向结构规则的拉丁字母体系进行优化,而面对汉字等非拉丁语系时表现脆弱。汉字作为典型的表意文字,包含偏旁部首、交叉穿插等极其精细的笔画结构,当字体缩小为微小尺度(Micro-scale / Diminutive Text)时,特征下采样往往导致关键笔画拓扑信息严重丢失,使模型频繁生成难以辨认的笔画团块。与此同时,开源社区中高分辨率、高质量的双语(中文-英文)排版图像数据集极度匮乏,现有数据集要么以英文为主,要么中文部分美学评分低下、文字标签对齐粗糙,难以支撑跨语言、跨尺度的高质量文本生成与编辑。

为了打破任务割裂与尺度失真的双重壁垒,本文提出了首个基于 DiT 架构的统一视觉文本生成与编辑模型 InnoText。本文的切入点是借助上下文学习(In-context Learning)的输入拼接范式,将文字生成(从零合成文本图)与局部编辑(在已有画面中擦除/替换指定文字)形式化为统一的图像修复流程,并在特征层针对不同字体尺度注入自适应先验。核心 idea:将视觉文本生成与编辑统一为单模型内的双联画上下文修复范式,结合编码逆字体高度的尺度感知调制(FSAM)与小字符随机放大机制(SCAA),彻底解决微小字体与复杂汉字笔画的拓扑坍塌难题。

方法详解

整体框架

InnoText 构建于开源高性能扩散 Transformer 基础模型 Flux.1 Fill dev 之上。该骨干网络天然具备依据遮罩图像与引导条件进行画面填充的能力,InnoText 通过设计自适应的双联画(Diptych)空间拼接输入范式与自适应先验调制,使其无需变更核心骨干即可无缝切换于生成与编辑两种任务之间。

在输入表示上,模型将图像条件划分为三部分:待修改或参考图像输入 \(I_{\text{masked}}\)、字形渲染图 \(I_{\text{glyph}}\) 以及空间遮罩 \(M\)。为实现架构统一,两类任务均在空间维度将字形图与目标画布拼接组成左右双联画: - 编辑任务(Edit Mode):输入图像设为 \(I_{\text{input}} = \text{Concat}([I_{\text{glyph}}, I_{\text{masked}}], \text{dim}=0)\),对应的遮罩设为 \(I_{\text{mask}} = \text{Concat}([\mathbf{0}, M], \text{dim}=0)\),模型仅在遮罩区域重新合成目标文字,严格保留周围背景上下文; - 生成任务(Generation Mode):输入图像拼接空白黑布画布,即 \(I_{\text{input}} = \text{Concat}([I_{\text{glyph}}, \mathbf{0}], \text{dim}=0)\),遮罩则将整个生成区域置为完全待生成状态 \(I_{\text{mask}} = \text{Concat}([\mathbf{0}, \mathbf{255}], \text{dim}=0)\),模型依据字形与提示词从零合成整幅高质量排版图像。

整体流水线如下图所示:

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["双联画输入构建<br/>拼接字形图与画布/遮罩"] --> B["字体尺度感知调制 (FSAM)<br/>提取灰度尺寸图并自适应调制隐状态"]
    B --> C["小字符感知数据增强 (SCAA)<br/>针对微小字形执行随机几何放大"]
    C --> D["DiT 流匹配去噪骨干<br/>多模态注意力协同更新图文特征"]
    D --> E["任务特定区域加权损失<br/>编辑强调局部细节,生成统筹全局一致"]

关键设计

1. 字体尺度感知调制(FSAM):以灰度尺寸图自适应校准多尺度潜空间特征

统一视觉文本生成的一大核心痛点在于大字号排版与微小字符在特征空间中的尺度敏感性失衡。常规的自适应归一化(AdaLN)对全图施加均匀的仿射变换参数,使得网络注意力过度偏向面积占优的大字,造成小字区域笔画模糊或漏生。FSAM 摒弃了传统的二值化遮罩,为每个样本构建一张连续灰度尺寸图(Size Map)。对于检测到的每个字符外接框,首先计算其近似字高 \(F_h\)

\[F_h = \max(\min(h_{\text{bbox}}, w_{\text{bbox}}), 1)\]

为了在特征层面显式增强对微小字符的关注,算法取字高的倒数赋值给对应文字包围盒区域,并经过全图归一化至 \([0, 1]\) 区间。该灰度尺寸图经 Patch 化并展平为序列后,通过线性投影视角与 DiT 隐藏状态对齐,映射为尺寸图潜向量 \(S'\)。随后通过平行的两路 MLP 分支分别解耦计算尺度增益 \(\gamma(s)\) 与偏置位移 \(\beta(S')\)

\[\gamma(s) = 1 + \gamma_{\text{max}} \cdot \sigma(k(s - 0.5)), \quad \beta(S') = \lambda_{\text{shift}} \cdot \tanh(\text{MLP}_{\text{shift}}(S'))\]

最终在 DiT 模块输出隐状态 \(H\) 上执行调制变换 \(H' = H \odot \gamma(s) + \beta(S')\)。该设计让网络在保留大字全局排版和谐的同时,对微小文字区域动态放大特征响应增益,确保各尺度字体特征的尺度不变性。

2. 小字符感知数据增强(SCAA):以随机缩放中央凹机制蒸馏微小字形先验

面对笔画极其密集且复杂的汉字小字,仅靠隐空间调制仍难以完全避免亚像素层面的笔画粘连。SCAA 借鉴了生物视觉系统中的中央凹聚焦机制,在训练阶段对微小字符区域执行随机局域放大。当检测到字符实例的估计字高低于预设几何阈值 \(\tau\) 时,系统以基础缩放倍率 \(\lambda\) 和微小随机扰动 \(\delta \sim \mathcal{U}(-\epsilon, \epsilon)\) 对该局部区域执行空间重采样:

\[R' = \text{Resize}(R, \lambda + \delta)\]

这种随机缩放丰富了模型在训练过程中对微小文字多分辨率形态的感知暴露,强制网络学习汉字笔画拓扑结构在不同采样率下的亚像素先验,有效抑制了微观字形的表征退化。在推理阶段,该策略对局部编辑任务保持对称应用,以维持训练与测试分布的一致性;而在全图生成任务中则关闭此缩放,以完全尊重原始参考模板的字体排版与整体构图。

3. 任务特定区域加权损失:解耦编辑局部高精修正与生成全局语义一致性

在单模型统一架构下,视觉文本编辑与生成对优化目标的需求存在天然张力:编辑任务的核心诉求是在尽可能不干扰背景的前提下,实现被遮罩局部的像素级精准字形重构;而生成任务则需要从零统筹整体画布的光影、构图与文字排版风格。若采用单一均方误差或标准流匹配损失(Flow Matching Loss),极易导致两项任务相互制约。为此,InnoText 引入了任务特定的区域加权损失策略:

\[\mathcal{L}_{\text{total}} = \begin{cases} \| v_t - u_t \|^2 \odot W_{\text{size}}, & \text{若为编辑任务 (Edit Mode)} \\ \| v_t - u_t \|^2, & \text{若为生成任务 (Gen Mode)} \end{cases}\]

其中 \(v_t\) 为流匹配速度预测向量,\(u_t\) 为目标速度场,\(W_{\text{size}}\) 为由上述连续尺寸图衍生的空间权重图。在编辑模式下,损失函数为文字编辑区域及微小字符赋予更高的监督权重,迫使模型精细优化字形边界;而在生成模式下则采用全局一致监督,保障全图构图自然度与背景纹理的真实感。

损失函数 / 训练策略

模型采用 Rectified Flow 流匹配目标函数进行优化。在训练过程中,批次内以 \(0.5\) 的均等概率随机交替采样编辑任务与生成任务样本,确保两种模式的平衡收敛。优化器选用 Prodigy 自适应优化器,权重衰减(Weight Decay)设为 \(0.01\),并在 Flux.1 Fill dev 主干上加载 LoRA 微调,LoRA Rank 设置为 \(128\)。SCAA 模块的尺寸阈值比例 \(\lambda\) 与扰动因子 \(\epsilon\) 分别设为 \(1.5\)\(0.3\)。全部训练在 8 张 NVIDIA A100 GPU 上进行,总计迭代 30,000 步,训练与评测图像统一调整为 \(512 \times 512\) 分辨率。

此外,为支撑双语高质量训练,研究团队构建了包含 30K 样本的 InnoText-30K 数据集(20K 中文 + 10K 英文)。中文部分通过将英文高美学数据集 Lex-10K 提示词经由 InternVL-3 语义扩充后由 Seedream 引擎生成高质底图,辅以 Anyword-3M 真实图文子集,并经过 NIMA 美学打分过滤、PP-OCRv4 文本框重标注以及 DeepSeek-VL2 密集图文配准清洗,构筑了高美学、强对齐的双语基石。

实验关键数据

主实验

评估涵盖 AnyText-Benchmark(用于编辑任务评估)与 InnoText-Bench(用于生成任务评估)。评估指标包括句子识别准确率(Sentence Accuracy, Sen. Acc)、归一化编辑距离(Normalized Edit Distance, NED)以及感知视觉质量指标(LPIPS)。对比基线涵盖 UNet 架构代表(AnyText, AnyText2)与 DiT 架构代表(Flux-Fill, TextFlux)。

任务 方法 英文 Sen. Acc ↑ 英文 NED ↑ 英文 LPIPS ↓ 中文 Sen. Acc ↑ 中文 NED ↑ 中文 LPIPS ↓
文本编辑 (Edit) Flux-Fill 0.1342 0.2481 0.1650 0.0191 0.0443 0.1276
AnyText 0.6839 0.8632 0.1234 0.6410 0.8209 0.1093
AnyText2 0.7893 0.9082 0.1739 0.7079 0.8419 0.1509
TextFlux 0.7732 0.8908 0.0838 0.7164 0.8498 0.0567
InnoText (本文) 0.7988 0.9016 0.0786 0.7257 0.8579 0.0591
文本生成 (Gen) Flux-Fill 0.0126 0.0635 0.6232 0.0057 0.0200 0.6402
AnyText 0.4707 0.7509 0.6463 0.4584 0.6440 0.6575
AnyText2 0.5638 0.7712 0.6330 0.5262 0.6636 0.5979
TextFlux 0.0071 0.0623 0.5968 0.0187 0.0470 0.6527
InnoText (本文) 0.6586 0.8066 0.4787 0.5907 0.6837 0.5311

消融实验

消融实验在中英文混合评测集上深入分析了各个组件在文本编辑与生成任务中的独立贡献,同时对比了现有基线在相同 InnoText-30K 数据集微调(-FT)后的表现。

配置 编辑 Sen. Acc ↑ 编辑 NED ↑ 编辑 LPIPS ↓ 生成 Sen. Acc ↑ 生成 NED ↑ 生成 LPIPS ↓ 说明
AnyText-FT 0.5794 0.7138 0.1009 0.4622 0.6513 0.6186 相同微调数据下的 UNet 基线
AnyText2-FT 0.5882 0.7341 0.0532 0.5358 0.6801 0.5539 增强型 UNet 微调基线
w/o FSAM 0.5672 0.7048 0.0604 0.5508 0.6479 0.5928 移除字体尺度感知调制模块
w/o SCAA 0.5963 0.7196 0.0497 0.5615 0.6418 0.5539 移除微小字符随机增强策略
w/o \(\mathcal{L}_{\text{T-SRW}}\) 0.6180 0.7533 0.0509 0.5892 0.6592 0.5671 移除任务特定区域加权损失
完整模型 (w/ all) 0.6374 0.7528 0.0484 0.5907 0.6837 0.5311 全部组件协同工作的统一框架

关键发现

  • FSAM 是保障视觉质量与可读性的最大贡献者:在消融实验中,去掉 FSAM 导致生成任务的 LPIPS 从 0.5311 骤增至 0.5928,编辑准确率由 63.74% 暴跌至 56.72%(跌幅达 7.02%),证明了基于逆字高灰度图的多尺度特征校准在平衡大字与小字表达中的决定性作用。
  • SCAA 显著挽救微小汉字的拓扑完整性:去掉小字符数据增强后,编辑任务准确率下跌 4.11%,生成任务准确率下跌 2.92%,表明在训练中引入随机几何放大的中央凹机制能够有效向骨干网络注入抗分辨率退化的字形先验。
  • 任务自适应损失有效缓解多任务梯度冲突:去掉区域加权损失后,编辑准确率下降 1.94%,验证了局部区域重加权与全局监督解耦对兼顾编辑细节与生成全局光影的必要性。
  • 主观评测(Human Evaluation)显著占优:在 15 位受试者的 100 组双盲对比测试中,InnoText 在编辑任务与生成任务上的总体人类偏好度(Overall Preference)分别高达 78.5% 和 80.2%,字形渲染准确率和美学表现大幅压倒 AnyText2。

亮点与洞察

  • 双联画上下文修复的高效统一:巧妙利用 Flux-Fill 的原生 Inpainting 能力,将全图生成降维为“字形图 + 空白画布”的特殊修复任务,无需重构双分支网络即可实现多任务无缝统一。
  • 连续逆字高灰度图设计:相较于常规的二值化硬掩码,通过计算字高倒数构建连续灰度尺寸图,以极低的参数增量为 Transformer 赋予了细粒度的字体尺度感知能力。
  • 全流程高质量双语语料工程:通过大模型改写重扩充、美学打分、OCR 重标注与多模态模型密实对齐构筑的 InnoText-30K,为多语言视觉排版社区提供了极具价值的训练与评测基准。

局限与展望

  • 极端大遮罩区域的冗余重复生成:当编辑任务中给定的擦除遮罩过大时,由于空间位置几何约束减弱,模型偶发出现局部字符复制或重叠排版现象。
  • 超高笔画密度生僻汉字的笔画粘连:对于包含 20 笔以上极复杂偏旁的生僻汉字,在极小字号场景下仍存在微小的笔画缺失或粘结,字形拓扑结构的精确离散建模仍有优化空间。
  • 未来方向:探索在 DiT 中引入字符级显式骨架线约束或矢量字体先验,进一步提升超小字体和复杂非拉丁文字在极限场景下的渲染准确率。

相关工作与启发

  • vs AnyText / AnyText2: AnyText 系列基于 UNet 架构,利用双路分支编码文本与背景,但在复杂非平整曲面与大尺度差异场景下容易产生边缘伪影与形变;InnoText 切换至 DiT 架构,并利用 FSAM 和 SCAA 机制攻克了微小尺度和密集汉字笔画的退化难题。
  • vs TextFlux: TextFlux 探索了基于 DiT 的纯端到端文本编辑,但在全图直接文本生成任务上缺乏有效的端到端统筹机制(在生成评测中准确率几乎归零);InnoText 创新设计了双联画输入范式,在单一模型内同时刷出文本生成与文本编辑的双 SOTA 表现。

评分

  • 新颖性: ⭐⭐⭐⭐☆ [双联画上下文架构统一与尺度感知灰度图调制思路新颖且工程落地性极强]
  • 实验充分度: ⭐⭐⭐⭐⭐ [涵盖主客观定量对比、详尽消融实验、双盲人类偏好研究以及深入的失败案例分析]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑链条清晰完备,方法与动机高度互锁,实验图表严密扎实]
  • 价值: ⭐⭐⭐⭐⭐ [为多语言视觉文本生成与编辑设立了高标准统一基准,对工业级海报设计与图像编辑极具参考价值]