CHARTSTYLE-100K: A Large-Scale Dataset for Structured Visualization Style Transfer¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/yuweiyang-anu/ChartStyle
领域: 图像生成
关键词: 结构化可视化、风格迁移、图像编辑、逆向数据生成、扩散模型
一句话总结¶
针对结构化图表风格迁移中普遍存在的数据编码几何畸变和参考内容泄露难题,论文提出了逆向合成流水线 ChartForge,构建了包含 10 万高质量图表三元组的数据集 ChartStyle-100K 与基准评测集 ChartStyle-Bench,并通过渐进式微调训练出兼顾组件级风格适配与严格几何保真的 ReChart 模型。
研究背景与动机¶
结构化可视化(如统计图表、信息图、流程图和表格)是现代数据传播与决策沟通的核心媒介,它通过高度严谨的几何视觉元素(柱高、弧度、散点坐标、连线拓扑)将抽象数值转化为可解读的直观模式。在实际场景中,专业的信息图设计不仅要求数据准确,更依赖特定视觉风格(如色彩调色板、字体排版、装饰纹理与图例规范)来提升传达效果与审美质感。然而,手工设计高品质图表门槛高且成本昂贵,难以规模化复用。尽管近年来基于扩散模型与流匹配(Flow Matching)的通用图像编辑模型在自然图像风格迁移上表现亮眼,但将它们直接迁移到结构化图表时却遭遇了系统性的崩溃。
这种失效根植于结构化图像风格迁移面临的三重特有矛盾:首先是组合风格复杂度,图表风格并非单一纹理滤镜,而是由调色板、字体、几何标记形态、背景纹理和注释排版共同构成的复合系统;其次是数据编码几何的零容忍约束,自然图像允许局部透视形变,但图表中柱高的细微拉伸或圆弧角度的偏移会直接篡改底层数据语义;最后是风格与内容的深度纠缠,风格参考图与内容图均由图表构成、共享同一套视觉词汇,通用编辑模型极易将风格图中的坐标轴、文本或无关图例直接“拷贝泄露”到生成结果中。如果沿用常规的正向合成思维(即直接引导模型将内容图重绘成参考图风格)来生成训练数据,模型自身的缺陷会被全盘继承到数据集中,产生大量失真与泄露样本。
为了打破这一死结,本文提出了一种逆向破局思路:既然“先有内容再强行套风格”容易导致失真与泄露,不如将生成过程倒转——先依据风格样例合成具有目标风格的可行图表,再从该目标中提取并退化出对应不同基础风格的同结构内容图。核心 idea:提出逆向数据合成流水线 ChartForge,从风格样例出发先生成带样式的目标图、再反向推导结构对齐的内容图以实现天然的内容-风格解耦,构建 10 万级三元组数据集 ChartStyle-100K,并通过通用到专精的两阶段渐进微调训练出组件级图表编辑模型 ReChart。
方法详解¶
整体框架¶
结构化图表风格迁移的数学本质是在给定风格参考图 \(I_s\) 与包含几何结构 \(G_c\) 和文本标注 \(T_c\) 的内容图 \(I_c\) 的条件下,寻找生成目标图 \(I_t = \Phi(I_s, I_c)\)。优化目标需同时兼顾组合风格迁移损失 \(\mathcal{L}_{\text{comp}}(I_t, I_s)\)、严格几何与文本保真损失 \(\mathcal{L}_{\text{struct}}(I_t, I_c)\),以及对风格参考图内容泄露的惩罚项 \(\mathcal{L}_{\text{entgl}}(I_t, I_s, I_c)\)。针对这三项在端到端模型中相互拉扯的瓶颈,作者设计了包含四个核心阶段的数据生成管线 ChartForge,并基于生成的大规模高质量三元组驱动两阶段渐进式微调框架 ReChart。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["风格参考图库<br/>5.8万张真实信息图与专业设计"] --> B["逆向目标图生成<br/>结合独立采样内容参数合成 It"]
B --> C["重塑内容图派生<br/>保持几何文本不变改换90种视觉基线得到 Ic"]
C --> D["风格空间自举重采样<br/>将重塑变体作为新参考循环自增强生成"]
D --> E["多维质量评估与过滤<br/>LLM三维评分 + PaddleOCR F1筛除缺陷样本"]
E --> F["两阶段渐进式微调<br/>通用风格对齐预训练 + ChartStyle-100K 专精微调"]
F --> G["ReChart 图表编辑模型<br/>精准保留几何与文字,无泄露迁移风格"]
关键设计¶
1. 逆向目标图生成:从源头斩断风格-内容纠缠与正向泄露
传统数据构建通常采用正向重绘逻辑(\(I_c \xrightarrow{I_s} I_t\)),但在模型尚未掌握图表结构先验前,强行将 \(I_s\) 的风格注入 \(I_c\) 必然导致两者文字与几何元素相互渗透污染。针对这一缺陷,ChartForge 采取了逆转生成次序的策略:第一阶段完全不依赖任何已有的内容图输入,仅以一张风格样例 \(I_s\) 为参考,同时从涵盖 36 种图表类型、26 个专业领域、多样化版式与信息密度的独立参数池中随机抽样生成元数据。随后促使图像大模型在严格遵循 \(I_s\) 色彩搭配、字体质感、图例标记特征的前提下,自主合成全新的目标图表 \(I_t\)。由于此时目标图的数值内容完全由独立参数即时生成,不存在旧内容的干扰,模型能最大程度沉浸在 \(I_s\) 的风格空间中,保证了生成目标 \(I_t\) 的视觉统一性与美学质感。
2. 重塑内容图派生:以结构守恒重绘锚定解耦三元组
在生成高风格化目标 \(I_t\) 之后,核心挑战是如何得到一张与其结构严格一致、但风格截然不同的内容对应图 \(I_c\)。直接剥离 \(I_t\) 的样式在连续像素空间属于病态反问题,ChartForge 的做法是将 \(I_t\) 作为输入进行受约束的内容重塑(Restyling)。通过指令驱动模型,从预先定义的 90 种不同视觉风格家族(如极简主义、复古手绘、数据新闻风、3D立体等)中采样新的基线外观,强制模型在绝对冻结图表核心几何数据(柱体高度比例、扇区圆心角、折线拐点坐标)和关键文本字符的前提下,仅改变色系搭配、边框质感和背景纹理。当单张目标图派生多个内容候选时,算法强制其中一个变体退化为最朴素的默认样式(如标准 matplotlib 扁平绘图或白底素描),从而得到严格成对、结构完全一致但风格彻底解耦的三元组 \((I_s, I_c, I_t)\)。
3. 风格空间自举重采样:纠正真实数据集的风格分布偏倚
网络爬取与开源图表库中的真实信息图样例存在严重的风格同质化现象,超过 80% 的样本高度集中在扁平化现代商务信息图,而诸如像素艺术、手绘插画、朋克复古或复古报纸等长尾特异风格极度匮乏。若仅以原始样例训练,模型难以应对发散性风格迁移需求。ChartForge 引入了风格空间自举重采样机制:将第二阶段中由多样化审美提示词生成的高质量重绘变体图 \(\tilde{I}_s\) 重新回收并沉淀为全新的风格参考原型,随后驱动流水线再次迭代执行目标生成与内容派生。这种自增强机制在零额外人工标注成本的前提下,将有效风格表征空间向艺术化和长尾领域大幅拓展,为后续训练提供了覆盖度平衡的高维风格流形。
4. 多维质量评估与过滤:基于大模型认知与 OCR 的联合判决
合成管线生成的候选三元组难免存在局部的文字畸变、语义漂移或微弱的参考图渗漏。为确保训练集的纯净度,流水线构建了基于 GPT-4o 与 PaddleOCR 的四维严格过滤准则: - 视觉质量打分 \(R_{cvq}, R_{tvq} \in [1, 5]\):分别独立评测 \(I_c\) 与 \(I_t\) 的文本可读性、色彩对比度、排版规整度及渲染伪影; - 内容一致性打分 \(R_{cc} \in [1, 5]\):双图比对评估图表拓扑、坐标轴标签、数据系列对应关系与数值逻辑的守恒性; - 风格一致性打分 \(R_{sc} \in [1, 5]\):对比 \(I_s\) 与 \(I_t\),严格审查调色板、字体视觉特征及几何图元装饰风格的一致度; - 字符级文字保真度 \(R_{ocr} \in [0, 1]\):使用 PaddleOCR 提取 \(I_c\) 与 \(I_t\) 的文本 Token,计算精确的词级 \(F_1\) 值。 最终筛选阈值设定为 \(R_{cvq} \ge 4\)、\(R_{tvq} \ge 4\)、\(R_{cc} \ge 3\)、\(R_{sc} \ge 3\) 且 \(R_{ocr} \ge 0.8\)。经过全流程判决,从初始生成的 308,409 组候选三元组中精炼出 100,744 组黄金数据,构成了 ChartStyle-100K。
5. 两阶段渐进式微调:从跨图像通识到图表几何专精的课程学习
直接以通用图文编辑基座(Qwen-Image-Edit)在 ChartStyle-100K 上进行全量端到端微调极易遭遇次优解,因为基础多模态扩散模型既缺乏跨多图输入时对风格-内容特征通道的显式分离能力,也缺乏对图表严格几何边界的敏感度。ReChart 确立了两阶段微调课程:第一阶段在通用域风格迁移数据上预训练,使双流多模态扩散主干(Double-stream MMDiT)学会解耦视觉参考图与被编辑图像的通用语义,建立跨图注意力机制;第二阶段迁移至 ChartStyle-100K 专精微调,专注于图表组件级(标题、图例、数据标记区)的条件调制。注意力层析分析证实,ReChart 成功将目标注意力显式分流——风格注意力聚集在色调纹理区域,而内容注意力牢牢锁定在坐标与几何轮廓上,从而在推理时实现零泄露与高保真编辑。
损失函数 / 训练策略¶
ReChart 采用 Rectified Flow / 流匹配损失函数对扩散主干进行微调。给定真实图像潜在编码 \(x_1\) 与先验高斯噪声 \(x_0\),模型学习在时间步 \(t \in [0, 1]\) 下的确定性速度场向量 \(v_\theta(x_t, t, c)\),其中条件 \(c = \{I_s, I_c\}\) 经过预训练视觉编码器对齐输入。训练损失公式为:
在微调过程中保持较高分辨率输入(与原图比例自适应匹配),采用余弦学习率衰减并配合梯度裁剪以维持训练稳定性。
实验关键数据¶
主实验¶
评估在专门构建的基准测试集 ChartStyle-Bench(包含 300 对经过严格人工核验与过滤的多样化内容-风格配对)上开展。评测指标结合了 GPT-4o 裁判打分(内容一致性 Content、风格相似度 Style、内容泄露率 Leakage、调和综合分 Overall)与自动化客观指标(语义一致性 Semantic、CLIP 风格保真度 Fidelity、PaddleOCR 识别词级 F1 值 OCRScore)。在发生内容泄露时,GPT-4o 将风格分重置为 1 以惩罚作弊性复制。
| 模型 | 内容一致性↑ | 风格相似度↑ | 内容泄露率↓ | 综合评分↑ | 语义一致性↑ | 风格保真度↑ | OCRScore↑ |
|---|---|---|---|---|---|---|---|
| StyleStudio [24] | 1.00 | 1.67 | 0.06 | 1.17 | 0.58 | 0.47 | 0.01 |
| CSGO [57] | 1.00 | 1.97 | 0.02 | 1.25 | 0.55 | 0.46 | 0.01 |
| OmniGen2 [54] | 1.11 | 2.66 | 0.57 | 1.14 | 0.54 | 0.53 | 0.04 |
| FLUX.2-dev [23] | 1.75 | 3.80 | 0.80 | 1.29 | 0.59 | 0.73 | 0.26 |
| Edit-R1 [27] | 1.85 | 3.25 | 0.63 | 1.35 | 0.65 | 0.66 | 0.28 |
| Seedream 4.0 [44] | 2.39 | 3.70 | 0.51 | 2.00 | 0.74 | 0.56 | 0.50 |
| GPT-Image-1 [38] | 2.31 | 2.96 | 0.05 | 2.30 | 0.77 | 0.46 | 0.54 |
| GPT-Image-1.5 [39] | 3.30 | 3.04 | 0.06 | 2.82 | 0.80 | 0.48 | 0.73 |
| Nano-Banana [3] | 3.57 | 2.66 | 0.20 | 2.44 | 0.87 | 0.50 | 0.77 |
| Nano-Banana-2 [11] | 3.48 | 3.75 | 0.48 | 2.59 | 0.76 | 0.54 | 0.71 |
| Nano-Banana-Pro [10] | 3.79 | 3.58 | 0.32 | 2.84 | 0.77 | 0.54 | 0.72 |
| Qwen-Image-Edit [53] | 2.75 | 2.73 | 0.51 | 1.58 | 0.76 | 0.62 | 0.54 |
| ReChart (本文) | 3.96 | 2.90 | 0.05 | 3.03 | 0.89 | 0.49 | 0.76 |
消融实验¶
1. 两阶段训练策略的有效性消融 论文在 ChartStyle-Bench 上系统验证了渐进式微调的各个阶段对内容保留与防泄露机制的贡献:
| 配置 | 内容一致性↑ | 风格相似度↑ | 内容泄露率↓ | 综合评分↑ | 语义一致性↑ | 风格保真度↑ | OCRScore↑ |
|---|---|---|---|---|---|---|---|
| Qwen-Image-Edit 基座 | 2.75 | 2.73 | 0.51 | 1.58 | 0.76 | 0.62 | 0.54 |
| + 仅第一阶段 (通用风格迁移) | 3.13 | 2.92 | 0.13 | 2.45 | 0.80 | 0.52 | 0.59 |
| + 仅第二阶段 (图表数据直训) | 2.45 | 3.15 | 0.03 | 2.53 | 0.84 | 0.48 | 0.54 |
| + 阶段一 + 阶段二 (完整模型) | 3.96 | 2.90 | 0.05 | 3.03 | 0.89 | 0.49 | 0.76 |
2. 数据合成中风格空间自举重采样(Stage III)的贡献
| 配置 | 内容一致性↑ | 风格相似度↑ | 内容泄露率↓ | 综合评分↑ | 语义一致性↑ | 风格保真度↑ | OCRScore↑ |
|---|---|---|---|---|---|---|---|
| ReChart 完整版 | 3.96 | 2.90 | 0.05 | 3.03 | 0.89 | 0.49 | 0.76 |
| 去掉风格空间自举重采样 | 3.57 | 2.75 | 0.09 | 2.71 | 0.88 | 0.48 | 0.73 |
3. 不同文字尺寸下的文本字符还原率(PaddleOCR F1)
| 模型 | <12 px | 12–14 px | 14–18 px | 18–24 px | 24–32 px | ≥32 px |
|---|---|---|---|---|---|---|
| ReChart (本文) | 0.56 | 0.56 | 0.66 | 0.72 | 0.75 | 0.78 |
| GPT-Image-1.5 [39] | 0.52 | 0.58 | 0.62 | 0.70 | 0.70 | 0.69 |
| Nano-Banana-Pro [10] | 0.50 | 0.60 | 0.68 | 0.74 | 0.71 | 0.72 |
关键发现¶
- 虚高风格分背后的泄露陷阱:FLUX.2-dev 和 Nano-Banana-2 等模型表面上获得了极高的风格相似度评分(分别为 3.80 与 3.75),但其内容泄露率高达 0.80 和 0.48,表明这些模型本质上是通过大面积直接“抄袭”风格参考图中的图表构件来骗取风格分,导致综合有效得分(Overall)断崖式下跌。
- 两阶段微调的互补互斥效应:若跳过通用风格对齐预训练而直接用图表数据训练基座,泄露率虽能压至 0.03,但内容一致性从 2.75 剧降至 2.45,说明基座直接在专业图表上过拟合会损害内容理解;唯有“通用对齐 + 领域专精”渐进式课程能将内容一致性推升至 3.96,同时维持极低的 0.05 泄露率。
- 小字号文本渲染依然是全行业痛点:多尺度文本保真度分析表明,当字体尺寸大于 14px 时所有先进模型均能取得 0.66 以上的 OCR F1;但一旦低于 12px,即便是 SOTA 商业闭源模型和 ReChart,F1 分数也显著下滑至 0.50–0.56,揭示了当前扩散架构高频密集字符重建的瓶颈。
亮点与洞察¶
- 颠倒生成次序的数据反向工程:针对配对数据中不可避免的内容渗透与几何扭曲问题,反向采用“参考图 \(\to\) 带风格目标图 \(\to\) 退化内容图”的三元组构建范式,构思精巧地以生成机制天然保障了结构解耦。
- 注意力层析与局部消歧分析:通过提取双流 MMDiT 的跨注意力热力图并进行风格元素局部擦除试验,在像素与 Token 双重视角下证实了模型对“几何结构由内容图主导、外观色调由风格图激发”的组件级控制能力。
- 代码重绘 vs 像素编辑的边界勘探:对比实验证明,现阶段基于 VLM 解析图表生成代码(如 Matplotlib/D3)再修改渲染的方式,受限于代码库表现力难以复现复杂的艺术纹理与精致材质,直接在像素空间学习多模态风格编辑更具表现上限。
局限与展望¶
- 密集小字号排版保真度受限:对于财务报表或复杂科研图表中高度紧缩的微小标注(<12px),生成结果仍偶尔出现字符粘连或笔画模糊,未来需引入文字感知局部超分或结构化 SVG 混合解码。
- 复杂复合图表的逻辑推理瓶颈:面对嵌套式仪表盘、双重次坐标轴或非标准拓扑图,模型偶发性地混淆不同数据系列的视觉映射,需探索结合图神经网络或显式几何约束的先验建模。
相关工作与启发¶
- vs CSGO [57] & StyleStudio [24]:传统图像风格迁移模型大多依赖通用 IP-Adapter 机制提取全局特征,在面对结构化图表时产生大量非结构化噪点与色块涂抹,完全丧失了几何可读性;本文构建的专精数据集赋予了模型组件级与几何敏感的迁移能力。
- vs Qwen-Image-Edit [53]:通用多模态编辑底座在处理多图输入时无法严格理清编辑指令与风格迁移的边界,内容泄露率超过 50%;ReChart 通过引入专精的两阶段课程学习,在保留其图文泛化潜力的同时根治了内容串扰。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 逆向生成三元组以实现内容-风格严格解耦的思路独到且极具启发性。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 300 组基准对的定量评测、两套大模型判决、双盲人工评测及细粒度消融分析,验证极其详实。
- 写作质量: ⭐⭐⭐⭐⭐ 动机阐述深刻,结构设计自洽,图表和注意力层析分析极具视觉说服力。
- 价值: ⭐⭐⭐⭐⭐ 开辟了结构化可视化像素级风格迁移这一重要垂直赛道,开源的数据集与基准具有很高的基石价值。