跳转至

Hierarchical Style Aggregation for Versatile Chinese Handwriting Generation

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/IIP-Lab-XDU/HiSAC
领域: 图像生成
关键词: 手写汉字生成, 少样本学习, 层次化风格聚合, 频域感知, 通用框架

一句话总结

HiSAC 将汉字显式分解为部首、部件与笔画三级拓扑结构,配合多频带频域感知风格编码与跨尺度匹配聚合机制,解耦内容拓扑与风格表征,统一了在线笔画轨迹预测与离线扩散图像合成两种少样本手写生成模式。

研究背景与动机

少样本汉字手写生成旨在仅依据书写者提供的极少数参考字样(如 5 张示例),合成保留目标汉字语义拓扑且高度契合该书写者笔迹风格的新字形。这在文档数字化分析、历史手稿复原以及面向长尾开集字符识别的数据增广中具有重要实用价值。然而,汉字字库规模庞大且内部结构极其复杂。以往方法主要依赖字符识别模型预训练的分类骨干提取内容特征,模型本质上只在判断“字符类别是什么”,却无法解析字符在空间中“如何书写形成”的拓扑与时序几何构型;而在风格侧,先前研究多提取整图全局特征向量,忽略了不同尺度空间结构与局部笔触细节的风格差异。

汉字内在具有高度规范的象形组合拓扑性,单字自顶向下可清晰拆解为全局结构布局、功能部首、构字部件以及最基础的笔画轨迹。现有少样本生成范式的核心瓶颈在于:内容表征的黑盒语义化与风格迁移的全局平铺化,导致参考字符与目标字符之间缺乏多粒度几何对齐通道,在生成未见生僻字或复杂构型时频繁遭遇笔画缺失、冗余笔画或部首空间坍塌。同时,已有研究通常割裂看待离线图像渲染(GAN 或扩散模型)与在线轨迹建模(RNN 或 Transformer),难以构建通用且可解释的风格表征流。

本文的切入视角是回归汉字本身的组合生成机理,将静态字形先验转化为可多层对齐的序列信息,并在空间与频域上同步解耦风格特征。核心 idea:将汉字显式分解为部首、部件和笔画三级层次结构,利用多频带频域编码器解耦捕获全局字态与局部笔动态,通过跨尺度层次风格聚合机制(HiSA)实现空间与频率维度的精细风格迁移,并即插即用适配在线轨迹与离线扩散生成器。

方法详解

整体框架

HiSAC 整体架构由三个核心部分协同构成:首先,对目标字符与参考字符进行层次化结构拆解,分别获取部首、部件和笔画三个粒度的离散与连续几何表征;其次,设计频域感知多频带风格编码器(FASE),将参考手写图像分割到粗粒度、中粒度与细粒度三个频带中提取多尺度表征;随后,层次化风格聚合模块(HiSA)利用跨尺度交叉注意力与笔画余弦相似度匹配,将风格特征精准注入到目标字符的三层结构中;最后,融合后的多粒度风格表征作为通用条件输入,驱动在线 Transformer 轨迹预测器或离线条件扩散生成器。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入:目标字符与参考手写字"] --> B["字符多层级结构解耦<br/>部首 / 部件 / 笔画拓扑序列"]
    A --> C["频域感知风格编码 FASE<br/>粗窄带 / 中宽带 / 细扩展频带"]
    B --> D["层次化风格聚合 HiSA<br/>部首部件注意力 + 笔画余弦匹配"]
    C --> D
    D --> E["通用生成解码器<br/>在线 GMM 轨迹 / 离线扩散去噪"]
    E --> F["输出:高保真风格化手写汉字"]

关键设计

1. 字符多层级结构解耦:以部首-部件-笔画先验替代黑盒内容编码 针对以往方法使用文字识别分类骨干导致“重语义、轻结构”的弊端,HiSAC 引入固定的汉字表意文字描述字符(IDS)分解表与递归分解算法。对于目标字符 \(c_{\text{tgt}}\),生成三种粒度的结构序列:捕获整体结构配置的部首级序列 \(R_{\text{tgt}} = \{r_j\}_{j=1}^{n_r}\)、编码空间局部布局的部件级序列 \(C_{\text{tgt}} = \{c_j\}_{j=1}^{n_c}\),以及详述微观运笔走向的笔画级序列 \(S_{\text{tgt}} = \{s_j\}_{j=1}^{n_s}\)。类似地,各参考字形也被解析为笔画序列。该查表过程近乎零计算开销,却赋予模型显式的构字先验,使少样本生成从抽象隐空间回归到清晰的笔墨结构对应。

2. 频域感知多频带风格编码(FASE):三通道分离全局字态与微观笔动态 不同于传统单分支 CNN 或 ViT 提取的平铺风格向量,手写风格同时体现在宏观字形倾斜/宽高比(低频全局)与微观运笔断连/顿挫转角(高频局部)。FASE 将图像 Patch 嵌入 \(X \in \mathbb{R}^{n \times d}\) 沿通道维度拆分为粗糙分支 \(X_c\)、中等分支 \(X_m\) 和精细分支 \(X_f\): - 粗糙窄带分支:利用 Vision Transformer 自注意力本质上充当低通滤波器的特性,提取全局长程构型(如倾斜度、长宽比例); - 中等宽带分支:通过 \(1 \times 1\) 逐点卷积后接深度可分离卷积(Depthwise Conv)与 GELU 激活,捕获中频笔段连贯度; - 精细扩展频带分支:采用步长为 1 的最大池化保持空间分辨率,后接 \(1 \times 1\) 卷积,高效感知笔画拐角曲率与边缘尖锐度等高频笔墨瞬态。 三路特征经通道拼接、层归一化与残差 MLP 整合为 \(Y\)。为拉大不同书写者之间的风格表征间距,模型采用基于 FASE 特征的三元组对比损失约束风格空间: $$ \mathcal{L}{\text{ctl}} = - \log \frac{\exp(Y_a \cdot Y_p / \tau)}{\exp(Y_a \cdot Y_p / \tau) + \sum $$ 其中 }^k \exp(Y_a \cdot Y_{n_i} / \tau)\(Y_a\) 为生成样本(Anchor),\(Y_p\) 为同作者真实参考(Positive),\(Y_{n_i}\) 为不同作者样本(Negative),均限定在相同文字语义下以彻底解耦内容。

3. 层次化风格聚合(HiSA):跨尺度注意力与笔画余弦相似度加权 为实现粗细兼顾且结构对齐的风格迁移,HiSA 将目标结构特征与 FASE 抽取的参考特征 \(Y = [Y_1, \dots, Y_k]\) 进行跨尺度融合。在部首与部件层级,结构跨度大且存在灵活变体,采用跨注意力机制聚合风格: $$ Z_{r/c} = \text{softmax}\left( \frac{E_{r/c} Y^\top}{\sqrt{d}} \right) Y $$ 而在微观笔画层级,风格主要取决于相似走势笔画的形态迁移。模型计算参考笔画嵌入 \(e_{i,j}\) 与目标笔画嵌入 \(e_n\) 之间的余弦相似度均值 \(\alpha_i\): $$ \alpha_i = \frac{1}{m_i n_s} \sum_{j=1}^{m_i} \sum_{n=1}^{n_s} \frac{\mathbf{e}{i,j}^\top \mathbf{e}_n}{|\mathbf{e} $$ 并通过 Softmax 归一化权重 }| |\mathbf{e}_n|\(\xi_i = \exp(\alpha_i) / \sum_j \exp(\alpha_j)\) 获得笔画级风格表示 \(Z_s = \sum_i \xi_i Y_i\)。最终将三层风格表征沿通道拼接形成紧致条件向量 \(Z = \text{Concat}(Z_r, Z_c, Z_s)\)

4. 通用生成解码器:在线 GMM 轨迹预测与离线扩散去噪无缝适配 HiSAC 提出的表征 \(Z\) 与具体生成器解耦,可无缝接入在线与离线两种生成管线: - 在线轨迹生成:采用自回归 Transformer 解码器,以部件表示 \(E_c\) 作为起始标记,解码器各层交叉注意力接入 \(Z\)。每个时间步输出高斯混合模型(GMM)参数预测位移概率密度,并配合三分类预测笔尖状态(落笔、提笔、书写结束),总损失由轨迹负对数似然损失 \(\mathcal{L}_{\text{GMM}}\) 与对比损失 \(\mathcal{L}_{\text{ctl}}\) 构成; - 离线图像合成:采用条件去噪扩散概率模型(DDPM),将 \(Z\) 作为条件向量注入 U-Net 交叉注意力层,除均方误差 \(\mathcal{L}_{\text{MSE}}\) 外,引入预训练 VGG16 的多层感知损失 \(\mathcal{L}_{\text{VGG}}\) 强化笔画边界视觉真实度。

损失函数 / 训练策略

  • 在线模型优化目标: $$ \mathcal{L}{\text{online}} = \lambda}} \mathcal{L{\text{ctl}} + \lambda $$ 其中状态交叉熵权重 }} \mathcal{L}_{\text{GMM}\(\lambda_{\text{state}} = 2\),超参数默认 \(\lambda_{\text{ctl}} = 1, \lambda_{\text{GMM}} = 1\)
  • 离线模型优化目标: $$ \mathcal{L}{\text{offline}} = \lambda}} \mathcal{L{\text{ctl}} + \lambda}} \mathcal{L{\text{MSE}} + \lambda $$ 其中感知损失权重设为 }} \mathcal{L}_{\text{VGG}\(\lambda_{\text{VGG}} = 0.01\),其余系数默认置为 1。

实验关键数据

主实验

实验在 CASIA-OLHWDB/HWDB 数据集(训练集约 370 万汉字样本、1020 位书写者)上训练,并在 ICDAR 2013 竞赛测试集(60 位书写者,各写 3755 个常用汉字)上分别评估在线与离线生成质量。所有图像归一化至 \(64 \times 64\) 分辨率,默认采用 \(k=5\) 张参考样本。

1. 在线汉字手写生成对比(原论文 Table 1)

评估指标包括表征笔画轨迹对齐误差的动态时间规整(DTW,越低越好)、样式分类器给出的 Style 分数(越高越好),以及字形识别器给出的 Content 分数(越高越好):

方法 发表出处 DTW ↓ Style ↑ Content ↑
DeepImitator PR 2020 1.0476 62.56 92.07
WriteLikeYou CGF 2021 0.9244 84.78 94.26
SDT CVPR 2023 0.8780 94.56 96.47
OLHWG ICLR 2025 0.9173 91.28 90.11
DNA WACV 2026 0.9041 93.43 96.23
HiSAC (Ours) ECCV 2026 0.8224 97.01 96.68

HiSAC 在 DTW 轨迹误差上相较次优方法(SDT 0.8780)显著降低 0.0556,同时 Style 分数突破至 97.01(提升 2.45 点),验证了其兼顾精确运笔与极致个性化笔迹还原的能力。

2. 离线汉字手写生成对比(原论文 Table 2)

对比涵盖经典 GAN 模型(HWT, VATr)与最新扩散模型(WordStylist, DiffusionPen, One-DM, DiffBrush),并同时测试了基于扩散生成器(\(\text{HiSAC}_{\text{Diffusion}}\))与自回归生成器(\(\text{HiSAC}_{\text{VAR}}\))的变体:

方法 发表出处 FID ↓ LPIPS ↓ RMSE ↓ Style ↑ Content ↑
HWT ICCV 2021 162.43 0.3112 0.3245 3.78 5.23
VATr CVPR 2023 136.78 0.2733 0.3105 38.49 43.25
WordStylist ICDAR 2023 39.27 0.1725 0.1661 57.74 82.79
DiffusionPen ECCV 2024 35.14 0.1678 0.1608 61.78 86.18
One-DM ECCV 2024 35.45 0.1652 0.1520 63.47 86.27
DiffBrush ICCV 2025 36.41 0.1704 0.1573 66.18 87.11
\(\text{HiSAC}_{\text{Diffusion}}\) (Ours) ECCV 2026 34.88 0.1627 0.1531 68.21 89.48
\(\text{HiSAC}_{\text{VAR}}\) (Ours) ECCV 2026 34.17 0.1638 0.1485 68.04 89.22

消融实验

在在线生成基准上对 FASE 频带分支与 HiSA 层次结构逐步消融(原论文 Table 3):

FASE-粗窄带 FASE-中宽带 FASE-细扩展带 HiSA-笔画 HiSA-部件 HiSA-部首 DTW ↓ Style ↑ Content ↑ 说明
0.8318 93.37 96.49 仅保留低频字态,高频笔韵不足
0.8286 93.75 96.58 仅保留中频连续度
0.8254 94.50 96.75 仅保留高频锐角转折
1.2146 83.22 67.35 移除全部 HiSA 结构指导,内容大幅坍塌
0.8373 96.88 95.62 缺失笔画对齐,局部细节降级
0.8321 96.62 96.18 缺失部件对齐,字形布局稳定性下降
0.8410 96.91 95.80 缺失部首对齐,宏观骨架对齐削弱
0.8224 97.01 96.68 完整模型(HiSAC),综合表现最佳

关键发现

  1. 结构先验是防坍塌的生命线:当彻底剥离 HiSA 结构对齐模块后,Content 分数直接从 96.68 暴跌至 67.35,DTW 误差激增至 1.2146。这证明没有明确的部首/部件/笔画对应指导,模型极易产生无法识别的“错字假字”。
  2. 多频带具有严格互补性:单分支 FASE 无论保留哪个频段,Style 均停留在 93.37~94.50 之间;三频带全开后跃升至 97.01。频谱可视化显示低频分支主导字形长宽斜率,高频分支专精笔锋折角,二者在频域上自然分工。
  3. 跨语种与跨域泛化能力出众:在零样本日本汉字(Kanji)评测中,HiSAC 在未经历日语字库训练的前提下,凭借汉字字形组合逻辑的共通性生成了结构完整的字形,未发生基准模型(SDT/WriteLikeYou)普遍出现的缺笔、错笔现象;在艺术字体(Table 4)生成上亦取得 16.23 FID 与 0.4684 SSIM 的领先表现。

亮点与洞察

  • 解耦“语义分类”与“书写拓扑”:以往手写生成研究惯性地使用分类模型预训练权重充当内容编码器,陷入了“只知其名不知其形”的陷阱。HiSAC 通过构建部首-部件-笔画多层次图表式结构输入,以极低计算代价赋予生成器精准的几何骨架。
  • 空间层次匹配与频谱分解的自然契合:空间上的“粗构架到微观笔画”与频率域上的“低频字态到高频转折”在概念上高度统一。通过将 Vision Transformer 的自注意力(低通)与局部卷积(带通/高通)在网络架构中并联分流,形成结构与特征空间的双重分层。
  • 生成架构无关的通用接口设计:将多粒度特征压缩为统一条件表征 \(Z\),既能为离散时间步自回归序列预测(在线轨迹)赋能,又能作为连续扩散逆过程的交叉注意力引导(离线图像),成功消弭了两条路线长期以来的架构壁垒。

局限与展望

  • 极端草书与连笔形变建模受限:作者在结语中坦承,当前分层方案依赖离散标准字形结构表(IDS),对于行草书中常见的极度夸张连笔变形、笔画完全融合甚至重组的狂草书写,刚性拓扑分解容易出现语义错配。
  • 参考样本数量存在边际递减:参考字数实验表明,\(k \ge 5\) 时性能即基本趋于饱和,在 1-shot 极限少样本条件下的鲁棒性仍有进一步探索空间。
  • 未来方向:探索可微分的动态笔画聚类与软分解机制,以适应行书与草书生成;将层次化结构建模逆向迁移到手写文档解析与古籍残卷识别任务中。

相关工作与启发

  • vs SDT (CVPR 2023): SDT 专注于解耦书写者风格与单字风格,但内容端仍沿用 CNN-Transformer 分类器。HiSAC 在在线测试中 DTW 由 0.8780 降至 0.8224,Style 分数由 94.56 升至 97.01,证明层次拓扑匹配比隐空间内容解耦更能保证生僻字生成的结构稳定。
  • vs DNA (WACV 2026): DNA 仅将部件信息作为内容表征的辅助提示,未在多层级上与风格做精细对齐。HiSAC 在部首/部件/笔画三个尺度上分别执行注意力和余弦匹配,在保真度和风格相似度上全面超越 DNA。
  • vs DiffusionPen / One-DM (ECCV 2024): 这类扩散手写生成模型主要针对西文或利用全局风格向量。HiSAC 引入的三频带 FASE 结合局部结构引导,在离线任务上取得了 34.88 FID 与 68.21 Style,显著优于 DiffusionPen 的 35.14 FID 与 61.78 Style。

评分

  • 新颖性: ⭐⭐⭐⭐☆ [汉字部首-部件-笔画三级拓扑与三频带 FASE 的双重解耦设计精巧,统一了在线离线生成表征]
  • 实验充分度: ⭐⭐⭐⭐⭐ [在线与离线双重对比、多模块细致消融、多频段可视化及跨语种艺术字泛化实验极其扎实]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑严密,图表清晰直观,方法数学表达与动机阐述严丝合缝]
  • 价值: ⭐⭐⭐⭐☆ [对汉字少样本生成、书法字体设计及文档手写文字识别数据增广具有显著落地价值]