跳转至

Semantic Line Diffusion: Character-Consistent Line Art from text-annotated Storyboards

会议: ECCV 2026
论文: ECCV 原文
代码: https://huggingface.co/SemanticDiffusion-for-Line-Art-code
领域: LLM 其他
关键词: 条漫分镜线稿生成, 扩散变换器, 跨画格角色一致性, 记忆增强检索, 故事板多模态条件

一句话总结

针对网络条漫分镜草稿(conti)几何稀疏且跨画格角色易走样的问题,提出 PanelDiff 扩散变换器架构,通过多参考静态特征池化、动态记忆库时序检索与面板自适应门控机制,实现高保真、强几何对齐且跨长序列角色一致的线稿生成。

研究背景与动机

在现代数字网络漫画(Webtoon)的工业生产管线中,从粗略的故事板草图(即“conti”草稿)绘制出干净精细的线稿(Line Art)是一项极度耗费工时且依赖高阶艺术经验的环节。创作者首先绘制结合了粗线条、简略形体、构图框选与文字备注的分镜草稿,再逐步精细化勾勒出标准的角色线稿。然而,由于 conti 草稿本身仅提供极其粗糙的几何轮廓和稀疏的语义提示,且带有垂直排版和离散镜头切换等强叙事结构约束,普通生成模型极难在重建高精度线条的同时保持剧集级别的视觉一致性。

现有主流的图像到图像翻译模型、草图到图像模型(如 ControlNet、T2I-Adapter、DiffSketcher 等)以及文生图扩散模型,本质上都是将每个画格作为独立样本进行孤立推理。这种单图孤立生成的范式使得模型在面对多画格故事板序列时,完全无法感知前后画格的角色演化历史;一旦角色在不同画格中出现视角切换、姿态变化或强烈面部表情,生成的人物面部几何与发型结构就会发生严重的“身份漂移”(Identity Drift),破坏整个章节的连贯阅读体验。

解决该问题的核心在于:既要利用艺术家预先设定的规范角色参考图来锚定全局身份先验,又要建立跨画格演进的动态视觉记忆,以便在长序列生成中动态跟踪角色的最新外观变化。本文的核心 idea 是:构建首个专门面向分镜草稿到线稿生成的 Panel-Aware 扩散变换器(PanelDiff),将画格索引、草稿几何、文本描述与结合了多参考静态池化和动态记忆库时序检索的角色身份 Token 统一拼接,并在特征对比与时序平滑损失监督下实现跨长序列高一致性的条漫分镜线稿合成。

方法详解

整体框架

PanelDiff 以条漫分镜草稿图像序列 \(x_t \in \mathbb{R}^{H \times W \times 3}\)、文本描述 \(\{l_c\}_{c \in \mathcal{C}_t}\) 以及艺术家提供的各角色全局静态参考线稿集 \(\mathcal{R}_c = \{r_c^{(k)}\}\) 为输入,目标是自回归递推地生成干净的线稿画格 \(y_t\)。整个框架围绕一条“多模态编码 \(\to\) 静态多参考池化与动态记忆检索 \(\to\) 面板自适应门控融合 \(\to\) DiT 去噪生成 \(\to\) 动态记忆 FIFO 维护”的数据流展开。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    InConti["输入:分镜草图 x_t<br/>与文本描述 l_c"] --> EncVisual["多模态编码<br/>轻量 ViT 提草稿 Token / 文本编码器提语义"]
    InRefs["输入:静态参考图 R_c<br/>与历史动态记忆"] --> PoolStatic["多参考静态特征池化<br/>草稿上下文注意力加权"]
    InRefs --> RetDyn["动态记忆库检索<br/>指数衰减时序核加权"]
    PoolStatic --> GateFusion["面板自适应门控融合<br/>全局上下文自适应加权与投影"]
    RetDyn --> GateFusion
    EncVisual --> DiTGen["面板感知 DiT 去噪生成<br/>拼接画格/草稿/文本/身份 Token 预测噪声"]
    GateFusion --> DiTGen
    DiTGen --> GenPanel["输出:精细线稿画格 y_t"]
    GenPanel --> UpdMemory["动态记忆 FIFO 维护<br/>共享编码器提取角色特征并入库"]

在推理阶段,轻量级 ViT 编码器 \(E_x\) 将分镜草稿提取为视觉 Token \(Z_{x_t}\),语言 Transformer 提取文本嵌入 \(e_c^{\text{text}}\)。共享的 CNN-ViT 混合线稿编码器 \(E_r\) 负责将静态参考图与先前画格中检测到的角色动态切片编码为特征向量,存入统一记忆库 \(\mathcal{M}\)。相似度解释器(Similarity Interpreter)结合当前画格的草稿全局上下文和文本嵌入,分别从静态库和动态库中计算注意力权重与时序衰减权重,经自适应门控融合成精炼的角色身份 Token \(\tilde{h}_{t,c}\)。最终,扩散变换器联合注意力机制处理画格索引、草稿 Token、文本 Token 和角色身份 Token,完成噪声预测与潜空间去噪,解码出高质量线稿并更新动态记忆。

关键设计

1. 多参考静态特征池化:基于画格上下文的参考图自适应加权 面对条漫中草稿线条极简、表情姿态多变的挑战,单一正脸参考图往往无法覆盖侧脸、仰视或极端动作下的局部结构。模型为每个角色维护静态参考集 \(\mathcal{R}_c\),由共享线稿编码器 \(E_r\) 提取静态特征集合 \(\mathcal{F}_{t,c}^{\text{static}} = \{f_{t,c,i}\}\)。为了让静态参考的激活程度契合当前草稿的视角倾向,系统利用草稿全局均值池化向量 \(g_t\) 与文本语义嵌入 \(e_c^{\text{text}}\) 联合构建当前画格的上下文查询向量 \(u_{t,c} = W_u [g_t \,;\, e_c^{\text{text}}]\)。随后,静态特征通过可学习投影矩阵 \(W_{\text{st}}\) 与查询向量计算点积注意力权重: $$ \alpha_{t,c,i}^{\text{static}} = \frac{\exp(u_{t,c}^\top W_{\text{st}} f_{t,c,i})}{\sum_{f_{t,c,k} \in \mathcal{F}{t,c}^{\text{static}}} \exp(u $$ 加权汇聚后的特征 }^\top W_{\text{st}} f_{t,c,k})\(s_{t,c} = \sum_i \alpha_{t,c,i}^{\text{static}} f_{t,c,i}\) 能够根据当前草稿的姿态偏向,自适应放大最相似静态参考范例的结构影响,有效避免了单一静态模板在非典型机位下的特征硬套与面容扭曲。

2. 记忆增强动态表征库:带时序衰减核的序列历史检索 随着叙事跨画格推进,角色在经历服装破损、发型微调或特定光影简化后,其局部线稿特征会发生连贯演进。系统在推理过程中动态提取已生成画格 \(\hat{y}_t\) 中各角色区域 \(\Omega_{t,c}\) 的特征 \(f_{t,c}^{\text{dyn}} = E_r(\hat{y}_t|_{\Omega_{t,c}})\),并记录包含画格索引、包围盒、置信度及视角姿态的元数据 \(\text{meta}_{t,c}\)。为防止记忆库随序列长度无限膨胀,每个角色配置了容量上限为 \(K_{\text{mem}} = 64\) 的 FIFO 环形缓冲区。在跨画格检索时,为契合叙事连贯性规律(邻近画格视觉相关度通常远高于数十格前的远端画格),模型引入了指数时序衰减核函数 \(\kappa(\Delta t_{t,i}) = \exp(-\Delta t_{t,i} / \lambda_{\text{time}})\),其中 \(\Delta t_{t,i} = t - t_i\) 表示画格间隔。动态特征的注意力检索权重综合了语义匹配度与时序相近度: $$ \beta_{t,c,i}^{\text{dyn}} = \frac{\exp(u_{t,c}^\top W_{\text{dy}} f_{t,c,i}) \cdot \kappa(\Delta t_{t,i})}{\sum_{f_{t,c,k} \in \mathcal{F}{t,c}^{\text{dyn}}} \exp(u $$ 汇聚得到的动态特征 }^\top W_{\text{dy}} f_{t,c,k}) \cdot \kappa(\Delta t_{t,k})\(d_{t,c} = \sum_i \beta_{t,c,i}^{\text{dyn}} f_{t,c,i}\) 赋予了模型跨画格的短期记忆与长程关联回溯能力,使得角色在连续动作序列中的笔触与线条细节保持高度连贯。

3. 面板自适应门控融合:动静态身份线索动态仲裁与 Token 化 在不同场景画格中,模型对静态规范参考和动态历史线索的依赖程度存在动态差异:当发生重大场景转换或视角剧变时,历史动态帧可能会带来错误姿态残留,此时应偏重静态先验;而在连续对话或微幅动作过渡中,动态特征对于抑制闪烁漂移至关重要。相似度解释器通过可学习向量 \(v\) 计算面板自适应门控标量 \(\eta_{t,c} = \sigma(v^\top [g_t \,;\, e_c^{\text{text}}])\),对静态池化特征 \(s_{t,c}\) 与动态检索特征 \(d_{t,c}\) 进行软加权融合: $$ m_{t,c} = \eta_{t,c} s_{t,c} + (1 - \eta_{t,c}) d_{t,c} $$ 融合后的混合特征 \(m_{t,c}\) 进一步与规范静态主特征 \(\bar{h}_{t,c}\) 进行拼接,经多层感知机网络 \(\psi(\cdot)\) 投影,形成送入 DiT 主干的最终角色身份 Token \(\tilde{h}_{t,c} = \psi([\bar{h}_{t,c} \,;\, m_{t,c}])\)。该设计在机制上实现了静态全局规范与动态局部演进的连续权衡。

4. 面板感知 DiT 联合去噪:序列结构条件与复合时序监督 扩散生成主干基于 Diffusion Transformer 架构构建。对于第 \(t\) 画格,输入序列直接拼接画格时序位置 Token \(p_t\)、草稿网格视觉 Token \(Z_{x_t}\)、文本 Token \(Z_{t}^{\text{text}}\) 以及本画格所涉各角色的身份 Token 集合 \(\{\tilde{h}_{t,c}\}\),形成联合条件序列 \(Z_{\text{int},s}\)。在去噪步 \(s\),DiT 结合时间步嵌入 \(\gamma(s)\) 预测目标线稿潜变量 \(z_t^{(s)}\) 的噪声成分 \(\hat{\epsilon}_t^{(s)} = F_\theta(z_t^{(s)}, Z_{\text{int},s}, \gamma(s))\)。为保证表征空间的判别力与序列平滑度,模型在常规扩散均方误差损失 \(\mathcal{L}_{\text{diff}}\) 之外,引入了同角色近邻排斥异角色的三元组对比损失 \(\mathcal{L}_{\text{id}} = \mathbb{E}[\max(0, \|f_{t,c} - f_{t',c}\|_2^2 - \|f_{t,c} - f_{t,c}^{\text{neg}}\|_2^2 + \delta)]\),以及对相邻画格动态特征变化施加平滑惩罚的时序一致性损失: $$ \mathcal{L}{\text{cons}} = \mathbb{E}|_2 \right] $$ 复合目标函数 } \left[ |f_{t,c} - f_{t-1,c\(\mathcal{L} = \mathcal{L}_{\text{diff}} + \lambda_{\text{id}} \mathcal{L}_{\text{id}} + \lambda_{\text{cons}} \mathcal{L}_{\text{cons}}\) 从像素级去噪、特征级身份辨识与序列级平滑三个维度对网络实施全方位端到端约束。

损失函数 / 训练策略

模型采用 Diffusion Transformer 架构与 Cosine 噪声调度策略,输入分辨率统一为 \(512 \times 512\)。训练采用 AdamW 优化器,基础学习率设为 \(10^{-3}\),若训练震荡不稳定则衰减至 \(10^{-5}\),总计训练 100 个 epoch,batch size 为 64。硬件环境部署在 8 卡 NVIDIA RTX A6000(每卡 48GB 显存,整机 128GB RAM)分布式集群上。静态参考嵌入在训练前预计算缓存以提升吞吐。

实验关键数据

主实验

论文构建了由 30 位专业网络漫画家绘制的 10 万对 Conti–LineArt 数据集(涵盖约 150 位具有标准参考图的固定角色),在标准单画格生成任务与 50 画格长序列生成任务上与现有主流图像生成、草图控制及故事生成基线模型进行了严格对比(均汇报 5 次随机种子运行的均值与标准差)。

模型 LPIPS ↓ FID ↓ MS-SSIM ↑ (人脸) PSNR ↑ SSIM ↑ Edge IoU ↑ Edge F1 ↑ ID Sim ↑
CycleGAN 0.345 (0.021) 91.7 (2.40) 0.812 (0.018) 18.3 (0.03) 0.731 (0.020) 0.54 (0.02) 0.58 (0.02) 0.71 (0.02)
Pix2PixHD 0.312 (0.019) 78.4 (2.10) 0.835 (0.017) 19.7 (0.02) 0.752 (0.019) 0.58 (0.02) 0.61 (0.02) 0.74 (0.02)
SPADE 0.287 (0.018) 72.1 (1.90) 0.842 (0.016) 20.6 (0.02) 0.768 (0.018) 0.60 (0.02) 0.64 (0.02) 0.76 (0.02)
Stable Diffusion 0.258 (0.016) 61.3 (1.70) 0.857 (0.015) 21.9 (0.02) 0.781 (0.017) 0.64 (0.02) 0.67 (0.02) 0.79 (0.02)
ControlNet 0.233 (0.015) 55.1 (1.50) 0.864 (0.014) 22.6 (0.02) 0.792 (0.016) 0.66 (0.02) 0.69 (0.02) 0.81 (0.02)
T2I-Adapter 0.225 (0.014) 53.2 (1.40) 0.868 (0.014) 23.1 (0.02) 0.799 (0.015) 0.67 (0.02) 0.70 (0.02) 0.82 (0.02)
IP-Adapter 0.216 (0.014) 51.4 (1.30) 0.874 (0.013) 23.6 (0.02) 0.807 (0.015) 0.68 (0.02) 0.72 (0.02) 0.83 (0.02)
DiffSketcher 0.208 (0.013) 49.8 (1.20) 0.881 (0.012) 24.0 (0.02) 0.815 (0.014) 0.69 (0.02) 0.73 (0.02) 0.84 (0.02)
InstructPix2Pix 0.241 (0.016) 64.4 (1.80) 0.853 (0.015) 21.2 (0.03) 0.776 (0.017) 0.63 (0.02) 0.66 (0.02) 0.78 (0.02)
GPT-4o 0.274 (0.017) 69.2 (2.00) 0.846 (0.016) 20.4 (0.03) 0.763 (0.018) 0.61 (0.02) 0.64 (0.02) 0.76 (0.02)
Ours (full) 0.162 (0.011) 39.8 (0.90) 0.903 (0.010) 26.8 (0.01) 0.861 (0.011) 0.74 (0.01) 0.80 (0.01) 0.91 (0.01)

在 50 画格长序列序列一致性评估中,各项指标表现如下:

模型 身份漂移 Drift ↓ 序列 MS-SSIM ↑ 布局排版 IoU ↑ 单画格 FLOPs (G)
CycleGAN 0.482 ± 0.021 0.33 ± 0.02 0.41 ± 0.01 23
Pix2PixHD 0.451 ± 0.018 0.37 ± 0.02 0.45 ± 0.01 69
SPADE 0.429 ± 0.017 0.40 ± 0.02 0.48 ± 0.01 92
Stable Diffusion 0.377 ± 0.014 0.44 ± 0.02 0.52 ± 0.01 150
ControlNet 0.355 ± 0.013 0.47 ± 0.02 0.56 ± 0.01 188
T2I-Adapter 0.346 ± 0.012 0.49 ± 0.01 0.58 ± 0.01 152
IP-Adapter 0.337 ± 0.012 0.51 ± 0.01 0.59 ± 0.01 149
DiffSketcher 0.328 ± 0.011 0.52 ± 0.01 0.60 ± 0.01 34
InstructPix2Pix 0.392 ± 0.016 0.43 ± 0.02 0.50 ± 0.01 160
GPT-4o 0.371 ± 0.015 0.45 ± 0.02 0.53 ± 0.01 —
Ours (full) 0.214 ± 0.009 0.68 ± 0.01 0.71 ± 0.01 41

消融实验

在 50 画格长序列上验证各模块的贡献度(5 次随机种子均值与标准差):

配置变体 MS-SSIM ↑ 身份漂移 Drift ↓ 布局排版 IoU ↑ 身份相似度 ID Sim ↑ 边缘重合 Edge IoU ↑ 说明
Ours (full) 0.903 (0.002) 0.214 (0.009) 0.71 (0.01) 0.91 (0.01) 0.74 (0.01) 完整模型(多参考+动态记忆+相似度解释器)
w/o Multi-Reference 0.861 (0.003) 0.301 (0.012) 0.65 (0.01) 0.84 (0.01) 0.67 (0.01) 移除多参考静态池化(漂移加剧 40.7%)
Single Reference 0.878 (0.003) 0.268 (0.011) 0.67 (0.01) 0.86 (0.01) 0.69 (0.01) 仅使用单张正脸静态参考图
w/o Memory Bank 0.842 (0.004) 0.332 (0.015) 0.62 (0.01) 0.82 (0.01) 0.64 (0.01) 完全移除动态记忆库(漂移激增至 0.332,掉点最严重)
Recent-Only Memory 0.874 (0.003) 0.259 (0.010) 0.66 (0.01) 0.87 (0.01) 0.69 (0.01) 仅保留前一画格作为记忆
w/o Similarity Interpreter 0.851 (0.004) 0.317 (0.013) 0.63 (0.01) 0.83 (0.01) 0.65 (0.01) 移除相似度解释器(无时序核与门控,简单平均)

此外,在未见过角色(Unseen Characters)和未见过画风(Unseen Artists)的泛化测试中,本文模型分别取得了 0.803 / 0.792 的 MS-SSIM 与 0.271 / 0.284 的极低漂移值,远超 DiffSketcher(0.715/0.352)与 IP-Adapter(0.712/0.363),展现了强大的域外泛化鲁棒性。

关键发现

  • 动态记忆库是长程一致性的最核心支柱:完全移除动态记忆库会导致身份漂移指标从 0.214 暴增至 0.332(恶化超 55%),MS-SSIM 跌至 0.842。仅依赖上一格(Recent-Only)虽有缓解(Drift 0.259),但在 50 格连续演化中误差仍会雪崩累加,证明了带有时序衰减核的 FIFO 记忆池的必要性。
  • 静态多参考样本提供基础几何锚点:参考图数量从 1 张提升至 4 张时,面部 MS-SSIM 从 0.78 显著攀升至 0.86,Drift 从 0.32 降至 0.27;继续增至 8 张收益放缓至 0.88。多视角规范参考有效消除了极端角度下的幻觉变形。
  • 草稿噪声扰动鲁棒性卓越:在对草稿进行随机删线、笔画抖动等极端形变(噪声系数 1.0)下,基线平均 MS-SSIM 崩溃至 0.48,而 PanelDiff 凭借语义上下文与记忆先验仍能保持 0.79,展现了应对真实低质量草图的实用价值。
  • 极佳的计算性价比:由于采用了精简紧凑的条件 Token 化与高效 DiT 设计,单图计算量仅需 41 GFLOPs,相较于 ControlNet(188 GFLOPs)和 Stable Diffusion(150 GFLOPs)计算开销节省超 70%。

亮点与洞察

  • 条漫工业生产痛点的形式化突破:首次将漫画工业界的“草稿分镜(conti)到干净线稿(line art)”过程形式化为跨画格条件扩散生成任务,并构建了高质量专用基准数据集。
  • 动静结合的记忆解耦架构:利用静态池化牢牢锚定全局面部骨相与角色设定,利用时序核动态检索追踪局部笔触与姿态流转,彻底破解了单图独立生成在长篇连环叙事中“画一格换一张脸”的固有顽疾。
  • 面向真实生产管线的高效轻量部署:单画格仅 41 GFLOPs 的开销和 30 位专业画师主观盲测中对线稿平滑度、身份一致性及排版对齐度的压倒性偏好,使该技术具备了直插漫画工作室工作流的可行性。

局限与展望

  • 复杂多角色同框与遮挡交互:当前动态记忆提取依赖基于单画格检测器切出的角色候选框 \(\Omega_{t,c}\),当多人紧密相拥、大幅重叠或存在极端肢体遮挡时,特征切片可能混入干扰角色的笔画,导致局部特征污染。
  • 超长篇章跨幕外观剧变支持:当前动态记忆为容量 64 的 FIFO 机制,若角色经历中途换装或重伤损毁并在 60 格后再次登场,该动态演进特征可能已被弹出队列,需依赖多状态层级记忆拓展。
  • 未来方向:可进一步将 Conti-to-LineArt 与后续的自动分层上色(Flat & Shadowing)管线串联,实现从草稿故事板到终版全彩条漫的端到端工业化生成。

相关工作与启发

  • vs ControlNet / T2I-Adapter: 后者通过辅助编码器注入草图结构引导,但缺乏时序记忆机制,在连续分镜推理时各格孤立,无法解决连续长序列中的面部特征漂移;本文引入动态记忆库与时序核检索,从时序动力学层面彻底锁定了角色外观。
  • vs StoryDiffusion / StoryImager: 后者针对开放场景通用插画的故事连贯生成,缺乏对条漫高度专用的“极简草稿-精细矢量线稿”结构对齐约束;本文设计了基于 CNN-ViT 混合架构的专用线稿编码器,并施加边缘对齐损失与相邻平滑损失,更契合专业黑白线稿创作要求。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次针对专业漫画 conti-to-line-art 提出结合动静态记忆库与 DiT 的一致性生成框架。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 100k 数据集评估、50 格长序列漂移评测、消融实验、域外泛化及 30 位职业画师主观盲测,指标全面严密。
  • 写作质量: ⭐⭐⭐⭐⭐ 问题定义直切工业痛点,数学公式定义清晰规范,系统框图与算法伪代码完备自洽。
  • 价值: ⭐⭐⭐⭐⭐ 极大推动了数字漫画生成从玩具级玩具插画向高专业度、工业级生产力辅助工具的演化。