A Scalable Vector Graphics Latent Space¶
会议: ECCV 2026
Paper: https://eccv.ecva.net/virtual/2026/poster/5250
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/9593.pdf
项目: SVG Latent Space
领域: 图像生成
关键词: 可缩放矢量图形、路径级表示、Transformer 自编码器、BPE 分词、潜在空间
一句话总结¶
SLS 将一条包含几何与样式信息的 SVG 路径压成一个可解码的稠密向量,在保持较好重建质量的同时,把下游图像描述的平均输入长度从 2432.02 个 XML token 缩减为 15.56 个路径向量;它主要贡献的是矢量图形的表示接口,而非新的文本生成 SVG 系统。
研究背景与动机¶
SVG 的价值不是把图像存得更小,而是保留可编辑的曲线、坐标和样式:同一个图形可以任意缩放,也可以单独改某条轮廓或填充色。 但这种符号表达对神经网络并不友好。 先光栅化再送入 CLIP、DINOv2,可以获得视觉语义,却无法仅凭这些特征恢复原来的 SVG 代码;直接把 XML 交给语言模型则保留了代码,却让一个简单图标占用大量上下文。 DeepSVG 等专用表示已经尝试把 SVG 编进潜在空间,但固定命令结构、控制点限制和样式覆盖不足,削弱了其作为通用接口的能力。
这里真正要解决的是压缩单位如何选择:整幅图压成一个向量,可能挤掉复杂结构;按固定 token 数切块,又可能把同一条曲线的几何和样式拆散。 路径则是一个更自然的中间粒度:每条路径本身是可独立描述、重建和检索的图形元素,多条路径又能组成整幅 SVG。 因此本文不要求下游模型阅读所有坐标,而是先学习一个仍能返回矢量代码的局部表示,让下游计算更多地随路径数量增长,而不是随 XML 字符串长度增长。
SLS 采用文本式 BPE,而不是手工规定每个绘图命令如何拆 token,并用同一词表处理几何和外观。 它通过路径重建学习表示,再把这些表示复用于描述和检索,没有额外设计一个检索专用编码器。 核心 idea:以完整 SVG 路径为压缩单元,把命令、坐标和样式共同编码成可重建的稠密向量,在下游用一个路径向量替代一长串 SVG token。
方法详解¶
整体框架¶
输入是一幅 SVG,预处理把它拆成独立路径,并整理成含样式属性的文本序列。 每条路径经「路径级统一分词」和「EOS 重建瓶颈」得到一个 1024 维向量;「球面归一化接口」提供单位范数表示,再由「路径向量下游接口」支持检索或描述生成。 要恢复 SVG 时,向量不是直接交给渲染器,而是先恢复到解码器熟悉的尺度,再自回归生成路径 token,将重建路径重新组合成图形。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["SVG 拆分为路径"] --> B["路径级统一分词"]
B --> C["EOS 重建瓶颈<br/>编码与自回归解码"]
C --> D["球面归一化接口"]
D -->|"下游使用"| E["路径向量下游接口"]
D -->|"恢复尺度后解码"| F["重建 SVG 路径"]
E --> G["路径检索或图像描述"]
关键设计¶
1. 路径级统一分词:让样式和几何共享表示入口
SVG 中可绘制的基本形状可以转写为路径,因此路径级编码避免了为圆、矩形等分别建立专用表示。 论文沿用 vHector 的预处理,把复合 SVG 对象拆成路径,再在处理后的语料上训练 BPE 词表。 BPE 学到的是经常共同出现的文本片段,而不是预先固定的一套「命令类型加若干坐标」槽位。 这样,绘图命令、数值参数、填充色、描边宽度和透明度都能从同一个输入通道进入模型。 相比只关注控制点的几何编码,这个入口让重建目标同时约束形状和外观,而不必把颜色留给另一个独立系统。
路径边界与 BPE 边界承担不同职责:前者决定什么信息被压成一个向量,后者决定该路径怎样变成离散序列。 按固定长度切块并不等价于路径建模,因为切割位置可能落在一个尚未结束的图形元素内部。 论文确实用固定块作对照,结果支持「完整路径」这个压缩单元,而不只是支持更短的输入。 同时,这并非任意复杂 SVG 的无限容量方案:训练数据会滤掉超过 1024 token 的路径,预处理覆盖范围也是实际适用边界。
2. EOS 重建瓶颈:用能否还原路径检验单向量是否足够
每条序列加上 BOS 和 EOS 标记,经过可学习 token 嵌入、正弦位置编码以及 Transformer 编码器。 编码器不额外添加可学习的 CLS token,而是取最后一层 EOS 位置的隐藏状态,作为整条路径的固定长度表示。 这让终止位置承担汇总完整序列的职责;瓶颈保留的是一个向量,而不是所有 token 的隐藏状态矩阵。 输入路径较长时,编码阶段仍必须处理这些 token,压缩收益主要发生在随后重复使用表示的阶段。
解码器把该向量只注入一次,作为因果 Transformer 的前缀,然后逐 token 预测原始路径序列。 训练时在潜向量上加入标准差为 1.0 的高斯噪声,让小幅扰动后仍需重建同一条路径,避免模型只记住极窄的编码点。 推理采用贪心解码,因为这里的目标是恢复指定路径,而不是通过随机采样增加绘图多样性。 因此「可逆」应理解为经验上的高保真可解码性,而不是数学双射或逐字符无损保证;神经网络的贪心选择本身也不是形式化语法验证器。
3. 球面归一化接口:下游比较方向,重建时恢复尺度
作者观察到训练后的潜向量范数接近一个稳定常数,而不是通过显式单位球约束把所有表示强制压上球面。 基于这一经验现象,下游先归一化向量,使相似度检索可直接使用点积;需要重建时,再乘回模型的经验平均范数。 原文第 3.2 节的关键变换可以写为:
这里 \(\mu_{\lVert z\rVert}\) 是该模型编码结果的平均范数,不是每个输入各自存储的原始范数。 这个区别很重要:若直接将单位向量送给在另一幅值范围上训练的解码器,就改变了它所见的输入分布。 论文还试过范数正则和可学习尺度,但这些变体并未优于最终模型,说明「主动让幅值编码信息」不是这里的主要收益来源。 归一化无损的说法依赖范数确实稳定;论文展示的是经验规律,不是对所有域外 SVG 都成立的证明。
4. 路径向量下游接口:同一表示支持结构检索和语言描述
检索时,查询路径和库中路径分别编码、归一化,按余弦相似度取最近邻。 由于向量已是单位长度,余弦相似度就是点积,适合预先编码大量图形元素后重复查询。 评测并不要求所有基线都把特征解码为 SVG:为了能与 CLIP、DINOv2 公平比较,作者统一按检索索引取回数据库中原有的路径,再衡量外观和语法相似性。 因此检索成绩和重建能力是两个相关但不同的证据,不能混为一个指标。
描述整幅 SVG 时,模型保留逐路径向量序列,而不是先把所有路径平均成一个向量。 一个线性投影将这些向量映射到语言模型的 token 嵌入维度,作为视觉前缀条件,再由语言模型输出自然语言描述。 描述任务联合训练投影层和语言模型;原文未在此明确说明 SLS 编码器是否同时更新,不应自行补成某种确定的冻结方案。 这种接口省掉的是语言模型端读取冗长 XML 的负担,并没有免除 SLS 自身的预训练、路径编码或需要时的自回归解码成本。
损失函数 / 训练策略¶
训练目标包含逐 token 交叉熵重建损失,以及目标 token 分布与预测分布之间的 KL 项;它不是把潜变量拟合到高斯先验的 VAE KL。 第 3.2 节先将目标分布描述为与真值 token 相关,随后又称其为锐化的自生成目标,但主文没有清楚给出具体构造及权重数值。 因此本笔记保留其用途与位置,不补造目标分布、温度或 KL 权重。
训练混合 StarVector、HeisenVec、ColorSVG 和 SVGX-Core,过滤后约有 150 万训练图像、3.1 万验证图像、1.6 万测试图像;对应约 2500 万、50 万、25 万条路径。 自编码器从头训练 48 万步,批量大小 192,学习率 \(10^{-4}\),预热 6000 步,使用 4 张 NVIDIA A100。 隐藏维度为 1024,注意力头数为 8,MLP 比率为 2,编码器与解码器合计 1.35 亿参数。 图像描述使用 Qwen3 0.6B、Llama 3.2 1B 和 Gemma 2 2B,学习率同为 \(10^{-4}\),批量大小 384。 本地全文覆盖 18 页主文与参考文献;文中提到的补充训练材料未包含在该缓存中。
实验关键数据¶
主实验¶
下表选自原文表 1,为混合 SVG 数据的重建评测,按第 4.1 节的留出划分理解。 DeepSVG 按整图编码,因此作者只做图像层面的直接比较,并遵守其每路径最大命令数限制。 表内数字保留原文量表:其 MSE 一列实际按 MSE-similarity 使用,越大越好,不能解释成通常越小越好的原始均方误差。
| 方法 | 图像 MSE-Sim ↑ | 图像 SSIM ↑ | 图像 LPIPS ↓ | 图像 DINO 相似度 ↑ |
|---|---|---|---|---|
| DeepSVG,零样本 | 76.03 | 67.85 | 53.99 | 49.86 |
| DeepSVG,同数据重训 | 76.05 | 67.85 | 53.31 | 57.95 |
| SLS,BPE | 90.83 | 87.26 | 18.79 | 80.85 |
相对重训 DeepSVG,SLS 的 SSIM 高 19.41 个表内分数点,LPIPS 低 34.52;这支持较好的视觉重建,但不是等计算预算或等样式容量的严格对照。 表 1 还给出 SLS 路径 mIoU 78.92,该指标比较几何覆盖而不计样式差异。
图像描述方面,表 3 的 Llama 3.2 1B 对照中,SLS 的 BLEU5 为 46.89,XML 为 12.31,DeepSVG 为 18.77;CLIP 参考为 54.67。 CLIP 的描述能力较强,但不能直接将其特征还原为 SVG,因此是非可解码参考,而不是同能力约束下的替代品。 表 4 报告平均上下文长度 2432.02 → 15.56,缩短 156.29 倍;训练计算量均值 18.06 → 0.108 TFLOPs,报告比值为 167.22 倍。 这些是论文描述任务的上下文与计算量统计,不是测得的端到端墙钟加速,也不能直接当作包含自编码器预训练的总成本下降。
消融实验¶
下表节选原文表 2,同属重建评测,固定采用 SSIM、LPIPS 与路径 mIoU 观察几何和视觉质量;未抄录不易跨词表比较的 token 重叠分数。
| 配置 | 图像 SSIM ↑ | 图像 LPIPS ↓ | 路径 mIoU ↑ |
|---|---|---|---|
| SLS,完整模型 | 87.26 | 18.79 | 78.92 |
| 投影维度 512 | 71.44 | 51.47 | 26.16 |
| CLS 汇聚 | 86.26 | 20.02 | 78.87 |
| DeepSVG-like 分词 | 67.08 | 47.73 | 40.58 |
| IconShop-like 分词 | 67.61 | 46.01 | 21.86 |
| 固定 512-token 块 | 83.73 | 23.99 | 64.31 |
| 固定 1024-token 块 | 84.13 | 24.06 | 61.33 |
关键发现¶
- 分词与容量的影响远大于汇聚位置:CLS 的 SSIM 为 86.26,接近完整模型;DeepSVG-like 分词则只有 67.08,不能把主要收益全归于 EOS。
- 路径边界比机械切块更有价值:512-token 块的 mIoU 为 64.31,完整路径为 78.92,支持按完整图形元素保留上下文。
- 表 5 检索中,SLS 的 MSE-Sim 为 89.95、BLEU5 为 20.91,DeepSVG 分别为 81.45、12.89;DINOv2 的 MSE-Sim 更高,为 98.86,但 BLEU5 为 10.77,呈现视觉相似与代码结构相似的不同偏好。
- 检索划分存在原文口径不一致:表 5 标题写测试集,第 4.4 节实际描述从验证集选 2500 个查询和 26.6 万个候选;这里按具体实验设置引用,不把它包装成额外独立测试集。
亮点与洞察¶
- 路径级瓶颈使几何坐标和样式成为一个可复用对象,而不只是 XML 的压缩摘要。重建、检索和描述三个方向共同检验这个对象是否保留了有用信息。
- 单位范数接口和原尺度解码明确分工,避免下游相似度计算绑死在解码器的幅值习惯上。这是可迁移的工程接口设计,但仍应先验证范数分布。
- 消融显示「选对压缩单位和词表」比替换一个汇聚 token 更关键。对图形文档这类结构化内容,表示边界本身就是模型设计的一部分。
局限与展望¶
- 作者明确设置的范围包括长度过滤、DeepSVG 对照的命令数限制,以及由多模态模型自动生成的描述参考;因此结果不能直接外推到所有复杂 SVG 或人工语义评价。
- 作者在表 6 报告域外 UniSVG 重建有所下降:SSIM 从域内 87.26 降至 78.44,LPIPS 从 18.79 升至 30.18,说明可迁移但并非没有域偏移。
- 阅读者判断:单路径重建并不保证模型显式理解多路径遮挡、布局或编辑依赖。整图任务提供了组合有效性的证据,但不等价于任意复杂场景的全局结构保证。
- 阅读者判断:严格可逆性、语法完全正确和全流程加速都比现有证据更强;应分别补充精确恢复率、无效 SVG 比例与含编码成本的时延评测。
- 复现信息仍有缺口:KL 目标与权重描述不充分,补充材料未在本地提供。本笔记未据此猜测实现,也不把缺少的细节当作已验证事实。
相关工作与启发¶
- 对比 DeepSVG:其层级几何表示强调结构化参数,SLS 用路径文本 BPE 纳入样式并降低固定参数化限制;优势来自不同表示假设,不能仅解释为编码器更强。
- 对比 vHector、IconShop 等 token 路线:它们直接在 SVG 序列上建模,SLS 在下游之前增加可解码的路径瓶颈;生成原始 SVG 和学习通用潜在接口是相关但不同的任务。
- 对比 CLIP、DINOv2:光栅特征对视觉语义与外观检索仍很有竞争力,SLS 的区别是保留返回矢量域的通道,而不是在所有视觉指标上取代它们。
评分¶
- 新颖性: 4/5 — 路径级、样式统一且可解码的组合有明确价值,底层自编码器与 BPE 本身较成熟。
- 实验充分度: 4/5 — 覆盖重建、描述、检索和关键消融,但严格可逆性与全流程成本证据不足。
- 写作质量: 3/5 — 主线清晰,KL 定义与检索划分口径仍需澄清。
- 价值: 4/5 — 适合作为矢量图形建模的基础接口,复杂 SVG 与实际编辑能力仍待扩展。