跳转至

Towards Scalable Pre-training of Visual Tokenizers for Generation

会议: ECCV2026
论文: ECCV 原文
作者: Jingfeng Yao, Yuda Song, Yucong Zhou, Xinggang Wang
领域: 视觉分词器 / 图像生成
关键词: 联合预训练、图文对比学习、自监督学习、潜空间、扩散模型

一句话总结

VTP 让视觉分词器同时学习重建、视觉语义与图文对齐,使增加分词器预训练投入能够改善下游扩散生成,在 ImageNet 256×256 上以 675M 生成模型训练 600 epochs 后取得有引导 gFID 1.11。

研究背景与动机

潜空间扩散模型先用视觉分词器压缩图像,再让扩散模型学习压缩表示的分布,最后由解码器还原像素。 这种分工降低了生成模型面对的空间分辨率,却也让第一阶段决定了第二阶段究竟要拟合怎样的表示。 传统自编码器主要通过重建误差接受监督,因此会努力保留纹理、颜色和局部细节。 问题是,细节保存得更精确,并不意味着对象、布局与语义在潜空间中组织得更适合生成。 论文的直接证据是:继续训练纯重建分词器时,重建 rFID 改善,但固定预算的下游生成 gFID 反而变差。

已有方法已经尝试引入语义先验,例如 VA-VAE 对齐视觉基础模型特征,REPA 在扩散训练中进行表示对齐,RAE 则直接使用预训练表示编码器。 这些结果说明感知特征有用,但不能自动回答另一个问题:应当怎样训练分词器,才能持续受益于更多数据、更大模型与更多计算? 如果只是把一个固定基础模型接到生成器前面,生成表示的上限仍然受到已有预训练目标的约束。 反过来,如果只扩大重建训练,计算可能主要被用来描述更细碎的低层变化,并没有降低下游建模难度。 因此,本文研究的不是进一步压缩 token 数量,而是让分词器的预训练目标与生成任务真正兼容。

VTP 将视觉分词器视为可以独立扩展的表示学习模型,同时保留像素重建能力。 图文对比学习提供全局语义对齐,自监督学习提供跨视图一致性和局部空间感知,重建约束保证表示仍可被解码。 作者通过固定下游 DiT 训练配置,观察第一阶段变化是否单独带来生成收益。 核心 idea:先把生成潜空间训练成兼具语义结构与可重建性的表示,再扩展分词器预训练,而不是期待更低的重建误差自然转化为更好的生成。

方法详解

整体框架

VTP 使用全 ViT 自编码器,输入图像经过编码器和低维瓶颈得到空间潜变量,像素解码器再将潜变量还原为图像。 这里的 tokenizer 是连续视觉表示的编码器,并不是必须依赖离散码本的文本式分词器。 训练数据是图文对;图像还会生成全局视图、局部视图和带遮挡的视图,分别服务于不同监督目标。 流程先做异构批量采样,再进行感知与重建联合预训练,最后采用冻结编码器的解码精修改善像素质量。 完成这些步骤后,分词器与下游扩散模型分开训练,DiT 的梯度不再更新编码器。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
        INPUT["图文对与图像视图"] --> BATCH["异构批量采样"]
        BATCH --> JOINT["感知与重建<br/>联合预训练"]
        JOINT --> REFINE["冻结编码器的<br/>解码精修"]
        REFINE -.->|冻结编码器提供潜变量| TRAIN["下游 DiT 训练"]
        TRAIN --> SAMPLE["扩散采样得到潜变量"]
        SAMPLE --> OUTPUT["像素解码与生成图像"]
        REFINE -.->|精修后的解码器| OUTPUT

图中的联合预训练包含文本编码器、EMA 教师和像素解码器三条监督路径,不是把它们串成逐步推理模块。 文本编码器和 EMA 教师用于塑造表示,不是生成一张新图像时必须依次执行的组件。 生成时由训练好的 DiT 在潜空间采样,再交给像素解码器;没有原始图像需要重建。 因此,重建测试与生成测试使用同一个解码能力,但输入潜变量的来源不同。

关键设计

1. 异构批量采样:让不同学习目标使用适合自己的样本规模

图文对比学习依赖批内负样本,通常需要较大的批量才能充分区分匹配与不匹配的图文组合。 自监督学习需要处理多个裁剪视图,重建还要运行像素解码器,全部使用同样的大批量会显著增加计算负担。 VTP 因而保留一个共享图文大批次,将全部配对样本用于 CLIP 目标,再随机抽取子集用于自监督与重建。 这不是为三个任务分别准备完全独立的数据集,而是在共享数据来源上分配不同计算预算。 主要扩展实验使用 CLIP 批量 16k、自监督批量 4k、重建批量 2k。 这些批量不意味着每张图像都必须在同一步中接受全部三种监督。

这个安排使扩大语义学习的有效样本规模时,不必按同样比例扩大解码成本。 它也说明“联合目标”的关键不只是把损失相加,还包括怎样让不同目标获得合适的训练条件。 第 14 页表 3 的专门采样消融另用 CLIP 8k、重建 1k 作为默认配置,不能与主要实验的批量设置混写。 该消融中增大 CLIP 批量的结果支持较强语义监督有利于生成,但不等价于所有目标都应无限增大批量。

2. 感知与重建联合预训练:在同一个可解码表示中学习全局与局部语义

编码器输出经过低维瓶颈,以免直接把高维感知特征原封不动交给生成模型。 原文第 3.2 节给出的图像与潜变量空间关系为:

\[ I\in\mathbb{R}^{3\times H\times W},\qquad Z\in\mathbb{R}^{d\times H/16\times W/16}. \]

其中下采样因子为 16,主要分析采用瓶颈维度 64,并用维度 256 检查观察是否只依赖某个容量设置。 解码器先把低维潜变量映射回特征空间,经若干 ViT 块处理,再用 pixel shuffle 恢复像素排列。 重建分支使用 L1 损失和感知损失,让表示保存具体外观,而不只留下类别级信息。 预训练阶段不引入 GAN 损失,因为作者观察到 GAN 与该 ViT 架构结合会导致较大的梯度范数和训练不稳定。

图文分支按照 CLIP 的方式比较一个批次内的图像与文本特征。 匹配的图文对被拉近,不匹配的组合被区分,因此图像表示必须编码描述中可辨认的语义内容。 这条路径提供的是全局跨模态约束,而不是直接监督每个像素位置应该对应哪个单词。 论文在文本到图像实验中进一步观察到,加入 CLIP 目标能够改善图像中文字的生成;这属于实验发现,不能据此宣称具备专门的 OCR 监督。

自监督分支借鉴 DINOv2,将遮挡图像建模与自蒸馏结合起来。 在遮挡图像建模中,EMA 教师处理未遮挡的全局视图,学生编码器处理其遮挡版本,从教师信号学习缺失区域的表示。 在自蒸馏中,学生处理全局和局部视图,教师处理全局视图,通过伪标签预测之间的交叉熵建立跨视图一致性。 因此,学生不仅要识别整张图的含义,还要让局部观察与全局理解相容。 EMA 教师是随训练更新的教师路径,不应误写为一个固定的外部 DINOv2 模型被直接复制到潜空间。

这三种监督各自补足不同信息,但并不保证任意权重都最优。 论文将重建权重设为 0.1,自监督和对比权重在对应消融中取 0 或 1,以考察单独加入或联合加入感知目标的影响。 较小重建权重能改善生成,但会牺牲部分重建保真度,因此“共同改善”不是声称两个指标永远没有竞争关系。 缓存中原文公式 (1) 至 (3) 的运算符提取不完整;这里按可读正文说明各项组成,不把修补后的表达式冒充作者原式。

3. 冻结编码器的解码精修:提高视觉保真度而不重新扰动潜空间

联合预训练结束后,作者固定视觉编码器,仅用 GAN 目标微调像素解码器。 这样把可能不稳定的对抗训练延后到潜空间已形成之后,同时让解码器继续改进纹理和视觉真实性。 因为编码器被冻结,解码精修不会通过更新编码器改变下游模型需要学习的潜变量表示。 它解决的是输出像素的质量问题,而不是靠对抗目标重新定义语义空间。

这个阶段也解释了为什么不能只看 tokenizer 的重建分数来判断生成潜力。 解码器可以更擅长把给定表示转回像素,但生成模型仍需从噪声学习到有意义的潜变量。 VTP 的主要收益来自前一阶段塑造表示,而解码精修保证这些表示能形成质量较好的最终图像。 对这两部分分别描述,有助于区分“更好地表达图像”和“更好地渲染表示”这两种能力。

一个完整示例

以主要分析中的 256×256 输入和 f16d64 配置为例,图像被压成 16×16 个空间位置,每个位置有 64 个通道。 原图在重建子批次中需要被解码还原,其描述在图文大批次中提供配对语义信号。 同一数据来源的不同裁剪与遮挡视图则为教师和学生提供自监督输入。 这些目标共同训练编码器,并不是先生成文字、再生成局部图、最后拼回原图。 编码器冻结后,下游 DiT 学习这些 16×16 空间潜变量的分布;生成阶段从噪声出发产生潜变量,再解码成图像。 这个例子说明 f16d64 的张量含义,不意味着论文所有实验都采用 64 通道;图 8 的文本到图像曲线标注的是 f16d24。

损失函数 / 训练策略

主要预训练数据是内部过滤的 DataComp-1B 子集,包含 277M 样本。 模型使用 QKNorm 改善稳定性;文本编码器为 12 层、隐藏维度 768 的 Transformer。 快速扩展实验使用 ViT-L 编码器与 4 层 ViT-L 像素解码器,最终扩展实验还研究对称的 VTP-S、VTP-B、VTP-L。 标准诊断协议固定 LightningDiT-B,在 ImageNet 上训练 80 epochs,并报告 FID-10k。 理解能力通过瓶颈特征的 ImageNet Top-1 线性探测衡量,不使用 DINO 系列常见的多层特征增强。 因此,该诊断较直接地检查生成模型真正接收的低维表示,而不是只测编码器内部最强的一组特征。 最终表 4 另外比较更大的生成模型和更长训练,不能把其中的最佳 gFID 当成标准小模型诊断协议的结果。

实验关键数据

主实验

下表摘自原文第 15 页表 4,任务为 ImageNet 256×256 生成;rFID 和 gFID 均越低越好。 参数量指生成模型,epochs 指下游生成训练;“未报告”不代表零分或不支持该设置。

方法 生成参数量 Epochs rFID 无引导 gFID 有引导 gFID
VA-VAE 675M 80 0.28 4.29 未报告
REPA-E 675M 80 0.28 3.46 1.67
RAE 675M 80 0.57 4.28 未报告
RAE 835M 80 0.57 2.16 未报告
VTP 675M 80 0.36 2.62 1.44
VTP 1.0B 80 0.36 2.03 未报告
VTP 675M 600 0.36 1.85 1.11

VTP 的重建 rFID 0.36 不如 VA-VAE 的 0.28,但在同为 675M、80 epochs 的行中,无引导生成 gFID 更低。 这正好说明重建能力不能替代下游生成评估,而不是 VTP 在所有单项指标上都领先。 表 4 还报告 VTP 的 ImageNet 零样本准确率 78.2% 与线性探测准确率 85.7%。 1.0B 模型的 2.03 不能与 675M 模型结果解释成完全相同生成计算下的改进。 原文第 14 页正文写 2.60、图 9 图注写 2.61,而表 4 写 2.62;这里按表 4 引用 675M、80 epochs 的数值,并保留这一不一致。

消融实验

下表为数据规模分析,来源是第 11 页图 7(a) 与第 12 页第 4.5 节,不是另一个最终模型排行榜。 比较使用 VTP-ViT-Large 与 AE-ViT-Large;每个预训练配置累计处理 1.1 billion 样本,下游 DiT 训练 FLOPs 保持一致。 列出的数据规模是不同图像的子集规模,而不是累计样本曝光量。

预训练子集规模 纯重建 AE gFID VTP gFID
100K 58.37 47.59
1M 58.39 40.57
10M 57.23 30.98
100M 56.71 27.45

在累计曝光量固定的条件下,VTP 从更多不同图像中获得明显收益,AE 的收益则很小。 这个设计将数据多样性与简单延长训练作了一定区分,小数据集会被重复访问更多次。 表内终点不能直接与表 4 的 1.11 比较,因为下游模型和训练设置不同。

关键发现

  • 第 8 页图 4 与第 10 页正文显示,纯重建训练增加时 gFID 从 55.04 变为 58.56,即生成质量下降。
  • 第 10 页图 6 的三目标联合设置达到 gFID 27.8 与线性探测 74.9%,支持感知目标的互补作用。
  • 第 12 页指出,扩大 VTP 编码器时 gFID 从 31.28 降至 26.12,再扩大解码器可达 24.08。
  • 图 8 在 LAION 上报告更快收敛和文本渲染改善,但缓存没有可靠的完整终点数值表,因此不推测各基准的精确增益。

亮点与洞察

  • 把可扩展性的对象前移到了 tokenizer。固定下游配置后,第一阶段的收益更容易与生成模型本身的扩展区分。
  • 理解评估直接落在瓶颈特征上。它检验的是生成模型实际使用的表示,而不是外围分类头可以利用的额外信息。
  • 语义学习和重建不被视为互斥路线。保留重建约束避免只迁移感知编码器时遗漏细节,同时用语义目标改变潜空间结构。
  • 异构批量采样是可复用的工程设计。它允许昂贵的解码目标使用较小批量,而不牺牲对比学习所需的负样本规模。

局限与展望

  • 作者展示的是所测配置内的经验扩展趋势,不是已经证明适用于任意数据和任意生成模型的普适定律。
  • 固定下游 FLOPs 不等于总成本不变。更大分词器和更多预训练计算的总收益,需要结合复用次数和总体训练预算评估。
  • 内部过滤的 277M 数据集增加了复现门槛。缓存未给出足以重建完整过滤结果的细节。
  • 理解与生成的相关性不自动证明单一因果机制。读者可进一步研究类别语义、空间结构和低层频谱各自的作用。
  • 本文主要覆盖图像生成,没有在所给全文中证明视频或所有统一多模态任务也会遵循相同趋势。
  • 数值报告存在上述 2.60、2.61、2.62 差异;损坏的公式和图 8 曲线不宜作为精确复现配置的唯一依据。

相关工作与启发

  • 与 VA-VAE 相比:两者都关注重建与生成的矛盾,VTP 更强调通过可扩展的联合预训练学习表示,而非仅向既有视觉特征对齐。
  • 与 RAE 相比:RAE 使用已有感知编码器并训练解码器;VTP 将语义学习与重建共同纳入编码器预训练,使生成适配性也参与表示形成。
  • 与 REPA / REPA-E 相比:这些方法在扩散训练期间利用表示对齐或联动调整,VTP 的核心实验把分词器预训练与 DiT 训练显式分开。
  • 研究启发:可在总训练 FLOPs 相同的条件下比较“增加 tokenizer 预算”和“增加 DiT 预算”,再考察一个 tokenizer 服务多个下游模型时的成本摊销;这是读者建议,不是本文已完成的实验。

评分

  • 新颖性: 4/5。贡献主要是生成导向的联合预训练与系统扩展分析,而不是全新的单项损失。
  • 实验充分度: 4/5。覆盖计算、参数、数据规模与文本到图像任务,但总体成本和复现细节仍有缺口。
  • 写作质量: 4/5。问题与控制实验清楚,部分结果数值不一致影响精确引用。
  • 价值: 5/5。为独立预训练可复用视觉分词器提供了明确且可检验的研究方向。