Let ViT Speak: Generative Language-Image Pre-training¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/YanFangCS/GenLIP
领域: 多模态 VLM
关键词: 视觉语言预训练, 生成式预训练, Vision Transformer, 门控注意力, 多模态大模型
一句话总结¶
GenLIP 摒弃了对比学习双塔和级联文本解码器的繁杂设计,仅用单一 Vision Transformer 统一处理拼接的图像-文本序列并通过自回归生成语言 token,以 1/5 的训练样本量即超越 SigLIP2 等强基线。
研究背景与动机¶
多模态大语言模型(MLLMs)通常由视觉编码器、跨模态投影层(Connector)以及自回归解码的 LLM 推理引擎三部分组成,其中视觉编码器抽取的特征表征质量直接决定了整机视觉感知的上限。当前主流的视觉语言预训练(VLP)范式普遍依赖 CLIP、SigLIP 等对比学习双塔架构。然而,对比学习鼓励在判别式嵌入空间中进行全局图文配对对齐,与下游 MLLM 依靠自回归 Next-Token 预测完成生成式推理的本质存在目标不匹配(Objective Mismatch)。实验诊断表明,直接将判别式对比编码器接入 LLM 时,无论仅微调投影层还是联合微调,其生成困惑度(Perplexity)均显著高于生成式编码器。
为了填补这一目标断层,CapPa、AIMv2 和 OpenVision2 等生成式 VLP 工作采用视觉编码器串联独立文本解码器的结构,用生成 Caption 的语言建模损失间接监督视觉 Backbone。此外,CoCa 和 SigLIP2 进一步叠加额外的文本编码器,融合对比学习和生成式多任务目标。然而,这种多塔级联与混合目标的设计不仅极大增加了模型复杂度与训练显存开销,更使得视觉 Transformer 的梯度只能经由外挂模块间接传导,限制了端到端跨模态表征的学习效率。
针对上述冗余,本文提出回归极简设计:与其引入复杂的多塔或辅助模块,不如直接让 Vision Transformer 学会“说话”。核心 idea:使用单一统一 Transformer 同时建模图像 Patch 与文本 Token 拼接而成的多模态前缀序列,仅通过纯粹的自回归 Next-Token 预测损失从零预训练视觉编码器,并借助门控注意力机制消除注意力汇聚陷阱(Attention Sink)。
方法详解¶
整体框架¶
GenLIP 的核心理念是用最精炼的结构实现端到端的生成式对齐。输入图文对首先经过各自的浅层嵌入层:图像被切分为不重叠 Patch 并经由卷积 Patch Embedding 映射为视觉前缀向量,文本则经由通用的分词器转换为词嵌入向量。两段特征沿序列维度拼接为前缀格式,送入单一 Transformer 主干网络中。在预训练阶段,模型仅依靠自回归语言建模损失预测文本部分;当下游部署为 MLLM 视觉编码器时,直接丢弃文本分词器与语言建模预测头,主干网络的注意力机制退化为标准的全双向自注意力,直接输出用于对齐下游 LLM 的视觉表征。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入数据:图像-文本配对样本"] --> B["多模态序列拼接<br/>图像 Patch 嵌入前缀 + 文本 Token 嵌入"]
B --> C["统一前缀注意力机制<br/>视觉双向自注意力 + 文本因果注意力"]
C --> D["门控注意力机制<br/>逐头输入自适应 Gate 抑制注意力汇聚"]
D --> E["两阶段预训练策略<br/>S1 固定分辨率 224 + S2 原生宽高比自适应"]
E --> F["下游视觉表征抽取<br/>剥离文本 Head,标准全注意力输出视觉向量"]
关键设计¶
1. 统一前缀多模态架构:免除多塔与额外解码器
现有生成式视觉语言预训练往往在视觉编码器外额外构建一个文本解码器,这导致反向传播时视觉主干只能接收来自解码器深层回传的次级梯度,减慢了早期跨模态特征融合的效率。GenLIP 直接将单张图像切片后的 Patch 序列与文本分词后的 Token 序列拼接成一个单一序列 \(S = [v_0, \dots, v_M, t_0, \dots, t_L]\)。为使单个 Transformer 既能完整吸收图像的二维空间全局关联,又能严格遵守文本自回归生成的时间因果律,模型舍弃了传统的二维绝对位置编码,改用多模态旋转位置编码(MRoPE),并在注意力矩阵中实施 Prefix-LM 掩码规则:视觉 Patch 之间采用全双向自注意力以充分聚合空间上下文,而后续的文本 Token 则对所有视觉 Patch 及自身前面的所有文本 Token 采用因果掩码。整个前向过程没有额外的跨模态 Cross-Attention 模块,亦无对比学习批次负样本构造,计算流高度紧凑统一。
2. 门控注意力机制:消除跨模态注意力汇聚(Attention Sink)与表征塌陷
在统一 Transformer 早期融合同步自回归建模中,研究人员发现了一个严重的表征塌陷现象:由于文本 Token 只能以因果形式观察视觉前缀,模型容易倾向于在注意力机制中偷懒,将全图的全局上下文极端压缩至序列第一个视觉 Patch 上,使其充当“图像概括汇总器”。这种注意力汇聚(Attention Sink)导致第一个 Token 吸收了绝大部分的注意力权重分配,不仅在预训练期间引发剧烈的 Loss 震荡峰值(Loss Spikes),更严重破坏了视觉特征在空间 Patch 间的分布多样性,使得模型在 ImageNet 线性探测和密集感知任务上的判别力暴跌(线性探测准确率从 84.3% 暴跌至 76.2%)。为此,GenLIP 引入了输入依赖的逐头门控注意力(Gated Attention):
其中 \(X\) 为当前块的输入隐状态,\(W_g, b_g\) 为可学习投影参数,\(\sigma\) 为 Sigmoid 函数,\(A = \text{Attn}(X)\) 为原始注意力输出。通过在注意力输出与残差连接之间引入这一轻量逐 Token 门控标量,模型动态限制了极端权重的过度集中,强迫语言生成过程从更广泛的空间 Patch 中索取细节语义,显著平抑了训练抖动并恢复了空间特征多样性。
3. 两阶段渐进式训练与原生宽高比自适应
为兼顾计算资源开销与下游密集图文理解需求,GenLIP 划分了清晰的两阶段预训练策略。第一阶段为固定分辨率基础预训练(S1):在 10 亿规模的 Recap-DataComp-1B 重标注合成图文数据集上,将图像统一规范为 \(224 \times 224\) 分辨率(对应 196 个 Patch),累计训练 80 亿样本(8 个 Epoch),高效学习基础多模态对齐表征与语言语义。第二阶段为多分辨率原生宽高比自适应(S2):在包含 3900 万样本的高质量长文本多模态数据集(Infinity-MM、BLIP3o-Long-Caption 与 CapRL)上,保持图像的原生宽高比不变,将图像动态缩放至 Patch 数量介于 16 到 1024 之间,仅微调 1 个 Epoch。该阶段借助 MRoPE 原生支持变长二维网格的优势,使视觉编码器迅速获得超长图表、高密度文本及细粒度文档 OCR 的感知泛化能力,而无需承担全程高分辨率预训练的高昂开销。
损失函数 / 训练策略¶
GenLIP 采用纯粹的自回归负对数似然损失函数,仅在文本 Token 范围上计算梯度,完全不引入图像维度的掩码自编码(MIM)或像素重构损失:
优化过程中针对超深网络引入 Layer Scale 与 Drop Path 进行正则化以稳定深层梯度的传递;批次大小与训练学习率遵循标准余弦退火策略,两阶段共计 8.04B 样本消耗。
实验关键数据¶
主实验¶
在 Cambrian 评测框架指导下,主实验重点考察冻结视觉编码器、仅微调下游多模态大模型(LLaVA-NeXT 分别搭载 Qwen2.5-1.5B-Instruct 与 Qwen2.5-7B-Instruct)设置下的表征质量。评测涵盖文档与 OCR(ChartQA, OCRBench, DocVQA, TextVQA 等)、通用 VQA(VQAv2, GQA, SQA, MME 等)和图像 Caption 生成(NoCaps, COCO, TextCaps)三大类。
下表摘录原论文 Table 2 中 LLaVA-NeXT-Qwen2.5-1.5B 冻结表征评测的代表性对比(重点对照不同规模下的数据消耗量与核心分项指标):
| 模型 | 架构 | 预训练数据量 | ChartQA | DocVQA | OCRBench | MME-P | TextCaps (CIDEr) | 全任务均分 (ALL AVG) |
|---|---|---|---|---|---|---|---|---|
| CLIP (Radford et al.) | ViT-L/14 | 12.8B | 24.8 | 38.9 | 23.7 | 1218 | 117.9 | 53.1 |
| AIMv2 (Fini et al.) | ViT-L/14 | 12.0B | 26.3 | 37.7 | 25.2 | 1157 | 122.4 | 55.7 |
| OpenVision2 (Liu et al.) | ViT-L/16 | 12.8B | 30.7 | 43.3 | 45.6 | 1230 | 127.4 | 58.7 |
| SigLIP (Zhai et al.) | ViT-L/16 | 40.0B | 30.2 | 47.3 | 41.0 | 1203 | 120.7 | 56.9 |
| SigLIP2 (Tschannen et al.) | ViT-L/16 | 40.0B | 33.4 | 45.1 | 45.7 | 1165 | 127.8 | 58.7 |
| GenLIP (本文) | ViT-L/16 | 8.0B | 41.2 | 51.1 | 51.1 | 1258 | 131.4 | 61.5 |
| SigLIP2 (Tschannen et al.) | ViT-So/16 | 40.0B | 35.2 | 46.4 | 47.2 | 1220 | 131.5 | 60.6 |
| GenLIP (本文) | ViT-So/16 | 8.0B | 40.8 | 51.9 | 51.5 | 1215 | 129.5 | 62.6 |
| SigLIP2 (Tschannen et al.) | ViT-g/16 | 40.0B | 35.3 | 47.6 | 47.3 | 1284 | 134.5 | 61.5 |
| GenLIP (本文) | ViT-g/16 | 8.0B | 45.0 | 57.0 | 55.6 | 1256 | 135.4 | 65.2 |
在冻结特征评测中,GenLIP-L/16 仅使用 8.0B 样本即取得 61.5 的综合均分,比使用 40.0B 样本的 SigLIP2-L/16 高出 2.8 分;在 ViT-g/16 规模下,GenLIP 相比 SigLIP2-g/16 的优势扩大到 3.7 分,其中 DocVQA(57.0 vs 47.6)与 ChartQA(45.0 vs 35.3)具有近 10 个百分点的压倒性提升。
消融实验¶
下表汇总结构设计中关键模块的消融表现,主要来自原论文 Table 7(对比 SAIL 架构与权重初始化,均为 1B 样本预训练)、Table 8(对比处理注意力汇聚的不同策略)以及 Table 9(判别特征评价):
| 配置 / 变体 | 核心变动说明 | ChartQA | OCRBench | DocVQA | IN-1K 线性探测 | 全任务均分 (ALL AVG) |
|---|---|---|---|---|---|---|
| SAIL (Qwen3-0.6B 初始化) | 语言预训练权重初始化,标准自注意力 | 31.6 | 30.2 | 39.3 | - | 53.6 |
| SAIL-g (Qwen3-0.6B 初始化) | 保留语言模型初始化 + 门控注意力 | 30.2 | 29.5 | 39.4 | - | 54.8 |
| SAIL-g (Scratch 从零训练) | 舍弃语言模型初始化 + 门控注意力 | 32.5 | 36.0 | 43.6 | - | 56.0 |
| GenLIP-So/16 (默认) | ViT 架构从零训练 + 门控注意力 | 34.6 | 34.2 | 44.1 | 84.3 (S1) | 56.3 |
| 1 Register 寄存器 Token | 引入 1 个寄存器 Token 吸收注意力汇聚 | 30.5 | 32.5 | 37.2 | - | 53.3 |
| 4 Registers 寄存器 Token | 引入 4 个寄存器 Token 吸收注意力汇聚 | 34.5 | 30.8 | 41.0 | - | 55.1 |
| GenLIP-So/16 (w/o GA) | 移除门控注意力 (Table 9) | - | - | - | 76.2 | - |
关键发现¶
- 生成对齐在细粒度图文任务中具备天然红利:在文档、图表与高密度 OCR 任务中,GenLIP 各尺度的提升最为显著,表明语言建模的像素-字符细粒度映射远强于对比学习全局余弦相似度。
- 语言模型预训练权重对视觉编码器提升有限:SAIL-style 实验揭示,直接用训练好的 Qwen3-0.6B 初始化多模态 Transformer 反而不如从零训练(53.6 vs 56.0),表明视觉感知底层特征的提取需要重新组织注意力流,旧有的纯文本注意力先验存在负迁移。
- 门控注意力比寄存器 Token 更加高效优雅:增加 1 到 4 个 Register Token 虽能略微吸收 Sink,但表征均分(53.3/55.1)依然显著落后于门控注意力机制(56.3),且门控机制不仅消除了 Loss Spikes,还一举将 ImageNet 线性探测准确率从 76.2% 提升至 84.3%。
亮点与洞察¶
- 极简架构的极致收敛:去除了所有对比学习的负样本队列与二次投影视觉解码器,单一 Transformer 一把抓,实现了“所见即所思,所思即所言”的无缝对接。
- 巧妙化解混合模态 Attention Sink:敏锐发现了文本生成强行依赖视觉前缀时出现的首 Token 塌陷捷径,以极低参数量的 Sigmoid 门控恢复了视觉 Patch 的空间判别度。
- 可复用的迁移价值:门控前缀自注意力(Gated Prefix-LM Attention)设计与原生宽高比适应策略可以直接推广到所有图生文、视频生成与端到端多模态原生大模型中。
局限与展望¶
- 作者承认的局限:目前的评测主要局限在学术界主流的 LLaVA-NeXT 架构下,在工业级前沿全参数 MLLM 上的实际增益仍待进一步验证;此外预训练数据量仍受限于 1B 级公开语料,更大规模(如百亿级)下的 Scaling Law 尚待探索;模型高度依赖高品质合成 Caption,数据采集与重标注成本较高。
- 潜在不足:虽然视觉特征在 MLLM 生成推理中极强,但因缺乏明确的对比学习约束,其在传统纯判别式任务(如 ImageNet 检索/分类)上相比 SigLIP2 仍有微小差距。
- 改进方向:探索在统一框架下融合弱判别辅助损失,或进一步扩展到交错多图与视频生成式预训练中。
相关工作与启发¶
- vs CLIP / SigLIP / SigLIP2: 对比学习依赖双塔投影并使用匹配损失,主要适用于全局检索与分类,但特征在接入下游生成式 MLLM 时存在对齐损耗;GenLIP 统一为单塔自回归,同等参数下数据效率提升数倍,下游生成困惑度更低。
- vs AIMv2 / OpenVision2: 传统生成式 VLP 必须级联外挂一个独立的文本解码器,带来多阶段优化与梯度损耗;GenLIP 彻底移除了文本解码器,让 ViT 本身充当语言生成器。
- vs SAIL / Chameleon: SAIL 强调利用预训练好的 LLM 构建原生多模态大模型;GenLIP 则专注于“从零训练一个服务于模块化 MLLM 的视觉编码器”,并通过门控机制解决了视觉特征坍塌问题。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ 勇敢砍掉冗余模块,用极其纯粹的生成范式让 ViT 直接输出语言,门控设计有的放矢。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 1.5B/7B 两种 LLM 尺寸、冻结与解冻两类评测、全方位消融与判别力探查,数据详实。
- 写作质量: ⭐⭐⭐⭐⭐ 论点清晰,架构演进动机明确,图表制作专业,阅读体验流畅。
- 价值: ⭐⭐⭐⭐⭐ 为模块化 MLLM 视觉编码器的下一代演化指明了“去复杂化、去对比化”的新方向。