VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling¶
会议: ECCV 2026
论文: ECCV 2026
代码: https://github.com/ShareLab-SII/VLZip
领域: 多模态 VLM
关键词: 长上下文多模态、图文交错理解、多模态Token压缩、软前缀注入、Q-Former
一句话总结¶
VLZip 针对图文交错长上下文推理中的注意力二次复杂度瓶颈,提出将视觉与文本分块统一蒸馏为层级软前缀并在解码器每层残差注入,在纯 Transformer 架构下将训练序列上限扩展 6 倍至 120K tokens,并在超长叙事推理基准 LongVLBench 上取得领先性能。
研究背景与动机¶
多模态大语言模型(VLM)在单图理解与短程问答上取得了显著进展,但在面对现实世界中的复杂活动时,仍受限于超长图文交错序列(如带图操作手册、长程医疗影像档案、视频连贯叙事以及长时间跨度的 GUI 智能体轨迹)。处理此类长序列面临两大基本壁垒:其一是架构层面上自注意力机制随序列长度呈现的二次复杂度增长,使得显存与计算开销急剧攀升;其二是现有长上下文多模态评测基准普遍缺乏对真实叙事推理的考验,大量评测要么简单拼接短上下文数据,要么依赖人工合成的“大海捞针”(NIAH)事实检索或填充无关文本,无法评估模型对全局上下文的深层综合理解能力。
现有缓解计算瓶颈的方法通常陷入效率与表达能力的妥协。主流方案大致沿三条技术路线展开:第一类是激进的输入剪枝(如 GlimpsePrune、VisionZip),这类方法几乎只针对视觉 token 进行静态或动态丢弃,带来不可逆的细粒度细节损失,且完全忽略了交错序列中文本维度的膨胀;第二类是架构替换,尝试用状态空间模型(SSM,如 Mamba)或混合架构替代 Transformer,虽提升了吞吐,却削弱了 Transformer 擅长的精准非局部推理;第三类是基于高质量长序列微调的数据驱动路线,未触碰底层的二次计算瓶颈。同时,文本领域虽然探索了软提示压缩(Soft Prompt Compression),但普遍局限于纯文本模态与单层输入嵌入注入,难以直接应对图文交错的复杂多模态动态。
本文的切入角度是:无需推翻标准 Transformer 架构,也无需永久丢弃上下文细节,而是将长程图文交错上下文外部蒸馏为高度浓缩的多层“软前缀”,并在解码器内部逐层供给细粒度全局信息。核心 idea:提出统一的视觉与文本分层压缩框架 VLZip,将交错图文分块蒸馏为各解码器层专用的紧凑软前缀,并在每个解码器层将软前缀残差注入到占位符隐状态中,以极小的外部压缩代价换取自注意力序列长度缩减 25 倍的高效高保真长程推理。
方法详解¶
整体框架¶
VLZip 面向由系统提示 \(S\)、用户问题 \(Q\) 以及长程图文交错上下文 \(C = \{t_0, v_0, \dots, t_n, v_n\}\) 组成的输入序列 \(X = \{S, C, Q\}\)。系统提示和问题保持原生输入不变,仅对冗长交错上下文 \(C\) 施加压缩。整体处理流程分为三个阶段:首先,通过模态专属的轻量级层次化压缩器,将图像分块与长文本分块独立蒸馏为针对解码器所有 \(L\) 层的紧凑表征向量;随后,在输入序列中用固定数量的占位符 token(文本占位符 T-P 与图像占位符 I-P)替代原始上下文块,使主干 LLM 的自注意力长度缩减数十倍;最后,在解码器前向传播过程中,于每一层自注意力计算之前,将对应的分层软前缀以残差相加形式注入占位符隐状态,确保深层推理持续拥有全景高保真上下文。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["长程图文交错输入<br/>系统提示 S + 交错上下文 C + 问题 Q"] --> B["双模态分块与分层软前缀蒸馏<br/>视觉分块与轻量文本编码 + Q-Former生成L层前缀"]
B --> C["跨模态占位符紧凑序列构建<br/>用轻量占位符 T-P / I-P 替代原始图文块"]
C --> D["逐层隐状态残差注入<br/>各Decoder层前将软前缀残差相加至占位符隐状态"]
D --> E["长上下文自注意力与答案生成<br/>短序列高效自注意力 + 细粒度全局语义推理"]
关键设计¶
1. 双模态分块与分层软前缀蒸馏:统一抽取紧凑层级表征 针对传统方法仅压缩图像 token 而忽略交错文本膨胀、且单步浅层压缩容易遗失复杂特征的痛点,VLZip 设计了对称且独立的层次化视觉与文本压缩模块。对于视觉模态,每张图像经视觉编码器提取出 \(N_{v,j}\) 个视觉 token 后,被均匀划分为尺寸为 \(C_v\)(默认 100)的局部块。每个视觉块输入共享的视觉 Q-Former,利用预设的 \(L \times M_v\) 个可学习查询向量 \(\mathbf{q}_v \in \mathbb{R}^{(L \cdot M_v) \times d}\),在单次前向传播中同时生成适用于全部 \(L\) 个解码器层的软前缀向量 \(\mathbf{Z}_{v,j,p} \in \mathbb{R}^{L \times M_v \times d}\)。对于文本模态,长文本段首先切分为 \(C_t\)(默认 100)token 的文本块,由轻量级文本编码器(Qwen2.5-0.5B)抽取初始特征后,经线性映射矩阵 \(\mathbf{W}_{\text{proj}}\) 对齐维度,再由文本 Q-Former 通过 \(L \times M_t\) 个可学习查询 \(\mathbf{q}_t \in \mathbb{R}^{(L \cdot M_t) \times d}\) 一次性生成全层文本软前缀 \(\mathbf{Z}_{t,i,k} \in \mathbb{R}^{L \times M_t \times d}\)。该设计避免了为每一层重复调用压缩器带来的额外推理时延,实现了层间差异化语义特征的高效解耦抽取。
2. 跨模态占位符紧凑序列构建:显著压减自注意力序列开销 针对长序列在主干 LLM 中自注意力计算的二次方内存与时间开销瓶颈,VLZip 在输入层采用占位符替换机制重构序列结构。对于每个包含 \(C_v\) 个 token 的原始图像块,序列中仅保留 \(M_v\)(默认 4)个专用的视觉占位符 token(I-P);对于每个包含 \(C_t\) 个 token 的原始文本块,同样仅保留 \(M_t\)(默认 4)个文本占位符 token(T-P)。这使得交错上下文在进入 LLM 嵌入层时被严格压缩了 \(C / M = 25\) 倍。例如长达 100K 的原始多模态上下文进入主干模型时被折叠为仅 4K 个占位符 token,系统提示和待解答问题则保持完整分辨率,既规避了自注意力计算中平方级的显存占用与注意力分散,又严格锁定了交错图文在时空时序上的对齐拓扑。
3. 逐层隐状态残差注入:保障全深度细粒度全局语义连贯 针对在输入层一次性拼接软提示(Soft Prompt)容易在深层网络中被前向计算稀释、从而丧失细粒度上下文细节的问题,VLZip 提出了跨所有解码器层的逐层残差注入机制。在解码器的第 \(l\) 层,记视觉占位符与文本占位符在该层的输入隐状态分别为 \(\mathbf{H}_{v,j,p}^{(l)} \in \mathbb{R}^{M_v \times d}\) 与 \(\mathbf{H}_{t,i,k}^{(l)} \in \mathbb{R}^{M_t \times d}\)。在执行本层自注意力计算之前,直接将该层对应的紧凑软前缀切片通过逐元素加法融合进入隐状态:
更新后的隐状态再与系统提示及问题的隐状态一同参与该层的自注意力机制与前馈网络计算。这一设计让模型在整个前向推理深度上始终能够直接访问未经多层非线性衰减的原始上下文细粒度表征,从而让紧凑的 4-token 占位符在深层解码中承载起高达 100-token 原始信息量的全局推断需求。
损失函数 / 训练策略¶
为了保证多组件协同学习的稳定性,VLZip 制定了递进式四阶段课程训练流水线(Curriculum Training Pipeline): 1. 阶段 1:视觉压缩器预训练(Visual Compressor Pre-training)。在单图指令微调数据(LLaVA-OneVision 单图子集)上训练,冻结视觉主干与 LLM 解码器,仅更新投影适配器与视觉 Q-Former 参数,学习将单图局部块压缩为多层软前缀。 2. 阶段 2:文本压缩器自监督预训练(Textual Compressor Pre-training)。在长文档语料(ChatQA2)上通过文本重构任务进行训练,要求模型将长文本块压缩后重构还原原文,仅训练轻量文本编码器、投影矩阵 \(\mathbf{W}_{\text{proj}}\) 和文本 Q-Former,确保压缩表征的语义完备性。 3. 阶段 3:多图文交错联合微调(Joint Interleaved Fine-tuning)。在多图多文交错序列数据集上联合训练,放开 LLM 解码器权重并保持两个压缩器可学习,促使模型学会协同理解并融合来自视觉和文本双通道的压缩软前缀。 4. 阶段 4:超长上下文强化巩固(Long-Context Consolidation)。在真实超长图文交错数据上进一步微调,全面适配极端上下文长度下的全局推理与依赖建模,巩固长程检索与综合分析能力。
实验关键数据¶
主实验¶
论文在提出的超长叙事基准 LongVLBench(涵盖 0-4k 至 >128k 共 7 个长度区间,总共 140 个高难度长视频叙事问答样本)上进行了全方位评测,同时在 MMLongBench(包含 VRAG、NIAH、ICL 三大任务)上验证泛化性。主干模型基于 Qwen2.5-VL-Instruct-3B。
下表给出了在 LongVLBench 上的对比结果,统计了各长度区间得分及推理成功率(防止 OOM 导致的断流):
| 模型 | 参数量 | 0-4k | 4k-8k | 8k-16k | 16k-32k | 32k-64k | 64k-128k | >128k | 平均分 |
|---|---|---|---|---|---|---|---|---|---|
| Long-VITA | 14B | 5.25 (100%) | 6.10 (100%) | 6.94 (80%) | 3.80 (75%) | 5.78 (45%) | 5.33 (15%) | 0.00 (0%) | 33.1 |
| LongLLaVA | 9B | 4.70 (100%) | 5.15 (100%) | 4.95 (100%) | 4.20 (100%) | 6.10 (100%) | 5.20 (100%) | 1.20 (100%) | 45.0 |
| Mantis | 8B | 0.70 (100%) | 2.00 (100%) | 1.88 (85%) | 0.00 (10%) | 2.00 (5%) | 0.00 (0%) | 0.00 (0%) | 6.3 |
| Qwen2.5-VL | 7B | 4.90 (100%) | 5.55 (100%) | 5.80 (100%) | 5.25 (100%) | 5.70 (100%) | 4.25 (100%) | 1.58 (95%) | 47.1 |
| InternVL2.5 | 4B | 4.95 (100%) | 5.05 (100%) | 5.85 (100%) | 4.90 (100%) | 3.15 (100%) | 2.90 (100%) | 0.95 (95%) | 39.1 |
| Ovis2 | 4B | 4.85 (100%) | 6.25 (100%) | 6.25 (100%) | 4.35 (100%) | 5.95 (100%) | 0.40 (100%) | 0.50 (100%) | 40.8 |
| GlimpsePrune | 3B | 5.35 (100%) | 4.70 (100%) | 6.20 (100%) | 4.45 (100%) | 5.10 (100%) | 2.21 (95%) | 0.00 (65%) | 39.9 |
| VisionZip | 3B | 4.95 (100%) | 4.70 (100%) | 6.89 (90%) | 3.75 (20%) | 2.00 (5%) | 4.00 (15%) | 0.00 (0%) | 24.7 |
| Qwen2.5-VL(基线) | 3B | 5.35 (100%) | 4.90 (100%) | 6.20 (100%) | 4.30 (100%) | 5.60 (100%) | 2.58 (95%) | 0.16 (95%) | 41.4 |
| VLZip (本文) | 3B | 4.60 (100%) | 5.65 (100%) | 5.75 (100%) | 5.60 (100%) | 6.70 (100%) | 7.45 (100%) | 7.60 (100%) | 61.9 |
下表补充了 MMLongBench 在极端 128k 长度下的核心评测数据对比:
| 模型 | 规模 | VRAG-128k | NIAH-128k | ICL-128k |
|---|---|---|---|---|
| LongLLaVA | 9B | 18.9 | 36.5 | OOM / - |
| Qwen2.5-VL | 7B | 31.1 | 27.0 | 44.0 |
| InternVL2.5 | 4B | 21.3 | 25.4 | 0.8 |
| GlimpsePrune | 3B | 8.2 | 13.5 | 6.8 |
| Qwen2.5-VL(基线) | 3B | 10.8 | 13.4 | 7.5 |
| VLZip (本文) | 3B | 23.3 | 25.3 | 58.8 |
消融实验¶
论文开展了系统的消融研究,验证了双模态压缩必要性、注入层选择以及分块参数的影响。
下表展示了在 8 卡 A100 (DeepSpeed ZeRO-2) 上,不同模态压缩组合对最大可训练序列长度的影响:
| 视觉压缩 | 文本压缩 | 最大可训练序列长度 (Tokens) |
|---|---|---|
| ✗ | ✗ | 20K |
| ✓ | ✗ | 50K |
| ✗ | ✓ | 40K |
| ✓ | ✓ | 120K |
下表给出了在固定 \(C=100, M=4\) 时,不同注入层策略在各任务上的表现对比:
| 注入策略 | VRAG avg | VRAG 128k | NIAH avg | NIAH 128k | ICL avg | ICL 128k | LongVL avg | LongVL >128k |
|---|---|---|---|---|---|---|---|---|
| First-layer (仅第一层) | 31.2 | 31.3 | 31.3 | 27.8 | 75.8 | 55.5 | 59.6 | 8.00 |
| First-half (前半层) | 30.0 | 28.0 | 28.9 | 27.1 | 70.2 | 42.3 | 60.6 | 7.65 |
| Interval-2 (隔层注入) | 28.9 | 27.8 | 30.6 | 27.2 | 70.8 | 39.3 | 61.8 | 8.25 |
| Full-layer (全层注入) | 26.0 | 23.3 | 30.5 | 25.3 | 76.6 | 58.8 | 61.9 | 7.60 |
关键发现¶
- 双模态统一压缩是长上下文训练的关键解:仅做单模态压缩只能将可训练长度从 20K 微增至 40K/50K,因为在交错序列中未压缩模态迅速成为显存瓶颈;只有同时压缩视觉与文本,才能将训练上下文一举推至 120K,实现 6 倍扩容。
- 极端长度下叙事推理能力展现“涌现”优势:在 LongVLBench 超过 128k 的区间内,基线 Qwen2.5-VL-3B 得分崩溃至 0.16,主流剪枝方法断流 OOM;而 VLZip 逆势上扬取得 7.60 的高分,表明全层软前缀注入成功保全了远距离因果推理所需的细粒度脉络。
- 全层注入机制是复杂推理与上下文学习的核心支撑:虽然首层注入(First-layer)在局部匹配检索(VRAG/NIAH)上表现略好,但全层注入在多样本上下文学习(ICL-128k 达到 58.8,远超 7B 模型的 44.0)和长程叙事综合(LongVLBench 61.9)上占据决定性优势,证明深层注意力极度依赖持续供给的全局上下文特征。
- 分块尺寸解耦影响局部检索与宏观理解:实验显示细粒度分块(\(C=25\))在短程检索上具备优势,而在极端长上下文下,较大分块(\(C=100, M=4\))捕获了更稳固的高阶语义块,长程泛化更优。
亮点与洞察¶
- 一次前向产生多层专属特征的 Q-Former 查询设计:巧妙利用 \(L \times M\) 维可学习查询向量,在单次前向传播中同时蒸馏出供给所有 \(L\) 个解码器层的软前缀,既免去了每一层单独执行交叉注意力的繁重开销,又赋予了不同深度解码器差异化的上下文表征。
- 以恒定占位符换取纯 Transformer 的极致推断伸缩性:通过在注意力计算中仅保留压缩占位符,自注意力序列长度压缩 25 倍,在单卡 A100-80GB 上成功实现 280K 推理,推理速度相比未压缩基线提升达 23.6 倍,并展现出外推支持 200 万(2M)tokens 显存不溢出的平坦曲率。
- 长视频叙事基准 LongVLBench 打破评测合成假象:不同于简单拼接或人工填塞噪声的虚假长文本数据集,LongVLBench 依托 CLIP 关键帧聚类与三级叙事描述链,构建了具有真实因果与时间线延续性的 interleaved 数据集,对多模态长文本领域建立了具有区分度的全新评测基准。
局限与展望¶
- 短程纯视觉感知与局部细节检索出现轻微性能妥协:在常规单图与短程 VQA(如 GQA、AI2D)以及短文本检索中,由于固定分块压缩平滑了局部像素信息,性能相比无损原始模型有 5%~10% 的掉点。未来可引入自适应动态分块或高分辨率细节跳跃直连机制。
- 对称压缩超参数假设仍有优化空间:当前实验固定图像与文本的分块大小与 token 数一致(\(C_v=C_t=100, M_v=M_t=4\)),然而视觉与语言的语义密度与信息熵截然不同,未来探索非对称模态压缩率有望进一步提升效率与保真度的 Pareto 前沿。
- 针对极短文本缺乏自适应判定逻辑:目前对于小于 100 字符的极短文本需要依靠启发式阈值透传跳过压缩,未能完全端到端自适应学习分块边界。
相关工作与启发¶
- vs 输入剪枝方法(GlimpsePrune, VisionZip):剪枝方法直接在注意力矩阵或前置阶段永久扔掉图像 token,不仅信息丢失无法挽回,更无法解决交错长文本的显存膨胀;VLZip 通过软前缀蒸馏保留了全部块区的高阶语义,且统一压缩图文双模态。
- vs 非 Transformer 架构模型(LongLLaVA, LongMamba):混合架构试图引入线性注意力和状态空间模型(SSM)降低长程开销,但在全局非局部关联和精细因果推断上存在固有表达能力折损;VLZip 完整保留了纯 Transformer 解码器的强表达能力,仅在输入和隐状态上进行表征压缩。
- vs 纯文本软提示压缩(GIST, ICA, DeepStack):传统软提示主要用于纯文本且通常仅在输入层进行静态拼接注入;DeepStack 虽然探索了视觉深层堆叠,但未处理交错多模态和长文本压缩。VLZip 首次将分层软前缀与全层残差注入推广至图文交错复杂场景中。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次提出将图文双模态统一分块蒸馏为多层软前缀并在纯 Transformer 解码器中逐层残差注入,构思精巧且落地坚实。
- 实验充分度: ⭐⭐⭐⭐⭐ 不仅在现有长上下文基准与常规短基准上全面对比,更自主研发了极具价值的 LongVLBench,覆盖显存、时间、各阶段训练消融极其完备。
- 写作质量: ⭐⭐⭐⭐⭐ 论证脉络清晰,动机阐述直击领域现有痛点,实验设计层层递进。
- 价值: ⭐⭐⭐⭐⭐ 为图文交错多模态长上下文大模型提供了一条不依赖复杂架构改动、实用性极高的高性能轻量化落地路径。