跳转至

NaVLM-PVC: Progressive Visual Compression for Efficient Native-Resolution Encoding in MLLMs

会议: ECCV 2026
论文: ECCV 官方
代码: https://github.com/AI9Stars/NaVLM-PVC(论文承诺开源代码与权重)
领域: 多模态VLM
关键词: 原生分辨率编码, 渐进式视觉压缩, 视觉Transformer, 局部窗口压缩, 细粒度Patch嵌入

一句话总结

针对切片编码割裂全局语义与原生分辨率编码计算量暴涨的核心矛盾,NaVLM-PVC 提出渐进式视觉压缩(PVC)范式,通过精细化 Patch 嵌入(RPE)与层级内容自适应局部窗口压缩(WTC),在保留完整全局上下文与细粒度感知的同时将首字延迟降低达 1.9× 至 2.4×。

研究背景与动机

多模态大语言模型(MLLMs)在文档理解、遥感解译和具身智能交互等领域取得了突飞猛进的进展。为了支持任意宽高比与高分辨率输入,早期主流架构(如 LLaVA-UHD、MiniCPM-V 等)普遍采用切片编码机制(Slice-based Encoding, SBE),将大图切分成若干局部独立 patch 分块后再送入 ViT。然而,切片机制物理上割裂了全局视觉流形,导致跨切片边界的目标被碎片化,模型对整体场景拓扑与长程相对空间关系的感知出现先天缺陷。近年以 Qwen2-VL、Oryx 等为代表的前沿模型逐步转向全局原生分辨率编码(Global Native-Resolution Encoding, GNE),在单次前向中处理整幅大图,显著强化了全局语义连贯性与空间方位推理能力。

然而,全局原生分辨率编码带来了无法忽视的计算瓶颈。标准 Vision Transformer 的自注意力计算复杂度随视觉 token 数呈现二次方增长(\(O(N^2)\)),高分辨率输入不仅急剧拉长视觉编码器的前向时延,更在 LLM 的 Prefill 阶段注入海量视觉 token,造成首字生成延迟(Time-To-First-Token, TTFT)和显存开销成倍攀升。现有折中方案要么依靠后置 Projector(如 Q-Former 或 Pixel-Unshuffle)在 ViT 最后一层集中下采样,此时 ViT 内部每一层仍承受全量 token 的庞大计算;要么依赖线性注意力或从头训练定制架构,难以继承海量开源预训练 ViT 权重的强大表征能力。

面对“切片编码割裂全局、原生编码计算过载”的核心冲突,研究团队探究发现全局编码能消除切片切分带来的十字形各向异性空间偏差,必须在保持全局前向流形的前提下压缩内部冗余。核心 idea:通过精细化 Patch 嵌入(RPE)无缝拓展视觉建模粒度,并在预训练 ViT 内部多阶段插入轻量内容自适应局部窗口压缩(WTC),以渐进分层收敛视觉 token 数量,实现兼备全局连贯性与极致推理效率的原生分辨率多模态编码。

方法详解

整体框架

NaVLM-PVC 遵循经典 MLLM 的三件套架构(视觉编码器、投影层与 LLM),但将视觉编码核心重构为渐进式压缩架构 ViT-PVC。高分辨率输入图片不经切片直接保持原生纵横比输入模型;视觉编码器内部首先通过 RPE 将图像细分并无损映射至初始特征;随后将 Transformer 层划分为 \(J\) 个阶段,在阶段交界处插入 WTC 模块,逐级对 \(2 \times 2\) 局部邻域进行自适应汇聚,使 token 数量呈现阶梯式级联递减;最终浓缩的精炼视觉特征经轻量 MLP Projector 对齐映射后,作为上下文注入 Qwen2-7B 解码。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["原生分辨率输入图像<br/>任意宽高比"] --> B["精细化Patch嵌入 (RPE)<br/>等价权重变换 P→P_hat"]
    B --> C["ViT 阶段1 (多层 Transformer)<br/>N个细粒度密集Token"]
    C --> D["局部窗口压缩 (WTC 1)<br/>内容自适应加权 2x2 汇聚"]
    D --> E["ViT 阶段2 (多层 Transformer)<br/>Token数量压缩至 N/4"]
    E --> F["局部窗口压缩 (WTC 2)<br/>内容自适应加权 2x2 汇聚"]
    F --> G["ViT 阶段3 (多层 Transformer)<br/>Token数量最终压缩至 N/16"]
    G --> H["MLP 投影层<br/>极简维度对齐"]
    H --> I["大语言模型 (LLM)<br/>高效Prefill与自回归生成"]

关键设计

1. 精细化Patch嵌入(RPE):以无损权重重构实现细粒度视觉分词

直接加大输入分辨率会导致 token 激增,而盲目增加 patch size 又会丢失细微几何边缘与文字笔画。RPE 的目标是将预训练 ViT 的 patch 大小 \(P\)(如 \(14 \times 14\)\(16 \times 16\))压缩至更细粒度的 \(\hat{P}\)(如 \(10 \times 10\)\(8 \times 8\)),同时严格保留预训练嵌入核的表征等价性,无需从头预训练 ViT 即可扩展视觉分辨率粒度。

设原始 Patch 权重核为 \(W \in \mathbb{R}^{D \times (C \cdot P \cdot P)}\),细粒度新权重为 \(\hat{W} \in \mathbb{R}^{D \times (C \cdot \hat{P} \cdot \hat{P})}\)。给定图像 patch 向量 \(t\) 与其细粒度对应项 \(\hat{t}\),通过双线性插值或区域采样构造线性变换矩阵 \(B\) 满足 \(\hat{t} = t B\)。为确保原 patch 嵌入与精细化嵌入在新空间具有表征等价性(即 \(t W^\top \approx \hat{t} \hat{W}^\top\)),等价于求解矩阵方程 \(B \hat{W}^\top \approx W^\top\)。作者采用最小二乘伪逆进行闭式解析映射: $$ \hat{W} = (B^\top)^+ W $$ 通过该权重变换,任意尺寸的原始图像在保持纵横比的前提下被切分为高密度、高解析度的初始 token 序列,为后续深层网络的局部语义浓缩奠定精细化底层表征。

2. 窗口化Token压缩(WTC):层级化内容自适应局部聚合

细粒度分词产生的大量视觉 token 若贯穿全层会严重拖垮运算,且深层网络特征空间高度冗余,天然具备局部聚合潜力。WTC 将整个 ViT 编码器沿深度切分为多个阶段,并在阶段间部署非重叠 \(2 \times 2\) 窗口。

相较于具有大量参数且浅层容易出现优化崩溃的 Pixel-Unshuffle,朴素平均池化虽然训练收敛稳定,却赋予背景与核心边界完全相同的均等权重,会削弱 OCR 字符与细密纹理的辨识度。为此,WTC 提出了“内容自适应池化”(Content-Adaptive Pooling, CA-Pooling)机制:首先提取局部窗口内 4 个 token \(\{x_i\}_{i=1}^4\) 的均值特征 \(x_{\text{avg}} = \frac{1}{4} \sum_{i=1}^4 x_i\);随后将局部全局上下文拼接至各局部 token 构建扩展向量 \(\hat{x}_i = [x_i; x_{\text{avg}}] \in \mathbb{R}^{1 \times 2D}\);再通过轻量双层感知机 \(f_\theta\) 预测动态注意力权重 logits \(a_i = f_\theta(\hat{x}_i)\): $$ x_{\text{compressed}} = \sum_{i=1}^{4} \frac{\exp(a_i)}{\sum_{j=1}^{4}\exp(a_j)} x_i $$ 在训练初期,将 \(f_\theta\) 最后一层权重进行零初始化(Zero Initialization),使得输出权重均匀退化为 \(0.25\)(严格等价于平均池化),保障浅层特征优化的连续性与数值稳定性;随着预训练与指令微调推进,模型自主学会向高信息密度区域(如边缘、文字、关键物体质心)倾斜权重,实现保真降维。

3. 联合结构调制与预对齐策略:解耦推理开销与特征流形适配

渐进式压缩的增益受 patch size \(P\)、WTC 模块数量 \(J\) 及其插入层位深度的深度制约。实验发现,将 WTC 插入过浅层位(如第 1~3 层)易打乱底层纹理提取流形,而过深插入则无法显著削减 ViT 内部的自注意力 FLOPs。作者通过系统性网格探索,确立了采用 3 个 WTC 模块(分别插入在第 4、18 及 27 层)的黄金平衡结构,兼具前向延迟与任务精度。

为了消除 RPE 权重重标定与层内 WTC 降采样对预训练 ViT 特征分布的突变扰动,作者专门设计了 400 万样本级(4M)的 ViT 预对齐阶段(Pre-alignment Stage)。在冻结 LLM 的前提下快速自洽对齐视觉流形,使后续联合多模态预训练和 SFT 能够在稳定的几何语义空间中无缝收敛。

实验关键数据

主实验

论文在涵盖通用理解、学术知识、图表/OCR 以及多模态视觉推理的 15 个主流榜单上全面评测了 NaVLM-PVC(以 Qwen2-7B 为语言基座),并对比了学术开源、商业开源以及代表性闭源模型。

表 1:通用与知识类基准性能对比(源自原文 Table 1)

模型 LLM 基座 预训练数据量 (#Data) 压缩比 (Ratio) MME MMBench SEED MMStar MMMU AI2D MathVista
LLaVA-OneVision Qwen2-7B 9.4M 4 1998.0 80.8 75.4 61.7 48.8 81.4 63.2
MiniCPM-V-2.6 Qwen2-7B 460.0M 16 2348.4 78.0 74.1 57.5 49.8 82.1 60.6
Qwen2-VL Qwen2-7B ~700.0M 4 2326.8 80.7 75.3* 60.7 54.1 83.0 58.2
InternVL2 InternLM2.5-7B ~100.0M 4 2210.3 79.5 76.2* 60.7 54.1 83.0 58.3
NaVLM-PVC (本文) Qwen2-7B 20.1M 64 2183.6 81.3 77.2 60.5 50.2 82.9 64.2

表 2:视觉推理与 OCR & 图表基准性能对比(源自原文 Table 2)

模型 压缩比 (Ratio) HallusionBench RealWorldQA CV-Bench-2D OCRBench DocVQA ChartQA
LLaVA-OneVision 4 31.6 66.3 69.7* 62.2 87.5 80.0
MiniCPM-V-2.6 16 48.1 65.5* 69.7* 85.2 90.8 79.4*
Qwen2-VL 4 50.6 70.1 76.0* 86.6 94.5 83.0
NaVLM-PVC (本文) 64 52.2 70.3 73.5 82.7 92.8 82.8

消融实验

为验证各模块的实际增益,作者基于 SigLIP2-SO-400M + Qwen2-7B 在 1024×1024 输入分辨率下展开模块消融(Tab. 3)。

表 3:RPE 与 WTC 组件设计消融(源自原文 Table 3)

配置方案 Patch Size WTC 层数 插入层索引 最终 Token 数 TTFT 延迟 (ms) 全基准均分 (Avg) OCR&Chart 视觉推理
Baseline 16 1 27 (尾层) 1024 233 62.1 61.8 55.7
+ WTC (Avg-pooling) 16 2 4, 18 256 82 59.2 53.4 53.2
+ WTC (CA-pooling) 16 2 4, 18 256 83 60.7 55.6 55.2
+ WTC (Pixel-unshuffle) 16 2 4, 18 256 83 57.5 53.5 52.9
+ RPE + WTC (完整方案) 8 3 4, 18, 27 256 160 63.0 64.6 55.6

表 4:相同预对齐训练机制下的模型性能与 Token 效率(源自原文 Table 4)

编码策略 视觉编码器 PVC 模块 最大 Token 数 均分 (Avg) MME POPE HallusionBench
GNE MoonViT 776 64.11 1522.97 85.38 39.94
GNE with PVC (本文) ViT-PVC 380 64.26 1532.33 88.25 39.11

关键发现

  1. 数据利用效率与极高压缩比:NaVLM-PVC 仅用 20.1M 多模态图文数据,即在总压缩比达到 64 的极致状态下,在 MMBench(81.3)、SEED(77.2)及 MathVista(64.2)上追平甚至超越了使用高达 700M 级训练样本的工业模型 Qwen2-VL(MMBench 80.7,MathVista 58.2)。
  2. 消融证实 RPE 与 WTC 的互补效应:单纯在内部插入平均池化压缩虽然将延迟从 233ms 锐减至 82ms,但 OCR&Chart 性能发生严重坍塌(从 61.8 暴跌至 53.4);引入内容自适应(CA-pooling)拉回了 2.2 个百分点;而进一步结合 RPE 缩小 patch 分词粒度后,OCR 成绩显著反弹至 64.6(超基线 2.8 分),同时仍比基准快 1.5×。
  3. 空间注意力的各向异性修复:在合成探测集 ShapeGrid-Sudoku 上,切片编码模型在水平和垂直切割轴上表现出严重的交叉状性能洼地,注意力热力图严重衰减;而原生编码模型注意力分布均匀,空间推理相对方位准确率提升达 11.0%(73.6% vs. 62.6%)。

亮点与洞察

  • 零初始化自适应门控机制:在局部 \(2 \times 2\) 压缩中,将 MLP 输出层初始化为零使得初始状态完全等同于平滑稳定的平均池化,解决了在预训练 ViT 中浅层插入可学习降采样模块时的梯度震荡与崩溃难题。
  • 伪逆投影重参数化:利用最小二乘闭式解直接重塑 patch 卷积核权重,让原有预训练 ViT 无需经历昂贵的冷启动重训练即可自适应任意更密集的 patch size。
  • 计算瓶颈前移与内生降维:不同于在投影层一次性压缩的“治标”方案,将压缩层级化穿插于 ViT 内部直接降低了自注意力的序列长度 \(N\),使视觉编码器计算开销与 LLM Prefill 阶段同时减负。

局限与展望

  • 窗口聚合仍受限于固定局部网格:当前的 WTC 依然局限在规则的 \(2 \times 2\) 局部邻域内,对于极大跨度的跨区域目标依然依靠标准自注意力建立连接,未来可探索自适应形变窗口或稀疏聚焦聚合。
  • 多级超参搜索依赖人工调优:WTC 的插入层深度与插入数量针对特定架构(如 SigLIP2 27层)进行了经验性确定,若迁移至深层 ViT(如 48 层)需建立通用的神经架构搜索或自适应层剪枝策略。
  • 视频与时空拓展:目前核心实验主要集中于高分辨率单图理解,后续有望扩展至连续视频序列的 3D-PVC 渐进式时空统一压缩。

相关工作与启发

  • vs 切片编码方案 (LLaVA-UHD / MiniCPM-V):切片机制通过裁切图像维持小分辨率,但引入切片边界的人工割裂与各向异性偏差。NaVLM-PVC 坚持全局原生分辨率前向流形,既消除了切片拼接带来的空间伪影,又通过层内压缩取得了比切片更快的端到端推理时延。
  • vs 原生分辨率与密集编码 (Qwen2-VL / MoonViT):Qwen2-VL 等方案需处理海量视觉 token,算力需求苛刻。ViT-PVC 仅用一半甚至四分之一的 token 预算即可达成同等级别的空间与几何理解能力。
  • vs 后置压缩投影 (Pixel-Unshuffle / Resampler / Honeybee):后置压缩只能为 LLM 的输入瘦身,无法降低 ViT 内部自注意力的二次方开销。PVC 的层级内置压缩使 ViT 主干与 LLM 解码器双重受益。

评分

  • 新颖性: ⭐⭐⭐⭐ [系统性揭示切片编码的空间偏差机理,并提出兼具无损分词与渐进窗口池化的 PVC 方案]
  • 实验充分度: ⭐⭐⭐⭐⭐ [涵盖专门设计的 ShapeGrid 探针集、15 个主流基准、细致的各层延迟与收敛消融]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑层层递进,机制图表清晰,实验论据扎实]
  • 价值: ⭐⭐⭐⭐⭐ [为高分辨率 MLLM 的低成本工程部署提供了可无缝复用的 ViT 升级范式]