跳转至

Stabilizing Ultra-Low-Bit Quantization of Multimodal LLMs via Global Bit Allocation

会议: ECCV 2026
论文: ECCV 2026 Poster
领域: 模型压缩
关键词: 多模态大模型量化, 混合精度量化, 块级各向异性, 全局比特分配, 离线训练后量化 (PTQ)

一句话总结

针对多模态大语言模型在 2~3 比特超低位宽量化下精度崩溃的问题,GloBitQ 揭示了由下流误差传播与离群激活共振诱发的块级输出通道双层各向异性,并提出基于统一超参数调控的全局重要性平衡比特分配与轻量仿射平滑,在 2.01/3.01 比特下实现高鲁棒性且免微调的模型压缩。

研究背景与动机

随着多模态大语言模型(VLM)在图文感知与复杂多步推理领域的迅速发展,其庞大的参数量和高昂的显存吞吐需求成为了边缘设备及端侧落地部署的核心瓶颈。训练后权重仅量化(Weight-only PTQ)通过将浮点权重直接映射为低比特整数,无需经历昂贵的端到端重新微调,成为缓解自回归解码阶段显存带宽受限(memory-bound)的最有效路径之一。然而,当把量化位宽进一步推向 2~3 比特的超低极限区间时,传统的均匀精度 PTQ 算法(如 GPTQ 等)遭遇了灾难性的精度崩溃(Accuracy Collapse),甚至在 2 比特下频繁输出无意义的异常值或直接发散。

这一断崖式下跌的本质症结在于量化损失曲面所展现出的极强各向异性(Anisotropy)。现有 PTQ 理论与算法普遍建立在逐层(layer-wise)重建目标之上,将每个线性层孤立看待;在层内,所有输出通道共享同一个输入协方差矩阵 \(H_l = \mathbb{E}[X_l^\top X_l]\),导致优化目标在数学上根本无法区分不同输出通道对下游模块的敏感度差异。均匀精度量化无视了这种异质性,把宝贵的比特预算平均挥霍在不敏感的权重通道上,却使关键通道严重受损。虽然部分混合精度工作尝试分配不同比特,但大多依赖经验启发式规则或局部代用指标,缺乏全局自洽的分配准则。

更为关键的是,当视角从孤立层提升至整个 Transformer 块(Block)级别时,自注意力投射、SwiGLU 门控非线性激活以及层归一化(LayerNorm)会彻底打破层内各输出通道的对称性,使不同通道经过下游网络传播后的误差放大系数产生巨大分歧;而 Transformer 固有的极少数输入离群激活(Activation Outliers)会与通道传播矩阵发生离群-敏感度共振(Outlier-Sensitivity Resonance),将通道间敏感度差异进一步成倍放大。核心 idea:从 Transformer 块级重建误差出发,刻画层间与层内输出通道的双层各向异性及离群共振机理,并以通道权重均值模长为低开销代理,构建由统一超参数调控的层级幂律平滑与通道秩值混合全局比特分配方案(GloBitQ),配合耦合混合精度的仿射平滑实现极低比特平稳量化。

方法详解

整体框架

GloBitQ 的核心目标是在严格受限的全局平均比特预算下(如平均 2.01 或 3.01 比特),以可忽略的计算开销为多模态模型中每个线性层的每个输出通道自动分配合适的位宽(基础位宽 \(b_\ell\) 或提升位宽 \(b_h = b_\ell + 1\)),随后通过轻量仿射变换消除误差。整个管线无需微调权重参数,仅依靠少量无标注多模态校准数据即可离线完成。

流程首先从全精度多模态模型出发,基于块级重建误差 Hessian 展开建立通道敏感度理论模型;接着利用权重均值模长近似各通道的综合敏感度,通过层级幂律加权与层内秩值混合打分计算全局重要性得分,在全局范围内通过 Top-\(\tau\) 截断生成全模型混合精度比特图;最后将确定好的比特图代入量化回路,通过轻量级可学习仿射平滑共同压缩权重与激活的条件数,输出最终的硬件兼容低比特模型。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入: 全精度多模态模型权重与校准样本"] --> B["块级双层各向异性与离群共振分析<br/>打破层级对称性·雅可比传播·离群乘性放大"]
    B --> C["统一超参驱动的全局比特分配机制<br/>层级幂律加权·通道秩值混合·全局Top-τ分配"]
    C --> D["耦合混合精度的轻量仿射平滑<br/>固定离散比特图·联合仿射优化·压缩特征条件数"]
    D --> E["输出: 硬件兼容的超低比特VLM (2.01/3.01-bit)"]

关键设计

1. 块级双层各向异性与离群共振分析:突破层级独立量化对输出通道的对称性盲区

传统 PTQ 方法将目标函数限定在单个线性层的均方误差 \(\mathbb{E}[\|X_l \Delta W_l^\top\|_F^2]\),在此框架下,每个输出通道权重向量 \(w_{l,i}\) 的量化误差均受制于同一个输入协方差矩阵 \(H_l = \mathbb{E}[X_l^\top X_l]\),使得优化器无法分辨输出通道之间的相对重要性。GloBitQ 将量化重建目标提升至包含完整自注意力、SwiGLU 门控、残差连接和 LayerNorm 的 Transformer 块级误差 \(\mathcal{E}_{\mathrm{block}}(\Delta\theta) = \mathbb{E}_{X}[\|\mathcal{B}(X; \theta + \Delta\theta) - \mathcal{B}(X; \theta)\|^2]\)。通过对残差扰动进行 Gauss-Newton 一阶展开,输出通道 \(i\) 的扰动经过下游算子后映射到块输出的雅可比矩阵为 \(M_l \in \mathbb{R}^{Td \times T m_l}\),其对应的通道独立 Hessian 矩阵转变为 \(H_{l,i}^{\mathrm{block}} = X_l^\top [\Phi_l]_{ii} X_l\),其中 \([\Phi_l]_{ii} \in \mathbb{R}^{T \times T}\) 为下游误差传播对角块。因为注意力头划分、门控激活和动态层归一化对各个通道的传播并不均等,\([\Phi_l]_{ii}\) 随通道索引 \(i\) 剧烈变化,彻底打破了传统层级分析的对称性假定,诱发出层内输出通道敏感度 \(\sigma_{l,i}^{\mathrm{block}} = \mathrm{tr}(H_{l,i}^{\mathrm{block}})\) 的显著离散。

更进一步,该机制解释了激活离群值如何造成误差雪崩:输入激活中存在的极少数高幅值通道使得 \(X_l X_l^\top\) 的特征值呈现极端各向异性(条件数 \(\kappa(H_l) \gg 1\))。当各向异性的激活协方差与通道特异的下游传播算子 \([\Phi_l]_{ii}\) 相互作用时,两者主特征向量的对齐使得真实输出通道敏感度比值放大为各向同性情况下的 \(\kappa_\Phi\) 倍(即 \(R_l^{\mathrm{out}} = \kappa_\Phi \cdot R_l^{\mathrm{iso}}\),且 \(\kappa_\Phi \gg 1\))。这种“离群-敏感度共振”构成了层间(不同层整体敏感度不同)与层内(同一层不同通道敏感度分化)的二层各向异性,为输出通道级混合精度量化提供了严密而清晰的物理依据。

2. 统一超参驱动的全局比特分配机制:层级幂律平滑与通道秩值混合归一化

在确定了通道敏感度 \(\sigma_{l,i}^{\mathrm{block}}\) 与量化范围 \(R_{l,i}^2\) 是决定误差削减的关键乘积项后,逐通道计算二阶 Hessian 迹在超大规模多模态模型上难以负担。GloBitQ 发现各通道平均权重绝对模长 \(I_{l,i} = \frac{1}{d_l} \sum_{j=1}^{d_l} |w_{l,i,j}|\) 与块级 Hessian 迹 \(\sigma_{l,i}^{\mathrm{block}}\) 的 Spearman 秩相关系数在多模态模型各层中均稳定超过 0.8,可作为 \(O(d)\) 复杂度的可靠排序代理。为了克服不同层权重模长分布形态各异(有的近均匀、有的重尾)造成的全局排序失真,GloBitQ 引入了双重平衡打分机制。

在层间层面,借鉴率失真理论中比特分配对方差的对数亚线性依赖特征,引入凹性幂律变换计算层重要性归一化权重: $\(\omega_l(\alpha) = \frac{\mu_l^\alpha}{\sum_{k=1}^L \mu_k^\alpha}, \quad \mu_l = \frac{1}{m_l}\sum_{i=1}^{m_l} I_{l,i}\)$ 在层内层面,构建兼具抗噪鲁棒性与绝对幅度感知力的“秩-值混合归一化”通道打分: $\(S_{l,i}(\alpha) = (1 - \alpha) \frac{\mathrm{rank}(I_{l,i})}{n_l} + \alpha \frac{I_{l,i} - I_l^{\min}}{I_l^{\max} - I_l^{\min}}\)$ 其中 \(\alpha \in (0, 1]\) 作为全框架唯一的全局-局部权衡超参数,在 \(\alpha \to 0\)(趋向均匀秩分配)与 \(\alpha \to 1\)(严格按绝对模长比例分配)之间平滑插值。最终计算每个通道的全局综合得分 \(G_{l,i}(\alpha) = \omega_l(\alpha) \cdot S_{l,i}(\alpha)\),并在全模型跨层联合排序后,将处于 Top-\(\tau\) 比例的最敏感通道提升为高位宽 \(b_h\),其余保留基础位宽 \(b_\ell\),理论上严格逼近块级最优分配。

3. 耦合混合精度的轻量仿射平滑:消除理论假设残差并压缩特征条件数

全局比特分配在推导中依赖了量化噪声在输入维度上近似独立同分布、以及权重模长对 Hessian 迹的排序保序性。为消除现实场景中未建模的高阶协方差残差并缓解极端特征条件数,GloBitQ 采用两阶段解耦方案:第一阶段通过原浮点权重一次性计算出全模型离散比特图并永久锁定;第二阶段将该混合精度量化器嵌入优化回路,引入可学习的逐层可逆仿射平滑矩阵(Affine Smoothing)。

在校准优化过程中,仅以 512 张图像图文配对样本微调仿射变换参数 15 个 epoch,使权重矩阵的奇异值分布与激活协方差矩阵的条件数得到联合压缩,显著拉平了量化误差损失曲面的陡峭度。由于比特分配图在优化前已全局冻结,避免了离散决策与连续参数交替更新带来的振荡与不稳定,且仿射变换在推理前可与前后线性算子完全融合吸纳,不产生任何额外的推理硬件开销。

损失函数 / 训练策略

GloBitQ 遵循训练后量化(PTQ)范式,权重主体不进行端到端梯度反向传播。在仿射平滑优化阶段: - 校准数据: 随机抽取来自 ShareGPT4V 数据集中基于 COCO 的 512 条图文微调数据样本。 - 优化配置: 学习率设为 \(5 \times 10^{-3}\),优化周期为 15 epochs,损失函数采用基于输出特征重构的均方误差损失(MSE)。 - 超参数配置: 在 Qwen2-VL-7B 与 Qwen2.5-VL-7B 上超参数 \(\alpha = 0.7\);在 LLaVA-OneVision 上 \(\alpha = 0.5\)。 - 混合比例: 3.01 比特对应 99% 的通道为 3 比特、1% 通道提升至 4 比特;2.01 比特对应 99% 的通道为 2 比特、1% 通道提升至 3 比特。

实验关键数据

主实验

评估在主流多模态基准(ChartQA、DocVQA、OCRBench、ScienceQA、SeedBench 2 Plus、TextVQA)上展开,涵盖 Qwen2-VL-7B、Qwen2.5-VL-7B 及 LLaVA-OneVision 三大经典开源多模态架构。

表 1: 3 比特量化多模态基准评测对比(3-bit / 3.01-bit)

模型与方法 粒度 位宽 (Bit) ChartQA DocVQA OCRBench ScienceQA Seed2Plus TextVQA 平均分 (AVG)
Qwen2-VL-7B
Full Precision (FP16) - - 83.16 93.80 86.50 85.70 69.10 84.30 83.76
GPTQ Per-Channel 3 58.84 74.55 61.50 65.13 50.37 73.49 63.98
GPTAQ Per-Channel 3 58.76 74.03 61.10 64.25 52.17 73.18 63.91
VLMQ Per-Channel 3 59.44 76.59 61.90 63.05 52.92 74.54 64.74
GloBitQ (本文) Per-Channel 3.01 79.28 92.82 82.70 84.33 67.32 83.76 81.70
Qwen2.5-VL-7B
Full Precision (FP16) - - 86.32 94.91 88.40 72.68 69.43 85.31 82.84
GPTQ Per-Channel 3 62.44 89.33 77.70 79.39 66.58 78.38 75.63
GPTAQ Per-Channel 3 63.68 90.41 79.60 80.52 66.40 77.94 76.42
VLMQ Per-Channel 3 65.32 91.36 80.00 81.70 67.32 79.28 77.49
GloBitQ (本文) Per-Channel 3.01 82.00 93.77 86.30 59.34 64.82 84.08 78.30
LLaVA-OneVision
Full Precision (FP16) - - 80.12 87.05 62.30 95.33 65.43 75.93 77.69
GPTQ Per-Channel 3 74.24 77.82 56.60 85.26 60.65 71.90 71.07
GPTAQ Per-Channel 3 75.72 78.07 58.30 85.97 61.84 72.69 72.09
VLMQ Per-Channel 3 74.56 78.21 59.20 86.37 61.05 73.66 72.17
GloBitQ (本文) Per-Channel 3.01 78.52 85.17 62.10 94.69 64.86 74.65 76.66

表 2: 2 比特极限压缩多模态基准评测对比(2-bit / 2.01-bit)

模型与方法 粒度 位宽 (Bit) ChartQA DocVQA OCRBench ScienceQA Seed2Plus TextVQA 平均分 (AVG)
Qwen2-VL-7B
Full Precision (FP16) - - 83.16 93.80 86.50 85.70 69.10 84.30 83.70
GPTQ (Per-Channel) Per-Channel 2.01 - - - - - - NAN (崩溃)
GPTQ (Group-128) Group-128 2 56.44 74.90 62.60 50.37 51.78 71.93 61.30
GPTAQ (Group-128) Group-128 2 56.08 72.57 61.30 59.70 51.25 67.98 61.40
VLMQ (Group-128) Group-128 2 55.32 75.76 62.50 62.32 53.80 74.80 64.00
GloBitQ (本文) Per-Channel 2.01 59.44 79.15 66.60 68.22 53.22 73.35 66.60
Qwen2.5-VL-7B
GPTQ (Per-Channel) Per-Channel 2.01 - - - - - - NAN (崩溃)
GPTQ (Group-128) Group-128 2 57.72 78.79 70.80 55.77 48.40 74.36 64.30
VLMQ (Group-128) Group-128 2 59.68 73.20 69.30 62.72 57.27 65.88 64.60
GloBitQ (本文) Per-Channel 2.01 64.80 81.17 74.10 48.78 54.89 74.69 66.40
LLaVA-OneVision
GPTQ (Per-Channel) Per-Channel 2.01 - - - - - - NAN (崩溃)
VLMQ (Group-128) Group-128 2 62.76 64.82 51.40 69.04 53.32 68.20 61.50
GloBitQ (本文) Per-Channel 2.01 59.48 64.06 52.10 73.72 53.53 61.94 60.80
GloBitQ (本文) Per-Channel 2.05 62.63 68.03 52.70 77.29 55.59 62.83 63.10

消融实验

表 3: Qwen2-VL-7B-Instruct 在 2 比特下全局混合精度机制消融

方法配置 粒度 位宽 (Bit) ChartQA Seed2Plus DocVQA OCRBench ScienceQA TextVQA 平均分 (AVG)
GPTQ Group-128 2 52.64 58.04 56.90 54.73 40.79 68.31 53.50
FlatQuant Per-Channel 2 56.48 58.39 62.90 52.40 46.20 59.47 51.10
GloBitQ (完整) Per-Channel 2.01 59.44 79.15 66.60 68.22 53.22 73.35 66.60

关键发现

  • 极小代价换取极大收益:仅分配 1% 的通道提升 1 比特(平均 2.01-bit 与 3.01-bit,增量显存开销低于 0.1%),GloBitQ 即可防止整个网络在 2 比特下崩溃。在 Qwen2-VL-7B 上,GloBitQ 相比传统均匀 2 比特 FlatQuant 平均暴涨 +15.5%,在多模态复杂理解 SeedBench 2 Plus 上单项从 58.39% 跃升至 79.15%。
  • 3 比特下逼近全精度性能:在 Qwen2-VL-7B 上,GloBitQ 3.01 比特达到 81.70 的平均分,与 FP16 浮点基线的 83.76 仅相差 2.06%(约 2.1%),相对基线 GPTQ(63.98)和 VLMQ(64.74)实现 +17% 级别的绝对优势。
  • 超参数 \(\alpha\) 的平滑折中:针对超参数 \(\alpha\) 的敏感度分析显示,若 \(\alpha\) 过小(0.2~0.3),模型退化为均匀分配,丧失对高敏通道的保护;若 \(\alpha\) 过大(0.7~0.8),过度倾斜少数通道会损伤通用泛化力。中等适中值(\(\alpha = 0.5 \sim 0.7\))在全局与局部敏感度之间达成最佳平衡。

亮点与洞察

  • 从理论上指明了层级独立量化的固有缺陷:指出层内所有输出通道在层级 MSE 下敏感度完全相同的数学盲区,首次严格证明了必须在 Transformer 块级传播和离群激活共振下,输出通道的敏感度才会分化,为混合精度量化奠定了坚实理论基础。
  • 以可忽略开销解耦全局最优分配与连续优化:用通道权重绝对模长(\(O(d)\) 复杂度)成功代理计算成本极高的全模型 Hessian 迹,并用单超参公式统领层间幂律与层内秩值双重加权,冻结比特图后再通过轻量仿射平滑收敛误差,设计极为优雅高效。
  • 对多模态超低比特边缘部署极具实用价值:无需反向微调网络参数,彻底解决 Per-Channel 2 比特模型发散输出 NAN 的业界难题,甚至以 2.01 比特 Per-Channel 超越了需要额外分组元数据开销的 Group-128 基线。

局限与展望

  • 视觉编码器与交叉注意力交互尚未细化建模:当前理论分析主要基于标准 Transformer 块结构展开,未对视觉编码器(如 SigLIP/CLIP)高分辨率动态分辨率输入带来的可变 Token 激活分布做专门针对性建模。
  • 跨层权重依赖关系仍简化为解耦排序:虽然跨层采用了幂律加权平衡,但深浅层之间的非线性误差累积仍假设为可加性分解,面对超深层大模型(如 70B+)可能存在误差传播的非线性失真。
  • 未来方向:可进一步将该全局通道分配策略拓展至带有低比特激活量化(W2A4 / W3A8)的全量化场景,并开发配套的底层硬件 GEMM 算子以直接兑现端侧实测加速。

相关工作与启发

  • vs GPTQ / GPTAQ: 经典工作采用层级误差局部贪心更新,输出通道在目标函数中完全同质,在 2 比特下输出直接发散(NAN);GloBitQ 引入块级视角的全局比特重新分配,在极微小开销下稳定了 2 比特量化。
  • vs VLMQ: VLMQ 针对多模态引入了词元级 Hessian 加权,但仍受限于固定的均匀比特划分;GloBitQ 揭示了跨层与跨通道的双层各向异性,通过 1% 的高比特通道自适应分配实现了显著更高的表现。
  • vs FlatQuant: FlatQuant 单独依靠仿射变换压缩激活异常,但均匀 2 比特分配依然造成严重信息损失;GloBitQ 将仿射平滑与全局混合精度耦合,精度反超 FlatQuant 15.5%。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次揭示块级输出通道各向异性与离群共振机理,构建优雅的全局分配代理与单超参平衡框架。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 3 个代表性多模态大模型、6 大图文权威基准、2 比特与 3 比特主实验及消融分析,数据扎实。
  • 写作质量: ⭐⭐⭐⭐⭐ 理论推导清晰完整,从层级缺陷到块级突破逻辑连贯,图表详实。
  • 价值: ⭐⭐⭐⭐⭐ 突破多模态大模型 2~3 比特实用化瓶颈,免微调、免复杂搜索且兼容硬件,工程实用价值极高。