跳转至

Beyond Selection: Token Parameterization for Extreme Visual Token Compression

会议: NeurIPS2026 Spotlight(据 arXiv comment)
arXiv: 2609.35232
领域: VLM 效率
关键词: 视觉 token 压缩、离散余弦变换、基坐标嵌入、正交重参数化、空间残差

一句话总结

Braco 不再从原始 patch 中挑出少数 token,而是用 DCT 低频骨干、基坐标嵌入、预算相关的坐标组织与稀疏池化空间残差构成紧凑视觉接口,在 576→16 token 时保留 94.0 的 Vanilla 归一化综合得分,并将全流水线 prefill 延迟降至 40.59 ms。

研究背景与动机

视觉语言模型(VLM)通常把图像编码成数百乃至数千个 patch token,再交给大语言模型(LLM)。在极小预算下,原本有效的剪枝或合并容易失效:留下的是几个局部 patch,某个低分区域中的文字、小物体或关系线索可能直接消失。PruMerge、DivPrune 一类方法很轻,但在本文测试的 4–25 token 区间,重要性排序本身无法保证保住全部任务证据。另一条路线用查询或交叉注意力把完整图像汇聚成少量潜在 token,如 MQT-LLaVA、QueCC、TokenPacker;这些接口能改善得分,却也可能让压缩模块自己的计算、参数与对齐训练成为新开销。

作者把问题拆成两层:少量坐标是否含有有用信息,以及下游模型是否容易学会读取这些坐标。先做正交变换再截断,改变的是保留下来的子空间;在已保留子空间内部再做正交旋转,则不增加或丢失信息,却可能改变 token 的相关性、尺度分布和空间组织。两者不能混为“更好的 token 选择”。例如,DCT 系数和对同一低频块做逆 DCT 得到的粗网格在信息上等价,但投影器和 LLM 的训练过程不必对这种 token 轴旋转保持不变。

因此,本文不是单纯把 JPEG 式低通压缩搬到 VLM,也不是声称低频能解决所有视觉任务。低频骨干承载全局结构,但变换后 token 不再对应原始位置,局部细节又可能被截掉;必须同时处理坐标身份、读取难度与细节补偿。核心 idea:把极端视觉压缩视为“选择保留子空间,再组织其坐标”的接口设计,用结构化 DCT 骨干承担全局信息,用基坐标嵌入和预算相关的正交组织改善对齐,再用少量空间残差补回局部证据。

方法详解

整体框架

Braco(Backbone–residual + basis + coordinate)放在视觉编码器之后、多模态投影器之前。输入是原始二维 patch 特征网格,输出是严格固定预算的压缩视觉 token;压缩器本身不读取用户问题或文本提示。主分支依次经过“DCT 低频骨干”“基坐标嵌入”“预算相关坐标组织”,并行的“空间残差”分支直接读取原始网格,最后拼接、归一化、投影到 LLM 隐藏维度。

总预算分成骨干和残差两部分:骨干保留一个方形低频块,残差由若干可学习池化槽位形成。残差分支并不是在逆变换后显式相减得到高频误差,而是从原始空间 token 中学习聚合互补证据。训练时用答案 token 的交叉熵更新可训练接口;推理时沿同一视觉数据流生成压缩接口,不需要标签、诊断探针或额外教师。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    X["图像编码后的<br/>原始 patch 网格"] --> B["DCT 低频骨干"]
    B --> E["基坐标嵌入"]
    E --> A["预算相关坐标组织"]
    X --> R["空间残差"]
    A --> Z["拼接、归一化、投影<br/>固定预算视觉接口"]
    R --> Z
    Z --> L["LLM + 文本提示"]
    T["训练时答案监督"] -.->|交叉熵| L

关键设计

1. DCT 低频骨干:先集中信息,再固定截断

先理解作者的参数化,而不是把 DCT 当作另一个重要性打分器。原始 token 矩阵的每一行对应一个空间位置;正交基沿 token 轴重新表达整个网格,结构化选择矩阵保留少数变换坐标,最后的正交矩阵只重新组织这些已保留坐标。核心关系是:

\[ \mathbf{Z}=\mathbf{A}\mathbf{P}_{\mathcal{S}}\mathbf{U}_{\mathbf{B}}\mathbf{X}. \]

其中,基与截断集合共同决定保留子空间,正交矩阵不改变这个子空间。恒等基加固定截断只是保留几个空间位置;DCT 加相同形状的截断则保留全局余弦模式。对编码器输出的每个特征通道做二维 DCT 后,Braco 保留左上方的方形低频块,因此一个骨干 token 是整个网格的某种全局加权组合,不是一个原始 patch。该规则固定、与图像内容无关,不是对原始 patch 做 top-k,也不是每张图挑幅值最大的频率系数。

这样做的依据是编码后的视觉特征常有短程相关性,DCT 能把较多能量集中到低频区域。但作者明确区分“能量留得多”和“任务信息留得多”:背景可能占很大能量,细小文字却可能能量低而决定答案。能量保留率是截断后特征平方范数的期望除以原始特征平方范数的期望;任务可读性(readability)则在局部线性任务模型下,度量任务方向投影到保留子空间后留下的加权功率比例。这里的“可读性”是可读取任务信息,不是生成文本是否通顺。

作者把二者组合成可压缩性诊断:

\[ \mathcal{C}(\mathbf{B};\mathcal{S})=\lambda\mathcal{E}(\mathbf{B};\mathcal{S})+(1-\lambda)\mathcal{R}(\mathbf{B};\mathcal{S}). \]

能量项关注通用信号失真,可读性项关注保留子空间与任务方向是否匹配;权重决定二者相对重要性。CelebA 冻结特征线性探针是可读性的受控实验,不是最终 VLM 的多模态准确率。结构化截断下 DCT/Haar 的能量优势,在允许逐样本幅值选取时明显缩小,说明优势依赖“基与部署规则”的组合。KLT 只作为基于诊断分布拟合的 oracle 参考,部署的 Braco 不使用 KLT,也不把这些诊断函数当作额外的端到端训练损失。

2. 基坐标嵌入:给全局系数稳定的身份,而不是伪造 patch 位置

一个 DCT 系数汇总多个空间位置,其频率索引不能简单解释为原图上的 patch 位置。如果把低频系数直接展平成序列,下游投影器必须额外学会“这一项代表哪种模式”。Braco 因此在保留的变换网格上加入基坐标嵌入(basis-coordinate embedding,BCE),使同一频率位置跨图像具有一致的身份提示。它与输入图像和文本问题无关,标识的是基坐标,而不是某个图像内容。

具体实现采用 Polar Fourier 特征:把频率索引转成归一化半径与角度,对两者使用多尺度正弦、余弦编码,再用共享线性映射投到视觉特征维度,通过可学习标量门控后加到系数上。归一化半径按原始变换网格尺度定义,不是按残差位置定义。输入无关不等于全无可训练参数:坐标特征固定,但映射和幅度门控可学习。相比自由学习一个位置表,这种编码显式保留频率方向与尺度线索;相比普通二维空间正弦编码,它面对的是频率格点而非原始像素位置。

3. 预算相关坐标组织:信息相同,读取与优化却不同

基坐标嵌入后,Braco 在保留的骨干内部选择坐标组织。vanilla 直接把系数作为 token,idct 用对应低频块尺寸的正交逆 DCT 变成粗空间网格,randrot 则是随机正交旋转对照。这里的逆 DCT 并不恢复原始分辨率,也无法追回被丢弃的高频;它仅在相同低频子空间内换坐标。骨干的原始输入信息不因该正交操作改变,而跨 token 相关性与几何布局可以改变。

可学习性(learnability)诊断因此与可压缩性不同:固定子空间后,它关注训练是否容易收敛、接口是否利于跨模态对齐。作者用 token Gram 矩阵的非对角能量惩罚相关性,用对角元素偏离平均值的程度惩罚尺度不均衡,再加上与首选粗网格组织的几何距离。统计项按骨干预算平方归一化;比较系数坐标与粗网格时,得到:

\[ \mathcal{L}_{\mathrm{learn}}(\mathbf{U}_{C};K_{b})-\mathcal{L}_{\mathrm{learn}}(\mathbf{I};K_{b})=\Delta_{\mathrm{st}}/K_{b}^{2}-\beta\rho_{C}. \]

这里统计差值表示改用粗网格后的统计惩罚增量,几何差值表示留在系数坐标时相对粗网格的错配。差值为正时,系数坐标的诊断得分更好;为负时,粗网格更好。这是两个候选之间的设计启发式,不是对所有正交旋转证明了全局最优,也不是把数据无关的数学恒等式解释成必然准确率提升。

在本文主设置中,骨干不足 16 token 时用 vanilla,达到 16 时用 idct。必须注意这里比较的是骨干预算,而非总预算:总计 16 token 的 c3s7 只有 9 个骨干 token,仍用 vanilla;总计 25 token 的 c4s9 有 16 个骨干 token,才用 idct。新编码器或分布下可以用少量无标签图像估计统计差值并校准切换点。附录中 CLIP、SigLIP、SigLIP2 的 LLaVA-Pretrain 中位切换预算分别为 16、64、36,说明“16”不是普适常数。

4. 空间残差:把有限补偿预算放回局部证据集中的域

低频骨干擅长全局结构,却可能漏掉局部证据。作者的理由不是“高频都重要”,而是局部稀疏信号在一个与空间基不相干的变换基中会分散到许多系数上;再多留几个频率系数未必能高效恢复一个小区域。于是把额外预算放回空间域,让可学习池化直接聚合原始 patch 特征。理论中的稀疏残差能量界支持这一动机,但不是所有图像或任务都具有空间稀疏误差的保证。

轻量 TokenLearner 风格评分器为每个残差槽位输出覆盖完整原始网格的 logits,sparsemax 把这些分数转换成具有稀疏支持、总和为 1 的权重,再对原始空间 token 求加权和。训练中退火温度以鼓励更尖锐的选择;实现也允许在启用时加入归一化网格梯度能量偏置。各槽位生成的是学习到的汇聚 token,不要求等于某个被选中的 patch,更不是对原 patch 排序后直接复制 top-k。附录未给出独立多样性约束,因此也不能假定每个槽位一定关注互不相交区域。

最后把空间残差追加到骨干 token 后面,归一化以协调两类 token 的尺度,再送入投影器。残差不是免费的:附录 c3s7 分解中,残差阶段约 1236.293 MFLOPs,显著高于 DCT 的 56.623 MFLOPs 与嵌入的 38.928 MFLOPs。设计要点是它仍比重型查询压缩器便宜,同时与骨干互补;不能把性能收益全归于固定 DCT,也不能把整套 Braco 描述成无训练模块。

一个完整示例

以主实验 576→16 token 为例,视觉编码器先输出 24×24 个 patch 特征。主分支做二维 DCT,只留下 3×3 低频系数,加入各自的 Polar Fourier 基坐标嵌入。由于骨干只有 9 token,不做逆 DCT,直接使用 vanilla 系数组织。

与此同时,空间分支从完整 576-token 网格计算 7 组稀疏权重,形成 7 个残差 token。最终 9 个骨干与 7 个残差拼成 16 个视觉 token,投影后与文本一起输入 LLM。如果图中出现一个小标签,骨干可能概括场景与总体布局,残差槽位有机会汇聚标签区域;这只是机制示例,不是论文报告的具体成功案例,也不保证文字一定被捕获。

损失函数 / 训练策略

主表全部压缩方法由作者在统一 LLaVA-1.5-7B 框架下重新训练和评估,而非拼接不同论文的公开结果。每个方法、每个预算使用预算专属 checkpoint,遵循 LLaVA 两阶段训练:预训练使用 blip_laion_cc_sbu_558k,指令微调使用 llava_v1_5_mix665k,两阶段各 1 epoch。优化器、学习率日程与权重衰减沿用公开 LLaVA 配方。

预训练总 batch size 为 256,共 2181 步,训练压缩器/接口与投影器,冻结视觉编码器和 LLM;指令微调总 batch size 为 128,共 5198 步,训练接口、投影器与 LLM。可学习性探针仅用预训练目标,以 0.99/0.01 划分 train/dev,并看 dev 交叉熵首次低于 2.50 的步数;它与完整两阶段主表实验应区分。本文的可压缩性、可读性与可学习性主要用于诊断和选择接口,不能误写成联合优化的三项监督损失。

实验关键数据

主实验

主表使用八个基准分数:GQA、MMBench EN/CN、MME All、POPE F1、ScienceQA、TextVQA、MMVet。“Acc.”是各基准得分相对 576-token Vanilla 的比值取均值,再乘 100;它不是普通分类 accuracy,也不代表 94% 的问题答对。以下统一保留这一归一化得分口径:

\[ \mathrm{Acc.}=100|\mathcal{B}|^{-1}\sum_{b\in\mathcal{B}}s_{b}/s_{b}^{\mathrm{Vanilla}}. \]

全流水线成本包含视觉编码器、压缩/投影接口及 LLM prefill;它不等于只测压缩器,也不是完整自回归答案生成时间。主设置在单 GPU、单图像、固定长度提示下测量,A100 上 20 次预热后取 100 次测量均值。

总视觉 token 方法 Acc. 全流水线 prefill FLOPs(T) prefill 延迟(ms)
576 Vanilla 100.0 8.67 67.25
25 TokenPacker 94.2 1.38 38.40
25 Braco 95.2 1.37 41.03
16 QueCC 93.9 1.36 63.22
16 TokenPacker 93.7 1.26 37.87
16 Braco 94.0 1.25 40.59
9 QueCC 93.1 1.26 62.79
9 Braco 93.2 1.15 40.22
4 QueCC 91.4 1.20 64.17
4 Braco 91.2 1.09 40.97

表据原文 Table 1。Braco 在 25/16/9 token 上取得比较方法中的最高综合得分,但不是所有任务都赢,也不是延迟最低:TokenPacker 在 25/16 token 上更快。QueCC 的原生网格不支持固定 24×24 输入上的 5×5 输出,因此没有 25-token 行,不能据此推断 Braco 在该预算击败了 QueCC。

16 token 相对 QueCC 的 prefill 延迟从 63.22 降到 40.59 ms,约降低 36%;相对未压缩模型,16 token 的 FLOPs 从 8.67 降到 1.25T。4 token 只与 QueCC 接近,主表得分还低 0.2;三种子结果也为 91.28±0.15 对 91.35±0.16,而非“每个预算都胜出”。

消融实验

配置 总 token Acc. 压缩器 FLOPs(G) 压缩器延迟(ms)
c2s5:混合骨干与残差 9 93.2 1.382 1.067
c3s0:仅骨干 9 89.8 0.152 0.289
c0s9:仅残差 9 92.0 1.396 1.077
c2s0:较小的仅骨干 4 85.7 0.152 0.288
c0s5:较小的仅残差 5 88.2 1.382 1.091

表据原文 Table 6;c 后数字是低频块边长,不是骨干 token 个数。前三行是同为 9 token 的公平预算比较:混合接口比仅骨干高 3.4,比仅残差高 1.2。后两行帮助分析固定分支的互补性,但总预算不同,不能当作等预算增益;骨干-only 也确实更便宜,不能把“仅残差不更便宜”扩大成所有单分支都更贵。

16-token 方法 测量边界 Acc. 压缩器延迟(ms) 压缩器 FLOPs(G)
QueCC 投影前 93.9 17.864 109.504
Braco 投影前 94.0 1.073 1.389
TokenPacker 投影后 93.7 1.004 15.271
Braco 投影后 94.0 1.270 2.060

表据原文 Table 2。投影前同边界比较才得到 Braco 相对 QueCC 的 16.6 倍压缩器延迟与 78.8 倍 FLOPs 优势;这些倍数不能套到全流水线。投影后 Braco 比 TokenPacker FLOPs 更低,但延迟略高,再次说明 FLOPs 最少不等于所有实现中最快。

关键发现

  • 坐标组织的证据是在固定子空间下测收敛:骨干预算 4 时仅 vanilla 在 1718 步达到 dev 交叉熵阈值;预算 16 时 idct/vanilla 为 707/860 步,预算 64 时为 237/590 步。这些骨干预算不能与主表总 token 预算直接混用。
  • c3s7 下强制 idct 的最终 Acc. 为 90.9,对应选定 vanilla 的 94.0;c4s9 下 idct 为 95.2,vanilla 为 93.2。基坐标嵌入改成 learned/二维 sine–cosine 时,正文报告下降 0.8–0.9 分。
  • 更大输入不是统一“仍保留 16 token”:AnyRes 多视图 Vicuna-7B 的 2880→80 token 达到 98.1,全流水线成本为 3.45T/44.36 ms,未压缩为 40.57T/261.08 ms。Qwen2.5-3B 的 729→16、1024→16、3645→20 分别达到 93.1、92.6、90.8;最后一项 QueCC 为 68.9,各行按对应未压缩模型归一化,不能跨模型当作绝对准确率比较。

亮点与洞察

  • 把“保留什么”与“怎么呈现”分离,是比换一个排序准则更有解释力的贡献。相同低频子空间的坐标对照,避免把优化改善误归因为保留了更多信息。
  • 全局骨干与局部汇聚互补,而不是让一种域承担所有证据。9-token 同预算消融同时排除了“只是用更多 token”和“纯残差已足够”两种简单解释。
  • 诊断函数并非只停留在概念层面:附录报告可压缩性与固定预算 MLP 得分的平均 Spearman 相关为 0.93,可学习性与 dev-loss AUC 的相关为 0.88。它们是实验支持的设计工具,不是通用性能保证。

局限与展望

  • 作者主要评估 LLaVA 系列视觉编码器→LLM 流水线及标准单图基准。视频、密集定位、非规则区域特征与动态 token 场景需要重新检查结构化基、骨干/残差分配和坐标切换规则。
  • 低频与稀疏局部证据的互补假设对 OCR 密集或细粒度定位任务未必足够。DocVQA 校准展示分布会改变切换点,但不等价于这些任务已完成全面端到端验证。
  • Braco 是预算专属训练的接口,不是无训练插件;关键 QueCC/TokenPacker 对比有三种子,其余部分只用单个 checkpoint。小幅综合得分优势、不同边界的模块成本与固定提示下的 prefill 结果,都应保留其测量条件。

相关工作与启发

  • vs PruMerge / DivPrune:它们围绕空间 token 剪枝或合并;Braco 的骨干保留全局变换模式,再用学习池化补细节。代价是需要重新训练接口,而非只做轻量推理时选择。
  • vs QueCC / MQT-LLaVA / TokenPacker:它们采用学习接口,部分带查询条件化;Braco 强调提示无关的固定骨干与轻量残差。QueCC 在 4 token 得分略高、TokenPacker 部分预算延迟更低,不能泛化成所有学习接口都被全面支配。
  • vs Fourier-VLM:双方都用 DCT 低频压缩;Fourier-VLM 以逆 DCT 粗网格作为接口,Braco 显式把坐标组织独立出来,并加入 BCE 与空间残差。可迁移的启发是测试下游是否容易读取压缩坐标,而不只测压缩重建误差。

评分

  • 新颖性: 4/5 — DCT 本身不新,贡献在保留子空间、坐标组织与残差接口的分离及验证。
  • 实验充分度: 4/5 — 有统一重训练、模块成本、消融、大输入与关键三种子结果,架构和任务范围仍有限。
  • 写作质量: 4/5 — 机制主线清楚,但 Acc. 命名与骨干/总预算容易被误读,需要结合附录理解。
  • 价值: 4/5 — 为极端视觉预算提供低开销、可校准的接口设计,部署收益需按具体硬件与 prefill 口径评估。