跳转至

Combating Textual Noise and Redundancy: Entropy-Aware Dense Visual Token Pruning

会议: ECCV2026
Paper: https://eccv.ecva.net/virtual/2026/poster/3558
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/1977.pdf
代码: https://github.com/SJTU-DeepVisionLab/EADP
领域: VLM效率
关键词: 视觉Token剪枝、文本噪声、信息熵、空间先验、子模优化

一句话总结

EADP 先通过文本对图像响应的空间熵过滤分散噪声,再融合局部与全局语义、平滑显著图并按覆盖收益选择视觉 token,使 LLaVA-NeXT-7B 在仅保留 640/2880 个 token 时达到与完整模型相同的 66.3 平均分。

研究背景与动机

视觉语言模型通常把图像切成大量 patch,再把视觉 token 与问题文本一起送入语言模型。高分辨率输入尤其昂贵,但直接删除视觉 token 又容易丢掉细小的文字、物体部件或判断否定问题所需的背景证据。CDPruner 等方法使用 CLIP 的 EOS 全局文本向量衡量图文相关性,这个浓缩表示适合识别总体主题,却未必能把问题里的细粒度实体准确定位到图像局部。

直观上,把每个文本 token 都与每个视觉 token 比较应当更精细;论文却观察到,直接聚合这些响应没有带来预期收益。实体词常在少量 patch 上形成尖峰,而功能词和标点可能在整张图上产生近乎均匀的低响应。后者数量多,累加后便形成抬高背景分数的噪声。即使人工挑出相关实体词,独立取高分 Top-K 仍可能反复选择同一显著部位,遗漏目标其他部分,说明打分与集合选择是两个不同的问题。

本文因而把问题从“哪些 patch 分数最高”改为“哪些 patch 能在问题约束下代表整张图”。核心 idea:用文本空间响应的熵净化细粒度指导,再用带空间先验的加权设施选址目标,在有限预算内选择具有互补覆盖能力的视觉 token。

方法详解

整体框架

输入是一张图像及其问题,输出是交给原有 LLM 的视觉子集。图像编码器先产生 N 个视觉 token;同一问题走两条文本路径:原有 LLM tokenizer 保留生成所需的语言序列,额外的 CLIP 文本编码器提供逐 token 特征与 EOS 特征,用来决定视觉 token 的取舍。这里过滤的是 CLIP 指导分支的文本特征,不是删掉 LLM 实际读到的问题词。

视觉特征通过与 CDPruner 相同实现的轻量投影映射到 CLIP 嵌入空间。熵引导去噪得到局部密集指导,全局语义融合补回整句上下文;空间平滑与分数极化修整相关性图,设施选址选择结合视觉特征相似度逐步选满 K 个 token。最终保留的是原有视觉表示的子集,并非把相邻 patch 合成新特征,也不是另训一个回答模型。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["图像与问题<br/>视觉及文本编码"] --> B["熵引导去噪"]
    B --> C["全局语义融合"]
    A -->|EOS 全局响应| C
    C --> D["空间平滑与分数极化"]
    D --> E["设施选址选择"]
    A -->|视觉特征相似度| E
    E --> F["K 个视觉 token<br/>原问题与 LLM 生成"]

关键设计

1. 熵引导去噪:按响应是否集中筛选文本,而不是按词性删词

对每个非 EOS 文本特征,计算它与全部视觉 token 的余弦相似度,形成 M×N 的矩阵。随后在视觉位置维度做 Softmax,将一行相似度变成空间概率分布,再求信息熵。下式按正文式 (4)–(5) 的含义整理,保留原文使用乘法尺度 τ 的约定;τ 越大,响应越尖锐,并非通常写作除以温度的形式。

\[ p_{i,j}=\frac{\exp(\tau c_{i,j})}{\sum_{k=1}^{N}\exp(\tau c_{i,k})},\qquad h_i=-\sum_{j=1}^{N}p_{i,j}\log p_{i,j}. \]

均匀关注所有 patch 的文本 token 熵高,指向少量局部区域的 token 熵低。算法取熵分布的下尾 q 分位数作为阈值,只让不高于阈值的文本 token 进入后续聚合,因此它依据当前图像中的实际响应筛选,不需要外部 NLP 解析器。分位数边界存在并列时,保留数量不必严格等于 qM;这个机制也不等同于保证保留下来的词都具有正确语义,错误但集中的匹配仍可能通过。

保留之后仍不一视同仁:对负熵乘以 γ 做 Softmax,使空间响应更集中的词获得更高权重。正文认为 CLIP 文本长度受 77-token 上限约束,密集相似度可用一次矩阵乘法计算,但长指令如何截断、分段或覆盖不在已读正文中展开。这里的“密集”指逐文本 token 对逐视觉 token 的指导,不表示能无限长地理解指令。

2. 全局语义融合:让局部实体定位与整句上下文互相补充

密集指导强调实体局部证据,可能忽视整句约束;EOS 全局向量虽然定位粗,却能保留整体语义。EADP 用一个凸组合连接两者,而不是让低熵实体词完全接管剪枝。令 T′ 为保留的文本集合、G 为 EOS 余弦响应、D 为密集指导,核心计算为:

\[ \alpha_i=\frac{\exp(-\gamma h_i)}{\sum_{r\in T'}\exp(-\gamma h_r)},\qquad s_j^D=\sum_{i\in T'}\alpha_i c_{i,j},\qquad s_j^I=\mu s_j^G+(1-\mu)s_j^D. \]

融合结果再做带数值稳定项 ε 的 min-max 归一化,映射到 [0,1],供后续空间处理使用。这也解释了 μ 的方向:μ=0 只有密集指导,μ=1 只有全局指导。消融中 μ=0.5 的五任务平均分为 68.5,高于两个端点的 67.7 与 68.1,支持互补性,却不能推导所有模型都应固定使用这个比例。

3. 空间平滑与分数极化:把局部结构引入权重,而不是强制连续选块

逐 token 打分没有显式邻接关系,某个部件上的尖峰不会自动照顾附近结构。作者把归一化分数还原成 H×W 网格,用 3×3 高斯卷积传播局部响应,再展平成向量。平滑作用于分数,不是对视觉 embedding 做模糊处理;它帮助相邻区域参与竞争,但最终选择仍是离散子集,没有规定必须保留一个连续矩形。

平滑也会压低尖峰、抬高附近背景,因而随后对分数做幂变换,即原文式 (12) 所说的极化。这里不是对分数应用 exp 函数,而是提升幂次:

\[ \hat{s}_j^I=\left(s_{\mathrm{smooth},j}^I\right)^\beta. \]

在 [0,1] 内且 β>1 时,非端点的绝对值会减小,但较高分相对较低分占据更大权重,这才是“强化核心区域”的准确含义。还需区分两个对照:β=1 才是幂变换的恒等映射;β=0 对正分数产生统一权重,并不只是简单关闭锐化。原文把 β=0 称为禁用极化,这一措辞比实际公式更宽泛,零分数如何处理也未在正文交代。

4. 设施选址选择:每增加一个 token,都看它补足了多少未覆盖内容

Top-K 给每个候选一个独立分数,两个几乎重复的高分 patch 仍可能同时入选。设施选址目标则让每个原始 token 找到已选集合中最相似的代表,并按其指令相关性加权。按正文式 (13) 的文字与符号整理,预算约束下的目标是:

\[ \max_{Y\subseteq V,\ |Y|=K}F(Y),\qquad F(Y)=\sum_{j=1}^{N}\hat{s}_j^I\max_{v_i\in Y}\operatorname{Sim}(v_i,v_j). \]

重要区别是权重属于“需要被代表的原始 token”,不只是属于候选本身。一个新候选若与已经选中的 token 几乎相同,对大多数位置的最佳相似度就提升很少;一个能覆盖尚未表示的物体部件的候选则可能有更大收益。这样,选择规则把去冗余放进集合目标,而不是先挑分数再事后去重。

作者采用贪心近似:缓存每个原始 token 当前的最佳覆盖相似度 Curr,每轮加入边际收益最大的候选并更新缓存,直到选满预算。相应增量为:

\[ \Delta(u\mid Y)=\sum_{j=1}^{N}\hat{s}_j^I\left[\max\{\operatorname{Sim}(u,v_j),\operatorname{Curr}(v_j)\}-\operatorname{Curr}(v_j)\right]. \]

这种边际收益递减结构允许使用子模优化工具。作者给出 1−1/e 近似保证,但它应理解为满足相应归一化、非负单调性等条件时对目标值的界,而不是每个语义部件都必然被保留的证明。正文使用余弦相似度,却把空集初始化、负相似度处理与证明放到补充材料;当前缓存正文不足以核验这些实现细节。若预计算 N×N 相似度矩阵,还需要 O(N²) 存储,因此高分辨率与视频场景的剪枝自身也有成本。

一个完整示例

以图 2 中询问图像是否含烤箱的指令为例,CLIP 指导分支检查每个词在视觉网格上的响应;“oven”若集中指向烤箱部位,其低熵响应会比四处分散的格式指令更有影响。与此同时,LLM 的问题文本保持完整,因此按单词或短语作答的要求并不会被从生成输入中删除。

在 LLaVA-1.5 的一个真实实验预算下,576 个视觉 token 最终只保留 128 个。融合后的热区先向相邻结构平滑,再由幂变换调整权重,贪心选择逐轮比较覆盖增量,避免只保留一簇相似 patch。该段是流程示意;缓存没有给出这张图逐轮选中的索引、完整熵值或最后答案的定量验证,不能把它当作额外实验。

损失函数 / 训练策略

EADP 在本文中作为即插即用的推理剪枝模块使用,没有提出新的训练损失、额外微调数据或可复述的训练日程。实验依赖现有 LLaVA 实现,视频采用 lmms-eval,Qwen 系列采用 VLMEvalKit,硬件为 NVIDIA RTX 3090。

复现时必须区分消融取值与统一默认配置:表 7 明确使用 LLaVA-1.5-7B、128 个视觉 token,并扫描 μ、q、β、平滑核及聚合方式,但已读正文没有完整列出 τ、γ、全部模型的默认 β 和跨架构投影细节。缓存数学排版有损,以上公式按相邻定义整理;未明确的参数与实现条件不补造,精确实现仍以原文及代码为准。

实验关键数据

主实验

下表摘录原文表 1–5 的 Avg.,同一行才是同架构、同预算比较。LLaVA 图像 Avg. 覆盖九个任务且不含 VizWiz;Qwen2.5、Qwen3 和视频分别覆盖八、十、三个任务。它们是论文报告的综合分,不是可跨模型直接比较的同一准确率;正文也未完整说明不同原始尺度的汇总规则。

模型 保留 / 原始 token 完整模型 Avg. 对照方法 Avg. EADP Avg. 相对对照差值
LLaVA-1.5-7B 128 / 576 64.9 CDPruner 63.2 63.5 +0.3
LLaVA-1.5-7B 32 / 576 64.9 CDPruner 60.4 60.9 +0.5
LLaVA-NeXT-7B 640 / 2880 66.3 CDPruner 66.0 66.3 +0.3
LLaVA-NeXT-7B 320 / 2880 66.3 CDPruner 64.5 65.2 +0.7
Qwen2.5-VL-7B 512 / 1296 84.0 DivPrune 78.1 78.0 −0.1
Qwen2.5-VL-7B 128 / 1296 84.0 DivPrune 66.4 68.4 +2.0
Qwen3-VL-8B 128 / 1024 84.3 DivPrune / CDPruner 59.2 62.7 +3.5
LLaVA-Video-7B 64×32 / 64×169 61.2 DivPrune 56.2 57.2 +1.0

Qwen3-VL 在 256-token 下的 DocVQA 为 62.8,对照 DivPrune / CDPruner 为 55.8 / 53.0,即增加 7.0 / 9.8 分,说明细粒度文档证据可能受益。视频正文声称 81.1% 剪枝时为 57.0、下降 4.2,但表 5 列出 57.2,相对 61.2 实为下降 4.0;本笔记保留表值并明确此冲突。VizWiz 另有官方测试与验证集复现两种口径,不将它们混入上述平均分。

消融实验

下表来自表 7,全部是 LLaVA-1.5-7B 保留 128 个视觉 token,在 VizWiz、SQA、TextVQA、POPE、MME 五个任务上的 Avg.;各行属于不同扫描组,不能当作逐步累加模块的实验。

扫描项目 配置 Avg. 可支持的结论
全局与密集融合 μ=0.0 67.7 仅密集指导
全局与密集融合 μ=0.5 68.5 两路融合较好
全局与密集融合 μ=1.0 68.1 仅全局指导
文本保留比例 q=0.3 68.6 丢弃更多高熵文本仍有效
文本保留比例 q=0.5 68.5 中等保留比例
文本保留比例 q=0.9 67.6 保留过多文本噪声更大
空间平滑 不使用 67.9 缺少邻域分数传播
空间平滑 3×3 68.5 相对不使用增加 0.6
分数极化 β=0.0 67.8 对正分数形成统一权重
分数极化 β=5.0 68.3 该扫描中的幂次设置

q=0.3 相对 q=0.9 提高 1.0 分,是所列扫描中较清晰的去噪证据;但表中没有独立替换设施选址为 Top-K 的数字,不能声称已定量隔离其贡献。熵、中心质量比、方差三种分散度统计分别为 68.5、68.4、68.5,表明收益不一定来自熵这一统计量的独占优势。

关键发现

效率来自原文表 6:2,000 个样本均匀取自 VizWiz、TextVQA、POPE、MME,在 LLaVA-1.5-7B 上测量。下表保留原始时间与计算量,不将 FLOPs 比值称为端到端加速。

配置 视觉 token Prefill / ms 端到端延迟 / ms FLOPs / G
完整模型 576 207.4 256.8 4489.8
EADP 128 118.8 169.3 1538.4
EADP 32 81.9 129.63 904.1
DivPrune 128 109.6 158.0 1529.9

128-token 下,EADP 的 FLOPs 约减少 65.7%,但端到端仅约加速 1.52 倍;它也比同预算 DivPrune 慢 11.3 ms。因此结论是改善质量与效率的折中,而不是同时取得最高质量和最低延迟。更严格的剪枝并不无损:Qwen3-VL 的 62.7 仍比完整模型 84.3 低 21.6 分。

亮点与洞察

  • 文本噪声可以通过跨模态响应而非词典定义。这个思路适合迁移到依赖文本查询的区域检索,但前提是空间集中程度确实与有效证据相关。
  • 相关性与代表性是不同的优化维度。先形成可靠的查询权重,再比较集合边际收益,能解释为什么精细打分后仍不能只做 Top-K。
  • 空间先验只修改权重,最终仍保留原始视觉特征。这让方法更容易插入现有推理流程,同时保留审查选择结果的可能。

局限与展望

  • 计算与复现边界:作者明确承认相似度预计算的 O(N²) 存储代价,并将更多实现与计时放在补充材料。当前缓存不足以验证长视频上的峰值内存、各模块耗时及所有默认参数。
  • 集中不等于正确:这是笔记分析。低熵响应可能是错误定位,否定、关系和多目标问题中的有效证据也可能分布很广;过滤有误时,全局指导只能提供部分补偿。
  • 理论不是语义保证:设施选址优化的是加权特征覆盖,并不保证每个部件、罕见目标或负例证据都被保留。需要对象级覆盖率与困难负例分组测试来支撑更强结论。
  • 实验归因仍有限:缺少可读的 Top-K 替换消融、重复运行方差和统计显著性。Qwen2.5-VL 的宽预算存在输给对照的情况,不能概括成所有设置都领先。
  • 文本与参数边界:正文未展开长于 CLIP 上限的指令处理。值得测试按指令长度或响应不确定性自适应选择 q、μ 与预算,但这属于后续研究建议,而非本文已验证能力。

相关工作与启发

  • 相对 CDPruner:沿用 EOS 全局指导及投影实现,但增加低熵密集指导,并以设施选址覆盖目标替代主要建模多样性的 DPP。二者都不应被笼统等同于 Top-K。
  • 相对 DivPrune:从基于多样性的视觉压缩进一步引入查询相关权重。EADP 在多数列出的严格预算下分数更高,但 DivPrune 在部分设置更快,且 Qwen2.5-VL 的 512-token Avg. 略高。
  • 相对 FastV、VisionZip:论文将基于重要性和结构感知的剪枝作为对照。可迁移的启发不是替所有方法再加一个分数,而是分别检查指导信号是否受污染、集合目标是否覆盖互补证据。

评分

  • 新颖性: 4/5。将文本空间熵去噪与查询加权设施选址组合,问题定位清楚,但基本统计与优化工具已有成熟基础。
  • 实验充分度: 4/5。覆盖多架构、图像、视频及真实延迟;独立选择器消融和不确定性报告仍不足。
  • 写作质量: 3/5。方法逻辑清晰,但视频数值、极化描述和默认配置说明有不一致或不充分之处。
  • 价值: 4/5。适合研究严格预算下的视觉证据保留,部署前需结合自身模型与延迟目标重新评估。