Look Less, Think Faster: Joint Token-Compute Adaptation for Multimodal LLMs¶
会议: ECCV 2026
论文: ECCV 官方页面
项目: Project Page
领域: LLM效率 / 多模态VLM / LLM推理
关键词: 多模态大模型、自适应推理、Token剪枝、动态计算分配、Pareto最优
一句话总结¶
SmartVL 提出了一个端到端联合调控视觉 Token 序列长度与 LLM 计算深度/宽度的统一多模态自适应推理框架,通过共享预算编码与可微延迟估计器实现跨阶段动态协同调度,在多项多模态基准与多样化算力预算下显著拓展了准确率与效率的 Pareto 前沿。
研究背景与动机¶
多模态大语言模型(MLLMs)在视觉问答、图像描述和视觉定位等任务中展现了卓越的理解能力,然而其高昂且静态的推理开销严重阻碍了实际落地部署。现有模型无论面对的是主体鲜明的简单孤立物体图像,还是充满复杂背景杂斑的嘈杂图像,均耗费等量的计算资源。与此同时,实际部署环境中的硬件负载时刻处于动态波动中,且实时交互与离线批处理系统对延迟容忍度的需求截然不同,静态固定的推理流程无法在有限且多变的运行时计算预算下实现最优权衡。
MLLM 的预计算(prefill)阶段开销主要由三个强耦合的维度主导:视觉 Token 数量决定的序列长度、Transformer 块层数决定的模型深度,以及注意力头和 FFN 通道激活比例决定的模型宽度。以往的高效推理方法普遍在孤立的单一维度上进行自适应优化——要么在视觉侧执行静态启发式的 Token 剪枝(如 FastV、LLaVA-PruMerge),要么在语言侧独立跳过部分网络层或注意力头(如 AdaLLaVA)。这种割裂的设计带来了严重的阶段不匹配:孤立的视觉 Token 剪枝缺乏下游语言模型高阶语义需求的指引,容易造成语义关键特征的不可逆丢失;而孤立的模型跳层/剪头机制则默认输入为全长视觉序列,当上游 Token 已被大幅稀疏化时,无法自适应调整计算深度与宽度。
这两者之间存在根本性的跨阶段耦合:视觉序列的 Token 冗余度与 LLM 内部的推理复杂度紧密关联,语言模型所需的架构容量(深度与宽度)必须严格基于剪枝后视觉输入的实际信息密度进行分配。本文的切入角度是打破这种单一维度的静态割裂,将视觉表征压缩与语言模型计算精简纳入统一优化闭环。核心 idea:设计统一的自适应推理框架 SmartVL,通过跨视觉编码器与 LLM 的共享预算编码和动态 Token 存活率嵌入,利用可微延迟估计器与非对称违规惩罚端到端联合训练视觉 Token 控制器与 LLM 计算控制器,依据输入复杂度和全局预算动态权衡保留更多视觉上下文与激活更深推理层。
方法详解¶
整体框架¶
SmartVL 将 MLLM 的自适应推理问题形式化为在给定输入图文 \((I, T)\) 与归一化算力预算 \(b \in [b_{\min}, 1]\) 下,自适应求解序列长度 \(S\)、有效深度 \(L_{\mathrm{eff}}\) 与各层有效宽度 \(\alpha_l\) 的联合策略 \(\pi(I, T, b)\)。整个系统由串联且协同优化的两大模块构成:在视觉端,视觉 Token 控制器接收注入了预算标记的 ViT 输入,动态生成逐 Token 的二值保留掩码;在语言端,LLM 计算控制器接收视觉序列与文本 Prompt,在强制全容量执行的前 \(P\) 层前缀层充分聚合全局多模态上下文,随后结合视觉 Token 存活率嵌入,为后续 \(L-P\) 层独立预测层级跳过掩码(L 变体)或注意力头组及 FFN 通道掩码(LH 变体)。
在训练阶段,两控制器生成的连续松弛决策被输入至硬件无关的可微 FLOPs 延迟估计器中,通过非对称违规损失引导模型在满足全局算力上限的前提下最大化任务预测表现;在推理阶段,系统移除松弛噪声并引入确定性预算投影机制,确保推理耗时严格受控。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
In["输入: 图像 I + 文本 T + 算力预算 b"] --> TokCtrl["视觉端 Token 控制器<br/>正弦预算融合 + Gumbel-Sigmoid 剪枝"]
TokCtrl --> Svis["筛选后视觉 Token + 前缀文本序列"]
Svis --> Prefix["固定执行 P 层 LLM 前缀层<br/>聚合全局多模态上下文状态"]
Prefix --> CompCtrl["LLM 端计算控制器<br/>拼接 Token 存活率 κ + 独立门控决策"]
CompCtrl --> DynLayers["动态调度后续 L-P 层<br/>自适应跳层 (L) 或注意力头/FFN组激活 (LH)"]
DynLayers --> Out["自适应多模态回答输出"]
关键设计¶
1. 视觉端 Token 控制器:编码器内预算融合与 Gumbel-Sigmoid 离散路由 为克服传统 Token 剪枝脱离算力目标与缺乏动态调控的问题,该模块直接将标量预算 \(b\) 嵌入视觉编码器(ViT)中。通过正弦位置编码结合轻量 MLP 将预算映射为预算向量 \(e_b^{\mathrm{ViT}} = \mathrm{MLP}_{\mathrm{ViT}}(\mathrm{PE}(b)) + \mathbf{p}_b\),并作为额外 Token 追加到图像 Patch 序列末尾。预算 Token 在贯穿 ViT 全部的自注意力层中与所有视觉 Patch 深度交互,最终输出融合了图像语义细节与全局算力约束的上下文预算状态 \(\mathbf{h}_b\)。随后,线性投影层预测每个视觉 Token 的保留对数几率 \(z \in \mathbb{R}^N\),并通过 Gumbel-Sigmoid 直通估计器(Straight-Through Estimator, STE)进行可微二值采样:
在训练前向传播中保留离散二值掩码 \(m_{\mathrm{token}} \in \{0, 1\}^N\)(丢弃的 Token 置零以维持静态张量形状),反向传播则通过连续松弛变量 \(y_i\) 传递梯度。在推理阶段移除噪声,仅物理丢弃 \(\sigma(z_i) \leq 0.5\) 的 Token,紧凑的存活序列由 RoPE 原生支持而无需额外重编码,使模型彻底告别针对不同数据集手动调参保留比率的做法。
2. LLM 端计算控制器:跨阶段存活率感知与无约束独立门控 针对已有计算自适应方法(如 AdaLLaVA)预先假定输入序列长度且依赖 Top-K 排序导致的灵活性不足,LLM 计算控制器首先利用独立的 MLP 将全局预算嵌入语言空间 \(e_b^{\mathrm{LLM}}\),追加在 Prompt 序列之后。前 \(P\) 个 Transformer 块(前缀层)被严格强制以全容量运行,既为多模态推理奠定了不可或缺的底层特征基座,又让预算 Token 充分沉淀全序列上下文信息得到前缀状态 \(\mathbf{h}_b^{(P)}\)。
至关重要的是,由于 LLM 后续计算开销直接受制于进入 LLM 的实际 Token 数量,模型将上游 Token 归一化存活率 \(\kappa = \mathrm{sg}\bigl(\sum_{i=1}^N \sigma(z_i)/N\bigr)\) 经过正弦编码与 MLP 后叠加至前缀状态:\(\tilde{\mathbf{h}}_b^{(P)} = \mathbf{h}_b^{(P)} + \mathrm{MLP}_{\kappa}(\mathrm{PE}(\kappa))\)。利用截断梯度 \(\mathrm{sg}(\cdot)\) 隔断了从 LLM 架构决策反传至视觉 Token 控制器的直接梯度路径,有效消除了两阶段梯度尺度不平衡所导致的视觉侧过早退化崩溃。在得到融合状态后,控制器对后续 \(L-P\) 层采用独立的 Gumbel-Sigmoid 激活,而非生硬的 Top-K 约束,使得各层的激活状态根据视觉信息密度与全局预算自主涌现。论文给出了两种调度粒度:Layer 级(SmartVL-L)输出标量二值掩码 \(g_l \in \{0, 1\}\),未激活层直接走残差旁路;Layer-Head 级(SmartVL-LH)将注意力头与 FFN 拆分为 \(G\) 个等大分组,生成组掩码矩阵 \(M_l \in \{0, 1\}^G\),以组容量比例 \(\alpha_l = \frac{1}{G}\sum_{j=1}^G M_{l,j}\) 统筹注意力机制与 FFN 中间维度的开销,当全组为 0 时自然等价于跳层,在单一机制中统一了深度与宽度控制。
3. 联合优化与推理调度:可微延迟估计器与非对称违规惩罚 为打通跨阶段离散架构搜索的端到端梯度通道,SmartVL 基于 Transformer 预计算浮点运算量构建了可微 FLOPs 估计器。令 \(\tilde{S}_{\mathrm{vis}} = \sum_{i=1}^N \sigma(z_i)\) 为视觉 Token 数的连续可微代理,总序列长度为 \(S = S_{\mathrm{text}} + \tilde{S}_{\mathrm{vis}}\),预计算开销按如下闭式连续近似:
由此得到可微计算开销比率 \(r = \hat{\mathcal{C}} / \mathcal{C}_{\mathrm{full}}\)。针对算力超标与闲置的不同代价,构建非对称违规损失:
超标惩罚 \(\mathcal{L}_{\mathrm{over}}\) 采用二次方强惩罚以严守延迟红线,而欠充惩罚 \(\mathcal{L}_{\mathrm{under}}\) 带有容差边界 \(\mu\),采用线性惩罚平缓鼓励算力利用。总损失函数 \(\mathcal{L}_{\mathrm{total}} = \mathcal{L}_{\mathrm{pred}} + \lambda(t) \cdot (w_{\mathrm{over}}\mathcal{L}_{\mathrm{over}} + w_{\mathrm{under}}\mathcal{L}_{\mathrm{under}})\) 中引入线性热身权重 \(\lambda(t) = \min(1, t/T_{\mathrm{warmup}})\),防止初始化早期惩罚梯度压垮预测损失导致拓扑崩塌。推理时,若连续松弛引起的确定性二值掩码偶发轻微超出预算,系统优先依据视觉侧对截断的高容忍度抛弃置信度最低的视觉 Token,仅在 Token 级收缩不足时进一步跳层或剪头。
损失函数 / 训练策略¶
在训练阶段,ViT 视觉编码器参数完全冻结以保持底层视觉特征分布稳定,端到端联合微调 LLM 主干、多模态投影层(Projector)以及双侧控制器参数。在每个训练步,全局预算 \(b\) 在区间 \([b_{\min}, b_{\max}]\) 内独立均匀采样并广播至整个批次内所有样本,保证了批处理硬件效率的同时使模型学会泛化至连续预算谱。门控线性偏置初始化为正值,使得模型在初期倾向于全容量运行,随后在热身调度下平稳学习稀疏化。
实验关键数据¶
主实验¶
论文基于 LLaVA-1.5-7B 主干在七大综合与细分多模态基准(VQAv2, GQA, TextVQA, ScienceQA, POPE, VizWiz, MMBench)上展开全面评测,并与计算自适应基线 AdaLLaVA、静态 Token 剪枝基线(FastV, LLaVA-PruMerge+)及两阶段级联组合基线 AdaLLaVA-PruMerge 进行了细致对比。
| 基准数据集 | 算力预算 (FLOPs) | SmartVL (本文) | AdaLLaVA | AdaLLaVA-PruMerge | 完整模型 (LLaVA-1.5) | 相比 AdaLLaVA 提升 |
|---|---|---|---|---|---|---|
| VQAv2 | 50% 预算 (~4.2T) | 74.4% | 67.9% | 74.5% | 76.5% | +6.5% |
| VQAv2 | 70% 预算 (~5.9T) | 75.7% | 74.4% | - | 76.5% | +1.3% |
| TextVQA | 50% 预算 (~4.3T) | 54.4% | 29.8% | 51.3% | 58.1% | +24.6% |
| TextVQA | 70% 预算 (~6.0T) | 57.0% | 50.8% | 54.3% | 58.1% | +6.2% |
| VizWiz | 50% 预算 (~4.2T) | 55.1% | 34.3% | - | - | +20.8% |
| GQA | 50% 预算 (~4.1T) | 59.8% | 56.8% | 60.1% | 62.0% | +3.0% |
| MMBench | 50% 预算 (~4.3T) | 62.0% | 63.3% | 63.1% | 64.3% | -1.3% |
| POPE | 50% 预算 (~4.1T) | 86.4% | 86.2% | 86.5% | 87.1% | +0.2% |
| 7个基准均值 | ~50% 预算 | - | - | - | - | +7.8% |
(注:数据源自原文 Fig. 1、Fig. 3 及正文第 4.2 节定量描述。50% 预算下七项基准平均超越 AdaLLaVA 7.8%)
消融与架构扩展实验¶
针对控制器粒度消融(SmartVL-L vs. SmartVL-LH)以及在更大规模主干 LLaVA-1.5-13B(共 40 层,固定 \(P=20\) 层前缀)上的扩展表现,实验结果如下:
| 实验设置 / 模型架构 | 评测基准 / 算力点 | SmartVL (本文) | 对应基准方案 | 性能差值与说明 |
|---|---|---|---|---|
| L vs. LH 粒度 (7B) | TextVQA @ 50% FLOPs | 54.1% (L) / 53.6% (LH) | 51.3% (Ada-PruMerge) | L 略优于 LH,全宽注意力对文本问答更关键 |
| L vs. LH 粒度 (7B) | TextVQA @ 100% FLOPs | 58.1% (L) / 57.5% (LH) | 58.1% (Full Model) | L 达到全容量上限,LH 存在微弱性能折损 |
| 13B 规模扩展 | VQAv2 @ ~50% (~7.25T FLOPs) | 75.45% | 72.27% (AdaLLaVA 13B @ 8.27T) | 节约 1T+ FLOPs 仍保持 +3.18% 准确率绝对优势 |
| 13B 规模扩展 | VQAv2 @ 中高算力 (11.56T FLOPs) | 77.66% | 76.45% (AdaLLaVA 13B @ 11.57T) | 相同算力下领先 +1.21% |
| 13B 规模扩展 | VQAv2 @ 100% 算力 (~16T FLOPs) | 78.82% | 77.85% (AdaLLaVA 13B) | 超过基线完整模型上限 +0.97% |
(注:数据源自原文 Fig. 5、Fig. 8 及第 4.4 节)
关键发现¶
- 跨维度联合自适应的优越性:在 50% 算力极端受限场景下,纯层剪枝方案(AdaLLaVA)因无法缩减视觉序列而必须强行裁撤过半语言层,导致深度推理能力崩溃(TextVQA 骤降至 29.8%,VizWiz 骤降至 34.3%)。SmartVL 动态通过先削减视觉冗余 Token,为 LLM 保留了足以完成图文逻辑整合的深层结构,使 TextVQA 维持在 54.4%,VizWiz 维持在 55.1%。
- 最优 Token-Compute 组合的高度内容与任务依赖性:解耦网格搜索(Fig. 6 & Fig. 7)表明不同任务对计算维度的偏好完全不同。细粒度目标幻觉评测 POPE 极其依赖高视觉覆盖率,即使在算力紧缩下也倾向于保留 80% Token 而仅使用 50% 语言层;而 VQAv2 与 TextVQA 则需要更深的符号推理,更倾向于在保留 90% 语言层的前提下激进压缩视觉 Token。SmartVL 的自适应机制能够自发拟合这种内容偏好,而任何固定的单维度分配均无法全局最优。
- 宽度剪枝与深度跳层的利弊权衡:SmartVL-L(纯层跳过)在多项任务上表现略好于 SmartVL-LH(头组与通道压缩),这表明注意力头和 FFN 宽度的完整性对于多模态特征的高保真传递至关重要,冗余主要集中在序列长度与模型垂直深度维度。
亮点与洞察¶
- 突破孤立优化的跨阶段协同设计:打破了过去视觉侧 Token 剪枝与语言侧模型剪枝各自为战的割裂范式,首次在多模态大模型中确立了“视觉空间信息密度与 LLM 架构容量强耦合”的系统认知,提供了兼顾两者自适应的完整解法。
- 巧妙的截断梯度与预算嵌入交互:在 LLM 计算控制器中引入 Token 存活率 \(\kappa\),并通过
stop-gradient切断其反向传播路径,极其巧妙地化解了跨阶段离散动作空间中梯度幅度悬殊造成的早期训练退化难题。 - 可微硬件代价引导的平滑学习:通过解析推导的 FLOPs 公式直接构造端到端可微比率,配合二次超标惩罚与线性欠充容差,使离散搜索问题转变为平滑可微的目标约束优化,彻底摆脱了复杂的强化学习或繁重的超参网格搜索。
局限与展望¶
- 算力指标局限于 Prefill 阶段 FLOPs:当前延迟估计器以计算密集型的 Prefill 阶段 FLOPs 作为硬件无关代理,尚未涵盖访存受限(Memory-bound)的自回归解码阶段(Decode Stage)开销以及 KV Cache 动态缩容策略。
- 硬件级真实墙钟延迟(Wall-clock Latency)转化依赖定制 Kernel:跳层和 Token 丢弃虽然能够立即降低理论计算量并在部分框架下加速,但注意力头和 FFN 分组稀疏(LH 变体)在通用 GPU 算子下的真实延迟收益受限于显存搬运与非规则张量计算,未来需要结合专用稀疏内核才能完全释放硬件收益。
- 与后训练量化的正交结合潜力:本文的架构维度自适应与权重量化(如 4-bit/8-bit AWQ、QLoRA)互不冲突,二者联合有望进一步击穿终端设备的资源极限。
相关工作与启发¶
- vs AdaLLaVA (ICCV 2025):AdaLLaVA 仅在语言侧通过 Top-K Gumbel-Softmax 跳过 Transformer 层、头和 MLP,完全不感知也不调整视觉 Token 数量。在低算力预算下被迫剪掉大量语言层导致性能雪崩(TextVQA 50% 预算仅 29.8%);SmartVL 引入前置视觉 Token 控制器与跨阶段联动,同等算力下 TextVQA 达 54.4%,7 个基准均值高出 7.8%。
- vs LLaVA-PruMerge+ (ICCV 2025) / FastV (ECCV 2024):这些方法是纯视觉侧的静态 Token 剪枝,依赖数据集级别的人工预设保留比率,且语言模型结构不可变,仅能覆盖有限的算力区间(如 3T~4.8T);SmartVL 实现了输入样本级与运行时预算级的动态双向自适应,平滑覆盖 20%~100%(2.5T~8.5T)的全算力谱。
- vs AdaLLaVA-PruMerge (两阶段组合):朴素组合仅是拼装两个独立调参的单点工具,配置离散且缺乏端到端协同感知;SmartVL 通过共享预算与联合损失进行端到端微调,取得了真正 Pareto 最优的决策边界。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ [首次打破多模态 Token 剪枝与架构剪枝的割裂边界,提出跨感知与认知阶段的端到端联合自适应框架]
- 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 7 大公开基准、横跨 20%~100% 全算力谱,包含详尽的任务解耦网格分析与 13B 规模扩展验证]
- 写作质量: ⭐⭐⭐⭐⭐ [动机叙述逻辑紧密,问题建模、公式推导与架构图文对应清晰自洽]
- 价值: ⭐⭐⭐⭐⭐ [为多模态大模型在边缘端和算力波动环境下的动态部署提供了极具参考价值的理论范式与工业落地路线]