跳转至

SpecEyes: Accelerating Agentic Multimodal LLM via Speculative Planning and Perception

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/MAC-AutoML/SpecEyes
领域: 模型推理加速 / 多模态VLM
关键词: 智能体多模态大模型、投机推理、认知门控、答案可分离度、异构并行服务

一句话总结

SpecEyes 首次将投机加速范式从 token 级跃迁至智能体级,通过无工具轻量小模型快速草拟答案,配合基于 Top-K Logit 可分离度的认知门控拦截高置信样本,并辅以异构并行漏斗掩盖大模型的串行工具调用,在 V*、HR-Bench 和 POPE 等基准上取得平均 1.73x(最高 3.35x)的加速比,且平均准确率提升 2.87%。

研究背景与动机

多模态大语言模型(MLLMs)正经历从静态单次被动感知向动态交互式智能体推理的范式转移。以 DeepEyes、Thyme、OpenAI o3 以及 Gemini Agentic Vision 为代表的智能体多模态模型,通过在多轮推理循环中动态调用外部感知工具(如局部裁剪 Crop、放大 Zoom-in、OCR 识别等),在细粒度视觉检测、高分辨率图像理解和复杂组合空间推理等挑战性任务上展现出强大的主动信息搜索能力。然而,这种赋予模型高超推理能力的机制,在底层系统部署层面却带来了严峻的效率危机。

在现有架构下,每个输入查询都会触发一条长度为智能体深度 \(D\) 的马尔可夫决策工具链,每一步的工具调用动作与观测结果都严格因果依赖于前序步骤的状态反馈。这种强数据依赖不仅导致单查询端到端时延随深度 \(D\) 线性爆炸,更在批处理服务中诱发了并发塌陷(Concurrency Collapse):批次内的多个并发请求由于工具链分支与步数异构,整体吞吐完全被长尾、深层的串行工具调用所扼杀,大量计算硬件处于空转等待状态。以往在语言模型上成熟的 token 级投机解码(如 SpecReason)仅在单步生成内引入草稿模型,仍未摆脱深层工具交互循环;而多模态 token 剪枝或时序压缩方案也仅仅裁剪模型内部注意力计算,并未削减主导延迟的工具调用往返。

现有工作普遍将智能体循环视为不可撼动的既定前置,未曾质疑过“是否每个查询都必须走完完整的工具链”。实际上,现实请求中相当大比例的查询仅需依赖原始图像的全局全局特征即可被轻量视觉语言模型直接解答。本文的核心 idea 是:将投机加速思想从 token/语义级跃迁至智能体级(Agentic-level),构建“快思考-慢思考”的异构层级架构,由轻量非智能体模型快速投机生成无工具解答,并设计基于答案可分离度的无标定认知门控拦截高置信度结果,仅将疑难长尾样本回退给大智能体模型执行工具循环。

方法详解

整体框架

SpecEyes 由四阶段投机流水线与底层的异构并行服务调度构成。系统首先由大智能体模型快速判断输入是否具有跳过工具链的潜力;接着由轻量无工具小模型对候选查询进行完全并行的投机生成;随后通过提出的答案可分离度认知门控量化置信度,高置信度查询直接提前截断并返回,剩余低置信度及复杂查询则安全回退至完整的大模型工具调用循环。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入批次查询 (B个请求) + 原始图像"] --> B["阶段 I:启发式工具调用判断<br/>大模型单token判决 g in {0, 1}"]
    B -->|g=1 必需工具| F["阶段 IV:大模型智能体回退<br/>多轮串行感知-工具循环"]
    B -->|g=0 无工具候选| C["阶段 II:轻量小模型投机预测<br/>无状态并行前向生成候选答案与Logits"]
    C --> D["阶段 III:认知门控分流<br/>Top-K Logit 答案可分离度 S_sep 计算"]
    D -->|"S_sep >= tau (高置信)"| E["直接采纳并返回<br/>完全绕过多轮工具循环"]
    D -->|"S_sep < tau (不确定)"| F
    E --> G["输出最终响应"]
    F --> G

关键设计

1. 四阶段智能体级投机流水线:打破深层工具链的因果串行锁

传统智能体模型的时延瓶颈源于状态转移 \(s_{d+1} = f(s_d, t_d(s_d))\) 构成的强因果链条,导致端到端时延为 \(L_{\text{agent}}(q) = \sum_{d=0}^{D(q)} (c_{\text{llm}} + c_{\text{tool}}(t_d))\)。SpecEyes 打破了这一刚性因果链,将其重构为四个解耦阶段: - 阶段 I(启发式工具判断):由大模型 \(\mathcal{M}_L\) 运行极轻量二分类提示词判断 \(g(q, I) \in \{0, 1\}\)。由于大模型本身具备工具调用策略意识,比小模型能更准确甄别复杂工具需求;该阶段仅生成单个二值 token 且无任何工具调用,引入的判断开销 \(c_J\) 极低。 - 阶段 II(小模型投机预测):判定为无工具候选(\(g=0\))的请求被批量分发给小模型 \(\mathcal{M}_S\)(如 Qwen3-VL-2B)。小模型仅依赖原图 \(I\) 进行单次无状态标准前向传播,输出候选答案 \(\hat{y}_S\) 及其全词表 Logit 分布 \(\{\boldsymbol{\ell}^{(n)}\}\)。 - 阶段 III(认知门控置信度切换):利用认知门控指标 \(S_{\text{sep}}\) 评估投机答案质量,超过阈值 \(\tau\) 的高置信答案直接完成返回;未通过者移交阶段 IV。 - 阶段 IV(智能体安全回退兜底):未通过门控的查询和阶段 I 标记为必须使用工具的查询汇入回退队列,由大模型 \(\mathcal{M}_L\) 接管并执行完整的深层工具感知循环。设阶段 I 筛选比例为 \(\beta\),门控接受率为 \(\alpha\),系统单查询期望时延大幅下降为: $\(\mathbb{E}[L_{\text{SpecEyes}}] = c_J + \beta c_S + (1 - \beta \alpha) L_{\text{agent}}\)$ 当有效绕过率 \(\beta \alpha\) 较高时,绝大部分请求由低成本的轻量前置阶段消化,从根本上消除了深层串行工具延迟。

2. 基于 Top-K Logit 答案可分离度的认知门控:尺度不变与无标定置信度评估

投机系统的生命线在于“何时该相信小模型”。常规置信度评估通常依赖最大 Softmax 概率的几何平均值 \(S_{\text{log}}\),但这一做法面临双重致命缺陷:首先,Softmax 具有显著的过度自信偏置(overconfidence),极易受 Logit 幅度尺度的影响;其次,标点符号或格式性 token 的局部高概率会稀释真正决策位置的歧义性,无法捕捉最优候选与次优竞品之间的竞争态势。

为克服这一难题,SpecEyes 提出了非参数化且尺度不变的 token 级答案可分离度指标 \(S_{\text{sep}}^{(n)}\)。令第 \(n\) 个生成 token 的降序排列 Logits 为 \(\ell^{(n)}_{[1]} \ge \ell^{(n)}_{[2]} \ge \dots \ge \ell^{(n)}_{[|V|]}\),计算其前 \(K\) 个最大 Logit 的均值 \(\mu_K^{(n)}\) 与标准差 \(\sigma_K^{(n)}\),定义: $\(S_{\text{sep}}^{(n)} = \frac{\ell^{(n)}_{[1]} - \mu_K^{(n)}}{\sigma_K^{(n)} + \epsilon}\)$ 该公式的分子衡量了最优 token 超越局部竞品候选簇的绝对安全裕度,分母则通过局部方差对其离散程度进行归一化。当最优选项具有压倒性优势时,\(S_{\text{sep}}^{(n)}\) 极大;当存在多个势均力敌的候选项时,标准差与均值使得该得分迅速衰减。更关键的是,分子分母关于 Logit 缩放具有严格的尺度不变性(Scale-invariant),天然免疫温度系数或输出幅度的未标定畸变。

在从 token 级向整句答案级聚合时,论文提出了最小池化聚合策略(Min Aggregation): $\(S_{\text{sep}}^{\text{min}} = \min_{n \in [|\hat{y}_S|]} S_{\text{sep}}^{(n)}\)$ 从风险理论角度(Proposition 1),整句错误事件为各 token 错误事件的并集 \(\mathcal{E} = \bigcup_n \mathcal{E}_n\)。若单 token 错误概率随 \(S_{\text{sep}}^{(n)}\) 单调递减,则基于最小分离度进行阈值过滤等价于实施了最严格的极值防御(Worst-case guard):只要生成序列中哪怕有一个 token 出现歧义或低置信,整个答案立即触发回退。这保证了高精度导向下的免误判拦截。

3. 异构并行漏斗架构:无状态前向掩盖有状态串行调用

在面向并发负载的真实推理服务系统(如基于 vLLM 连续批处理)中,批处理的墙上时钟时间往往受制于批次内耗时最长、工具调用步数最多的慢请求。SpecEyes 将四阶段流水线组织为异构漏斗形吞吐加速架构: - 批次中的 \(B\) 个请求在阶段 I 和阶段 II 中均为标准的前向推理,属于完全可并发调度的“无状态(Stateless)计算”,可直接享受 GPU 批处理带来的高张量并行收益,前端总开销仅为单步常数 \(c_J + c_S\)。 - 经过认知门控过滤后,仅有残余集合 \(R\),规模约为 \(|R| = (1 - \beta \alpha) B\) 的疑难请求需要进入“有状态(Stateful)”的串行工具循环。 通过将庞大请求池中的 \(\beta \alpha\) 比例提前在无状态前端消化,大模型的有效批次负担被急剧压缩。在连续批处理场景下,系统整体吞吐量提升比约为: $\(\frac{\Theta_{\text{SpecEyes}}}{\Theta_{\text{agent}}} \approx \frac{1}{1 - \beta \alpha}\)$ 这一机制将单查询级别的投机接受率乘性转化为系统级的高并发吞吐收益,彻底破解了智能体 MLLM 在实际生产部署中因并发而导致的吞吐骤降问题。

训练策略与开销说明

SpecEyes 属于完全免训练(Training-free / Zero-shot)的推理期加速系统。它既不需要重新微调小模型或大智能体模型,也不需要训练专门的外部二分类评分网络。阶段 I 仅使用静态启发式 Prompt 引导大模型输出单 token,阶段 III 的认知门控直接作用于解码过程的原始输出 Logit 分布,阈值 \(\tau\) 仅需在小规模校准子集(如 10% 样本)上通过粗粒度网格采样选定,完全保留了通用模型即插即用的部署便捷性。

实验关键数据

主实验

论文在三个核心基准上展开全面评测:细粒度属性与相对空间位置推理基准 V* Bench(包含 Direct Attributes 与 Relative Position 子集)、高分辨率多模态感知基准 HR-Bench(4K 与 8K 分辨率子集)以及视觉幻觉探测基准 POPE(包含 Adversarial、Popular 和 Random 三种测试分布)。测试以 Qwen3-VL-2B 作为小草稿模型 \(M_S\),分别以 DeepEyes(基于 LLaVA-1.5 架构强化学习微调)和 Thyme 为代表性大智能体模型 \(M_L\)(最大允许 5 步工具调用)。

下表展示了原论文 Table 1 的核心对比数据(包含准确率 Acc. % 与相对于基础大模型的端到端墙上时钟加速比 Spd.):

骨干网络与方法 V* Attr (Acc / Spd) V* Pos (Acc / Spd) HR-4K (Acc / Spd) HR-8K (Acc / Spd) POPE Adv (Acc / Spd) POPE Pop (Acc / Spd) POPE Rand (Acc / Spd) 全局平均 (Acc / Spd)
小模型 Qwen3-VL-2B (草稿基线) 77.39% / 5.44x 82.89% / 5.31x 71.38% / 3.20x 68.00% / 2.90x 82.56% / 4.20x 83.80% / 3.78x 86.47% / 4.07x 78.93% / 4.13x
DeepEyes 基础模型 (带完整工具) 90.43% / 1.00x 82.89% / 1.00x 75.85% / 1.00x 71.43% / 1.00x 78.43% / 1.00x 81.90% / 1.00x 88.83% / 1.00x 81.39% / 1.00x
DeepEyes (强制禁用工具) 80.87% / 4.08x 73.68% / 4.18x 75.25% / 2.71x 72.00% / 2.53x 46.90% / 3.78x 49.33% / 3.60x 48.20% / 3.81x 63.75% / 3.53x
SpecReason (Token级语义投机基线) 80.19% / 0.61x 73.91% / 0.38x 80.43% / 0.44x 72.54% / 0.42x 49.10% / 0.38x 51.55% / 0.38x 60.20% / 0.37x 66.85% / 0.43x
SpecEyes (log 概率聚合) 83.48% / 2.06x 88.16% / 2.05x 73.71% / 1.35x 69.67% / 1.28x 83.97% / 1.89x 86.70% / 1.95x 90.50% / 2.05x 82.31% / 1.80x
SpecEyes (mean 均值聚合) 78.26% / 2.89x 84.21% / 3.35x 71.62% / 1.88x 67.38% / 1.77x 85.13% / 2.06x 87.00% / 2.10x 90.13% / 2.14x 80.53% / 2.31x
SpecEyes (bottom-r 聚合) 83.48% / 2.13x 84.21% / 2.12x 75.22% / 1.20x 71.18% / 1.04x 85.13% / 2.08x 87.00% / 2.08x 90.13% / 2.11x 82.34% / 1.82x
SpecEyes (min 最小聚合,推荐) 90.43% / 1.53x 89.47% / 1.90x 75.85% / 1.13x 71.80% / 1.08x 85.13% / 2.13x 87.00% / 2.15x 90.13% / 2.19x 84.26% / 1.73x
Thyme 基础模型 (带完整工具) 86.96% / 1.00x 82.89% / 1.00x 77.72% / 1.00x 72.43% / 1.00x 81.32% / 1.00x 84.53% / 1.00x 90.17% / 1.00x 82.29% / 1.00x
Thyme (强制禁用工具) 84.35% / 2.81x 76.32% / 2.56x 74.25% / 1.85x 69.88% / 1.97x 77.77% / 3.51x 78.17% / 3.32x 79.93% / 2.99x 77.24% / 2.72x
SpecReason (Token级语义投机基线) 89.57% / 0.48x 75.00% / 0.53x 80.01% / 0.52x 81.02% / 0.51x 84.62% / 0.46x 85.97% / 0.43x 90.27% / 0.46x 83.78% / 0.48x
SpecEyes (min 最小聚合,推荐) 87.83% / 1.32x 82.89% / 1.42x 78.47% / 1.01x 73.31% / 0.95x 85.87% / 1.77x 88.30% / 1.78x 91.27% / 1.70x 83.99% / 1.42x

消融实验:草稿小模型尺寸与泛化能力

论文在 Table 2 中进一步评估了不同参数量级的小模型对 SpecEyes 性能的影响,分别测试了 Qwen3-VL-8B 和 Qwen2.5-VL-7B 作为草稿模型的效果:

草稿模型 \(M_S\) 配置 评估指标 V* Attr V* Pos HR-4K HR-8K POPE Adv POPE Pop POPE Rand 全局平均
\(M_S\) = Qwen3-VL-8B (仅草稿) Acc / Spd 81.74% / 4.23x 78.95% / 1.72x 77.50% / 2.46x 69.90% / 1.54x 84.47% / 2.48x 86.67% / 2.69x 91.33% / 3.06x 81.51% / 2.60x
+ DeepEyes 骨干 (SpecEyes min) Acc / Spd 92.17% / 1.47x 80.26% / 2.69x 78.49% / 1.05x 74.06% / 1.06x 84.23% / 1.75x 86.47% / 1.80x 89.70% / 1.85x 83.63% / 1.67x
+ Thyme 骨干 (SpecEyes min) Acc / Spd 90.43% / 1.28x 80.26% / 1.57x 78.38% / 0.96x 74.22% / 0.94x 85.52% / 1.60x 87.27% / 1.48x 90.80% / 1.56x 83.84% / 1.34x
\(M_S\) = Qwen2.5-VL-7B (仅草稿) Acc / Spd 79.13% / 3.95x 71.05% / 1.68x 74.88% / 2.75x 66.87% / 1.72x 79.66% / 2.68x 81.23% / 3.01x 88.79% / 3.55x 77.37% / 2.76x
+ DeepEyes 骨干 (SpecEyes min) Acc / Spd 90.43% / 0.92x 78.95% / 1.63x 75.97% / 1.02x 71.43% / 0.98x 80.60% / 1.20x 84.47% / 1.27x 89.77% / 1.23x 81.66% / 1.18x
+ Thyme 骨干 (SpecEyes min) Acc / Spd 87.83% / 0.93x 78.95% / 1.25x 77.72% / 0.85x 72.31% / 0.83x 82.82% / 1.06x 86.20% / 1.17x 91.10% / 1.19x 82.42% / 1.04x

关键发现

  1. 反直觉的“反向优化”提升精度:在 DeepEyes 骨干上,SpecEyes (min) 的平均准确率从基线的 81.39% 提升至 84.26%(+2.87%),在 POPE Adversarial 上更是从 78.43% 跃升至 85.13%(+6.70%)。分析表明,过度调用局部裁剪等工具反而容易引发累积性视觉幻觉和局部特征过拟合;轻量模型的全局直觉结合严格的门控机制,有效滤除了不必要的误导性工具探索。
  2. Token 级投机基线在智能体场景全面溃败:现有的 SpecReason 在多模态智能体任务上产生显著减速(速度比仅为 0.37x-0.61x,平均时延增加一倍以上),主要原因在于小模型在单步验证中产生了极高的交互 turn 数(平均 3.48 轮)和冗余 token 开销(平均 414 tokens),且无法消除深层工具调用;而 SpecEyes 从宏观智能体路径进行跳跃,彻底规避了交互累赘。
  3. 极值聚合是保障准确率的核心护城河:在四种聚合机制中,\(S_{\text{sep}}^{\text{min}}\) 取得了最佳的精度-速度平衡。均值聚合(mean)虽然速度更快(最高在 V* Pos 达 3.35x),但平均准确率发生滑坡(80.53%);而最小池化扮演了“木桶短板”防御角色,只要存在一个模糊词即触发回退,完美守住了准确率底线。
  4. 小模型规模的收益递减与开销拐点:消融实验表明,虽然 8B 和 7B 模型能提供更高的草稿准确率,但由于其单步前向延迟 \(c_S\) 大幅增加,导致系统整体加速比显著萎缩(DeepEyes 平均加速比从 2B 的 1.73x 降至 8B 的 1.67x 和 7B 的 1.18x),在高分辨率任务(如 HR-Bench 8K)上甚至出现略低于 1.0x 的减速。轻量级小模型(如 2B 级别)构成了性价比最佳的草稿引擎。

亮点与洞察

  • 从微观 Token 投机到宏观 Agentic 投机的认知跃迁:以往针对大模型推理加速的研究长期局限于自回归解码内部的 token 草稿生成,而 SpecEyes 洞察到在智能体系统中主导瓶颈已经发生位移——外部工具调用的串行往返(I/O 与多轮推理)才是主要开销来源。跳过一整段无意义的工具调用链,收益远胜于优化数十个 token 的推导。
  • 无需真实标签与额外训练的答案可分离度指标:传统模型难以实现可靠的自省判断,Softmax 概率因过置信与校准漂移极易引发灾难性错误接受。论文基于高维 Logit 极值与前 \(K\) 个竞品均值方差构造的相对裕度 \(S_{\text{sep}}\),具备严格的尺度不变性,为黑盒/白盒模型提供了即插即用、免标注训练的置信度防火墙。
  • 系统并发友好性设计(无状态掩盖有状态):将大部分请求拦截在无状态前向传播阶段,不仅减少了单查询计算量,更在底层显存管理与连续批处理调度中移除了阻碍高并发的异构动态分支,为学术界与工业界部署复杂 Agentic 系统提供了极具落地价值的系统优化范式。

局限与展望

  • 二值深度投机局限(D=0 瓶颈):目前 SpecEyes 的草稿阶段仅支持完全不调用工具(即智能体深度 \(D=0\))的激进跳过。在类似 HR-Bench 8K 这类绝大多数样本天然高度依赖高分辨率局部裁剪的严苛场景下,无工具候选率 \(\beta\) 和接受率 \(\alpha\) 均受限,导致加速比较小甚至被小模型额外前向开销反噬。未来工作可扩展为多深度投机(Multi-depth Speculation, \(D \in \{1, 2, \dots, n\}\)),允许轻量小模型执行有限的 1-2 次轻量级工具调用后再行门控。
  • 超参数阈值调优的领域泛化:虽然门控计算无须训练参数,但阈值 \(\tau\) 和候选集大小 \(K\) 仍依赖于目标数据集的一定先验(需要 10% 样本的分布采样),面对开放分布或未知任务流时,自适应动态调整阈值算法仍待进一步探索。

相关工作与启发

  • 对比 DeepEyes 与 Thyme 等原生 Agentic MLLM:原生模型通过强化学习使模型学会自主拆解任务并调用放大、裁剪等工具,提升了细粒度视觉推理上限,但牺牲了时延与并发可用性。SpecEyes 与其并非竞争关系,而是正交解耦的推理加速增强层,直接作为包装器挂载在 DeepEyes / Thyme 之上,无需重训即可实现近乎翻倍的加速比。
  • 对比 SpecReason 与 RelayLLM 等投机推理方案:前人工作将投机解码套用在语言智能体或单轮多模态生成上,本质依然是固定推理轨迹内部的微观 token 校验,因而在多轮工具交互下因频繁切换与累积开销产生负加速。SpecEyes 提出了宏观路径跳跃,为未来长思维链推理模型(如 o1/o3 风格系统)的系统级分流加速指明了路径。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次打破将工具调用链视为不可拆解刚性结构的固有思维,系统性提出 Agentic 级别的投机跳过机制与免标定可分离度门控。
  • 实验充分度: ⭐⭐⭐⭐⭐ 在三大主流高难度基准、两大经典智能体骨干以及多个不同规格的草稿模型上开展了详实的对比与消融,提供了严格的理论界与分布 KDE 验证。
  • 写作质量: ⭐⭐⭐⭐⭐ 概念建模清晰严密,从状态转移因果性切入直击智能体系统部署的并发与时延死结,图文表达极其精炼。
  • 价值: ⭐⭐⭐⭐⭐ 极具工程落地与系统借鉴价值,为高成本多模态智能体服务在云端高并发场景下的低成本实时部署提供了切实可行的解决路线。