跳转至

LISA: Locality-Informed Speculative Decoding for Accelerating Autoregressive Image Generation

会议: ECCV 2026
论文: ECCV 原文
项目页: https://neuraliying.github.io/LISA
领域: 图像生成
关键词: 自回归图像生成, 投机解码, 局部几何结构, 知识蒸馏, 软验证

一句话总结

针对视觉 Token 分布平坦分散导致投机解码接受率崩溃的问题,LISA 提出利用视觉码本的局部几何先验,在训练侧引入局部感知蒸馏、在推理侧引入几何感知软验证,实现高达 4.12× 的无损加速。

研究背景与动机

自回归(Autoregressive, AR)模型通过逐 Token 序列化生成在图像合成与统一多模态生成中取得了卓越质量,但严格的自回归解码机制带来了沉重的推理延迟开销。在大型语言模型(LLM)中,投机解码(Speculative Decoding)通过轻量级草稿模型(Drafter)预生成候选 Token、再由目标大模型并行验证,已成为主流的高效加速范式。然而,当将当前领先的投机解码技术(如 EAGLE-3)直接迁移至视觉自回归模型时,加速收益却十分有限,甚至出现严重退化。

这种失效的根源在于离散视觉 Token 与自然语言 Token 之间本质的分布差异。语言 Token 的概率分布通常呈尖锐的“尖峰状”,概率质量高度集中于少数候选词;而由连续信号矢量量化(VQ)离散化而来的视觉 Token,其预测分布极其平坦且缺乏判别性,导致草稿模型与目标模型极难实现严格对齐。更为严峻的是,视觉生成依赖随机采样(如温度采样 \(T>0\)、Top-\(K\) 采样),采样随机性会进一步分散概率质量,使原本在贪婪解码下表现尚可的严格逐点(Pointwise)验证机制在采样模式下发生接受率断崖式崩溃。

深入分析表明,尽管视觉分布全局平坦且空间熵分布不均,但由于 VQ 码本在语义上保留了连续视觉信号的局部相似性与空间冗余,高不确定性位置的目标概率质量在几何邻域内高度集中。核心 idea:利用离散视觉码本内在的局部几何先验,在训练侧通过局部感知蒸馏重加权高熵结构化不确定性区域的对齐监督,在推理侧通过几何感知软验证自适应放宽接受边界,从而系统性打通视觉投机解码的对齐与验证瓶颈。

方法详解

整体框架

LISA 遵循经典的“草稿模型生成候选树 + 目标模型并行验证”架构。为解决视觉 Token 分布平坦和采样失效的痛点,LISA 建立了涵盖训练与推理的双阶段闭环:在训练阶段,针对视觉先验各向异性分布,设计局部感知蒸馏(Locality-Informed Distillation),根据目标分布局部质心邻域的质量聚集度与草稿模型的失配程度构建动态门控,优先对齐高熵难例位置;在推理阶段,设计几何感知软验证(Geometry-Aware Soft Verification, GASV),根据目标预测熵自适应调整容忍阈值,并在白化特征空间中联合评估候选 Token 的几何漂移与聚类后验支持度,实现安全而宽松的 Token 接受。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入 Context 与提示词"] --> B["草稿模型生成候选树<br/>Draft Tree Expansion"]
    B --> C["目标模型并行前向计算<br/>提取预测 Logits 与隐状态"]
    C --> D["不确定性调制阈值<br/>基于熵与 Logit Margin 动态缩放"]
    D --> E["几何感知软验证 GASV<br/>几何漂移度与聚类后验概率联合判定"]
    E -->|接受候选序列 / 采样修正| F["输出被接受的视觉 Token 序列"]

关键设计

1. 局部感知位置选择:精准捕获局部聚集但预测失配的高价值区域

标准蒸馏损失在平坦的视觉分布上对所有位置平均用力,导致草稿模型在语义多义和纹理复杂的难例区域频繁失配。LISA 利用 VQ 码本在连续嵌入空间的局部几何特性,为每个位置构建几何锚点。首先在 \(L_2\) 归一化的码本空间中计算目标模型前 \(K_c\) 个最高概率 Token 的加权质心 \(\mathbf{c}_{b,t}\),并以此质心定义余弦距离半径为 \(r\) 的几何邻域 \(\mathcal{N}_{b,t}\)。当目标分布在该邻域内的累积概率质量 \(\alpha^t_{b,t}\) 很高、而草稿模型 Top-1 预测却落在邻域之外(即归属指标 \(a_{b,t}=0\))时,该位置被赋予极高的失配评分: $\(s_{b,t} = \alpha^t_{b,t}(1 - a_{b,t})\)$ 通过设定动态分位数阈值生成掩码,使监督信号集中于目标模型局部确定但草稿模型尚未对齐的关键空间位置。

2. 渐进式软门控与截断支持联合蒸馏:平滑优化动态并稳定梯度流

在训练初期,硬性选择高失配位置可能导致优化过程受过度复杂的局部噪声干扰而失稳。为此,LISA 引入基于局部对齐进度的渐进式软门控机制 \(g_{\mathrm{align}}(b,t)\),该门控由目标与草稿分布在联合 Top-\(K\) 集合 \(\mathcal{K}(b,t)\) 上的 KL 散度指数衰减决定: $\(g_{\mathrm{align}}(b,t) = \exp\left( -\mathrm{KL}\left(\tilde{p}_t^{(\mathcal{K})}(\cdot \mid b,t) \;\|\; \tilde{p}_s^{(\mathcal{K})}(\cdot \mid b,t)\right) \right)\)$ 结合调度否决因子 \(w_{\mathrm{veto}}(b,t)\),得到每个位置的最终损失权重 \(w_{b,t}\)。未选中的位置保留基线权重以维持平滑梯度流,入选位置则根据门控动态加权。在此权重调制下,模型在目标核集合 \(\mathcal{S}_t(b,t)\) 上优化截断交叉熵损失 \(\mathcal{L}_{\mathrm{CE}}\),并在联合支持集 \(\mathcal{K}\) 上最小化对齐损失 \(\mathcal{L}_{\mathrm{KD}}\),使草稿模型集中学习有意义的局部概率轮廓。

3. 不确定性调制阈值:感知生成熵的自适应接受边界

传统的固定严格拒绝采样准则在视觉生成的复杂纹理区会导致接受率剧降,因为此时真实分布的多峰性必然稀释单个 Token 概率。LISA 在验证时实时统计目标分布的归一化信息熵 \(U = \frac{-\sum_v p_t(v)\log p_t(v)}{\log V}\) 与归一化 Logit 裕度 \(m_{\mathrm{norm}} = \sigma(\ell_{(1)} - \ell_{(2)})\)。基于“目标不确定性越高,Top-1 与局部候选间感知差距越小”的统计规律,动态调节基准容忍阈值: $\(\kappa_{\mathrm{eff}} = f_\kappa(\kappa; U, m_{\mathrm{norm}}), \quad \lambda_{\mathrm{eff}} = f_\lambda(\lambda; U, m_{\mathrm{norm}})\)$ 当处于高熵、低 Margin 的高不确定性区域时,有效阈值自适应放宽,允许草稿模型提出的几何邻近 Token 获得更高接受概率,而在低熵的确定性区域收紧边界,确保严格保真。

4. 双路置信度软验证:几何漂移与聚类后验的容错判决

针对草稿模型给出的候选 Token \(v\) 与目标模型 Top-1 Token \(i\),LISA 在白化特征空间度量几何漂移距离 \(s_{\mathrm{geo}}(v) = \frac{\ell_i - \ell_v}{\|(\mathbf{w}_i - \mathbf{w}_v)\odot \mathrm{invstd}\|_2 + \varepsilon}\),并与离线预计算的聚类几何预算 \(\beta_{c_i}\) 比较得到几何软得分 \(g_{\mathrm{geo}}(v)\)。同时,将词表预划分为若干代表性聚类,计算聚类后验对数质量 \(\pi_c\),得到聚类隶属软得分 \(g_{\mathrm{clu}}(v)\)。最终通过逻辑或(OR-style)门控汇聚两路置信度: $\(g(v) = \max\left(g_{\mathrm{geo}}(v), \; g_{\mathrm{clu}}(v)\right)\)$ 将重调权重作用于原始采样分布 \(p_{\mathrm{soft}}(v) \propto p_{\mathrm{raw}}(v) g(v)\),使得语义相近或处于同一几何邻域内的候选在不破坏整体生成感知结构的前提下被安全接受。

损失函数 / 训练策略

草稿模型的整体训练目标由加权截断交叉熵与加权局部分布蒸馏组合而成: $\(\mathcal{L}_{\mathrm{tot}} = \lambda_{\mathrm{CE}}\mathcal{L}_{\mathrm{CE}} + \lambda_{\mathrm{KD}}\mathcal{L}_{\mathrm{KD}}\)$ 其中 \(\mathcal{L}_{\mathrm{CE}} = -\sum_{b,t} w_{b,t}\sum_{v\in\mathcal{S}_t(b,t)}\tilde{p}_t(v\mid b,t)\log p_s(v\mid b,t)\)\(\mathcal{L}_{\mathrm{KD}} = \tau_s^2 \sum_{b,t} w_{b,t} \mathrm{KL}\left(\tilde{p}_t^{(\mathcal{K})}(\cdot\mid b,t) \;\|\; \tilde{p}_s^{(\mathcal{K})}(\cdot\mid b,t)\right)\)。所有草稿模型基于 EAGLE-3 架构,使用 BF16 精度、学习率 \(3\times 10^{-4}\) 在 A100 GPU 上训练 6 个 epoch。训练数据在 LlamaGen-XL-T2I 上采用 100k LAION-COCO 子集,在 Lumina-mGPT-7B 上采用 30k 目标生成样本集。

实验关键数据

主实验

在单张 RTX 4090 GPU 上测试文生图(MS-COCO 2017 验证集 5,000 张)与类别生图(ImageNet-1K 20,000 张)任务的端到端端加速比与生成质量。

数据集 / 模型 方法 加速比 (Speedup)↑ 平均接受长度 (Acc. Len.)↑ FID↓ 质量指标 (CLIP↑ / IS↑)
LlamaGen-XL-T2I (MS-COCO) Vanilla 1.00× 45.5 28.6 (CLIP)
LlamaGen-XL-T2I EAGLE-2 0.97× 1.20 43.1 28.9 (CLIP)
LlamaGen-XL-T2I LANTERN 1.70× 2.40 47.2 28.6 (CLIP)
LlamaGen-XL-T2I SJD 1.61× 1.69 48.1 28.7 (CLIP)
LlamaGen-XL-T2I LISA (本文) 2.11× 3.05 46.7 28.5 (CLIP)
Lumina-mGPT-7B (MS-COCO) Vanilla 1.00× 30.1 33.0 (CLIP)
Lumina-mGPT-7B EAGLE-3 1.86× 2.77 30.2 32.1 (CLIP)
Lumina-mGPT-7B LANTERN 2.56× 3.63 33.9 32.7 (CLIP)
Lumina-mGPT-7B SJD 2.05× 2.23 31.1 31.3 (CLIP)
Lumina-mGPT-7B GSD (G=25) 3.77× 3.53 33.1 31.2 (CLIP)
Lumina-mGPT-7B ZipAR-16 2.31× 3.12 32.6 31.2 (CLIP)
Lumina-mGPT-7B AR-Sample 2.35× 2.61 30.9 26.1 (CLIP)
Lumina-mGPT-7B LISA (本文) 4.12× 4.79 31.0 31.5 (CLIP)
LlamaGen-XL-C2I (ImageNet) Vanilla 1.00× 1.00 9.78 152.3 (IS)
LlamaGen-XL-C2I EAGLE-3 0.70× 1.00 9.88 144.2 (IS)
LlamaGen-XL-C2I LANTERN 1.04× 1.50 10.72 149.5 (IS)
LlamaGen-XL-C2I LISA (κ=1.0, λ=0.6) 1.39× 2.02 10.50 148.6 (IS)
LlamaGen-XL-C2I LISA (κ=1.1, λ=0.4) 1.53× 2.69 12.60 142.1 (IS)

消融实验

消融实验对比了在不同草稿模型架构及推理验证配置下的接受长度与加速表现。

评估配置 模型及草稿骨干 验证机制配置 接受长度 (Acc. Len.)↑ 端到端加速比↑ 说明
训练对齐与GASV消融 LlamaGen-XL-T2I (EAGLE-3) w/o GASV (严格匹配) 1.00 ~1.00× 基础 EAGLE-3 对齐基线
训练对齐与GASV消融 LlamaGen-XL-T2I (本文草稿) w/o GASV (严格匹配) 1.24 - 仅加入局部感知蒸馏已优于基线
训练对齐与GASV消融 LlamaGen-XL-T2I (本文草稿) GASV (κ=1.0, λ=0.4) 2.92 ~2.05× 结合局部蒸馏与动态软验证
架构泛化消融 LlamaGen-XL-T2I (Medusa-style) 原始 Medusa 验证 1.19 1.04× 传统非树状头多头草稿基线
架构泛化消融 LlamaGen-XL-T2I (LISA-Medusa) w/o GASV (严格匹配) 1.53 1.37× 局部蒸馏迁移至 Medusa 架构
架构泛化消融 LlamaGen-XL-T2I (LISA-Medusa) w/ GASV (完整方案) 2.25 1.82× 泛化至 Medusa 时加速增益显著

关键发现

  • 训练对齐是突破视觉投机解码天花板的前提:即使不使用推理侧软验证(w/o GASV),仅使用局部感知蒸馏训练的草稿模型接受长度就从 1.00 提升至 1.24(T2I),证明减小高熵邻域的对齐误差能从源头上缓解视觉分布平坦带来的拒绝问题。
  • 软验证参数具备精准的可控权衡空间:随几何漂移阈值 \(\kappa\) 增大(从 0.6 增至 1.0),接受长度由 2.16 单调增加到 2.92;而聚类后验阈值 \(\lambda\) 增大则使接受判据更严格。用户可根据下游对保真度或极速推理的不同需求灵活切换。
  • 跨草稿骨干泛化性极佳:不仅适配以 EAGLE 为代表的自回归树状草稿模型,LISA 的蒸馏策略与软验证直接迁移到 Medusa 架构上时,加速比从 1.04× 提升至 1.82×,FID 反而由 46.9 优化至 46.2。

亮点与洞察

  • 抓住视觉模态本质差异,破除语言投机解码直接照搬的思维定势:系统剖析了视觉 Token 平坦多峰与空间熵非均质性,指出直接应用 LLM 的严格采样验证必然遭遇接受率崩溃。
  • 巧妙利用 VQ 连续几何空间先验弥补离散 Token 的孤立性:未直接在无序的离散索引空间做生硬匹配,而是映射回归一化码本嵌入空间构建动态几何邻域与白化漂移度量,实现语义平滑容错。
  • 训练端与推理端全链路协同:既在训练端通过不确定性门控引导草稿模型聚焦难点区域,又在推理端配合自适应动态阈值软化判决,兼顾保真度与加速比。

局限与展望

  • 依赖离散码本几何映射:目前方法依赖于 VQ-VAE/VQ-GAN 显式离散码本的连续嵌入空间,对于不依赖矢量量化的连续自回归视觉生成器(如扩散式自回归模型)的直接迁移机制仍待拓展。
  • 离线校准计算开销:白化统计量、聚类划分和几何预算需对目标模型进行一次离线统计前向计算,当模型频繁热更新时需要重复校准流程。
  • 未来方向:作者指出可进一步推广至视频自回归生成(更高时间冗余度)以及视觉-语言多模态大模型(MLLM)的交错图文生成加速。

相关工作与启发

  • vs EAGLE-2 / EAGLE-3: EAGLE 系列在 LLM 领域表现优异,但在视觉模型采样模式下因 Token 分布平坦导致接受率塌缩(C2I 加速比仅 0.70×,反而慢于直接推理);LISA 引入局部几何对齐与软验证,将加速比提升至 1.53× - 4.12×。
  • vs LANTERN: LANTERN 同样认识到视觉多模态特性并尝试放宽验证规则,但仅在推理端做松弛,未触及训练端草稿模型与目标模型的内在失配;LISA 通过训练端局部感知蒸馏与推理端几何软验证协同,在相同质量下接受长度显著更高(3.05 vs 2.40)。
  • vs SJD / ZipAR / GSD: 该类方法侧重于 Jacobi 迭代或分组并行解码,需修改目标模型执行结构或承受较高算力开销;LISA 维持轻量级草稿-目标标准范式,保持极高的即插即用部署灵活性。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 深入揭示了视觉 Token 平坦分布对投机解码的负面影响,创新性地引入离散码本局部几何结构指导蒸馏与软验证。
  • 实验充分度: ⭐⭐⭐⭐⭐ 覆盖 T2I 与 C2I 主流开源自回归标杆(LlamaGen、Lumina-mGPT),提供了详尽的参数敏感性分析、消融实验与草稿架构泛化实验。
  • 写作质量: ⭐⭐⭐⭐⭐ 动机分析深入透彻,数学推导清晰规范,配图信息量丰富且层层递进。
  • 价值: ⭐⭐⭐⭐⭐ 为视觉自回归大模型在工业端落地部署提供了切实可行的加速方案,对多模态高效推理具有极高借鉴意义。