跳转至

EVAR: Edge Visual Autoregressive Models via Principled Pruning

会议: ECCV 2026
论文: ECCV 原文
项目: https://aden9460.github.io/EVAR
代码: https://aden9460.github.io/EVAR
领域: 图像生成
关键词: 视觉自回归模型、结构化剪枝、二阶优化、边缘端部署、知识蒸馏

一句话总结

针对视觉自回归模型(VAR)在端侧单图生成时延迟高及跨尺度误差级联的瓶颈,提出结合金字塔感知二阶优化与渐进式尺度蒸馏的结构化剪枝框架 EVAR,将 VAR-d16 剪枝 40% 至 230M 参数,在保持 3.91 FID 的同时将 iOS 端单图生成延迟压缩至 277 ms(加速 1.8×)。

研究背景与动机

下一尺度视觉自回归模型(Next-scale VAR)打破了传统图像自回归生成逐 token 扫描的时序瓶颈,采用由粗到细的分层金字塔并行预测每个尺度的全部 token,在多尺度图像合成和高分辨率生成上展现出比肩扩散模型的保真度与可扩展性。然而,现有的 VAR 加速方案大多侧重于服务器端的大 batch 并行吞吐,面向资源受限边缘设备(如平板、手机)的单图极速推理仍面临巨大的计算与显存开销。以高端移动端为例,稠密 VAR 模型在严苛的系统内存约束下甚至频繁发生 OOM(内存溢出)崩溃,亟需行之有效的硬件对齐结构化剪枝技术。

直接将现存大语言模型常用的二阶结构化剪枝(如基于 OBS 最优脑部外科医生体系的方法)迁移到 VAR 上存在严重的架构失配。VAR 的多尺度生成机制天然存在两大脆弱性:一是尺度间 token 数量的极度不均衡,粗尺度(如 \(1\times 1\)\(2\times 2\))虽然决定了画面的全局轮廓布局与核心语义,但其 token 数量仅占整张序列的微小比例;而细尺度(如 \(16\times 16\))占据了绝大部分序列长度。直接拼接展开全部 token 统计 Hessian 矩阵,会导致海量的局部细尺度激活严重掩盖粗尺度,破坏敏感方向的显著性度量。二是误差级联效应,自回归管道具有误差逐级放大的特性,粗尺度的微小剪枝损伤会随自回归生成逐层放大,造成不可逆的结构崩塌。此外,在微调恢复阶段,细尺度 token 依然会在梯度贡献中占据绝对主导,导致决定全局语义的粗尺度处于欠监督状态。

为了在保护粗尺度全局架构的同时实现稳定的权重闭式补偿,本文的切入点是对多尺度统计量进行归一化重加权,并协调由粗到细的监督梯度分配。核心 idea:提出首个专为下一尺度视觉自回归模型定制的结构化剪枝框架 EVAR,通过尺度归一化与衰减加权的「金字塔感知 OBS」消除 Hessian 估计中的细尺度主导并保护粗尺度语义,辅以「渐进式尺度感知蒸馏(PSAD)」平衡反向传播梯度贡献,实现端侧低延迟高保真图像生成。

方法详解

整体框架

EVAR 的整体流水线涵盖多尺度流式校准、金字塔感知 OBS 结构化剪枝、渐进式尺度感知蒸馏(PSAD)以及 Core ML 硬件对齐部署四个阶段。首先,利用预训练 VQ-VAE 编码器将无偏差真实图像编码为金字塔残差 token 序列,在流式前向中收集各层激活并执行尺度归一化 Gram 矩阵累积。随后,基于二阶误差敏感度对 Multi-Head Attention 的投影头维度与 FFN 中间通道执行结构化裁剪,并应用闭式权重补偿。最后,通过动态软门控与反比尺度权重的蒸馏目标恢复紧凑模型的生成质量,并导出为适配移动端 GPU 的推理图。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["真实校准图像<br/>预编码残差金字塔"] --> B["流式校准与金字塔感知 Hessian 累加<br/>尺度归一化与衰减加权"]
    B --> C["金字塔感知 OBS 结构化剪枝<br/>注意力头与 FFN 通道联合裁剪并闭式补偿"]
    C --> D["渐进式尺度感知蒸馏 PSAD<br/>由粗到细软门控平滑与梯度平衡微调"]
    D --> E["Core ML 边缘端运行时<br/>绑定 CPU+GPU 计算单元消除 NPU 调度回退"]

关键设计

1. 金字塔感知二阶剪枝(Pyramid-Aware OBS):重构尺度平衡的 Hessian 估计

针对传统 OBS 直接平铺拼接 token 导致后期高分辨率 token 淹没粗尺度二阶统计量、进而诱发误差级联的问题,本设计对 Hessian 统计量引入尺度维度的归一化与自适应衰减加权。若简单将各尺度独立切分求逆,因粗尺度 token 数量(如 \(1\times 1=1\))远小于隐藏特征维度 \(D\),会导致样本协方差矩阵严重亏秩(Rank-deficient)而无法求逆。为此,EVAR 在统一空间内构建加权 Gram 矩阵,并加入阻尼项 \(\lambda I\) 确保矩阵严格正定可逆:

\[H_{\mathrm{pa}} = \sum_{i=1}^{K}\frac{w_i}{n_i}\left(X^{(i)}\right)^{\top}X^{(i)} + \lambda I\]

其中 \(X^{(i)} \in \mathbb{R}^{n_i \times D}\) 表示尺度 \(i\)\(n_i\) 个 token 的输入激活矩阵,归一化因子 \(1/n_i\) 消除了各尺度因 token 数量差异引起的统计量偏置,衰减权重 \(w_i\) 则赋予早期粗尺度更高的相对优先级。基于 \(H_{\mathrm{pa}}^{-1}\) 计算的列级与单元级显著性得分,能够精准保护承载全局图像架构的粗尺度特征方向。

2. 结构化单元迭代剪枝与闭式权重补偿:对齐移动端 GEMM 计算

为了将理论参数稀疏度转化为实际物理加速,EVAR 将 Transformer 模块中的权重划分为可物理移除的结构化单元,涵盖 Multi-Head Attention 输出投影矩阵的注意力头维度,以及 FFN 下投影矩阵的中间通道维度。通过累加单元内各列对应的 OBS 误差度量确定单元显著性分数:

\[\mathrm{score}(u) = \sum_{p \in u} \frac{\|W_{:,p}^{(S)}\|^2}{\left(H_{\mathrm{pa}}^{-1}\right)_{p,p}}\]

选定评分最小的不重要单元进行物理剔除后,利用 OBS 闭式扰动公式对剩余未剪枝参数进行一阶与二阶关联补偿:

\[\Delta^{(S)} = \sum_{p \in u} \frac{W_{:,p}^{(S)}}{\left(H_{\mathrm{pa}}^{-1}\right)_{p,p}} \left(H_{\mathrm{pa}}^{-1}\right)_{p,:}\]

针对维度较大的 FFN 层,EVAR 采用动态分组剪枝机制,初期以较大步长剪除低分通道组,后期平滑缩减组大小,在维持极低计算复杂度的同时保证补偿后重构误差最小。

3. 渐进式尺度感知蒸馏(PSAD):解除微调梯度的分辨率霸凌

剪枝后的紧凑模型表征容量受限,若直接采用常规均等 token 权重的知识蒸馏,由于最终尺度的高分辨率 token 在损失中占比过高,梯度反传会过度偏向细部纹理拟合而忽视全局构图。PSAD 提出了由粗到细的连续软门控函数 \(\tilde{\gamma}_i(t)\) 与尺度加权系数 \(w_i\)

\[\tilde{\gamma}_i(t) = \min\left(1, \max\left(0, \frac{t - t_i}{\Delta_i}\right)\right), \qquad w_i = \frac{C}{n_i}\]

其中 \(t_i\)\(\Delta_i\) 分别控制第 \(i\) 尺度的激活步数与过渡平滑区间,避免离散解锁引起的优化目标突变;加权系数 \(w_i = C / n_i\) 恰好抵消损失函数在各尺度累加时带来的 token 数量因子 \(n_i\),使得各尺度的有效反传梯度模长 \(g_i(t) \propto \tilde{\gamma}_i(t) w_i n_i \bar{g}_i \approx \tilde{\gamma}_i(t) C \bar{g}_i\) 达到跨尺度均衡,确保了容量缩减后的模型能够优先且扎实地重构出清晰稳定的图像宏观骨架。

损失函数 / 训练策略

EVAR 的剪枝后恢复训练采用联合目标: $\(\mathcal{L}_{\mathrm{total}}(t) = \mathcal{L}_{\mathrm{task}}(t) + \mathcal{L}_{\mathrm{PSAD}}(t)\)$ 其中 \(\mathcal{L}_{\mathrm{task}}(t)\) 为带门控掩码的自回归交叉熵任务损失,\(\mathcal{L}_{\mathrm{PSAD}}(t)\) 为引入软门控与反比尺度权重的教师-学生模型软输出 KL 散度: $\(\mathcal{L}_{\mathrm{PSAD}}(t) = \tau^2 \sum_{i=1}^{K}\tilde{\gamma}_i(t)\,w_i\,\mathcal{L}_{\mathrm{KL}}^{(i)}\)$ 在单台配备 8 张 NVIDIA RTX 5090 的节点上,采用 AdamW 优化器微调 40 个 epoch,VAR-d16 的剪枝模型每个 epoch 仅耗时约 1 小时。

实验关键数据

主实验

在 Class-Conditional ImageNet \(256 \times 256\) 基准上,EVAR 与代表性自回归模型及剪枝变体的生成质量对比如下:

模型分类 模型 参数量 剪枝比例 推理步数 FID ↓ IS ↑ Precision ↑ Recall ↑
VAR 基线 VAR-d16 310M 10 3.55 274.4 0.84 0.51
VAR 基线 VAR-d20 600M 10 2.95 302.6 0.83 0.56
VAR 基线 VAR-d24 1.0B 10 2.33 312.9 0.82 0.59
顺序 AR LlamaGen-L 343M 576 3.07 256.1 0.83 0.52
顺序 AR AiM-L 350M 256 2.83 244.6 0.82 0.55
协作/线性 CoDe (N=8) 2.3B 10 2.26 300.4 0.81 0.58
协作/线性 FastVAR (d24) 1.0B 10 2.64 284.4 0.80 0.58
EVAR (本文) VAR-d16 (20% 稀疏) 270M 20% 10 3.67 267.5 0.81 0.51
EVAR (本文) VAR-d16 (40% 稀疏) 230M 40% 10 3.91 259.1 0.81 0.51
EVAR (本文) VAR-d24 (20% 稀疏) 875M 20% 10 2.47 310.2 0.82 0.57
EVAR (本文) VAR-d24 (40% 稀疏) 748M 40% 10 2.52 304.4 0.82 0.57

不同剪枝方法在 VAR-d16 上的横向对比测试(Tab. 2):

剪枝算法 40% 稀疏 (免微调) FID ↓ 40% 稀疏 (免微调) IS ↑ 20% 稀疏 (免微调) FID ↓ 20% 稀疏 (免微调) IS ↑ 40% 稀疏 (1-epoch 微调) FID ↓ 40% 稀疏 (1-epoch 微调) IS ↑
SlimGPT 138.91 6.39 56.87 19.35 10.62 44.91
Magnitude 180.82 3.90 152.29 5.77 12.69 25.84
LLM-pruner 153.82 5.62 35.21 28.95 10.82 41.35
OBA 142.82 6.35 30.54 29.48 9.85 44.35
Taylor 145.66 6.78 27.30 31.48 8.35 46.87
EVAR (本文) 58.21 21.12 7.85 49.21 4.86 55.61

消融实验

校准累加策略对 VAR-d16 在 40% 稀疏度下的影响消融(Tab. 3):

校准 / 累加配置 参数量 FID ↓ 说明
稠密模型 (Dense Baseline) 310M 3.55 未剪枝基线
仅取第 1 尺度 (First scale) 230M 124.21 仅依赖粗尺度统计,特征空间严重欠拟合
仅取第 5 尺度 (Fifth scale) 230M 102.54 单一中间尺度无法覆盖全局层级
仅取最终尺度 (Last scale) 230M 86.51 仅依赖最大细尺度,粗尺度结构完全失真
直接平铺拼接 (Direct Concat) 230M 69.21 细尺度 token 数量霸榜,受统计量偏差冲击
金字塔感知累加 (Ours) 230M 58.21 尺度归一化与衰减加权,显著优于各变体

蒸馏策略与尺度加权策略消融(40% 稀疏度,参数量 230M,Tab. 4):

微调与蒸馏变体 参数量 FID ↓ 说明
剪枝后免微调 (Pruned Training-free) 230M 58.21 初始剪枝状态
仅普通微调 (+ FT) 230M 4.25 无教师引导,仅任务损失微调
朴素知识蒸馏 (+ Vanilla KD) 230M 4.26 未平衡跨尺度 token 梯度
指数增大权重 (+ Exponential Increase) 230M 5.82 强化细尺度权重,加剧全局结构退化
线性增大权重 (+ Linear Increase) 230M 5.45 后期尺度偏置仍削弱粗尺度监督
指数衰减权重 (+ Exponential Decay) 230M 4.36 过度抑制细尺度梯度,纹理细节欠拟合
渐进式尺度感知蒸馏 (+ PSAD Ours) 230M 3.91 软门控课程联合反比加权,最优恢复

移动端 iPad Pro (M4) 上的 Core ML 算子单元调度与延迟拆解(Tab. 5):

计算单元配置 (Compute Units) 测得延迟 (ms) CPU 算子数 GPU 算子数 NPU 算子数 调度特征分析
CPU + NPU 1090 ± 2 274 0 8554 274 个不支持算子引发频繁跨芯片数据搬移与回退,延迟严重恶化
All (CPU + GPU + NPU) 494 ± 2 129 3103 5596 三硬件单元频繁并发调度与内存上下文切换,开销居高不下
CPU + GPU 277 ± 2 10 8818 0 极简双单元管道避免 NPU 调度瓶颈,达到最快单图生成速度(1.8× 提速)

关键发现

  • 粗尺度二阶保真的决定性作用:在 20% 稀疏免微调状态下,EVAR 的 FID 达到 7.85,而 SlimGPT 与 Magnitude 分别高达 56.87 与 152.29。这证明在自回归体系中,防止粗尺度初始误差级联比单纯的大规模参数补偿重要得多。
  • 逆 token 数量加权的必要性:Tab. 4 证明任何赋予细尺度更多权重的尝试(Linear/Exponential Increase)都会造成性能崩塌(FID 升至 5.45~5.82);而 PSAD 采用严格的 \(w_i = C/n_i\) 消除梯度偏差,是把 FID 压进 3.91 的核心杠杆。
  • 边缘算力约束下的非对称收益:在高端桌面卡 RTX 5090 上,Batch Size=1 时稠密模型与剪枝模型的延迟几乎没有差异(受限于访存与 Launch Overhead);但转移到计算密集型的移动端(iPad Pro / iPhone)时,参数与宽度的缩减能直接转化为 1.8× 的端到端真实物理加速,并使原本在 iPhone 16 Pro Max 上 OOM 的稠密 VAR 具备了流畅运行的可行性。

亮点与洞察

  • 金字塔感知 Hessian 统计构建:巧妙通过 token 数量归一化与尺度衰减权重化解了尺度间样本容量极端不均的矛盾,既避免了单尺度拆解导致的严重亏秩,又扭转了二阶优化被海量局部像素霸榜的偏置。
  • 由粗到细的平滑软门控蒸馏:通过平滑连续过渡函数设计课程学习,使有限容量的剪枝网络在恢复阶段先稳健重建宏观拓扑、再逐步接纳高频细节,极大缓解了容量收缩引起的优化冲突。
  • 移动端 Core ML 运行时的实测避坑发现:揭示了现代边缘设备上「并非启用 NPU 就一定更快」的真实系统瓶颈——由于 VAR 复杂的自定义位置编码和动态采样算子缺乏 NPU 原生支持,强制使用 NPU 导致了高达 274 次 CPU-NPU 数据往返同步(耗时 1090ms),最终锁定 CPU+GPU 获得了 277ms 的极限低延迟。

局限与展望

  • 类别条件生成向开放域文生图扩展:目前实验主要验证于 ImageNet \(256 \times 256\) 类条件任务,面对更长序列的文生图多模态 cross-attention 结构,跨模态条件 token 与金字塔尺度之间的联合剪枝策略仍待探索。
  • 更高分辨率与可变步长架构适配:随着下一代视觉自回归模型向 \(512 \times 512\) 及任意宽高比扩展,金字塔层数增多使得极深层的误差级联更难控制,或需要动态自适应门控机制。
  • 与低比特量化(INT4/FP8)的联合压缩:EVAR 目前主要聚焦结构化通道/头修剪,未来若与低比特 PTQ 结合,可进一步降低移动端内存带宽占用。

相关工作与启发

  • vs SlimGPT / LLM-pruner: 后者基于单向展平的语言序列进行二阶 OBS 剪枝,缺乏对 VAR 尺度分层与误差级联的先验感知;EVAR 引入金字塔尺度归一化与衰减加权,在免微调和微调场景下全面大幅胜出。
  • vs CoDe / FastVAR: CoDe 采用两阶段协作解码(大模型猜轮廓、小模型补细节),FastVAR 依赖 KV 缓存修剪,它们均未改变模型本身的固有物理参数体量;EVAR 是正交的结构化模型压缩方案,可与并行/协作解码策略叠加使用。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 首次针对下一尺度视觉自回归模型揭示多尺度二阶估计失配与误差级联,定制了切实有效的金字塔剪枝与梯度平衡方案。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖不同稀疏度、免微调/微调横向对比、多模块详尽消融,以及极具工程价值的 iOS 真机端到端算子级分析。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑缜密,动机由浅入深,数学机制与工程系统部署的结合极其自然。
  • 价值: ⭐⭐⭐⭐⭐ 打通了高保真下一代自回归生成模型走向手机与平板端实时可用的最后一公里。