跳转至

Accurate Zero-shot Quantization via Hierarchical Teacher-Assistant Distillation

会议: ECCV 2026
Paper: https://eccv.ecva.net/virtual/2026/poster/4699
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/7082.pdf
代码: https://github.com/snudm-starlab/ZEST
领域: 模型压缩
关键词: 零样本量化、教师助理、知识蒸馏、批归一化统计、逐块重建

一句话总结

Zest 在不访问原始训练图像的条件下,以中间位宽教师助理、量化感知图像重校准和逐块重建连接全精度 CNN 与低位宽学生,在 ImageNet-1K 上取得 ResNet-18 W4A4 的 70.50% Top-1 准确率,距文中全精度基线仅 0.51 个百分点。

研究背景与动机

零样本量化面对的不是“没有预训练模型”,而是“拿到了模型,却拿不到训练数据”。 部署方可以读取全精度网络的权重和批归一化(BatchNorm,BN)统计,但不能使用原始训练图像重新校准低位宽网络。 已有方法因而通过优化噪声图像或训练生成器,寻找能够复现教师内部统计的合成数据,再用这些数据完成量化与知识蒸馏。 这种路径解决了数据来源问题,却不保证合成图像适合只有 3 或 4 位表示能力的学生。

当权重和激活被大幅压缩时,取整与裁剪会改变特征分布,教师能够表达的细微变化可能已经落在学生无法区分的数值区间里。 如果合成图像只针对全精度教师优化,学生既要适应这些图像,又要追赶数值行为相距很远的监督目标。 论文把这种困难描述为精度鸿沟、优化波动以及深层激活方差衰减;其主张不是单纯生成更像真实照片的图像,而是让监督者和校准输入都更接近量化域。

Zest 沿用教师助理思想,但不通过减少网络深度来构造助理,而是在相同网络结构下改变位宽。 先让一个中间精度网络吸收全精度教师的信息,再用它微调已有合成图像并监督最终学生,形成两段较短的数值迁移。 核心 idea:把“全精度教师直接教低位宽学生”改成“中间位宽教师助理同时校准数据与监督重建”,降低无真实数据条件下的数值失配。

方法详解

整体框架

输入是一个带有预存 BN 统计的全精度 CNN 和目标位宽;输出是保持网络结构的低位宽学生。 训练先构建教师助理桥,再进行量化感知图像重校准,最后利用教师助理完成学生的逐块重建。 图中的顺序对应学生生成流程;逐块重建这一机制也用于前面的教师助理训练,并不是只在最后使用一次。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["全精度 CNN<br/>权重与 BN 统计"] --> B["教师助理桥<br/>合成图像与中间位宽"]
    B --> C["量化感知图像重校准<br/>调整已有图像像素"]
    C --> D["逐块重建<br/>教师助理监督学生"]
    A -->|直接量化初始化学生| D
    D --> E["低位宽 CNN<br/>独立推理"]

这里的“层级”是监督关系的层级,而不是让学生继承教师助理的量化权重。 算法 1 明确规定,最终学生由原始全精度模型按目标位宽初始化,再在重校准图像上学习教师助理的块输出。 因此,模型初始化来源和训练监督来源必须分开理解。 训练结束后部署学生即可,不需要让三套网络串联处理每个测试输入。

关键设计

1. 教师助理桥:把过大的精度跨度拆成两段

教师助理与教师、学生保留相同层数及对应网络块,区别主要在数值精度。 默认设置是全精度教师、中间 W8A8 教师助理和 W4A4 或 W3A3 学生,其中 W/A 分别表示权重与激活位宽。 助理不是随意选一个较小模型,而是要同时保留教师的识别能力并提前体现整数表示的有限动态范围。 全精度监督目标过远时,学生可能持续追赶无法表示的特征细节;助理提供的目标则更接近学生可达到的数值状态。

构建助理之前,先训练一个以随机噪声和均匀采样类别标签为条件的生成器。 训练信号来自全精度教师:让合成图像在各 BN 层诱发的均值、方差接近教师预存统计。 生成器训练完后冻结,产生基础合成图像,再将原始教师量化到中间位宽,并用这些图像逐块拟合教师输出。 类别条件在这里帮助组织生成输入,不能据此擅自添加论文方法节未明确给出的额外分类损失。

助理的作用也不等于“越精确越好”。 表 3 中,ResNet-18 W4A4 学生在 W16A16 助理下为 69.15%,W8A8 助理下为 70.50%,W6A6 助理下为 70.34%,W4A4 助理下为 69.19%。 这些结果支持在所测设置里存在更合适的中间精度,但不能推出所有架构、量化器和目标位宽都应固定选择 8 位。 作者还称单个助理优于多个助理,具体比较在单独补充材料中;当前缓存不含该材料,因而不复述其未核验数据。

2. 量化感知图像重校准:保留语义起点,只修正数值失配

基础合成图像是针对全精度网络产生的,即使已经包含有用的类别结构,其内部响应也未必符合量化模型的裁剪边界和均值偏移。 Zest 不从中间位宽模型重新生成一批图像,而是把基础图像复制为待优化变量,以教师助理的 BN 统计为新的匹配目标,直接对像素做梯度更新。 变化的是图像本身,不是再次训练已冻结的生成器;教师助理在这一步提供量化域的统计约束。

这种“先初始化、再重校准”的安排把语义合成和数值适配分开。 全精度教师提供信息较丰富的起点,助理只负责让已有图像适应整数表示后的内部响应。 论文要求重校准迭代少于初始生成器训练迭代,实验采用 500 次对 4,000 次,意图是避免为了匹配量化统计而破坏原先的语义结构。 这个设计的重点不是证明图像视觉质量更高,而是让它们成为更适合低位宽重建的校准输入。

校准对象仍然是中间位宽助理,而不是最终学生的精确分布。 因此,这是一种利用近邻模型进行数值对齐的方案,并不保证覆盖所有 3 位学生特有的异常响应。 论文通过移除重校准后的准确率下降支持其有效性,但没有在主文中给出每种数值偏差被单独修正多少的分解测量。

3. 逐块重建:在误差传播到深层之前对齐中间激活

若只用最终分类输出约束整个量化网络,多层误差可能相互掩盖,浅层的小偏差也可能一路累积成深层表示退化。 Zest 按网络块从前向后优化,每个块匹配监督网络对应块的输出激活。 第一阶段以全精度教师监督中间位宽助理,使用基础合成图像;第二阶段以助理监督最终学生,使用重校准图像。 相同结构使这些块可以直接建立对应关系,不需要跨架构的特征维度适配模块。

这里的核心训练对象是中间激活重建,而不能把预备知识里介绍的最终输出 KL 蒸馏误当成完整方法的唯一目标。 表 4 的 Zest-B 正是把逐块重建换成监督者与学习者最终 logits 上的端到端重建,用于检验这一粒度选择。 默认逐块方案在 ResNet-18 W4A4 上达到 70.50%,对应端到端变体为 69.99%,差 0.51 个百分点。 这支持局部重建有益,但准确率消融本身还不足以独立证明所有深层激活塌缩都被消除。

损失函数 / 训练策略

论文的训练目标分成两类:图像合成与重校准匹配 BN 均值、方差,网络微调则匹配对应块的输出激活。 当前本地全文中的式 (1)、(3)–(6) 存在运算符、范数或上下标抽取缺损,因此这里保留可由正文确认的机制,不补写无法核验的完整损失公式。 这不影响确认训练顺序,但精确范数形式、系数与实现细节仍需查验原始公式或作者代码。

实现使用 W8A8 标准 min-max 量化构建教师助理,学生使用可学习步长量化(LSQ)。 第 4.1 节报告 1,024 张合成图像、4,000 次生成器训练、500 次图像重校准,以及每块 20,000 次重建迭代,批大小为 32。 因此,“零样本”只表示不访问真实训练数据,并不意味着无需优化或校准开销很小。 论文保持第一层为 8 位,第 4.2 节进一步明确首层权重例外;W4A4/W3A3 标签不应理解为所有层无例外地采用同一位宽。

实验关键数据

主实验

以下选取原文表 1、表 2 的 ImageNet-1K 验证集 Top-1 准确率,单位为 %,越高越好;验证集包含 50,000 张图像。 所有列均为论文报告值,不代表在相同计算预算下重新复现了各方法。 W/A 表示目标权重/激活位宽,需结合上述首层 8 位例外阅读。

架构 W/A Genie GenQ Zest 相比两列基线中较高值的提升
ResNet-18 4/4 69.66 69.77 70.50 +0.73 个百分点
ResNet-50 4/4 75.59 75.50 76.32 +0.73 个百分点
MobileNetV2 4/4 68.38 68.96 70.71 +1.75 个百分点
ResNet-18 3/3 66.16 68.18 68.45 +0.27 个百分点
ResNet-50 3/3 71.61 73.99 75.28 +1.29 个百分点
MobileNetV2 3/3 57.54 59.15 67.74 +8.59 个百分点

表 1 的全精度 ResNet-18 为 71.01%,所以 70.50% 对应下降 0.51 个百分点,不是下降 0.51%。 该表还包含其他方法,例如 MobileNetV2 W4A4 的 IntraQ 为 69.10%;因此最后一列只比较本表选取的 Genie 和 GenQ,不能统称“相对所有既有方法的提升”。

消融实验

原文表 4:ImageNet-1K 验证集、ResNet-18、W4A4,Top-1 越高越好。 差值均由该表的完整方法准确率直接相减,不跨架构比较。

配置 Top-1 (%) 相对完整方法下降 被替换或移除的内容
完整 Zest 70.50 0.00 个百分点 教师助理、图像重校准、逐块重建
Zest-T 70.23 0.27 个百分点 移除教师助理桥
Zest-R 69.94 0.56 个百分点 使用基础图像,不进行重校准
Zest-B 69.99 0.51 个百分点 改为最终 logits 的端到端重建

关键发现

  • 图像重校准的单项移除影响最大,为 0.56 个百分点;仅有助理结构并不能替代校准输入的数值适配。
  • 在所选主结果中,MobileNetV2 W3A3 的收益明显高于 ResNet-18 W3A3,说明不同架构对低位宽误差的敏感性差异很大。
  • 第 4.4 节另报告五次独立训练的 ResNet-18 W4A4 结果为 70.42% ± 0.08%;它与主表 70.50% 是不同统计口径,不能将主表值标成五次均值。
  • 表 3 的助理位宽结果不是单调关系;它支持中间整数精度有效,但不是对任意助理规模的普遍最优性证明。

亮点与洞察

  • 教师助理不仅改变监督者,也参与改造训练输入。这样把“谁来教”和“用什么数据教”连接起来,比单纯替换教师更完整。
  • 精度差本身可以成为知识蒸馏的容量差。保持结构不变,便于直接比较对应块的响应,也减少跨架构适配的额外变量。
  • 重用已有合成图像避免从低精度网络重新开始合成。其可借鉴之处在于先保留语义基础,再做针对部署数值约束的小步适配。

局限与展望

  • 作者明确的扩展方向:结论提出研究 ViT 和大语言模型上的适用性;当前证据来自带 BN 的 CNN,不能直接外推到其他归一化结构。
  • 读者观察:两轮模型重建和逐块 20,000 次迭代意味着额外离线成本,主文未给出端到端耗时、峰值显存或实际设备推理加速对照。
  • 证据边界:多个教师助理的详细比较位于单独补充材料,当前 17 页缓存仅含主文与参考文献,没有该项可核验的数表。
  • 指标解释问题:第 4.4 节把平滑度指标定义为梯度方差的倒数,却用“百分点”报告增幅,未在可读正文交代归一化口径;不宜据此给出精确的跨实验平滑度收益结论。
  • 机制证据强度:优化曲线和准确率支持稳定性改善,但正文未提供完整的逐层激活方差统计;“防止激活塌缩”应视为作者的机制解释,而非已全面验证的保证。

相关工作与启发

  • 与 ZeroQ、GDFQ 相比:共同利用模型内保存的知识合成校准数据;Zest 的重点是加入中间数值域,并对已经生成的图像二次校准,而不是仅依赖全精度教师统计。
  • 与教师助理知识蒸馏相比:传统助理用于缓解深度或宽度造成的结构容量差;本文将过渡轴改为位宽,同构网络因而可以直接进行块级监督。
  • 与 Genie、GenQ 相比:选取它们作为较强的合成数据量化参照时,Zest 的优势在不同架构上并不均匀;不能把 MobileNetV2 三位结果的较大增益概括为所有设置的同等提升。

评分

  • 新颖性:3/5。将成熟的教师助理思想延伸到精度层级,结合图像重校准形成清楚但偏组合式的创新。
  • 实验充分度:4/5。覆盖三种 CNN、两档位宽和组件消融,也报告重复训练结果,但缺少成本及跨模型族验证。
  • 写作质量:3/5。算法顺序明确,不过部分指标口径不够清楚,本地公式抽取损坏也限制了精确复核。
  • 价值:4/5。为没有原始数据的低位宽 CNN 量化提供了实用路径,适用前提和离线优化代价仍需考虑。