HQ-DM: Single Hadamard Transformation-Based Quantization-Aware Training for Low-Bit Diffusion Models¶
会议: ECCV 2026
论文: ECCV 2026 Poster
领域: 模型压缩
关键词: 扩散模型, 模型量化, 量化感知训练, 单哈达玛变换, 激活离群值
一句话总结¶
针对低比特扩散模型中激活离群值加剧量化误差且难以部署的问题,HQ-DM 提出仅对激活矩阵执行单哈达玛变换,在平滑激活尖峰的同时避免双重哈达玛变换对权重的离群值放大,完美兼容整型卷积与线性算子,在 W4A3 下将 LDM-4 的 Inception Score 提升超 467%。
研究背景与动机¶
扩散模型凭借迭代去噪采样机制在图像合成与多模态生成任务中确立了主流地位,然而其多步递归去噪过程带来了极高的显存占用与计算时延,严重制约了在边缘设备和实时交互场景下的部署。模型量化技术通过将浮点数映射到低比特整数(如 INT4/INT3),是压缩存储并利用整型硬件单元加速推理的关键途径。然而,扩散模型的去噪网络内部存在强烈的跨时间步非平稳性,特征尺度在不同去噪阶段剧烈跳变;同时其激活张量呈现显著的长尾分布与极端离群值(Outliers),导致低比特线性截断与舍入时产生巨大的量化噪声,并在多步迭代中持续累积与级联放大,致使模型生成质量发生崩塌。
在现存技术方案中,后训练量化(PTQ)尽管部署成本低,但在 4 比特及以下极低位宽时完全失效;近期引入 LoRA 蒸馏与时间步可学习步长(LSQ)的量化感知训练(QAT)虽改善了训练稳定性,却因缺乏对激活离群值的显式消除机制而在 W4A3 等极端设置下陷入严重退化。另一方面,大语言模型领域常采用的正交哈达玛变换能够通过旋转特征空间来打散离群值,但现有的双重哈达玛变换(Double Hadamard Transformation)需同时对激活与权重实施变换。这一方案不仅天然无法兼容带有空间局部滑动窗口与多步长(Strides)的卷积算子,更致命的是,权重矩阵原本平缓的数值分布经变换后反而被诱导出剧烈的权重离群值,反向恶化了权重截断误差。
本文的核心切入点在于:彻底解耦激活平滑与权重变换,仅对输入激活矩阵施加正交旋转,并将变换正规化因子吸收至浮点缩放系数中,从而以纯整型算子直接承载推理。核心 idea:提出单哈达玛变换量化感知训练框架(HQ-DM),仅对激活实施分块哈达玛正交旋转以消除激活离群值,无缝支持整型卷积与线性矩阵乘法,结合 LoRA 蒸馏与时间步自适应步长实现低比特扩散模型的高保真生成。
方法详解¶
整体框架¶
HQ-DM 构建了一套面向低比特扩散模型的高效量化感知蒸馏与硬件友好推理管线。在整个去噪网络的各线性层与卷积层前,系统首先依据通道或空间特征维度构造分块对角哈达玛正交矩阵,仅对输入激活张量进行在线投影变换,将极少数通道上的离群大值均匀平摊至整个正交子空间。随后,将变换后的激活张量与原始未受污染的权重张量送入对称整型量化器;通过代数恒等变形将哈达玛正规化系数直接融合进层间反量化缩放因子,使得中间核心计算可在硬件张量核心上以全整型矩阵乘法和整型卷积执行。在训练阶段,算法冻结原始全精度教师模型权重,利用 LoRA 低秩分支与逐时间步独立学习的步长参数(LSQ)联合优化输出蒸馏损失,实现极低开销的精度恢复。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
In["输入激活与特征图<br/>包含显著离群值通道"] --> SHT["单哈达玛激活变换<br/>分块对角正交旋转平摊尖峰"]
SHT --> IntOp["硬件友好整型算子重构<br/>吸收归一化因子/支持整型线性与卷积"]
IntOp --> QAT["LoRA 蒸馏与时间步自适应优化<br/>冻结主干权重/逐时间步学习 LSQ 步长"]
QAT --> Out["低比特去量化输出<br/>进入下一去噪时间步"]
关键设计¶
1. 单哈达玛激活变换:平滑激活尖峰并规避权重离群值放大 传统双重哈达玛变换(DHQ)试图在激活 \(X\) 与权重 \(W\) 之间同时插入 \(H\) 与 \(H^\top\),然而权重矩阵原本具备平缓集中的高斯样分布,对其实施哈达玛正交变换会将其转变为具有尖锐离群值的稀疏峰值分布(例如在 LDM-4 输出块权重中,DHQ 使得最大绝对值从 0.037 激增 2484% 至 0.964,峰度上升 65.81%),进而大幅破坏低比特权重表示。HQ-DM 提出单哈达玛变换策略,仅将正交变换作用于激活侧。针对输入通道数 \(C_i\) 并非 2 的整数幂的情况,HQ-DM 构造由 \(m\) 个基础哈达玛矩阵 \(H_k \in \mathbb{R}^{2^k \times 2^k}\) 组成的分块对角矩阵:
当单热基向量 \(e_i\) 遭遇离群尖峰时,变换后 \(e_i^\top H_k = 2^{-k/2} \cdot \mathbf{1}_{2^k}\) 将单一维度上的极端幅值均匀扩散为全 1 常数向量,极大收敛了激活的动态范围;而在权重端则保持原始分布,彻底杜绝了额外权重离群值的滋生。
2. 硬件友好的全整型线性与卷积算子重构 为确保在端侧 AI 加速器上的高效推理,单哈达玛变换必须能够在不引入浮点逆变换中间件的前提下完成整型计算。针对线性全连接层 \(Y = XW\),利用正交性质 \(H H^\top = I\),将展开式改写为 \(Y = (X H) H^\top W\)。通过将归一化浮点因子 \(2^{-k/2}\)(源于标准定义 \(H_k = 2^{-k/2} H_k^{\text{raw}}\))完全吸收至后续浮点缩放标量中,未归一化矩阵 \(H_k^{\text{raw}} \in \{-1, +1\}\) 转化为纯整型稀疏结构,线性计算完全退化为:
针对传统双哈达玛变换无法适配的卷积层,HQ-DM 提出了特征重塑(Reshape)机制。将 4D 激活张量 \(X_c \in \mathbb{R}^{B \times C_{\text{in}} \times h \times w}\) 合并批次、通道与高度维度,重塑为 2D 矩阵 \(\widetilde{X}_c \in \mathbb{R}^{(B \cdot C_{\text{in}} \cdot h) \times w}\),并在宽度维度右乘正交方阵 \(H_c \in \mathbb{R}^{w \times w}\):
该设计保证了正交反转在空间宽度轴上自闭环,使得包含多 stride 与 padding 的整型卷积运算无需经历昂贵的逐层浮点解量化,直接在 INT 硬件单元上完成流水线加速。
3. 基于 LoRA 蒸馏的时间步自适应量化感知训练 为了在消除离群值的基础上弥补超低比特带来的精度损失,HQ-DM 采用了参数高效的蒸馏微调范式。模型主体权重在训练中保持冻结,仅在各线性与卷积模块外挂低秩可学习矩阵 \(W' = W + B \cdot A\)(其中秩 \(r \ll \min(C_i, C_o)\))。针对扩散模型各时间步激活分布差异极大的物理特性,模型摒弃全局静态缩放,针对每个去噪步 \(t \in [1, T]\) 分配专属的可学习激活与权重缩放因子 \(S(t)\),通过直通估计器(Straight-Through Estimator, STE)进行反向梯度回传:
整个学生模型仅通过无数据(Data-free)形式在各去噪时间步最小化与 FP32 教师网络输出噪声之间的均方误差损失,在极少训练轮次内即可快速收敛。
损失函数 / 训练策略¶
在训练阶段,输入加噪潜变量 \(x_t\) 同时送入 FP32 教师模型 \(\epsilon_{\mathrm{FP}}\) 与量化学生模型 \(\epsilon_{\mathrm{quant}}\),蒸馏优化目标定义为:
优化器采用 AdamW,并对激活量化因子、权重量化因子及 LoRA 低秩权重分配差异化的初始学习率。由于单哈达玛变换计算开销极低且梯度传导平滑,整体训练耗时与前沿蒸馏方案完全持平。
实验关键数据¶
主实验¶
在 ImageNet \(256 \times 256\) 条件图像生成任务上,HQ-DM 在基于 U-Net 的 LDM-4 模型与前沿量化基线进行了严格评测(采样采用 20 步 DDIM)。结果表明,HQ-DM 在极低比特配置下建立了巨大的性能优势。
| 方法 | 位宽 (W/A) | IS ↑ | FID ↓ | sFID ↓ | Precision (%) ↑ |
|---|---|---|---|---|---|
| FP32 基线 | 32/32 | 365.35 | 11.22 | 7.78 | 93.68 |
| Q-Diffusion | 8/8 | 350.93 | 10.60 | 9.29 | 92.46 |
| PTQD | 8/8 | 359.78 | 10.05 | 9.01 | 93.00 |
| EfficientDM | 8/8 | 362.34 | 11.38 | 8.04 | 93.77 |
| HQ-DM (本文) | 8/8 | 363.22 | 11.01 | 7.76 | 93.46 |
| Q-Diffusion | 4/8 | 336.80 | 9.29 | 9.29 | 91.06 |
| PTQD | 4/8 | 344.72 | 8.74 | 7.98 | 91.69 |
| EfficientDM | 4/8 | 351.97 | 9.96 | 7.80 | 92.48 |
| HQ-DM (本文) | 4/8 | 355.59 | 10.07 | 7.14 | 93.07 |
| PTQD | 8/4 | 1.93 | 262.01 | 111.10 | 0.54 |
| EfficientDM | 8/4 | 252.00 | 6.75 | 8.48 | 84.90 |
| HQ-DM (本文) | 8/4 | 292.76 | 7.68 | 9.93 | 88.68 |
| PTQD | 4/4 | 2.57 | 258.11 | 124.33 | 0.69 |
| QuEST | 4/4 | 202.45 | 5.98 | — | — |
| EfficientDM | 4/4 | 220.20 | 6.63 | 9.80 | 80.97 |
| HQ-DM (本文) | 4/4 | 248.30 | 6.58 | 9.60 | 84.44 |
| PTQD | 4/3 | 1.62 | 297.88 | 150.46 | 0.31 |
| EfficientDM | 4/3 | 8.74 | 99.78 | 65.79 | 27.48 |
| HQ-DM (本文) | 4/3 | 49.62 | 33.47 | 12.09 | 54.87 |
在跨架构扩展性上,HQ-DM 还在 Transformer 架构的 DiT-XL(50 步采样)上展开验证。在 ImageNet \(256 \times 256\) 的 W4A4 配置下,HQ-DM 的 IS 达到 355.74,相较 EfficientDM 的 221.07 相对提升 60.92%,FID 从 10.41 降至 9.62,充分印证了方法对注意力主导架构的通用性。
消融实验¶
为了精确量化各核心模块对模型性能的独立赋能,研究团队在 ImageNet \(256 \times 256\) 上的 LDM-4 (W4A4) 模型中剥离了时间步步长学习(LSQ)、LoRA 蒸馏和单哈达玛变换(Hada.)。
| 配置 / 变体 | LSQ | LoRA | Hada. | IS ↑ | FID ↓ | sFID ↓ | Precision (%) ↑ |
|---|---|---|---|---|---|---|---|
| FP32 全精度基准 | — | — | — | 365.35 | 11.22 | 7.78 | 93.68 |
| EfficientDM 基线 | ✓ | ✓ | ✗ | 220.20 | 6.63 | 9.80 | 80.97 |
| 朴素 PTQ + LSQ | ✓ | ✗ | ✗ | 5.09 | 193.59 | 67.24 | 3.38 |
| 朴素 PTQ + LSQ + Hada. | ✓ | ✗ | ✓ | 33.29 | 68.16 | 48.86 | 26.50 |
| 朴素 QAT + LSQ | ✓ | ✗ | ✗ | 159.24 | 7.69 | 8.38 | 76.85 |
| 朴素 QAT + LSQ + Hada. | ✓ | ✗ | ✓ | 203.69 | 6.47 | 10.98 | 82.53 |
| 仅 LoRA 微调 | ✗ | ✓ | ✗ | 185.51 | 8.55 | 10.46 | 73.25 |
| LoRA + Hada. | ✗ | ✓ | ✓ | 229.75 | 6.52 | 10.72 | 79.55 |
| HQ-DM (完整模型) | ✓ | ✓ | ✓ | 248.30 | 6.58 | 9.60 | 84.44 |
此外,在双重哈达玛(DHQ-DM)与单哈达玛(HQ-DM)的直接对比中,DHQ-DM 在所有量化位宽下均出现严重精度塌陷(W4A4 下 IS 仅 4.37、FID 达 179.40),且由于双向额外乘法引入了超 10% 的推理延迟,证明了单哈达玛变换架构的优越性。
关键发现¶
- 哈达玛变换具备极强的独立正交增益:无论在无训练的 PTQ 还是 QAT 设定下,单哈达玛变换的加入均能带来跨越式的提升。在未引入 LoRA 的 PTQ 方案中,仅增加哈达玛旋转即可将 IS 从 5.09 提升至 33.29,FID 骤降 125.43 点。
- 极端低比特位宽下收益非线性放大:在 W4A4 时 HQ-DM 的 IS 较 EfficientDM 提升 12.76%;而在进入极端苛刻的 W4A3 场景时,EfficientDM 生成质量全面恶化(IS 8.74, FID 99.78),而 HQ-DM 取得了 49.62 的 IS 与 33.47 的 FID,相对提升幅度达到 467.73%,精准攻克了 3 比特激活量化的深水区。
- 硬件与训练开销极为轻量:在单张 A100 GPU 上的统计表明,HQ-DM 蒸馏收敛速度显著优于 baseline,稀疏整型哈达玛矩阵乘法未带来额外训练耗时(训练总时间 1.4 小时,远低于 PTQD 的 28 小时标定)。
亮点与洞察¶
- 从双重对称到单向非对称的洞见转变:以往工作机械继承了 LLM 的双重哈达玛范式,误以为权重也需旋转;本文敏锐指出了卷积算子不可分和权重被动引入离群值的本质弊端,用单侧正交变换破解了困局。
- 纯整型推理链路的代数闭环:通过将哈达玛正交矩阵的模长规整化系数吸收进反量化比例因子,将浮点旋转巧妙转化为纯加减运算与 INT 矩阵乘法,完美贴合现有 NPU/GPU 张量计算加速管线。
- 无数据蒸馏范式的迁移价值:HQ-DM 的训练完全依赖加噪潜变量与教师输出对齐,不依赖原始真实训练集图像,为有高隐私敏感度或缺乏原始预训练数据的企业级扩散模型量化部署提供了高通用性范例。
局限与展望¶
- 作者承认的局限:方法仅专注于激活侧离群值的抑制,量化整体精度仍高度依赖权重本身的数值平稳度;当权重位宽进一步压缩至 2 比特时,仍面临一定的能力瓶颈。
- 工程实现与维度边界:当输入张量的特征通道或空间维度极小且无法凑整至基础哈达玛阶数 \(2^k\) 时,系统只能退化为恒等矩阵 \(I\),无法对浅层输入投影块提供完整的离群值保护。
- 未来改进方向:可进一步探索混合精度自适应分配策略,将单哈达玛变换与敏感层非均匀比特动态调度结合,探索更高分辨率多模态视频生成模型(如 Sora 类架构)的低比特超高速部署。
相关工作与启发¶
- vs EfficientDM: EfficientDM 首次引入 LoRA 蒸馏进行扩散模型 QAT,但在 4 比特及以下激活下受到极端离群值的严重干扰且采用了非对称量化;HQ-DM 引入单哈达玛变换从几何空间消除离群值,并采用硬件友好的对称量化,在 W4A3 下实现翻倍的生成质量跃升。
- vs QuaRot / Double Hadamard (DHQ-DM): QuaRot 为大语言模型提出双重哈达玛变换,但无法适应卷积结构,并在旋转平稳权重时诱发大量额外权重离群值;HQ-DM 改用单哈达玛变换,并重塑卷积空间维度,无缝打通了全整型卷积计算网络。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ 针对扩散模型特性破除双哈达玛思维定势,巧妙实现单哈达玛变换与全整型卷积/线性融合。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 ImageNet、LSUN 双数据集,覆盖 U-Net 与 DiT 两大主流生成架构,包含详尽的模块消融与时延硬件评测。
- 写作质量: ⭐⭐⭐⭐⭐ 动机阐述深刻,对离群值机制的数学分析与图表呈现清晰扎实。
- 价值: ⭐⭐⭐⭐⭐ 彻底打通了扩散模型 W4A4 及 W4A3 超低比特落地的工程与理论通路,极具端侧应用落地价值。