SFKD: Spatial–Frequency Joint-Aware Heterogeneous Knowledge Distillation via Multi-Level Wavelet Spectral Interaction¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/cpcpWang/SFKD
领域: 模型压缩
关键词: 异构知识蒸馏 / 离散小波变换 / 快速傅里叶变换 / 空间频域联合感知 / 模型压缩
一句话总结¶
针对异构模型(CNN、Transformer、MLP-Mixer)归纳偏置差异导致的表征空间分布不一致问题,SFKD 提出结合多级离散小波解耦、双流双阶段谱精炼与高斯滤波频域对比损失,在保留并提炼全局结构与局部细节的同时实现高效异构知识蒸馏。
研究背景与动机¶
知识蒸馏作为经典的模型压缩手段,通常以同构网络(如 CNN 到 CNN、Transformer 到 Transformer)之间的知识传递为主。然而,在边缘设备部署场景下,合适的高性能同构教师模型往往难以获取;更为关键的是,单纯局限于同构蒸馏无法汲取跨架构网络互补的归纳偏置——例如 CNN 具备强局部感知和空间平移不变性,而 Transformer 擅长建模长距离全局依赖,将异构教师知识引入轻量学生往往能够激发出超越同构蒸馏的压缩潜力。
异构模型蒸馏的核心瓶颈在于表征空间的内在鸿沟。由于架构先验截然不同,教师与学生中间特征图在空间分布上展现出显著的不一致性。此前的方法(如 OFA、FBT 等)为了缓解这种跨架构表征冲突,普遍选择在蒸馏时大幅弱化甚至丢弃中间特征的空间结构信息,例如将特征压缩至极低维的嵌入空间、直接映射到无空间维度的 logits 空间,或者采用结构不可知的蒸馏损失。然而,中间特征的空间布局不仅包含模型特定的局部纹理细节,还承载着极具迁移价值的全局语义与几何拓扑结构。一味削弱或丢弃空间信息,直接扼杀了学生模型吸收跨架构空间结构知识的可能。
为了在异构蒸馏中充分利用空间表征而不受架构分布偏差干扰,本文提出空间-频域联合感知的蒸馏框架。核心 idea:利用离散小波变换的空间局部性将异构表征显式解耦为低频和高频子带,通过双流双阶段模块自适应精炼学生子带的结构稳定性,再借助高斯滤波傅里叶频域对比损失对齐全局能量分布与关键频率成分。
方法详解¶
整体框架¶
SFKD 框架主要由三个核心阶段串联而成:多级离散小波变换(MDWT)空间解耦、双流双阶段谱精炼(DS2SR)模块,以及高斯滤波频域损失(GFFL)。对于教师特征 \(F_t\) 与经投影层对齐后的学生特征 \(F_s\),首先使用基于 Haar 小波的多级离散小波变换,在空间维度上将其解耦为表征全局轮廓的低频子带与表征局部边缘纹理的多级高频子带集合。针对学生网络容量较弱导致的小波子带结构不稳定及频谱泄露问题,利用包含局部卷积精炼流(LCR)与全局 Transformer 精炼流(GTR)的双流双阶段模块进行自适应重构与跨频段交互。最后,通过二维快速傅里叶变换(FFT)将精炼后的子带投影到频域,提取振幅谱并施加高斯低通与高通掩码,利用 InfoNCE 损失拉近异构子带的主导频域能量分布,并在重构的全特征与预测 logits 层面进行多层次任务监督。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入特征<br/>教师特征 Ft 与投影后学生特征 Fs"] --> B["多级离散小波变换 MDWT<br/>空间解耦为低频 LJ 与多级高频 HJ 子带"]
B --> C["双流双阶段谱精炼 DS2SR<br/>LCR 局部卷积与 GTR 掩码交互全局精炼"]
C --> D["自适应加权融合 AWF<br/>整合局部与全局增强子带"]
D --> E["高斯滤波频域损失 GFFL<br/>FFT 振幅谱低通/高通对齐 + IMDWT 逆变换重构"]
E --> F["蒸馏总目标优化<br/>频域子带损失 + 重构特征对齐 + Logits KL 散度"]
关键设计¶
1. 多级离散小波变换(MDWT):显式解耦空间多尺度结构与细节 直接在像素空间对比异构特征时,CNN 的局部卷积归纳偏置与 Transformer 的 patch 级注意力会产生剧烈的空间对齐冲突。为了将易于对齐的宏观结构与模型特定的微观细节剥离,SFKD 采用正交可逆的 Haar 小波作为分解算子。对输入特征张量 \(F \in \mathbb{R}^{B \times C \times H \times W}\) 递归执行 \(J\) 级二维离散小波变换,将其显式拆解为一个低频子带 \(L^J\) 以及包含垂直、水平、对角三个方向的各级高频子带集合 \(\mathcal{H}^j = \{H^{j, LH}, H^{j, HL}, H^{j, HH}\}\)(\(j \in \{1, \dots, J\}\))。低频子带汇聚了跨架构共享的全局语义轮廓,高频子带则捕捉边界与纹理。这一空间解耦使不同性质的表征信息能够在受控的多尺度频带上独立处理,同时保留了完整的小波逆变换(IMDWT)无损重构能力。
2. 双流双阶段谱精炼模块(DS2SR):互补归纳偏置与跨频段定向交互 有限长小波滤波核在实际离散变换中难以达到理想带通截止,常导致子带间频谱泄露与高频残留;加之学生网络表征能力薄弱,其小波子带存在严重的结构不稳定与分布畸变。为此,DS2SR 构建了局部卷积精炼(LCR)与全局 Transformer 精炼(GTR)两个互补流: - 局部卷积精炼流(LCR):利用残差卷积块(ResConvBlock)分别精炼低频和高频子带,通过不同步长的卷积与带权残差跳连增强局部几何连续性并抑制过度平滑; - 全局 Transformer 精炼流(GTR):首先对小波子带进行卷积分块 Token 化,并创新性地设计了 4D 位置编码 \([j, d, Pos_h, Pos_w]\),其中 \(j\) 为小波分解层级,\(d \in \{0, 1, 2, 3\}\) 为低频与三类高频子带类型指示符,\(Pos_h, Pos_w\) 为空间二维坐标,完美解决了跨层级、跨子带方向的空间与层级位置混淆; - 双阶段跨频段掩码交互:在 GTR 内部,第一阶段先对低频 Token 进行自注意力平滑;第二阶段拼接低频与高频 Token,引入单向注意力掩码——允许低频 Token 观察高频 Token 以便利用高频边缘信息精准剔除低频中的残留高频噪声,但阻断高频 Token 观察低频 Token 以免反向干扰高频细节; - 自适应加权融合(AWF):针对低频和各级高频子带,分别通过自适应门控网络动态融合 LCR 与 GTR 的精炼输出,生成高鲁棒性的学生子带 \(L_{\mathrm{ref}}^{J, s}\) 与 \(\mathcal{H}_{\mathrm{ref}}^{s}\)。
3. 高斯滤波频域损失(GFFL):振幅谱全局能量对齐与平滑选频 小波变换虽具优异的空间局部性,但在空间网格上对齐仍可能受到微小相位平移和局部非刚性形变的干扰。相比之下,傅里叶振幅谱具有表征全局能量分布与整体几何结构的平移不变性。SFKD 对教师子带与精炼后的学生子带进行二维 FFT,计算振幅谱 \(|\mathcal{F}(X)|(u,v) = \sqrt{\mathrm{Re}(X)^2 + \mathrm{Im}(X)^2}\)。为消除硬截止滤波引起的截断伪影与吉布斯振铃效应,设计平滑的高斯低通掩码 \(G_{\mathrm{low}}(u,v) = \exp(-\frac{u^2+v^2}{2\sigma^2})\) 与高通掩码 \(G_{\mathrm{high}}(u,v) = 1 - G_{\mathrm{low}}(u,v)\)。针对集中于频谱中心的低频子带施加高斯低通滤波,针对分布于高频周边的细节子带施加高斯高通滤波,随后以 InfoNCE 对比损失对齐教师与学生的加权振幅谱:
损失函数 / 训练策略¶
为了确保蒸馏不仅在解耦的各子带频域对齐,还能在宏观特征与下游任务预测上保持全局一致,SFKD 采用四重联合损失: 1. 低频子带对齐损失:\(\mathcal{L}_{\mathrm{LF}} = \mathcal{L}_{\mathrm{GFFL}}(L^{J, t}, L_{\mathrm{ref}}^{J, s}; G_{\mathrm{low}})\); 2. 高频子带对齐损失:\(\mathcal{L}_{\mathrm{HF}} = \sum_{j=1}^J \mathcal{L}_{\mathrm{GFFL}}(\mathcal{H}^{j, t}, \mathcal{H}_{\mathrm{ref}}^{j, s}; G_{\mathrm{high}})\); 3. 全图逆变换重构特征损失:利用 IMDWT 将学生精炼子带逆变换重构为 \(F_s^{\mathrm{rec}}\),通过无滤波的傅里叶频域损失约束其与教师原始特征 \(F_t\) 的各向异性一致性:\(\mathcal{L}_{\mathrm{Rec}} = \mathcal{L}_{\mathrm{GFFL}}(F_t, F_s^{\mathrm{rec}}; \mathbf{1})\); 4. 重构特征分类预测损失:将 \(F_s^{\mathrm{rec}}\) 输入新初始化的分类头获得预测 logits \(Z_s^{\mathrm{rec}}\),与教师 logits \(Z_t\) 计算 KL 散度:\(\mathcal{L}_{\mathrm{KL}} = \mathcal{L}_{\mathrm{KL}}(Z_s^{\mathrm{rec}}, Z_t)\)。
总训练损失形式为各加权项与原始分类交叉熵之和:
实验关键数据¶
主实验¶
在 CIFAR-100 上评测覆盖 CNN、Transformer、MLP-Mixer 间 12 组异构教师-学生组合;在 ImageNet-1K 上评测 14 组异构组合及 2 组同构组合。对比方法涵盖经典 logits 蒸馏(KD、DKD、DIST)、通用特征蒸馏(FitNet、CC、RKD、CRD)以及先进异构蒸馏方法(OFA、FBT)。
| 数据集 | 教师模型 \(\to\) 学生模型 | 教师 Acc | 学生独立训练 | 之前最优 (FBT/OFA) | SFKD (本文) | 相对提升 |
|---|---|---|---|---|---|---|
| CIFAR-100 | Swin-T \(\to\) ResNet18 | 89.26% | 74.01% | 81.61% (FBT) | 83.26% | +1.65% |
| CIFAR-100 | ViT-S \(\to\) ResNet18 | 92.04% | 74.01% | 81.93% (FBT) | 82.10% | +0.17% |
| CIFAR-100 | Mixer-B/16 \(\to\) ResNet18 | 87.29% | 74.01% | 81.90% (FBT) | 81.98% | +0.08% |
| CIFAR-100 | Swin-T \(\to\) MobileNetV2 | 89.26% | 73.68% | 81.28% (FBT) | 82.03% | +0.75% |
| CIFAR-100 | ConvNeXt-T \(\to\) DeiT-T | 88.41% | 68.00% | 79.57% (FBT) | 83.91% | +4.34% |
| CIFAR-100 | Mixer-B/16 \(\to\) DeiT-T | 87.29% | 68.00% | 74.40% (FBT) | 81.14% | +6.74% |
| CIFAR-100 | ConvNeXt-T \(\to\) Swin-P | 88.41% | 72.63% | 80.73% (FBT) | 82.16% | +1.43% |
| CIFAR-100 | ConvNeXt-T \(\to\) ResMLP-S12 | 88.41% | 66.56% | 78.03% (FBT) | 85.08% | +7.05% |
| CIFAR-100 | Swin-T \(\to\) ResMLP-S12 | 87.29% | 66.56% | 77.20% (FBT) | 84.01% | +6.81% |
| ImageNet-1K | Swin-T \(\to\) ResNet18 | 81.38% | 69.75% | 72.21% (FBT) | 72.54% | +0.33% |
| ImageNet-1K | Swin-T \(\to\) MobileNetV2 | 81.38% | 68.87% | 72.54% (FBT) | 72.67% | +0.13% |
| ImageNet-1K | ResNet50 \(\to\) DeiT-T | 80.38% | 72.17% | 75.84% (FitNet) | 75.89% | +0.05% |
| ImageNet-1K | ResNet50 \(\to\) Swin-N | 80.38% | 75.53% | 77.79% (FBT) | 78.28% | +0.49% |
| ImageNet-1K | ConvNeXt-T \(\to\) ResMLP-S12 | 82.05% | 76.65% | 77.33% (FBT) | 78.35% | +1.02% |
| ImageNet-1K (同构) | ResNet34 \(\to\) ResNet18 | 73.31% | 69.75% | 72.29% (FBT) | 72.34% | +0.05% |
| ImageNet-1K (同构) | ResNet50 \(\to\) MobileNet | 76.61% | 68.58% | 73.45% (FBT) | 73.81% | +0.36% |
消融实验¶
1. 损失函数各组件消融(ImageNet-1K: Swin-T \(\to\) ResNet18)
| 实验配置 | \(\mathcal{L}_{\mathrm{LF}}\) | \(\mathcal{L}_{\mathrm{HF}}\) | \(\mathcal{L}_{\mathrm{Rec}}\) | \(\mathcal{L}_{\mathrm{KL}}\) | Top-1 准确率 (%) | 说明 |
|---|---|---|---|---|---|---|
| 移除低频损失 | \(\times\) | \(\checkmark\) | \(\checkmark\) | \(\checkmark\) | 72.19% | 掉点最大(-0.35%),印证全局结构是知识蒸馏主导支柱 |
| 移除高频损失 | \(\checkmark\) | \(\times\) | \(\checkmark\) | \(\checkmark\) | 72.32% | 掉点 -0.22%,高频局部边缘不可忽略 |
| 移除重构特征损失 | \(\checkmark\) | \(\checkmark\) | \(\times\) | \(\checkmark\) | 72.31% | 掉点 -0.23%,表明子带对齐仍需逆变换全特征约束 |
| 移除分类 Logits 损失 | \(\checkmark\) | \(\checkmark\) | \(\checkmark\) | \(\times\) | 72.46% | 掉点 -0.08%,任务导向监督提供必要正则化 |
| 完整模型(SFKD) | \(\checkmark\) | \(\checkmark\) | \(\checkmark\) | \(\checkmark\) | 72.54% | 四项损失联合取得最优蒸馏性能 |
2. DS2SR 精炼模块与互补流消融(ImageNet-1K: Top-1 准确率 %)
| 局部卷积精炼 (LCR) | 全局自注意力精炼 (GTR) | Swin-T \(\to\) ResNet18 (CNN 学生) | ResNet50 \(\to\) Swin-N (Transformer 学生) | 结构特性分析 |
|---|---|---|---|---|
| \(\times\) | \(\times\) | 71.24% | 76.83% | 无精炼时由于频谱泄露和表征畸变,蒸馏效果受限 |
| \(\checkmark\) | \(\times\) | 72.19% | 78.24% | CNN 学生升 0.95%,Transformer 学生升 1.41% |
| \(\times\) | \(\checkmark\) | 72.46% | 77.83% | CNN 学生更偏好 GTR(全局补充),升 1.22% |
| \(\checkmark\) | \(\checkmark\) | 72.54% | 78.28% | 双流互补融合达到最高精度 |
关键发现¶
- 低频子带承载蒸馏核心语义:在损失函数消融中,剔除低频损失 \(\mathcal{L}_{\mathrm{LF}}\) 导致幅度最大的性能滑坡(从 72.54% 跌落至 72.19%),证明宏观几何与全局语义是跨架构知识迁移的根基;同时高频局部细节能进一步补足分类边界精度。
- 架构归纳偏置呈交叉互补偏好:对于 CNN 学生(ResNet18),引入全局注意力 GTR 流带来的提升(+1.22%)明显高于单独引入局部卷积 LCR 流(+0.95%);相反,对于缺乏局部归纳偏置的 Transformer 学生(Swin-N),引入局部卷积 LCR 流带来的增益(+1.41%)显著高于 GTR 流(+1.00%)。这强力证明异构蒸馏中逆向补充异构模型所欠缺的归纳偏置具有显著效益。
- 频域滤波有效解决跨架构特征畸变:传统基于像素 MSE 的特征对齐方法(如 FitNet)在跨架构蒸馏到 Transformer 时常发生灾难性性能退化(如 CIFAR-100 ConvNeXt-T \(\to\) Swin-P 上 FitNet 仅得 24.06%),而 SFKD 达到 82.16%,展示出频域振幅谱对齐在异构表征上的强大鲁棒性。
亮点与洞察¶
- 空间局部性与频域平移不变性的优雅结合:不同于此前方法直接将特征展平或压入低维空间以避开空间不一致,SFKD 先通过离散小波变换在空间域解耦尺度,再转入傅里叶频域提取振幅谱,既充分挖掘了多尺度空间信息,又避免了刚性空间逐像素对齐的脆弱性。
- 4D 位置编码打通多层小波频谱表示:创造性地将小波分解层级 \(j\) 与高低频子带类型 \(d\) 作为额外维度,与空间二维坐标整合成 \([j, d, Pos_h, Pos_w]\) 4D 位置编码,使通用 Transformer 能够无歧义地处理层级化多频带特征。
- 定向单向注意力掩码机制:在跨频段交互中,允许低频 Token 查看高频 Token 辅助滤除频谱泄露噪声,同时严禁高频 Token 查看低频 Token 避免反向干扰,这一非对称设计为多频段特征融合提供了极佳的设计范式。
局限与展望¶
- 计算与内存开销:在训练阶段需要执行多级小波变换、双流网络精炼以及快速傅里叶变换(FFT),相比极简的 logits 蒸馏,单步反向传播的计算与显存开销相对较大。
- 超参数敏感度:高斯滤波器的带宽参数 \(\sigma\) 和多级小波分解层数 \(J\) 对不同分辨率输入(如 CIFAR 32x32 对比 ImageNet 224x224)存在一定经验依赖性,未来可探索自适应带宽学习机制。
- 任务拓展性:目前实验主要集中在图像分类任务,该空间-频域解耦机制在目标检测、语义分割等强依赖密集像素定位与边界敏感的稠密预测任务上的表现仍有待进一步验证与拓展。
相关工作与启发¶
- vs OFA (One-for-All):OFA 将中间特征图投影到无空间维度的 logits 空间来回避异构架构的空间鸿沟,并且依赖多阶段(4 个阶段)特征参与蒸馏;SFKD 仅使用模型最后一层特征,通过小波与傅里叶变换深入挖掘空间结构,在显著减少对多层特征依赖的前提下取得了更优性能。
- vs FBT (Fuse Before Transfer):FBT 通过构建一个混合的中间过渡桥接模型来融合异构知识;SFKD 则完全不需要训练额外的桥接大模型,直接利用正交小波基和傅里叶频域滤波显式解耦和过滤特征,计算逻辑更加清晰且在多项异构配置下平均领先 FBT 2.54%(CIFAR-100)。
- vs FCFD / FitNet:传统特征蒸馏直接在空间特征上做 MSE 强制对齐,在异构蒸馏中极易崩溃;SFKD 从理论上指出了频域振幅谱能吸纳空间平移与几何形变的特性,为特征对齐开辟了频域新范式。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 巧妙融合小波变换空间解耦与傅里叶振幅谱频域全局感知,设计 4D 位置编码与单向跨频掩码,视角独特。
- 实验充分度: ⭐⭐⭐⭐⭐ 在 CIFAR-100 与 ImageNet-1K 上涵盖 26 组异构与同构组合,消融实验精细深入。
- 写作质量: ⭐⭐⭐⭐⭐ 理论分析扎实,动机阐述层层递进,方法与图表逻辑高度一致。
- 价值: ⭐⭐⭐⭐⭐ 彻底打破异构知识蒸馏必须丢弃空间信息的思维定式,为跨架构模型压缩提供了全新的理论与工程基准。