Fourier Self-Supervision for Fine-Grained Generalized Category Discovery¶
会议: ECCV 2026
论文: ECCV 2026
代码: https://github.com/SarahRastegar/FourEx
领域: 自监督/表示学习
关键词: 广义类别发现, 傅里叶变换, 自监督对比学习, 细粒度分类, 双频滤波
一句话总结¶
针对细粒度广义类别发现中类间差异微弱导致难以聚类新类的问题,本文提出基于傅里叶变换的双频自监督对比学习框架,通过信噪比确定自适应截止频率并解耦表征空间,以低频提取粗粒度抽象层级、高频捕捉微小判别特征,显著提升新已知类别的发现精度。
研究背景与动机¶
广义类别发现(Generalized Category Discovery, GCD)致力于在仅有部分已知类别标签的未标注数据流中,既准确识别已知类别,又能自主挖掘并归聚未知的新类别。现有的主流 GCD 方案严重依赖对比自监督学习与原型聚类,虽然在粗粒度基准(如 CIFAR、ImageNet 子集)上展现了令人信服的聚合能力,但当应用场景拓展至细粒度领域(如鸟类、飞行器、汽车型号)时,类间外观差异急剧收缩,现有算法往往出现显著的性能退化。传统空间域强数据增强(如剧烈色彩抖动、随机裁剪)往往会破坏鸟喙、羽毛纹理等决定类别归属的微弱判别性细节,使对比学习过度依赖背景或粗糙的视觉轮廓。
细粒度 GCD 的核心矛盾在于:发现未知新类别需要全局、抽象的高层语义来建立类别间的隐式层级结构,从而限制新类的搜索空间并避免父子类别混淆;然而,精准区分相似的细粒度类别又极度依赖局部边缘、纹理等高频精细线索。现有对比学习范式在单一空间特征中混淆了这两种不同尺度的信息,模型极易陷入局部特征导致的过拟合或全局平滑带来的判别力丧失。
本文从傅里叶光学与深度神经网络学习规律(F-principle)中获得启发:低频成分携带大体形状与环境等抽象语义,有助于构建层级先验;高频成分则纯粹剥离出边缘与纹理,承载细粒度判别的核心证据。核心 idea:利用傅里叶变换将图像解构为低频与高频正交视图,分别在解耦的潜在维度子空间上执行分段自监督对比学习,以低频隐式层级引导未知类发现,以高频细节强化细粒度区分。
方法详解¶
整体框架¶
本文提出的 Fourier Self-Supervision 框架由输入预处理与频域变换、双频正交对比表征学习,以及频域增强一致性分类三个核心阶段组成。给定输入图像,框架首先施加高斯模糊抑制吉布斯振铃伪影,并经由快速傅里叶变换(FFT)将图像映射到频域;随后,系统基于预先设定的信噪比(SNR)准则确定截止频率边界,分别施加理想低通滤波器(LPF)与高通滤波器(HPF),经逆快速傅里叶变换(iFFT)重建出对应的低频视图与高频视图。骨干网络将原始图像及其频域增强视图映射至潜在表征空间,将潜在维度划分为左半区(低频专享)与右半区(高频专享),按照截断频率动态分配子维度进行对比损失计算,最后结合有标签数据的分类交叉熵联合优化。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入图像 x_i<br/>高斯平滑降噪"] --> B["自适应信噪比频域滤波<br/>FFT 变换 + SNR 截止频率"]
B --> C["频域滤波重构<br/>LPF 低通 / HPF 高通 + iFFT"]
C --> D["低频对比学习<br/>左半潜空间动态维度对齐"]
C --> E["高频对比学习<br/>右半潜空间边缘纹理区分"]
D --> F["频域增强分类一致性<br/>原图/低频/高频联合 BCE 约束"]
E --> F
F --> G["细粒度类别发现与聚类评估"]
关键设计¶
1. 自适应信噪比频域滤波:根据数据集特性建立鲁棒截止频率
频域滤波的截断频率如果人为随意设定,极易导致低频视图保留过多细节而失去抽象意义,或者高频视图被传感器高频噪声淹没。为实现数据依赖的客观频段选择,模型基于标准数字图像/视频质量评价准则,选取 15 dB(线性比值约为 32)作为可接受的主观信号质量阈值。对图像傅里叶变换 \(X\),截止频率 \(f_c\) 的信噪比定义为低频能量与高频能量的比值:
模型在整个数据集的所有类别上计算满足 15 dB 条件的临界点并求取均值,自动提取出低通最大截止阈值 \(T_l\) 与对应的高通阈值 \(T_h\)。此外,针对傅里叶逆变换在边缘处容易诱发的吉布斯振铃效应(Gibbs ringing artifacts),算法在变换前对图像施加核尺寸为 5 的轻量高斯滤波,确保频域重构视图不产生高频畸变。
2. 低频对比学习:约束隐式层级以辅助新类泛化
人类视觉在缺失高频边缘细节时,依然能凭借轮廓与色彩归纳出目标的粗略归属(例如辨别为林鸟或水鸟)。受神经网络优先拟合低频的 F-principle 启发,模型从 \([1, T_l]\) 中随机采样截止频率 \(f_l\),经 LPF 滤波后逆变换生成平滑视图 \(l_i = \mathcal{F}^{-1}(H_{LP} \odot \mathcal{F}(x_i))\)。为避免全局覆盖干扰局部判别,模型将总维度为 \(D\) 的潜在表征空间的左半区固定分配给低频,并依据截断比率动态确定对比维度 \(d = \frac{f_l}{T_l} \cdot \frac{D}{2}\):
其中 \(\mathcal{L}_{i|d}^u\) 和 \(\mathcal{L}_{i|d}^s\) 分别表示仅在最左侧前 \(d\) 维切片上计算的无监督与有监督对比损失。随着采样频率从粗到细变化,表征空间从高层抽象逐步过渡到精细类别,使未标记样本能够借助已知类别的共性父节点约束搜索空间,从而大幅抑制新类别发现过程中的层级混淆。
3. 高频对比学习:聚焦纹理微差以强化细粒度判别
细粒度分类的决定性判据大多隐藏在高频纹理和骨架边缘中,但高频分量能量较低且易受高频背景噪点污染。模型在保证信噪比可控的区间内随机采样高频截止频率 \(f_h < T_h\),构造高通滤波视图 \(h_i = \mathcal{F}^{-1}(H_{HP} \odot \mathcal{F}(x_i))\)。与低频向右拓展相反,高频特征严格锚定在潜在维度的最右半区,分配维度为 \(-d\)(对应最右侧 \(\frac{f_h}{T_h} \cdot \frac{D}{2}\) 维),在过滤掉平滑底色的纯净高频视图与原图之间计算高频对比损失 \(\mathcal{L}_{\text{high}}\):
这种分立子空间的设计实现了频域信息的正交解耦,使高频分量专注于微弱形态学微差的拉伸,而不会破坏左半区已经成型的平滑语义流形。
4. 频域增强分类一致性:多视图语义对齐与防过拟合
低频重建图 \(l_i\)、高频重建图 \(h_i\) 与原始样本 \(x_i\) 尽管在频域表现各异,但它们在语义上属于完全同源的实体。为强化有标签子集上的判别边界稳定性,模型引入基于二元交叉熵(BCE)的联合分类损失:
该损失强制分类器在严重缺失高频或完全剔除低频色彩的极端视图下,依然维持对正确类别的判别后验,促使网络捕捉鲁棒的频域不变语义。
损失函数 / 训练策略¶
整个端到端训练框架的目标函数由基础 GCD 模型的基线损失与三个自监督组件加权构成:
在优化策略上,主网络采用预训练 ViT-B/16。当作为即插即用模块应用于不同基线时,若基线为 SimGCD(记作 FourSim),微调 ViT 的最后一个 Transformer Block,前 11 层冻结;若基线为 SelEx(记作 FourEx),微调最后 3 个 Transformer Block。超参数设置中,平衡权重经验性设为 \(\alpha_{\text{low}} = 0.1\),\(\alpha_{\text{high}} = 0.1\),\(\alpha_{\text{cls}} = 0.1\)。
实验关键数据¶
主实验¶
在三个标准细粒度基准(CUB-200、FGVC-Aircraft、Stanford-Cars)上评估已知类(Known)、新类(Novel)以及全部类别(All)的聚类准确率,下表展示了 DINOv1 预训练主干下的表现对比:
| 数据集 | 指标 | SelEx 基线 | FourEx (本文) | 提升 (Gain) |
|---|---|---|---|---|
| CUB-200 | All / Known / Novel | 76.4 / 72.4 / 78.4 | 80.2 / 75.1 / 82.7 | +3.8 / +2.7 / +4.3 |
| FGVC-Aircraft | All / Known / Novel | 61.2 / 67.7 / 58.0 | 65.9 / 67.9 / 64.9 | +4.7 / +0.2 / +6.9 |
| Stanford-Cars | All / Known / Novel | 56.9 / 76.9 / 47.3 | 59.2 / 76.9 / 50.6 | +2.3 / 0.0 / +3.3 |
| Average (平均) | All / Known / Novel | 64.8 / 72.3 / 61.2 | 68.4 / 73.3 / 66.1 | +3.6 / +1.0 / +4.9 |
在长尾且严重不平衡的 Herbarium19 数据集上,FourEx 在 All / Known / Novel 上取得 44.5% / 61.5% / 35.3%,相比 SelEx 基线分别提升 +4.9% / +6.6% / +4.0%;在小规模样本稀缺的 Oxford-IIIT Pet 上,FourEx 达到 92.8% All 和 93.4% Novel 准确率。
消融实验¶
在 CUB-200、FGVC-Aircraft、Stanford-Cars 三个细粒度数据集上对各个损失组件进行消融分析(基线为微调后三层的 SelEx):
| 配置 | \(\mathcal{L}_{\text{low}}\) | \(\mathcal{L}_{\text{high}}\) | \(\mathcal{L}_{\text{cls}}\) | CUB-200 (All) | Aircraft (All) | Cars (All) | 综合平均 (Avg All) |
|---|---|---|---|---|---|---|---|
| 基线 (SelEx) | - | - | - | 76.4 | 61.2 | 56.9 | 64.8 |
| 仅低频对比 | ✓ | - | - | 77.5 | 63.8 | 56.3 | 65.9 |
| 仅高频对比 | - | ✓ | - | 78.8 | 63.9 | 56.8 | 66.5 |
| 仅频域分类 | - | - | ✓ | 78.0 | 62.8 | 57.1 | 66.0 |
| 双频协同 | ✓ | ✓ | - | 80.0 | 64.9 | 57.7 | 67.5 |
| 低频+分类 | ✓ | - | ✓ | 77.9 | 64.5 | 57.7 | 66.7 |
| 高频+分类 | - | ✓ | ✓ | 79.7 | 63.2 | 57.9 | 66.9 |
| 完整模型 (Full) | ✓ | ✓ | ✓ | 80.2 | 65.9 | 59.2 | 68.4 |
关键发现¶
- 单独的高频对比(\(\mathcal{L}_{\text{high}}\))对新类判别贡献尤为显著(CUB-200 Novel 单独提升至 81.9%),证实了高频纹理是细粒度新类聚类的核心推力;而低频对比(\(\mathcal{L}_{\text{low}}\))在维持已知类稳定性的同时为新类提供全局层级结构。
- 两个频段联合建模(\(\mathcal{L}_{\text{low}} + \mathcal{L}_{\text{high}}\))能够产生互补增益,平均准确率跃升至 67.5%,证明频域解耦能够有效规避空间域对比学习的特征混杂。
- 在真实未知类别数场景下(采用半监督估计,CUB 估计为 231 类、Cars 估计为 230 类),FourEx 在 CUB 上取得 77.3% All / 77.9% Novel,显著超越当前 SOTA 方法 NC-GCD(70.3% / 69.4%)。
亮点与洞察¶
- SNR 自适应临界频率推导:摆脱了以往频域方法随意选取滤波半径的经验主义缺陷,基于 15 dB 图像传输质量标准建立无监督的频域截断标准,使不同粒度与尺寸的数据集能自适应确定最优频段。
- 潜在维度的渐进解耦映射:将潜在特征向量划分为左半区(低频)与右半区(高频),并根据滤波截止频率比例动态调整参与对比的维度切片,在数学机制上强制实现了几何特征与语义层级的解耦表征。
- 即插即用的无缝兼容性:无需修改主干网络的前向架构,纯粹作为自监督表征增强代理接入已有 GCD 基线(如 SimGCD、SelEx),能无痛适配并全面提升泛化上限。
局限与展望¶
- 颜色敏感型任务受限:由于理想高通滤波在剥离低频直流分量的同时彻底去除了平滑的色彩通道信息,对于纯粹依赖颜色纹理而非几何边缘区分的细粒度物种,高通对比分支存在失效风险。
- 对遮挡与光照反射较为敏感:失败案例分析显示,高频重建容易放大局部镜面反射和反光边缘,导致误识别为同层级的相近近缘物种。
- 自适应频段划分粒度有限:目前仅采用单一低通与高通的双频切分,未来可探索连续带通小波分解,构建多尺度频谱金字塔自监督学习。
相关工作与启发¶
- vs GCD 基线 (Vaze et al., CVPR 2022 / SimGCD, ICCV 2023):传统基线直接在空间域执行实例级或参数化对比学习,在细粒度场景下受困于背景伪相关和局部过拟合;本文通过频域滤波引入显式高低频分立正交视图,从表征根源上解耦结构与细节。
- vs 层次化聚类方案 (InfoSieve, NeurIPS 2023 / SEAL, NeurIPS 2025):层次化方案通过图结构或复杂聚类树显式建模粗细关系,训练开销庞大;本文通过低频对比在隐空间内自然诱导层级约束,计算轻量且稳定性更高。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ [将傅里叶频域滤波与隐空间维度切片精巧结合于细粒度类别发现]
- 实验充分度: ⭐⭐⭐⭐⭐ [覆盖三大细粒度、长尾数据、类别数未知估计及粗粒度泛化消融]
- 写作质量: ⭐⭐⭐⭐⭐ [动机叙述逻辑紧密,信噪比推导与潜在解耦机制清晰易懂]
- 价值: ⭐⭐⭐⭐☆ [为细粒度自监督表示学习提供了极具启发性的频域解耦新范式]