Hyperbolic Hierarchical Clustering for Visual Representation Learning¶
会议: ECCV 2026
论文: ECCV 2026 Poster
代码: https://github.com/weijianan1/HCFormer
领域: 语义分割
关键词: 双曲几何、分层聚类、视觉骨干网络、ClusterMixer、语义分割
一句话总结¶
针对传统视觉骨干网络黑盒化及现有聚类骨干在计算复杂度和欧氏层级表征上的缺陷,本文提出显式可解释的聚类特征混合器 ClusterMixer 与 HCFormer 架构,通过解耦的局部欧氏补丁聚类与全局双曲窗口聚类,以线性计算复杂度实现高精度与强解释性的多尺度视觉表征学习。
研究背景与动机¶
卷积神经网络(ConvNets)与视觉 Transformer(ViTs)长期占据计算机视觉骨干网络的主流地位。ConvNets 凭借局部性与平移等变性奠定了经典范式,而 ViTs 与各类 MLP-Mixer 则通过全局注意力或空间感知变换进一步提升了表征容量。然而,这些主流的特征混合器(Token Mixer)在计算过程中普遍呈现严重的黑盒特性, patch 之间的信息路由与特征重组过程极不透明,缺乏直观的物理与语义可解释性。尽管近年来 Context Cluster(CoC)和 FEC 等工作尝试引入聚类算法构建透明的特征聚合分发机制,但在真实视觉任务中的精度表现依然落后于主流卷积与注意力网络,未能在保持可解释性的同时完全释放聚类机制的潜力。
聚类特征混合机制难以走向高效通用的根本矛盾在于双重维度:一是计算复杂度的刚性约束。传统的全局聚类机制在数据点与聚类中心数量增加时呈现二次方计算爆炸,对于语义分割、目标检测等高分辨率密集预测任务,极难支撑足够密集的聚类中心数量,若强行减少聚类中心又会导致细粒度几何信息剧烈退化。二是欧氏几何度量在表征层级结构时的内在失真。传统方法普遍基于零曲率的欧氏空间计算余弦或欧氏相似度,然而视觉语义天然具备局部平坦、全局呈树状分层的结构特征;平坦的欧氏空间在嵌入层级关系时会产生严重的距离形变,使得语义层级上相隔甚远的实体在欧氏距离上呈现虚假邻近。
为了在保证轻量线性的同时精准捕捉多粒度层级语义,本文的切入角度是将特征聚合显式划分为不同几何空间下的分层交互:在局部窗口内利用欧氏空间保留细腻的平坦几何信息,在全局尺度利用双曲几何对树状层级的天然低失真嵌入能力建模抽象上下文。核心 idea:提出基于软分配的白盒聚类特征混合器 ClusterMixer,构建局部欧氏补丁聚类与全局双曲窗口聚类解耦的分层聚类架构 HCFormer,以线性复杂度协同捕捉高保真细节与树状语义层级。
方法详解¶
整体框架¶
HCFormer 整体遵循经典的多阶段分层金字塔设计(4 个 Stage),输入图像首先通过步长为 4 的 Patch Embedding 层转换为离散的特征词元序列,并在每个阶段结束时通过局部卷积下采样将词元数量减半、通道数翻倍。在每个阶段的残差块中,模型摒弃传统的自注意力或空间卷积,全面采用本文提出的 ClusterMixer 作为核心特征混合器。为了规避全局聚类带来的二次方计算复杂度并充分建模图像中的层级语义,HCFormer 在空间上将图像解耦为补丁级(Patch-level)与窗口级(Window-level)两个并行的层级聚类分支:局部补丁分支在互不重叠的局部窗口内执行欧氏空间软聚类,提取精细几何边缘;全局窗口分支将每个窗口平均池化为单一数据点,在洛伦兹双曲空间中执行全局聚类交互,以低失真捕捉跨区域的高层语义树结构。两路特征聚合后在通道维度拼接并经由全连接层与残差连接更新原始词元。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入图像与 Patch 划分<br/>生成初始词元序列"] --> B["特征分流与多粒度表达<br/>划分局部窗口与计算均值"]
B --> C["局部软聚类 ClusterMixer<br/>局部平均池化中心 + 软分配"]
B --> D["全局双曲窗口聚类<br/>映射至洛伦兹双曲流形"]
C --> E["双几何协同度量<br/>Patch 欧氏距离 + Window 洛伦兹距离"]
D --> E
E --> F["双路特征聚合与拼接更新<br/>局部高频与全局抽象语义融合"]
F --> G["多阶段分层表征输出<br/>用于分类与密集预测任务"]
关键设计¶
1. 局部软聚类 ClusterMixer:基于无参池化中心与可学习位置偏置的高效白盒混合 传统基于 K-Means 或 Sinkhorn-Knopp 的聚类算法需要多轮迭代优化,计算代价极高且难以嵌入前向反向传播体系。为解决这一痛点,ClusterMixer 将聚类中心初始化与特征分发解耦。给定输入特征序列 \(X \in \mathbb{R}^{N \times C}\),首先通过 \(K \times K\) 邻域的无参平均池化直接生成 \(M\) 个聚类中心 \(C \in \mathbb{R}^{M \times C}\),复杂度与序列长度呈完全线性。随后,针对 CoC 硬聚类中每个 patch 仅能归属单一中心导致表征容量不足的问题,ClusterMixer 采用连续软分配机制,定义 patch \(x_i\) 对聚类中心 \(c_j\) 的归属权重 \(a_{i,j}\): $\(a_i = \text{Softmax}_{c_j \in C} (\alpha \cdot D(x_i, c_j) + b_{i,j})\)$ 其中 \(D(\cdot, \cdot)\) 为几何相似度度量,\(\alpha\) 为可学习缩放因子,而 \(b_{i,j} \in B\) 是引入的可学习相对位置偏置矩阵。在特征聚合阶段,各聚类中心自适应汇聚分配给它的所有 patch 特征得到更新后的中心向量 \(c'_j = (c_j + \sum_{i=1}^N A_{i,j} x_i) / (1 + \sum_{i=1}^N A_{i,j})\),最后根据分配矩阵 \(A\) 将更新后的中心信息反向广播回各个数据点生成上下文向量 \(g_i = \sum_{j=1}^M A_{i,j} c'_j\)。这种透明的“中心池化-相似度软分配-双向汇聚广播”机制使得特征更新具备了完整的聚类语义解释性。
2. 窗口-补丁分层解耦聚类机制:将二次方复杂度降至线性的全局感受野构建 在高分辨率场景下,全图密集聚类的计算量随着 token 数量爆炸增长。若将全图 \(N\) 个 patch 与 \(M\) 个中心全量配对,分配矩阵规模达到 \(N \times M\)。为打破这一计算瓶颈,HCFormer 提出了分层解耦聚类策略。将全图划分为 \(S\) 个大小为 \(K\) 的不重叠局部窗口,聚类操作被拆解为两个解耦的层级:在补丁级聚类中,每个 patch 作为一个数据点,聚类中心直接在局部窗口内部由邻近 patch 池化生成,各个局部窗口独立并行运行 ClusterMixer,复杂度收敛为 \(S \times \frac{N}{S} \times \frac{M}{S}\);而在窗口级聚类中,每个窗口内的所有 patch 特征取均值作为代表该窗口的数据点,聚类中心则在全图全局尺度生成。相比于 Swin Transformer 依赖移位窗口(Shifted Window)在边界处产生的局限交互,分层聚类机制通过极少量的全局窗口交互(复杂度仅为窗口数与全局中心数之积)直接赋予模型全局视野,将原本 \(O(N^2)\) 的复杂度彻底转化为 \(O(N)\) 的严格线性增长。
3. 欧氏-双曲双几何特征协同度量:树状抽象层级与平坦局部几何的最优映射 不同语义层级的视觉特征对度量几何空间有着截然不同的诉求。图像局部边缘和纹理通常服从近似平坦的流形结构,欧氏几何计算简便且数值极其稳定;然而跨物体的宏观语义和场景构成天然呈现自上而下的树状分层包含关系,平坦的欧氏空间无法在低维空间内无失真地容纳指数膨胀的树分支,进而造成语义距离失真。为兼顾二者优势,HCFormer 采用双几何协同策略:在计算密集的细粒度局部补丁级聚类中,采用标准的欧氏余弦相似度 \(D_\mathbb{E}(x_\mathbb{E}, c_\mathbb{E}) = \frac{x_\mathbb{E} \cdot c_\mathbb{E}}{\|x_\mathbb{E}\| \|c_\mathbb{E}\|}\);而在计算量小且高度抽象的全局窗口级聚类中,将特征映射至负常数曲率(\(-\kappa\))的洛伦兹双曲流形 \(\mathbb{L}^n = \{x \in \mathbb{R}^{n+1} : \langle x, x \rangle_\mathbb{L} = -1/\kappa, x_{\text{time}} = \sqrt{1/\kappa + \|x_{\text{space}}\|^2}\}\)。通过切空间指数映射 \(\text{expm}_0^\kappa(v)\) 将欧氏特征投影至双曲面后,采用洛伦兹测地线距离计算语义相似度: $\(D_\mathbb{L}^\kappa(x_\mathbb{L}, c_\mathbb{L}) = \sqrt{\frac{1}{\kappa} \text{arccosh}(-\kappa \langle x_\mathbb{L}, c_\mathbb{L} \rangle_\mathbb{L})}\)$ 最终,窗口级聚合特征 \(g_W\) 在上采样匹配空间维度后,与补丁级特征 \(g_P\) 进行通道拼接,经由归一化与全连接层完成多尺度特征融合 \(x' = x + \text{FC}(\text{Norm}([g_W, g_P]))\)。双几何的解耦规避了双曲算子在高维大尺度下的数值不稳定与算力开销,同时让高层特征获得了树状几何的高保真抽象能力。
损失函数 / 训练策略¶
HCFormer 针对双曲空间计算的数值敏感性设计了专门的数值保护策略:在执行双曲指数映射前对特征范数进行严格截断,防止双曲正弦 \(\sinh\) 与双曲余弦 \(\cosh\) 计算发生数值溢出;同时可学习缩放因子 \(\alpha\) 在相似度 Logits 中自适应吸收曲率尺度的浮动。在模型训练中,图像分类采用标准的交叉熵损失函数,下游检测与分割沿用对应检测头与分割头的复合损失。分类训练基于 Timm 框架,采用 4 卡 A100 分布式训练,批大小为 256,利用 AdamW 优化器进行 310 个 epoch 的充分训练,学习率设为 1e-3 并遵循带 5 epoch 热身的余弦退火策略,结合了 Mixup、CutMix、CutOut 及 RandAugment 等数据增强策略。
实验关键数据¶
主实验¶
在 ImageNet-1K 图像分类与 ADE20K 语义分割(搭配 Semantic FPN 框架,80k 迭代训练)基准上,HCFormer 与同量级主流 ConvNet、ViT、MLP 以及最先进的聚类骨干进行了全面对比。
| 模型类别 | 骨干网络 | 参数量 (M) | FLOPs (G) | Top-1 准确率 (%) | ADE20K mIoU (%) |
|---|---|---|---|---|---|
| ConvNet | ResNet-18 | 12.0 / 15.5 | 1.8 | 69.8 | 32.9 |
| ConvNet | ResNet-50 | 26.0 / 28.5 | 4.1 | 79.8 | 36.7 |
| Transformer | PVT-Tiny | 13.2 / 17.0 | 1.9 | 75.1 | 35.7 |
| Transformer | PVT-Small | 24.5 / 28.2 | 3.8 | 79.8 | 39.8 |
| Transformer | Swin-Tiny | 29.0 / 31.9 | 4.5 | 81.3 | 41.5 |
| MLP | MLP-Mixer-B/16 | 59.0 | 12.7 | 76.4 | - |
| 聚类骨干 | CoC-Tiny | 5.3 / - | 1.0 | 71.8 | - |
| 聚类骨干 | CoC-Small (/4) | 14.0 / 17.6 | 2.6 | 77.5 | 36.6 |
| 聚类骨干 | CoC-Medium (/4) | 27.9 / 25.2 | 5.5 | 81.0 | 40.2 |
| 聚类骨干 | FEC-Small | 5.5 / 9.1 | 1.4 | 72.7 | 35.3 |
| 聚类骨干 | FEC-Base | 14.4 / 18.0 | 3.4 | 78.1 | 37.7 |
| 聚类骨干 | FEC-Large | 28.3 / 31.9 | 6.5 | 81.2 | 40.5 |
| 本文方法 | HCFormer-Nano | 5.1 / 8.8 | 0.9 | 73.0 ± 0.29 | 36.8 |
| 本文方法 | HCFormer-Tiny | 7.0 / 10.3 | 1.0 | 75.1 ± 0.14 | 37.3 |
| 本文方法 | HCFormer-Small | 16.1 / 18.9 | 2.9 | 79.8 ± 0.06 | 40.4 |
| 本文方法 | HCFormer-Medium | 33.7 / 35.7 | 6.4 | 82.4 ± 0.03 | 43.3 |
注:参数量双列分别对应 ImageNet-1K 分类任务与 ADE20K 配合 Semantic FPN 分割任务。
消融实验¶
基于 HCFormer-Tiny 对核心设计组件、空间几何选取及超参数设置进行系统性消融分析。
| 消融配置项 | 变体条件 | Top-1 准确率 (%) | ADE20K mIoU (%) | COCO APbox | COCO APmask | 说明 |
|---|---|---|---|---|---|---|
| 基线模型 | 无分层聚类 / 无双曲 / 无相对位置 | 71.9 | 35.1 | 34.3 | 32.7 | 极简平坦局部聚类基线 |
| 组件消融 | + 双曲几何 + 相对位置 (无分层) | 72.7 | 34.6 | 34.4 | 32.8 | 缺乏高效分层交互机制 |
| 组件消融 | + 分层聚类 + 相对位置 (无双曲) | 73.4 | 35.2 | 34.7 | 33.1 | 全欧氏空间下的分层聚类 |
| 组件消融 | + 分层聚类 + 双曲几何 (无相对位置) | 74.4 | 36.4 | 35.9 | 34.2 | 缺少空间先验引导 |
| 完整模型 | HCFormer-Tiny (全部核心组件) | 75.1 | 37.3 | 36.4 | 34.5 | 完整双几何分层聚类架构 |
| 几何组合 | Window 欧氏 + Patch 欧氏 | 73.4 | - | - | - | 全欧氏度量基线 |
| 几何组合 | Window 双曲 + Patch 双曲 | 74.7 | - | - | - | 全双曲计算(吞吐量暴跌至 319.2) |
| 几何组合 | Window 双曲 + Patch 欧氏 (本文) | 75.1 | - | - | - | 兼顾树状表征力与欧氏高吞吐 (536.0) |
关键发现¶
- 双几何协同解耦的最优性:消融表明将双曲几何用于全局抽象的窗口级聚类、欧氏几何用于密集的补丁级聚类是性能与算力的最佳平衡点。全欧氏聚类因缺乏树状建模能力准确率仅为 73.4%(低 1.7%);而将补丁级也换为双曲距离不仅性能微跌至 74.7%(由于局部像素空间本质近乎平坦),还会导致推理吞吐从 536.0 骤降至 319.2 img/s。
- 分层解耦显著优于 Shifted Window:在特征混合机制对比中,HCFormer 的分层聚类机制(73.4%)明显优于直接套用 Swin 样式的移位窗口机制(72.7%),证明聚类算法结合跨尺度窗口池化能够更自然地构建全图全局感受野。
- 密集预测任务增益尤为显著:在 ADE20K 语义分割中,HCFormer-Medium 达到了惊人的 43.3% mIoU,相较同量级的 CoC-Medium/4(40.2%)与 FEC-Large(40.5%)获得了接近 3 个点的飞跃,充分证明了软聚类及双曲层级特征在多尺度密集语义解析上的独特优势。
亮点与洞察¶
- 设计范式的透明与白盒化:通过将自注意力替换为无参池化中心与可解释软聚类分配,HCFormer 在完全消除传统矩阵自乘黑盒的同时,实现了与主流 ViT/ConvNet 相当乃至更优的性能。
- 双曲流形与分层视觉尺度的有机结合:敏锐地抓住了视觉表征中“宏观语义呈树状包含、微观几何呈平坦连续”的拓扑特性,用窗口级双曲几何克服了长期以来欧氏空间在树状层级表示上的几何失真。
- 即插即用的通用密集预测骨干:通过标准的分层金字塔设计与线性复杂度约束,HCFormer 无需复杂定制即可直接外接到 Mask R-CNN、Semantic FPN 等下游检测分割架构中。
局限与展望¶
- 作者承认的局限:双曲流形算子包含 \(\text{arccosh}\)、\(\cosh\) 与 \(\sinh\) 等超越函数,在当前主流硬件(如 GPU Tensor Core)上的算子级原生支持不如标准矩阵乘法成熟,全双曲运算时吞吐量下降显著。
- 潜在不足:当前网络各阶段的聚类中心比例与窗口大小仍高度依赖先验超参数设置,未能依据图像内容的动态复杂度自适应调整聚类中心数量。
- 改进方向:探索硬件友好的双曲快速逼近算子,并在更大规模无监督预训练(如自监督聚类表征学习)中验证双曲层级表征的可扩展性。
相关工作与启发¶
- vs Context Cluster (CoC): CoC 采用欧氏空间下的硬聚类机制,每个点仅归属单个中心,无法灵活扩展聚类中心数量且缺乏宏观全局上下文交互;HCFormer 引入了无参软分配机制与双几何分层聚类,大幅提升了表征容量并显著超越 CoC 的分类与分割精度。
- vs FEC (Fully Clustering): FEC 将下采样池化与特征混合全部重构为聚类过程,但全流程受制于欧氏几何的度量失真;HCFormer 在保留端到端可解释聚类的同时,首次引入双曲空间刻画高层语义树,实现了更优的精度-吞吐权衡。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次将双曲几何与分层聚类机制深度融合构建通用的可解释视觉骨干网络。
- 实验充分度: ⭐⭐⭐⭐⭐ 覆盖 ImageNet 分类、ADE20K 分割及 COCO 检测,消融与可视化详实全面。
- 写作质量: ⭐⭐⭐⭐⭐ 架构动机阐述清晰,数学建模严谨,几何直觉与实验证据契合度高。
- 价值: ⭐⭐⭐⭐⭐ 为探索超越自注意力和卷积的下一代透明可解释视觉表征架构提供了极具说服力的范例。