HASSL: Hierarchy-Aware Self-Supervised Learning Framework for Single Cell Microscopy¶
会议: ECCV 2026
论文: ECCV 2026 Poster
代码: https://github.com/tum-ai/HASSL
领域: 医学图像
关键词: 自监督学习、单细胞显微镜、层次化表征、双教师蒸馏、HDBSCAN
一句话总结¶
针对单细胞显微图像自监督学习中粗粒度成像模态掩盖细粒度形态学层次结构的问题,HASSL 提出了引入分割弱先验的双教师 DINO 蒸馏与基于 HDBSCAN 层次聚类树的稳定性加权对比损失,在 230 万单细胞图像上实现了模态解耦与形态子簇的精准对齐。
研究背景与动机¶
高通量显微成像技术在现代细胞生物学与药物研发中不可或缺,但高质量单细胞标注数据的极度匮乏迫使学术界广泛转向自监督表征学习(SSL)。基于自蒸馏的视觉骨干网络(如 DINO 系列)虽然无需负样本即可扩展至海量无标注数据,然而迁移至单细胞显微领域时却面临独特的领域瓶颈。在真实显微场景下,成像仪器设置、成像模态(如明场、荧光、相衬)以及实验批次效应通常构成主导图像低级统计特性的强信号。现有自监督算法极易走入捷径,将表征空间按模态与批次撕裂为若干粗粒度“超簇”(superclusters),从而系统性抹杀隐藏在模态内部以及跨越模态分布的细微细胞形态学特征。
这一表征偏差导致严重的核心矛盾:生物学分析本质上高度依赖细粒度的层次化语义——同一细胞类型(例如神经元或少突胶质前体细胞 OPC)在不同显微模态下外观迥异,而完全不同的细胞类型在同一模态下又往往展现高度相似的几何轮廓。当模型受模态偏差主导时,既无法在模态内细分亚型,又不能在模态间建立跨模态语义对齐,导致下游的表型分类、药物扰动响应判定(MOA)及罕见细胞状态识别性能大打折扣。传统监督式层次分类受限于极其稀缺的单细胞多级标签,而通用的层次聚类自监督方法(如硬负样本挖掘)在连续形态学渐变下往往梯度极其不稳定且收敛缓慢。
本文切入角度在于解耦形态结构与模态线索,并利用无标签数据的自然聚类结构主动诱导多级层次关系。核心 idea:利用无标注通用分割掩码作为形态学弱先验构建双教师蒸馏打破模态超簇,并结合批次内 HDBSCAN 层次聚类树提取稳定持久度加权的多分辨率正负原型,构建层次感知对比学习目标,从粗到细拉紧同祖先子簇并分离同级兄弟亚型。
方法详解¶
整体框架¶
HASSL 旨在无任何层级标签监督的前提下,让 ViT 骨干网络学到兼具模态不变性与细粒度形态敏锐度的层次化潜空间。输入为单个细胞的单模态裁剪图像,整个流程分为几何弱先验生成、双教师自蒸馏打破模态超簇、批次内凝聚聚类树构建、以及稳定性加权层次原型对比四个阶段。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["单细胞裁剪图像输入<br/>涵盖多模态与细胞亚型"] --> B["阶段1:弱先验分割图生成<br/>CellposeSAM 无监督提取形态轮廓"]
B --> C["阶段2:双教师 DINO 蒸馏<br/>图像全局教师 + 分割几何教师联合对齐"]
C --> D["阶段3:HDBSCAN 层次聚类树构建<br/>批次嵌入最小生成树与祖先-兄弟路径挖掘"]
D --> E["阶段4:稳定性加权层次原型对比<br/>基于 persistence λ 加权的铰链对比损失"]
E --> F["输出:层次感知潜空间<br/>跨模态形态对齐与模态内紧凑子簇"]
关键设计¶
1. 双教师 DINO 蒸馏:引入几何掩码先验打破模态主导的粗粒度超簇
针对模型过度拟合显微成像模态纹理、忽略细胞轮廓骨架的问题,本文通过预训练通用分割模型(CellposeSAM)预先提取单细胞二值化形态掩码,将其作为免标签泄露的弱几何先验。在自蒸馏框架中,除了维持传统 DINO 全局图像输入的 EMA 图像教师分支外,新增了一个接收图像与分割掩码的分割教师分支。两个教师均采用 Sinkhorn-Knopp 居中与锐化算法生成归一化伪概率分布目标 \(q_{\mathrm{img}}\) 与 \(q_{\mathrm{seg}}\)。学生网络(ViT-S/16)在观察不同局部与全局裁剪视图时,不仅需要拉近与图像教师全局语义的交叉熵距离,还必须最小化自身在图像视图与掩码视图上的交叉跨模态蒸馏损失。图像到分割分支与分割自监督分支强制使得来自不同模态但形态相似的同类细胞在嵌入空间中向一致的几何锚点靠拢,迈出瓦解模态壁垒的第一步。
2. 多分辨率原型挖掘:自适应提取层次祖先正例与同级兄弟负例
传统的扁平对比学习无法刻画“超类型-亚型-微状态”的生物多级结构,强行拉远或拉近会导致语义坍塌。本文在内存批次嵌入上运行基于密度的 HDBSCAN 算法构建最小生成树(MST)及凝聚聚类树(condensed tree)。对于任意非噪声锚点样本 \(i\),其从叶节点亚型追溯至根节点超簇的完整祖先路径所对应的所有聚类中心,构成了多分辨率正例原型集 \(\mathcal{P}_i = \{\mu_{c_{ik}}\}\);而所有在各级父节点直接分叉的同级子簇(即兄弟节点,Siblings)则被精确选为负例原型集 \(\mathcal{S}(i)\)。这种挖掘策略滤除了更深层子节点包含的冗余重复信息,以最小有效原型集合同时约束宏观聚类包络与微观分支决策边界。
3. 稳定性加权铰链对比损失:依据簇持久度自适应平衡层次拉伸与排斥强度
在完全无监督的树状划分中,深浅不同的聚类节点置信度截然不同;将深层稳定的形态紧凑簇与浅层模糊的过渡簇等同视之会破坏优化平衡。本文利用 HDBSCAN 密度持久度指标 \(\lambda\)(即凝聚树中节点存活的倒数尺度跨度),经过极值归一化与非线性映射得到正负权重 \(\alpha_{ik}\) 与 \(\beta_{ic}\)。对于正例,沿着叶到根路径越深、持久度 \(\lambda\) 越高的簇赋予更高权重,拉紧细胞与其确凿亚型中心的内聚力;而对于兄弟负例,则取反向持久度(\(1 - \lambda\) 归一化),确保高度分化的不同细胞类别被严格推开,而亲缘关系接近的亚型之间避免过度斥力。两项通过余弦相似度加权求和,构建铰链边际对比损失:
该损失与自蒸馏损失平滑退火组合,促使边界模糊但形态各异的细胞(如明场下的星形胶质细胞与神经元)形成清晰可辨的紧凑子簇。
损失函数 / 训练策略¶
模型采用 ViT-S/16 为骨干,预训练总计 100 轮(在 2 张 NVIDIA RTX A6000 上进行)。在优化策略上,双教师损失权重 \(\gamma\) 在整个预训练过程中从 0 线性增加至 0.2,以渐进式注入形态结构约束;HDBSCAN 层次对比损失在最后 20 轮才引入并将其有效权重退火提升至 0.1(\(\lambda=1\)),避免前期表征未成型时伪聚类结构震荡训练。其余多裁剪及优化超参严格遵循 DINOv3 规范。
实验关键数据¶
主实验¶
评估在跨越 8 种成像模态、208 个标注类别的 2.3M 单细胞基准评测集上进行。通过全局嵌入空间下的 k-NN 检索(\(K \in \{1, 3, 5, 9\}\))及归一化/调整互信息(NMI/AMI)验证聚类一致性与表征精细度。
| 方法 | Acc@1 (%) | Acc@3 (%) | Acc@5 (%) | Acc@9 (%) | mAP (%) | NMI (%) | AMI (%) |
|---|---|---|---|---|---|---|---|
| Cellpaint-DINO | 44.8 | 55.7 | 61.7 | 68.9 | 49.7 | 47.0 | 46.4 |
| ChadaViT | 46.3 | 58.1 | 71.7 | 79.4 | 52.9 | 45.2 | 44.6 |
| OpenPhenom | 45.3 | 57.1 | 63.9 | 71.9 | 50.8 | 40.3 | 39.5 |
| scDINO | 50.4 | 61.9 | 68.0 | 75.3 | 55.4 | 43.9 | 43.3 |
| HCSC* | 46.1 | 61.6 | 64.5 | 79.7 | 53.9 | 45.3 | 44.6 |
| Baseline DINOv3* | 49.4 | 64.4 | 72.1 | 80.9 | 56.5 | 46.8 | 46.2 |
| HASSL (Ours) | 50.9 | 68.0 | 75.5 | 83.5 | 57.8 | 47.9 | 47.3 |
注:加星号模型均在相同数据子集上重新对齐训练以确保公平对比。
消融实验¶
消融分析分别验证了扁平聚类(DBSCAN)、未加权 HDBSCAN、独立双教师蒸馏以及独立层次聚类损失的作用。
| 配置 | Acc@1 (%) | Acc@9 (%) | mAP (%) | NMI (%) | AMI (%) | 说明 |
|---|---|---|---|---|---|---|
| HASSL (完整模型) | 50.9 | 83.5 | 57.8 | 47.9 | 47.3 | 双教师与稳定性加权 HDBSCAN 协同 |
| w/o 双教师 (仅加权HDBSCAN) | 50.9 | 82.8 | 58.1 | 47.6 | 46.9 | 去除形态掩码指导,深层检索及簇指标微降 |
| w/o HDBSCAN (仅双教师) | 50.6 | 82.9 | 57.4 | 47.2 | 46.2 | 去除层次对比,子簇分离边界锐度下降 |
| Baseline DINOv3 + DBSCAN | 49.1 | 75.6 | 55.2 | 47.2 | 46.6 | 扁平聚类单一尺度导致微簇过度碎片化 |
| Baseline DINOv3 + 未加权HDBSCAN | 48.4 | 74.5 | 54.3 | 47.0 | 46.3 | 无稳定性权重视所有层级等同,扰乱表征空间 |
关键发现¶
- 多层次数据集表现突出:在多级层次结构数据集(深度 > 1)上,HASSL 相比 DINOv3 基线检索准确率提升了 +6.3%(K=9),而在单层扁平数据上保持无损,验证了自适应层次原型的泛化性。
- 生物学扰动任务验证卓越:在艾伦细胞科学研究所(Allen Institute)的未见药物扰动识别任务中(预测紫杉醇或布雷菲德菌素扰动),HASSL 达到 92.0% 的加权 F1 分数,超越最强对比方法 Cellpaint-DINO(81.7%)达 +7.8%,证明其捕捉亚细胞细微表型变异的能力极为优异。
- 未见数据集泛化稳健:在零样本迁移至人类蛋白质图谱(HPA)评测时,未经该模态专门微调的 HASSL 取得 54.2% 加权 F1,大幅领先 DINOv3(51.5%)并逼近专有数据训练的 Cellpaint-DINO(54.8%)。
- 计算开销极低:在 100 轮训练中,HASSL 仅增加 2.3% 的训练耗时(+43.6 分钟)与 10.2% 的显存占用(+4.44 GB),具备良好的工程落地性价比。
亮点与洞察¶
- 分割弱先验作为模态正交化的解耦器:利用无需人工标签的通用分割模型提取单细胞轮廓,以轻量蒸馏作为结构锚点,巧妙打破了不同成像模态对自监督特征的垄断性主导。
- 持久度自适应原型挖掘消除手工正负样本风险:将拓扑数据分析中的 HDBSCAN 稳定度指标 \(\lambda\) 转化为对比损失中的置信度权重,既避免了硬聚类切分导致的梯度震荡,又保留了由叶至根的多分辨率连续拓扑。
- 跨模态近邻拓扑拉近:在 t-SNE 全局特征空间中,HASSL 使得相同细胞类型的荧光簇成为明场簇的第 2 紧邻,相比 DINOv3(第 8 紧邻)和 scDINO(第 22 紧邻)展现出实质性的跨模态生物语义对齐。
局限与展望¶
- 弱先验质量的下限约束:虽然分割掩码对噪声具备容忍度,但若在严重模糊、高密度重叠或背景碎片极多的特殊成像下分割完全失效,可能会给教师分支引入虚假形态偏差。
- 批次内层次聚类的规模依赖:HDBSCAN 构建依赖单批次内单细胞采样的丰富度,当训练批次较小或类内采样极其稀疏时,估计出的凝聚树深层亚型代表性可能有所衰减。
- 通用架构与目标扩展:当前框架以 DINO 自蒸馏为骨架,未来可将基于拓扑稳定性的原型挖掘策略推广至 InfoNCE、SimCLR 或掩码图像建模(MIM)等更广泛的自监督体系。
相关工作与启发¶
- vs DINOv3 / scDINO: 传统自蒸馏模型偏向全局语义与纹理统计,极易在显微图像中按成像通道与模态聚集;HASSL 显式注入分割先验与多级树形约束,解决了表征被成像设备主导的问题。
- vs HCSC (Hierarchical Contrastive Selective Coding): HCSC 依赖于递归 k-NN 提取硬正负样本原型,在细胞形态渐变分布下采样极不稳定、收敛慢;HASSL 引入凝聚层次聚类结合持久度平滑加权,原型构建与梯度表现显著更具鲁棒性。
- vs Cellpaint-DINO / OpenPhenom: 现有单细胞基础模型侧重于针对特定荧光通道工程(如 Cell Painting 或多通道 ViT),缺乏对形态骨架本身的显式解耦机制;HASSL 在无需专有通道预设的情况下即实现跨模态泛化。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ [双教师结合几何分割弱先验与 HDBSCAN 稳定性加权层次原型的设计自然且有效]
- 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 230 万细胞、20 个数据集、跨模态检索及真实药物扰动下游任务,消融与对照全面]
- 写作质量: ⭐⭐⭐⭐⭐ [逻辑链条清晰紧凑,数学表达规范,动机与实验结论高度闭环]
- 价值: ⭐⭐⭐⭐⭐ [为显微图像与单细胞基础模型克服模态主导效应、学习生物形态层次表征提供了坚实的通用范例]