跳转至

Neural Collapse-Inspired Multi-Label Federated Learning under Label-Distribution Skew

会议: ECCV2026
论文: ECCV 原文
代码: https://github.com/CanPeng123/multi_label_fl_fednca
领域: 联邦学习
关键词: 多标签分类、标签分布偏斜、神经坍缩、等角紧框架、逐类注意力

一句话总结

FedNCA-ML 先从图像中提取逐类特征,再用各客户端共享的固定等角紧框架及正负特征正则统一表示几何,在多标签 CIFAR-10 的一个偏斜设置中将 macro-AUC 从最佳对照的 83.63 提高到 87.55,但收益并不覆盖所有微平均指标。

研究背景与动机

联邦学习让医院等客户端保留原始图像,通过交换模型参数训练一个共同模型,但数据不出本地并不意味着各方学到的特征天然一致。 一家医院可能主要接诊某几类疾病,另一家医院则几乎没有这些病例;本地优化因此偏向不同标签,参数平均也难以直接消除这种偏差。 FedAvg 提供了协作训练的基本过程,FedProx 等方法约束本地漂移,但单标签场景下有效的处理方式不能直接解决多标签特征混杂。 例如同一张胸片可同时包含心脏增大与胸腔积液,共享的图像向量既要支持多个阳性判断,也容易把常见共现关系当作某个疾病的捷径。

问题不仅是不同客户端的标签频率不同,标签之间的关系也不同。 若某医院几乎总把两个标签一起观察到,模型可能无法分别提取其证据,而另一家医院却需要区分它们。 此外,缺少某类阳性样本与该类标注未知是两种问题;本文主要研究标签分布偏斜和缺类,不是给未标注疾病生成伪标签。 作者希望得到一个覆盖全部目标类别的全局模型,而不是为每个客户端建立独立的个性化分类体系。

神经坍缩描述了平衡单标签训练后期的一种理想几何:同类特征聚集,类中心形成对称分离的结构,并与分类器方向对齐。 这里的关键障碍是,一张多标签图像不可能同时作为一个整体坍缩到多个互斥方向。 因此作者只约束解耦后的逐类特征,不强迫骨干网络的共享图像表示丢掉语义相关性。 核心 idea:用逐类注意力把多标签预测拆成可对齐的表示,再让所有客户端共享固定 ETF 参照,使局部标签偏好难以改变类别的全局几何定义。

方法详解

整体框架

每个客户端输入图像及多热标签向量,ResNet-18 提取保留空间布局的特征图。 模型用共享 ETF 中的类别向量查询图像 token,标签感知解耦模块 LADM 为每个类别生成一个特征。 这些特征分别与对应 ETF 向量做内积,再经过 sigmoid 得到各类独立概率。 训练时,双重特征正则与二元交叉熵一起更新骨干网络和注意力模块;服务器聚合可训练参数后开启下一轮。 固定 ETF 同时参与查询和分类,但不随某个客户端的局部类别频率更新,也不需要每轮估计全局类中心。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
        A["共享 ETF 参照"] -->|固定类别查询| C["标签感知解耦<br/>LADM"]
        B["本地图像<br/>骨干空间特征"] --> C
        C --> D["逐类内积<br/>sigmoid 概率"]
        A -->|固定分类器| D
        C --> E["双重特征正则"]
        A -->|原型参照| E
        Y["多热标签<br/>仅训练"] --> E
        Y --> F["BCE 与正则<br/>本地参数更新"]
        D --> F
        E --> F
        F --> G["服务器平均<br/>下一轮广播"]

图中标签和损失分支只在训练时使用,推理保留图像特征、LADM、固定分类器和 sigmoid。 一次前向传播输出全部类别的概率,不是先选择一个类别再分类,也不需要测试图像的真实标签。 服务器侧没有教师模型、文本编码器或额外的原型融合模块。

关键设计

1. 共享 ETF 参照:同时固定查询与分类的类别方向

等角紧框架(Equiangular Tight Frame,ETF)为每个类别提供一个长度相同、两两夹角相同的向量。 对于 \(C\) 个类别,本文采用单位范数的单纯形 ETF;不同向量的内积为 \(-1/(C-1)\)。 其意义不是知道哪两类疾病更相似,而是预先给予每个类别对称的几何位置,不让常见类别通过分类器权重占据更有利的方向。 该参照在各客户端完全共享,既作为 LADM 的查询来源,又作为最终分类器的权重。 与根据本地样本估计类别中心相比,它在某客户端缺类时仍然存在,也不会因该客户端的样本组成发生漂移。

固定的是 ETF 本身,并不意味着整个模型冻结:骨干网络与注意力映射仍需学习如何把视觉证据组织到这些方向。 类别之间真实的相关性可以留在共享空间特征中,后续的逐类表示才接受更强的分离约束。 因此这是神经坍缩启发的结构先验,不是证明异质、多标签训练必然满足经典神经坍缩定理。 原文式 (1) 的矩阵构造在文本提取中缺失部分运算符,这里不将修复猜测写成作者的精确公式。

2. 标签感知解耦 LADM:让每个标签从空间特征中寻找证据

如果直接把整张图像池化成一个向量,再要求它服从单标签 ETF 分类几何,多种共存语义仍挤在同一表示里。 LADM 改为把骨干特征图展平为空间 token 序列,并引入固定二维正弦余弦位置编码。 位置编码让注意力能够利用证据出现的位置,同时不给每个客户端引入不同的可学习位置参照。 随后使用 4 头交叉注意力:每类 ETF 向量提供查询,图像 token 提供键和值,为每类汇聚一个特征。 它借用了 DETR 的查询式读取方式,但查询代表类别而非目标实例,训练只需图像级标签,不需要框标注。

同一区域可以支持多个标签,因此各查询是软证据选择器,而不是互斥的空间分割。 对类别 \(c\) 的特征 \(\mathbf{h}_{ic}\),只读取它与同类原型 \(\mathbf{m}_c\) 的内积作为该标签的预测依据。 这一点也说明为什么多标签输出仍然成立:每个类别都有自己的特征,而不是让同一个向量在 softmax 中竞争唯一类别。

\[ \hat y_{ic}=\sigma(\mathbf{h}_{ic}^{\top}\mathbf{m}_c). \]

这是原文式 (9) 的逐类预测关系,类别概率之间没有总和为一的约束。 共享查询减少“同一类别在不同客户端被查询成不同含义”的风险,但仍需要注意力参数从本地训练中学会读取图像。 表 7 比较了随机可学习查询、ETF 初始化的可学习查询和固定 ETF 查询,支持固定参照的实用价值,但并非所有指标均最优。

3. 双重特征正则:分别处理错误证据与阳性聚类

二元交叉熵只直接检查每个逐类特征与其对应原型的预测是否正确。 对于一个不存在的标签,它能够压低该特征在本类方向上的响应,却未必阻止这个特征错误地指向其他类别原型。 负特征拒绝损失因此遍历真实标签为零的逐类特征,将其与所有非自身原型比较,并惩罚过高的相似响应。 筛选基于内积经过 sigmoid 后的分数,阈值设为 \(\tau=0.3\);低于阈值的配对不贡献该惩罚。 “负特征”指当前样本不存在的类别所产生的特征,不是负样本客户端,也不是需要从服务器下载的对比样本。

正特征对比损失处理真实存在的类别:让其逐类特征相对所有原型更偏向自己的原型。 作者用原型上的 softmax 比较实现该目标,从而同时鼓励类内紧凑与类间可分。 这里的 softmax 是训练正则,不能与最终多标签 sigmoid 输出混淆。 对比参照是共享的固定原型,而非跨客户端上传的样本特征,因此不需要新增数据依赖的原型传输。 两项正则解决不同漏洞:负特征不应冒充其他类别,正特征应稳定聚集到本类方向。 它们仍可能相互影响优化;表 6 中只加负正则会降低 macro-F1,不能把“互补”理解成各自独立提升全部指标。

一个完整示例

设一张胸片的真实标签包含心脏增大和胸腔积液,但不包含纤维化;这是用于解释机制的示例,不是新的实验结果。 共享骨干先提取整张图像的空间证据,LADM 的不同类别查询再分别读取相关区域。 两个阳性类别可以注意到重叠的区域,但输出两个不同的逐类特征,各自与本类原型比较。 阳性对比正则要求这两个特征分别偏向各自方向,而不是要求整张胸片特征只能代表一种病。 纤维化对应的特征仍会生成,但其真实标签为零;BCE 压低本类概率,负特征拒绝正则进一步限制它冒用其他类别方向。 换到另一家缺少纤维化阳性病例的医院时,纤维化的 ETF 参照仍然相同,但该客户端不会凭空获得缺失的阳性视觉证据。 服务器只能通过其他客户端的参数更新获得相关知识,固定几何是协调工具,不是缺失数据的替代品。

损失函数 / 训练策略

总目标沿用原文式 (14),其中 BCE 处理各标签的二元监督,另外两项分别对应负特征拒绝和阳性对比。

\[ \mathcal{L}_{\mathrm{total}}=\mathcal{L}_{\mathrm{BCE}}+\lambda_1\mathcal{L}_{\mathrm{Neg}}+\lambda_2\mathcal{L}_{\mathrm{Pos}}. \]

原文式 (12) 和式 (13) 的文本提取存在求和、对数或分母排版缺损,因此这里解释其操作含义,不补写未经核实的精确归一化形式。 实验使用 10 个客户端且每轮全部参与,共 100 轮通信,每轮本地训练 1 个 epoch。 优化器为 AdamW,batch size 为 32,初始学习率为 \(10^{-4}\),weight decay 为 0.01。 CIFAR-10 从头训练,其他数据集使用 ImageNet 预训练的 ResNet-18。 从头训练时 \(\lambda_1=1\),预训练时 \(\lambda_1=0.01\),所有实验均取 \(\lambda_2=1\)。 作者按验证集最佳表现选取检查点,每个主实验使用 3 个随机种子并报告均值和标准差。 算法 1 明列客户端参数的等权平均;正文称其采用标准 FedAvg,但没有在该伪代码中写出按样本数加权的形式。 在存在数据量偏斜时,这一区别影响复现,不应未经代码核对便默认采用样本数加权。

实验关键数据

主实验

下表摘录原文表 1–5(第 11–12 页),数值沿用百分制,误差为 3 次运行的标准差。 \(\beta\) 是 Dirichlet 浓度,\(\gamma\) 是客户端类别可见比例;更小的 \(\beta\) 表示更强的分布偏斜。 “最佳对照”仅针对该行指标选择,不意味着同一方法在其他指标也最优;增益为百分点。

数据集与设置 指标 最佳对照 FedNCA-ML 增益 来源
CIFAR-10,\(\beta=0.5,\gamma=0.5\) macro-AUC SphereFed 83.63 ± 1.50 87.55 ± 0.31 +3.92 表 1
CIFAR-10,\(\beta=0.5,\gamma=0.5\) macro-F1 FedLGT 43.60 ± 1.68 48.17 ± 1.65 +4.57 表 1
DermaMNIST,\(\beta=0.1,\gamma=0.71\) macro-F1 FedLGT 45.61 ± 1.16 50.54 ± 1.37 +4.93 表 2
VOC,\(\beta=0.01,\gamma=0.5\) macro-F1 FedLGT 56.53 ± 2.42 61.08 ± 0.10 +4.55 表 3
COCO,\(\beta=0.05,\gamma=0.75\) macro-F1 FedLGT 55.68 ± 0.83 56.28 ± 0.32 +0.60 表 4
ChestX-ray14,\(\beta=0.1,\gamma=0.5\) macro-AUC FedLGT 70.16 ± 0.37 71.28 ± 0.15 +1.12 表 5

CIFAR-10 和 DermaMNIST 的多标签版本由多张图像拼接而成,目标标签取并集;VOC、COCO 和 ChestX-ray14 则包含自然多标签图像。 ChestX-ray14 的疾病类别数为 14,“No Finding”样本作为全零疾病标签处理,训练集中占 57%,并被均匀分配给客户端。 macro 指标按类平均,更重视少数类;论文称 micro 指标为 instance-wise,但不能将其理解成每类表现同等重要。 优势存在边界:VOC 的严重偏斜设置中,本文 macro-AUC 为 93.01,低于 SCAFFOLD 的 93.41;COCO micro-F1 为 61.71,低于 FedLGT 的 62.76。

消融实验

原文表 6(第 13 页),多标签 DermaMNIST,\(\beta=0.1,\gamma=0.71\);此表未给标准差,应独立于表 2 的多次运行结果阅读。

配置 macro-AUC macro-F1 micro-AUC micro-F1
可学习分类器基线 83.95 40.69 86.68 63.03
仅固定 ETF 分类器 83.61 33.35 87.26 61.48
ETF + LADM 84.38 47.95 86.70 60.49
ETF + LADM + 负正则 84.73 45.06 89.71 62.89
ETF + LADM + 正正则 85.20 49.84 89.03 61.06
ETF + LADM + 双重正则 87.69 51.38 90.36 63.26

仅固定分类器使 macro-F1 从 40.69 降至 33.35,说明单标签几何直接套到图像级多标签特征上可能有害。 ETF + LADM 相对可学习分类器提高 7.26 个 macro-F1 百分点;在其基础上加入双重正则又提高 3.43 个百分点。 表 6 的完整模型为 87.69/51.38,而同设置表 2 主结果为 86.30/50.54;原文未充分交代两表差异,不将它们混为同一次测量。

原文表 7(第 13 页)进一步比较查询设计,仍使用相同 DermaMNIST 偏斜设置。

查询类型 初始化 macro-AUC macro-F1 micro-AUC micro-F1
可学习 随机 82.94 47.94 86.33 57.37
可学习 ETF 85.39 46.92 84.94 53.37
固定 ETF 84.38 47.95 86.70 60.49

关键发现

固定 ETF 查询在表 7 的 4 个指标中有 3 个最高,但 macro-AUC 低于 ETF 初始化的可学习查询,不宜概括为全面胜出。 表 8(第 15 页)报告 FedNCA-ML 为 12.25M 总参数、12.23M 可训练参数,FedAvg 为 11.18M。 单客户端每轮单向 FP32 通信量从 42.69 MB 增至 46.71 MB;训练和推理相对耗时分别为 1.52 倍、1.15 倍。 因此“不传输额外原型”不等于通信量不增加,新增注意力参数仍需上传。 图 3–5 提供聚类、相似度和 Grad-CAM 的定性解释,但这些可视化不能单独证明临床少数病种的诊断安全性。

亮点与洞察

  • 共享的是类别参照而不是数据统计。客户端缺类时仍保留统一坐标,避免把不可靠的本地类中心当成全局定义。
  • ETF 只约束逐类表示,保留共享骨干中的语义关联。这比强制整张多标签图像服从单标签分类几何更符合任务结构。
  • 查询与分类器使用同一组原型,把“读取什么证据”和“朝哪个方向预测”联系起来。这提供了可复用的跨客户端一致性设计。
  • 正负特征分开处理暴露了 BCE 的盲区。不过消融表明正则存在交互,移植到其他数据集时仍需验证权重与阈值。

局限与展望

  • 实验固定为 10 个客户端、全参与和 ResNet-18,未验证大规模客户端、部分参与、异步更新或不同骨干下的稳定性。
  • 两个数据集采用人工拼接构造多标签,共现关系与自然临床共病不同;自然多标签数据上的收益更能说明适用性。
  • macro-AUC 改善不直接等于罕见疾病漏诊减少,还需要逐病种灵敏度、特异度、校准及临床阈值评估。这是读者提出的验证需求。
  • 缓存中部分公式损坏,且未包含单独补充材料;精确的正则归一化、空正负集合处理和 F1 阈值不能据此完整复现。
  • 原文第 12 页称 ChestX-ray14 严重偏斜的 macro-AUC 增益为 1.21,但表 5 的 71.28 减 70.16 为 1.12;本笔记按表值保留并明确指出差异。
  • 原文第 13 页把 30.27 称为 LADM 后最低逐类 F1,但表 6 同行还存在 23.83 和 26.11;30.27 不是该行最小值,不能照抄这一结论。
  • 固定几何避免了数据依赖的原型通信,但没有提供差分隐私或抗攻击证明;数据留在本地不构成完整隐私保证。

相关工作与启发

  • 与 FedETF 相比:FedETF 面向单标签图像级对齐,本文增加逐类提取以容纳多标签共存;表 6 展示了仅固定分类器的失败风险。
  • 与 MLC-NC 相比:MLC-NC 研究集中式长尾多标签学习,本文用固定共享参照避免本地类中心偏差与额外全局原型传输。
  • 与 FedLGT 相比:FedLGT 通过标签文本和冻结 CLIP 文本嵌入保持语义一致,本文使用不依赖文本的对称几何;表 4 的微平均结果说明后者不总占优。
  • 与 FedMLP 相比:FedMLP 针对部分标注与任务异质性并使用原型辅助伪标注,本文的缺类设定不能被视作同一个问题。
  • 后续启发:可以研究保留固定全局参照、只自适应注意力读取能力的部分参与策略,但这属于延伸方向,不是本文已经验证的结果。

评分

  • 新颖性: 4/5。将共享查询、ETF 分类器与逐类多标签表示结合,针对联邦异质性提出了明确适配。
  • 实验充分度: 4/5。覆盖 5 个数据集、9 个设置和组件消融,但缺少客户端规模与参与模式扩展。
  • 写作质量: 3/5。方法动机清楚,主表与消融口径、个别算术及最小值描述仍需澄清。
  • 价值: 4/5。对偏斜多标签联邦学习有可复用的表示设计价值,同时需要正视额外开销和指标间取舍。