Data-Free Client Contribution Estimation via Logit Maximization for Federated Learning¶
会议: ECCV 2026
论文: ECCV 官方页面
代码: https://github.com/asimukaye/celm
领域: AI 安全
关键词: 联邦学习、贡献度评估、Logit 最大化、标签偏斜、协作公平性
一句话总结¶
针对非独立同分布(Non-IID)及标签偏斜下联邦学习客户端贡献度难以公平衡量的问题,本文提出无须原始数据、辅助验证集及自报元数据的 CELM 框架,通过服务端类别级 Logit 最大化探测构建去偏证据矩阵并归一化类别份额,实现对罕见类持有者(Mavericks)的正向激励与搭便车者(Free-riders)的高效甄别。
研究背景与动机¶
在跨组织或跨机构的联邦视觉学习系统(Cross-silo FL)中,保护本地数据隐私与合规性是首要前提。然而,现实场景中的客户端数据往往呈现高度统计异质性,表现为样本规模悬殊、类别覆盖不全以及极端的标签分布偏斜(Label Skew)。标准联邦聚合协议(如以本地样本量作为权重的经典 FedAvg)隐式假设所有样本对全局优化的贡献均质,在异质分布下极易被拥有多数类大样本的客户端主导,导致全局模型对少数类或长尾类的泛化能力急剧退化。
公平评估客户端贡献度并据此进行模型加权是解决上述矛盾的关键,但现有方案面临多重现实壁垒。依赖客户端自报元数据(如样本数、类别直方图)的加权规则容易受到恶意篡改或策略性操纵;引入服务端辅助验证集(如 CFFL、FedCE)不仅在隐私敏感场景下通常无法获取,且验证集自身的分布偏差会直接扭曲评估结果。虽然近年来涌现出基于梯度对齐的无数据评估方法(如 CGSV),但这类方法通常假设“与群体平均梯度相似即有益”(Similarity-to-average),在面对持有罕见甚至独占类别的高价值客户端(Mavericks)时,反而会因其更新方向与平均梯度冲突而将其严重打压,甚至导致少数类识别率归零。
为此,本文的切入视角是绕开参数空间中的平均相似性陷阱,直接利用深度模型参数中蕴含的类别判别表征进行逆向探查。核心 idea:将活化最大化(Activation Maximization)技术引入联邦服务端作为黑盒探测器,通过在输入空间执行类别 Logit 最大化提取客户端模型的类级判别证据,经全局基线去偏与跨客户端相对份额归一化后计算贡献度权重,并在预热期后冻结权重以兼顾聚合稳定性与轻量计算。
方法详解¶
整体框架¶
CELM(Contribution Estimation from Logit Maximization)运行于标准的联邦聚合通信循环中,整体流程划分为早期预热阶段(\(t \le T_w\))和后期冻结阶段(\(t > T_w\))。在预热阶段,服务端接收到各客户端上传的模型参数后,在服务端合成输入空间针对每个类别并行执行有正则约束的梯度上升以最大化对应类别的未归一化 Logit,提取出原始证据分数;随后以服务端前一轮全局模型的探测平均值作为无偏基线进行截断去偏,组装为客户端-类别证据矩阵;接着在类别维度做跨客户端相对份额归一化,平均后施加单纯形归一化与指数移动平均(EMA)平滑;在预热轮次结束后,冻结该贡献度权重用于后续所有通信轮次。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["客户端上传本地模型权重 $w_i^{(t)}$"] --> B["类级 Logit 最大化探测"]
B --> C["全局基线去偏与相对份额归一化"]
C --> D["Simplex 约束与 EMA 动态平滑"]
D --> E["预热解耦与权重冻结执行"]
E --> F["加权聚合生成全局模型 $w_g^{(t)}$"]
关键设计¶
1. 类级 Logit 最大化探测:以类为单位提取本地模型判别证据
针对服务端无法获取客户端私有数据且无法信任元数据的困境,CELM 将经典特征可视化中的输入优化机制转化为模型能力探针。若客户端在本地充分学习了类别 \(c\),其模型参数中必然编码了该类别的强判别模式,使得从高斯噪声初始化的合成输入能够被快速优化至极高的类 Logit 值;反之若缺乏该类数据,则无法被激发出高响应。服务端针对每个客户端模型 \(w_i^{(t)}\) 和类别 \(c \in \{1,\dots,K\}\),在输入空间求解带 \(\ell_2\) 正则的梯度上升目标: $\(x_{i,c}^{\star,(t)} = \arg\max_{x \in \mathcal{X}} s_c(x; w_i^{(t)}) - \lambda \|x\|_2^2\)$ 其中 \(s_c(x; w)\) 为模型输出的第 \(c\) 类未归一化 Logit,\(\lambda\) 用于抑制像素幅值恶性膨胀与高频伪影。将优化后的最终响应记为原始证据 \(\tilde{q}_{i,c}^{(t)} = s_c(x_{i,c}^{\star,(t)}; w_i^{(t)})\)。所有类别的探测在服务端完全并行执行,探测图像保持为抽象模式而不泄露任何私有样本语义。
2. 全局基线去偏与相对份额归一化:消除模型置信度偏移并保护罕见类
仅靠原始 Logit 难以横向比较不同客户端,原因在于不同架构或优化状态下的模型存在全局置信度校准漂移。CELM 利用上一轮聚合好的全局模型 \(w_g^{(t-1)}\) 在所有类别上的平均最大化 Logit 建立全局背景基线: $\(b^{(t-1)} = \frac{1}{K} \sum_{c=1}^K s_c(x_{g,c}^{\star,(t-1)}; w_g^{(t-1)})\)$ 通过差分并经 ReLU 抑制低于全局均值的无效响应,获得去偏证据 \(q_{i,c}^{(t)} = \max(0, \tilde{q}_{i,c}^{(t)} - b^{(t-1)})\),构成证据矩阵 \(Q^{(t)} \in \mathbb{R}^{N \times K}\)。更关键的是,为防止持有多数类大样本的客户端在绝对数值上压制稀有类客户端,CELM 在列维度(即每类内部)计算跨客户端的相对证据份额: $\(r_{i,c}^{(t)} = \frac{q_{i,c}^{(t)}}{\sum_{j=1}^N q_{j,c}^{(t)} + \epsilon}\)$ 这种设计赋予稀有类与多数类相等的权重地位:即便某个稀有类仅被单一客户端持有,该客户端在此类上的相对份额 \(r_{i,c}^{(t)} \approx 1.0\),有效杜绝了传统均值相似性算法对 Maverick 客户端的抑制。
3. Simplex 约束与 EMA 动态平滑:抑制轮次波动与方差
获得各类相对份额后,客户端瞬时原始得分为全类别平均 \(\hat{c}_i^{(t)} = \frac{1}{K} \sum_{c=1}^K r_{i,c}^{(t)}\)。为满足模型加权聚合的凸组合物理意义,对其施加概率单纯形映射 \(\bar{c}_i^{(t)} = \hat{c}_i^{(t)} / \sum_{j=1}^N \hat{c}_j^{(t)}\)。考虑到单轮 SGD 随机采样与 Logit 优化中存在的瞬态扰动,直接采用瞬时权重容易引起训练振荡。CELM 引入动量因子 \(\beta \in [0, 1)\)(默认 0.5)进行指数移动平均更新: $\(c_i^{(t)} = \beta c_i^{(t-1)} + (1 - \beta)\bar{c}_i^{(t)}\)$ EMA 平滑滤除了各客户端因本地 mini-batch 噪声导致的权重跳变,保证了聚合轨迹的平滑演进。
4. 预热解耦与权重冻结策略:平衡判别特征保留与计算开销
随着全局聚合轮次推进,各客户端参数逐渐同质化,全局先验注入会弱化客户端独有的类级判别差异,且每轮全量探测会带来持续计算开销。CELM 提出了“预热解耦+后期冻结”策略:仅在总通信轮次的前 \(5\%\)(\(T_w = 0.05 T\))执行 Logit 探测。在预热阶段,服务端下发全局 Backbone,但允许客户端保留本地分类头(Head),以此强化分类层对本地数据分布的记忆敏感度;当 \(t > T_w\) 后,贡献度权重完全冻结为 \(c_i^{(t)} = c_i^{(T_w)}\),服务端恢复下发包含分类头的完整全局模型。该机制将整个探测计算完全局限在训练初期,后续轮次计算开销直接降至与传统 FedAvg 相同。
实验关键数据¶
主实验¶
论文在 FashionMNIST(4层 MLP)、CIFAR-10(5层 CNN)以及真实临床医学皮肤镜图像数据集 FedISIC(ViT-B/16)上进行了全面评测,涵盖纯标签偏斜(PLS)、阶梯偏斜(SLS)及不同浓度参数的狄利克雷分布(Dirichlet \(\alpha \in \{0.01, 0.05, 0.10\}\))。
| 数据集 | 划分设置 | FedAvg | CFFL | CGSV | ShapFed | CELM(本文) | 相对提升/优势 |
|---|---|---|---|---|---|---|---|
| FashionMNIST | Dir. (\(\alpha=0.01\)) | \(80.64 \pm 2.25\) | \(78.89 \pm 2.93\) | \(47.40 \pm 7.82\) | \(81.15 \pm 1.83\) | 81.76 ± 1.85 | 比 ShapFed 提高 0.61% |
| Dir. (\(\alpha=0.05\)) | \(81.63 \pm 2.69\) | \(81.89 \pm 0.45\) | \(46.30 \pm 3.34\) | \(81.97 \pm 2.61\) | 83.64 ± 0.42 | 比次优提升 1.67%,方差显著降低 | |
| Dir. (\(\alpha=0.10\)) | \(84.83 \pm 0.62\) | \(84.58 \pm 0.64\) | \(63.37 \pm 3.71\) | \(85.14 \pm 0.65\) | 85.34 ± 0.09 | 表现最优且稳定性极佳 | |
| PLS | \(80.62 \pm 0.52\) | \(80.95 \pm 1.81\) | \(49.41 \pm 2.17\) | \(81.80 \pm 0.56\) | 83.70 ± 0.19 | 超越次优 ShapFed 1.90% | |
| SLS | \(83.13 \pm 2.61\) | 88.13 ± 0.35 | \(55.39 \pm 5.06\) | \(84.17 \pm 2.07\) | 87.00 ± 1.14 | 优于所有数据无依赖方法 | |
| CIFAR-10 | Dir. (\(\alpha=0.01\)) | \(63.41 \pm 1.42\) | \(53.59 \pm 6.74\) | \(18.25 \pm 6.09\) | \(63.12 \pm 1.39\) | 64.37 ± 0.98 | 显著优于所有对比基线 |
| Dir. (\(\alpha=0.05\)) | \(65.12 \pm 1.89\) | \(55.92 \pm 9.31\) | \(24.48 \pm 1.57\) | \(65.83 \pm 1.71\) | 67.16 ± 1.29 | 超越 FedAvg 2.04% | |
| Dir. (\(\alpha=0.10\)) | \(68.98 \pm 0.67\) | \(60.41 \pm 4.85\) | \(29.03 \pm 3.16\) | \(68.98 \pm 0.42\) | 69.21 ± 0.76 | 保持持续领先 | |
| PLS | \(56.82 \pm 2.96\) | \(49.93 \pm 6.28\) | \(28.75 \pm 4.92\) | \(56.80 \pm 2.80\) | 59.11 ± 1.96 | 超过 FedAvg 2.29% | |
| SLS | \(67.40 \pm 0.95\) | \(70.47 \pm 2.10\) | \(33.58 \pm 1.76\) | \(69.91 \pm 0.43\) | 71.96 ± 0.08 | 全面超越验证集依赖方法 CFFL | |
| FedISIC | 真实临床划分 | \(61.25 \pm 0.04\) | \(62.60 \pm 6.34\) | \(26.17 \pm 0.59\) | \(62.31 \pm 0.16\) | 70.18 ± 0.58 | 平衡精度大幅领先次优 +7.58% |
罕见类别客户端(Mavericks)性能与消融分析¶
为了进一步检验算法对关键长尾知识的捕获能力,论文构建了 Maverick 专门实验(部分客户端独占稀有类)以及预热比例消融。
Maverick 场景下平衡准确率与罕见类准确率对比:
| 数据集 | 评测指标 | FedAvg | CFFL | CGSV | ShapFed | CELM(本文) |
|---|---|---|---|---|---|---|
| FashionMNIST | 平衡准确率 (Balanced Acc.) | \(84.79 \pm 0.24\) | \(84.39 \pm 2.43\) | \(50.74 \pm 0.23\) | \(84.87 \pm 0.32\) | 87.32 ± 0.10 |
| 罕见类准确率 (Rare Class Acc.) | \(81.76 \pm 0.68\) | \(82.99 \pm 8.56\) | \(0.00 \pm 0.00\) | \(82.02 \pm 0.81\) | 90.77 ± 0.24 | |
| CIFAR-10 | 平衡准确率 (Balanced Acc.) | \(64.75 \pm 0.29\) | \(62.10 \pm 1.15\) | \(42.12 \pm 4.17\) | \(64.14 \pm 0.27\) | 68.60 ± 0.53 |
| 罕见类准确率 (Rare Class Acc.) | \(39.95 \pm 1.06\) | \(44.69 \pm 18.06\) | \(0.00 \pm 0.00\) | \(38.16 \pm 1.13\) | 61.21 ± 0.59 |
预热轮次比例 \(T_w/T\) 消融实验(测试准确率 %):
| 数据集 | 划分设置 | \(T_w=5\%\)(默认) | \(T_w=10\%\) | \(T_w=15\%\) | \(T_w=20\%\) | \(T_w=30\%\) |
|---|---|---|---|---|---|---|
| FashionMNIST | Dir. (\(\alpha=0.05\)) | 83.64 ± 0.42 | \(83.31 \pm 0.99\) | \(83.07 \pm 0.95\) | \(83.06 \pm 0.75\) | \(82.70 \pm 0.91\) |
| PLS | \(83.70 \pm 0.19\) | \(83.57 \pm 0.45\) | \(83.73 \pm 0.34\) | \(83.99 \pm 0.10\) | 84.14 ± 0.51 | |
| CIFAR-10 | Dir. (\(\alpha=0.05\)) | 67.16 ± 1.29 | \(66.88 \pm 1.54\) | \(66.68 \pm 1.49\) | \(66.54 \pm 1.43\) | \(66.43 \pm 1.49\) |
| PLS | \(59.11 \pm 1.96\) | \(59.03 \pm 2.32\) | \(59.36 \pm 1.42\) | \(59.44 \pm 0.95\) | 59.86 ± 0.57 |
关键发现¶
- 罕见类识别实现飞跃:在 Maverick 偏斜下,基于梯度相似度的 CGSV 彻底失效(罕见类准确率坍塌至 \(0.00\%\)),而 CELM 将 FashionMNIST 与 CIFAR-10 的罕见类精度分别大幅推高至 \(90.77\%\) 和 \(61.21\%\)(比 FedAvg 分别高出 \(+9.01\%\) 和 \(+21.26\%\)),证实了按类别相对份额打分的必要性。
- 真实异质场景鲁棒性强:在真实多中心医学数据 FedISIC 上,各类间样本极度不平衡,CELM 凭借其自适应类别证据解耦能力取得 \(70.18\%\) 的平衡准确率,以超过 \(7.5\%\) 的优势碾压依赖验证集的 CFFL。
- 预热参数具备优异鲁棒性:仅需 \(5\%\) 的极短预热期即可准确标定客户端质量,延长预热期在极度非平衡场景(PLS)有微弱增益,但在常规异质下 \(5\%\) 即可达到最优收敛平衡,极大压缩了服务端的探测算力消耗。
亮点与洞察¶
- 将特征反演巧用作零样本贡献探测器:以往活化最大化主要用于可解释性或对抗生成,本文开创性地将其作为一种非侵入式的“模型测谎仪”,从网络权重中无损逆向推断本地数据分布的类级支撑度。
- 全局参考基线抵消系统性过置信:设计了利用全局旧模型进行 Logit 均值探测的去偏机制,有效排除了深度模型在反向求导时对某些易学类的天然高置信度偏置。
- 与客户端优化算法完全解耦与正交:CELM 所有改造均集中在服务端,实验证明 CELM 可与 FedRS(受限 Softmax)等客户端算法无缝叠加,构成 CELM(RS) 并取得更优异指标。
局限与展望¶
- 服务端计算复杂度随类别数线性增加:预热期每轮需要执行 \(K \times (N+1)\) 次输入反向传播优化,当面临千类级别的大型视觉分类任务时,服务端探测显存与延迟压力较显著,未来可研究类别动态子采样策略。
- 探测精度高度受制于模型置信度校准:如果客户端模型出现严重过拟合或温度失真,Logit 幅值可能与真实类别辨识力产生非线性脱节,结合置信度校准算法(如温度缩放)是潜在的增强路径。
相关工作与启发¶
- vs FedAvg: FedAvg 依赖客户端自报的样本数权重,在存在恶意汇报、非均质样本质量或标签偏斜时严重失真;CELM 完全摆脱元数据依赖,直接按模型实际掌握的类别证据赋权。
- vs CGSV & ShapFed: CGSV 采用梯度的均值余弦相似性作为奖励,在遇到独占稀有类的 Maverick 客户端时产生严重的负向抑制;ShapFed 虽在分类层引入类级对齐,但在复杂数据分布下仍显脆弱。CELM 从输出 Logit 的判别上限出发,彻底解决了稀有类客户端被多数派抹杀的问题。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ 首次将类级 Logit 最大化探测引入联邦学习客户端贡献度评估,思路独特新颖。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖多个视觉基准、真实临床数据集、合成异质划分、Maverick 极端场景与搭便车检测,论证严密扎实。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑结构严谨清晰,数学公式与算法流程完备。
- 价值: ⭐⭐⭐⭐☆ 为跨机构隐私联邦学习中的激励机制设计与模型鲁棒聚合提供了切实可行的免验证集方案。