AnaPFL: When Closed-Form Solutions Meet Generalization and Personalization in Personalized Federated Learning¶
会议: ECCV 2026
Paper: https://eccv.ecva.net/virtual/2026/poster/4595
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/6623.pdf
领域: 优化/理论
关键词: 个性化联邦学习、解析学习、闭式解、非独立同分布、残差细化
标题按 PDF 首页恢复“Generalization and”的空格;官方清单将这两个词连写,不是不同论文。
一句话总结¶
AnaPFL 在冻结视觉特征上先解析聚合全局主分支、再为各客户端解析拟合局部残差,只需一轮聚合,在三个视觉数据集的 18 种设置下比各设置最强基线提高 1.57–16.71 个准确率百分点。
研究背景与动机¶
个性化联邦学习不仅希望让客户端借助其他参与者的数据学到通用知识,还希望最终模型符合各自的本地分布。 当不同客户端拥有不同类别比例时,本地梯度会朝不同方向更新,聚合后的模型可能既不能充分共享知识,也不能很好满足某个客户端。 FedAvg 等方法偏向学习统一模型,Ditto、FedALA、FedSelect 等方法引入个性化机制,但通常仍需要多轮本地优化与通信。 这篇论文讨论的不是所有联邦学习场景,而是已有预训练模型、特征提取器可以保持冻结的场景。
在这种条件下,解析联邦学习 AFL 用最小二乘闭式解替代迭代梯度更新,能够以一轮聚合获得全局分类器。 但消除优化路径上的偏差,不等于消除客户端对不同预测规则的需求:共享分类器面向总体数据,未必适合本地高度偏斜的类别分布。 作者在 CIFAR-100 的观察是,异质性较低时 AFL 全局模型优于本地模型,而异质性很高时,本地模型反而更好。 因此真正缺少的是既保留解析聚合、又能在聚合后修正本地预测偏差的机制,而不是继续增加全局模型的训练轮数。
AnaPFL 把共享知识与本地补偿分开处理:先求统一的全局解,再固定它求各客户端的残差解。 核心 idea:用可解析聚合的全局主分支提供共同预测,再用另一随机特征空间中的本地细化分支拟合剩余误差,让个性化不再依赖多轮梯度更新。
方法详解¶
整体框架¶
输入是多个客户端各自持有的图像及类别标签;原始图像不集中到服务器。 所有客户端使用同一个冻结骨干提取特征,论文实验采用自监督预训练的 ViT-MAE-Base,并读取 CLS token。 随后进行“双空间解析表示”“全局解析聚合”“本地残差细化”三个步骤,输出一个全局分类器及每个客户端独有的补偿分类器。 训练时主分支需要客户端与服务器通信,细化分支只在本地求解;推理时同时计算两个分支的类别得分并加权相加。 这里的“无梯度”指这套冻结骨干之后的联邦学习过程,不表示 ViT-MAE 的预训练从未使用反向传播。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["各客户端图像与标签"] --> B["冻结 ViT-MAE<br/>提取 CLS 特征"]
B --> C["双空间解析表示"]
C --> D["全局解析聚合"]
D --> E["本地残差细化"]
E --> F["全局得分加本地补偿<br/>输出个性化预测"]
原文的式 (1)–(17) 在本地全文抽取中存在明显的符号丢失,尤其是逆矩阵、加减号和正则项。 因此下文依据第 3 节可核验的文字解释目标与计算过程,不把猜测补齐的公式冒充原式;递归聚合的精确系数应查阅原 PDF。 缓存包含完整方法与实验,但没有文中另引的附录 A、B,不能据此独立复核附录中的完整证明。
关键设计¶
1. 双空间解析表示:固定表征之上仍保留非线性拟合能力
如果直接在固定 CLS 特征上拟合线性分类器,能力受限于该空间中的可分性。 AnaPFL 对同一份骨干特征分别施加随机投影与非线性激活,形成主分支特征和细化分支特征。 主分支的高斯随机投影、激活函数与骨干在客户端间共享,否则服务器收到的不同分类器就不处于同一坐标系,解析聚合也失去基础。 细化分支使用不同于主分支的随机投影;原文允许其投影和激活是客户端特有的,因为这个分支无需在全体客户端间合并。
随机投影本身不通过反向传播学习,训练对象是激活特征之后的分类权重。 这使非线性来自固定的特征映射,而待求的分类器仍是最小二乘问题,可以获得闭式解。 两条分支并不是分别复制一套可训练骨干,而是复用同一骨干输出;实验中两条分支都取 1024 维并使用 Tanh。 它们虽然激活函数相同,却因投影不同而处于不同特征空间,为后续残差补偿提供不同的拟合基底。
2. 全局解析聚合:聚合数据统计关系,而不是平均不同优化轨迹
每个客户端先用自己的主分支特征及标签求解带正则化的最小二乘分类器,并计算对应的自相关矩阵。 客户端上传的是本地分类权重与这份矩阵,而不是原始样本或一连串梯度。 服务器随后递归维护聚合自相关矩阵和融合知识矩阵,将到达客户端的信息逐个并入。 这不是简单的 FedAvg 权重平均:自相关信息描述本地特征几何,使服务器能够按解析规则恢复汇总数据所对应的分类器。 最终还要处理各客户端局部正则项累积与全局目标正则项之间的差别,得到统一的全局主分支,再将其下发。
第 3.4 节定理 1 声明,该主分支与把全部参与数据放在一起求解相同固定特征目标的最优解一致。 定理 3 进一步限定了“不受异质性影响”的含义:在完整数据集合不变、共享特征映射与目标固定时,重新划分客户端不会改变这个全局分类器。 它不意味着任意客户端准确率不变,也不意味着个性化分支不依赖自己的本地数据。 递归聚合的结果还与客户端到达顺序无关,因此可按到达顺序处理统计量;但若客户端退出造成参与数据集合变化,便不能再援引同一数据集合下的不变性。
3. 本地残差细化:保留全局预测,只补其在本地遗漏的部分
拿到全局主分支后,每个客户端先在本地训练图像上计算其类别得分,再用标签减去这份得分得到残差目标。 细化分支不是重新拟合一遍原始标签,而是在自己的随机特征空间中,用带独立正则化的最小二乘解拟合这个残差。 如此,共同知识已能解释的部分由主分支负责,本地分类器只需学习还没有解释的误差,减少从头构造私人模型对共享知识的覆盖。 求解时全局分类器保持固定,因此每个客户端的残差优化可以独立完成,不需要服务器再次聚合。
推理时同一张图像进入两个特征映射,全局得分加上由 \(\lambda\) 缩放的本地细化得分,得到最终类别预测。 原文约束 \(\lambda\in(0,1]\),越大越强调本地补偿;这是得分级残差相加,不是对两个独立概率分布做凸组合。 这种结构解释了为什么异质性较大时细化更有价值:全局目标与局部类别偏好之间留下了更多可修正的误差。 它也解释了为什么不能一律把细化强度设得很大:客户端数据很少时,本地残差估计本身可能不可靠。
损失函数 / 训练策略¶
两个阶段均采用平方误差及权重正则化,而不是交叉熵;保持最小二乘形式是能直接求解的关键。 主分支正则系数为 \(\gamma=10^{-2}\),细化分支为 \(\beta=1\),两者不需要共享同一正则强度。 第 4.1 节说明,作者随机留出训练数据的 10% 选择 \(\lambda\),不使用测试集;选定后将验证样本放回,再用完整训练数据求最终模型。 CIFAR-100、Tiny-ImageNet、ImageNet-R 最终分别使用 \(\lambda=0.5,0.3,0.2\)。 其他上述超参数是经验设置,并没有声称做过穷尽搜索。 基线也按相同验证协议选择推荐配置,梯度方法设置为 200 轮通信、每轮 3 个本地训练 epoch。
实验关键数据¶
主实验¶
第 4.1 节与表 1 使用 CIFAR-100、Tiny-ImageNet、ImageNet-R,分别划分为 50 或 100 个客户端,并设 Dirichlet 参数 \(\alpha\in\{0.1,0.5,1.0\}\)。 下表选取高异质性设置;指标均为各客户端最终模型在各自本地测试集上的平均准确率(%,越高越好),不是统一全局测试集准确率。 所有方法共享冻结 ViT-MAE-Base 骨干,因此结果只支持这个受控协议,不代表解冻骨干训练时的普遍排名。
| 数据集 | 客户端数 / \(\alpha\) | AnaPFL ↑ | 同设置最强基线 ↑ | 提升(百分点) |
|---|---|---|---|---|
| CIFAR-100 | 50 / 0.1 | 80.64 | FedALA:72.89 | +7.75 |
| CIFAR-100 | 100 / 0.1 | 79.22 | FedALA:70.63 | +8.59 |
| Tiny-ImageNet | 100 / 0.1 | 68.57 | FedALA:61.16 | +7.41 |
| ImageNet-R | 100 / 0.1 | 44.91 | FedALA:28.20 | +16.71 |
这些数值来自原文表 1;“提升”是准确率的绝对百分点差,不能改写成相对百分比增幅。 18 种组合中的最小优势为 ImageNet-R、100 客户端、\(\alpha=1.0\) 下的 1.57 个百分点,说明并非所有设置都获得两位数增益。
消融实验¶
可用正文没有给出独立的模块消融表,也没有可核验的投影共享、去细化或 \(\lambda\) 扫描数值。 以下改用表 1 的真实异质性分析:固定 CIFAR-100、50 客户端,比较三种 \(\alpha\) 下的本地测试平均准确率(%,越高越好)。 AFL 是独立基线,不能把它直接标成严格匹配的“AnaPFL 去掉细化分支”消融。
| 方法 | \(\alpha=0.1\) ↑ | \(\alpha=0.5\) ↑ | \(\alpha=1.0\) ↑ |
|---|---|---|---|
| FedALA | 72.89 | 52.60 | 46.42 |
| AFL | 56.63 | 56.78 | 56.66 |
| AnaPFL | 80.64 | 66.96 | 62.63 |
随着类别分布更均匀,FedALA 的个性化收益减弱,AFL 的结果相对稳定,而 AnaPFL 在这两端都优于它们。 这支持“全局共享与本地补偿互补”的解释,但不足以分离不同随机投影与残差目标各自贡献了多少。
关键发现¶
- 单轮并非只换取速度:第 4.3 节指出 AnaPFL 与 AFL 每客户端仅需一轮聚合,梯度基线最多运行 200 轮;在该协议下 AnaPFL 仍有更高准确率。
- 效率数字有明确边界:第 4.3 节、图 5 对 FedAvg 与 FedPCL 的代表性比较报告计算与通信开销均减少超过 99%;不是相对更快的 AFL 也减少 99%。
- 开销不是零:正文给出的量级为 100–300 秒对 45,000–66,000 秒,200–400 MB 对 20,000–40,000 MB;这些是跨比较的范围,不能随意挑端点组成某个数据集的精确比值。
- 计时包括特征提取:效率实验固定 50 客户端、\(\alpha=0.1\)、两分支 1024 维,并计入特征提取和分类器训练时间;AFL 因为没有个性化而略快。
亮点与洞察¶
- 闭式解的价值是确定聚合目标:它不只是省去优化迭代,还把“共享模型学到了什么”落到集中式固定特征目标的等价性上。必须同时记住,该保证约束的是模型解,而非所有客户端的测试表现。
- 个性化可以是残差问题:让本地模型补全全局预测,而非与全局模型竞争完整标签拟合。这个结构把两个阶段的职责区分得很清楚,也使本地求解不再触发新的通信轮次。
- 特征非线性与分类器可解性可以分离:随机映射和 Tanh 扩展表征,平方损失维持后续求解的解析形式。代价是表征不能针对任务继续学习。
局限与展望¶
- 作者明确的范围限制:本文面向预训练冻结特征上的高效个性化联邦学习,不主张替代所有能够更新表征的梯度方法;更强自监督骨干属于作者讨论的可扩展方向。
- 作者提出的效率方向:自相关矩阵与相关求解仍有开销,正文提出低秩分解或 sketching 以减少成本,但没有提供这些压缩版本的实验。
- 阅读判断:隐私并未由闭式解自动保证:不上传图像、使用自监督预训练,不等于上传统计矩阵与分类权重就具有形式化隐私保护。可用正文未给出差分隐私预算或统计量泄漏评估。
- 阅读判断:组件归因证据不足:缺少独立模块消融、随机种子误差条及更大规模客户端系统测量,尚不能确定不同投影、残差建模和超参数选择各自的稳定贡献。
- 证据边界:本地文本中的公式损坏、附录缺失限制了对递归系数及完整理论证明的复核;这里保留有正文依据的机制和实验结论,不补写未核验推导。
相关工作与启发¶
- vs AFL:AFL 建立一轮解析联邦聚合的基础,但仅提供全局模型。AnaPFL 增加解析残差细化,在保留一轮聚合的前提下适应客户端分布。
- vs FedALA / FedSelect:它们分别通过自适应局部聚合或定制参数选择实现个性化,仍依赖迭代优化。AnaPFL 把学习对象限制为固定非线性特征上的解析分类器,效率优势伴随着可学习表征范围的限制。
- vs AFCL / DeepAFL:正文将联邦持续学习和加深解析网络视为相邻方向。AnaPFL 主要回答共享与个性化如何共存,没有在本实验中验证这些方向与其组合后的效果。
评分¶
- 新颖性:4/5。把解析全局聚合与局部残差求解连接得清楚,但随机特征、最小二乘及双分支本身不是全新工具。
- 实验充分度:3/5。三个数据集和多种异质性设置覆盖较好,缺少独立组件消融及不确定性统计。
- 写作质量:4/5。动机、双分支职责及冻结特征协议交代明确,完整理论细节仍需结合附录。
- 价值:4/5。适合已有可靠冻结视觉骨干、通信轮数受限的个性化联邦分类;不能据此泛化到所有端到端联邦学习任务。