跳转至

FedDO: Dynamic Client Optimization for Adaptive Federated Learning

会议: ECCV 2026
论文: ECCV 2026
代码: https://github.com/leafuan/FedDO_code
领域: 强化学习
关键词: 联邦学习, 深度强化学习, 连续控制, 数据规模异质性, DSAC-T

一句话总结

FedDO 将联邦学习中的客户端协同建模为连续动作控制问题,利用带三重精化的分布软行动者-评论家(DSAC-T)强化学习代理动态分配各客户端的数据使用比例,并引入低秩参数化重构支持大规模扩展,有效克服了统计异质性与样本规模不平衡导致的梯度漂移。

研究背景与动机

联邦学习(FL)通过在去中心化边缘设备间协同训练模型而不暴露本地原始数据,成为保护用户隐私和满足合规要求的重要范式。然而,真实世界的联邦系统普遍面临严重的统计异质性(Statistical Heterogeneity)与规模异质性(Scale Heterogeneity)的双重夹击。一方面,客户端之间非独立同分布(Non-IID)的数据特征会导致局部优化轨迹剧烈发散,引发全局模型聚合时的严重梯度漂移(Gradient Drift);另一方面,客户端本地数据集规模往往参差不齐,在基于加权平均的聚合机制下,拥有海量数据的节点极易主导全局模型的演进方向,导致小样本节点所蕴含的关键长尾特征被淹没,造成通信轮次振荡和收敛停滞。

为了缓解异质性带来的负面效应,近期的自适应控制研究尝试引入强化学习(RL)来优化客户端调度与聚合权重。然而,现有的 RL-FL 框架大多将客户端选择简化为“选或不选”的离散二值决策(Binary Selection),忽略了每个客户端内部数据参与强度的连续可调性,难以精细平衡不同节点的贡献权重与计算开销。此外,这些方法广泛依赖在线策略(On-Policy)算法(如 PPO),样本利用率低下,需要在高通信代价的联邦环境中进行频繁且冗余的在线探索,在面对高方差奖励与非平稳噪声时极易陷入训练不稳定或早熟收敛的窘境。

本文的切入角度是:打破将客户端决策局限在离散参与度的传统思维,将客户端数据使用比例重构为连续动作空间,并由高样本效率与抗噪鲁棒的异策略(Off-Policy)分布强化学习算法进行统一闭环调度。核心 idea:将联邦客户端协同建模为细粒度连续控制问题,由 DSAC-T 代理基于客户端参数漂移与模型状态自适应分配每轮各节点的数据使用比例,并通过低秩参数化重构压制超大规模客户端下的动作空间维度膨胀。

方法详解

整体框架

FedDO 的整体工作流将联邦学习服务器抽象为一个能够持续感知系统状态并输出连续控制策略的智能体。在通信轮次 \(t\) 开始时,服务器评估全局模型状态以及各客户端相对于全局模型的参数漂移程度,构建归一化的低维状态向量并输入至 DSAC-T 策略网络;策略网络自适应输出所有客户端的连续数据使用率向量 \(a_t = \langle d_t^1, d_t^2, \ldots, d_t^K \rangle\),其中 \(d_t^k \in [0, 1]\);各客户端根据指定比例无偏抽取本地样本子集执行局部随机梯度下降更新,并将更新后的模型参数回传服务器;服务器执行加权聚合得到新一代全局模型,并根据验证集精度增量生成连续奖励信号,以此更新经验回放池中的转移样本并优化强化学习代理。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["全局模型与客户端本地更新<br/>$w_t$ 与 $\{w_t^k\}_{k=1}^K$"] --> B["状态构建与低秩映射<br/>参数漂移 $o_t^k = \|w_t^k - w_t\|$"]
    B --> C["连续数据使用率分配<br/>动态输出采样比例 $d_t^k \in [0, 1]$"]
    C --> D["客户端子集采样与局部训练<br/>$|\mathcal{S}_t^k| = d_t^k |\mathcal{D}_k|$"]
    D --> E["模型加权聚合与验证评估<br/>更新 $w_{t+1}$ 并计算精度增量"]
    E --> F["分布软行动者-评论家决策代理<br/>DSAC-T 价值分布学习与策略优化"]
    F -.->|指导下一轮动作生成| B

关键设计

1. 连续数据使用率分配:细粒度平衡统计代表性与局部梯度漂移

针对离散客户端选择无法调节节点局部贡献强度、容易加剧数据规模失衡的问题,FedDO 将每个客户端 \(k\) 在通信轮次 \(t\) 的数据采样比例 \(d_t^k \in [0, 1]\) 定义为连续控制动作。对于持有本地私有数据集 \(\mathcal{D}_k\) 的客户端,实际参与局部训练的子集 \(\mathcal{S}_t^k \subseteq \mathcal{D}_k\) 满足无偏随机采样,其样本量严格遵循连续分配指令。仅有 \(d_t^k > 0\) 的客户端构成该轮的活跃集合 \(\mathcal{K}_t\)。服务器端的聚合目标与参数更新机制表示为:

\[w_{t+1} = \sum_{k \in \mathcal{K}_t} \frac{|\mathcal{S}_t^k|}{|\mathcal{S}_t|} w_t^k, \quad \text{其中 } \mathcal{S}_t = \bigcup_{k \in \mathcal{K}_t} \mathcal{S}_t^k\]

这种连续动作设计实现了多维度的弹性调节:在极端 Non-IID 环境下,代理倾向于精简活跃客户端数量并赋予其更高的单轮数据使用率,以减少发散客户端间的梯度冲突;在数据同质分布时,代理则倾向于调度更多客户端并分配较低的数据使用比例,以极低的局部计算与通信开销实现更广泛的样本覆盖。

2. 分布软行动者-评论家决策代理:消除异策略估计偏差与非平稳噪声

为了解决传统强化学习在联邦场景下样本效率低下且难以适应随机非平稳奖励的痛点,FedDO 引入了集成三重精化机制的分布软行动者-评论家算法(DSAC-T)。DSAC-T 的双 Critic 网络显式估计完整的回报分布 \(Z_{\theta_i}(s, a) \sim \mathcal{N}(Q_{\theta_i}(s, a), \sigma^2_{\theta_i}(s, a))\),不仅输出期望 Q 值,还捕捉了由于客户端随机掉线和分布漂移引起的不确定性 \(\sigma^2\)。在生成目标价值时,通过选取期望较小的 Critic 提供目标,并利用期望值替换与方差感知截断消除过乐观估计:

\[y_{\min}^q = r_t + \gamma \left( Q_{\bar{\theta}_{\bar{i}}}(s_{t+1}, a_{t+1}) - \alpha \log \pi_{\bar{\psi}}(a_{t+1} | s_{t+1}) \right)\]
\[y_{\min}^z = r_t + \gamma \left( Z_{\bar{\theta}_{\bar{i}}}(s_{t+1}, a_{t+1}) - \alpha \log \pi_{\bar{\psi}}(a_{t+1} | s_{t+1}) \right)\]

其中下标 \(\bar{i} = \arg\min_{i=1,2} Q_{\bar{\theta}_i}(s_{t+1}, a_{t+1})\)。Critic 网络在最小化分布 Bellman 误差时引入方差归一化权重 \(\omega_i = \mathbb{E}_{\mathcal{B}}[\sigma_{\theta_i}^2]\),使价值网络的更新尺度自适应对齐回报方差,从根本上消除了奖励尺度基数对算法收敛稳定性的干扰。

3. 低秩参数化重构:化解大规模节点下的动作空间维度灾难

在真实的大规模联邦网络中,客户端数量 \(K\) 常达到数百乃至数千量级。由于 Actor 网络的输出维度与 Critic 网络的输入维度均正比于 \(K\),全连接层参数规模将随节点数线性膨胀,导致策略网络训练负担急剧增加甚至发生梯度爆炸。FedDO 针对这一可扩展性瓶颈提出了低秩参数化重构技术。在不破坏 DSAC-T 核心框架的前提下,对高维状态输入采用低秩投影降维,对高维连续动作映射采用低秩矩阵分解进行因式分解。低秩约束在轻微牺牲冗余自由度的前提下,将智能体参数量削减了 20% 至 52% 以上,确保了算法从百级节点顺畅扩展至千级节点时的计算可行性与收敛稳定性。

损失函数 / 训练策略

DSAC-T 智能体的训练目标采用最大熵强化学习框架,鼓励策略在追求高累积回报的同时保持动作探索的多样性:

\[J(\pi_\psi) = \mathbb{E}_{\pi_\psi} \left[ \sum_{t=0}^T \gamma^t \left( r_t + \alpha \mathcal{H}(\pi_\psi(\cdot | s_t)) \right) \right]\]

Critic 网络采用方差加权的分布 KL 散度损失函数进行优化:

\[J_{\mathcal{Z}}^{\text{scale}}(\theta_i) = \omega_i \, \mathbb{E}_{(s, a) \sim \mathcal{B}} \left[ D_{\text{KL}}\left( C(y_z^{\min}; b) \,\Vert\, Z_{\theta_i}(s, a) \right) \right]\]

其中截断边界 \(C(y_z^{\min}; b) = \text{clip}(y_z^{\min}, Q_{\theta_i} - b, Q_{\theta_i} + b)\) 基于滑动方差 \(b = \xi \mathbb{E}_{\mathcal{B}}[\sigma_{\theta_i}]\) 控制更新波动。Actor 网络则最大化双 Critic 的悲观保守估计项:

\[J_\pi(\psi) = \mathbb{E}_{(s, a) \sim \mathcal{B}} \left[ \min_{i=1,2} Q_{\theta_i}(s, a) - \alpha \log \pi_\psi(a | s) \right]\]

服务器根据在验证集上的精度增量计算奖励信号,采用非对称指数缩放设计(\(\Xi = 64\)):

\[r_t = \begin{cases} \Xi^{(\phi_t - \phi_{t-1})}, & \phi_t \ge \phi_{t-1} \\ -\Xi^{(\phi_{t-1} - \phi_t)}, & \phi_t < \phi_{t-1} \end{cases}\]

实验关键数据

主实验

在由 100 个客户端构成的标准联邦系统下,对比涵盖聚合优化(FedAvg)、对比学习(MOON)、启发式调度(Oort)、Logit 校准(FedLC)、蒸馏(FedNTD)、跨模型协作(FedCross)以及基于离散强化学习聚合的基线(FedAA)。不同异质性设置通过狄利克雷分布 \(\text{Dir}(\alpha)\) 控制,\(\alpha=0.1\) 表示极强的数据偏斜,\(\alpha=0.5\) 表示中等偏斜,IID 为均匀分布。

表 1: 不同模型与数据分布划分下的 Top-1 测试精度对比 (%)

模型 数据集 异质性设置 FedAvg MOON Oort FedLC FedNTD FedCross FedAA FedDO (本文)
CNN FashionMNIST \(\alpha=0.1\) 83.66 ± 1.49 74.00 ± 10.10 84.29 ± 0.60 82.96 ± 1.83 83.78 ± 1.32 84.75 ± 0.31 75.53 ± 1.86 87.49 ± 0.07
FashionMNIST \(\alpha=0.5\) 83.52 ± 2.76 80.48 ± 1.95 82.99 ± 1.67 83.48 ± 2.31 84.53 ± 1.22 84.57 ± 0.69 76.58 ± 1.48 97.34 ± 0.01
FashionMNIST IID 90.80 ± 0.20 90.77 ± 0.14 91.06 ± 0.09 90.16 ± 0.21 90.74 ± 0.23 89.35 ± 0.03 89.88 ± 0.03 90.99 ± 0.02
CIFAR-10 \(\alpha=0.1\) 66.56 ± 0.72 46.19 ± 3.81 70.78 ± 0.27 67.83 ± 0.08 59.51 ± 0.43 55.68 ± 1.27 50.76 ± 0.10 71.36 ± 0.10
CIFAR-10 \(\alpha=0.5\) 56.88 ± 4.60 46.89 ± 4.04 34.08 ± 3.26 56.23 ± 1.93 59.52 ± 0.69 63.28 ± 0.67 43.39 ± 2.11 89.70 ± 0.05
CIFAR-10 IID 64.31 ± 0.06 62.76 ± 0.24 63.98 ± 0.09 64.51 ± 0.15 66.13 ± 0.07 59.25 ± 0.07 57.10 ± 0.05 67.03 ± 0.08
CIFAR-100 \(\alpha=0.1\) 28.92 ± 0.06 26.41 ± 0.35 25.71 ± 0.32 27.98 ± 0.18 28.93 ± 0.12 49.81 ± 0.05 20.22 ± 0.21 50.14 ± 0.15
CIFAR-100 \(\alpha=0.5\) 26.65 ± 0.18 24.82 ± 0.47 25.17 ± 0.53 27.02 ± 0.32 27.86 ± 0.19 50.92 ± 0.06 19.12 ± 0.23 53.44 ± 0.21
CIFAR-100 IID 23.44 ± 0.16 22.50 ± 0.15 22.88 ± 0.16 24.29 ± 0.03 25.91 ± 0.06 31.44 ± 0.03 19.61 ± 0.06 32.39 ± 0.14
TinyImageNet \(\alpha=0.1\) 12.01 ± 0.18 10.69 ± 0.43 12.49 ± 0.05 11.96 ± 0.15 14.44 ± 0.06 12.98 ± 0.02 9.47 ± 0.10 32.45 ± 0.04
TinyImageNet \(\alpha=0.5\) 11.81 ± 0.13 10.11 ± 0.39 11.94 ± 0.18 12.98 ± 0.03 14.57 ± 0.05 13.54 ± 0.05 9.42 ± 0.13 33.17 ± 0.16
TinyImageNet IID 10.81 ± 0.08 8.85 ± 0.09 10.22 ± 0.13 10.52 ± 0.03 6.50 ± 0.08 8.21 ± 0.05 6.54 ± 0.05 12.59 ± 0.04
ResNet-18 FashionMNIST \(\alpha=0.1\) 95.30 ± 0.32 80.87 ± 3.79 65.34 ± 2.01 95.79 ± 0.22 83.51 ± 0.77 94.90 ± 0.02 67.87 ± 0.61 97.68 ± 0.03
FashionMNIST \(\alpha=0.5\) 95.83 ± 0.07 82.35 ± 4.39 63.85 ± 0.42 96.26 ± 0.16 87.28 ± 1.21 95.34 ± 0.04 72.21 ± 0.58 97.69 ± 0.01
FashionMNIST IID 90.69 ± 0.09 90.61 ± 0.06 92.11 ± 0.03 90.77 ± 0.05 91.10 ± 0.10 88.23 ± 0.04 91.00 ± 0.06 92.11 ± 0.03
CIFAR-10 \(\alpha=0.1\) 55.75 ± 4.16 54.18 ± 1.27 59.25 ± 0.25 66.42 ± 0.04 53.54 ± 1.19 82.50 ± 0.17 42.89 ± 1.92 83.24 ± 0.10
CIFAR-10 \(\alpha=0.5\) 87.08 ± 0.36 65.92 ± 4.89 22.75 ± 4.48 69.99 ± 3.44 72.79 ± 2.86 85.27 ± 0.46 54.09 ± 0.61 88.26 ± 0.10
CIFAR-10 IID 66.07 ± 0.13 67.03 ± 0.08 66.24 ± 0.21 68.19 ± 0.06 68.38 ± 0.13 75.06 ± 0.03 57.70 ± 0.33 77.03 ± 0.08
CIFAR-100 \(\alpha=0.1\) 23.89 ± 0.29 24.22 ± 0.20 23.48 ± 0.26 27.62 ± 0.25 27.30 ± 0.14 26.25 ± 0.09 19.20 ± 0.16 31.65 ± 0.04
CIFAR-100 \(\alpha=0.5\) 19.74 ± 0.59 22.09 ± 0.45 24.09 ± 0.34 19.83 ± 0.88 20.65 ± 0.50 17.15 ± 0.11 19.16 ± 0.15 26.61 ± 0.20
CIFAR-100 IID 32.37 ± 0.32 31.32 ± 0.09 33.21 ± 0.06 33.08 ± 0.05 36.03 ± 0.10 32.65 ± 0.06 27.65 ± 0.14 37.87 ± 0.01
TinyImageNet \(\alpha=0.1\) 11.11 ± 0.15 11.90 ± 0.11 11.34 ± 0.10 10.84 ± 0.27 18.49 ± 0.13 13.89 ± 0.06 8.30 ± 0.07 22.02 ± 0.23
TinyImageNet \(\alpha=0.5\) 10.42 ± 0.05 12.36 ± 0.09 11.01 ± 0.16 20.47 ± 0.02 15.17 ± 0.49 30.48 ± 0.10 8.12 ± 0.07 31.22 ± 0.11
TinyImageNet IID 17.15 ± 0.07 15.54 ± 0.10 15.82 ± 0.12 18.29 ± 0.05 19.73 ± 0.17 16.65 ± 0.10 8.95 ± 0.12 20.01 ± 0.06
VGG-11 FashionMNIST \(\alpha=0.1\) 77.96 ± 1.38 40.52 ± 4.52 38.05 ± 1.57 74.84 ± 4.29 76.11 ± 1.60 74.06 ± 0.09 60.17 ± 2.16 90.65 ± 0.02
FashionMNIST \(\alpha=0.5\) 72.29 ± 2.11 55.08 ± 1.94 40.20 ± 2.24 81.81 ± 2.47 72.53 ± 3.94 74.13 ± 0.36 51.92 ± 1.56 94.63 ± 0.01
FashionMNIST IID 91.11 ± 0.06 90.79 ± 0.10 92.06 ± 0.17 91.00 ± 0.05 90.60 ± 0.04 89.67 ± 0.03 89.40 ± 0.21 92.49 ± 0.05
CIFAR-10 \(\alpha=0.1\) 75.11 ± 1.77 69.58 ± 2.66 64.44 ± 0.59 88.55 ± 0.03 76.72 ± 0.54 71.90 ± 0.36 46.05 ± 1.95 81.76 ± 0.08
CIFAR-10 \(\alpha=0.5\) 78.67 ± 1.30 35.74 ± 3.24 14.66 ± 2.96 76.28 ± 2.15 65.05 ± 1.54 71.75 ± 0.11 29.38 ± 1.53 90.35 ± 0.14
CIFAR-10 IID 78.54 ± 0.20 79.69 ± 0.19 80.27 ± 0.29 78.73 ± 0.30 81.80 ± 0.10 73.06 ± 0.04 69.35 ± 0.25 82.37 ± 0.07
CIFAR-100 \(\alpha=0.1\) 31.37 ± 0.20 22.07 ± 0.52 12.98 ± 0.61 27.27 ± 0.35 22.55 ± 0.30 47.15 ± 0.09 11.29 ± 0.59 61.92 ± 0.15
CIFAR-100 \(\alpha=0.5\) 26.86 ± 0.07 24.66 ± 0.33 12.89 ± 0.42 26.78 ± 0.15 27.87 ± 0.19 46.12 ± 0.10 9.19 ± 1.48 61.34 ± 0.09
CIFAR-100 IID 44.18 ± 0.12 35.18 ± 0.24 37.30 ± 0.38 37.71 ± 0.66 40.91 ± 0.55 38.85 ± 0.15 27.98 ± 0.27 44.84 ± 0.06
TinyImageNet \(\alpha=0.1\) 6.92 ± 0.54 10.41 ± 0.12 3.75 ± 0.23 6.62 ± 0.34 5.97 ± 0.41 11.61 ± 0.17 5.91 ± 0.05 14.73 ± 0.09
TinyImageNet \(\alpha=0.5\) 6.55 ± 0.36 8.35 ± 0.22 4.14 ± 0.22 7.02 ± 0.21 6.62 ± 0.24 13.91 ± 0.06 4.13 ± 0.22 15.10 ± 0.29
TinyImageNet IID 21.85 ± 0.19 20.28 ± 0.64 13.27 ± 0.34 18.93 ± 0.55 19.24 ± 0.46 18.71 ± 0.12 7.62 ± 0.50 24.14 ± 0.07

消融实验与扩展性分析

表 2: CIFAR-10 上使用 ResNet-18 达到目标精度所需的通信轮次 \(R\) 与最终精度 (Acc, %)

方法 \(\text{Dir}(0.1)\) 轮数与精度 (目标 71.4%) \(\text{Dir}(0.5)\) 轮数与精度 (目标 87.6%) \(\text{IID}\) 轮数与精度 (目标 66.6%) 说明
FedAvg (>1000, 55.7) (784, 87.7) (>1000, 66.2) 极端异质下发散,中等偏斜需 784 轮
MOON (>1000, 14.5) (>1000, 37.3) (773, 67.1) 非 IID 条件下对比正则化收敛极为缓慢
Oort (>1000, 59.35) (>1000, 24.1) (>1000, 66.4) 仅靠离散探索-利用无法克服梯度偏移
FedLC (>1000, 66.42) (>1000, 71.7) (639, 68.1) 校准 logits 有一定收益但仍未达高目标
FedNTD (>1000, 54.6) (>1000, 73.9) (625, 68.0) 蒸馏开销大且高异质下未能达标
FedCross (729, 82.4) (>1000, 85.7) (821, 75.0) 跨模型协作收敛较稳但通信轮次偏高
FedAA (>1000, 42.1) (>1000, 54.7) (>1000, 57.1) 离散强化学习动作在高维下探索困难
FedDO (本文) (344, 71.5) (429, 87.8) (476, 67.4) 通信轮次缩减 50% 以上,全场景达标

注:表格中 > 表示在上限 1000 轮通信内未达到指定目标精度,括号内第二项记录其达到的最高精度。

表 3: FashionMNIST 上 VGG-11 模型下低秩参数化重构对智能体参数量与精度的影响

客户端规模 \(K\) 原始架构精度 (Acc, %) 原始架构参数量 (Para) 低秩重构精度 (Acc, %) 低秩重构参数量 (Para) 参数量压缩比
100 90.62 0.93M 90.29 0.74M ↓ 20.4%
500 91.03 2.26M 89.27 1.28M ↓ 43.4%
1000 89.78 3.96M 89.55 1.95M ↓ 50.8%
2000 88.51 7.25M 85.96 3.47M ↓ 52.1%

关键发现

  • 收敛速度实现成倍跃升:在极度非 IID 的 \(\text{Dir}(0.1)\) 设置下,绝大多数基准算法在 1000 轮通信内均无法达到预定目标精度,而 FedDO 仅用 344 轮即告达标,比唯一达标的基准 FedCross 快 2.1 倍以上,同时实现了更高的最终分类准确率。
  • 动态行为自适应演进规律:实验揭示了 DSAC-T 策略学习到的关键调度机制——在强异质性(\(\text{Dir}(0.1)\))环境下,智能体会自动收缩每轮活跃客户端的数量(平均稳定在 20-25 个节点左右),并为其分配更高的单节点数据使用率(约 0.8-0.9),以保证局部更新的统计纯度与充分度;而在 IID 或弱偏斜环境下,智能体则调度更多客户端(超过 50 个节点)但赋予较低的数据使用率(约 0.4-0.5),实现计算与通信的高效权衡。
  • 高维扩展性与轻量化兼备:如表 3 所示,当客户端规模扩展到 2000 节点时,未重构的策略网络参数规模达 7.25M,而低秩参数化因式分解将其压缩至 3.47M(削减 52.1%),测试准确率仅产生微弱的 2.55% 波动,彻底打破了强化学习应用于大规模横向联邦系统的计算与内存瓶颈。

亮点与洞察

  • 从离散硬截断到连续软调节:传统方法将客户端选择当作二值开关,而 FedDO 揭示了单节点内部“使用多少数据”这一隐式控制杠杆能够有效平滑非 IID 样本诱发的局部曲率抖动,以极度平滑的连续动作替代了剧烈振荡的二值采样。
  • 分布强化学习的天然适配性:联邦学习的通信反馈本质上伴随严重的网络随机延迟与模型演化非平稳性。DSAC-T 的双 Critic 显式建模回报分布方差,并通过方差感知截断消除过乐观估计,使强化学习在非受控联邦环境下依然能保持稳健收敛。
  • 低秩重构打通千级节点瓶颈:通过对策略输入输出映射施加低秩分解,将参数量增长复杂度与客户端规模解耦,为大模型联邦训练或大规模跨设备联邦调度提供了极具启发性的工程范式。

局限与展望

  • 离线策略预训练成本:DSAC-T 代理在正式部署前需要在目标数据集或预设模拟环境下经历 200 个回合的完整离线强化学习训练周期。尽管这一成本可被多次在线部署均摊,但在全新的未见数据分布上仍需探索零样本跨任务泛化能力。
  • 同步联邦设定的假设:目前框架仍基于同步通信轮次,尚未全面考量真实边缘设备中极为普遍的落后者(Straggler)与非确定性掉线问题。未来工作可进一步将动态数据使用率与异步联邦学习(Asynchronous FL)及差分隐私(DP)机制深度结合。

相关工作与启发

  • vs FedAvg & FedProx: FedAvg 采用无差别或全量加权平均,在统计异质下产生严重漂移;FedProx 引入近端正则项约束局部步长,但无法动态调配数据源。FedDO 从源头动态控制客户端输入数据量,消除了不一致梯度对全局聚合的污染。
  • vs Oort: Oort 依据局部损失方差与系统能力执行离散探索-利用客户端筛选。FedDO 则进一步细化到连续的数据使用率分配,并在深层异构场景下显著优于静态启发式规则。
  • vs FedAA: FedAA 同样利用强化学习调整聚合权重与客户端选择,但依赖离散动作且采用较简陋的价值估计。FedDO 通过 DSAC-T 的连续分布控制与低秩参数化,在准确率、收敛速度和扩展性上全面超越 FedAA。

评分

  • 新颖性: ⭐⭐⭐⭐☆ [突破离散选择定势,将连续数据使用率与分布 RL 及低秩扩展有机融合]
  • 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 4 个主流视觉基准、3 种网络架构、3 种异质性分布及千级节点扩展性实验]
  • 写作质量: ⭐⭐⭐⭐⭐ [动机叙述逻辑清晰,问题建模严密,理论设计与实证发现紧密闭环]
  • 价值: ⭐⭐⭐⭐☆ [为现实世界异构联邦学习系统提供了切实可行的自适应优化与节点资源调度方案]