跳转至

Identifiable Gated Residual Personalization for Federated Parameter-Efficient Fine-Tuning

会议: ECCV 2026
论文: ECCV 2026 Oral/Poster
代码: https://github.com/ahuang0324/fedsdg
领域: 模型压缩
关键词: 联邦参数高效微调, 个性化联邦学习, 尺度可辨识性, 动态对齐, 双分支残差适配

一句话总结

针对联邦参数高效微调中门控残差混合存在的尺度不可辨识性(Scale Non-Identifiability)问题,FedSDG 通过结构解耦的双路径 LoRA、映射级标量门控与以冻结主干为锚点的动态尺度对齐(Dynamic Alignment),在不增加跨客户端通信的前提下实现了稳定、深度可感知的可辨识个性化。

研究背景与动机

在大模型时代,利用冻结预训练骨干网络(如 Vision Transformer)进行参数高效微调(PEFT)已成为边缘设备适应下游任务的主流范式。在联邦学习(FL)场景中,各个客户端由于数据采集环境、标注偏好以及领域分布的差异,普遍面临严重的非独立同分布(Non-IID)数据异构性。如果简单地在所有客户端之间对全局共享的 LoRA 适配器进行 Federated Averaging(FedAvg)聚合,极易引发客户端漂移、聚合偏差以及负迁移;反之,若完全依赖客户端本地微调,又会因私有数据样本匮乏而陷入过拟合并丢失跨客户端的通用结构。因此,个性化联邦学习(PFL)的核心诉求是在保留可迁移共享表征的同时,支持受控的、细粒度的客户端专属自适应。

为兼顾共享知识与个性化特征,现有联邦 PEFT 方法通常采用双分支残差混合结构(如 FedDPA),由全局聚合的共享分支提供公共骨干脚手架,本地保留的私有分支学习个体偏置,二者通过门控权重进行加权混合。然而,这种加权残差混合在数学表述上存在一个长期被忽视的根本缺陷——尺度不可辨识性(Scale Non-Identifiability)。在输出端,私有残差的实际功能贡献完全取决于残差向量的模长与门控系数的标量乘积。只要将私有残差缩放 \(c\) 倍、同时将门控系数压缩 \(1/c\) 倍,模型的输出函数与任务损失就完全保持不变。由于私有分支仅在本地更新且不参与全局聚合,不同客户端在多轮非 IID 本地训练中,私有残差的模长会发生严重的不可控漂移。这导致标量门控值彻底丧失了衡量个性化强度的物理意义,基于 \(\ell_1\) 范数的门控稀疏正则化预算失效,门控梯度也极易因模长抖动而恶化优化稳定性。

针对这一核心痛点,本文提出在不对通信协议进行任何改动的前提下,必须为私有残差确立一个不受本地漂移影响的基准能量尺度。核心 idea:提出结构解耦门控框架 FedSDG,在保持全局共享与本地私有双路径 LoRA 的基础上,引入映射级标量门控,并通过以冻结骨干网络激活 RMS 统计量为锚点的动态对齐机制(Dynamic Alignment),彻底消除残差尺度自由度,使门控权重真正成为物理可辨识的个性化注入比例。

方法详解

整体框架

FedSDG 的核心思路是“共享脚手架先行、私有残差解耦校准、逐层自适应门控注入”。在网络结构上,系统以冻结的 ViT 骨干网络为基础,在每个 Transformer Block 的注意力输出映射(\(W_o\))与前馈网络输出映射(\(W_2\))处插入结构对称的全局 LoRA 分支与私有 LoRA 分支。全局 LoRA 分支在通信轮次中上传服务器进行加权聚合,而私有 LoRA 分支与逐注入点标量门控始终驻留本地。为了消除私有残差模长与门控系数之间的尺度不可辨识性,FedSDG 在门控加权之前,利用当前样本在冻结骨干网络相应位置的均方根(RMS)幅值对私有残差进行动态对齐,再以 sigmoid 标量门控调节注入强度。

整个前向计算与聚合流程如下所示:

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入特征 $h_{k,l}$"] --> B["冻结主干前向<br/>输出 $b_{k,l}$ 并提取 RMS 统计量"]
    A --> C["全局与私有双路径 LoRA<br/>生成共享残差 $g_{k,l}$ 与私有残差 $p_{k,l}$"]
    B --> D["动态尺度对齐 Dynamic Alignment<br/>以主干 RMS 锚定私有残差能量"]
    C --> D
    D --> E["映射级标量门控调制<br/>标量门控 $m_{k,l}$ 控制个性化注入比例"]
    B --> F["可辨识残差混合与前向输出<br/>$out_{k,l} = b_{k,l} + g_{k,l} + m_{k,l} \cdot p^{\text{align}}_{k,l}$"]
    C --> F
    E --> F

关键设计

1. 结构解耦的双路径 LoRA 参数化:平衡全局通用性与本地特异性

传统全参数个性化或粗粒度头层微调难以平衡表征迁移与参数开销。FedSDG 在拥有 \(L\) 个 Block 的 ViT 骨干网络中,选定自注意力输出层 \(W_o\) 与 FFN 第二投影层 \(W_2\) 共计 \(L_{\text{inj}} = 2L\) 个关键位置插入适配器。每个位置配置两个结构对称、秩均为 \(r\)、缩放系数均为 \(s_{\text{lora}} = \alpha / r\) 的低秩分支:全局分支 \(\boldsymbol{\theta}_g\) 由服务器分发并负责在客户端间协同聚合,构建可迁移的通用特征脚手架;私有分支 \(\boldsymbol{\theta}_{p,k}\) 终身驻留客户端 \(k\) 本地,专注吸收本地特有的类别或域分布偏差。双分支共享相同的内部结构,确保两者的功能差异完全源自优化目标与数据异构性,而非架构不对称引起的归纳偏差。

2. 映射级标量门控:轻量可解释的深度可感知调节

在每一处残差注入点 \(l\),客户端维护一个独立的标量门控 logit \(a_{k,l}\),经 sigmoid 函数映射为门控因子 \(m_{k,l} = \sigma(a_{k,l}) \in (0, 1)\)。该标量值在空间维度(token)和通道维度(channel)上进行广播,从而以最小的参数代价(全模型仅额外增加 \(2L\) 个标量参数)调节第 \(l\) 个投影层对私有残差的接纳程度。为了防止本地训练初期私有残差过度偏转破坏通用表征的学习,FedSDG 采用“共享脚手架优先”(shared-scaffold-first)策略,将门控 logits 负向初始化为 \(a_{\text{init}} = -3\)(此时初始门控激活 \(m_{k,l} \approx 0.047\))。同时在本地目标中施加门控 \(\ell_1\) 正则化,促使网络自动学习跨网络深度的稀疏个性化分配。

3. 主干锚定的动态对齐机制:根除尺度不可辨识性

若直接执行传统残差相加 \(b_{k,l} + g_{k,l} + m_{k,l} p_{k,l}\),则对任意缩放因子 \(c > 0\),变换对 \((c m_{k,l}, p_{k,l}/c)\) 产生完全相同的输出,使得门控大小与真实注入能量脱钩,且门控梯度 \(\frac{\partial \mathcal{L}}{\partial a_{k,l}} \propto p_{k,l}\) 会随私有残差模长剧烈晃动。FedSDG 提出动态对齐(Dynamic Alignment, DA),放弃随时变聚合而漂移的全局残差 \(g_{k,l}\),转而选取输入该层经冻结主干网络产生的确定性输出 \(b_{k,l}\) 作为永恒锚点。具体而言,算法计算样本在 token 与 channel 上的均方根幅值 \(\text{RMS}(z) = \sqrt{\frac{1}{T \cdot d_l} \sum_{t,c} z_{t,c}^2 + \epsilon}\),并执行带有截断梯度的能量重定标: $\(p^{\text{align}}_{k,l} = \frac{p_{k,l}}{\text{sg}(\text{RMS}(p_{k,l}))} \cdot \text{sg}(\text{RMS}(b_{k,l}))\)$ 经此校准后,私有残差的单位能量恒等于当前激活下主干特征的单位能量(\(\text{RMS}(p^{\text{align}}_{k,l}) = \text{RMS}(b_{k,l})\))。此时,标量门控 \(m_{k,l}\) 的物理意义严格收敛为“私有特征相对于主干特征尺度的标准注入占比”。这不仅消除了尺度自由度、赋予 \(\ell_1\) 范数 \(\|\mathbf{m}_k\|_1\) 明确的层间个性化资源预算含义,还将门控梯度的量级锁定在稳定的主干特征尺度上,显著平抑了优化抖动。

损失函数 / 训练策略

在联邦微调第 \(t\) 轮,服务器抽取子集客户端并下发当前全局参数 \(\boldsymbol{\theta}_g^t\)。客户端 \(k\) 将本地全局分支初始化为 \(\boldsymbol{\theta}_g^{(k)} \leftarrow \boldsymbol{\theta}_g^t\),并在私有数据集 \(\mathcal{D}_k\) 上联合优化全局参数 \(\boldsymbol{\theta}_g^{(k)}\)、本地私有参数 \(\boldsymbol{\theta}_{p,k}\) 以及门控参数 \(\mathbf{a}_k\),最小化复合目标函数: $\(\mathcal{L}_k = \mathcal{L}_{\text{task}}(f_k; \mathcal{D}_k) + \lambda_1 \|\mathbf{m}_k\|_1 + \lambda_2 \|\boldsymbol{\theta}_{p,k}\|_2^2\)$ 其中 \(\mathcal{L}_{\text{task}}\) 为交叉熵分类损失,\(\lambda_1\) 约束投影层级私有残差的激活稀疏性,\(\lambda_2\) 限制本地完全独立更新分支的参数容量以防过拟合。在本地完成 \(E\) 轮训练后,客户端将全局增量 \(\Delta \boldsymbol{\theta}_g^{(k)} = \boldsymbol{\theta}_g^{(k)} - \boldsymbol{\theta}_g^t\) 上传至服务器执行聚合(如 FedAvg);私有 LoRA 参数、门控 logit 以及主干统计量始终严格保留在本地设备。通信体积与标准单一全局 LoRA 联邦学习完全一致。

实验关键数据

主实验

论文基于 ImageNet-21k 预训练的 ViT-Tiny 骨干网络(24 个 LoRA 注入点,秩 \(r=8\)\(\alpha=16\)),在 CIFAR-100、Tiny-ImageNet(测试标签偏移,Dirichlet 参数 \(\alpha \in \{0.1, 0.3, 0.5, 1.0\}\))以及 Office-Home、Mini-DomainNet(测试域特征偏移)四大基准上进行系统评测。模拟设定共 100 个客户端,每轮参与率 \(C=0.1\),本地训练 \(E=5\) 个 epoch,共训练 80 轮。

下表给出了四大基准在代表性异构设置下的本地平均测试准确率对比(均值±标准差):

数据集 / 异构设置 Local-only FedAvg FedRep Ditto FA+LoRA FedDPA FedSDG (本文)
CIFAR-100 (\(\alpha=0.1\)) 65.16 (1.50) 79.22 (1.10) 86.50 (0.03) 83.75 (0.70) 71.67 (0.83) 82.88 (0.50) 88.20 (0.09)
CIFAR-100 (\(\alpha=0.3\)) 47.46 (2.15) 82.20 (0.49) 77.11 (0.78) 75.70 (1.53) 76.34 (0.95) 74.33 (0.94) 82.57 (0.38)
CIFAR-100 (\(\alpha=0.5\)) 40.17 (2.53) 83.02 (0.35) 72.48 (0.56) 72.58 (1.11) 78.16 (0.25) 71.42 (0.25) 80.81 (0.11)
CIFAR-100 (\(\alpha=1.0\)) 32.82 (2.32) 82.95 (0.83) 67.31 (1.08) 69.50 (1.67) 79.16 (0.27) 68.32 (0.65) 79.24 (0.31)
Tiny-ImageNet (\(\alpha=0.1\)) 53.75 (0.83) 71.28 (0.08) 79.23 (0.55) 77.43 (0.57) 61.46 (0.46) 73.28 (0.24) 80.63 (0.57)
Tiny-ImageNet (\(\alpha=0.3\)) 36.65 (0.24) 74.35 (0.19) 68.10 (0.27) 69.30 (0.63) 68.22 (0.32) 64.40 (0.12) 74.23 (0.05)
Office-Home (dom-0.1) 55.11 (0.99) 72.34 (0.08) 69.56 (0.64) 70.53 (0.89) 55.00 (0.38) 73.36 (0.25) 75.40 (0.46)
Office-Home (global-0.1) 50.26 (0.42) 72.81 (0.58) 66.94 (0.70) 67.48 (1.40) 55.72 (0.46) 69.11 (0.88) 75.76 (1.11)
Mini-DomainNet (dom-0.1) 48.48 (0.07) 38.36 (0.96) 58.26 (0.13) 62.02 (0.15) 23.14 (0.94) 56.74 (0.10) 62.80 (0.11)
Mini-DomainNet (global-0.1) 49.39 (0.21) 41.99 (0.18) 59.41 (0.31) 62.95 (0.07) 26.72 (0.14) 57.02 (0.27) 63.58 (0.25)
全基准平均准确率 42.13 71.67 64.56 67.48 61.95 66.56 74.27

消融实验

下表汇总了门控机制配置与动态对齐(DA)有效性的消融对比数据:

实验组别 配置说明 Tiny-ImageNet (\(\alpha=0.1\)) Office-Home (dom-0.1) 结论与机制分析
门控设计消融 固定门控 \(m=0\) (无个性化) 64.77 (0.24) 56.16 (0.57) 缺乏私有适配能力,非 IID 适应受限
固定门控 \(m=0.047\) 76.63 (0.64) 70.55 (0.39) 静态小门控优于全开,但无法按层调配
固定门控 \(m=0.5\) 44.78 (2.21) 45.98 (0.92) 固定大门控导致私有分支过拟合与冲突
固定门控 \(m=1.0\) (全个性化) 31.05 (0.45) 36.88 (0.89) 完全放开导致性能发生灾难性退化
粗粒度门控 (Block级共享) 76.57 (0.64) 70.59 (0.21) 无法区分 Attention 与 FFN 的差异化需求
初始化 \(a_{\text{init}} = 0\) (\(m=0.5\)) 52.89 (3.30) 49.17 (1.03) 早期私有残差过强扰动了全局表征学习
FedSDG 默认 (可学习映射级) 80.63 (0.57) 75.40 (0.46) 逐层自适应调节带来最强鲁棒性与精度
动态对齐消融 FedSDG w/o DA (无动态对齐) 79.32 (0.30) 68.24 (0.64)* 存在尺度不可辨识性,多轮训练模长漂移
锚定全局残差 \(\text{DA}_{\text{global}}\) 80.09 (0.43) 64.64 (1.20) 全局残差受聚合扰动,锚点自身不稳定
锚定主干 \(\text{DA}_{\text{base}}\) (默认) 80.63 (0.57) 75.40 (0.46) 冻结主干特征提供绝对稳态能量尺度参考

(注:无 DA 情况下,跨轮次门控方差显著上升,极端非 IID 条件下退化更明显。)

关键发现

  • 深度集中效应与 FFN 偏好:通过对学得的层级门控分布可视化发现,个性化注入强度呈现出极强的“深层集中”规律。浅层 Block 的门控值普遍维持在极低水平(保留通用低阶视觉表征),而在较深网络层中门控系数显著增大。此外,在深层模块中,FFN 输出层(\(W_2\))的门控激活明显高于注意力输出层(\(W_o\)),这印证了前馈层作为概念记忆网络能够更好地吸收客户端专属的语义与分类边界偏置。
  • 异构度越强,个性化收益越显著:在 CIFAR-100 极度异构(\(\alpha=0.1\))设置下,FedSDG 相比最强基线 FedRep 提升 1.7 个百分点,相比同为双分支的 FedDPA 大幅领先 5.32 个百分点。在客户端百分位数评估中(P10/P50/P90),FedSDG 在 Office-Home (dom-0.1) 的 P10(最差 10% 客户端)准确率达到 56.64%,远超 FedRep 的 48.41% 与 Ditto 的 48.98%,展现出出色的公平性与抗长尾漂移能力。
  • 主干锚定优于全局分支锚定:消融实验直接证明,试图将私有残差锚定到全局更新分支(\(\text{DA}_{\text{global}}\))在域漂移较重的数据集上表现不佳(Office-Home 下从 75.40% 骤降至 64.64%),这是因为全局分支本身因每轮客户端聚合而产生剧烈动态位移,无法充当稳定的能量基准。

亮点与洞察

  • 洞悉并形式化了参数高效微调中的尺度不可辨识性难题:论文深刻指出加权残差混合中模长与标量权重的相乘退化现象,并通过严谨的数学推导阐明了该现象对损失正则化项(\(\ell_1\) 门控稀疏与 \(\ell_2\) 权重衰减)相对平衡的破坏,填补了联邦残差个性化在理论层面的解释空白。
  • 零通信代价的动态对齐(Dynamic Alignment)技巧:利用前向传播中天然存在的冻结主干特征作为不变量参考,在不上传或同步任何额外激活的前提下完成了客户端内部的模长校准,设计极其精妙且高度工程实用。
  • “共享脚手架优先”的门控初始化法则:将门控初始值设为较深负值(\(a_{\text{init}} = -3\)),在训练初期优先让所有客户端合力构建稳固的全局通用特征,后期再渐进式释放私有分支的特异性,该策略对防止分布式训练前期的梯度发散与客户端漂移具有高度普适的借鉴意义。

局限与展望

  • 模型架构与 PEFT 形式局限:当前实验主要基于 Vision Transformer(ViT-Tiny/ViT-Base)与 LoRA 适配器,尚未验证卷积网络(CNN)、状态空间模型(Mamba)或 Prompt/Prefix Tuning、(IA)\(^3\) 等其他高效微调范式在尺度不可辨识性上的具体表现。
  • 安全与隐私防御的深层检验:虽然私有参数和特征统计量完全驻留本地,但客户端上传的全局 LoRA 梯度在理论上仍可能遭受基于逆向优化的重构攻击或成员推断攻击,未来需进一步结合差分隐私(DP)或安全多方聚合(Secure Aggregation)展开严格验证。
  • 多模态与超大语言模型拓展:未来有必要将 FedSDG 推广至跨模态 VLM(如 CLIP、LLaVA)以及端侧端到端大语言模型的分布式指令微调场景。

相关工作与启发

  • vs FedRep / FedPer: FedRep 与 FedPer 采用显式的“全局特征抽取器 + 本地私有分类头”硬划分切分模型。本文表明,仅在分类头进行个性化无法纠正深层特征空间的域偏移,且在标签空间相同的极端非 IID 设置下表现受限。FedSDG 将个性化以解耦残差的形式下沉至骨干网络的各个 Transformer Block,实现了深层表征与分类头协同自适应。
  • vs FedDPA: FedDPA 同样维持全局与私有双分支 LoRA,但直接进行加权混合,未能察觉并解决私有残差模长与门控乘积之间的尺度不可辨识性,导致本地训练中门控权重在不同轮次和不同客户端间失去可比性,在多个基准测试中落后 FedSDG 5~8 个百分点。
  • vs Ditto / pFedMe: 目标正则化方法通过在本地损失中增加接近全局参数的近端项(Proximal Term)来约束漂移,但需要频繁权衡超参数,并在高维参数空间中优化难度较大。FedSDG 直接在残差子空间内进行结构与能量解耦,优化过程更加平滑且物理意义明确。

评分

  • 新颖性: ⭐⭐⭐⭐ [首次指明联邦 PEFT 残差混合中的尺度不可辨识性,提出主干锚定的动态对齐解决方案]
  • 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 4 个主流视觉与域迁移基准,囊括多种异构切分、消融实验、机制分析与公平性分位数评估]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑严密,数学证明简洁到位,框架图与层级可视化清晰直观]
  • 价值: ⭐⭐⭐⭐ [为大规模模型在受限设备上的个性化联邦部署提供了通信经济且性能卓越的即插即用方案]