FedNASP: Federated Vision-Language Navigation with Adaptive Step-Wise Personalization¶
会议: ECCV 2026
论文: ECCV 2026 Poster
代码: https://github.com/IntelliSys-Lab/FedNASP.git
领域: 机器人 / 具身智能
关键词: 视觉语言导航, 个性化联邦学习, 具身智能, 自适应步级调制, 前缀适配器
一句话总结¶
针对家庭私有环境下多模态视觉语言导航(VLN)因跨环境异质性严重且长程轨迹决策难度动态变化而导致传统联邦聚合与静态个性化失效的问题,FedNASP 提出在全局共享主干的基础上,通过轻量级步级个性化调制器动态预测每步个性化强度,并结合结构感知的适配器前缀注入,实现了跨客户端稳健高效的自适应去中心化具身导航。
研究背景与动机¶
视觉语言导航(VLN)要求具身智能体依据自然语言指令,在复杂的真实 3D 物理场景中对第一人称视角的连续全景视觉观测进行多模态对齐并规划出正确的移动轨迹。由于室内家庭或办公环境涉及高度隐私的房屋户型、家具摆放分布以及住户起居日常等敏感信息,集中式采集并存储私有轨迹数据面临严重的合规和安全阻碍。联邦学习(FL)通过仅在各客户端与服务器之间交换模型梯度或参数更新,为保护具身智能体私有数据提供了切实可行的去中心化训练框架。然而,由于每个客户端在实际中对应完全不同的住宅或建筑,数据分布呈现极其强烈的非独立同分布(Non-IID)特性:不同房屋在空间尺度、房间拓扑结构、视觉纹理以及住户自然语言指令风格上差异悬殊。直接采用经典 FedAvg 等统一聚合算法会产生“折中”的全局策略,在任何特定客户端环境下都无法实现高精度的动作预测和目标定位。
面对这一挑战,个性化联邦学习(pFL)成为必然选择,但现有主要面向单模态分类设计的 pFL 方案在移植到 VLN 任务时普遍失效。其核心矛盾在于:VLN 是一个典型的多模态长程序列决策过程,其不确定性与决策难度在轨迹的各个时间步上是极不均匀的。现有静态个性化方法为每个客户端或整条轨迹赋予固定的个性化权重,这在长程导航中极易失衡——在进入狭长直道等环境特征显著、全局通识起主导作用的阶段,过强的个性化会破坏泛化能力并诱发过度拟合;而在面临岔路口、视线遮蔽或需要精细消除歧义的关键决策步,缺乏足够的局部适配又会导致错误累积并引发整条轨迹的溃败。与此同时,多模态网络中语言编码器、视觉感知模块与跨模态注意力融合模块对环境异质性的敏感度截然不同,粗暴地全量个性化或错误选择个性化层会破坏跨模态对齐底座并引入巨大的端侧计算与显存开销。
为了破解长程时变决策上下文与多模态网络结构敏感性交织的双重难题,智能体需要一种能够“感知自身所处决策状态与历史进度,并动态拿捏共享通识与本地个性化配比”的全新范式。核心 idea:构建步级自适应个性化联邦学习框架,利用双分支轻量级调制器在每个导航步骤动态预测个性化缩放因子,协同结构感知的注意力前缀适配器,使智能体能够在长程轨迹中按需平衡全局通用导航先验与本地自适应多模态对齐。
方法详解¶
整体框架¶
FedNASP 将每个处于独立物理建筑(Scan)中的 VLN 智能体视为一个联邦客户端。在每一轮通信中,联邦服务器维护并广播全局共享的主干网络参数 \(\Theta_g\),而各个客户端在本地维持轻量级的步级个性化调制器(SPM)、注意力前缀适配器(SPI)以及本地强化学习价值评判器(Critic)。在执行本地导航回合时,智能体根据上一时间步的轨迹历史状态与当前多视角观测特征,由 SPM 动态推理出当前步作用于各个模块的调节标量 \(\alpha_{i,j}\);随后,SPI 适配器根据各注意力模块的输入特征生成残差投影分量 \((\Delta Q, \Delta K, \Delta V)\),并在 \(\alpha_{i,j}\) 的加权缩放下注入到选定的跨模态与视觉注意力块中;最后,客户端使用模仿学习与强化学习混合损失更新本地参数,并仅将主干网络的参数更新量 \(\Delta \Theta\) 上传至服务器执行加权聚合,而所有个性化模块参数严格驻留本地。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入:历史隐藏状态 h 与当前多视角观测 O"] --> B["步级个性化调制器(SPM)<br/>双分支 MLP 预测动态标量因子 alpha"]
B --> C["结构感知前缀注入(SPI)<br/>本地适配器生成 Delta QKV 并由 alpha 缩放"]
C --> D["动作预测与局部状态更新<br/>多模态融合选定下一步动作并在本地更新 Critic"]
D --> E["双轨通信聚合<br/>仅上传共享主干 Delta Theta 进行 FedAvg,个性化参数本地保留"]
关键设计¶
1. 步级个性化调制器(SPM):按需校准长程导航中的时变决策不确定性
长程导航过程中,决策的不确定性随时间步剧烈波动。智能体在部分步骤(如直线穿过走廊)完全可依赖通用环境先验,而在另一些步骤(如在多门厅堂根据特定指示寻找特定房间)则高度依赖本地个性化视觉-语言消除歧义。针对该痛点,FedNASP 引入轻量级两分支 MLP 结构的步级个性化调制器。SPM 显式解耦并接收两路关键互补信号:表征历史决策惯性、累积轨迹记忆与指令执行进度的解码器循环隐状态 \(h_{i,j-1}\),以及捕捉当前全景局部候选视觉线索与局部歧义的观测特征向量 \(O_{i,j}\)。通过拼接状态向量 \(z_{i,j} = [h_{i,j-1}; O_{i,j}]\),SPM 为各个受调注意力块输出平滑有界的缩放向量:
其中 \(\Phi_i\) 为客户端 \(i\) 私有的轻量调制器参数,\(\mathcal{B}\) 为个性化注意力块集合,\(\sigma\) 为 Sigmoid 激活函数。这种设计避免了粗暴的二值硬切换,使智能体能够平滑、连续地调节依赖全局通识与本地个性化适配的比例,显著提升了长程轨迹 Rollout 的数值优化稳定性。
2. 结构感知前缀注入(SPI):精准赋能高敏感模块并保全多模态对齐基底
多模态 VLN 网络并非所有组件都对客户端分布漂移同等敏感。如果盲目对整个多模态网络施加个性化,不仅会导致客户端存储负担剧增,更会打碎指令文本表示的通用语义空间。通过深入的模块敏感性实验,作者发现语言编码器呈现强烈的客户端不变性,保留在全局共享效益最高;而跨模态对齐模块和视觉编码模块则是环境异质性的主导震源,且本地 Critic 评判器能够更准确地反映特定住宅的价值反馈。因此,SPI 仅针对跨模态注意力与视觉注意力中的关键块部署轻量适配器 \(\Psi_i^{(b)}\),根据块输入生成增量残差偏置:
随后利用 SPM 输出的步级因子 \(\alpha_{i,j}^{(b)}\) 动态缩放并注入原始投影矩阵:
通过低秩适配器生成增量 \(\Delta QKV\) 的前缀式注入机制,智能体在保留全局主干通用特征提取与对齐先验的同时,以低于 10% 的极小参数开销赋予了网络极强的针对性环境微调能力。
3. 隐私与通信高效的双轨联邦联合优化:本地个性化演进与全局骨干聚合
在多轮联邦通信中频繁同步个性化参数会导致巨大的信道拥堵与潜在的重构隐私泄露。FedNASP 建立了双轨训练策略:在客户端 \(i\) 的本地训练循环中,结合模仿学习损失 \(\mathcal{L}_{\mathrm{IL}}\) 与强化学习损失 \(\mathcal{L}_{\mathrm{RL}}\) 对主干参数 \(\Theta_i\)、调制器参数 \(\Phi_i\) 以及前缀适配器 \(\Psi_i\) 进行端到端联合反向传播更新。当一轮本地更新完成时,客户端将个性化参数 \((\Phi_i, \Psi_i)\) 与价值评判网络严格锁定在本地,仅计算并上传共享主干的参数漂移量 \(\Delta \Theta_i^t = \Theta_i - \Theta_g^t\)。中央服务器仅利用数据集规模加权标准执行 FedAvg 聚合。这种结构不仅在通信开销与耗时上完全等同于普通的联邦单模态更新(轮均通信耗时仅从 14.12 分钟微增至 14.37 分钟),且彻底隔绝了特定房屋私有视觉拓扑与路径记忆参数的外泄途径。
损失函数 / 训练策略¶
在本地训练阶段,每个被采样的客户端 \(i \in \mathcal{S}_t\) 采用标准混合目标函数进行优化:
其中 \(\mathcal{L}_{\text{IL}}\) 是针对专家动作标签 \(a^\star_{i,j}\) 的交叉熵监督损失,\(\mathcal{L}_{\text{RL}}\) 采用基于本地价值网络评判(Critic)的 Actor-Critic 策略梯度损失,用于增强智能体面对偏离轨迹时的自愈探索能力。全局聚合时,服务器按客户端样本量 \(|D_i|\) 进行标准加权聚合:\(\Theta_g^{t+1} \leftarrow \Theta_g^t + \sum_{i \in \mathcal{S}_t} \frac{|D_i|}{\sum_{k \in \mathcal{S}_t} |D_k|} \Delta \Theta_i^t\)。
实验关键数据¶
主实验¶
实验在单机 NVIDIA RTX 3090 GPU 上进行,客户端采样率设为 \(C = 0.2\),本地训练轮数 \(E = 3\)。REVERIE 数据集训练 400 轮,CVDN 数据集训练 2000 轮,所有指标均为 5 次独立运行的均值。
下表给出了 REVERIE 细粒度物体定位导航基准上的对比结果(均为验证集未见场景评估,数值为 %):
| 方法 (Method) | 导航成功率 (SR) ↑ | 路径加权成功率 (SPL) ↑ | 预言机成功率 (OSR) ↑ | 远距离定位成功率 (RGS) ↑ | 路径加权定位成功率 (RGSPL) ↑ | 端侧存储参数量 (Params) |
|---|---|---|---|---|---|---|
| Centralized (中心化上限) | 41.78 | 36.33 | 46.65 | 32.87 | 29.23 | – |
| FedVLN (传统FL基线) | 29.83 | 25.08 | 34.17 | 22.95 | 19.81 | 235.18M (100%) |
| pFedNavi (先验pFL) | – | – | – | – | – | 470.10M (199.9%) |
| Per-FedAvg (经典元学习pFL) | 12.51 | 11.33 | 13.76 | 5.10 | 4.71 | 235.18M (100%) |
| FedPerfix (适配器pFL) | 37.22 | 31.40 | 40.67 | 31.18 | 26.24 | 253.92M (107.9%) |
| FedNASP (本文) | 43.23 | 36.62 | 45.88 | 35.22 | 30.70 | 256.86M (109.2%) |
下表给出了多轮对话导航基准 CVDN 上的实验评估(除 NE 与 Len 外,指标均为 %):
| 方法 (Method) | 导航成功率 (SR) ↑ | 路径加权成功率 (SPL) ↑ | 导航误差 (NE) ↓ | 预言机成功率 (OSR) ↑ | 路径预言机成功率 (OPSR) ↑ | 目标逼近距离 (DER) ↑ | 轨迹长度 (Len) |
|---|---|---|---|---|---|---|---|
| Centralized (中心化上限) | 43.56 | 33.13 | 6.11 | 62.85 | 76.20 | 5.63 | 16.27 |
| FedVLN (传统FL基线) | 21.19 | 8.24 | 7.61 | 42.80 | 53.76 | 3.85 | 22.84 |
| pFedNavi (先验pFL) | 19.61 | 13.62 | 9.71 | 45.54 | 55.87 | 2.58 | 14.02 |
| Per-FedAvg (经典pFL) | 22.16 | 10.56 | 7.58 | 43.42 | 53.19 | 4.27 | 28.67 |
| FedCP (条件策略pFL) | 31.82 | 14.49 | 6.42 | 49.56 | 62.10 | 5.32 | 21.32 |
| FedNASP (本文) | 39.02 | 23.14 | 5.98 | 57.09 | 71.40 | 5.62 | 21.06 |
消融实验¶
下表展示了核心组件 SPM 与 SPI 在 REVERIE 和 CVDN 上的消融对比(除 DER 外均为 %):
| 模型变体 (Variant) | REVERIE SR ↑ | REVERIE OSR ↑ | REVERIE RGS ↑ | CVDN SR ↑ | CVDN SPL ↑ | CVDN DER ↑ | 说明 |
|---|---|---|---|---|---|---|---|
| w/o SPI (去除前缀注入) | 29.83 | 34.17 | 22.95 | 21.19 | 8.24 | 3.85 | 退化为纯全局 FedVLN,缺乏本地自适应表征 |
| w/o SPM (固定步级强度) | 39.96 | 41.20 | 30.91 | 32.40 | 16.80 | 4.23 | 移除动态调制器,采用固定强度静态个性化 |
| FedNASP (完整模型) | 43.23 | 45.88 | 35.22 | 39.02 | 23.14 | 5.62 | 动态步级调节协同结构感知前缀注入 |
此外,在 REVERIE 上采用 ViLBERT 进行的模块个性化敏感度研究(Tab. 1)表明: - 仅保留跨模态模块本地化时,SR 从全全局基线的 27.83% 跃升至 33.25%,而单纯将语言编码器本地化时性能剧烈滑落至 13.23%(过度拟合本地指令风格导致语义表征漂移); - 最佳组合为“跨模态 + 视觉 + 本地 Critic”,平均客户端 SR/SPL 达到 37.35% / 31.21%,直接印证了 SPI 针对性结构选择的有效性。
关键发现¶
- 步级调制的决定性增益:消融数据显示,若不加 SPM 调制而仅使用静态前缀适配(w/o SPM),在 REVERIE 上的 SR 下降 3.27 个百分点,而在对话更密集、步数更长的 CVDN 上 SR 骤降 6.62 个百分点(从 39.02% 降至 32.40%),表明长程导航任务中决策上下文的不均匀性必须依靠步级动态调度来解决。
- 高分支与复杂环境受益最显著:在子集异质性分析中,拓扑分支比极高(High-branch ratio)的场景下 FedNASP 相对 FedAvg 的 SR 绝对提升达 +17.89%,密集拓扑(Density)下提升 +13.76%,证明该方法在智能体遭遇高度局部歧义选择时提供了决定性的分辨能力。
- 计算与通信极致轻量:端侧参数仅增加 9.2%,通信负载保持不变,每个通信轮次的运行耗时仅增加 1.8%(14.37 分钟 vs 14.12 分钟),却超越了同类 pFL 方法甚至在 REVERIE 的 SR 上反超了中心化上限(43.23% vs 41.78%)。
亮点与洞察¶
- 抓住了具身长程决策中“不确定性在时间步上分布不均”的核心物理现实,用两分支轻量 MLP 动态输出连续缩放因子的设计极其优雅高效。
- 对多模态具身模型的模块敏感度进行了系统性的剖析,破除了“所有参数均匀个性化”的盲目性,证明了冻结通用语言表征、激活跨模态融合适配器的结构感知重要性。
- 在保证完全不额外增加信道通信传输量且不泄露本地场景私密几何信息的前提下,大幅缩小了联邦具身导航与中心化训练的性能鸿沟。
局限与展望¶
- 作者承认的局限:目前验证主要集中在离散拓扑导航图(Matterport3D 环境)与有限的多模态模型结构(ViLBERT、Seq2Seq+LSTM),尚未扩展至基于连续控制物理引擎(如 Habitat、Robo-VLN)的大规模端到端机器人操作场景。
- 潜在研究局限:SPM 依赖解码器隐藏状态 \(h_{t-1}\),当面对纯基于大型视觉语言模型(如基于大模型自注意力机制、无显式循环记忆状态的 LLM/VLM Policy)时,时序记忆建模形式需要重新适配;且若某些极端客户端本地数据极少(如仅有 1-2 条短路径),本地适配器与调制器仍存在小样本欠拟合风险。
- 未来改进方向:可进一步探索结合在线测试时自适应(Test-Time Adaptation)与全局检索式记忆库,并拓展至四足机器人或真实室内轮式底盘的真机分布式协同建图导航中。
相关工作与启发¶
- vs FedVLN [27]: FedVLN 首次将 FedAvg 引入 VLN,但采用单一全局模型聚合,导致在非同质化住宅中遭受灾难性的策略折中与漂移;FedNASP 通过引入步级个性化机制与结构适配器,在 REVERIE 上将远距离目标定位成功率绝对提高 12.27%(相对提高 53%)。
- vs pFedNavi [23]: pFedNavi 虽然探索了参数选择个性化,但参数量膨胀接近 200% 且个性化策略在轨迹内部是静态固定的;FedNASP 仅引入 9.2% 额外参数,通信零额外开销,并在步级动态调优机制下全面超越其在各基准上的表现。
- vs FedPerfix [18]: FedPerfix 是针对 ViT 图像分类的静态前缀个性化方案,无法应对多模态交叉融合与时序长程决策的不均匀性;FedNASP 针对多模态网络结构进行结构解耦,并以时空联合状态动态驱动前缀缩放。
评分¶
- 新颖性: ⭐⭐⭐⭐ [针对具身长程决策不均匀性提出步级动态个性化调制与结构感知前缀注入,思路新颖且贴合任务本质]
- 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 REVERIE、CVDN 和 R2R 多重基准,包含详尽的模块敏感度分析、异质性子集剖析与消融测试]
- 写作质量: ⭐⭐⭐⭐⭐ [动机叙述逻辑链严密,符号定义清晰,框架图与正文呼应紧密]
- 价值: ⭐⭐⭐⭐ [为家庭服务机器人私密数据联合训练与落地部署提供了极具实用价值的轻量级技术路径]