跳转至

LGD-Net: Leader-Guided Cross-Modal Dynamics for Hyperspectral and Panchromatic Image Fusion

会议: ECCV 2026
论文: ECCV 原文
领域: 遥感
关键词: 高光谱全色融合, 连续动力系统, 跨模态交互, 图传播, 神经ODE

一句话总结

LGD-Net 提出了一种将全局跨模态交互与局部多尺度重建显式解耦的高光谱全色融合框架,通过紧凑 Leader 表征驱动的连续动力系统与差异感知图传播,在不增加网络深度的情况下实现高保真光谱与空间结构重建。

研究背景与动机

高光谱遥感成像能够在数百个连续波段上捕捉丰富的地表光谱反射特征,广泛应用于资源勘探、环境监测与精准农业等领域。然而,受制于传感器物理成像孔径与信噪比权衡,高光谱卫星往往只能提供较低的空间分辨率(LRHS)。为了兼顾空间几何细节与连续光谱特性,高光谱与高分辨率全色图像融合(Pansharpening)成为从 LRHS 观测与高分辨率单波段全色图(PAN)中重建高分辨率高光谱图像(HRHS)的核心途径。

近年来,以卷积神经网络、Transformer 以及混合结构为主的深度学习融合方案取得了显著进展。然而,现有主流方法普遍依赖多层堆叠的网络架构,在每个特征处理阶段同时进行局部空间纹理精细化与全局跨模态特征交互。在这种堆叠范式下,全色信息的注入强度与全局交互范围被隐式地绑定在网络层数与深度上——若想强化全局跨模态交互,通常需要堆叠更深的网络或引入参数沉重的注意力模块,但这不可避免地会同步加深局部特征的非线性变换,极易在平坦地物区域引入过度纹理或导致局部光谱畸变。网络深度这一单一结构参数同时统治了全局交互与局部重建,使模型难以针对不同地物区域灵活调节空间增强与光谱保真的配比。

针对这一本质瓶颈,LGD-Net 的切入角度是打破全局交互与网络深度的硬耦合。本文提出不再依靠增加网络层级去传递全局跨模态信息,而是先从各模态多尺度特征中提炼出紧凑的全局「Leader」表征,仅让 Leader 状态在一个连续时间的动态系统(ODE)中进行多步演化以完成跨模态深度交互,随后将精炼后的 Leader 作为全局引导调制多尺度局部特征节点,从而使局部重建与全局交互各司其职。核心 idea:将全局跨模态交互与局部多尺度重建显式解耦,构建模态 Leader 表征并通过可控连续动力系统完成跨模态状态演化,再残差调制多尺度图节点与坐标解码,实现高效且受控的谱空融合。

方法详解

整体框架

LGD-Net 接收低分辨率高光谱图像 \(\mathbf{X}_{\text{HS}} \in \mathbb{R}^{C_{\text{in}} \times h \times w}\) 与高分辨率全色图像 \(\mathbf{X}_{\text{PAN}} \in \mathbb{R}^{1 \times H \times W}\) 作为输入(其中空间倍率 \(r = H/h = W/w\)),旨在重构高质量的高分辨率高光谱图像 \(\widehat{\mathbf{X}} \in \mathbb{R}^{C_{\text{in}} \times H \times W}\)。整体流水线分为四个阶段:门控金字塔特征编码、尺度间差异感知图传播、紧凑 Leader 连续跨模态动力学演化,以及 Leader 引导特征调制与坐标条件解码。

整体架构的处理流向与模块协作如下流程图所示:

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入: LRHS 与 PAN 图像"] --> B["门控金字塔编码<br/>空洞深度卷积与双向多尺度金字塔"]
    B --> C["差异感知图传播<br/>相邻尺度间残差门控传播与结构对齐"]
    C --> D["连续跨模态动力学<br/>双线性交互与二阶 Runge-Kutta 状态演化"]
    D --> E["Leader 引导特征调制与解码<br/>多尺度残差注入与坐标条件卷积重建"]
    E --> F["输出: HRHS 重构图像"]

关键设计

1. 差异感知图传播:基于相邻尺度残差门控的模态内结构对齐

在由门控空洞深度卷积金字塔提取得到多尺度特征节点后,各尺度的特征在层级上依然相对孤立。若直接将不同分辨率的特征强行混合,容易模糊精细边缘或稀释粗尺度的丰富上下文。LGD-Net 将多尺度特征视作图节点,在模态内构建相邻尺度间的差异感知残差更新机制,使高层语义指导与低层边缘纹理在模态内完成平滑一致性聚合。

具体而言,对每个模态 \(m \in \{\text{HS}, \text{PAN}\}\),将多尺度节点双线性上采样对齐至全色分辨率后,相邻尺度 \(s\)\(s-1\) 之间的特征更新不仅依赖线性投影,更由通道维度的自适应差异门控 \(\mathbf{g}_m^{(s)}\) 进行动态缩放:

\[\widetilde{\mathbf{f}}_m^{(s)} = \mathbf{f}_m^{(s)} + \mathbf{g}_m^{(s)} \odot \phi(\mathbf{f}_m^{(s-1)})\]

其中 \(\phi(\cdot)\)\(1 \times 1\) 线性对齐投影。门控权重 \(\mathbf{g}_m^{(s)}\) 通过评估相邻尺度的局部结构差异产生:

\[\mathbf{g}_m^{(s)} = \sigma\left(\mathcal{N}\left(\psi(\mathbf{f}_m^{(s)} - \mathbf{f}_m^{(s-1)})\right)\right)\]

式中 \(\psi(\cdot)\) 为深度空间滤波与逐点卷积,\(\mathcal{N}(\cdot)\) 为通道 Group Normalization,\(\sigma(\cdot)\) 为 Sigmoid 激活函数。当两层尺度间的结构差异极小时,门控值趋于稳定平衡状态,避免对平滑区域施加过度校正;而当边缘或纹理出现较大偏差时,门控自适应增大残差流,使多尺度节点在保持局部光谱和空间特异性的同时实现结构对齐。

2. 连续跨模态动力学:解耦网络深度的 Leader 状态连续演化

传统堆叠模型若要强化全局跨模态信息交互,必须纵向增加网络层深,这导致局部卷积变换与全局交互被捆绑。为了打破这一限制,LGD-Net 先将模态内精炼后的多尺度特征拼接并压缩,提炼出紧凑的全局 Leader 状态向量 \(\mathbf{L}_m \in \mathbb{R}^{C \times H \times W}\)\(m \in \{\text{HS}, \text{PAN}\}\))。随后,多尺度局部节点被冻结在当前状态,仅让两个紧凑的 Leader 在一个连续时间动态系统(Neural ODE)中协同演化。

在连续动力学演化中,为兼顾互补信息的线性和高阶相关性,首先构建双线性跨模态交互项:

\[\begin{cases} \mathbf{Z}_{\text{HS}}^{(t)} = \mathbf{L}_{\text{PAN}}^{(t)} + \mathbf{L}_{\text{HS}}^{(t)} \odot \mathbf{L}_{\text{PAN}}^{(t)} + \mathbf{D}_{\text{PAN}}(\mathbf{L}_{\text{PAN}}^{(t)}) \\ \mathbf{Z}_{\text{PAN}}^{(t)} = \mathbf{L}_{\text{HS}}^{(t)} + \mathbf{L}_{\text{HS}}^{(t)} \odot \mathbf{L}_{\text{PAN}}^{(t)} + \mathbf{D}_{\text{HS}}(\mathbf{L}_{\text{HS}}^{(t)}) \end{cases}\]

其中 \(\mathbf{D}_m(\cdot)\) 为深度空间滤波。交互特征经动态投影矩阵映射为速度场 \(\mathbf{F}_m^{(t)}\),并由跨通道共享的动态空间门控 \(\boldsymbol{\gamma}^{(t)} = \sigma(\mathcal{G}([\mathbf{L}_{\text{HS}}^{(t)}, \mathbf{L}_{\text{PAN}}^{(t)}]))\) 调控空间信息流。连续时间演化方程定义为:

\[\frac{d\mathbf{L}_m}{dt} = \boldsymbol{\gamma}^{(t)} \odot \mathbf{F}_m^{(t)}\]

模型采用二阶龙格-库塔法(Runge-Kutta 2nd Order, RK2)进行稳定且计算轻量的数值积分,步长由可学习的有界标量 \(\eta = \Delta t \cdot s\) 自适应调整。仅需 \(T=2\) 次微小的动态步进,即可在全局 Leader 层面充分完成深层次跨模态上下文整合,既保证了长程跨模态建模能力,又完全免去了深层特征网络的庞大计算开销。

3. Leader 引导特征调制与解码:全局反馈注入与连续坐标重建

经过连续动力系统演化后的高光谱 Leader \(\mathbf{L}_{\text{HS}}^{(T)}\) 汇聚了全局空间与光谱增强信息,随后通过残差反馈回传至局部高光谱多尺度节点 \(\widetilde{\mathbf{f}}_{\text{HS}}^{(s)}\),实现自顶向下的精细化调制:

\[\widehat{\mathbf{f}}_{\text{HS}}^{(s)} = \widetilde{\mathbf{f}}_{\text{HS}}^{(s)} + \boldsymbol{\beta} \odot \mathcal{R}(\mathbf{L}_{\text{HS}}^{(T)})\]

其中 \(\mathcal{R}(\cdot)\)\(3 \times 3\) 线性投影层,\(\boldsymbol{\beta} \in (0, 1)^{1 \times H \times W}\) 为由最终 Leader 自适应计算得到的有界空间门控图,严格约束注入幅度以确保多尺度特征层级的数值稳定性。

受调控后的多尺度节点再次聚合生成强化全局特征 \(\mathbf{L}_{\text{HS}}^\star\)。鉴于常规卷积解码器具有天然的平移不变性,无法显式感知全局绝对空间几何定位,网络将归一化笛卡尔坐标网格 \(\mathbf{C} \in [-1, 1]^{2 \times H \times W}\) 与特征在通道维度拼接:\(\widetilde{\mathbf{L}}_{\text{HS}} = [\mathbf{L}_{\text{HS}}^\star, \mathbf{C}]\)。轻量级卷积解码器以此坐标条件特征为依据,直接投射出保留锐利地物边界与纯正光谱曲线的高分辨率高光谱图像。

损失函数 / 训练策略

网络整体采用端到端方式训练,以预测重构图像 \(\widehat{\mathbf{X}}\) 与参考真值 \(\mathbf{X}_{\text{ref}}\) 之间的 \(L_1\) 范数作为主要重构损失函数:

\[\mathcal{L} = \|\mathbf{X}_{\text{ref}} - \widehat{\mathbf{X}}\|_1\]

优化器采用 Adam,基础学习率设为 \(5 \times 10^{-4}\),并配合余弦退火调度器在 1600 个 epoch 内衰减至 \(1 \times 10^{-5}\)。数值求解器步长调节因子初始化并在训练中自适应更新,最优配置下取积分步数 \(T=2\)、缩放因子 \(s=1.2\)

实验关键数据

主实验

评估遵循 Wald 遥感图像降采样融合评测协议,在三个具有代表性的公开基准数据集(Botswana、Chikusei、Pavia Center)上进行全指标对比。评价指标涵盖峰值信噪比(PSNR)、结构相似度(SSIM)、光谱角映射(SAM)、互相关系数(CC)、均方根误差(RMSE)以及相对全局合成误差(ERGAS)。

数据集 方法 PSNR ↑ SSIM ↑ SAM ↓ CC ↑ RMSE ↓ ERGAS ↓
Botswana HyperPNN 37.430 0.944 2.454 0.969 0.019 1.544
FPFNet 37.750 0.957 3.520 0.977 0.018 1.481
HyperDSNet 38.010 0.947 2.308 0.972 0.018 1.421
HspeNet 38.150 0.947 2.214 0.972 0.018 1.402
HyperRefiner 39.200 0.959 2.094 0.978 0.015 1.249
Lformer 39.210 0.957 2.087 0.978 0.015 1.258
DHP-Darn 40.150 0.965 1.906 0.981 0.013 1.141
MCIFNet 39.237 0.958 2.068 0.977 0.015 1.259
LGD-Net(本文) 41.856 0.979 1.695 0.987 0.011 1.016
Chikusei HyperPNN 42.890 0.974 5.160 0.981 0.008 3.480
FPFNet 41.030 0.969 5.589 0.977 0.010 3.947
HyperDSNet 43.020 0.974 5.099 0.982 0.008 3.403
HspeNet 42.840 0.975 4.917 0.982 0.008 3.401
HyperRefiner 43.560 0.978 4.862 0.983 0.008 3.339
Lformer 44.890 0.983 3.635 0.987 0.007 2.862
DHP-Darn 45.400 0.985 4.431 0.988 0.006 2.724
MCIFNet 45.101 0.984 4.514 0.988 0.007 2.814
LGD-Net(本文) 47.814 0.991 3.996 0.992 0.005 2.240
Pavia HyperPNN 39.060 0.967 4.612 0.986 0.012 2.459
FPFNet 39.320 0.966 6.115 0.986 0.013 2.451
HyperDSNet 39.110 0.967 4.675 0.986 0.012 2.446
HspeNet 38.370 0.965 4.382 0.984 0.013 2.625
HyperRefiner 40.090 0.973 4.213 0.987 0.011 2.318
Lformer 40.730 0.975 3.979 0.988 0.010 2.182
DHP-Darn 41.670 0.978 3.820 0.990 0.009 2.018
MCIFNet 41.365 0.976 3.903 0.989 0.010 2.070
LGD-Net(本文) 44.830 0.984 3.297 0.992 0.007 1.693

消融实验

为了验证各个核心设计组件的有效性,作者在测试集上进行了模块消融对比实验(以验证各个模块对融合精度的单独贡献):

配置 PSNR ↑ SSIM ↑ SAM ↓ CC ↑ RMSE ↓ ERGAS ↓ 说明
Full model (LGD-Net) 44.896 0.984 3.288 0.992 0.007 1.685 完整模型
w/o Bilinear interaction 44.201 0.983 3.375 0.992 0.008 1.754 替换为常规线性交互,非线性跨模态对齐能力下降
w/o Graph Propagation 43.972 0.982 3.423 0.992 0.008 1.774 移除模态内图传播,层间结构连贯性受损
w/o Edge gating 44.385 0.983 3.353 0.992 0.007 1.740 移除自适应差异门控,跨尺度信息注入缺乏边界约束
w/o Leader refinement 43.818 0.982 3.462 0.992 0.009 1.894 移除 Leader 对多尺度特征的反向调制,掉点 1.08 dB
w/o Continuous dynamics 32.725 0.908 4.854 0.958 0.024 4.437 替换为普通残差堆叠,跨模态交互崩塌,PSNR 剧降 12.17 dB

关键发现

  • 连续动力学演化是性能基石:消融数据显示,若将连续动力学系统替换为传统的离散残差网络堆叠(w/o Continuous dynamics),PSNR 从 44.896 dB 暴跌至 32.725 dB(骤降 12.17 dB),ERGAS 从 1.685 恶化到 4.437。这证实了连续动力学求解器在平滑调节跨模态特征融合轨迹、避免特征突变方面的不可替代性。
  • 求解器步数与步长的权衡关系:针对 RK2 求解步数 \(T\),实验发现当 \(T=1\) 时跨模态状态演化不充分(PSNR 仅 36.142 dB);\(T=2\) 达到最优峰值(41.856 dB);而进一步增加至 \(T=3\)\(4\) 时,过度的动态迭代反而引发特征混叠,导致指标轻度回落(41.242 dB 与 40.562 dB)。步长缩放因子 \(s=1.2\) 亦呈现类似的凹函数特性。
  • 优异的精度-参数量平衡:模型参数量为 2.39M、计算量 25.73 GFLOPs、单张推理耗时 34.18 ms。相比超大模型 FPFNet(47.34M 参数 / 321.47 GFLOPs / 75.19 ms),LGD-Net 参数量减少了 95%,却在全部数据集上超越了前者,体现了 Leader 机制高效率建模的优势。

亮点与洞察

  • 全局交互与局部重建在机制层解耦:将全局上下文归纳至单一 Leader,并通过低代价 ODE 积分专门驱动 Leader 演化,避免了为扩大感受野而被迫加深全图卷积的架构弊端,设计极具通用性启发。
  • 双线性调制与连续 ODE 的协同设计:跨模态交互同时吸纳加性与乘性项,并嵌入可学习二阶 RK2 步进。这使得跨模态交互强度具备严格的数学物理演化解释,数值平滑可控。
  • 差异感知的多尺度图传播:利用相邻金字塔特征的差值作为门控调节器,只在结构发生显著变化时强化更新,天然契合遥感图像在地表均质区域与边缘过渡带的不同处理需求。

局限与展望

  • 连续动力学超参数依赖网格搜索:积分步数 \(T\) 与缩放因子 \(s\) 目前为经验固定超参数,不同地物复杂度或不同传感器(如机载 vs 星载)可能存在异质的最优动力学轨迹,未来可探索数据自适应的动态步长机制。
  • 对严苛几何未配准输入的泛化性待验证:当前评测基于 Wald 降采样仿真,LRHS 与 PAN 在几何上完全配准。在真实卫星对地观测中,双模态往往存在微小的视差或大气抖动,图传播与全局 Leader 融合机制在非严格对齐场景下的鲁棒性仍有待进一步验证。

相关工作与启发

  • vs HyperPNN / FPFNet (CNN 基线):传统 CNN 依赖局部感受野堆叠和特征金字塔简单拼接,容易在深层网络中丢失光谱基线;LGD-Net 通过显式分离全局 Leader 与局部节点,实现了更纯正的光谱曲线恢复。
  • vs HyperTransformer / Lformer (Transformer 基线):Transformer 类方法借助自注意力计算全局亲和力,计算与显存开销较高;LGD-Net 仅让紧凑 Leader 进行常微分方程状态演化,在保持长程上下文建模的同时显著减少了复杂度。
  • vs 扩散生成融合模型 (Diffusion-based):扩散模型依赖数十甚至上百步随机去噪迭代,推理极其缓慢;LGD-Net 仅需 2 步轻量 RK2 微分方程前向步进,单次推理仅需数十毫秒,更符合遥感业务落地需求。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 首次将 Leader 导向的连续动力系统与解耦理念引入高光谱图像融合,设计新颖深刻。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖三个主流数据集,评价指标完整,消融实验详实且涵盖 ODE 动力学步长深度剖析。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑链条清晰,数学表达严谨,方法动机与模块细节阐释充分。
  • 价值: ⭐⭐⭐⭐☆ 为跨模态遥感影像增强与超分辨率任务提供了无需堆叠层深的新范式。