跳转至

G-ZAP: A Generalizable Zero-Shot Framework for Arbitrary-Scale Pansharpening

会议: ECCV 2026
论文: ECCV 原文
领域: 遥感
关键词: 全色锐化、零样本学习、任意尺度、隐式神经表示、跨传感器泛化

一句话总结

G-ZAP 用带尺度条件的隐式神经表示(INR)做全色锐化的融合骨干,配一套「全分辨率无监督光谱一致性 + 两级降分辨率构造监督」的三级协同训练,仅用测试图像对本身现场训练就能在任意放大倍率下输出 HRMS,并且训好的权重可直接复用到未见的图像对、场景与传感器上。

研究背景与动机

卫星遥感受硬件限制,很难直接拍到同时具备高空间分辨率和高光谱分辨率的多光谱影像,工程上的折中是同时采集两类互补数据:低分辨率多光谱(LRMS)图与高分辨率全色(PAN)图。全色锐化就是把这两者融合成高分辨率多光谱(HRMS)图。这条技术线从成分替换(CS)、多分辨率分析(MRA)、变分优化(VO)等模型驱动方法,逐步过渡到数据驱动的深度学习方案;后者在空间细节保真与光谱保真上都明显超过传统方法,但几乎全部依赖在「模拟降分辨率数据集」上做大规模预训练。

真正的问题出在部署环节。模拟降分辨率数据与真实全分辨率数据之间存在分布错配(train–test distribution mismatch),模型在全分辨率真实影像上的表现往往达不到模拟基准上的水平,还要额外付出采集大量外部配对数据的代价。零样本全色锐化(PsDip、ZS-Pan 等)正是针对这一点:只用一对输入图像从零开始训练模型,从而绕开外部数据与分布错配。但它们把「免配对数据」的代价转嫁到了效率上——每换一对图像就要重新优化一整套参数,权重无法复用;不少方法还需要准确估计空间保真度来平衡光谱保真,方法论更重、算力开销更大。第三重限制是尺度:绝大多数方法只能输出与 PAN 尺寸一一对应的固定分辨率 HRMS,而实际应用往往需要多样的输出分辨率,固定尺度会直接损失细节清晰度。

已有的特征型隐式神经表示(feature-based INR,如 LIIF 及其变体)提供了一条不同的路:它用一个共享的连续函数空间隐式表示不同图像,天然支持任意分辨率的坐标查询;INF³、FeINFN 也已把 INR 用于图像融合。但它们仍然走「预训练—测试」范式,需要外部数据,且没有解决权重逐图失效的问题。本文的切入角度是:既然 INR 的查询是尺度条件的、函数空间是共享的,那么把它直接放进零样本设定、并设计一套能让同一套参数同时对齐多个分辨率的训练方案,就有机会同时拿到「只用测试数据」「任意尺度」「权重可复用」三点。核心 idea:以特征型 INR 融合网络(INRConv)为骨干,用传感器 MTF 把输入退化出三个分辨率层级,全分辨率层用无监督光谱一致性对齐真实推理条件,两个降分辨率层用「LRMS 天然就是 PAN 下采样版」这一事实构造伪真值做监督,让同一套尺度条件的权重在任意倍率下都成立,并在跨图像对、跨场景、跨传感器时直接复用。

方法详解

整体框架

输入是 PAN 影像 \(P\in\mathbb{R}^{H\times W}\)、LRMS 影像 \(Y\in\mathbb{R}^{h\times w\times c}\) 以及目标放大倍率 \(N\),输出是对应倍率的高分辨率多光谱影像 \(X_{\times N}\)。整条链路分两截:前半截是 INRConv 融合骨干,把 PAN 沿通道维复制到与 LRMS 同波段数、把 LRMS 上采样 \(r=H/h\) 倍到 PAN 分辨率,拼接后送进编码器得到一份定义在 PAN 离散网格上的融合特征图;再按 \(N\) 生成目标坐标网格,对每个目标点在特征图上做四点邻域查询与面积加权聚合,得到目标分辨率的稠密特征,最后用两个轻量卷积层解码成 HRMS。后半截是训练侧:模型不是拿外部数据训练的,而是拿这一对 PAN/LRMS 自己退化出三个分辨率层级(全分辨率、\(1/r\)\(1/r^2\)),三个层级共用同一套 INRConv 参数,分别施加无监督的光谱一致性损失和两条构造监督损失,联合优化。训练结束后,把 \(N\) 设成任意值即可直接推理,无需重训。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["PAN + LRMS 图像对<br/>+ 目标倍率 N"] --> B["尺度条件的隐式点查询融合<br/>编码 → 四点查询<br/>面积加权 → 卷积解码"]
    A --> C["传感器 MTF 退化<br/>构造 1/r 与 1/r² 两级输入"]
    B --> D["全分辨率光谱一致性约束<br/>N=1 输出 MTF 退化<br/>再下采样与 LRMS 比对"]
    C --> E["多尺度构造监督<br/>1/r 层用 LRMS 监督<br/>1/r² 层约束 N=1 与 N=4"]
    D --> F["共享参数联合优化"]
    E --> F
    F --> G["权重复用<br/>一套权重跨图像对<br/>场景与传感器"]
    G --> H["任意尺度 HRMS×N 输出"]

关键设计

1. 尺度条件的隐式点查询融合:把「放大倍率」变成喂给 MLP 的输入,而不是写死在卷积核里

卷积网络的输出分辨率是写死在权重里的——转置卷积的核尺寸、步长决定了它只能产出某一个倍率,换倍率就得换一个模型;而已有的 INR 融合方法虽然能查询任意坐标,却都建立在预训练范式上,先要有大量配对数据才谈得上泛化。G-ZAP 要的是「一套权重 + 任意倍率 + 只用测试图像对训练」,这要求尺度必须是模型的输入条件而非结构约束。

具体做法是:EDSR 主干编码器把通道复制后的 PAN 与上采样后的 LRMS 拼起来,编码成定义在 PAN 离散网格上的融合特征图 \(\mathcal{F}\);给定目标倍率 \(N\),在归一化域 \([-1,1]^2\) 上生成 \(HN\times WN\) 的目标坐标网格。对每个目标点 \(q\),先取它在 \(\mathcal{F}\) 网格上的四个最近邻 \(z_t\)(左上/右上/左下/右下),然后不是做普通的双线性插值,而是让一个小 MLP 同时吃三样东西:该邻域点的局部特征 \(\mathcal{F}(z_t)\)、目标点相对该邻域的偏移 \(q-z_t\)、以及编码了目标倍率 \(N\) 的 cell size \(s\),输出该邻域对 \(q\) 的潜在响应 \(v_t\)。最后按四个邻域与 \(q\) 所构成子区域的面积加权聚合:

\[f(q)=\sum_{t\in\{00,01,10,11\}}\frac{S_t}{S}\,\mathbf{v}_t,\qquad S=\sum_t S_t\]

其中 \(S_t\) 是邻域 \(z_t\) 对应的对角子区域面积。把所有目标坐标并行查询一遍就得到目标分辨率的稠密特征图,再由两个轻量卷积层解码成 HRMS。

关键在 cell size \(s\):它把「一个特征点要覆盖多大范围」显式地告诉 MLP,于是同一套参数在不同 \(N\) 下收到不同的尺度条件,可以给出连贯且各自正确的输出;面积加权聚合则让低倍率下共享同一 cell 的多个目标点自然继承该 cell 的覆盖范围,避免了直接坐标查询在小倍率下容易出现的混叠。另外把卷积放在 MLP 之后(而不是之前)是刻意为之——这是沿用 INF³ 的观察,轻量卷积可以缓解 INR 的过拟合,而零样本设定下过拟合几乎是最致命的失败模式。

2. 全分辨率光谱一致性约束:在真实推理分辨率上做自洽,且完全不需要空间保真项

零样本方法最难处理的是全分辨率那一层:那里没有任何真值可以监督。已有做法要么引入复杂的空间保真度建模(还要求估计得准),要么干脆放弃全分辨率监督、只在降分辨率上训练——后者又退回了分布错配。G-ZAP 的选择是:在真正的推理分辨率上,只加一条可解释、几乎零额外开销的光谱一致性约束,完全不碰空间保真项。

Level 0 让 INRConv 在 \(N=1\) 下直接处理原始分辨率的 \(P\)\(Y\),输出全分辨率 HRMS 估计;随后把这份估计按该传感器专属的 MTF(调制传递函数)做空间模糊,再下采样到 LRMS 分辨率,要求结果与观测到的 LRMS 输入一致,用 \(\ell_1\) 度量:

\[\mathcal{L}_{(0)}=\bigl\|\downarrow\!\bigl(\mathrm{MTF}\bigl(\mathcal{N}_\theta(P,Y,1)\bigr)\bigr)-Y\bigr\|_1\]

(该式在缓存全文里被 LaTeX 抽取损毁,此处按正文描述重建 ⚠️ 以原文为准。)这条约束只要求「全分辨率输出退化回低分辨率后仍与观测一致」,不需要任何真值,也刻意不引入空间保真项——这正是作者强调的第三点贡献:在不依赖空间保真约束的前提下拿到更好的结果。消融也印证了它的分量:去掉 \(\mathcal{L}_{(0)}\) 掉点最多(WV3 HQNR 从 0.9585 降到 0.9276,WV2 从 0.9226 降到 0.8781)。MTF 在这里不只是个模糊核,它是传感器相关的退化算子,L0/L1/L2 三层共用同一套退化建模,既保证三个层级的退化与真实传感器一致,也让跨传感器推理时无需重新学退化。

3. 多尺度构造监督:用后退化造出的「伪真值」把 4× 与 16× 的尺度关系钉死

只有 Level 0 的话,模型从没见过「输入分辨率低于输出分辨率」的情形,INR 的 cell size 条件等于没被用起来;但一味加降分辨率训练又会把模型推向与真实推理不一致的分布。本文的折中点是「构造监督」(constructed supervision),它利用了一个全色锐化特有的结构事实:LRMS 本来就是 PAN 的下采样版本,所以把 PAN 和 LRMS 一起再退化一级,得到的 LRMS 就自动成了一个合法的参考真值——不需要任何外部数据,也能造出对齐的配对监督。

Level 1 把 \(P\)\(Y\) 先用传感器 MTF 模糊再下采样 \(r\) 倍,得到 \(P_{1/r}\)\(Y_{1/r}\),让 INRConv 在 \(N=1\) 下重建,输出与原始 LRMS 图像 \(Y\) 对齐(\(P_{1/r}\) 的分辨率恰好是 \(h\times w\),与 \(Y\) 同尺寸,监督完全对齐)。Level 2 在 Level 1 的输入上再退化一级得到 \(P_{1/r^2}\)\(Y_{1/r^2}\),然后同时开两条支路:\(N=1\) 的输出对齐 \(Y_{1/r}\)\(N=4\) 的输出直接对齐原始 \(Y\)

\[\mathcal{L}_{(2)}=\bigl\|\mathcal{N}_\theta(P_{1/r^2},Y_{1/r^2},1)-Y_{1/r}\bigr\|_1+\bigl\|\mathcal{N}_\theta(P_{1/r^2},Y_{1/r^2},4)-Y\bigr\|_1\]

(同样为按正文重建 ⚠️ 以原文为准。)以 \(r=4\) 计,Level 2 的输入只有 PAN 分辨率的 \(1/16\),而 \(N=4\) 支路要求它把这份输入重建到 \(h\times w\)。也就是说这一级同时把 Level 1 学到的 4× 关系再巩固一遍,又把相对于 Level-0 全分辨率的 16× 尺度跨度纳入训练:同一个函数空间要同时满足多组「输入分辨率 → 输出分辨率」的映射,cell size 这个尺度条件才真正被用起来、变得敏感。消融显示 \(\mathcal{L}_{(2)}\) 单项贡献最小(WV3 HQNR 只掉 0.0074),但它守的是高倍率下的锐度——去掉之后高分辨率区域纹理明显变糊、细结构丢失。

4. 权重复用:把逐图优化摊成一次训练,并因此拿到更好的跨传感器表现

零样本的「免配对数据」是靠逐图重训换来的:PsDip 约 285 s/对、UCL 约 463 s/对、ZS-Pan 约 67 s/对,换一对图像就要从头再来,时间和硬件开销无法摊销。而在遥感影像里,不同场景之间的结构与纹理高度相似,这提示权重未必需要绑定在某一对图像上。

G-ZAP 训练完成后,权重可以原样迁移到未见图像对:8 波段设定下,用 WV3 上训好的模型直接推理 WV3 与 WV2,不做任何重训;4 波段设定下,用 GF2 训好的模型推理全部测试对(该变体记作 G-ZAP∗)。这样训练开销被摊薄到多张图上,单图推理时间降到 4.23 s(WV3)/ 0.14 s(WV2)。作者把这种可迁移性归因于特征型 INR 的性质:相比纯卷积特征,它可以被看作一种表达能力更强的插值机制,能更好地利用遥感图像中跨场景共享的结构与纹理,因此在图像特性发生变化(跨传感器)时也更稳。最直接的证据来自骨干替换消融——把 INRConv 换成纯卷积的 FusionNet、其余设置不变,FusionNet 在 WV2 的权重复用设定下相对自身的逐图训练出现明显下滑,而 INRConv 保持稳定。

一个完整示例

以 PanCollection 的 WV3 为例:PAN 裁到 \(512\times512\)、8 波段,\(r=4\),故 LRMS 为 \(128\times128\)

Level 0 用原始 \(P\ (512\times512)\)\(Y\ (128\times128)\),设 \(N=1\),输出 \(512\times512\),再 MTF 模糊 + 下采样到 \(128\times128\)\(Y\)\(\ell_1\)。Level 1 把 \(P\)\(Y\) 各退化一级,得 \(P_{1/4}\ (128\times128)\)\(Y_{1/4}\ (32\times32)\),设 \(N=1\) 输出 \(128\times128\),与 \(Y\) 比。Level 2 再退化一级,得 \(P_{1/16}\ (32\times32)\)\(Y_{1/16}\ (8\times8)\),两条支路同时算:\(N=1\) 的输出 \(32\times32\) 对齐 \(Y_{1/4}\)\(N=4\) 的输出 \(128\times128\) 对齐 \(Y\)

三层的输入分辨率、监督目标和 \(N\) 设置各不相同,但用的是同一套 INRConv 参数,每步只是换输入与倍率配置。训练完这一对之后,把 \(N\) 设成 1.6、2、3.4、4 等任意值,同一套权重就能直接输出对应分辨率的 HRMS——这也解释了为什么它能把权重直接搬到完全没见过的 WV2 上。整个流程只用到这一对图像,没有任何外部 HR/LR 配对。

损失函数 / 训练策略

总目标为三层的加权和:\(\mathcal{L}_{\text{total}}=\alpha\,\mathcal{L}_{(0)}+\beta\,\mathcal{L}_{(1)}+\gamma\,\mathcal{L}_{(2)}\)。权重取 \(\alpha=\beta=1\)\(\gamma\) 在 8 波段设定下取 0.2、4 波段设定下取 4(原文未解释为何相差 20 倍 ⚠️ 以原文为准)。优化用 Adam,初始学习率 \(5\times10^{-4}\),训练 500 个 epoch,硬件为单张 NVIDIA RTX 3090(24 GB)加 AMD EPYC 7402。作为对照,基线中的预训练深度模型只使用 WV3 与 GF2 的训练集(分别对应 8 波段与 4 波段配置),而 G-ZAP 只从测试的那一对 PAN/LRMS 出发,不使用任何外部 HR/LR 配对。

实验关键数据

主实验

数据来自 PanCollection 的 WorldView-3(WV3)、GaoFen-2(GF2)、WorldView-2(WV2)三个数据集,PAN 统一裁到 \(512\times512\),WV3/WV2 为 8 波段、GF2 为 4 波段。由于目标是真实场景、没有真值,评估主要在全分辨率下做,用三个无参考指标:HQNR(综合指标,由 \(D_s\)\(D_\lambda\) 合成)、\(D_s\)(空间失真,越低越好)、\(D_\lambda\)(光谱失真,越低越好)。对比方法涵盖传统方法(BT-H、C-BDSD、BDSD-PC、MTF-GLP-FS、MF)、预训练深度模型(FusionNet、LAGNet、FusionMamba、WFANet)与零样本方法(PsDip、ZS-Pan、UCL)。G-ZAP∗ 是权重复用变体:8 波段用 WV3(id=0)训好的模型直接推理 WV3 与 WV2,4 波段用 GF2(id=0)训好的模型推理全部测试对。

下表列出与前 SOTA(各数据集上最强的非 G-ZAP 方法,粗体为最优,下划线为次优)的对比:

数据集 方法 HQNR↑ \(D_\lambda\) \(D_s\)
GF2(4 波段,同域) FusionMamba(前 SOTA) 0.9536 0.0174 0.0295
GF2 G-ZAP∗(权重复用) 0.9569 0.0188 0.0246
GF2 G-ZAP 0.9706 0.0181 0.0115
WV3(8 波段,同域) FusionMamba(前 SOTA) 0.9550 0.0183 0.0272
WV3 G-ZAP∗ 0.9574 0.0187 0.0244
WV3 G-ZAP 0.9585 0.0187 0.0233
WV2(跨传感器) UCL(最强零样本基线) 0.9201 0.0228 0.0585
WV2 G-ZAP 0.9226 0.0304 0.0486
WV2 G-ZAP∗ 0.9367 0.0195 0.0450

消融实验

逐个去掉三个损失项,其余设置不变,在 WV3(同域)与 WV2(跨传感器)上评估:

配置 HQNR↑(WV3 / WV2) \(D_\lambda\)↓(WV3 / WV2) \(D_s\)↓(WV3 / WV2) 说明
G-ZAP(完整) 0.9585 / 0.9226 0.0187 / 0.0304 0.0233 / 0.0486 三级损失全开
w/o \(\mathcal{L}_{(0)}\) 0.9276 / 0.8781 0.0279 / 0.0496 0.0459 / 0.0760 去掉全分辨率光谱一致性,掉点最多
w/o \(\mathcal{L}_{(1)}\) 0.9377 / 0.8970 0.0181 / 0.0313 0.0451 / 0.0743 去掉 \(1/r\) 构造监督,空间失真显著恶化
w/o \(\mathcal{L}_{(2)}\) 0.9511 / 0.9178 0.0185 / 0.0264 0.0310 / 0.0574 去掉 \(1/r^2\) 多尺度监督,掉点最小但细节变糊

另一组是与零样本方法在耗时上的对比(秒,越低越好):

方法 WV3 时间↓ WV3 HQNR↑ WV2 时间↓ WV2 HQNR↑
PsDip 285.37 0.9215 280.23 0.8980
ZS-Pan 67.24 0.9449 68.52 0.9112
UCL 463.22 0.9482 464.41 0.9201
G-ZAP(逐图训练) 79.03 0.9585 78.58 0.9226
G-ZAP∗(权重复用) 4.23 0.9574 0.14 0.9367

关键发现

  • Level 0 是三级里最不可替代的一环:去掉它在 WV3/WV2 上 HQNR 分别掉 0.0309 / 0.0445,且 \(D_\lambda\)\(D_s\) 同时恶化。说明「在真实推理分辨率上加一条自洽约束」比单纯增加降分辨率监督更有效,也支持了「训练条件应当与部署条件对齐」这一判断。
  • 三层分工不同,不是简单叠加:去掉 \(\mathcal{L}_{(1)}\) 后 WV3 的 \(D_\lambda\) 反而略好于完整模型(0.0181 vs 0.0187),但 \(D_s\) 从 0.0233 恶化到 0.0451——\(1/r\) 层的贡献主要在空间细节,而非光谱。三层各自把住分布对齐、空间对齐、尺度对齐三件事。
  • 权重复用在跨传感器上不只是「不掉点」,甚至反超逐图训练:WV2 上 G-ZAP∗ 的 HQNR 0.9367 高于 G-ZAP 的 0.9226(同域 WV3 上两者接近:0.9574 vs 0.9585)⚠️ 原文只给数字未作解释。一个可能的原因是 WV2 单对图像提供的自监督信号弱于 WV3 上已学到的通用先验,但这是推测。
  • 骨干替换是权重可复用性的关键证据:同设置下把 INRConv 换成纯卷积 FusionNet,后者在 WV2 的权重复用设定下相对自身逐图训练明显下滑,INRConv 则保持稳定——支持「特征型 INR 是更强的插值机制、因而更可迁移」的解释。
  • 效率优势完全来自权重复用,而非单次训练更快:逐图训练的 G-ZAP 在 WV3 上要 79.03 s,反而比 ZS-Pan 的 67.24 s 更慢;只有 G-ZAP∗ 才达到 4.23 s / 0.14 s。原文「只需数秒甚至亚秒」的说法只在权重复用变体下成立。
  • 高倍率下的细节锐度依赖 \(\mathcal{L}_{(2)}\):去掉后高分辨率区域纹理变糊、细结构丢失,但 HQNR 只掉 0.0074,说明这个损失的作用更多体现在视觉细节而非无参考指标上。

亮点与洞察

  • 把「任意尺度」做成输入条件而不是结构约束:cell size \(s\) 与相对坐标一起喂给 MLP,等于把倍率信息编码进查询本身,同一套权重就能覆盖连续尺度谱;这比「为每个倍率训一个模型」或「固定倍率 + 后处理缩放」都更干净,而且天然兼容跨分辨率的多层级训练——因为不同层级本来就对应不同的 \(s\)
  • 「构造监督」利用的是任务自身的结构冗余:LRMS 本身就是 PAN 的下采样版,于是把两者一起再退化一级,凭空得到一个对齐的伪真值。这个 trick 不依赖任何外部数据,也不引入新的假设,凡是「配对的两种模态存在分辨率比例关系」的任务(高光谱—多光谱融合、深度—RGB、医学多模态)都可以照搬。
  • 刻意不做空间保真项是一个有分量的设计决策:以往零样本方法需要估计空间保真度来平衡光谱保真,本文证明在合适的三级训练下,只用光谱一致性加构造监督就够了,省掉了估计误差来源和额外算力。
  • 权重复用的论证方式值得借鉴:作者没有只报一个「复用后掉点很少」,而是用「换掉骨干后复用失效」来做对照,把「INR 带来的可迁移性」从一个说法变成了一条可证伪的证据链。
  • 可迁移到更一般的逐图自监督任务:任何「无真值、逐样本自监督优化」的设定(内部学习式超分、单图去噪、测试时自适应)都可以试着问一句——如果把优化目标拆成多个可构造的层级、并引入一个共享函数空间,能不能把逐样本优化换成「一次训练 + 权重复用」。

局限与展望

  • 逐图训练仍然不便宜:G-ZAP 本体要 79.03 s/对,比 ZS-Pan 的 67.24 s 更慢,跨传感器上还不一定赢过自己的权重复用变体。论文把「高效」归给 G-ZAP∗,但 G-ZAP∗ 的代价是引入了「用哪一对图像当种子」这个新的超参数——原文固定用 id=0,没有分析种子对选择的影响。
  • 任意尺度只有视觉证据:×1、×1.6、×2、×3.4、×4 的结果只给了视觉效果图,没有定量指标。原因是 HQNR/\(D_s\)/\(D_\lambda\) 这类全分辨率无参考指标本身定义在固定分辨率上,但论文至少可以用退化后再评估、或跨尺度自一致性来补一个定量信号,目前无法判断高倍率下数值退化的幅度。
  • 跨传感器只覆盖一种组合:仅验了 8 波段 WV3 → 8 波段 WV2。波段数不同的传感器之间(4 波段 ↔ 8 波段)能否复用权重、编码器是否需要按波段数重训,论文没有讨论;而两组实验的 \(\gamma\)(8 波段 0.2、4 波段 4,相差 20 倍)暗示波段数确实改变了损失的敏感度,原文同样没有解释。
  • 评估指标单一:全分辨率下只有 HQNR、\(D_s\)\(D_\lambda\) 三个无参考指标(且它们并非彼此独立,HQNR 本身由后两者合成),缺少与其他无参考评价体系的交叉验证;也没有报告多次运行的方差,看不出 0.001–0.005 量级的差距是否稳定。
  • 可改进方向:一是把构造监督推广到非整数退化因子(目前退化链是 \(r\)\(r^2\),与训练用的 \(N=1,4\) 硬绑定),使尺度条件在训练中真正连续;二是给权重复用加一个轻量的元学习/自适应环节,让复用权重能按目标传感器做几步微调,兼顾效率和跨传感器精度;三是把「选哪对图像当种子」变成可优化的选择问题。

相关工作与启发

  • vs ZS-Pan / PsDip(传统零样本):同样是测试时训练、不用外部数据,区别在于三点——他们逐对图像重训(285 s / 67 s 量级),本文训一次可复用;他们依赖空间保真度估计来平衡光谱保真,本文只用光谱一致性加构造监督;他们固定在 PAN 对应分辨率,本文支持任意倍率。
  • vs UCL(无监督系数学习的变分零样本框架):WV2 上 UCL 的 HQNR 0.9201 与 G-ZAP 的 0.9226 接近,但 UCL 单对耗时 463.22 s,是 G-ZAP∗ 的千倍量级;本文的差距主要体现在可部署性而非精度。
  • vs INF³ / FeINFN(特征型 INR 融合):本文的骨干设计与它们同源(同样采用「INR 查询 + 后接轻量卷积抑制过拟合」的思路),但那些方法走预训练—测试范式、需要外部数据;本文把 INR 放进零样本设定,并把尺度条件用于多层级协同训练。
  • vs LIIF / UltraSR(特征型 INR 超分):继承了「局部隐式图像函数 + 四点邻域 + 面积加权聚合」的骨架,但把单输入图像超分扩展成 PAN/LRMS 双输入的融合问题,并且 cell size 的作用从单纯的尺度编码升级为跨分辨率训练的耦合点。
  • vs FusionNet / FusionMamba / WFANet(预训练深度模型):这些方法在模拟降分辨率数据上训练,模拟基准上很强,但在本文的消融里 FusionNet 一旦换到跨传感器的权重复用设定就明显退化;说明预训练范式的泛化瓶颈不只在数据量,也在纯卷积特征本身的可迁移性。

评分

  • 新颖性: ⭐⭐⭐⭐ 把特征型 INR 与零样本全色锐化结合并给出三级协同训练与权重复用,组合与训练方案都有实质新意,「任意尺度」的实现方式(尺度作为查询条件)也比为每级训一个模型更本质。
  • 实验充分度: ⭐⭐⭐ 三个真实数据集、四大类基线、三类消融(损失项、骨干、耗时)覆盖得不错,但任意尺度缺定量评估、跨传感器只验一种组合、没有方差报告,且逐图训练在耗时上并不占优这一点被表述得偏乐观。
  • 写作质量: ⭐⭐⭐ 三级训练的分工讲得清楚、框架图与损失定义完整,但若干公式在排版中丢失、部分设计选择(如 \(\gamma\) 的取值差异、WV2 上权重复用反超)没有解释。
  • 价值: ⭐⭐⭐⭐ 「一次训练跨图跨传感器复用 + 任意尺度」对真实遥感部署很有吸引力,构造监督的思路也可直接迁移到其他多分辨率融合任务。