跳转至

SGP2: Coarse-to-Fine Controllable Multimodal Remote Sensing Image Generation

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/cpy0029/MMEarth-1.5M
领域: 图像生成
关键词: 遥感图像生成, 多模态控制生成, 格拉斯曼流形, 物理先验对齐, 频域谱损失

一句话总结

针对遥感图像生成中的语义冲突与物理失真问题,SGP2 提出了由粗到精的几何与物理先验协同生成框架,利用格拉斯曼流形测地线轨迹解耦全局与细节文本语义,并通过多层级视觉基座特征路由与频域谱损失约束振幅与相位一致性。

研究背景与动机

基于扩散模型的文本到图像生成技术在自然图像领域取得了巨大突破,也为遥感(Remote Sensing, RS)领域的数据稀缺缓解及目标检测、地物分类等下游任务带来了前所未有的机遇。然而,直接将自然图像扩散模型迁移至遥感场景面临严峻的领域自适应挑战。遥感影像具有独特的俯视俯瞰视角、错综复杂的地表拓扑结构以及严苛的地物物理反射特性(例如光学光谱响应与合成孔径雷达 SAR 的电磁散射特性)。尽管现有 ControlNet 式可控遥感生成模型引入了边缘、草图或分割掩码等空间先验,但在面对复杂文本提示时,仍普遍受困于两大致命瓶颈。

其一是多层级语义冲突(Semantics Conflict)。复杂遥感场景包含宏观场景与微观实体的多层次语义,例如“包含储油罐和结构化管道的工业区”。现存预训练文本编码器将文本嵌入视作欧氏空间中的固定点,特征严重纠缠;在去噪过程中,显著的宏观概念(工业区、大面积油罐)往往在注意力竞争中占据主导,彻底掩盖低方差的细粒度微观描述(如细长管道),导致生成图像细节缺失或语义遗漏。其二是物理规律不一致性(Physical Inconsistency)。遥感成像本质上是地表对电磁辐射的物理响应,具备高度严格的几何拓扑和频域能量分布规律。纯数据驱动的扩散模型缺乏显式物理约束和频域拓扑引导,在去噪迭代中极易发生结构崩塌(Structural Collapse)或辐射失真(Radiometric Distortion)。

解决上述问题的关键在于改变以往去噪各阶段“静态且一视同仁”的条件注入方式,使几何与物理先验的引导强度与扩散模型“先宏观轮廓、后微观纹理”的物理去噪规律深度契合。核心 idea:将文本特征投影至格拉斯曼流形并沿动态测地线平滑演进以解决欧氏特征纠缠,同时利用时间步感知的 MixRouter 动态调度视觉基座模型的多层级物理先验,并引入频域振幅与相位谱损失联合约束,实现由粗到精的物理保真遥感多模态图像生成。

方法详解

整体框架

SGP2 整体架构建立在 Diffusion Transformer(DiT)之上,围绕“时序演化与粗到精对齐”构建了三大核心模块。输入端首先通过格拉斯曼挖掘器(Grassmann Miner, GM)对输入文本嵌入进行奇异值分解,在格拉斯曼流形上构建随去噪时间步动态演进的测地线轨迹,使文本引导平滑地从全局语义重心向微观细节转移。随后,多模态条件隐变量拼接后输入 DiT 主干。在去噪过程中,物理先验专家(Physical Prior Expert, PPE)通过时间步感知路由器(MixRouter)动态调度视觉基础模型(VFM,如 DINOv3)的深层宏观语义与浅层低级几何结构特征;最后,结合频域谱损失(Spectral Loss, \(\mathcal{L}_{sp}\))显式约束生成特征在傅里叶变换下的振幅与相位分布,最终输出具有严格物理真实性与结构一致性的光学和 SAR 遥感图像。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入文本 + 多模态条件隐变量"] --> B["格拉斯曼挖掘器<br/>SVD子空间分解与测地线轨迹演进"]
    B --> C["DiT 去噪主干<br/>多模态特征多步迭代去噪"]
    C --> D["物理先验专家<br/>MixRouter动态时间步分配多层VFM先验"]
    D --> E["频域谱损失<br/>FFT振幅与相位联合约束"]
    E --> F["输出高保真遥感图像<br/>光学图像 / SAR 图像"]

关键设计

1. 格拉斯曼挖掘器:基于流形测地线轨迹的文本语义解耦与时序迁移 传统文本编码器将文本嵌入视作欧式空间中的静态固定点,高方差的全局概念与细粒度微观概念发生特征纠缠,使细节在全局主导下被完全淹没。为了在不破坏几何正交性的前提下解耦多层次语义,SGP2 首先对文本嵌入矩阵 \(Y \in \mathbb{R}^{L \times D}\) 执行奇异值分解(SVD): $\(Y = U S V^\top\)$ 其中截断保留前 \(k\) 维正交基 \(U_k \in \mathbb{R}^{L \times k}\)。利用 SVD 的能量集中特性,前 \(k_1\) 维基向量 \(U_g \in \mathbb{R}^{L \times k_1}\) 囊括主导早期去噪的全局高方差语义锚点,而其余正交基向量 \(U_d \in \mathbb{R}^{L \times (k-k_1)}\) 则隔离表征容易被压制的微观细节。为了避免在欧式空间直接线性插值或缩放破坏矩阵正交性,SGP2 在格拉斯曼流形 \(\mathcal{G}\) 上沿测地线(最短路径)推进特征演进,针对子空间 \(U_i\)\(i \in \{g, d\}\))定义连续测地线轨迹: $\(U_i(\theta_i) = U_i \cos(\theta_i) + \Delta_i \sin(\theta_i)\)$ 其中切向量 \(\Delta_i\) 由时间步条件偏置项 \(Z_i = \text{MLP}(\tau) \cdot \text{AvgPool}(U_i)\) 投影至 \(U_i\) 的正交补空间归一化得到。进一步设计互补的时间调度函数 \(w_g(\tau) = \sin(\tau\pi/2)\)\(w_d(\tau) = \cos(\tau\pi/2)\),动态缩放演进步长 \(\theta_g = \alpha_g w_g(\tau)\)\(\theta_d = \alpha_d w_d(\tau)\),并通过对角算子 \(\hat{S} = S \odot \Gamma(\tau)\) 动态调制奇异值谱。重构演进特征 \(\hat{Y} = U_{final} \hat{\Sigma} V^\top\) 后,将增量 \(P = \hat{Y} - Y\) 经零初始化线性算子 \(W_p\) 注入扩散模型:\(Y_{out} = Y + P W_p\),既实现了从全局到微观细节的平滑迁移,又避免破坏预训练文本分布。

2. 物理先验专家:时间步感知的多层级视觉基座特征动态软路由 现有的表示对齐方法(如 REPA)通常仅将视觉基座模型(VFM)单一顶层的抽象语义与 DiT 进行刚性对齐,这无法提供遥感成像所需的微观几何物理约束。SGP2 设计了物理先验专家,在 DiT 特征金字塔与预训练 VFM(DINOv3)金字塔之间建立多层级协同对齐。其核心机制 MixRouter 根据归一化时间步 \(\tau = t/T\) 动态计算软分配权重矩阵: $\(W(\tau) = \text{Softmax}(\text{MLP}(\tau)) \in \mathbb{R}^{N_D \times N_V}\)$ 其中 \(W^{(i,j)}(\tau)\) 精确表征在时间步 \(\tau\) 时第 \(j\) 层 VFM 特征对第 \(i\) 层 DiT 特征的对齐权重。多级对齐损失定义为所有特征对余弦相似度的加权期望: $\(\mathcal{L}_{align} = \sum_{i=1}^{N_D} \sum_{j=1}^{N_V} W^{(i,j)}(\tau) \cdot [1 - \text{sim}(x_D^{(i)}, x_V^{(j)})]\)$ 在去噪初始阶段(\(t\) 较大),MixRouter 自适应向 VFM 深层(如 Layer 23)分配极大权重,引导模型学习宏观轮廓和全局场景分布;在去噪后期(\(t\) 较小),对齐重心平滑过渡到 VFM 浅层(如 Layer 1),为 DiT 注入边缘、纹理等微观物理几何先验。

3. 频域谱损失:振幅与相位联合约束的电磁物理保真 遥感影像在本质上是地表地物对入射电磁波的物理反射与散射记录,在空间域对齐的基础上必须具备合规的频域能量分布。SGP2 引入频域感知的谱损失 \(\mathcal{L}_{sp}\),通过二维快速傅里叶变换(FFT)将 DiT 特征 \(x_D\) 与 VFM 特征 \(x_V\) 映射至频域。首先通过对数平滑 L1 损失约束振幅谱,锚定全局能量分布与宏观辐射特性: $\(\mathcal{L}_{amp} = \left| \log(|\mathcal{F}(x_D)|) - \log(|\mathcal{F}(x_V)|) \right|\)$ 为了进一步约束遥感地物的严苛精细拓扑与高频几何边界,SGP2 计算复数信号实部与虚部绝对误差相对于 VFM 振幅的归一化损失: $\(\mathcal{L}_{st} = \frac{|Re(\mathcal{F}(x_D)) - Re(\mathcal{F}(x_V))| + |Im(\mathcal{F}(x_D)) - Im(\mathcal{F}(x_V))|}{|\mathcal{F}(x_V)| + \epsilon}\)$ 该项不仅度量了各频段的能量差异,更通过独立约束实部与虚部隐式实现了复数频域相位的严格对齐。最终通过时间步自适应加权组合: $\(\mathcal{L}_{sp} = w_s(\tau) \mathcal{L}_{amp} + (1 - w_s(\tau)) \mathcal{L}_{st}\)$ 其中 \(w_s(\tau) = \sin(\pi\tau/2)\)。在去噪前期由 \(\mathcal{L}_{amp}\) 主导能量均衡,后期平滑过渡至由 \(\mathcal{L}_{st}\) 主导高频结构与相位精确对齐。

损失函数 / 训练策略

SGP2 的整体联合训练目标函数包含三项: $\(\mathcal{L}_{total} = \mathcal{L}_{DiT} + \mathcal{L}_{align} + \mathcal{L}_{sp}\)$ 其中 \(\mathcal{L}_{DiT}\) 为整流流(Rectified Flow)框架下的基础去噪损失。训练采用两阶段方案:第一阶段在 MMEarth-1.5M 数据集的 1,198,845 个图文对上进行 2 个 epoch 的文本到图像预训练;第二阶段在 66,124 对严格配准的受控多模态(光学与 SAR)图像对上微调 5 个 epoch。优化器选用 CAME-8bit,预训练学习率为 \(4 \times 10^{-5}\),微调学习率为 \(1 \times 10^{-5}\),采用 bf16 混合精度训练,总迭代步数约 8.5 万步。推理时使用适配整流流的 Flow-DPM-Solver 采样器,仅需 20 步去噪即可生成高质量图像,无分类器引导(CFG)缩放因子设为 4.5。

实验关键数据

主实验

在 RSICD 测试集上评估文本到光学遥感图像生成质量(分辨率 \(512 \times 512\)),SGP2 在各指标上全面超越现有代表性方法;在 DFC25 验证集上进行的文本到 SAR 图像生成实验中,SGP2 亦在结构相似度与雷达特异物理指标上取得最优结果。

数据集 方法 IS↑ FID↓ CLIPs↑ OA(%)↑
RSICD 测试集 (光学) CRS-Diff (TGRS 2024) 18.39 50.72 20.33 69.21
RSICD 测试集 (光学) InstancedDiff (CVPR 2024) - 138.60 24.70 -
RSICD 测试集 (光学) Text2Earth (GRSM 2025) 18.17 53.15 22.62 68.27
RSICD 测试集 (光学) AeroGen(FT) (CVPR 2025) 16.83 58.12 22.31 66.72
RSICD 测试集 (光学) JoDI (ArXiv 2025) 4.28 181.36 20.23 22.74
RSICD 测试集 (光学) JoDI(FT) (ArXiv 2025) 18.03 57.24 21.46 67.59
RSICD 测试集 (光学) SGP2 (本文) 21.23 44.17 24.58 86.27

在 DFC25 验证集的 SAR 图像生成对比中,SGP2 的 SSIM 达到 0.569(对比 JoDI(FT) 的 0.513 提升 10.9%),PSNR 达到 23.14 dB,视数 ENL 达到 5.31,辐射分辨率 RaRes 降至 1.76

消融实验

在单条件光学遥感图像生成任务下,针对格拉斯曼挖掘器(GM)、物理先验专家(PPE)以及频域谱损失(\(\mathcal{L}_{sp}\))的逐步消融结果如下表所示(评估指标为各条件输入下的 FID):

配置 (GM / PPE / \(\mathcal{L}_{sp}\)) HED↓ MLSD↓ Dep.↓ Skh.↓ Seg.↓ Road↓ 平均 FID↓ 说明
基线 (✗ / ✗ / ✗) 64.7 66.5 65.1 60.6 64.7 69.3 65.15 纯 DiT 基准
仅加入 GM (✓ / ✗ / ✗) 61.7 66.2 63.9 59.3 62.4 66.1 63.27 测地线语义解耦
仅加入 PPE (✗ / ✓ / ✗) 55.8 57.4 56.2 56.8 60.9 61.3 58.07 多层级视觉先验注入
加入 PPE + \(\mathcal{L}_{sp}\) (✗ / ✓ / ✓) 55.1 54.7 53.8 53.2 57.9 59.6 55.72 频域物理谱约束增强
加入 GM + PPE (✓ / ✓ / ✗) 47.6 49.7 50.2 54.9 52.1 51.4 50.98 几何与多级特征对齐
完整模型 SGP2 (✓ / ✓ / ✓) 42.4 43.7 42.1 41.8 42.6 43.2 42.63 三模块全协同

针对格拉斯曼挖掘器(GM)内部关键机制的变体消融(平均 FID): - 完整 GM:42.6 - 去掉 SVD 分解(w/o SVD):45.8(恶化 3.2,表明特征解耦至关重要) - 不显式分离全局与细节子空间(w/o \(U_g\) & \(U_d\)):44.3(细节被全局淹没) - 去掉测地线演化轨迹(w/o geodesic trajectory):43.6(破坏正交几何结构) - 去掉动态奇异值谱调制(w/o \(\Gamma(\tau)\)):43.1(能量中心转移受阻)

关键发现

  • 模块协同增益明显:物理先验专家(PPE)提供了最显著的基础性能跃迁(平均 FID 从 65.15 降至 58.07),而在此基础上引入频域谱损失 \(\mathcal{L}_{sp}\) 和格拉斯曼挖掘器(GM)形成了深度互补,使草图(Sketch)与深度图(Depth)条件下的 FID 分别大幅降低了 31.0% 和 35.3%。
  • 语义解耦的直观可控性:固定全局基向量 \(U_g\) 能够牢牢锁定农田或运动场等宏观场景几何分布,而调节细节基向量 \(U_d\) 则可精确控制河流蜿蜒、跑道跑线等微观纹理的高保真重建,证明了流形正交分解有效解决了语义冲突。
  • 动态路由的时间步物理规律吻合:可视化表明 MixRouter 在去噪初期将权重集中分配于 DINOv3 第 23 层等深层语义特征,后期则无缝迁移至第 1 层浅层几何特征,精准契合了从粗糙轮廓构建到精细纹理填充的物理生成阶段需求。

亮点与洞察

  • 流形几何视角打破欧氏文本纠缠:传统文生图方法将文本向量作为欧氏空间固定点处理,SGP2 创新性地引入格拉斯曼流形及其测地线轨迹,在保持正交性的同时实现了“宏观到微观”注意力重心的无损时序迁移。
  • 软路由打破刚性单点表征对齐:摒弃传统 REPA 式单一层级特征蒸馏,通过 MixRouter 将去噪时间步作为路由条件,实现扩散模型不同阶段对视觉基座底层结构与高层语义的自适应按需汲取。
  • 复数频域相位约束保障拓扑保真:通过显式惩罚 FFT 变换后的实部与虚部误差,不仅约束了电磁能量的振幅分布,更隐式对齐了对地物轮廓边缘至关重要的相位信息,彻底抑制了遥感图像生成中的辐射畸变。

局限与展望

  • 计算开销与推理阶段先验断联:格拉斯曼流形上的切向量投影和多层级特征对齐虽在训练中表现出色,但特征投影与奇异值调制增加了单步训练计算耗时;且在纯无条件扩散推理中仍依赖预训练文本编码器基底。
  • 超高分辨率大尺度场景拼接:当前模型针对 \(512 \times 512\) 分辨率影像进行了两阶段训练,面对吉像素级全幅宽遥感卫星影像生成时,仍需进一步探索滑动窗口或金字塔分块拼合中的跨块物理相位一致性保持。

相关工作与启发

  • vs CRS-Diff / Text2Earth: CRS-Diff 与 Text2Earth 依赖传统 ControlNet 架构或静态提示词微调,在面对长文本细节与复杂地物时容易产生语义遗漏与局部几何畸变。SGP2 通过流形测地线轨迹解耦和频域谱损失约束,在各项指标上实现大幅领先(RSICD 上 FID 由 50.72 降至 44.17)。
  • vs REPA / 表征对齐方法: 传统 REPA 仅在固定单一顶层对齐 DINO 特征,忽略了浅层几何拓扑;SGP2 的 Physical Prior Expert 采用时间步自适应软路由并扩展至频域幅相约束,为扩散模型表征引导提供了多层级、全频段的新范式。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 创新性地将格拉斯曼流形测地线演化与频域幅相谱约束引入遥感多模态扩散生成,架构设计精巧严谨。
  • 实验充分度: ⭐⭐⭐⭐⭐ 构建了 150 万规模的 MMEarth-1.5M 数据集,横跨光学与 SAR 模态,在单条件、多条件与文本生成上进行了详尽的主客观及消融评估。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,数学推导完备,问题定义与模块设计的对应关系极其清晰。
  • 价值: ⭐⭐⭐⭐⭐ 为遥感领域提供了由粗到精可控生成的新基线以及极具价值的大规模严格配准多模态数据集。