MMEarth-Bench: Global Model Adaptation via Multimodal Test-Time Training¶
会议: ECCV 2026
论文: ECCV 官方页面
项目: MMEarth-Bench
领域: 遥感
关键词: 地球观测、多模态重建、测试时训练、地理泛化、长尾分布
一句话总结¶
MMEarth-Bench 用五个全球环境任务和十二种对齐模态检验遥感模型的地理泛化,并通过测试时重建这些模态来调整编码器;相对联合训练基线,TTT-MMR 在各任务与两种测试划分的汇总评估中获得改善,地理分批尤其有助于长尾样本。
研究背景与动机¶
遥感领域已有大量利用无标签地球观测数据预训练的模型,但「见过全球影像」并不意味着「能把在一个地区学到的环境预测规律迁移到另一个地区」。生物量和土壤性质等标签往往来自稀疏的实地测量,地域分布不均,而且同样的光学外观可能对应不同的生态条件。只看随机划分的准确率,既难以暴露跨地区失效,也难以判断额外传感器、气候或地形信息是否真正消除了预测歧义。
已有基准通常每项任务仅提供少数模态,或只覆盖局部地区,难以让不同多模态模型在统一的全球条件下比较。本文因此先构建所有任务共享十二种模态的数据集,把整个非洲留作地理测试域。实验又暴露出另一种浪费:下游数据即使有丰富模态,预训练编码器也只能接受其原本支持的输入;把其余模态丢弃,意味着部署时可用的环境信息没有参与预测。
直接改造每个编码器以输入全部模态会破坏模型无关性,而根据目标预测生成伪标签又容易把现有错误强化。本文转而利用这些模态自身已有的观测值作为辅助监督,例如用树冠高度的重建误差帮助调整生物量预测表征,无须知道测试样本的真实生物量。核心 idea:让任意编码器仍接收兼容的输入,把所有可用模态转为测试时的重建目标,并以逐模态归一化梯度和地理分批获得有针对性、较稳定的适应信号。
方法详解¶
整体框架¶
本文同时贡献一个评测基准和一个适应方法,二者不应混为新的遥感基础模型。MMEarth-Bench 定义任务、模态及地理划分;TTT-MMR 在已有编码器后增加主任务解码器与模态解码器,先联合训练,再利用无主任务标签的测试批次更新编码器,最后输出环境变量或物种出现预测。
编码器输入始终是它支持的模态子集,十二种辅助模态则充当重建目标。下图中的训练标签只参与联合训练,测试阶段不使用主任务标签;TTT-MMR-Geo 改变的是批次组成,不是增加一个新的编码分支。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
benchmark["全球多模态基准"] -->|非非洲训练数据与标签| joint["双头联合训练"]
benchmark -->|测试观测与坐标| batch["地理邻近分批"]
joint -->|提供每批初始模型| adapt["均衡重建适应"]
batch -->|无主任务标签的批次| adapt
adapt -->|固定主任务头| output["环境任务预测"]
output -->|下一批恢复联合训练状态| adapt
关键设计¶
1. 全球多模态基准:把少标签、模态歧义和地理偏移放在同一评测中
每个图块为 \(128\times128\) 像素,地面分辨率为 10 m,覆盖约 1.6 平方公里;任务内图块互不重叠,数据是单时间戳而非时间序列。五项任务分别是像素级地上生物量回归、图块级土壤氮含量、土壤有机碳、土壤 pH 回归,以及 100 种陆生哺乳动物的多标签出现预测。表 2 给出的图块数依次为 18,393、5,643、7,982、8,508 和 36,410。生物量源于 GEDI,土壤源于 WoSIS 的 0–5 cm 深度记录,物种标签来自 IUCN 分布范围多边形,因此物种任务不是直接验证某时刻的实地目击。
十二种模态包含六种像素级数据:Sentinel-2、Sentinel-1、ASTER GDEM、ETH Canopy Height、Dynamic World、ESA WorldCover;以及六种图块级数据:降水、温度、经纬度、Sentinel-2 日期、生物群系和生态区。这里的「模态」也包括元数据和派生产品,并不意味着十二种独立传感器。非洲全部用于地理测试,其余地区按 70%/15%/15% 划为训练、验证和随机测试;另设相互嵌套的 5%、50% 训练子集。这个协议检验的是全球预训练后在非非洲标签上微调的迁移能力,不保证预训练阶段从未接触非洲无标签数据。
2. 双头联合训练:先建立环境任务与模态重建共享的表征
一个编码器同时连接主任务头和线性模态解码器。主任务头对图块级任务采用全局平均池化、LayerNorm 和全连接层,对像素级生物量任务则先双线性上采样,再使用 \(1\times1\) 卷积。模态解码器同样上采样并经 \(1\times1\) 卷积重建所有模态通道,对图块级模态再做全局平均池化。连续模态使用 MSE,类别模态使用交叉熵;这样不同任务与骨干可以共享一套辅助训练接口,而不必把所有模态塞进编码器。
联合训练时,编码器接收主任务损失与平均模态重建损失之和,两个头分别学习对应任务。这个阶段的作用不是额外预训练一个万能融合网络,而是让重建误差能够通过已学好的解码器作用于与主任务有关的编码表征。单独保留这个训练阶段、测试时不更新参数,就是 JT 基线;因此 JT 与 TTT 的比较能分离出「部署时适应」的收益,而不把辅助训练本身的改善都算给 TTT。
3. 地理邻近分批:让同一更新服务于相似的局部环境
标准 TTT-MMR 把测试图块随机分成不重叠批次;TTT-MMR-Geo 则用类似 k-d tree 的递归空间划分,把邻近图块组织成地理连续的批次,实验批大小为 8。随机批次具有较强正则化,因为更新要同时照顾不同地区;但罕见生态环境的梯度可能被常见样本稀释。地理批次更有机会聚集相似图块,让更新专门适应一个局部环境。
这种分批不根据测试标签挑选样本,也不是用经纬度预测伪标签。它只是用空间邻近性作为样本相似性的代理,与普通重建适应保持相同模型和目标。其收益取决于任务与骨干:局部专门化可能帮助长尾,却也减少跨地区样本带来的约束,因此不能预设地理分批处处优于随机分批。
4. 均衡重建适应:避免一个大尺度模态主导编码器更新
测试时先对每个模态计算批内平均重建损失,再分别求其相对于编码器参数的梯度;把每个模态梯度归一化后,才在可用模态间求平均并做 SGD 更新。缺失模态排除在适应信号之外。温度、地形、类别分布具有不同单位和损失尺度,直接把损失相加可能让梯度最大的模态主导更新;这里均衡的是各模态的梯度贡献,而不是宣称各模态对主任务同样可靠。
用 \(R_m\) 表示模态 \(m\) 的批内平均重建损失,\(\theta\) 表示编码器参数,\(\mathcal{M}_{\mathrm{avail}}\) 表示可用模态集合,更新机制可整理为:
该式按正文重述归一化后求平均的机制;缓存中的公式排版有损,不额外推定范数类型或零梯度稳定项。测试适应固定模态解码器,迫使误差通过编码器改变表征,主任务头也不参与更新。完成当前批次预测后,编码器恢复到联合训练结束时的状态,防止前一批的适应累积污染后一批;它不是沿整个测试集持续学习的在线模型。
一个完整示例¶
以一个只接受 RGB 的骨干预测非洲某地区生物量为例。训练时,它用非非洲标签学习生物量预测,同时从 RGB 表征重建树冠高度、地形、气候等模态;不会因为多了辅助模态就把输入层改成十二模态输入。
部署时,TTT-MMR-Geo 把最多 8 个邻近图块组成一批。模型从 RGB 产生模态重建,用已有的树冠高度等观测计算重建误差,按照上述规则调整编码器,然后经固定生物量头输出预测。真实生物量不进入这个过程;下一个地区开始前重置编码器。这里说明的是数据流,不是声称某个具体图块获得了原文未报告的误差下降。
损失函数 / 训练策略¶
联合训练的主任务损失对四项回归采用 MSE,对物种出现采用 BCE with logits;辅助目标是各模态重建损失的平均值。训练阶段更新编码器和两个解码器,测试阶段仅使用重建信号更新编码器,不能把梯度归一化规则误写成对原始模态值做统一归一化。
测试适应使用 SGD、学习率 \(10^{-2}\)、批大小 8。验证时每批尝试最多 5 次迭代,取各验证批最佳迭代次数的平均值用于测试;不是用测试标签决定何时停止,也不意味着每个测试批都固定运行 5 次。模型训练检查点同样由验证集性能选出。
基准比较 8 个预训练模型与 2 个随机初始化 ConvNeXtV2A 变体。后者的全模态版本把类别模态 one-hot 编码、把图块级变量广播为空间通道,最终形成 926 通道输入;这是强监督基线,与 TTT-MMR 通过重建目标利用模态是两条不同路线。所有骨干采用线性任务头并全参数微调,输入沿用各预训练模型的归一化方式,或使用训练集统计量;实验使用 NVIDIA H200 140GB GPU。
实验关键数据¶
主实验¶
回归性能指标为 \(R^2\),物种任务为 mAP。下表摘录原文表 5 的随机测试结果,数值是对五项任务及随机种子平均后的「三种训练/适应策略内排名」,越小越好,误差为标准误;并非模型之间的总排名,也不是性能百分比。
| 骨干模型 | JT | TTT-MMR | TTT-MMR-Geo |
|---|---|---|---|
| ConvNeXtV2A | 2.9 ± 0.1 | 2.1 ± 0.1 | 1.1 ± 0.1 |
| Scale-MAE | 3.0 ± 0.0 | 1.8 ± 0.1 | 1.2 ± 0.1 |
| DINOv3 Sat | 3.0 ± 0.0 | 1.7 ± 0.1 | 1.3 ± 0.1 |
| MPMAE | 3.0 ± 0.0 | 1.6 ± 0.1 | 1.4 ± 0.1 |
| TerraMind | 3.0 ± 0.0 | 1.5 ± 0.1 | 1.5 ± 0.1 |
| Galileo | 2.2 ± 0.2 | 1.7 ± 0.1 | 2.1 ± 0.2 |
这些结果表明,额外模态不必成为编码器输入才能帮助预测;RGB 骨干也能受益。但 Galileo 的随机测试结果提醒我们:地理分批相对 JT 有改善,并不代表它比随机分批更强。
消融实验¶
原文表 5 同时提供地理测试上的分批策略对照。这里把它作为适应策略分析,而不是虚构「去掉梯度归一化」或「去掉某个模态」的独立消融数值。
| 骨干模型 | JT | 随机分批 TTT-MMR | 地理分批 TTT-MMR-Geo |
|---|---|---|---|
| ConvNeXtV2A | 3.0 ± 0.0 | 1.5 ± 0.1 | 1.5 ± 0.1 |
| Scale-MAE | 2.8 ± 0.1 | 1.9 ± 0.2 | 1.3 ± 0.1 |
| DINOv3 Sat | 3.0 ± 0.0 | 1.5 ± 0.1 | 1.5 ± 0.1 |
| MPMAE | 2.7 ± 0.2 | 2.0 ± 0.1 | 1.3 ± 0.2 |
| TerraMind | 2.9 ± 0.1 | 1.7 ± 0.1 | 1.3 ± 0.2 |
| Galileo | 2.9 ± 0.1 | 1.6 ± 0.1 | 1.5 ± 0.2 |
关键发现¶
- 图 7 对每个任务和划分的模型/种子分布进行单侧 Wilcoxon 检验,经 Holm-Bonferroni 校正后均达到 \(p<0.05\)。这支持汇总层面的改善,不意味着每个单独运行都严格获益。
- 全量训练、随机测试时,从头训练的全模态 ConvNeXtV2A-MM 按跨任务平均排名列第 1;仅用 5% 训练数据时仍列第 4。额外观测本身可能比更大规模的预训练更关键,但低样本条件下预训练优势更明显。
- 五项任务中,除生物量外,其余四项均出现明显地理泛化下降;土壤有机碳在 5% 训练数据的随机测试中,所有模型的 \(R^2\) 均不为正。地理泛化与低样本难题并未被 TTT 完全解决。
- 图 8 用单个种子、汇总所有模型分析长尾:地理分批减轻罕见回归目标的低估,随机测试中也更有利于罕见物种。此处不从损坏的图中文字估读精确残差。
亮点与洞察¶
- 将额外模态作为监督目标而非模型输入,使输入不兼容的骨干也能利用部署时信息。这是一种通过梯度进行信息传递的适应方式,不要求重新设计多模态融合架构。
- 地理分批把批次组成提升为适应算法的一部分。它利用真实空间结构保护罕见样本的更新方向,而不仅仅调整损失权重。
- JT 基线与从头训练的全模态基线都很重要。前者区分辅助训练和测试更新的贡献,后者避免把输入信息量带来的收益一律归于预训练。
局限与展望¶
- 作者明确将数据集定位于系统评测,而不是构建最优任务专用模型;单时间戳设置不能代表时序遥感建模,地理迁移也只以非洲作为整体留出域。
- 方法需要测试时取得额外模态并执行反向传播。缺失模态可排除,但大规模缺失、错误配准和劣质辅助产品会如何影响适应,当前正文没有给出充分量化证据。
- 等权归一化减少尺度支配,却不能保证辅助梯度与主任务方向一致。本文声称归一化提高稳定性,但所读正文未给出独立数值消融,不应把这一机制的单独贡献量化。
- 缓存包含正文和参考文献,未包含文中提到的附录;更完整的超参数、线性探测结果和额外模型级增益不在本笔记的证据范围内。正文也不足以精确比较部署延迟和反向传播成本。
- 数据许可并不统一:表 2 中生物量为 CC BY,土壤任务为 CC BY-NC,物种任务遵循其使用条款。进一步应用需要分别核查许可与标签含义,不能将分布范围直接当作实地出现真值。
相关工作与启发¶
- 相对 MMEarth / MPMAE:沿用十二种模态的思路,但把模态重建从预训练任务扩展到任意骨干的测试时适应。已经用这些模态预训练的 MPMAE 仍可获益,说明适应不只是补充未见过的模态。
- 相对 TENT:TENT 通过预测熵最小化调整批归一化相关参数,天然更贴近分类;本文使用观测模态重建并更新编码器,可覆盖四项回归任务和不含 BatchNorm 的 Transformer。
- 相对 UDA-SS:UDA-SS 在训练阶段引入无标签目标域数据,本文的下游联合训练不访问目标域数据,直到测试时才使用它们;全球预训练是否接触过该地区是另一个层面,不能混淆。
- 相对 READ:READ 在编码并融合各模态时处理可靠性偏差,本文不要求把辅助模态编码为输入。值得进一步研究的是在保留这一兼容性的前提下,利用模态可靠性和地理相似性共同控制适应。
评分¶
- 新颖性: 4/5。统一全球基准与模型无关多模态测试监督有明确价值,方法建立在联合训练和 TTT 的已有框架上。
- 实验充分度: 4/5。覆盖五任务、两划分、十个模型配置与统计检验,但正文缺少梯度归一化、模态缺失和运行成本的独立量化。
- 写作质量: 4/5。问题、基准和方法衔接清楚,但应谨慎区分平均排名、绝对性能以及汇总改善的适用范围。
- 价值: 4/5。为遥感基础模型提供更接近地理部署条件的评测与适应基线,适用性仍取决于测试模态可得性。