跳转至

Foundation Model Selection for Remote Sensing via a Constraint-Aware Agent

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/be-chen/REMSA
领域: 遥感 / LLM Agent / 语义分割
关键词: 遥感基础模型, 模型选择, 智能体, 约束感知, 知识库

一句话总结

针对遥感领域基础模型激增且文档异构分散导致选型困难的痛点,本文构建了涵盖160余个遥感基础模型的结构化数据库RS-FMD,并提出了首个约束感知智能体Remsa,通过元数据对齐、动态编排、规则过滤与上下文排序实现自动化、高可解释的遥感模型精准推荐。

研究背景与动机

随着对地观测技术的飞速发展与高频卫星星座的部署,多源遥感传感器(如Sentinel-2多光谱、Sentinel-1合成孔径雷达SAR、EnMAP高光谱以及机载LiDAR等)每天都在产生海量多源数据。为了摆脱传统遥感分析对大量下游精标注数据的依赖,遥感基础模型(RSFM)迅速崛起,涵盖了单模态视觉编码器(如MMEarth、MA3E)、跨传感器模态融合架构(如OmniSat)以及多模态视觉语言模型(如GeoText、LHRS-Bot、SkySense等)。这些模型具有不同的预训练目标、空间-光谱-时序分辨率与架构设计,分别在农作物分类、水体提取、地表覆盖变化检测、灾害评估以及遥感视觉问答(VQA)等下游任务中表现出独特的适应优势。

然而,在面对实际遥感业务系统部署时,如何为具体任务挑选最适宜的遥感基础模型却面临极其严苛的瓶颈。不同于通用计算机视觉领域,遥感应用具有强烈的现实约束:传感器模态与波段配置多样、时空分辨率与地理跨度异质、计算与显存预算有限、标注样本高度稀缺,且各模型文档散落于学术论文、开源仓库与模型卡片中,缺乏统一结构化表征。现有评测基准(如GEO-Bench-2)通常局限于固定下游任务与测试集的端到端微调精度对比,而AutoML系统又无法解析开放式的自然语言部署诉求,导致遥感从业者往往依赖耗时费力的人工筛查或盲目调优,选型过程缺乏透明度与可复现性。

解决该问题的核心在于将开放自然语言交互与严谨的领域知识结构化表征紧密结合,在满足硬性工程约束的前提下权衡模型能力与资源开销。核心 idea:构建首个包含160余个模型元数据的结构化遥感基础模型数据库RS-FMD,并设计约束感知智能体Remsa,通过“意图解析-密集检索-硬约束过滤-上下文排序-交互式澄清-可解释报告”闭环,实现自然语言驱动的自动化与可信遥感基础模型选型。

方法详解

整体框架

Remsa采用模块化智能体架构,整体输入为用户以自然语言表达的遥感任务诉求与环境限制,输出为兼具排序置信度与技术依据的Top-\(k\)推荐候选及透明解释报告。系统核心包含大语言模型智能体中枢(解析器与任务编排器)以及一系列解耦的外部专业工具箱。解析器(Interpreter)负责将自由文本映射为包含任务类型、数据模态等强制字段与计算预算、微调需求等可选字段的结构化约束;任务编排器(Task Orchestrator)则基于约束完备度、候选集规模及排序置信度动态调度外部工具执行流水线,并借助向量任务记忆(Task Memory)沉淀用户历史偏好。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["用户自然语言查询与部署约束"] --> B["结构化元数据提取与双重置信度人机协同<br/>RS-FMD数据库构建与置信校验"]
    A --> C["意图解析与任务感知动态编排控制环<br/>解析强制与可选约束并自适应调度"]
    B -.-> D["结构化密集检索<br/>Sentence-BERT与FAISS高召回检索"]
    C --> D
    D --> E["规则硬约束过滤与少样本上下文偏好排序<br/>确定性硬约束剔除与LLM重排"]
    E -->|置信度不足或约束缺失| F["渐进式多轮澄清与记忆增强持久化<br/>针对性提问更新任务规范"]
    F --> C
    E -->|满足终止条件| G["可解释推荐报告生成<br/>输出选型结论、推理链与开源资源"]

关键设计

1. 结构化元数据提取与双重置信度人机协同:统一160+遥感基础模型的异构表征

针对遥感模型文档分散于论文、Model Card及GitHub代码库且缺乏统一机器可读格式的痛点,该设计提出了遥感基础模型数据库RS-FMD(Remote Sensing Foundation Model Database)。为了从非结构化文献中高保真地提取包括传感器波段、预训练模态、空间-时间分辨率、参数量、开源权重链接及下游报告基准等字段,系统采用半自动化抽取流水线。为杜绝虚假幻觉对下游决策的误导,引入了结合单步生成对数概率与多轮采样自洽性的场感知置信度评分机制:

\[ \text{Confidence} = w_{\text{logp}} \cdot \text{NormalizedLogProb} + w_{\text{cons}} \cdot \text{SelfConsistency} \]

其中对数概率通过温度系数 \(\tau=0.5\) 的Sigmoid函数归一化以维持敏感区间,设定经验权重 \(w_{\text{logp}}=0.7\) 与 \(w_{\text{cons}}=0.3\)。当某个字段的置信度低于阈值 \(\theta=0.75\) 时,系统仅对该不确定字段触发人工校验,从而在保证高质量元数据沉淀的同时显著减少人工标注负担。

2. 意图解析与任务感知动态编排控制环:自适应决策与约束驱动的状态转移

传统的通用Agent往往依赖无约束的单步规划或死板的预设流水线,难以应对遥感任务中模糊、残缺的自然语言输入。Remsa在中枢构建了解析器(Interpreter)与任务编排器(Task Orchestrator)。解析器通过严格的Schema提示词将非结构化输入结构化,强制提取“目标应用场景”(如水体分割、地物分类)与“输入模态”(如SAR、多光谱、光学高分),同时捕获计算显存、标注数据规模与精度优先级等软约束。编排器维护一个状态机,每一步持续评估约束完备度、候选集基数与重排置信度:当强制约束不全时阻断检索;候选过多时激活澄清;候选过少或硬约束违背时触发“最近兼容匹配”兜底策略,实现自适应动态调度。

3. 规则硬约束过滤与少样本上下文偏好排序:两阶段混合候选精筛与排序

密集检索(Retrieval Tool)利用Sentence-BERT为字段注入类型标识符(如 [APPLICATION]、[MODALITY]),在FAISS中进行余弦相似度粗筛以保证高召回。然而,粗筛结果无法精确对齐复杂的工程部署约束。排序工具设计了“确定性硬过滤 + 少样本上下文排序”的混合架构:首先通过硬规则强行剔除模态不匹配(例如用户输入SAR数据但模型仅支持RGB输入)或超出硬件预算的候选;随后,提示LLM结合领域专家精选的Few-shot范例,就候选模型的预训练数据广度、报告性能证据与下游迁移成本展开In-Context推理,输出具有相对优势差异的排序列表与打分置信度。

4. 渐进式多轮澄清与记忆增强持久化:人机交互细化与长效偏好沉淀

在实际场景中,非专业用户往往无法一次性提供完整技术参数(如未指明空间分辨率或计算卡型号)。澄清生成工具(Clarification Generator Tool)根据解析Schema反查未定义字段,主动生成针对性选择题或简答提示,最多交互3轮以避免交互疲劳。用户补充的信息无缝回填至任务规范中触发重排。同时,系统引入基于轻量向量数据库的Task Memory模块,通过余弦相似度检索用户过往历史项目偏好与部署约束,实现跨会话的快速初始化与个性化选型推荐。

一个完整示例

假设用户输入模糊需求:“我想用卫星影像做洪涝水体提取,但只有笔记本单卡RTX 4090算力”。 1. 解析阶段:解析器提取目标应用为“水体分割/变化检测”,计算预算为“单卡24GB”,但缺少“传感器模态”与“空间分辨率”定义。 2. 澄清阶段:澄清模块主动询问:“请问您的输入数据是Sentinel-1 SAR雷达数据还是Sentinel-2多光谱光学影像?是否包含时序序列?”用户回复:“使用Sentinel-1的双极化SAR影像”。 3. 检索与硬过滤:检索模块初筛出20个候选模型,规则过滤阶段果断剔除纯光学模型(如MA3E、GeoText)和参数超大规模的集群模型,保留支持SAR的多模态与SAR专用模型(如OmniSat、SkySense-SAR等)。 4. 上下文重排与解释:排序模块基于少样本提示对比剩余候选在SAR水体提取任务中的已验证表现及显存占用,最终推荐OmniSat与SkySense,并生成包含GitHub权重链接和显存适配理由的结构化选型报告。

实验关键数据

主实验

论文构建了由遥感与机器学习领域专家联合验证的基准数据集,包含100个涵盖多时相、多模态、差异化计算预算的真实自然语言查询场景。评测采用7项专家评分准则(应用匹配度、模态适配度、报告性能、推理效率、知名度、泛化能力、时效性),满分线性映射至1-100分。实验对比了Remsa与三种基线系统: - Remsa-Naive:移除动态编排机制,采用LangChain默认的单步Agent; - DB-Retrieval:仅基于FAISS对RS-FMD进行密集语义检索,无LLM排序与约束推理; - Unstructured-RAG:通用RAG方案,直接向LLM输入非结构化模型卡片与文档进行自由推荐。

各系统在主干模型为GPT-4.1下的评测结果如下表所示:

系统 平均Top-1得分 (Avg Top-1) 平均候选集得分 (Avg Set) Top-1命中率 (Top-1 Hit) 高质量命中率 (HQ Hit \(\ge 80\)) 平均倒数排名 (MRR)
Remsa (本文) 75.76 75.03 21.33% 40.00% 0.34
Remsa-Naive 72.67 72.00 20.00% 37.33% 0.29
Unstructured-RAG 71.23 68.39 13.33% 30.67% 0.24
DB-Retrieval 67.37 68.87 12.00% 17.33% 0.23

在不同LLM主干模型(DeepSeek-V3.2 与 LLaMA-3.3-70B)下的鲁棒性对比:

主干模型 系统 平均Top-1得分 平均候选集得分 Top-1命中率 高质量命中率 MRR
DeepSeek-V3.2 Remsa (本文) 75.35 73.81 18.67% 40.00% 0.30
DeepSeek-V3.2 Remsa-Naive 72.03 71.83 16.51% 36.89% 0.26
DeepSeek-V3.2 Unstructured-RAG 69.19 70.94 10.67% 24.00% 0.24
DeepSeek-V3.2 DB-Retrieval 67.37 68.87 12.00% 17.33% 0.23
LLaMA-3.3-70B Remsa (本文) 73.39 70.34 14.67% 32.00% 0.26
LLaMA-3.3-70B Remsa-Naive 69.02 69.00 14.23% 29.47% 0.24
LLaMA-3.3-70B Unstructured-RAG 69.87 68.04 10.00% 26.67% 0.22
LLaMA-3.3-70B DB-Retrieval 67.37 68.87 12.00% 17.33% 0.23

消融实验

为明确专家评测准则各维度对模型选型质量的影响机制,论文针对7项核心指标进行了逐项剔除的敏感性消融分析(基于GPT-4.1):

评分准则设置 平均候选集得分 (Avg Set) Top-1命中率 (Top-1 Hit) 平均倒数排名 (MRR) 影响说明
全准则完整评分 (Full Scoring) 75.03 22.67% 0.38 基准配置
剔除 应用匹配度 (w/o Application Compatibility) 73.32 21.33% 0.36 指标显著下降,印证模型功能定位对选型的绝对权重
剔除 模态适配度 (w/o Modality Match) 70.88 22.67% 0.36 综合得分大幅下滑4.15分,模态兼容性是首要物理约束
剔除 报告性能 (w/o Reported Performance) 75.05 22.67% 0.38 变动微弱,文献报告数据易被模态和架构特征间接覆盖
剔除 推理计算效率 (w/o Efficiency) 80.23 25.33% 0.38 评分上升,表明受限硬件约束会对大参数高性能模型形成惩罚
剔除 知名度与时效性 (w/o Popularity + Recency) 75.13 25.33% 0.39 评分微增,说明Remsa专注技术适配而非盲从开源星数和发表时间
剔除 泛化能力 (w/o Generalizability) 75.10 22.67% 0.38 波动微小,说明预训练数据量已被模态及应用能力充分表征

关键发现

  • 结构化元数据的决定性价值:仅依赖非结构化文本检索的Unstructured-RAG和仅做向量余弦匹配的DB-Retrieval在高质量命中率(HQ Hit)上均不足31%,而引入结构化数据库RS-FMD并配合规则硬过滤后,Remsa将HQ Hit大幅推升至40.00%,MRR提升近50%。
  • 动态编排与多轮澄清的必要性:对比Remsa与Remsa-Naive可见,在相同工具与知识库下,动态控制环使Avg Top-1提高3.09分,MRR由0.29提升至0.34,证明自适应状态机在处理不完全信息和触发澄清问题时的关键作用。
  • 主干无关的泛化鲁棒性:在商业闭源模型GPT-4.1与开源模型DeepSeek-V3.2、LLaMA-3.3-70B上,Remsa均系统性优于所有基线,且DeepSeek-V3.2在HQ Hit上达到了与GPT-4.1完全相同的40.00%,展现了极强的开源落地潜力。
  • 运行延迟权衡:DB-Retrieval耗时0.77秒,Unstructured-RAG耗时11.9秒,Remsa-Naive耗时22.7秒,而Remsa端到端平均延迟为31.7秒。多轮澄清与两阶段推理带来的少量时间开销换取了决策可用性的跃升。

亮点与洞察

  • 将下游盲目调优转化为上游决策自动化:首次系统化定义了遥感基础模型选型问题,避开了对160+模型全部进行下游高成本微调评测的不可行路线,以结构化智能体充当架构选型先验。
  • 双重置信度人机协同元数据清洗:融合生成对数概率与采样自洽性构建打分指标,仅对低于0.75置信度的元数据字段发起人工核验,为构建高质量领域大模型数据库提供了极佳范式。
  • 拒绝表面指标绑架的实用主义决策:敏感性实验表明,系统在剥离GitHub Star和发表年份后选型质量不降反升,证明其推理机制深入到了传感器波段兼容、分辨率匹配与显存硬约束等底层物理机理,而非简单的热点跟风。

局限与展望

  • 作者承认的局限:基准测试包含100个专家验证的查询场景,虽耗费了3,000次高强度人工评分,但对某些极端罕见的地球科学应用覆盖仍有欠缺;排序阶段依赖In-Context Learning而非监督学习或强化学习调优,对极复杂多目标权衡可能存在精度瓶颈。
  • 自身发现的局限:目前的RS-FMD库中各模型报告性能多来源于各自原论文,由于各研究测试集划分与预处理协议不统一,不同模型间的reported performance存在固有偏差,可能间接干扰轻量化对比。
  • 可改进方向:可进一步接入轻量级代码试跑沙盒或性能代理模型(Performance Predictor),根据少量样本快速探测特征适配度;同时探索动态扩展至其他多模态领域(如医疗多模态、自动驾驶多传感器)的选型迁移。

相关工作与启发

  • vs GEO-Bench / GEO-Bench-2 等评测基准:GEO-Bench聚焦于固定下游数据集的统一微调表现,属于事后静态标杆;Remsa聚焦于事前动态选型,解决用户真实业务中硬件、数据缺失与模态混合等异构约束匹配问题。
  • vs GeoLLM-Squad / RS-Agent 等遥感智能体:既有遥感智能体通常作为对地观测信息解译助手,调度工具完成图像检测或VQA;Remsa则是首个元决策型(Meta-Decision)模型选型智能体,赋能整个遥感深度学习研发管线上游。
  • vs 传统AutoML(Auto-WEKA, Auto-sklearn):传统AutoML在受限超参数空间或规则管道内通过贝叶斯优化搜索,无法理解自然语言表述和处理高维非结构化基础模型权重的复杂元数据,Remsa填补了基础模型时代领域选型智能体的空白。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ [首次提出针对遥感基础模型的结构化数据库与约束感知选型Agent,问题定位新颖且具有极高工程实用价值]
  • 实验充分度: ⭐⭐⭐⭐⭐ [构建100个真实专家场景并完成3,000次双盲细粒度打分,涵盖多LLM主干与详细指标敏感性分析]
  • 写作质量: ⭐⭐⭐⭐⭐ [概念阐述清晰,系统设计模块化透彻,图表规整且分析深入入理]
  • 价值: ⭐⭐⭐⭐⭐ [开源数据库与智能体工具链直击遥感大模型落地痛点,极大降低了交叉学科研究人员的技术门槛]