跳转至

GeoSolver: Scaling Test-Time Reasoning in Remote Sensing with Fine-Grained Process Supervision

会议: ECCV2026
论文: ECCV 原文
代码: https://github.com/minglangL/GeoSolver
领域: 遥感 / 视觉语言推理
关键词: 过程奖励模型、视觉忠实性、树状强化学习、测试时计算、遥感问答

一句话总结

GeoSolver 用高熵树搜索和视觉幻觉注入训练词元级 GeoPRM,再将其接入过程感知 Tree-GRPO 与测试时搜索,使遥感模型不仅优化最终答案,也受到中间视觉证据的约束;原文表 3 中,生成预算为 32 时视觉定位得分由 58.19 提升至 68.04。

研究背景与动机

遥感视觉语言模型面对的不是普通照片里几个显眼物体,而是俯视影像中尺度差异很大、外观相近且密集排列的目标。 回答“有多少架飞机”之前,模型需要找到候选目标、检查位置,再排除重复或误认。 GeoChat、VHM 等模型已经能进行领域问答,但输出一个正确数字,并不能说明它真的找对了图中的目标。 RS-EoT、GeoZero 等工作进一步引入思维链,让模型先收集视觉证据再作答;问题随之从“能否解释”转为“解释是否忠实”。 如果模型写出不存在的坐标,最后却碰巧得到正确计数,只看答案的训练仍可能奖励这条错误路径。

结果奖励的这种盲区,在强化学习中表现为信用分配困难:整段推理得到一个分数,却不知道哪一步开始偏离图像。 直接引入过程奖励也不一定解决问题,因为较长推理更容易包含低分片段,模型可能通过缩短回答来规避惩罚。 通用数学验证器擅长检查符号推导,却未必能识别遥感图像中边界框偏移、目标属性错误和密集空间关系。 因此,本文同时需要解决监督数据、奖励使用方式和探索效率,而不只是给现有模型增加一个评分器。

GeoSolver 将这三个问题连接起来:用模型自身的搜索发现逻辑分歧,用人为扰动补足视觉错配,再让验证信号影响训练和测试时的路径选择。 最终得到的 GeoSolver-9B 是回答问题的策略模型,GeoPRM 则是检查候选推理的独立验证器,两者职责不同。 验证器还能服务其他生成模型,这使领域知识不必全部通过重新微调生成模型来注入。 核心 idea:学习能定位视觉推理错误的过程验证器,并通过置信度骤降惩罚和树状信用分配,把额外计算用于保留有视觉依据的推理路径。

方法详解

整体框架

输入是一幅遥感图像和一个自然语言问题,输出可以是计数、边界框、场景类别、问答答案或图像描述。 策略模型以 GLM-4.1V-9B-Base 为基础,先在 Geo-CoT380k 上学习包含规划、视觉证据收集与综合回答的推理格式。 其 Aimv2-Huge 视觉编码器支持可变分辨率和宽高比,语言端使用 3D-RoPE;这些是沿用的基础模型能力,而非本文新提出的视觉骨干。 真正的新增机制依次是双源过程数据、词元级 GeoPRM、过程感知 Tree-GRPO,以及 GeoPRM 引导搜索。 训练时,真实答案用于构造监督标签和结果奖励;测试时,不再使用真实答案,而由验证器对生成内容作判断。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
        DATA["Geo-CoT380k<br/>图像、问题与标注"] -->|SFT 与离线构造| BUILD["双源过程数据"]
        BUILD --> VERIFY["词元级 GeoPRM"]
        VERIFY -->|训练时验证反馈| TRAIN["过程感知<br/>Tree-GRPO"]
        DATA -->|SFT 策略与结果监督| TRAIN
        TRAIN -->|GeoSolver-9B| SEARCH["GeoPRM 引导搜索"]
        VERIFY -->|测试时评分| SEARCH
        QUERY["测试图像与问题"] --> SEARCH
        SEARCH --> ANSWER["推理路径与最终答案"]

图中训练和测试共享验证器,但并不意味着每次回答都重新执行强化学习。 完成训练后的 GeoSolver 可以直接贪心解码;只有启用测试时扩展时,才增加候选生成及验证计算。 GeoPRM 也能对 GLM-4.1V 或 Qwen3-VL 的候选路径评分,不要求这些模型经过同一轮 Tree-GRPO。

关键设计

1. 双源过程数据:同时覆盖自然逻辑错误与视觉错配

首先让 SFT 策略围绕同一问题生成不同推理路径,并在下一词元分布熵较高的位置建立分支。 高熵表示模型在该前缀之后存在较强选择不确定性,而不是指已经生成的某个词元本身具有固定熵。 算法选取高熵位置,执行多次 rollout,再迭代扩展推理树,把采样集中到可能改变结果的决策位置。 对于一个推理步骤,作者用从该前缀继续生成后得到正确答案的比例估计其 Monte Carlo 价值。 这种标签衡量的是当前策略从此前缀出发的成功潜力,不等价于人工确认该步骤在图像上完全正确。 初始候选池包含 3.72 million 条轨迹,随后按同一问题内正确性分数的标准差过滤低方差问题,保留 1.37 million 个样本。 如果一个问题的路径全对或全错,它很难提供区分相邻决策好坏的训练信号,因此会被过滤。

但成功率标签仍可能放过“过程错、答案对”的样本,于是第二路直接修改正确轨迹中的视觉事实。 边界框扰动包含小幅抖动和大幅移动,分别针对细边界误差和把框移到背景等明显错配。 事实修改则更改目标数量或属性,让文本陈述与原图不一致。 这些负例与未改动的正例锚点组成约 0.7 million 个样本,和搜索数据合并后称为 Geo-PRM-2M。 原文的规模使用近似口径,不能把数据集名称当作精确去重后的样本总数。 两路数据的互补性在于:搜索产生自然的推理失误,合成扰动针对仅凭最终答案难以发现的视觉幻觉。 正文没有完整说明 MC 价值如何映射为逐词元二元标签,也未给出所有扰动幅度与过滤阈值,复现时仍需实现细节。

2. 词元级 GeoPRM:在局部坐标或事实出错时提供反馈

GeoPRM 从 SFT 后的模型初始化,并附加线性二分类头,而不是从零训练一个只看答案的打分网络。 输入包括图像、问题和已有推理前缀,分类头为推理词元预测正确性概率。 因此,一句话里的坐标数字或属性词出现问题时,模型能够给出更细的反馈,而不必把整句压成一个标签。 训练采用带掩码的词元级二元交叉熵,仅在有效推理词元上计算损失。 这里的“正确性概率”是监督训练得到的判别分数,论文并未给出充分的校准实验来证明它等于真实错误概率。

细粒度的意义在于把“这段解释似乎不可靠”转化为“它在引入某个新视觉事实时失去支持”。 不过,模型仍需依赖自身视觉表征判断这个事实,而不是调用一个独立的几何真值系统。 它也不是通用检测器的替代品:其直接输出是候选文本的评分,边界框和答案仍由策略模型生成。 这样的职责分离允许同一个 GeoPRM 检查不同生成模型,但跨模型能力必须以实际测试范围为限。

3. 过程感知 Tree-GRPO:先调整叶子奖励,再回传中间决策价值

作者不直接把所有过程分数求和或求平均来替代答案奖励,而是关注相邻位置的评分是否突然下降。 对于一条轨迹,若某处置信度跌幅越过阈值,就将原本的结果分数乘以一个介于 0 和 1 之间的惩罚因子。 结果分数可以是领域任务的连续指标,正文举例包括 IoU 和 mAP,并将其范围设为 \([0,1]\)。 这样,即使最终答案正确,包含明显过程错误的路径也不能获得未经折减的奖励。 相反,保持稳定可信的长推理不必仅因词元更多就被累积扣分;这是设计动机,不是对一切长度偏差的消除证明。

训练 rollout 继续使用高熵位置构树,而非为每个候选答案从头独立生成整条链。 每条完整叶子路径得到调整后的奖励,再对某个中间节点下的所有叶子奖励取平均,作为该节点的价值。 全局优势比较当前节点与根节点的价值,反映它相对整个问题平均水平的收益。 局部优势比较当前节点与父节点,反映这一步选择相对已有前缀带来了什么变化。 两种优势被结合后,还会按后代叶子数的平方根下调,避免共享前缀因出现在多条完整轨迹中而被反复放大。 最后通过带概率比裁剪的策略目标更新模型;过程验证由此影响到中间决策,而不只用于事后挑答案。 缓存中式 7 的优势组合运算符损坏,不能确认它的精确表达,因此这里不猜写完整优势式或裁剪损失。

4. GeoPRM 引导搜索:把测试时预算变成经过验证的候选选择

Best-of-N 先生成多个完整候选,再依据 GeoPRM 的过程反馈选择答案;这增加了找到正确路径的机会,也要求验证器能够正确排序。 Beam Search 则在逐步生成时评估候选分支,尽早排除引入不可信视觉事实的路径。 Self-Consistency 只依据多个答案之间的一致程度进行多数投票,没有显式检查各条路径的视觉依据。 因此,若生成模型经常以相似方式幻觉,多数投票可能继续支持同一个错误答案。 GeoPRM 的额外价值不是生成更多文字本身,而是在候选空间中提供不同于生成概率或投票频率的判别信号。

表 3 使用生成预算 32,图 3 进一步观察预算增加后的收益与平台期。 正文没有充分交代词元评分到整条路径分数的聚合规则、全部 beam 参数,以及验证开销如何计入预算。 因此,不能把“同样的生成预算”自动理解为同样的端到端时延或 GPU 成本。 跨模型实验使用 \(N\in\{8,16,32\}\),展示的是固定验证器引导不同生成模型的能力,不是让测试问题参与再训练。

一个完整示例

原文图 5(第 14 页)给出飞机计数任务的两条路径,可用来具体理解验证器何时介入。 错误路径先识别若干飞机,随后在第 5 步声称图像左下角的坐标 \([223,789]\) 还有一架飞机,最终回答 5。 作者将该目标标为幻觉,并报告这一位置附近的 GeoPRM 分数由 0.966 降至 0.228。 另一条路径依据可见目标得到最终答案 4,没有添加这架不存在的飞机。 在训练中,这类骤降可以折减错误路径的叶子奖励,继而改变经过该节点的优势。 在测试搜索中,相同反馈则用于候选排序或剪枝,真实答案不作为在线选择条件。 图例展示了可定位错误的个案,但没有报告全部幻觉类型上的检测召回率或误报率。

损失函数 / 训练策略

在四张 NVIDIA H200 上,策略模型先进行 1 epoch 的 SFT,再执行 1000 个过程感知 Tree-GRPO 优化步骤。 GeoPRM 使用 Geo-PRM-2M 训练 2 epochs,batch size 为 128;策略 RL 使用 Geo-CoT380k 的扩展训练集。 SFT 学习目标推理文本的负对数似然,GeoPRM 学习掩码二元分类,RL 则优化经过程反馈修正的任务奖励。 这三个目标分别承担格式初始化、验证能力学习和策略对齐,不应混为一次端到端联合训练。 以下只转述正文可确认的两个关系,不把排版损坏的式子恢复成声称精确的作者公式。

\[ V(s)=\frac{\text{number of successful rollouts from }s}{T} \]

其中 \(T\) 是继续生成次数,成功由最终答案是否满足标注判定;该关系对应第 6 页式 2 的文字定义。 对 RL 的节点价值,使用的则是后代完整路径的过程修正奖励均值,不再只是离散答案成功率。

\[ GA(s)=V(s)-V(\mathrm{root}),\qquad LA(s)=V(s)-V(p(s)) \]

这里 \(p(s)\) 是父节点;该关系由第 8 页正文明确给出。 骤降阈值、惩罚因子具体取值,以及优势合并和损失的完整实现,需要结合清晰公式或代码进一步核实。 论文给出的代码链接附有将来公开的表述,本笔记未核验仓库当前可用性。

实验关键数据

主实验

原文评估 6 类任务、17 个基准数据集;以下表格保留最能体现空间证据收益及反例的结果,不将不同任务指标混成统一准确率。 第一张表摘自原文表 1(第 9 页),使用标准推理,无测试时搜索;数值沿用原文百分数尺度。

任务与数据集 指标 GeoSolver 对比模型 对比得分
视觉定位,DIOR-RSVG mIoU 75.62 GLM-4.1V-Thinking 39.41
视觉定位,RRSIS-D mIoU 76.66 VHM 55.20
目标检测,HRRSD mAP@50 94.74 GLM-4.1V-Thinking 55.53
目标计数,NWPU-VHR Accuracy 79.0 GLM-4.1V-Thinking 62.5
目标计数,RSOD Accuracy 45.5 Gemini-2.0-Flash 63.5

HRRSD 检测比所列 GLM 基线高 39.21 个百分点,但 RSOD 计数低于 Gemini,不能概括为每项任务全面领先。 表 2(第 10 页)还报告 AID 场景分类 98.33、NWPU-Captions BLEU-4 为 80.93。 同表的 SIRI-WHU 分类为 76.00,低于 RS-EoT 的 78.88;RSICD 描述为 36.18,低于 SkySenseGPT 的 42.47。

第二张表来自原文表 3(第 11 页),每列为该类任务对应数据集的聚合结果,搜索方法的生成预算为 32。 VG 为 mIoU,Detect 为检测指标,OC、SC、VQA 为 Accuracy,IC 为 BLEU-4;保留原表独立口径。

推理策略 VG Detect OC SC VQA IC
贪心解码,无 TTS 58.19 74.11 54.06 90.62 70.07 47.00
Self-Consistency 59.44 75.17 59.28 92.57 76.58 47.51
GeoPRM Best-of-N 66.35 82.51 73.92 96.01 88.70 48.18
GeoPRM Beam Search 68.04 84.66 75.45 98.39 87.84 48.05

Beam Search 的 VG 比贪心解码高 9.85 个百分点,但 VQA 和 IC 略低于 Best-of-N,搜索方式不存在逐列支配关系。 描述任务的增益明显小于计数,提示可检查的局部空间事实可能比自由描述更适合这种验证信号。 这是一种基于表格的解释,而非论文已经单独证明的因果结论。

消融实验

第三张表摘自原文表 5(第 13 页),比较训练对齐方式;该实验的数值单独保留,不与表 3 的标准模型聚合行互换。 Avg 是六类不同指标的算术综合分,不是统一意义上的成功概率。

配置 VG,mIoU OC,Accuracy 检测,mAP Avg
仅 SFT 53.77 49.73 59.42 60.34
Vanilla GRPO 59.31 55.56 68.89 67.09
加平均过程分 APS 48.69 48.22 50.76 58.13
加过程感知奖励 PA 60.12 59.21 69.90 68.16
仅加树状探索 59.46 57.77 70.82 68.13
Process-Aware Tree-GRPO 61.07 63.6 73.97 70.51

相对 Vanilla GRPO,完整方法的 Avg 增加 3.42,而 APS 减少 8.96;作者将后者解释为缩短推理造成的奖励投机。 表 6(第 13 页)进一步检验数据构成:GeoSolver 的 BoN 在 \(N=32\) 时,对象级综合分为 74.26。 去掉 MCTS 数据后降为 64.27,去掉幻觉注入后为 70.26,分别相差 9.99 和 4.00。 该消融支持两类数据互补,但还不能分离数据量变化和数据类型变化各自的作用。

关键发现

  • 原文表 4 在 BoN、\(N=32\) 下给出 GeoPRM 的 Avg 为 75.95,而 Self-Consistency 为 68.43,GraphPRM 为 62.37。
  • 图 4 只在所示计数与场景分类设置中展示通用模型借助 GeoPRM 超过部分领域专家,不能外推为所有任务均超过所有专家。
  • 原文表 3 的无 TTS 数值不能直接由表 1、表 2 的对应数据集均值全部重现,表 5 的完整模型聚合值也不同;正文未清晰解释这些设置差异,本笔记不自行对齐或修正。

亮点与洞察

  • 过程标签的双来源对应两种不同失败:搜索寻找自然决策分歧,视觉扰动揭露答案奖励漏掉的错误事实。这个互补关系比单纯扩大正确思维链数量更有针对性。
  • 奖励的使用形式和验证器本身同样重要。APS 的退化说明“有过程分数”不代表直接优化它就有效,奖励设计会改变模型寻找捷径的方式。
  • 验证器可以成为独立的领域适配部件。生成模型保持不变时,候选选择仍能利用遥感知识,不过收益伴随额外推理成本。

局限与展望

  • 原文没有单独的系统局限章节;这里的复现与评估边界属于阅读分析,而非全部由作者主动承认。
  • MC 标签仍与基础策略能力和最终结果判定绑定,合成扰动也不能覆盖自然影像中的所有幻觉形式;值得增加人工核验的逐步视觉错误测试集。
  • 置信度骤降可能漏掉持续低置信度、缓慢恶化或稳定自信的错误推理。它规避部分长度偏差,但不能保证检测所有不忠实路径。
  • 图 3 的预算曲线展示收益与平台期,不足以单独确立严格的计算最优定律;缺少统一时延、验证 FLOPs 与显存成本对照。
  • 缓存中的多处公式抽取损坏,且标签映射、搜索聚合规则与若干超参数未充分交代;跨表聚合数值差异也限制了精确复现。

相关工作与启发

  • 与 GeoChat、VHM 相比:它们提供遥感理解和领域适配能力;本文强调显式检查推理中的视觉事实,而不是只提升最终任务分数。
  • 与 GeoZero、RS-EoT 相比:这些工作推动遥感思维链;本文进一步追问链条哪一步失真,并让验证信号进入策略优化与测试搜索。
  • 与 URSA、TreeRL 相比:本文借鉴骤降式过程惩罚及高熵树状探索,将它们与遥感专用错配数据结合,不应把每个组成思想都视为首次提出。
  • 可延伸方向:在固定生成和验证总成本下,比较静态搜索与按局部不确定性自适应分配预算,并用真实逐步错误标注检验剪枝是否正确。这是研究建议,不是已完成实验。

评分

  • 新颖性: 4/5。主要贡献是遥感过程数据与训练、搜索机制的系统结合,若干基础思想来自已有工作。
  • 实验充分度: 4/5。覆盖多任务、验证器比较和数据消融,但成本归一化与逐步错误评测仍不足。
  • 写作质量: 3/5。主线清楚,但实现细节、跨表数值口径及缓存公式可读性影响复核。
  • 价值: 4/5。为遥感视觉语言推理提供了可迁移的验证器路线,同时保留了明确的复现与效率问题。