DGSeg: Dynamic Gating of Semantic-Spatial Guided Predictions for Reasoning Segmentation¶
会议: ECCV2026
论文: ECCV 原文
领域: 多模态VLM / 推理分割
关键词: 推理分割、动态门控、语义-空间引导、GRPO、可提示分割
一句话总结¶
DGSeg 让 MLLM 同时产出「目标是什么」的文本语义描述和「目标在哪」的边界框空间定位作为两类互补线索,分别送入两条独立的分割分支,再用一个轻量动态门控模块逐像素估计两支的融合权重,在 ReasonSeg 零样本设定下把 7B 模型的 gIoU 推到 69.6(val)/ 67.3(test),超过 Seg-Zero、CoPRS、SAM-Veteran 等强基线。
研究背景与动机¶
推理分割要求模型面对「找一个能拧螺丝的工具」「哪个东西能防止浴室地面积水」这类隐含指代的查询,先推理出到底指哪个物体,再输出它的像素级掩码。MLLM 在这类查询上的语言推理是现成的,但细粒度定位一直是它们的短板;于是近两年主流方案都把两者拼起来:MLLM 负责「想」,可提示分割模型(SAM、SAM2、SAM3 这类)负责「画」,而两者之间的接口就是中间目标提示——一个或几个点、一个边界框、<SEG> 特殊 token 的隐嵌入,或者从注意力图里抠出来的定位信号。
问题恰恰出在这个接口上。把一段丰富的推理压缩成一个稀疏提示必然有损:当目标是「狗的鼻子」时,MLLM 给出的框往往松垮地罩住鼻子、顺带把整只狗也框进来,分割模型会把这些无关区域一并当作目标;点提示则可能直接落错部位。更麻烦的是,多提示本来是用来互补的,但现有做法(包括 SAM3 原版的用法)习惯把语义提示和几何提示联合编码成一份统一的提示表示再送进解码器,于是任何一个含糊或错误的提示都会污染整张掩码——坏提示的影响不再是局部的,而是全局的。用 MLLM 多轮迭代去修正提示(re-prompt、多轮工具调用一类)确实能缓解,但训练与推理开销都很高,而且仍然可能被 MLLM 自己的幻觉带偏。
本文的切入角度是:与其在一个统一的提示通道里和噪声搏斗,不如让互补的提示各自走各自的路,再按可靠性把两条路的预测加权融合。MLLM 被引导同时回答「目标是什么」(语义身份)与「目标在哪」(空间位置),产出文本描述与边界框两类线索;这两条线索分别进入独立的分割分支,最后由一个以「分支相对分割质量」为监督训练出来的轻量动态门控模块逐像素决定该信谁。核心 idea:把互补线索的处理从「联合编码」改成「分开预测 + 学习式融合」,并用两条分支各自的 IoU 构造软监督目标去训练门控,让不可靠分支的区域在像素级别上被压下去。
方法详解¶
整体框架¶
DGSeg 的整体流程可以概括为「生成线索 → 分开分割 → 加权融合」三步。输入是一张 RGB 图像 \(I\) 和一句语言查询 \(T\)。MLLM(推理模型 \(F_{\text{reason}}\))先按 chain-of-thought 的方式把推理过程写出来,再给出两个可解析的结论:一句描述目标身份的文本 \(c_{\text{sem}}\)(例如 "the goat with black legs")和一个框级别的定位 \(c_{\text{spa}}\)(例如 [152, 399, 501, 640])。分割模型 \(F_{\text{seg}}\) 选用 SAM3,因为它同时支持语义提示与空间提示。与 SAM3 原版把多种提示联合编码成一份统一提示表示不同,DGSeg 让 \(c_{\text{sem}}\) 和 \(c_{\text{spa}}\) 各走一条分支,分别得到掩码 logits \(\ell_{\text{sem}},\ell_{\text{spa}}\) 和对应的掩码预测 \(m_{\text{sem}},m_{\text{spa}}\)。最后,动态门控模块 \(F_{\text{dg}}\) 读入两条分支像素解码器的特征,逐像素预测语义分支应占的权重 \(W\),按 \(W\) 把两支 logits 加权求和并二值化,得到最终掩码。两条分支各自的预测不只是融合的输入,它们与真值的吻合程度还反过来充当融合模块的监督信号——这正是第二阶段的训练内容。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入图像 + 语言查询"] --> B["语义–空间双视角线索生成<br/>CoT 推理 → 文本描述 + 边界框"]
B --> C["语义–空间双分支分割<br/>两类线索各走一条 SAM3 分支"]
C --> D["动态门控融合<br/>像素级权重加权两支 logits"]
D --> E["最终掩码"]
关键设计¶
1. 语义–空间双视角线索生成:让 MLLM 同时说清「是什么」和「在哪」
单一类型的提示都不够用:<SEG> 隐嵌入携带语义但空间定位不精确,框和点空间明确但语义贫乏、且极易框大。Marr 关于「视觉理解即知道什么在哪里」的经典论述提示,一个完整的目标表示需要语义身份与空间定位两者兼备。因此 DGSeg 用 CoT 式的指令要求 MLLM 先输出推理轨迹 \(c_{\text{CoT}}\),再给出语义线索 \(c_{\text{sem}}\) 与空间线索 \(c_{\text{spa}}\) 两个结论。语义线索是自由文本描述而不是类别标签,这一点是刻意的:类别标签标注成本高,且与分割模型实际操作的提示空间并不对齐,而一段描述性的句子(如「狗身上负责嗅觉的那部分」)能更直接地落进 SAM3 的文本提示空间;空间线索则负责给出粗定位,把搜索范围收拢到目标附近。两者互补的方向是双向的——语义线索可以纠正空间线索框进来的多余区域,空间线索可以补上语义描述里定位不到的部分。线索本身的质量由第一阶段的 RL 微调保证(奖励设计见「损失函数 / 训练策略」)。
2. 语义–空间双分支分割:把坏提示的污染限制在它自己那条分支里
SAM3 原版把多个提示编码成一份统一的提示表示,任一来源的不可靠提示都会影响整个预测。DGSeg 的做法是把 \(c_{\text{sem}}\) 和 \(c_{\text{spa}}\) 分别送进两条提示路径,得到两套独立的像素解码器特征与两套掩码 logits。这一步表面上只是「拆开」,但它把「提示质量」与「预测质量」的对应关系保留了下来:语义分支的预测只可能被语义提示的错误影响,空间分支只可能被空间提示的错误影响;而这两类错误的性质完全不同(描述含糊 vs 框太大、框错部位),因此才有条件在像素级别上判断局部该信谁。消融结果支持这一判断:联合编码而不做融合的基线只有 60.8 gIoU,甚至低于只用空间分支的 63.4——说明语义线索里的噪声确实会经由联合编码污染整张掩码;拆开并融合之后则达到 66.0。
3. 动态门控融合:让融合权重由分支特征自己学出来,并用相对质量监督
两条分支各有各的对与错,最简单的平均融合会把好分支也一起拉低(平均融合只有 63.8 gIoU)。做融合的真正难点是:融合模块凭什么知道该信谁?DGSeg 的答案是让门控自己从像素级特征里读出来。\(F_{\text{dg}}\) 的输入是两条分支像素解码器特征的拼接 \([f_{\text{sem}},f_{\text{spa}}]\),这两组特征来自 SAM3 的像素解码器,既包含图像与提示的联合表示,也保留了边界结构与高响应区域这类分割模式;拼接后过一个两层卷积的轻量网络再取 sigmoid,得到逐像素权重图 \(W\in[0,1]^{1\times h\times w}\)。把 \(W\) 上采样到 logits 的空间分辨率后,融合写成:
其中 \(\odot\) 是逐元素乘,\(\mathbb{I}[\cdot]\) 是指示函数(⚠️ 二值化的具体阈值与写法以原文为准,原文此处 OCR 有损)。这里的关键是权重逐像素而不是整图共用一个标量:同一个目标上,框的外围区域该信语义分支、目标主体区域该信空间分支,整图标量做不到这种局部切换——消融中「学习式标量权重」只有 64.0 gIoU,比像素级门控低 2.0。之所以能学出来,是因为门控不只有分割损失可依赖(分割损失对「该给谁多少权重」的监督是含糊的),第二阶段额外用两分支各自的 IoU 构造了一个软监督目标 \(W^{*}\),直接把门控朝「更接近真值的那条分支」推(细节见训练策略)。事后分析印证了这一点:语义分支相对空间分支的 IoU 差值 \(s_{\text{sem}}-s_{\text{spa}}\) 与语义分支上的平均融合权重呈强正相关(\(r=0.637\));在像素级别上,当语义分支的 logit 明显更高时预测权重也倾向于语义分支(Fig. 3b)。这说明门控学到的不只是「哪条分支整体更好」,而是结合图像与提示的联合特征做局部判别,从而完成局部去噪。论文也指出,MoE 这类更强的融合器接进同一套 pipeline 能达到接近的效果(65.6),说明这个框架对融合器的选择是开放的。
一个完整示例¶
以 Fig. 4 底部的例子(查询「A truck on the bed of another truck」,目标是被载的那辆卡车)走一遍:MLLM 的 <answer> 里给出语义线索(描述被载的卡车)与一个大致覆盖该车的框。语义分支照描述去分割,形态更贴合目标;空间分支按框去分割,容易把承载它的那辆大卡车也一并圈进来。门控模块在前景像素上评估两支特征后,在被误分割的大卡车区域把权重明显压向语义分支(热力图上呈红/偏蓝的对比),最终掩码只保留被载的那辆车。整条链路上,两条分支都没有被丢弃,错的那部分是通过像素级加权被抑制掉的。
损失函数 / 训练策略¶
训练分两阶段,刻意把「线索生成」和「融合学习」解耦,避免两者的优化互相干扰。
Stage 1:用 GRPO 微调 MLLM(LoRA),此时冻结分割模型。目标是让 MLLM 输出既结构化、又能真正指到目标上的线索,因此奖励由三项组成:格式奖励要求推理过程放在 <think></think>、最终结论放在 <answer></answer> 中,格式合规得 1 分否则 0 分,保证线索可被稳定解析;空间奖励直接用预测框 \(c_{\text{spa}}\) 与真值框 \(b^{*}\) 的 IoU;语义奖励则刻意不用类别标签,而是把语义线索送进语义分支得到预测掩码 \(m_{\text{sem}}\),用它与真值掩码 \(m^{*}\) 的 IoU 作为奖励。这样设计的理由是:类别标签标注代价高,而且未必与分割模型工作的提示空间对齐;直接用分割模型的「掩码偏好」当反馈,相当于让 MLLM 学会说下游模型听得懂的话。消融证实了这一取向——把语义奖励换成类别标签奖励,gIoU 从 66.0 掉到 64.7,去掉语义奖励则掉到 62.1。
Stage 2:冻结 MLLM 与分割主干,只训动态门控模块(3 个 epoch、batch size 1、学习率 \(1\times10^{-4}\)、weight decay \(1\times10^{-4}\))。总目标为
其中 \(\mathcal{L}_{\text{seg}}\) 是最终融合掩码的分割损失;\(\mathcal{L}_{\text{w}}\) 是预测权重与软目标之间的二值交叉熵,软目标由两分支各自的 IoU \(s_{\text{sem}}=\text{IoU}(m_{\text{sem}},m^{*})\)、\(s_{\text{spa}}=\text{IoU}(m_{\text{spa}},m^{*})\) 经带温度 \(\tau\) 的归一化得到:
\(\mathcal{L}_{\text{ent}}\) 是对 \(W^{\uparrow}\) 的熵惩罚,用来阻止门控退化成「处处 0.5」的平均融合;\(\lambda_{\text{w}}\) 随迭代退火,让前期有强引导、后期又不至于收敛到软目标本身。此外训练时对像素重加权:两条分支预测不一致的像素获得更高权重,因为融合真正起作用的正是这些像素。其余超参与更多配置放在补充材料里。
实验关键数据¶
实验设置:推理模型用 Qwen2.5-VL(3B 与 7B 两档),分割主干用 SAM3;Stage 1 用 GRPO + LoRA 微调,单卡 batch size 8、每条样本采样 8 次;Stage 2 训练 3 个 epoch。两阶段都只用 RefCOCOg 采样的 9,000 条指代数据训练,因此 ReasonSeg 上的评测是零样本的。评测指标为 gIoU 与 cIoU:cIoU 是「所有图像的累计交集 / 累计并集」,因而偏向大图像;gIoU 是逐图 IoU 的平均,论文在 ReasonSeg 上以 gIoU 为主要口径。
主实验¶
ReasonSeg 零样本(%):
| 方法 | MLLM | Val gIoU | Val cIoU | Test gIoU | Test cIoU |
|---|---|---|---|---|---|
| Seg-Zero | Qwen2.5-VL-3B | 62.6 | 58.5 | 56.1 | 48.6 |
| PIXELTHINK | Qwen2.5-VL-3B | 62.3 | 58.5 | 58.8 | 52.1 |
| CoPRS | Qwen2.5-VL-3B | 61.3 | 60.6 | 57.8 | 52.7 |
| DGSeg | Qwen2.5-VL-3B | 66.0 | 58.3 | 60.0 | 50.3 |
| Seg-Zero | Qwen2.5-VL-7B | 62.6 | 62.0 | 57.5 | 52.0 |
| PIXELTHINK | Qwen2.5-VL-7B | 63.8 | 62.7 | 60.2 | 55.8 |
| CoPRS | Qwen2.5-VL-7B | 65.2 | 64.5 | 59.8 | 55.1 |
| SAM-Veteran | Qwen2.5-VL-7B | 68.2 | 67.3 | 62.6 | 56.1 |
| SAM3 Agent | Qwen2.5-VL-7B | 65.4 | 50.5 | 62.6 | 56.2 |
| DGSeg | Qwen2.5-VL-7B | 69.6 | 65.5 | 67.3 | 63.6 |
指代分割(cIoU,%):
| 方法 | MLLM | RefCOCO testA | RefCOCO+ testA | RefCOCOg test | 平均 |
|---|---|---|---|---|---|
| Seg-Zero | Qwen2.5-VL-3B | 79.3 | 73.7 | 71.5 | 74.8 |
| PIXELTHINK | Qwen2.5-VL-3B | 78.7 | 72.9 | 72.2 | 74.6 |
| DGSeg | Qwen2.5-VL-3B | 78.9 | 74.5 | 72.3 | 75.2 |
| Seg-Zero | Qwen2.5-VL-7B | 80.3 | 76.2 | 72.6 | 76.4 |
| RISE | Qwen2.5-VL-7B | 79.7 | 77.7 | 73.4 | 76.9 |
| SAM-Veteran | Qwen2.5-VL-7B | 80.8 | 76.6 | 73.4 | 76.9 |
| DGSeg | Qwen2.5-VL-7B | 80.3 | 76.4 | 73.9 | 76.9 |
推理设定与指代设定的差别值得点出:RefCOCO 系列的指代表达是显式的(「左边的黑裤子男人」),模型只需定位;ReasonSeg 的查询是隐含的(「什么样的结构能把浴室地面的水排走」),必须先推理出目标身份再定位,因此两类评测考察的能力并不相同。DGSeg 在指代基准上是「并列最好」而非明显领先(7B 平均 76.9,与 RISE、SAM-Veteran 持平),增益主要出现在推理基准上,这与「语义-空间互补主要在需要推理的隐含指代上发挥作用」的叙事是自洽的。另外需要注意不同方法的训练数据并不一致:例如 LENS 一类方法在 ReasonSeg 训练划分上微调过,而 DGSeg 是零样本,跨方法的绝对值不宜直接比较(⚠️ 口径差异以原文为准)。
消融实验¶
融合策略与双分支设计(ReasonSeg,Qwen2.5-VL-3B,gIoU %):
| 配置 | Val | Test | 说明 |
|---|---|---|---|
| Oracle fusion(软目标 \(W^{*}\) 作上限) | 67.9 | 62.8 | 上界参考,离完美仍有差距 |
| Baseline(不融合,提示联合编码) | 60.8 | 55.7 | 语义与空间线索一起编码 |
| 平均融合(不可学习) | 63.8 | 58.2 | 两支等权,好分支被拖低 |
| 置信度加权(不可学习) | 64.1 | 57.2 | 按置信度分配权重 |
| 学习式标量权重 | 64.0 | 57.8 | 整图共用一个权重 |
| MoE 融合 | 65.6 | 60.6 | 更强的可学习融合器 |
| 动态门控(本文) | 66.0 | 60.0 | 像素级权重 |
| 仅语义分支 | 55.3 | 52.8 | 只有文本线索 |
| 仅空间分支 | 63.4 | 54.9 | 只有框线索 |
奖励设计消融(Qwen2.5-VL-3B,gIoU %):
| 配置 | Val | Test | 说明 |
|---|---|---|---|
| 无 Stage 1(不做 RL 微调) | 36.0 | 33.7 | 线索完全不可靠,性能崩坏 |
| 去掉格式奖励 | 64.6 | 59.6 | 线索解析不稳定 |
| 去掉语义奖励 | 62.1 | 58.5 | 掉点最多的单项 |
| 去掉空间奖励 | 64.1 | 59.4 | 粗定位退化 |
| 语义奖励换成类别标签奖励 | 64.7 | 59.1 | 与分割模型提示空间不对齐 |
| 完整奖励(本文) | 66.0 | 60.0 |
计算开销(单张 H100):
| 方法 | 峰值显存 (GB) ↓ | FLOPs (GFLOPs) ↓ | FPS ↑ |
|---|---|---|---|
| Baseline(不融合) | 11.75 | 7375.7 | 0.280 |
| DGSeg | 12.24 (+4.2%) | 7395.1 (+0.3%) | 0.275 (-2.0%) |
关键发现¶
- 线索质量是命脉。 完全跳过 Stage 1 的 RL 微调,gIoU 从 66.0 直接崩到 36.0——此时下游分割结构完全不变,性能却只剩下约一半,说明这条 pipeline 的上限由 MLLM 给出的线索决定,融合模块只能在此基础上做局部纠偏。
- 语义奖励的设计比「有没有语义线索」更微妙。 三项奖励中去掉语义奖励掉点最多(66.0 → 62.1),而把语义奖励换成类别标签奖励也会掉到 64.7。这说明关键不只是「让 MLLM 说点什么」,而是要让它的输出对齐分割模型实际响应的提示空间——用分割掩码的偏好当反馈比用人类定义的类别标签更有效。
- 联合编码确实会被噪声污染。 不融合的联合编码基线(60.8)甚至低于只用空间分支(63.4),这是「坏提示会污染整张掩码」这一动机最直接的证据;而拆开 + 融合达到 66.0,比两条单分支都高。
- 融合方式越细越好,但离上界仍有距离。 可学习融合普遍优于不可学习融合,像素级门控(66.0)优于整图标量(64.0);Oracle 上界是 67.9,说明当两条分支都错时门控无力回天——它只能在「一支对一支错」的情形下纠偏。
- 代价极小。 双分支与门控只增加 0.3% FLOPs、4.2% 峰值显存,FPS 下降 2.0%,相比多轮迭代修正提示的路线在工程上划算得多。
- 口径提醒。 在 ReasonSeg 上 3B 模型的 cIoU(58.3)反而低于 Seg-Zero(58.5)与 CoPRS(60.6),论文自己解释了 cIoU 被大图像主导、因而以 gIoU 为主口径。读表时不应只看单列。
亮点与洞察¶
- 把「提示质量」当成一等公民,但改的是消费方式而不是提示本身。 不同于多轮 re-prompt 或提示去噪的路线,DGSeg 承认提示一定会有噪声,转而让下游以「分开消费 + 学习融合」的方式消化噪声。这个视角可以直接迁移到任何「LLM 输出结构化提示给下游专用模型」的 pipeline(检测、跟踪、检索)。
- 用下游模型的掩码偏好当 RL 奖励,而不是类别标签。 这是全文最「啊哈」的一点:把 reasoning model 对齐到 segmentation model 的提示空间,比对齐到人类定义的语义标签更有效(64.7 → 66.0,且去掉语义奖励掉 3.9)。本质是把「下游模型是否听得懂」当作奖励信号,是一种低成本、无需额外标注的跨模块对齐手段。
- 软融合目标让门控在无额外标注的情况下获得监督。 用两分支各自的 IoU 经带温度 softmax 归一化构造 \(W^{*}\),把「谁更接近真值」变成逐像素的回归目标;再配一个熵惩罚防止退化成平均融合,用退火避免收敛到软目标本身。这套「辅助目标 + 熵正则 + 退火」的组合是训练门控/路由类模块的通用配方。
- 两阶段解耦的工程价值。 先冻分割训 MLLM、再冻 MLLM 训一个极小模块,既避免了两个可学习组件互相干扰,也让第二阶段极其廉价(3 个 epoch、只训两层卷积)。这种「重模块靠 RL 对齐、轻模块靠监督学习」的分工值得复用。
局限与展望¶
- 两支都错时无法纠偏。 门控只能评估「哪支相对更好」,没有第三方证据可用;Oracle 上界(67.9)本身就说明即便门控完美,性能也受限于两条分支的质量。引入第三类线索(如注意力图、深度/法向先验)或在两支一致但都错时触发回退机制,是可以尝试的方向。
- 对分割主干的耦合较强。 语义线索走的是文本提示,因此必须依赖支持文本提示的 SAM3;换成 SAM/SAM2 这类只有几何提示的模型,这条 pipeline 就搭不起来。把语义分支替换成其他语义注入方式(如 CLIP 特征调制)会牺牲「分支对等」这一前提,值得权衡。
- 跨方法比较的训练口径不一致。 论文强调 ReasonSeg 上的零样本设定,但表中部分基线(如 LENS)在 ReasonSeg 训练划分上微调过;同时所有模型都在 RefCOCOg 的 9,000 条数据上训练,这一数据规模相对偏小,指代基准上的增益也明显弱于推理基准。
- 关键超参藏在补充材料。 \(\lambda_{\text{w}}\) 的退火schedule、\(\lambda_{\text{ent}}\)、温度 \(\tau\)、不一致像素的重加权系数、门控网络的具体通道数在正文都没有给出,复现需要对照附录。
- 可以延伸的方向:把门控与线索生成联合训练(而非两阶段冻结),让 Stage 1 的奖励也感知门控行为;把「相对质量监督」上移,直接用门控输出反过来指导 MLLM 改进线索;以及把双分支扩展到多分支、多提示(论文也提到融合器本身可替换为更强的设计)。
相关工作与启发¶
- vs LISA:LISA 用
<SEG>特殊 token 的上下文嵌入去条件化 SAM,本质上只有一条语义隐通道,且没有显式推理输出,无从评估这条提示好不好。DGSeg 显式产出文本描述与边界框两条线索、分别处理再融合,多出了「评估并抑制不可靠提示」这一环。 - vs Seg-Zero / Seg-R1:这类方法走纯空间提示(框 + 点)路线,靠 RL 提升框的质量;一旦框偏大,无关物体就会被带进掩码(原文 Fig. 5 第一行即是此例)。DGSeg 保留空间线索但同时补上语义线索,并用门控在像素级抑制空间分支的过度覆盖。
- vs SAM-Veteran / RSAgent / SegAgent:走「MLLM 多轮迭代修正提示」的路线,能减轻噪声但训练与推理开销高,且仍可能被幻觉带偏。DGSeg 用一次前向加一个两层卷积的融合模块换取类似的鲁棒性(开销仅 +0.3% FLOPs)。
- vs LENS:LENS 同样主张结合语义与空间信息,并把轻量分割头挂到冻结 MLLM 的注意力图上;但它缺少评估目标线索可靠性的机制,对错误线索很敏感(原文给出了失败案例),且原文称其在 ReasonSeg 训练划分上微调过,与 DGSeg 的零样本口径不同(⚠️ 原文对 LENS 的引用编号前后不一致,2.1 节引作 [32]、Fig. 5 与 4.4 节引作 [58],以原文为准)。
- vs SAM3 原版 / SAM3 Agent:原版把多类提示联合编码成统一表示,DGSeg 拆成两条分支再加门控融合,用的是同一套主干。Tab. 1 中 SAM3 Agent(7B)Val gIoU 为 65.4,DGSeg 为 69.6,差距主要来自提示的处理方式而非骨架能力。
- 与 Stable-SAM、SAMRefiner 的联系:这两者分别指出掩码解码器在低质量提示下会产生偏置激活、以及从粗掩码中挖掘更准的提示。DGSeg 与它们关注的是同一个问题(提示质量),但走的是「不改进提示、改进去噪融合」的路,思路互补。
评分¶
- 新颖性: ⭐⭐⭐⭐ 「分开预测 + 学习式融合」的组合本身不算全新,但用分支相对质量构造软门控目标、并以分割模型掩码偏好定义 RL 语义奖励这两点是实在的贡献
- 实验充分度: ⭐⭐⭐⭐ 两个任务、两档模型规模、融合策略/奖励/双分支/开销四组消融加相关性与可视化分析,比较完整;弱项是缺 3B 与 7B 之外的规模验证,补充材料的超参未进正文
- 写作质量: ⭐⭐⭐ 动机与框架叙述清楚,但正文与图表的符号多处 OCR 受损、LENS 的引用编号前后不一,且关键超参全部下放补充材料
- 价值: ⭐⭐⭐⭐ 在 ReasonSeg 零样本上把 7B 推到 69.6/67.3 gIoU 的领先水平,开销几乎可忽略,且「用下游模型偏好做奖励」与「软目标监督门控」两个技巧容易迁移