跳转至

Preference-Guided Adaptation for Open-Vocabulary Semantic Segmentation via Prompt Disagreement

会议: NeurIPS2026
arXiv: 2609.34528
代码: https://github.com/blue-531/pref-ovss
领域: 语义分割
关键词: 开放词汇语义分割、提示分歧、偏好学习、区域局部优化、领域适应

一句话总结

本文把不同提示模板产生的局部分割分歧转成一次二选一监督,用区域局部偏好优化和区域外一致性适应开放词汇分割模型;在真值驱动的偏好 oracle 实验中,CAT-Seg-L 的 MESS 平均 mIoU 从 35.26 提升至 45.88。

研究背景与动机

开放词汇语义分割(OVSS)允许用户在推理时指定类别名称,再通过视觉语言模型(VLM)的图文对齐把类别落实到像素。SAN、CAT-Seg 等模型在日常场景上已经具备较好的零样本能力,但到了胸片、农业、遥感或工业检查,视觉外观、类别粒度和术语都可能脱离预训练分布。给每个新领域重新画密集掩码不仅费时,还需要专业知识;仅靠模型在源领域学到的图文对应关系又不足以可靠地区分目标概念。

偏好学习提供了另一种监督接口:不要求标注者画出正确边界,只让其判断两张预测哪张更符合目标。然而,整图二选一容易出现一张预测在左半边更好、另一张在右半边更好的情况,反馈无法定位应该修改哪里。还存在候选生成问题:如果两张预测几乎相同,或候选变化改变了输入内容,二选一就很难提供有用且语义一致的训练信号。

作者利用 OVSS 自带的提示接口:固定图像与类别词表,只改变句式和尺度修饰词,就能得到具有系统差异的分割假设。先找模板集成最不确定的局部区域,再在区域内挑出分歧最大的两张预测,可把标注任务收缩成具体可见的比较。核心 idea:把提示分歧用作候选来源和查询定位信号,将一次区域偏好转成类别均衡的局部优化,并用区域外伪标签约束避免未被询问的区域漂移。

方法详解

整体框架

输入是依次到来的目标域训练图像、目标类别词表和 14 个固定提示模板,输出是适应该领域的 OVSS 模型。每张图像只进行一次区域查询、获得一个二元偏好,并执行一次梯度更新;不回放图像,也不积累偏好数据做多轮训练。三个核心环节依次是偏好查询挖掘、区域局部偏好优化(Region-Localized Preference Optimization,RLPO)和区域外一致性。

模型保留冻结的原始 OVSS 参数,只更新视觉分支 LoRA 与文本残差适配器;同时保存适应前的冻结参考模型。候选由当前模型生成,参考模型只用于偏好目标的得分锚定。主实验中偏好来自真值 oracle;实际拟议使用方式才是让人对局部候选做判断,两者不能混为已经完成的大规模人工适应实验。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["目标域图像与词表<br/>14 个模板候选"] --> B["偏好查询挖掘"]
    B -->|区域内二选一监督| C["区域局部偏好优化"]
    O["训练偏好<br/>真值 oracle 或人类"] -.-> C
    F["冻结参考模型"] -.-> C
    C --> D["区域外一致性"]
    D --> E["单步更新适配器"]
    E -->|推理使用默认模板配置| G["适应后的分割预测"]

图中的偏好与参考模型是训练监督和得分锚定,不是推理时的额外输入。适应完成后按基线默认配置预测:SAN 使用其默认 ViLD 提示池,CAT-Seg 使用 “a photo of a [CLASS] in the scene”;不在每张测试图像上再请求偏好,也不利用测试真值选模板。

关键设计

1. 偏好查询挖掘:先决定问哪里,再决定比较哪两个假设

同一类别名称分别填入 14 个模板,得到 14 张逐像素类别概率图。模板包含句式变化,也包含 small、medium、large 等尺度修饰,目标词表始终不变。这里的候选不是对图像做增强后产生的不同视觉任务,而是同一图像、同一语义目标下的不同预测;这让偏好判断具有可比性,也免去额外训练一个候选生成器。

查询位置由模板集成熵确定:先对每个像素的 14 个类别分布求均值,再计算该均值分布的香农熵。将熵按整图的 0.95 分位数二值化,取高熵掩码中最大连通分量的包围框作为查询区域 \(R\)。因此 \(R\) 是一个矩形框,不等于原始高熵掩码,框内可以包含低熵像素;这里也不是“恰好询问面积占比 5% 的区域”。

位置固定后,把各模板概率图转成 argmax 硬标签,在 \(R\) 内统计每对模板的标签不一致像素数,选择计数最大的候选对。熵回答“模型在哪个区域不确定”,成对分歧回答“哪两个假设最值得比较”,二者不是同一个指标。集成熵还可能因所有模板都低置信而增大,不能将它严格等同于纯粹的模板间差异度。

oracle 或标注者只需要判断区域内哪张预测更符合预期;结果定义赢家模板 \(w\) 和输家模板 \(l\)。局部查询避免整图偏好中相互抵消的优劣关系,但也意味着监督只涉及候选已有的假设:若所有模板都把目标认错,偏好最多挑出“较不错误”的结果,无法凭空给出正确类别与边界。

2. 区域局部偏好优化:比较相对参考的区域置信度变化

不能直接把语言模型的整段响应概率套到分割图上,因为图像大小和区域内类别面积会主导似然。RLPO 先用赢家的硬预测把 \(R\) 分成类别桶;同一套桶同时用于赢家、输家、当前模型和参考模型得分,保证比较时没有悄悄改变统计区域。只对实际出现的类别求均值,先在类内平均,再在类间平均,使小目标不会被大面积背景淹没。

设 \(R_c\) 是赢家在区域内预测为类别 \(c\) 的像素集合,\(U_R\) 是非空桶的类别集合,\(\hat Y^k\) 是本步当前模型在模板 \(k\) 下的硬预测。原文式(7)的类别均衡得分为:

\[ S_\theta^k(R)=\frac{1}{|U_R|}\sum_{c\in U_R}\frac{1}{|R_c|}\sum_{u\in R_c}\log P_\theta^k\bigl(\hat Y^k(u)\mid x,u\bigr). \]

注意桶由赢家划分,但每个模板评估的是自身硬预测的概率,而不是一律评估赢家标签。参考得分以冻结模型的概率替换当前概率,仍评估本步固定的候选标签,并沿用同一类别桶。候选硬标签在一次更新内固定;下一张图像到来时,再用更新后的模型生成新的候选,这属于在线偏好学习。

参考模型对应适应前状态,不是上一轮模型,也不是外部教师。它把得分变化锚定在每个模板原本的表现上,避免只因某个模板初始置信度更高就持续偏向它。偏好损失推动赢家相对参考的得分增量大于输家的增量;这不是直接对 oracle 真值做像素交叉熵,也不是把赢家掩码当成整个查询框的密集真值。

这一设计借用 DPO 的 Bradley–Terry 形式,但应区分实用目标与严格推导。附录 A 明确承认类别均衡平均是为处理类不平衡而做的设计性修改,不能视为整图似然分解的必然结果。另外,赢家和输家来自不同模板上下文,标准 DPO 中共享上下文的归一化项抵消条件并不自动成立。

附录 A.2 声称,跨模板归一化偏移与参数无关,所以可以在 log-sigmoid 中忽略且不影响梯度;这个论证不充分:常量位于非线性函数内部,虽然自身导数为零,仍会改变该函数对得分差的梯度权重。因此,本文的经验效果有实验支持,但不宜把 RLPO 描述为已经严格等价于原始 KL 正则化 DPO 的目标。

3. 区域外一致性:偏好纠错不能让未查询区域随之失控

区域偏好只约束 \(R\) 内的得分,但更新的是共享适配器,区域外的预测仍会发生变化。作者用赢家硬预测作伪标签,约束输家概率图在区域外保持一致;不是让整张图像所有位置无条件接受赢家结果,也不是再请求一份区域外标注。

具体监督掩码由两个条件相交构成:像素必须在 \(R\) 外,且赢家预测置信度超过 \(\tau_{\mathrm{conf}}\)。只在这些像素上计算 Lovász–Softmax 损失,默认阈值为 0.8。这样把偏好监督的空间范围与稳定性约束分开:框内重点学习哪个假设更好,框外用高置信伪标签减少输家分支漂移。

这种约束仍是模型自监督,不保证伪标签正确。高置信错误可能被保留;而因为共享参数会跨空间传递更新,即使只在指定掩码上计算损失,也不能声称模型参数更新只影响这些像素。消融显示它有补充收益,但主要提升来自 RLPO,而非单独的一致性训练。

一个完整示例

以一张胸片及其目标类别词表为例,模型用 14 个模板产生不同的结构预测。集成熵挑出某个边界附近的最大高熵连通区域,系统将其包围框呈现给标注者,并显示框内分歧最大的两张候选;标注者只决定哪张更接近预期,不需要画出边界。这是流程示例,不代表原文报告了该图像的具体标注结果。

选出赢家后,框内根据赢家类别桶统计两个模板对各自硬预测的置信度,并与冻结参考比较;框外只选赢家置信度超过 0.8 的像素,令输家贴近这些伪标签。两项损失合并后只更新一次适配器,接着处理下一张训练图像。最后推理换回基线默认模板配置,输出整图分割,而不是输出训练时被偏好选中的那张候选。

损失函数 / 训练策略

令 \(\Delta_k=S_\theta^k(R)-S_{\mathrm{ref}}^k(R)\),原文式(8)和式(10)的核心目标可紧凑写成:

\[ \mathcal L_{\mathrm{RLPO}}=-\log\sigma\!\left(\beta[\Delta_w-\Delta_l]\right),\qquad \mathcal L_{\mathrm{total}}=\mathcal L_{\mathrm{RLPO}}+\lambda_{\mathrm{cons}}\mathcal L_{\mathrm{cons}}. \]

默认 \(\beta=0.1\)、\(\lambda_{\mathrm{cons}}=0.1\),批大小为 1,使用 AdamW、权重衰减 \(10^{-4}\)。视觉 LoRA 的秩为 4,作用于 CLIP 最后四个 Transformer 块的 Q、V 投影;文本适配器是秩为 4 的低秩残差,作用于平均模板分类器嵌入,其参数在类别与模板之间共享。

CAT-Seg 默认学习率为 \(3\times10^{-3}\),CUB-200、ATLANTIS、iSAID、PST900 降为 \(10^{-3}\);SAN 默认 \(10^{-3}\),CUB-200、ATLANTIS、PST900 降为 \(3\times10^{-4}\)。这些是附录 C、表 6 的实际配置,因此不能把所有领域都说成完全相同的学习率。

实验关键数据

主实验

MESS 覆盖一般场景、地球监测、医学、工程、农业与生物五组。本文排除没有训练划分或不再公开的 Dark Zurich、DRAM、ISPRS Potsdam、CryoNuSeg,使用其余 18 个数据集;总体 Mean 是跨数据集平均,不是简单平均五个组分数。样本来自训练划分,评估使用官方保留划分。

默认每数据集使用 64 张适应图像,每图一次更新;CHASE_DB1 只有 8 张,CWFID 使用 32 张。适应结果取三次独立样本采样运行的均值,主表给出标准差。关键边界是:主实验 oracle 用区域内真值 IoU 比较候选;优化器接收二元结果而非密集真值,但整个实验的反馈产生过程仍依赖真值掩码。

下表摘录原文表 1 的总体 mIoU(%);Gain 为相对同骨干零样本基线的百分点差,不是相对所有方法的 SOTA 提升。

骨干 零样本 本文 Dense-mask 单步参考 Gain
SAN-B 25.29 32.39 ± 0.09 32.41 ± 0.46 +7.10
CAT-Seg-B 33.12 39.67 ± 0.08 44.26 ± 0.49 +6.55
SAN-L 27.40 33.99 ± 0.90 37.64 ± 0.15 +6.59
CAT-Seg-L 35.26 45.88 ± 0.38 46.67 ± 0.74 +10.62

Dense-mask 保持同样的单步流式适应协议,只改成密集真值监督,并非充分训练的上界。附录 E 表 9 的 CAT-Seg-L 全监督提示调优使用同样 64 张图像、训练 200 个 epoch,达到 53.17 ± 0.50;本文不匹配这个更强训练预算的结果。

消融实验

以下均为 CAT-Seg-L,摘录表 2、表 3 与附录 B 表 5。前四行比较损失,后四行比较候选来源或模板多样性,不能把不同类型诊断当成同一种去模块实验。

配置 总体 mIoU(%) 说明
完整模型 45.88 14 模板,RLPO + 一致性
去掉 RLPO 40.51 比完整模型低 5.37 点
去掉一致性 43.45 比完整模型低 2.43 点
零样本 35.26 不适应
MC Dropout 候选 39.09 14 候选,dropout 概率 0.1
测试时增强候选 44.66 14 候选,翻转及 0.75–1.25 倍缩放
仅句式变化模板 43.79 5 个不含尺度修饰的模板
仅尺度变化模板 43.65 固定句式,4 种尺度修饰设置

附录 D 表 7 单独验证 oracle 与人类判断的接近程度:20 名参与者各判断 30 对,每难度层 10 对,共 600 次判断,平均每次 9.4 秒。它验证的是候选偏好一致性,不是用这些人工判断重新跑完整适应流程。

难度层 区域 IoU 差值 判断次数 人类与 oracle 一致率
Easy ≥0.18 200 0.967
Medium [0.04, 0.18) 200 0.953
Hard <0.04 200 0.840
Overall — 600 0.920

关键发现

  • RLPO 是主要收益来源,一致性提供额外稳定作用;14 个模板的提示候选平均优于 MC Dropout 与增强,但医学组增强得分 53.15 高于提示候选的 51.83,不能说提示在每组都最强。
  • 表 4 中 4、16、64、128 张图像的平均 mIoU 分别为 38.26、42.31、45.88、45.79;收益并非随样本数严格单调,64 张之后平均结果趋于饱和。
  • 正文称医学是每个骨干提升最大的组,但表 1 的 SAN-L 医学只提升 6.62 点,工程与农业生物分别提升 11.98、11.91 点。这里保留表格事实,不沿用正文过强概括;CAT-Seg-L 医学提升 22.31 点则与表格一致。
  • 附录 D 表 8 对近乎平局的查询定向注入错误:IoU 差小于 0.15 的查询全部反转后,均值仍为 42.43,高于 35.26。正文图 4 的 20% 均匀反转约保留 8 点收益是近似图示结论,不替换成精确测量。

亮点与洞察

  • 候选多样性不只是推理时应消除的噪声,也可作为交互监督的入口。附录 E 中直接提示集成只有 34.74,反而低于 35.26 基线,说明收益不能简单归因于集成更多模板。
  • 一次偏好虽只有二元结果,却可通过查询区域、类别桶与候选置信度作用于许多像素。所谓“密集监督”指优化作用的空间分布,不代表一个二元判断包含了完整正确掩码。
  • 可以把“局部询问、局部偏好纠错、区域外稳定”的分工迁移到其他稠密预测交互。前提是候选保持语义可比,并明确哪些区域没有受到人工监督。

局限与展望

  • 作者承认,当所有模板都缺乏有用假设,偏好很难引导正确分割;可探索领域专家模板、领域特定描述或学习得到的模板,而非只用自然图像式句子。
  • 主结果依赖真值 oracle,600 次人类判断的协议没有证明跨所有专业领域的专家可用性、长期学习收益或实际标注总成本。9.4 秒也只覆盖单次判断,不包含训练算力、系统等待与专家培训。
  • 高置信区域外伪标签可能固化错误;可增加弃权、近乎平局跳过或多个查询,但必须重新核算反馈预算,不能把额外监督当作免费改进。
  • 附录 A.2 的跨模板 DPO 论证存在上述非线性常量偏移问题,值得补充更严格的目标解释或偏移消融;经验提升与理论等价性应分开评价。
  • 附录 H 表 11 在单张 H200、BDD100K 设置下,CAT-Seg-L 每步 1,616 ms、峰值 7,335 MiB,SAN-L 每步 418 ms、峰值 8,392 MiB。两者只训练 71,681 个参数,但 14 次候选前向仍有实际成本,不能把候选多样性“来自现有接口”误写成零计算开销。

相关工作与启发

  • vs SAN / CAT-Seg:它们提供开放词汇分割骨干,本文不替换其主体结构,而在冻结模型上增加轻量适配与偏好目标;跨两种结构的提升支持一定通用性,但不等于已覆盖全部 OVSS 模型。
  • vs DPO:沿用相对冻结参考的赢家/输家比较,不训练显式奖励模型;不同之处是候选来自不同提示上下文,得分被区域化并按赢家类别均衡,严格等价性需要额外论证。
  • vs 固定目标的分割偏好优化:原文将既有医学或小闭集任务与其开放词表适应区分开来,新增的是利用模板分歧构造局部查询,而不是首次在视觉分割中使用偏好。
  • vs 密集掩码微调:本文旨在降低拟议交互接口的标注负担,不是证明二元反馈优于所有充分训练的掩码监督方法;同图像预算与同优化步数预算也必须分开讨论。

评分

  • 新颖性: 4/5 — 将提示分歧、局部查询与类别均衡偏好学习结合,具有明确任务针对性。
  • 实验充分度: 4/5 — 四种骨干配置、消融和人工一致性验证较丰富,但真实人工反馈适应仍未充分验证。
  • 写作质量: 3/5 — 主流程清晰,但组级收益概括与表格不完全一致,跨模板推导存在论证缺口。
  • 价值: 4/5 — 为低标注预算的开放词汇领域适应提供可复用接口,部署价值取决于候选质量与反馈可靠性。