跳转至

Universal Cross-Prompt Adversarial Attacks on Promptable Concept Segmentation

会议: NeurIPS 2026(录用信息由任务包提供)
arXiv: 2609.39265
领域: 语义分割
关键词: 可提示概念分割、跨提示鲁棒性、通用扰动、时序记忆、鲁棒性评测

一句话总结

AdvPCS 从提示变化、概念感知与时序记忆三个层面评估可提示概念分割的脆弱性,在受控数字输入实验中使 SA-CO 文本提示下的三模型平均视频 mIoU 从 70.24% 降至 4.61%,但这不等于对任意提示、模型或现实输入都成立的失效保证。

研究背景与动机

SAM 将分割从固定类别预测转向由点或框指定目标的交互任务;SAM2 加入视频记忆,使模型能够利用前面的观察维持对象身份。SAM3 的可提示概念分割(Promptable Concept Segmentation,PCS)进一步接受概念性描述,试图找到符合该概念的多个实例。此时,分割质量不仅取决于像素边界,还依赖模型是否判断目标存在、是否将提示与正确对象对应,以及视频中是否持续追踪同一对象。

这种变化也改变了鲁棒性问题。只在一个点提示下观察到性能下降,并不能推出框提示或同义文本也会失败;反过来,换一种提示后暂时恢复分割,也不能证明模型对共享视觉异常具有稳定抵抗能力。既有面向 SAM 和 SAM2 的评测主要涉及空间提示或视觉表示,对概念感知和多种提示共同作用的覆盖不足。论文因而关注一种跨样本复用的通用扰动,考察其影响能否跨越提示类型、提示实例和视频帧,而不是只记录某个特定输入的失败。

视频又带来一个双面因素:历史记忆能够缓冲当前帧的不可靠观察,但也可能保留错误关联并影响后续判断。本文把提示条件化感知与时间状态一起纳入研究视野,避免将所有低重叠结果都归因于边界预测。核心 idea:把跨提示分割鲁棒性看成概念识别、局部对应与时序状态共同决定的系统性质,并通过受控复用扰动及分层评测观察其退化边界。

方法详解

整体框架

本文提出 AdvPCS,研究对象是 SAM3 及其 PCS 变体,而不是训练一种更准确的分割模型。正常推理时,图像编码器提供视觉表示,提示参与目标识别与定位,检测分支判断概念对象是否存在,跟踪分支则结合历史信息输出分割结果。视频中的当前帧预测因此同时受到当前观察与此前状态影响。

从非操作性的研究视角看,方法包含三个相互关联的关注点:跨提示覆盖、全局—局部感知、时序状态偏离。第一个关注点询问不同提示是否暴露同一种视觉脆弱性;第二个关注点区分整帧概念识别与候选对象的局部对应;第三个关注点询问错误是否仅限于当前帧,还是伴随时间状态变化影响后续预测。

实验以正常输入和受控扰动输入的分割质量对照作为证据,并区分图像与视频、点与框与文本、不同数据集与不同模型。通用性在这里首先指扰动在相应实验配置下跨输入复用,而非为每个测试样本单独调整。论文没有充分证明所有任务、模型和模式都由同一个完全不变的实验产物覆盖,因此不能将“通用”扩大解释为无条件通用。

威胁模型假定研究者能访问开源 SAM3,并使用公开数据进行研究。这提供了白盒条件下观察模型内部行为的基础,比只看到最终掩码的封闭服务更强。论文还报告模型间迁移,但模型迁移与纯黑盒评测不是同义词:后者需要明确目标访问权限、查询限制和独立测试条件。

本笔记只讨论机制解释、评测边界和防御意义,不复述扰动构造、目标函数、提示选择配方、更新过程或记忆干预实现。也不绘制生成流程图,以免把概念分析误读为可执行方法。

关键设计

1. 跨提示覆盖:把提示变化作为独立评测维度

同一个对象可以由文本概念、内部点或外接框指示,但这些输入提供的信息并不相同。文本偏向语义类别与描述,点提供局部位置,框则给出更完整的空间范围。如果只检验一种提示,结果可能主要反映该提示的信息瓶颈,而不是模型对视觉内容本身的稳定理解。

AdvPCS 在概念层面联合考虑多种提示及其变化,试图减少结论对某一种提示实例的依赖。这里的重要区别是跨提示类型与跨提示实例:前者例如从点到框,后者例如同一目标的不同文字表达。两者都需要明确测试覆盖范围,不能因为几个实例都发生退化,就宣称整个提示空间都被覆盖。

原文报告提示实例迁移图,并在附录检验多点输入。增加空间信息能部分改善扰动输入下的结果,说明提示仍具有补偿作用。这使“换提示无效”成为过强结论;更准确的说法是,所测提示变化未完全消除性能差距。

2. 全局—局部感知:解释概念存在与对象对应的不同作用

PCS 与只根据位置生成掩码的任务不同:模型首先需要理解提示指向什么,并判断画面里是否存在相应对象。整帧层面的概念存在判断与局部候选对象的对应关系可能出现不同错误。前者失误可能导致应有对象被遗漏,后者失误则可能造成错误关联或不完整覆盖。

本文将这两种感知尺度一起考虑,强调分割失败可能发生在输出掩码之前,而不只是边界变粗。对防御研究而言,这意味着仅检查掩码形状或边缘平滑度可能遗漏概念层面的漏检;应把概念存在判断、对象定位和最终掩码质量分开观察。

原文探索性实验发现感知置信变化与 mIoU 下降存在关联。这是支持关注感知分支的经验依据,但关联本身不足以证明感知是唯一因果来源。不同提示提供的空间约束也不同,最终重叠质量仍可能同时受视觉表示、定位与跟踪影响。

3. 时序状态偏离:区分当前观察错误与持续传播的错误

视频模型不只是对每一帧独立运行图像分割。它会保存关于对象身份和历史外观的信息,用来应对运动、遮挡及短暂消失。因此,相同的当前帧异常在不同历史状态下可能产生不同预测,单帧 mIoU 不能完整描述视频中的失效过程。

AdvPCS 的时序部分在抽象层面关注受控输入下的状态演化是否偏离正常序列。其研究意图是将即时感知退化与跨帧身份延续一起纳入评价,而不是假定记忆必然防御异常。历史信息既可能帮助恢复目标,也可能延续错误对应,两种作用取决于模型如何信任和更新状态。

这一解释不要求把内部状态干预写成操作步骤。可直接得到的防御启发是:除平均掩码重叠外,还应记录身份一致性、失效持续时间和异常后的恢复情况。本文主要给出 mIoU 与定性说明,并未提供足够数字来独立量化这些额外指标。

一个完整示例

设想一段含有同一目标的短视频,评测者分别用概念描述、点和框指示目标。正常条件下,模型应识别目标并在连续帧中维持对应;受控异常条件下,评测者观察不同提示是否仍得到相近的正确掩码,以及错误是否在后续帧持续。

如果换成框提示后结果部分恢复,只能说明额外空间信息在该条件下有帮助,不能证明所有其他异常都被抵御。如果图像模式明显退化而视频仍保留部分重叠,则可能存在历史信息的补偿作用,但需要独立时序分析才能确定原因。

这一例子是阅读评测结果的概念示例,不是论文中的个案数据,也不是扰动生成流程。其作用是让提示变化、感知尺度与时间状态三个层面在同一个场景里对应起来。

实验关键数据

主实验

论文使用 SA-CO、YouTube-VOS(表中写作 YouTube)、MOSE 和 DAVIS,并评估 SAM3、SAM3.1 与 EfficientSAM3(E-SAM3)。图像测试来自视频抽帧,并非另一个完全独立的静态图像来源。论文说明扰动研究使用 SA-CO,再迁移至其他数据集;缓存未充分说明 SA-CO 内部拟合与测试样本的隔离,不能直接将全部结果称为严格未见样本泛化。

BoU 表示正常输入 mIoU,AoU 表示扰动输入 mIoU。mIoU 衡量预测掩码与真实掩码的平均重叠,AoU 越低表示该受控评测中退化越严重;它不是“失败样本百分比”。下表选取原文表 1 的三模型平均值,所有数值单位均为 %,不是 SAM3 单模型结果。

数据集 提示 视频 BoU 视频 AoU 图像 BoU 图像 AoU
SA-CO 文本 70.24 4.61 78.42 3.96
YouTube 点 75.78 17.48 60.38 12.81
YouTube 框 77.88 37.27 82.24 25.41
MOSE 点 62.91 15.75 56.99 12.09
MOSE 框 65.87 27.26 76.72 27.28
DAVIS 点 67.62 25.90 51.71 11.58
DAVIS 框 76.97 42.01 80.81 23.92

SA-CO 文本提示的平均 AoU 确实低于 5%,但不是每个模型都低于 5%。E-SAM3 的文本 AoU 分别为视频 12.50% 和图像 11.19%;SAM3 对应为 0.00% 和 0.07%。模型差异不能被平均值掩盖,也不能把舍入后的 0.00% 理解为每个实例都精确零重叠。

消融实验

原文表 2 比较的是 SAM3:其正常输入数值与表 1 的 SAM3 列对应,而非三模型平均列。下表保留七个“数据集—提示”条件的汇总均值,包括 SA-CO 文本及另三个数据集的点、框条件。

方法 视频平均 mIoU (%) 图像平均 mIoU (%) 解释边界
正常输入 77.74 81.65 SAM3 的正常基准
AttackSAM 72.90 70.24 按本文统一设置适配的基线
DarkSAM 73.67 74.30 按本文统一设置适配的基线
S-RA 40.02 23.01 按本文统一设置适配的基线
UAD 32.31 27.15 按本文统一设置适配的基线
UAP-SAM2 29.83 11.58 此表中汇总表现次低的基线
AdvPCS 18.33 2.49 此表中汇总表现最低

对表 2 的逐列数值核对后,AdvPCS 在列出的七个视频条件和七个图像条件中均低于所列基线。但该结论仅适用于此表的 SAM3 和基线适配方式,不能扩展成三模型、任意提示或所有已有方法上的全面最优。

模块消融见图 5(a):正文称移除各组成部分都会减弱退化效果,但缓存没有图中可读的精确数值。因此不编造模块下降幅度,也不能确定哪个组成部分贡献最大。下表改用附录表 A1 的多点评测作为有数字依据的分析,数值为 SAM3 在 YouTube、MOSE、DAVIS 上的平均值。

输入点数 正常平均 mIoU (%) 扰动平均 mIoU (%) 可支持的观察
1 74.71 7.45 单点条件下差距明显
2 78.88 15.71 更多空间信息伴随部分恢复
3 82.52 18.53 扰动条件仍远低于正常条件
4 83.09 20.58 表中最高扰动平均值
5 83.35 19.71 恢复并不严格单调

关键发现

  • 框提示往往保留更多重叠,但仍有显著退化;这支持分别报告不同提示,而不是只给一个总均值。
  • 多点评测说明增加提示信息可以部分补偿异常影响,却没有在所测条件下恢复至正常水平。
  • 原文正文将 YouTube 的 17.48% 和 DAVIS 的 25.90% 放在文本提示叙述附近,但表 1 明确将它们列为点提示;本笔记按表格标注。
  • 附录声称检验 1–6 个点,但可读表 A1 只有 1–5 个点;不补出第六行。
  • 种子稳定性和模型迁移主要由图示支持,缓存缺乏可读精确数字,不据此报告置信区间或迁移矩阵数值。

亮点与洞察

  • 提示鲁棒性不是单一分数。 相同视觉内容在不同提示下得到不同程度的退化,说明提示的信息结构本身是评测的一部分。防御基准应保留提示分组结果与正常性能对照。
  • 概念识别与分割边界需要分开诊断。 低 mIoU 可能来自漏检、错误对应或轮廓质量下降。将这些失败类型分开,才有可能定位真正的系统瓶颈。
  • 记忆既是补偿来源,也是持续风险来源。 视频状态可能帮助恢复目标,也可能延续错误。更好的评测应把恢复能力与瞬时性能同时报告。

局限与展望

  • 作者承认跨提示处理带来额外计算开销,且该方法针对 PCS 的概念存在机制,未必适用于传统分割或 SAM、SAM2。
  • 主研究依赖开源模型访问;迁移结果不能代替严格定义的纯黑盒测试,更不能证明物理环境中的稳定失效。
  • “文本更脆弱”的观察还受数据集差异影响:表 1 的文本结果只来自 SA-CO,点和框来自其他数据集,不能单凭这些行识别提示类型的因果效应。
  • 防御研究中的预处理结果由正文概述为正常 mIoU 约从 70% 降至 40%、扰动 mIoU 仍低于 15%;剪枝条件下正常性能也会严重下降。这说明必须同时衡量防御保留的正常可用性,不应将破坏模型本身当成成功防御。
  • 防御段开头称研究在 SA-CO 上开展,但剪枝段明确写 DAVIS。两类防御并非一个无歧义的统一数据集实验,且均不代表所有防御方法。
  • 后续可研究提示一致性检查、概念漏检预警和时间状态的可信度监测,但这些只是防御方向,并非本文已经验证有效的方案。

相关工作与启发

  • vs SAM / SAM2 / SAM3:前两者奠定空间提示与视频记忆,SAM3 增加概念识别。本文研究的是这些能力组合后的鲁棒性,而不是正常分割精度改进。
  • vs AttackSAM / DarkSAM:既有方法提供提示相关和跨提示视觉鲁棒性的参照;本文将关注点扩展到 PCS 感知与视频状态。统一适配后的基线成绩不等于这些方法原论文的完整能力。
  • vs UAP-SAM2:两者都关注跨帧复用与记忆相关失效,但本文进一步讨论概念感知和多类提示。应比较受控实验覆盖,而不是据此断言某一种机制普遍更易受损。
  • 防御研究启发:建立保持对象语义一致的提示分组与时间恢复评测,能够帮助区分“输入异常”“提示歧义”和“状态延续错误”,减少对单个平均指标的依赖。

评分

  • 新颖性: 4/5 — 将 PCS 感知、跨提示变化和视频状态纳入同一鲁棒性问题。
  • 实验充分度: 3/5 — 覆盖四数据集、三模型,但提示与数据集交织,部分图示缺乏可读数字。
  • 写作质量: 3/5 — 研究主线清楚,存在提示标注、点评测范围和防御数据集表述不一致。
  • 价值: 4/5 — 为分割基础模型的分层防御评测提供有用证据,不构成通用失效或防御有效性的保证。