跳转至

Watermarking Should Be Treated as a Monitoring Primitive

会议: NeurIPS2026 Position Track(立场论文)
arXiv: 2605.13095
领域: AI 安全 / 水印安全与治理
关键词: 水印、监测原语、实体可链接性、归因访问、隐私治理

一句话总结

本文通过观察者威胁模型与受控文本、图像实验论证:在实体绑定持久且推断可靠时,水印可能支持重复归因,因此治理应同时约束内部归因访问和设计相关的外部来源识别,而不能只检验单份内容的水印鲁棒性。

研究背景与动机

生成内容水印通常被解释为一种溯源基础设施:让下游判断内容是否由模型生成,或者恢复嵌入的信息。研究因此多关注改写、编辑后还能否检测,以及能否抵抗伪造。这样的评测回答了信号是否可靠,却没有完整回答谁能借助信号推断生成实体,以及同一种能力在反复使用时会产生什么隐私影响。检测越可靠,并不必然意味着所有部署目的都越安全。

归因与监测的连接来自部署,而不仅来自水印载荷。例如,零比特水印只报告某个信号是否存在,但如果不同账户长期绑定不同密钥,且拥有归因权限的一方能够可靠区分这些信号,检测结果仍可能指向账户。另一类风险无需观察者持有密钥:某些配置会留下持续、可学习的来源差异。它们是否足以支持外部识别,取决于设计及数据条件,不能从“有水印”直接推出“所有用户都可被识别”。

本文属于 NeurIPS2026 Position Track,不是提出一个新的通用身份识别算法,也不是首次指出水印存在隐私风险。其贡献是把权限、绑定粒度与持续性纳入同一论证框架,并用有限配置下的可行性证据支撑治理议题。核心 idea:将水印评估单位从孤立样本扩展到实体级推断能力,同时区分有归因访问的内部观察者与无密钥、无检测器的外部观察者。

方法详解

整体框架

这里的“方法”是威胁模型和证据组织方式,而不是一套新网络。论文先区分水印存在性检测、实体归因与跨输出可链接性,再按观察者拥有的访问权限分析实现这些目标所需的条件,最后以内部归因实验、外部来源识别实验及对照检验其论点。

内部路径依赖检测器或解码器访问、实体映射和可靠的判定;外部路径依赖适当的来源标签、持续绑定及可学习的水印相关差异。两条路径都只能涉及观察到的输出,并不自动揭示某实体全部模型使用情况。实验也没有重建完整活动历史。

本文关注四个相互关联的问题:访问类别决定谁能够归因,绑定粒度和持续性决定归因对象与时间范围,可观察结构决定外部暴露,误报与治理边界决定如何解释结果。下面的关键设计是对这套分析框架的归纳,不表示作者新增了四个算法模块。

由于论文主要是立场与威胁模型分析,不把论证提纲画成算法流程图,也不提供监控步骤、身份映射实现或来源标签获取方法。

关键设计

1. 按访问权限划分观察者:组织身份不等于技术能力

“内部”不是指雇员,“外部”也不是指某种固定机构。内部观察者能够使用相关检测器,并把检测结果关联到实体;这种能力可能来自持有密钥,也可能来自被授予检测服务访问。若使用多比特水印,归因还可能依赖解码器恢复实体相关信息。一个获得这些权限的第三方机构,在本文模型中仍属于内部观察者。

因此,只有一个存在性检测接口,或者只有一张实体映射,都不足以保证可靠归因。检测必须能够在有关候选之间有效区分,信息还必须确实关联到所讨论的实体。经过变换后信号失效、权限被撤回或者绑定发生变化,都可能使这条推断链中断。作者分析的是能力条件,而不是默认所有平台都具有同样能力。

外部观察者没有密钥,也没有检测器访问。实验假定其拥有合适的来源标注参考输出,并检验未见输出的来源分类。这一设定要求标注可信、数据充分、参考集与测试集之间实体绑定一致,以及输出差异确实可学习;它不证明现实中普通用户一定存在足够的参考材料。

尤其需要区分发表账户、生成账户与自然人。一个来源标签可能只是账号或组织标签,既未必指向实际生成账户,更不等于经过核验的真实身份。本文的“识别”应理解为实验中的实体标签预测,不能将其改写成私人身份确认。

2. 分离载荷容量与部署粒度:零比特不等于零归因能力

零比特水印回答的是某个信号是否存在,多比特水印能够恢复额外消息。这个区别描述载荷,却不能独立决定隐私属性:如果零比特方案采用持久的逐实体多密钥部署,不同检测信号与实体的对应关系就可以成为归因依据,不必把姓名或账户标识直接编码进内容。

单份输出被判定含有水印、被归入某个实体、与另一份输出属于同一实体,是三个不同结论。第一个不自动推出第二个;第二个在可靠且绑定持续时可能帮助第三个。即使第二个成立,也只说明输出关联到部署中的实体,而不是说明该实体就是某个真实自然人。

持久性进一步决定了这种能力能否跨时间延续。长期逐账户绑定可以增加可链接范围;群组或共享绑定降低水印所提供的区分粒度,但也牺牲逐实体归因。密钥轮换只有在观察者无法继续取得跨轮换关联时,才可能削弱持续链接;单纯更换密钥名称不构成隐私保证。

这解释了为什么本文将治理重点放在绑定与权限上。水印能否支持合法审计是一回事,某次审计授权能否被持续用于其他目的则是另一回事。论文不将所有归因查询都称为监控滥用,也没有证明提供方或主管机构已经实施这种滥用。

3. 检验设计相关的可观察结构:外部暴露不是普遍性质

外部识别的核心问题不是能否恢复密钥,而是输出中是否存在持续的实体相关差异,足以在没有检测器的情况下区分来源。作者以 KGW 文本和 Tree-Ring 图像作为可行性案例。这里不能把内部覆盖的 12 种方法都说成已遭外部识别,也不能据两个案例宣称全部水印都具有同样泄露。

Tree-Ring 的解释尤其需要限定:实验中的实体“密钥”包含水印模式、半径、掩码形状和通道等配置组合,而不只是固定配置下的随机种子。因此,其外部结果说明的是配置级差异的可学习性,不是证明仅改变种子就一定可以区分用户。文本结果同样只适用于被评估的 KGW 配置,论文没有系统扫描其他强度或上下文设定。

为避免把内容偏好误当水印差异,实验让各实体使用共同的提示词池,并在不同数据划分之间保持提示词及样本不重叠。无水印和共享密钥对照进一步检查,移除逐实体水印差异后来源分类是否仍有明显优势。这些控制为该实验条件下的水印贡献提供证据,而不是排除所有现实来源线索。

图中“每实体样本数”表示带标签参考数据的规模,不是监控持续时间,也不是对多个匿名输出进行联合推断。作者预测的是单份留出输出的来源;未检验匿名探测输出的联合聚合,更未展示长期活动轨迹重建。

4. 将可靠性与授权边界同时纳入解释:正确率不是身份证明

内部主指标是“正确且通过检测的归因率”:只有归因实体正确、并通过相应校准阈值才计成功,错误归因和弃权都计失败。文中的 TPR@1%FPR 指每个密钥在非匹配输出上的误报率校准,不是对整个多密钥选择过程给出全局 1% 错误归因保证。候选规模和检测分数之间的相关性都会影响这种外推。

外部 top-1 和 top-3 是有限候选集合中的来源分类准确率,不是开放世界身份认证。二元实验还说明,整体准确率很高可以与不可忽略的误报同时存在;若真实目标输出很稀少,误报在阳性结果中的占比可能更高。不能用实验准确率替代真实使用场景中的基础率、未知来源拒识和错误后果分析。

治理因此需要分别声明归因目的、允许的访问主体、映射保存范围、绑定持续性、结果留存与二次使用限制,并提供审查和申诉机制。限制检测器访问主要针对内部路径,不能自动消除已有可学习结构带来的外部暴露;改变可观察结构也不自动消除仍持有归因权限者的内部能力。

这些是作者提出的部署权衡与治理方向,不是实验已经证明有效的防护措施。分布保持或不可检测构造可能减少外部可学习差异,但论文没有检验这些缓解方案,也没有证明其理论保证失效;单份输出层面的性质还需要与重复观察条件分别讨论。

实验关键数据

主实验

文本生成使用 Qwen2.5-14B 与 C4 提示词;图像生成使用 Stable Diffusion v2.1 与 Stable Diffusion Prompt 数据集。实体间提示词匹配,训练与测试提示词及样本不重叠;外部测试每实体含 100 份留出输出。

内部实验覆盖 12 种零比特水印,实体数从 1 增至 16。图 3 和正文报告整体归因较高、部分方法随实体增多略有下降;缓存没有提供逐点精确数值,因此不根据图像文本猜写百分比。

表 1 汇总外部识别的明确数值,仅反映两个被评估配置,不是算法排名。

外部实验条件 实体数 每实体带标签参考样本数 指标 结果 对应随机基线
KGW 文本,参考数据较少 16 100 top-1 11.3% 6.25%
KGW 文本,参考数据较多 16 4000 top-1 73.0% 6.25%
KGW 文本,参考数据较多 16 4000 top-3 90.0% 18.75%
Tree-Ring 图像,配置级实体区分 16 4000 top-1 91.0% 6.25%

来源:§5.2 与图 4,全文缓存第 439–459、521–525 行。随机基线按 \(1/n\) 和 \(\min(3/n,1)\) 换算;100 与 4000 是图 4 的参考数据规模端点,正文报告 KGW 的 11.3% 至 73.0% 变化。

消融实验

这里不是新模型模块的消融,而是来源差异对照。表 2 只保留原文可支持的定性结果,不从图 5 的抽取文本补造精确数字。

配置 文本 / 图像范围 来源推断表现 能支持的解释 不能支持的解释
逐实体多密钥,内部观察者 KGW / Tree-Ring 对照图 接近完美 有访问权限时,所测信号可支持归因 所有规模下都可靠或全局误报率为 1%
逐实体多密钥,外部观察者 KGW / Tree-Ring 较强但低于内部 特定设计的实体相关结构可学习 12 种方法均已通过外部验证
无水印 KGW / Tree-Ring 对应生成设置 接近随机 匹配设置下,没有明显的水印区分收益 无水印内容在现实中不可识别
所有实体共享密钥 KGW / Tree-Ring 接近随机 共享密钥移除了所测逐实体水印差异 共享密钥保证通用匿名性

来源:§5.2 Controls 与图 5,缓存第 532–542、590–596 行。这里控制了模型、提示词分布与生成设置;其他来源线索仍可能存在。

表 3 展示原文表 1 的二元实验计数及其直接含义,用于说明准确率与错误归因的区别。

二元实验项目 数值 解释
目标输出正确判为目标 100 / 100 目标召回率为 100%
背景输出误判为目标 48 / 1500 目标误报率为 3.2%
背景输出正确判为背景 1452 / 1500 背景召回率为 96.8%
整体正确率 97.0% 100 份目标与 1500 份背景的混合测试集
始终判为背景的基线 93.75% 目标召回率为 0%
目标阳性预测的精确率 约 67.6% 笔记计算:100 / (100 + 48),不是原文新增实验

来源:原文表 1、§5.2 Targeted Identification,缓存第 414–427、460–463、526–531 行。实验仅涉及一个随机选择的目标和另外 15 个实体组成的背景,不能推广到更大、更复杂的人群。

关键发现

  • 外部来源分类在所测配置中随带标签参考数据增加而改善,但论文没有证明普通用户具备相应规模的可用材料。
  • 无水印与共享密钥对照支持逐实体水印结构的贡献;这是一项受控实验结论,不是现实匿名性保证。
  • 内部 12 方法证据比外部两配置证据更广,两者不能互换;内部可靠性仍依赖访问、区分能力与绑定。
  • 二元实验中的 48 次背景误报提醒读者:低基础率下需要更审慎解释阳性结果,97.0% 不能当作个体身份结论的可信度。

亮点与洞察

  • 将载荷与部署分开讨论很重要。零比特限制的是显式消息容量,不是持久密钥映射能够带来的实体级信息。
  • 观察者按权限定义,使提供方、平台和获授权第三方可以放在同一能力框架中讨论。由此能够讨论权限持续与目的扩张,而不预设恶意。
  • 共享密钥对照把“内容本身可能有来源差异”与“水印增加了差异”分开。更有意义的评估应报告条件和边界,而非只宣称水印能识别来源。
  • 隐私评估不能仅看单次检测。即使每次归因都有合法用途,持续权限与跨情境结果留存仍需要独立治理。

局限与展望

  • 外部实验仅覆盖 KGW 文本与 Tree-Ring 配置级图像差异,不能代表全部水印、所有生成模型或种子级密钥区分。
  • 未评估外部识别在改写、摘要、图像编辑和解码变化后的效果,也未系统研究上下文宽度或水印强度变化。
  • 实验假定来源标签可靠、实体绑定稳定且参考数据充分;半监督、聚类和缺少标签的场景属于未来工作。
  • 未证明人口规模识别、完整活动历史重建、真实监控部署或实际滥用。图示监控场景是能力的假设用途,不是实测事实。
  • 每密钥 1% 误报校准不等于全局错误归因保证;开放世界未知来源、基础率变化与错误后果仍需评估。
  • 群组密钥、密钥轮换、权限限制和分布保持设计是待验证的治理或技术方向。防护评估应同时报告合法归因收益、外部可链接性和残余内部访问能力。

相关工作与启发

  • vs 多比特身份载荷研究:这类方案可以恢复实体相关消息;本文强调零比特多密钥部署也可能归因。区别在于部署中的对应关系,而非新增身份编码算法。
  • vs 水印移除、伪造与规则推断研究:它们关注信号被破坏、伪造或恢复;本文关注观察者利用信号做实体推断。检测成功或规则恢复成功,本身不证明实体识别成功。
  • vs 神经作者归因与风格分析:这些工作分析内容中的来源线索;本文通过提示词匹配和两类对照检查水印相关差异的贡献,但并未否认现实中其他线索。
  • vs 分布保持和不可检测水印:本文将其视为可能减少外部暴露的研究方向,没有证明这些构造的保证失效。内部归因能力与外部可学习性必须分别评价。
  • 治理启发:论文指出既有透明度框架已经涉及目的、留存和访问保护,因此不是从“完全没有治理”出发;其增量诉求是明确评估实体可链接性,并为持续归因和二次使用设置可执行边界。这里概述作者论证,不构成独立法律意见。

评分

  • 新颖性: 4/5。将两类观察者与部署持续性统一为治理议题,但不主张首次发现水印隐私风险。
  • 实验充分度: 3/5。受控对照和内部覆盖有价值,外部覆盖、规模及变换条件仍有限。
  • 写作质量: 4/5。清楚区分可行性、假设场景与实际部署证据,并明确每密钥误报的边界。
  • 价值: 4/5。为溯源系统增加实体级隐私评估维度,同时保留合法审计与问责用途。