Less Supervision, Better Generalization: Weakly Supervised Fake Region Localization in Diffusion-Edited Images¶
会议: NeurIPS2026(任务清单归属;所读版本为 arXiv 预印本)
arXiv: 2609.36882v1
领域: AI 安全
关键词: 弱监督定位、图像取证、重建先验、多实例学习、跨生成器泛化
一句话总结¶
ReGFLoW 用图像级真假标签训练双编码器与 VAE 重建引导的区域评分网络,在部分编辑与全合成混合评测中取得更高的跨生成器平均 F1,但付出明显的域内定位精度代价,且仅部分编辑时并未超过最强掩码监督基线的 OOD 均值。
研究背景与动机¶
图像真假分类只能说明整张图是否可疑,不能给出修改发生在哪里的空间证据。扩散编辑的区域定位又不等同于语义分割:一个物体内部的纹理、背景或光照都可能改变,伪迹未必沿物体轮廓分布。MaskCLIP、TruFor 等密集监督方法可以在受控数据上学到清晰的编辑区域,但训练掩码通常描述“希望编辑哪里”,而不一定完整描述生成过程留下的痕迹。
论文认为,这种差别带来两重约束。首先,指令式或托管编辑服务往往只暴露输入、指令与输出,不提供可靠的逐像素伪迹标签;其次,潜空间编码、解码及融合可能影响掩码外区域,而掩码监督把这些位置一律当作真实,会压制可迁移的弱证据。附录 A 进一步区分了条件掩码、界面选区与取证监督掩码,并说明前后图像差分会混合几何错位、曝光和纹理协调等变化,不能直接充当可靠标签。
但去掉掩码并不会自动解决定位问题:图像标签只要求找出足以判断“假”的证据,容易只激活几个位置或产生大面积误报;按语义相似度扩张激活区域,也可能把整个人或物体当成编辑区域。核心 idea:以冻结扩散模型 VAE 的重建行为提供空间先验,通过特征与分数双重注入以及伪迹中心多实例学习,把图像级真假监督转化为区域证据,而不强制伪迹服从编辑掩码边界。
方法详解¶
整体框架¶
ReGFLoW 输入待鉴别图像及其重建残差先验,输出区域定位图和独立的图像级真假预测。双编码器表征结合冻结 CLIP 的全局语义与可训练 MAE 的局部特征;重建引导打分把冻结 SD1 VAE 的残差注入局部特征和区域 logits,生成低分辨率评分图。
训练时,伪迹中心多实例学习从评分图聚合证据,并用图像真假标签约束真假样本的证据顺序;图像分类分支另外结合全局表征与高响应局部区域。测试时,逐图自适应校准在上采样评分图上调整阈值,再输出二值掩码;它不参与训练损失,也不等于经过统计验证的后验概率校准。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400, 'subGraphTitleMargin': {'top': 8, 'bottom': 16}}}%%
flowchart TD
I["待鉴别图像"] --> A["双编码器表征"]
subgraph B["重建引导打分"]
R["冻结 SD1 VAE<br/>重建残差与先验编码"] --> F["特征门控修正<br/>与分数偏置"]
end
I --> R
A --> F
F --> S["区域评分图"]
S -->|训练| C["伪迹中心多实例学习"]
Y["图像真假标签"] -.-> C
A --> H["图像分类分支"]
S -->|高响应局部表征| H
Y -.-> H
S -->|测试| D["逐图自适应校准"]
D --> O["定位掩码"]
关键设计¶
1. 双编码器表征:同时保留全局语义与局部伪迹线索
单靠高层语义可能把关注点固定在物体上,而伪迹又可能表现为弱纹理或局部不一致。模型使用冻结的 CLIP ViT-L/14 提供全局视觉特征,使用 ImageNet 预训练 MAE ViT-B/32 初始化可训练的局部伪迹编码器,并通过中间层交叉注意力交换两路信息。冻结的是 CLIP 编码器,不是整个定位网络;局部编码器与任务头仍接受真假监督更新。
局部分支输入分辨率为 512×512。正文描述局部特征先形成 32×32 网格,再经平均池化压到 16×16,通道数为 768;这让多实例学习面对的区域集合更紧凑,降低稀疏图像级梯度传播的困难。附录列出的 MAE 骨干名称不能直接代替完整侧适配网络的尺寸说明,本文也不据骨干名称自行推导另一套网格尺寸。
图像分类分支从全局编码器选取 CLS 特征,经过单层注意力汇总,再与局部证据拼接。局部证据来自评分最高的 10% 位置:先做硬选择,再用标准化分数形成掩蔽 softmax 注意力加权,最后交给两层 MLP。这里的硬 top-10% 选择属于分类分支,不能与下文定位 MIL 的软聚合混为一谈。
2. 重建引导打分:让先验分别修正特征与分数
先验来自冻结 SD1 VAE 的一次编码和解码,而不是反向扩散、去噪采样或扩散反演。论文的依据是:经过潜在扩散模型生成的内容可能更贴近其自编码器学习的流形,因而呈现较小或更规则的重建残差。但残差大小不是直接的真假标签,模型需要学习它与局部伪迹之间的关系,不能简单把高残差区域判成假。
正文式(1)按通道计算绝对差,三层卷积先验编码器把残差变成空间特征,再池化到同样的 16×16 网格,先验通道数为 32。附录 C 则说训练加载的是离线提供的 128×128 单通道残差;原文没有明确交代通道归约与预处理的完整转换,因此不能把二者无条件视为同一个实现细节。
局部特征与先验特征分别经过卷积投影,拼接后预测修正量;可学习标量门控限制修正强度。基础评分头在修正特征上预测 logits,另一个偏置分支同时读取修正特征与先验特征,把重建线索直接加到 logits 上。
两个门控标量都初始化为 0.05,因而特征修正从接近恒等的状态开始,却不是严格零修正。严格零初始化发生在偏置预测器最后的 1×1 卷积:偏置分支初始输出为零,初始分数因此等于基础 logits。这样的区别很重要,否则会把“弱注入先验”误写成“所有重建分支初始完全关闭”。
3. 伪迹中心多实例学习:用真假证据排序代替像素标签
每张图的 16×16 logits 构成一个包含 256 个实例的集合。假图只需某些区域具有生成证据,真图则不应出现强伪迹响应;直接平均会稀释小编辑,固定截取若干最高分区域又不适应面积差异。正文式(5)使用逐图标准化 logits 的 softmax 权重,对原始 logits 加权求和:
其中均值和标准差在单张图的区域 logits 上计算,锐度参数控制对高响应实例的集中程度。它可以理解为软 top-k,但并没有执行字面意义的硬 top-K 截断;所有位置仍在可微聚合中。正文消融段落的“adaptive top-k”应按此公式理解,不宜凭名称改写算法。
接下来对批内所有假图与真图配对,要求假图聚合分数高出真图一个间隔。这样约束的是证据排序,不是“假图所有区域都是假”,也没有给局部实例提供人工伪掩码。
排序监督仍可能只找到判别性强的少数区域,无法单独保证完整空间覆盖。因此还要抑制真图高响应、约束假图空间平滑,并结合分类与附录中的辅助正则;弱监督不等于没有监督,更不等于没有预训练模型先验。
4. 逐图自适应校准:把相对区域分数变成样本自适应阈值
弱监督排序主要约束相对证据大小,各图绝对分数尺度可能不同。测试时先将 logits 双线性上采样到输入分辨率,计算该图 raw logits 的均值、标准差,以及 raw sigmoid 概率的全图平均。后者虽然被原文称为“positive response ratio”,实际是连续概率均值,不是超过 0.5 的像素比例。
再将 logits 减去阈值、除以标准差并乘以尺度系数,经过 sigmoid 后以 0.5 二值化。默认中心为 0.08,基础系数为 0.9,调整强度为 0.50,系数范围为 0.40–1.20,尺度系数为 2.0,稳定项为 10^-6。平均 raw 响应越高,阈值偏移通常越小;这是分布归一化与启发式阈值调整,并不保证预测概率具有可靠的频率学意义。
一个完整示例¶
设待鉴别图像有一处局部纹理被修改。CLIP 提供整体场景表征,局部编码器提供空间特征,VAE 则给出与输入对齐的重建残差;这些残差不会直接成为编辑掩码,而是分别影响特征修正量和分数偏置。
形成 16×16 评分图后,训练中的软 MIL 聚合更重视高响应区域,再与真图的聚合证据比较。图像分类分支另行选择最高响应的 10% 局部位置与全局特征联合判断;测试定位则对整幅上采样 logits 做逐图校准,不走训练中的真假配对排序。
如果编辑小于区域网格的有效空间尺度,较强证据可能落在一个同时覆盖真实与修改内容的实例里。即使最终插值到像素分辨率,也不能凭插值恢复不存在的精确边界,这正是附录 F 承认的小编辑定位局限。
损失函数 / 训练策略¶
正文式(7)列出 MIL 排序、图像分类交叉熵、真图难负例抑制与边缘感知平滑四项。真图抑制取该图最高的 10% 区域 logits 的均值并施加 softplus,专门处理真图上少量高分误报;假图平滑在二维相邻位置上惩罚概率差,图像灰度边缘较强时降低惩罚,默认边缘权重参数为 10.0。
附录 B 的式(9)还加入假图稀疏项、区域对比项和可选峰值分离项。稀疏项轻量惩罚假图平均 sigmoid 响应,防止简单地全图激活;对比项选取假图高响应与真图难负例区域嵌入,利用来自图像标签的类别进行监督对比,默认选择比例与温度均为 0.10。峰值分离项默认权重为零,不属于默认启用的训练贡献。
这些附录项不能静默合并成“与正文完全相同的损失”。附录 B 给平滑权重 0.03、稀疏权重 3×10^-3;附录 C 给平滑权重 0.05,并采用 rank、contrast 等不同命名,未在该列表重述稀疏项。二者均列出真假抑制权重 0.05、对比权重 0.02;训练配置存在说明不一致,需实现或作者澄清。
附录 C 报告训练 10 个 epoch,采用 AdamW、学习率 5×10^-5、权重衰减 0.05、无 warmup,新增任务头学习率倍率为 3.0,随机种子为 42。它同时写“6 GPUs、每卡 batch 8、有效 batch 64”,但直接相乘是 48;没有交代能解释差异的梯度累积配置,因此这里保留冲突而不替作者修正。
训练不使用像素掩码,它们只用于评测。重建残差在训练时随样本加载,测试时同样需要获得该先验;冻结 VAE 只是不增加其训练参数,不能据此声称没有额外预处理或推理成本。
实验关键数据¶
主实验¶
实验采用 OpenSDID 协议,以 SD1.5 训练并作域内评测,其他生成器作跨域评测。P 指仅部分编辑图像,P+F 指部分编辑与全合成图像共同训练和评测;下表摘自正文表 1、表 2,全部是像素级 F1,OOD Avg 是四个跨域生成器的均值,不包括 SD1.5。
| 设置 | 方法 | SD1.5 | SD2.1 | SDXL | SD3 | Flux.1 | Avg. | OOD Avg. |
|---|---|---|---|---|---|---|---|---|
| P | MaskCLIP | 75.8 | 63.2 | 35.2 | 49.8 | 18.4 | 48.5 | 41.7 |
| P | ReGFLoW | 49.3 | 46.3 | 34.9 | 43.9 | 29.2 | 40.7 | 38.6 |
| P+F | MaskCLIP | 95.1 | 73.2 | 20.8 | 17.7 | 4.8 | 42.3 | 29.1 |
| P+F | ReGFLoW | 35.6 | 33.4 | 30.1 | 32.2 | 29.4 | 32.2 | 31.3 |
P 设置下,ReGFLoW 的 Flux.1 得分更高,但 OOD Avg 与域内得分都低于 MaskCLIP。P+F 设置下,OOD Avg 从 29.1 到 31.3,并不意味着每个生成器都赢:SD2.1 仍明显落后,而域内 F1 从 95.1 到 35.6 的代价尤其大。论文强调的收益应限定为部分跨域条件下的迁移,而非全面优于密集监督。
正文表 3 的图像级检测中,ReGFLoW 的 OOD F1/ACC 为 76.22/80.93,MaskCLIP 为 69.28/76.33,NPR 为 73.71/75.74。检测指标不能替代区域定位指标;例如 Flux.1 上 ReGFLoW 的检测 F1 为 56.78,仍低于 NPR 的 67.62。
消融实验¶
下表来自正文表 4。原表及紧邻消融段落未明确单列该表的数据划分与生成器范围;49.38 接近主表域内数值也不足以据此断言它是 OOD 均值。末行同时不含两个重建模块并改变训练目标,不能当作只移除 MIL 的单变量实验。
| 配置 | 分数偏置 | 特征融合 | 伪迹中心 MIL | Pixel F1 |
|---|---|---|---|---|
| ReGFLoW | 有 | 有 | 有 | 49.38 |
| w/o Bias Predictor | 无 | 有 | 有 | 46.06 |
| w/o Reconstruction Prior | 无 | 无 | 有 | 38.08 |
| Score-Pooling BCE | 无 | 无 | 无 | 32.34 |
完整配置优于保留特征融合但去掉分数偏置的配置;完全去掉重建先验后差距更大,支持双空间注入的价值。但这不证明“减少标签本身”产生全部增益,因为网络、空间先验与目标函数同时不同。
正文表 5 另在固定训练图像总量下增加一个源域,未见域的平均增益分别为 +4.40、+4.58、+3.52、+3.82。该表 SD1.5 单源基线与表 1 的数值不同,应作为独立域多样性实验解读,不把两套协议拼接;个别目标域也不保证上升,例如增加 SDXL 后 SD2 为 -0.08。
关键发现¶
- 重建先验提供了掩码之外的可学习空间线索,但先验本身不是像素真值,也不是“残差越大越假”的规则。
- 泛化收益最清晰的例子是远端生成器 Flux.1,以及 P+F 的 OOD 平均;域内精度和 P 的 OOD 平均则揭示了真实取舍。
- 固定总量的多源实验支持训练域多样性的作用,但不能独立识别弱标签、架构和先验各自的因果贡献。
- 附录 E 讨论微小编辑、压缩伪迹和高频真实纹理等失败情形;文本缓存含图注而非可交互原图,定性描述不替代图像逐例核验。
亮点与洞察¶
- 把生成过程的重建行为从整图检测线索转成局部可学习先验,是本文最有迁移价值的思路。特征修正与 logit 偏置分别干预表征和决策,不需要把残差阈值化成伪掩码。
- 区分“编辑控制区域”与“生成痕迹覆盖范围”比单纯降低标注成本更重要。定位目标不一定与语义边界重合,按物体相似度扩张热图可能偏离取证任务。
- 弱监督中应分别处理证据聚合、真图误报与最终阈值。本文对应的软 MIL、难负例抑制和逐图校准提供了这种分工,但每一项仍需在目标数据分布上验证。
局限与展望¶
- 作者承认额外重建步骤和小编辑定位不准;16×16 的评分网格限制边界细节,双线性上采样不能消除信息瓶颈。
- 论文批评编辑掩码不完整,却仍用它们评测像素 F1/IoU。检测掩码外真实生成痕迹可能被计为误报,既不能仅凭低分否认痕迹存在,也不能据作者解释自动豁免所有掩码外响应;需要更可靠的痕迹标注或分目标评测。
- SD1 VAE 先验对非同类生成流程的适用性不能由 OpenSDID 结果推广保证,且未提供足以支持“零额外延迟”的成本证据。
- 单通道残差预处理、batch 算术与损失配置均存在未澄清细节;正文和附录的不一致限制直接复现的确定性。
- 测试阈值使用固定启发式参数,稀疏正则与相对分布阈值也可能影响全合成图像的覆盖。后续应报告阈值敏感性、真图误报、不同编辑面积的表现及同架构监督强度对照。
相关工作与启发¶
- vs MaskCLIP / OpenSDI:同样结合 CLIP 与 MAE 来联合检测和定位,但本文用图像标签、重建先验及 MIL 学空间证据。对照呈现跨域收益与域内损失,而不是说明基础双编码器完全由本文首创。
- vs DIRE / AEROBLADE:这些工作说明重建误差可用于生成图像检测;ReGFLoW 用冻结 VAE 编解码残差进行区域特征与分数引导,不应将其写成 DIRE 式反向扩散流程。
- vs 语义弱监督定位 / WSCL:前者常借助物体相似性传播,后者用多源与区域一致性学习一般操纵线索。本文面向扩散痕迹,改用重建行为作为密集先验,但仍借助预训练视觉模型与图像标签。
- vs 既有扩散弱监督定位研究:参考文献中的 WACV 工作已研究受控扩散人脸定位。本文“首次”主张应限定为作者所强调的一般扩散生成与编辑图像设定,不能写成此前不存在任何扩散弱监督定位。
评分¶
- 新颖性: 4/5 — 将重建先验、双空间注入和伪迹中心 MIL 组合为一般扩散编辑定位方案,但弱监督定位和双编码器已有前例。
- 实验充分度: 3/5 — 包含跨生成器、混合假图类型及域多样性分析,但监督强度因果对照、消融范围与运行成本仍不充分。
- 写作质量: 3/5 — 主方法机制清楚,附录损失权重、有效 batch 与先验格式存在复现歧义。
- 价值: 4/5 — 对缺少密集掩码的图像取证有启发,实际部署仍需验证域内精度、微小编辑与误报风险。