跳转至

SPLIT: Training-Free AI-Generated and Partially Edited Video Detection via Spatial Patch-Level Incoherence and Temporal Roughness

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/mldljyh/SPLIT
领域: AIGC 检测
关键词: AI 生成视频检测、免训练检测、局部视频篡改、极低误报率、冻结特征统计

一句话总结

SPLIT 用一个完全免训练的检测器在冻结视觉编码器的 patch token 上算两个统计量——两步时间粗糙度(TTR,比较 1 步与 2 步累积位移)与局部空间运动不一致(LSMI,特征空间运动场的空间梯度)——乘性融合并做 γ 校正后,仅用真实视频标定阈值,在 FakeParts / GenVideo / ViF-Bench 三个基准的 FPR = 0.1% 操作点上取得最高 Fake Recall(FakeParts 74.45%,远超最强监督基线 ReStraV 的 35.67%)。

研究背景与动机

文本到视频与图像到视频生成已经把高质量合成视频变得唾手可得,与此同时还有一类更隐蔽的威胁:局部编辑——局部 inpainting / outpainting、时间维的插帧与延展、换脸、风格迁移,等等。这些东西在真实服务里意味着一个非常具体的部署约束:误拒真实用户内容的代价极高,真实视频上的误报率(FPR)必须压到 0.1% 量级;而在这种极端尾部操作点上,AUROC 这类聚合指标根本反映不出实际行为——它衡量的是全局排序,可判决发生在分布的尾巴上。现有监督检测器沿着三条路走:空间伪影、频域线索、时空不一致,且大多架在大规模预训练视频编码器上(DeMamba、AIGVDet、XCLIP、NPR、STIL、FTCN、MINTIME、TALL)。它们在训练分布内很强,可一旦换生成器、加后处理、尤其是面对「画面大部分仍是真实内容」的局部编辑,就会明显退化。免训练这一线(ReStraV 的感知拉直、D3 的片段级二阶时间波动)确实改善了跨生成器泛化,但它们都在帧级或片段级做池化。

矛盾就出在这里:局部编辑留下的证据是稀疏且空间局部的——一帧里被改的往往只是一小块区域,而 D3 把整个片段压成一个标量、ReStraV 把一帧压成一个摘要,这种池化会直接把稀疏证据稀释掉。FakeParts 的评测印证了这一点:不少检测器在局部编辑上掉点高达 50%,因为保留原样的真实上下文正好抵消了全局方法的判据。另一半问题在于阈值本身:部署时拿不到目标域的假样本,只能用真实数据标定阈值,可「在某个真实域上标好的阈值换一个真实域还能不能用」此前几乎没人量化。

本文的切入点是放弃「一帧一个嵌入」的压缩,直接在冻结编码器输出的 patch token 上做统计,并且把两条互补的局部线索分开度量。核心 idea:篡改在特征空间留下两类局部痕迹——单个 patch 的特征轨迹不再平滑(时间粗糙度),相邻 patch 的时间变化不再空间协调(运动场梯度不一致)——两者都不含任何可学习参数,乘性融合并用 γ 次幂放大尾部差异后,只用真实视频标定阈值就能在 FPR = 0.1% 处判真假。

方法详解

整体框架

输入是一段视频片段。SPLIT 先用一个冻结的预训练视觉编码器逐帧抽 patch token,堆叠成 \(T\times N\times D\) 的张量;在这个张量上并行走两条纯统计的支路——TTR 沿时间轴检查每个 patch 的特征轨迹平不平滑,LSMI 把相邻帧的 patch 特征差当作「运动场」、检查它在空间上跳不跳;两条支路各自聚合成一个标量后相乘、再做 γ 次幂校正,得到最终分数 \(s(x)\),最后用一个只用真实视频标定出来的阈值 \(\tau\) 判决真伪。整个过程没有任何需要训练的参数:唯一的常数 γ 在一个小的留出验证集上定一次(γ = 8)之后,在所有基准和所有 FPR 目标上固定不动。

这是纯特征统计型方法,没有网络结构可言,所以下面不画流程图,两条线索的度量式就是全文的核心。

关键设计

1. 从全局嵌入换到 patch token:让稀疏证据不被池化掉

D3 这类方法在片段级做二阶差分——先要把一帧压成一个向量,再对整段池化,局部编辑的证据在这一步就被稀释掉了。SPLIT 的做法是把粒度下沉:对 transformer 编码器(CLIP、XCLIP、DINO 等)直接取最后一层 patch token 并丢掉 [CLS],得到每帧 \(N\)\(D\) 维 token;对 CNN 编码器(ResNet、VGG、EfficientNet、MobileNet 等)取最后一层卷积特征图,把每个空间格子当一个 token,于是 \(N=H'W'\)\(D=C\)。沿时间堆叠得到 \(P\in\mathbb{R}^{T\times N\times D}\),再把 \(N\) 个 token 排成 \(H_p\times W_p\) 的二维网格(ViT 式切 patch 就是它的 patch 网格,CNN 就是特征图尺寸),为后面的空间邻域运算做准备。这一步换来两项收益:一是时间线索不再被帧级池化抹平,消融显示把 TTR 从 [CLS] 全局嵌入换成 patch token,FPR = 0.1% 下 Fake Recall 从 54.21% 跳到 68.29%(+14.08 个点),是全文单项最大增益;二是 patch 网格本身就是设计 3 里 LSMI 能做「空间梯度」的前提——没有网格就没有邻域。

2. 两步时间粗糙度 TTR:比较 1 步与 2 步累积位移

针对的是生成或局部编辑常留下的局部闪烁、纹理刷新不同步、局部时间错位。对每个 patch \(n\),先沿时间把相邻帧的特征位移模长累加起来,得到累计 1 步位移 \(L_1(n)\);再算累计 2 步位移并做归一化,让它与 1 步可比:

\[\hat L_2(n)=\sum_{t=1}^{T-2}\lVert p_{t+2,n}-p_{t,n}\rVert,\qquad L_2(n)=\Big(\frac{\hat L_2(n)}{2}\Big)\cdot\frac{T-1}{T-2}\]

除以 2 是把两步的位移摊回到单步尺度,乘 \((T-1)/(T-2)\) 是补偿两步序列比一步序列少一个样本,这个定义要求 \(T\ge 3\)。然后取对数比:

\[\mathrm{TTR}(n)=\log_2\frac{L_1(n)+\epsilon}{L_2(n)+\epsilon}\]

几何直觉很干净:如果 patch 特征匀速演化,走两步的弦长恰好等于两步的路径长,\(L_2\) 归一化之后与 \(L_1\) 相等,TTR ≈ 0;而一旦出现闪烁、纹理刷新或局部错位,相邻位移的方向不再对齐,绕过弯路的路径长 \(L_1\) 就会超过弦长代理 \(L_2\),TTR 随之变大。之所以用对数比而不是差值,是因为它把绝对运动幅度约掉了——快镜头和慢镜头不会被这个量区分开,只有「不光滑」才会被放大,这对跨内容泛化很关键。片段级统计是在对数空间取平均,\(\overline{\mathrm{TTR}}=\frac{1}{N}\sum_n \mathrm{TTR}(n)\),等价于各 patch 粗糙度比值的几何平均再取对数:既聚合了乘性证据、对少数极端离群的 patch 不敏感,又给出低方差的分数——低方差正是超低 FPR 阈值标定能站住的前提。作者也很克制地说明:TTR 是一个统计线索,而不是每个假视频的必然属性;真实视频遇到硬切、抖动、突变运动同样会出现高 TTR,这部分天然尾部由「只用真实数据标定阈值」吸收。

3. 局部空间运动不一致 LSMI:看运动场的空间梯度

第二个线索问的是一个 TTR 回答不了的问题:时间变化在空间上协不协调。把 patch token 排回 \(H_p\times W_p\times D\) 的网格,相邻两帧相减得到逐帧的「运动场」 \(M_t=P_{t+1}-P_t\),再用前向差分求它的空间梯度:

\[\nabla_x M_t(i,j)=M_t(i,j)-M_t(i,j+1),\qquad \nabla_y M_t(i,j)=M_t(i,j)-M_t(i+1,j)\]

LSMI 就是这些梯度模长在时间与空间上的平均:

\[\mathrm{LSMI}=\frac{1}{2}\Big(\mathbb{E}_{t,i,j}\big[\lVert\nabla_x M_t(i,j)\rVert_2\big]+\mathbb{E}_{t,i,j}\big[\lVert\nabla_y M_t(i,j)\rVert_2\big]\Big)\]

直觉是:真实视频里相邻 patch 通常一起动——同一个物体或同一次相机运动会覆盖一整片区域,所以运动场在空间上平缓、梯度小;而局部生成或编辑会在某个区域内产生与周围不同的时间变化,邻接 patch 之间出现突跳,梯度因此变大。值得强调的是这里的「运动」完全在特征空间里算,不需要 RAFT 之类光流网络,也就没有额外的前向开销。消融显示 LSMI 单独用非常弱(FPR = 0.1% 只有 8.04%),但它承载的是 TTR 完全没有的空间协调性证据:两者融合后在所有操作点上都是最优,最严阈值处比「只用 patch-level TTR」再高 6.16 个点。这也解释了作者为什么坚持两个线索都留——它们不是互相替代,而是各管一个维度。

4. γ 校正的乘性融合与真实数据标定判决

两个线索按乘法合成一个分数:\(s(x)=\mathrm{TTR}^{\gamma}\cdot\mathrm{LSMI}\),γ 是一个固定、不可学的锐化常数。选乘法而非平均,是因为两个线索里只要有一个不成立就应该把分数压低——LSMI 单独很弱,TTR 也会被真实视频的抖动抬高,相乘等于「两者同时偏高才算假」;而 γ 次幂把 TTR 拉到高次方,放大的是它在分数上的相对差异。这一步不是随手加的:判决发生在 FPR = 0.1% 的极端尾部,需要的不是全局排序能力而是尾部两端的分离度,幂函数恰好对分数大的样本压缩、对分数小的样本拉开(或反之),γ 越大这种非线性锐化越强。作者在小留出验证集上选了 γ,从 1 到 8 各操作点都稳定增益,到 16 已经饱和甚至在某些 FPR 上轻微回退,于是全程固定 γ = 8。

判决阈值不使用任何固定常数,而是「服务对齐」地反解出来。给定目标误报率 \(\alpha\in\{0.1\%,1\%,5\%\}\),在只用真实视频构成的标定集 \(\mathcal{R}\) 上取满足误报约束的最小阈值:

\[\tau_\alpha\triangleq\inf\{\tau:\ \Pr_{x\sim\mathcal R}[s(x)\ge\tau]\le\alpha\}\]

测试时 \(s(x)\ge\tau_\alpha\) 判为篡改、否则判为真实。为了让「恰好在一个真实域上标得好」的方法不占便宜,作者进一步提出 cross-real threshold transfer:分别在两个不重叠的真实集上各标一套阈值——FakeParts 的真实子集 ROVI 与 GenVideo 的真实子集 MSR-VTT——两套阈值都跑一遍测试基准,报两次 Fake Recall 的调和平均。主表用的就是这个调和平均数。

一个完整示例

以一段 2 秒、8 fps 的片段为例(以下 patch 数只为示意):16 帧经 XCLIP-B/16 在 224×224 上编码得到 14×14 = 196 个 patch,于是 \(P\in\mathbb{R}^{16\times196\times D}\)。对第 \(n\) 个 patch,\(L_1\) 是 15 个相邻帧位移之和,\(L_2\) 是 14 个跨帧两步位移之和除以 2 再乘 15/14。假设画面右下角有一小块被 inpainting 过,那个区域 patch 的特征会在编辑帧附近突跳一次,\(L_1\)\(L_2\) 多出来的那一截就是它的 TTR;把 196 个 patch 的 TTR 在对数空间平均,得到片段级 TTR。LSMI 那边把 196 个 token 排成 14×14 网格,算出 15 个运动场,每个场做 x / y 方向的前向差分,在有效位置(去掉最后一行一列)上取平均梯度模长。两路相乘再做 8 次幂,得到一个标量分数。最后拿出标定集上 0.1% 分位点作为 τ:分数超过就判为篡改。整个流程在 1000 条 FakeParts T2V 样本上的端到端耗时与同一 backbone 下的 D3 相当——开销几乎全被冻结编码器的前向占掉了。

损失函数 / 训练策略

SPLIT 没有训练阶段,也没有损失函数,不需要任何训练数据,因此不存在优化策略与学习率之类的超参——整套方法只有 γ = 8 这一个人为选定的常数。作为对照,实验中的十个监督基线统一用 GenVideo-100K 作为唯一训练集:NPR、STIL、FTCN、MINTIME、TALL、XCLIP、DeMamba 用官方 DeMamba 仓库复现,FID、AIGVDet、ReStraV 用各自官方实现训练与评测,D3 用官方仓库。实现细节上,默认编码器是 XCLIP-B/16,抽取不超过 2 秒的片段、8 fps 均匀采样、从长边裁掉 10%、统一 resize 到 224×224;所有实验在 AMD EPYC 9554 64 核 CPU 与单张 NVIDIA RTX A6000 上完成。

实验关键数据

主实验

三个基准的 Overall Fake Recall(%,cross-real threshold transfer,即两个真实域阈值分别评测后取调和平均):

基准 FPR SPLIT(免训练) 最优监督基线 D3(免训练)
FakeParts 0.1% 74.45 35.67(ReStraV) 2.28
FakeParts 1% 83.58 61.89(ReStraV) 37.42
FakeParts 5% 89.70 77.75(ReStraV) 70.59
GenVideo 0.1% 85.16 45.52(ReStraV) 5.47
GenVideo 1% 93.09 81.89(ReStraV) 66.50
GenVideo 5% 97.35 92.32(ReStraV) 90.52
ViF-Bench 0.1% 84.52 33.93(ReStraV) 0.97

FakeParts 内部八类操纵在 FPR = 0.1% 的分解(%),这也是最能体现「部分编辑」与「全生成」差别的一张表:

操纵类型 SPLIT ReStraV D3 说明
Style Change 98.80 18.60 0.34 全片风格改写,线索最密集
Extrapolation 97.86 23.27 0.00 时间延展,轨迹不平滑很明显
Outpainting 96.52 91.45 2.72 画面外扩,ReStraV 在此类也强
TI2V 95.27 73.13 0.66 图生视频,整段都是生成的
T2V 76.74 46.65 14.46 整段生成
Interpolation 67.81 0.18 0.00 插帧,局部时间改写
Faceswap 60.09 12.98 0.04 换脸,与人脸检测器语义无关
Inpainting 2.48 19.09 0.00 唯一失败类型,编辑区域最小

消融实验

组件消融(FakeParts Overall,Fake Recall %,cross-real threshold transfer):

配置 0.1% 1% 5% 说明
CLS 全局嵌入版 TTR 54.21 76.72 88.77 未用 patch token
Patch-level TTR 68.29 82.09 89.37 换成 patch token,+14.08
仅 LSMI 8.04 14.63 25.07 单独用很弱
Patch-level TTR + LSMI 74.45 83.58 89.70 完整模型,再 +6.16

编码器消融与后处理鲁棒性(均取 FakeParts Overall):

配置 0.1% 1% 5% 说明
SPLIT + XCLIP-B/16(默认) 74.45 83.58 89.70 最优组合
SPLIT + CLIP-B/16 71.47 81.56 89.39 同为 transformer、同粒度
SPLIT + ResNet18 61.23 77.87 88.01 轻量 CNN 也远超 D3
D3 + XCLIP-B/16 2.28 37.42 70.59 同 backbone 的免训练基线
Gaussian Blur σ = 1 62.54 77.49 88.71 后处理:轻微模糊
Gaussian Blur σ = 2 55.42 73.50 88.47 后处理:最强干扰
JPEG q = 90 70.45 80.89 88.83 后处理:影响小
JPEG q = 80 64.40 77.11 87.12 后处理:影响仍然有限
Flip(x 轴) 75.73 82.79 88.84 水平翻转几乎无损
Flip(y 轴) 66.92 80.42 88.52 垂直翻转小幅下降

跨真实域标定稳定性(标定域→测试域,表内为实际 FPR %,目标值应为 0.1 / 1 / 5):

方法 MSR-VTT→ROVI @0.1 @1 @5 ROVI→MSR-VTT @0.1 @1 @5
SPLIT 0.03 0.29 4.22 0.56 2.18 5.49
D3 0.00 0.07 1.52 1.18 4.06 9.04
ReStraV 0.00 0.00 0.00 15.30 39.86 66.10
AIGVDet 13.22 25.12 31.69 0.00 0.00 0.02
FID 0.62 8.25 38.64 0.01 0.16 0.67
FTCN 0.48 2.28 7.40 0.01 0.28 2.68

关键发现

  • patch 粒度是最大功臣,LSMI 是互补项:把 TTR 从 [CLS] 全局嵌入换成 patch token 带来 +14.08(54.21 → 68.29),是单项最大增益;LSMI 单独只有 8.04,但融合后在最严阈值处再涨 +6.16。作者的解读是 patch 级时间粗糙度是主判别线索,LSMI 补上空间协调性证据,在真实数据标定的严格尾部进一步把真假拉开。
  • 差距只在超低 FPR 处才显现:三个基准上 SPLIT 的优势都在 FPR = 0.1% 最大,越放松越小(FakeParts 从 +38.78 个点缩到 +11.95)。这正支持了论文的核心论点——AUROC 这类聚合指标看不见这个区间,服务对齐的操作点才是真正区分方法的地方。
  • Inpainting 是唯一失败类型:0.1% 只有 2.48%,反而输给 ReStraV 的 19.09%。作者的解释是每帧被编辑的区域太小;SPLIT 在这一类上排第二,但这个案例说明 patch 级统计在极小区域 + 邻域平滑的场景下会被真实视频的天然尾部分布淹没。
  • 方法与编码器无关,但空间粒度越细越好:七种 backbone(CLIP、XCLIP、DINOv2、ResNet18、VGG16、EfficientNet-b4、MobileNet-v3)上 SPLIT 都大幅赢过同 backbone 的 D3,且 B/16 版本稳定优于 B/32——与「局部伪影需要更高 patch 分辨率」的假设一致,也说明增益来自 patch 级打分而非某个特定预训练表征。
  • 对后处理鲁棒,且不依赖高频像素伪影:模糊最伤(σ = 2 时从 74.45 掉到 55.42,仍略高于最强的监督基线 ReStraV 的 54.73),JPEG 压缩影响明显更小(q = 80 仍保 64.40),几何翻转几乎无损(水平 75.73、垂直 66.92),说明打分聚合的是 patch 级时空证据、不依赖绝对空间朝向。对比之下频域方法 NPR 在 FakeParts Overall 的 0.1% 上只有 0.12%,正好印证高频伪影在尾部没有区分度。
  • 阈值跨真实域可移植:SPLIT 在两个方向上把迁移后的实际 FPR 都压在目标附近(0.03 / 0.56 对目标 0.1),而 ReStraV 反向漂到 15.30%、AIGVDet 正向漂到 13.22%——这些方法在某个真实域上标出的超低 FPR 阈值换个域就失效,实际部署中会直接崩掉。
  • 免训练但吞吐不掉:在相同 backbone 下 SPLIT 的端到端推理时间与 D3 相当,轻量的 TTR / LSMI 计算相对冻结编码器前向可以忽略,却在 FakeParts Overall @0.1% 上把分数从 2.28 抬到 74.45。

亮点与洞察

  • 用「路径长 vs 弦长」的几何直觉做免训练检测:匀速演化时两步弦长等于两步路径长,只有绕过弯路才让两者分离。这个构造的巧妙之处是把「不平滑」变成对绝对运动幅度不敏感的对数比——不需要训练、不需要光流网络、不需要任何标注,却能直接对准闪烁和局部时间错位这类生成伪影,是全文最有复用价值的想法。
  • 乘性融合 + γ 次幂是对「判决发生在极端尾部」的正面回应:平均融合优化的是全局排序,而幂次锐化放大的是分数尾部的相对差异。把部署约束(FPR ≤ 0.1%)反推到融合函数的设计上,而不是先设计融合再报告 AUROC,这个思路比融合公式本身更值得借鉴。
  • cross-real threshold transfer 可能是最可迁移的贡献:任何「只用真实数据标定阈值」的检测器都能用这套协议衡量标定稳定性,而不只是本文。它把一个通常被忽略的工程问题(阈值能不能换域)变成了一个可量化的指标,而且实验确实揭出了 ReStraV、AIGVDet 这类方法在超低 FPR 下的不可移植。
  • 可迁移方向:TTR 与 LSMI 都只依赖「逐帧 token 序列 + 空间网格」,因此可以直接搬到别的模态——音频 AIGC 检测把谱图切成 token 序列后同样能算时间粗糙度;图像 AIGC 检测可以把 LSMI 推广到单图(用相邻 patch 的差异代替时间运动场);patch 网格上的前向差分也可以替换成任意空间算子(拉普拉斯、邻域方差)来构造新的空间不一致度量。

局限与展望

  • 作者承认 TTR 只是统计线索:真实视频遇到硬切、抖动、突变运动同样会产生高 TTR,这部分靠真实数据标定的尾部来吸收,意味着方法在「真实视频本身就很粗糙」的域上会更容易失守。
  • 作者承认模糊下退化明显:σ = 2 时从 74.45 掉到 55.42,掉了约 19 个点,说明部分信号仍依赖相对精细的空间结构,而不是纯粹的高层语义。
  • 定位能力的空缺是最明显的短板:全文动机是「patch 级证据」,TTR(n) 与 LSMI 本身就是逐 patch 的,但最后只做了平均、输出一个片段级标量,没有任何空间热图或篡改区域定位实验。FakeParts 明明提供了像素级与帧级标注,不给定位结果等于把方法最大的一处潜在优势丢掉了——把逐 patch 的 TTR 直接当热图上采样回原分辨率,很可能是最自然的改进方向。
  • γ 的选择过程交代不足:方法免训练、不用训练集,但 γ = 8 是在留出验证集上选的,正文没有说明该验证集是否与测试生成器重叠、以及 γ 在不同 backbone 上是否仍是最优(只在补充材料给了 GenVideo / ViF-Bench 的同样趋势)。
  • Inpainting 上的失败需要一个更细的解释:2.48% 与 ReStraV 的 19.09% 差距很大。作者归因为编辑区域太小,但这同时也可能是 patch 级统计被邻域平均抹平、或真实视频天然尾部把信号淹掉。更细的 patch 粒度(B/32 → B/16 已证明有效)或引入局部归一化 / 显著性加权,是两条可以试的路。
  • 实验设置偏窄:只测了 2 秒、8 fps、224×224 的短片段,长视频、高分辨率、以及跨分辨率迁移下 TTR 的方差与阈值可移植性都没有验证。

相关工作与启发

  • vs D3:D3 同样免训练,但在片段级用中心差分测二阶时间波动,且要先把一帧压成一个全局嵌入。SPLIT 保留 patch token,把「时间不平滑」与「空间不协调」拆成两个线索再相乘。在与 D3 用同一个 backbone(XCLIP-B/16)的对照下,FakeParts Overall @0.1% 从 2.28% 提升到 74.45%,说明增益主要来自聚合粒度的下沉,而不是换了更强的特征。
  • vs ReStraV:ReStraV 也建立在冻结特征动力学上(感知拉直的观察:自然视频在 DINOv2 特征空间里轨迹更直),但它需要在帧级统计量(步距、曲率)上训练一个轻量分类器,而且统计是帧级 / 全局抽象的。SPLIT 没有任何可学习参数、不需要训练集,并且把粒度下沉到 patch。ReStraV 是三个基准上最强的监督基线(FakeParts 35.67%、GenVideo 45.52%、ViF-Bench 33.93%),但都被 SPLIT 大幅超过;同时它在跨真实域阈值迁移上出现了严重漂移(反向 15.30%),说明其分数分布对真实域更敏感。
  • vs DeMamba / AIGVDet 等监督视频检测器:它们在近域基准上很强(GenVideo Overall @0.1%:DeMamba 10.00%、AIGVDet 45.38%),但一遇到新生成器或局部编辑就明显退化——同一个 FPR 下 ViF-Bench Overall 分别只剩 3.30% 和 25.69%。SPLIT 完全不训练,却在 ViF-Bench 的每一个生成器上都排第一。
  • vs 频域方法 NPR:NPR 依赖生成器上采样留下的频域伪影,理论上跨生成器通用,但在超低 FPR 下几乎全为 0(FakeParts Overall @0.1% 仅 0.12%)。这与 SPLIT 对 JPEG 压缩相对不敏感相互印证:高频像素级伪影在分布尾部不具备区分度,而 patch 级的时空统计量可以。

评分

  • 新颖性: ⭐⭐⭐⭐ [两个线索本身是经典统计直觉(路径长 vs 弦长、运动场空间梯度),但组合方式、γ 尾部锐化融合与 cross-real 评测协议是新的;免训练 + patch 级粒度确实在局部编辑检测上打开了新空间]
  • 实验充分度: ⭐⭐⭐⭐⭐ [3 个基准、8 类操纵、10+ 生成器、11 个基线、7 种 backbone 的编码器消融、4 类后处理的鲁棒性、跨真实域标定稳定性,覆盖面很足]
  • 写作质量: ⭐⭐⭐⭐ [方法与动机讲得清楚、公式节制;但 Table 6 的排布与 Figure 3 叠加的标注较难读,γ 选择集等关键设置被推到了补充材料]
  • 价值: ⭐⭐⭐⭐ [免训练 + 超低 FPR 部署约束 + 跨真实域阈值标定,直接对准真实服务场景;Inpainting 上的失败与完全缺失的定位能力限制了近期落地]