SPLIT: Training-Free AI-Generated and Partially Edited Video Detection via Spatial Patch-Level Incoherence and Temporal Roughness¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/mldljyh/SPLIT
领域: AIGC 检测
关键词: AI 生成视频检测、免训练检测、局部视频篡改、极低误报率、冻结特征统计
一句话总结¶
SPLIT 用一个完全免训练的检测器在冻结视觉编码器的 patch token 上算两个统计量——两步时间粗糙度(TTR,比较 1 步与 2 步累积位移)与局部空间运动不一致(LSMI,特征空间运动场的空间梯度)——乘性融合并做 γ 校正后,仅用真实视频标定阈值,在 FakeParts / GenVideo / ViF-Bench 三个基准的 FPR = 0.1% 操作点上取得最高 Fake Recall(FakeParts 74.45%,远超最强监督基线 ReStraV 的 35.67%)。
研究背景与动机¶
文本到视频与图像到视频生成已经把高质量合成视频变得唾手可得,与此同时还有一类更隐蔽的威胁:局部编辑——局部 inpainting / outpainting、时间维的插帧与延展、换脸、风格迁移,等等。这些东西在真实服务里意味着一个非常具体的部署约束:误拒真实用户内容的代价极高,真实视频上的误报率(FPR)必须压到 0.1% 量级;而在这种极端尾部操作点上,AUROC 这类聚合指标根本反映不出实际行为——它衡量的是全局排序,可判决发生在分布的尾巴上。现有监督检测器沿着三条路走:空间伪影、频域线索、时空不一致,且大多架在大规模预训练视频编码器上(DeMamba、AIGVDet、XCLIP、NPR、STIL、FTCN、MINTIME、TALL)。它们在训练分布内很强,可一旦换生成器、加后处理、尤其是面对「画面大部分仍是真实内容」的局部编辑,就会明显退化。免训练这一线(ReStraV 的感知拉直、D3 的片段级二阶时间波动)确实改善了跨生成器泛化,但它们都在帧级或片段级做池化。
矛盾就出在这里:局部编辑留下的证据是稀疏且空间局部的——一帧里被改的往往只是一小块区域,而 D3 把整个片段压成一个标量、ReStraV 把一帧压成一个摘要,这种池化会直接把稀疏证据稀释掉。FakeParts 的评测印证了这一点:不少检测器在局部编辑上掉点高达 50%,因为保留原样的真实上下文正好抵消了全局方法的判据。另一半问题在于阈值本身:部署时拿不到目标域的假样本,只能用真实数据标定阈值,可「在某个真实域上标好的阈值换一个真实域还能不能用」此前几乎没人量化。
本文的切入点是放弃「一帧一个嵌入」的压缩,直接在冻结编码器输出的 patch token 上做统计,并且把两条互补的局部线索分开度量。核心 idea:篡改在特征空间留下两类局部痕迹——单个 patch 的特征轨迹不再平滑(时间粗糙度),相邻 patch 的时间变化不再空间协调(运动场梯度不一致)——两者都不含任何可学习参数,乘性融合并用 γ 次幂放大尾部差异后,只用真实视频标定阈值就能在 FPR = 0.1% 处判真假。
方法详解¶
整体框架¶
输入是一段视频片段。SPLIT 先用一个冻结的预训练视觉编码器逐帧抽 patch token,堆叠成 \(T\times N\times D\) 的张量;在这个张量上并行走两条纯统计的支路——TTR 沿时间轴检查每个 patch 的特征轨迹平不平滑,LSMI 把相邻帧的 patch 特征差当作「运动场」、检查它在空间上跳不跳;两条支路各自聚合成一个标量后相乘、再做 γ 次幂校正,得到最终分数 \(s(x)\),最后用一个只用真实视频标定出来的阈值 \(\tau\) 判决真伪。整个过程没有任何需要训练的参数:唯一的常数 γ 在一个小的留出验证集上定一次(γ = 8)之后,在所有基准和所有 FPR 目标上固定不动。
这是纯特征统计型方法,没有网络结构可言,所以下面不画流程图,两条线索的度量式就是全文的核心。
关键设计¶
1. 从全局嵌入换到 patch token:让稀疏证据不被池化掉
D3 这类方法在片段级做二阶差分——先要把一帧压成一个向量,再对整段池化,局部编辑的证据在这一步就被稀释掉了。SPLIT 的做法是把粒度下沉:对 transformer 编码器(CLIP、XCLIP、DINO 等)直接取最后一层 patch token 并丢掉 [CLS],得到每帧 \(N\) 个 \(D\) 维 token;对 CNN 编码器(ResNet、VGG、EfficientNet、MobileNet 等)取最后一层卷积特征图,把每个空间格子当一个 token,于是 \(N=H'W'\)、\(D=C\)。沿时间堆叠得到 \(P\in\mathbb{R}^{T\times N\times D}\),再把 \(N\) 个 token 排成 \(H_p\times W_p\) 的二维网格(ViT 式切 patch 就是它的 patch 网格,CNN 就是特征图尺寸),为后面的空间邻域运算做准备。这一步换来两项收益:一是时间线索不再被帧级池化抹平,消融显示把 TTR 从 [CLS] 全局嵌入换成 patch token,FPR = 0.1% 下 Fake Recall 从 54.21% 跳到 68.29%(+14.08 个点),是全文单项最大增益;二是 patch 网格本身就是设计 3 里 LSMI 能做「空间梯度」的前提——没有网格就没有邻域。
2. 两步时间粗糙度 TTR:比较 1 步与 2 步累积位移
针对的是生成或局部编辑常留下的局部闪烁、纹理刷新不同步、局部时间错位。对每个 patch \(n\),先沿时间把相邻帧的特征位移模长累加起来,得到累计 1 步位移 \(L_1(n)\);再算累计 2 步位移并做归一化,让它与 1 步可比:
除以 2 是把两步的位移摊回到单步尺度,乘 \((T-1)/(T-2)\) 是补偿两步序列比一步序列少一个样本,这个定义要求 \(T\ge 3\)。然后取对数比:
几何直觉很干净:如果 patch 特征匀速演化,走两步的弦长恰好等于两步的路径长,\(L_2\) 归一化之后与 \(L_1\) 相等,TTR ≈ 0;而一旦出现闪烁、纹理刷新或局部错位,相邻位移的方向不再对齐,绕过弯路的路径长 \(L_1\) 就会超过弦长代理 \(L_2\),TTR 随之变大。之所以用对数比而不是差值,是因为它把绝对运动幅度约掉了——快镜头和慢镜头不会被这个量区分开,只有「不光滑」才会被放大,这对跨内容泛化很关键。片段级统计是在对数空间取平均,\(\overline{\mathrm{TTR}}=\frac{1}{N}\sum_n \mathrm{TTR}(n)\),等价于各 patch 粗糙度比值的几何平均再取对数:既聚合了乘性证据、对少数极端离群的 patch 不敏感,又给出低方差的分数——低方差正是超低 FPR 阈值标定能站住的前提。作者也很克制地说明:TTR 是一个统计线索,而不是每个假视频的必然属性;真实视频遇到硬切、抖动、突变运动同样会出现高 TTR,这部分天然尾部由「只用真实数据标定阈值」吸收。
3. 局部空间运动不一致 LSMI:看运动场的空间梯度
第二个线索问的是一个 TTR 回答不了的问题:时间变化在空间上协不协调。把 patch token 排回 \(H_p\times W_p\times D\) 的网格,相邻两帧相减得到逐帧的「运动场」 \(M_t=P_{t+1}-P_t\),再用前向差分求它的空间梯度:
LSMI 就是这些梯度模长在时间与空间上的平均:
直觉是:真实视频里相邻 patch 通常一起动——同一个物体或同一次相机运动会覆盖一整片区域,所以运动场在空间上平缓、梯度小;而局部生成或编辑会在某个区域内产生与周围不同的时间变化,邻接 patch 之间出现突跳,梯度因此变大。值得强调的是这里的「运动」完全在特征空间里算,不需要 RAFT 之类光流网络,也就没有额外的前向开销。消融显示 LSMI 单独用非常弱(FPR = 0.1% 只有 8.04%),但它承载的是 TTR 完全没有的空间协调性证据:两者融合后在所有操作点上都是最优,最严阈值处比「只用 patch-level TTR」再高 6.16 个点。这也解释了作者为什么坚持两个线索都留——它们不是互相替代,而是各管一个维度。
4. γ 校正的乘性融合与真实数据标定判决
两个线索按乘法合成一个分数:\(s(x)=\mathrm{TTR}^{\gamma}\cdot\mathrm{LSMI}\),γ 是一个固定、不可学的锐化常数。选乘法而非平均,是因为两个线索里只要有一个不成立就应该把分数压低——LSMI 单独很弱,TTR 也会被真实视频的抖动抬高,相乘等于「两者同时偏高才算假」;而 γ 次幂把 TTR 拉到高次方,放大的是它在分数上的相对差异。这一步不是随手加的:判决发生在 FPR = 0.1% 的极端尾部,需要的不是全局排序能力而是尾部两端的分离度,幂函数恰好对分数大的样本压缩、对分数小的样本拉开(或反之),γ 越大这种非线性锐化越强。作者在小留出验证集上选了 γ,从 1 到 8 各操作点都稳定增益,到 16 已经饱和甚至在某些 FPR 上轻微回退,于是全程固定 γ = 8。
判决阈值不使用任何固定常数,而是「服务对齐」地反解出来。给定目标误报率 \(\alpha\in\{0.1\%,1\%,5\%\}\),在只用真实视频构成的标定集 \(\mathcal{R}\) 上取满足误报约束的最小阈值:
测试时 \(s(x)\ge\tau_\alpha\) 判为篡改、否则判为真实。为了让「恰好在一个真实域上标得好」的方法不占便宜,作者进一步提出 cross-real threshold transfer:分别在两个不重叠的真实集上各标一套阈值——FakeParts 的真实子集 ROVI 与 GenVideo 的真实子集 MSR-VTT——两套阈值都跑一遍测试基准,报两次 Fake Recall 的调和平均。主表用的就是这个调和平均数。
一个完整示例¶
以一段 2 秒、8 fps 的片段为例(以下 patch 数只为示意):16 帧经 XCLIP-B/16 在 224×224 上编码得到 14×14 = 196 个 patch,于是 \(P\in\mathbb{R}^{16\times196\times D}\)。对第 \(n\) 个 patch,\(L_1\) 是 15 个相邻帧位移之和,\(L_2\) 是 14 个跨帧两步位移之和除以 2 再乘 15/14。假设画面右下角有一小块被 inpainting 过,那个区域 patch 的特征会在编辑帧附近突跳一次,\(L_1\) 比 \(L_2\) 多出来的那一截就是它的 TTR;把 196 个 patch 的 TTR 在对数空间平均,得到片段级 TTR。LSMI 那边把 196 个 token 排成 14×14 网格,算出 15 个运动场,每个场做 x / y 方向的前向差分,在有效位置(去掉最后一行一列)上取平均梯度模长。两路相乘再做 8 次幂,得到一个标量分数。最后拿出标定集上 0.1% 分位点作为 τ:分数超过就判为篡改。整个流程在 1000 条 FakeParts T2V 样本上的端到端耗时与同一 backbone 下的 D3 相当——开销几乎全被冻结编码器的前向占掉了。
损失函数 / 训练策略¶
SPLIT 没有训练阶段,也没有损失函数,不需要任何训练数据,因此不存在优化策略与学习率之类的超参——整套方法只有 γ = 8 这一个人为选定的常数。作为对照,实验中的十个监督基线统一用 GenVideo-100K 作为唯一训练集:NPR、STIL、FTCN、MINTIME、TALL、XCLIP、DeMamba 用官方 DeMamba 仓库复现,FID、AIGVDet、ReStraV 用各自官方实现训练与评测,D3 用官方仓库。实现细节上,默认编码器是 XCLIP-B/16,抽取不超过 2 秒的片段、8 fps 均匀采样、从长边裁掉 10%、统一 resize 到 224×224;所有实验在 AMD EPYC 9554 64 核 CPU 与单张 NVIDIA RTX A6000 上完成。
实验关键数据¶
主实验¶
三个基准的 Overall Fake Recall(%,cross-real threshold transfer,即两个真实域阈值分别评测后取调和平均):
| 基准 | FPR | SPLIT(免训练) | 最优监督基线 | D3(免训练) |
|---|---|---|---|---|
| FakeParts | 0.1% | 74.45 | 35.67(ReStraV) | 2.28 |
| FakeParts | 1% | 83.58 | 61.89(ReStraV) | 37.42 |
| FakeParts | 5% | 89.70 | 77.75(ReStraV) | 70.59 |
| GenVideo | 0.1% | 85.16 | 45.52(ReStraV) | 5.47 |
| GenVideo | 1% | 93.09 | 81.89(ReStraV) | 66.50 |
| GenVideo | 5% | 97.35 | 92.32(ReStraV) | 90.52 |
| ViF-Bench | 0.1% | 84.52 | 33.93(ReStraV) | 0.97 |
FakeParts 内部八类操纵在 FPR = 0.1% 的分解(%),这也是最能体现「部分编辑」与「全生成」差别的一张表:
| 操纵类型 | SPLIT | ReStraV | D3 | 说明 |
|---|---|---|---|---|
| Style Change | 98.80 | 18.60 | 0.34 | 全片风格改写,线索最密集 |
| Extrapolation | 97.86 | 23.27 | 0.00 | 时间延展,轨迹不平滑很明显 |
| Outpainting | 96.52 | 91.45 | 2.72 | 画面外扩,ReStraV 在此类也强 |
| TI2V | 95.27 | 73.13 | 0.66 | 图生视频,整段都是生成的 |
| T2V | 76.74 | 46.65 | 14.46 | 整段生成 |
| Interpolation | 67.81 | 0.18 | 0.00 | 插帧,局部时间改写 |
| Faceswap | 60.09 | 12.98 | 0.04 | 换脸,与人脸检测器语义无关 |
| Inpainting | 2.48 | 19.09 | 0.00 | 唯一失败类型,编辑区域最小 |
消融实验¶
组件消融(FakeParts Overall,Fake Recall %,cross-real threshold transfer):
| 配置 | 0.1% | 1% | 5% | 说明 |
|---|---|---|---|---|
| CLS 全局嵌入版 TTR | 54.21 | 76.72 | 88.77 | 未用 patch token |
| Patch-level TTR | 68.29 | 82.09 | 89.37 | 换成 patch token,+14.08 |
| 仅 LSMI | 8.04 | 14.63 | 25.07 | 单独用很弱 |
| Patch-level TTR + LSMI | 74.45 | 83.58 | 89.70 | 完整模型,再 +6.16 |
编码器消融与后处理鲁棒性(均取 FakeParts Overall):
| 配置 | 0.1% | 1% | 5% | 说明 |
|---|---|---|---|---|
| SPLIT + XCLIP-B/16(默认) | 74.45 | 83.58 | 89.70 | 最优组合 |
| SPLIT + CLIP-B/16 | 71.47 | 81.56 | 89.39 | 同为 transformer、同粒度 |
| SPLIT + ResNet18 | 61.23 | 77.87 | 88.01 | 轻量 CNN 也远超 D3 |
| D3 + XCLIP-B/16 | 2.28 | 37.42 | 70.59 | 同 backbone 的免训练基线 |
| Gaussian Blur σ = 1 | 62.54 | 77.49 | 88.71 | 后处理:轻微模糊 |
| Gaussian Blur σ = 2 | 55.42 | 73.50 | 88.47 | 后处理:最强干扰 |
| JPEG q = 90 | 70.45 | 80.89 | 88.83 | 后处理:影响小 |
| JPEG q = 80 | 64.40 | 77.11 | 87.12 | 后处理:影响仍然有限 |
| Flip(x 轴) | 75.73 | 82.79 | 88.84 | 水平翻转几乎无损 |
| Flip(y 轴) | 66.92 | 80.42 | 88.52 | 垂直翻转小幅下降 |
跨真实域标定稳定性(标定域→测试域,表内为实际 FPR %,目标值应为 0.1 / 1 / 5):
| 方法 | MSR-VTT→ROVI @0.1 | @1 | @5 | ROVI→MSR-VTT @0.1 | @1 | @5 |
|---|---|---|---|---|---|---|
| SPLIT | 0.03 | 0.29 | 4.22 | 0.56 | 2.18 | 5.49 |
| D3 | 0.00 | 0.07 | 1.52 | 1.18 | 4.06 | 9.04 |
| ReStraV | 0.00 | 0.00 | 0.00 | 15.30 | 39.86 | 66.10 |
| AIGVDet | 13.22 | 25.12 | 31.69 | 0.00 | 0.00 | 0.02 |
| FID | 0.62 | 8.25 | 38.64 | 0.01 | 0.16 | 0.67 |
| FTCN | 0.48 | 2.28 | 7.40 | 0.01 | 0.28 | 2.68 |
关键发现¶
- patch 粒度是最大功臣,LSMI 是互补项:把 TTR 从 [CLS] 全局嵌入换成 patch token 带来 +14.08(54.21 → 68.29),是单项最大增益;LSMI 单独只有 8.04,但融合后在最严阈值处再涨 +6.16。作者的解读是 patch 级时间粗糙度是主判别线索,LSMI 补上空间协调性证据,在真实数据标定的严格尾部进一步把真假拉开。
- 差距只在超低 FPR 处才显现:三个基准上 SPLIT 的优势都在 FPR = 0.1% 最大,越放松越小(FakeParts 从 +38.78 个点缩到 +11.95)。这正支持了论文的核心论点——AUROC 这类聚合指标看不见这个区间,服务对齐的操作点才是真正区分方法的地方。
- Inpainting 是唯一失败类型:0.1% 只有 2.48%,反而输给 ReStraV 的 19.09%。作者的解释是每帧被编辑的区域太小;SPLIT 在这一类上排第二,但这个案例说明 patch 级统计在极小区域 + 邻域平滑的场景下会被真实视频的天然尾部分布淹没。
- 方法与编码器无关,但空间粒度越细越好:七种 backbone(CLIP、XCLIP、DINOv2、ResNet18、VGG16、EfficientNet-b4、MobileNet-v3)上 SPLIT 都大幅赢过同 backbone 的 D3,且 B/16 版本稳定优于 B/32——与「局部伪影需要更高 patch 分辨率」的假设一致,也说明增益来自 patch 级打分而非某个特定预训练表征。
- 对后处理鲁棒,且不依赖高频像素伪影:模糊最伤(σ = 2 时从 74.45 掉到 55.42,仍略高于最强的监督基线 ReStraV 的 54.73),JPEG 压缩影响明显更小(q = 80 仍保 64.40),几何翻转几乎无损(水平 75.73、垂直 66.92),说明打分聚合的是 patch 级时空证据、不依赖绝对空间朝向。对比之下频域方法 NPR 在 FakeParts Overall 的 0.1% 上只有 0.12%,正好印证高频伪影在尾部没有区分度。
- 阈值跨真实域可移植:SPLIT 在两个方向上把迁移后的实际 FPR 都压在目标附近(0.03 / 0.56 对目标 0.1),而 ReStraV 反向漂到 15.30%、AIGVDet 正向漂到 13.22%——这些方法在某个真实域上标出的超低 FPR 阈值换个域就失效,实际部署中会直接崩掉。
- 免训练但吞吐不掉:在相同 backbone 下 SPLIT 的端到端推理时间与 D3 相当,轻量的 TTR / LSMI 计算相对冻结编码器前向可以忽略,却在 FakeParts Overall @0.1% 上把分数从 2.28 抬到 74.45。
亮点与洞察¶
- 用「路径长 vs 弦长」的几何直觉做免训练检测:匀速演化时两步弦长等于两步路径长,只有绕过弯路才让两者分离。这个构造的巧妙之处是把「不平滑」变成对绝对运动幅度不敏感的对数比——不需要训练、不需要光流网络、不需要任何标注,却能直接对准闪烁和局部时间错位这类生成伪影,是全文最有复用价值的想法。
- 乘性融合 + γ 次幂是对「判决发生在极端尾部」的正面回应:平均融合优化的是全局排序,而幂次锐化放大的是分数尾部的相对差异。把部署约束(FPR ≤ 0.1%)反推到融合函数的设计上,而不是先设计融合再报告 AUROC,这个思路比融合公式本身更值得借鉴。
- cross-real threshold transfer 可能是最可迁移的贡献:任何「只用真实数据标定阈值」的检测器都能用这套协议衡量标定稳定性,而不只是本文。它把一个通常被忽略的工程问题(阈值能不能换域)变成了一个可量化的指标,而且实验确实揭出了 ReStraV、AIGVDet 这类方法在超低 FPR 下的不可移植。
- 可迁移方向:TTR 与 LSMI 都只依赖「逐帧 token 序列 + 空间网格」,因此可以直接搬到别的模态——音频 AIGC 检测把谱图切成 token 序列后同样能算时间粗糙度;图像 AIGC 检测可以把 LSMI 推广到单图(用相邻 patch 的差异代替时间运动场);patch 网格上的前向差分也可以替换成任意空间算子(拉普拉斯、邻域方差)来构造新的空间不一致度量。
局限与展望¶
- 作者承认 TTR 只是统计线索:真实视频遇到硬切、抖动、突变运动同样会产生高 TTR,这部分靠真实数据标定的尾部来吸收,意味着方法在「真实视频本身就很粗糙」的域上会更容易失守。
- 作者承认模糊下退化明显:σ = 2 时从 74.45 掉到 55.42,掉了约 19 个点,说明部分信号仍依赖相对精细的空间结构,而不是纯粹的高层语义。
- 定位能力的空缺是最明显的短板:全文动机是「patch 级证据」,TTR(n) 与 LSMI 本身就是逐 patch 的,但最后只做了平均、输出一个片段级标量,没有任何空间热图或篡改区域定位实验。FakeParts 明明提供了像素级与帧级标注,不给定位结果等于把方法最大的一处潜在优势丢掉了——把逐 patch 的 TTR 直接当热图上采样回原分辨率,很可能是最自然的改进方向。
- γ 的选择过程交代不足:方法免训练、不用训练集,但 γ = 8 是在留出验证集上选的,正文没有说明该验证集是否与测试生成器重叠、以及 γ 在不同 backbone 上是否仍是最优(只在补充材料给了 GenVideo / ViF-Bench 的同样趋势)。
- Inpainting 上的失败需要一个更细的解释:2.48% 与 ReStraV 的 19.09% 差距很大。作者归因为编辑区域太小,但这同时也可能是 patch 级统计被邻域平均抹平、或真实视频天然尾部把信号淹掉。更细的 patch 粒度(B/32 → B/16 已证明有效)或引入局部归一化 / 显著性加权,是两条可以试的路。
- 实验设置偏窄:只测了 2 秒、8 fps、224×224 的短片段,长视频、高分辨率、以及跨分辨率迁移下 TTR 的方差与阈值可移植性都没有验证。
相关工作与启发¶
- vs D3:D3 同样免训练,但在片段级用中心差分测二阶时间波动,且要先把一帧压成一个全局嵌入。SPLIT 保留 patch token,把「时间不平滑」与「空间不协调」拆成两个线索再相乘。在与 D3 用同一个 backbone(XCLIP-B/16)的对照下,FakeParts Overall @0.1% 从 2.28% 提升到 74.45%,说明增益主要来自聚合粒度的下沉,而不是换了更强的特征。
- vs ReStraV:ReStraV 也建立在冻结特征动力学上(感知拉直的观察:自然视频在 DINOv2 特征空间里轨迹更直),但它需要在帧级统计量(步距、曲率)上训练一个轻量分类器,而且统计是帧级 / 全局抽象的。SPLIT 没有任何可学习参数、不需要训练集,并且把粒度下沉到 patch。ReStraV 是三个基准上最强的监督基线(FakeParts 35.67%、GenVideo 45.52%、ViF-Bench 33.93%),但都被 SPLIT 大幅超过;同时它在跨真实域阈值迁移上出现了严重漂移(反向 15.30%),说明其分数分布对真实域更敏感。
- vs DeMamba / AIGVDet 等监督视频检测器:它们在近域基准上很强(GenVideo Overall @0.1%:DeMamba 10.00%、AIGVDet 45.38%),但一遇到新生成器或局部编辑就明显退化——同一个 FPR 下 ViF-Bench Overall 分别只剩 3.30% 和 25.69%。SPLIT 完全不训练,却在 ViF-Bench 的每一个生成器上都排第一。
- vs 频域方法 NPR:NPR 依赖生成器上采样留下的频域伪影,理论上跨生成器通用,但在超低 FPR 下几乎全为 0(FakeParts Overall @0.1% 仅 0.12%)。这与 SPLIT 对 JPEG 压缩相对不敏感相互印证:高频像素级伪影在分布尾部不具备区分度,而 patch 级的时空统计量可以。
评分¶
- 新颖性: ⭐⭐⭐⭐ [两个线索本身是经典统计直觉(路径长 vs 弦长、运动场空间梯度),但组合方式、γ 尾部锐化融合与 cross-real 评测协议是新的;免训练 + patch 级粒度确实在局部编辑检测上打开了新空间]
- 实验充分度: ⭐⭐⭐⭐⭐ [3 个基准、8 类操纵、10+ 生成器、11 个基线、7 种 backbone 的编码器消融、4 类后处理的鲁棒性、跨真实域标定稳定性,覆盖面很足]
- 写作质量: ⭐⭐⭐⭐ [方法与动机讲得清楚、公式节制;但 Table 6 的排布与 Figure 3 叠加的标注较难读,γ 选择集等关键设置被推到了补充材料]
- 价值: ⭐⭐⭐⭐ [免训练 + 超低 FPR 部署约束 + 跨真实域阈值标定,直接对准真实服务场景;Inpainting 上的失败与完全缺失的定位能力限制了近期落地]