跳转至

Revisiting Deepfake Detection: BCNet for Robust Generalization Beyond Semantic Dependence

会议: ECCV 2026
论文: ECCV 2026
代码: https://github.com/rstao-bjtu/BCNet
领域: AI 安全
关键词: 深度伪造检测 / 视觉基座模型 / 语义偏置 / 判别基底校正 / 泛化性

一句话总结

针对视觉基座模型在伪造检测中因依赖高层语义特征导致跨类别泛化崩溃的痛点,提出基底校正网络(BCNet),通过注意力引导语义擦除与归一化梯度扰动增强强制模型锚定底层真实合成伪影,在 WildRF 真实社交基准上取得 96.7% 的高泛化准确率。

研究背景与动机

以扩散模型和生成对抗网络为代表的生成式人工智能飞速发展,使得合成高保真、难辨真伪的图像门槛大幅降低,在带来创作便利的同时也加剧了虚假信息传播、身份冒用与公众舆论操纵等严峻安全风险。为了应对伪造图像在开放真实场景中的扩散,学术界广泛引入基于大规模预训练数据的视觉基座模型(VFM,如 CLIP 和 DINOv3),希望借助其泛化表征能力捕获多模态视觉空间中的伪造痕迹。

然而,视觉基座模型在海量图像数据上习得的丰富表征是一把双刃剑:模型天然倾向于建立对高层语义内容的强依赖,而非专注于底层的像素或频域合成痕迹。当检测器仅在单一语义类别(例如猫)的合成图像上微调时,虽然在同类别但不同生成器上的检测表现优异,但一旦迁移至未知语义类别(例如马、床),检测准确率便出现断崖式下跌。这表明现有 VFM 检测器并未真正掌握区分真伪的内在准则,而是将类别语义特征当作走捷径的判别依据,导致其在开放语义分布下的实用价值大打折扣。

这种语义偏差的根源在于判别基底错配——模型优先拟合显著前景对象的语义线索,忽略了全局背景与细微边界中微弱却通用的伪造伪影。核心 idea:构建基底校正网络(BCNet),仅在合成样本上非对称施加注意力引导语义擦除与归一化梯度扰动增强,主动剥离高层语义捷径并暴露潜在伪造特征,迫使模型将决策基底校正至本质的真伪分类边界。

方法详解

整体框架

BCNet 旨在矫正冻结视觉基座模型(以 DINOv3 ViT-H+/16 为主干)在伪造检测中的语义偏置。在特征提取阶段,骨干网络参数保持冻结,仅在全部 32 层 Transformer 注意力模块中引入低秩自适应(LoRA)分支进行参数高效微调。输入图像经过分类器产生基础判别,同时针对伪造样本构建两条互补的校正分支:一条分支通过注意力引导语义擦除(ASE)自适应识别并物理遮盖高语义关注区域,迫使网络在背景与轮廓区域挖掘伪造线索;另一条分支通过归一化梯度扰动增强(NPE)沿损失梯度方向添加符号化像素级微小扰动,放大隐蔽的合成缺陷并打破模型对脆弱语义先验的依赖。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入图像 X"] --> B["DINOv3 骨干网络 + LoRA"]
    B --> C["基础交叉熵损失 ℒCE"]
    B -->|伪造样本 y=1| D["注意力引导语义擦除<br/>自注意力图生成掩码并遮盖显著语义"]
    B -->|伪造样本 y=1| E["归一化梯度扰动增强<br/>沿分类梯度添加符号扰动暴露潜在线索"]
    D --> F["非对称基底校正与损失加权<br/>保护真实样本流形并倾斜优化难例"]
    E --> F
    C --> F
    F --> G["真伪判别结果"]

关键设计

1. 注意力引导语义擦除:通过显式遮蔽消除前景语义依赖 针对 VFM 优先捕捉显著前景目标并形成语义偏见的问题,该模块利用网络自身在最高层 Transformer 块中沉淀的自注意力图来定位语义中心。将最后一层的自注意力图双线性插值上采样至输入图像尺寸,记为 \(S\)。模块设定显著性阈值 \(\tau\)(论文取 0.75),构建二值化校正掩码 \(M\),将注意力超过阈值的高响应区域置 0,其余背景与边界区域置 1:

\[M_{i,j} = \mathbb{I}(S_{i,j} < \tau)\]

将该掩码点乘作用于输入的伪造图像 \(X_f\),得到语义擦除后的图像 \(X'_f = X_f \odot M\)。由于显著前景物体的语义信息被物理阻断,模型无法再借助物体本身的语义模式走捷径,必须转向未被遮挡的背景纹理、高频细节与边缘区域寻找不一致性,迫使 LoRA 参数聚焦于不同类别间共享的底层伪造痕迹。

2. 归一化梯度扰动增强:放大潜在伪影并破坏脆弱语义捷径 即便输入层面抹除了主干语义,模型依然可能在次级语义残差上建立投机特征。为了进一步剥离此类脆弱关联,该模块借鉴对抗微扰思想,动态计算分类损失关于输入像素的梯度方向,并通过符号函数将其归一化为离散数值,直接注入合成图像中:

\[X_{enh} = X_f + \epsilon \cdot \text{sign}\left(\nabla_{X_f} \mathcal{L}_{CE}(f_\theta(X_f), y)\right)\]

其中扰动强度系数 \(\epsilon\) 设定为 0.0005。通过仅保留梯度的符号信息,扰动排除了不同像素梯度的绝对幅值差异,在整幅画面中均匀且集中地增强那些能够引起模型判定震荡的微小区域。这种显式施加的微小扰动主动放大了隐藏的生成伪影,扰乱了脆弱的语义关联模式,促使检测器拓宽对复杂合成伪影的感知范围,进而显著提升辨别真伪边界的鲁棒性。

3. 非对称基底校正与损失加权:保护真实样本流形并主导判别优化 如果在真实图像上同样执行语义遮蔽与梯度扰动,必然会破坏真实自然图像固有的统计流形与结构完整性,导致模型混淆真实性的参照锚点。因此,BCNet 采用非对称基底校正机制,仅在标签为伪造的样本(\(y=1\))上激活 ASE 与 NPE 分支,使真实图像始终保持无损状态,充当稳定的真实性参照。

在联合训练优化中,总损失函数被构建为基础分类损失与两项校正损失的加权和:

\[\mathcal{L}_{total} = \lambda_{CE} \mathcal{L}_{CE} + \mathbb{I}(y=1) \cdot \left(\lambda_{ASE} \mathcal{L}_{ASE} + \lambda_{NPE} \mathcal{L}_{NPE}\right)\]

论文将基础分类权重设为 \(\lambda_{CE} = 0.1\),而将语义擦除损失与扰动增强损失的权重均提高至 \(\lambda_{ASE} = \lambda_{NPE} = 0.45\)。这种非对称的大比重倾斜优化策略,强制梯度更新优先攻克经过语义擦除和梯度扰动后的高难度硬样本,杜绝了模型在训练中滑向表面语义特征的可能性。

损失函数 / 训练策略

骨干网络采用 DINOv3 ViT-H+/16,在其所有 32 层 Transformer 层的自注意力模块中配置 LoRA(秩 \(r=16\)、缩放因子 \(\alpha=32\)、dropout 为 0.3)。训练遵循 Setting-II 协议,使用来自 ProGAN 和 SDv1.4 的共 144k 张图像,并在训练中辅以高斯模糊与 JPEG 压缩等常规图像增强手段。模型在 2 块 NVIDIA RTX 4090 GPU 上使用 AdamW 优化器仅训练 1 个 epoch,学习率为 \(5 \times 10^{-5}\),权重衰减为 0.001,批大小为 32。评估指标采用平均精度(A.P.)与阈值 0.5 下的准确率(Acc.)。

实验关键数据

主实验

在涵盖 25 种主流生成方法的大规模评测基准 AIGI-Bench 上,BCNet 全面超越了现有 10 种代表性 SOTA 方法;在涵盖真实社交网络高噪场景的 WildRF 与高保真编辑基准 OpenSDI 上,BCNet 亦展现出显著优势。

方法 AIGI-Bench (Acc. / A.P.) WildRF Avg (Acc. / A.P.) Chameleon (Acc. / A.P.) OpenSDI Avg (Acc. / A.P.) AIGCDetect Avg (Acc. / A.P.)
CNNSpot (CVPR 2020) 55.1 / 67.1 51.4 / 52.4 57.3 / 42.7 49.9 / 44.4 60.4 / 82.9
F3Net (ECCV 2020) 60.3 / 65.5 60.5 / 75.0 59.0 / 63.7 59.0 / 73.8 70.1 / 87.0
UnivFD (CVPR 2023) 72.5 / 75.6 59.8 / 70.1 51.7 / 42.7 60.7 / 77.5 82.5 / 92.6
FreqNet (AAAI 2024) 66.2 / 70.1 53.6 / 54.5 59.6 / 55.9 48.6 / 46.5 81.0 / 88.5
NPR (CVPR 2024) 67.9 / 73.5 55.1 / 59.4 59.1 / 47.4 51.3 / 51.6 83.5 / 91.8
SAFE (KDD 2025) 78.6 / 81.4 53.8 / 53.7 59.4 / 45.2 50.0 / 51.0 92.9 / 96.4
AIDE (ICLR 2025) 77.6 / 82.5 61.0 / 66.8 57.8 / 44.3 58.6 / 66.1 90.8 / 96.5
FerretNet (NeurIPS 2025) 79.9 / 83.9 53.5 / 52.7 59.3 / 44.2 50.0 / 45.9 87.2 / 98.4
VIB-Net (CVPR 2025) 69.3 / 70.9 61.4 / 81.2 60.8 / 60.5 60.0 / 87.7 89.9 / 97.5
Effort (ICML 2025) 79.8 / 89.9 54.3 / 65.4 58.9 / 57.0 50.4 / 67.6 93.3 / 99.8
BCNet (本文) 88.6 / 94.9 82.5 / 91.2 82.8 / 90.3 74.0 / 86.5 96.6 / 99.4

在社交媒体平台真实验证集 WildRF 的细分评测中,BCNet 在 Facebook(95.0% Acc)、Reddit(97.8% Acc)和 Twitter(97.4% Acc)上的平均准确率高达 96.7%,而对比基线如 CNNSpot 在 Twitter 上仅有 49.9%(近乎随机猜测),Effort 仅有 52.9%。

消融实验

在跨越 4 个代表性基准的组件消融实验中,验证了 ASE 与 NPE 各自的作用以及两者的协同倍增效应。

配置 ASE NPE AIGI-Bench (Acc.) Chameleon (Acc.) WildRF (Acc.) OpenSDI (Acc.)
Baseline (LoRA-DINOv3) - - 84.2 76.3 90.1 70.5
+ ASE 单独引入 ✓ - 85.4 (+1.2) 79.5 (+3.2) 95.2 (+5.1) 71.2 (+0.7)
+ NPE 单独引入 - ✓ 85.7 (+1.5) 79.9 (+3.6) 93.1 (+3.0) 71.8 (+1.3)
Full Model (BCNet) ✓ ✓ 88.6 (+4.4) 82.6 (+6.3) 96.7 (+6.6) 74.0 (+3.5)

在对真实样本是否应用校正策略的机制验证中,若将 ASE 与 NPE 同时施加在真实图像上,全基准平均准确率从 87.7% 大幅跌落至 82.9%;仅施加 NPE 跌至 82.8%,仅施加 ASE 跌至 86.1%。这证实了真实样本流形必须作为未经扰动的纯净基准。

关键发现

  • 双模块协同显著超越单模块累加:在 Chameleon 基准上,单独引入 ASE 提升 3.2%,单独引入 NPE 提升 3.6%,而两模块联合带来 6.3% 的增益;在 WildRF 上两模块联合带来 6.6% 的绝对提升,表明空间层面的语义物理遮挡与梯度空间的微扰增强形成了强大的正交互补。
  • 鲁棒性抗退化能力极强:在强 JPEG 压缩(QF=60)下,BCNet 在 WildRF 上仍保持 91.8% 的高准确度;在高斯模糊(\(\sigma=1.5\))下,Chameleon 与 OpenSDI 甚至分别逆势提升 0.9%,说明模型不再依赖脆弱的高频噪声,而是捕捉宏观结构级合成失真。
  • 骨干网络规模具备优异可扩展性:骨干网络从 300M 扩展至 840M 和 7B 参数时,全基准平均准确率从 85.2% 持续爬升至 87.7% 和 90.3%,在 Chameleon 上更是从 79.3% 飙升至 90.6%,证实基底校正理念能够深度释放超大参数基座模型的特征潜力。

亮点与洞察

  • 切中 VFM 伪造检测的命门:揭示了视觉基座模型虽然表征强,但会把大部分注意力沉溺在语义类别上,将伪造分类退化为语义分类这一核心痛点。
  • 优雅的非对称设计策略:只在伪造样本上动刀(遮蔽高语义区 + 注入梯度符号微扰),真实样本保留原始流形作为锚点,既治好了语义偏执,又守住了真假判别边界的稳定性。
  • 即插即用且轻量高效:基于注意力图生成掩码和符号梯度生成扰动均无需训练额外的生成器或复杂检测头,通过极小算力开销和 1 个 epoch 的微调即可显著刷新泛化上限。

局限与展望

  • 极端几何遮蔽与前沿生成器适应性:在极少数最新高保真扩散模型(如 Flux.1 达到 63.0% Acc)上虽然超越所有基线,但绝对指标相比传统生成模型仍有提升空间,表明新一代流匹配(Flow Matching)架构的细微合成痕迹更加隐匿。
  • 阈值超参数固定:当前语义擦除阈值 \(\tau=0.75\) 与微扰步长 \(\epsilon=0.0005\) 为静态全局设定,未来可探索根据图像内容复杂度自适应动态调节的阈值机制。
  • 向视频跨模态伪造检测延伸:当前研究聚焦于单帧静态图像,将基底校正理念扩展至时间维度以消除时序语义共现偏置是值得探索的未来方向。

相关工作与启发

  • vs Effort (ICML 2025):Effort 尝试通过奇异值分解(SVD)解耦特征,但缺乏显式剥离语义依赖的物理与对抗手段;BCNet 通过空间掩码与梯度扰动双管齐下,在 AIGI-Bench 上准确率领先 8.8 个百分点。
  • vs FerretNet (NeurIPS 2025) & SAFE (KDD 2025):FerretNet 使用零掩码重构挖掘纹理不连续性,SAFE 引入随机掩码防过拟合;但二者均为启发式盲目掩盖,缺少自注意力导向的目标性。BCNet 的 ASE 能够精准识别并消除语义密集区,提升了抑制偏置的针对性。
  • vs NPR (CVPR 2024):NPR 针对卷积上采样痕迹进行检测,容易在现代高保真扩散模型面前失效;BCNet 依赖语义不可知的内在特征,在多种先进扩散模型上展现出普遍适用性。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次系统揭示并针对性解决 VFM 在深度伪造检测中的语义偏置缺陷,设计了非对称基底校正机制。
  • 实验充分度: ⭐⭐⭐⭐⭐ 评测跨越 51 个数据集、5 大基准,涵盖 25 种前沿生成方法,包含详尽的消融、抗降质和可扩展性分析。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密清晰,动机论证有预实验坚实支撑,公式推导克制且表述流畅。
  • 价值: ⭐⭐⭐⭐⭐ 为大模型时代的通用伪造鉴伪提供了极具启发性的技术路线,开源代码具备高度社区实用性。