SafeGuard: A Multi-Agent Perception-Reasoning Framework for Social-Risk AI-Generated Video Detection¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/williamw99/SafeGuard
领域: 多模态VLM / VLM推理
关键词: AI生成视频检测, 多智能体协同, 感知推理鸿沟, 社会风险安全, 物理一致性验证
一句话总结¶
针对AI生成视频在社会风险场景中高逼真度与结构伪造并存导致的“感知-推理鸿沟”,SafeGuard通过分层感知求解器提取多维度细粒度法医线索,并由自反思验证器执行语义与物理合理性一致性闭环审计,在无需端到端重训的情况下大幅超越现有专用模型与通用大模型。
研究背景与动机¶
视频生成技术已从局部的面部编辑与深度伪造演进为全局全场景视频合成。现代文生视频系统(如 Sora、Pika、Wan、CogVideoX 等)能够生成具有全局时空连贯性和高感知逼真度的视频,使合成内容与真实摄录视频的视觉界限日趋模糊。随之而来的是严重的社会安全风险:生成模型不再局限于单纯的身份替换,而是能够伪造具有严重社会影响的完整事件,例如暴力冲突、虚假群体性事件以及敏感政治谣言。然而,现有的AI生成视频检测基准(如 GenVideo、DVF、GenVidBench 等)存在显著的数据分布偏差,主要聚焦于日常生活、自然风景等低风险良性场景,严重缺乏对物理规律违背、结构连续性破坏以及社会行为逻辑异常等高风险复杂场景的覆盖。
面对复杂的社会风险生成视频,现有的检测范式陷入了根本性的“感知-推理鸿沟”(Perception–Reasoning Gap)。一方面,专用的判别式检测模型(如 DeMamba、FTCN、NPR)擅长捕捉局部的像素分布或光流频域统计伪影,但完全缺乏对全局语义语境的理解与物理/社会因果推理能力,因而在未见过的生成架构或高逼真度生成内容上泛化性能崩溃;另一方面,通用多模态大语言模型(如 GPT-4o、Qwen3-VL、InternVL3.5)虽然具备极强的全局语义上下文抽象与逻辑推导能力,但受限于特征编码的下采样与语义压缩,对微妙的底层法医线索(如微小的几何形变、边界高频噪声、微小局部运动突变)极不敏感,极易被画面的高美学逼真度欺骗而给出“视频真实”的误判。这种保留细粒度底层法医证据与维持高层语义抽象之间的内在张力,构成了现有检测系统的核心瓶颈。
针对这一困境,本文的切入点在于:解耦底层法医痕迹感知与高层语义因果推理,并通过智能体之间的协同特化与反思回环重建闭环证据链。核心 idea:构建分层感知求解器与自反思验证器协同的多智能体框架 SafeGuard,先由大模型生成风险感知假设并引导局部区域裁剪与物理工具箱线索提取,再由验证器对假设与证据进行逻辑自洽性双向审计与自适应反思修正,将视频鉴伪转化为可解释、有物证支撑的闭环因果推理。
方法详解¶
整体框架¶
SafeGuard 将视频伪造检测重构为一个“语义怀疑提出 \(\to\) 物证定向搜寻 \(\to\) 证据约束推理 \(\to\) 自反思一致性审计”的闭环决策流程。系统主要由两个核心模块协同运作:分层感知求解器(Hierarchical Perceptual Solver)负责自顶向下地拆解全局场景动态、定位高危可疑区域,并调用多维法医工具箱提取细粒度的物理与纹理线索以形成初步判据;自反思验证器(Self-Reflective Verifier)则作为严格的逻辑门控,对求解器的完整推理轨迹进行多维度一致性审计,并在发现证据冲突或推理幻觉时驱动假设更新,进行闭环反思修正。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入待检视频 V"] --> B["1. 风险感知假设生成与时空路由<br/>场景上下文 C 提取并生成假设 Ht 与候选区域 Rt"]
B --> C["2. 语言引导定位与法医线索提取<br/>Grounding DINO + SAM 2 获得掩码并调用多维工具箱"]
C --> D["3. 证据约束推理<br/>综合多维物理置信度与语义语境输出初始判决 yt 与得分 st"]
D --> E["4. 证据-假设一致性审计<br/>自反思验证器多准则核验并计算可靠性得分 Sver 与反馈 Ft"]
E -->|Sver < γ 且 t ≤ L| F["5. 闭环反思微调<br/>融合反馈 Ft 更新假设 Ht+1 重新触发感知推理"]
F --> B
E -->|Sver ≥ γ 或 t > L| G["输出最终鉴伪决策与可解释证据报告"]
关键设计¶
1. 风险感知假设生成与时空路由:语义驱动的高危区域先验聚焦
全场景生成视频中,背景建筑物或静态环境往往渲染极其稳定,而人体姿态交互、剧烈动作形变或密集社会接触区域才是伪造瑕疵高度富集的区域。若直接对整帧进行盲目特征提取,极易被大面积的逼真背景稀释。该模块首先利用视觉语言模型总结输入视频 \(V\) 的全局动态与社会上下文摘要 \(C\)(如“混乱街头斗殴事件并伴随执法介入”),并根据社会风险语义构建潜在伪造假设 \(H_t\)(指出可能存在的肢体粘连、身份错乱或时序撕裂): $\(H_t = \text{LVLM}_{\text{H}}(C)\)$ 随后,路由模型基于上下文与假设,对视频执行粗粒度的时空路由,提取出最值得法医细查的高危候选目标或时空区域描述 \(R_t\): $\(R_t = \text{LVLM}_{\text{rout}}(V, C, H_t)\)$ 这一机制使后续的计算资源与检测重心高度聚焦于高风险语义主体,有效过滤了无关良性背景的干扰。
2. 语言引导定位与法医线索提取:多维互补的物理工具箱定向取证
高层多模态模型无法直接观测底层像素级反常,必须借助特化的判别工具提供定量物理置信度。本设计采用“两阶段语言引导分割 + 多维度物理工具箱”组合:给定路由文本查询 \(R_t\),首先使用 Grounding DINO 在各帧中预测目标粗边界框 \(\{B_i^t\}_{i=1}^N\),再利用 SAM 2 基于边界框提示生成逐像素精细掩码 \(M_t = \{M_i^t\}_{i=1}^N\)。通过逐像素掩码抠取局部高危交互视频片段 \(V_t^{\text{crop}} = V \odot M_t\)。针对抠取区域,调度包含 4 种互补物理透镜的特化工具箱 \(\mathcal{T} = \{f_o, f_d, f_a, f_p\}\) 进行取证: - 光流分析工具 \(f_o\)(基于 RAFT 提取光流场):检测时序运动不连续性、帧间肢体跳变与异常重影; - 几何深度工具 \(f_d\)(基于 Depth Anything V2 提取深度图):评估局部 3D 几何结构的物理合理性,捕捉异常平面穿模与体积塌陷; - 外观表征工具 \(f_a\)(基于 DINOv2 特征):检查物体级纹理与身份特征的帧间一致性; - 高频像素工具 \(f_p\)(基于 D3 二阶特征):分析边缘高频噪声分布、局部合成痕迹与像素级统计不规则性。
工具箱输出结构化的法医物理证据向量 \(E_t^{\text{phy}}\): $\(E_t^{\text{phy}} = \begin{bmatrix} f_o(V_t^{\text{crop}}) \\ f_d(V_t^{\text{crop}}) \\ f_a(V_t^{\text{crop}}) \\ f_p(V_t^{\text{crop}}) \end{bmatrix} \in (0, 1)^4\)$ 其中每个标量代表对应维度判定局部区域为真实视频的置信度。多维特征互为校准,克服了单一频域或纹理特征的偶发失效。
3. 证据约束推理:物理信号与语义因果的联合推断
单纯的数值证据无法直接作为最终判定,因为快速运动、正常运动模糊或自然遮挡同样可能引发光流突变或像素噪点。为避免误报,本模块要求模型在全局语境 \(C\) 和伪造假设 \(H_t\) 的双重约束下解释物理证据 \(E_t^{\text{phy}}\)。推理模块 \(\text{LVLM}_{\text{reason}}\) 检验观测到的底层物理反常与假设中的生成机理是否具有因果一致性(例如,光流中断是否源自人体手臂的不自然生长撕裂,而非单纯的镜头晃动): $\((y_t, s_t) = \text{LVLM}_{\text{reason}}(H_t, C, E_t^{\text{phy}})\)$ 该过程将分离的物理数值转化为具有因果链条的结构化初始判决 \(y_t \in \{\text{Real}, \text{Synthesized}\}\) 与置信度 \(s_t\),确保每一步推论都有清晰的物理实体线索作为支撑。
4. 证据-假设一致性审计:双向校验的多准则逻辑门控
初级推断仍可能存在多模态大模型的虚假关联或幻觉。自反思验证器扮演独立的“法医法官”角色,对求解器的完整执行链进行严格多准则审计: - 核验假设 \(H_t\) 是否符合社会风险语境 \(C\) 的常理; - 检查分割掩码 \(M_t\) 是否准确锁定了可疑主体,有无错割漏割; - 评估工具箱调度的合理性,以及物理置信度 \(E_t^{\text{phy}}\) 与判决 \(y_t\) 之间是否存在逻辑矛盾。
验证器生成综合可靠性得分 \(S_t^{\text{ver}}\) 与具有纠错指导作用的自然语言反馈 \(F_t\): $\((S_t^{\text{ver}}, F_t) = \text{LVLM}_{\text{check}}(C, H_t, R_t, M_t, \mathcal{T}, E_t^{\text{phy}}, y_t, s_t)\)$ 若 \(S_t^{\text{ver}}\) 低于设定阈值 \(\gamma\)(默认设为 0.5),则判定当前推理链条不可信,拒绝直接输出,触发闭环反思。
5. 闭环反思微调:自适应纠错的状态回环
当验证未通过时,系统不是简单地重复推理,而是将验证器的自然语言诊断反馈 \(F_t\)(如“光流异常仅存在于静态背景边缘,与前景人体无因果关联,需重新定位交互主体”)作为先验输入,驱动假设生成模块迭代演进: $\(H_{t+1} = \begin{cases} H_t, & \text{if } S_t^{\text{ver}} \ge \gamma \text{ or } t > L \\ \text{LVLM}_{\text{H}}(C, H_t, F_t), & \text{otherwise} \end{cases}\)$ 系统基于修正后的假设 \(H_{t+1}\) 重新发起局部区域定位与证据收集,直至通过审计或达到最大循环步数 \(L\)(实验中设为 3)。这一闭环极大压缩了模型因偶发性视觉线索误读导致的误报率。
一个完整示例¶
以一段两名男子在玻璃门前剧烈扭打冲突的文生视频为例: 1. 全局语境与假设生成:\(\text{LVLM}_H\) 提取全局语境 \(C\) 为“两名成年男子在室内门口剧烈打斗”,生成假设 \(H_1\) 指出“剧烈肢体冲突往往引发关节形变异常与环境接触面穿模”; 2. 时空路由与定位:\(\text{LVLM}_{rout}\) 输出关注重点 \(R_1\) 为“打斗双方的肢体交互区域与背后玻璃门接触点”,Grounding DINO 与 SAM 2 联合提取出高危交互掩码 \(M_1\) 并裁切出局部视频 \(V_1^{\text{crop}}\); 3. 工具箱取证与数值:光流分析检测到剧烈时序撕裂(\(f_o = 0.08\),极低真实概率);深度工具捕捉到被推搡男子的 3D 深度网格直接穿透了坚硬的玻璃门平面,却没有玻璃碎裂或物理形变(\(f_d = 0.05\));而外观与像素工具因模型生成的高清纹理给出了 \(f_a = 0.88\) 与 \(f_p = 0.79\) 的较高真实分; 4. 证据约束推理:\(\text{LVLM}_{reason}\) 结合打斗语境,指出虽然外观逼真,但几何深度穿模与光流撕裂是不可调和的底层物理法则违背,输出初步判决 \(y_1 = \text{Synthesized}\),\(s_1 = 0.90\); 5. 一致性审计:自反思验证器 \(\text{LVLM}_{check}\) 检查完整链条,确认“玻璃门穿模”物证与“激烈打斗”语境高度自洽,工具调用准确,评定可靠性得分 \(S_1^{\text{ver}} = 0.95 \ge 0.5\),直接放行输出最终报告与可解释结论。
实验关键数据¶
主实验¶
论文构建了首个面向社会安全风险的权威评测基准 SafeVid(共 20,356 条视频,均衡包含 10,178 条真实视频与由 21 种 SOTA 生成模型制作的 10,178 条合成视频,涵盖暴力冲突、公共安全、腐败伦理、极端主义等 10 大社会风险类别),并在四个公开基准(GenVideo、DVF、LOKI、GenVidBench)上进行了广泛的跨域泛化评测。
表 1 汇报了 SafeGuard 与各主流代表性基线模型在 SafeVid 及公开基准上的对比表现(涵盖 ID 域内、OOD 域外以及跨库泛化):
| 模型类别 | 模型方法 | SafeVid ID Acc (%) | SafeVid ID F1 (%) | SafeVid OOD Acc (%) | SafeVid OOD F1 (%) | SafeVid 均值 Acc (%) | GenVideo Acc (%) | DVF Acc (%) | LOKI Acc (%) | GenVidBench Acc (%) | 全局平均 Acc (%) |
|---|---|---|---|---|---|---|---|---|---|---|---|
| 人类评估 | Human Evaluator | 77.0 | 85.4 | 80.9 | 80.0 | 79.2 | - | - | - | - | 79.2 |
| 专用判别模型 | NPR [CVPR'24] | 71.6 | 75.5 | 62.8 | 63.3 | 65.0 | 85.3 | 54.6 | 57.2 | 53.0 | 63.0 |
| 专用判别模型 | FTCN [ICCV'21] | 82.3 | 82.5 | 41.6 | 44.4 | 51.6 | 95.6 | 83.4 | 68.1 | 65.3 | 72.8 |
| 专用判别模型 | DeMamba [SCIS'26] | 78.8 | 80.3 | 43.0 | 48.5 | 51.8 | 94.4 | 90.1 | 69.0 | 71.4 | 75.5 |
| 专用判别模型 | BusterX++ [arXiv'25] | 69.7 | 68.8 | 64.7 | 55.2 | 66.8 | 76.1 | 70.4 | 70.4 | 51.6 | 67.1 |
| 通用大模型 | InternVL3.5-38B | 42.9 | 18.1 | 52.7 | 19.7 | 48.5 | 58.5 | 61.2 | 56.3 | 47.3 | 54.4 |
| 通用大模型 | Qwen3-VL-32B | 62.0 | 60.2 | 62.1 | 47.2 | 62.1 | 78.4 | 75.0 | 70.0 | 58.3 | 68.8 |
| 通用大模型 | GPT-4o (Zero-Shot) | 65.9 | 70.1 | 63.7 | 52.0 | 64.6 | 77.6 | 74.5 | 55.8 | 61.5 | 66.8 |
| 通用大模型 | Gemini-2.5-Pro | 64.3 | 59.0 | 58.4 | 39.6 | 61.0 | 83.2 | 76.8 | 59.6 | 54.6 | 67.1 |
| 智能体框架 | SafeGuard (Qwen3-VL) | 92.2 | 90.0 | 76.2 | 71.2 | 82.9 | 97.2 | 96.3 | 84.7 | 80.6 | 88.3 |
| 智能体框架 | SafeGuard (GPT-4o) | 93.0 | 90.7 | 80.1 | 72.8 | 85.5 | 97.9 | 97.0 | 81.7 | 84.6 | 89.3 |
消融实验¶
表 2 评估了 SafeGuard 各模块的阶梯式贡献,以及物理工具箱各模态工具的消融情况:
| 实验组 | 变体配置 | SafeVid 均值 Acc (%) | SafeVid 均值 F1 (%) | GenVideo Acc (%) | DVF Acc (%) | LOKI Acc (%) | GenVidBench Acc (%) | 全局平均 Acc (%) |
|---|---|---|---|---|---|---|---|---|
| 架构消融 | Baseline (GPT-4o 单模型) | 64.6 | 60.5 | 77.6 | 74.5 | 55.8 | 61.5 | 66.8 |
| 架构消融 | + 风险感知假设与路由 (SHGR) | 66.0 | 59.1 | 77.7 | 75.0 | 59.9 | 63.8 | 68.5 |
| 架构消融 | + 局部视频裁剪 (SHGR + VC) | 67.5 | 71.0 | 84.3 | 80.9 | 64.4 | 65.0 | 72.4 |
| 架构消融 | + 自反思验证器 (SHGR + VC + SRV) | 74.5 | 71.8 | 92.3 | 91.6 | 77.6 | 73.1 | 81.8 |
| 架构消融 | + 法医线索提取 (SHGR + VC + FTE) | 79.0 | 76.0 | 93.0 | 94.0 | 79.3 | 75.4 | 84.1 |
| 架构消融 | SafeGuard 完整系统 | 85.5 | 80.9 | 97.9 | 97.0 | 81.7 | 84.6 | 89.3 |
| 工具箱消融 | 无工具辅助 (w/o tool use) | 74.5 | 71.8 | 92.3 | 91.6 | 77.6 | 73.1 | 81.8 |
| 工具箱消融 | + 光流工具 (w/ \(f_o\)) | 75.6 | 74.7 | 93.1 | 93.6 | 78.2 | 74.6 | 83.0 |
| 工具箱消融 | + 深度几何工具 (w/ \(f_o + f_d\)) | 78.5 | 78.4 | 95.1 | 94.0 | 78.7 | 78.7 | 85.0 |
| 工具箱消融 | + 外观一致性工具 (w/ \(f_o + f_d + f_a\)) | 83.3 | 79.5 | 96.2 | 96.3 | 81.6 | 82.5 | 88.0 |
| 工具箱消融 | 完整工具箱 (w/ \(f_o + f_d + f_a + f_p\)) | 85.5 | 80.9 | 97.9 | 97.0 | 81.7 | 84.6 | 89.3 |
关键发现¶
- 专用判别模型严重受困于域外过拟合:以 FTCN 和 DeMamba 为例,虽然在训练域内或包含同类伪影的 GenVideo 上准确率突破 94%~95%,但在 SafeVid OOD 分裂集上准确率暴跌至 41.6% 与 43.0%,表现接近甚至劣于随机猜测,说明纯底层统计伪影极难泛化至未见过的先进生成算法。
- 通用大模型存在严重的“高逼真度偏见”:GPT-4o 与 Gemini-2.5-Pro 在零样本下往往因为视频具有逼真的光照渲染与自然色彩,忽视了微弱的解剖学违背,在 SafeVid 上准确率仅在 61%~65% 徘徊;而开源 VLM 更是因对合成微小瑕疵欠敏感,甚至出现了低于 50% 准确率的严重误判。
- 工具箱中深度与外观线索贡献最为突出:工具箱消融表明,引入深度几何检测器 \(f_d\)(从 75.6% 提升至 78.5%)和外观表征 \(f_a\)(进一步提升至 83.3%)带来了最显著的性能跳升,证明生成模型在 3D 物理交互与多帧人体身份稳定性上的瑕疵是当前最致命的破绽。
- 自反思验证器与法医线索不可分割:单独启用自反思验证器(w/ SRV 却无 FTE)时系统准确率为 81.8%,而与完整法医特征结合后跃升至 89.3%。说明纯粹的文本自反思无法无中生有,必须以扎实的底层物证作为逻辑推导的锚点。
亮点与洞察¶
- 多智能体感推解耦设计:创新性地将鉴伪拆解为“分层感知求解器(探针)”与“自反思验证器(法官)”,成功攻克了传统方法在底层特征敏感性与高层因果推理力之间的兼顾难题。
- 免微调高可解释推理链:整个系统主干无需对多模态大模型进行高代价的视频端到端微调,依靠现成的开源判别式小模型(DINO、RAFT、Depth Anything 等)与通用 VLM 的提示工程协同,便能输出可复现、物证确凿的鉴伪报告。
- 首个社会安全风险视频基准 SafeVid:填补了现有检测数据集偏向风景日常良性画面的空白,以 10 大社会安全风险和 21 种先进生成模型重塑了鉴伪评测标准。
局限与展望¶
- 推理延迟与多轮循环开销:由于引入了目标检测、逐帧分割掩码生成、多工具并行推理以及大模型多轮反思,处理单个长视频的计算代价显著高于传统单模型,难以直接部署于毫秒级在线流媒体审核。
- 小模型分割与深度工具的误差传递:若极端复杂场景下 Grounding DINO 或 SAM 2 的分割出现严重漂移,提取的物理数值将产生偏差,虽然自反思验证器具备纠错能力,但在剧烈遮挡场景下仍可能导致反思步数耗尽。
- 未来方向:探索多智能体推理链的离线蒸馏策略,将多轮验证反思知识压缩进单一轻量级多模态模型中;同时将音频-视频跨模态多工一致性(如环境音与画面的物理因果对齐)纳入工具箱矩阵。
相关工作与启发¶
- vs DeMamba / FTCN / NPR(传统专用判别式模型):传统方法利用时空注意力或 Mamba 结构建模像素/光流残差,仅在同分布数据上有效,缺乏语境因果推断能力;SafeGuard 通过 VLM 引导区域路由与物理证据语义仲裁,在 OOD 数据集上实现了断层式的泛化领先(超出 FTCN 接近 40% 准确率)。
- vs GPT-4o / Gemini-2.5-Pro / VideoLLaMA3(通用多模态大模型):通用 VLM 具备宏观推理能力但缺失微观辨伪视力,极易因高审美逼真度产生幻觉误判;SafeGuard 为其装备了物理工具箱并加装反思验证闭环,使其语义逻辑能够牢牢锚定在可信的底层物证上。
- vs LAVID / BusterX++(智能体/多模态解释模型):现有尝试大多停留在文本层面的粗粒度问答或单向解释,缺乏对可疑区域的精确像素级分割提取与自反思纠错循环;SafeGuard 的双向自反思门控机制有效杜绝了单向推导中的幻觉累积。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次提出解耦感知与推理的多智能体视频鉴伪架构,并开拓了社会风险视频生成检测新任务。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 20K 规模的新建 SafeVid 基准及 4 个公开数据集,对比了数十种判别模型与主流大模型,消融详尽。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,问题提出直接切中当前视频生成技术跃升带来的核心安全痛点。
- 价值: ⭐⭐⭐⭐⭐ 对公共安全治理、高逼真度虚假视频内容审核以及多智能体协同在底层视觉任务中的应用具有重大实践意义。