跳转至

Spotlight: Identifying and Localizing Video Generation Errors Using VLMs

会议: ECCV 2026
论文: ECCV 原文
代码: https://spotlight-video.github.io
领域: 视频生成 / 多模态VLM / 评测基准
关键词: 视频生成评测、细粒度错误定位、视觉语言模型、时序局部化、物理与语义一致性

一句话总结

针对高保真文生视频中瞬态、局部的细粒度生成缺陷,本文提出 Spotlight 基准,涵盖 600 个顶尖生成视频与 1,604 处带起止时间戳、分类与自然语言归因的人工标注错误,并设计二分图匹配评估协议,揭示出当前最强 VLM 在错误定位与推理上落后人类近 2 倍。

研究背景与动机

近年来,基于大规模扩散与自回归 Transformer 架构的文生视频(Text-to-Video, T2V)技术取得了爆发式进展。以 Veo 3、Seedance 与 LTX-2 为代表的现代前沿模型,已能够生成高度逼真、时序连贯且宏观视觉质量极高的动态场景。过去早期生成模型中常见的全局结构崩塌、剧烈画面闪烁等宏观伪影已基本被克服,然而生成模型却演化出了更为隐蔽、细微且高度时空局部的细粒度错误——例如物体材质在特定瞬间发生荒谬变化、肢体局部形态突变融合、或者物体交互动作违背基本物理常识。这些缺陷往往转瞬即逝且镶嵌在整体美观的画面之中,观众往往需要多次慢放与定格重温才能准确定位问题。

为了摆脱耗时费力的人工评测,学术界与工业界正积极探索将具备感知与常识推理能力的视觉语言模型(VLMs)用作自动化视频评测器或对齐奖励模型。然而,现有的视频生成评测基准大多停留在整段视频的全局评分、文本匹配度判定或粗粒度伪影分类上,缺乏对局部时序区间的精确故障诊断。这一现状引出了一个关键矛盾:自动化评测与对齐训练迫切需要模型不仅能给出“好坏”的粗略标签,更要能像人类审计员一样指明“视频具体在第几秒出现了什么性质的物理、语义或解剖学错误”;但目前主流多模态大模型是否真正具备在复杂生成视频中精准定位与归因细微故障的能力,此前从未得到严格且具可解释性的系统评测。

本文的切入角度是为视频生成评估构建细粒度的时序定位与自然语言解释基准,迫使 VLM 走出粗粒度全局打分的舒适区。核心 idea:构建包含物理规律、语义连贯与生物解剖三大维度六大类别的细粒度时序错误基准 Spotlight,提出基于最大权二分图匹配的“时序精度+语义归因”(S+P)综合评测协议,系统性诊断 VLM 在生成视频故障审计中的感知瓶颈与幻觉问题。

方法详解

整体框架

Spotlight 的核心目标是评测 VLM 在面对文生视频输出时的细粒度故障定位与解释能力。给定由提示词 \(P\) 生成的长为 \(d\) 秒的视频 \(V\),评测任务要求模型输出一个错误集合 \(\hat{E} = \{\hat{e}_1, \dots, \hat{e}_j\}\),其中每个预测错误包含时序起止边界 \((\hat{t}^s_j, \hat{t}^e_j)\)、错误类别 \(\hat{c}_j\) 以及自然语言归因解释 \(\hat{r}_j\)。评测系统将预测集合与真实人类标注错误集合 \(E = \{e_i\}\) 进行对齐,并借助严谨的评测协议综合衡量时序精准度与语义归因正确性。

整体流程包含三个核心阶段:高质量多样化细粒度错误数据集的采集与清洗、基于推理时策略的 VLM 错误检测与时序定位、以及基于最大权二分图匹配的综合对齐度量。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入:生成视频 V 与提示词 P"] --> B["阶段1:多维度细粒度错误分类体系构建<br/>物理/语义/解剖 3大类型 6大类别标注"]
    B --> C["阶段2:推理时任务分解与多智能体检测<br/>类别分治 / 滑动窗口 / 顺次归因定位"]
    C --> D["阶段3:最大权二分图匹配综合度量<br/>时序精度 P + 语义相似度 S 联合阈值截断"]
    D --> E["输出:精确诊断得分与覆盖率统计"]

关键设计

1. 多维度细粒度错误分类体系构建:刻画现代生成模型的隐蔽失效边界

现有的视频伪影数据集大多关注低级渲染瑕疵(如运动模糊、编码伪影)或整段视频的文本不对齐,无法系统涵盖高保真生成模型在逻辑与物理层面的高级故障。Spotlight 建立了涵盖 3 种核心错误类型、细分为 6 个子类别的层级化分类体系: - 物理规律(Physics):包含“物理常识违背(Physical Violations)”(如重力倒错、刚体穿模、流体与碰撞力学失效)与“异常出现/消失(Appearance/Disappearance)”(如物体在视野无遮挡处突兀凭空生成或瞬间隐形)。 - 语义连贯(Semantics):包含“异常运动轨迹(Motion)”(如物体无动力突兀加速、运动方向反常跳跃)、“提示词遵从失败(Prompt Adherence)”(未能生成提示词要求的特定动作或状态)、以及“逻辑常识错误(Logical Errors)”(如物体功能倒错、时序因果颠倒)。 - 解剖结构(Anatomy):专门设立“肢体与生物解剖缺陷(Body Anatomy)”(如人体/动物多肢、关节异常反折、面部特征畸变)。

数据集汇聚了来自 StoryEval、VBench2、VidProM、BlackSwan 和 LVD-2M 五个来源的 200 个高难度提示词,利用 Veo 3 Fast、Seedance 1.0 与 LTX-2 三大最强模型生成 600 个视频。标注采用双轮专家筛选流程:首轮通过最低检出数(\(\ge 3\) 个错误/视频)与归因详实度(\(\ge 8\) 词/描述)筛选高水平标注员;第二轮由入选专家对全量视频重标,并收集 1-5 分的显眼度分级(划分为 Easy、Medium、Hard 三个难度等级)。标注间 IoU \(\ge 0.6\) 的高重合错误经由 LLM 语义相似度聚类合并,最终形成 1,604 处高质量错误标注,平均视频长 6.5s,错误区间平均 2.49s,标注一致性达 83%,人工复验准确率达 93%(归因)与 99%(时序)。

2. 推理时任务分解与多智能体检测:破解长视频时序感知退化

直接利用 VLM 进行零样本端到端提示(输入完整视频直接输出 JSON 错误列表)容易导致模型出现“粗略感知而时序坍塌”的问题——模型倾向于将整段视频全标为错误区间,或者遗漏局部微小的瞬态事件。为此,Spotlight 系统探索了针对视频错误审计的推理时基准范式: - 思维链提示(Chain-of-Thought, CoT):强制要求 VLM 在给出最终 JSON 前,逐帧显式描述画面内容与潜在异变,从而减少由于直接预测时间戳带来的随机性。 - 滑动窗口分解(Sliding Window, SW):针对 VLM 采样率低导致的时间分辨率不足,将视频切分为 2 秒局部子片段,并以更高的 4 fps 密度独立送检;预测的时序区间映射回全局时间轴后,由 LLM 进行传递闭包语义聚类与区间合并(取并集),显著捕获短暂隐蔽错误。 - 顺次解耦基准(Sequential: Reason then Localize, Seq):模拟人类审阅习惯,解耦“找问题”与“定时间”。第一阶段以全局低帧率(2 fps)扫描视频,仅提炼文本形式的错误描述与原因列表;第二阶段将各个检出的错误原因作为查询(Query),由模型重新聚焦视频精细搜索并回归对应的时间起止边界。 - 多智能体分治基准(Multi-Agent, MA):采用分而治之策略,针对 6 种错误类型独立派发 6 个专职 VLM 查询实例,每个实例仅专注排查特定类别的缺陷,最后合并去重。该策略极大减轻了长提示词下的注意力分散问题。

3. 最大权二分图匹配综合度量:解耦与严谨约束时空与语义双重对齐

在连续时序视频中,模型预测的错误集合 \(\hat{E}\) 与人类标注的真实集合 \(E\) 在数量、顺序和起止范围上均不对等,且可能存在单帧多错误、多区间重叠或重合率偏差,简单的整段 IoU 或字符比对无法公正反映性能。Spotlight 创新性地引入了基于二分图最优匹配的度量协议: - 时序精准度(Precision, \(P\))与覆盖度(Recall, \(R\):对于真实错误 \(e_i = (t^s_i, t^e_i, c_i, r_i)\) 与预测错误 \(\hat{e}_j = (\hat{t}^s_j, \hat{t}^e_j, \hat{c}_j, \hat{r}_j)\),精确度定义为预测区间落在真值区间内的有效比例,衡量时间戳预测的紧致性;召回率衡量真值区间被覆盖的完整性: $\(P(e_i, \hat{e}_j) = \frac{|[t^s_i, t^e_i] \cap [\hat{t}^s_j, \hat{t}^e_j]|}{\hat{t}^e_j - \hat{t}^s_j}, \quad R(e_i, \hat{e}_j) = \frac{|[t^s_i, t^e_i] \cap [\hat{t}^s_j, \hat{t}^e_j]|}{t^e_i - t^s_i}\)$ - 语义归因相似度(Reason Similarity, \(S\):采用 GPT-4o-mini 作为无偏评委,输入真实原因 \(r_i\) 与预测原因 \(\hat{r}_j\),在 1 到 10 分尺度上评判其语义因果匹配度并线性归一化到 \([0, 1]\): $\(S(e_i, \hat{e}_j) = \frac{\text{LLM-Match}(r_i, \hat{r}_j)}{10}\)$ - 双重硬约束配对矩阵(S+P):由于人工标记的错误区间往往极其紧凑(平均仅 2.49s),无端放大时间戳的宽松预测会虚高召回率。Spotlight 设定硬匹配阈值 \(\tau = 0.7\)。只有当时序精准度 \(P_{i,j} \ge \tau\) 且语义相似度 \(S_{i,j} \ge \tau\) 同时满足时,两节点之间才建立非零权重边,边权取两者的算术平均值: $\(F_{i,j} = \begin{cases} \frac{P_{i,j} + S_{i,j}}{2}, & \text{if } P_{i,j} \ge \tau \land S_{i,j} \ge \tau \\ 0, & \text{otherwise} \end{cases}\)$ - 全局最优配对求解:在权重矩阵 \(F\) 上运行 Kuhn-Munkres(匈牙利算法)求解最大权二分图匹配 \(\mathcal{M}\),计算所有成功匹配对的平均得分 \(M(E, \hat{E}) = \frac{1}{|\mathcal{M}|}\sum_{(e_i, \hat{e}_j)\in\mathcal{M}} F_{i,j}\) 以及对真实错误的覆盖率 \(M^\%(E, \hat{E}) = \frac{|\mathcal{M}|}{|E|}\)

实验关键数据

主实验

论文对多款开源与闭源前沿多模态大模型进行了全面基准测试,涵盖零样本端到端模式以及四类推理时增强策略,并在截断阈值 \(\tau = 0.7\) 下与非 VLM 传统基线(光流、CLIP 特征相似度)以及人类专家水平进行了严格对标。

模型 / 方法类别 方法变体 S+P 得分 \(M\) S+P 覆盖率 \(M^\%\) 语义相似度 \(M\) 相似度覆盖率 \(M^\%\) 时序精准度 \(P\) 精准度覆盖率 \(M^\%\) 时序召回率 \(R\) 召回率覆盖率 \(M^\%\)
Non-VLM 基线 Optical Flow - - - - 0.462 32.2% 0.049 3.0%
CLIP Similarity - - - - 0.663 38.1% 0.029 1.2%
开源 Zero-Shot InternVL3-8B 0.041 2.2% 0.150 8.6% 0.408 22.8% 0.593 35.8%
MiniCPM-V-4.5 (8B) 0.118 5.7% 0.248 14.0% 0.621 34.5% 0.530 28.6%
Molmo 2 (8B) 0.087 5.0% 0.291 19.7% 0.443 26.3% 0.845 74.8%
Qwen3-VL-8B-Instruct 0.148 8.0% 0.352 23.3% 0.472 27.1% 0.903 73.1%
Qwen3-VL-30B-A3B-I 0.137 6.1% 0.339 21.5% 0.510 29.9% 0.910 73.9%
闭源 Zero-Shot GPT-5.1 (Multi-Frame) 0.218 11.6% 0.340 23.3% 0.506 33.6% 0.599 43.5%
Gemini 2.5 Pro 0.250 12.6% 0.422 26.7% 0.691 44.3% 0.836 68.4%
Gemini 3 Pro 0.250 12.1% 0.387 24.1% 0.807 56.3% 0.681 45.9%
推理时优化 Qwen3-8B - CoT 0.163 7.9% 0.281 17.4% 0.617 40.2% 0.630 48.7%
Qwen3-8B - 滑动窗口 (SW) 0.189 10.0% 0.386 24.6% 0.664 41.8% 0.931 67.6%
Qwen3-8B - 顺次解耦 (Seq) 0.189 9.3% 0.394 25.7% 0.645 39.4% 0.822 60.9%
Qwen3-8B - 多智能体 (MA) 0.254 13.3% 0.405 30.6% 0.675 49.8% 0.767 61.7%
Gemini 2.5 Pro - MA 0.308 17.0% 0.514 33.8% 0.812 57.7% 0.829 67.6%
人类专家基准 Human Baseline 0.508 26.8% 0.599 34.4% 0.840 48.5% 0.880 50.0%

消融与细分维度分析

论文针对 6 大具体错误类型的检测能力进行了细化对比(采用最具代表性的综合指标 S+P,在 \(\tau = 0.7\) 条件下统计得分 \(M\) 及覆盖率 \(M^\%\)):

错误大类 具体错误类别 Qwen3-8B-MA 得分 \(M\) (\(M^\%\)) Gemini 2.5 Pro 得分 \(M\) (\(M^\%\)) Human 基线得分 \(M\) (\(M^\%\)) 主要失效模式与特点
物理规律 (Physics) 物理常识违背 (Phy. Viol.) 0.205 (20.3%) 0.149 (14.4%) 0.367 (33.9%) 力学与碰撞不自然;开源模型强于通用闭源
异常出现/消失 (App/Dis) 0.017 (1.5%) 0.099 (9.0%) 0.139 (12.1%) 闪烁突变极其隐蔽,全模型检出率均极低
语义连贯 (Semantics) 异常运动轨迹 (Motion) 0.122 (13.0%) 0.117 (11.1%) 0.264 (30.0%) 动力学不平滑,模型时序分辨率受限
提示词遵从失败 (Adherence) 0.243 (21.4%) 0.246 (20.8%) 0.532 (45.0%) 宏观语义最易检出,人类表现高达 0.532
逻辑常识错误 (Logical) 0.132 (11.4%) 0.083 (5.9%) 0.210 (21.4%) 因果与上下文反常,依赖长程常识推理
解剖结构 (Anatomy) 肢体解剖缺陷 (Body An.) 0.068 (7.0%) 0.078 (8.3%) 0.153 (17.6%) 复杂肢体畸变多在局部,模型易漏判或假阳性

关键发现

  • 人类与最强 VLM 存在两倍代差:在综合时序与归因的 S+P 严苛指标下,人类专家取得 0.508 得分,而最强的 Zero-Shot 模型(Gemini 2.5 Pro 与 Gemini 3 Pro)仅达到 0.250,差距达 2 倍;即便是最强的推理优化策略(Gemini 2.5 Pro + MA)也仅达到 0.308。
  • 高召回率背后的时序定位“虚假繁荣”:像 Qwen3-VL 与 Molmo 2 等开源模型虽然单项 Recall 达 73%~75%,但这并非其定位精准,而是因为模型存在将整段视频全域标记为错误区间的粗糙预测倾向;在施加了时序精准度惩罚的 S+P 评估下,其综合得分与匹配覆盖率瞬间暴跌至 6%~8%。
  • 多智能体(MA)分治策略收益显著:在 8B 开源基座上,将 6 个错误类型拆分为独立的专用 agent 查询,能使 S+P 得分从 0.148 激增至 0.254(提升 71.6%),以 8B 参数量直接打平并超越了参数规模大几个数量级的闭源 Gemini 2.5 Pro 零样本表现。
  • 错误根因溯源:对最佳零样本模型 Gemini 2.5 Pro 的 50 个错误样本深入复盘显示,78% 的预测存在明显失效。其中 29% 归因于视觉感知不足(如未能识别草丛风吹的细微晃动)、29% 归因于模型幻觉(在归因理由中凭空编造画面中从未发生的事件)、19% 归因于物理常识判断失误;而在时间戳预测中,有 35.9% 的区间由于预测过宽而损失了定位精准度。

亮点与洞察

  • 从“宏观打分”迈向“时序与因果归因”:此前大多数视频评测工作(如 VBench 系列)仅提供离散维度打分,Spotlight 首度将视频生成质量评测形式化为带有明确时间起止点和自然语言说理的故障诊断任务,为后续构建基于过程奖励模型(PRM)的强化学习对齐开辟了直接通道。
  • 双重阈值二分图匹配的度量严谨性:设计了时序精准度与语义归因相似度的双重硬阈值约束(\(\tau = 0.7\)),彻底堵死了通过“输出超长整段区间”骗取高覆盖率或通过“模糊泛化理由”骗取相似度的漏洞,确保度量真实反映局部定位与因果推理水平。
  • 多智能体分治对细粒度感知任务的普适启发:通过将多目标复合审计任务拆解为单类别专职 agent(Multi-Agent),大幅缓解了大模型在单次长上下文推理时的注意力稀释与漏检现象,验证了轻量级开源基座通过任务分解匹敌超大闭源模型的可行性。

局限与展望

  • 作者承认的局限:尽管基准覆盖了 600 个视频与 1,604 个错误标注,但受限于人类标注者的个体认知偏见、审美品味以及长时间标注造成的视觉疲劳,数据集可能仍未能穷尽视频中所有隐蔽的瞬态缺陷。
  • 深入观察的局限:时序边界目前依赖于人工秒级时间戳切分,在面对非刚性形变或渐进式物理违背(如物体极其缓慢地融化或变色)时,起止边界天然具有主观模糊性,硬截断阈值 \(\tau\) 可能会误伤部分边缘合理预测;此外评测语义相似度依赖 GPT-4o-mini,仍存在微小的仲裁者偏差。
  • 改进与拓展思路:未来可将时序区间回归扩展为时空三维定位(Spatio-Temporal Grounding,带有时空 bounding box 或 mask),实现“在何时、在何处”的双重定点审计;同时可基于 Spotlight 蒸馏出专用的轻量化视频故障定位小模型,直接充当视频扩散模型的局部去噪损失引导。

相关工作与启发

  • vs VBench / VBench 2.0: VBench 系列通过设计多维度提示词生成视频并使用 VLM 进行全局质量打分,侧重于评估生成模型横向排位;Spotlight 则聚焦于高保真视频内的局部瞬态故障,不仅给出定性判断,还强制要求输出起止时间戳与因果说理,评测目标从“宏观排位”转为“微观诊断”。
  • vs VideoPhy / Physics-IQ: 这类工作专注于视频生成是否遵循物理常识,多采用单选题(QA)或二分类形式;Spotlight 则将物理规律(力学、刚体、材质)与生物解剖、语义遵从统一纳入层级化分类体系,且以自由时序定位与自然语言解释为输出目标。
  • vs BrokenVideos / DAVID-XR1: BrokenVideos 侧重于早期低级视觉伪影(如画面撕裂、色彩失真);DAVID-XR1 侧重于 AI 生成视频的防伪鉴伪检测。Spotlight 则专注于前沿顶尖生成模型(Veo 3、Seedance)呈现的高语义、高拟真复杂场景下的细微失误,更贴合前沿生成模型的评测与对齐需求。

评分

  • 新颖性: ⭐⭐⭐⭐ [首次提出面向前沿高保真生成视频的细粒度时序错误定位与归因基准,开创了 VLM 视频故障审计新范式]
  • 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 3 大前沿生成模型、多款主流开源/闭源 VLM,涵盖 4 类推理时策略、消融实验、难度分级与人工对标]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑链路严密,任务定义、度量公式与失败根因分析详尽透彻,图表呈现直观规范]
  • 价值: ⭐⭐⭐⭐⭐ [为视频生成社区提供了极具挑战性的诊断沙盒,对推动 VLM 细粒度时空感知及视频对齐奖励模型发展具重大指导意义]