LongVQUBench: Benchmarking Long-Term Video Quality Understanding of Vision-Language Models¶
会议: ECCV 2026
论文: ECCV 原文
项目主页: https://longvqubench.github.io
领域: 多模态VLM
关键词: 视频质量理解, 长视频基准评测, 多模态大模型, 针失真问答, 时序感知推理
一句话总结¶
针对现有视频质量评测局限于短片段与孤立失真、无法衡量长时间累积退化与深层推理的问题,提出首个长视频质量理解基准 LongVQUBench,包含 1,200+ 跨数分钟至两小时的多元视频及 1,500 个问答对,建立从局部事件到跨事件再到全局质量的三级分层评测与针失真问答范式,全面揭示了 14 款前沿 LVLM 随视频时长与推理深度增加而性能严重衰减的瓶颈。
研究背景与动机¶
随着多模态大语言模型(LVLMs)的飞速发展,以 GPT-5、Gemini-3、Qwen2.5-VL 等为代表的统一架构在细粒度图像识别、长上下文视频问答等高层语义理解任务上展现出强大能力。然而,学术界在视频理解上的关注点长期过度聚焦于动作识别、因果事件推导与叙事语义追踪,严重忽视了模型对底层与中层视觉感官退化的理解能力——即长视频质量理解(Long-Term Video Quality Understanding, LVQU)。在长达数分钟乃至数小时的真实观看场景下,视频质量不仅取决于单帧的清晰度,更依赖于时序连续性、主观感知舒适度以及长时间跨度下的累积退化效应(如逐渐漂移的色调、间歇性闪烁与卡顿引发的视觉疲劳)。
传统的视频质量评估(VQA)方法(如 PSNR/SSIM 等全参考指标,或 BRISQUE、VIDEVAL、DOVER 等无参考模型)专注于短视频剪辑的低阶统计信号拟合,输出单一的主观质量评分(MOS),完全缺乏基于自然语言的语义归因与时序因果推理能力。而现有面向 LVLM 的评估基准中,Video-MME、LongVideoBench 和 MLVU 均以高层语义事件问答为主,缺乏对感知保真度与失真伪影的系统量化;Q-Bench-Video 虽首次探索了 LVLM 的视频质量解释能力,但其评测样本受限于 10 秒以内的微短片段,无法考察长程时序上的质量演化与跨事件交互。
填补长视频语义理解与细粒度质量感知之间的鸿沟,核心壁垒在于如何系统构建具有可控退化、长时依赖且排除内容语义偏差的大规模评测数据。核心 idea:构建首个系统化长视频质量理解基准 LongVQUBench,通过将 1,200+ 部时长达 2 小时的全景视频切分为短片段并精细注入空间与时序失真,创立由局部事件(LQU)、跨事件推理(CQR)至全局质量(GQU)的三级分层评测体系,并配合针失真问答(NDQA)范式,实现对 LVLM 感知敏感度、时序归因与全局综合评判能力的层级化探测。
方法详解¶
整体框架¶
LongVQUBench 的构建遵循“真实长视频采集 → 空间/时序受控失真注入 → 三级时序感知分层 → 针失真问答双轨标注”的完整流水线。基准涵盖电影、纪录片、监控、第一人称视角、教学视频及动画生成视频等六大多元模态,时长分布从数分钟延展至 120 分钟(平均时长 742.2 秒)。为了实现无偏且可溯源的质量评测,基准将长视频划分为统一的 15 秒基础时间片,并由专家设计 14 种空间失真与 4 种时序失真,分别在三种强度下受控注入,形成能够精准探查细粒度感知敏感度的“针失真问答(NDQA)”样本。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["长视频数据源<br/>1200+ 视频 / 0-120 分钟"] --> B["受控失真注入池<br/>14种空间 + 4种时序失真"]
B --> C["分层时序结构化评测<br/>LQU / CQR / GQU 三级体系"]
C --> D["针失真问答范式 (NDQA)<br/>选择题 (客观) + 开放式问题 (解释)"]
D --> E["多模态评测基准输出<br/>1500 问答对与专家交叉校验"]
关键设计¶
1. 受控失真注入池:解耦视觉失真类型与强度梯度的受控合成机制 真实采集的超长视频往往伴随复杂交织的自发退化,直接对其做质检标注极易受主体内容偏置干扰,且难以精准界定时间边界。为此,LongVQUBench 确立了“以高质量纯净视频为主体(888 部高质量,搭配 218 部中质量与 94 部低质量),系统化施加受控失真”的策略。基准构建了涵盖 14 种空间失真(如高斯模糊、传感器噪声、块效应、色彩偏移等)与 4 种时序失真(如抖动、丢帧/卡顿、闪烁、运动模糊)的失真库,每种失真设立 3 个离散强度级别。长视频首先被分割为连续的 15 秒短片,失真仅在选定的片段中施加并重新无缝拼接为完整长视频。这种模块化合成保证了失真出现的准确时间戳、真实退化类型以及与背景语义的独立性,为后续问答提供了绝对可靠的 Ground Truth。
2. 分层时序结构化评测:由微观感知到宏观归因的三级认知进阶体系 为了全面剖析模型在不同时间跨度下的感知推理机制,LongVQUBench 提出了自底向上的三级时序评价体系: - 局部事件质量理解(Local Event Quality Understanding, LQU):聚焦长视频中单一出现的短暂失真片段(5 至 20 秒),设置检测(Detection)、时序定位(Localization)、类型分类(Classification)、严重度与舒适度评估(Severity & Comfort Assessment)和开放推理(Open Reasoning)5 个维度,考察模型对突发伪影的捕捉与时间戳边界判定能力; - 跨事件质量推理(Cross-Event Quality Reasoning, CQR):针对分散在长视频不同区段的 2 至 4 个失真事件,设计对比(Comparison)、累积效应(Cumulative Effect)、综合集成(Integration)、时序关系(Temporal Relation)及开放推理维度,测试模型跨长时跨度关联多个局部退化、评估疲劳累积与相对劣化的跨片段推理能力; - 全局质量理解(Global Quality Understanding, GQU):覆盖数十分钟至两小时全片,包括稳定性评估(Stability Evaluation)、主导退化因素归因(Dominant Factor Identification)、时序演变趋势判断(Trend Assessment)、整体质量评估(Overall Evaluation)和开放推理,要求模型对长时间观看体验输出宏观、一致且具有说服力的综合评价。
3. 针失真问答范式(NDQA):兼顾客观判定与开放式机制解释的双轨探针 借鉴长文本大海捞针(Needle in a Haystack)评测思想,NDQA 将微弱但关键的空间或时序伪影稀疏“穿刺”于长时序列中,既不破坏主线叙事流,又能敏锐暴露模型在信息压缩下的感知盲点。评测格式采用双轨并进:一方面提供涵盖“Yes-or-No(判定存在)”、“What(识别种类)”、“Which(跨段对比)”和“How(量化强弱与范围)”四类客观多项选择题(MCQ),保证评测的自动化、标准化与无偏统计;另一方面设计开放式问答,要求模型自主用自然语言阐述失真产生的机理、在时轴上的起止规律以及为何导致观感断崖式下跌。开放式评测引入基于 GPT 的相关性(Relevance)与完整性(Completeness)多维度双重打分协议,结合人工专家交叉仲裁,杜绝了浅层模板复读与幻觉编造。
实验关键数据¶
主实验¶
在 40% 验证集上确定各模型最佳采样帧率后,对 14 款代表性 LVLM(包括 3 款闭源旗舰、7 款开源视频模型以及 4 款长视频 Agent 架构)在 60% 独立测试集上进行全维度评测。统一测试协议为零样本单次前向推理。下表展示了各类模型在多项选择题(MCQ)各维度上的准确率表现(%):
| 模型类型 | 模型 | 采样帧数 (#F) | LQU 均分 | CQR 均分 | GQU 均分 | 总体准确率 (Overall) |
|---|---|---|---|---|---|---|
| 闭源前沿模型 | GPT-5 | 256 | 65.4 | 82.2 | 60.9 | 69.5 |
| Gemini-3 | 128 | 61.6 | 79.3 | 59.4 | 66.8 | |
| Qwen-VL-Max | 64 | 57.6 | 77.3 | 57.1 | 64.0 | |
| 开源视频模型 | LLaVA-NeXT-Video | 8 | 44.7 | 70.0 | 54.7 | 56.4 |
| ShareGPT4Video | 16 | 30.4 | 31.7 | 25.3 | 29.1 | |
| Qwen3-VL | 64 | 50.6 | 72.6 | 57.8 | 60.3 | |
| MovieChat | 64 | 30.0 | 40.2 | 36.8 | 35.6 | |
| LLaVA-Video | 8 | 41.6 | 70.5 | 51.3 | 54.5 | |
| VQA2 (专用质量模型) | 8 | 51.4 | 64.1 | 47.2 | 54.2 | |
| Long-RL | 64 | 61.9 | 67.1 | 50.8 | 59.9 | |
| Agentic 架构 | VideoAgent | 自适应 | 28.6 | 40.0 | 37.1 | 35.2 |
| VideoExplorer | 自适应 | 39.4 | 58.1 | 44.9 | 47.5 | |
| LongVT | 自适应 | 50.3 | 50.5 | 35.6 | 45.5 | |
| DeepVideoDiscovery | 自适应 | 69.2 | 72.1 | 56.8 | 66.0 |
注:LQU、CQR、GQU 均分由对应子项(如 LQU 的 Detection, Localization, Classification, Severity & Comfort Assessment)算术平均所得。
消融实验:采样帧数预算对时序质量感知的影响¶
在 LongVQUBench 验证集(40%)上,探索不同均匀采样帧数(上限 1 FPS)对模型性能的影响。实验揭示了增加帧数在质量理解任务中收益极其有限甚至导致性能饱和倒退的普遍现象:
| 模型 | 采样帧数 (#frames) | LQU 准确率 | CQR 准确率 | GQU 准确率 | 总体表现 (Total) |
|---|---|---|---|---|---|
| GPT-5 | 8 | 72.4 | 77.8 | 61.2 | 70.5 |
| 32 | 71.5 | 78.5 | 63.0 | 71.0 | |
| 64 | 74.0 | 80.2 | 64.5 | 72.9 | |
| 128 | 75.5 | 81.6 | 65.0 | 74.0 | |
| 256 | 75.2 | 81.2 | 65.8 | 74.1 | |
| Gemini-3 | 8 | 71.2 | 73.6 | 59.6 | 68.1 |
| 32 | 67.2 | 75.0 | 56.2 | 66.1 | |
| 64 | 67.0 | 74.2 | 58.5 | 66.6 | |
| 128 | 71.0 | 76.5 | 59.2 | 68.9 | |
| 256 | 68.8 | 75.6 | 57.6 | 67.3 | |
| VQA2 (专业模型) | 8 | 63.2 | 65.5 | 49.5 | 59.4 |
| 32 | 59.0 | 63.5 | 47.5 | 56.7 | |
| 64 | 59.5 | 64.0 | 52.0 | 58.5 | |
| 128 | 58.0 | 63.0 | 50.5 | 57.2 | |
| 256 | 55.5 | 61.0 | 48.0 | 54.8 | |
| Qwen3-VL | 8 | 51.8 | 59.6 | 49.5 | 53.6 |
| 32 | 54.5 | 60.0 | 50.0 | 54.8 | |
| 64 | 54.0 | 75.0 | 60.4 | 63.1 | |
| 128 | 52.0 | 58.2 | 51.0 | 53.7 | |
| 256 | 49.5 | 56.5 | 49.5 | 51.8 |
关键发现¶
- 帧数增加遭遇严重收益边际递减甚至退化:闭源模型在 128 至 256 帧间迅速饱和;开源专业质量模型 VQA2 在仅 8 帧时即达顶峰(59.4%),扩展至 256 帧时反而暴跌至 54.8%;Qwen3-VL 亦在 64 帧后大幅倒退。这表明长视频中的均匀下采样在引入更多帧时引入了大量无效冗余,使得注意力分散,稀释了对短暂失真针伪影的敏锐度。
- 由局部到全局的阶梯式断崖式掉点:所有模型在 GQU(全局宏观质量)上的表现均显著落后于 CQR 和 LQU。例如即使是 GPT-5,在 GQU 趋势评估(Trend Assessment)维度上的准确率仅有 48.5%,接近随机猜测,证明当前模型严重缺乏追踪长时序质量单调变化或间歇波动的全局综合能力。
- Agentic 架构的探索策略成为分水岭:自适应关键帧检索的 Agentic 模型呈现极端两极分化。以 DeepVideoDiscovery 为代表的深度工具交互式 Agent 取得了 66.0% 的惊人成绩,在定位(Localization)上拿下全场最高的 83.3%,逼近 GPT-5;但采用简单启发式搜索的 VideoAgent 仅有 35.2%,说明质量失真的探测高度依赖于细致的目标导向时序探索策略。
- 开放式回答的“相关但残缺”困境:在开放式问答评测中,所有模型的相关度评分(Relevance)普遍处于高位(GPT-5 达到 88.9%,开源模型普遍在 75%-81%),表明模型听懂了题目并给出了对题的推论;然而完整度得分(Completeness)极度匮乏,即便是最强的 GPT-5 也仅为 45.8%,开源模型均在 36%-40% 之间徘徊,说明模型无法详尽归纳多处失真并给出严谨完整的物理机理解释。
亮点与洞察¶
- 将“大海捞针”拓展至连续视觉质量维度的 NDQA 范式:不同于语义长文本中直接匹配离散词条,NDQA 首次在视频时空连续体中嵌入微弱退化信号,逼迫模型脱离表面常识与宏观语义推断,在多模态表示层建立对低阶高频失真的敏锐感知。
- 三级认知阶梯(LQU → CQR → GQU)的设计洞察:将复杂的“视频主观质量评价”拆解为局部突变捕捉、跨段对比综合以及全片长期衰减趋势推演,为评估视觉模型时序归因能力提供了精细度前所未有的解剖刀。
- 对视频生成与流媒体分发的启发:基准揭示了现有模型对时序闪烁、累积卡顿、空间退化交互影响的迟钝,表明在利用 LVLM 充当视频生成模型(Sora、Gen-3)的自动质检与微调判别器时,必须专门引入时序跨事件与趋势归因的训练监督。
局限与展望¶
- 受控失真合成与野生自发退化的域差异:虽然基准包含了 18 种典型失真并精细调控了 3 级强度,但实际工业界与 UGC 视频中的退化往往是复杂的连续多源退化交织(如低照度高噪点与 HEVC 深度压缩并存),未来需进一步扩充自发复合退化的长视频标注。
- 统一单次前向评测协议的帧率瓶颈:由于许多开源模型存在上下文窗口限制,不得不采用极稀疏的下采样策略,这在客观上导致部分极短的针失真在下采样过程中被漏帧,未来可结合层次化滑动窗口或流式状态空间模型(SSM)扩展评测粒度。
- 评测指标对主观感受建模的深度有限:开放式回答评分目前依赖大模型打分,对人类心理物理学中的疲劳效应、重采样记忆遗忘效应等深层知觉特征的拟合仍有提升空间。
相关工作与启发¶
- vs Q-Bench-Video: Q-Bench-Video 首开利用 LVLM 评估视频画质的先河,但样本局限于几秒的短片,无法考察长时程下的时序退化演进;LongVQUBench 将时长推至 120 分钟,并提出了由局部到全局的三级分层与 NDQA 范式,填补了长程质量理解的空白。
- vs LongVideoBench & Video-MME: 现有长视频基准主要考察角色关系追踪、故事线推导或粗粒度动作分类;LongVQUBench 则要求模型同时掌握语义事件与底层时空失真的交互影响,证明了高语义理解能力并不能直接泛化为精细的画质鉴别力。
- vs 传统传统视频质量模型 (DOVER, VQA2): 传统深度 VQA 只能输出单一标量分数,黑盒化且无法用自然语言阐明原因;LongVQUBench 推动视频质量评估迈向“可归因、可定位、可交互式解释”的多模态智能新阶段。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次提出针对长视频质量理解的统一基准,构建了前所未有的三级时序感知体系与针失真问答范式。
- 实验充分度: ⭐⭐⭐⭐⭐ 覆盖 14 款跨越闭源、开源与 Agentic 架构的最前沿多模态大模型,并深入开展了采样帧率、客观选择题及开放式多维打分消融。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑层次清晰,概念界定严谨,图表结构完整且具备极高的学术规范度。
- 价值: ⭐⭐⭐⭐⭐ 为长视频大模型从单纯的语义理解走向精准、可解释的人类级视觉感知质检奠定了坚实的评测基石。