跳转至

Video-Oasis: Rethinking Evaluation of Video Understanding

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/sejong-rcv/Video-Oasis
领域: 视频理解
关键词: 视频理解评测, 捷径样本, 视觉依赖性, 时序依赖性, 基准审计

一句话总结

Video-Oasis 不新造视频基准,而是提出一套可持续的诊断套件,用「抽掉视觉证据」「破坏时序结构」「人机协同核验标注歧义」三条轴审计了 14 个现有视频理解基准,发现 55% 的样本无需视觉或时序信息即可答对;过滤后剩下的 11,033 个「视频原生挑战」样本上,最先进模型仅略高于 25.6% 的随机猜测。

研究背景与动机

视频理解评测这几年一直在做加法。动作识别、时序定位这类窄任务的时代过去后,Video-LLM 被要求同时处理细粒度动态和长视频推理,于是基准一个接一个地冒出来:Video-MME、MVBench、LongVideoBench、MLVU 负责通用长视频,EgoSchema 负责超长第一人称,VSI-Bench 这类负责空间。问题是,随着规模膨胀,同一份榜单上的分数越来越难解释——一个模型答对了某道题,究竟是因为它真的看懂了画面,还是因为语言先验已经能猜出选项,或者字幕/语音里已经写了答案?

这个疑问之所以长期悬着,根子在基准的构建方式。视频标注成本极高,所以主流流水线走的是自动策略的两条捷径:从选定的关键帧生成问题,或者让 LLM 基于视频转写文本来出题。这两条路都会无意间把「视频」这一模态旁路掉——生成出来的样本可能完全不依赖时间连续性、因果交互、多事件叙事这些真正把视频与图像/文本区分开的性质。此前并非没人审计过:EgoTempo 只查了 2 个基准且只看时序一条轴,Cambrian-S 覆盖 9 个基准但时序轴只有单项测试,Apollo 查 6 个基准、单条视觉轴。三者都没有用跨模型共识来稳固结论,也基本没有人工介入复核。

本文的切入点是:与其再造一个榜单,不如先把「这段视频问答到底需不需要看视频」变成一个可以批量执行、可复现的诊断问题。做法是把「必要性」拆成三个可操作的判据——视觉证据是否必需、时序上下文是否必需、标注是否可靠——每个判据配一组探针测试,用多个模型的一致性来判定样本是否为「捷径样本」,再把有争议的样本交给人看。核心 idea:用「视觉抽除 + 时序扰动 + 歧义核验」三组探针加跨模型共识与人工复核,把现有基准里真正依赖时空证据的样本蒸馏出来,得到一个更严苛的评测协议;这个协议既暴露了现有模型被高估的程度,也能反过来当作算法设计的实验台。

方法详解

整体框架

Video-Oasis 不是一个新的数据集,而是叠在已有基准之上的一层筛子。输入是某个基准的全部 QA 对及其视频;中间经过三个判据对应的九项检查——视觉依赖性(Blind / Audio / Summary)、时序依赖性(Center-Frame / Frame Shuffling / Bag-of-Frames)、标注可靠性(Consistency / Redundancy / Sensitivity),前六项由一组诊断模型作答并由跨模型共识判定捷径,后三项把人机协同的复核结果回灌;输出是过滤后的「视频原生挑战」集以及附着在它上面的五类能力标签。在 14 个基准上,24,416 个 QA 对被压到 11,033 个(对应 4,938 个唯一视频),评测体量减少 55%,而保留下来的是更依赖时空证据的部分。整个流程是可复现、可扩展的:新基准只要跑同一套探针即可并入,不必重新设计协议。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["14 个视频基准<br/>24,416 个 QA 对"] --> B["视觉依赖性诊断<br/>Blind / Audio / Summary"]
    B --> C["时序依赖性诊断<br/>中心帧 / 帧乱序 / BoF"]
    C --> D["歧义核验<br/>一致性 / 冗余 / 敏感性"]
    D --> E["视频原生挑战蒸馏<br/>五类能力 + 集成标注"]
    E --> F["视频原生诊断集<br/>11,033 QA · 4,938 视频"]

关键设计

1. 视觉依赖性诊断:用三条「无视觉」探针逼出靠语言先验与语音文本就能答对的样本

要证明一道题「必须看视频」,最直接的办法是把视觉证据抽掉再问一遍:如果模型照样答对,这道题就没有在考核视觉感知。三条探针分别抽掉不同层次的视觉信息——Blind 只给问题和选项,用于识别纯粹靠语言偏见或世界知识就能解的样本(比如「打字机哪一年首发」这种历史常识题);Audio 把视频音轨转写成文本喂给模型,用于识别答案其实藏在解说词里的样本;Summary 用固定间隔抽帧跑 caption 模型,把整段视频换成拼接的字幕序列,用于识别关键信息已经被文字摘要覆盖的样本。论文特意声明后两条探针不追求「把视频推理做成文本推理」的最优实现,它们只承担诊断职责:能靠语音转写或字幕序列答对,就说明它对原始画面的依赖不成立。

判定的关键在于「谁来算答对」。单模型太脆弱——一个模型答错可能只是它弱,不代表题目需要视觉。于是引入了跨模型共识阈值 \(c\):只有在某个测试上至少 \(c\) 个诊断模型都答对,该样本才被计为该测试下的捷径样本。基准 \(X\) 上的捷径比例定义为

\[R_{\text{shortcut}}(X)=\frac{\bigl|\{x\in X:\ \exists\,t\in\mathcal{T},\ \#\{m\in\mathcal{M}: m\ \text{在测试}\ t\ \text{上答对}\ x\}\ge c\}\bigr|}{|X|}\]

其中 \(\mathcal{T}\) 为六项诊断测试、\(\mathcal{M}\) 为诊断模型集合。\(c\) 放松到 1 时比例会飙升到 92.7%(平均),收紧到 3 时回落到 44.6%–63.0%,所以论文同时报告三个阈值——这个设计让「捷径有多普遍」变成一个可调口径的陈述,而不是一个靠单次实验撑着的数字。

2. 时序依赖性诊断:从单帧、乱序到无序匹配,逐级拆掉时序结构

视觉探针管的是「看不看画面」,但视频理解还有一半是「按不按顺序看」。三条时序探针按破坏强度递进:Center-Frame 只给正中间一帧,用来抓那些名字叫视频、实质是静态识别或空间关系的题;Frame Shuffling 随机打乱帧序,直接切断时序因果,如果模型在乱序下仍然答对,说明它对时间顺序不敏感;Bag-of-Frames 更彻底,用一个不建模时序的冻结 CLIP 系编码器(CLIP / Long-CLIP / EVA-CLIP)对查询做 top-k 帧匹配,这是一种「只看模式、不看顺序」的检索式解法,一旦它成功,这道题需要的就只是视觉模式识别而非时序推理。三级设计的好处是能区分「完全不看画面」与「看了画面但不看顺序」这两种性质不同的缺陷,而后者恰恰是很多自称视频模型的系统最隐蔽的问题。

3. 歧义核验:人机协同把「错标注」与「假捷径」分开

前六项探针都建立在「模型答对 = 样本有捷径」这个推断上,但视频数据又长又密,标注本身可能是坏的:时序定位含糊(问「什么时候发生」,答案却是一句「贯穿全片」)、主体指代不唯一(视频里有多个「棕发男子」)、证据不足,或者答案根本不唯一。这类样本会在诊断里表现为「模型答对」,被误判成捷径。三项核验专门处理这件事,并且它们的作用不是过滤而是「打标记待人工检查」:Consistency 用多个模型是否达成一致来暴露内在歧义;Redundancy 检查样本是否在任意一段视频片段上都能答对,从而暴露那些没有把答案锚定到特定时间段的坏设计;Sensitivity 则针对 Frame Shuffling 的假阳性——人工复核那些乱序后仍答对的样本,把其实真的需要时序顺序的题目捞回来。论文给出的典型例子很说明问题:一道问「'person fixes their hair' 发生在何时」的题,标注写「贯穿全片」,被冗余检查揪出后判定为错误标注;而问「棒球裁判在第二个球之后做了什么」的题虽然通过了乱序测试,人工复核却认定它确实依赖「第二个球之后」的顺序,于是被恢复保留。

4. 视频原生挑战蒸馏:让残留样本自己长出五类能力标签

过滤完之后,剩下的样本究竟是什么,需要一个自底向上的答案,而不是事先定好类目往上套。作者的流水线复用已有标注:先把存活 QA 对在源基准中的任务类别与子任务标签聚合起来,用 Gemini-2.5-Pro 据此抽象出候选挑战簇,再归并成五类能力——细粒度感知(识别依赖于细节在时空中的演化)、空间世界理解(跨帧整合碎片化多视角证据以推断相对位置、几何与轨迹)、时序动态与追踪(目标跟踪、动作序列、状态转移,必须依赖顺序)、因果与逻辑推理(推断潜在的因果、物理规律与未观察到的意图)、全局叙事(整合全时间线的事件以推断长程语义)。样本归类时不靠单模型:五个专有 LLM 各自独立打标,至少三个一致才接受,只有 122 个样本无法达成共识而转人工。这套「先过滤、后归纳」的顺序是关键——类别是从残留数据里长出来的,不是预设的考核清单,因此不会把传统图像任务换个壳又塞回视频评测里。

一个完整示例

拿 Figure 3 里的两道题走一遍流程,能看清三组检查是怎么协同的。

第一道问「'person fixes their hair' 发生在视频的什么时候」。它顺利通过 Blind / Audio / Summary(语言先验和字幕都答不出),也通过中心帧和乱序测试。但在 Redundancy 检查里,模型发现拿视频的任何一段去答都能答对——因为「整理头发」这个动作贯穿全片。样本被标记进入人工复核,复核确认标注「贯穿全片」与题目要求的时序定位不匹配,属于错误标注,剔除。

第二道问「棒球裁判在第二个球之后做了什么」。它在 Frame Shuffling 下模型仍然答对,于是被初判为时序捷径。但 Sensitivity 复核时人工读出「第二个球之后」这个短语本身就要求事件排序,乱序下答对更可能是模型记住了答案而非题目不需要顺序,因此把它从捷径名单里恢复,保留进最终诊断集。

两道题都同时「通过」了部分探针,却因为走向不同而结果相反——这正是为什么要用三条轴而不是一条轴:任何单一探针都会同时产生假阳性与假阴性,跨模型共识和人工复核是把这个偏差压下去的手段。

实验关键数据

主实验

审计部分先看诊断测试本身的聚合结果(14 个基准、全部样本)。随机猜测基线为 25.6%:

诊断测试 Eagle2.5 Qwen2.5-VL Qwen3-VL / 其他 说明
Blind 35.6 33.5 36.2 只给问题与选项,高出随机 8–11 个点
Audio 47.6 46.8 45.9 音轨转文本代替视频
Summary 44.0 42.6 45.0 抽帧字幕拼接代替视频
Center-Frame 42.2 40.2(Qwen3-VL)/ 43.0(VideoAuto-R1) 只给中间一帧
Frame Shuffling 52.2 50.7(Qwen3-VL)/ 52.4(VideoAuto-R1) 随机打乱帧序
Bag-of-Frames 31.4(CLIP)/ 32.8(Long-CLIP)/ 32.7(EVA-CLIP) 冻结 CLIP 做 top-k 帧匹配

把四个任务组分开看,捷径的普遍程度随共识阈值变化如下:

共识阈值 空间组 [21,33,43] 时序组 [9,27,42] 推理组 [7,22,52] 通用组 [12,16,35,39,50]
c ≥ 1 95.6 95.7 85.8 94.0
c ≥ 2 86.1 85.2 69.2 83.9
c = 3 58.8 54.4 44.6 63.0

过滤后得到 11,033 个视频原生挑战样本,用它们给 13 个模型排座次(准确率 %,随机基线 25.6):

模型 细粒度感知 空间世界 时序动态 因果逻辑 全局叙事 总体
GPT-4o 25.6 33.2 26.3 27.3 26.5 27.5
Gemini-2.5-Pro 40.2 49.8 50.9 45.4 43.0 46.7
Qwen2.5-VL (7B) 23.3 28.7 32.3 28.6 21.2 29.2
Qwen3-VL-Instruct (8B) 27.0 42.4 36.5 28.0 21.5 33.8
Qwen3-VL-Think (8B) 29.0 41.6 37.7 27.7 23.2 34.6
Eagle2.5 (8B) 26.9 31.0 39.7 33.2 22.7 34.5
InternVL-3 (8B) 27.0 31.3 34.1 30.6 24.5 31.6
InternVL-3.5 (8B) 29.5 41.9 35.1 29.8 23.3 33.6
Video-R1 (7B) 24.0 24.0 29.1 27.3 18.4 26.3
LongViLA-R1 (7B) 28.4 25.4 31.5 27.9 20.6 28.6
VideoAuto-R1 (8B) 27.5 44.3 39.5 31.1 28.9 36.8
VideoTree (GPT-5-mini) 28.6 34.0 32.3 24.6 20.7 30.1
STAR (GPT-5-mini) 31.6 44.4 42.2 34.0 32.9 39.5

消融实验

时序定位的作用。用 AKS 检索最相关的 16 帧作为定位方法,在视频原生挑战上做消融:

方法 细粒度感知 空间世界 时序动态 因果逻辑 全局叙事 总体
Eagle2.5(无定位) 25.0 29.4 34.9 30.5 25.7 31.5
Eagle2.5 + 时序定位 28.4 31.9 35.7 30.4 27.5 32.9
Qwen3-VL-Instruct(无定位) 22.9 37.1 28.8 24.8 16.9 27.8
Qwen3-VL-Instruct + 时序定位 25.2 37.9 32.3 23.3 19.9 30.1

为了把「定位不准」与「推理太弱」分开,论文在 ImplicitQA 与 KFS-Bench 的 2,945 个 QA 上做了 oracle 定位实验(其中 1,060 个是视频原生样本、1,885 个是捷径样本,每个都带真值时序区域):

方法 细粒度感知 空间世界 时序动态 因果逻辑 全局叙事 视频原生(总体) 捷径(总体)
Eagle2.5 37.2 22.9 40.5 38.5 16.0 35.0 78.0
Eagle2.5 + Oracle 定位 50.4 27.5 61.3 48.1 48.0 50.8 80.8

推理深度调制。以 Qwen3-VL (8B) 为底座比较三种模式,并加一个「两种模式只要有一个答对就算对」的 oracle 投票基线:

方法 细粒度感知 空间世界 时序动态 因果逻辑 全局叙事 总体
Qwen3-VL-Instruct 27.0 42.4 36.5 28.0 21.5 33.8
Qwen3-VL-Think 29.0 41.6 37.7 27.7 23.2 34.6
Qwen3-VL-AutoR1(自适应思考) 27.5 44.3 39.5 31.1 28.9 36.8
Qwen3-VL-Voting(oracle 二选一) 38.4 57.7 49.4 37.8 30.1 46.2
Gemini-2.5-Pro 40.2 49.8 50.9 45.4 43.0 46.7

训练范式对比。统一底座为 Qwen2.5-VL,比较长上下文 SFT 与两种 RLVR 奖励设计:

模型 QA 奖励 定位奖励 细粒度感知 空间世界 时序动态 因果逻辑 全局叙事 总体
Qwen2.5-VL 23.3 28.7 32.3 28.6 21.2 29.2
Eagle2.5(长上下文 SFT) 26.9 31.0 39.7 33.2 22.7 34.5
Video-R1 24.0 24.0 29.1 27.3 18.4 26.3
VideoAuto-R1(Qwen2.5) 25.4 29.7 35.9 33.7 28.6 32.7

关键发现

  • 模型排名确实被重排,RL 系视频模型被高估得最厉害。 在常规榜单上被当作进步代表的 Video-R1(26.3)与 LongViLA-R1(28.6)在新协议下几乎贴着随机线(25.6),其中 Video-R1 甚至低于它自己的底座 Qwen2.5-VL(29.2)近 3 个点——RLVR 学到的很可能是捷径样本上的模式而非时空推理。相对地,同底座加了定位奖励的 VideoAuto-R1(Qwen2.5) 从 29.2 涨到 32.7,说明奖励设计而非「是否用 RL」才是分水岭。
  • GPT-4o 也被显著高估。 它在新协议下总体只有 27.5,与 7B 开源模型同居随机线附近;而 Gemini-2.5-Pro 拿到 46.7,是唯一把各维度都推到 40 以上的系统,但仍谈不上解决——这说明任务本身对当前最强的专有模型也构成实质挑战。
  • 全局叙事是共同瓶颈。 13 个模型里绝大多数在 Global Narrative 这一列低于或接近随机线(Qwen2.5-VL 21.2、Eagle2.5 22.7、GPT-4o 26.5),最高也只有 STAR 的 32.9 与 Gemini 的 43.0。跨全时间线整合事件、同时过滤无关上下文,是当前架构最不擅长的能力。
  • 时序定位的收益取决于样本是否真的依赖定位。 Oracle 实验把差距拉得非常清楚:视频原生样本上从 35.0 跳到 50.8(+15.8),捷径样本上只从 78.0 到 80.8(+2.8)。言下之意是,捷径样本让模型可以绕过精确定位也能得分,这本身就是在鼓励「不看时序」;只有在强时空依赖的环境里,定位才成为决定性因素。
  • agentic 设计的收益不能全归给底层推理模型。 VideoTree 与 STAR 用同一个 GPT-5-mini 作推理模型,总体分却分别是 30.1 与 39.5,差出 9.4 个点,说明推理步骤的编排方式(而非推理模型本身)是关键变量。
  • 「何时思考」的收益接近换一个前沿模型。 固定开思考(34.6)只比指令模式(33.8)高 0.8;自适应思考(36.8)再高一截;而 oracle 二选一的投票基线(46.2)几乎追平 Gemini-2.5-Pro(46.7)。换句话说 Qwen3-VL (8B) 本身已经能解出大部分 Gemini 能解的题,缺的是「判断这一题该不该深想」的能力。
  • Video-Oasis 不等于「挑难题」。 与一个由三个模型全部答错构成的 6,609 题难度基线相比,两个集合只有 44.6% 重叠——说明它是按视觉/时序/歧义判据筛出来的,而不是按模型是否答错筛出来的。

数字口径说明:表中「视频原生挑战」主榜(13 模型)与消融表(Table 8)对同一模型给出的基线并不一致,例如 Eagle2.5 在主榜为 34.5、在定位消融的「无定位」行为 31.5,Qwen3-VL-Instruct 为 33.8 对 27.8。原文未说明两次评测的样本范围是否存在差异,此处照原表转录,⚠️ 以原文为准。另外主榜中的 VideoAuto-R1 (8B) 与 Table 10 的 Qwen3-VL-AutoR1 同为 36.8,应为 Qwen3-VL 底座版本;Table 11 中的 VideoAuto-R1(Qwen2.5) 为 32.7,底座不同,两者不可直接互比。

亮点与洞察

  • 把「基准可信吗」做成可复现的批量实验,而不是一篇评论文章。 三组探针 + 跨模型共识阈值 \(c\) 的组合,让「捷径有多普遍」这个判断有了可调口径和可迁移的工具链。任何新基准都可以直接跑同一套探针,这使得审计不是一次性的,而是可持续的。
  • 反循环验证(correlation rate)是全文方法论上最讲究的一处。 用与识别捷径时不同的模型(InternVL-3.5、LongViLA-R1、STAR)去检查被判定为捷径的样本在标准评测下是否仍被答对,平均达 76%,且没有任何单个测试低于 65.7%。这既排除了「自己判自己」的循环论证,又顺带得到一个有力结论:捷径样本已经被当前模型普遍掌握,未来的评测价值应该转移到剩下的部分。
  • Oracle 定位实验把「定位不准」和「推理太弱」这对混淆因素拆开了。 这是全文最有说服力的一个实验设计:同样是加真值定位,视频原生样本涨 15.8 个点、捷径样本只涨 2.8 个点。它一句话就说明了为什么在捷径泛滥的基准上做定位研究收益会被稀释,这个实验模式可以迁移到任何「模块 A 误差 vs 模块 B 误差」的归因场景。
  • 「何时思考」的投票上界提示了一条不靠扩模型的提升路径。 8B 模型在指令/思考两种模式下有一个 oracle 选择器就能到 46.2,逼近 Gemini 的 46.7。这个数字本身不可部署(它用了真值),但它把「推理深度控制」的量级摆在了明面上——后续工作应该朝可学习的选择器走,而不是朝更大的模型走。
  • 可迁移的通用做法:给任何多模态基准加一道「模态盲测」作为准入检查;用多模型共识阈值代替单模型判定;对「困难子集」筛选结果做一次与难度基线的重叠度检验,防止把筛选器写成难度挑选器。

局限与展望

  • 作者承认:caption 替换和帧乱序这两种测试仍可能保留部分时序线索,因此会同时产生假阳性(把真需要时序的题误判为捷径)与假阴性。论文的对策是叠加互补的诊断轴、加跨模型共识与人工复核,但并没有给出这个残余偏差的定量估计。
  • 捷径比例对诊断模型的强弱敏感。 判定「答对」的是那一组诊断模型,换成更强的模型,被判定为捷径的样本只会更多,55% 这个数字的性质更接近「在当前模型能力下可被绕过的比例」。论文报告了三个共识阈值来缓解这个问题,但没有做跨模型能力的敏感性曲线。
  • 文本探针可能同时高估与低估。 Audio / Summary 把任务变成纯文本 QA,若 caption 模型漏掉了画面关键信息,样本会被判为「需要视觉」,从而低估捷径;若某些样本本来就靠世界知识可解,两条探针又只是重复了 Blind 的结论。论文自陈这两条探针「不追求最优实现」,但也意味着它们的误判率没有被刻画。
  • Bag-of-Frames 的判定细节在正文中缺失。 用冻结 CLIP 系编码器做 top-k 帧匹配,但 \(k\) 的取值、相似度聚合方式(最大值还是均值)以及「答对」的定义都推给了补充材料,这直接影响该测试的可复现性与假阳性率。
  • 五类能力标签的边界没有做一致性验证。 类别由五个 LLM 投票产生、仅 122 个样本触发人工,但「因果与逻辑推理」与「全局叙事」在语义上高度邻近,论文没有报告类别间的混淆矩阵或标注者一致性指标。
  • 帧预算本身未被消融。 全部评测统一限制在 128 帧、1 fps 均匀采样。对长视频模型而言,这个上限可能本身就压低了它们的表现,而论文没有做帧数/采样率的敏感性分析——换句话说,主榜上「长视频模型也不强」的结论,未必完全来自模型架构。
  • 可改进方向:报告每个诊断测试在人工抽检样本上的假阳性率;把捷径比例表示成诊断模型能力(而非固定模型集)的函数;对帧预算做一次系统消融,把架构缺陷与输入预算限制分开。

相关工作与启发

  • vs EgoTempo [26]:他们审计 2 个第一人称基准、只覆盖时序一条轴且只有单项测试,没有跨模型共识与人工核验。Video-Oasis 把范围扩到 14 个基准、三条轴共九项检查,并用多模型一致性替代单模型判定。
  • vs Cambrian-S [44]:覆盖 9 个基准、视觉轴有多项测试,但时序轴仍是单项,结论同样缺少共识机制与人工验证。Video-Oasis 的主要增量在于把时序轴也拆成三级强度(单帧 / 乱序 / 无序匹配),并补上标注歧义这一维度。
  • vs Apollo [53]:审计 6 个基准、单条视觉轴,有部分人工验证。Video-Oasis 与之互补:Apollo 关注的是基准之间的冗余度,本文关注的是单条基准内部的样本是否成立。
  • vs 传统基准构建工作(Video-MME、MVBench、LongVideoBench、MLVU 等):这些工作在往上加数据、加任务、加时长,Video-Oasis 反其道做减法——用 55% 的样本量换来更高的判别力。一个直接的可操作启示是:新基准发布时若附带一份「本基准的捷径报告」,用户对其分数的信任成本会大幅降低。
  • vs 视频 RLVR 工作(Video-R1、VideoAuto-R1):Video-R1 在常规基准上是「RL 助力视频推理」的代表,但在本文协议下仅 26.3,低于其底座;VideoAuto-R1 靠 QA + 定位双奖励达到 32.7。两者的差距提示奖励的构成(是否显式奖励时序定位)比「是否引入 RL」更值得关注,这也是本文留给后续研究的一个明确开口。

评分

  • 新颖性: ⭐⭐⭐⭐ 单条探针(盲测、帧乱序)本身不算新,但「把基准审计做成可复现的三轴诊断协议 + 跨模型共识 + 人工核验 + 可用作算法实验台」这个组合在视频领域是新的,且明确拒绝了「再造一个榜单」的诱惑。
  • 实验充分度: ⭐⭐⭐⭐⭐ 14 个基准、24,416 个样本、13 个模型的横向评测,外加时序定位、oracle 上界、推理深度、SFT vs RLVR 四组消融,还做了捷径识别合法性与「非难度筛选」两项验证。
  • 写作质量: ⭐⭐⭐⭐ 判据—探针—共识—验证的逻辑链清楚,图 3 的错误标注与恢复案例很有说服力;扣分在于主榜与消融表的基线数字不一致且未说明样本范围,BoF 的关键超参被推给补充材料。
  • 价值: ⭐⭐⭐⭐⭐ 开源了完整审计流水线,任何新基准都能接入;55% 这个数字与「SFT/RLVR 各有互补优势、定位奖励更值得投入」的结论,对后续基准构建和视频模型训练都有直接的约束力。