PerceptionComp: A Video Benchmark for Complex Perception-Centric Reasoning¶
会议: ECCV2026
论文: ECCV 原文
领域: 视频理解 / 多模态VLM
关键词: 视频基准、感知中心推理、组合式问答、测试时推理、多模态大模型
一句话总结¶
PerceptionComp 用「多条感知子条件必须共同满足」的方式构造了 1,114 道五选一视频题(279 段高场景复杂度真实视频,100% 人工标注),使任何单一时刻或一次观看都不足以给出答案;人类在允许反复回看时可达 100%、单次观看则跌到 18.97%,而最强 MLLM(Gemini-3-Flash)只有 45.96%。
研究背景与动机¶
视频问答基准已经相当密集,但它们大致分成两族,各自漏掉了同一件事。第一族是感知型基准,如 VideoMME、Perception Test、LongVideoBench——视觉内容是真实的,但绝大多数问题看一遍视频、稍微想一想就能答对,模型之间的差距因此主要来自"记住了多少"而不是"会不会反复取证"。第二族是重逻辑的推理基准,如 VideoMathQA(数学推理)和 VSP(空间规划/迷宫),难度确实上去了,可难度来自逻辑结构本身,视觉输入往往是合成渲染或极度简化的示意图,模型答错跟"看不看得清"关系不大。长视频基准(LongVideoBench、LVBench 一路)则把压力压在上下文长度与叙事记忆上,视频越长越难,但"难"的是记住,不是回头去找证据。
于是出现了一个明显空洞:同时满足长跨度、感知中心、且必须反复取回视觉证据的基准并不存在。这件事此前没被做出来,不是没人想到,而是构造成本被低估了——要让一道题真正"无法靠单帧或语言先验蒙对",必须在出题阶段就证明两件事:答案被视频唯一确定,并且去掉任何一个子条件后答案都不再唯一。这种验证只能靠人工逐题做,自动化模板出题做不到;而此前提高难度最省事的做法是拉长视频时长,它并不触及感知难度这个正交轴。MLLM 测试时推理(test-time scaling)近两年的进展又让这件事变得值得做:既然"想得更久"已被证明能提升数学与代码推理,就需要一个能分离"想得不够"和"根本没看清"的诊断工具,否则无法判断该往感知侧还是推理侧投算力。
本文的做法是把难度直接写进构造约束里。视频层面,它不去堆时长,而是用 SAM2 实例数与光流幅度作为场景复杂度的代理量,主动挑物体多、运动剧烈、镜头频繁切换的片段,这类视频很难被一句文本描述替代;题目层面,每道题由若干感知子条件组合而成,采用合取(所有子条件指向同一目标,且任何真子集都不足以唯一定位)与顺序(后一条件依赖前一条件建立的中间实体)两种组合逻辑,解答过程被迫在多段时序证据之间来回搬运指代。核心 idea:把"必须反复感知"作为基准的硬性构造约束——视频按场景复杂度而非时长筛选,题目按合取/顺序逻辑组装并逐题人工验证答案唯一性与子条件必要性,再用单次观看人类对照实验证明捷径确实被堵死。
方法详解¶
整体框架¶
PerceptionComp 的产出是一份静态评测集,因此它的"方法"由三段管线加一套评测协议组成:视频筛选 → 子条件设计与题目组装 → 全人工标注与难度分级,产出 279 段视频上的 1,114 道五选一题;评测时只报五选一准确率(随机基线 20%),并配套三条人工基线与三组控制变量分析。
视频筛选解决"用什么素材",子条件组合解决"难在哪里",标注协议解决"答案是否可信",三者是相互约束的:如果视频不够杂乱,子条件再多也能被一次粗看糊弄过去;如果标注没有跨人复核,高难度题目极易出现歧义答案,基准本身的效度就崩了。评测协议上,有原生视频接口的模型(如 Gemini 系列)直接喂原始视频,其余模型统一采样 64 帧,部分 GPT API 因输入长度限制用 50 帧;闭源模型用思维链(CoT)提示,开源指令模型要求直接输出选项,开源 thinking 模型按 CoT 提示(temperature 0.7,最大生成长度 16,384 tokens)。此外论文额外做了三组控制变量实验(输入帧数、思考 token 预算、主动回看)来区分"视觉证据不足"与" deliberation 不足"两类失败。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["2–10 分钟真实视频<br/>城市漫步 / 商场 / 体育 / 别墅 / 综艺 / 电影 / 游戏直播"] --> B["高场景复杂度视频筛选<br/>SAM2 实例数 + 光流幅度"]
B --> C["子条件组合<br/>合取 / 顺序两种逻辑"]
C --> D["同类词五选一<br/>干扰项同属一个答案类别"]
D --> E["全人工标注与跨人复核<br/>答案唯一 + 子条件必要"]
E --> F["279 段视频 / 1,114 题<br/>+ 三级难度标注"]
F --> G["评测:五选一准确率<br/>人工基线 / MLLM / 控制变量分析"]
关键设计¶
1. 高场景复杂度视频筛选:把难度从时长轴搬到内容轴
现有感知型基准的素材常常是"单一事件 + 少量主体",论文的判断很直接:这类视频近似换成一句文本 caption 后下游表现不会明显变化,也就诊断不出感知能力。因此 PerceptionComp 明确按场景复杂度选片:覆盖城市漫步(户外)、商场购物、体育竞赛、室内住宅/别墅、综艺、电影片段、游戏直播七类来源,片段长度 2–10 分钟,并且刻意要求物体数量多、镜头切换频繁、相机运动大。复杂度不是人工拍脑袋判断的,而是用两个自动信号做代理量——SAM2 检测到的实例数(对应物体密度)与光流幅度(对应运动强度与场景变化动态,原文引用 RAFT 作为光流估计),优先保留三项指标都偏高的片段。所有视频来自真实录制而非合成渲染,其中游戏直播一类是录屏,但同样具有自然发生的杂乱动态。
这条设计与"把视频拉长"是正交的两条难度轴,也是论文反复强调的点:PerceptionComp 的多数视频并不超过 10 分钟,却比那些更长的基准更耗时(见主实验表 2),说明视频思考的难度维度不止上下文长度。
2. 子条件组合:用合取与顺序两种逻辑逼出「单帧不充分」
题目难度的来源被显式拆成"子条件本身有多难"和"子条件怎么拼起来"两部分。子条件层面,论文把感知能力分成六类并要求每道题至少调动其中若干类:语义理解(识别物体类别、形状/颜色/材质等属性、角色或交互这类高层语义关系)、空间理解(左右/前后/远近等场景布局与相对几何、以及遮挡)、时序理解(跟踪运动模式、定位事件在时间轴上的位置,例如参考事件之前/之后发生了什么)、对应(correspondence,跨镜头追踪同一实例、或做部件–整体匹配)、视觉知识(与画面强耦合的常识)与世界建模(基于当前动态做简单的近未来预测)。
组合层面有两条逻辑,它们各自对应一种"捷径"的封堵。合取组合让所有子条件指向同一个目标,构成 and 关系;关键在于论文额外验证了"任何真子集都不能唯一确定答案"——每个子条件只删掉候选集的一部分,只有全部条件同时满足才收敛到唯一解,这样模型就无法忽略查询里的某一部分还答对。顺序组合则要求子条件按序解决,后面的条件依赖前面建立的中间实体或状态:第一问先定位某个物体,第二问约束它在更晚时刻的行为,第三问再问它经历另一事件之后的关系。指代必须逐步向前搬运,形成多跳感知推理,早期读错会在后续步骤中持续传播,这也是后文失败分析里"错误集中在中段"的根源。
3. 同类词五选一:把语言先验从答案空间里挤出去
最终答案是六类感知信息之一:物体(类别名,如 car、sofa)、属性(颜色、数量、形状等)、关系(实体之间的语义/空间/社会关系)、位置(房间类型、国家或区域等地点描述)、动作(某个主体执行的动作名)、事件(视频中发生的更高层复合情形)。每道题固定为五选一,但干扰项不是随机凑的——所有选项都取自与正确答案相同的答案类别(全是颜色,或全是物体类别),并且每个选项被限制为一个单词或极短短语。
这么做的直接目的是削弱选项层面的语言线索:如果干扰项混入不同类别或长度差异明显的表述,模型可能靠"这个说法看起来更像答案"或常识搭配就选对,题目也就不再检验视频证据。指标上论文只报五选一准确率这个朴素指标,随机基线 20%;这个基线在后文单次观看人类实验(18.97%)中被实测验证——人类在不允许回看的条件下几乎只能猜,说明选项设计没有留下可见的偏置。
4. 全人工标注与跨人复核:保证「唯一解」和「每个子条件都必要」
高组合度题目最怕歧义,因此 PerceptionComp 采用 100% 人工标注:从选视频到最终标注,单题耗时 10–20 分钟。标注者的流程是先写出子条件与最终答案,再自查两件事——答案是否被视频唯一确定、每个子条件是否都真的必要;随后每道题由至少一位未参与出题的标注者独立复核,复核时再次确认存在唯一正确答案,且没有任何真子集足以唯一确定它,任一条不满足的题目会被修改或丢弃。
难度分级也由专家完成,依据是子条件数量与子条件内在难度共同决定,而不是单纯按数量排名——论文特意避免"子条件越多就越难"这种粗粒度代理。统计上(原文图 2(b))更高难度层级确实包含更多子条件,反映组合深度与长跨度感知推理要求的同步上升,但两者的对应关系并非定义式。
一个完整示例:从「玻璃立方体」到「骑车人马甲的颜色」¶
原文图 1(a) 的例子可以看清顺序组合是怎么运作的。题目要求:①先在画面中定位那家带有巨大玻璃立方体的店铺;②在这块玻璃立方体旁边的街上,有两辆颜色相同的餐车;③当镜头经过离玻璃立方体更近的那辆餐车时,一辆与餐车同色的 SUV 出现在道路右侧;④问"此刻从这辆 SUV 旁经过的骑车人,其马甲是什么颜色"。四步之间是严格的前向依赖:店铺决定街段,街段与"离玻璃立方体更近"共同锁定是哪辆餐车,餐车颜色决定 SUV 的身份,SUV 决定"此刻"是哪一帧,最后才轮到读马甲颜色。
人类被试在原文图 1(b) 中的解题轨迹也印证了这种逐步收缩:先找玻璃立方体 → 定位两辆黄色餐车 → 在路口附近找餐车 → 确定餐车与玻璃立方体的相对位置 → 在右侧找到黄色 SUV → 再找浅绿色骑车人。每一步都建立在前一步的定位结果上,任一步选错目标,后续即使推理自洽也会整体偏离真值——这正是顺序组合希望施加的压力。
实验关键数据¶
主实验¶
论文在完整 1,114 题上评测了三条人工基线与 18 个 MLLM(全文表 2)。人工侧的结论最直接:允许无限次回看并给足时间时专家达到 100.00%,普通参与者(可回看但会失去耐心)为 85.10%,而只允许看一遍、答题时不能回看的人类跌到 18.97%,接近五选一的 20% 随机线。
| 模型 | 规模 | 输入帧数 | 五选一准确率 (%) |
|---|---|---|---|
| Expert(无限次回看 + 充足时间) | - | - | 100.00 |
| Human(允许回看) | - | - | 85.10 |
| Single-view Human(不可回看) | - | - | 18.97 |
| Gemini-3-Flash [10] | - | 原生视频 | 45.96 |
| Gemini-3-Pro [10] | - | 原生视频 | 44.43 |
| Gemini-2.5-Pro [6] | - | 原生视频 | 44.34 |
| Seed2.0 Pro [3] | - | 64 | 44.34 |
| Gemini-3.1-Pro [10] | - | 原生视频 | 43.72 |
| GPT-o3 [29] | - | 50 | 43.54 |
| GPT-5.2 [28] | - | 64 | 40.75 |
| Gemini-2.5-Flash [6] | - | 原生视频 | 38.15 |
| GPT-5 [26] | - | 64 | 36.45 |
| GLM-4.5V [37] | 106B | 64 | 36.69 |
| GPT-4.1 [27] | - | 50 | 34.02 |
| Qwen3-VL [1] | 30B | 64 | 34.38 |
| Qwen3-VL [1] | 8B | 64 | 34.06 |
| Qwen3-VL-Thinking [1] | 235B | 64 | 38.20 |
| InternVL-3.5 [40] | 8B | 64 | 32.32 |
| Qwen2.5-VL [2] | 72B | 64 | 31.33 |
| GPT-4o-latest [16] | - | 50 | 32.50 |
| VideoChat-R1 [21] | 7B | 64 | 28.63 |
| Video-R1 [8] | 7B | 64 | 26.27 |
| Qwen2.5-VL [2] | 7B | 64 | 22.73 |
⚠️ 表中 Gemini-3 / 3.1、GPT-5 / 5.2、Seed2.0 Pro、GLM-4.5V 等为原文评测时的版本命名,以原文与各官方 model card 为准;本表只取表 2 的 Overall 列,原文按视频类别与难度层级的细分列在缓存文本中列序错乱,未逐列还原。另外正文 4.2/4.3 节把 Qwen3-VL-8B 写作 34.80%,而表 2 该行 Overall 为 34.06%,两处不一致,此处按表 2 的 34.06% 列出,⚠️ 以原文为准。
人类与模型的耗时对照同样说明问题:PerceptionComp 上人类平均答题时间 144 秒,是 VideoMMMU(65 秒)的 2 倍以上、Minerva(32 秒)/LongVideoBench(27 秒)/Video-Holmes(26 秒)的 5 倍以上、VideoMME(13 秒)的 10 倍以上、Perception Test(8 秒)的 18 倍,而 PerceptionComp 的视频大多并不比这些基准更长。
| 基准 | 人类平均答题时间 (s) | 本题基准单次观看人类准确率 |
|---|---|---|
| Perception Test | 8 | - |
| VideoMME | 13 | - |
| Video-Holmes | 26 | - |
| LongVideoBench | 27 | - |
| Minerva | 32 | - |
| VideoMMMU | 65 | - |
| PerceptionComp | 144 | 18.97% |
消融实验¶
论文没有可拆的模块,取而代之的是三组控制变量实验,用来把"视觉证据不够"与"想得不够"分开。三组实验都只在固定的 100 段视频(500 题)子集上做(评测预算所限),因此其绝对数值与上表全量结果不可直接比较。
| 变量 | 设置 | 模型 | 准确率变化 |
|---|---|---|---|
| 输入帧数 | 16 → 32 → 50 | GPT-o3 | 34.0 → 43.54(+9.5 点,单调上升) |
| 输入帧数 | 16 → 32 → 64 | Qwen3-VL-8B | 27.0 → 34.80(+7.8 点,单调上升) |
| 思考 token 预算 | 1,024 / 2,048 / 4,096 / 8,192 | Gemini-2.5-Flash | 单调上升(原文仅给曲线,未列数值) |
| 主动回看(LongVT 工具协议) | 固定输入 → 可选片段重看 | Qwen2.5-VL | 22.73 → 28.80(+6.07 点) |
| 主动回看(轻量 agentic 包装) | 固定输入 → 可选片段重看 | Gemini-3-Flash | 45.96 → 50.60(+4.64 点) |
| 推理式 vs 指令式 | GPT-4o → GPT-o3 | 闭源对照 | +11.04 点 |
| 推理式 vs 指令式 | Gemini-2.5-Flash → Gemini-2.5-Pro | 闭源对照 | +6.19 点 |
| 推理式 vs 指令式 | Qwen3-VL-8B → Qwen3-VL-Thinking-8B | 开源对照 | 34.06 → 33.82(下降 0.24 点) |
关键发现¶
- 感知预算和推理预算都是真瓶颈,且方向上互补。 增加输入帧数让 GPT-o3 从 34.0% 涨到 43.54%、Qwen3-VL-8B 涨 7.8 点,说明题目确实依赖"多帧、多时段"的证据聚合,而不是少数显著帧;放大思考 token 预算同样单调提升,说明题目也需要维持中间假设、避免过早收敛。两者叠加仍只有 50% 左右,离人类(可回看时 85.10%,专家 100%)很远。
- 纯语言侧变强不等于感知侧变强。 闭源上推理式模型稳定优于指令式(GPT-o3 超 GPT-4o 11.04 点,Gemini-2.5-Pro 超 Flash 6.19 点),但开源侧出现反例:Qwen3-VL-Thinking-8B(33.82%)略低于指令版 Qwen3-VL-8B(34.06%)。论文的解释是:当感知证据本身被读错或读得不充分时,更长的推理链会把错误放大而不是纠正,而 PerceptionComp 要求每一步中间结论都重新落回时序上分离的视觉证据,不确定性会在多跳链条中累积。
- 规模不是解药。 开源侧 Qwen3-VL 的 8B/30B/235B 三个尺度分别是 34.06/34.38/34.02,没有随参数量单调上升;瓶颈更像是"在杂乱场景与时间断点下稳定抽取细粒度证据"的能力,而非通用容量。
- 难度分层上出现了共同的天花板。 论文报告 Level 3(子条件更多、单条件更难)上所有模型都明显掉点,需要同时维持多个中间假设并反复回到不同时刻取证据;这一点与人工基线呼应——人类也要靠持续努力和反复验证才能做到满分。
- 强闭源模型之间的成绩挤在 40–46 的窄带里。 Gemini-3 各版本与 GPT-o3 架构/接口不同,却都落在中 40 分段,论文据此判断感知中心的长跨度视频推理上存在一个共同瓶颈,而不是某一家的工程差异。
- 失败集中在中段且多与空间理解有关。 论文把每道题按标注的子条件拆成固定步骤序列,找模型中间结论首次偏离专家轨迹的位置:失败率在第 1 步只有 5%,第 2 步升到 20%,第 3 步达到 40% 峰值,第 4 步 25%,此后回落到 10%;专家复核把其中 60% 的中段失败归因于空间子条件被违反(如三维空间关系判断错误)。典型模式是模型锚定到一个"关键词部分匹配"但违反关键空间/时间约束的对象上,后续链条自洽地跑偏。
亮点与洞察¶
- 用人类而不是模型来论证基准的有效性,是这篇最漂亮的一步。 "单次观看人类只有 18.97%"这个对照实验把"必须反复感知"从设计意图变成了可测量的性质,同时顺带验证了五选一选项没有明显先验偏置(接近 20% 随机线)。任何做诊断型基准的工作都可以复制这套论证:先证明人类在受限条件下的退化,再谈模型分数的意义。
- 把"复杂度"做成可复现的自动代理量。 用 SAM2 实例数与光流幅度筛视频,让"高场景复杂度"从主观形容词变成两个可计算、可复现的数值门槛,这对其他需要按难度采样视频/图像数据的工作(含 RL 训练数据筛选)都可直接迁移。
- "真子集不充分"这条验证规则是组合式题目防捷径的关键。 它把"每个子条件都必须被用到"从写作建议升级为可校验的构造约束,同样适用于任何多约束合成数据(工具调用轨迹、多跳 QA、agent 任务)的难度控制:只保留那些去掉任一约束后答案就不再唯一的样本。
- 反直觉的经验发现:更长的推理链可能放大感知错误。 Qwen3-VL-Thinking-8B 低于其指令版,加上失败集中在链条中段,共同指向一个可迁移的判断——在多跳感知任务上,推理预算的收益以感知步骤的正确率为前提;这类任务上"先修感知、再加 CoT"比反过来更划算。
局限与展望¶
- 规模偏小。 279 段视频 / 1,114 道题,与 MMVU(1,529 视频 / 3,000 题)、VideoMME(900 / 2,700)相比并不大。作者用"100% 人工 + 每题 10–20 分钟"解释了成本,但小规模意味着按视频类别或按难度细分后每格的样本有限,细粒度结论的统计功效会打折。
- 只有单一指标,缺少过程指标。 评测只报五选一准确率,而论文在失败分析里其实已经用了一个更有信息量的协议——把题目拆成子条件步骤、定位首次偏离专家轨迹的位置——但这个协议只出现在附录口径,未作为公开评测指标。把"分步子条件正确率"或"首错位置分布"纳入正式榜单,会比总分更能指出该往哪修。
- "真实视频"的边界需要说明。 虽然强调全部来自真实录制而非合成,但七类来源里包含游戏直播录屏与综艺片段,其视觉统计分布与机器人/AI 眼镜这类真实部署场景并不相同;摘要中"in-the-wild"的说法在这一点上略有张力。
- 难度分级缺少一致性报告。 Level 1/2/3 由专家依据子条件数量与内在难度共同判定,论文没有给出标注者间一致性(IAA)数字,也没有说明子条件内在难度如何量化,这使难度分层的可复现性弱于题目本身的"唯一解 + 必要性"校验——后者的协议写得很清楚。
- 五选一仍有残余的选项偏置风险。 干扰项同类化 + 单词化是合理的缓解,但没有做选项位置/顺序偏差分析,也没有报告模型是否在少数题目上通过"排除法"而非视频证据作答。
- 控制变量实验的边界要交代清楚。 帧数、思考 token、主动回看三组分析都只在 100 视频 / 500 题的固定子集上完成,不能与全量榜单的绝对数值直接比较;论文对子集抽样是否与全集同分布也没有展开。
- 可改进的方向:把主动回看做成正式设定并同时报告 token/帧预算,给出"同等算力下感知 vs 推理"的分配曲线;补充子条件级别的错误归因指标;以及在多语言提问下的稳定性测试(当前问题全为英文)。
相关工作与启发¶
- vs VideoMME / Perception Test / MMVU: 这几者是感知中心或学科专家型基准,视觉是真实的,但问题往往能在少数显著时刻上答对。PerceptionComp 的差异在于把"必须聚合时间上分离的多段证据"写进构造约束,并用单次观看人类 18.97% 量化了这一点——不是靠更长的视频,而是靠更密的约束。
- vs LongVideoBench / LVBench: 长视频基准把难度压在上下文长度与叙事记忆上,视频越长越难。PerceptionComp 的视频多为 2–10 分钟,难度来自场景复杂度和子条件组合这个正交轴;人类耗时对照(144 秒 vs 27 秒)说明"想得久"与"看得长"是两件事。
- vs VideoMathQA / VSP: 两者的难度主要来自逻辑结构(数学、迷宫/空间规划),视觉输入是合成或高度简化的。PerceptionComp 反过来,把视觉证据本身当作不可替代的瓶颈——这也是它能把"感知不足"与"推理不足"分开诊断的前提。
- vs Video-Holmes / VCR-Bench / MINERVA: 这些复杂视频推理基准偏重叙事、因果或人类中心推理,标注多为自动+人工混合。PerceptionComp 100% 人工,并且逐题验证"答案唯一"与"每个子条件必要",代价是规模更小、单题更贵。
- vs Video-R1 / VideoChat-R1 / LongVT 等推理与工具方法: 它们是本文评测的对象而非对手;结论是显式推理(VideoChat-R1)与主动回看(LongVT、agentic rewrap)都能带来提升,但在 PerceptionComp 上离人类仍很远,说明"会调用工具重看"还不等于"能可靠地 grounding 并组合多段证据"。
评分¶
- 新颖性: ⭐⭐⭐⭐ 基准本身不是新概念,但"子条件合取/顺序组合 + 真子集不充分验证 + 单次观看人类对照"这套构造与验证流程是实质推进,把感知中心难度做成了可校验的硬约束。
- 实验充分度: ⭐⭐⭐⭐ 覆盖闭源/开源/指令式/推理式共 18 个模型,三条人工基线加三组控制变量分析很难得;扣分在于分组分析只做了 500 题子集,且难度分级缺一致性报告。
- 写作质量: ⭐⭐⭐⭐ 动机链条清晰(两族基准各缺什么 → 构造约束 → 人类对照验证),失败分析里的中段错误分布很有说服力;表格在缓存文本中有列序混乱,部分正文与表 2 的数字不一致。
- 价值: ⭐⭐⭐⭐ 对"测试时感知扩展"这一类研究是当前少见的干净试验床:分数窄带、错误集中在感知与中段链条,能直接指导该往感知侧投算力的判断。