Benchmarking MLLMs on Mistake Recognition and Explanation in Single-Step Components of Cooking¶
会议: ECCV2026
Paper: https://eccv.ecva.net/virtual/2026/poster/5187
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/9273.pdf
代码: https://github.com/Shun-Takashige/cook-mre-benchmark
领域: 多模态VLM / 视频理解
关键词: 单步骤烹饪、指令偏离、错误解释、视觉辨别、模型评测
一句话总结¶
Cook-MRE 保持烹饪视频不变、只替换指令中的一个操作要素,以 1,289 个样本测试模型能否发现并解释偏差,发现 13 个开源 MLLM 中默认设置的最佳 Full Pass Accuracy 仅为 57.0%,会“报错”远不等于看清并说对错误。
研究背景与动机¶
程序性视频研究逐渐转向长流程、多步骤和丰富的错误类型:模型不仅要发现操作异常,还要定位跳步、顺序错误,乃至解释测量或加热是否符合要求。但复杂任务的失败未必来自长时记忆;模型可能连一个短片里“切片还是切丁”“使用的是筷子还是勺子”都没看清。把所有问题混在一个最终分数里,会掩盖更基础的视觉辨别瓶颈。
现有数据集往往在拍摄时安排真实错误,适合保留程序上下文,却需要专门采集视频,细分难度和提供解释参考还要额外标注。Cook-MRE 选择更窄的任务:操作本身可以完全正常,只要与给定指令不同,就构成指令偏离。例如视频确实在斜切牛蒡,而指令要求切丁,这既不是视频异常检测,也不是检查整道菜的步骤顺序。它要求模型同时理解指令、观察实际动作,并说明二者哪里不一致。
因此,作者利用 COM Kitchens 已有的步骤边界和文字描述,构造可控的单要素偏差,再分别检查错误存在、错误类型和实际观察。核心 idea:把“模型有没有发现不一致”与“模型是否真正看清并解释了不一致”分开测量,以受控的单步骤问题定位视觉解释能力的短板。
方法详解¶
整体框架¶
Cook-MRE 是数据集与评测协议,不是新的视频网络。构建端先做单要素样本构造,再经人工可视性审核;评测端将视频和指令交给模型进行无类型提示作答,最后用三级语义判分统计检测和解释能力。下图表示数据构建到评测的流程,不表示待测模型内部有这些模块。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
source["COM Kitchens<br/>步骤视频与原描述"] --> construct["单要素样本构造"]
construct --> review["人工可视性审核"]
review --> answer["无类型提示作答"]
answer --> judge["三级语义判分"]
judge --> report["类型与难度分析<br/>提示消融"]
模型输入是一个步骤片段及其要求执行的指令;输出是自由文本的判断、观察和理由。用于纠正的原始描述是裁判的参考答案,不作为额外提示交给待测模型。区分这两种文本很重要:合成指令规定“应该做什么”,原描述记录“视频实际做什么”。
关键设计¶
1. 单要素样本构造:用正常视频制造可归因的指令偏离
COM Kitchens 提供固定第三人称俯视视频、步骤起止帧和文字描述,源数据覆盖超过 70 个厨房环境。作者将描述理解为动作、食材、工具、位置四个要素;动作还包含切法等修饰信息。保留原描述产生正确样本,替换其中一个要素产生错误样本,因而错误类型可以唯一归因,不会把“工具和食材一起错了”混入单类型测试。
预处理先去掉液体调料、粉末调味料和混合食材等难以凭视觉可靠区分的步骤,通常限制片段在约 120 秒内,并排除文字描述只有一个操作要素的步骤。作者按每个要素类别选择约 350 个候选步骤,兼顾动作与食材多样性,减少源视频的过度重叠。这些是构建阶段的选择规模,不是最终独立视频数;同一步骤可以生成多个指令样本。
Qwen2.5-7B 读取步骤描述及周围菜谱上下文,一次替换一个要素,并调整相邻措辞使指令自然,例如替换切片动作为清洗时去掉“斜着”的修饰。目标是让错误来自视频与指令的对照,而不是让“用明显不合理的东西做菜”这样的文本自身暴露答案。由此得到的是虚拟指令偏差,并非重新拍摄的真实失败动作;低成本与现实性之间的界限必须保留。
2. 人工可视性审核:确保偏差可见且难度标签有依据
所有生成候选由一名标注者审核。审核不仅读文字,还检查实际视频帧,去掉动作被遮挡或出画、无法判定的情况;再去掉 chop 与 cut 这类实际上近义、不能证明有错的替换,并检查同一替换对在不同样本中的难度标签是否一致。这样的人工筛选是控制标签可信度的关键,但单人审核不能等同于多标注者一致性验证。
难度只在动作和食材上明确分为 easy/hard。动作 hard 包括切片与切丁、撕与折等相近操作,easy 是视觉上明显不同的动作;食材 hard 包括卷心菜与生菜等外观接近或同类食材,easy 则差异明显。工具和位置若替换得过于离谱,文本本身就会显得不合理;筛除这类语言偏置候选后,剩余范围不足以支持同样的难度二分,所以不能宣称四类都有独立验证的 easy/hard 标签。
最终有 989 个错误样本和 300 个正确样本。错误类型分别为动作 318、食材 339、工具 175、位置 157。原文另报 easy 515、hard 474,合计却覆盖全部 989 个错误,与“仅动作和食材划分难度”的说明存在口径不清;这里不推断工具与位置如何归入这两个总数。片段大多不超过 120 秒,原文明确有两个例外。
3. 无类型提示作答:防止把解释任务退化成候选答案选择
默认协议不给错误类型,也不给选项,而是询问厨师是否遵循指令,并要求观察与理由。模型必须同时考虑四个要素,既能说“不一致”,也要说明视频里真正出现的动作或对象。对斜切牛蒡的视频,仅复述“应该切丁”并不够;参考观察应与“实际在斜切”语义一致。
这也解释了所谓 correction 的边界:论文主要检查模型对实际视频内容的描述能否匹配原始步骤描述,并不验证一个新提出的补救动作在现实中是否成功。模型给出合理的烹饪常识建议,却没看出实际切法,仍应失败。把事实观察与规范要求分开,才能区分视觉错误、指令复述和真正的解释。
类型提示实验则显式指定要检查的要素,用来考察缩小关注范围后能否改善观察。不过,这不是所有样本上都等价的“降低难度”:正确样本必须对所有适用的类型提示均回答无错,最多形成四次误报机会。后续 Full Pass 变化因此同时反映聚焦收益和判断次数增加的代价,不能只归因于模型更会解释。
4. 三级语义判分:只有发现、归类、观察都正确才算解释通过
GPT-5-mini 读取模型回答和相应真值,分别用专用提示输出二值判定:\(r_i\) 表示错误存在判断正确;\(t_i\) 表示错误类型正确;\(e_i\) 表示实际观察与原始描述语义一致。后两项仅用于错误样本。裁判允许烹饪同义表达和合理的泛化,例如用 lettuce 指代 red leaf lettuce;不是逐字匹配参考答案。
令 \(\mathcal{M}\) 为错误样本集合,\(\mathcal{C}\) 为正确样本集合,\(N=1,289\)。以下公式依据正文判分定义整理;缓存中的公式排版已损坏,因此不视为对原公式字形的逐字转录,原式排版以 PDF 为准:
门控乘积意味着“类型碰巧说对但判断无错”不算 Type 通过,“判断和类型都对但把食材看错”不算 Correction 通过。Full Pass 则把正确样本也纳入,所以它不必与仅在错误样本上计算的 Correction 给出同样的模型排名。MPC F1 以错误为正类,定义为 \(2\mathrm{TP}/(2\mathrm{TP}+\mathrm{FP}+\mathrm{FN})\);Macro F1 是两个类别各自 F1 的平均值,用来暴露 989:300 不均衡下的类别偏置。
作者报告三个裁判标准各自与人工的一致率超过 94%;另一个用于事后错误分类的裁判任务一致率为 89.2%,不可混为一项可靠性结果。指令偏置表示回答由指令驱动、没有依托画面;误识别表示看了画面但认错;推理失败表示观察正确却推出错误结论;欠具体表示描述不足以完整作答,余下归入 Others。它们是回答的失败模式,不是数据集的四种操作错误类型。
损失函数 / 训练策略¶
没有新训练目标或微调。13 个开源模型均在全体 1,289 个样本上零样本评测,每段均匀采样 16 帧,使用单张 NVIDIA V100 或 A100。原文同时写“greedy decoding”和 temperature 0.1,未在本缓存中给出足以消除歧义的完整解码参数;这里保留这一复现注意点,不擅自推定采样开关。
统一 16 帧控制了输入预算,但不证明该任务已在 16 帧饱和。COM Kitchens 的许可禁止向第三方发送视频,因此待测模型本地部署,未测试闭源视频 MLLM;GPT-5-mini 的文本判分不应误写成上传视频给闭源模型测试。论文提到帧打乱消融,但数值在本缓存未包含的补充材料中,不能据此断言时间顺序无关。
实验关键数据¶
主实验¶
下表摘自原文表 2,均为默认、无类型提示设置,单位为 %。MPC F1 与 Macro F1 是检测指标,Type 与 Correction 仅统计错误样本,Full Pass 统计全体样本。
| 模型 | MPC F1 | Macro F1 | Type | Correction | Full Pass |
|---|---|---|---|---|---|
| InternVL3.5-38B | 87.6 | 76.3 | 77.9 | 50.2 | 55.5 |
| InternVL3.5-8B | 80.4 | 68.9 | 65.0 | 32.9 | 43.4 |
| InternVL3-38B | 85.9 | 75.6 | 75.6 | 49.7 | 57.0 |
| InternVL3-8B | 71.4 | 62.1 | 53.3 | 34.1 | 46.2 |
| Qwen2.5-VL-32B | 77.8 | 65.4 | 62.6 | 31.6 | 41.3 |
| Qwen2.5-VL-7B | 72.5 | 62.5 | 52.9 | 28.9 | 41.3 |
| Qwen3-VL-32B | 76.7 | 64.4 | 60.1 | 30.5 | 40.5 |
| Qwen3-VL-8B | 80.0 | 64.6 | 64.3 | 23.7 | 32.0 |
| Tarsier-34B | 75.6 | 63.6 | 55.9 | 29.1 | 39.6 |
| Tarsier-7B | 82.3 | 48.0 | 63.8 | 26.1 | 22.3 |
| ST-LLM-7B | 80.3 | 51.7 | 46.3 | 7.8 | 10.7 |
| LLaVA-Video-7B | 26.0 | 31.1 | 9.8 | 2.4 | 21.3 |
| VTimeLLM-7B | 22.4 | 30.2 | 8.7 | 1.9 | 22.7 |
最高默认 Full Pass 是 InternVL3-38B 的 57.0%,不是 InternVL3.5-38B;后者领先的是 MPC F1 和 Correction。ST-LLM 的 MPC F1 达 80.3%,但 Macro F1 只有 51.7%、Correction 只有 7.8%,说明只盯错误类 F1 会高估实用能力。F1 与准确率的分母和含义不同,其数值落差也不能解读为某个条件失败概率。
消融实验¶
同样来自表 2。箭头左侧为 Default,右侧为 Hint,Full Pass 变化为百分点;这是任务提示消融,不是移除网络模块的训练消融。
| 模型 | MPC F1:默认 → 提示 | Correction:默认 → 提示 | Full Pass:默认 → 提示 | Full Pass 变化 |
|---|---|---|---|---|
| InternVL3.5-38B | 87.6 → 87.3 | 50.2 → 57.4 | 55.5 → 62.1 | +6.6 |
| InternVL3-38B | 85.9 → 86.4 | 49.7 → 56.5 | 57.0 → 61.0 | +4.0 |
| Qwen2.5-VL-7B | 72.5 → 71.6 | 28.9 → 31.3 | 41.3 → 38.7 | -2.6 |
| Tarsier-34B | 75.6 → 81.0 | 29.1 → 40.2 | 39.6 → 36.3 | -3.3 |
| ST-LLM-7B | 80.3 → 86.8 | 7.8 → 2.6 | 10.7 → 2.0 | -8.7 |
| VTimeLLM-7B | 22.4 → 58.8 | 1.9 → 7.8 | 22.7 → 10.6 | -12.1 |
Tarsier-34B 的错误样本 Correction 增加 11.1 个百分点,整体 Full Pass 却下降 3.3 个百分点,正好说明提示下的正确样本误报不能忽略。图 6 还展示 InternVL3-38B 的两面性:提示能帮助区分切片与切丁,也会让它在本来正确使用筷子的片段中幻觉出木勺。
关键发现¶
- 规模扩展并非普遍有效:Qwen2.5-VL 两个规模的默认 Full Pass 同为 41.3%。InternVL3 从 8B 到 38B 在动作 easy/hard、食材 easy/hard 上分别提升 35.5、12.4、14.0、17.4 个百分点,这些精确差值来自正文第 5.2 节。
- InternVL 扩大语言模型时也扩大视觉编码器,而 Qwen 与 Tarsier 的比较固定视觉编码器。这支持视觉容量与收益的家族级相关性,但不是控制其他训练与架构因素后的因果证明。
- 图 5 的错误占比包含 No Error,正文却将相关百分数称为“占错误的比例”,存在分母表述冲突。因此这里只采用“指令偏置是主要失败模式”的定性结论,不把图中占比当作错误子集内比例重算或宣传。
亮点与洞察¶
- 单要素替换让答案不仅可判,还可归因。复用正常视频能够以较低成本构造食材、动作等对照,但必须保留可视性审核,不能只依赖语言模型生成负例。
- 逐级门控比单一检测分数更接近“解释是否可用”。它把会报警与能提供正确观察明确区分,适合迁移到操作教学或装配检查的分层评测。
- 正确样本不是陪衬,而是检测提示副作用的必要控制组。若只测错误样本,Tarsier-34B 在 Hint 下的 Correction 提升会掩盖整体性能退化。
局限与展望¶
- 作者明确限定为烹饪、单步骤和四类要素,不覆盖测量、时长、温度、跳步与顺序错误;固定俯视视角也不能直接代表第一人称应用。
- 合成错误保留正常视频,部分指令在实际烹饪中仍可能不常见。需要真实执行错误和其他程序性领域上的验证,才能评估外部效度。
- 标注由一人完成,裁判一致率虽高,但本缓存缺少补充材料中的细化验证信息。对同源片段生成的多个样本,也应在后续评估中考虑相关性,而不是将 1,289 个样本当作同样多的独立视频。
- 16 帧可能遗漏短暂手部动作;统一帧数保证预算一致,却未排除时间采样瓶颈。帧数扫描、关键帧覆盖和严格控制的视觉编码器实验是合理后续方向,不是本文已经完成的结论。
- 难度总数、错误分母和解码措辞有复现歧义;本缓存未包含帧打乱消融的数值。笔记不为这些缺口补造实验或参数。
相关工作与启发¶
- COM Kitchens:提供原始步骤视频与描述;Cook-MRE 在其上构造指令偏差和解释判分,不是重新采集 1,289 段真实出错视频。
- CaptainCook4D / EgoPER / EgoOops:关注多步骤程序或执行错误,适于流程与定位问题;Cook-MRE 主动去掉多步骤上下文以隔离基础视觉能力,两者互补而非替代。
- ProMQA:已有程序活动问答与解释任务;原文表 1 将其中 261 个样本归为单要素偏差,Cook-MRE 提供 989 个此类错误并增加难度分析。这个数量比较不等于在同一测试集上的性能领先。
- 后续研究启发:可将实际观察和指令核对分开生成,并单独校准无错样本的拒报能力;但这只是基于失败分析提出的方向,本文没有验证此类新方法。
评分¶
- 新颖性: 4/5。创新主要在可控的单步骤错误构造与解释评测,而非模型架构。
- 实验充分度: 4/5。覆盖 13 个模型、规模对照、类型难度与提示消融,但仍缺真实错误迁移及充分的因果控制。
- 写作质量: 3/5。任务和判分链条清楚,统计口径与解码表述的歧义降低了复现清晰度。
- 价值: 4/5。能揭示高检测 F1 背后的观察失败,适合用作细粒度程序性视频理解的诊断基准。