EatVid-Bench: A Multimodal Fine-Grained Eating Behavior Video Dataset¶
会议: ECCV 2026
Paper: https://eccv.ecva.net/virtual/2026/poster/5037
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/8551.pdf
领域: 视频理解
关键词: 进食行为、时序定位、视频问答、可追溯标注、标注引导推理
一句话总结¶
EatVid-Bench 将 682 段真实进食视频转化为可追溯的多层行为标注和 8,184 条问答,发现 Video-LLM 的高分健康描述常与低分客观感知并存,并用 AGCoT-LoRA 在 64 帧 Hard 子集上把 Qwen2.5-VL-7B 的客观题加权分从 0.1623 提高至 0.3214。
研究背景与动机¶
识别“一个人在吃饭”与理解“这顿饭吃了多少口、何时加速、停顿与表情是否支持某种行为解释”是不同任务。Video-MME、MLVU、MVBench 等通用基准覆盖广泛活动,却难以单独诊断进食动作中的短时定位和重复事件计数;Ego4D、EPIC-Kitchens 更侧重活动、物体操作与动作语义,也不直接提供从进食事件到行为解释的完整证据链。对于可能用于饮食监测的模型,答得像专业建议不意味着看清了视频。
进食场景特别容易让这种差异被语言能力掩盖。手向嘴移动是很短的事件,却会在数分钟视频中反复出现;食物类别需要跨帧汇总,速度需要从相邻摄入事件的间隔计算,健康相关描述又要综合这些观察。只评分最后一段文字,模型可能凭“吃得慢一些、饮食要均衡”等常识获得不错分数,而不必准确识别任何一口。人工逐帧标注所有几何、动作和语义信息成本很高,纯自动生成又会把上游错误包装成看似可信的答案。
本文因而把贡献放在标注与评测的连接处:先通过专门感知工具提取可检查的信号,再量化行为,最后约束语义解释,并由这些记录生成问答。已有姿态、分割、深度和多模态模型使这种组合成为可能,但评测标签仍需人工审核。核心 idea:让问答标签和训练推理过程都能回溯到具体动作、时间戳与统计量,用客观题和开放题的分离评分检验模型是否真正依赖视频证据。
方法详解¶
整体框架¶
EatVid-Bench 是数据集与评测系统,AGCoT-LoRA 是其上的领域适配基线,不是一套全新视频编码器。输入为网络筛选或志愿录制的进食视频;管线依次完成基础感知、行为量化、可追溯语义解释,再构建分层问答,并将训练部分的标注轨迹用于监督模型输出推理细节。
数据从约 2,000 个原始会话筛出 856 个有效会话,最终统计为 682 段视频、8,184 条问答,平均每段 4.3 分钟,总时长接近 3,000 分钟。视频以单一主要参与者、可见面部及手与食物交互为筛选条件,尽可能覆盖完整进食过程。场景比例为家庭 60%、食堂或餐厅 30%、其他 10%;餐具为筷子 42%、勺子 34%、叉子 19%、手 5%。这些选择提高可标注性,但也限定了所谓“真实场景”的覆盖范围。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["真实进食视频"] --> B["基础感知"]
B --> C["行为量化"]
C --> D["可追溯语义解释"]
D --> E["分层问答与评分"]
E -->|训练部分标注| F["标注引导适配"]
E -->|评测部分| G["分项能力诊断"]
F --> G
关键设计¶
1. 基础感知:先保留可以复查的物理线索
第一层不直接要求大模型判断进食是否健康,而是提取支撑判断的原始结构。MediaPipe 提供 33 个身体三维关键点、每只手 21 个关键点和 468 个面部关键点;Grounding DINO 检测食物并给出类别,SAM 细化食物掩码,MiDaS 提供单目深度线索。食物采用 9 个粗类别及其细分类,无法可靠识别细类时回退到粗类,避免强行给出具体食物名称。
音频经 Whisper-v3 转写并与视觉流同步,管线还使用吞咽相关声学峰值。转写、峰值提取与视觉同步是不同环节,正文没有给出完整声学检测实现,不能把 Whisper 本身描述成经过验证的吞咽检测器。第一层的意义在于让后续结论有可追踪输入;它不意味着自动姿态、类别、掩码或深度天然就是可靠真值。
2. 行为量化:把重复微动作变成事件时间线和统计量
第二层根据手腕与鼻尖之间的欧氏距离随时间的变化定位摄入事件:当距离出现低于自适应阈值的局部极小值时,记录一次候选 bite,并记录时间戳和左右手。这样能够把“手靠近嘴”从泛化动作描述转成可查询的事件,但触摸面部、遮挡或异常视角仍可能引入错误;正文未给出去重时间窗和阈值参数,不应自行补全。
咀嚼频率由面部关键点所体现的下颌振荡估计,并结合音频吞咽线索;相邻 bite 的间隔分布用于计算进食节奏。按这一概念的定义,相邻时间戳的间隔可记为下式,这是笔记中的记号说明,不是论文新增的学习目标:
管线进一步用 bite 密度将会话划分为准备、活跃、高峰和休息阶段。食物检测沿时间聚合后,以各类别的时间占比计算 Shannon 熵形式的 Nutritional Diversity Index;它反映类别出现的多样性,不是摄入重量或营养素均衡。缓存中的原文式 (1) 已损坏,因此这里不重建其公式或假定对数底数。食物掩码前后变化配合深度仅给出摄入体积的粗代理量,不支持精确热量估计。
3. 可追溯语义解释:把高层描述约束到下层证据
第三层让高容量多模态模型整合第一、二层信号、动作与表情时间片段,以及来自行为心理学研究的紧凑知识库。它不是让模型无条件写一份健康报告,而是要求每条解释附带来源元数据。例如,正文用“平均 IBI 小于 15 秒”说明较快进食的证据挂接方式;这只是论文的溯源示例,不是可普遍采用的临床阈值。表情和节奏最多支持受约束的行为解释,不能凭视频确诊心理或代谢疾病。
自动标签之后还有质量控制:用于评测划分的第二、三层标注均经人工检查纠正,影响问答构建的第一层信号也进行来源审计。三位受训标注者采用双盲审核与第三人仲裁,第二、三层一致性分别为 \(\kappa=0.85\) 和 \(\kappa=0.82\);语义输出还经结构解析和 GPT-4o 二次复核。可追溯性让人能够找到错误来自何处,但并不消除感知模型和语义模型的共同偏差。
4. 分层问答与评分:将感知正确与回答流畅分开测量
模板引擎查询标注模块,将事件、统计量和类别映射为可复查的问题及答案。七个能力维度为 bite 检测、咀嚼分析、动作时间线、面部表情、饮食组成、进食节奏、行为健康;五类题型为单选 SC、判断 TF、多选 MC、填空 FB、简答 SA。L1 查询单个属性或短时动作,L2 聚合多个时间点,L3 综合跨模态、长时间证据,数量大致按 9:2:1 分布。L3 表示综合范围更大,并不保证在现有评分器下更难。
SC、TF、FB 使用精确或正则匹配,MC 对预测与真值选项集合计算 F1;SA 由 GPT-4o 按时间定位、营养信息完整性、推理有效性和流畅度四轴打 1–10 分。论文报告原始 Acc、难度加权 WAcc,并把 SA-WAcc 与 Non-SA-WAcc 分开。正文没有提供难度权重、四轴聚合和归一化的完整细节,故不能仅凭本缓存复算 WAcc,也不应把它当成普通正确率。
为检验裁判依赖,作者使用 Gemini、Claude 和人工重新评分简答,与 GPT-4o 的 Spearman 相关分别为 0.89、0.87、0.82;客观题不使用语言模型裁判。表 2 还给出随机基线 Non-SA-WAcc 22.0、纯文本 SA-WAcc 58.2,以及人工 WAcc 72.0、Non-SA-WAcc 88.0,人工锚点标为 \(n=30,k=3\)。这些锚点提醒读者语言先验确实能贡献得分,但不同锚点的完整抽样细节不能从正文恢复。
5. 标注引导适配:让监督目标包含证据推导而非只有答案
AGCoT-LoRA 基于 Qwen2.5-VL-7B,用训练部分的第一、二层结构化标注构建显式推理监督,例如先列出 bite 时间戳,再计算间隔,最后回答节奏或计数问题。相较只学习最终答案,这种目标要求输出保留从观察到结论的中间依据;LoRA 则承担参数高效的领域适配。它不是证明模型内部推理真实的机制,而是一种可用外部标注约束输出过程的训练策略。
关键对照是在相同训练数据上使用不含标注引导推理目标的普通 LoRA。这个比较能区分“接触进食领域数据”与“学习标注轨迹”两种收益,比只比较微调前后更有解释力。不过,模型写出了时间戳仍不等于时间戳必然来自视觉证据;需要结合客观题和额外证据干预验证。
损失函数 / 训练策略¶
正文明确的是 Qwen2.5-VL-7B、LoRA 和标注导出的推理监督,没有给出可复现的完整损失公式、LoRA rank、学习率、训练轮数或训练划分数量;这些信息被指向补充材料。本地缓存仅有正文和参考文献,因此不补写超参数或假定独立的定位损失。
评测默认 zero-shot,AGCoT-LoRA 及普通 LoRA 对照属于已微调模型。主评测使用统一均匀采样的 32 帧,并排除超过 5 分钟的会话;Hard 子集主表使用 64 帧。作者另述 32/64 帧与 1/2/4 FPS 密度控制,称增加密度仅带来有限改善,但对应完整数表未包含在本缓存中,不能据此断言所有模型已公平获得同等时间证据。
实验关键数据¶
主实验¶
表中保持原文的 0–1 数值尺度,均为越高越好。下表摘自原文表 3,评测规模为 \(N=6,300\)、32 帧;这不是数据集总计的 8,184 条问答,正文没有完整交代两者的对应筛选明细。
| 模型 | Acc | WAcc | SA-WAcc | Non-SA-WAcc |
|---|---|---|---|---|
| InternVL2-8B | 0.3787 | 0.6537 | 0.8462 | 0.2843 |
| Qwen2.5-VL-7B | 0.3310 | 0.6300 | 0.8323 | 0.2415 |
| VideoLLaMA2-7B | 0.3332 | 0.5530 | 0.7101 | 0.2516 |
| VideoLLaMA3-7B | 0.3868 | 0.4678 | 0.5404 | 0.3284 |
InternVL2 的 WAcc 较高,但 VideoLLaMA3 的客观题分更高,说明综合排名不能替代分项诊断。Qwen2.5-VL 的 SA-WAcc 为 0.8323,客观题却只有 0.2415;这种分离比“总体模型很强”更能体现本文的研究问题。
下表摘自原文表 4:Hard 子集 \(N=376\)、64 帧,包含微调模型。它根据一组模型初测中普遍低分的任务实例构建,不是独立随机采样的总体测试集。
| 模型 | Acc | WAcc | SA-WAcc | Non-SA-WAcc |
|---|---|---|---|---|
| Qwen3.5-35B-A3B,API | 0.4388 | 0.7359 | 0.9667 | 0.2982 |
| InternVL2-8B | 0.2606 | 0.5868 | 0.8000 | 0.1823 |
| Qwen2.5-VL-7B | 0.2500 | 0.5798 | 0.8000 | 0.1623 |
| AGCoT-LoRA,7B | 0.4069 | 0.6130 | 0.7667 | 0.3214 |
相对基座,AGCoT-LoRA 的 Acc 增加 0.1569,即 15.69 个百分点;Non-SA-WAcc 增加 0.1591,即 15.91 个百分点,但 SA-WAcc 下降 0.0333。它在此表中超过 API 模型的客观题分,却没有超过其 WAcc,不能写成全面优于大模型。
消融实验¶
以下为正文第 5.4 节报告的匹配 Hard 子集、4 FPS 条件,单位为百分比。该消融与上表 64 帧不是同一采样协议,不能把 36.4% 与 32.14% 的差异归因于推理监督。
| 配置 | Non-SA-WAcc(%) | 对照含义 |
|---|---|---|
| Qwen2.5-VL 基座 | 14.1 | 未做领域适配 |
| 普通 LoRA | 22.3 | 相同训练数据,不含标注引导推理目标 |
| AGCoT-LoRA | 36.4 | 增加标注引导推理监督 |
普通 LoRA 比基座提高 8.2 个百分点;AGCoT-LoRA 比普通 LoRA 再提高 14.1 个百分点,比基座共提高 22.3 个百分点。该对照支持显式监督轨迹具有额外价值,但并未分别消融姿态、音频、深度或知识库。
关键发现¶
- 高 SA 分不等于准确感知:完整集和 Hard 子集都出现简答与客观题表现显著分离,纯文本锚点进一步提示语言先验的影响。
- 监督收益并非各项同步增长:64 帧 Hard 中客观分提升伴随 SA 分下降,必须保留这种取舍,不能只报一个提升数字。
- 难度有输入与评测两个来源:短暂 bite 可能被稀疏采样漏掉,而流畅的 L3 回答又可能获得高分;现有结果还不能完全分离模型能力、采样覆盖和评分器偏好。
亮点与洞察¶
- 将来源记录变成监督资源。相同的事件时间线既支持审核标签,也支持训练推理目标,减少了答案正确却解释无据的空间。
- 将开放题与客观题并排展示。综合分可能奖励语言完整性,客观题则更直接暴露计数和类别错误,二者应共同决定对模型的判断。
- 以普通 LoRA 作为关键对照。领域数据本身会带来提升,只有匹配训练数据的消融才能说明标注引导监督还有额外贡献。
局限与展望¶
- 作者承认文化与饮食覆盖有限,精确热量及营养素克数估计不在范围内。行为与情绪解释不是经过临床验证的诊断结果。
- 自动感知与语义整合仍可能传播误差。人工审核和裁判相关性降低部分风险,但相关性不证明标签的临床有效性,也不能排除共享语言偏差。
- 长视频结论受到主协议约束。数据中存在超过 20 分钟的会话,但主评测排除超过 5 分钟的视频,因此正文主表不验证完整长餐程理解。
- 复现信息不完整。8,184 条 QA 与 6,300 条主评测的映射、WAcc 权重、训练划分和超参数未充分展开;表 2 的类别占比只列六项,而分类体系含七个维度,咀嚼维度占比未单独说明。
- 后续应做证据遮蔽、时间打乱、事件级定位与跨文化验证,并报告参与者或视频来源隔离方式。此类检查比单纯提高 SA 分更能检验是否真正依赖视觉证据;本文正文没有提供这些干预的完整定量结果。
相关工作与启发¶
- 对比 OREBA、EatSense:既有进食研究关注摄入事件、动作定位或运动质量,本文扩展到与来源挂接的视频问答和行为解释;其优势是诊断链条,代价是更复杂的标注与质量控制。
- 对比 Video-MME、MLVU、MVBench:通用基准覆盖更广,EatVid-Bench 则集中考查进食细节,适合评估领域迁移,但不能代替通用能力测试。
- 对比 Ego4D、EPIC-Kitchens 与时间定位基准:本工作的特色是把事件时间线接到饮食相关问答,而不是单纯增加视频时长;可迁移的思想是让高层问答显式保留其低层证据来源。
资源以页首官方页面和 PDF 为准。正文称代码及基准发布于 GitHub、HuggingFace,但本缓存未保留具体地址,清单也未提供项目链接,因此不猜测仓库或数据集 URL。
评分¶
- 新颖性: 4/5。进食领域的可追溯问答与标注引导监督组合有价值,底层工具和 LoRA 并非新算法。
- 实验充分度: 3/5。多模型、分项指标、人工审核和普通 LoRA 对照较完整,但正文缺少部分协议细节与因果证据干预。
- 写作质量: 3/5。核心问题清楚,数据规模、题型分布和评测集之间的口径需要进一步澄清。
- 价值: 4/5。适合作为领域视频理解与证据依赖研究的诊断基准,不应直接等同于可部署的临床健康评估系统。