NutriBench-Kitchen: Benchmarking Embodied AI for Nutrition Management¶
会议: ECCV 2026
论文: ECCV 官方
代码: https://github.com/V1ol1n/NutriBench-Kitchen
领域: 机器人/具身智能
关键词: 具身智能、营养管理、长视频理解、结构化记忆、食物状态追踪
一句话总结¶
提出了具身营养管理(Embodied Nutrition Management)任务基准 NutriBench-Kitchen(包含 160 个长视频和 1,500 个严格人工校验的多任务 QA 对)以及引入情景、食物状态与食谱三路解耦结构化记忆的智能体 Nutri-Vgent,显著弥补了主流多模态大模型在跨时域食材状态更新与饮食约束规划上的能力短板。
研究背景与动机¶
在真实厨房中部署的具身智能体不能仅依靠单帧画面做出决策。现实烹饪过程往往跨越数分钟乃至数十分钟,食材经历倒入、称重、切碎、混合、转移与部分消耗等一系列不可逆状态变化。当用户询问“台面上剩余的食材还能否再做一份菜”或“当前烹饪是否超出卡路里限制”时,相关食材可能早已离开摄像头视野或被封闭在容器内部。传统基于单帧或短片段的静态食物识别模型无法感知历史演化,而通用具身规划与长视频问答基准往往预先假定环境状态已知,忽视了在动态视觉流中持续推断并维护物理潜状态的核心需求。
现有关于食物理解的研究多聚焦于单图分类、卡路里估算或跨模态菜谱检索(如 Nutrition5k、Recipe1M+、FoodKG),而 EPIC-KITCHENS、Ego4D 等以第一人称视角为主的具身数据集则主要评测动作识别与时序定位,未能建立“视觉动作事件 \(\rightarrow\) 食材库存物理状态演变 \(\rightarrow\) 营养/食谱规则约束下的未来行动决策”的完整闭环。如果智能体无法将分散在时间轴上的视觉事件转化为具有持久性的食物状态记录,即便模型能准确检索到最初加入面粉的那一帧,也无法推算出经历了后续多次消耗后容器中究竟还剩余多少克。
针对这一空白,本文形式化定义了“具身营养管理”(Embodied Nutrition Management)问题,并构建了涵盖食材录入、记忆维护、食谱查询、短程规划与长程规划五大任务维度的基准 NutriBench-Kitchen。本文的核心 idea 是通过解耦的情景记忆、食物状态动态账本与食谱知识图谱(Nutri-Vgent 架构),将长视频中瞬态的视觉事件转化为具有持续物理有效性的显式状态追踪,从而支持跨长时域、带营养与食谱约束的具身决策。
方法详解¶
整体框架¶
具身营养管理要求智能体基于长视频观测序列 \(V=\{v_t\}_{t=1}^T\)、问题 \(q\)、历史对话 \(h\) 以及外部食谱/营养知识库 \(\mathcal{K}\),推断当前隐藏的厨房物理状态 \(S_t\),进而生成合规的决策回答 \(\hat{y} = \mathcal{F}(V, q, h, r; \mathcal{K})\)。为攻关该基准展示的长期时序遗忘与状态丢失难题,本文设计了专门的长视频具身智能体 Nutri-Vgent,其核心是将传统的扁平式非结构化上下文检索拆分为三层互补的结构化记忆系统:记录时序动作的 Episodic Memory、量化追踪食材物理属性的 Food Memory 以及承载领域规则的 Recipe Memory。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["长烹饪视频流输入<br/>滑动时序窗口"] --> B["多模态大模型感知事件抽取<br/>动作与交互提案"]
B --> C["时序情景记忆<br/>动作/交互/物体时空锚定"]
B --> D["持续食物状态记忆<br/>食材量化账本/动态更新"]
E["食谱与营养知识库<br/>图谱/营养约束/替换规则"] --> F["函数调用检索工具<br/>DishSpec / FoodByCalories"]
C --> G["约束感知多模态推理机<br/>统一对齐状态与规则"]
D --> G
F --> G
G --> H["合规决策与问答输出"]
关键设计¶
1. 基准评测任务与双评估机制:全周期多层次覆盖 NutriBench-Kitchen 设计了 5 大互补的任务族,涵盖具身营养管理的完整生命周期:①食材录入(Ingredient Entry, IE),评估细粒度视觉定位与多视角下的食材初始数量/热量估算;②记忆管理(Memory Management, MM),测试在经历添加、转移、消耗、丢弃等多步操作后重建当前食材剩余状态的能力;③食谱查询(Recipe Query, RQ),考察结合动态库存与营养/过敏约束的配方匹配能力;④长程规划(Long-Term Planning, LTP),检验宏观烹饪阶段的依赖关系、步骤分解与执行序理解;⑤短程规划(Short-Term Planning, STP),评测基于局部物体状态与子目标的单步行动预测。同时,基准设立了 Easy(单轮问答,提供局部视觉提示 frame_hint)与 Hard(多轮复杂交互,无提示,完全依赖端到端长视频回溯与状态追踪)两种评测制度,确保全面检验模型的视觉接地与长程记忆上限。
2. 真实与受控互补的数据构建管线:双源标注与严格校验 基准精选了 160 个长烹饪视频(总计 1,500 个手工精校 QA),巧妙融合了两类互补的数据来源:145 段来自真实第一人称数据集 HD-EPIC 的烹饪序列,提供高自然度、丰富的交互动作与复杂的视觉遮挡;15 段自录长视频则引入高精度物理称重与营养实测数据,弥补公开网络视频缺乏食材绝对克数基准真值的缺陷。标注流程中,利用先进多模态模型(Qwen3-VL-max)初筛时序片段并草拟食物实体与事件候选,再由专业标注人员逐帧纠偏、对齐时间戳,并结合拥有超 10,000 道食谱的外部知识图谱消除食材别名歧义,确保每个负样本干扰项和正解推理链条严密可查。
3. 三层解耦结构化记忆架构(Nutri-Vgent):分离瞬态感知与稳态账本
针对传统通用视频 RAG 将所有时序文本直接拼接导致上下文污染(Context Pollution)与幻觉的问题,Nutri-Vgent 将营养智能体的记忆空间显式解耦为三部分:
- Episodic Memory(情景记忆):存储带时间戳的具身观测事件流,记录“何时、何地、发生了何种动作”(如将胡萝卜切块、将牛奶倒入碗中),解释当前状态的成因;
- Food Memory(食物状态记忆):维护显式的食材物理账本(Ledger),持久化追踪每种食材的规范名称、实时剩余量(克数/毫升)、物理位置(案板/锅内/碗中)与新鲜度;任何消耗或加工动作都会触发该账本的增量更新,即便食材随后离开视野,状态数值依然锁定保留;
- Recipe Memory(食谱记忆):存储结构化食谱配方、膳食限制与食材替换规则,通过 DishSpec(查询菜谱标准配比)和 FoodByCalories(热量范围检索)两套显式函数调用(Function Calling)接口供多模态主干动态查询。三者协同使智能体在推理前先在显式账本中完成状态-规则对齐,彻底阻断长时序推断时的隐式幻觉。
损失函数 / 训练策略¶
Nutri-Vgent 基于现成预训练大视觉语言模型(LVLM,如 Qwen3-VL 系列)构建,采用零样本思维链(Zero-shot CoT)和结构化外挂检索机制,不引入额外的参数微调。在评测指标方面,选择题使用确定性解析器计算准确率(Accuracy);数值估算题(主要集中在食材录入与记忆管理)采用平均相对准确率(Mean Relative Accuracy, MRA):
其中 \(\mathcal{C} = \{0.50, 0.55, \dots, 0.95\}\) 代表一系列递增的严苛相对误差容忍阈值,\(\epsilon\) 为防止除零的平滑常数。该指标系统度量了模型在不同精度阈值下预测食材数值的综合可靠性。
实验关键数据¶
主实验¶
在 NutriBench-Kitchen 的评测中,主流商业闭源模型(Gemini 2.5 Pro、GPT-4o)以及开源顶尖视觉语言模型与本文的 Nutri-Vgent 进行了详尽对比,涵盖 5 大任务族在 Easy(E.)与 Hard(H.)两种机制下的综合得分。
| 模型 | IE (E./H.) | LTP (E./H.) | MM (E./H.) | RQ (E./H.) | STP (E./H.) | 全局均分 (Avg.) |
|---|---|---|---|---|---|---|
| Random Chance | 16.7 / 25.0 | 25.0 / 25.0 | 25.0 / 25.0 | 25.0 / 25.0 | 25.0 / 25.0 | 24.2 |
| Frequency Baseline | 12.6 / 6.2 | 28.5 / 22.4 | 5.3 / 2.1 | 29.8 / 23.5 | 34.2 / 26.8 | 19.1 |
| Human Performance | 92.5 / 88.0 | 95.0 / 91.5 | 89.0 / 84.5 | 96.0 / 92.0 | 97.5 / 94.0 | 92.0 |
| 商业闭源 LVLM | ||||||
| GPT-4o | 30.7 / 16.7 | 69.3 / 66.7 | 26.7 / 61.3 | 46.7 / 50.5 | 49.3 / 59.3 | 47.7 |
| Gemini 2.5 Pro | 46.7 / 14.7 | 95.3 / 78.0 | 47.3 / 66.7 | 65.3 / 69.3 | 64.7 / 63.3 | 61.1 |
| 开源 LVLM 基线 | ||||||
| InternVL3.5-8B-HF | 26.7 / 18.0 | 81.3 / 45.3 | 36.7 / 58.7 | 50.7 / 53.5 | 48.7 / 49.3 | 46.9 |
| GLM-4.1V-9B-Base | 38.0 / 5.3 | 90.7 / 57.3 | 34.7 / 64.0 | 58.0 / 60.4 | 50.0 / 50.0 | 50.8 |
| Qwen3-VL-4B | 32.7 / 16.7 | 93.3 / 40.0 | 44.0 / 70.7 | 70.0 / 69.3 | 60.7 / 57.3 | 55.5 |
| + Vgent (扁平RAG) | 18.0 / 15.3 | 83.6 / 34.6 | 21.5 / 14.6 | 21.7 / 27.7 | 33.3 / 17.8 | 28.8 |
| + Nutri-Vgent (本文) | 22.7 / 73.3 | 72.7 / 35.1 | 42.7 / 68.7 | 61.3 / 95.0 | 76.0 / 73.0 | 62.1 |
| Qwen3-VL-8B | 30.7 / 14.0 | 95.3 / 48.7 | 38.7 / 66.0 | 70.7 / 63.4 | 53.3 / 52.7 | 53.4 |
| + Vgent (扁平RAG) | 16.9 / 20.7 | 77.6 / 58.8 | 20.8 / 26.2 | 25.5 / 21.3 | 30.4 / 18.5 | 31.7 |
| + Nutri-Vgent (本文) | 20.0 / 73.3 | 68.0 / 53.5 | 42.0 / 69.3 | 58.0 / 94.1 | 73.3 / 71.3 | 62.3 |
消融实验¶
在 Qwen3-VL(4B 与 8B)主干上,作者系统拆解并隔离了纯视觉输入(Vis.)、仅情景记忆(Epi.)、仅食物状态记忆(Food)以及完整双记忆融合(Epi. + Food)对各任务维度的影响。
| 主干模型 | 视觉(Vis.) | 情景(Epi.) | 食物状态(Food) | IE | LTP | MM | RQ | STP | 综合均分 (Overall) |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3-VL-4B | ✓ | 24.70 | 66.65 | 57.35 | 69.65 | 59.00 | 55.5 | ||
| ✓ | 50.00 | 44.30 | 46.30 | 44.55 | 51.00 | 47.3 | |||
| ✓ | 47.35 | 57.70 | 43.00 | 26.20 | 53.00 | 45.5 | |||
| ✓ | ✓ | 48.00 | 53.90 | 55.70 | 78.15 | 74.50 | 62.1 | ||
| Qwen3-VL-8B | ✓ | 22.35 | 72.00 | 52.35 | 67.05 | 53.00 | 53.4 | ||
| ✓ | 57.00 | 53.65 | 44.30 | 50.05 | 53.70 | 51.8 | |||
| ✓ | 43.65 | 69.00 | 42.65 | 26.85 | 52.35 | 46.9 | |||
| ✓ | ✓ | 46.65 | 60.75 | 55.65 | 76.05 | 72.30 | 62.3 |
关键发现¶
- 大模型普遍患有“长程遗忘与状态盲视”:通用纯视觉 LVLM 在没有显式状态记录时,长时序表现断崖式下跌。以 Qwen2.5-VL-7B 为例,其食材录入在 Easy 模式尚有 30.7%,但在无提示的 Hard 模式骤降至 3.3%;GPT-4o 在 Easy 记忆管理上仅得 26.7%,证明仅靠庞大的参数量无法自发推演出精确的物理量累积变化。
- 通用扁平 RAG 导致严重的上下文污染:对比通用视频图检索框架 Vgent 可以发现,直接将检索文本拼接进 prompt 反而导致大幅负迁移(Qwen3-VL-4B 从 55.5% 暴跌至 28.8%),因混乱的非结构化动作片段干扰了模型的数值与逻辑判断。
- Nutri-Vgent 在 Hard 模式展现断层优势:引入解耦结构化记忆后,Nutri-Vgent 在 Hard 难度的食材录入(IE 从 14.0% 飙升至 73.3%)与食谱查询(RQ 从 63.4% 跃升至 94.1%)中取得跨越式突破,充分验证了显式维护食材物理账本的不可替代性。
亮点与洞察¶
- 解耦式显式物理账本设计:Nutri-Vgent 创新性地将时序视觉事件与物理资产状态分离,避免了传统大模型在面对“食材已不在视线内”时的幻觉和遗忘。这一设计巧妙地将复杂的长视频隐式时序推理转化为了带有时空约束的符号账本增量更新。
- 双源互补基准构建方法:将真实自然的第一人称长视频(HD-EPIC)的高多样性与实验室物理实测(精确测量食材克数与卡路里)相结合,兼顾了视觉域的开放性与数值评测的绝对真值精度。
- 具身认知范式迁移价值:不仅适用于烹饪与营养管理,该三层解耦记忆(情景历程、物理资产账本、领域先验规则)结构可无缝泛化至家庭清洁、工业装配、手术辅助等需长期跟踪部件演化的所有具身物理交互任务中。
局限与展望¶
- 简单场景存在检索过载开销:在单步、视野开阔且无需回溯历史的 Easy 任务中,强制调用知识图谱与记忆检索反而会引入微小的过纠错(Over-correction),导致个别简单场景得分略微回调。
- 物理量感知目前依赖启发式规则与离线建图:食材体积向克数的估算仍较依赖标注经验或粗粒度投影,尚未在在线环境中直接闭环接入连续流体/粉末物理仿真引擎。
- 未来方向:作者指出后续工作将探索多智能体协作场景下的分布式时空记忆共享,并进一步把用户个性化健康偏好、慢性病饮食禁忌等动态 Profile 注入记忆检索循环。
相关工作与启发¶
- vs HD-EPIC / Ego4D: 既有第一人称视频基准主要考察局部动作识别、时空定位与简单手物交互,而 NutriBench-Kitchen 首次建立了动作事件对连续食材物理状态与营养约束的长期追踪评测闭环。
- vs Nutrition5k / Recipe1M+: 传统营养与食物计算基准依赖静态图像或离线数据库,忽视了动态烹饪中不可逆的物理剪切、混合与分装过程;本文将营养理解推向具身长时序交互维度。
- vs CookBench / ET-Plan-Bench: 具身规划类基准通常假设当前物理环境各物体的状态完全已知且可直接读取,而本文逼迫模型必须从纯粹的原生连续视觉流中自主感知、更新并保持该状态。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ [首次形式化定义具身营养管理,建立多维物理状态演变基准]
- 实验充分度: ⭐⭐⭐⭐⭐ [160 个长视频、1,500 个细粒度标注 QA,全面对比主流开源/闭源模型与结构消融]
- 写作质量: ⭐⭐⭐⭐⭐ [问题表述严谨清晰,系统架构与实验逻辑一脉相承]
- 价值: ⭐⭐⭐⭐⭐ [填补具身智能在长程物理状态维护与健康决策领域的关键空白,开源了可复现基准与智能体]