跳转至

CulinaryCut: A Physics-aware Vision-Language-Action Benchmark for Food Cutting via Material Point Method

会议: ECCV2026
Paper: https://eccv.ecva.net/virtual/2026/poster/5439
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/10616.pdf
领域: 机器人 / 具身智能
关键词: 视觉语言动作模型、食物切割、材料点法、接触力、仿真到现实迁移

本文沿用会议清单标题;缓存 PDF 正文标题为 CulinaryCut: A Physics-Grounded Cutting Benchmark for Vision-Language-Action Models

一句话总结

CulinaryCut 用 MLS-MPM 与 ManiSkill 耦合生成带接触力记录的食物切割数据,分别暴露 VLA 的比例定位和真实切断困难,并在不改变 RDT 架构、不输入力信号的条件下,将橙子切割的 IntSim 成功率从 23% 提高到 59%。

研究背景与动机

把物体搬到指定位置,主要考验感知、语言定位与轨迹执行;把香蕉或橙子切开,还需要刀具产生足以克服材料阻力的相互作用。刀尖到达目标、姿态正确,不等于材料已经分离。切割还会改变物体形状和连通关系,下一刀不能始终沿用最初看到的几何范围。这使食物切割同时成为空间理解与接触动力学的检验场。

DROID、Open X-Embodiment 等大规模操控数据提供了语言和机器人动作,却不是为材料断裂设计的;DiSECt、TopoCut、SliceIt! 等切割研究又未同时覆盖本文需要的语言指令、多视角观测和连续机器人动作接口。真正的空白不是再做一个刀具运动演示,而是让同一次交互中的图像、动作、形变、分离和力曲线相互一致,进而判断一个策略到底是“切错地方”,还是“切对地方但没切开”。

作者选择在数据生成端引入物理,而不是另造力条件策略。已有 VLA 保持原有视觉、语言与常规观测接口,只学习物理仿真中真正可执行的示范动作。核心 idea:用物理一致的切割示范和分层评测,将比例与方向定位的几何差距、材料分离的物理差距分别显现,并检验仅改变训练数据能否改善切断能力。

方法详解

整体框架

CulinaryCut 是数据集与评测基准,不是新 VLA 网络。先通过比例、方向和连续分块任务规定切哪里,再由 IntSim 将 ManiSkill 的机器人执行与 MLS-MPM 的材料状态更新耦合起来,生成动作、观测与力记录。扩增后的数据微调 RDT、Octo、OpenVLA,最后分别检查几何泛化、仿真中的真实分离和有限规模的实机迁移。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    Input["食物场景与切割指令"] --> Task["几何任务定义"]
    Task --> Physics["IntSim 物理耦合"]
    Physics --> Data["一致轨迹与双轴扩增"]
    Data --> Policy["微调既有 VLA<br/>不输入力信号"]
    Policy --> Eval["分层评测与速度护栏"]
    Eval --> Output["几何成功 / 物理切断<br/>有限实机验证"]

关键设计

1. 几何任务定义:把语言比例落到当前物体范围

单次切割要求策略从图像识别目标大小,再把“一半”“从右侧四分之一”等表达映射到实际位置;左右方向以相机视角为准。同一个比例配上不同方向,目标位置可能不同,不能只记忆关键词对应的固定动作。连续比例任务覆盖 0.1 到 0.9,用于暴露模型是否真正学到连续的对象坐标,而非少量中心切割模板。

另一类任务要求将物体等分成指定块数。这里不仅要执行多次动作,还要随着切割后的拓扑变化重新计算后续位置。论文将块数和均匀程度作为任务目标,但其表 3 报告的是各步骤切点是否落在目标容差内的成功率,不能把这些逐步数值直接当作最终完整等分率。这个区分使“第一刀还能对准、后面迅速失败”成为可观察的现象。

2. IntSim 物理耦合:让切断依赖材料响应而不只是刀具路径

ManiSkill 负责机器人执行与视觉观测;移动最小二乘材料点法 MLS-MPM 负责大形变与拓扑变化。材料由携带位置、速度、形变梯度和标量损伤值的粒子描述,通过粒子与网格之间的信息交换推进状态。共旋转弹性、J2 塑性和标量损伤模型共同表示弹性响应、不可逆变形与材料失效,因此刀具经过某处并不会自动等价于“该处已经分离”。

食物参数来自食品工程文献,再为数值稳定性做调整。例如香蕉的杨氏模量为 \(7.0\times10^3\) Pa,苹果为 \(3.0\times10^6\) Pa,橙子为 \(5.84\times10^5\) Pa。密度、杨氏模量和泊松比分别影响质量分布、刚度及变形响应;这些不是模型输入,而是决定示范交互的仿真参数,也不应理解为对所有现实样本逐个测得的常数。

刀与砧板用有符号距离场表示。接触约束改变材料运动速度时,模拟器从工具与材料的动量交换累计反作用冲量,再按输出时间间隔得到接触力。这样得到的力曲线与动作、形变、切断结果来自同一次物理推进。主文将这些信号用于数据构建、分析和护栏相关设计,不把它们交给策略;完整本构方程、损伤更新与护栏实现指向补充材料,本次缓存未包含该部分,不能补写其具体阈值。

3. 一致轨迹与双轴扩增:扩展视觉和语言而不虚增独立交互数

流水线图以各切割风格的遥操作初始演示为起点,主文的轨迹生成由轴对齐包围盒 AABB 运动规划器承担。规划器估计物体范围,按指令的比例和方向求切点,并记录首次接触时刻;接触阶段由物理模拟更新力、形变和拓扑。物体的位置、尺度、旋转,以及切割高度和速度被用于随机化。由此,模仿目标不是与材料无关的名义直线,而是受实际仿真交互约束的动作序列。

基础数据为 15 种食物上的 21,000 条轨迹,包含香蕉、黄瓜、苹果、桃、瓜、橙、草莓、梨、猕猴桃、番茄、柠檬、葡萄、阳光玫瑰葡萄、李子和樱桃。每条轨迹在来自 ReplicaCAD、AI2-THOR 和 ProcTHOR 的 15 个室内背景中渲染,并配至少 5 种语言表达,因此 \(21{,}000\times15\times5=1{,}575{,}000\) 对应约 157 万个增强实例,而不是 157 万条独立物理示范。

语言引擎将物体、位置、比例、方向填入模板,使用“50%”“一半”“两个四分之一”等同义表达,再通过 LLM 改写扩大措辞覆盖。初始物体状态不在文字中提供,策略仍必须从图像判断当前情境。每个实例绑定语言、多视角观测、连续动作和接触力剖面,但力标注的存在不意味着训练使用了力回归损失。

4. 分层评测与速度护栏:分别检查对准、切断与可迁移性

几何评测覆盖未见随机种子下的位置与尺度、多物体干扰、保留测试指令,以及留一物体类别的跨类别迁移。主文要求几何成功同时满足四项:刀尖到达桌面的位置误差小于 0.05 m;刀刃穿过指定切割区域;接触角为 \(90^\circ\pm10^\circ\);切点距目标不超过物体尺寸的十分之一。IntSim 的物理评测还要求材料确实被切断,因此其成功率不能与纯几何结果混为同一指标。

数据级对照固定 RDT 架构与策略输入:一组从 ManiSkill 的几何合格轨迹学习,另一组从 MLS-MPM 耦合动力学中执行并筛选的 IntSim 轨迹学习。物理示范通过动作隐含地体现材料阻力所需的速度微调和持续接触,而不是让策略显式读取力、接触或损伤状态。执行时所有基线使用相同速度护栏,裁剪超过 Franka 安全范围的指令,不增加策略观测、不重规划。这个对照支持“物理一致数据有用”,但不能证明模型已经形成显式材料推理。

损失函数 / 训练策略

RDT 是扩散式动作轨迹模型,Octo 是通用机器人策略,OpenVLA 基于视觉语言骨干预测动作;三者均在 CulinaryCut 训练划分上微调。本文没有提出统一的新损失,也没有在该对照中添加力条件分支。缓存主文未列出各模型的学习率、批大小和微调步数,不能把这些缺项按常见配置补齐。

每个物体与任务配置使用 20 次未参与训练的随机试验。MLS-MPM 使用 \(120^3\) 网格、\(\Delta t=2\times10^{-5}\) s 和 6 个子步。真实力验证使用 Franka Emika Panda 对香蕉进行恒速向下切割,腕部力/力矩传感器以 60 Hz 记录竖直反作用力;这与橙子策略迁移实验是不同验证,不能合并成多材料力校准证据。

实验关键数据

主实验

下表来自主文第 4.3 节的明确数值,均为成功率。单物体列是正文用于比较的参考表现,未见物体列来自留一类别设置;不是为每一种食物分别列出的成功率。

模型 单物体参考 多物体场景 未见物体迁移
RDT 69% 31% 43%
Octo 42% 17% 34%
OpenVLA 51% 28% 26%

RDT 在多物体环境中下降 38 个百分点,说明语言明确指定目标也不能消除视觉干扰。其未见物体表现下降 26 个百分点;留一类别会同时改变几何、外观和材料,不能把差异单独归因为刚度泛化失败。

消融实验

原文表 4 固定模型为 RDT、任务为橙子切割,改变训练数据来源。实机列保留原始成功次数,避免掩盖样本规模。

训练数据来源 ManiSkill 几何评测 IntSim 物理切断评测 实机成功次数
ManiSkill 62% 23% 1/10
IntSim 68% 59% 3/10

纯几何评测只提升 6 个百分点,但物理切断提升 36 个百分点。ManiSkill 训练策略在两种评测之间相差 39 个百分点,IntSim 训练策略相差 9 个百分点,说明几何通过不能替代材料切断检查。该实验是训练数据来源消融,不是“去掉力输入”的消融,因为两组都不输入力。

下面摘取原文表 3 的四等分分析;数字是 RDT 的逐步切点成功率,并非整段任务成功率或已证实的条件概率。

物体 目标 第 1 刀 第 2 刀 第 3 刀
香蕉 四等分 10% 5% 0%
黄瓜 四等分 10% 0% 0%

关键发现

  • 方向与比例变化不是简单同义改写:RDT 从右侧 0.25 比例训练配置迁移到左侧镜像指令,成功率由 55% 降到 20%;从 0.5 比例转到 0.25 比例,由 60% 降到 25%。密集比例监督是基准设计,主文未给出其单独消融增益。
  • 力验证需先去基线:实机预接触约 25 N 来自工具负载和偏置,扣除后峰值约 12.5 N,IntSim 约 12.0 N,相对误差在 5% 内;归一化曲线主要比较时间形状,不能据此宣称所有食物均精确标定。
  • 后续刀次迅速接近零表明拓扑变化后的重新定位困难,但表中只检验切点,未把分块均匀性或连续任务最终成功单列量化。

亮点与洞察

  • 物理信息可以通过示范动作进入学习。 即便不读取接触力,策略也能模仿材料动力学约束下的动作;这为改进既有 VLA 提供了数据端路径,而不要求立即更换网络接口。
  • 评测环境会改变“成功”的含义。 同一个策略的 62% 几何成功与 23% 物理切断揭示了代理指标的盲区,可启发其他接触丰富任务同时报告轨迹正确性与对象状态变化。
  • 数量应按独立轨迹与增强实例分开报告。 视觉、语言扩增扩大观测覆盖,却没有等量增加材料交互多样性;这个统计区分有助于判断基准规模真正增加了什么。

局限与展望

  • 作者承认只覆盖 15 种食物,尚缺面包、肉类及非食物可变形对象;当前模拟也未描述黏弹性松弛和含水量变化,不能概括全部真实材料响应。
  • 真实力曲线只验证了香蕉这一代表对象,释放阶段仍有误差,可能涉及黏附、纤维撕裂和机器人控制柔顺性。下一步应进行多材料、多速度的力与分离联合验证,而不仅比较归一化峰形。
  • 橙子实机对照每组只有 10 次,3/10 仍远非可靠部署。正文未提供足以支持稳定迁移结论的统计不确定性分析,需要更大样本和重复实验。
  • 本笔记观察:正文声明每个配置 20 次试验,却未完整交代所有汇总百分比的聚合分母;缓存也不含补充材料中的实现细节,无法仅凭主文复现完整训练和材料断裂判据。
  • 视觉域差距仍存在。作者提出与 Cosmos 等视觉生成模型结合,但这属于后续方向,不能写成本文已经验证的收益;扩增数据还应明确按基础轨迹划分,便于审查增强样本之间的泄漏风险。

相关工作与启发

  • 与 ForceVLA 比较:ForceVLA 使用力信息作为策略条件;本文保持策略接口不变,将物理约束前移到数据构建。两者可能互补,但没有直接实验证明哪个更好。
  • 与 DiSECt、SliceIt!、TopoCut 比较:这些工作分别涉及可微切割、双模拟器切片或多步切割;CulinaryCut 的重点是把材料模拟、语言、多视角和连续动作组织成标准 VLA 可用的基准,而不是宣称首次实现物理切割。
  • 与 DROID、Open X-Embodiment 比较:通用操控数据覆盖面广,本文覆盖更窄但细化了接触力与拓扑变化。可迁移的研究思路是在通用策略评测中加入任务特定的物理终态,而不是只扩大图像与语言数量。

评分

  • 新颖性: 4/5。贡献在于面向 VLA 的物理一致切割基准与双重差距诊断,而非新的材料算法或策略架构。
  • 实验充分度: 3/5。覆盖三种策略、多类几何变化和数据来源消融,但真实力验证与部署规模有限。
  • 写作质量: 4/5。几何成功与物理切断的论证清晰,部分指标聚合与实现信息仍依赖补充材料。
  • 价值: 4/5。为接触丰富的可变形操控提供明确的评测问题和数据改进方向,距离可靠实机切割仍有明显差距。