KineBench: Benchmarking Embodied World Models via IDM-Free Kinematic Grounding¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/minecraft-zzz/KineBench
领域: 机器人/具身智能
关键词: 具身世界模型、闭环评测、运动学接地、可操作度、复杂度缩放
一句话总结¶
KineBench 提出一套不依赖逆动力学模型(IDM)的具身世界模型闭环评测基准:用「实例分割 → 单目度量深度 → CAD 约束 6D 位姿跟踪」的显式运动学接地管线,把生成视频直接还原成机器人末端位姿并注入 ManiSkill3 仿真执行,再以 SPARC 轨迹平滑度与 Maruyama 可操作度两项经典机器人指标给出机器人视角的诊断信号,在 20 个操作任务的四套件上评测了 7 个前沿视频模型。
研究背景与动机¶
把视频生成模型当作具身世界模型(Embodied World Model, EWM)已经成为具身智能的一条主线:这些在互联网规模数据上训练的视频基础模型展现出很强的时空预测能力,于是被当成物理智能的预测先验——既可以做视觉-语言-动作模型的预训练骨干,也可以做基于模型的规划器,为下游任务执行提供预测 rollout。但这条路线暴露出一个评测短板:我们真正需要知道的是「这些视频模型生成的动作能不能被执行、物理上是否成立」,而不是「画面好不好看」。
现有评测大多答不了这个问题。早期视频生成基准(VBench、FVD/PSNR 一类)衡量的是像素级保真度与时空一致性;近期面向具身的基准比如 EWMBench、RBench 往前走了一步,用视觉模型或大型视觉语言模型去评场景一致性、动作完整性与语义对齐,但仍然是开环、像素空间的打分,无法验证物理可行性;另有一类工作用物理常识提示集去测「重力/碰撞是否合理」,测出来的依旧是视觉上的合理性,而非真实的物理可行性。少数框架(World-in-World、WoW-World-Eval)尝试把生成序列送进物理仿真器做闭环执行,并已经证明「视觉质量与任务成功率并不可靠相关」——这条路才是对的,但它立刻撞上同一个方法论瓶颈:要从生成出来的 RGB 帧里反推出机器人动作。
几乎所有闭环框架都只能用学出来的 IDM 来完成这一步——要么是端到端的神经映射,要么是显式跟踪加拟合。问题在于,从 2D 像素空间到 3D 运动学空间的映射本身是病态、且强依赖训练分布的:IDM 会过拟合训练数据里的动作分布,一旦面对生成模型产出的新物体、新场景、新轨迹就明显退化(论文第 4.2 节的受控实验里,IDM 在未见任务上的位姿误差高达十厘米量级)。于是闭环执行失败时,没人能判断究竟是世界模型画出了物理上不可能的画面,还是 IDM 自己抽错了动作——这种归因歧义让整套闭环评测的结论都变得可疑。
本文的切入点是把动作抽取从「隐式的学习式反演」换成「显式的几何接地」。之所以现在可行,是因为分割、单目度量深度、CAD 6D 位姿跟踪这几类视觉基础模型已经足够可靠,而机械爪的 CAD 模型可以由厂商直接提供、连人工标注都省了;更关键的是,显式管线里的每一级中间输出都能被单独读取和单独消融,误差可以定位到具体环节。核心 idea:用级联视觉基础模型做显式 6D 末端位姿接地来彻底取代 IDM,把生成视频接进物理仿真器闭环执行,并用 SPARC 与 Maruyama 可操作度两项机器人中心指标补充「为什么成功/为什么失败」的运动学诊断,在 20 个任务、四套递进评测里系统探测 EWM 的能力边界。
方法详解¶
整体框架¶
KineBench 把「评测一个具身世界模型」拆成三件事:先把生成视频还原成机器人末端在 3D 空间里的真实运动,再把这串运动放进物理仿真器里真的执行一遍,最后用机器人自己的运动学指标去解释它为什么成功或失败。输入是一条语言指令加一帧初始观测:被评的 EWM 自回归生成预测视频;KineBench 用级联的视觉基础模型逐帧估计末端 6D 位姿;位姿序列被注入 ManiSkill3 执行,仿真器渲染出下一帧观测,再回灌给 EWM 进入下一轮生成。整条闭环不需要被评模型做任何改动,也不要求它暴露动作头,因此对开权重模型与闭源 API 模型一视同仁。
与既有闭环基准最大的差别在「动作从哪来」:动作不是由逆动力学模型猜出来的,而是由几何管线算出来的。管线内部的三级(掩码、度量深度、CAD 位姿)都可以被单独拿出来检查,因此它给出了一个比 IDM 更稳定、也更可诊断的评测接口。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["语言指令 + 初始观测"] --> B["具身世界模型<br/>自回归生成预测视频"]
B --> C["IDM-free 显式运动学接地<br/>实例分割 → 度量深度 → CAD 6D 位姿"]
C --> D["ManiSkill3 闭环执行<br/>位姿注入 → 渲染下一帧观测"]
D -->|闭环回灌| B
C --> E["机器人中心运动学指标<br/>SPARC 平滑度 + Maruyama 可操作度"]
D --> F["四套件评测协议<br/>S0 基础 / S1 迁移<br/>S2 视觉 OOD / S3 复杂度缩放"]
E --> F
关键设计¶
1. IDM-free 显式运动学接地:用可检查的几何管线替代学习式动作反演
这条设计针对的就是前面那个归因歧义:闭环评测里动作抽取一旦出错,就再也说不清错在世界模型还是错在抽取器。KineBench 改用三级显式几何来完成抽取。第一步用微调的 YOLOv11 从每一帧里分割出末端夹爪掩码——因为夹爪的精确 CAD 模型由厂商提供,这一步不需要任何人工标注;第二步用域内微调的 MoGeV2 生成高精度绝对度量深度图,把 2D 掩码锚定到 3D 空间;第三步把掩码、CAD 模型与深度图一并交给 FoundationPose 做 6D 位姿跟踪,其核心是 render-and-compare:在 SE(3) 空间里迭代优化位姿,最小化渲染出的 CAD 模板与生成帧之间的光度残差与几何残差,随后把位姿注入 ManiSkill3 执行并渲染下一帧。
这样做的收益有两层。第一层是可诊断性:分割、深度、位姿三个中间量都能单独读取、单独消融,误差能被明确归位——论文的消融就把管线主要的平移误差定位到了深度估计阶段,而 CAD 约束下的位姿跟踪本身相对稳定;相反,端到端 IDM 一旦失败,根本没法把误差拆成「感知错」和「动作推断错」两部分。第二层是刚体约束顺带提供的几何正则化效应:生成视频里不可避免地有高频抖动与局部非刚性形变,FoundationPose 强制 3D 刚体对齐会把这类小幅像素噪声吸收掉(论文把这个效果类比为导纳控制器式的低通滤波),但对真正的物理幻觉——夹爪凭空消失、空间上不连续的跳变——却会因为根本违反刚体力学而给出不稳定甚至不可行的位姿。需要强调的是,论文只主张这套管线「减少 IDM 特有的归因歧义」,并不宣称能给出零误差的位姿恢复:它依然依赖分割、深度恢复,以及末端在画面中足够可见。
2. 机器人中心的双指标诊断:SPARC 管「抖不抖」,Maruyama 可操作度管「够不够得着」
PSNR、FVD 这类指标只在 2D 像素域工作,画面顺滑并不意味着机器人真的能把这段动作做出来。既然 KineBench 已经把 6D 位姿显式恢复出来,评测就可以从视觉外观搬到运动学保真度上,于是它引入两项在临床与机器人领域久经验证的经典指标,分别刻画轨迹平滑度和运动学可行性。
SPARC(Spectral Arc Length)针对的是平滑度度量的老毛病:传统做法依赖位置信号的高阶时间导数,会把生成视频中细微的高频位姿噪声不成比例地放大,指标直接失效。SPARC 换到频域,定义归一化速度幅度谱的弧长:
其中 \(\hat V(\omega)\) 是归一化速度幅度谱,\(\omega_c\) 是自适应截止频率。它的物理含义很直接:遵循最小能量原理的平滑动作会把能量集中在低频,谱曲线平坦、SPARC 值接近 0;反之,如果模型生成的动作卡顿或瞬移,高频谐波增加、谱曲线变得起伏,SPARC 值显著下降。因此它测的是世界模型在时间维度上的一致性(⚠️ 缓存文本中该公式的排版已损坏,此处按 SPARC 原始定义复原,以原文为准)。
Maruyama 可操作度管的是另一件事——光平滑还不够,机器人必须始终避开奇异位形。可操作度定义为 \(w=\sqrt{\det(J(q)J^{T}(q))}\),即由雅可比矩阵决定的末端速度椭球体积:把生成视频恢复出的 6D 位姿送进逆运动学求解器,如果世界模型生成的位姿超出了机器人真实的关节与结构约束,可操作度会急剧下降,于是沿整条轨迹积分可操作度,就直接反映了世界模型对「这台机器人运动学边界」的隐式认知。
两项指标并不替代成功率,而是互补的失败模式探针:论文发现它们与执行成功率之间的相关性是任务相关、模型相关的,并不存在一条统一的分数-成功映射。这恰恰是它们作为诊断信号的价值所在——平滑度饱和之后失败往往来自语义错位,而可操作度低则指向生成随机性把机器人推向了奇异点或运动学不可达的位置。
3. 四套件递进评测协议:逐层隔离泛化轴,再做复杂度条件下的受控缩放
单个成功率数字无法区分「模型只是背下了训练轨迹」和「模型真的学到了物理因果」,所以 KineBench 在 ManiSkill3 里设计了 20 个操作任务——覆盖基础到达运动、有无障碍的刚体抓取、沿 X/Y/Z 轴的铰链与滑轨等关节物体操作、以及长程组合任务,每个任务都带高度随机的物体实例与背景纹理并划分难度等级(部分资产来自 HumanoidGen 项目)——再把它们组织成四套诊断深度递增的评测。
Suite 0 是基础执行,训练集与评测集严格同分布(IID),任务、物体实例与背景全部一致,用来量化模型在无域偏移情况下复现演示动态的底线能力。Suite 1 是任务迁移,评测对「概念相关但不重叠」任务的零样本迁移:例如在 CloseBox、OpenBoxEasy-v1、CloseLaptopEasy 上训练的模型,被拿去测 OpenBoxEasy-v2(物体朝向是新的)或更难的 CloseLaptopHard,考察的是指令理解、空间外推与物理因果推理,而不是轨迹记忆。Suite 2 是视觉 OOD 泛化,把随机资产库(物体实例与背景纹理)一分为二,训练只用其中 50%,评测全部落在另外 50% 上,从而把「视觉表征鲁棒性」与「物理推理」解耦。Suite 3 是复杂度缩放,沿用 Suite 0 的 IID 任务分布,系统改变训练数据量与算力预算(用训练时长作为算力的代理),看任务内在复杂度——自由度、接触动力学——如何改变数据与算力带来的收益。
四套件合起来的效果是:基础执行能力、迁移能力、视觉鲁棒性和缩放行为被拆成四个可以分别读出的量,而不是混在一个总分里。
损失函数 / 训练策略¶
KineBench 本身是评测框架,没有统一的训练目标,但管线里两个学习组件需要域内微调:YOLOv11 用微调版本做 2D 掩码提取;MoGeV2 采用两阶段微调,第二阶段放大细粒度几何细节上的损失权重,以获得高保真的度量深度估计;位姿跟踪则直接用 FoundationPose 零样本工作,不做额外训练。被评的 EWM 在评测前会被各自的配方微调:Wan 2.1-1.3B、Wan 2.2-5B、CogVideoX-2B 使用全参数微调,CogVideoX-5B 与 Wan 2.2-5B 另有 LoRA 变体,默认训练 7.5k 步,全部实验受限于 4 张 NVIDIA A100 的算力预算;Suite 3 的缩放实验把优化步数在 1.5k–15k 之间、专家轨迹条数在 10–50(表 1 列标)之间扫描,训练时长作为算力代理。整个「抽取-执行」流程被刻意解耦,以保证闭环评测既高效又稳定。
实验关键数据¶
主实验¶
论文用 ManiSkill3 闭环执行成功率作为主指标,覆盖基础能力(S0)、跨任务迁移(S1)与视觉 OOD 鲁棒性(S2),结果如下(数值直接取自原文表 1):
| 评测套件 | Wan2.2-5B | CogVideoX-2B | Wan2.1-1.3B | Wan2.2-5B (LoRA) | CogVideoX-5B (LoRA) | Wan2.6 (API) | Hailuo-V2 (API) |
|---|---|---|---|---|---|---|---|
| Suite 0 基础执行(IID) | 56.32 | 46.17 | 43.96 | 19.00 | 18.33 | 14.08 | 6.56 |
| Suite 1 任务迁移 | 11.90 | 57.78 | 20.00 | 16.67 | 3.81 | – | – |
| Suite 2 视觉 OOD(已见资产) | 58.00 | 56.11 | 57.19 | 25.33 | – | – | – |
| Suite 2 视觉 OOD(未见资产) | 55.50 | 51.67 | 52.83 | 26.33 | – | – | – |
| Suite 3 复杂度缩放 | – | – | 43.96 | – | – | – | – |
(表中数值为百分比,– 表示该配置未在该套件评测。⚠️ 原文表 1 的列头在 PDF 文本抽取中被打乱,上表的「列 ↔ 模型」对应是依据数值与正文陈述的一致性复原的——S0 中 Wan2.2-5B 全参微调优于其 LoRA 版本、S1 中两者关系反转、S3 行取 Wan2.1-1.3B(43.96 与 S0 同配置数值一致)——逐列对应关系请以原文表 1 为准。)
Suite 3 的受控缩放(Wan2.1-1.3B 架构,训练时长作为算力代理):
| S3 配置 | 闭环成功率 | 说明 |
|---|---|---|
| 优化步数 1.5k | 44.83 | 算力预算最小 |
| 优化步数 4.5k | 47.88 | 略有提升 |
| 优化步数 7.5k(默认) | 43.96 | 与 S0 同配置一致 |
| 优化步数 15k | 73.33 | 算力增益最明显的一档 |
| 轨迹数 scale=10(7.5k 步) | 53.67 | 训练数据最少 |
| 轨迹数 scale=25 | 52.00 | 数据变多反而略降 |
| 轨迹数 scale=50 | 51.17 | 继续下降 |
(S3 各列数值取自原文表 1 右半部分;列名按表头「steps 1.5k / 4.5k / 15k / Scale 10 / 25 / 50」的顺序对应,⚠️ 以原文为准。正文把缩放范围描述为专家轨迹 10 → 100 条、优化步数 1,500 → 15,000 步,与表头列标略有出入。)
两项机器人中心指标给出的诊断(论文图 6、图 7):SPARC 与标准化成功率的关联强烈依赖模型的生成能力——零样本与欠优化的模型上,SPARC 与成功率高度相关,能有效筛掉因运动不流畅造成的灾难性物理幻觉;而全参微调模型生成的轨迹已经足够平滑、SPARC 分数饱和,此时的失败主要来自语义错位而非局部抖动。可操作度一侧,全参微调模型表现出一致的低可操作度代价,说明它内化了这台 7-DoF 机器人的结构边界;零样本闭源模型与容量受限的 LoRA 模型则不然,它们能生成视觉上看似合理的运动,但生成随机性经常把机器人推向奇异点或运动学不可达点,因而执行失败。Manip 分数由 PyRoki 求得的轨迹代价经 10–90 分位的稳健 min-max 归一化得到,越低越好。
消融实验¶
第一组消融针对管线的动作抽取环节,在未参与 IDM 训练的仿真任务轨迹上比较三种配置(IDM 基线为 WoW-World-Eval 的 Dino3DFlowIDM,在 Suite 1 的 10 个训练任务、每任务 100 条轨迹上训练;评测从未见任务里随机抽 5 条轨迹/任务,共 35 条):
| 动作抽取配置 | 平移误差 | 旋转误差 | 说明 |
|---|---|---|---|
| FoundationPose + 仿真真值深度 | 厘米级 | 原文未单列 | 管线性能上界 |
| FoundationPose + MoGeV2 估计深度 | 约 1.5–3 cm | 约 10° | 本文实际管线 |
| Dino3DFlowIDM(旧闭环基准) | 十厘米量级 | 均值偶有更低、但长尾失败更多 | 未见任务上显著退化 |
第二组消融考察上游深度估计质量的影响:在受控视觉扰动下(夹爪形变、20%/50% 遮挡、低对比度、运动模糊、图像噪声),KineBench 管线在所有条件下都取得明显低于 IDM 的平移误差;旋转均值在个别条件下略高,但分布集中得多、长尾失败少得多。论文进一步对比了「深度估计训练充分」与「明显欠拟合」两种 MoGe 质量,重建出的位姿误差几乎一样(图 5),说明这条管线的位姿恢复对深度质量并不敏感。
关键发现¶
- 归因歧义被实测量化:在未见任务上,显式接地管线的平移误差是厘米级(约 1.5–3 cm),而 IDM 是十厘米量级——差距来自 IDM 对训练动作分布的过拟合,而不是仿真器或任务本身。这意味着依赖 IDM 的旧闭环评测在跨分布场景下很可能低估世界模型的真实能力,或把抽取器的错误记在世界模型头上。
- 规模不是万能药,且增益与任务复杂度强耦合:S0 里更大的 Wan2.2-5B 明显强于小模型(56.32 vs CogVideoX-2B 的 46.17、Wan2.1-1.3B 的 43.96),但接触密集任务(StackCube、PickFruits)上所有模型都大幅掉点,说明视频模型学到的是运动学先验,摩擦与碰撞动力学仍是未解难题。
- 全参微调与 LoRA 是「专精 vs 可迁移」的权衡:S0 上全参微调优于 LoRA(56.32 vs 19.00),但 S1 上关系反转(11.90 vs 16.67)。一个可能的解释是 LoRA 保留了更多预训练的视觉与运动先验,而全参微调更强烈地特化到训练任务上——论文明确把这个解释当作假设而非因果结论。
- 视觉 OOD 下模型依赖的是外观特征而非 3D 可供性:简单任务(如 CloseBox)在未见资产上还比较稳,但需要精确定位可供性的任务明显退化,例如 Wan 2.2 在 OpenBoxHard 上从 60.0% 掉到 30.0%(任务级数字,来自正文)。
- 缩放曲线非线性且依任务而异:优化步数在 1.5k→4.5k→7.5k→15k 上给出 44.83 / 47.88 / 43.96 / 73.33,整体是非单调的;而轨迹数从 10 增到 50 时成功率反而从 53.67 降到 51.17。任务级更极端:较简单的 OpenBoxEasy 把同质训练轨迹从 10 条增到 100 条,成功率从 100% 掉到 83.33%(过专精风险);较复杂的 StoreCube-v2 增加优化预算则从 13.34% 升到 69.52%。数据与算力的边际收益取决于任务复杂度与轨迹多样性。
亮点与洞察¶
- 把「动作抽取」这个隐藏的混淆因子摊到台面上,并用实验量化它。多数闭环基准把 IDM 当作无害的工程细节,KineBench 指出它才是归因歧义的最大来源,并在未见任务上测出十厘米 vs 厘米级的差距。这种「先证明旧评测接口不可靠、再换掉它」的论证方式,对任何以模型为组件的评测流水线都有参考价值。
- 用 CAD 与刚体约束换取免标注与抗噪。因为夹爪 CAD 由厂商提供,掩码标注成本归零;而 render-and-compare 的刚体假设天然充当低通滤波,吸收像素级抖动却对真正的物理幻觉敏感——一个约束同时解决了两件事,是很经济的建模选择。
- 把临床/机器人学的经典指标引入生成模型评测。SPARC 与可操作度原本用于评估人类运动康复和机械臂构型质量,KineBench 把它们搬到生成视频上,等于给「生成的动作是否像机器人真能做出来的动作」提供了两个可解释、可复算的坐标轴;这种「借用成熟领域指标」的思路可以迁移到任何需要物理可行性的生成评测(例如把能量守恒或接触冲量约束做成指标)。
- 可复用 trick:把中间量显式化以便消融。即便整体仍是级联学习模块,只要中间输出可读,就能做「换真值深度」这类干净的消融,从而回答「误差出在哪一级」。任何用学习模型做评测接口的工作都可以照搬。
局限与展望¶
- 论文自己承认:基准中的专家轨迹由运动规划生成,动作分布偏窄,未来会引入人类遥操作数据来丰富分布;同时 3D 运动学指标只覆盖低层物理一致性,后续计划与现有 2D 像素指标结合,做更整体的诊断。
- 管线仍有残余误差,且论文没有回避:位姿恢复依赖分割、深度与末端可见性,旋转误差约 10°,对精密操作而言这个量级并不小;因此作者把定位限定为「减少 IDM 特有的归因歧义」而非无误差恢复。
- 我注意到的局限:缩放实验只在 Wan 2.1-1.3B 一个架构上做,样本量有限,「复杂度条件下的非线性缩放」这一结论外推时需要谨慎;
scale的确切含义(轨迹条数还是数据规模倍数)在表头与正文之间不完全一致,建议后续版本明确;闭源 API 模型只在 Suite 0 出现,无法参与迁移与 OOD 的诊断;单一仿真器(ManiSkill3)与单一 7-DoF 机械臂,跨仿真器、跨本体的泛化未验证;可操作度还依赖逆运动学求解器的实现(PyRoki)与归一化方式。 - 改进方向:把深度估计换成对遮挡更鲁棒的方案(或引入多视角)以压低旋转误差;把 IDM 与显式接地做互补融合(当末端被完全遮挡时退回 IDM,并显式报告不确定性);在多个架构与本体上重做缩放实验,检验缩放结论是否与架构无关。
相关工作与启发¶
- vs World-in-World / WoW-World-Eval(基于 IDM 的闭环基准): 他们同样把生成序列送进仿真器闭环执行,但动作必须由 IDM 抽取(WoW-World-Eval 还提出用 IDM 做图灵测试);本文完全去掉 IDM 依赖,用显式几何接地取代隐式反演,并给出实验证明在未见任务上 IDM 的位姿误差高出一个数量级。优势是接口更稳、更可诊断;代价是管线对分割/深度质量有一定依赖,末端被严重遮挡时仍会失效。
- vs EWMBench / RBench(开环视觉与 VLM 评测): 它们在像素与语义空间评场景一致性、动作完整性与语义对齐,覆盖面广、成本低,但无法验证物理可行性;KineBench 用执行成功率与运动学指标直接测「机器人能不能做出来」,两者是互补而非替代。
- vs VideoPhy 等物理常识评测: 那类工作通过提示集与多模态评审器(或扩散似然、光流代理)判断物理常识是否成立,衡量的是视觉上的合理性;KineBench 主张物理可行性只能用执行来验证。
- vs 视频生成质量基准(VBench / FVD / PSNR): 它们与任务成功率并不可靠相关,本文的主结果也再次印证了这一点。
评分¶
- 新颖性: ⭐⭐⭐⭐ 首个在闭环具身世界模型评测中彻底移除 IDM 依赖的工作,并首次把 SPARC 与 Maruyama 可操作度引入生成视频评测。
- 实验充分度: ⭐⭐⭐⭐ 7 个模型 × 20 任务 × 四套件,另有受控视觉扰动与深度质量消融;但受 4×A100 预算限制,缩放实验仅限单一架构。
- 写作质量: ⭐⭐⭐⭐ 问题定位清晰、论证链条完整,对「IDM 造成归因歧义」的批判有实验支撑;个别表格列头与正文描述存在小出入。
- 价值: ⭐⭐⭐⭐ 为具身世界模型给出了一个可执行、可诊断、可复算的评测协议,其「显式接地替代隐式反演」的思路可直接迁移到其他以模型为组件的评测管线。