跳转至

Human-Level Accuracy, Non-Human Strategies: Revealing Model-Human Divergence in Video Physical Reasoning

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/fanhong-li/model-human-divergence
领域: LLM 推理 / 多模态 VLM
关键词: 物理推理, 人机对比, 视频理解, 分布评测, 具身直觉物理

一句话总结

论文针对视频自监督模型在物理推理基准上达到人类级准确率却策略存疑的问题,提出了将模型多随机种子与人类标注群体进行分布对比的评测框架,揭示出模型内部高度自洽但与人类决策显著分歧、依赖可见场景统计特征而非真实前向模拟的本质差异。

研究背景与动机

预测物体在遮挡与未观测动态下的物理演变,是人类自婴儿时期就具备的核心常识能力。认知科学将这种能力解释为一种直觉物理引擎,即面对局部观测时在大脑中运行近似的前向模拟以推演未来。近年来,以 V-JEPA2、VideoMAEv2、DINOv2 为代表的自监督视觉模型在各类物理推理基准上取得了惊人突破,其中 V-JEPA2 在接触预测等任务上甚至将与人类平均准确率的差距缩小至约 1 个百分点。然而,这种平均准确率的拉平带来了一个根本性疑问:模型究竟学会了类似人类的因果前向时间模拟,还是仅仅提取并拟合了可见画面的静态几何与统计共现模式?

传统的评测范式通常将单个模型的汇总准确率与人类平均值进行点对点比对,这种粗粒度指标极易掩盖两者的内在策略脱节。即使总体准确率完全一致,两个系统也可能在完全不同的样本子集上犯错,或者在完全相反的物理子任务上产生性能倒挂。例如,在仅凭空间结构就能判断的几何场景与需要沿长因果链进行多体碰撞推演的时序场景混合时,宏观准确率会将两者混为一谈。这种评测盲区使得研究者无法区分模型是在遵循物理法则演化还是在投机取巧。

面对这一评估困境,本文没有停留在刷榜单一准确率数值,而是转向群体统计与心理测量学视角。如果将模型的不同探测初始化视作一个模型群体,同时将数十上百名独立标注员视作人类群体,我们就能从一致性结构、不确定性熵分布以及物理特征归因等多个维度剖析系统的决策策略。核心 idea:将模型随机种子与人类标注群体构建为双边群体分布,通过三级一致性层级(κHH ≫ κMM ≫ κMH)、熵空间分解与分层物理特征指纹,系统解耦模型准确率与人类策略的分歧,证实当前模型在物理推理中严重依赖表层统计线索而非前向因果模拟。

方法详解

整体框架

本文构建的分布评测框架(Distributional Evaluation Framework)突破了“单模型输出对齐单真值”的点估计局限。系统输入包含物理评测基准 Physion 中的测试视频与对应仿真物理状态轨迹;输出则涵盖群体预测概率、三级 Cohen's \(\kappa\) 一致性、不确定性象限以及物理特征回归系数。整个流程包含三个核心分析阶段:首先是对模型多随机种子(\(K=8\))与人类群体(每个样本约 100 人)的群体表征聚合;其次是通过分半自助重采样(split-half bootstrap)计算三级一致性层级并进行熵空间不确定性分解;最后利用从物理仿真轨迹中提取的静态、动态及未观测因果特征,通过岭回归拟合构建策略指纹并执行可观测与未观测特征的层级归因。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入数据<br/>Physion 1200测试视频 + HDF5仿真轨迹"] --> B["群体表征构建<br/>冻结主干 + 8种子探测头 vs 百人人类标注"]
    B --> C["三级一致性层级与不确定性分解<br/>κHH ≫ κMM ≫ κMH 与四象限熵分析"]
    C --> D["策略指纹与层级物理归因<br/>37维指纹相似度 + 89维A/B/C物理特征归因"]
    D --> E["评测结论<br/>揭示模型依赖表层统计线索而非前向模拟"]

关键设计

1. 群体表征构建:将随机种子与标注群体转化为决策概率分布

传统评测通常训练单一探针头直接计算 Accuracy,难以度量内部方差与分歧。本文为了公平对比 V-JEPA2、VideoMAEv2 和 DINOv2(统一采用 ViT-Large 主干、~307M 参数、输入 8 帧、步长 5.75),在固定编码器表征的前提下,采用 8 组独立随机初始化的端到端注意力探测头(depth 4, 16 heads)。对测试集第 \(i\) 个样本,定义模型群体预测均值 \(p_m^{(i)} = \frac{1}{K}\sum_{k=1}^K M_{ik}\),人类群体预测均值 \(p_h^{(i)} = \frac{1}{H_i}\sum_{j=1}^{H_i} R_{ij}\),并通过阈值 0.5 获取各自的多数投票结果 \(\hat{y}_m^{(i)}\)\(\hat{y}_h^{(i)}\)。这一设计将离散的二分类结果平滑扩展为群体共识度分布,为细粒度误差一致性检验提供了统一数学空间。

2. 三级一致性层级与不确定性分解:量化人机策略不可约分歧

为了度量模型是否收敛到了人类的判断模式,本文提出三级 Cohen's \(\kappa\) 评价层级。通过 1,000 次分半自助重采样(split-half bootstrap),分别计算人类半数群体之间的一致性 \(\kappa_{HH}\)、模型半数种子之间的一致性 \(\kappa_{MM}\) 以及模型多数投票与人类多数投票之间的一致性 \(\kappa_{MH}\)。若模型真正习得了类似人类的表征,理想排序应呈现 \(\kappa_{MM} \approx \kappa_{MH} \approx \kappa_{HH}\);而若模型高度自洽但偏离人类,则会出现 \(\kappa_{HH} > \kappa_{MM} \gg \kappa_{MH}\)。进一步地,利用二元香农熵 \(H(p) = -p\log_2 p - (1-p)\log_2(1-p)\),以 \(\tau = H(0.25) \approx 0.81\text{ bits}\) 为阈值将样本切分为四个象限: - Q1(双确定,容易样本); - Q2(模型不确定、人类确定,模型盲区); - Q3(模型确定、人类不确定,过度自信分歧); - Q4(双不确定,真实歧义)。 通过计算不对称比率 \(A = |Q2| / |Q3|\),精准诊断信息访问方向:当 \(A \ll 1\) 时,表明模型并非“比人类懂更多”,而是在人类犹豫不决的复杂场景下草率地形成了过度自信的偏倚。

3. 策略指纹与层级物理归因:定位决策依据的真实来源

为了探究驱动模型与人类决策差异的物理机制,研究从 Physion 的 HDF5 仿真轨迹中系统提取物理属性,并划分为三层时间特征:Layer A(静态场景属性:质量、摩擦力、物体数量、几何外形)、Layer B(截断帧前可观测动态:速度、动能、碰撞次数)以及 Layer C(截断帧后不可观测物理结果:接触发生时间、因果链长度、预测时域)。在策略指纹刻画上,选取覆盖三层的 37 维核心物理特征,以各群体的逐样本正确性二值向量为目标训练岭回归(Ridge Regression),得到权重向量 \(\beta \in \mathbb{R}^{37}\) 作为该群体的“策略指纹”,通过计算不同模型与人类之间的余弦相似度度量策略重合度。在特征归因分析上,使用完整的 89 维特征库(19A + 47B + 23C),通过 5 折交叉验证训练回归模型拟合人机分歧度 \(|p_m - p_h|\),直接检验分歧究竟来自于截断前可观测信息还是截断后未发生物理事件。

实验关键数据

主实验

在 Physion 基准上统一采用 ViT-Large 主干、相同注意力探测头配置下,三个代表性模型与人类群体的对比如下(摘自原文 Table 1 与正文关键统计):

模型 / 群体 随机种子数 测试集准确率 (%) 训练集准确率 (%) 人机分歧率 (%) \(\kappa\) 一致性
V-JEPA2 8 73.16 ± 0.95 90.60 ± 0.56 26.4 0.484 (\(\kappa_{MH}\))
VideoMAEv2 8 67.65 ± 0.72 85.41 ± 0.47 30.0 0.397 (\(\kappa_{MH}\))
DINOv2 8 66.90 ± 0.73 91.96 ± 0.38 30.2 0.399 (\(\kappa_{MH}\))
Human ~100/样本 74.2 4.8 (人人间) 0.906 (\(\kappa_{HH}\))

注:\(\kappa_{MM}\) 经 8 种子分半计算为 0.796 [0.77, 0.82]。V-JEPA2 与人类准确率相差仅约 1.0 个百分点,但人机分歧率高达 26.4%,为人类自身分歧(4.8%)的 5.5 倍。

子场景分析与归因消融

原文 Table 2 提供了 8 个物理子场景的详细准确率对比(均值 ± 标准差,\(\Delta = \text{V-JEPA2} - \text{Human}\)),直观展现了场景结构性分歧:

物理子场景 V-JEPA2 (%) VideoMAEv2 (%) DINOv2 (%) Human (%) \(\Delta\) (V-JEPA2 vs Human)
Collision 83.8 ± 1.7 77.8 ± 2.2 70.6 ± 1.8 80.3 +3.5
Containment 80.8 ± 2.6 73.4 ± 1.9 72.2 ± 2.1 76.0 +4.8
Towers 80.3 ± 2.1 75.8 ± 1.9 72.2 ± 1.9 75.5 +4.8
Linking 75.6 ± 1.8 72.7 ± 1.4 60.7 ± 3.4 63.8 +11.8
Roll/Slide 75.9 ± 2.1 74.8 ± 2.4 74.6 ± 1.8 87.7 -11.8
Drop 69.7 ± 2.8 66.4 ± 1.0 66.2 ± 2.5 74.0 -4.3
Clothiness 60.9 ± 3.0 55.5 ± 2.6 61.1 ± 3.1 67.7 -6.8
Dominoes 58.2 ± 2.3 44.8 ± 3.6 57.5 ± 2.2 68.7 -10.5
Overall 73.2 ± 0.95 67.7 ± 0.72 66.9 ± 0.73 74.2 -1.0

在特征层级归因消融实验中,利用不同特征集合预测人机分歧度 \(|p_m - p_h|\)(5 折交叉验证): - 可观测特征(Layer A + B,共 66 维):最佳拟合模型的决定系数为负数(\(R^2 = -0.32\),AUROC = 0.63),表明截断前可见场景信息对预测人机分歧毫无有效解释力。 - 不可观测结果特征(Layer C,共 23 维):实现显著的正向预测能力(\(R^2 = 0.29\),AUROC = 0.70);而在“双方均确定但给出相反判断”的高置信度分歧子集上,AUROC 飙升至 0.85

关键发现

  • 一致性层级断层:实验证实了显著的不等式 \(\kappa_{HH} (0.906) \gg \kappa_{MM} (0.796) \gg \kappa_{MH} (0.484)\)。模型内部的一致性差距仅为 0.110,而模型与人类之间存在高达 0.312 的鸿沟(2.8 倍),表明模型学到了一套高度自洽但完全不同于人类认知规律的决策范式。
  • 策略指纹聚类与孤立:所有三种不同预训练目标的视觉模型(V-JEPA2, VideoMAEv2, DINOv2)在策略指纹的余弦相似度上高度聚类(0.60–0.75,均 \(p < 0.001\)),但没有任何一个模型与人类策略存在显著相关性(余弦相似度仅 0.27–0.34,均 \(p > 0.1\))。
  • 几何与因果动态的场景分化:模型在空间连通性、纯几何依赖的场景(如 Linking,+11.8 pp)大幅超越人类;而在涉及多体碰撞传递与重力因果链的场景(如 Dominoes,-10.5 pp;Roll/Slide,-11.8 pp)显著劣于人类。
  • 困难度倒挂与盲目自信:在人类认为极难的样本(人类正确率 <50%,均值仅 30.7%)中,V-JEPA2 获得了 50.4% 的准确率(高出 19.8 pp,接近随机猜测)。熵分析显示其不对称比率 \(A = 0.32\),Q3 象限样本数约为 Q2 的 3 倍,说明模型经常在人类把握不准的边界模糊样本上产生盲目的高置信度预测。

亮点与洞察

  • 从点估计到群体分布的范式跃迁:引入心理测量学与群体评估工具,证明单次微调/测试所获得的平均准确率是极具欺骗性的,揭开了人机性能接近表面下“同分不同解”的本质。
  • 精巧的时序分层特征归因设计:将仿真状态解耦为截断前可观测特征与截断后不可观测因果特征,通过 \(R^2\) 负值与正值的剧烈对比,以数据驱动方式间接锁定了模型缺乏前向时间模拟能力的核心症结。
  • 跨架构统一协议消除混淆因子:在完全控制参数量(统一 ViT-L)、采样帧率及下游探测器结构的严苛设置下,证实非人策略并非某单一模型的偶发缺陷,而是当前自监督视频表征的共有特征。

局限与展望

  • 基准依赖与标注成本:该评测框架严重依赖每个样本具有百人规模的人类投票分布,在大规模真实世界开放场景下复现和扩展面临高昂的数据采集成本。
  • 因果归因的相关性限制:Layer C 特征与任务最终标签天然存在构造相关性,目前的回归归因仅能提供关联性证据,尚未结合干预实验完全隔离因果机制。
  • 评测范围局限于冻结表征探测:实验聚焦于冻结特征加浅层线性/注意力探针协议,未涵盖 10B+ 参数级的全量微调大模型、视觉生成扩散模型或显式结合物理仿真引擎的神经符号系统,未来的研究需探索生成式前向展开是否能真正弥补这一人机鸿沟。

相关工作与启发

  • vs. Physion 原基准工作 (Bear et al., 2021): Physion 原生使用 aggregate accuracy 进行简单的人机胜负比较;本文复用了其全量百人标注矩阵与仿真 HDF5 物理量,但从分布一致性(\(\kappa_{MH}\))、熵不确定性分解与策略指纹三个全新维度彻底重构了对该基准的认知。
  • vs. 视觉模型误差一致性研究 (Geirhos et al., 2020): Geirhos 等人在静态图像分类中提倡错误一致性(Cohen's \(\kappa\) 与 error overlap);本文将其开拓性地迁移并定制至动态物理推理领域,并结合物理引擎轨迹设计了时序多层特征归因。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ [首次将群体分布评估与时序物理特征归因引入视频物理推理,打破准确率幻觉]
  • 实验充分度: ⭐⭐⭐⭐⭐ [1200个视频、8种子、百人标注矩阵、3种主流ViT-L统一对比,数据论证极其扎实]
  • 写作质量: ⭐⭐⭐⭐⭐ [论证逻辑环环相扣,从表层现象到结构性差异再到深层归因,概念与图表表达极其清晰]
  • 价值: ⭐⭐⭐⭐⭐ [对具身智能、自监督视频模型演进与物理评测基准设计具有重要的诊断与指导价值]