PercepTax: Benchmarking Cross-Property Reasoning in Vision-Language Models¶
会议: ECCV 2026
论文: ECCV 原文
领域: LLM推理
关键词: 视觉语言模型、跨属性推理、知觉分类学、物理智能、基准测试
一句话总结¶
提出了首个评估视觉语言模型层次化知觉分类与跨属性推理能力的物理智能基准 PercepTax,覆盖材质、物理属性、可负担性与功能四大族系,揭示出前沿 VLM 在多重物理约束联合决策中存在严重落差。
研究背景与动机¶
人类在真实物理环境中执行复杂任务时,能够自然地根据环境空间结构与物体的物理本质进行多维协同推理。当身处未曾预设特定工具的场景(例如需要紧急防护但缺乏现成盾牌)时,人类会自发形成层次化的认知链路:先感知场景中的可用物体,进而在头脑中对各候选物体解构材质、刚度、尺寸与便携性等多重物理属性,最终挑选出最适配当前需求的替代物(如用坚固轻便的书本或告示牌抵御冲击)。这种从空间感知、物体识别再到多维属性交织抽象的知觉分类过程,构成了物理智能的基础。
然而,现有的视觉语言模型基准大多将物理世界理解割裂为离散单一的维度。部分工作专攻 3D 空间关系判断,另一些工作则分别评测单一属性族系(如材质分类、可负担性预测或孤立的物理常识选择)。这些评测模式回避了现实交互中至关重要的跨属性联合推理能力:模型必须同时整合材质的耐受度、形状带来的可操作性、功能设计的兼容性以及 3D 空间中的位置约束,才能形成可行的物理决策。此前尚无基准能够在一个统一且受控的测试框架下,联合标注完整的物体属性体系并量化模型的多属性协同过滤能力。
本文填补了这一空白,系统性构建了面向物理智能的知觉分类基准 PercepTax。作者规范化了四大属性族系与细粒度标签空间,在大规模合成与真实场景中建立多对多属性映射与受控问答体系。核心 idea:将物理场景认知形式化为「场景–物体–属性」的三层知觉分类体系(Perceptual Taxonomy),并构建需同时满足材质、物理属性、可负担性与功能的跨属性推理任务,以此诊断 VLM 从单属性表象识别走向复合物理决策的核心瓶颈。
方法详解¶
整体框架¶
PercepTax 围绕「场景(Scene)→ 物体(Objects)→ 属性(Properties)」的三层知觉分类体系展开设计。在场景层,利用合成环境的高精标注与真实图像的基础模型感知,提取 2D 实例分割掩码与 3D 定向包围盒(含相机坐标系下的三维坐标与偏航角);在物体层,为各实例标注类别名称与自然语言描述;在属性层,为每个物体构建涵盖四大属性族系的完整属性档案。基于这一底层结构,问答生成引擎通过 48 组参数化模板生成覆盖渐进式认知梯度的四类题目,并执行严格的唯一候选约束验证与人工质量过滤。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["多源图像采集<br/>UE5合成场景 + OpenImages真实图像"] --> B["场景与物体标注<br/>2D分割掩码 + 3D包围盒 + 文本描述"]
B --> C["属性字典与多维聚类<br/>四大族系 54 个物理属性标签"]
C --> D["模板化问答引擎<br/>48 组阶梯式认知推理模板"]
D --> E["唯一候选约束与校验<br/>过滤多义干扰 + 全局人工核验"]
E --> F["PercepTax 基准发布<br/>28,033 道阶梯式评测题目"]
关键设计¶
1. 跨属性统一字典与层次化物体画像:构建完整的物理先验映射
以往基准无法开展跨属性评测的根本原因,在于每个数据集仅针对单一属性范式进行孤立标注,导致不同属性间的交互约束无法在同一物体上闭环。PercepTax 系统化定义了 54 种细粒度物理属性,严整归纳为四大族系:涵盖 14 类材质(如纸张、金属、木材等,决定物体质地与耐久性)、10 类可负担性(如抓握、支撑、坐卧、容纳等交互动作潜能)、13 类功能(如坐具家具、储物容器、警示标牌等设计初衷)、以及 17 类物理属性(如刚性、脆性、弹性、质量、稳定性等受力反应特征)。对于数据集中收集的 3,173 种物体类别,团队先利用大模型结合上下文生成多维属性描述,再通过 HDBSCAN 与 K-Means 进行无监督聚类并辅以专业人员全面核验,赋予每个物体一套完整的属性配置文件,为跨属性复合约束推理奠定了统一的真值基础。
2. 阶梯式知觉分类任务设计:解耦视觉定位与认知推理阶段
为了精确定位模型在物理认知链条中的失效环节,PercepTax 将评测划分为由浅入深的四类任务体系:第一级为物体描述匹配(Object Description,占比 22.1%),考验模型根据自然语言线索在框选物体中识别正确目标的基础对齐能力;第二级为 3D 空间关系推理(3D Spatial Relationship,占比 19.4%),考察物体间在真实 3D 相机坐标系下的左右、上下、前后及远近相对位置;第三级为单一属性理解(Single Property Understanding,占比 1.75%),独立检验模型对特定材质、力学属性或功能的理解;第四级为核心的跨属性分类推理(Cross-Property Reasoning,占比 56.7%)。跨属性任务以目标导向的现实问题切入(例如挑选可临时替代垫脚凳的物品),要求模型在思维链路中执行联合条件过滤,同时验证刚度、承重面、稳定度和高度等复合指标。
3. 唯一候选约束与多模态自动化生成管线:保障评测无歧义
针对开放式视觉推理中极易出现的歧义与多解问题,数据引擎引入了严格的唯一候选约束机制(Unique Candidate Constraint)。在生成任一跨属性目标问题时,系统会遍历该场景中所有被标记的物体档案,执行严苛的逻辑筛选,只有当场景内恰好有且仅有一个候选物体完全满足问题所隐含的所有物理约束时,该题目才被允许保留。引擎结合轻量化 LLM 进行语义润色与语法多样性拓展,随后执行自动逻辑验真。全局人工抽检阶段剔除了约 31.7% 的错检包围盒、属性不匹配或多解题目,最终保留了 28,033 道高质量题目(其中包含 50 道高难度专家手写真实场景题目),确保评测具备极高的一致性与严谨度。
实验关键数据¶
主实验¶
评测涵盖顶尖商业专有模型(Gemini 2.5 Pro、GPT-5、Claude Sonnet 4.5)以及主流开源模型(Qwen3-VL 系列、InternVL3.5 系列、LLaVA 系列),均在开放式生成协议下输出回答,并由 LLM 验证器对照真实标签判定语义正确性。
| 模型 | 评测子集 | 空间关系 (S.R.) | 物体描述 (Obj. Desc.) | 单一属性 (Single-Prop.) | 跨属性推理 (Cross-Prop.) | 全任务平均 (All) |
|---|---|---|---|---|---|---|
| 人类上限 (Human) | 仿真集 (Sim.) | 94.81% | 99.26% | 90.37% | 94.07% | 94.63% |
| 人类上限 (Human) | 真实集 (Real) | 89.70% | 91.11% | 88.15% | 92.96% | 90.48% |
| Gemini 2.5 Pro | 仿真集 (Sim.) | 60.63% | 53.81% | 30.77% | 38.20% | 41.87% |
| Gemini 2.5 Pro | 真实集 (Real) | 74.30% | 84.70% | 55.29% | 53.00% | 57.38% |
| GPT-5 | 仿真集 (Sim.) | 54.56% | 54.24% | 25.90% | 29.92% | 34.82% |
| GPT-5 | 真实集 (Real) | 76.23% | 87.06% | 47.77% | 39.84% | 48.78% |
| Claude Sonnet 4.5 | 仿真集 (Sim.) | 46.97% | 29.24% | 16.00% | 21.64% | 26.21% |
| Claude Sonnet 4.5 | 真实集 (Real) | 69.38% | 66.67% | 43.59% | 32.95% | 42.48% |
| Qwen3-VL-32B | 仿真集 (Sim.) | 52.89% | 38.56% | 25.99% | 30.30% | 34.53% |
| Qwen3-VL-32B | 真实集 (Real) | 72.16% | 81.18% | 50.37% | 41.66% | 50.08% |
| InternVL3.5-30B-A3B | 仿真集 (Sim.) | 45.20% | 27.54% | 16.02% | 17.61% | 23.47% |
| InternVL3.5-30B-A3B | 真实集 (Real) | 76.23% | 72.16% | 37.06% | 25.57% | 37.32% |
| Qwen3-VL-8B | 真实集 (Real) | 73.23% | 77.65% | 45.04% | 39.08% | 46.54% |
| LLaVA-Next-Vicuna-7B | 真实集 (Real) | 55.89% | 7.45% | 19.77% | 9.20% | 17.91% |
消融实验¶
为了诊断跨属性推理性能暴跌是源于单属性视觉感知的失误还是多属性联合推理的缺陷,作者进行了真值属性注入(Oracle Property Analysis)与残差错误根因归因分析。
| 模型配置与测试集 | 单属性基础准确率 (SP Base) | 单属性真值注入 (SP Oracle) | 跨属性基础准确率 (CP Base) | 跨属性真值注入 (CP Oracle) | 类别语义偏差 (SB) | 约束忽略倾向 (CN) | 物理常识鸿沟 (PCG) |
|---|---|---|---|---|---|---|---|
| Gemini 2.5 Pro (Sim.) | 30.77% | 50.88% | 38.20% | 43.33% | 37.08% | 7.69% | 55.24% |
| Gemini 2.5 Pro (Real) | 55.29% | 82.05% | 53.00% | 62.56% | 21.55% | 27.99% | 49.06% |
| Qwen3-VL-32B (Sim.) | 25.99% | 29.41% | 30.30% | 33.93% | 43.10% | 12.72% | 44.18% |
| Qwen3-VL-32B (Real) | 50.37% | 74.44% | 41.66% | 47.89% | 21.74% | 28.56% | 48.44% |
关键发现¶
- 感知与推理的巨大割裂:GPT-5 在真实图像物体描述上可达 87.06%,但跨属性推理准确率断崖式跌落至 39.84%(落后自身感知表现超 47 个百分点,落后人类上限达 53.12 个百分点),表明现有 VLM 能“看清”物体却无法完成基于属性交互的物理推演。
- 物理常识鸿沟是残余错误的主要来源:在完全提供真值属性的 Oracle 条件下,单属性识别率大幅飙升(如 Gemini 2.5 Pro 达 82.05%),但跨属性推理依然严重受阻(仅达 62.56%)。残余错误中 44%–55% 归因于物理常识鸿沟(PCG,如无法根据材质名推断防水耐热能力),表明核心瓶颈深植于跨维度属性的组合逻辑与交互推理。
- 知觉分类上下文学习具备跨域迁移效能:借助基于 UE5 仿真场景建立的层次化思维范例进行少量样本提示(PercepTax ICL),GPT-5 在真实图像跨属性推理上获得了 3.76% 的净提升(39.84% → 43.60%),Gemini 2.5 Pro 提升至 54.86%,证明结构化的知觉分类认知链路有助于引导模型突破表层相关性偏差。
亮点与洞察¶
- 首创「跨属性联合推理」评测范式:突破以往基准局限于材质或可负担性单一维度的定势,将现实世界物理推演形式化为对材质、物理属性、可负担性与功能的联立约束求解。
- 严密的真值与残差错误诊断体系:通过 Oracle 真值注入与认知残差分解,精确量化出单属性感知与多属性推理各自的瓶颈权重,确证了物理常识推演与组合归纳是模型落后于人类的核心短板。
- 虚实结合的互补数据构建:依托 UE5 高精度 3D 几何光度真实性与 OpenImages 广阔的自然多样性,既保障了几何物理真值的绝对无歧义,又兼顾了真实世界多模态分布的鲁棒性评估。
局限与展望¶
- 动态物理交互与时间维度的缺失:当前评测主要基于静态单帧图像,尚未涵盖物体在外力作用下发生形变、断裂或流体交互等动态时间序列过程。
- 连续物理量与环境上下文的粗粒度建模:属性标签体系当前主要以离散化的分类概念为主,对连续承重极值、质量精确克数等数值型物理参量的覆盖仍需深化。
- 未来模型演进方向:需研发显式融入知觉分类分层先验的视觉语言模型架构,在后训练(Post-training)阶段加强基于强化学习的多约束物理推理对齐。
相关工作与启发¶
- vs PhysBench & PhysGame: 后者侧重于离散的物理常识选择或游戏视频反常识检测,缺乏对完整场景中细粒度物体多属性档案的联合建模;PercepTax 首次在同一实体上实现了材质、功能、可负担性与 3D 几何的统一标注与复合推理。
- vs Hypo3D & RoboAfford: Hypo3D 仅涉及材质与功能双属性,RoboAfford 侧重于机器人操作位姿与单一接触可负担性;PercepTax 扩展到了四大属性族系共 54 类属性,并将评测重心置于面向开放真实物理决策的跨属性条件过滤。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次系统性提出跨属性物理推理概念,构建了多层次知觉分类评测标准。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 10 款主流商业与开源模型,包含 Oracle 注入、三类错误模式解构与 ICL 迁移实验。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑结构严谨清晰,图表完备,问题定义与理论动机阐述透彻。
- 价值: ⭐⭐⭐⭐⭐ 为具身智能、场景理解与多模态物理常识推理研究提供了极具诊断价值的高质量基准。