跳转至

EgoPHI: Estimating 3D Hand-Object Contact and Force from Egocentric Vision

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/eth-siplab/EgoPHI
项目主页: https://siplab.org/projects/EgoPHI
领域: 机器人 / 具身智能 (Robotics)
关键词: 第一人称视觉、手物交互、3D接触预测、接触力估计、物理交互推理

一句话总结

EgoPHI 是首个仅通过单张第一人称 RGB 图像与物体几何模板,联合估计双手和铰接刚体物体表面逐顶点 3D 接触区域与接触力分布的视觉模型,结合物理仿真数据生成与真机 FTIR 传感验证,将第一人称手物理解推进至物理动力学层面。

研究背景与动机

理解第一人称视角下的手物交互(Hand-Object Interaction, HOI)是建模人类与物理世界交互、实现具身智能机器人模仿学习的关键基石。近年基于单目视觉的手物交互研究在手部姿态估计、全身体表接触检测以及精细手物接触区域定位(如 DECO、HACO 等)上取得了显著进展。然而,仅靠接触几何定位根本无法完整刻画交互过程中的物理动力学——物体的稳定抓握、支撑平衡与受控操纵本质上完全由接触界面施加的物理力(接触力大小与三维方向分布)所主导。

从单目第一人称视角推断物理接触力面临着极端的技术瓶颈。由于第一人称视角下双手对物体的严重自遮挡、弱视觉线索(如轻微的皮肤泛白与微弱形变)以及单目深度歧义,使得直接在 3D 空间反解力的大小与法向极其困难。受限于真实世界密集体表测力传感数据的匮乏,过往探索要么仅停留在 2D 图像空间的压力热图推断(如 PressureVision),要么局限于平面刚性接触面(如 EgoPressure),完全无法处理日常生活中常见的非平面刚性及铰接物体交互。

面对真实力标注难以大规模采集与三维手物空间严重遮挡的核心矛盾,本文提出了一条结合物理仿真监督与图结构交互几何推理的解决路径。核心 idea:通过物理引擎构建可拓展的密集逐顶点力学仿真标注管线,并设计融合网格内拓扑与网格间跨模态交叉注意力的迭代姿态细化与力学推理网络,实现从单张第一人称图像中联合解算双手与物体的 3D 接触和力分布。

方法详解

整体框架

EgoPHI 的输入为单张第一人称 RGB 图像 \(I\)、左手和右手 3D 姿态网格顶点坐标 \(P_L, P_R \in \mathbb{R}^{V_H \times 3}\),以及物体的 CAD 模板网格 \(O_{\text{template}}\)。整体推理分为三个阶段:特征提取与跨模态投影、基于图交互模块的物体位姿迭代细化(IRM)、以及基于对齐几何的接触与 3D 力场联合解码。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["单张第一人称RGB图像 + 左右手网格 + 物体模板"] --> B["特征提取与跨模态投影<br/>ViT视觉特征采样 + 局部/相对几何嵌入"]
    B --> C["迭代位姿细化模块 (IRM)<br/>网格内GAT + 网格间Cross-Attention循环更新(R, t)"]
    C --> D["对齐坐标空间重建<br/>基于预测位姿重投影物体顶点与提取全图特征"]
    D --> E["接触力场联合推理<br/>双手与物体逐顶点接触概率 + 力大小与方向解码"]
    E --> F["输出:左右手与物体网格密集体表接触概率与3D力向量"]

在系统前序阶段,模型提取 ViT-B/16 空间特征图,将手部与初始物体网格投影至像素平面做双线性采样,结合三维坐标形成初始顶点嵌入。随后通过迭代位姿细化模块在相机坐标系下恢复被遮挡物体的刚体 6D 姿态;最后,在几何紧密对齐的三维网格上运行接触力推理模块,输出双手与物体上逐顶点的接触状态和三维力向量。

关键设计

1. 物理引擎接触力仿真与标注蒸馏:无接触传感下的密集物理监督生成 针对真实多指抓握与铰接交互中无法密集埋设微型测力阵列的痛点,本文借助 SOFA 物理仿真框架,对已有大规模铰接手物交互动作序列(ARCTIC)进行动力学重建。将手物网格视为准刚体模型,在各顶点部署虚拟软弹簧微元。当手部与物体顶点进入预设接触邻域时触发罚函数响应,生成与穿透/碰撞位移量 \(d_i\) 成正比的法向恢复力: $\(\mathbf{f}_i = -k d_i \mathbf{n}_i\)$ 其中 \(k=10\) 为刚度系数,\(\mathbf{n}_i\) 为顶点表面法向量。为消除非实际接触区域的虚假渗透干扰,仿真管线采用二值几何接触掩膜 \(M\) 对原始力分布进行逐元素硬过滤,得到物理自洽的地面真值 \(\tilde{\mathcal{F}} = M \odot \mathcal{F}\)。在网络监督中,力向量进一步解耦为模长 \(|f_i|\) 与单位方向向量 \(u_i = f_i / |f_i|\) 分别回归,显著增强了极端离群力值下的数值稳定性。

2. 图交互注意力模块:兼顾拓扑先验与跨网格空间邻接 手物接触并非孤立发生,而是网格局部流形刚性约束与网格间空间接近度共同作用的结果。为此,作者提出了专用的图交互块(Graph-Based Interaction Block),统一用于姿态更新与力场推断。模块内部包含两层核心结构: - 网格内图注意力网络(Intra-mesh GAT):严格遵循手部与物体的三角面片边拓扑传递特征,保持局部几何平滑与动力学约束传递; - 网格间交叉注意力机制(Inter-mesh Cross-Attention):让左手、右手与物体的顶点特征在无固定拓扑的全连接图上互相交互,计算顶点间的物理邻近与互斥感知。该结构替代了传统无拓扑的全连接 MLP,赋予模型在严重遮挡下利用一侧手部几何推断另一侧接触状态的能力。

3. 迭代物体姿态细化机制:闭环消除接触歧义 第一人称视角下物体被手部大面积遮挡,直接预测绝对位姿极易因像素错位导致接触面悬空或穿模,从而摧毁力学推理的前提。姿态细化模块(Iterative Refinement Module, IRM)以零平移和单位旋转为起点,循环执行 \(N=3\) 轮闭环更新。每轮循环中固定手部静态表征,根据当前估计姿态 \((R_{i-1}, t_{i-1})\) 动态采样物体 RoI 视觉特征并融合相对于双手中心的相对几何距离;经过图交互块全局均值池化后,由姿态解码器预测旋转增量 \(\Delta R_i \in \mathbb{R}^6\) 与平移增量 \(\Delta t_i \in \mathbb{R}^3\),做矩阵李代数复合: $\(R_i = \Delta R_i \cdot R_{i-1}, \quad t_i = \Delta t_i + t_{i-1}\)$ 该显式闭环使平均顶点位姿误差(MPV)大幅下降 70% 以上,为下游细粒度力学回归奠定了精确的接触几何边界。

4. 接触门控力场联合预测:物理一致性约束 在力估计阶段,网络利用对齐后的物体坐标 \((R_N, t_N)\) 重新从全分辨率 ViT 特征图上提取特征,并通过第二组独立的图交互块进行解码。输出头同时预测逐顶点接触概率 \(C\) 以及力大小与方向。由于非接触区域必然不存在接触力,网络在输出端将预测的连续力向量直接与接触概率进行元素级点乘软门控: $\(\tilde{\mathbf{f}}_i = C_i \cdot (|f_i| \mathbf{u}_i)\)$ 该门控机制有效抑制了视觉盲区中的浮空虚假力生成,确保了从视觉证据到物理接触状态的因果一致性。

损失函数 / 训练策略

联合训练损失函数由六项多任务目标加权组成: $\(\mathcal{L}_{\text{total}} = \lambda_c \mathcal{L}_{\text{contact}} + \lambda_m \mathcal{L}_{\text{force-mag}} + \lambda_v \mathcal{L}_{\text{force-vec}} + \lambda_t \mathcal{L}_{\text{trans}} + \lambda_r \mathcal{L}_{\text{rot}} + \lambda_p \mathcal{L}_{\text{verts}}\)$ 接触损失 \(\mathcal{L}_{\text{contact}}\) 结合加权二值交叉熵、顶点级类别平衡(VCB)损失、数据集级先验约束与空间平滑正则项;力模长 \(\mathcal{L}_{\text{force-mag}}\) 使用接触加权的 \(L_2\) 损失配合网格平均力正则;力方向 \(\mathcal{L}_{\text{force-vec}}\) 采用接触概率加权的归一化单位向量余弦距离;姿态损失则约束几何顶点误差、测地线旋转差和欧氏平移。训练使用 Adam 优化器,学习率 \(1 \times 10^{-4}\),批大小为 8。

实验关键数据

主实验

在 ARCTIC 测试集(同分布,评估手部与物体双侧)与 H2O 数据集(分布外零样本,评估跨数据集泛化)上对比 3D 网格接触力基准 HACO(在其公开模型及 ARCTIC 上微调的 3D 力估计版本)和 2D 图像域力估计模型 PressureVision。

数据集 模型 手部力 MAE [N] ↓ 手部力 RMSE [N] ↓ 手部力 vIoU ↑ 物体力 MAE [N] ↓ 物体接触 F1 ↑ 手部接触 F1 ↑
ARCTIC s05 HACO 6.62 7.29 1.0 不支持 不支持 0.196
ARCTIC s05 EgoPHI w/o IRM 4.80 5.94 0.7 5.01 0.038 0.057
ARCTIC s05 EgoPHI (本文) 4.03 5.06 2.2 4.42 0.060 0.190
H2O s4_ego HACO 6.37 7.13 0.7 不支持 不支持 0.198
H2O s4_ego EgoPHI w/o IRM 4.65 5.87 0.8 4.70 0.030 0.026
H2O s4_ego EgoPHI (本文) 5.16 6.62 0.6 3.88 0.037 0.097

在 2D 投影压力评估对比中,EgoPHI 在 ARCTIC 上达到 15.4% Volumetric IoU,远超专用 2D 压力估计网络 PressureVision 的 6.6%。

消融实验与真机验证

作者对核心组件 Iterative Refinement Module (IRM) 进行消融,并在自主研发的基于受全内反射(FTIR)原理的真机测试平台(包含亚克力圆柱体与立方体,8 名受试者,2000 对同步真值帧)上进行了 sim-to-real 物理验证。

评估配置 / 物体 模块设定 接触 Precision ↑ 接触 Recall ↑ 接触 IoU ↑ 力 MAE [N] ↓ 力 RMSE [N] ↓
ARCTIC (2D投影) w/o IRM 0.186 0.023 0.021 - -
ARCTIC (2D投影) 完整模型 (IRM) 0.245 0.304 0.157 - -
真机评测: 立方体 (Cube) 完整模型 0.115 0.316 0.085 0.48 1.54
真机评测: 圆柱体 (Cylinder) 完整模型 0.114 0.305 0.067 1.35 3.24

同时,SOFA 仿真值与真机 FTIR 标定测量值展现出高保真一致性:立方体与圆柱体上的帧级 MAE 仅为 \(0.25 \pm 0.16\text{ N}\) 与 \(0.36 \pm 0.18\text{ N}\),Spearman 秩相关系数达到 0.604 和 0.760。

关键发现

  • 姿态迭代对接触定位至关重要:去掉 IRM 会导致接触区域 IoU 发生断崖式下跌(ARCTIC 2D IoU 从 0.157 跌至 0.021),说明未经精确几何对齐的网格极易使模型失去物理交互的局部对应能力。
  • 误差解耦分析证实几何瓶颈:利用真值位姿(GT pose)消除姿态估计误差后,接触与力的预测质量几乎完美贴合真实分布,证明力回归本身的表征能力充沛,主要瓶颈在于极端遮挡下的单目第一人称位姿恢复。
  • 推理期手部姿态误差域迁移:在测试时用 HAMER 估计的噪声手部姿态替代 GT,虽然模型自适应后手部力 MAE 有所收敛,但由于几何网格顶点漂移,接触分类的精准度明显受损。

亮点与洞察

  • 首次实现双手与铰接物体表面的全 3D 逐顶点力场联合预测:打破了传统仅在 2D 图像像素或平整桌面估计法向压力的局限,真正赋予了第一人称视觉系统物理量级的交互感知能力。
  • 物理仿真低成本合成密集体表力标签:利用 SOFA 准刚体碰撞惩罚模型构建了端到端的力学合成管线,解决了学术界长期缺乏三维密集手物动态测力数据的核心卡点。
  • 巧妙的低成本 FTIR 真实物理测试台:利用亚克力全内反射光强与皮肤接触压力的线性关系,配合鱼眼相机与数字测力计建立精密标定查找表,为视觉力估计提供了可靠的物理真值评测范式。

局限与展望

  • 单帧静态推断缺少时序连贯性:真实物理交互中的力具有强动态惯性与时序延续性,单帧推断无法施加牛顿运动定律等时序微分约束。
  • 强依赖预先给定的物体 CAD 模板几何:若面对完全未知的日常物体,当前管线无法零样本泛化,未来需引入像 SAM3D 此类前向几何重建模型。
  • 仅支持法向接触力与均匀材质假设:仿真与真机评测均未建模切向摩擦力与剪切力,且假定各物体为各向同性刚度,对软质或非均匀弹性材料的力学反解仍显不足。

相关工作与启发

  • vs HACO: HACO 在海量多数据集上优化了双手网格的接触分类,但完全不支持物体侧的接触定位,更缺乏物理受力估计能力;EgoPHI 在保证手部接触精度的同时拓展到了双手+物体全接触力场。
  • vs PressureVision / PressureVision++: PressureVision 仅在 2D 图像平面预测指尖压力热图,容易受第一人称自遮挡干扰;EgoPHI 基于显式 3D 网格拓扑与图注意力网络,抗遮挡鲁棒性显著更高。
  • vs EgoPressure: EgoPressure 探索了第一人称 3D 手部网格压力,但场景受限于与大面积平整表面(桌面)的接触,且代码未开源;EgoPHI 攻克了复杂的非平面、可铰接三维刚体交互。

评分

  • 新颖性: ⭐⭐⭐⭐⭐(首个第一人称双手与物体双侧密集 3D 接触与力场估计体系,打通物理仿真与真实传感器标定)
  • 实验充分度: ⭐⭐⭐⭐⭐(跨数据集评测、误差解耦分析、消融实验,配合定制 FTIR 实体装置的真实验证)
  • 写作质量: ⭐⭐⭐⭐⭐(架构与物理公式叙述严密,实验分析深刻透彻)
  • 价值: ⭐⭐⭐⭐⭐(对具身智能、灵巧手物理仿真学习及 XR 人机交互具有直接指导价值)