跳转至

EgoMAN: Interaction-Structured Reasoning for Egocentric 3D Hand Trajectory Prediction

会议: ECCV 2026
论文: ECCV 原文
代码: https://egoman-project.github.io/
领域: 多模态VLM / LLM推理
关键词: 第一人称手部轨迹预测, 交互阶段推理, Trajectory-Token Interface, 流匹配, 6DoF运动生成

一句话总结

EgoMAN 提出了面向第一人称 3D 手部轨迹预测的交互结构化推理框架,通过包含意图与阶段航点的紧凑四词元接口连接多模态推理模型与流匹配动作专家,从根本上解决了意图与连续轨迹解耦导致的噪声累积与泛化难题。

研究背景与动机

第一人称 3D 手部运动轨迹预测是具身智能交互、机器人模仿学习与主动辅助系统的核心使能技术。系统需要从强烈的自我动眼动干扰、复杂的场景几何遮挡以及手部高频运动历史中,准确推断双手在未来几秒内的精确时空轨迹。然而,真实世界的第一人称日常交互视频中充斥着大量偶发性、探索性与过渡性移动,这些偶发扰动与真实的任务目标语义关联极其微弱。

现有方法在建模这种长程轨迹时普遍陷入两难:一类端到端连续回归模型(如 USST、MMTwin、基于 CVAE 的 HandsOnVLM)通常将轨迹视为平坦且均匀的连续时间序列,缺乏对交互目标与时序阶段的显式结构化建模,使得模型极难将真正由意图驱动的动作从第一人称视角的偶发晃动噪声中剥离出来,在跨场景测试时累积误差巨大;另一类基于接触面或动作启智(Affordance)的方法严重依赖外部目标检测器和预定义的接触估计管道,极易受级联感知误差影响,不仅计算开销昂贵、推理帧率极低,且难以适应开放词表的通用意图推理。

面对这一矛盾,人类在执行操作时本质上是以结构化的阶段序列(如接近目标、接触操作、完成离开)来锚定动作的。本文的切入角度是:将高层意图引导的多模态时空推理与底层高频物理动力学生成解耦,借助稀疏但具备物理可解释性的交互阶段航点作为桥梁。核心 idea:提出交互结构化推理框架 EgoMAN,利用仅含 4 个离散阶段词元的 Trajectory-Token Interface 桥接大模型交互推理与流匹配运动专家,并通过三阶段渐进式对齐训练实现平滑、精准且强泛化的长程 6DoF 双手轨迹预测。

方法详解

整体框架

EgoMAN 的输入包括当前时刻的单帧第一人称 RGB 图像 \(V_t\)、历史双手手腕轨迹 \(\{L_\tau, R_\tau\}_{\tau=t-H}^t\)(包含 3D 坐标 \(L_\tau \in \mathbb{R}^6\) 与 6D 连续旋转表示 \(R_\tau \in \mathbb{R}^{12}\)),以及任务意图自然语言文本 \(I\)。系统的最终目标是预测跨越接近与操作完整阶段的未来长程双腕 6DoF 轨迹 \(\{\tilde{L}_\tau, \tilde{R}_\tau\}_{\tau=t+1}^{t+T}\)

整个框架由两大模块与一个核心接口组成:首先,基于 Qwen2.5-VL 构建的交互结构化推理模块吸收图像、历史手势嵌入与意图指令,通过多任务问答与结构化预测生成高层动作语义与稀疏的关键时空航点;接着,Trajectory-Token Interface 将这套结构化表征解构为动作语义特征向量与带时序标定的阶段 6DoF 航点;最后,基于流匹配(Flow Matching)架构的运动专家模块以历史运动、视觉特征、语义嵌入和航点作为时空条件,解码生成物理自洽的高频平滑 6DoF 连续手部轨迹。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["第一人称输入<br/>RGB帧 + 历史手部轨迹 + 意图文本"] --> B["交互结构化推理模块<br/>Qwen2.5-VL 编码与时空阶段推理"]
    B --> C["Trajectory-Token Interface<br/>ACT动作语义 + START/CONTACT/END航点"]
    C --> D["流匹配运动专家<br/>以时空航点为条件的连续速度场生成"]
    D --> E["输出未来长程 6DoF 双手轨迹<br/>3D空间位置 + 6D连续旋转"]

关键设计

1. 交互结构化推理与四词元表征:将连续运动离散锚定为阶段事件

针对传统连续回归模型将整段动作视为均匀平坦信号导致意图混淆的痛点,该模块将手物交互过程显式显构为具备物理因果性的离散阶段。推理模块扩展了多模态大模型的能力,既能输出开放语义回答,也能在遭遇特殊指令时预测 4 个特化词元:动作语义词元 <ACT>,以及表征时空演化的 3 个航点词元 <START>(接近起始)、<CONTACT>(操作开始/接近完成)与 <END>(操作完成)。每个航点词元外接轻量化预测头,直接输出对应阶段的发生时间步戳、双手 3D 绝对空间坐标以及连续 6D 旋转。这种设计将连续高频动作的全局预测降维为关键拓扑节点的推理,极大地降低了长程动作的多模态对齐难度。

2. 混合适应性语义对比与加权时空航点监督:稳定大规模多任务联合预训练

在利用大规模 EgoMAN 数据集预训练推理模块时,批次内混杂了纯文本语义 QA 与包含坐标数值预测的轨迹问答,造成常规对比学习由于批次有效样本数 \(K\) 动态剧烈波动而频繁发生梯度崩溃。为此,设计了基于样本数阈值 \(\kappa\) 的自适应动作语义损失函数:

\[ \mathcal{L}_{\text{act}} = \begin{cases} 1 - \frac{1}{K}\sum_{i=1}^K \text{sim}(z_i, z_i^+), & K < \kappa \\ -\frac{1}{K}\sum_{i=1}^K \log \frac{\exp(\text{sim}(z_i, z_i^+)/\tau)}{\sum_{j=1}^K \exp(\text{sim}(z_i, z_j^+)/\tau)}, & K \ge \kappa \end{cases} \]

当有效样本偏少时平滑退化为余弦相似度损失,充足时切换为 InfoNCE 强化表征辨别力。同时,对 3D 航点坐标采用高斯时间窗口加权的 Huber 损失,并结合相机投影的 2D 重投影损失与测地旋转距离损失(Geodesic loss),且严格仅对可见航点进行反向传播,从源头杜绝了不可见目标带来的虚假梯度干扰。

3. 流匹配运动专家与渐进式接口对齐:弥合离散推理与连续动力学分布鸿沟

直接端到端联合训练多模态推理模型与连续扩散/回归网络极度不稳定,两者的优化目标和梯度尺度存在严重冲突。EgoMAN 采用了三阶段解耦渐进式训练管线:第一阶段在 100 万 QA 对上独立预训练交互推理模块;第二阶段利用标注的真实航点(GT waypoints)预训练基于 Transformer 的流匹配运动专家,使其在 DINOv3 视觉特征、历史轨迹与语义先验条件下,掌握学习条件速度场 \(\hat{v}(x_t, t)\) 的基础平滑动力学分布;第三阶段执行 Trajectory-Token Interface 的联合微调,让运动专家逐步适应推理模块预测出的带噪声航点输入,并通过 Flow Matching 轨迹损失与语言模型交叉熵损失联合收敛。航点在其中扮演软约束引导角色,不仅显著提升了模型对预测扰动的容忍度,还使得流匹配推理仅需极少积分步数即可稳定收敛。

损失函数 / 训练策略

推理模块的总预训练损失为 \(\mathcal{L}_{\text{total}} = \mathcal{L}_{\text{text}} + \lambda_{\text{act}} \mathcal{L}_{\text{act}} + \lambda_{\text{wp}} \mathcal{L}_{\text{wp}}\)。运动专家遵循标准条件流匹配(Flow Matching)目标:

\[ \mathcal{L}_{\text{FM}} = \mathbb{E}_{t, x_0, x_1} \left\| \hat{v}(x_t, t) - (x_1 - x_0) \right\|_2^2 \]

在测试推理阶段,从高斯随机先验噪声 \(x_0\) 出发,沿学习到的条件速度场按欧拉积分迭代 \(N\) 步:\(x_{k+1} = x_k + \Delta t \cdot \hat{v}(x_k, t_k)\)\(\Delta t = 1/N\)),即可快速稳定生成长达 5 秒的连续高频 6DoF 双腕轨迹。

实验关键数据

主实验

评估基于作者构建的基准评测集 EgoMAN-Bench,包括域内未见场景 EgoMAN-Unseen 与完全跨域测试集 HOT3D-OOD。采用 Best-of-10 采样评估,指标包括平均位移误差(ADE)、终点位移误差(FDE)、动态时间规整距离(DTW,单位均为米)以及角度旋转误差(Rot,单位度)。

表 1: EgoMAN-Bench 上的 3D 手部轨迹预测对比(原论文 Table 1)

测试集 方法 ADE (m) ↓ FDE (m) ↓ DTW (m) ↓ Rot (°) ↓
EgoMAN-Unseen USST* (ICCV 2023) 0.233 0.394 0.220 46.98
MMTwin* 0.206 0.256 0.204 48.98
HandsOnVLM* (TMLR 2025) 0.171 0.228 0.161 35.22
FM-base (仅运动专家) 0.160 0.229 0.144 37.00
EgoMAN-ACT (无阶段推理) 0.141 0.204 0.127 35.03
EgoMAN (本文) 0.124 0.179 0.111 32.75
HOT3D-OOD USST* (ICCV 2023) 0.245 0.409 0.226 55.80
MMTwin* 0.209 0.259 0.207 44.37
HandsOnVLM* (TMLR 2025) 0.194 0.262 0.186 38.13
FM-base (仅运动专家) 0.161 0.237 0.147 39.47
EgoMAN-ACT (无阶段推理) 0.153 0.228 0.141 38.42
EgoMAN (本文) 0.141 0.217 0.130 35.09

消融实验

在 EgoMAN-Unseen 单次采样设定(\(K=1\))下,系统检验交互结构化推理(R)、运动专家独立预训练(M)以及基于 6DoF 航点的 Trajectory-Token Interface(WP)各个模块的作用。

表 2: 核心组件消融实验(原论文 Table 2)

配置编号 推理模块 (R) 运动预训练 (M) 接口类型 (WP) ADE (m) ↓ FDE (m) ↓ DTW (m) ↓ Rot (°) ↓
1 0.273 0.308 0.260 51.79
2 6DoF 0.215 0.255 0.198 43.03
3 0.162 0.225 0.148 36.24
4 0.161 0.224 0.147 35.90
5 隐式特征 (Emb) 0.150 0.210 0.138 34.02
6 (完整模型) 6DoF 显式航点 0.151 0.206 0.137 33.88

关键发现

  • 显著超越外部 SOTA 基线:在域内未知测试场景 EgoMAN-Unseen 上,EgoMAN 的 ADE 相比最强基线 HandsOnVLM* 降低了 27.5%(0.124m 对比 0.171m);在严苛的跨域零样本 HOT3D-OOD 场景下,ADE 同样大幅下降 27.3%(0.141m 对比 0.194m),旋转误差降低至 35.09°,展现出优秀的域泛化能力。
  • 航点接口是推理能力向运动转化的决定性通道:消融表对比配置 4(无接口)与配置 6 可以看出,若不加显式 Trajectory-Token 接口,即便开启了交互推理模块,性能几乎停滞在纯运动专家水平(ADE 0.161m 对比 0.162m);只有通过 6DoF 词元显式传递时空约束,才能激发大模型的时空规划能力,ADE 进一步下探至 0.151m。
  • 阶段航点预测速度与精度兼得:在航点预测对比中(原论文 Table 3),相比 VRB*(0.03 FPS, Contact 误差 0.300m)与 VidBot(0.04 FPS, Contact 误差 0.290m),EgoMAN 达到了 3.45 FPS 的高推理效率,且接触位置误差大幅缩减至 0.192m,接触点定位精度提升 33.8%,整条轨迹逼近度提升 52.8%。
  • 语义-动作高精度对齐:在动作动词检索任务中(原论文 Table 4),EgoMAN 预测轨迹的 Top-3 动词召回率达到了 43.9%,远高于 HandsOnVLM 的 27.9% 和 MMTwin 的 22.9%,FID 低至 0.04,说明其轨迹深具语义可区分性,绝非模糊的均值漂移。

亮点与洞察

  • 离散阶段词元架起具身语义与连续控制桥梁:将长程交互动力学浓缩为 4 个结构化阶段词元,既规避了 VLM 直接暴力自回归回归连续浮点数的高累积误差与抖动,又避免了传统启发式检测管道级联故障,设计极其简洁雅致。
  • 软先验引导而非硬截断:航点词元并不强制对流匹配施加硬性阶段断点,而是以条件时空嵌入的形式注入编码器,这种软引导策略赋予了流匹配运动专家纠偏与平滑插值的能力,对大模型的轻微预测偏差表现出极高鲁棒性。
  • 解耦再渐进对齐的训练哲学:证明了多模态语义推理与高频动力学生成在目标分布上的天然张力,先各自预训练底座、再以接口特征为枢纽联合微调的方案,对具身机器人多模态模型构建具有极高通用参考价值。

局限与展望

  • 作者承认的局限:目前 EgoMAN 仅预测手腕级别的 6DoF 刚体轨迹,尚未涵盖手指多关节的高自由度灵巧抓握与接触力学参数,交互阶段划分(仅 Approach 与 Manipulation)相对粗粒度。
  • 审视性局限:由于数据标注高度依赖大模型对第一人称视角的单目几何推断,在重度手物自遮挡或超快速运动导致动态模糊的场景下,航点时间戳与 3D 深度仍存在一定漂移;同时流匹配生成过程虽然平滑,但尚无显式的环境网格碰撞惩罚机制。
  • 改进方向:可进一步接入全身姿态先验与灵巧手接触网格模型(如 MANO/SMPL-X),并将该轨迹接口直接对接真实四足或双臂机器人的低层阻抗控制器进行实机闭环操纵验证。

相关工作与启发

  • vs HandsOnVLM:HandsOnVLM 同样尝试用视觉语言模型引导手物交互,但其通过 CVAE 解码多达 50 个无显式物理定义的隐式手部 token,缺乏时序阶段几何锚定,易产生均值模糊;EgoMAN 仅用 4 个明确定义物理含义的时空阶段 token,预测精度与生成平滑度大幅领先。
  • vs VRB / VidBot 等 Affordance 方案:传统方案依赖检测器提取接触点与交互矢量,推理极慢(<0.05 FPS)且容易因漏检失效;EgoMAN 通过统一 VLM 内部直接解码阶段航点,摆脱了繁冗外部管道,推理效率提升百倍(3.45 FPS)。
  • 启发:在具身端到端 VLA 研发中,不宜让 LLM/VLM 承担全部底层微观控制信号生成,利用离散语义阶段词元作为“宏观动作路标”,下游交由扩散/流匹配模型执行高频动力学插值,是兼顾高层智能与底层稳定性的最优架构范式之一。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 巧妙提出 Trajectory-Token Interface,将具身长程交互动作显式构造成离散阶段拓扑,构思极具启发性。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 21.9 万轨迹的大规模 EgoMAN 数据集构建、跨域零样本评测、完备消融与动词语义对齐检索,验证扎实。
  • 写作质量: ⭐⭐⭐⭐⭐ 架构与方法阐述逻辑严密,图表清晰,实验对比针对性强。
  • 价值: ⭐⭐⭐⭐⭐ 为第一人称动作预测与机器人具身操作策略生成提供了重要的方法与高质量基准资产。