跳转至

EgoTraj: Real-World Egocentric Human Trajectory

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/yehiahmad/EgoTraj
领域: 自动驾驶
关键词: 第一人称轨迹预测 / 多模态数据集 / 视线追踪 / 具身导航 / 消费级AR头显

一句话总结

EgoTraj 是首个基于消费级 AR 头显(Meta Quest Pro)采集的真实户外多模态第一人称轨迹数据集与评测基准,同步记录了 75 名受试者在复杂城市道路中自选路线行走时的 6DoF 头部姿态、3D 视线向量、第一人称视频与 VLM 场景结构化标注,并通过级联交叉注意力验证了视线和场景先验对未来轨迹与头部朝向预测的显著收益。

研究背景与动机

第一人称视角(Egocentric View)是人类在物理世界中进行自主导航与环境交互的感知基石。人类行人在城市环境中移动时,不仅依赖对周围障碍物与道路几何的感知,更无意识地借助视觉注视点(Gaze Fixation)提前 1-2 秒预判转弯点、过街间隙或规避潜在冲突。然而在自动驾驶、人形机器人、轮椅辅助以及视障人群 AR 助航等具身智能场景中,赋予机器这种预判第一人称自身轨迹与头部运动的能力一直面临巨大挑战。现有绝大多数轨迹预测研究完全建立在俯视图(Bird's-Eye View, BEV)或固定路侧相机(如 ETH/UCY、SDD、inD、nuScenes)之上,这些外部观测视角仅能记录行人的外在运动位移,完全缺失了人类从第一人称视角感知场景、分配注意力以及产生意图的内部认知线索。

为了突破这一瓶颈,近年来第一人称视觉领域陆续推出了数个大规模数据集(如 Ego4D、Ego-Exo4D),但它们的设计初衷绝大部分是动作识别与视频理解,缺乏导航维度的长时程 6DoF 轨迹与连续运动遥测数据。少数专注于第一人称轨迹预测的先驱工作(如 KrishnaCam、EgoMotion、LookOut、EgoCogNav)则面临诸多严苛局限:要么仅依赖单个受试者或局限于室内平坦走廊,要么仅使用胸戴相机/离线 SfM 重建而缺乏真实的 6DoF 姿态真值,要么缺乏连续同步的眼动视线追踪数据。更为关键的是,以往方案多依赖庞大笨重的定制化传感器支架,难以反映轻量级消费类可穿戴头显在剧烈自运动、快速视线转移与低功耗边缘端面临的真实感知挑战。

针对真实户外第一人称轨迹数据与意图引导感知评测的空白,本研究选择基于轻量化消费级头显 Meta Quest Pro 采集真实多模态导航数据。核心 idea:构建首个包含 75 位受试者真实户外自主导航的 10.7 小时多模态第一人称数据集 EgoTraj,高频同步 6DoF 头部姿态、3D 视线向量、RGB 视频与 VLM 结构化场景语义描述,建立统一预测基准并揭示视线先验对突破轨迹预测瓶颈的核心价值。

方法详解

整体框架

EgoTraj 的构建与基准评估覆盖了从“软硬件协同数据采集”、“多源时空同步与标定”、“VLM 结构化场景语义生成”到“多模态轨迹与朝向预测基准评测”的全链路。首先,佩戴 Meta Quest Pro(MQPro)的受试者在真实的室外街区(涵盖人行道、斑马线、十字路口等)在 7 个地标路标之间自主选择路径行走;内置 Visual-Inertial SLAM 与双眼红外眼动追踪系统以 30 Hz 记录头部 6DoF 运动学位姿与 3D 视线向量,并与全彩透视(Passthrough)RGB 视频对齐打包为 HDF5。随后,系统通过二次多项式标定模型将 3D 视线几何重投影至第一人称像平面,并调用 Qwen2.5-VL-32B 对关键帧生成包含交互决策的结构化场景标注。在预测基准侧,模型接收过去的位姿、视线、社交人体与场景上下文,端到端预测未来 3.5 秒的轨迹位移与 6DoF 头部朝向。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["MQPro 硬件采集<br/>6DoF位姿 + 3D视线 + RGB视频"] --> B["多模态时空对齐与几何标定<br/>30Hz时间戳同步 + 视线像素重投影"]
    B --> C["VLM 场景语义理解与脱敏<br/>EgoBlur人脸车牌打码 + Qwen2.5-VL标注"]
    C --> D["EgoViz 质量控制看板<br/>位姿-视线-视频-语义多重视角联动质检"]
    D --> E["多模态级联交叉注意力基准预测<br/>CXA-Transformer / EgoCast 建模意图"]
    E --> F["输出未来轨迹与朝向<br/>未来 3.5s 坐标位移 ADE/FDE + 头部旋转误差"]

关键设计

1. 消费级 AR 设备的自然流真实户外采集与轻量几何标定 为了彻底摆脱过往数据集依赖重型外挂设备或单调室内路线的束缚,本设计直接采用 Meta Quest Pro 头显的全彩透视模式,利用其自带的双目红外眼动追踪相机、四路外向内追踪相机与 6 轴 IMU,在 Unity 环境下深度调用内置 VIO-SLAM 系统,以 30 Hz 输出头部三维坐标、姿态四元数、线速度与角速度。受试者在包含 7 个地标性区域(对应 21 组起止地标对)的真实城市开放空间中自主决策行进路线。统计表明,相同端点对之间轨迹的动态时间规整(DTW)距离中位数高达 122.8 m(跨度达 19.3~379.4 m),切实杜绝了机械脚本式的重复行走。在几何对齐上,由于 3D 视线向量与 RGB 透视相机坐标系存在安装与眼动非线性偏移,系统为每个会话拟合逐会话二次多项式模型(Quadratic Calibration Model),将视线俯仰角和偏航角精确映射至图像像素坐标 \((u, v)\),使得下游预测模型能够直接将视线注视点与视觉特征图融合。

2. 基于视觉语言模型的导航决策感知场景结构化生成 高层语义与行为意图是纯运动学外推模型无法捕捉的维度。为了给第一人称轨迹赋予上下文意图支撑,系统构建了结合 EgoBlur 自动隐私脱敏与大视觉语言模型(VLM)的标注管线。从 253 个视频片段中按 1 fps 抽取 38,606 帧,使用 Qwen2.5-VL-32B-Instruct 并设计包含少量示例(few-shot)与思维链(Chain-of-Thought, CoT)的提示词,要求模型重点提取与即时导航决策密切相关的要素(如行人流跟随、路口接近、规避障碍、交通灯状态与视线落点目标),而非泛泛的背景美学描述。系统引入两阶段一致性检验:第一阶段在跨会话分层抽样的样本上对标签结构与明确导航决策逻辑进行合规性验证,重试机制后合规率达到 96%;第二阶段经过双人工专家独立交叉盲检,主要字段的 Cohen's \(\kappa\) 一致性系数达到 0.83~0.96,最终以 sidecar JSON 与 HDF5 文件协同封装。

3. 多模态交互先验与级联交叉注意力轨迹预测基准 针对第一人称轨迹中普遍存在的频繁停走、剧烈转向与头部自运动抖动,基准设计了基于 CXA-Transformer(级联交叉注意力网络)的多模态适配范式。模型统一采用过去 1.5 秒(\(T_{\text{obs}}=1.5\text{ s}\),45 帧)的观测窗口,预测未来 3.5 秒(\(T_{\text{pred}}=3.5\text{ s}\),105 帧)的轨迹与姿态。除了自身位姿与运动历史(\(Y\)),系统通过轻量级现成预训练模型提取多路互补先验:使用 YOLOv8-Pose 提取视野中周围行人的 2D 骨骼关键点(\(P\))、中心点(\(C\))与包围框(\(B\));利用 OneFormer 提取场景语义分割掩码(\(S\));使用 Depth Anything V2 输出稠密相对深度(\(D\));并直接注入投影视线坐标(\(G=(u, v)\))。不同于传统早期特征拼接(Early Fusion),CXA-Transformer 利用多级级联交叉注意力模块,让自身运动序列依次与场景几何(\(S\))、社交意图(\(P\))以及注视焦点(\(G\))进行跨注意力查询,使得视线注视点能够充当显著性权重,引导轨迹朝向意图关注区弯折。

损失函数 / 训练策略

轨迹位移预测通过最小化真实轨迹与预测位置之间的平均位移误差(ADE)与最终位移误差(FDE)进行监督: $\(\text{ADE} = \frac{1}{T_{\text{pred}}} \sum_{i=1}^{T_{\text{pred}}} \|\hat{p}_{t+i} - p_{t+i}\|_2, \quad \text{FDE} = \|\hat{p}_{t+T_{\text{pred}}} - p_{t+T_{\text{pred}}}\|_2\)$ 针对头部朝向预测,为避免欧拉角奇异性与四元数双重覆盖歧义,模型在旋转矩阵空间施加 \(L_1\) 旋转误差损失(\(L_1^{\text{rot}}\)): $\(\mathcal{L}_{\text{rot}} = \frac{1}{T_{\text{pred}}} \sum_{i=1}^{T_{\text{pred}}} \|\hat{R}_{t+i} R_{t+i}^{\top} - I\|_1\)$ 整个数据集按 80% / 10% / 10% 的比例划分为互不重叠的训练集、验证集和测试集(各受试者完全解耦)。此外,为了严格检验泛化能力,评估协议还设立了“预留航路点划分(Waypoint Held-Out)”(完全保留 3 组起止路标对,10 个会话)与“陌生受试者划分(Unfamiliar)”(保留对录制区域完全陌生的 8 名受试者),通过 1,000 次 Bootstrap 重采样计算 95% 置信区间。

实验关键数据

主实验

在 EgoTraj 测试集上,基线对比覆盖了经典运动学外推方法以及最先进的学习型序列模型。所有模型均在相同数据划分下以 1.5 秒历史预测未来 3.5 秒。

模型类型 模型名称 输入模态 ADE (m) ↓ FDE (m) ↓ \(L_1^{\text{head}}\) ↓
运动学基准 Const_Vel (等速外推) 自身平移+旋转 0.24 0.35 0.82
运动学基准 Lin_Ext (线性回归) 自身平移+旋转 0.26 0.39 1.39
神经网络 M_Transformer (早期拼接) 自身平移+旋转 0.20 0.32 0.74
神经网络 CXA-Transformer (级联注意力) 自身平移+旋转 0.19 0.29 0.69
神经网络 EgoCast (适配版) 自身平移+旋转 0.16 0.28 0.78

消融实验与模态贡献

在统一的 CXA-Transformer 架构下,针对自身运动轨迹(\(Y\))、社交线索(中心点 \(C\)、包围框 \(B\)、骨骼姿态 \(P\))、场景分割(\(S\))、相对深度(\(D\))以及投影视线(\(G\))进行模态消融分析:

模态组合 输入特征说明 ADE (m) ↓ FDE (m) ↓ \(L_1^{\text{head}}\) ↓
\(Y\) 仅自身位姿与运动学序列 0.19 0.29 0.69
\(Y + C\) 增加周围行人中心点 0.18 0.29 0.79
\(Y + B\) 增加周围行人 2D 包围框 0.18 0.30 0.81
\(Y + P\) 增加周围行人骨骼姿态 (YOLOv8-Pose) 0.17 0.27 0.77
\(Y + S\) 增加场景语义分割 (OneFormer) 0.16 0.26 0.74
\(Y + D\) 增加单目相对深度 (Depth Anything V2) 0.18 0.29 0.78
\(Y + G\) 增加 2D 投影视线注视点 \((u, v)\) 0.15 0.26 0.69
\(Y + C + G\) 行人中心点 + 视线 0.14 0.25 0.67
\(Y + B + G\) 行人包围框 + 视线 0.16 0.26 0.70
\(Y + P + G\) 行人骨骼姿态 + 视线 0.12 0.24 0.63
\(Y + S + G\) 场景分割 + 视线 0.12 0.25 0.65
\(Y + D + G\) 相对深度 + 视线 0.15 0.27 0.71
\(Y + P + S + G\) 自身运动 + 行人姿态 + 场景分割 + 视线 (全配置) 0.12 0.23 0.58

跨划分泛化评测

为了检验多模态预测模型是否仅在记忆固定路线模板,论文在三种不同严苛程度的数据划分上进行了鲁棒性检验(汇报 95% Bootstrap 置信区间):

模态配置 随机受试者划分 (\(n=8\)) ADE / FDE (m) 预留航路点对划分 (\(n=10\)) ADE / FDE (m) 陌生受试者划分 (\(n=8\)) ADE / FDE (m)
\(Y\) (仅自运动) 0.19±.014 / 0.29±.021 0.21±.018 / 0.32±.024 0.23±.019 / 0.34±.027
\(Y + P\) (加入行人姿态) 0.17±.011 / 0.27±.019 0.19±.015 / 0.29±.022 0.20±.013 / 0.31±.020
\(Y + S\) (加入场景分割) 0.16±.013 / 0.25±.014 0.18±.012 / 0.28±.018 0.18±.016 / 0.29±.023
\(Y + G\) (加入视线) 0.15±.009 / 0.26±.017 0.16±.014 / 0.26±.013 0.16±.010 / 0.29±.018
\(Y + P + S + G\) (全多模态) 0.12±.008 / 0.23±.012 0.14±.010 / 0.25±.011 0.14±.012 / 0.26±.014

关键发现

  • 视线是单模态增益最显著的意图信号:在仅有自运动的基础上,单独引入注视点坐标(\(Y+G\))即可将 ADE 从 0.19 m 骤降至 0.15 m,降幅高达 21.1%,优于深度(0.18 m)和粗粒度行人框(0.18 m),充分印证了认知科学中“眼动领先于肢体位移 1-2 秒”的意图预示机理。
  • 细粒度人体姿态远胜粗粒度位置标定:在社交建模中,\(Y+P\)(人体骨骼姿态)相比 \(Y+B\)(检测框)和 \(Y+C\)(中心点)表现出更强的误差抑制能力,这表明行人的肢体朝向与步态动态传递了远比静态空间占位更具指导意义的避障交互意图。
  • 全多模态融合下朝向与轨迹实现双重最强预测:当整合自运动、行人骨骼、语义分割与视线(\(Y+P+S+G\))后,ADE 降至 0.12 m,FDE 降至 0.23 m,头部朝向旋转误差更从 0.69 显著压低至 0.58。
  • 泛化性验证排除路由模板记忆:在预留航路点和陌生受试者划分下,全模态模型性能仅出现极其微弱的衰减(ADE 从 0.12 m 略增至 0.14 m),说明多模态交叉注意力真正学会了依据视觉与意图交互做泛化决策,而非过拟合于特定街区的路线记忆。

亮点与洞察

  • 消费级 AR 头显在真实复杂交通场景的成功落地:验证了利用 Meta Quest Pro 内置 VIO 与视线追踪系统即可完成高质量学术级多模态真实数据采集,相比上万美元的科研级专用传感器支架,大幅降低了具身数据采集门槛。
  • 多维度视听质检平台 EgoViz Dashboard:配套开发了可交互的可视化质检看板,能以 30 Hz 毫秒级精度同步查看 2D 轨迹、全局 BEV 地图、第一人称 RGB 帧、视线注视绿点以及 VLM 语义描述,为复杂多源传感器的数据时钟漂移检测提供了工程典范。
  • 揭示了极端急转弯处第一人称预测的固有困境:定性分析明确指出了在十字路口等待绿灯后突然发生的约 90 度急转弯属于典型失败案例(Failure Cases)。在转弯发生前,头部与肢体运动学统计完全处于稳态行走区间,缺乏前兆运动信号;表明未来的第一人称预测必须从确定性回归转向多模态意图与不确定性概率建模。

局限与展望

  • 极端突发转向意图的确定性预测瓶颈:作者坦承在红绿灯路口的瞬时约 90 度折向场景中,所有基线模型均大幅低估转弯曲率;当前确定性预测架构缺乏表达多模态未来概率分支的能力。
  • 场景光照与天气多样性尚待扩充:目前的 75 个会话主要集中在日间正常天气下,尚未系统覆盖雨雪天、夜间低照度或眩光等极端光照下的鲁棒性边界。
  • 视觉语言模型标注存在单向依赖:场景描述完全由离线 Qwen2.5-VL-32B 抽取,尽管有高合规率,但尚未将语言大模型作为预测主干进行端到端的联合微调与具身对话控制。

相关工作与启发

  • vs LookOut (ICCV 2025): LookOut 采用 Project Aria 眼镜采集了 4 小时数据,但其时长较短、缺少多受试者多样性且未提供结构化场景描述标注;EgoTraj 扩充至 10.7 小时与 75 位受试者,并提供了完善的 VLM 场景与意图侧注。
  • vs EgoCogNav (2025): EgoCogNav 重点探究认知不确定性与室内外混合场景,仅含 6 小时且非纯户外;EgoTraj 专精于真实城市户外交通环境(人行道、斑马线、交叉口),为 AR 助航与无人配送机器人提供了直观的高交互真实场景。
  • vs 传统第三方轨迹预测 (Social-LSTM, TUTR): 传统方法局限于静态俯视角下的群组避障外推,缺失主观视觉与注视意图;EgoTraj 填补了从第一人称主观视角理解人类如何分配注意力、并据此预测自身未来行为的关键拼图。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 首次在消费级 AR 头显上开源大规模真实户外第一人称轨迹-视线-视频-场景多模态数据集。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 5 种基线对比、13 种模态消融组合以及 3 类不同严格程度的泛化划分与置信区间分析。
  • 写作质量: ⭐⭐⭐⭐⭐ 结构清晰严谨,软硬件采集细节、几何标定流程与失败案例剖析透明详尽。
  • 价值: ⭐⭐⭐⭐⭐ 对人形机器人、智能轮椅、视障人士 AR 辅助导航以及端到端自动驾驶具身交互具有极高的实用参考价值。