跳转至

Ego-Human Motion Prediction with 3D-Aware LLM

会议: ECCV 2026
论文: ECCV 2026 Poster
代码: https://jaewoo97.github.io/Ego3DLM/
领域: 3D视觉
关键词: 第一人称人体运动预测, 多模态大语言模型, 3D场景感知, 强化学习微调, 跨模态对齐

一句话总结

Ego3DLM 将第一人称动作预测建模为显式 3D 场景感知的大语言模型推理过程,以单阶段自回归方式联合解码过去与未来的 3D 姿态及自然语言叙述,并借助跨模态对齐奖励的 GRPO 强化学习大幅提升运动物理可行性与语义保真度。

研究背景与动机

第一人称视角下的人体运动预测在增强现实与虚拟现实(AR/VR)、人机协作以及具身智能中扮演着关键角色。相比第三人称视频,第一人称观测能够直接反映穿戴者的真实视场、潜在交互意图与近场物体接触。然而,第一人称运动预测极度欠定:头部摄像头难以拍到穿戴者自身的身体躯干,输入信号通常仅限于稀疏的穿戴式追踪点(如头部与双手),这使得同一局部运动观测能够对应诸多物理上完全不同的未来动作轨迹。

现有的运动语言模型尝试引入文本作为语义先验以消解预测的多义性,或者将动作离散化为动作词元(motion tokens)进行联合建模。然而,主流方法通常侧重于第三人称下的动作重建与编辑,在第一人称预测中往往忽略了决定人体运动可达性与物理约束的显式 3D 空间和语义上下文。即便少数工作尝试注入 3D 场景几何,也多是将特征作为被动条件粗暴拼入网络,模型并未习得真正的场景空间推理能力;更严重的是,以往系统通常将连续位姿生成与动作语言描述拆分为独立的推理分支,割裂了动作执行与语义意图之间的内在约束,导致预测的动作容易与场景发生穿透碰撞,且生成的语言描述与实际运动脱节。

本文的核心思路是:准确的人体运动预测必须建立在对周围 3D 环境的显式空间与语义理解之上,且姿态生成与自然语言叙述应在单次前向过程中整体联合解码,使物理动作与语义意图互为锚定。核心 idea:构建 3D 感知多模态大语言模型 Ego3DLM,在统一自回归序列中依次生成空间场景推理、过去姿态、未来姿态、过去叙述与未来描述,并通过融合模态内与模态间对齐奖励的 GRPO 强化学习直接优化运动-语言一致性。

方法详解

整体框架

Ego3DLM 的输入包含三部分:穿戴设备采集的稀疏三点追踪数据(头部和双手的 6D 姿态)、第一人称连续视频帧,以及周围环境重建的 3D 点云场景。模型的输出是一个连贯的自回归序列,包含显式空间推理、离散化人体运动姿态词元( past 与 future )以及对应的自然语言描述。

为了实现从 3D 几何到时空动作与语义叙述的无缝传导,整个训练体系分为三个递进阶段: 1. 3D 场景空间-语义特征提取与预训练(Stage I):提取 2D 语义先验并提升到 3D 点云,通过密集问答让语言模型掌握可通行度与物体关系; 2. 多模态多任务指令微调(Stage II):将空间推理、过去/未来姿态生成和过去/未来文本描述串联在单个自回归序列中整体监督; 3. 多模态对齐奖励 GRPO 强化学习(Stage III):采样生成候选,计算动作轨迹、语言质量及跨模态特征距离奖励,利用组相对策略优化直接强化物理合理性与图文一致性。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["三点追踪 + 视频 + 3D点云输入"] --> B["3D场景特征提取与对齐<br/>2D特征提升至点云 + Q-Former压缩"]
    B --> C["空间与语义场景感知预训练<br/>方向障碍物可达性与物体语义QA"]
    C --> D["单阶段全任务指令微调<br/>空间推理→姿态预测→文本描述链"]
    D --> E["多模态跨模态对齐奖励 GRPO<br/>动作与语言特征空间相互距离约束"]
    E --> F["输出:连贯3D运动轨迹与同步动作叙述"]

关键设计

1. 3D场景特征提取与对齐:将2D开放词表语义提升至3D点云并紧凑压缩

针对第一人称视频视角有限且点云本身缺乏密集语义的问题,模型首先利用 Mask2Former 提取图像实例掩码,并结合 EVA-ViT-G 提取密集的全局与目标中心 2D 特征。根据相机每帧位姿,采用最佳视角选择策略将 2D 语义特征反投影并提升到 3D 场景点云中,每个 3D 点只保留最近视角特征以减少遮挡伪影。随后点云变换至以人体初始帧为基准的第一人称坐标系,经过体素化降采样并叠加 3D 正弦位置编码后,输入包含 \(K=32\) 个查询向量的 Q-Former 结构中,压缩得到固定维度的紧凑场景嵌入表示 \(\mathbf{S}\)。结合每帧经由投影层映射的 CLIP 视觉特征 \(\mathbf{V}\),共同作为输入上下文注入语言模型。

2. 空间与语义场景感知预训练:在学习动作前预先内化环境可达性先验

为了避免语言模型将 3D 特征退化为无关噪声,在引入人体运动之前,先在大规模自动生成的空间与语义问答数据上进行第一阶段预训练。语义问答涵盖物体存在、空间方位、物体状态、颜色及计数等 6 类常识;空间问答则将第一人称前方划分为前、左、右三个角区,要求模型判断各方向的净空等级(低、中、高)、阻挡状态(受阻、畅通)以及最优通行方向。通过对语义问题答案 \(a^{\text{sem}}\) 与空间问题答案 \(a^{\text{spa}}\) 的自回归负对数似然联合优化: $\(\mathcal{L}_{\text{Pre}} = - \sum_i \left( \log p_\theta(a_i^{\text{sem}} \mid a_{<i}^{\text{sem}}, q^{\text{sem}}, \mathbf{E}) + \log p_\theta(a_i^{\text{spa}} \mid a_{<i}^{\text{spa}}, q^{\text{spa}}, \mathbf{E}) \right)\)$ 其中 \(\mathbf{E} = (\mathbf{S}, \mathbf{V})\)。该阶段赋予模型强大的空间约束与障碍物规避意识,使后续生成的动作具备先验物理可行性。

3. 单阶段全任务指令微调:思维链式空间推理到跨模态统一生成

针对传统方案将运动追踪与预测割裂、姿态与语言分流的缺陷,第二阶段设计了链式生成的指令微调范式。模型在接收三点位姿特征 \(\mathbf{P}\)、视频 \(\mathbf{V}\) 和场景 \(\mathbf{S}\) 后,按照固定顺序解码:[空间场景描述 a^spa] → [过去位姿词元 x^past] → [未来位姿词元 x^fut] → [过去运动叙述 y^past] → [未来运动描述 y^fut]。通过将离散运动量化 PQ-VAE 的 4096 个 codebook 词元扩充至大语言模型词表中,姿态与语言在统一空间完成自回归建模。显式生成的空间推理引导位姿解码避开物理障碍,而先行生成的位姿隐状态则进一步作为条件指导未来动作描述的文本生成,形成时空与跨模态双向约束。

4. 多模态跨模态对齐奖励 GRPO:以强化学习打破似然训练瓶颈

最大似然监督训练仅能逼近真实样本分布,无法直接约束同时预测出的姿态与文本是否语义一致。第三阶段采用免价值网络的组相对策略优化(GRPO),针对每个输入提示采样一组 \(G\) 个候选,综合动作精度奖励 \(R_{\text{motion}} = \max(0, 1 - \text{JPE})\)、文本质量奖励 \(R_{\text{text}} = \text{BLEU-4}\) 以及格式惩罚 \(R_{\text{format}}\)。最核心的是引入模态间对齐奖励 \(R_{\text{matching}}\),通过预训练的动作-文本双塔匹配编码器,直接在共享潜在空间中度量欧氏距离: $\(R_{\text{matching}} = - \left[ d_{\text{gp}}(\mathbf{e}_{t_{\text{gt}}}, \mathbf{e}_{m_{\text{pred}}}) + d_{\text{pg}}(\mathbf{e}_{t_{\text{pred}}}, \mathbf{e}_{m_{\text{gt}}}) + d_{\text{pp}}(\mathbf{e}_{t_{\text{pred}}}, \mathbf{e}_{m_{\text{pred}}}) \right]\)$ 其中 \(d_{\text{pp}}\) 显式惩罚当前轮次预测出的文本与预测出的位姿之间的语义偏差。这一强化学习信号促使模型在面对物理空间时,自发收敛到语义与动作动态完全自洽的最优输出。

实验关键数据

主实验

在真实第一人称多模态数据集 Nymeria 上的评测对比(涵盖未来 5 秒运动预测与过去运动追踪)。主干模型采用 GPT-2 Medium。

方法 预测 APE ↓ 预测 JPE ↓ 预测 ADE2s ↓ 预测 FDE2s ↓ 预测 FID ↓ 追踪 APE ↓ 追踪 Upper ↓ 追踪 Lower ↓ 文本描述 Bleu-4 ↑ 跨模态对齐 \(d_{\text{pp}}\) ↓
FIction 206.2 564.7 416.7 494.9 0.3275 181.1 114.0 282.3 - -
EgoLM (SFT) 184.9 579.4 329.9 519.2 0.2137 161.9 95.6 265.6 0.0649* 9.8686
UniEgoMotion 151.5 424.3 223.9 360.4 0.1530 152.2 79.4 233.3 - -
Ego3DLM (本文) 147.9 364.5 205.9 312.6 0.0160 96.4 53.1 152.7 0.1039 4.2571

(注:EgoLM 仅能对过去运动进行文本叙述,其过去文本 Bleu-4 为 0.0649;Ego3DLM 的过去文本 Bleu-4 达到 0.1107。)

消融实验

指令微调阶段各关键模块与预训练任务的消融分析(以完整 SFT 模型为基准):

配置 预测 APE ↓ 预测 JPE ↓ 预测 ADE2s ↓ 追踪 APE ↓ 文本 R@3 ↑ 跨模态对齐 \(d_{\text{pp}}\) ↓ 说明
本文完整 SFT 模型 148.5 368.3 208.8 98.3 0.2706 5.9170 包含完整预训练与空间推理
去掉 3D 场景输入 (w/o S) 156.2 388.5 220.8 105.8 0.2574 6.3012 缺失 3D 物理边界,预测误差显著恶化
去掉空间感知预训练 (w/o Qspa) 152.9 378.3 214.3 99.3 0.2453 6.1612 障碍物可达性理解缺失,对齐距离增大
去掉语义感知预训练 (w/o Qsem) 153.5 381.1 221.9 122.1 0.2558 5.9190 追踪与环境关联能力下降,追踪 APE 剧增 24.2%
去掉显式空间推理链 (w/o SSR) 151.5 376.6 213.4 99.4 0.2638 6.3930 空间上下文未向动作和语言传导,对齐急剧恶化

关键发现

  • 3D 场景特征是物理防碰撞的核心支柱:在消融中去掉 3D 场景输入后,预测位姿全局误差 JPE 从 368.3 骤增至 388.5,且定性结果显示模型频繁穿越墙壁与床榻;3D 场景输入在提供障碍物拓扑边界方面具有不可替代性。
  • 显式空间推理步骤(SSR)具有思维链(CoT)诱导效应:在生成动作之前强制输出空间障碍与净空判断,不仅没有打乱序列生成,反而显著改善了随后的未来文本质量和位姿-语言对齐度(\(d_{\text{pp}}\) 从 6.3930 优化至 5.9170),证明空间几何推理有效充当了动作意图的语义中介。
  • 跨模态对齐奖励的双向互利性:在 Stage III 中引入 \(R_{\text{matching}}\) 后,\(d_{\text{pp}}\) 距离进一步从 5.9170 压缩至 4.2571(相比 SFT 阶段压缩近 28%),同时姿态预测精度与文本 Bleu 指标全面刷新,说明动作与语言联合优化能够产生强烈的互补增益,而非模态间竞争。

亮点与洞察

  • 将 3D 点云与动作离散化词元融入大语言模型自回归:将 PQ-VAE 的 4096 个姿态代码加入词表,使得原本用于文本推理的因果 Transformer 能够天然地同时进行连续人体运动预测与时序自然语言叙述。
  • 免价值网络的 GRPO 跨模态优化机制:将模态间共享潜在距离转化为强化学习相对优势奖励,避开了复杂双塔多模态系统中繁重的 Value 网络拟合,稳定且直接地拉齐了预测姿态与预测文本的语义分布。
  • 可迁移的链式生成范式:先推理物理环境结构、再规划连续物理运动、最后输出高层意图描述的结构化序列解码流,可平移至人机协同机器人轨迹规划与第一人称具身操作等多元任务。

局限与展望

  • 假设 3D 场景点云完全预先已知:方法高度依赖预先离线重建好的 3D 点云与已知相机轨迹,无法直接应用于未探索陌生环境下的即时在线建图与交互。
  • 微小物体精细交互建模不足:当前三点追踪与点云体素化精度主要关注躯干与四肢的大尺度位移及避障,对手指关节层面的精细接触和微型工具操作的预测精度仍显薄弱。
  • 未来改进方向:探索与在线神经辐射场(NeRF)或 3D 高斯泼溅(3D-GS)增量建图模块深度集成的在线第一人称大语言模型体系。

相关工作与启发

  • vs EgoLM: EgoLM 仅利用第一人称视频和追踪点,缺乏显式 3D 场景拓扑支持,且将姿态与语言解码分流处理;本文通过点云特征注入、单阶段自回归统一生成与 GRPO 强化对齐,在保持语言质量的同时将预测位姿的全局 JPE 误差降低了 37.1%,跨模态对齐距离缩减过半。
  • vs UniEgoMotion: UniEgoMotion 虽然结合了 3D 场景并实现了优异的位姿预测,但仅局限于纯动作生成,缺乏意图语义解释;本文不仅在位姿预测各项指标上全面超越 UniEgoMotion,更赋予了模型同步输出高保真未来意图叙述的跨模态推断能力。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次提出融合显式 3D 场景感知、四输出单阶段自回归生成及跨模态 GRPO 的第一人称动作预测多模态框架。
  • 实验充分度: ⭐⭐⭐⭐⭐ 在真实大规模 Nymeria 数据集上开展了极详尽的主实验、消融对比以及针对动作、文本和跨模态距离的多维度量化分析。
  • 写作质量: ⭐⭐⭐⭐⭐ 动机阐述自然流畅,方法架构清晰完整,图表制作精美且与理论逻辑高度自洽。
  • 价值: ⭐⭐⭐⭐⭐ 为第一人称 AR/VR 人体意图理解与具身智能体环境交互规划提供了极具参考价值的统一语言模型范式。