ObjectForesight: Predicting 3D Object Trajectories from Human Videos¶
会议: ECCV 2026
论文: ECCV 原文
项目主页: https://objectforesight.github.io
领域: 3D 视觉
关键词: 3D未来预测, 物体中心动力学, 6-DoF轨迹, 自中心视频, 扩散模型
一句话总结¶
ObjectForesight 是一个物体中心的 3D 前向动力学模型,通过自动化八阶段管线从自中心日常交互视频中提炼出逾 200 万条高质量 6-DoF 轨迹,结合 3D 点云几何编码器与扩散 Transformer(DiT),实现了从无显式动作标签的人类被动视觉观测中预测物体物理自洽的 3D 运动轨迹。
研究背景与动机¶
人类具备一种与生俱来的物理想象能力:看到桌上的咖啡杯,我们能预见它被拿取、倾斜或放下的轨迹;看到手伸向刀柄,我们能自然推断刀具的运动及被切物体的物理形变。这种在脑海中模拟物体交互的能力,是智能体进行物理世界规划、决策与操作的核心基石。然而,传统计算模型试图模仿该能力时,多局限于像素层级的视频生成或抽象的隐空间世界模型,缺乏严格的 3D 几何约束与物理落地点,极易产生时空漂移、形变崩塌或不可行的物理伪影。
现存的核心矛盾在于两方面:一方面,机器人操纵领域的数据集规模极小且高度依赖特定脚本化动作控制与昂贵传感器;另一方面,互联网上虽有海量日常人类第一人称交互视频,却严重缺乏配对的 3D 物体姿态、真实度量尺度与相机几何标定。同时,人类交互中物体运动具有天然的一对多不确定性(同一个物体既可能被平移推开,也可能被抓取举起),确定性的自回归模型往往会平均化这些多模态分布,导致轨迹平滑退化或累积误差失控。
本文切入的角度是:摆脱昂贵动作传感器与低层控制指令的束缚,将第一人称人类交互视频视作通往物理先验的直接监督源,直接在物体中心的三维欧氏空间(SE(3))中建模未来动力学。核心 idea:构建一套高保真自动化提取管线从数万小时人类交互视频中恢复出度量统一的 3D 轨迹数据集,并提出融合点云几何与扩散 Transformer(DiT)的物体中心动力学模型,直接学习现实物体受人操纵时的 6-DoF 轨迹多模态分布。
方法详解¶
整体框架¶
ObjectForesight 的整体预测流水线分为两个核心部分:首先是自动化的大规模第一人称视频 3D 轨迹提炼管线,将原始视频转化为度量准确、以锚点帧相机系为基准的 6-DoF 轨迹;其次是条件化 3D 预测模型,其端到端架构由一个几何感知场景编码器与一个基于 AdaLN-Zero 的扩散 Transformer(DiT)时序骨干组成。
预测任务的形式化定义为:给定输入历史 \(C\) 帧(默认 \(C=3\))的 RGB 图像、物体掩码与对应的度量姿态 \(\mathbf{P}_{1:C}\),以及锚点帧(预测区间的首帧 \(t_a = C+1\))的反投影点云 \(\mathbf{X}\),目标是预测未来 \(H\) 步(默认 \(H=8\))的 6-DoF 姿态序列 \(\mathbf{P}_{\text{future}}\)。所有姿态均以锚点帧相机坐标系为基准,从而将纯粹的物体相对运动与相机的自我运动(ego-motion)彻底解耦。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}, 'subGraphTitleMargin': {'top': 8, 'bottom': 16}}}%%
flowchart TD
A["输入: 锚点帧点云 X<br/>+ 历史姿态与边界框"] --> B["多模态时空上下文提取<br/>锚点时序注意力与 FiLM 调制"]
B --> C["物体中心几何编码<br/>PTV3 局部坐标与几何嵌入"]
C --> D["深度归一化姿态编码<br/>对数深度与投影坐标转化"]
D --> E["扩散时序去噪<br/>DiT v-参数化预测"]
E --> F["SE(3) 物理姿态解码与平滑约束<br/>输出未来 H 步 6-DoF 轨迹"]
关键设计¶
1. 大规模自中心视频 3D 轨迹自动化提炼管线:从无标定视频到度量级三维监督
为了从海量但嘈杂的第一人称视频中获得干净的 3D 轨迹,本文设计了一套八阶段全自动提取流水线。首先通过动作片段筛选与 EgoHOS 识别手-物交互区域;接着将 EgoHOS 粗掩码作为 SAM2 的正负提示点(手部为负,物体内部为正),结合时序多帧交集一致性机制解决闪烁与漂移;第三步引入多模态大模型 InternVL3 进行两级质量门控,分别在视频级过滤未发生物理位移的静止物体,以及在帧级裁剪过滤严重运动模糊或极端遮挡;第四步利用 TRELLIS 依据清晰视角重构静态 3D 网格模板,并用 SpaTrackerV2 提取度量深度;最后结合 FoundationPose 进行带度量尺度重估、多视角优选与双向时序跟踪(IoU 低于 0.1 触发局部重注册),切片出以锚点帧相机系为参考的标准 6-DoF 轨迹窗口。
2. 物体中心几何感知上下文编码:点云结构与近期运动的高效对齐
预测未来的物体运动既依赖其近期的运动惯性(如速度、方向),又受制于周围支撑面与障碍物的几何结构。模型首先将历史各帧的 9D 姿态与归一化 2D 边界框级联投影至 64 维空间,通过以锚点帧为 Query、融入相对时间正弦编码的注意力池化,得到稠密上下文向量 \(\mathbf{ctx} \in \mathbb{R}^{64}\)。紧接着,将锚点帧反投影点云 \(\mathbf{X}\) 输入 PointTransformerV3(PTV3)编码器。每个三维点均显式表示为双重坐标:锚点相机坐标系与估计的物体局部坐标系。通过特征级线性调制(FiLM),\(\mathbf{ctx}\) 动态调控点云特征;再利用物体中心注意力头将点特征聚合为全局几何嵌入 \(\mathbf{z}_{\text{geom}} \in \mathbb{R}^{512}\),为扩散模型提供精准的几何导引。
3. 深度归一化姿态表征与前缀条件扩散 Transformer:稳定捕捉一对多运动分布
直接在绝对三维直角坐标系中去噪容易因相机距离造成的尺度动态范围过大而失稳。模型将 9D 姿态 \(\mathbf{p}_t = [x_t, y_t, z_t, \mathbf{r}_{t,\text{6D}}]\) 重参数化为深度归一化向量 \(\mathbf{y}_t = [u_t, v_t, s_t, \mathbf{r}_{t,\text{6D}}]\),其中: $\(u_t = \frac{x_t}{z_t}, \quad v_t = \frac{y_t}{z_t}, \quad s_t = \log z_t\)$ 该变换压缩了深度的数值方差,并在训练集前几个批次统计的 \((\boldsymbol{\mu}, \boldsymbol{\sigma})\) 下完成标准化。时序骨干采用带有 AdaLN-Zero 机制的 Diffusion Transformer(DiT)。标准化的历史姿态标记序列被直接作为显式 Prefix 拼接在扩散序列前端,\(\mathbf{z}_{\text{geom}}\) 与扩散步长嵌入通过轻量 MLP 调制每一层的层归一化与残差门控。针对不同步态的噪声水平,模型采用余弦 \(\beta\)-schedule 与 \(v\)-参数化设计,配合信噪比加权和随预测步长线性递增的时间权重,有效保证了远期预测的多样性与物理可行性。
损失函数 / 训练策略¶
模型的整体损失由隐式扩散去噪目标与物理空间显式轨迹监督共同构成: $\(\mathcal{L}_{\text{total}} = \mathcal{L}_{\text{v}} + \mathcal{L}_{\text{aux}} + \mathcal{L}_{z_{\min}} + \lambda_{\text{vel}} \mathcal{L}_{\text{vel}} + \lambda_{\text{acc}} \mathcal{L}_{\text{acc}}\)$ 其中主损失 \(\mathcal{L}_{\text{v}}\) 是带有 P2 权重 \(w(\tau)\) 的 \(v\)-预测均方误差: $\(\mathcal{L}_{\text{v}} = \mathbb{E} \left[ w(\tau) \|\mathbf{v}_\theta(\tilde{\mathbf{Y}}_\tau, \tau) - \mathbf{v}_\tau\|_2^2 \right]\)$ 辅助姿态损失 \(\mathcal{L}_{\text{aux}}\) 将去噪重构的姿态反归一化回物理世界,直接计算平移欧氏距离与 3D 旋转测地线距离 \(d_{\text{geo}}(\mathbf{R}_k, \hat{\mathbf{R}}_k)\),由信噪比系数 \(\bar{\alpha}_\tau\) 加权,避免在强噪声阶段惩罚不稳定的重构;\(\mathcal{L}_{\text{vel}}\) 与 \(\mathcal{L}_{\text{acc}}\) 对一阶姿态增量 \(\Delta \mathbf{t}_k, \Delta \mathbf{R}_k\) 及二阶加速度施加平滑惩罚;\(\mathcal{L}_{z_{\min}}\) 则引入截断惩罚防止物体穿透相机平面。训练超参数设置为 \(\lambda_R = 2.0, \lambda_{\text{trans}} = 20.0, \lambda_{\text{vel}} = 0.5, \lambda_{\text{acc}} = 0.1\)。推理时使用 50 步确定性 DDIM 采样。
实验关键数据¶
主实验¶
在从 EPIC-Kitchens 提炼的自中心轨迹数据集与实验室采集的高精度 HOT3D-Clips 数据集上,对平移(ADE, FDE, DES)和旋转(ARE, FRE, RES)六大指标进行全面评测。在 EPIC-Kitchens 子集上,还与业内顶尖视频生成模型 Luma AI Ray3(通过生成未来视频再套用同一位姿估计管线)进行对比。
原论文 Table 1 主实验对比结果如下:
| 数据集 / 评测方案 | 方法 | ADE (m) ↓ | FDE (m) ↓ | DES (m) ↓ | ARE (°) ↓ | FRE (°) ↓ | RES (°) ↓ |
|---|---|---|---|---|---|---|---|
| Epic-Kitchens | Constant Velocity | 0.027 | 0.053 | 0.007 | 2.47 | 5.60 | 0.80 |
| ObjectForesight-AR | 0.067 | 0.074 | 0.002 | 9.48 | 12.58 | 0.93 | |
| ObjectForesight-DiT (本文) | 0.016 | 0.029 | 0.004 | 2.30 | 4.82 | 0.66 | |
| vs. 视频生成对比 (子集) | Luma AI Ray3 | 0.084 | 0.149 | 0.020 | 12.86 | 20.90 | 2.62 |
| ObjectForesight-DiT (本文) | 0.029 | 0.059 | 0.008 | 7.29 | 13.98 | 1.77 | |
| HOT3D-Clips | Constant Velocity | 0.136 | 0.280 | 0.040 | 38.70 | 68.53 | 9.85 |
| ObjectForesight-AR | 0.055 | 0.082 | 0.007 | 9.80 | 14.95 | 1.55 | |
| ObjectForesight-DiT (本文) | 0.021 | 0.026 | 0.003 | 8.92 | 12.58 | 1.16 |
消融实验¶
消融实验在 EPIC-Kitchens 数据集上深入分析了三维场景编码器选择及 DiT 模型尺度的影响。
原论文 Table 2 架构与模型缩放消融如下:
| (a) 场景编码器对比 (固定 12L-768D DiT) | ADE (m) ↓ | FDE (m) ↓ | ARE (°) ↓ | FRE (°) ↓ | (b) DiT 规模缩放 (固定 PTV3) | ADE (m) ↓ | FDE (m) ↓ | ARE (°) ↓ | FRE (°) ↓ |
|---|---|---|---|---|---|---|---|---|---|
| DGCNN | 0.0171 | 0.0297 | 2.333 | 4.968 | 6L-384D | 0.0193 | 0.0311 | 4.242 | 7.762 |
| PointNet++ | 0.0171 | 0.0298 | 2.357 | 5.024 | 8L-512D | 0.0171 | 0.0294 | 2.802 | 5.663 |
| SparseConv | 0.0179 | 0.0295 | 2.700 | 5.299 | 12L-768D (完整模型) | 0.0165 | 0.0287 | 2.299 | 4.816 |
| No-Encoder (无场景编码) | 0.0174 | 0.0298 | 2.690 | 5.380 | |||||
| PTV3 (本文方案) | 0.0165 | 0.0287 | 2.299 | 4.816 |
关键发现¶
- 扩散机制彻底超越自回归方案:在 EPIC-Kitchens 上,自回归变体 ObjectForesight-AR 表现甚至劣于匀速直线外推 baseline(ADE 0.067 m vs 0.027 m),原因在于自回归预测在单峰损失约束下被多模态交互拉向几何均值,导致累积误差迅速发散;而 DiT 扩散架构完整保留了交互的多模态采样能力,相比 Constant Velocity 使 ADE 下降 41%(0.016 m)、FDE 下降 45%(0.029 m)。
- SE(3) 空间建模显著优于 2D 像素视频生成反解:与 Luma AI Ray3 的子集对比表明,生成未来 RGB 视频再估算姿态的累积误差极大(ADE 0.084 m,ARE 12.86°),而直接在 3D 空间预测姿态的 ObjectForesight-DiT 误差仅为其约三分之一(ADE 0.029 m,ARE 7.29°),证明显式 3D 动力学建模对物理轨迹的约束至关重要。
- 高质量几何编码器是不可或缺的使能组件:消融表明,若使用 SparseConv 等不匹配的骨干网络,其表现(ARE 2.700°)甚至不如完全不输入场景点云的 No-Encoder(ARE 2.690°),说明劣质几何特征会引入噪声破坏时序先验;而 PTV3 能够有效利用双坐标系空间结构带来最稳健的增益。
亮点与洞察¶
- 从被动人类视频中自动提炼高保真度量 3D 交互数据:巧妙组合 EgoHOS、SAM2 时序交集机制、InternVL3 动静双重门控与 FoundationPose 度量对齐,在无需动作捕捉与穿戴设备的前提下自动化提炼出 200 万条干净轨迹,为具身智能提供了极低成本的数据扩展飞轮。
- 深度归一化姿态空间设计:将三维直角坐标重参数化为对数深度与投影坐标,既压缩了相机透视造成的极端动态范围,又在数值层面上极大地提升了扩散模型的去噪收敛稳定性。
- 解耦主体运动与相机自我运动:统一将整段时序重投影至锚点帧(Anchor-frame)坐标系中,消除了第一人称视频由于拍摄者头部运动带来的剧烈抖动与虚假运动假象,使动力学模型能够纯粹聚焦于物体自身的交互物理规律。
局限与展望¶
- 假设刚体对象与静态拓扑:当前框架仅针对刚性物体进行 6-DoF 姿态估计与预测,对于日常交互中极其常见的可形变物体(如面团、衣物)或铰接物体(如剪刀、微波炉门)无法直接适用,未来需引入可形变场或运动链骨架。
- 预测时间窗口相对较短:默认预测时域为 8 步(约 0.13 秒至 1.3 秒,依采样率而定),在长时间跨度、多阶段任务(如将物体从柜子取出并跨越桌面装入微波炉)上的长程预测能力仍有待检验。
- 尚未直接闭环到机器人低层控制策略:当前输出为物体轨迹而非机器人末端操作动作或抓取接触点,后续研究可探索将预测的物体 3D 轨迹作为高层示教引导,桥接下游强化学习与模仿学习控制策略。
相关工作与启发¶
- vs. 像素级视频世界模型 (如 SVD, Luma Ray3):视频世界模型试图在 2D 像素隐空间中模拟世界演化,但缺乏明确的 3D 物理与几何锚定,易产生穿模、失真与形变;ObjectForesight 直接在 SE(3) 空间建模,物理保真度与几何精确性远优于间接像素方法。
- vs. 机器人具身操作模型 (如 RT-X, Open X-Embodiment):传统机器人策略依赖特定机械臂的关节角、末端执行器姿态及严格的动作示教标签,跨平台泛化代价高昂;ObjectForesight 绕过具体执行机构,直接预测物理环境受人操纵后的客观运动结果,可作为通用高层物理世界规划器。
- vs. 人手未来轨迹与接触预测 (如 HandsonVLM, ContactGrasp):以往自中心工作往往专注于手部动作或抓取触点的预测;本文转向以物体为中心(Object-Centric),直接预测物体本身的动态演进,对交互后果提供了更直接的物理表征。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次系统性提出并形式化从无标定人类自中心视频中学习物体 6-DoF 动力学预测的任务,且具备成熟的自动化百万级轨迹挖掘管线。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 EPIC-Kitchens 与 HOT3D 双数据集、六大轨迹指标评测、与前沿视频生成模型对比以及详尽的编码器与规模消融。
- 写作质量: ⭐⭐⭐⭐⭐ 结构逻辑清晰流畅,公式与图表表达严密,管线与模型设计细节扎实。
- 价值: ⭐⭐⭐⭐⭐ 为具身智能、空间物理推理和基于人类视频学习通用世界动力学开辟了一条极具扩展潜力的数据与模型路径。