跳转至

Forecasting Animal Motion

会议: ECCV 2026
论文: ECCV 论文页
项目主页: https://motion-forecasting.github.io/
领域: 时间序列
关键词: 动物运动预测、稠密点轨迹、扩散Transformer、非刚性运动、行为建模

一句话总结

将稠密点轨迹确立为行为建模的视觉 Token,结合局部 DINOv3 视觉特征与相机运动补偿管线,构建了基于扩散 Transformer(DiT)的无序轨迹预测架构,实现了跨物种、免 3D 骨架先验且具备长尾泛化能力的野生动物非刚性运动预测。

研究背景与动机

预测动态智能体的未来运动与行为是具身智能与计算机视觉的核心目标之一。在复杂的自然生境中,不管是觅食、捕食、警戒逃逸还是社交互动,准确预判非刚性个体的后续轨迹与姿态对于环境认知与交互生存至关重要。然而,相较于静态视觉识别与像素级生成的成熟,行为预测在现代视觉系统中仍缺乏统一且普适的基础。其核心症结在于计算机视觉领域一直缺乏一种类似于自然语言中“离散词元”那样能够抽象、解耦且具备结构化表达能力的“行为 Token”。现有预测方法主要分化为两个极端:一种是基于大尺度视频扩散模型直接在像素空间(Pixel Space)生成未来视频帧,虽然具有视觉通用性,但像素空间将表观纹理、环境光照、阴影漂移以及强烈的相机抖动与底层的物理运动动力学深度纠缠在一起,导致建模复杂度与数据需求呈几何级爆炸,并且极其容易产生违背物理常识的幻觉形变;另一种则是在 3D 几何空间依赖特异性的参数化模型(如用于人体的 SMPL,或针对马、狗等少数物种的 3D 网格先验),这类方法严重依赖刚性骨骼绑定,不仅难以扩展到自然界海量的长尾物种与复杂形态,且几乎无法捕捉细粒度的非刚性局部形变。

要打破这种“像素空间纠缠低效”与“3D 参数模型特异脆弱”的两难困境,系统亟需一种介于原始像素与特异性 3D 模型之间的中层视觉表征——它既要有足够的物理几何结构来约束运动动力学,又必须具备跨物种、跨形态的通用表达能力。经典生物运动知觉研究(如 Johansson 的点光源刺激实验)早已证实:静态的离散点集往往语义匮乏,但一旦启动运动,点集的相对运动轨迹就能揭示出极其丰富的 3D 拓扑结构、关节铰接规律与动作意图。将时空演化的 2D 稠密点轨迹作为行为的显式载体,能够彻底剥离复杂的像素外观与环境光照扰动,让模型将全部表征容量聚焦于运动动力学本身。此外,自然界动物运动在统计上受环境相互作用等乘性独立因素驱动,往往呈现对数正态分布(Log-Normal Distribution),且伴随着严重的局部遮挡与不可测视野。

本文正是抓住点轨迹在非刚性动态建模上的独特优势,提出了以点轨迹为行为视觉 Token 的生成式预测范式。作者设计了包含相机运动补偿与实例跟踪的野生动物运动提取管线,从海量无约束自然视频中解耦出相机稳定的绝对位移,并在此基础上构建了能够联合推理轨迹动力学、遮挡状态与局部视觉上下文的扩散 Transformer 架构。核心 idea:将稠密点轨迹作为行为的视觉 Token,解耦外观与运动动力学,构建基于扩散 Transformer(DiT)的无序轨迹集生成模型,并通过遮挡感知速度重参数化与相机补偿管线,实现高保真、数据高效且跨物种泛化的野生动物非刚性行为预测。

方法详解

整体框架

整体框架旨在从单帧静态外观观测与极短的历史观测中,联合预测前景动物表面任意非刚性点轨迹在未来的时空演变及可见度。输入包括初始时间步 \(t=1\) 的单张动物局部 RGB 观测图像 \(I\)、初始时段 \(T_c\) 步内的观测运动历史与可见状态,以及可选的用户指定全局位移控制向量 \(d\);输出为未来 \(T_c+1\)\(T\) 步内的所有表面点 2D 连续轨迹与二值遮挡指示变量。

整个处理与预测流水线分为离线数据预处理与在线扩散去噪两个核心阶段:首先在自然视频中通过密集点跟踪、动物实例分割与背景单应变换消除相机抖动,将运动映射到归一化的相机稳定坐标系;随后将每个点轨迹抽象为一个独立的视觉 Token,结合局部 DINOv3 视觉先验、历史速度编码、初始坐标位置嵌入以及加噪的目标速度,构成无序 Token 集合输入 Diffusion Transformer(DiT)网络进行多步去噪恢复,最终通过时序累加还原为高保真未来轨迹。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入:首帧 RGB 图像<br/>+ 观测历史轨迹与遮挡状态"] --> B["视频预处理与相机运动补偿<br/>RANSAC单应变换解耦背景与动物坐标"]
    B --> C["行为轨迹 Token 构建<br/>拼接DINOv3特征/历史运动/加噪未来"]
    C --> D["遮挡感知速度空间重参数化<br/>时序差分速度+缺失段插值+可见度指示"]
    D --> E["轨迹扩散 Transformer 去噪生成<br/>初始坐标位置编码+DiT自注意力建模"]
    E --> F["输出:未来点轨迹序列<br/>+ 动态遮挡状态(支持全局位移控制)"]

关键设计

1. 视频预处理与相机运动补偿:解耦背景相机运动并归一化世界坐标 野生动物纪录片与野外视频通常伴随剧烈的摄影师运镜、变焦以及手持晃动,若直接在像素坐标系下训练预测模型,网络将被迫拟合相机的外部运动而非动物自身的运动学生物规律。为在缺乏高精度 3D 传感器和精确几何深度的野外条件下获得近似的世界坐标系,本文开发了一套稳健的自动化数据清洗管线。管线首先采用 BootsTAPIR 对全视频提取高密度点轨迹,并通过计算相邻帧间平滑运动点数量的突变阈值进行鲁棒的镜头切分(Shot Detection)。在每个独立镜头内,联合调用 Grounding-DINO 检测动物边界框并由 VideoSAM 进行视频时序分割,锁定动物实例前景掩码。为了精确估计相机运镜,算法将完全位于动物掩码内部的运动点滤除,利用仅分布在静态自然背景上的背景点轨迹执行 RANSAC 算法,逐帧求解背景单应性矩阵 \(H_t\)。在获得各帧单应矩阵后,将动物首帧边界框向外扩展 50% 作为规范化参考系,通过 \(H_1 H_t^{-1}\) 映射消除镜头平移与缩放,并将坐标线性归一化到 \([0, 1]^2\) 区间。同时,在动物前景掩码内采样点轨迹时,引入了针对细长生物结构(如四肢、长尾、耳朵)的采样偏置权重,确保细粒度关节在轨迹集合中拥有充分的表征密度。由此构建的 300 小时 MammalMotion 数据集揭示:野生动物的位移幅度严格服从对数正态分布(Log-Normal Distribution)而非传统假设的幂律分布,反映出复杂自然运动是多重独立生物与物理因素乘性交互作用的结果。

2. 行为轨迹 Token 构建:融合局部 DINOv3 语义与时序历史 表面点轨迹集合天然具备无序性(Unordered Set),既没有规整的 2D 网格拓扑,也没有预定义的骨骼层次图。如何赋予每个空间散落的散点以明确的解剖部位属性与物理语义?本文设计了单轨迹专属的 Token 构造机制。模型在首帧图像截窗上提取预训练冻结的 DINOv3 特征图,DINOv3 凭借大规模自监督视觉表征蕴含了丰富的动物身体部位先验(如四肢末端、躯干、头部轮廓)。对于第 \(n\) 条轨迹在首帧的初始位置 \((x_1^n, y_1^n)\),利用双线性插值采样得到对应的局部视觉特征向量 \(f_n^{\text{DINO}}\)。随后,提取前 \(T_c\) 步历史时段内的已知速度序列 \((\dot{x}_{1:T_c-1}^n, \dot{y}_{1:T_c-1}^n)\) 并进行正弦位置编码,与标量遮挡历史 \(O_{1:T_c}^n\) 一同拼入特征。最终,将当前扩散时间步 \(\tau\) 对应的带噪未来速度目标 \(\hat{V}\) 与带噪遮挡状态 \(\hat{O}\) 在通道维度与视觉特征拼接,得到完整的输入 Token: $\(Z_n = [\mathbf{Z}_{\tau, n}^{\text{diff}}, f_n^{\text{DINO}}, V_{1:T_c}^n, O_{1:T_c}^n]\)$ 各点 Token 经由线性层投影到隐空间维度 \(D_T\) 后,额外叠加由初始绝对二维坐标 \((x_1^n, y_1^n)\) 计算得到的 2D 正弦位置编码。这一设计使得 Transformer 无需依赖人为指定的点排序顺序,仅凭空间位置嵌入与自注意力交互即可自然感知各表面点之间的空间相对距离与非刚性协作关系。

3. 遮挡感知速度空间重参数化:插值消除强相关性并联合建模可见度 若直接以未来各时间步的绝对坐标 \(X \in \mathbb{R}^{T \times N \times 2}\) 作为扩散生成目标,网络训练将面临两大严重缺陷:一是绝对坐标序列具有极高的自相关性,其方差绝大部分被起始位置所占据,真实运动动力学的微小增量容易被数值淹没;二是野外动物剧烈的步态交替和自遮挡(例如四肢在躯干后侧穿行、尾巴摆动隐匿)会导致轨迹在不可见帧处坐标缺失。为此,本文将扩散目标重参数化为时序速度增量与遮挡指示标量的组合 \(\mathbf{Z}_0^{\text{diff}} = \{\gamma V, \beta O\}\),其中速度分量定义为前后帧坐标差:\(\dot{x}_t^n = x_{t+1}^n - x_t^n\)\(\dot{y}_t^n = y_{t+1}^n - y_t^n\)。针对不可见时段,采用两端最近可见帧 \((i, j)\) 进行线速度线性插值填补: $\(\dot{x}_t^n = \frac{x_i^n - x_j^n}{i - j}\)$ 若轨迹直至序列结束均未再出现,则补零处理。尽管遮挡指示值 \(O_t^n \in \{0, 1\}\) 在理论上属于离散布尔量,但实验证明在经过合适的缩放因子 \(\beta\) 调节后,标准的连续高斯加噪扩散过程完全能够将其高质量去噪还原为离散判决。生成阶段在速度空间完成多步去噪后,通过对预测速度沿时间维度进行确定性累加,即可精确复原各点的连续轨迹: $\(x_t^n = x_1^n + \sum_{s=1}^{t-1} v_{x, s}^n, \quad y_t^n = y_1^n + \sum_{s=1}^{t-1} v_{y, s}^n\)$

4. 轨迹扩散 Transformer 去噪生成:置换不变性与全局运动控制 为灵活捕获自然界动物未来行为高度发散的多模态分布(如猎豹可能选择加速冲刺、急停转向或原地潜伏),去噪骨干网络采用了基于自注意力机制的 Diffusion Transformer(DiT)。由于输入序列是由 \(N\) 个点轨迹 Token 构成的无序集合,标准自注意力操作天然具备置换等变性(Permutation Equivariance),能够无损建模不同物种任意数量、任意分布的非刚性点集。更重要的是,除了每个 Token 自带的局部上下文,网络还需要感知全局时序信息与高级意图控制。模型通过线性层分别嵌入扩散时间步 \(\tau\) 与可选的用户期望全局位移向量 \(d \in \mathbb{R}^2\): $\(d = \frac{\sum_{n=1}^N O_T^n \left[(x_T^n, y_T^n) - (x_1^n, y_1^n)\right]}{\sum_{n=1}^N O_T^n}\)$ 该全局嵌入通过自适应层归一化(Adaptive Layer Norm, AdaLN)逐层注入到 DiT 的每个 Transformer Block 中。当缺少显式位移控制指令时,直接将 \(d\) 的嵌入置零以支持完全无约束的自发行为发散采样;而当给定目标位移时,AdaLN 机制能够有效调控全局速度分布,引导全身非刚性骨骼与肌肉组织协同响应期望运动方向。

损失函数 / 训练策略

在前向扩散过程中,遵循 DDPM 框架对目标信号 \(\mathbf{Z}_0^{\text{diff}}\) 进行高斯噪声加噪: $\(q(\mathbf{Z}_\tau^{\text{diff}} \mid \mathbf{Z}_0^{\text{diff}}) = \mathcal{N}\left(\mathbf{Z}_\tau^{\text{diff}}; \sqrt{\bar{\alpha}_\tau} \mathbf{Z}_0^{\text{diff}}, (1 - \bar{\alpha}_\tau) \mathbf{I}\right)\)$ 其中加噪调度采用从 \(\beta_1 = 0.0001\)\(\beta_S = 0.02\) 的线性噪声表,共设置 \(S=1000\) 个训练步。模型 \(f_\theta\) 负责直接从带噪张量中回归干净目标 \(\mathbf{Z}_0^{\text{diff}}\),训练目标为最小化带条件输入的 L1 预测损失: $\(\mathcal{L} = \mathbb{E}_{\mathbf{Z}_0^{\text{diff}}, \tau, \epsilon} \left[ \| \mathbf{Z}_0^{\text{diff}} - f_\theta(\mathbf{Z}_\tau^{\text{diff}}, \mathbf{Z}^{\text{cond}}, \tau) \|_1 \right]\)$ 其中条件变量集合包含首帧图像特征、初始点坐标、历史速度序列、历史遮挡及可选全局位移:\(\mathbf{Z}^{\text{cond}} = \{I, X_1, V_{1:T_c}, O_{1:T_c}, d\}\)

在推理阶段,为了大幅提升采样效率,采用确定性 DDIM 采样策略(\(\eta=0\))。通过跳步策略将推理步数从 1000 步压缩至 100 步,在保持预测轨迹平滑性与保真度无损的前提下实现了 \(10\times\) 推理加速。实验设置中观测历史为 \(N_{\text{cond}}=4\) 帧(约 0.27 秒),以 15 FPS 的速率向未来预测 28 个时间步(约 1.87 秒)的连续动作。

实验关键数据

主实验

评估在经过严格筛选与相机补偿的 MammalMotion 数据集上展开。对比模型涵盖非学习基线(静止预测 No-Motion、等速外推 Constant Velocity、真实平均速度 Oracle Velocity)、通用无监督点轨迹预测模型 WHN(Zero-Shot),以及机器人操作领域的点轨迹预测代表模型 Track2Act。评测指标分为两类:分布级指标包括速度与加速度分布的 Fréchet 距离(FD(V)、FD(A))、轨迹方差(Var(V)、Var(A))以及视频运动距离(FVMD);实例级指标采用 Best-of-5 评估,包括平均位移误差(ADE)、终点位移误差(FDE)、视频运动距离(VMD)以及阈值内准确率(PWT,像素容差阈值覆盖 1 到 16 像素)。

下表展示了全数据集(All Data)在高运动幅度(High Motion)及全体运动组合(Combined)下的核心定量结果:

设置 方法 FD(V)↓ (×10³) FD(A)↓ (×10³) FVMD↓ (/10³) ADE↓ FDE↓ VMD↓ PWT↑ (%)
高运动 (High) Ground Truth (真值) - - - - - - -
高运动 (High) No motion (无运动基线) 27.10 7.51 481.99 0.325 0.596 6.50 12.44
高运动 (High) Constant vel (恒速外推) 13.70 7.51 210.47 0.286 0.591 5.02 11.94
高运动 (High) WHN (零样本) 25.20 3.19 280.77 0.262 0.538 5.74 11.62
高运动 (High) Track2Act 11.80 4.81 76.28 0.136 0.294 4.50 21.79
高运动 (High) Ours (uncond,无位移先验) 8.96 3.74 49.30 0.119 0.275 4.33 26.01
高运动 (High) Oracle vel (真值速度参考) 12.10 7.51 326.80 0.110 0.156 7.04 14.70
高运动 (High) Ours (cond,带位移引导) 4.86 3.33 40.24 0.068 0.103 4.25 31.50
全体综合 (Combined) No motion 4.66 1.53 204.14 0.099 0.180 4.82 53.94
全体综合 (Combined) Constant vel 2.59 1.53 89.77 0.104 0.215 5.02 41.15
全体综合 (Combined) WHN 5.34 0.691 94.70 0.105 0.200 4.85 29.92
全体综合 (Combined) Track2Act 2.52 1.09 26.17 0.053 0.110 3.48 56.59
全体综合 (Combined) Ours (uncond,无位移先验) 1.96 0.877 17.00 0.046 0.102 3.31 60.01
全体综合 (Combined) Oracle vel 2.26 1.53 185.62 0.042 0.058 5.57 51.74
全体综合 (Combined) Ours (cond,带位移引导) 1.07 0.778 14.38 0.028 0.042 3.26 63.48

消融实验

为了进一步探究在单一属类(如猫科豹属 Panthera,包含狮子、老虎、美洲豹等四足大型猫科动物)上训练与在大规模跨物种全集预训练的差异,以及回归方法(ATM)与扩散模型的差距,作者在 Panthera 子集上进行了系统对比与跨域迁移实验:

训练配置 / 方法 评估集状态 FD(V)↓ (×10³) FD(A)↓ (×10³) FVMD↓ (/10³) ADE↓ FDE↓ PWT↑ (%) 说明 / 核心结论
No motion (基准) Panthera (高运动) 16.60 5.61 335.41 0.211 0.393 13.22 无法应对大幅肢体变动
Constant vel (基准) Panthera (高运动) 7.49 5.61 149.52 0.193 0.413 16.73 线性外推导致动作僵硬失真
ATM (回归模型) Panthera (高运动) 6.52 6.18 112.71 0.143 0.262 16.31 确定性回归易陷入平滑平均态
Track2Act (豹属训练) Panthera (高运动) 6.32 4.30 104.85 0.135 0.245 16.72 缺少初始位置编码与局部语义先验
Ours (豹属专属训练) Panthera (高运动) 3.71 5.06 84.79 0.107 0.209 20.68 域内训练显著优于回归与基线扩散
Ours (全集预训练直接迁移) Panthera (高运动) 1.96 3.74 49.30 0.119 0.275 26.01 全数据集多样性带来强大的跨物种迁移收益
Ours (带位移引导 cond) Panthera (高运动) 2.82 4.19 79.38 0.067 0.097 27.31 全局方向引导显著削减端点位移误差

关键发现

  • 全数据集预训练的正向跨物种迁移效应:对比在 Panthera 单一分类子集上训练与在 300 小时 MammalMotion 全集上训练的模型,高运动测试集上的 FVMD 从 84.79 剧幅下降到 49.30,PWT 从 20.68% 跃升至 26.01%。这有力证明野生动物复杂的肢体关节动力学存在深层的底层物理共享性,大规模全物种训练不会稀释形态特征,反而通过多物种的运动先验互补极大增强了非刚性形变泛化能力。
  • 扩散生成相较于确定性回归的保真度优势:ATM 等基于直接坐标回归的模型虽然能降低均方误差,但在时序加速度分布 FD(A)(6.18 vs 本文 5.06/3.74)和运动一致性 FVMD 上大幅落后。回归方法倾向于预测统计平均值,丧失了生物运动特有的摆动突变与细粒度节奏,而扩散模型能够采样出符合解剖学约束且具有动作多样性的逼真步态。
  • 位移向量引导的解耦控制能力:引入平均位移向量 \(d\) 后,ADE 与 FDE 几乎腰斩(高运动全集 ADE 从 0.119 降至 0.068,FDE 从 0.275 降至 0.103)。然而单纯依赖真实位移进行刚性外推的 Oracle Velocity 基线其 FVMD 却高达 326.80,表明仅有宏观位移无法产生合理的关节微动态,本文架构成功实现了全局行为意图引导与局部微观非刚性运动协调的解耦。
  • 与像素级视频扩散模型(SVD)的定性对比:在长尾稀有物种(例如在训练集仅占 0.39% 的野兔)上,Stable Video Diffusion(SVD)等像素生成模型发生严重退化,不仅无法生成合理的觅食步态,甚至破坏了动物拓扑结构(如将兔耳异化为鸟翼);而本文通过点轨迹抽象,在仅有极少样本的情况下依然准确预测出灵动的头部嗅探与四肢微调动作。

亮点与洞察

  • 行为建模粒度的范式降维:将长期被像素绑架的视频行为预测,降维到以稠密点轨迹为核心的视觉 Token 空间。该抽象彻底剥离了光照、纹理、复杂场景背景等巨量无关信息,使 Transformer 能够以极高的数据与算力效率直击生物力学动力学本质。
  • 利用野外摄影物理特性的坐标解耦:敏锐地抓住野生动物摄影中以远摄和固定机位为主的光学特性,借助背景 RANSAC 单应矩阵实时抵消相机运镜与镜头缩放,以极低代价构建了近似的“世界坐标系”,有效解决了非受控野外视频中相机与个体运动纠缠的顽疾。
  • 强大的长尾与域外实体泛化潜力:即便对于极低频出现的物种(如仅占 0.025% 的驯鹿、0.31% 的北极熊、0.50% 的羊驼),模型依然能够输出符合步态生理学的连续轨迹;甚至在面对零样本的人类、非哺乳动物(鸵鸟、蝴蝶)及完全非生物实体(乐高机器人)时,展现出令人惊讶的物理运动一致性。

局限与展望

  • 2D 轨迹在大幅度 3D 旋转翻滚下的表征盲区:目前框架建立在 2D 投影点轨迹之上,当动物发生大幅度三维翻滚、剧烈掉头或穿越密集灌木林造成全身长时间连续遮挡时,2D 速度插值与不可见状态恢复容易发生累积漂移,难以完全替代原生 3D 物理因果推理。
  • 背景单应矩阵对近景大视差场景的假设局限:基于 RANSAC 的单应矩阵补偿主要适用于平面背景或大景深远摄镜头。当无人机低空盘旋、存在多层前景树枝遮挡或近距离剧烈平移时,三维视差(Parallax)无法被单应矩阵完全消除,可能残留微弱的伪相机运动。
  • 轨迹到高保真视频画面的重渲染依赖:当前成果的可视化主要采用将首帧局部图像圆形 Patch 沿预测轨迹平移叠加的方式,尚未与下游轨迹引导的视频生成扩散渲染器(如 ControlNet 类型的轨迹反演生成)打通端到端渲染管线。

相关工作与启发

  • vs Track2Act / Any-Point Trajectory Modeling (ATM): 机器人领域的先导工作主要聚焦于刚性操作环境与平滑动作,往往强假设目标全程可见,并直接在绝对坐标系下进行回归或扩散,缺乏初始局部语义感知与遮挡建模;本文针对极其复杂的野外非刚性多物种形变,提出了速度重参数化、局部 DINOv3 融合与显式可见度预测机制。
  • vs 像素级视频预测 (Video Diffusion / SVD): 像素级模型受制于像素重建负担,在长尾物种上极易出现形态漂移与结构异化;本文证明将点轨迹作为显式行为 Token 能以更少的数据和算力达成更高保真度的物理运动一致性。
  • vs 参数化 3D 动物重建 (MagicPony / 3D Safari / BITE): 现有 3D 方法必须针对斑马、猎犬、马等单一类别精心构建参数化骨架网格,无法泛化到千万种自然界物种;本文是类别无关(Category-Agnostic)的通用拓扑架构。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次将稠密点轨迹确立为非刚性野生动物行为预测的统一视觉 Token,并揭示了动物运动的对数正态分布统计特性。
  • 实验充分度: ⭐⭐⭐⭐⭐ 建立 300 小时高质量野生动物基准 MammalMotion,覆盖全集与子集、不同运动强度区间及多重分布/实例级评估指标。
  • 写作质量: ⭐⭐⭐⭐⭐ 问题意识鲜明,方法设计紧凑自洽,理论分析与生物学知觉背景结合深入。
  • 价值: ⭐⭐⭐⭐⭐ 为计算动物行为学(Computational Ethology)提供了全新的自动化无监督范式,并为具身智能与世界模型的动作预测开辟了结构化路线。