What Moves? Localized Motion Representations for Compositional Scene Control¶
会议: ECCV 2026
论文: ECCV 原文
领域: 视频生成
关键词: 局部运动表征 / 组合式场景控制 / 运动迁移 / 轨迹预测 / 扩散模型
一句话总结¶
针对现有视频运动表征无法解耦实体级动态与场景上下文的难题,本文提出一种基于空间提示的局部运动表征学习方法,在保留全景上下文的前提下通过内容引导提取区域时序动态,并借助掩码轨迹预测实现精准、可组合的实体级运动控制。
研究背景与动机¶
现实物理世界的视觉场景天然具备组合特性,多个实体及其复杂的运动轨迹在共享的环境中同步演化。例如在自动驾驶场景中,车辆行驶、行人穿行动作以及背景相机的推拉移动各自呈现完全不同的时空规律;在人机交互或日常操作中,肢体动作与被操作物体的位移也构成了协调但可拆分的动态单元。然而,现有视频生成与控制方法在表征动态时往往陷入两极分化:一类方法采用全局隐编码表征整段视频动态(如 DisMo),将所有物体的运动与背景相机运动纠缠在一起,导致运动迁移时产生严重的运动泄漏(motion leakage)与非目标区域伪影;另一类方法依赖密集的像素级信号(如光流、点轨迹或 ControlNet 空间条件,如 DragAnything、Tora 等),这类几何信号虽然具备局部约束力,却缺乏高层语义抽象,且强绑定于原视频的特定视角、画面构图与物体几何形状,难以跨越视角变化或外形差异进行鲁棒迁移。
若想实现实体级别的局部动态隔离,最朴素的尝试是对目标物体进行空间裁剪(Spatial Crop)后再提取运动特征。然而,运动本身具有天然的“关系依赖性”(Relational Nature),其真实物理语义高度依赖于全局参考系、相机自我运动(Camera Ego-motion)以及物体与环境的相对交互。一旦将实体从全局画面中硬性裁切剥离,局部的相对位移就会失去物理锚点,不仅无法消解全局相机移动造成的假象,甚至会导致动态意图产生严重歧义;而在全局特征图上进行后验特征掩码(Post-hoc Masking)又无法从编码源头引导网络聚焦于目标实体的运动模式。
针对局部性与全局上下文难以兼得的核心矛盾,本文提出了保留全局场景感知并结合空间区域提示的局部运动表征学习框架。核心 idea:在编码阶段保留完整视频的全景上下文并引入时不变内容嵌入作为区域提示查询,使网络在全局视野下提炼特定实体的局部运动 Token,并通过预测实体内部稀疏点的未来轨迹构建端到端自监督约束,从而获得兼具全局物理参照与高空间特异性的可提示局部运动表征。
方法详解¶
整体框架¶
本文框架旨在从包含 \(T\) 帧的输入视频 \(V = \{x_t\}_{t=1}^T\) 及首帧给定的 \(K\) 个实体区域掩码 \(S = \{s_k\}_{k=1}^K\) 中,提取出具备持久性且针对特定实体的时序运动 Token 序列 \(m_k = \{m_{k,t}\}_{t=1}^T\)。整个系统由三大核心组件协同构成:内容编码器(Content Encoder)提取时不变的静态外观与语义锚点;运动编码器(Motion Encoder)在观察整段全景视频的同时接收内容嵌入作为查询,输出实体专属的局部运动 Token;掩码轨迹解码器(Masked Tracks Decoder)则以稀疏点未来时空轨迹预测为自监督目标,驱使运动 Token 专注于真实的物理运动规律而剥离静态外观偏置。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入:完整视频 V<br/>与初始实体区域掩码 sk"] --> B["全景感知提示式运动编码<br/>保留全局上下文并以实体内容作为查询"]
A --> C["时不变内容引导与外观解耦<br/>提取静态语义嵌入剥离外观干扰"]
C --> B
B --> D["掩码稀疏轨迹预测监督<br/>基于当前帧与运动Token预测未来点轨迹"]
C --> D
D --> E["下游应用:CogVideoX 组合式生成<br/>与零样本局部动作识别"]
在推理与生成阶段,针对目标图像中的指定实体区域,提取出的运动 Token 可以作为条件信号注入到预训练视频扩散模型(如 CogVideoX-5B)中,实现单实体运动迁移、跨多场景多实体的组合式动画驱动,或者直接作为特征向量用于细粒度局部动作识别。
关键设计¶
1. 全景感知提示式运动编码:在全场景视野下提取实体专属动态
传统局部特征提取直接裁切局部补丁,破坏了诸如背景光流、相机移动及物体间遮挡交互等关键线索。本文的运动编码器 \(E_\theta\) 反其道而行之,直接接收完整的全景视频序列 \(V\) 作为输入,保留全局时空视场。为了从复杂的全景动态中精准分离出特定实体的运动,编码器将内容编码器输出的实体内容嵌入 \(c = \{c_k\}_{k=1}^K\) 作为交叉注意力的交互查询(Query)。这种设计使编码器既能观察到全局场景的相对参照系,又能借助语义查询将注意力牢牢锁定在指定的空间区域上,有效抑制了来自场景其他动态物体或背景运动的信号渗漏。
2. 时不变内容引导与外观解耦:语义查询剥离空间外观与身份偏置
运动表征的核心挑战在于防止动态特征退化为静态外观特征的简单记忆,从而保证运动在迁移到全新外观物体时具备通用泛化能力。内容编码器 \(C_\phi\) 接收参考帧图像 \(x_i\) 与区域分割掩码 \(s_k\),通过池化抽取一个时不变的语义内容 Token \(c_k = C_\phi(x_i, s_k)\)。该 Token 仅负责定义“被选中的实体是谁”,并作为身份上下文输入给运动编码器和后续轨迹解码器。由于静态外观身份已被 \(c_k\) 显式承载,时序演化的运动 Token \(m_{k,t}\) 无需承担记录纹理、颜色等外观信息的压力,从表征机制层面迫使 \(m_{k,t}\) 纯化为仅刻画空间位移与形变动态的抽象载体。
3. 掩码稀疏轨迹预测监督:局部未来点追踪构建端到端运动目标
为了在无须人工标注密集运动标签的前提下训练高质量运动表征,本文设计了基于未来轨迹预测的自监督目标。对于每个实体区域 \(S_k\),系统在初始区域内部采样稀疏查询点,并通过点追踪算法提取其在时序上的基准运动轨迹 \(p_{k,1:T}\)。在训练阶段,掩码轨迹解码器 \(D_\psi\) 接收当前时刻视频帧 \(x_t\)、当前点位置 \(p_{k,t}\)、内容嵌入 \(c_k\) 以及当前时刻的局部运动 Token \(m_{k,t}\),目标是确定性地回归未来 \(L\) 步的点位置 \(p_{k,t+1:t+L}\)。由于轨迹预测损失严格限定在实体内部有效点上计算,网络必须将局部运动的精准动力学信息压缩进 \(m_{k,t}\) 中,同时彻底避免将非目标区域的全局噪声编码进来。
损失函数 / 训练策略¶
模型采用确定性回归方式训练轨迹解码器,采用 \(\ell_2\) 范数计算实体内部稀疏轨迹的未来步长预测误差:
该损失仅在实体内部有效未来轨迹点上计算。整个预训练阶段使用 AdamW 优化器,在 OpenVid-1M 与内部采集的高质量视频数据集上以 batch size 128 联合训练 600k 步。当迁移至下游视频生成任务时,以冻结的 CogVideoX-5B 扩散 Transformer 作为基座,将学习到的局部运动 Token 与目标帧控制条件拼接注入,实现零样本或轻量适配的精准运动操控。
实验关键数据¶
主实验¶
在多实体组合式运动迁移(Composable Motion Transfer)基准测试中,评估将不同源物体的局部动态分别提取并注入到同一多主体目标画面中的效果。对比基线涵盖先进的低级别轨迹控制模型(ATI、WanMove、Tora)以及全局语义运动迁移模型。评估指标包括时序一致性(Temporal Consistency)、目标区域运动保真度(In-Region Motion Fidelity)、非目标区域运动泄漏(Out-of-Region Motion Leakage,越低越好)以及运动选择性(Motion Selectivity,保真度与泄漏量之差,越高越好)。
| 方法 | 生成基座模型 | 参数量 | 时序一致性 ↑ | 目标区域保真度 ↑ | 非目标区域泄漏 ↓ | 运动选择性 ↑ |
|---|---|---|---|---|---|---|
| ATI [1] | Wan 2.1 | 14B | 0.9634 | 0.7148 | 0.3857 | 0.3291 |
| WanMove [7] | Wan 2.1 | 14B | 0.9792 | 0.7059 | 0.4110 | 0.2949 |
| Tora [59] | CogVideoX | 5B | 0.9766 | 0.6520 | 0.3904 | 0.2616 |
| 本文 (Ours) | CogVideoX | 5B | 0.9831 | 0.6718 | 0.2604 | 0.4114 |
在人类主观评测(Human Preference Study)中,就生成视频的真实感(Realism)、运动迁移质量与局部性(Transfer Quality & Locality)以及伪影抑制(Fewer Artifacts)三项维度统计偏好投票率:
| 方法 | 生成基座模型 | 参数量 | 画面真实感 (%) ↑ | 运动迁移质量 (%) ↑ | 伪影更少 (%) ↑ |
|---|---|---|---|---|---|
| ATI [1] | Wan 2.1 | 14B | 1.96 | 4.90 | 5.23 |
| WanMove [7] | Wan 2.1 | 14B | 14.05 | 14.38 | 14.38 |
| Tora [59] | CogVideoX | 5B | 13.73 | 17.32 | 15.69 |
| DisMo [35] | CogVideoX | 5B | 21.24 | 26.80 | 20.26 |
| 本文 (Ours) | CogVideoX | 5B | 49.02 | 36.60 | 44.44 |
消融实验¶
在 A2D 局部动作分类任务中,验证全景上下文与局部掩码提示对运动理解能力的影响。若将本文方法退化为输入裁切补丁模式(\(\text{Ours}_{\text{rgb}}\))或退化为全帧无差异掩码模式(\(\text{Ours}_{\text{global}}\)),性能均发生剧烈衰退。下表同时报告了当全图掩码退化为全局编码器时,在通用零样本动作识别基准上的表现(Top-1 Accuracy,kNN \(k=20\)):
| 设定 / 模型 | SSv2 (%) ↑ | Jester (%) ↑ | Diving48 (%) ↑ | ARID (%) ↑ | IARD (%) ↑ |
|---|---|---|---|---|---|
| DINOv2 [31] | 10.3 | 23.2 | 9.39 | 14.5 | 76.1 |
| VideoMAE [44] | 7.1 | 20.1 | - | 17.3 | 73.4 |
| V-JEPA2 [2] | 22.2 | 40.8 | 11.1 | 28.0 | 87.6 |
| SemanticMoments\(_{\text{DINO}}\) [18] | 11.4 | 37.3 | 9.85 | 22.0 | 62.7 |
| SemanticMoments\(_{\text{V-JEPA2}}\) [18] | 31.5 | 52.2 | 12.7 | 38.3 | 92.5 |
| DisMo [35] | 24.6 | 69.8 | 20.9 | 55.3 | 92.0 |
| 本文 (Ours 全局提示模式) | 26.5 | 72.8 | 17.1 | 55.4 | 93.0 |
在外观扰动下的运动检索任务(SemanticMoments 合成变换基准)中,针对视角变换、外观替换与样式渲染变化,本文模型检索准确率达到 89.6%,远超静态特征模型 DINOv2(44.4%)、VideoMAE(79.2%)与通用视频表征 V-JEPA2(74.4%),与专门训练的全局运动表征 DisMo(90.0%)基本持平。
关键发现¶
- 运动泄漏的大幅抑制:在组合式迁移实验中,本文将非目标实体的运动泄漏率从基线的 0.3857~0.4110 骤降至 0.2604(降低超过 32%),运动选择性指标由基线的 0.2616~0.3291 跃升至 0.4114,证明了基于内容查询提取局部运动对空间隔离的决定性作用。
- 全景上下文是局部理解的前提:消融实验显示,如果直接裁切视频输入(\(\text{Ours}_{\text{rgb}}\)),动作识别准确率断崖式下跌,表明剥离场景全局参考会导致局部动力学意图无法明确解析;而若放弃局部查询(\(\text{Ours}_{\text{global}}\)),则受背景其他移动主体干扰。只有“全景观察 + 局部提示”兼顾方案才能兼得高精度与强隔离。
- 外观无关性与通用泛化:经过稀疏轨迹自监督训练后,局部运动表征成功摆脱了对目标几何结构的过拟合。在全图提示下,模型能够无缝退化为高性能全局运动编码器,并在多项动作识别榜单上超越 VideoMAE 与 V-JEPA2。
亮点与洞察¶
- 全景输入与局部查询的统一框架:巧妙地打破了“局部控制必靠裁切”的传统思维,利用全视频特征与局部内容查询的交互,既保留了相机运动和物体交互的全局参考系,又实现了目标实体的高纯度提取。
- 稀疏轨迹监督作为运动自监督诱导器:没有引入昂贵的人工动作标签,而是使用现成点追踪器的未来位移预测作为伪标签任务,迫使网络捕捉深层物理形变与位移轨迹,天然地将静态纹理信息剥离。
- 局部与全局的双模态兼容:通过简单输入全景掩码,局部编码器可无缝退化为顶尖水平的全局视频动作表征模型,具备极高的表征迁移价值。
局限与展望¶
- 极端密集重叠遮挡下的身份追踪漂移:当场景中存在高度相似且频繁严重互遮的实体时(例如密集人群),时不变内容嵌入可能出现注意力弥散,导致运动分配混淆。
- 强剧烈变形非刚体的细粒度局限:当前的未来轨迹预测依托于稀疏点追踪基准,对于流体、烟雾、布料褶皱等极高自由度非刚体动态的细腻表征仍有提升空间。
- 未来方向:可进一步将可变形 3D 高斯或神经辐射场动态融入局部表征中,实现真正的 3D 物理感知局部动力学控制。
相关工作与启发¶
- vs DisMo [35]: DisMo 采用全局潜在特征提取整体运动,无法指定具体物体并造成组合场景下的运动混杂;本文通过空间区域掩码提示与内容嵌入引导,首次实现了实体级别的独立提取与跨场景灵活重组。
- vs Tora [59] / WanMove [7]: Tora 与 WanMove 依赖显式的低级别点轨迹引导,当源视频与目标画面存在视点跳跃或实体骨骼差异时容易产生几何拉伸畸变;本文提取的是抽象的高层运动语义 Token,既保持了时空动力学特性,又对几何外观形变具备良好的容忍度与泛化力。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 巧妙解决了局部运动理解需要全局参考系的矛盾,提出了极具启发性的提示式局部运动表征架构。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖组合式生成、运动泄漏定量评估、人类偏好评测、动作识别及外观扰动检索,对比维度极全面。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,图文对应清晰,动机推导与实验论证水到渠成。
- 价值: ⭐⭐⭐⭐⭐ 为组合式可控视频生成与视频细粒度理解提供了统一且即插即用的动态表征新范式。