STANCE: Controllable Video Generation for Structured Dynamics via Sparse-To-dense ANChored Encoding¶
会议: ECCV 2026
论文: ECCV 原文
代码: 待开源
领域: 视频生成
关键词: 视频生成、物理交互、可控扩散模型、Dense RoPE、几何辅助生成
一句话总结¶
STANCE 针对视频生成中稀疏控制信号易被稀释和物理交互不连贯的问题,提出了将用户粗粒度提示转化为像素对齐的 2.5D 实例运动线索,结合 Dense RoPE 锚定与共享 DiT 权重的几何辅助生成流,实现了高保真且符合物理规律的刚体动力学视频可控生成。
研究背景与动机¶
近年来视频生成模型凭借 Diffusion Transformer(DiT)在视觉逼真度和长程时空建模上取得了显著突破。然而,在涉及刚体碰撞、速度惯性、接触判定等具有严密结构化动力学的物理交互场景中,现有模型依然频繁出现物理不一致现象。例如,物体在碰撞前悬停迟滞、发生无接触反弹、穿模错位,或者在连续运动中身份与纹理严重漂移。这表明现有架构普遍偏向于像素级纹理的高保真重构,而缺乏对复杂物理动力学演化的内在约束。
深入分析这一痛点的建模根源,主要存在两个实际瓶颈:其一,人类用户所能提供的运动先验通常非常稀疏(如粗粒度的 2D 拖拽箭头),在经过扩散模型的 patchify 下采样和浅层注意力后,有效 token 占比极低并迅速被稀释,导致模型无法获得精确的空间导向;其二,控制信号往往缺乏深度与物理属性感知,无法有效消解相机视角运动与物体三维运动之间的歧义,更难以建模质量差异引发的动量传递反转。现有轨迹驱动方法虽能稳定运动,却强依赖密集的逐帧脚本,编辑成本极高。
为了在保留大模型生成先验的同时赋予其精准的物理控制能力,本文从稀疏先验的致密化与空间锚定机制切入。核心 idea:将用户极简的二维箭头与物理标量提升为像素对齐的 2.5D 实例线索,利用 Dense RoPE 在潜空间筛选并固化高显著性运动锚点,并在统一 DiT 内引入轻量几何辅助流充当“几何见证者”,通过自注意力联合正则化消除物理漂移。
方法详解¶
整体框架¶
STANCE 建立在 CogVideoX 等先进 DiT 架构之上,输入包括文本提示、首帧关键图像,以及用户交互指定的实例掩码、2D 运动箭头、深度变化标量 \(\Delta z\) 与物体质量 \(m\)。整个系统包含三个核心环节:首先,将稀疏用户先验稠密化为像素对齐的 2.5D 实例线索(Instance Cues);其次,通过 Dense RoPE 筛选非零活跃位置并赋予首帧旋转位置编码,保证控制 token 的显著性与空间寻址能力;最后,在 DiT 序列维度扩展出结构辅助流(深度或分割图),与 RGB 流共享时空注意力与运动线索,实现几何联合正则化。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入:首帧图像 + 实例掩码<br/>+ 运动箭头/深度增量/质量"] --> B["2.5D 实例线索构建<br/>流场平均与标量广播对齐"]
B --> C["Dense RoPE 空间锚定<br/>非零位置筛选与固定预算 RoPE"]
C --> D["序列级双流 DiT 生成<br/>RGB 流与几何辅助流联合自注意力"]
D --> E["输出:高物理一致性视频<br/>+ 几何结构图验证"]
关键设计¶
1. 2.5D 实例线索构建:消除透视歧义与融入物理属性
传统拖拽或箭头控制仅在 2D 平面施加位移,在相机移动或存在深度倾角时极易产生运动方向歧义,且完全忽略了碰撞动力学中至关重要的质量因素。针对这一问题,STANCE 设计了像素级对齐的 2.5D 实例线索(Instance Cues)。训练阶段,模型提取参考帧之间的光流并按实例掩码 \(\Omega^{(i)}\) 计算平均运动向量: $$ \bar{\mathbf{v}}^{(i)} = \frac{1}{|\Omega^{(i)}|} \sum_{(x,y)\in\Omega^{(i)}} \mathbf{O}(x,y) $$ 同时基于单目深度图差值计算实例沿视线方向的深度位移标量 \(\Delta z_i = \text{mean}_{p\in M_i} (D_{t+1}(p) - D_t(p))\)。在推理阶段,用户绘制的 2D 粗粒度箭头被光栅化至掩码区域内形成面内运动场,深度增量 \(\Delta z\)(正值表示远离相机向屏幕内运动,负值表示向屏幕外运动)与质量标量 \(m\) 则直接广播填充至相同掩码区域。四通道特征 \((u, v, \Delta z, m)\) 在空间上与图像严格对齐,使得 DiT 在预测动态演化时能够显式感知三维运动趋势与质量对抗结果。
2. Dense RoPE 空间锚定:防止下采样稀释与保持空间寻址
在扩散 Transformer 中,patchify 下采样操作会导致局部运动掩码在潜空间中高度稀疏。对于细小或细长物体,非零控制值常被大量零值包围,在浅层注意力中被严重稀释,导致控制失效。Dense RoPE 不采用全局缩放,而是专门提取掩码区域内的非零活跃网格索引集 \(\Omega = \{i \in \{1,\dots,L\} : \mathbf{M}_i = 1\}\)。根据预设的固定 token 预算 \(N\),当活跃索引数不足时进行平铺截断,超出时进行均匀下采样,构建出大小恒定的索引集 \(\mathcal{J}\)(\(|\mathcal{J}|=N\))。
对于选中的每个运动特征向量 \(\mathbf{x}^{\text{Cue}}_j\)(\(j \in \mathcal{J}\)),赋予其在首帧网格处的旋转位置编码(RoPE)参数,并通过可学习增益 \(g_k\) 调节特征强度: $$ \mathbf{q}^{\text{Cue}}_j = \mathbf{W}_q \left( \mathbf{x}^{\text{Cue}}_j \mathbf{p}^{\text{Cue}}_j \right), \quad \tilde{\mathbf{k}}^{\text{Cue}}_j = g_k \mathbf{W}_k \left( \mathbf{x}^{\text{Cue}}_j \mathbf{p}^{\text{Cue}}_j \right) $$ 这种机制将紧凑且高信噪比的运动锚点直接拼接入主注意力序列。由于每个 motion token 绑定了绝对的空间起点坐标,后续帧的视频 token 在各层时空注意力中均能可靠检索到其运动发起的几何位置,杜绝了运动漂移与目标身份混淆。
3. 序列级双流 DiT 生成:几何见证者约束与联合去噪
单纯依赖单一 RGB 扩散头优化时,模型往往落入局部最优,将容量耗费在高频纹理合成而牺牲物理结构轮廓。STANCE 在保持 DiT 骨干网络参数量完全不变的前提下,引入轻量级辅助结构流(单目深度或实例分割)作为“几何见证者”(Geometry Witness)。在序列维度上,将视频 token 长度扩展为 \(2L\): $$ \mathbf{X}^{1:2L}{\text{video}} = \left[ \mathbf{X}^{1:L}}} ; \, \mathbf{X}^{1:L{\text{aux}} \right] $$ 为了保持空间和时间的一致性,相同视空索引位置的 RGB token 与辅助 token 共享相同的位置编码,仅向辅助流注入一个可学习且零初始化的领域标记向量 \(\mathbf{d}_{\text{aux}}\) 进行模态区分。文本、RGB 序列与辅助序列共同拼接后进行全时空自注意力交互: $$ \mathbf{Z} \in {\mathbf{Q}, \mathbf{K}, \mathbf{V}} = \left[ \mathbf{W}_z(\mathbf{x}}}) ; \, \mathbf{fz(\mathbf{X}^{1:L}^*}}) ; \, \mathbf{fz(\mathbf{X}^{1:L}) \right] $$ 在训练时,联合优化两组去噪目标: $$ \mathcal{L} = \mathbb{E}}{t,\epsilon} \left[ |\hat{\epsilon} - \epsilon|^2 \right] $$ 辅助流直接惩罚形变与轮廓漂移,迫使注意力和隐空间表征锁定物体的刚体几何边界,从而让 RGB 流在无需密集逐帧监督的前提下自发形成清晰、连贯的接触与回弹物理效果。}} - \epsilon|^2 + \lambda_{\text{aux}} |\hat{\epsilon}_{\text{aux}
实验关键数据¶
主实验¶
评估基于 Kubric 构建的 200 个未见测试视频(100 个简单场景与 100 个真实合成场景)。衡量指标包括物理一致性核心指标 Physics IQ(综合衡量空间 IoU、时空 IoU、加权空间 IoU 与运动 MSE,范围 0-100,越高越好)以及感知真实度 FVD(越低越好)。基线涵盖轨迹引导模型与交互式视频控制模型。
| 方法 | 模型参数量 | Physics IQ (↑) | FVD (↓) |
|---|---|---|---|
| SG-I2V | - | 15.42 | 113.54 |
| Drag-Anything | - | 24.86 | 92.78 |
| MoFA-Video | - | 29.71 | 98.30 |
| MotionPro | - | 31.58 | 74.27 |
| VLIPP | - | 36.40 | 57.90 |
| Wan-Move | 14B | 47.50 | 45.78 |
| STANCE-2B (Ours) | 2B | 45.90 | 54.97 |
| STANCE-5B (Ours) | 5B | 47.62 | 50.74 |
消融实验¶
控制机制与联合生成消融(常规场景与小目标子集):
| 配置 | Physics IQ (常规) ↑ | Physics IQ (小目标) ↑ | FVD (常规) ↓ | FVD (小目标) ↓ | 说明 |
|---|---|---|---|---|---|
| 文本条件基线 | 24.08 | — | 97.40 | — | 仅文本提示,无空间引导 |
| + 低分辨率 2D 掩码 | 43.72 | 31.92 | 56.20 | 58.59 | 传统单张特征图拼接 |
| + Dense RoPE (仅 RGB) | 46.89 | 41.83 | 54.63 | 56.32 | 活跃位置重采样与首帧锚定 |
| + 联合分割流生成 | 47.96 | 45.12 | 53.09 | 53.35 | 边界约束清晰,小目标改善明显 |
| + 联合深度流生成 (Full) | 49.03 | 45.63 | 50.39 | 51.32 | 连续 2.5D 几何约束,整体最优 |
Dense RoPE 解耦消融分析:
| 活跃点重采样 (Re-samp.) | 首帧位置锚定 (FF-RoPE) | Physics-IQ (↑) | FVD (↓) | 说明 |
|---|---|---|---|---|
| \(\times\) | \(\times\) | 31.92 | 66.20 | 朴素下采样,小物体 token 严重缺失 |
| \(\checkmark\) | \(\times\) | 37.45 | 58.18 | 保证 token 数量但缺少稳定空间坐标 |
| \(\times\) | \(\checkmark\) | 35.21 | 54.74 | 具有绝对坐标但细小物体的 token 预算不足 |
| \(\checkmark\) | \(\checkmark\) | 37.83 | 54.63 | 两者互补,实现精确的空间连续控制 |
关键发现¶
- 小物体场景下的控制鲁棒性显著提升:在细小物体(Small-object)挑战集上,单纯使用 2D Map 引导时 Physics IQ 从常规的 43.72 剧降至 31.92(跌幅达 27%),而 Dense RoPE 使小物体性能大幅跃升至 41.83,验证了活跃点采样消除稀释瓶颈的关键作用。
- 几何辅助流的正则化收益:在相同网络容量下,引入深度流作为辅助任务使常规场景 Physics IQ 从 46.89 提升至 49.03,FVD 从 54.63 降至 50.39。深度流提供了连续的纵深透视关系,对接触碰撞前后的运动连贯性优化最为显著;而分割流在小物体边界界定上表现同样稳健。
- 与大规模轨迹基线对比的高效率:STANCE-5B 在无需外部复杂轨迹前置规划的情况下,Physics IQ 达到 47.62,比肩参数量近 3 倍的 14B 轨迹模型 Wan-Move(47.50),展现了 DiT 内置动力学外推的优越性。
亮点与洞察¶
- Dense RoPE 的显式空间保真设计:将活跃掩码位置重采样与第一帧绝对 RoPE 相结合,巧妙攻克了 Transformer 在图像下采样过程中细小物体控制信号被“平均化”抹除的根本痼疾。
- 无需额外参数的“几何见证”机制:将辅助模态以序列扩展(Sequence Extension)而非通道或批次扩展的方式送入 DiT,完全复用主干的自注意力计算通路,在推理或生成时用极小代价为像素纹理施加刚体轮廓约束。
- 用户友好度与物理维度兼顾:将 2.5D 深度偏置与标量质量 \(m\) 转化为可广播的密集特征通道,用户只需调整滑动条或轻点箭头即可驱动碰撞反弹、冲量守恒等复杂链式反应。
局限与展望¶
- 受限于刚体假设:目前方法重点针对刚体碰撞、滚动、滑动与多米诺骨牌效应建模,难以处理布料、流体或软体动物等复杂的非刚性形变与流体动力学。
- 对极端控制噪声的宽容度受限:当用户输入的运动箭头存在严重反常理扰动或剧烈冲突时,模型会在先验知识与外部提示间妥协,可能导致运动减弱或生成方向偏斜。
- 未来方向:可进一步探索结合非刚性物理属性标记(如弹性系数、粘滞系数),并将该框架扩展至通用具身机器人操作场景视频仿真中。
相关工作与启发¶
- vs VLIPP: VLIPP 主要依赖文本与视觉常识隐式驱动物理先验,缺乏精确的像素对齐导向,容易在碰撞前发生物体提前悬停反弹;STANCE 借助 2.5D 实例线索和 Dense RoPE 实现了严格对齐的动力学演化。
- vs MoFA-Video & MotionPro: 现有的运动场适配方案在较长序列或相机位姿变化时常面临纹理漂移与掩码泄露问题;STANCE 通过双流联合去噪使结构几何流直接锁死物体轮廓,外观保持能力大幅增强。
- vs Wan-Move (轨迹驱动模型): 纯轨迹方法依赖逐帧稠密路径输入,要求外部指定“去哪里的每一个步骤”;STANCE 仅定义初始速度与物理参数,由模型自发解算刚体运动,自由度与可控性更为平衡。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ 针对物理可控生成的痛点,提出了简洁高效的 Dense RoPE 锚定与序列级双流正则化设计。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 20 万条交互数据训练、细粒度小物体测试集、全面的控制/模态消融及真实世界视频测试。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,图文设计精准,动机阐述直击物理视频生成核心瓶颈。
- 价值: ⭐⭐⭐⭐☆ 为可控视频生成、虚拟仿真与具身智能世界模型提供了高实用性的控制管线范式。