Schroedinger’s Cat: Probabilistic Representation and Prediction of Potential Scene Kinematics¶
会议: ECCV 2026
论文: ECCV 原文
项目主页: https://compvis.github.io/schroedingers_cat/
领域: 视频生成
关键词: 场景动力学、运动规划、概率表征、无采样密度估计、生成式世界模型
一句话总结¶
提出 GARFIELD 框架,通过在单帧与时空稀疏约束下学习结构化运动潜在分布,不仅支持快速无采样判别式运动密度估计,还能联合采样出高一致性的未来轨迹,采样速度比视频世界模型快 97 倍。
研究背景与动机¶
现实世界在时间维度上的演变具有天然的欠定性与随机性,单凭当前的局部观测往往蕴含着多种合乎物理规律的可能未来。传统的视频生成世界模型尝试以逐像素合成的方式预测未来,虽然视觉细节丰富,但将庞大的模型容量浪费在静态背景和细微纹理的渲染上,导致推理延迟极高且难以显式解耦核心运动分布。基于流场或点追踪的直接动力学建模虽然绕过了像素渲染的开销,但已有方案多局限于密集网格预测,且只能生成单次确定性采样样本,无法直接获取运动概率分布与不确定性,难以支持精准交互与规划。
更关键的技术矛盾在于:在不完全观测下,未来轨迹的真实概率分布无法直接从单一观测视频中作为标签获取;若仅依赖生成式扩散模型做蒙特卡洛(Monte-Carlo)重复采样来估计概率密度,巨大的计算开销彻底锁死了实时规划与交互探索的可能性。同时,现有交互式引导方法往往需要密集的终止帧图像、连续轨迹或文本描述,难以满足仅给定任意时空稀疏目标点时的柔性引导需求。
受“薛定谔的猫”思想实验启发,观测与约束的引入会使可能状态的概率波函数逐步坍缩。本文将场景未来的演化建模为时空离散点分布的概率空间,提出 GARFIELD 架构,使用统合的潜在表征兼顾联合多模态轨迹采样与无采样即时密度解码。核心 idea:将未来动力学建模为由场景图像与稀疏约束联合引导的结构化潜在概率分布,基于共享表征同时实现高保真轨迹联合生成与单次前向无采样运动概率密度解码。
方法详解¶
整体框架¶
GARFIELD 整体流程分为结构化潜在表征学习、点级判别式密度解码和多轨迹联合生成采样三个核心阶段。输入由场景初始 RGB 图像 \(I\) 以及任意时空位置上的稀疏已知轨迹目标点 \(b_T\) 构成(记约束为 \(C = (I, b_T)\))。系统首先通过联合运动编码器(Joint Encoder)提取条件表征,并解耦为各场景实体在各时间步的时空局部潜在变量 \(z_{i\tau}\)。基于同一组潜在特征,网络既可以通过判别式密度解码器在单个 ViT 前向传播中输出离散网格上的非参数概率热力图,也可以通过联合全解码器(Full Decoder)一次性采样出具备时空互依赖性的全局协调轨迹集合。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入约束 C<br/>(起始帧图像 I + 稀疏目标点 bT)"] --> B["联合运动编码器:全局上下文提取与时空解耦"]
B --> C["结构化潜在变量集合 {ziτ}"]
C --> D["无采样判别式密度解码器:单步前向预测概率热图"]
C --> E["联合轨迹解码器:消除模态漂移生成协调轨迹"]
D --> F["交互式不确定性探索:香农熵引导稀疏约束注入"]
F -->|更新约束集合 C| A
E --> G["输出一致的多实体完整未来轨迹 T"]
关键设计¶
1. 结构化潜在时空分解与联合编码:打通点级表征与全局上下文 传统轨迹生成模型直接输出整条轨迹或全局向量,导致特定实体在特定时间步的不确定性无法被精准隔离与回溯。GARFIELD 设计了联合编码器 \(E_\phi\),接收初始图像 \(I\)(由可微调的 DINOv2R-B 提取视觉特征并叠加 3D 轴向旋转位置编码 RoPE)与稀疏约束 \(b_T\),输出针对每个场景元素 \(i\) 和时间步 \(\tau\) 的因子化潜在变量 \(z_{i\tau}\)。在预训练阶段,网络引入一个轻量级点解码器 \(D_\psi^p\)(参数量约 34M 的 MLP),通过学习单点位置的边际分布 \(t_{i\tau} \sim D_\psi^p(z_{i\tau}) \approx p(t_{i\tau} \mid C)\),强行迫使每个 \(z_{i\tau}\) 紧凑吸纳并表征对应时空槽位的动力学分布。在训练前 50k 步中,已知目标点的稀疏比率 \(b_T / T\) 从 0.5 线性衰减至 0.01,使编码器充分掌握在极度稀疏条件下的鲁棒推断能力。
2. 无采样判别式密度解码器:常量级时间完成动力学不确定性推断 若要对未来可能运动空间进行评估,传统扩散生成模型必须进行成百上千次蒙特卡洛抽样,耗时高达数秒甚至数分钟,无法应用于实时规划闭环。GARFIELD 构建了确定性密度估计器 \(D_\omega^d\),将图像空间划分为 \(g \times g\) 的正则空间网格 \(\mathcal{G}\)。该解码器直接以冻结编码器输出的局部潜在特征 \(z_{i\tau}\) 为输入,通过单次 Vision Transformer 前向传播,输出该实体在网格离散区间内的概率向量: $$ p_\omega^{(u,v)}(z_{i\tau}) = \text{P}(t_{i\tau} \in \mathcal{B}{u,v} \mid z) $$ 模型通过网格交叉熵损失 \(\mathcal{L}_{\text{grid}}\) 进行监督,将连续轨迹落点离散化为 One-Hot 标签进行分类训练。该机制使得模型在无需任何迭代采样的前提下,仅耗时约 0.8 ms 即可输出高分辨率的运动概率热力图,相比蒙特卡洛采样提升了两个数量级的计算效率。
3. 联合轨迹全解码器:消除跨时步与跨实体模态错配 若仅依靠点级解码器独立生成各个时步的落点,在面对多模态分布(例如车辆在十字路口向左转或向右转)时,点级解码器在相邻时间步可能会随机抽取自不同的模态,导致合成轨迹在时序上剧烈抖动与物理失真。为此,GARFIELD 引入联合全解码器 \(D_\theta\),以包含所有实体与时间步的完整潜在集合 \(\{z_{i\tau}\}_{i,\tau}\) 为条件输入,端到端联合输出完整的轨迹集合 \(T \sim p(T \mid C)\)。联合解码器内部通过自注意力机制充分交换不同物体之间以及相同时序前后的上下文关联,有效消除了时序不连贯与物体间碰撞穿模的问题,保证了物理与行为逻辑的全局协调性。
4. 基于香农熵的主动交互式约束探索:高效坍缩可能未来 为了让系统以最小的用户干预实现最精确的轨迹规划,GARFIELD 依据密度解码器输出的概率分布,直接计算每个点位的香农熵: $$ H(t_{i\tau}) = - \sum_{(u,v) \in \mathcal{G}} p_\omega^{(u,v)}(t_{i\tau} \mid z_{i\tau}) \log p_\omega^{(u,v)}(t_{i\tau} \mid z_{i\tau}) $$ 熵值高直观对应了未来动力学处于多模态分支或尚未确定的状态,熵值低则代表场景运动在物理或目标约束下已经高度确定。在交互规划过程中,算法主动识别全场景中熵值最高的时空关键节点,优先提示用户或策略在此处注入微量约束点,从而以指数级速度驱动整体可能空间的精准坍缩。
损失函数 / 训练策略¶
GARFIELD 采取分阶段解耦训练策略。第一阶段联合优化编码器 \(E_\phi\) 与点级解码器 \(D_\psi^p\),总计训练 460k 步;目标点稀疏度 \(b_T / T\) 在前 50k 步内由 0.5 线性衰减至 0.01;对潜在变量 \(z_{i\tau}\) 施加 \(\tanh\) 激活并在训练中注入标准差 \(\sigma = 10^{-5}\) 的微弱高斯噪声以平滑潜在流形。第二阶段冻结编码器权重,分别对密度估计器 \(D_\omega^d\)(使用网格交叉熵损失 \(\mathcal{L}_{\text{grid}}\))和联合全解码器 \(D_\theta\)(基于轨迹回归与流形匹配监督)独立微调约 100k 步。所有训练均采用 AdamW 优化器、学习率 \(10^{-4}\)、全局 Batch Size 为 256 并以 bfloat16 精度稳定加速。
实验关键数据¶
主实验¶
在公开基准 OpenVid-1M 数据集上评估开放域运动规划性能。各模型均在初始帧和稀疏已知点(或对应文本/图像条件)输入下生成 5 次轨迹并取最佳结果,评价指标包含归一化终点误差(EPE)、各像素阈值下的关键点正确百分比(PCK@10%、PCK@1%)、最终位移误差(FDE)以及推理延迟(Latency)。
| 方法 | 类型 | 稀疏目标数 | EPE ↓ | PCK@10% ↑ | PCK@1% ↑ | FDE ↓ | 延迟 (s) ↓ |
|---|---|---|---|---|---|---|---|
| CogVideoX [49] | 视频生成 | - | 0.025 | 0.936 | 0.601 | 0.046 | 178 |
| LTX-Video [15] | 视频生成 | - | 0.019 | 0.960 | 0.648 | 0.023 | 39 |
| Motion-I2V [37] | 运动先验 | 4 | 0.033 | 0.927 | 0.412 | 0.044 | 13.2 |
| Motion-I2V [37] | 运动先验 | 16 | 0.018 | 0.976 | 0.587 | 0.025 | 13.2 |
| Track2Act [7] | 轨迹生成 | - (需目标帧) | 0.033 | 0.967 | 0.100 | 0.038 | 4.10 |
| FPT [5] | 显式分布 | 4 | 0.112 | 0.669 | 0.109 | 0.169 | 0.60 |
| FPT [5] | 显式分布 | 16 | 0.103 | 0.671 | 0.150 | 0.113 | 0.60 |
| GARFIELD (Ours) | 显式动力学 | 4 | 0.014 | 0.969 | 0.795 | 0.018 | 0.40 |
| GARFIELD (Ours) | 显式动力学 | 16 | 0.012 | 0.977 | 0.821 | 0.015 | 0.40 |
消融实验¶
消融实验对比了解耦时空表征的必要性、潜在特征维度影响,以及点级解码器与联合全解码器在不同约束程度下的表现。
| 配置 | 约束条件 | EPE ↓ | FDE ↓ | 说明 |
|---|---|---|---|---|
| 全局表征 (Global) | \(b_T/T = 1\%\) | 0.479 | 0.482 | 潜在向量未按时空解耦,导致定位崩溃 |
| 纠缠表征 (Entangled) | \(b_T/T = 1\%\) | 0.509 | 0.510 | 未施加点级局部约束监督 |
| GARFIELD (完整结构化) | \(b_T/T = 1\%\) | 0.011 | 0.015 | 结构化解耦与点级监督充分生效 |
| 潜在维度 dim=16 | \(b_T/T = 90\%\) (OOD) | 0.009 | - | 极高约束 OOD 测试下泛化较强 |
| 潜在维度 dim=64 (默认) | \(b_T/T = 90\%\) (OOD) | 0.008 | - | 兼顾分布表达容量与泛化性 |
| 潜在维度 dim=256 | \(b_T/T = 90\%\) (OOD) | 0.019 | - | 维度过大在极端稠密约束下过拟合 |
| 点级解码器 \(D_\psi^p\) | \(\|b_T\| = 2\) | 0.031 | 0.037 | 约束极少时受多模态时序错配影响 |
| 联合全解码器 \(D_\theta\) | \(\|b_T\| = 2\) | 0.028 | 0.032 | 联合自注意力机制有效化解模态冲突 |
| 点级解码器 \(D_\psi^p\) | \(\|b_T\| = 16\) | 0.013 | 0.017 | 约束充沛时空间已塌缩,两模型接近 |
| 联合全解码器 \(D_\theta\) | \(\|b_T\| = 16\) | 0.013 | 0.017 | 与点级模型持平,保持高精度 |
在模块运行耗时分析中:编码器 \(E_\phi\) 耗时 3.0 ms,判别式密度估计器 \(D_\omega^d\) 耗时仅 0.8 ms,点级解码器 \(D_\psi^p\) 耗时 37.0 ms,联合全解码器 \(D_\theta\) 耗时 330.4 ms。
关键发现¶
- 视频生成模型受限于逐像素解码的高昂延迟(CogVideoX 耗时 178 秒),而 GARFIELD 仅耗时 0.4 秒即可完成更高精度的轨迹生成,速度提升达 97 倍以上。
- 时空解耦潜在结构是系统成立的核心基石:若直接使用全局 Token(Global/Entangled),EPE 迅速劣化至 0.47 以上,丧失基本运动规划能力。
- 密度估计器(0.8 ms)能够输出与 100 次蒙特卡洛迭代采样高度一致的概率分布(在 Jensen-Shannon 散度与 Wasserstein 距离指标上均最优),使得在线交互式不确定性评估首次具备毫秒级响应能力。
- 基于香农熵的主动约束选择策略在收敛速度上甚至优于依靠 Ground-Truth 误差的 Oracle 策略,仅需一半的约束点数即可达成同等精度的轨迹收敛。
亮点与洞察¶
- 将量子测量塌缩隐喻落地为算法表征:把“未观测状态的叠加”与“条件约束引起的分布塌缩”数学化为条件概率分布演进过程,赋予场景动力学概率建模极具物理直觉的架构设计。
- 双分支解码设计化解生成质量与推断速度的固有矛盾:判别式网格分类头实现 0.8 ms 的极速无采样密度推断,而联合生成解码头消除时序多模态漂移,二者互补构成完整闭环。
- 熵引导的主动式规划范式可泛化性强:利用非参数密度估计直接获取系统不确定性分布,该范式不仅适用于视频运动预测,还可平滑迁移至机器人示教轨迹修正与自动驾驶长尾交互场景中。
局限与展望¶
- 依赖 2D 离散网格划分:当前的密度解码建立在 \(20 \times 20\) 的 2D 图像平面网格上,对于沿视线方向(深度维度)的大尺度运动以及相机剧烈自旋情况建模不够完备。
- 缺乏显式 3D 物理交互先验:模型表征主要从 2D 视频伪标签中自监督提取,面对复杂刚体碰撞、流体或软体形变时,偶尔出现违反物理支撑关系的幻觉轨迹。
- 改进方向:可进一步将结构化潜在空间扩展至 3D 高斯泼溅或体素占有率网格(Occupancy Grid),并在编码端引入物理引擎可微分约束,实现具身智能下的三维全场景动力学推断。
相关工作与启发¶
- vs CogVideoX / LTX-Video / 视频世界模型:视频世界模型尝试将动力学隐式包裹在巨大的像素生成网络中,推演单条轨迹需生成数十帧高分辨率图像(耗时数十至数百秒);GARFIELD 剥离外观渲染,专注于稀疏动力学,推理提速 97 倍且精度显著领先。
- vs Track2Act:Track2Act 必须依赖密集终点 RGB 图像作为 Goal,而在真实交互规划中未来画面往往不可预知;GARFIELD 支持时空任意稀疏离散点约束,更符合真实场景规划需求。
- vs Flow Poke Transformer (FPT):FPT 假定未来分布服从高斯混合模型(GMM)且仅预测单一步骤;GARFIELD 采用完全非参数化的离散网格建模多模态分布,并支持长达 32 步的多实体全局轨迹推演。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 巧妙提出融合无采样密度解码与联合轨迹采样的动力学潜在空间,开创性引入熵引导约束塌缩机制。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖开放域轨迹规划、机器人抓取、行人轨迹预测,并提供极度详实的消融与延迟评测。
- 写作质量: ⭐⭐⭐⭐⭐ 叙述逻辑严密,图表美观直观,薛定谔的猫这一类比与技术机制契合度极高。
- 价值: ⭐⭐⭐⭐⭐ 为轻量级、实时、具备不确定性感知能力的具身智能运动基座模型开辟了全新路径。