跳转至

Representations Before Pixels: Semantics-Guided Hierarchical Video Prediction

会议: ECCV 2026
论文: ECCV 2026
代码: https://github.com/Sta8is/Re2Pix
领域: 自动驾驶
关键词: 视频预测、视觉基础模型、分层视频生成、潜在扩散模型、嵌套丢弃

一句话总结

Re2Pix 提出将未来视频预测解耦为“视觉基础模型语义表征预测”与“语义引导的潜在扩散渲染”两阶段分层架构,并结合嵌套丢弃与混合监督解决自回归表征的训练-测试分布偏移,在自动驾驶基准上显著提升时序语义一致性、生成画质并带来高达 7 至 14 倍的训练收敛加速。

研究背景与动机

在自动驾驶等高度动态的物理世界场景中,准确预测未来视频是实现长期环境推理、决策与安全轨迹规划的关键基础。然而,从原始连续视频中预测未来演变极其困难,模型既需要掌握高层宏观语义(场景中包含哪些车辆、行人、车道线以及它们如何发生动态交互),又需要渲染微观像素细节(光照变化、阴影反射、纹理遮挡)。现有主流方法大多采用端到端范式,直接在 VAE 的潜空间中利用扩散模型逐步去噪预测未来潜变量。这种做法的核心症结在于高层语义拓扑与低阶视觉外观被深层纠缠在同一潜空间中,强迫生成模型在单次去噪过程中兼顾物理动力学推演与像素级外观绘制,极易出现物体身份漂移(identity drift)、结构崩塌、车道抖动或闪烁伪影,且收敛极其缓慢。

尽管近期部分工作(如 REPA 和 VideoREPA)尝试引入预训练视觉基础模型(VFM)特征,通过辅助蒸馏损失在扩散特征层面上施加表征对齐,但扩散模型本质上依然在单一潜空间中同时负责前向预测与像素渲染,两者仍处于隐式耦合状态。另一种思路是纯语义预测(如 DINO-Foresight、DINO-WM),但它们只停留在表征空间做推演,无法生成真实高保真的 RGB 像素帧供自动驾驶端到端闭环验证。

因此,核心矛盾在于:能否在保留连贯生成能力的同时,将“高层语义动力学推演”与“底层视觉外观合成”显式分离?本文的切入角度是引入先语义后像素的分层预测架构,第一阶段在冻结的视觉基础模型表征空间建模场景演化,第二阶段以此显式表征为骨架指导潜在扩散模型生成高保真图像。核心 idea:将未来视频预测分解为“冻结 VFM 语义特征预测”与“语义引导的潜在扩散视觉合成”两阶段,并引入嵌套特征丢弃(Nested Dropout)与动静态混合监督(Mixed Supervision)攻克自回归累积误差带来的训练-测试分布偏移。

方法详解

整体框架

Re2Pix 的整体流程遵循分层粗到细预测的设计哲学。输入为连续 \(M\) 帧历史观察上下文视频帧,目标是预测未来 \(K-M\) 帧。整个框架由两个独立但紧密协作的阶段构成: 1. 阶段 1:高层语义表征自回归预测。利用预训练且参数冻结的视觉基础模型(DINOv2-Reg ViT-B/14)独立抽取每帧的高维语义特征,并通过 PCA 降维构建多尺度紧凑表征。一个轻量化的掩码特征 Transformer(Masked Feature Transformer)以自回归方式逐帧外推未来语义特征序列。 2. 阶段 2:语义特征引导的视频潜扩散生成。采用因果 3D VAE(WAN2.1 VAE)将历史上下文帧压缩到低维潜空间,并对未来帧潜变量注入高斯噪声。扩散主干网络(基于 DiT 架构)接收历史清晰潜变量、未来噪声潜变量以及由第一阶段预测或输入的完整时序语义特征,通过早期特征融合引导潜在去噪过程,最终由 3D VAE 解码器将去噪后的未来潜变量重建为真实像素级 RGB 视频帧。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入上下文视频帧 x(1:M)"] --> B["阶段 1:VFM 特征预测<br/>冻结 DINOv2 提取特征 + 掩码 Transformer 自回归推演"]
    A --> C["因果 3D VAE 编码<br/>压缩至低维潜变量 z(1:M)"]
    B --> D["阶段 2:早期语义对齐<br/>空间下采样 + 独立投影 + 逐通道相加融合"]
    C --> D
    D --> E["嵌套丢弃与混合监督<br/>按方差截断通道 + 90%真实/10%预测特征混合训练"]
    E --> F["扩散 Transformer 去噪<br/>DiT 主干预测未来去噪潜变量 z(M+1:K)"]
    F --> G["3D VAE 解码器输出<br/>高保真且语义一致的未来 RGB 视频帧"]

关键设计

1. VFM 特征预测:解耦动力学与外观的高层语义推演 传统潜在扩散模型在预测未来时必须同时推测场景布局演化与复杂纹理,容易陷入局部细节而丢失全局路况语义。本文引入预训练冻结的 DINOv2 编码器 \(E_h\),提取包含丰富语义且去除微观像素噪声的特征图。具体地,模型抽取 ViT-B 的第 3、6、9、12 层的中间表征并进行通道拼接,随后通过 PCA 降维投影至 \(C_h = 1152\) 维。该特征天然具有层次化方差结构:高方差主成分编码全局宏观几何与类别语义,低方差成分编码细部形状。随后,采用基于掩码机制的特征 Transformer \(G_h\) 专门建模场景时序演化。在训练时输入上下文特征并对未来目标帧特征进行全掩码回归;在推理阶段则采用滑动窗口自回归方式,先推演未来语义骨架,从而为下游生成模型提供稳定可靠的动力学先验。

2. 早期语义对齐:无显存冗余的输入级表征融合 在将预测的高层语义注入扩散生成模型时,若采用传统的交叉注意力(Cross-Attention)机制,不仅会引入数以亿计的额外可学习参数(实验中约增加 265M 参数),还会显著增加序列交互的计算与显存开销;而如果采用自适应归一化(AdaLN),全局调制信号又难以对局部细粒度空间布局施加高精度的密集约束。为此,Re2Pix 采用了极其精炼的早期融合设计:先对 VAE 潜变量进行 \(2 \times 2\) patchify 切块,并将 VFM 语义特征图在空间上双线性插值缩放到与潜变量 patch 相同的空间网格尺度。随后,两类特征分别通过各自独立的线性嵌入层映射到同一维度空间,并在输入端直接执行逐通道相加(Channel-wise Summation)。这种设计在不增加任何额外输入 token 序列长度的前提下,使 DiT 主干的所有自注意力层从最底层的输入端开始便天然具备强结构约束。

3. 嵌套丢弃与混合监督:消除自回归累积误差的稳健条件策略 直接将两阶段串联面临严峻的训练-测试分布偏移(Train-Test Mismatch):在训练扩散生成器时,教师强制(Teacher-Forcing)使模型默认接触到来自真实未来帧的完美干净特征 \(E_h(x_{M+1:K})\);然而在推理部署时,条件特征完全来源于自回归模型 \(G_h\) 的长程预测,不可避免地包含多步外推累积的噪声与失真。如果扩散模型在训练期对完美的微观特征产生病态依赖,在测试期面对带噪特征时生成画质便会急剧劣化,出现严重的模糊与闪烁。针对该瓶颈,Re2Pix 提出了两套互补的稳健策略: - 嵌套特征丢弃(Nested Dropout):利用 PCA 降维特征通道的方差递减特性,在训练阶段对所有语义特征图随机保留前 \(c \in \{8, 16, 32, 64, 128, 256, 512, 1152\}\) 个通道,将剩余的 \(C_h - c\) 个细粒度通道置零: $\(\tilde{h}_{1:K} = \left[ h_{1:K}^{1:c},\, \mathbf{0}^{C_h - c} \right]\)$ 该随机截断迫使扩散模型学会依据高阶粗粒度结构进行渲染,防止其过度依赖极易在自回归中失真的低方差细粒度特征。 - 动静态混合监督(Mixed Supervision):在训练批次中打破纯真实特征供给,随机抽取 10% 的训练样本采用 \(G_h\) 预测的未来特征进行条件注入,剩余 90% 沿用真实特征。这一微量注入(90/10 混合比)直接让扩散模型在训练期适应自回归特征的噪声分布,同时保持了全局语义收敛的稳定性,一举根除了生成模糊问题。

损失函数 / 训练策略

Re2Pix 的两个阶段分别独立优化,大幅提升了训练稳定性并降低了端到端联合训练的高昂调试成本: 1. 特征预测网络损失:特征生成器 \(G_h\) 在给定上下文特征 \((h_1, \ldots, h_M)\) 下预测第 \(M+1\) 帧特征,使用平滑 \(L_1\) 损失(Smooth L1 Loss)进行密集表征回归: $\(\mathcal{L}_{\text{feat}} = \text{SmoothL1}\left( G_h(h_1, \ldots, h_M),\, h_{M+1} \right)\)$ 2. 扩散生成网络损失:采用 EDM 扩散公式与 DiT 架构(800M 参数,共 14 层 Transformer,嵌入维度 2048,配以 AdaLN-LoRA 与 RMSNorm)。扩散过程对未来帧的 VAE 潜变量 \(z_{M+1:K}\) 加噪,去噪模型 \(G_z\) 最小化重加权均方误差目标: $\(\mathcal{L}_{\text{diffusion}} = \mathbb{E}_{\epsilon, n} \left[ \lambda_n \left\| G_z(z_{M+1:K}^{(n)};\, z_{1:M},\, \tilde{h}_{1:K},\, n) - z_{M+1:K} \right\|^2 \right]\)$ 其中仅未来帧的潜在变量计算损失。在 8 张 NVIDIA H200 GPU 上单数据集训练仅需 40k 次迭代(约 7 小时),比基线取得 7 至 14 倍的收敛加速。

实验关键数据

主实验

在自动驾驶标杆数据集 Cityscapes 上,输入 13 帧上下文,预测未来 12 帧(其中评估第 19 帧的密集语义分割与深度估计,全序列评估 FID 与 FVD)。对比标准潜在扩散基线、REPA/VideoREPA 表征对齐方法以及扩大参数量的 Baseline-Large(1.5B 参数),各项指标如下表所示:

方法 模型参数 全局类别 mIoU(A)↑ 动体类别 IoU(M)↑ 深度阈值 δ1↑ 绝对相对误差 AbsR↓ 画质 FID↓ 时序连贯度 FVD↓
Re2Pix (Stage 1 特征上界) - 69.76 69.66 88.03 0.1262 - -
Baseline 782M 60.55 57.64 85.15 0.1460 12.86 60.70
Baseline w/ REPA 792M 61.45 (+0.90) 59.63 (+1.99) 85.35 (+0.20) 0.1465 (+0.0005) 12.34 (-0.52) 55.15 (-5.55)
Baseline w/ VideoREPA 792M 60.98 (+0.43) 58.61 (+0.97) 85.22 (+0.07) 0.1466 (+0.0006) 12.95 (+0.09) 59.03 (-1.67)
Baseline-Large 1.5B 61.69 (+1.14) 59.65 (+2.01) 85.43 (+0.28) 0.1453 (-0.0070) 11.99 (-0.87) 56.81 (-3.89)
Re2Pix (本文) 1.1B 63.53 (+2.98) 62.29 (+4.65) 85.72 (+0.57) 0.1413 (-0.0047) 9.90 (-2.96) 52.66 (-8.04)

消融实验

消融实验深入验证了训练条件策略(嵌套丢弃、混合监督)与特征融合方式对模型最终表现的决定性作用:

实验切片 配置项 mIoU(A)↑ IoU(M)↑ δ1↑ AbsR↓ FID↓ FVD↓ 说明
嵌套丢弃消融 固定 1152 通道 62.38 60.67 85.45 0.1467 12.63 58.91 未做截断,对高频细粒度特征过拟合
嵌套丢弃 (Nested) 63.53 62.29 85.72 0.1413 9.90 52.66 显著改善 FID/FVD,各指标全面大幅提升
混合监督比例 仅真实特征 (100% GT) 64.42 63.15 86.06 0.1407 10.43 80.85 存在分布偏移,测试期严重模糊,FVD 崩塌
仅预测特征 (100% Pred) 62.77 61.38 85.58 0.1420 10.21 55.81 语义感知指标明显下降
混合比例 (85/15) 62.49 60.00 85.52 0.1440 10.54 54.89 预测特征偏多,语义引导减弱
混合比例 (90/10) 63.53 62.29 85.72 0.1413 9.90 52.66 最佳权衡,兼顾高保真与强语义约束
混合比例 (95/05) 63.49 62.33 85.75 0.1319 10.27 53.69 真实特征偏多,画质略有劣化
特征融合架构 Cross-Attention (+265M) 61.34 59.03 85.30 0.1462 11.83 56.37 参数量显著激增,性能反倒落后
AdaLN 调制 63.10 61.75 85.71 0.1425 10.75 55.75 难以细粒度空间对齐
早期输入融合 (Early-Fusion) 63.53 62.29 85.72 0.1413 9.90 52.66 零额外参数、输入级通道相加,效果最佳

关键发现

  • 分层解耦打破表征纠缠,显著加速收敛:Re2Pix 达到 FID=15 仅需 20k 迭代,而 Baseline 达到同样水平需 140k 迭代,生成画质收敛加速达 7 倍;分割指标 mIoU 收敛速度更提升达 14 倍。这是因为扩散模型不再需要从零摸索场景的动态演变规律,只需专注于条件外观渲染。
  • 嵌套丢弃是抵抗自回归误差的利器:相比固定通道输入,嵌套丢弃使 FID 从 12.63 降至 9.90,FVD 从 58.91 降至 52.66。测试时即便将通道数从 1152 骤降至 128,FID 仍能保持在 9.80,FVD 保持在 52.82,证实高阶主成分已经足以维持高保真生成。
  • 纯真实特征训练会导致严重的分布坍塌:在无混合监督下(100% GT 训练),FVD 恶化至 80.85(相比 90/10 混合时的 52.66 严重恶化),直观表现为画面细节模糊与时序剧烈闪烁;90/10 的轻度混合监督完美抹平了这一泛化鸿沟。
  • 参数量并非决定性因素:拥有 1.5B 参数的 Baseline-Large 在各项指标上均落后于仅 1.1B 的 Re2Pix,证明性能增益来自于解耦架构的结构性优势,而非暴力扩展参数。

亮点与洞察

  • 将表征预测由“辅助损失”升级为“显式中介生成变量”:不同于 REPA 类方法仅将 VFM 作为特征相似度蒸馏监督,Re2Pix 将 VFM 表征作为承前启后的物理骨架,真正实现了“动力学推演与像素渲染”的职责切分。
  • 极简但极其高效的早期相加融合:没有采用沉重繁琐的交叉注意力,而是通过双线性插值与线性映射在输入端逐通道相加,不增加 token 长度即可实现致密的像素-语义空间对齐。
  • 利用 PCA 层次特性设计嵌套丢弃(Nested Dropout):巧妙契合了主成分分析由粗到细的方差衰减规律,无需额外的排序网络即可自适应实现多粒度鲁棒正则化。
  • 极具推广潜力的模块化两阶段范式:该架构可广泛复用于机器人具身操作(Embodied AI)视频预测、世界模型(World Models)仿真模拟等任务中,将复杂的时空预测问题化繁为简。

局限与展望

  • 两阶段串行依赖与误差单向传播:若第一阶段的特征预测发生严重错判(例如未能预测出突然横穿的行人),第二阶段的潜在扩散生成器由于受制于强语义条件,极难自发纠正这一结构性遗漏。
  • 跨场景 VFM 语义先验的域偏置:当前系统强依赖于 DINOv2 在开集自然图像上学到的表征,若遭遇严重极端天气(暴雪、大雾、夜间强眩光)或传感器域偏移,VFM 表征质量下降将连带影响全管线。
  • 未来方向:探索引入双向反馈机制或置信度自适应门控,允许扩散生成器在表征不确定时反向校准高层特征;同时探索端到端高效联合微调。

相关工作与启发

  • vs Cosmos-Predict / Vista (端到端扩散世界模型):Cosmos 和 Vista 直接在潜空间或像素空间端到端预测未来,模型需要同时学习物理动力学和高保真外观,训练耗费数万 GPU 时且容易出现动态漂移。Re2Pix 显式解耦出语义表征预测阶段,大幅减轻了生成主干负担,在远小的数据与算力预算下取得了更优或可比的生成质量与语义保真度。
  • vs REPA / VideoREPA (表征对齐方法):REPA 类方法在扩散模型的隐藏层施加特征蒸馏约束,但推理时依然依赖扩散潜变量自身完成所有动力学预测。Re2Pix 则是生成式地预测 VFM 特征,并作为条件输入注入,从根本上实现了动力学与渲染的物理分工。
  • vs DINO-Foresight / DINO-WM (纯语义预测模型):DINO-Foresight 等工作仅在 DINO 表征空间完成未来语义预测,无法合成可观测的连续像素视频,难以应用于视觉闭环仿真与真机测试。Re2Pix 补齐了从表征到真实像素的完整下半程。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次系统性提出利用视觉基础模型表征预测指导分层视频扩散生成的两阶段架构,并设计了嵌套丢弃与混合监督。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 Cityscapes、nuScenes、CoVLA 及 KITTI 零样本泛化,设计了多维度的语义一致性、生成画质指标及详尽的消融与收敛分析。
  • 写作质量: ⭐⭐⭐⭐⭐ 动机阐述深刻,对端到端纠缠的痛点分析透彻,方法设计逻辑严密自洽。
  • 价值: ⭐⭐⭐⭐⭐ 为自动驾驶世界模型与视频生成领域提供了一种高效、高保真且语义一致的实用分层生成范式。