Geometry-Aware Spatio-Temporal Context Modeling for 4D Occupancy Forecasting¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/chenst27/GAST
领域: 自动驾驶
关键词: 4D占用预测, 几何感知时空语境, 显式-隐式渐进生成, 双路时空建模, 世界模型
一句话总结¶
提出端到端几何感知时空语境建模框架 GAST,摒弃离散 Token 化与自回归架构,通过位姿驱动的渐进显式-隐式特征生成与跨坐标系双路时空建模,在 Occ3D-nuScenes 上以 2.84 倍推理速度大幅超越 SOTA 达 7.67% mIoU。
研究背景与动机¶
3D 语义占用网格将自动驾驶场景离散化为高密度的体素单元并赋予语义标签,相较于传统的 3D 边界框检测或稀疏激光雷达点云,能够更完整地表达异形障碍物与任意几何拓扑。将 3D 占用扩展至时序维度的 4D 占用预测任务,旨在根据自车历史观测与自车运动推演未来多秒内三维场景在几何占据和语义类别上的演化过程,为端到端自动驾驶长时轨迹规划、长尾 corner-case 仿真生成以及高质量合成闭环测试提供基石支撑。
然而,当前占据统治地位的 4D 占用预测基线普遍建立在生成式自回归世界模型框架之上(如 OccWorld、RenderWorld、Occ-LLM、I2-World 等)。这类方案通常采用两阶段范式:先通过 VQ-VAE 将高维 3D 空间网格离散化为量化 Token,再通过自回归 Transformer 逐帧串行生成未来 Token 序列并解码。这一范式存在三处难以调和的结构性瓶颈:第一,静态背景(如道路地面、路侧建筑物)在物理上严格遵循自车自运动的刚体几何变换,但自回归 Token 预测缺乏显式几何先验约束,导致多步外推时静态几何迅速发生形变扭曲和位置漂移;第二,自回归的因果步进机制割裂了全局时空上下文的直接交互,各帧特征在各自局部位姿坐标系中孤立生成,累积误差随预测时域延长而迅速放大;第三,两阶段分步训练使得序列预测器的上限严格受限于分词器的压缩表征能力与信息丢失,无法实现端到端梯度协同优化。
针对上述矛盾,本文的核心切入点在于回归连续 BEV 特征空间的端到端直接建模:对静态结构引入位姿驱动的显式刚性投影,对动态变化引入动作调制的隐式可形变微调,并以统一世界坐标系下的双路时空交互保障全局一致性。核心 idea:摒弃离散 Token 自回归范式,提出端到端几何感知时空语境建模框架(GAST),通过“显式几何翘曲-隐式运动调制-可形变跨注意力”的渐进生成模块构建几何高保真单帧表征,结合“全局世界坐标多尺度空间聚合”与“ConvGRU 时序动态提取”的双路并行时空建模,实现历史重建与未来预测的端到端联合优化。
方法详解¶
整体框架¶
GAST 接收连续历史帧的 3D 占用网格与自车位姿序列,首先通过轻量占用编码器压缩为紧凑的鸟瞰图(BEV)特征序列并预测未来自车位姿;随后通过渐进显式-隐式生成模块合成具备刚性几何结构与动态语义的单帧未来 BEV 特征;接着利用双路时空建模模块在统一空间与时序序列中消除歧义;最终由时空解码器联合输出历史重建与未来多帧预测的 4D 语义体素网格。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入历史占用与位姿<br/>O_{T-N_h+1:T}, P_{T-N_h+1:T}"] --> B["BEV 编码与自车位姿预测<br/>抽取 B_t 并预测未来位姿 \hat{P}_t"]
B --> C["显式-隐式渐进生成<br/>刚性空间翘曲 + 运动调制 + 局部细化"]
C --> D["全局空间语境聚合<br/>世界坐标系对齐 + 多尺度金字塔融合"]
C --> E["时序动态特征提取<br/>ConvGRU 时序因果递推"]
D --> F["双路特征融合与自注意力<br/>空间对齐与时序平滑表征融合"]
E --> F
F --> G["联合重建与预测解码<br/>统一时空体素重建与 4D 占用外推"]
G --> H["输出 4D 占用网格<br/>历史重建与未来多秒外推"]
关键设计¶
1. 显式-隐式渐进生成:刚性几何翘曲与动态特征细化 以往纯隐式或自回归预测器在预测静态道路、建筑物时容易发生模糊或几何崩塌,其根源在于未能显式利用自车外参变换这一强约束物理几何先验。为此,本设计由显式几何变换(EGT)、隐式特征调制(IFM)与局部特征细化(FR)三个渐进级联阶段构成。在显式几何变换阶段,将当前观测到的高置信度 BEV 特征 \(B_T\) 直接作为源,依据未来预测位姿 \(\hat{P}_t = (\hat{t}_t, \hat{q}_t)\) 与当前位姿 \(P_T\) 的相对位姿变换,通过可微空间采样网格实施刚性变换: $\(B_t^{geo} = \text{Warp}(B_T;\, P_T^{-1} \circ \hat{P}_t)\)$ 该操作无需任何额外参数即可将当前静态背景精确映射至未来时步的自车坐标系下,彻底锁定了静态结构的几何刚性。随后,为了赋予特征表征动态交通参与者及非刚性演化的能力,隐式特征调制阶段将预测的未来相对位姿增量 \((\Delta\hat{t}_t, \Delta\hat{q}_t)\) 拼接编码为自运动特征向量,通过两层线性映射生成通道级自适应缩放因子 \(\gamma_t \in \mathbb{R}^c\) 与偏置因子 \(\beta_t \in \mathbb{R}^c\),执行通道仿射调制: $\(B_t^{mod} = \gamma_t \odot B_t^{geo} + \beta_t\)$ 最后,针对翘曲边界空白与遮挡区域动态补全的问题,局部特征细化阶段将调制特征 \(B_t^{mod}\) 作为 Query,利用逆向坐标变换 \(\mathcal{T}_{t \to T}\) 将未来 BEV 网格中心映射回当前坐标系获取 2D 空间参考点,以当前真实观测特征 \(B_T\) 作为 Key 和 Value 执行可形变跨注意力(Deformable Cross-Attention): $\(B_t^{ref} = \text{DeformAttn}\big(B_t^{mod},\, \mathcal{T}_{t \to T}(C_t),\, B_T\big)\)$ 使预测特征能够自适应聚合当前视野中高置信度几何与纹理上下文,输出兼备几何真实性与语义合理性的单帧未来表征。
2. 全局空间语境聚合:跨时间世界坐标对齐与多尺度融合 在自车高速行驶或转向工况下,各未来时间步的 BEV 特征分布在局部坐标系中彼此错位,直接进行时序卷积难以捕获场景级的大范围空间依赖。针对这一割裂痛点,全局空间语境聚合模块将所有历史帧特征 \(\{B_t\}_{t=T-N_h+1}^T\) 与细化后的未来帧特征 \(\{B_t^{ref}\}_{t=T+1}^{T+N_f}\) 统一通过对应位姿刚性重投影至固定的全局世界坐标系下,消除视角漂移,形成空间严格对齐的时间延展特征序列 \(\{B_t^{align}\}\)。为了同时兼顾宏观道路拓扑与精细物体几何,将空间对齐特征构建为 \(K=3\) 级分辨率的金字塔表征(\(50 \times 50\)、\(100 \times 100\)、\(200 \times 200\)),各层经由轻量卷积聚合空间语境后自粗至细自顶向下融合: $\(\tilde{F}_k = \text{Conv}\big(\text{Upsample}(\tilde{F}_{k-1}) \oplus F_k^{global}\big),\quad k=2,\dots,K\)$ 顶层特征聚合大尺度全局连通性,底层特征保留微观结构边缘。融合后的全局全分辨率特征 \(F^{global} := \tilde{F}_K\) 再通过可微网格采样映射回各未来时刻的局部自车视野中: $\(B_t^{spatial} = \text{GridSample}\big(F^{global},\, \phi(\hat{P}_t)\big)\)$ 从而赋予每个局部预测单元全局一致的空间拓扑参照体系。
3. 时序动态特征提取:ConvGRU 驱动的时序平滑与双路融合 纯空间重投影虽然保证了静态几何的一致性,但无法显式建模场景中动态前景物体的速度、加速度与运动惯性。时序动态特征提取模块将历史 BEV 特征与细化未来特征沿时序维度拼接为连续序列,利用轻量级二维卷积门控循环单元(ConvGRU)按因果时间序逐帧递推隐藏状态: $\(h_t = \text{ConvGRU}(\mathcal{B}_t,\, h_{t-1}),\quad t = T-N_h+1, \dots, T+N_f\)$ 初始状态 \(h_{T-N_h}=0\)。在未来阶段(\(t > T\)),ConvGRU 顺滑地将历史时序动量向未来因果传播,提取出平滑的时序演化特征 \(B_t^{temp}\)。最后,全局空间特征与时序动态特征在每个未来时刻通过通道拼接与卷积块紧密交融: $\(\hat{B}_t = \text{Conv}(B_t^{spatial} \oplus B_t^{temp})\)$ 并串联一层可形变自注意力增强帧内多语义交互,实现空间全局约束与时间连续动力学的互补闭环。
4. 联合重建与预测解码:端到端时空表征正则化 传统预测模型往往仅针对未来帧施加监督,容易导致潜在特征空间过度拟合未来拟合目标而破坏感知特征的基础结构。GAST 将历史 BEV 特征序列与增强后的未来预测特征序列拼接构成统一的 4D 时空特征体,经过双线性插值上采样与残差 3D 卷积块直接解码为全场景 4D 语义体素网格 \(\hat{O} \in \mathbb{R}^{(N_h+N_f) \times S \times H \times W \times D}\)。模型不仅对未来时间步(\(t > T\))计算预测误差,同时对历史时间步(\(t \le T\))计算高保真重建误差。历史重建分支充当时空表征的感知正则项,防止特征解码器因时空外推产生分布偏移,确保编码器在无信息泄露的前提下学到时间维度平滑且泛化稳健的场景表征。
损失函数 / 训练策略¶
模型采用端到端联合反向传播优化,总损失函数涵盖 4D 占用感知损失与自车位姿回归损失: $\(\mathcal{L}_{total} = \mathcal{L}_{occ}^{past} + \mathcal{L}_{occ}^{future} + \lambda_{trans}\mathcal{L}_{trans} + \lambda_{rot}\mathcal{L}_{rot}\)$ 其中占用预测损失在历史重建段与未来外推段分别联合使用加权交叉熵损失(Weighted Cross-Entropy)与 Lovász-Softmax 损失,平衡极端空体素(empty class)与少样本动静态语义类别的类别不均衡问题,权重系数 \(\lambda_{wce}=\lambda_{lov}=1.0\)。位姿回归中采用平移 \(L_2\) 损失与基于四元数内积的角度距离损失,权重设为 \(\lambda_{trans}=0.01\)、\(\lambda_{rot}=1.0\)。模型在 4 卡 NVIDIA RTX 3090 上采用 AdamW 优化器训练 30 个 Epoch,初始学习率为 0.001 并遵循余弦退火策略逐步衰减至零。
实验关键数据¶
主实验¶
在主流大规模自动驾驶占用预测基准 Occ3D-nuScenes 验证集上,将 GAST 与自回归、扩散模型等代表性 SOTA 方法在 1s、2s、3s 及平均(Avg.)预测范围内的几何 IoU 与语义 mIoU 进行全面对比。
| 输入模态 | 自车轨迹 | 方法 | mIoU (1s) | mIoU (2s) | mIoU (3s) | mIoU (Avg.) | IoU (1s) | IoU (2s) | IoU (3s) | IoU (Avg.) |
|---|---|---|---|---|---|---|---|---|---|---|
| 环视相机 | 预测轨迹 | OccWorld-D | 11.55 | 8.10 | 6.22 | 8.62 | 18.90 | 16.26 | 14.43 | 16.53 |
| 环视相机 | 预测轨迹 | Occ-LLM | 11.28 | 10.21 | 9.13 | 10.21 | 27.11 | 24.07 | 20.19 | 23.79 |
| 环视相机 | 预测轨迹 | DFIT-OccWorld | 13.38 | 10.16 | 7.96 | 10.50 | 19.18 | 16.85 | 15.02 | 17.02 |
| 环视相机 | 预测轨迹 | GAST-STC (本文) | 19.32 | 13.96 | 10.62 | 14.84 | 27.97 | 23.35 | 20.22 | 23.87 |
| 环视相机 | 真实轨迹 | DOME-STC | 17.79 | 14.23 | 11.58 | 14.53 | 26.39 | 23.20 | 20.42 | 23.33 |
| 环视相机 | 真实轨迹 | I2-World-STC | 21.67 | 18.78 | 16.47 | 18.97 | 30.55 | 28.76 | 26.99 | 28.77 |
| 环视相机 | 真实轨迹 | GAST-STC (本文) | 22.90 | 19.93 | 17.17 | 20.16 | 31.62 | 29.92 | 28.00 | 29.87 |
| 3D 占用 | 预测轨迹 | OccWorld | 25.78 | 15.14 | 10.51 | 17.14 | 34.63 | 25.07 | 20.18 | 26.63 |
| 3D 占用 | 预测轨迹 | OccLLaMA | 25.05 | 19.49 | 15.26 | 19.93 | 34.56 | 28.53 | 24.41 | 29.17 |
| 3D 占用 | 预测轨迹 | RenderWorld | 28.69 | 18.89 | 14.83 | 20.80 | 37.74 | 28.41 | 24.08 | 30.08 |
| 3D 占用 | 预测轨迹 | COME | 30.57 | 19.91 | 13.38 | 21.29 | 36.96 | 28.26 | 21.86 | 29.03 |
| 3D 占用 | 预测轨迹 | DFIT-OccWorld | 31.68 | 21.29 | 15.18 | 22.71 | 40.28 | 31.24 | 25.29 | 32.27 |
| 3D 占用 | 预测轨迹 | GAST (本文) | 38.60 | 24.79 | 18.54 | 27.38 | 44.69 | 34.21 | 28.85 | 35.90 |
| 3D 占用 | 真实轨迹 | DOME | 35.11 | 25.89 | 20.29 | 27.10 | 43.99 | 35.36 | 29.74 | 36.36 |
| 3D 占用 | 真实轨迹 | UniScene | 35.37 | 29.59 | 25.08 | 31.76 | 38.34 | 32.70 | 29.09 | 34.84 |
| 3D 占用 | 真实轨迹 | COME | 42.75 | 32.97 | 26.98 | 34.23 | 50.57 | 43.47 | 38.36 | 44.13 |
| 3D 占用 | 真实轨迹 | I2-World | 47.62 | 38.58 | 32.98 | 39.73 | 54.29 | 49.43 | 45.69 | 49.80 |
| 3D 占用 | 真实轨迹 | GAST (本文) | 55.54 | 46.33 | 40.18 | 47.40 | 60.77 | 55.97 | 51.96 | 56.24 |
消融实验¶
在 Occ3D-nuScenes 验证集上逐步引入各模块对模型整体性能(真实自车位姿设定)的贡献进行细致消融分析。
| 序号 | 显式变换 (EGT) | 运动调制 (IFM) | 特征细化 (FR) | 空间聚合 (GSCA) | 动态提取 (TDE) | mIoU (%) | IoU (%) | 说明 |
|---|---|---|---|---|---|---|---|---|
| 1 | - | - | - | - | - | 18.31 | 29.01 | 纯独立卷积逐帧基线 |
| 2 | ✓ | - | - | - | - | 31.78 | 41.65 | 引入显式位姿刚性空间翘曲 (+13.47% mIoU) |
| 3 | ✓ | ✓ | - | - | - | 32.55 | 42.63 | 叠加相对运动通道仿射调制 (+0.77% mIoU) |
| 4 | ✓ | ✓ | ✓ | - | - | 40.47 | 49.15 | 完整 PEIG 模块,融合观测细化 (+7.92% mIoU) |
| 5 | ✓ | ✓ | ✓ | ✓ | - | 46.08 | 55.50 | 引入世界坐标多尺度空间语境聚合 (+5.61% mIoU) |
| 6 | ✓ | ✓ | ✓ | ✓ | ✓ | 47.40 | 56.24 | 完整 GAST 模型,融合双路时空表征 (+1.32% mIoU) |
模型计算效率与长时预测对比¶
| 评测维度 | 方法 | 参数量 (#Params) | 计算量 (#FLOPs) | 推理延迟 (Latency) | 平均 mIoU (%) | 平均 IoU (%) |
|---|---|---|---|---|---|---|
| 计算效率 (RTX 3090) | DOME (扩散基线) | 444.07 M | 2928.66 G | 1899.15 ms | 27.10 | 36.36 |
| 计算效率 (RTX 3090) | COME (扩散+ControlNet) | 692.97 M | 4461.46 G | 4377.67 ms | 34.23 | 44.13 |
| 计算效率 (RTX 3090) | I2-World (两阶段自回归 SOTA) | 22.67 M | 494.58 G | 227.09 ms | 39.73 | 49.80 |
| 计算效率 (RTX 3090) | GAST (本文) | 12.09 M | 416.27 G | 80.03 ms | 47.40 | 56.24 |
| 8 秒超长时预测 (Avg.) | DOME | - | - | - | 15.83 | 25.21 |
| 8 秒超长时预测 (Avg.) | COME | - | - | - | 19.07 | 29.96 |
| 8 秒超长时预测 (Avg.) | GAST (本文) | - | - | - | 24.12 | 39.06 |
关键发现¶
- 显式几何投影是突破性能瓶颈的最大胜负手:消融实验显示,仅加入基于位姿的显式几何变换(EGT)即可使 mIoU 暴增 13.47%(从 18.31% 跃升至 31.78%),IoU 暴增 12.64%。这确证了自动驾驶场景中道路、建筑等静态体素占据绝大部分体积,依靠位姿变换直接锁定静态背景远比让神经网络从头拟合坐标外推更精准。
- 跨时域世界坐标对齐消除长距离空间漂移:引入全局空间语境聚合(GSCA)带来 5.61% 的 mIoU 跃升,多尺度分辨率金字塔消融进一步表明,融合 50×50、100×100 和 200×200 三层结构显著优于任何单一分辨率尺度,兼备全局路径拓扑和边界几何细节。
- 卓越的推理实时性与极简参数规模:得益于抛弃昂贵且串行不可并行的自回归 Transformer,GAST 仅包含 12.09M 参数,计算量为 416.27G FLOPs,单帧端到端推理时延仅为 80.03 ms,较 I2-World 提速 2.84 倍,较扩散基线 COME 提速超过 54 倍。
- 超长时域预测衰减极为平缓:在 8 秒超长预测挑战中,第 8 秒时 GAST 仍保持 15.96% mIoU 和 30.87% IoU,整体 8 秒均值较 COME 提升 5.05% mIoU 和 9.10% IoU,充分印证显式几何约束能有效抑制误差雪崩。
- 零样本迁移泛化优异:在未经过任何微调的情况下,在 Occ3D-Waymo 验证集上 10Hz 与 2Hz 采样率下分别录得 57.47% 与 46.70% mIoU,相较 I2-World 分别领先 13.74% 与 10.32%。
亮点与洞察¶
- 解耦“确定性静态几何”与“自适应动态演化”:将物理先验(位姿刚性翘曲)与隐式学习(仿射调制与可形变交叉注意力)显隐解耦,用确定性几何底座化解复杂预测难题,设计非常优雅且符合物理规律。
- 打破自回归世界模型的思维定势:在学术界盲目拥抱大语言模型离散 Token 化与自回归架构的潮流下,证明在连续 BEV 空间进行紧凑的时空连续表征建模不仅在精度上全面碾压,在时延和参数量上更是具备数量级优势。
- 世界坐标下的多尺度空间对齐表征:将历史与未成形的未来统一投射至固定全局参考系构建金字塔,化解了局部视点剧烈移动造成的时空感知割裂,该设计对于多智能体协同感知及长时高精地图重建具备直接借鉴价值。
局限与展望¶
- 强依赖高精度自车位姿与轨迹预测:显式几何翘曲严重依赖未来位姿预测的准确性。在极端打滑、颠簸或剧烈长时变道场景中,若位姿外推偏差较大,显式空间翘曲可能带来系统性几何投影畸变。
- 动态障碍物运动意图建模深度有限:虽然 ConvGRU 能捕捉平滑的运动惯性,但未显式结合矢量化道路拓扑(如车道线走向、红绿灯语义),面对前方车辆复杂博弈与转向意图时可能产生保守的均值外推。
- 未来改进方向:可考虑将矢量化 HD-Map / 拓扑车道线先验注入隐式调制分支,并探索将不确定性建模引入显式翘曲过程,使模型在剧烈未知位姿下具备退化容错与方差估计能力。
相关工作与启发¶
- vs OccWorld / RenderWorld / Occ-LLM: 早期世界模型采用 VQ-VAE 离散量化加 Transformer 逐 Token 因果自回归生成,训练受限于 Tokenizer 重构上限且推理缓慢;本文采用连续 BEV 特征空间端到端直接回归,推理速度提升近 3 倍且指标全面超越。
- vs I2-World: I2-World 尝试将场景 Token 解耦为帧内细粒度与帧间动态演化两个子自回归过程;本文通过刚体变换公式直接显式解耦静态几何,用纯卷积与时空注意力替代两阶段自回归,计算量更轻量且无累积误差。
- vs DOME / COME: 扩散模型占用预测方法通过多步反向去噪生成连续空间表征,虽然表征连续但采样延迟高达数千毫秒无法实车落地;本文单步前向传播完成 4D 占用外推,延迟仅 80ms,为端到端实时车载计算提供可能。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 巧妙跳出自回归世界模型范式,将物理位姿显式先验与连续端到端双路时空语境深度融合。
- 实验充分度: ⭐⭐⭐⭐⭐ 覆盖 Occ3D-nuScenes 的 4 种模态组合、8 秒超长时预测、Occ3D-Waymo 零样本迁移及超详细细粒度消融。
- 写作质量: ⭐⭐⭐⭐⭐ 架构逻辑严密自洽,问题痛点剖析深刻,方法描述与数学表达清晰准确。
- 价值: ⭐⭐⭐⭐⭐ 为自动驾驶 4D 占用预测与端到端规控提供高精度、高效率的全新基座范式。