跳转至

StreetForward: Perceiving Dynamic Street with Feedforward Causal Dynamics

会议: ECCV 2026
论文: ECCV 2026
领域: 自动驾驶
关键词: 动态街景重建, 前馈3DGS, 因果时序注意力, 跨帧渲染一致性, 无追踪器4D感知

一句话总结

StreetForward 提出了一种无需相机位姿、外部追踪器和分割标签的前馈 4D 动态街景重建框架,通过因果掩码注意力解耦时序有向运动并联合跨帧渲染一致性优化,实现了高保真度的时空外推与插值视角合成。

研究背景与动机

自动驾驶闭环仿真与数据驱动闭环测试高度依赖对真实驾驶场景的快速、精准 4D 数字化重建。传统的动态街景神经渲染方案,如结合 NeRF 或 3D 高斯泼溅(3DGS)的经典系统(如 StreetGS、OmniRe),几乎完全依赖耗时且计算昂贵的单场景离线迭代优化(per-scene optimization)。这种计算范式在面对海量、多样且频繁更新的自动驾驶数据流时显得极为笨重,无法支撑高效的规控闭环验证与数字孪生生成。

为了打破效率瓶颈,近期研究借鉴大型 3D 几何基础模型(如 DUSt3R、VGGT)的思路,探索以前馈网络(feedforward)形式在单次推理中恢复几何与相机位姿。然而将前馈重建推进至动态 4D 街景时,遭遇了两个根深蒂固的技术痛点:第一,运动导致的几何退化——VGGT 等模型的交替注意力(Alternating Attention)原生面向无序多视角静态结构,全局注意力同等对待全部帧的视觉 token,缺乏对有向时间流(source → target)的建模能力,容易在运动前景处产生严重的模糊与漂移;第二,运动监督的固有困境与外部依赖——现有前馈动态模型(如 DGGT)要么强依赖外部 3D 追踪器(Tracker)提供候选运动,在长程外推或遮挡时频频出现漂移与碰撞伪影,要么依赖昂贵的稠密 4D 流真值监督,这在规模化真实数据中极难获取。

本文的切入角度是:不再引入脆弱的外部目标追踪器或分割标注,而是从时序因果结构出发,重塑前馈注意力机制,并借由 3DGS 在跨帧几何形变下的天然一致性提供自监督约束。核心 idea:在视觉几何 Transformer 的交替注意力后构建因果掩码注意力显式建模前后帧有向时序流,并通过跨帧高斯渲染、前向/后向双向对称正则与局部刚性约束,以完全自监督且免追踪器的方式前馈预测逐像素动态速度场与 4D 高斯场景。

方法详解

整体框架

StreetForward 接收未经位姿校正的单目车载视频序列作为输入,直接端到端输出相机内外参、稠密深度、全场景 3D 高斯图元(3DGS)以及双向逐像素速度场,从而支持任意新视角和新时间戳的高保真渲染。整个流程分为特征编码与几何初始化、因果时序注意力动力学建模、双向运动解码与跨帧高斯传播、以及时空一致性联合优化四个阶段。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入车载视频序列<br/>未定姿单目多帧图像"] --> B["交替注意力几何编码<br/>DINOv2 + 帧内/全局AA提取静态表征"]
    B --> C["基础几何与位姿解码<br/>预测内外参/深度/初始高斯图元"]
    B --> D["因果掩码时序注意力<br/>注入正弦时间嵌入 + 有向因果掩码"]
    D --> E["双向速度场与动态掩码解码<br/>输出前向/后向速度与动态概率"]
    C & E --> F["动静解耦跨帧渲染与时空一致性约束<br/>静态图元全局融合 + 跨帧动态图元传播"]
    F --> G["4D动态街景输出<br/>支持新位姿与新时间戳的高保真渲染"]

关键设计

1. 因果掩码注意力:消除时序有向运动的表征模糊 VGGT 中的交替注意力(Alternating Attention)设计之初是为了处理无序图像集合,其全局注意力权重在各帧之间双向发散,无法识别物理世界中严格随时间流逝的前向因果传播。本文首先将每帧的 patch token 拼接一个连续正弦时间编码 \(\tau_f \in \mathbb{R}^{d_t}\),得到维度扩充后的时空 token \(\tilde{\mathbf{X}}\) 并展平为序列 \(\tilde{\mathbf{Z}}\)。随后引入结构化因果掩码矩阵 \(\mathbf{M}\): $$ \mathbf{M}[b, h, i, j] = \begin{cases} 1, & \text{if } \mathrm{frame}(i) = f_{\mathrm{s}} \text{ and } \mathrm{frame}(j) = f_{\mathrm{t}} \ 0, & \text{otherwise} \end{cases} $$ 其中前向传播设定目标帧 \(f_{\mathrm{t}} = f_{\mathrm{s}} + 1\),后向传播设定 \(f_{\mathrm{t}} = f_{\mathrm{s}} - 1\)。掩码被转化为对数偏移 \(-\infty\) 融入注意力 Softmax 计算中: $$ \mathbf{A}^{(h)} = \mathrm{softmax}\left(\frac{\mathbf{Q}^{(h)}{\mathbf{K}^{(h)}}^\top}{\sqrt{d_h}} + \log \mathbf{M}\right) \mathbf{V}^{(h)} $$ 这一设计强迫注意力机制严格沿着时间维度聚合有向的几何与光流线索,在保留静态全局场景结构理解的同时,构建出纯粹且判别力极强的运动感知潜在特征 \(\mathbf{Y}\)。

2. 动静解耦与免追踪器的高斯图元跨帧自监督聚合 在传统的动态高斯重建中,常给每个高斯图元赋予生命周期(lifespan)属性,这极易导致静态背景图元在视角插值时发生不自然的消亡与闪烁。StreetForward 彻底废除图元生命周期机制,使静态高斯在全序列中永久保留。利用 DPT 结构的运动解码头输出双向速度 \(\mathbf{v}_{f,u} \equiv [\mathbf{v}^+_{f,u}, \mathbf{v}^-_{f,u}] \in \mathbb{R}^6\) 和动态置信度 \(s_{f,u}\),通过动态阈值 \(\tau_{\text{dyn}}\) 判定静态指示因子 \(\chi_{f,u} = \mathbb{I}[s_{f,u} \le \tau_{\text{dyn}}]\)。更关键的是,在渲染当前帧 \(f\) 时,模型显式排除帧 \(f\) 自身参数化生成的动态高斯图元,仅利用全局静态高斯集合 \(\mathcal{G}^{\text{static}}\) 与来自相邻帧经速度变换扭曲过来的动态高斯 \(\mathcal{G}^{\text{dynamic}}_{f \leftarrow t}\)(\(t \in \{f-1, f+1\}\))进行合成: $$ \mathcal{G}f = \mathcal{G}^{\text{static}} \cup \bigcup $$ 这种“留空挖槽”式的跨帧代理渲染策略,迫使网络必须通过正确的相邻帧速度位移去解释当前帧的运动前景,从而在无需任何稠密真值速度或外部实例追踪器的情况下,实现了纯粹通过光度自监督学习物体的物理速度。} \mathcal{G}^{\text{dynamic}}_{f \leftarrow t

3. 时空刚性正则与透明度崩溃抑制 在缺乏稠密监督的情况下,仅依靠 RGB 重建损失求解 4D 运动具有严重的病态性,容易导致前景产生结构性浮动伪影,或者模型利用透明度归零来逃避几何对齐错误。为此,本文设计了三大互补正则项: 首先是局部刚性约束 \(\mathcal{L}_{\text{rigid}} = \mathcal{L}_{\text{rigid-2D}} + \mathcal{L}_{\text{rigid-3D}}\)。在 2D 像素窗口 \(\mathcal{N}(u)\) 与 3D 空间 \(K\) 近邻 \(\mathcal{N}_K(u)\) 范围内,加权惩罚速度场的一致性偏离,强迫刚体表面各部位具有平滑的块状速度场,消除了车辆周围散落的悬浮伪影(floaters)。 其次是双向时序对称损失: $$ \mathcal{L}_{\text{fb}} = \sum_u |\mathbf{v}^{f \to f+1}_u + \mathbf{v}^{f \to f-1}_u|_2^2 $$ 在微小时间步长 \(\Delta t\) 内施加等速假设,防止前后向速度彼此割裂。 最后是透明度稳定项 \(\mathcal{L}_{\alpha} = \lambda_{\alpha} \sum_{f} \sum_{k \in \mathcal{V}_f} w_{f,k} \|1 - \alpha_k^f\|_2\),该项激励可见高斯图元维持接近 1 的显著透明度,防止模型在遇到复杂运动视差时将高斯图元透明度优化至接近 0 的简并解(opacity collapse),迫使反向传播梯度专注于修正高斯图元的 3D 位置与空间运动。

损失函数 / 训练策略

整个模型采用分阶段渐进式优化策略: 1. 第一阶段(单帧几何与位姿对齐):冻结 DINOv2 编码器,运动解码头最终线性层权重置零且暂不参与反向传播。关闭跨帧动态聚合,仅优化交替注意力骨干网络、相机头、深度头以及高斯头,使静态场景几何与单帧高斯图元初始化达到极高精度。同时引入光度损失 \(\mathcal{L}_{\text{rgb}}\)、透明度正则 \(\mathcal{L}_{\alpha}\) 以及光栅化深度与预测深度的几何一致性损失 \(\mathcal{L}_{\text{depth}}\)。 2. 第二阶段(动态时序动力学联合微调):激活因果掩码注意力与运动解码头,开启跨帧动态图元渲染和时序随机下采样(1× 至 4× 帧率),将损失联合扩展为: $$ \mathcal{L} = \mathcal{L}{\text{rgb}} + \mathcal{L}} + \mathcal{L{\text{depth}} + \lambda}}\mathcal{L{\text{rigid}} + \lambda $$ 通过该策略,网络能稳健地从单帧可靠几何平滑过渡到复杂的 4D 速度场与时空外推生成。}}\mathcal{L}_{\text{fb}

实验关键数据

主实验

模型在 Waymo Open Dataset 官方测试集(202 个场景)上进行了严格评估,涵盖密集交通、雨天以及夜间等复杂自动驾驶工况。输入 20 帧视频序列,仅提供第 1、5、10、15 帧作为上下文视图,其余帧作为测试视角评估原始视角时空插值(Dynamic only 与 Full image)以及基于稀疏 LiDAR 点云反投影的深度精度(RMSE)。此外,模型在 CARLA 数据集上进行了零样本(zero-shot)域迁移评估。

数据集 / 评测维度 指标 StreetForward (本文) DGGT (之前SOTA) STORM 性能优势 / 收益
Waymo 动态区域 (Dynamic Only) PSNR ↑ 24.30 20.99 22.10 +3.31 dB (超越前沿 feedforward 方法)
Waymo 动态区域 (Dynamic Only) SSIM ↑ 0.827 0.821 0.624 +0.006 (相比 DGGT)
Waymo 全图范围 (Full Image) PSNR ↑ 27.01 27.41 26.38 保持极高水平 (仅微弱差异于 DGGT)
Waymo 全图范围 (Full Image) SSIM ↑ 0.818 0.846 0.794 保持竞争力
Waymo 稀疏深度 (Dynamic RMSE) RMSE ↓ 3.45 6.37 7.50 误差降低 45.8%
Waymo 稀疏深度 (Full Image) RMSE ↓ 3.14 4.08 5.48 误差降低 23.0%
CARLA 零样本迁移 (Dynamic PSNR) PSNR ↑ 22.37 21.32 12.80 +1.05 dB (显著跨域泛化优势)
CARLA 零样本迁移 (Dynamic SSIM) SSIM ↑ 0.741 0.691 0.313 +0.050
CARLA 零样本迁移 (Full Image PSNR) PSNR ↑ 24.62 23.91 18.23 +0.71 dB
CARLA 零样本迁移 (Full Depth RMSE) RMSE ↓ 6.01 6.56 - 误差显著低于所有基线

消融实验

在 Waymo 数据集上针对时序因果建模、时空运动正则以及几何透明度约束开展了系统的消融实验,分别统计动态区域与全图的渲染表现:

配置 动态区域 PSNR ↑ 动态区域 SSIM ↑ 全图 PSNR ↑ 全图 SSIM ↑ 说明
Full model (完整模型) 24.30 0.827 27.01 0.818 完整因果注意力与复合时空正则
w/o causal attention (去除因果注意力) 22.36 0.714 24.07 0.781 动态 PSNR 骤降 1.94 dB,时序有向信息丢失
fixed causal horizon (\(k=1\)) 22.96 0.722 24.66 0.760 视野范围固定缺乏多帧率鲁棒性
w/o \(\mathcal{L}_{\text{rigid}}\) (去除局部刚性约束) 22.64 0.743 26.21 0.786 运动场出现断裂与大量空间浮动伪影
w/o \(\mathbf{v}^-\) (仅保留前向速度) 23.26 0.786 26.88 0.809 缺乏后向融合,遮挡区域填补能力受损
w/o \(\mathcal{L}_{\text{fb}}\) (去除前向后向一致性) 23.03 0.721 26.43 0.794 前后轨迹不自洽,运动平滑度下降
w/o \(\mathcal{L}_{\alpha}\) (去除透明度稳定项) 21.02 0.659 25.85 0.683 发生透明度崩溃,产生黑洞并严重掉点 3.28 dB

关键发现

  • 因果注意力的不可替代性:去除因果掩码注意力后,动态区域 PSNR 下降了近 2 dB,这证明无向的全局注意力机制在混合静态背景与动态目标时无法精确分离运动矢量,导致合成画面出现严重的运动模糊与重影。
  • 透明度稳定项是多帧融合的定海神针:消融实验中去除 \(\mathcal{L}_{\alpha}\) 导致动态区域性能发生崩塌式下降(PSNR 跌去 3.28 dB,SSIM 骤降 0.168)。在多帧联合光度优化中,高斯图元极易自发减小透明度以规避位置不匹配带来的惩罚,\(\mathcal{L}_{\alpha}\) 成功规避了这一局部极小值。
  • 自监督运动优于粗糙外部追踪器:在与 DGGT 的对比中,DGGT 依赖 TAPIR-3D 类外部追踪器,面对长时遮挡或复杂路口时极易把车辆轨迹误判至空中或邻近车道;而 StreetForward 凭借像素级因果动力学与刚性正则,完全避免了伪动态噪点,对停放车辆等假阳性动态先验具备天然免疫力。

亮点与洞察

  • 有向因果掩码对通用视觉 Transformer 的低成本赋能:没有另起炉灶设计沉重的 4D 视频扩散主干,而是在成熟的交替注意力之上仅添加 4 层因果掩码注意力与时间编码,以极轻量的额外参数量精准捕获了物理前向/后向运动。
  • “留空排除”的自监督跨帧代理机制:在渲染当前帧时故意剥离当前帧自身的动态高斯,强制相邻帧依据运动速度位移来解释当前画面,这一设计精巧地破解了缺乏稠密 3D 场景流与运动速度真值标签的自监督训练难题。
  • 消除高斯生命周期依赖以保全静态背景:打破了 4D 动态高斯重建中滥用 lifespan 属性的惯性思维,将静态背景赋予全局永久生命力并通过正则防崩溃,有效提升了自动驾驶横向变道视角外推时的背景完整度。

局限与展望

  • 作者承认的局限:模型基于恒定速度假设约束微小时间步长内的双向运动,在车辆急速急刹、大角度转向或者行人剧烈非刚体变形的极端运动场景下,局部的恒速线性外推可能存在一定程度的轨迹漂移。
  • 实验与边界局限:当前评估主要基于 20 帧短视频片段,在长达数分钟或公里级的大尺度自动驾驶长序列中,前馈模型的全局记忆容量与累积漂移尚未进行长程压测。
  • 未来改进方向:可进一步将隐式车辆骨架/包围盒动力学作为物理先验引入局部刚性正则中,或结合自回归序列更新机制将该框架扩展至超长时序自动驾驶在线建图与仿真闭环。

相关工作与启发

  • vs VGGT / Pi3: VGGT 和 Pi3 作为前沿的无序多视角几何前馈大模型,在静态 3D 几何与位姿恢复上表现惊艳,但在动态场景下均表现出明显的几何劣化(动态区域深度 RMSE 高达 6.36m 与 7.93m)。StreetForward 继承了其交替注意力机制,但通过因果掩码和运动解码将动态深度 RMSE 剧烈压缩至 3.45m。
  • vs DGGT: DGGT 同样探索了免位姿的前馈 4D 驾驶场景重建,但其核心依赖外部 3D 追踪器(如 TAPIR-3D)。在复杂遮挡或外推时易导致车辆飞天或轨迹崩溃,且静态/动态分割错误频发;StreetForward 实现了完全的 tracker-free 与 segmentation-free,动态区域 PSNR 提升达 3.31 dB。
  • vs STORM: STORM 虽然探索了时空前馈重建,但依赖离散的体素/特征网格,速度估计精度粗糙,导致动态前景边缘严重模糊;StreetForward 基于显式高斯和双向因果注意力在渲染细节上显著领先。

评分

  • 新颖性: ⭐⭐⭐⭐ [创新地将因果掩码引入几何 Transformer 并通过留空跨帧渲染实现完全免追踪器的无监督速度学习]
  • 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 Waymo、CARLA 跨域零样本迁移,主客观渲染、深度指标与系统消融完备]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑严密,动静解耦机制与数学公式叙述清晰透彻]
  • 价值: ⭐⭐⭐⭐⭐ [对自动驾驶大规模仿真、数据闭环及免优化 4D 高斯街景重建具有重要的工程与学术指导意义]