跳转至

Semantic-Aware, Physics-Informed, Geometry-Grounded Weather Synthesis

会议: ECCV 2026
论文: ECCV Official
代码: https://jumponthemoon.github.io/w-crafter/
领域: 自动驾驶
关键词: 天气合成、视频编辑、粒子模拟、物理先验、几何对齐

一句话总结

通过解耦语义锚定、物理驱动的各向异性高斯粒子动态模拟与 3D 几何对齐,有效激活现成视频扩散模型中被抑制的天气与粒子先验,实现逼真、时空连贯且可控的恶劣天气视频生成。

研究背景与动机

恶劣天气(如暴雪、倾盆大雨)下的视频合成在自动驾驶鲁棒感知评估、数据增强及影视特效中极具价值。然而,极端恶劣天气由于采集难度大且危险,真实世界对应的数据极为稀缺。现有天气视频生成方案主要面临两难困境:基于 3D 隐式/显式重建(如 NeRF、3DGS)的方法依赖人工规则设计或逐场景耗时优化,不仅对重建伪影极为敏感,且合成效果僵硬单调;而基于数据驱动微调视频扩散模型的方法,往往高度受限于合成训练集或图形引擎的风格分布,泛化到新场景时需要极其昂贵的重新微调。

另一方面,通用条件视频编辑模型在处理天气效果时存在显著瓶颈。通用生成模型通常在干净、高质量的清晰视频上预训练,导致模型在先验上本能地抑制强烈的环境退化与颗粒遮挡。仅靠简单的文本提示词(如“make it snowy”或“heavy rain”)往往只能引发微弱的全局色调发白或轻微阴暗,无法生成密集下落的雨丝与雪花颗粒。更为关键的是,直接在 2D 画面上叠加动态粒子时,若脱离了相机的真实运动轨迹与场景 3D 重力方向,粒子运动就会与背景产生严重的漂移与视差割裂。

本文的核心洞察在于:预训练视频扩散模型并未丢失天气粒子的表征能力,而是缺少能够显式激活此类潜空间退化先验的“结构化几何与物理动力学提示”。只要在输入端提供符合空间几何与物理运动轨迹的粒子图元与深度引导,预训练模型无需任何额外微调便能自发涌现高质量雨雪。核心 idea:将天气合成拆解为“语义(长什么样)-动力学(怎么运动)-几何(落在何处)”三元解耦控制框架,通过语义锚定生成第一帧基准风格,基于物理动力学模拟各向异性高斯粒子场,再借助 3D 场景几何将粒子投影至相机与深度空间,从而零样本驱动现成视频扩散模型生成物理逼真的恶劣天气。

方法详解

整体框架

整体框架分为三个相互解耦且串联对齐的阶段:语义感知外观锚定(Semantic-Aware Appearance Anchoring)、物理驱动动力学模拟(Physics-Informed Dynamic Simulation)以及几何对齐视频合成(Geometry-Grounded Video Synthesis)。系统输入原始视频序列,输出添加了逼真雨雪动力学与环境退化的合成视频。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    In["输入原始视频序列"] --> P1["1. 语义感知外观锚定<br/>VLM解析+LLM推理指令+I2I首帧锚定"]
    In --> G0["几何基础模型估计<br/>3D点云地图 + 深度图 + 相机轨迹"]
    P1 --> GAlign["3. 几何对齐与投影<br/>拟合地平面重力对齐 + 相机投影粒子"]
    G0 --> P2["2. 物理驱动动力学模拟<br/>各向异性高斯粒子场受重力/风力/湍流演化"]
    P2 --> GAlign
    GAlign --> Cond["构建结构化三元条件<br/>首帧外观锚点 A + 粒子动态图 {Et} + 场景深度 {Gt}"]
    Cond --> Out["现成条件视频扩散模型<br/>零样本生成物理逼真天气视频"]

整个工作流通过显式物理控制弥补隐式生成模型的缺陷:首先在首帧确立地表湿滑度、积雪厚度与环境全局光照;随后在正则 3D 空间中数值求解粒子动力学方程,并结合估计的相机姿态投影为包含动态几何视差的粒子图;最后将增强后的深度图与外观提示输入条件视频编辑模型(如 Wan2.1-VACE)完成高质量时间连贯渲染。

关键设计

1. 语义感知外观锚定:消除文本提示欠拟合与歧义

仅用单一粗粒度提示词无法指导图像编辑模型捕捉微弱光照、地面湿润倒影或厚重积雪的结构细节。为此,该模块首先调用视觉语言模型(VLM)对视频首帧 \(I_0\) 进行细粒度语义解析,抽取场景中包含的道路、建筑、植被等结构属性描述 \(P_{\mathrm{scene}} \leftarrow \mathrm{VLM}(I_0)\)。随后,大语言模型(LLM)结合用户指定的事件意图 \(U\)(包括天气类型、持续时间类别 short/medium/long 以及烈度),推理出针对该场景的可执行图像编辑指令: $\(P_{\mathrm{img}} \leftarrow \mathrm{LLM}(P_{\mathrm{scene}}, U)\)$ 利用图像编辑模型(如 FLUX.1-Kontext Pro)对首帧进行重绘,生成具有准确环境光调(如阴霾散射光、湿润反光)的编辑首帧 \(I'_0\)。同时,LLM 基于编辑指令总结出一段全局连贯的视频描述 \(P_{\mathrm{vid}}\)。将后续模拟的物理粒子图叠加至 \(I'_0\) 得到外观基准 \(\tilde{I}_0\),与 \(P_{\mathrm{vid}}\) 共同构成外观锚点 \(\mathcal{A}=(\tilde{I}_0, P_{\mathrm{vid}})\),从语义源头上锁死视频整体的时间连贯风格。

2. 物理驱动动力学模拟:连续粒子场与流体扰动

为了在无配对恶劣天气视频训练数据的前提下激活扩散模型的降水颗粒先验,本文构建了由连续各向异性高斯图元构成的粒子场。每个粒子 \(i\) 在二维局部坐标下的空间足迹由各向异性高斯核参数化: $\(G_i(s) = \exp\left(-\left(\frac{x^2}{2\sigma_{x,i}^2} + \frac{y^2}{2\sigma_{y,i}^2}\right)\gamma\right)\)$ 其中 \((\sigma_{x,i}, \sigma_{y,i})\) 控制粒子长宽比以分别模拟拉长的雨丝或扁圆的雪花,\(\gamma\) 为基于深度的尺度因子。在三维空间中,赋予粒子质量 \(m\) 与坐标 \(\mathbf{x}_i \in \mathbb{R}^3\),其速度 \(\mathbf{v}_i\) 在时间上的演化遵循受力动力学方程: $\(m\dot{\mathbf{v}}_i(t) = \mathbf{F}_g + \mathbf{F}_w + \mathbf{N}_t(\mathbf{x}_i(t), t)\)$ 其中重力 \(\mathbf{F}_g = mg \mathbf{d}_g\) 与风力 \(\mathbf{F}_w = \alpha \mathbf{d}_w\) 决定宏观运动趋势。为了引入真实降水中由于空气扰动引发的局部随机摇曳,引入无散度旋度噪声(Curl Noise)场表示湍流 \(\mathbf{N}_t(\mathbf{x}, t) = \beta (\nabla \times \boldsymbol{\psi}(\mathbf{x}, t))\),其中势函数 \(\boldsymbol{\psi}\) 由 3D Perlin 噪声构建。系统采用显式欧拉积分进行时序离散推进,获得具有物理真实感的密集粒子运动轨迹。

3. 几何对齐视频合成:重力校准与相机动态投影

标准粒子模拟通常在固定向下的正则坐标系中进行,而实拍视频往往包含倾斜视角与复杂的相机自身运动(Ego-motion)。若直接将 2D 粒子贴在画面上,在车辆前进转弯时粒子会出现悬浮脱节。该模块首先利用几何基础模型(Depth Anything V3)从输入视频 \(V\) 中预测场景稠密点云 \(S_p\)、逐帧深度图 \(D\) 以及相机内外参 \((K_t, R_t, \mathbf{t}_t)\)。 首先在点云空间中采样并拟合主导地平面方程 \(\pi: \mathbf{c}^\top \mathbf{p} + d = 0\),将地面法向量反方向定为真实场景重力方向 \(\mathbf{d}'_g = -\mathbf{c}\);通过罗德里格斯旋转将正则粒子场的主轴对齐至真实重力轴,使得在倾斜视角下雨雪依然垂直于实际地表下落。随后,利用各帧相机位姿 \((K_t, R_t, \mathbf{t}_t)\) 将粒子三维坐标 \(\mathbf{x}_i^t\) 投影到图像平面像素坐标 \(\mathbf{u}_{i,t}\),并根据投影速度方向动态旋转粒子图元朝向 \(\theta_{i,t} = \mathrm{atan2}((\mathbf{v}_i^t)^y, (\mathbf{v}_i^t)^x)\)。最终合成的粒子图叠加到深度图上形成粒子增强深度图 \(\{\mathcal{E}_t\}\),与原始深度几何 \(\{\mathcal{G}_t\}\) 及外观锚点 \(\mathcal{A}\) 共同输入预训练条件视频生成器(Wan2.1-VACE)完成最终渲染。

实验关键数据

主实验

评估基于涵盖 DAVIS、DL3DV-10k、PandaSet 与 nuScenes 的 58 个多样化场景视频。对比方法包括纯文本引导模型 CogVideoX、WeatherEdit 以及条件引导模型 LTX-Video、VACE。评测指标包括 CLIP 文本定向对齐度(CLIP-D)、CLIP 图像语义相似度(CLIP-S)以及 GPT-4V 多模态感知打分(VLM)。

方法 雪天 CLIP-D ↑ 雪天 VLM ↑ 雨天 CLIP-D ↑ 雨天 VLM ↑ 整体 CLIP-D ↑ 整体 CLIP-S ↑ 整体 VLM ↑
CogVideoX 0.08 0.56 0.06 0.52 0.07 0.82 0.54
WeatherEdit 0.14 0.45 0.12 0.36 0.13 0.91 0.41
LTX-Video 0.15 0.68 0.12 0.67 0.13 0.82 0.67
VACE 0.18 0.76 0.14 0.74 0.16 0.82 0.75
Ours 0.19 0.84 0.15 0.81 0.17 0.81 0.83

注:原论文 Table 1。WeatherEdit 拥有偏高的 CLIP-S 是由于其改动过于微弱保守,几乎未改变原始场景内容;而本文方法在维持合理语义一致性的同时,大幅提升了天气对齐度与感知真实度。

下游感知与真实度评测

为了验证生成数据对自动驾驶恶劣天气感知的实用价值,本文在 ACDC 与 MUSES 两个权威极端天气语义分割基准上,分别评估了经典分割模型 DAFormer 与 HRDA 在引入合成雨雪数据微调后的域泛化性能增益(mIoU, %):

基准模型 ACDC (雪天) ACDC (雨天) MUSES (雪天) MUSES (雨天)
DAFormer 50.9 50.8 41.4 33.8
DAFormer + Ours 56.3 (+5.4) 56.6 (+5.8) 47.2 (+5.8) 41.5 (+7.7)
HRDA 50.0 51.6 40.4 35.4
HRDA + Ours 60.4 (+10.4) 66.1 (+14.5) 50.4 (+10.0) 44.4 (+9.0)

注:原论文 Table 4。此外,在 46 人参与的人工评测(5 分 Likert 量表)中,本文在照片真实感上达到 4.16(基线 VACE 为 3.58),物理真实感达到 4.12(VACE 为 3.52);用户盲选首选率在雨天达 41.3%、雪天达 56.5%(见原论文 Table 2、Table 3)。

关键发现

  • 下游感知增益显著:在困难的 MUSES 雨天驾驶场景下,HRDA 经合成数据增强后 mIoU 从 35.4% 暴涨 9.0% 达到 44.4%;在 ACDC 雨天下涨幅高达 14.5%(从 51.6% 提升至 66.1%),证明物理自洽的雨雪颗粒与反光能有效弥补现实极端天气标注数据匮乏的短板。
  • 几何与重力对齐消融:若缺失点云地平面重力校准,粒子在仰角/俯角相机中仍沿画面垂直下落,违背真实物理;若缺失相机位姿动态投影,在自车前向行驶时粒子无法体现近大远小的快速视差推进,丧失运动纵深感。
  • 语义锚定抑制幻觉:若仅将粒子深度图直接送入视频扩散模型而缺少细粒度首帧锚定提示,扩散模型倾向于将颗粒结构错误识别为场景杂物,导致画面出现结构崩塌;细化的场景级重绘指令确保了模型将深度扰动正确理解为大气降水。

亮点与洞察

  • 激活而非从头学习:巧妙指出了现成视频大模型并非无法生成密集雨雪,而是潜空间先验被训练集的洁净偏好所抑制。通过注入几何物理图元唤醒潜在能力,避免了代价极高的全参数重训。
  • 物理与生成的桥接设计:将经典的无散度旋度噪声(Curl Noise)与各向异性高斯粒子集成进现代扩散模型的结构化条件通道,使风力、湍流、颗粒形状具备清晰物理可解释性与精确滑杆调节能力。
  • 对自动驾驶长尾 Corner Case 的可扩展生成:无需复杂图形学引擎建模,直接在真实采集的历史晴天 Log 视频上批量注入暴雨、大雪、不同风向风速的气象干扰,形成闭环数据闭环。

局限与展望

  • 级联上游依赖累积:方案依赖深度估计基础模型(Depth Anything V3)与地平面拟合算法。若输入场景缺乏清晰地面(如空中俯视视角、极度崎岖山地)或深度估计失准,重力对齐与位姿投影会出现误差传递。
  • 双向物理交互简化:当前的物理模拟主要属于单向几何投影,尚未显式模拟雨滴打击地面飞溅(Splash)、挡风玻璃刮水器刮拭物理痕迹或车轮带起的积水扬雾,细节交互仍有待提升。
  • 推理时间偏长:单个视频的预处理(VLM解析、几何估计与物理积分)耗时约 3 分钟,但后续扩散模型逐帧生成耗时约 38 分钟(单张 RTX A6000),难以满足在线实时交互仿真需求。

相关工作与启发

  • vs. WeatherWeaver (ICCV 2025):WeatherWeaver 依赖虚拟引擎合成的雨雪数据集重新训练视频扩散模型,生成结果容易受合成渲染器风格绑架;本文完全免除针对性视频微调(Zero-shot),通用性与真实感更强。
  • vs. ClimateNeRF / RainyGS:神经辐射场与 3D 高斯泼溅天气合成方案需要针对单一场景进行稠密多视角采集与昂贵的逐场景拟合,无法泛化到单目单次拍摄的开环视频;本文直接支持单目野外视频驱动。

评分

  • 新颖性: ⭐⭐⭐⭐☆ [解耦语义、物理动力学与几何,以零样本方式激活视频大模型被抑制的天气先验]
  • 实验充分度: ⭐⭐⭐⭐⭐ [覆盖通用视频与自动驾驶数据集,涵盖主观评价、客观指标以及下游分割模型鲁棒性验证]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑架构异常清晰,动机剖析精准且各阶段数学表述严密规范]
  • 价值: ⭐⭐⭐⭐⭐ [为自动驾驶感知数据闭环与极端天气长尾仿真提供了切实落地的实用工具]