Multi-view Multi-vehicle Driving Dataset for Novel View Synthesis¶
会议: ECCV 2026
论文: CVF Open Access
代码: https://mv2-dataset.github.io/
领域: 3D 视觉
关键词: 自动驾驶新视角合成、多车辆多视角、跨视角外推评测、3D高斯泼溅、位姿估计基准
一句话总结¶
针对自动驾驶场景中新视角合成评测仅依赖单轨迹插值的严峻瓶颈,本文构建了首个由汽车、两轮电瓶车及无人机同步采集的多车跨视角真实驾驶数据集 MV2,通过高精度对齐与基于极线一致性的位姿验证,构建了跨轨迹与空地视角的严苛基准,实验证明现有优化型和前馈型 NVS 方法在基线变大时均出现灾难性性能退化。
研究背景与动机¶
基于可微渲染的新视角合成(Novel View Synthesis, NVS)如 NeRF 和 3D Gaussian Splatting(3DGS)近年来取得了突破性进展,在自动驾驶高保真仿真、端到端感知验证与闭环规划测试中展现出极高应用价值。然而在实际室外自动驾驶场景下部署 NVS 面临极其苛刻的挑战:车载视角基线稀疏、大面积无纹理天空区域以及高密度动态移动物体。现有绝大多数驾驶 NVS 基准(如基于 KITTI、Waymo Open Dataset、nuScenes 或 Argoverse 2 的评测协议)本质上是将采集车前行单轨迹中的视频帧按间隔抽帧(如每第 \(k\) 帧为测试帧),这种测试仅衡量了沿同一条轨迹内插(interpolation)的复原能力,无法评估模型真正推广到未观测横向或高程视角的跨轨迹外推(extrapolation)能力。
现有填补外推空白的尝试受到多重物理与技术局限:合成仿真数据(如 CARLA/XLD)缺乏真实世界的复杂光影与传感器噪声;多次遍历重合场景方案(如 MTGS、Para-lane)因为城市交通动态性无法重现相同的动态物体,被迫仅评估静态静态背景;而使用单辆车在真实复杂路况下不可能同时从多个车道或立体高空同步观测相同动态实体。此外,现有空对地驾驶数据集缺乏跨视角精确位姿联合标定。因此,业界缺乏一个包含真实动态交通流、具有大基线横向位移与立体视角高度跨度、且具有可信亚像素几何位姿注册的物理基准。
本文的核心突破在于设计了一套汽车(四轮)、电瓶车(两轮)与无人机(空中)协同伴随驾驶采集方案。汽车与电瓶车并排分道行驶提供横向跨车道视差,无人机高空同步俯视提供无遮挡立体视角覆盖,并以两阶段 SfM 定位与密集极线对齐机制攻克大视差跨序列位姿注册难题。本文的核心 idea 是构建包含 50 个复杂动态城市场景与 12,000 张高分辨率图像的多车立体驾驶数据集 MV2,首次建立跨车辆与空对地的真实外推 NVS 评估体系,揭示前馈与优化型渲染及前馈位姿估计在跨视角驾驶场景中的真实性能瓶颈。
方法详解¶
整体框架¶
MV2 数据集的构建与评测流程围绕多视角多平台数据同步采集、几何位姿联合注册验证、以及跨传感器视角的双向外推评测展开。采集硬件涵盖三类平台:安装双目广角相机(左目 \(V^L\)、中目 \(V^C\))的试验汽车、安装单相机 \(V^S\) 的两轮电瓶车、以及安装单相机 \(V^D\) 的航拍无人机。数据经过筛选切片为 100 帧短序列后,通过结构光标定内参结合基于两阶段增量 SfM 与神经网络特征匹配的位姿标定网络统一到全局坐标系中,并施加严格的极线几何误差阈值过滤掉不可靠测试帧。最终划分出以汽车为主视角的 Eval-Car-Train 和以无人机为主视角的 Eval-Drone-Train 两大跨视角评测协议。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["多车辆同步采集<br/>汽车(VC,VL) + 电瓶车(VS) + 无人机(VD)"] --> B["两阶段坐标系统一注册<br/>训练流自建SfM + 测试帧局部定位"]
B --> C["基于人机结合的极线几何验证<br/>RoMA密集匹配与极线误差硬阈值过滤"]
C --> D["跨传感器跨视角NVS与位姿基准评估<br/>Eval-Car-Train 与 Eval-Drone-Train"]
关键设计¶
1. 多平台伴随协同采集与时钟硬同步机制:打破单轨迹观测盲区 现有驾驶数据集无法提供动态场景的立体并发视点。MV2 采用四轮汽车、两轮电瓶车与航拍无人机三平台伴随编队行驶策略,在 5 天时间内累计采集超过两小时的城市与半城市复杂道路视频,全部传感器均采用 1080p 60FPS 格式并通过系统时钟进行同步。汽车和电瓶车沿相邻车道并排行驶以提供真实物理横向基线视差,无人机在上空同步跟飞以捕捉无遮挡场景全景。采集数据按 2 FPS 均匀采样并切片为包含 100 帧的短视频段,剔除了严重拥堵停滞、隧道弱纹理、车辆相对失位以及红绿灯长停顿等退化片段,初筛得到 200 个多机位候选序列,确保动态物体在各传感器间存在充沛的共视观测。
2. 两阶段解耦相机位姿注册:避免跨视角联合优化崩塌 在大基线场景下直接对所有机位图像运行全局联合 SfM(如常规 COLMAP)极易因视角差异过大导致特征匹配大量误配,造成重建崩溃或漂移。为此,本文设计了两阶段位姿估计框架:第一阶段,仅使用单平台训练序列图像(如汽车中目 \(V^C\) 或无人机目 \(V^D\))在 COLMAP 中独立运行标准 SfM,建立稳健、尺度一致的局部 3D 几何基线与训练帧绝对位姿;第二阶段,将跨平台测试机位图像(\(V^L, V^S, V^D\))作为查询帧,利用基于图像检索识别出的最近邻 15 张训练图像作为几何锚点,通过 COLMAP 的视觉定位模块单独反推测试位姿。该解耦策略完全隔离了外侧视角带来的误差污染,保证训练位姿不受扰动,同时可精准识别并剔除定位失败的测试帧。
3. 基于密集神经网络特征与双层极线几何验证:保证无真值下的位姿高保真度 在野外室外驾驶中缺乏毫米级地面真值位姿,相对位姿评估若选取的参考帧自身带偏会导致“伪正确”。本文首先基于序列连续性构建位姿图,在训练序列上验证相邻帧以及首尾帧/第 50 帧的闭环几何一致性。人工标注员针对图像对划定同名 3D 物理区域的候选边界框,并在裁剪框内调用密集匹配网络 RoMA 获取高密度像素级点对应集 \(X_{\text{RoMA}}\)。对于匹配点对 \((x_1, x_2)\),给定两相机内参 \(K_1, K_2\) 及相对外参旋转 \(R = R_2 R_1^\top\)、平移 \(t = t_2 - R t_1\),基础矩阵定义为 \(F = K_2^{-\top} [t]_\times R K_1^{-1}\),对应单点极线几何距离计算公式为: $\(e = \|x_2^\top F x_1\|\)$ 计算整帧 \(N\) 对密集匹配点集上的最大极线误差 \(e_m = \max_{i} e_i\)。设置严格质量阈值 \(e_m \le 30\) 像素;仅当训练序列内所有相邻帧均满足此约束时,该序列才被保留(200 个序列中仅 50 个高难度长序列达标)。随后,对测试图像与其最近邻训练帧进行相同的极线误差检验,过滤掉残余定位不精确的测试样本,最终固化了包含 12,000 张高保真对齐画面的严苛基准。
4. 针对驾驶特性的无 LiDAR 深度先验与动态分割适配:赋能单目优化基线 由于 MV2 不依赖笨重昂贵的机械式 LiDAR,本文探索了纯视觉深度先验对驾驶 3DGS 模型的支撑。利用单目深度估计模型 Depth Anything V3(DaV3)为训练帧推断密集深度图,并与 COLMAP SfM 重建稀疏深度进行基于仿射尺度与平移变换的自适应对齐: $\(\mathcal{L}_{\text{depth}} = \sum_{p \in \mathcal{P}} \|\omega D_{\text{DaV3}}(p) + \varepsilon - D_{\text{SfM}}(p)\|_1\)$ 其中 \(\omega, \varepsilon\) 为场景级优化系数,\(\mathcal{P}\) 为具有有效 SfM 稀疏点投影的像素集合。通过对估计深度施加 \([10, 30]\text{m}\) 距离窗滤波,有效排除了近处运动模糊和远景天空深度的发散干扰。对于动态物体,将基于无人机多视角的时空运动初筛掩码与 Segment Anything Model(SAM)语义提示相结合,生成高召回且轮廓紧凑的动态前景掩码,使 PVG 等动态高斯模型在无需激光雷达与 3D 边界框标注的情况下实现高质量动态解耦。
实验关键数据¶
主实验¶
在 MV2 提出的 Eval-Car-Train(以车载主视角 \(V^C\) 训练)和 Eval-Drone-Train(以航拍视角 \(V^D\) 训练)两大设置下评估了代表性前馈通用 3DGS 模型与逐场景优化模型。测试集按照基线跨度划分为同一轨迹插值 \(T^{C \to C}\) / \(T^{D \to D}\)、小基线车体测试 \(T^{C \to L}\)、大基线跨车道两轮车测试 \(T^{C \to S}\) / \(T^{D \to S}\) 以及跨高度地空视角 \(T^{D \to C}\)。
表 1: MV2 基准在各测试集上的新视角合成定量性能对比(对应原文 Table 1)
| 设置 | 模型 | PSNR \(\uparrow\) (\(T^{\to \text{Self}}\)) | PSNR \(\uparrow\) (\(T^{\to \text{Lateral}}\)) | PSNR \(\uparrow\) (\(T^{\to \text{Cross-Vehicle}}\)) | SSIM \(\uparrow\) (\(T^{\to \text{Cross}}\)) | LPIPS \(\downarrow\) (\(T^{\to \text{Cross}}\)) |
|---|---|---|---|---|---|---|
| Eval-Car-Train | DepthSplat (12v) | 18.05 | 17.13 | 14.39 | 0.25 | 0.40 |
| MonoSplat (12v) | 18.43 | 18.24 | 15.71 | 0.28 | 0.33 | |
| MVSplat (12v) | 16.33 | 14.08 | 12.88 | 0.35 | 0.54 | |
| NeRF (nerfacto) | 20.93 | 19.38 | 15.73 | 0.52 | 0.59 | |
| 3DGS (splatfacto) | 24.22 | 22.52 | 16.78 | 0.64 | 0.47 | |
| DesireGS | 25.96 | 24.31 | 19.48 | 0.55 | 0.34 | |
| PVG (SOTA) | 27.01 | 25.44 | 20.23 | 0.58 | 0.31 | |
| Eval-Drone-Train | DepthSplat (12v) | 16.78 | 9.09 (\(T^{D \to C}\)) | 7.87 (\(T^{D \to S}\)) | 0.14 | 0.56 |
| MonoSplat (12v) | 18.54 | 10.21 (\(T^{D \to C}\)) | 8.32 (\(T^{D \to S}\)) | 0.23 | 0.52 | |
| 3DGS | 29.13 | 10.36 (\(T^{D \to C}\)) | 11.42 (\(T^{D \to S}\)) | 0.43 | 0.46 | |
| NeRF | 21.30 | 11.01 (\(T^{D \to C}\)) | 11.54 (\(T^{D \to S}\)) | 0.35 | 0.61 | |
| droneSplat | 16.43 | 12.16 (\(T^{D \to C}\)) | 12.33 (\(T^{D \to S}\)) | 0.50 | 0.72 | |
| PVG (SOTA) | 28.12 | 12.65 (\(T^{D \to C}\)) | 13.82 (\(T^{D \to S}\)) | 0.46 | 0.52 |
消融实验¶
表 2: PVG 在深度监督来源与距离滤波策略下的消融实验对比(对应原文 Table 2)
| 数据集 | 视角设置 | 深度先验监督源 | PSNR \(\uparrow\) | SSIM \(\uparrow\) | LPIPS \(\downarrow\) |
|---|---|---|---|---|---|
| Waymo (WOD) | \(T^{C \to C}\) | 多视角 LiDAR 真值 | 28.45 | 0.912 | 0.145 |
| Waymo (WOD) | \(T^{C \to C}\) | 单视角 LiDAR 真值 | 28.66 | 0.792 | 0.121 |
| Waymo (WOD) | \(T^{C \to C}\) | DaV3 单目深度 + \([10, 30]\text{m}\) 滤波 | 29.12 | 0.815 | 0.108 |
| MV2 (本文) | \(T^{C \to C}\) | COLMAP 稀疏点云深度 | 24.72 | 0.655 | 0.238 |
| MV2 (本文) | \(T^{C \to C}\) | DaV3 单目深度 + IQR 滤波 | 25.88 | 0.680 | 0.210 |
| MV2 (本文) | \(T^{C \to C}\) | DaV3 单目深度 + \([10, 30]\text{m}\) 滤波 | 27.01 | 0.720 | 0.200 |
| MV2 (本文) | \(T^{C \to S}\) (跨车外推) | DaV3 单目深度 + IQR 滤波 | 19.43 | 0.550 | 0.330 |
| MV2 (本文) | \(T^{C \to S}\) (跨车外推) | DaV3 单目深度 + \([10, 30]\text{m}\) 滤波 | 20.23 | 0.580 | 0.310 |
表 3: 动态物体分割掩码对跨车辆外推 \(T^{C \to S}\) 的影响消融(对应原文 Table 3)
| 掩码监督设置 | 动态区域 PSNR \(\uparrow\) | 动态区域 SSIM \(\uparrow\) | 全图 PSNR \(\uparrow\) | 全图 SSIM \(\uparrow\) | 全图 LPIPS \(\downarrow\) |
|---|---|---|---|---|---|
| 无动态掩码 (None) | 13.98 | 0.32 | 14.72 | 0.34 | 0.63 |
| DS+SAM (伪标签) | 19.93 | 0.52 | 21.24 | 0.58 | 0.30 |
| GT (人工真值上限) | 21.70 | 0.62 | 24.29 | 0.72 | 0.18 |
关键发现¶
- 外推性能断崖式下跌:在 Eval-Car-Train 设置下,表现最佳的模型 PVG 在同轨迹插值 \(T^{C \to C}\) 达到 27.01 dB,在小侧向位移 \(T^{C \to L}\) 降至 25.44 dB,而在跨车道电瓶车视角 \(T^{C \to S}\) 剧烈下滑至 20.23 dB(降幅接近 7 dB);空对地测试下更是从 28.12 dB 骤降至 12.65 dB(\(T^{D \to C}\)),印证了当前主流算法极其依赖视角插值,泛化几何外推能力极其脆弱。
- 优化型全面优于前馈型 3DGS:即便输入 12 个参考视角,前馈模型 MonoSplat 和 DepthSplat 在 \(T^{C \to S}\) 下 PSNR 仅在 14~15 dB 徘徊,无法应对城市大尺度远近景混合场景;逐场景优化方法(PVG、DesireGS)大幅领先。
- 深度先验与动态解耦是纯视觉核心使能要素:DaV3 单目深度结合 \([10, 30]\text{m}\) 范围裁剪使 PVG 在没有 LiDAR 的情况下在 MV2 上达到 27.01 dB,极为接近 Waymo 激光雷达监督性能(28.66 dB);且 DS+SAM 伪掩码使全图外推 PSNR 从 14.72 dB 跃升至 21.24 dB,IoU 达到 63.69%,提供了高效的低成本动态分离路径。
- 前馈位姿估计模型在大视差下严重失效:在相机姿态评测中,传统优化型 SfM(COLMAP)平均极线误差稳健保持在 30 像素以内;而近期的前馈位姿估计网络(如 MASt3r-sfm、MapAnything、VGGT)在跨机位查询下出现大量极端误差(极线误差频现 > 50 像素),证明 MV2 同时是检测几何位姿泛化性的坚固标尺。
亮点与洞察¶
- 多智能体伴随式跨轨迹真实数据采集设计:采用四轮汽车、两轮电瓶车与无人机伴随行驶,成功在同一物理时钟下采集到包含真实交通动态与丰富相互遮挡的高保真跨视角图像,打破了传统驾驶数据集单轨同质采样的限制。
- 两阶段 SfM 局部配准与严格极线距离门限:将训练序列自主重建与测试帧受限局部重定位解耦,配合密集特征匹配与基础矩阵极线误差硬阈值过滤(\(e_m \le 30\)),在无外部高精动捕和 RTK-GPS 的严苛真实环境下构建了极高几何置信度的跨机位基准。
- 揭示了自动驾驶仿真跨车道模拟的盲点:实验以无可辩驳的量化证据证明,即使是单车换道这样基础的仿真外推,现有 SOTA 高斯渲染模型生成的视图也会严重失真,为自动驾驶神经仿真的评测提供了明确警示与指引。
局限与展望¶
- 天气与光照场景多样性有限:由于三车同步协同安全要求极高,数据主要集中在晴朗白天的干燥铺装路面,未涵盖夜间、逆光眩光、强降雨雪雾等恶劣天气条件。
- 极端几何遮挡下的空对地重建空白:当无人机以大俯角观察密集树冠、立交桥底层或高楼侧面时,从空中视角到地面视角的透视畸变极大,现有所有模型 PSNR 均跌破 14 dB,需要发展显式拓扑补全或基于大尺度先验的扩散补全机制。
- 前馈三维重建架构的尺度泛化瓶颈:前馈 3DGS 在驾驶规模上普遍失效,未来可探索将大模型几何基础先验(如 MapAnything / Spatial Intelligence Foundation Models)与自适应空间尺度高斯原语结合的全新架构。
相关工作与启发¶
- vs Waymo / nuScenes / KITTI (传统单车驾驶数据集):传统数据集仅从单个移动底盘(通常为安装在车顶的固定传感器支架)采集数据,测试集只能按时序跳帧抽取同一轨迹的画面,衡量的是轨迹内插;MV2 拥有真正物理独立的伴随行驶轨迹,支持跨车道和跨高度的外推评估。
- vs XLD / CARLA (合成仿真基准):XLD 利用 CARLA 引擎合成平行车道视点,但虚拟纹理、理想光照和人造物理运动与真实传感器噪声存在巨大域差距;MV2 全部由真实世界物理车辆与高清工业级运动相机实录而成。
- vs MTGS / Para-lane (多次重复遍历静态数据集):此类方法通过同一辆车在不同时间多次驶过同一路段来拼凑多车道视点,由于真实交通具有不可逆时序性,必须把动态车辆与行人全部掩蔽剔除,仅能评估静态场景;MV2 保持了多车时钟同步,能够原汁原味评估动态物体的跨视角几何与外观合成质量。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次提出真实世界多车辆协同伴随采集的大基线跨视角自动驾驶 NVS 数据集与基准,视角跨度与评测协议具有开创性。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 8 种前沿静态/动态/前馈 NVS 模型以及前馈位姿估计算法,在多级基线、深度滤波及动态掩码上进行了详尽深入的消融。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑结构严密,问题定义明确,图表数据支撑扎实,位姿验证数学与几何表述清晰。
- 价值: ⭐⭐⭐⭐⭐ 为自动驾驶神经渲染、闭环模拟器保真度检验与跨视角大基线视觉位姿估计提供了极为关键的高质量真实评测基准。