跳转至

VIPS: Vehicle-Infrastructure Cooperative Planning Benchmark via Pseudo-Simulation

会议: ECCV 2026
论文: ECCV 原文
代码: https://vips2026.github.io
领域: 自动驾驶
关键词: 车路协同、端到端自动驾驶、伪仿真基准、稀疏协同表征、运动规划

一句话总结

提出首个面向车路协同(V2I)端到端规划的伪仿真基准 VIPS,结合真实与合成扰动观测对规划策略进行保真鲁棒性评测,并设计了高效紧凑的稀疏协同规划框架 CoS-V2X。

研究背景与动机

端到端自动驾驶直接从传感器输入映射到底层规划轨迹,在复杂城市交通环境中展现出强大潜力。然而,单车系统受限于自车视角的视场与严重物理遮挡,尤其在十字路口、无保护左转等密集交互场景中极易出现盲区。车路协同(V2I)利用路侧高位固定传感器的全局视野,能显著补足盲区感知。但现有端到端规划评估陷入两难权衡:开环评测仅对比预录制数据中的人类专家轨迹,无法反映多步规划中的复合误差累积与偏差恢复能力;闭环评测虽支持交互评估,却极度依赖昂贵的仿真引擎,且伴随难以消除的合成域差异。

近期单车伪仿真(Pseudo-Simulation)方案通过在真实数据端点施加扰动合成多样化未来视点,提供了低成本且高保真的评估范式。但将其推广至车路协同场景面临本质障碍:规划决策高度依赖车端与路侧的多智能体异步协同与视点融合,既要保证路侧视角与扰动后车端新视角的严格物理几何一致性,又要对信息交互时的丢包、遮挡与有效性进行联合评估。

针对这一瓶颈,本文切入的角度是:在真实 V2I 多视角数据的基础上,构建严格对齐的车路双重视角扰动合成流水线,并将评测拆分为标称性能与扰动恢复双阶段。本文的核心 idea 是:将伪仿真范式拓展至车路协同领域,通过 3D 高斯泼溅与路侧掩膜修复生成时空一致的车路双侧扰动观测,结合扩展预测驾驶模型评分建立两阶段 V2I 规划基准 VIPS,并同步提出基于稀疏实例交互的高效规划框架 CoS-V2X。

方法详解

整体框架

VIPS 评测流水线包含 Stage 1 标称工况评测与 Stage 2 扰动合成评测两大阶段。Stage 1 在真实车路同步观测下,利用运动学模型推演规划轨迹并计算标称分数;Stage 2 在专家轨迹终点邻域内采样候选扰动位姿,分别采用 3D 高斯泼溅扩散精炼(车端视角)与实例掩模检索修复(路侧视角)合成视点严格对齐的双侧观测,并用高斯权重聚合恢复得分。配套的 CoS-V2X 规划模型则在感知阶段通过对称实例锚点与双向交叉注意力实现高效特征融合,以极低的通信与显存开销直接赋能下游运动预测与并行规划。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["真实车端与路侧同步输入"] --> B["Stage 1: 标称评测<br/>真实观测输入并推演规划轨迹"]
    B --> C["Stage 2: 扰动状态采样<br/>Hermite 样条生成历史轨迹与候选位姿"]
    C --> D["双路视点一致性合成<br/>车端 3DGS + 路侧掩模修复"]
    D --> E["双阶段综合评测评分<br/>EPDMS 惩罚乘积与高斯加权聚合"]
    subgraph CoS_V2X["CoS-V2X 稀疏协同规划框架"]
        direction TB
        F["稀疏锚点与实例库更新"] --> G["Top-K 实例双向交叉注意力融合"]
        G --> H["端到端运动预测与并行轨迹规划"]
    end
    D -.-> CoS_V2X
    CoS_V2X -.-> E

关键设计

1. 两阶段车路协同伪仿真评测协议:兼顾标称效率与扰动恢复

传统开环评估无法检测自车因小误差偏离后能否重回正轨。VIPS 引入两阶段评测:Stage 1 在真实观测下执行非反应式 BEV 运动学推演,评估自车在无扰动工况下的标称驾驶能力 \(s_1\);Stage 2 则在专家演示终点施加横向(\(\pm 2.0\,\text{m}\),步长 \(1.0\,\text{m}\))与纵向(沿行驶方向按加速度物理可行域每 \(5.0\,\text{m}\) 采样最多 7 个点)扰动,利用 Hermite 样条构造自车历史轨迹,通过拒绝采样剔除碰撞等物理不可行状态后得到 7,168 个测试样本。Stage 2 评测多样本得分并通过高斯距离核进行加权聚合: $\(s_2 = \sum_{i=1}^N \hat{w}_i s_i, \quad \hat{w}_i = \frac{w_i}{\sum_{j=1}^N w_j}, \quad w_i = \exp\left(-\frac{\|x_i - \hat{x}\|^2}{2\sigma^2}\right)\)$ 其中 \(x_i\) 为扰动起点,\(\hat{x}\) 为 Stage 1 预测终点。最终评测指标为双阶段乘积 \(s_{\text{final}} = s_1 s_2\),要求策略兼具标称完成度与偏移鲁棒性。

2. 几何一致的车路双侧新视点合成:3DGS 扩散精炼与固定路侧背景修复

车路协同伪仿真的核心瓶颈在于车端视角与路侧视角必须共享同一个虚拟位移后的自车。针对动态车端多相机环视,VIPS 采用面向自动驾驶场景的 3D Gaussian Splatting(3DGS)渲染新视点,并级联 Diffix3D+ 扩散模型消除神经渲染模糊伪影;针对路侧固定相机,远距离小目标若用 3DGS 会严重模糊,VIPS 创新提出基于 SAM3 提示引导的自车图块提取与视角检索变换策略。将变换后的自车图块投影贴至新坐标,并在原自车位置通过检索同场景无车图块进行填补。该异构渲染策略保证了车路两端对自车新位姿的观测严格自洽。

3. 统一多目标规划评分 EPDMS:硬性安全惩罚与连续舒适度加权

为精确刻画规划质量,VIPS 构建了扩展预测驾驶模型评分(EPDMS)。将驾驶准则拆解为安全关键型违背项(无责任碰撞 NC、可行驶区域依从性 DAC、行驶方向依从性 DDC)构成的惩罚集合 \(\mathcal{M}_{\text{pen}}\),以及表现型指标(自车进度 EP、碰撞前时间 TTC、车道保持 LK、历史舒适度 HC)构成的集合 \(\mathcal{M}_{\text{avg}}\)。公式采用惩罚乘积乘以加权平均: $\(\text{EPDMS} = \left(\prod_{n \in \mathcal{M}_{\text{pen}}} \text{score}_n\right) \cdot \left(\frac{\sum_{m \in \mathcal{M}_{\text{avg}}} w_m \cdot \text{score}_m}{\sum_{m \in \mathcal{M}_{\text{avg}}} w_m}\right)\)$ 任何安全硬违规(如碰撞)将导致单项评分为零并直接将总分清零,彻底避免以牺牲安全为代价刷取进度的投机策略。

4. CoS-V2X 稀疏协同规划网络:低通信带宽下的实例级双向交互

传统 V2X 规划多采用 BEV 特征稠密拼接,导致巨大通信带宽与显存开销。CoS-V2X 采用对称锚点架构,通过时序实例库维护 \(N\) 个共享可学习锚点。路侧感知头仅筛选分类置信度最高的 Top-\(K\) 实例索引集 \(\mathcal{K}\),将其特征与边界框参数发送至车端。车端在对齐锚点处进行双向交叉注意力与置信度动态加权融合: $\(w_i^s = \frac{z_i^s}{z_i^{\text{veh}} + z_i^{\text{infra}} + \epsilon}, \quad \mathbf{B}_i^{\text{fuse}} = w_i^{\text{veh}}\mathbf{B}_i^{\text{veh}} + w_i^{\text{infra}}\mathbf{B}_i^{\text{infra}}\)$ 融合后的稀疏实例表征无需任何中间重构,直接驱动后续并行运动预测与多候选轨迹规划评分,使单步传输带宽骤降至 \(2.5 \times 10^6\,\text{BPS}\)

损失函数 / 训练策略

CoS-V2X 采用两阶段解耦训练范式。感知模块联合优化 3D 目标检测的分类 Focal Loss、3D 边界框回归 Smooth L1 Loss 以及在线局部地图分段损失;运动预测与规划模块沿用 SparseDrive 的端到端设计,计算多模态轨迹候选分类得分以及最优轨迹项的 Imitation L1 Loss。整体在 4 张 NVIDIA A100 GPU 上端到端微调收敛。

实验关键数据

主实验

在 VIPS 评测基准上对比单车 SOTA 规划模型(UniAD, SparseDrive, MomAD 等)与先进 V2X 协同规划模型。评测视野固定为 5 秒时域窗口,综合考量 Stage 1(S1)、Stage 2(S2)及复合评分 \(S1+S2\)

方法 V2I 协同 S1 EPDMS ↑ S2 EPDMS ↑ 综合 EPDMS (S1+S2) ↑ 关键指标亮点 (S2)
Constant Velocity 62.39 68.62 5.88 LK 仅 20.13,偏离严重
AD-MLP [154] 52.73 41.90 32.31 S2 DAC 仅 63.86
UniAD [36] 75.26 69.11 37.28 S2 LK 降至 25.61
SparseDrive [108] 74.47 55.74 43.26 S2 DDC 降至 68.87
HiP-AD [111] 75.54 68.76 42.03 S2 NC 94.85,TTC 94.33
MomAD [104] 69.95 67.48 45.38 S2 LK 30.68
Uni-V2X [146] 75.70 72.35 43.79 S2 NC 99.10,TTC 97.22
CoS-V2X (Ours) 78.69 73.21 50.88 S2 NC 99.96,DAC 99.98,TTC 99.95

注:依据原论文 Table 2。人类专家演示仅提供 Stage 1 标杆得分 91.55。CoS-V2X 在综合得分上超越此前最佳协同模型 Uni-V2X 达 +7.09 分。

消融实验

评估协同感知增益、渲染质量以及算法运行系统效率(分别对应原文 Table 3, Table 4, Table 6)。

评测维度 / 配置 关键指标 结果数值 说明
协同感知增益 (Table 3) 3DOD NDS / mAP ↑
在线建图 mAP ↑
无 V2I: 17.78 / 14.63
无 V2I: 30.46
开启 V2I: 31.30 / 28.13 (+13.50 mAP)
开启 V2I: 34.24 (+3.78 mAP)
系统开销对比 (Table 4) 训练/测试显存 ↓
推理帧率 FPS ↑
传输带宽 BPS ↓
Uni-V2X: 29.38 / 6.95 GB
Uni-V2X: 0.2 FPS
Uni-V2X: \(3.5 \times 10^6\) BPS
CoS-V2X: 8.86 / 4.81 GB (-69.8% 训练显存)
CoS-V2X: 6.4 FPS (速度提升 32 倍)
CoS-V2X: \(2.5 \times 10^6\) BPS (-28.6% 带宽)
合成图像感知质量 (Table 6) 车端 LPIPS ↓
路侧 LPIPS ↓
纯 3DGS: 0.414
纯 3DGS: 0.324
Ours (3DGS+Diffix3D+): 0.371
Ours (SAM3 图块检索修复): 0.076

关键发现

  • 扰动鲁棒性断崖:单车模型在 Stage 2 扰动下性能急剧恶化,如 SparseDrive 从 74.47 暴跌至 55.74;而引入路侧视角的 CoS-V2X 依然保持 73.21,在碰撞避免(NC 99.96)与行驶区域合规(DAC 99.98)上展现出极高的恢复鲁棒性。
  • 评测指标与人类高度一致:在 7 位 10 年以上驾龄司机的专家主观盲测中(Table 5),EPDMS 的 Kendall \(\tau\)-b 相关系数达 0.84,成对排序准确率达 0.94,远超常速基线的 0.23 与 0.62。
  • 真实分布漂移可忽略:使用仅在真实数据上训练的 CoS-V2X 评估合成 S1 数据(Table 7),检测 mAP 仅从 28.13 降至 26.70,规划 EPDMS 仅从 78.69 降至 77.60,充分证明了合成观测的高保真度。

亮点与洞察

  • 填补协同规划低成本保真评测空白:首次将伪仿真扩展到多智能体 V2I 领域,用静态数据重渲染替代全动态仿真,使端到端协同评测摆脱了仿真器 Sim-to-Real 的巨大鸿沟。
  • 路侧小目标视点合成的巧妙解法:没有盲目对全场景套用 3DGS,而是针对固定视角路侧相机利用 SAM3 实例抠图与同场景无车背景补全,以 LPIPS 0.076 的极高画质完成了车辆位置替换。
  • 稀疏实例协同的高效可迁移性:CoS-V2X 证明了无需传输庞大的稠密 BEV 网格,仅靠 Top-\(K\) 稀疏锚点与双向交叉注意力即可实现超越稠密通信的 SOTA 协同规划,为车联网规模化部署提供了关键范例。

局限与展望

  • 周围智能体缺乏交互反应:当前 BEV 运动学模拟中,周围车辆仍沿原录制轨迹运动(非反应式),无法模拟主车扰动避让后他车的连锁交互反应。
  • 依赖预制高精矢量地图:评测目前基于离线人工精细标注的 V2X-Real 矢量地图,对于无地图先验的未知开放道路泛化评测仍有待扩展。
  • 通信时延与丢包建模相对理想:实验主要评测了不同带宽下的稀疏表征,对实际物理通信中严重的信道衰落、非均匀丢包和异步时间对齐扰动探索有限。

相关工作与启发

  • vs NAVSIM v2 [5]: NAVSIM 开启了单车伪仿真评测,VIPS 将其拓展至车路协同系统,攻克了异构多传感器视角几何对齐与路侧渲染畸变的难题。
  • vs Uni-V2X [146]: Uni-V2X 基于 BEV 稠密网格进行特征交互,计算量与通信开销巨大(0.2 FPS, 29.38 GB 显存);CoS-V2X 采用稀疏锚点交互,推理速度提升至 6.4 FPS,显存削减近 70%,规划得分反超 7 分。
  • vs DAIR-V2X / V2X-Seq [143, 145]: 传统 V2X 基准主要关注感知检测与开环位移误差(L2 ADE/FDE),VIPS 建立了首个面向闭环级行为表现的安全-规则-舒适度综合评测基准。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次打通车路双视角协同伪仿真评测闭环,提出创新的异构视点渲染与稀疏协同框架。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖双阶段规划评测、感知消融、系统效率、图像质量感知评测及专家盲测对齐。
  • 写作质量: ⭐⭐⭐⭐⭐ 问题定义直击痛点,架构图与评测协议描述详实,逻辑层层递进。
  • 价值: ⭐⭐⭐⭐⭐ 为端到端车路协同决策提供了低成本、高保真的标准化 Benchmark,具备显著工业落地参考意义。