跳转至

PersonaDrive: Controllable Trajectory Prediction with Multi-Dimensional Driving Personas

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/VisualAIKHU/PersonaDrive
领域: 自动驾驶
关键词: 轨迹预测, 驾驶风格, 自然语言控制, 多模态融合, 闭环规划

一句话总结

针对现有轨迹预测模型缺乏可控性且单一紧迫度维度无法刻画复合驾驶风格的问题,PersonaDrive 提出将驾驶风格解耦为时间紧迫度(Temporal Urgency)与乘坐舒适度(Ride Comfort)的 3×3 九宫格空间,构建了 PCT 数据集,并通过锚框变换网络 PCAT、多模态门控融合 PCMF 以及分层导引与多样性损失实现了自然语言驱动的个性化轨迹生成。

研究背景与动机

端到端自动驾驶与轨迹预测系统在城市道路感知与规划上取得了长足进步,但现存方案大多在均质化的日常驾驶数据上进行拟合,预测行为严重趋向单一且保守的“平均司机”模式。真实世界中的人类驾驶行为高度依赖即时情景与乘客意图——行程是否紧急、后排是否载有易碎物品或病患、乘客身体状态以及情绪波动,都会使驾驶员呈现出完全不同的激进程度与动力学特征。缺乏可控人格输入的规划系统,无法满足不同用户在多样化现实场景下的个性化乘车诉求。

以往尝试引入人格控制的研究往往将驾驶风格简化为粗粒度的单一维度谱系(如紧急、正常、悠闲)。这种一维建模存在致命的表达瓶颈:在相同的高紧迫度下,急救车运送重伤患者需要平稳避障以防二次伤害,而消防车赶赴火场则允许剧烈颠簸与极限转向;在一维谱系中二者均被粗暴地折叠为“紧急”,抹杀了动力学层面的本质差异,也使自然语言指令的精细调节优势荡然无存。

本文的切入角度是将驾驶风格正交解耦为控制纵向行进距离的“时间紧迫度”与控制横向平滑度的“乘坐舒适度”,在各划分为高/中/低三档后构建覆盖 9 种典型人格的 PCT 评测集。核心 idea:通过自然语言直接解构时间紧迫度与乘坐舒适度双轴控制标量,层次化缩放与修整轨迹锚框原型并注入 BEV 门控融合,在保持基础安全物理约束的同时实现细粒度、解耦的个性化多模态轨迹规划。

方法详解

整体框架

PersonaDrive 的总体架构输入包含多路环视相机图像 \(I_{\text{cam}}\)、LiDAR 点云 \(I_{\text{lidar}}\) 以及表征乘客意图的自然语言描述 \(T\)。视觉感知模块提取鸟瞰图(BEV)特征查询 \(Q_{\text{bev}}\),冻结的轻量文本编码器提取文本查询 \(Q_{\text{txt}}\)。系统核心包含两阶段调制机制:首先通过人格条件锚框变换(PCAT)将文本查询解耦为紧迫度标量与舒适度向量,层次化调制初始轨迹先验锚框集;随后通过人格条件多模态融合(PCMF)将调制后的锚框、自车状态与场景 BEV 深度对齐,最终由扩散轨迹预测头输出未来 4 秒内的 8 步规划轨迹。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["传感器输入<br/>环视相机 + LiDAR 点云"] --> B["BEV 感知编码器<br/>生成场景特征 Qbev"]
    C["乘客文本指令 T<br/>如:急送病患/运送易碎物"] --> D["文本编码器 (MiniLM)<br/>提取人格表征 Qtxt"]
    D --> E["PCAT 锚框变换<br/>双轴解耦: 紧迫度标量 αu + 舒适度向量 αc"]
    E --> F["调制先验锚框 P̃<br/>全局纵向缩放 + 逐时间步平滑修整"]
    B --> G["PCMF 多模态融合<br/>原型池压缩 + 条件重采样 + 场景自适应门控"]
    D --> G
    F --> G
    G --> H["轨迹预测头 (DiffusionDrive)<br/>生成 8 步个性化未来轨迹"]
    H --> I["目标函数协同约束<br/>Lguide 物理定序 + LAD 防对角塌缩多样性"]

关键设计

1. PCAT 锚框变换:双轴解耦与层次化动力学先验注入 传统基于锚框的轨迹预测模型使用场景统计得到的固定几何原型,直接将其与文本嵌入拼接难以实现对轨迹物理尺度的强控。PCAT 将文本查询 \(Q_{\text{txt}}\) 拆分为两个专职投影分支:紧迫度分支通过双层 MLP 输出标量 \(\alpha_u \in \mathbb{R}\),主导轨迹的全局纵向行进距离;舒适度分支通过另一组 MLP 输出时序调制向量 \(\alpha_c \in \mathbb{R}^T\),通过 Sigmoid 仿射变换严格限制在 \([0.8, 1.2]\)(设定偏置 \(\gamma_c=0.8\),缩放幅值 \(\Delta_c=0.4\)),调节各航路点的局部曲率与加加速度。对基准锚框 \(p_i\),变换依次进行全局尺度伸缩与局部逐时间步调制: $\(\tilde{p}_i^{(u)} = p_i \times \alpha_u, \quad \tilde{p}_i(t) = \tilde{p}_i^{(u)}(t) \times \alpha_c(t)\)$ 对于中等紧迫度与中等舒适度的基准中性人格,系统保持 \(\alpha_u=1, \alpha_c=1\) 恒等映射,确保零偏置时无缝退化为基础模型性能。

2. PCMF 多模态融合:原型池压缩与场景自适应门控交互 将全局语义文本直接跨模态注入高维稀疏的 BEV 网格往往造成空间感知失真或指令稀释。PCMF 采用三步渐进式交互机制:首先,查询原型池利用 8 个可学习种子查询通过交叉注意力将全场景 \(Q_{\text{bev}}\) 压缩为紧凑的环境条件上下文 \(C = \text{Attn}(Q_{\text{seed}}, Q_{\text{bev}})\);随后,条件重采样器将调制上下文 \(\tilde{C}\) 叠加至插槽种子 \(Q'_{\text{slot}} = Q_{\text{seed}} + \tilde{C}\),分别对智能体先验、自车状态与文本特征进行重采样对齐,得到各模态表示 \(R_j\);最后,基于场景复杂度通过 MLP 预测归一化门控权重 \(g = \text{softmax}(\text{MLP}(Q_{\text{bev}})) = [g_{\text{agent}}, g_{\text{ego}}, g_{\text{text}}]\),对各分支动态加权后经由交叉注意力更新 BEV 特征,使规划决策在复杂障碍交互与用户偏好之间自适应取得平衡。

3. 分层物理导引与防对角塌缩多样性损失 端到端训练极易发生模式塌缩,即不同人格输出趋同,或仅在对角极端人格上有区别。PersonaDrive 针对 3×3 九宫格提出了双重监督约束: - 分层导引损失(\(\mathcal{L}_{\text{guide}}\):在紧迫度维度上,提取轨迹总长度 \(l_m\),要求同列舒适度下紧迫度更高的轨迹行进更远;在舒适度维度上,通过三阶有限差分计算平均加加速度 \(j_m\)(jerk),要求同行紧迫度下舒适度更低(允许更激进)的轨迹具有更大的 jerk。12 组相邻网格的物理裕度单向惩罚彻底杜绝了紧迫度与舒适度的逻辑颠倒: $\(\mathcal{L}_{\text{urg}} = \frac{1}{|\mathcal{C}_u|} \sum_{(m_l, m_h) \in \mathcal{C}_u} \text{ReLU}\Big(\big[l^{\text{gt}}_{m_h} - l^{\text{gt}}_{m_l}\big] - \big[l^{\text{pred}}_{m_h} - l^{\text{pred}}_{m_l}\big]\Big)\)$ - 轴解耦多样性损失(\(\mathcal{L}_{\text{AD}}\):若对全量 9 个人格做扁平的成对多样性约束,模型极易产生“对角模式塌缩”(例如快速激进与慢速平稳两极分化,而快速平缓与慢速激进两类交叉样本失效)。\(\mathcal{L}_{\text{AD}}\) 显式拆解为轴内损失 \(\mathcal{L}_{\text{Intra}}\) 与轴间损失 \(\mathcal{L}_{\text{Inter}}\),通过在各单轴分组内对距离矩阵经 Softmax 转换后的概率分布施加对称 KL 散度与下界裕度惩罚,强制不同人格在对应轴上拉开行为分布差异。

损失函数 / 训练策略

总体训练目标由轨迹扩散基础损失、分层导引损失与轴解耦多样性损失组合构成: $\(\mathcal{L}_{\text{Total}} = \lambda_1 \mathcal{L}_{\text{traj}} + \lambda_2 \mathcal{L}_{\text{guide}} + \lambda_3 \mathcal{L}_{\text{AD}}\)$ 实验中超参数固定为 \(\lambda_1 = 10, \lambda_2 = 1, \lambda_3 = 1\),多样性损失平衡权重 \(w_{\text{Inter}} = 0.2\)。模型基于 ResNet-34 骨干网络在 NAVSIM 训练集(navtrain)上使用 6 张 NVIDIA RTX A6000 GPU 训练 100 个 epoch,优化器选用 AdamW,初始学习率为 \(6 \times 10^{-4}\),全局 batch size 为 128。

实验关键数据

主实验

在 NAVSIM closed-loop 评测基准(基于 OpenScene)的 navtest 测试集上,评测覆盖全部 9 种人格的平均位移误差(Avg. ADE)、最终位移误差(Avg. FDE)以及基准规划综合得分(Avg. PDMS)。

Table 2: NAVSIM navtest 闭环评测基准主要对比结果(全 9 个人格平均值)

方法 会议/期刊 Avg. ADE (m) ↓ Avg. FDE (m) ↓ Avg. PDMS ↑
LTF TPAMI 2022 2.49 3.87 52.0
Transfuser TPAMI 2022 2.53 3.96 51.9
UniAD CVPR 2023 2.47 3.83 52.5
Hydra-MDP arXiv 2024 6.70 11.85 41.4
PARA-Drive CVPR 2024 4.84 9.00 51.9
Traj-LLM T-IV 2024 2.66 4.20 54.1
VisionTRAP ECCV 2024 5.17 9.95 50.7
WoTE ICCV 2025 3.35 5.71 52.4
DiffusionDrive (Base) CVPR 2025 3.93 5.79 55.3
VADv2 ICLR 2026 6.18 10.76 47.9
PersonaDrive (Ours) ECCV 2026 2.39 3.71 57.7

相比次优方法 UniAD,PersonaDrive 将 Avg. ADE 降低了 3.2%(从 2.47m 降至 2.39m),Avg. FDE 降低了 3.1%(从 3.83m 降至 3.71m),同时 Avg. PDMS 提升至 57.7。

消融实验

消融实验系统验证了各个核心模块与损失函数对最终规划表现的贡献度。

Table 4: NAVSIM navtest 核心组件消融实验(均包含文本编码器)

配置 PCAT PCMF \(\mathcal{L}_{\text{AD}}\) Avg. ADE (m) ↓ Avg. FDE (m) ↓ Avg. PDMS ↑ 说明
Base (Text-only) - - - 3.93 5.79 55.3 基础扩散模型简单拼接文本特征
+ PCAT - - 3.52 5.43 56.0 仅引入两阶段锚框层次调制
+ PCAT + PCMF - 3.23 4.85 56.9 加入多模态门控融合增强特征表达
+ PCMF + \(\mathcal{L}_{\text{AD}}\) - 2.55 3.87 57.2 缺少锚框物理先验,全靠注意力与多样性损失拉伸
+ PCAT + \(\mathcal{L}_{\text{AD}}\) - 2.61 3.97 57.5 缺少 PCMF 门控融合细化
Full Model 2.39 3.71 57.7 完整模型各模块协同达到最优性能

Table 3: 一维与多维人格控制表现对比(ADE / FDE, 单位: m)

设定 UH-CL UH-CH UM-CM UL-CL UL-CH 全 9 格 Avg. ADE 全 9 格 Avg. FDE
1D-Urgency (仅紧迫度) 3.30 / 5.81 3.07 / 5.42 2.35 / 3.52 2.73 / 4.06 2.56 / 4.21 2.67 4.27
1D-Comfort (仅舒适度) 4.79 / 11.76 4.66 / 10.32 2.35 / 3.52 5.70 / 9.84 7.11 / 12.87 4.50 8.64
Multi-D (本文多维) 2.98 / 5.25 2.69 / 4.47 2.35 / 3.52 2.02 / 2.82 1.82 / 2.33 2.39 3.71

关键发现

  • 对角冲突网格(Against-the-grain)收益最显著:在“高紧迫度+高舒适度”(UH-CH,如护送重症病患)和“低紧迫度+低舒适度”(UL-CL,如寻找掉落物品靠边蹭行)等双轴强冲突场景中,一维控制基线产生严重性能衰退(UH-CH 在 1D-Comfort 下 FDE 飙升至 10.32m),而多维解耦机制有效兼顾了快速与平顺,FDE 降至 4.47m。
  • 轻量句子级文本编码器优于大容量 Token 级模型:文本编码器对比中,参数量仅 33M 的 MiniLM(ADE 2.39m / FDE 3.71m)大幅领先 140M 的 DeBERTa(ADE 5.99m / FDE 11.56m)与 RoBERTa(ADE 4.72m / FDE 8.76m)。MiniLM 针对句子相似度进行微调,天然将同行同列指令映射到相邻流形,完美契合 PCAT 的解耦映射;而 token 级掩码自编码器产生的表征对轴解耦注入了严重噪声。
  • 极小推理开销:模型参数量仅从 Baseline 的 61.4M 微增至 63.2M(+2.75%),推理耗时从 0.022s/帧(45 FPS)变为 0.023s/帧(43 FPS),在保持实时性的前提下赋予了端到端车辆丰富的人格控制能力。

亮点与洞察

  • 解耦双轴九宫格建模范式:将看似主观抽象的人格解构为时间紧迫度(纵向尺度)与乘坐舒适度(横向与加加速度平滑度)两大正交物理量,兼具概念清晰性与数学可操作性。
  • 几何锚框显式缩放与隐空间门控协同:没有盲目依赖大模型端到端硬学生成,而是通过 PCAT 在初始几何先验上施加有物理上界的参数缩放,将可解释性与扩散模型的精细拟合能力有机结合。
  • 可复用的成对分布对齐多样性损失\(\mathcal{L}_{\text{AD}}\) 采用分组对称 KL 散度约束距离矩阵分布,成功解决了连续空间多模态输出时高维条件极易塌缩到主模态的问题,该设计完全可迁移到人机协作机器人轨迹生成或具身智能意图控制中。

局限与展望

  • 依赖模拟生成的数据集监督:PCT 数据集的 9 种轨迹由 GPT-4o-mini 生成并配合多轮规则过滤与 GPT-4o 打分,虽有人工评测(85.7% 辨识准确率)印证,但本质仍属于合成先验,缺乏大规模真实极端驾驶行为记录的真实验证。
  • 静态指令假设:当前模型假设整段行程乘客的人格设定固定,无法动态应对行驶途中突发的意图转变(如突发急病需瞬间切换为极度紧迫模式)。
  • 未来方向:探索时序动态意图流的在线无缝切换控制,并将该双轴人格框架推广至包含博弈博弈的多车交互仿真环境。

相关工作与启发

  • vs DiffusionDrive / UniAD: 传统 SOTA 端到端模型均以单一均值安全为目标,面对不同乘客输出千篇一律的轨迹;PersonaDrive 在保留其强感知与闭环安全性能的同时,补齐了自然语言条件下的动力学风格控制拼图。
  • vs LangTraj / Traj-LLM: 以往语言控制轨迹工作多停留在粗粒度的高层动作控制(如“左转”、“变道”)或单调的一维紧急程度标签;PersonaDrive 实现了连续物理量(速度、加加速度、转角速率)维度的正交多轴连续调控。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次提出正交双轴 3×3 九宫格驾驶风格解耦范式,立意明确且极具现实意义。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 NAVSIM 闭环对比、消融、1D 对比、编码器对比及人工评测,论据扎实。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑结构严谨,数学公式与图表清晰,动机与实验完全闭环。
  • 价值: ⭐⭐⭐⭐⭐ 为个性化智能座舱与网约车自动驾驶的定制化乘坐体验提供了落地的可行范例。