跳转至

TEX-Drive: Temporal Perception Meets Experience-Guided Mixture-of-Experts for End-to-End Autonomous Driving

会议: ECCV 2026
论文: ECCV 官方页面
领域: 自动驾驶
关键词: 端到端自动驾驶, 混合专家模型, 时序感知, 关键帧选择, 经验引导规划

一句话总结

针对端到端自动驾驶中时序感知与专家专业化割裂、导致长时程与动态场景决策不一致的难题,TEX-Drive 提出显式关键帧引导的时序感知单元与基于长期记忆经验路由的混合专家规划架构,在 Bench2Drive 闭环基准上取得 68.22 Driving Score 与 40.62% 成功率。

研究背景与动机

人类驾驶行为本质上是由工作记忆、模块化专门机制与中央执行系统协同驱动的认知过程。人类在动态道路场景中行驶时,并非机械地平权回顾所有历史画面,而是将先前的关键驾驶经验与当前实时观测动态结合,快速判断超车或跟车意图,并调度对应的驾驶操作模式。然而,现有的端到端自动驾驶(E2E-AD)模型大多将时序感知与功能专门化两个核心认知机制割裂建模。一方面,时序模型通常采用多帧均匀堆叠、平均汇聚或全量注意力,不仅带来高昂计算负担,且无法明确衡量历史帧的重要性,导致在刹车、变道等关键转折时刻响应迟滞;另一方面,将混合专家(MoE)引入规划层的方法往往依赖浅层门控网络和瞬时特征进行路由,专家分配缺乏可解释性与时序连贯性,在长时程或复杂交互场景中极易出现频繁跳变与注意力碎片化。

这种割裂建模的核心矛盾在于:动作规划既依赖连贯且抓得住转折点的时序动态表征,又需要专家系统具备跨时间的语义持久性,但传统门控网络缺少显式时序线索的约束,而时序编码器又缺乏下游任务经验对关键时序特征的定向指引。导致专家路由像一个黑盒,难以在多变场景中建立结构化、可追溯的专业化分工。

本文的切入角度是打破时序建模与专家路由之间的单向流水线壁垒,让显式的时序依赖筛选直接赋能长周期经验匹配。核心 idea:构建统一的时序–经验协同框架,以可解释的关键帧评分自适应提取高价值历史动态,并结合 FiLM 目标调制的长期经验记忆向量驱动 MoE 专家路由与自回归轨迹生成,实现感知与规划的闭环增强。

方法详解

整体框架

TEX-Drive 包含三大核心组成部分:多视影视觉与自车状态感知编码器、关键帧引导的时序感知单元(KTP)以及经验驱动的 MoE 规划单元(E-MoE)。系统首先提取当前多视角的空间特征与车速、转向角等测量嵌入,通过交叉注意力融合成当前联合特征,并写入先进先出(FIFO)的历史特征缓冲区。随后,KTP 模块评估候选历史帧的跨时序相关性与时间偏置,确定性地筛选出高价值关键帧并融合为增强的时序表征。进入规划阶段后,E-MoE 利用导航目标经 FiLM 调制该时序表征,并与各专家的长期经验记忆进行相似度匹配完成稀疏路由,最终由被激活的专家执行自回归解码生成未来安全轨迹。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["多视角图像 + 自车状态输入"] --> B["多模态感知编码<br/>交叉注意力融合当前特征 Ft"]
    B --> C["历史特征缓冲区<br/>FIFO 维护近 K1 帧序列 Ht"]
    C --> D["显式关键帧时序感知<br/>相关性与时间衰减评分选 Top-K2 帧"]
    D --> E["目标条件特征调制<br/>FiLM 将导航目标注入时序表征"]
    E --> F["经验引导专家路由<br/>与专家记忆 Mi 计算相似度激活 Top-K3 专家"]
    F --> G["多专家自回归轨迹解码<br/>置信度加权聚合与轨迹头输出"]

关键设计

1. 显式关键帧时序感知(KTP):跨时序相关性与时间偏置联合过滤 针对传统方法等权堆叠历史帧引入冗余噪声以及注意力隐式加权不可解释的缺陷,KTP 设计了结构化依赖过滤机制。系统维护长度为 \(K_1\) 的 FIFO 历史特征队列 \(H_t=\{F_{t-K_1+1}, \dots, F_{t-1}\}\)。对每个候选帧 \(F_i\),首先计算当前帧与历史帧之间的跨时序匹配 Logits: $\(L_{t,i} = \frac{(W_q F_t)(W_k F_i)^\top}{\sqrt{d}}\)$ 与常规自注意力不同,Softmax 在所有历史候选帧维度上归一化,得到反映相对时序关联系数的权重图,并在空间 token 对上平均得到标量路由分数 \(s_{ir}\)。为兼顾近期上下文重要性,KTP 引入指数时间偏置项 \(\text{TemporalBias}(i) = \exp(-(K_1 - i))\),将质量、相关性与时域距离融合成统一关联分: $\(s_i = s_{iq} + s_{ir} + \lambda \cdot \text{TemporalBias}(i)\)$ 模型根据综合得分确定性筛选 Top-\(K_2\) 个关键帧,并通过指数衰减权重 \(w_i = \exp(-\lambda(1 - \text{TemporalBias}(i)))\) 送入分层融合网络 \(f_{\text{fusion}}\) 生成时序融合特征 \(\hat{F}_t\)。该机制将时序推理转化为可追溯的显式决策点识别。

2. 目标导向 FiLM 调制:动态对齐场景表征与驾驶意图 在执行专家分配前,单纯的环境表征无法完全决定当前的行动模式——相同的道路拓扑下,直行与变道需要截然不同的驾驶经验。为此,TEX-Drive 在路由前引入 FiLM(Feature-wise Linear Modulation)目标引导机制。导航目标特征 \(G_t\) 输入至轻量 MLP 生成逐通道仿射变换参数 \([\gamma_i \parallel \beta_i] = f_{\text{FiLM}}(G_t)\),对时序融合特征 \(\hat{F}_t\) 进行通道缩放与平移: $\(\tilde{Z}_t = \gamma_i \odot \hat{F}_t + \beta_i\)$ 该操作将长远意图显式注入到低层时序表征中,使得后续经验匹配不仅基于“看到了什么”,更强约束于“计划去哪里”。

3. 经验引导专家路由与动量记忆更新:稳定长周期专家专业化 传统 MoE 的浅层门控易受瞬时扰动影响导致频繁误切。TEX-Drive 为 \(N\) 个专家 \(\{E_1, \dots, E_N\}\) 各自维护一个长期经验记忆向量 \(M_i \in \mathbb{R}^{d_m}\),沉淀特定场景的先验模式。经验路由器计算目标调制特征 \(\tilde{Z}_t\) 与各专家记忆的内积相似度: $\(s_{it} = \frac{(\tilde{Z}_t W_q) \cdot (M_i W_k)^\top}{\sqrt{d_m}}\)$ 经 Softmax 得到路由置信度 \(R_{it}\),并激活 Top-\(K_3\) 个专家。为防止表征坍塌与不同专家经验同质化,推理过程中非激活专家不更新,且在选出的 Top-\(K_3\) 专家中仅对排名第 1 的专家执行动量更新: $\(M_i \leftarrow (1 - \mu) M_i + \mu f_{\text{proj}}(\tilde{Z}_t)\)$ 这种工作记忆回放机制使得专家在吸收当前道路变化的同时,锚定自身长周期的控制倾向,有效抑制了突兀的动作抖动。

4. 标量门控自适应融合与自回归轨迹解码:经验驱动的精准控制 每个激活的专家 \(E_i\) 首先通过可学习标量门控 \(\alpha = \sigma(W_g [\tilde{Z}_t \parallel M_i] + b_g)\) 动态插值环境表征与经验记忆,生成记忆增强表征 \(H_i = \text{LN}(\tilde{Z}_t + \alpha(M_i - \tilde{Z}_t))\)。专家解码器 TrajDecoder 基于轻量 Transformer 解码架构,以 \(H_i\) 为首步隐状态自回归预测多步轨迹点 \(\{y_{t+1}^i, \dots, y_{t+T}^i\}\)。最后,各专家的候选轨迹按路由置信度加权汇总,经轨迹头输出最终的可行驾驶路径,确保轨迹输出在时序和语义上高度平滑。

损失函数 / 训练策略

系统采用端到端联合训练策略。在 Bench2Drive 闭环评测中,未来预测步数设置为 4 步(频率 2 Hz),FIFO 缓冲区大小 \(K_1 = 20\),每 5 帧抽取 1 帧。底层控制器使用精心调校的 PID 参数(纵向 \(K_P=5.0, K_I=0.5, K_D=1.0\);横向 \(K_P=0.75, K_I=0.75, K_D=0.3\)),并限制最大油门与刹车分别为 0.75 与 0.4。模型在 4 块 NVIDIA RTX A800 GPU 上训练完成。

实验关键数据

主实验

在 Bench2Drive 闭环基准测试(44 个复杂场景,包含会车、变道、让行等高动态行为)与开环 L2 误差评估中,TEX-Drive 与 11 种前沿方法对比,即使仅使用单模态纯视觉输入(Camera-only),综合表现亦全面超越了融合激光雷达的多模态方法及同类 MoE 模型(如 GEMINUS)。

表 1: Bench2Drive 基准上不同模型的开环与闭环性能对比(对应原文 Table 1)

方法 模态 开环 Avg. L2 (m) ↓ 闭环 Driving Score ↑ 闭环 Success Rate (%) ↑
TCP (2022) C 1.70 40.70 15.00
LeTFuser (2023) C+L 0.84 52.53 18.18
UniAD-Base (2023) C 0.73 45.81 16.36
ThinkTwice (2023) C+L 0.95 58.79 29.54
VAD (2023) C 0.91 42.35 15.00
DriveAdapter (2023) C 1.01 64.22 33.08
EATNet (2024) C+L 1.12 42.97 15.91
DriveTransformer (2025) C 0.62 63.46 35.01
SparseDrive (2025) C 0.83 42.12 15.00
TTOG (2025) C 0.74 45.23 16.36
GEMINUS (2025) C 1.60 65.39 37.73
TEX-Drive (本文) C 0.60 68.22 40.62

表 2: Bench2Drive 五项核心驾驶能力成功率对比(对应原文 Table 2)

方法 汇入 (Merging) ↑ 超车 (Overtaking) ↑ 紧急制动 (Em-Brake) ↑ 让行 (Give Way) ↑ 交通标志识别 (Traffic Sign) ↑ 平均分 (Mean) ↑
TCP 16.18 20.00 20.00 10.00 6.99 14.63
ThinkTwice 27.38 18.42 35.82 50.00 54.23 37.17
DriveAdapter 28.82 26.38 48.76 50.00 56.43 42.08
DriveTransformer 17.57 35.00 48.36 40.00 52.10 38.60
GEMINUS 11.11 37.50 55.00 40.00 45.26 37.77
TEX-Drive (本文) 32.22 37.50 50.00 50.00 55.77 45.09

消融实验

消融实验系统验证了关键帧时序感知(KTP)与经验引导 MoE(E-MoE)的模块有效性及两者的协同增益(TP 指使用未经筛选的全部历史特征,MoE 指无记忆经验导向的普通门控混合专家)。

表 3: 模块消融实验(对应原文 Table 4)

KTP E-MoE 闭环 Driving Score ↑ 闭环 Success Rate (%) ↑ 多任务平均分 (MA) ↑ 说明
53.77 21.81 19.59 无时序感知与专家机制的基准模型
✗ (普通 MoE) 55.15 26.81 21.37 仅引入标准 MoE
61.72 33.18 37.14 仅引入经验驱动 E-MoE
TP 57.86 25.00 20.83 仅使用未过滤的全量时序特征
62.74 34.38 40.09 仅引入关键帧感知 KTP
TP 普通 MoE 58.27 31.25 33.59 普通时序与普通 MoE 简单组合
68.22 40.62 45.09 完整模型(KTP + E-MoE)

表 4: nuScenes 真实数据集开环评测与推理效率对比(对应原文 Table 5)

方法 L2 1s (m) ↓ L2 2s (m) ↓ L2 3s (m) ↓ 平均 L2 (m) ↓ 碰撞率 1s (%) ↓ 碰撞率 2s (%) ↓ 碰撞率 3s (%) ↓ 平均碰撞率 (%) ↓ FPS ↑
ST-P3 1.33 2.11 2.90 2.11 0.23 0.62 1.27 0.71 2.7
UniAD 0.48 0.96 1.65 1.03 0.05 0.17 0.71 0.31 1.7
GenAD 0.36 0.83 1.55 0.91 0.06 0.23 1.00 0.43 2.4
VAD 0.41 0.70 1.05 0.72 0.07 0.17 0.41 0.22 7.6
DWM 0.43 0.77 1.20 0.80 0.10 0.21 0.48 0.26 0.3
TEX-Drive (本文) 0.45 0.59 0.91 0.65 0.08 0.13 0.39 0.20 3.3

关键发现

  • 双模块互促协同效应强:由表 3 可见,单独引入 KTP 或 E-MoE 分别取得约 62 左右的 Driving Score,而两者协同的完整模型跃升至 68.22,相比普通组合(TP + MoE 的 58.27)高出近 10 分。KTP 为 E-MoE 提供了剔除噪点的纯净阶段语义,而 E-MoE 的稳定经验回流反向锚定了时序注意力的聚合方向。
  • 专家专业化与时序持久度大幅改善:定量专家分析(原文 Table 3)表明,KTP + E-MoE 将路由熵(Route Ent.)从 0.78 降至 0.49(决策更明确),Top-1 专家的平均连续维持时间(Temp. Persist.)从 1.9 步大幅延长到 4.8 步(稳定性提升 2.5 倍),彻底消除了普通 MoE 频繁跳变的震荡弊端。
  • 长时程预测退化率极低:在 nuScenes 测试中(表 4),当预测时界由 1s 延伸到 3s 时,UniAD 的 L2 误差由 0.48 暴增到 1.65(增幅 244%),而 TEX-Drive 仅由 0.45 增至 0.91(增幅仅 102%),3s 碰撞率(0.39%)与平均碰撞率(0.20%)均为全部对比方法中最低。

亮点与洞察

  • 显式可追溯的关键帧时序选择机制:抛弃等权拼接与黑盒注意力,通过相关性与指数距离衰减构建显式评分,让驾驶系统在急刹、转弯等转折时刻精准“唤醒”历史关键瞬态。
  • 只更新 Top-1 专家的动量记忆更新策略:推理阶段仅针对置信度最高的单一专家进行慢速动量刷新,巧妙规避了传统 MoE 多专家在共享更新下的同质化坍塌,维持了不同经验域的技能独特性。
  • 向大模型与具身决策可迁移的模块调度思想:将长远规划目标(FiLM 调制)与时序特征结合去检索专家记忆向量的设计,非常适合推广到端到端具身机器人操作与长周期任务规划中。

局限与展望

  • 闭环评测目前受限于 CARLA 仿真环境:虽然在 nuScenes 上补充了开环轨迹验证,但闭环控制决策的交互安全性仍未在实车开放道路上得到充分实测。
  • 超参敏感性存在权衡约束:实验显示当激活专家数 \(K_3 > 2\) 或关键帧数 \(K_2\) 进一步放大时,模型性能出现下降并加剧推理延迟,对特定硬件部署的自适应动态截断能力仍有待加强。
  • 未来方向:探索与多模态大语言模型(VLM)结合以注入常识推理,并将经验记忆机制扩展为层级化终身学习存储体系。

相关工作与启发

  • vs DriveTransformer / ThinkTwice: 该类工作依赖深层 Transformer 进行隐式时空特征关联,计算开销大且缺乏对关键时刻帧的显式筛选;TEX-Drive 通过轻量 KTP 模块显式筛选高价值时序帧,大幅压低冗余计算并提升时序阶段可解释性。
  • vs GEMINUS / MoSE: 此类端到端 MoE 方案依赖浅层网络从短期瞬时特征直接分配专家,动作容易出现帧间振荡;TEX-Drive 通过目标调制特征与长期经验记忆向量对齐,并引入动量单专家慢速更新,实现了长时程时序连贯且语义明确的专家专业化。

评分

  • 新颖性: ⭐⭐⭐⭐☆ (显式关键帧时序过滤与经验记忆 MoE 的双向闭环结合切中时序规划痛点,设计完备自洽)
  • 实验充分度: ⭐⭐⭐⭐⭐ (覆盖 Bench2Drive 闭环、多能力专项拆解、nuScenes 真实开环、模块消融与专家路由熵量化,证据链极其扎实)
  • 写作质量: ⭐⭐⭐⭐⭐ (结构清晰,动机与认知学原理阐述透彻,图表对照准确规范)
  • 价值: ⭐⭐⭐⭐☆ (为解决自动驾驶时空表征与动态控制专家分配的不稳定问题提供了可落地的模块化范式)