跳转至

🚗 自动驾驶

🎞️ ECCV2026 · 33 篇论文解读

📌 同领域跨会议浏览: 📷 CVPR2026 (157) · 🔬 ICLR2026 (50) · 🧪 ICML2026 (8) · 🤖 AAAI2026 (56) · 🧠 NeurIPS2025 (47) · 📹 ICCV2025 (91)

🔥 高频主题: 自动驾驶 ×7 · 3D 目标检测 ×3 · 少样本学习 ×2 · 扩散模型 ×2 · 时序预测 ×2

2K Retrofit: Entropy-Guided Efficient Sparse Refinement for High-Resolution 3D Geometry Prediction

本文提出 2K Retrofit,一种无需修改或重训练基座模型即可让现有 3D 基础模型(如 Depth Anything、VGGT)输出 2K 分辨率几何预测的通用框架——核心思路是用冻结的基座做快速粗预测,再通过熵引导的稀疏细化机制只对高不确定性像素区域做全分辨率修正,在大幅降低计算和显存开销的同时达到或超越全分辨率方法的精度。

单调最小调节时间PI整定:基于切触恒等式的FOTD系统无超调控制

本文针对一阶加纯滞后(FOTD)被控对象,推导了严格单调(零超调)阶跃响应下最小化2%调节时间的PI整定问题的精确解析解——核心是一个描述输出斜率在单调边界处切触零点条件的切触恒等式,由此将二维搜索降为一维嵌套标量条件,给出了显式闭式规则、基于响应的精确降阶和无仿真超越方程组三种不同精度的求解方案,并将2%调节时间相比Lambert-W临界阻尼消去设计降低14%–52%。

ASTAD: 非对称风格迁移实现自动驾驶合成到真实域的适应

ASTModel 针对自动驾驶场景中「合成图有完美标注、现实风格参考图无标注」的非对称约束,提出两阶段无训练框架——先用 DINO 原型匹配从无标签风格图提取粗语义先验,再在扩散逆过程中通过多层语义投票精化先验、鲁棒中位数阈值过滤和像素比例调制混合 AdaIN 实现类一致风格注入,在保持语义结构前提下 3.2x 提速生成逼真的目标域风格数据。

CooperScene: Multi-Modal Cooperative Autonomy Benchmark with C-V2X Communication Characterization

CooperScene 是首个在真实道路场景中同步采集 C-V2X 通信特征(吞吐量、延迟、丢包率、抖动)与多模态传感器数据(LiDAR、相机、GNSS/IMU)的协同自动驾驶数据集,覆盖 3 辆智能车和 1 个路侧单元在路口、高速匝道、停车场等多样场景的交互,基于该数据集的基准评测表明,现有协同感知方法在真实 C-V2X 带宽约束下的 mAP 相比理想网络假设最多下降 49%,揭示了理想化评测与可部署性能之间的巨大鸿沟。

Deconfounded Lifelong Learning for Autonomous Driving via Dynamic Knowledge Spaces

DeLL 首次将终身学习引入闭环端到端自动驾驶,利用 Dirichlet 过程混合模型构造显式和隐式双动态知识空间,并将动态生长的知识锚点作为中介变量实现前门调整去混杂,在 Bench2Drive 上以零额外存储开销取得优于 PackNet 和 ER 的终身学习性能。

Driver-WM: A Driver-Centric Traffic-Conditioned Latent World Model for In-Cabin Dynamics Rollout

把「舱内驾驶员未来会怎么动」当成一个在潜在空间里、由舱外交通事件因果驱动的 rollout 问题来做:用冻结的 Qwen3-VL 特征当感知接口,双流分别编码交通和驾驶员,再用一个「门控因果注入」让外部环境单向调制驾驶员内部状态的自回归演化,最终解码成未来 5 步的人体骨架轨迹(外加行为/情绪语义作辅助正则),在 AIDE 上于安全攸关的高动态片段上取得稳健的长时预测。

DriveVA: Video Action Models are Zero-Shot Drivers

DriveVA 提出一种统一的视频-动作世界模型,将未来视频预测与轨迹规划放在同一个 DiT 扩散生成过程中联合解码,利用大规模视频生成模型(Wan2.2-TI2V-5B)的时空先验实现强零样本跨域泛化,在 NAVSIM 上达到 90.9 PDMS,并在 nuScenes 和 Bench2Drive 上分别降低 78.9% 和 52.5% 的平均 L2 误差与 83.3% 和 52.4% 的碰撞率。

DriveWeaver: Point-Conditioned Video Inpainting for Controllable Vehicle Insertion in Autonomous Driving Simulation

DriveWeaver 提出以车辆点云渲染图为像素级条件的视频扩散修补框架,通过轻量 PointAdapter 将几何条件注入冻结的 Wan2.1 差分变换器骨干,生成光照融合一致且几何精确的前景车辆,并设计全局-局部分层修补策略消除长时序漂移,生成结果可进一步蒸馏为 3D 高斯泼溅实现实时渲染。

ExploreVLA: Dense World Modeling and Exploration for End-to-End Autonomous Driving

提出统一理解-生成框架 ExploreVLA,在 VLA 驾驶模型中引入未来 RGB + 深度图像生成作为密集世界建模目标,并利用世界模型的图像预测不确定性作为内在探索奖励,通过安全门控 GRPO 让策略超越模仿学习分布、发现多样且安全的驾驶行为,在 NAVSIM 上取得 93.7 PDMS 和 88.8 EPDMS 的 SOTA。

FLM-Occ: Feed-forward Likelihood Maximization for Efficient Indoor Occupancy Prediction

FLM-Occ 将室内单目占用预测从体素分类重新定义为体素分布估计,通过最大似然估计(MLE)训练网络以前馈方式预测场景的混合模型参数,仅用 32 个超二次曲面原语即可超越此前需 1200 个高斯原语的最优方法,同时推理速度提升 3.7 倍。

FrozenDrive: Zero-Shot Text-Guided Driving Scene Generation and Data Augmentation

FrozenDrive 把预训练 Stable Diffusion 主干完全冻结、零新增参数,仅通过重排 self-attention 的输入(拼接多视角特征、注入前一帧参考)就同时拿到多视角与时序一致性,从而保住原始扩散先验、实现零样本文本引导的驾驶场景生成,并用文本 prompt 定向合成夜/雨/雪等稀有恶劣天气数据显著提升下游感知与规划鲁棒性。

Geometry-Preserving in 3D Gaussian Splatting for LiDAR-Camera Extrinsic Calibration

提出 GeoP-Calib,通过稠密深度锚定(DDA,多视角 LiDAR 点云累积构建稠密深度先验)和梯度解耦(GD,阻断光度损失对高斯空间参数的反传)两条设计,缓解 3DGS 标定中的"几何衰退"问题,在 KITTI-360 和 KITTI 上平移误差显著优于现有无目标标定方法。

混合事件-帧传感器:统一噪声建模、标定与仿真

提出首个混合事件-帧传感器的统一统计噪声模型与标定管线,并构建了能生成与真实传感器噪声分布一致的 RAW 帧和事件流的仿真器 H-ESIM,在视频插帧和去模糊任务上验证了仿真到真实的迁移能力。

HilDA: Hierarchical Distillation with Diffusion for Advancing Self-Supervised LiDAR Pre-training

HilDA 用视觉基础模型(VFM)的「分层语义结构 + CLS 全局上下文」而非只用最后一层特征来蒸馏 LiDAR 骨干网络,并额外挂一个「预测未来 BEV 占据」的条件扩散任务补齐时空几何信息,在跨模态蒸馏的分割、检测、场景流、语义占据多个下游任务上刷新 SOTA。

Horizon3D: Sparse Radar-Camera Fusion for Long-Range 3D Perception in Autonomous Driving

Horizon3D 提出一种面向长距离自动驾驶感知的稀疏雷达-相机融合框架,用高斯原语(Gaussian primitives)捕捉目标级细节、稀疏 BEV 特征编码场景级上下文,并通过双路径时序融合(BEV 路径做多帧累积 + Gaussian 路径做逐目标运动传播)同时解决远距离稀疏性和高速大位移两难问题,在 TruckScenes 上以 +3.0 NDS / +1.6 mAP 超过此前最优雷达-相机融合方法,且推理速度快于现有 BEV 融合方法。

HSDF-Lane: Height-Aligned Signed Distance Field with Semantic Lane Prior for 3D Lane Detection

HSDF-Lane 用垂直方向对齐的有符号距离场(HSDF)替代传统稀疏斜率锚点来隐式建模道路表面,通过可微渲染同时输出精确高度图和表面对齐特征,并引入车道感知语义位置编码(LSPE)将车道存在先验注入 Transformer 查询,在 OpenLane 基准上取得 3D 车道检测和高度估计双项 SOTA。

LaGen: Towards Autoregressive LiDAR Scene Generation

LaGen 首次将自回归框架引入 LiDAR 场景生成,以单帧点云为起点、结合 3D 边界框与自车状态条件,逐帧生成高保真的长时间序列 LiDAR 场景,并支持交互式闭环仿真。

LeAD-M3D: Leveraging Asymmetric Distillation for Real-Time Monocular 3D Detection

LeAD-M3D 在纯图像 YOLOv10-M3D 基线上叠加三个组件——非对称 MixUp 去噪蒸馏(A2D2)、把 3D 重叠塞进匹配打分的 CM3D、只对高置信区域跑 3D 回归头的 CGI3D——不用 LiDAR / 双目 / 几何先验,就在 KITTI、Waymo、Rope3D 上做到 SOTA 精度,同时比同精度模型快最多 3.6 倍、TensorRT 下最大模型也能跑到 60 FPS 以上。

Long-term Traffic Simulation via Structured Autoregressive Modeling

RosettaSim 将长时多智能体交通仿真建模为结构化自回归序列生成问题,利用冻结/部分冻结的 LLM(Qwen2.5-0.5B)作为结构先验,将场景拓扑、智能体状态和生成意图投影到变长 token 序列中统一处理运动预测与智能体种群动态;同时提出检索式交通评估框架 RTE,用语义相似的真实场景作为参考锚点替代全局分布匹配,在 WOSAC 短时和长时仿真上均达到 SOTA。

OmniNWM: Omniscient Driving Navigation World Models

OmniNWM 用一个统一的概率框架把驾驶世界模型的「状态-动作-奖励」三要素打通:联合生成像素对齐的全景 RGB / 语义 / 深度 / 3D 占据,用规范化全景 Plücker 射线图把运动控制从相机装配几何里解耦出来实现零样本跨相机迁移,再从生成的占据体直接导出稠密奖励,从而在生成的世界里对规划智能体做闭环评估。

Open-Vocabulary BEV Segmentation with 3D-Aware Geometric Constraints

提出首个开放词汇BEV分割框架OVBEVSeg,通过反向几何推理路线(用无监督3D检测建立2D-BEV对应→BEV感知的3DGS优化几何→蒸馏到前馈网络)将VLMs的语义从2D提升到BEV空间,在nuScenes新类上超越闭集方法15.3 mIoU且推理速度更快。

PLOT: Pseudo-Labeling via Object Tracking for Monocular 3D Object Detection

PLOT 提出一个无需辅助传感器或模型重训练的 3D 伪标签生成框架,通过密集点跟踪建立跨帧点级对应、从背景/物体轨迹解耦估计相机自运动与物体运动、引入全局物体记忆维护长程身份一致性,最终将多视角部分观测对齐并融合为完整的物体伪点云,在 KITTI、KITTI-360、Waymo 等基准上达到与全监督方法可比的效果,并泛化到非驾驶场景。

PriorEye: Geospatial Visual Priors for End-to-End Autonomous Driving

PriorEye 将离线采集的街景图像锚定到规划路线上,构造"地理空间视觉先验"并通过双记忆架构注入端到端驾驶策略,使其具备人类驾驶员般的前瞻性感知,同时在传感器失效和先验污染两种极端情况下均保持鲁棒。

Real-Time Source-Free Object Detection

本文在 YOLOv10(首个 NMS-free 双头检测器)上构建了实时无源域适应目标检测框架 RT-SFOD,提出双头伪标签融合(DHF)恢复 O2O 头漏检物体同时保持高精度,以及多尺度自适应表征多样化损失(MARD)对抗域偏移导致的特征秩退化,在四个域偏移基准上以 1.3 倍推理速度、~2 倍参数压缩实现 1.4-3.5% mAP 提升。

RESOLVE: A Multi-Resolution and Multi-Modal Dataset for Roadside Cooperative Perception

RESOLVE 是首个真实世界多分辨率、多模态路侧协同感知数据集,通过在真实城市交叉路口同时部署 16/64/128 线三种分辨率的 LiDAR 并严格保持传感和环境因素一致,系统评测了 LiDAR 分辨率变化对 3D 检测、多目标追踪和协同感知的影响,揭示了多模态融合如何在点云稀疏时补偿感知下降,以及跨分辨率训练-推理不匹配造成的领域漂移问题。

Rethinking Training & Inference for Forecasting: Linking Winner-Take-All back to GMMs

本文揭示自动驾驶轨迹预测中广泛使用的 Winner-Take-All (WTA) 损失函数本质上是 K-Means 聚类目标而非高斯混合模型 (GMM) 似然,正是这一"GMM 建模 + WTA 训练"的不匹配导致模式概率无信息量且过分割;在此基础上提出两种无需重训的后处理手段——测试时加权合并与一步 EM 微调,显著改善模式排序质量和位移精度。

StreamOcc: Streaming Dense Voxel Representations for 3D Occupancy Prediction

StreamOcc首次将流式更新范式与稠密3D体素表示结合起来用于占用预测,通过矫正体素流式聚合(StreamAgg)和查询引导聚合(QueryAgg)分别解决warping畸变和动态目标特征退化两大难题,在83.3ms/帧的实时延迟和2.8GB显存占用下达到SurroundOcc和Occ3D-nuScenes上的SOTA性能。

Towards Metric-Agnostic Trajectory Forecasting

本文主张轨迹预测应该只学一个「校准良好的预测分布」,把 minFDE / soft mAP 这些互相打架的指标当成下游任务,用一组免重训的采样策略(TraDiE policies)在评测时从同一个分布里挑出每个指标各自最优的 K 条轨迹,从而让单个 DONUT-NLL 模型在 Waymo 上同时刷到距离类和窗口类指标的 SOTA。

Understanding Cross-Rig Generalization in Automotive Perception: a Multi-Rig Benchmark and Rig Variation Metrics

本文构建了包含14种系统变化的相机布局的仿真基准PCCR,提出Rig Variance和Rig Contrastive Distance两个基于标定参数的几何描述子,实验表明相机平移差异是跨rig泛化性能下降的主导因素,RigCD可预测不同布局间的迁移难度排序,Spearman秩相关最高达0.80。

UniDrive-WM: Unified Understanding, Planning and Generation World Model for Autonomous Driving

UniDrive-WM 在单一 VLM 框架中联合实现场景理解、轨迹规划和轨迹条件未来图像生成,通过规划→生成的可微双向耦合,在 Bench2Drive 闭环评估中将 Driving Score 从 77.74 提升至 79.31,L2 轨迹误差降低 7.3%、碰撞率降低 10.4%,并在两个互补的图像生成分支(离散自回归与连续扩散)之间系统分析了速度-保真度的权衡关系。

UniTeD: Unified Temporal Diffusion for Joint Perception and Planning in Autonomous Driving

UniTeD 把感知(检测、地图、运动预测)和规划的 anchor query 放进同一个扩散去噪过程里联合建模,用时序过渡模块(TTM)对齐历史帧与当前帧的噪声水平、用 Anchor Refresh 策略缓解稀疏扩散的训练-推理分布偏移,仅用相机就在 NAVSIM、Bench2Drive 上超过判别式与「只对规划做扩散」的方法,拿到 90.2 PDMS / 87.3 DS。

Unveiling Transferability in Trajectory Prediction via Latent Scene Embeddings

本文提出 TransferAtlas 框架,用一个图神经网络编码器将 24 个轨迹预测数据集共同映射到 32 维统一隐空间,数据集在此空间中表现为一个高斯分布,两个分布间的 KL 散度即可量化从源域到目标域的迁移难易程度——零样本迁移的 Spearman 秩相关系数达 0.811,为数据集选择、预训练源推荐和基础模型构建提供了原理性指导。

WarpI2I: Image Warping for Image-to-Image Translation

本文提出一个与模型无关、无参的 warp-unwarp 框架,在编码前对显著性区域做空间放大再反向还原,在不增大隐空间分辨率的前提下保留 LDM 图像翻译中的细粒度结构信息;同时配套提出一套基于 FLUX 的轻量合成数据管线,在人体/驾驶场景重打光与天气/时段驾驶翻译任务中以极小开销取得显著提升。