BeyondSight: Object Permanence for End-to-End Autonomous Driving¶
会议: ECCV2026
官方论文: ECCV 5981
论文: PDF
项目: BeyondSight
领域: 自动驾驶
关键词: 物体恒存性、部分可观测性、时序查询传播、稀疏场景表示、遮挡感知规划
一句话总结¶
BeyondSight 在 SparseDrive 中把目标的历史传播与当前图像更新分离,并用覆盖不可观测时刻的标注训练,使被完全遮挡的目标仍能进入预测和规划,将不可观测目标 mAP 从 0 提升到 0.249、标准 nuScenes 开放环平均规划 L2 从 0.61 降到 0.54。
研究背景与动机¶
端到端驾驶系统即使保留历史特征,也不一定理解“看不见不等于不存在”。例如,行人刚走到路口就被前车挡住,检测查询在缺少视觉证据时可能被压低置信度或删除;预测模块随即不再输出该行人的未来轨迹,规划器因此拿到一个缺少关键参与者的场景。SparseDrive 等稀疏查询架构可以跨帧传播实例,但如果历史查询仍必须经过以当前图像为中心的更新,长期遮挡就可能逐步抹去这段记忆。
问题还出在监督与评测上。标准协议通常过滤没有传感器点支持的目标,模型即使保留了真实存在的遮挡目标,也可能被当成误检。论文以关联 LiDAR 和雷达回波数是否大于零近似定义可观测性;这是标注侧的传感器支持代理,不是精确的相机可见性判定,也不意味着推理时输入了这些点云。作者分析称,每个时刻约有 30% 的目标完全不可观测,单纯增加短期时序融合并不能补上被监督规则删除的对象。
本文把任务限制为曾经被观测、后来暂时不可观测的目标,而不是凭空发现从未见过的隐藏参与者。核心 idea:让目标存在性由可持续传播的历史假设支撑,让当前观测只负责提供新证据,同时用跨越遮挡间隙的标注与评测使这种持续性真正可学习、可衡量。
方法详解¶
整体框架¶
BeyondSight 保留 SparseDrive 的多视角图像骨干、稀疏场景表示、运动预测与规划模块,核心改动集中在动态目标查询的更新。时序先验解码器先从历史检测和运动预测中产生不依赖当前图像的假设;观测解码器结合新查询与当前图像特征形成观测假设;后验融合解码器协调两者,再把最终目标集合交给预测与规划。
另一个必要组成是离线构建的 nuScenes-Permanence:它补全不可观测时间段的目标状态,训练时监督历史假设和融合结果,评测时区分可观测与不可观测目标。这里的“先验、后验”只是受滤波启发的潜在查询表示,论文明确说明它们不是校准后的概率分布,不能把模块置信度直接解释为贝叶斯存在概率。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
DATA["持续性标注与评测<br/>离线补全遮挡状态"] -.->|训练监督| PRIOR
HISTORY["历史检测与运动查询"] --> PRIOR["时序先验解码器"]
PRIOR --> OBS["观测解码器"]
IMAGE["当前图像特征与新查询"] --> OBS
PRIOR --> FUSION["后验融合解码器"]
OBS --> FUSION
DATA -.->|训练监督| FUSION
FUSION --> OUTPUT["持续目标集合<br/>运动预测与自车规划"]
关键设计¶
1. 持续性标注与评测:先让遮挡期间的目标成为合法监督对象
nuScenes-Permanence 保留原本可观测的轨迹段,并保留零 LiDAR 或雷达点支持的已有框;缺失区间通过前后观测之间的插值、以及离开传感器视野时的短时外推补齐。补全过程严格离线运行,推理时没有补全轨迹可查,也不能读取未来观测。因此,训练数据可以借助完整序列构造参考,但模型运行时仍需仅凭自身历史状态维持目标。这套标注主要适用于近似连续运动,不声称能恢复遮挡中的突发转向或停车。
评测也必须改变,否则“保留隐藏目标”仍会被惩罚。作者把真值划分为可观测集合、不可观测集合和两者的全集,分别报告 mAP_obs、mAP_unobs、mAP_all;评一个子集时,先匹配目标集合,再把剩余预测中匹配到另一忽略集合的项移除,避免两类目标相互造成误检惩罚。由于隐藏轨迹部分来自外推,不可观测目标使用随不可观测持续时间变化的匹配容差:时间趋近零时退回标准阈值。容差依据遮住原本可观测轨迹片段、重建后与真值比较的误差校准;正文未给出具体函数,不能自行补写公式。
2. 时序先验解码器:给历史目标一条不受当前图像压制的更新路径
这一分支把上一帧检测查询与运动预测查询经轻量 MLP 融合,再使用仅作用于查询的自注意力细化。前者承载已观测目标的信息,后者提供运动条件,使传播不只是把旧特征原样缓存。关键区别是该阶段完全不访问当前图像特征:遮挡时缺少视觉证据,不会直接阻止先验假设生成。
这解决了普通查询传播中的隐含耦合:历史对象虽然被送到下一帧,但若所有信息都必须穿过当前观测分支,最终仍可能被“此处没有可见目标”的证据覆盖。独立先验为后续融合保留另一个候选。不过它并不保证状态永远正确,长时间失去观测后,运动先验仍可能漂移;物体恒存性不是无限期无条件保留所有旧目标。
3. 观测解码器:用可见证据更新目标,同时允许新目标进入
时序先验与新初始化的物体查询一起进入标准 SparseDrive 检测解码器,利用骨干提供的图像特征形成观测条件下的假设。新查询让系统不局限于此前见过的对象;历史查询则能在目标重新出现时重新吸收视觉证据。该分支只用可观测目标监督,因此无需为了保住不可见对象而从遮挡物的图像区域“找出”不存在的视觉特征。
分工比单纯增加记忆长度更重要:观测分支负责“这次传感器支持什么”,先验分支负责“根据之前的信息哪些目标仍可能在场”。两个分支不必在每一帧给出完全相同的答案,遮挡期间的分歧正是后验融合要处理的内容。训练时的可观测标签来自标注支持信息,而不是要求模型推理时拿到隐藏真值。
4. 后验融合解码器:让持久目标真正进入下游决策
对每个目标,融合阶段保留分类置信度较高的提案,并经过最终查询细化,得到交给预测和规划的目标集合。先验与观测两路都有机会提供获选假设:当前看得见时可利用新证据,被挡住时则不必强迫视觉分支承担全部责任。这里不是把两个概率分布做解析乘积,也不能仅凭“后验”这个名字补出卡尔曼滤波式的融合公式。
时序与融合分支的检测监督覆盖可观测和不可观测目标,运动监督也扩展到两者全集;后验解码器另预测一个可观测状态,用二元交叉熵训练。这样,“目标存在”与“目标当前有传感器支持”成为不同输出语义,而不是用一个检测分数同时代替两者。规划器本身没有改动,收益来自它接收到更完整的动态参与者及其预测轨迹。
一个完整示例¶
以论文图 1 和图 3 所讨论的遮挡情形为例:行人此前被看见,随后被另一辆车完全挡住。历史检测与运动查询先经过时序先验解码器,形成行人仍在附近运动的假设;当前图像分支可以更新遮挡车辆,却未必能给行人提供有效观测。融合分支仍能使用先验候选,将隐藏行人保留给预测器,规划器因而有机会与其未来轨迹保持间距。
行人重新出现后,观测分支又能提供状态纠正。若行人在遮挡中突然改变意图,先验也可能失准,这正是论文的适用边界。此例解释模块如何衔接,不为原文未报告的隐藏轨迹、速度或查询置信度添加数字。
损失函数 / 训练策略¶
训练沿用 SparseDrive 两阶段流程:先学习稀疏感知表示,再联合训练感知、运动预测与规划。总体目标保留观测分支检测、地图、规划和深度损失,同时加入覆盖全部目标的修改版检测与运动监督;修改版检测目标还包含可观测状态的二元交叉熵,其权重为 1.0。正文没有提供足以完整复现所有损失内部实现的细节,因此这里只解释监督范围,不重建损坏的 PDF 公式。
优化器为 AdamW,权重衰减为 0.001,采用余弦学习率和 500 次 warm-up;第一、二阶段学习率分别为 0.0004、0.0003,图像骨干学习率倍率分别为 0.5、0.1。新解码器使用自注意力、两层 MLP 和检测头,新增参数少于 5%;这不是推理延迟增加少于 5% 的证据。
实验关键数据¶
主实验¶
实验使用 nuScenes 官方 700/150 场景训练/验证划分,六路相机、2 Hz 关键帧和十类目标。下表摘自原文表 1,L2 单位为米,碰撞率 CR 单位为百分比;均是开放环评测,越低越好。
| 方法 | L2 1 s | L2 2 s | L2 3 s | 平均 L2 | 平均 CR (%) |
|---|---|---|---|---|---|
| UniAD | 0.48 | 0.96 | 1.65 | 1.03 | 0.31 |
| VAD-Base | 0.41 | 0.70 | 1.05 | 0.72 | 0.22 |
| SparseDrive | 0.29 | 0.58 | 0.96 | 0.61 | 0.08 |
| BridgeAD | 0.28 | 0.55 | 0.92 | 0.58 | 0.08 |
| MomAD | 0.31 | 0.57 | 0.91 | 0.60 | 0.09 |
| BeyondSight | 0.26 | 0.51 | 0.85 | 0.54 | 0.07 |
物体恒存性是否真的改善,需要看原文表 3 的分组指标,而非只看总体规划。mAP 与 EPA 越高越好,minADE 为多条预测中最小平均位移误差,越低越好;EPA 沿用既有端到端预测准确率协议,并非本文新指标。
| 评测集合 | 方法 | mAP | minADE | EPA |
|---|---|---|---|---|
| 全部目标 | SparseDrive | 0.389 | 0.642 | 0.457 |
| 全部目标 | BeyondSight | 0.413 | 0.582 | 0.481 |
| 可观测目标 | SparseDrive | 0.415 | 0.610 | 0.492 |
| 可观测目标 | BeyondSight | 0.421 | 0.625 | 0.496 |
| 不可观测目标 | SparseDrive | 0.000 | 0.615 | 0.000 |
| 不可观测目标 | BeyondSight | 0.249 | 0.479 | 0.285 |
标准 nuScenes 表 2 中,ResNet50 设置下检测 mAP 从 0.415 升至 0.427,NDS 从 0.526 升至 0.536,AMOTA 从 0.372 升至 0.401。标准 mAP 的 0.427 与扩展协议 mAP_obs 的 0.421 属于不同评测口径,不应混用。
消融实验¶
下表摘自原文表 4,同一标注组内按行累加组件,不是逐项独立移除。平均 CR 沿用规划表的百分比口径。
| 训练标注 | 累积配置 | mAP_obs | mAP_unobs | mAP_all | 平均 L2 | 平均 CR (%) |
|---|---|---|---|---|---|---|
| 标准 nuScenes | SparseDrive | 0.415 | 0.000 | 0.389 | 0.61 | 0.08 |
| 标准 nuScenes | + 时序先验 | 0.417 | 0.000 | 0.390 | 0.60 | 0.08 |
| 标准 nuScenes | + 后验融合 | 0.413 | 0.000 | 0.388 | 0.61 | 0.08 |
| nuScenes-Permanence | SparseDrive | 0.403 | 0.021 | 0.388 | 0.61 | 0.08 |
| nuScenes-Permanence | + 时序先验 | 0.406 | 0.126 | 0.399 | 0.58 | 0.08 |
| nuScenes-Permanence | + 后验融合 | 0.415 | 0.194 | 0.405 | 0.56 | 0.07 |
| nuScenes-Permanence | + Unobs. supervision | 0.418 | 0.213 | 0.410 | 0.55 | 0.07 |
| nuScenes-Permanence | 完整 BeyondSight | 0.421 | 0.249 | 0.413 | 0.54 | 0.07 |
关键发现¶
- 架构和监督缺一不可:标准标注下增加先验及融合仍得不到不可观测目标检测能力;扩展标注下,加入先验使 mAP_unobs 从 0.021 升至 0.126,是表中最大的单步增益,但累积实验不能隔离全部交互作用。
- 改善并非所有指标单调上升:扩展协议中可观测目标 minADE 从 0.610 变为 0.625,说明不能笼统声称所有对象的预测精度都提高。
- 高遮挡子集包含 600 个验证样本,筛选条件为遮挡动态目标未来轨迹在 4 秒内接近自车计划至 12 米范围。SparseDrive 与 BeyondSight 的平均 L2 分别为 0.64、0.56,平均 CR 分别为 0.163、0.08;该子集是特定条件下的分析,不代表全部交通场景。
亮点与洞察¶
- 不依赖当前图像的状态更新路径。 记忆不是只保留历史 token,还要避免这些 token 在每次视觉更新时被擦掉;这一设计可迁移到其他经历观测中断的具身任务。
- 监督集合与评测规则一起改。 如果训练删除隐藏目标、评测又惩罚对它们的预测,模型就没有维持对象的激励;对称忽略规则让分组指标更能反映目标能力。
- 规划收益来自输入场景而非新规划器。 在保留原规划模块的情况下仍获得改善,使“缺失参与者会影响决策”这一解释更直接,但尚不能单独证明真实道路安全提升。
局限与展望¶
- 作者承认长期遮挡会使假设过时,目标偏离学习到的运动先验时可能出现错误持续或定位漂移;不确定性感知记忆、失效判定和多假设预测是自然后续方向。
- 隐藏状态由插值和短时外推产生,并非逐帧实测真值;突然停车、转弯和意图变化不在其可靠覆盖范围。仿真特权标注与多观察者数据可用于更直接的验证。
- 匹配容差随遮挡时长变化,具体轨迹补全与容差细节指向补充材料,本次缓存正文没有这些细节;不可把 0.249 当成固定严格定位阈值下的隐藏目标性能。
- 原文报告框数从 932k 增至 1.33M,同时写“+30%”,两者若以原框数为分母并不一致;这里保留端点并提示口径问题,不直接复用该增长百分比。
- 表 4 未充分解释“+ Unobs. supervision”与最后完整模型之间具体还增加了什么,也未细分其与扩展标注的区别;不能将最后 0.213 到 0.249 的提升擅自归因于某一个损失。
- 证据来自单一数据集的开放环评测与定性案例,正文未给闭环驾驶、置信区间或实际延迟测试;增加参数少于 5% 不能替代部署成本评估。
相关工作与启发¶
- SparseDrive:直接基线,以稀疏实例查询联合感知、预测和规划;本文主要改变目标查询生命周期及监督范围,不是替换整个驾驶栈。
- StreamPETR、ForeSight 与 BridgeAD:分别体现对象级时间传播、检测与预测共享记忆、历史预测辅助当前任务等思路。BeyondSight 的区别是把完全不可观测期间的存在性明确纳入模型、标注与评测三者。
- OPNet 与 PermaTrack:视频理解和跟踪已有物体恒存性研究,因此概念本身并非首次提出;本文价值在于将其接入端到端驾驶的预测与规划链路。
- 可迁移启发:维护“对象还在不在”与“传感器现在看不看得见”两个语义,有助于机器人在临时遮挡中持续推理,但必须配合记忆失效与不确定性机制,避免把持续性变成长期误报。
评分¶
- 新颖性: 4/5。三阶段查询设计本身较轻量,亮点是把持续性监督、模型与评测统一起来;物体恒存性概念已有先例。
- 实验充分度: 3/5。有主任务、分组指标、累积消融和遮挡子集,但缺闭环测试,隐藏真值依赖补全,部分消融定义不够清楚。
- 写作质量: 4/5。问题与分支分工清晰,不过标注增幅口径和完整模型最后一步消融解释仍需澄清。
- 价值: 4/5。对遮挡下漏掉关键交通参与者这一实际问题有针对性,也提示驾驶评测不能只关注当前可见对象;评分为笔记作者判断。