Learning 1-Bit LiDAR-based Localization with Auxiliary Objective¶
会议: ECCV2026
论文: ECCV 原文
代码: 待开源
领域: 自动驾驶
关键词: 激光雷达定位、绝对位姿回归、二值神经网络、信息瓶颈、辅助目标蒸馏
一句话总结¶
BiLoc 提出了首个面向 6-DoF 激光雷达定位的 1-Bit 二值神经网络框架,通过信息瓶颈视角引入仅在训练期生效的软掩码通道蒸馏与位姿感知最优传输辅助目标,在 Oxford 和 NCLT 数据集上大幅降低定位误差(Oxford 平均位置误差降至 7.56m,较最强二值 baseline 降低 10.11%),同时在 RTX 5090 上实现 2.07 倍推理加速与 3.01MB 超低权重存储。
研究背景与动机¶
在现代自动驾驶系统中,感知、定位、规划与控制通常采用松耦合模块化架构。与可选择性降频或按需唤醒的高阶感知骨干不同,6-DoF 激光雷达定位属于长时常驻(always-on)的安全关键模块,必须以极高频率为下游规划和控制提供连续位姿估计。然而在车载边缘计算平台上,常驻定位模块能够分得的算力与显存配额极其有限。传统基于显式建图与点云配准的定位方法计算开销大、地图维护成本高;而新兴的基于深度学习的绝对位姿回归(APR)网络虽然实现了端到端高效推断,但其全精度浮点模型(如 DiffLoc 参数量达 39.96M、计算量高达 77.06 G-OPs)依然难以在极低功耗边缘芯片上部署。
极端模型量化——二值神经网络(BNN)将网络权重和激活值全部压缩至 1-Bit,能够将浮点乘加运算替换为硬件友好的 XNOR 和 PopCount 位运算,理论上带来高达 32 倍显存压缩与 58 倍计算加速。然而,将 BNN 直接迁移到 6-DoF 激光雷达定位任务时会遭遇严重的性能塌陷。核心矛盾在于:定位本质上是对微小位姿差异高度敏感的精细连续回归任务,而 1-Bit 极端压缩破坏了特征表达的细粒度判别力;更严峻的是,符号函数(sign)的非可微性迫使反向传播依赖直通估计器(STE),累积的梯度失配误差与受限的表示空间相互交织,导致标准定位回归损失难以驱动浅层与深层二值编码器保留任务充分的表征。
作者借助信息瓶颈(Information Bottleneck, IB)理论与知识量化分析发现,1-Bit 模型在浅层即出现严重的信息丢失,深层特征的信息保留量急剧衰减。本文的核心 idea 是:将 1-Bit 激光雷达定位重构为信息瓶颈约束下的最优化问题,利用离线预训练的全精度教师模型作为参考分布,引入包含软掩码通道蒸馏与位姿感知最优传输的训练期辅助目标,绕过任务头累积的 STE 梯度失配,在零推理开销前提下自适应补偿二值编码器的关键几何表征。
方法详解¶
整体框架¶
BiLoc 采用绝对位姿回归(APR)范式,整体处理流程包含点云投影、二值骨干特征提取、全二值化扩散位姿解码三个推理阶段,以及一个仅在训练期生效的离线全精度教师辅助监督分支。
输入首先将连续 3 帧原始激光雷达点云投影为保留几何和深度信息的范围图像(Range Image,尺寸为 \(32 \times 512\))。随后,范围图像输入 1-Bit 二值化视觉 Transformer 骨干网络(如基于 BHViT / ReActNet 架构的二值化 ViT-S/16)进行分块并提取全局紧凑表征。提取到的潜空间特征输入基于全二值化 PoseDiffusion 架构的解码器,经过多步迭代去噪最终回归出车辆的 6-DoF 全局位姿(包含平移向量 \(t\) 与四元数旋转 \(q\))。在训练阶段,预先训练好的离线全精度 DINO ViT-S/16 教师模型并行提取参考特征,通过辅助目标向二值编码器注入稳定的几何与结构监督信号;训练收敛后辅助分支被完全剥离,推断期仅保留纯 1-Bit 网络。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
In["连续 3 帧原始点云序列<br/>LiDAR Point Clouds"] --> Proj["球面投影为范围图像<br/>Range Image (32x512)"]
Proj --> Enc["1-Bit 骨干网络编码<br/>Binarized ViT-S/16 Backbone"]
Enc --> Dec["全二值扩散去噪解码<br/>Binarized PoseDiffusion"]
Dec --> Out["6-DoF 全局位姿预测<br/>Global Pose (t, q)"]
Teach["离线全精度 DINO 教师<br/>Offline Real-Valued Teacher"] -.->|提供参考分布 Z*| Aux
Enc -.->|潜特征 Z| Aux["辅助目标监督<br/>Auxiliary Objective"]
subgraph Aux ["辅助目标机制 (仅训练期)"]
direction TB
M1["软掩码通道特征蒸馏<br/>Mahalanobis Soft-Mask Distillation"]
M2["位姿感知结构流形对齐<br/>Sinkhorn Optimal Transport"]
end
Aux -.->|直接注入编码器梯度| Enc
关键设计¶
1. 软掩码通道特征蒸馏:自适应补偿通道级信息损失
针对 1-Bit 编码器中部分特征通道退化严重且信息量分布不均的痛点,BiLoc 并没有采用无差别的均方误差对齐,而是基于信息瓶颈互信息项 \(I(Z_{\text{diff}}, Z^*)\) 设计了动态通道重加权策略。为了避免耗时的在线知识点计算,作者计算真实全精度特征 \(Z_c^*\) 与二值特征 \(Z_c\) 在各通道上的马氏距离平方,并通过 Sigmoid 函数生成平滑的软掩码向量 \(\mathbf{m}\):
在实际工程实现中,为兼顾显存效率,所有通道共享一个可学习的方差标量。该软掩码自适应放大了全精度与二值特征差异显著的关键通道的蒸馏权重,蒸馏损失采用加权 \(L_1\) 范数计算:\(\mathcal{L}_{\text{rep}} = \|\mathbf{m} \odot Z - Z^*\|_1\)。这种显式加权引导 1-Bit 编码器优先重构丢失最严重的几何特征维度,同时抑制冗余维度的噪声。
2. 位姿感知结构流形对齐:跨样本最优传输关系迁移
针对单纯逐样本对齐忽略特征空间几何流形拓扑、以及同一局部区域临近轨迹位姿样本缺乏结构一致性的痛点,BiLoc 引入了条件互信息项 \(I(S(Z), S(Z^*) \mid \mathbf{p})\)。利用位姿作为先验侧信息(Side Information),放宽样本之间僵硬的一对一严格对齐,允许二值网络的样本表征不仅与对应的教师样本对齐,还与其位姿邻近的样本产生结构关联。作者将其建模为以 Sinkhorn 算法求解的离散最优传输(Optimal Transport)问题,并构建了融合余弦特征相似度与几何位姿误差的联合代价矩阵 \(C\):
其中位姿距离项结合了欧氏平移偏差与四元数最小旋转角:\(d_{\text{pose}}(Z_i^*, Z_j) = \|t_i - t_j\|_2 + 2 \arccos |q_i^\top q_j|\)。通过 Sinkhorn 算子求解满足边缘约束的最优传输方案 \(\pi\),定义结构损失 \(\mathcal{L}_{\text{struct}} = \langle \pi, C \rangle + \varepsilon \sum_{i,j} \pi_{ij} \log \pi_{ij}\),使二值潜空间在度量几何上保持连续、平滑的拓扑流形。
3. 绕过任务头的梯度旁路机制:缓解 STE 累积梯度失配
针对二值网络在反向传播中因符号函数导数近似(STE)产生的系统性累积梯度失配问题,作者在理论上分析了辅助梯度的稳定化作用。当仅使用位姿回归任务损失 \(\mathcal{L}_{\text{loc}}\) 时,反向传播必须穿过整个任务头,编码器权重 \(\theta_e\) 接收到的梯度包含严重的累积失配量 \(\upsilon\)(即 \(\frac{\partial \mathcal{L}_{\text{loc}}}{\partial y_c}(G + \upsilon)\))。BiLoc 将两个辅助损失 \(\mathcal{L}_{\text{rep}}\) 和 \(\mathcal{L}_{\text{struct}}\) 直接定义在编码器输出的潜表征 \(Z\) 上,分别产生直接作用于编码器的辅助梯度 \(\Phi_{\text{rep}} = \frac{\partial Z}{\partial \theta_e} \frac{\partial \mathcal{L}_{\text{rep}}}{\partial Z}\) 与 \(\Phi_{\text{struct}} = \frac{\partial Z}{\partial \theta_e} \frac{\partial \mathcal{L}_{\text{struct}}}{\partial Z}\)。论文从向量内积不等式证明,当辅助监督信号与任务基准梯度正交或同向(\(\langle G, \lambda_1 \Phi_{\text{rep}} + \lambda_2 \Phi_{\text{struct}} \rangle \ge 0\))时,相对梯度失配代理指标 \(K_{\text{BiLoc}} = \|\upsilon\| / \|G + \lambda_1 \Phi_{\text{rep}} + \lambda_2 \Phi_{\text{struct}}\|\) 严格小于基线失配指标 \(K_{\text{base}}\),从优化动力学上保证了 1-Bit 骨干网络的高效稳定收敛。
损失函数 / 训练策略¶
BiLoc 的联合优化目标函数由主任务位姿回归损失和两项训练期辅助损失构成:
模型基于 PyTorch 实现,在单张 NVIDIA RTX 5090 GPU 上使用 AdamW 优化器训练 200 个 epoch,初始学习率为 \(1\times 10^{-3}\) 并配合余弦退火策略。离线教师网络固定为在对应数据集上自监督预训练的 DINO ViT-S/16。两项辅助损失的超参数分别设置为 \(\lambda_1 = 0.80\) 和 \(\lambda_2 = 0.05\)。至关重要的是,为了防止后期辅助目标对最终位姿微调产生过度约束,辅助目标对骨干网络的梯度回传在第 80 个 epoch 后完全停止,使模型在最后阶段专注于任务位姿的精确收敛。
实验关键数据¶
主实验¶
实验在 Oxford Radar RobotCar(城市开放道路,4 条训练序列 / 4 条测试序列)和 NCLT(密歇根大学北校区,包含长时季节变化与障碍物施工)两个大型室外实测基准上进行,全面对比了 32-Bit 全精度模型与多种主流 1-Bit 二值化架构(均集成至 DiffLoc 框架下)。
表 1:Oxford 自动驾驶数据集位姿回归误差与模型复杂度对比(节选自原论文 Table 1 & Table 2)
| 模型方案 | 精度 (Bits) | 参数量 (M) | 计算量 OPs (G) | 平均位置误差 (m) | 平均旋转误差 (°) |
|---|---|---|---|---|---|
| PointLoc | 32 | 3.29 | 10.13 | 12.45 | 2.17 |
| STCLoc | 32 | 9.31 | 1.59 | 7.01 | 1.28 |
| HypLiLoc | 32 | 52.31 | 4.89 | 5.74 | 1.05 |
| DiffLoc (Real-valued) | 32 | 39.96 | 77.06 | 3.53 | 0.72 |
| DiffLoc + ReActNet | 1 | 2.89 | 0.38 | 15.16 | 3.91 |
| DiffLoc + BinaryViT | 1 | 2.83 | 0.14 | 8.87 | 2.57 |
| DiffLoc + BHViT | 1 | 3.01 | 0.17 | 8.41 | 2.15 |
| DiffLoc + BiLoc (Ours) | 1 | 3.01 | 0.17 | 7.56 | 1.91 |
表 2:NCLT 跨季节激光雷达数据集长时定位对比(节选自原论文 Table 3)
| 模型方案 | 精度 (Bits) | 2012-02-12 (m/°) | 2012-02-19 (m/°) | 2012-03-31 (m/°) | 2012-05-26 (m/°) | 全局平均 (m/°) |
|---|---|---|---|---|---|---|
| PointLoc | 32 | 7.23 / 4.88 | 6.31 / 3.89 | 6.71 / 4.32 | 10.02 / 5.32 | 7.57 / 4.60 |
| PosePN++ | 32 | 4.97 / 3.75 | 3.68 / 2.65 | 4.35 / 3.38 | 9.59 / 4.49 | 5.65 / 3.57 |
| HypLiLoc | 32 | 1.71 / 3.56 | 1.68 / 2.69 | 1.52 / 2.90 | 2.90 / 3.47 | 1.95 / 3.16 |
| DiffLoc (Real-valued) | 32 | 0.99 / 2.40 | 0.92 / 2.14 | 0.98 / 2.27 | 1.88 / 2.43 | 1.19 / 2.31 |
| DiffLoc + ReActNet | 1 | 5.76 / 6.78 | 5.05 / 6.07 | 4.91 / 6.45 | 10.72 / 7.16 | 6.61 / 6.62 |
| DiffLoc + BinaryViT | 1 | 3.68 / 5.89 | 3.43 / 4.92 | 3.44 / 5.29 | 8.21 / 5.80 | 4.69 / 5.48 |
| DiffLoc + BHViT | 1 | 2.69 / 4.81 | 2.28 / 3.90 | 2.39 / 4.28 | 6.86 / 4.88 | 3.56 / 4.47 |
| DiffLoc + BiLoc (Ours) | 1 | 2.15 / 4.71 | 1.95 / 3.73 | 1.94 / 4.15 | 6.52 / 4.87 | 3.14 / 4.36 |
消融实验与超参分析¶
在 Oxford 数据集测试子集 18-14-14-42 上对特征蒸馏强度 \(\lambda_1\) 与结构流形对齐强度 \(\lambda_2\) 进行了系统网格搜索(原论文 Figure 6)。同时,原论文 Table 4 评估了在实际 RTX 5090 显卡上的实测推断延迟(输入图像尺寸 \(32 \times 512\))。
表 3:辅助损失权重网格搜索消融(位置误差,单位:米,整理自原论文 Figure 6)
| \(\lambda_2\) \ \(\lambda_1\) | 0.00 | 0.40 | 0.80 | 1.20 | 说明 |
|---|---|---|---|---|---|
| 0.00 | 5.86 | 5.41 | 5.27 | 5.40 | 无结构对齐,单纯增大通道蒸馏先升后降 |
| 0.05 | 5.54 | 5.18 | 4.89 | 5.12 | 最优组合 (\(\lambda_1=0.80, \lambda_2=0.05\)) |
| 0.10 | 5.65 | 5.26 | 5.03 | 5.21 | 结构对齐约束过强,轻微限制表征灵活性 |
表 4:车载推理延迟与硬件开销实测对比(引自原论文 Table 4)
| 模型实现方案 | 精度 (Bits) | 参数量 (M) | 计算量 (G-OPs) | 实测推断延迟 (ms) | 相对全精度加速比 |
|---|---|---|---|---|---|
| Real-valued DiffLoc (cuDNN) | 32 | 39.96 | 77.06 | 30.72 | 1.00× (基准) |
| 1-Bit DiffLoc + BHViT (TC-BNN) | 1 | 3.01 | 0.17 | 14.83 | 2.07× |
| 1-Bit DiffLoc + Ours (TC-BNN) | 1 | 3.01 | 0.17 | 14.83 | 2.07× (零推理代价) |
关键发现¶
- 无额外开销的前提下性能大幅领先:在 Oxford 上,BiLoc 将当前最强二值 baseline(BHViT)的平均位置误差从 8.41m 降低至 7.56m(相对提升 10.11%),平均旋转误差从 2.15° 降至 1.91°(相对提升 11.16%)。在更苛刻的长时跨季节 NCLT 数据集上,平均误差同样降低 0.42m / 0.11°。
- 软掩码与最优传输的协同增益:消融实验显示,基线(\(\lambda_1=0, \lambda_2=0\))误差为 5.86m;仅加入通道蒸馏(\(\lambda_1=0.8, \lambda_2=0\))降至 5.27m;进一步引入几何最优传输流形对齐后达到最优值 4.89m,充分证明了二者在微观通道与宏观拓扑层面的互补性。
- 训练期早停策略防止过度拟合:在第 80 个 epoch 停止辅助目标梯度更新至关重要,使二值网络在掌握强几何语义后,能够无偏地拟合最终回归头的极细微位姿位移。
亮点与洞察¶
- 理论与架构的优雅闭环:巧妙地将信息瓶颈(IB)理论映射到 1-Bit 神经网络的训练动力学中,指出 1-Bit 定位困难不仅是容量限制,更是反向传播时 STE 梯度失配导致的优化困难,并给出了严格的梯度范数理论证明。
- 位姿几何先验融入最优传输:在特征结构蒸馏时,并没有机械复制通用的特征相似度矩阵,而是把六自由度位姿间的欧氏平移与四元数旋转作为物理侧信息嵌入代价矩阵中,使特征拓扑具有直接的物理空间意义。
- 真正的“免费午餐”(Zero Inference Overhead):所有软掩码计算、最优传输求解与全精度教师网络仅存在于反向传播图的前 80 个 epoch 中,推断期不增加哪怕一个参数或一次算术指令,极具工业边缘计算落地价值。
局限与展望¶
- 依赖两阶段教师与离线预训练:该方法必须先在目标数据集上预训练高质量全精度 DINO 教师模型,增加了整体研发管线的前期准备时间与算力投入。
- 硬件底层加速潜力尚未完全释放:受限于当前通用 GPU 软件生态(如 TC-BNN 仅支持有限算子),实测延迟降低 2.07 倍(14.83ms vs 30.72ms),相较于理论 58 倍位运算加速仍有显著差距,有待专用 ASIC 或 FPGA 二值计算核心进一步挖掘。
- 极端动态与退化场景鲁棒性:在 NCLT 施工剧烈变化的 2012-05-26 序列上,1-Bit 模型的定位误差依然达 6.52m,表明在环境剧烈变迁且缺少纹理特征时,二值特征的泛化鲁棒性仍弱于 32-Bit 全精度网络。
相关工作与启发¶
- vs DiffLoc [CVPR 2024]: DiffLoc 奠定了基于去噪扩散模型的激光雷达全局位姿回归 SOTA,但依赖 39.96M 的庞大参数和高达 77.06 G-OPs 的计算代价。BiLoc 成功将其核心骨干网络与去噪头全面二值化至 1-Bit,将计算量骤降 450 多倍(0.17 G-OPs)。
- vs ReActNet / BinaryViT / BHViT [CVPR 2020 / 2023 / 2025]: 传统 BNN 经典方法大多针对语义分类任务设计,在面对具有连续高精度几何要求的回归任务时存在严重欠拟合。BiLoc 首次通过跨样本位姿引导的结构蒸馏克服了这一迁移障碍。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ (首次探索 1-Bit 激光雷达 6-DoF 定位网络,从信息瓶颈与梯度失配理论推导辅助目标设计)
- 实验充分度: ⭐⭐⭐⭐⭐ (在 Oxford 与 NCLT 双大型基准上对比了多种 SOTA 二值架构,含详实的网格搜索与 RTX 5090 实测延迟)
- 写作质量: ⭐⭐⭐⭐⭐ (数学建模清晰严密,理论证明完整自洽,图表信息表达极佳)
- 价值: ⭐⭐⭐⭐☆ (对计算与功耗极度受限的车载边缘芯片与低空无人机常驻定位系统具有重大的实际工程落地指导意义)