Towards Practical Lossless Neural Compression for LiDAR Point Clouds¶
会议: ECCV 2026
论文: ECCV 2026
代码: https://github.com/pengpeng-yu/FastPCC
领域: 自动驾驶
关键词: 激光雷达点云压缩, 无损神经压缩, 几何重致密化, 跨尺度特征传播, 全整数推理
一句话总结¶
针对自动驾驶高精度激光雷达点云压缩中的高分辨率上下文稀疏难题与跨平台浮点失步导致的熵编码崩溃,本文提出融合几何重致密化与跨尺度特征传播的轻量八叉树预测框架,并构建了首个端到端混合精度全整数推理流水线,在完全保障跨平台确定性解码的前提下达到 14 FPS 实时无损压缩。
研究背景与动机¶
随着自动驾驶与三维高精建图技术的爆发式演进,海量车载激光雷达点云数据急剧膨胀,亟需兼具高率失真性能与极低延迟的实用化无损压缩算法。当前主流的神经点云压缩(PCC)方法普遍基于体素或八叉树层级结构,通过自回归条件概率模型预测各几何节点的占用状态。然而,这类方法在高分辨率压缩场景下面临着严重的「高分辨率上下文稀疏(High-Resolution Contextual Sparsity, HRCS)」瓶颈:随着量化精细度提高(八叉树层级加深),局部三维空间急剧稀疏化,统计表明在 KITTI 深层八叉树中,单个节点在 \(3\times3\times3\) 邻域内的占用邻居数量呈非线性骤降,甚至跌至 1 以下。这种邻域几何上下文的极度匮乏,使得传统局域网络难以准确估计占用概率分布,直接限制了压缩率的提升。
更为严峻的工业落地障碍在于跨平台确定性解码问题。神经压缩严重依赖算术编码或非对称数字系统(ANS)等熵编码技术,这类算法对先验概率预测的数值精度具有极端敏感性。然而,现代异构硬件(如 NVIDIA 不同架构 GPU、边缘加速卡与 CPU)以及软件栈在浮点运算实现上存在不可避免的非确定性与舍入微小偏差;实验表明,在 RTX 4090 上编码的点云比特流在 RTX 5880 上解码时,仅微弱的浮点误差就会引发熵解码雪崩式崩溃,导致重建点云退化为全空间均匀噪声。现有图像/视频压缩的整型化方案无法直接适配点云稀疏卷积与动态数据流,导致神经网络点云编解码器长期难以走出实验室环境。
本文的切入角度是:解耦几何稀疏性与表征密度,在浅层稠密空间提取丰富几何上下文后再向深层稀疏空间映射,同时构建消除所有浮点运算的确定性整型计算通路。核心 idea:通过几何重致密化(GRED)逆向提取浅层稠密几何特征并沿八叉树重稀疏化,结合浅深分区的跨尺度特征传播(XFP)消除多尺度冗余提取,并研发首个覆盖稀疏卷积与定点查表 Softmax 的端到端混合精度全整数推理流水线,实现兼顾高压缩比、14 FPS 实时性与比特级跨平台一致性的实用无损点云编解码器。
方法详解¶
整体框架¶
本文提出的实时无损激光雷达点云压缩框架围绕八叉树展开逐层自回归预测编码。给定最大深度为 \(L\) 的八叉树 \(\mathbf{X} = \{\mathbf{X}^1, \dots, \mathbf{X}^L\}\),算法按层逐步预测节点占用码 \(\mathbf{X}^l \in \{1, \dots, 255\}^{N_l}\) 的条件概率分布。整个流程主要包含四个阶段:八叉树构建、先验特征构建、跨尺度特征传播(XFP,内嵌 GRED 机制)以及全整数熵编码。输入点云经过体素划分后生成八叉树,当预测第 \(l\) 层时,利用先前已编码层级的几何先验信息,根据层级深度阈值 \(t\) 自动切换浅层传播或深层重致密化传播机制,最终经由定点化预测器输出 255 类概率分布,驱动无损熵编码引擎生成二进制码流。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入激光雷达点云"] --> B["八叉树构建与层级划分"]
B --> C{"当前层级判定<br/>l ≤ t ?"}
C -->|是:浅层稠密| D["浅层特征传播<br/>直接下级特征传递与拼接"]
C -->|否:深层稀疏| E["深层特征传播与几何重致密化<br/>回溯稠密尺度降采样与重稀疏化"]
D --> F["全整数推理流水线<br/>INT8 稀疏卷积与定点运算"]
E --> F
F --> G["定点查找表 Softmax<br/>生成比特级一致概率分布"]
G --> H["跨平台确定性熵编解码与码流输出"]
关键设计¶
1. 几何重致密化模块:逆向追溯浅层稠密尺度以突破高分辨率上下文稀疏 针对高八叉树层级下因点云极度稀疏导致的 HRCS 现象,传统方法直接在高分辨率稀疏空间盲目扩大感受野,既带来了巨大的显存与算力开销,又因有效邻居匮乏而收益微弱。GRED 采取反向思路:当需要在高稀疏层级 \(l\) 预测占用状态时,放弃直接建模超稀疏邻域,而是将上一层已编码的占用特征 \(\mathbf{X}^{l-1}\) 逆向降采样到预设的稠密八叉树尺度 \(k\)(\(k < l\)),得到重致密化特征图 \(\mathbf{G}^k\): $$ \mathbf{G}^k = \mathrm{Downsampling}(\mathbf{X}^{l-1}) $$ 在该稠密尺度下,利用残差块(ResBlock)轻巧提取结构连贯的局部空间表征 \(\mathbf{F}^k = \mathrm{ResBlock}(\mathbf{G}^k)\)。随后,为了避免在稠密空间直接预测所有潜在子节点引发的维度爆炸,GRED 采用逐步上采样与占用驱动的剪枝操作,递归地将稠密特征投影回当前稀疏空间: $$ \mathbf{F}^{m+1} = \mathrm{Pruning}(\mathrm{Upsampling}(\mathbf{F}^m), \mathbf{X}^m), \quad m = k, \dots, l-1 $$ 其中上采样为线性变换加 PReLU 激活(通道扩张 8 倍),剪枝操作依据已编码占用码 \(\mathbf{X}^m\) 及时剔除未占用子节点。该模块使网络在极低计算代价下获得了稠密几何的语义先验,化解了深层特征提取无据可依的困境。
2. 跨尺度特征传播模块:浅深双模态协同与跨层级特征无损复用 虽然 GRED 解决了单层的 HRCS 问题,但若每层均独立重致密化,仍会忽视八叉树跨尺度之间强烈的结构相关性,导致特征提取重复冗余。XFP 将 GRED 升华为全局跨尺度传播网络,根据几何密度拐点设定阈值 \(t\),划分双传播模态:在浅层阶段(\(l \le t\)),点云几何天然稠密,XFP 省略计算密集的逆向重致密化,直接将 \(l-1\) 层的特征 \(\mathbf{F}^{l-1}\) 经由残差块提取得到 \(\mathbf{S}^{l-1} = \mathrm{ResBlock}(\mathbf{F}^{l-1})\),并与当前占用码拼接后单步重稀疏化投影至 \(l\) 层;在深层阶段(\(l > t\)),稀疏性显著恶化,XFP 触发深层传播通路,将尺度 \(k\) 处的重致密化特征 \(\mathbf{G}^k\) 与该尺度原有的多尺度历史特征 \(\mathbf{F}^k\) 进行通道拼接,送入残差块融合: $$ \mathbf{H}^k = \mathrm{ResBlock}(\mathrm{Concat}(\mathbf{F}^k, \mathbf{G}^k)) $$ 随后的递归上采样与剪枝过程均以融合特征 \(\mathbf{H}^k\) 为起点展开。这一分层混合传播策略既保证了浅层计算的极简与低延迟,又使深层特征能够最大化复用跨层级上下文,显著提升了熵模型的概率估计精准度。
3. 全整数端到端推理流水线:混合精度定点化解决异构设备熵编码崩溃 为彻底根除异构硬件浮点计算非确定性导致的熵解码失败,本文设计了神经点云压缩领域首个全整数端到端推理流水线。系统采用混合精度策略,将计算密集型的线性层与稀疏卷积完全量化至 8 位整型(INT8),而对数值极度敏感的重缩放与非线性激活采用 32 位定点算术(Fixed-Point INT32)保障稳定性。对于权重进行对称量化(零点 \(z_w = 0\)),INT32 累加输出通过预计算的整数乘数 \(m\) 与固定右移位数 \(r\) 重新量化为 INT8: $$ \mathbf{q}y = \mathrm{clip}\left(\left\lfloor \mathbf{y}\right) $$ 针对空间稀疏卷积算子,算法将其严谨分解为确定性坐标哈希映射与带索引的整型线性变换组合,消除底层稀疏库执行顺序不确定带来的微小差异。此外,针对预测器末端极易引起跨平台分歧的 255 类 Softmax 运算,本文完全摒弃浮点指数与除法,引入基于对称区间 }} \cdot m 2^{-r} \right\rceil + z_y, \; q_{\min}, \; q_{\max\([-12, 0]\)、步长 \(1/512\) 的 16 位定点指数预计算查找表(LUT): $$ p_i = \frac{\exp(\ell_i - \max_k \ell_k)}{\sum_j \exp(\ell_j - \max_k \ell_k)} $$ 所有减法、查表、求和与归一化均在 INT32 域严格执行,输出确定性的高精度定点概率分布,使得编码器与解码器在跨平台互测中实现完全相同的逐比特(Bit-Exact)概率复现,消除了熵编码发散。
损失函数 / 训练策略¶
模型采用多分类交叉熵损失监督 255 类 8 位占用码分布的预测。设真实条件分布为 \(P(\mathbf{X})\),网络预测分布为 \(Q(\mathbf{X})\),整体训练目标为最小化负对数似然: $$ \mathcal{L} = \mathbb{E}{P(\mathbf{X})} \left[ -\sum) \right] $$ 在训练完成后,利用轻量校准集收集线性与稀疏卷积激活值的动态范围统计量,完成定点量化参数校准;Softmax 查找表等所有后续模块均基于纯数学定点映射,无需额外微调,保证了部署的高效性。}^L \log Q(\mathbf{X}^l \mid \mathbf{X}^{1:l-1
实验关键数据¶
主实验¶
实验基于主流车载雷达基准 KITTI(20,351 帧测试集)和 Ford(3,000 帧测试集)展开,涵盖 11 至 16 位的几何量化精度。基线涵盖传统工业标准 G-PCC(八叉树模式)、经典注意力神经压缩模型 OctAttention、最先进分层 Transformer 模型 Light EHEM、通用多尺度体素模型 Unicorn 以及实时神经压缩前沿工作 RENO。
| 对比模型 | 架构类型 | KITTI BD-Rate (D1/D2) % | KITTI BD-PSNR (D1/D2) dB | Ford BD-Rate (D1/D2) % | Ford BD-PSNR (D1/D2) dB |
|---|---|---|---|---|---|
| OctAttention (AAAI'22) | Octree Transformer | -7.294 / -7.332 | +0.754 / +0.760 | -6.205 / -6.193 | +0.969 / +0.969 |
| Light EHEM (CVPR'23) | Octree Transformer | +1.429 / +1.422 | -0.152 / -0.152 | +11.535 / +11.987 | -1.899 / -1.960 |
| Unicorn (TPAMI'25) | Voxel Sparse Conv | -10.862 / -10.889 | +1.367 / +1.373 | +3.922 / +3.989 | -0.622 / -0.637 |
| RENO (CVPR'25) | Real-time Neural | -15.582 / -15.579 | +1.887 / +1.890 | -11.049 / -11.040 | +1.938 / +1.938 |
| G-PCC octree (MPEG) | Traditional Codec | -21.931 / -21.954 | +2.532 / +2.541 | -19.150 / -19.143 | +3.411 / +3.412 |
| Ours (Float) | Octree GRED+XFP | 基准 | 基准 | 基准 | 基准 |
| Ours (Integer) vs RENO | Integer Pipeline | -14.289 / -14.285 | +1.728 / +1.730 | -6.875 / -6.864 | +1.185 / +1.185 |
| Ours (Integer) vs G-PCC | Integer Pipeline | -20.705 / -20.728 | +2.378 / +2.387 | -15.355 / -15.348 | +2.694 / +2.694 |
在编码速度与跨硬件推理测试中,全整数流水线表现出卓越的硬件亲和性与吞吐量:
| 算法模型 | 运行硬件平台 | KITTI 编码时间 (s) | KITTI 解码时间 (s) | Ford 编码时间 (s) | Ford 解码时间 (s) | 跨平台解码一致性 |
|---|---|---|---|---|---|---|
| G-PCC octree | AMD EPYC 7R32 (CPU) | 0.149 | 0.103 | 0.150 | 0.107 | 完全一致 (传统算子) |
| RENO | NVIDIA RTX 4090 | 0.059 | 0.056 | 0.072 | 0.057 | 浮点失步 (崩溃) |
| Ours (Float) | NVIDIA RTX 4090 | 0.075 | 0.081 | 0.093 | 0.103 | 跨 GPU 浮点崩溃 |
| Ours (Integer) | NVIDIA RTX 4090 | 0.060 | 0.070 | 0.067 | 0.082 | 完全比特一致 (通过) |
| Ours (Integer) | NVIDIA RTX 5880 | 0.047 | 0.056 | 0.054 | 0.067 | 完全比特一致 (通过) |
| Ours (Integer) | NVIDIA Tesla V100 | 0.166 | 0.175 | 0.187 | 0.199 | 完全比特一致 (通过) |
消融实验¶
在 KITTI 数据集上对几何重致密化模块(GRED)与跨尺度特征传播模块(XFP)进行逐级剥离验证,量化其率失真增益贡献:
| 实验配置方案 | 相对 Baseline BD-Rate (D1/D2) % | 相对 Baseline BD-PSNR (D1/D2) dB | 相对 G-PCC BD-Rate (D1/D2) % | 相对 G-PCC BD-PSNR (D1/D2) dB | 说明 |
|---|---|---|---|---|---|
| Baseline | 0.00 / 0.00 | 0.00 / 0.00 | -10.04 / -10.08 | +1.13 / +1.14 | 无重致密化与跨尺度复用 |
| + GRED | -3.78 / -3.78 | +0.40 / +0.40 | -13.44 / -13.47 | +1.49 / +1.50 | 引入稠密尺度回溯重致密化 |
| + GRED + XFP (Full) | -13.22 / -13.21 | +1.46 / +1.46 | -21.93 / -21.95 | +2.53 / +2.54 | 完整模型:双模态跨尺度传播 |
关键发现¶
- XFP 模块贡献最为显著:消融数据显示,在 GRED 基础上叠加 XFP 带来了高达 1.06 dB 的 BD-PSNR 跃升(BD-Rate 相对基线优化扩阔 9.44%),证明自上而下的跨层级先验复用极大削减了各层级孤立提取的特征盲区与冗余。
- GRED 专门根治深层精度骤降:在高精度率失真曲线(14-16 位)上,未配备 GRED 的 Baseline 曲线发生明显倾斜退化;引入 GRED 后成功遏制了 HRCS 带来的性能骤跌,带来 0.40 dB 的净增益。
- 整数定点化几乎无损精度但大幅加速:对比整型模型与浮点模型,KITTI 上 BD-PSNR 仅微微波动 0.16 dB,但在 RTX 4090 上编码耗时从 0.075s 压减到 0.060s,且在 12 位精细度下完整编解码达 14 FPS,实现了精度与速度的双赢。
亮点与洞察¶
- 逆向致密再稀疏投影的计算哲学:面对高分辨率点云超稀疏导致算力空转与特征匮乏的矛盾,本文没有选择昂贵的大窗口注意力,而是巧用「下采样致密卷积 \(\to\) 占用掩码剪枝上采样」的闭环,在轻量化前提下重塑深层局部空间上下文。
- 神经网络无损点云压缩真正迈过工业部署鸿沟:通过整型稀疏卷积分解与定点查表 Softmax,本文率先攻破了神经点云压缩在跨设备时熵编码必定崩溃的工程痛点,无需传输任何额外校准信息即可保证跨 GPU / CPU 的逐比特一致性。
- 浅深分界的跨尺度信息路由:依据八叉树几何密度变化自然拐点划分 \(l \le t\) 与 \(l > t\),浅层走极简单步复用,深层走全流程重致密融合,避免了一刀切网络结构造成的浅层算力浪费。
局限与展望¶
- 作者承认的局限:在训练样本受限的数据集(如仅含 1,500 帧训练集的 Ford 数据集)上,模型跨域泛化性能受到一定制约,相比庞大的基线模型(如参数量巨大的 Light EHEM)略显劣势。
- 本文发现的局限:全整数流水线目前主要针对同类型 GPU 体系进行了详尽测试,在端侧极低算力 NPU 或不同位宽定点 DSP 上的量化自适应性尚待进一步扩展。
- 未来改进思路:探索时序帧间运动补偿与跨帧几何重致密化联合机制,将单帧静态八叉树压缩扩展为支持车载 LiDAR 连续点云流的动态流式整型编码框架。
相关工作与启发¶
- vs OctAttention [AAAI'22] & Light EHEM [CVPR'23]:两者均采用大型 Transformer 及其注意力变体建模八叉树上下文,虽有强大拟合能力但解码延迟极高(Light EHEM 官方代码未开源且难以实时运行);本文通过纯卷积级 GRED 与 XFP 达到匹敌的率失真表现,速度提升至 14 FPS,且支持确定性整型部署。
- vs RENO [CVPR'25]:RENO 侧重于高效采样策略以降低延迟,但在高分辨率下的率失真表现较弱;本文整型模型在同等实时延迟量级下,在 KITTI 上相比 RENO 取得了 1.73 dB 的显著 PSNR 增益。
- vs G-PCC octree [MPEG]:传统手工特征八叉树编码虽然具有天然的跨平台确定性,但率失真性能全面落后于深度模型;本文整型模型在保持完全跨平台一致性的同时,相比 G-PCC 实现了超过 20.7% 的码率节省。
评分¶
- 新颖性: ⭐⭐⭐⭐ [针对 HRCS 提出几何重致密化与跨尺度传播机制,并首次构建点云无损全整数推理管线]
- 实验充分度: ⭐⭐⭐⭐⭐ [详尽评测 KITTI/Ford、全套 BD 指标、消融严谨、多 GPU 跨平台一致性实测]
- 写作质量: ⭐⭐⭐⭐⭐ [逻辑层层递进,从物理稀疏机理分析到模块推导、定点公式严谨清晰]
- 价值: ⭐⭐⭐⭐⭐ [攻克了神经无损点云编码走向车载自动驾驶跨平台实机部署的绝对关键瓶颈]