SHReg: Strictly Rotation-Equivariant Point Cloud Registration via Spherical Harmonics¶
会议: ECCV 2026
论文: ECCV 2026
领域: 3D视觉
关键词: 点云配准, 旋转等变性, 球谐函数, 不可约表示, 闭式位姿估计
一句话总结¶
针对传统点云配准依赖数据增强或脆弱局部参考系导致的旋转泛化差问题,SHReg 基于 SO(3) 群表示理论与球谐函数构建了严格旋转等变卷积骨干,不仅解耦读出严格旋转不变的判别性几何描述子,还利用等变高阶张量在单个对应点上闭式求解刚体变换假说,在 3DMatch、3DLoMatch 与 KITTI 上全面超越现有 SOTA。
研究背景与动机¶
点云配准是 3D 视觉与机器人定位的核心基础任务,其目标是估计刚体变换以对齐两片局部重叠的点云。点云通常具有任意的三维姿态与初始朝向,而提取的几何特征却必须对任意刚体旋转保持不变,这一长期存在的结构矛盾使得旋转鲁棒的局部特征学习成为配准管线的关键瓶颈。以往基于局部小块(patch-wise)的方法尝试利用距离、角度等手工设计的旋转不变几何统计量(如 PPF),或通过局部邻域估计局部参考坐标系(LRF)来规范化姿态。然而,手工不变统计量极易平滑掉高阶判别性几何细节,而 LRF 依赖法向量或主曲率,在点云低重叠、局部遮挡或噪声扰动下极易发生坐标轴反转和抖动,导致特征提取完全失效。
随着点云表征网络的发展,全场景(scene-wise)密集特征提取器(如基于 KPConv 或 FCGF 的网络架构)因计算效率高、上下文建模能力强而成为主流,但这些骨干网络天然对旋转极其敏感。现有方法普遍退而求其次,在训练期间依靠大范围随机旋转数据增强来迫使网络“强行记忆”旋转不变性。这种经验式方案存在严重的内在缺陷:连续的 SO(3) 空间根本无法被有限的离散增强充分覆盖,模型在面对未见过的旋转角度时性能骤降;同时,网络把大量参数容量浪费在抵消姿态变化上,削弱了网络捕获细粒度几何判别结构的能力。
面对这一两难困境,本文打破了“数据增强经验逼近”与“脆弱参考系投影”的传统思路,转向从群论代数结构本身寻求根本解法。既然三维旋转由李群 SO(3) 严格支配,网络中间层特征就应当在代数结构上直接服从 SO(3) 的等变变换规律,既严格保全局部结构的绝对方向线索,又能自然导出保真的旋转不变表征。核心 idea:将点云局部几何严格编码为 SO(3) 群的不可约表示,利用球谐张量积卷积实现严格旋转等变特征提取,并在解耦读出严格旋转不变描述子进行粗到细匹配的同时,利用高阶等变张量直接在单对对应点上闭式求解刚体变换假说。
方法详解¶
整体框架¶
SHReg 接收两片待配准的点云 \(P\) 和 \(Q\),整体流程由双支解耦的等变-不变计算管线构成:首先,严格 SO(3) 等变球谐骨干网络逐层提取多分辨率局部特征,所有特征通道严格组织为 SO(3) 的不可约表示(irreps);随后,网络沿不变路径利用范数投影导出严格旋转不变描述子,送入几何 Transformer 执行由粗到细的超点(superpoint)与稠密点对应关系匹配;最后,网络沿等变路径提取匹配点对的高阶等变张量特征,构造局部标准正交标架并在单个对应点上直接闭式恢复刚体变换假说,经全局一致性校验选出最优对齐姿态。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
P["输入点云 P 与 Q"] --> A["球谐不可约表示张量积卷积<br/>严格 SO(3) 等变特征提取"]
A --> B["严格旋转不变描述子读取<br/>不可约分量范数投影"]
A --> D["单对应点闭式位姿提议<br/>ℓ=1,2 高阶等变张量定标架"]
B --> C["粗到细几何对应匹配<br/>超点与密集点软分配"]
C --> E["全局一致性验证与位姿选择<br/>最大化内点闭式最优变换"]
D --> E
E --> F["最终刚体变换对齐结果 (R*, t*)"]
关键设计¶
1. 球谐不可约表示张量积卷积:从代数结构上保证严格旋转等变性 针对现有场景级卷积网络天然缺乏旋转对称性、过度依赖离散数据增强的痛点,SHReg 将点云局部几何嵌入到 SO(3) 群的不可约表示(irreps)空间中。对于每个点 \(p_i\),其特征分解为不同阶数不可约表示块的直和: $\(F_i = \bigoplus_{\ell=0}^{\ell_{\max}} F_i^{(\ell)},\qquad F_i^{(\ell)}\in\mathbb{R}^{C_\ell\times(2\ell+1)}\)$ 其中 \(\ell=0\) 对应标量通道,\(\ell>0\) 对应高阶几何张量,每个块在任意刚体旋转 \(R \in \mathrm{SO}(3)\) 下满足 \(F_i^{(\ell)}(R \circ P) = F_i^{(\ell)}(P) D^{(\ell)}(R)^\top\),其中 \(D^{(\ell)}(R)\) 为 \(\ell\) 阶 Wigner-D 矩阵。在卷积传递时,边缘位移向量 \(r_{ij} = p_j - p_i\) 的单位方向 \(\hat{r}_{ij}\) 映射为球谐基函数 \(Y^{(\ell_e)}(\hat{r}_{ij})\),欧氏距离 \(r = \|r_{ij}\|\) 则通过 RBF 核并由轻量级多层感知机计算径向权重 \(a^{(\ell_e)}(r)\)。特征卷积通过两类 irrep 特征与球谐核的张量积,并经过 Clebsch-Gordan (CG) 系数投影到合法的输出 irrep 空间: $\(M_{ij}^{(\ell_o)} = \sum_{\ell_i, \ell_e} C_{\ell_i, \ell_e \to \ell_o} \Big[ F_j^{(\ell_i)} \otimes \big( a^{(\ell_e)}(r_{ij}) Y^{(\ell_e)}(\hat{r}_{ij}) \big) \Big]\)$ 其中输出阶数满足三角不等式 \(|\ell_i - \ell_e| \le \ell_o \le \ell_i + \ell_e\)。聚合邻域消息后,网络利用严格不变的 \(\ell=0\) 标量激活值构造门控非线性来调制高阶通道。整套网络从卷积核、张量积投影到激活函数均在数学上与三维刚体旋转代数可交换,彻底摆脱了局部坐标系与离散旋转采样的近似误差。
2. 严格旋转不变描述子读取:保全高阶几何判别力与旋转不变性 点云配准需要在不同姿态下计算特征距离以建立对应关系,若直接使用等变特征,不同旋转下的对应点特征向量差异极大,无法直接进行内积匹配;若采用传统手工几何投影,又会损失几何判别细节。由于 Wigner-D 矩阵在实数空间下是标准正交矩阵(\(D^{(\ell)}(R)^\top D^{(\ell)}(R) = I\)),同一不可约表示块内的 \(2\ell+1\) 维向量在旋转作用下的 \(\ell_2\) 范数具有天然的旋转不变性。SHReg 在不可约表示的通道内部,对每一阶张量计算正交范数收缩: $\(X_{i,c}^{(\ell)} = \sqrt{\sum_{m=-\ell}^{\ell} \big| F_{i,c}^{(\ell,m)} \big|^2}\)$ 将所有阶数 \(\ell \in [0, \ell_{\max}]\) 的不变标量特征沿通道拼接得到点描述子 \(d_i = \mathrm{Concat}(\{X_i^{(\ell)}\}_{\ell=0}^{\ell_{\max}})\)。这种读出方式将高阶张量中蕴含的曲率、高阶几何流形变率完整浓缩为严格不变标量,输入到包含自注意力和交叉注意力的 Geometric Transformer 中,并结合可匹配性头与显著性头执行由粗到细的超点与局部稠密点双向匹配,使得对应点特征在面对未见过的任意全范围三维旋转时表现出完美的数值稳定性。
3. 基于等变张量的单对应点闭式位姿提议:将假设采样从三次缩减至线性复杂度 传统配准流水线(如 RANSAC 或 LGR)在建立对应点集合后,必须随机采样至少 3 对非共线对应点才能通过 SVD 求解一个刚体变换假说。这种三元组采样导致假设搜索空间达到立方级 \(\mathcal{O}(N^3)\),在低重叠度或低内点率(inlier ratio)场景下需要数十万次迭代才能命中有效解。SHReg 发现,等变特征虽然不直接用于匹配,但其高阶分量携带了极其精确的局部三维朝向信息。SHReg 通过 \(\ell=2\) 阶特征沿通道加权聚合得到 5 维向量并映射为对称无迹张量 \(S_p, S_q\),其主特征向量确立了无向主轴 \(a_p, a_q\);接着,利用 \(\ell=1\) 阶矢量特征 \(v_p, v_q\) 消除主轴的正反符号二义性:\(\tilde{a}_p = \mathrm{sign}(a_p^\top v_p) a_p\);随后通过 Gram-Schmidt 正交化直接构造出局部右手正交坐标基 \(A_p, A_q \in \mathrm{SO}(3)\)。对于任意一对匹配点 \((p \leftrightarrow q)\),局部坐标系之间的相对旋转可立即闭式解析求解: $\(R = A_q A_p^\top, \qquad t = q - R p\)$ 每个单对应点直接独立产生一个高质量的刚体变换假说,将假设生成空间从三次降为线性规模 \(\mathcal{O}(N)\),随后在全局阶段仅需统计在几何重投影阈值 \(\tau\) 内的内点支持度,即可快速筛选出全局最优变换。
损失函数 / 训练策略¶
模型采用多任务联合端到端监督,总损失为 \(\mathcal{L} = \mathcal{L}_c + \mathcal{L}_f + \mathcal{L}_r\): 1. 超点匹配损失 \(\mathcal{L}_c\):采用重叠感知的 Circle Loss 监督超点级旋转不变特征,拉近真值重叠区域内的超点对距离,推开非重叠负样本对; 2. 细粒度点匹配损失 \(\mathcal{L}_f\):在真值匹配的超点邻域簇内部,利用负对数似然损失监督软分配矩阵 \(Z\) 及显著性预测头,促使重叠区显著几何点获得更高的匹配置信度; 3. 等变特征对比损失 \(\mathcal{L}_r\):针对等变特征引入带有边界的对比对齐损失,迫使两片点云的等变特征在真实相对旋转 \(R_{gt}\) 变换后与真值对齐,强化不可约表示在低重叠环境下的方向辨识能力。
实验关键数据¶
主实验¶
在室内标准基准 3DMatch(重叠度 \(>30\%\))与极低重叠基准 3DLoMatch(重叠度 \(10\% \sim 30\%\))上,与主流场景级、局部小块级及旋转鲁棒算法的对比结果如下:
| 方法 | 模型大小 (MB) | 3DMatch FMR (%↑) | 3DMatch IR (%↑) | 3DMatch RR (%↑) | 耗时 (s↓) | 3DLoMatch FMR (%↑) | 3DLoMatch IR (%↑) | 3DLoMatch RR (%↑) | 耗时 (s↓) |
|---|---|---|---|---|---|---|---|---|---|
| FCGF⋄ (ICCV 2019) | 8.76 | 94.7 | 31.1 | 82.8 | 0.12 | 59.4 | 9.8 | 38.0 | 0.13 |
| SpinNet⋄ (CVPR 2021) | 1.41 | 97.6 | 47.5 | 88.6 | 9.85 | 75.3 | 20.5 | 59.8 | 9.03 |
| Predator⋄ (CVPR 2021) | 7.43 | 96.6 | 58.0 | 89.0 | 0.64 | 78.2 | 26.7 | 64.4 | 0.47 |
| GeoTransformer (TPAMI 2023) | 9.83 | 98.1 | 70.9 | 92.4 | 0.18 | 87.4 | 43.5 | 74.3 | 0.17 |
| YOHO (ACM MM 2021) | 12.38 | 98.2 | 64.4 | 90.8 | 2.81 | 78.9 | 25.9 | 66.0 | 2.62 |
| RoReg (TPAMI 2023) | 12.71 | 98.2 | 81.6 | 93.0 | 2.27 | 82.3 | 39.6 | 70.1 | 2.10 |
| RoITr⋄ (CVPR 2023) | 10.10 | 98.0 | 82.4 | 91.9 | 0.36 | 89.2 | 54.6 | 74.1 | 0.34 |
| PEAL (CVPR 2023) | 9.83 | 98.4 | 71.0 | 94.2 | 1.46 | 88.3 | 46.0 | 78.8 | 1.19 |
| PARE-Net (ECCV 2024) | 3.84 | 98.5 | 76.9 | 95.0 | 0.17 | 88.3 | 47.5 | 80.5 | 0.17 |
| SHReg (本文) | 9.52 | 98.5 | 78.6 | 95.4 | 0.28 | 88.6 | 48.8 | 82.4 | 0.28 |
在施加任意连续随机三维大旋转的测试集(Rotated 3DLoMatch)上,评估未见旋转分布下的泛化性能(标注变动幅度相对于标准测试集的变换召回率 TR):
| 方法 | 模型大小 (MB) | 标准 3DLoMatch RE (◦↓) | 标准 3DLoMatch TE (cm↓) | 标准 3DLoMatch TR (%↑) | 旋转 3DLoMatch RE (◦↓) | 旋转 3DLoMatch TE (cm↓) | 旋转 3DLoMatch TR (%↑) |
|---|---|---|---|---|---|---|---|
| FCGF | 8.76 | 4.84 | 12.87 | 39.6 | 4.74 | 13.39 | 24.5 (-15.1) |
| Predator | 7.43 | 3.61 | 10.65 | 65.6 | 3.55 | 10.30 | 64.0 (-1.6) |
| GeoTransformer | 9.83 | 2.91 | 8.71 | 75.4 | 2.94 | 8.85 | 72.6 (-2.8) |
| PEAL | 9.83 | 2.84 | 8.64 | 81.2 | 2.86 | 8.53 | 78.7 (-2.5) |
| YOHO* | 12.38 | 3.54 | 10.34 | 66.6 | 3.61 | 10.16 | 67.1 (+0.5) |
| RoReg* | 12.71 | 3.01 | 9.26 | 71.3 | 3.03 | 9.28 | 71.0 (-0.3) |
| BUFFER* | 0.92 | 3.03 | 9.86 | 74.4 | 3.02 | 9.99 | 74.7 (+0.3) |
| RoITr* | 10.10 | 2.95 | 9.03 | 75.1 | 2.97 | 9.08 | 75.5 (+0.4) |
| PARE-Net* | 3.84 | 2.87 | 8.83 | 81.3 | 2.84 | 8.71 | 81.8 (+0.5) |
| SHReg (本文)* | 9.52 | 2.92 | 8.96 | 83.0 | 2.88 | 8.94 | 83.3 (+0.3) |
在室外自动驾驶大场景 KITTI 数据集上(直接在 3DMatch 权重上进行零样本跨域评估):
| 方法 | 模型大小 (MB) | RE (◦↓) | TE (cm↓) | TR (%↑) | 推理耗时 (s↓) |
|---|---|---|---|---|---|
| FCGF | 8.76 | 0.30 | 9.5 | 96.6 | — |
| D3Feat | 14.08 | 0.30 | 7.2 | 99.8 | — |
| Predator | 22.77 | 0.27 | 6.8 | 99.8 | 0.77 |
| GeoTransformer | 25.50 | 0.23 | 6.2 | 99.8 | 0.26 |
| PARE-Net | 2.08 | 0.23 | 4.9 | 99.8 | 0.21 |
| SHReg (本文) | 24.82 | 0.23 | 4.7 | 99.8 | 0.24 |
消融实验¶
在 3DMatch 与 3DLoMatch 上针对骨干网络设计与位姿估计器类型进行全面拆解消融:
| 组件分类 | 架构与配置选项 | 3DMatch FMR (%) | 3DMatch IR (%) | 3DMatch RR (%) | 3DLoMatch FMR (%) | 3DLoMatch IR (%) | 3DLoMatch RR (%) |
|---|---|---|---|---|---|---|---|
| 骨干网络 | 旋转敏感基线网络 (无 SH/irreps) | 98.0 | 71.0 | 93.6 | 86.7 | 41.5 | 78.2 |
| SH 编码 (移除 CG 张量积投影) | 98.2 | 73.5 | 94.2 | 87.5 | 43.5 | 79.3 | |
| SH + CG 投影 (移除门控非线性) | 98.3 | 75.8 | 94.7 | 88.0 | 45.6 | 80.1 | |
| SH + CG + Gate (移除不变范数读取层) | 97.6 | 68.0 | 92.8 | 84.0 | 36.5 | 75.5 | |
| 完整 SHReg 骨干网络 | 98.5 | 78.6 | 95.4 | 88.6 | 48.8 | 82.4 | |
| 位姿估计器 | RANSAC (经典三元组随机采样) | 98.5 | 78.6 | 94.0 | 88.6 | 48.8 | 79.5 |
| LGR / Patch 局部块姿态估计器 | 98.5 | 78.6 | 94.6 | 88.6 | 48.8 | 81.0 | |
| Ours (单对应点闭式位姿提议器) | 98.5 | 78.6 | 95.4 | 88.6 | 48.8 | 82.4 |
关键发现¶
- 不变性读取层是匹配性能的决定性屏障:在骨干消融中,若直接去掉正交范数收缩读取层(w/o invariant readout),3DLoMatch 的 RR 发生断崖式下跌,从 82.4% 暴跌至 75.5%,IR 降低 12.3 个百分点。这证明等变特征天然与空间姿态耦合,若不经过严格的标量不变量解耦,无法直接利用欧氏度量或点积注意力进行准确匹配。
- 单对应点闭式位姿估计器突破低重叠瓶颈:在相同的一致对应点集合下,单对应点闭式位姿提议相较于三点采样 RANSAC,在 3DLoMatch 上的配准召回率(RR)净提升 2.9 个百分点(82.4% vs 79.5%)。分析表明,在 10%~30% 极低重叠场景下,三元组采样极易抽中伪内点或退化构型,而单点高阶张量标架完全由局部刚性结构闭式确定,仅需 500 个候选假设即可迅速收敛到真值附近。
- 对大范围连续三维旋转表现出绝对鲁棒性:在施加全范围连续三维旋转后,常规旋转敏感方法(如 FCGF、GeoTransformer、PEAL)的 TR 分别下跌 15.1、2.8 和 2.5 个百分点,而 SHReg 的 TR 反而略微上升 0.3 个百分点(83.0% → 83.3%),彻底验证了数学理论构建的严格旋转等变性在面对极端未见姿态时的绝对稳定性。
亮点与洞察¶
- 将群论代数对称性内嵌于表征核心:SHReg 摒弃了经验式离散旋转增强与脆弱的局部坐标系投影,利用球谐基底与 Clebsch-Gordan 张量积投影,使网络层间每一维特征严格遵守 SO(3) 群表示法则,构建了完全无需数据增强的刚性旋转不变性。
- 解耦设计打破了匹配与姿态估计的目标冲突:对应点匹配需要“绝对不变性”,而刚体位姿恢复需要“敏感的方向指引”。SHReg 通过范数收缩产生不变描述子用于对应搜索,同时保留高阶不可约张量用于单点标架确定,实现了配准全管线中不变性与等变性的兼收并蓄。
- 局部正交标架的代数闭式化构造:巧妙将 \(\ell=2\) 阶五维特征重构为对称无迹张量提取主轴、结合 \(\ell=1\) 矢量特征消除符号二义性,省去了传统点云处理中复杂的特征值扰动敏感分解与迭代优化,使得单对应点闭式位姿解算兼备确定性与计算极速。
局限与展望¶
- 高阶不可约表示带来显著的张量积计算与显存开销:随着不可约表示阶数 \(\ell\) 的增加,张量积维度与 Clebsch-Gordan 稀疏投影的计算复杂度迅速攀升。在室外大尺度密集点云处理时,模型权重和临时张量占用内存较大,对部署设备提出了更高要求。
- 极度平坦或对称表面的主轴简并性:当局部邻域结构处于纯平面或球面对称状态时,高阶张量的特征值容易趋同,导致构造局部标架时主轴方向出现数值不敏感或退化现象,尽管有退化安全检查,极端退化几何下的位姿假说质量仍有提升空间。
- 未来方向:探索高阶球谐张量积的稀疏化与低秩近似算子,将严格 SO(3) 等变机制扩展至包含尺度等变性的相似变换群(Sim(3)),并将其推广至动态大场景实时 SLAM 与移动机器人在线闭环检测中。
相关工作与启发¶
- vs GeoTransformer / Predator: 依赖旋转敏感的稀疏卷积/Transformer 架构,依靠大量旋转数据增强进行逼近,面对大幅度未见旋转时特征匹配与位姿恢复显著退化;SHReg 实现了数学层面的严格等变与不变,彻底杜绝了旋转敏感性。
- vs YOHO / RoReg: 依赖离散旋转候选搜索或局部分块的 LRF 构造,计算开销巨大且易受局部遮挡破坏;SHReg 直接利用连续球谐基和单点高阶张量标架闭式解析姿态,耗时大幅降低且抗遮挡能力显著增强。
- vs PARE-Net: PARE-Net 探索了位置感知等变网络,但位姿生成依然缺乏紧密的单点张量几何闭式约束;SHReg 通过严格的不可约张量正交标架求解,在 3DLoMatch 极低重叠率下取得了更高的精度与更快的假设收敛速度。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ [首次完整将 SO(3) 球谐不可约张量表示与单对应点闭式位姿求解融合进端到端点云配准管线,理论完备且优雅]
- 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 3DMatch、3DLoMatch、Rotated 3DLoMatch 以及跨域 KITTI,包含主实验、大旋转压力测试与详尽细致的模块消融]
- 写作质量: ⭐⭐⭐⭐⭐ [公式推导脉络清晰,动机论述严密自洽,图表组织扎实直观]
- 价值: ⭐⭐⭐⭐⭐ [为解决低重叠、大姿态偏差的三维点云配准提供了高可靠的数学工具,兼具理论深度与工程实用性]