跳转至

Building Transformation Layers for Riemannian Neural Networks

会议: NeurIPS2026
arXiv: 2609.35436
代码: https://github.com/GitZH-Chen/RieTrans
领域: 其他(黎曼神经网络)
关键词: 黎曼几何、多切空间、流形卷积、参数平凡化、正定矩阵

一句话总结

本文把全连接层重新解释为点到超平面的有符号响应,用多切空间与可计算伪距离构造流形全连接层,再通过乘积流形扩展卷积,在十种几何实例上验证了表达灵活性,但性能与计算成本仍依赖具体几何和数据。

研究背景与动机

当网络的中间表示是协方差矩阵、线性子空间或双曲嵌入时,直接套普通矩阵乘法可能破坏正定性、正交约束或曲率结构。已有黎曼网络已经拥有归一化、注意力、残差和分类层,但最基础的特征变换仍常常依赖特定空间:SPDNet 使用矩阵双线性映射,Grassmann 网络使用左乘后重新正交化,双曲网络则通过原点切空间或 Lorentz 时空结构变换。这些方案各有用途,却很难在同一架构下自由更换表示几何。

一个通用替代方案是先在原点取对数映射,再做欧式全连接,最后用指数映射返回流形。不过,这使所有输出共享同一个展开位置,特征变换主要发生在单一切空间。另一些几何专用层依据真实点到超平面的距离构造输出,但这种距离在一般流形上未必有闭式解;即使距离能计算,多条距离约束也未必存在共同满足的输出。基于加权 Fréchet 均值的卷积还受到另一种限制:输出仍属于原来的流形,不能像普通卷积一样自由调整表示维度。

本文不试图寻找适用于所有流形的矩阵乘法,而是寻找全连接层背后更容易推广的几何关系:每个输出坐标都对应输入相对于一个超平面的有符号响应。核心 idea:用可计算的点到超平面伪距离把输出约束化为切空间坐标,让每个输出拥有自己的输入展开位置,再以指数映射和乘积几何恢复流形全连接与卷积。

方法详解

整体框架

输入是一个属于已知黎曼流形的点,输出是另一指定流形上的点;两侧的内在维度可以不同。层先为每个输出方向学习一个输入基点与切向法向量,计算输入在该基点处的对数映射及其法向响应,把所有标量响应组装到输出原点的切空间,再用指数映射产生合法输出。

卷积不是额外引入一种流形平均操作,而是把一个感受野内的多个流形点视为乘积流形上的单个点,再应用上述全连接构造。参数平凡化负责让可学习基点与法向量都由固定切空间中的欧式参数生成;具体几何实例则把统一公式展开成可实现的向量或矩阵运算。

因此,点到超平面伪距离、多切空间响应、参数平凡化和乘积流形卷积是同一构造的不同层次,不是四个依次训练的独立网络。这里以几何机制为主,不用流程图把定理与实例误画成串行模块。

关键设计

1. 点到超平面伪距离与多切空间:让隐式输出约束变成显式可计算变换

普通全连接层的每一行权重都确定一个法向方向,偏置则确定对应超平面的位置。作者将这一关系推广到流形:在基点处用对数映射把输入展开,再以当地黎曼度量计算它与法向量的内积。响应为零的点组成该基点和法向量所定义的黎曼超平面;响应的正负区分两侧,幅值同时包含法向量的尺度。

关键不是把这个内积无条件称为真实几何距离,而是明确采用以下代理量。对于非零法向量,论文的点到超平面伪距离为:

\[ d_{\mathrm{pseudo}}(X,H_{A,P})=\frac{|\langle \operatorname{Log}_{P}(X),A\rangle_{P}|}{\|A\|_{P}}. \]

它不需要求解“寻找超平面上最近点”的优化问题。在输出原点选择度量下的正交归一基后,输出到各坐标超平面的有符号伪距离,恰好就是输出对数映射的各个系数。因此,多条隐式距离条件可以直接通过组装切向量来求解,得到定理 3.3 的核心变换:

\[ Y=\operatorname{Exp}^{\mathcal M}_{E}\left(\sum_{i=1}^{m}\langle \operatorname{Log}^{\mathcal N}_{P_i}(X),A_i\rangle^{\mathcal N}_{P_i}B_i\right). \]

这里输入流形为 \(\mathcal N\),输出流形为 \(\mathcal M\),输出内在维度为 \(m\);\(B_i\) 是输出原点切空间的正交归一基。每个输出方向拥有自己的 \(P_i\) 和 \(A_i\),所以同一输入会在多个可学习位置展开,而不是所有输出都只读取一次原点对数映射。输出仍在一个固定原点处合成,但输入侧的响应具有不同的局部参考位置。

这解释了它与单切空间变换的区别,也解释了它为什么能够允许不同输入、输出维度。伪距离只有在流形等距于欧式空间等特定条件下才与真实测地点到超平面距离一致;论文明确列出欧式空间以及 SPD 的 LEM、LCM。对一般曲率空间,笔记中的“响应”不应被理解成精确最短距离。

2. 参数平凡化:用方向与位移生成移动基点,避免直接优化切丛参数

如果独立学习基点和法向量,基点一旦更新,法向量所在的切空间也随之变化,普通欧式优化器无法把二者当作无约束向量随意更新。此外,在欧式情形,同一个超平面可以由很多基点表示,独立学习基点容易带来冗余。作者沿用已有的紧凑参数化思路,在输入原点学习一个切向量和一个标量位移,再由几何算子生成所需参数:

\[ P_i=\operatorname{Exp}^{\mathcal N}_{E}(\gamma_i[Z_i]),\qquad A_i=\Gamma_{E\rightarrow P_i}(Z_i). \]

其中 \([Z_i]\) 是按输入原点度量归一化后的非零切向量,\(\gamma_i\) 控制沿该方向的位移,平行移动将法向量带到新基点。训练实际更新的是固定切空间中的 \(Z_i\) 和实数 \(\gamma_i\),而非直接在不断变化的切空间里更新 \(A_i\)。这使欧式优化器能够反向传播,同时保留参数的流形约束。

对内在维度为 \(n\) 的输入,每个输出方向从两个 \(n\) 维几何参数缩减为一个 \(n\) 维切向量加一个标量,即从 \(2n\) 变成 \(n+1\)。这是论文采用的紧凑建模选择,不应扩写成任意曲流形上所有独立基点与法向参数都已被证明无损等价。它也不消除几何运算成本:AIM 的矩阵对数、BWM 的矩阵平方根等仍然可能很昂贵。

3. 乘积流形卷积:先组合感受野,再累加各分量的几何响应

普通卷积可以理解为“取局部窗口、拼接窗口特征、施加共享的全连接核”。在流形上,不能直接把矩阵或子空间的数组拼接后当作原流形的合法点;正确对象是由各点构成的有序元组,也就是乘积流形。乘积流形的度量和对数映射按分量分解,因此,每个输出方向的响应就是对窗口内各点的基点内积响应求和,然后仍在输出切空间合成并映回。

一个核输出一个目标流形点,多个核提供多个输出通道;核在不同窗口共享参数。目标流形可以改变矩阵尺寸或子空间维度,不必与输入相同。与加权 Fréchet 均值不同,这不是在输入流形内部做平均,所以其维度变化不受“均值必须属于原空间”的限制。附录 G.5 还限定了对称性主张:本文是参数随等距变换协同变化的等变关系,不是 ManifoldNet 那种固定核参数下的等变性。

实验中的主 SPDNN 只使用一个跨通道的全局感受野和一个核,因此那里卷积实际上是乘积流形全连接。附录另外增加滑动局部窗口与共享核的 SPDConvNet,才直接检验局部卷积;不能用主 SPDNN 结果替代对空间或时间卷积的验证。

4. 几何实例与批量化:统一接口不意味着所有空间使用相同数值计算

作者将上述构造落到三种双曲模型、五种 SPD 度量和两种 Grassmann 表示。双曲 HFC-P、HFC-K 分别利用 Möbius、Einstein 加法简化响应,HFC-H 则利用 Lorentz 度量与平行移动;这些结构是实例化时的计算工具,不是通用定理额外要求的公理。直接为每个输出构造全部局部向量会产生大批中间张量,定理 4.3 把共同部分化为输入与单位方向的批量内积,再逐元素处理曲率项,避免显式物化完整的批量、输出维度、输入维度三维张量。

SPD 实例把响应组装到符合所选度量的矩阵切空间。LEM、AIM 在单位阵处通过矩阵指数恢复正定输出;LCM 通过严格下三角元素与对角对数坐标构造 Cholesky 因子,再恢复正定矩阵;PEM 与 BWM 的指数映射只在局部定义,需要按附录 G.4 处理正定域约束,例如用特征值截断进行数值正则化。输出为 \(r\times r\) 的 SPD 矩阵时,其内在维度是 \(r(r+1)/2\),不是仅有 \(r\) 个标量输出。

Grassmann 实例的输入是子空间,可用正交基 ONB 或投影矩阵 PP 表示。目标 \(\operatorname{Gr}(q,r)\) 的切向自由度是 \(q(r-q)\),组装响应后用 SVD 与三角函数,或用反对称块矩阵的指数恢复输出。这样既能改变环境维度,也能改变子空间维度;PP 对数映射借助 ONB 对数映射支持反向传播。割迹附近的对数映射需要数值处理,不能把紧流形上的公式当成无条件全局单值坐标。

一个完整示例

以论文 Radar 的 SPDNN-LEM 配置为例,输入是多个 \(20\times20\) 协方差矩阵,卷积使用全局感受野,输出一个 \(8\times8\) SPD 矩阵。下面是该配置的机制解释,不是额外测量结果。

第一步,把多个协方差矩阵作为乘积流形输入,而不是先对它们做均值。每个目标切空间方向拥有针对各输入分量的可学习几何响应;在 LEM 下,这些响应可以简化成矩阵对数坐标中的内积与偏移。

第二步,对同一输出方向累加各输入分量的响应。\(8\times8\) 对称矩阵共有 \(36\) 个独立坐标,所以需要 \(36\) 个输出切向系数,按正交归一基组装成对称矩阵,再取矩阵指数得到正定输出。

第三步,SPD 多项逻辑回归分类器读取这个输出并给出类别分数。监督来自 Radar 的三个类别,不是把“到超平面的伪距离”直接当作训练损失;训练通过分类目标反向传播到卷积核的切向参数和位移。

损失函数 / 训练策略

本文主要贡献是变换层,不是新的损失函数。双曲实验使用链接预测设置,主 HNN 是输入维度到 16、再从 16 到 16 的两层编码器,使用 Adam,学习率为 \(10^{-2}\);不同方法分别调节权重衰减与 dropout。Cora 对全部方法不使用激活,其余三个图使用切空间 ReLU。附录说明 HFC 后还使用既有偏置平移,因此资源表并非单独一层的参数量。

SPDNN 使用一个卷积层接多项逻辑回归分类器。LEM、PEM、LCM 的分类器度量与卷积一致;AIM、BWM 为效率考虑使用 LEM 分类器,因此它们不是从卷积到分类都使用同一度量。训练批量大小 30、最多 150 个 epoch 并采用早停,主要使用 AMSGrad,部分配置改用 SGD;还可能在卷积前使用矩阵幂改变潜在几何。

Grassmann 网络也是一个变换层后接分类器;本文模型使用 AMSGrad,学习率 \(5\times10^{-3}\),批量大小 30,训练 150 个 epoch。基线采用 SGD 和不同学习率,故这组结果并非只改变变换层而冻结全部优化设置的严格消融。

原文符号需要保留审慎边界:第 3.1 节先写正偏置的欧式全连接,随后逐坐标式使用负偏置;第 5.1 节 LorentzTan 公式的外层写为 Log,而相关切空间变换表写为 Exp。这里不擅自统一成作者已确认的实现公式,复现应核对代码与最终版本。

实验关键数据

主实验

下表选取原文表 4 的两层 HNN 链接预测结果,指标为测试 AUC(%),原文报告五折平均。它是同一骨干内不同变换层的比较,不是不同任务之间的排行榜。

变换层 Disease Airport Pubmed Cora
Möbius 76.73 ± 4.86 93.26 ± 0.43 94.95 ± 0.06 90.75 ± 0.47
Einstein 77.34 ± 2.56 92.72 ± 0.07 94.99 ± 0.13 89.73 ± 0.21
LFC 78.00 ± 0.60 92.63 ± 0.27 94.22 ± 0.11 91.74 ± 0.12
Poincaré FC 79.19 ± 2.05 94.21 ± 0.43 94.30 ± 0.19 87.16 ± 0.95
HFC-P 80.66 ± 1.35 94.13 ± 0.47 94.77 ± 0.28 90.76 ± 0.57
HFC-K 80.58 ± 1.59 94.32 ± 0.27 94.61 ± 0.27 89.94 ± 0.49
HFC-H 82.93 ± 0.89 95.18 ± 0.18 93.99 ± 0.25 92.20 ± 0.25

HFC-H 在 Disease、Airport、Cora 的这组比较中最好,但 Pubmed 的 Einstein 与 LorentzTan 都达到 94.99,超过全部 HFC。原文将结果与图的双曲性联系起来;这提示几何适配影响性能,不是证明更复杂的黎曼变换在所有数据上都优于切空间模型。

下表摘取原文表 6 的 SPD 分类准确率(%),保留同架构的 GyroSPD++-LEM 与三种本文度量。NTU60 仅评估互动作子集;这些数值不是完整 NTU60 标准任务结果。

模型 Radar HDM05 FPHA NTU60 互动作
GyroSPD++-LEM(本文复现) 98.08 ± 0.26 77.63 ± 1.01 88.23 ± 0.62 85.48 ± 1.10
SPDNN-LEM 98.27 ± 0.48 81.16 ± 0.93 91.83 ± 0.41 86.72 ± 0.14
SPDNN-PEM 98.43 ± 0.44 78.77 ± 0.45 90.33 ± 0.37 82.61 ± 0.37
SPDNN-BWM 98.72 ± 0.14 72.49 ± 2.02 87.80 ± 0.56 82.64 ± 0.35

LEM 在后三个数据集更强,BWM 在 Radar 更强。复现边界很重要:附录 I.2.4 指出 HDM05 使用 122 类、每类 50/50 划分,NTU60 使用 cross-view,与部分原论文设置不同;即使 FPHA 使用相同官方划分,复现 GyroSPD++-LEM 的 88.23 仍低于来源论文的 94.72。因此,本文内部胜出不等于已经超过那些来源论文的公布结果。

消融实验

下表使用原文表 8 的 Radar 五折结果,考察 GrNN 的子空间与环境维度选择,属于维度分析而非移除模块的消融。

配置 子空间维度 环境维度 准确率(%)
GrNet 4 20→16 90.48 ± 0.76
GrNN-ONB 4→4 20→16 93.92 ± 0.74
GrNN-ONB 4→4 20→20 92.83 ± 0.66
GrNN-ONB 4→6 20→16 95.23 ± 0.96
GrNN-ONB 4→8 20→16 94.77 ± 0.81
GrNN-PP 4→4 20→16 94.35 ± 0.42
GrNN-PP 4→6 20→16 94.51 ± 0.53

ONB 把子空间维度从保持 4 改成输出 6 时,准确率从 93.92 提高到 95.23,增加 1.31 个百分点;再增到 8 并未继续提高。PP 下相同维度变化只有从 94.35 到 94.51,说明“可改变子空间维度”确实提供了设计空间,却不保证收益随维度单调增加。

关键发现

  • HNN 的资源口径是完整模型注册参数元素数与峰值已分配显存 MiB。Cora 上 NestFC 为 2,076,931 个参数元素、1234.25 MiB,HFC-H 为 23,248、326.61 MiB;这不能被写成有效自由度或推理延迟的比较。
  • 参数紧凑不意味着显存处处最低:Disease 上 HFC-H 使用 89.82 MiB,而 Möbius 为 77.20 MiB。几何算子的中间状态仍有成本。
  • 附录局部卷积的 Radar 设置 [40,3,3] 中,SPDConvNet-LEM 为 97.68 ± 0.32、1.58 秒/epoch,ManifoldNet 为 77.89 ± 1.56、13.12 秒/epoch;但 MVC-Net 因数值不稳定被移除切空间 ReLU,各方法并非激活完全一致。
  • SPD 训练速度强烈依赖度量:Radar 上 SPDNN-LCM 为 0.65 秒/epoch,SPDNN-BWM 为 6.07 秒/epoch。附录还说明部分传统 SPD 基线在 HDM05、FPHA 用 CPU,而其他配置用 A6000,不能把跨设备耗时全部归因于层本身。

亮点与洞察

  • 将全连接的本质从“矩阵乘法”转向“超平面响应”,使输入、输出几何可以分开定义。可迁移的部分是寻找欧式操作背后的几何约束,而不是逐个空间另造一套代数。
  • 伪距离既是效率选择,也是可解性选择。它把难以同时满足的真实距离约束转换成输出切空间的系数,因此是框架成立的关键,而非可随意忽略的近似细节。
  • 乘积流形提供了卷积的清晰接口:分量内负责几何,分量间通过度量求和结合。这让通道、矩阵尺寸和子空间维度成为可独立研究的架构变量。

局限与展望

  • 作者限定于可计算的黎曼算子;未知流形或缺乏可处理 Exp、Log 的空间不能直接使用。数值近似算子是后续方向,而不是本文已经验证的通用解法。
  • 伪距离与真实测地距离的一致性有条件,Grassmann 割迹与 PEM、BWM 的局部定义域也需要处理。实际数值正则化可能改变理想几何映射,应额外报告截断发生频率与梯度稳定性。
  • 紧凑参数化、几何选择、分类器度量、矩阵幂预处理及优化器都有可能影响结果。现有实验不能完全分离“多切空间带来的提升”和这些同时变化因素。
  • 主 SPDNN 是浅层全局卷积,Grassmann 只在 Radar 上评估;局部卷积扩展也集中于 Radar。更深网络、长时间序列和多种任务上的稳定性仍需验证。
  • 后续可以在同一等距表示、相同优化预算和共享初始化下比较几何实例,检验经验差异究竟来自表示、数值条件还是参数化,而不是直接归结为某种几何更优。

相关工作与启发

  • vs Möbius / Einstein 切空间层:它们主要在固定原点展开后做欧式变换,本文为每个输出学习不同输入基点。Pubmed 结果提醒这种更丰富的局部响应并不总是必要。
  • vs Poincaré FC / GyroSPD++:通用定义通过合适距离选择可以包含已有构造;采用本文伪距离得到的 HFC-P 不等同于已有 Poincaré FC。SPD 对比的重要新增环节还包括紧凑平凡化,不能只把差异归为“换成黎曼算子”。
  • vs ManifoldNet:Fréchet 均值卷积保留固定参数下的等变性,但不能自由改变目标流形维度;本文交换得到维度灵活性与参数协变的几何兼容关系,两者并不是完全相同的保证。
  • vs Grassmann FRMap + ReOrth:左乘与 QR 可以改变环境维度但保持子空间维度,本文通过目标切空间构造同时开放两种维度。Radar 的维度分析是支持这个设计空间的直接证据。

评分

  • 新颖性: 4/5。统一超平面解释与乘积流形扩展有价值,但伪距离和紧凑参数化继承已有思想。
  • 实验充分度: 4/5。覆盖三类流形并补充局部卷积与复现边界,但深层稳定性与严格因素分离仍不足。
  • 写作质量: 3/5。核心定理清楚,附录说明充分,不过偏置符号和 LorentzTan 的 Log/Exp 表述需核对。
  • 价值: 4/5。适合作为多种流形变换层的统一设计接口,不宜视作任何任务上都更强或更快的默认层。