跳转至

Learning Geometry-Aware Embedding Fields for Intrinsic Riemannian Mappings

会议: ECCV 2026
论文: ECCV 原文
代码: https://circle-group.github.io/research/LearningRiemannianGeometry
领域: 3D视觉
关键词: 黎曼几何、指数映射与对数映射、神经几何场、三平面超调制、几何深度学习

一句话总结

针对非流形与含噪离散点云上黎曼测地映射求解困难的问题,提出了一种学习连续几何嵌入场的方法,通过稀疏八叉树卷积与三平面超调制解码,以单次前向推理高效预测指数映射与对数映射。

研究背景与动机

微分几何与黎曼几何为刻画连续弯曲流形上的测地线、切空间及本征拓扑结构提供了坚实的数学理论基础。在理想光滑流形上,指数映射(将切空间向量沿测地线映射到流形表面)与对数映射(恢复指向目标点的切向量)存在清晰的解析形式或基于全局网格连接关系的离散算子解法。然而,现代三维视觉与图形学在现实场景中捕获的几何输入多为无序点云、非流形三角网格面片汤(triangle soups)或隐式神经表面,缺乏严格的流形连接性,且普遍伴随严重的传感器噪声与局部缺失。这导致依赖网格拓扑扩散的经典数值求解器(如热传导法 Vector Heat Method、程函方程求解器)完全失效,甚至面临网格拓扑修复本身即为病态难题的困境。

现有的隐式曲面导航或直接拟合方法,通常依赖迭代投影算法或基于启发式步进的测地线数值追踪。这类算法计算开销随分辨率剧增,在遇到高曲率边界或薄片结构时容易产生严重的数值发散;纯几何启发式步进更无法感知高层全局形状拓扑,经常在薄板的双面之间发生越界穿透(leakage),或在稀疏区域产生断裂。更关键的是,现代可微分几何学习管线迫切需要算子本身具备可微性与批量并行评估能力,而全局方程求解器无法支持局部区域的快速常数阶查询。

针对上述矛盾,本文提出从数据驱动视角将黎曼映射算子形式化为流形上的连续神经场学习任务。作者的关键洞察在于:指数映射与对数映射在局部具备高度的几何局域性与平滑连续性,邻近点诱导的映射规律高度相似。核心 idea:利用稀疏八叉树卷积神经网络将无拓扑的点云编码为全局连续的几何嵌入场,查询时提取局部几何潜编码并超调制生成轻量三平面神经场,直接在三维外温坐标系中以单次前向网络推理实现保角且保距的双向黎曼测地映射。

方法详解

整体框架

本文方法的目标是输入离散无拓扑几何(如点云 \(\mathcal{P} \subset \mathbb{R}^3\)),为流形上的任意源点 \(p\) 建立可微的指数映射 \(\text{Exp}_p: T_p\mathcal{M} \to \mathcal{M}\) 与对数映射 \(\text{Log}_p: \mathcal{M} \to T_p\mathcal{M}\)。算法分为两阶段:全局离散几何向连续几何嵌入场(Geometric Embedding Field, GEF)的编码,以及基于局部潜编码超调制三平面场的轻量级映射解码。

整体流水线如下图所示:

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入离散点云<br/>(无网格连接性/含噪表面)"] --> B["稀疏八叉树几何编码器<br/>(3D OCNN U-Net 连续嵌入场)"]
    B --> C["源点嵌入三线性插值<br/>(提取局部几何潜编码 zp)"]
    C --> D["三平面超调制生成<br/>(线性投影展开正交特征平面)"]
    D --> E["外温相对三维坐标查询<br/>(避免局部2D基底旋转多义性)"]
    E --> F["轻量MLP单步解码<br/>(即时预测ExpMap与LogMap)"]

关键设计

1. 稀疏八叉树几何嵌入场:无须网格连接性的连续几何特征提取
传统方法高度依赖严格的三角网格拓扑关系,在面对点云、粗糙三角面片汤或隐式场采样时极易崩溃。本文采用基于稀疏八叉树卷积(OCNN)的 3D U-Net 作为主干网络,通过自适应八叉树自顶向下分层聚合空间邻域几何结构,并通过带跳跃连接的解码层恢复高分辨率空间连续场。针对流形表面的任意源点 \(p\),网络直接通过三线性插值采样得到该处的局部几何潜向量 \(z_p\)。该过程完全抛弃了网格拓扑假设,在对复杂流形进行一次性前向特征分析后,即可支持后续任意位置的常数阶查询。

2. 三平面超调制机制:几何自适应的高效局部神经场构建
指数与对数映射的全局行为虽然受整体拓扑制约,但其在源点 \(p\) 邻域的流动特性主要由该处的局部内在曲率与度量张量决定。本文设计了受 FiLM 和 HyperNetwork 启发的超调制架构:源点特征向量 \(z_p\) 经由单层线性投影矩阵映射,直接重构并生成三组相互正交的局部特征平面(\(XY, XZ, YZ\) 三平面)。对于输入的空间查询向量,网络只需在生成的三平面上进行双线性特征插值并拼接,即可送入微型 MLP(仅需约 5 次矩阵乘法与 3 次线性插值)输出最终目标坐标。这种超调制解耦使网络具备动态适应异质局部曲率的能力,同时保持极高的 GPU 批处理并行速度。

3. 外温三维相对坐标建模:规避切空间局部正交基底的旋转多义性
在微分几何中,传统算法通常在切平面上人为指定一组二维局部正交坐标系(2D tangent chart)。然而,流形上二维切空间基底的定义存在天然的绕法向旋转不确定性(up to \(SO(2)\) rotation),若直接输入局部二维坐标,会导致神经网络在不同采样点之间因基底旋转而难以收敛。本文摒弃局部二维展开,转而直接在三维外温欧几里得空间(ambient 3D space)中采用相对坐标(如切向量 \(v \in \mathbb{R}^3\) 与相对位移 \(q - p\))进行特征采样与解码。这种设计彻底消除了基底旋转二义性,保证了几何映射在全流形表面上的全局连续与平移不变性。

4. 割迹样本过滤机制:排除非双射多义性导致的训练崩塌
黎曼几何中,指数映射在流形全局上往往由于测地线相交产生割迹(cut locus)而非单射,对数映射在超过单射半径(injectivity radius)后失去明确的良定义(如图 3 所示的斯坦福兔上环绕测地线碰撞)。直接在全局几何上进行监督训练会导致网络在多值解处振荡并陷入平凡解。本文提出割迹几何过滤策略:在由高质量网格生成监督真值时,若目标流形点对应切空间中多条缠绕的极小测地线方向,则判定该点超出单射范围并将其从 LogNet 训练集中剥离,过滤掉约 29.6% 的奇异多义样本,使模型专注于保距且良定义的同胚区域学习。

损失函数 / 训练策略

网络采用多目标联合优化函数,总损失定义为: $\(\mathcal{L}_{\mathrm{total}} = \lambda_{\mathrm{rec}}\mathcal{L}_{\mathrm{rec}} + \lambda_{\mathrm{geo}}\mathcal{L}_{\mathrm{geo}} + \lambda_{\mathrm{cyc}}\mathcal{L}_{\mathrm{cycle}}\)$ 超参数设定为 \(\lambda_{\mathrm{rec}} = 1.0\)\(\lambda_{\mathrm{geo}} = 0.01\)\(\lambda_{\mathrm{cyc}} = 0.01\)。各损失项具体如下:

  • 真值重构损失 \(\mathcal{L}_{\mathrm{rec}}\):在高质量网格上通过 potpourri3D 生成伪真值,采用 \(L_1\) 范数分别监督三维流形点预测 \(\hat{q}\) 与切向量预测 \(\hat{v}\): $\(\mathcal{L}_{\mathrm{Exp}} = \|\hat{q} - q_{\mathrm{gt}}\|_1, \quad \mathcal{L}_{\mathrm{Log}} = \|\hat{v} - v_{\mathrm{gt}}\|_1, \quad \mathcal{L}_{\mathrm{rec}} = \mathcal{L}_{\mathrm{Exp}} + \mathcal{L}_{\mathrm{Log}}\)$
  • 内在几何正则项 \(\mathcal{L}_{\mathrm{geo}}\):理想的指数与对数映射在局部应满足等距性(保距离)与共形性(保角度)。由于网络全流程可微,利用自动微分计算映射函数关于输入的 \(3 \times 3\) 雅可比矩阵 \(J\),定义一阶度量张量 \(M = J^T J\)。通过保距损失 \(\mathcal{L}_{\mathrm{iso}}\) 约束对角元素 \(M_{ii} \to 1\)(基向量模长保持),通过保角损失 \(\mathcal{L}_{\mathrm{conf}}\) 惩罚非对角元素 \(M_{ij} \to 0\)(正交方向夹角保持): $\(\mathcal{L}_{\mathrm{iso}} = \sum_i |M_{ii} - 1|, \quad \mathcal{L}_{\mathrm{conf}} = \sum_{i \neq j} |M_{ij}|, \quad \mathcal{L}_{\mathrm{geo}} = \mathcal{L}_{\mathrm{iso}} + \mathcal{L}_{\mathrm{conf}}\)$
  • 循环一致性损失 \(\mathcal{L}_{\mathrm{cycle}}\):利用指数映射与对数映射互为逆映射的双偶特性,施加自监督闭环约束: $\(\mathcal{L}_{\mathrm{cycle}} = \|h(g(v; z_p); z_p) - v\|_1\)$ 其中 \(g(\cdot; z_p)\) 代表 ExpNet,\(h(\cdot; z_p)\) 代表 LogNet。

实验关键数据

主实验

评估在合成 ShapeNet 规范测试集、低质量原始网格(RawShapeNet,存在非流形与自相交)、非均匀采样点云及含噪点云(高斯位移 \([0, 0.015]\))上展开。对数映射评估平均距离失真(\(E_{\mathrm{MDD}} \downarrow\))与平均角度误差(\(E_\theta \downarrow\),度),指数映射评估三维欧氏平均误差(\(E_{\mathrm{Exp}} \downarrow\)),并在 Apple M4 Max CPU 上测量单次查询运行时间(Time \(\downarrow\),秒)。

数据集/分布类别 样本数 / 顶点规模 对数映射: 方法 \(E_{\mathrm{MDD}} \downarrow\) \(E_\theta (^\circ) \downarrow\) 耗时(s) \(\downarrow\) 指数映射: 方法 \(E_{\mathrm{Exp}} \downarrow\) 耗时(s) \(\downarrow\)
ShapeNet 1000 / 16.6k Heat Method
Projection
Ours
0.250
0.115
0.110
16.7
14.6
11.1
0.178
0.001
0.012
Tracing
Proj.
Ours
0.036
0.049
0.026
0.396
0.003
0.019
RawShapeNet 200 / 10.0k Heat Method
Projection
Ours
0.314
0.166
0.169
21.3
17.1
15.4
0.101
0.001
0.013
Tracing
Proj.
Ours
0.050
0.048
0.036
0.374
0.003
0.020
Non-uniform 200 / 15.0k Heat Method
Projection
Ours
0.339
0.155
0.152
22.4
16.3
14.0
0.051
0.0005
0.011
Tracing
Proj.
Ours
0.043
0.047
0.030
0.415
0.003
0.019
Noisy 200 / 16.6k Heat Method
Projection
Ours
0.326
0.203
0.202
21.1
19.4
17.8
0.101
0.001
0.013
Tracing
Proj.
Ours
0.060
0.055
0.038
0.374
0.003
0.020

在未微调迁移至非刚性人体变形数据集 DFAUST 及真实 Kinect-v2 扫描点云的零样本泛化中,本文方法同样表现优异:DFAUST 上 Log 角度误差从 Heat 算法的 \(25.47^\circ\) 降至 \(16.51^\circ\),Exp 误差达到 \(0.043\);Kinect-v2 真实噪点数据上 Log 角度误差达到 \(8.37^\circ\)(优于基线),Exp 误差降至 \(0.060\)(优于 Tracing 的 \(0.063\) 与 Proj. 的 \(0.064\))。

消融实验

在 100 个 ShapeNet 模型上验证割迹数据过滤与几何正则化损失的作用:

变体配置 \(E_{\mathrm{MDD}}\) (Log) \(\downarrow\) \(E_\theta (^\circ)\) (Log) \(\downarrow\) \(E_{\mathrm{Exp}}\) (Exp) \(\downarrow\) 训练相对开销 \(\downarrow\) 核心作用说明
No Filtering(不过滤割迹) 0.112 11.3 0.027 1.42× 精度未有显著差异,但因冗余歧义样本导致算力与训练耗时增加 42%
Simple Loss(仅保留监督损失) 0.162 11.5 0.025 1.00× 缺乏雅可比保角保距约束,对数映射距离失真急剧恶化(0.112 \(\to\) 0.162)
Full Model(本文完整模型) 0.112 11.2 0.028 1.00× 在最佳训练效率下达成测地等距与共形性能的平衡

关键发现

  • 薄板结构免穿透能力:定性对比显示,热传导法等依赖离散拉普拉斯算子的方法在极薄结构处(如容器边缘、飞机机翼薄板)会发生热量跨表面“短路泄漏”,无法区分上下表面;而本文学习到的几何场能精准恢复沿着薄壁外缘绕行的真实测地线轨迹。
  • 高曲率法向剧变下的鲁棒性:简单投影基准假设局部平坦,在法向急剧翻转的曲面区域产生严重的几何拉伸畸变;本文方法依靠三平面高维场保留了非欧几何特征,在 Kinect-v2 真实残缺扫描边缘与空洞处依然能生成规整均匀的棋盘格纹理展开。
  • 卓越的推理延迟:相较于迭代数值测地线追踪(Tracing 单点查询需要 \(0.37 \sim 0.41\) 秒),本文解码仅需约 \(0.019\) 秒(CPU 单线程),提速近 20 倍,且骨干网络单次前向可并行批处理计算全场潜编码。

亮点与洞察

  • 算子级神经隐式建模:打破了传统几何深度学习仅用于形状分类/分割或隐式重建的局限,首次将黎曼几何中基础的双向测地线映射转化为端到端可微的神经场求逆问题。
  • 外温相对三维表示替代局部切标架:巧妙利用三维欧氏空间相对位移规避切空间 \(SO(2)\) 基底旋转多义性,从根本上消除了神经网络因标架不确定性引起的梯度震荡。
  • 几何雅可比正则项驱动保形性:将经典微分几何中度量张量保角保距的物理准则直接映射为网络一阶自动微分雅可比矩阵的软约束,使无网格网络天然习得离散曲面的本征测地流。

局限与展望

  • 真值监督信号上限瓶颈:当前训练严重依赖传统离散微分几何库(potpourri3D)在水密网格上生成的离散测地解作为监督信号,模型的极限拟合精度难以超越经典数值算法本身的离散化误差。
  • 离散场分辨率细节平滑:稀疏八叉树卷积与三平面的网格体素分辨率存在上限,在遇到超微观高频几何褶皱或极微小几何特征时容易被插值平滑淡化。
  • 大尺度参数化依赖后处理缝合:由于局部对数映射受单射半径限制,大尺度整表面展开目前仍需借助贪心加权刚性对齐(Weighted Rigid Alignment)后处理算法拼接局部图册(Atlas),尚未达成真正端到端的全局单射参数化。

相关工作与启发

  • vs Vector Heat Method (Sharp et al., 2019):经典向量热传导法必须在高质量、无裂缝的三角流形网格上求解泊松方程与热扩散方程,无法直接运行于含噪无拓扑点云;本文通过神经隐式场完全摆脱了流形拓扑依赖。
  • vs NeuroGF (Zhang et al., 2023) / GeodesicEmbedding (Xia et al., 2021):此类方法主要针对标量测地距离场进行神经网络拟合;本文则更进一步,直接拟合向量值的切空间双向映射(Exp/Log Map),为几何变形迁移与曲面参数化提供了直接算子。
  • vs Neural Riemannian Distance Fields (NRDF, He et al., 2024):NRDF 侧重于关节人体姿态流形先验的学习;本文聚焦于任意非刚性几何表面本征微积分算子的学习与即时推断。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 首次将高阶微分几何双向映射(Exp/Log Map)转化为外温相对三平面神经场,消除了局部基底二义性。
  • 实验充分度: ⭐⭐⭐⭐☆ 覆盖了 ShapeNet、RawMesh、非均匀采样、高斯噪声点云、DFAUST 变形及 Kinect-v2 真实扫描。
  • 写作质量: ⭐⭐⭐⭐⭐ 概念清晰、理论推导扎实,几何动机与网络架构对应紧密。
  • 价值: ⭐⭐⭐⭐☆ 为离散几何处理、隐式曲面纹理贴图与流形深度学习提供了极高效率的可微算子支持。