跳转至

Masked BRep Autoencoder via Hierarchical Graph Transformer

会议: ECCV2026
论文: ECCV 原文
领域: 3D 视觉 / 自监督学习
关键词: 边界表示、掩码自编码器、层次图 Transformer、跨尺度注意力、CAD 表示学习

一句话总结

本文保持 CAD 边界表示的拓扑不变,掩去面与边的原始几何和属性,用双分辨率跨尺度注意力及局部消息传递重建它们,从而获得可迁移的表示,在 MFInstSeg 的 0.1% 标注设置下取得 88.75% 面级准确率。

研究背景与动机

工业 CAD 模型不仅描述物体外观,还保存可供制造和编辑使用的精确曲面、曲线及连接关系。 边界表示(boundary representation,BRep)把这些连续几何与离散拓扑放在同一数据结构中。 因此,识别一个面对应孔壁、倒角还是某种建模操作,不能只看散落的采样点,还需要知道它与哪些面相连。 UVNet 等方法通过曲面 UV 采样和图神经网络利用这些信息,但主要依靠局部邻域传播。 另一方面,企业 CAD 数据常受知识产权约束,获得大量高质量任务标签并不容易。

无标注预训练可以缓解标签稀缺,却仍需选对模型与学习目标。 纯局部消息传递难以直接捕获相距较远但几何相关的面,而平坦 Transformer 又没有显式分开整体结构和细小曲面变化。 例如,大平面与小圆角可能同时存在,统一密集采样会让许多相似平面信号与关键细节一起进入表示。 如果只在已经编码好的特征上掩码,编码阶段还可能提前泄露待恢复几何的信息。 论文因此同时改造预训练输入和图编码器,而不是单纯换一个更宽的注意力网络。

其切入点是让粗分辨率面表示提炼全局上下文,再用这个上下文指导细分辨率表示,并最终回到真实邻接关系。 这里的“层次”主要指双分辨率几何与由全局到局部的计算顺序,不是把 CAD 装配树逐层池化。 任务仍是表示学习,掩码恢复只是训练信号,不等于直接生成可编辑、拓扑有效的完整 CAD 文件。 核心 idea:在不删除拓扑连接的前提下掩去原始几何,用跨尺度全局交互和局部拓扑传播共同推断缺失信息,再将编码器迁移到少标注任务。

方法详解

整体框架

输入是已有拓扑的 BRep,面成为几何属性邻接图(gAAG)的节点,BRep 边成为带属性的图边。 预训练从原始几何与属性的随机掩码开始,再进行双分辨率编码、跨尺度互注意力和局部消息传递。 两阶段解码器先恢复图特征,再恢复显式几何与属性,未掩码输入提供重建监督。 下游阶段移除重建解码器,接上面级或形状级任务头,对完整编码器和任务头一起微调。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
        Input["BRep 几何、属性<br/>及固定邻接图"] --> Mask["输入级掩码"]
        Mask --> Embed["双分辨率几何编码"]
        Embed --> Global["跨尺度互注意力"]
        Global --> Local["局部拓扑传播"]
        Local -->|预训练| Decode["两阶段重建监督"]
        Input -.->|未掩码目标与停止梯度| Decode
        Local -->|下游:完整输入| Head["面级或形状级任务头"]

关键设计

1. 输入级掩码:隐藏观测,但保留关系骨架

默认随机掩去 70% 的面与边的原始几何及属性,而不是先完整编码后再掩去潜在特征。 模型因此不能直接读取被遮蔽实体的原始几何,需要从剩余面、边和全局上下文推断它们。 掩码并不删除图节点或图边,原有拓扑在整个预训练中保持不变。 这使任务成为“已知连接关系下补充几何信息”,而非同时猜测图结构和几何。 作者将其解释为更严格的信息瓶颈:先阻断输入,再学习如何汇聚上下文。 正文没有给出原始通道的具体掩码填充值,不应自行认定全部置零或采用某种特定 mask token。

与无掩码自编码相比,模型不能只学习近似恒等映射。 与潜在 gAAG 掩码相比,被掩实体的原始观测不会先经过本次受损输入的 BRep 编码分支。 这两种差别在表 4 中分别有对照,不能把它们合并成泛泛的“加了预训练”。

2. 双分辨率几何编码:同一曲面保留粗结构与细节两种视图

每个面在 UV 参数域上分别采样 \(3\times3\)\(13\times13\) 网格。 每个采样点包含坐标 3 维、法向 3 维和裁剪指示 1 维,共 7 维几何信息。 面属性为 16 维,包括类型 6 维、面积 1 维、质心 3 维和包围盒 6 维。 裁剪指示帮助表示参数域中哪些位置属于实际曲面,而非把整张参数矩形都当作有效表面。 每条边均匀采样 13 个点,以坐标、切向和两侧面的法向组成 12 维几何信息。 边属性为 9 维,包含类型 5 维、长度 1 维和凸性 3 维。

两路 2D CNN 分别将粗、细面几何编码为 256 维,属性 MLP 产生 128 维向量。 每一路面几何向量与属性向量拼接,再经 MLP 得到各自独立的 256 维节点嵌入。 边几何通过 1D CNN 得到 256 维,边属性通过 MLP 得到 128 维,再融合成 256 维边嵌入。 因此,后续注意力处理的是每个面的双分辨率特征,而不是把所有 UV 采样点都直接当作注意力 token。 粗、细分支对应同一批面,不能据此推断粗分支的面节点数量更少。 其归纳偏置是分开不同采样尺度的几何内容,而非已证明的注意力复杂度降阶。

3. 跨尺度互注意力:先聚合全局线索,再反向细化高分辨率特征

跨尺度互注意力(cross-scale mutual attention,CSMA)将面特征分成低分辨率与高分辨率两组。 低分辨率特征作为查询,从高分辨率特征提取细节,再通过自注意力聚合全局上下文。 更新后的全局上下文随后指导高分辨率特征细化,同时融合显式边特征。 网络连续堆叠两个 CSMA 块,使整体信息与局部几何有机会反复交换。 与对所有面统一执行单层级交互相比,这条有方向的跨尺度路径强调先提炼再反馈。 作者认为它可避免冗余平面细节压过关键几何变化,表 4 的单分辨率及加宽对照支持这一设计的任务收益。

需要注意,全文抽取中的式 (1)–(2) 已损坏,无法可靠还原全部嵌套注意力操作。 上述流程依据第 6–7 页正文和图 3 的说明,不将推测的算子顺序写成作者的精确公式。 正文说明边特征参与高分辨率细化,但其完整张量组织仍需原始图式或补充材料确认。

4. 局部拓扑传播:全局上下文之后,重新强调实际相邻关系

第二个 CSMA 块输出的高分辨率面特征,与边特征一起进入消息传递神经网络(MPNN)。 MPNN 沿给定邻接图聚合信息,使几何相关性与实际面到面的连接关系共同约束表示。 这一步的意义不只是增加网络深度:全局注意力可以联系远处的面,局部传播则明确谁与谁共享边界。 网络得到的潜在面特征用于面级预测,潜在图表示也可以接形状级分类任务头。 正文将具体任务头实现放在补充材料,本笔记不假定其池化方法或逐层结构。

顺序本身是一个可检验的设计选择。 把 MPNN 放到 Transformer 之前,在 MFInstSeg 的 0.1% 标注设置下准确率变为 76.39%,低于默认的 88.75%。 这一对照支持该配置中的“先全局、后局部”,但不意味着所有图任务都应该照搬同一顺序。

5. 两阶段重建监督:先恢复图表示,再恢复显式几何

图解码器采用 MPNN,从潜在面、边特征中恢复中间图特征。 随后,BRep 解码器用 FoldingNet 分支恢复面和边的几何,用两个 MLP 分支恢复面、边属性。 面几何输出对应 7 维采样信号,边几何输出对应 12 维采样信号;属性输出分别为 16 维和 9 维。 面侧只重建高分辨率特征及其几何,而不另外重建低分辨率网格;边侧重建边特征和原始信息。 高分辨率目标包含更细几何,可让恢复过程关注小结构,而不只是大致外形。

完整、未掩码 BRep 经 BRep 编码器产生中间特征目标,该目标分支使用停止梯度。 于是网络既要恢复合理的显式几何,又要让图解码结果对齐完整观测的特征。 作者将停止梯度描述为防止表示坍塌的措施,但不能把这个目标分支理解为文中未说明的 EMA 教师。 图中虚线表示训练监督,不是推理时额外访问完整答案。

一个完整示例

考虑带平面、孔壁和圆角的机械零件;以下是机制示意,不是论文新增的定量实验。 同一个大平面会形成粗、细两套 UV 采样,圆角面也采用这两种分辨率。 预训练若遮蔽圆角面的观测,邻接图仍告知模型它与哪些面相连。 粗分支从保留的细分辨率特征中汇总整体形状线索,细分支再结合全局上下文与边信息更新。 之后 MPNN 沿真实相邻关系传播信息,解码器尝试恢复被遮蔽面的几何与属性。 转入加工特征识别时,不再执行随机掩码或重建,任务头直接根据编码结果给各面分类。

损失函数 / 训练策略

第 8 页列出五类监督:潜在特征对齐、面几何重建、面属性重建、边几何重建和边属性重建。 监督覆盖所有面与边,而不是只计算被掩码实体的误差。 损失的精确形式、权重和属性回归细节在未提供的补充材料中,因此这里不编写总损失公式。 预训练使用 AdamW、批量大小 128、初始学习率 \(10^{-4}\)、余弦衰减,训练 100 个 epoch。 默认掩码比例为 70%,实验硬件为单张 NVIDIA A800。 加工特征识别微调 200 个 epoch,任务头学习率为 \(10^{-4}\),预训练编码器学习率为 \(10^{-5}\)。 常规设置更新整个网络;只训练任务头的 Frozen encoder 是独立消融,不是默认评测协议。

实验关键数据

主实验

第 9 页报告预训练候选集合为 283,018 个模型,其中 SolidLetter 只取 25,000 个样本,而非其完整的 96,861 个模型。 按作者描述,仅合并训练部分得到 198,113 个无标注模型,下游测试集不进入预训练或微调。 加工特征识别使用 80%/10%/10% 划分,建模分割与分类使用 70%/15%/15%。 Acc 在前两类任务中为面级准确率,mIoU 为类别交并比的平均值;分类 Acc 则以整个形状为单位。 表中所有结果单位均为 %,只比较同一数据集、同一监督设置的行。

下表摘录原文表 1(第 11 页),三个数据集均包含 25 个加工特征类别。

数据集 标注比例 方法 Acc mIoU
MFInstSeg 0.1% BRepFormer 33.43 7.47
MFInstSeg 0.1% BRepMAE 87.93 66.53
MFInstSeg 0.1% 本文 88.75 66.38
MFInstSeg 0.5% BRepMAE 94.86 83.38
MFInstSeg 0.5% 本文 96.19 87.21
MFCAD++ 0.1% BRepMAE 86.38 65.75
MFCAD++ 0.1% 本文 89.19 67.29
CADSynth 0.1% BRepMAE 93.55 78.40
CADSynth 0.1% 本文 93.82 79.29
MFInstSeg 100% BRepFormer 99.62 98.75
MFInstSeg 100% 本文 99.53 98.47

下表摘录原文表 2(第 12 页):Fusion 360 Gallery 的 8 类建模分割,10-shot 指总计 10 个有标签训练样本,不是每类 10 个。

方法 10-shot Acc 10-shot mIoU 完整数据 Acc 完整数据 mIoU
BRep-BERT 59.26 19.02 95.14 82.88
BRT 54.98 13.54 94.48 79.23
BRepFormer 50.24 12.31 94.02 78.73
本文 72.33 34.63 97.02 86.75

原文表 3(第 13 页)的 SolidLetter 分类则按每类 10 或 20 个样本训练,共 26 类,不能与上表的 shot 预算直接等同。 本文的 10-shot、20-shot、完整数据 Acc 分别为 82.51%、89.58%、97.91%;去掉预训练中的 SolidLetter 后,Ours* 分别为 81.83%、88.47%、97.78%。

消融实验

下表摘录原文表 4(第 14 页),均为 MFInstSeg 面级 Acc(%),下游监督比例是列标题,掩码比例属于预训练配置。

配置 0.1% 标注 0.5% 标注 100% 标注
单分辨率,仅 \(13\times13\) 85.83 93.14 99.27
单分辨率,512 维 87.17 95.46 99.41
三分辨率,增加 \(7\times7\) 86.41 94.46 99.42
MPNN 前置 76.39 92.10 99.06
无掩码,0% 66.41 84.19 99.43
掩码 gAAG 特征 78.63 92.98 99.16
冻结编码器 82.01 92.71 98.64
本文,默认 70% 掩码 88.75 96.19 99.53

关键发现

  • 在 0.1% 标注下,去掉掩码使 Acc 从 88.75% 降至 66.41%,相差 22.34 个百分点;说明学习目标不是次要配件。
  • 单分辨率加宽到 512 维仍只有 87.17%,但没有方差或显著性检验,不能把所有微小差异都解读为稳定优势。
  • 本文并非逐项领先:MFInstSeg 的 0.1% mIoU 为 66.38%,略低于 BRepMAE 的 66.53%;全标注时也低于 BRepFormer。
  • 表 5(第 15 页)在平均 30 个面的模型上报告下游网络 6.09M 参数、5.26G FLOPs、10.42 ms 延迟和 96.01 models/s;不能外推为大型装配体的速度。

亮点与洞察

  • 输入级掩码和拓扑保留相互配合:模型失去直接几何答案,却仍有关系骨架可供推断。这比笼统地“对 CAD 使用 MAE”更明确。
  • 双分辨率不是多加一组特征后简单拼接,而是通过有方向的跨尺度交互组织信息。加宽与三分辨率消融使这个选择有了具体对照。
  • 冻结编码器仍达到 82.01% 的低标注 Acc,说明收益不完全来自下游端到端拟合。不过它只证明该任务设置下的表示可用性。

局限与展望

  • 作者明确指出双分辨率采样增加预处理与存储开销,大型工业装配体会遭遇内存和训练序列长度瓶颈。
  • 原文式 (1)–(4) 在文本抽取中损坏,补充材料未包含于指定来源;注意力完整公式、损失细节与任务头无法在此精确复现。
  • 第 9 页称预训练取各数据集 70% 训练部分,但加工任务使用 80% 训练划分;二者如何嵌套应通过实际划分清单核实,不能仅据正文断言泄漏或已独立验证无泄漏。
  • BRep-BERT 的分类结果取自原论文,而非同一代码重跑;这是解释公平性时应保留的边界。
  • 表 4 未报告多随机种子方差;极少标注抽样可能带来波动,建议增加重复试验及更大装配体的成本分析。

相关工作与启发

  • 对比 UVNet / AAGNet:保留面、边几何与图邻接这一基础,本文进一步引入跨尺度全局交互和自监督预训练,而不是放弃拓扑改用纯点云。
  • 对比 BRepMAE:直接掩原始输入,并在局部 MPNN 之前加入层次注意力;表 1 的少标注收益同时伴随个别 mIoU 例外。
  • 对比 BRepFormer:少标注优势涉及预训练与架构两项差别,不能把与从零训练基线的全部差距都归因于 CSMA。
  • 研究启发:可考虑依据曲率或几何复杂度选择采样密度,以缓解作者指出的存储瓶颈;这属于读者建议,论文没有验证自适应采样。

评分

  • 新颖性: 4/5。输入级掩码、双分辨率交互和全局到局部组织形成明确组合,基础模块本身并非全新。
  • 实验充分度: 4/5。覆盖三类任务、跨数据集预训练对照和多组消融,但重复试验与完整复现信息不足。
  • 写作质量: 3/5。主线清晰,若干关键实现依赖补充材料;本次公式抽取损坏不等于原始排版错误。
  • 价值: 4/5。对标签稀缺的 CAD 表示学习有实践意义,应用范围仍受大型装配体开销限制。