本研究由清华大学软件学院的Yuanxu Sun、Yuezhou Ma、Haixu Wu、Guanyang Zeng、Muye Chen、Jianmin Wang和Mingsheng Long共同完成,通讯作者为Mingsheng Long与Haixu Wu。该论文发表于2026年在韩国首尔召开的第43届国际机器学习大会(ICML),收录于PMLR第306卷。研究团队提出了一种名为BreP2Shape的新型自监督预训练方法,旨在弥合计算机辅助设计(CAD)领域中抽象的边界表示(Boundary Representation, B-Rep)与直观的形状表示(Shape Representation)之间的鸿沟。
计算机辅助设计(CAD)是现代工程与制造业的基石,从消费品到航天器的设计均依赖于这一基础框架。B-Rep作为行业标准,通过精确的参数化几何实体与拓扑关系的复杂交互来编码三维几何形状。然而,传统的B-Rep模型分析高度依赖领域专家的人工操作,耗时且效率低下。近年来,深度学习方法在B-Rep模型处理方面展现出巨大潜力,但现有方法普遍面临一个根本性挑战:表征鸿沟(Representation Gap)。
具体而言,当前方法主要分为两大范式:连续方法与离散方法。连续方法(如BRT)利用参数化控制点实现分析精度,但这些数学化的抽象表达与实际的三维物理空间解耦,难以捕捉直观的形状属性。离散方法(如UV-Net和BrepNet)通过对参数域进行空间采样获得直观的形状表征,虽然易于理解,却牺牲了几何精度,且对离散化伪影敏感。这两种范式之间缺乏有效的桥接机制,导致模型难以同时兼顾数学严谨性与几何直观性。
为解决这一问题,研究团队提出了一个核心科学问题:如何学习一种既能保持数学严谨性、又具备几何直观性的通用B-Rep表征?这一问题对于推进CAD领域的深度学习应用具有基础性意义。
研究首先构建了一个包含250,000个B-Rep模型的大规模预训练语料库BreP2Shape-250k。该数据集整合了来自MFCAD、MFCAD++、TMCAD、FabWave、Fusion360Seg等多个基准数据集的模型,通过引入复杂制造几何体以增强几何多样性。预处理阶段,研究团队采用Böhm节点插入算法,将异构的NURBS实体近无损地分解为标准化的Bézier原语序列。具体而言,每个曲面被分解为固定数量的Bézier三角形面片,每条曲线被分解为Bézier曲线段,每个原语由固定数量的控制点定义,从而消除了原始数据的异构性。由此产生了两种互补的几何表征:边界表征P(由控制点集构成)和形状表征U(通过在参数域内均匀采样并经解析映射得到的三维空间点集)。
基于上述两种表征,BreP2Shape的核心预训练任务被形式化为学习从抽象边界表征到直观形状表征的映射关系,其优化目标为最小化预测空间点与真实空间点之间的均方误差。这一任务无需任何人工标注,天然适用于自监督学习范式。值得注意的是,该方法同时引入了面级和边级的监督信号,其中边级监督作为跨实体几何一致性约束,确保相邻曲面在共享边界处的空间对齐,这是区别于现有方法(如SSL4CAD)的重要设计。
为实现有效的表征对齐,本研究提出了双流Transformer(Dual Transformer)架构。该架构包含两个并行处理流,分别独立编码曲面令牌和曲线令牌,以保留其各自的几何特性。其核心创新在于拓扑注意力机制(Topology Attention):在面流中,通过面图(Face Graph)定义相邻面之间的连接关系,注意力偏置由共享边的嵌入向量经线性投影生成;在边流中,利用面图的对偶图——边图(Edge Graph)进行对称的信息交换。这种设计建立了面流与边流之间的双向信息流动,使模型能够利用B-Rep拓扑的内在对偶性,在保持细粒度局部几何信息的同时实现全局上下文感知。
在令牌化阶段,各Bézier原语首先通过MLP投影到隐空间,随后通过两个独立的Transformer编码器分别对面和边原语序列进行编码,并通过可学习的[CLS]令牌聚合为全局实体级嵌入。预训练时,在双流Transformer的最终层输出上添加任务特定的MLP预测头以重构形状表征;下游微调时,则替换为适配具体任务(如分割或分类)的预测层。
研究在四个广泛采用的基准数据集上进行下游任务评估:MFCAD++(加工特征分割,25类)、Fusion360Seg(语义分割,8类)、FabWave(细粒度零件分类,45类)和TMCAD(工业机械部件分类,10类)。预训练阶段使用AdamW优化器和MSE损失进行100轮训练,微调阶段切换为交叉熵损失,同样训练100轮。基线模型(UV-Net、AAGNet、BRT)则按其原始设置训练350轮以确保公平对比。评估指标包括分类的准确率(Acc)和分割的准确率与交并比(IoU)。
研究系统考察了数据规模和模型规模对性能的影响。数据扩展实验中,预训练数据从25,000增至250,000时,预训练损失显著降低11.6%,下游任务平均准确率从0.9379提升至0.9524。模型扩展实验中,当双流Transformer层数从2层增至12层(参数量从1.3M扩展至3.3M)时,预训练损失持续下降,下游性能稳步提升。这一扩展行为归因于自监督目标对边界与形状表征对齐的强制约束,以及B-Rep模型丰富的实体多样性与组合结构,使得数据规模增长能持续引入新信息而非冗余样本。
在分类任务上,BreP2Shape在FabWave和TMCAD两个数据集上均超越了现有方法。尤其在几何复杂度较高的TMCAD数据集上,BreP2Shape展现了更强的泛化能力,准确率达到82.64%。在分割任务上,BreP2Shape在MFCAD++和Fusion360Seg的准确率与IoU指标上均取得最优性能。值得注意的是,尽管仅使用100轮微调(基线方法使用350轮),BreP2Shape仍然实现了显著优势,验证了预训练表征的高效迁移能力。
在有限标注数据实验中,仅使用100个标注样本时,BreP2Shape在MFCAD++上达到47.9%准确率,而UV-Net和BRT分别为41.5%和44.8%。随着标注数据增加,BreP2Shape始终保持稳定的性能优势。在域迁移实验中,以Fusion360Seg为源域、MFCAD为目标域,BreP2Shape在目标域的100样本低数据情境下相较于SSL4CAD实现了约15%的绝对准确率提升,表明其学习的表征能够捕获跨数据集的共享几何与拓扑模式。
预训练策略消融显示,移除双流Transformer仅预训练令牌化器会导致预训练损失显著升高(面损失从1.855升至2.142,边损失从1.238升至1.287);移除边级监督则导致面损失上升至1.872,验证了拓扑交互与边级空间对齐对表征学习的重要性。微调策略消融表明,线性探测在TMCAD上已取得79.15%的竞争性表现,部分微调(仅训练双流Transformer)性能接近全微调,说明预训练表征本身已具备高迁移性,而拓扑编码器对于捕获复杂交互至关重要。骨干网络消融对比了GNN、Query-Former、面流Transformer等多种变体,默认的双流Transformer在结合拓扑注意力机制后取得了最优的整体表现。
通过t-SNE可视化对比,BreP2Shape的表征相较于原始边界表征展现出更清晰的类别分离,与形状表征的几何直觉更为一致。定量分析中,余弦相似度区分性得分(标签一致性差距)从边界表征的0.14提升至BreP2Shape表征的0.23,线性探测准确率从70.35%提升至84.65%,证实对齐目标产生了更具语义意义的特征空间。
BreP2Shape通过自监督预训练成功实现了抽象B-Rep参数与直观空间几何的对齐,为B-Rep深度学习提供了一种可扩展、泛化性强的解决方案。其科学价值在于揭示了边界表征与形状表征联合学习的有效性,以及拓扑先验在Transformer架构中的关键作用,为几何深度学习领域的表征对齐研究提供了新范式。
在应用价值方面,该方法通过消除对大规模标注数据的依赖,显著降低了工程与制造领域应用AI的门槛,有望推动智能CAD系统的发展。预训练模型可高效迁移至分类、分割等多种下游任务,且在小样本情境下表现出色,具备实际工业部署的潜力。
本研究的首要亮点在于提出了边界表征与形状表征对齐的创新自监督学习范式,将原本解耦的精确参数与直观几何统一到同一个表征空间中。其次,双流Transformer与拓扑注意力机制的设计精巧地融入了B-Rep的结构先验,在保持架构可扩展性的同时实现了面与边实体间的双向信息交换。第三,BreP2Shape-250k大规模预训练数据集的构建为模型的规模扩展性验证提供了坚实基础。最后,该工作在多个基准上仅用不足三分之一的微调轮数即超越现有最先进方法,展现了优越的收敛速度和泛化能力。