遇见数据集

cadena-bench

收藏
Hugging Face2026-08-04 更新2026-08-05 收录
官方服务:

资源简介:

CADENA-Bench是一个用于CAD逆向工程基准测试的数据集,专注于真实机械零件。数据来源于MCB、TMCAD和CADNet三个公开数据集,经过去除平凡和重复几何后,根据零件功能划分为六个家族:轴与衬套(762个)、齿轮与轴承(749个)、壳体与框架(359个)、杠杆与型材(463个)、弹簧与紧固件(1046个)、工装与量具(17个),总计3396个零件。每个样本包含零件ID、家族标签、网格文件、网格二进制数据、八个视角(六个轴对齐和两个等轴测)拼接而成的图像,以及用于逐步推理的提示文本。该数据集用于评估CAD逆向工程方法,特别是针对旋转和阵列几何体的重建能力。评估指标采用GMS(几何匹配分数),要求预测点与目标点距离足够近且法线方向一致,无效预测不计入平均分。数据集已与强化学习训练集去重,确保无重叠。

CADENA-Bench is a benchmark dataset for CAD reverse engineering, focusing on real mechanical parts. The data is sourced from three public datasets: MCB, TMCAD, and CADNet. After removing trivial and duplicate geometries, the parts are categorized into six families based on their functions: Shafts and Bushings (762), Gears and Bearings (749), Housings and Frames (359), Levers and Profiles (463), Springs and Fasteners (1046), and Tools and Gauges (17), totaling 3,396 parts. Each sample includes a part ID, family label, mesh file, mesh binary data, an image composed of eight views (six axis-aligned and two isometric), and a prompt text for step-by-step reasoning. The dataset is used to evaluate CAD reverse engineering methods, particularly their ability to reconstruct rotational and array geometries. The evaluation metric is GMS (Geometry Matching Score), which requires predicted points to be sufficiently close to target points with consistent normal directions; invalid predictions are excluded from the average score. The dataset has been deduplicated with the reinforcement learning training set to ensure no overlap.

创建时间:
2026-08-02
原始信息汇总

CADENA-Bench 数据集概述

基本信息

  • 数据集名称:CADENA-Bench
  • 任务类型:图像到文本(image-to-text)
  • 许可协议:MIT
  • 数据规模:1K < n < 10K,共 3396 个样本
  • 数据集大小:约 13.05 GB(下载大小约 6.4 GB)

数据集简介

CADENA-Bench 是一个用于 CAD 逆向工程的基准测试数据集,专注于真实机械零件。数据来源于 MCB、TMCAD 和 CADNet,剔除了平凡和重复的几何形状,并按六个零件族进行分组,以便更清晰地暴露方法的弱点。数据集中所有零件均来自真实机械零件,合计 3396 个零件。

数据划分

  • 训练集:3396 个样本,总字节数约 13.05 GB

零件族分布

零件族 数量
shafts_and_bushings 762
gears_and_bearings 749
housings_and_frames 359
levers_and_profiles 463
springs_and_fasteners 1046
tooling_and_gauges 17
总计 3396

注:tooling_and_gauges 样本量较小,其对应的评分不应作为排名参考。

数据字段

字段名 内容说明
part_id 零件标识符
family 所属零件族
mesh 目标网格的二进制数据
mesh_file 目标网格文件名
image 八张目标视图拼接图(六个轴对齐视图 + 两个等距视图)
prompt 用于逐步推断的提示词

数据纯净性

原始评估集包含 3504 个零件,其中 108 个网格与强化学习训练语料库中的网格字节完全相同,这些重复网格已从该基准中移除。因此,本基准与 RL 训练集无交集。移除过程可通过哈希对比所有网格并剔除精确内容匹配来复现。

评估方法

论文采用 GMS(几何匹配分数) 对预测结果进行评分。GMS 要求预测点既要在距离上足够接近目标点,又要法线方向一致(满足 ‖p − q‖ ≤ τn_p · n_q ≥ cos α),从而反映表面是否被正确重建,而非仅关注体积是否填充。预测失败或非水密的模型结果视为无效,无效结果计入无效率并从均值统计中排除。

使用示例

python from datasets import load_dataset

ds = load_dataset("kulibinai/cadena-bench", split="train") gears = ds.filter(lambda r: r["family"] == "gears_and_bearings")

相关资源

  • 论文:CADENA: Stepwise CAD Reverse Engineering(arXiv:2608.00799)
  • 代码:https://github.com/zhemdi/cadena
  • 模型:https://huggingface.co/kulibinai/cadena

引用格式

bibtex @article{cadena2026, title = {CADENA: Stepwise CAD Reverse Engineering}, author = {Kabisov, Soslan and Savrasov, Gennadiy and Elistratov, Maksim and Rodriguez, Antonio and Ignatiev, Daniil and Gavrilov, Nikita and Uzdenov, Rustam and Boyko, Alexey I. and Pasechnik, Igor and Konushin, Anton and Kuznetsov, Andrey and Zhemchuzhnikov, Dmitrii}, year = {2026}, eprint = {2608.00799}, archivePrefix = {arXiv}, primaryClass = {cs.CV}, url = {https://arxiv.org/abs/2608.00799} }

搜集汇总
数据集介绍
cadena-bench 数据集图片
构建方式
CADENA-Bench基准数据集专为真实机械零件的CAD逆向工程评估而构建,其数据源涵盖MCB、TMCAD及CADNet等多个权威CAD模型库,剔除了琐碎与重复的几何形状,并依据零件功能与结构特征划分为六大类别,如轴套、齿轮轴承、壳体框架等,共汇集3396个真实机械零件样本。每个样本均提供目标网格文件、八视图拼接图像(含六个轴对齐视图与两个等距视图)、参考CAD程序及其路径、逐步推理提示词以及所属家族标签,构建过程严谨规范。为防范数据污染,构建者通过哈希比对去除了与强化学习训练集字节级重复的108个网格,确保基准与训练集互不重叠,从而保障评估结果的纯净性与可靠性。
特点
该数据集的核心特色在于聚焦真实机械零件,其几何复杂度远超常见的草图-拉伸合成数据,能够显著暴露学习方法在旋转与阵列特征上的性能短板,统计显示各方法在GMS指标上平均损失近半。数据集按零件家族分组报告性能,避免聚合分数掩盖关键失败模式,同时提供多视角图像与参考程序等多模态信息,便于多角度评估。此外,严格的数据清洗与去重措施确保了基准的独立性,小样本的tooling_and_gauges类别虽不可作为排名依据,但丰富了数据多样性,为研究细粒度逆向工程能力提供了独特视角。
使用方法
研究人员可通过HuggingFace数据集API便捷调用,例如使用datasets库的load_dataset函数加载训练集,并依据家庭标签进行条件筛选以聚焦特定类别。数据集支持逐步逆向工程推理任务,其prompt字段预置了推理引导,结合图像与网格输入,可评估模型在真实机械零件上的CAD程序生成质量。官方提供的评估指标GMS要求预测点与目标点空间邻近且法向一致,严格判定表面重建效果,无效或非水密预测计入无效率,确保评价的客观性。配套的开源代码与预训练模型可复现论文实验,便于深入分析。
背景与挑战
背景概述
CADENA-Bench基准数据集诞生于计算机辅助设计(CAD)逆向工程领域研究的关键时期,由Kabisov等学者于2026年创建并发布,旨在应对从真实机械零件中自动重建CAD模型这一核心挑战。该数据集精心整合自MCB、TMCAD和CADNet三大来源,剔除简单及重复几何体后,汇聚3396个真实机械零件,并依据零件功能特性划分至六个家族(如轴与轴套、齿轮与轴承等),以精细评估逆向工程方法的性能。其发布依托arXiv预印本及开源代码,为领域研究者提供了标准化测试平台,有力推动了CAD逆向工程技术从理论走向实用,对提升制造自动化与数字孪生构建的精准度具有深远影响。
当前挑战
CADENA-Bench所针对的领域挑战在于现有学习方法在真实机械零件上的泛化能力显著不足,评测揭示从合成草图-拉伸语料迁移到此类零件时,GMS指标平均下降近半,尤其在旋转体与阵列特征上性能急剧退化,凸显了传统方法对复杂几何结构的建模局限性。构建过程中面临多重难题:需从多个异构CAD数据源中提取并清洗大量零件,严格去除与强化学习训练集重复的108个网格以避免数据污染,同时确保零件分类的科学性与全面性;此外,还须设计鲁棒的评估协议以区分无效预测,并逐家族报告结果以暴露方法弱点,这些均对数据集的构建精度与公正性提出了极高要求。
常用场景
经典使用场景
CADENA-Bench作为CAD逆向工程领域的基准测试集,聚焦于真实机械零件的三维重建与程序化建模。其经典使用场景在于评估从网格或图像到CAD模型序列的生成方法,即给定零件的多视角渲染图像或网格数据,模型需输出可执行的CAD操作序列(如草图-拉伸、旋转、阵列等)。数据集按六个零件族划分,使得研究者能够细致剖析算法在不同几何特征下的表现差异,尤其针对回转体与阵列特征等复杂结构。这一基准的独特性在于剔除了平凡与重复几何,迫使模型面对实际工业零件的复杂度,从而验证其泛化能力与鲁棒性。
解决学术问题
该数据集解决了CAD逆向工程中缺乏真实零件基准的突出问题。以往研究多基于合成草图-拉伸型零件,导致算法在真实机械零件上性能骤降,而CADENA-Bench通过精心构建的3396个零件,揭示了现有学习方法在回转体与阵列特征上的显著失效,使得性能瓶颈不再被平均指标所掩盖。它提供了严格的评估协议(如GMS指标与有效性检查),确保了结果的可比性与可靠性,推动了该领域从玩具样例向工业级应用的过渡,为后续研究树立了新的评价标杆。
衍生相关工作
CADENA-Bench的发布催生了多项衍生工作。其核心方法论——逐步逆向工程(Stepwise CAD Reverse Engineering)——被后续研究广泛借鉴,如改进的序列生成模型、强化学习策略以及结合图神经网络的程序合成方法。该基准的评估指标(GMS)与去污染策略成为新基准设计的参考模板,推动了更严谨的评估实践。此外,基于该数据集,研究者探索了多模态学习(图像、网格与程序联合建模),并衍生出零件解析、形状识别等子任务,形成了围绕真实工业零件基准的活跃研究分支。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务