BenchCAD
收藏资源简介:
BenchCAD是由弗吉尼亚大学等机构联合创建的工业计算机辅助设计基准数据集,包含17,900个经过执行验证的CadQuery程序,覆盖106个工业零件族。该数据集源自ISO/DIN/EN/ASME/IEC等工业标准,通过专家手工建模和参数化采样流程生成,确保了工程约束和几何精度。其核心应用在于评估多模态大模型在CAD代码生成、视觉问答和程序编辑等任务中的工业就绪能力,旨在解决现有系统在三维结构理解、参数化抽象和可执行程序合成方面的不足,推动工业CAD自动化的发展。
BenchCAD is an industrial computer-aided design (CAD) benchmark dataset jointly developed by the University of Virginia and other institutions. It contains 17,900 execution-verified CadQuery programs and covers 106 industrial part families. Derived from industrial standards including ISO, DIN, EN, ASME, and IEC, the dataset is generated through expert manual modeling and parameterized sampling workflows, ensuring compliance with engineering constraints and geometric accuracy. Its core application is to evaluate the industrial readiness of multimodal large language models (LLMs) on tasks such as CAD code generation, visual question answering, and program editing. This dataset aims to address the limitations of existing systems in three-dimensional structure understanding, parameterized abstraction, and executable program synthesis, thereby advancing the development of industrial CAD automation.
数据集概述
BenchCAD 是一个面向工业程序化计算机辅助设计(CAD)的综合性、基于行业标准的基准测试集。它旨在评估模型在工业CAD推理方面的能力,覆盖从视觉识别到复杂代码生成的多个层次。
核心特性
- 大规模执行验证:包含 17,900 个经过沙盒执行验证的 CadQuery 零件程序。
- 工业标准锚定:49% 的零件族(52/106)锚定于真实的 47 项 ISO、DIN、EN、ASME、IEC 规范表格。
- 丰富操作覆盖:涵盖 46 种不同的 CadQuery 操作,包括
helix、twistExtrude、polarArray、loft和sweep等高级操作。 - 能力分解设计:通过四项匹配任务,分解评估模型的视觉识别、参数抽象和代码合成能力。
发布数据集
BenchCAD 包含三个子数据集:
| 数据集 | 规模 | 描述 |
|---|---|---|
| BenchCAD | 17,900 个零件 | 经过验证的 CadQuery 程序,包含代码、STEP 文件、4视图、参数和操作标签。 |
| BenchCAD-QA | 2,400 个问答对 | 配对的图像/代码数值问答项目。 |
| BenchCAD-Edit | 748 个编辑对 | 经过验证的编辑前/编辑后程序对。 |
所有零件源自 106 个手工精心制作的工业零件族。每个数据集发布均附带 Croissant 1.0 元数据,代码采用 MIT 许可证,数据采用 CC-BY-4.0 许可证。
任务定义
BenchCAD 设计了四项匹配任务,以系统评估 CAD 推理能力:
- Vision2Code(img2cq):根据多视角渲染图生成 CadQuery 程序。通过交并比(IoU)、倒角距离(Chamfer)、豪斯多夫距离(Hausdorff)、特征F1分数(Feature-F1)、基础操作召回率(essential-op recall)和执行率(exec rate)进行评估。
- Vision QA(qa_img):基于多视角渲染图的几何推理(数值问答)。问题按四级能力层级(从 L1 整体视觉识别到 L4 空间推理)分解。
- Code QA(qa_code):基于 CadQuery 源代码的符号理解(数值问答)。问题与 Vision QA 共享题库,通过对比答案差异,分离视觉识别失败与参数推理失败。
- Code Edit(edit_code):根据自然语言指令编辑程序。包含五种编辑类型(T1–T5),从简单替换到复杂几何重建。评分指标为“净空归一化改进”(headroom-normalised improvement)。
领导者板概况
数据集页面提供了部分前沿模型的性能指标,用以展示基准测试的有效性。
- Vision2Code:在该任务中,基于 BenchCAD 训练的 Qwen3-VL-2B(RL, IID)模型取得了最高综合分(total ↑)0.7682,显著优于通用前沿多模态大模型(如 Gemini 3.1 Pro thinking 的 0.3970)。
- Vision QA & Code QA:在所有模型上,Code QA 的性能(最高总分为 0.838)显著优于 Vision QA(最高总分为 0.587),揭示了约 25 个百分点的模态差距,表明模型从代码中提取几何和参数信息远比从图像中可靠。
- Code Edit:在程序编辑任务中,GPT-5.3 (thinking) 取得了最高准确率(Accuracy) 0.865。五种编辑类型的表现从简单(T1)到困难(T5)依次递减,其中多块几何重建(T5)仍是最大挑战。




