遇见数据集

CADFS

收藏
github2026-06-02 更新2026-06-03 收录
数据链接:
官方服务:

资源简介:

CADFS是一个大型CAD程序数据集和框架,用于基于大语言模型的计算机辅助设计。该数据集包含干净的FeatureScript表示、原始数据和草图规范,适用于训练和评估模型。

CADFS is a large-scale CAD program dataset and framework designed for large language model-based computer-aided design. This dataset includes clean FeatureScript representations, raw data, and sketch specifications, which are suitable for training and evaluating models.

创建时间:
2026-06-02
原始信息汇总

数据集概述:CADFS

CADFS 是一个大型计算机辅助设计(CAD)程序数据集和框架,旨在利用大型语言模型(LLMs)进行计算机辅助设计。

核心特性

  • 规模:基于 ABC 数据集构建,是一个大型 CAD 程序数据集。
  • 内容:包含 CAD 模型的 FeatureScript 程序表示、文本注释、多视角图像以及 STL/STEP 格式的参考模型。
  • 任务:支持文本条件生成(Text-conditioned Generation)和图像条件重建(Image-conditioned Reconstruction)。
  • 模型:提供了一个预训练模型 CADFS-2B,基于 Qwen2-VL-2B 架构。

数据集构成

数据集托管在 Hugging Face 上,主要包含以下部分:

  • dataset/featurescript_rp.zip:清洗后的 FeatureScript 程序文件,以 {chunk_id:04}/{model_id:08}.txt 格式组织。
  • dataset/text_annotations.zip:CAD 模型的文本注释文件。
  • raw/multiview_images_abc.zip:用于图像条件生成的多视角输入图像。
  • raw/stl_abc.zip:参考 CAD 模型的 STL 格式文件。
  • raw/featurescript_raw.zipraw/sketch_raw.zip:原始 FeatureScript 程序和草图数据。
  • train_data/:用于训练的 JSONL 格式文件,包含两个训练阶段(stage1 和 stage2)的数据,分别对应 DeepCAD 子集和完整 CADFS 数据集。
  • test_data/:用于测试的数据,包含 CADFS 测试子集和 DeepCAD 测试子集的 JSONL 文件、特征脚本、注释、图像及 STL 文件。
  • misc/:包含数据划分、去重索引等辅助文件。

框架与工作流程

该数据集提供了一个完整的框架,涵盖从数据准备到模型推理和评估的完整流程:

  1. 数据处理:提供从原始数据中获取清洗后 FeatureScript 程序的管道。
  2. 注释:提供使用 vLLM 服务(例如 openai/gpt-oss-120b)为 CAD 模型生成文本注释的管道。
  3. 数据集准备:将数据转换为标准的 JSONL 格式,并可为图像添加路径。
  4. 训练:推荐使用 LLaMA-Factory 进行训练,提供 stage1stage2 的训练配置文件。
  5. 推理:提供脚本,用于从 JSONL 测试文件进行文本条件生成或图像条件重建。
  6. 渲染:使用 Onshape API 将 FeatureScript 代码渲染为 STEP 格式的 B-rep 模型,或仅验证代码有效性。
  7. 评估:计算预测的 B-rep 与参考模型之间的 3D 重建指标,包括倒角距离(CD)、法线一致性(NC)和边缘距离(ECD)。

引用

bibtex @InProceedings{pyatov2026cadfs, author = {Pyatov, Vladislav and Bobrovskikh, Gleb and Galochkin, Saveliy and Boldyrev, Nikita and Voynov, Oleg and Filippov, Alexander and Ferrer, Gonzalo and Wonka, Peter and Burnaev, Evgeny}, title = {CADFS: A Big CAD Program Dataset and Framework for Computer-Aided Design with Large Language Models}, booktitle = {Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)}, month = {June}, year = {2026}, pages = {10176-10186} }

搜集汇总
数据集介绍
CADFS 数据集图片
构建方式
CADFS数据集源自ABC数据集中的CAD模型,通过提取其FeatureScript程序并经过深度清洗与标准化处理而构建。首先,从原始FeatureScript代码中去除冗余和噪声,保留纯净的程序表示。随后,利用大语言模型(如GPT-OSS-120B)对每个模型进行文本描述注释,生成了文本-代码对齐的标注。同时,借助多视角渲染技术从STL参考模型中生成图像数据,为图像条件生成任务奠定基础。此外,数据集还划分了DeepCAD子集,并通过去重和上下文窗口过滤机制,最终形成适用于两阶段训练的高质量JSONL格式样本。
使用方法
使用CADFS数据集时,用户首先需从HuggingFace下载原始数据,并通过提供的脚本解压并准备纯净的FeatureScript程序与标注文件。基于LLaMA-Factory框架,可加载预训练模型Qwen2-VL-2B,按照两阶段配置进行监督微调。推理阶段,用户需准备JSONL测试文件及对应图像,调用推理脚本生成预测的FeatureScript代码。随后,借助Onshape API将代码渲染为B-Rep实体模型,并通过评估脚本计算Chamfer距离、法向一致性等几何指标,全面验证生成结果的精度。
背景与挑战
背景概述
CADFS数据集由Vladislav Pyatov、Gleb Bobrovskikh等研究者在2026年创建,依托于新加坡南洋理工大学、英国萨里大学等多所机构合作完成。该数据集旨在解决计算机辅助设计(CAD)领域中,大型语言模型(LLM)对结构化CAD程序理解与生成能力不足的核心研究问题。CADFS基于ABC数据集中的CAD模型,通过自动化管线提取并清洗FeatureScript程序,构建了包含文本描述、多视角图像与对应CAD程序的大型多模态数据集,为文本条件CAD生成、图像条件重建等任务提供了标准化评估基准。其发布对推动LLM在工程制图、产品设计等工业应用中的智能化进程具有重要影响力。
当前挑战
该数据集面临的挑战首先在于CAD程序生成的核心技术难题,如何从稀疏的文本或图像输入中准确推断出复杂的三维几何构造与多步建模逻辑,是领域内长期存在的瓶颈。其次,在构建过程中,需要从原始ABC数据中提取非标准化、存在冗余或错误的FeatureScript代码,设计精密的清洗与规范化流程,同时通过大模型自动生成高质量文本描述,并确保图像与程序对齐的准确性。此外,处理超过百万级别的CAD模型,在计算资源分配、重复数据去重及长序列训练优化上也构成显著挑战。
常用场景
经典使用场景
CADFS数据集在计算机辅助设计领域中的经典使用场景是用于训练和评估能够生成结构化CAD程序的大语言模型。具体而言,研究者利用该数据集中海量的FeatureScript程序及其对应的文本描述与多视角渲染图像,构建从自然语言指令或多视图图像到参数化CAD建模程序的条件生成任务。这一场景充分发挥了大语言模型理解复杂编程语法和空间几何关系的能力,实现了从抽象需求到具体CAD实体模型的端到端生成,为智能设计自动化奠定了坚实的数据基础。
解决学术问题
该数据集有效解决了当前CAD领域两大核心学术难题:其一是缺乏规模充足、质量可靠的结构化CAD程序数据集,导致深度生成模型难以训练;其二是现有方法难以将非结构化的文本描述或二维图像直接映射为可编辑的参数化CAD模型。CADFS通过提供超过15万个经过精处理的FeatureScript程序及其多模态标注,突破了数据瓶颈,使得研究者能够系统性地探索多模态条件控制下的CAD程序生成,显著提升了生成模型在几何精度和程序正确性上的表现,推动了CAD智能化的理论发展。
实际应用
在实际工程应用中,CADFS数据集驱动的模型可实现高效的工业设计自动化流程。例如,设计师仅需输入一句描述性文本——“一个带法兰盘的旋转体”——模型即可自动输出对应的FeatureScript程序,进而生成可直接用于制造的实体模型。在生产逆向工程场景中,通过拍摄现有零件多视角照片,模型可重构出其参数化CAD模型,极大缩短了从实物到数模的转化周期。此外,该框架还支持对生成程序的编译与几何渲染验证,确保输出结果的工程可用性,在机械设计、产品研发和个性化定制等领域展现出广阔的应用前景。
数据集最近研究
最新研究方向
CADFS数据集聚焦于利用大规模语言模型(LLMs)实现计算机辅助设计(CAD)中的程序化建模,其最新研究方向涵盖文本条件生成、图像条件重建以及多模态CAD模型生成。该数据集包含了海量FeatureScript程序及对应的文本标注和多视图图像,为探索LLMs在三维几何推理与程序合成中的前沿能力提供了坚实基础。结合近年来大模型在代码生成与视觉理解领域的突破性进展,CADFS推动了将自然语言描述或二维图像直接转化为可编辑CAD模型的技术路径,显著降低了专业设计门槛。其意义在于不仅弥补了CAD领域大规模、高质量程序数据的缺失,还为三维创造与人工智能深度融合开辟了新范式,有望引领制造业、建筑可视化等行业的智能化变革。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务