遇见数据集

FllumaOne-100K

收藏
github2026-06-14 更新2026-06-26 收录
官方服务:

资源简介:

FllumaOne-100K是一个包含100,000个核验证程序化CAD样本的代码原生多模态CAD数据集,设计用于学习可编辑的CAD结构,而不仅仅是最终形状几何。它包括可执行的Python CAD程序、结构化特征树、紧凑训练IR、STEP几何、表面点云、规范渲染视图、文本监督和验证元数据。

FllumaOne-100K is a code-native multimodal CAD dataset containing 100,000 verified procedural CAD samples, designed for learning editable CAD structures rather than just final shape geometry. It includes executable Python CAD programs, structured feature trees, compact training IR, STEP geometry, surface point clouds, standardized rendered views, textual supervision, and validation metadata.

创建时间:
2026-06-06
原始信息汇总

数据集概述

FllumaOne-100K 是一个面向代码的原生多模态计算机辅助设计(CAD)数据集,包含 100,000 个经过内核验证的程序化 CAD 样本。该数据集旨在支持可编辑 CAD 结构的学习,而非仅关注最终形状几何。

数据集规模与划分

  • 总数: 100,000 个样本
  • 训练集: 80,000 个样本
  • 验证集: 10,000 个样本
  • 测试集: 10,000 个样本

数据组成与格式

每个样本包含以下内容:

  • 可执行的 Python CAD 程序 (program.py)
  • 结构化特征树 JSON 文件 (feature_tree.json)
  • 紧凑的训练导向中间表示 (training_ir.txt)
  • STEP 几何导出文件 (model.step)
  • 表面点云 NumPy .npz 文件 (point_cloud.npz)
  • 八张标准特征感知可见边缘渲染图(位于 images/canonical/ 目录)
  • 确定性及大语言模型辅助的文本描述(text/descriptions.jsontext/llm_descriptions.jsonl
  • 验证元数据(metadata.json

原始数据集按 100 个分片目录组织(shard_0000/shard_0099/),每个分片包含 1,000 个样本目录。此外,还提供机器学习就绪的 Parquet 表格(parquet/train.parquetparquet/val.parquetparquet/test.parquet),包含样本ID、类别、程序文本、特征树、训练IR、元数据、描述、图像及大文件引用等列。

支持的任务

  • 文本到 CAD 生成
  • 图像到 CAD 生成
  • 点云到 CAD 重建
  • CAD 程序合成
  • 特征树预测
  • 训练中间表示生成
  • 跨模态 CAD 检索
  • B-rep 特征提取
  • 自回归设计自动补全
  • 可编辑逆向工程

基线任务:文本到程序生成

本仓库研究的是文本到程序 CAD 生成任务。模型根据自然语言提示,生成使用 Flluma API 的 Python 程序。评估分为两个阶段:

  1. Python 级别检查: 语法有效性、所需 part 定义、源代码相似度和操作序列指标。
  2. Flluma 执行检查: 程序加载、CAD 构建成功、内核实体有效性和 STEP 导出有效性。

模型与训练配置

  • 基础模型: Qwen/Qwen2.5-Coder-1.5B-Instruct
  • 微调方法: LoRA
  • 提示模式: 混合使用确定性和大语言模型描述
  • 最大序列长度: 4096
  • 训练轮数: 1
  • 学习率: 2e-4
  • LoRA 秩: 16
  • LoRA alpha: 32
  • LoRA dropout: 0.05
  • 有效训练批次大小: 8
  • 报告 GPU: NVIDIA GeForce RTX 5060 Ti 16GB

环境要求

  • Python 3.12
  • PyTorch 2.10.0+cu128
  • Transformers 5.5.0
  • Datasets 4.3.0
  • Accelerate 1.13.0
  • PEFT 0.19.1
  • Safetensors 0.7.0
  • PyArrow 23.0.1

报告结果摘要

全测试集结果

指标 数值
测试样本数 10,000
Python 语法有效率 99.98%
所需 part 定义率 99.98%
Flluma 加载成功率 99.97%
Flluma 构建成功率 99.97%
内核实体有效率 99.14%
STEP 导出有效率 99.14%
平均源代码相似度 87.34%
操作精确率/召回率/F1 99.97%/99.95%/99.96%
操作最长公共子序列比例 99.94%

几何相似度评估(归一化对称 Chamfer 距离)

在 9,909 个点云对上评估:

指标 数值
平均 Chamfer 距离 0.00212409
中位数 Chamfer 距离 0.00149057
P90 Chamfer 距离 0.00350186
P95 Chamfer 距离 0.00485354

下载与许可

  • 下载链接: https://drive.google.com/drive/folders/1ksf5CooyMw0oWXue2AYsa1Cu5wrmesnH
  • 许可证: Creative Commons Attribution 4.0 International License (CC BY 4.0)

已知局限

  • 数据集为程序化生成,反映了 Flluma 生成管线的模板族、参数范围、验证约束和 API 约定,应视为合成 CAD 建模基准和训练语料库,而非人类设计的工业 CAD 分布全集。
  • 文本监督包含模板生成和大语言模型辅助,可能包含偶尔的措辞伪影或文本-CAD 一致性问题。
  • 基准实验为可重复的文本到程序参考实验,不包含模型权重,不声称具备开放领域 CAD 设计能力。

引用

bibtex @dataset{fllumaone100k2026, title = {FllumaOne-100K: A Code-Native Multimodal CAD Dataset}, author = {FllumaOne Dataset Authors}, year = {2026}, note = {Dataset release} }

搜集汇总
数据集介绍
FllumaOne-100K 数据集图片
构建方式
FllumaOne-100K是一个代码原生的多模态计算机辅助设计数据集,它通过Flluma系统生成,该系统是基于OpenCASCADE的Qt/C++ CAD平台。数据集的构建始于可执行的Python CAD程序,这些程序在Flluma环境中运行,并经过内核验证。每个样本均从特征树(feature_tree.json)出发,衍生出结构化的特征树JSON文件、紧凑的训练中间表示、STEP几何体、表面点云、八视角标准渲染图像以及文本描述等多种模态数据。最终通过严格的几何有效性、导出状态及特征树一致性等验证流程,筛选出十万个合格样本,并划分为八万训练、一万验证与一万测试样本。
特点
该数据集的核心特点在于其代码原生性与多模态对齐能力。与仅关注最终形状几何的传统CAD数据集不同,FllumaOne-100K提供了可编辑的结构化设计信息,涵盖可执行的Python程序、特征树、训练中间表示、STEP几何、点云、渲染视图及文本描述。样本在生成过程中均通过了Flluma运行时与OpenCASCADE几何内核的双重验证,确保了几何与程序的一致性。此外,数据集还提供了Parquet格式的机器学习表格,便于直接加载训练。基于这些特性,数据集可支持文本生成CAD、图像生成CAD、点云重建、CAD程序合成、特征树预测、跨模态检索及逆向工程等多种可编辑CAD学习任务。
使用方法
使用FllumaOne-100K时,用户可先从Google Drive下载完整压缩包并解压至本地目录。在复现文本生成程序基线时,通过运行提供的Shell或PowerShell脚本依次完成数据准备、LoRA微调、预测生成与评估。训练采用Qwen2.5-Coder-1.5B-Instruct作为基座模型,结合混合确定性描述与大语言模型增强描述作为提示语。评估分两阶段进行:首先在Python层面检查语法、函数定义及操作序列相似性,随后在Flluma环境中验证程序的加载、构建、内核实体有效性及STEP导出。此外,还可使用归一化对称Chamfer距离评估生成几何与参考点云的相似度。所有结果摘要均存储在results目录中,便于论文撰写与分析。
背景与挑战
背景概述
FllumaOne-100K数据集由FllumaOne团队于2026年创建,旨在推动计算机辅助设计(CAD)领域从传统几何建模向可编辑结构学习的范式转变。该数据集依托于基于OpenCASCADE的Qt/C++ CAD系统Flluma,通过可执行Python程序生成10万经内核验证的程序化CAD样本,覆盖训练、验证与测试子集。其核心研究问题在于弥合自然语言描述与可编辑CAD结构之间的鸿沟,支持文本到CAD生成、特征树预测、跨模态检索等多样化任务。FllumaOne-100K的发布为CAD智能建模与逆向工程研究提供了标准化的多模态基准平台,对提升计算机辅助设计的自动化与可编辑性具有重要影响力。
当前挑战
FllumaOne-100K所解决的领域挑战在于打破传统CAD数据集仅关注最终形状几何的局限,转向学习具有结构可编辑性的CAD程序表示,这要求模型在理解自然语言的同时,精确生成符合CAD内核执行规范的Python代码序列。在构建过程中,挑战尤为严峻:首先,需设计一套从Python程序到几何模型的全自动验证流水线,确保每个样本经Flluma运行时与OpenCASCADE内核的严格测试;其次,需在100K规模上协调多模态数据对齐,包括程序、特征树、STEP几何、点云与文本描述之间的一致性;此外,模板与大语言模型辅助的文本监督可能引入语义伪影,需通过元数据校验维护数据质量,同时避免过度拟合单一API模板分布,以保障基准实验的可泛化性。
常用场景
经典使用场景
在计算机辅助设计与自然语言处理交叉领域,FllumaOne-100K数据集最经典的使用场景是文本驱动CAD程序生成。研究者利用该数据集中的10万组真实CAD样本(每份包含执行Python程序、特征树、训练中间表示及多模态几何数据),训练语言模型根据自然语言描述自动合成可执行CAD代码。数据集通过严格的Flluma内核验证确保每个样本都是几何完备且可导出的实体模型,为从文本注释到程序化设计建模范式提供了高质量、可复现的基准,推动了自然语言操控三维建模能力的系统化研究。
解决学术问题
该数据集精准回应了CAD领域长期存在的两大核心难题:一是缺乏大规模、内核验证的跨模态程序化设计数据,导致文本到CAD模型学习依赖最终几何而非可编辑结构;二是现有数据多采样自封闭库或纯形状文件,无法支持结构化特征预测与程序合成。FllumaOne-100K通过同步提供可执行代码、特征树、STEP几何、点云及规范渲染图,首次将学习重点从静态几何转移到可编辑CAD结构,使模型不仅能复现外形,更能理解参数化建模流程,显著提升了文本驱动CAD任务在语法、语义与几何一致性上的评估基准。
衍生相关工作
基于FllumaOne-100K已衍生出多项标志性工作:基线实验中研究者采用Qwen2.5-Coder-1.5B-Instruct结合LoRA微调,在99%以上测试样本上实现了语法与内核构建成功,并引入混合确定性与大语言模型描述提示策略(prompt-source evaluation),揭示了提示来源对生成性能的非影响性;进一步衍生工作包括标准化对称Chamfer距离几何相似度评估方法,在9,909组点云对上获得平均0.0021的偏差量,以及面向LLM-only提示源的鲁棒性测试,为后续多模态CAD生成模型的评估框架与可靠复现基准树立了典范。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务