遇见数据集

FDM-gcodes

收藏
Hugging Face2026-08-03 更新2026-08-04 收录
官方服务:

资源简介:

FDM G-Codes 数据集是一个大规模、高多样性的熔融沉积成型(FDM)G-code 数据集,由 kpoc/3d-models 数据集(源自 Printables)中的 STL 文件经 PrusaSlicer 迭代切片生成。每个原始 STL 文件默认生成 10 个变体,每个变体使用高度随机化的配置参数,包括打印机配置文件(涵盖 Generic FDM、Prusa、Creality、Voron、Anycubic、Bambu、Artillery 等)、喷嘴直径(0.25mm-0.8mm)、耗材类型(PLA、PETG、ABS、ASA、TPU)、层高、填充密度(0-100%)、填充图案、速度、支撑结构等。该数据集专为训练原始 3D 打印制造指令(G-code)的机器学习模型而设计,可用于 G-code 生成、打印失败预测、刀具路径语义分析、与打印机无关的切片分类等任务。数据采用 WebDataset 风格的 .tar 分片格式(每个约 8GB),支持高效流式读取。根目录包含一个 Parquet 元数据文件(metadata.parquet),每行对应一个原始 3D 模型,包含模型 ID、名称、描述、标签、类别、许可证、来源以及嵌套的 gcode 数组(每个变体包括源 STL 路径、G-code 路径、设置路径、打印机配置文件、喷嘴直径、耗材类型、层高、填充密度、是否启用支撑、随机种子)。tar 分片中按 model_id 组织文件:images/*.jpg(预览图像)、gcode/*.gcode(切片后的 G-code 文件)、gcode/*.settings.json(随机化设置)。G-code 文件继承其父 3D 模型的许可证,具体许可证信息在元数据的 license 列中。建议使用 WebDataset 或 Hugging Face 流式 API 进行训练。

The FDM G-Codes dataset is a large-scale, high-diversity Fused Deposition Modeling (FDM) G-code dataset, generated by iteratively slicing STL files from the kpoc/3d-models dataset (derived from Printables) using PrusaSlicer. Each original STL file is processed to produce 10 variants by default, each with highly randomized configuration parameters, including printer profiles (covering Generic FDM, Prusa, Creality, Voron, Anycubic, Bambu, Artillery, etc.), nozzle diameter (0.25mm-0.8mm), filament type (PLA, PETG, ABS, ASA, TPU), layer height, infill density (0-100%), infill pattern, speed, support structure, etc. This dataset is specifically designed for training machine learning models on raw 3D printing manufacturing instructions (G-code), and can be used for tasks such as G-code generation, print failure prediction, toolpath semantic analysis, and printer-agnostic slice classification. The data is stored in WebDataset-style .tar shard format (each approximately 8GB), supporting efficient streaming reads. The root directory contains a Parquet metadata file (metadata.parquet), where each row corresponds to an original 3D model, including model ID, name, description, tags, category, license, source, and a nested gcode array (each variant includes source STL path, G-code path, settings path, printer profile, nozzle diameter, filament type, layer height, infill density, support enabled flag, random seed). Within the tar shards, files are organized by model_id: images/*.jpg (preview images), gcode/*.gcode (sliced G-code files), gcode/*.settings.json (randomized settings). G-code files inherit the license of their parent 3D model, with specific license information in the license column of the metadata. It is recommended to use WebDataset or Hugging Face streaming API for training.

创建时间:
2026-07-29
原始信息汇总

数据集概述

FDM G-Codes Dataset 是一个大规模、高度多样化的熔融沉积建模(FDM)G代码数据集,由 kpoc/3d-models 数据集(源自 Printables)生成,专门用于训练机器学习模型处理原始 3D 打印制造指令(G代码)。该数据集适用于 G代码生成、打印失败预测、刀具路径语义分析以及与打印机无关的切片分类等任务。

数据集生成方式

  • 对源数据集中的每个原始 STL 文件使用 PrusaSlicer 进行迭代切片,生成了多个变体(每个 STL 默认为 10 个)。
  • 每个变体都使用高度随机化的配置配置文件,对以下参数进行随机化处理:
    • 打印机配置:以通用 FDM 设置为主,同时涵盖 Prusa、Creality (Ender)、Voron、Anycubic、Bambu 和 Artillery 的混合几何形状/打印床尺寸。
    • 喷嘴直径:范围从 0.25mm 到 0.8mm。
    • 耗材类型:为 PLA、PETG、ABS、ASA 和 TPU 提供合理的温度和床层配置文件。
    • 打印设置:随机化层高、外围层数、实心层数、填充密度(0-100%)、填充图案(网格、螺旋、蜂窝、立方体等)、速度和支撑结构。
  • 这种随机化过程迫使下游机器学习模型学习 G代码的底层语义,而不是过度拟合特定打印机的标准预设。

数据结构

数据集使用 WebDataset 风格的 .tar 分片(通常每个约 8GB)进行格式化,以支持数百万文件的高效流式传输。

1. Parquet 元数据 (metadata.parquet)

根元数据文件包含每个原始 3D 模型的一行数据。它保留了所有原始的 Printables 元数据(名称、描述、标签、类别、许可证),并包含一个嵌套的 gcode 数组,详细描述了该模型的每个切片变体:

json { "source_stl_path": "...", "gcode_path": "...", "settings_path": "...", "printer_profile": "generic_fdm_0.4", "nozzle_diameter_mm": 0.4, "filament_type": "PETG", "layer_height_mm": 0.213, "fill_density_pct": 15, "supports_enabled": true, "seed": 12345678 }

2. Tar 分片 (data/gdata_*.tar)

在 tar 归档文件中,文件按原始 model_id 分组:

  • <model_id>/images/*.jpg:来自 Printables 的原始预览图像。
  • <model_id>/gcode/*.gcode:包含原始刀具路径的完整切片 G代码文件。
  • <model_id>/gcode/*.settings.json:一个人类可读的 JSON 文件,存储用于生成相应 G代码的随机化设置。

使用建议

由于数据集规模巨大,在训练前完全下载可能对大多数环境不现实。强烈建议使用 WebDataset 或 Hugging Face 的流式 API 在训练过程中动态流式传输 tar 文件。

许可证与归属

.gcode 文件继承其父级 3D 模型的许可证。请参阅元数据中的 license 列,了解每个模型关联的特定 Creative Commons / 开源许可证。所有模型最初均来源于 Printables。

搜集汇总
数据集介绍
FDM-gcodes 数据集图片
构建方式
面向增材制造领域中对机器理解制造指令的迫切需求,该数据集以Printables平台的原生三维模型为源,借助PrusaSlicer切片引擎,对每一模型迭代生成约十种随机化变体。其构建流水线兼容STL、OBJ、3MF、STEP与AMF等格式,并在每个变体中系统化地扰乱打印机型、喷嘴直径、耗材种类与打印参数,涵盖从0.25至0.8毫米的喷嘴、多种热塑性材料及0至100%的填充密度与多样填充图案。经切片所得G代码、随机化配置与原始预览图被组织为WebDataset风格的tar分片,并以Parquet元数据建立索引,从而在超大规模下实现高效流式访问。
特点
该数据集以超万亿规模的体量构建了一个高度多样化的FDM制造指令语料库,其核心特征在于通过广泛随机化的切片配置迫使模型摆脱对特定打印机预设的过度依赖,转而习得G代码中蕴含的工具路径语义。元数据层面完整保留了原始模型名称、描述、标签、类别与许可信息,并关联标准化为512×512的JPEG预览图与对应的G代码及人类可读的settings.json文件。数据以分片形式存储,天然适配流式读取,既支持G代码生成与打印失败预测,也适用于工具路径语义分析与打印机无关的切片分类等任务。
使用方法
鉴于该数据集体量极为庞大,完整下载后训练对多数环境并不现实,推荐采用WebDataset或Hugging Face流式API在训练过程中动态读取tar分片。使用者可先加载metadata.parquet作为索引,依据model_id定位所需模型及其图像与G代码变体,再按需提取对应文件。由于G代码文件继承其父三维模型的许可,使用时应查阅元数据中的license列以确认具体的知识共享或开源许可条款,并遵循相应的署名要求。
背景与挑战
背景概述
增材制造领域中,熔融沉积成型(FDM)的G代码承载着从数字模型到物理构件的核心制造指令,其语义理解与生成长期依赖人工经验。FDM-gcodes数据集于2024年前后由研究者构建,源于Printables平台的海量3D模型,经PrusaSlicer对每个原始模型迭代切片生成多个变体,规模逾万亿字节。该数据集旨在为G代码生成、打印失败预测、工具路径语义分析及跨打印机切片分类等任务提供大规模、高多样性的训练资源,推动制造指令的机器学习研究从特定设备预设向通用语义理解范式迁移。
当前挑战
该数据集所应对的领域问题在于:G代码作为底层制造指令,其语义解析与生成长期受制于打印机硬件多样性、切片参数组合爆炸以及缺乏统一标注基准,导致模型易过拟合于特定设备预设而难以泛化。构建过程中,数据规模的指数级增长对存储与流式读取提出严苛要求;同时,需在随机化打印机配置、喷嘴直径、耗材类型及打印参数的同时,确保切片结果在物理上合理可行,并保留原始模型的许可证信息以符合开源合规。此外,将多源异构的3D模型格式统一切片并标准化为WebDataset分片,亦需克服格式兼容与元数据对齐等技术难题。
常用场景
经典使用场景
在增材制造与智能算法交叉领域,FDM-gcodes数据集为G-code生成与打印失败预测等任务提供了大规模、高多样性的原始指令语料。通过对每个三维模型施以十种随机化切片变体,该数据集覆盖了从0.25毫米至0.8毫米喷嘴直径、多种打印机型与丝材类型的广泛参数组合,迫使机器学习模型习得G-code的底层语义而非过拟合特定预设。基于WebDataset流式读取的存储结构,研究者得以在无需完全下载的前提下开展大规模训练,使之成为机器人制造与切片分类研究的经典基准。
实际应用
在实际工业场景中,FDM-gcodes可服务于打印质量监控、异常检测与工艺参数优化。制造企业借助该数据集训练的模型,能够从原始G-code中预判潜在打印缺陷,降低材料浪费与设备停机时间。同时,其涵盖Prusa、Creality、Voron、Bambu等主流打印机的混合几何与床身尺寸,使算法部署于异构设备集群时具备较强的适应性,为分布式增材制造与云切片服务提供了数据支撑。
衍生相关工作
围绕该数据集,后续研究衍生出多条经典工作脉络。部分工作聚焦于基于Transformer的G-code序列生成模型,将打印路径视作结构化语言进行建模;另有研究利用其多模态特性(图像与G-code配对)开展跨模态检索与打印结果预测。此外,随机化设置JSON文件为条件生成与参数反演任务提供了监督信号,催生了打印机配置推断与切片参数推荐等衍生方向,持续拓展着增材制造领域的数据驱动研究边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务