遇见数据集

3d-models

收藏
Hugging Face2026-07-25 更新2026-07-27 收录
官方服务:

资源简介:

Printables 3D Models数据集是一个从Printables.com抓取的大规模3D模型及其相关元数据集合,旨在帮助研究人员和开发者训练用于3D任务的机器学习模型,例如文本到3D生成、图像到3D生成以及3D特征提取。数据集经过精心处理以优化机器学习流程:进行了去重处理,仅保留每个模型中的唯一3D文件;复杂网格格式(如.3mf和.obj)已自动转换为标准的.stl文件;高分辨率渲染预览图像被压缩并标准化为最大800x800尺寸的RGB JPEG格式;所有关系型元数据(包括标签、原始类别、描述)均以高效的Parquet格式进行索引。数据集采用分片式WebDataset架构,数据被分组为25 GB的.tar归档文件,归档内部按照原始Printables模型ID进行组织,每个模型目录包含images/(压缩后的预览图像)和stls/(标准化后的STL文件)子目录。根目录下的metadata.parquet文件包含每个3D模型项目的元数据行,字段包括:模型唯一ID、标题、创作者原始HTML/文本描述、标签列表、Printables上的分层类别路径、指向tar归档内图像和STL文件的路径列表,以及包含该模型数据的分片文件名称。该数据集是用户生成内容的聚合,其中的模型受其各自创作者选择的许可证约束(主要是各种知识共享许可),使用者需负责遵守原始许可证,特别是在商业使用和署名方面。数据集固有地偏向FDM 3D打印和创客社区,大量包含机械零件、桌面微缩模型、收纳器和功能性打印件,可能无法完美泛化到建筑、电影或有机游戏3D模型而无需微调。

The Printables 3D Models dataset is a large-scale collection of 3D models and associated metadata scraped from Printables.com. It is designed to assist researchers and developers in training machine learning models for 3D tasks, such as text-to-3D generation, image-to-3D generation, and 3D feature extraction. The dataset is carefully processed to optimize machine learning workflows: deduplication is performed to retain only unique 3D files per model; complex mesh formats (.3mf, .obj) are automatically converted to standard .stl files; high-resolution rendered preview images are compressed and standardized to a maximum size of 800x800 in RGB JPEG format; and all relational metadata (tags, original categories, descriptions) are indexed in efficient Parquet format. The dataset uses a sharded WebDataset architecture, with data grouped into 25 GB .tar archives. Inside the archives, data is organized by the original Printables model ID, with each model directory containing subdirectories for images/ (compressed preview images) and stls/ (standardized STL files). The metadata.parquet file in the root directory includes rows for each 3D model project, with fields such as: unique model ID, title, original creator HTML/text description, list of tags, hierarchical category path on Printables, paths to images and STL files within the tar archive, and the shard file name containing the model data. This dataset is an aggregation of user-generated content, and the models are subject to licenses chosen by their respective creators (primarily various Creative Commons licenses). Users are responsible for complying with the original licenses, especially regarding commercial use and attribution. The dataset inherently biases toward FDM 3D printing and maker communities, heavily featuring mechanical parts, desktop miniatures, organizers, and functional prints, and may not generalize perfectly to architectural, film, or organic game 3D models without fine-tuning.

创建时间:
2026-07-24
原始信息汇总

数据集概述

Printables 3D Models Dataset 是一个大规模的3D模型及其元数据集合,数据来源于 Printables.com 网站,旨在支持3D相关机器学习任务的研究与开发,如 文本生成3D(Text-to-3D)和 图像生成3D(Image-to-3D)。


数据集特点

  • 去重处理:仅保留每个模型中的唯一3D文件。
  • 格式标准化:将复杂网格格式(.3mf.obj)自动转换为标准的 .stl 文件。
  • 视觉压缩:高分辨率渲染预览图被压缩并归一化为最大尺寸 800x800 的 RGB JPEG 格式。
  • Parquet 元数据:所有关系型元数据(标签、原始类别、描述)均以 Parquet 格式高效索引。

数据结构

数据集采用分片的 WebDataset 架构,以支持 TB 级数据量。数据被分组为 10 GB.tar 归档文件。

.tar 归档文件内部,结构按 Printables 模型 ID 组织:

data_0001.tar ├── <model_id>/ │ ├── images/ │ │ ├── image_1_compressed.jpg │ │ └── image_2_compressed.jpg │ └── stls/ │ ├── part_1.stl │ └── part_2.stl

仓库根目录包含 metadata.parquet 文件,每一行代表一个3D模型项目,包含以下字段:

  • model_id:Printables 上的唯一 ID
  • name:3D 模型的标题
  • description:创作者提供的原始 HTML/文本描述
  • tags:应用于模型的标签列表
  • printables_category:Printables 上的层级类别路径
  • image_paths:指向 tar 归档文件内图像的路径列表
  • stl_paths:指向 tar 归档文件内 STL 文件的路径列表
  • shard_file:包含该模型数据的 .tar 归档文件名
  • license:应用于3D模型项目的版权许可
  • source:指向 Printables 上原始模型页面的直接 URL

使用注意事项

许可

该数据集是 Printables 上用户生成内容的聚合体。其中的模型受各自创作者选择的个人许可证约束(主要是各类知识共享许可协议)。用户有责任尊重原始许可证,尤其是在商业使用和署名方面。

偏差与局限性

该数据集天然偏向于 FDM 3D 打印和创客社区,包含大量机械零件、桌面微缩模型、收纳用品和功能性打印件。若未进行微调,它可能无法很好地泛化到建筑、影视或有机游戏类3D模型。

搜集汇总
数据集介绍
3d-models 数据集图片
构建方式
该数据集源自对Printables.com网站的大规模爬取,旨在为文本到三维模型、图像到三维模型生成及三维特征提取等机器学习任务提供高质量的训练资源。为确保数据在机器学习流水线中的高效兼容性,数据集经过多重精密处理:首先进行去重操作,确保每个三维文件中仅保留唯一的模型数据;随后将复杂的网格格式(如.3mf、.obj)自动化转换为标准的.stl文件,以提升通用性;同时,高分辨率渲染预览图像被压缩并归一化为最大尺寸800×800像素的RGB JPEG格式。所有关系型元数据(包括标签、原始类别、描述等)则被高效索引为Parquet格式,便于快速查询与加载。
使用方法
用户可通过Hugging Face Datasets库直接加载元数据,并利用WebDataset或标准Python库解析.tar压缩包以访问三维文件和图像。使用前需注意,数据集中模型遵循用户创作时选择的原始许可协议(主要为各类知识共享许可),应用于商业场景时务必核实合规性。结合模型ID和shard_file字段可精准定位数据所在压缩包,通过image_paths和stl_paths列表便捷地提取对应文件。该数据集特别适用于文本或图像驱动下的三维内容生成任务,也可作为三维特征提取预训练的基础语料,建议针对特定下游任务进行领域微调以改善性能。
背景与挑战
背景概述
3D模型数据是计算机视觉与图形学领域的重要资源,其质量与规模直接制约着三维生成任务的性能。该数据集由研究社区从Printables.com平台系统抓取并整理,于近期发布,旨在为文本到三维、图像到三维生成以及三维特征提取等前沿问题提供大规模训练语料。核心研究问题聚焦于如何利用海量真实世界用户创作的三维模型,促进生成模型对几何结构、材质属性与语义标签的联合理解。依托其超25GB的分片式WebDataset架构及标准化的STL文件格式,该数据集弥补了现有大规模三维数据在打印模型领域的空白,有望推动面向制造与创客社区的智能设计工具的发展。
当前挑战
该数据集所解决的领域问题主要源于三维生成任务中高质量训练数据的匮乏:现有数据往往局限于特定类别或渲染场景,难以支撑对功能性机械零件、桌面微缩模型等多样性结构的鲁棒生成。构建过程中面临的核心挑战包括:从非结构化网页抓取中实施大规模去重以保留唯一三维模型,将复杂格式(如.3mf、.obj)自动转换为统一STL标准,以及压缩高分辨率渲染预览图为800×800的RGB JPEG以平衡存储与质量。此外,项目须尊重用户原创许可(多为Creative Commons),在数据聚合中确保合规性与归属透明性,这对自动化的元数据管理提出了严格约束。
常用场景
经典使用场景
该数据集涵盖了来自Printables.com的海量3D模型及其元数据,经过精心处理(去重、格式标准化至STL、图像压缩至800x800分辨率),并以分片WebDataset架构存储,非常适合用于训练文本到3D(Text-to-3D)和图像到3D(Image-to-3D)生成模型。其标准化的网格文件和元数据索引,也为多模态3D特征提取提供了理想的数据基础,助力研究者探索从文本或图像描述直接生成三维形体的学习范式。
解决学术问题
该数据集有效解决了3D深度学习领域高质量、大规模、多模态配对数据稀缺的难题。它为文本与三维形状之间的语义对齐学习提供了可靠资源,推动了条件式三维生成、零样本三维理解等前沿研究。通过支持条件生成模型(如扩散模型、自回归模型)的训练与评估,该数据集帮助研究人员突破了数据瓶颈,加速了从二维视觉知识迁移到三维空间推理的学术进程,对理解三维世界的几何与语义结构具有重要意义。
实际应用
在实际应用中,该数据集可赋能数字内容创作与工业设计自动化。基于其训练的文本到3D模型,用户通过自然语言描述即可快速生成可打印的三维模型原型,极大降低了传统三维建模的技术门槛。在游戏开发、影视特效、虚拟现实(VR)与增强现实(AR)场景中,图像到3D生成能力可高效地将现实物体照片转化为虚拟资产,提升内容生产管线效率。此外,其偏向功能性打印件(机械零件、桌面模型)的特点,也便于定制化制造与快速成型应用。
数据集最近研究
最新研究方向
该数据集聚焦于文本到3D与图像到3D生成的前沿研究,为大规模3D模型与元数据的联合学习提供了标准化资源。随着扩散模型与多模态大模型的崛起,从自然语言或二维图像直接生成可打印的三维网格成为热点,此数据集凭借其去重、格式统一及高效索引的WebDataset架构,有力支撑了面向FDM打印社区的部件级、功能性物体生成研究。它不仅促进了3D生成模型在机械零件、桌面微缩模型等实际场景中的泛化能力提升,也引发了对用户生成内容许可合规性与领域偏置的深入讨论,对推动开放3D数据集生态的可持续发展具有标志性意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务