遇见数据集

awesome-industrial-datasets

收藏
github2026-06-03 更新2026-06-04 收录
官方服务:

资源简介:

这是一个精选的公开工业数据集集合,旨在简化对高质量工业数据集的访问,覆盖化学、机械、石油和天然气等多个工业领域。该合集为研究人员、工程师和数据科学家提供用于机器学习模型和分析任务的真实世界工业数据,目前包含176个数据集,并按数据集名称、标签状态、特征、数据源和附加标签进行组织。

This is a curated collection of public industrial datasets, designed to streamline access to high-quality industrial data across diverse industrial sectors including chemical, mechanical, petroleum and natural gas. This collection provides real-world industrial data for machine learning model development and analytical tasks, catering to researchers, engineers and data scientists. Currently, it contains 176 datasets, which are organized by dataset name, label status, features, data sources and additional tags.

创建时间:
2022-10-26
原始信息汇总

数据集详情总结

数据集仓库概览

数据集名称: Awesome Industrial Datasets
数据集总数: 176
数据集地址: https://github.com/jonathanwvd/awesome-industrial-datasets
HTML版本导航: https://jonathanwvd.github.io/awesome-industrial-datasets/

数据集覆盖领域

  • 化学工业
  • 机械工程
  • 石油与天然气
  • 航空与航天
  • 电力与能源
  • 制造业
  • 纺织业
  • 环境监测
  • 土木工程
  • 矿业

数据集特征概览

标注情况

  • Yes: 完全标注
  • Likely: 很可能已标注
  • No: 未标注
  • Partially: 部分标注
  • Information not available: 信息不可用

数据类型与特征

  • 时间序列: 多数数据集包含时间序列数据
  • 多变量: 多数数据集为多变量数据
  • 图像数据: 包含缺陷检测、表面检查等图像数据集
  • 视频数据: 包含异常检测等视频数据集
  • 表格数据: 包含结构化表格数据

数据来源

  • 真实数据: 来自真实工业场景
  • 合成数据: 模拟生成的数据
  • 两者兼具: 真实与合成数据混合

代表性数据集示例

数据集名称 标注情况 类型 数据来源 领域
3D Printer Likely 多变量 真实 3D打印、机械工程
AI4I 2020 Predictive Maintenance Dataset Yes 多变量、时间序列 合成 预测性维护
AITEX Fabric Image Database Yes 图像、多分类 真实 纺织品缺陷检测
C-MAPSS Aircraft Engine Simulator Data Yes 时间序列、多变量 合成 航空发动机预测
CWRU Bearing Data Yes 多变量、时间序列 真实 轴承故障诊断
Bosch Production Line Performance Yes 多变量、表格 真实 生产线质量控制
BATADAL Water SCADA Cyber-Attack Dataset 部分 多变量、时间序列 合成 水务系统网络安全
AeBAD Yes 图像、视频、异常检测 真实 航空叶片检测

数据集用途

  • 机器学习模型训练与评估
  • 异常检测与故障诊断
  • 预测性维护
  • 质量检测与控制
  • 剩余使用寿命预测
  • 时间序列预测与分析
  • 分类与回归任务
  • 图像分割与缺陷检测
搜集汇总
数据集介绍
awesome-industrial-datasets 数据集图片
构建方式
该数据集仓库通过系统化梳理与整合工业领域公开可用的高质量数据集而构建,覆盖化工、机械、油气等多个关键行业。每个数据集均以独立Markdown文件详细记录,并统一纳入一个结构化的表格中,表格字段包括数据集名称、是否标注、特征类型、数据来源及附加标签。仓库维护者持续追踪并收录来自真实工业场景与合成模拟环境的数据资源,形成一份兼具广度与深度的工业数据集索引。
特点
该仓库收录了176个数据集,涵盖多元时间序列、图像、视频等多种数据类型,且多数包含明确的标注信息,适用于回归、分类、异常检测与分割等任务。数据集来源既包括真实工业设备与传感器采集的实测数据,也包含基于物理模型生成的仿真数据,兼顾了真实性与可控性。附加标签系统进一步细化了每个数据集的应用领域与任务类型,便于研究者精准筛选。
使用方法
用户可通过GitHub仓库的README表格或HTML版本导航页面浏览所有数据集索引。每个数据集条目均链接至对应的Markdown文件,其中详细说明了数据描述、列含义、来源链接以及常见的机器学习用途。研究者可直接从原始出处下载数据,并参考文件中的元信息进行模型训练与评估,适用于预测性维护、故障检测、质量控制等工业智能应用场景。
背景与挑战
背景概述
在工业4.0与人工智能深度融合的浪潮下,高质量工业数据集成为驱动智能制造、预测性维护与过程优化的核心基石。该数据集仓库由Jonathan W. V. D.于近年创建,旨在系统性地整合涵盖化工、机械、油气等多个关键工业领域的公开数据资源。其核心研究问题在于破解工业数据获取难、异构性强、标注成本高的困境,为研究人员与工程师提供一站式数据检索与利用平台。截至当前,该仓库已收录176个数据集,显著提升了工业机器学习模型的可复现性与跨领域比较能力,对推动工业智能化的学术研究与工程实践产生了深远影响。
当前挑战
当前工业数据集领域面临多重挑战:首先,真实工业场景中数据标注极度匮乏,多数数据集仅部分标注或存在标签噪声,严重制约了监督学习模型的泛化性能;其次,数据来源多样(如传感器、仿真、图像)导致多模态融合与时间序列对齐困难,且样本分布常存在严重类别不平衡与领域偏移问题;再者,构建过程中需应对工业数据的隐私保护与商业机密限制,使得公开可用的真实数据规模有限,合成数据虽弥补了部分空白,但其与真实工况的偏差仍构成模型部署的潜在风险。
常用场景
经典使用场景
该数据集集合囊括了涵盖化工、机械、油气、制造、能源等众多工业领域的真实与合成数据,为工业智能分析提供了丰富的基准资源。其最经典的使用场景在于工业异常检测与预测性维护,例如利用C-MAPSS航空发动机仿真数据进行剩余寿命预测,或基于CWRU轴承数据集进行旋转机械故障诊断。研究者可通过多变量时间序列或图像数据,训练分类与回归模型,实现设备健康状态的精准评估。
解决学术问题
该数据集体系有效解决了工业领域数据稀缺、标注困难、场景单一等长期困扰学术研究的瓶颈问题。通过提供如APS Failure at Scania Trucks等带标注的真实故障数据,研究者得以深入探索高维特征下的故障分类与异常检测算法。同时,Tennessee Eastman Process等仿真数据为过程控制与异常识别方法提供了可复现的基准,推动了工业AI从理论验证向工程实践的跨越。
衍生相关工作
该数据集集合催生了众多经典学术与工程成果,如基于C-MAPSS数据的深度剩余寿命预测模型、利用CWRU轴承数据的迁移学习故障诊断框架,以及针对Tennessee Eastman过程的图神经网络异常检测方法。此外,AITEX织物图像数据集推动了工业视觉缺陷检测的语义分割与少样本学习研究,而AssetOpsBench等合成数据则启发了多智能体协同维护策略的探索,形成了从数据到模型的完整创新生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务