遇见数据集

Nigeria Machinery Usage and Failures Dataset

收藏
arXiv2026-07-09 更新2026-07-14 收录
数据链接:
官方服务:

资源简介:

该数据集是由独立研究员与佐治亚大学合作创建的尼日利亚工业机械使用与故障数据集,旨在填补非洲工业领域公开可用的结构化数据空白。数据集包含89条机器级记录,涵盖2006至2025年间尼日利亚制造业和石油天然气两大行业的28项指标,数据来源于尼日利亚中央银行、国家统计局等官方机构的年度报告和统计公报。数据通过人工收集和交叉验证构建,采用整数编码方案并附带完整解码手册,确保可追溯性和可复现性。该数据集主要应用于低资源工业环境下的预测性维护、故障诊断和领域扎根推理任务,为语言模型在数值任务上的微调提供基准参考。

This dataset is a Nigerian industrial machinery usage and fault dataset co-developed by independent researchers and the University of Georgia, aiming to fill the gap of publicly available structured data in the African industrial sector. The dataset contains 89 machine-level records covering 28 indicators across Nigeria's manufacturing and oil & gas industries from 2006 to 2025. The data is sourced from annual reports and statistical bulletins of official institutions including the Central Bank of Nigeria and the National Bureau of Statistics. Constructed via manual collection and cross-validation, the dataset adopts an integer encoding scheme and is accompanied by a complete decoding manual to ensure traceability and reproducibility. This dataset is primarily applied to predictive maintenance, fault diagnosis, and domain-grounded reasoning tasks in low-resource industrial environments, serving as a benchmark reference for fine-tuning language models on numerical tasks.

创建时间:
2026-07-09
搜集汇总
数据集介绍
Nigeria Machinery Usage and Failures Dataset 数据集图片
构建方式
该数据集通过手动采集构建,数据源自尼日利亚官方机构的公开文件,包括尼日利亚中央银行统计公报、国家统计局、尼日利亚上游石油监管委员会年度报告、尼日利亚制造商协会经济评论以及尼日利亚国家石油公司财务报表。研究者从PDF年报或统计公报中定位具体数值,若同一指标出现在多个来源则进行交叉验证,优先采用官方数据并记录差异。对于无法查询到的数据,不进行估算或插补。原始数值被编码为一致的数字模式,便于模型直接读取,并通过代码簿解析每个编码的含义。最终形成覆盖工业制造和油气两大部门、涵盖2006年至2025年的89条机器级记录和28个指标。
特点
该数据集的核心特点在于其完全可追溯的源头和领域扎根性。每条记录均标注了具体的公共来源,并通过代码簿实现编码与真实意义的双向映射。数据覆盖了设备利用率、停机时间、维护支出、生产产出等28个指标,但覆盖率不均衡,17个指标仅有一个观测值,主要时间深度集中在产能利用率指标上。数据集规模较小,明确作为参考和种子数据集,而非大规模训练集。此外,研究者指出并修复了一个普遍问题:早期版本中仅有1/78的提示包含工业领域术语,而修复后94/94的提示均实现领域扎根。
使用方法
该数据集主要用于微调语言模型时提供领域扎根的推理示例。推理层包含94条提示-完成-推理轨迹,其中84条为检索任务,6条为真实的多步计算任务,4条为分类任务。建议用户将检索行和计算行分开作为不同分层进行微调,以分别测试领域记忆召回和多步数值推理能力。数据集附带有轻量级评估脚本,可复现论文中的指标并支持对任何模型进行评分。由于条数有限,该数据集更适合作为参考和种子资源,可与其他更广泛的工业数据结合使用以支持训练。
背景与挑战
背景概述
在工业机械故障诊断与预测性维护领域,数据驱动的分析方法已成为提升设备可靠性与降低运维成本的关键手段。然而,非洲经济体,尤其是作为非洲最大石油生产国的尼日利亚,其工业机械层面的运行数据长期处于稀缺且不可用状态,大量关键指标深藏于年度报告、监管文件或国家统计摘要之中,无法被模型直接摄取。为填补这一空白,独立研究者Gospel Bassey与佐治亚大学的Vincent Fakiyesi于2025年携手构建了尼日利亚机械使用与故障数据集,该数据集手工采集自尼日利亚中央银行、国家统计局及尼日利亚上游石油监管委员会等官方机构的公开文档,覆盖2006至2025年间制造业与油气部门的28项指标、共89条机器级记录。这一开创性资源不仅为低资源环境下的工业数据分析提供了首个可溯源的结构化参考标杆,更为后续针对非洲本土场景的大语言模型训练与推理任务奠定了数据基础。
当前挑战
该数据集所面临的挑战体现在双重维度。在领域层面,预测性维护方法虽在发达国家试验台数据(如凯斯西储大学轴承数据集)上表现优异,却因地域性操作条件与机械类型的差异难以直接迁移至尼日利亚,加之该地区工业数据的碎片化与不一致性,导致数据驱动方法在非洲实际场景中近乎无法应用。在构建过程中,挑战更为严峻:89条记录中有17个指标仅包含单一观测值,覆盖极度不均,无法支撑大规模预测性维护分类器的训练;手动收集过程需从大量PDF格式的年度报告与统计公报中逐一定位、交叉核验,且严格拒绝估算或插补,真实反映了可验证数据的稀疏性;此外,此前版本中78条推理提示仅有1条包含工业领域术语,暴露出数值匹配但语义脱节的“接地失败”问题,迫使研究团队开发了一套域接地链式思维推理层修复方案,以确保持每个提示均能锚定真实的工业指标、子部门与年份来源。
常用场景
经典使用场景
在非洲工业数据极度匮乏的背景下,Nigeria Machinery Usage and Failures Dataset作为首个面向尼日利亚制造业与油气行业的结构化机械设备数据集,为低资源场景下的工业数据驱动研究提供了关键基准。其最经典的使用场景集中于设备故障预测与维护策略分析,研究者可借助该数据集中涵盖的产能利用率、停机时间、维护支出等28项指标,对尼日利亚主要炼油厂及制造企业的设备运行状态进行纵向追踪与模式识别,从而填补该地区在工业机器学习领域长期存在的可用数据空白。
实际应用
在实际应用中,该数据集为尼日利亚本土企业的设备资产管理提供了数据驱动的决策支持。制造企业可利用其产能利用率与停机时间的历史模式,优化预防性维护计划的制定;油气公司则能依据炼油厂检修支出与故障事件的关联分析,更精准地分配维修预算。此外,数据集中包含的天然气燃烧量与原油产量指标,还可辅助监管部门评估工业活动对环境的影响,并为国际发展机构评估尼日利亚工业基础设施的投资回报率提供量化依据。
衍生相关工作
该数据集直接催生了领域对齐的思维链推理层构建方法,该方法通过严格的接受门控机制(自动检测领域术语、数值精度与溯源完整性),生成了94条高质量的推理示例。这一方法论框架已为低资源工业数据的语言模型微调树立了可复用的技术路线,并启发了后续在设备剩余寿命预测中引入域特化提示模板的研究方向。同时,数据集的完全开源与溯源文件同行发布,也推动了工业数据科学领域关于小型种子数据集标准化评估协议的确立。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务