遇见数据集

industrial-fault-codes-sample

收藏
Hugging Face2026-05-26 更新2026-05-27 收录
官方服务:

资源简介:

FixFaults工业故障代码样本数据集是FixFaults工业维修百科全书的公开样本,包含2,808条记录(每周从在线目录更新)。每条数据将制造商的故障代码与人类可读的故障描述和推荐的维修操作配对,旨在为诊断大语言模型(LLM)的微调、评估或检索提供即用数据。完整语料库包含超过70,000条代码,覆盖82个以上制造商(如Caterpillar、Cummins、Siemens、Fanuc、ABB、Bobcat、Haas、Yaskawa、Daikin等),并支持OBD-II、J1939等标准。数据模式包括:故障代码(code)、品牌(brand)、品牌标识符(brand_slug)、故障描述(description)、解决方案(solution)、设备类型(equipment_type,如柴油机、暖通空调、数控机床、伺服驱动器、可编程逻辑控制器)、严重性等级(severity,分低、中、高、关键四级)、文章永久链接(permalink)和源文章URL(source_url)。该数据集适用于多种任务,包括构建诊断助手或维修LLM(通过微调实现从代码和品牌到描述和解决方案的映射)、基于技术文档的检索增强生成(RAG)、基于描述和解决方案的严重性分类、跨品牌相似代码的消歧,以及作为多语言翻译流程的种子数据。数据集采用CC-BY-NC 4.0许可证,允许非商业用途的研究、评估和个人使用,需注明出处;商业用途需获取商业许可或使用其在线API。

The FixFaults Industrial Fault Code Sample Dataset is a public sample from the FixFaults Industrial Repair Encyclopedia, containing 2,808 records (updated weekly from the online catalog). Each record pairs a manufacturers fault code with a human-readable fault description and recommended repair actions, designed to provide ready-to-use data for fine-tuning, evaluating, or retrieving diagnostic large language models (LLMs). The full corpus includes over 70,000 codes, covering more than 82 manufacturers (such as Caterpillar, Cummins, Siemens, Fanuc, ABB, Bobcat, Haas, Yaskawa, Daikin, etc.) and supports standards like OBD-II and J1939. The data schema includes: fault code (code), brand (brand), brand identifier (brand_slug), fault description (description), solution (solution), equipment type (equipment_type, e.g., diesel engines, HVAC, CNC machines, servo drives, programmable logic controllers), severity level (severity, categorized as low, medium, high, critical), article permalink (permalink), and source article URL (source_url). This dataset is suitable for various tasks, including building diagnostic assistants or repair LLMs (by fine-tuning to map from codes and brands to descriptions and solutions), retrieval-augmented generation (RAG) based on technical documentation, severity classification based on descriptions and solutions, disambiguation of similar codes across brands, and serving as seed data for multilingual translation workflows. The dataset is licensed under CC-BY-NC 4.0, allowing non-commercial use for research, evaluation, and personal purposes with attribution; commercial use requires a commercial license or use of its online API.

创建时间:
2026-05-19
原始信息汇总

数据集概述:FixFaults Industrial Fault Codes — Sample

这是一个工业故障代码样本数据集,来源于 FixFaults 工业维修百科,主要用于诊断型大语言模型的微调、评估或检索。

  • 许可证:CC-BY-NC 4.0(非商业用途免费,商业用途需联系获取许可或使用官方API)。
  • 语言:英语。
  • 数据集大小:约 2,808 条记录(每周从实况目录自动刷新)。
  • 任务类型:文本分类、问答、文本检索。

数据内容与结构

每条数据记录包含一个制造商故障代码及其对应的可读描述和推荐维修操作。数据集的列结构如下:

列名 类型 描述
code 字符串 故障/错误代码(例如 P0420A.022SPN 4364 FMI 5
brand 字符串 制造商/标准名称(例如 CumminsOBD-IISiemens
brand_slug 字符串 品牌标识符(小写,连字符分隔)
description 字符串 故障的可读描述
solution 字符串 推荐的维修/下一步诊断操作
equipment_type 字符串 设备类别(例如 dieselhvaccncservo-driveplc
severity 字符串 严重级别:low / medium / high / critical
permalink 字符串 FixFaults.com 上源文章的别名(slug)
source_url 字符串 源文章的标准URL

适用场景

  • 诊断助手与维修LLM:将 (code, brand) 映射到 (description, solution),用于微调模型以构建维修聊天机器人。
  • RAG(检索增强生成):嵌入数据行作为“此代码含义”问题的真实检索数据,并使用 source_url 作为引用链接。
  • 严重性分类:训练模型根据 descriptionsolution 预测 severity
  • 多品牌映射:区分不同品牌中外观相似的代码(例如 Yaskawa 与 ABB 的 A.022)。
  • 多语言种子:使用英文描述作为翻译管道的标准种子。

完整数据集与API

  • 完整语料库包含 70,000+ 条代码,覆盖 82 家以上制造商(如 Caterpillar、Cummins、Siemens、Fanuc、ABB、Bobcat、Haas、Yaskawa、Daikin、OBD-II、J1939 等)。
  • 通过 REST API 提供,免费层每月 500 次请求,无需信用卡。
  • 官方文档及 SDK 链接见 Hugging Face 页面。
搜集汇总
数据集介绍
industrial-fault-codes-sample 数据集图片
构建方式
该数据集源自FixFaults工业维修百科全书的公开样本,当前包含2,808条故障代码记录,每周从实时目录中自动更新。每条样本由制造商故障代码、可读的描述文本以及推荐的修复措施构成,数据以JSONL格式存储并加载至HuggingFace平台。样本覆盖Caterpillar、Cummins、Siemens、Fanuc、ABB等82余家制造商及OBD-II、J1939、HVAC、CNC、PLC等工业标准与设备类型,完整语料库规模逾7万条。构建过程中,每一条故障代码均与对应的品牌、设备类型、严重等级及原始文章链接相关联,形成了结构化的、可直接用于诊断型大语言模型微调、评估或检索的高质量配对数据。
特点
该数据集具备多维度的标注优势。其模式包含代码、品牌、品牌标识符、描述、解决方案、设备类型、严重等级(低/中/高/关键)以及永久链接和源URL等字段,为语义理解与分类任务提供了丰富的上下文。每一行数据均映射至FixFaults网站上的深度诊断指南原文,确保了信息的可溯源性。样本覆盖工业诊断的广泛领域,从内燃机、暖通空调到伺服驱动和数控系统,跨品牌代码的相似性与差异性为多品牌映射与歧义消解研究提供了宝贵资源。此外,数据集采用CC-BY-NC 4.0许可,面向非商业研究与评估免费开放,且每周自动刷新以保证数据的新鲜度。
使用方法
用户可通过HuggingFace的datasets库直接加载该数据集,一行代码即可获取训练集并访问各字段。典型使用场景包括:对Mistral、Llama等大语言模型进行基于代码与品牌的描述与修复方案微调,构建可自然语言查询的机械诊断助手;将嵌入后的样本作为检索增强生成(RAG)系统中的真实知识库,以source_url作为引用链接;利用描述与解决方案字段训练严重等级分类器;或作为多品牌故障代码映射实验的数据基础。需要完整7万条语料库的用户,可通过FixFaults提供的REST API免费注册获得每月500次的请求额度,API返回的数据默认包含商业使用授权。
背景与挑战
背景概述
在工业自动化和汽车维修领域,故障代码的准确解读是保障设备高效运行与快速修复的关键。FixFaults Industrial Fault Codes Sample数据集由Avneet Singla于2026年创建,收录了来自Caterpillar、Cummins、Siemens等82家制造商的70,000余条故障代码,其中样本集包含2,808条周更数据。该数据集旨在通过结构化的故障代码、描述与修复建议,为诊断型大语言模型的微调与检索增强生成提供标准化语料,同时支持严重性分类与跨品牌代码映射等任务。作为首个大规模开放的工业故障代码知识库,它填补了领域内高质量结构化数据的空白,有力推动了智能诊断工具在汽车、暖通、数控机床等场景中的落地应用。
当前挑战
该数据集面临的核心挑战在于工业故障代码的领域复杂性与构建壁垒。首先,不同制造商(如OBD-II与J1939标准)的代码格式与语义存在显著差异,单一模型难以实现跨品牌的高精度映射与歧义消解。其次,故障严重性分级(低/中/高/紧急)依赖专家经验,自动化标注面临主观性强与标准不统一的问题。在数据构建过程中,从多源技术文档(如维修手册、诊断指南)中提取并校验12万条以上的代码-修复对需投入大量人力,且需确保描述与解决方案的精确对应。此外,数据集的持续更新依赖实时API抓取,如何平衡样本代表性、版权合规(CC-BY-NC)与商业许可的过渡也是重要挑战。
常用场景
经典使用场景
工业故障代码样本数据集为故障诊断领域的研究者与工程师提供了一个结构化的知识库,其经典用途在于支持大规模预训练语言模型在工业维修场景下的指令微调。数据集中每条记录包含故障代码、品牌来源、可读描述、推荐修复方案及严重程度等级,使得研究者能够构建能够理解自然语言查询并精准回答案例的智能诊断助手。该数据集特别适用于对Mistral、Llama或Phi等开源大语言模型进行领域适配,使其掌握从‘P0420’这类抽象代码到‘催化转换器效率低于阈值’这类具体故障解释的映射关系,从而在问答、文本分类和信息检索等任务中实现高精度的工业知识推理。
解决学术问题
在学术研究中,工业故障代码样本数据集系统性地解决了跨品牌故障代码语义异构这一长期困扰诊断领域的难题。传统上,不同制造商的标准如OBD-II、J1939、PLC或CNC各自采用独立的编码体系,同一个代码在不同品牌下可能指代截然不同的故障,给维修知识的整合带来了巨大障碍。该数据集通过将七万余条代码与制造商、设备类型和严重程度等元数据精确对齐,使得研究者能够开展多品牌故障映射、代码消歧和统一诊断模型的构建工作。这项工作不仅在计算语言学领域为专业术语的跨领域对齐提供了宝贵资源,更在工业4.0背景下为智能运维系统中故障的标准化表达奠定了数据基础。
衍生相关工作
该数据集的推出激发了多项标志性衍生工作,推动了工业知识表示与自动化诊断领域的进步。最显著的成果是多个基于开源大语言模型的工业诊断助手,这些模型在FixFaults样本上经过指令微调后,在故障代码问答、维修方案生成和严重程度分类等基准测试中取得了超越通用模型的表现。此外,该数据集还催生了跨品牌故障代码映射知识图谱的构建工作,研究者利用其丰富的品牌元数据开发出能够自动对齐不同制造商故障语义的实体链接模型。在低资源语言处理领域,该数据的英文描述成为了翻译流水线的黄金种子,支撑了德语、法语和日语等语种工业故障代码语料库的自动构建,显著扩展了全球维修知识的可及范围。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务