Awesome-Industry-Dataset
收藏官方服务:
资源简介:
该合集旨在收集和整理各行业的开源数据集,覆盖31个行业,包括文本数据集、视觉数据集和多模态数据集,以促进行业数据的开放共享和行业大模型的发展。
This collection aims to collect and curate open-source datasets across various industries, spanning 31 industry sectors, including text, visual, and multimodal datasets, to promote the open sharing of industry-specific data and the development of industry-focused large language models (LLMs).
创建时间:
2024-07-23
原始信息汇总
AI大模型行业数据全景扫描
项目概述
该项目由北京智源人工智能研究院(BAAI)发起,旨在从多角度全面分析开源行业数据集的总体状况,涵盖文本数据集、视觉数据集和多模态数据集,针对31个行业进行详细总结和整理,并统计与分析开源行业大模型现状。
最新动态
- 2024/10/18:更新AI大模型行业数据全景扫描
- 2024/9/25:发布AI大模型行业数据全景扫描;开源行业指令数据集IndustryInstruction;开源IndustryCorpus2.0
- 2024/8/30:收录整理84个开源行业大模型
- 2024/8/18:收录第一版开源行业数据集,共332个数据集(187个文本数据集、76个视觉数据集、69个多模态数据集)
- 2024/6/13:开源IndustryCorpus1.0
文本数据集
该部分收录了覆盖多个行业的文本数据集,类型包括预训练(PT)、指令微调(SFT)和评估(Evaluation)数据集,语言涉及中文和英文,发布者涵盖学术机构、研究实验室和企业。
行业分布及代表性数据集
- 农林牧渔:IndustryCorpus2.0-农林牧渔(PT,111.9GB,Apache 2.0);AgriMa(SFT,中文,山西大学)
- 汽车:IndustryCorpus2.0-汽车(PT,39.9GB,Apache 2.0);汽车大师问答摘要与推理(SFT,中文,110k条,复旦大学)
- 采矿:IndustryCorpus2.0-采矿(PT,8.9GB,Apache 2.0)
- 石油化工:IndustryCorpus2.0-石油化工(PT,40.2GB,Apache 2.0);ChemData700K(SFT,英文,0.2GB/730k条,MIT,上海人工智能实验室)
- 电力能源:IndustryCorpus2.0-电力能源(PT,68.7GB,Apache 2.0)
- 生物医药:IndustryCorpus2.0-生物医药(PT,61.7GB,Apache 2.0);Pile-PubMed Central(PT,英文,81.6GB,MIT,EleutherAI);TCM-Ancient-Books(PT,中文,0.1GB,xiaopangxia);MedHop(SFT,英文,0.5GB/4k条,CC BY-SA 3.0,伦敦大学学院);Mol-Instructions(SFT,英文,0.2GB/2M条,CC BY 4.0,浙江大学);ShenNong_TCM_Dataset(SFT,中文,0.1GB/112k条,Apache 2.0,华东师范大学);TCM_Literature_QA(SFT,中文,13k条,CC BY-NC-SA 4.0,天池小喵萌)
- 航空航天:IndustryCorpus2.0-航空航天(PT,38.6GB,Apache 2.0);UMETRIP-QA(SFT,中文,4k条,中航信移动科技有限公司)
- 其他制造业:IndustryCorpus2.0-其他制造(PT,47.2GB,Apache 2.0)
- 计算机/通信:IndustryCorpus2.0-计算机_通信(PT,157.8GB,Apache 2.0);CoSQL(PT,英文,0.1GB,CC BY-SA 4.0,密歇根大学);Pile-Ubuntu IRC(PT,英文,5.5GB,MIT,EleutherAI);OWL-Instruct-ops001(SFT,中英文,北京航空航天大学);OWL-Bench(Evaluation,中文,北京航空航天大学)
- 计算机编程:IndustryCorpus2.0-计算机_编程(PT,11GB,Apache 2.0);JuICe(PT,英文,3.7GB,华盛顿大学);The Stack(PT,英文,56.6GB,Custom,bigcode);starcoderdata(PT,英文,783GB,Custom,bigcode);github-code(PT,英文,1000GB,Custom,CodeParrot);code_search_net(PT,英文,5GB,Custom,CodeSearchNet);Lyra(SFT,中英文,北京大学);StaQC(SFT,英文,0.1GB/268k条,CC BY 4.0,华盛顿大学);CodeGPT(SFT,中文,32k条,复旦大学);Code_Alpaca_20K(SFT,英文,20k条,sahil280114);ToolAlpaca(SFT,英文,421条,中国科学院大学);mbpp(Evaluation,英文,1k条,CC BY 4.0,Google Research);HumanEval(Evaluation,英文,164条,MIT,OpenAI)
- 人工智能:IndustryCorpus2.0-人工智能(PT,7.7GB,Apache 2.0)
- 其他信息服务:IndustryCorpus2.0-其他信息服务(PT,1.8GB,Apache 2.0);yf_amazon(SFT,中文,0.3GB/7M条,亚马逊);EcomGPT(Evaluation,中英文,6k条,阿里)
- 房地产/建筑:IndustryCorpus2.0-房地产_建筑(PT,105.2GB,Apache 2.0)
- 交通运输/邮政:IndustryCorpus2.0-交通运输(PT,40.5GB,Apache 2.0);TransGPT-pt(PT,中文,Apache 2.0,北京交通大学);TransGPT-sft(SFT,中文,58k条,Apache 2.0,北京交通大学)
- 水利/海洋:IndustryCorpus2.0-水利_海洋(PT,20.2GB,Apache 2.0);OceanBench(Evaluation,英文,10k条,MIT,浙江大学)
- 数学:IndustryCorpus2.0-数学(PT,156.7GB,Apache 2.0);MathGLM-dataset(PT,中文,9.3GB,清华大学);NaturalProofs(PT,英文,0.1GB,MIT,纽约大学);MathPile(PT,英文,21.2GB,CC BY-NC-SA 4.0,上海人工智能实验室);Proof-Pile-2(PT,英文,205GB,EleutherAI);OpenWebMath(PT,英文,27.4GB,ODC-By 1.0,University of Toronto);Pile-DM_Mathematics(PT,英文,8.1GB,MIT,EleutherAI);Goat(SFT,英文,0.5GB/2M条,Apache 2.0,新加坡国立大学);OpenMathInstruct-1(SFT,英文,2.9GB/7M条,Custom,NVIDIA);MWP-Instruct(SFT,英文,252k条,Apache 2.0,Macropodus);BELLE_School_Math(SFT,中文,0.1GB/248k条,GPL 3.0,BELLE Group);Math23K(Evaluation,中文,23k条,腾讯);math_dataset(Evaluation,英文,2.2GB,Apache 2.0,Google DeepMind);Gsm8k(Evaluation,英文,8k条,MIT,OpenAI);Ape210K(Evaluation,中文,210k条,腾讯)
- 学科教育:IndustryCorpus2.0-学科教育(PT,340.9GB,Apache 2.0);Educhat-sft-002-data-osm(SFT,中英文,5GB/4M条,CC BY-NC 4.0,华东师范大学);MCTS(SFT,中文,0.1GB/691k条,北京语言大学);Child_chat_data(SFT,中文,哈尔滨工业大学);EXAMS(SFT,0.2GB/24k条,CC BY-NC-SA 4,Sofia University)
搜集汇总
数据集介绍

构建方式
在人工智能大模型蓬勃发展的浪潮中,高质量行业数据的匮乏成为制约模型垂直领域应用的关键瓶颈。为此,北京智源人工智能研究院(BAAI)牵头构建了Awesome-Industry-Dataset这一综合性开源行业数据集资源库。该数据集通过系统性地梳理与整合,从文本、视觉、多模态三大维度,覆盖农林牧渔、汽车、生物医药、计算机编程等31个国民经济行业门类,收录了332个开源行业数据集,并同步整理了84个开源行业大模型。构建过程中,团队不仅纳入了BAAI自研的IndustryCorpus系列预训练语料,还广泛搜集了来自全球顶尖高校及研究机构(如清华大学、浙江大学、EleutherAI等)的公开数据集,并按照数据集类型(预训练PT、指令微调SFT、评估Evaluation)、语言(中文、英文)、规模及许可证类型进行了精细化的分类与标注,形成了层次分明、结构清晰的行业数据全景图谱。
特点
该资源库最显著的特点在于其全景式的覆盖能力与系统化的组织架构。不同于以往单一领域的数据集集合,Awesome-Industry-Dataset横跨31个行业,实现了从农业、制造业到金融、教育等关键领域的全面渗透,为跨行业大模型的研发提供了坚实的数据底座。在数据形态上,它融合了纯文本语料、视觉图像数据以及图文多模态数据,满足了不同模型架构的训练需求。尤为值得一提的是,该资源库不仅收录了大规模预训练语料(如IndustryCorpus2.0中计算机/通信领域达157.8GB的文本),还精心整理了针对垂直场景的指令微调数据集(如生物医药领域的Mol-Instructions包含200万条指令)以及标准化的评估基准(如编程领域的HumanEval),形成了从预训练到微调再到评测的完整数据链路。此外,所有数据集均标注了来源机构、许可证类型及论文引用,极大提升了数据的可追溯性与合规性。
使用方法
研究人员与开发者可以便捷地利用该资源库进行行业大模型的研发工作。首先,用户可通过GitHub仓库的目录导航,按行业类别(如“生物医药”)快速定位到所需的子数据集。对于预训练任务,可直接从Hugging Face平台下载BAAI发布的IndustryCorpus系列语料(如IndustryCorpus2.0),其采用Apache 2.0许可证,支持商业使用;对于指令微调,则可选用如Mol-Instructions、ShenNong_TCM_Dataset等特定领域的SFT数据集,这些数据通常以JSON格式提供,可直接加载至transformers或LLaMA-Factory等训练框架。评估环节中,用户可调用HumanEval或GSM8K等基准数据集对模型性能进行标准化测试。资源库中的每个数据集均附有直接链接至Hugging Face或OpenDataLab的下载入口,以及对应的学术论文引用,确保用户能够无缝衔接数据获取与研究复现的全流程。
背景与挑战
背景概述
随着大语言模型技术的迅猛发展,其在垂直行业中的落地应用已成为人工智能领域的研究热点。然而,高质量、大规模且覆盖多行业的开源数据集依然匮乏,严重制约了行业大模型的泛化能力与实用性。在此背景下,北京智源人工智能研究院于2024年启动了“AI大模型行业数据全景扫描”项目,旨在系统性地梳理和整合开源行业数据集资源。该项目由智源研究院主导,核心研究问题聚焦于如何构建覆盖31个行业的文本、视觉及多模态数据集,并推动开源行业大模型的发展。通过发布IndustryCorpus系列数据集(1.0与2.0版本)以及IndustryInstruction指令数据集,该工作为农林牧渔、生物医药、计算机编程等关键领域提供了宝贵的预训练与微调数据,显著促进了行业大模型的研究与应用进程。
当前挑战
该数据集面临的核心挑战包括:其一,行业领域问题的复杂性。不同行业(如生物医药、航空航天)对数据格式、知识粒度及推理能力的要求迥异,通用数据集难以满足专业需求,亟需针对性构建领域专用数据集。其二,构建过程中的数据瓶颈。开源行业数据分散、质量参差不齐,且部分行业(如采矿、水利)数据量极小,需投入大量人力进行清洗、标注与整合。此外,多语言、多模态数据的对齐与融合,以及版权许可的合规性审核,均显著增加了数据集构建的难度与成本。
常用场景
经典使用场景
Awesome-Industry-Dataset 作为一项涵盖31个行业、汇聚332个开源数据集的综合性资源库,其经典使用场景在于为跨行业大模型的预训练与微调提供高质量、多模态的数据支撑。研究人员可依据具体行业需求,如生物医药、计算机编程或数学领域,从该数据集中精准筛选对应的文本、视觉或多模态数据,从而构建领域专用的训练语料。例如,在生物医药行业中,数据集整合了IndustryCorpus2.0-生物医药、MedHop等资源,支持从预训练到指令微调的完整流程,显著提升模型在医学问答、分子结构理解等任务上的表现。这种按需组合的灵活性,使得该数据集成为推动行业大模型落地的核心基石。
实际应用
在实际应用中,该数据集已广泛赋能于智能客服、工业质检与辅助诊断等场景。例如,在交通运输领域,依托TransGPT-sft等指令数据,企业可微调模型以精准解答物流调度、交通法规等专业咨询;在计算机编程领域,通过The Stack与HumanEval的代码数据,开发者能训练出自动生成高质量代码的助手。此外,该数据集还支撑了农业领域的作物病害识别(借助AgriMa数据)与石油化工中的分子性质预测(利用ChemData700K),显著降低了行业AI系统的开发成本,推动了大模型从实验室走向生产线。
衍生相关工作
该数据集衍生了一系列具有深远影响的经典工作,其中最引人注目的是基于其语料库训练的开源行业大模型。例如,北京智源人工智能研究院发布的IndustryInstruction指令数据集,直接催生了面向生物医药与教育的垂直模型,如ShenNong_TCM_Dataset用于中医知识问答,Educhat-sft-002-data-osm则专注于学科辅导。此外,该数据集中的数学子集(如Proof-Pile-2与OpenMathInstruct-1)为推理增强模型(如MathGLM)提供了训练基础,而计算机编程数据则支撑了StarCoder等代码大模型的诞生。这些工作不仅验证了行业数据集的实用性,更形成了从数据到模型再到应用的完整研究链条。
以上内容由遇见数据集搜集并总结生成




