AwesomeLLMsDatasets
收藏资源简介:
这是一个专注于大型语言模型(LLM)的数据集合集,覆盖五个核心维度:预训练语料库、微调指令数据集、偏好数据集、评估数据集、传统NLP数据集,以及多模态数据集和检索增强生成(RAG)数据集。它汇总了444个数据集,涵盖8种语言类别和32个领域,旨在为研究者和开发者提供全面的资源参考,推动人工智能技术发展。
This is a dataset collection focused on Large Language Models (LLMs). It covers five core dimensions: pretraining corpora, fine-tuning instruction datasets, preference datasets, evaluation datasets, traditional NLP datasets, as well as multimodal datasets and Retrieval-Augmented Generation (RAG) datasets. With a total of 444 datasets covering 8 language categories and 32 domains, this collection aims to provide comprehensive resource references for researchers and developers and promote the advancement of artificial intelligence technology.
数据集详情总结:Awesome-LLMs-Datasets
-
概述:该项目是一个针对大语言模型(LLM)文本数据集的综合汇总,涵盖五个核心维度:预训练语料库、微调指令数据集、偏好数据集、评估数据集和传统自然语言处理(NLP)数据集。此外,新加入了多模态大语言模型(MLLM)数据集和检索增强生成(RAG)数据集。
-
相关论文:发表于 2024 年 2 月的论文 "Datasets for Large Language Models: A Comprehensive Survey",对 444 个数据集进行了统计分析,覆盖 8 种语言类别和 32 个领域,总数据量超过 774.5 TB(预训练语料库)和 7 亿条实例(其他数据集)。
-
数据集信息模块:每个数据集包含以下 20 个维度的信息:
- 语料库/数据集名称
- 发布者
- 发布时间(“X”表示月份未知)
- 大小
- 是否公开(“All”表示完全开源,“Partial”表示部分开源,“Not”表示未开源)
- 许可证
- 语言(“EN”表示英语,“ZH”表示中文,“AR”表示阿拉伯语,“ES”表示西班牙语,“RU”表示俄语,“DE”表示德语,“PL”表示编程语言,“Multi”表示多语言,括号内为语言数量)
- 构建方法(“HG”表示人工生成,“MC”表示模型生成,“CI”表示收集并改进现有数据集)
- 类别
- 来源
- 领域
- 指令类别
- 偏好评估方法(“VO”表示投票,“SO”表示排序,“SC”表示评分,“-H”表示人工执行,“-M”表示模型执行)
- 问题类型(“SQ”表示主观题,“OQ”表示客观题,“Multi”表示多种类型)
- 评估方法(“CE”表示代码评估,“HE”表示人工评估,“ME”表示模型评估)
- 关注点
- 评估类别/子类别数量
- 评估类别
- 实体类别数量(NER 任务)
- 关系类别数量(RE 任务)
-
数据集分类结构:
- Pre-training Corpora:包括通用领域预训练语料库(细分为网页、语言文本、书籍、学术资料、代码、平行语料、社交媒体、百科、多类别)和特定领域预训练语料库(细分为金融、医疗、数学、其他)。
- Instruction Fine-tuning Datasets:包括通用指令微调数据集(细分为人工生成、模型构建、收集改进、混合类型)和特定领域指令微调数据集(细分为医疗、代码、法律、数学、教育、其他)。
- Preference Datasets:按偏好评估方法细分为投票、排序、评分、其他。
- Evaluation Datasets:涵盖超过 20 个子类别,包括通用、考试、科目、自然语言理解、推理、知识、长文本、工具、智能体、代码、分布外、法律、医疗、金融、社会规范、真实性、评估、多任务、多语言、其他以及评估平台。
- Traditional NLP Datasets:细分为问答(阅读理解、知识问答、推理问答)、文本蕴含识别、数学、指代消解、情感分析、语义匹配、文本生成、文本翻译、文本摘要、文本分类、文本质量评估、文本转代码、命名实体识别、关系抽取、多任务。
- Multi-modal Large Language Models (MLLMs) Datasets:细分为指令微调数据集和评估数据集。
- Retrieval Augmented Generation (RAG) Datasets:独立类别,包含多个子数据集。
-
关键更新(截至 2024 年 4 月):
- 2024 年 1 月:创建仓库。
- 2024 年 2 月:新增 Dolma、Aya Collection、Aya Dataset、OpenMathInstruct-1、FinBen 等数据集。
- 2024 年 4 月:新增 MLLMs 和 RAG 数据集板块;新增 MMRS-1M、VideoChat2-IT、InstructDoc、ALLaVA-4V Data、MVBench、OlympiadBench、MMMU、CLUE Benchmark Series、OpenLLM Leaderboard、OpenCompass、MTEB Leaderboard、C-MTEB Leaderboard、NAH、ToolEyes、UHGEval、CLongEval、MathPile、WanJuan-CC、IEPile、InstructIE、CRUD-RAG、WikiEval、RGB、RAG-Instruct-Benchmark-Tester、ARES 等数据集。
- 2024 年 4 月 6 日:新增 GPQA、MGSM、HaluEval-Wild、CMATH、FineMath、RealTime QA、WYWEB、ChineseFactEval、Counting-Stars、SlimPajama、MassiveText、MADLAD-400、Minerva、CCAligned、WikiMatrix、OpenWebMath、WebQuestions、ALCE、AlphaFin、COIG-CQIA 等数据集。





