遇见数据集

AwesomeLLMsDatasets

收藏
github2026-03-07 更新2026-06-04 收录
官方服务:

资源简介:

这是一个专注于大型语言模型(LLM)的数据集合集,覆盖五个核心维度:预训练语料库、微调指令数据集、偏好数据集、评估数据集、传统NLP数据集,以及多模态数据集和检索增强生成(RAG)数据集。它汇总了444个数据集,涵盖8种语言类别和32个领域,旨在为研究者和开发者提供全面的资源参考,推动人工智能技术发展。

This is a dataset collection focused on Large Language Models (LLMs). It covers five core dimensions: pretraining corpora, fine-tuning instruction datasets, preference datasets, evaluation datasets, traditional NLP datasets, as well as multimodal datasets and Retrieval-Augmented Generation (RAG) datasets. With a total of 444 datasets covering 8 language categories and 32 domains, this collection aims to provide comprehensive resource references for researchers and developers and promote the advancement of artificial intelligence technology.

创建时间:
2024-04-27
原始信息汇总

数据集详情总结:Awesome-LLMs-Datasets

  • 概述:该项目是一个针对大语言模型(LLM)文本数据集的综合汇总,涵盖五个核心维度:预训练语料库、微调指令数据集、偏好数据集、评估数据集和传统自然语言处理(NLP)数据集。此外,新加入了多模态大语言模型(MLLM)数据集和检索增强生成(RAG)数据集。

  • 相关论文:发表于 2024 年 2 月的论文 "Datasets for Large Language Models: A Comprehensive Survey",对 444 个数据集进行了统计分析,覆盖 8 种语言类别和 32 个领域,总数据量超过 774.5 TB(预训练语料库)和 7 亿条实例(其他数据集)。

  • 数据集信息模块:每个数据集包含以下 20 个维度的信息:

    • 语料库/数据集名称
    • 发布者
    • 发布时间(“X”表示月份未知)
    • 大小
    • 是否公开(“All”表示完全开源,“Partial”表示部分开源,“Not”表示未开源)
    • 许可证
    • 语言(“EN”表示英语,“ZH”表示中文,“AR”表示阿拉伯语,“ES”表示西班牙语,“RU”表示俄语,“DE”表示德语,“PL”表示编程语言,“Multi”表示多语言,括号内为语言数量)
    • 构建方法(“HG”表示人工生成,“MC”表示模型生成,“CI”表示收集并改进现有数据集)
    • 类别
    • 来源
    • 领域
    • 指令类别
    • 偏好评估方法(“VO”表示投票,“SO”表示排序,“SC”表示评分,“-H”表示人工执行,“-M”表示模型执行)
    • 问题类型(“SQ”表示主观题,“OQ”表示客观题,“Multi”表示多种类型)
    • 评估方法(“CE”表示代码评估,“HE”表示人工评估,“ME”表示模型评估)
    • 关注点
    • 评估类别/子类别数量
    • 评估类别
    • 实体类别数量(NER 任务)
    • 关系类别数量(RE 任务)
  • 数据集分类结构

    • Pre-training Corpora:包括通用领域预训练语料库(细分为网页、语言文本、书籍、学术资料、代码、平行语料、社交媒体、百科、多类别)和特定领域预训练语料库(细分为金融、医疗、数学、其他)。
    • Instruction Fine-tuning Datasets:包括通用指令微调数据集(细分为人工生成、模型构建、收集改进、混合类型)和特定领域指令微调数据集(细分为医疗、代码、法律、数学、教育、其他)。
    • Preference Datasets:按偏好评估方法细分为投票、排序、评分、其他。
    • Evaluation Datasets:涵盖超过 20 个子类别,包括通用、考试、科目、自然语言理解、推理、知识、长文本、工具、智能体、代码、分布外、法律、医疗、金融、社会规范、真实性、评估、多任务、多语言、其他以及评估平台。
    • Traditional NLP Datasets:细分为问答(阅读理解、知识问答、推理问答)、文本蕴含识别、数学、指代消解、情感分析、语义匹配、文本生成、文本翻译、文本摘要、文本分类、文本质量评估、文本转代码、命名实体识别、关系抽取、多任务。
    • Multi-modal Large Language Models (MLLMs) Datasets:细分为指令微调数据集和评估数据集。
    • Retrieval Augmented Generation (RAG) Datasets:独立类别,包含多个子数据集。
  • 关键更新(截至 2024 年 4 月):

    • 2024 年 1 月:创建仓库。
    • 2024 年 2 月:新增 Dolma、Aya Collection、Aya Dataset、OpenMathInstruct-1、FinBen 等数据集。
    • 2024 年 4 月:新增 MLLMs 和 RAG 数据集板块;新增 MMRS-1M、VideoChat2-IT、InstructDoc、ALLaVA-4V Data、MVBench、OlympiadBench、MMMU、CLUE Benchmark Series、OpenLLM Leaderboard、OpenCompass、MTEB Leaderboard、C-MTEB Leaderboard、NAH、ToolEyes、UHGEval、CLongEval、MathPile、WanJuan-CC、IEPile、InstructIE、CRUD-RAG、WikiEval、RGB、RAG-Instruct-Benchmark-Tester、ARES 等数据集。
    • 2024 年 4 月 6 日:新增 GPQA、MGSM、HaluEval-Wild、CMATH、FineMath、RealTime QA、WYWEB、ChineseFactEval、Counting-Stars、SlimPajama、MassiveText、MADLAD-400、Minerva、CCAligned、WikiMatrix、OpenWebMath、WebQuestions、ALCE、AlphaFin、COIG-CQIA 等数据集。
搜集汇总
数据集介绍
AwesomeLLMsDatasets 数据集图片
构建方式
该数据集以系统性文献综述为基石,通过广泛搜集与整理现有的大语言模型文本数据集,构建了一个覆盖预训练语料、指令微调数据集、偏好数据集、评估数据集以及传统自然语言处理数据集五大维度的综合性资源库。数据集信息的收录遵循严格的多维标准,涵盖名称、发布者、时间、规模、开源状态、许可协议、语言、构建方式等二十项属性,并依据构建方式细分为人工生成、模型构建及现有数据集收集改进三类。同时,数据集持续动态更新,逐步纳入多模态大语言模型与检索增强生成等新兴领域的数据集,以确保其前沿性与全面性。
特点
该数据集最显著的特点在于其系统性与多维度的分类架构。它将海量的数据集资源按照大语言模型的生命周期与功能模块进行精细划分,从预训练到评估形成完整链条,便于研究者快速定位所需资源。每个数据集均附有详尽的元数据信息,包括规模、语言分布、领域归属及构建方法,总计涵盖超过774.5 TB的预训练语料与7亿条其他实例,横跨8种语言类别与32个领域。此外,数据集还引入了多模态与RAG等前沿方向,展现了其与时俱进的特质与广泛的应用潜力。
使用方法
研究者可通过数据集仓库的目录结构高效导航,依据预训练语料、指令微调、偏好数据、评估及传统NLP等主类别进行浏览,并可进一步利用子类别(如网页、书籍、数学、医疗等)精准筛选特定领域的数据资源。每个数据集条目均提供直接的论文链接、GitHub仓库与数据集下载地址,便于获取原始数据与复现研究。对于偏好数据集,还标注了投票、排序、评分等评估方法,以辅助用户根据研究需求选择合适的数据构建与评估策略。
背景与挑战
背景概述
自2023年以来,大型语言模型(LLM)的迅猛发展对高质量、多样化的数据集提出了前所未有的需求。在此背景下,AwesomeLLMsDatasets数据集于2024年1月由研究团队创建,旨在系统梳理和归纳现有的代表性LLM文本数据集。该数据集围绕预训练语料库、指令微调数据集、偏好数据集、评估数据集及传统自然语言处理数据集五大维度展开,并逐步扩展至多模态大语言模型数据集与检索增强生成数据集。其核心研究问题在于填补LLM数据集领域缺乏全面综述与深入分析的空白,为研究者提供清晰的资源全景。截至2024年,该数据集已涵盖444个数据集,覆盖8种语言类别与32个领域,预训练语料库总数据量超过774.5 TB,其他数据集实例超过7亿条,对推动LLM领域的系统性研究具有重要影响力。
当前挑战
当前,该数据集面临的挑战主要来自两个方面。其一,在领域问题层面,LLM数据集的构建需应对数据质量参差不齐、标注一致性不足等核心难题,例如预训练语料库中需高效过滤噪声与重复内容,指令微调数据集则需确保任务的多样性与指令的明确性,以提升模型泛化能力。其二,在构建过程中,数据集面临动态更新的压力,随着新模型与任务不断涌现,需持续整合如多模态与检索增强生成等新兴数据集,同时维护不同来源数据的格式统一与版权合规。此外,跨语言覆盖的扩展与大规模数据存储管理的效率问题,也构成了技术上的显著挑战。
常用场景
经典使用场景
AwesomeLLMsDatasets 作为一个系统性的数据集资源索引,其经典使用场景在于为大型语言模型(LLM)研究提供全面的数据资源导航。研究者可通过该数据集目录,快速定位并选择适用于不同训练阶段的数据集,包括预训练语料库、指令微调数据集、偏好数据集、评估数据集及传统自然语言处理数据集。其分类体系覆盖了从通用预训练语料到多模态、检索增强生成等新兴领域,使得模型开发者在构建或优化LLM时,能够依据任务需求高效检索并比较数据集的规模、语言、构建方法等关键属性,从而显著降低数据调研与筛选的时间成本。
实际应用
在实际应用中,AwesomeLLMsDatasets 充当了工业界与学术界之间数据共享的桥梁。企业研发团队可借助其分类体系,快速为特定垂直领域(如金融、医疗、法律)的LLM应用筛选合适的微调数据集,例如使用OpenMathInstruct-1提升数学推理能力,或利用FinBen评估金融场景下的模型表现。同时,该索引中收录的评估基准(如OpenCompass、MTEB Leaderboard)为模型上线前的性能验证提供了标准化流程,而RAG数据集的加入则直接服务于检索增强生成系统的构建,提升了知识密集型问答、文档摘要等产品的落地效率。
衍生相关工作
该数据集催生了一系列衍生研究工作,其核心价值在于为后续研究提供了结构化数据地图。例如,基于其分类框架,学者们开展了数据质量对模型性能影响的横纵向对比研究,分析了不同构建方法(人工生成、模型构建、现有数据集改进)在指令微调中的优劣。此外,该索引中新增的多模态与RAG数据集板块,直接推动了多模态大语言模型(如VideoChat2-IT)和检索增强系统(如CRUD-RAG)的评测基准工作。其论文《Datasets for Large Language Models: A Comprehensive Survey》本身也成为引用量极高的综述文献,为数据驱动型LLM研究奠定了方法论基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务