调查从五个方面对LLM的 444个 数据集(涵盖8种语言类别和32个领域)进行了整理和分类:
一、预训练语料库(59个)
49个 通用预训练语料库
10个 领域特定预训练语料库
二、指令微调数据集(103个)
69个通用指令微调数据集
34个特定领域指令微调数据集
三、偏好数据集 (16个)
16个偏好数据集
四、评估数据集(112个)
112个评估数据集
五、传统自然语言处理(NLP)数据集(154个)
37个阅读理解数据集、 13个知识问答数据集、13个推理问答数据集
10个识别文本蕴含数据集、9个数学数据集、6个共指消解数据集
4个情感分析数据集、10个语义匹配数据集、4个文本生成数据集
3个文本翻译数据集、 14个文本摘要数据集、6个文本分类数据集
4个文本质量评估数据集、4个文本转代码数据集、10个命名实体识别数据集
4个关系抽取数据集、3个多任务数据集信息汇总