本数据集包含用于论文'Instruction Pre-Training: Language Models are Supervised Multitask Learners'中基于上下文的指令合成器的微调数据集合。数据集涵盖了超过40个任务类别,包括文本分类、表格问答、问答和零样本分类等,用于生成指令-响应对以预训练语言模型。此外,数据集还详细介绍了多任务微调过程,以开发能够从任何原始文本生成指令
RegMix Data Sample数据集是从Pile-Uncopyrighted数据集中精心挑选出来的,专门为RegMix论文设计,旨在通过将数据混合识别作为回归任务来促进语言模型预训练中的高性能数据混合自动识别。该数据集大小约为20GB,包含5B个token,遵循领域示例的自然token分布,并将不同领域的示例分别存储在单独的文件中。数据集分为两个主要目录:`train`和`valid`,每个