navitrix/mmlu
收藏资源简介:
MMLU(大规模多任务语言理解)数据集是一个用于评估语言模型在多项选择题上理解能力的基准数据集。它涵盖了从高中到大学水平的多个学科领域,包括数学、科学、人文和社会科学等。每个数据样本包含一个问题、所属学科、四个选项(A、B、C、D)和一个正确答案标签。数据集分为测试集、验证集和开发集,部分配置还提供辅助训练集。该数据集旨在测试模型在广泛主题上的知识和推理能力,适用于问答和多项选择任务。数据规模中等,语言为英语,许可证为MIT。
The MMLU (Measuring Massive Multitask Language Understanding) dataset is a benchmark for evaluating language models understanding of multiple-choice questions across various subjects. It covers disciplines from high school to college level, including mathematics, sciences, humanities, and social sciences. Each data sample consists of a question, subject, four choices (A, B, C, D), and a correct answer label. The dataset is split into test, validation, and dev sets, with some configurations including auxiliary training sets. It is designed to test models knowledge and reasoning across a broad range of topics, suitable for question-answering and multiple-choice tasks. The dataset is medium-sized, in English, and licensed under MIT.



