MNLP_M3_mcqa_dataset
收藏资源简介:
MNLP M3 MCQA数据集是一个包含约30,000个多项选择题问答(MCQA)示例的精心策划的集合,这些示例来自多个学术和基准数据集。该数据集旨在用于训练和评估在STEM(科学、技术、工程、数学)和一般知识领域中针对多项选择题任务的模型。数据集包括来自`SciQ`、`OpenBookQA`、`MathQA`、`ARC-Easy`、`ARC-Challenge`和`MedMCQA`等6个不同来源的问题,每个问题有4个选项和一个正确答案,涵盖了从科学到数学的各种主题。
The MNLP M3 MCQA dataset is a carefully curated collection of approximately 30,000 multiple-choice question answering (MCQA) examples sourced from multiple academic and benchmark datasets. This dataset is designed for training and evaluating models on multiple-choice question answering tasks across STEM (Science, Technology, Engineering, Mathematics) and general knowledge domains. It includes questions from six distinct sources: SciQ, OpenBookQA, MathQA, ARC-Easy, ARC-Challenge, and MedMCQA. Each question has four options and one correct answer, covering a wide range of topics from science to mathematics.
MNLP M3 MCQA 数据集概述
基本信息
- 语言: 英文 (en)
- 许可证: MIT
- 多语言性: 单语言 (monolingual)
- 规模: 10K<n<100K
- 任务类别: 多项选择 (multiple-choice)
- 任务ID: 多项选择问答 (multiple-choice-qa)
- 数据集名称: MNLP M3 MCQA Dataset
主要特点
- 包含约30,000个多项选择问答 (MCQA) 问题
- 来源于6个不同的数据集: SciQ, OpenBookQA, MathQA, ARC-Easy, ARC-Challenge, MedMCQA
- 每个问题有4个选项 (A–D) 和一个正确答案
- 涵盖广泛的主题: 科学、技术、工程、数学和常识
数据集结构
每个示例为一个字典,包含以下字段:
| 字段 | 类型 | 描述 |
|---|---|---|
dataset |
string |
来源数据集 (sciq, openbookqa 等) |
id |
string |
问题的唯一标识符 |
question |
string |
问题文本 |
choices |
list |
4个答案选项列表 (对应A–D) |
answer |
string |
正确选项,为字母: "A", "B", "C", 或 "D" |
来源数据集
数据集整合了以下高质量MCQA来源:
| 来源 (Hugging Face) | 名称 | 大小 | 描述 |
|---|---|---|---|
allenai/sciq |
SciQ | 11,679 | 科学问题 (物理、化学、生物、地球科学) |
allenai/openbookqa |
OpenBookQA | 4,957 | 需要多步推理和常识的科学考试风格问题 |
allenai/math_qa |
MathQA | 5,000 | 数学应用题,引入数值推理和问题解决组件 |
allenai/ai2_arc (ARC-Easy) |
ARC-Easy | 2,140 | 中学水平的科学问题,测试基本STEM理解和事实回忆 |
allenai/ai2_arc (ARC-Challenge) |
ARC-Challenge | 1,094 | 需要推理和推断的更难的科问题目 |
openlifescienceai/medmcqa |
MedMCQA | 5,000 | 医学主题的多项选择题,涵盖各种医学学科的临床推理问题 |
数据集划分
train(~70%) — 用于训练MCQA模型validation(~15%) — 用于调整和监控训练性能test(~15%) — 用于对未见问题的最终评估
作者
该数据集由Youssef Belghmi创建并发布,作为EPFL (2025年春季) CS-552: Modern NLP课程的一部分。




