遇见数据集

Zaid/mmlu-random-1

收藏
Hugging Face2024-07-15 更新2024-07-22 收录
官方服务:

资源简介:

该数据集包含多个配置,每个配置对应不同的学科领域,如抽象代数、解剖学、天文学等。每个配置包含多个特征,如问题、学科、选项和答案。数据集被分为测试集、验证集和开发集,每个集的大小和示例数量都有详细说明。数据集的主要用途可能是用于教育或评估目的的多选题测试。

The dataset contains multiple configurations, each corresponding to different subject areas such as abstract algebra, anatomy, astronomy, etc. Each configuration includes features such as question, subject, choices, and answer. The dataset is divided into test, validation, and development sets, with detailed information on the size and number of examples for each set. The primary use of the dataset is likely for educational or assessment purposes in the form of multiple-choice tests.

提供机构:
Zaid
原始信息汇总

数据集概述

该数据集包含多个配置,每个配置对应不同的学科领域。每个配置包含以下特征:

  • question: 问题文本,数据类型为字符串。
  • subject: 学科领域,数据类型为字符串。
  • choices: 选项列表,数据类型为字符串序列。
  • answer: 答案,数据类型为分类标签,标签名称为 A, B, C, D。

每个配置包含三个数据集分割:

  • test: 测试集
  • validation: 验证集
  • dev: 开发集

以下是各配置的详细信息:

配置列表

abstract_algebra

  • test: 100个样本,21316字节
  • validation: 11个样本,2232字节
  • dev: 5个样本,918字节
  • 下载大小: 17255字节
  • 数据集大小: 24466字节

all

  • test: 14042个样本,6967453字节
  • validation: 1531个样本,763484字节
  • dev: 285个样本,125353字节
  • 下载大小: 3991525字节
  • 数据集大小: 7856290字节

anatomy

  • test: 135个样本,34594字节
  • validation: 14个样本,3282字节
  • dev: 5个样本,1010字节
  • 下载大小: 28952字节
  • 数据集大小: 38886字节

astronomy

  • test: 152个样本,48735字节
  • validation: 16个样本,5223字节
  • dev: 5个样本,2129字节
  • 下载大小: 39371字节
  • 数据集大小: 56087字节

business_ethics

  • test: 100个样本,35140字节
  • validation: 11个样本,3235字节
  • dev: 5个样本,2273字节
  • 下载大小: 31641字节
  • 数据集大小: 40648字节

clinical_knowledge

  • test: 265个样本,68572字节
  • validation: 29个样本,7290字节
  • dev: 5个样本,1308字节
  • 下载大小: 51669字节
  • 数据集大小: 77170字节

college_biology

  • test: 144个样本,51521字节
  • validation: 16个样本,5111字节
  • dev: 5个样本,1615字节
  • 下载大小: 43066字节
  • 数据集大小: 58247字节

college_chemistry

  • test: 100个样本,26796字节
  • validation: 8个样本,2484字节
  • dev: 5个样本,1424字节
  • 下载大小: 26860字节
  • 数据集大小: 30704字节

college_computer_science

  • test: 100个样本,45429字节
  • validation: 11个样本,4959字节
  • dev: 5个样本,2893字节
  • 下载大小: 41095字节
  • 数据集大小: 53281字节

college_mathematics

  • test: 100个样本,26999字节
  • validation: 11个样本,2909字节
  • dev: 5个样本,1596字节
  • 下载大小: 26853字节
  • 数据集大小: 31504字节

college_medicine

  • test: 173个样本,85845字节
  • validation: 22个样本,8337字节
  • dev: 5个样本,1758字节
  • 下载大小: 56348字节
  • 数据集大小: 95940字节

college_physics

  • test: 102个样本,32107字节
  • validation: 11个样本,3687字节
  • dev: 5个样本,1495字节
  • 下载大小: 29603字节
  • 数据集大小: 37289字节

computer_security

  • test: 100个样本,29212字节
  • validation: 11个样本,4768字节
  • dev: 5个样本,1194字节
  • 下载大小: 30168字节
  • 数据集大小: 35174字节

conceptual_physics

  • test: 235个样本,45867字节
  • validation: 26个样本,5034字节
  • dev: 5个样本,1032字节
  • 下载大小: 35015字节
  • 数据集大小: 51933字节

default

  • test: 14042个样本,6967453字节
  • validation: 1531个样本,763484字节
  • dev: 285个样本,125353字节
  • 下载大小: 3991525字节
  • 数据集大小: 7856290字节

econometrics

  • test: 114个样本,48359字节
  • validation: 12个样本,5147字节
  • dev: 5个样本,1712字节
  • 下载大小: 36192字节
  • 数据集大小: 55218字节

electrical_engineering

  • test: 145个样本,28900字节
  • validation: 16个样本,3307字节
  • dev: 5个样本,1090字节
  • 下载大小: 26787字节
  • 数据集大小: 33297字节

elementary_mathematics

  • test: 378个样本,79924字节
  • validation: 41个样本,10042字节
  • dev: 5个样本,1558字节
  • 下载大小: 55029字节
  • 数据集大小: 91524字节

formal_logic

  • test: 126个样本,51789字节
  • validation: 14个样本,6464字节
  • dev: 5个样本,1825字节
  • 下载大小: 32928字节
  • 数据集大小: 60078字节

global_facts

  • test: 100个样本,19991字节
  • validation: 10个样本,2013字节
  • dev: 5个样本,1297字节
  • 下载大小: 19335字节
  • 数据集大小: 23301字节

high_school_biology

  • test: 310个样本,116850字节
  • validation: 32个样本,11746字节
  • dev: 5个样本,1776字节
  • 下载大小: 78269字节
  • 数据集大小: 130372字节

high_school_chemistry

  • test: 203个样本,63527字节
  • validation: 22个样本,7630字节
  • dev: 5个样本,1333字节
  • 下载大小: 45882字节
  • 数据集大小: 72490字节

high_school_computer_science

  • test: 100个样本,47664字节
  • validation: 9个样本,3619字节
  • dev: 5个样本,3066字节
  • 下载大小: 39174字节
  • 数据集大小: 54349字节

high_school_european_history

  • test: 165个样本,275568字节
  • validation: 18个样本,30196字节
  • dev: 5个样本,11712字节
  • 下载大小: 196482字节
  • 数据集大小: 317476字节

high_school_geography

  • test: 198个样本,46972字节
  • validation: 22个样本,4870字节
  • dev: 5个样本,1516字节
  • 下载大小: 38249字节
  • 数据集大小: 53358字节

high_school_government_and_politics

  • test: 193个样本,73589字节
  • validation: 21个样本,7870字节
  • dev: 5个样本,1962字节
  • 下载大小: 52765字节
  • 数据集大小: 83421字节

high_school_macroeconomics

  • test: 390个样本,129375字节
  • validation: 43个样本,14298字节
  • dev: 5个样本,1466字节
  • 下载大小: 68947字节
  • 数据集大小: 145139字节

high_school_mathematics

  • test: 270个样本,62132字节
  • validation: 29个样本,6536字节
  • dev: 5个样本,1420字节
  • 下载大小: 45293字节
  • 数据集大小: 70088字节

high_school_microeconomics

  • test: 238个样本,82831字节
  • validation: 26个样本,8321字节
  • dev: 5个样本,1436字节
  • 下载大小: 49974字节
  • 数据集大小: 92588字节

high_school_physics

  • test: 151个样本,62999字节
  • validation: 17个样本,7150字节
  • dev: 5个样本,1592字节
  • 下载大小: 45592字节
  • 数据集大小: 71741字节

high_school_psychology

  • test: 545个样本,173565字节
  • validation: 60个样本,18817字节
  • dev: 5个样本,2023字节
  • 下载大小: 113201字节
  • 数据集大小: 194405字节

high_school_statistics

  • test: 216个样本,116306字节
  • validation: 23个样本,10583字节
  • dev: 5个样本,2646字节
  • 下载大小: 74916字节
  • 数据集大小: 129535字节

high_school_us_history

  • test: 204个样本,302026字节
  • validation: 22个样本,32266字节
  • dev: 5个样本,8982字节
  • 下载大小: 200052字节
  • 数据集大小: 343274字节

high_school_world_history

  • test: 237个样本,385478字节
  • validation: 26个样本,46243字节
  • dev: 5个样本,5015字节
  • 下载大小: 250141字节
  • 数据集大小: 436736字节

human_aging

  • test: 223个样本,49431字节
  • validation: 23个样本,5040字节
  • dev: 5个样本,1071字节
  • 下载大小: 41243字节
  • 数据集大小: 55542字节

human_sexuality

  • test: 131个样本,34587字节
  • validation: 12个样本,2637字节
  • dev: 5个样本,1160字节
  • 下载大小: 32591字节
  • 数据集大小: 38384字节

international_law

  • test: 121个样本,56060字节
  • validation: 13个样本,6734字节
  • dev: 5个样本,2511字节
  • 下载大小: 41680字节
  • 数据集大小: 65305字节

jurisprudence

  • test: 108个样本,35810字节
  • validation: 11个样本,3904字节
  • dev: 5个样本,1376字节
  • 下载大小: 33619字节
  • 数据集大小: 41090字节

logical_fallacies

  • test: 108个样本,35810字节
  • validation: 11个样本,3904字节
  • dev: 5个样本,1376字节
  • 下载大小: 33619字节
  • 数据集大小: 41090字节
搜集汇总
数据集介绍
Zaid/mmlu-random-1 数据集图片
构建方式
Zaid/mmlu-random-1 数据集源于大规模多任务语言理解(MMLU)基准的随机化子集,旨在评估模型在广泛学科中的知识广度与推理能力。其构建方式遵循了MMLU的原始框架,精心收录了涵盖人文、社科、理工及医学等领域的多项选择题。每个数据条目均包含一个问题文本、对应的学科标签、四个选项(A至D)以及一个标准答案标签。数据集为每个学科配置了独立的配置名,并统一划分了测试集、验证集与开发集,以支持模型训练与评估的标准化流程。
特点
该数据集最显著的特点在于其学科覆盖的全面性与样本分布的随机性。从抽象代数到世界历史,从临床知识到计算机安全,数据集横跨57个学科领域,总计包含逾一万五千道测试题目,为多领域语言理解能力提供了严苛的评测环境。各学科子集规模不一,反映了真实知识体系中的复杂度差异。此外,每个样本均附带明确的学科归属,便于研究者进行领域特定的性能分析与诊断。
使用方法
使用该数据集时,研究者可通过Hugging Face Datasets库便捷加载。加载后,每个样本以字典形式呈现,包含问题、学科、选项及正确答案字段。典型的评估流程为:向模型输入问题与选项,令其从四个候选中择一输出,随后将模型预测与标准答案比对以计算准确率。数据集的多配置设计允许用户按需选择特定学科或加载全部数据,适用于从细粒度能力剖析到整体性能基准测试的多样化场景。
背景与挑战
背景概述
Zaid/mmlu-random-1数据集是Massive Multitask Language Understanding(MMLU)基准测试的一个随机子集变体,由Zaid于2023年左右构建,旨在评估语言模型在广泛学科领域中的知识与推理能力。MMLU源自Hendrycks等人于2020年提出的原始基准,覆盖从抽象代数到法理学等57个学科,其核心研究问题在于检验预训练模型在零样本和少样本场景下,能否像人类专家一样在多选题中展现跨领域理解。该数据集通过包含100至数百个样本的测试集,为模型在医学、法律、工程等专业领域的泛化性能提供了标准化度量,已成为衡量大型语言模型知识广度的关键标杆,对推动通用人工智能的发展具有深远影响。
当前挑战
该数据集面临的挑战首先体现在领域问题的复杂性上:MMLU旨在解决语言模型在单一任务中难以覆盖多学科知识的局限,但Zaid/mmlu-random-1的随机子集可能因样本分布不均而无法全面代表原始基准的多样性,导致评估结果偏向特定学科,削弱了泛化能力的可信度。其次,构建过程中遭遇的挑战包括数据标注的精确性维护——原始MMLU依赖专家精心设计的问题与答案,而随机子集化可能引入噪声或丢失领域平衡,同时有限样本量(如某些配置仅含5个开发样本)限制了模型微调与验证的稳定性,增加了结果统计的方差与不可复现风险。
常用场景
经典使用场景
MMLU(Massive Multitask Language Understanding)数据集是评估大语言模型在多学科知识掌握与推理能力上的标杆性基准。Zaid/mmlu-random-1 作为该数据集的随机子集,保留了涵盖从抽象代数、解剖学到法学、计量经济学等数十个学科的多选题结构。其经典用法在于作为高效评测工具,在资源受限或快速迭代场景下,对模型在人文、社科、理工、医学等领域的零样本或少样本表现进行标准化测试,从而衡量模型知识的广度与深度。
解决学术问题
该数据集的核心学术价值在于解决了大语言模型知识评估缺乏系统性、跨学科覆盖不足的问题。通过提供涵盖57个领域、超过1.4万道题目的标准化测试集,它使得研究者能够客观量化模型在专业学科知识、逻辑推理与常识判断上的真实水平,避免了单一任务或领域评估的片面性。这一基准的建立推动了模型能力的可比较性,为后续模型在知识记忆、泛化能力及理解一致性上的改进提供了关键参照。
衍生相关工作
该数据集衍生了诸多经典工作,如GPT-4、LLaMA、Claude等模型均将MMLU作为核心评测基准,并报告了在随机子集或全量集上的得分。此外,研究者基于其结构开发了多种优化策略,包括领域自适应微调(如Medicine-LLaMA)、多任务提示学习以及知识蒸馏方法,旨在提升模型在特定学科上的表现。这些工作不仅验证了数据集的评测有效性,也推动了从通用模型向专业化模型的发展方向。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务