遇见数据集

joey234/mmlu-high_school_macroeconomics

收藏
Hugging Face2023-08-23 更新2024-03-04 收录
官方服务:

资源简介:

--- dataset_info: features: - name: question dtype: string - name: choices sequence: string - name: answer dtype: class_label: names: '0': A '1': B '2': C '3': D - name: negate_openai_prompt struct: - name: content dtype: string - name: role dtype: string - name: neg_question dtype: string - name: fewshot_context dtype: string - name: fewshot_context_neg dtype: string splits: - name: dev num_bytes: 4117 num_examples: 5 - name: test num_bytes: 1391944 num_examples: 390 download_size: 141522 dataset_size: 1396061 configs: - config_name: default data_files: - split: dev path: data/dev-* - split: test path: data/test-* --- # Dataset Card for "mmlu-high_school_macroeconomics" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

数据集信息: 特征字段: - 字段名:question,数据类型:字符串 - 字段名:choices,数据类型:字符串序列 - 字段名:answer,数据类型:类别标签(class_label),其类别映射为:'0'对应A、'1'对应B、'2'对应C、'3'对应D - 字段名:negate_openai_prompt,为结构体类型,包含以下子字段: - 子字段名:content,数据类型:字符串 - 子字段名:role,数据类型:字符串 - 字段名:neg_question,数据类型:字符串 - 字段名:fewshot_context,数据类型:少样本上下文(对应英文为fewshot_context) - 字段名:fewshot_context_neg,数据类型:反向少样本上下文 数据集划分: - 划分名称:dev,数据字节数:4117,样本总数:5 - 划分名称:test,数据字节数:1391944,样本总数:390 下载大小:141522字节,数据集总存储大小:1396061字节 配置项: - 配置名称:default,对应数据文件: - 划分dev:数据路径为data/dev-* - 划分test:数据路径为data/test-* # "mmlu-high_school_macroeconomics"数据集卡片 [更多信息贡献指南](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

提供机构:
joey234
原始信息汇总

数据集概述

数据集名称

"mmlu-high_school_macroeconomics"

数据集特征

  • question: 数据类型为字符串。
  • choices: 数据类型为序列字符串。
  • answer: 数据类型为分类标签,标签名称为:
    • 0: A
    • 1: B
    • 2: C
    • 3: D
  • negate_openai_prompt: 结构化数据,包含以下字段:
    • content: 数据类型为字符串。
    • role: 数据类型为字符串。
  • neg_question: 数据类型为字符串。
  • fewshot_context: 数据类型为字符串。
  • fewshot_context_neg: 数据类型为字符串。

数据集分割

  • dev:
    • 字节数: 4117
    • 示例数: 5
  • test:
    • 字节数: 1391944
    • 示例数: 390

数据集大小

  • 下载大小: 141522字节
  • 数据集总大小: 1396061字节

配置文件

  • config_name: default
  • data_files:
    • split: dev, path: data/dev-*
    • split: test, path: data/test-*
搜集汇总
数据集介绍
joey234/mmlu-high_school_macroeconomics 数据集图片
构建方式
该数据集源自大规模多任务语言理解基准(MMLU)中的高中宏观经济学子集,旨在评估语言模型在特定学科领域的知识掌握程度。构建上,数据集以选择题形式组织,每个样本包含一个问题(question)、四个选项(choices)及正确答案(answer),其中答案被编码为A至D的类别标签。此外,为增强模型的鲁棒性,数据集引入了负向提示字段(negate_openai_prompt)和负向问题(neg_question),并提供了少样本上下文(fewshot_context)及其负向版本(fewshot_context_neg),以支持多样化的评估范式。数据划分为开发集(dev,5个样本)和测试集(test,390个样本),确保模型在有限示例下进行推理。
特点
该数据集的核心特点在于其聚焦于高中宏观经济学这一狭窄领域,同时融合了负向提示与少样本学习机制,为模型理解经济学术语、政策分析及供需关系等概念提供了精细化的评估场景。数据集的字段设计独具匠心,除基础问答外,negate_openai_prompt字段通过结构化角色与内容模拟对话交互,neg_question则用于测试模型对否定表述的敏感性。fewshot_context字段允许在测试前注入少量示例,而fewshot_context_neg进一步挑战模型在对抗性环境下的表现。这种多维度设计使得数据集不仅能衡量模型的知识广度,还能检验其逻辑一致性与抗干扰能力。
使用方法
使用该数据集时,研究者可加载默认配置,通过HuggingFace的datasets库直接获取开发集与测试集。典型应用流程包括:首先,利用question与choices字段构造输入,要求模型从四个选项中选出正确答案,并与answer字段比对以计算准确率。其次,可借助fewshot_context字段在提示中嵌入少量示例,模拟少样本学习场景。此外,neg_question和negate_openai_prompt字段适用于鲁棒性测试,通过对比模型在标准与负向条件下的表现差异,评估其推理稳定性。数据集以parquet格式存储,支持高效加载,适合用于教育评估、模型基准测试及对抗性训练等任务。
背景与挑战
背景概述
大规模多任务语言理解(MMLU)数据集由Hendrycks等人于2020年提出,旨在评估语言模型在广泛学科上的知识储备与推理能力。其中,高中宏观经济学子集(joey234/mmlu-high_school_macroeconomics)聚焦于经济学基础教育中的核心概念,涵盖供给需求、国民收入核算、货币政策与财政政策等经典议题。该子集包含390条测试样本与5条开发样本,每条样本以四选一的选择题形式呈现,并附带了用于对抗性测试的否定式问题变体,以探究模型在语义反转条件下的鲁棒性。作为MMLU体系的重要组成部分,这一子集为衡量模型在社会科学领域的常识性理解与逻辑演绎能力提供了标准化基准,其影响力体现在对GPT-4、LLaMA等前沿模型在经济学知识维度的系统评估中,推动了教育智能化与知识图谱构建的交叉研究。
当前挑战
该数据集所解决的领域问题在于,传统自然语言处理基准多聚焦于通用知识或单一学科,缺乏对宏观经济学这样具有动态因果关系的复杂领域的深度评测。具体挑战包括:其一,宏观经济概念间存在非线性关联(如利率与汇率传导机制),模型需超越表层模式匹配,实现因果推理;其二,否定式问题(neg_question)的设计要求模型在语义翻转后仍能保持正确判断,这对基于统计共现的语言模型构成显著认知负荷。在数据集构建过程中,挑战体现为:原始MMLU试题需从教科书与标准化考试中提取,确保知识覆盖的权威性与时效性;同时,否定式样本的自动生成需避免引入语法歧义或逻辑矛盾,否则会扭曲评测的效度。此外,仅有5条开发样本的有限标注规模,使得模型调参时的过拟合风险加剧,需依赖跨任务迁移学习来缓解。
常用场景
经典使用场景
在宏观经济学的教育研究领域,joey234/mmlu-high_school_macroeconomics数据集被广泛用于评估和提升语言模型对高中阶段宏观经济学知识的掌握程度。该数据集包含390道测试题目,涵盖供需平衡、货币政策、财政政策、通货膨胀等核心概念,每道题配有四个选项和标准答案。研究者常将其作为基准测试,衡量模型在特定学科知识上的推理与记忆能力,尤其适用于对比不同预训练模型在经济学常识上的表现优劣。
实际应用
在实际应用中,该数据集可辅助开发智能辅导系统与自适应学习平台。例如,教育科技公司可利用其训练能够自动解答宏观经济学问题的AI助教,为学生提供个性化错题解析与知识点巩固。此外,它还能用于构建经济学知识问答机器人,为金融机构或高校提供快速检索与解释经济政策术语的服务,降低人工咨询成本。数据集中的负样本设计(如neg_question)更可增强模型对误导性信息的鲁棒性,提升实际部署中的可靠性。
衍生相关工作
基于此数据集,衍生出一系列优化语言模型学科能力的研究工作。例如,部分学者采用课程学习策略,将题目按难度排序后逐步训练模型,显著提升其在宏观经济学术语上的准确率。另有工作引入对抗性样本生成技术,利用neg_question字段构造干扰项,增强模型对错误选项的辨别力。此外,该数据集还作为少样本学习(fewshot_context)的测试床,催生了针对经济学推理链提示设计的创新方法,推动了知识密集型任务中提示工程的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务