遇见数据集

joey234/mmlu-elementary_mathematics-rule-neg-prepend

收藏
Hugging Face2023-04-29 更新2024-03-04 收录
官方服务:

资源简介:

--- dataset_info: features: - name: question dtype: string - name: choices sequence: string - name: answer dtype: class_label: names: '0': A '1': B '2': C '3': D - name: neg_prompt dtype: string splits: - name: test num_bytes: 148516 num_examples: 378 download_size: 82529 dataset_size: 148516 --- # Dataset Card for "mmlu-elementary_mathematics-rule-neg-prepend" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

--- 数据集信息: 特征字段: - 名称:question(问题),数据类型:字符串 - 名称:choices(候选选项),数据类型:字符串序列 - 名称:answer(标准答案),数据类型:类别标签(class_label),其标签映射规则为: '0':A,'1':B,'2':C,'3':D - 名称:neg_prompt(负向提示词),数据类型:字符串 数据集划分(splits): - 名称:test(测试集),字节占用量:148516,样本数量:378 下载文件大小:82529 数据集总占用大小:148516 --- # 「mmlu-elementary_mathematics-rule-neg-prepend」数据集卡片(Dataset Card) [更多信息待补充](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

提供机构:
joey234
原始信息汇总

数据集概述

数据集名称

mmlu-elementary_mathematics-rule-neg-prepend

数据集特征

  • question:问题描述,数据类型为字符串。
  • choices:选项列表,数据类型为序列字符串。
  • answer:答案,数据类型为分类标签,具体标签名称为:
    • 0: A
    • 1: B
    • 2: C
    • 3: D
  • neg_prompt:否定提示,数据类型为字符串。

数据集分割

  • test:测试集,包含378个样本,总大小为148516字节。

数据集大小

  • 下载大小:82529字节
  • 数据集总大小:148516字节
搜集汇总
数据集介绍
joey234/mmlu-elementary_mathematics-rule-neg-prepend 数据集图片
构建方式
该数据集源自MMLU基准测试中的初等数学子集,专注于评估语言模型在基础数学推理方面的能力。构建过程中,研究者对原始样本进行了规则化的否定提示改造,即在每个问题前添加一个明确的否定性前置指令(neg_prompt),旨在测试模型面对干扰信息时的鲁棒性与逻辑一致性。数据集包含378条测试样本,每条样本由问题(question)、四个选项(choices)、标准答案(answer)以及对应的否定提示(neg_prompt)组成,答案以A、B、C、D四分类标签形式存储。
使用方法
使用时,可将该数据集加载为测试集,用于评估预训练语言模型在初等数学问答任务中的表现。推荐将问题与否定提示拼接后输入模型,要求模型从四个选项中选出正确答案。评估指标可采用准确率,并对比模型在有/无否定提示下的性能差异,以量化其抗干扰能力。数据格式为标准的HuggingFace数据集结构,支持直接通过datasets库加载,便于集成到现有的评估流水线中。
背景与挑战
背景概述
在自然语言处理与教育测评交叉领域,数学推理能力评估一直是衡量模型认知水平的重要维度。该数据集由joey234于2023年前后创建,隶属于MMLU(Massive Multitask Language Understanding)基准测试的子集,聚焦于初等数学(elementary mathematics)这一具体学科。核心研究问题在于探究规则否定提示(rule-neg-prepend)对语言模型数学解题表现的影响,通过精心设计的378道选择题,覆盖算术、代数、几何等基础数学概念。该数据集不仅继承了MMLU在跨领域知识评估方面的权威性,更开创性地引入否定性提示策略,为理解模型在对抗性设定下的推理鲁棒性提供了关键测试平台,对后续教育AI系统的公平性与可靠性研究产生了深远影响。
当前挑战
该数据集面临的核心挑战在于双重维度:首先,在领域问题层面,初等数学看似简单却蕴含逻辑陷阱,传统模型常因过度依赖模式匹配而非真正理解数学原理而失准,规则否定提示进一步放大了这一缺陷,要求模型具备超越表面词汇的因果推理能力;其次,在构建过程中,378个样本的规模虽精炼却可能引入采样偏差,如何确保题目难度梯度与知识覆盖的均衡性成为关键,同时否定性提示的语法结构设计需避免歧义或误导,这对标注者的语言学与数学素养提出了极高要求,任何微小的提示措辞差异都可能导致模型表现剧烈波动,增加了基准测试的可重复性挑战。
常用场景
经典使用场景
在自然语言处理与教育测评的交叉领域中,该数据集聚焦于小学基础数学的规则推理能力,通过将否定前缀(neg-prepend)策略融入MMLU基准测试的子集,构建了一个专门评估语言模型在简单数学问题上鲁棒性的测试平台。其经典使用场景在于衡量模型面对带有否定表述的数学选择题时的表现,从而揭示模型在理解逻辑否定与数学规则结合时的局限性。
解决学术问题
该数据集直面当前大语言模型在数学推理中易受表述干扰的学术困境,尤其是当问题被嵌入否定修饰后,模型准确率显著下降的现象。它系统性地量化了模型在基础数学规则上的逻辑漏洞,为研究语言模型的形式化推理能力、否定语义处理机制以及训练数据偏差提供了关键基准,推动了可解释AI与稳健推理方向的深入探索。
实际应用
在实际应用中,该数据集可服务于教育科技领域的智能辅导系统,用于检测和优化AI在数学教学中的响应可靠性,避免因否定表述而导致的错误引导。同时,它也为自动化试题生成与评估工具提供了质量校验标准,确保模型在辅助学生解题或批改作业时具备对基础数学规则的稳定理解。
数据集最近研究
最新研究方向
在人工智能与教育测评的交汇领域,小学数学作为认知发展的基石,其评测数据集的设计正迎来范式革新。joey234/mmlu-elementary_mathematics-rule-neg-prepend 数据集聚焦于通过否定性提示(neg_prompt)规则前置策略,探索大语言模型在基础数学推理中的鲁棒性与对抗性脆弱性。这一研究方向紧密关联当前热点事件——如GPT-4、Claude等模型在标准化数学测试中的表现争议,以及提示工程(Prompt Engineering)对模型输出稳定性的关键影响。该数据集不仅为评估模型对逻辑否定与任务指令的敏感性提供了标准化基准,更揭示了语言模型在简单规则遵循中的认知盲区,其意义在于推动从“答案正确性”到“推理可靠性”的评测标准进化,为构建更稳健、可解释的教育AI系统奠定实证基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务