遇见数据集

joey234/mmlu-high_school_physics-neg-prepend

收藏
Hugging Face2023-08-23 更新2024-03-04 收录
官方服务:

资源简介:

--- dataset_info: features: - name: question dtype: string - name: choices sequence: string - name: answer dtype: class_label: names: '0': A '1': B '2': C '3': D - name: negate_openai_prompt struct: - name: content dtype: string - name: role dtype: string - name: neg_question dtype: string - name: fewshot_context dtype: string - name: ori_prompt dtype: string - name: neg_prompt dtype: string - name: fewshot_context_neg dtype: string - name: fewshot_context_ori dtype: string splits: - name: dev num_bytes: 8534 num_examples: 5 - name: test num_bytes: 1413219 num_examples: 151 download_size: 206264 dataset_size: 1421753 configs: - config_name: default data_files: - split: dev path: data/dev-* - split: test path: data/test-* --- # Dataset Card for "mmlu-high_school_physics-neg-prepend" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

数据集信息: 特征项: - 字段名:question,数据类型:字符串 - 字段名:choices,数据类型:字符串序列 - 字段名:answer,数据类型:类别标签(class_label),其类别名称映射关系为:'0'对应'A','1'对应'B','2'对应'C','3'对应'D' - 字段名:negate_openai_prompt,为结构体类型,包含两个子字段: - content:数据类型为字符串,存储内容 - role:数据类型为字符串,存储角色信息 - 字段名:neg_question,数据类型:字符串 - 字段名:fewshot_context,数据类型:字符串 - 字段名:ori_prompt,数据类型:字符串 - 字段名:neg_prompt,数据类型:字符串 - 字段名:fewshot_context_neg,数据类型:字符串 - 字段名:fewshot_context_ori,数据类型:字符串 数据集划分: - 划分名称:dev(开发集),占用字节数:8534,样本总量:5 - 划分名称:test(测试集),占用字节数:1413219,样本总量:151 下载大小:206264 数据集总大小:1421753 配置项: - 配置名称:default(默认配置),数据文件映射规则: - 划分dev对应数据路径:data/dev-* - 划分test对应数据路径:data/test-* --- # 数据集卡片:“mmlu-high_school_physics-neg-prepend” [需补充更多信息](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

提供机构:
joey234
原始信息汇总

数据集概述

数据集名称

mmlu-high_school_physics-neg-prepend

数据集特征

  • question: 数据类型为字符串。
  • choices: 数据类型为字符串序列。
  • answer: 数据类型为分类标签,标签名称为A、B、C、D。
  • negate_openai_prompt: 结构化数据,包含content(字符串类型)和role(字符串类型)。
  • neg_question: 数据类型为字符串。
  • fewshot_context: 数据类型为字符串。
  • ori_prompt: 数据类型为字符串。
  • neg_prompt: 数据类型为字符串。
  • fewshot_context_neg: 数据类型为字符串。
  • fewshot_context_ori: 数据类型为字符串。

数据集分割

  • dev: 包含5个示例,总字节数为8534。
  • test: 包含151个示例,总字节数为1413219。

数据集大小

  • 下载大小: 206264字节
  • 数据集总大小: 1421753字节

配置文件

  • config_name: default
  • data_files:
    • split: dev, path: data/dev-*
    • split: test, path: data/test-*
搜集汇总
数据集介绍
joey234/mmlu-high_school_physics-neg-prepend 数据集图片
构建方式
该数据集基于MMLU(Massive Multitask Language Understanding)基准中的高中物理子集构建而成,旨在评估语言模型在物理知识理解上的鲁棒性。构建过程中,原始数据中的每个问题被转换为一个否定形式的问题,通过在问题前添加否定提示(neg-prepend)来生成对抗性样本。具体地,数据集包含原始问题(question)、四个选项(choices)以及正确答案(answer),同时引入了neg_question字段,其中存储了经过否定处理的问句。此外,还设计了多种提示格式,如原始提示(ori_prompt)、否定提示(neg_prompt)、少样本上下文(fewshot_context)及其否定与原始变体,以支持不同的评估场景。数据划分为开发集(5个样本)和测试集(151个样本),确保模型在有限样本下也能进行有效测试。
特点
该数据集的核心特点在于其对抗性设计,通过否定前缀策略系统性地挑战语言模型的推理能力。每个样本包含多维度提示信息,包括原始提示、否定提示以及少样本上下文,使得研究者可以深入分析模型在正面与负面语境下的表现差异。数据集聚焦于高中物理这一特定领域,问题覆盖力学、电磁学、热学等核心概念,难度适中但具有代表性。其否定预处理方式不仅测试模型对语义反转的敏感度,还能评估其在面对干扰信息时的稳健性。此外,数据集的规模精简(仅151个测试样本),便于快速迭代实验,同时保留了足够的统计效力以反映模型性能的显著变化。
使用方法
使用该数据集时,研究者可直接加载HuggingFace上的默认配置,通过split参数指定开发集或测试集。每个样本提供了多种输入格式:可直接使用question字段进行标准评估,或利用neg_question字段测试模型对否定问题的响应。更复杂的评估可结合ori_prompt与neg_prompt字段,对比模型在原始与否定提示下的准确性。少样本设置可通过fewshot_context、fewshot_context_neg和fewshot_context_ori字段实现,允许在上下文学习场景中评估模型的适应性。推荐在评估时同时报告标准准确率和否定提示下的准确率,以量化模型的鲁棒性。数据集以JSON格式存储,兼容主流框架如transformers和evaluate库,便于集成到现有评估流程中。
背景与挑战
背景概述
大规模多任务语言理解(MMLU)基准测试自2020年由OpenAI等机构提出以来,已成为评估语言模型知识广度与推理能力的重要标尺。其中,高中物理子集聚焦于经典力学、电磁学与热力学等核心概念,旨在检验模型对基础物理原理的掌握程度。该数据集由joey234于2023年构建,通过引入否定提示(neg-prepend)策略,探索模型在对抗性扰动下的鲁棒性。其核心研究问题在于:当原始问题被语义反转或逻辑否定后,模型能否维持准确的物理推理?这一设计不仅揭示了现有语言模型在因果理解与常识推理上的脆弱性,也为后续的对抗训练与数据增强提供了关键参照。随着GPT-4、Claude等模型在MMLU上接近人类表现,该子集对评估模型在科学教育场景中的实际应用价值愈发凸显。
当前挑战
当前该数据集面临的核心挑战可归纳为三重维度。其一,在领域问题层面,高中物理涵盖矢量运算、能量守恒等抽象概念,模型常因无法区分‘非’、‘不含’等否定词而陷入逻辑陷阱,例如将‘下列哪项不是牛顿定律’误答为‘是’,暴露出符号推理与自然语言表征间的鸿沟。其二,在构建过程中,否定提示的生成需兼顾语义保真度与语法自然性,人工标注的5条开发集与151条测试集规模有限,难以覆盖物理知识的所有分支与否定模式变体。其三,由于数据集的单一否定策略(仅针对问题前缀),模型可能通过记忆表面模式而非真正理解物理原理来规避错误,导致评估结果的泛化性存疑。这些挑战共同指向语言模型在科学推理中‘知其然不知其所以然’的深层困境。
常用场景
经典使用场景
在自然语言处理与教育测评的交叉领域中,joey234/mmlu-high_school_physics-neg-prepend数据集专为评估和增强大型语言模型在高中物理知识上的推理能力而设计。其经典使用场景聚焦于对抗性负样本测试,通过在原始问题前添加否定性前缀(neg-prepend),构建出具有语义反转特性的挑战性样本。研究者利用该数据集检验模型在面对逻辑干扰时的鲁棒性,从而深入理解语言模型在科学知识问答中的理解边界与脆弱性。
解决学术问题
该数据集精准回应了学术研究中关于语言模型对否定语义敏感度的核心问题。传统基准测试往往忽略否定结构对模型推理的干扰,导致模型在简单变体下性能骤降。通过系统性地引入否定前缀,该数据集揭示了模型在物理概念理解上的隐含缺陷,为探究模型是否真正掌握知识而非依赖表面模式提供了关键实验工具。其意义在于推动了对语言模型认知深度与泛化能力的严谨评估。
衍生相关工作
该数据集衍生了一系列关于语言模型否定理解机制的经典工作。研究者基于此构建了否定感知的训练策略,如对比学习与对抗训练方法,以增强模型对否定结构的鲁棒性。同时,它激发了跨学科研究,将认知科学中的否定处理理论引入NLP领域,催生了诸如“否定一致性评估框架”和“语义反转探测任务”等创新性工作,为模型可解释性研究开辟了新路径。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务