遇见数据集

joey234/mmlu-global_facts-neg-prepend-verbal

收藏
Hugging Face2024-01-11 更新2024-03-04 收录
官方服务:

资源简介:

--- configs: - config_name: default data_files: - split: dev path: data/dev-* - split: test path: data/test-* dataset_info: features: - name: question dtype: string - name: choices sequence: string - name: answer dtype: class_label: names: '0': A '1': B '2': C '3': D - name: negate_openai_prompt struct: - name: content dtype: string - name: role dtype: string - name: neg_question dtype: string - name: fewshot_context dtype: string - name: ori_prompt dtype: string - name: neg_prompt dtype: string - name: fewshot_context_neg dtype: string - name: fewshot_context_ori dtype: string splits: - name: dev num_bytes: 7049 num_examples: 5 - name: test num_bytes: 753562 num_examples: 100 download_size: 110433 dataset_size: 760611 --- # Dataset Card for "mmlu-global_facts-neg-prepend-verbal" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

--- 配置项(configs): - 配置名称(config_name): default 数据文件(data_files): - 数据集划分(split): dev 文件路径(path): data/dev-* - 数据集划分(split): test 文件路径(path): data/test-* 数据集信息(dataset_info): 特征字段(features): - 字段名(name): question 数据类型(dtype): 字符串 - 字段名(name): choices 数据类型(dtype): 字符串序列 - 字段名(name): answer 数据类型(dtype): 类别标签(class_label),类别映射(names)为:'0'对应A,'1'对应B,'2'对应C,'3'对应D - 字段名(name): negate_openai_prompt 数据类型(dtype): 结构体(struct),包含: - 字段名(name): content 数据类型(dtype): 字符串 - 字段名(name): role 数据类型(dtype): 字符串 - 字段名(name): neg_question 数据类型(dtype): 字符串 - 字段名(name): fewshot_context 数据类型(dtype): 少样本上下文 - 字段名(name): ori_prompt 数据类型(dtype): 原始提示词 - 字段名(name): neg_prompt 数据类型(dtype): 反向提示词 - 字段名(name): fewshot_context_neg 数据类型(dtype): 反向少样本上下文 - 字段名(name): fewshot_context_ori 数据类型(dtype): 原始少样本上下文 数据集划分(splits): - 划分名称(name): dev 字节数(num_bytes): 7049 样本数量(num_examples): 5 - 划分名称(name): test 字节数(num_bytes): 753562 样本数量(num_examples): 100 下载大小(download_size): 110433 字节 数据集总大小(dataset_size): 760611 字节 --- # 「mmlu-global_facts-neg-prepend-verbal」数据集卡片 [需补充更多信息](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

提供机构:
joey234
原始信息汇总

数据集概述

数据集名称

  • 名称: mmlu-global_facts-neg-prepend-verbal

数据集配置

  • 默认配置: default
    • 数据文件:
      • 开发集: data/dev-*
      • 测试集: data/test-*

数据集特征

  • 特征列表:
    • question: 字符串类型
    • choices: 字符串序列
    • answer: 分类标签类型,包含以下类别:
      • 0: A
      • 1: B
      • 2: C
      • 3: D
    • negate_openai_prompt: 结构体类型,包含以下字段:
      • content: 字符串类型
      • role: 字符串类型
    • neg_question: 字符串类型
    • fewshot_context: 字符串类型
    • ori_prompt: 字符串类型
    • neg_prompt: 字符串类型
    • fewshot_context_neg: 字符串类型
    • fewshot_context_ori: 字符串类型

数据集分割

  • 分割信息:
    • 开发集:
      • 字节数: 7049
      • 样本数: 5
    • 测试集:
      • 字节数: 753562
      • 样本数: 100

数据集大小

  • 下载大小: 110433 字节
  • 数据集大小: 760611 字节
搜集汇总
数据集介绍
构建方式
该数据集基于MMLU(Massive Multitask Language Understanding)基准中的全球事实子集构建而成,旨在评估语言模型对世界知识的掌握程度。在构建过程中,研究者引入了否定性预处理策略,通过将原始问题转化为否定形式(neg_question),并生成对应的否定提示(neg_prompt),以检验模型在否定语境下的推理能力。数据集包含两个划分:开发集(dev)包含5个样本,测试集(test)包含100个样本。每个样本保留了原始问题、选项、正确答案,并新增了否定后的提示字段(negate_openai_prompt),以及少样本学习上下文(fewshot_context)和原始提示(ori_prompt),形成了多层次的对照结构。
特点
该数据集的核心特点在于其否定性预处理设计,通过显式构造否定问题(neg_question)和否定提示(neg_prompt),能够系统性地评估语言模型对否定语义的敏感度与鲁棒性。数据集包含10个字段,其中negate_openai_prompt采用结构化存储,包含角色(role)和内容(content)键值对,便于直接适配OpenAI API格式。此外,数据集同时提供了原始提示(ori_prompt)与否定提示(neg_prompt),以及对应的少样本上下文(fewshot_context_ori与fewshot_context_neg),支持对比实验设计,从而深入分析否定操作对模型预测的影响。
使用方法
该数据集适用于多选问答任务的评估与微调。使用时,可直接加载HuggingFace数据集,通过question字段获取原始问题,利用choices和answer字段进行标准评估;亦可借助neg_question和neg_prompt字段测试模型在否定语境下的表现。negate_openai_prompt字段可直接作为OpenAI聊天补全API的输入,简化了调用流程。研究者可结合fewshot_context字段构建少样本学习场景,或通过对比ori_prompt与neg_prompt的输出差异,量化否定操作对模型推理的干扰程度。
背景与挑战
背景概述
在大型语言模型(LLM)的可靠性评估中,知识边界与逻辑一致性成为核心议题。joey234/mmlu-global_facts-neg-prepend-verbal数据集由研究者于2023年构建,旨在探索LLM对全球事实性知识的理解及其在否定性提示下的表现。该数据集基于MMLU(Massive Multitask Language Understanding)框架,聚焦于全球事实类问题,通过设计包含否定前缀的问答对,系统性地检验模型在语义反转场景中的推理鲁棒性。其核心研究问题在于揭示LLM是否真正掌握事实知识,抑或仅依赖表面统计规律。作为对抗性评估的典型案例,该数据集为理解语言模型的认知局限性提供了关键基准,推动了可信AI领域对知识表征与逻辑一致性的深入探讨。
当前挑战
该数据集面临的核心挑战包括:一是领域问题层面,现有LLM在否定性语境中常出现知识召回错误,例如对“非欧洲国家首都”等否定表述的推理失败,暴露出模型对语义极性转换的脆弱性,这直接威胁到事实问答系统的可靠性。二是构建过程中,需要精心设计否定前缀的语法结构以避免歧义,同时确保原始事实与否定后答案的逻辑对偶性,这对数据标注的精确性提出严苛要求。此外,仅100个测试样本的规模限制了统计显著性,可能无法全面覆盖否定性推理的复杂模式,亟需扩展至更多样化的否定类型与领域知识。
常用场景
经典使用场景
该数据集以MMLU(大规模多任务语言理解)为基础,聚焦于全球事实性知识,通过引入否定前缀和口头表达变体,构建了评估语言模型在事实推理与否定理解能力上的经典测试集。其核心使用场景在于衡量大型语言模型面对含有否定语义的陈述时,能否准确识别、检索并应用世界知识,尤其关注模型在对抗性扰动下的鲁棒性。研究者常借助该数据集检验模型是否真正理解事实的逻辑关系,而非仅依赖统计共现模式,从而推动语言模型从表面记忆向深层推理迈进。
实际应用
在实际应用中,该数据集可用于强化语言模型在知识密集型场景下的可靠性,例如智能问答系统、自动事实核查工具及跨文化信息检索平台。通过基于该数据的微调或对抗训练,模型能够更精准地处理用户带有否定或反事实前提的查询,减少因语义误解导致的错误输出。此外,在全球化商业情报分析、法律文书审阅及教育评估系统中,该数据集有助于构建对复杂语言变体更具适应性的AI系统,提升人机交互的信任度与准确性。
衍生相关工作
基于该数据集,研究者已衍生出多项经典工作,包括否定敏感的语言模型微调框架、对抗性提示生成方法以及多语言事实鲁棒性基准扩展。部分工作将其与MMLU的其他子集结合,构建跨任务否定推理图谱;另一些则借鉴其否定前缀设计,开发了针对模型逻辑一致性的压力测试工具。这些衍生研究不仅深化了学界对语言模型认知缺陷的理解,还催生了如否定感知注意力机制、反事实知识蒸馏等一系列创新技术,极大丰富了自然语言理解领域的理论体系与实践工具箱。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务