遇见数据集

joey234/mmlu-formal_logic-neg-prepend

收藏
Hugging Face2023-08-23 更新2024-03-04 收录
官方服务:

资源简介:

--- dataset_info: features: - name: question dtype: string - name: choices sequence: string - name: answer dtype: class_label: names: '0': A '1': B '2': C '3': D - name: negate_openai_prompt struct: - name: content dtype: string - name: role dtype: string - name: neg_question dtype: string - name: fewshot_context dtype: string - name: ori_prompt dtype: string - name: neg_prompt dtype: string - name: fewshot_context_neg dtype: string - name: fewshot_context_ori dtype: string splits: - name: dev num_bytes: 9134 num_examples: 5 - name: test num_bytes: 1353581 num_examples: 126 download_size: 164902 dataset_size: 1362715 configs: - config_name: default data_files: - split: dev path: data/dev-* - split: test path: data/test-* --- # Dataset Card for "mmlu-formal_logic-neg-prepend" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

dataset_info: 特征: - 字段名: 问题(question) 数据类型: 字符串 - 字段名: 选项(choices) 数据类型: 字符串序列 - 字段名: 答案(answer) 数据类型: 类别标签(class_label): 类别名称: '0': A '1': B '2': C '3': D - 字段名: 反向OpenAI提示词(negate_openai_prompt) 数据类型: 结构体 子字段: - 字段名: 内容(content) 数据类型: 字符串 - 字段名: 角色(role) 数据类型: 字符串 - 字段名: 反向问题(neg_question) 数据类型: 字符串 - 字段名: 少样本上下文(fewshot_context) 数据类型: 字符串 - 字段名: 原始提示词(ori_prompt) 数据类型: 字符串 - 字段名: 反向提示词(neg_prompt) 数据类型: 字符串 - 字段名: 反向少样本上下文(fewshot_context_neg) 数据类型: 字符串 - 字段名: 原始少样本上下文(fewshot_context_ori) 数据类型: 字符串 划分: - 划分名: dev 字节数: 9134 样本数: 5 - 划分名: test 字节数: 1353581 样本数: 126 下载大小: 164902 数据集总大小: 1362715 配置项: - 配置名称: default 数据文件: - 划分: dev 路径: data/dev-* - 划分: test 路径: data/test-* --- # “mmlu-formal_logic-neg-prepend”数据集卡片 [需补充更多信息](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

提供机构:
joey234
原始信息汇总

数据集概述

数据集名称

  • 名称: mmlu-formal_logic-neg-prepend

数据集特征

  • 特征列表:
    • question: 数据类型为字符串
    • choices: 数据类型为字符串序列
    • answer: 数据类型为分类标签,其中标签名称为 0: A, 1: B, 2: C, 3: D
    • negate_openai_prompt: 结构化数据,包含两个子特征:
      • content: 数据类型为字符串
      • role: 数据类型为字符串
    • neg_question: 数据类型为字符串
    • fewshot_context: 数据类型为字符串
    • ori_prompt: 数据类型为字符串
    • neg_prompt: 数据类型为字符串
    • fewshot_context_neg: 数据类型为字符串
    • fewshot_context_ori: 数据类型为字符串

数据集分割

  • 分割信息:
    • dev: 包含5个样本,占用9134字节
    • test: 包含126个样本,占用1353581字节

数据集大小

  • 下载大小: 164902字节
  • 数据集总大小: 1362715字节

配置信息

  • 配置名称: default
  • 数据文件路径:
    • dev: data/dev-*
    • test: data/test-*
搜集汇总
数据集介绍
joey234/mmlu-formal_logic-neg-prepend 数据集图片
构建方式
在形式逻辑推理领域,数据集的构建质量直接影响模型对逻辑规则的掌握程度。joey234/mmlu-formal_logic-neg-prepend数据集基于MMLU基准中的形式逻辑子集进行深度改造,通过系统性地在原始问题前添加否定前缀(neg-prepend)来生成对抗性样本。具体而言,每个原始问题(question)被转化为一个带有否定语义的变体(neg_question),同时保留原始选项(choices)与正确答案(answer)。此外,数据集还包含了原始提示(ori_prompt)、否定提示(neg_prompt)以及结合少样本学习的上下文(fewshot_context、fewshot_context_neg),从而构建出多维度、结构化的逻辑推理测试集。
特点
该数据集的核心特点在于其对形式逻辑推理能力的精细化评估。通过引入否定前缀,数据集有效检验了模型在语义反转条件下的逻辑一致性,避免了模型仅依赖表面模式匹配的捷径。数据集中包含的negate_openai_prompt字段提供了标准化的否定指令模板,确保了实验的可重复性。同时,少样本上下文(fewshot_context)与否定上下文(fewshot_context_neg)的并行设计,使得研究者可以对比分析模型在有无否定干扰下的推理表现。整个数据集仅包含5条开发样本与126条测试样本,规模虽小但聚焦于高难度逻辑挑战,适合作为模型鲁棒性的诊断工具。
使用方法
使用该数据集时,研究者可直接从HuggingFace加载默认配置,其数据文件按dev与test两个划分存储。推荐将neg_question作为模型输入,配合choices与answer进行标准的多选推理评估。为深入分析否定效应,可利用neg_prompt与ori_prompt字段分别构造不同提示条件下的推理任务,观察模型性能差异。此外,fewshot_context_neg与fewshot_context_ori字段支持少样本学习场景下的对比实验,通过调整示例数量与否定策略,系统评估模型对逻辑否定的敏感度。数据集格式兼容主流框架,可直接用于分类或生成式模型的微调与评测。
背景与挑战
背景概述
在自然语言处理与逻辑推理的交叉领域,形式逻辑(formal logic)的自动化推理能力被视为衡量语言模型智能水平的重要标尺。MMLU(Massive Multitask Language Understanding)基准测试自2020年由加州大学伯克利分校等机构推出以来,已成为评估模型多任务理解能力的权威标准,其中形式逻辑子集专门考察模型对逻辑命题、推理规则及否定形式的掌握程度。joey234/mmlu-formal_logic-neg-prepend数据集正是针对这一子集的深化拓展,其创建团队通过精心设计的否定前导词(neg-prepend)策略,系统性地探究语言模型在处理逻辑否定时的脆弱性。该数据集以原始MMLU形式逻辑题目为基础,通过构造包含否定逻辑的变体问题,揭示了当前主流模型在逻辑一致性上的显著短板,对检验与提升语言模型的鲁棒推理能力具有重要价值。
当前挑战
该数据集所聚焦的核心挑战在于解决语言模型对逻辑否定(negation)的敏感性与鲁棒性问题。在领域层面,形式逻辑推理要求模型准确区分肯定与否定命题,但现有模型常因训练数据中的统计偏差而将否定视为无关噪声,导致在否定变体题目上出现推理崩溃。在构建过程中,挑战体现为如何在不破坏原题逻辑结构的前提下,生成语法正确且语义明确的否定问题变体,同时确保否定前后题目难度与知识范畴的等价性。此外,数据集需谨慎平衡否定提示的显式程度,避免因过度引导而泄露答案线索,这要求设计者在否定词的选择、位置嵌入及上下文一致性上进行精细调控,以构建出能真实反映模型逻辑缺陷的高质量评测样本。
常用场景
经典使用场景
在形式逻辑与自然语言推理的交叉领域,joey234/mmlu-formal_logic-neg-prepend数据集被广泛用于评估大语言模型在逻辑否定处理上的鲁棒性。该数据集基于MMLU中形式逻辑子集构建,通过系统性地在问题前添加否定前缀(如“并非”或“相反”),构造出与原题语义对立的对抗样本。研究者常利用此数据集测试模型是否能在否定语境下维持逻辑一致性,避免因表层词汇变化而误判答案,从而揭示模型在符号化推理上的深层缺陷。这一场景已成为逻辑推理基准测试中不可或缺的挑战性环节。
衍生相关工作
该数据集催生了一系列经典衍生工作,包括基于对比学习的否定感知预训练方法、逻辑否定对抗训练框架以及多任务否定推理基准。例如,研究者提出NegBERT模型,通过专门设计否定感知注意力机制增强对否定结构的编码能力;另有工作构建了NegLogic基准,将本数据集与因果推理、时间逻辑等场景结合,形成多维鲁棒性评估体系。这些衍生研究不仅深化了对语言模型逻辑缺陷的认知,还推动了可解释性分析工具的发展,如通过否定敏感性热力图揭示模型决策的脆弱环节,为构建更可靠的语言智能提供了方法论基础。
数据集最近研究
最新研究方向
在形式逻辑与大型语言模型交叉的前沿领域,joey234/mmlu-formal_logic-neg-prepend数据集聚焦于探究否定提示(negation prepend)对模型推理能力的影响。该数据集基于MMLU基准中的形式逻辑子集,通过系统性地在问题前添加否定前缀,构建了对抗性测试样本,以评估当前主流大语言模型在逻辑否定场景下的鲁棒性。这一研究方向与近期大模型在复杂推理任务中暴露的脆弱性热点事件紧密相关,例如模型在面临简单否定改写时可能产生与原始答案截然相反的输出。该数据集的发布为揭示语言模型在逻辑一致性上的深层次缺陷提供了关键测试资源,推动了对抗性样本生成与模型鲁棒性评估方法的革新,对提升AI系统的可靠性与可信度具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务