遇见数据集

joey234/mmlu-human_sexuality-neg-prepend-fix

收藏
Hugging Face2023-08-21 更新2024-03-04 收录
官方服务:

资源简介:

--- configs: - config_name: default data_files: - split: dev path: data/dev-* - split: test path: data/test-* dataset_info: features: - name: question dtype: string - name: choices sequence: string - name: answer dtype: class_label: names: '0': A '1': B '2': C '3': D - name: negate_openai_prompt struct: - name: content dtype: string - name: role dtype: string - name: neg_question dtype: string - name: fewshot_context dtype: string - name: ori_prompt dtype: string splits: - name: dev num_bytes: 5197 num_examples: 5 - name: test num_bytes: 288820 num_examples: 131 download_size: 13461 dataset_size: 294017 --- # Dataset Card for "mmlu-human_sexuality-neg-prepend-fix" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

## 配置项 - 配置名称:默认(default) 数据文件: - 拆分集(split):开发集,路径为 `data/dev-*` - 拆分集(split):测试集,路径为 `data/test-*` ## 数据集信息 ### 特征字段 1. 字段名:问题(question),数据类型:字符串 2. 字段名:选项(choices),类型:字符串序列 3. 字段名:答案(answer),数据类型:分类标签(class_label),标签映射为:`0`对应A,`1`对应B,`2`对应C,`3`对应D 4. 字段名:否定式OpenAI提示词(negate_openai_prompt),结构体类型: - 子字段名:内容(content),数据类型:字符串 - 子字段名:角色(role),数据类型:字符串 5. 字段名:否定式问题(neg_question),数据类型:字符串 6. 字段名:少样本上下文(fewshot_context),数据类型:字符串 7. 字段名:原始提示词(ori_prompt),数据类型:字符串 ### 拆分集合 1. 开发集(dev):字节数为5197,样本量为5 2. 测试集(test):字节数为288820,样本量为131 - 下载大小:13461字节 - 数据集总大小:294017字节 --- # 数据集卡片:"mmlu-human_sexuality-neg-prepend-fix" [需补充更多信息](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

提供机构:
joey234
原始信息汇总

数据集概述

数据集名称

  • mmlu-human_sexuality-neg-prepend-fix

数据集配置

  • 默认配置
    • 数据文件路径
      • dev: data/dev-*
      • test: data/test-*

数据集特征

  • 特征列表
    • question: 问题,数据类型为字符串
    • choices: 选项,数据类型为字符串序列
    • answer: 答案,数据类型为类别标签,包含选项 A, B, C, D
    • negate_openai_prompt: 结构化数据,包含内容和角色,均为字符串类型
    • neg_question: 否定问题,数据类型为字符串
    • fewshot_context: 少量示例上下文,数据类型为字符串
    • ori_prompt: 原始提示,数据类型为字符串

数据集分割

  • 分割信息
    • dev: 5 个样本,5197 字节
    • test: 131 个样本,288820 字节

数据集大小

  • 下载大小: 13461 字节
  • 数据集大小: 294017 字节
搜集汇总
数据集介绍
joey234/mmlu-human_sexuality-neg-prepend-fix 数据集图片
构建方式
该数据集基于MMLU基准中human_sexuality子集构建,通过引入否定前缀修正策略对原始问题进行语义翻转处理。具体而言,对每个测试样本的提问文本添加否定性修饰,生成对应的neg_question字段,同时保留原始问题(ori_prompt)与标准选项结构。数据集划分为开发集(5例)与测试集(131例),确保样本分布的均衡性与领域覆盖的完整性。
特点
数据集的核心特色在于其双重问题表征设计:既包含标准MMLU格式的原始问答对,又提供经否定前缀修正的对抗性变体。negate_openai_prompt字段采用结构化角色-内容对话格式,便于评估大语言模型在否定逻辑下的推理鲁棒性。fewshot_context字段嵌入上下文示例,支持少样本学习场景的灵活适配。
使用方法
使用者可通过HuggingFace Datasets库直接加载,默认配置提供dev与test两个切分。适用于评估模型在人类性学领域知识上的基础准确率与否定敏感性,典型用法为对比模型在ori_prompt与neg_question上的输出差异。建议结合MMLU官方评估协议,将choices字段的选项映射为分类标签,通过answer字段的索引值计算准确率指标。
背景与挑战
背景概述
大规模多任务语言理解(MMLU)基准测试是评估大型语言模型在广泛知识领域内推理能力的重要工具,涵盖人文、科学、社会科学等众多学科。在此背景下,joey234/mmlu-human_sexuality-neg-prepend-fix数据集专注于人类性学这一细分领域,旨在修正原始MMLU数据集中否定前缀处理不当的问题,从而提升模型对微妙语义变化的敏感度。该数据集由研究者Joey等人创建,核心研究问题在于如何通过数据预处理修复来增强语言模型在敏感话题上的理解鲁棒性,其发布对于推动模型在隐私、伦理及特定学术领域的公平性评估具有潜在影响力。
当前挑战
数据集面临的挑战主要体现为两个方面。首先,在领域问题层面,人类性学涉及高度语境化的概念和敏感表述,语言模型常因否定词前置的缺失而误判正反意涵,导致推理偏差,这一问题亟待通过精确的数据标注来缓解。其次,在构建过程中,原始MMLU数据中否定前缀的识别与修复需要人工校验与算法结合,以避免引入新噪声,同时该数据集规模较小(仅131个测试样本),如何在有限样本中确保修正的泛化性及避免过拟合,构成了构建中的核心难点。
常用场景
经典使用场景
在自然语言处理与知识推理的交汇领域,joey234/mmlu-human_sexuality-neg-prepend-fix数据集专为评估和提升大语言模型在人类性学这一特定学科上的推理能力而设计。其经典使用场景聚焦于模型对否定性前缀问题的处理,通过对比原始问题与经否定改造后的变体,系统性地检验模型在逻辑反转、语义消歧及常识对抗中的表现。这一场景不仅要求模型具备扎实的领域知识,更需展现对语言细微变化的鲁棒性,从而成为衡量模型在细粒度知识理解与对抗性推理方面能力的标杆。
实际应用
在实际应用中,该数据集的价值体现在教育辅导、心理咨询辅助系统以及智能内容审核等场景。例如,在开发面向青少年的性教育虚拟助手时,模型必须能准确理解如“哪种行为不是安全的?”等否定性提问,避免因语义误解给出危险建议。此外,在社交媒体内容过滤中,模型需正确解析用户对性健康话题的否定或反讽表达,以提升违规内容识别的精准度。该数据集通过模拟真实世界中的语言歧义,助力模型在敏感领域实现更可靠的交互,降低因逻辑错误引发的伦理风险。
衍生相关工作
基于该数据集,衍生出一系列聚焦于对抗性提示工程与模型鲁棒性增强的研究工作。例如,相关工作探索了通过对比学习框架,在训练阶段引入否定性样本以提升模型的逻辑一致性;另一些研究则利用该数据集作为基准,开发了针对大语言模型的否定性推理能力评估协议,并进一步扩展到其他学科如医学和法律领域。此外,该数据集还催生了关于模型在少样本情境下处理语言极性反转的元学习策略研究,为构建通用推理增强模块提供了实证基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务