遇见数据集

joey234/mmlu-professional_psychology-neg-prepend-fix

收藏
Hugging Face2023-08-21 更新2024-03-04 收录
官方服务:

资源简介:

--- configs: - config_name: default data_files: - split: dev path: data/dev-* - split: test path: data/test-* dataset_info: features: - name: question dtype: string - name: choices sequence: string - name: answer dtype: class_label: names: '0': A '1': B '2': C '3': D - name: negate_openai_prompt struct: - name: content dtype: string - name: role dtype: string - name: neg_question dtype: string - name: fewshot_context dtype: string - name: ori_prompt dtype: string splits: - name: dev num_bytes: 7999 num_examples: 5 - name: test num_bytes: 2096464 num_examples: 612 download_size: 14733 dataset_size: 2104463 --- # Dataset Card for "mmlu-professional_psychology-neg-prepend-fix" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

configs: - config_name: default data_files: - split: dev(开发集) path: data/dev-* - split: test(测试集) path: data/test-* dataset_info: features: - name: 问题(question) dtype: 字符串 - name: 选项(choices) sequence: 字符串序列 - name: 答案(answer) dtype: class_label: 类别标签 names: '0': A '1': B '2': C '3': D - name: 反向OpenAI提示词(negate_openai_prompt) struct: - name: 内容(content) dtype: 字符串 - name: 角色(role) dtype: 字符串 - name: 反向问题(neg_question) dtype: 字符串 - name: 少样本上下文(fewshot_context) dtype: 字符串 - name: 原始提示词(ori_prompt) dtype: 字符串 splits: - name: dev(开发集) num_bytes: 7999 num_examples: 5 - name: test(测试集) num_bytes: 2096464 num_examples: 612 download_size: 14733 dataset_size: 2104463 --- # 数据集卡片:"mmlu-professional_psychology-neg-prepend-fix" [需补充更多信息](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

提供机构:
joey234
原始信息汇总

数据集概述

数据集名称

  • 名称: mmlu-professional_psychology-neg-prepend-fix

数据集配置

  • 默认配置: default

数据文件

  • 开发集:
    • 路径: data/dev-*
    • 分割: dev
  • 测试集:
    • 路径: data/test-*
    • 分割: test

数据集信息

特征

  • 问题:
    • 名称: question
    • 数据类型: string
  • 选项:
    • 名称: choices
    • 数据类型: sequence of string
  • 答案:
    • 名称: answer
    • 数据类型: class_label
      • 标签名称:
        • 0: A
        • 1: B
        • 2: C
        • 3: D
  • 否定OpenAI提示:
    • 名称: negate_openai_prompt
    • 结构:
      • 内容:
        • 名称: content
        • 数据类型: string
      • 角色:
        • 名称: role
        • 数据类型: string
  • 否定问题:
    • 名称: neg_question
    • 数据类型: string
  • 少量样本上下文:
    • 名称: fewshot_context
    • 数据类型: string
  • 原始提示:
    • 名称: ori_prompt
    • 数据类型: string

分割

  • 开发集:
    • 名称: dev
    • 字节数: 7999
    • 样本数: 5
  • 测试集:
    • 名称: test
    • 字节数: 2096464
    • 样本数: 612

大小

  • 下载大小: 14733 字节
  • 数据集大小: 2104463 字节
搜集汇总
数据集介绍
joey234/mmlu-professional_psychology-neg-prepend-fix 数据集图片
构建方式
在自然语言处理与认知科学交叉领域,对抗性样本的构建对评估模型鲁棒性至关重要。该数据集基于MMLU专业心理学子集进行改造,通过向原始问题前添加否定前缀(neg-prepend)生成负向变体,同时保留原始答案标签。构建流程包含两个阶段:首先对原始问题文本进行否定化处理,形成neg_question字段;其次将否定前缀与原始提示拼接,生成negate_openai_prompt结构化字段。数据集划分为5条样本的开发集与612条样本的测试集,确保模型在少量示例下仍能有效评估。
使用方法
使用者可通过HuggingFace的datasets库直接加载,指定配置名default后自动获取dev和test两个划分。加载后数据包含question、choices、answer等基础字段,以及neg_question和negate_openai_prompt等增强字段。典型使用流程为:将negate_openai_prompt作为模型输入,比较模型输出与原始answer的匹配度,从而量化否定前缀对推理能力的影响。对于少样本评估,可利用fewshot_context字段拼接示例,或将neg_question与原始提示组合构建自定义提示模板。该数据集特别适合用于心理学知识问答场景下的对抗性鲁棒性测试。
背景与挑战
背景概述
大规模多任务语言理解(MMLU)基准测试自2020年由Hendrycks等人提出以来,已成为评估语言模型知识广度和推理能力的重要标尺。该数据集涵盖了包括专业心理学在内的57个学科领域,旨在检验模型在零样本和少样本场景下的泛化性能。joey234/mmlu-professional_psychology-neg-prepend-fix作为MMLU专业心理学子集的修正版本,由研究人员针对原始数据中提示词前置否定(neg-prepend)可能引发的偏差进行专项修复,其核心研究问题聚焦于如何消除提示工程对模型评估的干扰,确保测试结果真实反映模型内在的知识掌握程度。该修正版本的出现,进一步提升了MMLU在专业心理学领域评估的可靠性与公信力。
当前挑战
该数据集面临的核心挑战在于领域问题与构建过程的双重复杂性。就领域问题而言,专业心理学涉及临床诊断、发展理论、认知机制等高度专业化的知识,模型需在四个选项中精准区分细微语义差异,这对语言模型的常识推理与领域术语理解构成严峻考验。在构建过程中,原始MMLU数据存在提示词前置否定导致模型产生系统性偏差的问题,修复版本需在不改变题目原意的前提下,通过调整否定词位置与上下文结构来消除混淆,同时确保修正后的样本在少样本提示场景中仍保持评估效度。此外,测试集仅包含612个样本,样本量有限使得统计显著性易受噪声影响,增加了评估结果稳定性维护的难度。
常用场景
经典使用场景
在自然语言处理与心理学交叉领域,MMLU专业心理学子集常被用作评估大语言模型在专业知识掌握程度上的基准测试。该数据集聚焦于专业心理学知识,涵盖认知、发展、临床等多个分支的标准化多选题,通过对比模型预测与人类专家标注的正确答案,系统衡量模型对心理学领域复杂概念与推理能力的理解水平。研究者通常利用该数据集检验模型在零样本或少样本情境下的知识迁移能力,尤其关注模型是否能够准确区分心理学中容易混淆的专业术语与理论框架。
解决学术问题
该数据集有效解决了大语言模型在垂直学科知识评估中缺乏标准化基准的学术难题。传统通用评估任务难以揭示模型在特定领域的认知边界,而MMLU专业心理学子集通过精心设计的612道测试题目,为量化模型在心理学知识图谱中的覆盖深度与推理准确性提供了可靠工具。它帮助研究者识别模型在心理测量、异常心理学等子领域的知识盲区,推动学界深入理解模型知识表征的局限性,从而促进更精准的领域自适应训练策略与知识增强方法的开发。
实际应用
在实际应用中,该数据集可辅助开发面向心理咨询、教育测评等场景的智能辅助系统。例如,通过微调模型使其通过专业心理学测试,可以构建具备基础心理学知识的对话代理,用于支持心理健康筛查、学习材料推荐或自动化的知识问答服务。此外,该数据集还可用于验证心理学教学工具中AI助手的专业素养,确保其在解答学生关于心理发展理论或临床诊断标准等疑问时的准确性,降低因模型知识缺陷导致的信息误导风险。
数据集最近研究
最新研究方向
该数据集聚焦于大规模多任务语言理解(MMLU)框架下专业心理学领域的负向提示修复研究。当前前沿方向集中于探索语言模型在心理学专业知识问答中的鲁棒性,特别关注通过负向提示(neg-prepend)策略评估模型对误导性信息的抵抗能力。这一研究方向与近期大语言模型安全性和可靠性热点事件紧密相连,例如模型在面对对抗性输入时可能产生错误推理。该数据集通过引入negate_openai_prompt和neg_question字段,为研究者提供了标准化基准,以量化模型在专业领域内对否定性提示的脆弱性。其意义在于推动开发更稳健的心理学AI辅助系统,确保在临床咨询、心理评估等敏感场景中,模型能抵御逻辑陷阱并维持专业准确性,从而提升AI在心理健康领域的可信应用边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务