遇见数据集

joey234/mmlu-clinical_knowledge

收藏
Hugging Face2023-08-23 更新2024-03-04 收录
官方服务:

资源简介:

--- dataset_info: features: - name: question dtype: string - name: choices sequence: string - name: answer dtype: class_label: names: '0': A '1': B '2': C '3': D - name: negate_openai_prompt struct: - name: content dtype: string - name: role dtype: string - name: neg_question dtype: string - name: fewshot_context dtype: string - name: fewshot_context_neg dtype: string splits: - name: dev num_bytes: 4228 num_examples: 5 - name: test num_bytes: 848200 num_examples: 265 download_size: 103156 dataset_size: 852428 configs: - config_name: default data_files: - split: dev path: data/dev-* - split: test path: data/test-* --- # Dataset Card for "mmlu-clinical_knowledge" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

提供机构:
joey234
原始信息汇总

数据集概述

数据集名称

  • 名称: mmlu-clinical_knowledge

数据集特征

  • 特征列表:
    • question: 数据类型为字符串。
    • choices: 数据类型为序列字符串。
    • answer: 数据类型为分类标签,标签名称为A、B、C、D。
    • negate_openai_prompt: 结构化特征,包含以下子特征:
      • content: 数据类型为字符串。
      • role: 数据类型为字符串。
    • neg_question: 数据类型为字符串。
    • fewshot_context: 数据类型为字符串。
    • fewshot_context_neg: 数据类型为字符串。

数据集分割

  • 分割信息:
    • dev: 包含5个样本,总大小为4228字节。
    • test: 包含265个样本,总大小为848200字节。

数据集大小

  • 下载大小: 103156字节
  • 数据集总大小: 852428字节

数据文件配置

  • 配置名称: default
  • 数据文件路径:
    • dev: 路径为data/dev-*
    • test: 路径为data/test-*
搜集汇总
数据集介绍
joey234/mmlu-clinical_knowledge 数据集图片
构建方式
在临床医学知识评估的背景下,joey234/mmlu-clinical_knowledge数据集源自大规模多任务语言理解(MMLU)基准,专门聚焦于临床知识领域。该数据集以选择题形式构建,每个样本包含一个问题、四个选项(A、B、C、D)以及一个正确答案标签。为增强模型鲁棒性,数据集额外引入了否定提示(negate_openai_prompt)和否定问题(neg_question)字段,通过语义反转方式生成对抗性样本。同时,提供少样本上下文(fewshot_context)及其否定版本(fewshot_context_neg),支持上下文学习范式的评估。数据划分为开发集(5例)和测试集(265例),确保评估的标准化与可复现性。
使用方法
使用该数据集时,需通过HuggingFace Datasets库加载默认配置,支持开发集和测试集的分离访问。典型应用流程包括:利用question和choices字段构建输入,以answer字段作为监督标签进行模型微调或评估。对于鲁棒性测试,可启用neg_question或negate_openai_prompt字段,对比模型在原始与否定样本上的表现差异。少样本评估场景下,fewshot_context字段提供了示例模板,可直接嵌入提示工程。推荐将测试集作为主要评估集,开发集用于超参数调优或少量示例选择。最终性能指标通常采用准确率,并建议分层分析不同临床子领域的表现以揭示模型弱点。
背景与挑战
背景概述
在自然语言处理与医学人工智能交叉领域,大规模多任务语言理解(MMLU)基准测试的提出为评估语言模型的跨领域知识掌握程度树立了重要标杆。其中,临床知识子集(mmlu-clinical_knowledge)由Hendrycks等人于2020年创建,旨在专门考察模型在诊断、治疗、病理生理学等临床医学核心议题上的推理能力。该数据集依托MMLU整体框架,汇集了265道经过专家验证的多项选择题,覆盖从基础医学到专科实践的广泛知识点,成为衡量通用语言模型在专业医疗场景中应用潜力的关键工具。其发布推动了医学自然语言处理研究向更严谨、可复现的方向发展,尤其在临床决策支持系统的评估中影响深远。
当前挑战
该数据集面临的核心挑战首先在于领域知识的深度与广度平衡:临床医学涵盖解剖、药理、流行病学等数十个亚领域,而265道题目难以完全覆盖所有关键主题,可能导致模型评估存在偏差。其次,构建过程中需要确保题目表述的精确性与临床时效性,避免因医学指南更新或术语演变而出现答案过时或歧义。此外,数据集的开发集仅含5个样本,对模型微调时的稳定性构成考验,易引发过拟合或泛化能力不足。最后,在模型评测环节,如何区分模型是基于真正的医学推理还是表面模式匹配来作答,仍是亟待解决的难题,这直接关系到评估结果对实际临床应用的指导价值。
常用场景
经典使用场景
该数据集源自大规模多任务语言理解(MMLU)基准中的临床知识子集,专为评估语言模型在医学领域的知识储备与推理能力而设计。其经典使用场景在于通过多项选择题的形式,检验模型对临床医学概念、诊断流程、治疗方案及药物相互作用等专业知识的掌握程度。研究者利用该数据集可系统性地衡量模型在零样本或少样本条件下的医学理解水平。
解决学术问题
该数据集有效解决了自然语言处理领域中医学知识评估缺乏标准化基准的学术难题。通过提供涵盖内科、外科、儿科等多科室的临床知识试题,它使得研究者能够量化比较不同语言模型在专业医学语境下的表现,从而揭示模型在知识记忆、逻辑推理及领域适应性上的短板。这一基准的建立推动了医学人工智能中知识表示与推理研究的进展。
实际应用
在实际应用中,该数据集被广泛用于医疗辅助系统的预训练与微调阶段,帮助开发更精准的临床决策支持工具。例如,基于此数据集的模型可用于自动解答医学考试题目、辅助医生进行诊断推理或生成医疗建议。此外,它还可作为医疗聊天机器人的知识验证集,确保其在真实场景中提供可靠且符合循证医学的答复。
数据集最近研究
最新研究方向
基于大规模多任务语言理解(MMLU)基准的临床知识子集,该数据集聚焦于评估语言模型在医学领域的事实性知识掌握与推理能力。当前前沿研究方向集中在利用该数据集检验大语言模型在临床决策支持、医学考试问答及患者教育中的表现,尤其关注模型对专业术语的语义理解与多选项逻辑判断。随着医疗人工智能伦理与安全性的关注度提升,该数据集被广泛用于检测模型在负向提示(如negate_openai_prompt和neg_question字段)下的鲁棒性,模拟真实临床场景中信息偏差对诊断准确性的影响。其影响在于推动构建更可信的医学AI系统,并为跨模态临床知识图谱的融合提供基准测试平台。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务