jpcorb20/medical_wikipedia
收藏官方服务:
资源简介:
MedWiki数据集是基于`Cohere/wikipedia-22-12`数据集,通过`MaartenGr/BERTopic_Wikipedia`模型对医学主题文章进行过滤生成的。该数据集包含标题、文本、维基ID、段落ID、推断主题和概率等字段。数据集主要用于文本生成任务,语言为英语,标签为医学领域。数据集的大小类别为1M到10M之间,许可证为cc。主题分类是通过`GPT3.5-turbo 0613`对主题的词汇表示进行提示来完成的。
MedWiki数据集是基于`Cohere/wikipedia-22-12`数据集,通过`MaartenGr/BERTopic_Wikipedia`模型对医学主题文章进行过滤生成的。该数据集包含标题、文本、维基ID、段落ID、推断主题和概率等字段。数据集主要用于文本生成任务,语言为英语,标签为医学领域。数据集的大小类别为1M到10M之间,许可证为cc。主题分类是通过`GPT3.5-turbo 0613`对主题的词汇表示进行提示来完成的。
提供机构:
jpcorb20原始信息汇总
数据集概述
数据集信息
-
特征(Features):
title: 数据类型为字符串(string)text: 数据类型为字符串(string)wiki_id: 数据类型为整数(int32)paragraph_id: 数据类型为整数(int32)topic_infer: 数据类型为长整型(int64)prob: 数据类型为浮点数(float64)
-
分割(Splits):
train: 训练集,包含1139464个示例,总大小为565706758字节
-
配置(Configs):
default: 包含训练数据文件,路径为data/train-*
数据集属性
- 任务类别(Task Categories): 文本生成(text-generation)
- 语言(Language): 英语(en)
- 标签(Tags): 医学(medical)
- 大小类别(Size Categories): 1M<n<10M
- 许可证(License): 知识共享(CC)
搜集汇总
数据集介绍

构建方式
医疗领域知识的系统化整合在自然语言处理研究中占据重要地位,而维基百科作为开放知识库的典范,为构建专业语料库提供了丰富素材。该数据集基于Cohere/wikipedia-22-12全量百科快照,借助MaartenGr/BERTopic_Wikipedia主题模型对医学相关文章进行精准筛选。主题分类过程中,研究团队利用GPT3.5-turbo 0613对主题模型的词表征进行医学领域归属判定,最终形成涵盖113万余条训练样本的高质量医学文本集合。每个样本包含标题、正文、维基页面标识符及段落编号等结构化字段,并通过topic_infer与prob字段记录主题推断结果及其置信度。
特点
该数据集最显著的特点在于其主题导向的医学文本过滤机制,通过主题模型与大型语言模型的协同工作,实现了从海量百科条目中高效提取医学相关内容的能力。数据规模达到百万级别,覆盖医学领域的多元主题,且每个段落均保留原始维基百科的结构信息,便于下游任务中的细粒度检索与处理。此外,数据集以英文为主,兼容文本生成等常见自然语言处理任务,其开放许可协议(CC)也为学术研究提供了便利的复用条件。
使用方法
使用者可通过HuggingFace Datasets库加载该数据集,由于数据生成依赖远程脚本,需在加载时设置trust_remote_code=True参数以启用动态过滤逻辑。数据集仅包含训练拆分,可直接用于医学文本生成、主题分类或信息检索等任务的模型训练与评估。建议结合tokenizer对文本进行预处理,并利用title与paragraph_id字段建立文档级或段落级的引用关系。需注意,该数据集不包含原始维基百科文件,仅提供构建脚本,因此首次加载需确保网络环境畅通以完成实时过滤。
背景与挑战
背景概述
在自然语言处理领域,医学文本资源的匮乏长期制约着临床知识推理与智能问答系统的发展。jpcorb20/medical_wikipedia数据集应运而生,由研究者Jean-Philippe Corbeil于2024年创建,依托Cohere/wikipedia-22-12大规模语料库,借助BERTopic主题建模技术筛选医学相关文章,并通过GPT-3.5-turbo对主题进行语义标注。该数据集聚焦于医学领域的文本生成任务,包含超过110万段落,涵盖疾病、治疗、药物等核心医学主题,为医疗AI模型提供了结构化的知识来源,显著推动了医学自然语言处理研究的进展。
当前挑战
该数据集面临多重挑战。首先,在领域问题层面,医学文本生成需处理高度专业化的术语与复杂的临床逻辑,现有模型易产生事实性错误或语义偏差,如何确保生成内容的医学准确性成为核心难题。其次,在构建过程中,基于主题模型筛选医学文章存在分类噪声,GPT标注可能引入主观偏见,导致部分非医学内容混入或关键医学主题遗漏。此外,数据集仅包含英文语料,缺乏多语言覆盖,限制了其在全球医疗场景中的适用性。数据更新停滞也意味着无法反映最新的医学知识进展。
常用场景
经典使用场景
在生物医学自然语言处理领域,jpcorb20/medical_wikipedia数据集为研究者提供了一类经过主题筛选的医学维基百科语料库。该数据集基于Cohere/wikipedia-22-12大规模百科全书的子集,通过BERTopic主题建模与GPT-3.5-turbo智能分类,精准抽取了涵盖疾病诊断、药物机制、临床操作等医学主题的文章段落。其典型应用场景涵盖医学语言模型的预训练与领域适应,例如构建能够理解复杂医学术语、生成临床报告或辅助医疗问答系统的深层语言表征。研究者可借助该数据集训练具备医学常识的生成式模型,从而提升在专业医疗文本上的语义理解与生成能力。
实际应用
在实际应用中,该数据集可作为构建智能医疗辅助系统的基石。基于其训练的模型能够被部署于电子病历的自动摘要生成、医学文献的知识抽取以及患者问诊对话的语义理解等任务。例如,通过微调该语料上的语言模型,可开发出辅助医生撰写诊断意见的文本生成工具,或用于医疗聊天机器人对症状描述进行精准解析。此外,该数据集还可支撑药物-疾病关联发现、临床试验筛选等知识图谱构建任务,提升医疗信息处理流程的自动化水平与决策支持能力。
衍生相关工作
该数据集衍生出的代表性工作包括Corbeil(2024)在MEDIQA-CORR评测任务中提出的医学错误检测与纠正框架,其中利用该语料微调的医学智能体实现了对临床文本中事实性错误的精准定位与修正。此外,该数据集为领域内研究提供了可复现的基准,激发了一系列关于医学主题建模与语料质量控制的后续探索,如基于对比学习的医学段落表示优化、以及融合知识图谱的医学语言模型预训练策略。这些工作共同推动了医学自然语言处理从通用向专科化、可解释化方向的纵深发展。
以上内容由遇见数据集搜集并总结生成



