遇见数据集

cburger/MD_raw_2

收藏
Hugging Face2023-05-28 更新2024-03-04 收录
官方服务:

资源简介:

--- dataset_info: features: - name: text dtype: string - name: label dtype: class_label: names: '0': ' Allergy / Immunology' '1': ' Autopsy' '2': ' Bariatrics' '3': ' Cardiovascular / Pulmonary' '4': ' Chiropractic' '5': ' Consult - History and Phy.' '6': ' Cosmetic / Plastic Surgery' '7': ' Dentistry' '8': ' Dermatology' '9': ' Diets and Nutritions' '10': ' Discharge Summary' '11': ' ENT - Otolaryngology' '12': ' Emergency Room Reports' '13': ' Endocrinology' '14': ' Gastroenterology' '15': ' General Medicine' '16': ' Hematology - Oncology' '17': ' Hospice - Palliative Care' '18': ' IME-QME-Work Comp etc.' '19': ' Lab Medicine - Pathology' '20': ' Letters' '21': ' Nephrology' '22': ' Neurology' '23': ' Neurosurgery' '24': ' Obstetrics / Gynecology' '25': ' Office Notes' '26': ' Ophthalmology' '27': ' Orthopedic' '28': ' Pain Management' '29': ' Pediatrics - Neonatal' '30': ' Physical Medicine - Rehab' '31': ' Podiatry' '32': ' Psychiatry / Psychology' '33': ' Radiology' '34': ' Rheumatology' '35': ' SOAP / Chart / Progress Notes' '36': ' Sleep Medicine' '37': ' Speech - Language' '38': ' Surgery' '39': ' Urology' splits: - name: train num_bytes: 15217808 num_examples: 4966 download_size: 7299369 dataset_size: 15217808 --- # Dataset Card for "MD_raw_2" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

dataset_info: 特征: - 名称:text,数据类型:字符串 - 名称:label,数据类型: 分类标签: 类别名称: '0': '过敏/免疫学' '1': '尸检' '2': '减重医学' '3': '心血管/肺部医学' '4': '脊骨神经医学' '5': '咨询-病史与体格检查' '6': '美容/整形外科' '7': '牙科学' '8': '皮肤病学' '9': '饮食与营养学' '10': '出院小结' '11': '耳鼻喉科-耳鼻咽喉学' '12': '急诊病历报告' '13': '内分泌学' '14': '胃肠病学' '15': '普通内科' '16': '血液学-肿瘤学' '17': '临终关怀-姑息治疗' '18': 'IME-QME-Work Comp 等' '19': '检验医学-病理学' '20': '医疗信函' '21': '肾脏病学' '22': '神经病学' '23': '神经外科' '24': '妇产科学' '25': '门诊病历记录' '26': '眼科学' '27': '骨科学' '28': '疼痛管理' '29': '儿科学-新生儿科' '30': '物理医学-康复医学' '31': '足病医学' '32': '精神病学/心理学' '33': '放射学' '34': '风湿病学' '35': 'SOAP/病历/病程记录' '36': '睡眠医学' '37': '言语-语言治疗' '38': '外科学' '39': '泌尿外科学' 划分: - 名称:train,字节数:15217808,样本数:4966 下载大小:7299369 数据集总大小:15217808 --- # "MD_raw_2"数据集卡片 [需补充更多信息](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

提供机构:
cburger
原始信息汇总

数据集概述

数据集名称

MD_raw_2

数据集特征

  • text
    • 数据类型: string
  • label
    • 数据类型: class_label
    • 类别名称:
      • 0: Allergy / Immunology
      • 1: Autopsy
      • 2: Bariatrics
      • 3: Cardiovascular / Pulmonary
      • 4: Chiropractic
      • 5: Consult - History and Phy.
      • 6: Cosmetic / Plastic Surgery
      • 7: Dentistry
      • 8: Dermatology
      • 9: Diets and Nutritions
      • 10: Discharge Summary
      • 11: ENT - Otolaryngology
      • 12: Emergency Room Reports
      • 13: Endocrinology
      • 14: Gastroenterology
      • 15: General Medicine
      • 16: Hematology - Oncology
      • 17: Hospice - Palliative Care
      • 18: IME-QME-Work Comp etc.
      • 19: Lab Medicine - Pathology
      • 20: Letters
      • 21: Nephrology
      • 22: Neurology
      • 23: Neurosurgery
      • 24: Obstetrics / Gynecology
      • 25: Office Notes
      • 26: Ophthalmology
      • 27: Orthopedic
      • 28: Pain Management
      • 29: Pediatrics - Neonatal
      • 30: Physical Medicine - Rehab
      • 31: Podiatry
      • 32: Psychiatry / Psychology
      • 33: Radiology
      • 34: Rheumatology
      • 35: SOAP / Chart / Progress Notes
      • 36: Sleep Medicine
      • 37: Speech - Language
      • 38: Surgery
      • 39: Urology

数据集拆分

  • train
    • 数据大小: 15217808 bytes
    • 示例数量: 4966

数据集大小

  • 下载大小: 7299369 bytes
  • 数据集大小: 15217808 bytes
搜集汇总
数据集介绍
cburger/MD_raw_2 数据集图片
构建方式
在医学文本分析领域,高质量标注数据集的构建至关重要。cburger/MD_raw_2数据集源自对原始医学文档的系统性整理与分类,其构建过程聚焦于文本与标签的配对。数据集中包含'text'字段,承载了来自不同医学场景的原始文本内容,以及'label'字段,该字段为一个包含40个细粒度类别的分类标签体系,覆盖了从变态反应与免疫学、心血管/肺病学、皮肤病学到外科学、泌尿科学等几乎全部临床专科。这些类别不仅包括了常规的临床科室,还纳入了尸检、会诊记录、饮食营养、姑息治疗等特殊文书类型,体现了对医学文本多样性的深刻考量。数据集以训练集形式发布,共计4966个样本,确保了在有限规模内实现类别分布的均衡与代表性。
使用方法
使用该数据集时,研究人员可直接加载'text'字段作为输入特征,'label'字段作为监督信号,进行文本分类模型的训练与评估。推荐采用预训练语言模型(如BERT、ClinicalBERT)进行微调,以充分捕捉医学文本中的上下文语义。由于标签为整数编码,需在模型输出层配置与类别数(40)相匹配的全连接层,并使用交叉熵损失函数进行优化。数据集以HuggingFace Datasets库的标准格式提供,支持直接通过load_dataset函数加载,便于集成到现有的机器学习管道中。训练前建议对文本进行分词与清洗,去除无关符号,同时保留医学缩写与术语的完整性。
背景与挑战
背景概述
在自然语言处理与医学信息学交叉领域中,临床文本的自动分类与结构化分析是提升医疗数据利用效率的关键环节。cburger/MD_raw_2数据集由研究者构建,旨在为多类别医学文本分类任务提供标准化基准。该数据集涵盖了从过敏与免疫、心血管与肺病、到精神病学与放射学等40个精细化的临床专科类别,反映了真实医疗场景中文档类型的多样性。其创建时间虽未明确注明,但通过其标签体系的专业性与细粒度可见,研究团队致力于弥合非结构化临床笔记与可计算医学知识之间的鸿沟。该数据集对推动医疗文档自动归档、临床决策支持系统以及医学语言模型的评估具有重要参考价值。
当前挑战
该数据集所面临的挑战首先体现在领域问题的复杂性上:医学文本分类需处理高度专业化的术语、缩写以及不同专科间重叠的语义空间,例如“General Medicine”与“Consult - History and Phy.”之间的边界模糊,增加了模型区分的难度。其次,构建过程中,原始临床文档的获取涉及隐私保护与伦理审查,数据标注需要具备医学背景的专家参与,以确保40个标签的准确分配,而样本量仅4966条,可能导致类别不平衡问题。此外,文本长度与格式的差异(如简短笔记与详尽出院总结)也要求模型具备鲁棒的特征提取能力,这些因素共同构成了数据集应用与扩展的主要障碍。
常用场景
经典使用场景
MD_raw_2数据集汇聚了涵盖40个医学专科的临床文本记录,包括过敏与免疫学、心血管与肺科、皮肤科、急诊报告、影像学等领域的病历资料。其经典使用场景在于为自然语言处理模型提供多类别医学文本分类的训练素材,研究者可基于该数据集构建能够精准识别临床文档所属专科领域的分类器,从而实现对海量非结构化医疗文本的自动化归档与索引。
解决学术问题
该数据集有效解决了医学文本自动分类领域长期面临的专科类别覆盖不全与标注数据匮乏的学术难题。通过提供涵盖从普通内科到泌尿外科等40个专科的标准化标注文本,它使得研究者能够突破传统手工分类的局限,探索基于深度学习的多标签分类算法,显著推动了临床文档管理系统的智能化进程,并为跨专科医疗信息检索提供了坚实的实验基准。
实际应用
在实际医疗场景中,MD_raw_2数据集支撑着电子健康记录系统的自动化分类与分流功能。医疗机构可借助基于该数据集训练的模型,将患者病历、出院小结或会诊记录即时归类至对应专科,从而优化工作流程,减少人工分拣错误。此外,该数据集还可用于开发临床决策支持工具,辅助医生快速定位相关病史资料,提升诊疗效率与精准度。
数据集最近研究
最新研究方向
在临床自然语言处理领域,医学文档的自动分类与结构化解析正成为推动智慧医疗发展的关键一环。cburger/MD_raw_2数据集聚焦于多专科医学文本的细粒度分类,涵盖从过敏与免疫学到泌尿外科等40个专科类别,为开发高精度医学文档分类模型提供了丰富的标注语料。当前前沿研究多围绕基于预训练语言模型(如BioBERT、ClinicalBERT)的迁移学习策略展开,通过微调大模型实现出院小结、会诊记录、手术报告等不同类型文本的自动识别。该数据集的发布契合了电子健康记录(EHR)智能化管理的迫切需求,尤其在多标签分类、少样本学习及跨专科泛化能力等热点方向上具有重要实验价值,有望推动临床决策支持系统与医疗文本挖掘技术的实质性进展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务