Awesome-Datasets-Hub
收藏官方服务:
资源简介:
这是一个精心策划的数据集集合,专注于大型语言模型(LLMs)相关领域,涵盖医疗人工智能、自然语言处理(NLP)、多模态学习、指令调优、推理、代码生成和评估基准等多个主题。该合集通过分类目录组织,旨在为研究人员和开发者提供广泛的数据集资源索引和推荐。
This is a curated dataset collection focused on the domain of large language models (LLMs), covering a diverse array of topics including medical artificial intelligence, natural language processing (NLP), multimodal learning, instruction tuning, reasoning, code generation, and evaluation benchmarks. Organized via categorized catalogs, this collection aims to provide researchers and developers with comprehensive indexing and curated recommendations for available dataset resources.
创建时间:
2026-05-15
原始信息汇总
医学大语言模型数据集汇总
本页面收录了40个用于大语言模型(LLM)的医学领域数据集,覆盖了多个子领域和任务类型。
数据集分类概览
根据数据集的领域和任务,可将其分为以下几大类:
- 医学问答与基准测试 (Medical QA & Benchmarks):共9个数据集,用于评估和训练模型在医学知识问答方面的能力。
- 临床自然语言处理 (Clinical NLP):共9个数据集,专注于处理临床记录、电子健康档案(EHR)等文本数据。
- 生物医学文献 (Biomedical Literature):共3个数据集,用于从科学文献中提取信息。
- 医学影像与放射学 (Radiology):共9个数据集,涉及X光、MRI等医学影像及其报告。
- 命名实体识别与信息抽取 (NER / IE):共6个数据集,用于识别和抽取医学术语,如疾病、药物等。
- 医学对话 (Dialogue):共3个数据集,包含医患对话记录。
详细数据集列表
| 序号 | 数据集名称 | 领域 | 任务/类型 | 规模 | 语言 | 许可协议 |
|---|---|---|---|---|---|---|
| 01 | MedQA (USMLE) | 医学问答与基准测试 | 医学资格问答 | 12,723 问题 | 英语/中文/繁体中文 | MIT |
| 02 | MedMCQA | 医学问答与基准测试 | 医学选择题 | 194K 问题 | 英语 | MIT |
| 03 | PubMedQA | 医学问答与基准测试 | 生物医学问答 | 273K 问答对 | 英语 | MIT |
| 04 | BioASQ | 医学问答与基准测试 | 生物医学问答 | 5,600+ 问题 | 英语 | CC BY 2.5 |
| 05 | MASH-QA | 医学问答与基准测试 | 医疗问答 | 35K 问答对 | 英语 | MIT |
| 06 | MedQuAD | 医学问答与基准测试 | 消费者医学问答 | 47K 问答对 | 英语 | CC BY 4.0 |
| 07 | LiveQA Medical | 医学问答与基准测试 | 消费者健康问答 | 634 问题 | 英语 | 研究目的 |
| 08 | MedS-Bench | 医学问答与基准测试 | 临床评估 | 13 项任务 | 英语 | Apache 2.0 |
| 09 | COVID-QA | 医学问答与基准测试 | COVID-19阅读理解问答 | 2,019 问答对 | 英语 | MIT |
| 10 | MIMIC-III | 临床自然语言处理 | 重症监护室电子病历 | 46K 患者 | 英语 | PhysioNet DUA |
| 11 | MIMIC-IV | 临床自然语言处理 | 医院电子病历 | 299K 患者 | 英语 | PhysioNet DUA |
| 12 | n2c2 / i2b2 Challenges | 临床自然语言处理 | 临床NLP评测 | 多年数据 | 英语 | DUA |
| 13 | MedNLI | 临床自然语言处理 | 临床文本蕴含 | 14K 句对 | 英语 | PhysioNet DUA |
| 14 | emrQA | 临床自然语言处理 | 电子病历问答 | 1M+ 问答对 | 英语 | MIT |
| 15 | MTSamples | 临床自然语言处理 | 临床转录笔记 | 5K+ 报告 | 英语 | 公开 |
| 16 | EHRNoteQA | 临床自然语言处理 | 临床笔记问答 | 2.4K 问答对 | 英语 | PhysioNet |
| 17 | Asclepius | 临床自然语言处理 | 合成临床笔记 | 158K 笔记 | 英语 | CC BY |
| 18 | GatorTron Corpus | 临床自然语言处理 | 临床语言模型预训练 | 900亿词 | 英语 | 受限 |
| 19 | CORD-19 | 生物医学文献 | COVID-19科学文献 | 100万+ 论文 | 英语 | 自定义 |
| 20 | PMC-OA | 生物医学文献 | 生物医学文献预训练 | 400万+ 文章 | 英语 | 开放获取 |
| 21 | PMC-LLaMA Data | 生物医学文献 | 医学指令微调 | 750亿 Token | 英语 | 开放获取 |
| 22 | PMC-Patients | 生物医学文献 | 患者友好摘要 | 167K 患者 | 英语 | CC BY |
| 23 | MIMIC-CXR | 医学影像与放射学 | 胸部X光与报告 | 377K 图像 | 英语 | PhysioNet |
| 24 | CheXpert | 医学影像与放射学 | X光分类 | 224K 图像 | 英语 | 研究目的 |
| 25 | NIH ChestX-ray14 | 医学影像与放射学 | 胸部疾病检测 | 112K 图像 | 英语 | CC0 |
| 26 | OpenI | 医学影像与放射学 | 放射学报告与图像 | 7K 病例 | 英语 | 公开 |
| 27 | ROCO | 医学影像与放射学 | 医学视觉-语言 | 81K 图像 | 多语言 | 研究目的 |
| 28 | PadChest | 医学影像与放射学 | 胸部X光解读 | 160K 图像 | 西班牙语/英语 | 研究目的 |
| 29 | VinDr-CXR | 医学影像与放射学 | 胸部X光异常检测 | 18K 图像 | 英语 | PhysioNet |
| 30 | RSNA Pneumonia | 医学影像与放射学 | 肺炎检测 | 30K 图像 | 英语 | Kaggle |
| 31 | BraTS | 医学影像与放射学 | 脑肿瘤分割 | 2K+ MRI扫描 | 多语言 | 研究目的 |
| 32 | MedMentions | 命名实体识别与信息抽取 | 生物医学命名实体识别 | 4K 摘要 | 英语 | CC BY |
| 33 | BC5CDR | 命名实体识别与信息抽取 | 化学与疾病命名实体识别 | 1,500 文章 | 英语 | 研究目的 |
| 34 | NCBI Disease Corpus | 命名实体识别与信息抽取 | 疾病实体识别 | 793 摘要 | 英语 | 公开 |
| 35 | DDI Corpus | 命名实体识别与信息抽取 | 药物-药物相互作用抽取 | 1K 文档 | 英语 | 研究目的 |
| 36 | ADE Corpus | 命名实体识别与信息抽取 | 药物不良事件抽取 | 4K+ 句子 | 英语 | CC BY |
| 37 | JNLPBA | 命名实体识别与信息抽取 | 生物医学实体识别 | 2K 摘要 | 英语 | 研究目的 |
| 38 | MedDialog | 医学对话 | 医学对话生成 | 100万 对话 | 中文/英语 | 研究目的 |
| 39 | HealthCareMagic-100K | 医学对话 | 医患对话 | 100K 对话 | 英语 | 自定义 |
| 40 | iCliniq | 医学对话 | 临床咨询对话 | 10K 对话 | 英语 | 自定义 |



