遇见数据集

Huyt/mimic-drug-rec

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集基于MIMIC(Medical Information Mart for Intensive Care)数据库构建,专注于医疗领域的自然语言处理任务。它包含来自MIMIC-III和MIMIC-IV子集的数据,涵盖患者医疗记录,如诊断、治疗、药物历史等信息。数据集特征包括患者ID、就诊ID、诊断列表(文本和编码形式)、治疗列表、历史用药记录、目标药物、问题与答案等字段,旨在支持医疗问答、药物推荐或临床决策支持等应用。数据分为mimic3和mimic4两个分片,分别包含15,032和314,841个示例,总大小约1.04 GB。

This dataset is constructed from the MIMIC (Medical Information Mart for Intensive Care) database, focusing on natural language processing tasks in the medical domain. It includes data from the MIMIC-III and MIMIC-IV subsets, covering patient medical records such as diagnoses, procedures, medication history, and more. The features consist of patient ID, visit ID, diagnoses lists (in text and coded forms), procedures lists, historical medications, target medications, questions, and answers, designed to support applications like medical question-answering, medication recommendation, or clinical decision support. The data is split into mimic3 and mimic4 sections, containing 15,032 and 314,841 examples respectively, with a total size of approximately 1.04 GB.

提供机构:
Huyt
搜集汇总
数据集介绍
Huyt/mimic-drug-rec 数据集图片
构建方式
在临床决策支持与药物推荐研究领域,高质量的数据集是推动模型发展的基石。mimic-drug-rec数据集基于MIMIC-III与MIMIC-IV两大重症监护数据库构建,通过系统性地提取患者历次就诊记录,整合了诊断、手术过程、历史用药及目标用药等多维度信息。每一条数据均对应一次完整的药物推荐场景,其中源数据来源于结构化电子病历,而诊断与手术的文本描述则被保留以增强语义理解。构建过程中,团队将历史用药按就诊顺序组织为嵌套列表,目标用药则作为预测标签,最终生成了适用于有监督学习的结构化样本。数据集划分为mimic3与mimic4两个子集,分别包含15,032与314,841个实例,确保了数据规模与临床复杂度的平衡。
特点
该数据集的核心特色在于其多模态、时序敏感的药物推荐框架。每个样本不仅包含患者的基本标识与就诊ID,还携带了诊断与手术的代码及文本描述,使模型能够同时利用结构化编码与自然语言信息。历史用药以列表嵌套列表的形式呈现,忠实保留了药物方案的演变序列,为目标药物的预测提供了丰富的上下文。目标药物以代码与药物名称双重形式给出,便于不同粒度的评估。此外,数据集内置了从临床记录自动生成的问答对(question与answer字段),为探索对话式药物推荐或指令微调范式提供了可能。其两个子集覆盖了不同版本的MIMIC数据,既支持跨数据集验证,也增强了模型的泛化能力。
使用方法
使用该数据集时,研究人员可依据任务需求灵活选择mimic3或mimic4子集,或合并使用以扩大训练规模。对于药物推荐任务,典型做法是将diagnoses、procedures及history_medications作为输入特征,以target_medications为预测目标,构建序列到序列或分类模型。为利用文本字段,可结合预训练的医学语言模型(如ClinicalBERT)对diagnoses_text与procedures_text进行编码。question与answer字段则支持直接用于训练指令跟随模型,通过设计提示模板(例如“根据患者诊断与用药史,推荐合适药物”)实现零样本或少样本药物推理。数据加载可通过HuggingFace Datasets库的load_dataset函数便捷实现,指定split参数即可获取对应子集的迭代器,便于集成至PyTorch或TensorFlow训练流程。
背景与挑战
背景概述
在临床决策支持系统中,基于患者历史数据预测用药方案是精准医疗的关键环节。mimic-drug-rec数据集诞生于对MIMIC-III和MIMIC-IV重症监护数据库的深度挖掘,由医学信息学与自然语言处理领域的研究者构建,旨在解决药物推荐这一核心研究问题。该数据集整合了患者诊断、治疗过程、用药历史及目标用药信息,形成了超过33万条临床记录,为开发可复现的用药推荐算法提供了大规模、结构化的基准资源。自发布以来,mimic-drug-rec已成为连接临床数据与机器学习模型的桥梁,极大地推动了电子健康记录分析与智能用药系统的研究进展。
当前挑战
该数据集解决的核心领域挑战在于如何从多模态、时序性的临床数据中自动生成准确且安全的药物推荐列表,替代传统依赖专家经验的决策方式。在构建过程中,研究者面临两大挑战:一是数据异构性——需将MIMIC数据库中非结构化的诊断文本、程序描述与结构化历史用药信息对齐,确保跨源数据的一致性;二是时序依赖建模——患者用药历史以嵌套列表形式存储,需设计策略捕捉药物间的相互作用与序列模式,避免因信息错位导致推荐偏差。此外,大规模数据清洗中还需处理缺失值、编码冲突等临床数据固有的噪声问题,以维持数据集的临床有效性。
常用场景
经典使用场景
mimic-drug-rec数据集源自MIMIC临床数据库,专为药物推荐任务设计。其经典使用场景在于利用电子健康记录中的患者历史数据,包括诊断、手术及既往用药信息,预测当前诊疗阶段应开具的合理药物组合。该数据集将多源异构的临床信息整合为结构化格式,为开发基于深度学习的药物推荐模型提供了标准化基准,尤其在处理多标签分类和序列生成任务中展现出独特价值。研究人员借助该数据集,能够系统性地训练并评估模型在真实医疗环境下的药物推荐性能,推动了个性化药物治疗方案的发展。
衍生相关工作
围绕mimic-drug-rec数据集,学术界已衍生出一系列经典工作。基于该数据集的药物推荐模型常采用编码器-解码器架构,如利用Transformer捕捉诊疗序列的长期依赖关系,或结合对比学习增强药物组合的表示能力。部分研究进一步融合知识图谱中的药物药理信息,以缓解数据稀疏性问题。这些工作不仅在多个公开基准上取得最优性能,还催生了针对药物剂量预测、不良反应预警等延伸任务的探索,形成了以数据驱动为核心的临床决策研究范式。
数据集最近研究
最新研究方向
该数据集聚焦于临床决策支持系统中的药物推荐任务,尤其是基于电子健康记录(EHR)的纵向患者数据建模。近期研究前沿围绕大型语言模型(LLM)与临床知识图谱的融合,探讨如何利用MIMIC-III和MIMIC-IV中涵盖的诊断、手术、用药历史等多源异构信息,构建可解释的序列到序列(Seq2Seq)药物生成模型。随着大语言模型在医疗问答领域的突破,该数据集成为评估模型在复杂临床情景中推理药物配伍禁忌、剂量调整及个体化治疗策略的关键基准。其规模与高质量标注(如药物名称与代码对齐)推动了从静态推荐向动态、多任务学习范式的演进,在辅助医生制定循证用药方案、减少药物不良事件方面具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务