遇见数据集

BlueZeros/EHR-Ins-Reasoning

收藏
Hugging Face2025-11-03 更新2025-11-15 收录
官方服务:

资源简介:

EHR-Ins是一个为了增强大型语言模型在电子健康记录(EHR)上的推理和分析能力而开发的大规模、全面的指令数据集。它包含两种主要类型的数据:30万个高质量的推理案例和大约350万到400万个非推理案例。数据集覆盖了42种不同的EHR任务,分为决策制定(如诊断和治疗建议)和风险预测(如死亡率和再入院率)两大类。该数据集的核心创新是一个思维图驱动框架,用于大规模合成高质量推理数据。该框架通过识别EHR中的关键相关医疗实体,将这些实体与外部知识(如UMLS知识库)相链接,并促使模型(如GPT-4o)基于生成的图产生结构化的逐步临床推理。EHR-Ins提供了明确的医疗推理监督,使EHR-R1系列模型能够系统地获取进行准确和强大EHR分析所需的多样化、上下文丰富的推理能力。

EHR-Ins is a large-scale, comprehensive instruction dataset developed to enhance the reasoning and analysis capabilities of Large Language Models (LLMs) for Electronic Health Records (EHR). It consists of two major types of data: 300K high-quality reasoning cases and approximately 3.5 to 4 million non-reasoning cases. The dataset spans a wide variety of 42 distinct EHR tasks, categorized into two types: decision-making (e.g., diagnosis and treatment recommendations) and risk-prediction (e.g., mortality and readmission). The core innovation of the dataset is a thinking-graph-driven framework used to synthesize the high-quality reasoning data at scale. This framework works by identifying key related medical entities from EHRs, linking these entities with external knowledge such as the UMLS knowledge base, and prompting a model (like GPT-4o) to produce structured, step-by-step clinical reasoning based on the generated graph. EHR-Ins provides explicit medical reasoning supervision, enabling models like the EHR-R1 series to systematically acquire diverse, context-rich reasoning capabilities necessary for accurate and robust EHR analysis.

提供机构:
BlueZeros
搜集汇总
数据集介绍
BlueZeros/EHR-Ins-Reasoning 数据集图片
构建方式
在电子健康记录(EHR)分析领域,构建高质量的指令数据集是提升大语言模型推理能力的关键。EHR-Ins-Reasoning数据集采用了一种创新的“思维图驱动框架”进行构建,通过从EHR中识别关键医疗实体,并利用UMLS等外部知识库将这些实体关联起来,形成结构化的知识图谱。随后,基于该图谱引导GPT-4o等模型生成逐步的、结构化的临床推理过程,从而大规模合成高质量的推理数据。该数据集包含约30万条推理案例和350万至400万条非推理案例,覆盖42种不同的EHR任务,涵盖决策制定与风险预测两大类别。
特点
该数据集的核心特色在于其明确的医学推理监督机制,通过思维图框架为模型提供了丰富的、上下文相关的推理训练信号。其覆盖的42种任务既包括诊断和治疗建议等决策任务,也涵盖死亡率预测和再入院风险等预测任务,确保了任务多样性与领域深度。此外,数据集中的每个样本均包含任务指令、序列化的EHR输入、候选选项及详细的标签信息,并针对风险预测任务设计了特定的事件类型与评估指标,使得数据集在训练和评估时具备高度的灵活性与可解释性。
使用方法
使用EHR-Ins-Reasoning数据集时,研究人员可直接加载JSONL格式的文件,每个样本包含idx、instruction、input、output、candidates及task_info等关键字段。根据任务类型,可将instruction与input组合作为模型输入,output用于监督训练,candidates则供未训练模型进行选项预测。对于风险预测任务,task_info中的target_key为None,需依赖events和metric进行标签提取与评分计算。该数据集特别适合用于训练具备临床推理能力的语言模型,如EHR-R1系列,并已在MIMIC-IV数据集上进行了脱敏处理,确保数据安全与隐私合规。
背景与挑战
背景概述
电子健康记录(EHR)作为现代医疗信息化的核心载体,蕴含着丰富的临床决策支持潜力。然而,如何让大型语言模型(LLM)从海量、异构的EHR数据中习得可靠的医学推理能力,始终是人工智能与医疗交叉领域的关键难题。在此背景下,由上海交通大学、上海人工智能实验室等多个顶尖机构的研究团队于2025年共同构建的EHR-Ins-Reasoning数据集应运而生。该数据集旨在突破传统EHR分析中模型仅依赖浅层模式匹配的局限,通过提供显式的医学推理监督信号,推动LLM向具备深度临床推理能力的EHR-R1系列模型演进。其核心创新在于提出了“思维图驱动框架”,能够将UMLS知识库中的医学实体关联与结构化推理路径相结合,进而大规模合成高质量推理案例。这一工作不仅为EHR领域的自然语言处理研究提供了关键数据基础设施,也显著提升了模型在诊断、治疗推荐及风险预测等42项临床任务上的表现,对促进可信、可解释的智能医疗系统发展具有深远意义。
当前挑战
EHR-Ins-Reasoning数据集所面临的挑战可从两个维度加以审视。在领域问题层面,EHR分析的核心困难在于临床推理的复杂性与不确定性:同一组检查结果可能对应多种鉴别诊断,而时间序列数据中的因果关联又常混杂着患者个体差异与医疗流程噪声,使得模型难以从结构化表格中提炼出稳健的决策逻辑。在数据集构建过程中,研究团队遭遇了多重技术瓶颈。首先,原始MIMIC-IV数据包含敏感的患者身份信息,必须经过严格的去标识化处理,同时保留临床语义的完整性,这对数据脱敏策略提出了极高要求。其次,思维图的自动生成依赖外部知识库的精准链接,而UMLS中实体关系的稀疏性与多义性常导致推理路径偏离真实临床场景。此外,如何平衡300K推理案例与近400万非推理案例之间的比例,确保模型既能习得深度推理能力又不失泛化性能,也是数据配比设计中的重大挑战。
常用场景
经典使用场景
在临床智能决策领域,EHR-Ins-Reasoning数据集最经典的应用场景在于训练和评估大语言模型在电子健康记录上的多任务推理能力。该数据集覆盖42种不同的EHR任务,涵盖诊断推荐、治疗方案选择等决策型任务,以及死亡率预测、再入院风险评估等风险预测型任务。通过提供30万条高质量推理案例与约350至400万条非推理案例,研究者能够系统性地构建模型从结构化病历中提取临床线索、进行逻辑推演并输出可解释结论的能力,成为推动医学语言模型从浅层模式匹配迈向深层临床推理的核心数据基础。
解决学术问题
该数据集有效解决了电子健康记录分析中长期存在的两大学术难题:其一是缺乏大规模、带显式推理监督的指令数据,导致模型难以习得可靠的临床推理链条;其二是现有数据集任务单一,无法全面评估模型在多样化临床场景下的泛化能力。EHR-Ins-Reasoning通过“思维图谱驱动框架”合成高质量推理数据,将医学实体识别、外部知识库链接与结构化推理过程融为一体,为模型提供了可复现的、上下文丰富的推理监督信号。这一创新显著提升了模型在复杂临床判断中的准确性与鲁棒性,推动了医学自然语言处理领域从静态预测向动态推理的范式转变。
衍生相关工作
基于EHR-Ins-Reasoning数据集,研究者已衍生出多项具有影响力的工作。最直接的成果是EHR-R1系列模型,该系列通过在该数据集上进行指令微调与强化学习,首次在电子健康记录分析领域实现了接近临床专家水平的推理能力。后续工作进一步探索了思维图谱框架的轻量化版本,将其迁移至资源受限的医疗边缘设备上。此外,有研究团队利用该数据集中的推理案例作为教师信号,蒸馏出更小规模的专用推理模型,在保持高准确率的同时大幅降低推理延迟。这些衍生工作共同构建了一条从数据构建、模型训练到实际部署的完整技术链路,有力推动了医学人工智能的临床转化进程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务