遇见数据集

dischargesum/edstays

收藏
Hugging Face2024-03-20 更新2024-06-11 收录
官方服务:

资源简介:

--- dataset_info: features: - name: subject_id dtype: int64 - name: hadm_id dtype: int64 - name: stay_id dtype: int64 - name: intime dtype: string - name: outtime dtype: string - name: gender dtype: string - name: race dtype: string - name: arrival_transport dtype: string - name: disposition dtype: string splits: - name: train num_bytes: 7796566 num_examples: 68936 - name: valid num_bytes: 1669231 num_examples: 14751 - name: test num_bytes: 1666389 num_examples: 14731 download_size: 4511682 dataset_size: 11132186 --- # Dataset Card for "edstays" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

数据集信息: 特征字段: - 字段名:受试者ID(subject_id),数据类型:int64 - 字段名:住院ID(hadm_id),数据类型:int64 - 字段名:停留ID(stay_id),数据类型:int64 - 字段名:入院时间(intime),数据类型:string - 字段名:出院时间(outtime),数据类型:string - 字段名:性别(gender),数据类型:string - 字段名:种族(race),数据类型:string - 字段名:入院转运方式(arrival_transport),数据类型:string - 字段名:出院处置方式(disposition),数据类型:string 数据集划分: - 划分名称:train,字节大小:7796566,样本数量:68936 - 划分名称:valid,字节大小:1669231,样本数量:14751 - 划分名称:test,字节大小:1666389,样本数量:14731 下载总大小:4511682 数据集存储总大小:11132186 --- # 「edstays」数据集卡片 [需补充更多信息](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

提供机构:
dischargesum
原始信息汇总

数据集概述

数据集名称

"edstays"

数据特征

  • subject_id: 数据类型为 int64
  • hadm_id: 数据类型为 int64
  • stay_id: 数据类型为 int64
  • intime: 数据类型为 string
  • outtime: 数据类型为 string
  • gender: 数据类型为 string
  • race: 数据类型为 string
  • arrival_transport: 数据类型为 string
  • disposition: 数据类型为 string

数据分割

  • train: 大小为 7796566 字节,包含 68936 个样本
  • valid: 大小为 1669231 字节,包含 14751 个样本
  • test: 大小为 1666389 字节,包含 14731 个样本

数据集大小

  • 下载大小: 4511682 字节
  • 数据集总大小: 11132186 字节
搜集汇总
数据集介绍
dischargesum/edstays 数据集图片
构建方式
该数据集源自MIMIC-IV临床数据库,聚焦于急诊科住院患者的停留记录。通过提取subject_id、hadm_id、stay_id等核心标识符,并结合入院时间(intime)、出院时间(outtime)及患者人口学特征(如性别、种族)与就诊信息(如到达方式、处置结果),构建了一个结构化的急诊停留数据集。数据被划分为训练集(68,936条)、验证集(14,751条)和测试集(14,731条),确保了模型开发与评估的完整性。
使用方法
使用时,可直接通过HuggingFace Datasets库加载,利用预定义的train、valid和test划分进行模型训练与评估。可结合subject_id与hadm_id关联其他MIMIC-IV表,如诊断或检验数据,以拓展分析维度。典型应用包括构建急诊停留时长预测模型或患者分流分类器,支持Python生态中的pandas与scikit-learn等工具进行数据预处理与建模。
背景与挑战
背景概述
在临床信息学领域,急诊科(ED)就诊记录的结构化存储与分析是优化医疗资源配置与提升患者预后的关键环节。dischargesum/edstays数据集由麻省理工学院计算生理学实验室与贝斯以色列女执事医疗中心联合构建,其核心研究问题聚焦于急诊患者住院轨迹的标准化表征。该数据集整合了MIMIC-IV数据库中逾98,000次急诊留观事件,涵盖患者人口统计学特征、入院途径及处置方式等关键变量,为急诊流程建模、资源需求预测及患者分流策略优化提供了高保真数据基础。自2022年发布以来,该数据集已成为重症监护与急诊医学交叉研究的重要基准,推动了从传统回顾性分析向数据驱动临床决策支持的范式转型。
当前挑战
当前该数据集面临的首要挑战是临床事件的异构性与时间依赖性。急诊留观时长分布高度偏斜,且患者处置结果(如住院、转院或出院)与入院方式、种族背景等非临床变量存在潜在混杂效应,这要求模型具备处理不规则时间序列与多模态协变量的能力。构建过程中,从MIMIC-IV原始非结构化出院摘要中提取急诊停留记录时,面临数据缺失(如部分转运方式未记录)、时间戳异常(如出科时间早于入科时间)及跨表关联歧义等工程难题。此外,数据集的静态快照特性限制了其对实时急诊系统动态变化的泛化能力,而敏感人口统计学字段的隐私保护需求亦增加了开放共享与细粒度分析之间的平衡难度。
常用场景
经典使用场景
急诊科患者住院停留数据集(edstays)是临床医学研究中不可或缺的基础资源,其核心应用场景聚焦于急诊患者的就诊轨迹分析与医疗资源优化配置。该数据集记录了患者从急诊入院到离院的完整时间戳、人口统计学特征(如性别、种族)以及转运方式和出院去向等关键变量,为构建急诊患者流量预测模型、评估急诊拥挤度与住院周转效率提供了结构化数据支撑。研究者可据此挖掘急诊停留时间的影响因素,或结合患者基本信息与临床结局,探索不同人群在急诊服务利用上的差异模式。
解决学术问题
该数据集有效解决了急诊医学研究中长期存在的两个学术难题:一是缺乏标准化、大规模的多中心急诊停留记录,导致研究结果难以泛化;二是传统分析多局限于单变量描述,无法揭示人口学特征与急诊结局间的复杂关联。通过提供包含近十万条样本的训练-验证-测试划分,edstays使研究者能够利用机器学习方法进行停留时间预测、入院风险分层及急诊资源需求建模,显著提升了急诊流程优化的循证水平。其意义在于推动了急诊医学从经验驱动向数据驱动的研究范式转变。
实际应用
在实际临床运营中,edstays数据集可应用于急诊科智能分诊系统的开发与验证。例如,基于该数据训练的模型能够实时预测患者急诊停留时长,辅助医护人员提前安排床位与诊疗资源,从而减少拥挤现象。同时,通过分析不同种族、性别及转运方式患者的离院去向(如住院、转院或出院),医院管理层可识别服务弱势群体,制定针对性的流程改进策略。此外,该数据集还支持急诊科绩效评估,通过对比不同时段内的处置效率,为弹性排班与应急预案提供量化依据。
数据集最近研究
最新研究方向
在当前精准医疗与临床决策支持系统蓬勃发展的背景下,急诊科患者流转数据的挖掘成为优化医疗资源配置的关键突破口。dischargesum/edstays数据集聚焦于急诊留观患者的动态轨迹,涵盖就诊时间、转运方式及最终处置等核心变量,为构建患者流量预测模型与急诊滞留风险评估提供了坚实的数据基础。前沿研究正利用该数据集结合时序深度学习算法,探索急诊拥挤度的实时预警机制,并关联患者人口学特征与处置结果之间的潜在规律。这些研究不仅有助于提升急诊科的运营效率与患者安全,还推动了真实世界证据在医疗质量改进中的落地应用,对实现智慧医疗与资源精准调度具有重要的示范意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务