hospital patient records dataset
收藏资源简介:
该数据集包含医院患者记录,其中输入变量用于预测结果——患者住院时间,以提高医疗管理效率。数据经过检查,发现了一些数据质量问题,如数据类型不匹配和少量缺失值,但没有重复值。数据质量问题已解决,数据集现已准备好进行分析。原始数据源来自Analytics Vidhya网站,但通过Kaggle获取,包含318,438行和18列。特征包括医院可用额外房间数量、入院类型和入院时记录的疾病严重程度,以预测患者住院时间。
This dataset contains hospital patient records, with input variables designed to predict the target outcome: length of hospital stay, to enhance healthcare management efficiency. The dataset was inspected, and multiple data quality issues were detected, including mismatched data types and a small number of missing values, yet no duplicate records were found. All identified data quality issues have been resolved, and the dataset is now ready for analysis. The original data source originated from the Analytics Vidhya website, but the dataset was obtained via Kaggle, consisting of 318,438 rows and 18 columns. The features include the number of available extra hospital rooms, admission type, and disease severity recorded at admission, which are utilized to predict patients' length of hospital stay.
数据集概述
数据集基本信息
- 数据集名称:Hospital Patient Records Data Cleaning
- 原始来源:Analytics Vidhya 网站(通过 Kaggle 获取)
- 数据规模:318,438 行,18 列
- 核心用途:利用输入变量预测患者住院时长(Stay),以提升医疗管理效率
数据内容与特征
- 关键特征:
- Available Extra Rooms in Hospital:医院可用额外房间数量
- Type of Admission:医院登记的就诊类型
- Severity of Illness:入院时记录的病情严重程度
- 预测标签:Stay(患者住院时长)
数据质量处理
发现的问题
- 存在少量缺失值
- 未发现重复行
- 检测到两处数据类型不匹配
缺失值处理
- 缺失类型与归因:
- City_Code_Patient:MNAR(非随机缺失,如患者居住地无城市代码)
- Stay:MAR(随机缺失,可能受就诊类型和可用房间数影响)
- Bed Grade、patientid 等:MCAR(完全随机缺失,比例小且无明确模式)
- 填补方法:
- Bed Grade:均值填补(数据呈正态分布)
- patientid、City_Code_Patient、Visitors with Patient:中位数填补(存在异常值)
- Type of Admission、Severity of Illness、Age、Stay:众数填补(分类变量)
数据类型修正
- Bed Grade 和 City_Code_Patient 原为浮点型,已转换为整型
- City_Code_Patient 是数据集中缺失值比例最高的列
处理流程与工具
- 主要工具:Python(在 Anaconda Jupyter Notebook 环境中运行)
- 核心库:pandas(数据清洗与验证)、numpy(数值与数组运算)
- 处理步骤:
- 导入库并加载数据集
- 数据概览与字典理解
- 数据剖析(结构、内容、类型)
- 统计摘要分析与分布评估
- 缺失值比例计算
- 重复行检测
- 缺失值填补
- 数据类型转换
- 数据清洗验证
数据验证结果
- 所有列的缺失值已清零
- 重复行数为零
- 数据类型已匹配
使用说明
- 克隆仓库或下载 .ipynb 文件
- 安装依赖库:
pip install pandas numpy - 从 Kaggle 下载数据集:https://www.kaggle.com/datasets/nehaprabhavalkar/av-healthcare-analytics-ii
- 将数据集与笔记本置于同一文件夹
- 在 Jupyter Notebook 中按顺序运行单元格




