遇见数据集

InfoBayAI/HIV_EHR_dastaset

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个大规模的集合,包含470,295条HIV纵向电子健康记录时间序列患者记录,旨在支持高级医疗人工智能、预测分析、临床决策支持系统和纵向医学研究应用的开发。它由从医疗和治疗环境中收集的真实世界患者级HIV临床记录组成,包含跨多个临床就诊和治疗时间线的结构化时间医疗数据。数据集捕捉了HIV护理管理中常见的真实疾病进展模式、治疗反应、实验室测量、药物方案、共病条件和临床结果。这使得它对于构建准确、可扩展且可用于生产的AI系统非常有价值,适用于疾病进展建模、治疗优化、生存分析、风险预测和医疗预测应用。此外,该数据集可用于监督微调、基于人类反馈的强化学习和时间序列医疗AI工作流程的管道中。

This dataset is a large-scale collection of 470,295 HIV Longitudinal Electronic Health Record (EHR) Time-Series patient records, designed to support the development of advanced healthcare AI, predictive analytics, clinical decision support systems, and longitudinal medical research applications. It consists of real-world patient-level HIV clinical records collected from healthcare and treatment environments, containing structured temporal healthcare data across multiple clinical visits and treatment timelines. The dataset captures authentic disease progression patterns, treatment responses, laboratory measurements, medication regimens, comorbid conditions, and clinical outcomes commonly observed in HIV care management. This makes it highly valuable for building accurate, scalable, and production-ready AI systems for disease progression modeling, treatment optimization, survival analysis, risk prediction, and healthcare forecasting applications. Additionally, this dataset can be utilized in pipelines for Supervised Fine-Tuning (SFT), Reinforcement Learning with Human Feedback (RLHF), and time-series healthcare AI workflows.

提供机构:
InfoBayAI
搜集汇总
数据集介绍
InfoBayAI/HIV_EHR_dastaset 数据集图片
构建方式
该数据集通过正式协议获取,并在日常医疗业务过程中自然生成,汇集了来自真实临床环境的470,295名HIV患者记录。数据以CSV格式存储,包含结构化临床信息,涵盖人口统计学信息、CD4计数、病毒载量、ART治疗方案、合并症、WHO临床分期及患者结局等关键字段。所有记录均源自实际的HIV诊疗与治疗管理流程,确保了数据在疾病监测、治疗优化和预后评估方面的真实性与代表性。
特点
数据集的显著特点在于其大规模的真实世界临床数据覆盖,包含近50万患者纵向记录,为构建高精度的医疗预测模型提供了坚实基础。字段设计聚焦HIV疾病管理的核心指标,如病毒载量、CD4动态变化、抗逆转录病毒治疗方案及依从性、结核病筛查、妊娠状态、预防母婴传播信息等,支持从疾病进展分析到治疗反应评估的多维度研究。此外,该数据集可无缝应用于监督微调、自监督学习及基于人类反馈的强化学习等先进AI工作流。
使用方法
用户可直接以标准CSV格式加载数据,利用患者基本信息、实验室检测时间序列和治疗记录等结构化字段,开发用于病毒载量预测、CD4计数分析、临床风险分层及患者队列划分的机器学习模型。数据集特别适用于医疗AI系统的训练与验证,支持构建临床决策支持工具、治疗效果评估系统及人群健康研究。研究人员可按需选择字段,结合Apache Spark、Pandas等工具进行大规模分析,或将其整合到EHR驱动的机器学习流水线中,实现从数据清洗到模型部署的全流程开发。
背景与挑战
背景概述
该数据集由Infobay.AI机构创建,发布于2020年代,专注于HIV临床电子健康记录(EHR)的大规模收集与利用,核心研究问题在于如何通过真实世界的临床数据驱动医疗人工智能系统,提升对HIV疾病进展、治疗反应及患者预后的预测能力。数据集包含470,295名HIV患者的结构化记录,涵盖了人口统计学信息、CD4计数、病毒载量、抗逆转录病毒治疗方案、合并症、WHO临床分期及患者结局等关键字段。这一资源为HIV疾病动态分析、治疗优化、风险分层及人群健康研究提供了坚实的基础,对推动精准医疗和智能化临床决策支持系统的发展具有重要影响力,弥补了高质量临床数据在HIV领域AI模型训练中的稀缺性。
当前挑战
该数据集所解决的领域挑战在于HIV临床管理中存在的复杂性和异质性,包括病毒载量与CD4计数的波动性预测、个体化治疗方案的优化以及患者结局的早期判别,传统统计方法难以捕捉多维时序数据中的非线性关系。在构建过程中,面临的挑战包括从真实医疗环境中整合异构数据源,处理缺失值、不一致编码与隐私保护问题;此外,确保数据的临床代表性和跨中心可迁移性,以及设计适用于监督微调、自监督学习和人类反馈强化学习等先进AI框架的数据结构,均对数据质量与标注一致性提出了严苛要求。
常用场景
经典使用场景
HIV_EHR_dastaset作为大规模艾滋病患者电子健康档案数据集,在临床预测建模领域扮演着关键角色。研究人员常利用其包含的CD4计数、病毒载量、抗逆转录病毒治疗方案及合并症等结构化信息,构建疾病进展预测模型。该数据集的时序特性使其特别适合用于ART治疗反应评估、病毒学失败预警以及机会性感染风险分层等任务。临床决策支持系统可通过该数据训练算法,实现对患者预后的动态监测与早期干预。此外,在患者分层分析中,该数据集支持基于WHO临床分期、病毒抑制状态等特征划分亚群,从而优化个体化治疗策略的制定。这些应用不仅验证了真实世界EHR数据在精准医疗中的可行性,也为后续细粒度临床研究奠定了数据基础。
解决学术问题
该数据集有效解决了艾滋病临床研究中数据稀疏性与样本异质性两大核心难题。传统研究常受限于样本量不足而难以捕捉低频率事件(如药物耐药性出现),而470,295条记录的大规模样本使罕见临床表型的统计推断成为可能。通过整合死亡状态、结核共感染标志物及预防性治疗信息,该数据集突破了既往研究仅关注病毒学指标的局限,推动从单一生物标志物分析向多维度健康结局预测的范式转变。在因果推断层面,ART方案与患者预后的关联性分析得以在控制混杂因素(如体重变化、妊娠状态)后更可靠地开展。这些进展促进了真实世界证据在HIV治疗指南优化中的应用,弥合了临床试验设计与临床实践之间的鸿沟。
衍生相关工作
该数据集催生了一系列经典学术工作,尤其在表征学习与临床预警领域。研究者基于其开发了用于病毒载量缺失值插补的时间序列生成对抗网络,解决了真实EHR中记录不完整的问题。另一项里程碑工作利用CD4与病毒载量的动态变化图结构,构建了预测免疫重建综合征的图神经网络模型。该数据集也是迁移学习研究的基准,例如将高资源地区训练的HIV并发症预测模型通过域自适应技术适配至低资源临床场景。此外,有团队从中提取治疗序列模式,结合强化学习提出ART用药策略优化框架。这些工作不仅展示了该数据集的复用潜力,更推动了医疗AI中数据高效利用方法论的发展,为其他慢性病管理研究提供了可复制的技术范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务