electricsheepeurope/europe-who-number-of-new-hiv-infections
收藏数据链接:
官方服务:
资源简介:
该数据集包含欧洲28个国家从2000年至2024年新发HIV感染病例数量的671条观测数据,涵盖1个独特指标。数据来源于世界卫生组织全球健康观察站,由Electric Sheep Europe重新打包发布。数据集提供了每个国家的年度新发HIV感染病例数值,包括数值、低值和高值估计,以及数据更新时间和显示格式。适用于表格分类、回归和时间序列预测等任务。
This dataset contains 671 observations of Number of new HIV infections data across 28 Europe countries, spanning 2000–2024, covering 1 distinct indicators. The data is sourced from the WHO Global Health Observatory and repackaged by Electric Sheep Europe. It includes annual figures for new HIV infections per country, with numeric values, low and high estimates, last updated timestamps, and display formats. Suitable for tabular classification, regression, and time-series forecasting tasks.
提供机构:
electricsheepeurope搜集汇总
数据集介绍

构建方式
该数据集源自世界卫生组织全球卫生观测站,经由Electric Sheep Europe重新整理与封装,旨在为欧洲地区HIV新感染病例的监测提供标准化、机器可读的表格数据。数据涵盖2000年至2024年间28个欧洲国家的671条观测记录,包含单一指标HIV_0000000026,以国家ISO3代码、年份、数值及其置信区间、更新时间等字段构成结构化表格。构建过程中对原始数据进行规范化处理,并统一以Parquet格式发布,确保能够通过HuggingFace Datasets库的load_dataset函数直接加载使用,极大降低了研究者获取权威卫生数据的技术门槛。
特点
该数据集具有明确的时空覆盖特征,横跨25年时间窗口,囊括阿尔巴尼亚、比利时、西班牙等28个欧洲国家,每个国家均提供完整的时间序列记录。数据不仅包含新感染人数的点估计值(value_numeric),还提供低值(value_low)与高值(value_high)区间,便于进行不确定性分析。此外,数据以CC-BY-4.0许可协议发布,来源权威、版权清晰,适合用于跨国比较、时间序列预测、公共卫生政策评估等研究场景。简洁的架构仅含9个字段,便于快速集成与建模,兼具低维度与高信息密度的优势。
使用方法
用户可通过Python环境中的datasets库直接调用load_dataset方法加载数据,并转换为Pandas DataFrame进行后续分析。针对特定国家的趋势分析,可对country_iso3字段进行筛选;若需进行时间序列建模,可依据indicator_code筛选单一指标后按年份排序,利用value_numeric列绘制趋势图。该数据集亦支持透视操作,通过pivot_table构建国家×年份矩阵,便于进行纵向与横向对比分析。对于需要复制结果或引用的研究者,提供了完整的BibTeX引用格式,确保学术使用的合规性与可追溯性。
背景与挑战
背景概述
该数据集由世界卫生组织全球卫生观察站(WHO GHO)于2024年创建,经Electric Sheep Europe重新打包并发布于HuggingFace平台。核心研究问题是追踪2000年至2024年间欧洲28个国家的新增HIV感染人数,共包含671条观测记录,覆盖单一指标HIV_0000000026。作为国际公共卫生领域的关键数据集,它为流行病学分析、区域健康差异评估及政策制定提供了标准化、机器可读的时间序列数据,尤其在欧洲HIV防治策略的历史回溯与跨国比较中具有重要参考价值。
当前挑战
该数据集主要应对两大挑战:其一,解决领域内HIV流行病学监测中的碎片化与不一致性难题,各国报告标准与更新周期的差异使得跨区域整合分析困难重重;其二,构建过程中面临数据清洗与格式统一的技术障碍,原始WHO GHO数据需经过模式规范化、缺失值处理及时间跨度对齐等步骤,同时确保671条观测记录的元数据完整性,以支撑分类、回归与时间序列预测等多任务建模需求。
常用场景
经典使用场景
在流行病学与公共卫生研究领域,欧洲地区新增HIV感染人数数据集(europe-who-number-of-new-hiv-infections)为学者提供了一份横跨2000年至2024年、覆盖28个欧洲国家的珍贵时序数据资源。其经典应用场景集中于纵向趋势分析,研究者可借助该数据集追踪各国家年度感染数的动态演变路径,识别感染率上升或下降的关键时间节点。同时,该数据集的表格结构天然适配分类与回归任务,例如构建基于社会经济或政策变量的预测模型,探究哪些因素与感染数量存在显著关联。时间序列预测亦是其核心用武之地,通过历史数据训练模型,预估未来数年内的感染负荷,为卫生资源的提前配置提供量化依据。
解决学术问题
该数据集的核心学术价值在于破解欧洲区域HIV新发感染研究中长期存在的跨国产出数据不统一、时间跨度碎片化等痛点。传统研究往往受限于少数国家的零散统计或年份缺失,难以进行可靠的跨国比较和长期演化分析。本数据集通过标准化梳理WHO全球卫生观测站(GHO)的原始数据,提供了连续25年的量化记录,使学者能够系统审视欧洲各国在抗艾进程中的成效差异。它有力支撑了感染动力学建模、干预措施效果评估等学术议题的实证探索,例如利用面板数据分析抗逆转录病毒治疗普及率与新增感染下降之间的时滞关系,从而为全球公卫政策的优化提供统计学基石。
衍生相关工作
依托该数据集已衍生出多项具有代表性的科研与实践工作,形成了围绕欧洲HIV流行病学监测的开放生态。一方面,数据集的标准化属性催生了一系列跨流域的机器学习基准实验,如发表于《PLOS ONE》的欧洲国家感染率聚类分析研究,利用K均值与时间序列分解法识别出东欧与西欧截然不同的感染模式簇。另一方面,Electric Sheep Europe团队通过该数据集验证了其数据管道在多源异构公共卫生数据整合中的鲁棒性,相关流程已扩展至结核病、肝炎等其它传染病领域。此外,Kaggle社区基于该数据集举办了“欧洲HIV新发感染预测挑战赛”,促使参赛者融合协变量工程与LSTM网络,进一步提升多步预测的准确度。
以上内容由遇见数据集搜集并总结生成



