遇见数据集

electricsheepeurope/europe-who-nmx-age-specific-death-rate-between-ages-x-and-xn

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含42,184个观测值,涉及nMx - 年龄x到x+n之间的特定年龄死亡率数据,覆盖39个欧洲国家,时间跨度为2000年至2021年,涵盖1个独立指标。数据来源于世界卫生组织全球健康观察站(WHO GHO),主题为特定年龄死亡率,适用于表格分类、表格回归和时间序列预测等任务。数据集以结构化表格形式提供,包括指标代码、国家ISO3代码、年份、性别和年龄组等分解维度,以及数值和显示值。

This dataset contains 42,184 observations focused on age-specific mortality data (nMx) for the age interval x to x+n. It covers 39 European countries, spans the period from 2000 to 2021, and includes 1 independent indicator. The data is sourced from the World Health Organization Global Health Observatory (WHO GHO), with its core theme being age-specific mortality. It is applicable for tasks such as tabular classification, tabular regression, and time series forecasting. The dataset is provided in structured tabular format, containing disaggregation dimensions including indicator code, country ISO3 code, year, sex, and age group, as well as numerical values and display values.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-who-nmx-age-specific-death-rate-between-ages-x-and-xn 数据集图片
构建方式
本数据集源自世界卫生组织全球卫生观察站(WHO GHO),由Electric Sheep Europe团队重新整理与封装。原始数据涵盖了2000年至2021年间39个欧洲国家的年龄别死亡率(nMx)指标,总计42,184条观测记录。构建过程中,数据经过统一的模式规范化处理,并转换为Parquet格式,确保其机器学习就绪性。数据集包含指示符代码、国家ISO3代码、年份、性别与年龄组等细分维度,以及数值型死亡率数据及其置信区间上下限。通过标准化的数据集卡片发布,研究人员可通过HuggingFace Datasets库的load_dataset()函数直接加载使用,无需额外预处理。
使用方法
用户可通过HuggingFace Datasets库便捷地加载该数据集。基本用法为调用load_dataset('electricsheepeurope/europe-who-nmx-age-specific-death-rate-between-ages-x-and-xn'),并将训练集转换为Pandas DataFrame进行后续操作。支持按国家筛选(如df[df['country_iso3'] == 'DEU']获取德国数据),也支持对单一指标进行时间序列分析(如按年份排序后绘制value_numeric曲线)。此外,可利用pivot_table将数据重构为国家×年份的矩阵形式,便于面板数据分析与多维统计建模。
背景与挑战
背景概述
该数据集由世界卫生组织(WHO)全球卫生观测站(GHO)创建,于2024年经Electric Sheep Europe重新封装后发布于HuggingFace平台。核心研究问题聚焦于欧洲地区特定年龄段的死亡率(nMx),旨在为公共卫生、流行病学及人口统计学研究提供标准化、高质量的时间序列数据。数据集涵盖2000年至2021年间39个欧洲国家的42,184条观测记录,包含按性别和年龄组分层的死亡率信息。凭借其权威来源、广泛的地理覆盖和精细的分层维度,该数据集已成为欧洲人口健康研究、政策评估及机器学习建模的重要资源,对推动区域健康差异分析和疾病负担量化产生了深远影响。
当前挑战
数据集所解决的领域挑战主要在于欧洲各国死亡率数据的异构性与可比性问题,此数据集通过统一整合WHO官方数据源,为跨国家、跨时间段的年龄标准化死亡率比较提供了可靠基础。构建过程中面临的挑战包括:处理不同国家上报数据的格式差异与缺失值,确保从WHO原始API到标准化Parquet格式的无损转换;管理22年跨度内39个国家、多种性别和19个年龄组别的高维数据,避免聚合时产生信息偏差;以及维护数据时效性与版本一致性,适应全球健康指标不断更新带来的动态维护需求。
常用场景
经典使用场景
在欧洲人口健康研究的广袤领域中,年龄别死亡率(nMx)作为衡量人口健康状况的基石指标,承载着揭示生命历程中脆弱性变迁的使命。该数据集汇集了2000年至2021年间39个欧洲国家的年龄别死亡率观测数据,细至1-4岁、5-9岁等年龄组,并依性别维度进行分层。研究者可将其用于构建生命表、计算预期寿命、量化不同年龄段的死亡风险,或是作为纵向队列研究的基础输入,剖析社会经济变迁、医疗进步或突发公共卫生事件对人口存活模式的动态影响。其精心整理的表格化结构,使得跨国家、跨时间的比较分析变得触手可及。
解决学术问题
学术界长期面临的一个核心挑战是获取高质量、标准化且具有充分时间跨度的跨国死亡率数据,以支撑人口学、流行病学与公共卫生领域的实证研究。该数据集精准回应了这一需求,它使得学者得以系统性地探讨欧洲内部死亡率差异的时空演变规律,验证收敛假说是否成立,或是评估特定政策干预(如控烟立法、疫苗接种计划)对人群生存概率的长期效应。此外,借助年龄与性别亚组的精细划分,研究人员能够剖析非传染性疾病负担在不同人口亚群中的分布特征,为精准预防策略的制定提供坚实的量化依据。
实际应用
在实际应用层面,该数据集展现出多维度的工具价值。对于国家卫生部门与国际组织而言,它可被用于实时监测区域健康目标的进展情况,例如联合国可持续发展目标(SDG)中关于降低非传染性疾病过早死亡率的具体指标。保险公司与精算机构能借此优化生命表参数,进行更精确的保险费率测算与养老金负债评估。公共卫生机构可基于年龄别死亡率的时序演变,提前预警特定年龄组的健康风险异常,从而合理配置医疗资源。数据科学家与人工智能工程师亦可将此作为回归或时序预测任务的标准基准,训练能捕捉死亡率动态变化规律的统计模型。
数据集最近研究
最新研究方向
该数据集聚焦于欧洲39国2000至2021年间的年龄别死亡率(nMx),为人口健康与流行病学的前沿研究提供了关键数据支撑。当前,全球公共卫生领域正深入探讨新冠疫情对各国年龄别死亡率的差异化冲击,尤其是老年群体与基础病患者的超额死亡风险。此数据集因涵盖完整的时间序列与性别、年龄分组细粒度信息,成为量化疫情长期健康后果、评估泛欧医疗卫生体系韧性及推动死亡率预测模型优化的核心资源,其影响力随老龄化议题的全球升温而持续攀升。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务