遇见数据集

electricsheepeurope/europe-who-nlx-person-years-lived-between-ages-x-and-xn

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含nLx - person-years lived between ages x and x+n(在年龄x和x+n之间存活的人年数)指标的数据,覆盖39个欧洲国家,时间跨度为2000年至2021年,共有42,276个观测值。数据来源于世界卫生组织(WHO)的全球健康观察站(GHO),用于衡量人口健康和生存状况。数据集包括指标代码、国家代码、年份、性别和年龄组等维度信息,以及数值字段,适用于表格分类、回归和时间序列预测等任务。数据由Electric Sheep Europe重新打包,以方便机器学习使用。

This dataset includes data for the nLx metric — person-years lived between ages x and x+n. It covers 39 European countries, spans the period from 2000 to 2021, and contains a total of 42,276 observations. The data is sourced from the Global Health Observatory (GHO) of the World Health Organization (WHO), and is used to measure population health and survival conditions. The dataset includes dimensional information such as metric code, country code, year, gender, and age group, as well as numeric fields, and is applicable to tasks such as table classification, regression, and time series forecasting. It was repackaged by Electric Sheep Europe to facilitate machine learning use.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-who-nlx-person-years-lived-between-ages-x-and-xn 数据集图片
构建方式
本数据集源自世界卫生组织全球卫生观察站(WHO GHO),由Electric Sheep Europe团队重新打包并发布至HuggingFace平台。原始数据经过系统性整理,涵盖了2000年至2021年间39个欧洲国家的nLx指标,即年龄区间x到x+n内的生存人年数。数据集包含42,276条观测记录,每条记录均附有指标代码、国家ISO3编码、年份、性别与年龄组别维度信息,以及数值型观测值与上下置信区间。数据以标准化Schema呈现,并采用Parquet格式存储,便于机器学习流水线的直接调用。
特点
该数据集的核心特色在于其多维度的精细划分与权威数据源的双重保障。除核心的生存人年数值外,数据集通过dim1与dim2字段分别提供性别(如全体、男性、女性)与年龄组别(如1-4岁、5-9岁等共计19个年龄区间)的分层信息,使得研究者能够针对特定亚群进行深入分析。此外,数据集的时间跨度长达22年,覆盖欧洲39个国家,为区域性的流行病学建模、生命表构建及健康指标趋势研究提供了丰富的时间序列素材。其CC-BY-4.0许可协议也极大地促进了学术研究的复用与传播。
使用方法
使用者可通过HuggingFace的datasets库便捷加载数据,调用`load_dataset('electricsheepeurope/europe-who-nlx-person-years-lived-between-ages-x-and-xn')`即可获取训练集。数据集支持直接转换为Pandas DataFrame进行探索性分析,例如按国家过滤、按指标与年份排序绘制时间序列图,或利用pivot_table构建国家与年份的透视矩阵。对于需要批量建模的场景,预定义的列Schema及Parquet格式确保了与主流机器学习框架的无缝集成,显著降低了数据清洗与格式转换的工程负担。
背景与挑战
背景概述
该数据集由世界卫生组织(WHO)全球卫生观察站(GHO)发布,并由Electric Sheep Europe于2021年重新整理封装于HuggingFace平台。其核心研究问题聚焦于欧洲39个国家2000至2021年间按年龄和性别分层的‘nLx——在年龄x至x+n期间存活的人年数’这一关键生命表指标。该指标是人口健康评估与卫生政策制定的基石,能够揭示不同年龄段的死亡率与生存状况,为计算预期寿命、评估疾病负担及优化医疗资源配置提供不可或缺的定量依据。通过对欧洲多国长时段、标准化的数据整合,该数据集显著提升了跨区域人口健康研究的可及性与可比性,对流行病学、人口学及公共卫生领域的实证研究产生了深远影响。
当前挑战
该数据集面临的挑战主要源于其构建与应用的复杂性。在领域问题层面,核心挑战在于如何准确利用‘人年数’这一指标来量化不同年龄组的死亡风险与生存负担,从而支持对人口老龄化、慢性病及传染病长期影响等重大健康议题的精细刻画,这要求模型能够处理高度非线性的年龄-死亡率关系。在构建过程中,挑战体现为对来自39个欧洲国家、跨越22年的原始异构数据源进行规范化整合,包括统一不同国家的年龄分组标准、处理缺失值(如‘value_low’和‘value_high’列常见空白)以及确保跨时间、跨国家数据口径的一致性。此外,数据以多种分解维度(性别、年龄组)呈现,在分析时需要解决多分类变量的高维性与稀疏性问题,以提取稳定且具解释性的健康趋势。
常用场景
经典使用场景
在人口健康与流行病学研究中,nLx——即年龄区间x至x+n间的生存人年数——是生命表构建的核心指标之一。欧洲WHO地区nLx数据集涵盖了39个国家长达22年的观测记录,为学术研究提供了高分辨率的人口生存数据。经典使用场景包括生命表参数估计、死亡率趋势分析以及区域间健康差异的量化。通过该数据集,研究者能够精准计算各年龄段的期望寿命损失、疾病负担转移路径以及健康老龄化进程。其按性别和年龄组细化的分层结构,使得深入探讨不同人群的生存模式成为可能,从而支撑起对公共卫生政策效果的纵向评估与比较。
解决学术问题
该数据集有效解决了欧洲多国人口生存数据碎片化与标准不统一的核心难题。在生命表构建中,nLx作为核算“潜在寿命损失年”和“伤残调整生命年”的基础参数,其精确性直接关系到疾病负担研究的可信度。数据集提供了2000-2021年间统一的观测指标,使跨国家、跨时期的死亡率变化与健康不平等现象得以系统刻画。它填补了中小国家长期生命表数据公开可用的空白,为计量经济学中的健康人力资本模型、社会医学中的社会经济梯度研究以及精算科学中的生存概率建模提供了可靠的数据基础,显著降低了数据获取与清洗的时间成本。
衍生相关工作
基于此数据集,衍生出一系列具有广泛影响力的方法学与应用性工作。一方面,研究者利用其时间序列结构开发了改进的Lee-Carter死亡率预测模型及其贝叶斯变体,提高了长期生命表外推的稳健性。另一方面,结合社会经济协变量(如GDP、教育水平),学者们构建了多水平生存分析框架,揭示了欧洲国家间健康不平等的结构性驱动因素。此外,该数据集还被用于验证新型疾病负担计算工具,如集成nLx与伤残权重的DBI指数。这些衍生工作不仅深化了对人口老龄化与寿命转变的理论理解,也为跨学科的健康政策模拟平台(如Microsimulation模型)提供了标准化的参数输入。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务