遇见数据集

electricsheepasia/asia-who-nlx-person-years-lived-between-ages-x-and-xn

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含nLx - person-years lived between ages x and x+n(年龄x到x+n之间的人年数)的数据,涵盖48个亚洲国家,时间跨度为2000年至2021年,共有51,890个观测值。数据来源于世界卫生组织全球健康观察站,包含1个核心指标(LIFE_0000000033)。数据集以表格形式组织,列包括指标代码、国家ISO3代码、WHO区域、年份、性别维度、年龄组维度、数值等,适用于分类、回归和时间序列预测任务。数据由Electric Sheep Asia重新打包,以方便机器学习使用。

This dataset contains nLx - person-years lived between ages x and x+n data across 48 Asia countries, spanning 2000–2021, with 51,890 observations. It is sourced from the WHO Global Health Observatory and includes 1 distinct indicator (LIFE_0000000033). The data is structured in tabular format with columns such as indicator_code, country_iso3, who_region, year, dim1_type, dim1, dim2_type, dim2, value_numeric, etc., and is suitable for tabular classification, regression, and time-series forecasting tasks. Repackaged by Electric Sheep Asia for ML-ready use.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-who-nlx-person-years-lived-between-ages-x-and-xn 数据集图片
构建方式
该数据集源自世界卫生组织全球卫生观察站,由Electric Sheep Asia进行二次封装与标准化处理。数据收集覆盖2000年至2021年间48个亚洲国家,共计51,890条观测记录。每条记录详尽描述了特定年龄区间内人群的存活人年数,数据通过官方卫生统计渠道获取,并经过系统化的模式清洗与Schema统一,最终以Parquet格式存储,确保高效读取与机器学习兼容性。
特点
数据集以单一指标`LIFE_0000000033`为核心,通过多维拆解维度(如性别与年龄组)提供粒度化信息。性别维度涵盖总体、女性和男性三类,年龄组则细分为19个区间,从0-1岁至20-24岁不等。这种结构使得研究者能够灵活分析不同亚群的生命表参数。此外,数据集保留了原始数值、置信区间上下限及显示值,并附有数据更新时间戳,增强了透明度和可追溯性。
使用方法
研究者可通过HuggingFace Datasets库快速加载数据,一行代码即可将数据集转换为Pandas DataFrame进行后续分析。典型操作包括按国家ISO代码过滤单一国家的时间序列数据、按年份排序绘制特定指标的折线图,或利用透视表功能构建国家×年份的矩阵,便于进行跨国比较与面板数据分析。数据集以CC-BY-4.0许可发布,使用时需同时引用WHO和Electric Sheep Asia的整理版本。
背景与挑战
背景概述
该数据集由世界卫生组织(WHO)全球卫生观测站(GHO)发布,经Electric Sheep Asia重新打包整理,于2021年首次公开。数据集聚焦于亚洲地区“年龄x到x+n间存活人年数”(nLx)这一关键人口健康指标,覆盖48个亚洲国家,时间跨度从2000年至2021年,包含51,890条观测记录。nLx指标是生命表分析中的核心参数,用于量化特定年龄区间内的存活时间总和,在流行病学、人口学及公共卫生政策制定中具有广泛应用。该数据集的发布为研究亚洲各国人口健康转变、老龄化趋势及疾病负担提供了标准化、可横向对比的量化基础,显著推动了对该区域异质性人口结构的系统性分析。
当前挑战
该数据集面临的挑战首先来自其核心研究领域:nLx指标的计算依赖于精确的死亡率数据,而亚洲多国统计体系不一,部分低收入国家存在登记不全或年龄信息错报问题,导致估计值存在系统性偏差。其次,在构建过程中,原始WHO数据存在多维度分类(性别与年龄组)的复杂嵌套结构,且部分年份或国家存在缺失值(如value_low与value_high列为空),需经严格的数据清洗与插补处理。此外,将不同国家、不同版本的生命表参数统一为标准化模式,并保持跨年度可比性,对数据整合流程提出了极高要求。
常用场景
经典使用场景
该数据集源于世界卫生组织全球卫生观察站的生命表核心指标——nLx,即某一年龄段内个体存活的人年数。通过对亚洲48个国家从2000年至2021年的时序观测,研究者得以精确描绘不同性别和年龄组的人口生存轨迹。经典使用场景聚焦于构建区域生命表、测算年龄别死亡风险以及评估健康干预对人群生存时间的累积效应,为人口学与公共卫生领域的定量分析提供了标准化的纵向数据支撑。
实际应用
在实际应用中,该数据集助力各国卫生部门与政策制定者评估医疗保障体系效能,例如通过追踪某年龄组人年数的变动来量化疾病防控或计划生育政策的效果。保险公司利用其测算精算生命表以优化产品定价与准备金计提;国际发展机构则借助该数据进行区域健康不平等监测和资源分配优先级排序。数据集的时序与区划属性也便于嵌入地方政府的人口预测模型。
衍生相关工作
基于该数据集衍生出一系列经典工作,包括构建亚洲分年龄别死亡率预测模型、开发考虑性别结构的人口健康指数,以及将nLx指标与疾病负担数据耦合以估算伤残调整生命年(DALY)。部分研究将其与气候环境数据融合,探索环境暴露对人群生存时间的间接影响。另有团队以此为基础,标准化了从WHO原始API到机器学习就绪格式的数据管道,形成了可复用的亚洲人口统计基准数据集簇。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务