遇见数据集

electricsheepasia/asia-who-nmx-age-specific-death-rate-between-ages-x-and-xn

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲地区48个国家在2000年至2021年期间的特定年龄组死亡率(nMx)数据,共计51,900个观测值。数据来源于世界卫生组织(WHO)的全球健康观察站(GHO),由Electric Sheep Asia重新打包发布。数据集涵盖1个核心指标(LIFE_0000000029),并提供了按性别和年龄组分组的详细维度信息,适用于表格分类、回归和时间序列预测等机器学习任务。

This dataset contains 51,900 observations of nMx - age-specific death rate between ages x and x+n data across 48 Asia countries, spanning 2000–2021, covering 1 distinct indicators. The data is sourced from the WHO Global Health Observatory and repackaged by Electric Sheep Asia for machine learning applications such as tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-who-nmx-age-specific-death-rate-between-ages-x-and-xn 数据集图片
构建方式
该数据集源自世界卫生组织全球卫生观测站(WHO GHO),由Electric Sheep Asia团队重新整理并发布至HuggingFace平台。数据集聚焦于亚洲地区48个国家在2000至2021年间,年龄别死亡率(nMx)这一关键人口健康指标,共包含51,900条观测记录。在构建过程中,原始数据经历了格式规范化和模式统一,确保各字段类型清晰一致,并辅以性別与年龄组等多个细分维度,最终以高效Parquet文件格式封装,便于直接加载使用。
特点
数据集拥有丰富的特征设计:核心数值字段`value_numeric`精确记录了各年龄组死亡率,辅以置信区间上下限字段;同时,通过`dim1`(性别)与`dim2`(年龄组)两套分类维度系统,实现了按性别(男女及总体)以及从0-1岁至95岁以上共19个年龄段的精细拆分。此外,数据还囊括了国家ISO代码、WHO区域、更新日期等元信息,形成了时间跨度长、空间覆盖广、结构规范的多维面板数据,为区域健康差异研究提供了坚实基础。
使用方法
数据集的使用高度便捷,支持HuggingFace Datasets库一键加载。用户只需调用`load_dataset()`函数即可将数据读入为pandas DataFrame,随后可灵活进行按国家筛选、按指标绘制时间序列曲线,或进行国家×年份的透视矩阵构建等操作。例如,可快速提取印度尼西亚的完整死亡率记录,或对特定指标如`LIFE_0000000029`进行可视化分析。代码示例详尽,降低了数据探索门槛,尤其适合进行回归分析、分类任务及时序预测等机器学习应用。
背景与挑战
背景概述
该数据集由世界卫生组织(WHO)全球卫生观察站(GHO)提供,经Electric Sheep Asia于2026年重新打包并发布在HuggingFace平台。核心研究问题聚焦于2000至2021年间48个亚洲国家的年龄别死亡率(nMx),旨在为流行病学、人口健康评估及卫生政策制定提供精细化基础数据。通过涵盖0-1岁至15-19岁等19个年龄组并依据性别进行分层,该数据集不仅支持传统的死亡率趋势分析,更推动了时间序列预测与回归建模在该领域的应用。作为亚洲区域首个大规模标准化的年龄别死亡率公开数据集,它显著降低了获取全球健康数据的门槛,对发展中国家疾病负担评估、可持续发展目标监测及健康不平等研究具有重要推动力。
当前挑战
数据集旨在解决年龄别死亡率数据在亚洲区域普遍存在的粒度粗糙、时空不连续及标准化缺失等关键挑战。传统研究常受限于粗死亡率或全因死亡率,难以精确反映低龄组及性别间的死亡风险差异,而本数据集通过统一的分层框架有效填补了这一空白。构建过程中面临的挑战包括:从WHO原始数据中提取并校验48国长达22年的面板数据,确保不同国家上报口径与生命登记系统的一致性;处理年龄分组与性别维度的多层级编码(如AGEGROUP_YEARS00-01至AGEGROUP_YEARS15-19),将其转化为机器可读的标准模式;此外,还需应对部分国家年份数据缺失及异常值清洗问题,最终形成包含51,900条观测的稳定表格,为后续分析奠定可靠基础。
常用场景
经典使用场景
在全球健康与人口统计学研究领域,该数据集承载着亚洲48个国家从2000年至2021年间各年龄段的死亡率观测值,为探究不同区域的死亡模式演变提供了珍贵的时间序列资料。经典的使用方式是通过清洗和整合观测数据,构建以国家、年份、年龄组和性别为维度的面板数据,进而拟合死亡率曲线,分析各年龄段死亡风险的动态特征。研究者常利用该数据集计算去死因寿命表,评估不同死亡原因对预期寿命的净影响,为理解亚洲地区健康转型进程奠定数据基础。
衍生相关工作
基于该数据集,研究者已衍生出多项开创性工作,包括利用贝叶斯分层模型对亚洲各国的年龄别死亡率进行平滑与预测,生成低死亡率国家与高死亡率国家间的风险梯度图谱。相关学者还通过整合该数据与经济社会指标,构建了融入性别、教育水平等变量的多因素健康决定模型,量化发展因素对死亡率的非线性影响。此外,该数据集支撑了关于新冠疫情冲击下超额死亡率的跨国分析工作,通过对比疫情前后的年龄别死亡曲线,揭示了疫情对不同国家脆弱人群的非对称冲击后果,极大丰富了全球健康危机响应知识体系。
数据集最近研究
最新研究方向
该数据集汇集了世界卫生组织全球卫生观察站关于2000至2021年间48个亚洲国家的年龄别死亡率(nMx)数据,为亚洲区域人口健康研究提供了珍贵的时序面板资料。当前前沿研究方向聚焦于利用此类细粒度死亡率数据构建预测模型,以捕捉不同性别与年龄组别间的死亡风险异质性,进而支撑流行病学过渡理论在东亚、南亚及东南亚的实证检验。结合后疫情时代全球对生命表编制的迫切需求,该数据集成为评估新冠疫情对亚洲各国年龄别死亡率冲击的量化基石,也是探索非传染性疾病负担变化与预期寿命演进路径的关键数据源。其标准化结构与机器可读格式更适配深度学习与时空统计模型,推动亚洲区域健康不平等研究从描述性分析迈向因果推断与政策模拟的前沿。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务