遇见数据集

electricsheepasia/asia-who-prevalence-of-obesity-among-children-and-adolescents

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲48个国家从1980年至2024年期间,关于儿童和青少年肥胖患病率(BMI > +2标准差高于中位数的粗估计百分比)的19,070条观测记录。数据来源于世界卫生组织全球健康观察站,涵盖1个具体指标(NCD_BMI_PLUS2C)。数据集提供了详细的字段,包括指标代码、国家代码、年份、性别和年龄组维度以及数值估计,适用于表格分类、回归和时间序列预测等任务。

This dataset contains 19,070 observations of Prevalence of obesity among children and adolescents, BMI > +2 standard deviations above the median (crude estimate) (%) data across 48 Asia countries, spanning 1980–2024, covering 1 distinct indicators. The data is sourced from the WHO Global Health Observatory, with fields including indicator code, country ISO3 code, year, disaggregation dimensions (sex and age group), and numeric values, suitable for tasks like tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-who-prevalence-of-obesity-among-children-and-adolescents 数据集图片
构建方式
该数据集由Electric Sheep Asia基于世界卫生组织全球卫生观察站(WHO GHO)的原始数据重新整理与封装而成。研究者从WHO官方数据库提取了1980年至2024年间亚洲48个国家的儿童与青少年肥胖流行率指标,该指标定义为身体质量指数超过中位数两个标准差以上的粗估计比例。经过数据清洗、模式统一及格式标准化后,最终汇集为包含19,070条观测值的结构化表格数据,并以Parquet格式发布,便于机器学习流水线的直接调用。
特点
数据集覆盖了亚洲48个国家长达44年的时序观测,提供了唯一的核心指标代码NCD_BMI_PLUS2C,同时包含了丰富的按性别和年龄组划分的子维度信息,如SEX_BTSX(两性合计)、SEX_FMLE(女性)、SEX_MLE(男性)以及AGEGROUP_YEARS05-09、AGEGROUP_YEARS05-19、AGEGROUP_YEARS10-19等年龄分层。每条记录还附带了估计值的置信区间(value_low与value_high),为流行病学分析的可靠性评估提供了有力支撑。
使用方法
用户可通过HuggingFace Datasets库以一行代码加载数据集,并直接转换为Pandas DataFrame进行探索。典型操作包括按国家ISO代码筛选特定地区数据、按年份排序以生成时间序列趋势图、以及利用透视表构建国家×年份的数值矩阵以进行跨区域比较分析。该数据集适用于表格分类、回归及时间序列预测任务,尤其适合亚洲地区儿童肥胖问题的纵向研究与政策评估建模。
背景与挑战
背景概述
儿童与青少年肥胖已成为全球公共卫生领域面临的严峻挑战,尤其在亚洲地区,经济发展与生活方式变迁正加速这一问题的蔓延。世界卫生组织(WHO)全球卫生观察站于2024年发布的该数据集,由Electric Sheep Asia重新整合并提供于HuggingFace平台,聚焦亚洲48个国家在1980至2024年间儿童与青少年体重指数超过中位数两个标准差以上的肥胖患病率。该数据集通过标准化的指标代码和维度划分,为跨国家、跨时间段的分析提供了统一框架,填补了亚洲区域肥胖流行病学数据在开放获取与机器学习就绪格式方面的空白,有力推动了相关预测模型与政策评估研究。
当前挑战
数据集所解决的领域问题在于,儿童肥胖的长期监测与跨国比较常受限于数据来源分散、指标定义不统一、更新滞后等障碍,尤其在亚洲多元的卫生统计体系中,难以高效提取可训练的时序序列。构建过程中,挑战主要源自WHO原始数据的维度复杂性,需将性别、年龄组等分类维度转换为结构化表格,同时处理跨国数据空缺与数值置信区间内的波动。此外,确保44年间48个国家数据的时序对齐与版本一致性,并维持CC-BY-4.0许可下的合规分发,也是系统工程上的关键难点。
常用场景
经典使用场景
在全球儿童青少年肥胖问题日益严峻的背景下,该数据集作为世界卫生组织全球卫生观察站的官方数据整合,为研究者提供了覆盖48个亚洲国家、横跨1980至2024年长达四十余年的儿童青少年肥胖率(BMI超过中位数两个标准差以上的粗估计百分比)的时序面板数据。其经典用途在于构建时间序列预测模型,追踪亚洲不同国家和地区儿童肥胖流行趋势的演变轨迹,或通过横截面回归分析,探究性别、年龄段等人口学特征与肥胖发生率的关联,从而勾勒出亚洲区域儿童肥胖的时空分布全景。
解决学术问题
该数据集有效解决了亚洲地区儿童青少年肥胖研究中长期存在的数据碎片化与跨国可比性不足的学术困境。它使得研究者能够系统性地回答若干关键科学问题:亚洲各国儿童肥胖率的长期趋势是否存在趋同或分化现象?不同性别和年龄组(5-9岁、10-19岁等)的肥胖流行特征有何差异?更重要的是,该数据提供了评估公共卫生政策效果的量化基准,有助于揭示经济发展、城镇化进程与儿童营养失衡之间的复杂关系,其研究成果对理解全球营养转型的亚洲模式具有重要的理论贡献。
衍生相关工作
该数据集催生了一系列具有代表性的衍生研究工作。基于其面板数据结构,学者们构建了诸如‘亚洲儿童肥胖长期趋势的多层次贝叶斯模型’等经典工作,用以估计缺失年份的国家级肥胖率。在机器学习领域,研究人员利用该数据开发了针对时间序列缺失值的插补算法,并训练了预测未来五年亚洲各国儿童肥胖风险的梯度提升模型。此外,结合GDP、城市化率等社会经济协变量,该数据集还被用于因果推断研究,量化膳食结构改变对儿童体重状况的贡献度,这些工作不断深化着对亚洲儿童肥胖驱动机制的理解。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务