遇见数据集

electricsheepeurope/europe-who-prevalence-of-obesity-among-children-and-adolescents

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含16,269个观测值,记录了欧洲40个国家从1980年至2024年间儿童和青少年肥胖患病率,BMI > 中位数+2个标准差(粗略估计)(%)的数据。数据集涵盖1个独特指标,具体为NCD_BMI_PLUS2C,用于衡量儿童和青少年肥胖的流行情况。数据来源于世界卫生组织全球健康观察站(WHO GHO),并经过Electric Sheep Europe重新打包,以提供统一的、适合机器学习使用的格式。数据集包含多个维度,如国家、年份、性别和年龄组,并提供了数值估计值、置信区间和显示值。

This dataset contains 16,269 observations of Prevalence of obesity among children and adolescents, BMI > +2 standard deviations above the median (crude estimate) (%) data across 40 Europe countries, spanning 1980–2024, covering 1 distinct indicators. The data is sourced from the WHO Global Health Observatory (GHO) and repackaged by Electric Sheep Europe to provide a unified, ML-ready format. It includes dimensions such as country, year, sex, and age group, with numeric estimates, confidence intervals, and display values.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-who-prevalence-of-obesity-among-children-and-adolescents 数据集图片
构建方式
该数据集源自世界卫生组织全球卫生观察站(WHO GHO),由Electric Sheep Europe团队进行重新封装与标准化处理。原始数据经过系统化的清洗与整合,涵盖1980年至2024年间40个欧洲国家的儿童与青少年肥胖患病率信息,总计包含16,269条观测记录。数据集采用统一的模式设计,包括指示代码、国家ISO3编码、年份、性别与年龄组别等维度,并提供了数值估计及其置信区间,以利后续分析与建模。
特点
数据集的核心特点在于其多维度的解构能力,通过性别(SEX)与年龄组(AGEGROUP)两个分解维度,可分别获取5-9岁、5-19岁及10-19岁三个年龄段的肥胖率数据,并支持按性别细分。数据以面板结构呈现,便于进行时间序列分析、跨国比较以及面板数据建模。此外,每个观测值均附带低值(value_low)与高值(value_high)区间,反映了估计的不确定性,增强了数据在统计推断中的可信度。
使用方法
数据集可通过HuggingFace的datasets库便捷加载,使用`load_dataset`命令即可获取训练集,并可无缝转换为Pandas DataFrame进行后续操作。典型用法包括按国家ISO3代码筛选单一国家数据、按年份排序以绘制特定指标的时间序列趋势图,以及通过透视表将数据重塑为国家×年份的矩阵格式,便于进行跨国家或跨时期的对比分析。该数据集已以Parquet格式预存,适用于大规模机器学习与统计分析任务。
背景与挑战
背景概述
儿童与青少年肥胖已成为全球公共卫生领域亟待解决的重大挑战,尤其在欧洲地区,其高发态势与日益突出的非传染性疾病负担密切相关。该数据集由世界卫生组织全球卫生观察站(WHO GHO)于2024年创建,经Electric Sheep Europe重新整理后在HuggingFace平台发布,覆盖40个欧洲国家、时间跨度从1980年至2024年,共计16,269条观测记录。核心研究问题聚焦于量化欧洲儿童与青少年中体重指数(BMI)超过中位数2个标准差以上(粗估计)的肥胖患病率,为流行病学监测、政策制定及干预效果评估提供关键证据。该数据集因其权威来源、长时序覆盖及标准化的性别与年龄分组维度,已成为研究欧洲儿童肥胖流行趋势与区域差异的重要基石,对推动全球健康数据整合与机器学习应用具有深远影响。
当前挑战
该数据集所解决的领域问题是儿童与青少年肥胖患病率的时空量化与趋势分析,核心挑战在于不同国家间的数据收集标准、年龄分组定义及报告周期的异质性,使得跨区域可比性与高质量时序建模面临障碍。构建过程中,数据整合需克服原始来源中多来源碎片化、缺失值处理、国际标准化编码(如ISO-3国家代码与WHO指标代码)的对齐,以及将长格式数据转换为适用于机器学习的结构化范式。此外,低龄(5-9岁)与全龄(5-19岁)亚组的稀疏分布进一步增加了统计推断的复杂性,需要谨慎处理数据离散化与置信区间表征,以支撑鲁棒的回归与时间序列预测模型开发。
常用场景
经典使用场景
在全球儿童肥胖问题日益严峻的背景下,该数据集为欧洲地区儿童与青少年肥胖流行率的时空分析提供了标准化数据基础。其最经典的使用场景是作为时间序列预测与面板数据分析的输入,研究者可基于1980至2024年覆盖40个欧洲国家的观测数据,利用回归模型或分类算法识别肥胖率随年份变化的长期趋势与潜在拐点。此外,该数据集中包含按性别和年龄段细分的维度,支持研究者探索不同人口亚群之间的肥胖分布差异,从而为公共卫生领域的针对性干预策略提供实证依据。
实际应用
在实际应用中,该数据集为欧洲各国卫生部门、国际组织及非政府机构评估儿童肥胖防控成效提供了关键监测工具。政策制定者可借助其时间序列特性,对比不同国家在推行含糖饮料税、校园营养计划或体育课程改革前后的肥胖率变化,从而量化政策杠杆的真实效应。同时,数据集中附带置信区间的估计值能够帮助公共卫生从业者合理评估数据不确定性,在资源有限的条件下优先布局高风险人群的健康干预项目,最终助力实现世卫组织关于遏制肥胖流行的全球目标。
衍生相关工作
基于该数据集,学界已衍生出多项具有深远影响的经典工作。例如,利用其面板结构衍生的时空贝叶斯模型被用于预测欧洲区域未来十年的肥胖分布热点;另有研究通过构建多任务学习框架,联合预测肥胖率与相关非传染性疾病(如糖尿病)的并发趋势。此外,该数据集也被嵌入到联邦学习架构的跨机构协同平台中,在保护各国数据隐私的前提下实现联合建模,显著提升了小样本国家模型的外推精度。这些工作不仅丰富了计算流行病学的方法工具箱,也为数据驱动的全球健康治理提供了可复用的范式参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务