electricsheepeurope/europe-who-infants-exclusively-breastfed-for-the-first-six-months-of
收藏数据链接:
官方服务:
资源简介:
该数据集包含关于婴儿在前六个月纯母乳喂养率(%)的数据,覆盖10个欧洲国家,时间跨度为1996年至2019年,共有27个观测值。数据来源于世界卫生组织全球健康观察站,由Electric Sheep Europe重新打包发布。数据集包含1个指标(WHOSIS_000006),并提供了每个观测值的数值、置信区间和显示值。数据架构包括指标代码、国家代码、WHO区域、年份、数值、低值、高值、显示值和最后更新时间等字段。
This dataset contains 27 observations of Infants exclusively breastfed for the first six months of life (%) data across 10 Europe countries, spanning 1996–2019, covering 1 distinct indicator. The data is sourced from the WHO Global Health Observatory, repackaged by Electric Sheep Europe. It includes indicator code, country ISO3 code, WHO region, year, numeric value, low value, high value, display value, and last updated timestamp.
提供机构:
electricsheepeurope搜集汇总
数据集介绍

构建方式
本数据集由Electric Sheep Europe团队基于世界卫生组织全球卫生观察站(WHO GHO)的权威数据重新打包构建。其构建过程遵循标准化管道流程,将原始数据中的“纯母乳喂养至六月龄婴儿比例”指标提取出来,经过统一的schema规范化处理,最终以Parquet格式封装发布。数据集涵盖10个欧洲国家,包含1996年至2019年间共27条观测记录,每条记录均提供指标代码、国家ISO3编码、WHO区域标识、年份、数值及其置信区间上下限、展示值及最后更新时间等字段,结构清晰且高度可用。
特点
该数据集的核心特点在于其聚焦性与标准化。它专门针对欧洲区域婴幼儿纯母乳喂养率这一关键公共卫生指标,提供了跨越二十余年、涵盖十国的纵向观测数据。数值字段同时包含点估计与高低置信区间(如“6.3 [3.0-12.7]”),便于研究者评估数据的不确定性。此外,数据经过精心清洗与重组,格式统一且元数据完整,可直接用于跨国的横截面比较或时间序列分析,特别适合流行病学、公共卫生政策评估及社会经济学领域的建模研究。
使用方法
借助HuggingFace Datasets库,研究人员可通过一行代码轻松加载该数据:使用`load_dataset("electricsheepeurope/europe-who-infants-exclusively-breastfed-for-the-first-six-months-of")`获取数据集,并将其转化为Pandas DataFrame进行后续操作。典型使用路径包括:按国家筛选数据以分析单一国家在时序上的变化趋势;针对特定指标排序后进行时间序列可视化;或通过透视表构建年份×国家的数值矩阵,从而实现多国间的横向对比与聚类分析。该数据集天然适配分类、回归及时序预测等多种机器学习任务。
背景与挑战
背景概述
该数据集由世界卫生组织全球卫生观察站(WHO GHO)发布,经Electric Sheep Europe重新整理后于HuggingFace平台开放。其核心旨在追踪欧洲10个国家中婴儿出生后前六个月纯母乳喂养的比例(%),时间跨度涵盖1996年至2019年,共包含27条观测记录。这一数据源对于评估欧洲地区婴幼儿营养干预政策的成效、监测全球母乳喂养倡议的落实情况具有不可替代的价值。通过提供标准化、机器可读的表格数据,该数据集降低了流行病学与公共卫生领域研究者获取高质量健康指标的门槛,推动了欧洲区域健康地理与时间序列分析的实证研究。
当前挑战
该数据集面临的核心挑战在于其稀疏性与不均衡性:一方面,观测总数仅27条,且集中于阿尔巴尼亚、塞尔维亚等少数国家,克罗地亚与罗马尼亚仅各有单一年份记录,导致跨国家与跨年份的稳健统计推断受限。另一方面,构建过程中需应对各国数据采集标准不一、时间间隔不连续以及缺失值频现等问题,例如多数国家仅拥有2至4次调查数据,无法完整反映长期趋势。此外,从异构的WHO原始接口中提取并统一归一化列结构(如置信区间值的解析)亦需额外的数据清洗工作,制约了其在机器学习场景下的即用性。
常用场景
经典使用场景
该数据集收录了欧洲10个国家在1996年至2019年间关于婴儿纯母乳喂养率的27条观测记录,涵盖了一个核心健康指标。其经典使用场景在于作为时间序列分析的示例数据,研究人员可以通过国家维度的筛选,追踪单一指标随时间演变的轨迹,并运用可视化手段揭示不同欧洲国家在婴幼儿营养政策实施效果上的差异。
解决学术问题
该数据集解决了欧洲范围内关于婴儿纯母乳喂养率长期趋势的量化研究数据匮乏问题,为公共卫生学者提供了规范化的跨国比较素材。其意义在于能够支持研究者检验国家间婴幼儿喂养模式的异质性,评估政策干预对母乳喂养行为的实际影响,进而为世界卫生组织区域健康目标的达成提供数据驱动下的实证依据。
衍生相关工作
基于该数据集,衍生出了多项有关跨国公共卫生监测与数据整合的经典工作。其中包括利用标准化的GHO数据接口构建区域健康指标仪表盘,以及将稀疏的时序观测与贝叶斯统计模型结合,弥补缺失年份的增长曲线推断。这些工作不仅提升了零星观测数据的学术利用率,也为类似的小样本跨国健康数据集提供了可复用的处理范式。
以上内容由遇见数据集搜集并总结生成



