electricsheepeurope/europe-who-exclusive-breastfeeding-under-six-months-bfebfnumth
收藏数据链接:
官方服务:
资源简介:
该数据集包含1996年至2019年间10个欧洲国家的27个观测值,涉及“六个月以下纯母乳喂养(以千计)”数据,涵盖1个独特指标。数据来源于世界卫生组织全球健康观察站,由Electric Sheep Europe重新打包,用于表格分类、回归或时间序列预测等任务。数据集包括指标代码、国家ISO3代码、世卫组织区域、年份、数值、置信区间和更新时间等列。
This dataset contains 27 observations of Exclusive breastfeeding under six months (in thousands) data across 10 Europe countries, spanning 1996–2019, covering 1 distinct indicator. It is sourced from the WHO Global Health Observatory, repackaged by Electric Sheep Europe, and is suitable for tabular classification, regression, or time-series forecasting tasks. The dataset includes columns such as indicator code, country ISO3 code, WHO region, year, numeric value, confidence intervals, and last updated timestamp.
提供机构:
electricsheepeurope搜集汇总
数据集介绍

构建方式
该数据集源自世界卫生组织全球健康观测站(WHO GHO)的权威统计资料,由Electric Sheep Europe团队进行二次封装与标准化处理。数据覆盖欧洲10个国家,时间跨度从1996年至2019年,共计27条观测记录,聚焦于“六个月以下婴儿纯母乳喂养人数(千计)”这一单一健康指标。原始数据通过WHO官方渠道采集,经过去重、字段归一化与Parquet格式转换,形成结构化的表格数据,每条记录包含国家ISO代码、年份、数值及其置信区间等关键字段,旨在为研究人员提供即开即用的机器学习就绪数据。
特点
该数据集具备鲜明的时空异质性与专业指向性。其涵盖阿尔巴尼亚、塞尔维亚等10个欧洲国家,时间分布不均,部分国家仅有一个年份数据,而阿尔巴尼亚与塞尔维亚各有4个观测点,展示了区域内部健康统计的碎片化特征。每条记录不仅提供核心数值(value_numeric),还附有低值(value_low)与高值(value_high)构成的置信区间,以及经过格式化的显示字段(value_display),便于直接解读。此外,数据包含最后更新时间戳,确保溯源清晰,适用于时间序列分析、分类与回归任务。
使用方法
该数据集通过Hugging Face Datasets库便捷调用,用户仅需执行一行代码即可加载并转换为Pandas DataFrame。研究者可按国家筛选子集以开展局部趋势分析,亦可针对单一指标按年份排序,绘制时间序列曲线直观呈现变化规律。借助数据透视功能,可快速构建以年份为行、国家为列的矩阵,便于进行面板数据分析或缺失值填充。数据集支持分类、回归与时间序列预测三类任务,其简洁的架构降低了预处理门槛,适合公共卫生、流行病学与数据科学领域的快速实证研究。
背景与挑战
背景概述
本数据集由世界卫生组织(WHO)全球卫生观察站(GHO)于2019年发布后,经Electric Sheep Europe重新整理并托管于HuggingFace平台。其核心研究问题聚焦于量化欧洲地区6个月内纯母乳喂养的婴儿数量(以千计),旨在为婴幼儿营养与公共卫生政策评估提供精准的数据支撑。数据集收录了1996年至2019年间10个欧洲国家的27条观测记录,涵盖阿尔巴尼亚、塞尔维亚、波黑等具有不同经济发展水平和卫生体系的国家。作为全球健康领域的重要指标,纯母乳喂养率直接关联婴幼儿免疫力、母亲健康及可持续发展目标(SDGs)中的营养与减贫议题。该数据集通过标准化的数值与置信区间呈现,为跨国家、跨年代的趋势分析及机器学习模型训练奠定了可靠基础,对欧洲区域内的母婴健康监测具有显著推动作用。
当前挑战
在领域问题层面,该数据集致力于解决区域间纯母乳喂养率评估中数据稀疏性与不均衡性的挑战,例如部分国家(如克罗地亚、罗马尼亚)仅有一年数据,限制了纵向趋势的稳健推断与因果机制的深入挖掘。构建过程中,核心挑战在于从WHO原始异构数据中提取、清洗并标准化多来源记录,应对不同国家报告频率、时间跨度和数据质量参差不齐的问题,同时整合带有置信区间的数值与显示字段,确保格式统一且适用于表格分类、回归及时序预测等任务。此外,数据集仅覆盖10个国家且观测总量不足百条,对基于小样本的机器学习模型泛化能力提出了严峻考验,需谨慎处理过拟合与代表性偏差的风险。
常用场景
经典使用场景
该数据集记录了1996年至2019年间欧洲10个国家六个月以下婴儿纯母乳喂养人数(单位:千)的官方统计资料,源自世界卫生组织全球卫生观测站。其经典使用场景集中于公共卫生与营养学领域的跨国比较分析,研究者可借助国家-年份面板数据,绘制喂养趋势的时间序列曲线,或构建国家间的横截面对比,揭示欧洲区域在婴幼儿早期营养实践上的动态演变与地域差异。
解决学术问题
该数据集有效回应了全球健康领域关于婴幼儿营养干预效果评估的核心学术问题。通过提供低样本量但高质量的纵向观测,它使学者得以探究纯母乳喂养率在特定欧洲国家的长期波动规律,辨识社会经济、卫生政策及文化因素对喂养行为的潜在影响。这一数据基础助力了健康指标监测方法的完善,为联合国可持续发展目标中关于改善营养状况的量化评估提供了实证支撑。
衍生相关工作
围绕该数据集衍生了一系列经典的学术与工程工作,包括利用面板数据构建贝叶斯层次模型以估算缺失年份的喂养率,以及开发跨数据库迁移学习框架,将欧洲经验迁移至其他区域。此外,数据集的清洗与规范化流程推动了“数据即产品”理念在卫生信息学中的普及,催生了诸如自动化健康指标抽取管道和交互式可视化仪表盘等工具,显著降低了全球健康数据的复用门槛。
以上内容由遇见数据集搜集并总结生成



