遇见数据集

electricsheepafrica/africa-ilo-emp-care-sex-edu-nb-care-employment-by-sex-and-education-thousands

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含非洲37个国家从2000年至2025年的付费护理工作者数据,共有2570个观测值,涉及1个具体指标:按性别和教育程度分类的护理就业人数(以千计)。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,通过API提取并过滤至非洲国家,涵盖了就业、性别和教育等多维度的分类信息。数据集包括国家代码、来源标签、指标代码、性别分类、时间年份、观测值等列,用于表格分类、回归和时间序列预测等任务。数据以年度频率发布,并包含数据质量标志,如观测状态和注释,适用于劳动市场分析和机器学习研究。

This dataset covers data on paid care workers across 37 African countries from 2000 to 2025, with a total of 2570 observations. It focuses on one specific indicator: the number of employed care workers, categorized by gender and educational attainment, measured in thousands. The data is sourced from the ILOSTAT statistical database of the International Labour Organization (ILO), extracted via API and filtered to retain only entries for African nations, encompassing multi-dimensional classification information including employment, gender, and education. The dataset comprises columns such as country code, source tag, indicator code, gender category, calendar year, and observed values, among others. It is applicable for tasks including table classification, regression, and time series forecasting. Released at an annual frequency, the dataset also includes data quality flags such as observation status and accompanying notes, making it suitable for labor market analysis and machine learning research.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-emp-care-sex-edu-nb-care-employment-by-sex-and-education-thousands 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,经由Electric Sheep Africa团队重新封装而成。构建流程始于从ILOSTAT的REST API接口直接拉取指标代码为EMP_CARE_SEX_EDU_NB的原始数据,并依据非洲ISO3国家代码进行地域筛选。ILOSTAT本身依据国际劳工统计学家会议(ICLS)定义对调查微观数据进行统一协调,数据来源在source.label字段中予以标注,确保了数据的可追溯性。最终,数据被整理为包含2570条观测记录、覆盖37个非洲国家、时间跨度为2000年至2025年的结构化表格,并以Parquet格式发布,便于机器学习应用。
特点
数据集的核心特点在于其聚焦于非洲地区有偿护理工作者的雇佣状况,并按照性别和教育水平进行详细分类。它包含一个关键指标“Care employment by sex and education (thousands)”,并提供了ref_area、sex、classif1等维度字段,其中性别分为总计、男性和女性三类,教育水平则涵盖汇总级别。数据质量方面,采用年频率观测,优先使用ILO筛选的“最佳来源”,并通过obs_status等字段标记异常值或方法修订等质量提示,兼顾了数据的广度与可靠性。
使用方法
数据集的使用极为便捷,借助Hugging Face的datasets库,通过一行代码load_dataset即可加载为Pandas DataFrame,快速进行数据探索。用户可按国家进行过滤分析特定区域的趋势,也支持针对单一指标进行时间序列的可视化与建模。此外,数据可轻易通过pivot_table方法转化为国家×年份的矩阵形式,适用于面板数据分析或预测任务。数据集采用CC-BY-4.0许可协议,引用时需注明ILO原始来源及Electric Sheep Africa的封装工作。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年整理发布,并经人工智能研究机构Electric Sheep Africa重新封装至HuggingFace平台,聚焦非洲大陆37个国家2000至2025年间按性别与教育水平划分的有偿护理工作者就业情况(以千人为单位)。作为ILOSTAT统计数据库的核心指标之一,该数据集旨在揭示非洲地区护理行业劳动力结构的演变趋势,为分析性别平等、教育回报率及可持续发展目标中的体面劳动议题提供量化基础。其跨时25年、覆盖近40国的广袤时空跨度,使其成为研究非洲劳动力市场转型与护理经济政策效应的关键资源。
当前挑战
该数据集面临的核心挑战源于非洲地区劳动力统计数据的碎片化与异质性。由于各国调查方法(如劳动力调查与行政记录)及国际劳工统计会议定义的应用差异,不同来源的观测值间存在系统性偏差,需依赖ILO的‘最佳来源’选择机制进行协调。此外,37国的不规则时间序列(如安哥拉2009年才纳入统计)与大量标记为‘不可靠’或‘方法修订’的观测值,增加了模型构建与因果推断的难度。数据集的细粒度(按性别与教育水平细分)虽增强了分析潜力,却加剧了高维稀疏性问题,尤其在教育分类非标准化时更为显著。
常用场景
经典使用场景
在劳动经济学与发展研究领域,该数据集为剖析非洲地区护理行业就业结构提供了关键支撑。其核心应用在于构建性别与教育维度交叉的就业分析模型,研究者可借此量化不同教育水平下男性与女性在带薪护理岗位中的分布特征,并追踪2000至2025年间的长时间序列演变趋势。这一场景尤其适合开展面板数据分析或时间序列预测任务,例如运用固定效应模型探究教育扩张对护理就业性别差距的调节效应,或借助ARIMA等工具预测未来护理劳动力供给的波动轨迹。
实际应用
实际应用中,该数据集赋能国际组织与政策制定者开展劳动力市场的精准干预。例如,ILO及各国劳动部门可依据按性别与教育细分的就业数据,识别护理行业中女性过度集中的地区与时段,从而设计针对性的职业培训计划以拓宽男性从业通道。同时,数据集的时间序列属性支持构建动态预警系统,监测教育结构性失衡对护理人才储备的潜在威胁,为制定兼顾公平与效率的就业促进政策提供实时数据锚点,减少决策盲区。
衍生相关工作
围绕这一数据集,已衍生出一系列具有标杆意义的学术探索。研究者基于其丰富的时间与空间维度,开发出融合性别意识的教育与就业关联模型,用以评估非洲各国在实现可持续发展目标5(性别平等)与目标8(体面劳动)方面的进展。此外,部分工作利用该数据验证了人类发展指数与护理就业占比的阈值效应,还有学者将其与ILOSTAT中其他关联指标(如工时、工资)结合,构建了非洲首个区域性的护理经济核算框架,极大拓展了单一指标数据的分析纵深与政策解释力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务