遇见数据集

electricsheepafrica/africa-ilo-emp-temp-sex-ind-cct-nb-employment-by-ilo-sector-and-sex-and-citizenship-t

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含15,168个观测值,覆盖36个非洲国家,时间跨度为2000年至2025年,核心指标为EMP_TEMP_SEX_IND_CCT_NB,即按国际劳工组织(ILO)部门、性别和公民身份划分的就业人数(以千计)。数据来源于ILO的ILOSTAT数据库,通过REST API获取并过滤为非洲国家。数据集包含多个字段,如国家代码(ISO 3166-1 alpha-3)、国家名称、数据来源代码和标签、指标代码和标签、性别分类(总计、男性、女性)、分类变量(如ILO部门、公民身份)、观测年份、观测值、观测状态标志等。数据为年度频率,ILO根据国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行协调。数据集适用于表格分类、回归和时间序列预测任务,可用于分析非洲各国就业趋势。数据由Electric Sheep Africa重新打包,以统一模式提供,便于机器学习使用。

This dataset contains 15,168 observations of employment data across 36 African countries, spanning from 2000 to 2025, with the core indicator EMP_TEMP_SEX_IND_CCT_NB, which represents employment by ILO sector, sex, and citizenship (in thousands). The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via REST API and filtered to African country codes. The dataset includes multiple columns such as country code (ISO 3166-1 alpha-3), country name, source code and label, indicator code and label, sex disaggregation (total, male, female), classification variables (e.g., ILO sector, citizenship), observation year, observed value, observation status flags, etc. Data is annual frequency, with ILO harmonizing raw survey microdata using International Conference of Labour Statisticians (ICLS) definitions. The dataset is suitable for tabular classification, regression, and time-series forecasting tasks, enabling analysis of employment trends across African countries. Repackaged by Electric Sheep Africa with normalized schemas for machine learning readiness.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-emp-temp-sex-ind-cct-nb-employment-by-ilo-sector-and-sex-and-citizenship-t 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,通过调用其REST API接口(https://rplumber.ilo.org/data/indicator?id=EMP_TEMP_SEX_IND_CCT_NB)直接获取原始数据,并依据非洲ISO3国家代码进行地理过滤。ILOSTAT基于国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行标准化处理,数据来源涵盖劳动力调查、家庭收支调查等多类渠道,并在source.label字段中标注以保障可追溯性。最终由Electric Sheep Africa团队重新打包为HuggingFace数据集,提供统一、机器学习就绪的数据格式。
特点
该数据集以15,168条观测记录覆盖36个非洲国家、时间跨度为2000年至2025年,聚焦于“按ILO行业、性别和公民身份划分的就业人数(千)”。核心特色在于提供多维度的分类分解,包括性别(总计、男性、女性)、行业分类及公民身份类别,能够支持精细化劳动市场分析。数据来源权威,由ILO依据最佳来源原则选取,并标记观测状态(如不可靠)和系列中断说明,具备较高的透明度和可信度。
使用方法
用户可通过HuggingFace的datasets库直接加载该数据集,一行代码即可获取Pandas DataFrame进行后续分析。典型使用方法包括:按国家代码(如ref_area == 'KEN')筛选特定国家数据;针对单一指标按时间排序以绘制时间序列趋势图;或利用pivot_table将数据重塑为国家×年份的矩阵形式,便于面板数据分析。数据集结构清晰,包含ref_area、time、obs_value等关键字段,适配分类、回归及时间序列预测等任务。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)的统计数据库ILOSTAT整理发布,并由Electric Sheep Africa于2025年重新打包,聚焦于非洲36个国家2000年至2025年间按ILO行业、性别和公民身份划分的就业数据,共计15,168条观测记录。ILOSTAT作为全球劳动统计的权威来源,通过整合劳动力调查、家庭收支调查及行政记录等多元数据,为研究非洲劳动力市场结构、性别就业差异及公民身份对就业的影响提供了可靠基石。该数据集不仅填补了非洲区域精细化就业数据的空白,还推动了时间序列预测、分类与回归等机器学习任务在劳动经济学领域的应用,对政策制定者、发展经济学家及数据科学家具有重要参考价值。
当前挑战
首先,非洲多国存在周期性劳动力调查缺失与数据不连贯问题,导致部分国家(如加纳2017年后数据中断)的时间序列断裂,削弱了跨年比较的可靠性。其次,数据来源异构性突出,不同国家采用不同调查方法(如劳动力调查与家庭收支调查),其问卷设计、抽样框架及季节调整差异可能引入系统性偏差。此外,数据质量标注(如观测状态标记为“不可靠”)虽提供警示,但异常值与缺失值的处理需依赖领域知识。最后,数据集仅包含年度频率,无法捕捉劳动力市场的短期波动,而非洲非正规经济占比高、定义模糊,进一步放大了数据真实反映就业全貌的难度。
常用场景
经典使用场景
该数据集收录了国际劳工组织(ILO)发布的非洲36个国家2000至2025年间按经济部门、性别及公民身份分类的就业数据,共计15,168条观测记录。在劳动经济学与发展研究领域,它被视为探究非洲劳动力市场结构性变迁的基石性资源。研究者常借助这一数据集开展时间序列分析,追踪特定国家或地区在不同维度下的就业波动趋势,或通过面板数据模型剖析经济增长、性别平等政策及移民法规对就业格局的潜在影响。其高度结构化的分类变量为跨层级交互分析提供了便利,使之成为检验理论假设与构建预测模型的理想样本。
实际应用
在实际应用层面,数据集为非洲各国政府及国际发展机构制定精准劳动就业策略提供了数据驱动的决策依据。政策制定者可通过分析性别与部门维度的就业分布,识别女性就业被边缘化的领域,或监测经济特区政策对本土与外来劳动力的吸纳效果。非营利组织亦可利用该数据设计干预项目,评估技能培训或创业扶持对特定人群就业率的改善程度。此外,金融与投资机构可将其纳入非洲国家风险分析框架,通过对就业稳定性与结构变化的追踪,辅助资金投放与产业布局的理性抉择。
衍生相关工作
围绕该数据集已衍生出一系列富有影响力的研究成果。在国际对比层面,学者将其与ILOSTAT全球数据联动,构建非洲与亚洲、拉丁美洲劳动力市场的比较分析,揭示不同发展路径下就业结构的趋同与分异。另有一部分研究聚焦于性别维度,利用数据集中的性别分类变量,深入探讨女性劳动力参与率与家庭福利、教育投入之间的非线性关联,推动了女性经济学领域的实证创新。此外,结合遥感影像或夜间灯光数据,研究者尝试融合统计指标与地理空间数据,构建更为精细的非洲区域贫困与就业预测模型,拓展了跨学科协同的研究范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务