遇见数据集

electricsheepafrica/africa-ilo-eip-xplf-sex-edu-mts-nb-potential-labour-force-by-sex-education-and-marita

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含非洲42个国家从1994年至2025年的潜在劳动力数据,按性别、教育程度和婚姻状况分类(单位:千)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API直接提取并过滤为非洲国家代码,共8,581条观测记录。核心指标为“EIP_XPLF_SEX_EDU_MTS_NB”,表示按性别、教育程度和婚姻状况划分的潜在劳动力数量。数据集采用结构化表格形式,包含国家代码、年份、指标值、数据来源、分类变量(如性别、教育、婚姻状况)及质量注释等列。数据经过ILO基于国际劳工统计学家会议(ICLS)定义进行标准化处理,适用于表格分类、回归分析和时间序列预测等机器学习任务。数据集由Electric Sheep Africa重新打包发布,遵循CC-BY-4.0许可协议。

This dataset contains potential labour force data for 42 African countries from 1994 to 2025, disaggregated by sex, education level, and marital status (in thousands). Sourced from the International Labour Organization (ILO) ILOSTAT database, it includes 8,581 observations extracted via API and filtered to African ISO3 country codes. The core indicator is EIP_XPLF_SEX_EDU_MTS_NB, representing the potential labour force by sex, education, and marital status. The data is structured in tabular format with columns for country codes, years, indicator values, data sources, classification variables (e.g., sex, education, marital status), and quality notes. It is harmonized by ILO using International Conference of Labour Statisticians (ICLS) definitions and is suitable for machine learning tasks such as tabular classification, regression, and time-series forecasting. Repackaged by Electric Sheep Africa and released under the CC-BY-4.0 license.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-eip-xplf-sex-edu-mts-nb-potential-labour-force-by-sex-education-and-marita 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过其REST API直接获取,筛选出非洲地区42个国家的数据。数据集聚焦于潜在劳动力人口(按性别、教育程度和婚姻状况分类)的观测值,涵盖1994年至2025年的时间跨度,共计8,581条记录。数据经过ILO基于国际劳工统计学家会议(ICLS)定义的统一化处理,并对原始调查微观数据进行协调,确保了跨国可比性。每条观测均附有来源标识,便于追溯数据质量与可靠性。
特点
数据集的一个显著特点在于其多维度的分类结构,提供了性别(男性、女性、总计)、教育水平(细分为不同等级)以及婚姻状况(以聚合类别呈现)的细分指标,使得研究者能够深入分析非洲劳动力市场的结构性特征。此外,数据集包含了丰富的元数据字段,如观测状态标记(如临时的、不可靠的)以及注释信息,详细说明了指标定义、方法论变动及数据来源,为用户评估数据适用性提供了重要依据。数据涵盖42个非洲国家,其中南非、毛里求斯、安哥拉等国的观测数量最为丰富。
使用方法
用户可通过HuggingFace Datasets库便捷地加载数据,使用`load_dataset()`函数即可获取包含完整字段的表格数据。加载后,可以借助Python的Pandas库进行数据探索,例如按国家代码筛选特定国家的观测,或者按指标代码过滤时间序列数据。利用`pivot_table`方法可将数据重塑为国家×年份的矩阵形式,便于进行面板数据分析。该数据集尤其适用于劳动力参与率建模、失业率预测以及性别或教育维度的社会经济不平等研究。由于数据以Parquet格式打包,读取速度快,适合大规模计算任务。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年通过其核心统计数据库ILOSTAT发布,并经Electric Sheep Africa重新封装整理,聚焦非洲地区潜在劳动力人口按性别、教育程度及婚姻状况的分布情况。作为全球劳动力统计的权威来源,ILOSTAT基于各国劳动力调查、家计调查及行政记录等微观数据,统一采用国际劳工统计学家会议(ICLS)定义进行标准化处理。该数据集覆盖42个非洲国家、1994至2025年间的8,581条观测值,为研究非洲劳动力市场中的潜在劳动参与、就业不足及结构性失业提供了关键指标,填补了该区域在劳动力未充分利用度量方面的数据空白,对推动非洲发展经济学、劳动经济学及性别平等研究具有重要支撑作用。
当前挑战
在领域问题层面,该数据集致力于解决非洲劳动力市场中潜在劳动人口(即未充分参与但具备劳动意愿的人群)的量化困境,传统失业率指标常低估实际劳动闲置程度,而该数据通过性别、教育及婚姻状况的多维交叉分析,揭示了隐性失业与就业不足的复杂结构。在构建过程中,挑战主要体现在数据一致性上:各非洲国家统计能力差异显著,部分年份观测值被标记为“不可靠”(obs_status标签),且因方法论修订导致的时间序列断裂(如break in series标注)增加了纵向可比性的难度;同时,多重来源的整合需要ILO通过“最优来源”筛选机制消除重复与冲突,而教育分类标准(如classif1中的非标准教育水平)和婚姻状况分类(classif2)的跨国异质性进一步提升了数据清洗与合并的复杂度。
常用场景
经典使用场景
在劳动力经济学与发展经济学的研究脉络中,该数据集凭借其覆盖42个非洲国家、横跨1994年至2025年的长时序观测值,成为剖析潜在劳动力人口结构性特征的宝贵资源。其经典用法聚焦于按性别、教育水平和婚姻状况三重维度对潜在劳动力规模进行拆解分析,研究者可借助时间序列预测模型或面板回归方法,洞察教育与婚姻状态如何交织影响不同性别群体的劳动参与意愿,以及这些因素在非洲大陆上随年份演变的动态轨迹。
解决学术问题
该数据集深度回应了非洲劳动力市场中一个长期悬而未决的学术难题——如何系统量化并解释潜在劳动力(即那些处于失业与就业灰色地带、尚未被传统指标充分捕捉的人群)的构成与演化。通过提供高度结构化的分层数据,它使学者能够突破以往仅依赖宏观失业率的局限,精准识别不同教育背景与婚姻状态下的性别差异,进而评估社会政策、经济发展与制度变迁对劳动力边缘群体的真实影响,为拓展劳动经济学与发展研究的理论边界提供了坚实的实证基础。
衍生相关工作
围绕此数据集衍生出的经典研究工作主要集中在劳动市场不充分就业测量的方法论创新与地域比较分析上。学者们通常将其与ILOSTAT体系中的其他指标(如失业率、就业人口比)进行交叉验证,构建综合性的劳动力偏充分利用指数,以捕捉非洲独特的非正规就业与隐性失业现象。部分前沿研究进一步将婚姻状况作为社会资本代理变量,探讨家庭内部决策如何影响潜在劳动力的形成,并运用分位数回归或面板向量自回归等因果推断技术,揭示教育与性别平等政策对潜在劳动力规模的长期影响机制。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务