遇见数据集

electricsheepafrica/africa-ilo-eip-xplf-sex-age-nb-potential-labour-force-by-sex-and-age-thousands

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为“按性别和年龄划分的潜在劳动力(千计)| 非洲(ILOSTAT)”,是一个关于非洲劳动力未充分利用情况的表格型数据集。它包含8,992个观测值,覆盖43个非洲国家,时间跨度为1994年至2025年,专注于一个核心指标:EIP_XPLF_SEX_AGE_NB(按性别和年龄划分的潜在劳动力,以千计)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API获取并过滤为非洲国家。数据集提供了详细的列结构,包括国家代码、国家名称、数据来源、指标代码、性别分类(总计、男性、女性)、年龄分类、观测年份、观测值及其状态标志等。数据以年度频率发布,并经过ILO的标准化处理,确保与国际劳工统计学家会议(ICLS)定义一致。该数据集适用于表格分类、回归和时间序列预测等任务,旨在支持对非洲劳动力市场的分析和机器学习研究。

The dataset, titled Potential labour force by sex and age (thousands) | Africa (ILOSTAT), is a tabular dataset focusing on labour underutilization in Africa. It contains 8,992 observations across 43 African countries, spanning the years 1994 to 2025, with one distinct indicator: EIP_XPLF_SEX_AGE_NB (Potential labour force by sex and age, in thousands). Sourced from the International Labour Organizations (ILO) ILOSTAT database, the data is retrieved via REST API and filtered to African country codes. The dataset features a detailed schema including country codes, country names, data sources, indicator codes, sex disaggregation (total, male, female), age classifications, observation year, observed values, and status flags. Data is published at annual frequency and harmonized by ILO following International Conference of Labour Statisticians (ICLS) definitions. It is suitable for tabular classification, regression, and time-series forecasting tasks, supporting analysis and machine learning research on African labour markets.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-eip-xplf-sex-age-nb-potential-labour-force-by-sex-and-age-thousands 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过其REST API直接提取指标`EIP_XPLF_SEX_AGE_NB`,并依据非洲ISO3国家代码进行过滤筛选而得。ILOSTAT依据国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行协调统一,数据来源涵盖劳动力调查、家庭收入调查及行政记录等,并在`source.label`列中标注来源信息以确保可追溯性。数据集由Electric Sheep Africa重新打包,以Parquet格式发布,便于机器学习和数据分析工作流直接调用。
特点
本数据集包含8,992条观测记录,覆盖43个非洲国家,时间跨度为1994年至2025年,聚焦于“按性别和年龄划分的潜在劳动力(千人)”这一单一指标。数据按性别维度进行分解,包含总计、男性和女性三种分类,并通过`classif1`列提供年龄分组信息。数据集以年频次发布,采用ILO选定的最佳来源以避免多源冲突,同时通过`obs_status`和`note_indicator`等列标注观测状态与方法论变更,确保数据质量与使用的审慎性。
使用方法
用户可通过HuggingFace的`datasets`库直接加载数据集,使用`load_dataset("electricsheepafrica/africa-ilo-eip-xplf-sex-age-nb-potential-labour-force-by-sex-and-age-thousands")`命令即可获取训练集并转换为Pandas DataFrame进行后续分析。支持按国家过滤(如`df[df["ref_area"] == "KEN"]`)、按时间序列绘制特定指标的变化趋势,也可通过数据透视表构建国家×年份矩阵,便于进行跨国家的时间序列分析与比较研究。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门创建,经Electric Sheep Africa于2025年重新整理并发布在HuggingFace平台上。其核心研究问题聚焦于非洲地区潜在劳动力(即未被充分就业统计覆盖但仍希望工作的群体)的规模与结构,涵盖43个非洲国家1994年至2025年的年度观测数据,总计8,992条记录。作为ILOSTAT数据库的子集,该数据集为分析非洲劳动力市场中的隐性失业、性别与年龄差异提供了关键数据支撑。其在区域发展、劳动经济学及SDG体面工作目标监测等领域具有重要影响力,尤其填补了非洲国家高质量劳动力统计数据的空白,为政策制定者与研究者提供了标准化、可复用的跨时间序列数据资源。
当前挑战
该数据集所解决的领域问题在于,传统失业率指标常低估非洲劳动力市场的真实闲置程度,而潜在劳动力(如因家庭照料、教育资源匮乏或制度化歧视而退出劳动力市场者)的测度需要精细的性别与年龄分组数据。数据构建过程中的挑战包括:非洲多国缺乏连续多年的劳动力调查,导致时间序列存在断裂(如部分国家仅覆盖高峰期);不同来源的原始调查数据需依据国际劳工统计学家会议(ICLS)定义进行统一归化,处理过程中需标注来源与方法论变更,但部分国家的元数据标注不完整;此外,高频率数据(季度/月度)未被纳入,且ILO仅选择每个国家—年份组合的“最优来源”,可能引入选择性偏差,影响纵向比较的稳健性。
常用场景
经典使用场景
在探讨非洲劳动力市场结构性特征的研究中,该数据集为分析潜在劳动力群体提供了不可或缺的量化工具。通过纳入1994年至2025年间43个非洲国家的观测数据,并依据性别与年龄进行细分,研究者得以识别那些处于失业与就业边缘的群体规模及其演变趋势。其经典应用多见于构建面板数据回归模型,用以评估宏观经济波动、教育政策或社会变革对潜在劳动力参与率的影响,从而揭示非洲大陆特有的劳动力利用不足现象。
解决学术问题
该数据集旨在填补非洲劳动力统计中关于“潜在劳动力”这一非标准就业群体的系统性数据空白。传统失业率指标往往忽视因灰心而放弃求职或无条件进入劳动力市场的个体,而本数据集通过国际劳工组织统一方法论,量化了这一隐性失业群体。它支撑了关于劳动力利用不足的跨国比较研究,帮助学者探索性别差异、年龄结构转型与劳动力市场松紧度之间的复杂关联,对于修正非洲就业质量评估模型具有里程碑意义。
衍生相关工作
该数据集衍生出一系列围绕非洲劳动力市场动态的前沿工作,包括利用时序预测算法估算未来非充分就业规模的模型,以及结合其他ILOSTAT指标构建的劳动力市场脆弱性指数。研究者还将其与家庭调查微观数据融合,发展出解释非洲青年NEET(不在学、不就业、不培训)群体生成机制的机器学习框架。此外,基于该数据的地图可视化工具已成为非洲政策可视化平台的核心组件,推动了数据驱动的区域发展议程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务