遇见数据集

electricsheepafrica/africa-ilo-eip-teip-sex-age-edu-nb-persons-outside-the-labour-force-by-sex-age-and-ed

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为“按性别、年龄和教育程度分类的劳动力之外人口(千)| 非洲(ILOSTAT)”,是一个关于非洲国家劳动力之外人口的统计数据集。它包含181,398个观测值,覆盖49个非洲国家,时间跨度为1982年至2025年,涉及1个核心指标:EIP_TEIP_SEX_AGE_EDU_NB(按性别、年龄和教育程度分类的劳动力之外人口,以千计)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤至非洲国家ISO3代码,原始数据基于国际劳工统计学家会议(ICLS)定义进行标准化。数据集提供详细的表格结构,包括国家代码、性别、年龄、教育程度分类、观测年份、数值和质量标志等列,适用于表格分类、回归和时间序列预测等自然语言处理任务。数据以英语为主,采用cc-by-4.0许可证,由Electric Sheep Africa重新打包发布,旨在为非洲提供机器学习就绪的数据层。

The dataset is titled Persons outside the labour force by sex, age and education (thousands) | Africa (ILOSTAT), and it is a statistical dataset focusing on persons outside the labour force in African countries. It contains 181,398 observations across 49 African countries, spanning the years 1982 to 2025, with one key indicator: EIP_TEIP_SEX_AGE_EDU_NB (Persons outside the labour force by sex, age and education, in thousands). The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via API and filtered to African ISO3 country codes, with raw data harmonized using International Conference of Labour Statisticians (ICLS) definitions. The dataset features a detailed tabular schema including columns for country code, sex, age, education classifications, observation year, value, and quality flags, making it suitable for tabular classification, regression, and time-series forecasting tasks in NLP. It is primarily in English, licensed under cc-by-4.0, and repackaged by Electric Sheep Africa as part of a unified, ML-ready data layer for Africa on HuggingFace.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-eip-teip-sex-age-edu-nb-persons-outside-the-labour-force-by-sex-age-and-ed 数据集图片
构建方式
该数据集由Electric Sheep Africa基于国际劳工组织(ILO)的ILOSTAT数据库重新打包而成。数据通过ILOSTAT REST API直接获取,筛选出非洲49个国家的ISO3代码后,对原始调查微观数据依据国际劳工统计学家会议(ICLS)定义进行统一协调处理。数据集涵盖了1982年至2025年间的181,398条观测记录,每个观测值均包含国家、性别、年龄和教育水平的细分维度,并以Parquet格式发布,便于机器学习就绪。
使用方法
用户可通过HuggingFace的datasets库便捷加载数据集,使用'load_dataset("electricsheepafrica/africa-ilo-eip-teip-sex-age-edu-nb-persons-outside-the-labour-force-by-sex-age-and-ed")'命令直接获取训练数据,并转换为Pandas DataFrame进行后续分析。典型应用包括按国家筛选子集进行国别研究、利用'time'和'obs_value'列绘制特定指标的时间序列趋势,或通过透视表构建国家×年份的统计矩阵,便于跨区域比较与建模。
背景与挑战
背景概述
本数据集由国际劳工组织(ILO)于其旗舰统计数据库ILOSTAT中创建,并由Electric Sheep Africa于2025年重新整合发布,聚焦非洲大陆劳动力市场研究的核心议题——劳动参与不足的度量。数据集涵盖了49个非洲国家自1982年至2025年间关于“按性别、年龄和教育程度划分的劳动力外人口”的181,398条观测记录,通过统一的ICLS定义对各国劳动力调查数据进行规范化处理。作为ILOSTAT中衡量劳动力未充分利用状况的关键指标,该数据集为研究非洲地区结构性失业、隐性劳动力储备以及教育水平对劳动参与影响的长期趋势提供了标准化、跨国的量化基础,对发展经济学和劳动经济学领域具有重要的实证支撑价值。
当前挑战
该数据集面临的挑战首先体现在所解决的领域问题层面:劳动参与不足作为比传统失业率更复杂的多维现象,需要甄别因教育、家庭责任或制度障碍导致的非经济活动,而非洲各国劳动力调查的频率、定义和覆盖人群差异使得跨时空可比性难以保障。在构建过程中,数据整合需克服多重障碍:各国原始数据来源不一(如劳动力调查、行政记录),需通过ILOSTAT的算法选择“最佳来源”进行统一;教育分类标准不一致(如classif2标注的“非标准教育层级”)导致细分数据存在编码注释;观测状态标记(如'U'标识不可靠值)及方法修订(如'方法论修订'断点)警示了部分年份数据质量受限,需谨慎解读长期趋势。
常用场景
经典使用场景
在非洲劳动经济学与人口统计学研究中,该数据集被广泛用于分析劳动力市场边缘群体的结构性特征。通过按性别、年龄和教育水平分类的观测值,研究者能够精准刻画非洲各国脱离劳动力人群的规模与构成,揭示潜在劳动力储备的分布规律。其时间跨度覆盖1982至2025年,为纵向比较提供了宝贵的历史纵深感,尤其适合用于构建面板数据模型,探究影响劳动力参与率变化的长期趋势与周期波动。
解决学术问题
该数据集有效回应了非洲劳动经济学中关于劳动力利用不足(labour underutilization)的测量困境。传统失业率指标难以反映那些既不工作也不求职的‘潜在劳动力’规模,而本数据集提供的‘脱离劳动力人数’及其分维度统计,帮助学者精准测算劳动力闲置的真实程度。它突破了单一失业率指标的局限,为评估性别教育差异与劳动市场退出机制之间的关联提供了量化基础,进而推动了包容性增长与劳动政策干预效果的实证研究。
实际应用
在实际政策制定中,该数据集被国际劳工组织(ILO)、非洲各国统计局及发展机构用于监测劳动力市场健康状况与资源配置效率。例如,通过分析特定年龄段或教育群体的脱离劳动力规模,政府可精准识别需要职业培训或再就业支持的弱势人群,优化社会保障支出方向。此外,它也为跨国投资机构评估非洲各国人力资本存量与潜在劳动力供给提供了关键数据支撑,助力制定区域经济一体化战略与就业促进计划。
数据集最近研究
最新研究方向
该数据集聚焦于非洲劳动力市场边缘群体的结构性困境,通过整合国际劳工组织ILOSTAT中49个非洲国家1982至2025年间按性别、年龄与教育程度划分的劳动力市场外人口数据,为探索劳动力利用不足的深层次成因提供了跨时空的量化基础。当前研究前沿着重于利用该数据集揭示非洲非正规就业与教育错配之间的联动机制,结合联合国可持续发展目标中体面工作与经济增长议题,分析青年与女性群体因技能鸿沟而被排斥于劳动力市场之外的社会经济代价。尤其在南非、毛里求斯等国长达二十余年的追踪观察中,研究者可借助时间序列建模捕捉劳动力退出模式的动态演变,从而为区域性人力资本政策优化、社会保障体系改革以及后疫情时代就业复苏策略提供证据支撑,其影响力正随着非洲大陆自贸区建设与数字化转型进程而日益凸显。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务