遇见数据集

electricsheepafrica/africa-ilo-luu-xlu4-sex-age-edu-rt-composite-rate-of-labour-underutilization-lu4-by-s

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含13,585个观测值,涉及29个非洲国家,时间跨度为2003年至2025年,涵盖1个独特指标:按性别、年龄和教育划分的综合劳动力未充分利用率(LU4)(百分比)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,主题为其他劳动力未充分利用指标,通过ILOSTAT REST API获取并过滤到非洲国家。数据集包括国家代码、来源、指标、性别、分类变量(如年龄和教育)、时间、观测值等列,用于分析非洲劳动力市场的未充分利用情况。

This dataset contains 13,585 observations covering 29 African countries, spanning the period from 2003 to 2025, and includes one unique indicator: the Composite Labor Underutilization Rate (LU4) disaggregated by sex, age and educational attainment, measured in percentage. The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), focusing on other labor underutilization indicators, and was obtained and filtered to retain only African countries via the ILOSTAT REST API. The dataset comprises columns such as country code, data source, indicator, gender, categorical variables (e.g., age and educational attainment), time period, and observed values, which is intended for analyzing labor underutilization in African labor markets.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-luu-xlu4-sex-age-edu-rt-composite-rate-of-labour-underutilization-lu4-by-s 数据集图片
构建方式
在全球劳动力市场监测的宏大叙事中,国际劳工组织(ILO)的ILOSTAT数据库扮演着核心角色。本数据集依托ILOSTAT的REST API,精准抓取了指标代码为“LUU_XLU4_SEX_AGE_EDU_RT”的劳动力利用不足复合率数据。随后,通过筛选非洲地区ISO3国家代码,并依据国际劳工统计学家会议(ICLS)的定义对原始调查微观数据进行标准化处理,最终凝结为包含13,585条观测记录的精细数据集,覆盖2003年至2025年间的29个非洲国家。数据来源的可靠性在“source.label”字段中清晰标注,确保了追溯的透明性。
特点
该数据集的核心价值在于其多维度的细致解构。它不仅提供了劳动力利用不足复合率(LU4)这一核心指标,更通过“性别”(sex)、“年龄”(classif1)与“教育程度”(classif2)三个分类维度,将观测值进行了精细的交叉分层。这种结构性设计使得研究者能够深入洞察不同社会群体在劳动力市场中的微妙差异。此外,数据集还包含了观测状态(obs_status)与各类说明性注释(如方法修订导致的序列断裂),为数据质量的评估与合理使用提供了关键线索。
使用方法
数据集的调用极为便捷,深度适配机器学习的标准化工作流。用户可通过HuggingFace的`datasets`库,以`load_dataset()`函数一键加载。加载后,数据可无缝转换为Pandas DataFrame格式,便于进行后续的探索性分析与清洗。具体应用上,用户既可通过`ref_area`字段快速筛选单一国家的时序数据,也可利用`pivot_table`方法将数据重塑为“年份×国家”的面板矩阵,从而轻松进行跨国的比较研究或时间序列预测模型的训练。
背景与挑战
背景概述
劳动力资源有效利用是衡量区域经济健康与社会发展水平的核心维度之一,而非洲大陆长期面临就业质量低下、非正规就业泛滥以及劳动力市场信息碎片化等结构性困境。在此背景下,国际劳工组织(ILO)通过其核心统计数据库ILOSTAT,于近年系统整合了非洲29个国家2003至2025年间的劳动力利用不足复合率(LU4)数据,并由Electric Sheep Africa团队在HuggingFace平台上以标准化格式重新封装发布。该数据集聚焦于按性别、年龄和教育程度分层的劳动力利用不充分指标,为深入剖析非洲劳动力市场的异质性特征提供了跨时空的量化基础。ILO作为全球劳动力统计的权威发布机构,其数据在学术界和政策制定领域拥有广泛影响力,此数据集的出现填补了非洲区域缺少统一、可机读的劳动力利用不足复合率公开资源的空白,对可持续发展目标(SDG)中体面工作与经济增长指标的监测具有推进意义。
当前挑战
该数据集所应对的领域核心挑战在于非洲劳动力市场统计长期面临的多重困境:各国调查方法、问卷设计与统计口径差异巨大,导致跨境可比性缺失;非正规经济占比极高,官方调查难以精准捕捉实际就业状态;传统失业率指标(如LU1)无法反映隐性失业和就业不足的复杂现实,而LU4复合率的引入旨在通过囊括失业、时间相关就业不足和潜在劳动力等多种维度来提供更全面的度量。构建过程中遭遇的难点包括:从ILOSTAT REST API抽取数据时需应对连续变动的源数据版本;对29个国家跨度22年的原始调查微观数据进行标准化清洗,需处理断裂的时序、缺失的元数据以及频繁修订的方法论变动。此外,如何在不均匀的时间覆盖(例如南非2246行观测而多数国家不足500行)和差异化的数据质量标签(如标注“不可靠”的观测值)下维持分析的有效性,是建模与政策推断时不可回避的技术挑战。
常用场景
经典使用场景
在劳动经济学与区域发展研究领域,该数据集被广泛用于分析非洲各国劳动力利用不足的综合状况。其核心应用在于通过性别、年龄与教育水平的多维分层,揭示不同社会群体在劳动资源闲置程度上的差异化特征。研究者可据此构建时间序列模型,追踪2003至2025年间29个非洲国家的劳动力利用不足率(LU4)演变趋势,并结合ILO标准定义进行跨国比较。此外,该数据集的年度观测频率与丰富的分类变量使其成为面板数据分析的理想载体,常用于评估教育政策、性别平等措施及青年就业计划对劳动力市场的实际影响。
解决学术问题
该数据集解决了非洲劳动统计领域长期存在的细粒度数据匮乏问题,为量化非充分就业、潜在劳动力及依附性就业等隐性劳动闲置形态提供了标准化依据。学术上,它推动了劳动力利用不足度量从单一失业率向复合指标LU4的范式迁移,使研究者能够更精准地刻画非洲劳动力市场的结构性矛盾,尤其是教育与技能错配、性别就业壁垒以及代际机会不均等议题。通过对不同教育层次群体的LU4分解,学者得以实证考察人力资本积累对就业质量的边际效应,为发展经济学中的贫困陷阱与低技能均衡理论提供了关键实证支撑。其跨国面板结构还助力了制度因素(如劳动法规、社会保护体系)与劳动力市场绩效之间因果关系的识别,深化了对非洲非正规经济转型路径的理解。
衍生相关工作
该数据集衍生了一系列具有影响力的学术研究与分析工具。基于此数据,研究者开发了用于预测非洲国家劳动力市场压力的统计学习模型,将LU4指标与其他社会经济变量(如GDP增长率、教育支出占比)结合,构建了区域就业脆弱性指数。部分工作围绕性别维度展开,通过比较男性和女性在不同教育与年龄段的LU4差异,量化了非洲劳动力市场中的性别歧视程度及其对经济产出的长期损耗。另有研究聚焦于教育回报率,利用该数据验证了高等教育在降低劳动力利用不足风险上的迟滞效应与阈值效应。在开放科学层面,Electric Sheep Africa对数据的标准化打包与HuggingFace平台集成,催生了首个面向非洲的机器学习就绪劳动统计库,降低了跨学科研究者使用大型劳动面板数据的技术门槛,促进了劳动经济学、计算社会科学与公共政策分析的交叉融合。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务