遇见数据集

electricsheepafrica/africa-ilo-luu-xlu4-sex-edu-mts-rt-composite-rate-of-labour-underutilization-lu4-by-s

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含非洲29个国家从2003年到2025年的5,679个观测值,涉及1个特定指标:按性别、教育和婚姻状况划分的劳动力未充分利用综合率(LU4)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤为非洲国家,涵盖了劳动力未充分利用的其他测量指标。数据集包括国家代码、年份、指标值、性别分类、教育水平和婚姻状况等列,用于表格分类、回归和时间序列预测任务。

This dataset contains 5,679 observations of the composite rate of labour underutilization (LU4) by sex, education and marital status (%) across 29 Africa countries, spanning from 2003 to 2025. It includes data on other measures of labour underutilization, sourced from the ILOSTAT database of the International Labour Organization (ILO), with a focus on African regions. The dataset is structured for tabular classification, regression, and time-series forecasting tasks, featuring columns such as country codes, year, indicator values, and disaggregation dimensions like sex, education, and marital status.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-luu-xlu4-sex-edu-mts-rt-composite-rate-of-labour-underutilization-lu4-by-s 数据集图片
构建方式
本数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,聚焦于非洲大陆劳动力利用不足的综合衡量指标(LU4)。数据通过调用ILOSTAT官方REST API接口获取,并依据非洲ISO3国家代码进行区域筛选。ILOSTAT本身遵循国际劳工统计学家会议(ICLS)的定义标准,对各国的原始调查微观数据进行统一协调与标准化处理,从而确保了跨国家、跨年份数据的一致性与可比性。数据集涵盖了29个非洲国家,时间跨度从2003年至2025年,共计5,679条观测记录。每条记录均包含详细的数据来源标注,便于用户追溯数据的原始出处与调查方法。
特点
该数据集的核心特点在于其精细的多维分类结构,提供了按性别、教育程度和婚姻状况交叉分组的劳动力利用不足复合率(LU4)数据。除时间序列和地理维度外,数据集还包含sex、classif1(教育)与classif2(婚姻状况)等分类变量,使得研究者能够深入剖析不同社会人口群体间的劳动力市场差异。数据质量方面,依托ILO官方机制,当同一国家同年份存在多个数据来源时,默认采用ILO选定的“最佳来源”;同时,观测值附有状态标记,如“不可靠”等,为用户评估数据可信度提供了依据。
使用方法
用户可通过HuggingFace的datasets库便捷地加载此数据集,只需执行`load_dataset("electricsheepafrica/africa-ilo-luu-xlu4-sex-edu-mts-rt-composite-rate-of-labour-underutilization-lu4-by-s")`即可获得一个可直接使用的数据集对象。随后可轻松转换为Pandas DataFrame进行深入分析。典型的使用场景包括:依据`ref_area`字段筛选特定国家的数据以进行国别研究;利用`time`和`obs_value`字段绘制单一指标的长时间序列变化图;或通过透视表操作(pivot_table)构建以年份为行、国家为列的观测值矩阵,便于进行跨国比较分析。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门(ILOSTAT)在2025年发布,并由Electric Sheep Africa于HuggingFace平台重新封装整理。数据集聚焦于非洲29个国家2003至2025年间劳动力利用不足的复合率(LU4),按性别、教育程度和婚姻状况进行细分,包含5679条观测记录。作为全球劳动统计的权威来源,ILOSTAT通过整合各国劳动力调查、家庭收入调查等微观数据,为非洲劳动力市场的结构性问题提供了标准化、可比较的测量工具。该数据集的推出填补了非洲区域劳动力利用不足多维分解数据的空白,尤其为性别不平等、教育回报率及婚姻状况对就业质量影响的实证研究奠定了数据基础,对发展经济学、劳动经济学以及国际发展政策评估具有重要影响力。
当前挑战
该数据集面临的核心领域挑战在于劳动力利用不足(LU4)这一复合指标的统计口径统一问题——非洲各国在调查方法、数据采集时点及问卷设计上存在显著差异,ILO虽通过国际劳动统计学家会议(ICLS)定义进行协调,但部分国家数据因方法修订出现序列断裂(如注释中标注的'Break in series'),直接影响时间序列分析的可比性。构建过程中,数据整合面临来源多样性带来的质量挑战:同一国家同一指标可能存在多个调查来源,ILO需筛选'最佳来源',但部分观测值被标记为'不可靠';此外,教育分类的非标准化(如非标准教育水平纳入)和婚姻状况的聚合层次差异导致细分维度缺失或含义模糊,增加了数据清洗与跨国家比较的复杂性。
常用场景
经典使用场景
在劳动经济学与非洲发展研究领域,该数据集作为衡量劳动力利用不足程度的综合性指标(LU4),为学者提供了跨越29个非洲国家、时间跨度从2003年至2025年的宝贵观测样本。其最典型的应用场景在于构建时间序列模型,以揭示不同性别、教育背景和婚姻状况群体在劳动力市场中的结构性差异。研究者可通过此数据集追踪特定国家或区域劳动力利用不足率的长期演变趋势,并利用其包含的丰富分类维度(如性别、教育层次)进行多因素交叉分析,从而精准识别出那些在就业市场中最为脆弱的群体。数据的高时间分辨率和地理覆盖度,使其成为分析非洲劳动力市场动态、评估宏观经济政策干预效果以及比较不同国家间劳动力吸纳能力的理想起点。
解决学术问题
该数据集精准回应了发展经济学中一个核心且长期悬而未决的学术难题:如何超越传统的失业率指标,全面衡量非洲劳动力市场中的资源错配与人力资本浪费。传统的失业率经常低估非洲普遍存在的就业不足、隐形失业和劳动时间被迫缩短等现象,而LU4综合比率则巧妙地将这些维度的劳动力利用不足纳入统一框架。通过提供按性别、教育水平和婚姻状况细分的微观数据,该数据集使得研究者能够检验人力资本理论、劳动力市场歧视理论以及家庭经济决策模型在非洲语境下的适用性。其重要意义在于,不仅揭示了非洲大陆劳动力利用不足的真实规模与结构性特征,还为设计更具包容性的就业政策提供了实证基础,推动了关于体面劳动与可持续发展目标的学术讨论走向深入。
衍生相关工作
围绕该数据集的核心指标LU4,学术界已经衍生出若干重要的研究方向与经典工作。最直接的衍生路径是将其作为因变量,构建面板数据回归模型,探索影响非洲劳动力利用不足的关键驱动因素,如经济全球化程度、教育投资回报、制度质量或政治稳定性。另一类经典工作致力于将LU4与传统的失业率、就业率指标进行对比研究,通过计量方法剥离出就业不足的独立影响,由此催生了关于劳动力市场‘隐形闲置’的丰富理论文献。此外,该数据的多维度分类特性激励了机器学习领域的研究者,尝试利用梯度提升树或循环神经网络等算法,基于历史序列预测未来数年的LU4变动趋势,这些预测模型被广泛应用于发展规划和国际援助的战略制定之中。最后,针对该数据质量标记(如不可靠观测值的标注),也引发了关于非洲统计能力建设和调查方法论改进的学术讨论。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务