遇见数据集

electricsheepafrica/africa-ilo-luu-xlu4-sex-geo-rt-composite-rate-of-labour-underutilization-lu4-by-s

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含关于非洲劳动力未充分利用复合率(LU4)的统计数据,按性别和城乡地区划分(百分比)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,覆盖27个非洲国家,时间跨度为2003年至2025年,共包含915个观测值。数据集聚焦于一个核心指标:LUU_XLU4_SEX_GEO_RT,即按性别和城乡地区划分的劳动力未充分利用复合率。数据以表格形式组织,包括列如国家代码(ref_area)、年份(time)、观测值(obs_value)、性别分类(sex)等,并提供了数据来源、质量说明(如年度频率、最佳来源选择)和使用示例。数据集由Electric Sheep Africa重新打包,旨在为非洲提供统一的、机器学习就绪的数据层,适用于表格分类、回归和时间序列预测等任务。

This dataset contains statistical data on the composite rate of labour underutilization (LU4) in Africa, disaggregated by sex and rural/urban areas (%). The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), covering 27 African countries from 2003 to 2025, with 915 observations. It focuses on a single core indicator: LUU_XLU4_SEX_GEO_RT, which represents the composite rate of labour underutilization by sex and rural/urban areas. The data is organized in tabular format, including columns such as country code (ref_area), year (time), observed value (obs_value), sex classification (sex), among others, and provides information on data sources, quality notes (e.g., annual frequency, best source selection), and usage examples. Repackaged by Electric Sheep Africa, the dataset aims to offer a unified, ML-ready data layer for Africa, suitable for tasks like tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-luu-xlu4-sex-geo-rt-composite-rate-of-labour-underutilization-lu4-by-s 数据集图片
构建方式
该数据集依托国际劳工组织(ILO)权威统计数据库ILOSTAT,通过其REST API接口直接获取原始指标数据,并严格筛选出非洲ISO3国家代码所对应的观测记录。为确保数据质量与可比性,ILOSTAT采用国际劳工统计学家会议(ICLS)定义对各国劳动力调查微观数据进行统一协调与标准化处理,并在source.label列中标注每项数据的原始来源,实现全程可追溯。数据集最终以Parquet格式封装,经Electric Sheep Africa重新整理后发布,支持通过HuggingFace Datasets库一键加载。
特点
数据集汇集了2003年至2025年间27个非洲国家的915条观测记录,聚焦于劳动力利用不足的综合率(LU4),并按性别(男性、女性、总计)及城乡地域(国家、农村、城市地区)进行精细分层。所有指标均源自ILO官方发布的‘其他劳动力利用不足衡量标准’系列,数据涵盖时间跨度长、地理覆盖广,且附有观测状态标记(如可靠性等级)及系列中断等注释信息,为时间序列分析与跨国比较提供了高质量、结构化且具备统计一致性的基础。
使用方法
用户可通过HuggingFace Datasets库的load_dataset函数直接加载该数据集,返回的DataFrame包含国家代码、性别、地域分类、年份及观测值等关键字段。适用于利用pandas进行数据筛选,例如按国家代码过滤特定国家的子集,或按指标排序构建时间序列并进行可视化分析。亦可使用pivot_table方法将数据重塑为国家×年份矩阵,便于面板数据建模或跨区域比较。数据集兼容表格分类、回归及时间序列预测等多种任务场景,为非洲劳动力市场研究提供了便捷的机器学习就绪数据接口。
背景与挑战
背景概述
劳动力利用不足的综合度量是评估非洲劳动力市场健康状况的关键指标,超越了传统的失业率概念,涵盖了包括潜在劳动力与时间相关就业不足在内的更广泛群体。该数据集由国际劳工组织(ILO)通过其核心统计数据库ILOSTAT发布,并由Electric Sheep Africa于2025年重新包装整理,专注于非洲大陆27个国家从2003年至2025年的LU4(劳动力利用不足综合率)数据,按性别和城乡地域细分。核心研究问题在于揭示非洲不同地区劳动力未充分利用的结构性差异,为制定精准的就业政策提供量化基础。该数据集在劳动经济学和可持续发展目标(SDG)监测领域具有重要影响力,为跨时空比较非洲劳动力市场动态提供了统一且标准化的数据源。
当前挑战
该数据集所解决的领域问题挑战在于,传统失业率指标在非洲普遍存在的非正规经济和低劳动参与率情境下严重低估了劳动力市场的真实困境,LU4指标能够更全面刻画劳动力利用不足的复杂形态。构建过程中面临多重挑战:第一,非洲各国的劳动力调查覆盖频率、问卷设计和统计标准存在显著差异,ILO通过ICLS定义进行数据协调,但部分观测值仍带有“不可靠”状态标记;第二,数据源多样性导致同一国家不同年份可能采用不同调查方法,引入序列断裂风险;第三,城乡和性别维度的精细化分解导致样本量稀疏,27个国家共915个观测点难以支撑高粒度时空模型,且部分国家数据点仅有数年记录,限制了纵向分析的稳健性。
常用场景
经典使用场景
该数据集收录了2003年至2025年间非洲27个国家的915条复合劳动力利用不足率(LU4)观测数据,并按照性别和城乡地域进行了精细分层。其最经典的使用场景在于开展非洲地区劳动力市场的结构性分析,研究人员可借助该数据集比较不同国家及性别群体间的劳动力闲置状况,并追踪其随时间演变的轨迹。数据集简洁的结构使其尤其适用于构建面板数据模型,进而评估宏观经济政策、教育投资或城镇化进程对劳动力有效配置的影响。
衍生相关工作
该数据集的衍生工作包括构建非洲劳动力闲置预测模型,融合时间序列分析方法以提前预警就业风险。已有研究利用其面板结构,建立多国劳动力利用不足率的动态聚类,识别出不同国家在劳动力市场韧性方面的同质性与异质性。此外,结合遥感影像或教育普查数据,学者开发了跨领域的机器学习模型,探讨城市化水平与劳动力利用不足之间的非线性关系。在开源生态中,该数据集还催生了标准化的数据清洗与批处理工具库,大幅降低了非洲劳动数据复用的门槛。
数据集最近研究
最新研究方向
该数据集聚焦于非洲地区劳动力利用不足的综合衡量指标(LU4),按性别与城乡区域进行分层统计,为深入解析非洲大陆劳动力市场的结构性失衡提供了关键数据支撑。当前前沿研究方向主要集中在结合时序预测模型与面板数据回归分析,以揭示南非、卢旺达等27个非洲国家从2003年至2025年间劳动力资源错配的动态演变规律。特别是在新冠疫情与全球供应链重构的背景下,该数据集成为评估非洲国家就业恢复韧性、性别就业差距演化以及城市化进程中农村劳动力转移效率的热点研究基础,为国际劳工组织推动的体面劳动目标(SDG 8)在非洲本土化实施提供了精准的量化监测工具。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务