遇见数据集

electricsheepafrica/africa-ilo-ged-xlu4-sex-hht-chl-rt-prime-age-composite-rate-of-labour-underutilizatio

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的其他劳动力未充分利用指标数据,具体为按性别、户型和儿童存在情况划分的黄金年龄复合劳动力未充分利用率(LU4)。数据集涵盖24个非洲国家,时间范围为2005年至2024年,共6,386个观测值。数据通过ILOSTAT REST API获取,并经过非洲国家代码过滤,包含国家、指标、性别分类、年份、观测值等列,适用于表格分类、回归或时间序列预测任务。数据由Electric Sheep Africa重新打包,以提供一致、机器学习友好的格式。

This dataset contains Other measures of labour underutilization data from the International Labour Organization (ILO) ILOSTAT database, specifically the Prime-age composite rate of labour underutilization (LU4) by sex, household type and presence of children. It covers 24 Africa countries from 2005 to 2024, with 6,386 observations. Data is sourced via the ILOSTAT REST API and filtered to Africa ISO3 country codes, including columns such as country code, indicator, sex classification, year, and observed value, suitable for tabular classification, regression, or time-series forecasting tasks. The dataset is repackaged by Electric Sheep Africa to provide a consistent, ML-ready format.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-ged-xlu4-sex-hht-chl-rt-prime-age-composite-rate-of-labour-underutilizatio 数据集图片
构建方式
本数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,通过调用其REST API接口(https://rplumber.ilo.org/data/indicator?id=GED_XLU4_SEX_HHT_CHL_RT)直接获取原始数据,并依据非洲ISO3国家代码进行地理过滤,最终由Electric Sheep Africa平台重新打包整理。ILOSTAT利用国际劳工统计学家会议(ICLS)定义对各国劳动力调查微观数据进行标准化处理,确保数据的一致性与可比性。数据集以Parquet格式封装,提供清晰的列式结构与标注来源(source.label)以增强可追溯性,共收录6386条观测记录,覆盖24个非洲国家,时间跨度为2005年至2024年。
特点
该数据集聚焦于‘黄金年龄劳动利用不足综合率(LU4)’这一关键指标,并按照性别、家庭类型及有无6岁以下儿童三个维度进行精细分类。数据高度结构化,包含23个字段,如国别代码(ref_area)、数据来源(source)、指标定义(indicator)、观测值(obs_value)及状态标记(obs_status)等,便于直接用于面板数据分析或时间序列建模。其独特之处在于提供了统一的、跨国家的可比劳动力利用不充分衡量标准,填补了非洲区域在此类精细分层数据上的空白,同时标注了数据质量标记(如不可靠值U),为用户进行数据清洗与质量评估提供了依据。
使用方法
用户可通过HuggingFace Datasets库的load_dataset()函数一键加载该数据集,并将其转换为Pandas DataFrame进行后续分析。例如,可对特定国家(如肯尼亚)进行筛选,或针对单一指标(GED_XLU4_SEX_HHT_CHL_RT)按年份排序以绘制时间序列图。此外,利用pivot_table功能可将数据重塑为国家×年份的矩阵形式,便于进行横向比较或构建面板回归模型。数据预览、条件过滤以及多维分类变量的交叉分析均能通过简洁的Python代码高效实现,适合经济学家、政策研究者及机器学习从业者直接用于回归预测或统计分析任务。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2024年通过其ILOSTAT数据库构建,经Electric Sheep Africa整理后发布于HuggingFace平台,专门针对非洲24个国家2005至2024年间劳动力利用不足的复合率(LU4)进行度量。核心研究问题聚焦于通过性别、家庭类型及幼儿存在情况等多维度分解,揭示非洲劳动力市场中的隐性失业与就业不足现象。作为ILOSTAT全球劳动力统计体系的关键子集,该数据集弥补了非洲大陆在高频、可比性的劳动力利用指标方面的空白,为追踪可持续发展目标(SDG)中的体面劳动指标提供了可靠的数据基础,对发展经济学与劳动政策研究具有重要推动力。
当前挑战
该数据集面临的领域问题挑战在于,非洲地区广泛存在的非正规经济与低质量就业使得传统失业率指标难以全面反映劳动力利用不足的真实状况,LU4复合率需整合未被充分就业、时间相关就业不足及潜在劳动力等多元维度,这对统计口径的标准化与跨国产出可比性提出极高要求。构建过程中遭遇的挑战包括:各国劳动力调查的抽样方案、问卷设计及数据采集频率差异显著,导致跨时间与跨国家的一致性受损;部分国家因政治动荡或资源限制导致数据缺失,例如安哥拉仅提供2019年单一年份观测;此外,ILO需对多元来源进行“最佳来源”筛选与微数据调和,处理过程中产生的数据质量标记(如U表示不可靠值)进一步增加了建模与分析的复杂性。
常用场景
经典使用场景
在劳动经济学与非洲发展研究的交叉领域中,该数据集的核心用途在于构建劳动利用不足率的时序分析与跨国比较模型。研究者可借助其涵盖24个非洲国家、跨越2005至2024年的6,386条观测记录,针对青壮年群体(prime-age)的综合劳动利用不足率(LU4)进行细粒度建模。数据按性别、家庭类型及六岁以下儿童的存在状况进行分层,使得分析维度极为丰富。典型工作流程包括通过时间序列预测揭示各国劳动市场疲软的演变轨迹,或利用面板回归识别影响劳动利用不足的结构性因素。数据集的高频更新与标准化编码特性,也使其成为评估非洲各国可持续发展目标(SDG)中体面劳动进展情况的理想基准资源。
实际应用
在实际决策层面,该数据集为国家劳动政策制定与国际发展援助机构提供了循证工具。政府劳动部门可借助分性别、分家庭类型的LU4时序数据,精准识别劳动力闲置最为严重的群体与地区,从而设计更具靶向性的就业促进计划。例如,当数据显示有六岁以下儿童的家庭中女性劳动利用不足率显著偏高时,政策制定者可据此推出普惠性幼托服务以释放潜在劳动力。国际组织如世界银行或非洲开发银行可将该数据集纳入其劳动力市场监测平台,动态评估项目干预效果。此外,非政府组织在开展农村生计改善项目时,也能通过该数据筛选出劳动利用不足程度最高的国家或区域,优化资源投放优先级。
衍生相关工作
围绕该数据集已孵化出多项具有影响力的衍生工作。在学术领域,研究者基于该数据构建了非洲多国劳动市场面板数据库,并衍生出预测劳动利用不足率的机器学习模型。例如,有工作利用随机森林与梯度提升算法,结合宏观经济指标对LU4进行超前预测,其结论被用于评估新冠疫情对非洲女性劳动力的非对称冲击。在数据产品层面,Electric Sheep Africa团队以此为核心数据源,进一步开发了标准化程度更高的非洲劳动统计集成数据集,降低了多源异构数据的整合门槛。还有研究利用该数据验证了家庭结构变迁与劳动利用效率之间的因果联系,相关成果发表在劳动经济学的权威期刊上,有力推动了非洲劳动统计的二次分析与知识再生产。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务