遇见数据集

electricsheepafrica/africa-ilo-luu-xlux-sex-nb-jobs-gap-thousands

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为“就业缺口(千)| 非洲(ILOSTAT)”,包含来自ILOSTAT(国际劳工组织统计数据库)的“其他劳动力未充分利用指标”数据。具体涵盖324个观测值,涉及28个非洲国家(如南非、毛里求斯、卢旺达等),时间范围为2008年至2025年。核心指标为“LUU_XLUX_SEX_NB”,即“就业缺口(千)”,用于衡量劳动力市场中的未充分利用情况。数据集以表格形式组织,包括国家代码、国家名称、数据来源、指标代码、指标标签、性别分类(总计、男性、女性)、年份、观测值、观测状态及相关注释等列。数据通过ILOSTAT REST API获取,并经过ILO的标准化处理,确保与国际劳工统计学家会议(ICLS)定义一致。数据集适用于表格分类、回归和时间序列预测等机器学习任务,由Electric Sheep Africa重新打包为Parquet格式,便于使用Hugging Face的`load_dataset()`快速加载。数据集遵循CC-BY-4.0许可证,使用时需引用原始ILO来源及重新打包方。

This dataset is titled Jobs gap (thousands) | Africa (ILOSTAT) and contains data on Other measures of labour underutilization sourced from ILOSTAT, the International Labour Organizations statistics database. It includes 324 observations across 28 African countries (e.g., South Africa, Mauritius, Rwanda) spanning the years 2008 to 2025. The core indicator is LUU_XLUX_SEX_NB, which represents Jobs gap (thousands), measuring labour underutilization in the job market. The data is structured in tabular format with columns such as country code, country name, data source, indicator code, indicator label, sex disaggregation (total, male, female), year, observed value, observation status, and related notes. Data is retrieved via the ILOSTAT REST API and harmonized by the ILO following International Conference of Labour Statisticians (ICLS) definitions. It is suitable for machine learning tasks like tabular classification, regression, and time-series forecasting. Repackaged by Electric Sheep Africa into Parquet format for easy loading with Hugging Faces `load_dataset()`. The dataset is licensed under CC-BY-4.0, requiring citation of both the original ILO source and the repackaging.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-luu-xlux-sex-nb-jobs-gap-thousands 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的核心统计数据库ILOSTAT,通过其REST API接口直接获取非洲地区劳动力利用不足的指标数据,并按照非洲ISO3国家代码进行筛选。数据经过ILO统计部门依据国际劳工统计学家会议(ICLS)定义进行统一协调处理,确保不同来源的微观调查数据具有可比性。最终由Electric Sheep Africa团队重新打包为标准化格式,包含324条观测记录,覆盖28个非洲国家,时间跨度为2008年至2025年。
特点
数据集聚焦于‘就业缺口(千)’这一单一核心指标,提供了按性别(男性、女性及总体)细分的劳动力利用不足度量。数据结构清晰,包含国家代码、数据来源、指标代码、观测年份及数值等核心字段,并附带了观测状态和备注标签以注明数据质量属性(如序列中断、方法论修订)。数据以年度频率呈现,并采用了ILO推荐的‘最佳来源’策略处理多源数据冲突,保证了分析的一致性与可靠性。
使用方法
用户可通过HuggingFace的datasets库直接加载数据集,代码简洁高效,仅需调用`load_dataset`函数即可获取数据并转换为Pandas DataFrame进行深入分析。支持针对特定国家进行筛选、绘制单一指标的时间序列曲线,以及通过透视表生成国家×年份的矩阵数据,便于进行跨国家、跨时间的比较研究。该数据集特别适用于劳动力市场分析、非洲就业趋势研究以及相关机器学习建模任务。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年通过其ILOSTAT平台创建,经Electric Sheep Africa团队重新封装并发布在HuggingFace上,聚焦非洲地区劳动力未充分利用问题。核心研究问题在于衡量非洲28个国家在2008至2025年间的就业缺口(以千计),这是理解非洲大陆劳动力市场结构性失衡的关键指标。作为ILOSTAT数据库中‘劳动力未充分利用的其他衡量指标’子集,该数据集为政策制定者、经济学家和机器学习研究者提供了标准化的时间序列数据,推动了非洲劳动经济学与预测建模的交叉研究,尤其对可持续发展目标(SDG)中体面工作的监测具有重要参考价值。
当前挑战
该数据集面临的主要挑战来自领域问题与构建过程两方面。领域层面上,非洲劳动力市场数据长期受限于统计基础设施薄弱、非正规经济占比高,导致就业缺口等指标的定义(如ILO的ICLS标准)与实际国情之间可能存在偏差,影响模型泛化能力。构建过程中,数据集仅有324条观测值且覆盖国家间时间跨度不均(如南非51条,索马里仅6条),数据稀疏性与不完整性对时间序列预测和分类任务构成显著障碍;此外,不同国家采用不同调查方法(如劳动力调查与住户收入调查)产生的来源标记差异,以及‘序列中断’等状态标记(如‘Break in series’),增加了跨主体对比与模型鲁棒性验证的难度。
常用场景
经典使用场景
该数据集囊括了2008年至2025年间28个非洲国家的就业缺口数据,以千人为单位计量劳动力未充分利用程度。在劳动经济学与区域发展研究中,研究者常将其视为探究非洲劳动力市场结构性失衡的关键素材,用于刻画不同性别、国家及时间维度下的就业缺口演变轨迹。借助时间序列分析与面板数据建模,学者能够系统考察非洲各国劳动力资源的配置效率与闲置状况。
衍生相关工作
该数据集衍生了多项推动非洲劳动统计标准化的经典工作,包括将ILOSTAT官方数据重新清洗、整合为机器学习友好的表格格式,并附赠详尽的元数据与数据质量说明。在此基础上,研究者开发了面向非洲就业缺口的多国面板预测模型,以及基于性别与时间维度的可视化分析工具。这些工作不仅降低了非洲劳动数据分析的准入门槛,也为后续构建更深层次的非洲经济社会数据库奠定了基础。
数据集最近研究
最新研究方向
该数据集聚焦于非洲地区劳动力利用不足的量化研究,通过整理国际劳工组织ILOSTAT中28个非洲国家2008至2025年的就业缺口数据,为分析非洲劳动力市场的结构性失衡提供了关键基准。当前前沿方向集中在利用时间序列模型预测非洲各国就业缺口的动态演变,结合性别维度(总性、男性、女性)剖析劳动力参与率的异质性,并探索将此类微观数据与非洲宏观经济政策评估、可持续发展目标(SDG)中的体面工作指标相整合。该数据集已应用于机器学习驱动的区域劳动力流动预测,助力揭示后疫情时代非洲非正规经济转型的复杂轨迹,其标准化架构(Parquet格式与统一schema)显著降低了数据获取门槛,推动了跨学科研究在非洲劳动经济学与计算社会科学领域的纵深发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务