遇见数据集

electricsheepafrica/africa-ilo-how-xees-sex-ocu-edu-nb-mean-weekly-hours-actually-worked-per-employee-by

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的非洲国家劳动统计数据,具体指标为员工按性别、职业和教育程度划分的平均每周实际工作时间。数据集涵盖38个非洲国家,时间跨度为1991年至2025年,共包含99,157个观测值。数据提供了按性别(总计、男性、女性)、职业技能水平和教育程度聚合水平等维度细分的员工平均每周实际工作时间统计,适用于表格分类、回归和时间序列预测等任务。

This dataset contains labor statistics from the International Labour Organization (ILO) ILOSTAT database for African countries, specifically the indicator Mean weekly hours actually worked per employee by sex, occupation and education. It covers 38 African countries from 1991 to 2025, with 99,157 observations. The data provides statistics on average weekly hours actually worked per employee, disaggregated by dimensions such as sex (total, male, female), occupation skill level, and education aggregate level, suitable for tasks like tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-how-xees-sex-ocu-edu-nb-mean-weekly-hours-actually-worked-per-employee-by 数据集图片
构建方式
本数据集源自国际劳工组织(ILO)旗下的ILOSTAT中央统计数据库,通过REST API接口直接抽取指标代码为HOW_XEES_SEX_OCU_EDU_NB的原始数据,并依据非洲ISO3国家代码进行过滤与整合。数据经ILO统计部门依据国际劳工统计学家会议(ICLS)定义进行统一调和,原始调查微观数据来源在source.label字段中予以标注,最终由Electric Sheep Africa团队重新封装为Parquet格式,形成可供机器学习直接调用的结构化数据集。
特点
该数据集涵盖1991至2025年间38个非洲国家的99,157条观测记录,核心指标为按性别、职业与教育程度划分的雇员平均每周实际工作小时数。数据不仅包含sex、classif1、classif2等多维分类维度,还附带了观测状态标志、系列断裂注释等质量元信息,便于用户进行数据筛选与异常识别。年度频率的时间跨度与丰富的国家覆盖,使其成为研究非洲劳动力市场时空演变与劳动强度差异的宝贵资源。
使用方法
用户可通过HuggingFace Datasets库的load_dataset函数一步加载数据,并转换为Pandas DataFrame进行后续分析。典型的应用包括按国家筛选子集、以时间为轴对单一指标进行时序可视化、以及透视构建国家×年份的观测值矩阵。数据集中obs_value列直接提供数值型目标变量,适用表格分类、回归乃至时间序列预测等多种任务场景,极大降低了非洲劳动统计数据的获取与预处理门槛。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年通过ILOSTAT数据库发布,并由Electric Sheep Africa重新封装至HuggingFace平台。其核心研究问题聚焦于非洲38个国家1991年至2025年间,按性别、职业和受教育程度划分的雇员平均每周实际工作小时数,共包含99,157条观测数据。ILOSTAT作为全球劳动统计的权威来源,基于国际劳工统计学家会议(ICLS)定义对各国劳动力调查数据进行协调统一,为研究非洲劳动力市场结构、性别平等与教育回报等议题提供了关键微观数据支撑。该数据集通过标准化的分类维度,使得跨国家、跨时间段的比较分析成为可能,对劳动经济学、发展经济学以及国际政策评估领域具有重要影响力。
当前挑战
该数据集所解决的领域问题在于,非洲地区劳动力市场数据长期存在碎片化、不一致和缺失的挑战,难以支持精细化的政策分析与学术研究。具体挑战包括:1)多国数据源的异质性——38个非洲国家的原始调查在设计、抽样方法及统计口径上存在显著差异,ILOSTAT虽进行了协调,但数据质量标注(如“不可靠”状态)仍需谨慎处理。2)时间序列的稀疏性与覆盖缺口——部分国家仅覆盖少数年份,且1991年至2025年间的数据不连续,给长期趋势建模带来困难。3)分类维度的兼容性——性别、职业和教育的交叉分类往往存在大量缺失值,制约了多因素交互分析的深度。4)数据集成与重封装的工程技术挑战——从ILO的REST API批量拉取并过滤至非洲国家ISO代码,需保证数据溯源完整,同时在Pandas与HuggingFace Datasets间实现高效转换,确保机器学习就绪的格式一致性。
常用场景
经典使用场景
在劳动经济学与计算社会学领域,该数据集最为经典的使用场景在于构建基于性别、职业与教育水平的多维劳动供给时间预测模型。由于数据涵盖了非洲38个国家长达35年的面板观测,研究者可借助该数据深入剖析“教育与职业选择如何调节性别对每周实际工作时长的影响”这一核心议题。典型做法是将`sex`、`classif1`(职业技能等级)与`classif2`(教育聚合等级)作为核心解释变量,以`obs_value`(平均实际周工时)为响应变量,通过固定效应模型或分位数回归揭示不同社会群体的劳动时间异质性。这些分析为理解非洲劳动力市场的结构性分化提供了量化基础。
解决学术问题
该数据集有效回应了发展中地区劳动统计领域长期面临的“粒度缺失”与“地域覆盖不均”两大难题。在学术层面,它解决了在过去难以获取的按性别、职业与教育维度交叉细分的非洲周工时连续观测序列问题。借助ILOSTAT统一协调的定义与最佳来源选择机制,研究者可以克服各国因调查方法差异造成的统计口径不一致,从而开展可信的跨国比较。这一数据集极大地推动了诸如“教育投资回报在工作时间维度上的性别差异”、“职业隔离对劳动强度的长期影响”等经典发展经济学问题的实证检验,为国际劳工组织的体面劳动目标评估提供了关键的量化依据。
衍生相关工作
围绕该数据集,学术界与开源社区已衍生出一系列经典工作。首先,在时间序列预测方向,研究者利用此逐年的平均工时观测,构建了基于Prophet或LSTM的短期劳动供给预报模型,用以模拟不同宏观增长情境下非洲各国务工群体的工时演化趋势。其次,在结构性分析与归因领域,学者将该数据与ILOSTAT平台内的失业率、非正规就业占比等指标进行关联,通过结构方程模型或聚类分析揭示工时分化背后的制度与教育驱动机制。最后,数据重打包方Electric Sheep Africa也基于该数据集推动了非洲ML-Ready数据层标准化的示范,促使更多跨界研究能够以低门槛方式复现劳动经济学领域的跨国比较分析。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务