遇见数据集

electricsheepafrica/africa-ilo-how-temp-sex-eco-edu-nb-mean-weekly-hours-actually-worked-per-employed-per

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含218,158个观测值,覆盖41个非洲国家,时间跨度为1991年至2025年,专注于“工作时长”指标。具体指标为“HOW_TEMP_SEX_ECO_EDU_NB”,即按性别、经济活动和教育划分的就业人员平均每周实际工作时间。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤为非洲国家。数据集结构包括国家代码、指标代码、性别分类、经济活动和教育分类变量、观测年份、观测值及其状态标志等列,适用于表格分类、回归和时间序列预测任务。数据集旨在提供非洲地区劳动力市场的工作时间统计分析,支持研究和机器学习应用。

This dataset contains 218,158 observations across 41 African countries, spanning from 1991 to 2025, focusing on the Hours of work indicator. The specific indicator is HOW_TEMP_SEX_ECO_EDU_NB, which represents the mean weekly hours actually worked per employed person, disaggregated by sex, economic activity, and education. The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), retrieved via API and filtered to African countries. The dataset schema includes columns such as country code, indicator code, sex classification, economic activity and education classification variables, observation year, observed value, and status flags. It is designed for tabular classification, regression, and time-series forecasting tasks, providing statistical analysis of working hours in African labor markets for research and machine learning applications.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-how-temp-sex-eco-edu-nb-mean-weekly-hours-actually-worked-per-employed-per 数据集图片
构建方式
该数据集由Electric Sheep Africa团队通过ILOSTAT REST API直接获取,原始数据源自国际劳工组织(ILO)的中央统计数据库。ILOSTAT基于国际劳工统计学家会议(ICLS)定义,对各国劳动力调查、家庭收入调查、企业调查及行政记录等微观数据进行协调处理。数据集构建过程首先从API端点提取指标ID为HOW_TEMP_SEX_ECO_EDU_NB的原始观测值,随后依据非洲ISO3国家代码进行地理范围筛选,最终整合为包含218,158条观测记录的表格数据集。数据以Parquet格式存储,并标注了原始数据来源的source.label字段以确保可追溯性。
特点
该数据集聚焦非洲大陆的劳动工时议题,涵盖1991年至2025年间41个非洲国家的观测数据,具有长时序、广地域的特征。核心指标为按性别、经济活动部门及教育程度分层的每周实际工作平均小时数,反映了非洲劳动力市场的多元结构。数据按年度频率发布,通过sex、classif1、classif2等维度提供精细化的分层信息,支持从总览到细分群体的多层级分析。数据集还包含了观测状态标志和注释字段,便于用户识别数据的可靠性及特殊情况,整体上体现了高覆盖度、结构化与可解释性的特点。
使用方法
用户可通过HuggingFace Datasets库的load_dataset()函数直接加载该数据集,并将其转换为Pandas DataFrame进行后续操作。基本使用包括调用ds['train'].to_pandas()获取全量数据,随后可依据ref_area字段筛选特定国家的子集,例如提取肯尼亚(KEN)的观测数据用于国别分析。对于时间序列研究,可按indicator字段过滤出目标指标,再按时序排列并以obs_value列进行可视化或趋势建模。此外,利用pivot_table函数可将数据重塑为国家×年份的矩阵形式,便于进行跨国的比较与面板数据分析。代码示例清晰,衔接了数据加载、过滤与重排的典型工作流。
背景与挑战
背景概述
在劳动力经济学与公共政策研究领域,工作时间的精准测度是评估劳动市场健康状况、性别平等进展及人力资本配置效率的核心指标。为应对非洲大陆长期存在的劳动统计数据碎片化与可获取性不足的困境,国际劳工组织(ILO)通过其ILOSTAT数据库,自1991年起系统收集并发布了覆盖41个非洲国家的“按性别、经济活动与教育程度划分的受雇人员周实际工作小时均值”数据集。该数据集由Electric Sheep Africa于2025年重新整合并托管于HuggingFace平台,包含逾21.8万条观测记录,旨在为研究者与政策制定者提供标准化的时序与分类数据,以推动非洲劳动力市场的量化分析、跨国比较及可持续发展目标(SDGs)的跟踪评估。
当前挑战
该数据集所应对的领域问题主要源于非洲劳动力市场的复杂性与数据鸿沟:多数国家的劳动力调查频次不均、定义标准不一,导致对实际工作强度、性别分工差异及教育回报率的准确估算面临障碍。在构建过程中,亟需克服的挑战包括:跨国家跨年度数据的元数据对齐,需将各国采用不同国际劳动统计学家会议(ICLS)定义的微观调查数据通过统一指标编码(如HOW_TEMP_SEX_ECO_EDU_NB)进行归一化处理;多源数据融合时的‘最优来源’选择逻辑(同一国家同一时点存在多个数据集时仅保留ILO标定版本),可能引入选择偏差;此外,来自不同国家不同年份的观测状态标识(如provisional或unreliable)反映了原始数据质量参差不齐,如何在保留统计效力的同时向用户透明标注可靠性,亦是数据重打包过程中的关键技术考验。
常用场景
经典使用场景
该数据集汇聚了国际劳工组织ILOSTAT数据库中关于非洲41个国家、横跨1991至2025年间的平均每周实际工作小时数,按性别、经济活动部门和教育水平进行了精细分层。其经典使用场景在于构建面板数据模型,以解析非洲劳动力市场的时间配置结构。研究者可借助该数据集剖析不同性别、教育背景及行业类别下劳动者的工时差异,探究经济增长、产业结构变迁与工作时间长度之间的动态关联。无论是进行描述性统计、固定效应回归还是时间序列分解,该数据集都提供了高时间分辨率与多维度交叉的观测基础。
实际应用
实际应用层面,该数据集可为非洲各国劳动政策制定者与跨国发展机构提供科学决策依据。通过监测各行业、各群体工时的年度动态,政府能够评估劳动法规执行效果、识别超时劳动的潜在风险群体,并针对性地设计促进体面劳动的政策工具。国际组织如ILO和世界银行亦可利用该数据跟踪可持续发展目标中有关体面工作与经济增长的指标进展。此外,企业和投资者在评估非洲市场劳动力成本与生产效率时,可将分行业、分性别的工时数据融入区位选择与人力资源规划模型,从而提升决策的针对性与准确性。
衍生相关工作
基于该数据集,研究者已衍生出一系列具有代表性的学术工作。典型方向包括利用面板数据构建的劳动生产率与工时关系的跨国实证分析,探讨非洲国家工业化进程中工作时间的收敛性趋势。另一类衍生工作聚焦于性别视角,结合教育分层数据,分析女性劳动参与率提升对家庭内部分工与宏观经济产出的影响。此外,有学者将该数据集与非洲企业的微观调查数据匹配,构建多层级模型以探究企业异质性对工时波动的作用机制。这些衍生研究不仅深化了对非洲劳动市场运行规律的理解,也推动了计量经济学方法在稀缺数据场景下的创新应用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务