遇见数据集

electricsheepafrica/africa-ilo-how-xees-sex-ec2-nb-mean-weekly-hours-actually-worked-per-employee-by

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为“按性别和经济活动划分的员工平均每周实际工作时间 - ISIC二级分类 | 非洲(ILOSTAT)”,是一个表格型数据集,专注于非洲地区的劳动统计。它包含28,647个观测值,覆盖40个非洲国家,时间跨度为1996年至2025年。数据集的核心指标是“HOW_XEES_SEX_EC2_NB”,即按性别和经济活动(基于国际标准产业分类ISIC的二级分类)划分的员工平均每周实际工作时间。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,该数据库通过ICLS(国际劳工统计学家会议)定义对原始调查微数据进行标准化处理。数据集包含多个列,如国家代码、国家名称、数据来源、指标代码、指标标签、性别分类(总计、男性、女性)、经济活动分类、观测年份、观测值、观测状态和相关注释。数据以年度频率提供,并经过筛选仅包括非洲国家,适用于表格分类、表格回归和时间序列预测等任务。数据集由Electric Sheep Africa重新打包,以方便机器学习使用,采用cc-by-4.0许可证。

This dataset, titled Mean weekly hours actually worked per employee by sex and economic activity - ISIC level 2 | Africa (ILOSTAT), is a tabular dataset focused on labor statistics in Africa. It contains 28,647 observations across 40 African countries, spanning from 1996 to 2025. The core indicator is HOW_XEES_SEX_EC2_NB, which represents the mean weekly hours actually worked per employee, disaggregated by sex and economic activity (based on the International Standard Industrial Classification, ISIC, at the 2-digit level). Data is sourced from the International Labour Organization (ILO)s ILOSTAT database, which harmonizes raw survey microdata using ICLS (International Conference of Labour Statisticians) definitions. The dataset includes columns such as country code, country name, data source, indicator code, indicator label, sex classification (total, male, female), economic activity classification, observation year, observed value, observation status, and related notes. Data is provided at annual frequency and filtered to include only African countries, making it suitable for tasks like tabular classification, tabular regression, and time-series forecasting. The dataset is repackaged by Electric Sheep Africa for machine learning readiness and is released under the cc-by-4.0 license.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-how-xees-sex-ec2-nb-mean-weekly-hours-actually-worked-per-employee-by 数据集图片
构建方式
本数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,经由Electric Sheep Africa团队从ILOSTAT REST API接口直接抽取并重新打包而成。原始数据基于各国劳动力调查、家庭收入调查及行政记录等来源,并依据国际劳工统计学家会议(ICLS)定义进行统一协调处理。数据采集范围限定于非洲40个国家的ISO3代码,时间跨度覆盖1996年至2025年,共计28,647条观测记录,聚焦于“按性别和经济活动划分的雇员每周实际工作平均小时数”这一核心指标。
特点
该数据集具有鲜明的跨地域与时序特征,囊括了南非、毛里求斯、埃及等40个非洲国家的长序列劳动工时数据,时间跨度近三十年。数据以年度频率呈现,并按性别(总、男、女)及经济活动(ISIC第2级)进行细致分层,便于开展多维比较分析。每条记录均附带数据来源标签与观测状态标识(如临时、不可靠),并包含可能的序列断裂注释,为用户评估数据质量提供了透明依据。
使用方法
用户可通过HuggingFace Datasets库以load_dataset()函数一键加载该数据集至Python环境,并轻松转换为Pandas DataFrame进行后续操作。推荐基于'ref_area'字段按国别筛选,或基于'indicator'字段提取单一指标进行时间序列分析与可视化。亦可利用pivot_table方法将数据重塑为国家×年份的矩阵形式,便于跨国产出比较或面板数据分析。数据集采用CC-BY-4.0许可协议,使用时需同时引用ILO原始数据源及Electric Sheep Africa的重新打包版本。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)旗下ILOSTAT数据库于2025年整理发布,经Electric Sheep Africa团队重新封装至HuggingFace平台,聚焦非洲40个国家1996至2025年间按性别和经济活动划分的雇员周均实际工作小时数,共计28,647条观测记录。作为劳动统计领域的核心指标,工作时间数据是衡量劳动力市场效率、性别平等及工作条件的关键变量,尤其对非洲这一统计基础设施相对薄弱的大陆而言,标准化的跨国产出弥足珍贵。研究问题在于揭示非洲各国工作时间的动态演变及其与性别、产业结构的关联,为比较劳动经济学、可持续发展目标(SDG)监测及政策评估提供基础数据支撑。其影响力体现在填补了非洲区域高质量劳动时间序列的空白,便捷的API接口与Parquet格式更降低了机器学习与时间序列分析的应用门槛。
当前挑战
数据集面临的核心领域挑战在于非洲劳动统计的高度异质性:各国调查方法(如劳动力调查、行政记录)与统计口径(ICLS定义)存在差异,部分国家的观测值因样本量小或调查频次不足而被标记为不可靠,时间序列的断点与数据缺失削弱了跨国家、跨时段的可比性与建模精度。构建层面,数据整合需从ILOSTAT REST API抽取并过滤至非洲国家代码,且需应对多维度分类(性别、经济活动分类ISIC level 2)、多来源标识(source.label)以及观测状态标志(如临时值、不可靠值)的复杂映射,确保元数据与数值的一致性。此外,少于百分之一的国家(如塞舌尔)拥有不成比例的高密度观测,而多数国家数据稀疏,需设计稳健的插值或分层抽样策略以避免模型偏差。
常用场景
经典使用场景
在劳动经济学与区域发展研究的交汇领域,该数据集作为非洲大陆首个标准化、跨国的每周实际工作时长统计资源,为学者提供了从时间维度解析劳动力市场动态的独特窗口。其最经典的使用场景是构建面板数据模型,用于探究性别、经济活动部门(如农业、制造业、服务业)与工作时长之间的结构性关系。研究者可以借助近三十年覆盖40个非洲国家的观测值,分析经济发展阶段、劳动政策变迁对工作强度的异质性影响,或通过时间序列分解揭示非洲劳动力市场在全球化与本地化双重作用下的演进规律。
衍生相关工作
基于该数据集,学术界已衍生出一系列具有代表性的研究工作。典型工作包括利用随机效应模型或双重差分法,量化非洲大陆自由贸易区(AfCFTA)对成员国不同性别劳动者工作时长的差异化冲击;也有研究结合卫星夜光数据与机器学习算法,构建非正规就业规模的代理指标,进而分析工作时长与非正规经济渗透率之间的关系。此外,部分学者将本数据集与ILOSTAT其他模块(如工资、失业率)相融合,开发出面向非洲的体面劳动指数(Decent Work Index),为可持续生计评估提供了多维度的量化框架。
数据集最近研究
最新研究方向
该数据集聚焦于非洲劳动力市场中基于性别与经济活动的平均每周实际工时监测,为时间序列预测、面板数据回归及分类任务提供了高质量的结构化样本。当前前沿研究正借助该数据探究非正规就业形态对劳动时间的异质性影响,尤其关注新冠疫情后非洲各国工时恢复路径的性别差异。结合ILOSTAT的标准化方法论,研究者可追溯数据源标签以评估调查方法的连续性断裂,从而在机器学习模型中引入观测状态与注释变量以控制数据质量。这一工作为SDG体面工作目标的量化追踪、区域劳动力市场动态建模以及跨国比较分析奠定了可复现的基准,推动了非洲发展经济学与计算社会科学的交叉创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务