遇见数据集

electricsheepafrica/africa-ilo-how-xees-sex-dsb-nb-mean-weekly-hours-actually-worked-per-employee-by

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含非洲29个国家(2005-2025年)的772个观测值,重点关注按性别和残疾状况划分的雇员实际平均每周工作小时数指标(HOW_XEES_SEX_DSB_NB)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API获取并过滤为非洲国家。数据集包括国家代码、来源、指标、性别分类、时间、观测值等列,适用于表格分类、回归和时间序列预测等任务。

This dataset contains 772 observations of Hours of work data across 29 Africa countries, spanning 2005–2025, covering 1 distinct indicator: Mean weekly hours actually worked per employee by sex and disability status (HOW_XEES_SEX_DSB_NB). The data is sourced from ILOSTAT, the ILOs central statistics database, and is repackaged by Electric Sheep Africa for ML-ready use. It includes columns such as country codes, source information, indicator details, sex disaggregation, time, and observed values, suitable for tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-how-xees-sex-dsb-nb-mean-weekly-hours-actually-worked-per-employee-by 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,专注于收集非洲地区雇员按性别和残疾状况划分的周平均实际工作小时数。数据通过ILOSTAT REST API直接抽取,并依据非洲ISO3国家代码进行地理筛选。ILOSTAT利用国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一协调,确保跨国可比性。原始数据来源包括国家劳动力调查、家庭收入调查、企业调查及行政记录,并在数据集的`source.label`列中标注具体来源,便于追溯与验证。最终数据集包含772条观测记录,覆盖29个非洲国家,时间跨度为2005年至2025年。
特点
该数据集具有鲜明的结构化特征,其核心指标为`HOW_XEES_SEX_DSB_NB`,即按性别和残疾状况分类的雇员周平均实际工作小时数。数据按年度频率发布,并通过`sex`字段提供总人口、男性与女性三个维度的细分。此外,`classif1`字段进一步按残疾状况进行分解(如残疾状态总计)。数据集还包含观测状态标记(如临时性或不可靠)、指标注释(如方法修订导致的中断)以及来源注释,赋予使用者对数据质量与变更历史的全面掌控。这种丰富的元数据设计,使其在劳动经济学、残疾人就业政策评估等研究中具有独特的分析价值。
使用方法
使用者可通过HuggingFace Datasets库便捷地加载该数据集,只需调用`load_dataset("electricsheepafrica/africa-ilo-how-xees-sex-dsb-nb-mean-weekly-hours-actually-worked-per-employee-by")`即可获得可直接操作的Pandas DataFrame。在此基础上,可灵活进行多种分析操作:例如通过`df[df["ref_area"] == "KEN"]`筛选特定国家数据;可依据`time`字段对单一指标进行时间序列分析并可视化;亦可利用`pivot_table`将数据重塑为国家×年份的矩阵形式,以支持面板数据分析或比较不同国家在某一时点的工作时长差异。该数据集亦适用于分类、回归及时间序列预测等机器学习任务。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计司于2025年创建,经Electric Sheep Africa重新封装后发布于HuggingFace平台,聚焦非洲地区按性别与残疾状况划分的雇员平均每周实际工时。作为ILOSTAT数据库的子集,该数据集整合了2005至2025年间29个非洲国家的772条观测记录,核心研究问题在于揭示残障与非残障劳动力在劳动时间维度上的差异,为评估非洲劳动力市场的包容性与可持续发展目标(SDG)中的体面工作指标提供量化依据。其价值在于填补了非洲大陆残障人群劳动参与精细统计的空白,对劳动经济学、公共政策评估及人权研究领域具有重要推动作用。
当前挑战
该数据集面临的核心挑战在于领域问题层面:非洲国家间劳动力调查方法、残疾定义标准及数据收集频率不一,导致跨国产出的工时数据可比性不足,尤其在残障状况划分上存在显著的分类歧义。构建过程中,需应对ILOSTAT多源异构数据的清洗与整合难题,包括处理不同来源代码的冲突、年度与季频数据的尺度统一,以及因方法论修订(如中断序列标注)带来的历史数据连续性断裂。此外,部分国家观测数稀疏(如尼日利亚仅23条),使得时间序列分析易受小样本偏差影响,进一步制约了高精度建模的可能。
常用场景
经典使用场景
该数据集记录了非洲29个国家2005至2025年间按性别和残疾状况划分的雇员平均每周实际工作小时数,共计772条观测值,广泛适用于时间序列预测、表格分类与回归等任务。研究者可借此构建多维度劳动工时模型,剖析不同性别及残疾群体在工作时长上的结构性差异,也可结合宏观经济社会发展指标,探究工时变化的内在驱动力。其规范化整理后的格式,令调用者可通过一行代码加载数据,快速投入区域劳动经济学与包容性增长议题的实证分析。
实际应用
在实际应用中,该数据集能够为国际劳工组织、非洲各国劳动部门及社会政策智库提供决策依据。借助时间序列分析,政策制定者可动态追踪不同性别和残疾群体工时变化趋势,评估最低工资调整、劳动保护立法或残疾人就业激励政策的实际成效。企业和非政府组织亦可利用这些数据优化包容性用工方案,识别工时差异显著的行业与国家,针对性设计职业康复与技能培训项目,促进残疾人劳动力的有效融入,进而提升区域劳动力市场的整体公平性与运行效率。
衍生相关工作
围绕该数据集,学术界已衍生出若干具有影响力的研究方向。劳动经济学家基于按性别与残疾状况拆分的工时数据,发展出分析劳动力市场多重不平等的新框架,并扩展了传统工时决定模型以纳入残障维度的解释变量。一些研究将其与ILOSTAT中薪资、就业率等指标交叉匹配,构建面向非洲国家的多位阶体面工作指数,揭示了残疾群体在劳动力市场中的系统性劣势。此外,该数据集推动了基于机器学习的工时预测方法创新,尤其是在数据稀疏的国家中对缺失时序进行插补与推理,为数据匮乏地区的劳动统计建模提供了方法论参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务