遇见数据集

electricsheepafrica/africa-ilo-how-temp-sex-ocu-edu-nb-mean-weekly-hours-actually-worked-per-employed-per

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含非洲38个国家从1991年至2025年间,按性别、职业和教育程度划分的就业人员实际平均每周工作小时数的108,051个观测值。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,涵盖了单一的指标HOW_TEMP_SEX_OCU_EDU_NB。数据集通过Electric Sheep Africa重新打包,以表格形式提供,适用于表格分类、回归和时间序列预测等任务。数据包括国家代码、年份、观测值、性别分类、职业和教育分类等字段,并附有数据来源和质量说明。

This dataset contains 108,051 observations of mean weekly hours actually worked per employed person by sex, occupation and education across 38 African countries from 1991 to 2025. It is sourced from the International Labour Organization (ILO) ILOSTAT database, covering the indicator HOW_TEMP_SEX_OCU_EDU_NB. Repackaged by Electric Sheep Africa, the data is provided in tabular format suitable for tasks like tabular classification, regression, and time-series forecasting. It includes fields such as country code, year, observed value, sex disaggregation, occupation and education classifications, along with source and quality notes.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-how-temp-sex-ocu-edu-nb-mean-weekly-hours-actually-worked-per-employed-per 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,通过其REST API接口直接采集代号为'HOW_TEMP_SEX_OCU_EDU_NB'的指标数据,并依据非洲ISO 3166-1 alpha-3国家代码进行地理筛选,最终获得覆盖38个非洲国家、横跨1991年至2025年间的108,051条观测记录。ILO依据国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行了标准化处理,每一观测均附有来源标签以确保数据可追溯。数据以Parquet格式打包,经由Electric Sheep Africa管道统一摄入并整理,研究者可直接通过HuggingFace Datasets库的load_dataset()函数加载使用。
特点
该数据集聚焦于非洲地区按性别、职业和受教育程度划分的受雇人员每周实际工作小时数均值,是劳动经济学与非洲发展研究领域的重要资源。其核心特点在于多维度交叉分类的设计:性别维度包含总、男、女三类,职业与教育水平则通过'classif1'和'classif2'两列实现灵活分解。数据集覆盖38个非洲国家,时间跨度达35年,且包含如'obs_status'等质量标记字段,可用于评估数据的可靠性。此外,列中详尽记录了数据来源、分类编码及注释信息,极大提升了数据的透明度和可复现性。
使用方法
使用该数据集极为便捷,仅需通过HuggingFace Datasets库调用load_dataset('electricsheepafrica/africa-ilo-how-temp-sex-ocu-edu-nb-mean-weekly-hours-actually-worked-per-employed-per')即可获得训练集并转换为Pandas DataFrame。研究者可按国家(ref_area)、性别(sex)或职业分类(classif1)轻松筛选子集,例如过滤出肯尼亚的观测值。对于时间序列分析,可按指标排序后利用obs_value和time列进行可视化。亦可通过透视表(pivot_table)将数据重塑为国家×年份矩阵,便于面板数据分析或回归建模。该数据集设计考虑了ML-Ready特性,可无缝适配分类、回归及时间序列预测等任务。
背景与挑战
背景概述
在劳动经济学与可持续发展研究领域,精确衡量不同劳动力群体的工作时间差异,对于评估体面劳动、性别平等及教育回报率至关重要。国际劳工组织(ILO)于2025年通过其ILOSTAT数据库发布了涵盖非洲38个国家、1991至2025年间约10.8万条观测的“按性别、职业和教育划分的就业者平均每周实际工作时间”数据集。该数据集由Electric Sheep Africa重新打包为机器学习就绪格式,聚焦于非洲大陆劳动力市场的时空异质性,旨在为跨国家、跨时期的体面劳动指标分析提供统一且可比较的微观数据基础。其核心研究问题在于,如何通过精细化的分类维度(性别、职业技能水平、教育程度)刻画非洲劳动力参与模式及工作时间的演变轨迹,从而支持政策制定者与研究者识别劳动力市场中的结构性不平等与脆弱群体。该数据集的发布极大降低了非洲劳动统计数据的获取门槛,对推动非洲区域劳动力研究、可持续发展目标(SDG 8.5)的监测以及机器学习在劳动经济学中的应用具有开创性意义。
当前挑战
该数据集所应对的领域挑战在于,非洲劳动力市场长期面临官方统计数据缺失、时间序列不连续、分类标准不统一以及性别与教育维度信息碎片化等困境,导致难以系统比较各个国家在不同时期的周均实际工作时间,尤其缺乏对低技能、女性及非正式就业群体劳动负担的精细化衡量。在构建过程中,数据整合遭遇了多重挑战:ILOSTAT原始数据源自各国劳动力调查、家计调查等多种来源,需通过国际劳工统计学家会议(ICLS)定义进行指标协调与最佳来源筛选;非洲国家间数据质量参差不齐,部分观测被标记为“不可靠”或属临时估算;分类变量(如职业和教育水平)在不同国家存在定义差异,需借助注释字段保留透明性;此外,为保持与原始API的兼容性,数据未被重采样或填补缺失值,用户需要自行处理不完整的时间序列与潜在的选择性偏差问题。
常用场景
经典使用场景
在劳动经济学与发展经济学领域,该数据集最经典的应用场景是进行非洲各国劳动力市场结构的跨国比较与纵向趋势分析。研究者可利用其精细的分类维度——性别、职业技能等级与教育水平——剖析不同社会群体在周均实际工作时间上的差异,进而揭示非洲大陆内部就业质量的不平等格局。例如,通过时间序列建模,可追踪特定国家在数十年间劳动强度的演变轨迹,或借助面板回归方法估计教育回报率与职业分层对工作时长的影响。该数据集的结构化特征使其天然适用于监督学习任务,如基于人口统计学特征预测工作时长区间的分类模型,以及估算连续工作时间的回归任务。此外,其年度观测的时间跨度(1991-2025年)为时序预测研究提供了丰富的训练样本,使得构建非洲区域性劳动力指标的预测模型成为可能。
衍生相关工作
基于该数据集的丰富分类与长时序特征,已衍生出若干具有典范意义的研究思路与技术工具。在学术领域,研究者常以其为输入数据,构建非洲劳动市场均衡模型,或使用机器学习回归算法(如梯度提升树、随机森林)识别影响工时波动的主导因素,为传统经济学假设提供数据驱动的验证路径。在数据集衍生品方面,IT从业者开发了自动化的元数据标准化管线,将其与ILOSTAT的其他子集(如工资、失业率指标)通过国家代码与年份进行纵向拼接,形成更为全面的非洲劳动力市场综合面板数据集。此外,该数据激发了针对稀疏时序填补技术的研究,由于部分国家观测缺失,学界尝试应用矩阵分解或状态空间模型进行插值,进而产出了增强版的平滑数据集,服务于需要连续时间序列的计量分析。这些衍生工作共同构成了围绕非洲劳动统计开展的开放科学生态,既验证了原始数据的可靠性,又拓展了其实践边界。
数据集最近研究
最新研究方向
基于国际劳工组织ILOSTAT数据源,该数据集聚焦非洲38国1991至2025年间按性别、职业与教育程度分层的实际周劳动工时均值,为劳动经济学、发展经济学与性别研究领域提供了高分辨率时序面板数据。前沿研究集中在利用该数据集分析非洲劳动力市场在非正规就业扩张、技能错配与教育回报率波动背景下的工时结构性变迁,尤其关注新冠疫情、数字转型及区域一体化政策对劳动供给模式的冲击。通过多维分类变量(性别×职业×教育)的交叉分解,研究者得以识别弱势群体(如低技能女性)的工时脆弱性,并评估ILO体面劳动议程在撒哈拉以南非洲的实现路径。该数据集生成的实证证据为非洲国家调整最低工资标准、优化职业培训体系及完善社会保护制度提供了关键统计基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务