遇见数据集

electricsheepafrica/africa-ilo-how-temp-sex-ocu-nb-mean-weekly-hours-actually-worked-per-employed-per

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含非洲40个国家从1991年至2025年的9,933个观测值,专注于“工作时长”数据,具体指标为“按性别和职业划分的就业人员平均每周实际工作时间”。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,经过重新打包,以表格形式提供,包括国家代码、来源、指标、性别分类、时间、观测值等列,适用于表格分类、回归和时间序列预测等任务。

This dataset contains 9,933 observations of Hours of work data across 40 Africa countries, spanning 1991 to 2025, with the specific indicator Mean weekly hours actually worked per employed person by sex and occupation. It is sourced from the ILOSTAT database of the International Labour Organization (ILO), repackaged in a tabular format with columns such as country code, source, indicator, sex classification, time, observed value, etc., suitable for tasks like tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-how-temp-sex-ocu-nb-mean-weekly-hours-actually-worked-per-employed-per 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,经由Electric Sheep Africa团队从ILOSTAT REST API直接采集,并筛选出非洲ISO3国家代码对应的观测数据。原始数据以国际劳工统计学家会议(ICLS)定义为基准,通过劳动力调查、家庭收入调查及行政记录等多源数据进行协调统一,最终形成包含9,933条观测记录的非洲周工时数据集。每条记录涵盖国家、性别、职业分类、时间及观测值等字段,并附有来源标签以确保数据可追溯。
使用方法
使用该数据集时,可通过HuggingFace的`datasets`库调用`load_dataset`函数直接加载为Pandas DataFrame。用户可按国家代码(如`ref_area == 'KEN'`)过滤分析单一国家的时间序列,亦可按指标代码排序后绘制趋势图。对于面板数据分析,推荐利用`pivot_table`方法将数据重塑为国家×年份矩阵,以便进行跨时空的比较研究或回归建模。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年发布,经Electric Sheep Africa团队重新封装,聚焦非洲40个国家1991至2025年间按性别与职业分类的每周实际工作小时数。作为ILOSTAT数据库的核心子集,它旨在弥合非洲大陆劳动统计数据的碎片化鸿沟,为研究劳动力市场性别差异、职业结构变迁及非正规就业模式提供标准化时间序列数据。凭借近万条观测记录和严格的ILO统计方法学支撑,该数据集已成为非洲区域劳动经济学、可持续发展目标(SDG 8)监测及跨国比较研究的重要基石,尤其填补了发展中国家精细劳动投入度量的长期空白。
当前挑战
数据集面临的核心挑战源于非洲劳动力数据的先天不足:多数国家调查频率低、样本覆盖不全,导致大量年份存在观测缺失(如1990年代仅博茨瓦纳等少数国家有记录)。数据质量参差不齐,部分观测被标记为不可靠(obs_status=U),且来源混杂(含劳动力调查、行政记录等),增加了跨国产出可比性分析难度。构建层面,ILO需在原始微观数据中协调各国迥异的职业分类标准与性别定义,经过标准化流程(ICLS定义)重新聚合,同时应对API数据的版本波动和标注不统一问题——最终数据集仍保留原始来源标签以追根溯源,但对用户的数据清洗与元数据理解提出隐性门槛。
常用场景
经典使用场景
在劳动经济学与非洲发展研究的交汇处,该数据集为分析非洲大陆不同性别和职业类别下就业人口的实际每周平均工时提供了标准化、经国际劳工组织(ILO)统一定义的纵向数据。其最经典的使用场景集中于时间序列回归分析与面板数据建模,研究者可基于1991年至2025年间覆盖40个非洲国家的近万条观测,追踪工时变化的长周期趋势,或对比南非、毛里求斯、埃及等国间的结构性差异。数据集按性别(男性、女性、合计)与职业技能层级(OCU_SKILL_TOTAL)进行细粒度分解,使得探究性别工时差距、职业隔离对劳动供给的影响,以及经济发展阶段与工作时长之间的关联性成为可能。此外,通过将观察值(obs_value)与数据质量标识(obs_status)结合,研究者能有效甄别异常值或不可靠记录,确保了建模过程的严谨性与结论的可靠性。
解决学术问题
该数据集精准回应了非洲劳动市场研究中长期面临的若干核心学术挑战。首先,它解决了非洲地区高质量、长时间跨度且具有跨国可比性的工时微观数据匮乏的问题——ILOSTAT通过统一采纳国际劳工统计学家会议(ICLS)定义,对各国劳动力调查原始数据进行标准化调和,使研究者得以规避各国统计口径不一致带来的测量误差。基于这一数据基础,学者能够量化性别不平等在劳动时间分配中的具体表现,揭示女性就业者面临的“时间贫困”现象及其与职业类型的交互作用,从而为性别经济学和发展经济学提供实证证据。其次,数据集的时间跨度覆盖了非洲多个经济周期与政策变革期,支撑对劳动标准政策、最低工时立法或结构转型效果的回溯性评估,推动了关于“体面劳动”指标(SDG 8)进展评价的定量研究。
实际应用
在政策制定与国际发展合作的现实场景中,该数据集为多维度应用提供了坚实的数据基础设施。国际劳工组织、非洲联盟及各成员国劳动部门可依此监测工时基准的达标情况,识别哪些国家或职业群体存在过度劳动或劳动时间不足的隐患,进而优化就业促进政策与劳动保护法规的制定。对于从事非洲市场研究的国际发展机构与咨询公司而言,该数据帮助评估不同产业和性别群体的劳动力利用效率,为区域供应链规划、行业投资选址以及企业人力资源配置提供佐证。此外,数据集以标准化格式封装于HuggingFace平台,支持通过`load_dataset()`即时接入机器学习流水线,使得数据科学家能够快速构建工时预测模型或自动化报告系统,显著降低了非洲劳动数据在日常商业分析与政务决策中的访问与使用门槛。
数据集最近研究
最新研究方向
该数据集聚焦于非洲40个国家1991至2025年间按性别和职业划分的就业人员实际周平均工时,为劳动经济学与可持续发展目标(SDG)下的体面工作指标研究提供了关键基础。当前前沿方向在于利用其时间序列与分类特征,结合机器学习模型(如时序预测与分类回归)挖掘非洲劳动力市场结构性变化,尤其是后疫情时代非正规就业与性别工时差距的动态关联。数据集经ILOSTAT权威来源整理并打包为ML就绪格式,显著降低了非洲劳动统计研究的数据门槛,支持跨区域比较与政策模拟,对推动非洲体面劳动议程的量化评估具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务