遇见数据集

electricsheepafrica/africa-ilo-how-xees-sex-age-nb-mean-weekly-hours-actually-worked-per-employee-by

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含非洲41个国家在1991年至2025年期间,按性别和年龄分组的员工平均每周实际工作时间的观测数据,共有9,827个观测值。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,涵盖了单一指标“HOW_XEES_SEX_AGE_NB”,即员工平均每周实际工作时间。数据集经过重新打包,以表格形式提供,包括国家代码、年份、观测值、性别分类等字段,适用于表格分类、回归和时间序列预测等任务。数据以英语为主,遵循CC-BY-4.0许可证。

This dataset contains 9,827 observations of mean weekly hours actually worked per employee by sex and age across 41 African countries from 1991 to 2025. It is sourced from the ILOSTAT database of the International Labour Organization (ILO), focusing on the indicator HOW_XEES_SEX_AGE_NB. The data is repackaged in a tabular format with columns such as country code, year, observed value, and sex disaggregation, suitable for tasks like tabular classification, regression, and time-series forecasting. The dataset is in English and licensed under CC-BY-4.0.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-how-xees-sex-age-nb-mean-weekly-hours-actually-worked-per-employee-by 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,通过REST API接口直接拉取‘HOW_XEES_SEX_AGE_NB’指标数据,并依据非洲ISO3国家代码进行地理范围过滤。ILO统计部门采用国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行协调处理,数据来源在‘source.label’列中明确标注,确保了数据溯源的可追溯性与统计口径的一致性。最终经Electric Sheep Africa重新打包为Parquet格式,形成一份包含9,827条观测记录的机器学习就绪数据集。
使用方法
本数据集可通过HuggingFace的‘datasets’库便捷加载。用户只需调用‘load_dataset’函数即可将数据导入为Pandas DataFrame,随后可根据国家代码(如‘ref_area’字段)过滤特定国家数据,或按‘indicator’与‘time’字段进行时间序列分析。此外,支持通过透视表操作将数据重塑为以年份为行、国家为列的矩阵形式,便于进行跨国的对比研究与建模任务,涵盖分类、回归及时序预测等场景。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)通过其ILOSTAT统计数据库整理发布,并由Electric Sheep Africa于2025年重新封装至HuggingFace平台,旨在提供非洲地区按性别与年龄划分的雇员平均每周实际工作小时数。ILOSTAT作为全球劳动统计的权威来源,其数据源自各国劳动力调查、家庭收支调查及行政记录,并依据国际劳动统计学家会议(ICLS)定义进行标准化处理。该数据集涵盖1991年至2025年间41个非洲国家的9,827条观测值,聚焦于工作小时这一核心劳动指标,为分析非洲劳动力市场的性别差异、年龄结构变化及工时趋势提供了关键数据支撑。作为首个面向非洲区域的ILO工作小时专项数据集,它填补了该地区在劳动经济学研究中结构化、机器可读数据集的空白,对推动非洲发展议程中的体面劳动目标研究具有重要价值。
当前挑战
该数据集所解决的领域问题在于,非洲劳动力市场长期面临数据稀疏、统计口径不一及性别-年龄维度缺失等挑战,传统研究常依赖碎片化的单国调查或粗略聚合估计,难以支撑跨国的比较分析及时序建模。构建过程中,ILO需协调41国来源各异的原始调查数据(如劳动力调查与行政记录),处理因方法论修订导致的序列断裂(如标注为“Break in series”的观测值),并通过缺失值标识与“最佳来源”选择策略来平衡数据覆盖与一致性。此外,数据仅在年度频率发布,缺少月季度细分,且部分国家观测时间跨度短、存在明显的数据缺口,加之指标定义在跨国语境中的细微差异,均对时间序列预测与因果推论的可靠性构成显著约束。
常用场景
经典使用场景
在劳动经济学与跨区域比较研究的学术版图中,该数据集构筑了一座连接ILO官方统计体系与非洲劳动力市场的桥梁。其最经典的使用场景集中于两个维度:其一,研究者可利用其丰富的按性别和年龄组别划分的周工时数据,剖析不同人口亚群在非洲各国劳动参与中的结构性差异;其二,基于1991年至2025年间覆盖41个非洲国家的长面板数据,学者得以构建时间序列模型,捕捉区域工时变动的长期趋势与周期性波动。数据集提供的高质量年度观测值,加之标准化的分类字段与详尽的数据溯源注释,为开展统计建模与因果推断等学术探索提供了坚实的数据底座。
解决学术问题
该数据集精准回应的第一个核心学术问题是非洲大陆劳动工时水平在性别与年龄维度上的不平等度量。过往研究常因数据碎片化而难以勾勒出泛非层面的完整图景,该数据集通过ILO统一的方法论整合,使得跨国家、跨时期的性别工时差距量化分析成为可能,从而为揭示隐性劳动剥削与性别隔离提供了统计学依据。第二个重要问题在于劳动市场动态的时域解析,借助该长期面板数据,研究者能够系统评估经济周期、政策干预乃至公共卫生事件对劳动力投入程度的冲击效应,进而深化对非洲非正规就业与劳动力弹性机制的理论认知,推动发展经济学与劳动经济学交叉领域的经验研究。
实际应用
在实际应用层面,该数据集为公共政策制订与国际发展合作提供了关键的定量支持。政府部门与科研智库可以依赖这些标准化工时数据,对标ILO体面劳动目标中的工作时间合理指标,识别出工时过长或劳动投入不足的特定国别与人群,从而设计更具靶向性的劳动力市场监管政策与劳动权益保护机制。同时,跨国机构与开发银行借助这些可与社会经济变量联动的面板数据,对非洲各国的就业质量、生产效率以及社会保障体系的覆盖面进行多维评估,有助于优化援助资金的配置策略与劳动密集型产业的区域投资决策。此外,数据为企业和人力资源咨询机构在非洲市场的劳动力成本测算与合规风险评估提供了科学的参照基准。
数据集最近研究
最新研究方向
该数据集聚焦于非洲大陆雇员按性别与年龄划分的平均每周实际工时,为劳动经济学、性别研究及可持续发展目标(SDG)中的体面劳动指标提供了宝贵的时间序列数据。当前前沿研究方向包括利用该数据集构建时序预测模型,以追踪非洲地区劳动力市场在全球化、技术变革及公共卫生事件(如新冠疫情)冲击下的动态演变;同时,结合性别维度的细粒度离散化特征,研究者可深入剖析非洲各国非正规就业模式中的性别不平等现象,为制定精准的劳工政策提供量化依据。数据集覆盖41个非洲国家长达三十余年的观测值,其跨区域、长时序特性尤为适合开展面板数据分析,探索经济增长与劳动强度之间的非线性关联,从而推动对非洲劳动力弹性与福祉的实证研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务