遇见数据集

electricsheepafrica/africa-ilo-emp-nifl-sex-ind-rt-informal-employment-rate-by-ilo-sector-and-sex

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含非洲41个国家在2009年至2025年间的非正规就业率数据,按国际劳工组织(ILO)部门和性别分类(百分比)。数据来源于ILOSTAT数据库,涵盖8,356个观测值,涉及一个核心指标(EMP_NIFL_SEX_IND_RT)。数据集提供了详细的元数据,包括国家代码、来源、性别分类、时间年份、观测值及其状态等,适用于表格分类、回归和时间序列预测等任务。数据由Electric Sheep Africa重新打包,以支持机器学习和研究应用。

This dataset contains 8,356 observations of informal employment rate data by ILO sector and sex (%) for 41 African countries from 2009 to 2025. It is sourced from the ILOSTAT database of the International Labour Organization (ILO), covering one distinct indicator (EMP_NIFL_SEX_IND_RT). The dataset includes detailed metadata such as country codes, sources, sex disaggregation, time years, observed values, and status flags, making it suitable for tabular classification, regression, and time-series forecasting tasks. Repackaged by Electric Sheep Africa to facilitate machine learning and research applications.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-emp-nifl-sex-ind-rt-informal-employment-rate-by-ilo-sector-and-sex 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过调用其REST API获取原始指标数据,并针对非洲地区ISO3国家代码进行地理筛选。原始数据基于各国劳动力调查、家庭收入调查、机构调查及行政记录等多元来源,经ILO统计部门依据国际劳工统计学家会议(ICLS)定义进行统一整合与标准化处理。Electric Sheep Africa团队在此基础上完成数据清洗与重构,将结果以Parquet格式封装,确保数据条目可追溯至其原始来源,最终形成包含8,356条观测记录、覆盖41个非洲国家、时间跨度为2009年至2025年的结构化数据集。
特点
本数据集聚焦于非洲地区按ILO行业与性别划分的非正规就业率(%),其核心优势在于实现了多维度的精细分解:性别维度涵盖总人口、男性和女性三个类别,同时提供ILO行业分类等额外分层变量。数据集中每个观测值均附有来源标签、观测状态标记及序列中断等元数据说明,便于研究者评估数据质量。此外,数据经过统一架构规范化处理,包含国家代码、指标名称、年份、观测值及注释字段,为进行跨国家、跨时间的比较分析提供了标准化基础。
使用方法
用户可通过HuggingFace的datasets库直接加载该数据集,使用一行代码即可完成导入,并将数据转换为Pandas DataFrame格式进行后续分析。针对特定国家的分析需求,可通过筛选ref_area列实现子集提取;若需进行时间序列分析,则可按indicator与time字段排序并可视化观测值变化趋势。数据集还支持构建国家与年份的透视矩阵,便于进行面板数据分析或机器学习建模。参照ILOSTAT的CC-BY-4.0许可协议,使用者应同时注明原始数据来源及Electric Sheep Africa的重新封装贡献。
背景与挑战
背景概述
非正规就业作为非洲劳动力市场的核心议题,长期受到国际劳工组织(ILO)的高度关注。该数据集由ILO统计部门依托其旗舰数据库ILOSTAT构建,并由Electric Sheep Africa于2025年重新封装后发布于HuggingFace平台,涵盖2009至2025年间41个非洲国家的8,356条观测记录。其核心研究问题聚焦于按ILO行业和性别分层的非正规就业率,旨在揭示非洲大陆非正规经济的规模、结构性特征及演变趋势。作为目前覆盖非洲国家最广、时间跨度最长的非正规就业率标准化数据集之一,它为比较劳动经济学、发展经济学以及可持续发展目标(SDG)中体面工作的监测提供了关键数据支撑,尤其填补了非洲区域高质量、机器可读的劳动力统计数据的空白。
当前挑战
该数据集所应对的领域核心挑战在于非正规就业的量化与比较难题:非洲各国对非正规就业的定义、调查方法和统计周期存在显著差异,系统性的可比数据极度匮乏。构建过程中面临多重障碍,首先需从ILOSTAT的异构原始调查微观数据中,依据国际劳工统计学家会议(ICLS)定义进行统一规范化处理,并剔除不兼容的季节或月度子序列。其次,数据质量标注复杂,需处理标志为‘不可靠’或‘序列中断’的观测值,确保下游分析的可信度。此外,整合来自劳动力调查、住户收支调查等多源行政记录,需在保留来源可追溯性的同时,为每个国家-年份组合选优ILO认定的‘最佳来源’,这一协调过程对数据管道的一致性和边际质量评估提出了极高要求。
常用场景
经典使用场景
该数据集汇集了2009年至2025年间非洲41个国家的非正规就业率数据,按国际劳工组织(ILO)行业和性别进行分层,构成了一个结构化的面板数据集。其经典使用场景在于开展跨国的劳动经济学比较研究,尤其是通过时间序列分析或面板回归模型,探究非正规就业在不同非洲国家的演变轨迹。研究者能够借助这一统一口径的数据源,量化宏观政策、经济危机或制度变革对非正规就业比例的冲击,同时还可结合性别维度揭示劳动力市场中的结构性差异。
衍生相关工作
该数据集衍生出的相关工作主要集中在其作为多源融合数据的基准测试角色。一方面,研究者可以将其作为标签数据用于训练和验证非正规就业预测的机器学习模型,如时间序列预测或分类模型;另一方面,该数据集的元数据设计(如断点标记、可靠性标识)催生了针对数据质量自动检测的研究。此外,数据集本身对世界银行、联合国开发计划署等机构已有调查数据的补充与交叉验证,也为后续研究提供了清理异构时序数据的方法论范例。
数据集最近研究
最新研究方向
该数据集聚焦于非洲国家非正规就业率的性别与行业维度异质性分析,结合国际劳工组织ILOSTAT的权威统计数据,为理解非洲劳动力市场的结构性转型提供了关键量化支撑。当前前沿研究方向涵盖利用时间序列模型预测非正规就业动态演变趋势,以及通过面板数据挖掘性别差距、行业分布与政策干预之间的深层关联。随着全球对非洲可持续发展目标(SDGs)中体面工作议程的关注升温,该数据集在衡量非洲大陆非正规经济规模、评估劳动力市场政策效果、以及构建跨区域比较研究框架中发挥着不可替代的作用,尤其为揭示后疫情时代非洲就业弹性的脆弱性与韧性提供了宝贵的数据基础设施。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务