遇见数据集

electricsheepafrica/africa-ilo-eip-dwap-sex-edu-cct-rt-inactivity-rate-by-sex-education-and-citizenship

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含非洲42个国家从1991年至2025年的按性别、教育和公民身份划分的不活动率(百分比)观测数据,共有6,709条观测记录。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API获取并过滤为非洲国家。数据集包含一个核心指标:EIP_DWAP_SEX_EDU_CCT_RT(按性别、教育和公民身份划分的不活动率)。数据结构包括国家代码(ref_area)、指标代码(indicator)、年份(time)、观测值(obs_value)以及分类维度如性别(sex)、教育(classif1)和公民身份(classif2)等列。数据经过ILO harmonization处理,使用国际劳工统计学家会议(ICLS)定义,并标注了数据来源和质量状态(如临时或不可靠数据)。该数据集适用于表格分类、回归和时间序列预测等机器学习任务,旨在为非洲提供统一的、机器学习就绪的数据层。

This dataset contains 6,709 observations of inactivity rate by sex, education and citizenship (%) across 42 Africa countries, spanning from 1991 to 2025. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via REST API and filtered to African countries. It includes one core indicator: EIP_DWAP_SEX_EDU_CCT_RT (Inactivity rate by sex, education and citizenship). The schema comprises columns such as country code (ref_area), indicator code (indicator), year (time), observed value (obs_value), and disaggregation dimensions like sex (sex), education (classif1), and citizenship (classif2). The data is harmonized by ILO using International Conference of Labour Statisticians (ICLS) definitions, with source and quality flags (e.g., provisional or unreliable). It is suitable for machine learning tasks like tabular classification, regression, and time-series forecasting, and is part of a unified, ML-ready data layer for Africa.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-eip-dwap-sex-edu-cct-rt-inactivity-rate-by-sex-education-and-citizenship 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)旗下的ILOSTAT统计数据库,重点聚焦非洲大陆的劳动参与情况。构建过程中,数据通过直接调用ILOSTAT REST API获取指标`EIP_DWAP_SEX_EDU_CCT_RT`,并依据ILO制定的国际劳工统计学家会议(ICLS)定义,对原始调查微观数据进行规范化与整合。随后,数据集筛选出非洲42个国家的ISO3代码,确保地理覆盖的精准性。在Electric Sheep Africa的重新封装下,原始数据被转化为Parquet格式,并统一了分类维度,最终形成包含6,709条观测值、时间跨度从1991年至2025年的整洁表格,为研究者提供了即用型的数据基础。
特点
该数据集的核心特色在于其精细的多维分类与高时效性。除了按性别(总、男、女)进行基础拆解外,还引入了教育水平(如总量、各级别)与公民身份(如总量、本国、非本国)两大分类变量,使得非经济活动率的分析能够深入考察性别、教育背景与公民身份交织下的复杂模式。数据覆盖42个非洲国家,时间跨度长达34年,且最新数据更新至2025年,充分体现了非洲地区劳动力市场的动态变迁。此外,每一条观测值均附有详细的来源标签与观测状态标记,便于用户追溯数据质量与可靠性。
使用方法
使用者可通过`datasets`库中的`load_dataset`函数一键加载该数据集,并将其转换为Pandas DataFrame进行后续分析。针对单一国家的研究,可直接按`ref_area`字段进行过滤;对于时间序列分析,可依据`indicator`字段选择特定指标并按`time`排序进行可视化。若需构建国家间的横向对比矩阵,可利用`pivot_table`方法以年份为行、国家代码为列,将`obs_value`重塑为面板数据结构。数据集中的分类列(如`sex`、`classif1`及其标签)可为分组聚合与统计建模提供灵活的分层支持。
背景与挑战
背景概述
非劳动参与率作为衡量劳动力市场边缘群体的关键指标,其按性别、教育程度与公民身份交叉分解的数据对于理解非洲大陆复杂的社会经济结构具有不可替代的价值。由国际劳工组织(ILO)统计司编纂、Electric Sheep Africa于2025年再包装发布的该数据集,收录了1991年至2025年间非洲42个国家的6,709条观测记录,聚焦于非劳动参与率的精细分层。数据集依托ILOSTAT这一全球劳动统计权威数据库,通过对各国劳动力调查、住户收支调查等原始微观数据的标准化整合,提供了统一可比的时间序列。该数据的发布填补了非洲区域在劳动力市场弱势群体交叉分析方面的空白,为研究性别不平等、教育回报差异及公民身份对劳动力参与的影响提供了量化基石,推动了发展经济学与公共政策领域的循证决策。
当前挑战
该数据集面临的核心挑战首先来自其研究的领域问题:非洲大陆劳动力市场存在严重的性别与教育鸿沟,女性、低教育水平及非公民群体的经济参与率普遍偏低,然而传统聚合数据掩盖了群组内部的异质性,亟需交叉维度分解的精细数据以揭示结构性障碍。在构建过程中,数据来源的多样性导致了方法论上的挑战:不同国家采用的调查设计、问卷措辞及统计定义存在差异,ILO虽通过国际劳工统计学家会议(ICLS)标准进行协调,但数据标注中的“非标准教育等级”、“方法修订导致的序列断裂”及“不可靠观测值”等标记揭示了数据可比性与时间一致性上的技术困境。此外,部分国家年际数据稀疏,如刚果民主共和国仅覆盖2005至2020年且观测不足150条,使得稳健的因果推断与长期趋势分析面临样本限制。
常用场景
经典使用场景
该数据集的核心应用场景在于对非洲地区劳动力市场中不活跃率的精细化拆解与分析。凭借其横跨1991至2025年间42个非洲国家的海量观测数据,研究者得以按性别、教育程度与公民身份三个维度,系统性地剖析劳动力参与的结构性差异。例如,通过筛选特定国家的时间序列数据,可直观揭示不同性别群体或不同教育水平人群在劳动力市场边缘化的演化趋势。这种多维度交叉分类的独特设计,使得该数据集成为评估非洲各国劳动力政策效果、监测性别平等进展以及理解教育回报率变化的不可替代的量化工具。
实际应用
在实际应用中,该数据集的价值广泛辐射至政策制定、国际发展机构评估与商业决策等多个领域。对于政府与劳工部门而言,借助该数据可精准识别出高不活跃率的弱势群体(如低教育女性、非公民),从而设计更具靶向性的就业促进计划与职业培训项目。国际组织(如国际劳工组织、世界银行)可利用其进行可持续发展目标(SDG)中关于体面工作的进展监测。在商业层面,跨国企业的人力资源部门可通过分析不同教育背景群体的不活跃率,制定更具地域适应性的招聘策略,优化非洲市场的劳动力成本测算。
衍生相关工作
基于该数据集,一系列具有影响力的相关工作应运而生。其一,研究者利用其构建了非洲劳动力不活跃率的预测模型,引入宏观经济变量(如GDP增长率、城镇化率)后,开发出可前瞻性预估特定国家未来劳动力供给状况的时间序列预测框架。其二,数据集的维度设计催生了关于教育回报率在不同性别与公民身份群体间差异的计量分析,经典文献如《教育扩展能否缩小非洲劳动力参与中的性别鸿沟?》等均以此为数据根基。其三,该数据集还支撑了描绘非洲劳动力市场结构性变迁的可视化仪表盘项目,诸如动态展示各国不活跃率随时间演变的交互式地图,已成为政策研究者理解区域劳动生态的便捷入口。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务