遇见数据集

electricsheepafrica/africa-ilo-eip-teip-sex-geo-mts-nb-persons-outside-the-labour-force-by-sex-rural-urba

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含非洲45个国家从1994年至2025年期间“按性别、城乡地区和婚姻状况划分的非劳动力人口(千人)”的统计数据,共有19,390个观测值,涵盖1个核心指标(EIP_TEIP_SEX_GEO_MTS_NB)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过其REST API获取,并经过Electric Sheep Africa重新打包,以表格形式存储,包括国家代码、性别、地区类型、婚姻状况、年份和观测值等维度。数据集用于表格分类、回归和时间序列预测等任务,支持对非洲劳动力市场非劳动力人口的分析。

This dataset contains 19,390 observations of Persons outside the labour force by sex, rural / urban area and marital status (thousands) data across 45 Africa countries, spanning 1994–2025, covering 1 distinct indicator (EIP_TEIP_SEX_GEO_MTS_NB). The data is sourced from the International Labour Organization (ILO) ILOSTAT database via its REST API, repackaged by Electric Sheep Africa, and stored in tabular format with dimensions such as country code, sex, area type, marital status, year, and observed values. It is designed for tabular classification, regression, and time-series forecasting tasks, facilitating analysis of non-labour force populations in African labour markets.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-eip-teip-sex-geo-mts-nb-persons-outside-the-labour-force-by-sex-rural-urba 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,由Electric Sheep Africa团队通过REST API从官方指标端点直接获取,并严格限定于非洲ISO3国家代码范围内的观测记录。数据经过ILOSTAT统一协调处理,依据国际劳工统计学家大会(ICLS)定义对原始调查微观数据进行标准化整合,确保跨国家与跨时期的数据可比性。在构建过程中,团队保留了完整的元数据字段,如来源标签(source.label)和指标注释(note_indicator.label),以增强数据的可追溯性与透明度。最终整合为包含19,390条观测、覆盖45个非洲国家及1994年至2025年时间跨度的结构化表格数据集,并以Parquet格式打包发布。
特点
该数据集的核心特点在于其精细的多维度分层结构,涵盖性别(sex)、城乡地域(classif1)及婚姻状况(classif2)三个关键分类变量,实现了对劳动力市场外人群特征的深度刻画。指标唯一聚焦于'EIP_TEIP_SEX_GEO_MTS_NB',即按性别、城乡区域和婚姻状况统计的劳动力市场外人口数量(单位:千),保证了分析主题的高度专一性。数据来源多样性得到明确标注,每个观测都附有来源代码及标签,便于用户评估数据质量。此外,数据集包含'obs_status'状态标志和'note_indicator'注释字段,用以提示数据可靠性及方法修订等潜在断点,体现了对数据使用严谨性的考量。
使用方法
该数据集的使用极为便捷,可通过HuggingFace Datasets库的load_dataset()函数一键加载至Python环境,并直接转换为Pandas DataFrame进行后续分析。用户能够通过筛选'ref_area'列轻松聚焦特定国家的时间序列,例如过滤'KEN'以分析肯尼亚的数据趋势。针对单一指标的分析,可基于'indicator'列筛选后按'time'排序,绘图展示观测值(obs_value)的年度变化。此外,利用pivot_table函数可将数据重塑为国家×年份的矩阵形式,便于进行跨国面板数据分析或回归建模。数据集的表格分类与回归、时间序列预测等任务类别也支持将其直接用于机器学习模型的训练与评估。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)的统计数据库ILOSTAT于2025年创建,并经Electric Sheep Africa重新整理发布,涵盖了1994年至2025年间非洲45个国家的19,390条观测数据。其核心研究问题聚焦于劳动参与率之外的群体——即按性别、城乡区域及婚姻状况划分的未参与劳动力人群规模,旨在通过标准化、细粒度的时间序列数据,揭示非洲地区劳动力利用不足的复杂结构。作为ILOSTAT在非洲区域的专项子集,该数据集为劳动力经济、社会政策和可持续发展目标(SDG)相关研究提供了关键数据基础,尤其对于分析非洲大陆独特的非正规就业、性别不平等及城乡劳动力流动模式具有重要影响力。
当前挑战
该数据集面临的挑战首先源自领域问题的复杂性:非洲各国劳动力调查的采集频率、口径(如ICLS定义)和统计质量差异显著,数据中频繁出现的“方法修订”标识(如“Break in series: Methodology revised”)和“不可靠”状态标记,反映了跨时段、跨国别数据一致性维护的固有困难。构建过程中,ILOSTAT虽通过“最佳来源”选择机制和原始调查元数据溯源(如source.label)来保证数据质量,但同一指标在相同国家年份可能面临多个来源的冲突,且观测值需要经过多重分类维度(性别、地区、婚姻状况)的拆解整合,这种多层次聚合与清洗流程极易产生语义歧义或统计偏差,对使用者的原始数据处理和解读专业性提出较高要求。
常用场景
经典使用场景
该数据集从国际劳工组织(ILO)的ILOSTAT数据库中提取,聚焦于非洲45个国家1994年至2025年间因性别、城乡地域及婚姻状况分组的劳动力市场之外人群规模(以千人为单位)。其最经典的使用场景包括基于表格数据的分层分类与回归建模,例如预测特定国家或地区在给定年份的非劳动力人群数量,以及利用时间序列分析方法洞察非洲劳动力参与率的长周期演变趋势。研究者可通过该数据探究经济结构转型、城市化进程与劳动力退出率之间的关联,尤其适用于交叉分析性别与婚姻状况对劳动参与决策的交互效应。
实际应用
在实际应用中,该数据集可服务于国际发展机构与非洲各国政府的劳动力政策设计。例如,通过追踪不同性别与婚姻状况人群在城乡间的分布变化,政策制定者能够定位劳动参与率低迷的脆弱群体,进而设计针对性的技能培训、就业援助与社会保障计划。此外,数据集还可用于构建劳动力流动预测模型,辅助评估城镇化进程中劳动力市场的吸纳能力,或为国际组织如ILO、世界银行提供实证依据,以制定更具包容性的劳动权益保护框架,推动区域可持续发展目标的实现。
衍生相关工作
该数据集衍生了一系列基于ILOSTAT的经典研究工作,例如利用类似面板数据构建非洲劳动力市场的时空预测模型,或开发针对非正式就业人群的劳动力参与动态系统。数据标准化与公开性促进了比较制度研究,如婚姻状况对女性劳动力退出率的差异化影响在不同殖民历史国家间的变异。此外,该数据被用于训练机器学习模型以填补非洲部分国家调查年份缺失的观察值,并衍生出如“预测非洲非经济活动人口与正式就业转移概率”的专题分析工作,进一步拓展了结构化劳动力数据在因果推断与政策模拟中的应用边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务