遇见数据集

electricsheepafrica/africa-ilo-eap-teap-sex-edu-mts-nb-labour-force-by-sex-education-and-marital-status-t

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

这是一个关于非洲49个国家劳动力数据的表格数据集,包含1982年至2025年的100,449条观测值。数据集的核心指标是按性别、教育程度和婚姻状况划分的劳动力(以千计),数据来源于国际劳工组织(ILO)的ILOSTAT数据库。数据集包含国家代码、国家名称、数据来源、指标代码、指标名称、性别分类(总计、男性、女性)、教育程度分类、婚姻状况分类、观测年份、观测值、观测状态等列。数据已通过Electric Sheep Africa重新打包,便于机器学习使用。

This dataset contains 100,449 observations of Labour force data across 49 Africa countries, spanning 1982–2025, covering 1 distinct indicator: Labour force by sex, education and marital status (thousands). The data is sourced from ILOSTAT, the ILOs central statistics database, and has been repackaged by Electric Sheep Africa for machine learning readiness. It includes columns such as country code, country name, source, indicator code, indicator name, sex disaggregation (total, male, female), education classification, marital status classification, observation year, observed value, and observation status.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-eap-teap-sex-edu-mts-nb-labour-force-by-sex-education-and-marital-status-t 数据集图片
构建方式
该数据集以国际劳工组织中央统计数据库(ILOSTAT)为原始数据源,由Electric Sheep Africa团队进行标准化重包装而成。构建过程遵循元数据驱动的工程范式,从ILOSTAT中系统抽取非洲区域劳动力市场统计记录,涵盖49个非洲国家、1982年至2025年的时间跨度,共汇聚100,449条观测。数据集以Parquet格式存储,保留原始指标定义与单位,未对缺失值作插补处理,确保数据可追溯性与分析灵活性,最终形成结构化、可直接用于机器学习任务的表格型数据集。
特点
该数据集的核心特征在于其多维度的交叉分类能力,按性别、教育程度与婚姻状况三个维度系统刻画非洲各国劳动力规模,单位为千人。数据覆盖范围广泛,时间序列长达四十余年,空间上横跨49个非洲国家,兼具横向比较与纵向追踪的分析价值。数据集采用标准化元数据标注,附有明确的国家、年份与指标字段,便于跨数据集联接。其规模介于十万至百万行之间,属中等偏大数据集,适合开展劳动经济学、性别研究与教育回报分析等实证工作。
使用方法
研究人员可借助Hugging Face的datasets库便捷加载该数据集,通过load_dataset函数获取数据对象,并查看其结构与特征。对于表格分析场景,可将数据集转换为Pandas DataFrame以进行后续处理。使用时应首先检查各变量的缺失值与分布特征,明确单位与定义后再开展建模。该数据集支持与Electric Sheep Africa目录下的其他非洲数据集进行联接,通过国家、年份与指标字段实现跨域整合,从而构建可复现的分析流程与笔记本。
背景与挑战
背景概述
国际劳工组织(ILO)长期致力于全球劳动力市场统计数据的收集与标准化,其ILOSTAT数据库是劳动经济学研究的核心基础设施。然而,非洲地区在性别、教育程度与婚姻状况交叉维度上的劳动力参与数据长期分散且缺乏统一整理。Electric Sheep Africa于2026年发布的该数据集,系统整合了1982至2025年间49个非洲国家的100,449条观测记录,填补了非洲劳动力市场结构化数据的空白,为性别经济学、教育回报率及家庭劳动供给等研究提供了可复现的量化基础。
当前挑战
该数据集所回应的领域难题在于:非洲劳动力市场中性别、教育与婚姻状况的交互效应长期缺乏跨国可比证据,传统调查数据在定义与覆盖上参差不齐。构建过程中的核心挑战则包括:跨国统计口径的标准化协调、缺失值与未声明地理编码的处理、时间序列中指标定义漂移的识别,以及元数据中上下游来源信息的补全。这些挑战要求使用者在建模前必须审慎核查变量定义与单位,避免因标签推断而产生误导性政策结论。
常用场景
经典使用场景
在劳动经济学与人口统计学的交叉领域中,该数据集承载了非洲大陆劳动力市场结构化观测的核心功能。其经典使用场景聚焦于按性别、教育程度与婚姻状况三个维度对劳动力规模进行分层解析,研究者可借助这一覆盖四十九个非洲国家、时间跨度自1982年至2025年、逾十万条观测的表格型语料,开展劳动力参与率的横截面比较与纵向趋势追踪,进而刻画不同人口子群在就业市场中的分布形态与结构变迁。
解决学术问题
该数据集直面劳动经济学中长期存在的结构性不平等测度难题。既往研究常因非洲区域细分统计资料的匮乏而难以将性别差异、教育分层与婚姻状态同时纳入统一分析框架,本数据集以标准化表格格式整合三重分类变量,使研究者得以系统检验教育回报的性别异质性、婚姻状况与劳动供给之间的关联机制,以及各国内部劳动力结构的演化路径,为区域比较研究提供了可复现的数据基础。
衍生相关工作
以该数据集为基座,衍生出一系列围绕非洲劳动力市场异质性的经典研究。部分学者将其与非洲区域其他社会经济数据集进行国别与年份层面的联接,构建多维度劳动力福利评估模型;亦有研究聚焦于婚姻状态与女性劳动供给之间的因果关系识别,利用该数据的面板结构开展准实验分析;此外,该数据集还被用于训练面向表格数据的统计学习模型,以检验分类变量交互效应的稳健性。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务