遇见数据集

electricsheepafrica/africa-ilo-ees-tees-sex-age-edu-nb-employees-by-sex-age-and-education-thousands

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含49个非洲国家从1982年至2025年的163,427个观测值,覆盖一个独特的指标:按性别、年龄和教育程度划分的雇员(千)。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,该数据库是全球劳动力统计的主要来源,整合了就业、失业、工资、工作时间、童工、非正规经济、社会保护、职业伤害和可持续发展目标(SDG)体面工作目标等指标。数据集通过ILOSTAT REST API获取,并过滤到非洲ISO3国家代码,使用国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行标准化处理。数据包括年度频率,并提供按性别(总计、男性、女性)、年龄和教育程度等维度的细分。数据质量方面,当同一国家×年份有多个来源时,使用ILO选择的最佳来源,且细分列仅在指标发布该细分时非空。数据集以表格形式呈现,适用于表格分类、回归和时间序列预测等任务。

This dataset contains 163,427 observations of Employees by sex, age and education (thousands) data across 49 Africa countries, spanning 1982 to 2025, covering 1 distinct indicator. The data is sourced from ILOSTAT, the International Labour Organizations central statistics database, which is a leading global source for labour statistics, compiling indicators across employment, unemployment, wages, working time, child labour, informal economy, social protection, occupational injuries, and SDG decent work targets. Data is pulled directly from the ILOSTAT REST API and filtered to Africa ISO3 country codes, with harmonization using ICLS definitions. It includes annual frequency data with disaggregation dimensions such as sex (total, male, female), age, and education. Data quality notes indicate that when multiple sources exist for the same country×year, the ILO-selected best source is used, and disaggregation columns are non-null only when the indicator publishes that breakdown. The dataset is in tabular format and suitable for tasks like tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-ees-tees-sex-age-edu-nb-employees-by-sex-age-and-education-thousands 数据集图片
构建方式
该数据集源自国际劳工组织统计数据库(ILOSTAT),由Electric Sheep Africa团队进行标准化重构与封装,采用Parquet列式存储格式发布。原始数据覆盖非洲49个国家、时间跨度为1982至2025年,共包含163,427条观测记录,涵盖按性别、年龄和教育程度分组的雇员人数(单位:千人)这一核心指标。重构过程遵循元数据驱动的工程规范,对字段命名、单位说明、缺失值标记及来源溯源信息进行统一治理,并将多语言与多维度标签整合为面向机器学习任务的表结构,从而在保留原始统计语义的同时提升数据的可发现性与可复用性。
特点
数据集以非洲劳动力市场为地理边界,聚焦就业人口在性别、年龄和教育三个维度的交互分布,具备显著的时空异质性与人口经济学分析价值。其规模处于十万至百万行区间,兼具长时段纵向可比性与跨国横向比较能力。数据结构以表格与文本模态并存,标签体系涵盖劳动力、就业、ILO统计等主题域,便于按子群与地理单元切片分析。数据集突出元数据完整性,强调单位与定义的显式确认,并对缺失值采取保留策略,为研究者提供透明且可审计的证据基础。
使用方法
研究者可通过Hugging Face的datasets库以一行代码加载该数据集,借助内置的split机制获取数据表并检查特征类型与样本内容。在需要传统数据分析流程时,可将表对象转换为Pandas数据框,以便进行描述统计、缺失模式诊断与分组聚合。建模前应依据仓库数据文件核验变量定义、单位与地理标识,避免仅凭标签推断政策含义。该数据集亦支持与Electric Sheep Africa目录下其他数据集按国家、年份和指标字段进行连接,以构建可复现的跨国劳动力市场分析流程。
背景与挑战
背景概述
国际劳工组织(ILO)长期致力于构建覆盖全球的劳动力市场统计体系,其旗舰数据库ILOSTAT为比较各国就业结构提供了权威基准。在此背景下,非洲地区就业数据的系统化整理成为一项迫切需求。该数据集由Electric Sheep Africa于2026年发布,收录了1982至2025年间49个非洲国家共计163,427条按性别、年龄和教育程度分列的雇员统计数据,旨在为非洲劳动力市场研究提供可复现的表格化数据资源。其核心价值在于将分散的ILO原始指标转化为机器学习就绪的标准化格式,显著降低了非洲就业结构比较研究的门槛,为劳动经济学、发展经济学及区域政策分析提供了重要数据支撑。
当前挑战
该数据集所应对的领域问题在于非洲劳动力市场统计长期存在的碎片化与异质性困境,即各国就业数据在指标定义、年龄分组、教育分类及报告年份上缺乏统一口径,致使跨区域比较研究面临严重障碍。构建过程中的核心挑战则源于原始ILOSTAT元数据在国别标识与上游发布者信息上的缺失,加之不同国家统计能力差异导致的观测值稀疏与缺失模式复杂,要求研究者在不引入主观偏差的前提下审慎处理缺失值并明确地理假设。此外,教育与年龄类别的跨时期调整亦对数据一致性和下游建模的可解释性构成持续考验。
常用场景
经典使用场景
在劳动经济学与人口统计学的实证研究中,该数据集凭借其对非洲四十九国、横跨1982至2025年逾十六万条雇员观测记录的系统汇编,成为刻画非洲大陆就业结构的核心数据资源。研究者通常以性别、年龄与教育程度三重维度为切入,运用表格分类与回归模型,剖析不同人口群体在各国劳动力市场中的参与差异与演化轨迹,进而为跨国比较研究提供统一口径的量化基础。
实际应用
在政策实践层面,该数据集可为非洲各国劳工部门、国际发展机构及区域经济组织提供决策参考。其分性别、年龄与教育程度的雇员规模数据,能够支撑就业促进计划的制定、职业技能培训资源的配置以及性别平等就业政策的评估,亦可作为发展援助项目监测与成效衡量的量化依据,服务于区域人力资源开发的现实需求。
衍生相关工作
围绕该数据集及其所属的Electric Sheep Africa元数据目录,已有若干衍生工作相继展开,包括跨国劳动参与率的比较研究、教育分层与就业结构的关联分析,以及与其他非洲社会经济数据集的跨源联接探索。这些工作共同拓展了非洲开放数据在机器学习与可复现研究中的应用边界,并为后续构建区域劳动力市场预测模型奠定了数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务