遇见数据集

electricsheepafrica/africa-ilo-une-tune-sex-edu-nb-unemployment-by-sex-and-education-thousands

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)核心统计数据库ILOSTAT的失业数据,专门针对非洲地区。数据集涵盖了49个非洲国家从1982年至2025年的10,841个观测值,聚焦于一个指标:按性别和教育程度划分的失业人数(千人)。数据通过ILOSTAT REST API获取,并过滤为非洲国家代码,使用国际劳工统计学家会议(ICLS)的定义对原始调查微观数据进行协调,确保数据可比性。数据集包括国家代码、国家名称、数据来源、指标代码、性别分组、教育分类、观测年份、观测值、观测状态标志等列,并提供了数据质量注意事项,如数据为年度频率、使用ILO选择的最佳来源等。该数据集由Electric Sheep Africa重新打包,旨在为非洲提供统一的、适合机器学习的数据层。

This dataset contains unemployment data from ILOSTAT, the ILOs central statistics database, specifically for Africa. It includes 10,841 observations across 49 African countries spanning from 1982 to 2025, focusing on one indicator: Unemployment by sex and education (thousands). Data is pulled directly from the ILOSTAT REST API and filtered to Africa ISO3 country codes, with ILOSTAT harmonizing raw survey microdata using International Conference of Labour Statisticians (ICLS) definitions to ensure comparability. The dataset includes columns such as country code, country name, data source, indicator code, sex disaggregation, education classification, observation year, observed value, observation status flags, and provides data quality caveats, such as annual frequency and use of ILO-selected best source. It is repackaged by Electric Sheep Africa as part of a unified, ML-ready data layer for Africa.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-une-tune-sex-edu-nb-unemployment-by-sex-and-education-thousands 数据集图片
构建方式
该数据集脱胎于国际劳工组织核心统计数据库ILOSTAT的失业指标,经Electric Sheep Africa以标准化元数据流程重新封装而成。构建路径以非洲区域为边界,系统汇集1982年至2025年间49个非洲国家的失业观测记录,共计10,841条,涵盖性别与教育程度两个维度,以千人为计量单位组织为表格化数据。数据以parquet格式发布,保留原始缺失值,未作插补,并通过统一元数据清单赋予可发现性与可复现性,从而使源自权威劳动统计体系的信息转化为适配机器学习工作流的就绪资源。
特点
数据集以长时段、跨国别、多维分组为显著特征,时间跨度逾四十年,地理范围基本覆盖非洲大陆,并以性别与受教育程度构成交叉分类框架,便于刻画失业结构的异质性。其体量处于一万至十万行区间,属中等规模表格数据,同时提供文本模态以承载元数据描述。许可协议为CC BY 4.0,允许在署名前提下自由使用与再分发,且附带来源说明与引用模板,为学术研究与政策分析提供透明度与合规保障。
使用方法
使用者可通过Hugging Face datasets库以一行代码加载数据集,返回的字典对象包含可用划分,借助features属性检视字段结构,并可通过to_pandas方法转换为数据框以衔接Python分析生态。分析前应优先核查国家列、年份与指标定义,明确单位与缺失机制,避免仅凭标签推断政策含义。该数据适合开展按地理、时间与亚组的剖面分析,亦可依据显式国家、年份与指标字段与其他非洲数据集联接,构建可复现的研究笔记本。
背景与挑战
背景概述
非洲劳动力市场长期面临就业结构失衡与教育错配的困扰,失业率的性别差异与教育梯度更是政策制定者关注的焦点。在此背景下,Electric Sheep Africa于2026年基于国际劳工组织ILOSTAT的权威统计,整理发布了覆盖49个非洲国家、时间跨度自1982年至2025年的失业数据,共计逾万条观测记录,按性别与教育程度分层呈现。该数据集以标准化元数据与Parquet格式降低了非洲经济数据的获取门槛,为劳动经济学研究、区域就业政策评估及性别平等议题提供了可复现的量化基础,推动了非洲开放数据生态的建设。
当前挑战
该数据集所回应的核心领域问题在于:如何以统一、可比的跨国面板数据刻画非洲失业率的性别与教育维度差异,从而支撑劳动市场政策分析。构建过程中的主要挑战包括:非洲各国统计能力参差,ILOSTAT原始数据在报告频率、指标定义与覆盖年份上存在显著异质性,需在整合时加以协调;性别与教育交叉分类常导致样本稀疏与缺失值密集,可能削弱估计稳健性;部分国家元数据中地理标识缺位,需依赖推断而非确证;此外,失业统计的国别方法差异与教育分类体系不一致,亦对跨国比较的可信度构成潜在制约。
常用场景
经典使用场景
在劳动经济学与非洲发展研究的交汇处,基于性别与受教育程度剖析失业结构始终是核心议题。该数据集囊括49个非洲国家自1982年至2025年间共计10,841条观测记录,以千人计失业人口为度量单位,为研究者提供了跨国家、跨时期、跨人口亚组的立体化失业面板。其最经典的使用场景在于构建多层次失业率模型,通过性别与教育维度的交叉分层,刻画非洲劳动力市场中失业分布的异质性特征,并借助面板回归、聚类分析或时间序列分解等方法,识别不同受教育群体在性别间的脆弱性差异,从而为比较劳动经济学提供标准化、可复现的数据基础。
实际应用
在政策实践层面,该数据集为非洲各国劳工部门、国际发展机构及区域经济共同体提供了可操作的决策依据。通过识别特定性别与教育层级中失业率异常高企的国家与时段,政策制定者可精准定位技能错配最为严重的群体,进而设计针对性的职业培训、教育补贴或就业促进方案。国际组织亦可借助该数据集监测可持续发展目标中充分就业与体面劳动指标的进展,评估既有干预措施在缩小性别鸿沟方面的成效。此外,企业与社会投资者可依据受教育女性的失业分布研判区域人力资本存量与潜在市场机会,辅助选址与人才战略的制定。
衍生相关工作
该数据集作为Electric Sheep Africa开放数据目录的组成部分,衍生出一系列围绕非洲劳动市场计量分析的经典工作。研究者将其与非洲开发银行的社会经济数据库、世界银行的世界发展指标以及各国劳动力调查微观数据加以链接,构建出更具解释力的多源融合模型。部分后续研究基于该数据集发布了非洲失业性别差距的可视化仪表盘与国别诊断报告,亦有学者以此为基础训练机器学习模型以预测不同教育群体失业率的演变趋势。Electric Sheep Africa标准化元数据框架本身亦被其他非洲数据集的策展工作所借鉴,形成了开放数据工程与劳动统计交叉领域的持续性影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务