遇见数据集

electricsheepafrica/africa-ilo-une-tune-sex-edu-cbr-nb-unemployment-by-sex-education-and-place-of-birth-t

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含4,103个观测值,覆盖33个非洲国家,时间跨度为1991年至2025年,主要指标是“国际移民存量”数据,具体指标为UNE_TUNE_SEX_EDU_CBR_NB,即按性别、教育和出生地划分的失业人数(以千计)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤到非洲国家。数据集包括国家代码、年份、观测值、性别分类(总计、男性、女性)、教育水平和出生地等维度,并提供了数据质量说明和使用示例。数据集以表格形式存储,适用于表格分类、回归和时间序列预测等任务。

This dataset contains 4,103 observations of International migrant stock data across 33 Africa countries, spanning 1991–2025, covering 1 distinct indicator: UNE_TUNE_SEX_EDU_CBR_NB (Unemployment by sex, education and place of birth in thousands). The data is sourced from ILOSTAT, the ILOs central statistics database, via API and filtered to Africa ISO3 country codes. It includes columns such as country code, year, observed value, sex disaggregation (total, male, female), education level, and place of birth, with notes on data quality and usage examples. The dataset is formatted for tabular tasks like classification, regression, and time-series forecasting.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-une-tune-sex-edu-cbr-nb-unemployment-by-sex-education-and-place-of-birth-t 数据集图片
构建方式
该数据集脱胎于国际劳工组织统计数据库(ILOSTAT)的原始汇编,并由Electric Sheep Africa团队以元数据驱动的方式重新封装发布。构建过程遵循标准化流程,对1991年至2025年间33个非洲国家的失业统计数据实施系统化整理,将性别、教育程度与出生地等人口维度嵌入统一的表格结构之中,同时保留来源标识与许可信息,形成兼具可追溯性与可复用性的分析型数据资产。
特点
数据集以表格与文本双重模态呈现,涵盖4103条观测记录,聚焦非洲区域失业问题的多维分布特征。变量设计兼顾性别、教育水平与出生地三类分层要素,使研究者得以透视劳动力市场中的结构性差异。数据以parquet格式存储,便于高效读取与列式分析;标签体系覆盖劳动经济学、国际移民存量与就业状况等主题,并附带缺失值提示与来源元数据,为严谨的实证研究提供基础支撑。
使用方法
研究者可依托Hugging Face数据集库以编程方式加载该数据,借助数据集查看器快速浏览变量结构与样本记录。在建模前建议先审视各字段的缺失情况与定义口径,必要时转换为Pandas数据框进行清洗与探索性分析。使用过程中应保留国家、年份等显式标识字段,以便与其他非洲数据集进行横向联结;对地理信息仅由标题隐含的情形,需在分析文档中明确假设,并审慎对待缺失值的插补决策。
背景与挑战
背景概述
在全球化劳动力市场深化与人力资本跨国流动加剧的背景下,非洲大陆的失业结构性特征及其与出生地、性别、教育水平的关联始终是劳动经济学与发展研究的核心议题。国际劳工组织(ILO)作为全球劳工统计的权威机构,其ILOSTAT数据库长期为非洲各国就业政策评估提供基准。然而,非洲区域数据长期面临碎片化、口径不一与可发现性不足的困境。2026年,Electric Sheep Africa在Hugging Face平台发布该数据集,将ILOSTAT中1991至2025年间覆盖33个非洲国家的4103条观测记录进行标准化重封装,以统一元数据图谱提升非洲数据的可检索性与可复用性,为跨国比较研究与机器学习建模奠定基础。
当前挑战
该数据集所应对的核心领域问题在于:如何在跨国、跨时期且社会经济背景高度异质的非洲情境下,可靠地刻画出生地、性别与教育程度对失业的交互影响。其构建过程亦面临多重挑战:其一,原始ILOSTAT数据在各国统计能力差异下存在指标定义、教育分类与出生地范畴的非标准化问题;其二,元数据清单中country与upstream_publisher字段的缺失,迫使下游分析必须显式声明地理与来源假设;其三,迁移存量与失业指标间的概念边界需谨慎辨析,避免将标签直接等同于政策含义;其四,1K至10K的规模限制了对高维交互效应的精细化估计能力。
常用场景
经典使用场景
在劳动经济学与人口统计学的交叉研究中,该数据集堪称剖析非洲劳动力市场结构性失衡的经典素材。凭借涵盖33个非洲国家、跨越1991至2025年的4,103条观测记录,研究者得以按性别、教育程度与出生地三维度对失业规模展开细粒度比较。其典型使用场景包括构建面板数据模型以识别失业率的教育梯度与性别差异,或借助出生地变量揭示国际移民与本土劳动力在就业机会上的异质性,进而为非洲区域一体化背景下的劳动力流动政策提供实证依据。
实际应用
在政策实践层面,该数据集可直接服务于非洲各国劳工部与国际组织的就业监测与干预设计。通过追踪不同出生地群体与教育层次的失业演变,决策者可精准定位脆弱人群并优化职业培训资源配置。国际移民组织亦可借助出生地维度评估移民融入劳动力市场的成效,进而调整社会保护与语言培训方案。此外,世界银行与非洲开发银行在国别伙伴战略中可将该数据作为就业诊断的基准输入,支撑包容性增长项目的绩效评估与目标设定。
衍生相关工作
依托Electric Sheep Africa的元数据治理框架,该数据集已催生一系列衍生性研究工作。典型者包括以非洲移民存量为主题的跨库关联分析,将本数据集与Electric Sheep Africa目录下的国际移民存量数据相衔接,用以考察出生地属性对失业的调节效应。亦有研究者基于其教育分层结构构建非洲青年就业脆弱性指数,或结合性别维度开展失业持续期的生存分析。这些工作共同拓展了ILOSTAT原始数据的可复用边界,并推动非洲开放数据生态向可复现研究范式演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务