遇见数据集

electricsheepafrica/africa-ilo-une-2une-sex-age-nb-unemployment-by-sex-and-age-ilo-modelled-estimates

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含非洲53个国家从1991年至2027年的失业数据,具体指标为“按性别和年龄划分的失业人数——国际劳工组织(ILO)2025年11月的模型估计(千人)”。数据来源于国际劳工组织的ILOSTAT数据库,涵盖了总计17,568个观测值。数据集字段包括国家代码、国家名称、数据来源、指标代码、性别分类(总计、男性、女性)、年龄分类、年份、观测值(失业人数,单位为千人)等。数据以年度频率发布,经过ILO的标准化处理,并包含数据质量说明,如使用最佳来源和分类字段的非空条件。该数据集适用于表格分类、表格回归和时间序列预测等机器学习任务,旨在为非洲提供统一、机器学习就绪的数据层。

This dataset contains unemployment data for 53 African countries from 1991 to 2027, specifically the indicator Unemployment by sex and age -- ILO modelled estimates, Nov. 2025 (thousands). The data is sourced from ILOSTAT, the International Labour Organizations central statistics database, with a total of 17,568 observations. Dataset fields include country code, country name, data source, indicator code, sex classification (total, male, female), age classification, year, observed value (unemployment in thousands), etc. The data is published at annual frequency, standardized by the ILO, and includes quality caveats such as the use of the best source and non-null conditions for disaggregation columns. It is suitable for machine learning tasks like tabular classification, tabular regression, and time-series forecasting, aiming to provide a unified, ML-ready data layer for Africa.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-une-2une-sex-age-nb-unemployment-by-sex-and-age-ilo-modelled-estimates 数据集图片
构建方式
该数据集由Electric Sheep Africa团队基于国际劳工组织(ILO)的ILOSTAT数据库构建而成。数据通过ILOSTAT REST API直接拉取,并以ISO3国家代码筛选出非洲区域,涵盖了53个非洲国家从1991年至2027年的失业率观测值。ILOSTAT依据国际劳工统计学家会议(ICLS)的定义对原始调查微观数据进行统一化处理,并在数据集的‘source.label’列中标注了数据来源,确保了数据的可追溯性和一致性。最终整理出包含17,568条观测值的数据集,每条记录均包含了国家、性别、年龄组、时间及失业观测值等关键字段。
特点
该数据集的核心特点在于其时空覆盖的广度与维度的精细性。时间跨度长达37年(1991–2027),覆盖了非洲大陆53个国家,提供了宏观的劳动市场趋势分析基础。在维度上,数据按性别(总、男、女)和年龄组(如成年、青年)进行拆解,允许研究者进行多角度、多层次的失业率分析。此外,数据来源于ILO的模型估算结果,并带有‘调整’状态标记,提供了对观测数据质量的透明说明。数据集采用Parquet格式打包,与HuggingFace Datasets库无缝集成,便于机器学习任务直接加载使用。
使用方法
该数据集设计为与HuggingFace Datasets库无缝集成,用户可通过一行Python代码直接加载数据:`load_dataset('electricsheepafrica/africa-ilo-une-2une-sex-age-nb-unemployment-by-sex-and-age-ilo-modelled-estimates')`。加载后,数据可直接转换为Pandas DataFrame进行探索性分析。典型应用包括按国家筛选时间序列数据、按指标绘制趋势图,或构建年份×国家的透视矩阵。数据集支持分类、回归及时间序列预测等多种任务场景,适合用于劳动经济学研究、政策分析及非洲区域发展建模等工作。
背景与挑战
背景概述
在非洲大陆,劳动力市场统计数据的稀缺性与碎片化长期制约着区域发展政策的精准制定。由国际劳工组织(ILO)依托ILOSTAT数据库编制的非洲失业数据集(1991–2027年),经Electric Sheep Africa重新封装后问世,覆盖53个非洲国家,包含17,568条观测记录,聚焦失业人数这一核心指标,并按性别和年龄维度进行细致分解。该数据集的核心研究问题在于如何利用标准化建模方法填补非洲各国因调查能力不均导致的数据空白,提供可比较的长期失业率估算。作为ILO模拟估算的产物,它整合了劳动力调查、行政记录等多源数据,为宏观经济分析、可持续发展目标(SDG)监测及非洲劳动力政策评估提供了关键的历史与预测基准,显著推动了非洲劳动经济学与数据驱动治理的研究进程。
当前挑战
该数据集所解决的领域问题核心在于非洲劳动力统计面临的系统脆弱性——许多国家的数据采集不连续、定义不统一,导致跨时间与跨国别的失业率比较充满不确定性。具体挑战包括:1)数据稀疏性:部分国家特定年份仅有模型估算而非实际调查值,依赖复杂的插补与校准算法,引入额外误差;2)定义异质性:各国对失业的定义与国际劳工统计学家会议(ICLS)标准间的差异尚未完全消除,影响纵向可比性;3)构建过程中的挑战:从ILOSTAT REST API抽取原始微数据后,需处理因调查来源不同导致的标记不一致问题(如source.label字段中的“Modelled Estimates”代表混合来源),并在重新封装时保持时序完整性,同时确保跨性别人口分解的零值无偏处理;4)时效性局限:该版本基于2025年11月模型,仅提供年度频率,缺失月度和季度波动信息,无法捕捉短期经济冲击下的失业动态。
常用场景
经典使用场景
非洲作为全球劳动力市场最为脆弱的区域之一,其失业问题长期受到国际发展经济学界的密切关注。该数据集汇聚了国际劳工组织ILOSTAT数据库基于统一方法论生成的失业率建模估计值,覆盖了1991年至2027年共53个非洲国家的17,568条观测记录,并细分至性别与年龄组别。经典应用场景包括纵向时间序列分析,用以描绘各国失业率的演变轨迹;跨截面比较研究,揭示不同国家与地区间劳动力市场的结构性差异;以及面板数据回归,探究经济增长、教育投入或政策干预对失业动态的深远影响。
实际应用
在实际政策制定与可持续发展议程中,该数据集展现出极强的决策支撑价值。国际发展机构与非政府组织可借助其覆盖全非洲的长时间序列失业数据,精准识别青年与女性劳动参与率偏低的重点区域,从而定向投放职业培训计划或就业促进项目。各国劳工部门亦可参照ILO的建模框架,弥补本国普查或抽样调查在间隔期内可能产生的数据空白,实时评估就业政策成效。此外,跨国企业基于该数据的区域劳动力供给分析,能够更理性地规划非洲市场的投资布局与用工策略。
衍生相关工作
该数据集的出现推动了若干衍生研究工作的蓬勃发展,突出表现在非洲劳动力市场计量模型的改进与预测工具的迭代上。一些前沿工作将ILO建模估计与卫星夜间灯光、移动信令等非传统数据源相结合,以高频代理变量增强失业预测的即时性。另有学者围绕该数据开发了面向非洲区域的可交互式失业可视化仪表盘,方便决策者直接按年份、性别与年龄组别进行动态查询。此外,基于该数据的因果推断研究如雨后春笋般涌现,例如利用面板空间计量方法分析邻国劳动力政策溢出效应,以及评估撒哈拉以南非洲数字化转型对青年失业的异质性影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务