遇见数据集

electricsheepafrica/africa-ilo-emp-temp-sex-ind-cbr-nb-employment-by-ilo-sector-and-sex-and-place-of-birt

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个关于非洲就业的表格数据集,包含13,170个观测值,覆盖32个非洲国家,时间跨度为2000年至2025年。数据来源于国际劳工组织(ILO)的中央统计数据库ILOSTAT,主题为就业。具体指标为EMP_TEMP_SEX_IND_CBR_NB,即按ILO部门、性别和出生地划分的就业数据(以千计)。数据集包含多个列,如国家代码、指标、性别分类(总计、男性、女性)、时间年份、观测值等,并提供了数据来源和质量说明。数据为年度频率,使用ILO选择的最佳来源,适用于表格分类、回归和时间序列预测任务。

This dataset is a tabular dataset on employment in Africa, containing 13,170 observations across 32 African countries, spanning the years 2000 to 2025. The data is sourced from ILOSTAT, the central statistics database of the International Labour Organization (ILO), with the topic being employment. The specific indicator is EMP_TEMP_SEX_IND_CBR_NB, which represents employment by ILO sector, sex, and place of birth (in thousands). The dataset includes columns such as country code, indicator, sex disaggregation (total, male, female), time year, observed value, and provides information on data sources and quality. The data is annual frequency, uses the ILO-selected best source, and is suitable for tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-emp-temp-sex-ind-cbr-nb-employment-by-ilo-sector-and-sex-and-place-of-birt 数据集图片
构建方式
该数据集由Electric Sheep Africa团队基于国际劳工组织(ILO)旗下ILOSTAT数据库的REST API构建而成。数据通过请求特定指标代码“EMP_TEMP_SEX_IND_CBR_NB”获取原始信息,并依据非洲国家ISO3代码进行地理范围过滤。构建过程中,ILOSTAT依据国际劳工统计学家会议(ICLS)标准对各国劳动力调查、家计调查及行政记录等原始微观数据进行统一整合与标准化处理,最终形成一份涵盖32个非洲国家、时间跨度从2000年至2025年、共计13,170条观测记录的就业数据集。数据来源在“source.label”列中得以标注,确保了溯源清晰。
特点
该数据集的核心特点在于其精细的多维度分层结构。除了基本的国家与年份信息外,数据按性别(男、女、总计)及ILO行业类别进行交叉分解,同时引入了出生地这一关键人口学变量,提供了对不同群体在特定行业就业状况的细致描摹。数据集包含“观测状态”与“注释说明”字段,用以标示数据是否为临时估算、方法修订或可信度不足等问题,帮助研究者审慎评估数据质量。此外,数据以年频率发布,并优先采用ILO选定的最佳来源,确保了跨时间与跨地域的可比性。
使用方法
该数据集可通过HuggingFace的`datasets`库便捷加载,仅需一行Python代码即可获得Pandas DataFrame格式数据。使用者可按国家代码检索特定国家的所有观测,或按时间序列对单一指标进行绘图分析,以直观揭示特定行业就业数量的演变趋势。通过数据透视功能,还可将长格式数据重塑为国家×年份的宽表矩阵,便于开展面板数据回归或聚类分析等计量研究。数据许可证为CC-BY-4.0,使用时需注明原始出处及Electric Sheep Africa的二次封装贡献。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)下属的统计数据库ILOSTAT于2025年整理并重新发布,由Electric Sheep Africa在HuggingFace平台上进行封装与标准化处理,聚焦于非洲32个国家在2000年至2025年间按ILO行业、性别及出生地划分的就业数据(单位:千人)。作为全球劳动统计领域的权威来源,ILOSTAT通过整合各国劳动力调查、家计调查及行政记录数据,为理解非洲大陆的劳动力市场结构变迁提供了关键支撑。该数据集包含13,170条观测值,覆盖1个核心指标,其精细化的分类维度——包括性别(总、男、女)与行业及出生地的交叉分层——使得研究者能够深入剖析非洲就业格局中因性别与地域因素引发的差异,为制定包容性就业政策提供了科学依据。其影响力体现在:它不仅填补了非洲地区长期缺乏标准化、跨国家、长时序就业细分数据的空白,还为劳动经济学、发展经济学及国际比较研究提供了可复现的数据基础。
当前挑战
该数据集所应对的核心领域挑战在于:非洲大陆长期面临就业数据碎片化、统计口径不一致以及时间序列不连续的问题,使得跨国家、跨时期的劳动力市场比较分析充满困难,尤其是按性别与出生地划分的就业结构数据极为稀缺,阻碍了对区域内弱势群体就业状况的精准评估。在构建过程中,数据整合面临多重挑战:首先,各国原始调查数据在采集方法、问卷设计及定义标准上存在显著差异,ILOSTAT需依据国际劳工统计学家会议(ICLS)定义进行复杂的数据协调与质量标记,例如通过“obs_status”字段标注数据是否可靠或临时,并借助“note_indicator”字段记录方法论变更带来的序列断裂。其次,数据筛选与地域聚焦需从ILOSTAT的全球API接口中提取非洲国家的特定子集,并处理部分国家数据稀疏、年份覆盖率不均(如某些国家仅有个别年份数据)的问题。此外,分类维度(如行业分类“classif1”与出生地分类“classif2”)在部分观测值中可能存在缺失,需要在保证数据可用的前提下进行合理的空值处理与注释,以确保时间序列分析中的连续性与可比性。
常用场景
经典使用场景
在劳动经济学与发展经济学的研究中,非洲大陆的就业结构分析长期受困于数据碎片化与统计口径不一。该数据集整合了国际劳工组织ILOSTAT权威数据库,覆盖32个非洲国家2000至2025年的年度就业指标,依据ILO行业分类、性别与出生地三个维度进行精细拆解,共计13,170条观测记录。研究者可直接利用其时间序列特性分析非洲各国就业规模的演变趋势,或通过分类变量开展跨国、跨性别及跨行业的比较研究。数据集以规范的表格形式呈现,包含ISO国家代码、来源标注与观测状态标识,便于直接接入面板数据回归模型、聚类分析或机器学习预测任务,为非洲劳动力市场的宏观计量分析提供了标准化的数据基底。
解决学术问题
长期以来,非洲劳动力市场研究面临两大瓶颈:一是各国统计调查频率不一、定义迥异导致数据可比性差;二是缺乏同时涵盖性别、行业与出生地三个核心维度的长期面板数据。该数据集通过ILO对原始调查微观数据的统一整合与ICLS定义校准,显著缓解了上述困境。它使得学者能够系统回答诸如非洲经济增长是否伴随性别就业差距缩小、非正规部门的行业分布特征、以及移民与本地出生人口的就业结构差异等传统议题。更重要的是,该数据为检验国际发展经济学中的“结构转型”理论提供了实证依据,例如评估非洲国家产业就业份额变迁是否符合配第—克拉克定理,从而为劳动经济学界关于非洲就业非正规化与去工业化假说的辩论提供了可重复验证的数据支撑。
衍生相关工作
该数据集的发布推动了非洲劳动力市场量化研究生态的发展,催生了多项衍生工作。一方面,研究者将其与ILOSTAT中其他指标如工资、工作时长或非正规就业率进行关联分析,构建非洲体面就业综合指数;另一方面,Electric Sheep Africa团队基于此类标准化数据开发了ML-Ready的数据管道,使研究者能够利用`load_dataset()`快速将其接入诸如时序预测模型(如Prophet或LSTM)以预测非洲各国就业趋势。在学术层面,已有工作基于该数据构建了非洲性别就业差距的贝叶斯分层模型,并与世界银行企业调查数据进行匹配,分析制度环境对就业结构的影响。此外,该数据集的纵向覆盖特性也使其成为检验机器学习领域域适应与迁移学习方法的基准数据集,尤其是针对数据稀疏的非洲小国进行插值填补的方法论创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务