遇见数据集

electricsheepafrica/africa-ilo-emp-xfrb-sex-cbr-nb-employed-foreign-born-population-by-sex-and-countr

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含2014年至2024年间18个非洲国家的584个观测值,涉及“按性别和出生国划分的就业外国出生人口(千人)”这一指标。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API获取并过滤到非洲地区,使用国际劳工统计学家会议(ICLS)定义进行协调。数据集涵盖国家代码、国家名称、数据来源、指标代码、性别分类、时间年份、观测值等字段,用于表格分类、回归和时间序列预测等任务。

This dataset contains 584 observations of employed foreign-born population by sex and country of birth (in thousands) across 18 African countries from 2014 to 2024. It is sourced from ILOSTAT, the International Labour Organizations statistics database, with data harmonized using International Conference of Labour Statisticians definitions. The dataset includes fields such as country code, country name, source, indicator code, sex disaggregation, year, and observed values, and is designed for tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-emp-xfrb-sex-cbr-nb-employed-foreign-born-population-by-sex-and-countr 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,通过REST API接口直接获取原始指标数据(指标代码:EMP_XFRB_SEX_CBR_NB),并依据非洲ISO3国家代码进行地理范围筛选。ILOSTAT基于国际劳工统计学家会议(ICLS)定义对各国劳动力调查、住户收入调查、机构调查及行政记录等微观数据进行统一清洗与标准化处理,确保跨国家、跨年度的数据可比性。数据经由Electric Sheep Africa重新打包,转换为Parquet格式并发布至HuggingFace平台,以支持机器学习工作流的便捷调用。
特点
数据集涵盖2014至2024年间18个非洲国家的584条观测记录,聚焦于“按性别和出生国划分的受雇外国出生人口(千人)”这一核心指标。其特点在于提供了多维度分层信息,包括性别(总计、男性、女性)和出生国类别,同时保留了来源标注(source.label)以增强数据溯源能力。数据为年度频率,且在每个国家—年份组合中采用ILO挑选的“最佳来源”,兼顾了数据的权威性与一致性。样本量虽小,但覆盖非洲多个次区域,为跨国比较与趋势分析提供了基础。
使用方法
用户可通过HuggingFace Datasets库以load_dataset()函数一键加载数据,并转换为Pandas DataFrame进行后续处理。典型操作包括按国家代码(ref_area)筛选特定国家的时间序列数据,按指标排序后利用`obs_value`列进行可视化分析,或通过pivot_table构建国家×年份的截面矩阵。数据集预置了性别的分层键,便于研究者按性别子组展开对比分析。结合ILOSTAT官方文档中的指标定义,用户可进一步探索就业、失业、工资等相关主题,形成对非洲劳动力迁移格局的深入认知。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计数据库ILOSTAT于2024年创建,并由Electric Sheep Africa团队重新打包发布,聚焦于2014至2024年间18个非洲国家中按性别和出生国分类的就业型外国出生人口数据。作为全球劳动力统计的权威来源,ILOSTAT基于各国劳动力调查、行政记录等资料进行数据整合与标准化,旨在为非洲移民劳动力市场研究提供精细化、可比较的时序数据。该数据集共包含584条观测记录,覆盖单指标EMP_XFRB_SEX_CBR_NB,其发布填补了非洲区域在跨国劳动力流动量化分析上的数据空白,为政策制定者、发展经济学家和迁移研究者评估外来劳工对东道国经济贡献提供了可靠基础,尤其对理解非洲内部迁移与就业结构具有重要推动作用。
当前挑战
该数据集面临的挑战首先体现在领域层面:非洲多数国家缺乏系统化的劳动力调查体系,导致数据采集频率不一、统计口径差异显著,部分国家仅有单一年份观测,难以支撑稳健的时序分析和跨区域比较。构建过程中,国际劳工组织需对来自18国的异构原始数据进行清洗、插补和一致性校验,例如处理不同调查问卷对“外国出生”定义的偏差,以及应对高频缺失值——如部分国家性别或年龄维度的分类信息不完整。此外,数据集仅提供年度频率,对季度或月度波动性较强的就业现象捕捉能力有限;同时,部分观测状态被标记为临时性或不可靠,进一步增加了模型训练与政策推断的不确定性。
常用场景
经典使用场景
在劳动经济学与移民研究的交汇领域,该数据集常被用于分析非洲国家外国出生人口的就业分布及其时间演变趋势。研究者依托2014至2024年间18个非洲国家的观测数据,通过时间序列建模或面板数据分析,揭示国际移民在非洲大陆劳动市场的融入模式。数据的性别维度拆解使其特别适合探讨跨国劳动流动的性别差异,而按出生国分类的就业人数指标则为估算移民群体的经济贡献提供了量化基础。
实际应用
在实际应用层面,该数据集为国际组织与国家统计部门提供了关键的政策支撑工具。国际劳工组织利用此类数据监测非洲区域体面劳动目标(SDG 8)的进展,各国政府则据此制定针对移民群体的就业融合政策。具体的应用场景包括评估移民对特定行业劳动力缺口的补充作用、指导劳动技能培训项目的定向投放,以及作为社会保障体系覆盖率测算的依据。非政府组织亦可借助性别维度的数据设计促进移民女性就业的精准干预方案。
衍生相关工作
围绕该数据已衍生出多项标志性研究成果与工具。基于其时间序列结构,研究者开发了非洲国家移民就业动态的预测模型,并与世界银行国际移民存量数据库进行交叉验证。在方法论层面,相关工作催生了适用于混合频率数据(年度观测与季度调查结合)的缺失值插补算法。此外,该数据与ILOSTAT平台其他指标(如工资中位数、非正规就业率)的联合使用,催生了衡量移民就业质量的综合指数构建方法,成为后续非洲劳动市场研究的基准参照系。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务