遇见数据集

electricsheepafrica/africa-ilo-pop-xflc-sex-cct-nb-inflow-of-working-age-foreign-citizens-by-sex-and

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含144个观测值,涉及4个非洲国家(2014-2020年),涵盖一个特定指标:按性别和国籍划分的工作年龄外国公民流入量(千人)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,主题为国际移民流动,经过处理并重新打包,适用于表格分类、回归和时间序列预测等任务。

This dataset contains 144 observations across 4 African countries from 2014 to 2020, covering one specific indicator: inflow of working age foreign citizens by sex and country of citizenship (thousands). The data is sourced from the International Labour Organization (ILO) ILOSTAT database, focusing on international migrant flow, and has been processed and repackaged for use in tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-pop-xflc-sex-cct-nb-inflow-of-working-age-foreign-citizens-by-sex-and 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,通过REST API直接抽取指标POP_XFLC_SEX_CCT_NB的数据,并依据非洲ISO3国家代码进行地域过滤。ILOSTAT自身依据国际劳工统计学家会议(ICLS)定义,对原始调查微观数据进行统一协调处理,同时以source.label字段标记数据来源,确保可追溯性。数据集由Electric Sheep Africa团队重新封装,转为ML-Ready的Parquet格式,共包含144条观测记录,覆盖4个非洲国家,时间跨度为2014年至2020年。
特点
该数据集聚焦于国际迁移流动中的劳动力维度,专门记录进入劳动年龄的外国公民数量(单位:千),并按性别和公民身份国别进行细致划分。数据集中包含sex字段,提供总计、男性和女性三种分类,便于进行性别维度的对比分析。此外,数据集还引入了classif1等分类变量,用于标识公民身份归属,尽管该维度仅含一个类别。整体而言,数据结构简洁,但纵向时间序列与横向国家、性别交叉特征显著,适合探究非洲部分地区跨国劳动力流入的时空演变规律。
使用方法
用户可通过HuggingFace Datasets库的load_dataset()函数一键加载数据集,并将其转换为Pandas DataFrame进行后续分析。示例包括按国家筛选(如ref_area=='KEN')、对单个指标进行时间序列可视化(需按time排序obs_value),以及构建国家×年份的透视矩阵(pivot_table)。此外,数据集支持分类与回归任务,以及时间序列预测,便于研究者构建预测模型或进行描述性统计分析。建议在引用时同时标注原始ILO数据和Electric Sheep Africa的重新封装贡献。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2020年通过其ILOSTAT数据库发布,并由Electric Sheep Africa团队重新打包整理,聚焦于非洲地区劳动年龄外国公民的流入情况。数据涵盖2014年至2020年间4个非洲国家(几内亚、埃塞俄比亚、布基纳法索、肯尼亚)的144条观测记录,核心指标为按性别和国籍分类的劳动年龄外国公民流入量(单位:千人)。该数据集填补了非洲国际劳动力迁移量化研究的数据空白,为分析区域劳动力市场动态、移民政策影响及可持续发展目标(SDG)中的体面工作指标提供了关键支撑,在劳动经济学和人口迁移研究领域具有重要参考价值。
当前挑战
该数据集所解决的领域问题在于,非洲地区国际劳动力迁移数据长期匮乏且碎片化,难以支撑精细化政策分析与模型构建。数据构建过程中面临多重挑战:首先,原始数据来源多样,包括劳动力调查、人口普查及行政记录,需通过ILO的ICLS定义进行标准化处理,但不同来源的统计口径与时间粒度差异显著。其次,非洲国家数据覆盖不均衡,仅4国提供完整信息,且观测期长短不一(如几内亚仅2014年数据),导致时序分析存在断层。此外,部分观测值的可靠性标志缺失,增加了数据质量评估的复杂性。
常用场景
经典使用场景
该数据集聚焦于非洲四国(几内亚、埃塞俄比亚、布基纳法索、肯尼亚)2014至2020年间按性别和国籍分类的适龄劳动外国公民流入量,涵盖144条观测记录。研究者常将其用于构建跨国劳动力迁移的预测模型,通过时间序列分析揭示非洲区域内人口流动的性别结构特征与国别差异。其经典应用场景包括利用表格数据进行回归分析,以量化经济因素、政策环境与移民流量的关联性;或作为分类任务的基础,预测特定年份内某一国家的外来劳动力规模。
解决学术问题
在学术研究中,该数据集有效回应了非洲劳动迁移领域数据稀缺的困境,为国家间劳动力流动的性别分层与区域异质性分析提供了可靠支撑。它有助于解构国际移民流量的驱动机制,例如探究经济增长、就业机会与政治稳定性如何塑造非洲内部的劳动力再分配。此外,数据中按国籍细分的字段使学者能够检验移民网络效应与邻国溢出效应,深化对非洲大陆一体化进程中人口动态的理论认知,为发展经济学和人口地理学贡献了关键实证依据。
衍生相关工作
基于该数据集衍生出的经典工作包括构建非洲劳动力迁移的时空预测模型,将其与国际劳工组织的就业指标融合,开发用于监测可持续发展目标(SDG)中体面工作进展的工具。另有研究将其与非洲大陆自由贸易区(AfCFTA)的政策评估相结合,探讨贸易自由化如何通过劳动力流动性影响区域经济格局。此外,该数据已被整合进面向非洲的机器学习基准数据集,推动迁移模式自动识别算法的研发,为后续跨国比较研究奠定了标准化基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务