遇见数据集

electricsheepeurope/europe-ilo-emp-xflc-sex-eco-nb-inflow-of-employed-foreign-citizens-by-sex-and-eco

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的按性别和经济活动划分的就业外国公民流入量(千人)指标数据,覆盖10个欧洲国家(法国、芬兰、丹麦、挪威、斯洛文尼亚、马耳他、德国、斯洛伐克、比利时、罗马尼亚),时间范围为2013年至2024年。数据集共有975条观测记录,每条记录包括国家代码、指标代码、性别分类(总计、男性、女性)、年份、观测值(单位:千人)以及其他元数据(如数据来源、状态标志)。数据以年度频率发布,经过ILO基于国际劳工统计学家会议(ICLS)定义进行标准化处理。数据集适用于表格分类、回归和时间序列预测等机器学习任务,旨在为研究欧洲劳动力市场和国际移民流动提供ML就绪的数据支持。

This dataset contains the Inflow of employed foreign citizens by sex and economic activity (thousands) indicator data from the International Labour Organization (ILO) ILOSTAT database, covering 10 European countries (France, Finland, Denmark, Norway, Slovenia, Malta, Germany, Slovakia, Belgium, Romania) from 2013 to 2024. It includes 975 observations, each with country codes, indicator codes, sex disaggregation (total, male, female), year, observed values (in thousands), and other metadata (e.g., data source, status flags). The data is published at an annual frequency and harmonized by ILO based on International Conference of Labour Statisticians (ICLS) definitions. The dataset is suitable for machine learning tasks such as tabular classification, regression, and time-series forecasting, providing ML-ready data for studying European labor markets and international migrant flows.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-xflc-sex-eco-nb-inflow-of-employed-foreign-citizens-by-sex-and-eco 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,通过REST API直接抽取标识符为EMP_XFLC_SEX_ECO_NB的指标数据,经筛选聚焦于欧洲地区的ISO3国家代码。ILOSTAT依据国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一协调,数据来源在source.label列中予以标注,确保可追溯性。Electric Sheep Europe在此基础上对数据进行了重新封装,整合为975条观测记录,涵盖2013至2024年间10个欧洲国家的劳动力流入信息。
特点
数据集以国际移民流动为核心主题,专注于受雇外国公民按性别和经济活动分类的流入量(单位:千)。其包含的观测覆盖了法国、芬兰、丹麦、挪威等10个欧洲国家,时间跨度达12年。数据架构丰富,设有ref_area、sex、classif1等16个字段,其中sex维度提供“总计”、“男性”、“女性”三类性别分类,classif1则记录经济活动的大类划分。数据质量方面,ILO对同一国家年份可能存在的多源数据采用“最佳来源”原则,并标注观测状态如暂定或不可靠,确保研究者能辨别数据精准度。
使用方法
研究者可通过Hugging Face的datasets库轻松加载该数据集,调用load_dataset()函数即可获得可转换为Pandas DataFrame的训练集,便于进行表格分类、回归或时间序列预测等任务。具体应用包括:按国家筛选(如德国)、按单一指标构建时间序列并绘制趋势图,或通过数据透视将年度观测重塑为国家×年份的矩阵。鉴于数据已按统一模式打包为Parquet格式,用户无需额外预处理即可直接开展欧洲劳动力迁移流动的定量分析,推动了从数据获取到模型构建的无缝衔接。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门构建,经Electric Sheep Europe于2024年重新整理并发布在HuggingFace平台。数据集聚焦于欧洲10个国家2013至2024年间按性别和经济活动分类的受雇外国公民流入量(单位:千人),共包含975条观测记录。其核心研究问题在于量化跨国劳动力流动的规模与结构特征,为分析欧洲劳动力市场国际化程度、性别差异及产业分布提供了关键数据支撑。作为ILOSTAT数据库的子集,该数据集继承了ILO在劳动统计领域的权威性,对移民经济学、劳动经济学及国际政策评估具有重要参考价值,尤其助力于理解欧洲一体化进程中的人口流动动态。
当前挑战
该数据集所解决的领域问题核心在于,国际移民流动的劳动力维度常因数据碎片化与定义不统一而难以精准量化,传统数据来源多缺乏细颗粒度的性别与经济活动交叉分析。构建过程中面临的挑战包括:不同国家统计体系与国际劳工统计学家会议(ICLS)定义之间的协调难题,导致部分观测值因数据来源差异需标记状态(如“临时”或“不可靠”)。此外,数据稀疏性显著——法国贡献321条记录,而罗马尼亚仅9条,这限制了跨国比较的统计效力。年度频率与缺失的月度或季度数据进一步制约了高时间分辨率建模,且分类变量(如经济部门)的非完整覆盖增加了分析复杂性。
常用场景
经典使用场景
该数据集记录了2013至2024年间十个欧洲国家的外籍受雇劳动者流入情况,按性别和经济活动分类,以千人为单位。经典使用场景涵盖时间序列预测与面板数据分析,研究者可借助该数据构建劳动力迁移的计量模型,例如运用自回归移动平均模型或固定效应模型,预测不同性别群体在特定行业中的就业流动趋势。同时,数据集的分类变量设计使其适用于多类别分类任务,如基于性别和行业特征预测外籍劳动者的流入规模,从而为欧洲劳动力市场的结构性变迁提供量化实证基础。
解决学术问题
该数据集致力于解决欧洲移民劳动力市场研究中长期存在的数据碎片化与口径不统一问题,填补了外籍劳动者按性别与行业细分流入量的系统化记录空白。学术上,它使研究者能够实证检验性别差异如何影响外籍劳动者的行业分布与就业稳定性,并评估不同经济部门对移民劳动力的吸纳能力。通过披露ILOSTAT官方统计的年度观测值,该数据有助于揭示劳动力迁移与宏观经济波动之间的动态关联,为劳动经济学与人口迁移领域的理论模型校准提供了权威的欧洲样本依据。
衍生相关工作
该数据集衍生了一系列基于迁移流数据的实证研究前沿工作,包括利用面板数据探索外籍劳动者流动对本地劳动力市场工资溢出的影响,以及结合多源统计构建欧洲移民就业流动性的综合指标体系。此外,研究者还将其作为基准数据集,开发了针对跨国劳动力迁移的机器学习预测模型,如基于梯度提升和长短期记忆网络的时间序列框架,用以模拟经济冲击下移民就业的动态响应。这些衍生成果不仅深化了迁移经济学的量化分析,也为开放科学背景下劳动统计数据的可重复研究树立了典范。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务