遇见数据集

electricsheepeurope/europe-ilo-pop-xflc-sex-cct-nb-inflow-of-working-age-foreign-citizens-by-sex-and

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲24个国家2010年至2024年期间国际移民流动的统计数据,专门记录按性别和国籍划分的工作年龄外国公民流入量(以千人为单位)。数据集包含3,499个观测值,涵盖一个核心指标:POP_XFLC_SEX_CCT_NB(工作年龄外国公民流入量,按性别和国籍分类)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,经过标准化处理,采用国际劳工统计学家会议(ICLS)的定义。数据结构包括国家代码、年份、性别分类(总计、男性、女性)、观测值、数据来源和质量标志等字段。数据集适用于表格分类、回归和时间序列预测等机器学习任务。

This dataset contains 3,499 observations of international migrant flow data across 24 European countries from 2010 to 2024, specifically focusing on the inflow of working-age foreign citizens by sex and country of citizenship (in thousands). It covers one key indicator: POP_XFLC_SEX_CCT_NB (Inflow of working age foreign citizens by sex and country of citizenship). The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), harmonized using International Conference of Labour Statisticians (ICLS) definitions. The schema includes fields such as country code, year, sex disaggregation (total, male, female), observed values, data sources, and quality flags. The dataset is suitable for tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-pop-xflc-sex-cct-nb-inflow-of-working-age-foreign-citizens-by-sex-and 数据集图片
构建方式
该数据集从国际劳工组织(ILO)的ILOSTAT REST API直接提取,针对指标代码POP_XFLC_SEX_CCT_NB进行数据拉取,并依据欧洲ISO3国家代码进行筛选过滤。ILOSTAT作为全球劳动统计的权威来源,其数据整合了各国劳动力调查、家庭收入调查、机构调查及行政记录等多元原始微观数据,并依据国际劳动统计学家会议(ICLS)定义进行标准化处理。经过清洗与重封装后,数据集包含3,499条观测记录,覆盖2010至2024年间的24个欧洲国家。
特点
本数据集聚焦于‘按性别和国籍分列的工作年龄外国公民流入量(千人)’这一核心指标,提供了精细化的性别维度的分解,包含总计、男性和女性三个细分类别。数据以年频率组织,每条记录均附带来源标识、观测状态标志及注释信息,便于用户追溯数据质量与潜在断点。其独特的多元分类信息(如国籍类别)进一步丰富了分析维度,使得研究者能够深入探究欧洲各国国际移民流动的结构性特征与演变趋势。
使用方法
用户可通过HuggingFace Datasets库便捷地加载数据,使用`load_dataset`函数即可将数据以Pandas DataFrame形式获取。支持对国家层面进行筛选,如利用`ref_area`字段过滤出特定国家的子集;亦可针对单一指标进行时间序列分析,通过排序和可视化揭示流入量的年度波动。此外,数据表支持灵活重塑,例如通过透视操作构建以年份为行、国家为列的矩阵格式,便于进行跨国对比分析或作为下游预测模型的输入特征。
背景与挑战
背景概述
国际移民流动的量化分析是劳动经济学与人口学研究的重要基石,尤其在全球化背景下,劳动力跨境流动对欧洲各国的社会保障体系、劳动力市场均衡及公共政策制定产生了深远影响。该数据集由国际劳工组织(ILO)统计司基于其核心统计数据库ILOSTAT创建,由Electric Sheep Europe团队于2024年重新封装并发布。其核心研究问题聚焦于监测2010至2024年间欧洲24国劳动年龄外国公民的流入规模,并通过性别与国籍的细粒度拆解,揭示移民流动的结构性特征。作为ILOSTAT体系下标准化、可复现的公开数据集,它为跨国比较研究、时序预测模型及劳动政策评估提供了可靠的数据基础,对推动欧洲移民治理的实证研究具有重要参考价值。
当前挑战
该数据集所应对的领域问题在于,国际移民流数据常因各国统计口径不一、来源多元(如劳动力调查、行政记录)而难以统一比较,ILOSTAT通过国际劳工统计学家会议(ICLS)定义进行标准化,但数据异质性与断点(如注释列中的系列中断标识)仍是分析中需要谨慎处理的挑战。在构建层面,数据采集依赖ILOSTAT REST API的实时抽取,需对24个欧洲国家的ISO代码进行精准过滤,同时处理每年多源数据中ILO优选源的筛选逻辑;此外,观测状态标记(如“不可靠”)的纳入与缺失值的隐式存在,要求使用者具备数据质量评估的专业知识,从而避免因果推断中的系统性偏差。
常用场景
经典使用场景
该数据集记录了2010年至2024年间24个欧洲国家按性别和国籍分类的适龄劳动外籍公民流入量(单位:千人次),是国际劳工组织ILOSTAT数据库的精选子集。在经典使用场景中,研究者常将其作为时间序列分析的核心数据源,用于追踪欧洲各国劳动移民的年度动态变化趋势。通过按国家、性别或国籍维度进行分组透视,可构建跨年度的面板数据,支撑迁移流量与劳动力市场指标、经济周期变量之间的关联性建模与分析。
衍生相关工作
该数据集衍生了一系列具有影响力的经典工作,包括基于该时间序列构建的移民流入预测模型,例如结合宏观经济指标的VAR模型和机器学习驱动的长短期记忆网络(LSTM)。此外,有研究利用其面板结构,通过工具变量法识别移民对本地劳动力市场的因果效应,相关成果发表于《劳动经济学》与《人口经济学》等权威期刊。ILOSTAT数据本身也与世界银行全球移民数据库、欧盟统计局移民统计形成互补,共同支撑了跨国比较研究的深入开展。
数据集最近研究
最新研究方向
该数据集聚焦于欧洲适龄劳动外国公民流入的时序监测与跨国比较分析,涵盖2010至2024年间24个欧洲国家的性别与国籍细分数据。当前前沿研究围绕欧洲移民潮与劳动力市场结构性变革展开,尤其关注后疫情时代国际流动格局的重塑、俄乌冲突对人口迁移的冲击,以及欧盟劳动力短缺背景下高技能与低技能移民的差异化融入。依托ILOSTAT的标准化统计框架,该数据集为时间序列预测、性别差异分析及政策效应评估提供了高颗粒度支撑,其清洗后的结构便于机器学习和因果推断模型直接调用,助力理解欧洲劳动力流动的区域异质性与制度响应机制。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务