遇见数据集

electricsheepasia/asia-ilo-pop-xflc-sex-cct-nb-inflow-of-working-age-foreign-citizens-by-sex-and

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲19个国家从1980年至2024年的国际移民流动数据,具体关注工作年龄外国公民按性别和国籍划分的流入情况(以千计)。数据集共有4,494个观测值,涵盖一个核心指标:POP_XFLC_SEX_CCT_NB,即工作年龄外国公民按性别和国籍划分的流入量(千)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤为亚洲国家。数据列包括国家代码、国家名称、年份、性别分类(总计、男性、女性)、观测值及相关元数据,适用于表格分类、回归和时间序列预测等任务。数据集以CC-BY-4.0许可证发布,由Electric Sheep Asia重新打包,便于机器学习使用。

This dataset contains international migrant flow data for 19 Asia countries from 1980 to 2024, specifically focusing on the inflow of working age foreign citizens by sex and country of citizenship (in thousands). It includes 4,494 observations covering one key indicator: POP_XFLC_SEX_CCT_NB, which represents Inflow of working age foreign citizens by sex and country of citizenship (thousands). The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via API and filtered for Asia countries. Columns include country codes, country names, year, sex disaggregation (total, male, female), observed values, and related metadata, suitable for tasks such as tabular classification, regression, and time-series forecasting. The dataset is released under the CC-BY-4.0 license and repackaged by Electric Sheep Asia for machine learning readiness.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-pop-xflc-sex-cct-nb-inflow-of-working-age-foreign-citizens-by-sex-and 数据集图片
构建方式
本数据集源自国际劳工组织(ILO)的ILOSTAT数据库,经由Electric Sheep Asia团队重新封装而成。构建过程首先通过ILOSTAT提供的REST API接口,直接获取标识符为POP_XFLC_SEX_CCT_NB的原始数据,随后依据亚洲地区ISO 3166-1 alpha-3国家代码进行地理范围过滤,仅保留涵盖19个亚洲国家的观测记录。数据收集的时间跨度从1980年至2024年,共计包含4,494条观测值。ILOSTAT依据国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行协调处理,并在源标记列中注明数据来源,确保了数据的可追溯性与标准化程度。最终,数据集以Parquet格式存储,便于机器学习场景下的高效加载与使用。
使用方法
该数据集可直接通过HuggingFace Datasets库的load_dataset函数加载,返回一个包含训练集(train)的Dataset对象,进而转换为Pandas DataFrame以便进行数据探索与预处理。使用者可根据具体国家代码(如IDN代表印度尼西亚)过滤数据,实现针对特定国家的时序分析。对于核心指标POP_XFLC_SEX_CCT_NB,可按照时间排序后绘制趋势图,直观展示移民流入量的历史变化。更进一步,研究者可利用pivot_table函数将数据重塑为国家与年份的交叉矩阵,形成面板数据结构,适用于计量经济学模型或机器学习预测任务。数据集兼容分类、回归和时序预测等多种任务类型,为社会科学计算提供了灵活的基础设施。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2024年通过其ILOSTAT数据库发布,并由Electric Sheep Asia团队整理封装至HuggingFace平台。研究核心聚焦于亚洲地区19个国家在1980至2024年间劳动年龄外国公民的流入情况,按性别与国籍分类统计,总计包含4,494条观测记录。作为全球劳动统计的权威来源,ILO通过标准化调查与行政记录数据,为跨国劳动力流动研究提供了弥足珍贵的时序资料。该数据集不仅弥补了亚洲区域移民流入数据的稀缺性,更因其细致的分类维度(性别、国籍)和长达45年的时间跨度,为人口经济学、国际迁移政策及劳动力市场分析等领域的实证研究奠定了坚实的数据基础,显著推动了对于亚洲劳动力跨境流动模式与趋势的量化理解。
当前挑战
该数据集面临的挑战首先体现在领域问题上:亚洲各国移民统计口径不一(如对“移民”或“劳动年龄”的定义差异),导致跨国可比性成为核心难题;同时,许多国家缺乏系统性数据收集机制,使得时序数据存在大量缺失与断层。构建过程中,数据整合需克服各国数据源异质性(如调查类型、行政记录来源各异)及ILO最佳来源选择策略带来的偏差风险;此外,部分国家仅提供年度而非月度或季度数据,限制了高频时序分析的可行性。数据质量标注(如状态标记为临时或不可靠)虽提高了透明度,却增加了建模时处理不确定性观测的复杂性。
常用场景
经典使用场景
在劳动经济学与迁移研究的交叉领域中,该数据集的核心应用场景在于分析亚洲地区跨国劳动力流动的时空格局。研究者可利用其涵盖19个亚洲国家、跨越44年(1980–2024)的年度观测数据,结合性别维度(总量、男性、女性)与公民身份分类,构建面板数据模型,以揭示国际移民流入在地区分布、时间趋势及人口结构上的动态演变特征。
解决学术问题
该数据集有效回应了国际移民研究中数据碎片化与可比性不足的长期困境。通过整合国际劳工组织(ILO)统一的统计框架与经协调的微观数据来源,解决了跨国劳动力流入测算口径不一的问题,使得学者能够系统评估亚洲各国劳动力迁移的规模、性别差异及政策影响,为探讨移民对劳动力市场均衡、经济增长与社会福利的因果效应提供了可靠的经验基础。
实际应用
在实际应用层面,该数据集为政府机构与国际组织的劳动力政策制定提供了量化依据。劳动部门可据此监测跨国劳工流入的季节性模式与来源国变化,优化签证配额与就业准入政策;国际发展机构能利用其追踪青年劳动力跨区域流动趋势,评估技能错配程度,进而设计更具精准性的就业培训与区域协作方案,助力亚洲生产网络的弹性构建。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲国家劳动年龄外国公民流入的性别与国籍维度的时序变化,为研究区域劳动力迁移模式、跨国劳动市场整合及人口流动政策效应提供了高颗粒度数据支撑。在全球化退潮与区域经济重构交织的背景下,亚洲作为国际移民的重要目的地,其劳动力流入结构正经历深刻调整——日本、韩国等发达经济体对技术移民的依赖加剧,而东南亚国家间的低技能劳动力循环流动日趋活跃。该数据集与ILOSTAT标准的衔接,使其能够与就业质量、工资水平等指标联动分析,从而揭示移民流入对东道国本地劳动力市场的替代与互补效应,并为后疫情时代亚洲供应链韧性评估及《区域全面经济伙伴关系协定》(RCEP)框架下要素流动自由化影响研究提供实证基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务