遇见数据集

electricsheepasia/asia-ilo-pop-xfrc-sex-cct-nb-working-age-foreign-citizens-by-sex-and-country-of

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲23个国家在2000年至2024年期间的“国际移民存量”数据,具体指标为“按性别和国籍划分的劳动年龄外国公民(千人)”。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤为亚洲国家,包含2,719个观测值。数据集以表格形式组织,涵盖国家代码、国家名称、数据来源、指标代码、性别分类、年份、观测值等字段,适用于表格分类、回归和时间序列预测等任务。数据经过国际劳工统计学家会议(ICLS)定义标准化处理,并标注了数据来源和质量状态。

This dataset contains 2,719 observations of International migrant stock data across 23 Asia countries, spanning 2000–2024, covering the indicator Working age foreign citizens by sex and country of citizenship (thousands). The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), retrieved via API and filtered to Asia ISO3 country codes. It is structured in tabular format with columns such as country code, country name, data source, indicator code, sex disaggregation, year, observed value, etc., and is suitable for tabular classification, regression, and time-series forecasting tasks. The data is harmonized using ICLS definitions and includes source and quality flags.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-pop-xfrc-sex-cct-nb-working-age-foreign-citizens-by-sex-and-country-of 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)旗下的ILOSTAT数据库,聚焦于亚洲地区劳动年龄外国公民的性别与国籍分布情况。数据通过ILOSTAT的REST API接口直接获取,原始指标编码为POP_XFRC_SEX_CCT_NB,随后依据亚洲ISO3国家代码进行地域筛选与提取。ILOSTAT本身整合了各国劳动力调查、家户收支调查及行政记录等微观数据,并依据国际劳工统计学家会议(ICLS)定义进行标准化处理,确保了跨国的可比性。数据集最终由Electric Sheep Asia团队进行二次封装与清洗,以Parquet格式发布在HuggingFace平台上,便于研究人员直接调用。
特点
本数据集收录了2,719条观测记录,覆盖2000年至2024年间23个亚洲国家,涵盖性别、国籍等多个细分维度。数据以年度为频率呈现,每条记录均包含国家代码、数据来源标签、指标值及其状态标识,便于用户追溯数据质量。特别值得一提的是,数据集提供了详细的分类变量,如性别(总、男、女)与公民身份类别,有助于开展精细化的劳动迁移分析。此外,ILOSTAT对多个数据源进行了优选,优先采用ILO认定的“最佳来源”,在保证数据权威性的同时,也对观测值的可靠性进行了标注,如“不可靠”等标志,提升了科研使用的透明度。
使用方法
用户可通过HuggingFace Datasets库快速加载该数据集,仅需一行Python指令即可获取完整表格。针对特定国家的分析,可利用'ref_area'列进行筛选,如过滤出印度尼西亚的数据。对于时间序列的探索,可依据'indicator'与'time'列排序后绘制趋势图,直观展现劳动年龄外国公民数量的演变。若需构建国家-年份矩阵,可借助pandas的pivot_table功能进行透视,便于进行跨国的横向比较或面板数据分析。该数据集兼容表格分类、回归及时间序列预测等多种任务,适合迁移经济学、劳动经济学及人口统计学等领域的量化研究。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2024年整理发布,经Electric Sheep Asia重新打包至HuggingFace平台,聚焦于亚洲23个国家2000至2024年间劳动年龄外国公民的性别与国籍分布情况。作为ILOSTAT数据库的核心子集,数据旨在填补亚洲地区国际移民劳动力统计的系统性空白,为跨国劳动力流动、人口迁徙与就业政策研究提供精细化的面板数据支撑。通过标准化的人口学分类与时间序列结构,该数据集在劳动经济学、移民社会学及国际人口统计领域具有重要参考价值,尤其有助于解析亚洲经济体对外籍劳动力的依赖模式及其演变趋势。
当前挑战
领域层面,该数据集致力于解决亚洲国家间移民劳动力数据碎片化与口径不一的问题,ILOSTAT虽采用国际劳工统计学家会议(ICLS)定义进行协调,但不同来源(如劳动力调查与行政记录)之间的数据可比性仍存在局限,且部分国家观测年限稀疏、年度频率与缺失值普遍,影响长期趋势分析的稳健性。构建过程中,主要挑战包括从REST API高效提取庞大多维数据、将地理与时间分类标准化至23个ISO代码国家、处理各来源标记的可靠性状态(如‘Unreliable’标志),以及在多源并存时依据ILO‘最佳来源’优先级进行取舍,确保数据质量与可追溯性。
常用场景
经典使用场景
该数据集收录了2000年至2024年间亚洲23个国家按性别与国籍分类的劳动年龄外国公民人数,总计2719条观测记录,源自国际劳工组织(ILO)的ILOSTAT数据库。经典使用场景聚焦于迁移劳动人口的结构性分析,研究者可借助该数据集追踪跨国劳动力在亚洲区域内的流动趋势,考察不同国籍与性别群体在劳动年龄人口中的分布格局,进而为区域劳动力市场一体化研究提供量化基础。其时间序列属性使其尤其适用于纵向比较研究,例如分析全球经济周期或政策变动对亚洲跨国劳动人口规模的冲击效应。
解决学术问题
该数据集有效回应了移民经济学与劳动社会学中长期存在的两个关键学术问题:一是亚洲地区跨国劳动年龄人口数据长期碎片化且口径不统一,ILO通过ILCLS标准进行整合,解决了不同国家间数据可比性缺失的困境;二是性别维度的引入使得研究能够深入探讨女性移民劳动参与率、性别分工在跨国流动中的演变机制,从而弥补了传统移民研究偏重总量而忽视人口结构异质性的不足。其意义在于为验证推拉理论、劳动力市场分割理论等经典框架在亚洲情境下的适用性提供了可靠的实证材料,推动了区域迁移研究从描述性统计向因果推断的范式转型。
衍生相关工作
围绕该数据集的核心指标‘POP_XFRC_SEX_CCT_NB’,衍生出多项具有影响力的学术工作。研究人员基于其时间序列维度构建了亚洲移民流动面板模型,揭示了2008年金融危机与新冠疫情后亚太地区劳动年龄移民存量的非对称性恢复模式。另有学者结合ILOSTAT中的工资与失业率指标,利用该数据集进行多变量回归分析,量化了国籍歧视对性别工资差距的边际贡献。在方法论层面,部分工作聚焦于数据插补技术,针对少数国家存在的数据缺失间隔开发了贝叶斯分层模型,提升了亚洲跨国劳动统计的完整性。这些衍生成果进一步巩固了该数据集作为亚洲劳动迁移研究基准资源的学术地位。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务