遇见数据集

electricsheepasia/asia-ilo-pop-xnas-sex-crs-nb-stock-of-nationals-abroad-by-sex-and-country-of-re

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲18个国家的海外国民存量(按性别和居住国划分,单位:千)数据,涵盖1993年至2024年期间,共401个观察值。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,这是一个全球劳动力统计的主要来源,涉及就业、失业、工资等多个领域。数据集通过ILOSTAT REST API获取,并经过筛选和标准化处理,以表格形式提供,包括国家代码、年份、性别分类、指标值等列。它适用于表格分类、回归和时间序列预测等任务,旨在支持亚洲地区的机器学习研究和分析。

This dataset contains Stock of nationals abroad by sex and country of residence (thousands) data for 18 Asia countries, spanning from 1993 to 2024, with 401 observations. The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), a leading global source for labour statistics covering areas such as employment, unemployment, and wages. It is obtained via the ILOSTAT REST API, filtered for Asia ISO3 country codes, and provided in a tabular format with columns including country codes, years, sex disaggregation, indicator values, and more. The dataset is suitable for tasks like tabular classification, regression, and time-series forecasting, designed to support machine learning research and analysis in the Asia region.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-pop-xnas-sex-crs-nb-stock-of-nationals-abroad-by-sex-and-country-of-re 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过REST API接口从原始数据源(https://rplumber.ilo.org/data/indicator?id=POP_XNAS_SEX_CRS_NB)直接抓取,并依据亚洲ISO3国家代码进行筛选过滤。数据经过Electric Sheep Asia团队的重新封装,将原始的调查微观数据依据国际劳工统计学家会议(ICLS)定义进行协调标准化,并在source.label列中标注了数据的来源类型,如劳动力调查(LFS)等,以确保数据的可追溯性与一致性。最终整合为一份包含401条观测记录的表格数据集,覆盖了18个亚洲国家1993年至2024年的年度数据。
特点
该数据集的核心特点在于其针对亚洲地区海外国民存量数据的专门化与细分粒度。它仅包含一个关键指标——按性别和居住国分类的海外国民存量(单位:千),并提供了性别维度的分列(总、男、女),实现了对人口流动结构的精细刻画。此外,数据来源标注清晰,有助于辨识不同国家调查方法的差异性。尽管观测数量有限(不足1K),但其时间跨度长达30余年,覆盖了菲律宾、新加坡、日本、韩国等多元发展水平的亚洲经济体,为区域劳动力迁移与人口研究提供了宝贵的结构化时间序列资料。
使用方法
用户可通过HuggingFace Datasets库便捷地调用该数据集,只需执行`load_dataset("electricsheepasia/asia-ilo-pop-xnas-sex-crs-nb-stock-of-nationals-abroad-by-sex-and-country-of-re")`即可将数据加载为Python的DataFrame格式。随后可进行灵活的数据操作,例如按国家筛选特定区域的海外国民数据,或针对单一指标按年份排序绘制时间序列变化图。亦可通过透视表功能,将数据重塑为国家×年份的矩阵形式,便于进行跨国的面板数据分析与可视化呈现。
背景与挑战
背景概述
随着全球化进程的加速,国际劳动力流动成为经济学与社会学研究的焦点,而精准的海外国民存量数据对理解跨国劳工迁移模式、制定移民政策及评估其对原籍国经济的影响至关重要。该数据集由国际劳工组织(ILO)旗下的ILOSTAT数据库于2024年整理发布,并经Electric Sheep Asia团队重新封装,涵盖1993至2024年间18个亚洲国家的401条观测记录。核心研究问题聚焦于量化亚洲国家海外国民的分布规模与性别结构,为劳动经济学、人口统计学及可持续发展目标(如体面工作)的实证分析提供了标准化、可复现的数据基础,在区域劳动力迁移研究中具有显著影响力。
当前挑战
数据集所解决的领域挑战在于:亚洲跨国劳工数据长期存在来源碎片化、定义不统一及时间序列不完整的问题,使得区域比较与趋势建模面临困难。构建过程中遭遇的具体挑战包括:首先,原始数据需从多国劳动力调查、行政记录等异构来源中提取,并依据国际劳工统计学家会议(ICLS)定义进行一致性协调;其次,部分国家(如印度、巴基斯坦)数据点稀疏,仅覆盖少数年份,导致时间序列分析存在偏差;最后,分类维度中的“sex”字段虽区分总人口、男性和女性,但其他潜在细分(如年龄、教育水平)因缺失值较多,限制了多维度交叉分析的深度。
常用场景
经典使用场景
在劳动力迁移与跨境人口流动的研究领域中,该数据集被广泛用于分析亚洲国家国民在海外的存量分布及其时序演变。研究者可借助数据集中的国家、年份、性别等维度,构建跨国比较的计量模型,用于揭示亚洲劳动力外流的规模、性别结构以及长期变化趋势。其经典的实验设定包括:以观测值作为被解释变量,以时间序列或面板数据形式,结合各国社会经济指标,探讨国民外流与母国劳动力市场、经济发展阶段之间的关联。数据集中细致的来源标签与分类变量,为研究者控制数据异质性、进行稳健性检验提供了可靠支撑,因而成为移民经济学与人口地理学中高引用率的规范数据源。
衍生相关工作
围绕该数据集已衍生出一系列具有影响力的学术工作。一方面,研究者基于面板数据结构构建了亚洲移民迁移的引力模型,量化母国经济水平、距离与文化差异对国民外流规模的解释力,部分实证工作进而延伸到气候移民与灾害驱动的非常规流动领域。另一方面,结合性别分类变量的特性,催生了关注女性海外劳动者权益与性别差异效应的专题研究,揭示了传统视角下被低估的女性劳务输出模式。在方法论层面,该数据集被用作机器学习回归任务的基准测试集,以检验时间序列预测模型在稀疏面板数据上的泛化能力,部分工作还将其与ILO其他劳动力统计指标进行联合建模,拓展了劳动经济学中多源数据融合的研究路径。
数据集最近研究
最新研究方向
在全球化与跨国劳动力流动日益频繁的背景下,该数据集聚焦于亚洲国家海外国民居住存量,为追踪区域间人口迁徙、劳动力供给变化及性别维度下的迁移模式提供了关键数据支撑。前沿研究方向主要围绕时间序列预测与因果推断,结合ILOSTAT提供的标准化劳动力调查数据,可深入分析亚洲各国海外国民存量与本国劳动市场、社会保障及经济发展之间的动态关联。随着国际移民政策调整及后疫情时代跨国流动复苏,该数据集能够支持精细化的性别差异分析,揭示女性海外就业趋势及其对母国劳动力结构的潜在影响,为区域可持续发展目标(SDG8体面工作和经济增长)的政策制定与实证研究奠定数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务